Multimodal large language models (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Çok kipli büyük dil modelleri (İng. Multimodal Large Language Models, MLLMs) — metin, görüntü, ses ve video dahil olmak üzere çeşitli kiplerdeki bilgiyi işleyebilen ve üretebilen bir yapay zeka modelleri sınıfıdır[1]. Yalnızca metinle çalışan tek kipli dil modellerinin aksine, MLLM'ler karmaşık içerik anlama ve üretme görevlerini çözmek için farklı kaynaklardan gelen bilgileri bir araya getirir.

MLLM'lerin temel kavramı, farklı kipler için tek bir vektörel temsil (embedding) oluşturmaktır. Bu sayede model, örneğin bir görüntü ile onun metin açıklaması arasındaki anlamsal ilişkileri kurabilir[2]. Modern MLLM'lerin temelini atan en önemli atılım, görsel ve metinsel temsilleri ortak bir özellik uzayında hizalamak için karşıtlıklı öğrenmenin (contrastive learning) kullanılması oldu; bu yaklaşım CLIP modelinde hayata geçirildi[3].

Gelişim Tarihi

Erken Dönem (2013–2020)

Çok kipli yapay zekanın kavramsal temelleri 2013 yılında Stanford araştırmacıları tarafından atıldı; bu araştırmacılar, kelime vektörel temsilleri kullanılarak sıfır örnekli öğrenmenin (zero-shot learning) mümkün olduğunu gösterdi[4]. 2016 yılında FAIR (Meta AI) ekibi, bilgisayarlı görme modellerini eğitmek için doğal dil açıklamalarının kullanımının etkinliğini ortaya koyarak doğrudan eğitim olmaksızın ImageNet üzerinde %11,5 doğruluk elde etti[5].

CLIP Dönemi (2021)

Devrim niteliğindeki an, OpenAI'ın Ocak 2021'de CLIP (Contrastive Language-Image Pre-training) modelini yayımlamasıyla yaşandı. 400 milyon görüntü-metin çifti üzerinde eğitilen model, belirli görevlere özgü eğitim almaksızın görüntüleri sınıflandırma yeteneği sergiledi. CLIP, sonraki pek çok MLLM için temel oluşturdu[6].

Ölçeklendirme ve Yenilikler (2022–2024)

CLIP'in başarısının ardından pek çok önemli model ortaya çıktı:

  • Flamingo (DeepMind, 2022) — az sayıda örnekle öğrenme konusunda üstün yetenekler sergileyen 80 milyar parametreli model.
  • BLIP (Salesforce, 2022) — anlama ve üretme için birleşik mimari.
  • GPT-4V (OpenAI, 2023) — bu ölçekteki ilk ticari çok kipli model.
  • LLaVA (Microsoft, 2023) — GPT-4V'ye popüler açık kaynaklı alternatif.
  • Gemini (Google, 2023) — farklı veri türleriyle çalışmak üzere baştan tasarlanmış, natively çok kipli mimari.
  • GPT-4o (OpenAI, 2024) — düşük gecikmeyle gerçek zamanlı olarak metin, ses ve videoyu işleyebilen model[1].
  • Claude 3.5 Sonnet (Anthropic, 2024) — gelişmiş görsel bilgi analizi yeteneklerine sahip model.

Mimari Yaklaşımlar

Çift Kodlayıcı Mimari (Dual-Encoder)

Her kip için ayrı kodlayıcılar kullanır; bu kodlayıcılar verileri ortak bir temsil uzayına yansıtır. En belirgin örnek CLIP'tir; burada görsel transformer görüntüleri, metin transformer'ı ise dil verilerini işler. Avantajları arasında modülerlik ve hesaplama verimliliği sayılabilir; dezavantajı ise sınırlı çapraz kipsel etkileşimdir[7].

Kodlayıcı-Kodçözücü Mimarisi

Tek bir kodlayıcı çok kipli girdiyi işlerken, kodçözücü metin çıktısı üretir. Flamingo modeli, değişken uzunluktaki görsel girdileri işlemek için Perceiver Resampler mekanizmasını ve çapraz kipsel dikkat katmanlarını kullanır. Bu yaklaşım zengin kipler arası etkileşim sağlar ancak yüksek hesaplama kaynağı gerektirir[8].

Hizalama Mimarisi (Alignment)

Bu yaklaşım, küçük bir eğitilebilir hizalama modülü aracılığıyla birbirine bağlanan dondurulmuş önceden eğitilmiş kodlayıcıları kullanır. Örneğin BLIP-2, dondurulmuş görsel kodlayıcı ile dil modeli arasında hafif bir bağlayıcı unsur olarak Q-Former (Querying Transformer) kullanır ve bu sayede çok daha az eğitilebilir parametre gerektirir[9].

Temel Modeller

GPT-4V / GPT-4o (OpenAI)

GPT-4 model ailesi, tahminlere göre (uzmanlar karışımı mimarisinde) 1,8 trilyona kadar parametre içermektedir. Mayıs 2024'te yayımlanan GPT-4o modeli, gerçek zamanlı olarak metin, görüntü, ses ve video işlemeyi destekler. MMMU benchmark'ında %69,1 doğruluk oranına ulaşmaktadır[10].

Gemini (Google)

Metin, görüntü, ses ve video üzerinde sıfırdan eğitilmiş natively çok kipli mimari. Gemini 1.5 Pro, 10 milyon token'a kadar bağlam penceresi destekler ve 32 popüler benchmark'ın 30'unda GPT-4'ü geride bırakır[11].

Claude 3 (Anthropic)

200.000 token'a kadar bağlam penceresiyle sunulan model ailesi (Haiku, Sonnet, Opus). Claude 3 Opus, MMMU benchmark'ında %58,5 oranı sergiler. Model güvenliğini artırmak için Constitutional AI yaklaşımı kullanılmaktadır[12].

LLaVA (açık kaynaklı model)

CLIP görsel kodlayıcısını Vicuna dil modeliyle birleştirir. 7, 13 ve 34 milyar parametreli sürümleri mevcuttur. Model, sentetik görevlerde GPT-4'ün göreli performansının %85,1'ine ulaşmaktadır[13].

Uygulama Alanları

  • Görsel Soru-Cevap (VQA): Kullanıcıların görsel içerik hakkında soru sormasına olanak tanır.
  • Belge Analizi: Modern MLLM'ler dakikada 2000 sayfaya kadar işleyebilir.
  • Tıbbi Görüntüleme: Med-PaLM M (Google) gibi modeller tıbbi görüntüleri ve klinik verileri analiz eder.
  • Robotik: RT-2 (Google DeepMind) gibi modeller, robotların görsel ortamı anlamasına ve doğal dil komutlarını yerine getirmesine olanak sağlar.

Mevcut Sınırlamalar

  • Halüsinasyonlar: Üretilen içerikteki halüsinasyon oranı %27–46 olarak tahmin edilmektedir. Modeller var olmayan nesneleri tanımlayabilir veya görsel bilgiyi yanlış yorumlayabilir[14].
  • Yüksek Hesaplama Gereksinimleri: MLLM'lerin eğitimi ve kullanımı önemli bir hesaplama altyapısı gerektirmektedir.
  • Veri Önyargısı: Eğitim verilerinde demografik grupların, dillerin ve kültürlerin yetersiz temsil edilmesi sistematik hatalara yol açmaktadır.

Dış bağlantılar

  • A Comprehensive Guide to Multimodal LLMs (Encord Blog)
  • Multimodal LLMs: The Complete Guide (Viso.ai)

Kaynakça

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

Notlar

  1. 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
  2. «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
  3. Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
  4. DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
  5. «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
  6. «Understanding CLIP». Stanford CS231n. [6]
  7. «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
  8. «The Architectures of Multimodal Language Models». Determined AI. [8]
  9. «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
  10. «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
  11. «Google Gemini: A Deep Dive». DaveAI Blog. [11]
  12. «Introducing the Claude 3 Family». Anthropic. [12]
  13. Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
  14. «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]