Multimodal large language models (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Modelele lingvistice mari multimodale (engl. Multimodal Large Language Models, MLLMs) reprezintă o clasă de modele de inteligență artificială capabile să proceseze și să genereze informații în diverse modalități, inclusiv text, imagini, audio și video[1]. Spre deosebire de modelele lingvistice unimodale, care lucrează exclusiv cu text, MLLM integrează informații din surse diferite pentru a rezolva sarcini complexe de înțelegere și generare a conținutului.

Conceptul fundamental al MLLM constă în crearea unei reprezentări vectoriale unificate (embedding) pentru diferite modalități. Aceasta permite modelului să stabilească relații semantice între, de exemplu, o imagine și descrierea sa textuală[2]. Progresul-cheie care a pus bazele MLLM moderne a fost utilizarea învățării contrastive pentru alinierea reprezentărilor vizuale și textuale într-un spațiu comun de caracteristici, așa cum a fost implementat în modelul CLIP[3].

Istoria dezvoltării

Perioada timpurie (2013–2020)

Bazele conceptuale ale inteligenței artificiale multimodale au fost puse în 2013, când cercetătorii de la Stanford au demonstrat posibilitatea învățării cu zero exemple (zero-shot learning) folosind reprezentări vectoriale ale cuvintelor[4]. În 2016, echipa FAIR (Meta AI) a arătat eficiența utilizării descrierilor în limbaj natural pentru antrenarea modelelor de vedere artificială, atingând o acuratețe de 11,5% pe ImageNet fără antrenare directă[5].

Era CLIP (2021)

Momentul revoluționar a fost lansarea modelului CLIP (Contrastive Language-Image Pre-training) de către OpenAI în ianuarie 2021. Modelul, antrenat pe 400 de milioane de perechi imagine-text, a demonstrat capacitatea de a clasifica imagini fără antrenare specializată pe sarcini concrete. CLIP a devenit fundația pentru numeroase MLLM ulterioare[6].

Scalare și inovații (2022–2024)

După succesul CLIP, au apărut numeroase modele-cheie:

  • Flamingo (DeepMind, 2022) — model cu 80 de miliarde de parametri, care a demonstrat capacități remarcabile de învățare cu puține exemple.
  • BLIP (Salesforce, 2022) — arhitectură unificată pentru înțelegere și generare.
  • GPT-4V (OpenAI, 2023) — primul model multimodal comercial de o asemenea anvergură.
  • LLaVA (Microsoft, 2023) — alternativă open-source populară la GPT-4V.
  • Gemini (Google, 2023) — arhitectură nativ multimodală, proiectată de la bun început pentru lucrul cu diferite tipuri de date.
  • GPT-4o (OpenAI, 2024) — model capabil să proceseze text, audio și video în timp real, cu latență redusă[1].
  • Claude 3.5 Sonnet (Anthropic, 2024) — model cu capacități îmbunătățite de analiză a informațiilor vizuale.

Abordări arhitecturale

Arhitectura cu doi encoderi (Dual-Encoder)

Utilizează encoderi separați pentru fiecare modalitate, care proiectează datele într-un spațiu comun de reprezentări. Un reprezentant emblematic este CLIP, unde un transformer vizual procesează imaginile, iar unul textual — datele lingvistice. Avantajele constau în modularitate și eficiență computațională, dezavantajul fiind interacțiunea cross-modală limitată[7].

Arhitectura encoder-decoder

Un encoder unic procesează intrarea multimodală, iar un decoder generează ieșirea textuală. Modelul Flamingo utilizează mecanismul Perceiver Resampler pentru procesarea intrărilor vizuale de lungime variabilă și straturi de atenție cross-modală. Această abordare oferă o interacțiune inter-modală bogată, însă necesită resurse computaționale mai mari[8].

Arhitectura de aliniere (Alignment)

Această abordare utilizează encoderi pre-antrenați înghețați, conectați printr-un modul de aliniere mic și antrenabil. De exemplu, BLIP-2 folosește Q-Former (Querying Transformer) ca element de legătură ușor între encoderul vizual înghețat și modelul lingvistic, necesitând semnificativ mai puțini parametri antrenabili[9].

Modele principale

GPT-4V / GPT-4o (OpenAI)

Familia de modele GPT-4 include, conform estimărilor, până la 1,8 trilioane de parametri (în arhitectura mixture of experts). Modelul GPT-4o, lansat în mai 2024, suportă procesarea textului, imaginilor, audio și video în timp real. Pe benchmark-ul MMMU atinge o acuratețe de 69,1%[10].

Gemini (Google)

Arhitectură nativ multimodală, antrenată de la zero pe text, imagini, audio și video. Gemini 1.5 Pro suportă o fereastră contextuală de până la 10 milioane de token-uri și depășește GPT-4 pe 30 din 32 de benchmark-uri populare[11].

Claude 3 (Anthropic)

Familie de modele (Haiku, Sonnet, Opus) cu fereastră contextuală de până la 200.000 de token-uri. Claude 3 Opus obține 58,5% pe benchmark-ul MMMU. Pentru creșterea siguranței modelelor este utilizată abordarea Constitutional AI[12].

LLaVA (model open-source)

Combină encoderul vizual CLIP cu modelul lingvistic Vicuna. Sunt disponibile variante cu 7, 13 și 34 de miliarde de parametri. Modelul atinge 85,1% din performanța relativă a GPT-4 pe sarcini sintetice[13].

Domenii de aplicare

  • Răspuns la întrebări vizuale (VQA): Permite utilizatorilor să adreseze întrebări despre conținut vizual.
  • Analiza documentelor: MLLM moderne sunt capabile să proceseze până la 2.000 de pagini pe minut.
  • Imagistică medicală: Modele precum Med-PaLM M (Google) analizează imagini medicale și date clinice.
  • Robotică: Modele precum RT-2 (Google DeepMind) permit roboților să înțeleagă mediul vizual și să execute comenzi în limbaj natural.

Limitări actuale

  • Halucinații: Nivelul halucinațiilor în conținutul generat este estimat la 27–46%. Modelele pot descrie obiecte inexistente sau interpreta incorect informațiile vizuale[14].
  • Cerințe computaționale ridicate: Antrenarea și utilizarea MLLM necesită o infrastructură computațională considerabilă.
  • Bias-ul datelor: Reprezentarea insuficientă a grupurilor demografice, limbilor și culturilor în datele de antrenare conduce la erori sistematice.

Referințe

  • A Comprehensive Guide to Multimodal LLMs (Encord Blog)
  • Multimodal LLMs: The Complete Guide (Viso.ai)

Literatură

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

Note

  1. 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
  2. «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
  3. Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
  4. DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
  5. «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
  6. «Understanding CLIP». Stanford CS231n. [6]
  7. «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
  8. «The Architectures of Multimodal Language Models». Determined AI. [8]
  9. «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
  10. «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
  11. «Google Gemini: A Deep Dive». DaveAI Blog. [11]
  12. «Introducing the Claude 3 Family». Anthropic. [12]
  13. Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
  14. «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]