Multimodal large language models (TL)
Multimodal na Malalaking Modelo ng Wika (Ingles: Multimodal Large Language Models, MLLMs) — ito ay isang klase ng mga modelo ng artificial intelligence na kayang magproseso at bumuo ng impormasyon sa iba't ibang modalidad, kabilang ang teksto, mga larawan, audio at video[1]. Hindi katulad ng mga unimodal na modelo ng wika na gumagana nang eksklusibo sa teksto, ang MLLM ay nag-iintegrate ng impormasyon mula sa iba't ibang pinagkukunan upang malutas ang mga kumplikadong gawain ng pag-unawa at pagbuo ng nilalaman.
Ang pangunahing konsepto ng MLLM ay ang paglikha ng isang pinag-isang vector representation (embedding) para sa iba't ibang modalidad. Nagbibigay-daan ito sa modelo na magtatag ng mga semantic na koneksyon sa pagitan ng, halimbawa, isang larawan at ng tekstong paglalarawan nito[2]. Ang pangunahing tagumpay na naglatag ng pundasyon ng mga modernong MLLM ay ang paggamit ng contrastive learning para sa pagkakahanay ng mga visual at tekstwal na representasyon sa isang karaniwang espasyo ng mga katangian, tulad ng isinagawa sa modelo ng CLIP[3].
Kasaysayan ng Pag-unlad
Maagang Panahon (2013–2020)
Ang mga konseptwal na pundasyon ng multimodal AI ay inilatag noong 2013, nang ipakita ng mga mananaliksik mula sa Stanford ang posibilidad ng zero-shot learning gamit ang mga vector representation ng mga salita[4]. Noong 2016, ipinakita ng koponan ng FAIR (Meta AI) ang bisa ng paggamit ng mga natural na paglalarawang pangwika para sa pagsasanay ng mga modelo ng computer vision, na nakamit ang 11.5% na katumpakan sa ImageNet nang walang direktang pagsasanay[5].
Panahon ng CLIP (2021)
Isang rebolusyonaryong sandali ang paglabas ng modelo ng CLIP (Contrastive Language-Image Pre-training) ng OpenAI noong Enero 2021. Ang modelo, na sinanay sa 400 milyong pares ng larawan at teksto, ay nagpakita ng kakayahang mag-classify ng mga larawan nang walang espesyal na pagsasanay sa mga partikular na gawain. Naging pundasyon ang CLIP para sa maraming kasunod na MLLM[6].
Pag-scale at mga Inobasyon (2022–2024)
Pagkatapos ng tagumpay ng CLIP, lumitaw ang maraming pangunahing modelo:
- Flamingo (DeepMind, 2022) — isang 80-bilyong modelo na nagpakita ng natatanging kakayahan sa few-shot learning.
- BLIP (Salesforce, 2022) — isang pinag-isang arkitektura para sa pag-unawa at pagbuo.
- GPT-4V (OpenAI, 2023) — ang unang komersyal na multimodal na modelo ng ganyang sukat.
- LLaVA (Microsoft, 2023) — isang popular na bukas na alternatibo sa GPT-4V.
- Gemini (Google, 2023) — isang natively multimodal na arkitektura, na orihinal na idinisenyo para sa pagtatrabaho sa iba't ibang uri ng datos.
- GPT-4o (OpenAI, 2024) — isang modelo na kayang magproseso ng teksto, audio at video sa real time na may mababang latency[1].
- Claude 3.5 Sonnet (Anthropic, 2024) — isang modelo na may pinahusay na kakayahan sa pagsusuri ng visual na impormasyon.
Mga Arkitekturang Pamamaraan
Dual-Encoder na Arkitektura
Gumagamit ng hiwalay na mga encoder para sa bawat modalidad, na nagpoproyekto ng datos sa isang karaniwang espasyo ng mga representasyon. Isang maliwanag na halimbawa ay ang CLIP, kung saan pinoproseso ng visual transformer ang mga larawan, at ng tekstwal — ang datos ng wika. Ang mga kalamangan ay ang modularity at kahusayan sa pagkalkula, ang kakulangan — ang limitadong cross-modal na pakikipag-ugnayan[7].
Arkitektura ng Encoder-Decoder
Isang solong encoder ang nagpoproseso ng multimodal na input, at ang decoder ay bumubuo ng tekstwal na output. Ang modelo ng Flamingo ay gumagamit ng mekanismong Perceiver Resampler para sa pagpoproseso ng mga visual na input na may variable na haba at mga cross-modal na layer ng attention. Ang pamamaraang ito ay nagbibigay ng mayamang inter-modal na pakikipag-ugnayan, ngunit nangangailangan ng mas malalaking mapagkukunan ng pagkalkula[8].
Arkitektura ng Alignment
Ginagamit ng pamamaraang ito ang mga naka-freeze na pre-trained na encoder, na konektado sa pamamagitan ng isang maliit na naaral na module ng alignment. Halimbawa, gumagamit ang BLIP-2 ng Q-Former (Querying Transformer) bilang isang magaang na konektadong elemento sa pagitan ng naka-freeze na visual encoder at ng modelo ng wika, na nangangailangan ng mas kaunting mga naaral na parameter[9].
Mga Pangunahing Modelo
GPT-4V / GPT-4o (OpenAI)
Ang pamilya ng mga modelo ng GPT-4, ayon sa mga pagtatantya, ay may hanggang 1.8 trilyon na parameter (sa arkitektura ng mixture of experts). Ang modelo ng GPT-4o, na inilabas noong Mayo 2024, ay sumusuporta sa pagpoproseso ng teksto, mga larawan, audio at video sa real time. Sa benchmark na MMMU ay nakamit nito ang 69.1% na katumpakan[10].
Gemini (Google)
Isang natively multimodal na arkitektura, na sinanay mula sa simula sa teksto, mga larawan, audio at video. Sinusuportahan ng Gemini 1.5 Pro ang context window na hanggang 10 milyong token at nakahihigit sa GPT-4 sa 30 sa 32 na popular na benchmark[11].
Claude 3 (Anthropic)
Isang pamilya ng mga modelo (Haiku, Sonnet, Opus) na may context window na hanggang 200,000 token. Nagpapakita ang Claude 3 Opus ng 58.5% sa benchmark na MMMU. Para sa pagpapahusay ng kaligtasan ng modelo, ginagamit ang pamamaraang Constitutional AI[12].
LLaVA (bukas na modelo)
Pinagsama ang visual encoder ng CLIP sa modelo ng wika na Vicuna. Makukuha ang mga variant na may 7, 13 at 34 bilyong parameter. Nakamit ng modelo ang 85.1% na relatibong pagganap ng GPT-4 sa mga synthetic na gawain[13].
Mga Larangan ng Paggamit
- Visual Question Answering (VQA): Nagbibigay-daan sa mga gumagamit na magtanong tungkol sa visual na nilalaman.
- Pagsusuri ng Dokumento: Ang mga modernong MLLM ay kayang magproseso ng hanggang 2,000 pahina bawat minuto.
- Medical na Imaging: Ang mga modelo tulad ng Med-PaLM M (Google) ay nag-aanalisa ng mga medikal na larawan at klinikal na datos.
- Robotics: Ang mga modelo tulad ng RT-2 (Google DeepMind) ay nagbibigay-daan sa mga robot na maunawaan ang visual na kapaligiran at magsagawa ng mga utos sa natural na wika.
Mga Kasalukuyang Limitasyon
- Hallucinations: Ang antas ng hallucination sa nabuo na nilalaman ay tinatantya sa 27–46%. Maaaring ilarawan ng mga modelo ang mga bagay na hindi umiiral o maling bigyang-kahulugan ang visual na impormasyon[14].
- Mataas na Pangangailangan sa Pagkalkula: Ang pagsasanay at paggamit ng MLLM ay nangangailangan ng makabuluhang imprastraktura ng pagkalkula.
- Kinikilingang Datos: Ang kakulangan ng representasyon ng mga demografikong grupo, wika at kultura sa datos ng pagsasanay ay nagdudulot ng mga sistematikong pagkakamali.
Mga Sanggunian
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
Panitikan
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
Mga Talababa
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
- ↑ «Understanding CLIP». Stanford CS231n. [6]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [8]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [11]
- ↑ «Introducing the Claude 3 Family». Anthropic. [12]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]