Multimodal reasoning (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mulmódal na Pangangatuwiran (Ingles: Multimodal Reasoning) — ito ang kakayahan ng artipisyal na katalinuhan, lalo na ng malalaking language model (LLM), na sabay-sabay na iproseso, bigyang-kahulugan, at lohikal na iugnay ang impormasyon mula sa iba't ibang uri ng datos (modalidad), tulad ng teksto, larawan, audio at video, para sa paglutas ng mga kumplikadong gawain[1]. Ang prosesong ito ay ginagaya ang maraming panig na pang-unawa ng tao at isang mahalagang hakbang patungo sa paglikha ng mas unibersal at mapagbagay na pangkalahatang artipisyal na katalinuhan (AGI)[2].

Ang mga modelong nagtataglay ng ganitong kakayahan ay tinatawag na mulmódal na malalaking language model (MLLM o LMRM — Large Multimodal Reasoning Models). Pinalawak nila ang mga kakayahan ng tradisyonal na LLM na sinanay lamang sa teksto, na nagbibigay-daan sa kanila na maunawaan ang nilalaman ng mga larawan, suriin ang mga video, kontrolin ang mga robot, at makipag-usap batay sa biswal na datos.

Ebolusyon ng mga Pamamaraan

Ang mga pamamaraan ng mulmódal na pangangatuwiran ay sumailalim sa mabilis na ebolusyon mula sa mga modular na sistema patungo sa mga pinag-isang arkitektura na nakasentro sa wika.

  • Maagang mga sistema: Nakabatay sa magkakahiwalay na pipeline, kung saan ang mga natatanging bahagi ang nagpoproseso ng bisyon, ang iba ay nagpoproseso ng teksto, at sa huling yugto ay pinagsama ang kanilang mga representasyon. Ang pamamaraang ito ay nangangailangan ng maingat na disenyo para sa bawat partikular na gawain.
  • Mga modernong sistema: Lumipat sa mga pinag-isang modelo na nakasentro sa wika. Sa mga ito, ang malaking language model ay nagsisilbing sentral na elemento, o "makina" ng pangangatuwiran, na nagpoproseso ng impormasyon mula sa lahat ng modalidad sa iisang format. Naging posible ito dahil sa mga pamamaraan na "nagturo" sa language model na maunawaan ang biswal at iba pang datos, na inilalarawan ang mga ito bilang mga espesyal na token[1].

Isang mahalagang tagabalik sa paglipat na ito ang konsepto ng "mulmódal na chain-of-thought" (Multimodal Chain-of-Thought, MCoT), kung saan ang modelo ay tumatanggap ng isang pagkakasunud-sunod ng mga pahiwatig na hakbang-hakbang na gumagabay dito sa mga lohikal na hakbang na gumagamit ng iba't ibang modalidad.

Mga Arkitektura ng Mulmódal na LLM

Mayroong dalawang pangunahing estratehiyang arkitektura para sa pagsasama ng iba't ibang modalidad sa isang language model[3]:

1. Pinag-isang Arkitektura sa Antas ng Token

Sa pamamaraang ito, ang lahat ng modalidad ay ginagawang karaniwang representasyon na tugma sa LLM. Halimbawa, ang isang larawan ay hinihiwa sa mga piraso (patch), dinadaan sa visual encoder (halimbawa, Vision Transformer (ViT)) at ginagawang isang pagkakasunud-sunod ng mga vector embedding — biswal na token. Pagkatapos, ang mga biswal na token na ito ay pinagsasama (kinokonkatenasyon) sa mga text token at ipinapasok sa malaking language model, na nagpoproseso ng mga ito bilang isang pinag-isang daloy.

  • Mga kalamangan: Ang pamamaraang ito ay halos hindi nangangailangan ng mga pagbabago sa arkitektura ng LLM at madaling i-scale.
  • Mga halimbawa: GPT-4 mula sa OpenAI, PaLM-E mula sa Google.

2. Arkitektura na may Cross-Modal na Atensyon

Dito, ang language model at ang visual encoder ay nananatiling magkahiwalay na subsistem, ngunit konektado ng mga espesyal na layer ng cross-modal na atensyon (cross-attention). Ang mga layer na ito ay nagbibigay-daan sa mga tekstuwal at biswal na representasyon na mag-impluwensya sa isa't isa sa proseso ng pagbuo. Ang modelo ay para bang "sumusunod" sa mga biswal na katangian sa bawat hakbang ng paglikha ng tekstuwal na tugon.

  • Mga kalamangan: Nagbibigay-daan sa epektibong paggamit ng kapangyarihan ng mga umiiral na, paunang sinanay at naka-freeze na modelo (halimbawa, isang malaking LLM at isang makapangyarihang ViT), na sinasimulan lamang ang mga nagtutugmang layer.
  • Halimbawa: Flamingo mula sa DeepMind.

Sa mga modernong pananaliksik, ang mga pinag-isang decoder-only na arkitektura ay naging dominante, dahil mas madali silang i-scale at mas mahusay na ginagamit ang mga kakayahan ng umiiral na LLM[3].

Mga Pangunahing Modelo at Pananaliksik

Ang pag-unlad ng MLLM ay partikular na bumilis noong 2022–2024.

  • Flamingo (DeepMind, 2022): Isa sa mga unang malalaking visual-language model (VLM), na kayang lutasin ang iba't ibang mulmódal na gawain sa mode ng few-shot learning nang walang karagdagang fine-tuning. Ipinakita ng Flamingo na ang isang modelo ay maaaring mabilis na mag-angkop sa mga bagong gawain sa pamamagitan lamang ng ilang halimbawa sa prompt[4].
  • Kosmos-1 (Microsoft Research, 2023): Ang unang MLLM na sinanay mula sa simula sa datos mula sa web. Kaya nitong pang-unawain ang teksto at mga larawan bilang "mga karaniwang modalidad" at nagpakita ng magagandang resulta sa paglutas ng mga gawaing may teksto sa mga larawan (OCR), mulmódal na diyalogo, at maging sa mga gawain ng di-berbal na lohikal na pag-iisip (matriks ni Raven)[2].
  • GPT-4 (OpenAI, 2023): Ang flagship na modelo, na inilarawan bilang isang "malaking mulmódal na modelo," na kayang tumanggap ng teksto at mga larawan bilang input. Bagama't hindi inilalabas ang arkitektura nito, alam na kaya nitong suriin ang nilalaman ng mga larawan, ilarawan ang mga graph, at ipaliwanag ang mga biswal na meme. Ang access sa mga mulmódal na kakayahan nito ay limitadong ibinigay, halimbawa, sa pakikipagtulungan sa application na BeMyEyes para sa tulong sa mga bulag at may kapansanan sa paningin[5].
  • PaLM-E (Google, 2023): Ang tinatawag na "embodied" (embodied) mulmódal na modelo, na nilikha para sa pagsasama ng biswal na pang-unawa sa pisikal na mga aksyon ng robot. Kayang bumuo ng PaLM-E ng mga sunud-sunod na plano para sa pagkontrol ng mga robot, na tumatanggap bilang input ng kombinasyon ng mga larawan mula sa mga camera at mga pagbabasa ng sensor. Ipinakita nito ang epekto ng "positibong transfer": ang pagsasanay sa mga pangkalahatang gawaing "bisyon+wika" ay nagpabuti ng kahusayan ng mga kakayahan sa robotics[6].
  • LLAMA 3.2 (Meta, 2024): Isang bukas na serye ng mga modelo, na nagsimulang isama ang mga mulmódal na bersyon. Ang kanilang paglalabas ay ginagawang accessible ang mga teknolohiya ng MLLM sa malawak na komunidad ng mga mananaliksik para sa karagdagang mga eksperimento[3].

Mga Problema at Limitasyon

Kabílang sa mga kahanga-hangang tagumpay, ang MLLM ay nahaharap sa ilang seryosong problema:

  • Mga hallusinasyon: Tulad ng kanilang mga ninuno sa teksto, ang MLLM ay maaaring bumuo ng mga pahayag na kapani-paniwalang tunog ngunit sa katunayan ay mali. Ang biswal na impormasyon ay hindi nag-aalis ng problemang ito, at kung minsan ay nagpapalubha nito, na humahantong sa maling interpretasyon ng mga larawan[7].
  • Kakayahan sa paglalahat at lalim ng pangangatuwiran: Ang mga modelo ay madalas na hindi maasahang makapagpalipat ng mga konklusyon sa mga bagong uri ng datos (omni-modal na paglalahat), at ang kanilang pangangatuwiran ay maaaring maging mababaw. Maaari nilang ilarawan ang isang larawan ngunit mabigo kung ang gawain ay nangangailangan ng multi-step na pagpaplano na isinasaalang-alang ang teksto at larawan[1].
  • Mga teknikal na kahirapan: Ang pagsasanay ng MLLM ay nangangailangan ng napakalaking mapagkukunan sa pagkalkula at malalaking, maingat na inihanda na mulmódal na dataset. Ang pagtatasa ng kalidad ng mga ganitong modelo ay kumplikado rin, dahil nangangailangan ito ng mga espesyal na benchmark na isinasaalang-alang ang parehong pag-unawa at pangangatuwiran.

Mga Pananaw sa Pag-unlad

Ipinakikita ng mga trend na ang mga mulmódal na modelo ay magiging lalong "natively" mulmódal (Native Large Multimodal Models), ibig sabihin, orihinal na idinisenyo para sa pagtatrabaho sa lahat ng modalidad. Ang panghuling layunin ay lumikha ng unibersal na katalinuhan na kayang maramdaman at maunawaan ang mundo nang kasing yaman ng isang tao. Para sa layuning ito, nagtatrabaho ang mga mananaliksik sa pagbabawas ng pag-asa sa mga may label na datos, pagsasanay ng mga modelo sa mas abstract, sanhi-at-bunga na pag-iisip, at pagtitiyak ng ligtas na kontrol sa mga makapangyarihang sistemang ito. Ang pag-unlad ng mga auxiliary na pamamaraan, tulad ng HuggingGPT — kung saan ang LLM ay nagsisilbing coordinator na namamahagi ng mga gawain sa mga expert na modelo — ay nagbubukas din ng landas patungo sa mas maaasahang mulmódal na AI[8].

Mga Sanggunian

  • Pangkalahatang artikulo: A Survey on Large Multimodal Reasoning Models (2025)
  • Artikulo ni Sebastian Raschka tungkol sa pag-unawa sa mulmódal na LLM

Panitikan

  • Li, Y. et al. (2025). Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models. arXiv:2505.04921.
  • Lee, J. et al. (2024). Multimodal Reasoning with Multimodal Knowledge Graph. ACL 2024.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models. arXiv:2302.14045.
  • Shen, Y. et al. (2023). HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face. arXiv:2303.17580.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Chen, X. et al. (2023). PaLI-X: On Scaling Up a Multilingual Vision and Language Model. arXiv:2305.18565.
  • Alayrac, J-B. et al. (2022). Flamingo: A Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Chen, X. et al. (2022). PaLI: A Jointly-Scaled Multilingual Language-Image Model. arXiv:2209.06794.
  • Huang, S. et al. (2022). Multimodal Chain-of-Thought Prompting in Large Language Models. arXiv:2302.00923.

Mga Tala

  1. 1.0 1.1 1.2 Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». arXiv:2505.04921 [cs.AI], 8 мая 2025 г. [1]
  2. 2.0 2.1 Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045 [cs.CL], 28 февр. 2023 г. [2]
  3. 3.0 3.1 3.2 Raschka, Sebastian. «Understanding Multimodal LLMs». Ahead of AI Magazine. [3]
  4. Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». DeepMind Blog. [4]
  5. «GPT-4». OpenAI. [5]
  6. Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]
  7. Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». ACL Anthology, 2024. [7]
  8. Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». OpenReview. [8]