Multimodal CoT Prompting (TL)
Multimodal na Chain-of-Thought Prompting (Multimodal Chain-of-Thought Prompting, MCoT) — isang pagpapalawak ng pamamaraan ng chain-of-thought (CoT) para sa mga gawaing kinabibilangan ng maraming uri ng datos (modalidad). Sa mga MCoT-modelo, ang wika at iba pang modalidad, tulad ng paningin o pagsusuri ng tabular na datos, ay kalahok sa iisang proseso ng hakbang-hakbang na paghinuha para sa paglutas ng mga kumplikadong gawain[1].
Ang pamamaraang ito ay lumitaw kasabay ng pag-unlad ng multimodal na malalaking modelo ng wika (MLLM), na kayang sabay-sabay na iproseso ang teksto, mga larawan, audio at video. Nagbibigay-daan ang MCoT sa mga modelo na bumuo ng mga maiintindihang, hakbang-hakbang na paliwanag na pinagsasama ang impormasyon mula sa iba't ibang pinagkukunan, na nagpapataas ng katumpakan at transparency ng kanilang gawain.
Paunang kondisyon: mula sa tekstwal hanggang sa multimodal na CoT
Chain-of-Thought sa teksto
Sa una, ang pamamaraan ng Chain-of-Thought (CoT) ay iminungkahi ng mga mananaliksik ng Google noong 2022 para sa mga tekstwal na malalaking modelo ng wika (LLM)[2]. Ang ideya ay sanayin ang modelo na bumuo ng isang pagkakasunod-sunod ng mga intermediate na hakbang ng paghinuha bago ibigay ang panghuling sagot. Ang pagdaragdag sa prompt ng mga halimbawa ng hakbang-hakbang na solusyon (few-shot prompting) ay kapansin-pansing nagpabuti ng kakayahan ng LLM na malutas ang mga gawaing nangangailangan ng aritmetika, lohikal, at makatwirang paghinuha, at nagpataas ng pangkalahatang katumpakan at pagiging maaasahan ng mga modelo[2].
Paglipat sa multimodality
Ang tagumpay ng tekstwal na CoT ay nagbigay-inspirasyon sa mga pagtatangkang palawakin ito sa mga multimodal na sitwasyon. Sa paglabas ng mga MLLM, tulad ng Kosmos-1 mula sa Microsoft, na sinanay nang sabay-sabay sa teksto at mga larawan, lumitaw ang posibilidad na isama ang CoT-lohika sa multimodal na pang-unawa[3]. Ipinakita ng mga eksperimento na ang mga naturang modelo ay maaaring gumamit ng hakbang-hakbang na paghinuha, isinasaalang-alang ang parehong tekstwal at visual na input, na nagpakita ng pangunahing posibilidad ng pagsasama ng lohika at pang-unawa[3].
Mga pangunahing pamamaraan at metodolohiya
Simula noong 2023, maraming pamamaraan ang iminungkahi para sa pagpapatupad ng multimodal na CoT.
Dalawang yugto na Multimodal-CoT (Zhang et al.)
Isa sa mga unang pamamaraan, iminungkahi noong 2023, ay gumagamit ng dalawang yugtong pamamaraan[4]:
- Pagbuo ng batayan: Sa unang hakbang, ang modelo ay bumubuo ng tekstwal na chain-of-thought (rationale) batay sa multimodal na impormasyon (halimbawa, teksto at larawan).
- Pagbuo ng sagot: Sa pangalawang hakbang, ang modelo ay nagbibigay ng panghuling sagot batay sa nabuo na batayan.
Ang ganitong hiwalay na pamamaraan ay nagpahintulot sa isang modelo na may wala pang 1 bilyong parameter na makamit ang pinakamataas na kalidad sa siyentipikong dataset na ScienceQA, na nalampasan pa ang malaking modelong GPT-3.5. Napansin din ang pagbaba ng mga hallucination[4].
Compositional CoT
Ipinakita sa kumperensyang CVPR 2024, ang pamamaraang ito ay nakatuon sa mga visual-tekstwal na gawain at nagmumungkahi ng pagbuo ng istrukturadong representasyon ng larawan bilang intermediate na hakbang[5]. Sa una, ang MLLM ay bumubuo ng paglalarawan ng eksena sa anyo ng scene graph, na tinutukoy ang mga bagay at ang mga relasyon sa pagitan nila. Pagkatapos, ang istrukturadong paglalarawang ito ay isinama sa prompt para sa panghuling sagot. Ang pamamaraang ito ay nagpapahintulot sa LLM na mas malalim na isaalang-alang ang mga kompositional na koneksyon sa pagitan ng mga bagay at nagpapabuti ng mga resulta sa mga gawaing paglalarawan ng kumplikadong eksena at visual na tanong-at-sagot na pagsusuri[5].
CoT na may paghahati ng tungkulin (Duty-Distinct CoT)
Ang pamamaraang ito, ipinakita sa NeurIPS 2023, ay nagmumungkahi ng paghahati ng responsibilidad sa pagitan ng iba't ibang bahagi ng sistema[6]:
- Modelo ng wika ang responsable sa lohikal na paghinuha at pagsasama ng impormasyon.
- Visual na subsystem (modelo ng computer vision) ang responsable sa pagkilala ng nilalaman ng larawan.
Ang ganitong "dalawahang prompting" ay nagbibigay ng "kritikal na pag-iisip": sinusuri at ginagamit ng LLM ang visual na impormasyon na natanggap mula sa espesyalisadong visual na module. Ang pamamaraan ng DDCoT ay nagpahintulot sa pagbuo ng mas pangkalahatan at maipaliwanag na paghinuha at makabuluhang nagpataas ng katumpakan sa mga gawaing multimodal na siyentipikong QA[6].
Iba pang mga variant ng MCoT
Aktibong nililinang din ang iba pang mga pamamaraan na inangkop para sa mga tiyak na modalidad:
- Dual CoT: Pamamaraan ng parallel na dobleng direksyonal na paghinuha.
- Audio-CoT: Pag-angkop ng chain-of-thought para sa mga gawaing may kaugnayan sa audio at pagsasalita.
- Video-of-Thought: Teknik ng hakbang-hakbang na pagsusuri ng video data[1].
Aplikasyon at mga resulta
Ipinakita ng multimodal na CoT prompting ang bisa nito sa maraming larangan kung saan kinakailangan ang pagsasama ng magkakaibang impormasyon.
- Edukasyon at siyentipikong QA: Nagbibigay-daan sa mga sistema na sagutin ang mga tanong na may mga diagram at ilustrasyon, na nagbibigay ng detalyadong paliwanag ng solusyon (halimbawa, sa dataset na ScienceQA)[4].
- Autonomous na pagmamaneho at robotics: Tumutulong sa sunud-sunod na interpretasyon ng datos mula sa mga lidar, sensor at camera, na nagpapabuti ng pag-unawa sa eksena at paggawa ng desisyon ng mga ahente.
- Embodied AI: Nagbibigay ng mas maaasahang pagpaplano ng mga aksyon para sa mga sistemang nakikipag-ugnayan sa pisikal na mundo, batay sa mga visual at tekstwal na pahiwatig.
- Medisina at pangangalagang pangkalusugan: Ang pagsasama ng mga medikal na larawan (halimbawa, mga X-ray) sa mga tekstwal na paglalarawan ay nagpapataas ng katumpakan ng diagnosis at maipaliwanag na mga konklusyon ng AI[1].
Mga hamon at pananaw
Kabalikat ng makabuluhang pag-unlad, ang multimodal na paggamit ng CoT ay nananatiling isang kumplikadong pananaliksik na problema.
- Kakulangan ng mga may labelang datos: Para sa pagsasanay ng mga modelo na bumuo ng tamang multimodal na paghinuha, kinakailangan ang malalaking koleksyon ng datos na may detalyadong paliwanag, na mahirap makuha.
- Kakayahang umangkop at generalizability: Ang mga pamamaraang inangkop para sa isang uri ng gawain (halimbawa, teksto + larawan) ay maaaring hindi mahusay na mailapat sa iba pang kombinasyon ng modalidad.
- Pinakamainam na integrasyon: Nananatiling bukas ang tanong kung paano pinakamainam na isama ang iba't ibang modalidad sa iisang proseso ng paghinuha upang talagang mapalakas ang pag-unawa ng modelo, at hindi lamang mapahaba ang sagot.
- Standardisasyon at pagtatasa: May pangangailangan para sa pagbuo ng mga standardisadong benchmark para sa layunin na pagtatasa at paghahambing ng iba't ibang MCoT-pamamaraan[6].
Para makamit ang multimodal na AI na malapit sa pangkalahatang kakayahang intelektwal, kailangan ang karagdagang inobasyon sa mga pamamaraan ng MCoT na isinasaalang-alang ang kakaibang pag-unawa sa mundo sa pamamagitan ng iba't ibang sensor[1].
Mga Sanggunian
- Pangkalahatang-tanaw ng Multimodal CoT sa Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — detalyadong siyentipikong pangkalahatang-tanaw
Panitikan
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]