Multimodal CoT Prompting (RO)
Prompting multimodal cu lanț de raționament (Multimodal Chain-of-Thought Prompting, MCoT) — este o extensie a metodei lanțului de raționament (CoT) pentru sarcini care implică mai multe tipuri de date (modalități). În modelele MCoT, limbajul și alte modalități, precum vederea sau analiza datelor tabelate, participă într-un proces unitar de inferență pas cu pas pentru rezolvarea sarcinilor complexe[1].
Această abordare a apărut odată cu dezvoltarea modelelor lingvistice mari multimodale (MLLM), capabile să proceseze simultan text, imagini, audio și video. MCoT permite modelelor să genereze explicații interpretabile, pas cu pas, care combină informații din surse diferite, sporind astfel acuratețea și transparența funcționării lor.
Premise: de la CoT textual la CoT multimodal
Lanțul de raționament (Chain-of-Thought) în text
Inițial, metoda Chain-of-Thought (CoT) a fost propusă de cercetătorii Google în 2022 pentru modelele lingvistice mari (LLM) de tip textual[2]. Ideea constă în a antrena modelul să genereze o secvență de pași intermediari de raționament înainte de a produce răspunsul final. Adăugarea în prompt a unor exemple de rezolvare pas cu pas (few-shot prompting) a îmbunătățit semnificativ capacitatea LLM de a rezolva sarcini ce necesită raționament aritmetic, logic și de bun simț, sporind acuratețea și fiabilitatea generală a modelelor[2].
Tranziția spre multimodalitate
Succesul CoT textual a stimulat încercările de a-l extinde la scenarii multimodale. Odată cu apariția MLLM, precum Kosmos-1 de la Microsoft, antrenate simultan pe text și imagini, a apărut posibilitatea de a integra logica CoT cu percepția multimodală[3]. Experimentele au arătat că astfel de modele pot utiliza raționamentul pas cu pas, luând în considerare atât intrările textuale, cât și cele vizuale, demonstrând posibilitatea de principiu de a combina logica cu percepția[3].
Abordări principale și metodologii
Începând cu 2023, au fost propuse o serie de metode pentru implementarea CoT multimodal.
Multimodal-CoT în două etape (Zhang et al.)
Una dintre primele metode, propusă în 2023, utilizează o schemă în două etape[4]:
- Generarea justificării: În primul pas, modelul generează un lanț de raționament textual (rationale) pe baza informațiilor multimodale (de exemplu, text și imagine).
- Formularea răspunsului: În al doilea pas, modelul produce răspunsul final, bazându-se pe justificarea generată.
Această abordare separată a permis unui model cu mai puțin de 1 miliard de parametri să atingă o calitate record pe dataset-ul științific ScienceQA, depășind chiar și modelul mare GPT-3.5. De asemenea, s-a remarcat o reducere a halucinațiilor[4].
CoT compozițional (Compositional CoT)
Prezentat la conferința CVPR 2024, această metodă se concentrează pe sarcini vizual-textuale și propune generarea unei reprezentări structurate a imaginii ca pas intermediar[5]. Mai întâi, MLLM generează o descriere a scenei sub forma unui graf de scenă, indicând obiectele și relațiile dintre ele. Apoi, această descriere structurată este inclusă în prompt pentru răspunsul final. Această abordare permite LLM să ia în considerare mai profund legăturile compoziționale dintre obiecte și îmbunătățește rezultatele la sarcini de descriere a scenelor complexe și de analiză vizuală de tip întrebare-răspuns[5].
CoT cu separarea responsabilităților (Duty-Distinct CoT)
Această metodă, prezentată la NeurIPS 2023, propune împărțirea responsabilității între diferite componente ale sistemului[6]:
- Modelul lingvistic este responsabil pentru raționamentul logic și integrarea informațiilor.
- Subsistemul vizual (modelul de computer vision) este responsabil pentru recunoașterea conținutului imaginii.
Acest „prompting binar" asigură o „gândire critică": LLM evaluează și utilizează informațiile vizuale primite de la modulul vizual specializat. Abordarea DDCoT a permis generarea unor raționamente mai generale și mai explicabile și a îmbunătățit semnificativ acuratețea la sarcinile de QA științific multimodal[6].
Alte variante MCoT
Se dezvoltă activ și alte abordări, adaptate pentru modalități specifice:
- Dual CoT: Schemă de raționament bidirecțional paralel.
- Audio-CoT: Adaptarea lanțului de gânduri pentru sarcini legate de audio și vorbire.
- Video-of-Thought: Tehnică de analiză pas cu pas a datelor video[1].
Aplicații și rezultate
Prompting-ul CoT multimodal și-a demonstrat eficiența în numeroase domenii unde este necesară combinarea informațiilor eterogene.
- Educație și QA științific: Permite sistemelor să răspundă la întrebări cu diagrame și ilustrații, furnizând o explicație detaliată a soluției (de exemplu, pe dataset-ul ScienceQA)[4].
- Conducere autonomă și robotică: Ajută la interpretarea secvențială a datelor de la lidare, senzori și camere, îmbunătățind înțelegerea scenei și luarea deciziilor de către agenți.
- AI Întruchipat (Embodied AI): Asigură o planificare mai fiabilă a acțiunilor pentru sistemele care interacționează cu lumea fizică, pe baza indiciilor vizuale și textuale.
- Medicină și sănătate: Combinarea imaginilor medicale (de exemplu, radiografii) cu descrierile textuale crește acuratețea diagnosticului și explicabilitatea concluziilor AI[1].
Provocări și perspective
În ciuda progreselor semnificative, utilizarea multimodală a CoT rămâne o problemă de cercetare complexă.
- Lipsa datelor adnotate: Antrenarea modelelor pentru a genera raționamente multimodale corecte necesită seturi mari de date cu explicații detaliate, a căror obținere este laborioasă.
- Flexibilitate și generalizare: Metodele ajustate pentru un tip de sarcini (de exemplu, text + imagine) se pot transfera cu dificultate la alte combinații de modalități.
- Integrare optimă: Rămâne deschisă întrebarea cum să se integreze cel mai bine diferitele modalități într-un proces unitar de raționament, astfel încât acesta să amplifice cu adevărat înțelegerea modelului, și nu doar să prelungească răspunsul.
- Standardizare și evaluare: Există necesitatea dezvoltării unor benchmark-uri standardizate pentru evaluarea și compararea obiectivă a diferitelor abordări MCoT[6].
Pentru a atinge un AI multimodal apropiat de capacitățile de inteligență generală, sunt necesare inovații suplimentare în metodele MCoT care să țină cont de specificul perceperii lumii prin diferiți senzori[1].
Referințe
- Prezentare generală Multimodal CoT în Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — prezentare științifică detaliată
Bibliografie
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Note
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]