Multimodal CoT Prompting (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Multimodale prompting met gedachteketen (Multimodal Chain-of-Thought Prompting, MCoT) — dit is een uitbreiding van de Chain-of-Thought (CoT)-methode naar taken die meerdere gegevenstypen (modaliteiten) omvatten. In MCoT-modellen nemen taal en andere modaliteiten, zoals visuele waarneming of de analyse van tabelgegevens, deel aan één gezamenlijk stapsgewijs redeneerproces voor het oplossen van complexe taken[1].

Deze aanpak ontstond met de ontwikkeling van multimodale grote taalmodellen (MLLM), die in staat zijn tekst, afbeeldingen, audio en video gelijktijdig te verwerken. MCoT stelt modellen in staat interpreteerbare, stapsgewijze verklaringen te genereren die informatie uit verschillende bronnen combineren, wat de nauwkeurigheid en transparantie van hun werking vergroot.

Voorgeschiedenis: van tekstuele naar multimodale CoT

Chain-of-Thought in tekst

Oorspronkelijk werd de Chain-of-Thought (CoT)-methode in 2022 door onderzoekers van Google voorgesteld voor tekstuele grote taalmodellen (LLM)[2]. Het idee is om het model te trainen een reeks tussenliggende redeneersstappen te genereren voordat het een definitief antwoord geeft. Het toevoegen van voorbeelden van stapsgewijze oplossingen aan de prompt (few-shot prompting) verbeterde de vaardigheid van LLM's om taken op te lossen die rekenkundige, logische en gezond-verstandredenering vereisen merkbaar, en verhoogde de algehele nauwkeurigheid en betrouwbaarheid van de modellen[2].

Overgang naar multimodaliteit

Het succes van tekstuele CoT stimuleerde pogingen om deze aanpak uit te breiden naar multimodale scenario's. Met de opkomst van MLLM's, zoals Kosmos-1 van Microsoft, die gelijktijdig op tekst en afbeeldingen worden getraind, ontstond de mogelijkheid om CoT-logica te integreren met multimodale waarneming[3]. Experimenten toonden aan dat dergelijke modellen stapsgewijze redenering kunnen toepassen met zowel tekstuele als visuele invoer, wat de principiële mogelijkheid aantoonde om logica en waarneming te combineren[3].

Belangrijkste benaderingen en methodologieën

Vanaf 2023 werd een aantal methoden voorgesteld voor de implementatie van multimodale CoT.

Tweefasige Multimodal-CoT (Zhang et al.)

Een van de eerste methoden, voorgesteld in 2023, maakt gebruik van een tweefasig schema[4]:

  1. Generatie van redenering: In de eerste stap genereert het model een tekstuele gedachteketen (rationale) op basis van multimodale informatie (bijvoorbeeld tekst en afbeelding).
  2. Vorming van het antwoord: In de tweede stap geeft het model een definitief antwoord op basis van de gegenereerde redenering.

Deze opgesplitste aanpak stelde een model met minder dan 1 miljard parameters in staat een recordhoge kwaliteit te bereiken op de wetenschappelijke dataset ScienceQA, waarbij het zelfs het grote model GPT-3.5 overtrof. Er werd ook een afname van hallucinaties vastgesteld[4].

Compositional CoT

Gepresenteerd op de conferentie CVPR 2024, richt deze methode zich op visueel-tekstuele taken en stelt voor een gestructureerde representatie van de afbeelding als tussenliggende stap te genereren[5]. Eerst genereert het MLLM een scènebeschrijving in de vorm van een scènegraaf, waarbij objecten en relaties daartussen worden aangegeven. Vervolgens wordt deze gestructureerde beschrijving opgenomen in de prompt voor het definitieve antwoord. Deze aanpak stelt LLM's in staat de compositorische verbanden tussen objecten dieper in aanmerking te nemen en verbetert de resultaten bij taken voor de beschrijving van complexe scènes en visuele vraag-en-antwoordanalyse[5].

CoT met taakverdeling (Duty-Distinct CoT)

Deze methode, gepresenteerd op NeurIPS 2023, stelt voor de verantwoordelijkheid te verdelen over verschillende componenten van het systeem[6]:

  • Het taalmodel is verantwoordelijk voor logisch redeneren en integratie van informatie.
  • Het visuele subsysteem (het computervisiemodel) is verantwoordelijk voor het herkennen van de inhoud van afbeeldingen.

Deze «binaire prompting» zorgt voor «kritisch denken»: het LLM beoordeelt en gebruikt visuele informatie die afkomstig is van een gespecialiseerde visuele module. De DDCoT-aanpak maakte het mogelijk meer algemene en verklaarbare redeneringen te genereren en verhoogde de nauwkeurigheid bij multimodale wetenschappelijke QA-taken aanzienlijk[6].

Andere varianten van MCoT

Er worden ook andere benaderingen actief ontwikkeld, aangepast aan specifieke modaliteiten:

  • Dual CoT: Een schema voor parallelle bidirectionele redenering.
  • Audio-CoT: Een aanpassing van de gedachteketen voor taken die verband houden met audio en spraak.
  • Video-of-Thought: Een techniek voor stapsgewijze analyse van videogegevens[1].

Toepassingen en resultaten

Multimodale CoT-prompting heeft zijn effectiviteit aangetoond op talrijke gebieden waar het combineren van heterogene informatie vereist is.

  • Onderwijs en wetenschappelijke QA: Stelt systemen in staat vragen met diagrammen en illustraties te beantwoorden en daarbij een uitgebreide toelichting op de oplossing te geven (bijvoorbeeld op de dataset ScienceQA)[4].
  • Autonoom rijden en robotica: Helpt bij het opeenvolgend interpreteren van gegevens van lidars, sensoren en camera's, waardoor het scènebegrip en de besluitvorming van agenten verbeteren.
  • Embodied AI: Zorgt voor betrouwbaardere actieplanning voor systemen die met de fysieke wereld interageren, op basis van visuele en tekstuele aanwijzingen.
  • Geneeskunde en gezondheidszorg: De combinatie van medische beelden (zoals röntgenfoto's) met tekstuele beschrijvingen verhoogt de nauwkeurigheid van diagnoses en de verklaarbaarheid van AI-conclusies[1].

Uitdagingen en vooruitzichten

Ondanks aanzienlijke vooruitgang blijft het multimodale gebruik van CoT een complex onderzoeksonderwerp.

  • Gebrek aan gelabelde gegevens: Voor het trainen van modellen om correcte multimodale redeneringen te genereren zijn grote datasets met gedetailleerde toelichtingen nodig, die moeilijk te verkrijgen zijn.
  • Flexibiliteit en generaliseerbaarheid: Methoden die zijn afgesteld op één type taak (bijvoorbeeld tekst + afbeelding) kunnen slecht overdraagbaar zijn naar andere combinaties van modaliteiten.
  • Optimale integratie: De vraag blijft open hoe de verschillende modaliteiten het beste kunnen worden geïntegreerd in één redeneerproces, zodat dit het begrip van het model werkelijk versterkt in plaats van slechts het antwoord te verlengen.
  • Standaardisatie en evaluatie: Er bestaat een behoefte aan de ontwikkeling van gestandaardiseerde benchmarks voor objectieve evaluatie en vergelijking van verschillende MCoT-benaderingen[6].

Voor het bereiken van multimodale AI die dicht bij algemene intellectuele vermogens komt, zijn verdere innovaties nodig in MCoT-methoden die rekening houden met de specificiteit van de waarneming van de wereld via verschillende sensoren[1].

Verwijzingen

  • Overzicht van Multimodal CoT in Prompting Guide
  • «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — gedetailleerd wetenschappelijk overzicht

Literatuur

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

Noten

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]