Multimodal CoT Prompting (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Multimodal Chain-of-Thought Prompting (Multimodal Chain-of-Thought Prompting, MCoT) — är en utvidgning av metoden Chain-of-Thought (CoT) till uppgifter som innefattar flera datatyper (modaliteter). I MCoT-modeller deltar språk och andra modaliteter, såsom syn eller analys av tabelldata, i en gemensam process för stegvist resonemang för att lösa komplexa uppgifter[1].

Detta tillvägagångssätt uppstod i samband med utvecklingen av multimodala stora språkmodeller (MLLM), som kan bearbeta text, bilder, ljud och video samtidigt. MCoT gör det möjligt för modeller att generera tolkningsbara, stegvisa förklaringar som kombinerar information från olika källor, vilket ökar deras precision och transparens.

Förutsättningar: från textbaserad till multimodal CoT

Chain-of-Thought i text

Ursprungligen föreslogs metoden Chain-of-Thought (CoT) av forskare på Google år 2022 för textbaserade stora språkmodeller (LLM)[2]. Idén går ut på att träna modellen att generera en sekvens av mellanliggande resonemangssteg innan det slutliga svaret ges. Att lägga till exempel på stegvisa lösningar i prompten (few-shot prompting) förbättrade märkbart LLM:ernas förmåga att lösa uppgifter som kräver aritmetiska, logiska och sunda resonemang, och höjde modellernas övergripande precision och tillförlitlighet[2].

Övergång till multimodalitet

Framgångarna med textbaserad CoT stimulerade försök att utvidga den till multimodala scenarier. Med tillkomsten av MLLM, såsom Kosmos-1 från Microsoft, som tränas simultant på text och bilder, uppstod möjligheten att integrera CoT-logik med multimodal perception[3]. Experiment visade att sådana modeller kan använda stegvisa resonemang med hänsyn till både textbaserade och visuella indata, vilket demonstrerade den principiella möjligheten att kombinera logik och perception[3].

Huvudsakliga tillvägagångssätt och metodologier

Från och med 2023 har ett antal metoder föreslagits för att implementera multimodal CoT.

Tvåstegs Multimodal-CoT (Zhang et al.)

En av de första metoderna, föreslagen år 2023, använder ett tvåstegsschema[4]:

  1. Generering av motivering: I det första steget genererar modellen en textbaserad resonemangsserie (rationale) baserad på multimodal information (till exempel text och bild).
  2. Formulering av svar: I det andra steget producerar modellen det slutliga svaret med stöd av den genererade motiveringen.

Detta uppdelade tillvägagångssätt gjorde det möjligt för en modell med färre än 1 miljard parametrar att uppnå rekordlåg felprocent på det vetenskapliga datasetet ScienceQA, och överträffade till och med den stora modellen GPT-3.5. En minskning av hallucinationer noterades också[4].

Compositional CoT

Denna metod, presenterad vid konferensen CVPR 2024, fokuserar på visuell-textuella uppgifter och föreslår att generera en strukturerad representation av bilden som ett mellanliggande steg[5]. Först skapar MLLM en scenebeskrivning i form av en scengraf, som anger objekt och relationer dem emellan. Därefter inkluderas denna strukturerade beskrivning i prompten för det slutliga svaret. Detta tillvägagångssätt gör det möjligt för LLM att djupare beakta kompositionella samband mellan objekt och förbättrar resultaten vid uppgifter som rör beskrivning av komplexa scener och visuell fråga-och-svar-analys[5].

CoT med ansvarsfördelning (Duty-Distinct CoT)

Denna metod, presenterad vid NeurIPS 2023, föreslår att ansvaret delas upp mellan olika systemkomponenter[6]:

  • Språkmodellen ansvarar för logiskt resonemang och informationsintegration.
  • Det visuella delsystemet (en datorseendemodell) ansvarar för igenkänning av bildinnehållet.

Detta "binära prompting" möjliggör "kritiskt tänkande": LLM utvärderar och använder visuell information från en specialiserad visuell modul. DDCoT-metoden möjliggjorde mer generella och förklaringsbara resonemang och förbättrade avsevärt precisionen vid multimodala vetenskapliga QA-uppgifter[6].

Andra varianter av MCoT

Andra tillvägagångssätt anpassade till specifika modaliteter utvecklas aktivt:

  • Dual CoT: Ett schema för parallellt dubbelriktat resonemang.
  • Audio-CoT: En anpassning av tankekedjan för uppgifter relaterade till ljud och tal.
  • Video-of-Thought: En teknik för stegvis analys av videodata[1].

Tillämpning och resultat

Multimodal CoT-prompting har visat sin effektivitet inom ett flertal områden där kombinering av heterogen information krävs.

  • Utbildning och vetenskaplig QA: Gör det möjligt för system att besvara frågor med diagram och illustrationer och tillhandahålla utförliga förklaringar av lösningen (till exempel på datasetet ScienceQA)[4].
  • Autonom körning och robotteknik: Hjälper till att tolka data från lidars, sensorer och kameror i sekvens, vilket förbättrar scenförståelse och beslutsfattande hos agenter.
  • Embodied AI: Möjliggör mer tillförlitlig aktionsplanering för system som interagerar med den fysiska världen, baserat på visuella och textbaserade ledtrådar.
  • Medicin och sjukvård: Kombinationen av medicinska bilder (till exempel röntgenbilder) med textbeskrivningar ökar diagnostikens precision och förklaringsbarheten hos AI:ns slutsatser[1].

Problem och framtidsutsikter

Trots betydande framsteg är multimodal användning av CoT fortfarande ett komplext forskningsproblem.

  • Brist på annoterad data: För att träna modeller att generera korrekta multimodala resonemang krävs stora datamängder med detaljerade förklaringar, vilket är arbetskrävande att ta fram.
  • Flexibilitet och generaliserbarhet: Metoder som är inställda på en typ av uppgifter (till exempel text + bild) kan vara svåra att överföra till andra kombinationer av modaliteter.
  • Optimal integration: Frågan om hur man på bästa sätt integrerar olika modaliteter i en gemensam resonemangsprocess — så att den verkligen stärker modellens förståelse snarare än bara förlänger svaret — kvarstår som öppen.
  • Standardisering och utvärdering: Det finns ett behov av att utveckla standardiserade benchmark för objektiv utvärdering och jämförelse av olika MCoT-metoder[6].

För att uppnå multimodal AI nära allmänna intellektuella förmågor krävs ytterligare innovationer inom MCoT-metoder som beaktar särdragen i hur världen uppfattas via olika sensorer[1].

Externa länkar

  • Översikt över Multimodal CoT i Prompting Guide
  • "Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey" — en detaljerad vetenskaplig översikt

Litteratur

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

Noter

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]