Multimodal CoT Prompting (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Multimodální prompting s řetězcem uvažování (Multimodal Chain-of-Thought Prompting, MCoT) — je rozšíření metody řetězce uvažování (CoT) na úlohy zahrnující více typů dat (modalit). V MCoT modelech se jazyk a další modality, jako je zrak nebo analýza tabulkových dat, podílejí na jediném procesu postupného odvozování pro řešení složitých úloh[1].

Tento přístup vznikl s rozvojem multimodálních velkých jazykových modelů (MLLM), schopných současně zpracovávat text, obrázky, audio a video. MCoT umožňuje modelům generovat interpretovatelná, postupná vysvětlení kombinující informace z různých zdrojů, čímž zvyšuje přesnost a transparentnost jejich práce.

Předpoklady: od textového k multimodálnímu CoT

Chain-of-Thought v textu

Původně byla metoda Chain-of-Thought (CoT) navržena výzkumníky společnosti Google v roce 2022 pro textové velké jazykové modely (LLM)[2]. Myšlenka spočívá v tom, aby model generoval posloupnost mezikroků uvažování před vydáním konečné odpovědi. Přidání příkladů postupného řešení do promptu (few-shot prompting) výrazně zlepšilo schopnost LLM řešit úlohy vyžadující aritmetické, logické a zdravorozumové uvažování a zvýšilo celkovou přesnost a spolehlivost modelů[2].

Přechod k multimodalitě

Úspěch textového CoT podnítil snahy rozšířit jej na multimodální scénáře. S příchodem MLLM, jako je Kosmos-1 od Microsoftu, které jsou trénovány současně na textu a obrázcích, vznikla možnost integrovat CoT logiku s multimodálním vnímáním[3]. Experimenty ukázaly, že takové modely mohou využívat postupné uvažování zohledňující jak textové, tak vizuální vstupní data, což demonstrovalo principiální možnost propojení logiky a vnímání[3].

Základní přístupy a metodologie

Počínaje rokem 2023 byla navržena řada metod pro realizaci multimodálního CoT.

Dvoustupňový Multimodal-CoT (Zhang et al.)

Jedna z prvních metod, navržená v roce 2023, využívá dvoustupňové schéma[4]:

  1. Generování odůvodnění: V prvním kroku model generuje textový řetězec uvažování (rationale) na základě multimodálních informací (například textu a obrázku).
  2. Formování odpovědi: Ve druhém kroku model vydává konečnou odpověď opírající se o vygenerované odůvodnění.

Takovýto oddělený přístup umožnil modelu s méně než 1 miliardou parametrů dosáhnout rekordně vysoké kvality na vědeckém datasetu ScienceQA, přičemž předčil i velký model GPT-3.5. Bylo také zaznamenáno snížení halucinací[4].

Kompoziční CoT (Compositional CoT)

Představená na konferenci CVPR 2024, tato metoda se zaměřuje na vizuálně-textové úlohy a navrhuje generovat strukturovanou reprezentaci obrázku jako mezikrok[5]. Nejprve MLLM vytvoří popis scény ve formě scénového grafu, uvádějící objekty a vztahy mezi nimi. Poté je tento strukturovaný popis zahrnut do promptu pro finální odpověď. Tento přístup umožňuje LLM hlouběji zohledňovat kompoziční vazby mezi objekty a zlepšuje výsledky při popisu složitých scén a vizuální otázko-odpovědní analýze[5].

CoT s rozdělením povinností (Duty-Distinct CoT)

Tato metoda, představená na NeurIPS 2023, navrhuje rozdělit odpovědnost mezi různé komponenty systému[6]:

  • Jazykový model zodpovídá za logické uvažování a integraci informací.
  • Vizuální subsystém (model počítačového vidění) zodpovídá za rozpoznávání obsahu obrázku.

Takovýto „binární prompting" zajišťuje „kritické myšlení": LLM vyhodnocuje a využívá vizuální informace získané od specializovaného zrakového modulu. Přístup DDCoT umožnil generovat obecnější a vysvětlitelnější uvažování a výrazně zvýšil přesnost při multimodálních vědeckých QA úlohách[6].

Další varianty MCoT

Aktivně se rozvíjejí i další přístupy přizpůsobené konkrétním modalitám:

  • Dual CoT: Schéma paralelního obousměrného uvažování.
  • Audio-CoT: Adaptace řetězce myšlenek pro úlohy spojené s audiem a řečí.
  • Video-of-Thought: Technika postupné analýzy videodát[1].

Využití a výsledky

Multimodální CoT prompting prokázal účinnost v mnoha oblastech, kde je vyžadováno kombinování různorodých informací.

  • Vzdělávání a vědecký QA: Umožňuje systémům odpovídat na otázky s diagramy a ilustracemi a poskytovat podrobné vysvětlení řešení (například na datasetu ScienceQA)[4].
  • Autonomní řízení a robotika: Pomáhá postupně interpretovat data z lidarů, senzorů a kamer, čímž zlepšuje porozumění scéně a rozhodování agentů.
  • Embodied AI: Zajišťuje spolehlivější plánování akcí pro systémy interagující s fyzickým světem na základě vizuálních a textových podnětů.
  • Medicína a zdravotnictví: Kombinace lékařských snímků (například rentgenových) s textovými popisy zvyšuje přesnost diagnostiky a vysvětlitelnost závěrů AI[1].

Problémy a perspektivy

Navzdory značnému pokroku zůstává multimodální využití CoT složitým výzkumným problémem.

  • Nedostatek anotovaných dat: Trénování modelů ke generování správných multimodálních úvah vyžaduje rozsáhlé datové sady s podrobnými vysvětleními, jejichž získávání je pracné.
  • Flexibilita a zobecnitelnost: Metody přizpůsobené jednomu typu úloh (například text + obrázek) se mohou špatně přenášet na jiné kombinace modalit.
  • Optimální integrace: Zůstává otevřenou otázkou, jak nejlépe integrovat různé modality do jediného procesu uvažování tak, aby skutečně posiloval porozumění modelu, a ne jen prodlužoval odpověď.
  • Standardizace a hodnocení: Existuje potřeba rozvoje standardizovaných benchmarků pro objektivní hodnocení a srovnání různých MCoT přístupů[6].

Pro dosažení multimodální AI blízké obecným intelektuálním schopnostem jsou zapotřebí další inovace v metodách MCoT zohledňujících specifiku vnímání světa různými senzory[1].

Odkazy

  • Přehled Multimodal CoT v Prompting Guide
  • «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — podrobný vědecký přehled

Literatura

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

Poznámky

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]