---
title: "Multimodal CoT Prompting (CS)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 4723
wiki_created_at: 2026-09-06T23:39:00Z
wiki_modified_at: 2026-09-06T23:39:00Z
downloaded_at: 2026-09-07T23:04:13Z
---

# Multimodal CoT Prompting (CS)

**Multimodální prompting s řetězcem uvažování** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — je rozšíření metody řetězce uvažování (CoT) na úlohy zahrnující více typů dat (modalit). V MCoT modelech se jazyk a další modality, jako je zrak nebo analýza tabulkových dat, podílejí na jediném procesu postupného odvozování pro řešení složitých úloh<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-survey_wang_2025-1)</sup>.

Tento přístup vznikl s rozvojem multimodálních velkých jazykových modelů (MLLM), schopných současně zpracovávat text, obrázky, audio a video. MCoT umožňuje modelům generovat interpretovatelná, postupná vysvětlení kombinující informace z různých zdrojů, čímž zvyšuje přesnost a transparentnost jejich práce.

## Předpoklady: od textového k multimodálnímu CoT

### Chain-of-Thought v textu

Původně byla metoda **Chain-of-Thought (CoT)** navržena výzkumníky společnosti Google v roce 2022 pro textové velké jazykové modely (LLM)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-cot_wei_2022-2)</sup>. Myšlenka spočívá v tom, aby model generoval posloupnost mezikroků uvažování před vydáním konečné odpovědi. Přidání příkladů postupného řešení do promptu (*few-shot prompting*) výrazně zlepšilo schopnost LLM řešit úlohy vyžadující aritmetické, logické a zdravorozumové uvažování a zvýšilo celkovou přesnost a spolehlivost modelů<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-cot_wei_2022-2)</sup>.

### Přechod k multimodalitě

Úspěch textového CoT podnítil snahy rozšířit jej na multimodální scénáře. S příchodem MLLM, jako je **Kosmos-1** od Microsoftu, které jsou trénovány současně na textu a obrázcích, vznikla možnost integrovat CoT logiku s multimodálním vnímáním<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-kosmos1_huang_2023-3)</sup>. Experimenty ukázaly, že takové modely mohou využívat postupné uvažování zohledňující jak textové, tak vizuální vstupní data, což demonstrovalo principiální možnost propojení logiky a vnímání<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-kosmos1_huang_2023-3)</sup>.

## Základní přístupy a metodologie

Počínaje rokem 2023 byla navržena řada metod pro realizaci multimodálního CoT.

### Dvoustupňový Multimodal-CoT (Zhang et al.)

Jedna z prvních metod, navržená v roce 2023, využívá dvoustupňové schéma<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Generování odůvodnění**: V prvním kroku model generuje textový řetězec uvažování (*rationale*) na základě multimodálních informací (například textu a obrázku).
2.  **Formování odpovědi**: Ve druhém kroku model vydává konečnou odpověď opírající se o vygenerované odůvodnění.

Takovýto oddělený přístup umožnil modelu s méně než 1 miliardou parametrů dosáhnout rekordně vysoké kvality na vědeckém datasetu **ScienceQA**, přičemž předčil i velký model GPT-3.5. Bylo také zaznamenáno snížení halucinací<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-mcot_zhang_2023-4)</sup>.

### Kompoziční CoT (Compositional CoT)

Představená na konferenci CVPR 2024, tato metoda se zaměřuje na vizuálně-textové úlohy a navrhuje generovat strukturovanou reprezentaci obrázku jako mezikrok<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-compositional_cot_mitra_2024-5)</sup>. Nejprve MLLM vytvoří popis scény ve formě scénového grafu, uvádějící objekty a vztahy mezi nimi. Poté je tento strukturovaný popis zahrnut do promptu pro finální odpověď. Tento přístup umožňuje LLM hlouběji zohledňovat kompoziční vazby mezi objekty a zlepšuje výsledky při popisu složitých scén a vizuální otázko-odpovědní analýze<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### CoT s rozdělením povinností (Duty-Distinct CoT)

Tato metoda, představená na NeurIPS 2023, navrhuje rozdělit odpovědnost mezi různé komponenty systému<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-ddcot_zheng_2023-6)</sup>:

- **Jazykový model** zodpovídá za logické uvažování a integraci informací.
- **Vizuální subsystém** (model počítačového vidění) zodpovídá za rozpoznávání obsahu obrázku.

Takovýto „binární prompting" zajišťuje „kritické myšlení": LLM vyhodnocuje a využívá vizuální informace získané od specializovaného zrakového modulu. Přístup DDCoT umožnil generovat obecnější a vysvětlitelnější uvažování a výrazně zvýšil přesnost při multimodálních vědeckých QA úlohách<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-ddcot_zheng_2023-6)</sup>.

### Další varianty MCoT

Aktivně se rozvíjejí i další přístupy přizpůsobené konkrétním modalitám:

- **Dual CoT**: Schéma paralelního obousměrného uvažování.
- **Audio-CoT**: Adaptace řetězce myšlenek pro úlohy spojené s audiem a řečí.
- **Video-of-Thought**: Technika postupné analýzy videodát<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-survey_wang_2025-1)</sup>.

## Využití a výsledky

Multimodální CoT prompting prokázal účinnost v mnoha oblastech, kde je vyžadováno kombinování různorodých informací.

- **Vzdělávání a vědecký QA**: Umožňuje systémům odpovídat na otázky s diagramy a ilustracemi a poskytovat podrobné vysvětlení řešení (například na datasetu ScienceQA)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-mcot_zhang_2023-4)</sup>.
- **Autonomní řízení a robotika**: Pomáhá postupně interpretovat data z lidarů, senzorů a kamer, čímž zlepšuje porozumění scéně a rozhodování agentů.
- **Embodied AI**: Zajišťuje spolehlivější plánování akcí pro systémy interagující s fyzickým světem na základě vizuálních a textových podnětů.
- **Medicína a zdravotnictví**: Kombinace lékařských snímků (například rentgenových) s textovými popisy zvyšuje přesnost diagnostiky a vysvětlitelnost závěrů AI<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-survey_wang_2025-1)</sup>.

## Problémy a perspektivy

Navzdory značnému pokroku zůstává multimodální využití CoT složitým výzkumným problémem.

- **Nedostatek anotovaných dat**: Trénování modelů ke generování správných multimodálních úvah vyžaduje rozsáhlé datové sady s podrobnými vysvětleními, jejichž získávání je pracné.
- **Flexibilita a zobecnitelnost**: Metody přizpůsobené jednomu typu úloh (například text + obrázek) se mohou špatně přenášet na jiné kombinace modalit.
- **Optimální integrace**: Zůstává otevřenou otázkou, jak nejlépe integrovat různé modality do jediného procesu uvažování tak, aby skutečně posiloval porozumění modelu, a ne jen prodlužoval odpověď.
- **Standardizace a hodnocení**: Existuje potřeba rozvoje standardizovaných benchmarků pro objektivní hodnocení a srovnání různých MCoT přístupů<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-ddcot_zheng_2023-6)</sup>.

Pro dosažení multimodální AI blízké obecným intelektuálním schopnostem jsou zapotřebí další inovace v metodách MCoT zohledňujících specifiku vnímání světa různými senzory<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_note-survey_wang_2025-1)</sup>.

## Odkazy

- Přehled Multimodal CoT v Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — podrobný vědecký přehled

## Literatura

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## Poznámky

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(CS)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
