---
title: "Multimodal CoT Prompting (PL)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Polish"
  - "Category:Prompt engineering"
revision_id: 4736
wiki_created_at: 2026-09-06T23:39:12Z
wiki_modified_at: 2026-09-06T23:39:12Z
downloaded_at: 2026-09-07T23:04:18Z
---

# Multimodal CoT Prompting (PL)

**Multimodalny prompting z łańcuchem rozumowania** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — rozszerzenie metody łańcucha rozumowania (CoT) na zadania obejmujące wiele typów danych (modalności). W modelach MCoT język i inne modalności, takie jak wzrok czy analiza danych tabelarycznych, uczestniczą w jednolitym procesie wnioskowania krok po kroku w celu rozwiązywania złożonych zadań<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-survey_wang_2025-1)</sup>.

Podejście to pojawiło się wraz z rozwojem multimodalnych dużych modeli językowych (MLLM), zdolnych do jednoczesnego przetwarzania tekstu, obrazów, dźwięku i wideo. MCoT pozwala modelom generować interpretowalnych, krok po kroku wyjaśnienia łączące informacje z różnych źródeł, co zwiększa dokładność i przejrzystość ich działania.

## Przesłanki: od tekstowego do multimodalnego CoT

### Chain-of-Thought w tekście

Pierwotnie metoda **Chain-of-Thought (CoT)** została zaproponowana przez badaczy Google w 2022 roku dla tekstowych dużych modeli językowych (LLM)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-cot_wei_2022-2)</sup>. Idea polega na tym, by nauczyć model generowania sekwencji pośrednich kroków rozumowania przed podaniem ostatecznej odpowiedzi. Dodanie do promptu przykładów rozwiązań krok po kroku (*few-shot prompting*) wyraźnie poprawiło zdolność LLM do rozwiązywania zadań wymagających rozumowania arytmetycznego, logicznego i zdroworozsądkowego, a także zwiększyło ogólną dokładność i niezawodność modeli<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-cot_wei_2022-2)</sup>.

### Przejście do multimodalności

Sukces tekstowego CoT pobudził próby rozszerzenia go na scenariusze multimodalne. Wraz z pojawieniem się MLLM, takich jak **Kosmos-1** od Microsoft, trenowanych jednocześnie na tekście i obrazach, pojawiła się możliwość integracji logiki CoT z multimodalnym postrzeganiem<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-kosmos1_huang_2023-3)</sup>. Eksperymenty wykazały, że takie modele mogą stosować rozumowanie krok po kroku, uwzględniając zarówno tekstowe, jak i wizualne dane wejściowe, co potwierdziło zasadniczą możliwość łączenia logiki i percepcji<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-kosmos1_huang_2023-3)</sup>.

## Główne podejścia i metodologie

Począwszy od 2023 roku zaproponowano szereg metod realizacji multimodalnego CoT.

### Dwuetapowy Multimodal-CoT (Zhang et al.)

Jedna z pierwszych metod, zaproponowana w 2023 roku, wykorzystuje dwuetapowy schemat<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Generowanie uzasadnienia**: W pierwszym kroku model generuje tekstowy łańcuch rozumowania (*rationale*) na podstawie informacji multimodalnych (np. tekstu i obrazu).
2.  **Formułowanie odpowiedzi**: W drugim kroku model podaje ostateczną odpowiedź, opierając się na wygenerowanym uzasadnieniu.

Takie rozdzielone podejście pozwoliło modelowi z mniej niż 1 mld parametrów osiągnąć rekordowo wysoką jakość na naukowym datasecie **ScienceQA**, przewyższając nawet duży model GPT-3.5. Odnotowano również redukcję halucynacji<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-mcot_zhang_2023-4)</sup>.

### Compositional CoT (Kompozycyjny CoT)

Zaprezentowana na konferencji CVPR 2024 metoda koncentruje się na zadaniach wizualno-tekstowych i proponuje generowanie strukturalnej reprezentacji obrazu jako kroku pośredniego<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-compositional_cot_mitra_2024-5)</sup>. Na początku MLLM tworzy opis sceny w postaci grafu sceny, wskazując obiekty i relacje między nimi. Następnie ten strukturalny opis jest włączany do promptu dla ostatecznej odpowiedzi. Takie podejście pozwala LLM głębiej uwzględniać kompozycyjne powiązania między obiektami i poprawia wyniki w zadaniach opisu złożonych scen oraz wizualnego pytania i odpowiedzi<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### CoT z podziałem obowiązków (Duty-Distinct CoT)

Ta metoda, zaprezentowana na NeurIPS 2023, proponuje podział odpowiedzialności między różne komponenty systemu<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-ddcot_zheng_2023-6)</sup>:

- **Model językowy** odpowiada za logiczne rozumowanie i integrację informacji.
- **Podsystem wizualny** (model widzenia komputerowego) odpowiada za rozpoznawanie zawartości obrazu.

Taki „binarny prompting" zapewnia „myślenie krytyczne": LLM ocenia i wykorzystuje informacje wizualne otrzymane od wyspecjalizowanego modułu wzrokowego. Podejście DDCoT pozwoliło generować bardziej ogólne i wyjaśnialne rozumowania oraz istotnie zwiększyło dokładność w zadaniach multimodalnego naukowego QA<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-ddcot_zheng_2023-6)</sup>.

### Inne warianty MCoT

Aktywnie rozwijane są też inne podejścia, dostosowane do konkretnych modalności:

- **Dual CoT**: Schemat równoległego dwukierunkowego rozumowania.
- **Audio-CoT**: Adaptacja łańcucha myśli do zadań związanych z dźwiękiem i mową.
- **Video-of-Thought**: Technika analizy danych wideo krok po kroku<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-survey_wang_2025-1)</sup>.

## Zastosowania i wyniki

Multimodalny prompting CoT wykazał skuteczność w wielu dziedzinach, gdzie wymagane jest łączenie różnorodnych informacji.

- **Edukacja i naukowe QA**: Umożliwia systemom odpowiadanie na pytania z diagramami i ilustracjami, dostarczając rozbudowane wyjaśnienie rozwiązania (np. na datasecie ScienceQA)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-mcot_zhang_2023-4)</sup>.
- **Autonomiczna jazda i robotyka**: Pomaga sekwencyjnie interpretować dane z lidarów, czujników i kamer, poprawiając rozumienie sceny i podejmowanie decyzji przez agentów.
- **Embodied AI**: Zapewnia bardziej niezawodne planowanie działań dla systemów wchodzących w interakcję z fizycznym światem, na podstawie wskazówek wizualnych i tekstowych.
- **Medycyna i opieka zdrowotna**: Połączenie obrazów medycznych (np. zdjęć rentgenowskich) z opisami tekstowymi zwiększa dokładność diagnostyki i wyjaśnialność wniosków AI<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-survey_wang_2025-1)</sup>.

## Problemy i perspektywy

Pomimo znaczącego postępu, multimodalne zastosowanie CoT pozostaje złożonym problemem badawczym.

- **Niedobór danych z adnotacjami**: Trenowanie modeli do generowania poprawnych multimodalnych rozumowań wymaga dużych zbiorów danych ze szczegółowymi wyjaśnieniami, których pozyskanie jest pracochłonne.
- **Elastyczność i uogólnialność**: Metody dostosowane do jednego typu zadań (np. tekst + obraz) mogą słabo przenosić się na inne kombinacje modalności.
- **Optymalna integracja**: Pozostaje otwarta kwestia, jak najlepiej integrować różne modalności w jeden proces rozumowania, aby naprawdę wzmacniał on rozumienie modelu, a nie jedynie wydłużał odpowiedź.
- **Standaryzacja i ewaluacja**: Istnieje potrzeba opracowania standaryzowanych benchmarków do obiektywnej oceny i porównywania różnych podejść MCoT<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-ddcot_zheng_2023-6)</sup>.

Osiągnięcie multimodalnej AI zbliżonej do ogólnych możliwości intelektualnych wymaga dalszych innowacji w metodach MCoT uwzględniających specyfikę postrzegania świata przez różne sensory<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_note-survey_wang_2025-1)</sup>.

## Odnośniki

- Przegląd Multimodal CoT w Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — szczegółowy naukowy przegląd

## Literatura

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## Przypisy

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PL)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
