---
title: "Multimodal CoT Prompting (HU)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 4731
wiki_created_at: 2026-09-06T23:39:08Z
wiki_modified_at: 2026-09-06T23:39:08Z
downloaded_at: 2026-09-07T23:04:16Z
---

# Multimodal CoT Prompting (HU)

**Multimodális gondolatmenetes prompting** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — a gondolatmenet-lánc (CoT) módszerének kiterjesztése olyan feladatokra, amelyek több adattípust (modalitást) foglalnak magukban. Az MCoT-modellekben a nyelv és más modalitások – például a látás vagy a táblázatos adatok elemzése – egyetlen, lépésenkénti következtetési folyamatban vesznek részt összetett feladatok megoldása érdekében<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-survey_wang_2025-1)</sup>.

Ez a megközelítés a multimodális nagy nyelvi modellek (MLLM) fejlődésével jelent meg, amelyek képesek egyszerre feldolgozni szöveget, képeket, hangot és videót. Az MCoT lehetővé teszi a modellek számára, hogy értelmezhető, lépésenkénti magyarázatokat generáljanak, amelyek különböző forrásokból származó információkat ötvöznek, ezáltal növelve a pontosságot és a működés átláthatóságát.

## A szöveges CoT-tól a multimodális CoT-ig: előzmények

### Chain-of-Thought szövegben

A **Chain-of-Thought (CoT)** módszert kezdetben a Google kutatói javasolták 2022-ben szöveges nagy nyelvi modellek (LLM) számára<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-cot_wei_2022-2)</sup>. Az alapelv az, hogy a modellt arra tanítják, hogy a végső válasz kiadása előtt közbenső következtetési lépések sorozatát generálja. A lépésenkénti megoldási példák hozzáadása a prompthoz (*few-shot prompting*) jelentősen javította az LLM-ek képességét aritmetikai, logikai és józan ésszerűséget igénylő feladatok megoldásában, és növelte a modellek általános pontosságát és megbízhatóságát<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-cot_wei_2022-2)</sup>.

### Átmenet a multimodalitás felé

A szöveges CoT sikere ösztönözte a módszer multimodális forgatókönyvekre való kiterjesztésére irányuló kísérleteket. A Microsoft **Kosmos-1** nevű MLLM-jének megjelenésével – amely egyszerre szövegen és képeken tanul – lehetővé vált a CoT-logika integrálása a multimodális percepcióval<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-kosmos1_huang_2023-3)</sup>. A kísérletek megmutatták, hogy az ilyen modellek képesek lépésenkénti következtetéseket alkalmazni szöveges és vizuális bemenetek figyelembevételével egyaránt, ami bizonyította a logika és a percepció ötvözésének elvi lehetőségét<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-kosmos1_huang_2023-3)</sup>.

## Főbb megközelítések és módszertanok

2023-tól kezdve számos módszert javasoltak a multimodális CoT megvalósítására.

### Kétlépéses Multimodal-CoT (Zhang et al.)

Az egyik első, 2023-ban javasolt módszer kétlépéses sémát alkalmaz<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Indoklás generálása**: Az első lépésben a modell szöveges gondolatmenet-láncot (*rationale*) generál multimodális információk (például szöveg és kép) alapján.
2.  **Válasz kialakítása**: A második lépésben a modell a generált indoklásra támaszkodva adja ki a végső választ.

Ez az elkülönített megközelítés lehetővé tette, hogy egy 1 milliárd paraméternél kisebb modell rekordmagas teljesítményt érjen el a **ScienceQA** tudományos dataseten, még a nagyméretű GPT-3.5 modellt is felülmúlva. Emellett a hallucinációk csökkenését is megfigyelték<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-mcot_zhang_2023-4)</sup>.

### Compositional CoT - Kompozicionális CoT

A CVPR 2024 konferencián bemutatott módszer vizuális-szöveges feladatokra összpontosít, és közbenső lépésként a kép strukturált reprezentációjának generálását javasolja<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-compositional_cot_mitra_2024-5)</sup>. Először az MLLM jelenetleírást generál jelenetgráf formájában, feltüntetve az objektumokat és a köztük lévő relációkat. Ezt követően ez a strukturált leírás bekerül a végső válaszhoz használt promptba. Ez a megközelítés lehetővé teszi az LLM számára, hogy mélyebben figyelembe vegye az objektumok közötti kompozicionális kapcsolatokat, és javítja az összetett jelenetek leírásával és vizuális kérdés-válasz elemzéssel kapcsolatos feladatok eredményeit<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### Duty-Distinct CoT - Feladatmegosztásos CoT

A NeurIPS 2023 konferencián bemutatott módszer a felelősség megosztását javasolja a rendszer különböző komponensei között<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-ddcot_zheng_2023-6)</sup>:

- **A nyelvi modell** felelős a logikai következtetésért és az információ integrálásáért.
- **A vizuális alrendszer** (számítógépes látás modell) felelős a képtartalom felismeréséért.

Ez a „bináris prompting" „kritikus gondolkodást" biztosít: az LLM értékeli és felhasználja a specializált vizuális modulból érkező képi információkat. A DDCoT megközelítés általánosabb és magyarázhatóbb következtetések generálását tette lehetővé, és jelentősen növelte a pontosságot multimodális tudományos QA feladatokon<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-ddcot_zheng_2023-6)</sup>.

### Az MCoT egyéb változatai

Intenzíven fejlesztenek más, adott modalitásokhoz igazított megközelítéseket is:

- **Dual CoT**: Párhuzamos, kétirányú következtetési séma.
- **Audio-CoT**: A gondolatmenet-lánc adaptációja hang- és beszédfelismerési feladatokhoz.
- **Video-of-Thought**: Videóadatok lépésenkénti elemzésének technikája<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-survey_wang_2025-1)</sup>.

## Alkalmazások és eredmények

A multimodális CoT-prompting számos területen bizonyította hatékonyságát, ahol különböző típusú információk ötvözése szükséges.

- **Oktatás és tudományos QA**: Lehetővé teszi a rendszerek számára, hogy diagramokat és illusztrációkat tartalmazó kérdésekre válaszoljanak, részletes megoldásmagyarázatot nyújtva (például a ScienceQA dataseten)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-mcot_zhang_2023-4)</sup>.
- **Autonóm vezetés és robotika**: Segít a lidar-, szenzor- és kameraadatok szekvenciális értelmezésében, javítva a jelenetmegértést és az ágensek döntéshozatalát.
- **Embodied AI**: Megbízhatóbb cselekvéstervezést biztosít a fizikai világgal interakcióba lépő rendszerek számára vizuális és szöveges jelzések alapján.
- **Orvostudomány és egészségügy**: Az orvosi képek (például röntgenfelvételek) és szöveges leírások ötvözése növeli a diagnosztika pontosságát és az AI következtetéseinek magyarázhatóságát<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-survey_wang_2025-1)</sup>.

## Kihívások és kilátások

A jelentős előrelépés ellenére a CoT multimodális alkalmazása összetett kutatási problémát jelent.

- **Annotált adatok hiánya**: A modellek helyes multimodális következtetések generálására való betanításához nagy, részletes magyarázatokat tartalmazó adathalmazok szükségesek, amelyek előállítása munkaigényes.
- **Rugalmasság és általánosíthatóság**: Az egyik feladattípusra (például szöveg + kép) hangolt módszerek esetleg rosszul vihetők át más modalitáskombinációkra.
- **Optimális integráció**: Nyitott kérdés marad, hogyan lehet a legjobban integrálni a különböző modalitásokat egyetlen következtetési folyamatba úgy, hogy az valóban erősítse a modell megértését, ne csupán meghosszabbítsa a választ.
- **Szabványosítás és értékelés**: Szükség van szabványosított benchmarkok kidolgozására a különböző MCoT-megközelítések objektív értékeléséhez és összehasonlításához<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-ddcot_zheng_2023-6)</sup>.

Az általános intelligencia szintjéhez közelítő multimodális AI eléréséhez további innovációk szükségesek az MCoT módszerekben, amelyek figyelembe veszik a világ különböző érzékelőkkel való percepcióját<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_note-survey_wang_2025-1)</sup>.

## Hivatkozások

- A Multimodal CoT áttekintése a Prompting Guide-ban
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — részletes tudományos áttekintés

## Irodalom

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## Jegyzetek

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HU)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
