---
title: "Multimodal CoT Prompting (BG)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 4721
wiki_created_at: 2026-09-06T23:38:58Z
wiki_modified_at: 2026-09-06T23:38:58Z
downloaded_at: 2026-09-07T23:04:13Z
---

# Multimodal CoT Prompting (BG)

**Мултимодален промптинг с верига от разсъждения** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — това е разширение на метода верига от разсъждения (CoT) към задачи, включващи няколко типа данни (модалности). В MCoT-моделите езикът и другите модалности, като зрение или анализ на таблични данни, участват в единен процес на стъпково извеждане за решаване на сложни задачи<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-survey_wang_2025-1)</sup>.

Този подход възникна с развитието на мултимодалните големи езикови модели (MLLM), способни едновременно да обработват текст, изображения, аудио и видео. MCoT позволява на моделите да генерират интерпретируеми, стъпкови обяснения, обединяващи информация от различни източници, което повишава точността и прозрачността на тяхната работа.

## Предпоставки: от текстов към мултимодален CoT

### Chain-of-Thought - Верига от разсъждения в текст

Първоначално методът **Chain-of-Thought (CoT)** беше предложен от изследователи на Google през 2022 година за текстови големи езикови модели (LLM)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-cot_wei_2022-2)</sup>. Идеята се състои в това да се обучи моделът да генерира последователност от междинни стъпки на разсъждение преди да даде окончателен отговор. Добавянето в промпта на примери за стъпково решение (*few-shot prompting*) значително подобри способността на LLM да решават задачи, изискващи аритметични, логически и здравословни разсъждения, и повиши общата точност и надеждност на моделите<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-cot_wei_2022-2)</sup>.

### Преход към мултимодалност

Успехът на текстовия CoT стимулира опити да се разпростре върху мултимодални сценарии. С появата на MLLM, като **Kosmos-1** от Microsoft, които се обучават едновременно върху текст и изображения, възникна възможността да се интегрира CoT-логиката с мултимодалното възприятие<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-kosmos1_huang_2023-3)</sup>. Експериментите показаха, че такива модели могат да използват стъпкови разсъждения, отчитайки както текстови, така и визуални входни данни, което демонстрира принципната възможност за обединяване на логика и възприятие<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-kosmos1_huang_2023-3)</sup>.

## Основни подходи и методологии

От 2023 година насам бяха предложени редица методи за реализация на мултимодален CoT.

### Двуетапен Multimodal-CoT (Zhang et al.)

Един от първите методи, предложен през 2023 година, използва двуетапна схема<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Генериране на обосновка**: На първата стъпка моделът генерира текстова верига от разсъждения (*rationale*) въз основа на мултимодална информация (например текст и изображение).
2.  **Формиране на отговор**: На втората стъпка моделът дава окончателен отговор, опирайки се на генерираната обосновка.

Такъв разделен подход позволи на модел с по-малко от 1 млрд. параметра да постигне рекордно високо качество върху научния dataset **ScienceQA**, надминавайки дори големия модел GPT-3.5. Отбелязано беше и намаляване на халюцинациите<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-mcot_zhang_2023-4)</sup>.

### Compositional CoT - Композиционен CoT

Представен на конференцията CVPR 2024, този метод се фокусира върху визуално-текстови задачи и предлага генериране на структурирано представяне на изображението като междинна стъпка<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-compositional_cot_mitra_2024-5)</sup>. Напред MLLM създава описание на сцената под формата на сценен граф, указвайки обектите и отношенията между тях. След това това структурирано описание се включва в промпта за финалния отговор. Такъв подход позволява на LLM по-задълбочено да отчита композиционните връзки между обектите и подобрява резултатите при задачи за описание на сложни сцени и визуален въпросно-отговорен анализ<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### Duty-Distinct CoT - CoT с разделяне на отговорностите

Този метод, представен на NeurIPS 2023, предлага да се раздели отговорността между различни компоненти на системата<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-ddcot_zheng_2023-6)</sup>:

- **Езиковият модел** отговаря за логическото разсъждение и интеграцията на информацията.
- **Визуалната подсистема** (модел за компютърно зрение) отговаря за разпознаването на съдържанието на изображението.

Такъв „двоичен промптинг" осигурява „критично мислене": LLM оценява и използва визуалната информация, получена от специализирания зрителен модул. Подходът DDCoT позволи генерирането на по-общи и обясними разсъждения и съществено повиши точността при задачи за мултимодален научен QA<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-ddcot_zheng_2023-6)</sup>.

### Други варианти на MCoT

Активно се разработват и други подходи, адаптирани към конкретни модалности:

- **Dual CoT**: Схема на паралелно двупосочно разсъждение.
- **Audio-CoT**: Адаптация на веригата от мисли за задачи, свързани с аудио и реч.
- **Video-of-Thought**: Техника за стъпков анализ на видеоданни<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-survey_wang_2025-1)</sup>.

## Приложение и резултати

Мултимодалният CoT-промптинг демонстрира ефективност в множество области, където се изисква обединяване на разнородна информация.

- **Образование и научен QA**: Позволява на системите да отговарят на въпроси с диаграми и илюстрации, предоставяйки разгърнато обяснение на решението (например върху dataset-а ScienceQA)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-mcot_zhang_2023-4)</sup>.
- **Автономно шофиране и роботика**: Помага за последователното интерпретиране на данни от лидари, сензори и камери, подобрявайки разбирането на сцената и вземането на решения от агентите.
- **Embodied AI**: Осигурява по-надеждно планиране на действията за системи, взаимодействащи с физическия свят, въз основа на визуални и текстови подсказки.
- **Медицина и здравеопазване**: Съчетаването на медицински изображения (например рентгенови снимки) с текстови описания повишава точността на диагностиката и обяснимостта на изводите на ИИ<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-survey_wang_2025-1)</sup>.

## Проблеми и перспективи

Въпреки значителния напредък, мултимодалното използване на CoT остава сложен изследователски проблем.

- **Недостиг на анотирани данни**: За обучението на модели да генерират коректни мултимодални разсъждения са необходими големи набори от данни с подробни пояснения, чието получаване е трудоемко.
- **Гъвкавост и обобщаемост**: Методи, настроени за един тип задачи (например текст + изображение), могат да се пренасят лошо към други комбинации от модалности.
- **Оптимална интеграция**: Остава открит въпросът как най-добре да се интегрират различните модалности в единен процес на разсъждение, така че той действително да усилва разбирането на модела, а не просто да удължава отговора.
- **Стандартизация и оценка**: Съществува необходимост от разработване на стандартизирани benchmark-и за обективна оценка и сравнение на различните MCoT-подходи<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-ddcot_zheng_2023-6)</sup>.

За постигането на мултимодален ИИ, близък до общоинтелектуалните възможности, са необходими допълнителни иновации в методите MCoT, отчитащи спецификата на възприятието на света чрез различни сензори<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_note-survey_wang_2025-1)</sup>.

## Препратки

- Преглед на Multimodal CoT в Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — подробен научен преглед

## Литература

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## Бележки

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BG)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
