---
title: "Multimodal CoT Prompting"
source: "https://systems-analysis.info/wiki/Multimodal_CoT_Prompting"
wiki: "systems-analysis.info/wiki"
article: "Multimodal_CoT_Prompting"
language: "ru"
categories:
  - "Категория:Prompt инжиниринг"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 153
wiki_created_at: 2026-09-06T21:55:49Z
wiki_modified_at: 2026-09-06T21:55:49Z
downloaded_at: 2026-09-07T22:17:50Z
---

# Multimodal CoT Prompting

**Мультимодальный промптинг с цепочкой рассуждений** (**Multimodal [Chain-of-Thought Prompting](https://systems-analysis.info/wiki/Chain-of-Thought_Prompting "Chain-of-Thought Prompting")**, **MCoT**) — это расширение метода цепочки рассуждений (CoT) на задачи, включающие несколько типов данных (модальностей). В MCoT-моделях язык и другие модальности, такие как зрение или анализ табличных данных, участвуют в едином процессе пошагового вывода для решения сложных задач<sup>[\[1\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-survey_wang_2025-1)</sup>.

Этот подход возник с развитием мультимодальных больших языковых моделей (MLLM), способных одновременно обрабатывать текст, изображения, аудио и видео. MCoT позволяет моделям генерировать интерпретируемые, пошаговые объяснения, объединяющие информацию из разных источников, что повышает точность и прозрачность их работы.

## Предпосылки: от текстового к мультимодальному CoT

### Цепочка рассуждений (Chain-of-Thought) в тексте

Изначально метод **Chain-of-Thought (CoT)** был предложен исследователями Google в 2022 году для текстовых [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")<sup>[\[2\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-cot_wei_2022-2)</sup>. Идея заключается в том, чтобы обучить модель генерировать последовательность промежуточных шагов рассуждения перед выдачей окончательного ответа. Добавление в промпт примеров пошагового решения (*few-shot prompting*) заметно улучшило способность LLM решать задачи, требующие арифметических, логических и здравых рассуждений, и повысило общую точность и надёжность моделей<sup>[\[2\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-cot_wei_2022-2)</sup>.

### Переход к мультимодальности

Успех текстового CoT стимулировал попытки распространить его на мультимодальные сценарии. С появлением MLLM, таких как **Kosmos-1** от Microsoft, которые обучаются одновременно на тексте и изображениях, возникла возможность интегрировать CoT-логику с мультимодальным восприятием<sup>[\[3\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-kosmos1_huang_2023-3)</sup>. Эксперименты показали, что такие модели могут использовать пошаговые рассуждения, учитывая как текстовые, так и визуальные входные данные, что продемонстрировало принципиальную возможность объединения логики и восприятия<sup>[\[3\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-kosmos1_huang_2023-3)</sup>.

## Основные подходы и методологии

Начиная с 2023 года был предложен ряд методов для реализации мультимодального CoT.

### Двухэтапный Multimodal-CoT (Zhang et al.)

Один из первых методов, предложенный в 2023 году, использует двухэтапную схему<sup>[\[4\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Генерация обоснования**: На первом шаге модель генерирует текстовую цепочку рассуждений (*rationale*) на основе мультимодальной информации (например, текста и изображения).
2.  **Формирование ответа**: На втором шаге модель выдаёт окончательный ответ, опираясь на сгенерированное обоснование.

Такой разделённый подход позволил модели с менее чем 1 млрд параметров достичь рекордно высокого качества на научном датасете **ScienceQA**, превзойдя даже крупную модель GPT-3.5. Также было отмечено снижение галлюцинаций<sup>[\[4\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-mcot_zhang_2023-4)</sup>.

### Композиционный CoT (Compositional CoT)

Представленный на конференции CVPR 2024, этот метод фокусируется на визуально-текстовых задачах и предлагает генерировать структурированное представление изображения в качестве промежуточного шага<sup>[\[5\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-compositional_cot_mitra_2024-5)</sup>. Сначала MLLM порождает описание сцены в виде сценового графа, указывая объекты и отношения между ними. Затем это структурированное описание включается в промпт для финального ответа. Такой подход позволяет LLM глубже учитывать композиционные связи между объектами и улучшает результаты на задачах описания сложных сцен и визуального вопросно-ответного анализа<sup>[\[5\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-compositional_cot_mitra_2024-5)</sup>.

### CoT с разделением обязанностей (Duty-Distinct CoT)

Этот метод, представленный на NeurIPS 2023, предлагает разделить ответственность между разными компонентами системы<sup>[\[6\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-ddcot_zheng_2023-6)</sup>:

- **Языковая модель** отвечает за логическое рассуждение и интеграцию информации.
- **Визуальная подсистема** (модель компьютерного зрения) отвечает за распознавание содержимого изображения.

Такой «двоичный промптинг» обеспечивает «критическое мышление»: LLM оценивает и использует визуальную информацию, полученную от специализированного зрительного модуля. Подход DDCoT позволил генерировать более общие и объяснимые рассуждения и существенно повысил точность на задачах мультимодального научного QA<sup>[\[6\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-ddcot_zheng_2023-6)</sup>.

### Другие варианты MCoT

Активно разрабатываются и другие подходы, адаптированные под конкретные модальности:

- **Dual CoT**: Схема параллельного двунаправленного рассуждения.
- **Audio-CoT**: Адаптация цепочки мыслей для задач, связанных с аудио и речью.
- **Video-of-Thought**: Техника пошагового анализа видеоданных<sup>[\[1\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-survey_wang_2025-1)</sup>.

## Применение и результаты

Мультимодальный CoT-промптинг продемонстрировал эффективность во множестве областей, где требуется объединение разнородной информации.

- **Образование и научный QA**: Позволяет системам отвечать на вопросы с диаграммами и иллюстрациями, предоставляя развёрнутое объяснение решения (например, на датасете ScienceQA)<sup>[\[4\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-mcot_zhang_2023-4)</sup>.
- **Автономное вождение и робототехника**: Помогает интерпретировать данные с лидаров, сенсоров и камер последовательно, улучшая понимание сцены и принятие решений агентами.
- **Воплощённый ИИ (Embodied AI)**: Обеспечивает более надёжное планирование действий для систем, взаимодействующих с физическим миром, на основе визуальных и текстовых подсказок.
- **Медицина и здравоохранение**: Сочетание медицинских изображений (например, рентгеновских снимков) с текстовыми описаниями повышает точность диагностики и объяснимость выводов ИИ<sup>[\[1\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-survey_wang_2025-1)</sup>.

## Проблемы и перспективы

Несмотря на значительный прогресс, мультимодальное использование CoT остаётся сложной исследовательской проблемой.

- **Нехватка размеченных данных**: Для обучения моделей генерировать корректные [мультимодальные рассуждения](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5 "Мультимодальное рассуждение") требуются большие наборы данных с подробными пояснениями, получение которых трудоёмко.
- **Гибкость и обобщаемость**: Методы, настроенные на один тип задач (например, текст + изображение), могут плохо переноситься на другие сочетания модальностей.
- **Оптимальная интеграция**: Остаётся открытым вопрос, как наилучшим образом интегрировать разные модальности в единый процесс рассуждения, чтобы он действительно усиливал понимание модели, а не просто удлинял ответ.
- **Стандартизация и оценка**: Существует необходимость в разработке стандартизированных бенчмарков для объективной оценки и сравнения различных MCoT-подходов<sup>[\[6\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-ddcot_zheng_2023-6)</sup>.

Для достижения мультимодального ИИ, близкого к общеинтеллектуальным возможностям, требуются дальнейшие инновации в методах MCoT, учитывающих специфику восприятия мира различными сенсорами<sup>[\[1\]](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_note-survey_wang_2025-1)</sup>.

## См. также

- [Chain-of-Thought Prompting](https://systems-analysis.info/wiki/Chain-of-Thought_Prompting "Chain-of-Thought Prompting")
- [Generated Knowledge Prompting](https://systems-analysis.info/wiki/Generated_Knowledge_Prompting "Generated Knowledge Prompting")
- [Least-to-Most Prompting](https://systems-analysis.info/wiki/Least-to-Most_Prompting "Least-to-Most Prompting")
- [MM-RAG (Multimodal RAG)](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG) "MM-RAG (Multimodal RAG)")
- [Meta Prompting](https://systems-analysis.info/wiki/Meta_Prompting "Meta Prompting")

## Ссылки

- <a href="https://www.promptingguide.ai/techniques/multimodalcot" class="external text" rel="nofollow">Обзор Multimodal CoT в Prompting Guide</a>
- <a href="https://arxiv.org/abs/2503.12605" class="external text" rel="nofollow">«Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — детальный научный обзор</a>

## Литература

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. <a href="https://openaccess.thecvf.com/content/CVPR2024/html/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.html" class="external text" rel="nofollow">PDF</a>.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. <a href="https://arxiv.org/abs/2310.16436" class="external text" rel="nofollow">arXiv:2310.16436</a>.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. <a href="https://arxiv.org/abs/2302.14045" class="external text" rel="nofollow">arXiv:2302.14045</a>.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. <a href="https://arxiv.org/abs/2503.12605" class="external text" rel="nofollow">arXiv:2503.12605</a>.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. <a href="https://arxiv.org/abs/2501.07246" class="external text" rel="nofollow">arXiv:2501.07246</a>.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. <a href="https://openreview.net/forum?id=0saecDOdh2" class="external text" rel="nofollow">OpenReview:0saecDOdh2</a>.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2506.21448" class="external text" rel="nofollow">arXiv:2506.21448</a>.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. <a href="https://zhangmeishan.github.io/Video-of-Thought.pdf" class="external text" rel="nofollow">PDF</a>.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. <a href="https://arxiv.org/abs/2505.18561" class="external text" rel="nofollow">arXiv:2505.18561</a>.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. <a href="https://arxiv.org/abs/2503.01298" class="external text" rel="nofollow">arXiv:2503.01298</a>.

## Примечания

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4,2](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6,2](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
