---
title: "Multimodal CoT Prompting (PT)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
  - "Category:Prompt engineering"
revision_id: 4737
wiki_created_at: 2026-09-06T23:39:13Z
wiki_modified_at: 2026-09-06T23:39:13Z
downloaded_at: 2026-09-07T23:04:18Z
---

# Multimodal CoT Prompting (PT)

O **prompting multimodal com cadeia de pensamento** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) é uma extensão do método de cadeia de pensamento (CoT) para tarefas que envolvem múltiplos tipos de dados (modalidades). Nos modelos MCoT, a linguagem e outras modalidades, como visão ou análise de dados tabulares, participam de um processo unificado de inferência passo a passo para resolver problemas complexos<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-survey_wang_2025-1)</sup>.

Essa abordagem surgiu com o desenvolvimento de modelos de linguagem grandes multimodais (MLLMs), capazes de processar simultaneamente texto, imagens, áudio e vídeo. O MCoT permite que os modelos gerem explicações interpretáveis e passo a passo que integram informações de diferentes fontes, aumentando a precisão e a transparência de seu funcionamento.

## Contexto: do CoT textual ao multimodal

### Cadeia de Pensamento (Chain-of-Thought) em texto

Inicialmente, o método **Chain-of-Thought (CoT)** foi proposto por pesquisadores do Google em 2022 para modelos de linguagem grandes (LLMs) textuais<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-cot_wei_2022-2)</sup>. A ideia consiste em treinar o modelo para gerar uma sequência de passos de raciocínio intermediários antes de fornecer a resposta final. A adição de exemplos de solução passo a passo no prompt (*few-shot prompting*) melhorou notavelmente a capacidade dos LLMs de resolver problemas que exigem raciocínio aritmético, lógico e de senso comum, aumentando a precisão e a confiabilidade geral dos modelos<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-cot_wei_2022-2)</sup>.

### Transição para a multimodalidade

O sucesso do CoT textual estimulou tentativas de estendê-lo para cenários multimodais. Com o surgimento de MLLMs, como o **Kosmos-1** da Microsoft, que são treinados simultaneamente com texto e imagens, surgiu a oportunidade de integrar a lógica do CoT com a percepção multimodal<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-kosmos1_huang_2023-3)</sup>. Experimentos mostraram que tais modelos podem utilizar raciocínio passo a passo, considerando tanto entradas textuais quanto visuais, o que demonstrou a viabilidade fundamental de unir lógica e percepção<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-kosmos1_huang_2023-3)</sup>.

## Principais abordagens e metodologias

A partir de 2023, foram propostos vários métodos para implementar o CoT multimodal.

### Multimodal-CoT de duas etapas (Zhang et al.)

Um dos primeiros métodos, proposto em 2023, utiliza um esquema de duas etapas<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Geração de justificativa**: No primeiro passo, o modelo gera uma cadeia de pensamento textual (*rationale*) com base em informações multimodais (por exemplo, texto e imagem).
2.  **Formulação da resposta**: No segundo passo, o modelo fornece a resposta final, baseando-se na justificativa gerada.

Essa abordagem dividida permitiu que um modelo com menos de 1 bilhão de parâmetros alcançasse uma qualidade recorde no dataset científico **ScienceQA**, superando até mesmo o grande modelo GPT-3.5. Também foi observada uma redução nas alucinações<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-mcot_zhang_2023-4)</sup>.

### CoT Composicional (Compositional CoT)

Apresentado na conferência CVPR 2024, este método foca em tarefas visuais e textuais e propõe a geração de uma representação estruturada da imagem como um passo intermediário<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-compositional_cot_mitra_2024-5)</sup>. Primeiro, o MLLM gera uma descrição da cena na forma de um grafo de cena, indicando objetos e as relações entre eles. Em seguida, essa descrição estruturada é incluída no prompt para a resposta final. Essa abordagem permite que o LLM considere mais profundamente as relações composicionais entre os objetos e melhora os resultados em tarefas de descrição de cenas complexas e análise de perguntas e respostas visuais<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### CoT com separação de responsabilidades (Duty-Distinct CoT)

Este método, apresentado na NeurIPS 2023, propõe dividir a responsabilidade entre diferentes componentes do sistema<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-ddcot_zheng_2023-6)</sup>:

- O **modelo de linguagem** é responsável pelo raciocínio lógico e pela integração das informações.
- O **subsistema visual** (modelo de visão computacional) é responsável pelo reconhecimento do conteúdo da imagem.

Esse "prompting binário" proporciona "pensamento crítico": o LLM avalia e utiliza as informações visuais recebidas de um módulo visual especializado. A abordagem DDCoT permitiu gerar raciocínios mais gerais e explicáveis e aumentou significativamente a precisão em tarefas de QA científico multimodal<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-ddcot_zheng_2023-6)</sup>.

### Outras variantes de MCoT

Outras abordagens, adaptadas para modalidades específicas, também estão sendo desenvolvidas ativamente:

- **Dual CoT**: Um esquema de raciocínio paralelo bidirecional.
- **Audio-CoT**: Uma adaptação da cadeia de pensamento para tarefas relacionadas a áudio e fala.
- **Video-of-Thought**: Uma técnica para análise passo a passo de dados de vídeo<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-survey_wang_2025-1)</sup>.

## Aplicações e resultados

O prompting multimodal com CoT demonstrou eficácia em diversas áreas que exigem a combinação de informações heterogêneas.

- **Educação e QA científico**: Permite que os sistemas respondam a perguntas com diagramas e ilustrações, fornecendo uma explicação detalhada da solução (por exemplo, no dataset ScienceQA)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-mcot_zhang_2023-4)</sup>.
- **Condução autônoma e robótica**: Auxilia na interpretação sequencial de dados de LiDARs, sensores e câmeras, melhorando a compreensão da cena e a tomada de decisões por agentes.
- **IA Incorporada (Embodied AI)**: Garante um planejamento de ações mais robusto para sistemas que interagem com o mundo físico, com base em dicas visuais e textuais.
- **Medicina e saúde**: A combinação de imagens médicas (como radiografias) com descrições textuais aumenta a precisão do diagnóstico e a explicabilidade das conclusões da IA<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-survey_wang_2025-1)</sup>.

## Desafios e perspectivas

Apesar do progresso significativo, o uso multimodal do CoT continua sendo um problema de pesquisa complexo.

- **Falta de dados rotulados**: Para treinar modelos a gerar raciocínios multimodais corretos, são necessários grandes conjuntos de dados com explicações detalhadas, cuja obtenção é trabalhosa.
- **Flexibilidade e generalização**: Métodos ajustados para um tipo de tarefa (por exemplo, texto + imagem) podem não se transferir bem para outras combinações de modalidades.
- **Integração ótima**: Permanece uma questão em aberto como integrar da melhor forma as diferentes modalidades em um único processo de raciocínio, de modo que ele realmente aprimore a compreensão do modelo, em vez de apenas prolongar a resposta.
- **Padronização e avaliação**: Há uma necessidade de desenvolver benchmarks padronizados para a avaliação objetiva e comparação das diferentes abordagens de MCoT<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-ddcot_zheng_2023-6)</sup>.

Para alcançar uma IA multimodal próxima das capacidades de inteligência geral, são necessárias mais inovações nos métodos de MCoT que considerem as especificidades da percepção do mundo por diferentes sensores<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_note-survey_wang_2025-1)</sup>.

## Ligações externas

- <a href="https://www.promptingguide.ai/techniques/multimodalcot" class="external text" rel="nofollow">Visão geral do Multimodal CoT no Prompting Guide</a>
- <a href="https://arxiv.org/abs/2503.12605" class="external text" rel="nofollow">"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey" — uma revisão científica detalhada</a>

## Literatura

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. <a href="https://openaccess.thecvf.com/content/CVPR2024/html/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.html" class="external text" rel="nofollow">PDF</a>.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. <a href="https://arxiv.org/abs/2310.16436" class="external text" rel="nofollow">arXiv:2310.16436</a>.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. <a href="https://arxiv.org/abs/2302.14045" class="external text" rel="nofollow">arXiv:2302.14045</a>.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. <a href="https://arxiv.org/abs/2503.12605" class="external text" rel="nofollow">arXiv:2503.12605</a>.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. <a href="https://arxiv.org/abs/2501.07246" class="external text" rel="nofollow">arXiv:2501.07246</a>.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. <a href="https://openreview.net/forum?id=0saecDOdh2" class="external text" rel="nofollow">OpenReview:0saecDOdh2</a>.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2506.21448" class="external text" rel="nofollow">arXiv:2506.21448</a>.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. <a href="https://zhangmeishan.github.io/Video-of-Thought.pdf" class="external text" rel="nofollow">PDF</a>.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. <a href="https://arxiv.org/abs/2505.18561" class="external text" rel="nofollow">arXiv:2505.18561</a>.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. <a href="https://arxiv.org/abs/2503.01298" class="external text" rel="nofollow">arXiv:2503.01298</a>.

## Notas

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(PT)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
