Multimodal CoT Prompting (PT)
O prompting multimodal com cadeia de pensamento (Multimodal Chain-of-Thought Prompting, MCoT) é uma extensão do método de cadeia de pensamento (CoT) para tarefas que envolvem múltiplos tipos de dados (modalidades). Nos modelos MCoT, a linguagem e outras modalidades, como visão ou análise de dados tabulares, participam de um processo unificado de inferência passo a passo para resolver problemas complexos[1].
Essa abordagem surgiu com o desenvolvimento de modelos de linguagem grandes multimodais (MLLMs), capazes de processar simultaneamente texto, imagens, áudio e vídeo. O MCoT permite que os modelos gerem explicações interpretáveis e passo a passo que integram informações de diferentes fontes, aumentando a precisão e a transparência de seu funcionamento.
Contexto: do CoT textual ao multimodal
Cadeia de Pensamento (Chain-of-Thought) em texto
Inicialmente, o método Chain-of-Thought (CoT) foi proposto por pesquisadores do Google em 2022 para modelos de linguagem grandes (LLMs) textuais[2]. A ideia consiste em treinar o modelo para gerar uma sequência de passos de raciocínio intermediários antes de fornecer a resposta final. A adição de exemplos de solução passo a passo no prompt (few-shot prompting) melhorou notavelmente a capacidade dos LLMs de resolver problemas que exigem raciocínio aritmético, lógico e de senso comum, aumentando a precisão e a confiabilidade geral dos modelos[2].
Transição para a multimodalidade
O sucesso do CoT textual estimulou tentativas de estendê-lo para cenários multimodais. Com o surgimento de MLLMs, como o Kosmos-1 da Microsoft, que são treinados simultaneamente com texto e imagens, surgiu a oportunidade de integrar a lógica do CoT com a percepção multimodal[3]. Experimentos mostraram que tais modelos podem utilizar raciocínio passo a passo, considerando tanto entradas textuais quanto visuais, o que demonstrou a viabilidade fundamental de unir lógica e percepção[3].
Principais abordagens e metodologias
A partir de 2023, foram propostos vários métodos para implementar o CoT multimodal.
Multimodal-CoT de duas etapas (Zhang et al.)
Um dos primeiros métodos, proposto em 2023, utiliza um esquema de duas etapas[4]:
- Geração de justificativa: No primeiro passo, o modelo gera uma cadeia de pensamento textual (rationale) com base em informações multimodais (por exemplo, texto e imagem).
- Formulação da resposta: No segundo passo, o modelo fornece a resposta final, baseando-se na justificativa gerada.
Essa abordagem dividida permitiu que um modelo com menos de 1 bilhão de parâmetros alcançasse uma qualidade recorde no dataset científico ScienceQA, superando até mesmo o grande modelo GPT-3.5. Também foi observada uma redução nas alucinações[4].
CoT Composicional (Compositional CoT)
Apresentado na conferência CVPR 2024, este método foca em tarefas visuais e textuais e propõe a geração de uma representação estruturada da imagem como um passo intermediário[5]. Primeiro, o MLLM gera uma descrição da cena na forma de um grafo de cena, indicando objetos e as relações entre eles. Em seguida, essa descrição estruturada é incluída no prompt para a resposta final. Essa abordagem permite que o LLM considere mais profundamente as relações composicionais entre os objetos e melhora os resultados em tarefas de descrição de cenas complexas e análise de perguntas e respostas visuais[5].
CoT com separação de responsabilidades (Duty-Distinct CoT)
Este método, apresentado na NeurIPS 2023, propõe dividir a responsabilidade entre diferentes componentes do sistema[6]:
- O modelo de linguagem é responsável pelo raciocínio lógico e pela integração das informações.
- O subsistema visual (modelo de visão computacional) é responsável pelo reconhecimento do conteúdo da imagem.
Esse "prompting binário" proporciona "pensamento crítico": o LLM avalia e utiliza as informações visuais recebidas de um módulo visual especializado. A abordagem DDCoT permitiu gerar raciocínios mais gerais e explicáveis e aumentou significativamente a precisão em tarefas de QA científico multimodal[6].
Outras variantes de MCoT
Outras abordagens, adaptadas para modalidades específicas, também estão sendo desenvolvidas ativamente:
- Dual CoT: Um esquema de raciocínio paralelo bidirecional.
- Audio-CoT: Uma adaptação da cadeia de pensamento para tarefas relacionadas a áudio e fala.
- Video-of-Thought: Uma técnica para análise passo a passo de dados de vídeo[1].
Aplicações e resultados
O prompting multimodal com CoT demonstrou eficácia em diversas áreas que exigem a combinação de informações heterogêneas.
- Educação e QA científico: Permite que os sistemas respondam a perguntas com diagramas e ilustrações, fornecendo uma explicação detalhada da solução (por exemplo, no dataset ScienceQA)[4].
- Condução autônoma e robótica: Auxilia na interpretação sequencial de dados de LiDARs, sensores e câmeras, melhorando a compreensão da cena e a tomada de decisões por agentes.
- IA Incorporada (Embodied AI): Garante um planejamento de ações mais robusto para sistemas que interagem com o mundo físico, com base em dicas visuais e textuais.
- Medicina e saúde: A combinação de imagens médicas (como radiografias) com descrições textuais aumenta a precisão do diagnóstico e a explicabilidade das conclusões da IA[1].
Desafios e perspectivas
Apesar do progresso significativo, o uso multimodal do CoT continua sendo um problema de pesquisa complexo.
- Falta de dados rotulados: Para treinar modelos a gerar raciocínios multimodais corretos, são necessários grandes conjuntos de dados com explicações detalhadas, cuja obtenção é trabalhosa.
- Flexibilidade e generalização: Métodos ajustados para um tipo de tarefa (por exemplo, texto + imagem) podem não se transferir bem para outras combinações de modalidades.
- Integração ótima: Permanece uma questão em aberto como integrar da melhor forma as diferentes modalidades em um único processo de raciocínio, de modo que ele realmente aprimore a compreensão do modelo, em vez de apenas prolongar a resposta.
- Padronização e avaliação: Há uma necessidade de desenvolver benchmarks padronizados para a avaliação objetiva e comparação das diferentes abordagens de MCoT[6].
Para alcançar uma IA multimodal próxima das capacidades de inteligência geral, são necessárias mais inovações nos métodos de MCoT que considerem as especificidades da percepção do mundo por diferentes sensores[1].
Ligações externas
- Visão geral do Multimodal CoT no Prompting Guide
- "Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey" — uma revisão científica detalhada
Literatura
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Notas
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]