Multimodal CoT Prompting (PT)

From Systems analysis Wiki
Jump to navigation Jump to search

O prompting multimodal com cadeia de pensamento (Multimodal Chain-of-Thought Prompting, MCoT) é uma extensão do método de cadeia de pensamento (CoT) para tarefas que envolvem múltiplos tipos de dados (modalidades). Nos modelos MCoT, a linguagem e outras modalidades, como visão ou análise de dados tabulares, participam de um processo unificado de inferência passo a passo para resolver problemas complexos[1].

Essa abordagem surgiu com o desenvolvimento de modelos de linguagem grandes multimodais (MLLMs), capazes de processar simultaneamente texto, imagens, áudio e vídeo. O MCoT permite que os modelos gerem explicações interpretáveis e passo a passo que integram informações de diferentes fontes, aumentando a precisão e a transparência de seu funcionamento.

Contexto: do CoT textual ao multimodal

Cadeia de Pensamento (Chain-of-Thought) em texto

Inicialmente, o método Chain-of-Thought (CoT) foi proposto por pesquisadores do Google em 2022 para modelos de linguagem grandes (LLMs) textuais[2]. A ideia consiste em treinar o modelo para gerar uma sequência de passos de raciocínio intermediários antes de fornecer a resposta final. A adição de exemplos de solução passo a passo no prompt (few-shot prompting) melhorou notavelmente a capacidade dos LLMs de resolver problemas que exigem raciocínio aritmético, lógico e de senso comum, aumentando a precisão e a confiabilidade geral dos modelos[2].

Transição para a multimodalidade

O sucesso do CoT textual estimulou tentativas de estendê-lo para cenários multimodais. Com o surgimento de MLLMs, como o Kosmos-1 da Microsoft, que são treinados simultaneamente com texto e imagens, surgiu a oportunidade de integrar a lógica do CoT com a percepção multimodal[3]. Experimentos mostraram que tais modelos podem utilizar raciocínio passo a passo, considerando tanto entradas textuais quanto visuais, o que demonstrou a viabilidade fundamental de unir lógica e percepção[3].

Principais abordagens e metodologias

A partir de 2023, foram propostos vários métodos para implementar o CoT multimodal.

Multimodal-CoT de duas etapas (Zhang et al.)

Um dos primeiros métodos, proposto em 2023, utiliza um esquema de duas etapas[4]:

  1. Geração de justificativa: No primeiro passo, o modelo gera uma cadeia de pensamento textual (rationale) com base em informações multimodais (por exemplo, texto e imagem).
  2. Formulação da resposta: No segundo passo, o modelo fornece a resposta final, baseando-se na justificativa gerada.

Essa abordagem dividida permitiu que um modelo com menos de 1 bilhão de parâmetros alcançasse uma qualidade recorde no dataset científico ScienceQA, superando até mesmo o grande modelo GPT-3.5. Também foi observada uma redução nas alucinações[4].

CoT Composicional (Compositional CoT)

Apresentado na conferência CVPR 2024, este método foca em tarefas visuais e textuais e propõe a geração de uma representação estruturada da imagem como um passo intermediário[5]. Primeiro, o MLLM gera uma descrição da cena na forma de um grafo de cena, indicando objetos e as relações entre eles. Em seguida, essa descrição estruturada é incluída no prompt para a resposta final. Essa abordagem permite que o LLM considere mais profundamente as relações composicionais entre os objetos e melhora os resultados em tarefas de descrição de cenas complexas e análise de perguntas e respostas visuais[5].

CoT com separação de responsabilidades (Duty-Distinct CoT)

Este método, apresentado na NeurIPS 2023, propõe dividir a responsabilidade entre diferentes componentes do sistema[6]:

  • O modelo de linguagem é responsável pelo raciocínio lógico e pela integração das informações.
  • O subsistema visual (modelo de visão computacional) é responsável pelo reconhecimento do conteúdo da imagem.

Esse "prompting binário" proporciona "pensamento crítico": o LLM avalia e utiliza as informações visuais recebidas de um módulo visual especializado. A abordagem DDCoT permitiu gerar raciocínios mais gerais e explicáveis e aumentou significativamente a precisão em tarefas de QA científico multimodal[6].

Outras variantes de MCoT

Outras abordagens, adaptadas para modalidades específicas, também estão sendo desenvolvidas ativamente:

  • Dual CoT: Um esquema de raciocínio paralelo bidirecional.
  • Audio-CoT: Uma adaptação da cadeia de pensamento para tarefas relacionadas a áudio e fala.
  • Video-of-Thought: Uma técnica para análise passo a passo de dados de vídeo[1].

Aplicações e resultados

O prompting multimodal com CoT demonstrou eficácia em diversas áreas que exigem a combinação de informações heterogêneas.

  • Educação e QA científico: Permite que os sistemas respondam a perguntas com diagramas e ilustrações, fornecendo uma explicação detalhada da solução (por exemplo, no dataset ScienceQA)[4].
  • Condução autônoma e robótica: Auxilia na interpretação sequencial de dados de LiDARs, sensores e câmeras, melhorando a compreensão da cena e a tomada de decisões por agentes.
  • IA Incorporada (Embodied AI): Garante um planejamento de ações mais robusto para sistemas que interagem com o mundo físico, com base em dicas visuais e textuais.
  • Medicina e saúde: A combinação de imagens médicas (como radiografias) com descrições textuais aumenta a precisão do diagnóstico e a explicabilidade das conclusões da IA[1].

Desafios e perspectivas

Apesar do progresso significativo, o uso multimodal do CoT continua sendo um problema de pesquisa complexo.

  • Falta de dados rotulados: Para treinar modelos a gerar raciocínios multimodais corretos, são necessários grandes conjuntos de dados com explicações detalhadas, cuja obtenção é trabalhosa.
  • Flexibilidade e generalização: Métodos ajustados para um tipo de tarefa (por exemplo, texto + imagem) podem não se transferir bem para outras combinações de modalidades.
  • Integração ótima: Permanece uma questão em aberto como integrar da melhor forma as diferentes modalidades em um único processo de raciocínio, de modo que ele realmente aprimore a compreensão do modelo, em vez de apenas prolongar a resposta.
  • Padronização e avaliação: Há uma necessidade de desenvolver benchmarks padronizados para a avaliação objetiva e comparação das diferentes abordagens de MCoT[6].

Para alcançar uma IA multimodal próxima das capacidades de inteligência geral, são necessárias mais inovações nos métodos de MCoT que considerem as especificidades da percepção do mundo por diferentes sensores[1].

Ligações externas

Literatura

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

Notas

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]