Multimodal CoT Prompting (FR)
Le prompting multimodal avec chaîne de pensée (Multimodal Chain-of-Thought Prompting, MCoT) est une extension de la méthode de la chaîne de pensée (CoT) à des tâches impliquant plusieurs types de données (modalités). Dans les modèles MCoT, le langage et d'autres modalités, comme la vision ou l'analyse de données tabulaires, participent à un processus unifié d'inférence étape par étape pour résoudre des problèmes complexes[1].
Cette approche a émergé avec le développement des grands modèles de langage multimodaux (MLLM), capables de traiter simultanément du texte, des images, de l'audio et de la vidéo. Le MCoT permet aux modèles de générer des explications interprétables et progressives qui combinent des informations de différentes sources, ce qui améliore la précision et la transparence de leur fonctionnement.
Prérequis : du CoT textuel au CoT multimodal
Chaîne de pensée (Chain-of-Thought) dans le texte
Initialement, la méthode Chain-of-Thought (CoT) a été proposée par des chercheurs de Google en 2022 pour les grands modèles de langage (LLM) textuels[2]. L'idée consiste à entraîner le modèle à générer une séquence d'étapes de raisonnement intermédiaires avant de fournir la réponse finale. L'ajout d'exemples de résolution pas à pas dans le prompt (few-shot prompting) a considérablement amélioré la capacité des LLM à résoudre des problèmes nécessitant un raisonnement arithmétique, logique et de bon sens, et a augmenté la précision et la fiabilité globales des modèles[2].
Transition vers la multimodalité
Le succès du CoT textuel a encouragé les tentatives d'étendre cette méthode à des scénarios multimodaux. Avec l'émergence des MLLM, tels que Kosmos-1 de Microsoft, qui sont entraînés simultanément sur du texte et des images, il est devenu possible d'intégrer la logique du CoT à la perception multimodale[3]. Les expériences ont montré que de tels modèles peuvent utiliser un raisonnement pas à pas en tenant compte à la fois des données textuelles et visuelles, démontrant ainsi la faisabilité de combiner la logique et la perception[3].
Approches et méthodologies principales
Depuis 2023, plusieurs méthodes ont été proposées pour mettre en œuvre le CoT multimodal.
Multimodal-CoT en deux étapes (Zhang et al.)
L'une des premières méthodes, proposée en 2023, utilise un schéma en deux étapes[4] :
- Génération de la justification : Dans un premier temps, le modèle génère une chaîne de pensée textuelle (rationale) basée sur des informations multimodales (par exemple, du texte et une image).
- Formation de la réponse : Dans un second temps, le modèle fournit la réponse finale en s'appuyant sur la justification générée.
Cette approche divisée a permis à un modèle de moins d'un milliard de paramètres d'atteindre une qualité record sur le jeu de données scientifique ScienceQA, surpassant même le grand modèle GPT-3.5. Une réduction des hallucinations a également été observée[4].
CoT compositionnel (Compositional CoT)
Présentée à la conférence CVPR 2024, cette méthode se concentre sur les tâches visuo-textuelles et propose de générer une représentation structurée de l'image comme étape intermédiaire[5]. D'abord, le MLLM génère une description de la scène sous forme de graphe de scène, en indiquant les objets et les relations entre eux. Ensuite, cette description structurée est incluse dans le prompt pour la réponse finale. Cette approche permet au LLM de mieux prendre en compte les liens compositionnels entre les objets et améliore les résultats dans les tâches de description de scènes complexes et d'analyse de questions-réponses visuelles[5].
CoT avec séparation des tâches (Duty-Distinct CoT)
Cette méthode, présentée à NeurIPS 2023, propose de répartir la responsabilité entre différents composants du système[6] :
- Le modèle de langage est responsable du raisonnement logique et de l'intégration des informations.
- Le sous-système visuel (modèle de vision par ordinateur) est responsable de la reconnaissance du contenu de l'image.
Ce « prompting binaire » assure une « pensée critique » : le LLM évalue et utilise les informations visuelles fournies par un module visuel spécialisé. L'approche DDCoT a permis de générer des raisonnements plus généraux et explicables et a considérablement augmenté la précision dans les tâches de QA scientifique multimodal[6].
Autres variantes du MCoT
D'autres approches, adaptées à des modalités spécifiques, sont activement développées :
- Dual CoT : Un schéma de raisonnement parallèle bidirectionnel.
- Audio-CoT : Une adaptation de la chaîne de pensée pour les tâches liées à l'audio et à la parole.
- Video-of-Thought : Une technique d'analyse pas à pas des données vidéo[1].
Applications et résultats
Le prompting CoT multimodal a démontré son efficacité dans de nombreux domaines où la combinaison d'informations hétérogènes est requise.
- Éducation et QA scientifique : Permet aux systèmes de répondre à des questions contenant des diagrammes et des illustrations, en fournissant une explication détaillée de la solution (par exemple, sur le jeu de données ScienceQA)[4].
- Conduite autonome et robotique : Aide à interpréter séquentiellement les données des lidars, capteurs et caméras, améliorant la compréhension de la scène et la prise de décision des agents.
- IA incarnée (Embodied AI) : Assure une planification d'actions plus fiable pour les systèmes interagissant avec le monde physique, sur la base d'indices visuels et textuels.
- Médecine et santé : La combinaison d'images médicales (par exemple, des radiographies) avec des descriptions textuelles améliore la précision du diagnostic et l'explicabilité des conclusions de l'IA[1].
Défis et perspectives
Malgré des progrès significatifs, l'utilisation multimodale du CoT reste un problème de recherche complexe.
- Manque de données annotées : L'entraînement des modèles à générer des raisonnements multimodaux corrects nécessite de grands ensembles de données avec des explications détaillées, dont la collecte est laborieuse.
- Flexibilité et généralisabilité : Les méthodes conçues pour un type de tâche (par exemple, texte + image) peuvent mal se transposer à d'autres combinaisons de modalités.
- Intégration optimale : La question reste ouverte de savoir comment intégrer au mieux les différentes modalités dans un processus de raisonnement unifié, de manière à ce qu'il renforce réellement la compréhension du modèle plutôt que de simplement allonger la réponse.
- Standardisation et évaluation : Il est nécessaire de développer des benchmarks standardisés pour une évaluation et une comparaison objectives des différentes approches MCoT[6].
Pour parvenir à une IA multimodale proche des capacités intellectuelles générales, des innovations supplémentaires sont nécessaires dans les méthodes MCoT, en tenant compte des spécificités de la perception du monde par différents capteurs[1].
Liens externes
- Présentation du Multimodal CoT dans le Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — une revue scientifique détaillée
Bibliographie
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Références
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]