---
title: "Multimodal CoT Prompting (HI)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 4730
wiki_created_at: 2026-09-06T23:39:07Z
wiki_modified_at: 2026-09-06T23:39:07Z
downloaded_at: 2026-09-07T23:04:16Z
---

# Multimodal CoT Prompting (HI)

**मल्टीमोडल चेन-ऑफ-थॉट प्रॉम्प्टिंग** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — यह चेन-ऑफ-थॉट (CoT) विधि का विस्तार है, जो कई प्रकार के डेटा (मोडैलिटी) को शामिल करने वाले कार्यों पर लागू होता है। MCoT मॉडलों में भाषा और अन्य मोडैलिटी, जैसे कि दृष्टि या सारणीबद्ध डेटा का विश्लेषण, एकल चरण-दर-चरण निष्कर्ष प्रक्रिया में जटिल कार्यों को हल करने के लिए भाग लेते हैं<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-survey_wang_2025-1)</sup>।

यह दृष्टिकोण मल्टीमोडल बड़े भाषा मॉडलों (MLLM) के विकास के साथ उभरा, जो एक साथ पाठ, चित्र, ऑडियो और वीडियो को संसाधित करने में सक्षम हैं। MCoT मॉडलों को व्याख्यायोग्य, चरण-दर-चरण स्पष्टीकरण उत्पन्न करने की अनुमति देता है जो विभिन्न स्रोतों से जानकारी को एकीकृत करते हैं, जिससे उनकी सटीकता और पारदर्शिता बढ़ती है।

## पूर्वापेक्षाएँ: पाठ्य से मल्टीमोडल CoT तक

### Chain-of-Thought - पाठ में चेन-ऑफ-थॉट

मूल रूप से **Chain-of-Thought (CoT)** विधि 2022 में Google के शोधकर्ताओं द्वारा पाठ्य बड़े भाषा मॉडलों (LLM) के लिए प्रस्तावित की गई थी<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-cot_wei_2022-2)</sup>। विचार यह है कि मॉडल को अंतिम उत्तर देने से पहले मध्यवर्ती तर्क चरणों का एक क्रम उत्पन्न करने के लिए प्रशिक्षित किया जाए। prompt में चरण-दर-चरण समाधान के उदाहरण जोड़ना (*few-shot prompting*) ने LLM की अंकगणितीय, तार्किक और सामान्य बुद्धि वाले कार्यों को हल करने की क्षमता में उल्लेखनीय सुधार किया और मॉडलों की समग्र सटीकता और विश्वसनीयता को बढ़ाया<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-cot_wei_2022-2)</sup>।

### मल्टीमोडैलिटी की ओर संक्रमण

पाठ्य CoT की सफलता ने इसे मल्टीमोडल परिदृश्यों तक विस्तारित करने के प्रयासों को प्रोत्साहित किया। Microsoft के **Kosmos-1** जैसे MLLM के आगमन के साथ, जो एक साथ पाठ और चित्रों पर प्रशिक्षित होते हैं, CoT तर्क को मल्टीमोडल धारणा के साथ एकीकृत करने की संभावना उत्पन्न हुई<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-kosmos1_huang_2023-3)</sup>। प्रयोगों से पता चला कि ऐसे मॉडल पाठ्य और दृश्य दोनों इनपुट को ध्यान में रखते हुए चरण-दर-चरण तर्क का उपयोग कर सकते हैं, जिसने तर्क और धारणा के संयोजन की मूलभूत संभावना को प्रदर्शित किया<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-kosmos1_huang_2023-3)</sup>।

## मुख्य दृष्टिकोण और पद्धतियाँ

2023 से मल्टीमोडल CoT को लागू करने के लिए कई विधियाँ प्रस्तावित की गई हैं।

### Dual-Stage Multimodal-CoT - द्वि-चरणीय मल्टीमोडल-CoT (Zhang et al.)

2023 में प्रस्तावित पहली विधियों में से एक द्वि-चरणीय योजना का उपयोग करती है<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **औचित्य उत्पादन**: पहले चरण में मॉडल मल्टीमोडल जानकारी (जैसे पाठ और चित्र) के आधार पर एक पाठ्य तर्क श्रृंखला (*rationale*) उत्पन्न करता है।
2.  **उत्तर निर्माण**: दूसरे चरण में मॉडल उत्पन्न औचित्य पर आधारित होकर अंतिम उत्तर देता है।

इस विभाजित दृष्टिकोण ने 1 अरब से कम parameters वाले मॉडल को वैज्ञानिक dataset **ScienceQA** पर रिकॉर्ड-उच्च गुणवत्ता प्राप्त करने की अनुमति दी, यहाँ तक कि बड़े मॉडल GPT-3.5 को भी पीछे छोड़ दिया। हैलुसिनेशन में कमी भी देखी गई<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-mcot_zhang_2023-4)</sup>।

### Compositional CoT - संयोजनात्मक CoT

CVPR 2024 सम्मेलन में प्रस्तुत, यह विधि दृश्य-पाठ्य कार्यों पर केंद्रित है और एक मध्यवर्ती चरण के रूप में चित्र का संरचित प्रतिनिधित्व उत्पन्न करने का प्रस्ताव करती है<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-compositional_cot_mitra_2024-5)</sup>। पहले MLLM दृश्य ग्राफ के रूप में एक दृश्य विवरण उत्पन्न करता है, जिसमें वस्तुएँ और उनके बीच के संबंध दर्शाए जाते हैं। फिर यह संरचित विवरण अंतिम उत्तर के लिए prompt में शामिल किया जाता है। यह दृष्टिकोण LLM को वस्तुओं के बीच संयोजनात्मक संबंधों को अधिक गहराई से ध्यान में रखने की अनुमति देता है और जटिल दृश्यों के विवरण तथा दृश्य प्रश्न-उत्तर विश्लेषण के कार्यों पर परिणामों में सुधार करता है<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-compositional_cot_mitra_2024-5)</sup>।

### Duty-Distinct CoT - कर्तव्य-विभाजित CoT

NeurIPS 2023 में प्रस्तुत यह विधि सिस्टम के विभिन्न घटकों के बीच जिम्मेदारी विभाजित करने का प्रस्ताव करती है<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-ddcot_zheng_2023-6)</sup>:

- **भाषा मॉडल** तार्किक तर्क और जानकारी के एकीकरण के लिए जिम्मेदार है।
- **दृश्य उपप्रणाली** (कंप्यूटर विज़न मॉडल) चित्र की सामग्री की पहचान के लिए जिम्मेदार है।

यह "द्विआधारी prompting" "आलोचनात्मक सोच" प्रदान करती है: LLM विशेष दृश्य मॉड्यूल से प्राप्त दृश्य जानकारी का मूल्यांकन और उपयोग करता है। DDCoT दृष्टिकोण ने अधिक सामान्य और व्याख्यायोग्य तर्क उत्पन्न करने और मल्टीमोडल वैज्ञानिक QA कार्यों पर सटीकता में महत्वपूर्ण सुधार करने की अनुमति दी<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-ddcot_zheng_2023-6)</sup>।

### अन्य MCoT विकल्प

विशिष्ट मोडैलिटी के अनुकूल अन्य दृष्टिकोण भी सक्रिय रूप से विकसित किए जा रहे हैं:

- **Dual CoT**: समानांतर द्विदिशीय तर्क की योजना।
- **Audio-CoT**: ऑडियो और वाक् से संबंधित कार्यों के लिए चेन-ऑफ-थॉट का अनुकूलन।
- **Video-of-Thought**: वीडियो डेटा के चरण-दर-चरण विश्लेषण की तकनीक<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-survey_wang_2025-1)</sup>।

## अनुप्रयोग और परिणाम

मल्टीमोडल CoT प्रॉम्प्टिंग ने कई ऐसे क्षेत्रों में प्रभावशीलता प्रदर्शित की है जहाँ विविध जानकारी के संयोजन की आवश्यकता होती है।

- **शिक्षा और वैज्ञानिक QA**: सिस्टम को आरेखों और चित्रों के साथ प्रश्नों का उत्तर देने की अनुमति देता है, समाधान का विस्तृत स्पष्टीकरण प्रदान करता है (उदाहरण के लिए, ScienceQA dataset पर)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-mcot_zhang_2023-4)</sup>।
- **स्वायत्त ड्राइविंग और रोबोटिक्स**: लिडार, सेंसर और कैमरों के डेटा को क्रमिक रूप से व्याख्यायित करने में मदद करता है, दृश्य समझ और एजेंटों के निर्णय लेने में सुधार करता है।
- **Embodied AI - सन्निहित AI**: दृश्य और पाठ्य संकेतों के आधार पर भौतिक दुनिया के साथ इंटरैक्ट करने वाले सिस्टम के लिए अधिक विश्वसनीय क्रिया नियोजन सुनिश्चित करता है।
- **चिकित्सा और स्वास्थ्य सेवा**: चिकित्सा छवियों (जैसे एक्स-रे) को पाठ्य विवरणों के साथ संयोजित करना निदान की सटीकता और AI निष्कर्षों की व्याख्यायोग्यता को बढ़ाता है<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-survey_wang_2025-1)</sup>।

## समस्याएँ और संभावनाएँ

महत्वपूर्ण प्रगति के बावजूद, CoT का मल्टीमोडल उपयोग एक जटिल शोध समस्या बनी हुई है।

- **लेबल किए गए डेटा की कमी**: मॉडलों को सही मल्टीमोडल तर्क उत्पन्न करने के लिए प्रशिक्षित करने के लिए विस्तृत स्पष्टीकरण के साथ बड़े डेटासेट की आवश्यकता होती है, जिन्हें प्राप्त करना श्रम-साध्य है।
- **लचीलापन और सामान्यीकरण**: एक प्रकार के कार्य (जैसे पाठ + चित्र) के लिए कॉन्फ़िगर की गई विधियाँ मोडैलिटी के अन्य संयोजनों पर खराब प्रदर्शन कर सकती हैं।
- **इष्टतम एकीकरण**: यह प्रश्न खुला रहता है कि विभिन्न मोडैलिटी को एकल तर्क प्रक्रिया में सर्वोत्तम तरीके से कैसे एकीकृत किया जाए ताकि यह वास्तव में मॉडल की समझ को मजबूत करे, न कि केवल उत्तर को लंबा करे।
- **मानकीकरण और मूल्यांकन**: विभिन्न MCoT दृष्टिकोणों के वस्तुनिष्ठ मूल्यांकन और तुलना के लिए मानकीकृत benchmark विकसित करने की आवश्यकता है<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-ddcot_zheng_2023-6)</sup>।

सामान्य बौद्धिक क्षमताओं के निकट मल्टीमोडल AI प्राप्त करने के लिए MCoT विधियों में और नवाचार की आवश्यकता है जो विभिन्न सेंसर द्वारा दुनिया की धारणा की विशिष्टता को ध्यान में रखें<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_note-survey_wang_2025-1)</sup>।

## संदर्भ

- Prompting Guide में Multimodal CoT का अवलोकन
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — विस्तृत वैज्ञानिक समीक्षा

## साहित्य

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## टिप्पणियाँ

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(HI)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[६]</a></span>
