---
title: "Multimodal CoT Prompting (BN)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 4722
wiki_created_at: 2026-09-06T23:38:59Z
wiki_modified_at: 2026-09-06T23:38:59Z
downloaded_at: 2026-09-07T23:04:13Z
---

# Multimodal CoT Prompting (BN)

**মাল্টিমোডাল চেইন-অব-থট প্রম্পটিং** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — এটি চেইন-অব-থট (CoT) পদ্ধতির একটি সম্প্রসারণ, যা একাধিক ধরনের ডেটা (মোডালিটি) অন্তর্ভুক্ত কাজের জন্য প্রযোজ্য। MCoT মডেলে ভাষা এবং অন্যান্য মোডালিটি, যেমন দৃষ্টি বা সারণি ডেটা বিশ্লেষণ, জটিল সমস্যা সমাধানের জন্য একটি একীভূত ধাপে-ধাপে অনুমান প্রক্রিয়ায় অংশগ্রহণ করে<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-survey_wang_2025-1)</sup>।

এই পদ্ধতিটি মাল্টিমোডাল বৃহৎ ভাষা মডেল (MLLM)-এর বিকাশের সাথে উদ্ভূত হয়েছে, যা একই সাথে টেক্সট, ছবি, অডিও এবং ভিডিও প্রক্রিয়া করতে সক্ষম। MCoT মডেলগুলিকে বিভিন্ন উৎস থেকে তথ্য একত্রিত করে ব্যাখ্যাযোগ্য, ধাপে-ধাপে ব্যাখ্যা তৈরি করতে সক্ষম করে, যা তাদের নির্ভুলতা এবং স্বচ্ছতা বৃদ্ধি করে।

## পূর্বশর্ত: টেক্সট থেকে মাল্টিমোডাল CoT-এ রূপান্তর

### Chain-of-Thought টেক্সটে

প্রাথমিকভাবে **Chain-of-Thought (CoT)** পদ্ধতিটি ২০২২ সালে Google-এর গবেষকরা টেক্সট-ভিত্তিক বৃহৎ ভাষা মডেল (LLM)-এর জন্য প্রস্তাব করেছিলেন<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-cot_wei_2022-2)</sup>। মূল ধারণাটি হলো মডেলকে চূড়ান্ত উত্তর দেওয়ার আগে মধ্যবর্তী যুক্তির ধাপগুলির একটি ক্রম তৈরি করতে প্রশিক্ষণ দেওয়া। প্রম্পটে ধাপে-ধাপে সমাধানের উদাহরণ যোগ করা (*few-shot prompting*) LLM-এর গাণিতিক, যৌক্তিক এবং সাধারণ জ্ঞানমূলক যুক্তি প্রয়োজন এমন সমস্যা সমাধানের ক্ষমতা উল্লেখযোগ্যভাবে উন্নত করেছে এবং মডেলের সামগ্রিক নির্ভুলতা ও নির্ভরযোগ্যতা বৃদ্ধি করেছে<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-cot_wei_2022-2)</sup>।

### মাল্টিমোডালিটিতে রূপান্তর

টেক্সট CoT-এর সাফল্য মাল্টিমোডাল পরিস্থিতিতে এটি প্রসারিত করার প্রচেষ্টাকে উৎসাহিত করেছে। Microsoft-এর **Kosmos-1**-এর মতো MLLM-এর আবির্ভাবের সাথে, যা একই সাথে টেক্সট এবং ছবিতে প্রশিক্ষিত, CoT যুক্তিকে মাল্টিমোডাল উপলব্ধির সাথে একীভূত করার সুযোগ তৈরি হয়েছে<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-kosmos1_huang_2023-3)</sup>। পরীক্ষাগুলি দেখিয়েছে যে এই ধরনের মডেলগুলি টেক্সট এবং ভিজ্যুয়াল উভয় ইনপুট বিবেচনা করে ধাপে-ধাপে যুক্তি ব্যবহার করতে পারে, যা যুক্তি এবং উপলব্ধি একত্রিত করার মৌলিক সম্ভাবনা প্রদর্শন করেছে<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-kosmos1_huang_2023-3)</sup>।

## মূল পদ্ধতি এবং পদ্ধতিতত্ত্ব

২০২৩ সাল থেকে মাল্টিমোডাল CoT বাস্তবায়নের জন্য বেশ কিছু পদ্ধতি প্রস্তাব করা হয়েছে।

### দ্বি-পর্যায়ের Multimodal-CoT (Zhang et al.)

২০২৩ সালে প্রস্তাবিত প্রথম পদ্ধতিগুলির মধ্যে একটি একটি দ্বি-পর্যায়ের স্কিম ব্যবহার করে<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **যুক্তি তৈরি**: প্রথম ধাপে মডেলটি মাল্টিমোডাল তথ্যের (যেমন, টেক্সট এবং ছবি) উপর ভিত্তি করে একটি টেক্সট চেইন-অব-রিজনিং (*rationale*) তৈরি করে।
2.  **উত্তর গঠন**: দ্বিতীয় ধাপে মডেলটি তৈরি করা যুক্তির উপর ভিত্তি করে চূড়ান্ত উত্তর প্রদান করে।

এই বিভক্ত পদ্ধতিটি ১ বিলিয়নেরও কম প্যারামিটার সহ একটি মডেলকে বৈজ্ঞানিক dataset **ScienceQA**-তে রেকর্ড-উচ্চ গুণমান অর্জন করতে দিয়েছে, এমনকি বড় মডেল GPT-3.5-কেও ছাড়িয়ে গেছে। হ্যালুসিনেশন হ্রাসও লক্ষ্য করা গেছে<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-mcot_zhang_2023-4)</sup>।

### Compositional CoT

CVPR 2024 সম্মেলনে উপস্থাপিত, এই পদ্ধতিটি ভিজ্যুয়াল-টেক্সট কাজের উপর দৃষ্টি নিবদ্ধ করে এবং একটি মধ্যবর্তী ধাপ হিসেবে ছবির একটি কাঠামোগত উপস্থাপনা তৈরি করার প্রস্তাব করে<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-compositional_cot_mitra_2024-5)</sup>। প্রথমে MLLM একটি দৃশ্য গ্রাফের আকারে দৃশ্যের বিবরণ তৈরি করে, বস্তু এবং তাদের মধ্যে সম্পর্ক নির্দেশ করে। তারপর এই কাঠামোগত বিবরণটি চূড়ান্ত উত্তরের জন্য প্রম্পটে অন্তর্ভুক্ত করা হয়। এই পদ্ধতিটি LLM-কে বস্তুর মধ্যে রচনামূলক সংযোগগুলি আরও গভীরভাবে বিবেচনা করতে দেয় এবং জটিল দৃশ্য বর্ণনা ও ভিজ্যুয়াল প্রশ্নোত্তর বিশ্লেষণের কাজে ফলাফল উন্নত করে<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-compositional_cot_mitra_2024-5)</sup>।

### Duty-Distinct CoT

NeurIPS 2023-এ উপস্থাপিত এই পদ্ধতি সিস্টেমের বিভিন্ন উপাদানের মধ্যে দায়িত্ব বিভাজনের প্রস্তাব করে<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-ddcot_zheng_2023-6)</sup>:

- **ভাষা মডেল** যৌক্তিক যুক্তি এবং তথ্য একীভূত করার জন্য দায়ী।
- **ভিজ্যুয়াল সাবসিস্টেম** (কম্পিউটার ভিশন মডেল) ছবির বিষয়বস্তু সনাক্ত করার জন্য দায়ী।

এই "দ্বৈত প্রম্পটিং" "সমালোচনামূলক চিন্তাভাবনা" নিশ্চিত করে: LLM বিশেষ ভিজ্যুয়াল মডিউল থেকে প্রাপ্ত ভিজ্যুয়াল তথ্য মূল্যায়ন করে এবং ব্যবহার করে। DDCoT পদ্ধতিটি আরও সাধারণ এবং ব্যাখ্যাযোগ্য যুক্তি তৈরি করতে সক্ষম করেছে এবং মাল্টিমোডাল বৈজ্ঞানিক QA কাজে নির্ভুলতা উল্লেখযোগ্যভাবে বৃদ্ধি করেছে<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-ddcot_zheng_2023-6)</sup>।

### MCoT-এর অন্যান্য রূপান্তর

নির্দিষ্ট মোডালিটির সাথে অভিযোজিত অন্যান্য পদ্ধতিগুলিও সক্রিয়ভাবে বিকাশ পাচ্ছে:

- **Dual CoT**: সমান্তরাল দ্বিমুখী যুক্তির স্কিম।
- **Audio-CoT**: অডিও এবং বক্তৃতা সংক্রান্ত কাজের জন্য চেইন-অব-থটের অভিযোজন।
- **Video-of-Thought**: ভিডিও ডেটার ধাপে-ধাপে বিশ্লেষণের কৌশল<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-survey_wang_2025-1)</sup>।

## প্রয়োগ এবং ফলাফল

মাল্টিমোডাল CoT প্রম্পটিং অনেক ক্ষেত্রে কার্যকারিতা প্রদর্শন করেছে যেখানে বিভিন্ন ধরনের তথ্য একত্রিত করা প্রয়োজন।

- **শিক্ষা এবং বৈজ্ঞানিক QA**: সিস্টেমগুলিকে ডায়াগ্রাম এবং চিত্র সহ প্রশ্নের উত্তর দিতে দেয়, বিশদ সমাধান ব্যাখ্যা প্রদান করে (যেমন, ScienceQA dataset-এ)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-mcot_zhang_2023-4)</sup>।
- **স্বায়ত্তশাসিত ড্রাইভিং এবং রোবোটিক্স**: লিডার, সেন্সর এবং ক্যামেরার ডেটা ধারাবাহিকভাবে ব্যাখ্যা করতে সাহায্য করে, দৃশ্য বোঝার এবং এজেন্টের সিদ্ধান্ত গ্রহণ উন্নত করে।
- **Embodied AI**: ভিজ্যুয়াল এবং টেক্সট সংকেতের উপর ভিত্তি করে ভৌত জগতের সাথে মিথস্ক্রিয়া করা সিস্টেমগুলির জন্য আরও নির্ভরযোগ্য কর্ম পরিকল্পনা নিশ্চিত করে।
- **চিকিৎসা এবং স্বাস্থ্যসেবা**: চিকিৎসা চিত্র (যেমন, এক্স-রে) এবং টেক্সট বিবরণের সমন্বয় রোগ নির্ণয়ের নির্ভুলতা এবং AI-এর উপসংহারের ব্যাখ্যাযোগ্যতা বৃদ্ধি করে<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-survey_wang_2025-1)</sup>।

## সমস্যা এবং সম্ভাবনা

উল্লেখযোগ্য অগ্রগতি সত্ত্বেও, CoT-এর মাল্টিমোডাল ব্যবহার একটি জটিল গবেষণা সমস্যা হয়ে রয়েছে।

- **লেবেলযুক্ত ডেটার অভাব**: মডেলগুলিকে সঠিক মাল্টিমোডাল যুক্তি তৈরি করতে প্রশিক্ষণ দেওয়ার জন্য বিশদ ব্যাখ্যা সহ বড় dataset প্রয়োজন, যা সংগ্রহ করা শ্রমসাধ্য।
- **নমনীয়তা এবং সাধারণীকরণ**: এক ধরনের কাজের জন্য (যেমন, টেক্সট + ছবি) কনফিগার করা পদ্ধতিগুলি মোডালিটির অন্যান্য সমন্বয়ে খারাপভাবে স্থানান্তরিত হতে পারে।
- **সর্বোত্তম একীকরণ**: প্রশ্নটি উন্মুক্ত থেকে যায় যে কীভাবে একটি একীভূত যুক্তি প্রক্রিয়ায় বিভিন্ন মোডালিটিকে সর্বোত্তমভাবে একীভূত করা যায় যাতে এটি সত্যিই মডেলের বোঝাপড়া বৃদ্ধি করে, শুধু উত্তর দীর্ঘ না করে।
- **মানীকরণ এবং মূল্যায়ন**: বিভিন্ন MCoT পদ্ধতির উদ্দেশ্যমূলক মূল্যায়ন এবং তুলনার জন্য মানীকৃত benchmark তৈরির প্রয়োজনীয়তা রয়েছে<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-ddcot_zheng_2023-6)</sup>।

সাধারণ বুদ্ধিবৃত্তিক ক্ষমতার কাছাকাছি মাল্টিমোডাল AI অর্জনের জন্য MCoT পদ্ধতিতে আরও উদ্ভাবন প্রয়োজন, যা বিভিন্ন সেন্সর দ্বারা বিশ্ব উপলব্ধির বিশেষত্ব বিবেচনা করে<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_note-survey_wang_2025-1)</sup>।

## তথ্যসূত্র

- Prompting Guide-এ Multimodal CoT-এর পর্যালোচনা
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — বিশদ বৈজ্ঞানিক পর্যালোচনা

## সাহিত্য

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## পাদটীকা

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(BN)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[৬]</a></span>
