Multimodal CoT Prompting (FA)
پرامپتدهی مولتیمودال با زنجیره استدلال (Multimodal Chain-of-Thought Prompting، MCoT) — گسترشی از روش زنجیره استدلال (CoT) به وظایفی است که شامل چندین نوع داده (مودالیتی) میشوند. در مدلهای MCoT، زبان و سایر مودالیتیها، مانند بینایی یا تحلیل دادههای جدولی، در یک فرایند یکپارچه استنتاج گامبهگام برای حل مسائل پیچیده شرکت میکنند[1].
این رویکرد با توسعه مدلهای زبانی بزرگ مولتیمودال (MLLM) که قادر به پردازش همزمان متن، تصویر، صدا و ویدیو هستند، پدیدار شد. MCoT به مدلها امکان میدهد توضیحات قابل تفسیر و گامبهگامی تولید کنند که اطلاعات منابع مختلف را ادغام میکنند و این امر دقت و شفافیت عملکرد آنها را افزایش میدهد.
پیشزمینه: از CoT متنی تا مولتیمودال
Chain-of-Thought در متن
روش Chain-of-Thought (CoT) در ابتدا توسط پژوهشگران Google در سال ۲۰۲۲ برای مدلهای زبانی بزرگ (LLM) متنی پیشنهاد شد[2]. ایده اصلی این است که مدل را آموزش دهیم تا پیش از ارائه پاسخ نهایی، یک دنباله از گامهای استدلال میانی تولید کند. افزودن نمونههای حل گامبهگام به prompt (few-shot prompting) توانایی LLMها را در حل مسائل نیازمند استدلال حسابی، منطقی و مبتنی بر عقل سلیم بهطور قابلتوجهی بهبود بخشید و دقت و قابلیت اطمینان کلی مدلها را افزایش داد[2].
گذار به مولتیمودالیتی
موفقیت CoT متنی، تلاشهایی را برای گسترش آن به سناریوهای مولتیمودال برانگیخت. با ظهور MLLMهایی مانند Kosmos-1 از Microsoft که بهطور همزمان روی متن و تصویر آموزش میبینند، امکان ادغام منطق CoT با درک مولتیمودال فراهم شد[3]. آزمایشها نشان داد که چنین مدلهایی میتوانند از استدلال گامبهگام با در نظر گرفتن هم ورودیهای متنی و هم بصری استفاده کنند، که امکان بنیادی ترکیب منطق و درک را نشان داد[3].
رویکردها و روششناسیهای اصلی
از سال ۲۰۲۳ به بعد، روشهای متعددی برای پیادهسازی CoT مولتیمودال پیشنهاد شدهاند.
Multimodal-CoT دو مرحلهای (Zhang et al.)
یکی از اولین روشها که در سال ۲۰۲۳ پیشنهاد شد، از یک طرح دو مرحلهای استفاده میکند[4]:
- تولید استدلال: در گام اول، مدل یک زنجیره استدلال متنی (rationale) بر اساس اطلاعات مولتیمودال (مثلاً متن و تصویر) تولید میکند.
- شکلگیری پاسخ: در گام دوم، مدل پاسخ نهایی را با تکیه بر استدلال تولیدشده ارائه میدهد.
این رویکرد تفکیکشده به مدلی با کمتر از یک میلیارد پارامتر اجازه داد تا به کیفیتی رکوردشکن در dataset علمی ScienceQA دست یابد و حتی از مدل بزرگ GPT-3.5 پیشی بگیرد. همچنین کاهش توهمات (hallucinations) نیز مشاهده شد[4].
Compositional CoT (CoT ترکیبی)
این روش که در کنفرانس CVPR 2024 معرفی شد، بر وظایف بصری-متنی تمرکز دارد و پیشنهاد میکند یک نمایش ساختاریافته از تصویر بهعنوان گام میانی تولید شود[5]. ابتدا MLLM توصیف صحنه را به شکل یک گراف صحنه تولید میکند و اشیاء و روابط بین آنها را مشخص میسازد. سپس این توصیف ساختاریافته در prompt برای پاسخ نهایی گنجانده میشود. این رویکرد به LLM اجازه میدهد پیوندهای ترکیبی بین اشیاء را عمیقتر در نظر بگیرد و نتایج را در وظایف توصیف صحنههای پیچیده و تحلیل پرسشوپاسخ بصری بهبود بخشد[5].
CoT با تفکیک وظایف (Duty-Distinct CoT)
این روش که در NeurIPS 2023 معرفی شد، پیشنهاد میکند مسئولیت بین اجزای مختلف سیستم تقسیم شود[6]:
- مدل زبانی مسئول استدلال منطقی و ادغام اطلاعات است.
- زیرسیستم بینایی (مدل بینایی کامپیوتری) مسئول تشخیص محتوای تصویر است.
این «پرامپتدهی دوگانه» «تفکر انتقادی» را تضمین میکند: LLM اطلاعات بصری دریافتشده از ماژول بینایی تخصصی را ارزیابی و استفاده میکند. رویکرد DDCoT استدلالهای قابلتعمیمتر و قابلتوضیحتری تولید کرد و دقت را در وظایف QA علمی مولتیمودال بهطور قابلتوجهی افزایش داد[6].
سایر انواع MCoT
رویکردهای دیگری نیز که برای مودالیتیهای خاص تطبیق یافتهاند، در حال توسعه هستند:
- Dual CoT: طرح استدلال موازی دوسویه.
- Audio-CoT: تطبیق زنجیره افکار برای وظایف مرتبط با صدا و گفتار.
- Video-of-Thought: تکنیک تحلیل گامبهگام دادههای ویدیویی[1].
کاربردها و نتایج
پرامپتدهی CoT مولتیمودال در حوزههای متعددی که نیاز به ترکیب اطلاعات ناهمگون دارند، اثربخشی خود را نشان داده است.
- آموزش و QA علمی: به سیستمها اجازه میدهد به سؤالات دارای نمودار و تصویر پاسخ دهند و توضیح گستردهای از راهحل ارائه کنند (مثلاً در dataset ScienceQA)[4].
- رانندگی خودمختار و رباتیک: کمک میکند دادههای لیدار، سنسورها و دوربینها بهصورت متوالی تفسیر شوند و درک صحنه و تصمیمگیری عاملها بهبود یابد.
- Embodied AI: برنامهریزی اقدامات قابلاطمینانتر را برای سیستمهایی که با دنیای فیزیکی بر اساس سرنخهای بصری و متنی تعامل دارند فراهم میکند.
- پزشکی و بهداشت: ترکیب تصاویر پزشکی (مثلاً عکسهای رادیولوژی) با توضیحات متنی دقت تشخیص و قابلیت توضیحدهی نتایج AI را افزایش میدهد[1].
چالشها و چشماندازها
علیرغم پیشرفتهای قابلتوجه، استفاده مولتیمودال از CoT همچنان یک مسئله پژوهشی پیچیده است.
- کمبود دادههای برچسبخورده: آموزش مدلها برای تولید استدلالهای مولتیمودال صحیح نیازمند مجموعه دادههای بزرگ با توضیحات دقیق است که تهیه آنها زمانبر است.
- انعطافپذیری و تعمیمپذیری: روشهایی که برای یک نوع وظیفه (مثلاً متن + تصویر) تنظیم شدهاند، ممکن است به ترکیبهای دیگر مودالیتیها بهخوبی منتقل نشوند.
- ادغام بهینه: این سؤال که چگونه میتوان مودالیتیهای مختلف را به بهترین نحو در یک فرایند استدلال یکپارچه ادغام کرد، بهگونهای که واقعاً درک مدل را تقویت کند نه صرفاً پاسخ را طولانیتر کند، همچنان باز است.
- استانداردسازی و ارزیابی: نیاز به توسعه benchmarkهای استانداردشده برای ارزیابی و مقایسه عینی رویکردهای مختلف MCoT وجود دارد[6].
برای دستیابی به AI مولتیمودال نزدیک به تواناییهای هوش عمومی، نوآوریهای بیشتری در روشهای MCoT که ویژگیهای درک دنیا از طریق حسگرهای مختلف را در نظر میگیرند، مورد نیاز است[1].
پیوندها
- مرور Multimodal CoT در Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — مرور علمی تفصیلی
منابع
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [۱]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [۲]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [۳]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [۴]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [۵]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [۶]