Multimodal reasoning — استدلال چندوجهی
استدلال چندوجهی (انگلیسی: Multimodal Reasoning) — توانایی هوش مصنوعی، بهویژه مدلهای زبانی بزرگ (LLM)، برای پردازش همزمان، تفسیر و پیوند منطقی اطلاعات از انواع مختلف داده (وجهها)، مانند متن، تصویر، صدا و ویدیو، بهمنظور حل مسائل پیچیده است[1]. این فرایند ادراک چندبُعدی انسانی را شبیهسازی میکند و گامی کلیدی در مسیر ایجاد هوش مصنوعی عمومی (AGI) انعطافپذیرتر و جهانیتر به شمار میرود[2].
مدلهایی که از چنین توانایی برخوردارند، مدلهای زبانی بزرگ چندوجهی (MLLM یا LMRM — Large Multimodal Reasoning Models) نامیده میشوند. این مدلها قابلیتهای LLMهای سنتی را که تنها بر روی متن آموزش دیدهاند گسترش میدهند و به آنها اجازه میدهند محتوای تصاویر را درک کنند، ویدیو تحلیل کنند، رباتها را کنترل کنند و بر اساس دادههای بصری گفتگو داشته باشند.
تکامل رویکردها
رویکردهای استدلال چندوجهی از سیستمهای ماژولار به معماریهای یکپارچه و زبانمحور تکامل سریعی داشتهاند.
- سیستمهای اولیه: بر پایه خطوط لوله جداگانه بودند که در آنها اجزای مستقل بینایی را پردازش میکردند، اجزای دیگر متن را، و در مرحله پایانی بازنماییهای آنها ترکیب میشد. این رویکرد نیازمند طراحی دقیق برای هر وظیفه خاص بود.
- سیستمهای مدرن: به مدلهای یکپارچه زبانمحور روی آوردهاند. در این مدلها، مدل زبانی بزرگ نقش حلقه مرکزی یا «موتور» استدلال را ایفا میکند که اطلاعات تمام وجهها را در قالبی واحد پردازش مینماید. این امر از طریق روشهایی ممکن شد که به مدل زبانی «آموختند» دادههای بصری و سایر دادهها را با بازنمایی آنها به صورت tokenهای ویژه درک کند[1].
مفهوم «زنجیره استدلال چندوجهی» (Multimodal Chain-of-Thought, MCoT) نقطه عطف مهمی در این گذار بود؛ در این رویکرد مدل دنبالهای از راهنماها دریافت میکند که گام به گام او را از طریق مراحل منطقی با استفاده از وجههای مختلف هدایت میکنند.
معماریهای LLM چندوجهی
دو استراتژی معماری اصلی برای ادغام وجههای مختلف با مدل زبانی وجود دارد[3]:
۱. معماری یکپارچه در سطح token
در این رویکرد تمام وجهها به بازنمایی مشترکی تبدیل میشوند که با LLM سازگار است. برای مثال، تصویر به قطعات (patch) تقسیم میشود، از طریق یک encoder بصری (مانند Vision Transformer (ViT)) عبور میکند و به دنبالهای از embeddingهای برداری — tokenهای بصری — تبدیل میشود. سپس این tokenهای بصری با tokenهای متنی الحاق (concatenate) شده و به عنوان ورودی به مدل زبانی بزرگ داده میشوند که آنها را در یک جریان واحد پردازش میکند.
- مزایا: این طرح تقریباً نیازی به تغییر در معماری LLM ندارد و به راحتی مقیاسپذیر است.
- نمونهها: GPT-4 از OpenAI، PaLM-E از Google.
۲. معماری با توجه cross-modal
در اینجا مدل زبانی و encoder بصری به عنوان زیرسیستمهای جداگانه باقی میمانند، اما از طریق لایههای توجه cross-modal (cross-attention) به هم متصل میشوند. این لایهها به بازنماییهای متنی و بصری اجازه میدهند در فرایند تولید بر یکدیگر تأثیر بگذارند. مدل به نوعی در هر گام تولید پاسخ متنی «نگاهی» به ویژگیهای بصری میاندازد.
- مزایا: امکان استفاده مؤثر از قدرت مدلهای از پیش آموزشدیده و منجمد موجود (مانند یک LLM بزرگ و ViT قدرتمند) را فراهم میکند و فقط لایههای اتصالی آموزش میبینند.
- نمونه: Flamingo از DeepMind.
در پژوهشهای معاصر، معماریهای یکپارچه decoder-only به حالت غالب تبدیل شدهاند، زیرا مقیاسپذیری سادهتری دارند و از قابلیتهای LLMهای موجود بهتر بهره میبرند[3].
مدلها و پژوهشهای کلیدی
توسعه MLLM بهویژه در سالهای ۲۰۲۲ تا ۲۰۲۴ شتاب گرفت.
- Flamingo (DeepMind, 2022): یکی از اولین مدلهای بزرگ بصری-زبانی (VLM) که قادر است در حالت few-shot learning وظایف متنوع چندوجهی را بدون fine-tuning اضافی حل کند. Flamingo نشان داد که یک مدل واحد میتواند با دریافت تنها چند نمونه در prompt به سرعت با وظایف جدید سازگار شود[4].
- Kosmos-1 (Microsoft Research, 2023): اولین MLLM که از ابتدا بر روی دادههای وب آموزش دید. این مدل قادر است متن و تصویر را به عنوان «وجههای مشترک» درک کند و نتایج قویای در حل وظایف متنی با تصویر (OCR)، گفتگوی چندوجهی و حتی وظایف استدلال منطقی غیرکلامی (ماتریسهای راون) نشان داد[2].
- GPT-4 (OpenAI, 2023): مدل پرچمدار که به عنوان «مدل بزرگ چندوجهی» معرفی میشود و قادر است متن و تصویر را به عنوان ورودی دریافت کند. هرچند معماری آن فاش نشده، اما مشخص است که میتواند محتوای تصاویر را تحلیل کند، نمودارها را توصیف کند و میمهای بصری را توضیح دهد. دسترسی به قابلیتهای چندوجهی آن به صورت محدود فراهم شد، از جمله در همکاری با برنامه BeMyEyes برای کمک به نابینایان و کمبینایان[5].
- PaLM-E (Google, 2023): مدل چندوجهی به اصطلاح «تجسمیافته» (embodied) که برای یکپارچهسازی ادراک بصری با اقدامات فیزیکی ربات طراحی شده است. PaLM-E قادر است با دریافت ترکیبی از تصاویر دوربین و دادههای سنسور، برنامههای گامبهگام برای کنترل ربات تولید کند. این موضوع اثر «انتقال مثبت» را نشان داد: آموزش بر وظایف عمومی «بینایی+زبان» کارایی مهارتهای رباتیک را بهبود بخشید[6].
- LLAMA 3.2 (Meta, 2024): مجموعه مدلهای متنباز که نسخههای چندوجهی نیز در آن ظهور کردند. ظهور این مدلها فناوریهای MLLM را برای جامعه پژوهشی گسترده جهت آزمایشهای بیشتر در دسترس قرار میدهد[3].
چالشها و محدودیتها
علیرغم دستاوردهای چشمگیر، MLLM با چالشهای جدی متعددی روبرو هستند:
- توهمزایی: مانند نسلهای متنی پیشین خود، MLLM میتوانند ادعاهایی تولید کنند که بهظاهر قانعکنندهاند اما از نظر واقعی نادرست هستند. اطلاعات بصری این مشکل را رفع نمیکند و گاهی آن را پیچیدهتر میکند و منجر به تفسیرهای نادرست از تصاویر میشود[7].
- قابلیت تعمیم و عمق استدلال: مدلها اغلب قادر نیستند نتیجهگیریها را به انواع جدید داده (تعمیم omni-modal) بهطور قابل اطمینان منتقل کنند و استدلال آنها ممکن است سطحی باشد. آنها میتوانند یک تصویر را توصیف کنند، اما در صورتی که وظیفه نیازمند برنامهریزی چندمرحلهای با در نظر گرفتن متن و تصویر باشد، شکست میخورند[1].
- پیچیدگیهای فنی: آموزش MLLM نیازمند منابع محاسباتی عظیم و datasetهای چندوجهی بزرگ و با کیفیت بالا است. ارزیابی کیفیت چنین مدلهایی نیز دشوار است زیرا نیازمند benchmarkهای ویژهای است که هم درک و هم استدلال را در نظر بگیرند.
چشماندازهای توسعه
روندها نشان میدهند که مدلهای چندوجهی بهطور فزایندهای «ذاتاً» چندوجهی (Native Large Multimodal Models) خواهند شد، یعنی از ابتدا برای کار با تمام وجهها طراحی میشوند. هدف نهایی ایجاد هوش جهانی است که بتواند جهان را به همان اندازه غنی که انسان میکند، درک کند. برای این منظور پژوهشگران در حال کار بر کاهش وابستگی به دادههای برچسبگذاریشده، آموزش مدلها برای تفکر انتزاعیتر و علّی-معلولی، و تضمین کنترل ایمن بر چنین سیستمهای قدرتمندی هستند. توسعه رویکردهای کمکی مانند HuggingGPT — که در آن LLM به عنوان هماهنگکنندهای عمل میکند که وظایف را بین مدلهای متخصص توزیع میکند — نیز راه را به سوی هوش مصنوعی چندوجهی قابل اطمینانتر هموار میکند[8].
پیوندها
- مقاله مروری: A Survey on Large Multimodal Reasoning Models (2025)
- مقاله Sebastian Raschka درباره درک LLMهای چندوجهی
منابع
- Li, Y. et al. (2025). Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models. arXiv:2505.04921.
- Lee, J. et al. (2024). Multimodal Reasoning with Multimodal Knowledge Graph. ACL 2024.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models. arXiv:2302.14045.
- Shen, Y. et al. (2023). HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face. arXiv:2303.17580.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Chen, X. et al. (2023). PaLI-X: On Scaling Up a Multilingual Vision and Language Model. arXiv:2305.18565.
- Alayrac, J-B. et al. (2022). Flamingo: A Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Chen, X. et al. (2022). PaLI: A Jointly-Scaled Multilingual Language-Image Model. arXiv:2209.06794.
- Huang, S. et al. (2022). Multimodal Chain-of-Thought Prompting in Large Language Models. arXiv:2302.00923.
یادداشتها
- ↑ 1.0 1.1 1.2 Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». arXiv:2505.04921 [cs.AI], 8 мая 2025 г. [۱]
- ↑ 2.0 2.1 Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045 [cs.CL], 28 февр. 2023 г. [۲]
- ↑ 3.0 3.1 3.2 Raschka, Sebastian. «Understanding Multimodal LLMs». Ahead of AI Magazine. [۳]
- ↑ Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». DeepMind Blog. [۴]
- ↑ «GPT-4». OpenAI. [۵]
- ↑ Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». Google Research Blog. [۶]
- ↑ Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». ACL Anthology, 2024. [۷]
- ↑ Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». OpenReview. [۸]