---
title: "Multimodal reasoning — मल्टीमोडल रीज़निंग"
source: "https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97"
wiki: "systems-analysis.info/int"
article: "Multimodal_reasoning_—_मल्टीमोडल_रीज़निंग"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4786
wiki_created_at: 2026-09-06T23:39:53Z
wiki_modified_at: 2026-09-06T23:39:53Z
downloaded_at: 2026-09-07T23:04:36Z
---

# Multimodal reasoning — मल्टीमोडल रीज़निंग

**मल्टीमोडल रीज़निंग** (अंग्रेज़ी: *Multimodal Reasoning*) — यह कृत्रिम बुद्धिमत्ता की, विशेष रूप से बड़े भाषा मॉडलों (LLM) की, वह क्षमता है जिसके द्वारा वे एक साथ विभिन्न प्रकार के डेटा (modalities) — जैसे **पाठ, चित्र, ऑडियो** और **वीडियो** — से जानकारी को संसाधित, व्याख्यायित और तार्किक रूप से जोड़ते हुए जटिल कार्यों को हल करते हैं<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-survey_perception-1)</sup>। यह प्रक्रिया मानवीय बहुआयामी अनुभूति का अनुकरण करती है और एक अधिक सार्वभौमिक तथा अनुकूलनीय सामान्य कृत्रिम बुद्धिमत्ता (AGI) के निर्माण की दिशा में एक महत्वपूर्ण कदम है<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-ms_kosmos1-2)</sup>।

ऐसी क्षमता रखने वाले मॉडलों को **मल्टीमोडल बड़े भाषा मॉडल** (**MLLM** या LMRM — *Large Multimodal Reasoning Models*) कहा जाता है। ये पारंपरिक LLM की सीमाओं का विस्तार करते हैं, जो केवल पाठ पर प्रशिक्षित होते थे, और उन्हें चित्रों की सामग्री समझने, वीडियो का विश्लेषण करने, रोबोट नियंत्रित करने तथा दृश्य डेटा के आधार पर संवाद करने में सक्षम बनाते हैं।

## दृष्टिकोणों का विकास

मल्टीमोडल रीज़निंग के दृष्टिकोण मॉड्यूलर प्रणालियों से एकीकृत, भाषा-केंद्रित आर्किटेक्चर की ओर तेज़ी से विकसित हुए हैं।

- **प्रारंभिक प्रणालियाँ**: ये अलग-अलग pipeline पर आधारित थीं, जिनमें अलग घटक दृष्टि को संसाधित करते थे, अन्य पाठ को, और अंतिम चरण में उनके प्रतिनिधित्वों को संयुक्त किया जाता था। इस दृष्टिकोण में प्रत्येक विशिष्ट कार्य के लिए सावधानीपूर्वक डिज़ाइन की आवश्यकता थी।
- **आधुनिक प्रणालियाँ**: ये एकीकृत, भाषा-केंद्रित मॉडलों की ओर स्थानांतरित हो गई हैं। इनमें बड़ा भाषा मॉडल केंद्रीय कड़ी, या रीज़निंग का "इंजन" बनकर काम करता है, जो सभी modalities की जानकारी को एक समान प्रारूप में संसाधित करता है। यह उन तकनीकों से संभव हुआ जिन्होंने भाषा मॉडल को दृश्य और अन्य डेटा को विशेष token के रूप में प्रस्तुत करके समझना सिखाया<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-survey_perception-1)</sup>।

इस परिवर्तन में एक महत्वपूर्ण मील का पत्थर **«मल्टीमोडल चेन-ऑफ-थॉट»** (*Multimodal Chain-of-Thought, MCoT*) की अवधारणा थी, जिसमें मॉडल को संकेतों की एक श्रृंखला दी जाती है जो उसे विभिन्न modalities का उपयोग करते हुए चरणबद्ध तार्किक चरणों से गुज़ारती है।

## मल्टीमोडल LLM आर्किटेक्चर

विभिन्न modalities को भाषा मॉडल के साथ जोड़ने के लिए दो मुख्य आर्किटेक्चरल रणनीतियाँ हैं<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-raschka_understanding-3)</sup>:

### 1. Token स्तर पर एकीकृत आर्किटेक्चर

इस दृष्टिकोण में सभी modalities को LLM के अनुकूल एक सामान्य प्रतिनिधित्व में परिवर्तित किया जाता है। उदाहरण के लिए, एक चित्र को टुकड़ों (patches) में विभाजित किया जाता है, एक दृश्य encoder (जैसे Vision Transformer (ViT)) से गुज़ारा जाता है और वेक्टर embedding के अनुक्रम — **दृश्य token** — में बदला जाता है। फिर ये दृश्य token, पाठ token के साथ संयुक्त (concatenate) होकर बड़े भाषा मॉडल को एक एकल धारा के रूप में प्रदान किए जाते हैं।

- **लाभ**: इस योजना के लिए LLM आर्किटेक्चर में लगभग कोई बदलाव नहीं चाहिए और यह आसानी से scale होती है।
- **उदाहरण**: OpenAI का GPT-4, Google का **PaLM-E**।

### 2. क्रॉस-मोडल attention आर्किटेक्चर

यहाँ भाषा मॉडल और दृश्य encoder अलग-अलग उप-प्रणालियाँ बने रहते हैं, लेकिन **क्रॉस-मोडल attention** (*cross-attention*) की विशेष परतों से जुड़े होते हैं। ये परतें पाठ और दृश्य प्रतिनिधित्वों को उत्पन्न करने की प्रक्रिया में एक-दूसरे को प्रभावित करने देती हैं। मॉडल जैसे-जैसे पाठ उत्तर बनाता है, हर चरण में दृश्य विशेषताओं को "देखता" रहता है।

- **लाभ**: यह पहले से मौजूद, पूर्व-प्रशिक्षित और स्थिर मॉडलों (जैसे एक बड़ी LLM और एक शक्तिशाली ViT) की शक्ति का प्रभावी उपयोग करते हुए केवल संयोजक परतों को प्रशिक्षित करने की अनुमति देता है।
- **उदाहरण**: DeepMind का **Flamingo**।

आधुनिक शोध में एकीकृत *decoder-only* आर्किटेक्चर प्रभावशाली बन गए हैं, क्योंकि ये आसानी से scale होते हैं और मौजूदा LLM की क्षमताओं का बेहतर उपयोग करते हैं<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-raschka_understanding-3)</sup>।

## प्रमुख मॉडल और शोध

MLLM का विकास विशेष रूप से 2022–2024 के बीच तेज़ हुआ।

- **Flamingo (DeepMind, 2022)**: पहले बड़े दृश्य-भाषा मॉडलों (VLM) में से एक, जो few-shot learning के तरीके से बिना अतिरिक्त fine-tuning के विविध मल्टीमोडल कार्य हल करने में सक्षम था। Flamingo ने प्रदर्शित किया कि एक एकल मॉडल prompt में केवल कुछ उदाहरण पाकर नए कार्यों के लिए जल्दी अनुकूलित हो सकता है<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-deepmind_flamingo-4)</sup>।

<!-- -->

- **Kosmos-1 (Microsoft Research, 2023)**: पहला MLLM जो वेब डेटा पर शुरू से प्रशिक्षित हुआ। यह पाठ और चित्रों को «सामान्य modalities» के रूप में ग्रहण कर सकता है और इसने चित्रों के साथ पाठ-आधारित कार्यों (OCR), मल्टीमोडल संवाद, और यहाँ तक कि अशाब्दिक तार्किक चिंतन (Raven की matrices) में भी मजबूत परिणाम दिखाए<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-ms_kosmos1-2)</sup>।

<!-- -->

- **GPT-4 (OpenAI, 2023)**: एक प्रमुख मॉडल जो «बड़े मल्टीमोडल मॉडल» के रूप में प्रस्तुत किया गया है और पाठ तथा चित्र दोनों को इनपुट के रूप में स्वीकार करता है। हालाँकि इसकी आर्किटेक्चर सार्वजनिक नहीं है, यह ज्ञात है कि यह चित्रों की सामग्री का विश्लेषण, ग्राफ का वर्णन और दृश्य memes की व्याख्या कर सकता है। इसकी मल्टीमोडल क्षमताओं तक पहुँच सीमित रूप से दी गई, जैसे नेत्रहीनों और कम दृष्टि वाले लोगों की सहायता के लिए BeMyEyes ऐप के सहयोग में<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-openai_gpt4-5)</sup>।

<!-- -->

- **PaLM-E (Google, 2023)**: एक तथाकथित «embodied» मल्टीमोडल मॉडल, जो रोबोट की भौतिक क्रियाओं के साथ दृश्य अनुभूति को एकीकृत करने के लिए बनाया गया है। PaLM-E कैमरों के चित्रों और सेंसर के डेटा के संयोजन को इनपुट के रूप में लेकर रोबोट नियंत्रण के लिए चरण-दर-चरण योजनाएँ बनाने में सक्षम है। इसने «सकारात्मक transfer» का प्रभाव प्रदर्शित किया: सामान्य «दृश्य+भाषा» कार्यों पर प्रशिक्षण से रोबोटिक कौशल में सुधार हुआ<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-google_palm-e-6)</sup>।

<!-- -->

- **LLAMA 3.2 (Meta, 2024)**: मॉडलों की एक खुली श्रृंखला, जिसमें मल्टीमोडल संस्करण भी शामिल हैं। इनका उद्भव MLLM तकनीकों को व्यापक शोध समुदाय के लिए आगे के प्रयोगों हेतु सुलभ बनाता है<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-raschka_understanding-3)</sup>।

## समस्याएँ और सीमाएँ

प्रभावशाली उपलब्धियों के बावजूद, MLLM को कई गंभीर चुनौतियों का सामना करना पड़ता है:

- **Hallucination**: अपने पाठ-आधारित पूर्ववर्तियों की तरह, MLLM भी विश्वासजनक लगने वाले लेकिन तथ्यात्मक रूप से गलत कथन उत्पन्न कर सकते हैं। दृश्य जानकारी इस समस्या को समाप्त नहीं करती, बल्कि कभी-कभी इसे और जटिल बना देती है, जिससे चित्रों की गलत व्याख्याएँ होती हैं<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-acl_multimodal_kg-7)</sup>।
- **सामान्यीकरण क्षमता और रीज़निंग की गहराई**: मॉडल अक्सर नए प्रकार के डेटा (omni-modal सामान्यीकरण) पर निष्कर्ष विश्वसनीय ढंग से लागू नहीं कर पाते, और उनकी रीज़निंग सतही हो सकती है। वे किसी चित्र का वर्णन कर सकते हैं, लेकिन जब कार्य में पाठ और चित्र को मिलाकर बहु-चरणीय योजना बनानी हो तो विफल हो जाते हैं<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-survey_perception-1)</sup>।
- **तकनीकी जटिलताएँ**: MLLM के प्रशिक्षण के लिए विशाल कम्प्यूटेशनल संसाधनों और बड़े, सावधानी से तैयार किए गए मल्टीमोडल dataset की आवश्यकता होती है। ऐसे मॉडलों की गुणवत्ता का मूल्यांकन भी जटिल है, क्योंकि इसके लिए विशेष benchmark चाहिए जो समझ और रीज़निंग दोनों को ध्यान में रखें।

## विकास की संभावनाएँ

रुझान दर्शाते हैं कि मल्टीमोडल मॉडल तेज़ी से **«मूल रूप से मल्टीमोडल»** (*Native Large Multimodal Models*) बनते जाएंगे, अर्थात शुरू से ही सभी modalities के साथ काम करने के लिए डिज़ाइन किए जाएंगे। अंतिम लक्ष्य एक **सार्वभौमिक बुद्धिमत्ता** का निर्माण करना है जो मानव की तरह ही समृद्ध रूप से दुनिया को अनुभव और समझ सके। इसके लिए शोधकर्ता चिह्नित डेटा पर निर्भरता कम करने, मॉडलों को अधिक अमूर्त, कारण-कार्य संबंधी चिंतन सिखाने और ऐसी शक्तिशाली प्रणालियों पर सुरक्षित नियंत्रण सुनिश्चित करने पर काम कर रहे हैं। सहायक दृष्टिकोणों का विकास, जैसे **HuggingGPT** — जिसमें LLM समन्वयक के रूप में विशेषज्ञ मॉडलों को कार्य वितरित करता है — भी अधिक विश्वसनीय मल्टीमोडल AI की राह प्रशस्त कर रहा है<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_note-hugging_gpt-8)</sup>।

## संदर्भ

- समीक्षा लेख: A Survey on Large Multimodal Reasoning Models (2025)
- Sebastian Raschka का मल्टीमोडल LLM की समझ पर लेख

## साहित्य

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. arXiv:2505.04921.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. ACL 2024.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. arXiv:2302.14045.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. arXiv:2303.17580.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- OpenAI (2023). *GPT-4 Technical Report*. arXiv:2303.08774.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. arXiv:2305.18565.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. arXiv:2209.06794.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. arXiv:2302.00923.

## टिप्पणियाँ

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-survey_perception_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-survey_perception_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 мая 2025 г. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 февр. 2023 г. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-raschka_understanding_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-raschka_understanding_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[७]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%8B%E0%A4%A1%E0%A4%B2_%E0%A4%B0%E0%A5%80%E0%A4%9C%E0%A4%BC%E0%A4%A8%E0%A4%BF%E0%A4%82%E0%A4%97#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[८]</a></span>
