---
title: "Multimodal reasoning — الاستدلال متعدد الوسائط"
source: "https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7"
wiki: "systems-analysis.info/int"
article: "Multimodal_reasoning_—_الاستدلال_متعدد_الوسائط"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4784
wiki_created_at: 2026-09-06T23:39:51Z
wiki_modified_at: 2026-09-06T23:39:51Z
downloaded_at: 2026-09-07T23:04:36Z
---

# Multimodal reasoning — الاستدلال متعدد الوسائط

**الاستدلال متعدد الوسائط** (بالإنجليزية: *Multimodal Reasoning*) — هو قدرة الذكاء الاصطناعي، وتحديدًا نماذج اللغة الكبيرة (LLM)، على معالجة المعلومات وتفسيرها وربطها منطقيًا بشكل متزامن من أنواع مختلفة من البيانات (الوسائط)، مثل **النصوص والصور والصوت** و**الفيديو**، لحل المهام المعقدة<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-survey_perception-1)</sup>. تحاكي هذه العملية الإدراك البشري متعدد الأوجه وتُعد خطوة أساسية نحو إنشاء ذكاء اصطناعي عام (AGI) أكثر شمولًا وقدرة على التكيف<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-ms_kosmos1-2)</sup>.

تُعرف النماذج التي تمتلك هذه القدرة باسم **نماذج اللغة الكبيرة متعددة الوسائط** (**MLLM** أو LMRM — *Large Multimodal Reasoning Models*). وهي توسع إمكانيات نماذج LLM التقليدية، التي دُرّبت على النصوص فقط، مما يسمح لها بفهم محتوى الصور، وتحليل مقاطع الفيديو، والتحكم في الروبوتات، وإجراء حوارات بناءً على البيانات المرئية.

## تطور المنهجيات

شهدت منهجيات الاستدلال متعدد الوسائط تطورًا سريعًا، من الأنظمة القائمة على الوحدات (modular) إلى المعماريات الموحدة التي تتمحور حول اللغة.

- **الأنظمة المبكرة**: كانت تعتمد على مسارات معالجة منفصلة، حيث تتولى مكونات معالجة الرؤية، ومكونات أخرى معالجة النصوص، ثم يتم دمج تمثيلاتهم في المرحلة النهائية. تطلب هذا النهج تصميمًا دقيقًا لكل مهمة على حدة.
- **الأنظمة الحديثة**: انتقلت إلى نماذج موحدة تتمحور حول اللغة. في هذه النماذج، يعمل نموذج اللغة الكبير كعنصر مركزي، أو «محرك» للاستدلال، يقوم بمعالجة المعلومات من جميع الوسائط في تنسيق واحد. أصبح هذا ممكنًا بفضل التقنيات التي «علّمت» نموذج اللغة كيفية فهم البيانات المرئية وغيرها، من خلال تمثيلها في شكل مَرمّزات (tokens) خاصة<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-survey_perception-1)</sup>.

كان من المعالم الهامة في هذا التحول مفهوم **«سلسلة الفكر متعددة الوسائط»** (*Multimodal Chain-of-Thought, MCoT*)، حيث يتلقى النموذج سلسلة من المُوجِّهات التي تقوده خطوة بخطوة عبر مراحل منطقية تستخدم وسائط مختلفة.

## معماريات نماذج اللغة الكبيرة متعددة الوسائط

توجد استراتيجيتان معماریتان أساسيتان لدمج الوسائط المختلفة مع نموذج اللغة<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-raschka_understanding-3)</sup>:

### 1. المعمارية الموحدة على مستوى المَرمّزات (Tokens)

في هذا النهج، يتم تحويل جميع الوسائط إلى تمثيل مشترك متوافق مع نموذج LLM. على سبيل المثال، تُقسَّم الصورة إلى أجزاء (patches)، وتُمرَّر عبر مُشفّر بصري (مثل Vision Transformer (ViT))، وتتحول إلى سلسلة من التضمينات المتجهية — **المَرمّزات البصرية**. بعد ذلك، يتم ربط (concatenate) هذه المَرمّزات البصرية مع المَرمّزات النصية وتقديمها كمدخل لنموذج اللغة الكبير، الذي يعالجها كتيار واحد.

- **المزايا**: لا يتطلب هذا المخطط أي تغييرات تقريبًا في معمارية نموذج LLM وهو قابل للتوسع بسهولة.
- **أمثلة**: GPT-4 من OpenAI، و**PaLM-E** من Google.

### 2. المعمارية ذات الانتباه متعدد الوسائط (Cross-modal attention)

هنا، يظل نموذج اللغة والمُشفّر البصري نظامين فرعيين منفصلين، ولكنهما يتصلان عبر طبقات خاصة من **الانتباه متعدد الوسائط** (*cross-attention*). تسمح هذه الطبقات للتمثيلات النصية والبصرية بالتأثير على بعضها البعض أثناء عملية التوليد. يبدو الأمر كما لو أن النموذج «يختلس النظر» إلى الميزات البصرية في كل خطوة من خطوات إنشاء الاستجابة النصية.

- **المزايا**: تتيح الاستخدام الفعال لقوة النماذج الموجودة مسبقًا، والمُدرّبة والمُجمّدة (frozen) (مثل نموذج LLM كبير ومُشفّر ViT قوي)، من خلال تدريب الطبقات الرابطة فقط.
- **مثال**: **Flamingo** من DeepMind.

في الأبحاث الحديثة، أصبحت معماريات *decoder-only* الموحدة هي السائدة، لأنها أسهل في التوسع وتستفيد بشكل أفضل من قدرات نماذج LLM الحالية<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-raschka_understanding-3)</sup>.

## النماذج والأبحاث الرئيسية

تسارع تطور نماذج MLLM بشكل خاص في الفترة بين 2022 و2024.

- **Flamingo (DeepMind, 2022)**: أحد أوائل النماذج البصرية-اللغوية الكبيرة (VLM)، القادرة على حل مجموعة متنوعة من المهام متعددة الوسائط في وضع التعلم بالقليل من الأمثلة (few-shot learning) دون الحاجة إلى ضبط إضافي. أظهر Flamingo أن نموذجًا واحدًا يمكنه التكيف بسرعة مع مهام جديدة بمجرد تزويده ببضعة أمثلة في المُوجِّه<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-deepmind_flamingo-4)</sup>.

<!-- -->

- **Kosmos-1 (Microsoft Research, 2023)**: أول نموذج MLLM يُدرَّب من الصفر على بيانات الويب. يستطيع هذا النموذج إدراك النصوص والصور كـ«وسائط مشتركة» وقد أظهر نتائج قوية في حل المهام النصية مع الصور (OCR)، والحوار متعدد الوسائط، وحتى في مهام التفكير المنطقي غير اللفظي (مصفوفات ريفن)<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-ms_kosmos1-2)</sup>.

<!-- -->

- **GPT-4 (OpenAI, 2023)**: النموذج الرائد الذي تم تقديمه كـ«نموذج كبير متعدد الوسائط»، قادر على استقبال النصوص والصور كمدخلات. على الرغم من أن معماريته لم تُكشف، فمن المعروف أنه يستطيع تحليل محتوى الصور، ووصف الرسوم البيانية، وشرح الميمات المرئية. أُتيح الوصول إلى قدراته متعددة الوسائط بشكل محدود، على سبيل المثال، بالتعاون مع تطبيق BeMyEyes لمساعدة المكفوفين وضعاف البصر<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-openai_gpt4-5)</sup>.

<!-- -->

- **PaLM-E (Google, 2023)**: نموذج متعدد الوسائط يُعرف بـ«المُجسَّد» (*embodied*)، صُمم لدمج الإدراك البصري مع الإجراءات الجسدية للروبوت. يستطيع PaLM-E إنشاء خطط متدرجة للتحكم في الروبوتات، حيث يستقبل مزيجًا من الصور من الكاميرات وقراءات أجهزة الاستشعار. أظهر هذا تأثير «النقل الإيجابي» (positive transfer): حيث أدى التدريب على مهام «الرؤية + اللغة» العامة إلى تحسين كفاءة المهارات الروبوتية<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-google_palm-e-6)</sup>.

<!-- -->

- **LLAMA 3.2 (Meta, 2024)**: سلسلة نماذج مفتوحة المصدر ظهرت فيها أيضًا إصدارات متعددة الوسائط. ظهورها يجعل تقنيات MLLM متاحة لمجتمع البحث الواسع لإجراء المزيد من التجارب<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-raschka_understanding-3)</sup>.

## المشاكل والقيود

على الرغم من الإنجازات المثيرة للإعجاب، تواجه نماذج MLLM عددًا من المشاكل الجادة:

- **الهلوسة**: مثل أسلافها النصية، يمكن لنماذج MLLM أن تولد تأكيدات تبدو مقنعة ولكنها غير صحيحة في الواقع. لا تقضي المعلومات المرئية على هذه المشكلة، بل قد تعقدها أحيانًا، مما يؤدي إلى تفسيرات خاطئة للصور<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-acl_multimodal_kg-7)</sup>.
- **القدرة على التعميم وعمق الاستدلال**: غالبًا ما تفشل النماذج في نقل الاستنتاجات بشكل موثوق إلى أنواع جديدة من البيانات (التعميم الشامل للوسائط)، وقد يكون استدلالها سطحيًا. يمكنها وصف صورة، لكنها قد تفشل إذا كانت المهمة تتطلب تخطيطًا متعدد الخطوات يأخذ في الاعتبار النص والصورة معًا<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-survey_perception-1)</sup>.
- **الصعوبات التقنية**: يتطلب تدريب نماذج MLLM موارد حاسوبية هائلة ومجموعات بيانات كبيرة ومتعددة الوسائط ومُعدة بعناية. كما أن تقييم جودة هذه النماذج معقد، لأنه يتطلب معايير قياس (benchmarks) خاصة تأخذ في الاعتبار الفهم والاستدلال.

## آفاق التطور

تشير الاتجاهات إلى أن النماذج متعددة الوسائط ستصبح بشكل متزايد **متعددة الوسائط «أصليًا»** (*Native Large Multimodal Models*)، أي مصممة منذ البداية للعمل مع جميع الوسائط. الهدف النهائي هو إنشاء **ذكاء شامل**، قادر على إدراك وفهم العالم بنفس الثراء الذي يفهمه الإنسان. لتحقيق ذلك، يعمل الباحثون على تقليل الاعتماد على البيانات المصنفة، وتدريب النماذج على تفكير أكثر تجريدًا وسببيًا، وضمان التحكم الآمن في مثل هذه الأنظمة القوية. كما أن تطوير المنهجيات المساعدة، مثل **HuggingGPT** — حيث يعمل نموذج LLM كمنسق يوزع المهام على نماذج متخصصة — يمهد الطريق أيضًا نحو ذكاء اصطناعي متعدد الوسائط أكثر موثوقية<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-hugging_gpt-8)</sup>.

## روابط خارجية

- <a href="https://arxiv.org/html/2505.04921v1" class="external text" rel="nofollow">مقال استعراضي: A Survey on Large Multimodal Reasoning Models (2025)</a>
- <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external text" rel="nofollow">مقالة لسيباستيان راشكا حول فهم نماذج LLM متعددة الوسائط</a>

## المراجع الأكاديمية

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. <a href="https://arxiv.org/abs/2505.04921" class="external text" rel="nofollow">arXiv:2505.04921</a>.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. <a href="https://aclanthology.org/2024.acl-long.579.pdf" class="external text" rel="nofollow">ACL 2024</a>.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. <a href="https://arxiv.org/abs/2302.14045" class="external text" rel="nofollow">arXiv:2302.14045</a>.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. <a href="https://arxiv.org/abs/2303.17580" class="external text" rel="nofollow">arXiv:2303.17580</a>.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- OpenAI (2023). *GPT-4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external text" rel="nofollow">arXiv:2303.08774</a>.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. <a href="https://arxiv.org/abs/2305.18565" class="external text" rel="nofollow">arXiv:2305.18565</a>.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. <a href="https://arxiv.org/abs/2209.06794" class="external text" rel="nofollow">arXiv:2209.06794</a>.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.

## ملاحظات

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-survey_perception_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-survey_perception_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 мая 2025 г. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 февр. 2023 г. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-raschka_understanding_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-raschka_understanding_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[٤]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[٥]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[٦]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[٧]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/int/Multimodal_reasoning_%E2%80%94_%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%AF%D9%84%D8%A7%D9%84_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[٨]</a></span>
