---
title: "Multimodal large language models — مدل‌های زبانی بزرگ چندوجهی"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_—_مدل‌های_زبانی_بزرگ_چندوجهی"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 4760
wiki_created_at: 2026-09-06T23:39:32Z
wiki_modified_at: 2026-09-06T23:39:32Z
downloaded_at: 2026-09-07T23:04:27Z
---

# Multimodal large language models — مدل‌های زبانی بزرگ چندوجهی

**مدل‌های زبانی بزرگ چندوجهی** (به انگلیسی: **Multimodal Large Language Models, MLLMs**) — دسته‌ای از مدل‌های هوش مصنوعی هستند که قادر به پردازش و تولید اطلاعات در قالب‌های مختلف، از جمله متن، تصویر، صدا و ویدیو می‌باشند<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-encord_intro-1)</sup>. برخلاف مدل‌های زبانی تک‌وجهی که صرفاً با متن کار می‌کنند، MLLM اطلاعات را از منابع گوناگون یکپارچه می‌سازند تا وظایف پیچیده‌ی درک و تولید محتوا را حل کنند.

مفهوم اصلی MLLM بر پایه‌ی ایجاد یک embedding یکپارچه برای قالب‌های مختلف استوار است. این امر به مدل اجازه می‌دهد تا پیوندهای معنایی میان، برای مثال، یک تصویر و توصیف متنی آن برقرار کند<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-acm_survey-2)</sup>. پیشرفت کلیدی که پایه‌های MLLM مدرن را بنا نهاد، استفاده از یادگیری تضادی برای هم‌راستاسازی بازنمایی‌های تصویری و متنی در فضای مشترک ویژگی‌ها بود، آن‌گونه که در مدل **CLIP** پیاده‌سازی شد<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-radford2021-3)</sup>.

## تاریخچه‌ی توسعه

### دوره‌ی اولیه (۲۰۱۳–۲۰۲۰)

مبانی مفهومی هوش مصنوعی چندوجهی در سال ۲۰۱۳ پایه‌گذاری شد، زمانی که پژوهشگران دانشگاه Stanford امکان یادگیری با نمونه‌ی صفر (zero-shot learning) با استفاده از بازنمایی‌های برداری کلمات را نشان دادند<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-deoldify2013-4)</sup>. در سال ۲۰۱۶، تیم **FAIR** (Meta AI) اثربخشی استفاده از توصیفات زبان طبیعی برای آموزش مدل‌های بینایی ماشین را به اثبات رساند و بدون آموزش مستقیم به دقت ۱۱٫۵٪ بر روی ImageNet دست یافت<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-openai_fair_2016-5)</sup>.

### دوران CLIP (۲۰۲۱)

لحظه‌ای انقلابی با انتشار مدل **CLIP** (*Contrastive Language-Image Pre-training*) توسط OpenAI در ژانویه‌ی ۲۰۲۱ رقم خورد. این مدل که بر روی ۴۰۰ میلیون جفت تصویر-متن آموزش دیده بود، توانایی دسته‌بندی تصاویر بدون آموزش تخصصی بر روی وظایف خاص را نشان داد. CLIP پایه و اساس بسیاری از MLLM‌های بعدی قرار گرفت<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-stanford_cs_clip-6)</sup>.

### مقیاس‌بندی و نوآوری (۲۰۲۲–۲۰۲۴)

پس از موفقیت CLIP، مدل‌های کلیدی متعددی پدیدار شدند:

- **Flamingo** (DeepMind، ۲۰۲۲) — مدلی با ۸۰ میلیارد پارامتر که توانایی‌های برجسته‌ای در یادگیری با نمونه‌های اندک نشان داد.
- **BLIP** (Salesforce، ۲۰۲۲) — معماری یکپارچه برای درک و تولید محتوا.
- **GPT-4V** (OpenAI، ۲۰۲۳) — اولین مدل چندوجهی تجاری در این مقیاس.
- **LLaVA** (Microsoft، ۲۰۲۳) — جایگزین متن‌باز محبوب برای GPT-4V.
- **Gemini** (Google، ۲۰۲۳) — معماری بوماً چندوجهی که از ابتدا برای کار با انواع مختلف داده طراحی شده است.
- **GPT-4o** (OpenAI، ۲۰۲۴) — مدلی که قادر به پردازش متن، صدا و ویدیو به صورت بلادرنگ با تأخیر پایین است<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic، ۲۰۲۴) — مدلی با قابلیت‌های بهبودیافته در تحلیل اطلاعات تصویری.

## رویکردهای معماری

### معماری دوگانه‌انکودر (Dual-Encoder)

از انکودرهای جداگانه برای هر قالب استفاده می‌کند که داده‌ها را به فضای مشترک بازنمایی فرافکنی می‌نمایند. نمونه‌ی بارز آن **CLIP** است که در آن یک transformer تصویری، تصاویر را پردازش می‌کند و یک transformer متنی، داده‌های زبانی را. مزایای این رویکرد ماژولار بودن و بهره‌وری محاسباتی است، و نقص آن تعامل محدود میان قالب‌هاست<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-viso_ai_mllm-7)</sup>.

### معماری انکودر-دکودر

یک انکودر یکپارچه ورودی چندوجهی را پردازش می‌کند و دکودر خروجی متنی تولید می‌نماید. مدل **Flamingo** از مکانیزم *Perceiver Resampler* برای پردازش ورودی‌های تصویری با طول متغیر و لایه‌های توجه متقاطع بین قالب‌ها استفاده می‌کند. این رویکرد تعامل غنی بین قالب‌ها را فراهم می‌سازد، اما به منابع محاسباتی بیشتری نیاز دارد<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-determined_ai_arch-8)</sup>.

### معماری هم‌راستاسازی (Alignment)

این رویکرد از انکودرهای پیش‌آموخته‌ی منجمد استفاده می‌کند که از طریق یک ماژول هم‌راستاسازی آموزش‌پذیر کوچک به هم متصل می‌شوند. برای نمونه، **BLIP-2** از **Q-Former** (*Querying Transformer*) به عنوان یک عنصر اتصال سبک میان انکودر تصویری منجمد و مدل زبانی استفاده می‌کند و به پارامترهای آموزش‌پذیر به مراتب کمتری نیاز دارد<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-clarifai_blip2-9)</sup>.

## مدل‌های اصلی

### GPT-4V / GPT-4o (OpenAI)

خانواده‌ی مدل‌های GPT-4 بر اساس تخمین‌ها تا **۱٫۸ تریلیون** پارامتر دارند (در معماری mixture of experts). مدل **GPT-4o** که در مه ۲۰۲۴ منتشر شد، از پردازش متن، تصویر، صدا و ویدیو به صورت بلادرنگ پشتیبانی می‌کند. این مدل بر روی benchmark **MMMU** به دقت **۶۹٫۱٪** دست می‌یابد<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

معماری بوماً چندوجهی که از ابتدا بر روی متن، تصویر، صدا و ویدیو آموزش دیده است. **Gemini 1.5 Pro** از پنجره‌ی زمینه‌ای تا **۱۰ میلیون token** پشتیبانی می‌کند و در ۳۰ مورد از ۳۲ benchmark محبوب از GPT-4 پیشی می‌گیرد<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

خانواده‌ای از مدل‌ها (Haiku، Sonnet، Opus) با پنجره‌ی زمینه‌ای تا ۲۰۰٬۰۰۰ token. **Claude 3 Opus** بر روی benchmark MMMU به **۵۸٫۵٪** دست می‌یابد. برای افزایش ایمنی مدل‌ها از رویکرد Constitutional AI استفاده می‌شود<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (مدل متن‌باز)

انکودر تصویری CLIP را با مدل زبانی Vicuna ترکیب می‌کند. نسخه‌هایی با ۷، ۱۳ و ۳۴ میلیارد پارامتر در دسترس هستند. این مدل به ۸۵٫۱٪ از عملکرد نسبی GPT-4 بر روی وظایف مصنوعی دست می‌یابد<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-llava_paper-13)</sup>.

## حوزه‌های کاربرد

- **پرسش و پاسخ تصویری (VQA)**: به کاربران اجازه می‌دهد درباره‌ی محتوای تصویری سؤال بپرسند.
- **تحلیل اسناد**: MLLM‌های مدرن قادرند تا ۲۰۰۰ صفحه در دقیقه پردازش کنند.
- **تصویربرداری پزشکی**: مدل‌هایی مانند **Med-PaLM M** (Google) تصاویر پزشکی و داده‌های بالینی را تحلیل می‌کنند.
- **رباتیک**: مدل‌هایی مانند **RT-2** (Google DeepMind) به ربات‌ها امکان می‌دهند محیط تصویری را درک کرده و دستورات به زبان طبیعی را اجرا کنند.

## محدودیت‌های کنونی

- **توهم‌زایی**: نرخ توهم‌زایی در محتوای تولیدشده بین ۲۷ تا ۴۶ درصد تخمین زده می‌شود. مدل‌ها ممکن است اشیاء ناموجود را توصیف کنند یا اطلاعات تصویری را نادرست تفسیر نمایند<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_note-arxiv_hallucinations-14)</sup>.
- **نیازهای محاسباتی بالا**: آموزش و استفاده از MLLM به زیرساخت محاسباتی قابل توجهی نیاز دارد.
- **تعصب داده**: نمایندگی ناکافی گروه‌های جمعیتی، زبان‌ها و فرهنگ‌ها در داده‌های آموزشی منجر به خطاهای سیستماتیک می‌شود.

## پیوندها

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## منابع

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## یادداشت‌ها

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[۶]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[۷]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[۸]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[۹]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[۱۰]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[۱۱]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[۱۲]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[۱۳]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%D9%85%D8%AF%D9%84%E2%80%8C%D9%87%D8%A7%DB%8C_%D8%B2%D8%A8%D8%A7%D9%86%DB%8C_%D8%A8%D8%B2%D8%B1%DA%AF_%DA%86%D9%86%D8%AF%D9%88%D8%AC%D9%87%DB%8C#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[۱۴]</a></span>
