---
title: "Multimodal large language models — मल्टीमॉडल बड़े भाषा मॉडल"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_—_मल्टीमॉडल_बड़े_भाषा_मॉडल"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4763
wiki_created_at: 2026-09-06T23:39:34Z
wiki_modified_at: 2026-09-06T23:39:34Z
downloaded_at: 2026-09-07T23:04:28Z
---

# Multimodal large language models — मल्टीमॉडल बड़े भाषा मॉडल

**मल्टीमॉडल बड़े भाषा मॉडल** (अंग्रेज़ी: **Multimodal Large Language Models, MLLMs**) — यह कृत्रिम बुद्धिमत्ता के मॉडलों का एक वर्ग है, जो विभिन्न modalities में जानकारी को संसाधित और उत्पन्न करने में सक्षम है, जिसमें टेक्स्ट, चित्र, ऑडियो और वीडियो शामिल हैं<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-encord_intro-1)</sup>। केवल टेक्स्ट के साथ काम करने वाले unimodal भाषा मॉडलों के विपरीत, MLLM जटिल सामग्री-समझ और सामग्री-उत्पादन कार्यों को हल करने के लिए विभिन्न स्रोतों की जानकारी को एकीकृत करते हैं।

MLLM की मूल अवधारणा विभिन्न modalities के लिए एकीकृत vector representation (embedding) बनाने में निहित है। इससे मॉडल को, उदाहरण के लिए, किसी चित्र और उसके टेक्स्ट विवरण के बीच शब्दार्थ संबंध स्थापित करने की सुविधा मिलती है<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-acm_survey-2)</sup>। आधुनिक MLLM की नींव रखने वाली प्रमुख उपलब्धि, साझा feature space में दृश्य और पाठ्य representations के संरेखण के लिए contrastive learning का उपयोग था, जैसा कि **CLIP** मॉडल में लागू किया गया था<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-radford2021-3)</sup>।

## विकास का इतिहास

### प्रारंभिक काल (2013–2020)

मल्टीमॉडल AI की वैचारिक नींव 2013 में रखी गई, जब स्टैनफोर्ड के शोधकर्ताओं ने शब्द vector representations का उपयोग करते हुए zero-shot learning की संभावना प्रदर्शित की<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-deoldify2013-4)</sup>। 2016 में **FAIR** (Meta AI) की टीम ने computer vision मॉडलों को प्रशिक्षित करने के लिए प्राकृतिक भाषा विवरणों के उपयोग की प्रभावशीलता दिखाई, और बिना प्रत्यक्ष प्रशिक्षण के ImageNet पर 11.5% सटीकता प्राप्त की<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-openai_fair_2016-5)</sup>।

### CLIP का युग (2021)

जनवरी 2021 में OpenAI द्वारा **CLIP** (*Contrastive Language-Image Pre-training*) मॉडल का विमोचन एक क्रांतिकारी क्षण बना। 40 करोड़ image-text जोड़ों पर प्रशिक्षित इस मॉडल ने विशिष्ट कार्यों पर विशेष प्रशिक्षण के बिना चित्रों को वर्गीकृत करने की क्षमता प्रदर्शित की। CLIP अनेक बाद के MLLM का आधार बनी<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-stanford_cs_clip-6)</sup>।

### विस्तार और नवाचार (2022–2024)

CLIP की सफलता के बाद अनेक महत्वपूर्ण मॉडल सामने आए:

- **Flamingo** (DeepMind, 2022) — 80 अरब पैरामीटर वाला मॉडल, जिसने कम उदाहरणों के साथ सीखने में उत्कृष्ट क्षमता दिखाई।
- **BLIP** (Salesforce, 2022) — समझ और उत्पादन के लिए एकीकृत architecture।
- **GPT-4V** (OpenAI, 2023) — इस पैमाने का पहला व्यावसायिक मल्टीमॉडल मॉडल।
- **LLaVA** (Microsoft, 2023) — GPT-4V का लोकप्रिय open-source विकल्प।
- **Gemini** (Google, 2023) — स्वाभाविक रूप से मल्टीमॉडल architecture, जो मूल रूप से विभिन्न प्रकार के डेटा के साथ काम करने के लिए डिज़ाइन की गई।
- **GPT-4o** (OpenAI, 2024) — ऐसा मॉडल जो कम विलंबता के साथ वास्तविक समय में टेक्स्ट, ऑडियो और वीडियो संसाधित कर सकता है<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-encord_intro-1)</sup>।
- **Claude 3.5 Sonnet** (Anthropic, 2024) — दृश्य जानकारी के विश्लेषण में उन्नत क्षमताओं वाला मॉडल।

## architectural दृष्टिकोण

### Dual-Encoder Architecture - द्वि-एन्कोडर Architecture

प्रत्येक modality के लिए अलग-अलग encoders का उपयोग करता है, जो डेटा को साझा representation space में प्रक्षेपित करते हैं। इसका प्रमुख उदाहरण **CLIP** है, जहाँ visual transformer चित्रों को और text transformer भाषाई डेटा को संसाधित करता है। इसके लाभ हैं modularity और computational दक्षता, जबकि सीमित cross-modal interaction इसकी कमज़ोरी है<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-viso_ai_mllm-7)</sup>।

### Encoder-Decoder Architecture - एन्कोडर-डीकोडर Architecture

एक एकल encoder मल्टीमॉडल इनपुट को संसाधित करता है, जबकि decoder टेक्स्ट आउटपुट उत्पन्न करता है। **Flamingo** मॉडल परिवर्तनशील लंबाई के दृश्य इनपुट को संसाधित करने के लिए *Perceiver Resampler* तंत्र और cross-modal attention layers का उपयोग करता है। यह दृष्टिकोण समृद्ध inter-modal interaction प्रदान करता है, लेकिन अधिक computational संसाधनों की आवश्यकता होती है<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-determined_ai_arch-8)</sup>।

### Alignment Architecture - संरेखण Architecture

यह दृष्टिकोण frozen pre-trained encoders का उपयोग करता है, जो एक छोटे trainable alignment module के माध्यम से जुड़े होते हैं। उदाहरण के लिए, **BLIP-2** frozen visual encoder और भाषा मॉडल के बीच एक हल्के connecting element के रूप में **Q-Former** (*Querying Transformer*) का उपयोग करता है, जिसके लिए काफी कम trainable parameters की आवश्यकता होती है<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-clarifai_blip2-9)</sup>।

## प्रमुख मॉडल

### GPT-4V / GPT-4o (OpenAI)

GPT-4 मॉडल परिवार में अनुमानतः **1.8 ट्रिलियन** तक पैरामीटर हैं (mixture of experts architecture में)। मई 2024 में जारी **GPT-4o** मॉडल वास्तविक समय में टेक्स्ट, चित्र, ऑडियो और वीडियो की प्रोसेसिंग का समर्थन करता है। **MMMU** benchmark पर यह **69.1%** सटीकता प्राप्त करता है<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-encord_mmmu_perf-10)</sup>।

### Gemini (Google)

स्वाभाविक रूप से मल्टीमॉडल architecture, जिसे टेक्स्ट, चित्र, ऑडियो और वीडियो पर शुरू से प्रशिक्षित किया गया है। **Gemini 1.5 Pro** **1 करोड़ tokens** तक के context window का समर्थन करता है और 32 लोकप्रिय benchmarks में से 30 पर GPT-4 से बेहतर प्रदर्शन करता है<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-daveai_gemini-11)</sup>।

### Claude 3 (Anthropic)

200,000 tokens तक के context window वाले मॉडलों का परिवार (Haiku, Sonnet, Opus)। **Claude 3 Opus** MMMU benchmark पर **58.5%** अंक दर्शाता है। मॉडलों की सुरक्षा बढ़ाने के लिए Constitutional AI दृष्टिकोण का उपयोग किया जाता है<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-anthropic_claude3-12)</sup>।

### LLaVA (open-source मॉडल)

CLIP visual encoder को Vicuna भाषा मॉडल के साथ संयोजित करता है। 7, 13 और 34 अरब पैरामीटर वाले संस्करण उपलब्ध हैं। यह मॉडल synthetic कार्यों पर GPT-4 की तुलनात्मक performance का 85.1% प्राप्त करता है<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-llava_paper-13)</sup>।

## उपयोग के क्षेत्र

- **Visual Question Answering (VQA)**: उपयोगकर्ताओं को दृश्य सामग्री के बारे में प्रश्न पूछने की सुविधा देता है।
- **दस्तावेज़ विश्लेषण**: आधुनिक MLLM प्रति मिनट 2000 पृष्ठों तक संसाधित करने में सक्षम हैं।
- **चिकित्सा imaging**: **Med-PaLM M** (Google) जैसे मॉडल चिकित्सा चित्रों और नैदानिक डेटा का विश्लेषण करते हैं।
- **रोबोटिक्स**: **RT-2** (Google DeepMind) जैसे मॉडल रोबोट को दृश्य वातावरण समझने और प्राकृतिक भाषा में आदेशों का पालन करने में सक्षम बनाते हैं।

## वर्तमान सीमाएँ

- **Hallucinations**: उत्पन्न सामग्री में hallucination का स्तर 27–46% आंका गया है। मॉडल अस्तित्वहीन वस्तुओं का वर्णन कर सकते हैं या दृश्य जानकारी की गलत व्याख्या कर सकते हैं<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_note-arxiv_hallucinations-14)</sup>।
- **उच्च computational आवश्यकताएँ**: MLLM के प्रशिक्षण और उपयोग के लिए महत्वपूर्ण computational infrastructure की आवश्यकता होती है।
- **डेटा पूर्वाग्रह**: प्रशिक्षण डेटा में जनसांख्यिकीय समूहों, भाषाओं और संस्कृतियों का अपर्याप्त प्रतिनिधित्व व्यवस्थित त्रुटियों को जन्म देता है।

## संदर्भ

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## साहित्य

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## टिप्पणियाँ

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[७]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[८]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[९]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[१०]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[११]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[१२]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[१३]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A4%AE%E0%A4%B2%E0%A5%8D%E0%A4%9F%E0%A5%80%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2_%E0%A4%AC%E0%A4%A1%E0%A4%BC%E0%A5%87_%E0%A4%AD%E0%A4%BE%E0%A4%B7%E0%A4%BE_%E0%A4%AE%E0%A5%89%E0%A4%A1%E0%A4%B2#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[१४]</a></span>
