---
title: "Multimodal large language models — মাল্টিমোডাল বৃহৎ ভাষা মডেল"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_—_মাল্টিমোডাল_বৃহৎ_ভাষা_মডেল"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4764
wiki_created_at: 2026-09-06T23:39:35Z
wiki_modified_at: 2026-09-06T23:39:35Z
downloaded_at: 2026-09-07T23:04:28Z
---

# Multimodal large language models — মাল্টিমোডাল বৃহৎ ভাষা মডেল

**মাল্টিমোডাল বৃহৎ ভাষা মডেল** (ইংরেজি: **Multimodal Large Language Models, MLLMs**) — এটি কৃত্রিম বুদ্ধিমত্তা মডেলের একটি শ্রেণি, যা টেক্সট, চিত্র, অডিও এবং ভিডিও সহ বিভিন্ন মোডালিটিতে তথ্য প্রক্রিয়া করতও তৈরি করতে সক্ষম<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-encord_intro-1)</sup>। শুধুমাত্র টেক্সট নিয়ে কাজ করে এমন ইউনিমোডাল ভাষা মডেলের বিপরীতে, MLLM বিভিন্ন উৎস থেকে তথ্য একত্রিত করে জটিল বোঝাপড়া ও কন্টেন্ট তৈরির কাজ সম্পন্ন করে।

MLLM-এর মূল ধারণাটি হলো বিভিন্ন মোডালিটির জন্য একটি একক ভেক্টর উপস্থাপনা (embedding) তৈরি করা। এটি মডেলকে উদাহরণস্বরূপ একটি চিত্র এবং তার টেক্সট বিবরণের মধ্যে অর্থগত সম্পর্ক স্থাপন করতে দেয়<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-acm_survey-2)</sup>। আধুনিক MLLM-এর ভিত্তি স্থাপনকারী মূল অগ্রগতি ছিল সাধারণ feature space-এ ভিজ্যুয়াল ও টেক্সট উপস্থাপনা সারিবদ্ধ করতে contrastive learning-এর ব্যবহার, যা **CLIP** মডেলে বাস্তবায়িত হয়েছিল<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-radford2021-3)</sup>।

## ইতিহাসের বিকাশ

### প্রাথমিক পর্যায় (২০১৩–২০২০)

মাল্টিমোডাল AI-এর ধারণাগত ভিত্তি ২০১৩ সালে স্থাপিত হয়েছিল, যখন স্ট্যানফোর্ডের গবেষকরা শব্দ ভেক্টর উপস্থাপনা ব্যবহার করে zero-shot learning-এর সম্ভাবনা প্রদর্শন করেন<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-deoldify2013-4)</sup>। ২০১৬ সালে **FAIR** (Meta AI) টিম কম্পিউটার ভিশন মডেল প্রশিক্ষণে প্রাকৃতিক ভাষার বিবরণ ব্যবহারের কার্যকারিতা দেখায় এবং সরাসরি প্রশিক্ষণ ছাড়াই ImageNet-এ ১১.৫% নির্ভুলতা অর্জন করে<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-openai_fair_2016-5)</sup>।

### CLIP-এর যুগ (২০২১)

একটি বিপ্লবী মুহূর্ত ছিল ২০২১ সালের জানুয়ারিতে OpenAI কর্তৃক **CLIP** (*Contrastive Language-Image Pre-training*) মডেলের প্রকাশ। ৪০০ মিলিয়ন চিত্র-টেক্সট জোড়ায় প্রশিক্ষিত এই মডেলটি নির্দিষ্ট কাজে বিশেষায়িত প্রশিক্ষণ ছাড়াই চিত্র শ্রেণিবদ্ধ করার ক্ষমতা প্রদর্শন করে। CLIP পরবর্তী অনেক MLLM-এর ভিত্তি হয়ে ওঠে<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-stanford_cs_clip-6)</sup>।

### স্কেলিং ও উদ্ভাবন (২০২২–২০২৪)

CLIP-এর সাফল্যের পর অনেক গুরুত্বপূর্ণ মডেল আবির্ভূত হয়:

- **Flamingo** (DeepMind, ২০২২) — ৮০ বিলিয়ন প্যারামিটারের মডেল, যা অল্প সংখ্যক উদাহরণ দিয়ে শেখার ক্ষেত্রে অসাধারণ ক্ষমতা প্রদর্শন করে।
- **BLIP** (Salesforce, ২০২২) — বোঝাপড়া ও তৈরির জন্য একটি একীভূত আর্কিটেকচার।
- **GPT-4V** (OpenAI, ২০২৩) — এই মাত্রার প্রথম বাণিজ্যিক মাল্টিমোডাল মডেল।
- **LLaVA** (Microsoft, ২০২৩) — GPT-4V-এর একটি জনপ্রিয় ওপেন বিকল্প।
- **Gemini** (Google, ২০২৩) — নেটিভলি মাল্টিমোডাল আর্কিটেকচার, মূলত বিভিন্ন ধরনের ডেটা নিয়ে কাজ করার জন্য ডিজাইন করা।
- **GPT-4o** (OpenAI, ২০২৪) — কম বিলম্বে রিয়েল টাইমে টেক্সট, অডিও ও ভিডিও প্রক্রিয়া করতে সক্ষম মডেল<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-encord_intro-1)</sup>।
- **Claude 3.5 Sonnet** (Anthropic, ২০২৪) — ভিজ্যুয়াল তথ্য বিশ্লেষণে উন্নত ক্ষমতাসম্পন্ন মডেল।

## আর্কিটেকচারাল পদ্ধতি

### Dual-Encoder আর্কিটেকচার

প্রতিটি মোডালিটির জন্য আলাদা encoder ব্যবহার করে, যা ডেটাকে একটি সাধারণ উপস্থাপনা space-এ প্রজেক্ট করে। এর উজ্জ্বল উদাহরণ হলো **CLIP**, যেখানে একটি ভিজ্যুয়াল transformer চিত্র প্রক্রিয়া করে এবং একটি টেক্সট transformer ভাষা ডেটা প্রক্রিয়া করে। সুবিধাগুলো হলো মডুলারিটি ও গণনামূলক দক্ষতা, আর সীমাবদ্ধতা হলো সীমিত cross-modal মিথস্ক্রিয়া<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-viso_ai_mllm-7)</sup>।

### Encoder-Decoder আর্কিটেকচার

একটি একক encoder মাল্টিমোডাল ইনপুট প্রক্রিয়া করে এবং decoder টেক্সট আউটপুট তৈরি করে। **Flamingo** মডেলটি পরিবর্তনশীল দৈর্ঘ্যের ভিজ্যুয়াল ইনপুট প্রক্রিয়ার জন্য *Perceiver Resampler* প্রক্রিয়া এবং cross-modal attention স্তর ব্যবহার করে। এই পদ্ধতি সমৃদ্ধ cross-modal মিথস্ক্রিয়া নিশ্চিত করে, কিন্তু বেশি গণনামূলক সম্পদ প্রয়োজন<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-determined_ai_arch-8)</sup>।

### Alignment আর্কিটেকচার

এই পদ্ধতি একটি ছোট প্রশিক্ষণযোগ্য alignment মডিউলের মাধ্যমে সংযুক্ত frozen পূর্ব-প্রশিক্ষিত encoder ব্যবহার করে। উদাহরণস্বরূপ, **BLIP-2** একটি frozen ভিজ্যুয়াল encoder এবং ভাষা মডেলের মধ্যে হালকা সংযোগকারী উপাদান হিসেবে **Q-Former** (*Querying Transformer*) ব্যবহার করে, যার জন্য উল্লেখযোগ্যভাবে কম প্রশিক্ষণযোগ্য প্যারামিটার প্রয়োজন<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-clarifai_blip2-9)</sup>।

## প্রধান মডেলগুলো

### GPT-4V / GPT-4o (OpenAI)

GPT-4 মডেল পরিবারে অনুমানত **১.৮ ট্রিলিয়ন** পর্যন্ত প্যারামিটার রয়েছে (mixture of experts আর্কিটেকচারে)। ২০২৪ সালের মে মাসে প্রকাশিত **GPT-4o** মডেলটি রিয়েল টাইমে টেক্সট, চিত্র, অডিও ও ভিডিও প্রক্রিয়া সমর্থন করে। **MMMU** benchmark-এ এটি **৬৯.১%** নির্ভুলতা অর্জন করে<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-encord_mmmu_perf-10)</sup>।

### Gemini (Google)

টেক্সট, চিত্র, অডিও ও ভিডিওতে শুরু থেকে প্রশিক্ষিত একটি নেটিভলি মাল্টিমোডাল আর্কিটেকচার। **Gemini 1.5 Pro** **১০ মিলিয়ন token** পর্যন্ত context window সমর্থন করে এবং ৩২টি জনপ্রিয় benchmark-এর মধ্যে ৩০টিতে GPT-4-কে ছাড়িয়ে যায়<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-daveai_gemini-11)</sup>।

### Claude 3 (Anthropic)

২০০,০০০ token পর্যন্ত context window সহ মডেল পরিবার (Haiku, Sonnet, Opus)। **Claude 3 Opus** MMMU benchmark-এ **৫৮.৫%** স্কোর করে। নিরাপত্তা বাড়াতে মডেলগুলো Constitutional AI পদ্ধতি ব্যবহার করে<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-anthropic_claude3-12)</sup>।

### LLaVA (ওপেন মডেল)

CLIP ভিজ্যুয়াল encoder-কে Vicuna ভাষা মডেলের সাথে একত্রিত করে। ৭, ১৩ এবং ৩৪ বিলিয়ন প্যারামিটারের রূপ পাওয়া যায়। মডেলটি সিন্থেটিক কাজে GPT-4-এর তুলনায় ৮৫.১% আপেক্ষিক কর্মক্ষমতা অর্জন করে<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-llava_paper-13)</sup>।

## প্রয়োগের ক্ষেত্র

- **ভিজ্যুয়াল প্রশ্নোত্তর (VQA)**: ব্যবহারকারীদের ভিজ্যুয়াল কন্টেন্ট সম্পর্কে প্রশ্ন করতে দেয়।
- **ডকুমেন্ট বিশ্লেষণ**: আধুনিক MLLM প্রতি মিনিটে ২০০০ পৃষ্ঠা পর্যন্ত প্রক্রিয়া করতে সক্ষম।
- **মেডিকেল ইমেজিং**: **Med-PaLM M** (Google)-এর মতো মডেলগুলো মেডিকেল চিত্র ও ক্লিনিকাল ডেটা বিশ্লেষণ করে।
- **রোবোটিক্স**: **RT-2** (Google DeepMind)-এর মতো মডেলগুলো রোবটকে ভিজ্যুয়াল পরিবেশ বুঝতে এবং প্রাকৃতিক ভাষায় নির্দেশ পালন করতে সক্ষম করে।

## বর্তমান সীমাবদ্ধতা

- **হ্যালুসিনেশন**: তৈরি করা কন্টেন্টে হ্যালুসিনেশনের মাত্রা ২৭–৪৬% হিসেবে মূল্যায়ন করা হয়। মডেলগুলো অবিদ্যমান বস্তু বর্ণনা করতে বা ভিজ্যুয়াল তথ্য ভুলভাবে ব্যাখ্যা করতে পারে<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_note-arxiv_hallucinations-14)</sup>।
- **উচ্চ গণনামূলক চাহিদা**: MLLM প্রশিক্ষণ ও ব্যবহারের জন্য উল্লেখযোগ্য গণনামূলক অবকাঠামো প্রয়োজন।
- **ডেটা পক্ষপাত**: প্রশিক্ষণ ডেটায় জনতাত্ত্বিক গোষ্ঠী, ভাষা ও সংস্কৃতির অপর্যাপ্ত প্রতিনিধিত্ব পদ্ধতিগত ত্রুটির দিকে নিয়ে যায়।

## তথ্যসূত্র

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## সাহিত্য

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## টীকা

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[৭]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[৮]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[৯]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[১০]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[১১]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[১২]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[১৩]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%E0%A6%AE%E0%A6%BE%E0%A6%B2%E0%A7%8D%E0%A6%9F%E0%A6%BF%E0%A6%AE%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B2_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[১৪]</a></span>
