---
title: "Multimodal large language models (ID)"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_(ID)"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_(ID)"
language: "id"
categories:
  - "Category:Indonesian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4750
wiki_created_at: 2026-09-06T23:39:24Z
wiki_modified_at: 2026-09-06T23:39:24Z
downloaded_at: 2026-09-07T23:04:23Z
---

# Multimodal large language models (ID)

**Model bahasa besar multimodal** (Ingg. **Multimodal Large Language Models, MLLMs**) — adalah kelas model kecerdasan buatan yang mampu memproses dan menghasilkan informasi dalam berbagai modalitas, termasuk teks, gambar, audio, dan video<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-encord_intro-1)</sup>. Berbeda dengan model bahasa unimodal yang bekerja secara eksklusif dengan teks, MLLM mengintegrasikan informasi dari berbagai sumber untuk menyelesaikan tugas pemahaman dan pembuatan konten yang kompleks.

Konsep utama MLLM adalah pembuatan representasi vektor tunggal (embedding) untuk berbagai modalitas. Hal ini memungkinkan model untuk membangun koneksi semantik antara, misalnya, gambar dan deskripsi tekstualnya<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-acm_survey-2)</sup>. Terobosan kunci yang meletakkan dasar MLLM modern adalah penggunaan pembelajaran kontrastif untuk menyelaraskan representasi visual dan tekstual dalam ruang fitur bersama, sebagaimana diimplementasikan dalam model **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-radford2021-3)</sup>.

## Sejarah Perkembangan

### Periode Awal (2013–2020)

Dasar konseptual AI multimodal diletakkan pada tahun 2013, ketika para peneliti dari Stanford mendemonstrasikan kemungkinan pembelajaran zero-shot (zero-shot learning) menggunakan representasi vektor kata<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-deoldify2013-4)</sup>. Pada tahun 2016, tim **FAIR** (Meta AI) menunjukkan efektivitas penggunaan deskripsi bahasa alami untuk melatih model computer vision, mencapai akurasi 11,5% pada ImageNet tanpa pelatihan langsung<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-openai_fair_2016-5)</sup>.

### Era CLIP (2021)

Momen revolusioner adalah peluncuran model **CLIP** (*Contrastive Language-Image Pre-training*) oleh OpenAI pada Januari 2021. Model yang dilatih pada 400 juta pasang gambar-teks ini mendemonstrasikan kemampuan mengklasifikasikan gambar tanpa pelatihan khusus pada tugas-tugas tertentu. CLIP menjadi dasar bagi banyak MLLM berikutnya<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-stanford_cs_clip-6)</sup>.

### Penskalaan dan Inovasi (2022–2024)

Setelah keberhasilan CLIP, muncul berbagai model kunci:

- **Flamingo** (DeepMind, 2022) — model 80 miliar parameter yang menunjukkan kemampuan luar biasa dalam few-shot learning.
- **BLIP** (Salesforce, 2022) — arsitektur terpadu untuk pemahaman dan pembuatan konten.
- **GPT-4V** (OpenAI, 2023) — model multimodal komersial pertama pada skala tersebut.
- **LLaVA** (Microsoft, 2023) — alternatif sumber terbuka yang populer untuk GPT-4V.
- **Gemini** (Google, 2023) — arsitektur multimodal native yang dirancang dari awal untuk bekerja dengan berbagai jenis data.
- **GPT-4o** (OpenAI, 2024) — model yang mampu memproses teks, audio, dan video secara real-time dengan latensi rendah<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — model dengan kemampuan analisis informasi visual yang ditingkatkan.

## Pendekatan Arsitektur

### Arsitektur Dual-Encoder

Menggunakan encoder terpisah untuk setiap modalitas yang memproyeksikan data ke dalam ruang representasi bersama. Contoh menonjolnya adalah **CLIP**, di mana visual transformer memproses gambar, sementara encoder tekstual memproses data bahasa. Keunggulannya adalah modularitas dan efisiensi komputasi, sedangkan kekurangannya adalah keterbatasan interaksi lintas modalitas<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-viso_ai_mllm-7)</sup>.

### Arsitektur Encoder-Decoder

Encoder tunggal memproses input multimodal, sementara decoder menghasilkan output teks. Model **Flamingo** menggunakan mekanisme *Perceiver Resampler* untuk memproses input visual dengan panjang variabel dan lapisan cross-modal attention. Pendekatan ini memungkinkan interaksi antar modalitas yang kaya, tetapi membutuhkan sumber daya komputasi yang lebih besar<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-determined_ai_arch-8)</sup>.

### Arsitektur Alignment

Pendekatan ini menggunakan encoder yang telah dilatih sebelumnya dan dibekukan (frozen), yang dihubungkan melalui modul alignment yang dapat dilatih berukuran kecil. Misalnya, **BLIP-2** menggunakan **Q-Former** (*Querying Transformer*) sebagai elemen penghubung ringan antara encoder visual yang dibekukan dan model bahasa, sehingga membutuhkan jauh lebih sedikit parameter yang dapat dilatih<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-clarifai_blip2-9)</sup>.

## Model Utama

### GPT-4V / GPT-4o (OpenAI)

Keluarga model GPT-4 diperkirakan memiliki hingga **1,8 triliun** parameter (dalam arsitektur mixture of experts). Model **GPT-4o**, yang dirilis pada Mei 2024, mendukung pemrosesan teks, gambar, audio, dan video secara real-time. Pada benchmark **MMMU**, model ini mencapai akurasi **69,1%**<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Arsitektur multimodal native yang dilatih dari awal pada teks, gambar, audio, dan video. **Gemini 1.5 Pro** mendukung jendela konteks hingga **10 juta token** dan melampaui GPT-4 pada 30 dari 32 benchmark populer<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Keluarga model (Haiku, Sonnet, Opus) dengan jendela konteks hingga 200.000 token. **Claude 3 Opus** menunjukkan **58,5%** pada benchmark MMMU. Pendekatan Constitutional AI digunakan untuk meningkatkan keamanan model<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (model sumber terbuka)

Menggabungkan encoder visual CLIP dengan model bahasa Vicuna. Tersedia dalam varian dengan 7, 13, dan 34 miliar parameter. Model ini mencapai 85,1% dari performa relatif GPT-4 pada tugas-tugas sintetis<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-llava_paper-13)</sup>.

## Bidang Penerapan

- **Visual Question Answering (VQA)**: Memungkinkan pengguna mengajukan pertanyaan tentang konten visual.
- **Analisis dokumen**: MLLM modern mampu memproses hingga 2.000 halaman per menit.
- **Pencitraan medis**: Model seperti **Med-PaLM M** (Google) menganalisis gambar medis dan data klinis.
- **Robotika**: Model seperti **RT-2** (Google DeepMind) memungkinkan robot memahami lingkungan visual dan menjalankan perintah dalam bahasa alami.

## Keterbatasan Saat Ini

- **Halusinasi**: Tingkat halusinasi dalam konten yang dihasilkan diperkirakan mencapai 27–46%. Model dapat mendeskripsikan objek yang tidak ada atau salah menginterpretasikan informasi visual<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_note-arxiv_hallucinations-14)</sup>.
- **Kebutuhan komputasi tinggi**: Pelatihan dan penggunaan MLLM memerlukan infrastruktur komputasi yang signifikan.
- **Bias data**: Kurangnya representasi kelompok demografis, bahasa, dan budaya dalam data pelatihan menyebabkan kesalahan sistematis.

## Tautan

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## Daftar Pustaka

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## Catatan

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(ID)#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
