---
title: "Multimodal large language models — 멀티모달 대형 언어 모델"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_—_멀티모달_대형_언어_모델"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4768
wiki_created_at: 2026-09-06T23:39:38Z
wiki_modified_at: 2026-09-06T23:39:38Z
downloaded_at: 2026-09-07T23:04:30Z
---

# Multimodal large language models — 멀티모달 대형 언어 모델

**멀티모달 대형 언어 모델** (영어: **Multimodal Large Language Models, MLLMs**) — 텍스트, 이미지, 오디오, 비디오 등 다양한 모달리티에서 정보를 처리하고 생성할 수 있는 인공지능 모델의 한 분류이다<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-encord_intro-1)</sup>. 단일 모달리티인 텍스트만을 다루는 유니모달 언어 모델과 달리, MLLM은 다양한 출처의 정보를 통합하여 복잡한 이해 및 콘텐츠 생성 과제를 수행한다.

    MLLM의 핵심 개념은 서로 다른 모달리티에 대한 통합 벡터 표현(embedding)을 생성하는 것이다. 이를 통해 모델은 예를 들어 이미지와 그에 대한 텍스트 설명 사이의 의미적 연관성을 확립할 수 있다[2]. 현대 MLLM의 기반을 마련한 핵심적인 돌파구는 CLIP 모델에서 구현된 것처럼, 시각적 표현과 텍스트 표현을 공통 특징 공간에 정렬하기 위한 대조 학습(contrastive learning)의 활용이었다[3].

## 발전의 역사

### 초기 시대 (2013–2020)

멀티모달 AI의 개념적 토대는 2013년에 마련되었으며, 스탠퍼드 연구자들이 단어 벡터 표현을 활용한 제로샷 학습(zero-shot learning)의 가능성을 입증하였다<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-deoldify2013-4)</sup>. 2016년에는 **FAIR** (Meta AI) 팀이 자연어 설명을 컴퓨터 비전 모델 학습에 활용하는 방식의 효과를 보여주었으며, 직접적인 학습 없이 ImageNet에서 11.5%의 정확도를 달성하였다<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-openai_fair_2016-5)</sup>.

### CLIP 시대 (2021)

혁명적인 전환점은 2021년 1월 OpenAI가 **CLIP** (*Contrastive Language-Image Pre-training*) 모델을 출시하면서 찾아왔다. 4억 쌍의 이미지-텍스트 데이터로 학습된 이 모델은 특정 과제에 대한 전문화된 학습 없이 이미지를 분류하는 능력을 보여주었다. CLIP은 이후 수많은 MLLM의 기반이 되었다<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-stanford_cs_clip-6)</sup>.

### 확장과 혁신 (2022–2024)

CLIP의 성공 이후 다수의 핵심 모델들이 등장하였다:

- **Flamingo** (DeepMind, 2022) — 소수 사례 학습(few-shot learning)에서 뛰어난 능력을 보인 800억 파라미터 모델.
- **BLIP** (Salesforce, 2022) — 이해와 생성을 위한 통합 아키텍처.
- **GPT-4V** (OpenAI, 2023) — 해당 규모의 첫 번째 상업용 멀티모달 모델.
- **LLaVA** (Microsoft, 2023) — GPT-4V의 인기 있는 오픈 소스 대안.
- **Gemini** (Google, 2023) — 다양한 데이터 유형을 처리하도록 처음부터 설계된 네이티브 멀티모달 아키텍처.
- **GPT-4o** (OpenAI, 2024) — 낮은 지연 시간으로 텍스트, 오디오, 비디오를 실시간 처리할 수 있는 모델<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — 향상된 시각 정보 분석 능력을 갖춘 모델.

## 아키텍처 접근 방식

### Dual-Encoder - 이중 인코더 아키텍처

각 모달리티에 대해 별도의 인코더를 사용하여 데이터를 공통 표현 공간에 투영한다. 대표적인 예로 **CLIP**이 있으며, 여기서 시각 트랜스포머는 이미지를, 텍스트 트랜스포머는 언어 데이터를 처리한다. 장점은 모듈성과 연산 효율성이며, 단점은 제한된 크로스 모달 상호작용이다<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-viso_ai_mllm-7)</sup>.

### 인코더-디코더 아키텍처

단일 인코더가 멀티모달 입력을 처리하고, 디코더가 텍스트 출력을 생성한다. **Flamingo** 모델은 가변 길이의 시각적 입력을 처리하기 위해 *Perceiver Resampler* 메커니즘과 크로스 모달 어텐션 레이어를 활용한다. 이 접근 방식은 풍부한 모달리티 간 상호작용을 제공하지만 더 많은 연산 자원을 필요로 한다<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-determined_ai_arch-8)</sup>.

### Alignment - 정렬 아키텍처

이 접근 방식은 동결된 사전학습 인코더를 소규모 학습 가능한 정렬 모듈을 통해 연결하는 방식을 사용한다. 예를 들어, **BLIP-2**는 동결된 시각 인코더와 언어 모델 사이의 경량 연결 요소로 **Q-Former** (*Querying Transformer*)를 사용하며, 학습 가능한 파라미터 수를 크게 줄인다<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-clarifai_blip2-9)</sup>.

## 주요 모델

### GPT-4V / GPT-4o (OpenAI)

GPT-4 모델 계열은 추정상 최대 **1조 8천억 개**의 파라미터를 보유하고 있다(혼합 전문가 아키텍처 기준). 2024년 5월에 출시된 **GPT-4o** 모델은 텍스트, 이미지, 오디오, 비디오의 실시간 처리를 지원한다. **MMMU** 벤치마크에서 **69.1%**의 정확도를 달성하였다<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

텍스트, 이미지, 오디오, 비디오를 처음부터 함께 학습한 네이티브 멀티모달 아키텍처이다. **Gemini 1.5 Pro**는 최대 **1천만 개의 토큰**에 달하는 컨텍스트 윈도우를 지원하며, 32개의 주요 벤치마크 중 30개에서 GPT-4를 능가한다<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

최대 20만 개의 토큰 컨텍스트 윈도우를 갖춘 모델 계열(Haiku, Sonnet, Opus)이다. **Claude 3 Opus**는 MMMU 벤치마크에서 **58.5%**를 기록한다. 모델의 안전성 향상을 위해 Constitutional AI 접근 방식이 사용된다<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (오픈 소스 모델)

CLIP 시각 인코더와 Vicuna 언어 모델을 결합한다. 70억, 130억, 340억 파라미터 버전이 제공된다. 이 모델은 합성 과제에서 GPT-4 대비 85.1%의 상대적 성능을 달성한다<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-llava_paper-13)</sup>.

## 응용 분야

- **시각적 질의응답 (VQA)**: 사용자가 시각적 콘텐츠에 대해 질문할 수 있도록 한다.
- **문서 분석**: 현대 MLLM은 분당 최대 2,000페이지를 처리할 수 있다.
- **의료 영상**: **Med-PaLM M** (Google)과 같은 모델이 의료 이미지와 임상 데이터를 분석한다.
- **로보틱스**: **RT-2** (Google DeepMind)와 같은 모델은 로봇이 시각적 환경을 이해하고 자연어 명령을 수행할 수 있도록 한다.

## 현재의 한계

- **환각(Hallucination)**: 생성된 콘텐츠에서 환각의 비율은 27~46%로 추정된다. 모델이 존재하지 않는 객체를 설명하거나 시각 정보를 잘못 해석할 수 있다<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_note-arxiv_hallucinations-14)</sup>.
- **높은 연산 요구량**: MLLM의 학습 및 활용에는 상당한 연산 인프라가 필요하다.
- **데이터 편향**: 학습 데이터에서 인구 집단, 언어, 문화의 불충분한 대표성이 체계적인 오류로 이어진다.

## 참조 링크

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## 참고 문헌

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## 주석

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_%E2%80%94_%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC_%EB%8C%80%ED%98%95_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
