Multimodal large language models — 멀티모달 대형 언어 모델
멀티모달 대형 언어 모델 (영어: Multimodal Large Language Models, MLLMs) — 텍스트, 이미지, 오디오, 비디오 등 다양한 모달리티에서 정보를 처리하고 생성할 수 있는 인공지능 모델의 한 분류이다[1]. 단일 모달리티인 텍스트만을 다루는 유니모달 언어 모델과 달리, MLLM은 다양한 출처의 정보를 통합하여 복잡한 이해 및 콘텐츠 생성 과제를 수행한다.
MLLM의 핵심 개념은 서로 다른 모달리티에 대한 통합 벡터 표현(embedding)을 생성하는 것이다. 이를 통해 모델은 예를 들어 이미지와 그에 대한 텍스트 설명 사이의 의미적 연관성을 확립할 수 있다[2]. 현대 MLLM의 기반을 마련한 핵심적인 돌파구는 CLIP 모델에서 구현된 것처럼, 시각적 표현과 텍스트 표현을 공통 특징 공간에 정렬하기 위한 대조 학습(contrastive learning)의 활용이었다[3].
발전의 역사
초기 시대 (2013–2020)
멀티모달 AI의 개념적 토대는 2013년에 마련되었으며, 스탠퍼드 연구자들이 단어 벡터 표현을 활용한 제로샷 학습(zero-shot learning)의 가능성을 입증하였다[4]. 2016년에는 FAIR (Meta AI) 팀이 자연어 설명을 컴퓨터 비전 모델 학습에 활용하는 방식의 효과를 보여주었으며, 직접적인 학습 없이 ImageNet에서 11.5%의 정확도를 달성하였다[5].
CLIP 시대 (2021)
혁명적인 전환점은 2021년 1월 OpenAI가 CLIP (Contrastive Language-Image Pre-training) 모델을 출시하면서 찾아왔다. 4억 쌍의 이미지-텍스트 데이터로 학습된 이 모델은 특정 과제에 대한 전문화된 학습 없이 이미지를 분류하는 능력을 보여주었다. CLIP은 이후 수많은 MLLM의 기반이 되었다[6].
확장과 혁신 (2022–2024)
CLIP의 성공 이후 다수의 핵심 모델들이 등장하였다:
- Flamingo (DeepMind, 2022) — 소수 사례 학습(few-shot learning)에서 뛰어난 능력을 보인 800억 파라미터 모델.
- BLIP (Salesforce, 2022) — 이해와 생성을 위한 통합 아키텍처.
- GPT-4V (OpenAI, 2023) — 해당 규모의 첫 번째 상업용 멀티모달 모델.
- LLaVA (Microsoft, 2023) — GPT-4V의 인기 있는 오픈 소스 대안.
- Gemini (Google, 2023) — 다양한 데이터 유형을 처리하도록 처음부터 설계된 네이티브 멀티모달 아키텍처.
- GPT-4o (OpenAI, 2024) — 낮은 지연 시간으로 텍스트, 오디오, 비디오를 실시간 처리할 수 있는 모델[1].
- Claude 3.5 Sonnet (Anthropic, 2024) — 향상된 시각 정보 분석 능력을 갖춘 모델.
아키텍처 접근 방식
Dual-Encoder - 이중 인코더 아키텍처
각 모달리티에 대해 별도의 인코더를 사용하여 데이터를 공통 표현 공간에 투영한다. 대표적인 예로 CLIP이 있으며, 여기서 시각 트랜스포머는 이미지를, 텍스트 트랜스포머는 언어 데이터를 처리한다. 장점은 모듈성과 연산 효율성이며, 단점은 제한된 크로스 모달 상호작용이다[7].
인코더-디코더 아키텍처
단일 인코더가 멀티모달 입력을 처리하고, 디코더가 텍스트 출력을 생성한다. Flamingo 모델은 가변 길이의 시각적 입력을 처리하기 위해 Perceiver Resampler 메커니즘과 크로스 모달 어텐션 레이어를 활용한다. 이 접근 방식은 풍부한 모달리티 간 상호작용을 제공하지만 더 많은 연산 자원을 필요로 한다[8].
Alignment - 정렬 아키텍처
이 접근 방식은 동결된 사전학습 인코더를 소규모 학습 가능한 정렬 모듈을 통해 연결하는 방식을 사용한다. 예를 들어, BLIP-2는 동결된 시각 인코더와 언어 모델 사이의 경량 연결 요소로 Q-Former (Querying Transformer)를 사용하며, 학습 가능한 파라미터 수를 크게 줄인다[9].
주요 모델
GPT-4V / GPT-4o (OpenAI)
GPT-4 모델 계열은 추정상 최대 1조 8천억 개의 파라미터를 보유하고 있다(혼합 전문가 아키텍처 기준). 2024년 5월에 출시된 GPT-4o 모델은 텍스트, 이미지, 오디오, 비디오의 실시간 처리를 지원한다. MMMU 벤치마크에서 69.1%의 정확도를 달성하였다[10].
Gemini (Google)
텍스트, 이미지, 오디오, 비디오를 처음부터 함께 학습한 네이티브 멀티모달 아키텍처이다. Gemini 1.5 Pro는 최대 1천만 개의 토큰에 달하는 컨텍스트 윈도우를 지원하며, 32개의 주요 벤치마크 중 30개에서 GPT-4를 능가한다[11].
Claude 3 (Anthropic)
최대 20만 개의 토큰 컨텍스트 윈도우를 갖춘 모델 계열(Haiku, Sonnet, Opus)이다. Claude 3 Opus는 MMMU 벤치마크에서 58.5%를 기록한다. 모델의 안전성 향상을 위해 Constitutional AI 접근 방식이 사용된다[12].
LLaVA (오픈 소스 모델)
CLIP 시각 인코더와 Vicuna 언어 모델을 결합한다. 70억, 130억, 340억 파라미터 버전이 제공된다. 이 모델은 합성 과제에서 GPT-4 대비 85.1%의 상대적 성능을 달성한다[13].
응용 분야
- 시각적 질의응답 (VQA): 사용자가 시각적 콘텐츠에 대해 질문할 수 있도록 한다.
- 문서 분석: 현대 MLLM은 분당 최대 2,000페이지를 처리할 수 있다.
- 의료 영상: Med-PaLM M (Google)과 같은 모델이 의료 이미지와 임상 데이터를 분석한다.
- 로보틱스: RT-2 (Google DeepMind)와 같은 모델은 로봇이 시각적 환경을 이해하고 자연어 명령을 수행할 수 있도록 한다.
현재의 한계
- 환각(Hallucination): 생성된 콘텐츠에서 환각의 비율은 27~46%로 추정된다. 모델이 존재하지 않는 객체를 설명하거나 시각 정보를 잘못 해석할 수 있다[14].
- 높은 연산 요구량: MLLM의 학습 및 활용에는 상당한 연산 인프라가 필요하다.
- 데이터 편향: 학습 데이터에서 인구 집단, 언어, 문화의 불충분한 대표성이 체계적인 오류로 이어진다.
참조 링크
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
참고 문헌
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
주석
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
- ↑ «Understanding CLIP». Stanford CS231n. [6]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [8]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [11]
- ↑ «Introducing the Claude 3 Family». Anthropic. [12]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]