Decoder-only models (architecture) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

디코더 전용 모델 (영어: Decoder-Only Models) — 이것은 트랜스포머(Transformer) 아키텍처의 디코딩 부분(디코더)만을 기반으로 하는 대형 언어 모델(LLM)의 지배적인 아키텍처 클래스입니다. 이 모델들은 텍스트 생성 작업에 특화되어 있으며, 대부분의 현대적인 챗봇과 AI 어시스턴트의 기반을 이룹니다.

이 접근 방식을 대중화한 대표적인 모델 시리즈는 OpenAI의 GPT 시리즈입니다.

개념 및 아키텍처

디코더 전용 모델의 핵심 아이디어는 시퀀스의 자기회귀적 생성(autoregressive generation)입니다. 이는 모델이 이전에 생성된 모든 token을 기반으로 다음 token을 예측한다는 것을 의미합니다. 입력 prompt(사용자 요청)와 이미 생성된 텍스트는 모델이 계속 이어가는 하나의 시퀀스로 취급됩니다.

아키텍처 측면에서, 모델은 N개의 동일한 디코더 레이어가 쌓인 구조로 이루어져 있습니다. 각 레이어는 인코더나 완전한 디코더와 달리 두 가지 주요 서브레이어만을 포함합니다:

  1. 마스킹된 멀티헤드 셀프 어텐션 (Masked Multi-Head Self-Attention): 이것은 자기회귀적 특성을 보장하는 핵심 메커니즘입니다. 시퀀스를 처리하는 동안 특수한 인과 마스크(causal mask)가 각 token이 후속 token을 "참조"하지 못하도록 합니다. 따라서 위치 i에 대한 예측은 위치 <i의 token에만 의존합니다.
  2. 완전 연결 신경망 (Feed-Forward Network): 각 token의 표현에 비선형 변환을 적용합니다.

디코더 전용 모델에는 교차 어텐션(cross-attention) 메커니즘이 존재하지 않습니다. "어텐션"을 기울일 인코더가 없기 때문입니다.

사전 학습 작업

디코더 전용 모델은 하나의, 그러나 매우 강력한 자기지도(self-supervised) 작업으로 학습됩니다:

인과적 언어 모델링 (Causal Language Modeling, CLM)

  • 작동 원리: 모델은 시퀀스에서 다음 token을 예측하도록 학습됩니다. 각 학습 단계에서 모델은 텍스트 단편을 입력으로 받아 다음 token에 대한 확률 분포를 생성해야 합니다.
  • 목표: 방대한 텍스트 데이터에서 올바른 다음 token의 확률을 최대화하는 것입니다. 언뜻 단순해 보이는 이 작업은 모델이 문법, 구문, 세계에 관한 사실, 그리고 언어의 복잡한 패턴을 학습하도록 강제합니다.

적용 분야

자기회귀적 특성 덕분에, 디코더 전용 모델은 텍스트 생성이 필요한 모든 작업에 이상적으로 적합합니다:

  • 자유 형식 텍스트 생성: 기사, 시, 시나리오 등의 작성.
  • 대화 시스템 및 챗봇: 대화체 스타일로 사용자 질문에 응답.
  • 요약(Summarization): 긴 텍스트의 요약본 생성.
  • 기계 번역: 이를 위해 인코더-디코더 모델이 자주 사용되지만, 디코더 전용 모델도 작업이 prompt에 명시된 경우(예: "영어에서 한국어로 번역하시오: ...") 번역을 수행할 수 있습니다.
  • 코드 작성: 텍스트 설명을 기반으로 코드 생성.
  • 인컨텍스트 학습 (In-context learning): 규모 덕분에 대형 디코더 모델은 fine-tuning 없이도 prompt 내에서 단 몇 가지 예시(few-shot)만으로, 또는 예시 없이도(zero-shot) 새로운 작업을 해결하는 능력을 보여줍니다.

주요 모델 및 그 발전

  • GPT 시리즈 (2018-현재): 이 접근 방식의 선구자이자 대중화를 이끈 모델들. GPT-1은 사전 학습의 효과를 보여주었고, GPT-2는 스케일링의 강력함을 증명했으며, GPT-3은 few-shot 능력의 등장을 보여주었습니다. ChatGPT와 GPT-4는 이 아키텍처를 AI 어시스턴트의 표준으로 만들었습니다.
  • LLaMA (2023-현재): Meta의 오픈 모델 시리즈로, 강력한 LLM에 대한 접근성을 민주화하고 커뮤니티의 혁신 물결을 촉진했습니다.
  • Claude (2023-현재): Anthropic의 모델 패밀리로, Constitutional AI를 통한 안전성과 제어 가능성에 초점을 맞추고 있습니다.
  • PaLMGemini (2022-현재): Google의 플래그십 모델들. Gemini는 또한 네이티브 멀티모달 디코더 전용 모델이기도 합니다.

다른 아키텍처와의 비교

트랜스포머 기반 핵심 아키텍처 비교
아키텍처 주요 작업 컨텍스트 방향 대표 모델
디코더 전용 텍스트 생성 단방향 (왼쪽에서 오른쪽) GPT, LLaMA, Claude, Gemini
인코더 전용 텍스트 이해 양방향 BERT, RoBERTa
인코더-디코더 시퀀스-투-시퀀스 변환 양방향 (인코더) + 단방향 (디코더) T5, BART, 원본 Transformer

같이 보기

  • GPT