---
title: "Decoder-only models (architecture) (KO)"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_(KO)"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1540
wiki_created_at: 2026-09-06T22:50:13Z
wiki_modified_at: 2026-09-06T22:50:13Z
downloaded_at: 2026-09-07T22:46:30Z
---

# Decoder-only models (architecture) (KO)

**디코더 전용 모델** (영어: Decoder-Only Models) — 이것은 **트랜스포머(Transformer)** 아키텍처의 **디코딩** 부분(디코더)만을 기반으로 하는 대형 언어 모델(LLM)의 지배적인 아키텍처 클래스입니다. 이 모델들은 **텍스트 생성** 작업에 특화되어 있으며, 대부분의 현대적인 챗봇과 AI 어시스턴트의 기반을 이룹니다.

이 접근 방식을 대중화한 대표적인 모델 시리즈는 OpenAI의 **GPT** 시리즈입니다.

## 개념 및 아키텍처

디코더 전용 모델의 핵심 아이디어는 시퀀스의 **자기회귀적 생성(autoregressive generation)**입니다. 이는 모델이 이전에 생성된 모든 token을 기반으로 다음 token을 예측한다는 것을 의미합니다. 입력 prompt(사용자 요청)와 이미 생성된 텍스트는 모델이 계속 이어가는 하나의 시퀀스로 취급됩니다.

아키텍처 측면에서, 모델은 $N$개의 동일한 디코더 레이어가 쌓인 구조로 이루어져 있습니다. 각 레이어는 인코더나 완전한 디코더와 달리 두 가지 주요 서브레이어만을 포함합니다:

1.  **마스킹된 멀티헤드 셀프 어텐션 (Masked Multi-Head Self-Attention):** 이것은 자기회귀적 특성을 보장하는 핵심 메커니즘입니다. 시퀀스를 처리하는 동안 특수한 **인과 마스크(causal mask)**가 각 token이 후속 token을 "참조"하지 못하도록 합니다. 따라서 위치 $i$에 대한 예측은 위치 $< i$의 token에만 의존합니다.
2.  **완전 연결 신경망 (Feed-Forward Network):** 각 token의 표현에 비선형 변환을 적용합니다.

디코더 전용 모델에는 **교차 어텐션(cross-attention)** 메커니즘이 존재하지 않습니다. "어텐션"을 기울일 인코더가 없기 때문입니다.

## 사전 학습 작업

디코더 전용 모델은 하나의, 그러나 매우 강력한 자기지도(self-supervised) 작업으로 학습됩니다:

### 인과적 언어 모델링 (Causal Language Modeling, CLM)

- **작동 원리:** 모델은 시퀀스에서 다음 token을 예측하도록 학습됩니다. 각 학습 단계에서 모델은 텍스트 단편을 입력으로 받아 다음 token에 대한 확률 분포를 생성해야 합니다.
- **목표:** 방대한 텍스트 데이터에서 올바른 다음 token의 확률을 최대화하는 것입니다. 언뜻 단순해 보이는 이 작업은 모델이 문법, 구문, 세계에 관한 사실, 그리고 언어의 복잡한 패턴을 학습하도록 강제합니다.

## 적용 분야

자기회귀적 특성 덕분에, 디코더 전용 모델은 텍스트 생성이 필요한 모든 작업에 이상적으로 적합합니다:

- **자유 형식 텍스트 생성:** 기사, 시, 시나리오 등의 작성.
- **대화 시스템 및 챗봇:** 대화체 스타일로 사용자 질문에 응답.
- **요약(Summarization):** 긴 텍스트의 요약본 생성.
- **기계 번역:** 이를 위해 인코더-디코더 모델이 자주 사용되지만, 디코더 전용 모델도 작업이 prompt에 명시된 경우(예: "영어에서 한국어로 번역하시오: ...") 번역을 수행할 수 있습니다.
- **코드 작성:** 텍스트 설명을 기반으로 코드 생성.
- **인컨텍스트 학습 (In-context learning):** 규모 덕분에 대형 디코더 모델은 fine-tuning 없이도 prompt 내에서 단 몇 가지 예시(*few-shot*)만으로, 또는 예시 없이도(*zero-shot*) 새로운 작업을 해결하는 능력을 보여줍니다.

## 주요 모델 및 그 발전

- **GPT 시리즈** (2018-현재): 이 접근 방식의 선구자이자 대중화를 이끈 모델들. GPT-1은 사전 학습의 효과를 보여주었고, GPT-2는 스케일링의 강력함을 증명했으며, GPT-3은 *few-shot* 능력의 등장을 보여주었습니다. ChatGPT와 GPT-4는 이 아키텍처를 AI 어시스턴트의 표준으로 만들었습니다.
- **LLaMA** (2023-현재): Meta의 오픈 모델 시리즈로, 강력한 LLM에 대한 접근성을 민주화하고 커뮤니티의 혁신 물결을 촉진했습니다.
- **Claude** (2023-현재): Anthropic의 모델 패밀리로, **Constitutional AI**를 통한 안전성과 제어 가능성에 초점을 맞추고 있습니다.
- **PaLM** 및 **Gemini** (2022-현재): Google의 플래그십 모델들. Gemini는 또한 네이티브 멀티모달 디코더 전용 모델이기도 합니다.

## 다른 아키텍처와의 비교

| 아키텍처          | 주요 작업             | 컨텍스트 방향                     | 대표 모델                  |
|-------------------|-----------------------|-----------------------------------|----------------------------|
| **디코더 전용**   | 텍스트 생성           | 단방향 (왼쪽에서 오른쪽)          | GPT, LLaMA, Claude, Gemini |
| **인코더 전용**   | 텍스트 이해           | 양방향                            | BERT, RoBERTa              |
| **인코더-디코더** | 시퀀스-투-시퀀스 변환 | 양방향 (인코더) + 단방향 (디코더) | T5, BART, 원본 Transformer |

트랜스포머 기반 핵심 아키텍처 비교

## 같이 보기

- GPT
