---
title: "Encoder-only models — 인코더 전용 모델"
source: "https://systems-analysis.info/int/Encoder-only_models_%E2%80%94_%EC%9D%B8%EC%BD%94%EB%8D%94_%EC%A0%84%EC%9A%A9_%EB%AA%A8%EB%8D%B8"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_—_인코더_전용_모델"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1936
wiki_created_at: 2026-09-06T22:56:16Z
wiki_modified_at: 2026-09-06T22:56:16Z
downloaded_at: 2026-09-07T22:48:34Z
---

# Encoder-only models — 인코더 전용 모델

**인코더 전용 모델** (영어: Encoder-Only Models) — 대형 언어 모델(LLM) 아키텍처의 한 유형으로, **Transformer** 아키텍처의 **인코딩** 부분(인코더)만을 사용합니다. 디코더 또는 인코더-디코더 전체 아키텍처를 사용하는 모델과 달리, 이 모델들은 **자연어 이해(Natural Language Understanding, NLU)** 작업에 특화되어 있습니다.

이 접근 방식의 선구자이자 대표 모델은 2018년 Google이 개발한 **BERT** (Bidirectional Encoder Representations from Transformers)입니다.

## 개념 및 아키텍처

인코더 전용 모델의 핵심 아이디어는 입력 시퀀스의 각 token에 대해 깊이 있는 **문맥화된 표현(embedding)**을 생성하는 것입니다. Transformer의 **자기 주의(self-attention)** 메커니즘 덕분에, 각 token은 시퀀스 내 모든 다른 token을 "보고" 상호작용할 수 있어, 모델이 풍부한 문맥을 포착할 수 있습니다.

핵심 특징은 **양방향성**입니다. 각 token의 표현은 왼쪽과 오른쪽 문맥을 동시에 기반으로 형성됩니다. 이는 본질적으로 단방향인 자기회귀적 디코더 전용 모델(GPT 등)과 근본적으로 다른 점입니다.

아키텍처상으로, 모델은 $N$개의 동일한 인코더 레이어로 구성된 스택으로 이루어집니다. 각 레이어는 두 가지 주요 서브레이어로 구성됩니다:

1.  **다중 헤드 자기 주의(Multi-Head Self-Attention):** 각 token에 대한 문맥화된 표현을 계산합니다.
2.  **완전 연결 신경망(Feed-Forward Network):** 각 token 표현에 비선형 변환을 적용합니다.

모델의 출력으로는 입력 시퀀스와 동일한 길이의 벡터 시퀀스가 생성되며, 각 벡터는 대응하는 입력 token의 풍부한 표현입니다.

## 사전 학습 작업

모델이 양방향 문맥에서 언어를 이해하도록 학습시키기 위해, 특수한 자기지도(self-supervised) 사전 학습 작업이 사용됩니다.

### 마스킹 언어 모델링(Masked Language Modeling, MLM)

이는 인코더 전용 모델의 가장 핵심적인 작업으로, BERT에서 처음 소개되었습니다.

- **작동 원리:** 입력 시퀀스에서 소수의 token(일반적으로 15%)이 무작위로 숨겨(마스킹)집니다. 모델의 과제는 주변의 양방향 문맥을 활용하여 마스킹된 token의 원래 값을 예측하는 것입니다.
- **목적:** 이 작업은 모델로 하여금 단어 간의 깊은 의미론적·통사론적 관계를 학습하도록 유도합니다.

### 다음 문장 예측(Next Sentence Prediction, NSP)

이 작업(역시 원본 BERT에서 도입)은 모델이 문장 간의 관계를 이해하도록 학습시키기 위해 설계되었습니다.

- **작동 원리:** 모델에 문장 쌍이 입력되고, 두 번째 문장이 원문에서 첫 번째 문장의 논리적 이어지는 문장인지 판별해야 합니다.
- **현황:** 이후 연구(예: RoBERTa 모델)에서 NSP는 MLM보다 효과가 낮다는 것이 밝혀졌으며, 다른 작업으로 대체되거나 완전히 제거되는 경우가 많습니다.

## 활용 분야

인코더 전용 모델은 자기회귀적 디코더가 없기 때문에 자유로운 텍스트 생성에는 적합하지 않습니다. 이 모델의 강점은 텍스트 분석과 이해에 있습니다. 모델의 출력 벡터 표현은 다양한 NLU 작업에 활용됩니다.

- **텍스트 분류:** 감성 분석이나 주제 분류 같은 작업에는, 각 시퀀스의 맨 앞에 추가되는 특수 token \`\[CLS\]\`의 표현이 사용됩니다. 이 token의 최종 벡터는 전체 시퀀스 정보를 집약합니다.
- **Token 분류:** 개체명 인식(NER)이나 품사 태깅(POS-tagging) 같은 작업에는 각 개별 token의 벡터 표현이 사용됩니다.
- **질의 응답(Question Answering):** 주어진 텍스트에서 답변을 추출하는 방식의 질의 응답(extractive QA)에서, 모델은 답변의 시작 및 종료 token을 예측하도록 학습됩니다.
- **Embedding 추출:** 인코더 모델은 고품질 문장 또는 문서 embedding을 얻기 위한 범용 텍스트 인코더로 자주 활용되며, 이는 검색 시스템이나 의미적 유사도 작업에 사용될 수 있습니다.

## 주요 모델과 발전 과정

- **BERT** (2018): 아키텍처의 선구자로, 다수의 NLP benchmark에서 새로운 기록을 수립했습니다.
- **RoBERTa** (2019): '견고하게 최적화된 BERT'. 더 많은 데이터로 더 오래 학습하고 NSP 작업을 제거함으로써 BERT의 성능을 크게 향상시킬 수 있음을 보여주었습니다.
- **ALBERT** (2019): 'A Lite BERT'. embedding 인수분해 및 레이어 간 파라미터 공유 기법을 통해 파라미터 수를 대폭 줄인 모델입니다.
- **DistilBERT** (2019): 지식 증류(knowledge distillation)를 통해 만들어진 BERT의 경량화 버전으로, 더 빠르고 가볍지만 원본 성능의 대부분을 유지합니다.
- **ELECTRA** (2020): 보다 효율적인 사전 학습 작업인 **replaced token detection**을 도입했습니다. 모델이 소형 생성기 모델이 생성한 '가짜' token과 원본 token을 구별하도록 학습합니다.
- **DeBERTa** (2020): token의 내용과 상대적 위치를 별도로 인코딩하는 '분리된 주의(disentangled attention)' 메커니즘을 도입했습니다.

## 같이 보기

- BERT
