---
title: "Theoretical foundations of large language models — LLM의 이론적 기초"
source: "https://systems-analysis.info/int/Theoretical_foundations_of_large_language_models_%E2%80%94_LLM%EC%9D%98_%EC%9D%B4%EB%A1%A0%EC%A0%81_%EA%B8%B0%EC%B4%88"
wiki: "systems-analysis.info/int"
article: "Theoretical_foundations_of_large_language_models_—_LLM의_이론적_기초"
language: "ko"
categories:
  - "Category:Core LLM concepts"
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 8061
wiki_created_at: 2026-09-07T01:11:46Z
wiki_modified_at: 2026-09-07T01:11:46Z
downloaded_at: 2026-09-07T23:23:11Z
---

# Theoretical foundations of large language models — LLM의 이론적 기초

**대형 언어 모델(LLM)의 이론적 기초 (트랜스포머 아키텍처 기반)**는 현대 대형 언어 모델(LLM)의 작동, 학습 및 능력의 근간을 이루는 수학적, 통계적, 정보이론적 원리의 집합입니다. 이 기초들은 트랜스포머(Transformer) 아키텍처를 기반으로 구축된 모델들이 어떻게 높은 수준의 일관성을 갖추고 인간의 언어를 이해하고 생성할 수 있는지를 설명합니다.

## 아키텍처적 기초: Transformer - 트랜스포머 아키텍처

현대 LLM은 거의 전적으로 2017년 논문 「Attention Is All You Need」에서 발표된 **트랜스포머** 아키텍처를 기반으로 합니다. 이 아키텍처는 순환 레이어(RNN 및 LSTM 방식)를 포기하고 **어텐션(attention)** 메커니즘에 집중함으로써 긴 시퀀스를 효율적으로 처리하고 연산을 병렬화할 수 있게 되었습니다.

### 메커니즘 자기 어텐션 (Self-Attention)

이것은 트랜스포머 아키텍처의 핵심입니다. 자기 어텐션 메커니즘은 모델이 시퀀스 내의 각 단어(token)의 중요도를 동일한 시퀀스 내의 다른 모든 단어에 대해 가중치를 부여할 수 있게 합니다. 각 token에 대해 세 개의 벡터가 생성됩니다:

- **Query (Q, 쿼리):** 현재 단어를 나타내는 벡터.
- **Key (K, 키):** 다른 단어의 쿼리와 비교되는 벡터.
- **Value (V, 값):** 이후로 전달될 단어 정보를 포함하는 벡터.

어텐션 점수는 스케일된 내적으로 계산됩니다:

$\text{Attention}(Q,K,V) = \text{softmax}\left( \frac{QK^{T}}{\sqrt{d_{k}}} \right)V$

여기서 $d_{k}$는 키 벡터의 차원 수입니다. 이 메커니즘을 통해 모델은 단어 간의 거리에 상관없이 복잡한 문맥적 의존 관계를 파악할 수 있습니다.

**멀티헤드 어텐션 (Multi-Head Attention)**은 서로 다른 투영 행렬을 사용하여 이러한 연산을 병렬로 여러 번 수행하는 것으로, 모델이 구문과 의미의 다양한 측면에 동시에 집중할 수 있게 합니다.

### Transformer - 트랜스포머 기반 아키텍처 유형

트랜스포머 구성 요소를 활용하는 세 가지 주요 방식이 있습니다:

1.  **인코더-디코더 (Encoder-Decoder):** 시퀀스-투-시퀀스 변환 작업(예: 기계 번역)을 위한 고전적인 아키텍처. 인코더는 입력 시퀀스를 처리하고, 디코더는 출력을 생성합니다. 예시: T5, BART.
2.  **인코더 전용 (Encoder-Only):** 인코더 스택만을 사용하는 모델. 전체 시퀀스의 문맥에 대한 깊은 이해가 필요한 작업(텍스트 분류, 개체명 인식)에 적합합니다. 예시: BERT.
3.  **디코더 전용 (Decoder-Only):** 디코더 스택만을 사용하는 모델. 자기 회귀적으로 작동하여 이전 token을 기반으로 다음 token을 예측합니다. 이는 생성 모델의 표준입니다. 예시: GPT, LLaMA, Claude.

### Positional Encoding - 위치 인코딩

자기 어텐션 메커니즘은 단어의 순서를 고려하지 않기 때문에 아키텍처에 **위치 인코딩**이 추가됩니다. token 임베딩에 시퀀스 내 위치를 인코딩하는 벡터가 더해집니다. 원래 모델에서는 사인 함수가 사용되었습니다:

$\text{PE}(\text{pos},2i) = \sin(\text{pos}/10000^{2i/d_{\text{model}}})$

$\text{PE}(\text{pos},2i + 1) = \cos(\text{pos}/10000^{2i/d_{\text{model}}})$

현대 모델에서는 학습 가능한 위치 인코딩과 회전식 위치 임베딩(Rotary Position Embeddings, RoPE)도 사용됩니다.

## 학습 원리: 확률에서 최적화까지

### 확률론적 과제로서의 언어 모델링

LLM의 핵심에는 텍스트 시퀀스의 확률을 예측하는 **언어 모델링** 과제가 있습니다. 형식적으로, 시퀀스 $X = (x_{1},x_{2},\ldots,x_{T})$에 대해 모델은 확률 $P(X)$을 추정합니다. 연쇄 확률 법칙을 이용하면 이는 조건부 확률의 곱으로 분해됩니다:

$P(X) = \prod\limits_{t = 1}^{T}P(x_{t}|x_{1},\ldots,x_{t - 1})$

따라서 모델의 학습은 이전 token들의 문맥을 기반으로 다음 token $x_{t}$을 예측하는 것으로 귀결됩니다.

### 손실 함수와 정보이론

모델의 예측 품질을 평가하고 학습하기 위해 **크로스 엔트로피 손실 함수**가 사용됩니다. 이는 모델이 예측한 확률 분포($q$)와 실제 분포($p$) 사이의 차이를 측정하며, 여기서 올바른 다음 token의 확률은 1이고 나머지는 0입니다.

$H(p,q) = - \sum\limits_{i}p(i)\log q(i)$

크로스 엔트로피 최소화는 학습 데이터의 우도(likelihood) 최대화와 동치입니다.

관련된 품질 지표로 **퍼플렉서티(perplexity)**가 있으며, 이는 크로스 엔트로피의 지수로 정의됩니다: $\text{Perplexity} = 2^{H(p,q)}$. 직관적으로, 퍼플렉서티는 각 단계에서 모델이 «선택하는» 평균 후보 수를 나타냅니다. 퍼플렉서티가 낮을수록 모델이 더 자신감 있고 정확합니다.

### 최적화

LLM의 학습은 수십억 개의 모델 파라미터를 조정하여 손실 함수를 최소화하는 과정입니다. 이를 위해 **경사 하강법**을 기반으로 한 방법들이 사용됩니다. 가장 일반적인 것은 각 파라미터에 대해 학습률을 적응적으로 조정하는 **Adam** (Adaptive Moment Estimation) 최적화기와 그 변형들(예: AdamW)입니다.

### 학습 패러다임

1.  **사전 학습 (Pre-training):** 모델이 자기 지도 학습 방식의 과제를 사용하여 방대한 비레이블 텍스트 코퍼스(Common Crawl, The Pile, C4)로 학습됩니다. 과제로는 다음이 포함됩니다:
    - **인과적 언어 모델링 (CLM):** 다음 token 예측 (GPT에서 사용).
    - **마스크된 언어 모델링 (MLM):** 텍스트에서 무작위로 마스크된 token 복원 (BERT에서 사용).
2.  **파인튜닝 (Fine-tuning):** 사전 학습 후 모델은 소규모 레이블 데이터셋을 사용하여 특정 작업에 맞게 적응됩니다.
3.  **정렬 (Alignment):** 모델의 행동을 인간의 선호와 가치관에 맞추기 위한 특별한 파인튜닝 단계. 핵심 방법은 **RLHF (Reinforcement Learning from Human Feedback)**로, 인간의 선호를 예측하는 모델의 보상 신호를 활용하여 모델을 파인튜닝합니다.

## Scaling Laws - 스케일링 법칙과 창발적 능력

경험적 연구에 따르면 LLM의 성능은 세 가지 요소의 증가와 함께 예측 가능하게 향상됩니다: 모델 크기(파라미터 수, $N$), 학습 데이터셋 크기($D$), 그리고 연산량($C$). 이 의존 관계는 **스케일링 법칙(scaling laws)**으로 기술됩니다.

OpenAI 논문(Kaplan et al., 2020)에서 제안된 법칙은 손실 함수 $L$이 $N$, $D$, $C$의 거듭제곱 함수로 감소함을 보여줍니다. DeepMind의 후속 연구(Hoffmann et al., 2022)는 이러한 법칙을 보완하여(**친칠라 법칙(Chinchilla laws)**), 최적 학습을 위해서는 모델 크기와 데이터 양 모두를 균형 있게 늘려야 함을 보였습니다.

스케일링의 중요한 결과는 **창발적 능력(emergent abilities)**의 출현입니다. 이는 모델이 명시적으로 학습받지 않은 작업(예: 산술, 논리적 추론, 코드 작성)을 수행하기 시작하는 성능의 질적 도약입니다. 이러한 능력은 일반적으로 소규모 모델에서는 나타나지 않으며, 특정 규모 임계값에 도달한 후에만 나타납니다.

## 텍스트 생성: 디코딩 전략

학습 후 모델은 다음 token을 반복적으로 예측하여 텍스트를 생성합니다. 모델이 출력한 확률 분포에서 다음 token을 선택하는 방식은 다양한 **디코딩 전략**을 통해 이루어집니다:

- **탐욕 탐색 (Greedy Search):** 항상 가장 확률이 높은 token을 선택합니다. 빠르지만 종종 반복적이고 단조로운 텍스트를 생성합니다.
- **빔 탐색 (Beam Search):** 각 단계에서 $k$개의 가장 가능성 높은 시퀀스를 유지하여 더 최적의 전역 해를 찾을 수 있게 합니다.
- **온도 샘플링:** token 확률이 **온도** 파라미터($T$)에 의해 조정됩니다. $T > 1$일 때 분포가 더 균일해지고(창의성 증가), $T < 1$일 때는 더 첨예해집니다(무작위성 감소).
- **Top-k 샘플링:** 각 단계에서 가장 확률이 높은 $k$개의 token으로 샘플링을 제한합니다.
- **Top-p (Nucleus) 샘플링:** 누적 확률이 임계값 $p$를 초과하는 최소 token 집합으로 샘플링을 제한합니다. 이를 통해 후보 풀의 크기를 동적으로 조정할 수 있습니다.

## 이론적 문제와 한계

- **환각(Hallucinations):** 모델이 사실적으로는 틀리지만 그럴듯하게 들리는 정보를 생성하는 경향. 이는 모델이 텍스트의 진실성이 아닌 확률을 최적화하기 때문입니다.
- **편향(Bias):** LLM은 학습 데이터에 존재하는 사회적, 문화적 및 기타 편향을 상속하고 증폭시킵니다.
- **해석 가능성 («블랙박스»):** 방대한 파라미터 수로 인해 모델이 정확히 어떻게 결정을 내리는지 이해하기 매우 어려우며, 이는 디버깅을 어렵게 하고 위험을 초래합니다.
- **계산 복잡도:** 자기 어텐션 메커니즘은 시퀀스 길이에 대해 이차적 복잡도($O(n^{2})$)를 가지며, 이는 처리 가능한 최대 문맥 길이를 제한합니다.

## 같이 보기

- 대형 언어 모델
- BERT
- GPT

## 참고 문헌

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Brown, T. B. et al. (2020). *Language Models Are Few-Shot Learners*. arXiv:2005.14165.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). *Training Compute-Optimal Large Language Models*. arXiv:2203.15556.
- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Ouyang, L. et al. (2022). *Training Language Models to Follow Instructions with Human Feedback*. arXiv:2203.02155.
- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Bubeck, S. et al. (2023). *Sparks of Artificial General Intelligence: Early Experiments with GPT-4*. arXiv:2303.12712.
- Touvron, H. et al. (2024). *The Llama 3 Herd of Models*. arXiv:2407.21783.
- Bender, E. M. et al. (2021). *On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?*. DOI:10.1145/3442188.3445922.
