---
title: "Transformer architecture — Transformer 아키텍처"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_Transformer_아키텍처"
language: "ko"
categories:
  - "Category:Core LLM concepts"
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8255
wiki_created_at: 2026-09-07T01:14:37Z
wiki_modified_at: 2026-09-07T01:14:37Z
downloaded_at: 2026-09-07T23:24:22Z
---

# Transformer architecture — Transformer 아키텍처

**Transformer 아키텍처**는 2017년 Google 연구자들이 「Attention Is All You Need」<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup> 논문에서 발표한 신경망 아키텍처입니다. 이 아키텍처는 자연어 처리(NLP) 분야에 혁명을 일으켰으며, BERT, GPT, Gemini와 같은 대부분의 현대 대형 언어 모델(LLM)의 기반이 되었습니다. Transformer의 핵심 혁신은 **자기 주의(self‑attention)** 메커니즘으로, 이를 통해 모델은 입력 데이터의 각 부분의 중요도를 가중하고, RNN 및 LSTM에서 나타나는 순환성을 배제하면서 시퀀스를 병렬로 처리할 수 있습니다.

## 역사적 맥락과 배경

2017년 이전에는 텍스트와 같은 순차 데이터를 처리하는 데 있어 순환 신경망(RNN)과 그 개선 변형인 장단기 기억(LSTM) 네트워크가 지배적인 아키텍처였습니다.

### Transformer가 해결한 RNN/LSTM의 문제점

- **순차 처리의 한계:** RNN과 LSTM은 token 단위로 데이터를 처리하기 때문에 시퀀스 내 병렬처리가 불가능하며, 대규모 데이터 학습 속도가 느립니다.
- **기울기 소실 및 폭발 문제:** 긴 시퀀스에서 여러 단계를 역방향으로 전파되는 기울기가 소실되거나 폭발할 수 있어, 장기 의존성 학습이 어렵습니다.
- **장기 의존성:** 시퀀스 앞부분의 정보가 끝부분에서 손실될 수 있습니다.

Transformer의 접근 방식은 주의 메커니즘을 선호하여 **순환성을 완전히 배제**하는 것입니다. 이는 임의의 두 위치 사이의 **의존성 경로 길이를 상수**로 유지함으로써($O(1)$) 장거리 의존성 모델링을 용이하게 하지만, 기본적인 self‑attention 구현은 시퀀스 길이에 대해 **이차(quadratic) 계산 복잡도**를 가집니다($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-tay2020-2)</sup>. 기울기 소실/폭발 문제는 완전히 사라지는 것이 아니라, 잔차 연결(residual connection), LayerNorm, 학습 방식에 의해 **완화**됩니다. 현대 구현에서는 학습 안정성을 위해 **Pre‑LayerNorm (Pre‑LN)** 변형을 자주 사용합니다<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-xiong2020-3)</sup>.

## 아키텍처 및 핵심 구성 요소

원본 Transformer 아키텍처는 **인코더(encoder)**와 **디코더(decoder)**라는 두 가지 주요 부분으로 구성됩니다. 두 구성 요소 모두 동일한 레이어를 쌓은 형태입니다(원논문에서는 $N = 6$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>.

- **인코더 레이어 구조:** (1) 다중 헤드 자기 주의(MHA), (2) 위치별 FFN; 각 하위 레이어는 잔차 연결과 LayerNorm으로 감싸져 있습니다<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>.
- **디코더 레이어 구조:** (1) **마스킹된** 자기 주의(인과 마스크가 미래 위치 접근을 차단), (2) 인코더 출력에 대한 **cross‑attention**, (3) FFN — 마찬가지로 잔차 연결과 LayerNorm 포함<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>.

### 주의 메커니즘과 Self‑Attention

주의 메커니즘은 값(Value) 벡터의 가중 합산을 계산하며, 가중치는 키(Key)와 쿼리(Query)의 호환성 정도에 의해 결정됩니다. Transformer에서는 **스케일드 내적 주의(Scaled Dot‑Product Attention)**를 사용합니다:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

여기서 $d_{k}$는 키/쿼리의 차원이며, $\sqrt{d_{k}}$으로 나누는 것은 softmax의 포화를 방지합니다<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>. $Q$, $K$, $V$가 동일한 시퀀스에서 생성될 때 이 메커니즘을 **자기 주의(self‑attention)**라고 합니다.

### Multi‑Head Attention (다중 헤드 주의)

단일 행렬 집합 $(W_{Q},W_{K},W_{V})$ 대신, $h$개의 병렬 "헤드"를 사용하며, 각 헤드는 $Q,K,V$를 더 작은 차원의 부분 공간으로 투영하고, 독립적으로 주의를 계산한 뒤 결과를 연결하여 투영합니다<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**추론 가속을 위한 변형:**

- **MQA (Multi‑Query Attention):** 모든 헤드가 하나의 키/값을 공유 → 디코딩 시 KV 캐시 용량과 트래픽이 크게 감소<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** MHA와 MQA 사이의 절충안 — 여러 헤드 그룹이 K/V를 공유; MQA 수준의 속도에서 MHA에 가까운 품질 유지<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-ainslie2023-5)</sup>.

### 위치 인코딩(Positional Encoding)

self‑attention은 token 순서에 불변이기 때문에, 입력 embedding에 **위치 인코딩**이 추가됩니다.

- <sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>의 **원본 사인파 인코딩** (PE):

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **현대적인 상대적/회전 방식 변형:**
  - **RoPE (Rotary Position Embeddings)**는 $Q$/$K$ 벡터의 회전을 통해 상대적 이동을 인코딩하며, 일부 현대 LLM에 적용됩니다<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-su2021-6)</sup>.
  - **ALiBi**는 주의 점수에 선형 패널티를 도입하여 학습 시보다 더 긴 길이로의 외삽을 개선합니다<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-press2021-7)</sup>.

### 위치별 FFN, 잔차 연결 및 정규화

인코더와 디코더의 각 레이어는 주의 외에도 **위치별 FFN**을 포함합니다:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

각 하위 레이어 주변에는 **잔차 연결(residual connections)**과 **Layer Normalization**이 사용됩니다: ${LayerNorm}(x + {Sublayer}(x))$. 원논문에서는 **Post‑LN** 변형을 사용했으며<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>, 현대 LLM에서는 학습 안정성 향상과 긴 warm‑up 의존도 감소를 위해 **Pre‑LN**을 자주 사용합니다<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-xiong2020-3)</sup>.

## 발전과 현대적 변형

RNN과 LSTM 같은 발전된 변형을 기반으로 한 초기 방법들은 텍스트를 순차적으로, token 하나씩 처리했습니다. 이러한 방식은 언어 구조에 직관적으로 부합했지만, 병렬 계산을 어렵게 하고 텍스트에서 멀리 떨어진 요소 간의 의존성 감지를 복잡하게 만드는 중요한 한계를 가지고 있었습니다. 2017년, Google의 연구자 그룹은 「Attention Is All You Need」라는 제목의 논문을 발표했습니다. 이 논문에서 그들은 새로운 아키텍처인 'Transformer'를 설명했습니다. 이 모델은 처음으로 순환 신경망의 사용을 완전히 포기하고 이를 '주의(attention)' 메커니즘으로 대체했습니다. 핵심 혁신은 주의 메커니즘이 Transformer로 하여금 입력 시퀀스의 각 단어가 출력에서 해당 단어를 생성하는 데 얼마나 중요한지 평가할 수 있게 하는 동시에, 모든 단어를 동시에 처리할 수 있다는 점이었습니다. 이러한 병렬 처리 능력은 방대한 양의 데이터로 훨씬 더 큰 모델을 학습하는 것을 가능하게 했습니다. 그 결과 현대적인 대형 언어 모델(LLM)이 등장하게 되었습니다.

Transformer 아키텍처는 크게 세 가지 범주로 나눌 수 있는 다양한 모델의 기반이 되었습니다.

### 1. 인코더 전용 모델(Encoder‑only)

- **예시:** BERT (및 RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-devlin2019-8)</sup>.
- **원리:** 양방향 컨텍스트를 활용한 **마스킹 언어 모델링(MLM)** 과제로 사전 학습.
- **적용:** 이해 과제 (분류, NER 등).

### 2. 디코더 전용 모델(Decoder‑only)

- **예시:** GPT 시리즈 (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-llama2023-11)</sup>, Claude.
- **원리:** **인과 언어 모델링(CLM)** — 다음 token 예측; 주의에 인과 마스크 적용<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>.
- **적용:** 텍스트 생성, 대화, 코드.

### 3. 인코더-디코더 모델(Encoder‑decoder)

- **예시:** 원본 Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-raffel2019-12)</sup>.
- **원리:** 인코더가 입력 표현을 구축하고, 디코더가 출력을 생성하면서 인코더 특징에 대해 cross‑attention을 사용<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-vaswani2017-1)</sup>.
- **적용:** seq2seq 과제 (번역, 요약 등).

### 4. 멀티모달 및 대안 아키텍처

- **Vision Transformer (ViT)** — 이미지에 대한 적응 (패치 분할)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — *shifted windows*를 활용한 계층적 모델<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-liu2021-swin-14)</sup>.
- **긴 시퀀스를 위한 대안:**
  - **Mamba** — 선형 복잡도를 가진 선택적 상태 공간 모델(SSM)<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — 병렬 학습과 선형 추론 복잡도를 갖는 RNN 유사 아키텍처<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-peng2023-rwkv-16)</sup>.
  - **하이브리드** (예: **Jamba**): Transformer와 Mamba 블록을 교대로 배치하며, 때로는 MoE로 보완<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-lieber2024-jamba-17)</sup>.

## 학습 기법 및 최적화

Transformer의 효율성은 학습 기법 및 인프라와 밀접하게 관련되어 있습니다.

- **사전 학습 전략:** CLM 및 MLM; 또한 대조적 및 노이즈 제거 목표 (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-raffel2019-12)</sup>.
- **Fine‑tuning 기법:**
  - **전체 fine‑tuning** — 모든 파라미터를 미세 조정.
  - **파라미터 효율적 fine‑tuning (PEFT):** **LoRA**는 기반 가중치를 동결한 채 저랭크 어댑터를 도입<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-hu2021-lora-18)</sup>.
- **행동 정렬:** **RLHF** — 인간 피드백 기반 강화 학습<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-ouyang2022-rlhf-19)</sup>.
- **추론 시스템 최적화:** **PagedAttention/vLLM**은 KV 캐시의 페이지 방식 관리를 통해 서빙 처리량을 향상시키며, 긴 시퀀스와 대형 배치에서 특히 유용합니다<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_note-kwon2023-vllm-20)</sup>.

## 참조

- The Illustrated Transformer — Transformer 아키텍처의 시각적 설명

## 참고 문헌

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## 주석

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer_%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
