---
title: "Transformer architecture — Transformerアーキテクチャ"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_Transformerアーキテクチャ"
language: "ja"
categories:
  - "Category:Japanese"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Systems analysis terminology"
revision_id: 8256
wiki_created_at: 2026-09-07T01:14:38Z
wiki_modified_at: 2026-09-07T01:14:38Z
downloaded_at: 2026-09-07T23:24:22Z
---

# Transformer architecture — Transformerアーキテクチャ

**Transformerアーキテクチャ**は、2017年にGoogleの研究者らによって論文「Attention Is All You Need」<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>で発表されたニューラルネットワークアーキテクチャです。このアーキテクチャは自然言語処理（NLP）の分野に革命をもたらし、BERT、GPT、Geminiなど、現代のほとんどの大規模言語モデル（LLM）の基盤となっています。Transformerの主要な革新は**自己アテンション（self-attention）**機構であり、これによりモデルは入力データの各部分の重要度を重み付けし、RNNやLSTMに固有であった再帰的処理を廃止してシーケンスを並列に処理することが可能になりました。

## 歴史的背景と前提条件

2017年以前は、テキストなどのシーケンシャルデータを処理するための主要なアーキテクチャは、再帰型ニューラルネットワーク（RNN）とその改良版である長・短期記憶（LSTM）ネットワークでした。

### Transformerによって対処されたRNN/LSTMの課題

- **逐次処理の制約:** RNNとLSTMはデータをトークンごとに処理するため、シーケンス内での並列化が不可能であり、大規模なデータセットでの学習が遅くなります。
- **勾配消失・爆発問題:** 長いシーケンスでは、多くのステップを経て逆伝播される勾配が消失または爆発する可能性があり、長期的な依存関係の学習が困難になります。
- **長期的な依存関係:** シーケンスの冒頭の情報が、終盤に到達するまでに失われる可能性があります。

Transformerのアプローチは、アテンション機構を優先して**再帰的処理を完全に廃止する**ことです。これにより、任意の位置間の**依存関係のパス長が一定**（$O(1)$）となり、遠距離の依存関係のモデリングが容易になります。ただし、基本的な自己アテンションの実装は、シーケンス長に対して**計算量が二乗**（$O(n^{2})$）になります<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-tay2020-2)</sup>。勾配消失・爆発問題は「解消」されるわけではありませんが、残差接続、LayerNorm、および学習方法によって**緩和**されます。現代の実装では、学習時により安定している**Pre-LayerNorm（Pre-LN）**がしばしば採用されます<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-xiong2020-3)</sup>。

## アーキテクチャと主要コンポーネント

オリジナルのTransformerアーキテクチャは、**エンコーダ**と**デコーダ**という2つの主要部分から構成されています。どちらのコンポーネントも、同一の層を積み重ねたスタックです（原論文では$N = 6$）<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。

- **エンコーダ層の構造:** （1）マルチヘッド・セルフアテンション（MHA）、（2）位置ごとのフィードフォワードネットワーク（FFN）。各サブレイヤーは残差接続とLayerNormで囲まれています<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。
- **デコーダ層の構造:** （1）**マスク付き**自己アテンション（因果マスクにより未来の位置へのアクセスを禁止）、（2）エンコーダの出力に対する**クロスアテンション**、（3）FFN。こちらも残差接続とLayerNormが使用されます<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。

### Attention Mechanism and Self-Attention - アテンション機構と自己アテンション

アテンション機構は、クエリ（Query）とキー（Key）の適合度によって決定される重みを用いて、値（Value）ベクトルの加重和を計算します。Transformerでは、**スケール化ドット積アテンション（Scaled Dot-Product Attention）**が使用されます。

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

ここで$d_{k}$はキー／クエリの次元数です。$\sqrt{d_{k}}$で割ることにより、softmaxの飽和を防ぎます<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。$Q$、$K$、$V$が同じシーケンスから生成される場合、この機構は**自己アテンション（self-attention）**と呼ばれます。

### Multi-Head Attention - マルチヘッドアテンション

単一の行列セット$(W_{Q},W_{K},W_{V})$の代わりに、$h$個の並列な「ヘッド」が使用されます。各ヘッドは$Q,K,V$をより低い次元の部分空間に射影し、独立してアテンションを計算します。その後、結果が連結されて射影されます<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{where~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**推論を高速化するためのバリエーション:**

- **MQA (Multi-Query Attention):** すべてのヘッドが単一のキー／値を共有します。これにより、デコーディング時のKVキャッシュのサイズとトラフィックが大幅に削減されます<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-shazeer2019-4)</sup>。
- **GQA (Grouped-Query Attention):** MHAとMQAの中間的なアプローチで、複数のヘッドのグループがK/Vを共有します。MQAに近い速度でMHAに近い品質を実現します<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-ainslie2023-5)</sup>。

### Positional Encoding - 位置エンコーディング

self-attentionはトークンの順序に対して不変であるため、入力エンベディングに**位置エンコーディング**が追加されます。

- **オリジナルの正弦波エンコーディング**（PE）<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **現代的な相対／回転エンコーディング:**
  - **RoPE (Rotary Position Embeddings)** は、$Q$/$K$ベクトルの回転を通じて相対的な位置シフトを符号化します。多くの現代的なLLMで採用されています<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-su2021-6)</sup>。
  - **ALiBi** は、アテンションスコアに線形のペナルティを導入し、学習データよりも長いシーケンスへの外挿性能を向上させます<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-press2021-7)</sup>。

### 要素ごとのFFN、残差接続、正規化

エンコーダとデコーダの各層は、アテンションに加えて**位置ごとのフィードフォワードネットワーク（FFN）**を含んでいます。

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

各サブレイヤーの周りには**残差接続（residual connections）**と**Layer Normalization**が使用されます: ${LayerNorm}(x + {Sublayer}(x))$。オリジナルでは**Post-LN**が採用されていましたが<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>、現代のLLMでは学習の安定性を高め、長いウォームアップへの依存を減らすために**Pre-LN**がしばしば使用されます<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-xiong2020-3)</sup>。

## 発展と現代的なバリエーション

再帰型ニューラルネットワーク（RNN）やその発展形であるLSTMに基づく初期の手法は、テキストをトークンごとに逐次的に処理していました。このアプローチは言語の構造に直感的に合致していましたが、並列計算を困難にし、テキスト内で遠く離れた要素間の依存関係を検出することを複雑にするという大きな制約がありました。2017年、Googleの研究者グループが「Attention Is All You Need」という論文を発表しました。その中で彼らは新しいアーキテクチャ「Transformer」を提案しました。このモデルは、再帰型ニューラルネットワークの使用を初めて完全に廃止し、代わりに「アテンション」機構を採用しました。主な革新点は、アテンション機構によってTransformerが出力シーケンスの対応する単語を生成するために、入力シーケンスの各単語の重要性を評価できることでした。これにより、モデルはすべての単語を同時に処理できるようになりました。この並列処理能力により、はるかに大規模なモデルを膨大なデータ量で学習させることが可能となり、その結果、現代の大規模言語モデル（LLM）が誕生しました。

Transformerアーキテクチャは、大まかに3つのクラスに分類される多くのモデルの基盤となりました。

### 1. Encoder-only models - エンコーダのみのモデル

- **例:** BERT（およびRoBERTa、ALBERT）<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-devlin2019-8)</sup>。
- **原理:** 双方向コンテキストを用いた**マスク付き言語モデリング（MLM）**タスクによる事前学習。
- **応用:** 理解タスク（分類、NERなど）。

### 2. Decoder-only models - デコーダのみのモデル

- **例:** GPTシリーズ（GPT-1/2/3）<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-brown2020-10)</sup>、LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-llama2023-11)</sup>、Claude。
- **原理:** **因果言語モデリング（CLM）** — 次のトークンを予測。アテンションには因果マスクが適用されます<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。
- **応用:** テキスト生成、対話、コード生成。

### 3. Encoder-decoder models - エンコーダ・デコーダモデル

- **例:** オリジナルのTransformer、T5、BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-raffel2019-12)</sup>。
- **原理:** エンコーダが入力の表現を構築し、デコーダが出力を生成し、エンコーダの特徴に対するクロスアテンションを利用します<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-vaswani2017-1)</sup>。
- **応用:** seq2seqタスク（翻訳、要約など）。

### 4. マルチモーダルおよび代替アーキテクチャ

- **Vision Transformer (ViT)** — 画像への応用（パッチへの分割）<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-dosovitskiy2020-13)</sup>。**Swin Transformer** — *shifted windows* を用いた階層的モデル<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-liu2021-swin-14)</sup>。
- **長いシーケンスに対する代替案:**
  - **Mamba** — 線形計算量を持つ選択的状態空間モデル（SSM）<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-gu2023-mamba-15)</sup>。
  - **RWKV** — 並列学習と線形計算量の推論が可能なRNN風アーキテクチャ<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-peng2023-rwkv-16)</sup>。
  - **ハイブリッド**（例：**Jamba**）: TransformerブロックとMambaブロックを交互に配置し、時にはMoEで補完されます<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-lieber2024-jamba-17)</sup>。

## 学習と最適化の技術

Transformerの有効性は、学習技術とインフラストラクチャに密接に関連しています。

- **事前学習戦略:** CLMとMLM。また、対照的およびデノイジング目的（ELECTRA、T5）<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-raffel2019-12)</sup>。
- **ファインチューニング技術 (Fine‑tuning):**
  - 全パラメータの**完全なファインチューニング**。
  - **パラメータ効率の良いファインチューニング (PEFT):** **LoRA**は、ベースの重みを凍結したまま低ランクのアダプタを導入します<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-hu2021-lora-18)</sup>。
- **振る舞いのアライメント:** **RLHF** — 人間のフィードバックに基づく強化学習<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-ouyang2022-rlhf-19)</sup>。
- **推論のためのシステム最適化:** **PagedAttention/vLLM**は、KVキャッシュのページ管理により、サービングのスループットを向上させます。特に長いシーケンスや大きなバッチサイズで有用です<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_note-kwon2023-vllm-20)</sup>。

## 外部リンク

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer — Transformerアーキテクチャの視覚的な解説</a>

## 参考文献

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## 脚注

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_Transformer%E3%82%A2%E3%83%BC%E3%82%AD%E3%83%86%E3%82%AF%E3%83%81%E3%83%A3#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
