---
title: "Transformer-Architektur"
source: "https://systems-analysis.info/int/Transformer-Architektur"
wiki: "systems-analysis.info/int"
article: "Transformer-Architektur"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8245
wiki_created_at: 2026-09-07T01:14:29Z
wiki_modified_at: 2026-09-07T01:14:29Z
downloaded_at: 2026-09-07T23:24:17Z
---

# Transformer-Architektur

**Die Transformer-Architektur** ist eine Architektur für neuronale Netze, die 2017 von Forschern bei Google in dem Paper „Attention Is All You Need“<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup> vorgestellt wurde. Sie revolutionierte den Bereich der Verarbeitung natürlicher Sprache (NLP) und wurde zur Grundlage für die meisten modernen [großen Sprachmodelle](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLM), wie BERT, GPT und Gemini. Die zentrale Innovation des Transformers ist der Mechanismus der **Selbst-Aufmerksamkeit (Self-Attention)**, der es dem Modell ermöglicht, die Bedeutung verschiedener Teile der Eingabedaten abzuwägen und Sequenzen parallel zu verarbeiten, wodurch die für RNNs und LSTMs typische Rekurrenz vermieden wird.

## Historischer Kontext und Voraussetzungen

Vor 2017 waren rekurrente neuronale Netze (RNN) und ihre weiterentwickelte Variante, Netze mit langem Kurzzeitgedächtnis (LSTM), die dominierenden Architekturen für die Verarbeitung sequenzieller Daten wie Text.

### Durch den Transformer adressierte Probleme von RNN/LSTM

- **Einschränkungen der sequenziellen Verarbeitung:** RNNs und LSTMs verarbeiten Daten Token für Token, was einen intra-sequenziellen Parallelismus ausschließt und das Training mit großen Datenmengen verlangsamt.
- **Problem der verschwindenden und explodierenden Gradienten:** In langen Sequenzen können Gradienten, die über viele Zeitschritte zurückpropagiert werden, entweder verschwinden oder explodieren, was das Erlernen langfristiger Abhängigkeiten erschwert.
- **Langfristige Abhängigkeiten:** Informationen vom Anfang einer Sequenz können bis zu ihrem Ende verloren gehen.

Der Ansatz des Transformers besteht in einem **vollständigen Verzicht auf Rekurrenz** zugunsten eines Attention-Mechanismus. Er gewährleistet eine **konstante Pfadlänge für Abhängigkeiten** zwischen beliebigen Positionen ($O(1)$), was die Modellierung weitreichender Abhängigkeiten erleichtert, obwohl die grundlegende Implementierung der Selbst-Aufmerksamkeit eine **quadratische Rechenkomplexität** in Bezug auf die Sequenzlänge aufweist ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-tay2020-2)</sup>. Das Problem der verschwindenden/explodierenden Gradienten wird nicht „beseitigt“, sondern durch Residualverbindungen, LayerNorm und das Trainingsregime **gemildert**; in modernen Implementierungen wird oft die Variante **Pre-LayerNorm (Pre-LN)** als stabiler im Training eingesetzt<sup>[\[3\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-xiong2020-3)</sup>.

## Architektur und Schlüsselkomponenten

Die ursprüngliche Transformer-Architektur besteht aus zwei Hauptteilen: einem **Encoder** und einem **Decoder**. Beide Komponenten sind Stapel identischer Schichten ($N = 6$ im Originalartikel)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>.

- **Struktur einer Encoder-Schicht:** (1) Multi-Head Self-Attention (MHA), (2) ein positionsweises Feed-Forward-Netzwerk (FFN); jede Unterschicht ist von einer Residualverbindung und LayerNorm umschlossen<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>.
- **Struktur einer Decoder-Schicht:** (1) **maskierte** Selbst-Aufmerksamkeit (eine kausale Maske verhindert den Zugriff auf zukünftige Positionen), (2) **Cross-Attention** zu den Ausgaben des Encoders, (3) ein FFN – ebenfalls mit Residualverbindungen und LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>.

### Attention-Mechanismus und Self-Attention

Der Attention-Mechanismus berechnet eine gewichtete Summe von Value-Vektoren (Wertvektoren), wobei die Gewichte durch die Kompatibilität von Key-Vektoren (Schlüssel) mit Query-Vektoren (Abfragen) bestimmt werden. Im Transformer wird die **skalierte Punktprodukt-Aufmerksamkeit (Scaled Dot-Product Attention)** verwendet:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Wobei $d_{k}$ die Dimension der Keys/Queries ist; die Division durch $\sqrt{d_{k}}$ verhindert eine Sättigung der Softmax-Funktion<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>. Wenn $Q$, $K$ und $V$ aus derselben Sequenz generiert werden, wird der Mechanismus als **Selbst-Aufmerksamkeit (Self-Attention)** bezeichnet.

### Multi-Head Attention (vielköpfige Aufmerksamkeit)

Anstelle eines einzigen Satzes von Matrizen $(W_{Q},W_{K},W_{V})$ werden $h$ parallele „Köpfe“ (Heads) verwendet. Jeder Kopf projiziert $Q,K,V$ in Unterräume geringerer Dimension, berechnet die Aufmerksamkeit unabhängig, und die Ergebnisse werden anschließend konkateniert und projiziert<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{wobei~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Varianten zur Beschleunigung der Inferenz:**

- **MQA (Multi-Query Attention):** alle Köpfe teilen sich einen einzigen Key/Value → reduziert das Volumen und den Traffic des KV-Cache bei der Dekodierung erheblich<sup>[\[4\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped-Query Attention):** ein Kompromiss zwischen MHA und MQA – mehrere Gruppen von Köpfen teilen sich K/V; die Qualität ist vergleichbar mit MHA, bei einer Geschwindigkeit, die der von MQA nahekommt<sup>[\[5\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-ainslie2023-5)</sup>.

### Positionskodierung (Positional Encoding)

Da Self-Attention invariant gegenüber der Reihenfolge der Token ist, werden den Eingabe-Embeddings **Positionskodierungen** hinzugefügt.

- **Ursprüngliche sinusförmige Kodierungen** (PE) aus<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Moderne relative/rotatorische Varianten:**
  - **RoPE (Rotary Position Embeddings)** kodiert relative Verschiebungen durch Rotation der $Q$/$K$-Vektoren; wird in einer Reihe moderner LLMs verwendet<sup>[\[6\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-su2021-6)</sup>.
  - **ALiBi** fügt den Attention-Scores eine lineare Strafe (Bias) hinzu, was die Extrapolation auf Längen verbessert, die über die Trainingsdaten hinausgehen<sup>[\[7\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-press2021-7)</sup>.

### Positionsweise FFN, Residualverbindungen und Normalisierung

Jede Encoder- und Decoder-Schicht enthält neben der Aufmerksamkeit auch ein **positionsweises Feed-Forward-Netzwerk (FFN)**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Um jede Unterschicht herum werden **Residualverbindungen** und **Layer Normalization** verwendet: ${LayerNorm}(x + {Sublayer}(x))$. Im Original wurde die Variante **Post-LN** angewendet<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>; in modernen LLMs wird oft **Pre-LN** für eine bessere Trainingsstabilität und eine geringere Abhängigkeit von einem langen Warm-up verwendet<sup>[\[3\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-xiong2020-3)</sup>.

## Evolution und moderne Varianten

Frühere Methoden, die auf rekurrenten neuronalen Netzen (RNN) und deren fortschrittlichen Varianten wie LSTM basierten, verarbeiteten Text sequenziell, Token für Token. Obwohl dieser Ansatz intuitiv der Struktur der Sprache entsprach, schuf er eine erhebliche Einschränkung: Er erschwerte parallele Berechnungen und die Erkennung von Abhängigkeiten zwischen Elementen, die im Text weit voneinander entfernt waren. Im Jahr 2017 stellte eine Gruppe von Forschern von Google ein Paper mit dem Titel „Attention Is All You Need“ vor. Darin beschrieben sie eine neue Architektur – den „Transformer“. Dieses Modell verzichtete erstmals vollständig auf rekurrente neuronale Netze und ersetzte sie durch einen „Attention“-Mechanismus. Die wichtigste Neuerung bestand darin, dass der Attention-Mechanismus dem Transformer ermöglichte, die Wichtigkeit jedes Wortes in der Eingabesequenz für die Generierung des entsprechenden Wortes in der Ausgabe zu bewerten. Dabei konnte das Modell alle Wörter gleichzeitig verarbeiten. Diese Fähigkeit zur parallelen Verarbeitung ermöglichte das Training von wesentlich größeren Modellen auf riesigen Datenmengen. Daraus entstanden die modernen großen Sprachmodelle (LLMs).

Die Transformer-Architektur diente als Grundlage für eine Vielzahl von Modellen, die sich grob in drei Klassen einteilen lassen.

### 1. Nur-Encoder-Modelle (Encoder-only)

- **Beispiel:** BERT (und RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-devlin2019-8)</sup>.
- **Prinzip:** Pre-Training mit der Aufgabe der **maskierten Sprachmodellierung (Masked Language Modeling, MLM)** mit bidirektionalem Kontext.
- **Anwendung:** Verständnisaufgaben (Klassifikation, NER etc.).

### 2. Nur-Decoder-Modelle (Decoder-only)

- **Beispiel:** die GPT-Serie (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-llama2023-11)</sup>, Claude.
- **Prinzip:** **Kausale Sprachmodellierung (Causal Language Modeling, CLM)** – Vorhersage des nächsten Tokens; die Aufmerksamkeit wird durch eine kausale Maske eingeschränkt<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>.
- **Anwendung:** Textgenerierung, Dialoge, Code.

### 3. Encoder-Decoder-Modelle

- **Beispiel:** der ursprüngliche Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-raffel2019-12)</sup>.
- **Prinzip:** Der Encoder erstellt eine Repräsentation der Eingabe, der Decoder generiert die Ausgabe und verwendet Cross-Attention auf die Merkmale des Encoders<sup>[\[1\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-vaswani2017-1)</sup>.
- **Anwendung:** Seq2Seq-Aufgaben (Übersetzung, Zusammenfassung etc.).

### 4. Multimodale und alternative Architekturen

- **Vision Transformer (ViT)** – eine Anpassung für Bilder (Aufteilung in Patches)<sup>[\[13\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** – ein hierarchisches Modell mit *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-liu2021-swin-14)</sup>.
- **Alternativen für lange Sequenzen:**
  - **Mamba** – selektive Zustandsraummodelle (SSM) mit linearer Komplexität<sup>[\[15\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** – eine RNN-ähnliche Architektur mit parallelem Training und linearer Inferenzkomplexität<sup>[\[16\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-peng2023-rwkv-16)</sup>.
  - **Hybride** (z.B. **Jamba**): wechseln zwischen Transformer- und Mamba-Blöcken ab; manchmal ergänzt durch MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-lieber2024-jamba-17)</sup>.

## Trainings- und Optimierungstechniken

Die Effektivität des Transformers ist eng mit den Trainingstechniken und der Infrastruktur verbunden.

- **Pre-Training-Strategien:** CLM und MLM; auch kontrastive und Denoising-Ziele (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-raffel2019-12)</sup>.
- **Fine-Tuning-Techniken (Fine-Tuning):**
  - **Vollständiges Fine-Tuning** aller Parameter.
  - **Parametereffizientes Fine-Tuning (PEFT):** **LoRA** führt Low-Rank-Adapter ein, während die Basisgewichte eingefroren bleiben<sup>[\[18\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-hu2021-lora-18)</sup>.
- **Verhaltensanpassung (Alignment):** **RLHF** – bestärkendes Lernen durch menschliches Feedback<sup>[\[19\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-ouyang2022-rlhf-19)</sup>.
- **Systemoptimierungen für die Inferenz:** **PagedAttention/vLLM** erhöht den Durchsatz beim Serving durch eine seitenbasierte Verwaltung des KV-Cache; besonders nützlich bei langen Sequenzen und großen Batches<sup>[\[20\]](https://systems-analysis.info/int/Transformer-Architektur#cite_note-kwon2023-vllm-20)</sup>.

## Weblinks

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer – eine visuelle Erklärung der Transformer-Architektur</a>

## Literatur

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## Einzelnachweise

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer-Architektur#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
