---
title: "LLM-Architekturen"
source: "https://systems-analysis.info/int/LLM-Architekturen"
wiki: "systems-analysis.info/int"
article: "LLM-Architekturen"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3539
wiki_created_at: 2026-09-06T23:22:19Z
wiki_modified_at: 2026-09-06T23:22:19Z
downloaded_at: 2026-09-07T22:57:29Z
---

# LLM-Architekturen

**Architekturen großer Sprachmodelle (LLM)** sind die grundlegenden Prinzipien und Strukturen, die definieren, wie große Sprachmodelle aufgebaut, trainiert und betrieben werden. Moderne LLMs, die in der Lage sind, menschliche Sprache zu verstehen und zu generieren, basieren fast ausschließlich auf der **[Transformer](https://systems-analysis.info/int/Transformer-Architektur "Transformer-Architektur")**-Architektur<sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>, beinhalten jedoch zahlreiche Verbesserungen und unterschiedliche Ansätze, die auf die Steigerung von Effizienz, Skalierbarkeit und Leistungsfähigkeit abzielen.

## Familien von LLM-Architekturen (Transformer)

Moderne große Sprachmodelle basieren auf der [Transformer-Architektur](https://systems-analysis.info/int/Transformer-Architektur "Transformer-Architektur")<sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>, nutzen diese jedoch je nach Zielsetzung unterschiedlich: um Text zu verstehen, eine Fortsetzung zu generieren oder einen Text in einen anderen umzuwandeln. In der Praxis werden unter Beibehaltung der Grundprinzipien des Transformers drei Familien unterschieden<sup>[\[2\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-2)[\[3\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-3)[\[4\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-4)</sup>.

### 1. Encoder-only (nur Encoder)

Das Modell verwendet ausschließlich den Encoder-Stack und betrachtet den gesamten Eingabetext bidirektional. Das Pre-Training basiert in der Regel auf Masked Language Modeling (MLM): Ein Teil der Tokens wird maskiert, und das Modell lernt, diese anhand des umgebenden Kontexts wiederherzustellen. Dank des bidirektionalen Kontexts sind solche Modelle stark in Aufgaben des Verstehens und der Bewertung (Scoring): Klassifikation, Erkennung von benannten Entitäten (NER), Reranking von Dokumenten und extraktive Frage-Antwort-Systeme (QA). Für die autoregressive Generierung von Grund auf sind sie nicht konzipiert.

Zusätzlich werden in der Praxis alternative Pre-Training-Ziele für die Encoder-only-Familie eingesetzt: *Replaced Token Detection (RTD) in ELECTRA* (ein Diskriminator-Modell erkennt ersetzte Tokens) und *kontrastives Lernen* von Bi-Encodern für die semantische Suche/Retrieval (InfoNCE/Softmax-Loss bei Paaren von „Anfrage-Dokument“, wie bei Dense Passage Retrieval). Bei der Verwendung in RAG-Systemen fungieren Encoder-only-Modelle entweder als *Bi-Encoder* (separate Kodierung von Anfrage und Dokument für eine schnelle ANN-Suche) oder als *Cross-Encoder* (gemeinsame Kodierung des Paares für ein präzises Reranking).

**Vorteile:**

- Hohe Qualität beim Textverständnis durch bidirektionalen Kontext: Klassifikation, NER, Faktenextraktion, Reranking, extraktives QA.
- Parallele Verarbeitung und hoher Durchsatz: ein einziger Forward-Pass ohne Autoregression; ideal für das Batch-Scoring großer Datenmengen.
- Natürliche Integration mit Suche und RAG: in der Rolle eines Bi-Encoders für schnelle semantische Suche; in der Rolle eines Cross-Encoders für präzises Reranking.
- Effiziente Anpassung: Relativ kompakte Varianten (≈100–300 Mio. Parameter; BERT-base ≈110 Mio.) liefern nach gezieltem Fine-Tuning eine hohe Qualität.
- Stabile Latenz, unabhängig von der Länge der generierten Antwort (keine schrittweise Dekodierung); gut geeignet für das Offline-Scoring großer Sammlungen.
- Möglichkeit zur Erweiterung des Kontextfensters bei Encodern durch relative/rotatorische Positionen und/oder lokal-verdünnte Attention (z. B. Longformer/BigBird), was für lange Dokumente nützlich ist.

**Nachteile:**

- Keine nativen generativen Fähigkeiten: Für Dialoge und ausführliche Antworten ist ein Decoder oder ein externes generatives Modul erforderlich.
- Eingeschränkte Eignung für interaktive Szenarien: keine schrittweise Generierung mit Zustandserhaltung.
- Nichtübereinstimmung des Pre-Training-Ziels mit Aufgaben der freien Generierung: MLM ist im Vergleich zum kausalen Modellieren weniger gut für die Generierung geeignet.
- Historisch begrenztes Kontextfenster (oft 512 Tokens in Basiskonfigurationen mit absoluten Positionen); die Erweiterung erfordert spezielle Positions-/Attention-Schemata und/oder zusätzliches Training.
- Für Retrieval-Aufgaben ist ein separates kontrastives Fine-Tuning des Bi-Encoders und/oder Cross-Encoders erforderlich; ohne dieses ist die Qualität der Suche/des Rerankings in der Regel geringer als bei speziell trainierten Modellen.

**Repräsentative Modelle:** BERT und Derivate sowie RoBERTa und DeBERTa (erweiterte Encoder-only-Varianten); aus alternativen Pre-Training-Zielen – ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-5)[\[6\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-6)[\[7\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-7)[\[8\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-8)[\[9\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-9)[\[10\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-10)</sup>

### 2. Decoder-only (nur Decoder)

Es wird nur der Decoder-Stack mit kausaler (linksgerichteter) Attention verwendet: Das Modell sagt das nächste Token basierend auf dem bereits gegebenen Präfix voraus. Dieser Trainingsmodus – Causal Language Modeling (CLM) – macht diese Modelle zur natürlichen Wahl für die Generierung: Dialoge, ausführliche Antworten, kreative Texte, Programmcode. Der Kompromiss besteht in einer erhöhten Latenz und einem größeren KV-Cache bei langen Prompts. In der Praxis werden für Decoder-only-Modelle zahlreiche technische Optimierungen eingesetzt: Verkleinerung des KV-Cache durch MQA und GQA, Beschleunigung der Inferenz durch spekulative Dekodierung und serverseitige Optimierungen (PagedAttention/vLLM, Continuous Batching, Chunked Prefill).<sup>[\[11\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-11)[\[12\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-12)[\[13\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-13)[\[14\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-14)[\[15\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-15)</sup>

**Vorteile:**

- Natürliche Textgenerierung (CLM): starke Zero-Shot- und Few-Shot-Fähigkeiten; gut skalierbar.<sup>[\[16\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-16)</sup>
- Universelle Anwendbarkeit: Ein Modell löst viele Aufgaben durch Anweisungen und Beispiele im Prompt; lässt sich natürlich mit RAG und dem Aufruf von Werkzeugen (Tool Use) kombinieren.
- Ausgereiftes Ökosystem: Praktiken für Instruction-Tuning und Verhaltens-Alignment (RLHF, DPO); offene und kommerzielle Implementierungen verfügbar.<sup>[\[17\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-17)[\[18\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-18)</sup>
- Umfangreiche Inferenzoptimierungen: MQA/GQA reduzieren das Volumen des KV-Cache und erhöhen den Durchsatz; spekulative Dekodierung beschleunigt die Inferenz ohne Änderung der Ausgabeverteilung; PagedAttention/vLLM mit Continuous Batching und Chunked Prefill steigern die End-to-End-GPU-Auslastung.<sup>[\[19\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-19)[\[20\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-20)[\[21\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-21)[\[22\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-22)[\[23\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-23)</sup>
- Unterstützung für strukturierte Generierung für strikte Ausgabeformate (JSON/SQL/DSL), was die Integration mit Informationssystemen und APIs vereinfacht.<sup>[\[24\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-24)[\[25\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-25)</sup>

**Nachteile:**

- Erhöhte Latenz bei der Generierung: sequenzielle Ausgabe; die Kosten für ein neues Token steigen mit der Länge des bereits „gelesenen“ Kontexts (KV-Cache).
- Weniger vorteilhaft bei Profilen mit „langer Eingabe – kurzer Ausgabe“ (Zusammenfassung, Übersetzung) im Vergleich zu Encoder-Decoder-Modellen, bei denen die Eingabe nur einmal kodiert wird.
- Beschränkung auf unidirektionalen Kontext: Bei Verstehensaufgaben manchmal Modellen mit bidirektionaler Repräsentation (Encoder-only / Encoder-Decoder) unterlegen.
- Der Speicher für den KV-Cache kann bei langen Prompts und großen Batches zum Engpass werden. <sup>[\[26\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-26)</sup>
- Die Quantisierung von Aktivierungen/KV (INT8/FP8) beschleunigt die Inferenz, kann jedoch die Qualität bei langen Kontexten/Code beeinträchtigen und erfordert eine sorgfältige Validierung (insbesondere bei strengen SLAs).

**Repräsentative Modelle:** GPT-3, GPT-4 (Details zur Architektur und zum Datensatz wurden nicht öffentlich gemacht), LLaMA und *Llama 3* (8B/70B, 2024).<sup>[\[27\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-27)[\[28\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-28)[\[29\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-29)[\[30\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-30)</sup>

### 3. Encoder-Decoder

Diese Architektur kombiniert beide Komponenten. Der Encoder arbeitet im bidirektionalen Modus, der Decoder kausal. Der Encoder analysiert die Eingabe einmal und erstellt ihre Repräsentation; der Decoder generiert die Ausgabe, indem er über Cross-Attention auf diese Repräsentation zugreift. Dieser getrennte Ansatz ist besonders nützlich, wenn ein langer Eingabetext in eine kurze Ausgabe umgewandelt werden soll: maschinelle Übersetzung, Zusammenfassung, dokumentenbasierte Antworten. Obwohl die Methode insgesamt höhere Rechenkosten erfordert (zwei Stacks und Cross-Attention), liegt ihr Vorteil in der kontrollierten Generierung auf Basis einer vollständigen Analyse des Quelltextes; dabei erfolgt die Kodierung einmalig und wird während des gesamten Inferenzprozesses wiederverwendet.

**Vorteile:**

- Bedingte Generierung: Der Decoder verwendet Cross-Attention auf die Repräsentation der Eingabe. <sup>[\[31\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-31)</sup>
- Effizient im Szenario „lange Eingabe → kurze Ausgabe“: Die Eingabe wird nur einmal kodiert.
- Geeignet für das „Text-to-Text“-Format und kontrollierte Ausgabe (aufgabenbezogene Präfixe, spezielle Anweisungen). <sup>[\[32\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-32)</sup>
- Stabilität und Effizienz bei langen Quellen: In der Dekodierungsphase wächst nur die Self-Attention über die Ausgabe, während die Cross-Attention die festen Keys/Values des Encoders wiederverwendet (die Eingabe wird nicht bei jedem Schritt neu „gelesen“).

**Nachteile:**

- Zwei Stacks erhöhen den Speicher- und Rechenbedarf beim Training und bei der Anwendung.
- Bei sehr langen Sequenzen ist die resultierende Latenz mit der von Decoder-only-Modellen vergleichbar; die Autoregression bleibt der Engpass.
- Weniger universelle Chat-Modelle als bei Decoder-only; werden häufiger als hochwertige Seq2Seq-Engine für spezifische Aufgaben eingesetzt.
- Bei sehr langer Eingabe steigt der Speicherbedarf für die Keys/Values der Cross-Attention in jeder Decoderschicht (über die gesamte Quelle), was eine sorgfältige Planung des Servings erfordert.

**Repräsentative Modelle:** T5 (einschließlich T5 v1.1 und der Praxis des Instruction-Tuning in *FLAN-T5*) und BART. <sup>[\[33\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-33)[\[34\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-34)[\[35\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-35)</sup>

## Dichte (Dense) Transformer

Die klassische und am weitesten verbreitete Architektur von LLMs: Bei der Verarbeitung jedes Tokens wird praktisch der gesamte Parametersatz des Modells genutzt. Im Gegensatz zu Sparse-Ansätzen (z. B. Mixture-of-Experts) gibt es keine selektive Aktivierung von Teilnetzen – jeder Block arbeitet für jedes Token. <sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>

### Funktionsweise und Architektur

**Grundstruktur.** Das Modell ist ein Stack aus N identischen Transformer-Blöcken. Jeder Block enthält:

1.  **Multi-Head Self-Attention.** Für jedes Token werden drei Vektoren berechnet: Q (Query), K (Key), V (Value); die Attention wird als $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$ definiert, wobei $M$ eine Maske (kausale und/oder Padding-Maske) ist, die ungültige Positionen ausschließt. Mehrere „Attention-Heads“ berücksichtigen parallel verschiedene Aspekte des Kontexts (H Heads, normalerweise $d_{head} = \frac{d_{model}}{H}$); ihre Anzahl wächst mit der Skalierung des Modells. <sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>
2.  **Feed-Forward-Netzwerk (FFN).** Zwei lineare Schichten mit einer Nichtlinearität dazwischen (typischerweise GELU/SiLU; in einigen modernen Modellen SwiGLU). Die Zwischendimension beträgt in der Regel $\approx 4\, d_{model}$; bei Verwendung von SwiGLU wird oft $\approx \frac{8}{3}\, d_{model}$ gewählt, um eine vergleichbare Anzahl von Parametern beizubehalten. Das FFN enthält einen erheblichen Teil der Parameter. <sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-36)</sup>

**Zusätzliche Komponenten.** Es werden Residualverbindungen und Layer-Normalisierung verwendet; in modernen LLMs wird häufiger Pre-LN (Normalisierung vor den Teilblöcken) eingesetzt, was die Trainingsstabilität bei großer Tiefe verbessert. Neben der klassischen LayerNorm wird zunehmend **RMSNorm** verwendet (reduziert den Rechenaufwand und funktioniert gut in großen Modellen); in einigen Familien wird auch eine Normalisierung im Attention-Raum angewendet (z. B. Normalisierung von Q/K vor dem Softmax). Positionsrepräsentationen können absolut oder relativ sein; für lange Kontexte ist RoPE zum De-facto-Standard geworden.

##### Beispiele für Modelle und deren Skalierung

- BERT-Large: 24 Schichten, Dimension 1024, 16 Attention-Heads, ≈340 Mio. Parameter. <sup>[\[37\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-37)</sup>
- GPT-3 (175B): 96 Schichten, Dimension 12288, 96 Attention-Heads, ≈175 Mrd. Parameter. <sup>[\[38\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-38)</sup>
- LLaMA-65B: 80 Schichten, Dimension 8192, 64 Attention-Heads, ≈65 Mrd. Parameter. <sup>[\[39\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-39)</sup>
- PaLM-540B: 118 Schichten, Dimension ca. 18432, ≈540 Mrd. Parameter. <sup>[\[40\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-40)</sup>

##### Vorteile

- Einheitliche Blöcke, gut erforschte Trainingsmodi und vorhersagbares Verhalten bei der Skalierung.
- Die Qualität verbessert sich exponentiell mit dem Wachstum von Parametern und Daten; der compute-optimale Modus sieht eine gemeinsame Erhöhung der Modellgröße und des Volumens der Trainings-Tokens vor. <sup>[\[41\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-41)[\[42\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-42)</sup>
- Dieselbe Architektur deckt nach dem Fine-Tuning ein breites Spektrum an Aufgaben ab, ohne dass Änderungen auf Schichtebene erforderlich sind.

##### Nachteile

- Die volle Self-Attention hat eine quadratische Komplexität in Bezug auf die Sequenzlänge ($O(n^{2})$), was das Kontextfenster begrenzt. <sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>
- Vollständige Aktivierung der Parameter bei jedem Generierungsschritt: In einem Decoder ohne MoE steigen die Inferenzkosten pro Token ungefähr proportional zur Anzahl der Parameter.
- Der Engpass ist die Speicherbandbreite (memory-bound): Das Laden der Gewichte aus dem HBM begrenzt oft die Inferenzgeschwindigkeit.

##### Grenzen der Skalierung und des Kontexts

- Der Speicher für die Parameter wächst linear mit der Modellgröße; der Trainingsspeicher erhöht sich aufgrund von Gradienten und Zuständen des Optimierers.
- Basis-Konfigurationen waren historisch auf 2.000–4.000 Tokens beschränkt. Moderne Positionierungsschemata (RoPE) und Erweiterungstechniken (Position Interpolation, YaRN usw.) ermöglichen eine Vergrößerung des Fensters um eine Größenordnung und mehr, jedoch auf Kosten zusätzlicher Rechen-/Speicherlast. <sup>[\[43\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-43)[\[44\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-44)</sup>

### Moderne Optimierungen

- **FlashAttention.** Eine exakte Attention, die die GPU-Speicherhierarchie berücksichtigt; reduziert den Speicherbedarf und beschleunigt das Training/die Inferenz bei langen Sequenzen. <sup>[\[45\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-45)</sup>
- **Reduzierung und Verwaltung des KV-Cache.** Multi-Query Attention und Grouped-Query Attention verringern das Cache-Volumen und den Speicherverkehr; auf Serverebene erhöht PagedAttention (vLLM) den Durchsatz durch seitenbasiertes Cache-Management. <sup>[\[46\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-46)[\[47\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-47)[\[48\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-48)</sup>
- **Spekulative Dekodierung.** Ein Entwurfsmodell (Draft Model) schlägt eine Fortsetzung vor, die das Hauptmodell schnell überprüft; dies führt zu einer Beschleunigung ohne Änderung der Ausgabeverteilung. <sup>[\[49\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-49)</sup>

## Sparse Models und Mixture-of-Experts (MoE)

MoE ist eine Methode, die Kapazität eines Modells zu erhöhen, ohne die Rechenkosten pro Token proportional zu steigern. Anstelle eines großen FFN-Blocks pro Schicht wird ein Satz paralleler „Experten“ (mehrere unabhängige FFNs) verwendet, und ein trainierbarer Router (Gating-Netzwerk) wählt für jedes Token die Top-k relevantesten Experten aus (typischerweise k=1–2; in einigen Modellen k=4). Nur die ausgewählten Experten werden aktiviert; ihre Ausgaben werden gewichtet und summiert. So kann die Gesamtzahl der Parameter Hunderte von Milliarden oder sogar Billionen betragen, während bei jedem Schritt nur ein kleiner Teil davon genutzt wird. <sup>[\[50\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-GLAM-51)</sup>

#### Beispiele für Modelle und deren Skalierung

- **Switch Transformer (Google)**: bis zu ~1,6 Billionen Parameter; Top-1-Routing (ein Experte pro Token). Zeigte, dass MoE die Kapazität bei vergleichbaren Kosten pro Token drastisch erhöhen kann. <sup>[\[50\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1,2 Billionen Parameter, 64 Experten pro Schicht, Top-2; pro Token werden ≈96,6 Mrd. Parameter (≈8 %) aktiviert. <sup>[\[51\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: ~46,7 Mrd. Parameter insgesamt, ≈12,9 Mrd. aktiv pro Token, Top-2. <sup>[\[52\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: ~141 Mrd. Parameter insgesamt, ≈39 Mrd. aktiv pro Token, Top-2. <sup>[\[54\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: 132 Mrd. Parameter insgesamt, ≈36 Mrd. aktiv pro Token; 16 Experten und Top-4-Routing (Fine-grained MoE). <sup>[\[55\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-DBRX-55)</sup>

##### Vorteile

- Die Rechenkosten werden durch die Anzahl der aktiven Experten k bestimmt, nicht durch die Gesamtzahl der Parameter: Modelle im Billionen-Maßstab können trainiert und eingesetzt werden, bei Kosten, die mit deutlich kleineren dichten Modellen vergleichbar sind. <sup>[\[51\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-GLAM-51)</sup>
- Spezialisierung: Experten passen sich automatisch an Sprachen/Domänen/Muster an, was die Qualität bei multimodalen Aufgaben verbessert.
- Flexibler Einsatz: Häufig genutzte Experten können im Speicher gehalten und seltene nachgeladen werden (bei entsprechender Infrastruktur).

##### Einschränkungen

- Lastenverteilung: Ohne Regularisierung kann der Router bei einigen Experten „hängen bleiben“ (Router Collapse). Es sind Auxiliary Losses (Load-Balancing) und verbesserte Routing-Schemata erforderlich. <sup>[\[50\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Switch-50)</sup>
- Komplexität verteilter Berechnungen: Erfordert Expert Parallelism und All-to-All-Kommunikation; Kommunikations-Overhead und Speicherverwaltung werden zum Engpass. <sup>[\[56\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-NVIDIA_MoE-56)</sup>
- Trainingsstabilität: Die Einstellungen des Routers und die Kapazitätsbeschränkungen sind entscheidend, sonst kann es zu Qualitäts-/Konvergenzproblemen kommen.

#### Moderne Verbesserungen

- **Expert-Choice Routing**: Experten „wählen“ Tokens aus, was die Lastenverteilung und Konvergenz bei vergleichbaren Kosten verbessert. <sup>[\[57\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-ExpertChoice-57)</sup>
- **Fine-grained MoE**: Eine größere Anzahl kleinerer Experten (wie bei DBRX) ermöglicht eine feinere Granularität der Spezialisierung. <sup>[\[55\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: Die Umwandlung eines dichten Modells in ein MoE-Modell aus seinem Checkpoint kann die Qualität bei moderaten Kosten erheblich steigern. <sup>[\[58\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-SparseUpcycling-58)</sup>

#### Anwendungsfälle für MoE

- Große, multimodale Assistenten bei begrenztem Rechenbudget.
- Training auf umfangreichen Korpora, bei denen Spezialisierung von Vorteil ist.
- Szenarien mit ausgereifter verteilter Infrastruktur (viele GPUs/TPUs und schnelle Netzwerke).

**Wann Dense Models besser geeignet sind**: begrenzte Infrastruktur (1–2 GPUs), strenge Anforderungen an vorhersagbare Latenz und einfache Bereitstellung.

## Retrieval-Augmented Generation (RAG)

RAG ist ein architektonisches **System-Pattern** um ein LLM herum, keine interne Architektur des Modells selbst. Es kombiniert ein LLM (die generative Komponente) mit einer externen Wissensdatenbank (die Retrieval-Komponente), um die Begrenzungen des „parametrischen Gedächtnisses“ des Modells auszugleichen.

- **Funktionsweise:** Vor der Generierung ruft das LLM relevante Dokumente aus einer externen Quelle (Wiki, unternehmensinterne Wissensdatenbank, Web) ab und stützt sich bei der Formulierung der Antwort auf diese. <sup>[\[59\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RAG-59)</sup>
- **Vorteile:**
  - Reduzierung von Halluzinationen und Verbesserung der faktischen Genauigkeit. <sup>[\[59\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-60)</sup>
  - Aktualität ohne vollständiges Neutraining des Modells. <sup>[\[59\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RAG-59)</sup>
  - Zitierbarkeit und Nachverfolgbarkeit der Antworten.
- **Anwendung:** De-facto-Standard für Unternehmensassistenten und Systeme, die überprüfbare Fakten und die Arbeit mit privaten/hochspezialisierten Daten erfordern. <sup>[\[59\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RAG-59)</sup>

## Attention-Mechanismen und Kontextverarbeitung

Die grundlegende Self-Attention hat eine quadratische Komplexität in Bezug auf die Sequenzlänge ($O(n^{2})$), weshalb Optimierungen entwickelt wurden.

- **Sparse Attention:** Beschränkung der Attention auf lokale Fenster/Muster. Beispiele: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-62)</sup>.
- **FlashAttention:** Neuanordnung der Berechnungen unter Berücksichtigung der GPU-Speicherhierarchie; führt zu erheblichen Zeit- und Speichereinsparungen und ist zum De-facto-Standard beim Training von LLMs mit langem Kontext geworden<sup>[\[63\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-63)[\[64\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-64)[\[65\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-65)</sup>.
- **MQA/GQA (Beschleunigung der Dekodierung):** *Multi-Query Attention* (gemeinsame Keys/Values für alle Heads) reduziert den KV-Cache-Verkehr<sup>[\[66\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-66)</sup>. *Grouped-Query Attention* schafft einen Ausgleich zwischen Qualität und Geschwindigkeit<sup>[\[67\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-67)</sup>.
- **Verbesserte Positionsrepräsentationen:**
  - **ALiBi (Attention with Linear Biases):** Lineare Biases zu den Attention-Scores verbessern die Generalisierung auf längere Sequenzen. <sup>[\[68\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Relative Positionsinformation durch Rotation von Q/K; weit verbreitet in modernen Modellen (z. B. LLaMA). <sup>[\[69\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-69)[\[70\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-70)</sup>
  - **Kontexterweiterung für RoPE-Modelle:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-72)</sup> sowie NTK-aware-Modifikationen ermöglichen eine effiziente Erweiterung des Kontextfensters ohne Architekturänderungen.

<!-- -->

- **Weitere Ansätze für lange Sequenzen:**
  - **Transformer-XL:** Rekurrenter Speicher zwischen Segmenten zur Modellierung weitreichender Abhängigkeiten. <sup>[\[73\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-73)</sup>
  - **Reformer:** LSH-Attention und reversible Residual-Blöcke zur Speichereinsparung. <sup>[\[74\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-74)</sup>
  - **Performer:** Lineare Approximation der Softmax-Attention (FAVOR+). <sup>[\[75\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-75)</sup>
  - **Linformer:** Niedrigrang-Approximation der Attention-Matrix. <sup>[\[76\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-76)</sup>

## Modelloptimierungen und Trainingsinfrastruktur

Für das Training und die Bereitstellung von LLMs werden spezialisierte Techniken und Frameworks verwendet.

- **Quantisierung (Quantization):** Die Verringerung der Bit-Tiefe der Gewichte reduziert den Speicherbedarf und beschleunigt die Inferenz. **QLoRA** ermöglicht das effiziente Fine-Tuning von 4-Bit-Modellen (einschließlich 65B) bei einer Qualität, die nahe an der vollen Genauigkeit liegt<sup>[\[77\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-77)</sup>.
- **Wissensdestillation (Knowledge Distillation):** *Teacher→Student*-Training für kompakte Modelle<sup>[\[78\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-78)</sup>; ein Beispiel ist **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-79)</sup>.
- **Verteiltes Training:**
  - **DeepSpeed** und **ZeRO** – Verteilung von Parametern/Gradienten/Optimiererzuständen für das Training von Modellen im Billionen-Maßstab<sup>[\[80\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-80)</sup>.
  - **Megatron-LM** – Tensor- und Pipeline-Parallelismus für sehr große Transformer<sup>[\[81\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-81)</sup>.
- **Ökosystem und Werkzeuge:** **Hugging Face Transformers** und **Accelerate** bieten Standardimplementierungen von Modellen und die Integration mit DeepSpeed/FSDP für Training und Inferenz<sup>[\[82\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-82)[\[83\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-83)</sup>.

## Skalierungsgesetze und compute-optimales Training

Empirische **Skalierungsgesetze** zeigen, dass der Kreuzentropie-Fehler mit dem Wachstum von Parametern, Daten und Rechenleistung exponentiell abnimmt. <sup>[\[84\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-84)</sup> Die Arbeit zu **Chinchilla** präzisierte die Modi des **compute-optimalen** Trainings: Für optimale Effizienz sollten die Modellgröße und die Anzahl der Trainings-Tokens gemeinsam skaliert werden (ein Beispiel ist ein 70B-Modell, das auf ~1,4 Billionen Tokens trainiert wurde und größere, untertrainierte Modelle übertrifft). <sup>[\[85\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-85)</sup>

## State Space Models (SSM)

**State Space Models (SSM)** sind eine alternative Architektur zu Transformern für die Verarbeitung langer Sequenzen. Sie entlehnen Ideen aus der Regelungstheorie und der digitalen Signalverarbeitung und lösen das Hauptproblem der Self-Attention: den quadratischen Anstieg des Rechenaufwands mit zunehmender Textlänge.

### Das Kernproblem und die Lösung

**Das Problem der Transformer.** Das Hauptproblem traditioneller Transformer ist die quadratische Komplexität der Attention: Ein zehnmal längerer Text erfordert etwa 100-mal mehr Berechnungen.

**Der SSM-Ansatz.** Statt „gleichzeitiger Aufmerksamkeit auf alle Wörter“ verarbeitet das Modell den Text sequenziell und unterhält einen kompakten internen **Gedächtniszustand**, der bei jedem Schritt aktualisiert wird. Dadurch wachsen Zeit- und Speicherverbrauch ungefähr linear mit der Textlänge. Gleichzeitig kann das Training parallel durchgeführt werden – durch eine Faltungsdarstellung des Kernels (hoher Durchsatz bei langen Sequenzen). <sup>[\[86\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-S4-86)</sup>

### Funktionsweise

Ein diskretes SSM wird durch Zustands- und Ausgangsgleichungen beschrieben:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

wobei $x_{t}$ der Gedächtniszustand, $u_{t}$ die Eingabe (Token) und $y_{t}$ die Ausgabe ist. In tiefen SSMs werden die Matrizen $A,B,C,D$ so parametrisiert, dass Stabilität und effiziente Berechnungen bei langen Sequenzen gewährleistet sind. Derselbe Layer kann betrachtet werden als:

- rekurrent (schrittweises Scannen) – speichereffiziente Inferenz ohne KV-Cache;
- faltend (konvolutionell) – paralleles Training mit einem vorberechneten Kernel. <sup>[\[86\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-S4-86)</sup>

### Grundlegende Architekturen und Hybride

- **S4 (Structured State Spaces).** Die grundlegende SSM-Linie mit einer stabilen Parametrisierung der Zustandsmatrix; zeigt Effizienz bei sehr langen Sequenzen. <sup>[\[86\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-S4-86)</sup>
- **Mamba.** *Selektive* SSMs: Die Aktualisierungsregeln für das Gedächtnis hängen von der aktuellen Eingabe ab (das Modell entscheidet selbst, was im „Gedächtnis behalten“ und was „vergessen“ werden soll). Die Implementierung ist auf die GPU-Speicherhierarchie ausgerichtet; laut den Autoren wird eine mehrfache Steigerung des Inferenzdurchsatzes bei linearer Komplexität in Bezug auf die Länge erreicht. <sup>[\[87\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mamba-87)</sup>
- **RetNet.** Ein *Retention*-Mechanismus mit drei Modi: paralleles Training, rekurrentes und block-rekurrentes Inferencing. Das Ziel ist, schnelles Training (wie bei Transformern) mit sparsamer Inferenz (O(1) Speicher pro Token) zu kombinieren. <sup>[\[88\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RetNet-88)</sup>
- **Hybride Attention+SSM.** Ein Beispiel ist **Jamba** (abwechselnde Schichten von Transformer und Mamba plus MoE): Berichtet über die Unterstützung von Kontexten von ca. ~256K Tokens bei deutlich geringerem Speicherbedarf im Vergleich zu reinen Transformer-Modellen ähnlicher Klasse. <sup>[\[89\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Jamba-89)</sup>

#### Vorteile

- Lineare Komplexität und Speichereinsparung bei der Inferenz. Keine globale Self-Attention und kein KV-Cache; es wird nur ein kompakter Zustand gespeichert. <sup>[\[87\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RetNet-88)</sup>
- Paralleles Training auf langen Sequenzen. Der Faltungsmodus erhöht den Trainingsdurchsatz. <sup>[\[86\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-S4-86)</sup>
- Hardware-Effizienz. Implementierungen sind auf moderne Speicherhierarchien (HBM/SRAM) ausgerichtet. <sup>[\[87\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mamba-87)</sup>
- Lange Kontexte und Streaming. Hybride aus SSM+Attention sind für Hunderttausende von Tokens bei moderaten Ressourcen praktisch. <sup>[\[89\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Jamba-89)</sup>

#### Einschränkungen und aktuelle Praxis

- Reifegrad des Ökosystems. Werkzeuge und „Rezepte“ zur Skalierung (Instructions, RLHF/DPO) sind noch nicht so ausgereift wie im Transformer-Stack. <sup>[\[87\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mamba-87)</sup>
- Qualität und Stabilität. Bei einigen Aufgaben zeigen Hybride (Attention+SSM) einen stabileren Kompromiss zwischen Qualität, Geschwindigkeit und Speicher als „reine“ SSMs. <sup>[\[89\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Jamba-89)</sup>

#### Vergleich der Ansätze (verallgemeinert)

| Merkmal                       | Transformer                       | SSM                   | Hybride (Attention+SSM) |
|-------------------------------|-----------------------------------|-----------------------|-------------------------|
| Komplexität bzgl. Länge       | Quadratisch (Self-Attention)      | Linear (Scan/Faltung) | Nahezu linear           |
| Speicher pro Token (Inferenz) | KV-Cache wächst mit Kontext       | O(1) Zustand          | Moderates Wachstum      |
| Lange Kontexte                | Erfordert spezielle Optimierungen | Native Unterstützung  | Praktikabel bis ~256 K  |
| Reifegrad des Ökosystems      | Hoch                              | In Entwicklung        | In Entwicklung          |

#### Praktische Anwendungen

- Analyse sehr langer Dokumente (Bücher, Berichte, wissenschaftliche Übersichten).
- Streaming-Verarbeitung und Chat-Szenarien mit langer Historie ohne steigende Speicherkosten.
- Umgebungen mit begrenzten Ressourcen (mobile/edge-Geräte).
- Zeitreihen und andere sequentielle Daten.

**Repräsentative Modelle:** S4, Mamba, RetNet; Hybride Attention+SSM (Jamba). <sup>[\[86\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Jamba-89)</sup>

## Evolution der Architekturen

- 2017 – Veröffentlichung des Papers „Attention Is All You Need“. Die Transformer-Architektur wird vorgestellt: Multi-Head Self-Attention und Positionskodierungen ermöglichen das Training von Modellen ohne Rekurrenz und Faltungen; gleichzeitig hat die Attention eine quadratische Komplexität in Bezug auf die Kontextlänge.<sup>[\[1\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 – GPT-1 und BERT werden vorgestellt. GPT-1 verwendet einen reinen Decoder-Stack mit kausaler Attention für die Generierung und anschließendes Fine-Tuning; BERT führt einen bidirektionalen Encoder und das MLM-Pre-Training für Aufgaben des Textverständnisses ein. <sup>[\[90\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-90)[\[91\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-91)</sup>

<!-- -->

- 2019 – Methoden zur Verarbeitung langer Sequenzen werden vorgeschlagen und Decoder-only-Modelle skaliert. Transformer-XL fügt einen „Speicher“ und relative Positionen hinzu, um über ein festes Fenster hinauszugehen; GPT-2 zeigt eine Zunahme der Zero-Shot-Fähigkeiten bei zunehmender Skalierung; BART demonstriert die Effektivität des Denoising-Pre-Trainings für Seq2Seq. <sup>[\[92\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-92)[\[93\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-93)[\[94\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-94)</sup>

<!-- -->

- 2020 – Das „Text-to-Text“-Format wird vereinheitlicht und Methoden für lange Dokumente werden gezeigt. T5 formuliert einen einheitlichen Encoder-Decoder-Ansatz für verschiedene Aufgaben; Longformer und BigBird verwenden Sparse/strukturierte Attention für lange Texte; GPT-3 bestätigt die Effektivität der Skalierung von dichten Decoder-only-Modellen. <sup>[\[95\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-95)[\[96\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-96)[\[97\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-97)[\[98\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-98)</sup>

<!-- -->

- 2021 – Positionsrepräsentationen werden verbessert und die Parameter-Sparsamkeit (MoE) wird demonstriert. RoPE und ALiBi verbessern die Generalisierung bei großen Längen; Switch Transformer und GLaM aktivieren nur einen Teil der Experten pro Token und erhöhen so die Kapazität ohne exponentiellen Anstieg der Inferenzkosten. <sup>[\[99\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-99)[\[100\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-100)[\[101\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-101)[\[102\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-102)</sup>

<!-- -->

- 2022 – Der compute-optimale Modus wird präzisiert und die Inferenz bei langen Prompts beschleunigt. Chinchilla zeigt den Vorteil einer größeren Anzahl von Trainings-Tokens bei moderater Modellgröße; PaLM mit Multi-Query Attention reduziert das Volumen des KV-Cache; FlashAttention beschleunigt die Attention auf GPUs. <sup>[\[103\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-103)[\[104\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-104)[\[105\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-105)[\[106\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-106)</sup>

<!-- -->

- 2023 – Kontextfenster werden ohne Layer-Änderungen vergrößert und das serverseitige Serving verbessert. Die LLaMA-Reihe etabliert Praktiken (RMSNorm, SwiGLU, RoPE); Position Interpolation und YaRN erweitern den Kontext; vLLM/PagedAttention verwaltet den KV-Cache effizienter. <sup>[\[107\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-107)[\[108\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-108)[\[109\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-109)[\[110\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-110)[\[111\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-111)[\[112\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-112)</sup>

<!-- -->

- 2023 – GPT-4 und Gemini demonstrieren die Verarbeitung und Generierung in mehreren Modalitäten innerhalb einer Modellfamilie. <sup>[\[113\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-113)[\[114\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-114)</sup>

<!-- -->

- 2023 – Modelle mit Zustandsraum (SSM) werden vorgeschlagen. Mamba und RetNet führen die sequentielle Verarbeitung mit einem kompakten Zustand anstelle eines KV-Cache wieder ein und legen den Grundstein für hybride Architekturen. <sup>[\[115\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-115)[\[116\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-116)</sup>

<!-- -->

- 2024 – Offene MoE-Modelle und Attention+SSM-Hybride werden veröffentlicht; die Attention auf neuen GPUs wird beschleunigt. Mixtral 8×7B/8×22B und DBRX bestätigen die Praktikabilität von MoE; Jamba kombiniert Transformer und Mamba für sehr lange Kontexte; FlashAttention-3 erhöht den Durchsatz. <sup>[\[117\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-117)[\[118\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-118)[\[119\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-119)[\[120\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-120)[\[121\]](https://systems-analysis.info/int/LLM-Architekturen#cite_note-121)</sup>

## Weblinks

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer – eine visuelle Erklärung

## Literatur

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few-Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence-to-Sequence Pre-training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron-LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute-Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT-4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT-4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer-Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer-XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## Einzelnachweise

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding-enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long-Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write-Head is All You Need* (Multi-Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-29) Achiam, J. et al. (2023). *GPT-4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence-to-Sequence Pre-training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence-to-Sequence Pre-training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models (FLAN-T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-38) Brown, T. et al. (2020). Language Models are Few-Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write-Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture-of-Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture-of-Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval-Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-64) Dao, T. et al. (2023). *FlashAttention-2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-65) Shah, M. et al. (2024). *FlashAttention-3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write-Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-73) Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self-Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion-Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear-Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer-Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-92) Dai, Z. et al. (2019). Transformer-XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-98) Brown, T. et al. (2020). Language Models are Few-Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-113) OpenAI (2023). GPT-4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/LLM-Architekturen#cite_ref-121) Shah, M. et al. (2024). FlashAttention-3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
