---
title: "FlashAttention-2 (DE)"
source: "https://systems-analysis.info/int/FlashAttention-2_(DE)"
wiki: "systems-analysis.info/int"
article: "FlashAttention-2_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 2196
wiki_created_at: 2026-09-06T22:59:58Z
wiki_modified_at: 2026-09-06T22:59:58Z
downloaded_at: 2026-09-07T22:49:46Z
---

# FlashAttention-2 (DE)

**FlashAttention-2** ist ein fortschrittlicher Algorithmus zur Berechnung des Attention-Mechanismus in [großen Sprachmodellen (LLMs)](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle"). Der Algorithmus wurde von **Tri Dao** und Forschern der Stanford University entwickelt und im Juli 2023 vorgestellt<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>. Sein Hauptziel ist die signifikante Beschleunigung des Trainings und der Inferenz von Transformer-Modellen durch eine effizientere Nutzung der GPU-Hardware, wobei die Berechnungsergebnisse im Vergleich zum Standard-Attention-Mechanismus exakt identisch bleiben, d.h. **ohne Genauigkeitsverlust**.

FlashAttention-2 ist die logische Weiterentwicklung des **FlashAttention**-Algorithmus, der 2022 vom selben Team vorgestellt wurde. Die neue Version behebt das Problem der unvollständigen GPU-Auslastung des Vorgängers und erreicht eine nahezu doppelte Geschwindigkeitssteigerung im Vergleich zur ersten Version.

## Hintergrund: Das Attention-Problem in Transformern

Der Standard-Self-Attention-Mechanismus stellt bei der Verarbeitung langer Textsequenzen in Transformern einen Engpass dar. Seine Rechenkomplexität und sein Speicherbedarf wachsen **quadratisch** (O(N²)) mit der Sequenzlänge (N), was die maximale Kontextlänge und die Skalierbarkeit von LLMs stark einschränkt<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>.

Um dieses Problem zu lösen, wurde 2022 der Algorithmus **FlashAttention** vorgestellt<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-huggingface_optim-2)</sup>. Seine zentralen Ideen sind:

- **Berücksichtigung der GPU-Speicherhierarchie (IO-Awareness)**: Der Algorithmus minimiert die aufwendigen Lese- und Schreibvorgänge zwischen dem langsamen GPU-Speicher (HBM) und dem schnellen On-Chip-SRAM.
- **Blockweise Verarbeitung (Tiling)**: Die Berechnungen werden in kleine Blöcke (Tiles) aufgeteilt, die im schnellen SRAM verarbeitet werden. Dadurch wird die Materialisierung der vollständigen Attention-Matrix im Speicher vermieden.

Dies ermöglichte einen **linearen** Anstieg des Speicherverbrauchs (O(N)) und eine Beschleunigung um den Faktor 2–4 im Vergleich zu Standardimplementierungen<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-huggingface_optim-2)</sup>. FlashAttention fand breite Anwendung und trug zur Entwicklung von Modellen mit deutlich vergrößertem Kontext bei, beispielsweise von 2.000–4.000 Tokens (GPT-3) auf 128.000 (GPT-4) und mehr<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-tridao_blog_fa3-3)</sup>. So beschleunigte der Einsatz von FlashAttention im Modell **Falcon-40B** die Inferenz um das 3-fache und die gesamte Generierungsleistung um das 5-fache im Vergleich zu GPT-3<sup>[\[4\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-e2e_analysis-4)</sup>.

## Entwicklung und Ziele von FlashAttention-2

Trotz seines Erfolgs nutzte die erste Version von FlashAttention die Rechenressourcen der GPUs nicht vollständig aus. Auf **NVIDIA A100**-Grafikkarten erreichte die Leistung nur **25–40 %** des theoretischen Maximums (FLOPs/s)<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>. Hauptgrund dafür waren eine suboptimale Auslastung der Streaming Multiprocessors und redundante Operationen mit dem gemeinsam genutzten Speicher<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-openreview_fa2-5)</sup>.

Das Ziel von **FlashAttention-2** war es, die Berechnungen durch eine effizientere Parallelisierung der Arbeit und die Minimierung von Hilfsoperationen weiter zu beschleunigen. Der Algorithmus wurde unter Verwendung von Low-Level-Primitiven aus der **NVIDIA CUTLASS 3.x**-Bibliothek vollständig neu geschrieben, um maximale Leistung zu erzielen<sup>[\[6\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-hazyresearch_blog-6)</sup>.

## Technische Architektur und Funktionsprinzipien

FlashAttention-2 führt drei wesentliche Verbesserungen ein, um Parallelität und Effizienz zu steigern<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>:

### 1. Minimierung von Nicht-Matrix-Operationen

Der Algorithmus reduziert die Anzahl der Hilfsoperationen mit Gleitkommazahlen, die keine Matrixmultiplikationen sind (non-matmul FLOPs). Da die Tensor Cores der GPUs speziell für Matrixoperationen (GEMM) optimiert sind und diese bis zu 16-mal schneller ausführen, ermöglicht diese Änderung, die leistungsfähigsten GPU-Einheiten die meiste Zeit zu nutzen.

### 2. Verbesserter Parallelismus

Im ursprünglichen FlashAttention wurde die Arbeit an einem einzelnen Attention-Head nicht parallelisiert, was bei langen Sequenzen und kleinen Batch-Größen zu Leerlauf führte. FlashAttention-2 führt eine **blockübergreifende Parallelisierung** ein: Die Berechnungen für einen einzelnen Attention-Head werden nun auf verschiedene Streaming Multiprocessors der GPU verteilt, was deren Auslastung erheblich verbessert.

### 3. Optimierte Arbeitsaufteilung innerhalb eines Blocks

Auf der Ebene eines einzelnen Rechenblocks wurde die Arbeit zwischen den Thread-Gruppen (Warps) neu verteilt, um den Datenaustausch über den gemeinsam genutzten Speicher (Shared Memory) zu reduzieren. Dies verringert die Anzahl der redundanten Lese- und Schreibvorgänge, die für die Softmax-Normalisierung erforderlich sind.

## Leistung und Effizienz

Dank der architektonischen Verbesserungen zeigt FlashAttention-2 eine signifikante Leistungssteigerung:

- **Zweifache Beschleunigung**: Der Algorithmus ist etwa **doppelt so schnell** wie die erste Version von FlashAttention<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>.
- **Hohe GPU-Auslastung**: Auf einer **NVIDIA A100**-GPU werden **50–73 %** des theoretischen maximalen Durchsatzes (TFLOPs) erreicht, was der Effizienz optimierter Matrixmultiplikationen (GEMM) nahekommt<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_main-1)</sup>.
- **Rekordverdächtige Rechengeschwindigkeit**:
  - Auf einer **A100**-GPU wird eine Geschwindigkeit von bis zu **225 TFLOP/s** im End-to-End-Trainingszyklus eines GPT-ähnlichen Modells erreicht, was einer Auslastung der Recheneinheiten von 72 % entspricht. Zum Vergleich: Standard-Attention lastete die GPU unter denselben Bedingungen mit weniger als 100 TFLOP/s aus<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_pdf-7)</sup>.
  - Auf einer **H100**-GPU erreicht die Leistung **335 TFLOP/s**<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_pdf-7)</sup>.

Diese Leistungssteigerung ermöglicht es beispielsweise, ein Modell mit einem Kontextfenster von **16k** Tokens in der gleichen Zeit zu trainieren, die zuvor für ein Fenster von **8k** Tokens benötigt wurde<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-openreview_fa2-5)</sup>. Wichtig ist, dass der Algorithmus **exakt** und deterministisch bleibt, sodass seine Anwendung die Qualität der Modellvorhersagen nicht beeinträchtigt<sup>[\[8\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-raschka_blog-8)</sup>.

## Anwendung und Integration in das Ökosystem

FlashAttention-2 wurde schnell zu einem Standardwerkzeug im LLM-Ökosystem. Es ist in viele gängige Frameworks und Bibliotheken integriert:

- **PyTorch**: Native Unterstützung.
- **Hugging Face Transformers**: Die Unterstützung wird beim Laden des Modells mit dem Parameter \`attn_implementation="flash_attention_2"\` aktiviert<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-linkedin_younes-9)</sup>. Kompatibel mit Dutzenden von Architekturen (GPT, Llama, Falcon, BERT usw.)<sup>[\[10\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-huggingface_gpu_infer-10)</sup>.
- **TensorRT-LLM**, **xFormers** und **Triton**: Der Algorithmus ist für diese Plattformen implementiert, was eine breite Anwendung gewährleistet<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_pdf-7)</sup>.

Die Integration ermöglicht es, FlashAttention-2 einfach mit anderen Optimierungsmethoden wie Quantisierung (GPTQ, QLoRA) und effizientem Fine-Tuning (PEFT) zu kombinieren<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-linkedin_younes-9)</sup>.

## Vergleich mit nachfolgenden Versionen

### FlashAttention-3

Die Forschung im Bereich der Attention-Optimierung wird fortgesetzt. Im Juli 2024 stellte Tri Dao **FlashAttention-3** vor, das auf die Nutzung der Fähigkeiten der **NVIDIA Hopper**-GPU-Architektur (H100/H200) abzielt. Die wichtigsten Neuerungen sind<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-tridao_blog_fa3-3)</sup>:

- **Unterstützung für FP8**: Nutzt 8-Bit-Gleitkommaberechnungen für weitere Beschleunigung.
- **Asynchrone Operationen**: Nutzt die asynchronen Fähigkeiten der GPU effizienter.

FlashAttention-3 bietet eine Beschleunigung um den Faktor **1,5–2** im Vergleich zu FlashAttention-2 auf H100-GPUs und erreicht eine Leistung von bis zu **740 TFLOP/s** (75 % des theoretischen Maximums)<sup>[\[11\]](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_note-arxiv_fa3-11)</sup>.

## Literatur

- Dao, T. (2023). *FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning*. <a href="https://arxiv.org/abs/2307.08691" class="external text" rel="nofollow">arXiv:2307.08691</a>.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Dao, T. et al. (2024). *FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision*. <a href="https://arxiv.org/abs/2407.08608" class="external text" rel="nofollow">arXiv:2407.08608</a>.
- Kwon, W. et al. (2023). *Efficient Memory Management for Large Language Model Serving with PagedAttention*. <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Ye, Z. et al. (2025). *FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving*. <a href="https://arxiv.org/abs/2501.01005" class="external text" rel="nofollow">arXiv:2501.01005</a>.
- Chen, Y. et al. (2023). *FlashDecoding++: Faster Large Language Model Inference on GPUs*. <a href="https://arxiv.org/abs/2311.01282" class="external text" rel="nofollow">arXiv:2311.01282</a>.
- Liu, Y. et al. (2024). *FastAttention: Extending FlashAttention-2 to NPUs and Low-Resource GPUs*. <a href="https://openreview.net/forum?id=76NYyOrnfk" class="external text" rel="nofollow">OpenReview: 76NYyOrnfk</a>.
- Dege, P. et al. (2025). *FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs*. <a href="https://arxiv.org/abs/2506.01969" class="external text" rel="nofollow">arXiv:2506.01969</a>.
- Wang, G. et al. (2024). *FlashMask: Efficient and Rich Mask Extension of FlashAttention*. <a href="https://openreview.net/forum?id=rog0J435OO" class="external text" rel="nofollow">OpenReview: rog0J435OO</a>.
- Abbott, V.; Zardini, G. (2025). *FlashAttention on a Napkin: A Diagrammatic Approach to Deep Learning IO-Awareness*. <a href="https://arxiv.org/abs/2412.03317" class="external text" rel="nofollow">arXiv:2412.03317</a>.

## Einzelnachweise

1.  <span id="cite_note-arxiv_main-1">↑ <sup>[1.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_main_1-5)</sup> Dao, Tri. „FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning“. *arXiv:2307.08691* \[cs.LG\], 17. Juli 2023. <a href="https://arxiv.org/abs/2307.08691" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_optim-2">↑ <sup>[2.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-huggingface_optim_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-huggingface_optim_2-1)</sup> „Optimizing LLMs for Speed and Memory“. *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.42.0/en/llm_tutorial_optimization" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-tridao_blog_fa3-3">↑ <sup>[3.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-tridao_blog_fa3_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-tridao_blog_fa3_3-1)</sup> Dao, Tri. „FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision“. *Tri Dao's Blog*. <a href="https://tridao.me/blog/2024/flash3/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-e2e_analysis-4">[↑](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-e2e_analysis_4-0) „FlashAttention vs FlashAttention-2 - an Analysis“. *E2E Networks Blog*. <a href="https://www.e2enetworks.com/blog/shades-of-attention-flashattention-vs-flashattention-2-a-comprehensive-study" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openreview_fa2-5">↑ <sup>[5.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-openreview_fa2_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-openreview_fa2_5-1)</sup> „FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning“. *OpenReview*. <a href="https://openreview.net/forum?id=mZn2Xyh9Ec" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hazyresearch_blog-6">[↑](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-hazyresearch_blog_6-0) „FlashAttention-2“. *Hazy Research, Stanford University*. <a href="https://hazyresearch.stanford.edu/blog/2023-07-17-flash2" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv_pdf-7">↑ <sup>[7.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_pdf_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_pdf_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_pdf_7-2)</sup> Dao, Tri. „FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning“ (PDF). *arXiv:2307.08691*. <a href="https://arxiv.org/pdf/2307.08691.pdf" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-raschka_blog-8">[↑](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-raschka_blog_8-0) Raschka, Sebastian. „Llama 2 and FlashAttention 2“. *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/research-highlights-in-three-sentences" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-linkedin_younes-9">↑ <sup>[9.0](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-linkedin_younes_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-linkedin_younes_9-1)</sup> Belkada, Younes. „Faster and more memory efficient models with Flash Attention 2!“. *LinkedIn*. <a href="https://www.linkedin.com/posts/younes-belkada-b1a903145_flashattention-llms-activity-7112061650106474496-1dzz" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-huggingface_gpu_infer-10">[↑](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-huggingface_gpu_infer_10-0) „GPU inference“. *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.39.0/perf_infer_gpu_one" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-arxiv_fa3-11">[↑](https://systems-analysis.info/int/FlashAttention-2_(DE)#cite_ref-arxiv_fa3_11-0) Dao, Tri, et al. „FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision“. *arXiv:2407.08608* \[cs.LG\], 11. Juli 2024. <a href="https://arxiv.org/abs/2407.08608" class="external autonumber" rel="nofollow">[11]</a></span>
