---
title: "FlashAttention-2 (SV)"
source: "https://systems-analysis.info/int/FlashAttention-2_(SV)"
wiki: "systems-analysis.info/int"
article: "FlashAttention-2_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 2211
wiki_created_at: 2026-09-06T23:00:22Z
wiki_modified_at: 2026-09-06T23:00:22Z
downloaded_at: 2026-09-07T22:49:52Z
---

# FlashAttention-2 (SV)

**FlashAttention-2** — är en förbättrad algoritm avsedd för beräkning av attention-mekanismen i stora språkmodeller (LLM). Algoritmen utvecklades av **Tri Dao** och forskare från Stanford University och presenterades i juli 2023<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>. Dess huvudsakliga mål är att avsevärt påskynda träning och inferens av transformer-modeller genom mer effektivt utnyttjande av GPU-hårdvaruresurser, samtidigt som fullständig beräkningsidentitet med den standardiserade attention-mekanismen bevaras, det vill säga **utan förlust av precision**.

FlashAttention-2 är en logisk vidareutveckling av algoritmen **FlashAttention**, som presenterades av samma team år 2022. Den nya versionen löser problemet med ofullständig GPU-belastning som observerades hos föregångaren och uppnår en nästan tvåfaldig hastighetsökning jämfört med den första versionen.

## Förutsättningar: problemet med attention i transformers

Den standardiserade self-attention-mekanismen är en flaskhals vid arbete med långa textsekvenser i transformers. Dess beräkningskomplexitet och minnesförbrukning växer **kvadratiskt** (O(N²)) beroende på sekvensens längd (N), vilket sätter allvarliga begränsningar på den maximala kontextlängden och skalbarheten hos LLM<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>.

För att lösa detta problem presenterades algoritmen **FlashAttention** år 2022<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-huggingface_optim-2)</sup>. Dess centrala idéer:

- **Hänsyn till GPU:ns minneshierarki (IO-awareness)**: Algoritmen minimerar kostsamma läs-/skrivoperationer mellan GPU:ns långsamma minne (HBM) och det snabba statiska minnet (SRAM) på chippet.
- **Blockbearbetning (tiling)**: Beräkningarna delas upp i små block (tiles) som bearbetas i det snabba SRAM, vilket gör det möjligt att undvika materialisering av den fullständiga attention-matrisen i minnet.

Detta gjorde det möjligt att uppnå **linjär** tillväxt i minnesförbrukning (O(N)) och en 2–4 gångers snabbhetsökning jämfört med standardimplementationer<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-huggingface_optim-2)</sup>. FlashAttention fick bred spridning och bidrog till framväxten av modeller med avsevärt förlängd kontext, till exempel från 2–4 tusen token (GPT-3) till 128 tusen (GPT-4) och mer<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-tridao_blog_fa3-3)</sup>. I modellen **Falcon-40B** påskyndade användningen av FlashAttention inferensen 3 gånger och den övergripande genereringsprestandan 5 gånger jämfört med GPT-3<sup>[\[4\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-e2e_analysis-4)</sup>.

## Utveckling och mål för FlashAttention-2

Trots framgången utnyttjade den första versionen av FlashAttention inte GPU:ns beräkningsresurser fullt ut. På grafikkort av typen **NVIDIA A100** nådde prestandan bara **25–40%** av det teoretiska maximala värdet (FLOPs/s)<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>. Huvudorsaken var en suboptimal belastning av Streaming Multiprocessors och överflödiga operationer med delat minne<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-openreview_fa2-5)</sup>.

Målet med **FlashAttention-2** blev att ytterligare påskynda beräkningarna genom effektivare parallellisering av arbetet och minimering av hjälpoperationer. Algoritmen skrevs om från grunden med hjälp av lågnivåprimitiver från biblioteket **NVIDIA CUTLASS 3.x** för att uppnå maximal prestanda<sup>[\[6\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-hazyresearch_blog-6)</sup>.

## Teknisk arkitektur och arbetsprinciper

FlashAttention-2 introducerar tre viktiga förbättringar för att öka parallellism och effektivitet<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>:

### 1. Minimering av icke-matrisoperationer

Algoritmen reducerar antalet hjälpoperationer med flyttal som inte är matrisoperationer (non-matmul FLOPs). Eftersom GPU:ns tensorkärnor är optimerade just för matrisoperationer (GEMM) och utför dem upp till 16 gånger snabbare, gör denna förändring att den mesta tiden ägnas åt GPU:ns mest presterande block.

### 2. Förbättrad parallellism

I den ursprungliga FlashAttention parallelliserades inte arbetet med ett enskilt attention-huvud, vilket ledde till stillestånd vid långa sekvenser och små batchstorlekar. FlashAttention-2 introducerar **inter-block-parallellism**: beräkningarna för ett attention-huvud fördelas nu mellan olika Streaming Multiprocessors på GPU:n, vilket avsevärt ökar deras belastning.

### 3. Optimerad arbetsfördelning inom ett block

På nivån för ett enskilt beräkningsblock omfördelades arbetet mellan grupper av trådar (warps) för att minska datautbytet via delat minne (shared memory). Detta minskar antalet överflödiga läs-/skrivoperationer som krävs för Softmax-normalisering.

## Prestanda och effektivitet

Tack vare de arkitektoniska förbättringarna uppvisar FlashAttention-2 en betydande prestationsökning:

- **Tvåfaldig hastighetsökning**: Algoritmen arbetar ungefär **2 gånger snabbare** jämfört med den första versionen av FlashAttention<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>.
- **Hög GPU-utnyttjande**: På GPU:n **NVIDIA A100** uppnås **50–73%** av det teoretiska maximala genomflödet (TFLOPs), vilket ligger nära effektiviteten hos optimerade matrisoperationer (GEMM)<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_main-1)</sup>.
- **Rekordsnabb beräkning**:
  - På GPU:n **A100** uppnås en hastighet på upp till **225 TFLOP/s** i ett genomgående träningscykel för en GPT-liknande modell, vilket motsvarar 72% utnyttjande av beräkningsblocken. Jämförelsevis belastade standardmässig attention GPU:n med mindre än 100 TFLOP/s under samma förhållanden<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_pdf-7)</sup>.
  - På GPU:n **H100** når prestandan **335 TFLOP/s**<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_pdf-7)</sup>.

En sådan prestandaökning gör det möjligt att till exempel träna en modell med ett kontextfönster på **16k** token på samma tid som tidigare krävdes för ett fönster på **8k** token<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-openreview_fa2-5)</sup>. Det är viktigt att algoritmen förblir **exakt** och deterministisk, så dess tillämpning påverkar inte kvaliteten på modellens förutsägelser<sup>[\[8\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-raschka_blog-8)</sup>.

## Tillämpning och integration i ekosystemet

FlashAttention-2 har snabbt blivit ett standardverktyg i LLM-ekosystemet. Det är integrerat i många populära ramverk och bibliotek:

- **PyTorch**: Inbyggt stöd.
- **Hugging Face Transformers**: Stödet aktiveras med parametern \`attn_implementation="flash_attention_2"\` vid laddning av modellen<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-linkedin_younes-9)</sup>. Kompatibelt med dussintals arkitekturer (GPT, Llama, Falcon, BERT med flera)<sup>[\[10\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-huggingface_gpu_infer-10)</sup>.
- **TensorRT-LLM**, **xFormers** och **Triton**: Algoritmen är implementerad för dessa plattformar, vilket säkerställer bred tillämpning<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_pdf-7)</sup>.

Integrationen gör det enkelt att kombinera FlashAttention-2 med andra optimeringsmetoder, såsom kvantering (GPTQ, QLoRA) och effektiv fine-tuning (PEFT)<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-linkedin_younes-9)</sup>.

## Jämförelse med efterföljande versioner

### FlashAttention-3

Forskningen inom optimering av attention fortsätter. I juli 2024 presenterade Tri Dao **FlashAttention-3**, inriktat på att utnyttja möjligheterna hos GPU-arkitekturen **NVIDIA Hopper** (H100/H200). De viktigaste nyheterna<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-tridao_blog_fa3-3)</sup>:

- **Stöd för FP8**: Använder 8-bitars flyttalsberäkningar för ytterligare snabbhetsökning.
- **Asynkrona operationer**: Utnyttjar GPU:ns asynkrona möjligheter mer effektivt.

FlashAttention-3 ger en **1,5–2 gångers** snabbhetsökning jämfört med FlashAttention-2 på GPU H100 och uppnår en prestanda på upp till **740 TFLOP/s** (75% av det teoretiska maximala värdet)<sup>[\[11\]](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_note-arxiv_fa3-11)</sup>.

## Litteratur

- Dao, T. (2023). *FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness*. arXiv:2205.14135.
- Shah, J. et al. (2024). *FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision*. arXiv:2407.08608.
- Kwon, W. et al. (2023). *Efficient Memory Management for Large Language Model Serving with PagedAttention*. arXiv:2309.06180.
- Ye, Z. et al. (2025). *FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving*. arXiv:2501.01005.
- Chen, Y. et al. (2023). *FlashDecoding++: Faster Large Language Model Inference on GPUs*. arXiv:2311.01282.
- Liu, Y. et al. (2024). *FastAttention: Extending FlashAttention-2 to NPUs and Low-Resource GPUs*. OpenReview: 76NYyOrnfk.
- Dege, P. et al. (2025). *FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs*. arXiv:2506.01969.
- Wang, G. et al. (2024). *FlashMask: Efficient and Rich Mask Extension of FlashAttention*. OpenReview: rog0J435OO.
- Abbott, V.; Zardini, G. (2025). *FlashAttention on a Napkin: A Diagrammatic Approach to Deep Learning IO-Awareness*. arXiv:2412.03317.

## Noter

1.  <span id="cite_note-arxiv_main-1">↑ <sup>[1.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_main_1-5)</sup> Дао, Три. «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning». *arXiv:2307.08691* \[cs.LG\], 17 июля 2023 г. <a href="https://arxiv.org/abs/2307.08691" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_optim-2">↑ <sup>[2.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-huggingface_optim_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-huggingface_optim_2-1)</sup> «Optimizing LLMs for Speed and Memory». *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.42.0/en/llm_tutorial_optimization" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-tridao_blog_fa3-3">↑ <sup>[3.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-tridao_blog_fa3_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-tridao_blog_fa3_3-1)</sup> Дао, Три. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *Tri Dao's Blog*. <a href="https://tridao.me/blog/2024/flash3/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-e2e_analysis-4">[↑](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-e2e_analysis_4-0) «FlashAttention vs FlashAttention-2 - an Analysis». *E2E Networks Blog*. <a href="https://www.e2enetworks.com/blog/shades-of-attention-flashattention-vs-flashattention-2-a-comprehensive-study" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openreview_fa2-5">↑ <sup>[5.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-openreview_fa2_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-openreview_fa2_5-1)</sup> «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning». *OpenReview*. <a href="https://openreview.net/forum?id=mZn2Xyh9Ec" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hazyresearch_blog-6">[↑](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-hazyresearch_blog_6-0) «FlashAttention-2». *Hazy Research, Stanford University*. <a href="https://hazyresearch.stanford.edu/blog/2023-07-17-flash2" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv_pdf-7">↑ <sup>[7.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_pdf_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_pdf_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_pdf_7-2)</sup> Дао, Три. «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning» (PDF). *arXiv:2307.08691*. <a href="https://arxiv.org/pdf/2307.08691.pdf" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-raschka_blog-8">[↑](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-raschka_blog_8-0) Рашка, Себастьян. «Llama 2 and FlashAttention 2». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/research-highlights-in-three-sentences" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-linkedin_younes-9">↑ <sup>[9.0](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-linkedin_younes_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-linkedin_younes_9-1)</sup> Белькада, Юнес. «Faster and more memory efficient models with Flash Attention 2!». *LinkedIn*. <a href="https://www.linkedin.com/posts/younes-belkada-b1a903145_flashattention-llms-activity-7112061650106474496-1dzz" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-huggingface_gpu_infer-10">[↑](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-huggingface_gpu_infer_10-0) «GPU inference». *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.39.0/perf_infer_gpu_one" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-arxiv_fa3-11">[↑](https://systems-analysis.info/int/FlashAttention-2_(SV)#cite_ref-arxiv_fa3_11-0) Дао, Три, и др. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *arXiv:2407.08608* \[cs.LG\], 11 июля 2024 г. <a href="https://arxiv.org/abs/2407.08608" class="external autonumber" rel="nofollow">[11]</a></span>
