---
title: "FlashAttention-2 (TR)"
source: "https://systems-analysis.info/int/FlashAttention-2_(TR)"
wiki: "systems-analysis.info/int"
article: "FlashAttention-2_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 2214
wiki_created_at: 2026-09-06T23:00:25Z
wiki_modified_at: 2026-09-06T23:00:25Z
downloaded_at: 2026-09-07T22:49:53Z
---

# FlashAttention-2 (TR)

**FlashAttention-2** — büyük dil modellerinde (LLM) attention mekanizmasını hesaplamak için geliştirilmiş, iyileştirilmiş bir algoritmadır. Algoritma, **Tri Dao** ve Stanford Üniversitesi araştırmacıları tarafından geliştirilmiş ve Temmuz 2023'te tanıtılmıştır<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>. Temel amacı, GPU donanım kaynaklarını daha verimli kullanarak transformer modellerinin eğitim ve çıkarım (inference) sürecini önemli ölçüde hızlandırmak; bunu yaparken standart attention mekanizmasıyla tam hesaplama özdeşliğini korumak, yani **doğruluk kaybı olmaksızın** çalışmaktır.

FlashAttention-2, aynı ekip tarafından 2022 yılında tanıtılan **FlashAttention** algoritmasının mantıksal bir devamıdır. Yeni sürüm, önceki versiyonda gözlemlenen GPU'nun tam olarak kullanılmaması sorununu çözmekte ve birinci versiyona kıyasla neredeyse iki katı hız artışı sağlamaktadır.

## Arka Plan: Transformer'larda Attention Sorunu

Standart öz-dikkat (self-attention) mekanizması, transformer'larda uzun metin dizileriyle çalışırken bir darboğaz oluşturmaktadır. Hesaplama karmaşıklığı ve bellek tüketimi, dizi uzunluğuna (N) bağlı olarak **ikinci dereceden** (O(N²)) büyümekte; bu durum maksimum bağlam uzunluğu ve LLM'lerin ölçeklenebilirliği üzerinde ciddi kısıtlamalar oluşturmaktadır<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>.

Bu sorunu çözmek amacıyla 2022 yılında **FlashAttention** algoritması tanıtılmıştır<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-huggingface_optim-2)</sup>. Temel fikirleri şunlardır:

- **GPU bellek hiyerarşisinin dikkate alınması (IO-awareness)**: Algoritma, GPU'nun yavaş belleği (HBM) ile çip üzerindeki hızlı statik bellek (SRAM) arasındaki maliyetli okuma/yazma işlemlerini en aza indirir.
- **Blok tabanlı işleme (tiling)**: Hesaplamalar, hızlı SRAM'de işlenen küçük bloklara (tile) bölünür; böylece tam attention matrisinin bellekte oluşturulması önlenir.

Bu yaklaşım, bellek tüketiminin **doğrusal** büyümesini (O(N)) ve standart uygulamalara kıyasla 2–4 kat hızlanmayı sağlamıştır<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-huggingface_optim-2)</sup>. FlashAttention yaygın biçimde benimsenmiş ve bağlam uzunluğu önemli ölçüde artırılmış modellerin ortaya çıkmasına katkıda bulunmuştur; örneğin 2–4 bin token'dan (GPT-3) 128 bine (GPT-4) ve daha fazlasına çıkılmıştır<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-tridao_blog_fa3-3)</sup>. Örneğin **Falcon-40B** modelinde FlashAttention kullanımı, çıkarım hızını 3 kat, GPT-3 ile karşılaştırıldığında genel üretim performansını ise 5 kat artırmıştır<sup>[\[4\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-e2e_analysis-4)</sup>.

## FlashAttention-2'nin Geliştirilmesi ve Hedefleri

Tüm başarısına rağmen FlashAttention'ın ilk versiyonu, GPU hesaplama kaynaklarını tam olarak kullanmıyordu. **NVIDIA A100** ekran kartlarında performans, teorik maksimumun (FLOPs/s) yalnızca **%25–40**ına ulaşıyordu<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>. Bunun temel nedeni, Streaming Multiprocessor'ların yetersiz yüklenmesi ve paylaşılan bellekle yapılan gereksiz işlemlerdi<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-openreview_fa2-5)</sup>.

**FlashAttention-2**nin hedefi, işi daha verimli biçimde paralelleştirerek ve yardımcı işlemleri en aza indirerek hesaplamaları daha da hızlandırmaktı. Algoritma, maksimum performansa ulaşmak için **NVIDIA CUTLASS 3.x** kütüphanesinin düşük seviyeli primitifleri kullanılarak baştan yazılmıştır<sup>[\[6\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-hazyresearch_blog-6)</sup>.

## Teknik Mimari ve Çalışma Prensipleri

FlashAttention-2, paralelizmi ve verimliliği artırmak için üç temel iyileştirme sunmaktadır<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>:

### 1. Matris Dışı İşlemlerin Azaltılması

Algoritma, matris çarpımı olmayan (non-matmul FLOPs) yardımcı kayan noktalı işlemlerin sayısını azaltır. GPU'nun tensör çekirdekleri (tensor cores) özellikle matris işlemleri (GEMM) için optimize edilmiş olup bunları 16 kata kadar daha hızlı gerçekleştirdiğinden, bu değişiklik GPU'nun en yüksek performanslı bloklarının daha uzun süre kullanılmasını sağlar.

### 2. Geliştirilmiş Paralelizm

Orijinal FlashAttention'da tek bir attention "head" üzerindeki çalışma paralelleştirilmiyordu; bu durum uzun dizilerde ve küçük batch boyutlarında boşta bekleme sürelerine yol açıyordu. FlashAttention-2, **bloklar arası paralelleştirme** getirmektedir: artık tek bir attention head için hesaplamalar, GPU'nun farklı Streaming Multiprocessor'ları arasında dağıtılmakta ve bu sayede doluluk oranı önemli ölçüde artmaktadır.

### 3. Blok İçi İş Bölümünün Optimizasyonu

Tek bir hesaplama bloğu düzeyinde, iş paylaşımlı bellek (shared memory) üzerinden veri alışverişini azaltmak amacıyla thread grupları (warp) arasında yeniden dağıtılmıştır. Bu durum, Softmax normalizasyonu için gerekli gereksiz okuma/yazma işlemlerinin sayısını azaltmaktadır.

## Performans ve Verimlilik

Mimari iyileştirmeler sayesinde FlashAttention-2, önemli bir performans artışı sergilemektedir:

- **İki kat hızlanma**: Algoritma, FlashAttention'ın birinci versiyonuna kıyasla yaklaşık **2 kat daha hızlı** çalışmaktadır<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>.
- **Yüksek GPU kullanım oranı**: **NVIDIA A100** GPU'da teorik maksimum bant genişliğinin (TFLOPs) **%50–73**üne ulaşılmakta; bu değer, optimize edilmiş matris çarpımı (GEMM) işlemlerinin verimliliğine yaklaşmaktadır<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_main-1)</sup>.
- **Rekor hesaplama hızları**:
  - **A100** GPU'da, GPT tipi bir modelin uçtan uca eğitim döngüsünde **225 TFLOP/s**ye kadar hız elde edilmekte; bu da hesaplama bloklarının %72 oranında kullanımına karşılık gelmektedir. Karşılaştırma yapmak gerekirse, aynı koşullarda standart attention GPU'yu 100 TFLOP/s'nin altında yüklemekteydi<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_pdf-7)</sup>.
  - **H100** GPU'da performans **335 TFLOP/s**ye ulaşmaktadır<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_pdf-7)</sup>.

Bu performans artışı, örneğin **16k** token'lık bağlam penceresiyle bir modeli, daha önce **8k** token'lık pencere için gereken sürede eğitmeye olanak tanımaktadır<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-openreview_fa2-5)</sup>. Algoritmanın **doğru** ve deterministik kalmaya devam etmesi, bu algoritmanın kullanılmasının modelin tahmin kalitesini etkilemediği anlamına gelmektedir<sup>[\[8\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-raschka_blog-8)</sup>.

## Uygulama ve Ekosisteme Entegrasyon

FlashAttention-2, LLM ekosisteminde hızla standart bir araç haline gelmiştir. Pek çok popüler framework ve kütüphaneye entegre edilmiştir:

- **PyTorch**: Yerel (native) destek.
- **Hugging Face Transformers**: Model yüklenirken \`attn_implementation="flash_attention_2"\` parametresiyle destek etkinleştirilmektedir<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-linkedin_younes-9)</sup>. Onlarca mimariyle (GPT, Llama, Falcon, BERT vb.) uyumludur<sup>[\[10\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-huggingface_gpu_infer-10)</sup>.
- **TensorRT-LLM**, **xFormers** ve **Triton**: Algoritma bu platformlar için uygulanmış olup geniş kullanım alanı sağlamaktadır<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_pdf-7)</sup>.

Bu entegrasyon, FlashAttention-2'nin kuantizasyon (GPTQ, QLoRA) ve verimli ince ayar (PEFT) gibi diğer optimizasyon yöntemleriyle kolayca birleştirilmesine olanak tanımaktadır<sup>[\[9\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-linkedin_younes-9)</sup>.

## Sonraki Versiyonlarla Karşılaştırma

### FlashAttention-3

Attention optimizasyonu alanındaki araştırmalar sürmektedir. Temmuz 2024'te Tri Dao, **NVIDIA Hopper** (H100/H200) GPU mimarisinin olanaklarını hedefleyen **FlashAttention-3**ü tanıtmıştır. Temel yenilikler<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-tridao_blog_fa3-3)</sup>:

- **FP8 Desteği**: Daha fazla hızlanma için 8-bit kayan noktalı hesaplamalar kullanmaktadır.
- **Asenkron İşlemler**: GPU'nun asenkron yeteneklerini daha verimli biçimde kullanmaktadır.

FlashAttention-3, H100 GPU'da FlashAttention-2'ye kıyasla **1,5–2 kat** hızlanma sağlamakta ve **740 TFLOP/s**ye kadar (teorik maksimumun %75'i) performansa ulaşmaktadır<sup>[\[11\]](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_note-arxiv_fa3-11)</sup>.

## Kaynakça

- Dao, T. (2023). *FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness*. arXiv:2205.14135.
- Shah, J. et al. (2024). *FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision*. arXiv:2407.08608.
- Kwon, W. et al. (2023). *Efficient Memory Management for Large Language Model Serving with PagedAttention*. arXiv:2309.06180.
- Ye, Z. et al. (2025). *FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving*. arXiv:2501.01005.
- Chen, Y. et al. (2023). *FlashDecoding++: Faster Large Language Model Inference on GPUs*. arXiv:2311.01282.
- Liu, Y. et al. (2024). *FastAttention: Extending FlashAttention-2 to NPUs and Low-Resource GPUs*. OpenReview: 76NYyOrnfk.
- Dege, P. et al. (2025). *FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs*. arXiv:2506.01969.
- Wang, G. et al. (2024). *FlashMask: Efficient and Rich Mask Extension of FlashAttention*. OpenReview: rog0J435OO.
- Abbott, V.; Zardini, G. (2025). *FlashAttention on a Napkin: A Diagrammatic Approach to Deep Learning IO-Awareness*. arXiv:2412.03317.

## Notlar

1.  <span id="cite_note-arxiv_main-1">↑ <sup>[1.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_main_1-5)</sup> Дао, Три. «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning». *arXiv:2307.08691* \[cs.LG\], 17 июля 2023 г. <a href="https://arxiv.org/abs/2307.08691" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_optim-2">↑ <sup>[2.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-huggingface_optim_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-huggingface_optim_2-1)</sup> «Optimizing LLMs for Speed and Memory». *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.42.0/en/llm_tutorial_optimization" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-tridao_blog_fa3-3">↑ <sup>[3.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-tridao_blog_fa3_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-tridao_blog_fa3_3-1)</sup> Дао, Три. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *Tri Dao's Blog*. <a href="https://tridao.me/blog/2024/flash3/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-e2e_analysis-4">[↑](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-e2e_analysis_4-0) «FlashAttention vs FlashAttention-2 - an Analysis». *E2E Networks Blog*. <a href="https://www.e2enetworks.com/blog/shades-of-attention-flashattention-vs-flashattention-2-a-comprehensive-study" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openreview_fa2-5">↑ <sup>[5.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-openreview_fa2_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-openreview_fa2_5-1)</sup> «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning». *OpenReview*. <a href="https://openreview.net/forum?id=mZn2Xyh9Ec" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hazyresearch_blog-6">[↑](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-hazyresearch_blog_6-0) «FlashAttention-2». *Hazy Research, Stanford University*. <a href="https://hazyresearch.stanford.edu/blog/2023-07-17-flash2" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv_pdf-7">↑ <sup>[7.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_pdf_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_pdf_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_pdf_7-2)</sup> Дао, Три. «FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning» (PDF). *arXiv:2307.08691*. <a href="https://arxiv.org/pdf/2307.08691.pdf" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-raschka_blog-8">[↑](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-raschka_blog_8-0) Рашка, Себастьян. «Llama 2 and FlashAttention 2». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/research-highlights-in-three-sentences" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-linkedin_younes-9">↑ <sup>[9.0](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-linkedin_younes_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-linkedin_younes_9-1)</sup> Белькада, Юнес. «Faster and more memory efficient models with Flash Attention 2!». *LinkedIn*. <a href="https://www.linkedin.com/posts/younes-belkada-b1a903145_flashattention-llms-activity-7112061650106474496-1dzz" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-huggingface_gpu_infer-10">[↑](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-huggingface_gpu_infer_10-0) «GPU inference». *Hugging Face Documentation*. <a href="https://huggingface.co/docs/transformers/v4.39.0/perf_infer_gpu_one" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-arxiv_fa3-11">[↑](https://systems-analysis.info/int/FlashAttention-2_(TR)#cite_ref-arxiv_fa3_11-0) Дао, Три, и др. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *arXiv:2407.08608* \[cs.LG\], 11 июля 2024 г. <a href="https://arxiv.org/abs/2407.08608" class="external autonumber" rel="nofollow">[11]</a></span>
