---
title: "FlashAttention (UR)"
source: "https://systems-analysis.info/int/FlashAttention_(UR)"
wiki: "systems-analysis.info/int"
article: "FlashAttention_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 2268
wiki_created_at: 2026-09-06T23:01:15Z
wiki_modified_at: 2026-09-06T23:01:15Z
downloaded_at: 2026-09-07T22:50:14Z
---

# FlashAttention (UR)

**FlashAttention** — یہ ایک انقلابی algorithm ہے جو attention کے میکانزم کی گنتی کے لیے بنایا گیا ہے، جسے بڑے زبانی ماڈلز (LLM) کی تربیت اور inference کو نمایاں طور پر تیز کرنے کے لیے ڈیزائن کیا گیا ہے، اور یہ مکمل درستگی کو برقرار رکھتا ہے۔ یہ algorithm 2022 میں سٹینفورڈ یونیورسٹی کے محققین کی ایک ٹیم نے **Tri Dao** کی قیادت میں پہلی بار پیش کیا<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_main-1)</sup>۔

FlashAttention کا بنیادی خیال یہ ہے کہ GPU کی میموری کی درجہ بندی کو مدنظر رکھتے ہوئے گنتی کو از سر نو منظم کیا جائے، جس سے سست میموری تک رسائی کی تعداد کم سے کم ہو اور معیاری attention کے میکانزم کی اہم رکاوٹ دور ہو۔

## معیاری attention کا مسئلہ

Transformers میں خود توجہ (self-attention) کا معیاری میکانزم اس فارمولے سے حساب کیا جاتا ہے: $\text{Attention}(Q,K,V) = \text{softmax}\left( \frac{QK^{T}}{\sqrt{d_{k}}} \right)V$ جہاں Q، K، V بالترتیب queries، keys اور values کی matrices ہیں۔

اس طریقے کا بنیادی مسئلہ — sequence کی لمبائی N کے حوالے سے وقت اور میموری میں **مربع پیچیدگی** (O(N²)) ہے<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_main-1)</sup>۔ سادہ نفاذ میں GPU کی میموری میں N×N سائز کی مکمل attention matrix **S** کو حساب کرنا اور محفوظ رکھنا ضروری ہے، جس سے دو اہم مسائل پیدا ہوتے ہیں:

1.  **زیادہ میموری استعمال**: لمبے contexts کے ساتھ کام کرتے وقت N×N matrix کو محفوظ رکھنا ناممکن ہو جاتا ہے۔
2.  **ان پٹ-آؤٹ پٹ (IO) آپریشنز**: اہم رکاوٹ ریاضی آپریشنز کی تعداد نہیں بلکہ GPU کی سست میموری تک مسلسل رسائی ہے۔

### GPU کی میموری کی درجہ بندی

مسئلے کو سمجھنے کے لیے GPU میں میموری کی دو اقسام میں فرق کرنا ضروری ہے (NVIDIA A100 کی مثال سے):

- **SRAM** (static memory): چھوٹی مقدار کی تیز رفتار آن-چِپ میموری (~20 MB) جس کی bandwidth بہت زیادہ ہے (**19 TB/s** تک)۔
- **HBM** (high bandwidth memory): بڑی مقدار کی سست میموری (40–80 GB) جس کی bandwidth بہت کم ہے (تقریباً **1.5 TB/s**)<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-openreview_fa1-2)</sup>۔

یہ عدم توازن معیاری attention algorithm کو **میموری bandwidth سے محدود** (memory-bound) بنا دیتا ہے، کیونکہ یہ مسلسل سست HBM سے بڑی matrices پڑھتا اور لکھتا رہتا ہے، جو تاخیر کا بنیادی سبب ہے۔

## FlashAttention کی اہم اختراعات

FlashAttention ایک **IO-aware** (IO-آگاہ) algorithm ہے جو HBM تک رسائی کو کم سے کم کر کے مسئلے کو حل کرتا ہے۔ یہ تین بنیادی تکنیکوں سے حاصل ہوتا ہے۔

### Tiling اور بلاک پر مبنی پروسیسنگ

پوری matrix کو یکبارگی پروسیس کرنے کی بجائے، FlashAttention ان پٹ matrices Q، K، V کو چھوٹے بلاکس (**tiles**) میں تقسیم کرتا ہے جو تیز رفتار SRAM میں فٹ ہو جاتے ہیں۔ Algorithm ان بلاکس کو یکے بعد دیگرے لوڈ کرتا ہے، ان کے لیے تمام attention کے حسابات انجام دیتا ہے اور حتمی نتیجہ اپ ڈیٹ کرتا ہے، اور **مکمل attention matrix** کو سست HBM میں **محفوظ نہیں کرتا**<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_main-1)</sup>۔

### Softmax کا آن لائن حساب

اہم تکنیکی پیش رفت Softmax کا *آن لائن* حساب تھا۔ معیاری Softmax کے لیے normalization کی خاطر ان پٹ vector کے تمام عناصر معلوم ہونا ضروری ہے۔ FlashAttention ایک ترمیم شدہ algorithm استعمال کرتا ہے جو Softmax کو حصوں میں حساب کرنے کی اجازت دیتا ہے۔ یہ دو وسطی اقدار (موجودہ زیادہ سے زیادہ قدر اور exponentials کا مجموعہ) برقرار رکھتا ہے جو نئے بلاکس کی پروسیسنگ کے ساتھ اپ ڈیٹ ہوتی ہیں، جس سے پوری matrix تک یکبارگی رسائی کے بغیر درست نتیجہ حاصل ہوتا ہے<sup>[\[2\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-openreview_fa1-2)</sup>۔

### آپریشنز کو ایک CUDA kernel میں ضم کرنا

تمام attention آپریشنز (matrix کا ضرب QKᵀ، masking، Softmax، V سے ضرب) ایک **مربوط fused CUDA kernel** میں یکجا کیے گئے ہیں۔ اس سے HBM میں پڑھنے/لکھنے کے آپریشنز کی تعداد بنیادی طور پر کم ہو جاتی ہے: پوری matrix پر بار بار گزرنے کی بجائے algorithm ایک بار بلاک کو SRAM میں لوڈ کرتا ہے، تمام حسابات انجام دیتا ہے اور صرف حتمی نتیجہ لکھتا ہے۔

## نظریاتی اور عملی کارکردگی

### پیچیدگی اور بہتری

FlashAttention میموری کے استعمال کو O(N²) سے کم کر کے **O(N)** کر دیتا ہے، جو linear scaling فراہم کرتا ہے۔ یہ ثابت کیا گیا ہے کہ algorithm کی IO-پیچیدگی دو سطحی میموری hierarchy میں attention کے حساب کے لیے **نظریاتی طور پر بہترین** ہے، یعنی hardware کو تبدیل کیے بغیر درست attention کو اس سے تیز نہیں کیا جا سکتا<sup>[\[3\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-ieee_spectrum_2022-3)</sup>۔

### تجرباتی نتائج

FlashAttention کے پہلے ورژن نے نمایاں بہتری ظاہر کی:

- **تیز رفتاری**:
  - BERT-large (لمبائی 512): تربیت میں **15%** تیزی۔
  - GPT-2 (لمبائی 1K): **3 گنا** تیزی۔
  - Long-Range Arena کے کام (1K-4K): **2.4 گنا** تیزی<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_main-1)</sup>۔
- **میموری کی بچت**: درست بنیادی نفاذ کے مقابلے میں **20 گنا** تک میموری کی بچت۔
- **ماڈلز کے معیار میں بہتری**: لمبے contexts کے ساتھ کام کرنے کی صلاحیت کی بدولت، FlashAttention نہ صرف معیار کو برقرار رکھتا ہے بلکہ بہتر بھی کرتا ہے۔ مثال کے طور پر، GPT-2 کی perplexity میں 0.7 پوائنٹ کی بہتری آئی، اور لمبے دستاویزات کی درجہ بندی کے کاموں میں درستگی 6.4 پوائنٹ بڑھ گئی<sup>[\[1\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_main-1)</sup>۔

## ارتقاء اور مزید پیش رفت

FlashAttention کی کامیابی نے hardware-oriented algorithms کا ایک پورا سلسلہ شروع کیا۔

### FlashAttention-2 (2023)

دوسرا ورژن GPU کے وسائل کو زیادہ مکمل طور پر استعمال کرنے پر مرکوز تھا۔ اصل FlashAttention میں NVIDIA A100 پر کارکردگی زیادہ سے زیادہ کی صرف 25–40% تھی۔ FlashAttention-2 نے گنتی کے parallelism میں بہتری لائی، جس سے<sup>[\[4\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-tridao_flash2-4)</sup>:

- پہلے ورژن کے مقابلے میں **دو گنا** تیزی حاصل ہوئی۔
- GPU کا استعمال نظریاتی زیادہ سے زیادہ کے **50–73%** تک بڑھ گیا۔
- 256 سائز کے attention heads اور Multi-Query Attention (MQA) architectures کے لیے بھی سپورٹ بڑھ گئی۔

### FlashAttention-3 (2024)

تیسرا ورژن خاص طور پر **NVIDIA Hopper (H100)** GPU architecture کے لیے بہتر بنایا گیا<sup>[\[5\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-pytorch_blog_fa3-5)</sup>۔ یہ نئی hardware صلاحیتوں کا استعمال کرتا ہے، جیسے **Tensor Cores کی asynchrony** اور **FP8** کی سپورٹ، جس سے:

- FlashAttention-2 کے مقابلے میں مزید **1.5–2 گنا** تیزی حاصل ہوئی۔
- FP16 پر **740 TFLOPS** تک اور FP8 پر **1.2 PFLOPS** کے قریب کارکردگی حاصل ہوئی۔

### خصوصی حل

FlashAttention کے خیالات دیگر منصوبوں میں بھی پروان چڑھے:

- **FlashInfer** (2025): ایک قابل تنظیم attention engine جو خاص طور پر LLM inference کے کاموں کے لیے بہتر بنایا گیا ہے۔ یہ streaming generation کے دوران KV-cache کے ساتھ مؤثر کام پر مرکوز ہے<sup>[\[6\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-arxiv_flashinfer-6)</sup>۔
- **FlashMLA** (2024): context cache compression (*latent attention*) کے ساتھ attention کا نفاذ، جو بہت لمبی sequences پر کم سے کم معلومات کے نقصان کے ساتھ میموری بچانے کی اجازت دیتا ہے<sup>[\[7\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-github_flashmla-7)</sup>۔

## صنعت اور ecosystem پر اثر

FlashAttention ایک بنیادی پیش رفت بن گیا اور جلد ہی LLM کی مؤثر تربیت اور inference کے لیے **صنعت کا معیار** بن گیا۔ اسے PyTorch اور Hugging Face جیسی اہم libraries میں شامل کیا گیا اور یہ زیادہ تر بڑے زبانی ماڈلز (LLaMA، MPT، Falcon، Claude وغیرہ) میں استعمال ہوتا ہے۔

FlashAttention اور اس کے بعد کے ورژنز نے زبانی ماڈلز کی **context windows** بڑھانے میں فیصلہ کن کردار ادا کیا: 2–4 ہزار tokens (GPT-3) سے 128 ہزار tokens (GPT-4) تک اور تجرباتی ماڈلز میں لاکھوں tokens تک<sup>[\[8\]](https://systems-analysis.info/int/FlashAttention_(UR)#cite_note-medium_evolution-8)</sup>۔ Algorithm نے transformers کے scaling کی راہ میں ایک بڑی رکاوٹ دور کر دی، اور AI کے استعمال کے لیے نئے امکانات کھول دیے، لمبے دستاویزات کے تجزیے سے لے کر multimodal سمجھ تک۔

## روابط

- FlashAttention کا GitHub پر آفیشل repository

## کتابیات

- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness*. arXiv:2205.14135.
- Dao, T. (2023). *FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Shah, J. et al. (2024). *FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-Precision*. arXiv:2407.08608.
- Kwon, W. et al. (2023). *Efficient Memory Management for Large Language Model Serving with PagedAttention*. arXiv:2309.06180.
- Hong, K. et al. (2023). *FlashDecoding++: Faster Large Language Model Inference on GPUs*. arXiv:2311.01282.
- Ye, Z. et al. (2025). *FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving*. arXiv:2501.01005.
- Dege, P. et al. (2025). *FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs*. arXiv:2506.01969.
- Wang, G. et al. (2025). *FlashMask: Efficient and Rich Mask Extension of FlashAttention*. OpenReview wUtXB43Chi.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness* (OpenReview version). OpenReview H4DqfPSibmx.
- Gholami, A. et al. (2024). *FlashAttention on a Napkin: A Diagrammatic Approach to Deep Learning IO-Awareness*. OpenReview pF2ukh7HxA.

## حواشی

1.  <span id="cite_note-arxiv_main-1">↑ <sup>[1.0](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_main_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_main_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_main_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_main_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_main_1-4)</sup> Дао, Три, и др. «FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness». *arXiv:2205.14135* \[cs.LG\], 28 мая 2022 г. <a href="https://arxiv.org/abs/2205.14135" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-openreview_fa1-2">↑ <sup>[2.0](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-openreview_fa1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-openreview_fa1_2-1)</sup> Дао, Три, и др. «FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness». *OpenReview*. <a href="https://openreview.net/pdf?id=H4DqfPSibmx" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-ieee_spectrum_2022-3">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-ieee_spectrum_2022_3-0) «We're Training AI Twice as Fast This Year as Last». *IEEE Spectrum*. <a href="https://spectrum.ieee.org/mlperf-rankings-2022" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tridao_flash2-4">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-tridao_flash2_4-0) Дао, Три. «FlashAttention-2». *tridao.me*. <a href="https://tridao.me/publications/flash2/flash2.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-pytorch_blog_fa3-5">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-pytorch_blog_fa3_5-0) «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *PyTorch Blog*. <a href="https://pytorch.org/blog/flashattention-3/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-arxiv_flashinfer-6">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-arxiv_flashinfer_6-0) «\[2501.01005\] FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving». *arXiv*. <a href="https://arxiv.org/abs/2501.01005" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-github_flashmla-7">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-github_flashmla_7-0) «GitHub - deepseek-ai/FlashMLA: FlashMLA: Efficient MLA decoding kernels». *GitHub*. <a href="https://github.com/deepseek-ai/FlashMLA" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-medium_evolution-8">[↑](https://systems-analysis.info/int/FlashAttention_(UR)#cite_ref-medium_evolution_8-0) «The Evolution of Flash Attention: Revolutionizing Transformer Efficiency». *Medium*. <a href="https://medium.com/@sailakkshmiallada/the-evolution-of-flash-attention-revolutionizing-transformer-efficiency-8a039918d507" class="external autonumber" rel="nofollow">[8]</a></span>
