---
title: "FlashAttention-3"
source: "https://systems-analysis.info/wiki/FlashAttention-3"
wiki: "systems-analysis.info/wiki"
article: "FlashAttention-3"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 100
wiki_created_at: 2026-09-06T21:55:00Z
wiki_modified_at: 2026-09-06T21:55:00Z
downloaded_at: 2026-09-07T22:17:25Z
---

# FlashAttention-3

**FlashAttention-3** — это алгоритм для оптимизации механизма внимания (attention) в трансформерных нейросетях, разработанный для максимального использования аппаратных возможностей GPU архитектуры **NVIDIA Hopper** (H100)<sup>[\[1\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-venturebeat_unleashes-1)</sup>. Алгоритм был представлен в 2024 году группой исследователей из компаний Colfax Research, Meta, NVIDIA, Georgia Tech, Принстонский университет и Together AI. Работа была принята на конференцию NeurIPS 2024 и отмечена как *spotlight*<sup>[\[2\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-openreview_fa3-2)</sup>.

FlashAttention-3 является третьей итерацией в семействе алгоритмов, следующих за **[FlashAttention](https://systems-analysis.info/wiki/FlashAttention "FlashAttention")** (2022) и **[FlashAttention-2](https://systems-analysis.info/wiki/FlashAttention-3#FlashAttention-2)** (2023). Его главная цель — значительно ускорить обучение и инференс [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), сохранив при этом точность вычислений.

## Введение и предыстория

### Проблема механизма внимания

Ключевым компонентом трансформеров является механизм самовнимания (self-attention), однако его вычислительная сложность и потребление памяти растут **квадратично** (O(n²)) с увеличением длины входной последовательности (n)<sup>[\[1\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-venturebeat_unleashes-1)</sup>. Это создаёт серьёзное "узкое место", так как современные GPU оптимизированы для быстрых матричных умножений, но вычисление экспоненциальных функций (например, в Softmax) происходит на порядки медленнее. Кроме того, при наивной реализации в памяти GPU должен храниться большой промежуточный тензор внимания, что ограничивает масштабируемость моделей.

### FlashAttention и FlashAttention-2

Для решения этой проблемы в 2022 году был предложен **FlashAttention**, который сократил объём обращений к медленной глобальной памяти (HBM) за счёт двух техник:

- **Блочная обработка (tiling)**: Вычисления разбиваются на блоки (тайлы), которые обрабатываются в быстрой on-chip памяти (SRAM).
- **Слияние операций**: Все операции (матричное умножение, Softmax) выполняются в одном ядре GPU без записи промежуточных результатов в глобальную память.

Это позволило снизить сложность по памяти с квадратичной до **линейной** и ускорило вычисления в 2–4 раза.

В 2023 году была представлена улучшенная версия — **[FlashAttention-2](https://systems-analysis.info/wiki/FlashAttention-2 "FlashAttention-2")**, которая оптимизировала распараллеливание вычислений. На GPU архитектуры **NVIDIA Ampere** (A100) она достигла **~70%** от пиковой теоретической производительности<sup>[\[3\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-arxiv_html_fa3-3)</sup>. Однако на более новой архитектуре **NVIDIA Hopper** (H100) её эффективность оказалась значительно ниже — около **35%**<sup>[\[1\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-venturebeat_unleashes-1)</sup>. Это было связано с тем, что алгоритм не использовал новые аппаратные возможности Hopper, что и послужило толчком к созданию FlashAttention-3.

## Новые аппаратные возможности GPU Hopper (H100)

Архитектура NVIDIA Hopper предоставила ряд новых функций, которые FlashAttention-3 использует для достижения максимальной производительности<sup>[\[4\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-togetherai_blog-4)</sup>:

- **WGMMA (Warpgroup Matrix Multiply-Accumulate)**: Новый тип инструкций для тензорных ядер, выполняющий матричные умножения с почти двукратным приростом производительности по сравнению с архитектурой Ampere.
- **TMA (Tensor Memory Accelerator)**: Аппаратный модуль, который ускоряет передачу данных между глобальной (HBM) и общей (shared memory) памятью. TMA автоматически выполняет адресные расчёты, разгружая вычислительные ядра.
- **Формат FP8**: Аппаратная поддержка 8-битного формата данных с плавающей точкой, который удваивает теоретическую производительность по сравнению с FP16, но несёт риск потери точности из-за ограниченного динамического диапазона.

## Технические инновации FlashAttention-3

Алгоритм реализует три ключевых метода оптимизации, специально разработанных для архитектуры Hopper<sup>[\[4\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-togetherai_blog-4)</sup>:

### 1. Асинхронное выполнение и специализация варпов

FlashAttention-3 использует принцип *warp-specialization*, при котором разные группы потоков (*warps*) на GPU специализируются на разных задачах:

- **Producer warps**: Загружают данные из глобальной памяти с помощью TMA.
- **Consumer warps**: Выполняют матричные умножения на тензорных ядрах.

Благодаря аппаратной асинхронности Hopper, эти операции **перекрываются по времени**. Пока одна группа варпов выполняет вычисления, другая параллельно загружает данные для следующего блока. Этот конвейерный подход (*pipeline*), организованный по принципу «пинг-понга» (*ping-pong scheduling*), позволяет скрыть задержки от медленных операций (например, Softmax) и максимально полно загрузить все функциональные модули GPU.

### 2. Минимизация операций с памятью

Алгоритм сохраняет идеологию *tiling* из предыдущих версий, но активно использует **TMA** для асинхронной загрузки следующих блоков данных **параллельно** с текущими вычислениями. Передача данных из медленной HBM в быструю SRAM фактически выполняется «в тени» основных вычислений, благодаря чему GPU меньше простаивает в ожидании данных.

### 3. Низкая точность (FP8) с уменьшением ошибки квантования

Переход на FP8 удваивает скорость, но может привести к существенной потере точности из-за квантования. Для борьбы с этим разработчики внедрили метод *incoherent processing*<sup>[\[4\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-togetherai_blog-4)</sup>. Его суть заключается в следующем:

1.  Перед вычислением внимания векторы признаков (запросы Q и ключи K) умножаются на **случайную ортогональную матрицу** (например, матрицу Адамара).
2.  Это преобразование «размазывает» значения с аномально большим модулем (выбросы) по всем координатам, выравнивая их распределение.
3.  После этого выполняется квантование в FP8, которое теперь проходит с меньшей ошибкой.
4.  Поскольку преобразование ортогонально, оно не искажает итоговый результат внимания (QKᵀ), так как эффект от матрицы нивелируется при перемножении.

Эта техника позволила сократить ошибку вычисления внимания в FP8 примерно в **2,6 раза** по сравнению со стандартным применением FP8 без преобразований<sup>[\[4\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-togetherai_blog-4)</sup>.

## Производительность и значение

Применение перечисленных техник позволило FlashAttention-3 достичь значительного превосходства над предыдущими версиями на GPU H100:

- **Ускорение в 1.5–2 раза** по сравнению с FlashAttention-2.
- **Высокая утилизация GPU**: Достигает **~75–85%** от теоретического максимума производительности H100.
- **Пропускная способность**:
  - До **740–840 TFLOPS** для половинной точности (FP16/BF16).
  - До **1.2–1.3 PFLOPS** (петафлопс) при использовании 8-битной точности (FP8)<sup>[\[2\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-openreview_fa3-2)</sup>.

Высокая эффективность FlashAttention-3 напрямую влияет на разработку и применение LLM:

- **Сокращение времени обучения**: Ускорение внимания на 75–100% значительно сокращает время обучения моделей, которое может занимать недели или месяцы.
- **Увеличение [контекстного окна](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно")**: Модели могут эффективно обрабатывать более длинные последовательности (сотни тысяч [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")), что важно для анализа больших документов или кода<sup>[\[1\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-venturebeat_unleashes-1)</sup>.
- **Рациональное использование ресурсов**: Позволяет достигать той же производительности на меньшем количестве GPU или получать большую скорость на том же оборудовании, что снижает стоимость развёртывания моделей.

## Доступность и интеграция

Авторы опубликовали исходный код FlashAttention-3 под открытой лицензией в GitHub<sup>[\[4\]](https://systems-analysis.info/wiki/FlashAttention-3#cite_note-togetherai_blog-4)</sup>. Ожидается его интеграция в ведущие фреймворки глубокого обучения, такие как PyTorch и библиотеки Hugging Face Transformers, что сделает технологию доступной для широкого круга разработчиков и исследователей. Предыдущие версии уже стали стандартом де-факто в индустрии, и FlashAttention-3, вероятно, продолжит эту тенденцию.

## См. также

- [FlashAttention](https://systems-analysis.info/wiki/FlashAttention "FlashAttention")
- [FlashAttention-2](https://systems-analysis.info/wiki/FlashAttention-2 "FlashAttention-2")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [Agentic workflows](https://systems-analysis.info/wiki/Agentic_workflows "Agentic workflows")

## Ссылки

- <a href="https://github.com/Dao-AILab/flash-attention" class="external text" rel="nofollow">Официальный репозиторий FlashAttention на GitHub</a>
- <a href="https://www.together.ai/blog/flashattention-3" class="external text" rel="nofollow">Блог Together AI с анонсом FlashAttention-3</a>

## Литература

- Shah, J. et al. (2024). *FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision*. <a href="https://arxiv.org/abs/2407.08608" class="external text" rel="nofollow">arXiv:2407.08608</a>.
- Dao, T. (2023). *FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning*. <a href="https://arxiv.org/abs/2307.08691" class="external text" rel="nofollow">arXiv:2307.08691</a>.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Kwon, W. et al. (2023). *Efficient Memory Management for Large Language Model Serving with PagedAttention*. <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Ye, Z. et al. (2025). *FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving*. <a href="https://arxiv.org/abs/2501.01005" class="external text" rel="nofollow">arXiv:2501.01005</a>.
- Chen, Y. et al. (2023). *FlashDecoding++: Faster Large Language Model Inference on GPUs*. <a href="https://arxiv.org/abs/2311.01282" class="external text" rel="nofollow">arXiv:2311.01282</a>.
- Liu, Y. et al. (2024). *FastAttention: Extending FlashAttention-2 to NPUs and Low-Resource GPUs*. <a href="https://openreview.net/forum?id=76NYyOrnfk" class="external text" rel="nofollow">OpenReview: 76NYyOrnfk</a>.
- Dege, P. et al. (2025). *FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs*. <a href="https://arxiv.org/abs/2506.01969" class="external text" rel="nofollow">arXiv:2506.01969</a>.
- Wang, G. et al. (2024). *FlashMask: Efficient and Rich Mask Extension of FlashAttention*. <a href="https://arxiv.org/abs/2410.01359" class="external text" rel="nofollow">arXiv:2410.01359</a>.
- Abbott, V.; Zardini, G. (2025). *FlashAttention on a Napkin: A Diagrammatic Approach to Deep Learning IO-Awareness*. <a href="https://arxiv.org/abs/2412.03317" class="external text" rel="nofollow">arXiv:2412.03317</a>.

## Примечания

1.  <span id="cite_note-venturebeat_unleashes-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-venturebeat_unleashes_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-venturebeat_unleashes_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-venturebeat_unleashes_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-venturebeat_unleashes_1-3)</sup> «FlashAttention-3 unleashes the power of H100 GPUs for LLMs». *VentureBeat*. <a href="https://venturebeat.com/ai/flashattention-3-unleashes-the-power-of-h100-gpus-for-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-openreview_fa3-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-openreview_fa3_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-openreview_fa3_2-1)</sup> Шах, Джей, и др. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *OpenReview*. <a href="https://openreview.net/forum?id=tVConYid20" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv_html_fa3-3">[↑](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-arxiv_html_fa3_3-0) Шах, Джей, и др. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *arXiv:2407.08608v2* \[cs.LG\], 15 июля 2024 г. <a href="https://arxiv.org/html/2407.08608v2" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-togetherai_blog-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-togetherai_blog_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-togetherai_blog_4-1)</sup> <sup>[4,2](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-togetherai_blog_4-2)</sup> <sup>[4,3](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-togetherai_blog_4-3)</sup> <sup>[4,4](https://systems-analysis.info/wiki/FlashAttention-3#cite_ref-togetherai_blog_4-4)</sup> Шах, Джей, и др. «FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision». *Together AI Blog*. <a href="https://www.together.ai/blog/flashattention-3" class="external autonumber" rel="nofollow">[4]</a></span>
