---
title: "Архитектура Transformer"
source: "https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer"
wiki: "systems-analysis.info/wiki"
article: "Архитектура_Transformer"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Базовые понятия LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 209
wiki_created_at: 2026-09-06T22:05:27Z
wiki_modified_at: 2026-09-06T22:05:27Z
downloaded_at: 2026-09-07T22:18:20Z
---

# Архитектура Transformer

**Архитектура Transformer** — это архитектура нейронной сети, представленная в 2017 году исследователями Google в статье «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>. Она произвела революцию в области обработки естественного языка (NLP) и стала основой для большинства современных [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM), таких как [BERT](https://systems-analysis.info/wiki/BERT "BERT"), [GPT](https://systems-analysis.info/wiki/GPT "GPT") и [Gemini](https://systems-analysis.info/wiki/Gemini "Gemini"). Ключевой инновацией Transformer является механизм **самовнимания (self‑attention)**, который позволяет модели взвешивать важность различных частей входных данных и обрабатывать последовательности параллельно, отказавшись от рекуррентности, свойственной RNN и LSTM.

## Исторический контекст и предпосылки

До 2017 года доминирующими архитектурами для обработки последовательных данных, таких как текст, были рекуррентные нейронные сети (RNN) и их усовершенствованный вариант — сети с долгой краткосрочной памятью (LSTM).

### Проблемы RNN/LSTM, адресованные Трансформером

- **Ограничения последовательной обработки:** RNN и LSTM обрабатывают данные токен за токеном, что исключает внутри‑последовательный параллелизм и замедляет обучение на больших объёмах данных.
- **Проблема исчезающих и взрывающихся градиентов:** В длинных последовательностях градиенты, распространяемые в обратную сторону через множество шагов, могут либо затухать, либо расти, что затрудняет обучение долгосрочным зависимостям.
- **Долгосрочные зависимости:** Информация из начала последовательности может теряться к её концу.

Подход Transformer — это **полный отказ от рекуррентности** в пользу механизма внимания. Он обеспечивает **константную длину пути зависимостей** между любыми позициями ($O(1)$), что облегчает моделирование дальних зависимостей, при том что базовая реализация самовнимания имеет **квадратичную вычислительную сложность** по длине последовательности ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-tay2020-2)</sup>. Проблема затухания/взрыва градиентов не «исчезает», а **смягчается** за счёт резидуальных соединений, LayerNorm и режима обучения; в современных реализациях часто применяется вариант **Pre‑LayerNorm (Pre‑LN)** как более стабильный при обучении<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-xiong2020-3)</sup>.

## Архитектура и ключевые компоненты

Оригинальная архитектура Transformer состоит из двух основных частей: **энкодера** и **декодера**. Оба компонента — это стеки идентичных слоёв ($N = 6$ в оригинальной статье)<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.

- **Структура слоя энкодера:** (1) многоголовое самовнимание (MHA), (2) позиционно‑поэлементная FFN; каждый подслой окружён резидуальным соединением и LayerNorm<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Структура слоя декодера:** (1) **маскированное** самовнимание (каузальная маска запрещает доступ к будущим позициям), (2) **cross‑attention** к выходам энкодера, (3) FFN — также с резидуалами и LayerNorm<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.

### Механизм внимания и Self‑Attention

Механизм внимания вычисляет взвешенное суммирование векторов‑значений (Value), где веса определяются степенью совместимости ключей (Key) с запросами (Query). В Transformer используется **масштабированное скалярное произведение внимания (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Где $d_{k}$ — размерность ключей/запросов; деление на $\sqrt{d_{k}}$ предотвращает насыщение softmax<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>. Когда $Q$, $K$ и $V$ порождаются одной и той же последовательностью, механизм называется **самовниманием (self‑attention)**.

### Multi‑Head Attention (многоголовое внимание)

Вместо одного набора матриц $(W_{Q},W_{K},W_{V})$ используется $h$ параллельных «голов», каждая из которых проецирует $Q,K,V$ в подпространства меньшей размерности, независимо вычисляет внимание, затем результаты конкатенируются и проецируются<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Варианты для ускорения инференса:**

- **MQA (Multi‑Query Attention):** все головы разделяют один ключ/значение → существенно снижается объём и трафик KV‑кэша при декодировании<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** компромисс между MHA и MQA — несколько групп голов разделяют K/V; качество близко к MHA при скорости MQA<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-ainslie2023-5)</sup>.

### Позиционное кодирование (Positional Encoding)

Поскольку self‑attention инвариантен к порядку токенов, к входным эмбеддингам добавляются **позиционные кодировки**.

- **Оригинальные синусоидальные кодировки** (PE) из<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Современные относительные/роторные варианты:**
  - **RoPE (Rotary Position Embeddings)** кодирует относительные сдвиги через вращение векторов $Q$/$K$; применяется в ряде современных LLM<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-su2021-6)</sup>.
  - **ALiBi** вносит линейный штраф в оценки внимания, что улучшает экстраполяцию на длины, больше обучающих<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-press2021-7)</sup>.

### Поэлементные FFN, резидуалы и нормализация

Каждый слой энкодера и декодера, помимо внимания, содержит **позиционно‑поэлементную FFN**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Вокруг каждого подслоя используются **остаточные соединения (residual connections)** и **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. В оригинале применялся вариант **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>; в современных LLM часто используют **Pre‑LN** для лучшей стабильности обучения и меньшей зависимости от долгого warm‑up<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-xiong2020-3)</sup>.

## Эволюция и современные варианты

Ранние методы, основанные на рекуррентных нейронных сетях (RNN) и их продвинутых вариантах, таких как LSTM, обрабатывали текст последовательно, по одному токену за раз. Хотя такой подход интуитивно соответствовал структуре языка, он создавал значительное ограничение: затруднял параллельные вычисления и усложнял обнаружение зависимостей между элементами, которые находились далеко друг от друга в тексте. В 2017 году группа исследователей из Google представила статью под названием «Attention Is All You Need». В ней они описали новую архитектуру — «Трансформер» (Transformer). Эта модель впервые полностью отказалась от использования рекуррентных нейронных сетей, заменив их механизмом «внимания» (attention). Главное новшество заключалось в том, что механизм внимания позволял Трансформеру оценивать важность каждого слова во входной последовательности для генерации соответствующего слова в выходной. При этом модель могла обрабатывать все слова одновременно. Эта способность к параллельной обработке сделала возможным обучение гораздо более крупных моделей на огромных объемах данных. В результате появились современные большие языковые модели (LLM).

Архитектура Transformer послужила основой для множества моделей, условно делимых на три класса.

### 1. Модели только‑энкодер (Encoder‑only)

- **Пример:** [BERT](https://systems-analysis.info/wiki/BERT "BERT") (и RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-devlin2019-8)</sup>.
- **Принцип:** предобучение по задаче **маскированного языкового моделирования (MLM)** с двунаправленным контекстом.
- **Применение:** задачи понимания (классификация, NER и т. п.).

### 2. Модели только‑декодер (Decoder‑only)

- **Пример:** серия [GPT](https://systems-analysis.info/wiki/GPT "GPT") (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-brown2020-10)</sup>, [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA")<sup>[\[11\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-llama2023-11)</sup>, Claude.
- **Принцип:** **каузальное языковое моделирование (CLM)** — предсказание следующего токена; вниманию накладывается каузальная маска<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Применение:** генерация текста, диалоги, код.

### 3. Модели энкодер‑декодер (Encoder‑decoder)

- **Пример:** оригинальный Transformer, [T5](https://systems-analysis.info/wiki/T5 "T5"), BART<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-raffel2019-12)</sup>.
- **Принцип:** энкодер строит представление входа, декодер генерирует выход и использует cross‑attention к признакам энкодера<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Применение:** seq2seq‑задачи (перевод, суммаризация и др.).

### 4. Мультимодальные и альтернативные архитектуры

- **Vision Transformer (ViT)** — адаптация к изображениям (разбиение на патчи)<sup>[\[13\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — иерархическая модель со *shifted windows*<sup>[\[14\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-liu2021-swin-14)</sup>.
- **Альтернативы на длинных последовательностях:**
  - **Mamba** — селективные модели пространства состояний (SSM) с линейной сложностью<sup>[\[15\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — RNN‑подобная архитектура с параллельным обучением и линейной сложностью инференса<sup>[\[16\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-peng2023-rwkv-16)</sup>.
  - **Гибриды** (напр., **Jamba**): чередуют блоки Transformer и Mamba; иногда дополняются MoE<sup>[\[17\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-lieber2024-jamba-17)</sup>.

## Техники обучения и оптимизации

Эффективность Transformer тесно связана с техникой обучения и инфраструктурой.

- **Стратегии предобучения:** CLM и MLM; также контрастивные и денойзинговые цели (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-raffel2019-12)</sup>.
- **Техники дообучения ([Fine‑tuning](https://systems-analysis.info/wiki/Fine-tuning "Fine-tuning")):**
  - **Полное дообучение** всех параметров.
  - **[Параметрически‑эффективное дообучение (PEFT)](https://systems-analysis.info/wiki/PEFT "PEFT"):** **LoRA** вводит низкоранговые адаптеры при замороженных базовых весах<sup>[\[18\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-hu2021-lora-18)</sup>.
- **Выравнивание поведения:** **[RLHF](https://systems-analysis.info/wiki/RLHF "RLHF")** — обучение с подкреплением на основе обратной связи человека<sup>[\[19\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-ouyang2022-rlhf-19)</sup>.
- **Системные оптимизации инференса:** **PagedAttention/vLLM** повышают пропускную способность сервинга за счёт страничного управления KV‑кэшем; особенно полезно при длинных последовательностях и больших батчах<sup>[\[20\]](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-kwon2023-vllm-20)</sup>.

## См. также

- [Теоретические основы LLM](https://systems-analysis.info/wiki/%D0%A2%D0%B5%D0%BE%D1%80%D0%B5%D1%82%D0%B8%D1%87%D0%B5%D1%81%D0%BA%D0%B8%D0%B5_%D0%BE%D1%81%D0%BD%D0%BE%D0%B2%D1%8B_LLM "Теоретические основы LLM")
- [GPT](https://systems-analysis.info/wiki/GPT "GPT")
- [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA")
- [Decoder-only](https://systems-analysis.info/wiki/Decoder-only "Decoder-only")
- [Архитектуры LLM](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D1%8B_LLM "Архитектуры LLM")

## Ссылки

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer — визуальное объяснение архитектуры Transformer</a>

## Литература

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## Примечания

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12,0](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12,1](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
