---
title: "Архитектура Transformer"
source: "https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer"
wiki: "systems-analysis.info/int"
article: "Архитектура_Transformer"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Pages with math errors"
  - "Category:Pages with math render errors"
revision_id: 8635
wiki_created_at: 2026-09-07T01:20:22Z
wiki_modified_at: 2026-09-07T01:20:22Z
downloaded_at: 2026-09-07T23:26:32Z
---

# Архитектура Transformer

**Архитектура Transformer** — това е архитектура на невронна мрежа, представена през 2017 г. от изследователи на Google в статията „Attention Is All You Need"<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>. Тя предизвика революция в областта на обработката на естествен език (NLP) и се превърна в основа за повечето съвременни големи езикови модели (LLM), като BERT, GPT и Gemini. Ключовата иновация на Transformer е механизмът **на самовнимание (self‑attention)**, който позволява на модела да претегля важността на различните части от входните данни и да обработва последователности паралелно, отказвайки се от рекурентността, присъща на RNN и LSTM.

## Исторически контекст и предпоставки

Преди 2017 г. доминиращите архитектури за обработка на последователни данни, като текст, бяха рекурентните невронни мрежи (RNN) и техният усъвършенстван вариант — мрежите с дълга краткосрочна памет (LSTM).

### Проблеми на RNN/LSTM, адресирани от Transformer

- **Ограничения на последователната обработка:** RNN и LSTM обработват данни токен по токен, което изключва вътрешно-последователния паралелизъм и забавя обучението върху големи обеми данни.
- **Проблемът с изчезващите и експлодиращите градиенти:** При дълги последователности градиентите, разпространявани назад през множество стъпки, могат или да затихнат, или да нараснат, което затруднява обучението на дългосрочни зависимости.
- **Дългосрочни зависимости:** Информацията от началото на последователността може да се загуби към нейния край.

Подходът на Transformer е **пълен отказ от рекурентност** в полза на механизма на внимание. Той осигурява **константна дължина на пътя на зависимостите** между произволни позиции ($O(1)$), което улеснява моделирането на далечни зависимости, при положение че базовата реализация на самовниманието има **квадратична изчислителна сложност** по дължината на последователността ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-tay2020-2)</sup>. Проблемът с затихването/експлозията на градиентите не „изчезва", а **се смекчава** чрез резидуални връзки, LayerNorm и режим на обучение; в съвременните реализации често се прилага вариантът **Pre‑LayerNorm (Pre‑LN)** като по-стабилен при обучение<sup>[\[3\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-xiong2020-3)</sup>.

## Архитектура и ключови компоненти

Оригиналната архитектура Transformer се състои от две основни части: **енкодер** и **декодер**. И двата компонента са стекове от идентични слоеве ($N = 6$ в оригиналната статия)<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.

- **Структура на слоя на енкодера:** (1) многоглавно самовнимание (MHA), (2) позиционно‑поелементна FFN; всеки подслой е обграден с резидуална връзка и LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Структура на слоя на декодера:** (1) **маскирано** самовнимание (каузална маска забранява достъпа до бъдещи позиции), (2) **cross‑attention** към изходите на енкодера, (3) FFN — също с резидуали и LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.

### Механизъм на внимание и Self‑Attention

Механизмът на внимание изчислява претеглена сума от вектори-стойности (Value), където теглата се определят от степента на съвместимост на ключовете (Key) с заявките (Query). В Transformer се използва **мащабирано скаларно произведение на внимание (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{o}p}{\sqrt{d_{k}}} \right)V$

Където $d_{k}$ е размерността на ключовете/заявките; делението на $\sqrt{d_{k}}$ предотвратява насищането на softmax<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>. Когато $Q$, $K$ и $V$ произхождат от една и съща последователност, механизмът се нарича **самовнимание (self‑attention)**.

### Multi‑Head Attention (многоглавно внимание)

Вместо един набор от матрици $(W_{Q},W_{K},W_{V})$ се използват $h$ паралелни „глави", всяка от които проецира $Q,K,V$ в подпространства с по-малка размерност, независимо изчислява внимание, след което резултатите се конкатенират и проецират<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>:

**Failed to parse (syntax error): {\displaystyle \mathrm{MultiHead}(Q,K,V)=\mathrm{Concat}( ext{head}\_1,\dots, ext{head}\_h)W^O,\quad ext{где } ext{head}\_i=\mathrm{Attention}(QW_i^Q,KW_i^K,VW_i^V).}**

**Варианти за ускоряване на инференса:**

- **MQA (Multi‑Query Attention):** всички глави споделят един ключ/стойност → значително се намалява обемът и трафикът на KV‑кеша при декодиране<sup>[\[4\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** компромис между MHA и MQA — няколко групи глави споделят K/V; качеството е близо до MHA при скоростта на MQA<sup>[\[5\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-ainslie2023-5)</sup>.

### Позиционно кодиране (Positional Encoding)

Тъй като self‑attention е инвариантен спрямо реда на токените, към входните embedding-и се добавят **позиционни кодировки**.

- **Оригиналните синусоидални кодировки** (PE) от<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>:

$ext{PE}(ext{pos},2i) = \sin\!\left( ext{pos}/10000^{2i/d_{ext{model}}} \right),\quad ext{PE}(ext{pos},2i + 1) = \cos\!\left( ext{pos}/10000^{2i/d_{ext{model}}} \right).$

- **Съвременни относителни/роторни варианти:**
  - **RoPE (Rotary Position Embeddings)** кодира относителните отмествания чрез въртене на векторите $Q$/$K$; прилага се в редица съвременни LLM<sup>[\[6\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-su2021-6)</sup>.
  - **ALiBi** въвежда линейна наказателна добавка към оценките на вниманието, което подобрява екстраполацията към дължини, по-големи от тренировъчните<sup>[\[7\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-press2021-7)</sup>.

### Поелементни FFN, резидуали и нормализация

Всеки слой на енкодера и декодера, освен вниманието, съдържа **позиционно‑поелементна FFN**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Около всеки подслой се използват **остатъчни връзки (residual connections)** и **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. В оригинала се прилагаше вариантът **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>; в съвременните LLM често се използва **Pre‑LN** за по-добра стабилност на обучението и по-малка зависимост от дълго warm‑up<sup>[\[3\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-xiong2020-3)</sup>.

## Еволюция и съвременни варианти

Ранните методи, основани на рекурентни невронни мрежи (RNN) и техните усъвършенствани варианти, като LSTM, обработваха текст последователно, по един токен наведнъж. Макар такъв подход интуитивно да съответстваше на структурата на езика, той създаваше съществено ограничение: затрудняваше паралелните изчисления и усложняваше откриването на зависимости между елементи, намиращи се далеч един от друг в текста. През 2017 г. група изследователи от Google представиха статия, озаглавена „Attention Is All You Need". В нея те описаха нова архитектура — „Transformer". Този модел за първи път напълно се отказа от използването на рекурентни невронни мрежи, заменяйки ги с механизма на „внимание" (attention). Главната новост се състоеше в това, че механизмът на внимание позволяваше на Transformer да оценява важността на всяка дума от входната последователност при генерирането на съответната дума в изхода. При това моделът можеше да обработва всички думи едновременно. Тази способност за паралелна обработка направи възможно обучението на значително по-големи модели върху огромни обеми данни. В резултат се появиха съвременните големи езикови модели (LLM).

Архитектурата Transformer послужи като основа за множество модели, условно разделени на три класа.

### 1. Модели само с енкодер (Encoder‑only)

- **Пример:** BERT (и RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-devlin2019-8)</sup>.
- **Принцип:** предобучение по задачата **маскирано езиково моделиране (MLM)** с двупосочен контекст.
- **Приложение:** задачи за разбиране (класификация, NER и др.).

### 2. Модели само с декодер (Decoder‑only)

- **Пример:** серията GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-llama2023-11)</sup>, Claude.
- **Принцип:** **каузално езиково моделиране (CLM)** — предсказване на следващия токен; върху вниманието се налага каузална маска<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Приложение:** генериране на текст, диалози, код.

### 3. Модели енкодер‑декодер (Encoder‑decoder)

- **Пример:** оригиналният Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-raffel2019-12)</sup>.
- **Принцип:** енкодерът изгражда представяне на входа, декодерът генерира изхода и използва cross‑attention към признаците на енкодера<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-vaswani2017-1)</sup>.
- **Приложение:** seq2seq‑задачи (превод, обобщаване и др.).

### 4. Мултимодални и алтернативни архитектури

- **Vision Transformer (ViT)** — адаптация към изображения (разбиване на пачове)<sup>[\[13\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — йерархичен модел с *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-liu2021-swin-14)</sup>.
- **Алтернативи при дълги последователности:**
  - **Mamba** — селективни модели на пространствата на състоянията (SSM) с линейна сложност<sup>[\[15\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — архитектура, подобна на RNN, с паралелно обучение и линейна сложност на инференса<sup>[\[16\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-peng2023-rwkv-16)</sup>.
  - **Хибриди** (напр. **Jamba**): редуват блокове Transformer и Mamba; понякога се допълват с MoE<sup>[\[17\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-lieber2024-jamba-17)</sup>.

## Техники за обучение и оптимизация

Ефективността на Transformer е тясно свързана с техниките за обучение и инфраструктурата.

- **Стратегии за предобучение:** CLM и MLM; също контрастивни и денойзингови цели (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-raffel2019-12)</sup>.
- **Техники за дообучение (Fine‑tuning):**
  - **Пълно дообучение** на всички параметри.
  - **Параметрично-ефективно дообучение (PEFT):** **LoRA** въвежда нискорангови адаптери при замразени базови тегла<sup>[\[18\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-hu2021-lora-18)</sup>.
- **Изравняване на поведението:** **RLHF** — обучение с подкрепление въз основа на обратна връзка от човек<sup>[\[19\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-ouyang2022-rlhf-19)</sup>.
- **Системни оптимизации на инференса:** **PagedAttention/vLLM** повишават пропускателната способност при обслужване чрез странично управление на KV‑кеша; особено полезно при дълги последователности и големи батчове<sup>[\[20\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_note-kwon2023-vllm-20)</sup>.

## Връзки

- The Illustrated Transformer — визуално обяснение на архитектурата Transformer

## Литература

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Бележки

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
