---
title: "Архитектури на LLM"
source: "https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM"
wiki: "systems-analysis.info/int"
article: "Архитектури_на_LLM"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 8637
wiki_created_at: 2026-09-07T01:20:24Z
wiki_modified_at: 2026-09-07T01:20:24Z
downloaded_at: 2026-09-07T23:26:33Z
---

# Архитектури на LLM

**Архитектури на големите езикови модели (LLM)** — това са фундаменталните принципи и структури, които определят как се изграждат, обучават и функционират големите езикови модели. Съвременните LLM, способни да разбират и генерират човешки език, са почти изцяло базирани на архитектурата **Transformer**<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>, но включват множество усъвършенствания и различни подходи, насочени към повишаване на ефективността, мащабируемостта и възможностите.

## Семейства архитектури на LLM (трансформери)

Съвременните големи езикови модели се базират на архитектурата на трансформера<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>, но я използват по различен начин в зависимост от целта: разбиране на текст, генериране на продължение или преобразуване на един текст в друг. На практика се разграничават три семейства при запазване на основните принципи на трансформера<sup>[\[2\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-2)[\[3\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-3)[\[4\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-4)</sup>.

### 1. Encoder‑only (само кодировщик, само енкодер)

Моделът използва само стек от кодировщици и разглежда целия входен текст двупосочно. Предобучението обикновено се изгражда като masked‑language modeling (MLM, езиково моделиране с маскиране): част от токените се скриват, а моделът се учи да ги възстановява по контекста. Благодарение на двупосочния контекст такива модели са силни в задачите за разбиране и оценяване: класификация, разпознаване на именувани единици, преранжиране на документи и екстрактивен QA. За авторегресивна генерация „от нулата" те не са предназначени.

Допълнително на практика се прилагат и алтернативни цели на предобучение за семейството encoder‑only: *replaced token detection (RTD) в ELECTRA* (моделът-дискриминатор разпознава подменените токени) и *контрастивно обучение* на би-енкодери за семантично търсене/ретривер (InfoNCE/softmax‑loss върху двойки „заявка-документ", както в Dense Passage Retrieval). При използване в RAG encoder‑only участва или като *би-енкодер* (отделно кодиране на заявката и документа за бързо ANN-търсене), или като *кросс-енкодер* (съвместно кодиране на двойката за точно преранжиране).

**Предимства:**

- Високо качество на разбиране на текст благодарение на двупосочния контекст: класификация, NER, извличане на факти, преранжиране, екстрактивен QA.
- Паралелна обработка и висока пропускателна способност: един директен проход без авторегресия; удобно е за пакетно масово оценяване.
- Естествена интеграция с търсене и RAG: в ролята на би-енкодер — бързо семантично търсене; в ролята на кросс-енкодер — точно преранжиране.
- Ефективна адаптация: сравнително компактни варианти (≈100–300 млн параметра; BERT‑base ≈110 млн) след целенасочено дообучение дават високо качество.
- Стабилна латентност, независеща от дължината на генерирания отговор (няма стъпково декодиране); подходящи за офлайн-оценяване на големи колекции.
- Възможност за разширяване на контекстния прозорец на енкодерите чрез относителни/ротационни позиции и/или локално-разредено внимание (напр. Longformer/BigBird), което е полезно за дълги документи.

**Недостатъци:**

- Няма собствени генеративни възможности: за диалози и разгърнати отговори е необходим декодер или външен генеративен модул.
- Ограниченост в интерактивни сценарии: няма поетапна генерация със запазване на състоянието.
- Несъответствие на целта на предобучението със задачите за свободна генерация: MLM се съгласува по-лошо с генерацията в сравнение с каузалното моделиране.
- Исторически ограничен контекстен прозорец (често 512 токена в базовите конфигурации с абсолютни позиции); разширяването изисква специални схеми за позиции/внимание и/или дообучение.
- За задачите за ретривал е необходимо отделно контрастивно дообучение на би-енкодера и/или кросс-енкодера; без това качеството на търсене/преранжиране обикновено е по-ниско от това на специално обучените модели.

**Представителни модели:** BERT и производни, както и RoBERTa и DeBERTa (разширени варианти на encoder‑only); от алтернативните цели на предобучение — ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-5)[\[6\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-6)[\[7\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-7)[\[8\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-8)[\[9\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-9)[\[10\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-10)</sup>

### 2. Decoder‑only (само декодировщик, само декодер)

Използва се само стек от декодери с каузално (лево-насочено) внимание: моделът предсказва следващия токен по вече зададения префикс. Този режим на обучение — causal language modeling (CLM) — прави тези модели естествен избор за генерация: диалози, разгърнати отговори, творчески текст, програмен код. Компромисът е нарастване на закъснението и обема на KV-кеша при дълги промптове. На практика за decoder‑only широко се прилагат инженерни похвати: намаляване на KV-кеша чрез MQA и GQA, ускоряване на извода чрез спекулативно декодиране и сървърни оптимизации (PagedAttention/vLLM, continuous batching, chunked prefill).<sup>[\[11\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-11)[\[12\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-12)[\[13\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-13)[\[14\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-14)[\[15\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-15)</sup>

**Предимства:**

- Естествена генерация на текст (CLM): силни zero‑shot и few‑shot способности; мащабира се добре.<sup>[\[16\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-16)</sup>
- Универсалност на приложението: един модел решава множество задачи чрез инструкции и примери в промпта; естествено се съчетава с RAG и извикване на инструменти (tool use).
- Зряла екосистема: практики за инструкционно дообучение и изравняване на поведението (RLHF, DPO); налични са отворени и комерсиални реализации.<sup>[\[17\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-17)[\[18\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-18)</sup>
- Богат стек от оптимизации за инференс: MQA/GQA намаляват обема на KV-кеша и повишават пропускателната способност; спекулативното декодиране ускорява извода без промяна на разпределението; PagedAttention/vLLM с continuous batching и chunked prefill повишават цялостното използване на GPU.<sup>[\[19\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-19)[\[20\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-20)[\[21\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-21)[\[22\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-22)[\[23\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-23)</sup>
- Поддръжка на структурирана генерация за строги формати на отговори (JSON/SQL/DSL), което улеснява интеграцията с информационни системи и API.<sup>[\[24\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-24)[\[25\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-25)</sup>

**Недостатъци:**

- Повишено закъснение при генерация: последователен извод; цената на нов токен нараства с дължината на вече „прочетения" контекст (KV-кеш).
- По-малко изгоден при профил „дълъг вход – кратък изход" (обобщаване, превод) в сравнение с encoder–decoder, където входът се кодира веднъж.
- Ограничение от еднопосочния контекст: в задачите за разбиране понякога отстъпва на моделите с двупосочно представяне (encoder‑only / encoder–decoder).
- Паметта за KV-кеша може да бъде „тесното място" при дълги промптове и големи пакети; <sup>[\[26\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-26)</sup>
- Квантуването на активациите/KV (INT8/FP8) ускорява извода, но може да влоши качеството при дълги контексти/код; изисква внимателна валидация (особено при строги SLA).

**Представителни модели:** GPT‑3, GPT‑4 (детайлите на архитектурата и набора от данни не са публично оповестени), LLaMA и *Llama 3* (8B/70B, 2024).<sup>[\[27\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-27)[\[28\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-28)[\[29\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-29)[\[30\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-30)</sup>

### 3. Encoder–decoder (кодировщик–декодировщик, енкодер-декодер)

Архитектурата съчетава двата компонента. Енкодерът работи в двупосочен режим, а декодерът — каузално. Енкодерът веднъж анализира входа и формира неговото представяне; декодерът генерира изхода, обръщайки се към това представяне чрез cross‑attention. Този разделен подход е особено полезен там, където се изисква преобразуване на дълъг входен текст в кратък изход: машинен превод, обобщаване, отговори на базата на документи. Въпреки че методът изисква по-големи съвкупни изчислителни разходи (два стека и кросс-внимание), предимството му е контролирана генерация на базата на пълен анализ на изходния текст; при това кодирането се извършва еднократно и се преизползва по време на целия процес на извод.

**Предимства:**

- Условна генерация: декодерът използва cross‑attention към представянето на входа. <sup>[\[31\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-31)</sup>
- Ефективен в сценария „дълъг вход → кратък изход": входът се кодира веднъж.
- Удобен за формата „text‑to‑text" и контролиран извод (задачни префикси, специални инструкции). <sup>[\[32\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-32)</sup>
- Стабилност и ефективност при дълъг източник: в фазата на декодиране нараства само self‑attention по изхода, а cross‑attention преизползва фиксираните ключове/стойности от енкодера (входът не се „препрочита" на всяка стъпка).

**Недостатъци:**

- Двата стека увеличават изискванията към паметта и изчисленията при обучение и приложение.
- При свръхдълги последователности крайното закъснение е сравнимо с това на decoder‑only; авторегресията остава тесното място.
- По-малко универсални чат-модели, отколкото сред decoder‑only; по-често се използват като висококачествен seq2seq-двигател за конкретни задачи.
- При много дълъг вход нараства паметта за ключове/стойности на cross‑attention във всеки слой на декодера (по целия източник), което изисква внимателно планиране на сървиране.

**Представителни модели:** T5 (включително T5 v1.1 и практиката на инструкционно дообучение в *FLAN‑T5*) и BART. <sup>[\[33\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-33)[\[34\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-34)[\[35\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-35)</sup>

## Плътни (dense) трансформери

Класическата и най-разпространена архитектура на LLM: при обработката на всеки токен участва практически целият набор от параметри на модела. За разлика от разредените подходи (например Mixture‑of‑Experts), няма селективно активиране на подмрежи — всеки блок работи за всеки токен. <sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>

### Принцип на работа и архитектура

**Базова структура.** Моделът е стек от N еднотипни трансформерни блока. Всеки блок включва:

1.  **Многоглавно самовнимание (Multi‑Head Self‑Attention).** За всеки токен се изчисляват три вектора: Q (query), K (key), V (value); вниманието се определя като $\operatorname{softmax}\!\left( \frac{QK^{o}p + M}{\sqrt{d_{k}}} \right) \cdot V$, където $M$ е маска (каузална и/или маска за запълване), изключваща недопустимите позиции. Няколко „глави" на вниманието паралелно отчитат различни аспекти на контекста (H глави, обикновено $d_{head} = \frac{d_{model}}{H}$); броят им нараства с мащаба на модела. <sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>
2.  **Напълно свързана мрежа (Feed‑Forward Network, FFN).** Два линейни слоя с нелинейност между тях (обикновено GELU/SiLU; в редица съвременни модели — SwiGLU). Междинното измерение обикновено е $\approx 4\, d_{model}$; при използване на SwiGLU често се взема $\approx frac83\, d_{model}$ за запазване на сравним брой параметри. FFN съдържа значителен дял от параметрите. <sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-36)</sup>

**Допълнителни компоненти.** Използват се остатъчни (residual) връзки и нормализация на слоевете; в съвременните LLM по-често се прилага Pre‑LN (нормализация преди подблоковете) — това подобрява стабилността на обучението при голяма дълбочина. В допълнение към класическата LayerNorm все по-широко се използва **RMSNorm** (намалява изчислителните разходи и работи добре в големи модели); също така в някои семейства се прилага нормализация в пространството на вниманието (напр. нормализация на Q/K преди softmax). Позиционните представяния могат да бъдат абсолютни или относителни; за дълъг контекст де факто стандарт стана RoPE.

##### Примери за модели и мащаб

- BERT‑Large: 24 слоя, размерност 1024, 16 глави на вниманието, ≈340 млн параметра. <sup>[\[37\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-37)</sup>
- GPT‑3 (175B): 96 слоя, размерност 12288, 96 глави на вниманието, ≈175 млрд параметра. <sup>[\[38\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-38)</sup>
- LLaMA‑65B: 80 слоя, размерност 8192, 64 глави на вниманието, ≈65 млрд параметра. <sup>[\[39\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-39)</sup>
- PaLM‑540B: 118 слоя, размерност от порядъка на 18432, ≈540 млрд параметра. <sup>[\[40\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-40)</sup>

##### Предимства

- Еднотипни блокове, добре проучени режими на обучение и предсказуемо поведение при мащабиране.
- Качеството се подобрява степенно при нарастване на параметрите и данните; compute‑optimal режимът предполага съвместно увеличаване на размера на модела и обема на обучаващите токени. <sup>[\[41\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-41)[\[42\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-42)</sup>
- Една и съща архитектура след дообучение покрива широк спектър от задачи без промени на ниво слоеве.

##### Недостатъци

- Пълното самовнимание има квадратична сложност по дължината на последователността ($O(n^{2})$), което ограничава контекстния прозорец. <sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>
- Пълно активиране на параметрите при стъпка на генерация: в декодера без MoE цената на извода на токен нараства приблизително пропорционално на броя на параметрите.
- Тесното място е пропускателната способност на паметта (memory‑bound): зареждането на теглата от HBM често ограничава скоростта на инференса.

##### Ограничения на мащабирането и контекста

- Паметта за параметри нараства линейно с размера на модела; паметта за обучение се увеличава заради градиентите и състоянията на оптимизатора.
- Базовите конфигурации исторически са ограничени до 2–4 хиляди токена. Съвременните позиционни схеми (RoPE) и техниките за разширяване (Position Interpolation, YaRN и др.) позволяват увеличаване на прозореца с порядък и повече, но за сметка на допълнително изчислително/памятово натоварване. <sup>[\[43\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-43)[\[44\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-44)</sup>

### Съвременни оптимизации

- **FlashAttention.** Точно внимание, отчитащо йерархията на паметта на GPU; намалява разходите за памет и ускорява обучението/инференса при дълги последователности. <sup>[\[45\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-45)</sup>
- **Намаляване и управление на KV-кеша.** Multi‑Query Attention и Grouped‑Query Attention намаляват обема на кеша и трафика на паметта; на ниво сървър PagedAttention (vLLM) повишава пропускателната способност чрез странично управление на кеша. <sup>[\[46\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-46)[\[47\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-47)[\[48\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-48)</sup>
- **Спекулативно декодиране.** Чернова (draft) модел предлага продължение, а основният бързо го проверява; постига се ускорение без промяна на разпределението на извода. <sup>[\[49\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-49)</sup>

## Разредени модели (Sparse Models) и Mixture‑of‑Experts (MoE)

MoE е начин за увеличаване на капацитета на модела без пропорционален ръст на изчисленията на токен. Вместо един голям FFN-блок в слоя се използва набор от паралелни „експерти" (няколко независими FFN), а обучаем маршрутизатор (gating network) за всеки токен избира top‑k най-релевантните експерти (обикновено k=1–2; в редица модели k=4). Активират се само избраните експерти; техните изходи се претеглят и сумират. Така общият брой параметри може да достигне стотици милиарди и дори трилиони, но на всяка стъпка се задейства само малка част от тях. <sup>[\[50\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-GLAM-51)</sup>

#### Примери за модели и мащаб

- **Switch Transformer (Google)**: до ~1.6T параметра; top‑1 маршрутизация (един експерт на токен). Показа, че MoE позволява рязко увеличаване на капацитета при сравними разходи на токен. <sup>[\[50\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1.2T параметра, 64 експерта в слой, top‑2; за всеки токен се активират ≈96.6B параметра (≈8%). <sup>[\[51\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: ~46.7B параметра общо, ≈12.9B активни на токен, top‑2. <sup>[\[52\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: ~141B параметра общо, ≈39B активни на токен, top‑2. <sup>[\[54\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: 132B параметра общо, ≈36B активни на токен; 16 експерта и top‑4 маршрутизация (fine‑grained MoE). <sup>[\[55\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-DBRX-55)</sup>

##### Предимства

- Цената на изчисленията се определя от броя на активните експерти k, а не от общия брой параметри: може да се обучават и използват модели от трилионен мащаб при разходи, сравними с тези на плътни модели с забележимо по-малък размер. <sup>[\[51\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-GLAM-51)</sup>
- Специализация: експертите автоматично се „настройват" към езици/домейни/шаблони, подобрявайки качеството в многодоменни задачи.
- Гъвкаво разгръщане: може да се пазят в паметта често използваните експерти и да се зареждат рядко използваните (при подходяща инфраструктура).

##### Ограничения

- Балансиране на натоварването: без регуляризация маршрутизаторът може да „залепне" за част от експертите (router collapse). Необходими са auxiliary losses (load‑balancing) и подобрени схеми за маршрутизиране. <sup>[\[50\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Switch-50)</sup>
- Сложност на разпределените изчисления: изисква се expert parallelism и обмен all‑to‑all; комуникационните разходи и управлението на паметта стават тесното място. <sup>[\[56\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-NVIDIA_MoE-56)</sup>
- Стабилност на обучението: важни са настройките на рутера и ограниченията на капацитета (capacity), иначе е възможна деградация на качеството/сходимостта.

#### Съвременни подобрения

- **Expert‑Choice routing**: експертите „избират" токени, което подобрява балансирането и сходимостта при сравними разходи. <sup>[\[57\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: по-голям брой по-малки експерти (като в DBRX) дава фина гранулярност на специализацията. <sup>[\[55\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: преобразуването на плътен модел в MoE от неговия чекпойнт позволява съществено повишаване на качеството при умерени разходи. <sup>[\[58\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-SparseUpcycling-58)</sup>

#### Целесъобразност на прилагането на MoE

- Големи многодоменни асистенти при ограничен compute-бюджет.
- Обучение върху обширни корпуси, при които специализацията дава предимство.
- Сценарии с развита разпределена инфраструктура (много GPU/TPU и бързи мрежи).

**Кога плътните модели са по-добри**: ограничена инфраструктура (1–2 GPU), строги изисквания към предсказуемата латентност и простота на разгръщането.

## Retrieval‑Augmented Generation (RAG)

RAG е архитектурен **паттерн на системата** около LLM, а не вътрешна архитектура на самия модел. Той обединява LLM (генеративен компонент) с външна база от знания (компонент за извличане), което позволява да се компенсира ограничеността на „параметричната памет" на модела.

- **Принцип на работа:** Преди генерацията LLM извлича релевантни документи от външен източник (уики, корпоративна база от знания, уеб) и се опира на тях при формирането на отговора. <sup>[\[59\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RAG-59)</sup>
- **Предимства:**
  - Намаляване на халюцинациите и подобряване на фактическата точност. <sup>[\[59\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-60)</sup>
  - Актуалност без пълно преобучаване на модела. <sup>[\[59\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RAG-59)</sup>
  - Цитируемост и проследимост на отговорите.
- **Приложение:** Де факто стандарт за корпоративни асистенти и системи, при които се изискват проверими факти и работа с частни/тясноспециализирани данни. <sup>[\[59\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RAG-59)</sup>

## Механизми на вниманието и работа с контекста

Базовото самовнимание има квадратична сложност по дължината на последователността ($O(n^{2})$), затова са се появили оптимизации.

- **Разредено внимание (Sparse Attention):** Ограничаване на вниманието до локални прозорци/шаблони. Примери: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-62)</sup>.
- **FlashAttention:** Преустройство на реда на изчисленията, отчитащо йерархията на паметта на GPU; дава съществен изигрш по време и памет и се е превърнало в де факто стандарт при обучението на LLM с дълъг контекст<sup>[\[63\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-63)[\[64\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-64)[\[65\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-65)</sup>.
- **MQA/GQA (ускоряване на декодирането):** *Multi‑Query Attention* (общи ключове/стойности за всички глави) намалява трафика на KV-кеша<sup>[\[66\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-66)</sup>. *Grouped‑Query Attention* балансира качество/скорост<sup>[\[67\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-67)</sup>.
- **Подобрени позиционни представяния:**
  - **ALiBi (Attention with Linear Biases):** Линейни отклонения към оценките на вниманието подобряват обобщаването при по-голяма дължина. <sup>[\[68\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Относителна позиционна информация чрез завъртане на Q/K; широко използвана в съвременните модели (напр. LLaMA). <sup>[\[69\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-69)[\[70\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-70)</sup>
  - **Разширяване на контекста за RoPE-модели:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-72)</sup>, а също и NTK‑aware модификации позволяват ефективно увеличаване на контекстния прозорец без промяна на архитектурата.

<!-- -->

- **Други подходи за дълги последователности:**
  - **Transformer‑XL:** рекурентна памет между сегменти за моделиране на далечни зависимости. <sup>[\[73\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-73)</sup>
  - **Reformer:** LSH‑attention и обратими остатъчни блокове за икономия на памет. <sup>[\[74\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-74)</sup>
  - **Performer:** линейна апроксимация на softmax‑attention (FAVOR+). <sup>[\[75\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-75)</sup>
  - **Linformer:** нискорангова апроксимация на матрицата на вниманието. <sup>[\[76\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-76)</sup>

## Оптимизации на моделите и инфраструктура на обучението

За обучението и разгръщането на LLM се използват специализирани техники и фреймуъркове.

- **Квантуване (Quantization):** Намаляването на разрядността на теглата намалява паметта и ускорява инференса. **QLoRA** позволява ефективно дообучаване на 4-битови модели (включително 65B) при качество, близо до пълноточното<sup>[\[77\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-77)</sup>.
- **Дестилация на знания (Knowledge Distillation):** Обучение Teacher→Student за компактни модели<sup>[\[78\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-78)</sup>; пример — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-79)</sup>.
- **Разпределено обучение:**
  - **DeepSpeed** и **ZeRO** — разпределение на параметри/градиенти/състояния на оптимизатора за обучение на трилионни модели<sup>[\[80\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-80)</sup>.
  - **Megatron‑LM** — тензорен и конвейерен паралелизъм за много големи трансформери<sup>[\[81\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-81)</sup>.
- **Екосистема и инструменти:** **Hugging Face Transformers** и **Accelerate** предоставят стандартни реализации на модели и интеграция с DeepSpeed/FSDP за обучение и инференс<sup>[\[82\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-82)[\[83\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-83)</sup>.

## Закони на мащабирането и compute‑optimal обучение

Емпиричните **закони на мащабирането** показват, че кросс-ентропийната грешка намалява по степенен закон при нарастване на параметрите, данните и изчисленията. <sup>[\[84\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-84)</sup> Работата **Chinchilla** уточни режимите **compute‑optimal**: за оптимална ефективност размерът на модела и броят на обучаващите токени трябва да се мащабират съвместно (пример — 70B модел, обучен на ~1.4T токена, превъзхождащ по-големи недообучени модели). <sup>[\[85\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-85)</sup>

## Модели с пространство на състоянията (State Space Models, SSM)

**State Space Models (SSM)** — алтернативна на трансформерите архитектура за работа с дълги последователности. Тя заимства идеи от теорията на управлението и цифровата обработка на сигнали и решава главния проблем на self‑attention: квадратичния ръст на изчисленията при увеличаване на дължината на текста.

### Основен проблем и решение

**Проблемът на трансформерите.** Главният проблем на традиционните трансформери е квадратичната сложност на вниманието: текст, 10 пъти по-дълъг, изисква приблизително 100 пъти повече изчисления.

**Подходът SSM.** Вместо „едновременно внимание към всички думи" моделът преминава през текста последователно и поддържа компактно вътрешно **състояние на паметта**, което се актуализира на всяка стъпка. В резултат времето и потреблението на памет нарастват приблизително линейно с дължината на текста. При това обучението може да се извършва паралелно — чрез свиточно представяне на ядрото (висока пропускателна способност при дълги последователности). <sup>[\[86\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-S4-86)</sup>

### Принцип на работа

Дискретната SSM се описва с уравнения на състоянието и изхода:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

където $x_{t}$ е състоянието на паметта, $u_{t}$ е входът (токен), $y_{t}$ е изходът. В дълбоките SSM матриците $A,B,C,D$ се параметризират така, че да осигурят устойчивост и ефективни изчисления при дълги последователности. Същият слой може да се разглежда като:

- рекурентен (сканиране по стъпки) — икономичен по памет инференс без KV-кеш;
- свиточен — паралелно обучение с предварително изчислено ядро. <sup>[\[86\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-S4-86)</sup>

### Основни архитектури и хибриди

- **S4 (Structured State Spaces).** Базова линия на SSM с устойчива параметризация на матрицата на състоянието; демонстрира ефективност при много дълги последователности. <sup>[\[86\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-S4-86)</sup>
- **Mamba.** *Селективни* SSM: правилата за актуализиране на паметта зависят от текущия вход (моделът сам решава какво да „задържа в паметта" и какво да „забравя"). Реализацията е ориентирана към йерархията на паметта на GPU; според авторите се постига многократно увеличение на пропускателната способност на инференса при линейна сложност по дължина. <sup>[\[87\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mamba-87)</sup>
- **RetNet.** Механизъм *retention* с три режима: паралелно обучение, рекурентен и блоково-рекурентен инференс. Целта е да се съчетаят бързи тренировки (като при трансформерите) с икономичен поток при извод (O(1) памет на токен). <sup>[\[88\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RetNet-88)</sup>
- **Хибриди Attention+SSM.** Пример — **Jamba** (редуване на слоеве Transformer и Mamba плюс MoE): съобщава за поддръжка на контексти от порядъка на ~256 K токена при съществено по-малко изискване към паметта в сравнение с чисто трансформерни модели от подобен клас. <sup>[\[89\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Jamba-89)</sup>

#### Предимства

- Линейна сложност и икономия на памет при извод. Няма глобален self‑attention и KV-кеш; съхранява се само компактно състояние. <sup>[\[87\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RetNet-88)</sup>
- Паралелно обучение при дълги последователности. Свиточният режим повишава пропускателната способност на тренировката. <sup>[\[86\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-S4-86)</sup>
- Хардуерна ефективност. Реализациите са ориентирани към съвременната йерархия на паметта (HBM/SRAM). <sup>[\[87\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mamba-87)</sup>
- Дълги контексти и стрийминг. Хибридите SSM+Attention са практични за стотици хиляди токена при умерени ресурси. <sup>[\[89\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Jamba-89)</sup>

#### Ограничения и текуща практика

- Зрялост на екосистемата. Инструментите и „рецептите" за мащабиране (инструкции, RLHF/DPO) все още отстъпват на трансформерния стек. <sup>[\[87\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mamba-87)</sup>
- Качество и устойчивост. При редица задачи хибридите (Attention+SSM) показват по-стабилен компромис „качество/скорост/памет" в сравнение с „чистите" SSM. <sup>[\[89\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Jamba-89)</sup>

#### Сравнение на подходите (обобщено)

| Характеристика            | Трансформери                        | SSM                   | Хибриди (Attention+SSM) |
|---------------------------|-------------------------------------|-----------------------|-------------------------|
| Сложност по дължина       | Квадратична (self‑attention)        | Линейна (скан/свивка) | Близка до линейна       |
| Памет на токен (инференс) | KV-кешът нараства с контекста       | O(1) състояние        | Умерен ръст             |
| Дълги контексти           | Необходими са специални оптимизации | Естествена поддръжка  | Практични до ~256 K     |
| Зрялост на екосистемата   | Висока                              | Развиваща се          | Развиваща се            |

#### Практически приложения

- Анализ на много дълги документи (книги, отчети, научни прегледи).
- Потокова обработка и чат-сценарии с дълга история без оскъпяване на паметта.
- Среди с ограничени ресурси (мобилни/edge-устройства).
- Времеви редове и други последователни данни.

**Представителни модели:** S4, Mamba, RetNet; хибриди Attention+SSM (Jamba). <sup>[\[86\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Jamba-89)</sup>

## Еволюция на архитектурите

- 2017 — публикувана е статията „Attention Is All You Need". Представена е архитектурата на трансформера: многоглавното самовнимание и позиционните кодировки позволяват обучение на модели без рекурентност и свивки; същевременно вниманието има квадратична сложност по дължина на контекста.<sup>[\[1\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — представени са GPT‑1 и BERT. GPT‑1 използва стек само от декодери с каузално внимание за генерация и последващо дообучение; BERT въвежда двупосочен енкодер и предобучение MLM за задачи за разбиране на текст. <sup>[\[90\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-90)[\[91\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-91)</sup>

<!-- -->

- 2019 — предложени са начини за работа с дълги последователности и е мащабиран decoder‑only. Transformer‑XL добавя „памет" и относителни позиции за излизане отвъд фиксирания прозорец; GPT‑2 показва ръст на zero‑shot способностите при увеличаване на мащаба; BART демонстрира ефективността на denoising-предобучението за seq2seq. <sup>[\[92\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-92)[\[93\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-93)[\[94\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-94)</sup>

<!-- -->

- 2020 — унифициран е форматът „text‑to‑text" и са показани методи за дълги документи. T5 формулира единен encoder–decoder подход за различни задачи; Longformer и BigBird използват разредено/структурирано внимание за дълги текстове; GPT‑3 потвърждава ефективността на мащабирането на плътен decoder‑only. <sup>[\[95\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-95)[\[96\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-96)[\[97\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-97)[\[98\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-98)</sup>

<!-- -->

- 2021 — подобрени са позиционните представяния и е показана разреденост на параметрите (MoE). RoPE и ALiBi подобряват обобщаването при по-голяма дължина; Switch Transformer и GLaM активират само част от експертите на токен, повишавайки капацитета без многократен ръст на цената при извод. <sup>[\[99\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-99)[\[100\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-100)[\[101\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-101)[\[102\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-102)</sup>

<!-- -->

- 2022 — уточнен е compute‑optimal режимът и е ускорен изводът при дълги промптове. Chinchilla показва ползата от по-голям брой обучаващи токени при умерен размер на модела; PaLM с Multi‑Query Attention намалява обема на KV-кеша; FlashAttention ускорява вниманието на GPU. <sup>[\[103\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-103)[\[104\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-104)[\[105\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-105)[\[106\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-106)</sup>

<!-- -->

- 2023 — увеличени са контекстните прозорци без промяна на слоевете и е подобрено сървърното подаване. Линията LLaMA затвърждава практиките (RMSNorm, SwiGLU, RoPE); Position Interpolation и YaRN разширяват контекста; vLLM/PagedAttention по-ефективно управлява KV-кеша. <sup>[\[107\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-107)[\[108\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-108)[\[109\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-109)[\[110\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-110)[\[111\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-111)[\[112\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-112)</sup>

<!-- -->

- 2023 — GPT‑4 и Gemini демонстрират обработка и генерация в няколко модалности в рамките на едно семейство модели. <sup>[\[113\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-113)[\[114\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-114)</sup>

<!-- -->

- 2023 — предложени са модели с пространство на състоянията (SSM). Mamba и RetNet възстановяват последователната обработка с компактно състояние вместо KV-кеш и полагат основата за хибридни архитектури. <sup>[\[115\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-115)[\[116\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-116)</sup>

<!-- -->

- 2024 — публикувани са отворени MoE-модели и хибриди Attention+SSM; ускорено е вниманието на нови GPU. Mixtral 8×7B/8×22B и DBRX потвърждават практичността на MoE; Jamba съчетава Transformer и Mamba за много дълги контексти; FlashAttention‑3 увеличава пропускателната способност. <sup>[\[117\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-117)[\[118\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-118)[\[119\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-119)[\[120\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-120)[\[121\]](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_note-121)</sup>

## Препратки

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — визуално обяснение

## Литература

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## Бележки

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B8_%D0%BD%D0%B0_LLM#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
