---
title: "Контекстное окно"
source: "https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE"
wiki: "systems-analysis.info/wiki"
article: "Контекстное_окно"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Базовые понятия LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 257
wiki_created_at: 2026-09-06T22:06:13Z
wiki_modified_at: 2026-09-06T22:06:13Z
downloaded_at: 2026-09-07T22:18:41Z
---

# Контекстное окно

**Контекстное окно** в [больших языковых моделях](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (БЯМ) — это максимальный объём текстовой информации (в [токенах](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")), который модель способна учитывать при формировании ответа<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Иными словами, это своего рода «рабочая память» модели, определяющая, сколько текста (включая как исходный запрос пользователя, так и ранее сгенерированные фразы модели) она может держать в контексте одновременно<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Размер окна контекста измеряется в **токенах** — условных единицах текста (слова, их фрагменты или символы), на которые разбивается ввод для обработки моделью<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. От длины контекстного окна напрямую зависят связность и актуальность генерируемых ответов: большой объем контекста позволяет модели лучше учитывать предшествующую информацию, удерживать детали продолжительных диалогов и не терять смысл при работе с длинными документами<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

## Эволюция размеров контекстного окна

Первые трансформерные языковые модели имели сравнительно небольшое окно контекста. Например, в 2018-2019 годах максимальная длина контекста составляла порядка **512-1024 токенов**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Модель GPT-3 (2020) обрабатывала уже до **2048 токенов** за раз<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. В начале работы [ChatGPT](https://systems-analysis.info/wiki/GPT "GPT") (2022) предел контекста был около **4000 токенов** (около 3000 слов), что ограничивало длину беседы – при превышении ~3000 слов чатбот начинал «теряться» и галлюцинировать вне темы<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

Современные флагманские модели существенно увеличили этот порог: так, GPT-4 доступен в версиях с окном **8192** и **32 768 токенов**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>, а модель Claude от компании Anthropic в 2023 году получила окно в **100 000 токенов** (примерно 75 тысяч слов, то есть несколько сотен страниц текста)<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. К 2024 году появились модели с контекстом порядка **128 тысяч токенов** (например, [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 3.1 от Meta)<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup> и даже до **1 миллиона токенов** (Google Gemini 1.5 Pro)<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. В 2025 году был анонсирован LLAMA 4 Scout с рекордным контекстным окном до **10 миллионов токенов**<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-cloudflare-llama4-4)</sup>, что эквивалентно тексту объёмом в десятки тысяч страниц<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Однако столь экстремальные значения являются во многом теоретическими: ограничение памяти и данных для обучения не позволяет модели полностью задействовать весь 10-миллионный контекст на практике<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Тем не менее, гонка за увеличением окна контекста стала новым этапом развития БЯМ, сравнимым по значимости с ростом числа параметров моделей<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

Ниже приведены примеры максимальной длины контекста у ряда моделей:

- GPT-3 – до ~2048 токенов<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>
- GPT-4 – 8192 токенов (стандартная версия) и до 32 768 в расширенной версии<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>
- Anthropic Claude – до 100 000 токенов<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>
- [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 3.1 – до 128000 токенов<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>
- Google Gemini 1.5 Pro – до 1 000 000 токенов<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>
- Meta LLAMA 4 Scout – заявлено до 10 000 000 токенов<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-cloudflare-llama4-4)</sup>

Рост окна контекста радикально расширяет возможности моделей<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Если 32 тысячи токенов соответствуют примерно 50 страницам текста, то 100 тысяч токенов это порядка 75 тысяч слов<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Модель же способна за считанные секунды обработать такой объем, например, проанализировать весь роман или технический отчёт, выявив нужные детали<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Таким образом, модели с длинным контекстом могут удерживать в памяти целые книги, крупные наборы документов или длинные диалоги, что открывает новые сценарии применения — от подробного суммаризации и кросс-документного вопросно-ответного анализа до работы с большими фрагментами исходного кода.

## Ограничения и проблемы долгого контекста

Увеличение контекстного окна связано с серьезными техническими и практическими вызовами<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Главный из них — **комбинаторный рост вычислительной сложности**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. В трансформерах механизм самовнимания имеет квадратичную сложность по длине последовательности: при удвоении длины контекста требуемый объем памяти и вычислений возрастает примерно вчетверо<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Например, переход с контекста 1024 токена до 4096 токенов теоретически увеличивает затраты ресурсов ~в 16 раз<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Это накладывает ограничения как на этап обучения (где слишком длинные последовательности затруднительно использовать из-за ограничений памяти GPU и времени обучения), так и на этап применения модели - длинные запросы существенно замедляют генерацию ответа и удорожают её при использовании коммерческих API<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. За обработку входных токенов обычно взимается плата, поэтому длинные подсунутые модели тексты прямо пропорционально повышают стоимость ответа<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>.

**Информационная перегрузка** – другой важный фактор<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Хотя большое окно позволяет скормить модели больше данных, избыток деталей может привести к тому, что модель **не выделит главное среди «шума»**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Исследования показывают, что современные БЯМ воспринимают релевантную информацию неравномерно: они склонны уделять больше внимания фактам, размещенным в начале или конце длинного контекстного ввода (эффекты первичности и рецепсу), и гораздо хуже извлекают знания из середины большого документа<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-lost-in-middle-6)</sup>. Насыщение промпта лишними подробностями способно **снизить точность ответа**<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-lost-in-middle-6)</sup>. Таким образом, после определенного предела наращивание объема контекста может быть контрпродуктивным<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Практическим следствием этого является рекомендация включать в длинный запрос только действительно необходимые данные и структурировать контекст так, чтобы ключевая информация находилась ближе к началу (или концу) сообщения<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

Кроме того, на практике обнаружилось расхождение между номинальной длиной окна и той, которую модель **эффективно использует**<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Многие модели не умеют одинаково хорошо работать со всей доступной длиной — их эффективная глубина контекста существенно меньше максимальной<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Например, у модели [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 3.1 с обученным контекстом 128k в тестах информация, находящаяся за пределами ~64k токенов от начала, практически не влияла на ответы<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. В целом для большинства открытых БЯМ отмечено, что их реальная эффективная память составляет менее половины от предусмотренной длины контекста<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Исследователи связывают это с особенностями обучения: даже если модель формально тренируется на длинных последовательностях, крайне дальние позиции встречаются в данных гораздо реже, чем начальные, из-за чего модель оказывается **недообученной на конце окна**<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. В типичных корпусах частота появления очень длинных последовательностей падает по экспоненте<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Такая «левосторонне смещённая» распределённость позиций приводит к тому, что модель усваивает ближний контекст значительно лучше дальнего<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Решением может быть как более тщательный отбор и разметка обучающих данных, так и специальные методы, компенсирующие недообученные позиции<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. В целом же преодоление этого ограничения – активная область исследований<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>.

## Методы расширения окна контекста

Расширение контекстного окна БЯМ требует сочетания архитектурных и алгоритмических улучшений. Основные направления, применяемые в современных работах, включают:

- **Обучение на длинных последовательностях**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Очевидный подход — снабдить модель обучающими примерами, сопоставимыми с желаемой длиной контекста. Практикуется curriculum learning по длине: постепенно увеличивать размер текстов в процессе обучения<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Также используют приёмы вроде накопления градиента и специальные предварительные обработки данных<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>.
- **Оптимизация механизма внимания**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Поскольку стандартное само-внимание имеет квадратичные издержки, активно исследуются альтернативы: разреженное внимание, скользящее окно (sliding window), многомерное разбиение контекста и др.<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. К примеру, **Ring Attention** – метод оптимизации внимания, предложенный IBM, который снижает вычислительную нагрузку при длинных последовательностях<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. В модели [IBM Granite](https://systems-analysis.info/wiki/IBM_Granite "IBM Granite") добавление кольцевого внимания позволило существенно нарастить контекст<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.
- **Улучшение позиционных кодировок**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Важнейшая часть трансформера — способ кодирования позиций токенов<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Классические абсолютные позиционные энкодеры плохо экстраполируют за пределы длины, на которой обучены<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Поэтому для длинного контекста применяются относительные позиции и другие методы<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Так, модель Granite в версии с 128k контекстом перешла от абсолютной позиции к кодированию токенов по **относительному положению**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Широко применяется **ротари-позиционное кодирование (ROPE)**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>, которое лучше сохраняет взаиморасположение дальних токенов и позволяет масштабировать контекст<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Другой подход – Attention with Linear Biases (ALiBi) – вводит в механизм внимания линейно нарастающее смещение для больших расстояний<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Комбинация таких приёмов – например, масштабирование базовой частоты ROPE (как реализовано в [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 3) – сейчас применяется, чтобы модели могли поддерживать окно 100k+ токенов<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>.
- **Память и сжатие контекста**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Альтернативный путь — не увеличивать напрямую длину окна, а **компактно представлять** длинный ввод<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Например, одна из технологий IBM заключается в том, что модель генерирует сжатое представление (резюме) длинного текста с помощью другого БЯМ<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Другой подход – подключение внешней **долгосрочной памяти** или баз знаний: модель хранит важные факты вне своего контекстного окна и при необходимости подгружает их<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Последний вариант получил развитие в виде методов, известных как **retrieval-augmented generation (RAG)**<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>.

Важно отметить, что каждая из перечисленных стратегий имеет свою цену<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Обучение на длинных контекстах требует колоссальных вычислительных ресурсов и тщательно подобранных данных<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Новые механизмы внимания и позиции усложняют архитектуру модели и иногда снижают качество на коротких текстах<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Поэтому инженерам приходится тщательно балансировать между размером окна, стабильностью обучения и конечной производительностью модели<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>.

## Большие контексты vs. извлечение информации (RAG)

Рост максимального контекста в БЯМ до сотен тысяч и более токенов породил дискуссию о том, нужны ли внешние базы знаний и алгоритмы поиска при таких возможностях модели<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Если вся релевантная информация поместится напрямую в окно контекста, модель теоретически может ответить без обращения к внешним источникам<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Некоторые исследователи предполагают, что с увеличением окна методы типа **retrieval-augmented generation (RAG)**, когда модель заранее получает извлечённые из базы тексты, могут утратить актуальность<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. В пользу этого указывают, например, информационные потери на этапе извлечения: поиск возвращает лишь несколько топ-документов, тогда как «prompt-стаффинг» (прямое включение данных в запрос) позволяет скормить модели все контекстные сведения целиком<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. IBM-исследователь Пин-Ю Чен отмечает, что никто не захочет возиться с настройкой RAG, если можно просто загрузить в модель все нужные книги и документы сразу<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

Однако противоположная точка зрения состоит в том, что даже очень большое окно **не устраняет потребности в RAG**<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Представители IBM и другие эксперты подчёркивают, что **актуальность данных и их контроль** остаются серьезной проблемой<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Модель с огромным контекстом всё равно не знает того, чего не было в её обучающих данных — например, новостей за сегодняшний день<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Для оперативного включения свежей информации по запросу механизм ретривера необходим<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Кроме того, в корпоративных приложениях RAG позволяет избирательно подтягивать факты из защищённых хранилищ, соблюдая права доступа и не разглашая лишние конфиденциальные данные<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Наконец, экономические соображения также важны: обработка миллионов токенов «вхолостую» – дорогое удовольствие, и зачастую разумнее сначала найти несколько действительно релевантных отрывков (сократив контекст), чем каждую очередь заставлять модель читать тысячестраничный ввод<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. По этим причинам RAG пока остаётся важным компонентом приложений ИИ<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>, а большие окна контекста рекомендуется применять осмотрительно<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Вероятно, **гибридные подходы** — сочетание расширенного контекста (для хранения часто используемых данных в виде кеша, Cache-Augmented Generation) и выборочного извлечения новых знаний из внешних источников — станут оптимальной архитектурой<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>.

## Применения и перспективы

Увеличение доступного контекста существенно расширяет круг задач, решаемых языковыми моделями. **Суммаризация и анализ длинных документов** — одно из непосредственных приложений<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Модель с окном 100k токенов способна за один запрос прочитать объёмный отчёт, книгу или техническую документацию и выдать по ним сводку или ответы на вопросы<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Это находит применение в юриспруденции (разбор и конспектирование контрактов), науке (автоматический обзор литературы), бизнес-аналитике. Например, Claude успешно обрабатывал целиком роман «Великий Гэтсби» (~72000 токенов) и мог за секунды выявить в тексте точечные правки<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>.

**Поддержка длительных диалогов**<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Для чат-ботов большой контекст означает умение помнить десятки и сотни реплик<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Расширенное окно также позволяет интегрировать в беседу обширные справочные данные<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>.

**Программирование и работа с кодом**<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>. В задачах, связанных с анализом исходного кода, длинный контекст оказался особенно ценен<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>. Код часто распределён по множеству файлов; чтобы дать корректный ответ, модель должна «видеть» как можно больший фрагмент кодовой базы<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>. Исследования IBM показали, что расширение контекста заметно повышает качество моделей на задачах кодогенерации<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>. Модель Granite с окном 128k токенов способна воспринимать в запросе большой объём документации по библиотекам<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-ibm-context-1)</sup>.

**Мультимодальные приложения**<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Новейшие модели (такие как уже упомянутые [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 4, [Gemini](https://systems-analysis.info/wiki/Gemini "Gemini")) являются мультимодальными и могут принимать на вход не только текст, но и другие типы данных (аудио, изображения, видео)<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-anthropic-100k-3)</sup>. Большой контекст тут помогает, например, анализировать длинные аудио-записи (расшифровки разговоров) или видео (последовательность кадров с описаниями) целиком<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Сообщается, что модель Gemini 1.5 с окном 1М токенов способна удерживать в контексте до **1 часа аудио либо 3 часов видео** без потери важных деталей<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Это открывает перспективы для автоматической расшифровки и суммаризации многочасовых совещаний, фильмов и пр.<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>.

Несмотря на впечатляющие достижения, эксперты подчеркивают, что большой контекст — **не панацея**<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>, а инструмент, требующий грамотного использования<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-meibel-impact-8)</sup>. Он значительно повышает требования к инфраструктуре (память, быстродействие) и удорожает внедрение моделей<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Поэтому при разработке систем на базе БЯМ рекомендуется тщательно оценивать, какой объём контекста действительно необходим под задачу, и комбинировать подходы<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-f5-rag-5)</sup>. Тем не менее, тенденция очевидна: будущие модели будут стремиться совмещать ещё более длинный контекст с эффективным его использованием<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-datanorth-context-2)</sup>. Решение текущих проблем (масштабирования внимания, обучения на длинных последовательностях, устранения «забывания» середины) позволит БЯМ нового поколения оперировать ещё большими объёмами информации, оставаясь при этом точными и последовательными<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>. Это существенно расширит границы применимости ИИ — от полноценного ассистента до сложных аналитических систем<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_note-arxiv-short-context-7)</sup>.

## См. также

- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [Токен](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")
- [Архитектура Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [Основные приёмы Prompt Engineering](https://systems-analysis.info/wiki/%D0%9E%D1%81%D0%BD%D0%BE%D0%B2%D0%BD%D1%8B%D0%B5_%D0%BF%D1%80%D0%B8%D1%91%D0%BC%D1%8B_Prompt_Engineering "Основные приёмы Prompt Engineering")

## Ссылки

- <a href="https://research.ibm.com/blog/larger-context-window" class="external text" rel="nofollow">Why larger LLM context windows are all the rage - IBM Research</a>
- <a href="https://datanorth.ai/blog/context-length" class="external text" rel="nofollow">Context Length in LLMs: What Is It and Why It Is Important - DataNorth</a>
- <a href="https://www.meibel.ai/post/understanding-the-impact-of-increasing-llm-context-windows" class="external text" rel="nofollow">Understanding the Impact of Increasing LLM Context Windows - Meibel</a>
- <a href="https://www.anthropic.com/news/100k-context-windows" class="external text" rel="nofollow">Introducing 100K Context Windows - Anthropic</a>
- <a href="https://arxiv.org/html/2307.03172" class="external text" rel="nofollow">Lost in the Middle: How Language Models Use Long Contexts (arXiv)</a>
- <a href="https://arxiv.org/html/2410.18745v1" class="external text" rel="nofollow">Why Does the Effective Context Length of LLMs Fall Short? (arXiv)</a>
- <a href="https://www.f5.com/company/blog/rag-in-the-era-of-llms-with-10-million-token-context-windows" class="external text" rel="nofollow">RAG in the Era of LLMs with 10 Million Token Context Windows - F5 Labs</a>

## Примечания

1.  <span id="cite_note-ibm-context-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-ibm-context_1-26)</sup> «Why larger LLM context windows are all the rage». *IBM Research Blog*. <a href="https://research.ibm.com/blog/larger-context-window" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-datanorth-context-2">↑ <sup>[2,00](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-0)</sup> <sup>[2,01](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-1)</sup> <sup>[2,02](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-2)</sup> <sup>[2,03](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-3)</sup> <sup>[2,04](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-4)</sup> <sup>[2,05](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-5)</sup> <sup>[2,06](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-6)</sup> <sup>[2,07](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-7)</sup> <sup>[2,08](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-8)</sup> <sup>[2,09](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-9)</sup> <sup>[2,10](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-10)</sup> <sup>[2,11](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-11)</sup> <sup>[2,12](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-12)</sup> <sup>[2,13](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-13)</sup> <sup>[2,14](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-14)</sup> <sup>[2,15](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-15)</sup> <sup>[2,16](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-16)</sup> <sup>[2,17](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-17)</sup> <sup>[2,18](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-18)</sup> <sup>[2,19](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-19)</sup> <sup>[2,20](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-20)</sup> <sup>[2,21](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-21)</sup> <sup>[2,22](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-22)</sup> <sup>[2,23](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-23)</sup> <sup>[2,24](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-24)</sup> <sup>[2,25](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-25)</sup> <sup>[2,26](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-26)</sup> <sup>[2,27](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-27)</sup> <sup>[2,28](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-28)</sup> <sup>[2,29](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-29)</sup> <sup>[2,30](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-30)</sup> <sup>[2,31](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-31)</sup> <sup>[2,32](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-32)</sup> <sup>[2,33](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-33)</sup> <sup>[2,34](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-datanorth-context_2-34)</sup> «Context Length in LLMs: What Is It and Why It Is Important». *DataNorth Blog*. <a href="https://datanorth.ai/blog/context-length" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-anthropic-100k-3">↑ <sup>[3,00](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-0)</sup> <sup>[3,01](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-1)</sup> <sup>[3,02](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-2)</sup> <sup>[3,03](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-3)</sup> <sup>[3,04](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-4)</sup> <sup>[3,05](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-5)</sup> <sup>[3,06](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-6)</sup> <sup>[3,07](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-7)</sup> <sup>[3,08](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-8)</sup> <sup>[3,09](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-anthropic-100k_3-9)</sup> «Introducing 100K Context Windows». *Anthropic Blog*. <a href="https://www.anthropic.com/news/100k-context-windows" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cloudflare-llama4-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-cloudflare-llama4_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-cloudflare-llama4_4-1)</sup> «Meta's Llama 4 is now available on Workers AI». *Cloudflare Blog*. <a href="https://blog.cloudflare.com/meta-llama-4-is-now-available-on-workers-ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-f5-rag-5">↑ <sup>[5,00](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-0)</sup> <sup>[5,01](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-1)</sup> <sup>[5,02](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-2)</sup> <sup>[5,03](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-3)</sup> <sup>[5,04](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-4)</sup> <sup>[5,05](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-5)</sup> <sup>[5,06](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-6)</sup> <sup>[5,07](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-7)</sup> <sup>[5,08](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-8)</sup> <sup>[5,09](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-9)</sup> <sup>[5,10](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-10)</sup> <sup>[5,11](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-11)</sup> <sup>[5,12](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-f5-rag_5-12)</sup> «RAG in the Era of LLMs with 10 Million Token Context Windows». *F5 Labs Blog*. <a href="https://www.f5.com/company/blog/rag-in-the-era-of-llms-with-10-million-token-context-windows" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-lost-in-middle-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-lost-in-middle_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-lost-in-middle_6-1)</sup> Liu, Shi et al. (2023). «Lost in the Middle: How Language Models Use Long Contexts». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2307.03172" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv-short-context-7">↑ <sup>[7,00](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-0)</sup> <sup>[7,01](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-1)</sup> <sup>[7,02](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-2)</sup> <sup>[7,03](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-3)</sup> <sup>[7,04](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-4)</sup> <sup>[7,05](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-5)</sup> <sup>[7,06](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-6)</sup> <sup>[7,07](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-7)</sup> <sup>[7,08](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-8)</sup> <sup>[7,09](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-9)</sup> <sup>[7,10](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-10)</sup> <sup>[7,11](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-arxiv-short-context_7-11)</sup> Yang, Qingyu et al. (2024). «Why Does the Effective Context Length of LLMs Fall Short?». *arXiv*. <a href="https://arxiv.org/html/2410.18745v1" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-meibel-impact-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-1)</sup> <sup>[8,2](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-2)</sup> <sup>[8,3](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-3)</sup> <sup>[8,4](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-4)</sup> <sup>[8,5](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-5)</sup> <sup>[8,6](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE#cite_ref-meibel-impact_8-6)</sup> «Understanding the Impact of Increasing LLM Context Windows». *Meibel Blog*. <a href="https://www.meibel.ai/post/understanding-the-impact-of-increasing-llm-context-windows" class="external autonumber" rel="nofollow">[8]</a></span>
