---
title: "Нейронная дегенерация текста"
source: "https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0"
wiki: "systems-analysis.info/wiki"
article: "Нейронная_дегенерация_текста"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Базовые понятия LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 309
wiki_created_at: 2026-09-06T22:06:56Z
wiki_modified_at: 2026-09-06T22:06:56Z
downloaded_at: 2026-09-07T22:19:00Z
---

# Нейронная дегенерация текста

**Нейронная дегенерация текста**, также **вырождение текста при нейронной генерации** (англ. *Neural Text Degeneration*), — это класс патологий генерации текста в нейронных языковых моделях, при котором вывод становится неестественным: чрезмерно повторяющимся, шаблонным, малосодержательным или теряет связность. Термин получил широкое распространение после работы Ари Хольцмана и соавт. *The Curious Case of Neural Text Degeneration* (2019; ICLR 2020), где было показано, что стратегии декодирования, основанные на прямой максимизации правдоподобия, часто дают некачественный результат в задачах открытой генерации текста.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

## Простое объяснение

**Нейронная дегенерация текста** — это ситуация, когда модель **формально продолжает текст**, но делает это плохо с точки зрения естественной речи.

Обычно это выглядит так:

- модель начинает повторять одни и те же слова или фразы;
- текст становится слишком шаблонным и «безжизненным»;
- ответ теряет смысловую связность;
- в продолжение начинают попадать случайные или неудачные слова.

**Иными словами,** модель либо становится слишком *«осторожной»* и всё время выбирает одно и то же, либо, наоборот, получает слишком много свободы и начинает тянуть слабые и шумовые продолжения. В обоих случаях текст перестаёт быть похожим на естественную человеческую речь.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

## История изучения

Проблема была подробно сформулирована Хольцманом и соавт. в 2019 году на материале открытой генерации текста — прежде всего историй, свободных продолжений и диалоговых ответов. Авторы показали, что методы декодирования, ориентированные на максимизацию вероятности, такие как **жадный поиск** (*greedy search*) и **лучевой поиск** (*beam search*), в открытых задачах нередко приводят к неестественным, повторяющимся и малосодержательным последовательностям.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В той же работе было показано, что и противоположный подход — **чистое стохастическое сэмплирование** без усечения — также проблематичен, поскольку модель может выбирать токены из «ненадёжного хвоста» распределения вероятностей. Это ухудшает связность и повышает риск случайных, плохо согласованных продолжений.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Позднейшие работы уточнили и расширили это объяснение. В частности, Finlayson и соавт. предложили теоретическую интерпретацию того, почему методы усечения (например, [Top-p](https://systems-analysis.info/wiki/Top-p "Top-p")) часто помогают уменьшать вырождение текста: усечение хвоста позволяет избегать токенов, для которых модель особенно ненадёжна.<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

Meister и соавт. дополнительно связали проблему дегенерации с нарушением локальной типичности: человеческий текст, как правило, стремится поддерживать информационное содержание, близкое к ожидаемой условной энтропии, а не просто максимизировать вероятность каждого следующего [токена](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен").<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

## Основные проявления

Нейронная дегенерация текста может проявляться не только в виде явных повторов, но и в более скрытых формах: от смыслового обеднения до постепенного распада связности. Внешне такие тексты нередко остаются грамматически правильными, однако начинают заметно отличаться от естественной человеческой речи по разнообразию, информативности и устойчивости развития мысли.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

### Повторения и зацикливание

Наиболее известная форма — **повторение токенов, фраз или целых синтаксических конструкций**. Текст начинает «ходить по кругу», добавляя почти одинаковые продолжения снова и снова.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Такое вырождение может проявляться на разных уровнях:

- как повтор отдельных слов;
- как навязчивое воспроизведение одной и той же фразы;
- как циклическое возвращение к одной и той же мысли;
- как многократное копирование одной и той же синтаксической схемы с минимальными изменениями.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Особенно характерно, что повторы нередко становятся **самоподдерживающимися**: однажды возникшая конструкция начинает усиливать сама себя, поскольку модель продолжает опираться на уже сгенерированный фрагмент и воспроизводит его снова в слегка изменённом виде. В результате текст может сохранять видимость движения вперёд, но фактически перестаёт развиваться содержательно.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Шаблонность и обеднение содержания

Даже если явных циклов нет, модель может выдавать слишком предсказуемый и малосодержательный текст. Такой вывод остаётся грамматически корректным, но становится банальным, однообразным и бедным по информационному содержанию.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В этой форме дегенерации текст обычно выглядит «правильным», но производит впечатление чрезмерно безопасного и усреднённого. Модель предпочитает наиболее ожидаемые слова и обороты, из-за чего:

- снижается лексическое разнообразие;
- чаще повторяются одни и те же речевые шаблоны;
- исчезают менее очевидные, но более содержательные формулировки;
- текст становится более гладким по форме, но беднее по смыслу.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Именно поэтому дегенерация не всегда выглядит как явная ошибка: иногда она проявляется как **слишком предсказуемый, «ровный» и пустой текст**, который формально написан правильно, но почти не даёт новой информации.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

### Потеря связности

При избыточной случайности или слабом контроле над хвостом распределения генерация может сохранять локальную грамматическую правильность, но терять общую смысловую связанность: в текст начинают попадать неуместные слова, неожиданные переходы темы и логические разрывы.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В такой ситуации соседние фразы могут по отдельности выглядеть допустимыми, однако между ними ослабевают причинно-следственные, тематические и логические связи. Это проявляется в том, что:

- предложение грамматически корректно, но плохо связано с предыдущим;
- мысль внезапно меняет направление без ясного перехода;
- в тексте появляются локально допустимые, но контекстно неуместные продолжения;
- общий ход рассуждения становится рыхлым и неустойчивым.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Иными словами, модель может сохранять **локальную гладкость** на уровне отдельных фраз, но терять **глобальную связность** на уровне всего абзаца или длинного ответа.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Семантический дрейф

Ещё одна форма вырождения — **постепенное смещение смысла**, при котором текст не рушится мгновенно, а медленно уходит в сторону от исходной темы, задачи или линии повествования.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В отличие от явной бессвязности, здесь деградация развивается постепенно:

- модель начинает с релевантного ответа;
- затем добавляет всё более общие или слабо связанные детали;
- после этого исходная тема размывается;
- в конце текст может остаться формально плавным, но уже плохо отвечать на исходный запрос.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Такой дрейф особенно заметен в длинной генерации: модель не обязательно впадает в циклы, но шаг за шагом теряет тематическую дисциплину, и продолжение перестаёт быть по-настоящему релевантным.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Снижение информативности

Вырождение может выражаться не только в повторах, но и в том, что текст перестаёт добавлять новую информацию. Модель продолжает писать, однако семантическая «плотность» вывода снижается, и продолжение становится пустым по содержанию.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

В таком тексте слова и предложения продолжают накапливаться, но смысловое продвижение замедляется. Новые фразы:

- переформулируют уже сказанное;
- добавляют минимальное количество новых фактов;
- заменяют конкретику общими словами;
- поддерживают объём текста без сопоставимого роста содержания.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Это особенно важно, поскольку подобная деградация может выглядеть менее заметной, чем явные повторы: текст кажется «нормальным», но при внимательном чтении оказывается, что он в основном повторяет одну и ту же мысль разными словами.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

### Скрытая дегенерация без явных сбоев

Не всякая нейронная дегенерация выглядит как грубая поломка. В ряде случаев текст не содержит явных циклов, резких логических обрывов или очевидного «шума», однако всё равно заметно отклоняется от естественного человеческого письма.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Такая скрытая форма проявляется как сочетание:

- чрезмерной предсказуемости;
- однотипного ритма фраз;
- безопасных, но слабых формулировок;
- недостатка неожиданности, нюансов и смысловой глубины.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Именно поэтому нейронная дегенерация текста не сводится только к зацикливанию. Она охватывает более широкий спектр симптомов — от явных повторов до тонкого смыслового обеднения, при котором текст остаётся формально правильным, но теряет разнообразие, выразительность и содержательную ценность.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

## Причины

### Несовпадение между обучением и декодированием

Языковые модели обычно обучаются предсказывать следующий токен по вероятностному распределению. Однако при генерации текст нередко извлекается не как выборка из этого распределения, а с помощью процедур, которые **жёстко максимизируют вероятность** на каждом шаге или по всей последовательности. Это различие между целями обучения и правилами декодирования является одной из ключевых причин вырождения в открытых задачах.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### «Ненадёжный хвост» распределения

С другой стороны, полная свобода сэмплирования тоже может быть вредна. Даже очень маловероятные токены обычно имеют ненулевую вероятность, и среди них находится множество слабых, шумовых или плохо согласованных вариантов. Если модель выбирает токен из такого хвоста, качество продолжения может резко ухудшиться.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

### Нарушение локальной типичности

Meister и соавт. связывают вырождение с тем, что естественный текст обычно поддерживает информационное содержание, близкое к ожидаемой условной энтропии. Когда декодирование систематически уходит от этой «типичности», текст может становиться либо слишком банальным, либо слишком шумным.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

## Связь с методами декодирования

Нейронная дегенерация текста тесно связана не только с качеством самой языковой модели, но и с тем, **как именно** из её вероятностного распределения выбирается следующий токен. Один и тот же набор вероятностей может давать заметно разный результат в зависимости от стратегии декодирования: одни методы усиливают повторы и шаблонность, другие — повышают разнообразие, но рискуют потерять связность, третьи пытаются удержать компромисс между этими крайностями.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Жадный поиск и beam search

Жадный поиск и лучевой поиск особенно склонны к повторениям и шаблонности в задачах открытой генерации, поскольку систематически предпочитают наиболее вероятные продолжения.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В случае **жадного поиска** модель на каждом шаге выбирает один самый вероятный токен. Такой подход хорошо работает там, где у задачи есть сравнительно узкий набор корректных ответов, однако в свободной генерации он часто делает текст слишком предсказуемым. Модель снова и снова выбирает наиболее «безопасные» продолжения, из-за чего:

- усиливается склонность к повторению уже выбранных конструкций;
- уменьшается разнообразие формулировок;
- текст становится более шаблонным и бедным по содержанию.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

**Лучевой поиск** (beam search) частично расширяет пространство поиска, поскольку отслеживает сразу несколько наиболее вероятных гипотез. Однако в задачах открытого текста это не всегда спасает от вырождения. Напротив, из-за общей ориентации на максимизацию правдоподобия он также может систематически отдавать предпочтение слишком «правильным», но малоестественным продолжениям, что повышает риск:

- однообразия;
- повторяемости;
- избыточно гладкого, но малосодержательного текста.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Иными словами, методы, которые слишком последовательно выбирают наиболее вероятное продолжение, часто выигрывают в локальной предсказуемости, но проигрывают в естественности длинной генерации.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Чистое сэмплирование

Нестрого ограниченное сэмплирование повышает разнообразие, но без дополнительных фильтров чаще захватывает слабые токены из хвоста распределения, что может ухудшать связность текста.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

При **чистом сэмплировании** следующий токен выбирается случайно в соответствии с полным вероятностным распределением модели. В отличие от жадного поиска или beam search, такой подход даёт модели больше свободы и помогает избегать слишком раннего «застревания» в одном и том же шаблоне.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Однако у этой свободы есть обратная сторона. Даже если вероятность многих токенов очень мала, они обычно всё равно имеют ненулевой шанс быть выбранными. Из-за этого модель может захватывать продолжения из «хвоста» распределения, где чаще встречаются:

- случайные и контекстно слабые слова;
- плохо согласованные продолжения;
- токены, которые локально допустимы, но ухудшают общую связность текста.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В результате чистое сэмплирование часто уменьшает шаблонность, но одновременно делает текст менее устойчивым: он может оставаться разнообразным, но становится более рыхлым, непоследовательным или семантически нестабильным.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

### Методы усечения распределения

Методы усечения распределения — прежде всего [Top-p](https://systems-analysis.info/wiki/Top-p "Top-p") и [Top-k](https://systems-analysis.info/wiki/Top-k "Top-k") — были предложены как практический способ уменьшить вырождение. Они ограничивают множество допустимых токенов и тем самым снижают вероятность неудачных продолжений.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

Общая логика этих методов состоит в том, чтобы не позволять модели выбирать следующий токен из всего словаря. Вместо этого рассматривается только наиболее правдоподобная часть распределения:

- **Top-k** оставляет фиксированное число наиболее вероятных токенов;
- **Top-p** оставляет динамическое «ядро» токенов, суммарная вероятность которых достигает заданного порога.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Такое ограничение уменьшает риск того, что модель выберет слишком слабое продолжение из ненадёжного хвоста, но при этом не заставляет её каждый раз брать только один-единственный «лучший» вариант. За счёт этого методы усечения часто оказываются промежуточным решением между двумя крайностями:

- слишком жёсткой максимизацией;
- слишком свободным и шумным сэмплированием.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Позднее Finlayson и соавт. предложили более строгую теоретическую интерпретацию этой эффективности. Они показывают, что truncation-методы помогают отбрасывать токены, которые с большей вероятностью являются ненадёжными с точки зрения истинного распределения текста. Поэтому усечение можно рассматривать не только как инженерный эвристический приём, но и как способ уменьшить вероятность систематических ошибок при выборе следующего токена.<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

### Современные стратегии

Более поздние методы, такие как **locally typical sampling**, стремятся уменьшить дегенеративные повторы, сохраняя при этом качество генерации.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup> Аналогично, **contrastive search** был предложен как способ повысить разнообразие, не жертвуя связностью текста.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

Эти методы развивают идею, что проблема заключается не только в том, **сколько** токенов оставлять, но и в том, **какие именно** токены стоит считать хорошими кандидатами.

**Locally typical sampling** ориентируется не просто на высокую вероятность, а на близость информационного содержания токена к ожидаемой условной энтропии. Это позволяет уменьшать ситуации, когда модель:

- выбирает слишком банальные и «пустые» продолжения;
- застревает в дегенеративных повторах;
- становится слишком предсказуемой даже без явных циклов.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

**Contrastive search** использует иную логику: он стремится выбирать продолжения, которые одновременно остаются правдоподобными и не слишком похожими на уже сгенерированный контекст. За счёт этого уменьшается вероятность того, что модель будет усиливать одни и те же конструкции просто потому, что они локально очень вероятны.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

По сравнению с классическими decoding-стратегиями эти методы пытаются не просто ограничить выбор, а сделать сам критерий выбора более чувствительным к качеству длинной генерации — то есть к тому, будет ли текст оставаться содержательным, разнообразным и связным на протяжении нескольких предложений или абзацев.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

### Зависимость от режима декодирования

Связь между нейронной дегенерацией и декодированием не сводится к противопоставлению «хороших» и «плохих» методов. Один и тот же алгоритм может вести себя по-разному в зависимости от того, насколько жёстко или свободно он ограничивает распределение на каждом шаге.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

В общем виде можно выделить три режима:

- **слишком жёсткий выбор** — модель почти всегда берёт самые вероятные токены, что усиливает шаблонность и повторы;
- **слишком свободный выбор** — модель получает слишком широкий доступ к слабым продолжениям, что повышает риск бессвязности;
- **умеренно ограниченный выбор** — модель сохраняет разнообразие, но остаётся в пределах достаточно надёжной части распределения.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

Именно поэтому нейронная дегенерация часто рассматривается как следствие не только качества самой модели, но и **неудачного режима декодирования**: слишком жёсткого, слишком мягкого или плохо согласованного с конкретной задачей генерации.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

**Проще говоря,** вырождение чаще возникает на двух крайностях: когда модель либо слишком жёстко выбирает только самые вероятные слова, либо, наоборот, получает слишком много свободы и начинает тянуть случайные слабые продолжения. Наиболее устойчивые стратегии обычно находятся между этими крайними режимами.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

## Методы смягчения

Хотя универсального способа полностью устранить нейронную дегенерацию текста не существует, на практике разработан ряд методов, которые позволяют заметно снизить её наиболее типичные проявления — прежде всего повторы, шаблонность, потерю связности и захват «шумового» хвоста распределения. Эти методы различаются по тому, **как именно** они ограничивают выбор следующего токена: одни просто отсекают слабые варианты, другие учитывают форму распределения более тонко, третьи пытаются напрямую балансировать связность и разнообразие.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

### Усечение распределения

Самый распространённый способ борьбы с нейронной дегенерацией — ограничивать выбор следующего токена не всем словарём, а только наиболее правдоподобной его частью. Именно на этом основаны Top-p и Top-k.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

Основная идея этих методов состоит в том, что модель не должна свободно выбирать среди всех возможных токенов, поскольку значительная часть распределения находится в «ненадёжном хвосте», где скапливаются слабые, шумовые или плохо согласованные варианты. Усечение позволяет **искусственно сузить пространство выбора** и тем самым уменьшить вероятность того, что генерация резко уйдёт в бессвязность или начнёт распадаться.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

На практике используются две наиболее известные схемы:

- **[Top-k](https://systems-analysis.info/wiki/Top-k "Top-k")** — оставляет только фиксированное число наиболее вероятных токенов;
- **[Top-p](https://systems-analysis.info/wiki/Top-p "Top-p")** (*nucleus sampling*) — оставляет динамическое «ядро» токенов, суммарная вероятность которых достигает заданного порога $p$.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Их общий смысл один: не давать модели выбирать из слишком большого количества слабых продолжений. При этом Top-p обычно считается более гибким, поскольку размер допустимого множества меняется от шага к шагу в зависимости от текущей формы распределения.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup>

Finlayson и соавт. предложили более строгую интерпретацию того, почему truncation-методы часто работают: усечение помогает отбрасывать токены, которые могут не принадлежать поддержке «истинного» распределения текста, то есть являются особенно ненадёжными с точки зрения модели. Поэтому такие методы не просто механически «режут хвост», а фактически снижают вероятность систематических ошибок на этапе выбора токена.<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

**Проще говоря,** усечение распределения помогает модели не заходить слишком далеко в область слабых и случайных вариантов. За счёт этого текст чаще остаётся более связным, естественным и менее склонным к вырождению.

### Более адаптивные методы сэмплирования

Locally typical sampling, η-сэмплирование и родственные подходы пытаются не просто «отрезать хвост», а учитывать форму распределения и информационную структуру текущего шага генерации.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

В отличие от простого усечения, такие методы стремятся учитывать не только то, **насколько вероятен** токен, но и то, **насколько он типичен** для данного контекста. Это важно, потому что дегенерация возникает не только из-за слишком слабых токенов, но и из-за чрезмерного предпочтения слишком «безопасных» и банальных продолжений.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Например, **locally typical sampling** ориентируется на близость информационного содержания токена к ожидаемой условной энтропии. Иными словами, он старается выбирать не просто самые вероятные слова, а те, которые лучше соответствуют «нормальному» уровню информативности для данного контекста. Это позволяет уменьшать:

- дегенеративные повторы;
- чрезмерную шаблонность;
- смысловое обеднение текста при сохранении общей связности.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Схожую логику используют и другие адаптивные методы: вместо простого фиксированного отсечения они стремятся подстраиваться под текущее состояние распределения. За счёт этого модель меньше склонна впадать в две крайности:

- либо становиться слишком предсказуемой и «плоской»;
- либо захватывать слишком слабые и шумовые продолжения.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)</sup>

Такие методы обычно сложнее в интерпретации и настройке, чем Top-k или Top-p, однако они могут лучше справляться с тонкими формами дегенерации, где проблема состоит не в явной бессвязности, а в потере информативности и повторяемости речевых шаблонов.<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-meister2023-3)[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

**Проще говоря,** более адаптивные методы пытаются не просто убрать слабые слова, а оставить те продолжения, которые лучше подходят текущему контексту по смыслу и «естественности».

### Contrastive search

Contrastive search и близкие методы стремятся одновременно поддерживать связность и разнообразие, уменьшая повторы, которые часто возникают у strictly maximization-based decoding.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

Идея contrastive-подхода состоит в том, чтобы не полагаться только на вероятность следующего токена. Вместо этого выбор кандидата строится как компромисс между двумя требованиями:

- продолжение должно быть достаточно правдоподобным;
- продолжение не должно быть слишком похожим на уже сгенерированный контекст и тем самым усиливать повторение.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

За счёт этого contrastive search пытается подавлять именно те продолжения, которые формально выглядят очень вероятными, но практически ведут к зацикливанию, шаблонности или чрезмерно однотипной генерации. В отличие от чистого сэмплирования, этот подход не вводит случайность как основной механизм борьбы с вырождением, а старается целенаправленно выбирать **достаточно вероятные, но менее дегенеративные** продолжения.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

Такие методы особенно важны потому, что классические maximization-based стратегии часто дают высокую локальную уверенность, но платят за это естественностью текста. Contrastive search пытается сохранить сильные стороны детерминированного выбора — связность и устойчивость — при одновременном снижении повторов и однообразия.<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

**Проще говоря,** contrastive search старается не брать продолжение только потому, что оно самое вероятное. Он дополнительно «штрафует» слишком однообразные варианты, чтобы текст не зацикливался и не становился слишком шаблонным.

### Подбор стратегии под задачу

Более поздние исследования подчёркивают, что универсального метода нет: эффективность конкретной decoding-стратегии зависит от типа задачи, размера модели, выравнивания и других факторов. То, что хорошо работает для диалоговой генерации или эссе, может работать хуже в коде, математике или иных детерминированных доменах.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

Это означает, что борьба с нейронной дегенерацией — не только выбор «лучшего» алгоритма, но и **сопоставление метода с типом задачи**. В открытой генерации (истории, диалоги, длинные ответы) методы сэмплирования и более гибкие схемы отбора часто помогают сохранить разнообразие и естественность. В более жёстких и детерминированных задачах — например, в программировании, математике или задачах с однозначным правильным ответом — слишком агрессивная стохастика, наоборот, может снижать качество результата.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

Shi и соавт. также показывают, что на итоговый результат влияют не только сама стратегия декодирования, но и:

- размер модели;
- степень её выравнивания;
- чувствительность к гиперпараметрам;
- среда развёртывания и ограничения инференса.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

Отсюда следует важный практический вывод: один и тот же метод может выглядеть сильным в одной конфигурации и заметно слабее — в другой. Поэтому смягчение нейронной дегенерации на практике почти всегда требует подбора параметров и проверки на конкретном классе задач, а не опоры на один «универсальный» рецепт.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

**Проще говоря,** хороший способ декодирования зависит от того, что именно делает модель. Для свободного текста лучше работают одни методы, для кода, математики и других точных задач — другие.

### Комбинирование методов

На практике методы смягчения нередко применяются не изолированно, а в сочетании друг с другом. Например, усечение распределения может использоваться вместе с температурой, а более сложные стратегии — сочетаться с дополнительными ограничениями на выбор токенов.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

Смысл таких комбинаций состоит в том, чтобы разделить функции:

- один механизм задаёт общий уровень разнообразия;
- другой ограничивает «шумовой» хвост;
- третий снижает риск повторов или шаблонности.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-contrastive2022-4)</sup>

Однако увеличение числа одновременно настраиваемых механизмов усложняет контроль над поведением модели. Поэтому более сложная схема не всегда означает более качественный результат: выигрыш часто зависит от того, насколько хорошо подобраны гиперпараметры и насколько конкретная комбинация соответствует задаче.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

**Иными словами,** смягчение нейронной дегенерации чаще всего строится не на одном «магическом» методе, а на аккуратном сочетании нескольких ограничений, каждое из которых устраняет свою часть проблемы.

## Не следует путать с model collapse

Нейронную дегенерацию текста в смысле Holtzman и соавт. не следует смешивать с **model collapse** — отдельным явлением, изучаемым в работах о рекурсивном обучении моделей на синтетических данных.

В первом случае речь идёт прежде всего о вырождении текста **на этапе генерации** (inference), когда неудачная стратегия декодирования приводит к повторам, шаблонности или потере связности.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)</sup> Во втором — о деградации модели **на этапе обучения**, когда сгенерированные моделью данные начинают «загрязнять» обучающий набор следующего поколения моделей, что может приводить к исчезновению редких событий и сужению распределения.<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shumailov2024-6)</sup>

Эти явления тематически связаны, поскольку оба касаются ухудшения качества нейросетевого текста, однако в литературе обычно рассматриваются как разные проблемы: одна относится к декодированию, другая — к данным и обучению.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[6\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shumailov2024-6)</sup>

## Значение для больших языковых моделей

В эпоху [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") проблема нейронной дегенерации не исчезла, а сместилась из области небольших генераторов текста в область управления поведением более мощных систем. Хотя современные LLM обычно лучше выровнены и реже впадают в грубые циклы повторов, выбор decoding-стратегии по-прежнему заметно влияет на естественность, разнообразие и устойчивость вывода.<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-shi2024-5)</sup>

Из-за этого нейронная дегенерация текста рассматривается не как узкий дефект ранних языковых моделей, а как фундаментальная проблема практической генерации: хорошее вероятностное моделирование само по себе не гарантирует хорошего текста на этапе инференса.<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-holtzman2019-1)[\[2\]](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_note-finlayson2024-2)</sup>

## См. также

- [Top-p сэмплирование](https://systems-analysis.info/wiki/Top-p "Top-p")
- [Top-k сэмплирование](https://systems-analysis.info/wiki/Top-k "Top-k")
- [Температура](https://systems-analysis.info/wiki/%D0%A2%D0%B5%D0%BC%D0%BF%D0%B5%D1%80%D0%B0%D1%82%D1%83%D1%80%D0%B0_(LLM) "Температура (LLM)")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")

## Литература

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; опубликовано на ICLR 2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/2310.01693" class="external text" rel="nofollow">arXiv:2310.01693</a>.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. <a href="https://aclanthology.org/2023.tacl-1.7/" class="external text" rel="nofollow">TACL 2023</a>.
- Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. <a href="https://aclanthology.org/2024.emnlp-main.489/" class="external text" rel="nofollow">EMNLP 2024</a>.
- Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. <a href="https://arxiv.org/abs/2202.06417" class="external text" rel="nofollow">arXiv:2202.06417</a>.
- Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. <a href="https://pmc.ncbi.nlm.nih.gov/articles/PMC11269175/" class="external text" rel="nofollow">Nature 2024</a>.

## Примечания

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-27)</sup> <sup>[1,28](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-28)</sup> <sup>[1,29](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-29)</sup> <sup>[1,30](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-30)</sup> <sup>[1,31](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-31)</sup> <sup>[1,32](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-32)</sup> <sup>[1,33](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-33)</sup> <sup>[1,34](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-34)</sup> <sup>[1,35](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-35)</sup> <sup>[1,36](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-36)</sup> <sup>[1,37](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-37)</sup> <sup>[1,38](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-38)</sup> <sup>[1,39](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-39)</sup> <sup>[1,40](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-40)</sup> <sup>[1,41](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-41)</sup> <sup>[1,42](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-42)</sup> <sup>[1,43](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-43)</sup> <sup>[1,44](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-44)</sup> <sup>[1,45](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-45)</sup> <sup>[1,46](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-46)</sup> <sup>[1,47](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-holtzman2019_1-47)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-finlayson2024-2">↑ <sup>[2,00](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-0)</sup> <sup>[2,01](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-1)</sup> <sup>[2,02](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-2)</sup> <sup>[2,03](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-3)</sup> <sup>[2,04](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-4)</sup> <sup>[2,05](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-5)</sup> <sup>[2,06](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-6)</sup> <sup>[2,07](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-7)</sup> <sup>[2,08](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-8)</sup> <sup>[2,09](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-9)</sup> <sup>[2,10](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-10)</sup> <sup>[2,11](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-finlayson2024_2-11)</sup> Finlayson, M., Hewitt, J., Koller, A., Swayamdipta, S., & Sabharwal, A. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-meister2023-3">↑ <sup>[3,00](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-0)</sup> <sup>[3,01](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-1)</sup> <sup>[3,02](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-2)</sup> <sup>[3,03](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-3)</sup> <sup>[3,04](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-4)</sup> <sup>[3,05](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-5)</sup> <sup>[3,06](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-6)</sup> <sup>[3,07](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-7)</sup> <sup>[3,08](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-8)</sup> <sup>[3,09](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-9)</sup> <sup>[3,10](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-10)</sup> <sup>[3,11](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-11)</sup> <sup>[3,12](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-12)</sup> <sup>[3,13](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-13)</sup> <sup>[3,14](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-14)</sup> <sup>[3,15](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-15)</sup> <sup>[3,16](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-16)</sup> <sup>[3,17](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-17)</sup> <sup>[3,18](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-18)</sup> <sup>[3,19](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-meister2023_3-19)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *Transactions of the Association for Computational Linguistics*, 11. <a href="https://aclanthology.org/2023.tacl-1.7/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-contrastive2022-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-1)</sup> <sup>[4,2](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-2)</sup> <sup>[4,3](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-3)</sup> <sup>[4,4](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-4)</sup> <sup>[4,5](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-5)</sup> <sup>[4,6](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-6)</sup> <sup>[4,7](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-contrastive2022_4-7)</sup> Su, Y., Lan, T., Wang, Y., Yogatama, D., Kong, L., & Collier, N. (2022). *A Contrastive Framework for Neural Text Generation*. arXiv:2202.06417. <a href="https://arxiv.org/abs/2202.06417" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-shi2024-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-1)</sup> <sup>[5,2](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-2)</sup> <sup>[5,3](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-3)</sup> <sup>[5,4](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-4)</sup> <sup>[5,5](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-5)</sup> <sup>[5,6](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-6)</sup> <sup>[5,7](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-7)</sup> <sup>[5,8](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shi2024_5-8)</sup> Shi, C., Yang, H., Cai, D., Zhang, Z., Wang, Y., Yang, Y., & Lam, W. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. EMNLP 2024. <a href="https://aclanthology.org/2024.emnlp-main.489/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-shumailov2024-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shumailov2024_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/%D0%9D%D0%B5%D0%B9%D1%80%D0%BE%D0%BD%D0%BD%D0%B0%D1%8F_%D0%B4%D0%B5%D0%B3%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%B0#cite_ref-shumailov2024_6-1)</sup> Shumailov, I. et al. (2024). *AI models collapse when trained on recursively generated data*. *Nature*. <a href="https://pmc.ncbi.nlm.nih.gov/articles/PMC11269175/" class="external autonumber" rel="nofollow">[6]</a></span>
