---
title: "Top-p"
source: "https://systems-analysis.info/wiki/Top-p"
wiki: "systems-analysis.info/wiki"
article: "Top-p"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Базовые понятия LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 198
wiki_created_at: 2026-09-06T22:05:16Z
wiki_modified_at: 2026-09-06T22:05:16Z
downloaded_at: 2026-09-07T22:18:16Z
---

# Top-p

**Top‑p сэмплирование**, также известное как **ядерная выборка** (англ. *Nucleus Sampling*), — стохастический метод декодирования для авторегрессивных языковых моделей, широко применяемый в том числе в [больших языковых моделях](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM). Метод предложен в 2019 году Ари Хольцманом и соавт. (препринт arXiv — апрель 2019; публикация на ICLR 2020) как усовершенствованная альтернатива фиксированному Top‑k сэмплированию. Его идея — динамически подбирать множество кандидатов на каждом шаге генерации по порогу кумулятивной вероятности $p$.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

## Историческая предпосылка: проблема нейронной дегенерации текста

До появления Top‑p доминирующими стратегиями декодирования были **жадный поиск** (*greedy search*) и **лучевой поиск** (*beam search*), основанные на парадигме максимизации правдоподобия — выбора последовательности [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен") с наивысшей совокупной вероятностью. Жадный поиск на каждом шаге локально выбирает токен с максимальной вероятностью, а лучевой поиск параллельно отслеживает несколько гипотез генерации.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

Хотя эти методы были эффективны в закрытых задачах (машинный перевод, извлечение данных), при переходе к задачам открытой генерации текста (написание историй, диалоговые системы) они часто приводили к **нейронной дегенерации текста** — вырождению вывода, при котором текст становится шаблонным, теряет связность или зацикливается на повторениях. Это явление подробно описано Хольцманом и соавт. в работе *The Curious Case of Neural Text Degeneration*.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

Meister и соавт. связывают проблему дегенерации с тем, что человеческий текст стремится поддерживать информационное содержание, близкое к ожидаемой условной энтропии, а не просто максимизировать локальную вероятность каждого следующего токена.<sup>[\[2\]](https://systems-analysis.info/wiki/Top-p#cite_note-meister2023-2)</sup>

Альтернативой стало **чистое стохастическое сэмплирование** (*sampling without truncation*), при котором токен выбирается случайным образом в соответствии с его вероятностью. Однако этот метод породил обратную проблему: функция Softmax никогда не присваивает токену вероятность, строго равную нулю, поэтому в словаре из десятков тысяч слов всегда существует обширная зона шумовых токенов. При чистом сэмплировании увеличивается риск попадания в ненадёжный хвост распределения, что может ухудшать связность генерируемого текста.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/wiki/Top-p#cite_note-arxiv-hall-3)</sup> Необходимость совместить богатство стохастического выбора с надёжностью детерминированных ограничений привела к разработке методов усечения распределения, флагманом которых стало ядерное сэмплирование (Top‑p).<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/wiki/Top-p#cite_note-finlayson2024-4)</sup>

## Простое объяснение

**Top-p сэмплирование** — это способ ограничить выбор следующего токена только **наиболее правдоподобными** вариантами, не фиксируя их число заранее.

При генерации текста языковая модель на каждом шаге оценивает множество возможных продолжений и присваивает каждому из них некоторую вероятность. Одни токены оказываются очень вероятными, другие — умеренно вероятными, а большая часть словаря образует так называемый «хвост» распределения: варианты с очень малой вероятностью, которые формально допустимы, но часто оказываются случайными, неуместными или ухудшают связность текста.

Top-p сэмплирование отсекает этот маловероятный хвост **не по фиксированному количеству токенов**, а по **суммарной вероятности**. Сначала все кандидаты упорядочиваются от наиболее вероятных к наименее вероятным. Затем выбирается минимальный набор верхних токенов, чья общая вероятность достигает заданного порога $p$ — например, 0.9 или 0.95. После этого следующий токен выбирается случайным образом только из этого набора, а все остальные варианты исключаются.

Например, если модель продолжает фразу «Сегодня на улице шёл сильный…», среди наиболее вероятных вариантов могут оказаться «дождь» (0.45), «ливень» (0.25), «снег» (0.15) и «ветер» (0.10). При пороге $p = 0.90$ алгоритм суммирует токены по убыванию вероятности: 0.45 + 0.25 = 0.70 (меньше 0.90), добавляет «снег»: 0.70 + 0.15 = 0.85 (всё ещё меньше 0.90), добавляет «ветер»: 0.85 + 0.10 = 0.95 (порог превышен). Ядро сформировано из четырёх токенов. Все более редкие варианты отбрасываются, а вероятности оставшихся нормализуются: так, вероятность токена «дождь» после перенормировки составит $0.45/0.95 \approx 47.4\%$, и генератор выберет следующий токен именно из этого обновлённого распределения.

Главное отличие от Top‑k в том, что Top‑k всегда берёт **фиксированное число** лучших слов (например, 50), тогда как Top‑p не фиксирует количество вариантов заранее: иногда это может быть 3 слова, иногда 20 — всё зависит от того, как распределились вероятности именно на этом шаге. За счёт этого метод адаптируется к контексту и помогает отсекать «хвост» маловероятных токенов, делая текст более естественным.

**Ещё один пример.** Например, модель продолжает фразу «На завтрак он выпил горячий…». Среди наиболее вероятных продолжений могут быть: «чай» (0.50), «кофе» (0.30), «шоколад» (0.08), «бульон» (0.04), «кефир» (0.03). Если задан порог $p = 0.80$, алгоритм начинает суммировать вероятности сверху вниз: 0.50 для «чая», затем 0.50 + 0.30 = 0.80. Порог уже достигнут, значит ядро состоит только из двух токенов: «чай» и «кофе». Все остальные варианты отбрасываются. После перенормировки вероятность «чая» внутри ядра становится $0.50/0.80 = 62.5\%$, а вероятность «кофе» — $0.30/0.80 = 37.5\%$. Следующий токен выбирается только между этими двумя вариантами.

**Иными словами,** модель сначала убирает маловероятные и неудачные продолжения, а потом выбирает из оставшихся. Это помогает ей писать более понятно, естественно и без лишнего «шума».

## Концепция

Основная идея Top‑p — на каждом шаге выбирать **наименьшее** множество наиболее вероятных токенов, чья суммарная вероятность не меньше заданного порога $p$ (*ядро*, англ. *nucleus*).

Формально, пусть $x_{(1)},x_{(2)},\ldots$ — токены словаря $V$, отсортированные по убыванию условной вероятности $P(x \mid x_{1:i - 1})$. Тогда ядро $V^{(p)}$ определяется как кратчайший префикс этой упорядоченной последовательности, чья кумулятивная масса достигает порога:

$m = \min\left\{ n:\sum\limits_{j = 1}^{n}P\left( x_{(j)} \mid x_{1:i - 1} \right) \geq p \right\},\qquad V^{(p)} = \left\{ x_{(1)},\,\ldots,\, x_{(m)} \right\}.$

Иными словами, это **наименьшее по включению множество самых вероятных токенов**, суммарная вероятность которых не меньше $p$.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

После определения ядра вероятности токенов вне $V^{(p)}$ обнуляются, а внутри ядра — перенормируются (делятся на фактическую кумулятивную массу $p^{\prime} = \sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1})$, так что сумма становится равной 1). Следующий токен сэмплируется из этого усечённого и перенормированного распределения.

### Динамическая адаптация

- При «остром» распределении (модель уверена) ядро мало: несколько токенов уже дают массу ≥ $p$, что повышает связность. В предельном случае, если вероятность самого вероятного токена уже превышает $p$ (например, $P(x_{(1)}) = 0.96$ при $p = 0.95$), ядро сужается до единственного токена и Top‑p фактически превращается в жадное декодирование (greedy search).
- При «плоском» распределении (много правдоподобных продолжений) ядро велико: выбор расширяется, растёт разнообразие.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

## Сравнение с другими методами декодирования

### Top‑p vs. Top‑k

- **Top‑k** всегда выбирает из фиксированного числа $k$ наиболее вероятных токенов. В «острых» распределениях это может добавлять лишние маловероятные варианты «для количества», а в «плоских» — наоборот, отсекать разумные продолжения, не попавшие в топ‑$k$.
- **Top‑p** подстраивает размер множества кандидатов по данным шага, что делает поведение более гибким и стабильным на разных типах распределений.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>
- На практике Top‑k и Top‑p могут применяться **одновременно**. В этом случае сначала отбирается топ‑$k$ токенов, а затем внутри этого ограниченного множества ищется ядро с порогом $p$. Точный порядок и мотивация зависят от реализации, но такая комбинация документирована как распространённый приём.<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)</sup>

**Проще говоря,** [Top-k](https://systems-analysis.info/wiki/Top-k "Top-k") заранее решает, сколько вариантов оставить, а Top-p смотрит по ситуации и оставляет столько, сколько нужно в данном контексте. Поэтому Top-p обычно гибче, а Top-k — проще и предсказуемее.

### Top‑p vs. Температура

- **Температура** (*temperature*) перепрофилирует всю форму распределения (делает его более острым или гладким), но **не отсекает** токены: даже маловероятные варианты сохраняют ненулевой шанс.<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)</sup>
- **Top‑p** вводит **жёсткое усечение хвоста** распределения — низковероятные токены полностью исключаются из сэмплирования, что помогает предотвращать явно неуместные продолжения.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>
- **Порядок применения.** В стандартных пайплайнах (например, в Hugging Face Transformers) сначала к логитам применяется температура (меняется форма распределения), затем может применяться Top‑k, и только потом Top‑p (усечение хвоста). Это объясняет, почему «двойное воздействие» трудно контролировать: изменение температуры меняет саму кумулятивную массу, с которой затем работает Top‑p.<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)</sup>

**Проще говоря,** температура меняет, **насколько свободно** модель выбирает слова, а Top-p решает, **какие варианты вообще можно выбирать**. Поэтому температура влияет на степень случайности, а Top-p — на то, насколько далеко модель может зайти в менее вероятные продолжения.

### Порядок операций в реализации Hugging Face Transformers

Порядок применения sampling-процессоров зависит от конкретной библиотеки. В Hugging Face Transformers (начиная с v4.x) для обсуждаемой тройки параметров логит-процессоры по умолчанию добавляются в следующей последовательности:<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)[\[6\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-code-6)</sup>

1.  **Температурное масштабирование логитов.** Логит каждого токена делится на значение температуры перед экспоненцированием функции Softmax. Температура модифицирует форму распределения, подготавливая его к последующей фильтрации.
2.  **Фильтр Top‑k** (если сконфигурирован): обрезает словарь до фиксированного количества претендентов.
3.  **Фильтр Top‑p**: к уже суженному пулу токенов применяется кумулятивное усечение.
4.  **Ренормализация** оставшихся вероятностей и стохастическое сэмплирование.

На практике распространена комбинация умеренной температуры (0.7) с широким ядром Top‑p (0.95) и лимитом Top‑k (50): температура обеспечивает базовую вариативность, Top‑k работает как грубый предохранитель, а Top‑p выполняет контекстно‑зависимую микронастройку.<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)</sup>

**Проще говоря,** модель сначала делает выбор более или менее «свободным» с помощью температуры, потом при необходимости ограничивает число кандидатов через Top-k, а затем убирает слишком слабые варианты через Top-p. Такой порядок помогает сначала настроить общий характер выбора, а потом отсечь лишнее.

### Рекомендация: настройка одного параметра за раз

Провайдеры моделей рекомендуют при настройке стиля генерации изменять **либо** *temperature*, **либо** *top_p*, но не оба одновременно. Эта рекомендация содержится в официальной документации OpenAI, Azure OpenAI и Anthropic.<sup>[\[7\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-top-p-7)[\[8\]](https://systems-analysis.info/wiki/Top-p#cite_note-azure-rec-8)[\[9\]](https://systems-analysis.info/wiki/Top-p#cite_note-anthropic-params-9)</sup>

Практическое обоснование: оба параметра влияют на форму вероятностного распределения (температура изменяет крутизну кривой, а Top‑p устанавливает точку отсечения), поэтому одновременное их изменение затрудняет диагностику — невозможно определить, какой именно параметр привёл к улучшению или ухудшению выхода. Кроме того, при экстремально низких значениях обоих параметров (например, *Temperature ≈ 0* и *Top‑p ≈ 0.01*) ядро на практике сужается до одного токена, фактически превращая сэмплирование в жадный поиск.<sup>[\[7\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-top-p-7)</sup>

Ряд reasoning‑моделей дополнительно ограничивают настройку этих параметров на уровне API, что делает вопрос их совместного изменения неактуальным для таких моделей (см. раздел «Совместимость с библиотеками и API»).<sup>[\[7\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-top-p-7)</sup>

Распространённая инженерная эвристика: для задач, требующих высокой воспроизводимости, — использовать низкую температуру (вплоть до нуля); для творческих задач — оставлять температуру на базовом уровне (1.0) и регулировать вариативность параметром Top‑p, либо зафиксировать Top‑p на 1.0 и варьировать температуру. Конкретные рекомендации могут различаться у провайдеров.<sup>[\[7\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-top-p-7)[\[9\]](https://systems-analysis.info/wiki/Top-p#cite_note-anthropic-params-9)</sup>

## Влияние на фактологичность и галлюцинации

Выбор стратегии декодирования может влиять не только на стилистику генерируемого текста, но и на частоту и тип фактологических ошибок. Феномен **галлюцинаций** — уверенной генерации ложной или противоречащей контексту информации — является одной из центральных проблем генеративного ИИ. Эмпирические исследования показывают, что эффект стратегий сэмплирования на галлюцинации зависит от задачи, модели и конкретной настройки параметров.<sup>[\[3\]](https://systems-analysis.info/wiki/Top-p#cite_note-arxiv-hall-3)[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)</sup>

### Механизм возникновения ошибок при стохастическом сэмплировании

При высоких значениях Top‑p (например, 0.95) модель формирует ядро, охватывающее 95% вероятностной массы. В состояниях высокой энтропии (например, при попытке ответить на малоизвестный факт) это ядро может включать сотни низковероятных токенов. Стохастическое сэмплирование в таких условиях способно извлечь токен, грамматически корректный, но семантически не связанный с фактологической истиной. Оказавшись в контексте, такой токен может повлиять на последующие шаги генерации, поскольку модель продолжает генерацию с учётом всех предыдущих токенов, включая ошибочные.<sup>[\[3\]](https://systems-analysis.info/wiki/Top-p#cite_note-arxiv-hall-3)[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)</sup>

### Дихотомия открытых и закрытых задач

Масштабные эксперименты выявляют зависимость качества генерации от типа задачи. В задачах написания эссе или диалоговых системах стохастические методы (Top‑p, Temperature) остаются лидерами, тогда как в строго детерминированных доменах они могут значительно уступать детерминированным подходам.<sup>[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)</sup>

На бенчмарках синтеза программного кода (HumanEval, MBPP) и решения математических задач (GSM8K) детерминированные методы (Beam Search, Greedy Decoding) показывают лучшие результаты по сравнению с подходами на базе Top‑p. Датасет GSM8K, включающий 8,5 тысяч математических задач, требующих от 2 до 8 шагов вычислений, иллюстрирует уязвимость стохастического выбора в таких задачах: инъекция случайности через усечённое распределение Top‑p может нарушить цепочку рассуждений модели (Chain‑of‑Thought) на любом из промежуточных шагов. Tan и соавт. подчёркивают, что эффективность метода декодирования сильно зависит от конкретной задачи (*task‑dependent*).<sup>[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)</sup>

### Методы борьбы с галлюцинациями на уровне декодирования

Для борьбы с галлюцинаторными эффектами, спровоцированными стохастическим сэмплированием, разработаны методы продвинутой аугментации декодирования:

- **Контрастное декодирование** (*Contrastive Decoding*, DoLa) — оптимизирует разрыв в логарифмическом правдоподобии между основной моделью и меньшей вспомогательной моделью, выступая в роли фильтра достоверности.<sup>[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)</sup>
- **SH2** (*Self‑Highlighted Hesitation*) — искусственно заставляет декодер «колебаться» при работе с низкоуверенными токенами.<sup>[\[11\]](https://systems-analysis.info/wiki/Top-p#cite_note-illusion-insight-11)</sup>
- **Направленное проецирование активаций** (SEA) — подавляет галлюцинаторные сигналы на уровне векторных представлений.<sup>[\[11\]](https://systems-analysis.info/wiki/Top-p#cite_note-illusion-insight-11)</sup>

При этом современные модели с качественным выравниванием (*alignment*) обладают более глубоким пониманием фактологии, что снижает энтропию их внутренних распределений и делает их менее подверженными деградации фактов даже при высоких значениях Top‑p.<sup>[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)[\[12\]](https://systems-analysis.info/wiki/Top-p#cite_note-frontiers-hall-12)</sup>

## Практическое применение и рекомендации

Top‑p широко используется в современных LLM благодаря сочетанию гибкости и управляемости.

- **Типичный диапазон значений.** На практике часто применяют $p \approx 0.90\text{–}0.95$. Значение по умолчанию различается у провайдеров: у OpenAI \`top_p\` = **1.0** (усечение фактически отключено), у Anthropic — **0.99**, у многих моделей Google [Gemini](https://systems-analysis.info/wiki/Gemini "Gemini") — **0.95**.<sup>[\[13\]](https://systems-analysis.info/wiki/Top-p#cite_note-anthropic-release-13)</sup> В библиотеке Hugging Face Transformers фреймворковый default также равен **1.0**, хотя отдельные модели могут переопределять его в своём \`generation_config.json\`.<sup>[\[14\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-genconfig-14)</sup> Таким образом, 0.9–0.95 — это распространённый **рекомендуемый практический диапазон**, но не универсальный стандарт по умолчанию.<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)[\[15\]](https://systems-analysis.info/wiki/Top-p#cite_note-vertex-params-15)</sup>
  - Значения, близкие к 1.0 (например, 0.98–0.99), увеличивают разнообразие: в ядро попадает больше токенов.
  - Малые значения (например, 0.80–0.90) повышают детерминированность и «сдержанность» вывода.
  - При $p = 1$ усечение по Top‑p исчезает: выбор ведётся по всему словарю (с учётом температуры и других фильтров декодирования, если они включены).<sup>[\[5\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-gen-5)</sup>

<!-- -->

- **Совместимость с библиотеками и API.**
  - В Hugging Face Transformers реализован *TopPLogitsWarper*, где дополнительно используется порог \`min_tokens_to_keep\` (по умолчанию 1). Это защитная деталь реализации: при стандартных значениях $p \in (0,\, 1\rbrack$ пустое ядро и так не возникает из определения, однако параметр гарантирует корректную работу в граничных случаях.<sup>[\[16\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-warp-16)</sup>
  - В ряде API параметр \`top_p\` доступен, тогда как \`top_k\` может отсутствовать; поддержка параметров и их семантика **зависят от конкретной модели и режима работы**. Reasoning‑модели, как правило, ограничивают настройку стохастики на уровне API. Например, в актуальной документации OpenAI параметры \`temperature\` и \`top_p\` явно поддерживаются только у [GPT](https://systems-analysis.info/wiki/GPT "GPT")‑5.2 при \`reasoning.effort = none\`; запросы к GPT‑5.2 или GPT‑5.1 с иными значениями \`reasoning\`, а также к более ранним моделям GPT‑5 (\`gpt‑5\`, \`gpt‑5‑mini\`, \`gpt‑5‑nano\`) при передаче этих полей вызывают ошибку. Reasoning‑модели предыдущих поколений (o1, o3) также ограничивают или фиксируют их.<sup>[\[7\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-top-p-7)[\[17\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-reasoning-17)[\[18\]](https://systems-analysis.info/wiki/Top-p#cite_note-openai-gpt52-18)</sup> У Anthropic в [Claude](https://systems-analysis.info/wiki/Claude "Claude") API при включённом расширенном мышлении (extended thinking) изменение \`temperature\` и \`top_k\` запрещено, однако \`top_p\` разрешён в диапазоне 0.95–1.0; на сторонних платформах (например, Amazon Bedrock) ограничения могут отличаться.<sup>[\[19\]](https://systems-analysis.info/wiki/Top-p#cite_note-anthropic-thinking-19)</sup> **Ограничения провайдеров часто меняются от версии к версии**; рекомендуется сверяться с актуальной документацией.<sup>[\[8\]](https://systems-analysis.info/wiki/Top-p#cite_note-azure-rec-8)[\[20\]](https://systems-analysis.info/wiki/Top-p#cite_note-azure-reasoning-20)</sup>

<!-- -->

- **Длинные тексты и повторяемость.** В серии экспериментов показано, что nucleus sampling снижает склонность к вырождению (повторы, штампованные фразы) по сравнению с greedy/beam и фиксированным Top‑k, особенно на длинных последовательностях.<sup>[\[1\]](https://systems-analysis.info/wiki/Top-p#cite_note-holtzman2019-1)[\[10\]](https://systems-analysis.info/wiki/Top-p#cite_note-tan2024-10)</sup>

## Современные альтернативы

После публикации nucleus sampling в 2019 году было предложено несколько альтернативных методов стохастического декодирования, развивающих или дополняющих идею Top‑p:

### Min‑p сэмплирование

**Min‑p сэмплирование** (Nguyen et al., 2024) оставляет токены, чья вероятность не ниже $p_{\min} \times P(x_{(1)})$, то есть задаёт порог относительно самого вероятного токена. Принят к устному докладу на ICLR 2025; реализован в ряде популярных фреймворков, включая Hugging Face Transformers<sup>[\[21\]](https://systems-analysis.info/wiki/Top-p#cite_note-hf-minp-21)</sup> и vLLM<sup>[\[22\]](https://systems-analysis.info/wiki/Top-p#cite_note-vllm-minp-22)</sup>.<sup>[\[23\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-23)</sup>

Ключевое отличие от Top‑p состоит в типе порога: Top‑p использует **абсолютный** порог на основе кумулятивной суммы вероятностей, тогда как Min‑p устанавливает **относительный** порог, масштабируемый от вероятности самого вероятного токена.<sup>[\[23\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-23)</sup>

Математически алгоритм работает следующим образом: на каждом шаге определяется максимальная вероятность $P_{\max} = P(x_{(1)} \mid x_{1:i - 1})$, затем вычисляется масштабированный порог $P_{\text{threshold}} = p_{\min} \times P_{\max}$. В финальный пул попадают только токены, индивидуальная вероятность которых превышает этот порог.<sup>[\[24\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-arxiv-24)</sup>

Это обеспечивает адаптивность: если модель уверена в следующем слове ($P_{\max} = 0.9$), при базовом $p_{\min} = 0.1$ порог составит 0.09, жёстко отсекая шумовые токены. Если же модель неуверена ($P_{\max} = 0.1$), порог снижается до 0.01, впуская в ядро широкое разнообразие кандидатов.<sup>[\[23\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-23)</sup>

Известная слабость Top‑p проявляется при высокотемпературном сэмплировании ($T > 1.0$): когда распределение искусственно сглаживается, Top‑p вынужден включать в ядро большое количество низковероятных токенов для достижения заданной кумулятивной суммы, что может приводить к деградации связности.<sup>[\[23\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-23)</sup> Min‑p лучше справляется с такими условиями. В экспериментах авторов на бенчмарках научных и логических знаний (GPQA) с использованием модели Mistral Large при экстремальной температуре $T = 3.0$ алгоритм Min‑p показал точность 13.84%, тогда как стандартный Top‑p 0.9 дал результат 0.89% — на уровне случайного шума.<sup>[\[24\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-arxiv-24)</sup>

При этом в академической среде ведётся дискуссия: некоторые критические работы (например, <a href="https://arxiv.org/abs/2506.13681" class="external text" rel="nofollow">arXiv:2506.13681</a>) подвергают сомнению универсальность преимуществ Min‑p по всем NLP‑метрикам, указывая на необходимость дальнейшего изучения.<sup>[\[25\]](https://systems-analysis.info/wiki/Top-p#cite_note-minp-critique-25)</sup>

**Проще говоря,** Min-p сравнивает все варианты не с общей суммой вероятностей, а с самым сильным вариантом на текущем шаге. Поэтому, если модель уверена, он жёстче убирает слабые продолжения, а если не уверена — оставляет больше допустимых вариантов. За счёт этого Min-p может лучше сохранять баланс между связностью и разнообразием, особенно там, где Top-p начинает пропускать слишком много слабых слов.

### Locally typical sampling

**Locally typical sampling** (Meister и соавт., 2023) выбирает токены, чья информационная нагрузка ($- \log P$) близка к условной энтропии, опираясь на теоретико‑информационное понятие типичности.<sup>[\[2\]](https://systems-analysis.info/wiki/Top-p#cite_note-meister2023-2)</sup>

В отличие от Top‑p, который стремится минимизировать размер ядра, выбирая токены с максимальной вероятностью, Locally Typical Sampling решает задачу оптимизации на основе метрики информационного расстояния. Алгоритм вычисляет информационное содержание каждого токена ($- \log P(x)$) и измеряет его абсолютное расстояние до условной энтропии $H$ модели. Токены ранжируются не по сырой вероятности, а по степени их «информационной типичности» — близости к ожидаемому информационному содержанию контекста. Токены добавляются в ядро (в порядке возрастания расстояния до энтропии) до достижения порога кумулятивной вероятности.<sup>[\[2\]](https://systems-analysis.info/wiki/Top-p#cite_note-meister2023-2)[\[26\]](https://systems-analysis.info/wiki/Top-p#cite_note-typical-mit-26)</sup>

Следствие этого подхода: в состояниях высокой энтропии алгоритм целенаправленно исключает не только шумовой маловероятный хвост, но и излишне высоковероятные слова, которые несут слишком мало информации и делают текст банальным. Это снижает риск дегенеративных зацикливаний и приближает метрики повторяемости текста к показателям, характерным для текстов, написанных человеком.<sup>[\[26\]](https://systems-analysis.info/wiki/Top-p#cite_note-typical-mit-26)</sup>

### Tail Free Sampling (TFS)

**Tail Free Sampling** (TFS) — менее формализованный, но практически интересный подход к выявлению шумового хвоста, основанный на дифференциальном анализе вероятностного пространства. Если Top‑p и Min‑p оперируют вероятностями первого порядка (кумулятивной суммой и базовыми дробями), то TFS анализирует **первую и вторую производные** отсортированной кривой вероятностей. Метод описан в блоге Трентона Брикена и реализован в ряде inference-движков, хотя не был опубликован в виде рецензированной статьи.<sup>[\[27\]](https://systems-analysis.info/wiki/Top-p#cite_note-tfs-bricken-27)</sup>

Основной постулат TFS: включение даже одного шумового токена в выборку несёт экспоненциальную угрозу для всей авторегрессионной генерации. Вычисляя вторую производную от значений вероятностей, алгоритм локализует «плато» — участки кривой, где падение вероятностей замедляется и переходит в длинный пологий хвост. Точка этого перегиба становится динамической границей усечения: токены до неё признаются семантически безопасными, а весь хвост удаляется.<sup>[\[27\]](https://systems-analysis.info/wiki/Top-p#cite_note-tfs-bricken-27)</sup>

Несмотря на математическую элегантность, TFS требует более интенсивных вычислительных затрат на вычисление производных в реальном времени, из‑за чего в массовых коммерческих продуктах он уступает более легковесным алгоритмам.<sup>[\[27\]](https://systems-analysis.info/wiki/Top-p#cite_note-tfs-bricken-27)</sup>

### *p*‑less sampling

**$p$‑less sampling** — метод, полностью избавляющий инженера от необходимости настраивать гиперпараметры усечения.<sup>[\[28\]](https://systems-analysis.info/wiki/Top-p#cite_note-pless-openreview-28)</sup> Фундаментальная проблема всех предшествующих методов — от Top‑k и Top‑p до Min‑p — заключается в зависимости от статичных гиперпараметров, значения которых требуют экспертной настройки и могут быть оптимальны для одной задачи (креативное письмо), но неудачны для другой (программирование).<sup>[\[29\]](https://systems-analysis.info/wiki/Top-p#cite_note-pless-arxiv-29)</sup>

Алгоритм $p$‑less, укоренённый в теории информации, динамически генерирует уникальный порог усечения на каждом шаге декодирования, анализируя внутреннюю топологию всего распределения вероятностей в реальном времени. Авторы сообщают об устойчивости метода к температурным флуктуациям (*temperature robustness*): при повышении температуры традиционные методы могут существенно деградировать, тогда как $p$‑less сохраняет стабильность качества. Кроме того, благодаря отказу от логики кумулятивного сканирования и ренормализации больших ядер, метод, по данным авторов, обеспечивает более высокую вычислительную эффективность на этапе инференса и генерирует более компактные ответы без потери точности на датасетах по математике, логике и креативному письму.<sup>[\[29\]](https://systems-analysis.info/wiki/Top-p#cite_note-pless-arxiv-29)[\[28\]](https://systems-analysis.info/wiki/Top-p#cite_note-pless-openreview-28)</sup>

### η‑сэмплирование

**η‑сэмплирование** (Hewitt et al., 2022) использует энтропийно‑зависимый порог вероятности, адаптируясь к низкоэнтропийным контекстам, где Top‑p может усекать излишне.<sup>[\[30\]](https://systems-analysis.info/wiki/Top-p#cite_note-eta-30)</sup>

## См. также

- [Температура](https://systems-analysis.info/wiki/%D0%A2%D0%B5%D0%BC%D0%BF%D0%B5%D1%80%D0%B0%D1%82%D1%83%D1%80%D0%B0_(LLM) "Температура (LLM)")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")

## Литература

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; опубликовано на ICLR 2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Fan, A., Lewis, M., & Dauphin, Y. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). *Conformal Nucleus Sampling*. <a href="https://aclanthology.org/2023.findings-acl.3.pdf" class="external text" rel="nofollow">ACL Findings 2023</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/2310.01693" class="external text" rel="nofollow">arXiv:2310.01693</a>.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies*. <a href="https://arxiv.org/abs/2410.03968" class="external text" rel="nofollow">arXiv:2410.03968</a>.
- Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/abs/2407.01082" class="external text" rel="nofollow">arXiv:2407.01082</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.
- Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[32]</a>.
- *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. <a href="https://arxiv.org/abs/2509.23234" class="external text" rel="nofollow">arXiv:2509.23234</a>.

## Примечания

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/Top-p#cite_ref-holtzman2019_1-10)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-meister2023-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Top-p#cite_ref-meister2023_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Top-p#cite_ref-meister2023_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/Top-p#cite_ref-meister2023_2-2)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *TACL*, Vol. 11. arXiv:2202.00666. <a href="https://aclanthology.org/2023.tacl-1.7.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-hall-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/Top-p#cite_ref-arxiv-hall_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/Top-p#cite_ref-arxiv-hall_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/Top-p#cite_ref-arxiv-hall_3-2)</sup> *Large Language Models Hallucination: A Comprehensive Survey*. arXiv:2510.06265. <a href="https://arxiv.org/abs/2510.06265" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-finlayson2024-4">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-finlayson2024_4-0) Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-hf-gen-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-1)</sup> <sup>[5,2](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-2)</sup> <sup>[5,3](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-3)</sup> <sup>[5,4](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-4)</sup> <sup>[5,5](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-5)</sup> <sup>[5,6](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-gen_5-6)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf-code-6">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-code_6-0) Hugging Face Transformers. *generation/utils.py* (исходный код). <a href="https://github.com/huggingface/transformers/blob/main/src/transformers/generation/utils.py" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-top-p-7">↑ <sup>[7,0](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-top-p_7-0)</sup> <sup>[7,1](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-top-p_7-1)</sup> <sup>[7,2](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-top-p_7-2)</sup> <sup>[7,3](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-top-p_7-3)</sup> <sup>[7,4](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-top-p_7-4)</sup> OpenAI API Reference. *top_p* — рекомендация «We generally recommend altering this or temperature but not both». <a href="https://developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-azure-rec-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/Top-p#cite_ref-azure-rec_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/Top-p#cite_ref-azure-rec_8-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/reference" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-anthropic-params-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/Top-p#cite_ref-anthropic-params_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/Top-p#cite_ref-anthropic-params_9-1)</sup> Anthropic API Reference. *Messages API — top_p*. <a href="https://docs.anthropic.com/en/api/messages" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-tan2024-10">↑ <sup>[10,0](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-0)</sup> <sup>[10,1](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-1)</sup> <sup>[10,2](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-2)</sup> <sup>[10,3](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-3)</sup> <sup>[10,4](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-4)</sup> <sup>[10,5](https://systems-analysis.info/wiki/Top-p#cite_ref-tan2024_10-5)</sup> Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925. <a href="https://aclanthology.org/2024.emnlp-main.489.pdf" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-illusion-insight-11">↑ <sup>[11,0](https://systems-analysis.info/wiki/Top-p#cite_ref-illusion-insight_11-0)</sup> <sup>[11,1](https://systems-analysis.info/wiki/Top-p#cite_ref-illusion-insight_11-1)</sup> *From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs*. MDPI. <a href="https://www.mdpi.com/2673-2688/6/10/260" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-frontiers-hall-12">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-frontiers-hall_12-0) *Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior*. Frontiers in AI. <a href="https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1622292/full" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-anthropic-release-13">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-anthropic-release_13-0) Anthropic. *API release notes*. <a href="https://docs.anthropic.com/en/release-notes/api" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-hf-genconfig-14">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-genconfig_14-0) Hugging Face. *GenerationConfig (top_p default)*. <a href="https://huggingface.co/docs/transformers/main_classes/text_generation" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-vertex-params-15">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-vertex-params_15-0) Google AI / Vertex AI. *Content generation parameters (topP/topK)*. <a href="https://ai.google.dev/gemini-api/docs/prompting-strategies" class="external autonumber" rel="nofollow">[15]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/multimodal/content-generation-parameters" class="external autonumber" rel="nofollow">[16]</a></span>
16. <span id="cite_note-hf-warp-16">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-warp_16-0) Transformers API. *TopPLogitsWarper* (параметры и поведение, включая \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-openai-reasoning-17">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-reasoning_17-0) OpenAI API. *Using reasoning models — parameter support*. <a href="https://developers.openai.com/docs/guides/reasoning" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-openai-gpt52-18">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-openai-gpt52_18-0) OpenAI API. *Using GPT-5.2*. <a href="https://developers.openai.com/api/docs/guides/latest-model/" class="external autonumber" rel="nofollow">[19]</a></span>
19. <span id="cite_note-anthropic-thinking-19">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-anthropic-thinking_19-0) Anthropic. *Building with extended thinking*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking" class="external autonumber" rel="nofollow">[20]</a></span>
20. <span id="cite_note-azure-reasoning-20">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-azure-reasoning_20-0) Microsoft Learn (Azure AI Foundry). *Reasoning models — supported parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/reasoning" class="external autonumber" rel="nofollow">[21]</a></span>
21. <span id="cite_note-hf-minp-21">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-hf-minp_21-0) Hugging Face Transformers. *MinPLogitsWarper*. <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.MinPLogitsWarper" class="external autonumber" rel="nofollow">[22]</a></span>
22. <span id="cite_note-vllm-minp-22">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-vllm-minp_22-0) vLLM. *Sampling Parameters — min_p*. <a href="https://docs.vllm.ai/en/latest/serving/sampling_params.html" class="external autonumber" rel="nofollow">[23]</a></span>
23. <span id="cite_note-minp-23">↑ <sup>[23,0](https://systems-analysis.info/wiki/Top-p#cite_ref-minp_23-0)</sup> <sup>[23,1](https://systems-analysis.info/wiki/Top-p#cite_ref-minp_23-1)</sup> <sup>[23,2](https://systems-analysis.info/wiki/Top-p#cite_ref-minp_23-2)</sup> <sup>[23,3](https://systems-analysis.info/wiki/Top-p#cite_ref-minp_23-3)</sup> Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082. <a href="https://arxiv.org/abs/2407.01082" class="external autonumber" rel="nofollow">[24]</a></span>
24. <span id="cite_note-minp-arxiv-24">↑ <sup>[24,0](https://systems-analysis.info/wiki/Top-p#cite_ref-minp-arxiv_24-0)</sup> <sup>[24,1](https://systems-analysis.info/wiki/Top-p#cite_ref-minp-arxiv_24-1)</sup> Nguyen, M. et al. *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/pdf/2407.01082" class="external autonumber" rel="nofollow">[25]</a></span>
25. <span id="cite_note-minp-critique-25">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-minp-critique_25-0) *Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models*. arXiv:2506.13681. <a href="https://arxiv.org/abs/2506.13681" class="external autonumber" rel="nofollow">[26]</a></span>
26. <span id="cite_note-typical-mit-26">↑ <sup>[26,0](https://systems-analysis.info/wiki/Top-p#cite_ref-typical-mit_26-0)</sup> <sup>[26,1](https://systems-analysis.info/wiki/Top-p#cite_ref-typical-mit_26-1)</sup> *Locally Typical Sampling*. Transactions of the ACL, MIT Press. <a href="https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00536/114593/Locally-Typical-Sampling" class="external autonumber" rel="nofollow">[27]</a></span>
27. <span id="cite_note-tfs-bricken-27">↑ <sup>[27,0](https://systems-analysis.info/wiki/Top-p#cite_ref-tfs-bricken_27-0)</sup> <sup>[27,1](https://systems-analysis.info/wiki/Top-p#cite_ref-tfs-bricken_27-1)</sup> <sup>[27,2](https://systems-analysis.info/wiki/Top-p#cite_ref-tfs-bricken_27-2)</sup> Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[28]</a></span>
28. <span id="cite_note-pless-openreview-28">↑ <sup>[28,0](https://systems-analysis.info/wiki/Top-p#cite_ref-pless-openreview_28-0)</sup> <sup>[28,1](https://systems-analysis.info/wiki/Top-p#cite_ref-pless-openreview_28-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. OpenReview. <a href="https://openreview.net/forum?id=ItFuNJQGH4" class="external autonumber" rel="nofollow">[29]</a></span>
29. <span id="cite_note-pless-arxiv-29">↑ <sup>[29,0](https://systems-analysis.info/wiki/Top-p#cite_ref-pless-arxiv_29-0)</sup> <sup>[29,1](https://systems-analysis.info/wiki/Top-p#cite_ref-pless-arxiv_29-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234. <a href="https://arxiv.org/abs/2509.23234" class="external autonumber" rel="nofollow">[30]</a></span>
30. <span id="cite_note-eta-30">[↑](https://systems-analysis.info/wiki/Top-p#cite_ref-eta_30-0) Hewitt, J., Manning, C. D., & Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. Findings of EMNLP 2022. arXiv:2210.15191. <a href="https://arxiv.org/abs/2210.15191" class="external autonumber" rel="nofollow">[31]</a></span>
