---
title: "Top-p sampling (TL)"
source: "https://systems-analysis.info/int/Top-p_sampling_(TL)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(TL)"
language: "tl"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 8225
wiki_created_at: 2026-09-07T01:14:11Z
wiki_modified_at: 2026-09-07T01:14:11Z
downloaded_at: 2026-09-07T23:24:09Z
---

# Top-p sampling (TL)

**Top‑p sampling**, kilala rin bilang **nuclear sampling** (Ingles: *Nucleus Sampling*), — isang stochastic na paraan ng decoding para sa autoregressive na mga language model, malawakang ginagamit kabilang na sa malalaking language model (LLM). Iminungkahi ang pamamaraan noong 2019 ni Ari Holtzman at mga katuwang (preprint sa arXiv — Abril 2019; inilathala sa ICLR 2020) bilang isang pinahusay na alternatibo sa nakapirming Top‑k sampling. Ang ideya nito — dynamic na pagpili ng hanay ng mga kandidato sa bawat hakbang ng henerasyon batay sa threshold ng cumulative probability $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

## Makasaysayang Konteksto: Ang Problema ng Neural Text Degeneration

Bago lumabas ang Top‑p, ang mga nangingibabaw na estratehiya ng decoding ay ang **greedy search** (*greedy search*) at **beam search** (*beam search*), batay sa paradigma ng maximization ng likelihood — pagpili ng pagkakasunod-sunod ng mga token na may pinakamataas na kabuuang probabilidad. Ang greedy search sa bawat hakbang ay lokal na pumipili ng token na may pinakamataas na probabilidad, habang ang beam search ay sabay na sinusubaybayan ang ilang mga hypotheses ng henerasyon.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

Kahit na ang mga pamamaraang ito ay epektibo sa mga saradong gawain (machine translation, pagkuha ng datos), sa paglipat sa mga gawaing open-ended na henerasyon ng teksto (pagsulat ng mga kuwento, mga dialogue system) ay madalas itong humahantong sa **neural text degeneration** — pagkasira ng output, kung saan ang teksto ay nagiging paulit-ulit, nawawalan ng pagkakaugnay, o nagpapaikot sa mga ulitin. Ang penomenong ito ay detalyadong inilarawan ni Holtzman at mga katuwang sa akdang *The Curious Case of Neural Text Degeneration*.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

Iugnay ni Meister at mga katuwang ang problema ng degeneration sa katotohanang ang teksto ng tao ay nagsisikap na mapanatili ang informational na nilalaman na malapit sa inaasahang conditional entropy, sa halip na simpleng i-maximize ang lokal na probabilidad ng bawat susunod na token.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-meister2023-2)</sup>

Naging alternatibo ang **purong stochastic sampling** (*sampling without truncation*), kung saan ang token ay pinipili nang random ayon sa kanyang probabilidad. Gayunpaman, ang pamamaraang ito ay lumikha ng kabaligtaran na problema: ang Softmax function ay hindi kailanman nagtatalaga ng probabilidad na eksaktong katumbas ng zero sa isang token, kaya sa isang bokabularyo ng sampung libu-libong salita ay palaging may malawak na sona ng mga noise token. Sa purong sampling, tumataas ang panganib ng pagkahulog sa hindi mapagkakatiwalaang buntot ng distribusyon, na maaaring magpalala ng pagkakaugnay ng nabuong teksto.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-arxiv-hall-3)</sup> Ang pangangailangang pagsamahin ang kayamanan ng stochastic na pagpili at ang pagiging maaasahan ng mga deterministic na limitasyon ay humantong sa pagbuo ng mga pamamaraan ng truncation ng distribusyon, na ang pinakamahalagang kinatawan ay ang nucleus sampling (Top‑p).<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-finlayson2024-4)</sup>

## Simpleng Paliwanag

**Top-p sampling** — ito ay isang paraan ng paglilimita ng pagpili ng susunod na token sa mga **pinaka-malamang** na opsyon lamang, nang hindi nag-aayos ng kanilang bilang nang maaga.

Sa henerasyon ng teksto, ang language model sa bawat hakbang ay sinusuri ang maraming posibleng pagpapatuloy at nagbibigay sa bawat isa ng ilang probabilidad. Ang ilang mga token ay napaka-malamang, ang iba ay katamtamang malamang, at ang malaking bahagi ng bokabularyo ay bumubuo ng tinatawag na "buntot" ng distribusyon: mga opsyon na may napakaliit na probabilidad, na pormal na katanggap-tanggap, ngunit kadalasan ay random, hindi angkop, o nagpapababa ng pagkakaugnay ng teksto.

Ang Top-p sampling ay nagtatanggal ng malamang na buntot na ito **hindi sa pamamagitan ng nakapirming bilang ng mga token**, kundi sa pamamagitan ng **kabuuang probabilidad**. Una, ang lahat ng mga kandidato ay inayos mula sa pinakamalamang hanggang sa pinaka-hindi malamang. Pagkatapos, pinipili ang pinakamaliit na hanay ng mga nangungunang token na ang kabuuang probabilidad ay umabot sa itinakdang threshold $p$ — halimbawa, 0.9 o 0.95. Pagkatapos nito, ang susunod na token ay pinipili nang random mula lamang sa hanay na ito, at lahat ng iba pang opsyon ay tinatanggal.

Halimbawa, kung ang modelo ay nagpapatuloy ng parirala na "Ngayon sa labas ay may malakas na...", sa mga pinaka-malamang na opsyon maaaring maisama ang "ulan" (0.45), "malakas na ulan" (0.25), "niyebe" (0.15) at "hangin" (0.10). Sa threshold na $p = 0.90$, ang algorithm ay nagtatambak ng mga token sa pababang pagkakasunod ng probabilidad: 0.45 + 0.25 = 0.70 (mas mababa sa 0.90), idinaragdag ang "niyebe": 0.70 + 0.15 = 0.85 (mas mababa pa rin sa 0.90), idinaragdag ang "hangin": 0.85 + 0.10 = 0.95 (nalampasan na ang threshold). Ang nucleus ay nabuo mula sa apat na token. Lahat ng mas bihirang opsyon ay itinatapon, at ang mga probabilidad ng natitirang mga token ay ini-normalize: kaya, ang probabilidad ng token na "ulan" pagkatapos ng re-normalization ay magiging $0.45/0.95 \approx 47.4\%$, at ang generator ay pipili ng susunod na token mula sa na-update na distribusyon.

Ang pangunahing pagkakaiba mula sa Top‑k ay ang Top‑k ay palaging kumukuha ng **nakapirming bilang** ng pinakamahuhusay na salita (halimbawa, 50), habang ang Top‑p ay hindi nag-aayos ng bilang ng mga opsyon nang maaga: minsan ito ay maaaring 3 salita, minsan 20 — lahat ay depende sa kung paano ipinagkalat ang mga probabilidad sa partikular na hakbang na iyon. Dahil dito, ang pamamaraan ay umaangkop sa konteksto at tumutulong na alisin ang "buntot" ng mga hindi malamang na token, na ginagawang mas natural ang teksto.

**Isa pang halimbawa.** Halimbawa, ang modelo ay nagpapatuloy ng parirala na "Sa almusal ay uminom siya ng mainit na...". Sa mga pinaka-malamang na pagpapatuloy maaaring maisama: "tsaa" (0.50), "kape" (0.30), "tsokolate" (0.08), "sabaw" (0.04), "kefir" (0.03). Kung itinakda ang threshold na $p = 0.80$, ang algorithm ay nagsisimulang magdagdag ng mga probabilidad mula sa itaas pababa: 0.50 para sa "tsaa", pagkatapos ay 0.50 + 0.30 = 0.80. Naabot na ang threshold, ibig sabihin ang nucleus ay binubuo lamang ng dalawang token: "tsaa" at "kape". Lahat ng iba pang opsyon ay itinatapon. Pagkatapos ng re-normalization, ang probabilidad ng "tsaa" sa loob ng nucleus ay nagiging $0.50/0.80 = 62.5\%$, at ang probabilidad ng "kape" ay nagiging $0.30/0.80 = 37.5\%$. Ang susunod na token ay pinipili lamang sa pagitan ng dalawang opsyon na ito.

**Sa madaling salita,** una ay inaalis ng modelo ang mga hindi malamang at hindi magandang pagpapatuloy, at pagkatapos ay pumipili mula sa natitirang mga opsyon. Tinutulungan nito na sumulat ng mas malinaw, mas natural, at walang labis na "ingay".

## Konsepto

Ang pangunahing ideya ng Top‑p — sa bawat hakbang ay piliin ang **pinakamaliit** na hanay ng mga pinaka-malamang na token, na ang kabuuang probabilidad ay hindi bababa sa itinakdang threshold $p$ (*nucleus*).

Pormal, hayaan nating $x_{(1)},x_{(2)},\ldots$ — mga token ng bokabularyo $V$, na inayos sa pababang pagkakasunod ng conditional probability $P(x \mid x_{1:i - 1})$. Pagkatapos ang nucleus $V^{(p)}$ ay tinukoy bilang pinakamaikling prefix ng inayos na pagkakasunod na ito, na ang cumulative mass ay umabot sa threshold:

$m = \min\left\{ n:\sum\limits_{j = 1}^{n}P\left( x_{(j)} \mid x_{1:i - 1} \right) \geq p \right\},\qquad V^{(p)} = \left\{ x_{(1)},\,\ldots,\, x_{(m)} \right\}.$

Sa madaling salita, ito ay ang **pinakamaliit na hanay ng pinakamalamang na mga token ayon sa inclusion**, na ang kabuuang probabilidad ay hindi bababa sa $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

Pagkatapos matukoy ang nucleus, ang mga probabilidad ng mga token na wala sa $V^{(p)}$ ay ginagawang zero, at ang mga nasa loob ng nucleus ay ini-normalize (hinahati sa aktwal na cumulative mass $p^{\prime} = \sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1})$, upang ang kabuuan ay maging 1). Ang susunod na token ay sine-sample mula sa truncated at re-normalized na distribusyon.

### Dynamic na Adaptasyon

- Sa "matalas" na distribusyon (tiwala ang modelo) ang nucleus ay maliit: ilang token na lamang ang nagbibigay ng mass na ≥ $p$, na nagpapataas ng pagkakaugnay. Sa pinakamataas na kaso, kung ang probabilidad ng pinaka-malamang na token ay lumampas na sa $p$ (halimbawa, $P(x_{(1)}) = 0.96$ sa $p = 0.95$), ang nucleus ay kumikitid sa isang token lamang at ang Top‑p ay aktwal na nagiging greedy decoding.
- Sa "patag" na distribusyon (maraming makatwirang pagpapatuloy) ang nucleus ay malaki: napapalawig ang pagpili, lumalaki ang pagkakaiba-iba.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

## Paghahambing sa Iba Pang Paraan ng Decoding

### Top‑p kumpara sa Top‑k

- **Top‑k** ay palaging pumipili mula sa nakapirming bilang na $k$ ng mga pinaka-malamang na token. Sa "matalas" na mga distribusyon, maaari itong magdagdag ng mga karagdagang hindi malamang na opsyon "para sa bilang", at sa "patag" na mga distribusyon — kabaligtaran, nag-aalis ng makatwirang mga pagpapatuloy na hindi napasok sa top‑$k$.
- **Top‑p** ay inaangkop ang laki ng hanay ng mga kandidato batay sa datos ng hakbang, na ginagawang mas flexible at matatag ang gawi sa iba't ibang uri ng distribusyon.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>
- Sa praktika, ang Top‑k at Top‑p ay maaaring gamitin nang **sabay-sabay**. Sa kasong ito, unang pinipili ang top‑$k$ na mga token, at pagkatapos sa loob ng limitadong hanay na ito ay hinahanap ang nucleus na may threshold na $p$. Ang eksaktong pagkakasunod at motibasyon ay depende sa implementasyon, ngunit ang ganitong kombinasyon ay dokumentado bilang isang karaniwang pamamaraan.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)</sup>

**Sa simpleng salita,** ang Top-k ay nagpapasya nang maaga kung ilang opsyon ang itatabi, at ang Top-p ay tumitingin sa sitwasyon at nag-iiwan ng gaano karami ang kailangan sa kontextong iyon. Samakatuwid ang Top-p ay karaniwang mas flexible, at ang Top-k ay mas simple at mas mahuhulaan.

### Top‑p kumpara sa Temperatura

- **Temperatura** (*temperature*) ay nagbabago ng buong hugis ng distribusyon (ginagawa itong mas matalas o mas makinis), ngunit **hindi nagtatanggal** ng mga token: kahit ang mga hindi malamang na opsyon ay nagpapanatili ng hindi-zero na pagkakataon.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)</sup>
- **Top‑p** ay nagpapakilala ng **mahigpit na truncation ng buntot** ng distribusyon — ang mga mababang-probabilidad na token ay ganap na inalis mula sa sampling, na tumutulong na maiwasan ang malinaw na hindi angkop na mga pagpapatuloy.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>
- **Pagkakasunod ng aplikasyon.** Sa mga standard na pipeline (halimbawa, sa Hugging Face Transformers) ang temperatura ay unang inilalapat sa mga logit (binabago ang hugis ng distribusyon), pagkatapos ay maaaring ilapat ang Top‑k, at pagkatapos lamang ang Top‑p (truncation ng buntot). Ipinapaliwanag nito kung bakit mahirap kontrolin ang "dobleng epekto": ang pagbabago ng temperatura ay nagbabago ng mismong cumulative mass, na pagkatapos ay ginagamit ng Top‑p.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)</sup>

**Sa simpleng salita,** ang temperatura ay nagbabago ng **gaano kalaya** ang pagpili ng modelo ng mga salita, at ang Top-p ay nagpapasya, **anong mga opsyon ang maaaring piliin**. Samakatuwid ang temperatura ay nakakaimpluwensya sa antas ng randomness, at ang Top-p — sa kung gaano kalayo maaaring pumunta ang modelo sa mga hindi gaanong malamang na pagpapatuloy.

### Pagkakasunod ng mga Operasyon sa Implementasyon ng Hugging Face Transformers

Ang pagkakasunod ng aplikasyon ng mga sampling processor ay depende sa partikular na library. Sa Hugging Face Transformers (simula sa v4.x) para sa tatlong parameter na pinagtalunan, ang mga logit processor ay idinaragdag bilang default sa sumusunod na pagkakasunod:<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-code-6)</sup>

1.  **Temperatura scaling ng mga logit.** Ang logit ng bawat token ay hinahati sa halaga ng temperatura bago i-exponentiate ang Softmax function. Binabago ng temperatura ang hugis ng distribusyon, inihahanda ito para sa kasunod na filtering.
2.  **Top‑k filter** (kung naka-configure): pinuputol ang bokabularyo sa nakapirming bilang ng mga kandidato.
3.  **Top‑p filter**: ang cumulative truncation ay inilalapat sa nang pinahepang pool ng mga token.
4.  **Re-normalization** ng natitirang mga probabilidad at stochastic sampling.

Sa praktika, ang karaniwang kombinasyon ay katamtamang temperatura (0.7) na may malawak na Top‑p nucleus (0.95) at Top‑k limit (50): ang temperatura ay nagbibigay ng pangunahing pagkakaiba-iba, ang Top‑k ay gumaganap bilang magaspang na proteksyon, at ang Top‑p ay nagsasagawa ng context-dependent na fine-tuning.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)</sup>

**Sa simpleng salita,** una ang modelo ay ginagawang mas o hindi gaanong "malaya" ang pagpili sa tulong ng temperatura, pagkatapos kung kinakailangan ay nilimitahan ang bilang ng mga kandidato sa pamamagitan ng Top-k, at pagkatapos ay iniaalis ang masyadong mahinang mga opsyon sa pamamagitan ng Top-p. Ang ganitong pagkakasunod ay tumutulong na una ay i-configure ang pangkalahatang katangian ng pagpili, at pagkatapos ay alisin ang labis.

### Rekomendasyon: Pag-aayos ng Isang Parameter sa Isang Pagkakataon

Inirerekomenda ng mga provider ng modelo na sa pag-aayos ng istilo ng henerasyon, baguhin ang **alinman** sa *temperature* **o** *top_p*, ngunit hindi ang dalawa nang sabay-sabay. Ang rekomendasyon na ito ay nakapaloob sa opisyal na dokumentasyon ng OpenAI, Azure OpenAI, at Anthropic.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-top-p-7)[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-azure-rec-8)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-anthropic-params-9)</sup>

Praktikal na justipikasyon: ang parehong parameter ay nakakaimpluwensya sa hugis ng probability distribution (binabago ng temperatura ang steepness ng kurba, at ang Top‑p ay nagtatakda ng punto ng truncation), kaya ang sabay na pagbabago ng dalawa ay nagpapahirap sa diagnosis — imposibleng matukoy kung aling parameter ang nagdulot ng pagpapabuti o pagkasama ng output. Bukod pa rito, sa mga matinding mababang halaga ng parehong parameter (halimbawa, *Temperature ≈ 0* at *Top‑p ≈ 0.01*) ang nucleus sa praktika ay kumikitid sa isang token, na aktwal na ginagawang greedy search ang sampling.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-top-p-7)</sup>

Ilang reasoning‑model ay karagdagang nililimitahan ang pag-aayos ng mga parameter na ito sa antas ng API, na ginagawang hindi na napapanahon ang isyu ng kanilang sabay na pagbabago para sa gayong mga modelo (tingnan ang seksyong "Compatibility sa mga Library at API").<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-top-p-7)</sup>

Karaniwang engineering heuristic: para sa mga gawaing nangangailangan ng mataas na reproducibility — gumamit ng mababang temperatura (hanggang sa zero); para sa mga malikhaing gawain — iwanan ang temperatura sa base level (1.0) at i-regulate ang pagkakaiba-iba sa pamamagitan ng parameter na Top‑p, o i-fix ang Top‑p sa 1.0 at baguhin ang temperatura. Ang mga tiyak na rekomendasyon ay maaaring mag-iba sa iba't ibang provider.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-top-p-7)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-anthropic-params-9)</sup>

## Epekto sa Katotohanan at Hallucination

Ang pagpili ng estratehiya ng decoding ay maaaring makaapekto hindi lamang sa istilo ng nabuong teksto, kundi pati na rin sa dalas at uri ng mga factual na pagkakamali. Ang penomenong **hallucination** — tiwala na henerasyon ng maling o magkasalungat sa konteksto na impormasyon — ay isa sa mga sentral na problema ng generative AI. Ipinapakita ng mga empirical na pag-aaral na ang epekto ng mga estratehiya ng sampling sa hallucination ay depende sa gawain, modelo, at tiyak na setting ng parameter.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-arxiv-hall-3)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)</sup>

### Mekanismo ng Pagkakamali sa Stochastic Sampling

Sa mataas na halaga ng Top‑p (halimbawa, 0.95) ang modelo ay bumubuo ng nucleus na sumasaklaw sa 95% ng probability mass. Sa mga estado ng mataas na entropy (halimbawa, kapag sinusubukang sagutin ang isang hindi gaanong kilalang katotohanan) ang nucleus na ito ay maaaring magsama ng daan-daang mababang-probabilidad na token. Ang stochastic sampling sa ganitong mga kondisyon ay maaaring kumuha ng token na grammatically tama ngunit semantically hindi konektado sa factual na katotohanan. Kapag nandoon na sa konteksto, ang token na iyon ay maaaring makaapekto sa mga kasunod na hakbang ng henerasyon, dahil ang modelo ay nagpapatuloy ng henerasyon na isinasaalang-alang ang lahat ng nakaraang token, kabilang ang mga may pagkakamali.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-arxiv-hall-3)[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)</sup>

### Dychotomy ng mga Bukas at Saradong Gawain

Ang malalaking eksperimento ay nagpapakita ng pag-asa ng kalidad ng henerasyon sa uri ng gawain. Sa mga gawaing pagsulat ng sanaysay o mga dialogue system, ang mga stochastic na paraan (Top‑p, Temperatura) ay nananatiling mga lider, habang sa mga mahigpit na deterministic na domain ay maaari silang malaking mahuli sa mga deterministic na pamamaraan.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)</sup>

Sa mga benchmark ng code synthesis (HumanEval, MBPP) at paglutas ng mga mathematical na problema (GSM8K) ang mga deterministic na paraan (Beam Search, Greedy Decoding) ay nagpapakita ng mas magagandang resulta kumpara sa mga pamamaraan batay sa Top‑p. Ang dataset ng GSM8K, na kinabibilangan ng 8,500 na mathematical na problema na nangangailangan ng 2 hanggang 8 na hakbang ng pagkalkula, ay naglalarawan ng kahinaan ng stochastic na pagpili sa gayong mga gawain: ang pag-inject ng randomness sa pamamagitan ng truncated na distribusyon ng Top‑p ay maaaring makapinsala sa chain of reasoning ng modelo (Chain‑of‑Thought) sa alinman sa mga intermediate na hakbang. Binibigyang-diin ni Tan at mga katuwang na ang bisa ng paraan ng decoding ay lubos na nakasalalay sa tiyak na gawain (*task‑dependent*).<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)</sup>

### Mga Paraan ng Paglaban sa Hallucination sa Antas ng Decoding

Para labanan ang mga epekto ng hallucination na dulot ng stochastic sampling, may mga binuong pamamaraan ng advanced na augmentation ng decoding:

- **Contrastive Decoding** (*Contrastive Decoding*, DoLa) — nag-o-optimize ng pagkakaiba sa log-likelihood sa pagitan ng pangunahing modelo at ng mas maliit na auxiliary model, na gumaganap bilang filter ng katotohanan.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)</sup>
- **SH2** (*Self‑Highlighted Hesitation*) — artipisyal na pinipilit ang decoder na "mag-atubili" kapag nagtatrabaho sa mga mababang-tiwala na token.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-illusion-insight-11)</sup>
- **Directed na pag-project ng mga activation** (SEA) — pinapatahimik ang mga hallucination signal sa antas ng mga vector representation.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-illusion-insight-11)</sup>

Sa kabila nito, ang mga modernong modelo na may kalidad na alignment ay may mas malalim na pag-unawa sa katotohanan, na nagpapababa ng entropy ng kanilang mga panloob na distribusyon at ginagawa silang hindi gaanong madaling kapitan ng pagkasira ng mga katotohanan kahit sa mataas na halaga ng Top‑p.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)[\[12\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-frontiers-hall-12)</sup>

## Praktikal na Gamit at Rekomendasyon

Ang Top‑p ay malawakang ginagamit sa mga modernong LLM dahil sa kombinasyon ng flexibility at controllability.

- **Tipikal na hanay ng mga halaga.** Sa praktika, madalas gamitin ang $p \approx 0.90\text{–}0.95$. Ang default na halaga ay nag-iiba-iba depende sa provider: sa OpenAI ang \`top_p\` = **1.0** (ang truncation ay aktwal na naka-off), sa Anthropic — **0.99**, sa maraming modelo ng Google Gemini — **0.95**.<sup>[\[13\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-anthropic-release-13)</sup> Sa Hugging Face Transformers library ang default na framework ay katumbas din ng **1.0**, bagaman ang mga indibidwal na modelo ay maaaring i-override ito sa kanilang \`generation_config.json\`.<sup>[\[14\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-genconfig-14)</sup> Kaya ang 0.9–0.95 ay isang karaniwang **rekomendasyon na praktikal na hanay**, ngunit hindi isang universal na default na pamantayan.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)[\[15\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-vertex-params-15)</sup>
  - Ang mga halaga na malapit sa 1.0 (halimbawa, 0.98–0.99) ay nagpapataas ng pagkakaiba-iba: mas maraming token ang pumapasok sa nucleus.
  - Ang maliliit na halaga (halimbawa, 0.80–0.90) ay nagpapataas ng determinacy at "pag-iingat" ng output.
  - Sa $p = 1$ ang truncation ng Top‑p ay nawawala: ang pagpili ay isinasagawa sa buong bokabularyo (isinasaalang-alang ang temperatura at iba pang mga filter ng decoding, kung naka-enable ang mga ito).<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-gen-5)</sup>

<!-- -->

- **Compatibility sa mga Library at API.**
  - Sa Hugging Face Transformers ay ipinatupad ang *TopPLogitsWarper*, kung saan karagdagan pang ginagamit ang threshold na \`min_tokens_to_keep\` (default 1). Ito ay isang proteksyong detalye ng implementasyon: sa mga standard na halaga ng $p \in (0,\, 1\rbrack$ ang walang laman na nucleus ay hindi nagmumula sa kahulugan, ngunit tinitiyak ng parameter ang tamang gawa sa mga edge case.<sup>[\[16\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-warp-16)</sup>
  - Sa ilang API ang parameter na \`top_p\` ay available, habang ang \`top_k\` ay maaaring wala; ang suporta ng parameter at ang kanilang semantics ay **nakasalalay sa partikular na modelo at mode ng operasyon**. Ang mga reasoning model, bilang panuntunan, ay nililimitahan ang pag-configure ng stochasticity sa antas ng API. Halimbawa, sa kasalukuyang dokumentasyon ng OpenAI, ang mga parameter na \`temperature\` at \`top_p\` ay tahasang sinusuportahan lamang sa GPT‑5.2 na may \`reasoning.effort = none\`; ang mga kahilingan sa GPT‑5.2 o GPT‑5.1 na may iba pang mga halaga ng \`reasoning\`, pati na rin sa mga mas naunang modelo ng GPT‑5 (\`gpt‑5\`, \`gpt‑5‑mini\`, \`gpt‑5‑nano\`) kapag ipinasa ang mga field na ito ay nagdudulot ng error. Ang mga reasoning model ng nakaraang henerasyon (o1, o3) ay nililimitahan o nig-i-fix din ang mga ito.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-top-p-7)[\[17\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-reasoning-17)[\[18\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-openai-gpt52-18)</sup> Sa Anthropic sa Claude API kapag naka-enable ang extended thinking, ang pagbabago ng \`temperature\` at \`top_k\` ay ipinagbabawal, ngunit ang \`top_p\` ay pinahihintulutan sa hanay na 0.95–1.0; sa mga third-party platform (halimbawa, Amazon Bedrock) ang mga limitasyon ay maaaring mag-iba.<sup>[\[19\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-anthropic-thinking-19)</sup> **Ang mga limitasyon ng provider ay madalas na nagbabago mula bersyon sa bersyon**; inirerekomenda na suriin ang kasalukuyang dokumentasyon.<sup>[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-azure-rec-8)[\[20\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-azure-reasoning-20)</sup>

<!-- -->

- **Mahahabang teksto at paulit-ulit.** Sa isang serye ng mga eksperimento, ipinakita na ang nucleus sampling ay nagpapababa ng hilig sa degeneration (pag-uulit, mga cliché na parirala) kumpara sa greedy/beam at nakapirming Top‑k, lalo na sa mahabang pagkakasunod-sunod.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-holtzman2019-1)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tan2024-10)</sup>

## Mga Modernong Alternatibo

Pagkatapos mailathala ang nucleus sampling noong 2019, ilang alternatibong pamamaraan ng stochastic decoding ang iminungkahi, na nagpapaunlad o nagdadagdag sa ideya ng Top‑p:

### Min‑p Sampling

**Min‑p sampling** (Nguyen et al., 2024) ay nag-iiwan ng mga token na ang probabilidad ay hindi mas mababa sa $p_{\min} \times P(x_{(1)})$, ibig sabihin, nagtatakda ng threshold na may kaugnayan sa pinaka-malamang na token. Tinanggap para sa oral na ulat sa ICLR 2025; ipinatupad sa ilang sikat na framework, kabilang ang Hugging Face Transformers<sup>[\[21\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-hf-minp-21)</sup> at vLLM<sup>[\[22\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-vllm-minp-22)</sup>.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-23)</sup>

Ang pangunahing pagkakaiba mula sa Top‑p ay nasa uri ng threshold: ginagamit ng Top‑p ang **absolute** na threshold batay sa cumulative sum ng mga probabilidad, habang ang Min‑p ay nagtatakda ng **relative** na threshold, na sinusukat mula sa probabilidad ng pinaka-malamang na token.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-23)</sup>

Mathematically, ang algorithm ay gumagana tulad ng sumusunod: sa bawat hakbang ang maximum probability $P_{\max} = P(x_{(1)} \mid x_{1:i - 1})$ ay tinutukoy, pagkatapos ay kinakalkula ang scaled threshold $P_{\text{threshold}} = p_{\min} \times P_{\max}$. Sa final pool ay pumapasok lamang ang mga token na ang indibidwal na probabilidad ay lumalagpas sa threshold na ito.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-arxiv-24)</sup>

Ito ay nagbibigay ng adaptivity: kung tiwala ang modelo sa susunod na salita ($P_{\max} = 0.9$), sa base na $p_{\min} = 0.1$ ang threshold ay 0.09, mahigpit na tinatanggal ang mga noise token. Kung ang modelo ay hindi tiwala ($P_{\max} = 0.1$), ang threshold ay bumababa sa 0.01, na nagpapasok sa nucleus ng malawak na pagkakaiba-iba ng mga kandidato.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-23)</sup>

Ang kilalang kahinaan ng Top‑p ay lumalabas sa high-temperature sampling ($T > 1.0$): kapag ang distribusyon ay artipisyal na pinakinis, ang Top‑p ay napipilitang isama sa nucleus ang malaking bilang ng mga mababang-probabilidad na token upang makamit ang itinakdang cumulative sum, na maaaring humantong sa pagkasira ng pagkakaugnay.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-23)</sup> Mas mahusay ang Min‑p sa gayong mga kondisyon. Sa mga eksperimento ng mga may-akda sa mga benchmark ng siyentipiko at lohikal na kaalaman (GPQA) gamit ang modelong Mistral Large sa matinding temperatura $T = 3.0$, ipinakita ng algorithm na Min‑p ang accuracy na 13.84%, habang ang standard Top‑p 0.9 ay nagbigay ng resulta na 0.89% — sa antas ng random na ingay.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-arxiv-24)</sup>

Sa kabila nito, sa akademikong komunidad ay may patuloy na talakayan: ilang kritikal na gawain (halimbawa, arXiv:2506.13681) ay nagtatanong sa universality ng mga kalamangan ng Min‑p sa lahat ng NLP na metric, na nagpoprotesta sa pangangailangan ng karagdagang pag-aaral.<sup>[\[25\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-minp-critique-25)</sup>

**Sa simpleng salita,** ang Min-p ay naghahambing ng lahat ng opsyon hindi sa kabuuang suma ng mga probabilidad, kundi sa pinakamalakas na opsyon sa kasalukuyang hakbang. Kaya kung tiwala ang modelo, mas mahigpit nitong inaalis ang mahihinang pagpapatuloy, at kung hindi tiwala — nag-iiwan ng mas maraming katanggap-tanggap na opsyon. Dahil dito, mas maipanatili ng Min-p ang balanse sa pagitan ng pagkakaugnay at pagkakaiba-iba, lalo na kung saan nagsisimula nang pumasa ng masyadong maraming mahihinang salita ang Top-p.

### Locally Typical Sampling

**Locally typical sampling** (Meister et al., 2023) ay pumipili ng mga token na ang informational load ($- \log P$) ay malapit sa conditional entropy, batay sa information-theoretic na konsepto ng typicality.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-meister2023-2)</sup>

Sa kaibahan sa Top‑p, na nagsisikap na i-minimize ang laki ng nucleus sa pamamagitan ng pagpili ng mga token na may maximum na probabilidad, ang Locally Typical Sampling ay naglulutas ng optimization problem batay sa metric ng informational distance. Kinakalkula ng algorithm ang informational content ng bawat token ($- \log P(x)$) at sinusukat ang kanyang absolute na distansya sa conditional entropy $H$ ng modelo. Ang mga token ay hindi ina-rank sa pamamagitan ng raw na probabilidad, kundi sa antas ng kanilang "informational typicality" — pagiging malapit sa inaasahang informational content ng konteksto. Ang mga token ay idinaragdag sa nucleus (sa pataas na pagkakasunod ng distansya sa entropy) hanggang maabot ang threshold ng cumulative probability.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-meister2023-2)[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-typical-mit-26)</sup>

Kinagawian ng pamamaraang ito: sa mga estado ng mataas na entropy, ang algorithm ay sadyang nagtatanggal hindi lamang ng noise na mababang-probabilidad na buntot, kundi pati na rin ng labis na mataas-probabilidad na salita na nagdadala ng napakaliit na impormasyon at ginagawang banido ang teksto. Nagpapababa ito ng panganib ng degenerative loops at naglalapitan ng mga metric ng repetitiveness ng teksto sa mga katangian ng mga teksto na isinulat ng tao.<sup>[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-typical-mit-26)</sup>

### Tail Free Sampling (TFS)

**Tail Free Sampling** (TFS) — isang hindi gaanong formalized ngunit praktikal na interesanteng pamamaraan sa pagtukoy ng noise tail, batay sa differential analysis ng probability space. Kung ang Top‑p at Min‑p ay gumagana sa mga first-order probability (cumulative sum at basic fraction), ang TFS ay nag-aanalisa ng **una at pangalawang derivative** ng sorted probability curve. Ang pamamaraan ay inilarawan sa blog ni Trenton Bricken at ipinatupad sa ilang inference engine, bagaman hindi ito nailathala sa anyo ng isang peer-reviewed na artikulo.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tfs-bricken-27)</sup>

Ang pangunahing postulate ng TFS: ang pagsasama kahit ng isang noise token sa sample ay nagdadala ng exponential na banta sa buong autoregressive generation. Sa pamamagitan ng pagkalkula ng pangalawang derivative mula sa mga halaga ng probabilidad, ang algorithm ay nakaka-localize ng "platong" — mga lugar ng kurba kung saan bumabagal ang pagbaba ng mga probabilidad at lumilipat sa mahabang mababang buntot. Ang punto ng paglipat na ito ay nagiging dynamic na hangganan ng truncation: ang mga token bago nito ay kinikilala bilang semantically safe, at ang buong buntot ay tinatanggal.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tfs-bricken-27)</sup>

Sa kabila ng mathematical na elegansya, ang TFS ay nangangailangan ng mas matinding computational na gastos para sa pagkalkula ng mga derivative sa real time, dahil dito ay nahuhuli ito sa mas magaan na mga algorithm sa mga mass commercial na produkto.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-tfs-bricken-27)</sup>

### *p*‑less Sampling

**$p$‑less sampling** — isang pamamaraan na ganap na nagpapalaya sa inhinyero mula sa pangangailangan na i-configure ang mga hyperparameter ng truncation.<sup>[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-pless-openreview-28)</sup> Ang pundamental na problema ng lahat ng nakaraang pamamaraan — mula sa Top‑k at Top‑p hanggang sa Min‑p — ay ang pag-asa sa mga static na hyperparameter, na ang mga halaga ay nangangailangan ng expert na pag-aayos at maaaring optimal para sa isang gawain (creative writing) ngunit hindi angkop para sa isa pa (programming).<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-pless-arxiv-29)</sup>

Ang algorithm na $p$‑less, nakaugat sa information theory, ay dynamic na nagge-generate ng natatanging threshold ng truncation sa bawat hakbang ng decoding, na sinusuri ang panloob na topologya ng buong probability distribution sa real time. Nag-uulat ang mga may-akda ng katatagan ng pamamaraan sa temperatura fluctuation (*temperature robustness*): kapag tumataas ang temperatura, ang mga tradisyonal na pamamaraan ay maaaring malubhang magdegrade, habang ang $p$‑less ay nagpapanatili ng katatagan ng kalidad. Bukod pa rito, salamat sa pagtanggi sa lohika ng cumulative scanning at re-normalization ng malalaking nucleus, ang pamamaraan, ayon sa datos ng mga may-akda, ay nagbibigay ng mas mataas na computational efficiency sa inference stage at nagge-generate ng mas compact na mga sagot nang walang pagkawala ng accuracy sa mga dataset sa matematika, lohika, at creative writing.<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-pless-arxiv-29)[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-pless-openreview-28)</sup>

### η‑Sampling

**η‑sampling** (Hewitt et al., 2022) ay gumagamit ng entropy-dependent na probability threshold, umaangkop sa mga low-entropy na konteksto, kung saan maaaring mag-truncate nang labis ang Top‑p.<sup>[\[30\]](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_note-eta-30)</sup>

## Talasanggunian

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; inilathala sa ICLR 2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Fan, A., Lewis, M., & Dauphin, Y. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). *Conformal Nucleus Sampling*. ACL Findings 2023.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925.
- Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies*. arXiv:2410.03968.
- Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[32]</a>.
- *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234.

## Mga Tala

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-holtzman2019_1-10)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-meister2023-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-meister2023_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-meister2023_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-meister2023_2-2)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *TACL*, Vol. 11. arXiv:2202.00666. <a href="https://aclanthology.org/2023.tacl-1.7.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-hall-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-arxiv-hall_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-arxiv-hall_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-arxiv-hall_3-2)</sup> *Large Language Models Hallucination: A Comprehensive Survey*. arXiv:2510.06265. <a href="https://arxiv.org/abs/2510.06265" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-finlayson2024-4">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-finlayson2024_4-0) Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-hf-gen-5">↑ <sup>[5.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-gen_5-6)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf-code-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-code_6-0) Hugging Face Transformers. *generation/utils.py* (исходный код). <a href="https://github.com/huggingface/transformers/blob/main/src/transformers/generation/utils.py" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-top-p-7">↑ <sup>[7.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-top-p_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-top-p_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-top-p_7-2)</sup> <sup>[7.3](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-top-p_7-3)</sup> <sup>[7.4](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-top-p_7-4)</sup> OpenAI API Reference. *top_p* — рекомендация «We generally recommend altering this or temperature but not both». <a href="https://developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-azure-rec-8">↑ <sup>[8.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-azure-rec_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-azure-rec_8-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/reference" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-anthropic-params-9">↑ <sup>[9.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-anthropic-params_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-anthropic-params_9-1)</sup> Anthropic API Reference. *Messages API — top_p*. <a href="https://docs.anthropic.com/en/api/messages" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-tan2024-10">↑ <sup>[10.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-3)</sup> <sup>[10.4](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-4)</sup> <sup>[10.5](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tan2024_10-5)</sup> Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925. <a href="https://aclanthology.org/2024.emnlp-main.489.pdf" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-illusion-insight-11">↑ <sup>[11.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-illusion-insight_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-illusion-insight_11-1)</sup> *From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs*. MDPI. <a href="https://www.mdpi.com/2673-2688/6/10/260" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-frontiers-hall-12">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-frontiers-hall_12-0) *Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior*. Frontiers in AI. <a href="https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1622292/full" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-anthropic-release-13">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-anthropic-release_13-0) Anthropic. *API release notes*. <a href="https://docs.anthropic.com/en/release-notes/api" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-hf-genconfig-14">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-genconfig_14-0) Hugging Face. *GenerationConfig (top_p default)*. <a href="https://huggingface.co/docs/transformers/main_classes/text_generation" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-vertex-params-15">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-vertex-params_15-0) Google AI / Vertex AI. *Content generation parameters (topP/topK)*. <a href="https://ai.google.dev/gemini-api/docs/prompting-strategies" class="external autonumber" rel="nofollow">[15]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/multimodal/content-generation-parameters" class="external autonumber" rel="nofollow">[16]</a></span>
16. <span id="cite_note-hf-warp-16">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-warp_16-0) Transformers API. *TopPLogitsWarper* (параметры и поведение, включая \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-openai-reasoning-17">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-reasoning_17-0) OpenAI API. *Using reasoning models — parameter support*. <a href="https://developers.openai.com/docs/guides/reasoning" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-openai-gpt52-18">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-openai-gpt52_18-0) OpenAI API. *Using GPT-5.2*. <a href="https://developers.openai.com/api/docs/guides/latest-model/" class="external autonumber" rel="nofollow">[19]</a></span>
19. <span id="cite_note-anthropic-thinking-19">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-anthropic-thinking_19-0) Anthropic. *Building with extended thinking*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking" class="external autonumber" rel="nofollow">[20]</a></span>
20. <span id="cite_note-azure-reasoning-20">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-azure-reasoning_20-0) Microsoft Learn (Azure AI Foundry). *Reasoning models — supported parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/reasoning" class="external autonumber" rel="nofollow">[21]</a></span>
21. <span id="cite_note-hf-minp-21">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-hf-minp_21-0) Hugging Face Transformers. *MinPLogitsWarper*. <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.MinPLogitsWarper" class="external autonumber" rel="nofollow">[22]</a></span>
22. <span id="cite_note-vllm-minp-22">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-vllm-minp_22-0) vLLM. *Sampling Parameters — min_p*. <a href="https://docs.vllm.ai/en/latest/serving/sampling_params.html" class="external autonumber" rel="nofollow">[23]</a></span>
23. <span id="cite_note-minp-23">↑ <sup>[23.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp_23-1)</sup> <sup>[23.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp_23-2)</sup> <sup>[23.3](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp_23-3)</sup> Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082. <a href="https://arxiv.org/abs/2407.01082" class="external autonumber" rel="nofollow">[24]</a></span>
24. <span id="cite_note-minp-arxiv-24">↑ <sup>[24.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp-arxiv_24-0)</sup> <sup>[24.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp-arxiv_24-1)</sup> Nguyen, M. et al. *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/pdf/2407.01082" class="external autonumber" rel="nofollow">[25]</a></span>
25. <span id="cite_note-minp-critique-25">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-minp-critique_25-0) *Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models*. arXiv:2506.13681. <a href="https://arxiv.org/abs/2506.13681" class="external autonumber" rel="nofollow">[26]</a></span>
26. <span id="cite_note-typical-mit-26">↑ <sup>[26.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-typical-mit_26-0)</sup> <sup>[26.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-typical-mit_26-1)</sup> *Locally Typical Sampling*. Transactions of the ACL, MIT Press. <a href="https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00536/114593/Locally-Typical-Sampling" class="external autonumber" rel="nofollow">[27]</a></span>
27. <span id="cite_note-tfs-bricken-27">↑ <sup>[27.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tfs-bricken_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tfs-bricken_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-tfs-bricken_27-2)</sup> Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[28]</a></span>
28. <span id="cite_note-pless-openreview-28">↑ <sup>[28.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-pless-openreview_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-pless-openreview_28-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. OpenReview. <a href="https://openreview.net/forum?id=ItFuNJQGH4" class="external autonumber" rel="nofollow">[29]</a></span>
29. <span id="cite_note-pless-arxiv-29">↑ <sup>[29.0](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-pless-arxiv_29-0)</sup> <sup>[29.1](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-pless-arxiv_29-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234. <a href="https://arxiv.org/abs/2509.23234" class="external autonumber" rel="nofollow">[30]</a></span>
30. <span id="cite_note-eta-30">[↑](https://systems-analysis.info/int/Top-p_sampling_(TL)#cite_ref-eta_30-0) Hewitt, J., Manning, C. D., & Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. Findings of EMNLP 2022. arXiv:2210.15191. <a href="https://arxiv.org/abs/2210.15191" class="external autonumber" rel="nofollow">[31]</a></span>

## Tingnan Din

- Temperatura
- Malalaking Language Model
