Top-p sampling (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Top‑p sampling, kilala rin bilang nuclear sampling (Ingles: Nucleus Sampling), — isang stochastic na paraan ng decoding para sa autoregressive na mga language model, malawakang ginagamit kabilang na sa malalaking language model (LLM). Iminungkahi ang pamamaraan noong 2019 ni Ari Holtzman at mga katuwang (preprint sa arXiv — Abril 2019; inilathala sa ICLR 2020) bilang isang pinahusay na alternatibo sa nakapirming Top‑k sampling. Ang ideya nito — dynamic na pagpili ng hanay ng mga kandidato sa bawat hakbang ng henerasyon batay sa threshold ng cumulative probability p.[1]

Makasaysayang Konteksto: Ang Problema ng Neural Text Degeneration

Bago lumabas ang Top‑p, ang mga nangingibabaw na estratehiya ng decoding ay ang greedy search (greedy search) at beam search (beam search), batay sa paradigma ng maximization ng likelihood — pagpili ng pagkakasunod-sunod ng mga token na may pinakamataas na kabuuang probabilidad. Ang greedy search sa bawat hakbang ay lokal na pumipili ng token na may pinakamataas na probabilidad, habang ang beam search ay sabay na sinusubaybayan ang ilang mga hypotheses ng henerasyon.[1]

Kahit na ang mga pamamaraang ito ay epektibo sa mga saradong gawain (machine translation, pagkuha ng datos), sa paglipat sa mga gawaing open-ended na henerasyon ng teksto (pagsulat ng mga kuwento, mga dialogue system) ay madalas itong humahantong sa neural text degeneration — pagkasira ng output, kung saan ang teksto ay nagiging paulit-ulit, nawawalan ng pagkakaugnay, o nagpapaikot sa mga ulitin. Ang penomenong ito ay detalyadong inilarawan ni Holtzman at mga katuwang sa akdang The Curious Case of Neural Text Degeneration.[1]

Iugnay ni Meister at mga katuwang ang problema ng degeneration sa katotohanang ang teksto ng tao ay nagsisikap na mapanatili ang informational na nilalaman na malapit sa inaasahang conditional entropy, sa halip na simpleng i-maximize ang lokal na probabilidad ng bawat susunod na token.[2]

Naging alternatibo ang purong stochastic sampling (sampling without truncation), kung saan ang token ay pinipili nang random ayon sa kanyang probabilidad. Gayunpaman, ang pamamaraang ito ay lumikha ng kabaligtaran na problema: ang Softmax function ay hindi kailanman nagtatalaga ng probabilidad na eksaktong katumbas ng zero sa isang token, kaya sa isang bokabularyo ng sampung libu-libong salita ay palaging may malawak na sona ng mga noise token. Sa purong sampling, tumataas ang panganib ng pagkahulog sa hindi mapagkakatiwalaang buntot ng distribusyon, na maaaring magpalala ng pagkakaugnay ng nabuong teksto.[1][3] Ang pangangailangang pagsamahin ang kayamanan ng stochastic na pagpili at ang pagiging maaasahan ng mga deterministic na limitasyon ay humantong sa pagbuo ng mga pamamaraan ng truncation ng distribusyon, na ang pinakamahalagang kinatawan ay ang nucleus sampling (Top‑p).[1][4]

Simpleng Paliwanag

Top-p sampling — ito ay isang paraan ng paglilimita ng pagpili ng susunod na token sa mga pinaka-malamang na opsyon lamang, nang hindi nag-aayos ng kanilang bilang nang maaga.

Sa henerasyon ng teksto, ang language model sa bawat hakbang ay sinusuri ang maraming posibleng pagpapatuloy at nagbibigay sa bawat isa ng ilang probabilidad. Ang ilang mga token ay napaka-malamang, ang iba ay katamtamang malamang, at ang malaking bahagi ng bokabularyo ay bumubuo ng tinatawag na "buntot" ng distribusyon: mga opsyon na may napakaliit na probabilidad, na pormal na katanggap-tanggap, ngunit kadalasan ay random, hindi angkop, o nagpapababa ng pagkakaugnay ng teksto.

Ang Top-p sampling ay nagtatanggal ng malamang na buntot na ito hindi sa pamamagitan ng nakapirming bilang ng mga token, kundi sa pamamagitan ng kabuuang probabilidad. Una, ang lahat ng mga kandidato ay inayos mula sa pinakamalamang hanggang sa pinaka-hindi malamang. Pagkatapos, pinipili ang pinakamaliit na hanay ng mga nangungunang token na ang kabuuang probabilidad ay umabot sa itinakdang threshold p — halimbawa, 0.9 o 0.95. Pagkatapos nito, ang susunod na token ay pinipili nang random mula lamang sa hanay na ito, at lahat ng iba pang opsyon ay tinatanggal.

Halimbawa, kung ang modelo ay nagpapatuloy ng parirala na "Ngayon sa labas ay may malakas na...", sa mga pinaka-malamang na opsyon maaaring maisama ang "ulan" (0.45), "malakas na ulan" (0.25), "niyebe" (0.15) at "hangin" (0.10). Sa threshold na p=0.90, ang algorithm ay nagtatambak ng mga token sa pababang pagkakasunod ng probabilidad: 0.45 + 0.25 = 0.70 (mas mababa sa 0.90), idinaragdag ang "niyebe": 0.70 + 0.15 = 0.85 (mas mababa pa rin sa 0.90), idinaragdag ang "hangin": 0.85 + 0.10 = 0.95 (nalampasan na ang threshold). Ang nucleus ay nabuo mula sa apat na token. Lahat ng mas bihirang opsyon ay itinatapon, at ang mga probabilidad ng natitirang mga token ay ini-normalize: kaya, ang probabilidad ng token na "ulan" pagkatapos ng re-normalization ay magiging 0.45/0.9547.4%, at ang generator ay pipili ng susunod na token mula sa na-update na distribusyon.

Ang pangunahing pagkakaiba mula sa Top‑k ay ang Top‑k ay palaging kumukuha ng nakapirming bilang ng pinakamahuhusay na salita (halimbawa, 50), habang ang Top‑p ay hindi nag-aayos ng bilang ng mga opsyon nang maaga: minsan ito ay maaaring 3 salita, minsan 20 — lahat ay depende sa kung paano ipinagkalat ang mga probabilidad sa partikular na hakbang na iyon. Dahil dito, ang pamamaraan ay umaangkop sa konteksto at tumutulong na alisin ang "buntot" ng mga hindi malamang na token, na ginagawang mas natural ang teksto.

Isa pang halimbawa. Halimbawa, ang modelo ay nagpapatuloy ng parirala na "Sa almusal ay uminom siya ng mainit na...". Sa mga pinaka-malamang na pagpapatuloy maaaring maisama: "tsaa" (0.50), "kape" (0.30), "tsokolate" (0.08), "sabaw" (0.04), "kefir" (0.03). Kung itinakda ang threshold na p=0.80, ang algorithm ay nagsisimulang magdagdag ng mga probabilidad mula sa itaas pababa: 0.50 para sa "tsaa", pagkatapos ay 0.50 + 0.30 = 0.80. Naabot na ang threshold, ibig sabihin ang nucleus ay binubuo lamang ng dalawang token: "tsaa" at "kape". Lahat ng iba pang opsyon ay itinatapon. Pagkatapos ng re-normalization, ang probabilidad ng "tsaa" sa loob ng nucleus ay nagiging 0.50/0.80=62.5%, at ang probabilidad ng "kape" ay nagiging 0.30/0.80=37.5%. Ang susunod na token ay pinipili lamang sa pagitan ng dalawang opsyon na ito.

Sa madaling salita, una ay inaalis ng modelo ang mga hindi malamang at hindi magandang pagpapatuloy, at pagkatapos ay pumipili mula sa natitirang mga opsyon. Tinutulungan nito na sumulat ng mas malinaw, mas natural, at walang labis na "ingay".

Konsepto

Ang pangunahing ideya ng Top‑p — sa bawat hakbang ay piliin ang pinakamaliit na hanay ng mga pinaka-malamang na token, na ang kabuuang probabilidad ay hindi bababa sa itinakdang threshold p (nucleus).

Pormal, hayaan nating x(1),x(2), — mga token ng bokabularyo V, na inayos sa pababang pagkakasunod ng conditional probability P(xx1:i1). Pagkatapos ang nucleus V(p) ay tinukoy bilang pinakamaikling prefix ng inayos na pagkakasunod na ito, na ang cumulative mass ay umabot sa threshold:

m=min{n:j=1nP(x(j)x1:i1)p},V(p)={x(1),,x(m)}.

Sa madaling salita, ito ay ang pinakamaliit na hanay ng pinakamalamang na mga token ayon sa inclusion, na ang kabuuang probabilidad ay hindi bababa sa p.[1]

Pagkatapos matukoy ang nucleus, ang mga probabilidad ng mga token na wala sa V(p) ay ginagawang zero, at ang mga nasa loob ng nucleus ay ini-normalize (hinahati sa aktwal na cumulative mass p=xV(p)P(xx1:i1), upang ang kabuuan ay maging 1). Ang susunod na token ay sine-sample mula sa truncated at re-normalized na distribusyon.

Dynamic na Adaptasyon

  • Sa "matalas" na distribusyon (tiwala ang modelo) ang nucleus ay maliit: ilang token na lamang ang nagbibigay ng mass na ≥ p, na nagpapataas ng pagkakaugnay. Sa pinakamataas na kaso, kung ang probabilidad ng pinaka-malamang na token ay lumampas na sa p (halimbawa, P(x(1))=0.96 sa p=0.95), ang nucleus ay kumikitid sa isang token lamang at ang Top‑p ay aktwal na nagiging greedy decoding.
  • Sa "patag" na distribusyon (maraming makatwirang pagpapatuloy) ang nucleus ay malaki: napapalawig ang pagpili, lumalaki ang pagkakaiba-iba.[1]

Paghahambing sa Iba Pang Paraan ng Decoding

Top‑p kumpara sa Top‑k

  • Top‑k ay palaging pumipili mula sa nakapirming bilang na k ng mga pinaka-malamang na token. Sa "matalas" na mga distribusyon, maaari itong magdagdag ng mga karagdagang hindi malamang na opsyon "para sa bilang", at sa "patag" na mga distribusyon — kabaligtaran, nag-aalis ng makatwirang mga pagpapatuloy na hindi napasok sa top‑k.
  • Top‑p ay inaangkop ang laki ng hanay ng mga kandidato batay sa datos ng hakbang, na ginagawang mas flexible at matatag ang gawi sa iba't ibang uri ng distribusyon.[1]
  • Sa praktika, ang Top‑k at Top‑p ay maaaring gamitin nang sabay-sabay. Sa kasong ito, unang pinipili ang top‑k na mga token, at pagkatapos sa loob ng limitadong hanay na ito ay hinahanap ang nucleus na may threshold na p. Ang eksaktong pagkakasunod at motibasyon ay depende sa implementasyon, ngunit ang ganitong kombinasyon ay dokumentado bilang isang karaniwang pamamaraan.[5]

Sa simpleng salita, ang Top-k ay nagpapasya nang maaga kung ilang opsyon ang itatabi, at ang Top-p ay tumitingin sa sitwasyon at nag-iiwan ng gaano karami ang kailangan sa kontextong iyon. Samakatuwid ang Top-p ay karaniwang mas flexible, at ang Top-k ay mas simple at mas mahuhulaan.

Top‑p kumpara sa Temperatura

  • Temperatura (temperature) ay nagbabago ng buong hugis ng distribusyon (ginagawa itong mas matalas o mas makinis), ngunit hindi nagtatanggal ng mga token: kahit ang mga hindi malamang na opsyon ay nagpapanatili ng hindi-zero na pagkakataon.[5]
  • Top‑p ay nagpapakilala ng mahigpit na truncation ng buntot ng distribusyon — ang mga mababang-probabilidad na token ay ganap na inalis mula sa sampling, na tumutulong na maiwasan ang malinaw na hindi angkop na mga pagpapatuloy.[1]
  • Pagkakasunod ng aplikasyon. Sa mga standard na pipeline (halimbawa, sa Hugging Face Transformers) ang temperatura ay unang inilalapat sa mga logit (binabago ang hugis ng distribusyon), pagkatapos ay maaaring ilapat ang Top‑k, at pagkatapos lamang ang Top‑p (truncation ng buntot). Ipinapaliwanag nito kung bakit mahirap kontrolin ang "dobleng epekto": ang pagbabago ng temperatura ay nagbabago ng mismong cumulative mass, na pagkatapos ay ginagamit ng Top‑p.[5]

Sa simpleng salita, ang temperatura ay nagbabago ng gaano kalaya ang pagpili ng modelo ng mga salita, at ang Top-p ay nagpapasya, anong mga opsyon ang maaaring piliin. Samakatuwid ang temperatura ay nakakaimpluwensya sa antas ng randomness, at ang Top-p — sa kung gaano kalayo maaaring pumunta ang modelo sa mga hindi gaanong malamang na pagpapatuloy.

Pagkakasunod ng mga Operasyon sa Implementasyon ng Hugging Face Transformers

Ang pagkakasunod ng aplikasyon ng mga sampling processor ay depende sa partikular na library. Sa Hugging Face Transformers (simula sa v4.x) para sa tatlong parameter na pinagtalunan, ang mga logit processor ay idinaragdag bilang default sa sumusunod na pagkakasunod:[5][6]

  1. Temperatura scaling ng mga logit. Ang logit ng bawat token ay hinahati sa halaga ng temperatura bago i-exponentiate ang Softmax function. Binabago ng temperatura ang hugis ng distribusyon, inihahanda ito para sa kasunod na filtering.
  2. Top‑k filter (kung naka-configure): pinuputol ang bokabularyo sa nakapirming bilang ng mga kandidato.
  3. Top‑p filter: ang cumulative truncation ay inilalapat sa nang pinahepang pool ng mga token.
  4. Re-normalization ng natitirang mga probabilidad at stochastic sampling.

Sa praktika, ang karaniwang kombinasyon ay katamtamang temperatura (0.7) na may malawak na Top‑p nucleus (0.95) at Top‑k limit (50): ang temperatura ay nagbibigay ng pangunahing pagkakaiba-iba, ang Top‑k ay gumaganap bilang magaspang na proteksyon, at ang Top‑p ay nagsasagawa ng context-dependent na fine-tuning.[5]

Sa simpleng salita, una ang modelo ay ginagawang mas o hindi gaanong "malaya" ang pagpili sa tulong ng temperatura, pagkatapos kung kinakailangan ay nilimitahan ang bilang ng mga kandidato sa pamamagitan ng Top-k, at pagkatapos ay iniaalis ang masyadong mahinang mga opsyon sa pamamagitan ng Top-p. Ang ganitong pagkakasunod ay tumutulong na una ay i-configure ang pangkalahatang katangian ng pagpili, at pagkatapos ay alisin ang labis.

Rekomendasyon: Pag-aayos ng Isang Parameter sa Isang Pagkakataon

Inirerekomenda ng mga provider ng modelo na sa pag-aayos ng istilo ng henerasyon, baguhin ang alinman sa temperature o top_p, ngunit hindi ang dalawa nang sabay-sabay. Ang rekomendasyon na ito ay nakapaloob sa opisyal na dokumentasyon ng OpenAI, Azure OpenAI, at Anthropic.[7][8][9]

Praktikal na justipikasyon: ang parehong parameter ay nakakaimpluwensya sa hugis ng probability distribution (binabago ng temperatura ang steepness ng kurba, at ang Top‑p ay nagtatakda ng punto ng truncation), kaya ang sabay na pagbabago ng dalawa ay nagpapahirap sa diagnosis — imposibleng matukoy kung aling parameter ang nagdulot ng pagpapabuti o pagkasama ng output. Bukod pa rito, sa mga matinding mababang halaga ng parehong parameter (halimbawa, Temperature ≈ 0 at Top‑p ≈ 0.01) ang nucleus sa praktika ay kumikitid sa isang token, na aktwal na ginagawang greedy search ang sampling.[7]

Ilang reasoning‑model ay karagdagang nililimitahan ang pag-aayos ng mga parameter na ito sa antas ng API, na ginagawang hindi na napapanahon ang isyu ng kanilang sabay na pagbabago para sa gayong mga modelo (tingnan ang seksyong "Compatibility sa mga Library at API").[7]

Karaniwang engineering heuristic: para sa mga gawaing nangangailangan ng mataas na reproducibility — gumamit ng mababang temperatura (hanggang sa zero); para sa mga malikhaing gawain — iwanan ang temperatura sa base level (1.0) at i-regulate ang pagkakaiba-iba sa pamamagitan ng parameter na Top‑p, o i-fix ang Top‑p sa 1.0 at baguhin ang temperatura. Ang mga tiyak na rekomendasyon ay maaaring mag-iba sa iba't ibang provider.[7][9]

Epekto sa Katotohanan at Hallucination

Ang pagpili ng estratehiya ng decoding ay maaaring makaapekto hindi lamang sa istilo ng nabuong teksto, kundi pati na rin sa dalas at uri ng mga factual na pagkakamali. Ang penomenong hallucination — tiwala na henerasyon ng maling o magkasalungat sa konteksto na impormasyon — ay isa sa mga sentral na problema ng generative AI. Ipinapakita ng mga empirical na pag-aaral na ang epekto ng mga estratehiya ng sampling sa hallucination ay depende sa gawain, modelo, at tiyak na setting ng parameter.[3][10]

Mekanismo ng Pagkakamali sa Stochastic Sampling

Sa mataas na halaga ng Top‑p (halimbawa, 0.95) ang modelo ay bumubuo ng nucleus na sumasaklaw sa 95% ng probability mass. Sa mga estado ng mataas na entropy (halimbawa, kapag sinusubukang sagutin ang isang hindi gaanong kilalang katotohanan) ang nucleus na ito ay maaaring magsama ng daan-daang mababang-probabilidad na token. Ang stochastic sampling sa ganitong mga kondisyon ay maaaring kumuha ng token na grammatically tama ngunit semantically hindi konektado sa factual na katotohanan. Kapag nandoon na sa konteksto, ang token na iyon ay maaaring makaapekto sa mga kasunod na hakbang ng henerasyon, dahil ang modelo ay nagpapatuloy ng henerasyon na isinasaalang-alang ang lahat ng nakaraang token, kabilang ang mga may pagkakamali.[3][1]

Dychotomy ng mga Bukas at Saradong Gawain

Ang malalaking eksperimento ay nagpapakita ng pag-asa ng kalidad ng henerasyon sa uri ng gawain. Sa mga gawaing pagsulat ng sanaysay o mga dialogue system, ang mga stochastic na paraan (Top‑p, Temperatura) ay nananatiling mga lider, habang sa mga mahigpit na deterministic na domain ay maaari silang malaking mahuli sa mga deterministic na pamamaraan.[10]

Sa mga benchmark ng code synthesis (HumanEval, MBPP) at paglutas ng mga mathematical na problema (GSM8K) ang mga deterministic na paraan (Beam Search, Greedy Decoding) ay nagpapakita ng mas magagandang resulta kumpara sa mga pamamaraan batay sa Top‑p. Ang dataset ng GSM8K, na kinabibilangan ng 8,500 na mathematical na problema na nangangailangan ng 2 hanggang 8 na hakbang ng pagkalkula, ay naglalarawan ng kahinaan ng stochastic na pagpili sa gayong mga gawain: ang pag-inject ng randomness sa pamamagitan ng truncated na distribusyon ng Top‑p ay maaaring makapinsala sa chain of reasoning ng modelo (Chain‑of‑Thought) sa alinman sa mga intermediate na hakbang. Binibigyang-diin ni Tan at mga katuwang na ang bisa ng paraan ng decoding ay lubos na nakasalalay sa tiyak na gawain (task‑dependent).[10]

Mga Paraan ng Paglaban sa Hallucination sa Antas ng Decoding

Para labanan ang mga epekto ng hallucination na dulot ng stochastic sampling, may mga binuong pamamaraan ng advanced na augmentation ng decoding:

  • Contrastive Decoding (Contrastive Decoding, DoLa) — nag-o-optimize ng pagkakaiba sa log-likelihood sa pagitan ng pangunahing modelo at ng mas maliit na auxiliary model, na gumaganap bilang filter ng katotohanan.[10]
  • SH2 (Self‑Highlighted Hesitation) — artipisyal na pinipilit ang decoder na "mag-atubili" kapag nagtatrabaho sa mga mababang-tiwala na token.[11]
  • Directed na pag-project ng mga activation (SEA) — pinapatahimik ang mga hallucination signal sa antas ng mga vector representation.[11]

Sa kabila nito, ang mga modernong modelo na may kalidad na alignment ay may mas malalim na pag-unawa sa katotohanan, na nagpapababa ng entropy ng kanilang mga panloob na distribusyon at ginagawa silang hindi gaanong madaling kapitan ng pagkasira ng mga katotohanan kahit sa mataas na halaga ng Top‑p.[10][12]

Praktikal na Gamit at Rekomendasyon

Ang Top‑p ay malawakang ginagamit sa mga modernong LLM dahil sa kombinasyon ng flexibility at controllability.

  • Tipikal na hanay ng mga halaga. Sa praktika, madalas gamitin ang p0.900.95. Ang default na halaga ay nag-iiba-iba depende sa provider: sa OpenAI ang `top_p` = 1.0 (ang truncation ay aktwal na naka-off), sa Anthropic — 0.99, sa maraming modelo ng Google Gemini — 0.95.[13] Sa Hugging Face Transformers library ang default na framework ay katumbas din ng 1.0, bagaman ang mga indibidwal na modelo ay maaaring i-override ito sa kanilang `generation_config.json`.[14] Kaya ang 0.9–0.95 ay isang karaniwang rekomendasyon na praktikal na hanay, ngunit hindi isang universal na default na pamantayan.[5][15]
    • Ang mga halaga na malapit sa 1.0 (halimbawa, 0.98–0.99) ay nagpapataas ng pagkakaiba-iba: mas maraming token ang pumapasok sa nucleus.
    • Ang maliliit na halaga (halimbawa, 0.80–0.90) ay nagpapataas ng determinacy at "pag-iingat" ng output.
    • Sa p=1 ang truncation ng Top‑p ay nawawala: ang pagpili ay isinasagawa sa buong bokabularyo (isinasaalang-alang ang temperatura at iba pang mga filter ng decoding, kung naka-enable ang mga ito).[5]
  • Compatibility sa mga Library at API.
    • Sa Hugging Face Transformers ay ipinatupad ang TopPLogitsWarper, kung saan karagdagan pang ginagamit ang threshold na `min_tokens_to_keep` (default 1). Ito ay isang proteksyong detalye ng implementasyon: sa mga standard na halaga ng p(0,1] ang walang laman na nucleus ay hindi nagmumula sa kahulugan, ngunit tinitiyak ng parameter ang tamang gawa sa mga edge case.[16]
    • Sa ilang API ang parameter na `top_p` ay available, habang ang `top_k` ay maaaring wala; ang suporta ng parameter at ang kanilang semantics ay nakasalalay sa partikular na modelo at mode ng operasyon. Ang mga reasoning model, bilang panuntunan, ay nililimitahan ang pag-configure ng stochasticity sa antas ng API. Halimbawa, sa kasalukuyang dokumentasyon ng OpenAI, ang mga parameter na `temperature` at `top_p` ay tahasang sinusuportahan lamang sa GPT‑5.2 na may `reasoning.effort = none`; ang mga kahilingan sa GPT‑5.2 o GPT‑5.1 na may iba pang mga halaga ng `reasoning`, pati na rin sa mga mas naunang modelo ng GPT‑5 (`gpt‑5`, `gpt‑5‑mini`, `gpt‑5‑nano`) kapag ipinasa ang mga field na ito ay nagdudulot ng error. Ang mga reasoning model ng nakaraang henerasyon (o1, o3) ay nililimitahan o nig-i-fix din ang mga ito.[7][17][18] Sa Anthropic sa Claude API kapag naka-enable ang extended thinking, ang pagbabago ng `temperature` at `top_k` ay ipinagbabawal, ngunit ang `top_p` ay pinahihintulutan sa hanay na 0.95–1.0; sa mga third-party platform (halimbawa, Amazon Bedrock) ang mga limitasyon ay maaaring mag-iba.[19] Ang mga limitasyon ng provider ay madalas na nagbabago mula bersyon sa bersyon; inirerekomenda na suriin ang kasalukuyang dokumentasyon.[8][20]
  • Mahahabang teksto at paulit-ulit. Sa isang serye ng mga eksperimento, ipinakita na ang nucleus sampling ay nagpapababa ng hilig sa degeneration (pag-uulit, mga cliché na parirala) kumpara sa greedy/beam at nakapirming Top‑k, lalo na sa mahabang pagkakasunod-sunod.[1][10]

Mga Modernong Alternatibo

Pagkatapos mailathala ang nucleus sampling noong 2019, ilang alternatibong pamamaraan ng stochastic decoding ang iminungkahi, na nagpapaunlad o nagdadagdag sa ideya ng Top‑p:

Min‑p Sampling

Min‑p sampling (Nguyen et al., 2024) ay nag-iiwan ng mga token na ang probabilidad ay hindi mas mababa sa pmin×P(x(1)), ibig sabihin, nagtatakda ng threshold na may kaugnayan sa pinaka-malamang na token. Tinanggap para sa oral na ulat sa ICLR 2025; ipinatupad sa ilang sikat na framework, kabilang ang Hugging Face Transformers[21] at vLLM[22].[23]

Ang pangunahing pagkakaiba mula sa Top‑p ay nasa uri ng threshold: ginagamit ng Top‑p ang absolute na threshold batay sa cumulative sum ng mga probabilidad, habang ang Min‑p ay nagtatakda ng relative na threshold, na sinusukat mula sa probabilidad ng pinaka-malamang na token.[23]

Mathematically, ang algorithm ay gumagana tulad ng sumusunod: sa bawat hakbang ang maximum probability Pmax=P(x(1)x1:i1) ay tinutukoy, pagkatapos ay kinakalkula ang scaled threshold Pthreshold=pmin×Pmax. Sa final pool ay pumapasok lamang ang mga token na ang indibidwal na probabilidad ay lumalagpas sa threshold na ito.[24]

Ito ay nagbibigay ng adaptivity: kung tiwala ang modelo sa susunod na salita (Pmax=0.9), sa base na pmin=0.1 ang threshold ay 0.09, mahigpit na tinatanggal ang mga noise token. Kung ang modelo ay hindi tiwala (Pmax=0.1), ang threshold ay bumababa sa 0.01, na nagpapasok sa nucleus ng malawak na pagkakaiba-iba ng mga kandidato.[23]

Ang kilalang kahinaan ng Top‑p ay lumalabas sa high-temperature sampling (T>1.0): kapag ang distribusyon ay artipisyal na pinakinis, ang Top‑p ay napipilitang isama sa nucleus ang malaking bilang ng mga mababang-probabilidad na token upang makamit ang itinakdang cumulative sum, na maaaring humantong sa pagkasira ng pagkakaugnay.[23] Mas mahusay ang Min‑p sa gayong mga kondisyon. Sa mga eksperimento ng mga may-akda sa mga benchmark ng siyentipiko at lohikal na kaalaman (GPQA) gamit ang modelong Mistral Large sa matinding temperatura T=3.0, ipinakita ng algorithm na Min‑p ang accuracy na 13.84%, habang ang standard Top‑p 0.9 ay nagbigay ng resulta na 0.89% — sa antas ng random na ingay.[24]

Sa kabila nito, sa akademikong komunidad ay may patuloy na talakayan: ilang kritikal na gawain (halimbawa, arXiv:2506.13681) ay nagtatanong sa universality ng mga kalamangan ng Min‑p sa lahat ng NLP na metric, na nagpoprotesta sa pangangailangan ng karagdagang pag-aaral.[25]

Sa simpleng salita, ang Min-p ay naghahambing ng lahat ng opsyon hindi sa kabuuang suma ng mga probabilidad, kundi sa pinakamalakas na opsyon sa kasalukuyang hakbang. Kaya kung tiwala ang modelo, mas mahigpit nitong inaalis ang mahihinang pagpapatuloy, at kung hindi tiwala — nag-iiwan ng mas maraming katanggap-tanggap na opsyon. Dahil dito, mas maipanatili ng Min-p ang balanse sa pagitan ng pagkakaugnay at pagkakaiba-iba, lalo na kung saan nagsisimula nang pumasa ng masyadong maraming mahihinang salita ang Top-p.

Locally Typical Sampling

Locally typical sampling (Meister et al., 2023) ay pumipili ng mga token na ang informational load (logP) ay malapit sa conditional entropy, batay sa information-theoretic na konsepto ng typicality.[2]

Sa kaibahan sa Top‑p, na nagsisikap na i-minimize ang laki ng nucleus sa pamamagitan ng pagpili ng mga token na may maximum na probabilidad, ang Locally Typical Sampling ay naglulutas ng optimization problem batay sa metric ng informational distance. Kinakalkula ng algorithm ang informational content ng bawat token (logP(x)) at sinusukat ang kanyang absolute na distansya sa conditional entropy H ng modelo. Ang mga token ay hindi ina-rank sa pamamagitan ng raw na probabilidad, kundi sa antas ng kanilang "informational typicality" — pagiging malapit sa inaasahang informational content ng konteksto. Ang mga token ay idinaragdag sa nucleus (sa pataas na pagkakasunod ng distansya sa entropy) hanggang maabot ang threshold ng cumulative probability.[2][26]

Kinagawian ng pamamaraang ito: sa mga estado ng mataas na entropy, ang algorithm ay sadyang nagtatanggal hindi lamang ng noise na mababang-probabilidad na buntot, kundi pati na rin ng labis na mataas-probabilidad na salita na nagdadala ng napakaliit na impormasyon at ginagawang banido ang teksto. Nagpapababa ito ng panganib ng degenerative loops at naglalapitan ng mga metric ng repetitiveness ng teksto sa mga katangian ng mga teksto na isinulat ng tao.[26]

Tail Free Sampling (TFS)

Tail Free Sampling (TFS) — isang hindi gaanong formalized ngunit praktikal na interesanteng pamamaraan sa pagtukoy ng noise tail, batay sa differential analysis ng probability space. Kung ang Top‑p at Min‑p ay gumagana sa mga first-order probability (cumulative sum at basic fraction), ang TFS ay nag-aanalisa ng una at pangalawang derivative ng sorted probability curve. Ang pamamaraan ay inilarawan sa blog ni Trenton Bricken at ipinatupad sa ilang inference engine, bagaman hindi ito nailathala sa anyo ng isang peer-reviewed na artikulo.[27]

Ang pangunahing postulate ng TFS: ang pagsasama kahit ng isang noise token sa sample ay nagdadala ng exponential na banta sa buong autoregressive generation. Sa pamamagitan ng pagkalkula ng pangalawang derivative mula sa mga halaga ng probabilidad, ang algorithm ay nakaka-localize ng "platong" — mga lugar ng kurba kung saan bumabagal ang pagbaba ng mga probabilidad at lumilipat sa mahabang mababang buntot. Ang punto ng paglipat na ito ay nagiging dynamic na hangganan ng truncation: ang mga token bago nito ay kinikilala bilang semantically safe, at ang buong buntot ay tinatanggal.[27]

Sa kabila ng mathematical na elegansya, ang TFS ay nangangailangan ng mas matinding computational na gastos para sa pagkalkula ng mga derivative sa real time, dahil dito ay nahuhuli ito sa mas magaan na mga algorithm sa mga mass commercial na produkto.[27]

p‑less Sampling

p‑less sampling — isang pamamaraan na ganap na nagpapalaya sa inhinyero mula sa pangangailangan na i-configure ang mga hyperparameter ng truncation.[28] Ang pundamental na problema ng lahat ng nakaraang pamamaraan — mula sa Top‑k at Top‑p hanggang sa Min‑p — ay ang pag-asa sa mga static na hyperparameter, na ang mga halaga ay nangangailangan ng expert na pag-aayos at maaaring optimal para sa isang gawain (creative writing) ngunit hindi angkop para sa isa pa (programming).[29]

Ang algorithm na p‑less, nakaugat sa information theory, ay dynamic na nagge-generate ng natatanging threshold ng truncation sa bawat hakbang ng decoding, na sinusuri ang panloob na topologya ng buong probability distribution sa real time. Nag-uulat ang mga may-akda ng katatagan ng pamamaraan sa temperatura fluctuation (temperature robustness): kapag tumataas ang temperatura, ang mga tradisyonal na pamamaraan ay maaaring malubhang magdegrade, habang ang p‑less ay nagpapanatili ng katatagan ng kalidad. Bukod pa rito, salamat sa pagtanggi sa lohika ng cumulative scanning at re-normalization ng malalaking nucleus, ang pamamaraan, ayon sa datos ng mga may-akda, ay nagbibigay ng mas mataas na computational efficiency sa inference stage at nagge-generate ng mas compact na mga sagot nang walang pagkawala ng accuracy sa mga dataset sa matematika, lohika, at creative writing.[29][28]

η‑Sampling

η‑sampling (Hewitt et al., 2022) ay gumagamit ng entropy-dependent na probability threshold, umaangkop sa mga low-entropy na konteksto, kung saan maaaring mag-truncate nang labis ang Top‑p.[30]

Talasanggunian

  • Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; inilathala sa ICLR 2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Fan, A., Lewis, M., & Dauphin, Y. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). Conformal Nucleus Sampling. ACL Findings 2023.
  • Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of LLMs. arXiv:2402.06925.
  • Finlayson, M. et al. (2024). Closing the Curious Case of Neural Text Degeneration. arXiv:2310.01693.
  • Chen, S. J. et al. (2025). Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies. arXiv:2410.03968.
  • Nguyen, M. et al. (2024). Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs. arXiv:2407.01082.
  • Sen, J. et al. (2025). Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs. arXiv:2506.05387.
  • Bricken, T. Tail Free Sampling. [32].
  • p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding. arXiv:2509.23234.

Mga Tala

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). The Curious Case of Neural Text Degeneration. arXiv:1904.09751. [1]
  2. 2.0 2.1 2.2 Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). Locally Typical Sampling. TACL, Vol. 11. arXiv:2202.00666. [2]
  3. 3.0 3.1 3.2 Large Language Models Hallucination: A Comprehensive Survey. arXiv:2510.06265. [3]
  4. Finlayson, M. et al. (2024). Closing the Curious Case of Neural Text Degeneration. arXiv:2310.01693. [4]
  5. 5.0 5.1 5.2 5.3 5.4 5.5 5.6 Hugging Face Transformers. Generation strategies (top‑k, top‑p, temperature). [5]
  6. Hugging Face Transformers. generation/utils.py (исходный код). [6]
  7. 7.0 7.1 7.2 7.3 7.4 OpenAI API Reference. top_p — рекомендация «We generally recommend altering this or temperature but not both». [7]
  8. 8.0 8.1 Microsoft Learn (Azure OpenAI). Text/Chat Completions — parameters. [8]
  9. 9.0 9.1 Anthropic API Reference. Messages API — top_p. [9]
  10. 10.0 10.1 10.2 10.3 10.4 10.5 Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of LLMs. arXiv:2402.06925. [10]
  11. 11.0 11.1 From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs. MDPI. [11]
  12. Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior. Frontiers in AI. [12]
  13. Anthropic. API release notes. [13]
  14. Hugging Face. GenerationConfig (top_p default). [14]
  15. Google AI / Vertex AI. Content generation parameters (topP/topK). [15] [16]
  16. Transformers API. TopPLogitsWarper (параметры и поведение, включая `min_tokens_to_keep`). [17]
  17. OpenAI API. Using reasoning models — parameter support. [18]
  18. OpenAI API. Using GPT-5.2. [19]
  19. Anthropic. Building with extended thinking. [20]
  20. Microsoft Learn (Azure AI Foundry). Reasoning models — supported parameters. [21]
  21. Hugging Face Transformers. MinPLogitsWarper. [22]
  22. vLLM. Sampling Parameters — min_p. [23]
  23. 23.0 23.1 23.2 23.3 Nguyen, M. et al. (2024). Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs. arXiv:2407.01082. [24]
  24. 24.0 24.1 Nguyen, M. et al. Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs. [25]
  25. Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models. arXiv:2506.13681. [26]
  26. 26.0 26.1 Locally Typical Sampling. Transactions of the ACL, MIT Press. [27]
  27. 27.0 27.1 27.2 Bricken, T. Tail Free Sampling. [28]
  28. 28.0 28.1 p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding. OpenReview. [29]
  29. 29.0 29.1 p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding. arXiv:2509.23234. [30]
  30. Hewitt, J., Manning, C. D., & Liang, P. (2022). Truncation Sampling as Language Model Desmoothing. Findings of EMNLP 2022. arXiv:2210.15191. [31]

Tingnan Din

  • Temperatura
  • Malalaking Language Model