---
title: "Top-p sampling (HU)"
source: "https://systems-analysis.info/int/Top-p_sampling_(HU)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(HU)"
language: "hu"
categories:
  - "Category:Core LLM concepts"
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Pages with math errors"
  - "Category:Pages with math render errors"
revision_id: 8215
wiki_created_at: 2026-09-07T01:14:00Z
wiki_modified_at: 2026-09-07T01:14:00Z
downloaded_at: 2026-09-07T23:24:03Z
---

# Top-p sampling (HU)

**Top‑p mintavételezés**, más néven **magmintavételezés** (angolul *Nucleus Sampling*), — sztochasztikus dekódolási módszer autoregresszív nyelvi modellekhez, amelyet széles körben alkalmaznak, többek között nagy nyelvi modellekben (LLM). A módszert 2019-ben javasolta Ari Holtzman és szerzőtársai (arXiv előnyomtatvány — 2019. április; megjelenés az ICLR 2020 konferencián) a rögzített Top‑k mintavételezés továbbfejlesztett alternatívájaként. Az alapötlet — a jelöltek halmazát minden generálási lépésnél dinamikusan a kumulatív valószínűségi küszöb $p$ alapján választják ki.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

## Történeti előzmény: a neurális szövegdegeneráció problémája

A Top‑p megjelenése előtt a domináns dekódolási stratégiák a **mohó keresés** (*greedy search*) és a **sugaras keresés** (*beam search*) voltak, amelyek a valószínűség-maximalizálás paradigmáján alapulnak — a legmagasabb együttes valószínűségű tokensorozat kiválasztásán. A mohó keresés minden lépésnél lokálisan a maximális valószínűségű tokent választja, a sugaras keresés pedig párhuzamosan több generálási hipotézist követ.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

Bár ezek a módszerek hatékonyak voltak zárt feladatokban (gépi fordítás, adatkinyerés), nyílt szöveggenerálási feladatokra (történetírás, párbeszédes rendszerek) való áttéréskor gyakran vezettek **neurális szövegdegenerációhoz** — a kimenet elfajulásához, amelynek során a szöveg sablonossá válik, elveszíti koherenciáját, vagy ismétlésekbe ragad. Ezt a jelenséget részletesen leírja Holtzman és szerzőtársai *The Curious Case of Neural Text Degeneration* (A neurális szövegdegeneráció különös esete) című munkájukban.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

Meister és szerzőtársai a degeneráció problémáját azzal hozzák összefüggésbe, hogy az emberi szöveg az elvárt feltételes entrópiához közeli információtartalmat igyekszik fenntartani, ahelyett hogy csupán minden következő token lokális valószínűségét maximalizálná.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-meister2023-2)</sup>

Alternatívaként jelent meg a **tiszta sztochasztikus mintavételezés** (*sampling without truncation*), amelynek során a tokent valószínűsége szerint véletlenszerűen választják ki. Ez a módszer azonban ellentétes problémát szült: a Softmax függvény sohasem rendel egy tokenhez szigorúan nulla valószínűséget, ezért több tízezer szóból álló szótárban mindig létezik egy kiterjedt zajtoken-zóna. Tiszta mintavételezés esetén megnő az eloszlás megbízhatatlan farkába való kerülés kockázata, ami ronthatja a generált szöveg koherenciáját.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-arxiv-hall-3)</sup> A sztochasztikus választás gazdagságát és a determinisztikus korlátok megbízhatóságát ötvöző igény az eloszláscsonkítási módszerek kidolgozásához vezetett, amelyek zászlóshajója a magmintavételezés (Top‑p) lett.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-finlayson2024-4)</sup>

## Egyszerű magyarázat

**A Top-p mintavételezés** egy olyan módszer, amely a következő token kiválasztását kizárólag a **legvalószínűbb** lehetőségekre korlátozza, anélkül hogy számukat előre rögzítené.

Szöveggenerálás során a nyelvi modell minden lépésnél kiértékeli a lehetséges folytatások sokaságát, és mindegyikhez valószínűséget rendel. Egyes tokenek nagyon valószínűek, mások mérsékelten valószínűek, a szótár nagy része pedig az úgynevezett eloszlás „farkát" alkotja: nagyon kis valószínűségű lehetőségek, amelyek formálisan megengedettek, de gyakran véletlenszerűek, nem illeszkedők, vagy rontják a szöveg koherenciáját.

A Top-p mintavételezés ezt a kis valószínűségű farkat **nem rögzített tokenszám** alapján vágja le, hanem **összesített valószínűség** alapján. Először az összes jelölt a legvalószínűbbtől a legkevésbé valószínűig kerül rendezésre. Majd kiválasztják a felső tokenek minimális halmazát, amelynek összesített valószínűsége eléri a megadott $p$ küszöbértéket — például 0,9 vagy 0,95. Ezután a következő token csak ebből a halmazból kerül véletlenszerűen kiválasztásra, az összes többi lehetőség kizárásra kerül.

Például ha a modell a „Ma az utcán erős…" mondatot folytatja, a legvalószínűbb lehetőségek között szerepelhet „eső" (0,45), „zápor" (0,25), „hó" (0,15) és „szél" (0,10). A $p = 0.90$ küszöb esetén az algoritmus csökkenő valószínűség szerint összegezi a tokeneket: 0,45 + 0,25 = 0,70 (kisebb 0,90-nél), hozzáadja a „hó" tokent: 0,70 + 0,15 = 0,85 (még mindig kisebb 0,90-nél), hozzáadja a „szél" tokent: 0,85 + 0,10 = 0,95 (a küszöb túllépve). A mag négy tokenből áll. Az összes ritkább lehetőséget elveti, a maradék valószínűségeit normalizálja: az „eső" token újranormalizálás utáni valószínűsége $0.45/0.95 \approx 47.4\%$ lesz, és a generátor ebből a frissített eloszlásból választja ki a következő tokent.

A Top‑k-tól való legfontosabb különbség abban áll, hogy a Top‑k mindig **rögzített számú** legjobb szót vesz figyelembe (például 50-et), míg a Top‑p nem rögzíti előre a lehetőségek számát: néha ez 3 szó, néha 20 — minden attól függ, hogyan oszlanak el a valószínűségek az adott lépésnél. Emiatt a módszer alkalmazkodik a kontextushoz, és segít levágni a kis valószínűségű tokenek „farkát", természetesebbé téve a szöveget.

**Még egy példa.** Például a modell a „Reggelire forró… ivott" mondatot folytatja. A legvalószínűbb folytatások között lehetnek: „tea" (0,50), „kávé" (0,30), „csokoládé" (0,08), „húsleves" (0,04), „kefír" (0,03). Ha a küszöb $p = 0.80$, az algoritmus felülről lefelé kezdi összegezni a valószínűségeket: 0,50 a „teánál", majd 0,50 + 0,30 = 0,80. A küszöb már elérve, tehát a mag csak két tokenből áll: „tea" és „kávé". Az összes többi lehetőséget elveti. Újranormalizálás után a „tea" valószínűsége a magon belül $0.50/0.80 = 62.5\%$ lesz, a „kávé" valószínűsége pedig $0.30/0.80 = 37.5\%$. A következő tokent csak e két lehetőség közül választják.

**Más szóval,** a modell először eltávolítja a kis valószínűségű és rossz folytatásokat, majd a maradékból választ. Ez segít neki érthetőbben, természetesebben és „zaj" nélkül írni.

## Koncepció

A Top‑p alapötlete — minden lépésnél kiválasztani a legvalószínűbb tokenek **legkisebb** halmazát, amelyek összesített valószínűsége nem kisebb a megadott $p$ küszöbnél (*mag*, angolul *nucleus*).

Formálisan legyen $x_{(1)},x_{(2)},\ldots$ a $V$ szótár tokenjei, csökkenő feltételes valószínűség $P(x \mid x_{1:i - 1})$ szerint rendezve. Ekkor a $V^{(p)}$ mag a rendezett sorozat legrövidebb prefixeként definiálható, amelynek kumulatív tömege eléri a küszöbértéket:

$m = \min\left\{ n:\sum\limits_{j = 1}^{n}P\left( x_{(j)} \mid x_{1:i - 1} \right) \geq p \right\},\qquad V^{(p)} = \left\{ x_{(1)},\,\ldots,\, x_{(m)} \right\}.$

Más szóval, ez a **befoglalás szerint legkisebb, legvalószínűbb tokenek halmaza**, amelyek összesített valószínűsége nem kisebb $p$-nél.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

A mag meghatározása után a $V^{(p)}$-n kívüli tokenek valószínűségét nullává teszik, a magon belüliekét pedig újranormalizálják (elosztják a tényleges kumulatív tömeggel $p^{\prime} = \sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1})$, így az összeg 1 lesz). A következő tokent ebből a csonkított és újranormalizált eloszlásból mintavételezik.

### Dinamikus adaptáció

- „Éles" eloszlásnál (a modell biztos) a mag kicsi: néhány token már $p$ tömegét adja, ami növeli a koherenciát. Határesetben, ha a legvalószínűbb token valószínűsége már meghaladja a $p$ értéket (például $P(x_{(1)}) = 0.96$ esetén $p = 0.95$ mellett), a mag egyetlen tokenre szűkül, és a Top‑p gyakorlatilag mohó dekódolássá (greedy search) válik.
- „Lapos" eloszlásnál (sok plauzibilis folytatás) a mag nagy: a választék bővül, nő a változatosság.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

## Összehasonlítás más dekódolási módszerekkel

### Top‑p vs. Top‑k

- A **Top‑k** mindig a $k$ legvalószínűbb token rögzített számából választ. „Éles" eloszlásoknál ez fölösleges, kevésbé valószínű lehetőségeket adhat hozzá „a szám kedvéért", „lapos" eloszlásoknál viszont épp ellenkezőleg — levághat ésszerű folytatásokat, amelyek nem kerültek be a top‑$k$ listába.
- A **Top‑p** a jelöltek halmazának méretét az adott lépés adatai alapján igazítja, ami rugalmasabb és stabilabb viselkedést eredményez különböző eloszlástípusoknál.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>
- A gyakorlatban a Top‑k és a Top‑p **egyidejűleg** is alkalmazható. Ebben az esetben először a top‑$k$ tokent választják ki, majd ezen a korlátozott halmazon belül keresik a $p$ küszöbű magot. A pontos sorrend és indoklás az implementációtól függ, de ez a kombináció elterjedt megközelítésként dokumentált.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)</sup>

**Egyszerűbben fogalmazva,** a Top-k előre eldönti, hány lehetőséget hagy meg, míg a Top-p a helyzettől függően annyi lehetőséget hagy meg, amennyi az adott kontextusban szükséges. Ezért a Top-p általában rugalmasabb, a Top-k pedig egyszerűbb és kiszámíthatóbb.

### Top‑p vs. Hőmérséklet

- A **Hőmérséklet** (*temperature*) az eloszlás egész alakját átformálja (élesebbé vagy simábbá teszi), de **nem vágja le** a tokeneket: még a kis valószínűségű lehetőségek is megőrzik nullán felüli esélyüket.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)</sup>
- A **Top‑p** az eloszlás farkának **kemény csonkítását** vezeti be — a kis valószínűségű tokenek teljesen kizárásra kerülnek a mintavételezésből, ami segít megelőzni az egyértelműen nem illeszkedő folytatásokat.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>
- **Az alkalmazás sorrendje.** Szabványos pipeline-okban (például a Hugging Face Transformers-ben) először a hőmérsékletet alkalmazzák a logitekre (az eloszlás alakja megváltozik), majd alkalmazható a Top‑k, és csak ezután a Top‑p (a farok csonkítása). Ez magyarázza, hogy a „kettős hatást" miért nehéz kontrollálni: a hőmérséklet megváltoztatása megváltoztatja azt a kumulatív tömeget, amellyel a Top‑p ezután dolgozik.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)</sup>

**Egyszerűbben fogalmazva,** a hőmérséklet azt változtatja, **mennyire szabadon** választ szavakat a modell, a Top-p pedig azt dönti el, **mely lehetőségek közül egyáltalán lehet választani**. Ezért a hőmérséklet a véletlenszerűség mértékét befolyásolja, a Top-p pedig azt, hogy mennyire mehet el a modell a kevésbé valószínű folytatások irányába.

### A műveletek sorrendje a Hugging Face Transformers implementációban

A sampling-processzorok alkalmazásának sorrendje az adott könyvtártól függ. A Hugging Face Transformers-ben (v4.x verziótól kezdve) a tárgyalt három paraméter logit-processzorainak alapértelmezett hozzáadási sorrendje a következő:<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-code-6)</sup>

1.  **A logitek hőmérsékleti skálázása.** Minden token logitját elosztják a hőmérséklet értékével a Softmax függvény exponenciálása előtt. A hőmérséklet módosítja az eloszlás alakját, előkészítve azt a późniejsze szűrésre.
2.  **Top‑k szűrő** (ha konfigurálva van): a szótárat rögzített számú jelöltre csonkítja.
3.  **Top‑p szűrő**: a már szűkített token-poolra alkalmazzák a kumulatív csonkítást.
4.  A megmaradó valószínűségek **újranormalizálása** és sztochasztikus mintavételezés.

A gyakorlatban elterjedt a mérsékelt hőmérséklet (0,7), a széles Top‑p mag (0,95) és a Top‑k korlát (50) kombinációja: a hőmérséklet biztosítja az alapvető variativitást, a Top‑k durva biztosítékként működik, a Top‑p pedig kontextusfüggő finomhangolást végez.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)</sup>

**Egyszerűbben fogalmazva,** a modell először a hőmérséklettel teszi a választást többé-kevésbé „szabaddá", majd szükség esetén a Top-k segítségével korlátozza a jelöltek számát, végül a Top-p eltávolítja a túl gyenge lehetőségeket. Ez a sorrend segít először beállítani a választás általános jellegét, majd levágni a fölöslegest.

### Javaslat: egyszerre csak egy paramétert állítson be

A modellszolgáltatók azt javasolják, hogy a generálási stílus beállításakor **vagy** a *temperature*, **vagy** a *top_p* értékét változtassák meg, de a kettőt ne egyszerre. Ez a javaslat az OpenAI, az Azure OpenAI és az Anthropic hivatalos dokumentációjában szerepel.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-top-p-7)[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-azure-rec-8)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-anthropic-params-9)</sup>

A gyakorlati indoklás: mindkét paraméter befolyásolja a valószínűségi eloszlás alakját (a hőmérséklet a görbe meredekségét változtatja, a Top‑p a levágási pontot állítja be), ezért egyidejű módosításuk megnehezíti a diagnosztikát — nem lehet meghatározni, hogy melyik paraméter vezetett a kimenet javulásához vagy romlásához. Ezen kívül mindkét paraméter szélsőségesen alacsony értékei esetén (például *Temperature ≈ 0* és *Top‑p ≈ 0,01*) a mag a gyakorlatban egyetlen tokenre szűkül, ami a mintavételezést valójában mohó kereséssé alakítja.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-top-p-7)</sup>

Néhány reasoning-modell API szinten tovább korlátozza ezeknek a paramétereknek a beállítását, ami az ilyen modelleknél értelmetlenné teszi az egyidejű módosításuk kérdését (lásd a „Könyvtárakkal és API-kkal való kompatibilitás" részt).<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-top-p-7)</sup>

Elterjedt mérnöki heurisztika: nagy reprodukálhatóságot igénylő feladatokhoz — alacsony hőmérsékletet alkalmazzon (akár nullát is); kreatív feladatokhoz — hagyja a hőmérsékletet az alap szinten (1,0), és a variativitást a Top‑p paraméterrel szabályozza, vagy rögzítse a Top‑p értékét 1,0-n és változtassa a hőmérsékletet. A konkrét ajánlások szolgáltatónként eltérhetnek.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-top-p-7)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-anthropic-params-9)</sup>

## Hatás a tényszerűségre és a hallucinációkra

A dekódolási stratégia megválasztása nem csupán a generált szöveg stílusát befolyásolhatja, hanem a ténybeli hibák gyakoriságát és típusát is. A **hallucinációk** jelensége — hamis vagy kontextusnak ellentmondó információk magabiztos generálása — a generatív mesterséges intelligencia egyik központi problémája. Empirikus kutatások azt mutatják, hogy a mintavételezési stratégiák hallucinációkra gyakorolt hatása a feladattól, a modelltől és a konkrét paraméterbeállítástól függ.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-arxiv-hall-3)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)</sup>

### A sztochasztikus mintavételezés során keletkező hibák mechanizmusa

Magas Top‑p értékeknél (például 0,95) a modell a valószínűségi tömeg 95%-át lefedő magot alkot. Magas entrópia állapotaiban (például kevéssé ismert tény megválaszolásakor) ez a mag több száz kis valószínűségű tokent is magában foglalhat. A sztochasztikus mintavételezés ilyen körülmények között nyelvtanilag helyes, de szemantikailag a ténybeli igazsághoz nem kapcsolódó tokent nyerhet ki. Amint a kontextusba kerül, ez a token befolyásolhatja a generálás következő lépéseit, mivel a modell az összes korábbi tokent — beleértve a hibásakat is — figyelembe véve folytatja a generálást.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-arxiv-hall-3)[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)</sup>

### Nyílt és zárt feladatok dichotómiája

Nagyméretű kísérletek a generálás minőségének feladattípustól való függését tárják fel. Esszéírási vagy párbeszédes rendszereknél a sztochasztikus módszerek (Top‑p, Temperature) maradnak az élenjárók, míg szigorúan determinisztikus területeken jelentősen elmaradhatnak a determinisztikus megközelítésektől.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)</sup>

A programkód-szintézis benchmark-okon (HumanEval, MBPP) és matematikai feladatok megoldásánál (GSM8K) a determinisztikus módszerek (Beam Search, Greedy Decoding) jobb eredményeket mutatnak a Top‑p alapú megközelítésekhez képest. A GSM8K dataset, amely 8500 matematikai feladatot tartalmaz, amelyek 2–8 számítási lépést igényelnek, szemlélteti a sztochasztikus választás sebezhetőségét ilyen feladatoknál: a csonkított Top‑p eloszláson keresztüli véletlenszerűség befecskendezése a modell érvelési láncát (Chain‑of‑Thought) a közbenső lépések bármelyikénél megzavarhatja. Tan és szerzőtársai hangsúlyozzák, hogy a dekódolási módszer hatékonysága erősen függ a konkrét feladattól (*task‑dependent*).<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)</sup>

### A dekódolási szintű hallucinációk elleni módszerek

A sztochasztikus mintavételezés által kiváltott hallucinációs hatások elleni küzdelemre fejlett dekódolás-augmentálási módszereket dolgoztak ki:

- **Kontasztív dekódolás** (*Contrastive Decoding*, DoLa) — a fő modell és egy kisebb segédmodell közötti logaritmikus valószínűségi rést optimalizálja, hitelességi szűrőként funkcionálva.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)</sup>
- **SH2** (*Self‑Highlighted Hesitation*) — mesterségesen arra kényszeríti a dekódert, hogy „habozzon" alacsony bizonyosságú tokenek esetén.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-illusion-insight-11)</sup>
- **Irányított aktiváció-vetítés** (SEA) — a hallucinációs jeleket a vektoros reprezentáció szintjén nyomja el.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-illusion-insight-11)</sup>

Emellett a minőségi illesztéssel (*alignment*) rendelkező modern modellek mélyebb tényismerettel rendelkeznek, ami csökkenti belső eloszlásaik entrópiáját, és kevésbé teszi őket fogékonnyá a tényderadációra még magas Top‑p értékeknél is.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)[\[12\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-frontiers-hall-12)</sup>

## Gyakorlati alkalmazás és ajánlások

A Top‑p széles körben használatos a modern LLM-ekben rugalmasság és kezelhetőség kombinációjának köszönhetően.

- **Tipikus értéktartomány.** A gyakorlatban gyakran alkalmazzák a **Failed to parse (syntax error): {\displaystyle p \approx 0.90 ext{–}0.95}** értéket. Az alapértelmezett érték szolgáltatónként eltér: az OpenAI-nál \`top_p\` = **1,0** (a csonkítás ténylegesen kikapcsolt), az Anthropic-nál — **0,99**, sok Google Gemini modellnél — **0,95**.<sup>[\[13\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-anthropic-release-13)</sup> A Hugging Face Transformers könyvtárban a keretrendszer alapértelmezése szintén **1,0**, bár egyes modellek felülírhatják ezt a saját \`generation_config.json\` fájljukban.<sup>[\[14\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-genconfig-14)</sup> Így a 0,9–0,95 elterjedt **ajánlott gyakorlati tartomány**, de nem univerzális alapértelmezett szabvány.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)[\[15\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-vertex-params-15)</sup>
  - Az 1,0-hoz közeli értékek (például 0,98–0,99) növelik a változatosságot: több token kerül a magba.
  - Kis értékek (például 0,80–0,90) növelik a determinisztikusságot és a kimenet „visszafogottságát".
  - Ha $p = 1$, a Top‑p szerinti csonkítás megszűnik: a választás az egész szótár alapján történik (a hőmérséklet és egyéb bekapcsolt dekódolási szűrők figyelembevételével).<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-gen-5)</sup>

<!-- -->

- **Kompatibilitás könyvtárakkal és API-kkal.**
  - A Hugging Face Transformers-ben a *TopPLogitsWarper* kerül implementálásra, ahol kiegészítőként a \`min_tokens_to_keep\` küszöb is alkalmazásra kerül (alapértelmezetten 1). Ez egy implementációs védőrészlet: standard $p \in (0,\, 1\rbrack$ értékeknél az üres mag a definícióból adódóan sem keletkezhet, azonban a paraméter garantálja a helyes működést határesetekben.<sup>[\[16\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-warp-16)</sup>
  - Számos API-ban a \`top_p\` paraméter elérhető, míg a \`top_k\` hiányozhat; a paraméterek támogatása és szemantikája **az adott modelltől és üzemmódtól függ**. A reasoning-modellek általában API szinten korlátozzák a sztochasztika beállítását. Például az aktuális OpenAI dokumentációban a \`temperature\` és \`top_p\` paraméterek explicit módon csak GPT‑5.2 esetén támogatottak, ha \`reasoning.effort = none\`; a GPT‑5.2 vagy GPT‑5.1 modelleknek más \`reasoning\` értékekkel, valamint a korábbi GPT‑5 modelleknek (\`gpt‑5\`, \`gpt‑5‑mini\`, \`gpt‑5‑nano\`) küldött kérések ezeknek a mezőknek az átadásakor hibát generálnak. Az előző generációs reasoning-modellek (o1, o3) szintén korlátozzák vagy rögzítik ezeket.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-top-p-7)[\[17\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-reasoning-17)[\[18\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-openai-gpt52-18)</sup> Az Anthropic Claude API-jában kibővített gondolkodás (extended thinking) bekapcsolásakor a \`temperature\` és \`top_k\` módosítása tiltott, azonban a \`top_p\` 0,95–1,0 tartományban engedélyezett; harmadik fél platformjain (például Amazon Bedrock) a korlátozások eltérhetnek.<sup>[\[19\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-anthropic-thinking-19)</sup> **A szolgáltatói korlátozások verzióról verzióra gyakran változnak**; ajánlott az aktuális dokumentációt ellenőrizni.<sup>[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-azure-rec-8)[\[20\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-azure-reasoning-20)</sup>

<!-- -->

- **Hosszú szövegek és ismételhetőség.** Kísérletek sorozata kimutatta, hogy a nucleus sampling csökkenti az elfajulásra való hajlamot (ismétlések, sztereotip kifejezések) a greedy/beam és a rögzített Top‑k módszerekhez képest, különösen hosszú sorozatoknál.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-holtzman2019-1)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tan2024-10)</sup>

## Modern alternatívák

A nucleus sampling 2019-es publikálása óta több alternatív sztochasztikus dekódolási módszert javasoltak, amelyek továbbfejlesztik vagy kiegészítik a Top‑p ötletét:

### Min‑p mintavételezés

A **Min‑p mintavételezés** (Nguyen és mtsai., 2024) azokat a tokeneket tartja meg, amelyek valószínűsége nem kisebb $p_{\min}imesP(x_{(1)})$-nél, azaz a küszöbértéket a legvalószínűbb tokenhez viszonyítva határozza meg. Az ICLR 2025 konferencián szóbeli előadásra elfogadták; számos népszerű keretrendszerben implementálva, köztük a Hugging Face Transformers-ben<sup>[\[21\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-hf-minp-21)</sup> és a vLLM-ben<sup>[\[22\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-vllm-minp-22)</sup>.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-23)</sup>

A Top‑p-től való legfontosabb különbség a küszöb típusában rejlik: a Top‑p **abszolút** küszöböt használ a kumulatív valószínűségösszeg alapján, míg a Min‑p **relatív** küszöböt állapít meg, amely a legvalószínűbb token valószínűségéhez van arányosítva.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-23)</sup>

Matematikailag az algoritmus a következőképpen működik: minden lépésnél meghatározza a maximális valószínűséget $P_{\max} = P(x_{(1)} \mid x_{1:i - 1})$, majd kiszámítja a skálázott küszöbértéket $P_{ext{threshold}} = p_{\min}imesP_{\max}$. A végső poolba csak azok a tokenek kerülnek, amelyek egyéni valószínűsége meghaladja ezt a küszöböt.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-arxiv-24)</sup>

Ez adaptivitást biztosít: ha a modell biztos a következő szóban ($P_{\max} = 0.9$), az alap $p_{\min} = 0.1$ esetén a küszöb 0,09 lesz, amely szigorúan kiszűri a zajtokeneket. Ha viszont a modell bizonytalan ($P_{\max} = 0.1$), a küszöb 0,01-re csökken, széles körű jelöltek befogadását lehetővé téve a magba.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-23)</sup>

A Top‑p ismert gyengesége magas hőmérsékletű mintavételezésnél ($T > 1.0$) mutatkozik meg: amikor az eloszlást mesterségesen simítják, a Top‑p kénytelen nagyszámú kis valószínűségű tokent bevenni a magba a kívánt kumulatív összeg eléréséhez, ami a koherencia romlásához vezethet.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-23)</sup> A Min‑p jobban boldogul ilyen körülmények között. A szerzők kísérleteiben a GPQA tudományos és logikai tudásbenchmark-okon, Mistral Large modellel, szélsőséges hőmérsékleten $T = 3.0$ a Min‑p algoritmus 13,84%-os pontosságot ért el, míg a standard Top‑p 0,9 csupán 0,89%-ot produkált — a véletlenszerű zajszint szintjén.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-arxiv-24)</sup>

Emellett az akadémiai körökben vita folyik: egyes kritikai munkák (például arXiv:2506.13681) megkérdőjelezik a Min‑p előnyeinek univerzalitását az összes NLP-metrika tekintetében, és további vizsgálatok szükségességére mutatnak rá.<sup>[\[25\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-minp-critique-25)</sup>

**Egyszerűbben fogalmazva,** a Min-p nem az összesített valószínűséggel, hanem az aktuális lépés legerősebb lehetőségével hasonlítja össze az összes variánst. Ezért, ha a modell biztos, keményebben eltávolítja a gyenge folytatásokat, ha bizonytalan — több elfogadható lehetőséget hagy meg. Emiatt a Min-p jobban megőrizheti az egyensúlyt a koherencia és a változatosság között, különösen ott, ahol a Top-p kezd túl sok gyenge szót átengedni.

### Locally typical sampling

A **Locally typical sampling** (Meister és mtsai., 2023) azokat a tokeneket választja ki, amelyek információtartalma ($- \log P$) közel van a feltételes entrópiához, az információelméleti tipikusság fogalmára támaszkodva.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-meister2023-2)</sup>

Ellentétben a Top‑p-vel, amely a mag méretét minimalizálva a maximális valószínűségű tokeneket választja, a Locally Typical Sampling információs távolság metrikán alapuló optimalizálási feladatot old meg. Az algoritmus kiszámítja minden token információtartalmát ($- \log P(x)$), és méri annak abszolút távolságát a modell feltételes entrópiájától $H$. A tokenek nem nyers valószínűségük, hanem „információs tipikusságuk" foka — az elvárt kontextus-információtartalomhoz való közelségük — szerint rangsorolódnak. A tokenek az entrópiától való távolságuk növekvő sorrendjében kerülnek a magba, a kumulatív valószínűségi küszöb eléréséig.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-meister2023-2)[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-typical-mit-26)</sup>

Ennek a megközelítésnek következménye: magas entrópia állapotaiban az algoritmus célzottan kizárja nemcsak a zajos kis valószínűségű farkat, hanem a túlságosan magas valószínűségű szavakat is, amelyek túl kevés információt hordoznak és triviálissá teszik a szöveget. Ez csökkenti a degeneratív hurkok kockázatát, és a szövegismétlési metrikákat az emberi szövegekre jellemző értékekhez közelíti.<sup>[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-typical-mit-26)</sup>

### Tail Free Sampling (TFS)

A **Tail Free Sampling** (TFS) — kevésbé formalizált, de gyakorlatilag érdekes megközelítés a zajos farok azonosítására, amely a valószínűségi tér differenciálanalízisén alapul. Míg a Top‑p és a Min‑p elsőrendű valószínűségekkel (kumulatív összeggel és alaptörtekkel) operál, addig a TFS a rendezett valószínűségi görbe **első és második deriváltját** elemzi. A módszert Trenton Bricken blogjában írta le, és számos inference-motorban implementálták, bár nem jelent meg lektorált cikk formájában.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tfs-bricken-27)</sup>

A TFS alapvető állítása: akár egyetlen zajos token mintába kerülése is exponenciális veszélyt jelent az egész autoregresszív generálásra. A valószínűségi értékek második deriváltját számítva az algoritmus lokalizálja a „fennsíkokat" — a görbe azon szakaszait, ahol a valószínűségek esése lelassul és hosszú sekély farokba megy át. Ennek a töréspontnak helye lesz a dinamikus csonkítási határ: az előtte lévő tokeneket szemantikailag biztonságosnak tekintik, az egész farkot pedig eltávolítják.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tfs-bricken-27)</sup>

Matematikai elegancia ellenére a TFS intenzívebb számítási ráfordítást igényel a valóidejű derivált-számításhoz, aminek következtében a tömeges kereskedelmi termékekben alulmarad a könnyebb súlyú algoritmusokkal szemben.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-tfs-bricken-27)</sup>

### *p*‑less sampling

A **$p$‑less sampling** — egy olyan módszer, amely teljesen megszabadítja a mérnököt a csonkítási hiperparaméterek beállításának szükségességétől.<sup>[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-pless-openreview-28)</sup> Minden korábbi módszer — a Top‑k-tól és a Top‑p-től a Min‑p-ig — alapvető problémája a statikus hiperparaméterektől való függőség, amelyek értékeinek beállítása szakértelmet igényel, és optimálisak lehetnek egy feladathoz (kreatív írás), de nem megfelelőek egy másikhoz (programozás).<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-pless-arxiv-29)</sup>

Az információelméleten gyökerező $p$‑less algoritmus minden dekódolási lépésnél egyedi csonkítási küszöbértéket generál dinamikusan, valós időben elemezve a teljes valószínűségi eloszlás belső topológiáját. A szerzők a módszer hőmérsékleti ingadozásokkal szembeni stabilitásáról (*temperature robustness*) számolnak be: a hőmérséklet növekedésekor a hagyományos módszerek jelentősen degradálódhatnak, míg a $p$‑less stabil minőséget tart fenn. Ezen kívül a kumulatív szkennelés logikájának és a nagy magok újranormalizálásának elhagyásával a módszer a szerzők adatai szerint magasabb számítási hatékonyságot biztosít az inferencia szakaszában, és tömörebb válaszokat generál pontosságveszteség nélkül matematikai, logikai és kreatív írási datasetek esetén.<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-pless-arxiv-29)[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-pless-openreview-28)</sup>

### η‑mintavételezés

Az **η‑mintavételezés** (Hewitt és mtsai., 2022) entrópiafüggő valószínűségi küszöböt alkalmaz, alkalmazkodva az alacsony entrópiájú kontextusokhoz, ahol a Top‑p túlzottan csonkíthat.<sup>[\[30\]](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_note-eta-30)</sup>

## Irodalom

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; megjelent az ICLR 2020-on). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Fan, A., Lewis, M., & Dauphin, Y. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). *Conformal Nucleus Sampling*. ACL Findings 2023.
- Tan, Q. és mtsai. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925.
- Finlayson, M. és mtsai. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Chen, S. J. és mtsai. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies*. arXiv:2410.03968.
- Nguyen, M. és mtsai. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082.
- Sen, J. és mtsai. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[32]</a>.
- *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234.

## Megjegyzések

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-holtzman2019_1-10)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-meister2023-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-meister2023_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-meister2023_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-meister2023_2-2)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *TACL*, Vol. 11. arXiv:2202.00666. <a href="https://aclanthology.org/2023.tacl-1.7.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-hall-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-arxiv-hall_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-arxiv-hall_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-arxiv-hall_3-2)</sup> *Large Language Models Hallucination: A Comprehensive Survey*. arXiv:2510.06265. <a href="https://arxiv.org/abs/2510.06265" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-finlayson2024-4">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-finlayson2024_4-0) Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-hf-gen-5">↑ <sup>[5.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-gen_5-6)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf-code-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-code_6-0) Hugging Face Transformers. *generation/utils.py* (исходный код). <a href="https://github.com/huggingface/transformers/blob/main/src/transformers/generation/utils.py" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-top-p-7">↑ <sup>[7.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-top-p_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-top-p_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-top-p_7-2)</sup> <sup>[7.3](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-top-p_7-3)</sup> <sup>[7.4](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-top-p_7-4)</sup> OpenAI API Reference. *top_p* — рекомендация «We generally recommend altering this or temperature but not both». <a href="https://developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-azure-rec-8">↑ <sup>[8.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-azure-rec_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-azure-rec_8-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/reference" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-anthropic-params-9">↑ <sup>[9.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-anthropic-params_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-anthropic-params_9-1)</sup> Anthropic API Reference. *Messages API — top_p*. <a href="https://docs.anthropic.com/en/api/messages" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-tan2024-10">↑ <sup>[10.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-3)</sup> <sup>[10.4](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-4)</sup> <sup>[10.5](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tan2024_10-5)</sup> Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925. <a href="https://aclanthology.org/2024.emnlp-main.489.pdf" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-illusion-insight-11">↑ <sup>[11.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-illusion-insight_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-illusion-insight_11-1)</sup> *From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs*. MDPI. <a href="https://www.mdpi.com/2673-2688/6/10/260" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-frontiers-hall-12">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-frontiers-hall_12-0) *Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior*. Frontiers in AI. <a href="https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1622292/full" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-anthropic-release-13">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-anthropic-release_13-0) Anthropic. *API release notes*. <a href="https://docs.anthropic.com/en/release-notes/api" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-hf-genconfig-14">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-genconfig_14-0) Hugging Face. *GenerationConfig (top_p default)*. <a href="https://huggingface.co/docs/transformers/main_classes/text_generation" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-vertex-params-15">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-vertex-params_15-0) Google AI / Vertex AI. *Content generation parameters (topP/topK)*. <a href="https://ai.google.dev/gemini-api/docs/prompting-strategies" class="external autonumber" rel="nofollow">[15]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/multimodal/content-generation-parameters" class="external autonumber" rel="nofollow">[16]</a></span>
16. <span id="cite_note-hf-warp-16">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-warp_16-0) Transformers API. *TopPLogitsWarper* (параметры и поведение, включая \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-openai-reasoning-17">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-reasoning_17-0) OpenAI API. *Using reasoning models — parameter support*. <a href="https://developers.openai.com/docs/guides/reasoning" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-openai-gpt52-18">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-openai-gpt52_18-0) OpenAI API. *Using GPT-5.2*. <a href="https://developers.openai.com/api/docs/guides/latest-model/" class="external autonumber" rel="nofollow">[19]</a></span>
19. <span id="cite_note-anthropic-thinking-19">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-anthropic-thinking_19-0) Anthropic. *Building with extended thinking*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking" class="external autonumber" rel="nofollow">[20]</a></span>
20. <span id="cite_note-azure-reasoning-20">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-azure-reasoning_20-0) Microsoft Learn (Azure AI Foundry). *Reasoning models — supported parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/reasoning" class="external autonumber" rel="nofollow">[21]</a></span>
21. <span id="cite_note-hf-minp-21">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-hf-minp_21-0) Hugging Face Transformers. *MinPLogitsWarper*. <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.MinPLogitsWarper" class="external autonumber" rel="nofollow">[22]</a></span>
22. <span id="cite_note-vllm-minp-22">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-vllm-minp_22-0) vLLM. *Sampling Parameters — min_p*. <a href="https://docs.vllm.ai/en/latest/serving/sampling_params.html" class="external autonumber" rel="nofollow">[23]</a></span>
23. <span id="cite_note-minp-23">↑ <sup>[23.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp_23-1)</sup> <sup>[23.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp_23-2)</sup> <sup>[23.3](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp_23-3)</sup> Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082. <a href="https://arxiv.org/abs/2407.01082" class="external autonumber" rel="nofollow">[24]</a></span>
24. <span id="cite_note-minp-arxiv-24">↑ <sup>[24.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp-arxiv_24-0)</sup> <sup>[24.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp-arxiv_24-1)</sup> Nguyen, M. et al. *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/pdf/2407.01082" class="external autonumber" rel="nofollow">[25]</a></span>
25. <span id="cite_note-minp-critique-25">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-minp-critique_25-0) *Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models*. arXiv:2506.13681. <a href="https://arxiv.org/abs/2506.13681" class="external autonumber" rel="nofollow">[26]</a></span>
26. <span id="cite_note-typical-mit-26">↑ <sup>[26.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-typical-mit_26-0)</sup> <sup>[26.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-typical-mit_26-1)</sup> *Locally Typical Sampling*. Transactions of the ACL, MIT Press. <a href="https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00536/114593/Locally-Typical-Sampling" class="external autonumber" rel="nofollow">[27]</a></span>
27. <span id="cite_note-tfs-bricken-27">↑ <sup>[27.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tfs-bricken_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tfs-bricken_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-tfs-bricken_27-2)</sup> Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[28]</a></span>
28. <span id="cite_note-pless-openreview-28">↑ <sup>[28.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-pless-openreview_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-pless-openreview_28-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. OpenReview. <a href="https://openreview.net/forum?id=ItFuNJQGH4" class="external autonumber" rel="nofollow">[29]</a></span>
29. <span id="cite_note-pless-arxiv-29">↑ <sup>[29.0](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-pless-arxiv_29-0)</sup> <sup>[29.1](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-pless-arxiv_29-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234. <a href="https://arxiv.org/abs/2509.23234" class="external autonumber" rel="nofollow">[30]</a></span>
30. <span id="cite_note-eta-30">[↑](https://systems-analysis.info/int/Top-p_sampling_(HU)#cite_ref-eta_30-0) Hewitt, J., Manning, C. D., & Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. Findings of EMNLP 2022. arXiv:2210.15191. <a href="https://arxiv.org/abs/2210.15191" class="external autonumber" rel="nofollow">[31]</a></span>

## Lásd még

- Hőmérséklet
- Nagy nyelvi modellek
