---
title: "Top-p sampling (PL)"
source: "https://systems-analysis.info/int/Top-p_sampling_(PL)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(PL)"
language: "pl"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Pages with math errors"
  - "Category:Pages with math render errors"
  - "Category:Polish"
revision_id: 8220
wiki_created_at: 2026-09-07T01:14:06Z
wiki_modified_at: 2026-09-07T01:14:06Z
downloaded_at: 2026-09-07T23:24:06Z
---

# Top-p sampling (PL)

**Próbkowanie Top‑p**, znane również jako **próbkowanie jądrowe** (ang. *Nucleus Sampling*), — stochastyczna metoda dekodowania dla autoregresywnych modeli językowych, szeroko stosowana między innymi w dużych modelach językowych (LLM). Metoda została zaproponowana w 2019 roku przez Ariego Holtzmanana i współautorów (preprint arXiv — kwiecień 2019; publikacja na ICLR 2020) jako udoskonalona alternatywa dla stałego próbkowania Top‑k. Jej idea polega na dynamicznym doborze zbioru kandydatów na każdym kroku generacji na podstawie progu skumulowanego prawdopodobieństwa $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

## Tło historyczne: problem degeneracji tekstu przez sieci neuronowe

Przed pojawieniem się Top‑p dominującymi strategiami dekodowania były **przeszukiwanie zachłanne** (*greedy search*) oraz **przeszukiwanie wiązkowe** (*beam search*), oparte na paradygmacie maksymalizacji wiarygodności — wyboru ciągu tokenów o najwyższym łącznym prawdopodobieństwie. Przeszukiwanie zachłanne na każdym kroku lokalnie wybiera token o maksymalnym prawdopodobieństwie, a przeszukiwanie wiązkowe równolegle śledzi kilka hipotez generacji.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

Choć metody te były skuteczne w zadaniach zamkniętych (tłumaczenie maszynowe, ekstrakcja danych), przy przejściu do zadań otwartej generacji tekstu (pisanie opowiadań, systemy dialogowe) często prowadziły do **neuronowej degeneracji tekstu** — degeneracji wyjścia, przy której tekst staje się szablonowy, traci spójność lub zapętla się na powtórzeniach. Zjawisko to zostało szczegółowo opisane przez Holtzmanana i współautorów w pracy *The Curious Case of Neural Text Degeneration*.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

Meister i współautorzy wiążą problem degeneracji z tym, że tekst ludzki dąży do utrzymania zawartości informacyjnej bliskiej oczekiwanej entropii warunkowej, a nie jedynie do maksymalizacji lokalnego prawdopodobieństwa każdego kolejnego tokenu.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-meister2023-2)</sup>

Alternatywą stało się **czyste stochastyczne próbkowanie** (*sampling without truncation*), przy którym token jest wybierany losowo zgodnie z jego prawdopodobieństwem. Jednak metoda ta zrodziła odwrotny problem: funkcja Softmax nigdy nie przypisuje tokenowi prawdopodobieństwa ściśle równego zeru, dlatego w słowniku złożonym z dziesiątek tysięcy słów zawsze istnieje rozległa strefa tokenów szumowych. Przy czystym próbkowaniu wzrasta ryzyko trafienia w zawodny ogon rozkładu, co może pogarszać spójność generowanego tekstu.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-arxiv-hall-3)</sup> Konieczność połączenia bogactwa wyboru stochastycznego z niezawodnością ograniczeń deterministycznych doprowadziła do opracowania metod obcinania rozkładu, których flagowym przedstawicielem stało się próbkowanie jądrowe (Top‑p).<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-finlayson2024-4)</sup>

## Proste wyjaśnienie

**Próbkowanie Top-p** to sposób ograniczenia wyboru następnego tokenu wyłącznie do **najbardziej prawdopodobnych** wariantów, bez wcześniejszego ustalania ich liczby.

Podczas generowania tekstu model językowy na każdym kroku ocenia wiele możliwych kontynuacji i przypisuje każdej z nich pewne prawdopodobieństwo. Niektóre tokeny okazują się bardzo prawdopodobne, inne — umiarkowanie prawdopodobne, a większość słownika tworzy tak zwany „ogon" rozkładu: warianty o bardzo małym prawdopodobieństwie, które są formalnie dopuszczalne, ale często okazują się przypadkowe, nieodpowiednie lub pogarszają spójność tekstu.

Próbkowanie Top-p odcina ten mało prawdopodobny ogon **nie według stałej liczby tokenów**, lecz według **sumy prawdopodobieństwa**. Najpierw wszyscy kandydaci są porządkowani od najbardziej prawdopodobnych do najmniej prawdopodobnych. Następnie wybierany jest minimalny zbiór najlepszych tokenów, których łączne prawdopodobieństwo osiąga zadany próg $p$ — na przykład 0,9 lub 0,95. Po tym kolejny token jest wybierany losowo wyłącznie z tego zbioru, a wszystkie pozostałe warianty są wykluczane.

Na przykład, jeśli model kontynuuje zdanie „Dzisiaj na ulicy padał silny…\\, wśród najbardziej prawdopodobnych wariantów mogą znaleźć się „deszcz" (0,45), „ulewa" (0,25), „śnieg" (0,15) i „wiatr" (0,10). Przy progu $p = 0.90$ algorytm sumuje tokeny według malejącego prawdopodobieństwa: 0,45 + 0,25 = 0,70 (mniej niż 0,90), dodaje „śnieg": 0,70 + 0,15 = 0,85 (nadal mniej niż 0,90), dodaje „wiatr": 0,85 + 0,10 = 0,95 (próg przekroczony). Jądro zostało uformowane z czterech tokenów. Wszystkie rzadsze warianty są odrzucane, a prawdopodobieństwa pozostałych są normalizowane: tak oto prawdopodobieństwo tokenu „deszcz" po renormalizacji wyniesie $0.45/0.95 \approx 47.4\%$, a generator wybierze następny token właśnie z tego zaktualizowanego rozkładu.

Główna różnica w stosunku do Top‑k polega na tym, że Top‑k zawsze bierze **stałą liczbę** najlepszych słów (na przykład 50), podczas gdy Top‑p nie ustala liczby wariantów z góry: czasem może to być 3 słowa, czasem 20 — wszystko zależy od tego, jak rozkładają się prawdopodobieństwa na danym kroku. Dzięki temu metoda dostosowuje się do kontekstu i pomaga odcinać „ogon" mało prawdopodobnych tokenów, czyniąc tekst bardziej naturalnym.

**Jeszcze jeden przykład.** Na przykład model kontynuuje zdanie „Na śniadanie wypił gorący…\\. Wśród najbardziej prawdopodobnych kontynuacji mogą być: „herbatę" (0,50), „kawę" (0,30), „kakao" (0,08), „bulion" (0,04), „kefir" (0,03). Jeśli zadany jest próg $p = 0.80$, algorytm zaczyna sumować prawdopodobieństwa od góry: 0,50 dla „herbaty", następnie 0,50 + 0,30 = 0,80. Próg został już osiągnięty, a więc jądro składa się tylko z dwóch tokenów: „herbata" i „kawa". Wszystkie pozostałe warianty są odrzucane. Po renormalizacji prawdopodobieństwo „herbaty" wewnątrz jądra wynosi $0.50/0.80 = 62.5\%$, a prawdopodobieństwo „kawy" — $0.30/0.80 = 37.5\%$. Następny token jest wybierany wyłącznie spośród tych dwóch wariantów.

**Innymi słowy,** model najpierw usuwa mało prawdopodobne i nieudane kontynuacje, a następnie wybiera spośród pozostałych. Pomaga mu to pisać bardziej zrozumiale, naturalnie i bez zbędnego „szumu".

## Koncepcja

Podstawowa idea Top‑p polega na tym, by na każdym kroku wybierać **najmniejszy** zbiór najbardziej prawdopodobnych tokenów, których łączne prawdopodobieństwo jest nie mniejsze niż zadany próg $p$ (*jądro*, ang. *nucleus*).

Formalnie, niech $x_{(1)},x_{(2)},\ldots$ — tokeny słownika $V$ posortowane według malejącego prawdopodobieństwa warunkowego $P(x \mid x_{1:i - 1})$. Wówczas jądro $V^{(p)}$ jest definiowane jako najkrótszy prefiks tej uporządkowanej sekwencji, którego skumulowana masa osiąga próg:

$m = \min\left\{ n:\sum\limits_{j = 1}^{n}P\left( x_{(j)} \mid x_{1:i - 1} \right) \geq p \right\},\qquad V^{(p)} = \left\{ x_{(1)},\,\ldots,\, x_{(m)} \right\}.$

Innymi słowy, jest to **najmniejszy ze względu na inkluzję zbiór najbardziej prawdopodobnych tokenów**, których łączne prawdopodobieństwo jest nie mniejsze niż $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

Po wyznaczeniu jądra prawdopodobieństwa tokenów poza $V^{(p)}$ są zerowane, a wewnątrz jądra — renormalizowane (dzielone przez faktyczną skumulowaną masę $p^{\prime} = \sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1})$, tak że suma wynosi 1). Następny token jest próbkowany z tego obciętego i renormalizowanego rozkładu.

### Dynamiczna adaptacja

- Przy „ostrym" rozkładzie (model jest pewny) jądro jest małe: kilka tokenów daje już masę ≥ $p$, co zwiększa spójność. W przypadku granicznym, gdy prawdopodobieństwo najbardziej prawdopodobnego tokenu już przekracza $p$ (na przykład $P(x_{(1)}) = 0.96$ przy $p = 0.95$), jądro zwęża się do jednego tokenu i Top‑p staje się faktycznie dekodowaniem zachłannym (greedy search).
- Przy „płaskim" rozkładzie (wiele prawdopodobnych kontynuacji) jądro jest duże: wybór się poszerza, rośnie różnorodność.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

## Porównanie z innymi metodami dekodowania

### Top‑p vs. Top‑k

- **Top‑k** zawsze wybiera spośród stałej liczby $k$ najbardziej prawdopodobnych tokenów. W „ostrych" rozkładach może to dodawać zbędne mało prawdopodobne warianty „dla liczby", a w „płaskich" — odwrotnie, odcinać rozsądne kontynuacje, które nie trafiły do top‑$k$.
- **Top‑p** dostosowuje rozmiar zbioru kandydatów do danych danego kroku, co czyni zachowanie bardziej elastycznym i stabilnym przy różnych typach rozkładów.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>
- W praktyce Top‑k i Top‑p mogą być stosowane **jednocześnie**. W takim przypadku najpierw wybierana jest czołówka top‑$k$ tokenów, a następnie wewnątrz tego ograniczonego zbioru poszukiwane jest jądro o progu $p$. Dokładna kolejność i uzasadnienie zależą od implementacji, jednak taka kombinacja jest udokumentowana jako powszechna praktyka.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)</sup>

**Mówiąc prościej,** Top-k z góry decyduje, ile wariantów zostawić, a Top-p patrzy na sytuację i zostawia tyle, ile potrzeba w danym kontekście. Dlatego Top-p jest zazwyczaj bardziej elastyczny, a Top-k — prostszy i bardziej przewidywalny.

### Top‑p vs. Temperatura

- **Temperatura** (*temperature*) przekształca całą formę rozkładu (czyni go bardziej ostrym lub łagodnym), ale **nie obcina** tokenów: nawet mało prawdopodobne warianty zachowują niezerową szansę.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)</sup>
- **Top‑p** wprowadza **twarde obcięcie ogona** rozkładu — tokeny o niskim prawdopodobieństwie są całkowicie wykluczane z próbkowania, co pomaga zapobiegać wyraźnie nieodpowiednim kontynuacjom.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>
- **Kolejność stosowania.** W standardowych pipeline'ach (na przykład w Hugging Face Transformers) najpierw do logitów stosowana jest temperatura (zmienia się forma rozkładu), następnie może być stosowany Top‑k, i dopiero potem Top‑p (obcięcie ogona). To wyjaśnia, dlaczego „podwójne oddziaływanie" jest trudne do kontrolowania: zmiana temperatury zmienia samą skumulowaną masę, z którą następnie pracuje Top‑p.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)</sup>

**Mówiąc prościej,** temperatura zmienia, **jak swobodnie** model wybiera słowa, a Top-p decyduje, **jakie warianty w ogóle można wybierać**. Dlatego temperatura wpływa na stopień losowości, a Top-p — na to, jak daleko model może się zapuszczać w mniej prawdopodobne kontynuacje.

### Kolejność operacji w implementacji Hugging Face Transformers

Kolejność stosowania procesorów próbkowania zależy od konkretnej biblioteki. W Hugging Face Transformers (począwszy od v4.x) dla omawianej trójki parametrów procesory logitów są domyślnie dodawane w następującej kolejności:<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-code-6)</sup>

1.  **Skalowanie logitów temperaturą.** Logit każdego tokenu jest dzielony przez wartość temperatury przed eksponencjowaniem funkcji Softmax. Temperatura modyfikuje formę rozkładu, przygotowując go do późniejszego filtrowania.
2.  **Filtr Top‑k** (jeśli skonfigurowany): przycina słownik do stałej liczby pretendentów.
3.  **Filtr Top‑p**: do już zawężonej puli tokenów stosowane jest obcięcie skumulowane.
4.  **Renormalizacja** pozostałych prawdopodobieństw i stochastyczne próbkowanie.

W praktyce powszechna jest kombinacja umiarkowanej temperatury (0,7) z szerokim jądrem Top‑p (0,95) i limitem Top‑k (50): temperatura zapewnia podstawową wariacyjność, Top‑k działa jako gruby bezpiecznik, a Top‑p wykonuje kontekstowo zależne dostrojenie.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)</sup>

**Mówiąc prościej,** model najpierw czyni wybór mniej lub bardziej „swobodnym" za pomocą temperatury, następnie w razie potrzeby ogranicza liczbę kandydatów przez Top-k, a potem usuwa zbyt słabe warianty przez Top-p. Taka kolejność pomaga najpierw ustawić ogólny charakter wyboru, a potem odciąć zbędne elementy.

### Zalecenie: dostrajanie jednego parametru naraz

Dostawcy modeli zalecają, aby przy dostosowywaniu stylu generacji zmieniać **albo** *temperature*, **albo** *top_p*, ale nie oba jednocześnie. Zalecenie to zawarte jest w oficjalnej dokumentacji OpenAI, Azure OpenAI i Anthropic.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-top-p-7)[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-azure-rec-8)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-anthropic-params-9)</sup>

Uzasadnienie praktyczne: oba parametry wpływają na kształt rozkładu prawdopodobieństwa (temperatura zmienia stromość krzywej, a Top‑p ustala punkt odcięcia), dlatego jednoczesna ich zmiana utrudnia diagnostykę — nie można określić, który dokładnie parametr doprowadził do poprawy lub pogorszenia wyjścia. Ponadto przy ekstremalnie niskich wartościach obu parametrów (na przykład *Temperature ≈ 0* i *Top‑p ≈ 0,01*) jądro w praktyce zwęża się do jednego tokenu, co faktycznie zamienia próbkowanie w przeszukiwanie zachłanne.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-top-p-7)</sup>

Niektóre modele reasoning dodatkowo ograniczają dostrajanie tych parametrów na poziomie API, co sprawia, że kwestia ich jednoczesnej zmiany staje się nieaktualna dla takich modeli (zob. sekcję „Zgodność z bibliotekami i API").<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-top-p-7)</sup>

Rozpowszechniona heurystyka inżynierska: dla zadań wymagających wysokiej odtwarzalności — stosować niską temperaturę (aż do zera); dla zadań kreatywnych — pozostawiać temperaturę na poziomie bazowym (1,0) i regulować wariacyjność parametrem Top‑p, albo ustalić Top‑p na 1,0 i zmieniać temperaturę. Konkretne zalecenia mogą różnić się u poszczególnych dostawców.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-top-p-7)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-anthropic-params-9)</sup>

## Wpływ na faktyczność i halucynacje

Wybór strategii dekodowania może wpływać nie tylko na stylistykę generowanego tekstu, ale także na częstotliwość i typ błędów faktycznych. Zjawisko **halucynacji** — pewnej generacji fałszywych lub sprzecznych z kontekstem informacji — jest jednym z centralnych problemów generatywnej AI. Badania empiryczne pokazują, że efekt strategii próbkowania na halucynacje zależy od zadania, modelu i konkretnych ustawień parametrów.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-arxiv-hall-3)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)</sup>

### Mechanizm powstawania błędów przy stochastycznym próbkowaniu

Przy wysokich wartościach Top‑p (na przykład 0,95) model tworzy jądro obejmujące 95% masy prawdopodobieństwa. W stanach wysokiej entropii (na przykład przy próbie odpowiedzi na mało znany fakt) jądro to może zawierać setki tokenów o niskim prawdopodobieństwie. Stochastyczne próbkowanie w takich warunkach może wyciągnąć token gramatycznie poprawny, ale semantycznie niepowiązany z prawdą faktyczną. Znalazłszy się w kontekście, taki token może wpłynąć na kolejne kroki generacji, ponieważ model kontynuuje generację z uwzględnieniem wszystkich poprzednich tokenów, w tym błędnych.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-arxiv-hall-3)[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)</sup>

### Dychotomia zadań otwartych i zamkniętych

Zakrojone na szeroką skalę eksperymenty ujawniają zależność jakości generacji od typu zadania. W zadaniach pisania esejów lub systemach dialogowych metody stochastyczne (Top‑p, Temperature) pozostają liderami, podczas gdy w ściśle deterministycznych domenach mogą znacznie ustępować podejściom deterministycznym.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)</sup>

Na benchmarkach syntezy kodu programistycznego (HumanEval, MBPP) i rozwiązywania zadań matematycznych (GSM8K) metody deterministyczne (Beam Search, Greedy Decoding) pokazują lepsze wyniki w porównaniu z podejściami opartymi na Top‑p. Dataset GSM8K, zawierający 8,5 tysiąca zadań matematycznych wymagających od 2 do 8 kroków obliczeń, ilustruje podatność stochastycznego wyboru w takich zadaniach: wprowadzenie losowości przez obcięty rozkład Top‑p może zaburzyć łańcuch rozumowania modelu (Chain‑of‑Thought) na dowolnym z kroków pośrednich. Tan i współautorzy podkreślają, że efektywność metody dekodowania silnie zależy od konkretnego zadania (*task‑dependent*).<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)</sup>

### Metody zwalczania halucynacji na poziomie dekodowania

Do walki z efektami halucynacyjnymi wywołanymi stochastycznym próbkowaniem opracowano metody zaawansowanej augmentacji dekodowania:

- **Dekodowanie kontrastywne** (*Contrastive Decoding*, DoLa) — optymalizuje różnicę w logarytmicznej wiarygodności między modelem głównym a mniejszym modelem pomocniczym, pełniąc rolę filtra wiarygodności.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)</sup>
- **SH2** (*Self‑Highlighted Hesitation*) — sztucznie zmusza dekoder do „wahania się" przy pracy z tokenami o niskiej pewności.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-illusion-insight-11)</sup>
- **Ukierunkowane rzutowanie aktywacji** (SEA) — tłumi sygnały halucynacyjne na poziomie reprezentacji wektorowych.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-illusion-insight-11)</sup>

Jednocześnie nowoczesne modele z wysokiej jakości wyrównaniem (*alignment*) posiadają głębsze rozumienie faktografii, co obniża entropię ich wewnętrznych rozkładów i czyni je mniej podatnymi na degradację faktów nawet przy wysokich wartościach Top‑p.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)[\[12\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-frontiers-hall-12)</sup>

## Zastosowanie praktyczne i zalecenia

Top‑p jest szeroko stosowany we współczesnych LLM dzięki połączeniu elastyczności i sterowalności.

- **Typowy zakres wartości.** W praktyce często stosuje się **Failed to parse (syntax error): {\displaystyle p \approx 0.90 ext{–}0.95}** . Domyślna wartość różni się u poszczególnych dostawców: u OpenAI \`top_p\` = **1,0** (obcięcie jest faktycznie wyłączone), u Anthropic — **0,99**, u wielu modeli Google Gemini — **0,95**.<sup>[\[13\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-anthropic-release-13)</sup> W bibliotece Hugging Face Transformers domyślna wartość frameworka wynosi również **1,0**, choć poszczególne modele mogą ją nadpisywać w swoim \`generation_config.json\`.<sup>[\[14\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-genconfig-14)</sup> Zatem 0,9–0,95 to powszechny **zalecany zakres praktyczny**, ale nie powszechny standard domyślny.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)[\[15\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-vertex-params-15)</sup>
  - Wartości bliskie 1,0 (na przykład 0,98–0,99) zwiększają różnorodność: do jądra trafia więcej tokenów.
  - Małe wartości (na przykład 0,80–0,90) zwiększają deterministyczność i „powściągliwość" wyjścia.
  - Przy $p = 1$ obcięcie przez Top‑p znika: wybór odbywa się z całego słownika (z uwzględnieniem temperatury i innych filtrów dekodowania, jeśli są włączone).<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-gen-5)</sup>

<!-- -->

- **Zgodność z bibliotekami i API.**
  - W Hugging Face Transformers zaimplementowany jest *TopPLogitsWarper*, gdzie dodatkowo używany jest próg \`min_tokens_to_keep\` (domyślnie 1). Jest to szczegół implementacyjny o charakterze ochronnym: przy standardowych wartościach $p \in (0,\, 1\rbrack$ puste jądro i tak nie powstaje z definicji, jednak parametr gwarantuje poprawne działanie w przypadkach granicznych.<sup>[\[16\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-warp-16)</sup>
  - W niektórych API parametr \`top_p\` jest dostępny, podczas gdy \`top_k\` może być nieobecny; obsługa parametrów i ich semantyka **zależą od konkretnego modelu i trybu pracy**. Modele reasoning z reguły ograniczają dostrajanie stochastyczności na poziomie API. Na przykład w aktualnej dokumentacji OpenAI parametry \`temperature\` i \`top_p\` są jawnie obsługiwane tylko przez GPT‑5.2 przy \`reasoning.effort = none\`; żądania do GPT‑5.2 lub GPT‑5.1 z innymi wartościami \`reasoning\`, a także do wcześniejszych modeli GPT‑5 (\`gpt‑5\`, \`gpt‑5‑mini\`, \`gpt‑5‑nano\`) przy przekazywaniu tych pól powodują błąd. Modele reasoning poprzednich generacji (o1, o3) również ograniczają lub ustalają je.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-top-p-7)[\[17\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-reasoning-17)[\[18\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-openai-gpt52-18)</sup> U Anthropic w Claude API przy włączonym rozszerzonym myśleniu (extended thinking) zmiana \`temperature\` i \`top_k\` jest zabroniona, jednak \`top_p\` jest dozwolony w zakresie 0,95–1,0; na platformach zewnętrznych (na przykład Amazon Bedrock) ograniczenia mogą się różnić.<sup>[\[19\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-anthropic-thinking-19)</sup> **Ograniczenia dostawców często zmieniają się wraz z kolejnymi wersjami**; zaleca się sprawdzanie aktualnej dokumentacji.<sup>[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-azure-rec-8)[\[20\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-azure-reasoning-20)</sup>

<!-- -->

- **Długie teksty i powtarzalność.** W serii eksperymentów wykazano, że nucleus sampling zmniejsza skłonność do degeneracji (powtórzenia, szablonowe frazy) w porównaniu z greedy/beam i stałym Top‑k, szczególnie w przypadku długich sekwencji.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-holtzman2019-1)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tan2024-10)</sup>

## Współczesne alternatywy

Po publikacji nucleus sampling w 2019 roku zaproponowano kilka alternatywnych metod stochastycznego dekodowania, rozwijających lub uzupełniających ideę Top‑p:

### Próbkowanie Min‑p

**Próbkowanie Min‑p** (Nguyen et al., 2024) pozostawia tokeny, których prawdopodobieństwo nie jest niższe niż $p_{\min}imesP(x_{(1)})$, to znaczy ustawia próg względem najbardziej prawdopodobnego tokenu. Przyjęty do prezentacji ustnej na ICLR 2025; zaimplementowany w szeregu popularnych frameworków, w tym Hugging Face Transformers<sup>[\[21\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-hf-minp-21)</sup> i vLLM<sup>[\[22\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-vllm-minp-22)</sup>.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-23)</sup>

Kluczowa różnica w stosunku do Top‑p polega na typie progu: Top‑p używa **absolutnego** progu opartego na skumulowanej sumie prawdopodobieństw, podczas gdy Min‑p ustanawia **względny** próg skalowany od prawdopodobieństwa najbardziej prawdopodobnego tokenu.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-23)</sup>

Mathematycznie algorytm działa następująco: na każdym kroku wyznaczane jest maksymalne prawdopodobieństwo $P_{\max} = P(x_{(1)} \mid x_{1:i - 1})$, następnie obliczany jest skalowany próg $P_{ext{threshold}} = p_{\min}imesP_{\max}$. Do końcowej puli trafiają tylko tokeny, których indywidualne prawdopodobieństwo przekracza ten próg.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-arxiv-24)</sup>

Zapewnia to adaptacyjność: jeśli model jest pewny co do następnego słowa ($P_{\max} = 0.9$), przy bazowym $p_{\min} = 0.1$ próg wynosi 0,09, ostro odcinając tokeny szumowe. Jeśli zaś model jest niepewny ($P_{\max} = 0.1$), próg spada do 0,01, wpuszczając do jądra szerokie spektrum kandydatów.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-23)</sup>

Znana słabość Top‑p ujawnia się przy próbkowaniu w wysokiej temperaturze ($T > 1.0$): gdy rozkład jest sztucznie wygładzany, Top‑p jest zmuszony włączać do jądra dużą liczbę tokenów o niskim prawdopodobieństwie, aby osiągnąć zadaną sumę skumulowaną, co może prowadzić do degradacji spójności.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-23)</sup> Min‑p lepiej radzi sobie w takich warunkach. W eksperymentach autorów na benchmarkach wiedzy naukowej i logicznej (GPQA) z użyciem modelu Mistral Large przy ekstremalnej temperaturze $T = 3.0$ algorytm Min‑p osiągnął dokładność 13,84%, podczas gdy standardowy Top‑p 0,9 dał wynik 0,89% — na poziomie przypadkowego szumu.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-arxiv-24)</sup>

Jednocześnie w środowisku akademickim toczy się dyskusja: niektóre prace krytyczne (na przykład arXiv:2506.13681) poddają w wątpliwość uniwersalność przewag Min‑p na wszystkich metrykach NLP, wskazując na konieczność dalszych badań.<sup>[\[25\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-minp-critique-25)</sup>

**Mówiąc prościej,** Min-p porównuje wszystkie warianty nie z łączną sumą prawdopodobieństw, lecz z najsilniejszym wariantem na bieżącym kroku. Dlatego jeśli model jest pewny, ostrzej usuwa słabe kontynuacje, a jeśli niepewny — pozostawia więcej dopuszczalnych wariantów. Dzięki temu Min-p może lepiej zachowywać równowagę między spójnością a różnorodnością, szczególnie tam, gdzie Top-p zaczyna przepuszczać zbyt wiele słabych słów.

### Locally typical sampling

**Locally typical sampling** (Meister i współautorzy, 2023) wybiera tokeny, których ładunek informacyjny ($- \log P$) jest bliski entropii warunkowej, opierając się na teorioformacyjnym pojęciu typowości.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-meister2023-2)</sup>

W odróżnieniu od Top‑p, który dąży do minimalizacji rozmiaru jądra, wybierając tokeny o maksymalnym prawdopodobieństwie, Locally Typical Sampling rozwiązuje zadanie optymalizacyjne oparte na metryce odległości informacyjnej. Algorytm oblicza zawartość informacyjną każdego tokenu ($- \log P(x)$) i mierzy jego bezwzględną odległość do entropii warunkowej $H$ modelu. Tokeny są rangowane nie według surowego prawdopodobieństwa, lecz według stopnia ich „informacyjnej typowości" — bliskości do oczekiwanej zawartości informacyjnej kontekstu. Tokeny są dodawane do jądra (w kolejności rosnącej odległości do entropii) aż do osiągnięcia progu skumulowanego prawdopodobieństwa.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-meister2023-2)[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-typical-mit-26)</sup>

Konsekwencją tego podejścia jest to, że w stanach wysokiej entropii algorytm celowo wyklucza nie tylko szumowy ogon o niskim prawdopodobieństwie, ale również słowa o nadmiernie wysokim prawdopodobieństwie, które niosą zbyt mało informacji i czynią tekst banalnym. Zmniejsza to ryzyko degeneracyjnych zapętleń i przybliża metryki powtarzalności tekstu do wskaźników charakterystycznych dla tekstów pisanych przez człowieka.<sup>[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-typical-mit-26)</sup>

### Tail Free Sampling (TFS)

**Tail Free Sampling** (TFS) — mniej sformalizowane, ale praktycznie interesujące podejście do identyfikacji szumowego ogona, oparte na różniczkowej analizie przestrzeni prawdopodobieństwa. Podczas gdy Top‑p i Min‑p operują prawdopodobieństwami pierwszego rzędu (sumą skumulowaną i podstawowymi ułamkami), TFS analizuje **pierwszą i drugą pochodną** posortowanej krzywej prawdopodobieństw. Metoda została opisana na blogu Trentona Brickena i zaimplementowana w szeregu silników inferencyjnych, choć nie została opublikowana w formie recenzowanego artykułu.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tfs-bricken-27)</sup>

Główny postulat TFS: włączenie nawet jednego tokenu szumowego do próbki niesie wykładnicze zagrożenie dla całej generacji autoregresywnej. Obliczając drugą pochodną wartości prawdopodobieństw, algorytm lokalizuje „plateau" — odcinki krzywej, gdzie spadek prawdopodobieństw zwalnia i przechodzi w długi łagodny ogon. Punkt tego przegięcia staje się dynamiczną granicą obcięcia: tokeny przed nim są uznawane za semantycznie bezpieczne, a cały ogon jest usuwany.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tfs-bricken-27)</sup>

Pomimo matematycznej elegancji, TFS wymaga bardziej intensywnych nakładów obliczeniowych na obliczanie pochodnych w czasie rzeczywistym, z powodu czego w masowych produktach komercyjnych ustępuje lżejszym algorytmom.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-tfs-bricken-27)</sup>

### *p*‑less sampling

**$p$‑less sampling** — metoda całkowicie zwalniająca inżyniera z konieczności dostrajania hiperparametrów obcięcia.<sup>[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-pless-openreview-28)</sup> Fundamentalny problem wszystkich poprzednich metod — od Top‑k i Top‑p po Min‑p — polega na zależności od statycznych hiperparametrów, których wartości wymagają eksperckiego dostrojenia i mogą być optymalne dla jednego zadania (pisanie kreatywne), ale nieodpowiednie dla innego (programowanie).<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-pless-arxiv-29)</sup>

Algorytm $p$‑less, zakorzeniony w teorii informacji, dynamicznie generuje unikalny próg obcięcia na każdym kroku dekodowania, analizując wewnętrzną topologię całego rozkładu prawdopodobieństwa w czasie rzeczywistym. Autorzy informują o odporności metody na fluktuacje temperatury (*temperature robustness*): przy wzroście temperatury tradycyjne metody mogą istotnie degradować, podczas gdy $p$‑less zachowuje stabilność jakości. Ponadto, dzięki rezygnacji z logiki skumulowanego skanowania i renormalizacji dużych jąder, metoda — według danych autorów — zapewnia wyższą efektywność obliczeniową na etapie inferencji i generuje bardziej zwięzłe odpowiedzi bez utraty dokładności na datasetach z matematyki, logiki i pisania kreatywnego.<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-pless-arxiv-29)[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-pless-openreview-28)</sup>

### η‑próbkowanie

**η‑próbkowanie** (Hewitt et al., 2022) używa zależnego od entropii progu prawdopodobieństwa, dostosowując się do kontekstów niskoentropynych, gdzie Top‑p może obcinać nadmiernie.<sup>[\[30\]](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_note-eta-30)</sup>

## Literatura

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; opublikowano na ICLR 2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Fan, A., Lewis, M., & Dauphin, Y. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). *Conformal Nucleus Sampling*. ACL Findings 2023.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925.
- Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies*. arXiv:2410.03968.
- Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[32]</a>.
- *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234.

## Przypisy

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-holtzman2019_1-10)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-meister2023-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-meister2023_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-meister2023_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-meister2023_2-2)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *TACL*, Vol. 11. arXiv:2202.00666. <a href="https://aclanthology.org/2023.tacl-1.7.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-hall-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-arxiv-hall_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-arxiv-hall_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-arxiv-hall_3-2)</sup> *Large Language Models Hallucination: A Comprehensive Survey*. arXiv:2510.06265. <a href="https://arxiv.org/abs/2510.06265" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-finlayson2024-4">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-finlayson2024_4-0) Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-hf-gen-5">↑ <sup>[5.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-gen_5-6)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf-code-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-code_6-0) Hugging Face Transformers. *generation/utils.py* (исходный код). <a href="https://github.com/huggingface/transformers/blob/main/src/transformers/generation/utils.py" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-top-p-7">↑ <sup>[7.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-top-p_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-top-p_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-top-p_7-2)</sup> <sup>[7.3](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-top-p_7-3)</sup> <sup>[7.4](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-top-p_7-4)</sup> OpenAI API Reference. *top_p* — рекомендация «We generally recommend altering this or temperature but not both». <a href="https://developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-azure-rec-8">↑ <sup>[8.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-azure-rec_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-azure-rec_8-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/reference" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-anthropic-params-9">↑ <sup>[9.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-anthropic-params_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-anthropic-params_9-1)</sup> Anthropic API Reference. *Messages API — top_p*. <a href="https://docs.anthropic.com/en/api/messages" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-tan2024-10">↑ <sup>[10.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-3)</sup> <sup>[10.4](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-4)</sup> <sup>[10.5](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tan2024_10-5)</sup> Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925. <a href="https://aclanthology.org/2024.emnlp-main.489.pdf" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-illusion-insight-11">↑ <sup>[11.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-illusion-insight_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-illusion-insight_11-1)</sup> *From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs*. MDPI. <a href="https://www.mdpi.com/2673-2688/6/10/260" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-frontiers-hall-12">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-frontiers-hall_12-0) *Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior*. Frontiers in AI. <a href="https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1622292/full" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-anthropic-release-13">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-anthropic-release_13-0) Anthropic. *API release notes*. <a href="https://docs.anthropic.com/en/release-notes/api" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-hf-genconfig-14">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-genconfig_14-0) Hugging Face. *GenerationConfig (top_p default)*. <a href="https://huggingface.co/docs/transformers/main_classes/text_generation" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-vertex-params-15">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-vertex-params_15-0) Google AI / Vertex AI. *Content generation parameters (topP/topK)*. <a href="https://ai.google.dev/gemini-api/docs/prompting-strategies" class="external autonumber" rel="nofollow">[15]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/multimodal/content-generation-parameters" class="external autonumber" rel="nofollow">[16]</a></span>
16. <span id="cite_note-hf-warp-16">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-warp_16-0) Transformers API. *TopPLogitsWarper* (параметры и поведение, включая \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-openai-reasoning-17">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-reasoning_17-0) OpenAI API. *Using reasoning models — parameter support*. <a href="https://developers.openai.com/docs/guides/reasoning" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-openai-gpt52-18">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-openai-gpt52_18-0) OpenAI API. *Using GPT-5.2*. <a href="https://developers.openai.com/api/docs/guides/latest-model/" class="external autonumber" rel="nofollow">[19]</a></span>
19. <span id="cite_note-anthropic-thinking-19">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-anthropic-thinking_19-0) Anthropic. *Building with extended thinking*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking" class="external autonumber" rel="nofollow">[20]</a></span>
20. <span id="cite_note-azure-reasoning-20">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-azure-reasoning_20-0) Microsoft Learn (Azure AI Foundry). *Reasoning models — supported parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/reasoning" class="external autonumber" rel="nofollow">[21]</a></span>
21. <span id="cite_note-hf-minp-21">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-hf-minp_21-0) Hugging Face Transformers. *MinPLogitsWarper*. <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.MinPLogitsWarper" class="external autonumber" rel="nofollow">[22]</a></span>
22. <span id="cite_note-vllm-minp-22">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-vllm-minp_22-0) vLLM. *Sampling Parameters — min_p*. <a href="https://docs.vllm.ai/en/latest/serving/sampling_params.html" class="external autonumber" rel="nofollow">[23]</a></span>
23. <span id="cite_note-minp-23">↑ <sup>[23.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp_23-1)</sup> <sup>[23.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp_23-2)</sup> <sup>[23.3](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp_23-3)</sup> Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082. <a href="https://arxiv.org/abs/2407.01082" class="external autonumber" rel="nofollow">[24]</a></span>
24. <span id="cite_note-minp-arxiv-24">↑ <sup>[24.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp-arxiv_24-0)</sup> <sup>[24.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp-arxiv_24-1)</sup> Nguyen, M. et al. *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/pdf/2407.01082" class="external autonumber" rel="nofollow">[25]</a></span>
25. <span id="cite_note-minp-critique-25">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-minp-critique_25-0) *Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models*. arXiv:2506.13681. <a href="https://arxiv.org/abs/2506.13681" class="external autonumber" rel="nofollow">[26]</a></span>
26. <span id="cite_note-typical-mit-26">↑ <sup>[26.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-typical-mit_26-0)</sup> <sup>[26.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-typical-mit_26-1)</sup> *Locally Typical Sampling*. Transactions of the ACL, MIT Press. <a href="https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00536/114593/Locally-Typical-Sampling" class="external autonumber" rel="nofollow">[27]</a></span>
27. <span id="cite_note-tfs-bricken-27">↑ <sup>[27.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tfs-bricken_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tfs-bricken_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-tfs-bricken_27-2)</sup> Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[28]</a></span>
28. <span id="cite_note-pless-openreview-28">↑ <sup>[28.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-pless-openreview_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-pless-openreview_28-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. OpenReview. <a href="https://openreview.net/forum?id=ItFuNJQGH4" class="external autonumber" rel="nofollow">[29]</a></span>
29. <span id="cite_note-pless-arxiv-29">↑ <sup>[29.0](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-pless-arxiv_29-0)</sup> <sup>[29.1](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-pless-arxiv_29-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234. <a href="https://arxiv.org/abs/2509.23234" class="external autonumber" rel="nofollow">[30]</a></span>
30. <span id="cite_note-eta-30">[↑](https://systems-analysis.info/int/Top-p_sampling_(PL)#cite_ref-eta_30-0) Hewitt, J., Manning, C. D., & Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. Findings of EMNLP 2022. arXiv:2210.15191. <a href="https://arxiv.org/abs/2210.15191" class="external autonumber" rel="nofollow">[31]</a></span>

## Zobacz też

- Temperatura
- Duże modele językowe
