---
title: "Top-p sampling (SV)"
source: "https://systems-analysis.info/int/Top-p_sampling_(SV)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(SV)"
language: "sv"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 8223
wiki_created_at: 2026-09-07T01:14:09Z
wiki_modified_at: 2026-09-07T01:14:09Z
downloaded_at: 2026-09-07T23:24:08Z
---

# Top-p sampling (SV)

**Top‑p-sampling**, även känt som **kärnsampling** (eng. *Nucleus Sampling*), är en stokastisk avkodningsmetod för autoregressiva språkmodeller, som bland annat används flitigt i stora språkmodeller (LLM). Metoden föreslogs 2019 av Ari Holtzman m.fl. (preprint arXiv – april 2019; publicerad på ICLR 2020) som ett förbättrat alternativ till fast Top‑k-sampling. Idén är att dynamiskt välja en kandidatmängd vid varje genereringssteg utifrån ett tröskelvärde för kumulativ sannolikhet $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

## Historisk bakgrund: problemet med neuronal textdegeneration

Innan Top‑p introducerades dominerade avkodningsstrategierna **girig sökning** (*greedy search*) och **strålsökning** (*beam search*), vilka bygger på paradigmet att maximera sannolikheten – att välja den tokensekvens med högst samlad sannolikhet. Girig sökning väljer lokalt vid varje steg den token med högst sannolikhet, medan strålsökning parallellt spårar flera genereringshypoteser.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

Även om dessa metoder var effektiva i slutna uppgifter (maskinöversättning, informationsextraktion) ledde de vid öppen textgenerering (historieskapande, dialogsystem) ofta till **neuronal textdegeneration** – en degradering av utdata där texten blir schablonartad, förlorar sammanhang eller fastnar i upprepningar. Detta fenomen beskrivs ingående av Holtzman m.fl. i artikeln *The Curious Case of Neural Text Degeneration*.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

Meister m.fl. kopplar degenerationsproblemet till att mänsklig text tenderar att hålla ett informationsinnehåll nära den förväntade villkorliga entropin, snarare än att enbart maximera den lokala sannolikheten för varje nästa token.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-meister2023-2)</sup>

Ett alternativ var **ren stokastisk sampling** (*sampling without truncation*), där en token väljs slumpmässigt i enlighet med dess sannolikhet. Denna metod skapade dock det omvända problemet: Softmax-funktionen tilldelar aldrig en token en exakt noll-sannolikhet, varför det i ett ordförråd med tiotusentals ord alltid finns ett stort brus-segment. Med ren sampling ökar risken att hamna i fördelningens opålitliga svans, vilket kan försämra sammanhänget i den genererade texten.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-arxiv-hall-3)</sup> Behovet av att kombinera rikedomen hos stokastiska val med tillförlitligheten hos deterministiska begränsningar ledde till utvecklingen av metoder för trunkering av fördelningen, där kärnsampling (Top‑p) är flaggskeppet.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-finlayson2024-4)</sup>

## Enkel förklaring

**Top-p-sampling** är ett sätt att begränsa valet av nästa token till endast de **mest sannolika** alternativen, utan att i förväg fastställa deras antal.

Vid textgenerering bedömer språkmodellen vid varje steg ett stort antal möjliga fortsättningar och tilldelar var och en en viss sannolikhet. Vissa tokens är mycket sannolika, andra måttligt sannolika, och merparten av ordförrådet bildar den så kallade "svansen" av fördelningen: varianter med mycket låg sannolikhet som formellt sett är tillåtna, men som ofta är slumpmässiga, malplacerade eller försämrar textens sammanhang.

Top-p-sampling skär bort denna osannolika svans **inte utifrån ett fast antal tokens**, utan utifrån **total sannolikhet**. Alla kandidater ordnas från mest sannolika till minst sannolika. Därefter väljs den minimala uppsättning av de översta tokens vars sammanlagda sannolikhet når det angivna tröskelvärdet $p$ – till exempel 0,9 eller 0,95. Sedan väljs nästa token slumpmässigt enbart ur denna mängd, och alla övriga alternativ utesluts.

Om modellen till exempel ska fortsätta meningen "Idag ute på gatan var det kraftigt…", kan de mest sannolika alternativen vara "regn" (0,45), "störtregn" (0,25), "snö" (0,15) och "vind" (0,10). Med tröskelvärdet $p = 0.90$ summerar algoritmen tokens i fallande sannolikhetsordning: 0,45 + 0,25 = 0,70 (under 0,90), lägger till "snö": 0,70 + 0,15 = 0,85 (fortfarande under 0,90), lägger till "vind": 0,85 + 0,10 = 0,95 (tröskeln överskriden). Kärnan består av fyra tokens. Alla mer sällsynta alternativ förkastas och de kvarvarandes sannolikheter normaliseras om: sannolikheten för token "regn" efter omnormalisering blir $0.45/0.95 \approx 47.4\%$, och generatorn väljer nästa token ur just denna uppdaterade fördelning.

Huvudskillnaden från Top‑k är att Top‑k alltid tar ett **fast antal** bästa ord (till exempel 50), medan Top‑p inte i förväg fastställer antalet alternativ: ibland kan det vara 3 ord, ibland 20 – allt beror på hur sannolikheterna fördelade sig just vid det steget. Tack vare detta anpassar sig metoden till kontexten och hjälper till att skära bort "svansen" av osannolika tokens, vilket gör texten mer naturlig.

**Ytterligare ett exempel.** Modellen ska till exempel fortsätta meningen "Till frukost drack han varm…". Bland de mest sannolika fortsättningarna kan finnas: "te" (0,50), "kaffe" (0,30), "choklad" (0,08), "buljong" (0,04), "kefir" (0,03). Om tröskelvärdet $p = 0.80$ är inställt börjar algoritmen summera sannolikheterna uppifrån och ned: 0,50 för "te", sedan 0,50 + 0,30 = 0,80. Tröskeln är redan uppnådd, så kärnan består av enbart två tokens: "te" och "kaffe". Alla övriga alternativ förkastas. Efter omnormalisering blir sannolikheten för "te" inom kärnan $0.50/0.80 = 62.5\%$, och sannolikheten för "kaffe" $0.30/0.80 = 37.5\%$. Nästa token väljs enbart mellan dessa två alternativ.

**Med andra ord** tar modellen först bort osannolika och olyckliga fortsättningar och väljer sedan bland de återstående. Detta hjälper den att skriva tydligare, mer naturligt och utan onödigt "brus".

## Koncept

Grundidén med Top‑p är att vid varje steg välja den **minsta** mängden av de mest sannolika tokens vars totala sannolikhet inte understiger det angivna tröskelvärdet $p$ (*kärnan*, eng. *nucleus*).

Formellt, låt $x_{(1)},x_{(2)},\ldots$ vara tokens i ordförrådet $V$, sorterade i fallande ordning efter villkorlig sannolikhet $P(x \mid x_{1:i - 1})$. Då definieras kärnan $V^{(p)}$ som det kortaste prefixet av denna ordnade sekvens vars kumulativa massa når tröskelvärdet:

$m = \min\left\{ n:\sum\limits_{j = 1}^{n}P\left( x_{(j)} \mid x_{1:i - 1} \right) \geq p \right\},\qquad V^{(p)} = \left\{ x_{(1)},\,\ldots,\, x_{(m)} \right\}.$

Med andra ord är detta den **minsta mängden (med avseende på inkludering) av de mest sannolika tokens** vars totala sannolikhet inte understiger $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

När kärnan har bestämts sätts sannolikheterna för tokens utanför $V^{(p)}$ till noll, och sannolikheterna för tokens inuti kärnan normaliseras om (divideras med den faktiska kumulativa massan $p^{\prime} = \sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1})$, så att summan blir 1). Nästa token samplas från denna trunkerade och omnormaliserade fördelning.

### Dynamisk anpassning

- Vid en "skarp" fördelning (modellen är säker) är kärnan liten: ett fåtal tokens ger redan massa ≥ $p$, vilket ökar sammanhänget. I gränsfall, om sannolikheten för den mest sannolika token redan överstiger $p$ (till exempel $P(x_{(1)}) = 0.96$ vid $p = 0.95$), krymper kärnan till en enda token och Top‑p förvandlas i praktiken till girig avkodning (greedy search).
- Vid en "platt" fördelning (många troliga fortsättningar) är kärnan stor: urvalet breddas och variationen ökar.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

## Jämförelse med andra avkodningsmetoder

### Top‑p vs. Top‑k

- **Top‑k** väljer alltid ur ett fast antal $k$ av de mest sannolika tokens. Vid "skarpa" fördelningar kan detta lägga till onödiga osannolika alternativ "för sakens skull", medan det vid "platta" fördelningar tvärtom kan skära bort rimliga fortsättningar som inte hamnat i topp‑$k$.
- **Top‑p** anpassar storleken på kandidatmängden utifrån stegets data, vilket gör beteendet mer flexibelt och stabilt för olika typer av fördelningar.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>
- I praktiken kan Top‑k och Top‑p tillämpas **samtidigt**. I det fallet väljs först topp‑$k$ tokens, och sedan söks kärnan med tröskelvärdet $p$ inom denna begränsade mängd. Den exakta ordningen och motivationen beror på implementeringen, men denna kombination är dokumenterad som ett vanligt tillvägagångssätt.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)</sup>

**Enkelt uttryckt** bestämmer Top-k i förväg hur många alternativ som ska behållas, medan Top-p bedömer situationen och behåller så många som behövs i det aktuella sammanhanget. Därför är Top-p vanligtvis mer flexibelt, medan Top-k är enklare och mer förutsägbart.

### Top‑p vs. Temperatur

- **Temperatur** (*temperature*) omformar hela fördelningens form (gör den skarpare eller jämnare), men **trunkerar inte** tokens: även osannolika alternativ behåller en icke-noll chans.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)</sup>
- **Top‑p** inför en **hård trunkering av svansen** i fördelningen – lågssannolika tokens utesluts helt från sampling, vilket hjälper till att förhindra uppenbart malplacerade fortsättningar.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>
- **Tillämpningsordning.** I standardpipelines (till exempel i Hugging Face Transformers) tillämpas temperaturen först på logits (fördelningens form förändras), sedan kan Top‑k tillämpas, och först därefter Top‑p (trunkering av svansen). Detta förklarar varför "dubbel påverkan" är svår att kontrollera: en förändring av temperaturen ändrar den kumulativa massan som Top‑p sedan arbetar med.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)</sup>

**Enkelt uttryckt** ändrar temperaturen **hur fritt** modellen väljer ord, medan Top-p avgör **vilka alternativ som överhuvudtaget kan väljas**. Temperaturen påverkar alltså graden av slumpmässighet, medan Top-p avgör hur långt modellen kan gå mot mindre sannolika fortsättningar.

### Operationsordning i Hugging Face Transformers-implementationen

Ordningen för tillämpning av sampling-processorer beror på det specifika biblioteket. I Hugging Face Transformers (från och med v4.x) läggs logit-processorerna för de tre diskuterade parametrarna till i standardordningen:<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-code-6)</sup>

1.  **Temperaturkalibrering av logits.** Varje tokens logit divideras med temperaturvärdet innan Softmax-funktionen exponentiseras. Temperaturen modifierar fördelningens form och förbereder den för efterföljande filtrering.
2.  **Top‑k-filter** (om konfigurerat): trunkerar ordförrådet till ett fast antal kandidater.
3.  **Top‑p-filter**: kumulativ trunkering tillämpas på den redan begränsade token-poolen.
4.  **Omnormalisering** av kvarvarande sannolikheter och stokastisk sampling.

I praktiken är en kombination av måttlig temperatur (0,7) med ett brett Top‑p-kärna (0,95) och en Top‑k-gräns (50) vanlig: temperaturen ger grundläggande variation, Top‑k fungerar som ett grovt skydd, och Top‑p utför kontextkänslig finjustering.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)</sup>

**Enkelt uttryckt** gör modellen först valet mer eller mindre "fritt" med hjälp av temperaturen, begränsar sedan vid behov antalet kandidater via Top-k, och tar därefter bort alltför svaga alternativ via Top-p. Denna ordning hjälper till att först ställa in valsituationens allmänna karaktär och sedan skära bort det överflödiga.

### Rekommendation: justera en parameter i taget

Modellleverantörer rekommenderar att man vid justering av genereringsstilen ändrar **antingen** *temperature*, **eller** *top_p*, men inte båda samtidigt. Denna rekommendation finns i den officiella dokumentationen från OpenAI, Azure OpenAI och Anthropic.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-top-p-7)[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-azure-rec-8)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-anthropic-params-9)</sup>

Praktisk motivering: båda parametrarna påverkar formen på sannolikhetsfördelningen (temperaturen ändrar kurvans branthet, medan Top‑p sätter avskärningspunkten), varför en samtidig förändring av dem försvårar diagnostiken – det blir omöjligt att avgöra vilken parameter som ledde till förbättring eller försämring av utdata. Dessutom krymper kärnan vid extremt låga värden på båda parametrarna (till exempel *Temperature ≈ 0* och *Top‑p ≈ 0,01*) i praktiken till en enda token, vilket i realiteten förvandlar sampling till girig sökning.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-top-p-7)</sup>

Ett antal reasoning-modeller begränsar dessutom justeringen av dessa parametrar på API-nivå, vilket gör frågan om deras gemensamma förändring irrelevant för sådana modeller (se avsnittet "Kompatibilitet med bibliotek och API:er").<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-top-p-7)</sup>

En vanlig teknisk tumregel: för uppgifter som kräver hög reproducerbarhet – använd låg temperatur (ner till noll); för kreativa uppgifter – behåll temperaturen på grundnivån (1,0) och reglera variationen med Top‑p-parametern, eller fixera Top‑p på 1,0 och variera temperaturen. Specifika rekommendationer kan skilja sig åt mellan leverantörer.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-top-p-7)[\[9\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-anthropic-params-9)</sup>

## Påverkan på faktuell noggrannhet och hallucinationer

Valet av avkodningsstrategi kan påverka inte bara stilen på den genererade texten, utan även frekvensen och typen av faktuella fel. Fenomenet **hallucinationer** – säker generering av falsk eller kontextmotsägande information – är ett av kärnproblemen inom generativ AI. Empiriska studier visar att effekten av sampling-strategier på hallucinationer beror på uppgiften, modellen och de specifika parameterinställningarna.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-arxiv-hall-3)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)</sup>

### Felgenereringsmekanismen vid stokastisk sampling

Vid höga Top‑p-värden (till exempel 0,95) bildar modellen en kärna som täcker 95% av sannolikhetsmassan. I tillstånd med hög entropi (till exempel vid försök att besvara ett föga känt faktum) kan denna kärna innehålla hundratals lågssannolika tokens. Stokastisk sampling under sådana förhållanden kan extrahera en token som är grammatiskt korrekt men semantiskt orelaterad till den faktiska sanningen. När en sådan token väl befinner sig i kontexten kan den påverka de efterföljande genereringsstegen, eftersom modellen fortsätter genereringen med hänsyn till alla tidigare tokens, inklusive felaktiga.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-arxiv-hall-3)[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)</sup>

### Dikotomin öppna och slutna uppgifter

Storskaliga experiment avslöjar ett beroende av genereringskvaliteten på uppgiftstypen. Vid essäskrivning eller dialogsystem är stokastiska metoder (Top‑p, Temperature) fortfarande ledande, medan de vid strikt deterministiska domäner kan prestera avsevärt sämre än deterministiska ansatser.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)</sup>

På benchmark-dataset för kodsyntes (HumanEval, MBPP) och matematisk problemlösning (GSM8K) visar deterministiska metoder (Beam Search, Greedy Decoding) bättre resultat jämfört med Top‑p-baserade ansatser. Dataset GSM8K, som innehåller 8 500 matematikuppgifter som kräver 2 till 8 beräkningssteg, illustrerar sårbarheten hos stokastiskt urval i sådana uppgifter: injektion av slumpmässighet via den trunkerade Top‑p-fördelningen kan bryta modellens resonemangkedja (Chain‑of‑Thought) vid vilket som helst av de mellanliggande stegen. Tan m.fl. betonar att avkodningsmetodens effektivitet är starkt uppgiftsberoende (*task‑dependent*).<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)</sup>

### Metoder för att bekämpa hallucinationer på avkodningsnivå

För att bekämpa hallucinationseffekter orsakade av stokastisk sampling har metoder för avancerad avkodningsaugmentation utvecklats:

- **Kontrastiv avkodning** (*Contrastive Decoding*, DoLa) – optimerar klyftan i logaritmisk sannolikhet mellan huvudmodellen och en mindre hjälpmodell, och fungerar som ett trovärdighetsfilter.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)</sup>
- **SH2** (*Self‑Highlighted Hesitation*) – tvingar artificiellt avkodaren att "tveka" vid hantering av lågkonfidens-tokens.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-illusion-insight-11)</sup>
- **Riktad aktivationsprojektion** (SEA) – undertrycker hallucinationssignaler på representationsvektornivå.<sup>[\[11\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-illusion-insight-11)</sup>

Samtidigt har moderna modeller med god alignering (*alignment*) en djupare förståelse av faktologi, vilket minskar entropin i deras interna fördelningar och gör dem mindre benägna för faktuell degradering även vid höga Top‑p-värden.<sup>[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)[\[12\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-frontiers-hall-12)</sup>

## Praktisk användning och rekommendationer

Top‑p används i stor utsträckning i moderna LLM tack vare kombinationen av flexibilitet och styrbarhet.

- **Typiskt värdeintervall.** I praktiken används ofta $p \approx 0.90\text{–}0.95$. Standardvärdet varierar mellan leverantörer: hos OpenAI är \`top_p\` = **1,0** (trunkering är i praktiken avaktiverad), hos Anthropic – **0,99**, hos många Google Gemini-modeller – **0,95**.<sup>[\[13\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-anthropic-release-13)</sup> I biblioteket Hugging Face Transformers är ramverkets standardvärde också **1,0**, även om enskilda modeller kan åsidosätta det i sin \`generation_config.json\`.<sup>[\[14\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-genconfig-14)</sup> Således är 0,9–0,95 ett vanligt **rekommenderat praktiskt intervall**, men inte en universell standardinställning.<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)[\[15\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-vertex-params-15)</sup>
  - Värden nära 1,0 (till exempel 0,98–0,99) ökar variationen: fler tokens ingår i kärnan.
  - Låga värden (till exempel 0,80–0,90) ökar determinismen och "återhållsamheten" i utdata.
  - Vid $p = 1$ försvinner Top‑p-trunkeringen: urvalet sker över hela ordförrådet (med hänsyn till temperatur och andra avkodningsfilter om de är aktiverade).<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-gen-5)</sup>

<!-- -->

- **Kompatibilitet med bibliotek och API:er.**
  - I Hugging Face Transformers är *TopPLogitsWarper* implementerat, där dessutom tröskeln \`min_tokens_to_keep\` (standard 1) används. Detta är en skyddsdetalj i implementationen: vid standardvärden $p \in (0,\, 1\rbrack$ uppstår en tom kärna inte ens enligt definitionen, men parametern garanterar korrekt funktion i gränsfall.<sup>[\[16\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-warp-16)</sup>
  - I vissa API:er är parametern \`top_p\` tillgänglig, medan \`top_k\` kan saknas; stödet för parametrar och deras semantik **beror på den specifika modellen och driftsläget**. Reasoning-modeller begränsar i regel stokastikinställningar på API-nivå. Till exempel stöds parametrarna \`temperature\` och \`top_p\` i aktuell OpenAI-dokumentation explicit endast för GPT‑5.2 med \`reasoning.effort = none\`; förfrågningar till GPT‑5.2 eller GPT‑5.1 med andra \`reasoning\`-värden, samt till tidigare GPT‑5-modeller (\`gpt‑5\`, \`gpt‑5‑mini\`, \`gpt‑5‑nano\`) som skickar dessa fält, genererar ett fel. Reasoning-modeller från tidigare generationer (o1, o3) begränsar eller fixerar dem också.<sup>[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-top-p-7)[\[17\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-reasoning-17)[\[18\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-openai-gpt52-18)</sup> Hos Anthropic i Claude API är det förbjudet att ändra \`temperature\` och \`top_k\` när utökat tänkande (extended thinking) är aktiverat, men \`top_p\` är tillåtet i intervallet 0,95–1,0; på tredjepartsplattformar (till exempel Amazon Bedrock) kan begränsningarna skilja sig åt.<sup>[\[19\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-anthropic-thinking-19)</sup> **Leverantörsbegränsningar förändras ofta från version till version**; det rekommenderas att kontrollera aktuell dokumentation.<sup>[\[8\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-azure-rec-8)[\[20\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-azure-reasoning-20)</sup>

<!-- -->

- **Långa texter och repetitivitet.** En serie experiment har visat att nucleus sampling minskar benägenheten för degeneration (upprepningar, schablonfraser) jämfört med greedy/beam och fast Top‑k, i synnerhet för långa sekvenser.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-holtzman2019-1)[\[10\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tan2024-10)</sup>

## Moderna alternativ

Efter publiceringen av nucleus sampling 2019 har flera alternativa stokastiska avkodningsmetoder föreslagits, som utvecklar eller kompletterar idén bakom Top‑p:

### Min‑p-sampling

**Min‑p-sampling** (Nguyen m.fl., 2024) behåller tokens vars sannolikhet inte understiger $p_{\min} \times P(x_{(1)})$, det vill säga sätter ett tröskelvärde relativt den mest sannolika token. Antagen för muntlig presentation på ICLR 2025; implementerad i ett antal populära ramverk, inklusive Hugging Face Transformers<sup>[\[21\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-hf-minp-21)</sup> och vLLM<sup>[\[22\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-vllm-minp-22)</sup>.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-23)</sup>

Den viktigaste skillnaden från Top‑p ligger i typen av tröskelvärde: Top‑p använder ett **absolut** tröskelvärde baserat på den kumulativa sannolikhetssumman, medan Min‑p sätter ett **relativt** tröskelvärde skalat från sannolikheten för den mest sannolika token.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-23)</sup>

Matematiskt fungerar algoritmen på följande sätt: vid varje steg bestäms den maximala sannolikheten $P_{\max} = P(x_{(1)} \mid x_{1:i - 1})$, sedan beräknas det skalade tröskelvärdet $P_{\text{threshold}} = p_{\min} \times P_{\max}$. Den slutliga poolen innehåller endast tokens vars individuella sannolikhet överstiger detta tröskelvärde.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-arxiv-24)</sup>

Detta ger adaptivitet: om modellen är säker på nästa ord ($P_{\max} = 0.9$) blir tröskeln med ett grundläggande $p_{\min} = 0.1$ lika med 0,09, vilket skär bort brus-tokens effektivt. Om modellen är osäker ($P_{\max} = 0.1$) sänks tröskeln till 0,01, vilket släpper in ett brett urval av kandidater i kärnan.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-23)</sup>

En känd svaghet hos Top‑p visar sig vid sampling med hög temperatur ($T > 1.0$): när fördelningen artificiellt utjämnas tvingas Top‑p att inkludera ett stort antal lågssannolika tokens i kärnan för att nå den angivna kumulativa summan, vilket kan leda till degradering av sammanhang.<sup>[\[23\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-23)</sup> Min‑p hanterar sådana förhållanden bättre. I författarnas experiment på benchmark-dataset för vetenskapliga och logiska kunskaper (GPQA) med modellen Mistral Large vid extrem temperatur $T = 3.0$ uppnådde Min‑p-algoritmen en noggrannhet på 13,84%, medan standard-Top‑p 0,9 gav 0,89% – på nivå med slumpmässigt brus.<sup>[\[24\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-arxiv-24)</sup>

Samtidigt pågår en diskussion i den akademiska världen: vissa kritiska arbeten (till exempel arXiv:2506.13681) ifrågasätter universaliteten hos Min‑p:s fördelar över alla NLP-mätvärden och pekar på behovet av ytterligare forskning.<sup>[\[25\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-minp-critique-25)</sup>

**Enkelt uttryckt** jämför Min-p alla alternativ inte med den totala sannolikhetssumman, utan med det starkaste alternativet vid det aktuella steget. Därför eliminerar det hårdare svaga fortsättningar om modellen är säker, och lämnar fler tillåtna alternativ om den är osäker. Tack vare detta kan Min-p bättre bevara balansen mellan sammanhang och variation, i synnerhet där Top-p börjar släppa igenom för många svaga ord.

### Locally typical sampling

**Locally typical sampling** (Meister m.fl., 2023) väljer tokens vars informationsinnehåll ($- \log P$) ligger nära den villkorliga entropin, och bygger på det informationsteoretiska begreppet typiskhet.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-meister2023-2)</sup>

Till skillnad från Top‑p, som strävar efter att minimera kärnans storlek genom att välja tokens med maximal sannolikhet, löser Locally Typical Sampling ett optimeringsproblem baserat på ett mätvärde för informationsavstånd. Algoritmen beräknar informationsinnehållet för varje token ($- \log P(x)$) och mäter dess absoluta avstånd till modellens villkorliga entropi $H$. Tokens rangordnas inte efter råsannolikhet, utan efter graden av deras "informationstypiskhet" – närheten till det förväntade informationsinnehållet i kontexten. Tokens läggs till kärnan (i ordning av stigande avstånd till entropin) tills tröskeln för kumulativ sannolikhet nås.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-meister2023-2)[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-typical-mit-26)</sup>

En följd av detta tillvägagångssätt är att algoritmen i tillstånd med hög entropi avsiktligt exkluderar inte bara den brusigas lågssannolika svansen, utan även alltför högsannolika ord som bär för lite information och gör texten banal. Detta minskar risken för degenerativa loopar och för metriker för textrepetitivitet närmre de värden som är typiska för mänskligt skriven text.<sup>[\[26\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-typical-mit-26)</sup>

### Tail Free Sampling (TFS)

**Tail Free Sampling** (TFS) är ett mindre formaliserat men praktiskt intressant tillvägagångssätt för att identifiera brusigas svansar, baserat på differentialanalys av sannolikhetsrymden. Om Top‑p och Min‑p opererar med förstaordningens sannolikheter (kumulativ summa och grundläggande bråk), analyserar TFS **första- och andraderivatan** av den sorterade sannolikhetskurvan. Metoden beskrivs i Trenton Brickens blogg och är implementerad i ett antal inference-motorer, men publicerades inte som en granskad artikel.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tfs-bricken-27)</sup>

TFS grundpostulat: inkludering av ens en brus-token i urvalet utgör ett exponentiellt hot mot hela den autoregressiva genereringen. Genom att beräkna andraderivatan av sannolikhetsvärdena lokaliserar algoritmen "platåer" – delar av kurvan där sannolikhetsfallet bromsas och övergår i en lång, flack svans. Denna inflektionspunkt blir den dynamiska trunkeringsgränsen: tokens före den anses semantiskt säkra, medan hela svansen tas bort.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tfs-bricken-27)</sup>

Trots den matematiska elegansen kräver TFS mer intensiva beräkningar för att beräkna derivator i realtid, varför det i massmarknadsprodukter ger vika för lättviktigare algoritmer.<sup>[\[27\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-tfs-bricken-27)</sup>

### *p*‑less sampling

**$p$‑less sampling** är en metod som helt befriar ingenjören från behovet av att konfigurera hyperparametrar för trunkering.<sup>[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-pless-openreview-28)</sup> Det grundläggande problemet med alla föregående metoder – från Top‑k och Top‑p till Min‑p – är beroendet av statiska hyperparametrar vars värden kräver expertkalibrering och kan vara optimala för en uppgift (kreativt skrivande), men olämpliga för en annan (programmering).<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-pless-arxiv-29)</sup>

Algoritmen $p$‑less, förankrad i informationsteori, genererar dynamiskt ett unikt trunkeringströskelvärde vid varje avkodningssteg genom att analysera den interna topologin för hela sannolikhetsfördelningen i realtid. Författarna rapporterar metodens robusthet mot temperaturfluktuationer (*temperature robustness*): vid ökad temperatur kan traditionella metoder degradera avsevärt, medan $p$‑less bibehåller stabil kvalitet. Dessutom uppger författarna att metoden, tack vare att den frångår logiken med kumulativ skanning och omnormalisering av stora kärnor, ger högre beräkningseffektivitet under inferens och genererar mer kompakta svar utan förlust av noggrannhet på dataset för matematik, logik och kreativt skrivande.<sup>[\[29\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-pless-arxiv-29)[\[28\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-pless-openreview-28)</sup>

### η‑sampling

**η‑sampling** (Hewitt m.fl., 2022) använder ett entropiberoende sannolikhetströskelvärde och anpassar sig till lågentropikontextuella förhållanden där Top‑p kan trunkera för mycket.<sup>[\[30\]](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_note-eta-30)</sup>

## Litteratur

- Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019; publicerat på ICLR 2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Fan, A., Lewis, M., & Dauphin, Y. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Ravfogel, S., Goldberg, Y., & Goldberger, J. (2023). *Conformal Nucleus Sampling*. ACL Findings 2023.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925.
- Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies*. arXiv:2410.03968.
- Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[32]</a>.
- *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234.

## Noter

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.00](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-holtzman2019_1-10)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-meister2023-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-meister2023_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-meister2023_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-meister2023_2-2)</sup> Meister, C., Pimentel, T., Wiher, G., & Cotterell, R. (2023). *Locally Typical Sampling*. *TACL*, Vol. 11. arXiv:2202.00666. <a href="https://aclanthology.org/2023.tacl-1.7.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-hall-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-arxiv-hall_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-arxiv-hall_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-arxiv-hall_3-2)</sup> *Large Language Models Hallucination: A Comprehensive Survey*. arXiv:2510.06265. <a href="https://arxiv.org/abs/2510.06265" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-finlayson2024-4">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-finlayson2024_4-0) Finlayson, M. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693. <a href="https://arxiv.org/abs/2310.01693" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-hf-gen-5">↑ <sup>[5.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-gen_5-6)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hf-code-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-code_6-0) Hugging Face Transformers. *generation/utils.py* (исходный код). <a href="https://github.com/huggingface/transformers/blob/main/src/transformers/generation/utils.py" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-top-p-7">↑ <sup>[7.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-top-p_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-top-p_7-1)</sup> <sup>[7.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-top-p_7-2)</sup> <sup>[7.3](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-top-p_7-3)</sup> <sup>[7.4](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-top-p_7-4)</sup> OpenAI API Reference. *top_p* — рекомендация «We generally recommend altering this or temperature but not both». <a href="https://developers.openai.com/api/reference/resources/chat/subresources/completions/methods/create" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-azure-rec-8">↑ <sup>[8.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-azure-rec_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-azure-rec_8-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/reference" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-anthropic-params-9">↑ <sup>[9.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-anthropic-params_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-anthropic-params_9-1)</sup> Anthropic API Reference. *Messages API — top_p*. <a href="https://docs.anthropic.com/en/api/messages" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-tan2024-10">↑ <sup>[10.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-3)</sup> <sup>[10.4](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-4)</sup> <sup>[10.5](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tan2024_10-5)</sup> Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of LLMs*. arXiv:2402.06925. <a href="https://aclanthology.org/2024.emnlp-main.489.pdf" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-illusion-insight-11">↑ <sup>[11.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-illusion-insight_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-illusion-insight_11-1)</sup> *From Illusion to Insight: A Taxonomic Survey of Hallucination Mitigation Techniques in LLMs*. MDPI. <a href="https://www.mdpi.com/2673-2688/6/10/260" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-frontiers-hall-12">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-frontiers-hall_12-0) *Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior*. Frontiers in AI. <a href="https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1622292/full" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-anthropic-release-13">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-anthropic-release_13-0) Anthropic. *API release notes*. <a href="https://docs.anthropic.com/en/release-notes/api" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-hf-genconfig-14">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-genconfig_14-0) Hugging Face. *GenerationConfig (top_p default)*. <a href="https://huggingface.co/docs/transformers/main_classes/text_generation" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-vertex-params-15">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-vertex-params_15-0) Google AI / Vertex AI. *Content generation parameters (topP/topK)*. <a href="https://ai.google.dev/gemini-api/docs/prompting-strategies" class="external autonumber" rel="nofollow">[15]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/multimodal/content-generation-parameters" class="external autonumber" rel="nofollow">[16]</a></span>
16. <span id="cite_note-hf-warp-16">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-warp_16-0) Transformers API. *TopPLogitsWarper* (параметры и поведение, включая \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-openai-reasoning-17">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-reasoning_17-0) OpenAI API. *Using reasoning models — parameter support*. <a href="https://developers.openai.com/docs/guides/reasoning" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-openai-gpt52-18">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-openai-gpt52_18-0) OpenAI API. *Using GPT-5.2*. <a href="https://developers.openai.com/api/docs/guides/latest-model/" class="external autonumber" rel="nofollow">[19]</a></span>
19. <span id="cite_note-anthropic-thinking-19">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-anthropic-thinking_19-0) Anthropic. *Building with extended thinking*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking" class="external autonumber" rel="nofollow">[20]</a></span>
20. <span id="cite_note-azure-reasoning-20">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-azure-reasoning_20-0) Microsoft Learn (Azure AI Foundry). *Reasoning models — supported parameters*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/reasoning" class="external autonumber" rel="nofollow">[21]</a></span>
21. <span id="cite_note-hf-minp-21">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-hf-minp_21-0) Hugging Face Transformers. *MinPLogitsWarper*. <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.MinPLogitsWarper" class="external autonumber" rel="nofollow">[22]</a></span>
22. <span id="cite_note-vllm-minp-22">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-vllm-minp_22-0) vLLM. *Sampling Parameters — min_p*. <a href="https://docs.vllm.ai/en/latest/serving/sampling_params.html" class="external autonumber" rel="nofollow">[23]</a></span>
23. <span id="cite_note-minp-23">↑ <sup>[23.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp_23-1)</sup> <sup>[23.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp_23-2)</sup> <sup>[23.3](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp_23-3)</sup> Nguyen, M. et al. (2024). *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. arXiv:2407.01082. <a href="https://arxiv.org/abs/2407.01082" class="external autonumber" rel="nofollow">[24]</a></span>
24. <span id="cite_note-minp-arxiv-24">↑ <sup>[24.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp-arxiv_24-0)</sup> <sup>[24.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp-arxiv_24-1)</sup> Nguyen, M. et al. *Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs*. <a href="https://arxiv.org/pdf/2407.01082" class="external autonumber" rel="nofollow">[25]</a></span>
25. <span id="cite_note-minp-critique-25">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-minp-critique_25-0) *Turning Down the Heat: A Critical Analysis of Min-p Sampling in Language Models*. arXiv:2506.13681. <a href="https://arxiv.org/abs/2506.13681" class="external autonumber" rel="nofollow">[26]</a></span>
26. <span id="cite_note-typical-mit-26">↑ <sup>[26.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-typical-mit_26-0)</sup> <sup>[26.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-typical-mit_26-1)</sup> *Locally Typical Sampling*. Transactions of the ACL, MIT Press. <a href="https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00536/114593/Locally-Typical-Sampling" class="external autonumber" rel="nofollow">[27]</a></span>
27. <span id="cite_note-tfs-bricken-27">↑ <sup>[27.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tfs-bricken_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tfs-bricken_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-tfs-bricken_27-2)</sup> Bricken, T. *Tail Free Sampling*. <a href="https://www.trentonbricken.com/Tail-Free-Sampling/" class="external autonumber" rel="nofollow">[28]</a></span>
28. <span id="cite_note-pless-openreview-28">↑ <sup>[28.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-pless-openreview_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-pless-openreview_28-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. OpenReview. <a href="https://openreview.net/forum?id=ItFuNJQGH4" class="external autonumber" rel="nofollow">[29]</a></span>
29. <span id="cite_note-pless-arxiv-29">↑ <sup>[29.0](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-pless-arxiv_29-0)</sup> <sup>[29.1](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-pless-arxiv_29-1)</sup> *p‑less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding*. arXiv:2509.23234. <a href="https://arxiv.org/abs/2509.23234" class="external autonumber" rel="nofollow">[30]</a></span>
30. <span id="cite_note-eta-30">[↑](https://systems-analysis.info/int/Top-p_sampling_(SV)#cite_ref-eta_30-0) Hewitt, J., Manning, C. D., & Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. Findings of EMNLP 2022. arXiv:2210.15191. <a href="https://arxiv.org/abs/2210.15191" class="external autonumber" rel="nofollow">[31]</a></span>

## Se även

- Temperatur
- Stora språkmodeller
