---
title: "Top-p sampling (DE)"
source: "https://systems-analysis.info/int/Top-p_sampling_(DE)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8209
wiki_created_at: 2026-09-07T01:13:53Z
wiki_modified_at: 2026-09-07T01:13:53Z
downloaded_at: 2026-09-07T23:23:58Z
---

# Top-p sampling (DE)

**Top-p-Sampling**, auch bekannt als **Nucleus-Sampling** (englisch *Nucleus Sampling*), ist eine stochastische Dekodierungsmethode, die in [großen Sprachmodellen](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLMs) zur Textgenerierung verwendet wird. Die Methode wurde 2019 von Ari Holtzman et al. als verbesserte Alternative zum festen Top-k-Sampling vorgeschlagen. Ihre Idee besteht darin, die Menge der Kandidaten-Tokens bei jedem Generierungsschritt dynamisch anhand einer kumulativen Wahrscheinlichkeitsschwelle $p$ auszuwählen.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)</sup>

## Konzept

Die Grundidee von Top-p besteht darin, bei jedem Schritt die **kleinste** mögliche Menge der wahrscheinlichsten Tokens auszuwählen, deren summierte Wahrscheinlichkeit nicht geringer als ein vorgegebener Schwellenwert $p$ ist (der *Kern*, englisch *nucleus*). Mathematisch lässt sich für eine bedingte Verteilung $P(x \mid x_{1:i - 1})$ über dem Vokabular $V$ der Kern $V^{(p)}$ wie folgt definieren:

$\sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1}) \geq p\quad\text{und}\quad\forall\, S \subset V^{(p)}:\ \sum\limits_{x \in S}P(x \mid x_{1:i - 1}) < p.$

Eine äquivalente Formulierung lautet: Sortieren Sie die Tokens nach absteigender Wahrscheinlichkeit $P(x \mid x_{1:i - 1})$ und wählen Sie das **kürzeste Präfix** aus, dessen kumulative Wahrscheinlichkeitsmasse ≥ $p$ ist.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)</sup>

Nach der Bestimmung des Kerns werden die Wahrscheinlichkeiten der Tokens außerhalb von $V^{(p)}$ auf null gesetzt und die Wahrscheinlichkeiten innerhalb des Kerns neu normiert (sodass ihre Summe 1 beträgt). Das nächste Token wird dann aus dieser verkürzten Verteilung gesampelt.

### Dynamische Anpassung

- Bei einer „spitzen“ Verteilung (wenn das Modell sehr sicher ist) ist der Kern klein: Nur wenige Tokens erreichen bereits eine kumulative Wahrscheinlichkeit von ≥ $p$, was die Kohärenz erhöht.
- Bei einer „flachen“ Verteilung (wenn es viele plausible Fortsetzungen gibt) ist der Kern groß: Die Auswahl wird erweitert, was die Vielfalt erhöht.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)</sup>

## Vergleich mit anderen Dekodierungsmethoden

### Top-p vs. Top-k

- **Top-k** wählt immer aus einer festen Anzahl $k$ der wahrscheinlichsten Tokens aus. Bei „spitzen“ Verteilungen kann dies unnötige, unwahrscheinliche Optionen hinzufügen, nur um die Anzahl $k$ zu erreichen, während bei „flachen“ Verteilungen umgekehrt plausible Fortsetzungen abgeschnitten werden können, die nicht zu den Top-$k$ gehören.
- **Top-p** passt die Größe der Kandidatenmenge an die Verteilung des aktuellen Schritts an, was das Verhalten flexibler und über verschiedene Verteilungstypen hinweg stabiler macht.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)</sup>

### Top-p vs. Temperatur

- **Temperatur** (*temperature*) formt die gesamte Wahrscheinlichkeitsverteilung um (macht sie spitzer oder flacher), schneidet aber **keine** Tokens ab: Selbst sehr unwahrscheinliche Optionen behalten eine von null verschiedene Wahrscheinlichkeit.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-hf-gen-2)</sup>
- **Top-p** führt eine **harte Abschneidung des Verteilungsschwanzes** ein, wodurch Tokens mit geringer Wahrscheinlichkeit vollständig vom Sampling ausgeschlossen werden. Dies hilft, offensichtlich unpassende Fortsetzungen zu verhindern.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)</sup>

Ein praktischer Ratschlag von Anbietern lautet: Zur Steuerung von Stil und Zufälligkeit sollte man in der Regel **entweder** \`temperature\` **oder** \`top_p\` anpassen, aber nicht beide gleichzeitig, um eine doppelte Beeinflussung der Verteilung zu vermeiden und die Fehlersuche zu vereinfachen.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-azure-rec-3)</sup>

## Praktische Anwendung und Empfehlungen

Top-p wird in modernen LLMs aufgrund seiner Kombination aus Flexibilität und Kontrollierbarkeit häufig eingesetzt.

- **Typischer Wertebereich.** In der Praxis werden oft Werte von $p \approx 0.90\text{–}0.95$ verwendet (siehe Anleitungen und Beispiele in Transformers; in vielen SDKs wird **0.95** als Standardwert oder in Beispielen empfohlen).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-hf-gen-2)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-vertex-params-4)</sup>
  - Werte nahe 1.0 (z. B. 0.98–0.99) erhöhen die Vielfalt, da mehr Tokens in den Kern aufgenommen werden.
  - Niedrigere Werte (z. B. 0.80–0.90) erhöhen die Determiniertheit und „Zurückhaltung“ der Ausgabe.
  - Bei $p = 1$ entfällt die Abschneidung: Die Auswahl erfolgt aus dem gesamten Vokabular (unter Berücksichtigung der Temperatur).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-hf-gen-2)</sup>

<!-- -->

- **Kompatibilität mit Bibliotheken und APIs.**
  - In Transformers ist der *TopPLogitsWarper* implementiert, der zusätzlich einen Schwellenwert \`min_tokens_to_keep\` (typischerweise ≥1) verwendet. Dieser verhindert, dass der Kern bei sehr kleinen $p$-Werten und „spitzen“ Verteilungen degeneriert (leer wird).<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-hf-warp-5)</sup>
  - In einigen APIs ist der Parameter \`top_p\` verfügbar, während \`top_k\` möglicherweise fehlt. Die Unterstützung und Semantik der Parameter **hängen vom jeweiligen Modell/Anbieter ab** (z. B. können einige auf schlussfolgerndes Denken spezialisierte Modelle die Anpassung der Stochastizität einschränken). Siehe dazu die offiziellen Dokumentationen von OpenAI, Azure und Google.<sup>[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-openai-top-p-6)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-azure-rec-3)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-vertex-params-4)</sup>

<!-- -->

- **Lange Texte und Wiederholungen.** In Experimenten wurde gezeigt, dass Nucleus-Sampling im Vergleich zu Greedy- und Beam-Search sowie festem Top-k die Tendenz zur Textdegeneration (Wiederholungen, stereotype Phrasen) reduziert, insbesondere bei langen Sequenzen.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-holtzman2019-1)[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_note-tan2024-7)</sup>

## Siehe auch

- [Temperatur](https://systems-analysis.info/int/Temperatur_(LLM) "Temperatur (LLM)")
- [Große Sprachmodelle](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle")

## Literatur

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Yu, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://aclanthology.org/2023.findings-acl.3.pdf" class="external text" rel="nofollow">ACL Findings 2023</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Finlayson, M. et al. (2024). *Basis‑Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods*. <a href="https://arxiv.org/abs/2410.03968" class="external text" rel="nofollow">arXiv:2410.03968</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.

## Einzelnachweise

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-holtzman2019_1-5)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hf-gen-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-hf-gen_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-hf-gen_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-hf-gen_2-2)</sup> Hugging Face Transformers. *Generation strategies (top-k, top-p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-azure-rec-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-azure-rec_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-azure-rec_3-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. Empfehlung: „ändern Sie \`temperature\` **oder** \`top_p\`, aber nicht beides gleichzeitig“. <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/how-to/completions" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-vertex-params-4">↑ <sup>[4.0](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-vertex-params_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-vertex-params_4-1)</sup> Google AI / Vertex AI. *Generation parameters (topP/topK) for text/Gemini*. Beispiele mit topP≈0.95. <a href="https://ai.google.dev/gemini-api/docs/parameters" class="external autonumber" rel="nofollow">[4]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-reference/text#parameters" class="external autonumber" rel="nofollow">[5]</a></span>
5.  <span id="cite_note-hf-warp-5">[↑](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-hf-warp_5-0) Transformers API. *TopPLogitsWarper* (Parameter und Verhalten, einschließlich \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[6]</a></span>
6.  <span id="cite_note-openai-top-p-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-openai-top-p_6-0) OpenAI API Reference. *top_p*. <a href="https://platform.openai.com/docs/api-reference/chat/create#chat-create-top_p" class="external autonumber" rel="nofollow">[7]</a></span>
7.  <span id="cite_note-tan2024-7">[↑](https://systems-analysis.info/int/Top-p_sampling_(DE)#cite_ref-tan2024_7-0) Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. arXiv:2402.06925. <a href="https://arxiv.org/abs/2402.06925" class="external autonumber" rel="nofollow">[8]</a></span>
