---
title: "Top-p sampling (FR)"
source: "https://systems-analysis.info/int/Top-p_sampling_(FR)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(FR)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8213
wiki_created_at: 2026-09-07T01:13:58Z
wiki_modified_at: 2026-09-07T01:13:58Z
downloaded_at: 2026-09-07T23:24:02Z
---

# Top-p sampling (FR)

**L'échantillonnage Top-p**, également connu sous le nom d' **échantillonnage par noyau** (en anglais *Nucleus Sampling*), est une méthode de décodage stochastique utilisée dans les [grands modèles de langage](https://systems-analysis.info/int/Grands_mod%C3%A8les_de_langage "Grands modèles de langage") (LLM) pour la génération de texte. La méthode a été proposée en 2019 par Ari Holtzman et ses co-auteurs comme une alternative améliorée à l'échantillonnage Top-k fixe. Son principe consiste à sélectionner dynamiquement un ensemble de candidats à chaque étape de la génération en fonction d'un seuil de probabilité cumulative $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)</sup>

## Concept

L'idée principale du Top-p est de sélectionner à chaque étape le **plus petit** ensemble de jetons les plus probables dont la probabilité totale est supérieure ou égale à un seuil donné $p$ (le *noyau*, en anglais *nucleus*). Mathématiquement, pour une distribution conditionnelle $P(x \mid x_{1:i - 1})$ sur un vocabulaire $V$, le noyau $V^{(p)}$ peut être défini comme suit :

$\sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1}) \geq p\quad\text{et}\quad\forall\, S \subset V^{(p)}:\ \sum\limits_{x \in S}P(x \mid x_{1:i - 1}) < p.$

Une formulation équivalente consiste à trier les jetons par ordre décroissant de $P(x \mid x_{1:i - 1})$ et à prendre le **plus court préfixe** dont la masse cumulative est ≥ $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)</sup>

Une fois le noyau défini, les probabilités des jetons en dehors de $V^{(p)}$ sont mises à zéro, et celles à l'intérieur du noyau sont normalisées (leur somme devient égale à 1). Le jeton suivant est ensuite échantillonné à partir de cette distribution tronquée.

### Adaptation dynamique

- Pour une distribution « pointue » (le modèle est confiant), le noyau est petit : quelques jetons suffisent pour atteindre une masse ≥ $p$, ce qui augmente la cohérence.
- Pour une distribution « plate » (de nombreuses suites sont plausibles), le noyau est grand : le choix est élargi, ce qui augmente la diversité.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)</sup>

## Comparaison avec d'autres méthodes de décodage

### Top-p vs. Top-k

- Le **Top-k** sélectionne toujours parmi un nombre fixe $k$ de jetons les plus probables. Dans les distributions « pointues », cela peut ajouter des options superflues et peu probables « pour faire le nombre », tandis que dans les distributions « plates », cela peut au contraire écarter des suites raisonnables qui ne figurent pas dans le top $k$.
- Le **Top-p** ajuste la taille de l'ensemble de candidats en fonction des données de l'étape, ce qui rend son comportement plus flexible et plus stable sur différents types de distributions.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)</sup>

### Top-p vs. Température

- La **température** (*temperature*) remodèle la forme entière de la distribution (la rendant plus pointue ou plus lisse), mais **n'écarte pas** les jetons : même les options peu probables conservent une chance non nulle.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-hf-gen-2)</sup>
- Le **Top-p** introduit une **troncation stricte de la queue** de la distribution — les jetons à faible probabilité sont complètement exclus de l'échantillonnage, ce qui aide à prévenir les suites manifestement inappropriées.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)</sup>

Conseil pratique des fournisseurs : pour ajuster le style ou le caractère aléatoire, on modifie généralement **soit** la \`temperature\`, **soit** le \`top_p\`, mais pas les deux simultanément, afin d'éviter un double impact sur la distribution et de simplifier le diagnostic.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-azure-rec-3)</sup>

## Application pratique et recommandations

Le Top-p est largement utilisé dans les LLM modernes en raison de sa combinaison de flexibilité et de contrôlabilité.

- **Plage de valeurs typique.** En pratique, on utilise souvent $p \approx 0.90\text{–}0.95$ (voir les guides et exemples dans Transformers ; dans de nombreux SDK, la valeur **0.95** est utilisée comme valeur par défaut ou recommandée dans les exemples).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-hf-gen-2)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-vertex-params-4)</sup>
  - Des valeurs proches de 1.0 (par exemple, 0.98–0.99) augmentent la diversité : le noyau inclut plus de jetons.
  - Des valeurs plus faibles (par exemple, 0.80–0.90) augmentent le déterminisme et la « retenue » de la sortie.
  - À $p = 1$, la troncation disparaît : la sélection se fait sur l'ensemble du vocabulaire (en tenant compte de la température).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-hf-gen-2)</sup>

<!-- -->

- **Compatibilité avec les bibliothèques et les API.**
  - Dans Transformers, le *TopPLogitsWarper* est implémenté, qui utilise également un seuil \`min_tokens_to_keep\` (généralement ≥1) pour empêcher le noyau de devenir vide avec des valeurs de $p$ très faibles et des distributions « pointues ».<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-hf-warp-5)</sup>
  - Dans plusieurs API, le paramètre \`top_p\` est disponible, alors que \`top_k\` peut être absent ; la prise en charge des paramètres et leur sémantique **dépendent du modèle/fournisseur spécifique** (par exemple, certains modèles de raisonnement peuvent limiter les réglages de stochasticité). Consultez les documentations officielles d'OpenAI/Azure/Google.<sup>[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-openai-top-p-6)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-azure-rec-3)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-vertex-params-4)</sup>

<!-- -->

- **Textes longs et répétitivité.** Une série d'expériences a montré que l'échantillonnage par noyau réduit la tendance à la dégénérescence (répétitions, phrases clichées) par rapport aux méthodes greedy/beam et au Top-k fixe, en particulier sur les longues séquences.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-holtzman2019-1)[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_note-tan2024-7)</sup>

## Voir aussi

- Température
- [Grands modèles de langage](https://systems-analysis.info/int/Grands_mod%C3%A8les_de_langage "Grands modèles de langage")

## Bibliographie

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Yu, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://aclanthology.org/2023.findings-acl.3.pdf" class="external text" rel="nofollow">ACL Findings 2023</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Finlayson, M. et al. (2024). *Basis‑Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods*. <a href="https://arxiv.org/abs/2410.03968" class="external text" rel="nofollow">arXiv:2410.03968</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.

## Références

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-holtzman2019_1-5)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hf-gen-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-hf-gen_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-hf-gen_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-hf-gen_2-2)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-azure-rec-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-azure-rec_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-azure-rec_3-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. Recommandation de « modifier la température **ou** top_p, mais pas les deux simultanément ». <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/how-to/completions" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-vertex-params-4">↑ <sup>[4.0](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-vertex-params_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-vertex-params_4-1)</sup> Google AI / Vertex AI. *Generation parameters (topP/topK) for text/Gemini*. Exemples avec topP≈0.95. <a href="https://ai.google.dev/gemini-api/docs/parameters" class="external autonumber" rel="nofollow">[4]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-reference/text#parameters" class="external autonumber" rel="nofollow">[5]</a></span>
5.  <span id="cite_note-hf-warp-5">[↑](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-hf-warp_5-0) Transformers API. *TopPLogitsWarper* (paramètres et comportement, y compris \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[6]</a></span>
6.  <span id="cite_note-openai-top-p-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-openai-top-p_6-0) OpenAI API Reference. *top_p*. <a href="https://platform.openai.com/docs/api-reference/chat/create#chat-create-top_p" class="external autonumber" rel="nofollow">[7]</a></span>
7.  <span id="cite_note-tan2024-7">[↑](https://systems-analysis.info/int/Top-p_sampling_(FR)#cite_ref-tan2024_7-0) Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. arXiv:2402.06925. <a href="https://arxiv.org/abs/2402.06925" class="external autonumber" rel="nofollow">[8]</a></span>
