---
title: "Top-p sampling (ES)"
source: "https://systems-analysis.info/int/Top-p_sampling_(ES)"
wiki: "systems-analysis.info/int"
article: "Top-p_sampling_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 8211
wiki_created_at: 2026-09-07T01:13:55Z
wiki_modified_at: 2026-09-07T01:13:55Z
downloaded_at: 2026-09-07T23:24:00Z
---

# Top-p sampling (ES)

**El muestreo Top‑p**, también conocido como **muestreo de núcleo** (en inglés, *Nucleus Sampling*), es un método de decodificación estocástico utilizado en los [grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje") (LLM) para la generación de texto. El método fue propuesto en 2019 por Ari Holtzman et al. como una alternativa mejorada al muestreo Top‑k fijo. Su idea es seleccionar dinámicamente el conjunto de candidatos en cada paso de la generación basándose en un umbral de probabilidad acumulada $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)</sup>

## Concepto

La idea principal de Top-p es seleccionar en cada paso el conjunto **más pequeño** de tokens más probables cuya probabilidad total sea mayor o igual al umbral especificado $p$ (el *núcleo*, en inglés *nucleus*). Matématicamente, para una distribución condicional $P(x \mid x_{1:i - 1})$ sobre un vocabulario $V$, el núcleo $V^{(p)}$ se puede definir de la siguiente manera:

$\sum\limits_{x \in V^{(p)}}P(x \mid x_{1:i - 1}) \geq p\quad\text{y}\quad\forall\, S \subset V^{(p)}:\ \sum\limits_{x \in S}P(x \mid x_{1:i - 1}) < p.$

Una formulación equivalente es: ordenar los tokens en orden descendente de $P(x \mid x_{1:i - 1})$ y tomar el **prefijo más corto** cuya masa acumulada sea ≥ $p$.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)</sup>

Una vez que se define el núcleo, las probabilidades de los tokens fuera de $V^{(p)}$ se establecen en cero, y las de los tokens dentro del núcleo se normalizan (su suma se convierte en 1). El siguiente token se muestrea a partir de esta distribución truncada.

### Adaptación dinámica

- En una distribución «puntiaguda» (cuando el modelo está seguro), el núcleo es pequeño: unos pocos tokens ya alcanzan una masa ≥ $p$, lo que aumenta la coherencia.
- En una distribución «plana» (cuando hay muchas continuaciones plausibles), el núcleo es grande: la selección se amplía, lo que aumenta la diversidad.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)</sup>

## Comparación con otros métodos de decodificación

### Top‑p vs. Top‑k

- **Top‑k** siempre selecciona de un número fijo $k$ de los tokens más probables. En distribuciones «puntiagudas», esto puede añadir opciones innecesarias y poco probables solo para alcanzar el número $k$, mientras que en distribuciones «planas», por el contrario, puede descartar continuaciones razonables que no llegaron a estar entre los $k$ principales.
- **Top‑p** ajusta el tamaño del conjunto de candidatos según los datos del paso actual, lo que hace que su comportamiento sea más flexible y estable en diferentes tipos de distribuciones.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)</sup>

### Top‑p vs. Temperatura

- La **temperatura** (*temperature*) remodela toda la forma de la distribución (haciéndola más puntiaguda o más suave), pero **no descarta** tokens: incluso las opciones poco probables conservan una probabilidad distinta de cero.<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-hf-gen-2)</sup>
- **Top‑p** introduce un **truncamiento estricto de la cola** de la distribución: los tokens de baja probabilidad se excluyen por completo del muestreo, lo que ayuda a prevenir continuaciones claramente inapropiadas.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)</sup>

Un consejo práctico de los proveedores: al ajustar el estilo o la aleatoriedad, generalmente se modifica **o bien** \`temperature\`, **o bien** \`top_p\`, pero no ambos simultáneamente, para evitar un impacto «doble» en la distribución y simplificar el diagnóstico.<sup>[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-azure-rec-3)</sup>

## Aplicación práctica y recomendaciones

Top‑p es ampliamente utilizado en los LLM modernos debido a su combinación de flexibilidad y control.

- **Rango de valores típico.** En la práctica, se suelen utilizar valores de $p \approx 0.90\text{–}0.95$ (ver guías y ejemplos en Transformers; en muchos SDK, el valor **0.95** aparece como predeterminado o recomendado en los ejemplos).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-hf-gen-2)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-vertex-params-4)</sup>
  - Valores cercanos a 1.0 (por ejemplo, 0.98–0.99) aumentan la diversidad, ya que más tokens entran en el núcleo.
  - Valores más bajos (por ejemplo, 0.80–0.90) aumentan el determinismo y la «contención» del resultado.
  - Con $p = 1$, el truncamiento desaparece: la selección se realiza sobre todo el vocabulario (teniendo en cuenta la temperatura).<sup>[\[2\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-hf-gen-2)</sup>

<!-- -->

- **Compatibilidad con bibliotecas y API.**
  - En Transformers, se implementa *TopPLogitsWarper*, que utiliza adicionalmente un umbral \`min_tokens_to_keep\` (generalmente ≥1) para evitar la degeneración del núcleo con valores de $p$ muy pequeños y distribuciones «puntiagudas».<sup>[\[5\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-hf-warp-5)</sup>
  - En varias API, el parámetro \`top_p\` está disponible, mientras que \`top_k\` puede no estarlo; el soporte de los parámetros y su semántica **dependen del modelo/proveedor específico** (por ejemplo, algunos modelos de razonamiento pueden restringir la configuración estocástica). Consulte las guías oficiales de OpenAI/Azure/Google.<sup>[\[6\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-openai-top-p-6)[\[3\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-azure-rec-3)[\[4\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-vertex-params-4)</sup>

<!-- -->

- **Textos largos y repetitividad.** En una serie de experimentos, se ha demostrado que el muestreo de núcleo (nucleus sampling) reduce la tendencia a la degeneración (repeticiones, frases clichés) en comparación con los métodos greedy, beam search y Top-k fijo, especialmente en secuencias largas.<sup>[\[1\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-holtzman2019-1)[\[7\]](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_note-tan2024-7)</sup>

## Véase también

- [Temperatura](https://systems-analysis.info/int/Temperatura_(LLM)_(ES) "Temperatura (LLM) (ES)")
- [Grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje")

## Literatura

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Yu, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://aclanthology.org/2023.findings-acl.3.pdf" class="external text" rel="nofollow">ACL Findings 2023</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Finlayson, M. et al. (2024). *Basis‑Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods*. <a href="https://arxiv.org/abs/2410.03968" class="external text" rel="nofollow">arXiv:2410.03968</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.

## Referencias

1.  <span id="cite_note-holtzman2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-holtzman2019_1-5)</sup> Holtzman, A., Buys, J., Du, L., Forbes, M., & Choi, Y. (2019). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751. <a href="https://arxiv.org/abs/1904.09751" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hf-gen-2">↑ <sup>[2.0](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-hf-gen_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-hf-gen_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-hf-gen_2-2)</sup> Hugging Face Transformers. *Generation strategies (top‑k, top‑p, temperature)*. <a href="https://huggingface.co/docs/transformers/main/en/generation_strategies" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-azure-rec-3">↑ <sup>[3.0](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-azure-rec_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-azure-rec_3-1)</sup> Microsoft Learn (Azure OpenAI). *Text/Chat Completions — parameters*. Recomendación: «modificar \`temperature\` **o** \`top_p\`, pero no ambos al mismo tiempo». <a href="https://learn.microsoft.com/en-us/azure/ai-services/openai/how-to/completions" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-vertex-params-4">↑ <sup>[4.0](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-vertex-params_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-vertex-params_4-1)</sup> Google AI / Vertex AI. *Generation parameters (topP/topK) for text/Gemini*. Ejemplos con topP≈0.95. <a href="https://ai.google.dev/gemini-api/docs/parameters" class="external autonumber" rel="nofollow">[4]</a> <a href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-reference/text#parameters" class="external autonumber" rel="nofollow">[5]</a></span>
5.  <span id="cite_note-hf-warp-5">[↑](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-hf-warp_5-0) Transformers API. *TopPLogitsWarper* (parámetros y comportamiento, incluyendo \`min_tokens_to_keep\`). <a href="https://huggingface.co/docs/transformers/main/en/main_classes/text_generation#transformers.TopPLogitsWarper" class="external autonumber" rel="nofollow">[6]</a></span>
6.  <span id="cite_note-openai-top-p-6">[↑](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-openai-top-p_6-0) OpenAI API Reference. *top_p*. <a href="https://platform.openai.com/docs/api-reference/chat/create#chat-create-top_p" class="external autonumber" rel="nofollow">[7]</a></span>
7.  <span id="cite_note-tan2024-7">[↑](https://systems-analysis.info/int/Top-p_sampling_(ES)#cite_ref-tan2024_7-0) Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. arXiv:2402.06925. <a href="https://arxiv.org/abs/2402.06925" class="external autonumber" rel="nofollow">[8]</a></span>
