---
title: "Top-k sampling (ES)"
source: "https://systems-analysis.info/int/Top-k_sampling_(ES)"
wiki: "systems-analysis.info/int"
article: "Top-k_sampling_(ES)"
language: "es"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 8184
wiki_created_at: 2026-09-07T01:13:32Z
wiki_modified_at: 2026-09-07T01:13:32Z
downloaded_at: 2026-09-07T23:23:49Z
---

# Top-k sampling (ES)

**Muestreo Top-k** (del inglés *Top-k sampling*) es un método de decodificación estocástico utilizado en los [grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje") (LLM) para la generación de texto. Su objetivo principal es limitar la selección del siguiente token a un número fijo ($k$) de los candidatos más probables, lo que permite evitar la generación de palabras poco probables y a menudo irrelevantes. Este método fue una de las primeras mejoras sobre el muestreo aleatorio simple y durante mucho tiempo fue una forma popular de mejorar la coherencia del texto generado.

## Concepto y matemática

En cada paso de la generación de texto, un modelo de lenguaje estándar produce una distribución de probabilidad $P(x|x_{1:i - 1})$ sobre todo el vocabulario $V$. El muestreo Top-k modifica este proceso de la siguiente manera:

1\. **Selección de candidatos:** De todo el vocabulario, se selecciona un subconjunto $V^{(k)}$ que consta de los $k$ tokens con las probabilidades más altas.

2\. **Truncamiento:** Las probabilidades de todos los tokens que no están en $V^{(k)}$ se establecen en cero.

3\. **Redistribución (normalización):** Las probabilidades de los $k$ tokens restantes se reescalan para que su nueva suma sea igual a 1.

4\. **Muestreo:** El siguiente token se selecciona aleatoriamente de esta nueva distribución truncada.

Así, Top-k introduce un **umbral estricto** en el número de candidatos: las palabras con un rango de probabilidad inferior a $k$ nunca serán seleccionadas.

### Influencia del parámetro $k$

- **$k$ pequeño (por ejemplo, $k = 5$ – $10$):** Hace que la generación sea más **conservadora** y **predecible**. El modelo elige solo de un conjunto muy limitado de las palabras más probables. Esto aumenta la coherencia, pero puede llevar a un texto repetitivo y aburrido.
- **$k$ grande (por ejemplo, $k = 50$ – $100$):** Aumenta la **diversidad** y **creatividad** del texto, ya que se incluyen más opciones en la muestra. Sin embargo, esto también aumenta el riesgo de incluir tokens menos relevantes o inapropiados.
- **Casos límite:**
  - **$k = 1$:** Equivalente a la **decodificación voraz (greedy decoding)**. El modelo siempre elige el token más probable.
  - **$k$ = tamaño del vocabulario:** Equivalente al muestreo estándar de la distribución completa, sin truncamiento.

## Importancia histórica

El método Top-k fue propuesto formalmente en 2018 por Angela Fan y sus colegas como una solución eficaz al problema de la degradación de la calidad del texto al utilizar un muestreo aleatorio completo. Demostraron que limitar la selección a un pequeño número de candidatos mejoraba significativamente la coherencia y el sentido de las historias generadas.

Por ejemplo, en las primeras versiones de GPT-2 se utilizaba un parámetro \`top_k=40\`, lo que permitía al modelo generar textos largos y coherentes que eran inalcanzables con métodos anteriores.

## Comparación con otros métodos de decodificación

### Top-k vs. Top-p

Top-k ha sido en gran medida reemplazado por un método más avanzado: el **muestreo Top-p (nucleus)**.

- **La principal desventaja de Top-k es su falta de adaptabilidad.** Un valor fijo de $k$ no tiene en cuenta la forma de la distribución de probabilidad:
  - Cuando la distribución es **pronunciada** (el modelo está seguro de unos pocos tokens), Top-k puede ampliar artificialmente la selección, incluyendo candidatos poco probables.
  - Cuando la distribución es **plana** (el modelo no está seguro y muchos tokens tienen una probabilidad similar), Top-k puede truncar prematuramente muchas opciones adecuadas.
- **Top-p**, por el contrario, **adapta dinámicamente** el tamaño de la muestra, seleccionando tokens en función de su probabilidad acumulada. Esto lo hace más flexible y fiable.

### Top-k vs. Temperatura

- La **temperatura** cambia la forma de toda la distribución de probabilidad, pero no trunca los tokens. Afecta a las probabilidades relativas de todos los candidatos.
- **Top-k** introduce un **truncamiento estricto**, excluyendo por completo los tokens fuera del top-$k$.

En la práctica, Top-k puede usarse junto con la temperatura: primero, la temperatura modifica la distribución y, luego, Top-k trunca los candidatos.

## Aplicación práctica

Aunque el muestreo Top-p se considera hoy en día preferible, Top-k todavía se utiliza en algunos casos, especialmente cuando se requiere un control simple e intuitivo sobre el tamaño de la muestra.

- **Valores típicos:** En la práctica, se utilizan valores de $k$ entre 20 y 100, dependiendo del equilibrio deseado entre coherencia y diversidad.
- **Recomendaciones:** Para la mayoría de las tareas, se recomienda usar Top-p. Si aun así se utiliza Top-k, debe combinarse con una temperatura moderada y seleccionar cuidadosamente el valor de $k$ para la tarea específica.

## Véase también

- [Grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje")

## Bibliografía

- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Holtzman, A. et al. (2024). *Closing the Curious Case of Neural Text Degeneration*. <a href="https://openreview.net/pdf?id=dONpC9GL1o" class="external text" rel="nofollow">OpenReview:dONpC9GL1o</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Finlayson, M. et al. (2024). *Basis-Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Yu, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://arxiv.org/abs/2305.02633" class="external text" rel="nofollow">arXiv:2305.02633</a>.
- Chen, S. J. et al. (2025). *Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods*. <a href="https://arxiv.org/abs/2410.03968" class="external text" rel="nofollow">arXiv:2410.03968</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.
