---
title: "Perplejidad (métrica)"
source: "https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)"
wiki: "systems-analysis.info/int"
article: "Perplejidad_(métrica)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 5519
wiki_created_at: 2026-09-06T23:50:27Z
wiki_modified_at: 2026-09-06T23:50:27Z
downloaded_at: 2026-09-07T23:08:52Z
---

# Perplejidad (métrica)

**Perplejidad** (del inglés *Perplexity*, PPL), en la teoría de la información y el aprendizaje automático, es una medida de la incertidumbre o "sorpresa" de un modelo de lenguaje al predecir una muestra de texto. Una perplejidad baja indica que la distribución de probabilidad del modelo se ajusta bien a los datos de prueba, mientras que una perplejidad alta significa que el modelo predice mal la secuencia<sup>[\[1\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-en_wiki-1)</sup>.

Formalmente, la perplejidad de una distribución de probabilidad se define como la exponencial de su entropía. Para una distribución discreta $p(x)$, es igual a $2^{H(p)}$, donde $H(p)$ es la entropía<sup>[\[1\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-en_wiki-1)</sup>. Intuitivamente, la perplejidad puede entenderse como el número "efectivo" de opciones entre las que el modelo elige en cada paso. Si la perplejidad es 100, significa que la incertidumbre del modelo es equivalente a elegir uno de 100 resultados equiprobables<sup>[\[2\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-comet_eval-2)</sup>.

El término fue introducido por primera vez en 1977 por un grupo de investigadores de IBM liderado por Frederick Jelinek en el contexto del reconocimiento estadístico del habla para cuantificar la "dificultad" de una tarea<sup>[\[3\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-readme_jelinek-3)</sup>.

## Perplejidad en los modelos de lenguaje

En el campo del procesamiento del lenguaje natural (PLN), la perplejidad se ha convertido en una métrica intrínseca (*intrinsic*) estándar para la evaluación de la calidad de los modelos de lenguaje. Mide qué tan bien un modelo predice una secuencia de palabras o tokens en un conjunto de datos de prueba.

### Definición formal

Para un corpus de prueba $W = w_{1}w_{2}\ldots w_{N}$ y un modelo de lenguaje $q$, la perplejidad se calcula como la media geométrica inversa de la probabilidad del corpus de prueba, normalizada por el número de palabras: $\text{PP}(W,q) = \left( \prod\limits_{i = 1}^{N}\frac{1}{q(w_{i} \mid w_{1},\ldots,w_{i - 1})} \right)^{1/N}$

Esta fórmula es equivalente a la exponencial de la entropía cruzada, o la pérdida logarítmica negativa media (*negative log-likelihood*): $\text{PP}(W,q) = \exp\left( - \frac{1}{N}\sum\limits_{i = 1}^{N}\log q(w_{i} \mid \text{contexto}) \right)$

**Minimizar la perplejidad** es equivalente a **maximizar la verosimilitud** del modelo sobre los datos de prueba. Por lo tanto, un modelo con menor perplejidad se considera estadísticamente más preciso<sup>[\[4\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-stanford_slp-4)</sup>.

### Aplicación histórica y LLM modernos

Históricamente, la perplejidad se utilizó ampliamente para evaluar modelos estadísticos de n-gramas. Por ejemplo, para el corpus del *Wall Street Journal*, un modelo de unigramas (que solo considera las frecuencias de las palabras) tiene una perplejidad de ~962, mientras que un modelo de trigramas (que considera el contexto de las dos palabras anteriores) tiene una perplejidad de aproximadamente 109<sup>[\[5\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-jurafsky_slp3-5)</sup>. Esta drástica reducción demuestra cuánto mejor el modelo captura los patrones lingüísticos.

Con el desarrollo de los modelos de lenguaje grandes (LLM), la perplejidad ha mantenido su papel como punto de referencia básico. Los investigadores reportan la perplejidad en conjuntos de datos de prueba estándar (por ejemplo, WikiText) como un indicador de la "fluidez" del modelo. Así, en el artículo de OpenAI sobre GPT-2, se indica que el modelo con ~117 millones de parámetros alcanza una perplejidad de aproximadamente 37 en el corpus WikiText-103<sup>[\[6\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-gpt2_issue-6)</sup>. La reducción de la perplejidad generalmente se correlaciona con una mejora en la calidad del modelo, por lo que la métrica sirve como un indicador conveniente del progreso durante el entrenamiento y la optimización.

## Limitaciones e interpretación de la métrica

Aunque una perplejidad baja indica una alta verosimilitud de los datos según el modelo, este indicador tiene varias limitaciones significativas y no siempre se correlaciona con la calidad real del texto generado.

- **Baja perplejidad ≠ alta calidad**. La perplejidad mide la *confianza* del modelo en sus predicciones, pero no su *fiabilidad*. Un modelo puede estar confiadamente equivocado, generando texto sin sentido pero estadísticamente probable (por ejemplo, repitiendo palabras y frases muy comunes)<sup>[\[2\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-comet_eval-2)</sup>.
- **Sensibilidad a los datos y a la tokenización**. La perplejidad **no es adecuada para comparar directamente modelos** con diferentes arquitecturas, vocabularios o métodos de tokenización. Por ejemplo, un modelo a nivel de caracteres puede tener una perplejidad numéricamente más baja que un modelo a nivel de palabras, pero esto no significa que resuelva mejor las tareas lingüísticas<sup>[\[2\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-comet_eval-2)</sup>.
- **Incapacidad para evaluar la semántica y el contexto largo**. La perplejidad es una métrica local que evalúa la predicción del siguiente token. Se correlaciona débilmente con la capacidad del modelo para captar dependencias a largo plazo y el contexto semántico a grandes distancias. Un estudio de 2023 (Hu et al.) demostró que la capacidad de los LLM para comprender textos largos (hasta 100,000 tokens) apenas se refleja en la métrica de perplejidad<sup>[\[7\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-hu_long_context-7)</sup>.
- **Posibilidad de manipulación**. La métrica puede ser "engañada". Un modelo sobreajustado mostrará una perplejidad artificialmente baja en datos que ha "memorizado". Investigaciones (Wang et al., 2022) también han demostrado que la duplicación de fragmentos de texto o incluso la ausencia de un punto al final de una oración puede reducir o aumentar injustificadamente la perplejidad sin afectar la calidad real del texto<sup>[\[8\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-wang_unreliable-8)</sup>.

## Conclusión: el papel de la perplejidad en la actualidad

Teniendo en cuenta las limitaciones mencionadas, en la práctica moderna la perplejidad se considera un **indicador auxiliar y preliminar** de la calidad de un modelo de lenguaje. Sigue siendo una herramienta valiosa para la evaluación rápida y la depuración de modelos, ya que no depende de una tarea de aplicación específica y es fácil de calcular<sup>[\[2\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-comet_eval-2)</sup>.

Sin embargo, para una evaluación completa de un LLM, la perplejidad por sí sola no es suficiente. Hoy en día, se complementa obligatoriamente con métricas extrínsecas (*extrinsic*) vinculadas a tareas específicas, como:

- Precisión en las respuestas a preguntas;
- Evaluaciones humanas (*human evaluation*);
- BLEU/ROUGE para traducción automática y resumen de textos.

En conjunto con estos métodos, la perplejidad sigue desempeñando un papel importante —servir como una medida objetiva de la "sorpresa" del modelo—, pero sus resultados siempre se interpretan teniendo en cuenta las limitaciones mencionadas<sup>[\[2\]](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_note-comet_eval-2)</sup>.

## Enlaces externos

- <a href="https://habr.com/ru/companies/wunderfund/articles/580230/" class="external text" rel="nofollow">Artículo "Perplejidad en los modelos de lenguaje" en Habr (en ruso)</a>
- <a href="https://huggingface.co/docs/transformers/perplexity" class="external text" rel="nofollow">Documentación de Hugging Face sobre el cálculo de la perplejidad</a>

## Bibliografía

- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). *Perplexity — a Measure of the Difficulty of Speech Recognition Tasks*. <a href="https://pubs.aip.org/asa/jasa/article/62/S1/S63/642598" class="external text" rel="nofollow">JASA:62(S1):S63</a>.
- Jurafsky, D., & Martin, J. H. (2021). *Speech and Language Processing* (3ª ed., cap. 3: N-gram Language Models). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external text" rel="nofollow">PDF</a>.
- Radford, A. et al. (2019). *Language Models are Unsupervised Multitask Learners*. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external text" rel="nofollow">OpenAI white paper</a>.
- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Wang, C. et al. (2022). *Perplexity by PLM Is Unreliable for Evaluating Text Quality*. <a href="https://arxiv.org/abs/2210.05892" class="external text" rel="nofollow">arXiv:2210.05892</a>.
- Meister, C., & Cotterell, R. (2021). *Language Model Evaluation Beyond Perplexity*. <a href="https://arxiv.org/abs/2106.00085" class="external text" rel="nofollow">arXiv:2106.00085</a>.
- Hu, Y. et al. (2024). *Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?*. <a href="https://arxiv.org/abs/2405.06105" class="external text" rel="nofollow">arXiv:2405.06105</a>.
- Lazaridou, A. et al. (2021). *Mind the Gap: Assessing Temporal Generalization in Neural Language Models*. <a href="https://openreview.net/pdf?id=73OmmrCfSyy" class="external text" rel="nofollow">NeurIPS 2021</a>.

## Referencias

1.  <span id="cite_note-en_wiki-1">↑ <sup>[1.0](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-en_wiki_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-en_wiki_1-1)</sup> "Perplexity". *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Perplexity" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-comet_eval-2">↑ <sup>[2.0](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-comet_eval_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-comet_eval_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-comet_eval_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-comet_eval_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-comet_eval_2-4)</sup> Morgan, Abby. "Perplexity for LLM Evaluation". *Comet AI Blog*, 21 de noviembre de 2024. <a href="https://www.comet.com/site/blog/perplexity-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-readme_jelinek-3">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-readme_jelinek_3-0) "README.md · evaluate-measurement/perplexity". *Hugging Face*. <a href="https://huggingface.co/spaces/evaluate-measurement/perplexity/blob/c4de5d6dae834c200992d54151402b80b6b46494/README.md" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-stanford_slp-4">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-stanford_slp_4-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-jurafsky_slp3-5">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-jurafsky_slp3_5-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt2_issue-6">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-gpt2_issue_6-0) "Perplexity number of wikitext-103 on gpt-2 don't match the paper". *GitHub, huggingface/transformers, Issue \#483*. <a href="https://github.com/huggingface/transformers/issues/483" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hu_long_context-7">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-hu_long_context_7-0) Hu, H., et al. "Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?". *arXiv:2405.06105* \[cs.CL\], 10 de mayo de 2024. <a href="https://ar5iv.labs.arxiv.org/html/2405.06105" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-wang_unreliable-8">[↑](https://systems-analysis.info/int/Perplejidad_(m%C3%A9trica)#cite_ref-wang_unreliable_8-0) Wang, C., et al. "Perplexity by PLM Is Unreliable for Evaluating Text Quality". *arXiv:2210.05892* \[cs.CL\], 12 de octubre de 2022. <a href="https://ar5iv.labs.arxiv.org/html/2210.05892" class="external autonumber" rel="nofollow">[8]</a></span>
