---
title: "Perplexidade"
source: "https://systems-analysis.info/int/Perplexidade"
wiki: "systems-analysis.info/int"
article: "Perplexidade"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 5520
wiki_created_at: 2026-09-06T23:50:28Z
wiki_modified_at: 2026-09-06T23:50:28Z
downloaded_at: 2026-09-07T23:08:53Z
---

# Perplexidade

**Perplexidade** (do inglês *Perplexity*, PPL), na teoria da informação e no aprendizado de máquina, é uma medida da incerteza ou "surpresa" de um modelo de linguagem ao prever uma amostra de texto. Uma baixa perplexidade indica que a distribuição de probabilidade do modelo se ajusta bem aos dados de teste, enquanto uma alta perplexidade significa que o modelo prevê mal a sequência<sup>[\[1\]](https://systems-analysis.info/int/Perplexidade#cite_note-ru_wiki-1)</sup>.

Formalmente, a perplexidade de uma distribuição de probabilidade é definida como a exponencial de sua entropia. Para uma distribuição discreta $p(x)$, ela é igual a $2^{H(p)}$, onde $H(p)$ é a entropia<sup>[\[2\]](https://systems-analysis.info/int/Perplexidade#cite_note-en_wiki-2)</sup>. Intuitivamente, a perplexidade pode ser entendida como o número "efetivo" de opções que o modelo tem a cada passo. Se a perplexidade for 100, isso significa que a incerteza do modelo é equivalente a escolher um de 100 resultados equiprováveis<sup>[\[3\]](https://systems-analysis.info/int/Perplexidade#cite_note-comet_eval-3)</sup>.

O termo foi introduzido pela primeira vez em 1977 por um grupo de pesquisadores da IBM liderado por Frederick Jelinek, no contexto do reconhecimento estatístico de fala, para quantificar a "dificuldade" de uma tarefa<sup>[\[4\]](https://systems-analysis.info/int/Perplexidade#cite_note-readme_jelinek-4)</sup>.

## Perplexidade em Modelos de Linguagem

No campo do processamento de linguagem natural (PLN), a perplexidade se tornou uma métrica intrínseca (*intrinsic*) padrão para a avaliação da qualidade de modelos de linguagem. Ela mede quão bem um modelo prevê uma sequência de palavras ou tokens em um conjunto de dados de teste.

### Definição Formal

Para um corpus de teste $W = w_{1}w_{2}\ldots w_{N}$ e um modelo de linguagem $q$, a perplexidade é calculada como a média geométrica inversa da probabilidade do corpus de teste, normalizada pelo número de palavras: $\text{PP}(W,q) = \left( \prod\limits_{i = 1}^{N}\frac{1}{q(w_{i} \mid w_{1},\ldots,w_{i - 1})} \right)^{1/N}$

Esta fórmula é equivalente à exponencial da entropia cruzada, ou da perda logarítmica negativa média (*negative log-likelihood*): $\text{PP}(W,q) = \exp\left( - \frac{1}{N}\sum\limits_{i = 1}^{N}\log q(w_{i} \mid \text{contexto}) \right)$

**A minimização da perplexidade** é equivalente à **maximização da verossimilhança** (*likelihood*) do modelo nos dados de teste. Portanto, um modelo com menor perplexidade é considerado estatisticamente mais preciso<sup>[\[5\]](https://systems-analysis.info/int/Perplexidade#cite_note-stanford_slp-5)</sup>.

### Aplicação Histórica e LLMs Modernos

Historicamente, a perplexidade foi amplamente utilizada para avaliar modelos estatísticos de n-gramas. Por exemplo, para o corpus do *Wall Street Journal*, um modelo de unigrama (que considera apenas as frequências das palavras) tem uma perplexidade de ~962, enquanto um modelo de trigrama (que considera o contexto das duas palavras anteriores) tem cerca de 109<sup>[\[6\]](https://systems-analysis.info/int/Perplexidade#cite_note-jurafsky_slp3-6)</sup>. Essa redução drástica mostra o quão melhor o modelo captura os padrões da linguagem.

Com o desenvolvimento dos grandes modelos de linguagem (LLMs), a perplexidade manteve seu papel como um ponto de referência básico. Pesquisadores relatam a perplexidade em conjuntos de teste padrão (por exemplo, WikiText) como um indicador da "fluidez" do modelo. Por exemplo, no artigo da OpenAI sobre o GPT-2, é afirmado que o modelo com ~117 milhões de parâmetros atinge uma perplexidade de cerca de 37 no corpus WikiText-103<sup>[\[7\]](https://systems-analysis.info/int/Perplexidade#cite_note-gpt2_issue-7)</sup>. A redução da perplexidade geralmente se correlaciona com a melhoria da qualidade do modelo, tornando a métrica um indicador conveniente de progresso durante o treinamento e a otimização.

## Limitações e Interpretação da Métrica

Embora uma baixa perplexidade indique uma alta verossimilhança dos dados segundo o modelo, essa métrica possui várias limitações significativas e nem sempre se correlaciona com a qualidade real do texto gerado.

- **Baixa perplexidade ≠ alta qualidade**. A perplexidade mede a *confiança* do modelo em suas previsões, mas não sua *veracidade*. Um modelo pode estar confiantemente errado, gerando texto sem sentido, mas estatisticamente provável (por exemplo, repetindo palavras e frases muito comuns)<sup>[\[3\]](https://systems-analysis.info/int/Perplexidade#cite_note-comet_eval-3)</sup>.
- **Sensibilidade aos dados e à tokenização**. A perplexidade **não é adequada para comparar diretamente modelos** com diferentes arquiteturas, vocabulários ou métodos de tokenização. Por exemplo, um modelo baseado em caracteres pode ter uma perplexidade numericamente menor que um modelo baseado em palavras, mas isso não significa que ele resolva melhor as tarefas de linguagem<sup>[\[3\]](https://systems-analysis.info/int/Perplexidade#cite_note-comet_eval-3)</sup>.
- **Incapacidade de avaliar a semântica e o contexto longo**. A perplexidade é uma métrica local que avalia a previsão do próximo token. Ela se correlaciona fracamente com a capacidade do modelo de capturar dependências de longo prazo e o contexto semântico em grandes distâncias. Um estudo de 2024 (Hu et al.) mostrou que a capacidade de um LLM de compreender textos longos (até 100 mil tokens) praticamente não se reflete na métrica de perplexidade<sup>[\[8\]](https://systems-analysis.info/int/Perplexidade#cite_note-hu_long_context-8)</sup>.
- **Possibilidade de manipulação**. A métrica pode ser "enganada". Um modelo sobreajustado (*overfitted*) apresentará uma perplexidade artificialmente baixa em dados que ele "memorizou". Pesquisas (Wang et al., 2022) também mostraram que a duplicação de trechos de texto ou mesmo a ausência de um ponto final na frase pode diminuir ou aumentar a perplexidade injustificadamente, sem afetar a qualidade real do texto<sup>[\[9\]](https://systems-analysis.info/int/Perplexidade#cite_note-wang_unreliable-9)</sup>.

## Conclusão: O Papel da Perplexidade Hoje

Considerando as limitações mencionadas, na prática moderna, a perplexidade é vista como um **indicador auxiliar e preliminar** da qualidade de um modelo de linguagem. Ela continua sendo uma ferramenta valiosa para avaliação rápida e depuração de modelos, pois não depende de uma tarefa de aplicação específica e é simples de calcular<sup>[\[3\]](https://systems-analysis.info/int/Perplexidade#cite_note-comet_eval-3)</sup>.

No entanto, para uma avaliação completa de LLMs, a perplexidade por si só não é suficiente. Atualmente, ela é necessariamente complementada por métricas extrínsecas (*extrinsic*), vinculadas a tarefas específicas, como:

- Precisão em respostas a perguntas;
- Avaliações humanas (*human evaluation*);
- BLEU/ROUGE para tradução automática e sumarização.

Em conjunto com esses métodos, a perplexidade continua a desempenhar um papel importante — servir como uma medida objetiva da "surpresa" do modelo —, mas seus resultados devem ser sempre interpretados levando em conta as limitações mencionadas<sup>[\[3\]](https://systems-analysis.info/int/Perplexidade#cite_note-comet_eval-3)</sup>.

## Ligações externas

- <a href="https://habr.com/ru/companies/wunderfund/articles/580230/" class="external text" rel="nofollow">Artigo "Perplexidade em Modelos de Linguagem" no Habr (em russo)</a>
- <a href="https://huggingface.co/docs/transformers/perplexity" class="external text" rel="nofollow">Documentação do Hugging Face sobre o cálculo da perplexidade</a>

## Leitura adicional

- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). *Perplexity — a Measure of the Difficulty of Speech Recognition Tasks*. <a href="https://pubs.aip.org/asa/jasa/article/62/S1/S63/642598" class="external text" rel="nofollow">JASA:62(S1):S63</a>.
- Jurafsky, D., & Martin, J. H. (2021). *Speech and Language Processing* (3ª ed., cap. 3: N-gram Language Models). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external text" rel="nofollow">PDF</a>.
- Radford, A. et al. (2019). *Language Models are Unsupervised Multitask Learners*. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external text" rel="nofollow">OpenAI white paper</a>.
- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Wang, C. et al. (2022). *Perplexity by PLM Is Unreliable for Evaluating Text Quality*. <a href="https://arxiv.org/abs/2210.05892" class="external text" rel="nofollow">arXiv:2210.05892</a>.
- Meister, C., & Cotterell, R. (2021). *Language Model Evaluation Beyond Perplexity*. <a href="https://arxiv.org/abs/2106.00085" class="external text" rel="nofollow">arXiv:2106.00085</a>.
- Hu, Y. et al. (2024). *Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?*. <a href="https://arxiv.org/abs/2405.06105" class="external text" rel="nofollow">arXiv:2405.06105</a>.
- Lazaridou, A. et al. (2021). *Mind the Gap: Assessing Temporal Generalization in Neural Language Models*. <a href="https://openreview.net/pdf?id=73OmmrCfSyy" class="external text" rel="nofollow">NeurIPS 2021</a>.

## Notas

1.  <span id="cite_note-ru_wiki-1">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-ru_wiki_1-0) "Perplexidade (teoria da informação)". *Wikipédia, a enciclopédia livre*. <a href="https://pt.wikipedia.org/wiki/Perplexidade_(teoria_da_informa%C3%A7%C3%A3o)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-en_wiki-2">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-en_wiki_2-0) "Perplexity". *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Perplexity" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-comet_eval-3">↑ <sup>[3.0](https://systems-analysis.info/int/Perplexidade#cite_ref-comet_eval_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Perplexidade#cite_ref-comet_eval_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Perplexidade#cite_ref-comet_eval_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Perplexidade#cite_ref-comet_eval_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Perplexidade#cite_ref-comet_eval_3-4)</sup> Morgan, Abby. "Perplexity for LLM Evaluation". *Comet AI Blog*, 21 Nov 2024. <a href="https://www.comet.com/site/blog/perplexity-for-llm-evaluation/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-readme_jelinek-4">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-readme_jelinek_4-0) "README.md · evaluate-measurement/perplexity". *Hugging Face*. <a href="https://huggingface.co/spaces/evaluate-measurement/perplexity/blob/c4de5d6dae834c200992d54151402b80b6b46494/README.md" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-stanford_slp-5">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-stanford_slp_5-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-jurafsky_slp3-6">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-jurafsky_slp3_6-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-gpt2_issue-7">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-gpt2_issue_7-0) "Perplexity number of wikitext-103 on gpt-2 don't match the paper". *GitHub, huggingface/transformers, Issue \#483*. <a href="https://github.com/huggingface/transformers/issues/483" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hu_long_context-8">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-hu_long_context_8-0) Hu, H., et al. "Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?". *arXiv:2405.06105* \[cs.CL\], 10 de maio de 2024. <a href="https://ar5iv.labs.arxiv.org/html/2405.06105" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-wang_unreliable-9">[↑](https://systems-analysis.info/int/Perplexidade#cite_ref-wang_unreliable_9-0) Wang, C., et al. "Perplexity by PLM Is Unreliable for Evaluating Text Quality". *arXiv:2210.05892* \[cs.CL\], 12 de out. de 2022. <a href="https://ar5iv.labs.arxiv.org/html/2210.05892" class="external autonumber" rel="nofollow">[9]</a></span>
