---
title: "Perplexität"
source: "https://systems-analysis.info/int/Perplexit%C3%A4t"
wiki: "systems-analysis.info/int"
article: "Perplexität"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 5570
wiki_created_at: 2026-09-06T23:51:09Z
wiki_modified_at: 2026-09-06T23:51:09Z
downloaded_at: 2026-09-07T23:09:13Z
---

# Perplexität

**Perplexität** (englisch *Perplexity*, PPL) ist in der Informationstheorie und im maschinellen Lernen ein Maß für die Unsicherheit oder die „Überraschung“ eines Sprachmodells bei der Vorhersage einer Textprobe. Eine niedrige Perplexität deutet darauf hin, dass die Wahrscheinlichkeitsverteilung des Modells gut zu den Testdaten passt, während eine hohe Perplexität bedeutet, dass das Modell die Sequenz schlecht vorhersagt<sup>[\[1\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-ru_wiki-1)</sup>.

Formal ist die Perplexität einer Wahrscheinlichkeitsverteilung als der Exponent ihrer Entropie definiert. Für eine diskrete Verteilung $p(x)$ ist sie gleich $2^{H(p)}$, wobei $H(p)$ die Entropie ist<sup>[\[2\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-en_wiki-2)</sup>. Intuitiv lässt sich die Perplexität als die „effektive“ Anzahl der Optionen verstehen, aus denen das Modell bei jedem Schritt wählt. Wenn die Perplexität 100 beträgt, bedeutet dies, dass die Unsicherheit des Modells der Auswahl aus 100 gleich wahrscheinlichen Ergebnissen entspricht<sup>[\[3\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-comet_eval-3)</sup>.

Der Begriff wurde erstmals 1977 von einer Gruppe von IBM-Forschern unter der Leitung von Frederick Jelinek im Kontext der statistischen Spracherkennung eingeführt, um den „Schwierigkeitsgrad“ einer Aufgabe quantitativ zu bewerten<sup>[\[4\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-readme_jelinek-4)</sup>.

## Perplexität bei Sprachmodellen

Im Bereich der Verarbeitung natürlicher Sprache (NLP) hat sich die Perplexität als standardmäßige intrinsische (*intrinsic*) Metrik zur Bewertung der Qualität von Sprachmodellen etabliert. Sie misst, wie gut ein Modell eine Sequenz von Wörtern oder Tokenn in einem Testdatensatz vorhersagt.

### Formale Definition

Für einen Testkorpus $W = w_{1}w_{2}\ldots w_{N}$ und ein Sprachmodell $q$ wird die Perplexität als die inverse geometrische mittlere Wahrscheinlichkeit des Testkorpus berechnet, normalisiert durch die Anzahl der Wörter: $\text{PP}(W,q) = \left( \prod\limits_{i = 1}^{N}\frac{1}{q(w_{i} \mid w_{1},\ldots,w_{i - 1})} \right)^{1/N}$

Diese Formel ist äquivalent zum Exponenten der Kreuzentropie oder des mittleren negativen Log-Likelihood-Verlusts (*negative log-likelihood*): $\text{PP}(W,q) = \exp\left( - \frac{1}{N}\sum\limits_{i = 1}^{N}\log q(w_{i} \mid \text{Kontext}) \right)$

Die **Minimierung der Perplexität** ist äquivalent zur **Maximierung der Likelihood** (Plausibilität) des Modells auf den Testdaten. Ein Modell mit geringerer Perplexität wird daher als statistisch genauer angesehen<sup>[\[5\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-stanford_slp-5)</sup>.

### Historische Anwendung und moderne LLMs

Historisch wurde die Perplexität weithin zur Bewertung statistischer n-Gramm-Modelle verwendet. Beispielsweise hat für den *Wall Street Journal*-Korpus ein Unigramm-Modell (das nur die Worthäufigkeiten berücksichtigt) eine Perplexität von ~962, während ein Trigramm-Modell (das den Kontext der beiden vorhergehenden Wörter berücksichtigt) einen Wert von etwa 109 aufweist<sup>[\[6\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-jurafsky_slp3-6)</sup>. Dieser drastische Rückgang zeigt, wie viel besser das Modell sprachliche Muster erfasst.

Mit der Entwicklung [großer Sprachmodelle (LLMs)](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") hat die Perplexität ihre Rolle als grundlegende Benchmark-Metrik beibehalten. Forscher geben die Perplexität auf Standard-Testdatensätzen (z. B. WikiText) als Indikator für die „Flüssigkeit“ (*fluency*) eines Modells an. So wird im OpenAI-Paper zu GPT-2 berichtet, dass das Modell mit ~117 Millionen Parametern eine Perplexität von etwa 37 auf dem WikiText-103-Korpus erreicht<sup>[\[7\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-gpt2_issue-7)</sup>. Eine Verringerung der Perplexität korreliert in der Regel mit einer Verbesserung der Modellqualität, weshalb die Metrik als nützlicher Indikator für den Fortschritt während des Trainings und der Optimierung dient.

## Grenzen und Interpretation der Metrik

Obwohl eine niedrige Perplexität auf eine hohe Wahrscheinlichkeit der Daten gemäß dem Modell hindeutet, hat dieser Indikator eine Reihe wesentlicher Einschränkungen und korreliert nicht immer mit der tatsächlichen Qualität des generierten Textes.

- **Niedrige Perplexität ≠ hohe Qualität**. Die Perplexität misst die *Sicherheit* (*confidence*) des Modells in seinen Vorhersagen, nicht aber deren *Korrektheit*. Ein Modell kann selbstbewusst falsch liegen und unsinnigen, aber statistisch wahrscheinlichen Text generieren (z. B. durch Wiederholung sehr häufiger Wörter und Phrasen)<sup>[\[3\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-comet_eval-3)</sup>.
- **Sensitivität gegenüber Daten und Tokenisierung**. Die Perplexität ist **für den direkten Vergleich von Modellen** mit unterschiedlichen Architekturen, Vokabularen oder Tokenisierungsmethoden **schlecht geeignet**. Beispielsweise kann ein zeichenbasiertes Modell numerisch eine niedrigere Perplexität aufweisen als ein wortbasiertes Modell, was jedoch nicht bedeutet, dass es sprachliche Aufgaben besser löst<sup>[\[3\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-comet_eval-3)</sup>.
- **Unfähigkeit zur Bewertung von Semantik und langem Kontext**. Die Perplexität ist eine lokale Metrik, die die Vorhersage des nächsten Tokens bewertet. Sie korreliert nur schwach mit der Fähigkeit des Modells, langfristige Abhängigkeiten und semantischen Kontext über große Distanzen zu erfassen. Eine Studie aus dem Jahr 2024 (Hu et al.) zeigte, dass die Fähigkeit von LLMs, lange Texte (bis zu 100.000 Token) zu verstehen, sich kaum in der Perplexitätsmetrik widerspiegelt<sup>[\[8\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-hu_long_context-8)</sup>.
- **Manipulationsanfälligkeit**. Die Metrik kann „ausgetrickst“ werden. Ein überangepasstes (overfitted) Modell zeigt eine künstlich niedrige Perplexität auf Daten, die es „auswendig gelernt“ hat. Studien (Wang et al., 2022) haben zudem gezeigt, dass die Duplizierung von Textfragmenten oder sogar das Fehlen eines Punktes am Satzende die Perplexität ungerechtfertigt senken oder erhöhen kann, ohne die tatsächliche Textqualität zu beeinflussen<sup>[\[9\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-wang_unreliable-9)</sup>.

## Fazit: Die Rolle der Perplexität heute

Unter Berücksichtigung der genannten Einschränkungen wird die Perplexität in der modernen Praxis als **unterstützender, vorläufiger Indikator** für die Qualität eines Sprachmodells betrachtet. Sie bleibt ein wertvolles Werkzeug für die schnelle Bewertung und das Debugging von Modellen, da sie nicht von einer bestimmten Anwendungsaufgabe abhängt und einfach zu berechnen ist<sup>[\[3\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-comet_eval-3)</sup>.

Für eine umfassende Bewertung von LLMs reicht die Perplexität allein jedoch nicht aus. Heutzutage wird sie zwingend durch externe (*extrinsic*) Metriken ergänzt, die an spezifische Aufgaben gebunden sind, wie zum Beispiel:

- Genauigkeit bei der Beantwortung von Fragen;
- Menschliche Bewertungen (*human evaluation*);
- BLEU/ROUGE für maschinelle Übersetzung und Textzusammenfassung.

In Kombination mit diesen Methoden spielt die Perplexität weiterhin eine wichtige Rolle als objektives Maß für die „Überraschung“ des Modells, ihre Ergebnisse müssen jedoch stets unter Berücksichtigung der genannten Einschränkungen interpretiert werden<sup>[\[3\]](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_note-comet_eval-3)</sup>.

## Weblinks

- <a href="https://habr.com/ru/companies/wunderfund/articles/580230/" class="external text" rel="nofollow">Artikel „Perplexität in Sprachmodellen“ auf Habr</a> (Russisch)
- <a href="https://huggingface.co/docs/transformers/perplexity" class="external text" rel="nofollow">Hugging Face-Dokumentation zur Berechnung der Perplexität</a> (Englisch)

## Literatur

- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). *Perplexity — a Measure of the Difficulty of Speech Recognition Tasks*. <a href="https://pubs.aip.org/asa/jasa/article/62/S1/S63/642598" class="external text" rel="nofollow">JASA:62(S1):S63</a>.
- Jurafsky, D., & Martin, J. H. (2021). *Speech and Language Processing* (3. Aufl., Kap. 3: N-gram Language Models). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external text" rel="nofollow">PDF</a>.
- Radford, A. et al. (2019). *Language Models are Unsupervised Multitask Learners*. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external text" rel="nofollow">OpenAI white paper</a>.
- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Wang, C. et al. (2022). *Perplexity by PLM Is Unreliable for Evaluating Text Quality*. <a href="https://arxiv.org/abs/2210.05892" class="external text" rel="nofollow">arXiv:2210.05892</a>.
- Meister, C., & Cotterell, R. (2021). *Language Model Evaluation Beyond Perplexity*. <a href="https://arxiv.org/abs/2106.00085" class="external text" rel="nofollow">arXiv:2106.00085</a>.
- Hu, Y. et al. (2024). *Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?*. <a href="https://arxiv.org/abs/2405.06105" class="external text" rel="nofollow">arXiv:2405.06105</a>.
- Lazaridou, A. et al. (2021). *Mind the Gap: Assessing Temporal Generalization in Neural Language Models*. <a href="https://openreview.net/pdf?id=73OmmrCfSyy" class="external text" rel="nofollow">NeurIPS 2021</a>.

## Einzelnachweise

1.  <span id="cite_note-ru_wiki-1">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-ru_wiki_1-0) „Perplexität“. *Wikipedia*. <a href="https://de.wikipedia.org/wiki/Perplexität" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-en_wiki-2">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-en_wiki_2-0) „Perplexity“. *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Perplexity" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-comet_eval-3">↑ <sup>[3.0](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-comet_eval_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-comet_eval_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-comet_eval_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-comet_eval_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-comet_eval_3-4)</sup> Morgan, Abby. „Perplexity for LLM Evaluation“. *Comet AI Blog*, 21. Nov. 2024. <a href="https://www.comet.com/site/blog/perplexity-for-llm-evaluation/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-readme_jelinek-4">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-readme_jelinek_4-0) „README.md · evaluate-measurement/perplexity“. *Hugging Face*. <a href="https://huggingface.co/spaces/evaluate-measurement/perplexity/blob/c4de5d6dae834c200992d54151402b80b6b46494/README.md" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-stanford_slp-5">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-stanford_slp_5-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-jurafsky_slp3-6">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-jurafsky_slp3_6-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-gpt2_issue-7">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-gpt2_issue_7-0) „Perplexity number of wikitext-103 on gpt-2 don't match the paper“. *GitHub, huggingface/transformers, Issue \#483*. <a href="https://github.com/huggingface/transformers/issues/483" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hu_long_context-8">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-hu_long_context_8-0) Hu, H., et al. „Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?“. *arXiv:2405.06105* \[cs.CL\], 10. Mai 2024. <a href="https://ar5iv.labs.arxiv.org/html/2405.06105" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-wang_unreliable-9">[↑](https://systems-analysis.info/int/Perplexit%C3%A4t#cite_ref-wang_unreliable_9-0) Wang, C., et al. „Perplexity by PLM Is Unreliable for Evaluating Text Quality“. *arXiv:2210.05892* \[cs.CL\], 12. Okt. 2022. <a href="https://ar5iv.labs.arxiv.org/html/2210.05892" class="external autonumber" rel="nofollow">[9]</a></span>
