---
title: "Perplexity (metric) (CS)"
source: "https://systems-analysis.info/int/Perplexity_(metric)_(CS)"
wiki: "systems-analysis.info/int"
article: "Perplexity_(metric)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Pages with math errors"
  - "Category:Pages with math render errors"
revision_id: 5523
wiki_created_at: 2026-09-06T23:50:30Z
wiki_modified_at: 2026-09-06T23:50:30Z
downloaded_at: 2026-09-07T23:08:54Z
---

# Perplexity (metric) (CS)

**Perplexita** (angl. *Perplexity*, PPL) v teorii informace a strojovém učení je míra neurčitosti nebo „překvapení" jazykového modelu při předpovídání vzorku textu. Nízká perplexita indikuje, že pravděpodobnostní rozdělení modelu dobře odpovídá testovacím datům, zatímco vysoká perplexita znamená, že model špatně předpovídá sekvenci<sup>[\[1\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-ru_wiki-1)</sup>.

Formálně je perplexita pravděpodobnostního rozdělení definována jako exponenciála jeho entropie. Pro diskrétní rozdělení $p(x)$ se rovná $2^{H(p)}$, kde $H(p)$ je entropie<sup>[\[2\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-en_wiki-2)</sup>. Intuitivně lze perplexitu chápat jako „efektivní" počet variant, z nichž model vybírá v každém kroku. Pokud je perplexita rovna 100, znamená to, že neurčitost modelu je ekvivalentní výběru jednoho ze 100 stejně pravděpodobných výsledků<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-comet_eval-3)</sup>.

Termín byl poprvé zaveden v roce 1977 skupinou výzkumníků IBM vedenou Frederickem Jelinkem v kontextu statistického rozpoznávání řeči za účelem kvantitativního hodnocení „obtížnosti" úlohy<sup>[\[4\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-readme_jelinek-4)</sup>.

## Perplexita v jazykových modelech

V oblasti zpracování přirozeného jazyka (NLP) se perplexita stala standardní interní (*intrinsic*) metrikou pro hodnocení kvality jazykových modelů. Měří, jak dobře model předpovídá sekvenci slov nebo tokenů v testovací datové sadě.

### Formální definice

Pro testovací korpus $W = w_{1}w_{2}\ldots w_{N}$ a jazykový model $q$ se perplexita vypočítává jako převrácená průměrná geometrická pravděpodobnost testovacího korpusu, normalizovaná podle počtu slov: $ext{PP}(W,q) = \left( \prod\limits_{i = 1}^{N}\frac{1}{q(w_{i} \mid w_{1},\ldots,w_{i - 1})} \right)^{1/N}$

Tento vzorec je ekvivalentní exponenciále křížové entropie neboli průměrných logaritmických ztrát (*negative log-likelihood*): **Failed to parse (syntax error): {\displaystyle ext{PP}(W, q) = \exp\left(-\frac{1}{N}\sum\_{i=1}^{N} \log q(w_i \mid ext{контекст})\right) }**

**Minimalizace perplexity** je ekvivalentní **maximalizaci věrohodnosti** modelu na testovacích datech. Model s nižší perplexitou je tedy považován za statisticky přesnější<sup>[\[5\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-stanford_slp-5)</sup>.

### Historické použití a moderní LLM

Historicky byla perplexita hojně využívána pro hodnocení statistických n-gramových modelů. Například pro korpus *Wall Street Journal* má unigramový model (zohledňující pouze frekvence slov) perplexitu ~962, zatímco trigramový (zohledňující kontext dvou předchozích slov) přibližně 109<sup>[\[6\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-jurafsky_slp3-6)</sup>. Tento výrazný pokles ukazuje, o kolik lépe model zachycuje jazykové zákonitosti.

S rozvojem velkých jazykových modelů (LLM) si perplexita zachovala svou roli základního referenčního ukazatele. Výzkumníci uvádějí perplexitu na standardních testovacích sadách (například WikiText) jako indikátor „plynulosti" modelu. Například v článku OpenAI o GPT-2 je uvedeno, že model s ~117 mil. parametry dosahuje perplexity přibližně 37 na korpusu WikiText-103<sup>[\[7\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-gpt2_issue-7)</sup>. Snížení perplexity obvykle koreluje se zlepšením kvality modelu, takže metrika slouží jako praktický indikátor pokroku při trénování a optimalizaci.

## Omezení a interpretace metriky

Ačkoli nízká perplexita svědčí o vysoké věrohodnosti dat podle modelu, tento ukazatel má řadu podstatných omezení a ne vždy koreluje se skutečnou kvalitou generovaného textu.

- **Nízká perplexita ≠ vysoká kvalita**. Perplexita měří *jistotu* modelu v jeho předpovědích, nikoli jejich *správnost*. Model může být sebejistě v omylu a generovat nesmyslný, avšak statisticky pravděpodobný text (například opakováním velmi častých slov a frází)<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-comet_eval-3)</sup>.
- **Citlivost na data a tokenizaci**. Perplexita **se špatně hodí pro přímé srovnání modelů** s různou architekturou, slovníkem nebo způsobem tokenizace. Například znakový model může mít numericky nižší perplexitu než slovní, ale to neznamená, že lépe řeší jazykové úlohy<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-comet_eval-3)</sup>.
- **Neschopnost hodnotit sémantiku a dlouhý kontext**. Perplexita je lokální metrika hodnotící předpověď dalšího tokenu. Slabě koreluje se schopností modelu zachycovat dlouhodobé závislosti a sémantický kontext na velkých vzdálenostech. Studie z roku 2023 (Hu et al.) ukázala, že schopnost LLM rozumět dlouhým textům (až 100 tis. tokenů) se v metrice perplexity prakticky neodráží<sup>[\[8\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-hu_long_context-8)</sup>.
- **Možnost manipulace**. Metriku lze „oklamat". Přetrénovaný model vykáže uměle nízkou perplexitu na datech, která si „zapamatoval". Výzkumy (Wang et al., 2022) také ukázaly, že duplikace fragmentů textu nebo dokonce absence tečky na konci věty může bezdůvodně snížit či zvýšit perplexitu, aniž by to ovlivnilo skutečnou kvalitu textu<sup>[\[9\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-wang_unreliable-9)</sup>.

## Závěr: role perplexity dnes

S ohledem na uvedená omezení je perplexita v současné praxi považována za **pomocný, předběžný ukazatel** kvality jazykového modelu. Zůstává cenným nástrojem pro rychlé hodnocení a ladění modelů, protože nezávisí na konkrétní aplikační úloze a je snadno vypočitatelná<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-comet_eval-3)</sup>.

Pro komplexní hodnocení LLM však perplexita sama o sobě nestačí. Dnes je povinně doplňována externími (*extrinsic*) metrikami vázanými na konkrétní úlohy, jako jsou:

- Přesnost odpovědí na otázky;
- Hodnocení lidmi (*human evaluation*);
- BLEU/ROUGE pro strojový překlad a sumarizaci.

Ve spojení s těmito metodami perplexita nadále plní důležitou roli — slouží jako objektivní míra „překvapení" modelu, avšak její výsledky jsou vždy interpretovány s přihlédnutím k uvedeným omezením<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_note-comet_eval-3)</sup>.

## Odkazy

- Článek „Perplexita v jazykových modelech" na Habru
- Dokumentace Hugging Face k výpočtu perplexity

## Literatura

- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). *Perplexity — a Measure of the Difficulty of Speech Recognition Tasks*. JASA:62(S1):S63.
- Jurafsky, D., & Martin, J. H. (2021). *Speech and Language Processing* (3. vyd., kap. 3: N-gram Language Models). PDF.
- Radford, A. et al. (2019). *Language Models are Unsupervised Multitask Learners*. OpenAI white paper.
- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. arXiv:2005.14165.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. arXiv:2001.08361.
- Wang, C. et al. (2022). *Perplexity by PLM Is Unreliable for Evaluating Text Quality*. arXiv:2210.05892.
- Meister, C., & Cotterell, R. (2021). *Language Model Evaluation Beyond Perplexity*. arXiv:2106.00085.
- Hu, Y. et al. (2024). *Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?*. arXiv:2405.06105.
- Lazaridou, A. et al. (2021). *Mind the Gap: Assessing Temporal Generalization in Neural Language Models*. NeurIPS 2021.

## Poznámky

1.  <span id="cite_note-ru_wiki-1">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-ru_wiki_1-0) «Перплексия». *Википедия*. <a href="https://ru.wikipedia.org/wiki/Перплексия" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-en_wiki-2">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-en_wiki_2-0) «Perplexity». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Perplexity" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-comet_eval-3">↑ <sup>[3.0](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-comet_eval_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-comet_eval_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-comet_eval_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-comet_eval_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-comet_eval_3-4)</sup> Morgan, Abby. «Perplexity for LLM Evaluation». *Comet AI Blog*, 21 Nov 2024. <a href="https://www.comet.com/site/blog/perplexity-for-llm-evaluation/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-readme_jelinek-4">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-readme_jelinek_4-0) «README.md · evaluate-measurement/perplexity». *Hugging Face*. <a href="https://huggingface.co/spaces/evaluate-measurement/perplexity/blob/c4de5d6dae834c200992d54151402b80b6b46494/README.md" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-stanford_slp-5">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-stanford_slp_5-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-jurafsky_slp3-6">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-jurafsky_slp3_6-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-gpt2_issue-7">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-gpt2_issue_7-0) «Perplexity number of wikitext-103 on gpt-2 don't match the paper». *GitHub, huggingface/transformers, Issue \#483*. <a href="https://github.com/huggingface/transformers/issues/483" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hu_long_context-8">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-hu_long_context_8-0) Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». *arXiv:2405.06105* \[cs.CL\], 10 мая 2024 г. <a href="https://ar5iv.labs.arxiv.org/html/2405.06105" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-wang_unreliable-9">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(CS)#cite_ref-wang_unreliable_9-0) Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». *arXiv:2210.05892* \[cs.CL\], 12 окт. 2022 г. <a href="https://ar5iv.labs.arxiv.org/html/2210.05892" class="external autonumber" rel="nofollow">[9]</a></span>
