---
title: "BLEU (Bilingual Evaluation Understudy) (CS)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 623
wiki_created_at: 2026-09-06T22:36:33Z
wiki_modified_at: 2026-09-06T22:36:33Z
downloaded_at: 2026-09-07T22:41:19Z
---

# BLEU (Bilingual Evaluation Understudy) (CS)

**BLEU** (z angl. *Bilingual Evaluation Understudy* — „dvoujazyčný zástupný hodnotitel") — je algoritmus pro automatické hodnocení kvality textu přeloženého strojem. Hodnocení se provádí porovnáním překladu-kandidáta s jedním nebo více vzorovými (referenčními) lidskými překlady<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-wiki_bleu-1)</sup>. Kvalita je určena mírou lexikální podobnosti strojového překladu s profesionálním. Jak poznamenali autoři: „čím bližší je strojový překlad překladu profesionálního člověka, tím je lepší"<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-bleu_dvi-2)</sup>.

Metoda byla navržena v roce 2002 skupinou výzkumníků z IBM pod vedením **Kishora Papineniho** a stala se jednou z prvních metrik vykazujících vysokou korelaci s hodnoceními odborníků-překladatelů. BLEU rychle získal popularitu díky jednoduchosti výpočtu, jazykové nezávislosti a dobré shodě s lidským hodnocením na úrovni korpusu textů<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-wiki_bleu-1)</sup>.

## Metodika výpočtu BLEU

BLEU hodnotí překlad prostřednictvím počítání shod n-gramů (posloupností *n* slov) mezi překladem-kandidátem a referenčními překlady.

### 1. Modifikovaná přesnost n-gramů

Nejprve se pro n-gramy různé délky (obvykle od 1 do 4) vypočítá jejich přesnost ($p_{n}$) — podíl n-gramů z překladu-kandidáta, které se vyskytují v referenčních překladech<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-mt_companion-3)</sup>. Přitom počet shod pro každý n-gram je omezen maximálním počtem jeho výskytů v kterémkoli z referenčních textů, aby se předešlo nadhodnocování skóre za opakování téhož slova.

### 2. Agregace a geometrický průměr

Aby bylo dosaženo jednotného hodnocení, přesnosti pro 1-, 2-, 3- a 4-gramy se agregují pomocí geometrického průměru. Děje se tak proto, aby nízká přesnost pro jeden typ n-gramů (například 4-gramů) výrazně ovlivnila výsledné skóre a odrážela špatnou kvalitu dlouhých frází. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Penalizace za stručnost (Brevity Penalty)

Aby se zabránilo získávání nadhodnocených skóre díky příliš krátkým, ale přesným překladům, zavádí BLEU **penalizaci za stručnost** (*Brevity Penalty*, BP). Pokud je délka překladu-kandidáta (c) podstatně menší než délka referenčního překladu (r), výsledné skóre BLEU se snižuje. Penalizace se vypočítává podle vzorce: $ext{BP} = \left\{ \begin{matrix}
1 & {ext{if}c > r} \\
e^{1 - r/c} & {ext{if}c \leq r}
\end{matrix} \right.$

### 4. Výsledný vzorec BLEU

Konečné skóre BLEU se vypočítává jako součin penalizace za stručnost a geometrického průměru přesností n-gramů<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-callison_burch-4)</sup>: $ext{BLEU} = ext{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ kde N je maximální délka n-gramů (obvykle 4) a $w_{n}$ jsou váhy (obvykle $1/N$).

Hodnota BLEU se pohybuje v rozsahu od 0 do 1 (často se násobí 100 a vyjadřuje v procentech). Čím blíže je výsledek k 1 (100 %), tím více se překlad považuje za „bližší lidskému".

## Využití a význam

Od svého zveřejnění se metrika BLEU stala de facto standardem pro hodnocení systémů strojového překladu (MT). Umožnila překonat „úzké místo" ve vývoji MT systémů — zdlouhavost a nákladnost ručního hodnocení. Vývojáři získali možnost rychle měřit efekt změn v modelech a operativně vyřazovat nevydařená řešení<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-bleu_dvi-2)</sup>.

BLEU dobře koreluje s lidskými hodnoceními na **úrovni celého korpusu** textů, ale je nespolehlivý pro hodnocení jednotlivých vět<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-mt_companion-3)</sup>. Proto byla metrika široce využívána ve standardizovaných soutěžích v oblasti MT (například NIST a WMT) pro porovnávání systémů.

## Omezení a kritika

Navzdory širokému rozšíření má BLEU řadu podstatných omezení:

- **Absence sémantického hodnocení**: BLEU měří pouze povrchní shodu slov a není schopen posoudit, zda je **smysl** zdrojového textu správně vyjádřen. Překlad může získat vysoké skóre, ale být gramaticky nesprávný nebo zkreslovat význam<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-deep_hub-5)</sup>.
- **Ignorování synonym a parafrází**: Algoritmus penalizuje překlady využívající synonyma nebo jiné formulace, než jsou v referenci, i když jsou zcela správné. Použití více referencí tento problém zmírňuje, ale zcela neřeší.
- **Citlivost na tokenizaci**: Výsledky BLEU jsou silně závislé na způsobu rozdělení textu na tokeny. Různé implementace tokenizátorů mohou vést k různým hodnotám, čímž se porovnávání modelů stává nesprávným. Pro řešení tohoto problému byl navržen standard **SacreBLEU**, který sjednocuje výpočet metriky<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-wiki_bleu-1)</sup>.
- **Obtížnost aplikace na některé jazyky**: BLEU špatně funguje s jazyky, které nemají jednoznačné oddělovače slov (například čínština nebo japonština), bez předchozí segmentace.

## Alternativy a moderní přístupy

Postupem času byly za účelem překonání nedostatků BLEU navrženy nové automatické metriky:

- **METEOR**: Zohledňuje shody synonym, stemming a pořadí slov.
- **ROUGE**: Používá se pro hodnocení sumarizace textů, přičemž se zaměřuje na úplnost (recall), nikoli na přesnost.
- **Naučitelné metriky (Learned Metrics)**: Moderní přístupy využívající modely Machine Learning k zohlednění sémantické blízkosti. Metriky jako **BLEURT** a **COMET** vykazují výrazně vyšší korelaci s lidskými hodnoceními než klasický BLEU<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-bleurt-6)</sup>.

V průběhu 20. let 21. století BLEU ztratil status bezpodmínečného standardu a ustoupil přesnějším metodám<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_note-ai_mil_lexicon-7)</sup>. Přesto zůstává důležitým milníkem v historii hodnocení MT a nadále se používá jako výchozí referenční bod při měření pokroku.

## Odkazy

- Co je skóre BLEU? — Dokumentace Microsoft Azure

## Poznámky

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(CS)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
