BLEU (Bilingual Evaluation Understudy) (CS)
BLEU (z angl. Bilingual Evaluation Understudy — „dvoujazyčný zástupný hodnotitel") — je algoritmus pro automatické hodnocení kvality textu přeloženého strojem. Hodnocení se provádí porovnáním překladu-kandidáta s jedním nebo více vzorovými (referenčními) lidskými překlady[1]. Kvalita je určena mírou lexikální podobnosti strojového překladu s profesionálním. Jak poznamenali autoři: „čím bližší je strojový překlad překladu profesionálního člověka, tím je lepší"[2].
Metoda byla navržena v roce 2002 skupinou výzkumníků z IBM pod vedením Kishora Papineniho a stala se jednou z prvních metrik vykazujících vysokou korelaci s hodnoceními odborníků-překladatelů. BLEU rychle získal popularitu díky jednoduchosti výpočtu, jazykové nezávislosti a dobré shodě s lidským hodnocením na úrovni korpusu textů[1].
Metodika výpočtu BLEU
BLEU hodnotí překlad prostřednictvím počítání shod n-gramů (posloupností n slov) mezi překladem-kandidátem a referenčními překlady.
1. Modifikovaná přesnost n-gramů
Nejprve se pro n-gramy různé délky (obvykle od 1 do 4) vypočítá jejich přesnost () — podíl n-gramů z překladu-kandidáta, které se vyskytují v referenčních překladech[3]. Přitom počet shod pro každý n-gram je omezen maximálním počtem jeho výskytů v kterémkoli z referenčních textů, aby se předešlo nadhodnocování skóre za opakování téhož slova.
2. Agregace a geometrický průměr
Aby bylo dosaženo jednotného hodnocení, přesnosti pro 1-, 2-, 3- a 4-gramy se agregují pomocí geometrického průměru. Děje se tak proto, aby nízká přesnost pro jeden typ n-gramů (například 4-gramů) výrazně ovlivnila výsledné skóre a odrážela špatnou kvalitu dlouhých frází.
3. Penalizace za stručnost (Brevity Penalty)
Aby se zabránilo získávání nadhodnocených skóre díky příliš krátkým, ale přesným překladům, zavádí BLEU penalizaci za stručnost (Brevity Penalty, BP). Pokud je délka překladu-kandidáta (c) podstatně menší než délka referenčního překladu (r), výsledné skóre BLEU se snižuje. Penalizace se vypočítává podle vzorce:
4. Výsledný vzorec BLEU
Konečné skóre BLEU se vypočítává jako součin penalizace za stručnost a geometrického průměru přesností n-gramů[4]: kde N je maximální délka n-gramů (obvykle 4) a jsou váhy (obvykle ).
Hodnota BLEU se pohybuje v rozsahu od 0 do 1 (často se násobí 100 a vyjadřuje v procentech). Čím blíže je výsledek k 1 (100 %), tím více se překlad považuje za „bližší lidskému".
Využití a význam
Od svého zveřejnění se metrika BLEU stala de facto standardem pro hodnocení systémů strojového překladu (MT). Umožnila překonat „úzké místo" ve vývoji MT systémů — zdlouhavost a nákladnost ručního hodnocení. Vývojáři získali možnost rychle měřit efekt změn v modelech a operativně vyřazovat nevydařená řešení[2].
BLEU dobře koreluje s lidskými hodnoceními na úrovni celého korpusu textů, ale je nespolehlivý pro hodnocení jednotlivých vět[3]. Proto byla metrika široce využívána ve standardizovaných soutěžích v oblasti MT (například NIST a WMT) pro porovnávání systémů.
Omezení a kritika
Navzdory širokému rozšíření má BLEU řadu podstatných omezení:
- Absence sémantického hodnocení: BLEU měří pouze povrchní shodu slov a není schopen posoudit, zda je smysl zdrojového textu správně vyjádřen. Překlad může získat vysoké skóre, ale být gramaticky nesprávný nebo zkreslovat význam[5].
- Ignorování synonym a parafrází: Algoritmus penalizuje překlady využívající synonyma nebo jiné formulace, než jsou v referenci, i když jsou zcela správné. Použití více referencí tento problém zmírňuje, ale zcela neřeší.
- Citlivost na tokenizaci: Výsledky BLEU jsou silně závislé na způsobu rozdělení textu na tokeny. Různé implementace tokenizátorů mohou vést k různým hodnotám, čímž se porovnávání modelů stává nesprávným. Pro řešení tohoto problému byl navržen standard SacreBLEU, který sjednocuje výpočet metriky[1].
- Obtížnost aplikace na některé jazyky: BLEU špatně funguje s jazyky, které nemají jednoznačné oddělovače slov (například čínština nebo japonština), bez předchozí segmentace.
Alternativy a moderní přístupy
Postupem času byly za účelem překonání nedostatků BLEU navrženy nové automatické metriky:
- METEOR: Zohledňuje shody synonym, stemming a pořadí slov.
- ROUGE: Používá se pro hodnocení sumarizace textů, přičemž se zaměřuje na úplnost (recall), nikoli na přesnost.
- Naučitelné metriky (Learned Metrics): Moderní přístupy využívající modely Machine Learning k zohlednění sémantické blízkosti. Metriky jako BLEURT a COMET vykazují výrazně vyšší korelaci s lidskými hodnoceními než klasický BLEU[6].
V průběhu 20. let 21. století BLEU ztratil status bezpodmínečného standardu a ustoupil přesnějším metodám[7]. Přesto zůstává důležitým milníkem v historii hodnocení MT a nadále se používá jako výchozí referenční bod při měření pokroku.
Odkazy
- Co je skóre BLEU? — Dokumentace Microsoft Azure
Poznámky
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]