---
title: "BLEU (Bilingual Evaluation Understudy) (HU)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 631
wiki_created_at: 2026-09-06T22:36:39Z
wiki_modified_at: 2026-09-06T22:36:39Z
downloaded_at: 2026-09-07T22:41:22Z
---

# BLEU (Bilingual Evaluation Understudy) (HU)

**BLEU** (az angol *Bilingual Evaluation Understudy* — „kétnyelvű helyettesítő értékelő" kifejezésből) — egy algoritmus a gépi fordítás minőségének automatikus értékelésére. Az értékelés a jelölt fordítás és egy vagy több referencia emberi fordítás összehasonlításával történik<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-wiki_bleu-1)</sup>. A minőséget a gépi fordítás és a professzionális fordítás közötti lexikai közelség mértéke határozza meg. Ahogy a szerzők megjegyezték: „minél közelebb áll a gépi fordítás egy professzionális ember fordításához, annál jobb"<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-bleu_dvi-2)</sup>.

A módszert 2002-ben javasolta az IBM egyik kutatócsoportja **Kishore Papineni** vezetésével, és az egyik első olyan metrikává vált, amely magas korrelációt mutatott a fordítói szakértők értékeléseivel. A BLEU gyorsan népszerűvé vált a számítás egyszerűsége, a nyelvtől való függetlensége és a szövegkorpusz szintjén tapasztalt jó egyezés miatt az emberi értékeléssel<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-wiki_bleu-1)</sup>.

## A BLEU kiszámításának módszertana

A BLEU az n-grammok (*n* szóból álló szekvenciák) egyezéseinek megszámlálásával értékeli a fordítást a jelölt fordítás és a referencia fordítások között.

### 1. Módosított n-gramm pontosság

Először különböző hosszúságú n-grammokra (általában 1-től 4-ig) kiszámítják azok pontosságát ($p_{n}$) — a jelölt fordítás azon n-grammjainak arányát, amelyek szerepelnek a referencia fordításokban<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-mt_companion-3)</sup>. Ugyanakkor az egyes n-grammok egyezéseinek száma a bármelyik referencia szövegben szereplő maximális előfordulásszámra van korlátozva, hogy elkerüljék az ugyanazon szó ismétléséért kapott pontszám felfújását.

### 2. Aggregálás és mértani közép

Egységes pontszám meghatározásához az 1-, 2-, 3- és 4-grammok pontosságait mértani közép segítségével aggregálják. Ez azért történik így, hogy az egyik n-gramm-típus (például a 4-grammok) alacsony pontossága erősen befolyásolja a végső pontszámot, tükrözve a hosszú kifejezések gyenge minőségét. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Rövidségi büntetés (Brevity Penalty)

Annak megakadályozására, hogy a túl rövid, de pontos fordítások indokolatlanul magas pontszámot kapjanak, a BLEU bevezeti a **rövidségi büntetést** (*Brevity Penalty*, BP). Ha a jelölt fordítás hossza (c) lényegesen kisebb a referencia fordítás hosszánál (r), a végső BLEU-pontszám csökken. A büntetés kiszámítása a következő képlettel történik: $ext{BP} = \left\{ \begin{matrix}
1 & {ext{if}c > r} \\
e^{1 - r/c} & {ext{if}c \leq r}
\end{matrix} \right.$

### 4. A BLEU végső képlete

A végső BLEU-pontszámot a rövidségi büntetés és az n-gramm pontosságok mértani közepének szorzataként számítják ki<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-callison_burch-4)</sup>: $ext{BLEU} = ext{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ ahol N a maximális n-gramm-hossz (általában 4), és $w_{n}$ a súlyok (általában $1/N$).

A BLEU értéke 0 és 1 között van (gyakran 100-zal megszorozzák és százalékban fejezik ki). Minél közelebb van az eredmény az 1-hez (100%), annál „emberközelibbnek" tekinthető a fordítás.

## Alkalmazás és jelentőség

Megjelenése óta a BLEU metrika de facto szabvánnyá vált a gépi fordítási (GT) rendszerek értékelésében. Lehetővé tette a GT-rendszerek fejlesztésének „szűk keresztmetszetének" — a kézi értékelés hosszadalmasságának és költségességének — leküzdését. A fejlesztők lehetőséget kaptak arra, hogy gyorsan megmérjék a modellekben végrehajtott változtatások hatását, és gyorsan kiszorítsák a sikertelen megoldásokat<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-bleu_dvi-2)</sup>.

A BLEU jól korrelál az emberi értékelésekkel a **teljes szövegkorpusz szintjén**, de megbízhatatlan az egyes mondatok értékelésére<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-mt_companion-3)</sup>. Ezért a metrikát széles körben alkalmazták szabványosított GT-versenyeken (például NIST és WMT) a rendszerek összehasonlítására.

## Korlátok és kritikák

Széles körű elterjedtsége ellenére a BLEU számos lényeges korláttal rendelkezik:

- **Szemantikai értékelés hiánya**: A BLEU csupán a szavak felszíni egyezését méri, és nem képes értékelni, hogy az eredeti szöveg **értelme** helyesen van-e visszaadva. Egy fordítás magas pontszámot kaphat, de grammatikailag helytelen lehet, vagy eltorzíthatja a jelentést<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-deep_hub-5)</sup>.
- **A szinonimák és parafrázisok figyelmen kívül hagyása**: Az algoritmus bünteti azokat a fordításokat, amelyek szinonimákat vagy a referenciától eltérő megfogalmazásokat alkalmaznak, még akkor is, ha azok teljesen helyesek. Több referencia használata enyhíti, de nem oldja meg teljesen ezt a problémát.
- **Tokenizációs érzékenység**: A BLEU eredményei erősen függnek a szöveg tokenekre bontásának módjától. A különböző tokenizátor-implementációk eltérő értékekhez vezethetnek, ami helytelenné teszi a modellek összehasonlítását. E probléma megoldására javasolták a **SacreBLEU** szabványt, amely egységesíti a metrika kiszámítását<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-wiki_bleu-1)</sup>.
- **Az alkalmazás nehézsége egyes nyelveken**: A BLEU rosszul működik az egyértelmű szóelválasztókkal nem rendelkező nyelvekkel (például kínaival vagy japánnal) előzetes szegmentálás nélkül.

## Alternatívák és modern megközelítések

Idővel a BLEU hiányosságainak leküzdésére új automatikus metrikákat javasoltak:

- **METEOR**: Figyelembe veszi a szinonima-egyezéseket, a stemmelést és a szórendi megfelelést.
- **ROUGE**: Szövegösszefoglalás értékelésére alkalmazható, a teljességre (recall) összpontosítva, nem a pontosságra.
- **Tanulható metrikák (Learned Metrics)**: Modern megközelítések, amelyek gépi tanulási modelleket használnak a szemantikai közelség figyelembevételéhez. Az olyan metrikák, mint a **BLEURT** és a **COMET**, lényegesen magasabb korrelációt mutatnak az emberi értékelésekkel, mint a klasszikus BLEU<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-bleurt-6)</sup>.

A 2020-as évekre a BLEU elvesztette feltétlen szabvány státuszát, helyet adva pontosabb módszereknek<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_note-ai_mil_lexicon-7)</sup>. Ennek ellenére fontos mérföldkő marad a GT értékelésének történetében, és alapvető viszonyítási pontként továbbra is használják a haladás mérésénél.

## Hivatkozások

- Mi az a BLEU-pontszám? — Microsoft Azure dokumentáció

## Megjegyzések

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HU)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
