BLEU (Bilingual Evaluation Understudy) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (az angol Bilingual Evaluation Understudy — „kétnyelvű helyettesítő értékelő" kifejezésből) — egy algoritmus a gépi fordítás minőségének automatikus értékelésére. Az értékelés a jelölt fordítás és egy vagy több referencia emberi fordítás összehasonlításával történik[1]. A minőséget a gépi fordítás és a professzionális fordítás közötti lexikai közelség mértéke határozza meg. Ahogy a szerzők megjegyezték: „minél közelebb áll a gépi fordítás egy professzionális ember fordításához, annál jobb"[2].

A módszert 2002-ben javasolta az IBM egyik kutatócsoportja Kishore Papineni vezetésével, és az egyik első olyan metrikává vált, amely magas korrelációt mutatott a fordítói szakértők értékeléseivel. A BLEU gyorsan népszerűvé vált a számítás egyszerűsége, a nyelvtől való függetlensége és a szövegkorpusz szintjén tapasztalt jó egyezés miatt az emberi értékeléssel[1].

A BLEU kiszámításának módszertana

A BLEU az n-grammok (n szóból álló szekvenciák) egyezéseinek megszámlálásával értékeli a fordítást a jelölt fordítás és a referencia fordítások között.

1. Módosított n-gramm pontosság

Először különböző hosszúságú n-grammokra (általában 1-től 4-ig) kiszámítják azok pontosságát (pn) — a jelölt fordítás azon n-grammjainak arányát, amelyek szerepelnek a referencia fordításokban[3]. Ugyanakkor az egyes n-grammok egyezéseinek száma a bármelyik referencia szövegben szereplő maximális előfordulásszámra van korlátozva, hogy elkerüljék az ugyanazon szó ismétléséért kapott pontszám felfújását.

2. Aggregálás és mértani közép

Egységes pontszám meghatározásához az 1-, 2-, 3- és 4-grammok pontosságait mértani közép segítségével aggregálják. Ez azért történik így, hogy az egyik n-gramm-típus (például a 4-grammok) alacsony pontossága erősen befolyásolja a végső pontszámot, tükrözve a hosszú kifejezések gyenge minőségét. p1p2p3p44

3. Rövidségi büntetés (Brevity Penalty)

Annak megakadályozására, hogy a túl rövid, de pontos fordítások indokolatlanul magas pontszámot kapjanak, a BLEU bevezeti a rövidségi büntetést (Brevity Penalty, BP). Ha a jelölt fordítás hossza (c) lényegesen kisebb a referencia fordítás hosszánál (r), a végső BLEU-pontszám csökken. A büntetés kiszámítása a következő képlettel történik: extBP={1extifc>re1r/cextifcr

4. A BLEU végső képlete

A végső BLEU-pontszámot a rövidségi büntetés és az n-gramm pontosságok mértani közepének szorzataként számítják ki[4]: extBLEU=extBPexp(n=1Nwnlogpn) ahol N a maximális n-gramm-hossz (általában 4), és wn a súlyok (általában 1/N).

A BLEU értéke 0 és 1 között van (gyakran 100-zal megszorozzák és százalékban fejezik ki). Minél közelebb van az eredmény az 1-hez (100%), annál „emberközelibbnek" tekinthető a fordítás.

Alkalmazás és jelentőség

Megjelenése óta a BLEU metrika de facto szabvánnyá vált a gépi fordítási (GT) rendszerek értékelésében. Lehetővé tette a GT-rendszerek fejlesztésének „szűk keresztmetszetének" — a kézi értékelés hosszadalmasságának és költségességének — leküzdését. A fejlesztők lehetőséget kaptak arra, hogy gyorsan megmérjék a modellekben végrehajtott változtatások hatását, és gyorsan kiszorítsák a sikertelen megoldásokat[2].

A BLEU jól korrelál az emberi értékelésekkel a teljes szövegkorpusz szintjén, de megbízhatatlan az egyes mondatok értékelésére[3]. Ezért a metrikát széles körben alkalmazták szabványosított GT-versenyeken (például NIST és WMT) a rendszerek összehasonlítására.

Korlátok és kritikák

Széles körű elterjedtsége ellenére a BLEU számos lényeges korláttal rendelkezik:

  • Szemantikai értékelés hiánya: A BLEU csupán a szavak felszíni egyezését méri, és nem képes értékelni, hogy az eredeti szöveg értelme helyesen van-e visszaadva. Egy fordítás magas pontszámot kaphat, de grammatikailag helytelen lehet, vagy eltorzíthatja a jelentést[5].
  • A szinonimák és parafrázisok figyelmen kívül hagyása: Az algoritmus bünteti azokat a fordításokat, amelyek szinonimákat vagy a referenciától eltérő megfogalmazásokat alkalmaznak, még akkor is, ha azok teljesen helyesek. Több referencia használata enyhíti, de nem oldja meg teljesen ezt a problémát.
  • Tokenizációs érzékenység: A BLEU eredményei erősen függnek a szöveg tokenekre bontásának módjától. A különböző tokenizátor-implementációk eltérő értékekhez vezethetnek, ami helytelenné teszi a modellek összehasonlítását. E probléma megoldására javasolták a SacreBLEU szabványt, amely egységesíti a metrika kiszámítását[1].
  • Az alkalmazás nehézsége egyes nyelveken: A BLEU rosszul működik az egyértelmű szóelválasztókkal nem rendelkező nyelvekkel (például kínaival vagy japánnal) előzetes szegmentálás nélkül.

Alternatívák és modern megközelítések

Idővel a BLEU hiányosságainak leküzdésére új automatikus metrikákat javasoltak:

  • METEOR: Figyelembe veszi a szinonima-egyezéseket, a stemmelést és a szórendi megfelelést.
  • ROUGE: Szövegösszefoglalás értékelésére alkalmazható, a teljességre (recall) összpontosítva, nem a pontosságra.
  • Tanulható metrikák (Learned Metrics): Modern megközelítések, amelyek gépi tanulási modelleket használnak a szemantikai közelség figyelembevételéhez. Az olyan metrikák, mint a BLEURT és a COMET, lényegesen magasabb korrelációt mutatnak az emberi értékelésekkel, mint a klasszikus BLEU[6].

A 2020-as évekre a BLEU elvesztette feltétlen szabvány státuszát, helyet adva pontosabb módszereknek[7]. Ennek ellenére fontos mérföldkő marad a GT értékelésének történetében, és alapvető viszonyítási pontként továbbra is használják a haladás mérésénél.

Hivatkozások

  • Mi az a BLEU-pontszám? — Microsoft Azure dokumentáció

Megjegyzések

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]