BLEU (Bilingual Evaluation Understudy) (NL)
BLEU (van het Engels Bilingual Evaluation Understudy — «tweetalige evaluatie-vervanger») — is een algoritme voor de automatische beoordeling van de kwaliteit van door machines vertaalde tekst. De beoordeling vindt plaats door de kandidaat-vertaling te vergelijken met één of meer referentie-vertalingen van mensen[1]. De kwaliteit wordt bepaald door de mate van lexicale gelijkenis tussen de machinevertaling en een professionele vertaling. Zoals de auteurs opmerkten: «hoe dichter een machinevertaling bij de vertaling van een professioneel mens ligt, hoe beter deze is»[2].
De methode werd in 2002 voorgesteld door een groep onderzoekers van IBM onder leiding van Kishore Papineni en werd één van de eerste metrics die een hoge correlatie met de beoordelingen van deskundige vertalers aantoonden. BLEU verwierf snel populariteit dankzij de eenvoud van de berekening, de taalkundige onafhankelijkheid en de goede overeenkomst met de menselijke beoordeling op corpusniveau[1].
Berekeningsmethode van BLEU
BLEU beoordeelt een vertaling door het tellen van overeenkomsten van n-grammen (reeksen van n woorden) tussen de kandidaat-vertaling en de referentie-vertalingen.
1. Gewijzigde n-gram precisie
Eerst wordt voor n-grammen van verschillende lengtes (gewoonlijk van 1 tot 4) de precisie () berekend — het aandeel n-grammen uit de kandidaat-vertaling dat voorkomt in de referentie-vertalingen[3]. Daarbij wordt het aantal overeenkomsten voor elk n-gram beperkt tot het maximale aantal voorkomens ervan in een van de referentieteksten, om een overschatting van de score door herhaling van hetzelfde woord te voorkomen.
2. Aggregatie en meetkundig gemiddelde
Om één enkele score te verkrijgen, worden de precisies voor 1-, 2-, 3- en 4-grammen geaggregeerd met behulp van het meetkundig gemiddelde. Dit wordt gedaan zodat een lage precisie voor één type n-gram (bijvoorbeeld 4-grammen) sterk van invloed is op de eindscore, wat een slechte kwaliteit van lange zinsdelen weerspiegelt.
3. Straf voor beknoptheid (Brevity Penalty)
Om te voorkomen dat te korte maar nauwkeurige vertalingen een te hoge score krijgen, introduceert BLEU een straf voor beknoptheid (Brevity Penalty, BP). Als de lengte van de kandidaat-vertaling (c) aanzienlijk kleiner is dan de lengte van de referentie-vertaling (r), wordt de uiteindelijke BLEU-score verlaagd. De straf wordt berekend volgens de formule:
4. Uiteindelijke BLEU-formule
De definitieve BLEU-score wordt berekend als het product van de straf voor beknoptheid en het meetkundig gemiddelde van de n-gram precisies[4]: waar N de maximale lengte van de n-grammen is (gewoonlijk 4), en de gewichten zijn (gewoonlijk ).
De BLEU-waarde ligt in het bereik van 0 tot 1 (vaak vermenigvuldigd met 100 en uitgedrukt in procenten). Hoe dichter het resultaat bij 1 (100%) ligt, hoe meer de vertaling als «dicht bij menselijk» wordt beschouwd.
Toepassing en betekenis
Sinds de publicatie is de BLEU-metric de de-facto standaard geworden voor de evaluatie van machinevertaalsystemen (MV). Het stelde ontwikkelaars in staat het «knelpunt» in de ontwikkeling van MV-systemen te overwinnen — de lange duur en hoge kosten van handmatige evaluatie. Ontwikkelaars kregen de mogelijkheid om snel het effect van wijzigingen in modellen te meten en mislukte oplossingen snel te elimineren[2].
BLEU correleert goed met menselijke beoordelingen op het niveau van het volledige corpus van teksten, maar is onbetrouwbaar voor de beoordeling van afzonderlijke zinnen[3]. Daarom werd de metric op grote schaal gebruikt in gestandaardiseerde MV-wedstrijden (bijvoorbeeld NIST en WMT) voor de vergelijking van systemen.
Beperkingen en kritiek
Ondanks de wijde verspreiding heeft BLEU een aantal wezenlijke beperkingen:
- Ontbreken van semantische beoordeling: BLEU meet slechts de oppervlakkige woordovereenkomst en is niet in staat te beoordelen of de betekenis van de brontekst correct is overgebracht. Een vertaling kan een hoge score krijgen, maar grammaticaal onjuist zijn of de betekenis vertekenen[5].
- Negeren van synoniemen en parafrasen: Het algoritme bestraft vertalingen die synoniemen of andere formuleringen gebruiken dan in de referentie, zelfs als deze volledig correct zijn. Het gebruik van meerdere referenties verzacht dit probleem, maar lost het niet volledig op.
- Gevoeligheid voor tokenisatie: De BLEU-resultaten zijn sterk afhankelijk van de manier waarop de tekst in tokens wordt opgesplitst. Verschillende implementaties van tokenizers kunnen leiden tot verschillende waarden, waardoor de vergelijking van modellen ongeldig wordt. Om dit probleem op te lossen werd de standaard SacreBLEU voorgesteld, die de berekening van de metric uniformeert[1].
- Moeilijke toepassing op sommige talen: BLEU werkt slecht met talen die geen duidelijke woordscheidingstekens hebben (bijvoorbeeld Chinees of Japans), zonder voorafgaande segmentatie.
Alternatieven en moderne benaderingen
Met de tijd werden nieuwe automatische metrics voorgesteld om de tekortkomingen van BLEU te overwinnen:
- METEOR: Houdt rekening met overeenkomsten van synoniemen, stemming en woordvolgorde.
- ROUGE: Wordt gebruikt voor de evaluatie van tekstsamenvatting, met de nadruk op volledigheid (recall) in plaats van precisie.
- Aangeleerde metrics (Learned Metrics): Moderne benaderingen die gebruik maken van Machine Learning-modellen om rekening te houden met semantische nabijheid. Metrics zoals BLEURT en COMET tonen een aanzienlijk hogere correlatie met menselijke beoordelingen dan de klassieke BLEU[6].
In de jaren 2020 verloor BLEU de status van onbetwiste standaard en maakte plaats voor nauwkeurigere methoden[7]. Desalniettemin blijft het een belangrijk mijlpaal in de geschiedenis van MV-evaluatie en wordt het nog steeds gebruikt als basisreferentiepunt bij het meten van vooruitgang.
Verwijzingen
- Wat is de BLEU-score? — Microsoft Azure-documentatie
Noten
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]