BLEU (Bilingual Evaluation Understudy) (IT)
BLEU (dall'inglese Bilingual Evaluation Understudy — «valutatore sostitutivo bilingue») — è un algoritmo per la valutazione automatica della qualità del testo tradotto da una macchina. La valutazione viene effettuata confrontando la traduzione candidata con una o più traduzioni umane di riferimento (etalon)[1]. La qualità è determinata dal grado di somiglianza lessicale tra la traduzione automatica e quella professionale. Come osservavano gli autori, «più la traduzione automatica si avvicina a quella di un traduttore umano professionista, migliore essa è»[2].
Il metodo fu proposto nel 2002 da un gruppo di ricercatori di IBM guidato da Kishore Papineni e divenne una delle prime metriche a mostrare un'alta correlazione con le valutazioni degli esperti traduttori. BLEU ha guadagnato rapidamente popolarità grazie alla semplicità del calcolo, all'indipendenza dalla lingua e alla buona corrispondenza con la valutazione umana a livello di corpus di testi[1].
Metodologia di calcolo del BLEU
BLEU valuta la traduzione calcolando le corrispondenze di n-grammi (sequenze di n parole) tra la traduzione candidata e le traduzioni di riferimento.
1. Precisione modificata degli n-grammi
Innanzitutto, per n-grammi di diversa lunghezza (di solito da 1 a 4) viene calcolata la loro precisione () — la quota di n-grammi della traduzione candidata che compaiono nelle traduzioni di riferimento[3]. Il numero di corrispondenze per ciascun n-gramma è limitato al numero massimo delle sue occorrenze in qualsiasi testo di riferimento, al fine di evitare una sopravvalutazione dovuta alla ripetizione della stessa parola.
2. Aggregazione e media geometrica
Per ottenere una valutazione unica, le precisioni per gli 1-, 2-, 3- e 4-grammi vengono aggregate tramite la media geometrica. Ciò viene fatto affinché una bassa precisione per un tipo di n-gramma (ad esempio, i 4-grammi) influenzi fortemente il punteggio finale, riflettendo la scarsa qualità delle frasi lunghe.
3. Penalità per brevità (Brevity Penalty)
Per impedire l'ottenimento di punteggi gonfiati grazie a traduzioni troppo brevi ma precise, BLEU introduce la penalità per brevità (Brevity Penalty, BP). Se la lunghezza della traduzione candidata (c) è significativamente inferiore alla lunghezza della traduzione di riferimento (r), il punteggio BLEU finale viene ridotto. La penalità è calcolata secondo la formula:
4. Formula finale del BLEU
Il punteggio BLEU definitivo è calcolato come il prodotto della penalità per brevità per la media geometrica delle precisioni degli n-grammi[4]: dove N è la lunghezza massima degli n-grammi (di solito 4), e sono i pesi (di solito ).
Il valore BLEU si trova nell'intervallo da 0 a 1 (spesso moltiplicato per 100 ed espresso in percentuale). Più il risultato si avvicina a 1 (100%), più la traduzione è considerata «vicina a quella umana».
Applicazione e significato
Dal momento della sua pubblicazione, la metrica BLEU è diventata lo standard de facto per la valutazione dei sistemi di traduzione automatica (MT). Ha permesso di superare il «collo di bottiglia» nello sviluppo dei sistemi MT — la lunghezza e il costo elevato della valutazione manuale. Gli sviluppatori hanno ottenuto la possibilità di misurare rapidamente l'effetto delle modifiche ai modelli e di scartare prontamente le soluzioni non riuscite[2].
BLEU mostra una buona correlazione con le valutazioni umane a livello dell'intero corpus di testi, ma risulta poco affidabile per la valutazione di singole frasi[3]. Pertanto, la metrica è stata ampiamente utilizzata nelle competizioni standardizzate di MT (ad esempio, NIST e WMT) per il confronto tra sistemi.
Limitazioni e critiche
Nonostante la sua ampia diffusione, BLEU presenta una serie di limitazioni significative:
- Assenza di valutazione semantica: BLEU misura solo la corrispondenza superficiale delle parole e non è in grado di valutare se il significato del testo originale sia stato correttamente trasmesso. Una traduzione può ottenere un punteggio elevato pur essendo grammaticalmente errata o distorcendo il significato[5].
- Ignoranza di sinonimi e parafrasi: L'algoritmo penalizza le traduzioni che utilizzano sinonimi o formulazioni diverse rispetto al riferimento, anche se del tutto corrette. L'utilizzo di più riferimenti attenua, ma non risolve completamente questo problema.
- Sensibilità alla tokenizzazione: I risultati BLEU dipendono fortemente dal modo in cui il testo viene suddiviso in token. Diverse implementazioni dei tokenizzatori possono portare a valori diversi, rendendo il confronto tra modelli non corretto. Per risolvere questo problema è stato proposto lo standard SacreBLEU, che uniforma il calcolo della metrica[1].
- Difficoltà di applicazione ad alcune lingue: BLEU funziona male con le lingue prive di separatori di parole ben definiti (ad esempio, il cinese o il giapponese) senza una preventiva segmentazione.
Alternative e approcci moderni
Nel tempo, per superare le carenze di BLEU, sono state proposte nuove metriche automatiche:
- METEOR: Tiene conto delle corrispondenze di sinonimi, dello stemming e dell'ordine delle parole.
- ROUGE: Viene utilizzato per la valutazione della sintesi di testi, concentrandosi sulla completezza (recall) piuttosto che sulla precisione.
- Metriche apprendibili (Learned Metrics): Approcci moderni che utilizzano modelli di Machine Learning per tenere conto della somiglianza semantica. Metriche come BLEURT e COMET mostrano una correlazione significativamente più alta con le valutazioni umane rispetto al BLEU classico[6].
Negli anni 2020 BLEU ha perso lo status di standard assoluto, cedendo il passo a metodi più precisi[7]. Tuttavia, rimane un'importante pietra miliare nella storia della valutazione MT e continua a essere utilizzato come punto di riferimento di base per la misurazione del progresso.
Collegamenti esterni
- Cos'è il punteggio BLEU? — Documentazione Microsoft Azure
Note
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]