---
title: "BLEU (Bilingual Evaluation Understudy) (IT)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 633
wiki_created_at: 2026-09-06T22:36:41Z
wiki_modified_at: 2026-09-06T22:36:41Z
downloaded_at: 2026-09-07T22:41:22Z
---

# BLEU (Bilingual Evaluation Understudy) (IT)

**BLEU** (dall'inglese *Bilingual Evaluation Understudy* — «valutatore sostitutivo bilingue») — è un algoritmo per la valutazione automatica della qualità del testo tradotto da una macchina. La valutazione viene effettuata confrontando la traduzione candidata con una o più traduzioni umane di riferimento (etalon)<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-wiki_bleu-1)</sup>. La qualità è determinata dal grado di somiglianza lessicale tra la traduzione automatica e quella professionale. Come osservavano gli autori, «più la traduzione automatica si avvicina a quella di un traduttore umano professionista, migliore essa è»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-bleu_dvi-2)</sup>.

Il metodo fu proposto nel 2002 da un gruppo di ricercatori di IBM guidato da **Kishore Papineni** e divenne una delle prime metriche a mostrare un'alta correlazione con le valutazioni degli esperti traduttori. BLEU ha guadagnato rapidamente popolarità grazie alla semplicità del calcolo, all'indipendenza dalla lingua e alla buona corrispondenza con la valutazione umana a livello di corpus di testi<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-wiki_bleu-1)</sup>.

## Metodologia di calcolo del BLEU

BLEU valuta la traduzione calcolando le corrispondenze di n-grammi (sequenze di *n* parole) tra la traduzione candidata e le traduzioni di riferimento.

### 1. Precisione modificata degli n-grammi

Innanzitutto, per n-grammi di diversa lunghezza (di solito da 1 a 4) viene calcolata la loro precisione ($p_{n}$) — la quota di n-grammi della traduzione candidata che compaiono nelle traduzioni di riferimento<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-mt_companion-3)</sup>. Il numero di corrispondenze per ciascun n-gramma è limitato al numero massimo delle sue occorrenze in qualsiasi testo di riferimento, al fine di evitare una sopravvalutazione dovuta alla ripetizione della stessa parola.

### 2. Aggregazione e media geometrica

Per ottenere una valutazione unica, le precisioni per gli 1-, 2-, 3- e 4-grammi vengono aggregate tramite la media geometrica. Ciò viene fatto affinché una bassa precisione per un tipo di n-gramma (ad esempio, i 4-grammi) influenzi fortemente il punteggio finale, riflettendo la scarsa qualità delle frasi lunghe. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Penalità per brevità (Brevity Penalty)

Per impedire l'ottenimento di punteggi gonfiati grazie a traduzioni troppo brevi ma precise, BLEU introduce la **penalità per brevità** (*Brevity Penalty*, BP). Se la lunghezza della traduzione candidata (c) è significativamente inferiore alla lunghezza della traduzione di riferimento (r), il punteggio BLEU finale viene ridotto. La penalità è calcolata secondo la formula: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. Formula finale del BLEU

Il punteggio BLEU definitivo è calcolato come il prodotto della penalità per brevità per la media geometrica delle precisioni degli n-grammi<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ dove N è la lunghezza massima degli n-grammi (di solito 4), e $w_{n}$ sono i pesi (di solito $1/N$).

Il valore BLEU si trova nell'intervallo da 0 a 1 (spesso moltiplicato per 100 ed espresso in percentuale). Più il risultato si avvicina a 1 (100%), più la traduzione è considerata «vicina a quella umana».

## Applicazione e significato

Dal momento della sua pubblicazione, la metrica BLEU è diventata lo standard de facto per la valutazione dei sistemi di traduzione automatica (MT). Ha permesso di superare il «collo di bottiglia» nello sviluppo dei sistemi MT — la lunghezza e il costo elevato della valutazione manuale. Gli sviluppatori hanno ottenuto la possibilità di misurare rapidamente l'effetto delle modifiche ai modelli e di scartare prontamente le soluzioni non riuscite<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-bleu_dvi-2)</sup>.

BLEU mostra una buona correlazione con le valutazioni umane a **livello dell'intero corpus** di testi, ma risulta poco affidabile per la valutazione di singole frasi<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-mt_companion-3)</sup>. Pertanto, la metrica è stata ampiamente utilizzata nelle competizioni standardizzate di MT (ad esempio, NIST e WMT) per il confronto tra sistemi.

## Limitazioni e critiche

Nonostante la sua ampia diffusione, BLEU presenta una serie di limitazioni significative:

- **Assenza di valutazione semantica**: BLEU misura solo la corrispondenza superficiale delle parole e non è in grado di valutare se il **significato** del testo originale sia stato correttamente trasmesso. Una traduzione può ottenere un punteggio elevato pur essendo grammaticalmente errata o distorcendo il significato<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-deep_hub-5)</sup>.
- **Ignoranza di sinonimi e parafrasi**: L'algoritmo penalizza le traduzioni che utilizzano sinonimi o formulazioni diverse rispetto al riferimento, anche se del tutto corrette. L'utilizzo di più riferimenti attenua, ma non risolve completamente questo problema.
- **Sensibilità alla tokenizzazione**: I risultati BLEU dipendono fortemente dal modo in cui il testo viene suddiviso in token. Diverse implementazioni dei tokenizzatori possono portare a valori diversi, rendendo il confronto tra modelli non corretto. Per risolvere questo problema è stato proposto lo standard **SacreBLEU**, che uniforma il calcolo della metrica<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-wiki_bleu-1)</sup>.
- **Difficoltà di applicazione ad alcune lingue**: BLEU funziona male con le lingue prive di separatori di parole ben definiti (ad esempio, il cinese o il giapponese) senza una preventiva segmentazione.

## Alternative e approcci moderni

Nel tempo, per superare le carenze di BLEU, sono state proposte nuove metriche automatiche:

- **METEOR**: Tiene conto delle corrispondenze di sinonimi, dello stemming e dell'ordine delle parole.
- **ROUGE**: Viene utilizzato per la valutazione della sintesi di testi, concentrandosi sulla completezza (recall) piuttosto che sulla precisione.
- **Metriche apprendibili (Learned Metrics)**: Approcci moderni che utilizzano modelli di Machine Learning per tenere conto della somiglianza semantica. Metriche come **BLEURT** e **COMET** mostrano una correlazione significativamente più alta con le valutazioni umane rispetto al BLEU classico<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-bleurt-6)</sup>.

Negli anni 2020 BLEU ha perso lo status di standard assoluto, cedendo il passo a metodi più precisi<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_note-ai_mil_lexicon-7)</sup>. Tuttavia, rimane un'importante pietra miliare nella storia della valutazione MT e continua a essere utilizzato come punto di riferimento di base per la misurazione del progresso.

## Collegamenti esterni

- Cos'è il punteggio BLEU? — Documentazione Microsoft Azure

## Note

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(IT)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
