---
title: "BLEU (Bilingual Evaluation Understudy) (RO)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 638
wiki_created_at: 2026-09-06T22:36:45Z
wiki_modified_at: 2026-09-06T22:36:45Z
downloaded_at: 2026-09-07T22:41:24Z
---

# BLEU (Bilingual Evaluation Understudy) (RO)

**BLEU** (din engl. *Bilingual Evaluation Understudy* — „evaluator bilingv substitut") — este un algoritm pentru evaluarea automată a calității textului tradus de mașină. Evaluarea se realizează prin compararea traducerii-candidat cu una sau mai multe traduceri umane de referință (etalon)<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-wiki_bleu-1)</sup>. Calitatea este determinată de gradul de similitudine lexicală dintre traducerea automată și cea profesională. După cum remarcau autorii, „cu cât traducerea automată este mai apropiată de traducerea unui profesionist uman, cu atât este mai bună"<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-bleu_dvi-2)</sup>.

Metoda a fost propusă în 2002 de un grup de cercetători de la IBM condus de **Kishore Papineni** și a devenit una dintre primele metrici care au demonstrat o corelație ridicată cu evaluările experților-traducători. BLEU a câștigat rapid popularitate datorită simplității calculului, independenței lingvistice și corespondenței bune cu evaluarea umană la nivel de corpus de texte<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-wiki_bleu-1)</sup>.

## Metodologia de calcul BLEU

BLEU evaluează traducerea prin numărarea corespondenților n-gramelor (secvențe de *n* cuvinte) dintre traducerea-candidat și traducerile de referință.

### 1. Precizia modificată a n-gramelor

În primul rând, pentru n-grame de diferite lungimi (de obicei de la 1 la 4) se calculează precizia lor ($p_{n}$) — proporția n-gramelor din traducerea-candidat care apar în traducerile de referință<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-mt_companion-3)</sup>. Totodată, numărul de corespondențe pentru fiecare n-gramă este limitat la numărul maxim de apariții ale acesteia în oricare dintre textele de referință, pentru a evita supraevaluarea prin repetarea aceluiași cuvânt.

### 2. Agregarea și media geometrică

Pentru a obține o evaluare unică, preciziile pentru 1-, 2-, 3- și 4-grame sunt agregate folosind media geometrică. Aceasta se face pentru ca o precizie scăzută pentru un tip de n-grame (de exemplu, 4-grame) să influențeze semnificativ scorul final, reflectând calitatea slabă a frazelor lungi. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Penalizarea pentru brevitate (Brevity Penalty)

Pentru a preveni obținerea unor scoruri umflate prin traduceri prea scurte, dar precise, BLEU introduce **penalizarea pentru brevitate** (*Brevity Penalty*, BP). Dacă lungimea traducerii-candidat (c) este semnificativ mai mică decât lungimea traducerii de referință (r), scorul final BLEU se reduce. Penalizarea se calculează după formula: $ext{BP} = \left\{ \begin{matrix}
1 & {ext{if}c > r} \\
e^{1 - r/c} & {ext{if}c \leq r}
\end{matrix} \right.$

### 4. Formula finală BLEU

Scorul BLEU final se calculează ca produsul dintre penalizarea pentru brevitate și media geometrică a preciziilor n-gramelor<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-callison_burch-4)</sup>: $ext{BLEU} = ext{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ unde N este lungimea maximă a n-gramelor (de obicei 4), iar $w_{n}$ — ponderile (de obicei $1/N$).

Valoarea BLEU se află în intervalul de la 0 la 1 (adesea înmulțită cu 100 și exprimată în procente). Cu cât rezultatul este mai aproape de 1 (100%), cu atât traducerea este considerată mai „apropiată de cea umană".

## Aplicare și importanță

Din momentul publicării, metrica BLEU a devenit standardul de facto pentru evaluarea sistemelor de traducere automată (TA). Ea a permis depășirea „blocajului" în dezvoltarea sistemelor de TA — durata îndelungată și costul ridicat al evaluării manuale. Dezvoltatorii au obținut posibilitatea de a măsura rapid efectul modificărilor din modele și de a elimina prompt soluțiile nereușite<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-bleu_dvi-2)</sup>.

BLEU corelează bine cu evaluările umane la **nivelul întregului corpus** de texte, dar este nesigur pentru evaluarea propozițiilor individuale<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-mt_companion-3)</sup>. De aceea, metrica a fost utilizată pe scară largă în competițiile standardizate de TA (de exemplu, NIST și WMT) pentru compararea sistemelor.

## Limitări și critici

În ciuda răspândirii largi, BLEU prezintă o serie de limitări semnificative:

- **Absența evaluării semantice**: BLEU măsoară doar corespondența superficială a cuvintelor și nu este capabil să evalueze dacă **sensul** textului sursă a fost redat corect. O traducere poate obține un scor ridicat, dar să fie incorectă gramatical sau să denatureze înțelesul<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-deep_hub-5)</sup>.
- **Ignorarea sinonimelor și a parafrazelor**: Algoritmul penalizează traducerile care folosesc sinonime sau formulări diferite față de referință, chiar dacă acestea sunt complet corecte. Utilizarea mai multor referințe atenuează, dar nu rezolvă complet această problemă.
- **Sensibilitatea la tokenizare**: Rezultatele BLEU depind puternic de modul de segmentare a textului în token-uri. Implementări diferite ale tokenizatoarelor pot conduce la valori diferite, făcând compararea modelelor incorectă. Pentru rezolvarea acestei probleme a fost propus standardul **SacreBLEU**, care unifică calculul metricii<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-wiki_bleu-1)</sup>.
- **Dificultatea aplicării la anumite limbi**: BLEU funcționează slab pentru limbile care nu au delimitatori clari de cuvinte (de exemplu, chineza sau japoneza), fără segmentare prealabilă.

## Alternative și abordări moderne

În timp, pentru a depăși neajunsurile BLEU au fost propuse noi metrici automate:

- **METEOR**: Ia în considerare corespondențele sinonimelor, stemming-ul și ordinea cuvintelor.
- **ROUGE**: Utilizat pentru evaluarea rezumării textelor, concentrându-se pe completitudine (recall), nu pe precizie.
- **Metrici antrenabile (Learned Metrics)**: Abordări moderne care folosesc modele de Machine Learning pentru a ține cont de similitudinea semantică. Metrici precum **BLEURT** și **COMET** demonstrează o corelație semnificativ mai ridicată cu evaluările oamenilor decât BLEU clasic<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-bleurt-6)</sup>.

Până în anii 2020, BLEU a pierdut statutul de standard absolut, cedând locul unor metode mai precise<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_note-ai_mil_lexicon-7)</sup>. Cu toate acestea, el rămâne o etapă importantă în istoria evaluării TA și continuă să fie utilizat ca punct de referință de bază în măsurarea progresului.

## Referințe

- Ce este scorul BLEU? — Documentația Microsoft Azure

## Note

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(RO)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
