BLEU (Bilingual Evaluation Understudy) (FR)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (de l'anglais Bilingual Evaluation Understudy — « doublure d'évaluation bilingue ») est un algorithme pour l'évaluation automatique de la qualité d'un texte traduit par une machine. L'évaluation est effectuée en comparant une traduction candidate avec une ou plusieurs traductions humaines de référence[1]. La qualité est déterminée par le degré de proximité lexicale entre la traduction automatique et une traduction professionnelle. Comme l'ont souligné les auteurs, « plus une traduction automatique est proche d'une traduction humaine professionnelle, meilleure elle est »[2].

La méthode a été proposée en 2002 par un groupe de chercheurs d'IBM dirigé par Kishore Papineni et est devenue l'une des premières métriques à montrer une forte corrélation avec les évaluations des traducteurs experts. BLEU a rapidement gagné en popularité grâce à sa simplicité de calcul, son indépendance linguistique et sa bonne concordance avec l'évaluation humaine au niveau du corpus de textes[1].

Méthode de calcul de BLEU

BLEU évalue une traduction en comptant les correspondances de n-grammes (séquences de n mots) entre la traduction candidate et les traductions de référence.

1. Précision modifiée des n-grammes

D'abord, pour des n-grammes de différentes longueurs (généralement de 1 à 4), leur précision (pn) est calculée — la proportion de n-grammes de la traduction candidate qui apparaissent dans les traductions de référence[3]. Le nombre de correspondances pour chaque n-gramme est limité au nombre maximum de ses occurrences dans l'un des textes de référence, afin d'éviter de surévaluer une traduction qui répète le même mot.

2. Agrégation et moyenne géométrique

Pour obtenir un score unique, les précisions pour les 1-grammes, 2-grammes, 3-grammes et 4-grammes sont agrégées à l'aide d'une moyenne géométrique. Cela est fait pour qu'une faible précision pour un type de n-gramme (par exemple, les 4-grammes) ait un impact significatif sur le score final, reflétant ainsi la mauvaise qualité des phrases longues. p1p2p3p44

3. Pénalité de brièveté (Brevity Penalty)

Pour éviter d'obtenir des scores élevés pour des traductions trop courtes mais précises, BLEU introduit une pénalité de brièveté (Brevity Penalty, BP). Si la longueur de la traduction candidate (c) est significativement inférieure à la longueur de la traduction de référence (r), le score BLEU final est réduit. La pénalité est calculée par la formule : BP={1si c>re1r/csi cr

4. Formule finale du score BLEU

Le score BLEU final est calculé comme le produit de la pénalité de brièveté et de la moyenne géométrique des précisions des n-grammes[4]: BLEU=BPexp(n=1Nwnlogpn) où N est la longueur maximale des n-grammes (généralement 4), et wn sont les poids (généralement 1/N).

La valeur de BLEU se situe dans une plage de 0 à 1 (souvent multipliée par 100 et exprimée en pourcentage). Plus le résultat est proche de 1 (100 %), plus la traduction est considérée comme « proche de la qualité humaine ».

Application et importance

Depuis sa publication, la métrique BLEU est devenue un standard de facto pour l'évaluation des systèmes de traduction automatique (TA). Elle a permis de surmonter le « goulot d'étranglement » dans le développement des systèmes de TA — la durée et le coût de l'évaluation manuelle. Les développeurs ont ainsi pu mesurer rapidement l'effet des changements dans leurs modèles et écarter rapidement les solutions inefficaces[2].

BLEU est bien corrélé avec les évaluations humaines au niveau du corpus entier de textes, mais n'est pas fiable pour évaluer des phrases individuelles[3]. C'est pourquoi la métrique a été largement utilisée dans les compétitions standardisées de TA (par exemple, NIST et WMT) pour comparer les systèmes.

Limites et critiques

Malgré sa large diffusion, BLEU présente plusieurs limites importantes :

  • Absence d'évaluation sémantique : BLEU ne mesure que la correspondance de surface des mots et est incapable d'évaluer si le sens du texte original a été correctement transmis. Une traduction peut obtenir un score élevé tout en étant grammaticalement incorrecte ou en déformant le sens[5].
  • Ignorance des synonymes et des paraphrases : L'algorithme pénalise les traductions qui utilisent des synonymes ou des formulations différentes de celles de la référence, même si elles sont parfaitement correctes. L'utilisation de plusieurs références atténue ce problème, mais ne le résout pas entièrement.
  • Sensibilité à la tokenisation : Les résultats de BLEU dépendent fortement de la manière dont le texte est divisé en tokens. Différentes implémentations de tokeniseurs peuvent conduire à des valeurs différentes, rendant la comparaison des modèles incorrecte. Pour résoudre ce problème, le standard SacreBLEU a été proposé pour unifier le calcul de la métrique[1].
  • Difficulté d'application à certaines langues : BLEU fonctionne mal avec les langues qui n'ont pas de séparateurs de mots clairs (comme le chinois ou le japonais) sans segmentation préalable.

Alternatives et approches modernes

Au fil du temps, de nouvelles métriques automatiques ont été proposées pour surmonter les défauts de BLEU :

  • METEOR : Prend en compte les correspondances de synonymes, la racinisation (stemming) et l'ordre des mots.
  • ROUGE : S'applique à l'évaluation du résumé de textes, en se concentrant sur le rappel (recall) plutôt que sur la précision.
  • Métriques entraînables (Learned Metrics) : Approches modernes utilisant des modèles d'apprentissage automatique pour tenir compte de la proximité sémantique. Des métriques telles que BLEURT et COMET montrent une corrélation significativement plus élevée avec les évaluations humaines que le BLEU classique[6].

Vers les années 2020, BLEU a perdu son statut de standard incontesté, cédant la place à des méthodes plus précises[7]. Néanmoins, il reste un jalon important dans l'histoire de l'évaluation de la TA et continue d'être utilisé comme un point de référence de base pour mesurer les progrès.

Liens externes

Références

  1. 1.0 1.1 1.2 « BLEU », Wikipédia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. « Bleu: a Method for Automatic Evaluation of Machine Translation ». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 « BLEU ». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. « BLEU: a Method for Automatic Evaluation of Machine Translation ». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. « Beyond BLEU Score. When it comes to the nuanced world of... ». The Deep Hub | Medium. [5]
  6. « BLEURT : une métrique pour l'évaluation des modèles de génération de texte ». Neurohive. [6]
  7. « Chief Digital and Artificial Intelligence Office > Lexicon ». ai.mil. [7]