BLEU (Bilingual Evaluation Understudy) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (del inglés Bilingual Evaluation Understudy — «suplente de evaluación bilingüe») es un algoritmo para la evaluación automática de la calidad de un texto traducido por una máquina. La evaluación se realiza comparando la traducción candidata con una o varias traducciones humanas de referencia[1]. La calidad se determina por el grado de similitud léxica de la traducción automática con una traducción profesional. Como señalaron los autores, «cuanto más se acerca una traducción automática a una traducción humana profesional, mejor es»[2].

El método fue propuesto en 2002 por un grupo de investigadores de IBM liderado por Kishore Papineni y se convirtió en una de las primeras métricas en mostrar una alta correlación con las evaluaciones de traductores expertos. BLEU ganó popularidad rápidamente gracias a su simplicidad de cálculo, independencia del idioma y buena correspondencia con la evaluación humana a nivel de corpus de textos[1].

Metodología de cálculo de BLEU

BLEU evalúa una traducción contando las coincidencias de n-gramas (secuencias de n palabras) entre la traducción candidata y las traducciones de referencia.

1. Precisión de n-gramas modificada

Primero, para n-gramas de diferentes longitudes (generalmente de 1 a 4), se calcula su precisión (pn), que es la proporción de n-gramas de la traducción candidata que aparecen en las traducciones de referencia[3]. Al mismo tiempo, el número de coincidencias para cada n-grama se limita al número máximo de sus apariciones en cualquiera de los textos de referencia para evitar inflar la puntuación por la repetición de la misma palabra.

2. Agregación y media geométrica

Para obtener una única puntuación, las precisiones para 1, 2, 3 y 4-gramas se agregan mediante una media geométrica. Esto se hace para que una baja precisión en un tipo de n-grama (por ejemplo, 4-gramas) afecte significativamente la puntuación final, reflejando la mala calidad de las frases largas. p1p2p3p44

3. Penalización por brevedad (Brevity Penalty)

Para evitar obtener puntuaciones infladas en traducciones demasiado cortas pero precisas, BLEU introduce una penalización por brevedad (Brevity Penalty, BP). Si la longitud de la traducción candidata (c) es significativamente menor que la longitud de la traducción de referencia (r), la puntuación final de BLEU se reduce. La penalización se calcula con la fórmula: BP={1si c>re1r/csi cr

4. Fórmula final de BLEU

La puntuación BLEU final se calcula como el producto de la penalización por brevedad y la media geométrica de las precisiones de los n-gramas[4]: BLEU=BPexp(n=1Nwnlogpn) donde N es la longitud máxima de los n-gramas (generalmente 4), y wn son los pesos (generalmente 1/N).

El valor de BLEU se encuentra en el rango de 0 a 1 (a menudo se multiplica por 100 y se expresa como porcentaje). Cuanto más se acerca el resultado a 1 (100%), más «cercana a la humana» se considera la traducción.

Aplicación e importancia

Desde su publicación, la métrica BLEU se convirtió en el estándar de facto para evaluar los sistemas de traducción automática (TA). Permitió superar el «cuello de botella» en el desarrollo de sistemas de TA: la duración y el costo de la evaluación manual. Los desarrolladores obtuvieron la capacidad de medir rápidamente el efecto de los cambios en los modelos y de descartar rápidamente las soluciones fallidas[2].

BLEU se correlaciona bien con las evaluaciones humanas a nivel de corpus de textos, pero no es fiable para evaluar oraciones individuales[3]. Por lo tanto, la métrica fue ampliamente utilizada en competiciones estandarizadas de TA (por ejemplo, NIST y WMT) para comparar sistemas.

Limitaciones y críticas

_A pesar de su amplia difusión, BLEU tiene una serie de limitaciones significativas:

  • Falta de evaluación semántica: BLEU solo mide la coincidencia superficial de palabras y no puede evaluar si el significado del texto original se ha transmitido correctamente. Una traducción puede obtener una puntuación alta, pero ser gramaticalmente incorrecta o distorsionar el significado[5].
  • Ignora sinónimos y paráfrasis: El algoritmo penaliza las traducciones que utilizan sinónimos u otras formulaciones diferentes a las de la referencia, incluso si son completamente correctas. El uso de múltiples referencias mitiga, pero no resuelve completamente este problema.
  • Sensibilidad a la tokenización: Los resultados de BLEU dependen en gran medida de cómo se divide el texto en tokens. Diferentes implementaciones de tokenizadores pueden llevar a valores distintos, haciendo que la comparación de modelos sea incorrecta. Para resolver este problema, se propuso el estándar SacreBLEU, que unifica el cálculo de la métrica[1].
  • Dificultad de aplicación a ciertos idiomas: BLEU funciona mal con idiomas que no tienen delimitadores de palabras claros (como el chino o el japonés) sin una segmentación previa.

Alternativas y enfoques modernos

Con el tiempo, para superar las deficiencias de BLEU, se propusieron nuevas métricas automáticas:

  • METEOR: Tiene en cuenta coincidencias de sinónimos, stemming y el orden de las palabras.
  • ROUGE: Se utiliza para evaluar la sumarización de textos, centrándose en la exhaustividad (recall) en lugar de la precisión.
  • Métricas aprendidas (Learned Metrics): Enfoques modernos que utilizan modelos de aprendizaje automático para tener en cuenta la proximidad semántica. Métricas como BLEURT y COMET muestran una correlación significativamente mayor con las evaluaciones humanas que el BLEU clásico[6].

Para la década de 2020, BLEU había perdido su estatus de estándar indiscutible, cediendo su lugar a métodos más precisos[7]. Sin embargo, sigue siendo un hito importante en la historia de la evaluación de la TA y continúa utilizándose como un punto de referencia básico para medir el progreso.

Enlaces externos

Referencias

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]