BERTScore (metric) (ES)
BERTScore es una métrica automática para evaluar la calidad del texto generado, basada en la medición de la similitud semántica mediante embeddings contextuales de modelos de lenguaje preentrenados, como BERT. La métrica fue propuesta en 2019 por un grupo de investigadores liderado por Tianyi Zhang en el artículo «BERTScore: Evaluating Text Generation with BERT»[1].
A diferencia de las métricas tradicionales como BLEU y ROUGE, que se basan en la coincidencia exacta de n-gramas, BERTScore permite detectar la equivalencia de significado incluso cuando las palabras y formulaciones difieren, teniendo en cuenta sinónimos y paráfrasis[2].
Método de cálculo
El método BERTScore consta de varias etapas:
- Obtención de embeddings contextuales: Ambos textos (el de referencia y el generado) se dividen en tokens y se procesan a través de un modelo Transformer preentrenado (por ejemplo, BERT o RoBERTa). Para cada token, se extrae su representación vectorial contextual (embedding).
- Cálculo de la similitud del coseno: Se calcula la similitud del coseno para todos los pares de tokens de los dos textos, formando una matriz de similitud de tokens[3].
- Cálculo de la precisión, exhaustividad y F1-score: Basándose en la matriz de similitud, para cada token en el texto generado, se encuentra el token más similar en el texto de referencia, lo que permite calcular la precisión (precision). De manera análoga, para cada token de referencia, se encuentra el token más cercano en el texto generado, lo que proporciona la exhaustividad (recall). El valor final de BERTScore es una F₁-score balanceada que combina la precisión y la exhaustividad:
La métrica es flexible: se pueden elegir diferentes modelos preentrenados, ponderar los tokens según su importancia (usando pesos IDF) y transformar linealmente las puntuaciones para una mejor interpretabilidad[3].
Aplicación y eficacia
BERTScore se aplica para evaluar la calidad en diversas tareas de generación de texto:
- Traducción automática: Captura la preservación del significado, incluso si las construcciones de la traducción difieren de las de referencia.
- Resumen automático: Es capaz de determinar que diferentes formulaciones pueden transmitir los mismos hechos clave, lo que lo hace más flexible que ROUGE.
- Sistemas de diálogo: Ayuda a medir la pertinencia de una respuesta comparándola con una de referencia a nivel de significado.
Una evaluación a gran escala realizada por los autores demostró que el coeficiente de correlación de BERTScore con las evaluaciones humanas es notablemente más alto que el de métricas como BLEU y ROUGE. Además, la métrica mostró una mayor robustez ante casos complejos de parafraseo[1].
Ventajas
- Consideración de la semántica: Compara textos a nivel de significado, teniendo en cuenta sinónimos y paráfrasis.
- Alta correlación con la evaluación humana: Las puntuaciones de BERTScore se alinean mejor con los juicios humanos sobre la calidad del texto que las métricas tradicionales.
- Universalidad y portabilidad: La métrica no está ligada a un idioma o tarea específicos; basta con seleccionar el modelo preentrenado adecuado.
- No requiere entrenamiento: BERTScore es una métrica no entrenable, a diferencia de métricas más complejas (como BLEURT) que necesitan un preentrenamiento en corpus de evaluaciones.
- Integración de modelos modernos: Aprovecha el poder de los Transformers para extraer características contextuales profundas.
Limitaciones y críticas
- Altos costos computacionales: El cálculo basado en embeddings requiere significativamente más recursos que el conteo de n-gramas y a menudo necesita el uso de GPU[2].
- Dependencia del modelo: La calidad de la evaluación está directamente relacionada con la calidad del modelo preentrenado. La elección del modelo y la capa para extraer los embeddings afecta el resultado, lo que puede causar problemas de reproducibilidad[4].
- Falta de consideración de hechos y estructura: BERTScore se centra en la similitud semántica local y no garantiza la comprensión de la estructura del texto ni la precisión fáctica. Un texto con frases reordenadas o errores de hecho puede obtener una puntuación alta[3].
- Baja interpretabilidad: A diferencia de BLEU/ROUGE, la puntuación de BERTScore es menos transparente, lo que dificulta el análisis de errores.
- Sesgos sociales (bias): La métrica hereda los estereotipos y sesgos presentes en los modelos preentrenados. Un estudio de 2022 demostró que las métricas basadas en LLM (incluido BERTScore) exhiben un sesgo social significativamente mayor que las métricas tradicionales[5].
Significado y papel en la evaluación
BERTScore representa un paso importante en el desarrollo de métodos para evaluar texto generado, ya que permite tener en cuenta la equivalencia semántica y no solo las coincidencias léxicas. Aunque ninguna métrica automática puede medir perfectamente la calidad del texto, BERTScore se ha consolidado como una herramienta fiable que complementa los enfoques clásicos (como BLEU y ROUGE) en lugar de reemplazarlos por completo.
En la práctica, BERTScore se utiliza a menudo en combinación con la evaluación manual y otras métricas para obtener una comprensión más completa y profunda de qué tan bien los modelos generan textos coherentes y semánticamente relevantes[2].
Enlaces externos
Referencias
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 de abril de 2019. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 de octubre de 2022. [5]