GLUE Benchmark (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (acrónimo de General Language Understanding Evaluation, "Evaluación General de la Comprensión del Lenguaje") es un benchmark multitarea para evaluar la calidad de los modelos de procesamiento del lenguaje natural (NLU). El benchmark fue propuesto en 2018 por un grupo de investigadores de la Universidad de Nueva York, la Universidad de Washington y DeepMind, incluyendo a Alex Wang y Samuel Bowman, y ha ganado una amplia difusión en la comunidad de investigación[1].

El objetivo principal de GLUE es proporcionar un conjunto de pruebas unificado, neutral y complejo para la evaluación comparativa de las capacidades de los modelos de NLU en un conjunto diverso de tareas que van más allá de un área específica. El benchmark incluye una plataforma en línea con una tabla de clasificación (leaderboard), que garantiza una comparación objetiva de los modelos y evita el sobreajuste a los datos de prueba, ya que las etiquetas verdaderas de algunas pruebas no se publican y solo están disponibles a través del servidor de evaluación. Se asume que para lograr resultados altos, un modelo debe ser capaz de extraer representaciones lingüísticas universales y transferir eficazmente el conocimiento entre diferentes tipos de tareas.

Composición y tareas del benchmark

El benchmark GLUE combina nueve tareas diferentes de comprensión del lenguaje, basadas en conjuntos de datos preexistentes y desafiantes para la IA. Todas las tareas están formuladas como clasificación o regresión sobre una sola oración o un par de oraciones[1].

  • CoLA (Corpus of Linguistic Acceptability) — tarea para determinar la aceptabilidad gramatical de una oración. La métrica de calidad es el Coeficiente de correlación de Matthews.
  • SST-2 (Stanford Sentiment Treebank) — tarea para determinar el sentimiento (positivo/negativo) de una reseña de película. La métrica es la exactitud (accuracy).
  • MRPC (Microsoft Research Paraphrase Corpus) — tarea para identificar paráfrasis en un par de oraciones de fuentes de noticias. Las métricas son exactitud y puntuación F1.
  • QQP (Quora Question Pairs) — tarea para determinar si dos preguntas de la comunidad de Quora son duplicadas. Las métricas son exactitud y puntuación F1.
  • STS-B (Semantic Textual Similarity Benchmark) — tarea de comparación semántica entre dos oraciones. El modelo debe predecir el grado de similitud semántica en una escala de 1 a 5. Las métricas son los coeficientes de correlación de Pearson y Spearman.
  • MNLI (Multi-Genre Natural Language Inference) — tarea de reconocimiento de la implicación textual en pares de oraciones de diversas fuentes de género (implicación, contradicción, neutral). Los resultados se evalúan por separado en subconjuntos coincidentes (matched) y no coincidentes (mismatched).
  • QNLI (Question Natural Language Inference) — una tarea derivada del conjunto de datos SQuAD. Requiere determinar si una oración de un párrafo contiene la respuesta a una pregunta dada.
  • RTE (Recognizing Textual Entailment) — un conjunto de datos agregado para la implicación textual que combina varias colecciones pequeñas. La tarea es clasificar de forma binaria la relación entre las oraciones.
  • WNLI (Winograd NLI) — una versión modificada del esquema de Winograd, adaptada al formato NLI. Es una tarea de resolución de anáforas: al sistema se le da una oración con un pronombre ambiguo y debe indicar a cuál de los dos objetos se refiere.

Metodología de evaluación

Para ser evaluados en GLUE, los investigadores envían las predicciones de su modelo a un servidor especial, tras lo cual reciben un cálculo automático de las métricas para cada tarea y una puntuación general.

  • GLUE-score — el indicador final, que se calcula como el promedio de los resultados en las nueve tareas principales.
  • Tabla de clasificación (Leaderboard) — una tabla pública que refleja el estado actual y muestra qué modelos rinden mejor en las tareas de NLU. El uso de conjuntos de prueba ocultos garantiza una comparación justa.
  • Conjunto de diagnóstico — un conjunto especial de 1100 ejemplos, anotados manualmente por expertos para un análisis lingüístico detallado. No afecta a la clasificación, sino que sirve como una herramienta de análisis cualitativo para verificar qué fenómenos lingüísticos (semántica léxica, lógica, sentido común) el modelo es capaz de reconocer y con cuáles tiene dificultades[1].

Resultados e impacto en la industria

En el lanzamiento de GLUE en 2018, los mejores modelos de la época (por ejemplo, BiLSTM con ELMo) alcanzaban una puntuación agregada de alrededor de 70 puntos (en una escala de 0 a 100), lo que era significativamente inferior al nivel humano (alrededor de 87 puntos)[2].

La aparición de GLUE y su tabla de clasificación abierta estimularon un rápido progreso en el campo del aprendizaje por transferencia en NLP.

  • Para mayo de 2019, en menos de un año, una nueva generación de modelos basados en transformadores (principalmente BERT) elevó el listón del estado del arte a 83.9 puntos.
  • En la segunda mitad de 2019, el benchmark GLUE fue efectivamente "superado": los mejores sistemas se acercaron mucho al nivel humano, y en algunas tareas incluso lo sobrepasaron[3].

GLUE jugó un papel crucial como punto de referencia unificado en el desarrollo de modelos de comprensión del lenguaje. Gracias a él, los investigadores pudieron comparar directamente diferentes arquitecturas en un conjunto complejo de tareas, identificar las fortalezas y debilidades de los enfoques, y compartir rápidamente los avances a través de la tabla de clasificación pública.

SuperGLUE: desarrollo posterior

El rápido éxito de GLUE llevó a que, apenas un año después, el mismo grupo de autores, con la participación de colegas de Facebook AI, presentara un nuevo conjunto de pruebas más complejo llamado SuperGLUE[4].

SuperGLUE fue anunciado a finales de 2019 como un conjunto de pruebas "más pegajoso" (stickier), diseñado para volver a crear una brecha entre las capacidades de los modelos modernos y las humanas. Incluía ocho tareas que requerían una comprensión del lenguaje aún más profunda, así como herramientas y reglas mejoradas para los participantes. Aunque GLUE sigue siendo utilizado como una prueba de referencia, el enfoque principal de la mejora competitiva se ha desplazado a SuperGLUE y otros benchmarks más especializados.

Enlaces externos

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Referencias

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]