HellaSwag Benchmark (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

HellaSwag es un conjunto de datos de referencia (benchmark) presentado en 2019 para evaluar la capacidad de los modelos de inteligencia artificial para el razonamiento de sentido común (commonsense reasoning) en lenguaje natural[1]. El benchmark fue desarrollado por un grupo de investigadores de la Universidad de Washington y el Instituto Allen para la Inteligencia Artificial.

La tarea de HellaSwag consiste en seleccionar la conclusión más plausible para un contexto de texto dado. La característica clave del conjunto de datos es que es trivial para los humanos, pero resulta desafiante incluso para los avanzados modelos de lenguaje, que se basan en patrones estadísticos superficiales[2].

Historia y antecedentes

HellaSwag es una evolución de las ideas del conjunto de datos SWAG (Situations With Adversarial Generations), propuesto por el mismo grupo de autores en 2018. En la tarea SWAG, los modelos debían elegir la continuación más probable para la descripción de una situación simple. Inicialmente, SWAG era difícil para los algoritmos, pero con la llegada del modelo BERT, sus resultados en SWAG alcanzaron un nivel de ~86%, casi igualando el rendimiento humano[2].

Este éxito generó dudas: ¿realmente BERT «comprende» el texto, o simplemente aprendió a reconocer artefactos estadísticos y patrones presentes en el conjunto de datos? Los autores de HellaSwag plantearon la hipótesis de que el alto rendimiento de BERT no se debía a una verdadera comprensión, sino a un sobreajuste a las especificidades del conjunto de datos. Demostraron que una mínima alteración en la distribución de los datos provocaba una caída drástica en la precisión de BERT. Esto significaba que para una evaluación objetiva del progreso en el NLP, se necesitaba un nuevo benchmark, más complejo y «engañoso»[2].

Descripción y objetivos del conjunto de datos

HellaSwag fue creado como una prueba diseñada para revelar las limitaciones de los modelos modernos en la comprensión de relaciones causa-efecto y escenarios cotidianos.

Estructura de la tarea

Cada ejemplo en HellaSwag consta de dos partes:

  1. Contexto: Un párrafo corto (de hasta tres oraciones) que describe el inicio de una situación.
  2. Cuatro opciones de finalización: Cuatro posibles continuaciones de la historia, también compuestas por varias oraciones.

Solo una de estas finalizaciones es la correcta (la real), mientras que las otras tres son falsas, generadas específicamente para confundir al modelo.

Fuentes de datos

Los ejemplos de situaciones se tomaron de dos fuentes que cubren una amplia gama de escenarios cotidianos:

  • ActivityNet Captions: Descripciones de acciones de videoclips (por ejemplo, «una persona abre un frasco de pepinillos»).
  • WikiHow: Instrucciones de artículos (por ejemplo, «cómo cambiar una llanta de un automóvil»).

El objetivo de HellaSwag es crear un benchmark que sea fácil de resolver para los humanos (de forma intuitiva), pero que dificulte al máximo la tarea para los modelos que carecen de un sentido común completo. Los autores denominaron este efecto el «efecto Ricitos de Oro» (Goldilocks effect)[1].

Método de Adversarial Filtering (AF)

La innovación clave en la creación de HellaSwag fue el método Adversarial Filtering (AF), una selección iterativa de «trampas» diseñadas para un modelo «víctima» específico. Este método permitió crear opciones falsas que son engañosamente similares a las correctas desde la perspectiva de los modelos estadísticos.

El esquema de funcionamiento de AF es el siguiente:

  1. Generación. A partir del contexto inicial, un modelo de lenguaje generador (por ejemplo, GPT) crea múltiples finales incorrectos potenciales.
  2. Discriminación. Un modelo clasificador (por ejemplo, BERT), que actúa como «víctima», intenta distinguir las continuaciones generadas de la real (correcta).
  3. Selección. Se seleccionan aquellas opciones falsas que el clasificador consideró más plausibles, es decir, aquellas en las que era más probable que se equivocara.
  4. Iteración. El proceso se repite varias veces hasta que las respuestas falsas se vuelven lo más parecidas posible a la correcta para el algoritmo.
  5. Verificación humana. En la etapa final, los conjuntos resultantes (contexto + 1 final correcto + 3 mejores finales falsos) son evaluados por humanos. Los evaluadores confirman que la opción correcta es inequívocamente la más natural, mientras que todas las alternativas contienen alguna incoherencia perceptible para una persona[2].

Gracias a AF, cada ejemplo en HellaSwag está diseñado desde el principio para inducir a error al modelo, pero permaneciendo transparente para un ser humano.

Resultados e importancia

HellaSwag se convirtió en una prueba rigurosa para los modelos de comprensión de texto. Los resultados de las pruebas mostraron una enorme brecha entre la inteligencia artificial y la humana:

  • Los humanos resuelven las tareas de HellaSwag casi sin errores, con una precisión de alrededor del 95-96%[2].
  • El mejor modelo en el momento de su creación, BERT-Large, alcanzó solo un ~47% de precisión. Métodos más simples mostraron resultados apenas por encima del azar (25%)[2].

La brecha de más de 45 puntos porcentuales confirmó la hipótesis de que los altos puntajes en pruebas anteriores no significaban una comprensión real. HellaSwag demostró que, incluso después de entrenar con enormes volúmenes de datos, los modelos no pueden desarrollar un sentido común general para situaciones nuevas.

En los años siguientes, HellaSwag se consolidó como una de las pruebas estándar para los nuevos modelos de lenguaje. El progreso de los sistemas de IA podía seguirse a través de sus resultados en este benchmark.

  • En 2020, el modelo GPT-3 (175 mil millones de parámetros) mostró una precisión de ~79% en modo few-shot, superando el nivel de muchos modelos especializados de la época, pero aún significativamente por debajo del rendimiento humano[3].
  • No fue hasta 2023 que los modelos de nueva generación, como GPT-4, lograron alcanzar en HellaSwag un resultado comparable al humano (alrededor del 95% de precisión)[4].

La creación de HellaSwag marcó un nuevo enfoque para evaluar el progreso en el NLP, basado en la idea de benchmarks evolutivos: a medida que los modelos mejoran, es necesario crear nuevas pruebas más complejas que revelen sus puntos débiles.

Enlaces externos

Bibliografía

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Referencias

  1. 1.0 1.1 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv:1905.07830, 2019. [2]
  3. Brown, T. B. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165, 2020. [3]
  4. Zellers, R. et al. «HellaSwag Project Page». [4]