---
title: "HellaSwag Benchmark (ES)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 2836
wiki_created_at: 2026-09-06T23:11:44Z
wiki_modified_at: 2026-09-06T23:11:44Z
downloaded_at: 2026-09-07T22:53:38Z
---

# HellaSwag Benchmark (ES)

**HellaSwag** es un conjunto de datos de referencia (benchmark) presentado en 2019 para evaluar la capacidad de los modelos de inteligencia artificial para el razonamiento de sentido común (*commonsense reasoning*) en lenguaje natural<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_paper-1)</sup>. El benchmark fue desarrollado por un grupo de investigadores de la Universidad de Washington y el Instituto Allen para la Inteligencia Artificial.

La tarea de HellaSwag consiste en seleccionar la conclusión más plausible para un contexto de texto dado. La característica clave del conjunto de datos es que es trivial para los humanos, pero resulta desafiante incluso para los avanzados modelos de lenguaje, que se basan en patrones estadísticos superficiales<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.

## Historia y antecedentes

HellaSwag es una evolución de las ideas del conjunto de datos **SWAG** (*Situations With Adversarial Generations*), propuesto por el mismo grupo de autores en 2018. En la tarea SWAG, los modelos debían elegir la continuación más probable para la descripción de una situación simple. Inicialmente, SWAG era difícil para los algoritmos, pero con la llegada del modelo BERT, sus resultados en SWAG alcanzaron un nivel de **~86%**, casi igualando el rendimiento humano<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.

Este éxito generó dudas: ¿realmente BERT «comprende» el texto, o simplemente aprendió a reconocer artefactos estadísticos y patrones presentes en el conjunto de datos? Los autores de HellaSwag plantearon la hipótesis de que el alto rendimiento de BERT no se debía a una verdadera comprensión, sino a un sobreajuste a las especificidades del conjunto de datos. Demostraron que una mínima alteración en la distribución de los datos provocaba una caída drástica en la precisión de BERT. Esto significaba que para una evaluación objetiva del progreso en el NLP, se necesitaba un nuevo benchmark, más complejo y «engañoso»<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.

## Descripción y objetivos del conjunto de datos

HellaSwag fue creado como una prueba diseñada para revelar las limitaciones de los modelos modernos en la comprensión de relaciones causa-efecto y escenarios cotidianos.

### Estructura de la tarea

Cada ejemplo en HellaSwag consta de dos partes:

1.  **Contexto**: Un párrafo corto (de hasta tres oraciones) que describe el inicio de una situación.
2.  **Cuatro opciones de finalización**: Cuatro posibles continuaciones de la historia, también compuestas por varias oraciones.

Solo una de estas finalizaciones es la correcta (la real), mientras que las otras tres son falsas, generadas específicamente para confundir al modelo.

### Fuentes de datos

Los ejemplos de situaciones se tomaron de dos fuentes que cubren una amplia gama de escenarios cotidianos:

- **ActivityNet Captions**: Descripciones de acciones de videoclips (por ejemplo, «una persona abre un frasco de pepinillos»).
- **WikiHow**: Instrucciones de artículos (por ejemplo, «cómo cambiar una llanta de un automóvil»).

El objetivo de HellaSwag es crear un benchmark que sea fácil de resolver para los humanos (de forma intuitiva), pero que dificulte al máximo la tarea para los modelos que carecen de un sentido común completo. Los autores denominaron este efecto el «efecto Ricitos de Oro» (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_paper-1)</sup>.

## Método de Adversarial Filtering (AF)

La innovación clave en la creación de HellaSwag fue el método **Adversarial Filtering** (**AF**), una selección iterativa de «trampas» diseñadas para un modelo «víctima» específico. Este método permitió crear opciones falsas que son engañosamente similares a las correctas desde la perspectiva de los modelos estadísticos.

El esquema de funcionamiento de AF es el siguiente:

1.  **Generación**. A partir del contexto inicial, un modelo de lenguaje generador (por ejemplo, GPT) crea múltiples finales incorrectos potenciales.
2.  **Discriminación**. Un modelo clasificador (por ejemplo, BERT), que actúa como «víctima», intenta distinguir las continuaciones generadas de la real (correcta).
3.  **Selección**. Se seleccionan aquellas opciones falsas que el clasificador consideró más plausibles, es decir, aquellas en las que era más probable que se equivocara.
4.  **Iteración**. El proceso se repite varias veces hasta que las respuestas falsas se vuelven lo más parecidas posible a la correcta para el algoritmo.
5.  **Verificación humana**. En la etapa final, los conjuntos resultantes (contexto + 1 final correcto + 3 mejores finales falsos) son evaluados por humanos. Los evaluadores confirman que la opción correcta es inequívocamente la más natural, mientras que todas las alternativas contienen alguna incoherencia perceptible para una persona<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.

Gracias a AF, cada ejemplo en HellaSwag está diseñado desde el principio para inducir a error al modelo, pero permaneciendo transparente para un ser humano.

## Resultados e importancia

HellaSwag se convirtió en una prueba rigurosa para los modelos de comprensión de texto. Los resultados de las pruebas mostraron una enorme brecha entre la inteligencia artificial y la humana:

- Los **humanos** resuelven las tareas de HellaSwag casi sin errores, con una precisión de alrededor del **95-96%**<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.
- El mejor modelo en el momento de su creación, **BERT-Large**, alcanzó solo un **~47%** de precisión. Métodos más simples mostraron resultados apenas por encima del azar (25%)<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_arxiv-2)</sup>.

La brecha de más de **45 puntos porcentuales** confirmó la hipótesis de que los altos puntajes en pruebas anteriores no significaban una comprensión real. HellaSwag demostró que, incluso después de entrenar con enormes volúmenes de datos, los modelos no pueden desarrollar un sentido común general para situaciones nuevas.

En los años siguientes, HellaSwag se consolidó como una de las pruebas estándar para los nuevos modelos de lenguaje. El progreso de los sistemas de IA podía seguirse a través de sus resultados en este benchmark.

- En 2020, el modelo GPT-3 (175 mil millones de parámetros) mostró una precisión de **~79%** en modo *few-shot*, superando el nivel de muchos modelos especializados de la época, pero aún significativamente por debajo del rendimiento humano<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-gpt3_paper-3)</sup>.
- No fue hasta 2023 que los modelos de nueva generación, como GPT-4, lograron alcanzar en HellaSwag un resultado comparable al humano (alrededor del **95%** de precisión)<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_note-hellaswag_official_site-4)</sup>.

La creación de HellaSwag marcó un nuevo enfoque para evaluar el progreso en el NLP, basado en la idea de **benchmarks evolutivos**: a medida que los modelos mejoran, es necesario crear nuevas pruebas más complejas que revelen sus puntos débiles.

## Enlaces externos

- <a href="https://rowanzellers.com/hellaswag/" class="external text" rel="nofollow">Sitio web oficial del proyecto HellaSwag</a>
- <a href="https://aclanthology.org/P19-1472/" class="external text" rel="nofollow">Artículo científico «HellaSwag: Can a Machine Really Finish Your Sentence?»</a>

## Bibliografía

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Referencias

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(ES)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
