---
title: "WinoGrande Benchmark (ES)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 8476
wiki_created_at: 2026-09-07T01:17:56Z
wiki_modified_at: 2026-09-07T01:17:56Z
downloaded_at: 2026-09-07T23:25:34Z
---

# WinoGrande Benchmark (ES)

**WinoGrande** es un conjunto de datos de referencia a gran escala diseñado para evaluar la capacidad de los sistemas de inteligencia artificial para el razonamiento de sentido común. Contiene alrededor de 44 000 problemas basados en el formato del Winograd Schema Challenge (WSC), pero significativamente ampliados y complejizados mediante un método de filtrado "adversarial" para eliminar pistas estadísticas<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-sakaguchi2019-1)</sup>.

El conjunto de datos fue desarrollado en 2019 por un grupo de investigadores del **Allen Institute for AI** y la **Universidad de Washington**. Cada problema consiste en una oración con un espacio en blanco que debe ser completado con una de dos opciones, eligiendo la correcta basándose en el contexto y la comprensión de la situación. WinoGrande se ha convertido en uno de los benchmarks clave en el campo del procesamiento del lenguaje natural (PLN)<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-huggingface-2)</sup>.

## Antecedentes: la obsolescencia del WSC

El **Winograd Schema Challenge** (WSC) original, propuesto en 2011, contenía solo 273 problemas y durante mucho tiempo fue considerado una prueba fiable para el sentido común. Sus problemas estaban diseñados para requerir una comprensión del mundo, en lugar de una simple coincidencia de palabras<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-wsc_wiki-3)</sup>.

Sin embargo, para 2018-2019, con la aparición de los grandes modelos de lenguaje basados en la arquitectura Transformer, como **BERT**, la situación cambió. Los modelos aprendieron a "superar" la prueba, alcanzando una precisión de alrededor del 90% al explotar patrones estadísticos no intencionados (artefactos) en los datos, en lugar de una comprensión real<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-kocijan2023-4)</sup>. El WSC dejó de ser un indicador fiable, lo que llevó a la necesidad de crear un nuevo benchmark más complejo y a gran escala: WinoGrande.

## Desarrollo y método de filtrado adversarial

La creación de WinoGrande se llevó a cabo en dos etapas principales: la generación masiva de problemas y su posterior filtrado.

### Crowdsourcing

En la primera etapa, utilizando la plataforma **Amazon Mechanical Turk**, se recopiló una gran base de datos de más de 47 000 oraciones. Los trabajadores de la plataforma crearon pares de oraciones siguiendo el esquema de Winograd, lo que aseguró la diversidad lingüística y el "ruido" característico del lenguaje natural, a diferencia de los problemas redactados por un pequeño grupo de expertos<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-sakaguchi2019-1)</sup>.

### Algoritmo AfLite

La innovación clave de WinoGrande fue el algoritmo **AfLite** (**Adversarial Filtering Lite**). Este método fue diseñado para descartar automáticamente problemas que pueden resolverse mediante simples pistas estadísticas, sin requerir razonamiento de sentido común. El algoritmo utilizaba modelos simples para identificar y eliminar aquellos ejemplos en los que una de las respuestas estaba demasiado asociada de forma evidente con otras palabras de la oración. *Por ejemplo, el problema «Los leones se comieron a las cebras porque son **depredadores**» sería filtrado, ya que la palabra «depredadores» está estadísticamente muy asociada con «leones».*

Como resultado del filtrado, se descartó aproximadamente el 14% de los datos recopilados. La versión final del conjunto de datos incluye **43 972 problemas**, lo que lo convierte en una prueba significativamente más fiable y desafiante<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-sakaguchi2019-1)</sup>.

## Resultados de los modelos y progreso

En el momento del lanzamiento de WinoGrande, los mejores modelos de la época mostraron resultados significativamente inferiores a los humanos.

- **RoBERTa** (una versión mejorada de BERT) alcanzó una precisión de **~79%**.
- El **ser humano**, en promedio, resuelve los problemas con una precisión de **~94%**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-sakaguchi2019-1)</sup>.

Esta brecha confirmó que el filtrado AfLite eliminó con éxito muchos de los atajos "fáciles" para los modelos. Sin embargo, con el desarrollo de los [LLM](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje"), esta brecha comenzó a reducirse.

- Para 2022, el modelo **ST-MoE-32B** alcanzó una precisión del **96,1%**, superando el nivel humano<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-lepore2025-5)</sup>.
- **GPT-3** mostró un resultado de alrededor del **88%**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-brown2020-6)</sup>.
- **GPT-4**, sin un ajuste fino específico, resuelve los problemas con una precisión de **~87,5%**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-openai2023-7)</sup>.

## Impacto y críticas

WinoGrande se ha convertido en uno de los benchmarks clave para evaluar el sentido común y se utiliza regularmente para probar nuevos modelos. Sus resultados se publican en los informes técnicos de las principales compañías de IA y en plataformas de comparación de modelos<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-hyper_ai-8)</sup>.

Al mismo tiempo, la metodología de creación del conjunto de datos se ha convertido en objeto de debate científico. Algunos investigadores señalan que el crowdsourcing masivo podría haber llevado a la aparición de frases poco naturales o ambiguas. También se han expresado dudas sobre si el filtrado automático de AfLite es capaz de eliminar por completo todos los artefactos ocultos<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_note-lepore2025-5)</sup>. No obstante, WinoGrande ha estimulado no solo el progreso en las métricas, sino también una importante discusión sobre la creación de métodos de evaluación de la IA más robustos y fiables.

## Enlaces externos

- <a href="https://winogrande.allenai.org/" class="external text" rel="nofollow">Sitio web oficial de WinoGrande</a>
- <a href="https://huggingface.co/datasets/allenai/winogrande" class="external text" rel="nofollow">Conjunto de datos en la plataforma Hugging Face</a>

## Bibliografía

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Referencias

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-huggingface_2-0) "allenai/winogrande". *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-wsc_wiki_3-0) "Winograd schema challenge". En *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(ES)#cite_ref-hyper_ai_8-0) "Common Sense Reasoning On Winogrande". *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
