---
title: "WinoGrande Benchmark (PT)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 8487
wiki_created_at: 2026-09-07T01:18:07Z
wiki_modified_at: 2026-09-07T01:18:07Z
downloaded_at: 2026-09-07T23:25:39Z
---

# WinoGrande Benchmark (PT)

**WinoGrande** — é um conjunto de dados de referência em grande escala, projetado para avaliar a capacidade de sistemas de inteligência artificial para o raciocínio de senso comum. Ele contém cerca de 44.000 tarefas baseadas no formato do Winograd Schema Challenge (WSC), mas significativamente expandidas e tornadas mais complexas por meio de um método de filtragem “adversarial” para eliminar vieses estatísticos<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-sakaguchi2019-1)</sup>.

O dataset foi desenvolvido em 2019 por um grupo de pesquisadores do **Allen Institute for AI** e da **Universidade de Washington**. Cada tarefa consiste em uma frase com uma lacuna que deve ser preenchida com uma de duas opções, escolhendo a correta com base no contexto e na compreensão da situação. WinoGrande tornou-se um dos benchmarks fundamentais na área de processamento de linguagem natural (NLP)<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-huggingface-2)</sup>.

## Contexto da criação: a obsolescência do WSC

O **Winograd Schema Challenge** (WSC) original, proposto em 2011, continha apenas 273 tarefas e foi por muito tempo considerado um teste confiável de senso comum. As tarefas foram projetadas para exigir compreensão do mundo, em vez de uma simples correspondência de palavras<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-wsc_wiki-3)</sup>.

No entanto, entre 2018 e 2019, com o surgimento de grandes modelos de linguagem baseados na arquitetura Transformer, como o **BERT**, a situação mudou. Os modelos aprenderam a “burlar” o teste, alcançando uma precisão de cerca de 90% ao explorar padrões estatísticos não intencionais (artefatos) nos dados, em vez de uma compreensão real<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-kocijan2023-4)</sup>. O WSC deixou de ser um indicador confiável, o que levou à necessidade de criar um novo benchmark, mais complexo e em maior escala — o WinoGrande.

## Desenvolvimento e o método de filtragem adversarial

A criação do WinoGrande ocorreu em duas etapas principais: a geração em massa de tarefas e sua posterior filtragem.

### Crowdsourcing

Na primeira etapa, com o auxílio da plataforma **Amazon Mechanical Turk**, foi coletada uma grande base de mais de 47.000 frases. Os trabalhadores de crowdsourcing criaram pares de frases seguindo o esquema de Winograd, o que garantiu diversidade linguística e o “ruído” característico da linguagem natural, em contraste com tarefas elaboradas por um pequeno grupo de especialistas<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-sakaguchi2019-1)</sup>.

### Algoritmo AfLite

A inovação central do WinoGrande foi o algoritmo **AfLite** (**Adversarial Filtering Lite**). Este método foi desenvolvido para descartar automaticamente tarefas que poderiam ser resolvidas por meio de pistas estatísticas simples, sem exigir senso comum. O algoritmo utilizou modelos simples para identificar e remover exemplos em que uma das respostas estava associada de forma muito óbvia a outras palavras na frase. *Por exemplo, a tarefa “Os leões comeram as zebras porque eles são **predadores**” seria filtrada, pois a palavra “predadores” está estatisticamente muito associada a “leões”.*

Como resultado da filtragem, cerca de 14% dos dados coletados foram descartados. A versão final do dataset inclui **43.972 tarefas**, o que o torna um teste significativamente mais confiável e desafiador<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-sakaguchi2019-1)</sup>.

## Resultados dos modelos e progresso

No lançamento do WinoGrande, os melhores modelos da época apresentaram resultados significativamente inferiores aos dos humanos.

- O **RoBERTa** (uma versão aprimorada do BERT) alcançou uma precisão de **~79%**.
- Um **humano**, em média, resolve as tarefas com uma precisão de **~94%**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-sakaguchi2019-1)</sup>.

Essa diferença confirmou que a filtragem AfLite eliminou com sucesso muitos “atalhos” para os modelos. No entanto, com o desenvolvimento dos LLMs, essa lacuna começou a diminuir.

- Em 2022, o modelo **ST-MoE-32B** alcançou **96,1%** de precisão, superando o nível humano<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-lepore2025-5)</sup>.
- O **GPT-3** apresentou um resultado de cerca de **88%**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-brown2020-6)</sup>.
- O **GPT-4**, sem ajuste fino específico, resolve as tarefas com uma precisão de **~87,5%**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-openai2023-7)</sup>.

## Impacto e críticas

O WinoGrande tornou-se um dos benchmarks mais importantes para a avaliação do senso comum e é usado regularmente para testar novos modelos. Seus resultados são publicados nos relatórios técnicos das principais empresas de IA e em plataformas de comparação de modelos<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-hyper_ai-8)</sup>.

Ao mesmo tempo, a metodologia de criação do dataset tornou-se objeto de debate científico. Alguns pesquisadores apontam que o crowdsourcing em massa pode ter levado à criação de frases pouco naturais ou ambíguas. Também foram levantadas dúvidas sobre se a filtragem automática do AfLite é capaz de eliminar completamente todos os artefatos ocultos<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_note-lepore2025-5)</sup>. No entanto, o WinoGrande estimulou não apenas o progresso nas métricas, mas também uma importante discussão sobre o desenvolvimento de métodos mais robustos e confiáveis para a avaliação de IA.

## Ligações externas

- <a href="https://winogrande.allenai.org/" class="external text" rel="nofollow">Site oficial do WinoGrande</a>
- <a href="https://huggingface.co/datasets/allenai/winogrande" class="external text" rel="nofollow">Dataset na plataforma Hugging Face</a>

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Notas

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. “WinoGrande: An Adversarial Winograd Schema Challenge at Scale”. *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-huggingface_2-0) “allenai/winogrande”. *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-wsc_wiki_3-0) “Winograd schema challenge”. In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. “The defeat of the Winograd Schema Challenge”. *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-lepore2025_5-1)</sup> Lepore, J. “AI Has Been Surprising for Years”. *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-brown2020_6-0) Brown, T. et al. “Language Models are Few-Shot Learners”. *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-openai2023_7-0) OpenAI. “GPT-4 Technical Report”. *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(PT)#cite_ref-hyper_ai_8-0) “Common Sense Reasoning On Winogrande”. *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
