WinoGrande Benchmark (PT)
WinoGrande — é um conjunto de dados de referência em grande escala, projetado para avaliar a capacidade de sistemas de inteligência artificial para o raciocínio de senso comum. Ele contém cerca de 44.000 tarefas baseadas no formato do Winograd Schema Challenge (WSC), mas significativamente expandidas e tornadas mais complexas por meio de um método de filtragem “adversarial” para eliminar vieses estatísticos[1].
O dataset foi desenvolvido em 2019 por um grupo de pesquisadores do Allen Institute for AI e da Universidade de Washington. Cada tarefa consiste em uma frase com uma lacuna que deve ser preenchida com uma de duas opções, escolhendo a correta com base no contexto e na compreensão da situação. WinoGrande tornou-se um dos benchmarks fundamentais na área de processamento de linguagem natural (NLP)[2].
Contexto da criação: a obsolescência do WSC
O Winograd Schema Challenge (WSC) original, proposto em 2011, continha apenas 273 tarefas e foi por muito tempo considerado um teste confiável de senso comum. As tarefas foram projetadas para exigir compreensão do mundo, em vez de uma simples correspondência de palavras[3].
No entanto, entre 2018 e 2019, com o surgimento de grandes modelos de linguagem baseados na arquitetura Transformer, como o BERT, a situação mudou. Os modelos aprenderam a “burlar” o teste, alcançando uma precisão de cerca de 90% ao explorar padrões estatísticos não intencionais (artefatos) nos dados, em vez de uma compreensão real[4]. O WSC deixou de ser um indicador confiável, o que levou à necessidade de criar um novo benchmark, mais complexo e em maior escala — o WinoGrande.
Desenvolvimento e o método de filtragem adversarial
A criação do WinoGrande ocorreu em duas etapas principais: a geração em massa de tarefas e sua posterior filtragem.
Crowdsourcing
Na primeira etapa, com o auxílio da plataforma Amazon Mechanical Turk, foi coletada uma grande base de mais de 47.000 frases. Os trabalhadores de crowdsourcing criaram pares de frases seguindo o esquema de Winograd, o que garantiu diversidade linguística e o “ruído” característico da linguagem natural, em contraste com tarefas elaboradas por um pequeno grupo de especialistas[1].
Algoritmo AfLite
A inovação central do WinoGrande foi o algoritmo AfLite (Adversarial Filtering Lite). Este método foi desenvolvido para descartar automaticamente tarefas que poderiam ser resolvidas por meio de pistas estatísticas simples, sem exigir senso comum. O algoritmo utilizou modelos simples para identificar e remover exemplos em que uma das respostas estava associada de forma muito óbvia a outras palavras na frase. Por exemplo, a tarefa “Os leões comeram as zebras porque eles são predadores” seria filtrada, pois a palavra “predadores” está estatisticamente muito associada a “leões”.
Como resultado da filtragem, cerca de 14% dos dados coletados foram descartados. A versão final do dataset inclui 43.972 tarefas, o que o torna um teste significativamente mais confiável e desafiador[1].
Resultados dos modelos e progresso
No lançamento do WinoGrande, os melhores modelos da época apresentaram resultados significativamente inferiores aos dos humanos.
- O RoBERTa (uma versão aprimorada do BERT) alcançou uma precisão de ~79%.
- Um humano, em média, resolve as tarefas com uma precisão de ~94%[1].
Essa diferença confirmou que a filtragem AfLite eliminou com sucesso muitos “atalhos” para os modelos. No entanto, com o desenvolvimento dos LLMs, essa lacuna começou a diminuir.
- Em 2022, o modelo ST-MoE-32B alcançou 96,1% de precisão, superando o nível humano[5].
- O GPT-3 apresentou um resultado de cerca de 88%[6].
- O GPT-4, sem ajuste fino específico, resolve as tarefas com uma precisão de ~87,5%[7].
Impacto e críticas
O WinoGrande tornou-se um dos benchmarks mais importantes para a avaliação do senso comum e é usado regularmente para testar novos modelos. Seus resultados são publicados nos relatórios técnicos das principais empresas de IA e em plataformas de comparação de modelos[8].
Ao mesmo tempo, a metodologia de criação do dataset tornou-se objeto de debate científico. Alguns pesquisadores apontam que o crowdsourcing em massa pode ter levado à criação de frases pouco naturais ou ambíguas. Também foram levantadas dúvidas sobre se a filtragem automática do AfLite é capaz de eliminar completamente todos os artefatos ocultos[5]. No entanto, o WinoGrande estimulou não apenas o progresso nas métricas, mas também uma importante discussão sobre o desenvolvimento de métodos mais robustos e confiáveis para a avaliação de IA.
Ligações externas
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Notas
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. “WinoGrande: An Adversarial Winograd Schema Challenge at Scale”. arXiv:1907.10641. [1]
- ↑ “allenai/winogrande”. Hugging Face. [2]
- ↑ “Winograd schema challenge”. In Wikipedia. [3]
- ↑ Kocijan, V. et al. “The defeat of the Winograd Schema Challenge”. Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. “AI Has Been Surprising for Years”. Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. “Language Models are Few-Shot Learners”. arXiv:2005.14165. [6]
- ↑ OpenAI. “GPT-4 Technical Report”. arXiv:2303.08774. [7]
- ↑ “Common Sense Reasoning On Winogrande”. HyperAI. [8]