WinoGrande Benchmark (PT)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — é um conjunto de dados de referência em grande escala, projetado para avaliar a capacidade de sistemas de inteligência artificial para o raciocínio de senso comum. Ele contém cerca de 44.000 tarefas baseadas no formato do Winograd Schema Challenge (WSC), mas significativamente expandidas e tornadas mais complexas por meio de um método de filtragem “adversarial” para eliminar vieses estatísticos[1].

O dataset foi desenvolvido em 2019 por um grupo de pesquisadores do Allen Institute for AI e da Universidade de Washington. Cada tarefa consiste em uma frase com uma lacuna que deve ser preenchida com uma de duas opções, escolhendo a correta com base no contexto e na compreensão da situação. WinoGrande tornou-se um dos benchmarks fundamentais na área de processamento de linguagem natural (NLP)[2].

Contexto da criação: a obsolescência do WSC

O Winograd Schema Challenge (WSC) original, proposto em 2011, continha apenas 273 tarefas e foi por muito tempo considerado um teste confiável de senso comum. As tarefas foram projetadas para exigir compreensão do mundo, em vez de uma simples correspondência de palavras[3].

No entanto, entre 2018 e 2019, com o surgimento de grandes modelos de linguagem baseados na arquitetura Transformer, como o BERT, a situação mudou. Os modelos aprenderam a “burlar” o teste, alcançando uma precisão de cerca de 90% ao explorar padrões estatísticos não intencionais (artefatos) nos dados, em vez de uma compreensão real[4]. O WSC deixou de ser um indicador confiável, o que levou à necessidade de criar um novo benchmark, mais complexo e em maior escala — o WinoGrande.

Desenvolvimento e o método de filtragem adversarial

A criação do WinoGrande ocorreu em duas etapas principais: a geração em massa de tarefas e sua posterior filtragem.

Crowdsourcing

Na primeira etapa, com o auxílio da plataforma Amazon Mechanical Turk, foi coletada uma grande base de mais de 47.000 frases. Os trabalhadores de crowdsourcing criaram pares de frases seguindo o esquema de Winograd, o que garantiu diversidade linguística e o “ruído” característico da linguagem natural, em contraste com tarefas elaboradas por um pequeno grupo de especialistas[1].

Algoritmo AfLite

A inovação central do WinoGrande foi o algoritmo AfLite (Adversarial Filtering Lite). Este método foi desenvolvido para descartar automaticamente tarefas que poderiam ser resolvidas por meio de pistas estatísticas simples, sem exigir senso comum. O algoritmo utilizou modelos simples para identificar e remover exemplos em que uma das respostas estava associada de forma muito óbvia a outras palavras na frase. Por exemplo, a tarefa “Os leões comeram as zebras porque eles são predadores” seria filtrada, pois a palavra “predadores” está estatisticamente muito associada a “leões”.

Como resultado da filtragem, cerca de 14% dos dados coletados foram descartados. A versão final do dataset inclui 43.972 tarefas, o que o torna um teste significativamente mais confiável e desafiador[1].

Resultados dos modelos e progresso

No lançamento do WinoGrande, os melhores modelos da época apresentaram resultados significativamente inferiores aos dos humanos.

  • O RoBERTa (uma versão aprimorada do BERT) alcançou uma precisão de ~79%.
  • Um humano, em média, resolve as tarefas com uma precisão de ~94%[1].

Essa diferença confirmou que a filtragem AfLite eliminou com sucesso muitos “atalhos” para os modelos. No entanto, com o desenvolvimento dos LLMs, essa lacuna começou a diminuir.

  • Em 2022, o modelo ST-MoE-32B alcançou 96,1% de precisão, superando o nível humano[5].
  • O GPT-3 apresentou um resultado de cerca de 88%[6].
  • O GPT-4, sem ajuste fino específico, resolve as tarefas com uma precisão de ~87,5%[7].

Impacto e críticas

O WinoGrande tornou-se um dos benchmarks mais importantes para a avaliação do senso comum e é usado regularmente para testar novos modelos. Seus resultados são publicados nos relatórios técnicos das principais empresas de IA e em plataformas de comparação de modelos[8].

Ao mesmo tempo, a metodologia de criação do dataset tornou-se objeto de debate científico. Alguns pesquisadores apontam que o crowdsourcing em massa pode ter levado à criação de frases pouco naturais ou ambíguas. Também foram levantadas dúvidas sobre se a filtragem automática do AfLite é capaz de eliminar completamente todos os artefatos ocultos[5]. No entanto, o WinoGrande estimulou não apenas o progresso nas métricas, mas também uma importante discussão sobre o desenvolvimento de métodos mais robustos e confiáveis para a avaliação de IA.

Ligações externas

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Notas

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. “WinoGrande: An Adversarial Winograd Schema Challenge at Scale”. arXiv:1907.10641. [1]
  2. “allenai/winogrande”. Hugging Face. [2]
  3. “Winograd schema challenge”. In Wikipedia. [3]
  4. Kocijan, V. et al. “The defeat of the Winograd Schema Challenge”. Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. “AI Has Been Surprising for Years”. Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. “Language Models are Few-Shot Learners”. arXiv:2005.14165. [6]
  7. OpenAI. “GPT-4 Technical Report”. arXiv:2303.08774. [7]
  8. “Common Sense Reasoning On Winogrande”. HyperAI. [8]