WinoGrande Benchmark (FR)
WinoGrande est un jeu de données de référence à grande échelle, conçu pour évaluer la capacité des systèmes d'intelligence artificielle au raisonnement de sens commun. Il contient environ 44 000 problèmes basés sur le format du Winograd Schema Challenge (WSC), mais considérablement étendus et complexifiés à l'aide d'une méthode de filtrage contradictoire (« adversarial filtering ») pour éliminer les indices statistiques[1].
Le jeu de données a été développé en 2019 par une équipe de chercheurs de l' Allen Institute for AI et de l' Université de Washington. Chaque problème se présente sous la forme d'une phrase avec un blanc à remplir avec l'une des deux options proposées, en choisissant la bonne en fonction du contexte et de la compréhension de la situation. WinoGrande est devenu l'un des benchmarks clés dans le domaine du traitement du langage naturel (NLP)[2].
Contexte de la création : l'obsolescence du WSC
Le Winograd Schema Challenge (WSC) original, proposé en 2011, ne contenait que 273 problèmes et a longtemps été considéré comme un test fiable du raisonnement de sens commun. Les problèmes y étaient conçus pour exiger une compréhension du monde, et non une simple mise en correspondance de mots[3].
Cependant, vers 2018-2019, avec l'émergence de grands modèles de langage basés sur l'architecture Transformer, tels que BERT, la situation a changé. Les modèles ont appris à « déjouer » le test, atteignant une précision d'environ 90 % en exploitant des régularités statistiques involontaires (artefacts) dans les données, plutôt que par une réelle compréhension[4]. Le WSC n'était plus un indicateur fiable, ce qui a conduit à la nécessité de créer un nouveau benchmark plus complexe et à plus grande échelle : WinoGrande.
Développement et méthode du filtrage contradictoire (adversarial filtering)
La création de WinoGrande s'est déroulée en deux étapes principales : la génération massive de problèmes et leur filtrage ultérieur.
Crowdsourcing
Dans un premier temps, une vaste base de plus de 47 000 phrases a été collectée via la plateforme Amazon Mechanical Turk. Les travailleurs du crowdsourcing ont créé des paires de phrases selon le schéma de Winograd, ce qui a garanti une diversité linguistique et un « bruit » caractéristique du langage naturel, contrairement aux problèmes rédigés par un petit groupe d'experts[1].
Algorithme AfLite
L'innovation clé de WinoGrande a été l'algorithme AfLite (Adversarial Filtering Lite). Cette méthode a été conçue pour écarter automatiquement les problèmes pouvant être résolus à l'aide de simples indices statistiques, sans nécessiter de raisonnement de sens commun. L'algorithme utilisait des modèles simples pour identifier et supprimer les exemples où l'une des réponses était trop manifestement liée à d'autres mots de la phrase. Par exemple, le problème « Les lions ont mangé les zèbres parce qu'ils sont des prédateurs » serait filtré, car le mot « prédateurs » est statistiquement fortement associé à « lions ».
À la suite de ce filtrage, environ 14 % des données collectées ont été rejetées. La version finale du jeu de données comprend 43 972 problèmes, ce qui en fait un test nettement plus fiable et difficile[1].
Résultats des modèles et progrès
Lors de la publication de WinoGrande, les meilleurs modèles de l'époque ont montré des résultats nettement inférieurs à ceux des humains.
- RoBERTa (une version améliorée de BERT) a atteint une précision de ~79 %.
- L' humain résout en moyenne les problèmes avec une précision de ~94 %[1].
Cet écart a confirmé que le filtrage AfLite avait réussi à éliminer de nombreuses voies « faciles » pour les modèles. Cependant, avec le développement des LLM, cet écart a commencé à se réduire.
- En 2022, le modèle ST-MoE-32B a atteint une précision de 96,1 %, dépassant le niveau humain[5].
- GPT-3 a obtenu un score d'environ 88 %[6].
- GPT-4, sans fine-tuning spécifique, résout les problèmes avec une précision de ~87,5 %[7].
Impact et critiques
WinoGrande est devenu l'un des benchmarks clés pour l'évaluation du raisonnement de sens commun et est régulièrement utilisé pour tester de nouveaux modèles. Ses résultats sont publiés dans les rapports techniques des principales entreprises d'IA et sur les plateformes de comparaison de modèles[8].
Parallèlement, la méthodologie de création du jeu de données a fait l'objet de débats scientifiques. Certains chercheurs soulignent que le crowdsourcing de masse a pu conduire à l'apparition de phrases non naturelles ou ambiguës. Des doutes ont également été émis quant à la capacité du filtrage automatique AfLite à éliminer complètement tous les artefacts cachés[5]. Néanmoins, WinoGrande a stimulé non seulement les progrès en matière de métriques, mais aussi une discussion importante sur la création de méthodes d'évaluation de l'IA plus robustes et fiables.
Liens externes
Bibliographie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Références
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]