WinoGrande Benchmark (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — dit is een grootschalige referentiedataset die is ontworpen om het vermogen van kunstmatige-intelligentiesystemen tot redeneren op basis van gezond verstand te evalueren. Het bevat ongeveer 44.000 taken gebaseerd op het formaat van de Winograd Schema Challenge (WSC), maar aanzienlijk uitgebreid en complexer gemaakt met behulp van een adversariale filtermethode om statistische aanwijzingen te elimineren[1].

De dataset werd in 2019 ontwikkeld door een groep onderzoekers van het Allen Institute for AI en de Universiteit van Washington. Elke taak bestaat uit een zin met een leeg veld dat moet worden ingevuld met een van twee opties, waarbij de juiste keuze wordt gemaakt op basis van context en situatiebegrip. WinoGrande is een van de belangrijkste benchmarks geworden op het gebied van natuurlijke taalverwerking (NLP)[2].

Aanleiding voor de ontwikkeling: veroudering van WSC

De oorspronkelijke Winograd Schema Challenge (WSC), voorgesteld in 2011, bevatte slechts 273 taken en werd lange tijd beschouwd als een betrouwbare test voor gezond verstand. De taken waren zo geconstrueerd dat ze begrip van de wereld vereisten, in plaats van eenvoudige woordovereenkomsten[3].

Met de komst van grote taalmodellen op Transformer-architectuur, zoals BERT, veranderde de situatie echter rond 2018–2019. Modellen leerden de test te 'kraken' en bereikten een nauwkeurigheid van ongeveer 90% door gebruik te maken van onbedoelde statistische patronen (artefacten) in de data, in plaats van door werkelijk begrip[4]. WSC was geen betrouwbare indicator meer, wat leidde tot de noodzaak om een nieuwe, complexere en uitgebreidere benchmark te ontwikkelen: WinoGrande.

Ontwikkeling en de adversarial filtering-methode

De ontwikkeling van WinoGrande verliep in twee hoofdfasen: massale generatie van taken en daaropvolgende filtering.

Crowdsourcing

In de eerste fase werd via het platform Amazon Mechanical Turk een grote basis van meer dan 47.000 zinnen verzameld. Crowdwerkers maakten zinsparen op basis van het Winograd-schema, wat zorgde voor linguïstische diversiteit en de 'ruis' die kenmerkend is voor natuurlijke taal, in tegenstelling tot taken die door een kleine groep experts zijn geschreven[1].

Het AfLite-algoritme

De belangrijkste innovatie van WinoGrande was het AfLite-algoritme (Adversarial Filtering Lite). Deze methode werd ontwikkeld om automatisch taken te verwijderen die kunnen worden opgelost met behulp van eenvoudige statistische aanwijzingen, zonder dat gezond verstand nodig is. Het algoritme gebruikte eenvoudige modellen om die voorbeelden te identificeren en te verwijderen waarbij een van de antwoorden te duidelijk was gekoppeld aan andere woorden in de zin. Zo zou de taak "Leeuwen aten zebra's op, omdat zij roofdieren zijn" worden gefilterd, omdat het woord "roofdieren" statistisch sterk geassocieerd wordt met "leeuwen".

Als gevolg van de filtering werd ongeveer 14% van de verzamelde data verwijderd. De definitieve versie van de dataset bevat 43.972 taken, waardoor het een aanzienlijk betrouwbaardere en complexere test vormt[1].

Modelresultaten en voortgang

Bij de release van WinoGrande presteerden de destijds beste modellen aanzienlijk slechter dan mensen.

  • RoBERTa (een verbeterde versie van BERT) bereikte een nauwkeurigheid van ~79%.
  • Mensen lossen taken gemiddeld op met een nauwkeurigheid van ~94%[1].

Dit verschil bevestigde dat de AfLite-filtering veel 'gemakkelijke' routes voor modellen succesvol had geëlimineerd. Met de verdere ontwikkeling van LLM's begon dit verschil echter te slinken.

  • In 2022 bereikte het model ST-MoE-32B een nauwkeurigheid van 96,1%, waarmee het het menselijke niveau overtrof[5].
  • GPT-3 behaalde een resultaat van ongeveer 88%[6].
  • GPT-4 lost taken zonder speciale fine-tuning op met een nauwkeurigheid van ~87,5%[7].

Invloed en kritiek

WinoGrande is een van de belangrijkste benchmarks geworden voor de evaluatie van gezond verstand en wordt regelmatig gebruikt voor het testen van nieuwe modellen. De resultaten worden gepubliceerd in technische rapporten van toonaangevende AI-bedrijven en op platforms voor modelvergelijking[8].

Tegelijkertijd is de methodologie voor het samenstellen van de dataset onderwerp van wetenschappelijke discussie geworden. Sommige onderzoekers wijzen erop dat grootschalige crowdsourcing kan hebben geleid tot onnatuurlijke of dubbelzinnige formuleringen. Er werden ook twijfels geuit over de vraag of de automatische AfLite-filtering in staat is alle verborgen artefacten volledig te elimineren[5]. Desalniettemin heeft WinoGrande niet alleen vooruitgang in meetwaarden gestimuleerd, maar ook een belangrijke discussie op gang gebracht over de ontwikkeling van robuustere en betrouwbaardere evaluatiemethoden voor AI.

Verwijzingen

  • Officiële website van WinoGrande
  • Dataset op het Hugging Face-platform

Literatuur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noten

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]