WinoGrande Benchmark (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — är ett storskaligt referensdataset utformat för att utvärdera AI-systems förmåga till resonemang baserat på sunt förnuft. Det innehåller cirka 44 000 uppgifter baserade på formatet Winograd Schema Challenge (WSC), men väsentligt utökade och försvårade med hjälp av en "adversarial" filtreringsmetod för att eliminera statistiska ledtrådar[1].

Datasetet utvecklades 2019 av en grupp forskare från Allen Institute for AI och University of Washington. Varje uppgift består av en mening med en lucka som ska fyllas i med ett av två alternativ, valt utifrån kontext och situationsförståelse. WinoGrande har blivit ett av de viktigaste benchmarks inom området för naturlig språkbehandling (NLP)[2].

Bakgrund: WSC:s föråldring

Den ursprungliga Winograd Schema Challenge (WSC), som introducerades 2011, innehöll bara 273 uppgifter och ansågs länge vara ett tillförlitligt test för sunt förnuft. Uppgifterna var konstruerade för att kräva världsförståelse snarare än enkel ordmatchning[3].

Men mot 2018–2019, med framväxten av stora språkmodeller baserade på transformer-arkitektur, såsom BERT, förändrades situationen. Modellerna lärde sig att "knäcka" testet och nå en noggrannhet på cirka 90 % genom att utnyttja oavsiktliga statistiska mönster (artefakter) i datan, snarare än genom verklig förståelse[4]. WSC upphörde att vara en tillförlitlig indikator, vilket ledde till behovet av ett nytt, mer komplext och storskaligt benchmark — WinoGrande.

Utveckling och adversarial filtering-metoden

Skapandet av WinoGrande genomfördes i två huvudsakliga steg: massiv generering av uppgifter och efterföljande filtrering.

Crowdsourcing

I det första steget samlades en stor bas med mer än 47 000 meningar in via plattformen Amazon Mechanical Turk. Crowdarbetare skapade meningspar enligt Winograd-schemat, vilket säkerställde lingvistisk mångfald och det "brus" som är typiskt för naturligt tal, till skillnad från uppgifter skrivna av en liten grupp experter[1].

AfLite-algoritmen

Den viktigaste innovationen i WinoGrande var algoritmen AfLite (Adversarial Filtering Lite). Denna metod utvecklades för att automatiskt gallra bort uppgifter som kan lösas med hjälp av enkla statistiska ledtrådar utan att kräva sunt förnuft. Algoritmen använde enkla modeller för att identifiera och ta bort de exempel där ett av svaren var alltför uppenbart kopplat till andra ord i meningen. Till exempel skulle uppgiften "Lejonen åt upp zebrorna eftersom de är rovdjur" ha filtrerats bort, eftersom ordet "rovdjur" statistiskt är starkt associerat med "lejon".

Till följd av filtreringen kasserades cirka 14 % av den insamlade datan. Den slutliga versionen av datasetet innehåller 43 972 uppgifter, vilket gör det till ett betydligt mer tillförlitligt och utmanande test[1].

Modellresultat och framsteg

Vid lanseringen av WinoGrande uppvisade de dåvarande bästa modellerna resultat som låg avsevärt under mänsklig nivå.

  • RoBERTa (en förbättrad version av BERT) uppnådde en noggrannhet på ~79 %.
  • Människor löser i genomsnitt uppgifterna med en noggrannhet på ~94 %[1].

Detta gap bekräftade att AfLite-filtreringen framgångsrikt eliminerat många "enkla" vägar för modellerna. Men i takt med att LLM-modeller utvecklades började detta gap minska.

  • År 2022 uppnådde modellen ST-MoE-32B en noggrannhet på 96,1 %, vilket översteg mänsklig nivå[5].
  • GPT-3 uppvisade ett resultat på cirka 88 %[6].
  • GPT-4 löser, utan särskild fine-tuning, uppgifterna med en noggrannhet på ~87,5 %[7].

Påverkan och kritik

WinoGrande har blivit ett av de viktigaste benchmarks för utvärdering av sunt förnuft och används regelbundet för att testa nya modeller. Dess resultat publiceras i tekniska rapporter från ledande AI-företag och på plattformar för modelljämförelse[8].

Samtidigt har metodiken för att skapa datasetet blivit föremål för vetenskaplig diskussion. Vissa forskare påpekar att storskalig crowdsourcing kan ha lett till uppkomsten av onaturliga eller tvetydiga fraser. Det har också framförts tvivel på huruvida den automatiska AfLite-filtreringen kan eliminera alla dolda artefakter fullständigt[5]. Icke desto mindre har WinoGrande stimulerat inte bara framsteg i mätvärden, utan också en viktig diskussion om utvecklingen av mer robusta och tillförlitliga metoder för AI-utvärdering.

Externa länkar

  • Officiell webbplats för WinoGrande
  • Datasetet på plattformen Hugging Face

Litteratur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noter

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]