WinoGrande Benchmark (PL)
WinoGrande — to wielkoskalowy zestaw danych służący do oceny zdolności systemów sztucznej inteligencji do rozumowania opartego na zdrowym rozsądku. Zawiera około 44 000 zadań opartych na formacie Winograd Schema Challenge (WSC), jednak znacznie rozszerzonych i skomplikowanych za pomocą metody filtrowania „adversarial" w celu wyeliminowania statystycznych podpowiedzi[1].
Zestaw danych został opracowany w 2019 roku przez grupę badaczy z Allen Institute for AI i Uniwersytetu Waszyngtońskiego. Każde zadanie to zdanie z luką, którą należy uzupełnić jednym z dwóch wariantów, wybierając właściwy na podstawie kontekstu i rozumienia sytuacji. WinoGrande stał się jednym z kluczowych benchmarków w dziedzinie przetwarzania języka naturalnego (NLP)[2].
Przesłanki powstania: dezaktualizacja WSC
Oryginalny Winograd Schema Challenge (WSC), zaproponowany w 2011 roku, zawierał zaledwie 273 zadania i przez długi czas był uważany za wiarygodny test zdrowego rozsądku. Zadania były skonstruowane tak, aby wymagały rozumienia świata, a nie prostego dopasowywania słów[3].
Jednak w latach 2018–2019, wraz z pojawieniem się dużych modeli językowych opartych na architekturze Transformer, takich jak BERT, sytuacja uległa zmianie. Modele nauczyły się „łamać" test, osiągając dokładność około 90% poprzez wykorzystywanie niezamierzonych statystycznych wzorców (artefaktów) w danych, a nie dzięki rzeczywistemu rozumieniu[4]. WSC przestał być wiarygodnym wskaźnikiem, co doprowadziło do konieczności stworzenia nowego, bardziej złożonego i rozbudowanego benchmarku — WinoGrande.
Opracowanie i metoda adversarial filtering
Tworzenie WinoGrande przebiegało w dwóch głównych etapach: masowe generowanie zadań oraz ich późniejsze filtrowanie.
Crowdsourcing
Na pierwszym etapie za pomocą platformy Amazon Mechanical Turk zgromadzono dużą bazę ponad 47 000 zdań. Pracownicy crowdsourcingowi tworzyli pary zdań według schematu Winograd, co zapewniło różnorodność językową i „szum" charakterystyczny dla naturalnej mowy, w odróżnieniu od zadań tworzonych przez małą grupę ekspertów[1].
Algorytm AfLite
Kluczową innowacją WinoGrande był algorytm AfLite (Adversarial Filtering Lite). Metoda ta została opracowana w celu automatycznego odrzucania zadań, które można rozwiązać za pomocą prostych statystycznych podpowiedzi, bez potrzeby używania zdrowego rozsądku. Algorytm wykorzystywał proste modele do wykrywania i usuwania tych przykładów, w których jedna z odpowiedzi była zbyt wyraźnie powiązana z innymi słowami w zdaniu. Na przykład zadanie „Lwy zjadły zebry, ponieważ są drapieżnikami\" zostałoby odfiltrowane, ponieważ słowo „drapieżniki" statystycznie silnie kojarzy się ze „lwami".
W wyniku filtrowania odrzucono około 14% zebranych danych. Ostateczna wersja zestawu danych obejmuje 43 972 zadania, co czyni go znacznie bardziej wiarygodnym i trudnym testem[1].
Wyniki modeli i postępy
W momencie publikacji WinoGrande najlepsze dostępne modele osiągały wyniki znacznie gorsze od ludzkich.
- RoBERTa (ulepszona wersja BERT) osiągnęła dokładność ~79%.
- Człowiek rozwiązuje zadania średnio z dokładnością ~94%[1].
Ta różnica potwierdziła, że filtrowanie AfLite skutecznie wyeliminowało wiele „łatwych" ścieżek dla modeli. Jednak wraz z rozwojem LLM różnica ta zaczęła się zmniejszać.
- Do 2022 roku model ST-MoE-32B osiągnął dokładność 96,1%, przewyższając poziom ludzki[5].
- GPT-3 uzyskał wynik około 88%[6].
- GPT-4, bez specjalnego fine-tuningu, rozwiązuje zadania z dokładnością ~87,5%[7].
Wpływ i krytyka
WinoGrande stał się jednym z kluczowych benchmarków do oceny zdrowego rozsądku i jest regularnie wykorzystywany do testowania nowych modeli. Jego wyniki są publikowane w raportach technicznych czołowych firm zajmujących się AI oraz na platformach do porównywania modeli[8].
Jednocześnie metodologia tworzenia zestawu danych stała się przedmiotem dyskusji naukowej. Niektórzy badacze zauważają, że masowy crowdsourcing mógł prowadzić do powstawania nienaturalnych lub niejednoznacznych fraz. Wyrażano również wątpliwości co do tego, czy automatyczne filtrowanie AfLite jest w stanie całkowicie wyeliminować wszystkie ukryte artefakty[5]. Niemniej jednak WinoGrande pobudził nie tylko postęp w zakresie metryk, lecz także ważną dyskusję na temat tworzenia bardziej odpornych i wiarygodnych metod oceny AI.
Odnośniki
- Oficjalna strona WinoGrande
- Zestaw danych na platformie Hugging Face
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Przypisy
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]