WinoGrande Benchmark (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — egy nagyszabású etalon adatkészlet, amelyet mesterséges intelligencia rendszerek józan észen alapuló következtetési képességének értékelésére terveztek. Körülbelül 44 000 feladatot tartalmaz, amelyek a Winograd Schema Challenge (WSC) formátumán alapulnak, de jelentősen kibővítve és megnehezítve az „adversarial" szűrési módszerrel a statisztikai jelzések kiküszöbölése érdekében[1].

Az adatkészletet 2019-ben az Allen Institute for AI és a Washingtoni Egyetem kutatóinak csoportja fejlesztette ki. Minden feladat egy hiányos mondatból áll, amelybe két lehetséges szó közül a kontextus és a szituáció megértése alapján kell a helyeset beilleszteni. A WinoGrande a természetes nyelvfeldolgozás (NLP) területének egyik kulcsfontosságú benchmarkjává vált[2].

A létrehozás előzményei: a WSC elavulása

Az eredeti Winograd Schema Challenge (WSC), amelyet 2011-ben javasoltak, mindössze 273 feladatot tartalmazott, és hosszú ideig megbízható józan ész tesztnek számított. A feladatokat úgy szerkesztették meg, hogy a világ megértését kívánják meg, ne csupán egyszerű szóegyeztetést[3].

Azonban 2018–2019-re, a Transformer architektúrán alapuló nagy nyelvi modellek — mint például a BERT — megjelenésével a helyzet megváltozott. A modellek megtanulták „feltörni" a tesztet, körülbelül 90%-os pontosságot érve el az adatokban található nem szándékos statisztikai minták (artifaktumok) kihasználásával, nem pedig valódi megértés révén[4]. A WSC megszűnt megbízható mérőeszköz lenni, ami szükségessé tette egy új, összetettebb és nagyobb méretű benchmark — a WinoGrande — létrehozását.

Fejlesztés és az adversarial filtering módszer

A WinoGrande létrehozása két fő szakaszban zajlott: a feladatok tömeges generálása és azok utólagos szűrése.

Közösségi adatgyűjtés (crowdsourcing)

Az első szakaszban az Amazon Mechanical Turk platform segítségével több mint 47 000 mondatból álló nagy adatbázist gyűjtöttek össze. A közreműködők Winograd-séma szerinti mondatpárokat hoztak létre, ami nyelvi változatosságot és a természetes beszédre jellemző „zajt" biztosított — ellentétben a kis szakértői csoport által írt feladatokkal[1].

Az AfLite algoritmus

A WinoGrande kulcsinnovációja az AfLite (Adversarial Filtering Lite) algoritmus volt. Ezt a módszert azoknak a feladatoknak az automatikus kiszűrésére fejlesztették ki, amelyek egyszerű statisztikai jelzések segítségével, józan ész nélkül is megoldhatók. Az algoritmus egyszerű modelleket alkalmazott azon példák azonosítására és eltávolítására, ahol az egyik válasz túlságosan nyilvánvalóan kapcsolódott a mondat más szavaihoz. Például az „Az oroszlánok megették a zebrákat, mert ők ragadozók" feladat kiszűrésre kerülne, mivel a „ragadozók" szó statisztikailag szorosan kapcsolódik az „oroszlánok" szóhoz.

A szűrés eredményeként az összegyűjtött adatok körülbelül 14%-át elvetették. Az adatkészlet végleges verziója 43 972 feladatot tartalmaz, ami jelentősen megbízhatóbb és nehezebb tesztet jelent[1].

A modellek eredményei és a fejlődés

A WinoGrande megjelenésekor az akkori legjobb modellek eredményei jelentősen elmaradtak az emberi szinttől.

  • A RoBERTa (a BERT továbbfejlesztett változata) ~79%-os pontosságot ért el.
  • Az ember átlagosan ~94%-os pontossággal oldja meg a feladatokat[1].

Ez a különbség igazolta, hogy az AfLite-szűrés sikeresen eltávolította a modellek számára elérhető számos „könnyű" megoldási utat. Az LLM-ek fejlődésével azonban ez a különbség csökkenni kezdett.

  • 2022-re az ST-MoE-32B modell 96,1%-os pontosságot ért el, meghaladva az emberi szintet[5].
  • A GPT-3 körülbelül 88%-os eredményt mutatott[6].
  • A GPT-4 különleges fine-tuning nélkül ~87,5%-os pontossággal oldja meg a feladatokat[7].

Hatás és kritika

A WinoGrande a józan ész értékelésének egyik kulcsbenchmarkjává vált, és rendszeresen használják új modellek tesztelésére. Eredményeit a vezető mesterségesintelligencia-vállalatok technikai jelentéseiben és modellek összehasonlítására szolgáló platformokon teszik közzé[8].

Ugyanakkor az adatkészlet létrehozásának módszertana tudományos vita tárgyává vált. Egyes kutatók megjegyzik, hogy a tömeges közösségi adatgyűjtés természetellenes vagy kétértelmű kifejezések megjelenéséhez vezethetett. Kétségek merültek fel azzal kapcsolatban is, hogy az AfLite automatikus szűrés képes-e teljesen kiküszöbölni az összes rejtett artifaktumot[5]. Mindazonáltal a WinoGrande nem csupán a mérőszámok terén elért fejlődést ösztönözte, hanem fontos vitát is indított az MI értékelésének megbízhatóbb és robusztusabb módszereinek kidolgozásáról.

Hivatkozások

  • A WinoGrande hivatalos weboldala
  • Az adatkészlet a Hugging Face platformon

Irodalom

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Megjegyzések

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]