WinoGrande Benchmark (RO)
WinoGrande — este un set de date de referință la scară largă, destinat evaluării capacității sistemelor de inteligență artificială de a raționa pe baza simțului comun. Conține aproximativ 44 000 de sarcini bazate pe formatul Winograd Schema Challenge (WSC), dar semnificativ extinse și complexificate prin intermediul metodei de filtrare „adversariale", pentru eliminarea indiciilor statistice[1].
Setul de date a fost dezvoltat în 2019 de un grup de cercetători de la Allen Institute for AI și Universitatea din Washington. Fiecare sarcină constă dintr-o propoziție cu un spațiu gol care trebuie completat cu una din două variante, alegând-o pe cea corectă pe baza contextului și a înțelegerii situației. WinoGrande a devenit unul dintre benchmark-urile cheie în domeniul procesării limbajului natural (NLP)[2].
Premisele creării: uzura morală a WSC
Originalul Winograd Schema Challenge (WSC), propus în 2011, conținea doar 273 de sarcini și a fost mult timp considerat un test fiabil al simțului comun. Sarcinile erau construite astfel încât să necesite înțelegerea lumii, nu simpla potrivire a cuvintelor[3].
Totuși, spre 2018–2019, odată cu apariția marilor modele de limbaj bazate pe arhitectura Transformer, precum BERT, situația s-a schimbat. Modelele au învățat să „spargă" testul, atingând o acuratețe de aproximativ 90% prin exploatarea unor regularități statistice neintenționate (artefacte) din date, și nu prin înțelegere reală[4]. WSC a încetat să mai fie un indicator fiabil, ceea ce a condus la necesitatea creării unui nou benchmark, mai complex și mai extins — WinoGrande.
Dezvoltarea și metoda adversarial filtering
Crearea WinoGrande a parcurs două etape principale: generarea în masă a sarcinilor și filtrarea lor ulterioară.
Crowdsourcing
În prima etapă, cu ajutorul platformei Amazon Mechanical Turk, a fost constituită o bază mare de peste 47 000 de propoziții. Lucrătorii din crowd creau perechi de propoziții după schema Winograd, asigurând diversitate lingvistică și „zgomotul" specific vorbirii naturale, spre deosebire de sarcinile redactate de un grup restrâns de experți[1].
Algoritmul AfLite
Inovația cheie a WinoGrande a fost algoritmul AfLite (Adversarial Filtering Lite). Această metodă a fost dezvoltată pentru eliminarea automată a sarcinilor ce pot fi rezolvate prin intermediul unor indicii statistice simple, fără a necesita simț comun. Algoritmul folosea modele simple pentru a identifica și elimina acele exemple în care unul dintre răspunsuri era asociat prea evident cu alte cuvinte din propoziție. De exemplu, sarcina „Leii au mâncat zebrele, deoarece ei sunt prădători" ar fi fost filtrată, deoarece cuvântul „prădători" este statistic strâns asociat cu „leii".
În urma filtrării, aproximativ 14% din datele colectate au fost eliminate. Versiunea finală a setului de date include 43 972 de sarcini, ceea ce îl face un test semnificativ mai fiabil și mai dificil[1].
Rezultatele modelelor și progresul
La lansarea WinoGrande, cele mai bune modele din acel moment au obținut rezultate semnificativ inferioare celor umane.
- RoBERTa (versiune îmbunătățită a BERT) a atins o acuratețe de ~79%.
- Omul rezolvă în medie sarcinile cu o acuratețe de ~94%[1].
Această diferență a confirmat că filtrarea AfLite a eliminat cu succes multe dintre „căile ușoare" pentru modele. Totuși, odată cu dezvoltarea LLM-urilor, acest decalaj a început să se reducă.
- Până în 2022, modelul ST-MoE-32B a atins o acuratețe de 96,1%, depășind nivelul uman[5].
- GPT-3 a obținut un rezultat de aproximativ 88%[6].
- GPT-4, fără fine-tuning special, rezolvă sarcinile cu o acuratețe de ~87,5%[7].
Influență și critici
WinoGrande a devenit unul dintre benchmark-urile cheie pentru evaluarea simțului comun și este utilizat în mod regulat pentru testarea noilor modele. Rezultatele sale sunt publicate în rapoartele tehnice ale companiilor de top din domeniul AI și pe platformele de comparare a modelelor[8].
În același timp, metodologia de creare a setului de date a devenit subiect de dezbatere științifică. Unii cercetători observă că crowdsourcing-ul în masă ar fi putut genera fraze nenaturale sau ambigue. Au fost exprimate și îndoieli cu privire la capacitatea filtrării automate AfLite de a elimina complet toate artefactele ascunse[5]. Cu toate acestea, WinoGrande a stimulat nu doar progresul la nivelul metricilor, ci și o dezbatere importantă despre crearea unor metode de evaluare a AI mai robuste și mai fiabile.
Referințe
- Site-ul oficial WinoGrande
- Setul de date pe platforma Hugging Face
Bibliografie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]