WinoGrande Benchmark (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — è un dataset di riferimento su larga scala progettato per valutare la capacità dei sistemi di intelligenza artificiale di ragionare sulla base del senso comune. Contiene circa 44 000 compiti basati sul formato Winograd Schema Challenge (WSC), ma significativamente ampliati e resi più complessi mediante un metodo di filtraggio «avversariale» per eliminare i suggerimenti statistici[1].

Il dataset è stato sviluppato nel 2019 da un gruppo di ricercatori dell'Allen Institute for AI e dell'Università di Washington. Ogni compito consiste in una frase con uno spazio vuoto da riempire scegliendo tra due opzioni, selezionando quella corretta sulla base del contesto e della comprensione della situazione. WinoGrande è diventato uno dei benchmark chiave nel campo dell'elaborazione del linguaggio naturale (NLP)[2].

Premesse della creazione: il superamento del WSC

L'originale Winograd Schema Challenge (WSC), proposto nel 2011, conteneva appena 273 compiti ed era stato a lungo considerato un test affidabile per il senso comune. I compiti erano costruiti in modo da richiedere una comprensione del mondo reale, non una semplice corrispondenza di parole[3].

Tuttavia, tra il 2018 e il 2019, con l'avvento dei grandi modelli linguistici basati sull'architettura Transformer, come BERT, la situazione cambiò. I modelli impararono a «violare» il test, raggiungendo un'accuratezza di circa il 90% sfruttando pattern statistici non intenzionali (artefatti) nei dati, anziché attraverso una reale comprensione[4]. Il WSC cessò di essere un indicatore affidabile, il che portò alla necessità di creare un nuovo benchmark più complesso e su larga scala: WinoGrande.

Sviluppo e metodo di adversarial filtering

La creazione di WinoGrande si è svolta in due fasi principali: la generazione massiva dei compiti e la loro successiva filtratura.

Crowdsourcing

Nella prima fase, tramite la piattaforma Amazon Mechanical Turk, è stata raccolta una grande base di oltre 47 000 frasi. I lavoratori del crowdsourcing creavano coppie di frasi secondo lo schema Winograd, garantendo diversità linguistica e il «rumore» tipico del linguaggio naturale, a differenza dei compiti redatti da un piccolo gruppo di esperti[1].

Algoritmo AfLite

L'innovazione chiave di WinoGrande è stata l'algoritmo AfLite (Adversarial Filtering Lite). Questo metodo è stato sviluppato per scartare automaticamente i compiti risolvibili tramite semplici suggerimenti statistici, senza richiedere il senso comune. L'algoritmo utilizzava modelli semplici per identificare e rimuovere gli esempi in cui una delle risposte era troppo evidentemente collegata ad altre parole nella frase. Ad esempio, il compito «I leoni mangiarono le zebre perché sono predatori» sarebbe stato filtrato, poiché la parola «predatori» è statisticamente associata in modo molto stretto a «leoni».

A seguito della filtratura, circa il 14% dei dati raccolti è stato scartato. La versione finale del dataset include 43 972 compiti, rendendolo un test significativamente più affidabile e complesso[1].

Risultati dei modelli e progressi

Al momento del rilascio di WinoGrande, i migliori modelli dell'epoca mostravano risultati significativamente inferiori a quelli umani.

  • RoBERTa (versione migliorata di BERT) ha raggiunto un'accuratezza del ~79%.
  • L'essere umano risolve i compiti con un'accuratezza media del ~94%[1].

Questo divario ha confermato che la filtratura con AfLite ha eliminato con successo molti percorsi «facili» per i modelli. Tuttavia, con lo sviluppo degli LLM, questo divario ha iniziato a ridursi.

  • Entro il 2022, il modello ST-MoE-32B ha raggiunto il 96,1% di accuratezza, superando il livello umano[5].
  • GPT-3 ha ottenuto un risultato di circa 88%[6].
  • GPT-4, senza fine-tuning specifico, risolve i compiti con un'accuratezza del ~87,5%[7].

Impatto e critiche

WinoGrande è diventato uno dei benchmark chiave per la valutazione del senso comune ed è regolarmente utilizzato per testare nuovi modelli. I suoi risultati vengono pubblicati nei rapporti tecnici delle principali aziende di intelligenza artificiale e sulle piattaforme di confronto tra modelli[8].

Al tempo stesso, la metodologia di creazione del dataset è diventata oggetto di dibattito scientifico. Alcuni ricercatori osservano che il crowdsourcing massivo potrebbe aver prodotto frasi innaturali o ambigue. Sono stati inoltre espressi dubbi sul fatto che la filtratura automatica AfLite sia in grado di eliminare completamente tutti gli artefatti nascosti[5]. Ciononostante, WinoGrande ha stimolato non solo progressi nelle metriche, ma anche un'importante discussione sulla creazione di metodi di valutazione dell'IA più robusti e affidabili.

Riferimenti

  • Sito ufficiale di WinoGrande
  • Dataset sulla piattaforma Hugging Face

Bibliografia

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]