GLUE Benchmark (IT)
GLUE (acronimo di General Language Understanding Evaluation, «Valutazione Generale della Comprensione del Linguaggio») — è un benchmark multitask per la valutazione della qualità dei modelli di comprensione del linguaggio naturale (NLU). Il benchmark è stato proposto nel 2018 da un gruppo di ricercatori della New York University, dell'Università di Washington e di DeepMind, tra cui Alex Wang e Samuel Bowman, e ha ottenuto ampia diffusione nella comunità di ricerca[1].
L'obiettivo principale di GLUE è fornire un insieme di test unificato, neutrale e impegnativo per la valutazione comparativa delle capacità dei modelli NLU su un insieme variegato di compiti che vanno oltre un singolo dominio specifico. Il benchmark include una piattaforma online con una leaderboard (tabella dei record), che garantisce un confronto obiettivo tra i modelli e impedisce l'adattamento ai dati di test, poiché le etichette reali per parte dei test non vengono pubblicate e sono accessibili solo tramite il server di valutazione. Si presuppone che, per ottenere risultati elevati, il modello debba essere in grado di estrarre rappresentazioni linguistiche universali e trasferire efficacemente le conoscenze tra diversi tipi di compiti.
Composizione e compiti del benchmark
Il benchmark GLUE raggruppa nove diversi compiti di comprensione del linguaggio, basati su dataset già esistenti e difficili per i sistemi di IA. Tutti i compiti sono formulati come classificazione o regressione su una singola frase o su una coppia di frasi[1].
- CoLA (Corpus of Linguistic Acceptability) — compito di determinazione dell'accettabilità grammaticale di una frase. La metrica di qualità è il coefficiente di correlazione di Matthews.
- SST-2 (Stanford Sentiment Treebank) — compito di determinazione del sentiment (positivo/negativo) di una recensione cinematografica. La metrica è l'accuratezza (accuracy).
- MRPC (Microsoft Research Paraphrase Corpus) — compito di identificazione delle parafrasi in una coppia di frasi provenienti da fonti giornalistiche. Le metriche sono accuratezza e F1-score.
- QQP (Quora Question Pairs) — compito di identificazione di domande duplicate dalla community di Quora. Le metriche sono accuratezza e F1-score.
- STS-B (Semantic Textual Similarity Benchmark) — compito di corrispondenza semantica tra due frasi. Il modello deve prevedere il grado di somiglianza semantica su una scala da 1 a 5. Le metriche sono i coefficienti di correlazione di Pearson e di Spearman.
- MNLI (Multi-Genre Natural Language Inference) — compito di riconoscimento dell'inferenza testuale su coppie di frasi provenienti da fonti di generi diversi (implicazione, contraddizione, neutralità). I risultati sono valutati separatamente sui sottoinsieme corrispondente (matched) e non corrispondente (mismatched).
- QNLI (Question Natural Language Inference) — compito ottenuto trasformando il dataset SQuAD. È necessario determinare se una frase di un paragrafo contiene la risposta a una domanda data.
- RTE (Recognizing Textual Entailment) — dataset cumulativo sull'inferenza testuale, che combina diverse piccole collezioni. Il compito consiste nel classificare in modo binario la relazione tra le frasi.
- WNLI (Winograd NLI) — versione modificata dello schema di Winograd, adattata al formato NLI. Compito di risoluzione dell'anafora: al sistema viene data una frase con un pronome ambiguo e occorre indicare a quale dei due oggetti si riferisce.
Metodologia di valutazione
Per la valutazione su GLUE, i ricercatori inviano le previsioni del proprio modello a un apposito server, dopodiché ricevono il calcolo automatico delle metriche per ciascun compito e un punteggio aggregato.
- GLUE-score — il punteggio finale, calcolato come media dei risultati su tutti i nove compiti principali.
- Leaderboard — tabella pubblica che riflette lo stato attuale e mostra quali modelli ottengono i migliori risultati sui compiti NLU. L'utilizzo di set di test nascosti garantisce un confronto equo.
- Set diagnostico — un insieme speciale di 1100 esempi, annotati manualmente da esperti per un'analisi linguistica approfondita. Non influisce sulla classifica, ma serve come strumento di analisi qualitativa per verificare quali fenomeni linguistici (semantica lessicale, logica, senso comune) il modello è in grado di riconoscere e con quali incontra difficoltà[1].
Risultati e impatto sull'industria
Al lancio di GLUE nel 2018, i migliori modelli dell'epoca (ad esempio BiLSTM con ELMo) raggiungevano un risultato complessivo di circa 70 punti (su scala 0–100), significativamente inferiore al livello umano (circa 87 punti)[2].
L'introduzione di GLUE e della leaderboard aperta ha stimolato un rapido progresso nel campo del transfer learning in NLP.
- Entro maggio 2019, in meno di un anno, la nuova generazione di modelli basati su transformer (in primo luogo BERT) ha innalzato l'asticella dello state-of-the-art a 83,9 punti.
- Nella seconda metà del 2019, il benchmark GLUE è stato di fatto «superato»: i migliori sistemi si sono avvicinati al livello umano, e su alcuni compiti lo hanno persino superato[3].
GLUE ha svolto un ruolo enorme come punto di riferimento comune nello sviluppo dei modelli di comprensione del linguaggio. Grazie ad esso, i ricercatori hanno potuto confrontare direttamente diverse architetture su un insieme complesso di compiti, identificare i punti di forza e di debolezza degli approcci e condividere rapidamente i progressi tramite la leaderboard pubblica.
SuperGLUE: sviluppi successivi
Il rapido successo di GLUE ha portato al fatto che, già dopo un anno, lo stesso gruppo di autori, con la partecipazione di colleghi di Facebook AI, ha presentato un nuovo insieme più impegnativo denominato SuperGLUE[4].
SuperGLUE è stato annunciato alla fine del 2019 come un insieme di test «più ostico» (stickier), pensato per ristabilire un divario tra le capacità dei modelli moderni e quelle umane. Include otto compiti che richiedono una comprensione ancora più profonda del linguaggio, e sono stati migliorati anche gli strumenti e le regole per i partecipanti. Sebbene GLUE continui a essere utilizzato come test di base, il principale obiettivo del miglioramento competitivo si è spostato su SuperGLUE e su altri benchmark più specializzati.
Collegamenti esterni
- Sito ufficiale di GLUE Benchmark
- Pagina di GLUE su Papers With Code con i risultati dei modelli
Bibliografia
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]