GLUE Benchmark (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (acroniem van General Language Understanding Evaluation, «Algemene evaluatie van taalbegrip») — is een multitaak-benchmark voor de evaluatie van de kwaliteit van modellen voor de verwerking van natuurlijke taal (NLU). De benchmark werd in 2018 voorgesteld door een groep onderzoekers van de New York University, de University of Washington en DeepMind, waaronder Alex Wang en Samuel Bowman, en verwierf brede bekendheid in de onderzoeksgemeenschap[1].

Het voornaamste doel van GLUE is het bieden van een uniforme, neutrale en uitdagende testomgeving voor de vergelijkende evaluatie van de mogelijkheden van NLU-modellen op een gevarieerde reeks taken die verder gaan dan één specifiek domein. De benchmark omvat een onlineplatform met een leaderboard (ranglijsttabel), dat een objectieve vergelijking van modellen mogelijk maakt en aanpassing aan testdata voorkomt, omdat de werkelijke labels voor een deel van de tests niet worden gepubliceerd en alleen toegankelijk zijn via de evaluatieserver. Aangenomen wordt dat een model, om hoge resultaten te behalen, in staat moet zijn universele taalrepresentaties te extraheren en kennis effectief over te dragen tussen verschillende typen taken.

Samenstelling en taken van de benchmark

De GLUE-benchmark bundelt negen verschillende taken op het gebied van taalbegrip, gebaseerd op reeds bestaande en voor AI uitdagende datasets. Alle taken zijn geformuleerd als classificatie of regressie over één zin of een zinspaar[1].

  • CoLA (Corpus of Linguistic Acceptability) — taak voor het bepalen van de grammaticale aanvaardbaarheid van een zin. De kwaliteitsmetriek is de Matthews-correlatiecoëfficiënt.
  • SST-2 (Stanford Sentiment Treebank) — taak voor het bepalen van het sentiment (positief/negatief) van een filmrecensie. Metriek — nauwkeurigheid (accuracy).
  • MRPC (Microsoft Research Paraphrase Corpus) — taak voor het detecteren van parafrasen in een zinspaar uit nieuwsbronnen. Metriek — nauwkeurigheid en F1-score.
  • QQP (Quora Question Pairs) — taak voor het identificeren van dubbele vragen uit de Quora-gemeenschap. Metriek — nauwkeurigheid en F1-score.
  • STS-B (Semantic Textual Similarity Benchmark) — taak voor de semantische vergelijking van twee zinnen. Het model moet de mate van betekenisovereenkomst voorspellen op een schaal van 1 tot 5. Metriek — Pearson- en Spearman-correlatiecoëfficiënt.
  • MNLI (Multi-Genre Natural Language Inference) — taak voor het herkennen van tekstuele implicatie aan de hand van zinnenparen uit bronnen van uiteenlopende genres (implicatie, contradictie, neutraliteit). Resultaten worden afzonderlijk beoordeeld op overeenkomende (matched) en niet-overeenkomende (mismatched) deelsets.
  • QNLI (Question Natural Language Inference) — taak verkregen door omzetting van de SQuAD-dataset. Vereist wordt te bepalen of een zin uit een alinea het antwoord op een gegeven vraag bevat.
  • RTE (Recognizing Textual Entailment) — een gecombineerde dataset voor tekstuele implicatie, die meerdere kleine collecties samenbrengt. De taak is het binair classificeren van de relatie tussen zinnen.
  • WNLI (Winograd NLI) — een aangepaste versie van het Winograd-schema, aangepast aan het NLI-formaat. Een taak voor anafoorresolutie: het systeem krijgt een zin met een dubbelzinnig voornaamwoord en moet aangeven op welk van twee objecten dit betrekking heeft.

Evaluatiemethode

Voor evaluatie op GLUE sturen onderzoekers de voorspellingen van hun model naar een speciale server, waarna zij een automatische berekening ontvangen van de metriek per taak en een totaalscore.

  • GLUE-score — de eindscore, berekend als het gemiddelde van de resultaten over alle negen hoofdtaken.
  • Leaderboard — een publieke tabel die de actuele stand van zaken weergeeft en toont welke modellen het beste presteren op NLU-taken. Het gebruik van verborgen testsets zorgt voor een eerlijke vergelijking.
  • Diagnostische set — een speciale set van 1100 voorbeelden, handmatig geannoteerd door experts voor gedetailleerde linguïstische analyse. Deze heeft geen invloed op de ranglijst, maar dient als instrument voor kwalitatieve analyse om te toetsen welke talige verschijnselen (lexicale semantiek, logica, gezond verstand) het model herkent en waarmee het moeite heeft[1].

Resultaten en invloed op de sector

Bij de lancering van GLUE in 2018 behaalden de destijds beste modellen (zoals BiLSTM met ELMo) een totaalscore van ongeveer 70 punten (op een schaal van 0–100), wat aanzienlijk lager was dan het menselijk niveau (ongeveer 87 punten)[2].

De komst van GLUE en het openbare leaderboard stimuleerde een snelle vooruitgang op het gebied van transfer learning in NLP.

  • In mei 2019, minder dan een jaar later, had een nieuwe generatie op transformers gebaseerde modellen (met name BERT) de state-of-the-art opgetrokken tot 83,9 punten.
  • In de tweede helft van 2019 was de GLUE-benchmark feitelijk «opgelost»: de beste systemen naderden het menselijk niveau tot op korte afstand en overtroffen dit op sommige taken zelfs[3].

GLUE heeft een enorme rol gespeeld als gemeenschappelijk referentiepunt in de ontwikkeling van modellen voor taalbegrip. Dankzij de benchmark konden onderzoekers verschillende architecturen direct vergelijken op een uitgebreide reeks taken, sterke en zwakke punten van benaderingen identificeren en prestaties snel uitwisselen via het publieke leaderboard.

SuperGLUE: verdere ontwikkeling

Het snelle succes van GLUE leidde ertoe dat al na een jaar hetzelfde team van auteurs, met medewerking van collega's van Facebook AI, een nieuwe, complexere suite presenteerde onder de naam SuperGLUE[4].

SuperGLUE werd eind 2019 aangekondigd als een «hardnekkigere» (stickier) testset, bedoeld om opnieuw een kloof te creëren tussen de mogelijkheden van moderne modellen en de mens. De suite omvat acht taken die een nog dieper taalbegrip vereisen, en beschikt over verbeterd instrumentarium en deelnameregels. Hoewel GLUE nog steeds wordt gebruikt als basistest, is de voornaamste focus van competitieve verbetering verschoven naar SuperGLUE en andere, meer gespecialiseerde benchmarks.

Verwijzingen

  • Officiële website van GLUE Benchmark
  • GLUE-pagina op Papers With Code met modelresultaten

Literatuur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noten

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]