GLUE Benchmark (HU)
GLUE (a General Language Understanding Evaluation rövidítése, „Az általános nyelvi megértés kiértékelése") — egy többfeladatos benchmark a természetes nyelvi megértési (NLU) modellek minőségének értékelésére. A benchmarkot 2018-ban javasolta a New York-i Egyetem, a Washingtoni Egyetem és a DeepMind kutatóinak egy csoportja, köztük Alex Wang és Samuel Bowman, és széles körű elterjedtséget nyert a kutatói közösségben[1].
A GLUE fő célja, hogy egységes, semleges és összetett tesztkomplexumot biztosítson az NLU-modellek képességeinek összehasonlító értékeléséhez egy egyetlen szakterületen túlmutató, változatos feladatsoron. A benchmark egy ranglistával (rekordtáblázattal) rendelkező online platformot is tartalmaz, amely objektív modellösszehasonlítást biztosít, és megakadályozza a tesztadatokhoz való igazítást, mivel az egyes tesztek valódi címkéit nem teszik közzé, azok kizárólag az értékelő szerveren keresztül érhetők el. Feltételezés szerint a magas eredmény eléréséhez a modellnek képesnek kell lennie általános nyelvi reprezentációk kinyerésére és a különböző típusú feladatok közötti hatékony tudástranszferre.
A benchmark összetétele és feladatai
A GLUE benchmark kilenc különböző nyelvi megértési feladatot foglal magában, amelyek már létező, a mesterséges intelligencia számára kihívást jelentő dataszeteken alapulnak. Minden feladatot egyetlen mondat vagy mondatpár osztályozásaként vagy regressziójaként fogalmaztak meg[1].
- CoLA (Corpus of Linguistic Acceptability) — a mondat grammatikai elfogadhatóságának meghatározására irányuló feladat. A minőségi metrika a Matthews-féle korrelációs együttható.
- SST-2 (Stanford Sentiment Treebank) — filmkritikák hangnemének (pozitív/negatív) meghatározására irányuló feladat. Metrika: pontosság (accuracy).
- MRPC (Microsoft Research Paraphrase Corpus) — hírforrásokból származó mondatpárokban az újrafogalmazások azonosítására irányuló feladat. Metrikák: pontosság és F1-mérték.
- QQP (Quora Question Pairs) — a Quora közösségből származó ismétlődő kérdések azonosítására irányuló feladat. Metrikák: pontosság és F1-mérték.
- STS-B (Semantic Textual Similarity Benchmark) — két mondat szemantikai hasonlóságának meghatározására irányuló feladat. A modellnek 1-től 5-ig terjedő skálán kell megjósolnia a jelentésbeli közelség mértékét. Metrikák: Pearson- és Spearman-korrelációs együttható.
- MNLI (Multi-Genre Natural Language Inference) — különböző műfajú forrásokból származó mondatpárok szöveges következtetésének felismerésére irányuló feladat (következtetés, ellentmondás, semlegesség). Az eredményeket külön értékelik az egyező (matched) és nem egyező (mismatched) részhalmazokon.
- QNLI (Question Natural Language Inference) — a SQuAD dataset átalakításából létrejött feladat. Azt kell meghatározni, hogy egy bekezdés adott mondata tartalmaz-e választ a feltett kérdésre.
- RTE (Recognizing Textual Entailment) — több kisebb gyűjteményt egyesítő, összesített szöveges következtetési dataset. A feladat a mondatok közötti viszony bináris osztályozása.
- WNLI (Winograd NLI) — a Winograd-séma módosított, NLI formátumra adaptált változata. Anafóra-feloldási feladat: a rendszernek kap egy kétértelmű névmást tartalmazó mondatot, és meg kell jelölnie, hogy az a két említett objektum közül melyikre vonatkozik.
Az értékelés módszertana
A GLUE-on való értékeléshez a kutatók feltöltik modelljük előrejelzéseit egy erre szolgáló szerverre, majd automatikusan megkapják az egyes feladatokra vonatkozó metrikák számítását és az összesített pontszámot.
- GLUE-score — az összesített mutató, amelyet mind a kilenc fő feladat eredményének átlagaként számítanak ki.
- Ranglista — nyilvános táblázat, amely tükrözi az aktuális helyzetet, és megmutatja, mely modellek teljesítenek jobban az NLU-feladatokban. A rejtett tesztkészletek használata biztosítja a tisztességes összehasonlítást.
- Diagnosztikai készlet — egy speciális, 1100 példányból álló, szakértők által kézzel annotált készlet a finomabb nyelvi elemzéshez. Nem befolyásolja a rangsort, hanem minőségi elemzési eszközként szolgál annak ellenőrzésére, hogy a modell mely nyelvi jelenségeket (lexikai szemantika, logika, józan ész) képes felismerni, és melyekkel küzd meg nehezebben[1].
Eredmények és hatás az iparra
A GLUE 2018-as indításakor az akkori legjobb modellek (például az ELMo-val kiegészített BiLSTM) körülbelül 70 pontot (0–100-as skálán) értek el összesítésben, ami lényegesen elmaradt az emberi szinttől (körülbelül 87 pont)[2].
A GLUE és a nyílt ranglista megjelenése rohamos fejlődést indított el a transzfer tanulás terén az NLP területén.
- 2019 májusára, kevesebb mint egy év alatt, a transformereken alapuló modellek új generációja (mindenekelőtt a BERT) a state-of-the-art szintet 83,9 pontra emelte.
- 2019 második felében a GLUE benchmarkot gyakorlatilag „teljesítettnek" tekintették: a legjobb rendszerek szorosan megközelítették az emberi szintet, egyes feladatokon pedig meg is haladták azt[3].
A GLUE óriási szerepet játszott mint egységes viszonyítási alap a nyelvi megértési modellek fejlesztésében. Ennek köszönhetően a kutatók közvetlenül összehasonlíthatták a különböző architektúrákat egy összetett feladatsoron, azonosíthatták az egyes megközelítések erős és gyenge pontjait, és gyorsan megoszthatták eredményeiket a nyilvános ranglistán keresztül.
SuperGLUE: a további fejlesztés
A GLUE gyors sikere odavezetett, hogy mindössze egy évvel később ugyanaz a szerzői csoport, a Facebook AI munkatársaival együtt, bemutatott egy új, összetettebb komplexumot SuperGLUE névvel[4].
A SuperGLUE-t 2019 végén jelentették be mint „nehezebben teljesíthető" (stickier) tesztkészletet, amelynek célja az volt, hogy ismét teret teremtsen a kortárs modellek és az emberi képességek között. Nyolc, még mélyebb nyelvi megértést igénylő feladatot foglal magában, emellett fejlettebb eszközkészletet és részvételi szabályokat is bevezettek. Bár a GLUE alaptesztként továbbra is használatban van, a versenyszerű fejlesztés fókusza a SuperGLUE-ra és más, specializáltabb benchmarkokra tolódott át.
Hivatkozások
- A GLUE Benchmark hivatalos weboldala
- A GLUE oldala a Papers With Code oldalon, a modellek eredményeivel
Irodalom
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Megjegyzések
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]