GLUE Benchmark (CS)
GLUE (zkratka z General Language Understanding Evaluation, „Obecné hodnocení porozumění jazyku") — jedná se o multitaskový benchmark pro hodnocení kvality modelů zpracování přirozeného jazyka (NLU). Benchmark byl navržen v roce 2018 skupinou výzkumníků z New York University, University of Washington a DeepMind, včetně Alexe Wanga a Samuela Bowmana, a získal široké uplatnění ve výzkumné komunitě[1].
Hlavním cílem GLUE je poskytnout jednotný, neutrální a náročný testovací soubor pro srovnávací hodnocení schopností NLU modelů na rozmanitém souboru úloh přesahujících rámec jedné konkrétní oblasti. Benchmark zahrnuje online platformu s leaderboardem (tabulkou rekordů), která zajišťuje objektivní srovnání modelů a zabraňuje přizpůsobování se testovacím datům, protože skutečné štítky pro část testů nejsou zveřejňovány a jsou dostupné pouze prostřednictvím hodnotícího serveru. Předpokládá se, že k dosažení vysokých výsledků musí model umět extrahovat univerzální jazykové reprezentace a efektivně přenášet znalosti mezi různými typy úloh.
Složení a úlohy benchmarku
Benchmark GLUE sdružuje devět různých úloh porozumění jazyku, které jsou založeny na již existujících a pro umělou inteligenci náročných datasetech. Všechny úlohy jsou formulovány jako klasifikace nebo regrese nad jednou větou nebo párem vět[1].
- CoLA (Corpus of Linguistic Acceptability) — úloha určování gramatické přijatelnosti věty. Metrikou kvality je Matthewsův korelační koeficient.
- SST-2 (Stanford Sentiment Treebank) — úloha určování tonality (pozitivní/negativní) filmové recenze. Metrikou je přesnost (accuracy).
- MRPC (Microsoft Research Paraphrase Corpus) — úloha identifikace parafrází v páru vět z tiskových zdrojů. Metrikami jsou přesnost a F1 skóre.
- QQP (Quora Question Pairs) — úloha určování duplicitních otázek z komunity Quora. Metrikami jsou přesnost a F1 skóre.
- STS-B (Semantic Textual Similarity Benchmark) — úloha sémantického porovnávání dvou vět. Model musí předpovědět míru sémantické blízkosti na škále od 1 do 5. Metrikami jsou Pearsonův a Spearmanův korelační koeficient.
- MNLI (Multi-Genre Natural Language Inference) — úloha rozpoznávání textového vyplývání na příkladu párů vět z různožánrových zdrojů (vyplývání, rozpor, neutralita). Výsledky jsou hodnoceny samostatně na shodném (matched) a neshodném (mismatched) podsouboru.
- QNLI (Question Natural Language Inference) — úloha vzniklá transformací datasetu SQuAD. Je třeba určit, zda věta z odstavce obsahuje odpověď na zadanou otázku.
- RTE (Recognizing Textual Entailment) — souhrnný dataset pro textové vyplývání spojující několik malých kolekcí. Úkolem je binárně klasifikovat vztah mezi větami.
- WNLI (Winograd NLI) — upravená verze Winogradova schématu přizpůsobená formátu NLI. Úloha řešení anafory: systému je dána věta s nejednoznačným zájmenem a je třeba určit, ke kterému ze dvou objektů se vztahuje.
Metodika hodnocení
Pro hodnocení na GLUE výzkumníci odesílají předpovědi svého modelu na speciální server, načež obdrží automatický výpočet metrik pro každou úlohu a souhrnné skóre.
- GLUE-score — výsledný ukazatel, který se vypočítá jako průměr výsledků ze všech devíti hlavních úloh.
- Leaderboard — veřejná tabulka, která odráží aktuální stav věcí a ukazuje, které modely lépe zvládají NLU úlohy. Použití skrytých testovacích sad zajišťuje spravedlivé srovnání.
- Diagnostická sada — speciální sada 1100 příkladů ručně anotovaných odborníky pro jemnou lingvistickou analýzu. Neovlivňuje hodnocení, ale slouží jako nástroj kvalitativní analýzy pro ověření, které jazykové jevy (lexikální sémantika, logika, zdravý rozum) model umí rozpoznávat a s čím má potíže[1].
Výsledky a vliv na odvětví
Při spuštění GLUE v roce 2018 dosahovaly tehdejší nejlepší modely (například BiLSTM s ELMo) souhrnného výsledku přibližně 70 bodů (na škále 0–100), což bylo podstatně níže než úroveň člověka (přibližně 87 bodů)[2].
Vznik GLUE a otevřeného leaderboardu podnítil bouřlivý pokrok v oblasti transferového učení v NLP.
- Do května 2019, za méně než rok, zvýšila nová generace modelů založených na transformerech (především BERT) laťku state-of-the-art na 83,9 bodu.
- Ve druhé polovině roku 2019 byl benchmark GLUE fakticky „překonán": nejlepší systémy se těsně přiblížily lidské úrovni a v některých úlohách ji dokonce překonaly[3].
GLUE sehrál obrovskou roli jako jednotný referenční bod v rozvoji modelů porozumění jazyku. Díky němu mohli výzkumníci přímo srovnávat různé architektury na komplexní sadě úloh, odhalovat silné a slabé stránky přístupů a rychle sdílet dosažené výsledky prostřednictvím veřejného leaderboardu.
SuperGLUE: následný vývoj
Bouřlivý úspěch GLUE vedl k tomu, že již o rok později stejný tým autorů za účasti kolegů z Facebook AI představil nový, náročnější soubor testů pod názvem SuperGLUE[4].
SuperGLUE byl oznámen koncem roku 2019 jako „odolnější" (stickier) sada testů, jejímž cílem bylo znovu vytvořit propast mezi schopnostmi současných modelů a člověka. Zahrnovalo osm úloh vyžadujících ještě hlubší porozumění jazyku a také byl vylepšen nástroj a pravidla pro účastníky. Ačkoli GLUE nadále slouží jako základní test, hlavní těžiště soutěžního zdokonalování se přesunulo na SuperGLUE a další, specializovanější benchmarky.
Odkazy
- Oficiální stránky GLUE Benchmark
- Stránka GLUE na Papers With Code s výsledky modelů
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Poznámky
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]