---
title: "GLUE Benchmark (HU)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(HU)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2427
wiki_created_at: 2026-09-06T23:03:51Z
wiki_modified_at: 2026-09-06T23:03:51Z
downloaded_at: 2026-09-07T22:51:07Z
---

# GLUE Benchmark (HU)

**GLUE** (a **General Language Understanding Evaluation** rövidítése, „Az általános nyelvi megértés kiértékelése") — egy többfeladatos benchmark a természetes nyelvi megértési (NLU) modellek minőségének értékelésére. A benchmarkot 2018-ban javasolta a New York-i Egyetem, a Washingtoni Egyetem és a DeepMind kutatóinak egy csoportja, köztük **Alex Wang** és **Samuel Bowman**, és széles körű elterjedtséget nyert a kutatói közösségben<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-glue_paper-1)</sup>.

A GLUE fő célja, hogy egységes, semleges és összetett tesztkomplexumot biztosítson az NLU-modellek képességeinek összehasonlító értékeléséhez egy egyetlen szakterületen túlmutató, változatos feladatsoron. A benchmark egy **ranglistával** (rekordtáblázattal) rendelkező online platformot is tartalmaz, amely objektív modellösszehasonlítást biztosít, és megakadályozza a tesztadatokhoz való igazítást, mivel az egyes tesztek valódi címkéit nem teszik közzé, azok kizárólag az értékelő szerveren keresztül érhetők el. Feltételezés szerint a magas eredmény eléréséhez a modellnek képesnek kell lennie általános nyelvi reprezentációk kinyerésére és a különböző típusú feladatok közötti hatékony tudástranszferre.

## A benchmark összetétele és feladatai

A GLUE benchmark kilenc különböző nyelvi megértési feladatot foglal magában, amelyek már létező, a mesterséges intelligencia számára kihívást jelentő dataszeteken alapulnak. Minden feladatot egyetlen mondat vagy mondatpár osztályozásaként vagy regressziójaként fogalmaztak meg<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — a mondat grammatikai elfogadhatóságának meghatározására irányuló feladat. A minőségi metrika a Matthews-féle korrelációs együttható.
- **SST-2** (*Stanford Sentiment Treebank*) — filmkritikák hangnemének (pozitív/negatív) meghatározására irányuló feladat. Metrika: pontosság (*accuracy*).
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — hírforrásokból származó mondatpárokban az újrafogalmazások azonosítására irányuló feladat. Metrikák: pontosság és F1-mérték.
- **QQP** (*Quora Question Pairs*) — a Quora közösségből származó ismétlődő kérdések azonosítására irányuló feladat. Metrikák: pontosság és F1-mérték.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — két mondat szemantikai hasonlóságának meghatározására irányuló feladat. A modellnek 1-től 5-ig terjedő skálán kell megjósolnia a jelentésbeli közelség mértékét. Metrikák: Pearson- és Spearman-korrelációs együttható.
- **MNLI** (*Multi-Genre Natural Language Inference*) — különböző műfajú forrásokból származó mondatpárok szöveges következtetésének felismerésére irányuló feladat (következtetés, ellentmondás, semlegesség). Az eredményeket külön értékelik az egyező (*matched*) és nem egyező (*mismatched*) részhalmazokon.
- **QNLI** (*Question Natural Language Inference*) — a SQuAD dataset átalakításából létrejött feladat. Azt kell meghatározni, hogy egy bekezdés adott mondata tartalmaz-e választ a feltett kérdésre.
- **RTE** (*Recognizing Textual Entailment*) — több kisebb gyűjteményt egyesítő, összesített szöveges következtetési dataset. A feladat a mondatok közötti viszony bináris osztályozása.
- **WNLI** (*Winograd NLI*) — a Winograd-séma módosított, NLI formátumra adaptált változata. Anafóra-feloldási feladat: a rendszernek kap egy kétértelmű névmást tartalmazó mondatot, és meg kell jelölnie, hogy az a két említett objektum közül melyikre vonatkozik.

## Az értékelés módszertana

A GLUE-on való értékeléshez a kutatók feltöltik modelljük előrejelzéseit egy erre szolgáló szerverre, majd automatikusan megkapják az egyes feladatokra vonatkozó metrikák számítását és az összesített pontszámot.

- **GLUE-score** — az összesített mutató, amelyet mind a kilenc fő feladat eredményének átlagaként számítanak ki.
- **Ranglista** — nyilvános táblázat, amely tükrözi az aktuális helyzetet, és megmutatja, mely modellek teljesítenek jobban az NLU-feladatokban. A rejtett tesztkészletek használata biztosítja a tisztességes összehasonlítást.
- **Diagnosztikai készlet** — egy speciális, 1100 példányból álló, szakértők által kézzel annotált készlet a finomabb nyelvi elemzéshez. Nem befolyásolja a rangsort, hanem minőségi elemzési eszközként szolgál annak ellenőrzésére, hogy a modell mely nyelvi jelenségeket (lexikai szemantika, logika, józan ész) képes felismerni, és melyekkel küzd meg nehezebben<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-glue_paper-1)</sup>.

## Eredmények és hatás az iparra

A GLUE 2018-as indításakor az akkori legjobb modellek (például az ELMo-val kiegészített BiLSTM) körülbelül **70 pontot** (0–100-as skálán) értek el összesítésben, ami lényegesen elmaradt az emberi szinttől (körülbelül 87 pont)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-human_vs_muppet-2)</sup>.

A GLUE és a nyílt ranglista megjelenése rohamos fejlődést indított el a transzfer tanulás terén az NLP területén.

- 2019 májusára, kevesebb mint egy év alatt, a transformereken alapuló modellek új generációja (mindenekelőtt a BERT) a *state-of-the-art* szintet **83,9 pontra** emelte.
- 2019 második felében a GLUE benchmarkot gyakorlatilag „teljesítettnek" tekintették: a legjobb rendszerek szorosan megközelítették az emberi szintet, egyes feladatokon pedig meg is haladták azt<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-w4ngatang_superglue-3)</sup>.

A GLUE óriási szerepet játszott mint **egységes viszonyítási alap** a nyelvi megértési modellek fejlesztésében. Ennek köszönhetően a kutatók közvetlenül összehasonlíthatták a különböző architektúrákat egy összetett feladatsoron, azonosíthatták az egyes megközelítések erős és gyenge pontjait, és gyorsan megoszthatták eredményeiket a nyilvános ranglistán keresztül.

## SuperGLUE: a további fejlesztés

A GLUE gyors sikere odavezetett, hogy mindössze egy évvel később ugyanaz a szerzői csoport, a Facebook AI munkatársaival együtt, bemutatott egy új, összetettebb komplexumot **SuperGLUE** névvel<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_note-venturebeat_superglue-4)</sup>.

A SuperGLUE-t 2019 végén jelentették be mint „nehezebben teljesíthető" (*stickier*) tesztkészletet, amelynek célja az volt, hogy ismét teret teremtsen a kortárs modellek és az emberi képességek között. Nyolc, még mélyebb nyelvi megértést igénylő feladatot foglal magában, emellett fejlettebb eszközkészletet és részvételi szabályokat is bevezettek. Bár a GLUE alaptesztként továbbra is használatban van, a versenyszerű fejlesztés fókusza a SuperGLUE-ra és más, specializáltabb benchmarkokra tolódott át.

## Hivatkozások

- A GLUE Benchmark hivatalos weboldala
- A GLUE oldala a Papers With Code oldalon, a modellek eredményeivel

## Irodalom

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Megjegyzések

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HU)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
