---
title: "GLUE Benchmark (RO)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(RO)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 2434
wiki_created_at: 2026-09-06T23:03:58Z
wiki_modified_at: 2026-09-06T23:03:58Z
downloaded_at: 2026-09-07T22:51:10Z
---

# GLUE Benchmark (RO)

**GLUE** (acronim din **General Language Understanding Evaluation**, „Evaluare generală a înțelegerii limbajului") — este un benchmark multisarcină pentru evaluarea calității modelelor de procesare a limbajului natural (NLU). Benchmark-ul a fost propus în 2018 de un grup de cercetători de la Universitatea din New York, Universitatea din Washington și DeepMind, printre care **Alex Wang** și **Samuel Bowman**, și a cunoscut o largă răspândire în comunitatea de cercetare<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-glue_paper-1)</sup>.

Obiectivul principal al GLUE este de a oferi un set de teste unic, neutru și dificil pentru evaluarea comparativă a capacităților modelelor NLU pe un set divers de sarcini, care depășesc limitele unui singur domeniu specific. Benchmark-ul include o platformă online cu un **leaderboard** (tabel al recordurilor), care asigură compararea obiectivă a modelelor și previne ajustarea la datele de test, deoarece etichetele reale pentru o parte din teste nu sunt publicate și sunt accesibile doar prin intermediul serverului de evaluare. Se presupune că, pentru a obține rezultate înalte, modelul trebuie să fie capabil să extragă reprezentări lingvistice universale și să transfere eficient cunoștințele între diferite tipuri de sarcini.

## Componența și sarcinile benchmark-ului

Benchmark-ul GLUE reunește nouă sarcini diferite de înțelegere a limbajului, bazate pe dataset-uri deja existente și dificile pentru IA. Toate sarcinile sunt formulate ca clasificare sau regresie pe o singură propoziție sau pe o pereche de propoziții<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — sarcina de determinare a acceptabilității gramaticale a unei propoziții. Metrica de calitate — Coeficientul de corelație Matthews.
- **SST-2** (*Stanford Sentiment Treebank*) — sarcina de determinare a tonalității (pozitive/negative) a unei recenzii de film. Metrica — acuratețe (*accuracy*).
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — sarcina de identificare a parafrazelor într-o pereche de propoziții din surse de știri. Metrici — acuratețe și scorul F1.
- **QQP** (*Quora Question Pairs*) — sarcina de identificare a întrebărilor duplicate din comunitatea Quora. Metrici — acuratețe și scorul F1.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — sarcina de comparare semantică a două propoziții. Modelul trebuie să prezică gradul de similaritate semantică pe o scară de la 1 la 5. Metrici — coeficienții de corelație Pearson și Spearman.
- **MNLI** (*Multi-Genre Natural Language Inference*) — sarcina de recunoaștere a implicației textuale pe exemplul perechilor de propoziții din surse de genuri diferite (implicație, contradicție, neutralitate). Rezultatele sunt evaluate separat pe subseturile corespunzătoare (*matched*) și necorespunzătoare (*mismatched*).
- **QNLI** (*Question Natural Language Inference*) — sarcina obținută prin transformarea dataset-ului SQuAD. Este necesar să se determine dacă o propoziție dintr-un paragraf conține răspunsul la o întrebare dată.
- **RTE** (*Recognizing Textual Entailment*) — un dataset cumulativ de implicație textuală, care reunește mai multe colecții mici. Sarcina — clasificarea binară a relației dintre propoziții.
- **WNLI** (*Winograd NLI*) — o versiune modificată a schemei Winograd, adaptată la formatul NLI. Sarcina de rezolvare a anaforizării: sistemului i se dă o propoziție cu un pronume ambiguu, iar acesta trebuie să indice la care dintre cele două obiecte se referă.

## Metodologia de evaluare

Pentru evaluarea pe GLUE, cercetătorii trimit predicțiile modelului lor pe un server dedicat, după care primesc calculul automat al metricilor pentru fiecare sarcină și un scor agregat.

- **GLUE-score** — indicatorul final, calculat ca valoarea medie a rezultatelor pentru toate cele nouă sarcini principale.
- **Leaderboard** — tabel public care reflectă starea actuală a domeniului și arată care modele se descurcă mai bine cu sarcinile NLU. Utilizarea seturilor de test ascunse asigură o comparare corectă.
- **Set de diagnosticare** — un set special de 1100 de exemple, adnotate manual de experți pentru analiză lingvistică fină. Acesta nu influențează clasamentul, ci servește ca instrument de analiză calitativă pentru a verifica ce fenomene lingvistice (semantică lexicală, logică, bun simț) modelul le poate recunoaște și cu care întâmpină dificultăți<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-glue_paper-1)</sup>.

## Rezultate și impactul asupra industriei

La lansarea GLUE în 2018, cele mai bune modele din acel moment (de exemplu, BiLSTM cu ELMo) atingeau un rezultat agregat de aproximativ **70 de puncte** (pe o scară 0–100), ceea ce era semnificativ sub nivelul uman (aproximativ 87 de puncte)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-human_vs_muppet-2)</sup>.

Apariția GLUE și a leaderboard-ului deschis a stimulat un progres rapid în domeniul transferului de cunoștințe în NLP.

- Până în mai 2019, în mai puțin de un an, noua generație de modele bazate pe transformere (în primul rând, BERT) a ridicat ștacheta *state-of-the-art* la **83,9 puncte**.
- În a doua jumătate a anului 2019, benchmark-ul GLUE a fost practic „rezolvat": cele mai bune sisteme s-au apropiat considerabil de nivelul uman, iar pe unele sarcini l-au depășit chiar<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-w4ngatang_superglue-3)</sup>.

GLUE a jucat un rol imens ca **punct de referință unic** în dezvoltarea modelelor de înțelegere a limbajului. Datorită lui, cercetătorii au putut compara direct diferite arhitecturi pe un set complex de sarcini, să identifice punctele forte și slabe ale abordărilor și să schimbe rapid realizările prin intermediul leaderboard-ului public.

## SuperGLUE: dezvoltarea ulterioară

Succesul rapid al GLUE a condus la faptul că, după doar un an, același colectiv de autori, cu participarea colegilor de la Facebook AI, a prezentat un nou set mai dificil, denumit **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_note-venturebeat_superglue-4)</sup>.

SuperGLUE a fost anunțat la sfârșitul anului 2019 ca un set de teste „mai dificil de rezolvat" (*stickier*), menit să recreeze decalajul dintre capacitățile modelelor moderne și ale oamenilor. Acesta includea opt sarcini care necesitau o înțelegere și mai profundă a limbajului, precum și instrumente și reguli îmbunătățite pentru participanți. Deși GLUE continuă să fie utilizat ca test de bază, principalul focar al îmbunătățirii competitive s-a mutat pe SuperGLUE și pe alte benchmark-uri mai specializate.

## Referințe

- Site-ul oficial al GLUE Benchmark
- Pagina GLUE pe Papers With Code cu rezultatele modelelor

## Bibliografie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(RO)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
