---
title: "GLUE Benchmark (PL)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(PL)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 2432
wiki_created_at: 2026-09-06T23:03:56Z
wiki_modified_at: 2026-09-06T23:03:56Z
downloaded_at: 2026-09-07T22:51:09Z
---

# GLUE Benchmark (PL)

**GLUE** (akronim od **General Language Understanding Evaluation**, „Ogólna ocena rozumienia języka") — to wielozadaniowy benchmark do oceny jakości modeli przetwarzania języka naturalnego (NLU). Benchmark został zaproponowany w 2018 roku przez grupę badaczy z Uniwersytetu Nowojorskiego, Uniwersytetu Waszyngtońskiego i DeepMind, w tym **Alexa Wanga** i **Samuela Bowmana**, i zyskał szerokie rozpowszechnienie w społeczności badawczej<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-glue_paper-1)</sup>.

Głównym celem GLUE jest zapewnienie jednolitego, neutralnego i wymagającego zestawu testów do porównawczej oceny możliwości modeli NLU na zróżnicowanym zbiorze zadań wykraczających poza jedną konkretną dziedzinę. Benchmark zawiera platformę internetową z **leaderboardem** (tabelą rekordów), która zapewnia obiektywne porównanie modeli i zapobiega dopasowywaniu do danych testowych, ponieważ prawdziwe etykiety dla części testów nie są publikowane i dostępne wyłącznie przez serwer oceny. Zakłada się, że aby osiągnąć wysokie wyniki, model musi umieć wyodrębniać uniwersalne reprezentacje językowe i efektywnie przenosić wiedzę między różnymi typami zadań.

## Skład i zadania benchmarku

Benchmark GLUE łączy dziewięć różnych zadań rozumienia języka, opartych na już istniejących i trudnych dla systemów AI datasetach. Wszystkie zadania sformułowane są jako klasyfikacja lub regresja na pojedynczym zdaniu bądź parze zdań<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — zadanie określania gramatycznej akceptowalności zdania. Metryka jakości — współczynnik korelacji Matthewsa.
- **SST-2** (*Stanford Sentiment Treebank*) — zadanie określania wydźwięku (pozytywnego/negatywnego) recenzji filmowej. Metryka — dokładność (*accuracy*).
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — zadanie wykrywania parafraz w parze zdań pochodzących ze źródeł prasowych. Metryki — dokładność i miara F1.
- **QQP** (*Quora Question Pairs*) — zadanie wykrywania duplikatów pytań ze społeczności Quora. Metryki — dokładność i miara F1.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — zadanie semantycznego porównywania dwóch zdań. Model musi przewidzieć stopień bliskości znaczeniowej w skali od 1 do 5. Metryki — współczynnik korelacji Pearsona i Spearmana.
- **MNLI** (*Multi-Genre Natural Language Inference*) — zadanie rozpoznawania wnioskowania tekstowego na przykładzie par zdań z różnogatunkowych źródeł (wynikanie, sprzeczność, neutralność). Wyniki oceniane są osobno na podzbiorze zgodnym (*matched*) i niezgodnym (*mismatched*).
- **QNLI** (*Question Natural Language Inference*) — zadanie powstałe przez przekształcenie datasetu SQuAD. Należy określić, czy zdanie z akapitu zawiera odpowiedź na zadane pytanie.
- **RTE** (*Recognizing Textual Entailment*) — zbiorczy dataset dotyczący wnioskowania tekstowego, łączący kilka mniejszych kolekcji. Zadanie polega na binarnej klasyfikacji relacji między zdaniami.
- **WNLI** (*Winograd NLI*) — zmodyfikowana wersja schematu Winograda, zaadaptowana do formatu NLI. Zadanie rozwiązywania anafory: systemowi podawane jest zdanie z niejednoznacznym zaimkiem i należy wskazać, do którego z dwóch obiektów on się odnosi.

## Metodyka oceniania

Aby dokonać ewaluacji na GLUE, badacze przesyłają predykcje swojego modelu na specjalny serwer, po czym otrzymują automatyczne obliczenie metryk dla każdego zadania oraz wynik zbiorczy.

- **GLUE-score** — wynik końcowy obliczany jako średnia wartość wyników ze wszystkich dziewięciu głównych zadań.
- **Leaderboard** — publiczna tabela odzwierciedlająca aktualny stan rzeczy i pokazująca, które modele lepiej radzą sobie z zadaniami NLU. Zastosowanie ukrytych zestawów testowych zapewnia uczciwe porównanie.
- **Zestaw diagnostyczny** — specjalny zestaw 1100 przykładów ręcznie opatrzonych adnotacjami przez ekspertów, służący do szczegółowej analizy lingwistycznej. Nie wpływa na ranking, lecz stanowi narzędzie analizy jakościowej pozwalające sprawdzić, jakie zjawiska językowe (semantyka leksykalna, logika, zdrowy rozsądek) model potrafi rozpoznać, a z jakimi ma trudności<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-glue_paper-1)</sup>.

## Wyniki i wpływ na branżę

Przy uruchomieniu GLUE w 2018 roku najlepsze ówczesne modele (np. BiLSTM z ELMo) osiągały łączny wynik około **70 punktów** (w skali 0–100), co było istotnie poniżej poziomu człowieka (około 87 punktów)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-human_vs_muppet-2)</sup>.

Pojawienie się GLUE i otwartego leaderboardu pobudziło gwałtowny postęp w dziedzinie uczenia transferowego w NLP.

- Do maja 2019 roku, w ciągu niespełna roku, nowa generacja modeli opartych na transformerach (przede wszystkim BERT) podniosła poprzeczkę *state-of-the-art* do **83,9 punktu**.
- W drugiej połowie 2019 roku benchmark GLUE został faktycznie „zaliczony": najlepsze systemy zbliżyły się do poziomu człowieka, a na niektórych zadaniach nawet go przekroczyły<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-w4ngatang_superglue-3)</sup>.

GLUE odegrał ogromną rolę jako **jednolity punkt odniesienia** w rozwoju modeli rozumienia języka. Dzięki niemu badacze mogli bezpośrednio porównywać różne architektury na złożonym zestawie zadań, identyfikować mocne i słabe strony podejść oraz szybko wymieniać się osiągnięciami za pośrednictwem publicznego leaderboardu.

## SuperGLUE: dalszy rozwój

Błyskawiczny sukces GLUE doprowadził do tego, że już po roku ten sam kolektyw autorów przy udziale współpracowników z Facebook AI przedstawił nowy, bardziej wymagający zestaw pod nazwą **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_note-venturebeat_superglue-4)</sup>.

SuperGLUE został ogłoszony pod koniec 2019 roku jako „trudniejszy do pokonania" (*stickier*) zestaw testów, mający na celu ponowne stworzenie wyraźnej luki między możliwościami współczesnych modeli a człowiekiem. Znalazło się w nim osiem zadań wymagających jeszcze głębszego rozumienia języka, a także ulepszono narzędzia i zasady dla uczestników. Choć GLUE jest nadal stosowany jako test bazowy, główny fokus rywalizacji przesunął się na SuperGLUE i inne, bardziej wyspecjalizowane, benchmarki.

## Linki zewnętrzne

- Oficjalna strona GLUE Benchmark
- Strona GLUE na Papers With Code z wynikami modeli

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(PL)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
