---
title: "SuperGLUE (benchmark) (PL)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 7012
wiki_created_at: 2026-09-07T00:14:33Z
wiki_modified_at: 2026-09-07T00:14:33Z
downloaded_at: 2026-09-07T23:16:55Z
---

# SuperGLUE (benchmark) (PL)

**SuperGLUE** — to kompleksowy **benchmark** (zestaw zadań testowych) służący do oceny systemów przetwarzania języka naturalnego, zwłaszcza **dużych modeli językowych** (LLM)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Został przedstawiony w 2019 roku przez grupę badaczy pod kierownictwem Alexa Wanga z Uniwersytetu Nowojorskiego, przy udziale Facebook AI Research i innych organizacji<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.

Powstanie SuperGLUE było odpowiedzią na fakt, że w połowie 2019 roku poprzedni benchmark GLUE stał się \\łatwym zadaniem\\ dla współczesnych modeli: łączny wynik najlepszych modeli na GLUE osiągnął 88,4, przekraczając średni poziom człowieka (87,1)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W ten sposób margines dalszego postępu uległ znacznemu zmniejszeniu<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W odpowiedzi na to autorzy opracowali SuperGLUE jako trudniejszą alternatywę, zdolną zapewnić bardziej rygorystyczną weryfikację rozumienia języka przez modele<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Celem SuperGLUE jest dostarczenie neutralnego i trudno \\obchodzonego\\ wskaźnika postępu w dziedzinie ogólnego rozumienia języka angielskiego<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Oczekiwano, że zauważalna poprawa wyników na SuperGLUE będzie wymagać istotnych innowacji w metodach Machine Learning — na przykład efektywniejszego uczenia na małych próbkach, uczenia wielozadaniowego i samosuperwizowanego<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Innymi słowy, SuperGLUE zawiera zadania, które są proste dla człowieka, lecz trudne dla sztucznej inteligencji<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>, aby stymulować opracowywanie modeli z prawdziwie głębokim rozumieniem języka.

## Cechy charakterystyczne i różnice w stosunku do GLUE

SuperGLUE w dużej mierze powiela format GLUE — oferuje jeden **zintegrowany wskaźnik jakości** obliczany na podstawie zestawu zadań, publiczny **leaderboard** oraz **narzędzia** do analizy modeli<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Jednak SuperGLUE wprowadza szereg ulepszeń i nowości w stosunku do swojego poprzednika<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>:

- **Trudniejsze zadania**: w SuperGLUE wybrano **osiem najtrudniejszych zadań**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Dwa z nich odziedziczono z GLUE (jako najtrudniejsze w tamtym benchmarku), pozostałe wybrano spośród nowych kandydatów na podstawie ich trudności dla współczesnych modeli NLP<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Tym samym benchmark koncentruje się na tych aspektach rozumienia, w których modele wcześniej osiągały najgorsze wyniki.
- **Różnorodność formatów**: o ile w GLUE wszystkie zadania sprowadzały się do klasyfikacji zdań lub par zdań, o tyle SuperGLUE obejmuje szerszy **wachlarz formatów**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Oprócz klasyfikacji dodano zadania dotyczące **rozwiązywania koreferencji** oraz **odpowiadania na pytania**, wymagające od modelu rozumienia spójnego tekstu i **wnioskowania logicznego**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **Ocena człowieka dla wszystkich zadań**: dla każdego zadania SuperGLUE wyznaczono **bazowy poziom wydajności człowieka** (non-expert)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>, potwierdzający, że nawet silne modele typu BERT istotnie ustępowały człowiekowi w momencie uruchomienia benchmarku<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Obecność **ludzkiego punktu odniesienia** (~90% łącznie) zapewnia \\margines\\ wzrostu dla modelu i służy jako cel docelowy<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **Przejrzyste zasady i narzędzia**: zrewidowano zasady umieszczania wyników na leaderboardzie (w celu zapewnienia uczciwego porównania i wskazania wkładu autorów datasetów)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Opublikowano również nowy, otwarty zestaw narzędzi ułatwiający fine-tuning i uczenie wielozadaniowe modeli na danych SuperGLUE<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.

Łącznie środki te czynią SuperGLUE bardziej wiarygodnym testem **uogólnionych zdolności językowych** modeli, uniemożliwiającym osiąganie wysokich wyników dzięki wąskiemu „oszukiwaniu" lub dostosowywaniu się do specyficznych formatów poprzedniego GLUE<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.

## Zestaw zadań SuperGLUE

SuperGLUE składa się z **ośmiu zadań** obejmujących różne aspekty rozumienia tekstu.

- **BoolQ** (Boolean Questions): zadanie typu **pytanie-odpowiedź (QA)**, w którym każdy przykład zawiera krótki tekst (fragment z Wikipedii) oraz pytanie, na które należy odpowiedzieć \\tak\\ lub \\nie\\<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Pytania są formułowane przez użytkowników (na podstawie zapytań wyszukiwarki Google) i wymagają wydobycia jawnego lub ukrytego faktu z tekstu; miarą jakości jest odsetek poprawnych odpowiedzi (accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): zadanie dotyczące **wnioskowania logicznego** (textual entailment) z trzema klasami<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Dataset składa się z krótkich tekstów zawierających zdania złożone podrzędnie; zadaniem jest określenie, w jakim stopniu autor tekstu jest **zaangażowany w prawdziwość** zagnieżdżonego stwierdzenia<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W istocie jest to sprawdzenie, czy dane twierdzenie wynika z podanego kontekstu. Zadanie jest trudne ze względu na małą wielkość próbki (ok. 250 przykładów) i niezrównoważenie klas; jakość oceniana jest na podstawie dokładności i miary F1 uśrednionej po klasach<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): zadanie dotyczące **rozumowania przyczynowo-skutkowego**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Model otrzymuje przesłankę (jedno zdanie) i musi wybrać właściwą przyczynę lub skutek spośród dwóch wariantów<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Wszystkie przykłady COPA są sformułowane ręcznie i wymagają **zdrowego rozsądku** do ustalenia związku przyczynowo-skutkowego. Tematyka obejmuje sytuacje z blogów i specjalistycznej encyklopedii; miarą jakości jest dokładność (odsetek poprawnych wyborów)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Przykład: dane zdanie „dziecko nabyło odporność na chorobę" i pytanie „jaka jest przyczyna?" — człowiek od razu rozumie, że poprawna odpowiedź to „otrzymało szczepionkę", podczas gdy model musi odgadnąć związek przyczynowy<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): zadanie dotyczące **rozumienia tekstu wielozdaniowego** z elementami wielokrotnego wyboru<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Model otrzymuje akapit tekstu, pytanie dotyczące jego treści oraz listę możliwych odpowiedzi; należy określić, które odpowiedzi są poprawne (w każdym pytaniu może być kilka poprawnych odpowiedzi)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Cecha charakterystyczna: odpowiedź na pytanie wymaga z reguły połączenia informacji z kilku zdań tekstu, co sprawdza zdolność modelu do **łączenia faktów**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Jakość mierzona jest dwiema miarami: F1 dla odpowiedzi (uwzględnia częściowo poprawne zestawy) oraz Exact Match — odsetek pytań, na które podano w pełni poprawne zestawy odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): zadanie dotyczące **czytania ze zrozumieniem i wykorzystaniem wiedzy**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Stanowi zmodyfikowany test Cloze: dany jest tekst informacyjny (artykuł CNN/Daily Mail) i zdanie z brakującym słowem oznaczającym encję; model musi wybrać, która encja z tekstu pasuje w miejsce pominięcia<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Warianty odpowiedzi obejmują wszystkie encje wymienione w artykule, które mogą merytorycznie się pokrywać<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Skuteczne rozwiązanie wymaga rozumienia kontekstu i zdrowego rozsądku. Miarami jakości są maksymalny token-level F1 oraz Exact Match (dokładne dopasowanie) dla przewidywanych odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): zadanie binarnej klasyfikacji dotyczące **wynikania tekstowego** (entailment vs. not entailment)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Zestaw danych łączy przykłady z kilku konkursów poświęconych rozpoznawaniu wynikania tekstowego (seria RTE 1–5)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Każde zadanie zawiera parę fragmentów tekstowych (premise-hypothesis); model musi określić, czy hipoteza wynika z tekstu. W odróżnieniu od wielu dużych datasetów, RTE jest dość mały (ok. 2,5 tys. przykładów treningowych), lecz wykazał znaczne korzyści z transfer learningu: dokładność wzrosła z ~56% (poziom losowego zgadywania) do ~86% wraz z pojawieniem się modeli typu BERT<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Niemniej jednak w momencie uruchomienia SuperGLUE dokładność modeli nadal ustępowała człowiekowi o około 8 punktów procentowych<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>, dlatego RTE włączono jako jedno z zadań zachowujących lukę do poziomu ludzkiego.
- **WiC** (Word-in-Context): zadanie dotyczące **rozstrzygania wieloznaczności znaczenia słowa w kontekście** (WSD)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Podane są dwa niezależne zdania, w każdym z nich pojawia się to samo wieloznaczne słowo; należy określić, czy słowo to jest użyte **w tym samym znaczeniu** w obu przypadkach<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Dane pochodzą z zasobów słownikowych (WordNet, VerbNet, Wiktionary), obejmują więc szeroki zakres słów i znaczeń<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Zadanie sformalizowane jest jako klasyfikacja binarna i oceniane na podstawie odsetka poprawnych odpowiedzi. WiC wymaga od modelu rozumienia subtelnych różnic semantycznych, sprawdzając w istocie **semantykę leksykalną**.
- **WSC** (Winograd Schema Challenge): zadanie dotyczące **rozwiązywania koreferencji z użyciem zdrowego rozsądku**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Każde zadanie składa się z jednego zdania zawierającego zaimek oraz listy dwóch encji (rzeczowników) z tego samego zdania<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Należy określić, do którego z podanych rzeczowników **odnosi się dany zaimek**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Przykład klasycznego zdania winograd: „Trofeum nie zmieściło się w walizce, bo było za małe" — człowiek rozumie, że „ono" odnosi się do walizki (to walizka była za mała). Takie przykłady są niemożliwe do rozwiązania bez **wiedzy ogólnej i kontekstu**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W GLUE znajdował się już uproszczony wariant tego zadania (WNLI), jednak przez długi czas modele nie potrafiły osiągnąć na nim nawet poziomu losowości<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Dopiero specjalne techniki, takie jak dołączenie zewnętrznych danych z podobnymi przykładami, podniosły jakość modeli na WSC do ~90% ok. 2019 roku<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Jednak człowiek rozwiązuje zadania WSC niemal bezbłędnie (~96–100% poprawnych odpowiedzi)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W SuperGLUE uwzględniono oryginalną wersję WSC w formacie klasyfikacji binarnej (dla każdej pary „zaimek-encja" model odpowiada, czy są one koreferencyjne)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Zadanie to pozostaje jednym z najtrudniejszych testów wymagających rozumowania opartego na wiedzy ogólnej.

Wszystkie testy SuperGLUE posiadają **zamknięte zestawy testowe** z odpowiedziami nieznanymi twórcom modeli<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Modele przesyłają swoje predykcje na serwer, gdzie obliczany jest łączny wynik — uśredniona po zadaniach dokładność (dla zadań z wieloma miarami najpierw uśrednia się wewnętrzną miarę)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Tak jednolity **wynik SuperGLUE** upraszcza porównywanie modeli pod względem ogólnego poziomu inteligencji językowej.

## Wyniki i postęp modeli

Przy uruchomieniu SuperGLUE autorzy podali jako punkt odniesienia wyniki silnego modelu bazowego (wzmocnionego BERT) — i okazały się one **znacznie niższe od ludzkich** na wszystkich zadaniach<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Średnio najlepszy ówczesny model uzyskał około **20 punktów mniej** niż człowiek według łącznej metryki<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. W przypadku niektórych zadań różnica była szczególnie duża: na przykład w zadaniu WSC model ledwo osiągał ~65% dokładności wobec 100% u człowieka (różnica ~35 punktów)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Nawet w zadaniach sprawiających wrażenie \\łatwiejszych\\ (BoolQ, CB, RTE, WiC) systemy automatyczne ustępowały poziomowi ludzkiemu o ~10 punktów<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Różnice te potwierdziły, że SuperGLUE rzeczywiście stanowi poważne wyzwanie dla ówczesnych technologii i nie może być trywialnie rozwiązany.

Niemniej jednak już kilka miesięcy po pojawieniu się SuperGLUE nastąpił **gwałtowny postęp**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-neurips-main-1)</sup>. Pod koniec 2019 roku badacze Google przedstawili model **T5** (Text-To-Text Transfer Transformer) z 11 miliardami parametrów, który osiągnął łączny wynik 88,9, zbliżając się do ludzkiego poziomu ~89,8<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-reddit-t5-2)</sup>. W praktyce T5 poprawił poprzedni rekord na SuperGLUE od razu o 4,3 punktu i zredukował odsetek błędów niemal o jedną trzecią<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-reddit-t5-2)</sup>, pozostawiając jedynie minimalną różnicę **0,9 punktu** do wyniku człowieka<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-reddit-t5-2)</sup>. Twórcy zauważali, że SuperGLUE celowo dobrano tak, by zadania były proste dla ludzi, dlatego osiągnięcie przez model poziomu ~89% stało się ważnym kamieniem milowym<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-reddit-t5-2)</sup>.

Pierwszym modelem, któremu udało się **przewyższyć uśrednioną jakość człowieka**, był model Microsoftu **DeBERTa** (Decoding-enhanced BERT with disentangled attention)<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. W styczniu 2021 roku badacze ogłosili, że wersja DeBERTa z 1,5 mld parametrów uzyskała **89,9 punktu**, nieznacznie powyżej ludzkiego punktu odniesienia wynoszącego 89,8<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. Był to **pierwszy przypadek**, gdy pojedynczy model przewyższył człowieka według metryki SuperGLUE<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. Co więcej, ensemble złożony z kilku modeli DeBERTa podniósł rekord do ~90,3 punktu<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. Model DeBERTa wyprzedził poprzedniego lidera (Google T5) o około 0,6% i zademonstrował skuteczność nowych pomysłów w architekturze Transformer (rozdzielona reprezentacja treści i pozycji słów, ulepszony dekoder masek itp.)<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-syncedreview-deberta-4)</sup>.

Postęp nie zatrzymał się na osiągniętym poziomie: wraz ze wzrostem rozmiarów i złożoności modeli językowych wyniki na SuperGLUE nadal się poprawiały<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-scaling-5)</sup>. Pod koniec 2021 roku na czele leaderboardu znalazł się model Microsoftu **T-NLRv5** (rodzina Microsoft Turing NLR) — jeszcze bardziej zwiększył on dystans powyżej poziomu ludzkiego<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-scaling-5)</sup>. Ostatnie zadania GLUE dotychczas nieopanowane przez maszyny (np. subtelności NLI) zostały \\zamknięte\\ przez ten model, który zbliżył się do **pełnego parytetu z człowiekiem** nawet w najtrudniejszych podzadaniach<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-scaling-5)</sup>.

W latach 2022–2023 próg poziomu ludzkiego na SuperGLUE został pewnie przekroczony przez kilka niezależnych dużych modeli<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>. Na przykład model **PaLM** firmy Google (540 mld parametrów) po fine-tuningu na zadaniach SuperGLUE osiągnął około 90,4 punktu, a model **GPT-4** (opracowany przez OpenAI) uzyskał wynik nieco wyższy<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>. W połowie 2023 roku w tabeli liderów SuperGLUE znajdowało się kilka modeli z wynikiem powyżej 90 (tj. przekraczającym średni poziom człowieka)<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>. Można powiedzieć, że benchmark jest **praktycznie rozwiązany** przez współczesne systemy<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>: wyniki najlepszych modeli są tak wysokie, że przewyższają możliwości większości niewykwalifikowanych ludzi<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>. Ten sukces świadczy o gigantycznym postępie w NLP w krótkim czasie, lecz jednocześnie wskazuje na konieczność tworzenia nowych, jeszcze trudniejszych testów dla najnowszych modeli<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>. Pojawiają się już kolejne benchmarki (np. MMLU, BIG-Bench i inne), mające na celu sprawdzanie modeli pod kątem szerszego rozumienia i erudycji wykraczającej poza zakres zadań SuperGLUE<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-ainavigator-benchmarks-6)</sup>.

## Wpływ i dalsze badania

SuperGLUE ugruntował się zatem jako **ważny etap rozwoju metod ewaluacyjnych** w przetwarzaniu języka<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. W środowiskach entuzjastów i naukowych jego wyniki stały się swoistym \\papierkiem lakmusowym\\ dla nowych architektur LLM: osiągnięcie lub przekroczenie poziomu ludzkiego na SuperGLUE jest odbierane jako oznaka zaawansowanego modelu z głębokim rozumieniem języka<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. Znalazło to odzwierciedlenie również w praktyce — wiele współczesnych modeli językowych, które osiągnęły wysokie wyniki na SuperGLUE, stało się podstawą aplikacyjnych systemów pytań i odpowiedzi, agentów dialogowych, systemów streszczania tekstu i innych<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_note-microsoft-deberta-3)</sup>. SuperGLUE jest nadal wykorzystywany przez badaczy do fine-tuningu i porównywania algorytmów, choć czołowa pozycja przesuwa się stopniowo ku nowym granicom oceny sztucznej inteligencji.

## Odnośniki

- Oficjalna strona SuperGLUE
- Oryginalna artykuł SuperGLUE (NeurIPS)
- Artykuł Microsoftu o osiągnięciu poziomu ludzkiego przez DeBERTa
- Strona datasetu SuperGLUE na Papers With Code

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-neurips-main_1-58)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-reddit-t5_2-3)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-deberta_3-6)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">[↑](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-syncedreview-deberta_4-0) «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-microsoft-scaling_5-2)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(PL)#cite_ref-ainavigator-benchmarks_6-6)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
