---
title: "SuperGLUE (benchmark) (CS)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6999
wiki_created_at: 2026-09-07T00:14:22Z
wiki_modified_at: 2026-09-07T00:14:22Z
downloaded_at: 2026-09-07T23:16:48Z
---

# SuperGLUE (benchmark) (CS)

**SuperGLUE** — je komplexní **benchmark** (sada testovacích úloh) pro hodnocení systémů zpracování přirozeného jazyka, zejména **velkých jazykových modelů** (LLM)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Byl představen v roce 2019 skupinou výzkumníků pod vedením Alexe Wanga z Newyorské univerzity za účasti Facebook AI Research a dalších organizací<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.

Vznik SuperGLUE byl vyvolán tím, že v polovině roku 2019 se předchozí benchmark GLUE stal „triviální úlohou" pro tehdejší modely: souhrnné skóre nejlepších modelů na GLUE dosáhlo hodnoty 88,4, čímž překonalo průměrnou úroveň člověka (87,1)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Prostor pro další pokrok se tak výrazně zúžil<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. V reakci na to autoři vyvinuli SuperGLUE jako náročnější alternativu, která umožňuje přísnější ověření jazykového porozumění modelů<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Cílem SuperGLUE je poskytovat neutrální a těžko „přeučitelný" ukazatel pokroku v oblasti obecného jazykového porozumění pro anglický jazyk<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Očekávalo se, že znatelné zlepšení výsledků na SuperGLUE bude vyžadovat podstatné inovace v metodách machine learningu — například efektivnější učení z malých vzorků, multitaskové a self-supervised učení<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Jinými slovy, SuperGLUE obsahuje úlohy, které jsou pro člověka snadné, ale pro strojovou inteligenci obtížné<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>, aby stimuloval vývoj modelů s opravdu hlubokým jazykovým porozuměním.

## Vlastnosti a rozdíly oproti GLUE

SuperGLUE z velké části přebírá formát GLUE — nabízí jediný **souhrnný ukazatel kvality** napříč úlohami, veřejný **leaderboard** a **sadu nástrojů** pro analýzu modelů<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. SuperGLUE však oproti svému předchůdci přináší řadu vylepšení a novinek<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>:

- **Náročnější úlohy**: SuperGLUE obsahuje **osm nejtěžších úloh**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Dvě z nich jsou převzaty z GLUE (jako jeho nejtěžší úlohy), ostatní byly vybrány z nových kandidátů na základě jejich obtížnosti pro současné NLP modely<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Benchmark se tak soustředí na ty aspekty porozumění, kde modely dříve dosahovaly nejhorších výsledků.
- **Rozmanitost formátů**: zatímco v GLUE se všechny úlohy redukovaly na klasifikaci vět nebo dvojic vět, SuperGLUE zahrnuje **širší spektrum formátů**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Kromě klasifikace jsou přidány úlohy na **rozlišení koreference** a **zodpovídání otázek**, které od modelu vyžadují porozumění souvislému textu a **logické vyvozování**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **Hodnocení člověkem u všech úloh**: pro každou úlohu SuperGLUE je stanoven **základní výkonnostní práh člověka** (non-expert)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>, který potvrzuje, že i silné modely jako BERT při spuštění benchmarku výrazně zaostávaly za člověkem<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Existence **lidského referenčního bodu** (~90 % souhrnně) zajišťuje „prostor" pro růst modelu a slouží jako cílová hodnota<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **Transparentní pravidla a nástroje**: byla přepracována pravidla pro zveřejňování výsledků na leaderboardu (za účelem zajištění férového srovnání a uvedení přínosu autorů datových sad)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Byla také zveřejněna nová open-source sada nástrojů pro pohodlné fine-tuning a multitaskové trénování modelů na datech SuperGLUE<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.

Vzhledem k těmto opatřením je SuperGLUE spolehlivějším testem **obecných jazykových schopností** modelů, který neumožňuje dosáhnout vysokých výsledků úzkým podváděním nebo přizpůsobením se specifickým formátům předchozího GLUE<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.

## Sada úloh SuperGLUE

SuperGLUE se skládá z **osmi úloh** pokrývajících různé aspekty porozumění textu.

- **BoolQ** (Boolean Questions): úloha typu **otázka-odpověď (QA)**, kde je ke každému příkladu přiložen krátký text (výňatek z Wikipedie) a otázka, na níž je třeba odpovědět „ano" nebo „ne"<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Otázky jsou formulovány uživateli (z vyhledávacích dotazů Google) a vyžadují extrakci explicitního nebo implicitního faktu z textu; metrikou kvality je podíl správných odpovědí (accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): úloha na **logické vyplývání** (textual entailment) se třemi třídami<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Dataset se skládá z krátkých textů obsahujících souvětí; je třeba určit, do jaké míry je autor textu **zavázán k pravdivosti** vložené výpovědi<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Jde fakticky o ověření, zda tvrzení vyplývá z daného kontextu. Úloha je obtížná kvůli malé velikosti vzorku (cca 250 příkladů) a nevyvážení tříd; kvalita se hodnotí přesností a F1 skóre průměrovaným přes třídy<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): úloha na **kauzální uvažování**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Modelu je dána premisa (jedno věta) a je třeba vybrat správnou příčinu nebo důsledek ze dvou variant<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Všechny příklady COPA jsou formulovány ručně a vyžadují **zdravý rozum** pro stanovení příčinno-následkové souvislosti. Tematika zahrnuje situace z blogů a specializované encyklopedie; metrikou je přesnost (podíl správných výběrů)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Příklad: je dána věta „dítě získalo imunitu vůči nemoci" a otázka „jaká je příčina?" — člověk okamžitě pochopí, že správná odpověď je „dostalo vakcínu", zatímco model musí kauzální vztah odhadnout<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): úloha na **porozumění textu z více vět** s prvky multiple choice<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Model obdrží odstavec textu, otázku k obsahu odstavce a seznam možných odpovědí; je třeba určit, které odpovědi jsou správné (u každé otázky může být více správných odpovědí)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Specifika: pro zodpovězení otázky je zpravidla nutné propojit informace z více vět textu, což ověřuje schopnost modelu **spojovat fakta**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Kvalita se měří dvěma metrikami: F1 podle odpovědí (zohledňuje částečně správné sady) a Exact Match — podíl otázek, na které byly poskytnuty zcela správné sady odpovědí<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): úloha na **čtení s porozuměním a využitím znalostí**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Jedná se o modifikovaný Cloze test: je dán zpravodajský text (článek CNN/Daily Mail) a věta s chybějícím pojmenovaným výrazem; model musí vybrat, která entita z textu se hodí na místo výpustky<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Varianty odpovědí jsou zadány jako všechny entity zmíněné v článku, přičemž se mohou svou podstatou překrývat<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Úspěšné řešení vyžaduje porozumění kontextu a zdravý rozum. Metrikami jsou maximální token-level F1 a Exact Match (přesná shoda) u předpovězených odpovědí<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): úloha binární klasifikace na **textové vyplývání** (entailment vs. not entailment)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Dataset sdružuje příklady z několika soutěží na rozpoznávání textového vyvozování (série RTE 1–5)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Každý úkol obsahuje dvojici textových fragmentů (premise-hypothesis); model musí určit, zda hypotéza vyplývá z textu. Na rozdíl od mnoha velkých datových sad je RTE poměrně malý (cca 2 500 tréninkových příkladů), ale vykazoval značný přínos z transfer learningu: přesnost vzrostla z ~56 % (úroveň náhodného hádání) na ~86 % s příchodem modelů jako BERT<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Nicméně v době spuštění SuperGLUE přesnost modelů stále zaostávala za člověkem přibližně o 8 procentních bodů<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>, proto byl RTE zařazen jako jedna z úloh, které si zachovávaly mezeru do lidské úrovně.
- **WiC** (Word-in-Context): úloha na **rozlišení nejednoznačnosti významu slova v kontextu** (WSD)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Jsou dány dvě nezávislé věty, v každé z nich se vyskytuje totéž víceznačné slovo; je třeba určit, zda je toto slovo použito **ve stejném významu** v obou případech<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Data jsou převzata ze slovníkových zdrojů (WordNet, VerbNet, Wiktionary), takže pokrývají široké spektrum slov a významů<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Úloha je formalizována jako binární klasifikace a hodnotí se podílem správných odpovědí. WiC od modelu vyžaduje porozumění jemným sémantickým rozdílům, čímž fakticky testuje **lexikální sémantiku**.
- **WSC** (Winograd Schema Challenge): úloha na **rozlišení koreference s využitím zdravého rozumu**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Každý úkol se skládá z jedné věty obsahující zájmeno a seznamu dvou entit (podstatných jmen) z téže věty<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Je třeba určit, ke kterému z navržených podstatných jmen se **dané zájmeno vztahuje**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Příklad klasické winograd věty: „Pohár se nevešel do kufru, protože byl příliš malý" — člověk rozumí, že „byl" se vztahuje ke kufru (příliš malý byl kufr). Takové příklady nelze vyřešit bez **každodenních znalostí a kontextu**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. V GLUE již byla přítomna zjednodušená varianta této úlohy (WNLI), ale modely dlouhou dobu nedokázaly překonat ani úroveň náhody<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Teprve speciální postupy, jako přidání externích dat s podobnými příklady, zvedly kvalitu modelů na WSC na ~90 % do roku 2019<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Člověk přitom řeší úlohy WSC prakticky bez chyb (~96–100 % správných odpovědí)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Do SuperGLUE je zařazena původní verze WSC ve formátu binární klasifikace (pro každou dvojici „zájmeno-entita" model odpovídá, zda se shodují v referenci)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Tato úloha zůstává jedním z nejtěžších testů vyžadujících uvažování se zdravým rozumem.

Všechny testy SuperGLUE mají **uzavřené testovací sady** s odpověďmi neznámými vývojářům<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Modely odesílají své předpovědi na server, kde se vypočítá souhrnné skóre — přesnost průměrovaná přes úlohy (u úloh s více metrikami se nejprve průměrují interní metriky)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Takové jediné **SuperGLUE score** zjednodušuje porovnávání modelů podle celkové úrovně jazykové inteligence.

## Výsledky a pokrok modelů

Při spuštění SuperGLUE autoři uvedli jako referenční hodnotu výsledky silného základního modelu (posíleného BERT) — a ty se ukázaly jako **výrazně nižší než lidské** u všech úloh<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Průměrně nejlepší tehdejší model dosáhl přibližně o **20 bodů méně** než člověk podle souhrnné metriky<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. U jednotlivých úloh byla mezera obzvláště velká: například u úlohy WSC model sotva dosahoval ~65 % přesnosti oproti 100 % u člověka (rozdíl ~35 bodů)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Dokonce i u zdánlivě „jednodušších" úloh (BoolQ, CB, RTE, WiC) automatické systémy zaostávaly za lidskou úrovní přibližně o 10 bodů<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Tyto rozdíly potvrdily, že SuperGLUE skutečně představuje vážnou výzvu pro tehdejší technologie a nelze jej triviálně vyřešit.

Přesto jen několik měsíců po vzniku SuperGLUE nastal **rychlý pokrok**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup>. Na konci roku 2019 výzkumníci Googlu představili model **T5** (Text-To-Text Transfer Transformer) s 11 miliardami parametrů, který dosáhl souhrnného výsledku 88,9, čímž se velmi přiblížil lidské úrovni ~89,8<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-reddit-t5-2)</sup>. T5 fakticky zlepšil předchozí rekord na SuperGLUE ihned o 4,3 bodu a snížil podíl chyb o téměř třetinu<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-reddit-t5-2)</sup>, přičemž zanechal pouze minimální mezeru **0,9 bodu** do lidského skóre<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-reddit-t5-2)</sup>. Vývojáři poznamenali, že SuperGLUE byl záměrně sestaven tak, aby úlohy byly pro lidi snadné, takže dosažení ~89 % modelem bylo důležitým milníkem<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-reddit-t5-2)</sup>.

Prvním, komu se podařilo **překonat průměrnou lidskou kvalitu**, byl model od Microsoftu **DeBERTa** (Decoding-enhanced BERT with disentangled attention)<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. V lednu 2021 výzkumníci oznámili, že verze DeBERTa s 1,5 miliardami parametrů dosáhla **89,9 bodu**, mírně překračujíc lidský referenční bod 89,8<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. Byl to **první případ**, kdy jediný model překonal člověka podle metriky SuperGLUE<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. Navíc ensemble několika modelů DeBERTa zvýšil rekord na ~90,3 bodu<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. Model DeBERTa překonal předchozího lídra (Google T5) přibližně o 0,6 % a prokázal účinnost nových myšlenek v architektuře Transformer (oddělená reprezentace obsahu a pozice slov, vylepšený dekodér masek aj.)<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-syncedreview-deberta-4)</sup>.

Pokrok se nezastavil: s rostoucí velikostí a složitostí jazykových modelů se výsledky na SuperGLUE nadále zlepšovaly<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-scaling-5)</sup>. Ke konci roku 2021 se na vrcholu leaderboardu ocitl model Microsoftu **T-NLRv5** (rodina Microsoft Turing NLR) — ještě více zvětšil odstup nad lidskou úrovní<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-scaling-5)</sup>. Poslední pro stroje nezvládnuté úlohy GLUE (například jemnosti NLI) byly tímto modelem „uzavřeny", který se velmi přiblížil **plnohodnotné paritě s člověkem** i u nejobtížnějších dílčích úloh<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-scaling-5)</sup>.

V letech 2022–2023 byl práh lidské úrovně na SuperGLUE spolehlivě překonán několika nezávislými velkými modely<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>. Například model **PaLM** od Googlu (540 miliard parametrů) při doladění na úlohách SuperGLUE dosáhl přibližně 90,4 bodu a model **GPT-4** (vyvinutý OpenAI) vykázal výsledek ještě o něco vyšší<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>. V polovině roku 2023 bylo v tabulce lídrů SuperGLUE hned několik modelů s výsledkem přes 90 (tedy překračujícím průměrnou lidskou úroveň)<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>. Lze říci, že benchmark je **moderními systémy prakticky vyřešen**<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>: skóre nejlepších modelů je natolik vysoké, že překonává možnosti většiny nekvalifikovaných lidí<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>. Tento úspěch dokládá obrovský pokrok v NLP za krátkou dobu, ale zároveň poukazuje na potřebu nových, ještě náročnějších testů pro nejnovější modely<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>. Již se objevují navazující benchmarky (například MMLU, BIG-Bench aj.), jejichž cílem je testovat modely na širší porozumění a erudici přesahující rámec úloh SuperGLUE<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup>.

## Vliv a další výzkum

SuperGLUE se tak zařadil jako **důležitá etapa vývoje hodnoticích metodik** ve zpracování jazyka<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. V nadšeneckých i vědeckých kruzích se jeho výsledky staly jakýmsi „lakmusovým papírkem" pro nové architektury LLM: dosažení nebo překročení lidské úrovně na SuperGLUE je vnímáno jako znak pokročilého modelu s hlubokým jazykovým porozuměním<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. To se odrazilo i v praxi — mnohé současné jazykové modely, které dosáhly vysokých výsledků na SuperGLUE, se staly základem aplikovaných systémů pro otázky a odpovědi, dialogových agentů, systémů sumarizace textu aj.<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup>. SuperGLUE je nadále využíván výzkumníky pro fine-tuning a porovnávání algoritmů, i když přední postavení se nyní postupně přesouvá k novým horizontům hodnocení umělé inteligence.

## Odkazy

- Oficiální stránky SuperGLUE
- Původní článek SuperGLUE (NeurIPS)
- Článek Microsoftu o dosažení lidské úrovně modelem DeBERTa
- Stránka datasetu SuperGLUE na Papers With Code

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Poznámky

<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-neurips-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-reddit-t5-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-deberta-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-syncedreview-deberta-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-microsoft-scaling-5)</sup> <sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_note-ainavigator-benchmarks-6)</sup> \</references\>

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-neurips-main_1-59)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-reddit-t5_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-reddit-t5_2-4)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-6)</sup> <sup>[3.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-deberta_3-7)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">↑ <sup>[4.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-syncedreview-deberta_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-syncedreview-deberta_4-1)</sup> «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-scaling_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-microsoft-scaling_5-3)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-6)</sup> <sup>[6.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(CS)#cite_ref-ainavigator-benchmarks_6-7)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
