---
title: "SuperGLUE (benchmark) (DE)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 7000
wiki_created_at: 2026-09-07T00:14:23Z
wiki_modified_at: 2026-09-07T00:14:23Z
downloaded_at: 2026-09-07T23:16:49Z
---

# SuperGLUE (benchmark) (DE)

**SuperGLUE** ist ein umfassender **Benchmark** (eine Sammlung von Testaufgaben) zur Bewertung von Systemen zur Verarbeitung natürlicher Sprache, insbesondere von **großen Sprachmodellen** (LLMs)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Er wurde 2019 von einer Forschergruppe unter der Leitung von Alex Wang von der New York University in Zusammenarbeit mit Facebook AI Research und anderen Organisationen vorgestellt<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.

Die Entwicklung von SuperGLUE wurde notwendig, da der vorherige Benchmark GLUE bis Mitte 2019 für moderne Modelle zu einer „einfachen Aufgabe“ geworden war: Die Gesamtpunktzahl der besten Modelle auf GLUE erreichte 88,4 und übertraf damit das durchschnittliche menschliche Niveau (87,1)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Dadurch verringerte sich der Spielraum für weitere Fortschritte<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Als Reaktion darauf entwickelten die Autoren SuperGLUE als eine anspruchsvollere Alternative, die eine strengere Überprüfung des Sprachverständnisses von Modellen ermöglicht<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Das Ziel von SuperGLUE ist es, eine neutrale und schwer zu „überlernende“ Metrik für den Fortschritt im allgemeinen Sprachverständnis für die englische Sprache bereitzustellen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Es wurde erwartet, dass eine signifikante Verbesserung der Ergebnisse auf SuperGLUE wesentliche Innovationen in den Methoden des maschinellen Lernens erfordern würde – zum Beispiel effizienteres Lernen mit kleinen Stichproben, Multi-Task-Learning und Self-Supervised Learning<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Mit anderen Worten, SuperGLUE enthält Aufgaben, die für Menschen einfach, aber für künstliche Intelligenz schwierig sind<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>, um die Entwicklung von Modellen mit einem wirklich tiefen Sprachverständnis zu fördern.

## Merkmale und Unterschiede zu GLUE

SuperGLUE folgt in vielerlei Hinsicht dem Format von GLUE – es bietet eine einzige **aggregierte Qualitätsmetrik** über eine Reihe von Aufgaben, ein öffentliches **Leaderboard** und ein **Toolkit** zur Analyse von Modellen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. SuperGLUE bringt jedoch eine Reihe von Verbesserungen und Neuerungen gegenüber seinem Vorgänger mit sich<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>:

- **Anspruchsvollere Aufgaben**: Für SuperGLUE wurden **acht der schwierigsten Aufgaben** ausgewählt<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Zwei davon wurden von GLUE übernommen (als einige der schwierigsten dort), die restlichen wurden aus neuen Kandidaten aufgrund ihrer Schwierigkeit für moderne NLP-Modelle ausgewählt<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Somit konzentriert sich der Benchmark auf jene Aspekte des Verständnisses, bei denen Modelle zuvor die schlechtesten Ergebnisse zeigten.
- **Vielfältige Formate**: Während bei GLUE alle Aufgaben auf die Klassifizierung von Sätzen oder Satzpaaren hinausliefen, umfasst SuperGLUE ein **breiteres Spektrum an Formaten**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Neben der Klassifizierung wurden Aufgaben zur **Koreferenzauflösung** und zur **Beantwortung von Fragen** hinzugefügt, die vom Modell das Verständnis zusammenhängender Texte und **logisches Schließen** erfordern<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **Menschliche Bewertung für alle Aufgaben**: Für jede Aufgabe in SuperGLUE wurde eine **Baseline für die menschliche Leistung** (Nicht-Experten) berechnet<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>, was bestätigt, dass selbst starke Modelle wie BERT zum Zeitpunkt der Einführung des Benchmarks den Menschen deutlich unterlegen waren<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Das Vorhandensein eines **menschlichen Referenzwerts** (insgesamt ca. 90 %) bietet einen „Puffer“ für das Wachstum der Modelle und dient als Zielvorgabe<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **Transparente Regeln und Werkzeuge**: Die Regeln für die Veröffentlichung von Ergebnissen auf dem Leaderboard wurden überarbeitet, um einen fairen Vergleich zu gewährleisten und die Beiträge der Datensatz-Autoren zu würdigen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Zudem wurde ein neues Open-Source-Toolkit veröffentlicht, um das Finetuning und das Multi-Task-Learning von Modellen auf SuperGLUE-Daten zu erleichtern<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.

Zusammengenommen machen diese Maßnahmen SuperGLUE zu einem zuverlässigeren Test für die **verallgemeinerten Sprachfähigkeiten** von Modellen, der es nicht erlaubt, hohe Ergebnisse durch enges „Cheating“ oder eine Anpassung an die spezifischen Formate des früheren GLUE zu erzielen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.

## Der Aufgabensatz von SuperGLUE

SuperGLUE besteht aus **acht Aufgaben**, die verschiedene Aspekte des Textverständnisses abdecken.

- **BoolQ** (Boolean Questions): Eine Aufgabe vom Typ **Frage-Antwort (QA)**, bei der zu jedem Beispiel ein kurzer Text (ein Auszug aus Wikipedia) und eine Frage gegeben werden, die mit „Ja“ oder „Nein“ beantwortet werden muss<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Die Fragen wurden von Nutzern formuliert (aus Google-Suchanfragen) und erfordern das Extrahieren expliziter oder impliziter Fakten aus dem Text; die Qualitätsmetrik ist der Anteil korrekter Antworten (Accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): Eine Aufgabe zur **logischen Folgerung** (Textual Entailment) mit drei Klassen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Der Datensatz besteht aus kurzen Texten mit komplexen Satzgefügen; es muss bestimmt werden, inwieweit der Autor des Textes **sich auf die Wahrheit** der eingebetteten Aussage **festlegt**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Im Grunde wird geprüft, ob eine Aussage aus dem gegebenen Kontext abgeleitet werden kann. Die Aufgabe ist aufgrund des kleinen Stichprobenumfangs (ca. 250 Beispiele) und der unausgewogenen Klassenverteilung schwierig; die Qualität wird anhand der Genauigkeit und des F1-Scores, gemittelt über die Klassen, bewertet<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): Eine Aufgabe zum **kausalen Schließen**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Dem Modell wird eine Prämisse (ein Satz) gegeben, und es muss die richtige Ursache oder Folge aus zwei Optionen auswählen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Alle COPA-Beispiele sind manuell formuliert und erfordern **gesunden Menschenverstand**, um eine Ursache-Wirkungs-Beziehung herzustellen. Die Themen umfassen Situationen aus Blogs und einer spezialisierten Enzyklopädie; die Metrik ist die Genauigkeit (Anteil der richtigen Wahlen)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Beispiel: Gegeben ist der Satz „Das Kind entwickelte eine Immunität gegen die Krankheit“ und die Frage „Was ist die Ursache?“ – ein Mensch versteht sofort, dass die richtige Antwort „Es erhielt einen Impfstoff“ ist, während Modelle die kausale Verbindung erraten müssen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): Eine Aufgabe zum **Leseverständnis über mehrere Sätze** mit Multiple-Choice-Elementen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Das Modell erhält einen Textabschnitt, eine Frage zu dessen Inhalt und eine Liste möglicher Antworten; es muss bestimmen, welche Antworten richtig sind (bei jeder Frage können mehrere Antworten korrekt sein)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Eine Besonderheit ist, dass zur Beantwortung der Frage in der Regel Informationen aus mehreren Sätzen des Textes kombiniert werden müssen, was die Fähigkeit des Modells zur **Verknüpfung von Fakten** prüft<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Die Qualität wird mit zwei Metriken gemessen: F1 über die Antworten (berücksichtigt teilweise korrekte Antwortsätze) und Exact Match – der Anteil der Fragen, bei denen alle Antworten vollständig korrekt sind<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): Eine Aufgabe zum **Leseverständnis unter Einbeziehung von Allgemeinwissen**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Es handelt sich um einen modifizierten Cloze-Test: Gegeben sind ein Nachrichtentext (ein Artikel von CNN/Daily Mail) und ein Satz mit einem fehlenden Substantiv (Entität); das Modell muss auswählen, welche Entität aus dem Text an die Stelle der Lücke passt<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Als Antwortmöglichkeiten werden alle im Artikel erwähnten Entitäten vorgegeben, die inhaltlich ähnlich sein können<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Eine erfolgreiche Lösung erfordert Kontextverständnis und gesunden Menschenverstand. Die Metriken sind der maximale Token-Level-F1 und Exact Match (exakte Übereinstimmung) für die vorhergesagten Antworten<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): Eine binäre Klassifikationsaufgabe zum **Textual Entailment** (Entailment vs. Non-Entailment)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Der Datensatz vereint Beispiele aus mehreren Wettbewerben zur Erkennung von textuellen Folgerungen (RTE-Serie 1-5)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Jede Aufgabe enthält ein Paar von Textfragmenten (Prämisse-Hypothese); das Modell muss bestimmen, ob die Hypothese aus dem Text folgt. Im Gegensatz zu vielen großen Datensätzen ist RTE recht klein (ca. 2.500 Trainingsbeispiele), hat aber erheblich vom Transfer-Learning profitiert: Die Genauigkeit stieg von ~56 % (Zufallsniveau) auf ~86 % mit dem Aufkommen von Modellen wie BERT<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Dennoch lag die Genauigkeit der Modelle zum Zeitpunkt der Einführung von SuperGLUE immer noch etwa 8 Prozentpunkte unter der des Menschen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>, weshalb RTE als eine der Aufgaben aufgenommen wurde, bei denen noch ein Abstand zum menschlichen Niveau bestand.
- **WiC** (Word-in-Context): Eine Aufgabe zur **Disambiguierung der Wortbedeutung im Kontext** (WSD)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Gegeben sind zwei unabhängige Sätze, in denen jeweils dasselbe mehrdeutige Wort vorkommt; es muss bestimmt werden, ob dieses Wort in beiden Fällen **in derselben Bedeutung** verwendet wird<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Die Daten stammen aus lexikalischen Ressourcen (WordNet, VerbNet, Wiktionary) und decken daher ein breites Spektrum an Wörtern und Bedeutungen ab<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Die Aufgabe ist als binäre Klassifikation formuliert und wird nach dem Anteil korrekter Antworten bewertet. WiC erfordert vom Modell das Verständnis feiner semantischer Unterschiede und prüft damit faktisch die **lexikalische Semantik**.
- **WSC** (Winograd Schema Challenge): Eine Aufgabe zur **Koreferenzauflösung unter Verwendung von gesundem Menschenverstand**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Jede Aufgabe besteht aus einem Satz, der ein Pronomen enthält, und einer Liste von zwei Entitäten (Substantiven) aus demselben Satz<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Es muss bestimmt werden, auf welches der vorgeschlagenen Substantive **sich das Pronomen bezieht**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Ein klassisches Winograd-Schema-Beispiel lautet: „Die Trophäe passte nicht in den Koffer, weil er zu klein war“ – ein Mensch versteht, dass „er“ sich auf den Koffer bezieht (der Koffer war zu klein). Solche Beispiele lassen sich ohne **Alltagswissen und Kontext** nicht lösen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. In GLUE gab es bereits eine vereinfachte Version dieser Aufgabe (WNLI), aber die Modelle konnten lange Zeit nicht einmal das Zufallsniveau übertreffen<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Erst spezielle Techniken, wie das Hinzufügen externer Daten mit ähnlichen Beispielen, hoben die Leistung der Modelle auf WSC bis 2019 auf ~90 % an<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Menschen lösen WSC-Aufgaben jedoch praktisch fehlerfrei (~96-100 % richtige Antworten)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. In SuperGLUE ist die Originalversion von WSC als binäre Klassifikationsaufgabe enthalten (für jedes Paar „Pronomen-Entität“ antwortet das Modell, ob sie referenziell übereinstimmen)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Diese Aufgabe bleibt einer der schwierigsten Tests, der Common-Sense-Reasoning erfordert.

Alle Tests von SuperGLUE haben **private Testdatensätze** mit für die Entwickler unbekannten Antworten<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Die Modelle senden ihre Vorhersagen an einen Server, auf dem eine Gesamtpunktzahl berechnet wird – die über die Aufgaben gemittelte Genauigkeit (bei Aufgaben mit mehreren Metriken wird zuerst die interne Metrik gemittelt)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Dieser einheitliche **SuperGLUE-Score** vereinfacht den Vergleich von Modellen hinsichtlich ihres allgemeinen sprachlichen Intelligenzniveaus.

## Ergebnisse und Fortschritt der Modelle

Bei der Einführung von SuperGLUE gaben die Autoren als Referenz die Ergebnisse eines starken Basismodells (eines verbesserten BERT) an – und diese fielen bei allen Aufgaben **deutlich schlechter als die menschlichen** aus<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Im Durchschnitt erreichte das beste Modell zu diesem Zeitpunkt etwa **20 Punkte weniger** als der Mensch in der Gesamtmetrik<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Bei einzelnen Aufgaben war der Unterschied besonders groß: So erreichte das Modell bei der WSC-Aufgabe kaum ~65 % Genauigkeit gegenüber 100 % beim Menschen (ein Rückstand von ~35 Punkten)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Selbst bei den auf den ersten Blick „einfacheren“ Aufgaben (BoolQ, CB, RTE, WiC) lagen die automatischen Systeme ~10 Punkte unter dem menschlichen Niveau<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Diese Unterschiede bestätigten, dass SuperGLUE eine ernsthafte Herausforderung für die damaligen Technologien darstellte und nicht trivial gelöst werden konnte.

Dennoch begann nur wenige Monate nach dem Erscheinen von SuperGLUE ein **rascher Fortschritt**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-neurips-main-1)</sup>. Ende 2019 stellten Forscher von Google das Modell **T5** (Text-To-Text Transfer Transformer) mit 11 Milliarden Parametern vor, das ein Gesamtergebnis von 88,9 erreichte und sich damit dem menschlichen Niveau von ~89,8 annäherte<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-reddit-t5-2)</sup>. Tatsächlich verbesserte T5 den bisherigen Rekord auf SuperGLUE um 4,3 Punkte und reduzierte die Fehlerrate um fast ein Drittel<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-reddit-t5-2)</sup>, sodass nur noch ein minimaler Abstand von **0,9 Punkten** zur menschlichen Leistung verblieb<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-reddit-t5-2)</sup>. Die Entwickler merkten an, dass die Aufgaben in SuperGLUE bewusst so gewählt wurden, dass sie für Menschen einfach sind, weshalb das Erreichen eines Niveaus von ~89 % durch ein Modell ein wichtiger Meilenstein war<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-reddit-t5-2)</sup>.

Das erste Modell, dem es gelang, **die durchschnittliche menschliche Leistung zu übertreffen**, war **DeBERTa** (Decoding-enhanced BERT with disentangled attention) von Microsoft<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. Im Januar 2021 berichteten die Forscher, dass eine Version von DeBERTa mit 1,5 Milliarden Parametern **89,9 Punkte** erreichte und damit knapp über dem menschlichen Referenzwert von 89,8 lag<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. Dies war das **erste Mal**, dass ein einzelnes Modell den Menschen in der SuperGLUE-Metrik übertraf<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. Darüber hinaus steigerte ein Ensemble aus mehreren DeBERTa-Modellen den Rekord auf ~90,3 Punkte<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. Das DeBERTa-Modell übertraf den bisherigen Spitzenreiter (Google T5) um etwa 0,6 % und demonstrierte die Wirksamkeit neuer Ideen in der Transformer-Architektur (getrennte Darstellung von Wortinhalt und -position, verbesserter Masken-Decoder usw.)<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-syncedreview-deberta-4)</sup>.

Der Fortschritt hörte hier nicht auf: Mit zunehmender Größe und Komplexität der Sprachmodelle verbesserten sich die SuperGLUE-Ergebnisse weiter<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-scaling-5)</sup>. Ende 2021 stand das Microsoft-Modell **T-NLRv5** (aus der Microsoft Turing NLR-Familie) an der Spitze des Leaderboards – es vergrößerte den Abstand zum menschlichen Niveau noch weiter<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-scaling-5)</sup>. Die letzten für Maschinen ungelösten GLUE-Aufgaben (z. B. Feinheiten von NLI) wurden von diesem Modell „geschlossen“, das sich selbst bei den schwierigsten Teilaufgaben einer **vollständigen Parität mit dem Menschen** annäherte<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-scaling-5)</sup>.

In den Jahren 2022-2023 wurde die Schwelle der menschlichen Leistung auf SuperGLUE von mehreren unabhängigen großen Modellen souverän überschritten<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>. So erreichte beispielsweise das Modell **PaLM** von Google (540 Mrd. Parameter) nach einem Finetuning auf SuperGLUE-Aufgaben etwa 90,4 Punkte, und das Modell **GPT-4** (entwickelt von OpenAI) zeigte ein sogar noch etwas höheres Ergebnis<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>. Mitte 2023 gab es in der SuperGLUE-Rangliste mehrere Modelle mit Ergebnissen über 90 (d. h. über dem durchschnittlichen menschlichen Niveau)<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>. Man kann sagen, dass der Benchmark von modernen Systemen **praktisch gelöst** wurde<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>: Die Leistungen der besten Modelle sind so hoch, dass sie die Fähigkeiten der meisten nicht qualifizierten Menschen übertreffen<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>. Dieser Erfolg zeugt von dem gigantischen Fortschritt im Bereich NLP in kurzer Zeit, weist aber gleichzeitig auf die Notwendigkeit neuer, noch komplexerer Tests für die neuesten Modelle hin<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>. Es entstehen bereits nachfolgende Benchmarks (z. B. MMLU, BIG-Bench u. a.), die darauf abzielen, Modelle auf ein breiteres Verständnis und Allgemeinwissen zu prüfen, das über die Aufgaben von SuperGLUE hinausgeht<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-ainavigator-benchmarks-6)</sup>.

## Einfluss und weitere Forschung

SuperGLUE hat sich somit als **wichtiger Meilenstein in der Entwicklung von Bewertungsmethoden** in der Sprachverarbeitung etabliert<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. In Enthusiasten- und Wissenschaftskreisen sind seine Ergebnisse zu einer Art „Lackmustest“ für neue LLM-Architekturen geworden: Das Erreichen oder Übertreffen des menschlichen Niveaus auf SuperGLUE wird als Zeichen eines fortschrittlichen Modells mit tiefem Sprachverständnis angesehen<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. Dies spiegelte sich auch in der Praxis wider – viele moderne Sprachmodelle, die hohe Ergebnisse auf SuperGLUE erzielten, bildeten die Grundlage für angewandte Systeme wie Frage-Antwort-Systeme, Dialogagenten, Textzusammenfassungssysteme und mehr<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_note-microsoft-deberta-3)</sup>. SuperGLUE wird von Forschern weiterhin für das Finetuning und den Vergleich von Algorithmen verwendet, obwohl sich der Fokus der Spitzenforschung allmählich auf neue Grenzen der Bewertung künstlicher Intelligenz verlagert.

## Weblinks

- <a href="https://super.gluebenchmark.com/" class="external text" rel="nofollow">Offizielle Website von SuperGLUE</a>
- <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external text" rel="nofollow">Originalartikel zu SuperGLUE (NeurIPS)</a>
- <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external text" rel="nofollow">Microsoft-Artikel über das Erreichen des menschlichen Niveaus durch DeBERTa</a>
- <a href="https://paperswithcode.com/dataset/superglue" class="external text" rel="nofollow">Datensatzseite von SuperGLUE auf Papers With Code</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-neurips-main_1-58)</sup> Wang, Alex et al. (2019). „SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems“. *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-reddit-t5_2-3)</sup> „Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline“. *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-deberta_3-6)</sup> „Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark“. *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">[↑](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-syncedreview-deberta_4-0) „Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark“. *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-microsoft-scaling_5-2)</sup> „Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE“. *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(DE)#cite_ref-ainavigator-benchmarks_6-6)</sup> „The Ultimate Guide to AI Benchmarks“. *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
