GLUE Benchmark (DE)

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (Akronym für General Language Understanding Evaluation, „Allgemeine Bewertung des Sprachverständnisses“) ist ein Multitask-Benchmark zur Bewertung der Leistung von Modellen zur Verarbeitung natürlicher Sprache (NLU). Der Benchmark wurde 2018 von einer Gruppe von Forschern der New York University, der University of Washington und DeepMind, darunter Alex Wang und Samuel Bowman, vorgestellt und fand in der Forschungsgemeinschaft weite Verbreitung[1].

Das Hauptziel von GLUE ist die Bereitstellung einer einheitlichen, neutralen und anspruchsvollen Testsuite für den Vergleich der Fähigkeiten von NLU-Modellen bei einer Vielzahl von Aufgaben, die über einen einzelnen spezifischen Bereich hinausgehen. Der Benchmark umfasst eine Online-Plattform mit einem Leaderboard (Bestenliste), die einen objektiven Vergleich von Modellen ermöglicht und eine Überanpassung an die Testdaten verhindert, da die wahren Labels für einen Teil der Tests nicht veröffentlicht werden und nur über den Bewertungsserver zugänglich sind. Es wird davon ausgegangen, dass ein Modell, um hohe Ergebnisse zu erzielen, in der Lage sein muss, universelle Sprachrepräsentationen zu extrahieren und Wissen effizient zwischen verschiedenen Aufgabentypen zu transferieren.

Zusammensetzung und Aufgaben des Benchmarks

Der GLUE-Benchmark vereint neun verschiedene Aufgaben zum Sprachverständnis, die auf bereits existierenden und für KI anspruchsvollen Datensätzen basieren. Alle Aufgaben sind als Klassifizierungs- oder Regressionsaufgaben über einem einzelnen Satz oder einem Satzpaar formuliert[1].

  • CoLA (Corpus of Linguistic Acceptability) – Eine Aufgabe zur Bestimmung der grammatikalischen Akzeptanz eines Satzes. Die Bewertungsmetrik ist der Matthews-Korrelationskoeffizient.
  • SST-2 (Stanford Sentiment Treebank) – Eine Aufgabe zur Bestimmung der Tonalität (positiv/negativ) einer Filmkritik. Die Metrik ist die Genauigkeit (accuracy).
  • MRPC (Microsoft Research Paraphrase Corpus) – Eine Aufgabe zur Erkennung von Paraphrasen in Satzpaaren aus Nachrichtenquellen. Die Metriken sind Genauigkeit und F1-Score.
  • QQP (Quora Question Pairs) – Eine Aufgabe zur Bestimmung von doppelten Fragen aus der Quora-Community. Die Metriken sind Genauigkeit und F1-Score.
  • STS-B (Semantic Textual Similarity Benchmark) – Eine Aufgabe zur semantischen Ähnlichkeit von zwei Sätzen. Das Modell muss den Grad der semantischen Ähnlichkeit auf einer Skala von 1 bis 5 vorhersagen. Die Metriken sind die Korrelationskoeffizienten nach Pearson und Spearman.
  • MNLI (Multi-Genre Natural Language Inference) – Eine Aufgabe zur Erkennung von Textueller Inferenz bei Satzpaaren aus verschiedenen Genres (Implikation, Widerspruch, Neutralität). Die Ergebnisse werden separat auf den übereinstimmenden (matched) und nicht übereinstimmenden (mismatched) Teilmengen bewertet.
  • QNLI (Question Natural Language Inference) – Eine Aufgabe, die durch die Umwandlung des SQuAD-Datensatzes entstanden ist. Es muss bestimmt werden, ob ein Satz aus einem Absatz die Antwort auf eine gegebene Frage enthält.
  • RTE (Recognizing Textual Entailment) – Ein aggregierter Datensatz zur Textuellen Inferenz, der mehrere kleinere Sammlungen vereint. Die Aufgabe besteht darin, die Beziehung zwischen Sätzen binär zu klassifizieren.
  • WNLI (Winograd NLI) – Eine modifizierte Version des Winograd-Schemas, die an das NLI-Format angepasst wurde. Dies ist eine Aufgabe zur Anaphernauflösung: Dem System wird ein Satz mit einem mehrdeutigen Pronomen gegeben, und es muss angeben, auf welches von zwei Objekten es sich bezieht.

Bewertungsmethodik

Um auf GLUE bewertet zu werden, reichen Forscher die Vorhersagen ihres Modells bei einem speziellen Server ein und erhalten anschließend eine automatische Berechnung der Metriken für jede Aufgabe sowie eine Gesamtpunktzahl.

  • GLUE-Score – Ein Gesamtergebnis, das als Durchschnitt der Ergebnisse über alle neun Hauptaufgaben berechnet wird.
  • Leaderboard – Eine öffentliche Tabelle, die den aktuellen Stand der Technik widerspiegelt und zeigt, welche Modelle NLU-Aufgaben am besten bewältigen. Die Verwendung von verborgenen Testdatensätzen gewährleistet einen fairen Vergleich.
  • Diagnose-Datensatz – Ein spezieller Satz von 1100 Beispielen, die von Experten manuell für eine feingranulare linguistische Analyse annotiert wurden. Er beeinflusst das Ranking nicht, sondern dient als Werkzeug für die qualitative Analyse, um zu prüfen, welche sprachlichen Phänomene (lexikalische Semantik, Logik, Alltagsverständnis) ein Modell erkennen kann und bei welchen es Schwierigkeiten hat[1].

Ergebnisse und Einfluss auf die Branche

Bei der Einführung von GLUE im Jahr 2018 erreichten die damals besten Modelle (z. B. BiLSTM mit ELMo) eine Gesamtpunktzahl von etwa 70 Punkten (auf einer Skala von 0–100), was deutlich unter dem menschlichen Leistungsniveau lag (etwa 87 Punkte)[2].

Das Aufkommen von GLUE und dem offenen Leaderboard stimulierte einen rasanten Fortschritt im Bereich des Transferlernens im NLP.

  • Bis Mai 2019, in weniger als einem Jahr, hob eine neue Generation von auf Transformern basierenden Modellen (allen voran BERT) den State-of-the-Art auf 83,9 Punkte.
  • In der zweiten Hälfte des Jahres 2019 wurde der GLUE-Benchmark praktisch „gelöst“: Die besten Systeme näherten sich dem menschlichen Leistungsniveau an und übertrafen es bei einigen Aufgaben sogar[3].

GLUE spielte eine immense Rolle als einziger Referenzpunkt bei der Entwicklung von Modellen zum Sprachverständnis. Dank ihm konnten Forscher verschiedene Architekturen direkt anhand einer komplexen Reihe von Aufgaben vergleichen, Stärken und Schwächen von Ansätzen identifizieren und Erfolge schnell über das öffentliche Leaderboard austauschen.

SuperGLUE: Die Weiterentwicklung

Der schnelle Erfolg von GLUE führte dazu, dass dasselbe Autorenteam unter Beteiligung von Kollegen von Facebook AI bereits ein Jahr später eine neue, anspruchsvollere Benchmark-Suite namens SuperGLUE vorstellte[4].

SuperGLUE wurde Ende 2019 als eine „hartnäckigere“ (stickier) Testreihe angekündigt, die darauf abzielte, erneut eine Lücke zwischen den Fähigkeiten moderner Modelle und menschlicher Leistung zu schaffen. Sie umfasste acht Aufgaben, die ein noch tieferes Sprachverständnis erfordern, sowie verbesserte Werkzeuge und Regeln für die Teilnehmer. Obwohl GLUE weiterhin als grundlegender Test verwendet wird, hat sich der Fokus des Wettbewerbs auf SuperGLUE und andere, spezialisiertere Benchmarks verlagert.

Literatur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2011). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Einzelnachweise

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]