---
title: "WinoGrande Benchmark (DE)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 8474
wiki_created_at: 2026-09-07T01:17:55Z
wiki_modified_at: 2026-09-07T01:17:55Z
downloaded_at: 2026-09-07T23:25:34Z
---

# WinoGrande Benchmark (DE)

**WinoGrande** ist ein umfangreicher Benchmark-Datensatz, der entwickelt wurde, um die Fähigkeit von Systemen der künstlichen Intelligenz zum logischen Schließen auf Basis von gesundem Menschenverstand (Common-Sense-Reasoning) zu bewerten. Er enthält etwa 44.000 Aufgaben, die auf dem Format der Winograd Schema Challenge (WSC) basieren, jedoch durch eine „adversarielle“ Filterungsmethode erheblich erweitert und erschwert wurden, um statistische Hinweise zu eliminieren<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-sakaguchi2019-1)</sup>.

Der Datensatz wurde 2019 von einer Forschergruppe des **Allen Institute for AI** und der **University of Washington** entwickelt. Jede Aufgabe besteht aus einem Satz mit einer Lücke, die mit einer von zwei Optionen gefüllt werden muss, wobei die richtige Wahl auf der Grundlage des Kontexts und des Situationsverständnisses getroffen werden muss. WinoGrande hat sich zu einem der wichtigsten Benchmarks im Bereich der Verarbeitung natürlicher Sprache (NLP) entwickelt<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-huggingface-2)</sup>.

## Hintergrund der Entwicklung: Die Veralterung des WSC

Die ursprüngliche **Winograd Schema Challenge** (WSC), die 2011 vorgeschlagen wurde, umfasste nur 273 Aufgaben und galt lange Zeit als zuverlässiger Test für gesunden Menschenverstand. Die Aufgaben waren so konzipiert, dass sie ein Verständnis der Welt erforderten und nicht nur einen einfachen Wortabgleich<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-wsc_wiki-3)</sup>.

Mit dem Aufkommen großer Sprachmodelle auf Basis der Transformer-Architektur, wie z. B. **BERT**, änderte sich die Situation jedoch in den Jahren 2018–2019. Die Modelle lernten, den Test zu „knacken“, indem sie eine Genauigkeit von etwa 90 % erreichten, indem sie unbeabsichtigte statistische Regelmäßigkeiten (Artefakte) in den Daten ausnutzten, anstatt ein echtes Verständnis zu zeigen<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-kocijan2023-4)</sup>. Der WSC war kein verlässlicher Indikator mehr, was zur Notwendigkeit führte, einen neuen, komplexeren und umfangreicheren Benchmark zu schaffen – WinoGrande.

## Entwicklung und die Methode des Adversarial Filtering

Die Erstellung von WinoGrande erfolgte in zwei Hauptphasen: der massenhaften Generierung von Aufgaben und deren anschließender Filterung.

### Crowdsourcing

In der ersten Phase wurde über die Plattform **Amazon Mechanical Turk** eine große Datenbank mit über 47.000 Sätzen gesammelt. Die Crowdworker erstellten Satzpaare nach dem Winograd-Schema, was für sprachliche Vielfalt und das für die natürliche Sprache typische „Rauschen“ sorgte, im Gegensatz zu Aufgaben, die von einer kleinen Expertengruppe verfasst wurden<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-sakaguchi2019-1)</sup>.

### Der AfLite-Algorithmus

Die zentrale Innovation von WinoGrande war der **AfLite**-Algorithmus (**Adversarial Filtering Lite**). Diese Methode wurde entwickelt, um Aufgaben automatisch auszusortieren, die mit einfachen statistischen Hinweisen gelöst werden können, ohne dass gesunder Menschenverstand erforderlich ist. Der Algorithmus verwendete einfache Modelle, um jene Beispiele zu identifizieren und zu entfernen, bei denen eine der Antworten zu offensichtlich mit anderen Wörtern im Satz verbunden war. *Zum Beispiel würde die Aufgabe „Die Löwen fraßen die Zebras, weil sie **Raubtiere** sind“ herausgefiltert, da das Wort „Raubtiere“ statistisch stark mit „Löwen“ assoziiert ist.*

Durch die Filterung wurden etwa 14 % der gesammelten Daten verworfen. Die endgültige Version des Datensatzes umfasst **43.972 Aufgaben**, was ihn zu einem deutlich zuverlässigeren und anspruchsvolleren Test macht<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-sakaguchi2019-1)</sup>.

## Modellergebnisse und Fortschritte

Bei der Veröffentlichung von WinoGrande zeigten die damals besten Modelle Ergebnisse, die deutlich unter den menschlichen Leistungen lagen.

- **RoBERTa** (eine verbesserte Version von BERT) erreichte eine Genauigkeit von **~79 %**.
- Ein **Mensch** löst die Aufgaben im Durchschnitt mit einer Genauigkeit von **~94 %**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-sakaguchi2019-1)</sup>.

Diese Lücke bestätigte, dass die AfLite-Filterung viele „einfache“ Lösungswege für die Modelle erfolgreich beseitigt hatte. Mit der Entwicklung von [LLMs](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") begann sich dieser Abstand jedoch zu verringern.

- Bis 2022 erreichte das Modell **ST-MoE-32B** eine Genauigkeit von **96,1 %** und übertraf damit das menschliche Niveau<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-lepore2025-5)</sup>.
- **GPT-3** zeigte ein Ergebnis von etwa **88 %**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-brown2020-6)</sup>.
- **GPT-4** löst die Aufgaben ohne spezielles Fine-Tuning mit einer Genauigkeit von **~87,5 %**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-openai2023-7)</sup>.

## Einfluss und Kritik

WinoGrande hat sich zu einem der wichtigsten Benchmarks für die Bewertung des gesunden Menschenverstandes entwickelt und wird regelmäßig zum Testen neuer Modelle verwendet. Seine Ergebnisse werden in den technischen Berichten führender KI-Unternehmen und auf Plattformen zum Modellvergleich veröffentlicht<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-hyper_ai-8)</sup>.

Gleichzeitig ist die Methode zur Erstellung des Datensatzes Gegenstand wissenschaftlicher Diskussionen geworden. Einige Forscher merken an, dass massenhaftes Crowdsourcing zur Entstehung unnatürlicher oder mehrdeutiger Formulierungen geführt haben könnte. Es wurden auch Zweifel geäußert, ob die automatische Filterung durch AfLite alle versteckten Artefakte vollständig beseitigen kann<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_note-lepore2025-5)</sup>. Dennoch hat WinoGrande nicht nur den Fortschritt bei den Metriken, sondern auch eine wichtige Diskussion über die Entwicklung robusterer und zuverlässigerer Methoden zur Bewertung von KI angeregt.

## Weblinks

- <a href="https://winogrande.allenai.org/" class="external text" rel="nofollow">Offizielle Website von WinoGrande</a>
- <a href="https://huggingface.co/datasets/allenai/winogrande" class="external text" rel="nofollow">Datensatz auf der Hugging Face-Plattform</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(DE)#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
