---
title: "GSM8K (Grade School Math 8K) (DE)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2491
wiki_created_at: 2026-09-06T23:05:00Z
wiki_modified_at: 2026-09-06T23:05:00Z
downloaded_at: 2026-09-07T22:51:40Z
---

# GSM8K (Grade School Math 8K) (DE)

**GSM8K** (**Grade School Math 8K**) ist ein Benchmark-Datensatz, der etwa 8.500 Textaufgaben aus der Grundschulmathematik enthält. Er wurde 2021 von Forschern bei **OpenAI** entwickelt, um die Fähigkeit von großen Sprachmodellen (LLMs) zu mehrstufigen mathematischen Schlussfolgerungen zu bewerten und weiterzuentwickeln<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-openai2021-1)</sup>. GSM8K hat sich zu einem der wichtigsten Benchmarks für die Messung von Fortschritten im Bereich des mathematischen Denkens bei künstlicher Intelligenz entwickelt.

Jede Aufgabe im Datensatz ist eine kurze Textgeschichte, deren Lösung die Ausführung von 2 bis 8 aufeinanderfolgenden arithmetischen Operationen (Addition, Subtraktion, Multiplikation, Division) erfordert. Trotz ihrer scheinbaren Einfachheit erfordern die Aufgaben ein tiefes Textverständnis und logisches Denken, was sie für viele LLMs zu einer Herausforderung macht<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-pwc-2)</sup>.

## Schlüsselmerkmale

### Umfang und Struktur

Der GSM8K-Datensatz umfasst etwa **8.500 Aufgaben**, die in zwei Teile unterteilt sind:

- **Trainingsdatensatz**: ~7.500 Aufgaben, die für das Feinabstimmen (*fine-tuning*) von Modellen vorgesehen sind. Jede Aufgabe enthält eine detaillierte schrittweise Lösung.
- **Testdatensatz**: ~1.000 Aufgaben, die zur unabhängigen Bewertung der Modellleistung verwendet werden<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-openai2021-1)</sup>.

### Komplexität und Inhalt

Die Aufgaben sind absichtlich so konzipiert, dass ein fähiger Mittelschüler sie lösen kann, erfordern jedoch **mehrstufige Schlussfolgerungen**. Dies ermöglicht es, nicht so sehr das mathematische Wissen des Modells zu testen, sondern vielmehr seine Fähigkeit, ein Problem zu zerlegen und logische Operationen nacheinander auszuführen.

### Linguistische Vielfalt

Die Formulierungen der Aufgaben in GSM8K zeichnen sich durch eine große Vielfalt an Stilen und sprachlichen Konstruktionen aus. Dies dient dazu, die Fähigkeit der Modelle zu überprüfen, Aufgabenstellungen zu verstehen, die auf unterschiedliche Weise formuliert sind, und das „Auswendiglernen“ bestimmter Muster zu vermeiden<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-klu_benchmark-3)</sup>.

## Geschichte und Entwicklung der Modellevaluierung

### Frühe Modelle und Baseline-Ergebnisse

In der ursprünglichen Arbeit von 2021 zeigten die Autoren, dass selbst große Modelle dieser Zeit, wie **GPT-3** (175 Mrd. Parameter), erhebliche Schwierigkeiten mit dem Datensatz hatten. Nach dem Feinabstimmen und dem Einsatz eines unterstützenden Verifikator-Modells erreichte die Lösungsgenauigkeit nur etwa **55 %**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-openai2021-1)</sup>. Dieses Ergebnis zeigte, dass ein einziger kleiner Fehler in der Argumentationskette zu einer völlig falschen Antwort führen kann.

### Bahnbrechende Methoden: Chain-of-Thought

Ein Durchbruch bei der Lösung der GSM8K-Aufgaben war der **Chain-of-Thought**-Ansatz (**Chain-of-Thought, CoT**). Im Jahr 2022 zeigten Forscher von Google, dass die Genauigkeit erheblich steigt, wenn das Modell dazu angeleitet wird, die Lösungsschritte explizit darzulegen, bevor es die Antwort ausgibt. Das Modell **PaLM** (540 Mrd. Parameter) erreichte mit CoT eine Genauigkeit von **58 %**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-google_cot-4)</sup>. Die Anwendung der komplexeren Technik **Self-Consistency** (Generierung mehrerer Lösungswege und Auswahl der häufigsten Antwort) steigerte die Genauigkeit auf **74 %**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-google_cot-4)</sup>.

### Übertreffen des menschlichen Niveaus

Seit 2023 haben die neuesten generativen Modelle das menschliche Leistungsniveau bei diesem Benchmark übertroffen.

- **GPT-4** von OpenAI erreichte im *Few-Shot-CoT*-Modus (bei dem im Prompt einige Beispiele für gelöste Aufgaben gegeben werden) eine Genauigkeit von etwa **92 %**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-gpt4_92-5)</sup> und mit zusätzlichen Strategien bis zu **97 %**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** von Anthropic erzielte ein Ergebnis von **88 %**, während die neuere Version **Claude 3** etwa **95 %** erreichte<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-klu_benchmark-3)</sup>.

Solch hohe Werte deuten auf erhebliche Fortschritte in den Schlussfolgerungsfähigkeiten von LLMs hin. Sie zeigen jedoch auch, dass GSM8K für Spitzenmodelle „nahezu gelöst“ ist, was die Entwicklung komplexerer Benchmarks wie **MATH** und **MMLU** vorantreibt.

## Rolle beim Training und der Entwicklung von Modellen

Neben der Evaluierung wird GSM8K auch aktiv für das **Training und die Verbesserung** von Modellen genutzt.

- **Fine-Tuning (Feinabstimmung)**: Der Trainingsdatensatz mit schrittweisen Lösungen ist eine wertvolle Ressource, um Modelle in mathematischer Logik zu schulen.
- **Training von Verifikatoren**: In der ursprünglichen Arbeit von OpenAI wurde ein Teil der GSM8K-Daten verwendet, um ein separates **Verifikator**-Modell zu trainieren, das die Korrektheit der generierten Lösungen bewertete. Dieser Ansatz, bei dem Generator und Kritiker getrennt trainiert werden, hat sich als wirksam erwiesen<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Die große Anzahl an Beispielen ermöglichte es Forschern, Prompt-Techniken wie **Chain-of-Thought** und **Tree-of-Thought** zu entwickeln und zu verfeinern. Diese Techniken bringen dem Modell bei, zu schlussfolgern, ohne seine Gewichte zu verändern.

## Weblinks

- <a href="https://paperswithcode.com/dataset/gsm8k" class="external text" rel="nofollow">Datensatz-Seite auf Papers With Code</a>
- <a href="https://github.com/openai/grade-school-math" class="external text" rel="nofollow">Offizielles Repository auf GitHub</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. "Training Verifiers to Solve Math Word Problems". *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-pwc_2-0) "GSM8K Dataset". *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-klu_benchmark_3-1)</sup> "GSM8K Benchmark". *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. "Language Models Perform Reasoning via Chain of Thought". *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-gpt4_92_5-0) Yu, L., et al. "Solving Challenging Math Word Problems Using GPT-4". *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(DE)#cite_ref-gpt4_97_6-0) "Achieving \>97% on GSM8K". *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
