---
title: "MATH-Benchmark"
source: "https://systems-analysis.info/int/MATH-Benchmark"
wiki: "systems-analysis.info/int"
article: "MATH-Benchmark"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3960
wiki_created_at: 2026-09-06T23:28:31Z
wiki_modified_at: 2026-09-06T23:28:31Z
downloaded_at: 2026-09-07T22:59:53Z
---

# MATH-Benchmark

**MATH** (ein Akronym für engl. **Mathematics Aptitude Test of Heuristics**) ist ein umfangreicher Datensatz und [Benchmark](https://systems-analysis.info/int/LLM-Benchmarks "LLM-Benchmarks") zur Bewertung der mathematischen Fähigkeiten und Problemlösungskompetenzen von [großen Sprachmodellen](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLMs). Der Datensatz wurde 2021 von einer Forschungsgruppe unter der Leitung von **Dan Hendrycks** vorgestellt und umfasst **12.500 Aufgaben**, die aus amerikanischen Mathematikwettbewerben für Oberstufenschüler stammen, wie AMC 10, AMC 12 und AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

Die Aufgaben decken ein breites Spektrum an Gebieten ab (Algebra, Geometrie, Zahlentheorie, Kombinatorik usw.) und sind nach Schwierigkeitsgraden abgestuft. Im Gegensatz zu Standard-Übungsaufgaben erfordern sie oft einen kreativen Ansatz und heuristische Methoden anstelle der direkten Anwendung von Formeln. Jede Aufgabe wird von einer vollständigen Schritt-für-Schritt-Lösung und einer finalen Antwort begleitet, was MATH zu einer wertvollen Ressource sowohl für das Training als auch für das Testen von Modellen macht<sup>[\[2\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-llm_eval_datasets-2)</sup>.

## Struktur und Merkmale des Datensatzes

Der MATH-Benchmark weist eine Reihe von Schlüsselmerkmalen auf, die ihn zu einem anspruchsvollen und zuverlässigen Bewertungsinstrument machen.

### Aufgabenformat

Alle Aufgaben und Lösungen sind im LaTeX-Format verfasst, und zur Beschreibung geometrischer Zeichnungen wird die Sprache **Asymptote** verwendet. Dies ermöglicht es, alle Bedingungen, einschließlich Abbildungen, in einer für Sprachmodelle verarbeitbaren Textform darzustellen. Jede Aufgabe ist mit Labels für sieben mathematische Gebiete und fünf Schwierigkeitsgrade versehen<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

### Automatische Bewertung

Die finalen Antworten im Datensatz sind in ein spezielles Format `\boxed{...}` eingeschlossen und auf einen strengen Standard normalisiert (z. B. vollständig gekürzte Brüche). Dies ermöglicht eine automatische Bewertung der Modelle anhand der Metrik der **exakten Übereinstimmung** (*exact match*), was Subjektivität und Mehrdeutigkeit bei der Überprüfung der Ergebnisse ausschließt. Das Modell muss die exakt richtige Antwort ausgeben, damit die Aufgabe als gelöst gilt<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

## Schwierigkeit der Aufgaben und menschliches Leistungsniveau

MATH ist einer der anspruchsvollsten Mathematiktests für KI. Die Aufgaben stellen selbst für Menschen mit fundierten mathematischen Kenntnissen eine Herausforderung dar.

- Im Rahmen der Untersuchung des Datensatzes wurde eine Gruppe von **Universitätsstudenten** getestet, deren Ergebnisse von **~40 %** bis zu **~90 %** bei Olympiadensiegern reichten.
- Selbst ein Träger von drei Goldmedaillen der Internationalen Mathematik-Olympiade konnte nicht alle Aufgaben fehlerfrei lösen<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

Dies zeigt, dass zur erfolgreichen Lösung der MATH-Aufgaben nicht nur Wissen, sondern auch hohe Präzision und mathematische Intuition erforderlich sind.

## Modellergebnisse und Fortschritte bei der Lösung

### Anfängliche Ergebnisse (2021)

Bei der Einführung des Benchmarks im Jahr 2021 zeigten selbst die größten Modelle äußerst schlechte Ergebnisse.

- Das Modell **GPT-3** (175 Mrd. Parameter) konnte nur etwa **5 %** der Aufgaben korrekt lösen.
- Feinabgestimmte Versionen von **GPT-2** erreichten eine Genauigkeit von 6–7 %<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

Die Autoren kamen zu dem Schluss, dass eine reine Skalierung der Modelle die Leistung kaum beeinflusst und dass für Fortschritte neue algorithmische Ansätze erforderlich sind<sup>[\[3\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-lang_models_surprised-3)</sup>.

### Der Durchbruch mit Minerva und GPT-4 (2022–2023)

Der Durchbruch gelang mit dem Aufkommen von Modellen, die speziell auf wissenschaftlichen Texten trainiert wurden, sowie neuen Lösungsansätzen.

- Im Jahr 2022 erreichte das Modell **Google Minerva** eine Genauigkeit von etwa **50 %** und zeigte damit, dass die Kombination aus Skalierung und spezialisiertem Training die Lösungsqualität drastisch verbessern kann<sup>[\[3\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-lang_models_surprised-3)</sup>.
- Im Jahr 2023 erzielte **GPT-4** von OpenAI einen weiteren Sprung. Durch den Einsatz von Werkzeugen konnte das Modell seine Ergebnisse erheblich verbessern:
  - Mit dem **Code Interpreter** (Codeausführung zur Überprüfung von Berechnungen) erreichte die Genauigkeit fast **70 %**.
  - Mit der Methode der *code-based self-verification* (Selbstüberprüfung und Fehlerkorrektur mittels Code) wurde ein Rekord von **84,3 %** gelöster Aufgaben aufgestellt<sup>[\[4\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-decoder_gpt4-4)</sup>.

Dieses Ergebnis ist mit dem Niveau starker menschlicher Teilnehmer vergleichbar und nähert sich der Experten-Schwelle.

## Bedeutung und Einfluss

Der MATH-Benchmark spielte eine entscheidende Rolle bei der Entwicklung der mathematischen Fähigkeiten von LLMs. Er hat deutlich gezeigt, dass zur Lösung komplexer Probleme eine reine Skalierung nicht ausreicht, sondern neue Ansätze erforderlich sind, wie zum Beispiel:

- Training anhand vollständiger Schritt-für-Schritt-Lösungen.
- Spezialisiertes Training auf wissenschaftlichen Daten.
- Einsatz externer Werkzeuge für Berechnungen und Verifikation.

Trotz erheblicher Fortschritte bleibt MATH eine wichtige und anspruchsvolle Herausforderung. Er dient weiterhin als Indikator für das mathematische Denkvermögen von LLMs und fördert die Forschung im Bereich der zuverlässigen Lösung von Aufgaben, die mehrstufige logische Schlussfolgerungen erfordern<sup>[\[1\]](https://systems-analysis.info/int/MATH-Benchmark#cite_note-hendrycks2021-1)</sup>.

## Weblinks

- <a href="https://github.com/hendrycks/math" class="external text" rel="nofollow">Offizielles GitHub-Repository des MATH-Datensatzes</a>
- <a href="https://paperswithcode.com/dataset/math" class="external text" rel="nofollow">Seite des Datensatzes auf Papers With Code</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH-Benchmark#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
