---
title: "MMLU Benchmark"
source: "https://systems-analysis.info/int/MMLU_Benchmark"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4068
wiki_created_at: 2026-09-06T23:30:03Z
wiki_modified_at: 2026-09-06T23:30:03Z
downloaded_at: 2026-09-07T23:00:42Z
---

# MMLU Benchmark

**MMLU** (Abkürzung für **Measuring Massive Multitask Language Understanding**) ist ein Benchmark-Datensatz, der entwickelt wurde, um die Fähigkeiten von [großen Sprachmodellen (LLM)](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") in einem breiten Spektrum von Fachgebieten zu bewerten. Der Benchmark wurde 2020 von einem Forscherteam unter der Leitung von **Dan Hendrycks** von der UC Berkeley entwickelt und 2021 auf der ICLR-Konferenz veröffentlicht<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_paper-1)</sup>.

Das Ziel von MMLU ist es zu überprüfen, inwieweit ein Modell vielfältiges Wissen und Fähigkeiten, die während des Pre-Trainings erworben wurden, durch Tests im *Zero-Shot*- oder *Few-Shot*-Modus ohne zusätzliches Fine-Tuning verinnerlicht hat. MMLU wurde als eine anspruchsvollere Alternative zu bestehenden Tests (wie GLUE und SuperGLUE) geschaffen, bei denen viele Modelle bis 2020 bereits menschliches Leistungsniveau erreicht hatten<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_wiki-2)</sup>.

## Beschreibung und Inhalt

MMLU besteht aus **15.908 Multiple-Choice-Fragen**, die **57 verschiedene Fachgebiete** abdecken. Die Themen der Aufgaben umfassen:

- MINT-Fächer (Mathematik, Physik, Biologie, Informatik).
- Geistes- und Sozialwissenschaften (Geschichte, Literatur, Recht, Verwaltung).
- Angewandte und berufliche Bereiche (Medizin, Rechtswissenschaft, Wirtschaft)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_paper-1)</sup>.

Der Schwierigkeitsgrad reicht vom Grundschulniveau bis hin zu fortgeschrittenem professionellem Niveau. Die Fragen basieren auf realen Prüfungsmaterialien für Schulen, Universitäten und beruflichen Tests wie dem GRE und dem USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_paper-1)</sup>. Das Aufgabenformat besteht aus vier Antwortmöglichkeiten pro Frage, was bedeutet, dass die Genauigkeit bei zufälliger Auswahl 25 % beträgt. Um ein hohes Ergebnis zu erzielen, muss ein Modell über umfassendes enzyklopädisches Wissen und die Fähigkeit zum logischen Denken verfügen.

## Ergebnisse und Entwicklung

Bei der Veröffentlichung von MMLU im Jahr 2020 zeigten die meisten LLMs Ergebnisse, die nur geringfügig über dem Zufallsniveau lagen. Das beste Ergebnis erzielte das Modell GPT-3 (175 Mrd. Parameter) mit **~43,9 %** korrekten Antworten. Zum Vergleich erreichte ein menschlicher Experte im Durchschnitt **~90 %**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_paper-1)</sup>. Diese Lücke bestätigte die Komplexität und den hohen Anspruch des neuen Benchmarks.

Mit der Zeit entwickelte sich MMLU zu einem der populärsten Tests für LLMs und erhielt den Status eines „Goldstandards“ in den Berichten führender KI-Unternehmen<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-new_savanna_2024-3)</sup>. In den Jahren 2023–2024 näherten sich die neuesten Modelle wie GPT-4, Googles **Gemini Ultra** und Anthropics **Claude 3.5** dem menschlichen Niveau an und erreichten eine Genauigkeit von **~85–90 %**<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-new_savanna_2024-3)</sup>.

Der schnelle Fortschritt führte zu einer allmählichen „Sättigung“ des Benchmarks: Führende Modelle erreichten Ergebnisse nahe dem Maximum, was die Fähigkeit von MMLU verringerte, ihre intellektuellen Fähigkeiten zu differenzieren. Dies motivierte die Community, neue, schwierigere Tests zu entwickeln<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-new_savanna_2024-3)</sup>.

## Einschränkungen und Kritik

Trotz seiner weiten Verbreitung weist MMLU eine Reihe wesentlicher Einschränkungen auf.

### Datenqualität und Korrektheit

Im Juni 2024 führten Forscher eine manuelle Analyse einer Stichprobe von 5.700 MMLU-Fragen durch und stellten eine erhebliche Anzahl von Fehlern fest<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-done_with_mmlu_2024-4)</sup>.

- Etwa **6,5 %** aller MMLU-Fragen enthalten Fehler in der Annotation oder Formulierung.
- In einigen Kategorien ist der Anteil fehlerhafter Aufgaben sehr hoch. Beispielsweise enthielten im Bereich „Virologie“ **57 %** der Aufgaben Fehler (mehrere korrekte Antworten, ungenaue Formulierungen oder eine falsch angegebene Referenzantwort).

Dies bedeutet, dass selbst ein perfektes Modell auf dem ursprünglichen Datensatz keine 100 % erreichen kann und ein Teil der Verbesserungen in den Metriken auf das Auswendiglernen systematischer Fehler im Datensatz durch das Modell zurückzuführen sein könnte<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-done_with_mmlu_2024-4)</sup>.

### Bewertungsmethodik und Data Contamination

- **Fehlender Teststandard**. Verschiedene Entwickler können unterschiedliche Prompts und Few-Shot-Modi verwenden, was einen direkten Vergleich der Modellergebnisse erschwert.
- **Data Contamination** (Datenleck). Es besteht das Risiko, dass Fragen und Antworten aus öffentlichen Benchmarks in die Trainingsdatensätze von LLMs gelangen. In einem solchen Fall „kennt“ das Modell die richtigen Antworten bereits, was die Bewertung unfair macht<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-new_savanna_2024-3)</sup>.

## Abgeleitete Versionen und Erweiterungen

Um die Probleme des ursprünglichen MMLU zu beheben, wurden mehrere Varianten entwickelt.

- **MMLU-Redux**. Eine korrigierte und verfeinerte Version des Datensatzes, die im Juni 2024 vorgestellt wurde. Sie umfasst 3.000 neu annotierte Fragen aus 30 Kategorien und soll eine zuverlässigere Bewertung von Modellen ermöglichen, ohne die durch Datenfehler verursachten Verzerrungen<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-done_with_mmlu_2024-4)</sup>.
- **MMLU-Pro**. Eine erweiterte und anspruchsvollere Variante des Tests, die Ende 2024 vorgestellt wurde. Sie enthält über 12.000 Fragen mit jeweils **10 Antwortmöglichkeiten** anstelle von vier. Dies reduziert die Wahrscheinlichkeit des zufälligen Erratens auf 10 %. Die Fragen wurden von Experten geprüft und umfassen neue Aufgaben aus anspruchsvolleren Quellen<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmlu_pro_vals_ai-5)</sup>.
- **MMMLU** (*Multilingual MMLU*). Eine mehrsprachige Version, die 2023 von OpenAI veröffentlicht wurde. Der gesamte MMLU-Datensatz wurde von professionellen Übersetzern in 14 Sprachen übersetzt, darunter weit verbreitete Sprachen (Spanisch, Chinesisch, Russisch) und ressourcenarme Sprachen (z. B. Yoruba). Dies ermöglicht die Bewertung und den Vergleich der Fähigkeiten von Modellen in verschiedenen Sprachen<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark#cite_note-mmmlu_hf-6)</sup>.

## Weblinks

- <a href="https://github.com/hendrycks/test" class="external text" rel="nofollow">Offizielles MMLU-Repository auf GitHub</a>
- <a href="https://paperswithcode.com/dataset/mmlu" class="external text" rel="nofollow">MMLU-Seite auf Papers with Code mit Modellergebnissen</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In: *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
