---
title: "Humanity's Last Exam (benchmark) (DE)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3019
wiki_created_at: 2026-09-06T23:14:24Z
wiki_modified_at: 2026-09-06T23:14:24Z
downloaded_at: 2026-09-07T22:54:29Z
---

# Humanity's Last Exam (benchmark) (DE)

**Humanity's Last Exam** (**HLE**, dt. „Die letzte Prüfung der Menschheit“) ist ein umfassender Benchmark, der zur Bewertung der Fähigkeiten fortgeschrittener Systeme der künstlichen Intelligenz (KI) bei Aufgaben entwickelt wurde, die ein Wissens- und Schlussfolgerungsniveau erfordern, das mit dem von menschlichen Top-Experten vergleichbar ist. Der Benchmark wurde in den Jahren 2024–2025 von der gemeinnützigen Organisation Center for AI Safety (CAIS) in Zusammenarbeit mit dem Unternehmen Scale AI entwickelt<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_paper-1)</sup>.

Das HLE-Projekt ist als „letzte akademische Prüfung“ für KI-Modelle konzipiert – ein extrem schwieriger Test, der feststellen soll, ob moderne Modelle sich dem Expertenniveau annähern und wo Lücken in ihren Fähigkeiten bestehen<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_paper-1)</sup>. Der [Benchmark](https://systems-analysis.info/int/LLM-Benchmarks "LLM-Benchmarks") umfasst 2500 äußerst komplexe Fragen aus über hundert verschiedenen Disziplinen<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-wiki_hle-2)</sup>.

## Entstehungsgeschichte

Mitte der 2020er Jahre zeigten große [Sprachmodelle](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") wie GPT-4 und Claude so hohe Ergebnisse in populären Testdatensätzen (z. B. MMLU), dass viele Benchmarks nicht mehr als verlässliches Maß für den Fortschritt dienten. Standardprüfungen auf Bachelor-Niveau wurden von den Modellen praktisch „deklassiert“, was eine objektive Bewertung weiterer Verbesserungen unmöglich machte<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-reuters_stump-3)</sup>.

In dieser Situation schlug **Dan Hendrycks**, Direktor des CAIS und ein bekannter KI-Forscher, das Konzept des „Humanity's Last Exam“ vor – eine Sammlung von Fragen höchster Komplexität, die die Fähigkeiten von KI von denen eines echten Experten unterscheiden sollte. Den Anstoß gab ein Gespräch mit dem Unternehmer Elon Musk, der die Meinung vertrat, dass die bestehenden Tests zu einfach geworden seien<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-wiki_hle-2)</sup>.

Zur Umsetzung der Idee schloss sich CAIS mit Scale AI zusammen. Am 15. September 2024 wurde offiziell eine weltweite Ausschreibung für die schwierigsten Fragen für die zukünftige Prüfung bekannt gegeben. Die Organisatoren wandten sich an Wissenschaftler und Spezialisten auf der ganzen Welt mit der Bitte, Aufgaben einzureichen, die selbst die fortschrittlichsten KI-Modelle an ihre Grenzen bringen könnten. Um die Teilnehmer zu motivieren, wurde ein Preisgeld von 500.000 \$ ausgelobt<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-reuters_stump-3)</sup>.

Die Auswahl der Aufgaben erfolgte in mehreren Phasen. Zunächst wurden die eingereichten Fragen mithilfe fortschrittlicher KI-Modelle gefiltert: Wenn die Algorithmen eine Aufgabe sicher lösten, wurde sie als nicht schwierig genug aussortiert. Aufgaben, an denen die KI scheiterte, wurden von Experten auf ihre Korrektheit und das Vorhandensein einer einzigen richtigen Antwort überprüft. Letztendlich waren an der Erstellung des Datensatzes fast 1000 Experten aus über 500 Wissenschafts- und Bildungseinrichtungen beteiligt<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.

Die endgültige Version des Benchmarks, die **2500 Fragen** umfasst, wurde Anfang 2025 vorgestellt. Ein Teil der Aufgaben wird in einer privaten Reserve für Kontrolltests zurückgehalten, um zu verhindern, dass Modelle auf den festen Datensatz optimiert werden<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-wiki_hle-2)</sup>.

## Struktur und Inhalt des Benchmarks

Der Fragenkatalog des HLE deckt ein breites Spektrum akademischer Disziplinen ab. Die Aufgaben sind thematisch wie folgt verteilt:

- **Mathematik**: ~41%
- **Biologie und Medizin**: ~11%
- **Informatik und KI**: ~10%
- **Physik**: ~9%
- **Geistes- und Sozialwissenschaften**: ~9%
- **Chemie**: ~7%
- **Ingenieurwissenschaften**: ~4%
- **Sonstige Bereiche**: ~9%

Etwa **14 %** aller Aufgaben sind **multimodal**, das heißt, ihre Lösung erfordert die Analyse von Bildern (Zeichnungen, Diagramme, Beschriftungen)<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-wiki_hle-2)</sup>. Die meisten Aufgaben (etwa 3/4) sind **offene Fragen mit Kurzantwort**, bei denen das Modell selbstständig eine präzise Antwort (eine Zahl, einen Begriff, einen Namen) generieren muss. Die übrigen sind Multiple-Choice-Fragen.

Alle Aufgaben im HLE weisen folgende gemeinsame Merkmale auf:

- **Extrem hoher Schwierigkeitsgrad**: Jede Aufgabe erfordert ein Wissens- und Fähigkeitsniveau, das mit dem eines qualifizierten Spezialisten auf dem jeweiligen Gebiet vergleichbar ist<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-techradar_pass-5)</sup>.
- **Überprüfbare Antwort**: Jede Frage hat eine eindeutige und nachweislich korrekte Antwort.
- **Resistenz gegen Websuche**: Die Aufgaben sind so konzipiert, dass die Antwort nicht durch eine einfache Suchanfrage gefunden werden kann; für den Erfolg sind ein tiefes Verständnis des Themas und logisches Schlussfolgern erforderlich<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_paper-1)</sup>.

## Testergebnisse der Modelle

Humanity's Last Exam bestätigte sofort seinen Ruf als extrem schwieriger Test: **Keines der modernen KI-Modelle konnte ein Ergebnis erzielen, das dem menschlichen Niveau nahekommt**. Die besten Sprachmodelle des Jahres 2025 zeigten eine sehr geringe Genauigkeit.

- Verschiedene Versionen von **GPT-4** von OpenAI und **Claude** von Anthropic erreichten ein Ergebnis von **weniger als 10 %**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.
- Das beste Ergebnis unter den Standard-LLMs erzielte das Modell **Gemini 2.5 Pro** (Google DeepMind) mit einer Genauigkeit von etwa **21,6 %**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.
- Selbst die besten Modelle scheiterten an etwa 4/5 der HLE-Fragen, was die große Lücke zwischen den aktuellen Fähigkeiten der KI und dem Niveau menschlicher Experten verdeutlicht<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_paper-1)</sup>.

Besonders interessant ist das Ergebnis des experimentellen Agenten **ChatGPT Deep Research** von OpenAI, dem es erlaubt war, automatisch Suchanfragen durchzuführen. Indem er die Arbeit eines Forschers simulierte, konnte dieser Agent **26,6 %** der Aufgaben korrekt lösen – ein Ergebnis, das mehr als doppelt so hoch ist wie das eines Modells ohne solche Werkzeuge, aber immer noch sehr weit von einer bestandenen Note entfernt ist<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hindustan_times_26-6)</sup>.

## Bedeutung und Perspektiven

Die Einführung des HLE war ein bedeutendes Ereignis in der KI-Community, da der Benchmark den dringenden Bedarf an einem neuen, anspruchsvolleren Maß für den Fortschritt deckte.

- **Ein gemeinsamer Referenzpunkt**. HLE bietet Forschern und politischen Entscheidungsträgern ein objektives Instrument zur Bewertung der KI-Fähigkeiten, das es ermöglicht, die Dynamik von Verbesserungen zu verfolgen und zu verstehen, wie nahe Maschinen dem menschlichen Niveau kommen.
- **Ein Instrument für politische Entscheidungsprozesse**. Die Existenz eines solchen Referenztests fördert sachlichere Diskussionen über die Entwicklungsrichtungen der KI, potenzielle Risiken und notwendige Regulierungsmaßnahmen.
- **Die letzte Hürde akademischer Prüfungen**. Der Name „Letzte Prüfung“ selbst spiegelt die Idee wider, dass diese Aufgabensammlung die letzte geschlossene Prüfung zur Bewertung von KI sein könnte. Ein erfolgreiches Bestehen des HLE würde bedeuten, dass eine Maschine in Bezug auf formales Wissen und streng überprüfbare Schlussfolgerungsfähigkeiten das Niveau der besten menschlichen Experten erreicht hat<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.

Es ist wichtig zu betonen, dass selbst das vollständige Bestehen des HLE nicht das Erreichen einer allgemeinen künstlichen Intelligenz (AGI) bedeuten würde, da der Test weder kreative Fähigkeiten, noch Eigeninitiative oder die Fähigkeit, neue wissenschaftliche Fragen zu stellen, überprüft<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.

Angesichts des schnellen Fortschritts gehen Forscher davon aus, dass Modelle bis Ende 2025 eine Genauigkeit von über 50 % im HLE erreichen könnten. Dies würde bedeuten, dass sich Maschinen dem menschlichen Niveau in der engen, aber wichtigen Metrik des akademischen Wissens stark angenähert haben<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_note-hle_site-4)</sup>.

## Weblinks

- <a href="https://agi.safe.ai/" class="external text" rel="nofollow">Offizielle Website von Humanity's Last Exam</a>
- <a href="https://arxiv.org/abs/2501.14249" class="external text" rel="nofollow">Wissenschaftlicher Artikel, der den Benchmark vorstellt</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(DE)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[6]</a></span>
