---
title: "Humanity's Last Exam (benchmark) (CS)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3018
wiki_created_at: 2026-09-06T23:14:24Z
wiki_modified_at: 2026-09-06T23:14:24Z
downloaded_at: 2026-09-07T22:54:28Z
---

# Humanity's Last Exam (benchmark) (CS)

**Humanity's Last Exam** (**HLE**, česky „Poslední zkouška lidstva") — je komplexní testovací benchmark určený k hodnocení schopností pokročilých systémů umělé inteligence (AI) na úlohách vyžadujících úroveň znalostí a schopností uvažování srovnatelnou s nejlepšími lidskými odborníky. Benchmark byl vytvořen v letech 2024–2025 neziskovou organizací Center for AI Safety (CAIS) ve spolupráci se společností Scale AI<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_paper-1)</sup>.

Projekt HLE je koncipován jako „poslední akademická zkouška" pro modely AI — nesmírně obtížná zkouška, která umožní určit, zda se současné modely blíží expertní úrovni a kde přetrvává mezera v jejich schopnostech<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_paper-1)</sup>. Benchmark obsahuje 2 500 mimořádně složitých otázek pokrývajících více než sto různých disciplín<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-wiki_hle-2)</sup>.

## Historie vzniku

V polovině 20. let 21. století dosáhly velké jazykové modely, jako jsou GPT-4 a Claude, natolik vysokých výsledků v populárních testovacích sadách (například MMLU), že mnohé benchmarky přestaly sloužit jako spolehlivá míra pokroku. Standardní zkoušky na úrovni bakalářského studia byly modely prakticky „zdolány", což znemožnilo objektivní hodnocení dalšího zlepšování<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-reuters_stump-3)</sup>.

V této situaci **Dan Hendrycks** (*Dan Hendrycks*), ředitel CAIS a uznávaný výzkumník v oblasti AI, navrhl koncept „Poslední zkoušky lidstva" — souboru otázek maximální obtížnosti, který by dokázal odlišit schopnosti AI od úrovně skutečného odborníka. Impulzem byl rozhovor s podnikatelem Elonem Muskem, který vyjádřil názor, že stávající testy jsou příliš snadné<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-wiki_hle-2)</sup>.

K realizaci myšlenky se CAIS spojil se Scale AI. Dne 15. září 2024 byl oficiálně vyhlášen globální sběr nejobtížnějších otázek pro budoucí zkoušku. Organizátoři oslovili vědce a odborníky z celého světa s výzvou, aby zaslali úlohy schopné přivést do slepé uličky i nejpokročilejší modely AI. K motivaci účastníků byl zřízen peněžní fond ve výši 500 000 USD<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-reuters_stump-3)</sup>.

Výběr úloh probíhal ve více etapách. Nejprve byly zaslané otázky filtrovány pomocí pokročilých modelů AI: pokud algoritmy úlohu spolehlivě vyřešily, byla vyřazena jako nedostatečně obtížná. Zadání, s nimiž si AI neporadila, prošla odbornou kontrolou za účelem ověření správnosti a existence jediné správné odpovědi. Celkem se na sestavení sady podílelo téměř 1 000 odborníků z více než 500 vědeckých a vzdělávacích institucí<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.

Finální verze benchmarku obsahující **2 500 otázek** byla představena na začátku roku 2025. Část zadání zůstává v uzavřené záloze pro kontrolní testování a předcházení přizpůsobení modelů konkrétní fixní sadě<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-wiki_hle-2)</sup>.

## Struktura a obsah benchmarku

Soubor otázek HLE pokrývá nejširší spektrum oborů akademického vědění. Zadání jsou tematicky rozdělena následovně:

- **Matematika**: ~41 %
- **Biologie a medicína**: ~11 %
- **Informatika a AI**: ~10 %
- **Fyzika**: ~9 %
- **Humanitní a společenské vědy**: ~9 %
- **Chemie**: ~7 %
- **Inženýrské vědy**: ~4 %
- **Ostatní oblasti**: ~9 %

Přibližně **14 %** všech zadání je **multimodálních**, tedy k jejich řešení je nutná analýza obrázků (kreseb, diagramů, popisků)<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-wiki_hle-2)</sup>. Většina (přibližně 3/4) zadání jsou **otevřené otázky s krátkou odpovědí**, kde musí model samostatně vygenerovat přesnou odpověď (číslo, termín, jméno). Zbylá zadání jsou otázky s výběrem z více možností.

Všechny úlohy v HLE sdílejí společné vlastnosti:

- **Mimořádně vysoká obtížnost**: Každý problém vyžaduje úroveň znalostí a dovedností srovnatelnou s kvalifikovaným odborníkem v daném oboru<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-techradar_pass-5)</sup>.
- **Ověřitelná odpověď**: Každá otázka má určitou a prokazatelnou správnou odpověď.
- **Odolnost vůči vyhledávání**: Zadání jsou vybrána tak, aby odpověď nebylo možné nalézt prostým vyhledávacím dotazem; k úspěchu je nutné hluboké porozumění předmětu a schopnost uvažování<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_paper-1)</sup>.

## Výsledky testování modelů

Humanity's Last Exam okamžitě potvrdil pověst nesmírně obtížné zkoušky: **žádný ze současných modelů AI nedokázal na něm dosáhnout výsledku blížícího se lidskému**. Nejlepší jazykové modely roku 2025 vykázaly velmi nízkou přesnost.

- Různé verze **GPT-4** od OpenAI a **Claude** od Anthropic dosáhly výsledku **méně než 10 %**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.
- Nejvyššího výsledku mezi standardními LLM dosáhl model **Gemini 2.5 Pro** (Google DeepMind) s přesností přibližně **21,6 %**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.
- I nejlepší modely neúspěšně odpověděly přibližně na 4/5 otázek HLE, což zdůrazňuje rozsah mezery mezi současnými schopnostmi AI a úrovní lidského odborníka<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_paper-1)</sup>.

Zvláštní zájem představuje výsledek experimentálního agenta **ChatGPT Deep Research** od OpenAI, jemuž bylo povoleno automaticky provádět vyhledávací dotazy. Napodobující práci výzkumníka, tento agent dokázal správně vyřešit **26,6 %** zadání — výsledek více než 2× vyšší než u jakéhokoli modelu bez takových nástrojů, přesto stále velmi vzdálený od hranice úspěšnosti<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hindustan_times_26-6)</sup>.

## Význam a perspektivy

Vznik HLE se stal významnou událostí v komunitě AI, neboť benchmark zaplnil naléhavou potřebu po nové, náročnější míře pokroku.

- **Společný výchozí bod**. HLE nabízí výzkumníkům a tvůrcům politik objektivní nástroj pro hodnocení schopností AI, který umožňuje sledovat dynamiku zlepšování a chápat, nakolik se stroje přibližují lidské úrovni.
- **Nástroj pro informování politiky**. Existence takového referenčního testu přispívá k věcnějším diskusím o směrech rozvoje AI, potenciálních rizicích a nezbytných regulačních opatřeních.
- **Finální hranice akademických zkoušek**. Samotný název „Poslední zkouška" odráží myšlenku, že tento soubor úloh může být poslední uzavřenou zkouškou pro hodnocení AI. Úspěšné absolvování HLE bude znamenat, že z hlediska formálních znalostí a přísně ověřitelných schopností uvažování stroj dosáhl úrovně nejlepších lidských odborníků<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.

Je důležité poznamenat, že ani úplné absolvování HLE nebude znamenat dosažení obecné umělé inteligence (AGI), protože test neověřuje tvůrčí schopnosti, iniciativu ani schopnost klást nové vědecké otázky<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.

S přihlédnutím k rychlému pokroku výzkumníci předpokládají, že modely by mohly překročit 50% přesnost na HLE do konce roku 2025. To by znamenalo, že stroje se těsně přiblížily lidské úrovni v úzké, avšak důležité metrice akademických znalostí<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_note-hle_site-4)</sup>.

## Odkazy

- Oficiální stránka Humanity's Last Exam
- Vědecký článek představující benchmark

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Poznámky

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(CS)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[6]</a></span>
