---
title: "Humanity's Last Exam (benchmark) (HU)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3025
wiki_created_at: 2026-09-06T23:14:30Z
wiki_modified_at: 2026-09-06T23:14:30Z
downloaded_at: 2026-09-07T22:54:31Z
---

# Humanity's Last Exam (benchmark) (HU)

**Humanity's Last Exam** (**HLE**, magyarul: „Az emberiség utolsó vizsgája") — egy átfogó tesztelési benchmark, amelyet a fejlett mesterséges intelligencia (MI) rendszerek képességeinek értékelésére terveztek olyan feladatokon, amelyek a legjobb emberi szakértőkéhez mérhető tudást és következtetési készséget igényelnek. A benchmarkot 2024–2025-ben a Center for AI Safety (CAIS) nonprofit szervezet fejlesztette ki a Scale AI vállalattal együttműködve<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_paper-1)</sup>.

A HLE projekt az MI-modellek „utolsó akadémiai vizsgájaként" lett megalkotva — egy rendkívül nehéz próbatételként, amely lehetővé teszi annak meghatározását, hogy a jelenlegi modellek közelednek-e a szakértői szinthez, és hol marad fenn a képességeikben mutatkozó szakadék<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_paper-1)</sup>. A benchmark 2500 rendkívül nehéz kérdést tartalmaz, amelyek több mint száz különböző diszciplínát ölelnek fel<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-wiki_hle-2)</sup>.

## História

A 2020-as évek közepére az olyan nagy nyelvi modellek, mint a GPT-4 és a Claude, olyan magas eredményeket értek el a népszerű tesztkészleteken (például az MMLU-n), hogy sok benchmark megszűnt a fejlődés megbízható mérőeszközeként szolgálni. A standard alapképzési szintű vizsgákat a modellek gyakorlatilag „elsöpörték", ami lehetetlenné tette a további fejlesztések objektív értékelését<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-reuters_stump-3)</sup>.

Ebben a helyzetben **Dan Hendrycks**, a CAIS igazgatója és jeles MI-kutató, javasolta az „Az emberiség utolsó vizsgája" koncepcióját — egy maximálisan nehéz kérdéssor összeállítását, amely képes lenne megkülönböztetni az MI képességeit a valódi szakértő szintjétől. A kezdeményezést egy Elon Musk vállalkozóval folytatott beszélgetés váltotta ki, aki azt a véleményét fejezte ki, hogy a meglévő tesztek túlságosan könnyűvé váltak<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-wiki_hle-2)</sup>.

Az ötlet megvalósítása érdekében a CAIS összefogott a Scale AI-jal. 2024. szeptember 15-én hivatalosan bejelentették a leendő vizsga legnehezebb kérdéseinek globális gyűjtését. A szervezők a világ tudósait és szakembereit kérték fel arra, hogy küldjenek be olyan feladatokat, amelyek még a legfejlettebb MI-modelleket is zavarba hoznák. A résztvevők motiválása érdekében 500 000 dolláros díjalapot hoztak létre<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-reuters_stump-3)</sup>.

A feladatok kiválasztása több szakaszban zajlott. Először a beküldött kérdéseket fejlett MI-modellek segítségével szűrték: ha az algoritmusok magabiztosan megoldották a feladatot, azt mint nem eléggé nehézet elvetették. Azok a feladatok, amelyekkel az MI nem boldogult, szakértői ellenőrzésen estek át a helyesség és az egyetlen helyes válasz meglétének értékelése érdekében. Végül a készlet összeállításában közel 1000 szakértő vett részt, több mint 500 tudományos és oktatási intézményből<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.

A benchmark végleges, **2500 kérdést** tartalmazó változatát 2025 elején mutatták be. A feladatok egy részét zárt tartalékban hagyták az ellenőrző tesztelés céljára és annak megakadályozására, hogy a modellek egy rögzített készlethez igazodjanak<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-wiki_hle-2)</sup>.

## A benchmark szerkezete és tartalma

A HLE kérdéskészlete az akadémiai tudás rendkívül széles spektrumát öleli fel. A feladatok tematikus megoszlása a következő:

- **Matematika**: ~41%
- **Biológia és orvostudomány**: ~11%
- **Informatika és MI**: ~10%
- **Fizika**: ~9%
- **Humán- és társadalomtudományok**: ~9%
- **Kémia**: ~7%
- **Mérnöki tudományok**: ~4%
- **Egyéb területek**: ~9%

Az összes feladat mintegy **14%-a** **multimodális**, vagyis megoldásukhoz képelemzés szükséges (rajzok, diagramok, feliratok)<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-wiki_hle-2)</sup>. A feladatok többsége (körülbelül 3/4-e) **rövid választ igénylő nyílt kérdés**, ahol a modellnek önállóan kell előállítania a pontos választ (szám, fogalom, név). A többi feleletválasztós kérdés.

A HLE összes feladata közös tulajdonságokkal rendelkezik:

- **Rendkívül magas nehézség**: Minden feladat az adott területen jártas kvalifikált szakértőéhez mérhető tudást és készségeket igényel<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-techradar_pass-5)</sup>.
- **Ellenőrizhető válasz**: Minden kérdésnek van meghatározott és bizonyítható helyes válasza.
- **Keresésállóság**: A feladatokat úgy válogatták össze, hogy a választ ne lehessen egyszerű keresési lekérdezéssel megtalálni; a sikerhez a téma mély megértése és következtetési képesség szükséges<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_paper-1)</sup>.

## A modellek tesztelési eredményei

A Humanity's Last Exam azonnal igazolta rendkívül nehéz próbatétel hírnevét: **a jelenlegi MI-modellek egyike sem tudott az emberi szinthez közelítő eredményt elérni rajta**. A 2025-ös legjobb nyelvi modellek nagyon alacsony pontosságot mutattak.

- Az OpenAI **GPT-4**-ének és az Anthropic **Claude**-jának különböző verziói **10% alatti** eredményt értek el<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.
- A standard LLM-ek közül a legmagasabb eredményt a **Gemini 2.5 Pro** (Google DeepMind) érte el, körülbelül **21,6%-os** pontossággal<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.
- Még a legjobb modellek is a HLE kérdéseinek körülbelül 4/5-ét tévesztették el, ami rávilágít az MI jelenlegi képességei és az emberi szakértő szintje közötti szakadék nagyságára<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_paper-1)</sup>.

Különös érdeklődésre tart számot az OpenAI kísérleti **ChatGPT Deep Research** ügynökének eredménye, amelynek engedélyezték az automatikus keresési lekérdezések végrehajtását. Egy kutató munkáját szimulálva ez az ügynök a feladatok **26,6%-át** oldotta meg helyesen — ez több mint kétszerese bármely ilyen eszközök nélküli modell eredményének, de még mindig messze elmarad az átmenő szinttől<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hindustan_times_26-6)</sup>.

## Jelentőség és kilátások

A HLE megjelenése jelentős eseménnyé vált az MI-közösségben, mivel a benchmark betöltötte a fejlődés egy új, nehezebb mérőeszköze iránti égető igényt.

- **Közös viszonyítási alap**. A HLE objektív eszközt kínál a kutatóknak és a döntéshozóknak az MI képességeinek értékelésére, lehetővé téve a fejlesztések dinamikájának nyomon követését és annak megértését, hogy a gépek mennyire közelítenek az emberi szinthez.
- **Szakpolitikai tájékoztatási eszköz**. Egy ilyen referencia-teszt megléte elősegíti az MI fejlődési irányairól, a potenciális kockázatokról és a szükséges szabályozási intézkedésekről folyó érdemibb vitákat.
- **Az akadémiai próbatételek végső határköve**. Maga az „utolsó vizsga" elnevezés azt a gondolatot tükrözi, hogy ez a feladatkészlet lehet az MI értékelésének utolsó zárt vizsgája. A HLE magabiztos teljesítése azt jelenti majd, hogy a formális tudás és a szigorúan ellenőrizhető következtetési készségek terén a gép elérte a legjobb emberi szakértők szintjét<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.

Fontos megjegyezni, hogy a HLE teljes teljesítése sem fog általános mesterséges intelligencia (AGI) elérését jelenteni, mivel a teszt nem méri a kreatív képességeket, a kezdeményezőkészséget vagy az új tudományos kérdések megfogalmazásának képességét<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.

A gyors fejlődésre tekintettel a kutatók feltételezik, hogy a modellek 2025 végére meghaladhatják az 50%-os pontosságot a HLE-n. Ez azt fogja jelenteni, hogy a gépek szorosan felzárkóztak az emberi szinthez az akadémiai tudás egy szűk, de fontos metrikája tekintetében<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_note-hle_site-4)</sup>.

## Hivatkozások

- A Humanity's Last Exam hivatalos weboldala
- A benchmarkot bemutató tudományos cikk

## Irodalom

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Jegyzetek

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(HU)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[6]</a></span>
