Humanity's Last Exam (benchmark) (HU)
Humanity's Last Exam (HLE, magyarul: „Az emberiség utolsó vizsgája") — egy átfogó tesztelési benchmark, amelyet a fejlett mesterséges intelligencia (MI) rendszerek képességeinek értékelésére terveztek olyan feladatokon, amelyek a legjobb emberi szakértőkéhez mérhető tudást és következtetési készséget igényelnek. A benchmarkot 2024–2025-ben a Center for AI Safety (CAIS) nonprofit szervezet fejlesztette ki a Scale AI vállalattal együttműködve[1].
A HLE projekt az MI-modellek „utolsó akadémiai vizsgájaként" lett megalkotva — egy rendkívül nehéz próbatételként, amely lehetővé teszi annak meghatározását, hogy a jelenlegi modellek közelednek-e a szakértői szinthez, és hol marad fenn a képességeikben mutatkozó szakadék[1]. A benchmark 2500 rendkívül nehéz kérdést tartalmaz, amelyek több mint száz különböző diszciplínát ölelnek fel[2].
História
A 2020-as évek közepére az olyan nagy nyelvi modellek, mint a GPT-4 és a Claude, olyan magas eredményeket értek el a népszerű tesztkészleteken (például az MMLU-n), hogy sok benchmark megszűnt a fejlődés megbízható mérőeszközeként szolgálni. A standard alapképzési szintű vizsgákat a modellek gyakorlatilag „elsöpörték", ami lehetetlenné tette a további fejlesztések objektív értékelését[3].
Ebben a helyzetben Dan Hendrycks, a CAIS igazgatója és jeles MI-kutató, javasolta az „Az emberiség utolsó vizsgája" koncepcióját — egy maximálisan nehéz kérdéssor összeállítását, amely képes lenne megkülönböztetni az MI képességeit a valódi szakértő szintjétől. A kezdeményezést egy Elon Musk vállalkozóval folytatott beszélgetés váltotta ki, aki azt a véleményét fejezte ki, hogy a meglévő tesztek túlságosan könnyűvé váltak[2].
Az ötlet megvalósítása érdekében a CAIS összefogott a Scale AI-jal. 2024. szeptember 15-én hivatalosan bejelentették a leendő vizsga legnehezebb kérdéseinek globális gyűjtését. A szervezők a világ tudósait és szakembereit kérték fel arra, hogy küldjenek be olyan feladatokat, amelyek még a legfejlettebb MI-modelleket is zavarba hoznák. A résztvevők motiválása érdekében 500 000 dolláros díjalapot hoztak létre[3].
A feladatok kiválasztása több szakaszban zajlott. Először a beküldött kérdéseket fejlett MI-modellek segítségével szűrték: ha az algoritmusok magabiztosan megoldották a feladatot, azt mint nem eléggé nehézet elvetették. Azok a feladatok, amelyekkel az MI nem boldogult, szakértői ellenőrzésen estek át a helyesség és az egyetlen helyes válasz meglétének értékelése érdekében. Végül a készlet összeállításában közel 1000 szakértő vett részt, több mint 500 tudományos és oktatási intézményből[4].
A benchmark végleges, 2500 kérdést tartalmazó változatát 2025 elején mutatták be. A feladatok egy részét zárt tartalékban hagyták az ellenőrző tesztelés céljára és annak megakadályozására, hogy a modellek egy rögzített készlethez igazodjanak[2].
A benchmark szerkezete és tartalma
A HLE kérdéskészlete az akadémiai tudás rendkívül széles spektrumát öleli fel. A feladatok tematikus megoszlása a következő:
- Matematika: ~41%
- Biológia és orvostudomány: ~11%
- Informatika és MI: ~10%
- Fizika: ~9%
- Humán- és társadalomtudományok: ~9%
- Kémia: ~7%
- Mérnöki tudományok: ~4%
- Egyéb területek: ~9%
Az összes feladat mintegy 14%-a multimodális, vagyis megoldásukhoz képelemzés szükséges (rajzok, diagramok, feliratok)[2]. A feladatok többsége (körülbelül 3/4-e) rövid választ igénylő nyílt kérdés, ahol a modellnek önállóan kell előállítania a pontos választ (szám, fogalom, név). A többi feleletválasztós kérdés.
A HLE összes feladata közös tulajdonságokkal rendelkezik:
- Rendkívül magas nehézség: Minden feladat az adott területen jártas kvalifikált szakértőéhez mérhető tudást és készségeket igényel[5].
- Ellenőrizhető válasz: Minden kérdésnek van meghatározott és bizonyítható helyes válasza.
- Keresésállóság: A feladatokat úgy válogatták össze, hogy a választ ne lehessen egyszerű keresési lekérdezéssel megtalálni; a sikerhez a téma mély megértése és következtetési képesség szükséges[1].
A modellek tesztelési eredményei
A Humanity's Last Exam azonnal igazolta rendkívül nehéz próbatétel hírnevét: a jelenlegi MI-modellek egyike sem tudott az emberi szinthez közelítő eredményt elérni rajta. A 2025-ös legjobb nyelvi modellek nagyon alacsony pontosságot mutattak.
- Az OpenAI GPT-4-ének és az Anthropic Claude-jának különböző verziói 10% alatti eredményt értek el[4].
- A standard LLM-ek közül a legmagasabb eredményt a Gemini 2.5 Pro (Google DeepMind) érte el, körülbelül 21,6%-os pontossággal[4].
- Még a legjobb modellek is a HLE kérdéseinek körülbelül 4/5-ét tévesztették el, ami rávilágít az MI jelenlegi képességei és az emberi szakértő szintje közötti szakadék nagyságára[1].
Különös érdeklődésre tart számot az OpenAI kísérleti ChatGPT Deep Research ügynökének eredménye, amelynek engedélyezték az automatikus keresési lekérdezések végrehajtását. Egy kutató munkáját szimulálva ez az ügynök a feladatok 26,6%-át oldotta meg helyesen — ez több mint kétszerese bármely ilyen eszközök nélküli modell eredményének, de még mindig messze elmarad az átmenő szinttől[6].
Jelentőség és kilátások
A HLE megjelenése jelentős eseménnyé vált az MI-közösségben, mivel a benchmark betöltötte a fejlődés egy új, nehezebb mérőeszköze iránti égető igényt.
- Közös viszonyítási alap. A HLE objektív eszközt kínál a kutatóknak és a döntéshozóknak az MI képességeinek értékelésére, lehetővé téve a fejlesztések dinamikájának nyomon követését és annak megértését, hogy a gépek mennyire közelítenek az emberi szinthez.
- Szakpolitikai tájékoztatási eszköz. Egy ilyen referencia-teszt megléte elősegíti az MI fejlődési irányairól, a potenciális kockázatokról és a szükséges szabályozási intézkedésekről folyó érdemibb vitákat.
- Az akadémiai próbatételek végső határköve. Maga az „utolsó vizsga" elnevezés azt a gondolatot tükrözi, hogy ez a feladatkészlet lehet az MI értékelésének utolsó zárt vizsgája. A HLE magabiztos teljesítése azt jelenti majd, hogy a formális tudás és a szigorúan ellenőrizhető következtetési készségek terén a gép elérte a legjobb emberi szakértők szintjét[4].
Fontos megjegyezni, hogy a HLE teljes teljesítése sem fog általános mesterséges intelligencia (AGI) elérését jelenteni, mivel a teszt nem méri a kreatív képességeket, a kezdeményezőkészséget vagy az új tudományos kérdések megfogalmazásának képességét[4].
A gyors fejlődésre tekintettel a kutatók feltételezik, hogy a modellek 2025 végére meghaladhatják az 50%-os pontosságot a HLE-n. Ez azt fogja jelenteni, hogy a gépek szorosan felzárkóztak az emberi szinthez az akadémiai tudás egy szűk, de fontos metrikája tekintetében[4].
Hivatkozások
- A Humanity's Last Exam hivatalos weboldala
- A benchmarkot bemutató tudományos cikk
Irodalom
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Jegyzetek
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]