Humanity's Last Exam (benchmark) (NL)
Humanity's Last Exam (HLE, Ned. «Het Laatste Examen van de Mensheid») — een uitgebreide test-benchmark, ontworpen om de mogelijkheden van geavanceerde kunstmatige intelligentie (AI)-systemen te beoordelen op taken die een kennisniveau en redeneervaardigheden vereisen die vergelijkbaar zijn met die van de beste menselijke experts. De benchmark werd ontwikkeld in 2024–2025 door de non-profitorganisatie Center for AI Safety (CAIS) in samenwerking met het bedrijf Scale AI[1].
Het HLE-project is bedoeld als het «laatste academische examen» voor AI-modellen — een uiterst moeilijke proef die moet bepalen of hedendaagse modellen de expertklasse benaderen en waar de kloof in hun capaciteiten blijft bestaan[1]. De benchmark omvat 2500 uiterst complexe vragen, verspreid over meer dan honderd verschillende disciplines[2].
Geschiedenis van de ontwikkeling
Tegen het midden van de jaren 2020 hadden grote taalmodellen zoals GPT-4 en Claude zulke hoge resultaten behaald op populaire testsets (zoals MMLU) dat veel benchmarks niet langer als betrouwbare maatstaf voor vooruitgang konden dienen. Standaardexamens op bachelorniveau werden door modellen praktisch «vernietigd», wat een objectieve beoordeling van verdere verbeteringen onmogelijk maakte[3].
In deze situatie stelde Dan Hendrycks (Dan Hendrycks), directeur van CAIS en bekend AI-onderzoeker, het concept van het «Laatste Examen van de Mensheid» voor — een reeks vragen van maximale moeilijkheidsgraad, die de mogelijkheden van AI zou kunnen onderscheiden van het niveau van een echte expert. De aanleiding was een gesprek met ondernemer Elon Musk, die de mening uitsprak dat de bestaande tests te gemakkelijk waren geworden[2].
Om het idee te realiseren bundelde CAIS de krachten met Scale AI. Op 15 september 2024 werd officieel een wereldwijde inzamelingsactie voor de moeilijkste vragen voor het toekomstige examen aangekondigd. De organisatoren richtten zich tot wetenschappers en specialisten over de hele wereld met een uitnodiging om vraagstukken in te dienen die zelfs de meest geavanceerde AI-modellen voor uitdagingen zouden stellen. Om deelnemers te motiveren werd een prijzenpot van $500.000 ingesteld[3].
De selectie van vraagstukken verliep in meerdere fasen. Eerst werden de ingezonden vragen gefilterd met behulp van geavanceerde AI-modellen: als de algoritmen een vraagstuk vol vertrouwen oplosten, werd het afgekeurd als onvoldoende moeilijk. Opgaven waarbij de AI tekortschoot, ondergingen een deskundigentoetsing om de juistheid en het bestaan van één correct antwoord te beoordelen. Uiteindelijk namen bijna 1000 experts uit meer dan 500 wetenschappelijke en onderwijsinstellingen deel aan de samenstelling van de set[4].
De definitieve versie van de benchmark, met 2500 vragen, werd begin 2025 gepresenteerd. Een deel van de opgaven is in een gesloten reserve gehouden voor controletoetsing en om te voorkomen dat modellen worden afgestemd op een vaste set[2].
Structuur en inhoud van de benchmark
De vragenset van HLE bestrijkt een zeer breed spectrum van academische disciplines. De opgaven zijn thematisch als volgt verdeeld:
- Wiskunde: ~41%
- Biologie en geneeskunde: ~11%
- Informatica en AI: ~10%
- Natuurkunde: ~9%
- Geesteswetenschappen en sociale wetenschappen: ~9%
- Scheikunde: ~7%
- Ingenieurswetenschappen: ~4%
- Overige gebieden: ~9%
Ongeveer 14% van alle opgaven is multimodaal, dat wil zeggen dat voor de oplossing ervan analyse van afbeeldingen (tekeningen, diagrammen, opschriften) vereist is[2]. De meerderheid (ongeveer 3/4) van de opgaven bestaat uit open vragen met een kort antwoord, waarbij het model zelfstandig een precies antwoord moet genereren (een getal, term of naam). De overige zijn meerkeuzevragen.
Alle vraagstukken in HLE hebben gemeenschappelijke eigenschappen:
- Extreem hoge moeilijkheidsgraad: Elk vraagstuk vereist een kennis- en vaardigheidsniveau dat vergelijkbaar is met dat van een gekwalificeerde specialist op het betreffende gebied[5].
- Verifieerbaar antwoord: Elke vraag heeft een bepaald en aantoonbaar correct antwoord.
- Bestand tegen zoekacties: De opgaven zijn zo samengesteld dat het antwoord niet via een eenvoudige zoekopdracht te vinden is; voor succes is een diep begrip van de materie en redeneervaardigheden vereist[1].
Resultaten van de modeltests
Humanity's Last Exam bevestigde onmiddellijk zijn reputatie als uiterst moeilijke proef: geen van de hedendaagse AI-modellen slaagde erin een resultaat te behalen dat ook maar in de buurt komt van het menselijk niveau. De beste taalmodellen van 2025 toonden een zeer lage nauwkeurigheid.
- Verschillende versies van GPT-4 van OpenAI en Claude van Anthropic behaalden een score van minder dan 10%[4].
- Het hoogste resultaat onder standaard LLM's werd behaald door het model Gemini 2.5 Pro (Google DeepMind) met een nauwkeurigheid van ongeveer 21,6%[4].
- Zelfs de beste modellen faalden op circa 4/5 van de HLE-vragen, wat de omvang van de kloof tussen de huidige AI-mogelijkheden en het niveau van een menselijke expert onderstreept[1].
Bijzondere interesse wekt het resultaat van de experimentele agent ChatGPT Deep Research van OpenAI, die automatisch zoekopdrachten mocht uitvoeren. Door het werk van een onderzoeker te imiteren, slaagde deze agent erin 26,6% van de opgaven correct op te lossen — een resultaat van meer dan 2 keer hoger dan dat van welk model dan ook zonder dergelijke hulpmiddelen, maar nog altijd ver verwijderd van een voldoende score[6].
Betekenis en vooruitzichten
Het verschijnen van HLE was een betekenisvolle gebeurtenis in de AI-gemeenschap, omdat de benchmark voorziet in een dringende behoefte aan een nieuwe, complexere maatstaf voor vooruitgang.
- Gemeenschappelijk referentiepunt. HLE biedt onderzoekers en beleidsmakers een objectief instrument om de mogelijkheden van AI te beoordelen, waardoor de dynamiek van verbeteringen gevolgd kan worden en inzichtelijk wordt hoe dicht machines het menselijk niveau naderen.
- Instrument voor beleidsvorming. Het bestaan van een dergelijke referentietest draagt bij aan meer inhoudelijke discussies over de richting van AI-ontwikkeling, potentiële risico's en noodzakelijke reguleringsmaatregelen.
- Definitieve grens van academische proeven. De naam «Laatste Examen» zelf weerspiegelt het idee dat deze vragenset het laatste gesloten examen kan worden voor de beoordeling van AI. Een overtuigende doorstaan van HLE zal betekenen dat de machine, wat betreft formele kennis en strikt verifieerbare redeneervaardigheden, het niveau van de beste menselijke experts heeft bereikt[4].
Het is belangrijk op te merken dat zelfs het volledig doorstaan van HLE niet zal betekenen dat kunstmatige algemene intelligentie (AGI) is bereikt, omdat de test geen creatieve vermogens, initiatief of het vermogen om nieuwe wetenschappelijke vragen te stellen beoordeelt[4].
Gezien de snelle vooruitgang veronderstellen onderzoekers dat modellen tegen het einde van 2025 meer dan 50% nauwkeurigheid op HLE kunnen bereiken. Dit zou betekenen dat machines het menselijk niveau op een smalle maar belangrijke maatstaf van academische kennis dicht hebben genaderd[4].
Verwijzingen
- Officiële website van Humanity's Last Exam
- Wetenschappelijk artikel dat de benchmark introduceert
Literatuur
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Noten
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]