Humanity's Last Exam (benchmark) (SV)
Humanity's Last Exam (HLE, sv. «Mänsklighetens sista examen») — ett omfattande benchmark-test utformat för att utvärdera kapaciteten hos avancerade system för artificiell intelligens (AI) på uppgifter som kräver en nivå av kunskap och resoneringsförmåga jämförbar med de bästa mänskliga experterna. Benchmarktet utvecklades 2024–2025 av den ideella organisationen Center for AI Safety (CAIS) i samarbete med företaget Scale AI[1].
Projektet HLE är tänkt som den «sista akademiska examen» för AI-modeller — ett ytterst svårt prov som ska avgöra huruvida moderna modeller närmar sig expertnivå och var det fortfarande finns luckor i deras förmågor[1]. Benchmarktet innehåller 2 500 utomordentligt svåra frågor som täcker mer än hundra olika discipliner[2].
Skapandehistorik
I mitten av 2020-talet hade stora språkmodeller som GPT-4 och Claude uppnått så höga resultat på populära testset (exempelvis MMLU) att många benchmark hade upphört att fungera som tillförlitliga mått på framsteg. Standardexamina på kandidatnivå hade i praktiken «krossats» av modellerna, vilket gjort det omöjligt att objektivt bedöma fortsatta förbättringar[3].
I detta läge föreslog Dan Hendrycks (Dan Hendrycks), direktör för CAIS och välkänd AI-forskare, konceptet «Mänsklighetens sista examen» — en uppsättning frågor av maximal svårighetsgrad som skulle kunna skilja AI:s förmågor från en verklig experts nivå. Impulsen kom från ett samtal med entreprenören Elon Musk, som uttryckte uppfattningen att befintliga tester hade blivit alltför enkla[2].
För att förverkliga idén förenade CAIS sina krafter med Scale AI. Den 15 september 2024 tillkännagavs officiellt en global insamling av de svåraste frågorna för den kommande examen. Arrangörerna vände sig till forskare och specialister runt om i världen med en inbjudan att skicka in uppgifter som skulle kunna förbryllla även de mest avancerade AI-modellerna. För att motivera deltagarna inrättades en prispott på 500 000 dollar[3].
Urvalet av uppgifter skedde i flera steg. De inkomna frågorna filtrerades först med hjälp av avancerade AI-modeller: om algoritmerna löste en uppgift med säkerhet sållades den bort som otillräckligt svår. Uppgifter som AI inte klarade genomgick expertgranskning för att bedöma korrektheten och förekomsten av ett enda rätt svar. Sammantaget deltog nära 1 000 experter från mer än 500 vetenskapliga och utbildningsinstitutioner i sammansättningen av testset[4].
Slutversionen av benchmarktet, bestående av 2 500 frågor, presenterades i början av 2025. En del av uppgifterna har lämnats i ett slutet reservförråd för kontrollprovning och för att förhindra att modeller anpassas till en fast uppsättning[2].
Benchmarktets struktur och innehåll
HLE:s frågeuppsättning täcker ett ytterst brett spektrum av akademiska discipliner. Uppgifterna fördelar sig ämnesmässigt på följande sätt:
- Matematik: ~41%
- Biologi och medicin: ~11%
- Datavetenskap och AI: ~10%
- Fysik: ~9%
- Humaniora och samhällsvetenskap: ~9%
- Kemi: ~7%
- Ingenjörsvetenskap: ~4%
- Övriga områden: ~9%
Omkring 14% av alla uppgifter är multimodala, det vill säga att deras lösning kräver analys av bilder (ritningar, diagram, inskriptioner)[2]. Majoriteten (ungefär 3/4) av uppgifterna är öppna frågor med kort svar, där modellen självständigt måste generera ett exakt svar (ett tal, en term, ett namn). Resterande är flervalsfrågor.
Alla uppgifter i HLE delar gemensamma egenskaper:
- Extremt hög svårighetsgrad: Varje problem kräver en kunskaps- och färdighetsnivå jämförbar med en kvalificerad specialist inom det aktuella området[5].
- Verifierbart svar: Varje fråga har ett bestämt och bevisbart rätt svar.
- Motståndskraft mot sökning: Uppgifterna är utvalda så att svaret inte kan hittas med en enkel sökfråga; djup ämnesförståelse och resonemang krävs för framgång[1].
Modellernas testresultat
Humanity's Last Exam bekräftade omedelbart sitt rykte som ett ytterst svårt prov: ingen av de moderna AI-modellerna lyckades uppnå ett resultat nära den mänskliga nivån på det. De bästa språkmodellerna år 2025 uppvisade mycket låg träffsäkerhet.
- Olika versioner av GPT-4 från OpenAI och Claude från Anthropic uppnådde resultat på under 10%[4].
- Det högsta resultatet bland vanliga LLM uppnåddes av modellen Gemini 2.5 Pro (Google DeepMind) med en träffsäkerhet på ungefär 21,6%[4].
- Även de bästa modellerna misslyckades med ungefär 4/5 av HLE:s frågor, vilket understryker storleken på klyftan mellan nuvarande AI-förmågor och en mänsklig experts nivå[1].
Av särskilt intresse är resultatet för den experimentella agenten ChatGPT Deep Research från OpenAI, som tilläts utföra automatiska sökfrågor. Genom att imitera en forskares arbete lyckades denna agent lösa 26,6% av uppgifterna korrekt — ett resultat mer än dubbelt så högt som för någon modell utan sådana verktyg, men ändå långt ifrån ett godkänt betyg[6].
Betydelse och framtidsutsikter
Tillkomsten av HLE var en betydelsefull händelse i AI-gemenskapen, eftersom benchmarktet fyllde ett akut behov av ett nytt, mer krävande mått på framsteg.
- Gemensam referenspunkt. HLE erbjuder forskare och beslutsfattare ett objektivt verktyg för att bedöma AI:s förmågor, vilket möjliggör uppföljning av förbättringsdynamiken och förståelse för hur nära maskinerna närmar sig den mänskliga nivån.
- Verktyg för policyinformation. Förekomsten av ett sådant referenstest bidrar till mer konkreta diskussioner om AI:s utvecklingsriktningar, potentiella risker och nödvändiga regleringsåtgärder.
- Den sista gränsen för akademiska prövningar. Själva benämningen «Sista examen» speglar idén att denna uppgiftssamling kan bli den sista slutna examen för utvärdering av AI. Att klara HLE med säkerhet kommer att innebära att maskinen, vad gäller formella kunskaper och strikt verifierbara resoneringsförmågor, har nått nivån hos de bästa mänskliga experterna[4].
Det är viktigt att notera att även ett fullständigt genomförande av HLE inte kommer att innebära att artificiell allmänintelligens (AGI) har uppnåtts, eftersom testet inte prövar kreativa förmågor, initiativförmåga eller förmågan att formulera nya vetenskapliga frågor[4].
Med hänsyn till den snabba utvecklingen förutspår forskare att modellerna kan överskrida 50% träffsäkerhet på HLE i slutet av 2025. Detta skulle innebära att maskinerna har kommit nära den mänskliga nivån vad gäller ett smalt men viktigt mått på akademisk kunskap[4].
Länkar
- Humanity's Last Exams officiella webbplats
- Den vetenskapliga artikel som presenterar benchmarktet
Litteratur
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Noter
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]