Humanity's Last Exam (benchmark) (PL)
Humanity's Last Exam (HLE, pol. „Ostatni egzamin ludzkości") — kompleksowy test-benchmark przeznaczony do oceny możliwości zaawansowanych systemów sztucznej inteligencji (SI) w zadaniach wymagających poziomu wiedzy i umiejętności rozumowania porównywalnego z najlepszymi ludzkimi ekspertami. Benchmark został opracowany w latach 2024–2025 przez organizację non-profit Center for AI Safety (CAIS) we współpracy z firmą Scale AI[1].
Projekt HLE pomyślany jest jako „ostatni akademicki egzamin" dla modeli SI — niezwykle trudna próba, która pozwoli określić, czy współczesne modele zbliżają się do poziomu eksperckiego i gdzie pozostaje luka w ich możliwościach[1]. Benchmark zawiera 2500 niezwykle trudnych pytań obejmujących ponad sto różnych dyscyplin[2].
Historia powstania
W połowie lat dwudziestych XXI wieku duże modele językowe, takie jak GPT-4 i Claude, osiągnęły tak wysokie wyniki w popularnych zestawach testowych (na przykład MMLU), że wiele benchmarków przestało służyć jako wiarygodna miara postępu. Standardowe egzaminy na poziomie licencjackim zostały praktycznie „rozgromione" przez modele, co uniemożliwiło obiektywną ocenę dalszych ulepszeń[3].
W tej sytuacji Dan Hendrycks (Dan Hendrycks), dyrektor CAIS i znany badacz SI, zaproponował koncepcję „Ostatniego egzaminu ludzkości" — zestawu pytań o maksymalnym stopniu trudności, który pozwoliłby odróżnić możliwości SI od poziomu prawdziwego eksperta. Impulsem do działania stała się rozmowa z przedsiębiorcą Elonem Muskiem, który wyraził pogląd, że istniejące testy stały się zbyt łatwe[2].
Aby zrealizować ten pomysł, CAIS połączył siły ze Scale AI. 15 września 2024 roku oficjalnie ogłoszono globalny nabór najtrudniejszych pytań do przyszłego egzaminu. Organizatorzy zwrócili się do naukowców i specjalistów na całym świecie z zaproszeniem do nadsyłania zadań zdolnych postawić w impasie nawet najbardziej zaawansowane modele SI. W celu motywowania uczestników ustanowiono pulę nagród w wysokości 500 000 USD[3].
Selekcja zadań przebiegała w kilku etapach. Najpierw nadesłane pytania były filtrowane przy użyciu zaawansowanych modeli SI: jeśli algorytmy pewnie rozwiązywały zadanie, było ono odrzucane jako niewystarczająco trudne. Zadania, z którymi SI sobie nie radziła, przechodziły weryfikację ekspercką w celu oceny poprawności i istnienia jednej właściwej odpowiedzi. Ostatecznie w tworzeniu zestawu wzięło udział niemal 1000 ekspertów z ponad 500 instytucji naukowych i edukacyjnych[4].
Finalna wersja benchmarku, obejmująca 2500 pytań, została przedstawiona na początku 2025 roku. Część zadań pozostawiono w zamkniętej rezerwie na potrzeby kontrolnego testowania i zapobiegania dostosowywaniu modeli do ustalonego zestawu[2].
Struktura i zawartość benchmarku
Zestaw pytań HLE obejmuje niezwykle szeroki zakres dyscyplin wiedzy akademickiej. Zadania są rozłożone tematycznie w następujący sposób:
- Matematyka: ~41%
- Biologia i medycyna: ~11%
- Informatyka i SI: ~10%
- Fizyka: ~9%
- Nauki humanistyczne i społeczne: ~9%
- Chemia: ~7%
- Nauki inżynieryjne: ~4%
- Pozostałe dziedziny: ~9%
Około 14% wszystkich zadań ma charakter multimodalny, to znaczy do ich rozwiązania wymagana jest analiza obrazów (rysunków, diagramów, napisów)[2]. Większość (około 3/4) zadań to otwarte pytania z krótką odpowiedzią, gdzie model musi samodzielnie wygenerować dokładną odpowiedź (liczbę, termin, nazwę). Pozostałe to pytania wielokrotnego wyboru.
Wszystkie zadania w HLE posiadają wspólne właściwości:
- Niezwykle wysoki stopień trudności: Każdy problem wymaga poziomu wiedzy i umiejętności porównywalnego z wykwalifikowanym specjalistą w danej dziedzinie[5].
- Weryfikowalna odpowiedź: Każde pytanie posiada określoną i dającą się udowodnić poprawną odpowiedź.
- Odporność na wyszukiwanie: Zadania są dobrane tak, aby odpowiedzi nie można było znaleźć za pomocą prostego zapytania wyszukiwarki; do osiągnięcia sukcesu wymagane jest głębokie rozumienie przedmiotu i rozumowanie[1].
Wyniki testowania modeli
Humanity's Last Exam natychmiast potwierdził reputację niezwykle trudnej próby: żaden ze współczesnych modeli SI nie był w stanie osiągnąć na nim wyniku zbliżonego do ludzkiego. Najlepsze modele językowe roku 2025 wykazały bardzo niską dokładność.
- Różne wersje GPT-4 od OpenAI oraz Claude od Anthropic osiągnęły wynik poniżej 10%[4].
- Najwyższy wynik wśród standardowych LLM osiągnął model Gemini 2.5 Pro (Google DeepMind) z dokładnością wynoszącą około 21,6%[4].
- Nawet najlepsze modele nie zdały około 4/5 pytań HLE, co podkreśla skalę przepaści między obecnymi możliwościami SI a poziomem ludzkiego eksperta[1].
Szczególne zainteresowanie wzbudza wynik eksperymentalnego agenta ChatGPT Deep Research od OpenAI, któremu zezwolono na automatyczne wykonywanie zapytań wyszukiwania. Naśladując pracę badacza, agent ten zdołał poprawnie rozwiązać 26,6% zadań — wynik ponad 2 razy wyższy niż u jakiegokolwiek modelu bez takich narzędzi, jednak wciąż bardzo odległy od wyniku zaliczeniowego[6].
Znaczenie i perspektywy
Pojawienie się HLE stało się istotnym wydarzeniem w społeczności SI, ponieważ benchmark wypełnił pilną potrzebę nowej, bardziej wymagającej miary postępu.
- Wspólny punkt odniesienia. HLE oferuje badaczom i decydentom obiektywne narzędzie do oceny możliwości SI, pozwalając śledzić dynamikę ulepszeń i rozumieć, jak bardzo maszyny zbliżają się do poziomu ludzkiego.
- Narzędzie do informowania polityki. Posiadanie takiego wzorcowego testu sprzyja bardziej merytorycznym dyskusjom na temat kierunków rozwoju SI, potencjalnych zagrożeń i niezbędnych środków regulacyjnych.
- Ostateczna granica akademickich prób. Sama nazwa „Ostatni egzamin" odzwierciedla ideę, że ten zestaw zadań może stać się ostatnim zamkniętym egzaminem do oceny SI. Pewne zaliczenie HLE będzie oznaczać, że pod względem formalnej wiedzy i ściśle weryfikowalnych umiejętności rozumowania maszyna osiągnęła poziom najlepszych ludzkich ekspertów[4].
Ważne jest, że nawet pełne zaliczenie HLE nie będzie oznaczać osiągnięcia ogólnej sztucznej inteligencji (AGI), ponieważ test nie sprawdza zdolności twórczych, inicjatywy ani umiejętności stawiania nowych pytań naukowych[4].
Biorąc pod uwagę szybki postęp, badacze przewidują, że modele mogą przekroczyć 50% dokładności na HLE do końca 2025 roku. Będzie to oznaczać, że maszyny zbliżyły się do poziomu ludzkiego pod względem wąskiej, lecz ważnej metryki wiedzy akademickiej[4].
Odnośniki
- Oficjalna strona Humanity's Last Exam
- Artykuł naukowy przedstawiający benchmark
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Przypisy
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]