Humanity's Last Exam (benchmark) (BG)
Humanity's Last Exam (HLE, бълг. „Последният изпит на човечеството") — комплексен тест-benchmark, предназначен за оценка на възможностите на напреднали системи за изкуствен интелект (ИИ) при задачи, изискващи ниво на знания и умения за разсъждение, сравнимо с най-добрите човешки експерти. Benchmark-ът е разработен през 2024–2025 г. от нестопанската организация Center for AI Safety (CAIS) съвместно с компанията Scale AI[1].
Проектът HLE е замислен като „последен академичен изпит" за модели на ИИ — изключително трудно изпитание, което позволява да се определи дали съвременните модели се доближават до експертно ниво и къде остава разривът в техните способности[1]. Benchmark-ът включва 2500 извънредно сложни въпроса, обхващащи повече от сто различни дисциплини[2].
История на създаването
Към средата на 2020-те години едрите езикови модели, като GPT-4 и Claude, демонстрираха толкова високи резултати в популярни тестови набори (например MMLU), че много benchmark-ове престанаха да служат като надеждна мярка за прогрес. Стандартните изпити от бакалавърско ниво бяха практически „разгромени" от моделите, което направи невъзможна обективната оценка на по-нататъшните подобрения[3].
В тази ситуация Дан Хендрикс (Dan Hendrycks), директор на CAIS и известен изследовател в областта на ИИ, предложи концепцията за „Последния изпит на човечеството" — набор от въпроси с максимална сложност, способен да разграничи възможностите на ИИ от нивото на истински експерт. Тласъкът дойде от разговор с предприемача Илон Мъск, който изрази мнението, че съществуващите тестове са станали прекалено лесни[2].
За реализацията на идеята CAIS обедини усилията си с Scale AI. На 15 септември 2024 г. беше официално обявено глобално събиране на най-трудните въпроси за бъдещия изпит. Организаторите се обърнаха към учени и специалисти от цял свят с покана да изпратят задачи, способни да затруднят дори най-напредналите модели на ИИ. За мотивиране на участниците беше учреден награден фонд от $500 000[3].
Отборът на задачите протичаше на няколко етапа. Първо изпратените въпроси преминаваха през филтър с помощта на напреднали модели на ИИ: ако алгоритмите решаваха задачата уверено, тя се отстраняваше като недостатъчно трудна. Заданията, с които ИИ не се справяше, преминаваха експертна проверка за оценка на коректността и наличието на единствен верен отговор. В крайна сметка в изграждането на набора участваха близо 1000 експерти от повече от 500 научно-образователни институции[4].
Окончателната версия на benchmark-а, включваща 2500 въпроса, беше представена в началото на 2025 г. Част от заданията са запазени в затворен резерв за контролно тестване и предотвратяване на приспособяването на моделите към фиксиран набор[2].
Структура и съдържание на benchmark-а
Наборът от въпроси на HLE обхваща изключително широк спектър от дисциплини на академичното знание. Заданията са разпределени тематично по следния начин:
- Математика: ~41%
- Биология и медицина: ~11%
- Информатика и ИИ: ~10%
- Физика: ~9%
- Хуманитарни и социални науки: ~9%
- Химия: ~7%
- Инженерни науки: ~4%
- Други области: ~9%
Около 14% от всички задания са мултимодални, тоест за тяхното решаване се изисква анализ на изображения (рисунки, диаграми, надписи)[2]. Повечето (около 3/4) задания представляват отворени въпроси с кратък отговор, при които моделът трябва самостоятелно да генерира точен отговор (число, термин, име). Останалите са въпроси с множествен избор.
Всички задачи в HLE притежават общи свойства:
- Изключително висока сложност: Всеки проблем изисква ниво на знания и умения, сравнимо с квалифициран специалист в съответната област[5].
- Проверим отговор: Всеки въпрос има определен и доказуемо верен отговор.
- Устойчивост към търсене: Заданията са подбрани така, че отговорът да не може да бъде намерен с обикновено търсачно запитване; за успех се изисква задълбочено разбиране на предмета и разсъждение[1].
Резултати от проверката на моделите
Humanity's Last Exam веднага потвърди репутацията си на изключително трудно изпитание: нито един от съвременните модели на ИИ не успя да покаже резултат, близък до човешкия. Най-добрите езикови модели към 2025 г. демонстрираха много ниска точност.
- Различни версии на GPT-4 от OpenAI и Claude от Anthropic показаха резултат под 10%[4].
- Най-високият резултат сред стандартните LLM постигна моделът Gemini 2.5 Pro (Google DeepMind) с точност около 21,6%[4].
- Дори най-добрите модели пропаднаха на около 4/5 от въпросите на HLE, което подчертава мащаба на разрива между текущите възможности на ИИ и нивото на човешкия експерт[1].
Особен интерес представлява резултатът на експерименталния агент ChatGPT Deep Research от OpenAI, на когото беше разрешено автоматично да извършва търсачни запитвания. Имитирайки работата на изследовател, този агент успя да реши правилно 26,6% от заданията — резултат повече от 2 пъти по-висок от този на всеки модел без подобни инструменти, но все още много далеч от проходния бал[6].
Значение и перспективи
Появата на HLE се превърна в значимо събитие в общността на ИИ, тъй като benchmark-ът запълни належащата нужда от нова, по-сложна мярка за прогрес.
- Обща отправна точка. HLE предлага на изследователите и на политиците обективен инструмент за оценка на възможностите на ИИ, позволявайки да се проследи динамиката на подобренията и да се разбере доколко машините се доближават до човешкото ниво.
- Инструмент за информиране на политиката. Наличието на такъв еталонен тест допринася за по-конкретни дискусии относно посоките на развитие на ИИ, потенциалните рискове и необходимите регулаторни мерки.
- Финална граница на академичните изпитания. Самото наименование „Последният изпит" отразява идеята, че този набор от задачи може да се окаже последният затворен изпит за оценка на ИИ. Уверено преминаване на HLE ще означава, че по отношение на формалните знания и строго проверимите умения за разсъждение машината е достигнала нивото на най-добрите човешки експерти[4].
Важно е да се отбележи, че дори пълното преминаване на HLE няма да означава постигане на общ изкуствен интелект (AGI), тъй като тестът не проверява творческите способности, инициативността или умението да се поставят нови научни въпроси[4].
С оглед на бързия прогрес изследователите предполагат, че моделите могат да надхвърлят 50% точност на HLE към края на 2025 г. Това ще означава, че машините са се доближили плътно до човешкото ниво по тясна, но важна метрика на академичните знания[4].
Препратки
- Официален сайт на Humanity's Last Exam
- Научна статия, представяща benchmark-а
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]