---
title: "Humanity's Last Exam"
source: "https://systems-analysis.info/wiki/Humanity's_Last_Exam"
wiki: "systems-analysis.info/wiki"
article: "Humanity's_Last_Exam"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 123
wiki_created_at: 2026-09-06T21:55:23Z
wiki_modified_at: 2026-09-06T21:55:23Z
downloaded_at: 2026-09-07T22:17:36Z
---

# Humanity's Last Exam

**Humanity's Last Exam** (**HLE**, «Последний экзамен человечества») — набор тестовых заданий (бенчмарк) для оценки способностей передовых систем искусственного интеллекта (ИИ) на закрытых академических задачах, которые требуют знаний и рассуждений на уровне ведущих экспертов. Бенчмарк создан в 2024–2025 годах некоммерческой организацией Center for AI Safety (CAIS) совместно с компанией Scale AI<sup>[\[1\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_paper-1)</sup>. Рецензируемая версия работы позднее вышла в журнале *Nature* в январе 2026 года под названием «A benchmark of expert-level academic questions to assess AI capabilities»<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>.

HLE задуман как «финальный академический экзамен» для моделей ИИ — предельно трудный тест с закрытыми ответами, призванный показать, насколько современные модели приблизились к экспертному уровню и где сохраняются пробелы в их возможностях<sup>[\[1\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_paper-1)</sup>. [Бенчмарк](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM") состоит из открыто опубликованного набора в 2500 вопросов более чем по сотне дисциплин и закрытого контрольного набора (holdout), по которому выявляют переобучение<sup>[\[1\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_paper-1)</sup>.

## Предыстория

К середине 2020-х годов ведущие языковые модели, такие как GPT-4 и Claude, достигли на популярных наборах тестов (например, MMLU) столь высоких результатов, что многие бенчмарки перестали быть надёжной мерой прогресса. Там, где эти тесты когда-то были трудным рубежом, передовые модели стали превышать 90 % точности, и объективно оценивать дальнейшие улучшения оказалось сложно<sup>[\[3\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-reuters_stump-3)</sup>. В отчёте *AI Index 2025* Стэнфордского института HAI (Human-Centered AI) Humanity's Last Exam позднее упомянут среди «более трудных бенчмарков», созданных именно потому, что популярные тесты достигли насыщения<sup>[\[4\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-ai_index-4)</sup>.

В этих условиях **Дэн Хендрикс** — директор CAIS и автор более раннего бенчмарка MMLU — предложил идею «последнего экзамена»: набора предельно трудных вопросов, способных отделить возможности ИИ от уровня настоящего эксперта. По словам Хендрикса, непосредственным толчком стал разговор с предпринимателем Илоном Маском, который считал существующие тесты слишком лёгкими и заметил, что вопросы MMLU «уровня студента-бакалавра», а ему хотелось задач, «которые под силу эксперту мирового класса»<sup>[\[5\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nyt_origin-5)</sup>. Первоначально у проекта было рабочее название в духе «The Last Stand» («Последний рубеж»), которое перед публичным запуском сменили на «Humanity's Last Exam» — менее апокалиптичное и точнее отражающее закрытый, экзаменационный формат вопросов<sup>[\[5\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nyt_origin-5)</sup>.

## Создание бенчмарка

Для реализации идеи CAIS объединился со Scale AI; её глава Александр Ван и директор по исследованиям Саммер Юэ помогали вести работу вместе с Хендриксом. 16 сентября 2024 года был объявлен глобальный сбор самых трудных вопросов для будущего экзамена. Учёных и специалистов по всему миру пригласили присылать задачи, способные поставить в тупик самые продвинутые модели ИИ, а для привлечения участников учредили призовой фонд в 500 000 долларов<sup>[\[3\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-reuters_stump-3)</sup>. По условиям выплачивали 5000 долларов за каждый из 50 лучших вопросов и 500 долларов — за следующие 500; авторам принятых вопросов также предлагали соавторство в итоговой статье<sup>[\[6\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-wiki_hle-6)</sup>. Срок подачи, изначально назначенный на 1 ноября 2024 года, позднее продлили до 15 ноября 2024 года.

Отбор задач шёл в несколько этапов. Сначала присланные вопросы фильтровали передовыми моделями ИИ: если модель отвечала верно (а для заданий с выбором ответа — лучше случайного угадывания), вопрос отбраковывали как недостаточно трудный. Вопросы, с которыми модели не справлялись, передавали экспертам, и те в два круга проверяли корректность и добивались единственного, однозначного и проверяемого ответа, который нельзя получить простым поиском в интернете. Из первоначального пула в десятки тысяч заявок вклад в итоговый набор внесли почти 1000 экспертов из более чем 500 учреждений в 50 странах — в основном профессора, исследователи и обладатели учёных степеней<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.

Впервые о бенчмарке объявили в конце января 2025 года; препринт на arXiv был подан 24 января 2025 года<sup>[\[1\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_paper-1)</sup>. После выхода до 21 марта 2025 года действовала открытая программа «отлова ошибок» (bug bounty) по отзывам сообщества — чтобы выявить и удалить ошибочные или находимые через поиск вопросы; 3 апреля 2025 года набор зафиксировали в объёме **2500 опубликованных вопросов**, удалив и заменив помеченные задания<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>. Часть вопросов удерживается в закрытом контрольном наборе — для контрольных проверок и защиты от переобучения под фиксированный набор<sup>[\[6\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-wiki_hle-6)</sup>. Рецензируемая версия работы вышла в *Nature* 28 января 2026 года<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>.

## Структура и содержание бенчмарка

Набор вопросов HLE охватывает широкий спектр академических дисциплин. Распределение по предметным областям следующее<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>:

- **Математика** — около 41 %
- **Биология и медицина** — около 11 %
- **Информатика и ИИ** — около 10 %
- **Физика** — около 9 %
- **Гуманитарные и социальные науки** — около 9 %
- **Химия** — около 7 %
- **Инженерные дисциплины** — около 4 %
- **Прочие области** — около 9 %

Около **14 %** всех заданий **мультимодальны**: помимо текста они требуют анализа сопровождающего изображения — схемы, рисунка или надписи<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>. Около **76 %** вопросов — задания **с точным (кратким) ответом**, где модель должна сама выдать точный ответ: число, термин или строку; остальные **24 %** — вопросы **с выбором ответа** из пяти и более вариантов<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>. Тематика намеренно узкоспециальна: от перевода древних пальмирских надписей до определения микроанатомических структур у птиц или анализа особенностей произношения библейского иврита<sup>[\[2\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-nature_hle-2)</sup>.

Все задания HLE обладают общими свойствами:

- **Крайне высокая трудность**: каждая задача требует знаний и навыков на уровне квалифицированного специалиста в своей области<sup>[\[8\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-techradar_pass-8)</sup>.
- **Проверяемый ответ**: у каждого вопроса есть конкретный, доказуемо верный ответ, пригодный для автоматической проверки.
- **Устойчивость к поиску**: задания составлены так, что ответ нельзя найти простым поисковым запросом; для успеха нужны глубокое понимание и рассуждение<sup>[\[1\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_paper-1)</sup>.

Для автоматической проверки сопровождающие бенчмарк используют отдельную модель (o3-mini) как экстрактор и «судью», сопоставляющего ответ модели с эталонным, и отмечают, что результаты могут немного меняться при других моделях-судьях и формулировках запроса<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.

## Результаты моделей

Humanity's Last Exam сразу подтвердил репутацию крайне трудного теста: на момент выхода **ни одна из современных моделей ИИ не приблизилась к экспертному уровню**, и разрыв сокращался лишь постепенно, по мере совершенствования моделей. Поскольку результаты сильно зависят от даты и от того, разрешены ли внешние инструменты, приведённые ниже цифры стоит читать как временной ряд, а не как фиксированный рейтинг.

- **Первый выпуск (начало 2025 года, без инструментов).** Ведущие модели набирали единицы процентов. GPT-4o вышла примерно на 3 %, а сильнейшие на тот момент модели с рассуждением — OpenAI o1 и DeepSeek-R1 — верно отвечали лишь примерно на 9 % вопросов<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.
- **Агенты с инструментами (февраль 2025 года).** Экспериментальный агент OpenAI **Deep Research** на базе модели o3, которому разрешили автоматический поиск в интернете, верно решил **26,6 %** заданий — примерно втрое больше лучшего результата без инструментов на тот момент, хотя и это далеко от проходного балла. Доступ к поиску делает прямое сравнение с моделями без инструментов неравноценным<sup>[\[9\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hindustan_times_26-9)</sup>.
- **В течение 2025 года (без инструментов).** Новые модели с рассуждением подняли точность без инструментов до низких двадцатых процентов. Gemini 2.5 Pro от Google на запуске в марте 2025 года показала около 18,8 %, а позднее — чуть больше двадцати процентов; Grok 4 от xAI к середине года достигла примерно 25 %<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.
- **Текущее состояние (2026 год).** Передовой рубеж продолжил круто расти. К началу 2026 года лучшие модели в официальном рейтинге вышли на середину тридцатых процентов; к середине 2026 года публичные рейтинги ставили лидеров на уровень середины сороковых и выше. Среди приводимых результатов для текстового набора — середина сороковых у линейки Gemini 3.x Pro от Google и низкие-средние сороковые у сильнейших вариантов GPT-5; при этом на площадке Artificial Analysis верхние позиции занимали Claude Fable 5 и Claude Opus 4.8 от Anthropic (около 53 % и 46 % соответственно) — одни из первых результатов выше отметки в 50 % на публичном рейтинге<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)[\[10\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-aa_leaderboard-10)</sup>.

Отдельное побочное наблюдение касается **калибровки**. На момент первой публикации модели сочетали низкую точность (менее 10 %) с очень высокой заявленной уверенностью (ошибка калибровки выше 80 %) — веский признак того, что системы скорее «конфабулируют», чем осознают границы собственного знания<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.

## Критика и ограничения

Несмотря на своё влияние, HLE вызвал предметную критику.

- **Эрудиция против интеллекта.** Часть авторов и наблюдателей сомневается, что ответы на узкоспециальные вопросы уровня аспирантуры — осмысленная мера общего интеллекта. Кевин Чжоу, исследователь теоретической физики из Калифорнийского университета в Беркли, участвовавший в составлении вопросов, отметил большой разрыв между результатом на экзамене и подлинной исследовательской способностью<sup>[\[6\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-wiki_hle-6)</sup>. (В рецензируемой версии *Nature* использовано более описательное название — «A benchmark of expert-level academic questions to assess AI capabilities».)
- **Точность ответов.** В июле 2025 года исследовательская организация FutureHouse опубликовала разбор, согласно которому примерно у **29 %** (95-процентный доверительный интервал ±3,7 процентного пункта) из **321 текстового вопроса по биологии/медицине и химии**, которые она проверила, ответы противоречили рецензируемой литературе. Проверка сознательно охватывала только эти подмножества, а не весь бенчмарк, и опиралась на исследовательского агента FutureHouse PaperQA2, сверявшего обоснование каждого ответа с опубликованными данными<sup>[\[11\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-futurehouse-11)</sup>. В ответ команда HLE провела собственную целевую перепроверку подмножества по биологии, химии и медицине и сообщила о доле экспертных расхождений около **18 %**, указав, что часть разрыва отражает подлинные разногласия экспертов в очень трудных вопросах, а не прямые ошибки; отдельно FutureHouse выпустила выверенное подмножество «HLE Bio/Chem Gold»<sup>[\[12\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_followup-12)</sup>.
- **Систематическая ревизия.** К 2026 году опасения о надёжности привели к систематической переверке набора. Проект «HLE-Verified» (2026) заново проверил открытый набор с помощью экспертной оценки и перекрёстных проверок моделями, сертифицировав 1811 из 2500 вопросов (либо подтверждённых как верные, либо исправленных с сохранением исходного замысла оценки) и выпустив оставшиеся 689 как задокументированный «неопределённый» набор; авторы сообщают, что проверка и исправление ощутимо сдвигают итоговые оценки моделей — то есть часть измеренной результативности отражала артефакты разметки, а не различия в способностях<sup>[\[13\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_verified-13)</sup>.
- **Оплата и процесс.** Некоторые участники сообщали о неясной схеме выплат и смещавшихся сроках в ходе разработки; ряд экспертов с учёными степенями выражал недовольство неопределёнными ожиданиями вокруг призового фонда в 500 000 долларов<sup>[\[6\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-wiki_hle-6)</sup>.
- **Не тест общего интеллекта.** По замыслу HLE измеряет структурированные, закрытые академические знания и рассуждение. Он не оценивает творчество, инициативу, способность к открытому исследованию или умение ставить новые научные вопросы, поэтому даже идеальный результат сам по себе не означал бы наличия общего искусственного интеллекта (AGI)<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.

## Значение и перспективы

Появление HLE стало заметным событием в сообществе ИИ: бенчмарк закрыл насущную потребность в новой, более трудной мере прогресса.

- **Общая точка отсчёта.** HLE даёт исследователям и регуляторам стандартизированный — хотя и чувствительный к методике — ориентир для оценки возможностей ИИ, позволяя отслеживать улучшения во времени и судить, насколько машины приблизились к уровню экспертов-людей.
- **Опора для выработки политики.** Общий эталонный тест поддерживает более содержательное обсуждение траекторий развития ИИ, потенциальных рисков и возможных мер регулирования.
- **Последний рубеж академического тестирования.** Название «последний экзамен» отражает мысль, что этот набор задач может стать финальным закрытым экзаменом, нужным для оценки ИИ. Прохождение HLE означало бы, что по формальным знаниям и строго проверяемым рассуждениям машина достигла уровня лучших экспертов-людей<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>.

Авторы предполагали, что при таком темпе прогресса модели могут превысить 50 % точности на HLE к концу 2025 года<sup>[\[7\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-hle_site-7)</sup>. На практике к этому сроку порог взят не был — на исходе 2025 года сильнейшие модели держались в официальном рейтинге примерно в диапазоне от середины двадцатых до высоких тридцатых процентов, — и публичные рейтинги не показывали уверенного преодоления отметки в 50 % вплоть до 2026 года, примерно на полгода позже прогноза. Преодоление этого порога означает, что машины вплотную приблизились к экспертному уровню по узкой, но важной мере академических знаний, оставляя при этом открытую научную и творческую работу отдельным, неизмеренным рубежом.

## Результаты моделей по источникам

Оценки HLE не абсолютны: они зависят от даты, от модели-судьи и формулировки запроса при проверке, от того, разрешены ли внешние инструменты (например, веб-поиск), и от того, включены ли мультимодальные вопросы или берётся только текстовое подмножество. Поэтому разные рейтинги дают для одной и той же модели разные числа, и цифры лучше сравнивать *внутри* одного источника, а не между источниками. Два рейтинга ниже — собственный рейтинг бенчмарка (Scale AI / SEAL) и независимый оценщик (Artificial Analysis) — это показывают: Gemini 3.1 Pro Preview на текстовом рейтинге Scale приводится с 47,3 %, а у Artificial Analysis — с 44,7 %, и два рейтинга даже не сходятся в том, кто сейчас лидер. Обе таблицы — срезы на конкретный момент, которые часто меняются; у каждой ниже указана дата, а за текущим положением дел стоит обращаться к «живым» рейтингам.

### Scale AI / SEAL — официальный рейтинг (только текст)

Собственный рейтинг бенчмарка, который ведётся вместе с Center for AI Safety. Модели оцениваются на текстовом подмножестве (около 86 % набора) при температуре 0; проверку выполняет o3-mini как автоматический экстрактор и судья. Ранг — статистическая верхняя граница (модель ставится выше другой лишь тогда, когда её нижняя 95-процентная доверительная граница превышает верхнюю границу другой), поэтому модели могут делить ранг. «Ошибка калибр.» — среднеквадратичная ошибка калибровки, то есть насколько заявленная уверенность модели расходится с фактической точностью; высокие значения указывают на самоуверенность. Приведённые ниже позиции — срез середины 2026 года, они часто меняются<sup>[\[14\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-scale_leaderboard-14)</sup>.

| Ранг (ВГ)                                                         | Модель                                 | Точность, % (±95 % ДИ) | Ошибка калибр. |
|-------------------------------------------------------------------|----------------------------------------|------------------------|----------------|
| 1                                                                 | Gemini 3.1 Pro Preview (thinking high) | 47,3 ±2,1              | 50             |
| 1                                                                 | GPT-5.4 Pro                            | 45,3 ±2,1              | 37             |
| 3                                                                 | Muse Spark                             | 40,9 ±2,1              | 51             |
| 3                                                                 | Gemini 3 Pro Preview                   | 37,7 ±2,0              | 57             |
| 4                                                                 | GPT-5.4 (xhigh thinking)               | 36,5 ±2,0              | 42             |
| 4                                                                 | Claude Opus 4.6 Thinking Max           | 36,2 ±2,0              | 46             |
| 5                                                                 | GPT-5 Pro                              | 33,3 ±2,0              | 49             |
| 8                                                                 | GPT-5.2                                | 28,5 ±1,9              | 45             |
| 8                                                                 | Claude Opus 4.5 Thinking               | 26,3 ±1,9              | 55             |
| 8                                                                 | GPT-5                                  | 26,3 ±1,9              | 50             |
| 9                                                                 | GPT-5.1 Thinking                       | 24,7 ±1,8              | 54             |
| 11                                                                | Gemini 2.5 Pro Preview (06-05)         | 22,1 ±1,8              | 72             |
| *Для сравнения — модели ранней эпохи (конец 2024 / начало 2025):* |                                        |                        |                |
| 34                                                                | o1 (декабрь 2024)                      | 7,8 ±1,1               | 84             |
| 48                                                                | Claude 3.5 Sonnet (октябрь 2024)       | 4,3 ±0,9               | 83             |
| 59                                                                | GPT-4o (ноябрь 2024)                   | 2,3 ±0,6               | 88             |

### Artificial Analysis — независимый рейтинг

Независимый оценщик, который прогоняет модели через собственную оценочную обвязку на **текстовом подмножестве** HLE (2158 вопросов), исключая мультимодальные вопросы для сопоставимости между моделями. Его цифры прямо несравнимы с рейтингом Scale выше из-за различий в методике, модели-судье и составе вопросов. Топ-10 ниже взят напрямую с рейтинга Artificial Analysis по состоянию на 1 июля 2026 года (положение часто меняется)<sup>[\[10\]](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_note-aa_leaderboard-10)</sup>.

| №   | Модель                         | Точность, % |
|-----|--------------------------------|-------------|
| 1   | Claude Fable 5 (with fallback) | 53,3        |
| 2   | Claude Opus 4.8 (max)          | 45,7        |
| 3   | Gemini 3.1 Pro Preview         | 44,7        |
| 4   | GPT-5.5 (xhigh)                | 44,3        |
| 5   | GPT-5.5 (high)                 | 43,0        |
| 6   | Gemini 3.5 Flash               | 41,0        |
| 7   | GLM-5.2 (max)                  | 40,1        |
| 8   | Muse Spark                     | 39,9        |
| 9   | Claude Sonnet 5 (max)          | 39,6        |
| 10  | Qwen3.7 Max                    | 38,1        |

## Ссылки

- <a href="https://agi.safe.ai/" class="external text" rel="nofollow">Официальный сайт Humanity's Last Exam</a>
- <a href="https://www.nature.com/articles/s41586-025-09962-4" class="external text" rel="nofollow">A benchmark of expert-level academic questions to assess AI capabilities - Рецензируемая статья в <em>Nature</em> (2026)</a>
- <a href="https://arxiv.org/abs/2501.14249" class="external text" rel="nofollow">Humanity's Last Exam - Препринт с описанием бенчмарка (arXiv)</a>
- <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external text" rel="nofollow">Humanity's Last Exam — Википедия</a>
- <a href="https://github.com/centerforaisafety/hle" class="external text" rel="nofollow">Humanity's Last Exam — Github</a>
- <a href="https://artificialanalysis.ai/evaluations/humanitys-last-exam" class="external text" rel="nofollow">Humanity's Last Exam Leaderboard — artificialanalysis.ai</a>
- <a href="https://labs.scale.com/leaderboard/humanitys_last_exam" class="external text" rel="nofollow">HHumanity's Last Exam - Scale Labs Leaderboard</a>

## Литература

- Liang P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma Z. et al. (2021). *Dynaboard: An Evaluation-As-A-Service Platform for Holistic Next-Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_paper_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_paper_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_paper_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_paper_1-3)</sup> <sup>[1,4](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_paper_1-4)</sup> Phan L., Gatti A., Han Z. и др. «Humanity's Last Exam». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-nature_hle-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-2)</sup> <sup>[2,3](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-3)</sup> <sup>[2,4](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-4)</sup> <sup>[2,5](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nature_hle_2-5)</sup> «A benchmark of expert-level academic questions to assess AI capabilities» // *Nature*. 2026. Т. 649. С. 1139–1146. DOI: 10.1038/s41586-025-09962-4. <a href="https://www.nature.com/articles/s41586-025-09962-4" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-reuters_stump_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-reuters_stump_3-1)</sup> Dastin J., Paul K. «AI experts ready ‘Humanity's Last Exam' to stump powerful tech» // *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-ai_index-4">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-ai_index_4-0) Maslej N. и др. *The AI Index 2025 Annual Report*. Stanford Institute for Human-Centered AI, апрель 2025. С. 141–142.</span>
5.  <span id="cite_note-nyt_origin-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nyt_origin_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-nyt_origin_5-1)</sup> Roose K. «When A.I. Passes This Test, Look Out» // *The New York Times*, 23 января 2025.</span>
6.  <span id="cite_note-wiki_hle-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-wiki_hle_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-wiki_hle_6-1)</sup> <sup>[6,2](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-wiki_hle_6-2)</sup> <sup>[6,3](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-wiki_hle_6-3)</sup> «Humanity's Last Exam» // *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[4]</a></span>
7.  <span id="cite_note-hle_site-7">↑ <sup>[7,00](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-0)</sup> <sup>[7,01](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-1)</sup> <sup>[7,02](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-2)</sup> <sup>[7,03](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-3)</sup> <sup>[7,04](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-4)</sup> <sup>[7,05](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-5)</sup> <sup>[7,06](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-6)</sup> <sup>[7,07](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-7)</sup> <sup>[7,08](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-8)</sup> <sup>[7,09](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_site_7-9)</sup> «Humanity's Last Exam» // *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[5]</a></span>
8.  <span id="cite_note-techradar_pass-8">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-techradar_pass_8-0) «Could you pass ‘Humanity's Last Exam'? Probably not, but neither can AI» // *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[6]</a></span>
9.  <span id="cite_note-hindustan_times_26-9">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hindustan_times_26_9-0) «OpenAI's deep research can complete 26% of ‘Humanity's Last Exam': What is it and what does it mean?» // *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[7]</a></span>
10. <span id="cite_note-aa_leaderboard-10">↑ <sup>[10,0](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-aa_leaderboard_10-0)</sup> <sup>[10,1](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-aa_leaderboard_10-1)</sup> «Humanity's Last Exam Benchmark Leaderboard» // *Artificial Analysis*. <a href="https://artificialanalysis.ai/evaluations/humanitys-last-exam" class="external autonumber" rel="nofollow">[8]</a></span>
11. <span id="cite_note-futurehouse-11">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-futurehouse_11-0) FutureHouse. «About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong», 2025. <a href="https://www.futurehouse.org/research/hle-exam" class="external autonumber" rel="nofollow">[9]</a></span>
12. <span id="cite_note-hle_followup-12">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_followup_12-0) Команда-организатор HLE пересмотрела препринт в ответ на разбор FutureHouse и при перепроверке подмножества по биологии, химии и медицине (сентябрь 2025 года) сообщила о доле экспертных расхождений около 18 %. См. arXiv:2501.14249 (пересмотренная версия) и обновление FutureHouse: <a href="https://www.futurehouse.org/research/hle-exam" class="external autonumber" rel="nofollow">[10]</a>.</span>
13. <span id="cite_note-hle_verified-13">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-hle_verified_13-0) Zhai W., Wang Z., Wang J. и др. «HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam». *arXiv:2602.13964*, 2026. <a href="https://arxiv.org/abs/2602.13964" class="external autonumber" rel="nofollow">[11]</a></span>
14. <span id="cite_note-scale_leaderboard-14">[↑](https://systems-analysis.info/wiki/Humanity's_Last_Exam#cite_ref-scale_leaderboard_14-0) «Humanity's Last Exam (Text Only)» // *Scale AI / SEAL Leaderboards*. <a href="https://scale.com/leaderboard/humanitys_last_exam_text_only" class="external autonumber" rel="nofollow">[12]</a></span>
