Humanity's Last Exam (benchmark) (FA)
Humanity's Last Exam (HLE، فارسی: «آخرین آزمون بشریت») — یک benchmark جامع است که برای ارزیابی تواناییهای سیستمهای پیشرفته هوش مصنوعی (AI) در وظایفی طراحی شده که به سطح دانش و مهارتهای استدلالی برابر با برترین متخصصان انسانی نیاز دارند. این benchmark در سالهای ۲۰۲۴–۲۰۲۵ توسط سازمان غیرانتفاعی Center for AI Safety (CAIS) به همراه شرکت Scale AI توسعه یافته است[1].
پروژه HLE به عنوان «آخرین آزمون دانشگاهی» برای مدلهای AI طراحی شده — آزمایشی بسیار دشوار که امکان تعیین میزان نزدیکی مدلهای امروزی به سطح تخصصی و شناسایی شکافهای باقیمانده در تواناییهای آنها را فراهم میکند[1]. این benchmark شامل ۲۵۰۰ سؤال فوقالعاده دشوار است که بیش از صد رشته مختلف را در بر میگیرد[2].
تاریخچه ایجاد
تا اواسط دهه ۲۰۲۰، مدلهای زبانی بزرگ مانند GPT-4 و Claude نتایج چنان بالایی در مجموعههای آزمایشی رایج (مانند MMLU) نشان دادند که بسیاری از benchmarkها دیگر معیار قابل اتکایی برای سنجش پیشرفت نبودند. آزمونهای استاندارد سطح کارشناسی عملاً توسط مدلها «درهم شکسته» شده بودند و ارزیابی عینی پیشرفتهای بعدی را ناممکن میساخت[3].
در این وضعیت، Dan Hendrycks، مدیر CAIS و پژوهشگر شناختهشده AI، مفهوم «آخرین آزمون بشریت» را پیشنهاد داد — مجموعهای از سؤالات با حداکثر سختی که بتواند تواناییهای AI را از سطح متخصص واقعی متمایز سازد. انگیزه این کار مکالمهای با کارآفرین Elon Musk بود که اظهار داشت آزمونهای موجود بیش از حد ساده شدهاند[2].
برای اجرای این ایده، CAIS با Scale AI همکاری کرد. در ۱۵ سپتامبر ۲۰۲۴، فراخوان جهانی برای جمعآوری دشوارترین سؤالات برای آزمون آینده بهطور رسمی اعلام شد. برگزارکنندگان از دانشمندان و متخصصان سراسر جهان دعوت کردند تا مسائلی ارسال کنند که حتی پیشرفتهترین مدلهای AI را به بنبست برسانند. برای انگیزش شرکتکنندگان، صندوق جایزهای به مبلغ ۵۰۰٬۰۰۰ دلار تأسیس شد[3].
انتخاب مسائل در چند مرحله انجام شد. ابتدا سؤالات ارسالشده از طریق مدلهای پیشرفته AI فیلتر میشدند: اگر الگوریتمها با اطمینان مسئله را حل میکردند، به عنوان ناکافی دشوار رد میشد. وظایفی که AI از عهده آنها برنمیآمد، برای ارزیابی صحت و وجود یک پاسخ درست واحد تحت بررسی تخصصی قرار میگرفتند. در نهایت، نزدیک به ۱۰۰۰ متخصص از بیش از ۵۰۰ مؤسسه علمی-آموزشی در تشکیل این مجموعه مشارکت داشتند[4].
نسخه نهایی benchmark، شامل ۲۵۰۰ سؤال، در اوایل سال ۲۰۲۵ ارائه شد. بخشی از وظایف در ذخیره بسته نگه داشته شده تا برای آزمایش کنترلی و جلوگیری از تنظیم مدلها بر اساس مجموعه ثابت استفاده شود[2].
ساختار و محتوای benchmark
مجموعه سؤالات HLE طیف گستردهای از رشتههای دانش دانشگاهی را در بر میگیرد. وظایف بر اساس موضوع به صورت زیر توزیع شدهاند:
- ریاضیات: ~۴۱٪
- زیستشناسی و پزشکی: ~۱۱٪
- علوم کامپیوتر و AI: ~۱۰٪
- فیزیک: ~۹٪
- علوم انسانی و اجتماعی: ~۹٪
- شیمی: ~۷٪
- علوم مهندسی: ~۴٪
- سایر حوزهها: ~۹٪
حدود ۱۴٪ از تمام وظایف چندوجهی (multimodal) هستند، یعنی برای حل آنها تحلیل تصاویر (نقشهها، نمودارها، نوشتهها) لازم است[2]. اکثر وظایف (تقریباً ۳/۴) سؤالات باز با پاسخ کوتاه هستند، که در آن مدل باید پاسخ دقیقی (عدد، اصطلاح، نام) بهطور مستقل تولید کند. بقیه سؤالات چندگزینهای هستند.
همه مسائل در HLE دارای ویژگیهای مشترک هستند:
- سختی بسیار بالا: هر مسئله به سطح دانش و مهارتی برابر با متخصص واجد شرایط در آن حوزه نیاز دارد[5].
- پاسخ قابل تأیید: هر سؤال دارای یک پاسخ درست مشخص و قابل اثبات است.
- مقاومت در برابر جستجو: وظایف به گونهای انتخاب شدهاند که پاسخ آنها را نتوان با یک جستجوی ساده یافت؛ برای موفقیت به درک عمیق موضوع و استدلال نیاز است[1].
نتایج ارزیابی مدلها
Humanity's Last Exam بلافاصله اعتبار یک آزمون فوقالعاده دشوار را تأیید کرد: هیچیک از مدلهای AI امروزی نتوانست نتیجهای نزدیک به سطح انسانی در آن کسب کند. بهترین مدلهای زبانی سال ۲۰۲۵ دقت بسیار پایینی نشان دادند.
- نسخههای مختلف GPT-4 از OpenAI و Claude از Anthropic نتیجه کمتر از ۱۰٪ را نشان دادند[4].
- بالاترین نتیجه در میان LLMهای استاندارد به مدل Gemini 2.5 Pro (Google DeepMind) با دقت حدود ۲۱٫۶٪ تعلق داشت[4].
- حتی بهترین مدلها حدود ۴/۵ سؤالات HLE را رد شدند، که بر وسعت شکاف میان تواناییهای فعلی AI و سطح متخصص انسانی تأکید میکند[1].
نتیجه عامل تجربی ChatGPT Deep Research از OpenAI جالب توجه است؛ به این عامل اجازه داده شده بود بهطور خودکار جستجوهای اینترنتی انجام دهد. با تقلید از کار یک پژوهشگر، این عامل توانست ۲۶٫۶٪ وظایف را بهدرستی حل کند — نتیجهای بیش از ۲ برابر بهتر از هر مدل بدون چنین ابزارهایی، اما همچنان بسیار دور از نمره قبولی[6].
اهمیت و چشمانداز
ظهور HLE رویدادی مهم در جامعه AI بود، زیرا این benchmark نیاز مبرم به معیاری جدید و پیچیدهتر برای سنجش پیشرفت را برآورده ساخت.
- نقطه مرجع مشترک. HLE به پژوهشگران و سیاستگذاران ابزاری عینی برای ارزیابی تواناییهای AI ارائه میدهد که امکان پیگیری پویایی پیشرفتها و درک میزان نزدیکی ماشینها به سطح انسانی را فراهم میکند.
- ابزاری برای آگاهیبخشی به سیاستگذاری. وجود چنین آزمون معیاری به بحثهای ملموستر درباره جهتهای توسعه AI، خطرات بالقوه و اقدامات نظارتی لازم کمک میکند.
- آخرین مرز آزمونهای دانشگاهی. همان نام «آخرین آزمون» بازتاب این ایده است که این مجموعه مسائل میتواند آخرین آزمون بسته برای ارزیابی AI باشد. گذر موفقیتآمیز از HLE به این معنا خواهد بود که ماشین از نظر دانش رسمی و مهارتهای استدلالی قابل تأیید سخت، به سطح بهترین متخصصان انسانی دست یافته است[4].
مهم است که توجه داشته باشیم حتی گذر کامل از HLE به معنای دستیابی به هوش مصنوعی عمومی (AGI) نخواهد بود، زیرا این آزمون تواناییهای خلاقانه، ابتکار عمل یا توانایی طرح سؤالات علمی جدید را بررسی نمیکند[4].
با توجه به پیشرفت سریع، پژوهشگران پیشبینی میکنند مدلها ممکن است تا پایان سال ۲۰۲۵ از دقت ۵۰٪ در HLE فراتر روند. این به معنای آن خواهد بود که ماشینها در یک معیار باریک اما مهم از دانش دانشگاهی به سطح انسانی بسیار نزدیک شدهاند[4].
پیوندها
- وبسایت رسمی Humanity's Last Exam
- مقاله علمی معرفی benchmark
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [۱]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [۲]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [۳]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [۴]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [۵]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [۶]