---
title: "Humanity's Last Exam (benchmark) (FA)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 3022
wiki_created_at: 2026-09-06T23:14:27Z
wiki_modified_at: 2026-09-06T23:14:27Z
downloaded_at: 2026-09-07T22:54:30Z
---

# Humanity's Last Exam (benchmark) (FA)

**Humanity's Last Exam** (**HLE**، فارسی: «آخرین آزمون بشریت») — یک benchmark جامع است که برای ارزیابی توانایی‌های سیستم‌های پیشرفته هوش مصنوعی (AI) در وظایفی طراحی شده که به سطح دانش و مهارت‌های استدلالی برابر با برترین متخصصان انسانی نیاز دارند. این benchmark در سال‌های ۲۰۲۴–۲۰۲۵ توسط سازمان غیرانتفاعی Center for AI Safety (CAIS) به همراه شرکت Scale AI توسعه یافته است<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_paper-1)</sup>.

پروژه HLE به عنوان «آخرین آزمون دانشگاهی» برای مدل‌های AI طراحی شده — آزمایشی بسیار دشوار که امکان تعیین میزان نزدیکی مدل‌های امروزی به سطح تخصصی و شناسایی شکاف‌های باقی‌مانده در توانایی‌های آن‌ها را فراهم می‌کند<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_paper-1)</sup>. این benchmark شامل ۲۵۰۰ سؤال فوق‌العاده دشوار است که بیش از صد رشته مختلف را در بر می‌گیرد<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-wiki_hle-2)</sup>.

## تاریخچه ایجاد

تا اواسط دهه ۲۰۲۰، مدل‌های زبانی بزرگ مانند GPT-4 و Claude نتایج چنان بالایی در مجموعه‌های آزمایشی رایج (مانند MMLU) نشان دادند که بسیاری از benchmark‌ها دیگر معیار قابل اتکایی برای سنجش پیشرفت نبودند. آزمون‌های استاندارد سطح کارشناسی عملاً توسط مدل‌ها «درهم شکسته» شده بودند و ارزیابی عینی پیشرفت‌های بعدی را ناممکن می‌ساخت<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-reuters_stump-3)</sup>.

در این وضعیت، **Dan Hendrycks**، مدیر CAIS و پژوهشگر شناخته‌شده AI، مفهوم «آخرین آزمون بشریت» را پیشنهاد داد — مجموعه‌ای از سؤالات با حداکثر سختی که بتواند توانایی‌های AI را از سطح متخصص واقعی متمایز سازد. انگیزه این کار مکالمه‌ای با کارآفرین Elon Musk بود که اظهار داشت آزمون‌های موجود بیش از حد ساده شده‌اند<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-wiki_hle-2)</sup>.

برای اجرای این ایده، CAIS با Scale AI همکاری کرد. در ۱۵ سپتامبر ۲۰۲۴، فراخوان جهانی برای جمع‌آوری دشوارترین سؤالات برای آزمون آینده به‌طور رسمی اعلام شد. برگزارکنندگان از دانشمندان و متخصصان سراسر جهان دعوت کردند تا مسائلی ارسال کنند که حتی پیشرفته‌ترین مدل‌های AI را به بن‌بست برسانند. برای انگیزش شرکت‌کنندگان، صندوق جایزه‌ای به مبلغ ۵۰۰٬۰۰۰ دلار تأسیس شد<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-reuters_stump-3)</sup>.

انتخاب مسائل در چند مرحله انجام شد. ابتدا سؤالات ارسال‌شده از طریق مدل‌های پیشرفته AI فیلتر می‌شدند: اگر الگوریتم‌ها با اطمینان مسئله را حل می‌کردند، به عنوان ناکافی دشوار رد می‌شد. وظایفی که AI از عهده آن‌ها برنمی‌آمد، برای ارزیابی صحت و وجود یک پاسخ درست واحد تحت بررسی تخصصی قرار می‌گرفتند. در نهایت، نزدیک به ۱۰۰۰ متخصص از بیش از ۵۰۰ مؤسسه علمی-آموزشی در تشکیل این مجموعه مشارکت داشتند<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.

نسخه نهایی benchmark، شامل **۲۵۰۰ سؤال**، در اوایل سال ۲۰۲۵ ارائه شد. بخشی از وظایف در ذخیره بسته نگه داشته شده تا برای آزمایش کنترلی و جلوگیری از تنظیم مدل‌ها بر اساس مجموعه ثابت استفاده شود<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-wiki_hle-2)</sup>.

## ساختار و محتوای benchmark

مجموعه سؤالات HLE طیف گسترده‌ای از رشته‌های دانش دانشگاهی را در بر می‌گیرد. وظایف بر اساس موضوع به صورت زیر توزیع شده‌اند:

- **ریاضیات**: ~۴۱٪
- **زیست‌شناسی و پزشکی**: ~۱۱٪
- **علوم کامپیوتر و AI**: ~۱۰٪
- **فیزیک**: ~۹٪
- **علوم انسانی و اجتماعی**: ~۹٪
- **شیمی**: ~۷٪
- **علوم مهندسی**: ~۴٪
- **سایر حوزه‌ها**: ~۹٪

حدود **۱۴٪** از تمام وظایف **چندوجهی** (multimodal) هستند، یعنی برای حل آن‌ها تحلیل تصاویر (نقشه‌ها، نمودارها، نوشته‌ها) لازم است<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-wiki_hle-2)</sup>. اکثر وظایف (تقریباً ۳/۴) **سؤالات باز با پاسخ کوتاه** هستند، که در آن مدل باید پاسخ دقیقی (عدد، اصطلاح، نام) به‌طور مستقل تولید کند. بقیه سؤالات چندگزینه‌ای هستند.

همه مسائل در HLE دارای ویژگی‌های مشترک هستند:

- **سختی بسیار بالا**: هر مسئله به سطح دانش و مهارتی برابر با متخصص واجد شرایط در آن حوزه نیاز دارد<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-techradar_pass-5)</sup>.
- **پاسخ قابل تأیید**: هر سؤال دارای یک پاسخ درست مشخص و قابل اثبات است.
- **مقاومت در برابر جستجو**: وظایف به گونه‌ای انتخاب شده‌اند که پاسخ آن‌ها را نتوان با یک جستجوی ساده یافت؛ برای موفقیت به درک عمیق موضوع و استدلال نیاز است<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_paper-1)</sup>.

## نتایج ارزیابی مدل‌ها

Humanity's Last Exam بلافاصله اعتبار یک آزمون فوق‌العاده دشوار را تأیید کرد: **هیچ‌یک از مدل‌های AI امروزی نتوانست نتیجه‌ای نزدیک به سطح انسانی در آن کسب کند**. بهترین مدل‌های زبانی سال ۲۰۲۵ دقت بسیار پایینی نشان دادند.

- نسخه‌های مختلف **GPT-4** از OpenAI و **Claude** از Anthropic نتیجه **کمتر از ۱۰٪** را نشان دادند<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.
- بالاترین نتیجه در میان LLM‌های استاندارد به مدل **Gemini 2.5 Pro** (Google DeepMind) با دقت حدود **۲۱٫۶٪** تعلق داشت<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.
- حتی بهترین مدل‌ها حدود ۴/۵ سؤالات HLE را رد شدند، که بر وسعت شکاف میان توانایی‌های فعلی AI و سطح متخصص انسانی تأکید می‌کند<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_paper-1)</sup>.

نتیجه عامل تجربی **ChatGPT Deep Research** از OpenAI جالب توجه است؛ به این عامل اجازه داده شده بود به‌طور خودکار جستجوهای اینترنتی انجام دهد. با تقلید از کار یک پژوهشگر، این عامل توانست **۲۶٫۶٪** وظایف را به‌درستی حل کند — نتیجه‌ای بیش از ۲ برابر بهتر از هر مدل بدون چنین ابزارهایی، اما همچنان بسیار دور از نمره قبولی<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hindustan_times_26-6)</sup>.

## اهمیت و چشم‌انداز

ظهور HLE رویدادی مهم در جامعه AI بود، زیرا این benchmark نیاز مبرم به معیاری جدید و پیچیده‌تر برای سنجش پیشرفت را برآورده ساخت.

- **نقطه مرجع مشترک**. HLE به پژوهشگران و سیاست‌گذاران ابزاری عینی برای ارزیابی توانایی‌های AI ارائه می‌دهد که امکان پیگیری پویایی پیشرفت‌ها و درک میزان نزدیکی ماشین‌ها به سطح انسانی را فراهم می‌کند.
- **ابزاری برای آگاهی‌بخشی به سیاست‌گذاری**. وجود چنین آزمون معیاری به بحث‌های ملموس‌تر درباره جهت‌های توسعه AI، خطرات بالقوه و اقدامات نظارتی لازم کمک می‌کند.
- **آخرین مرز آزمون‌های دانشگاهی**. همان نام «آخرین آزمون» بازتاب این ایده است که این مجموعه مسائل می‌تواند آخرین آزمون بسته برای ارزیابی AI باشد. گذر موفقیت‌آمیز از HLE به این معنا خواهد بود که ماشین از نظر دانش رسمی و مهارت‌های استدلالی قابل تأیید سخت، به سطح بهترین متخصصان انسانی دست یافته است<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.

مهم است که توجه داشته باشیم حتی گذر کامل از HLE به معنای دستیابی به هوش مصنوعی عمومی (AGI) نخواهد بود، زیرا این آزمون توانایی‌های خلاقانه، ابتکار عمل یا توانایی طرح سؤالات علمی جدید را بررسی نمی‌کند<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.

با توجه به پیشرفت سریع، پژوهشگران پیش‌بینی می‌کنند مدل‌ها ممکن است تا پایان سال ۲۰۲۵ از دقت ۵۰٪ در HLE فراتر روند. این به معنای آن خواهد بود که ماشین‌ها در یک معیار باریک اما مهم از دانش دانشگاهی به سطح انسانی بسیار نزدیک شده‌اند<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_note-hle_site-4)</sup>.

## پیوندها

- وب‌سایت رسمی Humanity's Last Exam
- مقاله علمی معرفی benchmark

## منابع

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## یادداشت‌ها

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(FA)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[۶]</a></span>
