---
title: "Humanity's Last Exam (benchmark) (UR)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 3036
wiki_created_at: 2026-09-06T23:14:40Z
wiki_modified_at: 2026-09-06T23:14:40Z
downloaded_at: 2026-09-07T22:54:34Z
---

# Humanity's Last Exam (benchmark) (UR)

**Humanity's Last Exam** (**HLE**، اردو: «انسانیت کا آخری امتحان») — یہ ایک جامع test-benchmark ہے جو مصنوعی ذہانت (AI) کے جدید ترین نظاموں کی صلاحیتوں کو ایسے کاموں پر جانچنے کے لیے بنایا گیا ہے جن کے لیے بہترین انسانی ماہرین کے ہم پلہ علم اور استدلال کی مہارت درکار ہوتی ہے۔ یہ benchmark غیر منافع بخش تنظیم Center for AI Safety (CAIS) نے کمپنی Scale AI کے اشتراک سے 2024–2025 میں تیار کی<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_paper-1)</sup>۔

HLE کا منصوبہ AI ماڈلز کے لیے «آخری علمی امتحان» کے طور پر تصور کیا گیا ہے — یہ انتہائی مشکل آزمائش ہے جو یہ تعین کرنے میں مدد دیتی ہے کہ آیا جدید ماڈل ماہرانہ سطح کے قریب پہنچ رہے ہیں اور ان کی صلاحیتوں میں ابھی کہاں خلاء باقی ہے<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_paper-1)</sup>۔ اس benchmark میں ایک سو سے زائد مختلف علمی شعبوں پر محیط 2500 انتہائی مشکل سوالات شامل ہیں<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-wiki_hle-2)</sup>۔

## تاریخِ تخلیق

2020 کی دہائی کے وسط تک بڑی language models جیسے GPT-4 اور Claude نے مقبول test sets (مثلاً MMLU) میں اتنے اعلیٰ نتائج دکھائے کہ بہت سے benchmarks ترقی کی قابلِ اعتماد پیمائش کے قابل نہیں رہے۔ انڈرگریجویٹ سطح کے معیاری امتحانات ماڈلز کے ہاتھوں عملاً «تباہ» ہو گئے، جس سے مزید بہتری کی معروضی جانچ ناممکن ہو گئی<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-reuters_stump-3)</sup>۔

اس صورتِ حال میں **Dan Hendrycks**، جو CAIS کے ڈائریکٹر اور AI کے معروف محقق ہیں، نے «انسانیت کے آخری امتحان» کا تصور پیش کیا — زیادہ سے زیادہ پیچیدگی کے سوالات کا ایک مجموعہ جو AI کی صلاحیتوں کو ایک حقیقی ماہر کی سطح سے الگ کر سکے۔ اس کا محرک کاروباری شخصیت Elon Musk کے ساتھ ایک گفتگو تھی جس میں انہوں نے رائے ظاہر کی کہ موجودہ ٹیسٹ بہت آسان ہو گئے ہیں<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-wiki_hle-2)</sup>۔

اس خیال کو عملی جامہ پہنانے کے لیے CAIS نے Scale AI کے ساتھ قوتیں یکجا کیں۔ 15 ستمبر 2024 کو مستقبل کے امتحان کے لیے سب سے مشکل سوالات کے عالمی اجتماع کا باضابطہ اعلان کیا گیا۔ منتظمین نے دنیا بھر کے سائنسدانوں اور ماہرین کو دعوت دی کہ وہ ایسے مسائل بھیجیں جو جدید ترین AI ماڈلز کو بھی الجھا دیں۔ شرکاء کی حوصلہ افزائی کے لیے \$500,000 کا انعامی فنڈ قائم کیا گیا<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-reuters_stump-3)</sup>۔

سوالات کا انتخاب کئی مراحل میں ہوا۔ پہلے موصول شدہ سوالات کو جدید AI ماڈلز کے ذریعے فلٹر کیا گیا: اگر الگورتھم کسی مسئلے کو اعتماد کے ساتھ حل کر لیتے تو اسے ناکافی مشکل سمجھ کر رد کر دیا جاتا۔ جن سوالات کو AI حل نہ کر پاتا وہ درستگی اور واحد صحیح جواب کی جانچ کے لیے ماہرانہ نظرثانی سے گزرتے۔ آخرکار 500 سے زائد علمی و تعلیمی اداروں سے تقریباً 1000 ماہرین نے اس مجموعے کی تشکیل میں حصہ لیا<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔

**2500 سوالات** پر مشتمل benchmark کا حتمی ورژن 2025 کے اوائل میں پیش کیا گیا۔ کچھ سوالات کو ایک بند ذخیرے میں رکھا گیا ہے تاکہ کنٹرول ٹیسٹنگ کے لیے استعمال ہو سکیں اور ماڈلز کی مقررہ مجموعے پر تیاری کو روکا جا سکے<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-wiki_hle-2)</sup>۔

## Benchmark کی ساخت اور مشمولات

HLE کے سوالات کا مجموعہ علمی شعبوں کی وسیع ترین رینج کا احاطہ کرتا ہے۔ سوالات موضوعات کے اعتبار سے اس طرح تقسیم ہیں:

- **ریاضی**: ~41%
- **حیاتیات اور طب**: ~11%
- **کمپیوٹر سائنس اور AI**: ~10%
- **طبیعیات**: ~9%
- **انسانی و سماجی علوم**: ~9%
- **کیمیا**: ~7%
- **انجینیئرنگ علوم**: ~4%
- **دیگر شعبے**: ~9%

تمام سوالات میں سے تقریباً **14%** سوالات **multimodal** ہیں، یعنی انہیں حل کرنے کے لیے تصاویر (خاکوں، خاکہ جات، تحریروں) کا تجزیہ ضروری ہے<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-wiki_hle-2)</sup>۔ اکثریت (تقریباً 3/4) سوالات **مختصر جواب والے کھلے سوالات** ہیں جہاں ماڈل کو خود ایک درست جواب (عدد، اصطلاح، نام) پیدا کرنا ہوتا ہے۔ باقی سوالات متعدد انتخابی جوابات والے ہیں۔

HLE کے تمام سوالات مشترکہ خصوصیات رکھتے ہیں:

- **انتہائی اعلیٰ پیچیدگی**: ہر مسئلے کے لیے متعلقہ شعبے میں کسی اہل ماہر کے ہم پلہ علم اور مہارت درکار ہے<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-techradar_pass-5)</sup>۔
- **قابلِ تصدیق جواب**: ہر سوال کا ایک متعین اور قابلِ ثبوت درست جواب ہے۔
- **تلاش سے محفوظ**: سوالات اس طرح منتخب کیے گئے ہیں کہ جواب سادہ سرچ کوئری سے نہ مل سکے؛ کامیابی کے لیے موضوع کی گہری سمجھ اور استدلال ضروری ہے<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_paper-1)</sup>۔

## ماڈلز کی جانچ کے نتائج

Humanity's Last Exam نے فوری طور پر انتہائی مشکل آزمائش کی اپنی ساکھ کو ثابت کر دیا: **جدید AI ماڈلز میں سے کوئی بھی اس میں انسانی سطح کے قریب نتیجہ نہ دے سکا**۔ 2025 کے بہترین language models نے بہت کم درستگی کا مظاہرہ کیا۔

- OpenAI کے **GPT-4** کے مختلف ورژنز اور Anthropic کے **Claude** نے **10% سے کم** کا نتیجہ دکھایا<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔
- معیاری LLMs میں سب سے اعلیٰ نتیجہ Google DeepMind کے **Gemini 2.5 Pro** ماڈل نے تقریباً **21.6%** درستگی کے ساتھ حاصل کیا<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔
- بہترین ماڈلز نے بھی HLE کے تقریباً 4/5 سوالات میں ناکامی اٹھائی، جو AI کی موجودہ صلاحیتوں اور انسانی ماہر کی سطح کے درمیان خلاء کی وسعت کو اجاگر کرتا ہے<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_paper-1)</sup>۔

خاص دلچسپی OpenAI کے تجرباتی ایجنٹ **ChatGPT Deep Research** کا نتیجہ ہے جسے خودکار طریقے سے سرچ کوئریاں چلانے کی اجازت تھی۔ ایک محقق کے کام کی نقل کرتے ہوئے یہ ایجنٹ **26.6%** سوالات درست حل کرنے میں کامیاب ہوا — یہ نتیجہ ایسے ٹولز کے بغیر کسی بھی ماڈل سے 2 گنا سے زیادہ بہتر ہے، لیکن پھر بھی پاسنگ اسکور سے بہت دور ہے<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hindustan_times_26-6)</sup>۔

## اہمیت اور مستقبل کی امکانات

HLE کا ظہور AI کمیونٹی میں ایک اہم واقعہ بن گیا کیونکہ اس benchmark نے ترقی کی نئی اور زیادہ مشکل پیمائش کی فوری ضرورت کو پورا کیا۔

- **مشترکہ نقطہِ آغاز**۔ HLE محققین اور پالیسی سازوں کو AI صلاحیتوں کی جانچ کا ایک معروضی ذریعہ فراہم کرتا ہے جو بہتری کی رفتار کو ٹریک کرنے اور یہ سمجھنے میں مدد دیتا ہے کہ مشینیں انسانی سطح کے کتنے قریب ہیں۔
- **پالیسی کو آگاہ کرنے کا ذریعہ**۔ ایسے حوالہ جاتی ٹیسٹ کا وجود AI کی ترقی کی سمتوں، ممکنہ خطرات اور ضروری ریگولیٹری اقدامات کے بارے میں زیادہ ٹھوس بحث کو ممکن بناتا ہے۔
- **علمی آزمائشوں کی آخری حد**۔ «آخری امتحان» کا نام خود اس خیال کو ظاہر کرتا ہے کہ سوالات کا یہ مجموعہ AI کی جانچ کے لیے آخری بند امتحان بن سکتا ہے۔ HLE کو اعتماد کے ساتھ پاس کرنا اس بات کا اشارہ ہوگا کہ رسمی علم اور سختی سے قابلِ جانچ استدلالی مہارتوں کے لحاظ سے مشین نے بہترین انسانی ماہرین کی سطح حاصل کر لی ہے<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔

یہ بات قابلِ ذکر ہے کہ HLE کو مکمل طور پر پاس کرنا بھی عمومی مصنوعی ذہانت (AGI) کے حصول کا مطلب نہیں ہوگا، کیونکہ یہ ٹیسٹ تخلیقی صلاحیتوں، خود اقدامی یا نئے علمی سوالات اٹھانے کی صلاحیت کو نہیں جانچتا<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔

تیز رفتار ترقی کو مدنظر رکھتے ہوئے محققین اندازہ لگاتے ہیں کہ ماڈلز 2025 کے اختتام تک HLE میں 50% درستگی سے تجاوز کر سکتے ہیں۔ اس کا مطلب یہ ہوگا کہ مشینیں علمی معلومات کی ایک محدود لیکن اہم میٹرک میں انسانی سطح کے قریب پہنچ گئی ہیں<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_note-hle_site-4)</sup>۔

## حوالہ جات

- Humanity's Last Exam کی سرکاری ویب سائٹ
- benchmark پیش کرنے والا علمی مقالہ

## کتابیات

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## حواشی

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(UR)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[6]</a></span>
