---
title: "Humanity's Last Exam (benchmark) (BN)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3017
wiki_created_at: 2026-09-06T23:14:23Z
wiki_modified_at: 2026-09-06T23:14:23Z
downloaded_at: 2026-09-07T22:54:28Z
---

# Humanity's Last Exam (benchmark) (BN)

**Humanity's Last Exam** (**HLE**, বাং. «মানবজাতির শেষ পরীক্ষা») — এটি একটি ব্যাপক test-benchmark, যা উন্নত কৃত্রিম বুদ্ধিমত্তা (AI) সিস্টেমের সক্ষমতা মূল্যায়নের জন্য তৈরি করা হয়েছে এমন সব কাজে, যেগুলোতে সেরা মানব বিশেষজ্ঞদের সমতুল্য জ্ঞান ও যুক্তি-দক্ষতার প্রয়োজন হয়। Benchmark-টি ২০২৪–২০২৫ সালে অলাভজনক প্রতিষ্ঠান Center for AI Safety (CAIS) এবং Scale AI কোম্পানির যৌথ উদ্যোগে তৈরি করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_paper-1)</sup>।

HLE প্রকল্পটি AI মডেলগুলোর জন্য একটি «শেষ একাডেমিক পরীক্ষা» হিসেবে পরিকল্পিত — একটি চরম কঠিন পরীক্ষা, যা নির্ধারণ করতে সাহায্য করবে যে আধুনিক মডেলগুলো বিশেষজ্ঞ স্তরের কাছাকাছি পৌঁছাচ্ছে কিনা এবং তাদের সক্ষমতায় কোথায় ফাঁক রয়ে গেছে<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_paper-1)</sup>। Benchmark-টিতে একশোরও বেশি বিভিন্ন বিষয় জুড়ে অত্যন্ত জটিল ২৫০০টি প্রশ্ন রয়েছে<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-wiki_hle-2)</sup>।

## ইতিহাস

২০২০-এর দশকের মাঝামাঝি সময়ে GPT-4 এবং Claude-এর মতো বৃহৎ ভাষা মডেলগুলো জনপ্রিয় test dataset-এ (যেমন MMLU) এতটাই উচ্চ ফলাফল দেখিয়েছিল যে অনেক benchmark অগ্রগতির নির্ভরযোগ্য পরিমাপ হিসেবে কাজ করা বন্ধ করে দিয়েছিল। স্নাতক স্তরের মানক পরীক্ষাগুলো মডেলগুলো দ্বারা কার্যত «বিধ্বস্ত» হয়ে গিয়েছিল, যা আরও উন্নতির বস্তুনিষ্ঠ মূল্যায়ন অসম্ভব করে তুলেছিল<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-reuters_stump-3)</sup>।

এই পরিস্থিতিতে **ড্যান হেন্ড্রিকস** (*Dan Hendrycks*), CAIS-এর পরিচালক এবং AI-এর বিখ্যাত গবেষক, «মানবজাতির শেষ পরীক্ষা»-র ধারণাটি প্রস্তাব করেছিলেন — সর্বোচ্চ জটিলতার প্রশ্নের একটি সংকলন, যা AI-এর সক্ষমতাকে প্রকৃত বিশেষজ্ঞের স্তর থেকে আলাদা করতে পারবে। এর অনুপ্রেরণা ছিল উদ্যোক্তা ইলন মাস্কের সাথে একটি কথোপকথন, যিনি মত প্রকাশ করেছিলেন যে বিদ্যমান পরীক্ষাগুলো অনেক সহজ হয়ে গেছে<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-wiki_hle-2)</sup>।

ধারণাটি বাস্তবায়নের জন্য CAIS, Scale AI-এর সাথে শক্তি একত্রিত করে। ২০২৪ সালের ১৫ সেপ্টেম্বর ভবিষ্যৎ পরীক্ষার জন্য সবচেয়ে কঠিন প্রশ্ন সংগ্রহের একটি বৈশ্বিক আহ্বান আনুষ্ঠানিকভাবে ঘোষণা করা হয়। আয়োজকরা বিশ্বজুড়ে বিজ্ঞানী ও বিশেষজ্ঞদের কাছে সেই সব সমস্যা পাঠানোর আমন্ত্রণ জানিয়েছিলেন যা সবচেয়ে উন্নত AI মডেলগুলোকেও বিপাকে ফেলতে সক্ষম। অংশগ্রহণকারীদের উৎসাহিত করতে \$৫০০,০০০ পুরস্কার তহবিল প্রতিষ্ঠা করা হয়েছিল<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-reuters_stump-3)</sup>।

সমস্যা বাছাই প্রক্রিয়া বেশ কয়েকটি ধাপে সম্পন্ন হয়েছিল। প্রথমে পাঠানো প্রশ্নগুলো উন্নত AI মডেলের মাধ্যমে একটি ফিল্টারে পাঠানো হয়েছিল: অ্যালগরিদম যদি কোনো সমস্যা আত্মবিশ্বাসের সাথে সমাধান করতে পারত, তাহলে সেটিকে অপর্যাপ্ত কঠিন হিসেবে বাতিল করা হত। যে কাজগুলোতে AI সফল হয়নি সেগুলো সঠিকতা এবং একক সঠিক উত্তরের উপস্থিতি মূল্যায়নের জন্য বিশেষজ্ঞ যাচাইয়ের মধ্য দিয়ে গেছে। শেষ পর্যন্ত ৫০০টিরও বেশি বৈজ্ঞানিক-শিক্ষামূলক প্রতিষ্ঠান থেকে প্রায় ১০০০ বিশেষজ্ঞ সংকলন তৈরিতে অংশ নিয়েছিলেন<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।

**২৫০০টি প্রশ্ন** নিয়ে গঠিত benchmark-এর চূড়ান্ত সংস্করণ ২০২৫ সালের শুরুতে উপস্থাপন করা হয়েছিল। কিছু কাজ নিয়ন্ত্রণ পরীক্ষা ও নির্দিষ্ট সংকলনের সাথে মডেলের অভিযোজন রোধের জন্য একটি বদ্ধ রিজার্ভে রেখে দেওয়া হয়েছে<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-wiki_hle-2)</sup>।

## Benchmark-এর কাঠামো ও বিষয়বস্তু

HLE-এর প্রশ্ন সংকলন একাডেমিক জ্ঞানের বিস্তৃত বিষয় জুড়ে বিস্তৃত। কাজগুলো বিষয় অনুযায়ী নিম্নরূপভাবে বিতরণ করা হয়েছে:

- **গণিত**: ~৪১%
- **জীববিজ্ঞান ও চিকিৎসাবিজ্ঞান**: ~১১%
- **কম্পিউটার বিজ্ঞান ও AI**: ~১০%
- **পদার্থবিজ্ঞান**: ~৯%
- **মানবিক ও সামাজিক বিজ্ঞান**: ~৯%
- **রসায়ন**: ~৭%
- **প্রকৌশল বিজ্ঞান**: ~৪%
- **অন্যান্য ক্ষেত্র**: ~৯%

সমস্ত কাজের প্রায় **১৪%** হলো **মাল্টিমোডাল**, অর্থাৎ সেগুলো সমাধানের জন্য চিত্র (ছবি, চিত্রলেখ, লেখচিত্র) বিশ্লেষণ প্রয়োজন<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-wiki_hle-2)</sup>। অধিকাংশ (প্রায় ৩/৪) কাজ হলো **সংক্ষিপ্ত উত্তরসহ মুক্ত প্রশ্ন**, যেখানে মডেলকে স্বাধীনভাবে একটি সঠিক উত্তর (সংখ্যা, পরিভাষা, নাম) তৈরি করতে হবে। বাকিগুলো বহু নির্বাচনী প্রশ্ন।

HLE-এর সমস্ত সমস্যার সাধারণ বৈশিষ্ট্য রয়েছে:

- **অত্যন্ত উচ্চ জটিলতা**: প্রতিটি সমস্যার জন্য সংশ্লিষ্ট ক্ষেত্রে দক্ষ বিশেষজ্ঞের সমতুল্য জ্ঞান ও দক্ষতার প্রয়োজন<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-techradar_pass-5)</sup>।
- **যাচাইযোগ্য উত্তর**: প্রতিটি প্রশ্নের একটি নির্দিষ্ট ও প্রমাণযোগ্য সঠিক উত্তর রয়েছে।
- **অনুসন্ধান-প্রতিরোধী**: কাজগুলো এমনভাবে বাছাই করা হয়েছে যাতে সাধারণ অনুসন্ধান দিয়ে উত্তর খুঁজে পাওয়া না যায়; সাফল্যের জন্য বিষয়ের গভীর বোঝাপড়া ও যুক্তি প্রয়োজন<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_paper-1)</sup>।

## মডেল পরীক্ষার ফলাফল

Humanity's Last Exam অবিলম্বে অত্যন্ত কঠিন পরীক্ষার খ্যাতি নিশ্চিত করেছে: **আধুনিক AI মডেলগুলোর কেউই এতে মানবিক স্তরের কাছাকাছি ফলাফল দেখাতে পারেনি**। ২০২৫ সালের সেরা ভাষা মডেলগুলো অত্যন্ত কম নির্ভুলতা প্রদর্শন করেছে।

- OpenAI-এর **GPT-4**-এর বিভিন্ন সংস্করণ এবং Anthropic-এর **Claude** **১০%-এরও কম** ফলাফল দেখিয়েছে<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।
- মানক LLM-গুলোর মধ্যে সর্বোচ্চ ফলাফল ছিল Google DeepMind-এর **Gemini 2.5 Pro** মডেলের, যার নির্ভুলতা প্রায় **২১.৬%**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।
- এমনকি সেরা মডেলগুলোও HLE-এর প্রায় ৪/৫ প্রশ্নে ব্যর্থ হয়েছে, যা বর্তমান AI সক্ষমতা এবং মানব বিশেষজ্ঞের স্তরের মধ্যে ব্যবধানের মাত্রা তুলে ধরে<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_paper-1)</sup>।

OpenAI-এর পরীক্ষামূলক এজেন্ট **ChatGPT Deep Research**-এর ফলাফল বিশেষ আগ্রহের বিষয়, যাকে স্বয়ংক্রিয়ভাবে অনুসন্ধান প্রশ্ন চালানোর অনুমতি দেওয়া হয়েছিল। একজন গবেষকের কাজ অনুকরণ করে, এই এজেন্ট **২৬.৬%** কাজ সঠিকভাবে সমাধান করতে সক্ষম হয়েছিল — এই ধরনের সরঞ্জাম ছাড়া যেকোনো মডেলের তুলনায় ২ গুণেরও বেশি ফলাফল, তবে এখনও উত্তীর্ণ নম্বর থেকে অনেক দূরে<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hindustan_times_26-6)</sup>।

## গুরুত্ব ও সম্ভাবনা

HLE-এর আবির্ভাব AI সম্প্রদায়ে একটি গুরুত্বপূর্ণ ঘটনা হিসেবে বিবেচিত হয়েছে, কারণ benchmark-টি অগ্রগতির নতুন, আরও কঠিন পরিমাপের তীব্র প্রয়োজনীয়তা পূরণ করেছে।

- **সাধারণ সূচনাবিন্দু**। HLE গবেষক ও নীতিনির্ধারকদের AI সক্ষমতা মূল্যায়নের একটি বস্তুনিষ্ঠ হাতিয়ার প্রদান করে, যা উন্নতির গতিশীলতা অনুসরণ করতে এবং মেশিনগুলো মানবিক স্তরের কতটা কাছাকাছি পৌঁছাচ্ছে তা বুঝতে সাহায্য করে।
- **নীতি প্রণয়নের হাতিয়ার**। এই ধরনের একটি মানদণ্ড পরীক্ষার উপস্থিতি AI-এর উন্নয়নের দিকনির্দেশনা, সম্ভাব্য ঝুঁকি এবং প্রয়োজনীয় নিয়ন্ত্রণমূলক ব্যবস্থা সম্পর্কে আরও বিষয়ভিত্তিক আলোচনাকে উৎসাহিত করে।
- **একাডেমিক পরীক্ষার চূড়ান্ত সীমানা**। «শেষ পরীক্ষা» নামটিই ধারণাটি প্রতিফলিত করে যে এই সমস্যার সংকলন AI মূল্যায়নের জন্য শেষ বদ্ধ পরীক্ষা হতে পারে। HLE আত্মবিশ্বাসের সাথে উত্তীর্ণ হওয়ার অর্থ হবে যে আনুষ্ঠানিক জ্ঞান এবং কঠোরভাবে যাচাইযোগ্য যুক্তি-দক্ষতার দিক থেকে মেশিন সেরা মানব বিশেষজ্ঞের স্তরে পৌঁছে গেছে<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।

এটি উল্লেখ করা গুরুত্বপূর্ণ যে HLE সম্পূর্ণরূপে উত্তীর্ণ হলেও তা সাধারণ কৃত্রিম বুদ্ধিমত্তা (AGI) অর্জনের অর্থ বহন করবে না, কারণ পরীক্ষাটি সৃজনশীল সক্ষমতা, উদ্যোগ বা নতুন বৈজ্ঞানিক প্রশ্ন উত্থাপনের দক্ষতা যাচাই করে না<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।

দ্রুত অগ্রগতির কথা মাথায় রেখে, গবেষকরা ধারণা করছেন যে মডেলগুলো ২০২৫ সালের শেষ নাগাদ HLE-তে ৫০% নির্ভুলতা অতিক্রম করতে পারে। এর অর্থ হবে যে মেশিনগুলো একাডেমিক জ্ঞানের একটি সংকীর্ণ কিন্তু গুরুত্বপূর্ণ পরিমাপে মানবিক স্তরের অত্যন্ত কাছাকাছি পৌঁছে গেছে<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_note-hle_site-4)</sup>।

## সূত্র

- Humanity's Last Exam-এর অফিসিয়াল ওয়েবসাইট
- Benchmark উপস্থাপনকারী বৈজ্ঞানিক নিবন্ধ

## সাহিত্য

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## টীকা

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(BN)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[৬]</a></span>
