Humanity's Last Exam (benchmark) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Humanity's Last Exam (HLE, বাং. «মানবজাতির শেষ পরীক্ষা») — এটি একটি ব্যাপক test-benchmark, যা উন্নত কৃত্রিম বুদ্ধিমত্তা (AI) সিস্টেমের সক্ষমতা মূল্যায়নের জন্য তৈরি করা হয়েছে এমন সব কাজে, যেগুলোতে সেরা মানব বিশেষজ্ঞদের সমতুল্য জ্ঞান ও যুক্তি-দক্ষতার প্রয়োজন হয়। Benchmark-টি ২০২৪–২০২৫ সালে অলাভজনক প্রতিষ্ঠান Center for AI Safety (CAIS) এবং Scale AI কোম্পানির যৌথ উদ্যোগে তৈরি করা হয়েছিল[1]

HLE প্রকল্পটি AI মডেলগুলোর জন্য একটি «শেষ একাডেমিক পরীক্ষা» হিসেবে পরিকল্পিত — একটি চরম কঠিন পরীক্ষা, যা নির্ধারণ করতে সাহায্য করবে যে আধুনিক মডেলগুলো বিশেষজ্ঞ স্তরের কাছাকাছি পৌঁছাচ্ছে কিনা এবং তাদের সক্ষমতায় কোথায় ফাঁক রয়ে গেছে[1]। Benchmark-টিতে একশোরও বেশি বিভিন্ন বিষয় জুড়ে অত্যন্ত জটিল ২৫০০টি প্রশ্ন রয়েছে[2]

ইতিহাস

২০২০-এর দশকের মাঝামাঝি সময়ে GPT-4 এবং Claude-এর মতো বৃহৎ ভাষা মডেলগুলো জনপ্রিয় test dataset-এ (যেমন MMLU) এতটাই উচ্চ ফলাফল দেখিয়েছিল যে অনেক benchmark অগ্রগতির নির্ভরযোগ্য পরিমাপ হিসেবে কাজ করা বন্ধ করে দিয়েছিল। স্নাতক স্তরের মানক পরীক্ষাগুলো মডেলগুলো দ্বারা কার্যত «বিধ্বস্ত» হয়ে গিয়েছিল, যা আরও উন্নতির বস্তুনিষ্ঠ মূল্যায়ন অসম্ভব করে তুলেছিল[3]

এই পরিস্থিতিতে ড্যান হেন্ড্রিকস (Dan Hendrycks), CAIS-এর পরিচালক এবং AI-এর বিখ্যাত গবেষক, «মানবজাতির শেষ পরীক্ষা»-র ধারণাটি প্রস্তাব করেছিলেন — সর্বোচ্চ জটিলতার প্রশ্নের একটি সংকলন, যা AI-এর সক্ষমতাকে প্রকৃত বিশেষজ্ঞের স্তর থেকে আলাদা করতে পারবে। এর অনুপ্রেরণা ছিল উদ্যোক্তা ইলন মাস্কের সাথে একটি কথোপকথন, যিনি মত প্রকাশ করেছিলেন যে বিদ্যমান পরীক্ষাগুলো অনেক সহজ হয়ে গেছে[2]

ধারণাটি বাস্তবায়নের জন্য CAIS, Scale AI-এর সাথে শক্তি একত্রিত করে। ২০২৪ সালের ১৫ সেপ্টেম্বর ভবিষ্যৎ পরীক্ষার জন্য সবচেয়ে কঠিন প্রশ্ন সংগ্রহের একটি বৈশ্বিক আহ্বান আনুষ্ঠানিকভাবে ঘোষণা করা হয়। আয়োজকরা বিশ্বজুড়ে বিজ্ঞানী ও বিশেষজ্ঞদের কাছে সেই সব সমস্যা পাঠানোর আমন্ত্রণ জানিয়েছিলেন যা সবচেয়ে উন্নত AI মডেলগুলোকেও বিপাকে ফেলতে সক্ষম। অংশগ্রহণকারীদের উৎসাহিত করতে $৫০০,০০০ পুরস্কার তহবিল প্রতিষ্ঠা করা হয়েছিল[3]

সমস্যা বাছাই প্রক্রিয়া বেশ কয়েকটি ধাপে সম্পন্ন হয়েছিল। প্রথমে পাঠানো প্রশ্নগুলো উন্নত AI মডেলের মাধ্যমে একটি ফিল্টারে পাঠানো হয়েছিল: অ্যালগরিদম যদি কোনো সমস্যা আত্মবিশ্বাসের সাথে সমাধান করতে পারত, তাহলে সেটিকে অপর্যাপ্ত কঠিন হিসেবে বাতিল করা হত। যে কাজগুলোতে AI সফল হয়নি সেগুলো সঠিকতা এবং একক সঠিক উত্তরের উপস্থিতি মূল্যায়নের জন্য বিশেষজ্ঞ যাচাইয়ের মধ্য দিয়ে গেছে। শেষ পর্যন্ত ৫০০টিরও বেশি বৈজ্ঞানিক-শিক্ষামূলক প্রতিষ্ঠান থেকে প্রায় ১০০০ বিশেষজ্ঞ সংকলন তৈরিতে অংশ নিয়েছিলেন[4]

২৫০০টি প্রশ্ন নিয়ে গঠিত benchmark-এর চূড়ান্ত সংস্করণ ২০২৫ সালের শুরুতে উপস্থাপন করা হয়েছিল। কিছু কাজ নিয়ন্ত্রণ পরীক্ষা ও নির্দিষ্ট সংকলনের সাথে মডেলের অভিযোজন রোধের জন্য একটি বদ্ধ রিজার্ভে রেখে দেওয়া হয়েছে[2]

Benchmark-এর কাঠামো ও বিষয়বস্তু

HLE-এর প্রশ্ন সংকলন একাডেমিক জ্ঞানের বিস্তৃত বিষয় জুড়ে বিস্তৃত। কাজগুলো বিষয় অনুযায়ী নিম্নরূপভাবে বিতরণ করা হয়েছে:

  • গণিত: ~৪১%
  • জীববিজ্ঞান ও চিকিৎসাবিজ্ঞান: ~১১%
  • কম্পিউটার বিজ্ঞান ও AI: ~১০%
  • পদার্থবিজ্ঞান: ~৯%
  • মানবিক ও সামাজিক বিজ্ঞান: ~৯%
  • রসায়ন: ~৭%
  • প্রকৌশল বিজ্ঞান: ~৪%
  • অন্যান্য ক্ষেত্র: ~৯%

সমস্ত কাজের প্রায় ১৪% হলো মাল্টিমোডাল, অর্থাৎ সেগুলো সমাধানের জন্য চিত্র (ছবি, চিত্রলেখ, লেখচিত্র) বিশ্লেষণ প্রয়োজন[2]। অধিকাংশ (প্রায় ৩/৪) কাজ হলো সংক্ষিপ্ত উত্তরসহ মুক্ত প্রশ্ন, যেখানে মডেলকে স্বাধীনভাবে একটি সঠিক উত্তর (সংখ্যা, পরিভাষা, নাম) তৈরি করতে হবে। বাকিগুলো বহু নির্বাচনী প্রশ্ন।

HLE-এর সমস্ত সমস্যার সাধারণ বৈশিষ্ট্য রয়েছে:

  • অত্যন্ত উচ্চ জটিলতা: প্রতিটি সমস্যার জন্য সংশ্লিষ্ট ক্ষেত্রে দক্ষ বিশেষজ্ঞের সমতুল্য জ্ঞান ও দক্ষতার প্রয়োজন[5]
  • যাচাইযোগ্য উত্তর: প্রতিটি প্রশ্নের একটি নির্দিষ্ট ও প্রমাণযোগ্য সঠিক উত্তর রয়েছে।
  • অনুসন্ধান-প্রতিরোধী: কাজগুলো এমনভাবে বাছাই করা হয়েছে যাতে সাধারণ অনুসন্ধান দিয়ে উত্তর খুঁজে পাওয়া না যায়; সাফল্যের জন্য বিষয়ের গভীর বোঝাপড়া ও যুক্তি প্রয়োজন[1]

মডেল পরীক্ষার ফলাফল

Humanity's Last Exam অবিলম্বে অত্যন্ত কঠিন পরীক্ষার খ্যাতি নিশ্চিত করেছে: আধুনিক AI মডেলগুলোর কেউই এতে মানবিক স্তরের কাছাকাছি ফলাফল দেখাতে পারেনি। ২০২৫ সালের সেরা ভাষা মডেলগুলো অত্যন্ত কম নির্ভুলতা প্রদর্শন করেছে।

  • OpenAI-এর GPT-4-এর বিভিন্ন সংস্করণ এবং Anthropic-এর Claude ১০%-এরও কম ফলাফল দেখিয়েছে[4]
  • মানক LLM-গুলোর মধ্যে সর্বোচ্চ ফলাফল ছিল Google DeepMind-এর Gemini 2.5 Pro মডেলের, যার নির্ভুলতা প্রায় ২১.৬%[4]
  • এমনকি সেরা মডেলগুলোও HLE-এর প্রায় ৪/৫ প্রশ্নে ব্যর্থ হয়েছে, যা বর্তমান AI সক্ষমতা এবং মানব বিশেষজ্ঞের স্তরের মধ্যে ব্যবধানের মাত্রা তুলে ধরে[1]

OpenAI-এর পরীক্ষামূলক এজেন্ট ChatGPT Deep Research-এর ফলাফল বিশেষ আগ্রহের বিষয়, যাকে স্বয়ংক্রিয়ভাবে অনুসন্ধান প্রশ্ন চালানোর অনুমতি দেওয়া হয়েছিল। একজন গবেষকের কাজ অনুকরণ করে, এই এজেন্ট ২৬.৬% কাজ সঠিকভাবে সমাধান করতে সক্ষম হয়েছিল — এই ধরনের সরঞ্জাম ছাড়া যেকোনো মডেলের তুলনায় ২ গুণেরও বেশি ফলাফল, তবে এখনও উত্তীর্ণ নম্বর থেকে অনেক দূরে[6]

গুরুত্ব ও সম্ভাবনা

HLE-এর আবির্ভাব AI সম্প্রদায়ে একটি গুরুত্বপূর্ণ ঘটনা হিসেবে বিবেচিত হয়েছে, কারণ benchmark-টি অগ্রগতির নতুন, আরও কঠিন পরিমাপের তীব্র প্রয়োজনীয়তা পূরণ করেছে।

  • সাধারণ সূচনাবিন্দু। HLE গবেষক ও নীতিনির্ধারকদের AI সক্ষমতা মূল্যায়নের একটি বস্তুনিষ্ঠ হাতিয়ার প্রদান করে, যা উন্নতির গতিশীলতা অনুসরণ করতে এবং মেশিনগুলো মানবিক স্তরের কতটা কাছাকাছি পৌঁছাচ্ছে তা বুঝতে সাহায্য করে।
  • নীতি প্রণয়নের হাতিয়ার। এই ধরনের একটি মানদণ্ড পরীক্ষার উপস্থিতি AI-এর উন্নয়নের দিকনির্দেশনা, সম্ভাব্য ঝুঁকি এবং প্রয়োজনীয় নিয়ন্ত্রণমূলক ব্যবস্থা সম্পর্কে আরও বিষয়ভিত্তিক আলোচনাকে উৎসাহিত করে।
  • একাডেমিক পরীক্ষার চূড়ান্ত সীমানা। «শেষ পরীক্ষা» নামটিই ধারণাটি প্রতিফলিত করে যে এই সমস্যার সংকলন AI মূল্যায়নের জন্য শেষ বদ্ধ পরীক্ষা হতে পারে। HLE আত্মবিশ্বাসের সাথে উত্তীর্ণ হওয়ার অর্থ হবে যে আনুষ্ঠানিক জ্ঞান এবং কঠোরভাবে যাচাইযোগ্য যুক্তি-দক্ষতার দিক থেকে মেশিন সেরা মানব বিশেষজ্ঞের স্তরে পৌঁছে গেছে[4]

এটি উল্লেখ করা গুরুত্বপূর্ণ যে HLE সম্পূর্ণরূপে উত্তীর্ণ হলেও তা সাধারণ কৃত্রিম বুদ্ধিমত্তা (AGI) অর্জনের অর্থ বহন করবে না, কারণ পরীক্ষাটি সৃজনশীল সক্ষমতা, উদ্যোগ বা নতুন বৈজ্ঞানিক প্রশ্ন উত্থাপনের দক্ষতা যাচাই করে না[4]

দ্রুত অগ্রগতির কথা মাথায় রেখে, গবেষকরা ধারণা করছেন যে মডেলগুলো ২০২৫ সালের শেষ নাগাদ HLE-তে ৫০% নির্ভুলতা অতিক্রম করতে পারে। এর অর্থ হবে যে মেশিনগুলো একাডেমিক জ্ঞানের একটি সংকীর্ণ কিন্তু গুরুত্বপূর্ণ পরিমাপে মানবিক স্তরের অত্যন্ত কাছাকাছি পৌঁছে গেছে[4]

সূত্র

  • Humanity's Last Exam-এর অফিসিয়াল ওয়েবসাইট
  • Benchmark উপস্থাপনকারী বৈজ্ঞানিক নিবন্ধ

সাহিত্য

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

টীকা

  1. 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [১]
  2. 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [২]
  3. 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [৩]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [৪]
  5. «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [৫]
  6. «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [৬]