---
title: "MMLU Benchmark (BN)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(BN)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4070
wiki_created_at: 2026-09-06T23:30:06Z
wiki_modified_at: 2026-09-06T23:30:06Z
downloaded_at: 2026-09-07T23:00:43Z
---

# MMLU Benchmark (BN)

**MMLU** (**Measuring Massive Multitask Language Understanding**-এর সংক্ষিপ্ত রূপ) — এটি একটি মানদণ্ড কাজের সংকলন (benchmark), যা বিভিন্ন বিষয় ক্ষেত্রে বড় ভাষা মডেলের (LLM) সক্ষমতা মূল্যায়নের জন্য ডিজাইন করা হয়েছে। Benchmark-টি ২০২০ সালে UC Berkeley-র **ড্যান হেন্ড্রিকস** (*Dan Hendrycks*)-এর নেতৃত্বে একটি গবেষক দল তৈরি করেছিল এবং ২০২১ সালে ICLR সম্মেলনে প্রকাশিত হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_paper-1)</sup>।

MMLU-র লক্ষ্য হলো — অতিরিক্ত fine-tuning ছাড়াই *zero-shot* বা *few-shot* পরীক্ষার মাধ্যমে একটি মডেল পূর্ব-প্রশিক্ষণ পর্যায়ে অর্জিত বৈচিত্র্যময় জ্ঞান ও দক্ষতা কতটুকু আত্মস্থ করেছে তা যাচাই করা। MMLU তৈরি হয়েছিল পূর্ববর্তী পরীক্ষাগুলোর (যেমন GLUE এবং SuperGLUE) একটি কঠিন বিকল্প হিসেবে, যেগুলোতে ২০২০ সাল নাগাদ অনেক মডেল ইতিমধ্যে মানব-স্তরে পৌঁছে গিয়েছিল<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_wiki-2)</sup>।

## বিবরণ ও বিষয়বস্তু

MMLU-তে রয়েছে **১৫,৯০৮টি বহু-নির্বাচনী প্রশ্ন**, যা **৫৭টি ভিন্ন বিষয়** জুড়ে বিস্তৃত। কাজগুলোর বিষয়বস্তুতে অন্তর্ভুক্ত রয়েছে:

- STEM বিষয় (গণিত, পদার্থবিজ্ঞান, জীববিজ্ঞান, কম্পিউটার বিজ্ঞান)।
- মানবিক ও সামাজিক বিজ্ঞান (ইতিহাস, সাহিত্য, আইন, প্রশাসন)।
- প্রায়োগিক ও পেশাদার ক্ষেত্র (চিকিৎসাবিজ্ঞান, আইনশাস্ত্র, ব্যবসা)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_paper-1)</sup>।

কঠিনতার পরিসর প্রাথমিক বিদ্যালয় থেকে উচ্চ পেশাদার স্তর পর্যন্ত বিস্তৃত। প্রশ্নগুলো স্কুল, বিশ্ববিদ্যালয় এবং GRE ও USMLE-এর মতো পেশাদার পরীক্ষার বাস্তব উপকরণের উপর ভিত্তি করে তৈরি<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_paper-1)</sup>। প্রতিটি প্রশ্নের জন্য চারটি উত্তর বিকল্প থাকে, অর্থাৎ এলোমেলোভাবে বেছে নিলে সঠিকতার হার ২৫%। উচ্চ ফলাফল অর্জন করতে মডেলের বিস্তৃত বিশ্বকোষীয় জ্ঞান এবং যুক্তি প্রদানের ক্ষমতা থাকতে হবে।

## ফলাফল ও বিকাশ

২০২০ সালে MMLU প্রকাশের সময় বেশিরভাগ LLM কেবল এলোমেলো অনুমানের চেয়ে সামান্য বেশি ফলাফল দেখিয়েছিল। সেরা ফলাফল দেখিয়েছিল GPT-3 মডেল (১৭৫ বিলিয়ন parameter), যা **~৪৩.৯%** সঠিক উত্তর অর্জন করেছিল। তুলনামূলকভাবে, একজন মানব বিশেষজ্ঞ গড়ে **~৯০%** অর্জন করেছিলেন<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_paper-1)</sup>। এই ব্যবধান নতুন benchmark-এর জটিলতা ও উচ্চ মানদণ্ড নিশ্চিত করেছিল।

সময়ের সাথে সাথে MMLU LLM-এর জন্য সবচেয়ে জনপ্রিয় পরীক্ষাগুলির একটিতে পরিণত হয়েছে এবং শীর্ষস্থানীয় AI কোম্পানির প্রতিবেদনে 'সোনার মানদণ্ড' হিসেবে স্বীকৃতি পেয়েছে<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-new_savanna_2024-3)</sup>। ২০২৩-২০২৪ সাল নাগাদ GPT-4, Google-এর **Gemini Ultra** এবং Anthropic-এর **Claude 3.5**-এর মতো সর্বশেষ মডেলগুলো মানব-স্তরের কাছাকাছি পৌঁছে **~৮৫-৯০%** সঠিকতা অর্জন করেছে<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-new_savanna_2024-3)</sup>।

দ্রুত অগ্রগতির ফলে benchmark-এর ধীরে ধীরে 'স্যাচুরেশন' ঘটেছে: শীর্ষস্থানীয় মডেলগুলো সর্বোচ্চের কাছাকাছি স্কোর অর্জন করতে শুরু করেছে, যা তাদের বৌদ্ধিক সক্ষমতা পার্থক্য করার ক্ষেত্রে MMLU-র সামর্থ্য হ্রাস করেছে। এটি সম্প্রদায়কে নতুন, আরও কঠিন পরীক্ষা তৈরিতে অনুপ্রাণিত করেছে<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-new_savanna_2024-3)</sup>।

## সীমাবদ্ধতা ও সমালোচনা

ব্যাপক প্রচলন সত্ত্বেও MMLU-র বেশ কিছু উল্লেখযোগ্য সীমাবদ্ধতা রয়েছে।

### তথ্যের মান ও সঠিকতা

২০২৪ সালের জুন মাসে গবেষকরা MMLU-র ৫,৭০০টি প্রশ্নের একটি নমুনার ম্যানুয়াল বিশ্লেষণ করেন এবং উল্লেখযোগ্য সংখ্যক ত্রুটি খুঁজে পান<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-done_with_mmlu_2024-4)</sup>।

- MMLU-র প্রায় **৬.৫%** প্রশ্নে লেবেলিং বা প্রণয়নে ত্রুটি রয়েছে।
- কিছু বিভাগে ভুল কাজের অনুপাত অত্যন্ত বেশি। উদাহরণস্বরূপ, 'ভাইরোলজি' বিভাগে **৫৭%** কাজে ত্রুটি ছিল (একাধিক সঠিক উত্তর, ভুল প্রণয়ন বা ভুলভাবে উল্লিখিত রেফারেন্স উত্তর)।

এর মানে হলো এমনকি একটি নিখুঁত মডেলও মূল dataset-এ ১০০% অর্জন করতে পারবে না, এবং মেট্রিকের কিছু উন্নতি সম্ভবত মডেলের সংকলনের পদ্ধতিগত ত্রুটি মুখস্থ করার সাথে সম্পর্কিত<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-done_with_mmlu_2024-4)</sup>।

### মূল্যায়ন পদ্ধতি ও তথ্য দূষণ

- **পরীক্ষার মানদণ্ডের অনুপস্থিতি**। বিভিন্ন ডেভেলপার ভিন্ন ভিন্ন prompt এবং few-shot মোড ব্যবহার করতে পারেন, যা মডেলের ফলাফলের সরাসরি তুলনাকে কঠিন করে তোলে।
- **তথ্য দূষণ** (*data contamination*)। প্রকাশিত benchmark থেকে প্রশ্ন ও উত্তর LLM-এর প্রশিক্ষণ নমুনায় অন্তর্ভুক্ত হওয়ার ঝুঁকি রয়েছে। সেই ক্ষেত্রে মডেল কার্যত সঠিক উত্তর 'জানে', যা মূল্যায়নকে অসৎ করে তোলে<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-new_savanna_2024-3)</sup>।

## ডেরিভেটিভ সংস্করণ ও সম্প্রসারণ

মূল MMLU-র সমস্যা সমাধানের জন্য বেশ কিছু রূপান্তর তৈরি করা হয়েছে।

- **MMLU-Redux**। ২০২৪ সালের জুনে উপস্থাপিত সংকলনের একটি সংশোধিত ও পরিমার্জিত সংস্করণ। এটিতে ৩০টি বিভাগ থেকে ৩,০০০টি পুনরায় লেবেলকৃত প্রশ্ন রয়েছে এবং তথ্যের ত্রুটিজনিত বিকৃতি ছাড়াই মডেলের আরও নির্ভরযোগ্য মূল্যায়নের জন্য তৈরি<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-done_with_mmlu_2024-4)</sup>।
- **MMLU-Pro**। ২০২৪ সালের শেষের দিকে উপস্থাপিত পরীক্ষার একটি বিস্তারিত ও কঠিন রূপান্তর। এটিতে ১২,০০০-এরও বেশি প্রশ্ন রয়েছে, প্রতিটিতে চারটির পরিবর্তে **১০টি উত্তর বিকল্প** দেওয়া হয়। এটি এলোমেলোভাবে সঠিক উত্তর বেছে নেওয়ার সম্ভাবনা ১০%-এ নামিয়ে আনে। প্রশ্নগুলো বিশেষজ্ঞদের দ্বারা যাচাই করা হয়েছে এবং আরও কঠিন উৎস থেকে নতুন কাজ অন্তর্ভুক্ত করা হয়েছে<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmlu_pro_vals_ai-5)</sup>।
- **MMMLU** (*Multilingual MMLU*)। OpenAI ২০২৩ সালে প্রকাশিত একটি বহুভাষিক সংস্করণ। সমগ্র MMLU সংকলন পেশাদার অনুবাদকদের দ্বারা ১৪টি ভাষায় অনুবাদ করা হয়েছে, যার মধ্যে প্রচলিত (স্প্যানিশ, চীনা, রাশিয়ান) এবং কম সম্পদশালী (যেমন ইয়োরুবা) উভয় ভাষা অন্তর্ভুক্ত। এটি বিভিন্ন ভাষায় মডেলের সক্ষমতা মূল্যায়ন ও তুলনা করতে সক্ষম করে<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_note-mmmlu_hf-6)</sup>।

## তথ্যসূত্র

- GitHub-এ MMLU-র অফিসিয়াল রিপোজিটরি
- মডেলের ফলাফলসহ Papers with Code-এ MMLU পৃষ্ঠা

## সাহিত্য

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## টীকা

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(BN)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[৬]</a></span>
