---
title: "MMLU Benchmark (HI)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(HI)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4077
wiki_created_at: 2026-09-06T23:30:13Z
wiki_modified_at: 2026-09-06T23:30:13Z
downloaded_at: 2026-09-07T23:00:45Z
---

# MMLU Benchmark (HI)

**MMLU** (**Measuring Massive Multitask Language Understanding** का संक्षिप्त रूप) — यह एक मानक कार्य-संग्रह (benchmark) है, जो बड़े भाषा मॉडलों (LLM) की क्षमताओं का विस्तृत विषय-क्षेत्रों में मूल्यांकन करने के लिए बनाया गया है। यह benchmark वर्ष 2020 में UC Berkeley के **डैन हेंड्रिक्स** (*Dan Hendrycks*) के नेतृत्व में शोधकर्ताओं की एक टीम द्वारा विकसित किया गया था और 2021 में ICLR सम्मेलन में प्रकाशित हुआ<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_paper-1)</sup>।

MMU का उद्देश्य यह परखना है कि मॉडल ने पूर्व-प्रशिक्षण (pre-training) के चरण में कितना विविध ज्ञान और कौशल अर्जित किया है — इसे *zero-shot* या *few-shot* परीक्षण मोड में, बिना किसी अतिरिक्त fine-tuning के, जाँचा जाता है। MMLU को पहले से मौजूद परीक्षणों (जैसे GLUE और SuperGLUE) के एक अधिक कठिन विकल्प के रूप में बनाया गया था, क्योंकि 2020 तक कई मॉडल उन पर मानव-स्तरीय प्रदर्शन कर चुके थे<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_wiki-2)</sup>।

## विवरण और सामग्री

MMU में **57 विभिन्न विषयों** को कवर करते हुए **15,908 बहुविकल्पीय प्रश्न** शामिल हैं। प्रश्नों के विषय-क्षेत्रों में शामिल हैं:

- STEM विषय (गणित, भौतिकी, जीव विज्ञान, सूचना विज्ञान)।
- मानविकी और सामाजिक विज्ञान (इतिहास, साहित्य, कानून, प्रशासन)।
- व्यावहारिक और व्यावसायिक क्षेत्र (चिकित्सा, न्यायशास्त्र, व्यवसाय)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_paper-1)</sup>।

कठिनाई का स्तर प्राथमिक विद्यालय से लेकर उन्नत पेशेवर स्तर तक होता है। प्रश्न विद्यालयों, विश्वविद्यालयों और GRE तथा USMLE जैसी पेशेवर परीक्षाओं की वास्तविक सामग्री पर आधारित हैं<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_paper-1)</sup>। प्रत्येक प्रश्न में चार उत्तर विकल्प होते हैं, जिसका अर्थ है कि यादृच्छिक चुनाव पर सटीकता 25% होती है। उच्च परिणाम प्राप्त करने के लिए मॉडल को व्यापक विश्वकोश ज्ञान और तर्क करने की क्षमता होनी चाहिए।

## परिणाम और विकास

2020 में MMLU के जारी होने पर अधिकांश LLM के परिणाम यादृच्छिक अनुमान से बस थोड़े ही ऊपर थे। सबसे अच्छा प्रदर्शन GPT-3 मॉडल (175 अरब पैरामीटर) ने किया, जिसने **~43.9%** सही उत्तर दिए। तुलना के लिए, एक मानव विशेषज्ञ औसतन **~90%** प्राप्त करता था<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_paper-1)</sup>। इस अंतर ने नए benchmark की कठिनाई और ऊँचे मानक की पुष्टि की।

समय के साथ MMLU LLM के लिए सबसे लोकप्रिय परीक्षणों में से एक बन गया और प्रमुख AI कंपनियों की रिपोर्टों में इसे "स्वर्ण मानक" का दर्जा प्राप्त हुआ<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-new_savanna_2024-3)</sup>। 2023-2024 तक GPT-4, Google के **Gemini Ultra** और Anthropic के **Claude 3.5** जैसे नवीनतम मॉडल मानव-स्तर के निकट पहुँच गए और **~85-90%** सटीकता तक पहुँचे<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-new_savanna_2024-3)</sup>।

तेज़ प्रगति के कारण benchmark का धीरे-धीरे "संतृप्तिकरण" (saturation) हुआ: अग्रणी मॉडल अधिकतम के निकट अंक प्राप्त करने लगे, जिससे MMLU की उनकी बौद्धिक क्षमताओं को अलग करने की क्षमता कम हो गई। इसने समुदाय को नए, अधिक कठिन परीक्षण विकसित करने के लिए प्रेरित किया<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-new_savanna_2024-3)</sup>।

## सीमाएँ और आलोचना

व्यापक प्रचलन के बावजूद, MMLU में कई महत्वपूर्ण सीमाएँ हैं।

### डेटा की गुणवत्ता और सटीकता

जून 2024 में शोधकर्ताओं ने MMLU के 5700 प्रश्नों के एक नमूने का हस्तचालित विश्लेषण किया और बड़ी संख्या में त्रुटियाँ पाईं<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-done_with_mmlu_2024-4)</sup>।

- MMLU के लगभग **6.5%** प्रश्नों में लेबलिंग या शब्दावली में त्रुटियाँ हैं।
- कुछ श्रेणियों में गलत कार्यों का अनुपात बहुत अधिक है। उदाहरण के लिए, "Virology" (विषाणु विज्ञान) खंड में **57%** कार्यों में त्रुटियाँ थीं (कई सही उत्तर, गलत शब्दावली या गलत तरीके से निर्दिष्ट मानक उत्तर)।

इसका अर्थ है कि एक आदर्श मॉडल भी मूल dataset पर 100% प्राप्त नहीं कर सकता, और मेट्रिक्स में कुछ सुधार मॉडल द्वारा संग्रह की व्यवस्थित त्रुटियों को याद करने से जुड़े हो सकते हैं<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-done_with_mmlu_2024-4)</sup>।

### मूल्यांकन पद्धति और डेटा रिसाव

- **परीक्षण मानक का अभाव**। विभिन्न डेवलपर अलग-अलग prompt और few-shot मोड का उपयोग कर सकते हैं, जिससे मॉडलों के परिणामों की सीधी तुलना कठिन हो जाती है।
- **डेटा रिसाव** (*data contamination*)। सार्वजनिक benchmark के प्रश्न और उत्तर LLM के प्रशिक्षण डेटा में शामिल होने का जोखिम है। ऐसे में मॉडल वास्तव में सही उत्तर "जानता" है, जिससे मूल्यांकन अनुचित हो जाता है<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-new_savanna_2024-3)</sup>।

## व्युत्पन्न संस्करण और विस्तार

मूल MMLU की समस्याओं को हल करने के लिए इसके कई रूप बनाए गए।

- **MMLU-Redux**। जून 2024 में प्रस्तुत संग्रह का एक सुधरा और परिष्कृत संस्करण। इसमें 30 श्रेणियों के 3000 पुनः-लेबल किए गए प्रश्न हैं और यह डेटा त्रुटियों के कारण होने वाले विकृतियों के बिना मॉडलों के अधिक विश्वसनीय मूल्यांकन के लिए है<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-done_with_mmlu_2024-4)</sup>।
- **MMLU-Pro**। 2024 के अंत में प्रस्तुत परीक्षण का एक विस्तारित और कठिन संस्करण। इसमें 12,000 से अधिक प्रश्न हैं, जिनमें से प्रत्येक में चार के बजाय **10 उत्तर विकल्प** दिए गए हैं। इससे यादृच्छिक अनुमान की संभावना 10% तक कम हो जाती है। प्रश्नों की विशेषज्ञों द्वारा जाँच की गई है और उनमें अधिक कठिन स्रोतों से नए कार्य शामिल हैं<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmlu_pro_vals_ai-5)</sup>।
- **MMMLU** (*Multilingual MMLU*)। OpenAI द्वारा 2023 में जारी बहुभाषी संस्करण। पूरे MMLU संग्रह का पेशेवर अनुवादकों द्वारा 14 भाषाओं में अनुवाद किया गया, जिनमें सामान्य (स्पेनिश, चीनी, रूसी) और कम-संसाधन (जैसे, योरूबा) दोनों शामिल हैं। इससे विभिन्न भाषाओं में मॉडलों की क्षमताओं का मूल्यांकन और तुलना करना संभव होता है<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_note-mmmlu_hf-6)</sup>।

## संदर्भ

- GitHub पर MMLU का आधिकारिक repository
- मॉडल परिणामों के साथ Papers with Code पर MMLU का पृष्ठ

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## टिप्पणियाँ

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(HI)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[६]</a></span>
