MMLU Benchmark (UR)
MMLU (اختصار Measuring Massive Multitask Language Understanding کا) ایک معیاری مجموعۂ کار (benchmark) ہے جو بڑے لسانی ماڈلز (LLM) کی صلاحیتوں کو وسیع موضوعاتی شعبوں میں جانچنے کے لیے تیار کیا گیا ہے۔ یہ benchmark سنہ 2020 میں UC Berkeley کے ڈین ہینڈریکس (Dan Hendrycks) کی قیادت میں محققین کی ایک ٹیم نے تیار کیا اور 2021 میں ICLR کانفرنس میں شائع کیا گیا[1]۔
MMLU کا مقصد یہ جانچنا ہے کہ ماڈل نے پیشگی تربیت (pre-training) کے مرحلے میں کس حد تک متنوع علم اور مہارتیں حاصل کی ہیں، اور اسے zero/few-shot طریقے سے بغیر اضافی fine-tuning کے آزمایا جاتا ہے۔ MMLU کو پہلے سے موجود ٹیسٹوں (جیسے GLUE اور SuperGLUE) کے مقابلے میں زیادہ مشکل متبادل کے طور پر بنایا گیا تھا، جن پر 2020 تک بہت سے ماڈلز انسانی سطح حاصل کر چکے تھے[2]۔
تفصیل اور مشمولات
MMLU میں 15,908 سوالات شامل ہیں جن میں متعدد جوابی اختیارات ہوتے ہیں اور یہ 57 مختلف مضامین پر محیط ہیں۔ سوالات کے موضوعات میں شامل ہیں:
- STEM شعبے (ریاضی، طبیعیات، حیاتیات، کمپیوٹر سائنس)۔
- انسانیاتی اور سماجی علوم (تاریخ، ادب، قانون، انتظامیہ)۔
- اطلاقی اور پیشہ ورانہ شعبے (طب، قانون، کاروبار)[1]۔
مشکل کا دائرہ ابتدائی مدرسہ کی سطح سے لے کر اعلیٰ پیشہ ورانہ سطح تک پھیلا ہوا ہے۔ سوالات اسکولوں، جامعات اور پیشہ ورانہ امتحانات جیسے GRE اور USMLE کے حقیقی امتحانی مواد پر مبنی ہیں[1]۔ ہر سوال کے لیے چار جوابی اختیارات ہوتے ہیں، جس کا مطلب ہے کہ اتفاقی انتخاب سے درستگی 25% ہوگی۔ بلند نتیجہ حاصل کرنے کے لیے ماڈل کو وسیع دائرۃ المعارفی علم اور استدلال کی صلاحیت درکار ہے۔
نتائج اور ارتقا
2020 میں MMLU کے اجرا کے وقت زیادہ تر LLM کے نتائج اتفاقی اندازے سے بمشکل بہتر تھے۔ سب سے بہترین نتیجہ GPT-3 (175 ارب parameters) نے دکھایا جس نے ~43.9% درست جوابات دیے۔ اس کے مقابلے میں ایک انسانی ماہر اوسطاً ~90% تک پہنچتا تھا[1]۔ اس فرق نے نئے benchmark کی مشکل اور بلند معیار کو ثابت کیا۔
وقت کے ساتھ MMLU، LLM کے لیے سب سے مقبول ٹیسٹوں میں سے ایک بن گیا اور معروف AI کمپنیوں کی رپورٹوں میں اسے "گولڈن اسٹینڈرڈ" کا درجہ ملا[3]۔ 2023-2024 تک جدید ترین ماڈلز جیسے GPT-4، Google کا Gemini Ultra اور Anthropic کا Claude 3.5 انسانی سطح کے قریب پہنچ گئے اور ~85-90% درستگی حاصل کر لی[2][3]۔
تیز رفتار پیش رفت نے benchmark کی بتدریج "سیری" (saturation) کا باعث بنا: سرفہرست ماڈلز زیادہ سے زیادہ کے قریب اسکور حاصل کرنے لگے، جس سے MMLU کی ان کی فکری صلاحیتوں میں فرق کرنے کی قوت کم ہو گئی۔ اس نے اجتماعیت کو نئے اور زیادہ مشکل ٹیسٹ تیار کرنے پر آمادہ کیا[3]۔
حدود اور تنقید
وسیع پیمانے پر استعمال کے باوجود MMLU میں کچھ اہم حدود موجود ہیں۔
اعداد و شمار کا معیار اور درستگی
جون 2024 میں محققین نے MMLU کے 5700 سوالات کے نمونے کا دستی جائزہ لیا اور کافی تعداد میں غلطیاں دریافت کیں[4]۔
- MMLU کے تمام سوالات میں سے تقریباً 6.5% میں لیبلنگ یا صیغہ بندی کی غلطیاں موجود ہیں۔
- بعض زمروں میں ناقص سوالات کا تناسب بہت زیادہ ہے۔ مثلاً "وائرولوجی" کے حصے میں 57% سوالات میں غلطیاں تھیں (کئی درست جوابات، غلط صیغہ بندی یا غلط حوالہ جاتی جواب)۔
اس کا مطلب ہے کہ ایک بالکل درست ماڈل بھی اصل dataset پر 100% اسکور حاصل نہیں کر سکتا، اور metrics میں بعض بہتریاں ماڈل کی جانب سے dataset کی منظم غلطیوں کو یاد کر لینے سے منسوب ہو سکتی ہیں[4]۔
جانچ کا طریقہ کار اور ڈیٹا کی آلودگی
- جانچ کے معیار کا فقدان۔ مختلف تیار کنندگان مختلف prompts اور few-shot طریقے استعمال کر سکتے ہیں، جس سے ماڈلز کے نتائج کا براہِ راست موازنہ مشکل ہو جاتا ہے۔
- ڈیٹا کی آلودگی (data contamination)۔ عوامی benchmarks کے سوالات اور جوابات کے LLM کی تربیتی مجموعوں میں شامل ہونے کا خطرہ موجود ہے۔ ایسی صورت میں ماڈل درحقیقت درست جوابات "جانتا" ہے، جس سے جانچ غیر منصفانہ ہو جاتی ہے[3]۔
ماخوذ نسخے اور توسیعات
اصل MMLU کے مسائل حل کرنے کے لیے اس کی کئی اقسام تیار کی گئی ہیں۔
- MMLU-Redux۔ مجموعے کا ایک درست شدہ اور بہتر نسخہ جو جون 2024 میں پیش کیا گیا۔ اس میں 30 زمروں سے 3000 دوبارہ لیبل کیے گئے سوالات شامل ہیں اور اس کا مقصد ڈیٹا کی غلطیوں سے پیدا ہونے والی تحریفات کے بغیر ماڈلز کی زیادہ قابلِ اعتماد جانچ کرنا ہے[4]۔
- MMLU-Pro۔ ٹیسٹ کا ایک توسیع شدہ اور پیچیدہ تر نسخہ جو 2024 کے آخر میں پیش کیا گیا۔ اس میں 12,000 سے زیادہ سوالات ہیں اور ہر سوال کے لیے چار کی بجائے 10 جوابی اختیارات دیے گئے ہیں۔ اس سے اتفاقی اندازے کا امکان 10% تک کم ہو جاتا ہے۔ سوالات کو ماہرین نے جانچا ہے اور ان میں مزید مشکل ذرائع سے نئے سوالات شامل کیے گئے ہیں[5]۔
- MMMLU (Multilingual MMLU)۔ کثیر لسانی نسخہ جو OpenAI نے 2023 میں جاری کیا۔ پورے MMLU مجموعے کو پیشہ ور مترجمین نے 14 زبانوں میں ترجمہ کیا، جن میں عام زبانیں (ہسپانوی، چینی، روسی) اور کم وسائل والی زبانیں (مثلاً یوروبا) دونوں شامل ہیں۔ اس سے مختلف زبانوں میں ماڈلز کی صلاحیتوں کا جائزہ لینا اور موازنہ کرنا ممکن ہوتا ہے[6]۔
روابط
- MMLU کا GitHub پر سرکاری ذخیرہ
- Papers with Code پر ماڈلز کے نتائج کے ساتھ MMLU صفحہ
کتابیات
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
حواشی
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]