MMLU Benchmark (FA)
MMLU (مخفف Measuring Massive Multitask Language Understanding) — یک مجموعه ارزیابی استاندارد (benchmark) است که برای سنجش تواناییهای مدلهای زبانی بزرگ (LLM) در طیف گستردهای از حوزههای موضوعی طراحی شده است. این benchmark در سال ۲۰۲۰ توسط تیمی از پژوهشگران به سرپرستی دن هندریکس (Dan Hendrycks) از UC Berkeley توسعه یافت و در سال ۲۰۲۱ در کنفرانس ICLR منتشر شد[1].
هدف MMLU این است که بسنجد مدل تا چه اندازه دانش و مهارتهای متنوعی را که در مرحله پیشآموزش کسب کرده، در قالب آزمایش بدون نمونه یا چند نمونه (zero/few-shot) و بدون تنظیم دقیق اضافی جذب کرده است. MMLU به عنوان جایگزینی دشوارتر برای آزمونهای پیشین (مانند GLUE و SuperGLUE) ساخته شد که بسیاری از مدلها تا سال ۲۰۲۰ در آنها به سطح انسانی رسیده بودند[2].
توضیحات و محتوا
MMML از ۱۵٬۹۰۸ سؤال چندگزینهای تشکیل شده که ۵۷ رشته مختلف را پوشش میدهد. موضوعات شامل موارد زیر است:
- رشتههای STEM (ریاضیات، فیزیک، زیستشناسی، علوم کامپیوتر).
- علوم انسانی و اجتماعی (تاریخ، ادبیات، حقوق، مدیریت).
- حوزههای کاربردی و حرفهای (پزشکی، حقوق، کسبوکار)[1].
دامنه دشواری از سطح دبستان تا سطح حرفهای پیشرفته متغیر است. سؤالات بر اساس مواد امتحانی واقعی مدارس، دانشگاهها و آزمونهای حرفهای مانند GRE و USMLE تهیه شدهاند[1]. قالب سؤالات به این صورت است که برای هر سؤال چهار گزینه وجود دارد، به این معنا که در صورت انتخاب تصادفی، دقت ۲۵٪ خواهد بود. برای کسب نتیجه بالا، مدل باید دانش دایرةالمعارفی گسترده و توانایی استدلال داشته باشد.
نتایج و پیشرفت
هنگام انتشار MMLU در سال ۲۰۲۰، اکثر LLMها نتایجی تنها اندکی بالاتر از حدس تصادفی نشان میدادند. بهترین نتیجه را مدل GPT-3 (با ۱۷۵ میلیارد پارامتر) با کسب ~۴۳٫۹٪ پاسخ صحیح به دست آورد. در مقایسه، یک متخصص انسانی به طور متوسط به ~۹۰٪ میرسید[1]. این شکاف، دشواری و استانداردهای بالای benchmark جدید را تأیید کرد.
با گذشت زمان، MMLU به یکی از محبوبترین آزمونها برای LLMها تبدیل شد و جایگاه «استاندارد طلایی» را در گزارشهای شرکتهای پیشرو AI به دست آورد[3]. تا سالهای ۲۰۲۳ تا ۲۰۲۴، جدیدترین مدلها از جمله GPT-4، Gemini Ultra از Google و Claude 3.5 از Anthropic به سطح انسانی نزدیک شدند و به دقتی در حدود ~۸۵-۹۰٪ دست یافتند[2][3].
پیشرفت سریع به «اشباع» تدریجی benchmark منجر شد: مدلهای پیشرو شروع به کسب امتیازاتی نزدیک به حداکثر کردند، که توانایی MMLU در تمایز قابلیتهای فکری آنها را کاهش داد. این موضوع جامعه پژوهشی را به سمت توسعه آزمونهای جدید و دشوارتر سوق داد[3].
محدودیتها و انتقادات
علیرغم گسترش گسترده، MMLU دارای تعدادی محدودیت قابل توجه است.
کیفیت و صحت دادهها
در ژوئن ۲۰۲۴، پژوهشگران تحلیل دستی نمونهای از ۵۷۰۰ سؤال MMLU انجام دادند و تعداد قابل توجهی خطا یافتند[4].
- حدود ۶٫۵٪ از تمام سؤالات MMLU دارای خطا در برچسبگذاری یا صورتبندی هستند.
- در برخی دستهها، نسبت سؤالات نادرست بسیار بالا است. برای مثال، در بخش «ویروسشناسی» ۵۷٪ از سؤالات دارای خطا بودند (چندین پاسخ صحیح، صورتبندی نادرست یا پاسخ مرجع اشتباه).
این بدان معناست که حتی یک مدل ایدهآل نمیتواند در dataset اصلی به ۱۰۰٪ دست یابد، و بخشی از بهبودهای معیارها ممکن است به حفظ خطاهای سیستماتیک مجموعه توسط مدل مربوط باشد[4].
روش ارزیابی و نشت دادهها
- فقدان استاندارد آزمایش. توسعهدهندگان مختلف ممکن است از promptهای متفاوت و حالتهای مختلف few-shot استفاده کنند، که مقایسه مستقیم نتایج مدلها را دشوار میسازد.
- نشت دادهها (data contamination). خطر وارد شدن سؤالات و پاسخهای benchmarkهای عمومی به مجموعههای آموزشی LLMها وجود دارد. در این صورت، مدل در واقع پاسخهای صحیح را «میداند»، که ارزیابی را ناعادلانه میکند[3].
نسخههای مشتق و توسعهها
برای رفع مشکلات MMLU اصلی، چند نوع از آن ایجاد شده است.
- MMLU-Redux. نسخه اصلاحشده و بازبینیشده مجموعه که در ژوئن ۲۰۲۴ معرفی شد. این نسخه شامل ۳۰۰۰ سؤال بازبرچسبگذاریشده از ۳۰ دسته است و برای ارزیابی قابلاعتمادتر مدلها بدون اعوجاج ناشی از خطاهای داده طراحی شده است[4].
- MMLU-Pro. نوع توسعهیافته و دشوارتر آزمون که در اواخر ۲۰۲۴ معرفی شد. این نسخه بیش از ۱۲٬۰۰۰ سؤال دارد که برای هر کدام ۱۰ گزینه پاسخ به جای چهار گزینه ارائه میشود. این کار احتمال حدس تصادفی را به ۱۰٪ کاهش میدهد. سؤالات توسط متخصصان بررسی شده و شامل تکالیف جدیدی از منابع دشوارتر هستند[5].
- MMMLU (Multilingual MMLU). نسخه چندزبانه که توسط OpenAI در سال ۲۰۲۳ منتشر شد. کل مجموعه MMLU توسط مترجمان حرفهای به ۱۴ زبان ترجمه شد، از جمله زبانهای پرکاربرد (اسپانیایی، چینی، روسی) و کممنبع (مثلاً یوروبا). این امر امکان ارزیابی و مقایسه قابلیتهای مدلها در زبانهای مختلف را فراهم میکند[6].
پیوندها
- مخزن رسمی MMLU در GitHub
- صفحه MMLU در Papers with Code همراه با نتایج مدلها
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [۱]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [۲]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [۳]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [۴]
- ↑ «MMLU Pro». Vals.ai, 2025. [۵]
- ↑ «openai/MMMLU». Hugging Face Datasets. [۶]