MMLU Benchmark (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (مخفف Measuring Massive Multitask Language Understanding) — یک مجموعه ارزیابی استاندارد (benchmark) است که برای سنجش توانایی‌های مدل‌های زبانی بزرگ (LLM) در طیف گسترده‌ای از حوزه‌های موضوعی طراحی شده است. این benchmark در سال ۲۰۲۰ توسط تیمی از پژوهشگران به سرپرستی دن هندریکس (Dan Hendrycks) از UC Berkeley توسعه یافت و در سال ۲۰۲۱ در کنفرانس ICLR منتشر شد[1].

هدف MMLU این است که بسنجد مدل تا چه اندازه دانش و مهارت‌های متنوعی را که در مرحله پیش‌آموزش کسب کرده، در قالب آزمایش بدون نمونه یا چند نمونه (zero/few-shot) و بدون تنظیم دقیق اضافی جذب کرده است. MMLU به عنوان جایگزینی دشوارتر برای آزمون‌های پیشین (مانند GLUE و SuperGLUE) ساخته شد که بسیاری از مدل‌ها تا سال ۲۰۲۰ در آن‌ها به سطح انسانی رسیده بودند[2].

توضیحات و محتوا

MMML از ۱۵٬۹۰۸ سؤال چندگزینه‌ای تشکیل شده که ۵۷ رشته مختلف را پوشش می‌دهد. موضوعات شامل موارد زیر است:

  • رشته‌های STEM (ریاضیات، فیزیک، زیست‌شناسی، علوم کامپیوتر).
  • علوم انسانی و اجتماعی (تاریخ، ادبیات، حقوق، مدیریت).
  • حوزه‌های کاربردی و حرفه‌ای (پزشکی، حقوق، کسب‌وکار)[1].

دامنه دشواری از سطح دبستان تا سطح حرفه‌ای پیشرفته متغیر است. سؤالات بر اساس مواد امتحانی واقعی مدارس، دانشگاه‌ها و آزمون‌های حرفه‌ای مانند GRE و USMLE تهیه شده‌اند[1]. قالب سؤالات به این صورت است که برای هر سؤال چهار گزینه وجود دارد، به این معنا که در صورت انتخاب تصادفی، دقت ۲۵٪ خواهد بود. برای کسب نتیجه بالا، مدل باید دانش دایرة‌المعارفی گسترده و توانایی استدلال داشته باشد.

نتایج و پیشرفت

هنگام انتشار MMLU در سال ۲۰۲۰، اکثر LLM‌ها نتایجی تنها اندکی بالاتر از حدس تصادفی نشان می‌دادند. بهترین نتیجه را مدل GPT-3 (با ۱۷۵ میلیارد پارامتر) با کسب ~۴۳٫۹٪ پاسخ صحیح به دست آورد. در مقایسه، یک متخصص انسانی به طور متوسط به ~۹۰٪ می‌رسید[1]. این شکاف، دشواری و استانداردهای بالای benchmark جدید را تأیید کرد.

با گذشت زمان، MMLU به یکی از محبوب‌ترین آزمون‌ها برای LLM‌ها تبدیل شد و جایگاه «استاندارد طلایی» را در گزارش‌های شرکت‌های پیشرو AI به دست آورد[3]. تا سال‌های ۲۰۲۳ تا ۲۰۲۴، جدیدترین مدل‌ها از جمله GPT-4، Gemini Ultra از Google و Claude 3.5 از Anthropic به سطح انسانی نزدیک شدند و به دقتی در حدود ~۸۵-۹۰٪ دست یافتند[2][3].

پیشرفت سریع به «اشباع» تدریجی benchmark منجر شد: مدل‌های پیشرو شروع به کسب امتیازاتی نزدیک به حداکثر کردند، که توانایی MMLU در تمایز قابلیت‌های فکری آن‌ها را کاهش داد. این موضوع جامعه پژوهشی را به سمت توسعه آزمون‌های جدید و دشوارتر سوق داد[3].

محدودیت‌ها و انتقادات

علی‌رغم گسترش گسترده، MMLU دارای تعدادی محدودیت قابل توجه است.

کیفیت و صحت داده‌ها

در ژوئن ۲۰۲۴، پژوهشگران تحلیل دستی نمونه‌ای از ۵۷۰۰ سؤال MMLU انجام دادند و تعداد قابل توجهی خطا یافتند[4].

  • حدود ۶٫۵٪ از تمام سؤالات MMLU دارای خطا در برچسب‌گذاری یا صورت‌بندی هستند.
  • در برخی دسته‌ها، نسبت سؤالات نادرست بسیار بالا است. برای مثال، در بخش «ویروس‌شناسی» ۵۷٪ از سؤالات دارای خطا بودند (چندین پاسخ صحیح، صورت‌بندی نادرست یا پاسخ مرجع اشتباه).

این بدان معناست که حتی یک مدل ایده‌آل نمی‌تواند در dataset اصلی به ۱۰۰٪ دست یابد، و بخشی از بهبودهای معیارها ممکن است به حفظ خطاهای سیستماتیک مجموعه توسط مدل مربوط باشد[4].

روش ارزیابی و نشت داده‌ها

  • فقدان استاندارد آزمایش. توسعه‌دهندگان مختلف ممکن است از promptهای متفاوت و حالت‌های مختلف few-shot استفاده کنند، که مقایسه مستقیم نتایج مدل‌ها را دشوار می‌سازد.
  • نشت داده‌ها (data contamination). خطر وارد شدن سؤالات و پاسخ‌های benchmark‌های عمومی به مجموعه‌های آموزشی LLM‌ها وجود دارد. در این صورت، مدل در واقع پاسخ‌های صحیح را «می‌داند»، که ارزیابی را ناعادلانه می‌کند[3].

نسخه‌های مشتق و توسعه‌ها

برای رفع مشکلات MMLU اصلی، چند نوع از آن ایجاد شده است.

  • MMLU-Redux. نسخه اصلاح‌شده و بازبینی‌شده مجموعه که در ژوئن ۲۰۲۴ معرفی شد. این نسخه شامل ۳۰۰۰ سؤال بازبرچسب‌گذاری‌شده از ۳۰ دسته است و برای ارزیابی قابل‌اعتمادتر مدل‌ها بدون اعوجاج ناشی از خطاهای داده طراحی شده است[4].
  • MMLU-Pro. نوع توسعه‌یافته و دشوارتر آزمون که در اواخر ۲۰۲۴ معرفی شد. این نسخه بیش از ۱۲٬۰۰۰ سؤال دارد که برای هر کدام ۱۰ گزینه پاسخ به جای چهار گزینه ارائه می‌شود. این کار احتمال حدس تصادفی را به ۱۰٪ کاهش می‌دهد. سؤالات توسط متخصصان بررسی شده و شامل تکالیف جدیدی از منابع دشوارتر هستند[5].
  • MMMLU (Multilingual MMLU). نسخه چندزبانه که توسط OpenAI در سال ۲۰۲۳ منتشر شد. کل مجموعه MMLU توسط مترجمان حرفه‌ای به ۱۴ زبان ترجمه شد، از جمله زبان‌های پرکاربرد (اسپانیایی، چینی، روسی) و کم‌منبع (مثلاً یوروبا). این امر امکان ارزیابی و مقایسه قابلیت‌های مدل‌ها در زبان‌های مختلف را فراهم می‌کند[6].

پیوندها

  • مخزن رسمی MMLU در GitHub
  • صفحه MMLU در Papers with Code همراه با نتایج مدل‌ها

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [۱]
  2. 2.0 2.1 «MMLU». In Wikipedia. [۲]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [۳]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [۴]
  5. «MMLU Pro». Vals.ai, 2025. [۵]
  6. «openai/MMMLU». Hugging Face Datasets. [۶]