MMLU Benchmark (BG)
MMLU (съкращение от Measuring Massive Multitask Language Understanding) — това е еталонен набор от задачи (benchmark), предназначен за оценка на способностите на големите езикови модели (LLM) в широк кръг от предметни области. Бенчмаркът е разработен през 2020 година от екип изследователи под ръководството на Дан Хендрикс (Dan Hendrycks) от UC Berkeley и публикуван на конференцията ICLR през 2021 година[1].
Целта на MMLU е да провери доколко моделът усвоява разнообразни знания и умения, придобити на етапа на предобучение, чрез тестване в режим на нулеви или няколко примера (zero/few-shot) без допълнително финно настройване. MMLU е създаден като по-сложна алтернатива на съществувалите преди това тестове (като GLUE и SuperGLUE), при които много модели до 2020 година вече бяха достигнали човешкото ниво[2].
Описание и съдържание
MMLL се състои от 15 908 въпроса с множествен избор на отговор, обхващащи 57 различни дисциплини. Тематиката на задачите включва:
- Предмети от направление STEM (математика, физика, биология, информатика).
- Хуманитарни и социални науки (история, литература, право, управление).
- Приложни и професионални области (медицина, юриспруденция, бизнес)[1].
Диапазонът на сложност варира от ниво на начално училище до напреднало професионално ниво. Въпросите се основават на реални изпитни материали за училища, университети и професионални тестове, като GRE и USMLE[1]. Форматът на задачите е четири варианта на отговор за всеки въпрос, което означава, че при случаен избор точността е 25%. За постигане на висок резултат моделът трябва да притежава обширни енциклопедични знания и способност за разсъждение.
Резултати и развитие
При публикуването на MMLU през 2020 година повечето LLM показваха резултати едва малко над случайното познаване. Най-добър резултат демонстрира моделът GPT-3 (175 млрд. параметри), постигайки ~43,9% верни отговори. За сравнение, човек-експерт средно достигаше ~90%[1]. Тази разлика потвърди сложността и високата планка на новия бенчмарк.
С течение на времето MMLU се превърна в един от най-популярните тестове за LLM, придобивайки статут на „златен стандарт" в отчетите на водещите AI компании[3]. До 2023–2024 година най-новите модели, като GPT-4, Gemini Ultra от Google и Claude 3.5 от Anthropic, се приближиха до човешкото ниво, достигайки ~85–90% точност[2][3].
Бързият напредък доведе до постепенно „насищане" на бенчмарка: водещите модели започнаха да постигат оценки близки до максималните, което намали способността на MMLU да разграничава техните интелектуални възможности. Това стимулира общността към разработване на нови, по-трудни тестове[3].
Ограничения и критика
Въпреки широкото си разпространение, MMLU има редица съществени ограничения.
Качество и коректност на данните
През юни 2024 година изследователи извършиха ръчен анализ на извадка от 5700 въпроса от MMLU и установиха значителен брой грешки[4].
- Около 6,5% от всички въпроси в MMLU съдържат грешки в анотацията или формулировките.
- В отделни категории делът на некоректните задачи е много висок. Например, в раздела „Вирусология\" 57% от задачите съдържаха грешки (няколко верни отговора, некоректни формулировки или неправилно посочен еталонен отговор).
Това означава, че дори идеален модел не може да постигне 100% на оригиналния dataset, а част от подобренията в метриките може да е свързана с запомнянето от модела на систематичните грешки в набора[4].
Методика на оценяване и изтичане на данни
- Липса на стандарт за тестване. Различни разработчици могат да използват различни prompt-ове и режими few-shot, което затруднява прякото сравнение на резултатите на моделите.
- Изтичане на данни (data contamination). Съществува риск въпросите и отговорите от публичните бенчмаркове да попаднат в обучителните извадки на LLM. В такъв случай моделът фактически „знае\" верните отговори, което прави оценяването нечестно[3].
Производни версии и разширения
За решаване на проблемите на оригиналния MMLU бяха създадени няколко негови варианта.
- MMLU-Redux. Поправена и прецизирана версия на набора, представена през юни 2024 година. Тя включва 3000 преанотирани въпроса от 30 категории и е предназначена за по-надеждно оценяване на моделите без изкривявания, причинени от грешки в данните[4].
- MMLU-Pro. Разширен и усложнен вариант на теста, представен в края на 2024 година. Той съдържа над 12 000 въпроса, за всеки от които се предлагат 10 варианта на отговор вместо четири. Това намалява вероятността за случайно познаване до 10%. Въпросите са преминали проверка от експерти и включват нови задачи от по-сложни източници[5].
- MMMLU (Multilingual MMLU). Многоезична версия, издадена от OpenAI през 2023 година. Целият набор MMLU е преведен от професионални преводачи на 14 езика, включително широко разпространени (испански, китайски, руски), така и нискоресурсни (например йоруба). Това позволява да се оценяват и сравняват възможностите на моделите на различни езици[6].
Препратки
- Официално хранилище на MMLU в GitHub
- Страница на MMLU в Papers with Code с резултатите на моделите
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]