MMLU Benchmark (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (съкращение от Measuring Massive Multitask Language Understanding) — това е еталонен набор от задачи (benchmark), предназначен за оценка на способностите на големите езикови модели (LLM) в широк кръг от предметни области. Бенчмаркът е разработен през 2020 година от екип изследователи под ръководството на Дан Хендрикс (Dan Hendrycks) от UC Berkeley и публикуван на конференцията ICLR през 2021 година[1].

Целта на MMLU е да провери доколко моделът усвоява разнообразни знания и умения, придобити на етапа на предобучение, чрез тестване в режим на нулеви или няколко примера (zero/few-shot) без допълнително финно настройване. MMLU е създаден като по-сложна алтернатива на съществувалите преди това тестове (като GLUE и SuperGLUE), при които много модели до 2020 година вече бяха достигнали човешкото ниво[2].

Описание и съдържание

MMLL се състои от 15 908 въпроса с множествен избор на отговор, обхващащи 57 различни дисциплини. Тематиката на задачите включва:

  • Предмети от направление STEM (математика, физика, биология, информатика).
  • Хуманитарни и социални науки (история, литература, право, управление).
  • Приложни и професионални области (медицина, юриспруденция, бизнес)[1].

Диапазонът на сложност варира от ниво на начално училище до напреднало професионално ниво. Въпросите се основават на реални изпитни материали за училища, университети и професионални тестове, като GRE и USMLE[1]. Форматът на задачите е четири варианта на отговор за всеки въпрос, което означава, че при случаен избор точността е 25%. За постигане на висок резултат моделът трябва да притежава обширни енциклопедични знания и способност за разсъждение.

Резултати и развитие

При публикуването на MMLU през 2020 година повечето LLM показваха резултати едва малко над случайното познаване. Най-добър резултат демонстрира моделът GPT-3 (175 млрд. параметри), постигайки ~43,9% верни отговори. За сравнение, човек-експерт средно достигаше ~90%[1]. Тази разлика потвърди сложността и високата планка на новия бенчмарк.

С течение на времето MMLU се превърна в един от най-популярните тестове за LLM, придобивайки статут на „златен стандарт" в отчетите на водещите AI компании[3]. До 2023–2024 година най-новите модели, като GPT-4, Gemini Ultra от Google и Claude 3.5 от Anthropic, се приближиха до човешкото ниво, достигайки ~85–90% точност[2][3].

Бързият напредък доведе до постепенно „насищане" на бенчмарка: водещите модели започнаха да постигат оценки близки до максималните, което намали способността на MMLU да разграничава техните интелектуални възможности. Това стимулира общността към разработване на нови, по-трудни тестове[3].

Ограничения и критика

Въпреки широкото си разпространение, MMLU има редица съществени ограничения.

Качество и коректност на данните

През юни 2024 година изследователи извършиха ръчен анализ на извадка от 5700 въпроса от MMLU и установиха значителен брой грешки[4].

  • Около 6,5% от всички въпроси в MMLU съдържат грешки в анотацията или формулировките.
  • В отделни категории делът на некоректните задачи е много висок. Например, в раздела „Вирусология\" 57% от задачите съдържаха грешки (няколко верни отговора, некоректни формулировки или неправилно посочен еталонен отговор).

Това означава, че дори идеален модел не може да постигне 100% на оригиналния dataset, а част от подобренията в метриките може да е свързана с запомнянето от модела на систематичните грешки в набора[4].

Методика на оценяване и изтичане на данни

  • Липса на стандарт за тестване. Различни разработчици могат да използват различни prompt-ове и режими few-shot, което затруднява прякото сравнение на резултатите на моделите.
  • Изтичане на данни (data contamination). Съществува риск въпросите и отговорите от публичните бенчмаркове да попаднат в обучителните извадки на LLM. В такъв случай моделът фактически „знае\" верните отговори, което прави оценяването нечестно[3].

Производни версии и разширения

За решаване на проблемите на оригиналния MMLU бяха създадени няколко негови варианта.

  • MMLU-Redux. Поправена и прецизирана версия на набора, представена през юни 2024 година. Тя включва 3000 преанотирани въпроса от 30 категории и е предназначена за по-надеждно оценяване на моделите без изкривявания, причинени от грешки в данните[4].
  • MMLU-Pro. Разширен и усложнен вариант на теста, представен в края на 2024 година. Той съдържа над 12 000 въпроса, за всеки от които се предлагат 10 варианта на отговор вместо четири. Това намалява вероятността за случайно познаване до 10%. Въпросите са преминали проверка от експерти и включват нови задачи от по-сложни източници[5].
  • MMMLU (Multilingual MMLU). Многоезична версия, издадена от OpenAI през 2023 година. Целият набор MMLU е преведен от професионални преводачи на 14 езика, включително широко разпространени (испански, китайски, руски), така и нискоресурсни (например йоруба). Това позволява да се оценяват и сравняват възможностите на моделите на различни езици[6].

Препратки

  • Официално хранилище на MMLU в GitHub
  • Страница на MMLU в Papers with Code с резултатите на моделите

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


Бележки

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]