MMLU Benchmark (PL)
MMLU (skrót od Measuring Massive Multitask Language Understanding) — to wzorcowy zestaw zadań (benchmark) przeznaczony do oceny zdolności dużych modeli językowych (LLM) w szerokim zakresie dziedzin przedmiotowych. Benchmark został opracowany w 2020 roku przez zespół badaczy pod kierownictwem Dana Hendrycksa (Dan Hendrycks) z UC Berkeley i opublikowany na konferencji ICLR w 2021 roku[1].
Celem MMLU jest sprawdzenie, w jakim stopniu model przyswaja różnorodną wiedzę i umiejętności zdobyte na etapie wstępnego uczenia, poprzez testowanie w trybie zero-shot lub few-shot bez dodatkowego fine-tuningu. MMLU został stworzony jako trudniejsza alternatywa dla wcześniej istniejących testów (takich jak GLUE i SuperGLUE), na których wiele modeli do 2020 roku osiągnęło już poziom człowieka[2].
Opis i zawartość
MMLL składa się z 15 908 pytań wielokrotnego wyboru, obejmujących 57 różnych dyscyplin. Tematyka zadań obejmuje:
- Przedmioty kierunku STEM (matematyka, fizyka, biologia, informatyka).
- Nauki humanistyczne i społeczne (historia, literatura, prawo, zarządzanie).
- Dziedziny stosowane i zawodowe (medycyna, prawo, biznes)[1].
Zakres trudności waha się od poziomu szkoły podstawowej do zaawansowanego poziomu zawodowego. Pytania oparte są na rzeczywistych materiałach egzaminacyjnych dla szkół, uczelni wyższych oraz profesjonalnych testów, takich jak GRE i USMLE[1]. Format zadań to cztery warianty odpowiedzi na każde pytanie, co oznacza, że przy losowym wyborze dokładność wynosi 25%. Aby osiągnąć wysoki wynik, model musi dysponować rozległą wiedzą encyklopedyczną oraz zdolnością do rozumowania.
Wyniki i rozwój
W momencie wydania MMLU w 2020 roku większość LLM osiągała wyniki jedynie nieznacznie wyższe od losowego zgadywania. Najlepszy wynik uzyskał model GPT-3 (175 mld parametrów), osiągając ~43,9% poprawnych odpowiedzi. Dla porównania, ekspert-człowiek osiągał średnio ~90%[1]. Ta różnica potwierdziła trudność i wysoką poprzeczkę nowego benchmarku.
Z czasem MMLU stał się jednym z najpopularniejszych testów dla LLM, uzyskując status „złotego standardu" w raportach czołowych firm z branży AI[3]. Do lat 2023–2024 najnowsze modele, takie jak GPT-4, Gemini Ultra od Google i Claude 3.5 od Anthropic, zbliżyły się do poziomu człowieka, osiągając ~85–90% dokładności[2][3].
Szybki postęp doprowadził do stopniowego „nasycenia" benchmarku: czołowe modele zaczęły osiągać wyniki bliskie maksymalnym, co obniżyło zdolność MMLU do różnicowania ich możliwości intelektualnych. To skłoniło środowisko do opracowania nowych, trudniejszych testów[3].
Ograniczenia i krytyka
Pomimo szerokiego rozpowszechnienia MMLU ma szereg istotnych ograniczeń.
Jakość i poprawność danych
W czerwcu 2024 roku badacze przeprowadzili ręczną analizę próby 5700 pytań MMLU i odkryli znaczną liczbę błędów[4].
- Około 6,5% wszystkich pytań MMLU zawiera błędy w adnotacjach lub sformułowaniach.
- W poszczególnych kategoriach odsetek niepoprawnych zadań jest bardzo wysoki. Na przykład w sekcji „Wirusologia\" 57% zadań zawierało błędy (kilka poprawnych odpowiedzi, nieprawidłowe sformułowania lub błędnie wskazana odpowiedź wzorcowa).
Oznacza to, że nawet doskonały model nie może uzyskać 100% na oryginalnym datasecie, a część poprawy wyników może być związana z zapamiętywaniem przez model systematycznych błędów zbioru[4].
Metodyka oceny i wyciek danych
- Brak standardu testowania. Różni twórcy mogą stosować różne prompty i tryby few-shot, co utrudnia bezpośrednie porównywanie wyników modeli.
- Wyciek danych (data contamination). Istnieje ryzyko przedostania się pytań i odpowiedzi z publicznych benchmarków do zbiorów treningowych LLM. W takim przypadku model faktycznie „zna" poprawne odpowiedzi, co sprawia, że ocena staje się nierzetelna[3].
Pochodne wersje i rozszerzenia
Aby rozwiązać problemy oryginalnego MMLU, powstało kilka jego wariantów.
- MMLU-Redux. Poprawiona i doprecyzowana wersja zestawu, przedstawiona w czerwcu 2024 roku. Zawiera 3000 ponownie opatrzonych adnotacjami pytań z 30 kategorii i jest przeznaczona do bardziej wiarygodnej oceny modeli bez zniekształceń wywołanych błędami w danych[4].
- MMLU-Pro. Rozbudowany i trudniejszy wariant testu, przedstawiony pod koniec 2024 roku. Zawiera ponad 12 000 pytań, na każde z nich podawanych jest 10 wariantów odpowiedzi zamiast czterech. Obniża to prawdopodobieństwo losowego zgadywania do 10%. Pytania zostały zweryfikowane przez ekspertów i obejmują nowe zadania z trudniejszych źródeł[5].
- MMMLU (Multilingual MMLU). Wielojęzyczna wersja wydana przez OpenAI w 2023 roku. Cały zestaw MMLU został przetłumaczony przez profesjonalnych tłumaczy na 14 języków, w tym zarówno powszechne (hiszpański, chiński, rosyjski), jak i niskozasobowe (na przykład joruba). Pozwala to oceniać i porównywać możliwości modeli w różnych językach[6].
Odnośniki
- Oficjalne repozytorium MMLU na GitHub
- Strona MMLU na Papers with Code z wynikami modeli
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Przypisy
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]