MMLU Benchmark (HU)
MMLU (a Measuring Massive Multitask Language Understanding rövidítése) — egy etalon feladatgyűjtemény (benchmark), amelyet a nagy nyelvi modellek (LLM) képességeinek széles szakterületi körben való értékelésére terveztek. A benchmarkot 2020-ban fejlesztette ki Dan Hendrycks (Dan Hendrycks) vezetésével egy kutatói csapat a UC Berkeley egyetemről, és 2021-ben az ICLR konferencián publikálták[1].
Az MMLU célja annak vizsgálata, hogy a modell mennyire sajátítja el az előtanítás során szerzett sokrétű tudást és készségeket, nulla példás vagy kevés példás (zero/few-shot) tesztelési módban, további finomhangolás nélkül. Az MMLU-t a korábban létező tesztek (mint a GLUE és a SuperGLUE) nehezebb alternatívájaként hozták létre, amelyeken 2020-ra már számos modell elérte az emberi szintet[2].
Leírás és tartalom
Az MMLU 15 908 feleletválasztós kérdésből áll, amelyek 57 különböző tudományterületet ölelnek fel. A feladatok témái a következőket tartalmazzák:
- STEM irányú tantárgyak (matematika, fizika, biológia, informatika).
- Bölcsészet- és társadalomtudományok (történelem, irodalom, jog, közigazgatás).
- Alkalmazott és szakmai területek (orvostudomány, jogtudomány, üzleti élet)[1].
A nehézségi szint az általános iskolai szinttől a haladó szakmai szintig terjed. A kérdések valódi vizsgaanyagokon alapulnak, amelyek iskolák, főiskolák és szakmai tesztek számára készültek, például a GRE és az USMLE számára[1]. A feladatok formátuma négy válaszlehetőséget kínál minden kérdéshez, ami azt jelenti, hogy véletlenszerű választás esetén a pontosság 25%. A magas eredmény eléréséhez a modellnek kiterjedt enciklopédikus tudással és következtetési képességgel kell rendelkeznie.
Eredmények és fejlődés
Az MMLU 2020-as megjelenésekor a legtöbb LLM csak alig valamivel a véletlenszerű találgatás fölötti eredményt ért el. A legjobb eredményt a GPT-3 modell (175 milliárd paraméter) mutatta, ~43,9%-os helyes választ érve el. Összehasonlításképpen, a szakértő ember átlagosan ~90%-ot ért el[1]. Ez a különbség megerősítette az új benchmark összetettségét és magas mércéjét.
Az idő múlásával az MMLU az LLM-ek egyik legnépszerűbb tesztjévé vált, és a vezető AI-vállalatok jelentéseiben „arany standard" státuszt kapott[3]. 2023–2024-re az újabb modellek, mint a GPT-4, a Google Gemini Ultra és az Anthropic Claude 3.5, megközelítették az emberi szintet, ~85–90%-os pontosságot érve el[2][3].
A gyors előrehaladás a benchmark fokozatos „telítődéséhez\" vezetett: a vezető modellek már a maximálishoz közeli pontszámokat értek el, ami csökkentette az MMLU azon képességét, hogy megkülönböztesse a modellek intellektuális lehetőségeit. Ez arra ösztönözte a szakmai közösséget, hogy új, nehezebb teszteket dolgozzon ki[3].
Korlátok és kritika
A széles körű elterjedtség ellenére az MMLU-nak számos lényeges korlátja van.
Adatminőség és helyesség
2024 júniusában kutatók kézi elemzést végeztek az MMLU 5700 kérdéséből álló mintán, és jelentős számú hibát fedeztek fel[4].
- Az összes MMLU-kérdés körülbelül 6,5%-a annotálási vagy megfogalmazási hibát tartalmaz.
- Egyes kategóriákban a helytelen feladatok aránya nagyon magas. Például a „Virológia" szekcióban a feladatok 57%-a tartalmazott hibát (több helyes válasz, helytelen megfogalmazás vagy tévesen megjelölt etalonválasz).
Ez azt jelenti, hogy még egy tökéletes modell sem képes 100%-ot elérni az eredeti dataseten, és a metrikák javulásának egy része összefügghet azzal, hogy a modell a gyűjtemény szisztematikus hibáit memorizálja[4].
Értékelési módszertan és adatszennyezés
- Az értékelési standard hiánya. A különböző fejlesztők különböző promptokat és few-shot módokat alkalmazhatnak, ami megnehezíti a modellek eredményeinek közvetlen összehasonlítását.
- Adatszennyezés (data contamination). Fennáll annak kockázata, hogy a nyilvános benchmarkok kérdései és válaszai bekerülnek az LLM-ek tanítóhalmazaiba. Ebben az esetben a modell lényegében „tudja" a helyes válaszokat, ami igazságtalanná teszi az értékelést[3].
Származtatott verziók és bővítések
Az eredeti MMLU problémáinak megoldására több változatát is létrehozták.
- MMLU-Redux. A gyűjtemény javított és pontosított verziója, amelyet 2024 júniusában mutattak be. Tartalmaz 3000, 30 kategóriában újracímkézett kérdést, és megbízhatóbb modellértékelésre szolgál az adathibák okozta torzítások nélkül[4].
- MMLU-Pro. A teszt bővített és nehezített változata, amelyet 2024 végén mutattak be. Több mint 12 000 kérdést tartalmaz, amelyekhez négy helyett 10 válaszlehetőség tartozik. Ez a véletlenszerű találgatás valószínűségét 10%-ra csökkenti. A kérdések szakértői ellenőrzésen estek át, és nehezebb forrásokból származó új feladatokat is tartalmaznak[5].
- MMMLU (Multilingual MMLU). Az OpenAI által 2023-ban kiadott többnyelvű verzió. A teljes MMLU-gyűjteményt szakmai fordítók 14 nyelvre fordították le, köztük elterjedt (spanyol, kínai, orosz) és alacsony erőforrású (például joruba) nyelvekre is. Ez lehetővé teszi a modellek képességeinek értékelését és összehasonlítását különböző nyelveken[6].
Hivatkozások
- Az MMLU hivatalos GitHub-tárhelye
- Az MMLU oldala a Papers with Code oldalon, a modellek eredményeivel
Irodalom
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Jegyzetek
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]