MMLU Benchmark (RO)
MMLU (abreviere de la Measuring Massive Multitask Language Understanding) — este un set de referință de sarcini (benchmark), destinat evaluării capacităților modelelor lingvistice de mari dimensiuni (LLM) într-o gamă largă de domenii tematice. Benchmark-ul a fost dezvoltat în 2020 de o echipă de cercetători condusă de Dan Hendrycks din UC Berkeley și publicat la conferința ICLR în 2021[1].
Scopul MMLU este de a verifica în ce măsură un model asimilează cunoștințe și abilități diverse, dobândite în etapa de preantrenare, prin testare în regim zero-shot sau few-shot fără ajustare suplimentară. MMLU a fost creat ca o alternativă mai dificilă față de testele existente anterior (precum GLUE și SuperGLUE), pe care multe modele ajunseseră deja la nivelul uman până în 2020[2].
Descriere și conținut
MMUL este alcătuit din 15 908 întrebări cu răspuns multiplu, acoperind 57 de discipline diferite. Tematica sarcinilor include:
- Discipline din domeniul STEM (matematică, fizică, biologie, informatică).
- Științe umaniste și sociale (istorie, literatură, drept, administrație).
- Domenii aplicate și profesionale (medicină, jurisprudență, afaceri)[1].
Gradul de dificultate variază de la nivel elementar până la nivel profesional avansat. Întrebările sunt bazate pe materiale de examen reale pentru școli, universități și teste profesionale, precum GRE și USMLE[1]. Formatul sarcinilor prevede patru variante de răspuns pentru fiecare întrebare, ceea ce înseamnă că la alegere aleatorie acuratețea este de 25%. Pentru a obține un rezultat înalt, modelul trebuie să dețină cunoștințe enciclopedice vaste și capacitate de raționament.
Rezultate și evoluție
La lansarea MMLU în 2020, majoritatea LLM-urilor obțineau rezultate doar puțin peste nivelul ghicitului aleatoriu. Cel mai bun rezultat l-a demonstrat modelul GPT-3 (175 de miliarde de parametri), obținând ~43,9% răspunsuri corecte. Prin comparație, un expert uman atingea în medie ~90%[1]. Acest decalaj a confirmat dificultatea și standardul ridicat al noului benchmark.
În timp, MMLU a devenit unul dintre cele mai populare teste pentru LLM-uri, căpătând statutul de „standard de aur" în rapoartele companiilor de frunte din domeniul AI[3]. Până în 2023-2024, cele mai recente modele, precum GPT-4, Gemini Ultra de la Google și Claude 3.5 de la Anthropic, s-au apropiat de nivelul uman, atingând o acuratețe de ~85-90%[2][3].
Progresul rapid a condus la o treptată „saturare" a benchmark-ului: modelele de top au început să atingă scoruri apropiate de maximum, ceea ce a redus capacitatea MMLU de a diferenția posibilitățile lor intelectuale. Acest lucru a stimulat comunitatea să dezvolte teste noi, mai dificile[3].
Limitări și critici
În ciuda răspândirii largi, MMLU prezintă o serie de limitări semnificative.
Calitatea și corectitudinea datelor
În iunie 2024, cercetătorii au efectuat o analiză manuală a unui eșantion de 5700 de întrebări din MMLU și au descoperit un număr semnificativ de erori[4].
- Aproximativ 6,5% din toate întrebările MMLU conțin erori în adnotare sau formulare.
- În anumite categorii, ponderea sarcinilor incorecte este foarte ridicată. De exemplu, în secțiunea „Virologie\" 57% dintre sarcini conțineau erori (mai multe răspunsuri corecte, formulări incorecte sau răspuns de referință indicat greșit).
Aceasta înseamnă că nici măcar un model ideal nu poate obține 100% pe dataset-ul original, iar o parte din îmbunătățirile metricilor poate fi legată de memorarea de către model a erorilor sistematice ale setului[4].
Metodologia de evaluare și contaminarea datelor
- Absența unui standard de testare. Diferiți dezvoltatori pot utiliza prompt-uri diferite și regimuri few-shot diferite, ceea ce îngreunează compararea directă a rezultatelor modelelor.
- Contaminarea datelor (data contamination). Există riscul că întrebările și răspunsurile din benchmark-urile publice să ajungă în seturile de antrenare ale LLM-urilor. În acest caz, modelul practic „cunoaște" răspunsurile corecte, ceea ce face evaluarea incorectă[3].
Versiuni derivate și extensii
Pentru a rezolva problemele originalului MMLU au fost create mai multe variante ale acestuia.
- MMLU-Redux. O versiune corectată și rafinată a setului, prezentată în iunie 2024. Aceasta include 3000 de întrebări re-adnotate din 30 de categorii și este destinată unei evaluări mai fiabile a modelelor, fără distorsiunile cauzate de erorile din date[4].
- MMLU-Pro. O variantă extinsă și mai dificilă a testului, prezentată la sfârșitul anului 2024. Aceasta conține peste 12 000 de întrebări, pentru fiecare oferindu-se 10 variante de răspuns în loc de patru. Acest lucru reduce probabilitatea ghicitului aleatoriu la 10%. Întrebările au fost verificate de experți și includ sarcini noi din surse mai dificile[5].
- MMMLU (Multilingual MMLU). O versiune multilingvă lansată de OpenAI în 2023. Întregul set MMLU a fost tradus de traducători profesioniști în 14 limbi, inclusiv limbi răspândite (spaniolă, chineză, rusă) și limbi cu resurse reduse (de exemplu, yoruba). Aceasta permite evaluarea și compararea capacităților modelelor în diferite limbi[6].
Referințe
- Depozitul oficial MMLU pe GitHub
- Pagina MMLU pe Papers with Code cu rezultatele modelelor
Bibliografie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]