MMLU Benchmark (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (acronimo di Measuring Massive Multitask Language Understanding) è un insieme di riferimento di task (benchmark) progettato per valutare le capacità dei grandi modelli linguistici (LLM) in un ampio spettro di domini tematici. Il benchmark è stato sviluppato nel 2020 da un team di ricercatori guidati da Dan Hendrycks dall'UC Berkeley e pubblicato alla conferenza ICLR nel 2021[1].

L'obiettivo di MMLU è verificare in che misura un modello assimila conoscenze e competenze diversificate acquisite nella fase di pre-addestramento, testandolo in modalità zero-shot o few-shot senza fine-tuning aggiuntivo. MMLU è stato creato come alternativa più impegnativa rispetto ai test precedentemente esistenti (come GLUE e SuperGLUE), sui quali molti modelli entro il 2020 avevano già raggiunto il livello umano[2].

Descrizione e contenuto

MMLU è composto da 15 908 domande a scelta multipla, che coprono 57 discipline diverse. La tematica dei quesiti include:

  • Materie dell'area STEM (matematica, fisica, biologia, informatica).
  • Scienze umanistiche e sociali (storia, letteratura, diritto, governance).
  • Ambiti applicativi e professionali (medicina, giurisprudenza, economia)[1].

Il livello di difficoltà varia dalla scuola primaria fino al livello professionale avanzato. Le domande sono basate su materiali d'esame reali di scuole, università e test professionali come GRE e USMLE[1]. Il formato dei quesiti prevede quattro opzioni di risposta per ciascuna domanda, il che significa che la precisione in caso di scelta casuale è del 25%. Per ottenere un punteggio elevato, il modello deve possedere un'ampia conoscenza enciclopedica e capacità di ragionamento.

Risultati e sviluppo

Al momento del rilascio di MMLU nel 2020, la maggior parte degli LLM mostrava risultati solo leggermente superiori alla risposta casuale. Il risultato migliore fu ottenuto dal modello GPT-3 (175 miliardi di parametri), con ~43,9% di risposte corrette. A titolo di confronto, un esperto umano raggiungeva in media ~90%[1]. Questo divario confermò la difficoltà e l'elevato standard del nuovo benchmark.

Nel tempo, MMLU è diventato uno dei test più popolari per gli LLM, acquisendo lo status di «gold standard» nei rapporti delle principali aziende AI[3]. Nel 2023-2024 i modelli più recenti, come GPT-4, Gemini Ultra di Google e Claude 3.5 di Anthropic, si sono avvicinati al livello umano, raggiungendo una precisione di ~85-90%[2][3].

Il rapido progresso ha portato a una progressiva «saturazione» del benchmark: i modelli leader hanno cominciato a raggiungere punteggi prossimi al massimo, riducendo la capacità di MMLU di distinguere le loro possibilità intellettive. Ciò ha spinto la comunità a sviluppare nuovi test più impegnativi[3].

Limitazioni e critiche

Nonostante la sua ampia diffusione, MMLU presenta alcune limitazioni sostanziali.

Qualità e correttezza dei dati

Nel giugno 2024, alcuni ricercatori hanno condotto un'analisi manuale di un campione di 5700 domande di MMLU, riscontrando un numero significativo di errori[4].

  • Circa il 6,5% di tutte le domande di MMLU contiene errori nell'annotazione o nella formulazione.
  • In alcune categorie la quota di quesiti non corretti è molto elevata. Ad esempio, nella sezione «Virologia» il 57% dei quesiti conteneva errori (più risposte corrette, formulazioni scorrette o risposta di riferimento indicata in modo errato).

Ciò significa che anche un modello ideale non può ottenere il 100% sul dataset originale, e parte dei miglioramenti nelle metriche può essere legata alla memorizzazione da parte del modello degli errori sistematici del dataset[4].

Metodologia di valutazione e contaminazione dei dati

  • Assenza di uno standard di test. Diversi sviluppatori possono utilizzare prompt e modalità few-shot differenti, il che rende difficile il confronto diretto dei risultati tra modelli.
  • Contaminazione dei dati (data contamination). Esiste il rischio che domande e risposte provenienti da benchmark pubblici finiscano nei dataset di addestramento degli LLM. In tal caso, il modello «conosce» di fatto le risposte corrette, rendendo la valutazione non equa[3].

Versioni derivate ed estensioni

Per risolvere i problemi del MMLU originale sono state create diverse varianti.

  • MMLU-Redux. Una versione corretta e affinata del dataset, presentata nel giugno 2024. Include 3000 domande ri-annotate da 30 categorie ed è destinata a una valutazione più affidabile dei modelli, priva delle distorsioni causate da errori nei dati[4].
  • MMLU-Pro. Una variante ampliata e più complessa del test, presentata alla fine del 2024. Contiene più di 12 000 domande, per ciascuna delle quali sono fornite 10 opzioni di risposta invece di quattro. Ciò riduce la probabilità di risposta casuale corretta al 10%. Le domande sono state verificate da esperti e includono nuovi quesiti provenienti da fonti più complesse[5].
  • MMMLU (Multilingual MMLU). Una versione multilingue rilasciata da OpenAI nel 2023. L'intero dataset MMLU è stato tradotto da traduttori professionisti in 14 lingue, incluse quelle diffuse (spagnolo, cinese, russo) e quelle a basse risorse (ad esempio, yoruba). Ciò consente di valutare e confrontare le capacità dei modelli in diverse lingue[6].

Riferimenti

  • Repository ufficiale di MMLU su GitHub
  • Pagina di MMLU su Papers with Code con i risultati dei modelli

Bibliografia

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]