MATH Benchmark (IT)
MATH (acronimo dall'inglese Mathematics Aptitude Test of Heuristics) — è un ampio dataset e benchmark per la valutazione delle capacità matematiche e delle abilità di problem solving nei Large Language Model (LLM). Il dataset è stato presentato nel 2021 da un gruppo di ricercatori guidati da Dan Hendrycks e contiene 12.500 problemi tratti da competizioni matematiche americane per le scuole superiori, come AMC 10, AMC 12 e AIME[1].
I problemi coprono un'ampia gamma di aree (algebra, geometria, teoria dei numeri, combinatoria e altro) e sono classificati per livello di difficoltà. A differenza dei problemi scolastici standard, richiedono spesso un approccio creativo e metodi euristici, piuttosto che la semplice applicazione di formule. Ogni problema è corredato di una soluzione completa passo dopo passo e di una risposta finale, il che rende MATH una risorsa preziosa sia per l'addestramento che per il testing dei modelli[2].
Struttura e caratteristiche del dataset
Il benchmark MATH possiede una serie di caratteristiche chiave che lo rendono uno strumento di valutazione impegnativo e affidabile.
Formato dei problemi
Tutti i problemi e le soluzioni sono presentati in formato LaTeX, mentre per la descrizione dei disegni geometrici viene utilizzato il linguaggio Asymptote. Ciò consente di rappresentare tutte le condizioni, incluse le immagini, in forma testuale, accessibile all'elaborazione da parte di un modello linguistico. A ogni problema sono assegnate etichette relative a sette aree della matematica e a cinque livelli di difficoltà[1].
Valutazione automatica
Le risposte finali nel dataset sono racchiuse in un formato speciale `\boxed{...}` e portate a uno standard rigoroso (ad esempio, le frazioni in forma irriducibile). Ciò consente di effettuare una valutazione automatica dei modelli tramite la metrica dell'exact match (corrispondenza esatta), eliminando soggettività e ambiguità nella verifica dei risultati. Il modello deve fornire una risposta strettamente corretta affinché il problema sia considerato risolto[1].
Difficoltà dei problemi e livello umano
MATH è uno dei test matematici più difficili per l'IA. I problemi rappresentano una sfida anche per persone con una solida preparazione matematica.
- Nel corso dello studio del dataset, un gruppo di studenti universitari è stato sottoposto al test con risultati compresi tra circa ~40% e ~90% per i vincitori di olimpiadi.
- Persino un detentore di tre medaglie d'oro alle Olimpiadi Internazionali di Matematica non è riuscito a risolvere tutti i problemi senza errori[1].
Ciò dimostra che per risolvere con successo i problemi di MATH non sono sufficienti la conoscenza, ma occorrono anche elevata precisione e intuizione matematica.
Risultati dei modelli e progressi nella risoluzione
Risultati iniziali (2021)
Al lancio del benchmark nel 2021, anche i modelli più grandi mostravano risultati estremamente bassi.
- Il modello GPT-3 (175 miliardi di parametri) è riuscito a risolvere correttamente solo circa il 5% dei problemi.
- Le versioni con fine-tuning di GPT-2 mostravano un'accuratezza del 6-7%[1].
Gli autori hanno concluso che il semplice aumento della scala dei modelli ha quasi nessun effetto sulle prestazioni e che per fare progressi sono necessari nuovi approcci algoritmici[3].
Il salto di Minerva e GPT-4 (2022–2023)
Il breakthrough è avvenuto con la comparsa di modelli appositamente addestrati su testi scientifici e di nuovi metodi di risoluzione.
- Nel 2022 il modello Google Minerva ha raggiunto un'accuratezza di circa il 50%, dimostrando che la combinazione di scala e preparazione specializzata può aumentare drasticamente la qualità della risoluzione[3].
- Nel 2023 GPT-4 di OpenAI ha mostrato un nuovo balzo in avanti. Utilizzando strumenti esterni, il modello è riuscito a migliorare significativamente i propri risultati:
- Con Code Interpreter (esecuzione di codice per la verifica dei calcoli) l'accuratezza ha raggiunto quasi il 70%.
- Con il metodo code-based self-verification (auto-verifica e correzione degli errori tramite codice) è stato stabilito un record dell'84,3% dei problemi risolti[4].
Questo risultato è paragonabile al livello dei partecipanti umani più capaci e si avvicina alla soglia dell'esperto.
Importanza e impatto
Il benchmark MATH ha svolto un ruolo chiave nello sviluppo delle capacità matematiche degli LLM. Ha dimostrato chiaramente che per risolvere problemi complessi il semplice scaling non è sufficiente, e che sono necessari nuovi approcci, quali:
- Addestramento su soluzioni complete passo dopo passo.
- Preparazione specializzata su dati scientifici.
- Utilizzo di strumenti esterni per calcoli e verifica.
Nonostante i notevoli progressi, MATH rimane una prova importante e impegnativa. Continua a fungere da indicatore del livello di ragionamento matematico negli LLM e stimola la ricerca nel campo della risoluzione affidabile di problemi che richiedono ragionamenti a più passaggi[1].
Riferimenti
- Repository ufficiale del dataset MATH su GitHub
- Pagina del dataset su Papers With Code
Bibliografia
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]