---
title: "MATH Benchmark (IT)"
source: "https://systems-analysis.info/int/MATH_Benchmark_(IT)"
wiki: "systems-analysis.info/int"
article: "MATH_Benchmark_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3972
wiki_created_at: 2026-09-06T23:28:41Z
wiki_modified_at: 2026-09-06T23:28:41Z
downloaded_at: 2026-09-07T22:59:57Z
---

# MATH Benchmark (IT)

**MATH** (acronimo dall'inglese **Mathematics Aptitude Test of Heuristics**) — è un ampio dataset e benchmark per la valutazione delle capacità matematiche e delle abilità di problem solving nei Large Language Model (LLM). Il dataset è stato presentato nel 2021 da un gruppo di ricercatori guidati da **Dan Hendrycks** e contiene **12.500 problemi** tratti da competizioni matematiche americane per le scuole superiori, come AMC 10, AMC 12 e AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

I problemi coprono un'ampia gamma di aree (algebra, geometria, teoria dei numeri, combinatoria e altro) e sono classificati per livello di difficoltà. A differenza dei problemi scolastici standard, richiedono spesso un approccio creativo e metodi euristici, piuttosto che la semplice applicazione di formule. Ogni problema è corredato di una soluzione completa passo dopo passo e di una risposta finale, il che rende MATH una risorsa preziosa sia per l'addestramento che per il testing dei modelli<sup>[\[2\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-llm_eval_datasets-2)</sup>.

## Struttura e caratteristiche del dataset

Il benchmark MATH possiede una serie di caratteristiche chiave che lo rendono uno strumento di valutazione impegnativo e affidabile.

### Formato dei problemi

Tutti i problemi e le soluzioni sono presentati in formato LaTeX, mentre per la descrizione dei disegni geometrici viene utilizzato il linguaggio **Asymptote**. Ciò consente di rappresentare tutte le condizioni, incluse le immagini, in forma testuale, accessibile all'elaborazione da parte di un modello linguistico. A ogni problema sono assegnate etichette relative a sette aree della matematica e a cinque livelli di difficoltà<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

### Valutazione automatica

Le risposte finali nel dataset sono racchiuse in un formato speciale \`\boxed{...}\` e portate a uno standard rigoroso (ad esempio, le frazioni in forma irriducibile). Ciò consente di effettuare una valutazione automatica dei modelli tramite la metrica dell'**exact match** (*corrispondenza esatta*), eliminando soggettività e ambiguità nella verifica dei risultati. Il modello deve fornire una risposta strettamente corretta affinché il problema sia considerato risolto<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

## Difficoltà dei problemi e livello umano

MATH è uno dei test matematici più difficili per l'IA. I problemi rappresentano una sfida anche per persone con una solida preparazione matematica.

- Nel corso dello studio del dataset, un gruppo di **studenti universitari** è stato sottoposto al test con risultati compresi tra circa **~40%** e **~90%** per i vincitori di olimpiadi.
- Persino un detentore di tre medaglie d'oro alle Olimpiadi Internazionali di Matematica non è riuscito a risolvere tutti i problemi senza errori<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

Ciò dimostra che per risolvere con successo i problemi di MATH non sono sufficienti la conoscenza, ma occorrono anche elevata precisione e intuizione matematica.

## Risultati dei modelli e progressi nella risoluzione

### Risultati iniziali (2021)

Al lancio del benchmark nel 2021, anche i modelli più grandi mostravano risultati estremamente bassi.

- Il modello **GPT-3** (175 miliardi di parametri) è riuscito a risolvere correttamente solo circa il **5%** dei problemi.
- Le versioni con fine-tuning di **GPT-2** mostravano un'accuratezza del 6-7%<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

Gli autori hanno concluso che il semplice aumento della scala dei modelli ha quasi nessun effetto sulle prestazioni e che per fare progressi sono necessari nuovi approcci algoritmici<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-lang_models_surprised-3)</sup>.

### Il salto di Minerva e GPT-4 (2022–2023)

Il breakthrough è avvenuto con la comparsa di modelli appositamente addestrati su testi scientifici e di nuovi metodi di risoluzione.

- Nel 2022 il modello **Google Minerva** ha raggiunto un'accuratezza di circa il **50%**, dimostrando che la combinazione di scala e preparazione specializzata può aumentare drasticamente la qualità della risoluzione<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-lang_models_surprised-3)</sup>.
- Nel 2023 **GPT-4** di OpenAI ha mostrato un nuovo balzo in avanti. Utilizzando strumenti esterni, il modello è riuscito a migliorare significativamente i propri risultati:
  - Con **Code Interpreter** (esecuzione di codice per la verifica dei calcoli) l'accuratezza ha raggiunto quasi il **70%**.
  - Con il metodo *code-based self-verification* (auto-verifica e correzione degli errori tramite codice) è stato stabilito un record dell'**84,3%** dei problemi risolti<sup>[\[4\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-decoder_gpt4-4)</sup>.

Questo risultato è paragonabile al livello dei partecipanti umani più capaci e si avvicina alla soglia dell'esperto.

## Importanza e impatto

Il benchmark MATH ha svolto un ruolo chiave nello sviluppo delle capacità matematiche degli LLM. Ha dimostrato chiaramente che per risolvere problemi complessi il semplice scaling non è sufficiente, e che sono necessari nuovi approcci, quali:

- Addestramento su soluzioni complete passo dopo passo.
- Preparazione specializzata su dati scientifici.
- Utilizzo di strumenti esterni per calcoli e verifica.

Nonostante i notevoli progressi, MATH rimane una prova importante e impegnativa. Continua a fungere da indicatore del livello di ragionamento matematico negli LLM e stimola la ricerca nel campo della risoluzione affidabile di problemi che richiedono ragionamenti a più passaggi<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_note-hendrycks2021-1)</sup>.

## Riferimenti

- Repository ufficiale del dataset MATH su GitHub
- Pagina del dataset su Papers With Code

## Bibliografia

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH_Benchmark_(IT)#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
