GSM8K (Grade School Math 8K) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — è un dataset di riferimento contenente circa 8.500 problemi matematici testuali di livello scolastico. È stato creato nel 2021 dai ricercatori di OpenAI per valutare e sviluppare le capacità dei grandi modelli linguistici (LLM) nel ragionamento matematico a più passaggi[1]. GSM8K è diventato uno dei principali benchmark per misurare i progressi nel campo del ragionamento matematico dell'intelligenza artificiale.

Ogni problema nel dataset è una breve storia testuale la cui soluzione richiede l'esecuzione da 2 a 8 operazioni aritmetiche sequenziali (addizione, sottrazione, moltiplicazione, divisione). Nonostante l'apparente semplicità, i problemi richiedono una profonda comprensione del testo e un ragionamento logico, il che li rende difficili per molti LLM[2].

Caratteristiche principali

Dimensioni e struttura

Il dataset GSM8K contiene circa 8.500 problemi, suddivisi in due parti:

  • Set di addestramento: ~7.500 problemi destinati al fine-tuning dei modelli. Ogni problema è corredato da una soluzione dettagliata passo dopo passo.
  • Set di test: ~1.000 problemi utilizzati per la valutazione indipendente delle prestazioni dei modelli[1].

Difficoltà e contenuto

I problemi sono volutamente formulati in modo che uno studente capace di scuola media possa risolverli, ma richiedono comunque ragionamenti a più passaggi. Ciò permette di valutare non tanto le conoscenze matematiche del modello, quanto la sua capacità di scomporre il problema ed eseguire operazioni logiche in sequenza.

Diversità linguistica

Le formulazioni dei problemi in GSM8K si distinguono per una grande varietà di stili e costruzioni linguistiche. Questo è stato fatto per verificare la capacità dei modelli di comprendere le condizioni dei problemi espresse in modi diversi e di evitare la "memorizzazione" di schemi specifici[3].

Storia ed evoluzione della valutazione dei modelli

Modelli iniziali e risultati di base

Nel lavoro originale del 2021, gli autori dimostrarono che anche i grandi modelli dell'epoca, come GPT-3 (175 miliardi di parametri), incontravano difficoltà significative con il dataset. Dopo il fine-tuning e l'utilizzo di un modello verificatore ausiliario, l'accuratezza nella soluzione raggiungeva solo circa il 55%[1]. Questo risultato dimostrò che un singolo piccolo errore nella catena di ragionamento può portare a una risposta completamente errata.

Metodologie innovative: Chain-of-Thought

Una svolta nella risoluzione dei problemi GSM8K fu rappresentata dall'approccio «catena di ragionamento» (Chain-of-Thought, CoT). Nel 2022, ricercatori di Google dimostrarono che, incoraggiando il modello a descrivere esplicitamente i passaggi della soluzione prima di fornire la risposta, l'accuratezza aumentava significativamente. Il modello PaLM (540 miliardi di parametri) con l'utilizzo del CoT raggiunse il 58% di accuratezza[4]. L'applicazione della tecnica più avanzata self-consistency (generazione di più varianti di soluzione e selezione della risposta più frequente) permise di aumentare l'accuratezza fino al 74%[4].

Il superamento del livello umano

A partire dal 2023, i modelli generativi più recenti hanno superato il livello umano su questo benchmark.

  • GPT-4 di OpenAI in modalità few-shot CoT (quando nel prompt vengono forniti alcuni esempi di problemi risolti) ha raggiunto un'accuratezza di circa il 92%[5], e con strategie aggiuntive fino al 97%[6].
  • Claude 2 di Anthropic ha ottenuto il risultato dell'88%, mentre la versione più recente Claude 3 ha raggiunto circa il 95%[3].

Tali risultati elevati testimoniano un progresso significativo nelle capacità di ragionamento degli LLM, ma indicano anche che GSM8K sta diventando "quasi risolto" per i modelli più avanzati, il che stimola lo sviluppo di benchmark più complessi come MATH e MMLU.

Ruolo nell'addestramento e nello sviluppo dei modelli

Oltre alla valutazione, GSM8K è ampiamente utilizzato per l'addestramento e il miglioramento dei modelli.

  • Fine-tuning (affinamento): Il set di addestramento con soluzioni passo dopo passo è una risorsa preziosa per il fine-tuning dei modelli sulla logica matematica.
  • Addestramento dei verificatori: Nel lavoro originale di OpenAI, una parte dei dati GSM8K è stata utilizzata per addestrare un modello verificatore separato, che valutava la correttezza delle soluzioni generate. Questo approccio di addestramento separato del generatore e del critico ha dimostrato la sua efficacia[1].
  • Prompt Engineering: La disponibilità di un grande numero di esempi ha permesso ai ricercatori di sviluppare e affinare tecniche di prompt come Chain-of-Thought e Tree-of-Thought, che insegnano al modello a ragionare senza modificarne i pesi.

Collegamenti esterni

  • Pagina del dataset su Papers With Code
  • Repository ufficiale su GitHub

Bibliografia

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]