GSM8K (Grade School Math 8K) (RO)
GSM8K (Grade School Math 8K) — este un set de date de referință care conține aproximativ 8.500 de probleme textuale de matematică de nivel școlar. A fost creat în 2021 de cercetători de la OpenAI pentru evaluarea și dezvoltarea capacităților marilor modele lingvistice (LLM) de raționament matematic în mai mulți pași[1]. GSM8K a devenit unul dintre principalele benchmark-uri pentru măsurarea progresului în domeniul raționamentului matematic al inteligenței artificiale.
Fiecare problemă din dataset reprezintă o scurtă poveste textuală, a cărei rezolvare necesită efectuarea a 2 până la 8 operații aritmetice consecutive (adunare, scădere, înmulțire, împărțire). În ciuda aparentei simplicități, problemele necesită o înțelegere profundă a textului și raționamente logice, ceea ce le face dificile pentru multe LLM-uri[2].
Caracteristici cheie
Volum și structură
Dataset-ul GSM8K conține aproximativ 8.500 de probleme, împărțite în două părți:
- Set de antrenament: ~7.500 de probleme destinate fine-tuning-ului modelelor. Fiecare problemă este însoțită de o soluție detaliată pas cu pas.
- Set de testare: ~1.000 de probleme utilizate pentru evaluarea independentă a performanței modelelor[1].
Dificultate și conținut
Problemele sunt concepute intenționat astfel încât să poată fi rezolvate de un elev capabil de gimnaziu, însă necesită raționamente în mai mulți pași. Acest lucru permite testarea nu atât a cunoștințelor matematice ale modelului, cât a capacității sale de a descompune problema și de a executa secvențial operații logice.
Diversitate lingvistică
Formulările problemelor din GSM8K se caracterizează printr-o mare varietate de stiluri și construcții lingvistice. Aceasta este menită să verifice capacitatea modelelor de a înțelege condițiile problemelor exprimate în moduri diferite și de a evita „memorarea" unor șabloane specifice[3].
Istorie și evoluția evaluării modelelor
Modele timpurii și rezultate de bază
În lucrarea originală din 2021, autorii au demonstrat că inclusiv modelele mari ale acelei perioade, precum GPT-3 (175 miliarde de parametri), întâmpinau dificultăți semnificative cu dataset-ul. După fine-tuning și utilizarea unui model-verificator auxiliar, acuratețea rezolvării atingea doar aproximativ 55%[1]. Acest rezultat a demonstrat că o singură eroare mică în lanțul de raționament poate conduce la un răspuns complet greșit.
Metode revoluționare: Chain-of-Thought
O descoperire importantă în rezolvarea problemelor GSM8K a fost abordarea „lanțului de raționament" (Chain-of-Thought, CoT). În 2022, cercetători de la Google au arătat că, dacă modelul este îndemnat să descrie explicit pașii de rezolvare înainte de a furniza răspunsul, acuratețea crește semnificativ. Modelul PaLM (540 miliarde de parametri) utilizând CoT a atins o acuratețe de 58%[4]. Aplicarea tehnicii mai complexe de self-consistency (generarea mai multor variante de soluție și selectarea răspunsului cel mai frecvent) a permis ridicarea acurateței la 74%[4].
Depășirea nivelului uman
Începând cu 2023, cele mai noi modele generative au depășit nivelul uman la acest benchmark.
- GPT-4 de la OpenAI în modul few-shot CoT (când în prompt sunt furnizate câteva exemple de probleme rezolvate) a atins o acuratețe de aproximativ 92%[5], iar cu strategii suplimentare — până la 97%[6].
- Claude 2 de la Anthropic a obținut rezultatul de 88%, iar versiunea mai nouă Claude 3 — aproximativ 95%[3].
Acești indicatori ridicați atestă un progres semnificativ în capacitățile de raționament ale LLM-urilor, însă indică totodată că GSM8K devine „aproape rezolvat" pentru modelele de vârf, ceea ce stimulează dezvoltarea unor benchmark-uri mai complexe, precum MATH și MMLU.
Rolul în antrenarea și dezvoltarea modelelor
Pe lângă evaluare, GSM8K este utilizat activ pentru antrenarea și îmbunătățirea modelelor.
- Fine-tuning (reantrenare): Setul de antrenament cu soluții pas cu pas reprezintă o resursă valoroasă pentru fine-tuning-ul modelelor în logica matematică.
- Antrenarea verificatoarelor: În lucrarea originală a OpenAI, o parte din datele GSM8K a fost utilizată pentru antrenarea unui model-verificator separat, care evalua corectitudinea soluțiilor generate. Această abordare de antrenare separată a generatorului și a criticului și-a dovedit eficiența[1].
- Prompt Engineering: Disponibilitatea unui număr mare de exemple le-a permis cercetătorilor să dezvolte și să rafineze tehnici de prompt, precum Chain-of-Thought și Tree-of-Thought, care învață modelul să raționeze fără a-i modifica ponderile.
Referințe
- Pagina dataset-ului pe Papers With Code
- Depozitul oficial pe GitHub
Bibliografie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]