MATH Benchmark (RO)
MATH (acronim din engl. Mathematics Aptitude Test of Heuristics) — este un set de date și benchmark de mari dimensiuni pentru evaluarea abilităților matematice și a competențelor de rezolvare a problemelor la modelele de limbaj de mari dimensiuni (LLM). Dataset-ul a fost prezentat în 2021 de un grup de cercetători condus de Dan Hendrycks și conține 12 500 de probleme, preluate din competițiile matematice americane pentru liceu, precum AMC 10, AMC 12 și AIME[1].
Problemele acoperă un spectru larg de domenii (algebră, geometrie, teoria numerelor, combinatorică ș.a.) și au o gradație după nivelul de dificultate. Spre deosebire de problemele standard din manuale, acestea necesită adesea un demers creativ și metode euristice, nu doar aplicarea directă a formulelor. Fiecare problemă este însoțită de o soluție completă pas cu pas și de răspunsul final, ceea ce face din MATH o resursă valoroasă atât pentru antrenarea, cât și pentru testarea modelelor[2].
Structura și particularitățile dataset-ului
Benchmark-ul MATH posedă o serie de caracteristici esențiale care îl fac un instrument de evaluare dificil și fiabil.
Formatul problemelor
Toate problemele și soluțiile sunt prezentate în format LaTeX, iar pentru descrierea figurilor geometrice se utilizează limbajul Asymptote. Aceasta permite reprezentarea tuturor condițiilor, inclusiv a imaginilor, în formă textuală accesibilă procesării de către un model de limbaj. Fiecărei probleme i se atribuie etichete după șapte domenii ale matematicii și după cinci niveluri de dificultate[1].
Evaluarea automată
Răspunsurile finale din dataset sunt incluse într-un format special `\boxed{...}` și aduse la un standard strict (de exemplu, fracțiile sunt în formă ireductibilă). Aceasta permite realizarea unei evaluări automate a modelelor după metrica corespondenței exacte (exact match), eliminând subiectivitatea și ambiguitatea la verificarea rezultatelor. Modelul trebuie să furnizeze un răspuns strict corect pentru ca problema să fie considerată rezolvată[1].
Dificultatea problemelor și nivelul uman
MATH este unul dintre cele mai dificile teste matematice pentru IA. Problemele reprezintă o provocare chiar și pentru persoanele cu o pregătire matematică solidă.
- În cadrul studiului dataset-ului, un grup de studenți universitari a fost testat, obținând rezultate de la ~40% până la ~90% în cazul câștigătorilor de olimpiade.
- Chiar și deținătorul a trei medalii de aur la Olimpiada Internațională de Matematică nu a reușit să rezolve toate problemele fără greșeli[1].
Aceasta arată că pentru rezolvarea cu succes a problemelor MATH nu sunt suficiente doar cunoștințele, ci și o precizie ridicată și intuiție matematică.
Rezultatele modelelor și progresul în rezolvare
Rezultatele inițiale (2021)
La lansarea benchmark-ului în 2021, chiar și cele mai mari modele obțineau rezultate extrem de scăzute.
- Modelul GPT-3 (175 miliarde de parametri) a reușit să rezolve corect doar aproximativ 5% din probleme.
- Versiunile fine-tuned ale GPT-2 arătau o acuratețe de 6-7%[1].
Autorii au concluzionat că simpla creștere a scalei modelelor nu influențează aproape deloc performanța și că pentru progres sunt necesare noi abordări algoritmice[3].
Saltul calitativ Minerva și GPT-4 (2022–2023)
Saltul calitativ a avut loc odată cu apariția modelelor antrenate special pe texte științifice și a unor noi metode de rezolvare.
- În 2022, modelul Google Minerva a atins o acuratețe de aproximativ 50%, demonstrând că îmbinarea scalei cu pregătirea specializată poate îmbunătăți drastic calitatea rezolvării[3].
- În 2023, GPT-4 de la OpenAI a înregistrat un nou salt. Utilizând instrumente externe, modelul a reușit să își îmbunătățească semnificativ rezultatele:
- Cu Code Interpreter (execuția codului pentru verificarea calculelor), acuratețea a atins aproape 70%.
- Cu metoda code-based self-verification (autoverificarea și corectarea erorilor cu ajutorul codului), a fost stabilit un record de 84,3% probleme rezolvate[4].
Acest rezultat este comparabil cu nivelul participanților umani puternici și se apropie de pragul expert.
Semnificație și impact
Benchmark-ul MATH a jucat un rol esențial în dezvoltarea abilităților matematice ale LLM. El a demonstrat în mod evident că pentru rezolvarea problemelor complexe nu este suficientă simpla scalare, ci sunt necesare abordări noi, precum:
- Antrenarea pe soluții complete pas cu pas.
- Pregătirea specializată pe date științifice.
- Utilizarea instrumentelor externe pentru calcule și verificare.
În pofida progresului semnificativ, MATH rămâne un test important și dificil. El continuă să servească drept indicator al nivelului de gândire matematică al LLM și stimulează cercetările în domeniul rezolvării fiabile a problemelor care necesită raționamente în mai mulți pași[1].
Referințe
- Depozitul oficial al dataset-ului MATH pe GitHub
- Pagina dataset-ului pe Papers With Code
Bibliografie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]