MATH Benchmark (TL)
MATH (akronimo mula sa Ingles na Mathematics Aptitude Test of Heuristics) — ito ay isang malaking dataset at benchmark para sa pagtatasa ng kakayahang matematikal at kasanayan sa paglutas ng mga problema ng malalaking language model (LLM). Ang dataset ay ipinakita noong 2021 ng isang grupo ng mga mananaliksik sa ilalim ng pamumuno ni Dan Hendrycks at naglalaman ng 12,500 na gawain, na kinuha mula sa mga American na paligsahang matematikal para sa mataas na paaralan, tulad ng AMC 10, AMC 12 at AIME[1].
Sasaklaw ang mga gawain sa malawak na hanay ng mga larangan (algebra, geometry, teorya ng bilang, kombinatorika at iba pa) at may gradasyon ayon sa antas ng kahirapan. Hindi tulad ng mga karaniwang gawain sa paaralan, kadalasan ay nangangailangan ang mga ito ng malikhaing pamamaraan at mga heuristikong pamamaraan, at hindi lamang direktang paggamit ng mga pormula. Ang bawat gawain ay sinasamahan ng kumpletong hakbang-hakbang na solusyon at panghuling sagot, na ginagawang mahalagang mapagkukunan ang MATH para sa parehong pagsasanay at pagsubok ng mga modelo[2].
Istraktura at mga katangian ng dataset
Ang benchmark na MATH ay nagtataglay ng ilang pangunahing katangian na ginagawa itong mahirap at maaasahang kasangkapan sa pagtatasa.
Format ng mga gawain
Lahat ng mga gawain at solusyon ay inihanda sa format na LaTeX, at para sa paglalarawan ng mga geometric na guhit ginagamit ang wika ng Asymptote. Nagbibigay-daan ito na ipakita ang lahat ng kondisyon, kabilang ang mga larawan, sa tekstong anyo na naa-access para sa pagpoproseso ng language model. Ang bawat gawain ay may mga label ayon sa pitong larangan ng matematika at ayon sa limang antas ng kahirapan[1].
Awtomatikong pagtatasa
Ang mga panghuling sagot sa dataset ay nakapaloob sa espesyal na format na `\boxed{...}` at dinala sa mahigpit na pamantayan (halimbawa, mga paksyon sa hindi nababawasang anyo). Nagbibigay-daan ito sa awtomatikong pagtatasa ng mga modelo ayon sa metriko ng eksaktong pagtutugma (exact match), na inaalis ang pagiging subjektibo at kalabuan sa pagsusuri ng mga resulta. Ang modelo ay dapat magbigay ng mahigpit na tamang sagot upang ang gawain ay maturing na nalutas[1].
Kahirapan ng mga gawain at antas ng tao
Ang MATH ay isa sa pinakamahirap na matematikal na pagsubok para sa AI. Ang mga gawain ay nagdudulot ng kahirapan kahit sa mga taong may malakas na matematikal na paghahanda.
- Sa panahon ng pag-aaral ng dataset, sinubukan ang isang grupo ng mga estudyante ng unibersidad na may mga resulta mula sa ~40% hanggang sa ~90% para sa mga nanalo sa mga olimpiyada.
- Kahit ang may-ari ng tatlong gintong medalya ng International Mathematical Olympiad ay hindi nakalaang lutasin ang lahat ng mga gawain nang walang pagkakamali[1].
Ipinapakita nito na para sa matagumpay na paglutas ng mga gawain ng MATH kailangan hindi lamang ng kaalaman, kundi pati na rin ng mataas na katumpakan at matematikal na intuisyon.
Mga resulta ng modelo at pag-unlad sa paglutas
Mga paunang resulta (2021)
Sa paglulunsad ng benchmark noong 2021, maging ang pinakamalaking mga modelo ay nagpakita ng napakababang mga resulta.
- Ang modelo ng GPT-3 (175 bilyong parameter) ay nakayang tamang lutasin ang humigit-kumulang 5% lamang ng mga gawain.
- Ang mga fine-tuned na bersyon ng GPT-2 ay nagpakita ng katumpakan na 6–7%[1].
Nakarating ang mga may-akda sa konklusyon na ang simpleng pagpapalaki ng sukat ng mga modelo ay halos walang epekto sa pagganap at para sa pag-unlad ay kailangan ng mga bagong algoritmikong pamamaraan[3].
Breakthrough ng Minerva at GPT-4 (2022–2023)
Naganap ang breakthrough sa pagdating ng mga modelong espesyal na sinanay sa mga siyentipikong teksto, at ng mga bagong paraan ng paglutas.
- Noong 2022, ang modelo ng Google Minerva ay nakamit ang katumpakan na humigit-kumulang 50%, na nagpapakita na ang kumbinasyon ng sukat at espesyalisadong paghahanda ay maaaring tumaas nang malaki ang kalidad ng paglutas[3].
- Noong 2023, ang GPT-4 mula sa OpenAI ay nagpakita ng bagong talon. Gamit ang mga kasangkapan, ang modelo ay nagawang makabuluhang mapabuti ang mga resulta nito:
- Sa Code Interpreter (pagpapatupad ng code para sa pagsusuri ng mga kalkulasyon) ang katumpakan ay umabot sa halos 70%.
- Sa pamamaraan ng code-based self-verification (self-verification at pagwawasto ng mga pagkakamali gamit ang code) ay naitakda ang rekord na 84.3% ng mga nalutas na gawain[4].
Ang resultang ito ay maihahambing sa antas ng mga malakas na kalahok na tao at papalapit sa threshold ng eksperto.
Kahalagahan at impluwensya
Ang benchmark na MATH ay gumanap ng mahalagang papel sa pagpapaunlad ng mga kakayahang matematikal ng LLM. Malinaw nitong ipinakita na para sa paglutas ng mga kumplikadong gawain ay hindi sapat ang simpleng pag-scale, at kailangan ng mga bagong pamamaraan, tulad ng:
- Pagsasanay sa mga kumpletong hakbang-hakbang na solusyon.
- Espesyalisadong paghahanda sa siyentipikong datos.
- Paggamit ng mga panlabas na kasangkapan para sa mga kalkulasyon at beripikasyon.
Sa kabila ng makabuluhang pag-unlad, ang MATH ay nananatiling mahalagang at mahirap na pagsubok. Patuloy itong nagsisilbing tagapagpahiwatig ng antas ng matematikal na pag-iisip sa LLM at nagbibigay ng motibasyon sa pananaliksik sa larangan ng maaasahang paglutas ng mga gawaing nangangailangan ng multi-step na pangangatuwiran[1].
Mga Sanggunian
- Opisyal na repository ng dataset ng MATH sa GitHub
- Pahina ng dataset sa Papers With Code
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]