GSM8K (Grade School Math 8K) (TL)
GSM8K (Grade School Math 8K) — ito ay isang etalon na dataset na naglalaman ng humigit-kumulang 8,5 libong tekstuwal na problema sa matematika sa antas ng paaralan. Ito ay nilikha noong 2021 ng mga mananaliksik mula sa OpenAI upang suriin at paunlarin ang kakayahan ng malalaking language model (LLM) sa multi-step na mathematical reasoning[1]. Ang GSM8K ay naging isa sa mga pangunahing benchmark para sa pagsukat ng pag-unlad sa larangan ng mathematical reasoning ng artificial intelligence.
Ang bawat problema sa dataset ay kumakatawan sa isang maikling tekstuwal na kuwento, ang solusyon nito ay nangangailangan ng pagkumpleto ng 2 hanggang 8 sunud-sunod na aritmetikong operasyon (karagdagan, pagbabawas, pagpaparami, paghahati). Sa kabila ng tila pagiging simple, ang mga problema ay nangangailangan ng malalim na pag-unawa sa teksto at lohikal na pangangatuwiran, na nagpapahirap sa maraming LLM[2].
Mga Pangunahing Katangian
Dami at Istraktura
Ang dataset ng GSM8K ay naglalaman ng humigit-kumulang 8500 na problema, na nahahati sa dalawang bahagi:
- Training set: ~7500 na problema, na inilaan para sa fine-tuning ng mga modelo. Ang bawat problema ay sinasamahan ng detalyadong hakbang-hakbang na solusyon.
- Test set: ~1000 na problema, na ginagamit para sa independyenteng pagtatasa ng performance ng mga modelo[1].
Kahirapan at Nilalaman
Ang mga problema ay sadyang binuo upang malutas ng isang may kakayahang mag-aaral sa sekondaryang paaralan, ngunit nangangailangan ng multi-step na pangangatuwiran. Pinapahintulutan nito ang pagsubok hindi lamang sa kaalaman sa matematika ng modelo, kundi pati na rin ang kakayahan nitong i-decompose ang problema at sunud-sunod na magsagawa ng lohikal na operasyon.
Pagkakaiba-iba ng Wika
Ang mga pagpapalawak ng mga problema sa GSM8K ay may malaking pagkakaiba-iba ng mga istilo at lingguwistikong konstruksyon. Ito ay ginawa upang suriin ang kakayahan ng mga modelo na maunawaan ang mga kondisyon ng problema na ipinahayag sa iba't ibang paraan, at upang maiwasan ang "pagsasaulo" ng mga partikular na template[3].
Kasaysayan at Ebolusyon ng Pagtatasa ng mga Modelo
Mga Maagang Modelo at Pangunahing Resulta
Sa orihinal na akda noong 2021, ipinakita ng mga may-akda na kahit ang malalaking modelo noong panahon na iyon, tulad ng GPT-3 (175 bilyong parameter), ay nakaranas ng malaking kahirapan sa dataset. Pagkatapos ng fine-tuning at paggamit ng auxiliary na modelo-verifier, ang katumpakan ng solusyon ay umabot lamang sa humigit-kumulang 55%[1]. Ipinakita ng resultang ito na ang isang maliit na pagkakamali sa chain ng pangangatuwiran ay maaaring humantong sa ganap na maling sagot.
Mga Breakthrough na Pamamaraan: Chain-of-Thought
Ang breakthrough sa paglutas ng mga problema ng GSM8K ay ang diskarteng "chain ng pangangatuwiran" (Chain-of-Thought, CoT). Noong 2022, ipinakita ng mga mananaliksik mula sa Google na kung hinihikayat ang modelo na tahasan na ilista ang mga hakbang ng solusyon bago ilabas ang sagot, ang katumpakan ay kapansin-pansing tumataas. Ang modelo ng PaLM (540 bilyong parameter) na may paggamit ng CoT ay umabot sa 58% na katumpakan[4]. Ang paggamit ng mas kumplikadong teknik na self-consistency (pagbuo ng ilang variant ng solusyon at pagpili ng pinaka-madalas na sagot) ay nagpahintulot na itaas ang katumpakan sa 74%[4].
Paglampas sa Antas ng Tao
Simula noong 2023, ang mga pinakabagong generative na modelo ay nalampasan ang antas ng tao sa benchmark na ito.
- Ang GPT-4 mula sa OpenAI sa mode na few-shot CoT (kapag ang prompt ay nagbibigay ng ilang halimbawa ng mga nalutas na problema) ay umabot sa katumpakan na humigit-kumulang 92%[5], at sa karagdagang mga estratehiya — hanggang 97%[6].
- Ang Claude 2 mula sa Anthropic ay nagpakita ng resulta na 88%, at ang mas bagong bersyon na Claude 3 — humigit-kumulang 95%[3].
Ang ganitong mataas na mga tagapagpahiwatig ay nagpapatunay ng malaking pag-unlad sa kakayahan ng LLM sa pangangatuwiran, ngunit nagpapahiwatig din na ang GSM8K ay nagiging "halos nalutas" para sa mga pinakamaunlad na modelo, na nagpapasigla sa pagbuo ng mas kumplikadong mga benchmark, tulad ng MATH at MMLU.
Papel sa Pagsasanay at Pagpapaunlad ng mga Modelo
Bukod sa pagtatasa, ang GSM8K ay aktibong ginagamit para sa pagsasanay at pagpapabuti ng mga modelo.
- Fine-tuning (karagdagang pagsasanay): Ang training set na may hakbang-hakbang na mga solusyon ay isang mahalagang mapagkukunan para sa fine-tuning ng mga modelo sa mathematical logic.
- Pagsasanay ng mga verifier: Sa orihinal na akda ng OpenAI, ang bahagi ng data ng GSM8K ay ginamit para sa pagsasanay ng isang hiwalay na modelo-verifier, na sinusuri ang kawastuhan ng mga nabuong solusyon. Napatunayan ng diskarteng ito ng hiwalay na pagsasanay ng generator at critic ang sarili nitong bisa[1].
- Prompt Engineering: Ang pagkakaroon ng malaking bilang ng mga halimbawa ay nagpahintulot sa mga mananaliksik na bumuo at mapahusay ang mga teknik ng prompt, tulad ng Chain-of-Thought at Tree-of-Thought, na nagtuturo sa modelo na mangatuwiran nang hindi binabago ang mga timbang nito.
Mga Link
- Pahina ng dataset sa Papers With Code
- Opisyal na repositoryo sa GitHub
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]