---
title: "GSM8K (Grade School Math 8K) (TL)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 2508
wiki_created_at: 2026-09-06T23:05:18Z
wiki_modified_at: 2026-09-06T23:05:18Z
downloaded_at: 2026-09-07T22:51:46Z
---

# GSM8K (Grade School Math 8K) (TL)

**GSM8K** (**Grade School Math 8K**) — ito ay isang etalon na dataset na naglalaman ng humigit-kumulang 8,5 libong tekstuwal na problema sa matematika sa antas ng paaralan. Ito ay nilikha noong 2021 ng mga mananaliksik mula sa **OpenAI** upang suriin at paunlarin ang kakayahan ng malalaking language model (LLM) sa multi-step na mathematical reasoning<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-openai2021-1)</sup>. Ang GSM8K ay naging isa sa mga pangunahing benchmark para sa pagsukat ng pag-unlad sa larangan ng mathematical reasoning ng artificial intelligence.

Ang bawat problema sa dataset ay kumakatawan sa isang maikling tekstuwal na kuwento, ang solusyon nito ay nangangailangan ng pagkumpleto ng 2 hanggang 8 sunud-sunod na aritmetikong operasyon (karagdagan, pagbabawas, pagpaparami, paghahati). Sa kabila ng tila pagiging simple, ang mga problema ay nangangailangan ng malalim na pag-unawa sa teksto at lohikal na pangangatuwiran, na nagpapahirap sa maraming LLM<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-pwc-2)</sup>.

## Mga Pangunahing Katangian

### Dami at Istraktura

Ang dataset ng GSM8K ay naglalaman ng humigit-kumulang **8500 na problema**, na nahahati sa dalawang bahagi:

- **Training set**: ~7500 na problema, na inilaan para sa fine-tuning ng mga modelo. Ang bawat problema ay sinasamahan ng detalyadong hakbang-hakbang na solusyon.
- **Test set**: ~1000 na problema, na ginagamit para sa independyenteng pagtatasa ng performance ng mga modelo<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-openai2021-1)</sup>.

### Kahirapan at Nilalaman

Ang mga problema ay sadyang binuo upang malutas ng isang may kakayahang mag-aaral sa sekondaryang paaralan, ngunit nangangailangan ng **multi-step na pangangatuwiran**. Pinapahintulutan nito ang pagsubok hindi lamang sa kaalaman sa matematika ng modelo, kundi pati na rin ang kakayahan nitong i-decompose ang problema at sunud-sunod na magsagawa ng lohikal na operasyon.

### Pagkakaiba-iba ng Wika

Ang mga pagpapalawak ng mga problema sa GSM8K ay may malaking pagkakaiba-iba ng mga istilo at lingguwistikong konstruksyon. Ito ay ginawa upang suriin ang kakayahan ng mga modelo na maunawaan ang mga kondisyon ng problema na ipinahayag sa iba't ibang paraan, at upang maiwasan ang "pagsasaulo" ng mga partikular na template<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-klu_benchmark-3)</sup>.

## Kasaysayan at Ebolusyon ng Pagtatasa ng mga Modelo

### Mga Maagang Modelo at Pangunahing Resulta

Sa orihinal na akda noong 2021, ipinakita ng mga may-akda na kahit ang malalaking modelo noong panahon na iyon, tulad ng **GPT-3** (175 bilyong parameter), ay nakaranas ng malaking kahirapan sa dataset. Pagkatapos ng fine-tuning at paggamit ng auxiliary na modelo-verifier, ang katumpakan ng solusyon ay umabot lamang sa humigit-kumulang **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-openai2021-1)</sup>. Ipinakita ng resultang ito na ang isang maliit na pagkakamali sa chain ng pangangatuwiran ay maaaring humantong sa ganap na maling sagot.

### Mga Breakthrough na Pamamaraan: Chain-of-Thought

Ang breakthrough sa paglutas ng mga problema ng GSM8K ay ang diskarteng **"chain ng pangangatuwiran"** (**Chain-of-Thought, CoT**). Noong 2022, ipinakita ng mga mananaliksik mula sa Google na kung hinihikayat ang modelo na tahasan na ilista ang mga hakbang ng solusyon bago ilabas ang sagot, ang katumpakan ay kapansin-pansing tumataas. Ang modelo ng **PaLM** (540 bilyong parameter) na may paggamit ng CoT ay umabot sa **58%** na katumpakan<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-google_cot-4)</sup>. Ang paggamit ng mas kumplikadong teknik na **self-consistency** (pagbuo ng ilang variant ng solusyon at pagpili ng pinaka-madalas na sagot) ay nagpahintulot na itaas ang katumpakan sa **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-google_cot-4)</sup>.

### Paglampas sa Antas ng Tao

Simula noong 2023, ang mga pinakabagong generative na modelo ay nalampasan ang antas ng tao sa benchmark na ito.

- Ang **GPT-4** mula sa OpenAI sa mode na *few-shot CoT* (kapag ang prompt ay nagbibigay ng ilang halimbawa ng mga nalutas na problema) ay umabot sa katumpakan na humigit-kumulang **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-gpt4_92-5)</sup>, at sa karagdagang mga estratehiya — hanggang **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-gpt4_97-6)</sup>.
- Ang **Claude 2** mula sa Anthropic ay nagpakita ng resulta na **88%**, at ang mas bagong bersyon na **Claude 3** — humigit-kumulang **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-klu_benchmark-3)</sup>.

Ang ganitong mataas na mga tagapagpahiwatig ay nagpapatunay ng malaking pag-unlad sa kakayahan ng LLM sa pangangatuwiran, ngunit nagpapahiwatig din na ang GSM8K ay nagiging "halos nalutas" para sa mga pinakamaunlad na modelo, na nagpapasigla sa pagbuo ng mas kumplikadong mga benchmark, tulad ng **MATH** at **MMLU**.

## Papel sa Pagsasanay at Pagpapaunlad ng mga Modelo

Bukod sa pagtatasa, ang GSM8K ay aktibong ginagamit para sa **pagsasanay at pagpapabuti** ng mga modelo.

- **Fine-tuning (karagdagang pagsasanay)**: Ang training set na may hakbang-hakbang na mga solusyon ay isang mahalagang mapagkukunan para sa fine-tuning ng mga modelo sa mathematical logic.
- **Pagsasanay ng mga verifier**: Sa orihinal na akda ng OpenAI, ang bahagi ng data ng GSM8K ay ginamit para sa pagsasanay ng isang hiwalay na modelo-**verifier**, na sinusuri ang kawastuhan ng mga nabuong solusyon. Napatunayan ng diskarteng ito ng hiwalay na pagsasanay ng generator at critic ang sarili nitong bisa<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Ang pagkakaroon ng malaking bilang ng mga halimbawa ay nagpahintulot sa mga mananaliksik na bumuo at mapahusay ang mga teknik ng prompt, tulad ng **Chain-of-Thought** at **Tree-of-Thought**, na nagtuturo sa modelo na mangatuwiran nang hindi binabago ang mga timbang nito.

## Mga Link

- Pahina ng dataset sa Papers With Code
- Opisyal na repositoryo sa GitHub

## Panitikan

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Mga Tala

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(TL)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
