---
title: "GSM8K (Grade School Math 8K) (ID)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(ID)"
language: "id"
categories:
  - "Category:Indonesian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2499
wiki_created_at: 2026-09-06T23:05:09Z
wiki_modified_at: 2026-09-06T23:05:09Z
downloaded_at: 2026-09-07T22:51:43Z
---

# GSM8K (Grade School Math 8K) (ID)

**GSM8K** (**Grade School Math 8K**) — adalah dataset benchmark yang berisi sekitar 8,5 ribu soal matematika tingkat sekolah dalam bentuk teks. Dataset ini dibuat pada tahun 2021 oleh para peneliti dari **OpenAI** untuk mengevaluasi dan mengembangkan kemampuan large language model (LLM) dalam melakukan penalaran matematika multi-langkah<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-openai2021-1)</sup>. GSM8K telah menjadi salah satu benchmark utama untuk mengukur kemajuan dalam bidang penalaran matematika kecerdasan buatan.

Setiap soal dalam dataset berupa cerita teks singkat yang penyelesaiannya memerlukan 2 hingga 8 operasi aritmetika berurutan (penjumlahan, pengurangan, perkalian, pembagian). Meskipun tampak sederhana, soal-soal ini memerlukan pemahaman teks yang mendalam dan penalaran logis, sehingga menjadi tantangan tersendiri bagi banyak LLM<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-pwc-2)</sup>.

## Karakteristik Utama

### Ukuran dan Struktur

Dataset GSM8K berisi sekitar **8500 soal** yang dibagi menjadi dua bagian:

- **Data latih**: ~7500 soal yang ditujukan untuk fine-tuning model. Setiap soal dilengkapi dengan penyelesaian langkah demi langkah yang rinci.
- **Data uji**: ~1000 soal yang digunakan untuk evaluasi independen terhadap performa model<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-openai2021-1)</sup>.

### Tingkat Kesulitan dan Konten

Soal-soal sengaja dirancang agar dapat diselesaikan oleh siswa sekolah menengah yang cakap, namun tetap memerlukan **penalaran multi-langkah**. Hal ini memungkinkan pengujian bukan sekadar pengetahuan matematika model, melainkan kemampuannya dalam mendekomposisi masalah dan menjalankan operasi logis secara berurutan.

### Keragaman Linguistik

Formulasi soal dalam GSM8K memiliki keragaman gaya dan konstruksi bahasa yang besar. Ini dilakukan untuk menguji kemampuan model dalam memahami kondisi soal yang dinyatakan dengan berbagai cara, serta menghindari "hafalan" pola tertentu<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-klu_benchmark-3)</sup>.

## Sejarah dan Evolusi Evaluasi Model

### Model Awal dan Hasil Dasar

Dalam karya asli tahun 2021, para penulis menunjukkan bahwa bahkan model-model besar pada masa itu, seperti **GPT-3** (175 miliar parameter), mengalami kesulitan signifikan dengan dataset ini. Setelah fine-tuning dan penggunaan model verifikator tambahan, akurasi penyelesaian hanya mencapai sekitar **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-openai2021-1)</sup>. Hasil ini menunjukkan bahwa satu kesalahan kecil dalam rantai penalaran dapat menyebabkan jawaban yang sepenuhnya salah.

### Terobosan Metodologi: Chain-of-Thought

Terobosan dalam penyelesaian soal GSM8K adalah pendekatan **«rantai penalaran»** (**Chain-of-Thought, CoT**). Pada tahun 2022, para peneliti dari Google menunjukkan bahwa jika model didorong untuk menuliskan langkah-langkah penyelesaian secara eksplisit sebelum memberikan jawaban, akurasi meningkat secara signifikan. Model **PaLM** (540 miliar parameter) dengan menggunakan CoT mencapai akurasi **58%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-google_cot-4)</sup>. Penerapan teknik yang lebih canggih yaitu **self-consistency** (menghasilkan beberapa varian penyelesaian dan memilih jawaban yang paling sering muncul) memungkinkan peningkatan akurasi hingga **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-google_cot-4)</sup>.

### Melampaui Tingkat Kemampuan Manusia

Mulai tahun 2023, model-model generatif terbaru telah melampaui tingkat kemampuan manusia pada benchmark ini.

- **GPT-4** dari OpenAI dalam mode *few-shot CoT* (ketika beberapa contoh soal yang telah diselesaikan diberikan dalam prompt) mencapai akurasi sekitar **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-gpt4_92-5)</sup>, dan dengan strategi tambahan — hingga **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** dari Anthropic menunjukkan hasil **88%**, sementara versi yang lebih baru **Claude 3** — sekitar **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-klu_benchmark-3)</sup>.

Angka-angka yang tinggi ini mencerminkan kemajuan signifikan dalam kemampuan penalaran LLM, namun juga mengindikasikan bahwa GSM8K mulai menjadi "hampir terpecahkan" bagi model-model mutakhir, yang mendorong pengembangan benchmark yang lebih menantang seperti **MATH** dan **MMLU**.

## Peran dalam Pelatihan dan Pengembangan Model

Selain untuk evaluasi, GSM8K secara aktif digunakan untuk **pelatihan dan peningkatan** model.

- **Fine-tuning (penyesuaian lanjutan)**: Data latih dengan penyelesaian langkah demi langkah merupakan sumber daya berharga untuk fine-tuning model dalam logika matematika.
- **Pelatihan verifikator**: Dalam karya asli OpenAI, sebagian data GSM8K digunakan untuk melatih model **verifikator** terpisah yang menilai kebenaran solusi yang dihasilkan. Pendekatan pelatihan terpisah antara generator dan kritikus terbukti efektif<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Ketersediaan sejumlah besar contoh memungkinkan para peneliti mengembangkan dan menyempurnakan teknik prompt, seperti **Chain-of-Thought** dan **Tree-of-Thought**, yang melatih model untuk bernalar tanpa mengubah bobotnya.

## Tautan

- Halaman dataset di Papers With Code
- Repositori resmi di GitHub

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Catatan

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ID)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
