GSM8K (Grade School Math 8K) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — adalah dataset benchmark yang berisi sekitar 8,5 ribu soal matematika tingkat sekolah dalam bentuk teks. Dataset ini dibuat pada tahun 2021 oleh para peneliti dari OpenAI untuk mengevaluasi dan mengembangkan kemampuan large language model (LLM) dalam melakukan penalaran matematika multi-langkah[1]. GSM8K telah menjadi salah satu benchmark utama untuk mengukur kemajuan dalam bidang penalaran matematika kecerdasan buatan.

Setiap soal dalam dataset berupa cerita teks singkat yang penyelesaiannya memerlukan 2 hingga 8 operasi aritmetika berurutan (penjumlahan, pengurangan, perkalian, pembagian). Meskipun tampak sederhana, soal-soal ini memerlukan pemahaman teks yang mendalam dan penalaran logis, sehingga menjadi tantangan tersendiri bagi banyak LLM[2].

Karakteristik Utama

Ukuran dan Struktur

Dataset GSM8K berisi sekitar 8500 soal yang dibagi menjadi dua bagian:

  • Data latih: ~7500 soal yang ditujukan untuk fine-tuning model. Setiap soal dilengkapi dengan penyelesaian langkah demi langkah yang rinci.
  • Data uji: ~1000 soal yang digunakan untuk evaluasi independen terhadap performa model[1].

Tingkat Kesulitan dan Konten

Soal-soal sengaja dirancang agar dapat diselesaikan oleh siswa sekolah menengah yang cakap, namun tetap memerlukan penalaran multi-langkah. Hal ini memungkinkan pengujian bukan sekadar pengetahuan matematika model, melainkan kemampuannya dalam mendekomposisi masalah dan menjalankan operasi logis secara berurutan.

Keragaman Linguistik

Formulasi soal dalam GSM8K memiliki keragaman gaya dan konstruksi bahasa yang besar. Ini dilakukan untuk menguji kemampuan model dalam memahami kondisi soal yang dinyatakan dengan berbagai cara, serta menghindari "hafalan" pola tertentu[3].

Sejarah dan Evolusi Evaluasi Model

Model Awal dan Hasil Dasar

Dalam karya asli tahun 2021, para penulis menunjukkan bahwa bahkan model-model besar pada masa itu, seperti GPT-3 (175 miliar parameter), mengalami kesulitan signifikan dengan dataset ini. Setelah fine-tuning dan penggunaan model verifikator tambahan, akurasi penyelesaian hanya mencapai sekitar 55%[1]. Hasil ini menunjukkan bahwa satu kesalahan kecil dalam rantai penalaran dapat menyebabkan jawaban yang sepenuhnya salah.

Terobosan Metodologi: Chain-of-Thought

Terobosan dalam penyelesaian soal GSM8K adalah pendekatan «rantai penalaran» (Chain-of-Thought, CoT). Pada tahun 2022, para peneliti dari Google menunjukkan bahwa jika model didorong untuk menuliskan langkah-langkah penyelesaian secara eksplisit sebelum memberikan jawaban, akurasi meningkat secara signifikan. Model PaLM (540 miliar parameter) dengan menggunakan CoT mencapai akurasi 58%[4]. Penerapan teknik yang lebih canggih yaitu self-consistency (menghasilkan beberapa varian penyelesaian dan memilih jawaban yang paling sering muncul) memungkinkan peningkatan akurasi hingga 74%[4].

Melampaui Tingkat Kemampuan Manusia

Mulai tahun 2023, model-model generatif terbaru telah melampaui tingkat kemampuan manusia pada benchmark ini.

  • GPT-4 dari OpenAI dalam mode few-shot CoT (ketika beberapa contoh soal yang telah diselesaikan diberikan dalam prompt) mencapai akurasi sekitar 92%[5], dan dengan strategi tambahan — hingga 97%[6].
  • Claude 2 dari Anthropic menunjukkan hasil 88%, sementara versi yang lebih baru Claude 3 — sekitar 95%[3].

Angka-angka yang tinggi ini mencerminkan kemajuan signifikan dalam kemampuan penalaran LLM, namun juga mengindikasikan bahwa GSM8K mulai menjadi "hampir terpecahkan" bagi model-model mutakhir, yang mendorong pengembangan benchmark yang lebih menantang seperti MATH dan MMLU.

Peran dalam Pelatihan dan Pengembangan Model

Selain untuk evaluasi, GSM8K secara aktif digunakan untuk pelatihan dan peningkatan model.

  • Fine-tuning (penyesuaian lanjutan): Data latih dengan penyelesaian langkah demi langkah merupakan sumber daya berharga untuk fine-tuning model dalam logika matematika.
  • Pelatihan verifikator: Dalam karya asli OpenAI, sebagian data GSM8K digunakan untuk melatih model verifikator terpisah yang menilai kebenaran solusi yang dihasilkan. Pendekatan pelatihan terpisah antara generator dan kritikus terbukti efektif[1].
  • Prompt Engineering: Ketersediaan sejumlah besar contoh memungkinkan para peneliti mengembangkan dan menyempurnakan teknik prompt, seperti Chain-of-Thought dan Tree-of-Thought, yang melatih model untuk bernalar tanpa mengubah bobotnya.

Tautan

  • Halaman dataset di Papers With Code
  • Repositori resmi di GitHub

Literatur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Catatan

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]