---
title: "MATH Benchmark (ID)"
source: "https://systems-analysis.info/int/MATH_Benchmark_(ID)"
wiki: "systems-analysis.info/int"
article: "MATH_Benchmark_(ID)"
language: "id"
categories:
  - "Category:Indonesian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3971
wiki_created_at: 2026-09-06T23:28:40Z
wiki_modified_at: 2026-09-06T23:28:40Z
downloaded_at: 2026-09-07T22:59:57Z
---

# MATH Benchmark (ID)

**MATH** (akronim dari bahasa Inggris **Mathematics Aptitude Test of Heuristics**) — adalah dataset besar dan benchmark untuk mengevaluasi kemampuan matematika dan keterampilan pemecahan masalah pada large language model (LLM). Dataset ini diperkenalkan pada tahun 2021 oleh sekelompok peneliti yang dipimpin oleh **Dan Hendrycks** dan memuat **12.500 soal** yang diambil dari kompetisi matematika Amerika untuk siswa sekolah menengah atas, seperti AMC 10, AMC 12, dan AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

Soal-soal mencakup berbagai bidang (aljabar, geometri, teori bilangan, kombinatorika, dan lain-lain) serta memiliki gradasi berdasarkan tingkat kesulitan. Berbeda dengan soal-soal pelajaran standar, soal-soal ini kerap memerlukan pendekatan kreatif dan metode heuristik, bukan sekadar penerapan rumus secara langsung. Setiap soal disertai solusi langkah demi langkah yang lengkap beserta jawaban akhir, sehingga MATH menjadi sumber daya yang berharga baik untuk pelatihan maupun pengujian model<sup>[\[2\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-llm_eval_datasets-2)</sup>.

## Struktur dan Karakteristik Dataset

Benchmark MATH memiliki sejumlah karakteristik utama yang menjadikannya alat evaluasi yang menantang dan andal.

### Format Soal

Semua soal dan solusi disajikan dalam format LaTeX, sedangkan untuk mendeskripsikan gambar geometri digunakan bahasa **Asymptote**. Hal ini memungkinkan semua kondisi soal, termasuk gambar, ditampilkan dalam bentuk teks yang dapat diproses oleh language model. Setiap soal dilabeli berdasarkan tujuh bidang matematika dan lima tingkat kesulitan<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

### Evaluasi Otomatis

Jawaban akhir dalam dataset diapit oleh format khusus \`\boxed{...}\` dan dinormalisasi ke standar yang ketat (misalnya, pecahan dalam bentuk paling sederhana). Hal ini memungkinkan evaluasi otomatis model berdasarkan metrik **exact match** (*exact match*), yang menghilangkan subjektivitas dan ambiguitas dalam pemeriksaan hasil. Model harus memberikan jawaban yang benar-benar tepat agar soal dianggap terpecahkan<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

## Kesulitan Soal dan Tingkat Kemampuan Manusia

MATH merupakan salah satu tes matematika paling sulit bagi AI. Soal-soalnya menantang bahkan bagi orang-orang dengan latar belakang matematika yang kuat.

- Dalam penelitian terhadap dataset ini, sekelompok **mahasiswa universitas** diuji dengan hasil mulai dari **~40%** hingga **~90%** bagi para pemenang olimpiade.
- Bahkan pemegang tiga medali emas Olimpiade Matematika Internasional pun tidak berhasil menyelesaikan semua soal tanpa kesalahan<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

Hal ini menunjukkan bahwa untuk berhasil menyelesaikan soal MATH diperlukan tidak hanya pengetahuan, tetapi juga ketepatan tinggi dan intuisi matematika.

## Hasil Model dan Kemajuan dalam Pemecahan Soal

### Hasil Awal (2021)

Saat benchmark diluncurkan pada tahun 2021, bahkan model-model terbesar sekalipun menunjukkan hasil yang sangat rendah.

- Model **GPT-3** (175 miliar parameter) hanya mampu menyelesaikan sekitar **5%** soal dengan benar.
- Versi fine-tuning dari **GPT-2** menunjukkan akurasi 6–7%<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

Para penulis menyimpulkan bahwa sekadar meningkatkan skala model hampir tidak berdampak pada performa, dan pendekatan algoritmik baru diperlukan untuk mencapai kemajuan<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-lang_models_surprised-3)</sup>.

### Terobosan Minerva dan GPT-4 (2022–2023)

Terobosan terjadi dengan munculnya model-model yang dilatih secara khusus pada teks ilmiah dan metode pemecahan baru.

- Pada tahun 2022, model **Google Minerva** mencapai akurasi sekitar **50%**, menunjukkan bahwa kombinasi skala dan pelatihan khusus dapat meningkatkan kualitas pemecahan soal secara drastis<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-lang_models_surprised-3)</sup>.
- Pada tahun 2023, **GPT-4** dari OpenAI mencatatkan lonjakan baru. Dengan menggunakan berbagai alat bantu, model ini berhasil meningkatkan hasilnya secara signifikan:
  - Dengan **Code Interpreter** (eksekusi kode untuk memverifikasi perhitungan), akurasi mencapai hampir **70%**.
  - Dengan metode *code-based self-verification* (verifikasi mandiri dan koreksi kesalahan menggunakan kode), rekor **84,3%** soal terpecahkan berhasil diraih<sup>[\[4\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-decoder_gpt4-4)</sup>.

Hasil ini sebanding dengan tingkat kemampuan peserta manusia yang kuat dan mendekati ambang batas tingkat ahli.

## Signifikansi dan Pengaruh

Benchmark MATH memainkan peran kunci dalam pengembangan kemampuan matematika LLM. Benchmark ini secara jelas menunjukkan bahwa untuk memecahkan soal-soal sulit, sekadar penskalaan tidak cukup, melainkan diperlukan pendekatan-pendekatan baru, seperti:

- Pelatihan menggunakan solusi langkah demi langkah yang lengkap.
- Pelatihan khusus pada data ilmiah.
- Penggunaan alat bantu eksternal untuk komputasi dan verifikasi.

Meski telah terjadi kemajuan yang signifikan, MATH tetap menjadi ujian yang penting dan menantang. Benchmark ini terus berfungsi sebagai indikator tingkat kemampuan berpikir matematis pada LLM dan mendorong penelitian di bidang pemecahan soal yang andal yang memerlukan penalaran multi-langkah<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_note-hendrycks2021-1)</sup>.

## Pranala Luar

- Repositori resmi dataset MATH di GitHub
- Halaman dataset di Papers With Code

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Catatan

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH_Benchmark_(ID)#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
