---
title: "GSM8K (Grade School Math 8K) (KO)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2501
wiki_created_at: 2026-09-06T23:05:11Z
wiki_modified_at: 2026-09-06T23:05:11Z
downloaded_at: 2026-09-07T22:51:44Z
---

# GSM8K (Grade School Math 8K) (KO)

**GSM8K** (**Grade School Math 8K**) — 초등·중학교 수준의 수학 문제 약 8,500개로 구성된 표준 데이터셋입니다. 이 데이터셋은 2021년 **OpenAI** 연구자들이 대형 언어 모델(LLM)의 다단계 수학적 추론 능력을 평가하고 발전시키기 위해 제작했습니다<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-openai2021-1)</sup>. GSM8K는 인공지능의 수학적 사고 능력 발전을 측정하는 핵심 benchmark 중 하나로 자리잡았습니다.

데이터셋의 각 문제는 짧은 텍스트 형식의 이야기로 구성되며, 풀이를 위해 덧셈·뺄셈·곱셈·나눗셈 등 2~8개의 순차적 산술 연산이 필요합니다. 겉으로는 단순해 보이지만, 문제들은 깊은 텍스트 이해력과 논리적 추론을 요구하기 때문에 많은 LLM에게 상당한 난이도를 가집니다<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-pwc-2)</sup>.

## 주요 특징

### 규모 및 구조

GSM8K 데이터셋은 약 **8,500개의 문제**를 포함하며, 두 부분으로 나뉩니다:

- **학습 데이터셋**: 약 7,500개의 문제로, 모델의 *fine-tuning*(파인튜닝)을 위해 설계되었습니다. 각 문제에는 상세한 단계별 풀이가 제공됩니다.
- **테스트 데이터셋**: 약 1,000개의 문제로, 모델 성능의 독립적 평가에 사용됩니다<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-openai2021-1)</sup>.

### 난이도 및 내용

문제들은 우수한 중학생이 풀 수 있는 수준으로 의도적으로 설계되었지만, **다단계 추론**을 요구합니다. 이를 통해 모델의 수학적 지식보다는 문제를 분해하고 논리적 연산을 순차적으로 수행하는 능력을 테스트합니다.

### 언어적 다양성

GSM8K의 문제 표현은 다양한 문체와 언어적 구성을 특징으로 합니다. 이는 모델이 다양한 방식으로 표현된 문제 조건을 이해하는 능력을 검증하고, 특정 패턴을 단순 암기하는 것을 방지하기 위한 것입니다<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-klu_benchmark-3)</sup>.

## 모델 평가의 역사 및 발전

### 초기 모델과 기본 결과

2021년 원본 논문에서 저자들은 당시 **GPT-3** (1,750억 파라미터)와 같은 대형 모델조차 이 데이터셋에서 상당한 어려움을 겪었음을 보였습니다. fine-tuning과 보조 검증 모델을 활용한 후에도 정확도는 약 **55%**에 불과했습니다<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-openai2021-1)</sup>. 이 결과는 추론 과정에서 발생한 작은 오류 하나가 완전히 잘못된 답으로 이어질 수 있음을 보여주었습니다.

### 획기적인 방법론: Chain-of-Thought

GSM8K 문제 풀이의 돌파구는 **「추론 사슬」** (**Chain-of-Thought, CoT**) 방식이었습니다. 2022년 Google 연구자들은 모델이 답을 도출하기 전에 풀이 단계를 명시적으로 서술하도록 유도하면 정확도가 크게 향상됨을 보였습니다. CoT를 적용한 **PaLM** (5,400억 파라미터) 모델은 **58%**의 정확도를 달성했습니다<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-google_cot-4)</sup>. 더욱 복잡한 **self-consistency** 기법(여러 풀이를 생성하고 가장 빈번한 답을 선택)을 적용하면 정확도를 **74%**까지 높일 수 있었습니다<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-google_cot-4)</sup>.

### 인간 수준 초월

2023년부터 최신 생성형 모델들이 이 benchmark에서 인간 수준을 뛰어넘기 시작했습니다.

- OpenAI의 **GPT-4**는 *few-shot CoT* 방식(프롬프트에 몇 가지 풀이 예시를 제공하는 방식)으로 약 **92%**의 정확도를 달성했으며<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-gpt4_92-5)</sup>, 추가적인 전략을 적용하면 **97%**에 이릅니다<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-gpt4_97-6)</sup>.
- Anthropic의 **Claude 2**는 **88%**, 최신 버전인 **Claude 3**는 약 **95%**의 결과를 보였습니다<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-klu_benchmark-3)</sup>.

이러한 높은 성과는 LLM의 추론 능력이 크게 발전했음을 보여주지만, 동시에 GSM8K가 최첨단 모델에게는 사실상 «해결된» 문제가 되어가고 있음을 시사합니다. 이는 **MATH**나 **MMLU**와 같은 더 어려운 benchmark의 개발을 촉진하고 있습니다.

## 모델 학습 및 발전에서의 역할

평가 외에도 GSM8K는 모델의 **학습 및 개선**에 적극적으로 활용됩니다.

- **Fine-tuning (파인튜닝)**: 단계별 풀이가 포함된 학습 데이터셋은 모델에게 수학적 논리를 fine-tuning하는 데 있어 귀중한 자원입니다.
- **검증 모델 학습**: OpenAI의 원본 논문에서 GSM8K 데이터의 일부는 생성된 풀이의 정확성을 평가하는 별도의 **검증기(verifier)** 모델을 학습하는 데 사용되었습니다. 이처럼 생성기와 비평기를 분리하여 학습하는 방식은 그 효과가 입증되었습니다<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: 다수의 예시 문제를 활용할 수 있어, 연구자들은 모델의 가중치를 변경하지 않고도 모델이 추론하도록 유도하는 **Chain-of-Thought** 및 **Tree-of-Thought**와 같은 프롬프트 기법을 개발하고 정교하게 다듬을 수 있었습니다.

## 외부 링크

- Papers With Code의 데이터셋 페이지
- GitHub 공식 저장소

## 참고 문헌

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## 각주

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(KO)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
