GSM8K (Grade School Math 8K) (KO)
GSM8K (Grade School Math 8K) — 초등·중학교 수준의 수학 문제 약 8,500개로 구성된 표준 데이터셋입니다. 이 데이터셋은 2021년 OpenAI 연구자들이 대형 언어 모델(LLM)의 다단계 수학적 추론 능력을 평가하고 발전시키기 위해 제작했습니다[1]. GSM8K는 인공지능의 수학적 사고 능력 발전을 측정하는 핵심 benchmark 중 하나로 자리잡았습니다.
데이터셋의 각 문제는 짧은 텍스트 형식의 이야기로 구성되며, 풀이를 위해 덧셈·뺄셈·곱셈·나눗셈 등 2~8개의 순차적 산술 연산이 필요합니다. 겉으로는 단순해 보이지만, 문제들은 깊은 텍스트 이해력과 논리적 추론을 요구하기 때문에 많은 LLM에게 상당한 난이도를 가집니다[2].
주요 특징
규모 및 구조
GSM8K 데이터셋은 약 8,500개의 문제를 포함하며, 두 부분으로 나뉩니다:
- 학습 데이터셋: 약 7,500개의 문제로, 모델의 fine-tuning(파인튜닝)을 위해 설계되었습니다. 각 문제에는 상세한 단계별 풀이가 제공됩니다.
- 테스트 데이터셋: 약 1,000개의 문제로, 모델 성능의 독립적 평가에 사용됩니다[1].
난이도 및 내용
문제들은 우수한 중학생이 풀 수 있는 수준으로 의도적으로 설계되었지만, 다단계 추론을 요구합니다. 이를 통해 모델의 수학적 지식보다는 문제를 분해하고 논리적 연산을 순차적으로 수행하는 능력을 테스트합니다.
언어적 다양성
GSM8K의 문제 표현은 다양한 문체와 언어적 구성을 특징으로 합니다. 이는 모델이 다양한 방식으로 표현된 문제 조건을 이해하는 능력을 검증하고, 특정 패턴을 단순 암기하는 것을 방지하기 위한 것입니다[3].
모델 평가의 역사 및 발전
초기 모델과 기본 결과
2021년 원본 논문에서 저자들은 당시 GPT-3 (1,750억 파라미터)와 같은 대형 모델조차 이 데이터셋에서 상당한 어려움을 겪었음을 보였습니다. fine-tuning과 보조 검증 모델을 활용한 후에도 정확도는 약 55%에 불과했습니다[1]. 이 결과는 추론 과정에서 발생한 작은 오류 하나가 완전히 잘못된 답으로 이어질 수 있음을 보여주었습니다.
획기적인 방법론: Chain-of-Thought
GSM8K 문제 풀이의 돌파구는 「추론 사슬」 (Chain-of-Thought, CoT) 방식이었습니다. 2022년 Google 연구자들은 모델이 답을 도출하기 전에 풀이 단계를 명시적으로 서술하도록 유도하면 정확도가 크게 향상됨을 보였습니다. CoT를 적용한 PaLM (5,400억 파라미터) 모델은 58%의 정확도를 달성했습니다[4]. 더욱 복잡한 self-consistency 기법(여러 풀이를 생성하고 가장 빈번한 답을 선택)을 적용하면 정확도를 74%까지 높일 수 있었습니다[4].
인간 수준 초월
2023년부터 최신 생성형 모델들이 이 benchmark에서 인간 수준을 뛰어넘기 시작했습니다.
- OpenAI의 GPT-4는 few-shot CoT 방식(프롬프트에 몇 가지 풀이 예시를 제공하는 방식)으로 약 92%의 정확도를 달성했으며[5], 추가적인 전략을 적용하면 97%에 이릅니다[6].
- Anthropic의 Claude 2는 88%, 최신 버전인 Claude 3는 약 95%의 결과를 보였습니다[3].
이러한 높은 성과는 LLM의 추론 능력이 크게 발전했음을 보여주지만, 동시에 GSM8K가 최첨단 모델에게는 사실상 «해결된» 문제가 되어가고 있음을 시사합니다. 이는 MATH나 MMLU와 같은 더 어려운 benchmark의 개발을 촉진하고 있습니다.
모델 학습 및 발전에서의 역할
평가 외에도 GSM8K는 모델의 학습 및 개선에 적극적으로 활용됩니다.
- Fine-tuning (파인튜닝): 단계별 풀이가 포함된 학습 데이터셋은 모델에게 수학적 논리를 fine-tuning하는 데 있어 귀중한 자원입니다.
- 검증 모델 학습: OpenAI의 원본 논문에서 GSM8K 데이터의 일부는 생성된 풀이의 정확성을 평가하는 별도의 검증기(verifier) 모델을 학습하는 데 사용되었습니다. 이처럼 생성기와 비평기를 분리하여 학습하는 방식은 그 효과가 입증되었습니다[1].
- Prompt Engineering: 다수의 예시 문제를 활용할 수 있어, 연구자들은 모델의 가중치를 변경하지 않고도 모델이 추론하도록 유도하는 Chain-of-Thought 및 Tree-of-Thought와 같은 프롬프트 기법을 개발하고 정교하게 다듬을 수 있었습니다.
외부 링크
- Papers With Code의 데이터셋 페이지
- GitHub 공식 저장소
참고 문헌
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
각주
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]