---
title: "GSM8K"
source: "https://systems-analysis.info/wiki/GSM8K"
wiki: "systems-analysis.info/wiki"
article: "GSM8K"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 118
wiki_created_at: 2026-09-06T21:55:18Z
wiki_modified_at: 2026-09-06T21:55:18Z
downloaded_at: 2026-09-07T22:17:31Z
---

# GSM8K

**GSM8K** (**Grade School Math 8K**) — это эталонный набор данных, содержащий около 8,5 тысяч текстовых задач по математике школьного уровня. Он был создан в 2021 году исследователями из **OpenAI** для оценки и развития способностей [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) к многошаговым математическим рассуждениям<sup>[\[1\]](https://systems-analysis.info/wiki/GSM8K#cite_note-openai2021-1)</sup>. GSM8K стал одним из ключевых бенчмарков для измерения прогресса в области математического мышления искусственного интеллекта.

Каждая задача в датасете представляет собой короткую текстовую историю, решение которой требует выполнения от 2 до 8 последовательных арифметических действий (сложение, вычитание, умножение, деление). Несмотря на кажущуюся простоту, задачи требуют глубокого понимания текста и логических рассуждений, что делает их сложными для многих LLM<sup>[\[2\]](https://systems-analysis.info/wiki/GSM8K#cite_note-pwc-2)</sup>.

## Ключевые характеристики

### Объем и структура

Датасет GSM8K содержит около **8500 задач**, которые разделены на две части:

- **Обучающая выборка**: ~7500 задач, предназначенных для дообучения (*[fine-tuning](https://systems-analysis.info/wiki/Fine-tuning "Fine-tuning")*) моделей. Каждая задача снабжена развернутым пошаговым решением.
- **Тестовая выборка**: ~1000 задач, используемых для независимой оценки производительности моделей<sup>[\[1\]](https://systems-analysis.info/wiki/GSM8K#cite_note-openai2021-1)</sup>.

### Сложность и содержание

Задачи намеренно составлены так, чтобы их мог решить способный ученик средней школы, но при этом они требуют **многошаговых рассуждений**. Это позволяет тестировать не столько математические знания модели, сколько её способность декомпозировать проблему и последовательно выполнять логические операции.

### Лингвистическое разнообразие

Формулировки задач в GSM8K отличаются большим разнообразием стилей и языковых конструкций. Это сделано для проверки способности моделей понимать условия задач, выраженные разными способами, и избегать "заучивания" конкретных шаблонов<sup>[\[3\]](https://systems-analysis.info/wiki/GSM8K#cite_note-klu_benchmark-3)</sup>.

## История и эволюция оценки моделей

### Ранние модели и базовые результаты

В оригинальной работе 2021 года авторы показали, что даже крупные модели того времени, такие как **GPT-3** (175 млрд параметров), испытывали значительные трудности с датасетом. После дообучения и использования вспомогательной модели-верификатора точность решения достигала лишь около **55%**<sup>[\[1\]](https://systems-analysis.info/wiki/GSM8K#cite_note-openai2021-1)</sup>. Этот результат продемонстрировал, что одна небольшая ошибка в цепочке рассуждений может привести к полностью неверному ответу.

### Прорывные методики: Chain-of-Thought

Прорывом в решении задач GSM8K стал подход **«цепочка рассуждений»** (**[Chain-of-Thought, CoT](https://systems-analysis.info/wiki/Chain-of-Thought_Prompting "Chain-of-Thought Prompting")**). В 2022 году исследователи из Google показали, что если побуждать модель явно расписывать шаги решения перед выводом ответа, точность значительно возрастает. Модель **[PaLM](https://systems-analysis.info/wiki/PaLM "PaLM")** (540 млрд параметров) с использованием CoT достигла **58%** точности<sup>[\[4\]](https://systems-analysis.info/wiki/GSM8K#cite_note-google_cot-4)</sup>. Применение более сложной техники **self-consistency** (генерация нескольких вариантов решения и выбор наиболее частого ответа) позволило поднять точность до **74%**<sup>[\[4\]](https://systems-analysis.info/wiki/GSM8K#cite_note-google_cot-4)</sup>.

### Преодоление человеческого уровня

Начиная с 2023 года, новейшие генеративные модели превзошли человеческий уровень на данном бенчмарке.

- **GPT-4** от OpenAI в режиме *few-shot CoT* (когда в подсказке даётся несколько примеров решённых задач) достиг точности около **92%**<sup>[\[5\]](https://systems-analysis.info/wiki/GSM8K#cite_note-gpt4_92-5)</sup>, а с дополнительными стратегиями — до **97%**<sup>[\[6\]](https://systems-analysis.info/wiki/GSM8K#cite_note-gpt4_97-6)</sup>.
- **[Claude](https://systems-analysis.info/wiki/Claude "Claude") 2** от Anthropic показал результат **88%**, а более новая версия **Claude 3** — около **95%**<sup>[\[3\]](https://systems-analysis.info/wiki/GSM8K#cite_note-klu_benchmark-3)</sup>.

Такие высокие показатели свидетельствуют о значительном прогрессе в способностях LLM к рассуждениям, однако также указывают на то, что GSM8K становится "почти решённым" для передовых моделей, что стимулирует разработку более сложных бенчмарков, таких как **MATH** и **[MMLU](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark")**.

## Роль в обучении и развитии моделей

Помимо оценки, GSM8K активно используется для **обучения и улучшения** моделей.

- **Fine-tuning (дообучение)**: Обучающая выборка с пошаговыми решениями является ценным ресурсом для дообучения моделей математической логике.
- **Обучение верификаторов**: В оригинальной работе OpenAI часть данных GSM8K использовалась для обучения отдельной модели-**верификатора**, которая оценивала правильность сгенерированных решений. Этот подход раздельного обучения генератора и критика доказал свою эффективность<sup>[\[1\]](https://systems-analysis.info/wiki/GSM8K#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Наличие большого числа примеров позволило исследователям разрабатывать и оттачивать техники подсказок, такие как **Chain-of-Thought** и **Tree-of-Thought**, которые обучают модель рассуждать без изменения её весов.

## См. также

- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [MMLU benchmark](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark")
- [Chain-of-Thought Prompting](https://systems-analysis.info/wiki/Chain-of-Thought_Prompting "Chain-of-Thought Prompting")
- [PaLM](https://systems-analysis.info/wiki/PaLM "PaLM")
- [MT-Bench benchmark](https://systems-analysis.info/wiki/MT-Bench_benchmark "MT-Bench benchmark")

## Ссылки

- <a href="https://paperswithcode.com/dataset/gsm8k" class="external text" rel="nofollow">Страница датасета на Papers With Code</a>
- <a href="https://github.com/openai/grade-school-math" class="external text" rel="nofollow">Официальный репозиторий на GitHub</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-openai2021-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/GSM8K#cite_ref-openai2021_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/GSM8K#cite_ref-openai2021_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/GSM8K#cite_ref-openai2021_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/GSM8K#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/wiki/GSM8K#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/GSM8K#cite_ref-klu_benchmark_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/GSM8K#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/GSM8K#cite_ref-google_cot_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/GSM8K#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/wiki/GSM8K#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/wiki/GSM8K#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
