---
title: "GSM8K (Grade School Math 8K) (ES)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 2493
wiki_created_at: 2026-09-06T23:05:02Z
wiki_modified_at: 2026-09-06T23:05:02Z
downloaded_at: 2026-09-07T22:51:41Z
---

# GSM8K (Grade School Math 8K) (ES)

**GSM8K** (**Grade School Math 8K**) es un conjunto de datos de referencia que contiene alrededor de 8.500 problemas de matemáticas de nivel escolar. Fue creado en 2021 por investigadores de **OpenAI** para evaluar y desarrollar las capacidades de los modelos de lenguaje grandes (LLM) para el razonamiento matemático de múltiples pasos<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-openai2021-1)</sup>. GSM8K se ha convertido en uno de los benchmarks clave para medir el progreso en el campo del razonamiento matemático de la inteligencia artificial.

Cada problema en el conjunto de datos es una breve historia de texto cuya solución requiere la ejecución de 2 a 8 operaciones aritméticas secuenciales (suma, resta, multiplicación, división). A pesar de su aparente simplicidad, los problemas requieren una comprensión profunda del texto y un razonamiento lógico, lo que los hace difíciles para muchos LLM<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-pwc-2)</sup>.

## Características clave

### Volumen y estructura

El conjunto de datos GSM8K contiene aproximadamente **8500 problemas**, que se dividen en dos partes:

- **Conjunto de entrenamiento**: ~7500 problemas, destinados al ajuste fino (*fine-tuning*) de los modelos. Cada problema viene con una solución detallada paso a paso.
- **Conjunto de prueba**: ~1000 problemas, utilizados para la evaluación independiente del rendimiento de los modelos<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-openai2021-1)</sup>.

### Complejidad y contenido

Los problemas están diseñados deliberadamente para que un estudiante de secundaria competente pueda resolverlos, pero al mismo tiempo requieren un **razonamiento de múltiples pasos**. Esto permite evaluar no tanto los conocimientos matemáticos del modelo, sino su capacidad para descomponer un problema y ejecutar operaciones lógicas de forma secuencial.

### Diversidad lingüística

Las formulaciones de los problemas en GSM8K presentan una gran diversidad de estilos y construcciones lingüísticas. Esto se hace para verificar la capacidad de los modelos para comprender las condiciones de los problemas expresadas de diferentes maneras y evitar la "memorización" de plantillas específicas<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-klu_benchmark-3)</sup>.

## Historia y evolución de la evaluación de modelos

### Primeros modelos y resultados base

En el trabajo original de 2021, los autores demostraron que incluso los grandes modelos de la época, como **GPT-3** (175 mil millones de parámetros), tenían dificultades significativas con el conjunto de datos. Después del ajuste fino y el uso de un modelo verificador auxiliar, la precisión de la solución solo alcanzaba alrededor del **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-openai2021-1)</sup>. Este resultado demostró que un pequeño error en la cadena de razonamiento puede llevar a una respuesta completamente incorrecta.

### Técnicas innovadoras: Chain-of-Thought

Un gran avance en la resolución de problemas de GSM8K fue el enfoque de la **"cadena de pensamiento"** (**Chain-of-Thought, CoT**). En 2022, investigadores de Google demostraron que si se incita al modelo a detallar explícitamente los pasos de la solución antes de dar la respuesta, la precisión aumenta significativamente. El modelo **PaLM** (540 mil millones de parámetros) con el uso de CoT alcanzó una precisión del **58%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-google_cot-4)</sup>. El uso de la técnica más compleja de **self-consistency** (generar varias variantes de solución y elegir la respuesta más frecuente) permitió elevar la precisión al **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-google_cot-4)</sup>.

### Superando el nivel humano

A partir de 2023, los modelos generativos más recientes han superado el nivel humano en este benchmark.

- **GPT-4** de OpenAI en modo *few-shot CoT* (cuando en el prompt se dan varios ejemplos de problemas resueltos) alcanzó una precisión de alrededor del **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-gpt4_92-5)</sup>, y con estrategias adicionales, hasta un **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** de Anthropic mostró un resultado del **88%**, y la versión más reciente, **Claude 3**, alrededor del **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-klu_benchmark-3)</sup>.

Estos altos resultados demuestran un progreso significativo en las capacidades de razonamiento de los LLM, pero también indican que GSM8K se está convirtiendo en un problema "casi resuelto" para los modelos de vanguardia, lo que impulsa el desarrollo de benchmarks más complejos como **MATH** y **MMLU**.

## Papel en el entrenamiento y desarrollo de modelos

Además de la evaluación, GSM8K se utiliza activamente para el **entrenamiento y la mejora** de los modelos.

- **Fine-tuning (ajuste fino)**: El conjunto de entrenamiento con soluciones paso a paso es un recurso valioso para entrenar a los modelos en lógica matemática.
- **Entrenamiento de verificadores**: En el trabajo original de OpenAI, parte de los datos de GSM8K se utilizó para entrenar un modelo **verificador** separado, que evaluaba la corrección de las soluciones generadas. Este enfoque de entrenar por separado un generador y un crítico demostró su eficacia<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_note-openai2021-1)</sup>.
- **Ingeniería de prompts**: La disponibilidad de un gran número de ejemplos ha permitido a los investigadores desarrollar y perfeccionar técnicas de prompting, como **Chain-of-Thought** y **Tree-of-Thought**, que enseñan al modelo a razonar sin modificar sus pesos.

## Enlaces externos

- <a href="https://paperswithcode.com/dataset/gsm8k" class="external text" rel="nofollow">Página del conjunto de datos en Papers With Code</a>
- <a href="https://github.com/openai/grade-school-math" class="external text" rel="nofollow">Repositorio oficial en GitHub</a>

## Bibliografía

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Referencias

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(ES)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
