MATH Benchmark (ES)
MATH (acrónimo del inglés Mathematics Aptitude Test of Heuristics) es un gran conjunto de datos y benchmark para evaluar las capacidades matemáticas y las habilidades de resolución de problemas de los grandes modelos de lenguaje (LLM). El conjunto de datos fue presentado en 2021 por un grupo de investigadores liderado por Dan Hendrycks y contiene 12 500 problemas tomados de competiciones de matemáticas de secundaria de Estados Unidos, como AMC 10, AMC 12 y AIME[1].
Los problemas abarcan un amplio espectro de áreas (álgebra, geometría, teoría de números, combinatoria, etc.) y están clasificados por nivel de dificultad. A diferencia de los problemas académicos estándar, a menudo requieren un enfoque creativo y métodos heurísticos en lugar de la aplicación directa de fórmulas. Cada problema viene acompañado de una solución completa paso a paso y la respuesta final, lo que convierte a MATH en un recurso valioso tanto para el entrenamiento como para la evaluación de modelos[2].
Estructura y características del conjunto de datos
El benchmark MATH posee varias características clave que lo convierten en una herramienta de evaluación compleja y fiable.
Formato de los problemas
Todos los problemas y soluciones se presentan en formato LaTeX, y para la descripción de los diagramas geométricos se utiliza el lenguaje Asymptote. Esto permite presentar todas las condiciones, incluidas las imágenes, en formato de texto, accesible para el procesamiento por un modelo de lenguaje. A cada problema se le asignan etiquetas correspondientes a siete áreas de las matemáticas y cinco niveles de dificultad[1].
Evaluación automática
Las respuestas finales en el conjunto de datos están encerradas en el formato especial `\boxed{...}` y se ajustan a un estándar estricto (por ejemplo, las fracciones se presentan en su forma irreducible). Esto permite una evaluación automática de los modelos utilizando la métrica de coincidencia exacta (exact match), lo que elimina la subjetividad y la ambigüedad en la verificación de los resultados. El modelo debe proporcionar la respuesta estrictamente correcta para que el problema se considere resuelto[1].
Complejidad de los problemas y nivel humano
MATH es una de las pruebas de matemáticas más difíciles para la IA. Los problemas presentan un desafío incluso para personas con una sólida formación matemática.
- Durante el estudio del conjunto de datos, se evaluó a un grupo de estudiantes universitarios, con resultados que oscilaron entre ~40% y ~90% para los ganadores de olimpiadas.
- Incluso un ganador de tres medallas de oro en la Olimpiada Internacional de Matemática no pudo resolver todos los problemas sin cometer errores[1].
Esto demuestra que para resolver con éxito los problemas de MATH se requiere no solo conocimiento, sino también una alta precisión e intuición matemática.
Resultados de los modelos y progreso en la resolución
Resultados iniciales (2021)
En el lanzamiento del benchmark en 2021, incluso los modelos más grandes mostraron resultados extremadamente bajos.
- El modelo GPT-3 (175 mil millones de parámetros) solo pudo resolver correctamente alrededor del 5% de los problemas.
- Las versiones reentrenadas de GPT-2 mostraron una precisión del 6-7%[1].
Los autores concluyeron que el simple aumento de la escala de los modelos apenas afectaba el rendimiento y que se necesitaban nuevos enfoques algorítmicos para lograr avances[3].
El avance de Minerva y GPT-4 (2022-2023)
El gran avance se produjo con la aparición de modelos entrenados específicamente en textos científicos y con nuevos métodos de resolución.
- En 2022, el modelo Minerva de Google alcanzó una precisión de alrededor del 50%, demostrando que la combinación de escala y entrenamiento especializado podía mejorar drásticamente la calidad de la resolución[3].
- En 2023, GPT-4 de OpenAI logró un nuevo salto. Utilizando herramientas, el modelo pudo mejorar significativamente sus resultados:
- Con Code Interpreter (ejecución de código para verificar cálculos), la precisión alcanzó casi el 70%.
- Con el método de code-based self-verification (autoverificación y corrección de errores mediante código), se estableció un récord del 84,3% de los problemas resueltos[4].
Este resultado es comparable al nivel de los participantes humanos más fuertes y se acerca al umbral de los expertos.
Significado e influencia
El benchmark MATH ha desempeñado un papel clave en el desarrollo de las capacidades matemáticas de los LLM. Demostró claramente que para resolver problemas complejos no basta con el simple escalado, sino que se necesitan nuevos enfoques, tales como:
- Entrenamiento con soluciones completas paso a paso.
- Entrenamiento especializado en datos científicos.
- Uso de herramientas externas para cálculos y verificación.
A pesar de los avances significativos, MATH sigue siendo una prueba importante y desafiante. Continúa sirviendo como un indicador del nivel de razonamiento matemático en los LLM y estimula la investigación en el campo de la resolución fiable de problemas que requieren razonamiento de múltiples pasos[1].
Lecturas adicionales
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Enlaces externos
- Repositorio oficial del conjunto de datos MATH en GitHub
- Página del conjunto de datos en Papers With Code
Referencias
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]