MATH Benchmark (BG)
MATH (акроним от англ. Mathematics Aptitude Test of Heuristics) — това е голям dataset и benchmark за оценка на математическите способности и умения за решаване на задачи при големи езикови модели (LLM). Датасетът е представен през 2021 година от група изследователи под ръководството на Дан Хендрикс (Dan Hendrycks) и съдържа 12 500 задачи, взети от американски математически състезания за гимназисти, като AMC 10, AMC 12 и AIME[1].
Задачите обхващат широк спектър от области (алгебра, геометрия, теория на числата, комбинаторика и др.) и имат градация по ниво на сложност. За разлика от стандартните учебни задачи, те често изискват творчески подход и евристични методи, а не пряко прилагане на формули. Всяко задание е придружено от пълно стъпка-по-стъпка решение и окончателен отговор, което прави MATH ценен ресурс както за обучение, така и за тестване на модели[2].
Структура и особености на датасета
Benchmark-ът MATH притежава редица ключови особености, които го правят сложен и надежден инструмент за оценка.
Формат на задачите
Всички задания и решения са представени във формат LaTeX, а за описание на геометрични чертежи се използва езикът Asymptote. Това позволява всички условия, включително изображенията, да бъдат представени в текстов вид, достъпен за обработка от езиков модел. На всяка задача са присвоени етикети по седем области на математиката и по пет нива на сложност[1].
Автоматична оценка
Окончателните отговори в датасета са поставени в специален формат `\boxed{...}` и приведени към строг стандарт (например дроби в несъкратим вид). Това позволява автоматична оценка на моделите по метриката точно съвпадение (exact match), което изключва субективността и неяснотата при проверката на резултатите. Моделът трябва да даде строго верен отговор, за да се счита задачата за решена[1].
Сложност на задачите и човешко ниво
MATH е един от най-трудните математически тестове за ИИ. Задачите представляват предизвикателство дори за хора с висока математическа подготовка.
- По време на изследването на датасета група университетски студенти е тествана с резултати от ~40% до ~90% при победителите в олимпиади.
- Дори притежател на три златни медала от Международната математическа олимпиада не е успял да реши всички задания без грешки[1].
Това показва, че за успешно решаване на задачите от MATH е необходимо не само знание, но и висока точност и математическа интуиция.
Резултати на моделите и напредък в решаването
Първоначални резултати (2021)
При стартирането на benchmark-а през 2021 година дори най-големите модели показваха изключително ниски резултати.
- Моделът GPT-3 (175 млрд. параметра) успя да реши правилно едва около 5% от задачите.
- Fine-tuned версиите на GPT-2 показваха точност от 6–7%[1].
Авторите стигнаха до извода, че простото увеличаване на мащаба на моделите почти не влияе на производителността и за напредък са необходими нови алгоритмични подходи[3].
Пробив на Minerva и GPT-4 (2022–2023)
Пробивът настъпи с появата на модели, специално обучени върху научни текстове, и нови методи за решаване.
- През 2022 година моделът Google Minerva достигна точност от около 50%, демонстрирайки, че съчетанието от мащаб и специализирана подготовка може рязко да повиши качеството на решаване[3].
- През 2023 година GPT-4 на OpenAI показа нов скок. Използвайки инструменти, моделът успя значително да подобри резултатите си:
- С Code Interpreter (изпълнение на код за проверка на изчисленията) точността достигна почти 70%.
- С метода code-based self-verification (самопроверка и коригиране на грешки с помощта на код) беше поставен рекорд от 84,3% решени задачи[4].
Този резултат е съпоставим с нивото на силни участници-хора и се доближава до експертния праг.
Значение и влияние
Benchmark-ът MATH изигра ключова роля в развитието на математическите способности на LLM. Той нагледно демонстрира, че за решаване на сложни задачи простото мащабиране не е достатъчно, а са необходими нови подходи, като:
- Обучение върху пълни стъпка-по-стъпка решения.
- Специализирана подготовка върху научни данни.
- Използване на външни инструменти за изчисления и верификация.
Въпреки значителния напредък, MATH остава важно и трудно изпитание. Той продължава да служи като индикатор за нивото на математическото мислене при LLM и стимулира изследванията в областта на надеждното решаване на задачи, изискващи многостъпкови разсъждения[1].
Връзки
- Официално хранилище на датасета MATH в GitHub
- Страница на датасета в Papers With Code
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]