---
title: "MATH Benchmark (BG)"
source: "https://systems-analysis.info/int/MATH_Benchmark_(BG)"
wiki: "systems-analysis.info/int"
article: "MATH_Benchmark_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3961
wiki_created_at: 2026-09-06T23:28:32Z
wiki_modified_at: 2026-09-06T23:28:32Z
downloaded_at: 2026-09-07T22:59:54Z
---

# MATH Benchmark (BG)

**MATH** (акроним от англ. **Mathematics Aptitude Test of Heuristics**) — това е голям dataset и benchmark за оценка на математическите способности и умения за решаване на задачи при големи езикови модели (LLM). Датасетът е представен през 2021 година от група изследователи под ръководството на **Дан Хендрикс** (Dan Hendrycks) и съдържа **12 500 задачи**, взети от американски математически състезания за гимназисти, като AMC 10, AMC 12 и AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

Задачите обхващат широк спектър от области (алгебра, геометрия, теория на числата, комбинаторика и др.) и имат градация по ниво на сложност. За разлика от стандартните учебни задачи, те често изискват творчески подход и евристични методи, а не пряко прилагане на формули. Всяко задание е придружено от пълно стъпка-по-стъпка решение и окончателен отговор, което прави MATH ценен ресурс както за обучение, така и за тестване на модели<sup>[\[2\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-llm_eval_datasets-2)</sup>.

## Структура и особености на датасета

Benchmark-ът MATH притежава редица ключови особености, които го правят сложен и надежден инструмент за оценка.

### Формат на задачите

Всички задания и решения са представени във формат LaTeX, а за описание на геометрични чертежи се използва езикът **Asymptote**. Това позволява всички условия, включително изображенията, да бъдат представени в текстов вид, достъпен за обработка от езиков модел. На всяка задача са присвоени етикети по седем области на математиката и по пет нива на сложност<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

### Автоматична оценка

Окончателните отговори в датасета са поставени в специален формат \`\boxed{...}\` и приведени към строг стандарт (например дроби в несъкратим вид). Това позволява автоматична оценка на моделите по метриката **точно съвпадение** (*exact match*), което изключва субективността и неяснотата при проверката на резултатите. Моделът трябва да даде строго верен отговор, за да се счита задачата за решена<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

## Сложност на задачите и човешко ниво

MATH е един от най-трудните математически тестове за ИИ. Задачите представляват предизвикателство дори за хора с висока математическа подготовка.

- По време на изследването на датасета група **университетски студенти** е тествана с резултати от **~40%** до **~90%** при победителите в олимпиади.
- Дори притежател на три златни медала от Международната математическа олимпиада не е успял да реши всички задания без грешки<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

Това показва, че за успешно решаване на задачите от MATH е необходимо не само знание, но и висока точност и математическа интуиция.

## Резултати на моделите и напредък в решаването

### Първоначални резултати (2021)

При стартирането на benchmark-а през 2021 година дори най-големите модели показваха изключително ниски резултати.

- Моделът **GPT-3** (175 млрд. параметра) успя да реши правилно едва около **5%** от задачите.
- Fine-tuned версиите на **GPT-2** показваха точност от 6–7%<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

Авторите стигнаха до извода, че простото увеличаване на мащаба на моделите почти не влияе на производителността и за напредък са необходими нови алгоритмични подходи<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-lang_models_surprised-3)</sup>.

### Пробив на Minerva и GPT-4 (2022–2023)

Пробивът настъпи с появата на модели, специално обучени върху научни текстове, и нови методи за решаване.

- През 2022 година моделът **Google Minerva** достигна точност от около **50%**, демонстрирайки, че съчетанието от мащаб и специализирана подготовка може рязко да повиши качеството на решаване<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-lang_models_surprised-3)</sup>.
- През 2023 година **GPT-4** на OpenAI показа нов скок. Използвайки инструменти, моделът успя значително да подобри резултатите си:
  - С **Code Interpreter** (изпълнение на код за проверка на изчисленията) точността достигна почти **70%**.
  - С метода *code-based self-verification* (самопроверка и коригиране на грешки с помощта на код) беше поставен рекорд от **84,3%** решени задачи<sup>[\[4\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-decoder_gpt4-4)</sup>.

Този резултат е съпоставим с нивото на силни участници-хора и се доближава до експертния праг.

## Значение и влияние

Benchmark-ът MATH изигра ключова роля в развитието на математическите способности на LLM. Той нагледно демонстрира, че за решаване на сложни задачи простото мащабиране не е достатъчно, а са необходими нови подходи, като:

- Обучение върху пълни стъпка-по-стъпка решения.
- Специализирана подготовка върху научни данни.
- Използване на външни инструменти за изчисления и верификация.

Въпреки значителния напредък, MATH остава важно и трудно изпитание. Той продължава да служи като индикатор за нивото на математическото мислене при LLM и стимулира изследванията в областта на надеждното решаване на задачи, изискващи многостъпкови разсъждения<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_note-hendrycks2021-1)</sup>.

## Връзки

- Официално хранилище на датасета MATH в GitHub
- Страница на датасета в Papers With Code

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Бележки

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH_Benchmark_(BG)#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
