---
title: "MATH Benchmark (PL)"
source: "https://systems-analysis.info/int/MATH_Benchmark_(PL)"
wiki: "systems-analysis.info/int"
article: "MATH_Benchmark_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 3975
wiki_created_at: 2026-09-06T23:28:43Z
wiki_modified_at: 2026-09-06T23:28:43Z
downloaded_at: 2026-09-07T22:59:58Z
---

# MATH Benchmark (PL)

**MATH** (akronim od ang. **Mathematics Aptitude Test of Heuristics**) — to duży zbiór danych i benchmark służący do oceny zdolności matematycznych oraz umiejętności rozwiązywania zadań przez duże modele językowe (LLM). Zbiór danych został zaprezentowany w 2021 roku przez grupę badaczy pod kierownictwem **Dana Hendrycksa** (Dan Hendrycks) i zawiera **12 500 zadań** zaczerpniętych z amerykańskich konkursów matematycznych dla szkół średnich, takich jak AMC 10, AMC 12 i AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

Zadania obejmują szeroki zakres dziedzin (algebra, geometria, teoria liczb, kombinatoryka i inne) i posiadają gradację według poziomu trudności. W odróżnieniu od standardowych zadań szkolnych, często wymagają one twórczego podejścia i metod heurystycznych, a nie bezpośredniego stosowania wzorów. Każde zadanie jest opatrzone pełnym rozwiązaniem krok po kroku oraz odpowiedzią końcową, co czyni MATH cennym zasobem zarówno do trenowania, jak i testowania modeli<sup>[\[2\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-llm_eval_datasets-2)</sup>.

## Struktura i cechy charakterystyczne zbioru danych

Benchmark MATH posiada szereg kluczowych cech, które czynią go trudnym i wiarygodnym narzędziem oceny.

### Format zadań

Wszystkie zadania i rozwiązania są przedstawione w formacie LaTeX, a do opisu rysunków geometrycznych używany jest język **Asymptote**. Pozwala to przedstawić wszystkie warunki, w tym obrazy, w postaci tekstowej dostępnej do przetwarzania przez model językowy. Każdemu zadaniu przypisane są etykiety z siedmiu dziedzin matematyki oraz z pięciu poziomów trudności<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

### Automatyczna ocena

Ostateczne odpowiedzi w zbiorze danych są ujęte w specjalny format \`\boxed{...}\` i sprowadzone do ścisłego standardu (na przykład ułamki w postaci nieskracalnej). Umożliwia to automatyczną ocenę modeli według metryki **dokładnego dopasowania** (*exact match*), co wyklucza subiektywność i niejednoznaczność przy weryfikacji wyników. Model musi podać ściśle poprawną odpowiedź, aby zadanie zostało uznane za rozwiązane<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

## Trudność zadań i poziom człowieka

MATH jest jednym z najtrudniejszych testów matematycznych dla AI. Zadania stanowią wyzwanie nawet dla osób z silnym przygotowaniem matematycznym.

- W trakcie badania zbioru danych grupę **studentów uczelni wyższych** przetestowano z wynikami od **~40%** do **~90%** u zwycięzców olimpiad.
- Nawet zdobywca trzech złotych medali Międzynarodowej Olimpiady Matematycznej nie zdołał rozwiązać wszystkich zadań bez błędów<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

Pokazuje to, że do skutecznego rozwiązywania zadań MATH potrzebna jest nie tylko wiedza, lecz także wysoka precyzja i intuicja matematyczna.

## Wyniki modeli i postęp w rozwiązywaniu

### Pierwsze wyniki (2021)

Przy uruchomieniu benchmarku w 2021 roku nawet największe modele osiągały bardzo niskie wyniki.

- Model **GPT-3** (175 mld parametrów) zdołał poprawnie rozwiązać zaledwie około **5%** zadań.
- Dostrojone wersje **GPT-2** osiągały dokładność na poziomie 6–7%<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

Autorzy doszli do wniosku, że proste zwiększanie skali modeli niemal nie wpływa na wydajność i że do dalszego postępu wymagane są nowe podejścia algorytmiczne<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-lang_models_surprised-3)</sup>.

### Przełom Minervy i GPT-4 (2022–2023)

Przełom nastąpił wraz z pojawieniem się modeli specjalnie trenowanych na tekstach naukowych oraz nowych metod rozwiązywania.

- W 2022 roku model **Google Minerva** osiągnął dokładność na poziomie około **50%**, demonstrując, że połączenie skali i wyspecjalizowanego przygotowania może gwałtownie podnieść jakość rozwiązań<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-lang_models_surprised-3)</sup>.
- W 2023 roku **GPT-4** firmy OpenAI odnotował kolejny skok. Korzystając z narzędzi, model zdołał znacząco poprawić swoje wyniki:
  - Z **Code Interpreter** (wykonywanie kodu w celu weryfikacji obliczeń) dokładność osiągnęła prawie **70%**.
  - Z metodą *code-based self-verification* (samoweryfikacja i korekta błędów za pomocą kodu) ustanowiono rekord wynoszący **84,3%** rozwiązanych zadań<sup>[\[4\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-decoder_gpt4-4)</sup>.

Ten wynik jest porównywalny z poziomem silnych uczestników-ludzi i zbliża się do progu eksperckiego.

## Znaczenie i wpływ

Benchmark MATH odegrał kluczową rolę w rozwijaniu zdolności matematycznych LLM. Wyraźnie zademonstrował, że do rozwiązywania złożonych zadań nie wystarczy proste skalowanie, lecz konieczne są nowe podejścia, takie jak:

- Trenowanie na pełnych rozwiązaniach krok po kroku.
- Wyspecjalizowane przygotowanie na danych naukowych.
- Wykorzystanie zewnętrznych narzędzi do obliczeń i weryfikacji.

Pomimo znacznego postępu, MATH pozostaje ważnym i trudnym testem. Nadal służy jako wskaźnik poziomu myślenia matematycznego u LLM i stymuluje badania w dziedzinie niezawodnego rozwiązywania zadań wymagających wieloetapowego rozumowania<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_note-hendrycks2021-1)</sup>.

## Linki

- Oficjalne repozytorium zbioru danych MATH na GitHub
- Strona zbioru danych na Papers With Code

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH_Benchmark_(PL)#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
