MATH Benchmark (TR)
MATH (İngilizce Mathematics Aptitude Test of Heuristics kısaltması) — büyük dil modellerinin (LLM) matematiksel yeteneklerini ve problem çözme becerilerini değerlendirmeye yönelik kapsamlı bir dataset ve benchmark'tır. Dataset, 2021 yılında Dan Hendrycks liderliğindeki bir araştırmacı grubu tarafından tanıtılmış olup AMC 10, AMC 12 ve AIME gibi Amerikan lise matematik yarışmalarından alınmış 12.500 problem içermektedir[1].
Problemler geniş bir konu yelpazesini kapsamaktadır (cebir, geometri, sayılar teorisi, kombinatorik vb.) ve zorluk düzeyine göre derecelendirilmiştir. Standart ders kitabı problemlerinden farklı olarak, bu problemler çoğunlukla doğrudan formül uygulaması yerine yaratıcı düşünce ve sezgisel yöntemler gerektirmektedir. Her problem, adım adım tam bir çözüm ve nihai cevapla birlikte sunulmakta; bu da MATH'ı hem model eğitimi hem de test edilmesi açısından değerli bir kaynak hâline getirmektedir[2].
Veri Kümesinin Yapısı ve Özellikleri
MATH benchmark, onu zorlu ve güvenilir bir değerlendirme aracı yapan bir dizi temel özelliğe sahiptir.
Problem Formatı
Tüm problemler ve çözümler LaTeX formatında sunulmakta; geometrik şekillerin betimlenmesinde ise Asymptote dili kullanılmaktadır. Bu sayede görseller dahil tüm koşullar, dil modeli tarafından işlenebilecek metin biçiminde ifade edilebilmektedir. Her probleme yedi matematik alanı ve beş zorluk seviyesine göre etiket atanmaktadır[1].
Otomatik Değerlendirme
Veri kümesindeki nihai cevaplar özel `\boxed{...}` formatında sunulmakta ve katı bir standarda getirilmektedir (örneğin, kesirler sadeleştirilmiş biçimde). Bu durum, modellerin tam eşleşme (exact match) metriğiyle otomatik olarak değerlendirilmesine olanak tanımakta; sonuçların kontrolünde öznel yoruma ve belirsizliğe yer bırakmamaktadır. Bir problemin çözülmüş sayılabilmesi için modelin tam olarak doğru cevabı üretmesi gerekmektedir[1].
Problem Zorluğu ve İnsan Başarı Düzeyi
MATH, yapay zeka için en zorlu matematik testlerinden biridir. Problemler, güçlü bir matematik altyapısına sahip insanlar için bile güçlük oluşturmaktadır.
- Araştırma sürecinde bir grup üniversite öğrencisi test edilmiş; sonuçlar, olimpiyat birincileri arasında ~%40 ile ~%90 arasında değişmiştir.
- Uluslararası Matematik Olimpiyatı'nda üç altın madalya kazanmış biri bile tüm problemleri hatasız çözmeyi başaramamıştır[1].
Bu durum, MATH problemlerini başarıyla çözebilmek için yalnızca bilginin değil, aynı zamanda yüksek doğruluk ve matematiksel sezginin de gerekli olduğunu göstermektedir.
Model Sonuçları ve Çözüm Sürecindeki İlerleme
İlk Sonuçlar (2021)
Benchmark'ın 2021'de kullanıma sunulduğu dönemde en büyük modeller bile son derece düşük sonuçlar sergiliyordu.
- GPT-3 modeli (175 milyar parametre) problemlerin yalnızca yaklaşık %5ini doğru çözebildi.
- Fine-tuning uygulanmış GPT-2 sürümleri %6-7 doğruluk gösterdi[1].
Yazarlar, modellerin ölçeğinin büyütülmesinin performans üzerinde neredeyse hiçbir etkisi olmadığı ve ilerleme için yeni algoritmik yaklaşımların gerektiği sonucuna vardı[3].
Minerva ve GPT-4 Atılımı (2022–2023)
Atılım, bilimsel metinler üzerinde özel olarak eğitilmiş modellerin ve yeni çözüm yöntemlerinin ortaya çıkmasıyla gerçekleşti.
- 2022 yılında Google Minerva modeli yaklaşık %50 doğruluğa ulaştı ve büyük ölçek ile özelleştirilmiş eğitimin birleşiminin çözüm kalitesini dramatik biçimde artırabileceğini ortaya koydu[3].
- 2023 yılında OpenAI'ın GPT-4 modeli yeni bir sıçrama gerçekleştirdi. Araçlardan yararlanarak model sonuçlarını önemli ölçüde iyileştirebildi:
- Code Interpreter (hesaplamaları doğrulamak için kod çalıştırma) ile doğruluk neredeyse %70e ulaştı.
- code-based self-verification (kod yardımıyla öz-denetim ve hata düzeltme) yöntemiyle %84,3 çözüm oranıyla yeni bir rekor kırıldı[4].
Bu sonuç, güçlü insan katılımcıların düzeyiyle karşılaştırılabilir nitelikte olup uzman eşiğine yaklaşmaktadır.
Önemi ve Etkisi
MATH benchmark, LLM'lerin matematiksel yeteneklerinin geliştirilmesinde kilit bir rol oynamıştır. Karmaşık problemlerin çözümü için yalnızca ölçek büyütmenin yetmediğini ve şunlar gibi yeni yaklaşımların zorunlu olduğunu açıkça ortaya koymuştur:
- Adım adım tam çözümler üzerinde eğitim.
- Bilimsel veriler üzerinde özelleştirilmiş hazırlık.
- Hesaplama ve doğrulama için harici araçların kullanımı.
Kaydedilen önemli ilerlemeye karşın MATH, önemli ve zorlu bir sınav olmayı sürdürmektedir. LLM'lerdeki matematiksel düşünme düzeyinin bir göstergesi olmaya devam etmekte ve çok adımlı akıl yürütme gerektiren problemlerin güvenilir biçimde çözülmesine yönelik araştırmaları teşvik etmektedir[1].
Dış bağlantılar
- MATH veri kümesinin GitHub'daki resmi deposu
- Papers With Code'daki veri kümesi sayfası
Kaynakça
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]