MATH Benchmark (FA)
MATH (سرنام انگلیسی Mathematics Aptitude Test of Heuristics) — یک مجموعه داده و benchmark بزرگ برای ارزیابی تواناییهای ریاضی و مهارتهای حل مسئله در مدلهای زبانی بزرگ (LLM) است. این dataset در سال ۲۰۲۱ توسط گروهی از پژوهشگران به سرپرستی دن هندریکس (Dan Hendrycks) معرفی شد و شامل ۱۲٬۵۰۰ مسئله برگرفته از مسابقات ریاضی آمریکا برای دانشآموزان دبیرستان، مانند AMC 10، AMC 12 و AIME است[1].
مسائل طیف گستردهای از حوزهها (جبر، هندسه، نظریه اعداد، ترکیبیات و غیره) را پوشش میدهند و دارای درجهبندی سطح دشواری هستند. برخلاف مسائل استاندارد درسی، این مسائل اغلب نیازمند رویکرد خلاقانه و روشهای اکتشافی هستند، نه صرفاً کاربرد مستقیم فرمولها. هر مسئله با یک حل گامبهگام کامل و پاسخ نهایی همراه است که MATH را به منبعی ارزشمند هم برای آموزش و هم برای آزمایش مدلها تبدیل میکند[2].
ساختار و ویژگیهای dataset
بنچمارک MATH دارای ویژگیهای کلیدی است که آن را به ابزاری دشوار و قابل اعتماد برای ارزیابی تبدیل میکند.
قالب مسائل
تمام مسائل و حلها در قالب LaTeX ارائه شدهاند و برای توصیف نمودارهای هندسی از زبان Asymptote استفاده میشود. این امر امکان بازنمایی تمام شرایط، از جمله تصاویر، را به صورت متنی فراهم میکند که برای پردازش توسط مدل زبانی در دسترس است. به هر مسئله برچسبهایی بر اساس هفت حوزه ریاضی و پنج سطح دشواری اختصاص داده شده است[1].
ارزیابی خودکار
پاسخهای نهایی در dataset در قالب ویژه `\boxed{...}` قرار داده شده و به استاندارد دقیقی آورده شدهاند (برای مثال، کسرها در شکل سادهشده). این امر امکان ارزیابی خودکار مدلها را با معیار تطابق دقیق (exact match) فراهم میکند که ذهنیت و ابهام را در بررسی نتایج حذف میکند. مدل باید پاسخ کاملاً صحیح ارائه دهد تا مسئله حلشده محسوب شود[1].
دشواری مسائل و سطح انسانی
MATH یکی از دشوارترین آزمونهای ریاضی برای هوش مصنوعی است. مسائل حتی برای افراد با پیشینه قوی ریاضی نیز چالشبرانگیز هستند.
- در جریان بررسی dataset، گروهی از دانشجویان دانشگاه آزمون دادند و نتایجی از ~۴۰٪ تا ~۹۰٪ برای برندگان المپیاد به دست آمد.
- حتی دارنده سه مدال طلای المپیاد بینالمللی ریاضی نیز نتوانست تمام مسائل را بدون خطا حل کند[1].
این نشان میدهد که برای حل موفق مسائل MATH نهتنها دانش، بلکه دقت بالا و شهود ریاضی نیز لازم است.
نتایج مدلها و پیشرفت در حل مسائل
نتایج اولیه (۲۰۲۱)
هنگام راهاندازی بنچمارک در سال ۲۰۲۱، حتی بزرگترین مدلها نتایج بسیار ضعیفی نشان دادند.
- مدل GPT-3 (۱۷۵ میلیارد پارامتر) تنها حدود ۵٪ از مسائل را به درستی حل کرد.
- نسخههای fine-tuning شده GPT-2 دقتی در حدود ۶ تا ۷ درصد نشان دادند[1].
نویسندگان به این نتیجه رسیدند که افزایش ساده مقیاس مدلها تقریباً تأثیری بر عملکرد ندارد و برای پیشرفت، رویکردهای الگوریتمی جدیدی لازم است[3].
پیشرفت چشمگیر Minerva و GPT-4 (۲۰۲۲–۲۰۲۳)
جهش بزرگ با ظهور مدلهایی که بهطور ویژه بر روی متون علمی آموزش دیده بودند و روشهای حل جدید رخ داد.
- در سال ۲۰۲۲، مدل Google Minerva به دقتی حدود ۵۰٪ دست یافت و نشان داد که ترکیب مقیاس و آموزش تخصصی میتواند کیفیت حل را به شدت افزایش دهد[3].
- در سال ۲۰۲۳، GPT-4 ساخت OpenAI جهش جدیدی نشان داد. با استفاده از ابزارها، مدل توانست نتایج خود را بهطور قابل توجهی بهبود بخشد:
- با Code Interpreter (اجرای کد برای بررسی محاسبات) دقت به نزدیک ۷۰٪ رسید.
- با روش code-based self-verification (خودبررسی و تصحیح خطاها با کمک کد) رکورد ۸۴٫۳٪ مسائل حلشده ثبت شد[4].
این نتیجه با سطح شرکتکنندگان انسانی قوی قابل مقایسه است و به آستانه تخصص نزدیک میشود.
اهمیت و تأثیر
بنچمارک MATH نقش کلیدی در توسعه تواناییهای ریاضی LLM داشته است. به وضوح نشان داد که برای حل مسائل پیچیده، مقیاسبندی ساده کافی نیست و رویکردهای جدیدی لازم است، از جمله:
- آموزش بر روی حلهای گامبهگام کامل.
- آموزش تخصصی بر دادههای علمی.
- استفاده از ابزارهای خارجی برای محاسبات و تأیید.
علیرغم پیشرفت چشمگیر، MATH همچنان آزمونی مهم و دشوار باقی مانده است. این بنچمارک به عنوان شاخصی از سطح تفکر ریاضی در LLM عمل میکند و پژوهش در زمینه حل قابل اعتماد مسائلی که نیازمند استدلال چندمرحلهای هستند را تحریک میکند[1].
پیوندها
- مخزن رسمی dataset MATH در GitHub
- صفحه dataset در Papers With Code
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [۱]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [۲]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [۳]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [۴]