MATH Benchmark (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

MATH (سرنام انگلیسی Mathematics Aptitude Test of Heuristics) — یک مجموعه داده و benchmark بزرگ برای ارزیابی توانایی‌های ریاضی و مهارت‌های حل مسئله در مدل‌های زبانی بزرگ (LLM) است. این dataset در سال ۲۰۲۱ توسط گروهی از پژوهشگران به سرپرستی دن هندریکس (Dan Hendrycks) معرفی شد و شامل ۱۲٬۵۰۰ مسئله برگرفته از مسابقات ریاضی آمریکا برای دانش‌آموزان دبیرستان، مانند AMC 10، AMC 12 و AIME است[1].

مسائل طیف گسترده‌ای از حوزه‌ها (جبر، هندسه، نظریه اعداد، ترکیبیات و غیره) را پوشش می‌دهند و دارای درجه‌بندی سطح دشواری هستند. برخلاف مسائل استاندارد درسی، این مسائل اغلب نیازمند رویکرد خلاقانه و روش‌های اکتشافی هستند، نه صرفاً کاربرد مستقیم فرمول‌ها. هر مسئله با یک حل گام‌به‌گام کامل و پاسخ نهایی همراه است که MATH را به منبعی ارزشمند هم برای آموزش و هم برای آزمایش مدل‌ها تبدیل می‌کند[2].

ساختار و ویژگی‌های dataset

بنچمارک MATH دارای ویژگی‌های کلیدی است که آن را به ابزاری دشوار و قابل اعتماد برای ارزیابی تبدیل می‌کند.

قالب مسائل

تمام مسائل و حل‌ها در قالب LaTeX ارائه شده‌اند و برای توصیف نمودارهای هندسی از زبان Asymptote استفاده می‌شود. این امر امکان بازنمایی تمام شرایط، از جمله تصاویر، را به صورت متنی فراهم می‌کند که برای پردازش توسط مدل زبانی در دسترس است. به هر مسئله برچسب‌هایی بر اساس هفت حوزه ریاضی و پنج سطح دشواری اختصاص داده شده است[1].

ارزیابی خودکار

پاسخ‌های نهایی در dataset در قالب ویژه `\boxed{...}` قرار داده شده و به استاندارد دقیقی آورده شده‌اند (برای مثال، کسرها در شکل ساده‌شده). این امر امکان ارزیابی خودکار مدل‌ها را با معیار تطابق دقیق (exact match) فراهم می‌کند که ذهنیت و ابهام را در بررسی نتایج حذف می‌کند. مدل باید پاسخ کاملاً صحیح ارائه دهد تا مسئله حل‌شده محسوب شود[1].

دشواری مسائل و سطح انسانی

MATH یکی از دشوارترین آزمون‌های ریاضی برای هوش مصنوعی است. مسائل حتی برای افراد با پیشینه قوی ریاضی نیز چالش‌برانگیز هستند.

  • در جریان بررسی dataset، گروهی از دانشجویان دانشگاه آزمون دادند و نتایجی از ~۴۰٪ تا ~۹۰٪ برای برندگان المپیاد به دست آمد.
  • حتی دارنده سه مدال طلای المپیاد بین‌المللی ریاضی نیز نتوانست تمام مسائل را بدون خطا حل کند[1].

این نشان می‌دهد که برای حل موفق مسائل MATH نه‌تنها دانش، بلکه دقت بالا و شهود ریاضی نیز لازم است.

نتایج مدل‌ها و پیشرفت در حل مسائل

نتایج اولیه (۲۰۲۱)

هنگام راه‌اندازی بنچمارک در سال ۲۰۲۱، حتی بزرگ‌ترین مدل‌ها نتایج بسیار ضعیفی نشان دادند.

  • مدل GPT-3 (۱۷۵ میلیارد پارامتر) تنها حدود ۵٪ از مسائل را به درستی حل کرد.
  • نسخه‌های fine-tuning شده GPT-2 دقتی در حدود ۶ تا ۷ درصد نشان دادند[1].

نویسندگان به این نتیجه رسیدند که افزایش ساده مقیاس مدل‌ها تقریباً تأثیری بر عملکرد ندارد و برای پیشرفت، رویکردهای الگوریتمی جدیدی لازم است[3].

پیشرفت چشمگیر Minerva و GPT-4 (۲۰۲۲–۲۰۲۳)

جهش بزرگ با ظهور مدل‌هایی که به‌طور ویژه بر روی متون علمی آموزش دیده بودند و روش‌های حل جدید رخ داد.

  • در سال ۲۰۲۲، مدل Google Minerva به دقتی حدود ۵۰٪ دست یافت و نشان داد که ترکیب مقیاس و آموزش تخصصی می‌تواند کیفیت حل را به شدت افزایش دهد[3].
  • در سال ۲۰۲۳، GPT-4 ساخت OpenAI جهش جدیدی نشان داد. با استفاده از ابزارها، مدل توانست نتایج خود را به‌طور قابل توجهی بهبود بخشد:
    • با Code Interpreter (اجرای کد برای بررسی محاسبات) دقت به نزدیک ۷۰٪ رسید.
    • با روش code-based self-verification (خودبررسی و تصحیح خطاها با کمک کد) رکورد ۸۴٫۳٪ مسائل حل‌شده ثبت شد[4].

این نتیجه با سطح شرکت‌کنندگان انسانی قوی قابل مقایسه است و به آستانه تخصص نزدیک می‌شود.

اهمیت و تأثیر

بنچمارک MATH نقش کلیدی در توسعه توانایی‌های ریاضی LLM داشته است. به وضوح نشان داد که برای حل مسائل پیچیده، مقیاس‌بندی ساده کافی نیست و رویکردهای جدیدی لازم است، از جمله:

  • آموزش بر روی حل‌های گام‌به‌گام کامل.
  • آموزش تخصصی بر داده‌های علمی.
  • استفاده از ابزارهای خارجی برای محاسبات و تأیید.

علی‌رغم پیشرفت چشمگیر، MATH همچنان آزمونی مهم و دشوار باقی مانده است. این بنچمارک به عنوان شاخصی از سطح تفکر ریاضی در LLM عمل می‌کند و پژوهش در زمینه حل قابل اعتماد مسائلی که نیازمند استدلال چندمرحله‌ای هستند را تحریک می‌کند[1].

پیوندها

  • مخزن رسمی dataset MATH در GitHub
  • صفحه dataset در Papers With Code

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [۱]
  2. «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [۲]
  3. 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [۳]
  4. «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [۴]