MATH Benchmark — معيار MATH
MATH (اختصار لـ Mathematics Aptitude Test of Heuristics) هو مجموعة بيانات ضخمة ومعيار قياسي لتقييم القدرات الرياضية ومهارات حل المسائل لدى نماذج اللغة الكبيرة (LLM). قُدمت مجموعة البيانات في عام 2021 من قبل مجموعة من الباحثين بقيادة دان هندريكس (Dan Hendrycks) وتحتوي على 12,500 مسألة مأخوذة من مسابقات الرياضيات الأمريكية لطلاب المدارس الثانوية، مثل AMC 10 و AMC 12 و AIME[1].
تغطي المسائل مجموعة واسعة من المجالات (الجبر، والهندسة، ونظرية الأعداد، والتوافقيات، وغيرها) وهي مصنفة حسب مستوى الصعوبة. وعلى عكس المسائل الدراسية التقليدية، فإنها غالبًا ما تتطلب نهجًا إبداعيًا وأساليب استدلالية (heuristic methods)، بدلاً من التطبيق المباشر للصيغ. كل مسألة مرفقة بحل كامل خطوة بخطوة وإجابة نهائية، مما يجعل MATH موردًا قيمًا لتدريب النماذج واختبارها على حد سواء[2].
هيكل مجموعة البيانات وميزاتها
يتميز معيار MATH القياسي بعدة خصائص أساسية تجعله أداة تقييم صعبة وموثوقة.
تنسيق المسائل
جميع المسائل والحلول مقدمة بتنسيق LaTeX، وتُستخدم لغة Asymptote لوصف الرسومات الهندسية. وهذا يسمح بتمثيل جميع الشروط، بما في ذلك الصور، في شكل نصي يمكن لنموذج اللغة معالجته. تم تصنيف كل مسألة ضمن سبعة مجالات في الرياضيات وخمسة مستويات صعوبة[1].
التقييم الآلي
الإجابات النهائية في مجموعة البيانات موضوعة ضمن تنسيق خاص `\boxed{...}` وموحدة وفقًا لمعيار صارم (على سبيل المثال، الكسور في أبسط صورة). وهذا يتيح إجراء تقييم آلي للنماذج باستخدام مقياس التطابق التام (exact match)، مما يزيل الذاتية والغموض عند التحقق من النتائج. يجب على النموذج تقديم الإجابة الصحيحة تمامًا حتى تُعتبر المسألة محلولة[1].
صعوبة المسائل والمستوى البشري
يُعد MATH واحدًا من أصعب الاختبارات الرياضية للذكاء الاصطناعي. تمثل المسائل تحديًا حتى للأشخاص ذوي الخلفية الرياضية القوية.
- خلال دراسة مجموعة البيانات، تم اختبار مجموعة من طلاب الجامعة، وتراوحت نتائجهم بين ~40% و~90% للفائزين في الأولمبيادات.
- حتى الحاصل على ثلاث ميداليات ذهبية في الأولمبياد الدولي للرياضيات لم يتمكن من حل جميع المسائل دون أخطاء[1].
وهذا يدل على أن الحل الناجح لمسائل MATH لا يتطلب المعرفة فحسب، بل أيضًا دقة عالية وحدسًا رياضيًا.
نتائج النماذج والتقدم في الحل
النتائج الأولية (2021)
عند إطلاق المعيار القياسي في عام 2021، أظهرت حتى أكبر النماذج نتائج منخفضة للغاية.
- تمكن نموذج GPT-3 (175 مليار مُعلَمة) من حل حوالي 5% فقط من المسائل بشكل صحيح.
- أظهرت الإصدارات المُدققة (fine-tuned) من GPT-2 دقة تتراوح بين 6-7%[1].
خلص المؤلفون إلى أن مجرد زيادة حجم النماذج لا يؤثر تقريبًا على الأداء، وأن تحقيق التقدم يتطلب مناهج خوارزمية جديدة[3].
طفرة Minerva و GPT-4 (2022–2023)
حدثت الطفرة مع ظهور نماذج مدربة خصيصًا على النصوص العلمية وطرق حل جديدة.
- في عام 2022، حقق نموذج Google Minerva دقة بلغت حوالي 50%، مما أثبت أن الجمع بين الحجم الكبير والتدريب المتخصص يمكن أن يحسن جودة الحل بشكل كبير[3].
- في عام 2023، أظهر نموذج GPT-4 من OpenAI قفزة جديدة. باستخدام الأدوات، تمكن النموذج من تحسين نتائجه بشكل كبير:
- باستخدام Code Interpreter (لتنفيذ الشيفرة البرمجية للتحقق من الحسابات)، وصلت الدقة إلى ما يقرب من 70%.
- وباستخدام طريقة التحقق الذاتي القائم على الكود (code-based self-verification)، تم تسجيل رقم قياسي بلغ 84.3% من المسائل المحلولة[4].
هذه النتيجة تضاهي مستوى المشاركين البشريين الأقوياء وتقترب من عتبة مستوى الخبراء.
الأهمية والتأثير
لعب معيار MATH القياسي دورًا رئيسيًا في تطوير القدرات الرياضية لنماذج اللغة الكبيرة. لقد أظهر بوضوح أن مجرد زيادة الحجم لا يكفي لحل المسائل المعقدة، وأن هناك حاجة إلى مناهج جديدة، مثل:
- التدريب على حلول كاملة خطوة بخطوة.
- التدريب المتخصص على البيانات العلمية.
- استخدام أدوات خارجية لإجراء الحسابات والتحقق.
على الرغم من التقدم الكبير، يظل MATH تحديًا مهمًا وصعبًا. ولا يزال يعمل كمؤشر لمستوى التفكير الرياضي لدى نماذج اللغة الكبيرة ويحفز الأبحاث في مجال الحل الموثوق للمسائل التي تتطلب استدلالًا متعدد الخطوات[1].
روابط خارجية
مراجع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
ملاحظات
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [١]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [٢]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [٣]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [٤]