MATH Benchmark (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

MATH (ראשי תיבות של Mathematics Aptitude Test of Heuristics) — הוא dataset גדול ו-benchmark להערכת יכולות מתמטיות ומיומנויות פתרון בעיות של מודלי שפה גדולים (LLM). ה-dataset הוצג בשנת 2021 על ידי קבוצת חוקרים בהנהגת דן הנדריקס (Dan Hendrycks) ומכיל 12,500 בעיות, שנלקחו מתחרויות מתמטיקה אמריקאיות לתלמידי תיכון, כגון AMC 10, AMC 12 ו-AIME[1].

הבעיות охватывают מגוון רחב של תחומים (אלגברה, גיאומטריה, תורת המספרים, קומבינטוריקה ועוד) ומדורגות לפי רמת קושי. בשונה מבעיות לימוד סטנדרטיות, הן דורשות לעתים קרובות חשיבה יצירתית ושיטות היוריסטיות, ולא יישום ישיר של נוסחאות. כל תרגיל מלווה בפתרון מלא שלב אחר שלב ובתשובה הסופית, מה שהופך את MATH למשאב בעל ערך הן לאימון והן לבדיקת מודלים[2].

מבנה ומאפייני ה-dataset

ה-benchmark MATH כולל מספר מאפיינים מרכזיים המהפכים אותו לכלי הערכה מאתגר ואמין.

פורמט הבעיות

כל התרגילים והפתרונות מוצגים בפורמט LaTeX, ולתיאור שרטוטים גיאומטריים משמשת שפת Asymptote. זה מאפשר להציג את כל התנאים, כולל תמונות, בצורת טקסט הנגיש לעיבוד על ידי מודל שפה. לכל בעיה מוקצות תגיות לפי שבעה תחומי מתמטיקה וחמישה רמות קושי[1].

הערכה אוטומטית

התשובות הסופיות ב-dataset כלולות בפורמט מיוחד `\boxed{...}` ומובאות לפי סטנדרט קפדני (למשל, שברים בצורה מצומצמת). זה מאפשר לבצע הערכה אוטומטית של מודלים לפי מדד התאמה מדויקת (exact match), המבטל סובייקטיביות ועמימות בבדיקת התוצאות. המודל חייב לספק תשובה נכונה במדויק כדי שהבעיה תיחשב כפתורה[1].

קושי הבעיות ורמת בני האדם

MATH הוא אחד ממבחני המתמטיקה הקשים ביותר עבור בינה מלאכותית. הבעיות מאתגרות אפילו אנשים בעלי הכשרה מתמטית חזקה.

  • במהלך מחקר ה-dataset, נבדקה קבוצת סטודנטים אוניברסיטאיים עם תוצאות שנעו בין ~40% ל-~90% אצל זוכי אולימפיאדות.
  • אפילו מחזיק שלוש מדליות זהב של האולימפיאדה הבינלאומית למתמטיקה לא הצליח לפתור את כל התרגילים ללא שגיאות[1].

זה מראה שלפתרון מוצלח של בעיות MATH נדרשים לא רק ידע, אלא גם דיוק גבוה ואינטואיציה מתמטית.

תוצאות מודלים והתקדמות בפתרון

תוצאות ראשוניות (2021)

בעת השקת ה-benchmark בשנת 2021, אפילו המודלים הגדולים ביותר הראו תוצאות נמוכות ביותר.

  • המודל GPT-3 (175 מיליארד פרמטרים) הצליח לפתור נכונה רק כ-5% מהבעיות.
  • גרסאות fine-tuning של GPT-2 הראו דיוק של 6–7%[1].

המחברים הגיעו למסקנה שהגדלה פשוטה של קנה המידה של מודלים כמעט אינה משפיעה על הביצועים, ולצורך התקדמות נדרשים גישות אלגוריתמיות חדשות[3].

פריצת הדרך של Minerva ו-GPT-4 (2022–2023)

פריצת הדרך התרחשה עם הופעת מודלים שאומנו במיוחד על טקסטים מדעיים ושיטות פתרון חדשות.

  • בשנת 2022 השיג המודל Google Minerva דיוק של כ-50%, והדגים שהשילוב של קנה מידה והכשרה מתמחה יכול לשפר משמעותית את איכות הפתרון[3].
  • בשנת 2023 הראה GPT-4 של OpenAI קפיצה חדשה. בשימוש בכלים, הצליח המודל לשפר משמעותית את תוצאותיו:
    • עם Code Interpreter (הרצת קוד לאימות חישובים) הגיע הדיוק לכמעט 70%.
    • עם שיטת code-based self-verification (בדיקה עצמית ותיקון שגיאות באמצעות קוד) נקבע שיא של 84.3% בעיות פתורות[4].

תוצאה זו דומה לרמת משתתפים אנושיים חזקים ומתקרבת לסף המומחיות.

משמעות והשפעה

ה-benchmark MATH מילא תפקיד מפתח בפיתוח היכולות המתמטיות של LLM. הוא הדגים בבירור שלפתרון בעיות מורכבות אין די בהתרחבות פשוטה בלבד, ונדרשות גישות חדשות כגון:

  • אימון על פתרונות שלמים שלב אחר שלב.
  • הכשרה מתמחה על נתונים מדעיים.
  • שימוש בכלים חיצוניים לחישובים ואימות.

למרות ההתקדמות המשמעותית, MATH נותר מבחן חשוב ומאתגר. הוא ממשיך לשמש כאינדיקטור לרמת החשיבה המתמטית של LLM ומעודד מחקר בתחום פתרון אמין של בעיות הדורשות רצפי הסקה מרובי שלבים[1].

קישורים

  • המאגר הרשמי של dataset ה-MATH ב-GitHub
  • דף ה-dataset ב-Papers With Code

ספרות

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

הערות

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
  2. «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
  3. 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
  4. «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]