GSM8K (Grade School Math 8K) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — הוא מערך נתונים ייחוסי המכיל כ-8,500 בעיות מילוליות במתמטיקה ברמת בית ספר יסודי. הוא נוצר בשנת 2021 על ידי חוקרים מ-OpenAI לשם הערכה ופיתוח יכולתם של מודלים לשוניים גדולים (LLM) לביצוע הסקות מתמטיות רב-שלביות[1]. GSM8K הפך לאחד ה-benchmarks המרכזיים למדידת ההתקדמות בתחום החשיבה המתמטית של בינה מלאכותית.

כל בעיה ב-dataset מהווה סיפור מילולי קצר, שפתרונו דורש ביצוע של 2 עד 8 פעולות חשבוניות עוקבות (חיבור, חיסור, כפל, חילוק). על אף פשטותן הנחזית, הבעיות דורשות הבנה עמוקה של הטקסט והסקה לוגית, מה שהופך אותן למאתגרות עבור מודלי LLM רבים[2].

מאפיינים מרכזיים

היקף ומבנה

מערך הנתונים GSM8K מכיל כ-8,500 בעיות, המחולקות לשני חלקים:

  • מערך אימון: כ-7,500 בעיות המיועדות ל-fine-tuning של מודלים. כל בעיה מלווה בפתרון מפורט צעד-אחר-צעד.
  • מערך בדיקה: כ-1,000 בעיות המשמשות להערכה עצמאית של ביצועי המודלים[1].

רמת קושי ותוכן

הבעיות מנוסחות בכוונה כך שתלמיד מוכשר בבית ספר תיכון יוכל לפתור אותן, אך בה בעת הן דורשות הסקה רב-שלבית. הדבר מאפשר לבחון לא כל כך את הידע המתמטי של המודל, אלא את יכולתו לפרק בעיה לחלקים ולבצע פעולות לוגיות ברצף.

גיוון לשוני

ניסוחי הבעיות ב-GSM8K נאפיינים במגוון רב של סגנונות ומבני שפה. הדבר נועד לבחון את יכולת המודלים להבין תנאי בעיות המנוסחים בדרכים שונות, ולמנוע "שינון" של תבניות מסוימות[3].

היסטוריה ואבולוציה של הערכת מודלים

מודלים מוקדמים ותוצאות בסיס

במאמר המקורי משנת 2021 הראו המחברים כי אפילו מודלים גדולים של אותה תקופה, כגון GPT-3 (175 מיליארד פרמטרים), התקשו במידה ניכרת עם מערך הנתונים. לאחר fine-tuning ושימוש במודל מאמת עזר, דיוק הפתרון הגיע לכ-55% בלבד[1]. תוצאה זו הדגימה כי טעות קטנה אחת בשרשרת ההסקה עלולה להוביל לתשובה שגויה לחלוטין.

שיטות פורצות דרך: Chain-of-Thought

פריצת הדרך בפתרון בעיות GSM8K הייתה הגישה של «שרשרת הסקה» (Chain-of-Thought, CoT). בשנת 2022 הראו חוקרים מ-Google כי אם מעודדים את המודל לפרט במפורש את שלבי הפתרון לפני הצגת התשובה, הדיוק עולה בצורה משמעותית. המודל PaLM (540 מיליארד פרמטרים) עם שימוש ב-CoT השיג דיוק של 58%[4]. שימוש בטכניקה המורכבת יותר של self-consistency (יצירת מספר גרסאות פתרון ובחירת התשובה השכיחה ביותר) אפשר להעלות את הדיוק ל-74%[4].

חציית רמת הביצועים האנושית

החל משנת 2023, מודלים גנרטיביים חדישים עברו את רמת הביצועים האנושית ב-benchmark זה.

  • GPT-4 מבית OpenAI במצב few-shot CoT (כאשר ה-prompt כולל מספר דוגמאות של בעיות פתורות) השיג דיוק של כ-92%[5], ועם אסטרטגיות נוספות — עד 97%[6].
  • Claude 2 מבית Anthropic הציג תוצאה של 88%, ואילו הגרסה החדישה יותר Claude 3 — כ-95%[3].

ציונים גבוהים אלה מעידים על התקדמות משמעותית ביכולות ההסקה של מודלי LLM, אך גם מצביעים על כך ש-GSM8K הופך ל"כמעט פתור" עבור המודלים המתקדמים, מה שמעודד פיתוח של benchmarks מורכבים יותר כגון MATH ו-MMLU.

תפקיד האימון ופיתוח המודלים

מלבד הערכה, GSM8K משמש באופן פעיל לאימון ושיפור מודלים.

  • Fine-tuning (כוונון עדין): מערך האימון עם פתרונות צעד-אחר-צעד הוא משאב בעל ערך לכוונון עדין של מודלים ללוגיקה מתמטית.
  • אימון מאמתים: במאמר המקורי של OpenAI, חלק מנתוני GSM8K שימשו לאימון מודל מאמת נפרד, שהעריך את נכונות הפתרונות שנוצרו. גישה זו של אימון נפרד של מחולל ומבקר הוכיחה את יעילותה[1].
  • Prompt Engineering: קיום מספר רב של דוגמאות אפשר לחוקרים לפתח ולשכלל טכניקות prompt כגון Chain-of-Thought ו-Tree-of-Thought, המלמדות את המודל להסיק מסקנות ללא שינוי המשקולות שלו.

קישורים

  • דף ה-dataset ב-Papers With Code
  • המאגר הרשמי ב-GitHub

ספרות

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

הערות

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]