GSM8K (Grade School Math 8K) (HE)
GSM8K (Grade School Math 8K) — הוא מערך נתונים ייחוסי המכיל כ-8,500 בעיות מילוליות במתמטיקה ברמת בית ספר יסודי. הוא נוצר בשנת 2021 על ידי חוקרים מ-OpenAI לשם הערכה ופיתוח יכולתם של מודלים לשוניים גדולים (LLM) לביצוע הסקות מתמטיות רב-שלביות[1]. GSM8K הפך לאחד ה-benchmarks המרכזיים למדידת ההתקדמות בתחום החשיבה המתמטית של בינה מלאכותית.
כל בעיה ב-dataset מהווה סיפור מילולי קצר, שפתרונו דורש ביצוע של 2 עד 8 פעולות חשבוניות עוקבות (חיבור, חיסור, כפל, חילוק). על אף פשטותן הנחזית, הבעיות דורשות הבנה עמוקה של הטקסט והסקה לוגית, מה שהופך אותן למאתגרות עבור מודלי LLM רבים[2].
מאפיינים מרכזיים
היקף ומבנה
מערך הנתונים GSM8K מכיל כ-8,500 בעיות, המחולקות לשני חלקים:
- מערך אימון: כ-7,500 בעיות המיועדות ל-fine-tuning של מודלים. כל בעיה מלווה בפתרון מפורט צעד-אחר-צעד.
- מערך בדיקה: כ-1,000 בעיות המשמשות להערכה עצמאית של ביצועי המודלים[1].
רמת קושי ותוכן
הבעיות מנוסחות בכוונה כך שתלמיד מוכשר בבית ספר תיכון יוכל לפתור אותן, אך בה בעת הן דורשות הסקה רב-שלבית. הדבר מאפשר לבחון לא כל כך את הידע המתמטי של המודל, אלא את יכולתו לפרק בעיה לחלקים ולבצע פעולות לוגיות ברצף.
גיוון לשוני
ניסוחי הבעיות ב-GSM8K נאפיינים במגוון רב של סגנונות ומבני שפה. הדבר נועד לבחון את יכולת המודלים להבין תנאי בעיות המנוסחים בדרכים שונות, ולמנוע "שינון" של תבניות מסוימות[3].
היסטוריה ואבולוציה של הערכת מודלים
מודלים מוקדמים ותוצאות בסיס
במאמר המקורי משנת 2021 הראו המחברים כי אפילו מודלים גדולים של אותה תקופה, כגון GPT-3 (175 מיליארד פרמטרים), התקשו במידה ניכרת עם מערך הנתונים. לאחר fine-tuning ושימוש במודל מאמת עזר, דיוק הפתרון הגיע לכ-55% בלבד[1]. תוצאה זו הדגימה כי טעות קטנה אחת בשרשרת ההסקה עלולה להוביל לתשובה שגויה לחלוטין.
שיטות פורצות דרך: Chain-of-Thought
פריצת הדרך בפתרון בעיות GSM8K הייתה הגישה של «שרשרת הסקה» (Chain-of-Thought, CoT). בשנת 2022 הראו חוקרים מ-Google כי אם מעודדים את המודל לפרט במפורש את שלבי הפתרון לפני הצגת התשובה, הדיוק עולה בצורה משמעותית. המודל PaLM (540 מיליארד פרמטרים) עם שימוש ב-CoT השיג דיוק של 58%[4]. שימוש בטכניקה המורכבת יותר של self-consistency (יצירת מספר גרסאות פתרון ובחירת התשובה השכיחה ביותר) אפשר להעלות את הדיוק ל-74%[4].
חציית רמת הביצועים האנושית
החל משנת 2023, מודלים גנרטיביים חדישים עברו את רמת הביצועים האנושית ב-benchmark זה.
- GPT-4 מבית OpenAI במצב few-shot CoT (כאשר ה-prompt כולל מספר דוגמאות של בעיות פתורות) השיג דיוק של כ-92%[5], ועם אסטרטגיות נוספות — עד 97%[6].
- Claude 2 מבית Anthropic הציג תוצאה של 88%, ואילו הגרסה החדישה יותר Claude 3 — כ-95%[3].
ציונים גבוהים אלה מעידים על התקדמות משמעותית ביכולות ההסקה של מודלי LLM, אך גם מצביעים על כך ש-GSM8K הופך ל"כמעט פתור" עבור המודלים המתקדמים, מה שמעודד פיתוח של benchmarks מורכבים יותר כגון MATH ו-MMLU.
תפקיד האימון ופיתוח המודלים
מלבד הערכה, GSM8K משמש באופן פעיל לאימון ושיפור מודלים.
- Fine-tuning (כוונון עדין): מערך האימון עם פתרונות צעד-אחר-צעד הוא משאב בעל ערך לכוונון עדין של מודלים ללוגיקה מתמטית.
- אימון מאמתים: במאמר המקורי של OpenAI, חלק מנתוני GSM8K שימשו לאימון מודל מאמת נפרד, שהעריך את נכונות הפתרונות שנוצרו. גישה זו של אימון נפרד של מחולל ומבקר הוכיחה את יעילותה[1].
- Prompt Engineering: קיום מספר רב של דוגמאות אפשר לחוקרים לפתח ולשכלל טכניקות prompt כגון Chain-of-Thought ו-Tree-of-Thought, המלמדות את המודל להסיק מסקנות ללא שינוי המשקולות שלו.
קישורים
- דף ה-dataset ב-Papers With Code
- המאגר הרשמי ב-GitHub
ספרות
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
הערות
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]