WinoGrande Benchmark (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — הוא מאגר נתוני ייחוס בקנה מידה גדול, המיועד להערכת יכולות ההיסק מבוסס-שכל-ישר של מערכות בינה מלאכותית. הוא כולל כ-44,000 משימות המבוססות על פורמט Winograd Schema Challenge (WSC), אך הורחבו ומורכבו משמעותית באמצעות שיטת סינון "אדברסרית" לצורך ביטול רמזים סטטיסטיים[1].

ה-dataset פותח בשנת 2019 על ידי קבוצת חוקרים מ-Allen Institute for AI ומ-אוניברסיטת וושינגטון. כל משימה היא משפט הכולל מקום חסר שיש למלא באחת משתי אפשרויות, תוך בחירת התשובה הנכונה על בסיס ההקשר והבנת המצב. WinoGrande הפך לאחד מה-benchmarks המרכזיים בתחום עיבוד שפה טבעית (NLP)[2].

הרקע ליצירה: התיישנות WSC

ה-Winograd Schema Challenge (WSC) המקורי, שהוצע בשנת 2011, כלל רק 273 משימות ונחשב זמן רב כמבחן אמין לשכל ישר. המשימות בו תוכננו כך שידרשו הבנת עולם ולא התאמת מילים פשוטה[3].

אולם עד השנים 2018–2019, עם הופעת מודלי שפה גדולים בארכיטקטורת transformer כגון BERT, השתנה המצב. המודלים למדו "לפרוץ" את המבחן ולהשיג דיוק של כ-90% על ידי ניצול דפוסים סטטיסטיים לא מכוונים (ארטיפקטים) בנתונים, ולא על ידי הבנה אמיתית[4]. WSC חדל להיות אינדיקטור אמין, מה שהוביל לצורך ביצירת benchmark חדש, מורכב ומקיף יותר — WinoGrande.

פיתוח ושיטת adversarial filtering

יצירת WinoGrande התקיימה בשני שלבים עיקריים: יצירת משימות בהיקף נרחב וסינונן לאחר מכן.

קראודסורסינג

בשלב הראשון, באמצעות הפלטפורמה Amazon Mechanical Turk, נאספה בסיס גדול של למעלה מ-47,000 משפטים. עובדי הקראוד יצרו זוגות משפטים לפי מתכונת Winograd, מה שהבטיח גיוון לשוני ו"רעש" האופייני לדיבור טבעי, בניגוד למשימות שנכתבו על ידי קבוצה קטנה של מומחים[1].

אלגוריתם AfLite

החידוש המרכזי של WinoGrande היה האלגוריתם AfLite (Adversarial Filtering Lite). שיטה זו פותחה לסינון אוטומטי של משימות שניתן לפתור באמצעות רמזים סטטיסטיים פשוטים, מבלי לדרוש שכל ישר. האלגוריתם השתמש במודלים פשוטים לזיהוי והסרת אותן דוגמאות שבהן אחת התשובות הייתה קשורה בצורה ברורה מדי למילים אחרות במשפט. לדוגמה, משימה כגון "האריות אכלו את הזברות מפני שהם טורפים" הייתה מסוננת, מכיוון שהמילה "טורפים" קשורה סטטיסטית בקשר הדוק ל"אריות".

כתוצאה מהסינון, כ-14% מהנתונים שנאספו הושמטו. הגרסה הסופית של ה-dataset כוללת 43,972 משימות, מה שהופך אותו למבחן אמין ומורכב הרבה יותר[1].

תוצאות מודלים והתקדמות

בעת השקת WinoGrande, המודלים המובילים באותה תקופה הציגו תוצאות שנפלו משמעותית מאלו של בני אדם.

  • RoBERTa (גרסה משופרת של BERT) השיגה דיוק של ~79%.
  • בני אדם פותרים את המשימות בממוצע בדיוק של ~94%[1].

פער זה אישר שסינון AfLite הצליח לבטל רבים מ"הנתיבים הקלים" עבור המודלים. אולם עם התפתחות ה-LLM, פער זה החל להצטמצם.

  • עד שנת 2022, המודל ST-MoE-32B השיג דיוק של 96.1%, ועלה על רמת הביצועים האנושית[5].
  • GPT-3 הציגה תוצאה של כ-88%[6].
  • GPT-4, ללא fine-tuning ייעודי, פותר משימות בדיוק של ~87.5%[7].

השפעה וביקורת

WinoGrande הפך לאחד מה-benchmarks המרכזיים להערכת שכל ישר ומשמש באופן קבוע לבדיקת מודלים חדשים. תוצאותיו מתפרסמות בדוחות הטכניים של חברות הבינה המלאכותית המובילות ובפלטפורמות להשוואת מודלים[8].

בד בבד, שיטת יצירת ה-dataset הפכה לנושא לדיון מדעי. חלק מהחוקרים מציינים שהקראודסורסינג ההמוני עשוי היה להוביל ליצירת ביטויים לא טבעיים או דו-משמעיים. כמו כן הועלו ספקות בנוגע לשאלה האם סינון AfLite האוטומטי מסוגל לבטל לחלוטין את כל הארטיפקטים הנסתרים[5]. עם זאת, WinoGrande עורר לא רק התקדמות במדדים, אלא גם דיון חשוב בנוגע ליצירת שיטות הערכה של בינה מלאכותית יציבות ואמינות יותר.

קישורים חיצוניים

  • האתר הרשמי של WinoGrande
  • ה-dataset בפלטפורמת Hugging Face

ספרות

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

הערות

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]