HellaSwag Benchmark (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

HellaSwag — הוא מאגר נתונים ייחוסי (benchmark), שהוצג בשנת 2019 להערכת יכולתן של מודלים של בינה מלאכותית להבין מצבים יומיומיים (commonsense reasoning) בשפה טבעית[1]. ה-benchmark פותח על ידי קבוצת חוקרים מאוניברסיטת וושינגטון ומהמכון לבינה מלאכותית של אלן.

משימת HellaSwag מתבססת על בחירת ההמשך הסביר ביותר להקשר טקסטואלי נתון. המאפיין המרכזי של מאגר הנתונים הוא שהוא טריוויאלי לבני אדם, אך מביך אפילו מודלים לשוניים מתקדמים המסתמכים על דפוסים סטטיסטיים שטחיים[2].

היסטוריה ורקע

HellaSwag הוא פיתוח של רעיונות ה-dataset SWAG (Situations With Adversarial Generations), שהוצע על ידי אותה קבוצת מחברים בשנת 2018. במשימת SWAG, מודלים נדרשו לבחור את ההמשך הסביר ביותר לתיאור מצב פשוט. בתחילה SWAG היה מאתגר לאלגוריתמים, אך עם הופעת מודל BERT תוצאותיו על SWAG הגיעו לרמה של ~86%, כמעט השוות לביצועי בני האדם[2].

הצלחה זו עוררה ספקות: האם BERT באמת "מבין" טקסט, או שמא למד פשוט לזהות ארטיפקטים סטטיסטיים ותבניות הקיימות במאגר הנתונים? מחברי HellaSwag העלו השערה שתוצאתו הגבוהה של BERT אינה נובעת מהבנה אמיתית, אלא מהתאמה לפרטיות ה-dataset. הם הראו שבשינוי קל ביותר של התפלגות הנתונים דיוקו של BERT צונח בחדות. משמעות הדבר הייתה שלצורך הערכה אובייקטיבית של ההתקדמות ב-NLP נדרש benchmark חדש, מורכב ו"מלכודתי" יותר[2].

תיאור ומטרות ה-dataset

HellaSwag נוצר כמבחן שנועד לחשוף את מגבלות המודלים המודרניים בהבנת קשרי סיבה ותוצאה ותרחישים יומיומיים.

מבנה המשימה

כל דוגמה ב-HellaSwag מורכבת משני חלקים:

  1. הקשר: פסקה קצרה (עד שלוש משפטים) המתארת את תחילתו של מצב כלשהו.
  2. ארבעה אפשרויות השלמה: ארבעה המשכים אפשריים לסיפור, גם הם מורכבים ממספר משפטים.

רק אחת מהשלמות אלו היא הנכונה (האמיתית), ושלוש האחרות הן שגויות, שנוצרו במיוחד כדי לבלבל את המודל.

מקורות הנתונים

דוגמאות המצבים נלקחו משני מקורות המכסים מגוון רחב של תרחישים יומיומיים:

  • ActivityNet Captions: תיאורי פעולות מסרטוני וידאו (לדוגמה, "אדם פותח צנצנת מלפפונים").
  • WikiHow: הוראות ממאמרים (לדוגמה, "כיצד להחליף גלגל ברכב").

מטרת HellaSwag היא ליצור benchmark שנפתר בקלות על ידי בני אדם (באופן אינטואיטיבי), אך מקשה במרבית על מודלים שאינם בעלי שכל ישר מלא. השפעה זו כינו המחברים "אפקט גולדילוקס" (Goldilocks effect)[1].

מתודולוגיית Adversarial Filtering (AF)

החידוש המרכזי ביצירת HellaSwag היה שיטת Adversarial Filtering (AF) — מיון איטרטיבי של "מלכודות" המיועדות למודל-"קורבן" ספציפי. שיטה זו אפשרה ליצור אפשרויות שגויות הדומות באופן מטעה לנכונות מבחינת המודלים הסטטיסטיים.

סכמת פעולת AF היא כדלקמן:

  1. יצירה. על בסיס ההקשר המקורי, מודל לשוני-יוצר (כגון GPT) מייצר מגוון סיומים שגויים פוטנציאליים.
  2. אבחנה. מודל-מסווג (כגון BERT), הממלא תפקיד "קורבן", מנסה להבחין בין ההמשכים שנוצרו לבין הממשי (הנכון).
  3. מיון. נבחרים האפשרויות השגויות שהמסווג מצא כסבירות ביותר, כלומר אלה שבהן היה סיכוי גבוה ביותר לטעות.
  4. איטרציה. התהליך חוזר על עצמו פעמים רבות, עד שהתשובות השגויות דומות ככל האפשר לנכונה עבור האלגוריתם.
  5. אימות על ידי בני אדם. בשלב האחרון, הסטים שהתקבלו (הקשר + סיום נכון אחד + 3 הסיומים השגויים הטובים ביותר) מוערכים על ידי בני אדם. המעריכים מאשרים שהאפשרות הנכונה היא ללא ספק הטבעית ביותר, ושכל החלופות מכילות אי-הגיון כלשהו הניכר לאדם[2].

בזכות AF, כל דוגמה ב-HellaSwag בנויה מראש כך שתטעה את המודל, אך תישאר שקופה לבני אדם.

תוצאות ומשמעות

HellaSwag הפך למבחן מחמיר למודלים של הבנת טקסט. תוצאות הבדיקה הראו פער עצום בין בינה מכונה לבינה אנושית:

  • בן אדם פותר משימות HellaSwag כמעט ללא טעויות, בדיוק של כ-95-96%[2].
  • המודל הטוב ביותר בעת יצירתו, BERT-Large, השיג רק ~47% דיוק. שיטות פשוטות יותר הציגו תוצאה שאינה גבוהה בהרבה מניחוש אקראי (25%)[2].

פער של יותר מ-45 נקודות אחוז אישר את ההשערה שתוצאות גבוהות במבחנים קודמים לא העידו על הבנה אמיתית. HellaSwag הדגים שאפילו לאחר אימון על כמויות עצומות של נתונים, מודלים אינם מסוגלים לפתח שכל ישר כללי למצבים חדשים.

בשנים שלאחר מכן, HellaSwag הפך לאחד המבחנים הסטנדרטיים למודלים לשוניים חדשים. ניתן היה לעקוב אחר ההתקדמות של מערכות AI על ידי תוצאותיהן ב-benchmark זה.

  • בשנת 2020 מודל GPT-3 (175 מיליארד פרמטרים) הציג דיוק של ~79% במצב few-shot, שעלה על רמתם של מודלים מתמחים רבים מאותה תקופה, אך עדיין נותר נמוך משמעותית מביצועי האדם[3].
  • רק בשנת 2023 מודלים מהדור החדש, כגון GPT-4, הצליחו להגיע ב-HellaSwag לתוצאה הדומה לאנושית (כ-95% דיוק)[4].

יצירת HellaSwag סימנה גישה חדשה להערכת ההתקדמות ב-NLP, המבוססת על רעיון ה-benchmarks המתפתחים: ככל שהמודלים משתכללים, יש צורך ביצירת מבחנים חדשים ומורכבים יותר, החושפים את נקודות החולשה שלהם.

קישורים

  • האתר הרשמי של פרויקט HellaSwag
  • המאמר המדעי «HellaSwag: Can a Machine Really Finish Your Sentence?»

ספרות

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

הערות

  1. 1.0 1.1 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv:1905.07830, 2019. [2]
  3. Brown, T. B. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165, 2020. [3]
  4. Zellers, R. et al. «HellaSwag Project Page». [4]