SuperGLUE (benchmark) (HE)
SuperGLUE — זהו benchmark מקיף (אוסף מבחנים) להערכת מערכות עיבוד שפה טבעית, ובמיוחד מודלים לשוניים גדולים (LLM)[1]. הוא הוצג בשנת 2019 על ידי קבוצת חוקרים בראשות אלכס וואן מאוניברסיטת ניו יורק, בשיתוף Facebook AI Research וארגונים נוספים[1].
יצירת SuperGLUE נבעה מכך שעד אמצע 2019 הפך ה-benchmark הקודם, GLUE, ל"משימה פשוטה" עבור המודלים המתקדמים: הציון המצטבר של המודלים הטובים ביותר ב-GLUE הגיע ל-88.4, ועלה על רמת האדם הממוצע (87.1)[1]. כך צומצם מרחב ההתקדמות האפשרית[1]. בתגובה לכך פיתחו המחברים את SuperGLUE כחלופה מאתגרת יותר, שתאפשר בדיקה מחמירה יותר של הבנת השפה על ידי מודלים[1]. מטרת SuperGLUE היא לספק מדד ניטרלי וקשה ל"אימון עליו" לקידמה בתחום הבנת השפה הכללית באנגלית[1]. הוערך כי שיפור ניכר בתוצאות על SuperGLUE ידרוש חידושים מהותיים בשיטות Machine Learning — למשל, למידה יעילה יותר מדגימות קטנות, למידה רב-משימתית ולמידה עצמית מפוקחת[1]. במילים אחרות, ב-SuperGLUE נכללות משימות פשוטות לאדם אך קשות לאינטליגנציה מכונתית[1], כדי לעודד פיתוח מודלים עם הבנת שפה עמוקה אמיתית.
מאפיינים והבדלים מ-GLUE
SuperGLUE חוזר במידה רבה על פורמט GLUE — הוא מציע ציון איכות מצטבר אחד לכלל המשימות, לוח מובילים ציבורי וערכת כלים לניתוח מודלים[1]. אולם SuperGLUE מביא עמו שורת שיפורים וחידושים בהשוואה לקודמו[1]:
- משימות מאתגרות יותר: ב-SuperGLUE נבחרו שמונה המשימות הקשות ביותר[1]. שתיים מהן עברו בירושה מ-GLUE (בין הקשות שבהן), והאחרות נבחרו מבין מועמדות חדשות על בסיס קושיין למודלי NLP מתקדמים[1]. כך מתמקד ה-benchmark בהיבטי ההבנה שבהם הציגו המודלים את תוצאותיהם הגרועות ביותר.
- מגוון פורמטים: בעוד שב-GLUE כל המשימות התכנסו לסיווג משפטים או זוגות משפטים, SuperGLUE כולל מנעד רחב יותר של פורמטים[1]. בנוסף לסיווג, נוספו משימות של פתרון קורפרנס ומענה לשאלות, הדורשות מהמודל הבנת טקסט רציף והסקה לוגית[1].
- הערכת אדם על כל המשימות: עבור כל משימה ב-SuperGLUE חושב רמת ביצוע בסיסית של אדם (לא מומחה)[1], המאשרת כי אפילו מודלים חזקים מסוג BERT נפלו משמעותית מרמת האדם בעת השקת ה-benchmark[1]. קיומו של יעד אנושי (~90% מצטבר) מספק "מרחב" לצמיחת המודל ומשמש כמטרה[1].
- כללים שקופים וכלים: תוקנו כללי פרסום התוצאות בלוח המובילים (לשם השוואה הוגנת וייחוס תרומת יוצרי הנתונים)[1]. כמו כן פורסמה ערכת קוד פתוח חדשה לנוחות fine-tuning ואימון רב-משימתי של מודלים על נתוני SuperGLUE[1].
כלל האמצעים הללו הופכים את SuperGLUE לבחינה אמינה יותר של יכולות השפה הכלליות של המודלים, שאינה מאפשרת השגת ציונים גבוהים באמצעות רמאות צרה או התאמה לפורמטים הספציפיים של GLUE הקודם[1].
אוסף המשימות של SuperGLUE
SuperGLUE מורכב משמונה משימות המכסות היבטים שונים של הבנת טקסט.
- BoolQ (Boolean Questions): משימת שאלות ותשובות (QA), שבה לכל דוגמה ניתן טקסט קצר (קטע מוויקיפדיה) ושאלה שיש לענות עליה "כן" או "לא"[1]. השאלות נוסחו על ידי משתמשים (מתוך שאילתות חיפוש של Google) ודורשות חילוץ עובדה מפורשת או משתמעת מן הטקסט; מדד האיכות הוא שיעור התשובות הנכונות (accuracy)[1].
- CB (CommitmentBank): משימת גרירה לוגית (textual entailment) עם שלושה מחלקות[1]. הנתונים מורכבים מטקסטים קצרים המכילים משפטים מורכבים; יש לקבוע באיזו מידה המחבר מחויב לאמיתות ההיגד הכלול[1]. למעשה, זוהי בדיקה האם הטענה נובעת מן ההקשר הנתון. המשימה קשה בשל גודל הדגימה הקטן (כ-250 דוגמאות) וחוסר האיזון בין המחלקות; האיכות נמדדת לפי דיוק ו-F1 ממוצע על פני המחלקות[1].
- COPA (Choice of Plausible Alternatives): משימת הסקת סיבה ותוצאה[1]. המודל מקבל הנחת יסוד (משפט אחד) ועליו לבחור את הסיבה או התוצאה הנכונה מבין שני אפשרויות[1]. כל דוגמאות COPA נוסחו ידנית ודורשות שכל ישר לביסוס הקשר הסיבתי. הנושאים כוללים מצבים מבלוגים ומאנציקלופדיה מתמחה; המדד הוא דיוק (שיעור הבחירות הנכונות)[1]. דוגמה: נתון המשפט "הילד רכש חסינות למחלה" והשאלה "מה הסיבה לכך?" — אדם מבין מיד שהתשובה הנכונה היא "הוא קיבל חיסון", בעוד שהמודל צריך להסיק את הקשר הסיבתי[1].
- MultiRC (Multi-Sentence Reading Comprehension): משימת הבנת טקסט רב-משפטית עם אלמנטים של בחירה מרובה[1]. המודל מקבל קטע טקסט, שאלה על תוכן הקטע ורשימת תשובות אפשריות; יש לקבוע אילו תשובות נכונות (לכל שאלה עשויות להיות כמה תשובות נכונות)[1]. מאפיינים: כדי לענות על שאלה, נדרש בדרך כלל שילוב מידע ממשפטים אחדים בטקסט, מה שבוחן את יכולת המודל לקשר עובדות[1]. האיכות נמדדת בשתי מדדים: F1 על התשובות (מחשיב אוספים נכונים חלקית) ו-Exact Match — שיעור השאלות שלהן ניתן אוסף תשובות נכון לחלוטין[1].
- ReCoRD (Reading Comprehension with Commonsense Reasoning Dataset): משימת קריאה עם הבנה ושימוש בידע[1]. מדובר במבחן Cloze מותאם: נתון טקסט חדשותי (כתבת CNN/Daily Mail) ומשפט עם מילת ישות חסרה; המודל צריך לבחור איזו ישות מן הטקסט מתאימה לחלל החסר[1]. אפשרויות התשובה הן כל הישויות המוזכרות בכתבה, כשחלקן עשויות להיות זהות במהותן[1]. הצלחה דורשת הבנת הקשר ושכל ישר. המדדים הם F1 ברמת token מרבי ו-Exact Match (התאמה מדויקת) של התשובות החזויות[1].
- RTE (Recognizing Textual Entailment): משימת סיווג בינארי של גרירה טקסטואלית (entailment לעומת not entailment)[1]. הנתונים משלבים דוגמאות מכמה תחרויות זיהוי גרירה טקסטואלית (סדרת RTE 1–5)[1]. כל משימה מכילה זוג קטעי טקסט (premise-hypothesis); המודל צריך לקבוע האם ההיפותזה נובעת מן הטקסט. בניגוד לנתונים גדולים רבים, RTE קטן יחסית (כ-2,500 דוגמאות אימון), אך הראה רווח משמעותי מ-transfer learning: הדיוק עלה מ-~56% (רמת ניחוש אקראי) ל-~86% עם הופעת מודלים מסוג BERT[1]. אף על פי כן, במועד השקת SuperGLUE עדיין פיגר דיוק המודלים אחרי האדם בכ-8 נקודות אחוז[1], ולכן נכלל RTE כאחת המשימות שבהן נשמר הפער מרמת האדם.
- WiC (Word-in-Context): משימת פתרון עמימות משמעות מילה בהקשר (WSD)[1]. ניתנים שני משפטים עצמאיים שבכל אחד מהם מופיעה אותה מילה רב-משמעית; יש לקבוע האם המילה משמשת באותה משמעות בשני המקרים[1]. הנתונים נלקחו ממשאבים לקסיקוגרפיים (WordNet, VerbNet, Wiktionary), ולכן מכסים מנעד רחב של מילים ומשמעויות[1]. המשימה מוגדרת כסיווג בינארי ומוערכת לפי שיעור התשובות הנכונות. WiC דורשת מהמודל הבנת הבדלים סמנטיים עדינים, ובפועל בוחנת סמנטיקה לקסיקלית.
- WSC (Winograd Schema Challenge): משימת פתרון קורפרנס בשימוש בשכל ישר[1]. כל משימה מורכבת ממשפט אחד המכיל כינוי גוף ורשימה של שתי ישויות (שמות עצם) מאותו משפט[1]. יש לקבוע לאיזה משמות העצם מתייחס כינוי הגוף הנתון[1]. דוגמה קלאסית של משפט Winograd: "הגביע לא נכנס למזוודה כי היא הייתה קטנה מדי" — האדם מבין ש"היא" מתייחס למזוודה (המזוודה הייתה קטנה מדי). דוגמאות כאלה אינן ניתנות לפתרון ללא ידע יומיומי והקשר[1]. ב-GLUE כבר היה גרסה מפושטת של משימה זו (WNLI), אך מודלים לא הצליחו במשך זמן רב לעלות אפילו על רמת האקראיות[1]. רק שיטות מיוחדות, כגון הוספת נתונים חיצוניים עם דוגמאות דומות, הרימו את איכות המודלים ב-WSC לכ-90% עד שנת 2019[1]. אולם האדם פותר משימות WSC כמעט ללא שגיאות (~96-100% תשובות נכונות)[1]. ב-SuperGLUE נכללת הגרסה המקורית של WSC בפורמט סיווג בינארי (לכל זוג "כינוי גוף-ישות" המודל משיב האם הם מתייחסים לאותו רפרנט)[1]. משימה זו נותרת אחת המבחנים הקשים ביותר הדורשים חשיבת commonsense.
לכל מבחני SuperGLUE קבוצות בדיקה סגורות שתשובותיהן אינן ידועות למפתחים[1]. המודלים שולחים את תחזיותיהם לשרת, שם מחושב הציון המצטבר — ממוצע על פני המשימות (עבור משימות עם כמה מדדים, מחושב תחילה ממוצע מדד פנימי)[1]. ציון SuperGLUE האחיד הזה מפשט את ההשוואה בין מודלים לפי רמת האינטליגנציה הלשונית הכללית.
תוצאות והתקדמות מודלים
בעת השקת SuperGLUE הביאו המחברים כנקודת ייחוס את תוצאות מודל הבסיס החזק (BERT משופר) — והן היו נמוכות משמעותית מהאנושיות בכל המשימות[1]. בממוצע הגיע המודל הטוב ביותר דאז לכ-20 נקודות פחות מן האדם לפי המדד המצטבר[1]. במשימות מסוימות היה הפער גדול במיוחד: למשל, במשימת WSC הגיע המודל בקושי לדיוק של ~65% לעומת 100% אצל האדם (פיגור של ~35 נקודות)[1]. אפילו במשימות ה"פשוטות" יחסית (BoolQ, CB, RTE, WiC) פיגרו המערכות האוטומטיות כ-10 נקודות מרמת האדם[1]. הפערים הללו אישרו שSuperGLUE אכן מציב אתגר רציני לטכנולוגיות הנוכחיות ואינו ניתן לפתרון טריוויאלי.
אולם כבר חודשים אחדים לאחר הופעת SuperGLUE החל התקדמות מהירה[1]. בסוף 2019 הציגו חוקרי Google את המודל T5 (Text-To-Text Transfer Transformer) עם 11 מיליארד פרמטרים, שהשיג ציון מצטבר של 88.9 והתקרב מאוד לרמת האדם של ~89.8[2]. למעשה, T5 שיפר את השיא הקודם ב-SuperGLUE בבת אחת ב-4.3 נקודות וצמצם את שיעור השגיאות בכמעט שליש[2], ותוך הותרת פער מינימלי של 0.9 נקודות בלבד ממדד האדם[2]. המפתחים ציינו שSuperGLUE נועד במכוון כך שהמשימות פשוטות לאדם, ולכן הגעת מודל לרמת ~89% הייתה אבן דרך חשובה[2].
הראשון שהצליח לעלות על איכות האדם הממוצע היה המודל של Microsoft DeBERTa (Decoding-enhanced BERT with disentangled attention)[3]. בינואר 2021 דיווחו החוקרים שגרסת DeBERTa עם 1.5 מיליארד פרמטרים השיגה 89.9 נקודות, מעט מעל ציון הייחוס האנושי של 89.8[3]. זה היה המקרה הראשון שבו מודל בודד עלה על האדם לפי מדד SuperGLUE[3]. בנוסף, אנסמבל של מספר מודלי DeBERTa העלה את השיא לכ-90.3 נקודות[3]. המודל DeBERTa עקף את המוביל הקודם (Google T5) בכ-0.6% והוכיח את האפקטיביות של רעיונות חדשים בארכיטקטורת Transformer (ייצוג נפרד של תוכן ומיקום מילים, decoder מסכות משופר ועוד)[4].
ההתקדמות לא עצרה: עם גדילת גודלם ומורכבותם של מודלי השפה המשיכו תוצאות SuperGLUE להשתפר[5]. לקראת סוף 2021 עמד בראש לוח המובילים המודל T-NLRv5 של Microsoft (משפחת Microsoft Turing NLR) — הוא הרחיב עוד יותר את הפער מעל רמת האדם[5]. המשימות האחרונות שנותרו לא פתורות למכונה ב-GLUE (למשל, עדינויות NLI) "נסגרו" על ידי מודל זה, שהתקרב מאוד לשוויון מלא עם האדם אפילו בתת-משימות הקשות ביותר[5].
לשנים 2022–2023 עבר סף רמת האדם ב-SuperGLUE בביטחון על ידי כמה מודלים גדולים עצמאיים[6]. לדוגמה, המודל PaLM של Google (540 מיליארד פרמטרים) השיג בעת fine-tuning על משימות SuperGLUE כ-90.4 נקודות, והמודל GPT-4 (שפותח על ידי OpenAI) הראה תוצאה גבוהה אף יותר[6]. באמצע 2023 כבר כלל לוח המובילים של SuperGLUE מספר מודלים עם ציון מעל 90 (כלומר, העולים על רמת האדם הממוצעת)[6]. ניתן לומר שה-benchmark פוצח למעשה על ידי המערכות המודרניות[6]: ציוני המודלים הטובים ביותר גבוהים כל כך שהם עולים על יכולות רוב האנשים הלא מוסמכים[6]. הצלחה זו מעידה על התקדמות עצומה ב-NLP בפרק זמן קצר, אך מצביעה גם על הצורך במבחנים חדשים ומאתגרים עוד יותר עבור המודלים החדישים ביותר[6]. כבר מופיעים benchmark-ים עוקבים (כגון MMLU, BIG-Bench ואחרים), שנועדו לבחון מודלים על הבנה רחבה יותר ועל ידע העולה על גבולות משימות SuperGLUE[6].
השפעה ומחקר עתידי
SuperGLUE התבסס אפוא כשלב חשוב בהתפתחות שיטות ההערכה בעיבוד שפה[3]. בקרב חוקרים ומתלהבים, תוצאותיו הפכו למעין "נייר לקמוס" עבור ארכיטקטורות LLM חדשות: השגה או חציית רמת האדם ב-SuperGLUE נתפסת כסימן למודל מתקדם עם הבנת שפה עמוקה[3]. הדבר בא לידי ביטוי גם בפרקטיקה — מודלי שפה מודרניים רבים שהגיעו לציונים גבוהים ב-SuperGLUE שימשו בסיס למערכות יישומיות של שאלות-תשובות, סוכני דיאלוג, מערכות סיכום טקסט ועוד[3]. SuperGLUE ממשיך לשמש חוקרים ל-fine-tuning ולהשוואת אלגוריתמים, אם כי העמדה המובילה עוברת כעת בהדרגה לאמות מידה חדשות להערכת בינה מלאכותית.
קישורים
- אתר הרשמי של SuperGLUE
- המאמר המקורי של SuperGLUE (NeurIPS)
- מאמר Microsoft על השגת רמת האדם על ידי DeBERTa
- דף הנתונים של SuperGLUE ב-Papers With Code
ספרות
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
הערות
[1] [2] [3] [4] [5] [6] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit /r/linguistics. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». Microsoft Research Blog. [3]
- ↑ 4.0 4.1 «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». Synced Review. [4]
- ↑ 5.0 5.1 5.2 5.3 «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». Microsoft Research Blog. [5]