---
title: "SuperGLUE (benchmark) (HE)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 7005
wiki_created_at: 2026-09-07T00:14:27Z
wiki_modified_at: 2026-09-07T00:14:27Z
downloaded_at: 2026-09-07T23:16:51Z
---

# SuperGLUE (benchmark) (HE)

**SuperGLUE** — זהו **benchmark** מקיף (אוסף מבחנים) להערכת מערכות עיבוד שפה טבעית, ובמיוחד **מודלים לשוניים גדולים** (LLM)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הוא הוצג בשנת 2019 על ידי קבוצת חוקרים בראשות אלכס וואן מאוניברסיטת ניו יורק, בשיתוף Facebook AI Research וארגונים נוספים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.

יצירת SuperGLUE נבעה מכך שעד אמצע 2019 הפך ה-benchmark הקודם, GLUE, ל"משימה פשוטה" עבור המודלים המתקדמים: הציון המצטבר של המודלים הטובים ביותר ב-GLUE הגיע ל-88.4, ועלה על רמת האדם הממוצע (87.1)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כך צומצם מרחב ההתקדמות האפשרית<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. בתגובה לכך פיתחו המחברים את SuperGLUE כחלופה מאתגרת יותר, שתאפשר בדיקה מחמירה יותר של הבנת השפה על ידי מודלים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. מטרת SuperGLUE היא לספק מדד ניטרלי וקשה ל"אימון עליו" לקידמה בתחום הבנת השפה הכללית באנגלית<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הוערך כי שיפור ניכר בתוצאות על SuperGLUE ידרוש חידושים מהותיים בשיטות Machine Learning — למשל, למידה יעילה יותר מדגימות קטנות, למידה רב-משימתית ולמידה עצמית מפוקחת<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. במילים אחרות, ב-SuperGLUE נכללות משימות פשוטות לאדם אך קשות לאינטליגנציה מכונתית<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>, כדי לעודד פיתוח מודלים עם הבנת שפה עמוקה אמיתית.

## מאפיינים והבדלים מ-GLUE

SuperGLUE חוזר במידה רבה על פורמט GLUE — הוא מציע **ציון איכות מצטבר** אחד לכלל המשימות, **לוח מובילים** ציבורי ו**ערכת כלים** לניתוח מודלים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. אולם SuperGLUE מביא עמו שורת שיפורים וחידושים בהשוואה לקודמו<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>:

- **משימות מאתגרות יותר**: ב-SuperGLUE נבחרו **שמונה המשימות הקשות ביותר**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. שתיים מהן עברו בירושה מ-GLUE (בין הקשות שבהן), והאחרות נבחרו מבין מועמדות חדשות על בסיס קושיין למודלי NLP מתקדמים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כך מתמקד ה-benchmark בהיבטי ההבנה שבהם הציגו המודלים את תוצאותיהם הגרועות ביותר.
- **מגוון פורמטים**: בעוד שב-GLUE כל המשימות התכנסו לסיווג משפטים או זוגות משפטים, SuperGLUE כולל **מנעד רחב יותר של פורמטים**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. בנוסף לסיווג, נוספו משימות של **פתרון קורפרנס** ו**מענה לשאלות**, הדורשות מהמודל הבנת טקסט רציף ו**הסקה לוגית**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **הערכת אדם על כל המשימות**: עבור כל משימה ב-SuperGLUE חושב **רמת ביצוע בסיסית של אדם** (לא מומחה)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>, המאשרת כי אפילו מודלים חזקים מסוג BERT נפלו משמעותית מרמת האדם בעת השקת ה-benchmark<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. קיומו של **יעד אנושי** (~90% מצטבר) מספק "מרחב" לצמיחת המודל ומשמש כמטרה<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **כללים שקופים וכלים**: תוקנו כללי פרסום התוצאות בלוח המובילים (לשם השוואה הוגנת וייחוס תרומת יוצרי הנתונים)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כמו כן פורסמה ערכת קוד פתוח חדשה לנוחות fine-tuning ואימון רב-משימתי של מודלים על נתוני SuperGLUE<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.

כלל האמצעים הללו הופכים את SuperGLUE לבחינה אמינה יותר של **יכולות השפה הכלליות** של המודלים, שאינה מאפשרת השגת ציונים גבוהים באמצעות רמאות צרה או התאמה לפורמטים הספציפיים של GLUE הקודם<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.

## אוסף המשימות של SuperGLUE

SuperGLUE מורכב מ**שמונה משימות** המכסות היבטים שונים של הבנת טקסט.

- **BoolQ** (Boolean Questions): משימת **שאלות ותשובות (QA)**, שבה לכל דוגמה ניתן טקסט קצר (קטע מוויקיפדיה) ושאלה שיש לענות עליה "כן" או "לא"<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. השאלות נוסחו על ידי משתמשים (מתוך שאילתות חיפוש של Google) ודורשות חילוץ עובדה מפורשת או משתמעת מן הטקסט; מדד האיכות הוא שיעור התשובות הנכונות (accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): משימת **גרירה לוגית** (textual entailment) עם שלושה מחלקות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הנתונים מורכבים מטקסטים קצרים המכילים משפטים מורכבים; יש לקבוע באיזו מידה המחבר **מחויב לאמיתות** ההיגד הכלול<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. למעשה, זוהי בדיקה האם הטענה נובעת מן ההקשר הנתון. המשימה קשה בשל גודל הדגימה הקטן (כ-250 דוגמאות) וחוסר האיזון בין המחלקות; האיכות נמדדת לפי דיוק ו-F1 ממוצע על פני המחלקות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): משימת **הסקת סיבה ותוצאה**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. המודל מקבל הנחת יסוד (משפט אחד) ועליו לבחור את הסיבה או התוצאה הנכונה מבין שני אפשרויות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כל דוגמאות COPA נוסחו ידנית ודורשות **שכל ישר** לביסוס הקשר הסיבתי. הנושאים כוללים מצבים מבלוגים ומאנציקלופדיה מתמחה; המדד הוא דיוק (שיעור הבחירות הנכונות)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. דוגמה: נתון המשפט "הילד רכש חסינות למחלה" והשאלה "מה הסיבה לכך?" — אדם מבין מיד שהתשובה הנכונה היא "הוא קיבל חיסון", בעוד שהמודל צריך להסיק את הקשר הסיבתי<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): משימת **הבנת טקסט רב-משפטית** עם אלמנטים של בחירה מרובה<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. המודל מקבל קטע טקסט, שאלה על תוכן הקטע ורשימת תשובות אפשריות; יש לקבוע אילו תשובות נכונות (לכל שאלה עשויות להיות כמה תשובות נכונות)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. מאפיינים: כדי לענות על שאלה, נדרש בדרך כלל שילוב מידע ממשפטים אחדים בטקסט, מה שבוחן את יכולת המודל **לקשר עובדות**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. האיכות נמדדת בשתי מדדים: F1 על התשובות (מחשיב אוספים נכונים חלקית) ו-Exact Match — שיעור השאלות שלהן ניתן אוסף תשובות נכון לחלוטין<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): משימת **קריאה עם הבנה ושימוש בידע**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. מדובר במבחן Cloze מותאם: נתון טקסט חדשותי (כתבת CNN/Daily Mail) ומשפט עם מילת ישות חסרה; המודל צריך לבחור איזו ישות מן הטקסט מתאימה לחלל החסר<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. אפשרויות התשובה הן כל הישויות המוזכרות בכתבה, כשחלקן עשויות להיות זהות במהותן<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הצלחה דורשת הבנת הקשר ושכל ישר. המדדים הם F1 ברמת token מרבי ו-Exact Match (התאמה מדויקת) של התשובות החזויות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): משימת סיווג בינארי של **גרירה טקסטואלית** (entailment לעומת not entailment)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הנתונים משלבים דוגמאות מכמה תחרויות זיהוי גרירה טקסטואלית (סדרת RTE 1–5)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כל משימה מכילה זוג קטעי טקסט (premise-hypothesis); המודל צריך לקבוע האם ההיפותזה נובעת מן הטקסט. בניגוד לנתונים גדולים רבים, RTE קטן יחסית (כ-2,500 דוגמאות אימון), אך הראה רווח משמעותי מ-transfer learning: הדיוק עלה מ-~56% (רמת ניחוש אקראי) ל-~86% עם הופעת מודלים מסוג BERT<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. אף על פי כן, במועד השקת SuperGLUE עדיין פיגר דיוק המודלים אחרי האדם בכ-8 נקודות אחוז<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>, ולכן נכלל RTE כאחת המשימות שבהן נשמר הפער מרמת האדם.
- **WiC** (Word-in-Context): משימת **פתרון עמימות משמעות מילה בהקשר** (WSD)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. ניתנים שני משפטים עצמאיים שבכל אחד מהם מופיעה אותה מילה רב-משמעית; יש לקבוע האם המילה משמשת **באותה משמעות** בשני המקרים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הנתונים נלקחו ממשאבים לקסיקוגרפיים (WordNet, VerbNet, Wiktionary), ולכן מכסים מנעד רחב של מילים ומשמעויות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. המשימה מוגדרת כסיווג בינארי ומוערכת לפי שיעור התשובות הנכונות. WiC דורשת מהמודל הבנת הבדלים סמנטיים עדינים, ובפועל בוחנת **סמנטיקה לקסיקלית**.
- **WSC** (Winograd Schema Challenge): משימת **פתרון קורפרנס בשימוש בשכל ישר**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. כל משימה מורכבת ממשפט אחד המכיל כינוי גוף ורשימה של שתי ישויות (שמות עצם) מאותו משפט<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. יש לקבוע לאיזה משמות העצם **מתייחס כינוי הגוף הנתון**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. דוגמה קלאסית של משפט Winograd: "הגביע לא נכנס למזוודה כי היא הייתה קטנה מדי" — האדם מבין ש"היא" מתייחס למזוודה (המזוודה הייתה קטנה מדי). דוגמאות כאלה אינן ניתנות לפתרון ללא **ידע יומיומי והקשר**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. ב-GLUE כבר היה גרסה מפושטת של משימה זו (WNLI), אך מודלים לא הצליחו במשך זמן רב לעלות אפילו על רמת האקראיות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. רק שיטות מיוחדות, כגון הוספת נתונים חיצוניים עם דוגמאות דומות, הרימו את איכות המודלים ב-WSC לכ-90% עד שנת 2019<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. אולם האדם פותר משימות WSC כמעט ללא שגיאות (~96-100% תשובות נכונות)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. ב-SuperGLUE נכללת הגרסה המקורית של WSC בפורמט סיווג בינארי (לכל זוג "כינוי גוף-ישות" המודל משיב האם הם מתייחסים לאותו רפרנט)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. משימה זו נותרת אחת המבחנים הקשים ביותר הדורשים חשיבת commonsense.

לכל מבחני SuperGLUE **קבוצות בדיקה סגורות** שתשובותיהן אינן ידועות למפתחים<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. המודלים שולחים את תחזיותיהם לשרת, שם מחושב הציון המצטבר — ממוצע על פני המשימות (עבור משימות עם כמה מדדים, מחושב תחילה ממוצע מדד פנימי)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. ציון SuperGLUE האחיד הזה מפשט את ההשוואה בין מודלים לפי רמת האינטליגנציה הלשונית הכללית.

## תוצאות והתקדמות מודלים

בעת השקת SuperGLUE הביאו המחברים כנקודת ייחוס את תוצאות מודל הבסיס החזק (BERT משופר) — והן היו **נמוכות משמעותית מהאנושיות** בכל המשימות<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. בממוצע הגיע המודל הטוב ביותר דאז לכ-**20 נקודות פחות** מן האדם לפי המדד המצטבר<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. במשימות מסוימות היה הפער גדול במיוחד: למשל, במשימת WSC הגיע המודל בקושי לדיוק של ~65% לעומת 100% אצל האדם (פיגור של ~35 נקודות)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. אפילו במשימות ה"פשוטות" יחסית (BoolQ, CB, RTE, WiC) פיגרו המערכות האוטומטיות כ-10 נקודות מרמת האדם<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. הפערים הללו אישרו שSuperGLUE אכן מציב אתגר רציני לטכנולוגיות הנוכחיות ואינו ניתן לפתרון טריוויאלי.

אולם כבר חודשים אחדים לאחר הופעת SuperGLUE החל **התקדמות מהירה**<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup>. בסוף 2019 הציגו חוקרי Google את המודל **T5** (Text-To-Text Transfer Transformer) עם 11 מיליארד פרמטרים, שהשיג ציון מצטבר של 88.9 והתקרב מאוד לרמת האדם של ~89.8<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-reddit-t5-2)</sup>. למעשה, T5 שיפר את השיא הקודם ב-SuperGLUE בבת אחת ב-4.3 נקודות וצמצם את שיעור השגיאות בכמעט שליש<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-reddit-t5-2)</sup>, ותוך הותרת פער מינימלי של **0.9 נקודות** בלבד ממדד האדם<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-reddit-t5-2)</sup>. המפתחים ציינו שSuperGLUE נועד במכוון כך שהמשימות פשוטות לאדם, ולכן הגעת מודל לרמת ~89% הייתה אבן דרך חשובה<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-reddit-t5-2)</sup>.

הראשון שהצליח **לעלות על איכות האדם הממוצע** היה המודל של Microsoft **DeBERTa** (Decoding-enhanced BERT with disentangled attention)<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. בינואר 2021 דיווחו החוקרים שגרסת DeBERTa עם 1.5 מיליארד פרמטרים השיגה **89.9 נקודות**, מעט מעל ציון הייחוס האנושי של 89.8<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. זה היה **המקרה הראשון** שבו מודל בודד עלה על האדם לפי מדד SuperGLUE<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. בנוסף, אנסמבל של מספר מודלי DeBERTa העלה את השיא לכ-90.3 נקודות<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. המודל DeBERTa עקף את המוביל הקודם (Google T5) בכ-0.6% והוכיח את האפקטיביות של רעיונות חדשים בארכיטקטורת Transformer (ייצוג נפרד של תוכן ומיקום מילים, decoder מסכות משופר ועוד)<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-syncedreview-deberta-4)</sup>.

ההתקדמות לא עצרה: עם גדילת גודלם ומורכבותם של מודלי השפה המשיכו תוצאות SuperGLUE להשתפר<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-scaling-5)</sup>. לקראת סוף 2021 עמד בראש לוח המובילים המודל **T-NLRv5** של Microsoft (משפחת Microsoft Turing NLR) — הוא הרחיב עוד יותר את הפער מעל רמת האדם<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-scaling-5)</sup>. המשימות האחרונות שנותרו לא פתורות למכונה ב-GLUE (למשל, עדינויות NLI) "נסגרו" על ידי מודל זה, שהתקרב מאוד ל**שוויון מלא עם האדם** אפילו בתת-משימות הקשות ביותר<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-scaling-5)</sup>.

לשנים 2022–2023 עבר סף רמת האדם ב-SuperGLUE בביטחון על ידי כמה מודלים גדולים עצמאיים<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>. לדוגמה, המודל **PaLM** של Google (540 מיליארד פרמטרים) השיג בעת fine-tuning על משימות SuperGLUE כ-90.4 נקודות, והמודל **GPT-4** (שפותח על ידי OpenAI) הראה תוצאה גבוהה אף יותר<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>. באמצע 2023 כבר כלל לוח המובילים של SuperGLUE מספר מודלים עם ציון מעל 90 (כלומר, העולים על רמת האדם הממוצעת)<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>. ניתן לומר שה-benchmark **פוצח למעשה** על ידי המערכות המודרניות<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>: ציוני המודלים הטובים ביותר גבוהים כל כך שהם עולים על יכולות רוב האנשים הלא מוסמכים<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>. הצלחה זו מעידה על התקדמות עצומה ב-NLP בפרק זמן קצר, אך מצביעה גם על הצורך במבחנים חדשים ומאתגרים עוד יותר עבור המודלים החדישים ביותר<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>. כבר מופיעים benchmark-ים עוקבים (כגון MMLU, BIG-Bench ואחרים), שנועדו לבחון מודלים על הבנה רחבה יותר ועל ידע העולה על גבולות משימות SuperGLUE<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup>.

## השפעה ומחקר עתידי

SuperGLUE התבסס אפוא כ**שלב חשוב בהתפתחות שיטות ההערכה** בעיבוד שפה<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. בקרב חוקרים ומתלהבים, תוצאותיו הפכו למעין "נייר לקמוס" עבור ארכיטקטורות LLM חדשות: השגה או חציית רמת האדם ב-SuperGLUE נתפסת כסימן למודל מתקדם עם הבנת שפה עמוקה<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. הדבר בא לידי ביטוי גם בפרקטיקה — מודלי שפה מודרניים רבים שהגיעו לציונים גבוהים ב-SuperGLUE שימשו בסיס למערכות יישומיות של שאלות-תשובות, סוכני דיאלוג, מערכות סיכום טקסט ועוד<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup>. SuperGLUE ממשיך לשמש חוקרים ל-fine-tuning ולהשוואת אלגוריתמים, אם כי העמדה המובילה עוברת כעת בהדרגה לאמות מידה חדשות להערכת בינה מלאכותית.

## קישורים

- אתר הרשמי של SuperGLUE
- המאמר המקורי של SuperGLUE (NeurIPS)
- מאמר Microsoft על השגת רמת האדם על ידי DeBERTa
- דף הנתונים של SuperGLUE ב-Papers With Code

## ספרות

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## הערות

<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-neurips-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-reddit-t5-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-deberta-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-syncedreview-deberta-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-microsoft-scaling-5)</sup> <sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_note-ainavigator-benchmarks-6)</sup> \</references\>

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-neurips-main_1-59)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-reddit-t5_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-reddit-t5_2-4)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-6)</sup> <sup>[3.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-deberta_3-7)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">↑ <sup>[4.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-syncedreview-deberta_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-syncedreview-deberta_4-1)</sup> «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-scaling_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-microsoft-scaling_5-3)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-6)</sup> <sup>[6.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(HE)#cite_ref-ainavigator-benchmarks_6-7)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
