---
title: "GLUE Benchmark (HE)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(HE)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2425
wiki_created_at: 2026-09-06T23:03:50Z
wiki_modified_at: 2026-09-06T23:03:50Z
downloaded_at: 2026-09-07T22:51:07Z
---

# GLUE Benchmark (HE)

**GLUE** (ראשי תיבות של **General Language Understanding Evaluation**, «הערכה כללית של הבנת שפה») — הוא benchmark רב-משימתי להערכת איכות מודלים לעיבוד שפה טבעית (NLU). ה-benchmark הוצע בשנת 2018 על ידי קבוצת חוקרים מאוניברסיטת ניו יורק, אוניברסיטת וושינגטון ו-DeepMind, בהם **אלכס וואנג** ו**סמואל באומן**, והפך נפוץ מאוד בקהילת המחקר<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-glue_paper-1)</sup>.

המטרה המרכזית של GLUE היא לספק חבילת בדיקות אחידה, ניטרלית ומאתגרת להשוואה בין יכולות מודלי NLU על מגוון משימות החורגות מתחום ספציפי אחד. ה-benchmark כולל פלטפורמה מקוונת עם **לוח תוצאות** (leaderboard), המאפשרת השוואה אובייקטיבית בין מודלים ומונעת התאמה לנתוני הבדיקה, שכן התוויות האמיתיות של חלק מהבדיקות אינן מפורסמות ונגישות רק דרך שרת ההערכה. ההנחה היא שכדי להשיג תוצאות גבוהות, על המודל להיות מסוגל לחלץ ייצוגי שפה כלליים ולהעביר ידע ביעילות בין סוגי משימות שונים.

## הרכב ומשימות ה-benchmark

ה-benchmark של GLUE מאחד תשע משימות שונות להבנת שפה, המבוססות על datasets קיימים ומאתגרים עבור בינה מלאכותית. כל המשימות מנוסחות כסיווג או רגרסיה על משפט בודד או על זוג משפטים<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — משימת קביעת הקבילות הדקדוקית של משפט. מדד האיכות — מקדם המתאם של מת'יוס.
- **SST-2** (*Stanford Sentiment Treebank*) — משימת זיהוי הסנטימנט (חיובי/שלילי) של ביקורת סרט. המדד — דיוק (*accuracy*).
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — משימת זיהוי פרפרזות בזוג משפטים ממקורות חדשותיים. המדדים — דיוק ומדד F1.
- **QQP** (*Quora Question Pairs*) — משימת זיהוי שאלות כפולות מקהילת Quora. המדדים — דיוק ומדד F1.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — משימת השוואה סמנטית בין שני משפטים. המודל נדרש לחזות את מידת הקרבה המשמעותית בסולם של 1 עד 5. המדדים — מקדמי המתאם של פירסון ושל ספירמן.
- **MNLI** (*Multi-Genre Natural Language Inference*) — משימת זיהוי גרירה טקסטואלית על זוגות משפטים ממקורות ז'אנריים מגוונים (גרירה, סתירה, ניטרליות). התוצאות מוערכות בנפרד על תת-קבוצות תואמות (*matched*) ולא-תואמות (*mismatched*).
- **QNLI** (*Question Natural Language Inference*) — משימה שנגזרה מהמרת dataset ה-SQuAD. נדרש לקבוע האם משפט מהפסקה מכיל תשובה לשאלה הנתונה.
- **RTE** (*Recognizing Textual Entailment*) — dataset מצטבר לגרירה טקסטואלית, המאחד מספר אוספים קטנים. המשימה — סיווג בינארי של היחס בין משפטים.
- **WNLI** (*Winograd NLI*) — גרסה מותאמת של סכמת וינוגרד לפורמט NLI. משימת פתרון אנפורה: המערכת מקבלת משפט עם כינוי גוף דו-משמעי ועליה לציין לאיזה משני האובייקטים הוא מתייחס.

## מתודולוגיית ההערכה

להערכה ב-GLUE, חוקרים שולחים את תחזיות המודל שלהם לשרת ייעודי, ולאחר מכן מקבלים חישוב אוטומטי של המדדים לכל משימה וציון מסכם.

- **GLUE-score** — המדד הסופי, המחושב כממוצע התוצאות על כל תשע המשימות הראשיות.
- **לוח התוצאות (Leaderboard)** — טבלה ציבורית המשקפת את המצב העדכני ומציגה אילו מודלים מתמודדים טוב יותר עם משימות NLU. השימוש בערכות בדיקה נסתרות מבטיח השוואה הוגנת.
- **ערכת האבחון** — ערכה מיוחדת של 1100 דוגמאות, המאוישות ידנית על ידי מומחים לניתוח לשוני עדין. היא אינה משפיעה על הדירוג, אלא משמשת כלי לניתוח איכותי לבדיקה אילו תופעות לשוניות (סמנטיקה לקסיקלית, לוגיקה, שכל ישר) המודל מסוגל לזהות ועם אילו הוא מתקשה<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-glue_paper-1)</sup>.

## תוצאות והשפעה על התעשייה

בעת השקת GLUE בשנת 2018, המודלים הטובים ביותר באותה עת (למשל, BiLSTM עם ELMo) השיגו תוצאה כוללת של כ-**70 נקודות** (בסולם 0–100), שהייתה נמוכה משמעותית מרמת האדם (כ-87 נקודות)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-human_vs_muppet-2)</sup>.

הופעת GLUE ולוח התוצאות הפתוח עוררה התקדמות מהירה בתחום למידת ההעברה ב-NLP.

- עד מאי 2019, בפחות משנה, דור חדש של מודלים מבוססי transformer (בראשם, BERT) העלה את רף ה-*state-of-the-art* ל-**83.9 נקודות**.
- במחצית השנייה של 2019, ה-benchmark של GLUE למעשה «נפרץ»: המערכות הטובות ביותר התקרבו צמוד לרמת האדם, ובחלק מהמשימות אף עלו עליה<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-w4ngatang_superglue-3)</sup>.

GLUE מילא תפקיד עצום כ**נקודת ייחוס אחידה** בפיתוח מודלים להבנת שפה. הודות לו, חוקרים יכלו להשוות ישירות ארכיטקטורות שונות על חבילה מורכבת של משימות, לזהות את החוזקות והחולשות של הגישות השונות ולחלוק הישגים במהירות דרך לוח התוצאות הציבורי.

## SuperGLUE: פיתוח עתידי

ההצלחה המהירה של GLUE הובילה לכך שכבר שנה לאחר מכן אותה קבוצת מחברים, בהשתתפות עמיתים מ-Facebook AI, הציגה חבילה חדשה ומאתגרת יותר בשם **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_note-venturebeat_superglue-4)</sup>.

SuperGLUE הוכרז בסוף 2019 כחבילת בדיקות «דביקה יותר» (*stickier*), שנועדה ליצור מחדש פער בין יכולות המודלים המודרניים לבין האדם. נכללו בה שמונה משימות הדורשות הבנת שפה עמוקה אף יותר, וכן שופרו הכלים והכללים למשתתפים. אמנם GLUE ממשיך לשמש כבדיקת בסיס, אולם מוקד השיפור התחרותי עבר ל-SuperGLUE ול-benchmarks אחרים, מתמחים יותר.

## קישורים חיצוניים

- האתר הרשמי של GLUE Benchmark
- דף GLUE ב-Papers With Code עם תוצאות המודלים

## ספרות

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## הערות

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HE)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
