---
title: "Encoder-only models — מודלים מבוססי מקודד בלבד"
source: "https://systems-analysis.info/int/Encoder-only_models_%E2%80%94_%D7%9E%D7%95%D7%93%D7%9C%D7%99%D7%9D_%D7%9E%D7%91%D7%95%D7%A1%D7%A1%D7%99_%D7%9E%D7%A7%D7%95%D7%93%D7%93_%D7%91%D7%9C%D7%91%D7%93"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_—_מודלים_מבוססי_מקודד_בלבד"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1927
wiki_created_at: 2026-09-06T22:56:09Z
wiki_modified_at: 2026-09-06T22:56:09Z
downloaded_at: 2026-09-07T22:48:32Z
---

# Encoder-only models — מודלים מבוססי מקודד בלבד

**מודלים מבוססי מקודד בלבד** (באנגלית: Encoder-Only Models) — הם מחלקה של ארכיטקטורות של מודלי שפה גדולים (LLM), המבוססות אך ורק על החלק **המקודד** (encoder) של ארכיטקטורת **Transformer**. בניגוד למודלים המשתמשים ב-decoder או בארכיטקטורה המלאה של encoder-decoder, מודלים אלה מתמחים במשימות **הבנת שפה טבעית (Natural Language Understanding, NLU)**.

המודל הדגל והחלוץ של גישה זו הוא **BERT** (Bidirectional Encoder Representations from Transformers), שפותח על ידי Google בשנת 2018.

## הרעיון והארכיטקטורה

הרעיון המרכזי של מודלים מבוססי מקודד בלבד הוא יצירת **ייצוגים מוקשרים להקשר** (embeddings) עמוקים לכל token ברצף הקלט. הודות למנגנון **self-attention** ב-Transformer, כל token יכול "לראות" וליצור אינטראקציה עם כל שאר ה-tokens ברצף, דבר המאפשר למודל ללכוד הקשר עשיר.

מאפיין מפתח הוא **דו-כיווניות**: הייצוג של כל token נוצר על בסיס ההקשר השמאלי וגם הימני בו-זמנית. זה מבדיל אותם באופן מהותי ממודלים אוטו-רגרסיביים מבוססי decoder בלבד (כגון GPT), שהם מטבעם חד-כיווניים.

מבחינה ארכיטקטונית, המודל מורכב מערימה של $N$ שכבות encoder זהות. כל שכבה מורכבת משני תת-שכבות עיקריות:

1.  **Multi-Head Self-Attention:** מחשב ייצוג מוקשר להקשר עבור כל token.
2.  **Feed-Forward Network:** מיישם טרנספורמציה לא-לינארית על כל ייצוג token.

בפלט, המודל מייצר רצף וקטורים באותה אורך כרצף הקלט, כאשר כל וקטור מהווה ייצוג עשיר של ה-token המתאים מהקלט.

## משימות אימון מקדים

כדי ללמד את המודל להבין שפה בהקשר דו-כיווני, נעשה שימוש במשימות אימון מקדים מבוקר-עצמי מיוחדות:

### Masked Language Modeling - מידול שפה עם מסיכה (MLM)

זוהי המשימה העיקרית והחשובה ביותר עבור מודלים מבוססי מקודד בלבד, שהוצגה לראשונה ב-BERT.

- **עקרון הפעולה:** מרצף הקלט מוסתרים (מוסווים) באופן אקראי אחוז קטן של tokens (בדרך כלל 15%). משימת המודל היא לחזות את הערכים המקוריים של ה-tokens המוסווים, תוך שימוש בהקשר הדו-כיווני הסובב אותם.
- **מטרה:** משימה זו מאלצת את המודל ללמוד קשרים סמנטיים ותחביריים עמוקים בין מילים.

### Next Sentence Prediction - חיזוי המשפט הבא (NSP)

משימה זו (גם היא מ-BERT המקורי) פותחה כדי ללמד את המודל להבין יחסים בין משפטים.

- **עקרון הפעולה:** המודל מקבל זוג משפטים ועליו לקבוע האם המשפט השני הוא המשך הגיוני של הראשון בטקסט המקורי.
- **סטטוס:** מחקרים מאוחרים יותר (לדוגמה, במודל RoBERTa) הראו כי NSP פחות יעילה מ-MLM, ולעיתים קרובות מחליפים אותה במשימות אחרות או מסירים אותה כליל.

## שימושים

מודלים מבוססי מקודד בלבד אינם מיועדים לייצור טקסט בצורה חופשית, מכיוון שאין להם decoder אוטו-רגרסיבי. עוצמתם טמונה בניתוח והבנת טקסט. ייצוגי הוקטורים של המודל בפלט משמשים לפתרון מגוון רחב של משימות NLU:

- **סיווג טקסט:** למשימות כגון ניתוח סנטימנט או זיהוי נושא, נעשה שימוש בייצוג ה-token המיוחד \`\[CLS\]\`, המתווסף לתחילת כל רצף. הוקטור הסופי שלו מצבר מידע על הרצף כולו.
- **סיווג tokens:** למשימות כגון זיהוי ישויות בשם (NER) או תיוג חלקי דיבר (POS-tagging), נעשה שימוש בייצוגי הוקטורים של כל token בנפרד.
- **מענה על שאלות (Question Answering):** במשימות שבהן התשובה היא קטע מתוך הטקסט הנתון (extractive QA), המודל מאומן לחזות את ה-tokens ההתחלתי והסופי של התשובה.
- **קבלת embeddings:** מודלים מבוססי מקודד משמשים לעיתים קרובות כמקודדי טקסט אוניברסליים לקבלת embeddings איכותיים של משפטים או מסמכים, שניתן להשתמש בהם לאחר מכן במנועי חיפוש או במשימות של דמיון סמנטי.

## מודלים עיקריים והתפתחותם

- **BERT** (2018): חלוץ הארכיטקטורה, שקבע שיאים חדשים על מגוון benchmark-ים של NLP.
- **RoBERTa** (2019): "BERT אופטימיזציה בצורה אמינה". הראה שניתן לשפר משמעותית את ביצועי BERT באמצעות אימון ממושך יותר על כמות גדולה יותר של נתונים ונטישת משימת NSP.
- **ALBERT** (2019): "A Lite BERT". מודל עם מספר פרמטרים קטן משמעותית הודות לטכניקות של פירוק embedding ושיתוף פרמטרים בין-שכבתי.
- **DistilBERT** (2019): גרסה מוקטנת של BERT, שנוצרה באמצעות distillation של ידע, שהיא מהירה וקלה יותר אך שומרת על חלק גדול מהביצועים של המקור.
- **ELECTRA** (2020): הציג משימת אימון מקדים יעילה יותר — **replaced token detection**, שבה המודל לומד להבחין בין tokens מקוריים ל"מזויפים", שנוצרו על ידי מודל-גנרטור קטן.
- **DeBERTa** (2020): הציג מנגנון "disentangled attention", המקודד בנפרד את התוכן ואת המיקומים היחסיים של tokens.

## ראו גם

- BERT
