Encoder-only models — מודלים מבוססי מקודד בלבד
מודלים מבוססי מקודד בלבד (באנגלית: Encoder-Only Models) — הם מחלקה של ארכיטקטורות של מודלי שפה גדולים (LLM), המבוססות אך ורק על החלק המקודד (encoder) של ארכיטקטורת Transformer. בניגוד למודלים המשתמשים ב-decoder או בארכיטקטורה המלאה של encoder-decoder, מודלים אלה מתמחים במשימות הבנת שפה טבעית (Natural Language Understanding, NLU).
המודל הדגל והחלוץ של גישה זו הוא BERT (Bidirectional Encoder Representations from Transformers), שפותח על ידי Google בשנת 2018.
הרעיון והארכיטקטורה
הרעיון המרכזי של מודלים מבוססי מקודד בלבד הוא יצירת ייצוגים מוקשרים להקשר (embeddings) עמוקים לכל token ברצף הקלט. הודות למנגנון self-attention ב-Transformer, כל token יכול "לראות" וליצור אינטראקציה עם כל שאר ה-tokens ברצף, דבר המאפשר למודל ללכוד הקשר עשיר.
מאפיין מפתח הוא דו-כיווניות: הייצוג של כל token נוצר על בסיס ההקשר השמאלי וגם הימני בו-זמנית. זה מבדיל אותם באופן מהותי ממודלים אוטו-רגרסיביים מבוססי decoder בלבד (כגון GPT), שהם מטבעם חד-כיווניים.
מבחינה ארכיטקטונית, המודל מורכב מערימה של שכבות encoder זהות. כל שכבה מורכבת משני תת-שכבות עיקריות:
- Multi-Head Self-Attention: מחשב ייצוג מוקשר להקשר עבור כל token.
- Feed-Forward Network: מיישם טרנספורמציה לא-לינארית על כל ייצוג token.
בפלט, המודל מייצר רצף וקטורים באותה אורך כרצף הקלט, כאשר כל וקטור מהווה ייצוג עשיר של ה-token המתאים מהקלט.
משימות אימון מקדים
כדי ללמד את המודל להבין שפה בהקשר דו-כיווני, נעשה שימוש במשימות אימון מקדים מבוקר-עצמי מיוחדות:
Masked Language Modeling - מידול שפה עם מסיכה (MLM)
זוהי המשימה העיקרית והחשובה ביותר עבור מודלים מבוססי מקודד בלבד, שהוצגה לראשונה ב-BERT.
- עקרון הפעולה: מרצף הקלט מוסתרים (מוסווים) באופן אקראי אחוז קטן של tokens (בדרך כלל 15%). משימת המודל היא לחזות את הערכים המקוריים של ה-tokens המוסווים, תוך שימוש בהקשר הדו-כיווני הסובב אותם.
- מטרה: משימה זו מאלצת את המודל ללמוד קשרים סמנטיים ותחביריים עמוקים בין מילים.
Next Sentence Prediction - חיזוי המשפט הבא (NSP)
משימה זו (גם היא מ-BERT המקורי) פותחה כדי ללמד את המודל להבין יחסים בין משפטים.
- עקרון הפעולה: המודל מקבל זוג משפטים ועליו לקבוע האם המשפט השני הוא המשך הגיוני של הראשון בטקסט המקורי.
- סטטוס: מחקרים מאוחרים יותר (לדוגמה, במודל RoBERTa) הראו כי NSP פחות יעילה מ-MLM, ולעיתים קרובות מחליפים אותה במשימות אחרות או מסירים אותה כליל.
שימושים
מודלים מבוססי מקודד בלבד אינם מיועדים לייצור טקסט בצורה חופשית, מכיוון שאין להם decoder אוטו-רגרסיבי. עוצמתם טמונה בניתוח והבנת טקסט. ייצוגי הוקטורים של המודל בפלט משמשים לפתרון מגוון רחב של משימות NLU:
- סיווג טקסט: למשימות כגון ניתוח סנטימנט או זיהוי נושא, נעשה שימוש בייצוג ה-token המיוחד `[CLS]`, המתווסף לתחילת כל רצף. הוקטור הסופי שלו מצבר מידע על הרצף כולו.
- סיווג tokens: למשימות כגון זיהוי ישויות בשם (NER) או תיוג חלקי דיבר (POS-tagging), נעשה שימוש בייצוגי הוקטורים של כל token בנפרד.
- מענה על שאלות (Question Answering): במשימות שבהן התשובה היא קטע מתוך הטקסט הנתון (extractive QA), המודל מאומן לחזות את ה-tokens ההתחלתי והסופי של התשובה.
- קבלת embeddings: מודלים מבוססי מקודד משמשים לעיתים קרובות כמקודדי טקסט אוניברסליים לקבלת embeddings איכותיים של משפטים או מסמכים, שניתן להשתמש בהם לאחר מכן במנועי חיפוש או במשימות של דמיון סמנטי.
מודלים עיקריים והתפתחותם
- BERT (2018): חלוץ הארכיטקטורה, שקבע שיאים חדשים על מגוון benchmark-ים של NLP.
- RoBERTa (2019): "BERT אופטימיזציה בצורה אמינה". הראה שניתן לשפר משמעותית את ביצועי BERT באמצעות אימון ממושך יותר על כמות גדולה יותר של נתונים ונטישת משימת NSP.
- ALBERT (2019): "A Lite BERT". מודל עם מספר פרמטרים קטן משמעותית הודות לטכניקות של פירוק embedding ושיתוף פרמטרים בין-שכבתי.
- DistilBERT (2019): גרסה מוקטנת של BERT, שנוצרה באמצעות distillation של ידע, שהיא מהירה וקלה יותר אך שומרת על חלק גדול מהביצועים של המקור.
- ELECTRA (2020): הציג משימת אימון מקדים יעילה יותר — replaced token detection, שבה המודל לומד להבחין בין tokens מקוריים ל"מזויפים", שנוצרו על ידי מודל-גנרטור קטן.
- DeBERTa (2020): הציג מנגנון "disentangled attention", המקודד בנפרד את התוכן ואת המיקומים היחסיים של tokens.
ראו גם
- BERT