Decoder-only models (architecture) (HE)
מודלים מבוססי מפענח בלבד (באנגלית: Decoder-Only Models) — הם המחלקה הדומיננטית של ארכיטקטורות מודלי שפה גדולים (LLM), המבוססים אך ורק על חלק המפענח (decoder) של ארכיטקטורת Transformer. מודלים אלו מתמחים במשימות יצירת טקסט ומהווים את הבסיס לרוב צ'אט-הבוטים ועוזרי ה-AI המודרניים.
סדרת הדגל שהפיצה גישה זו היא סדרת מודלי GPT של OpenAI.
Concept and Architecture - מושג וארכיטקטורה
הרעיון המרכזי של מודלים מבוססי מפענח בלבד הוא יצירה אוטו-רגרסיבית של רצפים. המשמעות היא שהמודל מנבא את ה-token הבא בהתבסס על כל ה-tokens הקודמים שנוצרו עד אותה נקודה. ה-prompt (בקשת המשתמש) והטקסט שכבר נוצר נתפסים כרצף אחד מאוחד, אותו ממשיך המודל.
מבחינה ארכיטקטונית, המודל מורכב מערימה של שכבות מפענח זהות. כל שכבה, בשונה מ-encoder או מ-decoder מלא, מכילה רק שני תת-שכבות עיקריות:
- Masked Multi-Head Self-Attention - ריבוי ראשי תשומת לב עצמית עם מיסוך: זהו המנגנון המרכזי המבטיח את התכונה האוטו-רגרסיבית. במהלך עיבוד הרצף, מסיכה סיבתית (causal mask) מיוחדת מונעת מכל token ל"הביט" ב-tokens הבאים אחריו. כך, הניבוי עבור מיקום תלוי רק ב-tokens במיקומים .
- Feed-Forward Network - רשת נוירונים מחוברת במלואה: מיישמת טרנספורמציה לא-לינארית על הייצוג של כל token.
במודלים מבוססי מפענח בלבד אין מנגנון cross-attention (תשומת לב צולבת), שכן אין encoder שאליו אפשר "לכוון תשומת לב".
Pre-training Tasks - משימות אימון מקדים
מודלים מבוססי מפענח בלבד מאומנים על משימה אחת, אך רבת-עוצמה, של למידה עצמית מפוקחת:
Causal Language Modeling (CLM) - מידול שפה סיבתי
- עקרון הפעולה: המודל מאומן לנבא את ה-token הבא ברצף. בכל שלב אימון הוא מקבל כקלט קטע טקסט ועליו לייצר התפלגות הסתברויות עבור ה-token הבא.
- המטרה: למקסם את ההסתברות של ה-token הנכון הבא על נפחים עצומים של נתוני טקסט. משימה פשוטה זו לכאורה מכריחה את המודל ללמוד דקדוק, תחביר, עובדות על העולם ודפוסים מורכבים של השפה.
Applications - יישומים
בזכות אופיים האוטו-רגרסיבי, מודלים מבוססי מפענח בלבד מתאימים באופן אידיאלי לכל משימה הדורשת יצירת טקסט:
- יצירת טקסט חופשית: כתיבת מאמרים, שירים, תסריטים וכדומה.
- מערכות דיאלוג וצ'אט-בוטים: מענה לשאלות משתמשים בסגנון שיחתי.
- סיכום: יצירת תקציר לטקסטים ארוכים.
- תרגום מכוני: אם כי לצורך זה נעשה שימוש תכוף במודלי encoder-decoder, מודלים מבוססי מפענח בלבד יכולים אף הם לבצע תרגום כאשר המשימה מנוסחת ב-prompt (לדוגמה: "תרגם מאנגלית לעברית: ...").
- כתיבת קוד: יצירת קוד על פי תיאור טקסטואלי.
- In-context learning - למידה בהקשר: בזכות היקפם, מודלי מפענח גדולים מפגינים יכולת לפתור משימות חדשות תוך קבלת מספר דוגמאות בלבד (few-shot) או אפילו ללא דוגמאות כלל (zero-shot) ישירות ב-prompt, ללא צורך ב-fine-tuning.
Key Models and Their Evolution - מודלים מרכזיים ואבולוציה שלהם
- סדרת GPT (2018–עד היום): חלוצים ומפיצי הגישה. GPT-1 הדגים את יעילות האימון המקדים, GPT-2 הציג את עוצמת ההתרחבות, ו-GPT-3 — את הופעת יכולות ה-few-shot. ChatGPT ו-GPT-4 הפכו ארכיטקטורה זו לתקן עבור עוזרי AI.
- LLaMA (2023–עד היום): סדרת מודלים פתוחים של Meta, אשר דמוקרטיזציה את הגישה ל-LLM חזקים ועוררה גל חדשנות בקהילה.
- Claude (2023–עד היום): משפחת מודלים של Anthropic, המתמקדת בבטיחות ובשליטה באמצעות Constitutional AI.
- PaLM ו-Gemini (2022–עד היום): מודלי הדגל של Google. Gemini הוא גם מודל מבוסס מפענח בלבד שהוא מולטי-מודאלי באופן ילידי.
Comparison with Other Architectures - השוואה עם ארכיטקטורות אחרות
| ארכיטקטורה | משימה עיקרית | כיוון ההקשר | מודלים טיפוסיים |
|---|---|---|---|
| מפענח בלבד | יצירת טקסט | חד-כיווני (משמאל לימין) | GPT, LLaMA, Claude, Gemini |
| מקודד בלבד | הבנת טקסט | דו-כיווני | BERT, RoBERTa |
| מקודד-מפענח | המרת רצף לרצף | דו-כיווני (מקודד) + חד-כיווני (מפענח) | T5, BART, Transformer המקורי |
ראו גם
- GPT