Decoder-only models (architecture) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

מודלים מבוססי מפענח בלבד (באנגלית: Decoder-Only Models) — הם המחלקה הדומיננטית של ארכיטקטורות מודלי שפה גדולים (LLM), המבוססים אך ורק על חלק המפענח (decoder) של ארכיטקטורת Transformer. מודלים אלו מתמחים במשימות יצירת טקסט ומהווים את הבסיס לרוב צ'אט-הבוטים ועוזרי ה-AI המודרניים.

סדרת הדגל שהפיצה גישה זו היא סדרת מודלי GPT של OpenAI.

Concept and Architecture - מושג וארכיטקטורה

הרעיון המרכזי של מודלים מבוססי מפענח בלבד הוא יצירה אוטו-רגרסיבית של רצפים. המשמעות היא שהמודל מנבא את ה-token הבא בהתבסס על כל ה-tokens הקודמים שנוצרו עד אותה נקודה. ה-prompt (בקשת המשתמש) והטקסט שכבר נוצר נתפסים כרצף אחד מאוחד, אותו ממשיך המודל.

מבחינה ארכיטקטונית, המודל מורכב מערימה של N שכבות מפענח זהות. כל שכבה, בשונה מ-encoder או מ-decoder מלא, מכילה רק שני תת-שכבות עיקריות:

  1. Masked Multi-Head Self-Attention - ריבוי ראשי תשומת לב עצמית עם מיסוך: זהו המנגנון המרכזי המבטיח את התכונה האוטו-רגרסיבית. במהלך עיבוד הרצף, מסיכה סיבתית (causal mask) מיוחדת מונעת מכל token ל"הביט" ב-tokens הבאים אחריו. כך, הניבוי עבור מיקום i תלוי רק ב-tokens במיקומים <i.
  2. Feed-Forward Network - רשת נוירונים מחוברת במלואה: מיישמת טרנספורמציה לא-לינארית על הייצוג של כל token.

במודלים מבוססי מפענח בלבד אין מנגנון cross-attention (תשומת לב צולבת), שכן אין encoder שאליו אפשר "לכוון תשומת לב".

Pre-training Tasks - משימות אימון מקדים

מודלים מבוססי מפענח בלבד מאומנים על משימה אחת, אך רבת-עוצמה, של למידה עצמית מפוקחת:

Causal Language Modeling (CLM) - מידול שפה סיבתי

  • עקרון הפעולה: המודל מאומן לנבא את ה-token הבא ברצף. בכל שלב אימון הוא מקבל כקלט קטע טקסט ועליו לייצר התפלגות הסתברויות עבור ה-token הבא.
  • המטרה: למקסם את ההסתברות של ה-token הנכון הבא על נפחים עצומים של נתוני טקסט. משימה פשוטה זו לכאורה מכריחה את המודל ללמוד דקדוק, תחביר, עובדות על העולם ודפוסים מורכבים של השפה.

Applications - יישומים

בזכות אופיים האוטו-רגרסיבי, מודלים מבוססי מפענח בלבד מתאימים באופן אידיאלי לכל משימה הדורשת יצירת טקסט:

  • יצירת טקסט חופשית: כתיבת מאמרים, שירים, תסריטים וכדומה.
  • מערכות דיאלוג וצ'אט-בוטים: מענה לשאלות משתמשים בסגנון שיחתי.
  • סיכום: יצירת תקציר לטקסטים ארוכים.
  • תרגום מכוני: אם כי לצורך זה נעשה שימוש תכוף במודלי encoder-decoder, מודלים מבוססי מפענח בלבד יכולים אף הם לבצע תרגום כאשר המשימה מנוסחת ב-prompt (לדוגמה: "תרגם מאנגלית לעברית: ...").
  • כתיבת קוד: יצירת קוד על פי תיאור טקסטואלי.
  • In-context learning - למידה בהקשר: בזכות היקפם, מודלי מפענח גדולים מפגינים יכולת לפתור משימות חדשות תוך קבלת מספר דוגמאות בלבד (few-shot) או אפילו ללא דוגמאות כלל (zero-shot) ישירות ב-prompt, ללא צורך ב-fine-tuning.

Key Models and Their Evolution - מודלים מרכזיים ואבולוציה שלהם

  • סדרת GPT (2018–עד היום): חלוצים ומפיצי הגישה. GPT-1 הדגים את יעילות האימון המקדים, GPT-2 הציג את עוצמת ההתרחבות, ו-GPT-3 — את הופעת יכולות ה-few-shot. ChatGPT ו-GPT-4 הפכו ארכיטקטורה זו לתקן עבור עוזרי AI.
  • LLaMA (2023–עד היום): סדרת מודלים פתוחים של Meta, אשר דמוקרטיזציה את הגישה ל-LLM חזקים ועוררה גל חדשנות בקהילה.
  • Claude (2023–עד היום): משפחת מודלים של Anthropic, המתמקדת בבטיחות ובשליטה באמצעות Constitutional AI.
  • PaLM ו-Gemini (2022–עד היום): מודלי הדגל של Google. Gemini הוא גם מודל מבוסס מפענח בלבד שהוא מולטי-מודאלי באופן ילידי.

Comparison with Other Architectures - השוואה עם ארכיטקטורות אחרות

השוואת ארכיטקטורות מפתח המבוססות על Transformer
ארכיטקטורה משימה עיקרית כיוון ההקשר מודלים טיפוסיים
מפענח בלבד יצירת טקסט חד-כיווני (משמאל לימין) GPT, LLaMA, Claude, Gemini
מקודד בלבד הבנת טקסט דו-כיווני BERT, RoBERTa
מקודד-מפענח המרת רצף לרצף דו-כיווני (מקודד) + חד-כיווני (מפענח) T5, BART, Transformer המקורי

ראו גם

  • GPT