Pre-training of large language models — פרה-אימון

From Systems analysis Wiki
Jump to navigation Jump to search

פרה-אימון של מודלים שפתיים גדולים (LLM) — הוא שלב יסודי ביצירת מודלים שפתיים גדולים מודרניים, המורכב מאימונם על מאגרי טקסט עצומים ומגוונים ללא תיוג. תהליך זה מאפשר למודלים לקלוט דפוסים לשוניים כלליים, ידע על העולם וקשרים סמנטיים, ויוצר את מה שנקרא מודל יסוד (foundation model), אשר ניתן לאחר מכן להתאים לפתרון משימות ספציפיות.

מהו פרה-אימון?

פרה-אימון (pre-training) מהווה את השלב הראשוני של האימון, שבו ה-LLM עובר אימון על מערכי נתוני טקסט בקנה מידה גדול תוך שימוש בשיטות למידה בפיקוח עצמי (self-supervised learning). משמעות הדבר היא שאותות האימון (תוויות) נוצרים מתוך הנתונים עצמם, ללא צורך בתיוג ידני על ידי בני אדם.

המטרה העיקרית של שלב זה היא חיזוי חלקים נסתרים או עתידיים של הטקסט. בהתאם לארכיטקטורה, נעשה שימוש בשתי משימות עיקריות:

  • מידול שפה סיבתי (Causal Language Modeling, CLM): המודל לומד לחזות את המילה הבאה (token) ברצף על בסיס כל הקודמות לה. גישה זו עומדת בבסיסם של מודלים גנרטיביים כגון GPT.
  • מידול שפה מוסווה (Masked Language Modeling, MLM): המודל לומד לשחזר מילים שהוסוו באקראי בטקסט, תוך שימוש בהקשר הדו-כיווני הסובב אותן (מילים משמאל ומימין). שיטה זו משמשת במודלים כגון BERT.

בזכות משימות אלו, המודל נאלץ ללמוד תחביר, סמנטיקה וידע עובדתי על העולם כדי לבצע חיזויים מוצלחים.

נתונים לפרה-אימון

יעילות הפרה-אימון תלויה במידה רבה באיכות ובמגוון נתוני האימון. נעשה שימוש במקורות עיקריים הבאים:

  • דפי אינטרנט: מאגרי נתונים כגון Common Crawl ו-C4 מספקים מגוון רחב של נושאים, סגנונות ושפות, ומהווים "תצלום" של האינטרנט.
  • ספרים: קורפוסים כגון BookCorpus ו-The Pile מספקים טקסט מובנה ועקבי, שימושי להבנת תלויות ארוכות טווח ונרטיבים.
  • נתוני שיחה: נתונים מפורומים (כגון Reddit) ורשתות חברתיות, המסייעים למודלים לשלוט בשפה בלתי פורמלית ובדפוסי שיח.
  • נתונים מתמחים: מאמרים מדעיים (מ-arXiv), קוד תוכנה (מ-GitHub ו-The Stack) או טקסטים רב-לשוניים לשיפור יכולות ספציפיות של המודל.

דוגמאות לפיזור נתונים

מודלים שונים משתמשים ביחסים שונים בין המקורות, דבר המשפיע על יכולותיהם הסופיות:

  • GPT-3 (175 מיליארד פרמטרים):** 16% ספרים, 84% דפי אינטרנט.
  • PaLM (540 מיליארד פרמטרים):** 5% ספרים, 14% דפי אינטרנט, 50% נתוני שיחה, 31% אחר.
  • LLaMA (65 מיליארד פרמטרים):** 5% ספרים, 2% דפי אינטרנט, 87% נתוני שיחה.

פיזורים אלה מראים כי בחירת הנתונים היא החלטה אסטרטגית המשתנה בהתאם למטרות המודל.

קורפוסים בשימוש נפוץ

מערכי נתונים בשימוש נפוץ לפרה-אימון של LLM
קורפוס גודל מקור עדכון אחרון
BookCorpus 5GB ספרים דצמ-2015
Gutenberg - ספרים דצמ-2021
C4 800GB Common Crawl אפר-2019
CC-Stories-R 31GB Common Crawl ספט-2019
CC-NEWS 78GB Common Crawl פבר-2019
REALNEWS 120GB Common Crawl אפר-2019
OpenWebText 38GB קישורי Reddit מרץ-2023
Pushshift.io 2TB קישורי Reddit מרץ-2023
Wikipedia 21GB ויקיפדיה מרץ-2023
The Pile 800GB אחר דצמ-2020
ROOTS 1.6TB אחר יונ-2022

טכניקות אימון

פרה-אימון של LLM דורש משאבי מחשוב משמעותיים. לניהול תהליך זה נעשה שימוש בטכניקות הבאות:

  • אימון מבוזר: שימוש במספר GPU או TPU לעיבוד מקבילי.
  • דיוק מעורב (Mixed Precision): שימוש בפורמטים מספריים בדיוק נמוך יותר (למשל 16 סיביות במקום 32 סיביות) להאצת החישובים וצמצום השימוש בזיכרון.
  • נקודות ביקורת של גרדיאנט (Gradient Checkpointing): טכניקה לחיסכון בזיכרון על ידי חישוב מחדש, במקום אחסון, של חלק מהפעלות הביניים.
  • מקביליות מודל (Model Parallelism): חלוקת המודל עצמו על פני מספר התקנים.

אימון מודל כגון GPT-3 עשוי להימשך מספר חודשים על אלפי GPU.

חוקי קנה המידה

מחקרים כגון עבודתם של OpenAI (Kaplan et al., 2020) הראו כי ביצועי מודלים שפתיים משתפרים באופן צפוי עם הגדלת שלושה גורמים:

  • גודל המודל (מספר הפרמטרים).
  • נפח הנתונים.
  • משאבי המחשוב.

תלויות אמפיריות אלו, המוכרות בשם חוקי קנה המידה, משמשות כמדריך למפתחים בתכנון ואימון מודלים גדולים וחזקים יותר, ומאפשרות חלוקה אופטימלית של תקציב המחשוב.

אתגרים והישגים

  • קנה מידה: ההישג העיקרי של פרה-אימון הוא היכולת לאזן בין גודל המודל, הנתונים והמחשוב להשגת ביצועים אופטימליים.
  • איכות נתונים: הבטחת ניקיון, מגוון והיעדר הטיה בנתוני האימון היא אתגר מרכזי.
  • יעילות: פיתוח שיטות לצמצום עלויות המחשוב, כגון פרה-אימון רציף או ארכיטקטורות יעילות יותר.
  • רב-לשוניות: יצירת מודלים המסוגלים לעבד מספר שפות ביעילות דורשת בחירה ואיזון קפדניים של נתונים.

ראו גם

  • מודלים שפתיים גדולים
  • BERT
  • GPT