Chinchilla (language model) (HE)
Chinchilla — היא מודל שפה גדול (LLM) שפותח על ידי קבוצת המחקר של DeepMind והוצג במרץ 2022[1]. המודל מכיל כ-70 מיליארד פרמטרים והיה מאומן על קורפוס טקסט בהיקף של 1.4 טריליון tokens.
מאפיין המפתח של Chinchilla הוא הגישה החישובית-אופטימלית שלה לאימון. בניגוד למודלים קודמים, שם הדגש העיקרי היה על הגדלת מספר הפרמטרים, Chinchilla נוצרה על בסיס ההשערה בדבר הצורך במדרוג פרופורציונלי הן של גודל המודל והן של היקף נתוני האימון. בזכות גישה זו הדגימה Chinchilla עליונות על פני מודלים גדולים בהרבה, כגון Gopher (280 מיליארד פרמטרים) ו-GPT-3 (175 מיליארד), על פני מגוון רחב של משימות שפה[2].
רקע והיסטוריית הפיתוח
פיתוח Chinchilla היה תוצאה של מחקר מדרוג LLM שנערך ב-DeepMind על בסיס משפחת המודלים Gopher[3]. מודל Gopher, שהוצג בשנת 2021, כלל 280 מיליארד פרמטרים, אך אומן על קורפוס קטן יחסית של 300 מיליארד tokens. באותה תקופה שלטה בתעשייה גישה לפיה ביצועי המודלים גדלו בעיקר באמצעות הגדלת גודלם (מספר הפרמטרים), בעוד שהיקף הנתונים נותר יציב יחסית.
ההשערה על אימון חישובי-אופטימלי
חוקרי DeepMind העלו השערה כי מודלים גדולים רבים, כולל Gopher, היו לא מאומנים דיים (undertrained) ביחס לגודלם. הם לא הגיעו לאיכות המרבית האפשרית בתקציב חישובי נתון, מאחר שחסרו להם נתוני אימון[2].
מהות ההשערה הייתה שלצורך ניצול אופטימלי של משאבי החישוב, יש להגדיל את גודל המודל ואת היקף נתוני האימון פרופורציונלית זה לזה. במילים אחרות, בעת הכפלת מספר הפרמטרים של המודל יש להכפיל בערך פי שניים גם את מספר tokens האימון[1]. מסקנה זו נוגדת מחקרים קודמים שהעריכו יתר על המידה את הערך של הגדלת המודל, שכן בוצעו תוך קיבוע היקף הנתונים.
לצורך בדיקת השערה זו, ערכה צוות DeepMind ניסויים נרחבים, ואימן למעלה מ-400 מודלים בגדלים שונים על מערכות נתונים בהיקף של 5 עד 500 מיליארד tokens. התוצאות אישרו כי מדרוג מקביל הוא האסטרטגיה האופטימלית. על בסיס ממצאים אלה פותח מודל Chinchilla כבדיקה מעשית של הפרדיגמה החדשה[4].
ארכיטקטורה ואימון
מאפיינים ארכיטקטוניים
Chinchilla שייכת למשפחת ה-transformers האוטו-רגרסיביים וקרובה ארכיטקטונית למודלי GPT-2/GPT-3[3]. היא ירשה פתרונות רבים מ-Gopher, אך עם הבדלים מרכזיים שמטרתם הפחתת הגודל תוך שמירה על עומק הרשת:
- פרמטרים: כ-70 מיליארד פרמטרים מחולקים על פני 80 שכבות.
- רוחב המודל: מספר ראשי ה-self-attention הופחת ל-64 (לעומת 128 ב-Gopher), והממד הפנימי של השכבות הופחת ל-8192 (לעומת ~16384 ב-Gopher).
- אופטימייזר: נעשה שימוש ב-AdamW במקום Adam, מה שמשפר את ההתכנסות על מערכות נתונים גדולות[3].
ארכיטקטורה זו אפשרה ל-Chinchilla לשמור על אותו עומק רשת כמו Gopher, אך עם מספר פרמטרים קטן בהרבה, מה שהפחית את דרישות הזיכרון והמשאבים החישוביים.
מדרוג ונתוני אימון
לצורך בדיקת ההשערה, אומנה Chinchilla עם אותו תקציב חישובי כמו Gopher, אך עם הקצאה מחדש של משאבים לטובת הנתונים. המודל בן 70 המיליארד פרמטרים אומן על קורפוס של 1.4 טריליון tokens, פי 4 בערך מהיקף הנתונים שנעשה בהם שימוש עבור Gopher[1].
יחס זה, בערך 20 tokens לכל פרמטר, הפך לידוע בשם נקודת Chinchilla (Chinchilla Point) ומשמש כנקודת ייחוס לאימון חישובי-אופטימלי של LLM מודרניים[5]. הניסוי אישר כי Chinchilla, שאומנה קרוב יותר לגבול האופטימלי הזה, הצליחה לממש את הפוטנציאל שלה באופן מלא יותר ממודלים שלא אומנו דיים, אף שהיו גדולים ממנה.
תוצאות וביצועים
על מגוון רחב של מבחנים סטנדרטיים הדגימה Chinchilla עליונות משמעותית על פני מודלים קודמים. היא עקפה בביטחון לא רק את Gopher, אלא גם LLM מובילים אחרים של אותה תקופה, כולל OpenAI GPT-3 (175 מיליארד פרמטרים) ו-Megatron-Turing NLG (530 מיליארד פרמטרים)[1].
התוצאה המדגימה ביותר הייתה ב-benchmark המקיף MMLU (Measuring Massive Multitask Language Understanding), המעריך ידע והיסק במאות משימות מגוונות. Chinchilla השיגה דיוק ממוצע של 67.5%, שהיה שיא חדש למודלים ממחלקה זו, ועלה ב-7 נקודות אחוז על תוצאת Gopher[4].
מלבד יעילות גבוהה, הפגינה Chinchilla גם חסכוניות בשימוש. גודלו הקטן יותר של המודל (70 מיליארד לעומת 175+ מיליארד של מקביליו) מורה כי לצורך inference ו-fine-tuning נדרשים משאבים חישוביים פחותים בהרבה, מה שמפשט את יישומה המעשי.
משמעות והשפעה
מחקר Chinchilla השפיע השפעה יסודית על הגישות לאימון מודלי שפה גדולים.
- חוקי המדרוג של Chinchilla (Chinchilla scaling laws): היחס האופטימלי שהתגלה בין גודל המודל לבין היקף הנתונים הפך לסטנדרט דה-פקטו ולנקודת ייחוס לפיתוחים עוקבים בתעשייה.
- הסטת המוקד מגודל לנתונים: העבודה עודדה את התעשייה להקדיש תשומת לב רבה יותר ליצירה, ניקוי והרחבה של קורפוסי אימון, ולא רק להגדלה אקראית של מספר הפרמטרים.
- יישום במערכות מולטי-מודליות: Chinchilla שימשה כרכיב השפה המרכזי במודל המולטי-מודלי של DeepMind Flamingo, המסוגל להבין תמונות וטקסט[6].
אף שמודל Chinchilla עצמו לא שוחרר לגישה ציבורית, המושגים והתוצאות שפורסמו במאמר המדעי שינו את מסלול ההתפתחות של כל תחום LLM, ותיוו דרך לצמיחה יעילה ומאוזנת יותר של יכולות הבינה המלאכותית.
ספרות
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
- Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
- Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
הערות
- ↑ 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
- ↑ 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
- ↑ 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
- ↑ 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
- ↑ «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
- ↑ «Chinchilla (language model)». Wikipedia.