PaLM (Pathways Language Model) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — הוא משפחת מודלי שפה גדולים (LLM), שפותחה על ידי חברת Google. הגרסה הראשונה של המודל, שהוצגה באפריל 2022, הכילה 540 מיליארד פרמטרים והפכה לאחת ממודלי השפה הגדולים ביותר בעולם באותה עת, כשהיא מפגינה יכולות פורצות דרך שנבעו מהגדלת הקנה-מידה האדירה[1].

הבסיס הטכנולוגי המרכזי של PaLM היה Pathways — ארכיטקטורה חדשה של מערכות Machine Learning מבית Google, המאפשרת תיאום יעיל של חישובים מבוזרים על פני אלפי שבבי האצה[2]. PaLM הייתה ההדגמה הרחבת-הקנה-מידה הראשונה של מערכת זו, ובה הציגה יעילות אימון חסרת תקדים בהיקפים עצומים.

Pathways - מערכת Pathways: הבסיס להרחבת קנה-מידה

התפיסה של Pathways, שהוצגה על ידי Google בשנת 2021, כללה יצירת רשת עצבית אחידה המסוגלת להכליל ידע ביעילות עבור תחומים שונים ולבצע אלפי משימות בו-זמנית. PaLM הייתה היישום הרחב-הקנה-מידה הראשון של מערכת זו: האימון שלה פוזר על פני 6144 מעבדים מיוחדים מסוג TPU v4, המאוגדים בשני אשכולות ענן (TPU v4 Pods)[1].

בעת יצירתה, זו הייתה תצורת ה-TPU הגדולה ביותר שאי פעם שימשה לאימון מודל יחיד. המערכת השיגה יעילות שיא בניצול משאבי החומרה (57.8% FLOPs), מה שאפשר לעלות בקנה-מידה הרבה מעבר לפרויקטים קודמים ולאמן בהצלחה מודל עם יותר מחצי טריליון פרמטרים[3].

ארכיטקטורה ונתוני אימון

ארכיטקטורת המודל

PaLM הוא מודל שפה צפוף (לא דליל) עם ארכיטקטורת "decoder בלבד" (decoder-only), בדומה למודלי סדרת GPT. ארכיטקטורה זו מכוונת למשימות חיזוי הtoken הבא ומתאימה היטב לייצור טקסט. בשונה מארכיטקטורת transformer הסטנדרטית, PaLM משתמשת במספר שינויים מרכזיים לשיפור היעילות[1]:

  • שכבות מקביליות: מנגנוני attention ושכבות fully-connected מחושבות באופן מקבילי, מה שאפשר לזרז את האימון בכ-15%.
  • הפעלת SwiGLU: שימוש בפונקציית ההפעלה SwiGLU במקום ה-ReLU הסטנדרטית, מה ששיפר משמעותית את איכות המודל.

נתוני האימון

PaLM אומנה על קורפוס נתונים איכותי בהיקף של 780 מיליארד token. מערך הנתונים היה רב-לשוני ומגוון, וכלל[1]:

  • מסמכי אינטרנט ספרים באיכות גבוהה.
  • מאמרים מוויקיפדיה.
  • דיאלוגים מרשתות חברתיות (50% מהקורפוס).
  • קוד מקור מ-GitHub (5% מהקורפוס).

כ-78% מהנתונים היו באנגלית, ו-22% הנותרים היוו קבוצה רב-לשונית. לצורך tokenization נעשה שימוש בטכניקה מיוחדת "ללא הפסדים", ששמרה על כל הרווחים (קריטי עבור קוד) ופירקה תווי Unicode בלתי-מזוהים לבתים.

יכולות ותוצאות

יכולות אמרג'נטיות ולמידת few-shot

PaLM הדגים כי הגדלת קנה-המידה של המודל, נפח הנתונים ועוצמת החישוב עשויה להוביל ליכולות אמרג'נטיות (המופיעות באופן בלתי-צפוי). במשימות רבות, ביצועי המודל עלו בצורה חדה ולא-ליניארית רק עם הגעה לקנה-המידה המקסימלי, מה שהצביע על הופעת יכולות חדשות שלא נצפו בעבר[3].

המודל הוערך במצב של למידת few-shot (ללא fine-tuning, עם מספר דוגמאות ב-prompt) ועלה על מודלים גדולים קודמים (כגון GPT-3 ו-LaMDA) ב-28 מתוך 29 benchmark פופולריים של NLP. על מערך המשימות המקיף BIG-bench, PaLM הפך למודל הראשון שתוצאותיו עלו על הרמה הממוצעת שהפגינו בוחנים אנושיים[1].

היסק לאורך שרשרת מחשבות (Chain-of-Thought)

אחד ההישגים הבולטים ביותר של PaLM הייתה היכולת להיסק לוגי רב-שלבי בשימוש בטכניקת ה-prompt המכונה "שרשרת מחשבות" (chain-of-thought prompting)[1]. שיטה זו מבוססת על הצגת דוגמאות למודל שבהן פתרון הבעיה מפורט שלב-אחר-שלב. לאחר שלמד מדוגמאות כאלה, PaLM הצליח לייצר "שרשרת מחשבות" משלו לפתרון בעיות חדשות ומורכבות, כגון:

  • בעיות מתמטיות: בבחינת GSM8K (בעיות ברמת בית ספר יסודי) פתר PaLM 58% מהבעיות, מה שעלה על תוצאת ה-state-of-the-art הקודמת שהושגה על ידי מודל שעבר fine-tuning.
  • בעיות של הגיון שכלי: המודל הצליח לייצר הסברים מפורטים לבעיות לא-טריוויאליות, כגון מתן פירוש לבדיחות שלא נתקל בהן קודם לכן.

יכולת זו הפכה את תהליך ה"חשיבה" של המודל לשקוף יותר ודומה יותר לאופן החשיבה האנושית.

יצירת קוד ורב-לשוניות

למרות שקוד המקור היווה רק 5% מנתוני האימון, PaLM הציג רמה הדומה לזו של מודל Codex המיוחד של OpenAI במשימות יצירה ועיבוד של קוד. המודל גם הפגין יכולות חזקות במשימות רב-לשוניות, לרבות תרגום[3].

אבולוציה וממשיכים: משפחת PaLM

PaLM הפך לבסיס למשפחה שלמה של מודלים שפיתחה Google.

PaLM 2

ה-PaLM 2 שהוצג במאי 2023 הפך לממשיך יעיל ורב-לשוני יותר. במקום לרדוף אחר כמות הפרמטרים, הדגש הועבר לאיכות נתוני האימון וליעילות הארכיטקטורה. PaLM 2 אומן על טקסטים ביותר מ-100 שפות ומפגין יכולות משופרות בלוגיקה, תכנות ותרגום[4]. המודל משוחרר בארבעה גדלים (מהקטן לגדול): Gecko, Otter, Bison ו-Unicorn. הגרסה הקומפקטית ביותר (Gecko) קלה מספיק להפעלה על מכשירים ניידים במצב לא-מקוון.

גרסאות מיוחדות

על בסיס PaLM ו-PaLM 2 נוצרו גרסאות לתחומים ספציפיים:

  • Med-PaLM 2: מודל מיוחד לרפואה. הפך למערכת ה-AI הראשונה שהגיעה לרמת מומחה בשאלות בחינת הרישוי הרפואי בארה"ב (USMLE)[4].
  • Sec-PaLM 2: מודל המכוון לאבטחת סייבר, שאומן לזהות פגיעויות ולנתח קוד זדוני[5].

PaLM-E: הגרסה המולטי-מודלית

PaLM-E (Pathways Language Model Embodied) — הוא מודל מולטי-מודלי המשלב את מודל השפה PaLM עם נתונים ויזואליים מ-Vision Transformer (ViT). הדבר מאפשר למודל לעבד הן טקסט והן תמונות, לפתור משימות הקשורות לעולם הפיזי, לדוגמה לצורך שליטה בבוטים[6].

היבטים אתיים ומגבלות

יוצרי PaLM מדגישים את הצורך בגישה אחראית לפיתוח מודלי שפה גדולים. במאמר המדעי הרשמי בוצע ניתוח של הטיות ורעילות אפשריות בטקסט המיוצר. לשם שקיפות, Google פרסמה כרטיס מודל (Model Card) ותעודת נתונים (Datasheet) עבור PaLM, המתעדים את מאפייני ה-dataset, תוצאות הבדיקות והמגבלות שזוהו[1]. אמצעים אלה תואמים את הנהלים המודרניים של AI אחראי ומיועדים להפחית את הסיכונים הקשורים להטיות וליצירת תכנים מזיקים.

קישורים חיצוניים

  • הבלוג הרשמי של Google על PaLM
  • PaLM API למפתחים

ספרות

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

הערות

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]