LLaMA (Meta AI) (HE)
LLaMA (Large Language Model Meta AI) — משפחה של מודלי שפה גדולים (LLM) בקוד פתוח ברובו, המפותחת על ידי מחלקת המחקר של Meta AI. מודלי LLaMA בנויים על ארכיטקטורת transformer מעודכנת ומכוונים ליעילות חישובית גבוהה, הנגשת טכנולוגיות AI מתקדמות לכלל הציבור, והתאמה קלה למשימות מתמחות. המשפחה התפתחה מהמהדורה המחקרית הראשונית LLaMA 1 (פברואר 2023) עד למודלים מולטימודאליים של LLaMA 4 (מהדורה מתוכננת ב-2026).
שם המודל
הראשי תיבות LLaMA מייצגים Large Language Model Meta AI (מודל שפה גדול של Meta AI).
- Large Language Model — מדגיש את היקף המודלים, שפרמטריהם נמדדים ממיליארדים עד טריליונים.
- Meta AI — מציין את המפתחת, קבוצת המחקר של Meta.
היסטוריית הפיתוח
פיתוח LLaMA החל בסוף 2022 כתגובה אסטרטגית של Meta להצלחת ChatGPT מבית OpenAI. מארק צוקרברג הרכיב צוות בין-תחומי הכולל חוקרים ממעבדת FAIR (Facebook AI Research). תפקיד מפתח בפילוסופיית הפרויקט מילא יאן לקון, ראש FAIR, שמאז 2013 דגל בעיקרון של פתיחות מלאה של כל מחקרי המעבדה.
הגרסה הראשונה, LLaMA 1, שוחררה בפברואר 2023 תחת רישיון מחקרי. זמן קצר לאחר השחרור, במרץ 2023, הודלפו משקלי המודל לרשת דרך BitTorrent. אירוע זה, בניגוד לחששות, לא עצר אלא דווקא האיץ את פיתוח הפרויקט, שכן אפשר לחוקרים עצמאיים וחובבים ברחבי העולם להתנסות במודל. כתוצאה מכך הופיעו עשרות אלפי מודלים נגזרים בפלטפורמת Hugging Face. הגרסאות הבאות, החל מ-LLaMA 2, שוחררו כבר תחת רישיון מסחרי[1], המבסס את מעמד LLaMA כשחקן מרכזי בשוק מודלי ה-AI הפתוחים.
אבולוציית המודלים וציר הזמן של המהדורות
| גרסה | תאריך שחרור | טווח פרמטרים | חידושים ותכונות מרכזיות |
|---|---|---|---|
| LLaMA 1 | פברואר 2023 | 7B – 65B | ארכיטקטורת בסיס (RMSNorm, SwiGLU, RoPE). אימון על 1.4 טריליון tokens. חלון הקשר של 2048 tokens. רישיון מחקרי. |
| LLaMA 2 | יולי 2023 | 7B – 70B | fine-tuning לשיחות (RLHF). הטמעת Grouped-Query Attention (GQA). חלון הקשר של 4096 tokens. רישיון מסחרי ראשון. |
| Code Llama | אוגוסט 2023 | 7B – 70B | גרסה מתמחה לקוד. fine-tuning על 500 מיליארד tokens של קוד. וריאנטים: בסיסי, Python-מתמחה, instruction-tuned. |
| LLaMA 3 | אפריל 2024 | 8B, 70B | אימון על 15 טריליון tokens. tokenizer משופר עם אוצר מילים של 128 אלף tokens. ביצועים גבוהים (82% על MMLU). |
| LLaMA 3.1 | יולי 2024[2] | 8B, 70B, 405B | מודל הדגל 405B עם ביצועים ברמת GPT-4o. חלון הקשר של עד 128 אלף tokens. נוספה יכולת עיבוד תמונות. |
| LLaMA 4 | (מתוכנן: אפריל 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | ארכיטקטורת Mixture-of-Experts (MoE). מולטימודאליות מובנית (טקסט, תמונות, וידאו). חלון הקשר של עד 10 מיליון tokens. |
ארכיטקטורה
LLaMA משתמשת בארכיטקטורת autoregressive transformer-decoder, אך מציגה מספר שיפורים מרכזיים המגבירים את יעילות החישוב ואיכות הטקסט המיוצר:
- Pre-normalization (נרמול מקדים). הנרמול מוחל על כניסת כל תת-שכבה של ה-transformer, ולא על יציאתה. גישה זו מייצבת את האימון של רשתות עמוקות מאוד ומונעת בעיות של גרדיאנטים.
- RMSNorm (Root Mean Square Layer Normalization). במקום LayerNorm הסטנדרטי משתמשים ב-RMSNorm. טכניקת נרמול זו מבטלת את פעולת חיסור הממוצע, מה שמאיץ את החישובים ב-10–50% תוך שמירה על יציבות.
- SwiGLU (Swish-Gated Linear Unit). כפונקציית הפעלה, במקום ReLU או GELU משתמשים ב-SwiGLU. מנגנון שערים (gating mechanism) זה יוצר זרימת גרדיאנט חלקה יותר ומשפר את איכות המודל.
- RoPE (Rotary Position Embeddings, embedding מיקום רוטציוני). לקידוד מיקומי tokens משתמשים ב-embedding מיקום יחסי RoPE, המאפשר למודל לבצע אקסטרפולציה טובה יותר לרצפים ארוכים מאלה ששימשו באימון.
- GQA (Grouped-Query Attention). הוכנס ב-LLaMA 2, טכניקה זו היא אופטימיזציה של attention רב-ראשי המפחיתה משמעותית את דרישות הזיכרון ומאיצה את יצירת הטקסט.
- Mixture-of-Experts (MoE) (מתוכנן ב-LLaMA 4). ארכיטקטורה המחלקת את פרמטרי המודל לרשתות-משנה "מומחה", תוך הפעלת חלק קטן מהן בלבד לכל שאילתה. זה מפחית בחדות את עלויות החישוב של inference.
תצורות LLaMA 1
| מודל | פרמטרים | מימד מצב נסתר | מספר שכבות | מספר ראשי attention | נפח נתוני האימון |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T tokens |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T tokens |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T tokens |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T tokens |
נתוני אימון
נפח קורפוסי האימון גדל מ-1.4 טריליון tokens עבור LLaMA 1 ל-15 טריליון עבור LLaMA 3. לאימון משתמשים במקורות זמינים לציבור, כולל Common Crawl (מהווה עד 67% מהנתונים), C4, GitHub, Wikipedia, Books, ArXiv ו-Stack Exchange. עבור LLaMA 3 שימשו גם נתונים פרטיים באיכות גבוהה.
ביצועים והשוואה
- על benchmark-ים: מודל LLaMA 3.1 (405B) מציג תוצאות קרובות ל-GPT-4o: על מבחן MMLU הוא מגיע ל-88.6%, נמוך ב-0.1 נקודת אחוז בלבד מ-GPT-4o. על משימת יצירת קוד HumanEval מציג LLaMA 3.1 89% (GPT-4o — 90.2%).
- יעילות פרמטרית: מודלי LLaMA עם מספר פרמטרים קטן יותר עולים לעתים קרובות על מודלים גדולים יותר של מתחרים. לדוגמה, LLaMA 1 (13B) עלתה על GPT-3 (175B) ברוב המבחנים.
- עלות: באחסון מקומי, עלות ה-inference של LLaMA עשויה להיות נמוכה עד פי 50 בהשוואה לשימוש ב-API קנייניים, מה שהופך את הטכנולוגיה לנגישה לעסקים קטנים ובינוניים.
רישוי
- LLaMA 1 הופצה תחת רישיון מחקרי לא מסחרי עם גישה על-פי בקשה.
- LLaMA 2 וגרסאות מאוחרות יותר מופצות תחת רישיון Llama Community License, המאפשר שימוש מסחרי ושינויים. אולם הרישיון כולל מגבלות: חברות עם יותר מ-700 מיליון משתמשים פעילים בחודש נדרשות לקבל אישור מיוחד מ-Meta. דבר זה מעורר ויכוחים האם LLaMA היא מודל פתוח לחלוטין.
יישומים
מודלי LLaMA משולבים במוצרים של אלפי חברות ומשמשים בתחומים שונים:
- מגזר עסקי: Zoom משתמשת ב-LLaMA ב-AI Companion לסיכום פגישות; Shopify — לעיבוד 40–60 מיליון בקשות ביום להעשרת מטא-נתוני מוצרים; Instacart — בעוזר הפנימי Ava.
- מדע וחברה: Meditron (עיבוד LLaMA) משמש לאבחון רפואי באזורים עם משאבים מוגבלים.
- מגזר ממשלתי ותעשייתי: Meta כרתה שותפויות עם Lockheed Martin ו-Palantir. NASA משתמשת ב-LLaMA 3 בתחנת החלל הבינלאומית כעוזר offline לביצוע פעולות קריטיות ללא קישור לכדור הארץ.
מגבלות וביקורת
- הטיה ובטיחות: ביקורות עצמאיות מראות כי מודלי LLaMA, למרות אמצעי הבטיחות, עלולים לשחזר סטריאוטיפים מזיקים. הדלפת משקלי LLaMA 1 החריפה את השאלות בנוגע לשימוש זדוני אפשרי בטכנולוגיה.
- פערי ידע: בתחומים מתמחים מאוד LLaMA עשויה להפגין פערים. לדוגמה, הדיוק במבחן הרפואי nephSAP עמד על 17–30% לעומת 73% של GPT-4.
- צריכת אנרגיה: אימון מודלים גדולים דורש משאבים עצומים. אימון LLaMA 1 דרש 2,638 מגה-וואט·שעה, שווה ערך לפליטות של 1,015 טון CO₂.
עתיד
Meta מתכננת להשקיע עד 65 מיליארד דולר בתשתית AI עד 2025. בפיתוח נמצא מודל LLaMA 4 Behemoth עם 2 טריליון פרמטרים, שיתמוך ביותר מ-200 שפות ויקבל אינטגרציה עמוקה עם מוצרי המטאוורס.
ספרות
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
הערות
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
ראו גם
- GPT
- מודלי שפה גדולים
- transformer (ארכיטקטורת רשת נוירונים)