Mixtral (Mistral AI) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — היא מודל שפה גדול (LLM) בקוד פתוח, שפותח על ידי חברת Mistral AI הצרפתית ושוחרר בדצמבר 2023. המודל מבוסס על ארכיטקטורת תערובת מומחים דלילה (Sparse Mixture of Experts, SMoE), המאפשרת לו לשלב ביצועים הדומים למודלים גדולים הרבה יותר (כגון Llama 2 70B ו-GPT-3.5) עם מהירות ויעילות inference גבוהות[1].

המודל מופץ תחת רישיון חופשי Apache 2.0, מה שהופך אותו לנגיש לשימוש אקדמי ומסחרי. Mixtral 8x7B מפגין יכולות חזקות במשימות רב-לשוניות, יצירת קוד ומעקב אחר הוראות, מה שהפך אותו לאחד המודלים הפתוחים הפופולריים ביותר עם שחרורו[2].

היסטוריית הפיתוח

חברת Mistral AI נוסדה באפריל 2023 על ידי חוקרים לשעבר מ-Meta ו-Google. בספטמבר 2023 שחררה החברה את מודלה הראשון, Mistral 7B, שזכה להכרה בשל יעילותו הגבוהה בגודל קטן.

ב-11 בדצמבר 2023 הכריזה Mistral AI על שחרור Mixtral 8x7B, מודלה הראשון המבוסס על ארכיטקטורת תערובת מומחים. המודל משך מיד את תשומת לב הקהילה כה-LLM הפתוח החזק ביותר באותה עת, והפגין איכות ברמת GPT-3.5 עם מהירות inference גבוהה משמעותית. בינואר 2024 פורסם תיאור טכני מפורט של המודל כמאמר מדעי ב-arXiv, שאפשר לחוקרים עצמאיים להכיר את פרטי הארכיטקטורה ותוצאות הבדיקות[2].

ארכיטקטורה: Sparse Mixture of Experts - תערובת מומחים דלילה (SMoE)

החידוש העיקרי של Mixtral 8x7B הוא יישום ארכיטקטורת Sparse Mixture of Experts. בניגוד ל-transformer רגילים ("צפופים"), שבהם כל שכבה מבצעת את אותו חישוב עבור כל ה-token, ב-Mixtral כל שכבה מכילה מספר בלוקים מקבילים של "מומחים".

תכונות מפתח של הארכיטקטורה:

  • מבנה MoE: כל שכבת transformer מכילה 8 בלוקי feed-forward ("מומחים"). לעיבוד כל token, רשת router מיוחדת בוחרת את 2 המומחים המתאימים ביותר (Top-2 routing).
  • פרמטרים: המספר הכולל של פרמטרי המודל הוא 46.7 מיליארד, אך בזכות ההפעלה הדלילה, רק 12.9 מיליארד פרמטרים פעילים משמשים לעיבוד כל token. זה מבטיח מהירות inference הדומה למודלים עם ~13 מיליארד פרמטרים.
  • אופטימיזציית attention: המודל משתמש בטכניקות מודרניות לעיבוד יעיל של רצפים ארוכים, כולל Sliding Window Attention (SWA) ו-Grouped Query Attention (GQA).
  • אורך הקשר: המודל תומך בחלון הקשר באורך של עד 32,768 token.

אימון

משפחת Mixtral 8x7B כוללת שתי גרסאות עיקריות:

  1. Mixtral-8x7B-v0.1 (מודל בסיס): מודל שעבר אימון מקדים על קורפוס גדול של נתוני אינטרנט במספר שפות אירופיות (אנגלית, צרפתית, גרמנית, ספרדית, איטלקית). המשימה העיקרית היא חיזוי ה-token הבא.
  2. Mixtral-8x7B-Instruct-v0.1 (מודל הוראות): גרסה שעברה fine-tuning באמצעות supervised fine-tuning (SFT) ו-Direct Preference Optimization (DPO). מודל זה עוקב טוב יותר אחר הוראות המשתמש ומיועד לשימוש בפורמט שיחה.

ביצועים

Mixtral 8x7B עולה על מודל Llama 2 70B או שווה לו באיכות ברוב ה-benchmark הסטנדרטיים, כאשר יש לו פי 5 פחות פרמטרים פעילים וכתוצאה מכך מהירות inference גבוהה משמעותית (עד פי 6 מהיר יותר)[2].

השוואת ביצועים של Mixtral 8x7B עם Llama 2 70B ו-GPT-3.5[2]
מדד Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (ידע כללי) 69.9% 70.0% 70.6%
GSM-8K (מתמטיקה) 53.6% 57.1% 58.4%
MBPP (יצירת קוד) 49.8% 52.2% 60.7%
MT-Bench (הערכת שיחה, גרסאות Instruct) 6.86 8.32 8.30
  • רב-לשוניות: בזכות חלקם המוגבר של נתונים רב-לשוניים בקורפוס האימון, Mixtral עולה משמעותית על Llama 2 70B במשימות בצרפתית, גרמנית, ספרדית ואיטלקית.
  • הטיה והזיות: בהשוואה ל-Llama 2 70B, המודל מפגין דיוק גבוה יותר ב-benchmark BBQ (הערכת דעות קדומות חברתיות) ופרופיל סנטימנט חיובי יותר ב-benchmark BOLD.

רישוי וזמינות

שתי גרסאות Mixtral 8x7B (הבסיסית וה-Instruct) שוחררו תחת רישיון Apache 2.0, המתיר שימוש אקדמי ומסחרי חופשי. קודי המקור ומשקלי המודלים זמינים ב-GitHub וב-Hugging Face.

קישורים חיצוניים

  • Mixtral of Experts — הכרזה רשמית בבלוג של Mistral AI
  • מודל Mixtral 8x7B ב-Hugging Face

ספרות

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

הערות

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]