Mistral AI (HE)
Mistral AI — חברה צרפתית בתחום הבינה המלאכותית, המתמחה בפיתוח מודלים שפתיים גדולים (LLM). החברה נוסדה באפריל 2023 והפכה במהירות לאחד השחקנים המרכזיים בשוק האירופי והעולמי, תוך מיצוב עצמה כחלופה למודלים קנייניים של ענקיות הטכנולוגיה האמריקאיות.
מאפיין מרכזי בגישת Mistral AI הוא ההתמקדות בפיתוח מודלים בעלי ביצועים גבוהים עם משקלים פתוחים (בעיקר תחת רישיון Apache 2.0), דבר המקדם דמוקרטיזציה של הגישה לטכנולוגיות AI מתקדמות. החברה ידועה בחידושים ארכיטקטוניים כגון Grouped-Query Attention (GQA), Sliding Window Attention (SWA) ו-Sparse Mixture-of-Experts (MoE), המאפשרים למודליה להשיג יעילות גבוהה בגודל יחסית קטן ובעלות חישובית מופחתת.
היסטוריה
חברת Mistral AI נוסדה בפריז באפריל 2023 על ידי שלושה חוקרים צרפתים: ארתור מנש (Arthur Mensch), גיום למפל (Guillaume Lample) ו-טימותה לקרואה (Timothée Lacroix). שלושת המייסדים עסקו קודם לכן במודלים שפתיים גדולים בחברות מובילות בעולם: מנש היה חוקר ב-Google DeepMind, ואילו למפל ולקרואה עסקו ב-LLM ב-Meta AI.
משימת החברה היא להנגיש את הישגי ה-AI המתקדמים לכולם, תוך קידום פתיחות, שיתוף פעולה ושקיפות. גישה זו אפשרה ל-Mistral AI למשוך השקעות משמעותיות במהירות:
- יוני 2023: €105 מיליון בסבב seed, שהפך לשיא אירופאי.
- דצמבר 2023: €385 מיליון בסבב Series A, לאחריו עלה שווי החברה לכדי $2 מיליארד וקיבלה מעמד של "חד-קרן".
- פברואר 2024: הוכרז על שותפות אסטרטגית עם Microsoft, הכוללת השקעה של $16 מיליון ואירוח מודלי Mistral בענן Azure.
- יוני 2024: סבב מימון חדש של €600 מיליון, שהביא את שווי החברה לכ-€5.8 מיליארד, ועשה אותה לאחד הסטארט-אפים ה-AI היקרים בעולם.
מאפיינים טכניים של הארכיטקטורה
מודלי Mistral AI מבוססים על ארכיטקטורת transformer, אך כוללים מספר חידושים מרכזיים שנועדו להגביר יעילות ולהפחית עלויות חישוב.
Transformer עם שיפורים (Mistral 7B)
המודל הראשון של החברה, Mistral 7B, הציג שני שיפורים ארכיטקטוניים חשובים:
- Sliding Window Attention (SWA) (תשומת לב עם חלון הזזה): במקום שכל token יתקשר עם כל ה-token-ים הקודמים (בעל מורכבות ריבועית), SWA מגביל את תשומת הלב לחלון קבוע (למשל, 4096 token-ים). הדבר מאפשר עיבוד רצפים ארוכים מאוד (עד 32,000 token-ים ומעלה) במורכבות חישובית לינארית, ומאיץ את העיבוד משמעותית.
- Grouped-Query Attention (GQA) (תשומת לב מקובצת לפי שאילתות): אופטימיזציה של מנגנון ה-multi-head attention הסטנדרטי. GQA משתמש במספר קטן יותר של "ראשים" עבור מפתחות (keys) וערכים (values) בהשוואה לשאילתות (queries) (למשל, ביחס 8:1), מה שמפחית משמעותית את דרישות הזיכרון ומאיץ את תהליך היצירה (inference) ללא אובדן איכות משמעותי.
Sparse Mixture-of-Experts (MoE)
במודלי סדרת Mixtral (למשל, Mixtral 8x7B, Mixtral 8x22B) נעשה שימוש בארכיטקטורת Sparse Mixture-of-Experts (תערובת מדולגת של מומחים). במקום שכבת רשת נוירונים צפופה אחת, נעשה שימוש במספר רשתות-משנה "מומחה" מקבילות. עבור כל token קלט, שכבת gating ייעודית (ראוטר) בוחרת באופן דינמי קבוצה קטנה של מומחים להפעלה (בדרך כלל 2 מתוך 8).
דבר זה מאפשר יצירת מודלים עם מספר כולל עצום של פרמטרים (ל-Mixtral 8x22B יש 141 מיליארד), אך בעת עיבוד כל token מופעל רק חלק קטן מהם (~39 מיליארד). כתוצאה מכך, המודל מגיע לאיכות הדומה למודלים "צפופים" גדולים בהרבה, אך במהירות ועלות inference של מודלים קטנים בהרבה.
ארכיטקטורת Mamba (SSM)
בשנת 2024 הציגה Mistral AI את המודל הניסיוני Codestral Mamba, המבוסס על ארכיטקטורת Mamba (Selective State-Space Model). בניגוד ל-transformer-ים, Mamba משתמש במנגנון רקורנטי המבוסס על מודלים של מרחב מצבים. יתרונות מרכזיים:
- מורכבות לינארית לפי אורך הרצף, מה שהופך אותו למהיר ביותר על הקשרים ארוכים.
- הקשר "אינסופי" תיאורטית, המוגבל רק על ידי הזיכרון הזמין.
- מהירות inference גבוהה בהשוואה ל-transformer-ים שקולים.
ציר זמן ומודלים
| חודש / שנה | מודל | פרמטרים (מיליארד) | מאפיינים מרכזיים | רישיון |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7.3 | ארכיטקטורת GQA + SWA; הקשר 32k; עולה על Llama 2 13B בכל ה-benchmark-ים. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46.7 (12.9 פעילים) | מודל MoE פתוח ראשון; איכות ברמת GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | מודלים "קטן" ודגל, זמינים דרך API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 פעילים) | הקשר 64k; איכות SOTA בקרב מודלי open-source בעת השקתו. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | מודל ייעודי ליצירת קוד (80+ שפות). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | מודלים ייעודיים למתמטיקה ולרב-לשוניות. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7.3 | מודל ניסיוני לקוד על ארכיטקטורת Mamba; הקשר 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | המודל המולטי-מודאלי הפתוח הראשון (טקסט + תמונות). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (הערכה) | מודל דגל מעודכן עם reasoning משופר. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | אופטימיזציה לזמן תגובה נמוך (עד 150 token-ים/שנייה); איכות ברמת מודלי 70B. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | מודל מולטי-מודאלי חזיתי (טקסט, תמונות) עם הקשר 128k. | קנייני |
| 05 / 2025 | Devstral 24B | 24 | מודל "סוכני" לפיתוח תוכנה אוטונומי; 46.8% על SWE-Bench. | Apache 2.0 |
השוואה עם מתחרים
- לעומת Llama (Meta): מודלי Mistral עולים באופן עקבי על מודלי Llama בגודל דומה ואף גדול יותר. Mistral 7B עלה על Llama 2 13B, ו-Mixtral 8x7B — על Llama 2 70B. ההבדל המרכזי הוא הרישיון: Mistral משתמשת ברישיון Apache 2.0 המתירני לחלוטין, בעוד שרישיון Llama כולל מגבלות.
- לעומת GPT (OpenAI): מודלי הדגל של OpenAI (GPT-4) נותרים מובילים במשימות המורכבות ביותר, אך המודלים הפתוחים של Mistral (למשל, Mixtral 8x7B) מפגינים איכות הדומה ל-GPT-3.5. Mistral מספקת חלופה פתוחה המאפשרת פריסת מודלים מקומית ושליטה מלאה בהם.
- לעומת Claude (Anthropic): מודלי Claude ידועים בחלון הקשר גדול וכן בדגש על בטיחות. Mistral הציעה מודלים פתוחים עם הקשר דומה או גדול יותר. מבחינת ביצועים ב-benchmark-ים סטנדרטיים (LMSys Arena), מודל Medium 3 עלה על Claude 3 Opus.
יישומים ואקוסיסטם
מוצרים
- Le Chat: עוזר צ'אט ציבורי (אינטרנט, iOS/Android), המדגים את יכולות מודלי Mistral, כולל חיפוש באינטרנט ויצירת תמונות.
- La Plateforme: פלטפורמה ארגונית עם גישת API לכל מודלי Mistral, המאפשרת לחברות לשלב LLM במוצריהן.
לקוחות ארגוניים
טכנולוגיות Mistral משמשות חברות גדולות כגון BNP Paribas (פיננסים), CMA CGM (לוגיסטיקה), Zalando (מסחר אלקטרוני) וסוכנות הממשלה France Travail. עבור לקוחות אירופאיים, חשובה במיוחד האפשרות לפריסה מקומית של המודלים לצורך עמידה ב-GDPR.
קהילת Open-Source
בזכות הרישיון הפתוח, מודלי Mistral הפכו לבסיס לאלפי פרויקטים בפלטפורמות כמו Hugging Face. הקהילה מבצעת fine-tuning פעיל של המודלים לצורך משימות מיוחדות, ויוצרת גרסאות לביולוגיה (BioMistral), משפטים (SaulLM-7B) ולוקליזציה לשפות שונות (למשל, Polish Bielik 7B).
רישוי
| סדרת מודלים | רישיון | מגבלות |
|---|---|---|
| בסיסיים, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | שימוש מסחרי חופשי. |
| Codestral 22B | Non-Production License | שימוש מסחרי אסור ללא הסכם נפרד. |
| סדרת Large, סדרת Medium | Mistral Research / קנייני | גישה דרך API בענן בלבד. |
קישורים
- תיעוד רשמי של Mistral AI
- פרופיל Mistral AI ב-Hugging Face
ספרות
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.