---
title: "Mixtral (Mistral AI) (HE)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4427
wiki_created_at: 2026-09-06T23:35:00Z
wiki_modified_at: 2026-09-06T23:35:00Z
downloaded_at: 2026-09-07T23:02:36Z
---

# Mixtral (Mistral AI) (HE)

**Mixtral 8x7B** — היא מודל שפה גדול (LLM) בקוד פתוח, שפותח על ידי חברת Mistral AI הצרפתית ושוחרר בדצמבר 2023. המודל מבוסס על ארכיטקטורת **תערובת מומחים דלילה (Sparse Mixture of Experts, SMoE)**, המאפשרת לו לשלב ביצועים הדומים למודלים גדולים הרבה יותר (כגון Llama 2 70B ו-GPT-3.5) עם מהירות ויעילות inference גבוהות<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_note-mistral_blog-1)</sup>.

המודל מופץ תחת רישיון חופשי Apache 2.0, מה שהופך אותו לנגיש לשימוש אקדמי ומסחרי. Mixtral 8x7B מפגין יכולות חזקות במשימות רב-לשוניות, יצירת קוד ומעקב אחר הוראות, מה שהפך אותו לאחד המודלים הפתוחים הפופולריים ביותר עם שחרורו<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_note-arxiv_paper-2)</sup>.

## היסטוריית הפיתוח

חברת Mistral AI נוסדה באפריל 2023 על ידי חוקרים לשעבר מ-Meta ו-Google. בספטמבר 2023 שחררה החברה את מודלה הראשון, **Mistral 7B**, שזכה להכרה בשל יעילותו הגבוהה בגודל קטן.

**ב-11 בדצמבר 2023** הכריזה Mistral AI על שחרור **Mixtral 8x7B**, מודלה הראשון המבוסס על ארכיטקטורת תערובת מומחים. המודל משך מיד את תשומת לב הקהילה כה-LLM הפתוח החזק ביותר באותה עת, והפגין איכות ברמת GPT-3.5 עם מהירות inference גבוהה משמעותית. בינואר 2024 פורסם תיאור טכני מפורט של המודל כמאמר מדעי ב-arXiv, שאפשר לחוקרים עצמאיים להכיר את פרטי הארכיטקטורה ותוצאות הבדיקות<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_note-arxiv_paper-2)</sup>.

## ארכיטקטורה: Sparse Mixture of Experts - תערובת מומחים דלילה (SMoE)

החידוש העיקרי של Mixtral 8x7B הוא יישום ארכיטקטורת **Sparse Mixture of Experts**. בניגוד ל-transformer רגילים ("צפופים"), שבהם כל שכבה מבצעת את אותו חישוב עבור כל ה-token, ב-Mixtral כל שכבה מכילה מספר בלוקים מקבילים של "מומחים".

תכונות מפתח של הארכיטקטורה:

- **מבנה MoE**: כל שכבת transformer מכילה **8** בלוקי feed-forward ("מומחים"). לעיבוד כל token, *רשת router* מיוחדת בוחרת את **2** המומחים המתאימים ביותר (*Top-2 routing*).
- **פרמטרים**: המספר הכולל של פרמטרי המודל הוא **46.7 מיליארד**, אך בזכות ההפעלה הדלילה, רק **12.9 מיליארד** פרמטרים פעילים משמשים לעיבוד כל token. זה מבטיח מהירות inference הדומה למודלים עם ~13 מיליארד פרמטרים.
- **אופטימיזציית attention**: המודל משתמש בטכניקות מודרניות לעיבוד יעיל של רצפים ארוכים, כולל **Sliding Window Attention (SWA)** ו-**Grouped Query Attention (GQA)**.
- **אורך הקשר**: המודל תומך בחלון הקשר באורך של עד **32,768 token**.

## אימון

משפחת Mixtral 8x7B כוללת שתי גרסאות עיקריות:

1.  **Mixtral-8x7B-v0.1** (מודל בסיס): מודל שעבר אימון מקדים על קורפוס גדול של נתוני אינטרנט במספר שפות אירופיות (אנגלית, צרפתית, גרמנית, ספרדית, איטלקית). המשימה העיקרית היא חיזוי ה-token הבא.
2.  **Mixtral-8x7B-Instruct-v0.1** (מודל הוראות): גרסה שעברה fine-tuning באמצעות *supervised fine-tuning (SFT)* ו-*Direct Preference Optimization (DPO)*. מודל זה עוקב טוב יותר אחר הוראות המשתמש ומיועד לשימוש בפורמט שיחה.

## ביצועים

Mixtral 8x7B עולה על מודל Llama 2 70B או שווה לו באיכות ברוב ה-benchmark הסטנדרטיים, כאשר יש לו פי 5 פחות פרמטרים פעילים וכתוצאה מכך מהירות inference גבוהה משמעותית (עד פי 6 מהיר יותר)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_note-arxiv_paper-2)</sup>.

| מדד                                        | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|--------------------------------------------|-------------|---------|--------------|
| **MMLU** (ידע כללי)                        | 69.9%       | 70.0%   | **70.6%**    |
| **GSM-8K** (מתמטיקה)                       | 53.6%       | 57.1%   | **58.4%**    |
| **MBPP** (יצירת קוד)                       | 49.8%       | 52.2%   | **60.7%**    |
| **MT-Bench** (הערכת שיחה, גרסאות Instruct) | 6.86        | 8.32    | **8.30**     |

השוואת ביצועים של Mixtral 8x7B עם Llama 2 70B ו-GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_note-arxiv_paper-2)</sup>

- **רב-לשוניות**: בזכות חלקם המוגבר של נתונים רב-לשוניים בקורפוס האימון, Mixtral עולה משמעותית על Llama 2 70B במשימות בצרפתית, גרמנית, ספרדית ואיטלקית.
- **הטיה והזיות**: בהשוואה ל-Llama 2 70B, המודל מפגין דיוק גבוה יותר ב-benchmark BBQ (הערכת דעות קדומות חברתיות) ופרופיל סנטימנט חיובי יותר ב-benchmark BOLD.

## רישוי וזמינות

שתי גרסאות Mixtral 8x7B (הבסיסית וה-Instruct) שוחררו תחת רישיון Apache 2.0, המתיר שימוש אקדמי ומסחרי חופשי. קודי המקור ומשקלי המודלים זמינים ב-GitHub וב-Hugging Face.

## קישורים חיצוניים

- Mixtral of Experts — הכרזה רשמית בבלוג של Mistral AI
- מודל Mixtral 8x7B ב-Hugging Face

## ספרות

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## הערות

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HE)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
