---
title: "Mixtral (Mistral AI) — مكسترال"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_—_مكسترال"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4444
wiki_created_at: 2026-09-06T23:35:15Z
wiki_modified_at: 2026-09-06T23:35:15Z
downloaded_at: 2026-09-07T23:02:41Z
---

# Mixtral (Mistral AI) — مكسترال

**Mixtral 8x7B** هو نموذج لغة كبير (LLM) مفتوح المصدر، طورته الشركة الفرنسية Mistral AI وأُصدر في ديسمبر 2023. يعتمد النموذج على معمارية **مزيج الخبراء المتناثر (Sparse Mixture of Experts, SMoE)**، مما يسمح له بالجمع بين الأداء المماثل لنماذج أكبر بكثير (مثل Llama 2 70B و GPT-3.5) وسرعة وكفاءة عالية في الاستدلال<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_note-mistral_blog-1)</sup>.

يُوزَّع النموذج بموجب ترخيص Apache 2.0 الحر، مما يجعله متاحًا للاستخدام الأكاديمي والتجاري. يُظهر Mixtral 8x7B قدرات قوية في المهام متعددة اللغات، وتوليد الشيفرات البرمجية، واتباع التعليمات، مما جعله أحد أشهر النماذج المفتوحة عند إصداره<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_note-arxiv_paper-2)</sup>.

## تاريخ التطوير

تأسست شركة Mistral AI في أبريل 2023 على يد باحثين سابقين من Meta و Google. في سبتمبر 2023، أصدرت الشركة نموذجها الأول، **Mistral 7B**، الذي حاز على تقدير لكفاءته العالية رغم حجمه الصغير.

في **11 ديسمبر 2023**، أعلنت Mistral AI عن إطلاق **Mixtral 8x7B**، وهو أول نموذج لها يعتمد على معمارية مزيج الخبراء. جذب النموذج انتباه المجتمع فورًا باعتباره أقوى LLM مفتوح المصدر في ذلك الوقت، حيث أظهر جودة تضاهي مستوى GPT-3.5 مع سرعة استدلال أعلى بكثير. في يناير 2024، نُشر وصف تقني مفصل للنموذج في شكل ورقة علمية على arXiv، مما أتاح للباحثين المستقلين الاطلاع على تفاصيل المعمارية ونتائج الاختبارات<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_note-arxiv_paper-2)</sup>.

## المعمارية: مزيج الخبراء المتناثر (SMoE)

الابتكار الرئيسي في Mixtral 8x7B هو تطبيق معمارية **Sparse Mixture of Experts**. على عكس نماذج الترانسفورمر القياسية ("الكثيفة")، حيث تؤدي كل طبقة نفس العملية الحسابية لجميع التوكنات، في Mixtral، تحتوي كل طبقة على عدة كتل متوازية تُعرف بـ "الخبراء".

الميزات الرئيسية للمعمارية:

- **بنية MoE**: تحتوي كل طبقة ترانسفورمر على **8** كتل تغذية أمامية ("خبراء"). لمعالجة كل توكن، تختار *شبكة توجيه* (router network) خاصة الخبيرين (**2**) الأكثر ملاءمة (*Top-2 routing*).
- **المَعلمات**: يبلغ العدد الإجمالي لمعلمات النموذج **46.7 مليار**، ولكن بفضل التنشيط المتناثر، يُستخدم فقط **12.9 مليار** معلمة نشطة لكل توكن أثناء عملية الاستدلال. وهذا يضمن سرعة استدلال تضاهي سرعة النماذج التي تحتوي على حوالي 13 مليار معلمة.
- **تحسين الانتباه**: يستخدم النموذج تقنيات حديثة لمعالجة التسلسلات الطويلة بكفاءة، بما في ذلك **Sliding Window Attention (SWA)** و **Grouped Query Attention (GQA)**.
- **طول السياق**: يدعم النموذج نافذة سياق تصل إلى **32768** توكنًا.

## التدريب

تتضمن عائلة Mixtral 8x7B إصدارين رئيسيين:

1.  **Mixtral-8x7B-v0.1** (النموذج الأساسي): نموذج مُدرَّب مسبقًا على مجموعة كبيرة من بيانات الويب بعدة لغات أوروبية (الإنجليزية، الفرنسية، الألمانية، الإسبانية، الإيطالية). مهمته الأساسية هي توقع التوكن التالي.
2.  **Mixtral-8x7B-Instruct-v0.1** (نموذج التعليمات): إصدار تم ضبطه بدقة باستخدام تقنيات *الضبط الدقيق المُوجَّه (supervised fine-tuning, SFT)* و*تحسين التفضيل المباشر (Direct Preference Optimization, DPO)*. يتبع هذا النموذج تعليمات المستخدم بشكل أفضل وهو مصمم للاستخدام في الصيغة الحوارية.

## الأداء

يتفوق Mixtral 8x7B على نموذج Llama 2 70B أو يضاهيه في الجودة على معظم المقاييس المرجعية (benchmarks) القياسية، بينما يمتلك معلمات نشطة أقل بـ 5 مرات، وبالتالي سرعة استدلال أعلى بكثير (أسرع بما يصل إلى 6 مرات)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_note-arxiv_paper-2)</sup>.

| المقياس                                       | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|-----------------------------------------------|-------------|---------|--------------|
| **MMLU** (المعرفة العامة)                     | 69.9%       | 70.0%   | **70.6%**    |
| **GSM-8K** (الرياضيات)                        | 53.6%       | 57.1%   | **58.4%**    |
| **MBPP** (توليد الشيفرات البرمجية)            | 49.8%       | 52.2%   | **60.7%**    |
| **MT-Bench** (تقييم الحوار، إصدارات Instruct) | 6.86        | 8.32    | **8.30**     |

مقارنة أداء Mixtral 8x7B مع Llama 2 70B و GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_note-arxiv_paper-2)</sup>

- **تعدد اللغات**: بفضل زيادة نسبة البيانات متعددة اللغات في مجموعة بيانات التدريب، يتفوق Mixtral بشكل كبير على Llama 2 70B في المهام باللغات الفرنسية والألمانية والإسبانية والإيطالية.
- **التحيز والهلوسات**: مقارنةً بـ Llama 2 70B، يُظهر النموذج دقة أعلى على مقياس BBQ (لتقييم التحيزات الاجتماعية) وملفًا عاطفيًا أكثر إيجابية على مقياس BOLD.

## الترخيص والتوافر

تم إصدار كلا الإصدارين من Mixtral 8x7B (الأساسي و Instruct) بموجب ترخيص Apache 2.0، الذي يسمح بالاستخدام الأكاديمي والتجاري الحر. الشيفرة المصدرية وأوزان النماذج متاحة على GitHub و Hugging Face.

## روابط خارجية

- <a href="https://mistral.ai/news/mixtral-of-experts/" class="external text" rel="nofollow">Mixtral of Experts</a> — الإعلان الرسمي في مدونة Mistral AI
- <a href="https://huggingface.co/mistralai/Mixtral-8x7B-v0.1" class="external text" rel="nofollow">نموذج Mixtral 8x7B على Hugging Face</a>

## مراجع

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external text" rel="nofollow">arXiv:2401.04088</a>.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. <a href="https://arxiv.org/abs/1701.06538" class="external text" rel="nofollow">arXiv:1701.06538</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external text" rel="nofollow">arXiv:2004.05150</a>.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. <a href="https://arxiv.org/abs/2404.02852" class="external text" rel="nofollow">arXiv:2404.02852</a>.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. <a href="https://openreview.net/forum?id=stXtBqyTWX" class="external text" rel="nofollow">OpenReview: stXtBqyTWX</a>.

## ملاحظات

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_%E2%80%94_%D9%85%D9%83%D8%B3%D8%AA%D8%B1%D8%A7%D9%84#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[٢]</a></span>
