Mixtral (Mistral AI) — مكسترال
Mixtral 8x7B هو نموذج لغة كبير (LLM) مفتوح المصدر، طورته الشركة الفرنسية Mistral AI وأُصدر في ديسمبر 2023. يعتمد النموذج على معمارية مزيج الخبراء المتناثر (Sparse Mixture of Experts, SMoE)، مما يسمح له بالجمع بين الأداء المماثل لنماذج أكبر بكثير (مثل Llama 2 70B و GPT-3.5) وسرعة وكفاءة عالية في الاستدلال[1].
يُوزَّع النموذج بموجب ترخيص Apache 2.0 الحر، مما يجعله متاحًا للاستخدام الأكاديمي والتجاري. يُظهر Mixtral 8x7B قدرات قوية في المهام متعددة اللغات، وتوليد الشيفرات البرمجية، واتباع التعليمات، مما جعله أحد أشهر النماذج المفتوحة عند إصداره[2].
تاريخ التطوير
تأسست شركة Mistral AI في أبريل 2023 على يد باحثين سابقين من Meta و Google. في سبتمبر 2023، أصدرت الشركة نموذجها الأول، Mistral 7B، الذي حاز على تقدير لكفاءته العالية رغم حجمه الصغير.
في 11 ديسمبر 2023، أعلنت Mistral AI عن إطلاق Mixtral 8x7B، وهو أول نموذج لها يعتمد على معمارية مزيج الخبراء. جذب النموذج انتباه المجتمع فورًا باعتباره أقوى LLM مفتوح المصدر في ذلك الوقت، حيث أظهر جودة تضاهي مستوى GPT-3.5 مع سرعة استدلال أعلى بكثير. في يناير 2024، نُشر وصف تقني مفصل للنموذج في شكل ورقة علمية على arXiv، مما أتاح للباحثين المستقلين الاطلاع على تفاصيل المعمارية ونتائج الاختبارات[2].
المعمارية: مزيج الخبراء المتناثر (SMoE)
الابتكار الرئيسي في Mixtral 8x7B هو تطبيق معمارية Sparse Mixture of Experts. على عكس نماذج الترانسفورمر القياسية ("الكثيفة")، حيث تؤدي كل طبقة نفس العملية الحسابية لجميع التوكنات، في Mixtral، تحتوي كل طبقة على عدة كتل متوازية تُعرف بـ "الخبراء".
الميزات الرئيسية للمعمارية:
- بنية MoE: تحتوي كل طبقة ترانسفورمر على 8 كتل تغذية أمامية ("خبراء"). لمعالجة كل توكن، تختار شبكة توجيه (router network) خاصة الخبيرين (2) الأكثر ملاءمة (Top-2 routing).
- المَعلمات: يبلغ العدد الإجمالي لمعلمات النموذج 46.7 مليار، ولكن بفضل التنشيط المتناثر، يُستخدم فقط 12.9 مليار معلمة نشطة لكل توكن أثناء عملية الاستدلال. وهذا يضمن سرعة استدلال تضاهي سرعة النماذج التي تحتوي على حوالي 13 مليار معلمة.
- تحسين الانتباه: يستخدم النموذج تقنيات حديثة لمعالجة التسلسلات الطويلة بكفاءة، بما في ذلك Sliding Window Attention (SWA) و Grouped Query Attention (GQA).
- طول السياق: يدعم النموذج نافذة سياق تصل إلى 32768 توكنًا.
التدريب
تتضمن عائلة Mixtral 8x7B إصدارين رئيسيين:
- Mixtral-8x7B-v0.1 (النموذج الأساسي): نموذج مُدرَّب مسبقًا على مجموعة كبيرة من بيانات الويب بعدة لغات أوروبية (الإنجليزية، الفرنسية، الألمانية، الإسبانية، الإيطالية). مهمته الأساسية هي توقع التوكن التالي.
- Mixtral-8x7B-Instruct-v0.1 (نموذج التعليمات): إصدار تم ضبطه بدقة باستخدام تقنيات الضبط الدقيق المُوجَّه (supervised fine-tuning, SFT) وتحسين التفضيل المباشر (Direct Preference Optimization, DPO). يتبع هذا النموذج تعليمات المستخدم بشكل أفضل وهو مصمم للاستخدام في الصيغة الحوارية.
الأداء
يتفوق Mixtral 8x7B على نموذج Llama 2 70B أو يضاهيه في الجودة على معظم المقاييس المرجعية (benchmarks) القياسية، بينما يمتلك معلمات نشطة أقل بـ 5 مرات، وبالتالي سرعة استدلال أعلى بكثير (أسرع بما يصل إلى 6 مرات)[2].
| المقياس | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (المعرفة العامة) | 69.9% | 70.0% | 70.6% |
| GSM-8K (الرياضيات) | 53.6% | 57.1% | 58.4% |
| MBPP (توليد الشيفرات البرمجية) | 49.8% | 52.2% | 60.7% |
| MT-Bench (تقييم الحوار، إصدارات Instruct) | 6.86 | 8.32 | 8.30 |
- تعدد اللغات: بفضل زيادة نسبة البيانات متعددة اللغات في مجموعة بيانات التدريب، يتفوق Mixtral بشكل كبير على Llama 2 70B في المهام باللغات الفرنسية والألمانية والإسبانية والإيطالية.
- التحيز والهلوسات: مقارنةً بـ Llama 2 70B، يُظهر النموذج دقة أعلى على مقياس BBQ (لتقييم التحيزات الاجتماعية) وملفًا عاطفيًا أكثر إيجابية على مقياس BOLD.
الترخيص والتوافر
تم إصدار كلا الإصدارين من Mixtral 8x7B (الأساسي و Instruct) بموجب ترخيص Apache 2.0، الذي يسمح بالاستخدام الأكاديمي والتجاري الحر. الشيفرة المصدرية وأوزان النماذج متاحة على GitHub و Hugging Face.
روابط خارجية
- Mixtral of Experts — الإعلان الرسمي في مدونة Mistral AI
- نموذج Mixtral 8x7B على Hugging Face
مراجع
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.