Mixtral (Mistral AI) (UR)
Mixtral 8x7B — یہ ایک بڑا لسانی ماڈل (LLM) ہے جس کا سورس کوڈ کھلا ہوا ہے، جسے فرانسیسی کمپنی Mistral AI نے تیار کیا اور دسمبر 2023 میں جاری کیا۔ یہ ماڈل Sparse Mixture of Experts (SMoE) آرکیٹیکچر پر مبنی ہے، جو اسے بہت بڑے ماڈلز (مثلاً Llama 2 70B اور GPT-3.5) کے مقابل کارکردگی کے ساتھ ساتھ inference کی اعلیٰ رفتار اور کارآمدی فراہم کرتا ہے[1]۔
یہ ماڈل آزاد لائسنس Apache 2.0 کے تحت تقسیم کیا جاتا ہے، جو اسے علمی اور تجارتی استعمال کے لیے دستیاب بناتا ہے۔ Mixtral 8x7B کثیر لسانی کاموں، کوڈ کی تخلیق اور ہدایات پر عمل کرنے میں نمایاں صلاحیتیں ظاہر کرتا ہے، جس نے اسے اپنے اجراء کے وقت کھلے ماڈلز میں سب سے مقبول بنا دیا[2]۔
تاریخِ ترقی
Mistral AI کمپنی اپریل 2023 میں Meta اور Google کے سابق محققین نے قائم کی۔ ستمبر 2023 میں کمپنی نے اپنا پہلا ماڈل، Mistral 7B، جاری کیا جسے چھوٹے حجم کے باوجود اعلیٰ کارکردگی کی وجہ سے سراہا گیا۔
11 دسمبر 2023 کو Mistral AI نے Mixtral 8x7B کا اعلان کیا، جو Mixture of Experts آرکیٹیکچر پر مبنی کمپنی کا پہلا ماڈل تھا۔ اس ماڈل نے فوری طور پر سماج کی توجہ حاصل کی کیونکہ یہ اس وقت کا سب سے طاقتور کھلا LLM تھا، جس نے inference کی نمایاں طور پر زیادہ رفتار کے ساتھ GPT-3.5 کے برابر معیار ظاہر کیا۔ جنوری 2024 میں arXiv پر ایک سائنسی مقالے کی صورت میں ماڈل کی تفصیلی تکنیکی وضاحت شائع کی گئی، جس سے آزاد محققین آرکیٹیکچر کی تفصیلات اور ٹیسٹ کے نتائج سے آگاہ ہو سکے[2]۔
آرکیٹیکچر: Sparse Mixture of Experts (SMoE)
Mixtral 8x7B کی سب سے بڑی جدت Sparse Mixture of Experts آرکیٹیکچر کا نفاذ ہے۔ معیاری («گھنے») transformers کے برعکس، جہاں ہر پرت تمام tokens کے لیے ایک ہی حساب کتاب انجام دیتی ہے، Mixtral میں ہر پرت میں متعدد متوازی «ماہر» بلاکس ہوتے ہیں۔
آرکیٹیکچر کی اہم خصوصیات:
- MoE ڈھانچہ: ہر transformer پرت میں 8 feed-forward بلاکس («ماہرین») ہوتے ہیں۔ ہر token کی پروسیسنگ کے لیے ایک خاص router network 2 سب سے موزوں ماہرین کا انتخاب کرتی ہے (Top-2 routing)۔
- پیرامیٹرز: ماڈل کے کل پیرامیٹرز کی تعداد 46.7 ارب ہے، تاہم sparse activation کی بدولت ہر token کے لیے inference کے دوران صرف 12.9 ارب فعال پیرامیٹرز استعمال ہوتے ہیں۔ اس سے ~13 ارب پیرامیٹرز والے ماڈلز کے مقابل inference کی رفتار حاصل ہوتی ہے۔
- Attention کی اصلاح: یہ ماڈل لمبی ترتیبوں کی مؤثر پروسیسنگ کے لیے جدید تکنیکیں استعمال کرتا ہے، بشمول Sliding Window Attention (SWA) اور Grouped Query Attention (GQA)۔
- Context کی لمبائی: یہ ماڈل 32,768 tokens تک کی context window سپورٹ کرتا ہے۔
تربیت
Mixtral 8x7B کے خاندان میں دو بنیادی ورژن شامل ہیں: 1. Mixtral-8x7B-v0.1 (بنیادی ماڈل): ایک pre-trained ماڈل جسے کئی یورپی زبانوں (انگریزی، فرانسیسی، جرمن، ہسپانوی، اطالوی) میں ویب ڈیٹا کے بڑے مجموعے پر تربیت دی گئی ہے۔ بنیادی کام اگلے token کی پیشین گوئی ہے۔ 2. Mixtral-8x7B-Instruct-v0.1 (ہدایاتی ماڈل): ایک ورژن جسے supervised fine-tuning (SFT) اور Direct Preference Optimization (DPO) کے ذریعے مزید fine-tune کیا گیا ہے۔ یہ ماڈل صارف کی ہدایات بہتر طریقے سے پیروی کرتا ہے اور مکالماتی انداز میں استعمال کے لیے موزوں ہے۔
کارکردگی
Mixtral 8x7B زیادہ تر معیاری benchmarks پر Llama 2 70B سے بہتر یا اس کے برابر معیار رکھتا ہے، جبکہ اس کے فعال پیرامیٹرز 5 گنا کم ہیں اور نتیجتاً inference کی رفتار نمایاں طور پر زیادہ (6 گنا تک تیز) ہے[2]۔
| معیار | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (عمومی علم) | 69.9% | 70.0% | 70.6% |
| GSM-8K (ریاضی) | 53.6% | 57.1% | 58.4% |
| MBPP (کوڈ کی تخلیق) | 49.8% | 52.2% | 60.7% |
| MT-Bench (مکالمے کا جائزہ، Instruct ورژن) | 6.86 | 8.32 | 8.30 |
- کثیر لسانیت: تربیتی مجموعے میں کثیر لسانی ڈیٹا کے بڑھے ہوئے حصے کی بدولت، Mixtral فرانسیسی، جرمن، ہسپانوی اور اطالوی زبانوں کے کاموں میں Llama 2 70B سے نمایاں طور پر بہتر ہے۔
- تعصب اور hallucinations: Llama 2 70B کے مقابلے میں یہ ماڈل BBQ benchmark (سماجی تعصبات کا جائزہ) پر زیادہ درستگی اور BOLD benchmark پر زیادہ مثبت جذباتی رجحان ظاہر کرتا ہے۔
لائسنسنگ اور دستیابی
Mixtral 8x7B کے دونوں ورژن (بنیادی اور Instruct) Apache 2.0 لائسنس کے تحت جاری کیے گئے ہیں، جو آزاد علمی اور تجارتی استعمال کی اجازت دیتا ہے۔ ماڈلز کا سورس کوڈ اور weights GitHub اور Hugging Face پر دستیاب ہیں۔
روابط
- Mixtral of Experts — Mistral AI کے بلاگ پر سرکاری اعلان
- Hugging Face پر Mixtral 8x7B ماڈل
کتابیات
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.