Mixtral (Mistral AI) (FA)
Mixtral 8x7B — یک مدل زبانی بزرگ (LLM) با کد منبع باز است که توسط شرکت فرانسوی Mistral AI توسعه یافته و در دسامبر ۲۰۲۳ منتشر شده است. این مدل بر پایه معماری ترکیب پراکنده متخصصان (Sparse Mixture of Experts, SMoE) بنا شده که به آن امکان میدهد عملکردی قابل مقایسه با مدلهای بسیار بزرگتر (مانند Llama 2 70B و GPT-3.5) را با سرعت و کارایی بالا در استنتاج ترکیب کند[1].
این مدل تحت مجوز آزاد Apache 2.0 توزیع میشود که آن را برای استفاده دانشگاهی و تجاری در دسترس قرار میدهد. Mixtral 8x7B تواناییهای قوی در وظایف چندزبانه، تولید کد و پیروی از دستورالعملها نشان میدهد که آن را در زمان انتشار به یکی از محبوبترین مدلهای متنباز تبدیل کرده است[2].
تاریخچه توسعه
شرکت Mistral AI در آوریل ۲۰۲۳ توسط پژوهشگران سابق Meta و Google تأسیس شد. در سپتامبر ۲۰۲۳ این شرکت اولین مدل خود، Mistral 7B، را منتشر کرد که به خاطر کارایی بالا در اندازه کوچک مورد توجه قرار گرفت.
۱۱ دسامبر ۲۰۲۳ Mistral AI انتشار Mixtral 8x7B را اعلام کرد، که اولین مدل آنها بر پایه معماری ترکیب متخصصان بود. این مدل بلافاصله به عنوان قویترین LLM متنباز آن زمان توجه جامعه را جلب کرد و کیفیتی در سطح GPT-3.5 با سرعت استنتاج به مراتب بالاتر نشان داد. در ژانویه ۲۰۲۴ توضیحات فنی تفصیلی مدل در قالب مقاله علمی در arXiv منتشر شد که به پژوهشگران مستقل امکان داد با جزئیات معماری و نتایج آزمونها آشنا شوند[2].
معماری: Sparse Mixture of Experts - ترکیب پراکنده متخصصان (SMoE)
نوآوری اصلی Mixtral 8x7B پیادهسازی معماری Sparse Mixture of Experts است. برخلاف transformer های استاندارد («متراکم») که در آنها هر لایه محاسبه یکسانی را برای تمام token ها انجام میدهد، در Mixtral هر لایه شامل چندین بلوک موازی «متخصص» است.
ویژگیهای کلیدی معماری:
- ساختار MoE: هر لایه transformer شامل ۸ بلوک feed-forward («متخصص») است. برای پردازش هر token یک router-network ویژه ۲ متخصص مناسبتر را انتخاب میکند (Top-2 routing).
- پارامترها: تعداد کل پارامترهای مدل ۴۶٫۷ میلیارد است، اما به لطف فعالسازی پراکنده، برای هر token در فرایند استنتاج تنها ۱۲٫۹ میلیارد پارامتر فعال استفاده میشود. این امر سرعت استنتاجی قابل مقایسه با مدلهای دارای ~۱۳ میلیارد پارامتر را فراهم میکند.
- بهینهسازی توجه: مدل از فنون مدرن برای پردازش کارآمد توالیهای طولانی استفاده میکند، از جمله Sliding Window Attention (SWA) و Grouped Query Attention (GQA).
- طول زمینه: مدل از پنجره زمینهای با طول تا ۳۲٬۷۶۸ token پشتیبانی میکند.
آموزش
خانواده Mixtral 8x7B شامل دو نسخه اصلی است:
- Mixtral-8x7B-v0.1 (مدل پایه): مدل پیشآموزشدیده که بر روی مجموعه داده بزرگی از محتوای وب به چند زبان اروپایی (انگلیسی، فرانسوی، آلمانی، اسپانیایی، ایتالیایی) آموزش دیده است. وظیفه اصلی — پیشبینی token بعدی.
- Mixtral-8x7B-Instruct-v0.1 (مدل دستورالعملی): نسخهای که با supervised fine-tuning (SFT) و Direct Preference Optimization (DPO) fine-tune شده است. این مدل بهتر از دستورالعملهای کاربر پیروی میکند و برای استفاده در قالب مکالمه طراحی شده است.
عملکرد
Mixtral 8x7B در اکثر benchmark های استاندارد از مدل Llama 2 70B پیشی میگیرد یا با آن برابری میکند، در حالی که ۵ برابر کمتر پارامتر فعال دارد و در نتیجه سرعت استنتاج به مراتب بالاتری ارائه میدهد (تا ۶ برابر سریعتر)[2].
| معیار | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (دانش عمومی) | 69,9% | 70,0% | 70,6% |
| GSM-8K (ریاضیات) | 53,6% | 57,1% | 58,4% |
| MBPP (تولید کد) | 49,8% | 52,2% | 60,7% |
| MT-Bench (ارزیابی مکالمه، نسخههای Instruct) | 6,86 | 8,32 | 8,30 |
- چندزبانگی: به لطف سهم بیشتر دادههای چندزبانه در مجموعه آموزشی، Mixtral در وظایف به زبان فرانسوی، آلمانی، اسپانیایی و ایتالیایی به طور قابل توجهی از Llama 2 70B پیشی میگیرد.
- سوگیری و توهمات: در مقایسه با Llama 2 70B، مدل دقت بالاتری در benchmark BBQ (ارزیابی تعصبات اجتماعی) و مشخصه احساسات مثبتتری در benchmark BOLD نشان میدهد.
مجوز و دسترسپذیری
هر دو نسخه Mixtral 8x7B (پایه و Instruct) تحت مجوز Apache 2.0 منتشر شدهاند که استفاده دانشگاهی و تجاری آزاد را مجاز میشمارد. کدهای منبع و وزنهای مدلها در GitHub و Hugging Face در دسترس هستند.
پیوندها
- Mixtral of Experts — اطلاعیه رسمی در وبلاگ Mistral AI
- مدل Mixtral 8x7B در Hugging Face
منابع
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.