Mixtral (Mistral AI) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — یک مدل زبانی بزرگ (LLM) با کد منبع باز است که توسط شرکت فرانسوی Mistral AI توسعه یافته و در دسامبر ۲۰۲۳ منتشر شده است. این مدل بر پایه معماری ترکیب پراکنده متخصصان (Sparse Mixture of Experts, SMoE) بنا شده که به آن امکان می‌دهد عملکردی قابل مقایسه با مدل‌های بسیار بزرگ‌تر (مانند Llama 2 70B و GPT-3.5) را با سرعت و کارایی بالا در استنتاج ترکیب کند[1].

این مدل تحت مجوز آزاد Apache 2.0 توزیع می‌شود که آن را برای استفاده دانشگاهی و تجاری در دسترس قرار می‌دهد. Mixtral 8x7B توانایی‌های قوی در وظایف چندزبانه، تولید کد و پیروی از دستورالعمل‌ها نشان می‌دهد که آن را در زمان انتشار به یکی از محبوب‌ترین مدل‌های متن‌باز تبدیل کرده است[2].

تاریخچه توسعه

شرکت Mistral AI در آوریل ۲۰۲۳ توسط پژوهشگران سابق Meta و Google تأسیس شد. در سپتامبر ۲۰۲۳ این شرکت اولین مدل خود، Mistral 7B، را منتشر کرد که به خاطر کارایی بالا در اندازه کوچک مورد توجه قرار گرفت.

۱۱ دسامبر ۲۰۲۳ Mistral AI انتشار Mixtral 8x7B را اعلام کرد، که اولین مدل آن‌ها بر پایه معماری ترکیب متخصصان بود. این مدل بلافاصله به عنوان قوی‌ترین LLM متن‌باز آن زمان توجه جامعه را جلب کرد و کیفیتی در سطح GPT-3.5 با سرعت استنتاج به مراتب بالاتر نشان داد. در ژانویه ۲۰۲۴ توضیحات فنی تفصیلی مدل در قالب مقاله علمی در arXiv منتشر شد که به پژوهشگران مستقل امکان داد با جزئیات معماری و نتایج آزمون‌ها آشنا شوند[2].

معماری: Sparse Mixture of Experts - ترکیب پراکنده متخصصان (SMoE)

نوآوری اصلی Mixtral 8x7B پیاده‌سازی معماری Sparse Mixture of Experts است. برخلاف transformer های استاندارد («متراکم») که در آن‌ها هر لایه محاسبه یکسانی را برای تمام token ها انجام می‌دهد، در Mixtral هر لایه شامل چندین بلوک موازی «متخصص» است.

ویژگی‌های کلیدی معماری:

  • ساختار MoE: هر لایه transformer شامل ۸ بلوک feed-forward («متخصص») است. برای پردازش هر token یک router-network ویژه ۲ متخصص مناسب‌تر را انتخاب می‌کند (Top-2 routing).
  • پارامترها: تعداد کل پارامترهای مدل ۴۶٫۷ میلیارد است، اما به لطف فعال‌سازی پراکنده، برای هر token در فرایند استنتاج تنها ۱۲٫۹ میلیارد پارامتر فعال استفاده می‌شود. این امر سرعت استنتاجی قابل مقایسه با مدل‌های دارای ~۱۳ میلیارد پارامتر را فراهم می‌کند.
  • بهینه‌سازی توجه: مدل از فنون مدرن برای پردازش کارآمد توالی‌های طولانی استفاده می‌کند، از جمله Sliding Window Attention (SWA) و Grouped Query Attention (GQA).
  • طول زمینه: مدل از پنجره زمینه‌ای با طول تا ۳۲٬۷۶۸ token پشتیبانی می‌کند.

آموزش

خانواده Mixtral 8x7B شامل دو نسخه اصلی است:

  1. Mixtral-8x7B-v0.1 (مدل پایه): مدل پیش‌آموزش‌دیده که بر روی مجموعه داده بزرگی از محتوای وب به چند زبان اروپایی (انگلیسی، فرانسوی، آلمانی، اسپانیایی، ایتالیایی) آموزش دیده است. وظیفه اصلی — پیش‌بینی token بعدی.
  2. Mixtral-8x7B-Instruct-v0.1 (مدل دستورالعملی): نسخه‌ای که با supervised fine-tuning (SFT) و Direct Preference Optimization (DPO) fine-tune شده است. این مدل بهتر از دستورالعمل‌های کاربر پیروی می‌کند و برای استفاده در قالب مکالمه طراحی شده است.

عملکرد

Mixtral 8x7B در اکثر benchmark های استاندارد از مدل Llama 2 70B پیشی می‌گیرد یا با آن برابری می‌کند، در حالی که ۵ برابر کمتر پارامتر فعال دارد و در نتیجه سرعت استنتاج به مراتب بالاتری ارائه می‌دهد (تا ۶ برابر سریع‌تر)[2].

مقایسه عملکرد Mixtral 8x7B با Llama 2 70B و GPT-3.5[2]
معیار Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (دانش عمومی) 69,9% 70,0% 70,6%
GSM-8K (ریاضیات) 53,6% 57,1% 58,4%
MBPP (تولید کد) 49,8% 52,2% 60,7%
MT-Bench (ارزیابی مکالمه، نسخه‌های Instruct) 6,86 8,32 8,30
  • چندزبانگی: به لطف سهم بیشتر داده‌های چندزبانه در مجموعه آموزشی، Mixtral در وظایف به زبان فرانسوی، آلمانی، اسپانیایی و ایتالیایی به طور قابل توجهی از Llama 2 70B پیشی می‌گیرد.
  • سوگیری و توهمات: در مقایسه با Llama 2 70B، مدل دقت بالاتری در benchmark BBQ (ارزیابی تعصبات اجتماعی) و مشخصه احساسات مثبت‌تری در benchmark BOLD نشان می‌دهد.

مجوز و دسترس‌پذیری

هر دو نسخه Mixtral 8x7B (پایه و Instruct) تحت مجوز Apache 2.0 منتشر شده‌اند که استفاده دانشگاهی و تجاری آزاد را مجاز می‌شمارد. کدهای منبع و وزن‌های مدل‌ها در GitHub و Hugging Face در دسترس هستند.

پیوندها

  • Mixtral of Experts — اطلاعیه رسمی در وبلاگ Mistral AI
  • مدل Mixtral 8x7B در Hugging Face

منابع

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

یادداشت‌ها

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [۱]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [۲]