Mistral AI (FA)
Mistral AI — شرکت فرانسوی در حوزه هوش مصنوعی است که در زمینه توسعه مدلهای زبانی بزرگ (LLM) تخصص دارد. این شرکت در آوریل ۲۰۲۳ تأسیس شد و به سرعت به یکی از بازیگران کلیدی بازارهای اروپایی و جهانی تبدیل گشت و خود را به عنوان جایگزینی برای مدلهای اختصاصی غولهای فناوری آمریکایی معرفی کرد.
ویژگی اصلی رویکرد Mistral AI، تمرکز بر ساخت مدلهای پرکارایی با وزنهای باز (عمدتاً تحت مجوز Apache 2.0) است که به دموکراتیزهکردن دسترسی به فناوریهای پیشرفته هوش مصنوعی کمک میکند. این شرکت به نوآوریهای معماری خود از جمله Grouped-Query Attention (GQA)، Sliding Window Attention (SWA) و Sparse Mixture-of-Experts (MoE) شناخته میشود که به مدلهایشان اجازه میدهد با اندازه و هزینه محاسباتی نسبتاً کم، کارایی بالایی داشته باشند.
تاریخچه
شرکت Mistral AI در آوریل ۲۰۲۳ در پاریس توسط سه پژوهشگر فرانسوی تأسیس شد: آرتور منش (Arthur Mensch)، گیوم لامپل (Guillaume Lample) و تیموته لاکروا (Timothée Lacroix). هر سه بنیانگذار پیش از این روی مدلهای زبانی بزرگ در شرکتهای پیشرو جهان کار کرده بودند: منش پژوهشگر Google DeepMind بود و لامپل و لاکروا در Meta AI روی LLM کار میکردند.
مأموریت شرکت این است که دستاوردهای پیشرفته هوش مصنوعی را برای همگان قابل دسترس سازد و از باز بودن، همکاری و شفافیت حمایت کند. این رویکرد به Mistral AI اجازه داد سرمایهگذاری قابل توجهی را به سرعت جذب کند:
- ژوئن ۲۰۲۳: ۱۰۵ میلیون یورو در دور seed که رکورد اروپا را شکست.
- دسامبر ۲۰۲۳: ۳۸۵ میلیون یورو در دور Series A که پس از آن ارزشگذاری شرکت از ۲ میلیارد دلار فراتر رفت و جایگاه «یونیکورن» را کسب کرد.
- فوریه ۲۰۲۴: اعلام مشارکت استراتژیک با Microsoft که شامل سرمایهگذاری ۱۶ میلیون دلاری و میزبانی مدلهای Mistral در ابر Azure بود.
- ژوئن ۲۰۲۴: دور جدید تأمین مالی به مبلغ ۶۰۰ میلیون یورو که ارزشگذاری شرکت را به حدود ۵٫۸ میلیارد یورو رساند و آن را به یکی از گرانترین استارتاپهای هوش مصنوعی جهان تبدیل کرد.
ویژگیهای فنی معماری
مدلهای Mistral AI بر پایه معماری transformer ساخته شدهاند، اما شامل تعدادی نوآوری کلیدی برای افزایش کارایی و کاهش هزینههای محاسباتی هستند.
Transformer با بهبودها (Mistral 7B)
اولین مدل شرکت، Mistral 7B، دو بهبود معماری مهم را معرفی کرد:
- Sliding Window Attention (SWA) (توجه با پنجره لغزان): به جای اینکه هر token با تمام tokenهای قبلی تعامل داشته باشد (که پیچیدگی درجه دوم دارد)، SWA توجه را به یک پنجره ثابت (مثلاً ۴۰۹۶ token) محدود میکند. این امر پردازش دنبالههای بسیار طولانی (تا ۳۲ هزار token و بیشتر) را با پیچیدگی محاسباتی خطی ممکن میسازد و پردازش را به طور قابل توجهی تسریع میکند.
- Grouped-Query Attention (GQA) (توجه گروهبندیشده بر اساس query): بهینهسازی مکانیزم استاندارد multi-head attention است. GQA از تعداد کمتری «هد» برای key و value نسبت به query استفاده میکند (مثلاً با نسبت ۸:۱)، که نیاز به حافظه را به طور قابل ملاحظهای کاهش میدهد و فرایند تولید (inference) را بدون افت کیفیت چشمگیر تسریع میکند.
Sparse Mixture-of-Experts (MoE)
در مدلهای سری Mixtral (مانند Mixtral 8x7B، Mixtral 8x22B) معماری Sparse Mixture-of-Experts (ترکیب پراکنده از متخصصان) به کار رفته است. به جای یک لایه شبکه عصبی متراکم، چندین زیرشبکه «متخصص» موازی استفاده میشود. برای هر token ورودی، یک لایه gating ویژه (مسیریاب) به صورت پویا زیرمجموعهای کوچک از متخصصان را برای فعالسازی انتخاب میکند (معمولاً ۲ از ۸).
این امر امکان ساخت مدلهایی با تعداد پارامتر کلی بسیار زیاد را فراهم میکند (Mixtral 8x22B دارای ۱۴۱ میلیارد پارامتر است)، اما در پردازش هر token تنها بخش کوچکی از آنها (~۳۹ میلیارد) استفاده میشود. در نتیجه، مدل به کیفیتی قابل مقایسه با مدلهای «متراکم» بزرگتر دست مییابد، اما با سرعت و هزینه inference مدلهایی با اندازه بسیار کمتر.
معماری Mamba (SSM)
در سال ۲۰۲۴، Mistral AI مدل آزمایشی Codestral Mamba را معرفی کرد که بر اساس معماری Mamba (Selective State-Space Model) ساخته شده است. بر خلاف transformerها، Mamba از مکانیزم بازگشتی مبتنی بر مدلهای فضای حالت استفاده میکند. مزایای کلیدی:
- پیچیدگی خطی نسبت به طول دنباله، که آن را در متنهای طولانی بسیار سریع میکند.
- زمینه به لحاظ نظری «بینهایت»، که تنها توسط حافظه موجود محدود میشود.
- سرعت بالای inference در مقایسه با transformerهای معادل.
زمانبندی و مدلها
| ماه / سال | مدل | پارامترها (میلیارد) | ویژگیهای کلیدی | مجوز |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7٫3 | معماری GQA + SWA؛ زمینه 32k؛ از Llama 2 13B در تمام benchmarkها پیشی میگیرد. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46٫7 (12٫9 فعال) | اولین مدل MoE باز؛ کیفیت در سطح GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | مدل «کوچکتر» و پرچمدار، در دسترس از طریق API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 فعال) | زمینه 64k؛ کیفیت SOTA در بین مدلهای open-source در زمان انتشار. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | مدل تخصصی برای تولید کد (بیش از ۸۰ زبان). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | مدلهای تخصصی برای ریاضیات و چندزبانی. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7٫3 | مدل آزمایشی برای کد بر معماری Mamba؛ زمینه 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | اولین مدل multimodal باز (متن + تصویر). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (تخمین) | مدل پرچمدار بهروزشده با reasoning بهبودیافته. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | بهینهشده برای تأخیر کم (تا ۱۵۰ token در ثانیه)؛ کیفیت در سطح مدلهای 70B. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | مدل multimodal مرزی (متن، تصویر) با زمینه 128k. | اختصاصی |
| 05 / 2025 | Devstral 24B | 24 | مدل «عاملی» برای توسعه خودکار نرمافزار؛ 46٫8٪ در SWE-Bench. | Apache 2.0 |
مقایسه با رقبا
- در برابر Llama (Meta): مدلهای Mistral به طور مداوم از مدلهای Llama با اندازه مشابه یا حتی بزرگتر پیشی میگیرند. Mistral 7B از Llama 2 13B و Mixtral 8x7B از Llama 2 70B پیشی گرفت. تفاوت اصلی در مجوز است: Mistral از مجوز کاملاً آزاد Apache 2.0 استفاده میکند، در حالی که مجوز Llama دارای محدودیتهایی است.
- در برابر GPT (OpenAI): مدلهای پرچمدار OpenAI (GPT-4) در دشوارترین وظایف پیشتاز باقی میمانند، اما مدلهای باز Mistral (مانند Mixtral 8x7B) کیفیتی قابل مقایسه با GPT-3.5 نشان میدهند. Mistral یک جایگزین باز ارائه میدهد که امکان استقرار محلی مدلها و کنترل کامل آنها را فراهم میکند.
- در برابر Claude (Anthropic): مدلهای Claude به پنجره زمینه بزرگ و تمرکز بر ایمنی شناخته میشوند. Mistral مدلهای باز با زمینه قابل مقایسه یا بزرگتر ارائه داده است. از نظر عملکرد در benchmarkهای استاندارد (LMSys Arena) مدل Medium 3 از Claude 3 Opus پیشی گرفته است.
کاربرد و اکوسیستم
محصولات
- Le Chat: دستیار چت عمومی (وب، iOS/Android) که قابلیتهای مدلهای Mistral از جمله جستجوی وب و تولید تصویر را نمایش میدهد.
- La Plateforme: پلتفرم سازمانی با دسترسی API به تمام مدلهای Mistral که به شرکتها امکان میدهد LLM را در محصولات خود یکپارچه کنند.
مشتریان سازمانی
فناوریهای Mistral توسط شرکتهای بزرگی همچون BNP Paribas (مالی)، CMA CGM (لجستیک)، Zalando (تجارت الکترونیک) و آژانس دولتی France Travail استفاده میشود. برای مشتریان اروپایی، امکان استقرار محلی مدلها برای رعایت GDPR اهمیت زیادی دارد.
جامعه Open-Source
با توجه به مجوز باز، مدلهای Mistral پایه هزاران پروژه در پلتفرمهایی مانند Hugging Face شدهاند. جامعه به طور فعال مدلها را برای حل وظایف تخصصی fine-tune میکند و نسخههایی برای زیستشناسی (BioMistral)، حقوق (SaulLM-7B) و بومیسازی به زبانهای مختلف (مانند Polish Bielik 7B) ایجاد میکند.
مجوزدهی
| سری مدلها | مجوز | محدودیتها |
|---|---|---|
| پایه، Small، Mixtral، Mathstral، Nemo، Pixtral، Devstral | Apache 2.0 | استفاده تجاری آزاد. |
| Codestral 22B | Non-Production License | استفاده تجاری بدون قرارداد جداگانه ممنوع است. |
| سری Large، سری Medium | Mistral Research / اختصاصی | دسترسی فقط از طریق API ابری. |
پیوندها
- مستندات رسمی Mistral AI
- پروفایل Mistral AI در Hugging Face
منابع
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.