Mistral AI (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Mistral AI — شرکت فرانسوی در حوزه هوش مصنوعی است که در زمینه توسعه مدل‌های زبانی بزرگ (LLM) تخصص دارد. این شرکت در آوریل ۲۰۲۳ تأسیس شد و به سرعت به یکی از بازیگران کلیدی بازارهای اروپایی و جهانی تبدیل گشت و خود را به عنوان جایگزینی برای مدل‌های اختصاصی غول‌های فناوری آمریکایی معرفی کرد.

ویژگی اصلی رویکرد Mistral AI، تمرکز بر ساخت مدل‌های پرکارایی با وزن‌های باز (عمدتاً تحت مجوز Apache 2.0) است که به دموکراتیزه‌کردن دسترسی به فناوری‌های پیشرفته هوش مصنوعی کمک می‌کند. این شرکت به نوآوری‌های معماری خود از جمله Grouped-Query Attention (GQA)، Sliding Window Attention (SWA) و Sparse Mixture-of-Experts (MoE) شناخته می‌شود که به مدل‌هایشان اجازه می‌دهد با اندازه و هزینه محاسباتی نسبتاً کم، کارایی بالایی داشته باشند.

تاریخچه

شرکت Mistral AI در آوریل ۲۰۲۳ در پاریس توسط سه پژوهشگر فرانسوی تأسیس شد: آرتور منش (Arthur Mensch)، گیوم لامپل (Guillaume Lample) و تیموته لاکروا (Timothée Lacroix). هر سه بنیان‌گذار پیش از این روی مدل‌های زبانی بزرگ در شرکت‌های پیشرو جهان کار کرده بودند: منش پژوهشگر Google DeepMind بود و لامپل و لاکروا در Meta AI روی LLM کار می‌کردند.

مأموریت شرکت این است که دستاوردهای پیشرفته هوش مصنوعی را برای همگان قابل دسترس سازد و از باز بودن، همکاری و شفافیت حمایت کند. این رویکرد به Mistral AI اجازه داد سرمایه‌گذاری قابل توجهی را به سرعت جذب کند:

  • ژوئن ۲۰۲۳: ۱۰۵ میلیون یورو در دور seed که رکورد اروپا را شکست.
  • دسامبر ۲۰۲۳: ۳۸۵ میلیون یورو در دور Series A که پس از آن ارزش‌گذاری شرکت از ۲ میلیارد دلار فراتر رفت و جایگاه «یونیکورن» را کسب کرد.
  • فوریه ۲۰۲۴: اعلام مشارکت استراتژیک با Microsoft که شامل سرمایه‌گذاری ۱۶ میلیون دلاری و میزبانی مدل‌های Mistral در ابر Azure بود.
  • ژوئن ۲۰۲۴: دور جدید تأمین مالی به مبلغ ۶۰۰ میلیون یورو که ارزش‌گذاری شرکت را به حدود ۵٫۸ میلیارد یورو رساند و آن را به یکی از گران‌ترین استارتاپ‌های هوش مصنوعی جهان تبدیل کرد.

ویژگی‌های فنی معماری

مدل‌های Mistral AI بر پایه معماری transformer ساخته شده‌اند، اما شامل تعدادی نوآوری کلیدی برای افزایش کارایی و کاهش هزینه‌های محاسباتی هستند.

Transformer با بهبودها (Mistral 7B)

اولین مدل شرکت، Mistral 7B، دو بهبود معماری مهم را معرفی کرد:

  • Sliding Window Attention (SWA) (توجه با پنجره لغزان): به جای اینکه هر token با تمام token‌های قبلی تعامل داشته باشد (که پیچیدگی درجه دوم دارد)، SWA توجه را به یک پنجره ثابت (مثلاً ۴۰۹۶ token) محدود می‌کند. این امر پردازش دنباله‌های بسیار طولانی (تا ۳۲ هزار token و بیشتر) را با پیچیدگی محاسباتی خطی ممکن می‌سازد و پردازش را به طور قابل توجهی تسریع می‌کند.
  • Grouped-Query Attention (GQA) (توجه گروه‌بندی‌شده بر اساس query): بهینه‌سازی مکانیزم استاندارد multi-head attention است. GQA از تعداد کمتری «هد» برای key و value نسبت به query استفاده می‌کند (مثلاً با نسبت ۸:۱)، که نیاز به حافظه را به طور قابل ملاحظه‌ای کاهش می‌دهد و فرایند تولید (inference) را بدون افت کیفیت چشمگیر تسریع می‌کند.

Sparse Mixture-of-Experts (MoE)

در مدل‌های سری Mixtral (مانند Mixtral 8x7B، Mixtral 8x22B) معماری Sparse Mixture-of-Experts (ترکیب پراکنده از متخصصان) به کار رفته است. به جای یک لایه شبکه عصبی متراکم، چندین زیرشبکه «متخصص» موازی استفاده می‌شود. برای هر token ورودی، یک لایه gating ویژه (مسیریاب) به صورت پویا زیرمجموعه‌ای کوچک از متخصصان را برای فعال‌سازی انتخاب می‌کند (معمولاً ۲ از ۸).

این امر امکان ساخت مدل‌هایی با تعداد پارامتر کلی بسیار زیاد را فراهم می‌کند (Mixtral 8x22B دارای ۱۴۱ میلیارد پارامتر است)، اما در پردازش هر token تنها بخش کوچکی از آن‌ها (~۳۹ میلیارد) استفاده می‌شود. در نتیجه، مدل به کیفیتی قابل مقایسه با مدل‌های «متراکم» بزرگ‌تر دست می‌یابد، اما با سرعت و هزینه inference مدل‌هایی با اندازه بسیار کمتر.

معماری Mamba (SSM)

در سال ۲۰۲۴، Mistral AI مدل آزمایشی Codestral Mamba را معرفی کرد که بر اساس معماری Mamba (Selective State-Space Model) ساخته شده است. بر خلاف transformer‌ها، Mamba از مکانیزم بازگشتی مبتنی بر مدل‌های فضای حالت استفاده می‌کند. مزایای کلیدی:

  • پیچیدگی خطی نسبت به طول دنباله، که آن را در متن‌های طولانی بسیار سریع می‌کند.
  • زمینه به لحاظ نظری «بی‌نهایت»، که تنها توسط حافظه موجود محدود می‌شود.
  • سرعت بالای inference در مقایسه با transformer‌های معادل.

زمان‌بندی و مدل‌ها

انتشارهای اصلی مدل‌های Mistral AI
ماه / سال مدل پارامترها (میلیارد) ویژگی‌های کلیدی مجوز
09 / 2023 Mistral 7B 7٫3 معماری GQA + SWA؛ زمینه 32k؛ از Llama 2 13B در تمام benchmark‌ها پیشی می‌گیرد. Apache 2.0
12 / 2023 Mixtral 8x7B 46٫7 (12٫9 فعال) اولین مدل MoE باز؛ کیفیت در سطح GPT-3.5. Apache 2.0
02 / 2024 Mistral Small / Large ? مدل «کوچک‌تر» و پرچم‌دار، در دسترس از طریق API. Small: Apache 2.0,
Large: Research
04 / 2024 Mixtral 8x22B 141 (39 فعال) زمینه 64k؛ کیفیت SOTA در بین مدل‌های open-source در زمان انتشار. Apache 2.0
05 / 2024 Codestral 22B 22 مدل تخصصی برای تولید کد (بیش از ۸۰ زبان). Non-Production
07 / 2024 Mathstral 7B / Nemo 12B 7 / 12 مدل‌های تخصصی برای ریاضیات و چندزبانی. Apache 2.0
07 / 2024 Codestral Mamba 7.3B 7٫3 مدل آزمایشی برای کد بر معماری Mamba؛ زمینه 256k+. Apache 2.0
09 / 2024 Pixtral 12B 12 اولین مدل multimodal باز (متن + تصویر). Apache 2.0
11 / 2024 Mistral Large 24.11 ~100+ (تخمین) مدل پرچم‌دار به‌روزشده با reasoning بهبودیافته. Research
01 / 2025 Mistral Small 3 24 بهینه‌شده برای تأخیر کم (تا ۱۵۰ token در ثانیه)؛ کیفیت در سطح مدل‌های 70B. Apache 2.0
05 / 2025 Mistral Medium 3 ? مدل multimodal مرزی (متن، تصویر) با زمینه 128k. اختصاصی
05 / 2025 Devstral 24B 24 مدل «عاملی» برای توسعه خودکار نرم‌افزار؛ 46٫8٪ در SWE-Bench. Apache 2.0

مقایسه با رقبا

  • در برابر Llama (Meta): مدل‌های Mistral به طور مداوم از مدل‌های Llama با اندازه مشابه یا حتی بزرگ‌تر پیشی می‌گیرند. Mistral 7B از Llama 2 13B و Mixtral 8x7B از Llama 2 70B پیشی گرفت. تفاوت اصلی در مجوز است: Mistral از مجوز کاملاً آزاد Apache 2.0 استفاده می‌کند، در حالی که مجوز Llama دارای محدودیت‌هایی است.
  • در برابر GPT (OpenAI): مدل‌های پرچم‌دار OpenAI (GPT-4) در دشوارترین وظایف پیشتاز باقی می‌مانند، اما مدل‌های باز Mistral (مانند Mixtral 8x7B) کیفیتی قابل مقایسه با GPT-3.5 نشان می‌دهند. Mistral یک جایگزین باز ارائه می‌دهد که امکان استقرار محلی مدل‌ها و کنترل کامل آن‌ها را فراهم می‌کند.
  • در برابر Claude (Anthropic): مدل‌های Claude به پنجره زمینه بزرگ و تمرکز بر ایمنی شناخته می‌شوند. Mistral مدل‌های باز با زمینه قابل مقایسه یا بزرگ‌تر ارائه داده است. از نظر عملکرد در benchmark‌های استاندارد (LMSys Arena) مدل Medium 3 از Claude 3 Opus پیشی گرفته است.

کاربرد و اکوسیستم

محصولات

  • Le Chat: دستیار چت عمومی (وب، iOS/Android) که قابلیت‌های مدل‌های Mistral از جمله جستجوی وب و تولید تصویر را نمایش می‌دهد.
  • La Plateforme: پلتفرم سازمانی با دسترسی API به تمام مدل‌های Mistral که به شرکت‌ها امکان می‌دهد LLM را در محصولات خود یکپارچه کنند.

مشتریان سازمانی

فناوری‌های Mistral توسط شرکت‌های بزرگی همچون BNP Paribas (مالی)، CMA CGM (لجستیک)، Zalando (تجارت الکترونیک) و آژانس دولتی France Travail استفاده می‌شود. برای مشتریان اروپایی، امکان استقرار محلی مدل‌ها برای رعایت GDPR اهمیت زیادی دارد.

جامعه Open-Source

با توجه به مجوز باز، مدل‌های Mistral پایه هزاران پروژه در پلتفرم‌هایی مانند Hugging Face شده‌اند. جامعه به طور فعال مدل‌ها را برای حل وظایف تخصصی fine-tune می‌کند و نسخه‌هایی برای زیست‌شناسی (BioMistral)، حقوق (SaulLM-7B) و بومی‌سازی به زبان‌های مختلف (مانند Polish Bielik 7B) ایجاد می‌کند.

مجوزدهی

سری مدل‌ها مجوز محدودیت‌ها
پایه، Small، Mixtral، Mathstral، Nemo، Pixtral، Devstral Apache 2.0 استفاده تجاری آزاد.
Codestral 22B Non-Production License استفاده تجاری بدون قرارداد جداگانه ممنوع است.
سری Large، سری Medium Mistral Research / اختصاصی دسترسی فقط از طریق API ابری.

پیوندها

  • مستندات رسمی Mistral AI
  • پروفایل Mistral AI در Hugging Face

منابع

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
  • Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.