---
title: "Mistral AI (FA)"
source: "https://systems-analysis.info/int/Mistral_AI_(FA)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 4398
wiki_created_at: 2026-09-06T23:34:37Z
wiki_modified_at: 2026-09-06T23:34:37Z
downloaded_at: 2026-09-07T23:02:27Z
---

# Mistral AI (FA)

**Mistral AI** — شرکت فرانسوی در حوزه هوش مصنوعی است که در زمینه توسعه مدل‌های زبانی بزرگ (LLM) تخصص دارد. این شرکت در آوریل ۲۰۲۳ تأسیس شد و به سرعت به یکی از بازیگران کلیدی بازارهای اروپایی و جهانی تبدیل گشت و خود را به عنوان جایگزینی برای مدل‌های اختصاصی غول‌های فناوری آمریکایی معرفی کرد.

ویژگی اصلی رویکرد Mistral AI، تمرکز بر ساخت مدل‌های پرکارایی با وزن‌های باز (عمدتاً تحت مجوز Apache 2.0) است که به دموکراتیزه‌کردن دسترسی به فناوری‌های پیشرفته هوش مصنوعی کمک می‌کند. این شرکت به نوآوری‌های معماری خود از جمله **Grouped-Query Attention (GQA)**، **Sliding Window Attention (SWA)** و **Sparse Mixture-of-Experts (MoE)** شناخته می‌شود که به مدل‌هایشان اجازه می‌دهد با اندازه و هزینه محاسباتی نسبتاً کم، کارایی بالایی داشته باشند.

## تاریخچه

شرکت Mistral AI در آوریل ۲۰۲۳ در پاریس توسط سه پژوهشگر فرانسوی تأسیس شد: **آرتور منش** (Arthur Mensch)، **گیوم لامپل** (Guillaume Lample) و **تیموته لاکروا** (Timothée Lacroix). هر سه بنیان‌گذار پیش از این روی مدل‌های زبانی بزرگ در شرکت‌های پیشرو جهان کار کرده بودند: منش پژوهشگر Google DeepMind بود و لامپل و لاکروا در Meta AI روی LLM کار می‌کردند.

مأموریت شرکت این است که دستاوردهای پیشرفته هوش مصنوعی را برای همگان قابل دسترس سازد و از باز بودن، همکاری و شفافیت حمایت کند. این رویکرد به Mistral AI اجازه داد سرمایه‌گذاری قابل توجهی را به سرعت جذب کند:

- **ژوئن ۲۰۲۳:** ۱۰۵ میلیون یورو در دور seed که رکورد اروپا را شکست.
- **دسامبر ۲۰۲۳:** ۳۸۵ میلیون یورو در دور Series A که پس از آن ارزش‌گذاری شرکت از ۲ میلیارد دلار فراتر رفت و جایگاه «یونیکورن» را کسب کرد.
- **فوریه ۲۰۲۴:** اعلام مشارکت استراتژیک با Microsoft که شامل سرمایه‌گذاری ۱۶ میلیون دلاری و میزبانی مدل‌های Mistral در ابر Azure بود.
- **ژوئن ۲۰۲۴:** دور جدید تأمین مالی به مبلغ ۶۰۰ میلیون یورو که ارزش‌گذاری شرکت را به حدود ۵٫۸ میلیارد یورو رساند و آن را به یکی از گران‌ترین استارتاپ‌های هوش مصنوعی جهان تبدیل کرد.

## ویژگی‌های فنی معماری

مدل‌های Mistral AI بر پایه معماری transformer ساخته شده‌اند، اما شامل تعدادی نوآوری کلیدی برای افزایش کارایی و کاهش هزینه‌های محاسباتی هستند.

### Transformer با بهبودها (Mistral 7B)

اولین مدل شرکت، **Mistral 7B**، دو بهبود معماری مهم را معرفی کرد:

- **Sliding Window Attention (SWA)** (توجه با پنجره لغزان): به جای اینکه هر token با تمام token‌های قبلی تعامل داشته باشد (که پیچیدگی درجه دوم دارد)، SWA توجه را به یک پنجره ثابت (مثلاً ۴۰۹۶ token) محدود می‌کند. این امر پردازش دنباله‌های بسیار طولانی (تا ۳۲ هزار token و بیشتر) را با پیچیدگی محاسباتی خطی ممکن می‌سازد و پردازش را به طور قابل توجهی تسریع می‌کند.
- **Grouped-Query Attention (GQA)** (توجه گروه‌بندی‌شده بر اساس query): بهینه‌سازی مکانیزم استاندارد multi-head attention است. GQA از تعداد کمتری «هد» برای key و value نسبت به query استفاده می‌کند (مثلاً با نسبت ۸:۱)، که نیاز به حافظه را به طور قابل ملاحظه‌ای کاهش می‌دهد و فرایند تولید (inference) را بدون افت کیفیت چشمگیر تسریع می‌کند.

### Sparse Mixture-of-Experts (MoE)

در مدل‌های سری **Mixtral** (مانند *Mixtral 8x7B*، *Mixtral 8x22B*) معماری **Sparse Mixture-of-Experts** (ترکیب پراکنده از متخصصان) به کار رفته است. به جای یک لایه شبکه عصبی متراکم، چندین زیرشبکه «متخصص» موازی استفاده می‌شود. برای هر token ورودی، یک لایه *gating* ویژه (مسیریاب) به صورت پویا زیرمجموعه‌ای کوچک از متخصصان را برای فعال‌سازی انتخاب می‌کند (معمولاً ۲ از ۸).

این امر امکان ساخت مدل‌هایی با تعداد پارامتر کلی بسیار زیاد را فراهم می‌کند (Mixtral 8x22B دارای ۱۴۱ میلیارد پارامتر است)، اما در پردازش هر token تنها بخش کوچکی از آن‌ها (~۳۹ میلیارد) استفاده می‌شود. در نتیجه، مدل به کیفیتی قابل مقایسه با مدل‌های «متراکم» بزرگ‌تر دست می‌یابد، اما با سرعت و هزینه inference مدل‌هایی با اندازه بسیار کمتر.

### معماری Mamba (SSM)

در سال ۲۰۲۴، Mistral AI مدل آزمایشی **Codestral Mamba** را معرفی کرد که بر اساس معماری **Mamba (Selective State-Space Model)** ساخته شده است. بر خلاف transformer‌ها، Mamba از مکانیزم بازگشتی مبتنی بر مدل‌های فضای حالت استفاده می‌کند. مزایای کلیدی:

- **پیچیدگی خطی** نسبت به طول دنباله، که آن را در متن‌های طولانی بسیار سریع می‌کند.
- **زمینه به لحاظ نظری «بی‌نهایت»**، که تنها توسط حافظه موجود محدود می‌شود.
- **سرعت بالای inference** در مقایسه با transformer‌های معادل.

## زمان‌بندی و مدل‌ها

<table class="wikitable mw-collapsible">
<caption>انتشارهای اصلی مدل‌های Mistral AI</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>ماه / سال</th>
<th>مدل</th>
<th>پارامترها (میلیارد)</th>
<th>ویژگی‌های کلیدی</th>
<th>مجوز</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7٫3</td>
<td>معماری GQA + SWA؛ زمینه 32k؛ از Llama 2 13B در تمام benchmark‌ها پیشی می‌گیرد.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46٫7 (12٫9 فعال)</td>
<td>اولین مدل MoE باز؛ کیفیت در سطح GPT-3.5.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>مدل «کوچک‌تر» و پرچم‌دار، در دسترس از طریق API.</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 فعال)</td>
<td>زمینه 64k؛ کیفیت SOTA در بین مدل‌های open-source در زمان انتشار.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>مدل تخصصی برای تولید کد (بیش از ۸۰ زبان).</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>مدل‌های تخصصی برای ریاضیات و چندزبانی.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7٫3</td>
<td>مدل آزمایشی برای کد بر معماری Mamba؛ زمینه 256k+.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>اولین مدل multimodal باز (متن + تصویر).</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (تخمین)</td>
<td>مدل پرچم‌دار به‌روزشده با reasoning بهبودیافته.</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>بهینه‌شده برای تأخیر کم (تا ۱۵۰ token در ثانیه)؛ کیفیت در سطح مدل‌های 70B.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>مدل multimodal مرزی (متن، تصویر) با زمینه 128k.</td>
<td>اختصاصی</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>مدل «عاملی» برای توسعه خودکار نرم‌افزار؛ 46٫8٪ در SWE-Bench.</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

انتشارهای اصلی مدل‌های Mistral AI

## مقایسه با رقبا

- **در برابر Llama (Meta):** مدل‌های Mistral به طور مداوم از مدل‌های Llama با اندازه مشابه یا حتی بزرگ‌تر پیشی می‌گیرند. Mistral 7B از Llama 2 13B و Mixtral 8x7B از Llama 2 70B پیشی گرفت. تفاوت اصلی در مجوز است: Mistral از مجوز کاملاً آزاد Apache 2.0 استفاده می‌کند، در حالی که مجوز Llama دارای محدودیت‌هایی است.
- **در برابر GPT (OpenAI):** مدل‌های پرچم‌دار OpenAI (GPT-4) در دشوارترین وظایف پیشتاز باقی می‌مانند، اما مدل‌های باز Mistral (مانند Mixtral 8x7B) کیفیتی قابل مقایسه با GPT-3.5 نشان می‌دهند. Mistral یک جایگزین باز ارائه می‌دهد که امکان استقرار محلی مدل‌ها و کنترل کامل آن‌ها را فراهم می‌کند.
- **در برابر Claude (Anthropic):** مدل‌های Claude به پنجره زمینه بزرگ و تمرکز بر ایمنی شناخته می‌شوند. Mistral مدل‌های باز با زمینه قابل مقایسه یا بزرگ‌تر ارائه داده است. از نظر عملکرد در benchmark‌های استاندارد (LMSys Arena) مدل Medium 3 از Claude 3 Opus پیشی گرفته است.

## کاربرد و اکوسیستم

### محصولات

- **Le Chat:** دستیار چت عمومی (وب، iOS/Android) که قابلیت‌های مدل‌های Mistral از جمله جستجوی وب و تولید تصویر را نمایش می‌دهد.
- **La Plateforme:** پلتفرم سازمانی با دسترسی API به تمام مدل‌های Mistral که به شرکت‌ها امکان می‌دهد LLM را در محصولات خود یکپارچه کنند.

### مشتریان سازمانی

فناوری‌های Mistral توسط شرکت‌های بزرگی همچون **BNP Paribas** (مالی)، **CMA CGM** (لجستیک)، **Zalando** (تجارت الکترونیک) و آژانس دولتی **France Travail** استفاده می‌شود. برای مشتریان اروپایی، امکان استقرار محلی مدل‌ها برای رعایت GDPR اهمیت زیادی دارد.

### جامعه Open-Source

با توجه به مجوز باز، مدل‌های Mistral پایه هزاران پروژه در پلتفرم‌هایی مانند Hugging Face شده‌اند. جامعه به طور فعال مدل‌ها را برای حل وظایف تخصصی fine-tune می‌کند و نسخه‌هایی برای زیست‌شناسی (BioMistral)، حقوق (SaulLM-7B) و بومی‌سازی به زبان‌های مختلف (مانند Polish Bielik 7B) ایجاد می‌کند.

## مجوزدهی

| سری مدل‌ها                                                | مجوز                       | محدودیت‌ها                                     |
|----------------------------------------------------------|----------------------------|-----------------------------------------------|
| پایه، Small، Mixtral، Mathstral، Nemo، Pixtral، Devstral | Apache 2.0                 | استفاده تجاری آزاد.                           |
| Codestral 22B                                            | Non-Production License     | استفاده تجاری بدون قرارداد جداگانه ممنوع است. |
| سری Large، سری Medium                                    | Mistral Research / اختصاصی | دسترسی فقط از طریق API ابری.                  |

## پیوندها

- مستندات رسمی Mistral AI
- پروفایل Mistral AI در Hugging Face

## منابع

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
