---
title: "Mistral AI (HI)"
source: "https://systems-analysis.info/int/Mistral_AI_(HI)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4401
wiki_created_at: 2026-09-06T23:34:39Z
wiki_modified_at: 2026-09-06T23:34:39Z
downloaded_at: 2026-09-07T23:02:28Z
---

# Mistral AI (HI)

**Mistral AI** — एक फ्रांसीसी आर्टिफिशियल इंटेलिजेंस कंपनी है, जो बड़े भाषा मॉडल (LLM) के विकास में विशेषज्ञता रखती है। अप्रैल 2023 में स्थापित, यह कंपनी तेजी से यूरोपीय और वैश्विक बाजारों में एक प्रमुख खिलाड़ी बन गई, और अमेरिकी तकनीकी दिग्गजों के स्वामित्व वाले मॉडलों के एक विकल्प के रूप में स्वयं को प्रस्तुत करती है।

Mistral AI के दृष्टिकोण की मुख्य विशेषता उच्च-प्रदर्शन वाले खुले भार (open-weight) मॉडल बनाने पर ध्यान केंद्रित करना है (मुख्यतः Apache 2.0 लाइसेंस के अंतर्गत), जो AI की अग्रणी तकनीकों तक पहुँच के लोकतंत्रीकरण में सहायक है। कंपनी अपनी वास्तुशिल्पीय नवाचारों के लिए जानी जाती है, जैसे **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** और **Sparse Mixture-of-Experts (MoE)**, जो उनके मॉडलों को अपेक्षाकृत छोटे आकार और कम कम्प्यूटेशनल लागत पर उच्च दक्षता प्राप्त करने में सक्षम बनाती हैं।

## इतिहास

Mistral AI की स्थापना अप्रैल 2023 में पेरिस में तीन फ्रांसीसी शोधकर्ताओं द्वारा की गई थी: **आर्थर मेंश** (Arthur Mensch), **गिओम लैम्पल** (Guillaume Lample) और **तिमोते लाक्रोआ** (Timothée Lacroix)। तीनों संस्थापक पहले विश्व की अग्रणी कंपनियों में बड़े भाषा मॉडलों पर काम कर चुके थे: मेंश Google DeepMind में शोधकर्ता थे, जबकि लैम्पल और लाक्रोआ Meta AI में LLM पर कार्यरत थे।

कंपनी का मिशन है — AI की अग्रणी उपलब्धियों को सभी के लिए सुलभ बनाना, खुलेपन, सहयोग और पारदर्शिता को बढ़ावा देते हुए। इस दृष्टिकोण ने Mistral AI को शीघ्र ही महत्वपूर्ण निवेश आकर्षित करने में सहायता की:

- **जून 2023:** seed राउंड में €105 मिलियन, जो यूरोप के लिए एक रिकॉर्ड था।
- **दिसंबर 2023:** Series A राउंड में €385 मिलियन, जिसके बाद कंपनी का मूल्यांकन \$2 बिलियन से अधिक हो गया और उसे 'यूनिकॉर्न' का दर्जा मिला।
- **फरवरी 2024:** Microsoft के साथ रणनीतिक साझेदारी की घोषणा, जिसमें \$16 मिलियन का निवेश और Azure क्लाउड पर Mistral मॉडलों की तैनाती शामिल थी।
- **जून 2024:** €600 मिलियन का नया वित्तपोषण राउंड, जिसके परिणामस्वरूप कंपनी का मूल्यांकन ~€5.8 बिलियन तक पहुँच गया, जिससे वह दुनिया के सबसे मूल्यवान AI स्टार्टअप्स में से एक बन गई।

## तकनीकी वास्तुकला की विशेषताएँ

Mistral AI के मॉडल transformer वास्तुकला पर आधारित हैं, लेकिन इनमें कई प्रमुख नवाचार शामिल हैं, जो दक्षता बढ़ाने और कम्प्यूटेशनल लागत को कम करने के उद्देश्य से किए गए हैं।

### सुधारों के साथ Transformer (Mistral 7B)

कंपनी का पहला मॉडल, **Mistral 7B**, दो महत्वपूर्ण वास्तुशिल्पीय सुधार प्रस्तुत करता है:

- **Sliding Window Attention (SWA)** (स्लाइडिंग विंडो अटेंशन): इसमें प्रत्येक token सभी पिछले token के साथ परस्पर क्रिया करने के बजाय (जो द्विघातीय जटिलता उत्पन्न करता है), SWA अटेंशन को एक निश्चित विंडो (जैसे, 4096 token) तक सीमित करता है। यह रैखिक कम्प्यूटेशनल जटिलता के साथ बहुत लंबे अनुक्रमों (32,000 token और उससे अधिक तक) को संसाधित करने की अनुमति देता है, जो प्रसंस्करण को काफी तेज कर देता है।
- **Grouped-Query Attention (GQA)** (समूहीकृत क्वेरी अटेंशन): यह standard multi-head attention तंत्र का एक अनुकूलन है। GQA, queries की तुलना में keys और values के लिए कम 'हेड्स' का उपयोग करता है (जैसे, 8:1 के अनुपात में), जो मेमोरी आवश्यकताओं को काफी कम करता है और गुणवत्ता में उल्लेखनीय हानि के बिना generation (inference) की प्रक्रिया को तेज करता है।

### Sparse Mixture-of-Experts (MoE)

**Mixtral** श्रृंखला के मॉडलों (जैसे, *Mixtral 8x7B*, *Mixtral 8x22B*) में **Sparse Mixture-of-Experts** (विरल विशेषज्ञों का मिश्रण) वास्तुकला का उपयोग किया जाता है। एकल घने Neural Network परत के बजाय, कई समानांतर 'विशेषज्ञ' उप-नेटवर्क का उपयोग होता है। प्रत्येक इनपुट token के लिए, एक विशेष gating परत (राउटर) सक्रियण के लिए विशेषज्ञों के एक छोटे उपसमुच्चय को गतिशील रूप से चुनता है (सामान्यतः 8 में से 2)।

इससे बड़ी कुल पैरामीटर संख्या वाले मॉडल बनाना संभव होता है (Mixtral 8x22B में 141 बिलियन हैं), लेकिन प्रत्येक token के प्रसंस्करण में केवल उनका एक छोटा हिस्सा (~39 बिलियन) सक्रिय होता है। परिणामस्वरूप, मॉडल बहुत बड़े 'घने' मॉडलों के तुलनीय गुणवत्ता प्राप्त करता है, लेकिन inference की गति और लागत काफी छोटे मॉडलों जैसी होती है।

### Mamba (SSM) वास्तुकला

2024 में, Mistral AI ने प्रायोगिक मॉडल **Codestral Mamba** प्रस्तुत किया, जो **Mamba (Selective State-Space Model)** वास्तुकला पर आधारित है। Transformer के विपरीत, Mamba एक पुनरावर्ती (recurrent) तंत्र का उपयोग करता है, जो state-space मॉडलों पर आधारित है। मुख्य लाभ:

- **रैखिक जटिलता** अनुक्रम की लंबाई के अनुसार, जो इसे लंबे संदर्भों पर अत्यंत तेज बनाती है।
- **सैद्धांतिक रूप से 'अनंत' संदर्भ**, जो केवल उपलब्ध मेमोरी द्वारा सीमित है।
- **उच्च inference गति** समकक्ष Transformer की तुलना में।

## कालक्रम और मॉडल

<table class="wikitable mw-collapsible">
<caption>Mistral AI के प्रमुख मॉडल रिलीज</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>माह / वर्ष</th>
<th>मॉडल</th>
<th>पैरामीटर (बिलियन)</th>
<th>मुख्य विशेषताएँ</th>
<th>लाइसेंस</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7.3</td>
<td>GQA + SWA वास्तुकला; 32k संदर्भ; सभी benchmark पर Llama 2 13B से बेहतर।</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46.7 (12.9 सक्रिय)</td>
<td>पहला खुला MoE मॉडल; GPT-3.5 के स्तर की गुणवत्ता।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>API के माध्यम से उपलब्ध 'लघु' और फ्लैगशिप मॉडल।</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 सक्रिय)</td>
<td>64k संदर्भ; जारी होने के समय open-source मॉडलों में SOTA गुणवत्ता।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>कोड जनरेशन के लिए विशेष मॉडल (80+ भाषाएँ)।</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>गणित और बहुभाषिकता के लिए विशेष मॉडल।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7.3</td>
<td>Mamba वास्तुकला पर कोड के लिए प्रायोगिक मॉडल; 256k+ संदर्भ।</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>पहला खुला मल्टीमोडल मॉडल (पाठ + चित्र)।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (अनुमान)</td>
<td>बेहतर reasoning के साथ अद्यतन फ्लैगशिप मॉडल।</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>कम विलंबता (150 token/सेकंड तक) के लिए अनुकूलित; 70B मॉडलों के स्तर की गुणवत्ता।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>128k संदर्भ के साथ अग्रणी मल्टीमोडल मॉडल (पाठ, चित्र)।</td>
<td>स्वामित्व</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>सॉफ्टवेयर के स्वायत्त विकास के लिए 'एजेंटिक' मॉडल; SWE-Bench पर 46.8%।</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

Mistral AI के प्रमुख मॉडल रिलीज

## प्रतिस्पर्धियों से तुलना

- **Llama (Meta) के साथ:** Mistral के मॉडल समान या उससे भी बड़े आकार के Llama मॉडलों से लगातार बेहतर प्रदर्शन करते हैं। Mistral 7B ने Llama 2 13B को पीछे छोड़ा, और Mixtral 8x7B ने Llama 2 70B को। मुख्य अंतर लाइसेंस में है: Mistral पूरी तरह अनुमत Apache 2.0 का उपयोग करता है, जबकि Llama के लाइसेंस में प्रतिबंध हैं।
- **GPT (OpenAI) के साथ:** OpenAI के फ्लैगशिप मॉडल (GPT-4) सबसे कठिन कार्यों में अग्रणी बने हुए हैं, हालाँकि Mistral के खुले मॉडल (जैसे, Mixtral 8x7B) GPT-3.5 के तुलनीय गुणवत्ता प्रदर्शित करते हैं। Mistral एक खुला विकल्प प्रदान करता है, जो मॉडलों को स्थानीय रूप से तैनात करने और उन पर पूर्ण नियंत्रण रखने की अनुमति देता है।
- **Claude (Anthropic) के साथ:** Claude के मॉडल बड़े संदर्भ विंडो और सुरक्षा पर केंद्रित होने के लिए जाने जाते हैं। Mistral ने तुलनीय या बड़े संदर्भ वाले खुले मॉडल प्रस्तुत किए हैं। मानक benchmark (LMSys Arena) पर प्रदर्शन में Medium 3 मॉडल ने Claude 3 Opus को पीछे छोड़ा।

## उपयोग और पारिस्थितिकी तंत्र

### उत्पाद

- **Le Chat:** सार्वजनिक चैट-असिस्टेंट (वेब, iOS/Android), जो Mistral मॉडलों की क्षमताओं का प्रदर्शन करता है, जिसमें वेब खोज और चित्र जनरेशन शामिल हैं।
- **La Plateforme:** कॉर्पोरेट प्लेटफ़ॉर्म जो सभी Mistral मॉडलों तक API के माध्यम से पहुँच प्रदान करता है, जिससे कंपनियाँ LLM को अपने उत्पादों में एकीकृत कर सकती हैं।

### कॉर्पोरेट ग्राहक

Mistral की तकनीकों का उपयोग प्रमुख कंपनियाँ करती हैं, जैसे **BNP Paribas** (वित्त), **CMA CGM** (लॉजिस्टिक्स), **Zalando** (e-commerce) और सरकारी एजेंसी **France Travail**। यूरोपीय ग्राहकों के लिए GDPR अनुपालन हेतु मॉडलों की स्थानीय तैनाती का विकल्प महत्वपूर्ण है।

### Open-Source समुदाय

खुले लाइसेंस के कारण, Mistral के मॉडल Hugging Face जैसे प्लेटफार्मों पर हजारों परियोजनाओं का आधार बन गए हैं। समुदाय सक्रिय रूप से विशेष कार्यों के लिए मॉडलों को fine-tune करता है, जीव विज्ञान (BioMistral), कानून (SaulLM-7B) और विभिन्न भाषाओं में स्थानीयकरण (जैसे, Polish Bielik 7B) के लिए संस्करण बनाता है।

## लाइसेंसिंग

| मॉडल श्रृंखला                                               | लाइसेंस                      | प्रतिबंध                                   |
|----------------------------------------------------------|----------------------------|------------------------------------------|
| आधार, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                 | निःशुल्क वाणिज्यिक उपयोग।                   |
| Codestral 22B                                            | Non-Production License     | अलग समझौते के बिना वाणिज्यिक उपयोग वर्जित है। |
| Large श्रृंखला, Medium श्रृंखला                                | Mistral Research / स्वामित्व | केवल क्लाउड API के माध्यम से पहुँच।             |

## संदर्भ

- Mistral AI का आधिकारिक दस्तावेज़ीकरण
- Hugging Face पर Mistral AI की प्रोफ़ाइल

## साहित्य

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
