---
title: "Mistral AI (BN)"
source: "https://systems-analysis.info/int/Mistral_AI_(BN)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4393
wiki_created_at: 2026-09-06T23:34:33Z
wiki_modified_at: 2026-09-06T23:34:33Z
downloaded_at: 2026-09-07T23:02:25Z
---

# Mistral AI (BN)

**Mistral AI** — ফ্রান্সের একটি কৃত্রিম বুদ্ধিমত্তা কোম্পানি, যা বৃহৎ ভাষা মডেল (LLM) তৈরিতে বিশেষজ্ঞ। ২০২৩ সালের এপ্রিল মাসে প্রতিষ্ঠিত এই কোম্পানি দ্রুতই ইউরোপীয় ও বৈশ্বিক বাজারে একটি গুরুত্বপূর্ণ খেলোয়াড় হিসেবে আবির্ভূত হয়েছে এবং নিজেকে আমেরিকান প্রযুক্তি জায়ান্টদের মালিকানাধীন মডেলগুলোর বিকল্প হিসেবে উপস্থাপন করছে।

Mistral AI-এর পদ্ধতির মূল বৈশিষ্ট্য হলো উন্মুক্ত ওজনসহ (প্রধানত Apache 2.0 লাইসেন্সের অধীনে) উচ্চ-কার্যক্ষম মডেল তৈরিতে মনোযোগ, যা অত্যাধুনিক AI প্রযুক্তিতে গণতান্ত্রিক প্রবেশাধিকার নিশ্চিত করে। কোম্পানিটি তার স্থাপত্যগত উদ্ভাবনের জন্য পরিচিত, যেমন **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** এবং **Sparse Mixture-of-Experts (MoE)**, যা তাদের মডেলগুলোকে তুলনামূলকভাবে ছোট আকার ও কম গণনামূলক ব্যয়ে উচ্চ দক্ষতা অর্জন করতে সক্ষম করে।

## ইতিহাস

Mistral AI কোম্পানিটি ২০২৩ সালের এপ্রিল মাসে প্যারিসে তিনজন ফরাসি গবেষক দ্বারা প্রতিষ্ঠিত হয়: **আর্থার মঁশ** (Arthur Mensch), **গিয়োম লাম্পল** (Guillaume Lample) এবং **তিমোতে লাক্রোয়া** (Timothée Lacroix)। তিনজন প্রতিষ্ঠাতাই এর আগে বিশ্বের শীর্ষস্থানীয় কোম্পানিগুলোতে বৃহৎ ভাষা মডেল নিয়ে কাজ করেছেন: মঁশ Google DeepMind-এ গবেষক ছিলেন, আর লাম্পল ও লাক্রোয়া Meta AI-তে LLM নিয়ে কাজ করতেন।

কোম্পানির লক্ষ্য হলো উন্মুক্ততা, সহযোগিতা ও স্বচ্ছতার প্রসারের মাধ্যমে AI-এর অত্যাধুনিক অর্জনগুলো সকলের কাছে সহজলভ্য করা। এই দৃষ্টিভঙ্গি Mistral AI-কে দ্রুত উল্লেখযোগ্য বিনিয়োগ আকর্ষণ করতে সহায়তা করেছে:

- **জুন ২০২৩:** Seed রাউন্ডে €১০৫ মিলিয়ন, যা ইউরোপের জন্য একটি রেকর্ড।
- **ডিসেম্বর ২০২৩:** Series A রাউন্ডে €৩৮৫ মিলিয়ন, যার পর কোম্পানির মূল্যায়ন \$২ বিলিয়ন ছাড়িয়ে যায় এবং এটি "ইউনিকর্ন" মর্যাদা লাভ করে।
- **ফেব্রুয়ারি ২০২৪:** Microsoft-এর সাথে কৌশলগত অংশীদারিত্বের ঘোষণা, যাতে \$১৬ মিলিয়ন বিনিয়োগ এবং Azure ক্লাউডে Mistral মডেল স্থাপন অন্তর্ভুক্ত ছিল।
- **জুন ২০২৪:** €৬০০ মিলিয়নের নতুন অর্থায়ন রাউন্ড, যার ফলে কোম্পানির মূল্যায়ন ~€৫.৮ বিলিয়নে পৌঁছায় এবং এটি বিশ্বের সবচেয়ে মূল্যবান AI স্টার্টআপগুলোর একটি হয়ে ওঠে।

## স্থাপত্যের প্রযুক্তিগত বৈশিষ্ট্য

Mistral AI-এর মডেলগুলো transformer স্থাপত্যের উপর ভিত্তি করে তৈরি, তবে কার্যকারিতা বৃদ্ধি ও গণনামূলক ব্যয় কমাতে বেশ কিছু গুরুত্বপূর্ণ উদ্ভাবন অন্তর্ভুক্ত করা হয়েছে।

### উন্নত Transformer (Mistral 7B)

কোম্পানির প্রথম মডেল, **Mistral 7B**, দুটি গুরুত্বপূর্ণ স্থাপত্যগত উন্নতি উপস্থাপন করেছিল:

- **Sliding Window Attention (SWA)** (স্লাইডিং উইন্ডো attention): প্রতিটি token যাতে সমস্ত পূর্ববর্তী token-এর সাথে মিথস্ক্রিয়া করে (যা দ্বিঘাত জটিলতা তৈরি করে) সেই পরিবর্তে SWA attention-কে একটি নির্দিষ্ট উইন্ডোতে (যেমন ৪০৯৬ token) সীমাবদ্ধ করে। এটি রৈখিক গণনামূলক জটিলতায় অত্যন্ত দীর্ঘ ক্রম (৩২,০০০ token বা তার বেশি পর্যন্ত) প্রক্রিয়া করা সম্ভব করে, প্রক্রিয়াকরণকে উল্লেখযোগ্যভাবে ত্বরান্বিত করে।
- **Grouped-Query Attention (GQA)** (গ্রুপভিত্তিক query attention): আদর্শ multi-head attention প্রক্রিয়ার অপ্টিমাইজেশন। GQA query-এর তুলনায় key ও value-এর জন্য কম সংখ্যক "হেড" ব্যবহার করে (যেমন ৮:১ অনুপাতে), যা মেমোরির চাহিদা উল্লেখযোগ্যভাবে কমায় এবং গুণমানের উল্লেখযোগ্য ক্ষতি ছাড়াই generation (inference) প্রক্রিয়াকে ত্বরান্বিত করে।

### Sparse Mixture-of-Experts (MoE)

**Mixtral** সিরিজের মডেলগুলোতে (যেমন *Mixtral 8x7B*, *Mixtral 8x22B*) **Sparse Mixture-of-Experts** (বিরল বিশেষজ্ঞদের মিশ্রণ) স্থাপত্য ব্যবহার করা হয়। একটি ঘন নিউরাল নেটওয়ার্ক স্তরের পরিবর্তে বেশ কিছু সমান্তরাল "বিশেষজ্ঞ" সাব-নেটওয়ার্ক ব্যবহার করা হয়। প্রতিটি ইনপুট token-এর জন্য একটি বিশেষ *gating* স্তর (রাউটার) গতিশীলভাবে সক্রিয় করার জন্য বিশেষজ্ঞদের একটি ছোট উপসেট নির্বাচন করে (সাধারণত ৮ জনের মধ্যে ২ জন)।

এটি বিপুল মোট প্যারামিটারসংখ্যা সম্পন্ন মডেল তৈরি করা সম্ভব করে (Mixtral 8x22B-এর ১৪১ বিলিয়ন প্যারামিটার রয়েছে), কিন্তু প্রতিটি token প্রক্রিয়া করার সময় তাদের মাত্র একটি অংশ (~৩৯ বিলিয়ন) ব্যবহৃত হয়। ফলে মডেলটি অনেক বড় "ঘন" মডেলের সাথে তুলনীয় গুণমান অর্জন করে, কিন্তু অনেক ছোট মডেলের মতো inference গতি ও ব্যয়ে।

### Mamba (SSM) স্থাপত্য

২০২৪ সালে Mistral AI একটি পরীক্ষামূলক মডেল **Codestral Mamba** উপস্থাপন করে, যা **Mamba (Selective State-Space Model)** স্থাপত্যের উপর ভিত্তি করে তৈরি। transformer-এর বিপরীতে, Mamba স্টেট স্পেস মডেলের উপর ভিত্তি করে একটি পুনরাবৃত্তিমূলক প্রক্রিয়া ব্যবহার করে। মূল সুবিধাগুলো হলো:

- **রৈখিক জটিলতা** ক্রমের দৈর্ঘ্যের সাপেক্ষে, যা এটিকে দীর্ঘ context-এ অত্যন্ত দ্রুত করে তোলে।
- **তাত্ত্বিকভাবে "অসীম" context**, যা কেবল উপলব্ধ মেমোরি দ্বারা সীমাবদ্ধ।
- সমতুল্য transformer-এর তুলনায় **উচ্চ inference গতি**।

## সময়রেখা এবং মডেলসমূহ

<table class="wikitable mw-collapsible">
<caption>Mistral AI-এর প্রধান মডেল রিলিজ</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>মাস / বছর</th>
<th>মডেল</th>
<th>প্যারামিটার (বিলিয়ন)</th>
<th>মূল বৈশিষ্ট্য</th>
<th>লাইসেন্স</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>০৯ / ২০২৩</td>
<td><strong>Mistral 7B</strong></td>
<td>৭.৩</td>
<td>GQA + SWA স্থাপত্য; ৩২k context; সমস্ত benchmark-এ Llama 2 13B-কে ছাড়িয়ে গেছে।</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>১২ / ২০২৩</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>৪৬.৭ (১২.৯ সক্রিয়)</td>
<td>প্রথম উন্মুক্ত MoE মডেল; GPT-3.5 সমমানের গুণমান।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>০২ / ২০২৪</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>API-এর মাধ্যমে উপলব্ধ "ছোট" ও ফ্ল্যাগশিপ মডেল।</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>০৪ / ২০২৪</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>১৪১ (৩৯ সক্রিয়)</td>
<td>৬৪k context; প্রকাশের সময় open-source মডেলগুলোর মধ্যে SOTA মানের।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>০৫ / ২০২৪</td>
<td><strong>Codestral 22B</strong></td>
<td>২২</td>
<td>কোড তৈরির জন্য বিশেষায়িত মডেল (৮০+ ভাষা)।</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>০৭ / ২০২৪</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>৭ / ১২</td>
<td>গণিত ও বহুভাষিকতার জন্য বিশেষায়িত মডেল।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>০৭ / ২০২৪</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>৭.৩</td>
<td>Mamba স্থাপত্যে কোডের জন্য পরীক্ষামূলক মডেল; ২৫৬k+ context।</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>০৯ / ২০২৪</td>
<td><strong>Pixtral 12B</strong></td>
<td>১২</td>
<td>প্রথম উন্মুক্ত মাল্টিমোডাল মডেল (টেক্সট + ছবি)।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>১১ / ২০২৪</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~১০০+ (আনুমানিক)</td>
<td>উন্নত reasoning সহ আপডেট করা ফ্ল্যাগশিপ মডেল।</td>
<td>Research</td>
</tr>
<tr class="even">
<td>০১ / ২০২৫</td>
<td><strong>Mistral Small 3</strong></td>
<td>২৪</td>
<td>কম বিলম্বের জন্য অপ্টিমাইজড (প্রতি সেকেন্ডে ১৫০ token পর্যন্ত); ৭০B মডেলের সমমানের গুণমান।</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>০৫ / ২০২৫</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>১২৮k context সহ ফ্রন্টিয়ার মাল্টিমোডাল মডেল (টেক্সট, ছবি)।</td>
<td>মালিকানাধীন</td>
</tr>
<tr class="even">
<td>০৫ / ২০২৫</td>
<td><strong>Devstral 24B</strong></td>
<td>২৪</td>
<td>সফটওয়্যারের স্বায়ত্তশাসিত উন্নয়নের জন্য "এজেন্টিক" মডেল; SWE-Bench-এ ৪৬.৮%।</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

Mistral AI-এর প্রধান মডেল রিলিজ

## প্রতিযোগীদের সাথে তুলনা

- **বনাম Llama (Meta):** Mistral মডেলগুলো ধারাবাহিকভাবে একই বা এমনকি বড় আকারের Llama মডেলগুলোকে ছাড়িয়ে যায়। Mistral 7B, Llama 2 13B-কে এবং Mixtral 8x7B, Llama 2 70B-কে ছাড়িয়ে গেছে। মূল পার্থক্য হলো লাইসেন্স: Mistral সম্পূর্ণ অনুমোদনমূলক Apache 2.0 ব্যবহার করে, যেখানে Llama লাইসেন্সে বিধিনিষেধ রয়েছে।
- **বনাম GPT (OpenAI):** OpenAI-এর ফ্ল্যাগশিপ মডেলগুলো (GPT-4) সবচেয়ে জটিল কাজে নেতৃত্ব বজায় রাখে, তবে Mistral-এর উন্মুক্ত মডেলগুলো (যেমন Mixtral 8x7B) GPT-3.5-এর সাথে তুলনীয় গুণমান প্রদর্শন করে। Mistral একটি উন্মুক্ত বিকল্প প্রদান করে, যা মডেলগুলো স্থানীয়ভাবে স্থাপন ও সম্পূর্ণ নিয়ন্ত্রণের সুযোগ দেয়।
- **বনাম Claude (Anthropic):** Claude মডেলগুলো বড় context উইন্ডো ও নিরাপত্তা-অভিমুখিতার জন্য পরিচিত। Mistral তুলনীয় বা বড় context সহ উন্মুক্ত মডেল অফার করেছে। আদর্শ benchmark-এ (LMSys Arena) কর্মক্ষমতার দিক থেকে Medium 3 মডেলটি Claude 3 Opus-কে ছাড়িয়ে গেছে।

## প্রয়োগ ও ইকোসিস্টেম

### পণ্যসমূহ

- **Le Chat:** পাবলিক চ্যাট-অ্যাসিস্ট্যান্ট (ওয়েব, iOS/Android), যা ওয়েব অনুসন্ধান ও ছবি তৈরিসহ Mistral মডেলের সক্ষমতা প্রদর্শন করে।
- **La Plateforme:** সমস্ত Mistral মডেলে API অ্যাক্সেস সহ কর্পোরেট প্ল্যাটফর্ম, যা কোম্পানিগুলোকে তাদের পণ্যে LLM সংযুক্ত করতে সক্ষম করে।

### কর্পোরেট ক্লায়েন্ট

Mistral-এর প্রযুক্তি বড় কোম্পানিগুলো যেমন **BNP Paribas** (অর্থায়ন), **CMA CGM** (লজিস্টিক্স), **Zalando** (ই-কমার্স) এবং সরকারি সংস্থা **France Travail** ব্যবহার করছে। ইউরোপীয় ক্লায়েন্টদের জন্য GDPR মেনে চলতে মডেলের স্থানীয় স্থাপনার সুবিধা গুরুত্বপূর্ণ।

### Open-Source সম্প্রদায়

উন্মুক্ত লাইসেন্সের কারণে, Mistral মডেলগুলো Hugging Face-এর মতো প্ল্যাটফর্মে হাজার হাজার প্রকল্পের ভিত্তি হয়ে উঠেছে। সম্প্রদায় সক্রিয়ভাবে বিশেষায়িত কাজের জন্য মডেলগুলো fine-tune করছে, জীববিজ্ঞান (BioMistral), আইনশাস্ত্র (SaulLM-7B) এবং বিভিন্ন ভাষায় স্থানীয়করণের সংস্করণ তৈরি করছে (যেমন Polish Bielik 7B)।

## লাইসেন্সিং

| মডেল সিরিজ                                                | লাইসেন্স                        | বিধিনিষেধ                             |
|-----------------------------------------------------------|--------------------------------|---------------------------------------|
| বেসিক, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                     | বিনামূল্যে বাণিজ্যিক ব্যবহার।             |
| Codestral 22B                                             | Non-Production License         | পৃথক চুক্তি ছাড়া বাণিজ্যিক ব্যবহার নিষিদ্ধ। |
| Large সিরিজ, Medium সিরিজ                                 | Mistral Research / মালিকানাধীন | শুধুমাত্র ক্লাউড API-এর মাধ্যমে অ্যাক্সেস।   |

## সূত্র

- Mistral AI-এর অফিশিয়াল ডকুমেন্টেশন
- Hugging Face-এ Mistral AI-এর প্রোফাইল

## সাহিত্য

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
