Mistral AI (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Mistral AI — ایک فرانسیسی مصنوعی ذہانت کمپنی ہے جو بڑے لسانی ماڈلز (LLM) کی تیاری میں مہارت رکھتی ہے۔ اپریل 2023 میں قائم کی گئی، یہ کمپنی تیزی سے یورپی اور عالمی بازاروں میں ایک اہم کھلاڑی بن گئی، اور خود کو امریکی ٹیکنالوجی دیوؤں کے ملکیتی ماڈلز کے متبادل کے طور پر پیش کرتی ہے۔

Mistral AI کے طریقۂ کار کی ایک اہم خصوصیت یہ ہے کہ یہ کھلے weights کے ساتھ اعلیٰ کارکردگی کے ماڈلز بنانے پر توجہ دیتی ہے (زیادہ تر Apache 2.0 لائسنس کے تحت)، جو AI کی جدید ٹیکنالوجیز تک رسائی کو جمہوری بناتا ہے۔ کمپنی اپنی آرکیٹیکچرل اختراعات کے لیے مشہور ہے، جیسے Grouped-Query Attention (GQA)، Sliding Window Attention (SWA) اور Sparse Mixture-of-Experts (MoE)، جو ان کے ماڈلز کو نسبتاً چھوٹے حجم اور کم حسابی لاگت کے ساتھ اعلیٰ کارکردگی حاصل کرنے کے قابل بناتے ہیں۔

تاریخ

Mistral AI کمپنی اپریل 2023 میں پیرس میں تین فرانسیسی محققین نے قائم کی: آرتھر مانش (Arthur Mensch)، گیوم لامپل (Guillaume Lample) اور تیموتے لاکروا (Timothée Lacroix)۔ تینوں بانیوں نے پہلے دنیا کی معروف کمپنیوں میں بڑے لسانی ماڈلز پر کام کیا تھا: مانش Google DeepMind میں محقق تھے، جبکہ لامپل اور لاکروا Meta AI میں LLM پر کام کرتے تھے۔

کمپنی کا مشن AI کی جدید ترقیات کو سب کے لیے قابلِ رسائی بنانا ہے، کھلے پن، تعاون اور شفافیت کو فروغ دے کر۔ اس نقطۂ نظر نے Mistral AI کو تیزی سے خاطر خواہ سرمایہ کاری اپنی طرف کھینچنے میں مدد دی:

  • جون 2023: seed-راؤنڈ میں €105 ملین، جو یورپ کے لیے ریکارڈ بن گیا۔
  • دسمبر 2023: Series A راؤنڈ میں €385 ملین، جس کے بعد کمپنی کی مالیت $2 ارب سے تجاوز کر گئی اور اسے «یونیکورن» کا درجہ ملا۔
  • فروری 2024: Microsoft کے ساتھ ایک اسٹریٹجک شراکت داری کا اعلان کیا گیا، جس میں $16 ملین کی سرمایہ کاری اور Azure کلاؤڈ پر Mistral ماڈلز کی میزبانی شامل تھی۔
  • جون 2024: €600 ملین کا نیا فنانسنگ راؤنڈ، جس کے نتیجے میں کمپنی کی مالیت ~€5.8 ارب تک پہنچ گئی، جس سے یہ دنیا کے مہنگے ترین AI اسٹارٹ اپس میں سے ایک بن گئی۔

آرکیٹیکچر کی تکنیکی خصوصیات

Mistral AI کے ماڈلز transformer آرکیٹیکچر پر مبنی ہیں، لیکن ان میں کئی اہم اختراعات شامل ہیں جن کا مقصد کارکردگی کو بڑھانا اور حسابی لاگت کو کم کرنا ہے۔

بہتریوں کے ساتھ Transformer (Mistral 7B)

کمپنی کے پہلے ماڈل، Mistral 7B، نے دو اہم آرکیٹیکچرل بہتریاں متعارف کرائیں:

  • Sliding Window Attention (SWA) (سرکتی ونڈو کے ساتھ attention): اس کے بجائے کہ ہر token تمام پچھلے tokens کے ساتھ تعامل کرے (جس کی پیچیدگی مربعی ہوتی ہے)، SWA attention کو ایک مقررہ ونڈو تک محدود کرتا ہے (مثلاً 4096 tokens)۔ یہ بہت لمبی ترتیبوں (32,000 tokens اور اس سے زیادہ تک) کو خطی حسابی پیچیدگی کے ساتھ پروسیس کرنے کی اجازت دیتا ہے، جو پروسیسنگ کو نمایاں طور پر تیز کرتا ہے۔
  • Grouped-Query Attention (GQA) (گروہ بندی شدہ query attention): معیاری multi-head attention میکانزم کی اصلاح۔ GQA keys اور values کے لیے queries کے مقابلے میں کم «heads» استعمال کرتا ہے (مثلاً 8:1 کے تناسب میں)، جو میموری کی ضروریات کو نمایاں طور پر کم کرتا ہے اور معیار میں خاطر خواہ کمی کے بغیر generation (inference) کے عمل کو تیز کرتا ہے۔

Sparse Mixture-of-Experts (MoE)

Mixtral سیریز کے ماڈلز میں (مثلاً Mixtral 8x7B، Mixtral 8x22B) Sparse Mixture-of-Experts (بکھری ہوئی ماہرین کی آمیزش) آرکیٹیکچر استعمال کی جاتی ہے۔ نیورل نیٹ ورک کی ایک گھنی پرت کے بجائے، کئی متوازی «ماہر» ذیلی نیٹ ورکس استعمال کیے جاتے ہیں۔ ہر input token کے لیے، ایک خصوصی gating-پرت (راؤٹر) متحرک طور پر ماہرین کے ایک چھوٹے ذیلی مجموعے کو فعال کرنے کے لیے منتخب کرتی ہے (عموماً 8 میں سے 2)۔

یہ بہت زیادہ کل پیرامیٹرز والے ماڈلز بنانے کی اجازت دیتا ہے (Mixtral 8x22B میں 141 ارب ہیں)، لیکن ہر token کی پروسیسنگ میں ان کا صرف ایک چھوٹا حصہ (~39 ارب) استعمال ہوتا ہے۔ نتیجتاً ماڈل بہت بڑے «گھنے» ماڈلز سے موازنہ کے قابل معیار حاصل کرتا ہے، لیکن inference کی رفتار اور لاگت نمایاں طور پر چھوٹے ماڈلز جیسی ہوتی ہے۔

Mamba آرکیٹیکچر (SSM)

2024 میں Mistral AI نے ایک تجرباتی ماڈل Codestral Mamba متعارف کرایا، جو Mamba (Selective State-Space Model) آرکیٹیکچر پر مبنی ہے۔ Transformers کے برعکس، Mamba ایک بازگشتی میکانزم استعمال کرتا ہے جو state-space ماڈلز پر مبنی ہے۔ اہم فوائد:

  • خطی پیچیدگی ترتیب کی لمبائی کے حساب سے، جو اسے لمبے contexts پر انتہائی تیز بناتی ہے۔
  • نظری طور پر «لامحدود» context، جو صرف دستیاب میموری تک محدود ہے۔
  • اعلیٰ inference رفتار مساوی transformers کے مقابلے میں۔

زمانی ترتیب اور ماڈلز

Mistral AI کے اہم ماڈل ریلیز
ماہ / سال ماڈل پیرامیٹرز (ارب) اہم خصوصیات لائسنس
09 / 2023 Mistral 7B 7.3 GQA + SWA آرکیٹیکچر؛ 32k context؛ تمام benchmarks پر Llama 2 13B سے بہتر۔ Apache 2.0
12 / 2023 Mixtral 8x7B 46.7 (12.9 فعال) پہلا کھلا MoE ماڈل؛ GPT-3.5 کے برابر معیار۔ Apache 2.0
02 / 2024 Mistral Small / Large ? «چھوٹا» اور فلیگ شپ ماڈل، API کے ذریعے دستیاب۔ Small: Apache 2.0,
Large: Research
04 / 2024 Mixtral 8x22B 141 (39 فعال) 64k context؛ اجراء کے وقت open-source ماڈلز میں SOTA معیار۔ Apache 2.0
05 / 2024 Codestral 22B 22 کوڈ جنریشن کے لیے خصوصی ماڈل (80+ زبانیں)۔ Non-Production
07 / 2024 Mathstral 7B / Nemo 12B 7 / 12 ریاضی اور کثیر لسانیت کے لیے خصوصی ماڈلز۔ Apache 2.0
07 / 2024 Codestral Mamba 7.3B 7.3 Mamba آرکیٹیکچر پر کوڈ کے لیے تجرباتی ماڈل؛ 256k+ context۔ Apache 2.0
09 / 2024 Pixtral 12B 12 پہلا کھلا ملٹی موڈل ماڈل (متن + تصاویر)۔ Apache 2.0
11 / 2024 Mistral Large 24.11 ~100+ (تخمینہ) بہتر reasoning کے ساتھ اپ ڈیٹ شدہ فلیگ شپ ماڈل۔ Research
01 / 2025 Mistral Small 3 24 کم تاخیر کے لیے بہینہ (150 tokens/s تک)؛ 70B ماڈلز کے برابر معیار۔ Apache 2.0
05 / 2025 Mistral Medium 3 ? 128k context کے ساتھ سرحدی ملٹی موڈل ماڈل (متن، تصاویر)۔ ملکیتی
05 / 2025 Devstral 24B 24 سافٹ ویئر کی خودمختار ترقی کے لیے «ایجنٹی» ماڈل؛ SWE-Bench پر 46.8%۔ Apache 2.0

حریفوں سے موازنہ

  • بمقابلہ Llama (Meta): Mistral کے ماڈلز مستقل طور پر Llama کے ہم پایہ یا بڑے ماڈلز سے بہتر کارکردگی دکھاتے ہیں۔ Mistral 7B نے Llama 2 13B کو پیچھے چھوڑ دیا، اور Mixtral 8x7B نے Llama 2 70B کو۔ اہم فرق لائسنس کا ہے: Mistral مکمل طور پر اجازتی Apache 2.0 استعمال کرتا ہے، جبکہ Llama لائسنس میں پابندیاں ہیں۔
  • بمقابلہ GPT (OpenAI): OpenAI کے فلیگ شپ ماڈلز (GPT-4) سب سے پیچیدہ کاموں میں سرفہرست رہتے ہیں، تاہم Mistral کے کھلے ماڈلز (مثلاً Mixtral 8x7B) GPT-3.5 سے موازنہ کے قابل معیار ظاہر کرتے ہیں۔ Mistral ایک کھلا متبادل فراہم کرتا ہے، جو ماڈلز کو مقامی طور پر deploy کرنے اور انہیں مکمل طور پر کنٹرول کرنے کی اجازت دیتا ہے۔
  • بمقابلہ Claude (Anthropic): Claude ماڈلز بڑے context ونڈو اور حفاظت پر توجہ کے لیے مشہور ہیں۔ Mistral نے موازنہ کے قابل یا بڑے context والے کھلے ماڈلز پیش کیے۔ معیاری benchmarks (LMSys Arena) پر کارکردگی کے لحاظ سے Medium 3 ماڈل نے Claude 3 Opus کو پیچھے چھوڑ دیا۔

استعمال اور ماحولیاتی نظام

مصنوعات

  • Le Chat: عوامی chat-assistant (ویب، iOS/Android)، جو Mistral ماڈلز کی صلاحیتوں کو ظاہر کرتا ہے، بشمول ویب تلاش اور تصویر جنریشن۔
  • La Plateforme: تمام Mistral ماڈلز تک API رسائی کے ساتھ کارپوریٹ پلیٹ فارم، جو کمپنیوں کو LLM کو اپنی مصنوعات میں ضم کرنے کی اجازت دیتا ہے۔

کارپوریٹ صارفین

Mistral کی ٹیکنالوجیز بڑی کمپنیاں استعمال کرتی ہیں، جیسے BNP Paribas (مالیات)، CMA CGM (لاجسٹکس)، Zalando (e-commerce) اور سرکاری ایجنسی France Travail۔ یورپی صارفین کے لیے GDPR کی تعمیل کے لیے ماڈلز کی مقامی deployment کا امکان اہم ہے۔

Open-Source کمیونٹی

کھلے لائسنس کی بدولت Mistral کے ماڈلز Hugging Face جیسے پلیٹ فارمز پر ہزاروں منصوبوں کی بنیاد بن گئے ہیں۔ کمیونٹی سرگرمی سے ماڈلز کو خصوصی کاموں کے لیے fine-tune کرتی ہے، حیاتیات (BioMistral)، قانون (SaulLM-7B) اور مختلف زبانوں میں مقامی کاری (مثلاً Polish Bielik 7B) کے لیے ورژن بناتی ہے۔

لائسنسنگ

ماڈل سیریز لائسنس پابندیاں
بنیادی، Small، Mixtral، Mathstral، Nemo، Pixtral، Devstral Apache 2.0 آزاد تجارتی استعمال۔
Codestral 22B Non-Production License علیحدہ معاہدے کے بغیر تجارتی استعمال ممنوع ہے۔
Large-سیریز، Medium-سیریز Mistral Research / ملکیتی صرف کلاؤڈ API کے ذریعے رسائی۔

روابط

  • Mistral AI کی سرکاری دستاویزات
  • Hugging Face پر Mistral AI کا پروفائل

کتابیات

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
  • Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.