Mistral AI (BN)
Mistral AI — ফ্রান্সের একটি কৃত্রিম বুদ্ধিমত্তা কোম্পানি, যা বৃহৎ ভাষা মডেল (LLM) তৈরিতে বিশেষজ্ঞ। ২০২৩ সালের এপ্রিল মাসে প্রতিষ্ঠিত এই কোম্পানি দ্রুতই ইউরোপীয় ও বৈশ্বিক বাজারে একটি গুরুত্বপূর্ণ খেলোয়াড় হিসেবে আবির্ভূত হয়েছে এবং নিজেকে আমেরিকান প্রযুক্তি জায়ান্টদের মালিকানাধীন মডেলগুলোর বিকল্প হিসেবে উপস্থাপন করছে।
Mistral AI-এর পদ্ধতির মূল বৈশিষ্ট্য হলো উন্মুক্ত ওজনসহ (প্রধানত Apache 2.0 লাইসেন্সের অধীনে) উচ্চ-কার্যক্ষম মডেল তৈরিতে মনোযোগ, যা অত্যাধুনিক AI প্রযুক্তিতে গণতান্ত্রিক প্রবেশাধিকার নিশ্চিত করে। কোম্পানিটি তার স্থাপত্যগত উদ্ভাবনের জন্য পরিচিত, যেমন Grouped-Query Attention (GQA), Sliding Window Attention (SWA) এবং Sparse Mixture-of-Experts (MoE), যা তাদের মডেলগুলোকে তুলনামূলকভাবে ছোট আকার ও কম গণনামূলক ব্যয়ে উচ্চ দক্ষতা অর্জন করতে সক্ষম করে।
ইতিহাস
Mistral AI কোম্পানিটি ২০২৩ সালের এপ্রিল মাসে প্যারিসে তিনজন ফরাসি গবেষক দ্বারা প্রতিষ্ঠিত হয়: আর্থার মঁশ (Arthur Mensch), গিয়োম লাম্পল (Guillaume Lample) এবং তিমোতে লাক্রোয়া (Timothée Lacroix)। তিনজন প্রতিষ্ঠাতাই এর আগে বিশ্বের শীর্ষস্থানীয় কোম্পানিগুলোতে বৃহৎ ভাষা মডেল নিয়ে কাজ করেছেন: মঁশ Google DeepMind-এ গবেষক ছিলেন, আর লাম্পল ও লাক্রোয়া Meta AI-তে LLM নিয়ে কাজ করতেন।
কোম্পানির লক্ষ্য হলো উন্মুক্ততা, সহযোগিতা ও স্বচ্ছতার প্রসারের মাধ্যমে AI-এর অত্যাধুনিক অর্জনগুলো সকলের কাছে সহজলভ্য করা। এই দৃষ্টিভঙ্গি Mistral AI-কে দ্রুত উল্লেখযোগ্য বিনিয়োগ আকর্ষণ করতে সহায়তা করেছে:
- জুন ২০২৩: Seed রাউন্ডে €১০৫ মিলিয়ন, যা ইউরোপের জন্য একটি রেকর্ড।
- ডিসেম্বর ২০২৩: Series A রাউন্ডে €৩৮৫ মিলিয়ন, যার পর কোম্পানির মূল্যায়ন $২ বিলিয়ন ছাড়িয়ে যায় এবং এটি "ইউনিকর্ন" মর্যাদা লাভ করে।
- ফেব্রুয়ারি ২০২৪: Microsoft-এর সাথে কৌশলগত অংশীদারিত্বের ঘোষণা, যাতে $১৬ মিলিয়ন বিনিয়োগ এবং Azure ক্লাউডে Mistral মডেল স্থাপন অন্তর্ভুক্ত ছিল।
- জুন ২০২৪: €৬০০ মিলিয়নের নতুন অর্থায়ন রাউন্ড, যার ফলে কোম্পানির মূল্যায়ন ~€৫.৮ বিলিয়নে পৌঁছায় এবং এটি বিশ্বের সবচেয়ে মূল্যবান AI স্টার্টআপগুলোর একটি হয়ে ওঠে।
স্থাপত্যের প্রযুক্তিগত বৈশিষ্ট্য
Mistral AI-এর মডেলগুলো transformer স্থাপত্যের উপর ভিত্তি করে তৈরি, তবে কার্যকারিতা বৃদ্ধি ও গণনামূলক ব্যয় কমাতে বেশ কিছু গুরুত্বপূর্ণ উদ্ভাবন অন্তর্ভুক্ত করা হয়েছে।
উন্নত Transformer (Mistral 7B)
কোম্পানির প্রথম মডেল, Mistral 7B, দুটি গুরুত্বপূর্ণ স্থাপত্যগত উন্নতি উপস্থাপন করেছিল:
- Sliding Window Attention (SWA) (স্লাইডিং উইন্ডো attention): প্রতিটি token যাতে সমস্ত পূর্ববর্তী token-এর সাথে মিথস্ক্রিয়া করে (যা দ্বিঘাত জটিলতা তৈরি করে) সেই পরিবর্তে SWA attention-কে একটি নির্দিষ্ট উইন্ডোতে (যেমন ৪০৯৬ token) সীমাবদ্ধ করে। এটি রৈখিক গণনামূলক জটিলতায় অত্যন্ত দীর্ঘ ক্রম (৩২,০০০ token বা তার বেশি পর্যন্ত) প্রক্রিয়া করা সম্ভব করে, প্রক্রিয়াকরণকে উল্লেখযোগ্যভাবে ত্বরান্বিত করে।
- Grouped-Query Attention (GQA) (গ্রুপভিত্তিক query attention): আদর্শ multi-head attention প্রক্রিয়ার অপ্টিমাইজেশন। GQA query-এর তুলনায় key ও value-এর জন্য কম সংখ্যক "হেড" ব্যবহার করে (যেমন ৮:১ অনুপাতে), যা মেমোরির চাহিদা উল্লেখযোগ্যভাবে কমায় এবং গুণমানের উল্লেখযোগ্য ক্ষতি ছাড়াই generation (inference) প্রক্রিয়াকে ত্বরান্বিত করে।
Sparse Mixture-of-Experts (MoE)
Mixtral সিরিজের মডেলগুলোতে (যেমন Mixtral 8x7B, Mixtral 8x22B) Sparse Mixture-of-Experts (বিরল বিশেষজ্ঞদের মিশ্রণ) স্থাপত্য ব্যবহার করা হয়। একটি ঘন নিউরাল নেটওয়ার্ক স্তরের পরিবর্তে বেশ কিছু সমান্তরাল "বিশেষজ্ঞ" সাব-নেটওয়ার্ক ব্যবহার করা হয়। প্রতিটি ইনপুট token-এর জন্য একটি বিশেষ gating স্তর (রাউটার) গতিশীলভাবে সক্রিয় করার জন্য বিশেষজ্ঞদের একটি ছোট উপসেট নির্বাচন করে (সাধারণত ৮ জনের মধ্যে ২ জন)।
এটি বিপুল মোট প্যারামিটারসংখ্যা সম্পন্ন মডেল তৈরি করা সম্ভব করে (Mixtral 8x22B-এর ১৪১ বিলিয়ন প্যারামিটার রয়েছে), কিন্তু প্রতিটি token প্রক্রিয়া করার সময় তাদের মাত্র একটি অংশ (~৩৯ বিলিয়ন) ব্যবহৃত হয়। ফলে মডেলটি অনেক বড় "ঘন" মডেলের সাথে তুলনীয় গুণমান অর্জন করে, কিন্তু অনেক ছোট মডেলের মতো inference গতি ও ব্যয়ে।
Mamba (SSM) স্থাপত্য
২০২৪ সালে Mistral AI একটি পরীক্ষামূলক মডেল Codestral Mamba উপস্থাপন করে, যা Mamba (Selective State-Space Model) স্থাপত্যের উপর ভিত্তি করে তৈরি। transformer-এর বিপরীতে, Mamba স্টেট স্পেস মডেলের উপর ভিত্তি করে একটি পুনরাবৃত্তিমূলক প্রক্রিয়া ব্যবহার করে। মূল সুবিধাগুলো হলো:
- রৈখিক জটিলতা ক্রমের দৈর্ঘ্যের সাপেক্ষে, যা এটিকে দীর্ঘ context-এ অত্যন্ত দ্রুত করে তোলে।
- তাত্ত্বিকভাবে "অসীম" context, যা কেবল উপলব্ধ মেমোরি দ্বারা সীমাবদ্ধ।
- সমতুল্য transformer-এর তুলনায় উচ্চ inference গতি।
সময়রেখা এবং মডেলসমূহ
| মাস / বছর | মডেল | প্যারামিটার (বিলিয়ন) | মূল বৈশিষ্ট্য | লাইসেন্স |
|---|---|---|---|---|
| ০৯ / ২০২৩ | Mistral 7B | ৭.৩ | GQA + SWA স্থাপত্য; ৩২k context; সমস্ত benchmark-এ Llama 2 13B-কে ছাড়িয়ে গেছে। | Apache 2.0 |
| ১২ / ২০২৩ | Mixtral 8x7B | ৪৬.৭ (১২.৯ সক্রিয়) | প্রথম উন্মুক্ত MoE মডেল; GPT-3.5 সমমানের গুণমান। | Apache 2.0 |
| ০২ / ২০২৪ | Mistral Small / Large | ? | API-এর মাধ্যমে উপলব্ধ "ছোট" ও ফ্ল্যাগশিপ মডেল। | Small: Apache 2.0, Large: Research |
| ০৪ / ২০২৪ | Mixtral 8x22B | ১৪১ (৩৯ সক্রিয়) | ৬৪k context; প্রকাশের সময় open-source মডেলগুলোর মধ্যে SOTA মানের। | Apache 2.0 |
| ০৫ / ২০২৪ | Codestral 22B | ২২ | কোড তৈরির জন্য বিশেষায়িত মডেল (৮০+ ভাষা)। | Non-Production |
| ০৭ / ২০২৪ | Mathstral 7B / Nemo 12B | ৭ / ১২ | গণিত ও বহুভাষিকতার জন্য বিশেষায়িত মডেল। | Apache 2.0 |
| ০৭ / ২০২৪ | Codestral Mamba 7.3B | ৭.৩ | Mamba স্থাপত্যে কোডের জন্য পরীক্ষামূলক মডেল; ২৫৬k+ context। | Apache 2.0 |
| ০৯ / ২০২৪ | Pixtral 12B | ১২ | প্রথম উন্মুক্ত মাল্টিমোডাল মডেল (টেক্সট + ছবি)। | Apache 2.0 |
| ১১ / ২০২৪ | Mistral Large 24.11 | ~১০০+ (আনুমানিক) | উন্নত reasoning সহ আপডেট করা ফ্ল্যাগশিপ মডেল। | Research |
| ০১ / ২০২৫ | Mistral Small 3 | ২৪ | কম বিলম্বের জন্য অপ্টিমাইজড (প্রতি সেকেন্ডে ১৫০ token পর্যন্ত); ৭০B মডেলের সমমানের গুণমান। | Apache 2.0 |
| ০৫ / ২০২৫ | Mistral Medium 3 | ? | ১২৮k context সহ ফ্রন্টিয়ার মাল্টিমোডাল মডেল (টেক্সট, ছবি)। | মালিকানাধীন |
| ০৫ / ২০২৫ | Devstral 24B | ২৪ | সফটওয়্যারের স্বায়ত্তশাসিত উন্নয়নের জন্য "এজেন্টিক" মডেল; SWE-Bench-এ ৪৬.৮%। | Apache 2.0 |
প্রতিযোগীদের সাথে তুলনা
- বনাম Llama (Meta): Mistral মডেলগুলো ধারাবাহিকভাবে একই বা এমনকি বড় আকারের Llama মডেলগুলোকে ছাড়িয়ে যায়। Mistral 7B, Llama 2 13B-কে এবং Mixtral 8x7B, Llama 2 70B-কে ছাড়িয়ে গেছে। মূল পার্থক্য হলো লাইসেন্স: Mistral সম্পূর্ণ অনুমোদনমূলক Apache 2.0 ব্যবহার করে, যেখানে Llama লাইসেন্সে বিধিনিষেধ রয়েছে।
- বনাম GPT (OpenAI): OpenAI-এর ফ্ল্যাগশিপ মডেলগুলো (GPT-4) সবচেয়ে জটিল কাজে নেতৃত্ব বজায় রাখে, তবে Mistral-এর উন্মুক্ত মডেলগুলো (যেমন Mixtral 8x7B) GPT-3.5-এর সাথে তুলনীয় গুণমান প্রদর্শন করে। Mistral একটি উন্মুক্ত বিকল্প প্রদান করে, যা মডেলগুলো স্থানীয়ভাবে স্থাপন ও সম্পূর্ণ নিয়ন্ত্রণের সুযোগ দেয়।
- বনাম Claude (Anthropic): Claude মডেলগুলো বড় context উইন্ডো ও নিরাপত্তা-অভিমুখিতার জন্য পরিচিত। Mistral তুলনীয় বা বড় context সহ উন্মুক্ত মডেল অফার করেছে। আদর্শ benchmark-এ (LMSys Arena) কর্মক্ষমতার দিক থেকে Medium 3 মডেলটি Claude 3 Opus-কে ছাড়িয়ে গেছে।
প্রয়োগ ও ইকোসিস্টেম
পণ্যসমূহ
- Le Chat: পাবলিক চ্যাট-অ্যাসিস্ট্যান্ট (ওয়েব, iOS/Android), যা ওয়েব অনুসন্ধান ও ছবি তৈরিসহ Mistral মডেলের সক্ষমতা প্রদর্শন করে।
- La Plateforme: সমস্ত Mistral মডেলে API অ্যাক্সেস সহ কর্পোরেট প্ল্যাটফর্ম, যা কোম্পানিগুলোকে তাদের পণ্যে LLM সংযুক্ত করতে সক্ষম করে।
কর্পোরেট ক্লায়েন্ট
Mistral-এর প্রযুক্তি বড় কোম্পানিগুলো যেমন BNP Paribas (অর্থায়ন), CMA CGM (লজিস্টিক্স), Zalando (ই-কমার্স) এবং সরকারি সংস্থা France Travail ব্যবহার করছে। ইউরোপীয় ক্লায়েন্টদের জন্য GDPR মেনে চলতে মডেলের স্থানীয় স্থাপনার সুবিধা গুরুত্বপূর্ণ।
Open-Source সম্প্রদায়
উন্মুক্ত লাইসেন্সের কারণে, Mistral মডেলগুলো Hugging Face-এর মতো প্ল্যাটফর্মে হাজার হাজার প্রকল্পের ভিত্তি হয়ে উঠেছে। সম্প্রদায় সক্রিয়ভাবে বিশেষায়িত কাজের জন্য মডেলগুলো fine-tune করছে, জীববিজ্ঞান (BioMistral), আইনশাস্ত্র (SaulLM-7B) এবং বিভিন্ন ভাষায় স্থানীয়করণের সংস্করণ তৈরি করছে (যেমন Polish Bielik 7B)।
লাইসেন্সিং
| মডেল সিরিজ | লাইসেন্স | বিধিনিষেধ |
|---|---|---|
| বেসিক, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | বিনামূল্যে বাণিজ্যিক ব্যবহার। |
| Codestral 22B | Non-Production License | পৃথক চুক্তি ছাড়া বাণিজ্যিক ব্যবহার নিষিদ্ধ। |
| Large সিরিজ, Medium সিরিজ | Mistral Research / মালিকানাধীন | শুধুমাত্র ক্লাউড API-এর মাধ্যমে অ্যাক্সেস। |
সূত্র
- Mistral AI-এর অফিশিয়াল ডকুমেন্টেশন
- Hugging Face-এ Mistral AI-এর প্রোফাইল
সাহিত্য
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.