Mistral AI (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Mistral AI — ফ্রান্সের একটি কৃত্রিম বুদ্ধিমত্তা কোম্পানি, যা বৃহৎ ভাষা মডেল (LLM) তৈরিতে বিশেষজ্ঞ। ২০২৩ সালের এপ্রিল মাসে প্রতিষ্ঠিত এই কোম্পানি দ্রুতই ইউরোপীয় ও বৈশ্বিক বাজারে একটি গুরুত্বপূর্ণ খেলোয়াড় হিসেবে আবির্ভূত হয়েছে এবং নিজেকে আমেরিকান প্রযুক্তি জায়ান্টদের মালিকানাধীন মডেলগুলোর বিকল্প হিসেবে উপস্থাপন করছে।

Mistral AI-এর পদ্ধতির মূল বৈশিষ্ট্য হলো উন্মুক্ত ওজনসহ (প্রধানত Apache 2.0 লাইসেন্সের অধীনে) উচ্চ-কার্যক্ষম মডেল তৈরিতে মনোযোগ, যা অত্যাধুনিক AI প্রযুক্তিতে গণতান্ত্রিক প্রবেশাধিকার নিশ্চিত করে। কোম্পানিটি তার স্থাপত্যগত উদ্ভাবনের জন্য পরিচিত, যেমন Grouped-Query Attention (GQA), Sliding Window Attention (SWA) এবং Sparse Mixture-of-Experts (MoE), যা তাদের মডেলগুলোকে তুলনামূলকভাবে ছোট আকার ও কম গণনামূলক ব্যয়ে উচ্চ দক্ষতা অর্জন করতে সক্ষম করে।

ইতিহাস

Mistral AI কোম্পানিটি ২০২৩ সালের এপ্রিল মাসে প্যারিসে তিনজন ফরাসি গবেষক দ্বারা প্রতিষ্ঠিত হয়: আর্থার মঁশ (Arthur Mensch), গিয়োম লাম্পল (Guillaume Lample) এবং তিমোতে লাক্রোয়া (Timothée Lacroix)। তিনজন প্রতিষ্ঠাতাই এর আগে বিশ্বের শীর্ষস্থানীয় কোম্পানিগুলোতে বৃহৎ ভাষা মডেল নিয়ে কাজ করেছেন: মঁশ Google DeepMind-এ গবেষক ছিলেন, আর লাম্পল ও লাক্রোয়া Meta AI-তে LLM নিয়ে কাজ করতেন।

কোম্পানির লক্ষ্য হলো উন্মুক্ততা, সহযোগিতা ও স্বচ্ছতার প্রসারের মাধ্যমে AI-এর অত্যাধুনিক অর্জনগুলো সকলের কাছে সহজলভ্য করা। এই দৃষ্টিভঙ্গি Mistral AI-কে দ্রুত উল্লেখযোগ্য বিনিয়োগ আকর্ষণ করতে সহায়তা করেছে:

  • জুন ২০২৩: Seed রাউন্ডে €১০৫ মিলিয়ন, যা ইউরোপের জন্য একটি রেকর্ড।
  • ডিসেম্বর ২০২৩: Series A রাউন্ডে €৩৮৫ মিলিয়ন, যার পর কোম্পানির মূল্যায়ন $২ বিলিয়ন ছাড়িয়ে যায় এবং এটি "ইউনিকর্ন" মর্যাদা লাভ করে।
  • ফেব্রুয়ারি ২০২৪: Microsoft-এর সাথে কৌশলগত অংশীদারিত্বের ঘোষণা, যাতে $১৬ মিলিয়ন বিনিয়োগ এবং Azure ক্লাউডে Mistral মডেল স্থাপন অন্তর্ভুক্ত ছিল।
  • জুন ২০২৪: €৬০০ মিলিয়নের নতুন অর্থায়ন রাউন্ড, যার ফলে কোম্পানির মূল্যায়ন ~€৫.৮ বিলিয়নে পৌঁছায় এবং এটি বিশ্বের সবচেয়ে মূল্যবান AI স্টার্টআপগুলোর একটি হয়ে ওঠে।

স্থাপত্যের প্রযুক্তিগত বৈশিষ্ট্য

Mistral AI-এর মডেলগুলো transformer স্থাপত্যের উপর ভিত্তি করে তৈরি, তবে কার্যকারিতা বৃদ্ধি ও গণনামূলক ব্যয় কমাতে বেশ কিছু গুরুত্বপূর্ণ উদ্ভাবন অন্তর্ভুক্ত করা হয়েছে।

উন্নত Transformer (Mistral 7B)

কোম্পানির প্রথম মডেল, Mistral 7B, দুটি গুরুত্বপূর্ণ স্থাপত্যগত উন্নতি উপস্থাপন করেছিল:

  • Sliding Window Attention (SWA) (স্লাইডিং উইন্ডো attention): প্রতিটি token যাতে সমস্ত পূর্ববর্তী token-এর সাথে মিথস্ক্রিয়া করে (যা দ্বিঘাত জটিলতা তৈরি করে) সেই পরিবর্তে SWA attention-কে একটি নির্দিষ্ট উইন্ডোতে (যেমন ৪০৯৬ token) সীমাবদ্ধ করে। এটি রৈখিক গণনামূলক জটিলতায় অত্যন্ত দীর্ঘ ক্রম (৩২,০০০ token বা তার বেশি পর্যন্ত) প্রক্রিয়া করা সম্ভব করে, প্রক্রিয়াকরণকে উল্লেখযোগ্যভাবে ত্বরান্বিত করে।
  • Grouped-Query Attention (GQA) (গ্রুপভিত্তিক query attention): আদর্শ multi-head attention প্রক্রিয়ার অপ্টিমাইজেশন। GQA query-এর তুলনায় key ও value-এর জন্য কম সংখ্যক "হেড" ব্যবহার করে (যেমন ৮:১ অনুপাতে), যা মেমোরির চাহিদা উল্লেখযোগ্যভাবে কমায় এবং গুণমানের উল্লেখযোগ্য ক্ষতি ছাড়াই generation (inference) প্রক্রিয়াকে ত্বরান্বিত করে।

Sparse Mixture-of-Experts (MoE)

Mixtral সিরিজের মডেলগুলোতে (যেমন Mixtral 8x7B, Mixtral 8x22B) Sparse Mixture-of-Experts (বিরল বিশেষজ্ঞদের মিশ্রণ) স্থাপত্য ব্যবহার করা হয়। একটি ঘন নিউরাল নেটওয়ার্ক স্তরের পরিবর্তে বেশ কিছু সমান্তরাল "বিশেষজ্ঞ" সাব-নেটওয়ার্ক ব্যবহার করা হয়। প্রতিটি ইনপুট token-এর জন্য একটি বিশেষ gating স্তর (রাউটার) গতিশীলভাবে সক্রিয় করার জন্য বিশেষজ্ঞদের একটি ছোট উপসেট নির্বাচন করে (সাধারণত ৮ জনের মধ্যে ২ জন)।

এটি বিপুল মোট প্যারামিটারসংখ্যা সম্পন্ন মডেল তৈরি করা সম্ভব করে (Mixtral 8x22B-এর ১৪১ বিলিয়ন প্যারামিটার রয়েছে), কিন্তু প্রতিটি token প্রক্রিয়া করার সময় তাদের মাত্র একটি অংশ (~৩৯ বিলিয়ন) ব্যবহৃত হয়। ফলে মডেলটি অনেক বড় "ঘন" মডেলের সাথে তুলনীয় গুণমান অর্জন করে, কিন্তু অনেক ছোট মডেলের মতো inference গতি ও ব্যয়ে।

Mamba (SSM) স্থাপত্য

২০২৪ সালে Mistral AI একটি পরীক্ষামূলক মডেল Codestral Mamba উপস্থাপন করে, যা Mamba (Selective State-Space Model) স্থাপত্যের উপর ভিত্তি করে তৈরি। transformer-এর বিপরীতে, Mamba স্টেট স্পেস মডেলের উপর ভিত্তি করে একটি পুনরাবৃত্তিমূলক প্রক্রিয়া ব্যবহার করে। মূল সুবিধাগুলো হলো:

  • রৈখিক জটিলতা ক্রমের দৈর্ঘ্যের সাপেক্ষে, যা এটিকে দীর্ঘ context-এ অত্যন্ত দ্রুত করে তোলে।
  • তাত্ত্বিকভাবে "অসীম" context, যা কেবল উপলব্ধ মেমোরি দ্বারা সীমাবদ্ধ।
  • সমতুল্য transformer-এর তুলনায় উচ্চ inference গতি

সময়রেখা এবং মডেলসমূহ

Mistral AI-এর প্রধান মডেল রিলিজ
মাস / বছর মডেল প্যারামিটার (বিলিয়ন) মূল বৈশিষ্ট্য লাইসেন্স
০৯ / ২০২৩ Mistral 7B ৭.৩ GQA + SWA স্থাপত্য; ৩২k context; সমস্ত benchmark-এ Llama 2 13B-কে ছাড়িয়ে গেছে। Apache 2.0
১২ / ২০২৩ Mixtral 8x7B ৪৬.৭ (১২.৯ সক্রিয়) প্রথম উন্মুক্ত MoE মডেল; GPT-3.5 সমমানের গুণমান। Apache 2.0
০২ / ২০২৪ Mistral Small / Large ? API-এর মাধ্যমে উপলব্ধ "ছোট" ও ফ্ল্যাগশিপ মডেল। Small: Apache 2.0,
Large: Research
০৪ / ২০২৪ Mixtral 8x22B ১৪১ (৩৯ সক্রিয়) ৬৪k context; প্রকাশের সময় open-source মডেলগুলোর মধ্যে SOTA মানের। Apache 2.0
০৫ / ২০২৪ Codestral 22B ২২ কোড তৈরির জন্য বিশেষায়িত মডেল (৮০+ ভাষা)। Non-Production
০৭ / ২০২৪ Mathstral 7B / Nemo 12B ৭ / ১২ গণিত ও বহুভাষিকতার জন্য বিশেষায়িত মডেল। Apache 2.0
০৭ / ২০২৪ Codestral Mamba 7.3B ৭.৩ Mamba স্থাপত্যে কোডের জন্য পরীক্ষামূলক মডেল; ২৫৬k+ context। Apache 2.0
০৯ / ২০২৪ Pixtral 12B ১২ প্রথম উন্মুক্ত মাল্টিমোডাল মডেল (টেক্সট + ছবি)। Apache 2.0
১১ / ২০২৪ Mistral Large 24.11 ~১০০+ (আনুমানিক) উন্নত reasoning সহ আপডেট করা ফ্ল্যাগশিপ মডেল। Research
০১ / ২০২৫ Mistral Small 3 ২৪ কম বিলম্বের জন্য অপ্টিমাইজড (প্রতি সেকেন্ডে ১৫০ token পর্যন্ত); ৭০B মডেলের সমমানের গুণমান। Apache 2.0
০৫ / ২০২৫ Mistral Medium 3 ? ১২৮k context সহ ফ্রন্টিয়ার মাল্টিমোডাল মডেল (টেক্সট, ছবি)। মালিকানাধীন
০৫ / ২০২৫ Devstral 24B ২৪ সফটওয়্যারের স্বায়ত্তশাসিত উন্নয়নের জন্য "এজেন্টিক" মডেল; SWE-Bench-এ ৪৬.৮%। Apache 2.0

প্রতিযোগীদের সাথে তুলনা

  • বনাম Llama (Meta): Mistral মডেলগুলো ধারাবাহিকভাবে একই বা এমনকি বড় আকারের Llama মডেলগুলোকে ছাড়িয়ে যায়। Mistral 7B, Llama 2 13B-কে এবং Mixtral 8x7B, Llama 2 70B-কে ছাড়িয়ে গেছে। মূল পার্থক্য হলো লাইসেন্স: Mistral সম্পূর্ণ অনুমোদনমূলক Apache 2.0 ব্যবহার করে, যেখানে Llama লাইসেন্সে বিধিনিষেধ রয়েছে।
  • বনাম GPT (OpenAI): OpenAI-এর ফ্ল্যাগশিপ মডেলগুলো (GPT-4) সবচেয়ে জটিল কাজে নেতৃত্ব বজায় রাখে, তবে Mistral-এর উন্মুক্ত মডেলগুলো (যেমন Mixtral 8x7B) GPT-3.5-এর সাথে তুলনীয় গুণমান প্রদর্শন করে। Mistral একটি উন্মুক্ত বিকল্প প্রদান করে, যা মডেলগুলো স্থানীয়ভাবে স্থাপন ও সম্পূর্ণ নিয়ন্ত্রণের সুযোগ দেয়।
  • বনাম Claude (Anthropic): Claude মডেলগুলো বড় context উইন্ডো ও নিরাপত্তা-অভিমুখিতার জন্য পরিচিত। Mistral তুলনীয় বা বড় context সহ উন্মুক্ত মডেল অফার করেছে। আদর্শ benchmark-এ (LMSys Arena) কর্মক্ষমতার দিক থেকে Medium 3 মডেলটি Claude 3 Opus-কে ছাড়িয়ে গেছে।

প্রয়োগ ও ইকোসিস্টেম

পণ্যসমূহ

  • Le Chat: পাবলিক চ্যাট-অ্যাসিস্ট্যান্ট (ওয়েব, iOS/Android), যা ওয়েব অনুসন্ধান ও ছবি তৈরিসহ Mistral মডেলের সক্ষমতা প্রদর্শন করে।
  • La Plateforme: সমস্ত Mistral মডেলে API অ্যাক্সেস সহ কর্পোরেট প্ল্যাটফর্ম, যা কোম্পানিগুলোকে তাদের পণ্যে LLM সংযুক্ত করতে সক্ষম করে।

কর্পোরেট ক্লায়েন্ট

Mistral-এর প্রযুক্তি বড় কোম্পানিগুলো যেমন BNP Paribas (অর্থায়ন), CMA CGM (লজিস্টিক্স), Zalando (ই-কমার্স) এবং সরকারি সংস্থা France Travail ব্যবহার করছে। ইউরোপীয় ক্লায়েন্টদের জন্য GDPR মেনে চলতে মডেলের স্থানীয় স্থাপনার সুবিধা গুরুত্বপূর্ণ।

Open-Source সম্প্রদায়

উন্মুক্ত লাইসেন্সের কারণে, Mistral মডেলগুলো Hugging Face-এর মতো প্ল্যাটফর্মে হাজার হাজার প্রকল্পের ভিত্তি হয়ে উঠেছে। সম্প্রদায় সক্রিয়ভাবে বিশেষায়িত কাজের জন্য মডেলগুলো fine-tune করছে, জীববিজ্ঞান (BioMistral), আইনশাস্ত্র (SaulLM-7B) এবং বিভিন্ন ভাষায় স্থানীয়করণের সংস্করণ তৈরি করছে (যেমন Polish Bielik 7B)।

লাইসেন্সিং

মডেল সিরিজ লাইসেন্স বিধিনিষেধ
বেসিক, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral Apache 2.0 বিনামূল্যে বাণিজ্যিক ব্যবহার।
Codestral 22B Non-Production License পৃথক চুক্তি ছাড়া বাণিজ্যিক ব্যবহার নিষিদ্ধ।
Large সিরিজ, Medium সিরিজ Mistral Research / মালিকানাধীন শুধুমাত্র ক্লাউড API-এর মাধ্যমে অ্যাক্সেস।

সূত্র

  • Mistral AI-এর অফিশিয়াল ডকুমেন্টেশন
  • Hugging Face-এ Mistral AI-এর প্রোফাইল

সাহিত্য

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
  • Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.