Mixtral (Mistral AI) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — এটি একটি ওপেন সোর্স বৃহৎ ভাষা মডেল (LLM), যা ফরাসি কোম্পানি Mistral AI দ্বারা তৈরি এবং ২০২৩ সালের ডিসেম্বরে প্রকাশিত। মডেলটি বিরল বিশেষজ্ঞ মিশ্রণ (Sparse Mixture of Experts, SMoE) আর্কিটেকচারের উপর ভিত্তি করে নির্মিত, যা এটিকে অনেক বড় মডেলের (যেমন Llama 2 70B এবং GPT-3.5) সাথে তুলনীয় কর্মক্ষমতা অর্জনের পাশাপাশি উচ্চ গতি ও দক্ষ inference নিশ্চিত করতে সক্ষম করে[1]

মডেলটি Apache 2.0 মুক্ত লাইসেন্সের আওতায় বিতরণ করা হয়, যা একাডেমিক ও বাণিজ্যিক ব্যবহারের জন্য এটিকে সহজলভ্য করে তোলে। Mixtral 8x7B বহুভাষিক কাজ, কোড তৈরি এবং নির্দেশনা অনুসরণে শক্তিশালী সক্ষমতা প্রদর্শন করে, যা প্রকাশের সময় এটিকে সবচেয়ে জনপ্রিয় ওপেন মডেলগুলির একটিতে পরিণত করেছিল[2]

ইতিহাস

Mistral AI কোম্পানিটি ২০২৩ সালের এপ্রিলে Meta এবং Google-এর প্রাক্তন গবেষকদের দ্বারা প্রতিষ্ঠিত হয়েছিল। ২০২৩ সালের সেপ্টেম্বরে কোম্পানিটি তার প্রথম মডেল Mistral 7B প্রকাশ করে, যা ছোট আকারে উচ্চ দক্ষতার জন্য স্বীকৃতি পায়।

১১ ডিসেম্বর ২০২৩ সালে Mistral AI তার বিশেষজ্ঞ মিশ্রণ আর্কিটেকচার-ভিত্তিক প্রথম মডেল Mixtral 8x7B প্রকাশের ঘোষণা দেয়। মডেলটি সঙ্গে সঙ্গে সম্প্রদায়ের মনোযোগ আকর্ষণ করে সেই সময়ের সবচেয়ে শক্তিশালী ওপেন LLM হিসেবে, যা inference গতিতে উল্লেখযোগ্যভাবে এগিয়ে থেকেও GPT-3.5-এর মানের কর্মক্ষমতা প্রদর্শন করে। ২০২৪ সালের জানুয়ারিতে arXiv-এ একটি বিস্তারিত প্রযুক্তিগত গবেষণাপত্র প্রকাশিত হয়, যা স্বাধীন গবেষকদের আর্কিটেকচারের বিবরণ এবং পরীক্ষার ফলাফল জানার সুযোগ দেয়[2]

আর্কিটেকচার: Sparse Mixture of Experts (SMoE)

Mixtral 8x7B-এর প্রধান উদ্ভাবন হলো Sparse Mixture of Experts আর্কিটেকচারের প্রয়োগ। প্রচলিত ("ঘন") transformer-এর বিপরীতে, যেখানে প্রতিটি স্তর সমস্ত token-এর জন্য একই গণনা সম্পাদন করে, Mixtral-এ প্রতিটি স্তরে একাধিক সমান্তরাল "বিশেষজ্ঞ" ব্লক রয়েছে।

আর্কিটেকচারের মূল বৈশিষ্ট্যসমূহ:

  • MoE কাঠামো: প্রতিটি transformer স্তরে ৮টি feed-forward ব্লক ("বিশেষজ্ঞ") রয়েছে। প্রতিটি token প্রক্রিয়াকরণের জন্য একটি বিশেষ router-নেটওয়ার্ক সবচেয়ে উপযুক্ত ২টি বিশেষজ্ঞ বেছে নেয় (Top-2 routing)।
  • প্যারামিটার: মডেলের মোট প্যারামিটার সংখ্যা ৪৬.৭ বিলিয়ন, তবে বিরল সক্রিয়করণের কারণে inference প্রক্রিয়ায় প্রতিটি token-এর জন্য মাত্র ১২.৯ বিলিয়ন সক্রিয় প্যারামিটার ব্যবহৃত হয়। এটি ~১৩ বিলিয়ন প্যারামিটারের মডেলের সাথে তুলনীয় inference গতি নিশ্চিত করে।
  • Attention অপ্টিমাইজেশন: মডেলটি দীর্ঘ ক্রম দক্ষতার সাথে প্রক্রিয়াকরণের জন্য আধুনিক প্রযুক্তি ব্যবহার করে, যার মধ্যে রয়েছে Sliding Window Attention (SWA) এবং Grouped Query Attention (GQA)
  • Context দৈর্ঘ্য: মডেলটি ৩২,৭৬৮ token পর্যন্ত context উইন্ডো সমর্থন করে।

প্রশিক্ষণ

Mixtral 8x7B পরিবারে দুটি প্রধান সংস্করণ রয়েছে:

  1. Mixtral-8x7B-v0.1 (ভিত্তি মডেল): একটি pre-trained মডেল, যা একাধিক ইউরোপীয় ভাষায় (ইংরেজি, ফরাসি, জার্মান, স্প্যানিশ, ইতালীয়) বিশাল ওয়েব ডেটা corpus-এ প্রশিক্ষিত। মূল কাজ হলো পরবর্তী token পূর্বাভাস।
  2. Mixtral-8x7B-Instruct-v0.1 (নির্দেশনা মডেল): supervised fine-tuning (SFT) এবং Direct Preference Optimization (DPO) ব্যবহার করে fine-tune করা সংস্করণ। এই মডেলটি ব্যবহারকারীর নির্দেশনা আরও ভালোভাবে অনুসরণ করে এবং সংলাপ বিন্যাসে ব্যবহারের জন্য ডিজাইন করা হয়েছে।

কর্মক্ষমতা

Mixtral 8x7B অধিকাংশ প্রচলিত benchmark-এ Llama 2 70B মডেলকে ছাড়িয়ে যায় বা সমতুল্য মান অর্জন করে, অথচ এতে ৫ গুণ কম সক্রিয় প্যারামিটার রয়েছে এবং ফলস্বরূপ inference গতি উল্লেখযোগ্যভাবে বেশি (৬ গুণ পর্যন্ত দ্রুত)[2]

Mixtral 8x7B-এর সাথে Llama 2 70B এবং GPT-3.5-এর কর্মক্ষমতার তুলনা[2]
মেট্রিক Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (সাধারণ জ্ঞান) 69,9% 70,0% 70,6%
GSM-8K (গণিত) 53,6% 57,1% 58,4%
MBPP (কোড তৈরি) 49,8% 52,2% 60,7%
MT-Bench (সংলাপ মূল্যায়ন, Instruct সংস্করণ) 6,86 8,32 8,30
  • বহুভাষিকতা: প্রশিক্ষণ corpus-এ বহুভাষিক ডেটার বর্ধিত অনুপাতের কারণে, Mixtral ফরাসি, জার্মান, স্প্যানিশ এবং ইতালীয় ভাষার কাজে Llama 2 70B-কে উল্লেখযোগ্যভাবে ছাড়িয়ে যায়।
  • পক্ষপাত ও hallucination: Llama 2 70B-এর তুলনায় মডেলটি BBQ benchmark-এ (সামাজিক পক্ষপাত মূল্যায়ন) উচ্চতর নির্ভুলতা এবং BOLD benchmark-এ আরও ইতিবাচক sentiment প্রোফাইল প্রদর্শন করে।

লাইসেন্সিং এবং প্রাপ্যতা

Mixtral 8x7B-এর উভয় সংস্করণ (ভিত্তি এবং Instruct) Apache 2.0 লাইসেন্সের আওতায় প্রকাশিত, যা মুক্ত একাডেমিক ও বাণিজ্যিক ব্যবহারের অনুমতি দেয়। মডেলের সোর্স কোড এবং weights GitHub এবং Hugging Face-এ পাওয়া যায়।

বহিঃসংযোগ

  • Mixtral of Experts — Mistral AI-এর ব্লগে অফিসিয়াল ঘোষণা
  • Hugging Face-এ Mixtral 8x7B মডেল

সাহিত্য

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

টীকা

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [১]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [২]