Mixtral (Mistral AI) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — यह एक ओपन-सोर्स बड़ा भाषा मॉडल (LLM) है, जिसे फ्रांसीसी कंपनी Mistral AI ने विकसित किया और दिसंबर 2023 में जारी किया। यह मॉडल Sparse Mixture of Experts (SMoE) आर्किटेक्चर पर आधारित है, जो इसे बहुत बड़े मॉडलों (जैसे Llama 2 70B और GPT-3.5) के समकक्ष प्रदर्शन के साथ-साथ उच्च गति और कुशल inference प्रदान करने में सक्षम बनाता है[1]

यह मॉडल Apache 2.0 मुक्त लाइसेंस के अंतर्गत वितरित किया जाता है, जिससे यह शैक्षणिक और व्यावसायिक दोनों उपयोगों के लिए उपलब्ध है। Mixtral 8x7B बहुभाषी कार्यों, कोड निर्माण और निर्देशों का पालन करने में उत्कृष्ट क्षमता प्रदर्शित करता है, जिसने इसे जारी होने के समय सबसे लोकप्रिय ओपन मॉडलों में से एक बना दिया[2]

विकास का इतिहास

Mistral AI की स्थापना अप्रैल 2023 में Meta और Google के पूर्व शोधकर्ताओं द्वारा की गई थी। सितंबर 2023 में कंपनी ने अपना पहला मॉडल, Mistral 7B, जारी किया, जिसे इसके छोटे आकार में उच्च दक्षता के लिए सराहा गया।

11 दिसंबर 2023 को Mistral AI ने Mixture of Experts आर्किटेक्चर पर आधारित अपने पहले मॉडल Mixtral 8x7B की घोषणा की। इस मॉडल ने तुरंत ही समुदाय का ध्यान आकर्षित किया क्योंकि यह उस समय का सबसे शक्तिशाली ओपन LLM था, जिसने inference की काफी अधिक गति के साथ GPT-3.5 के समकक्ष गुणवत्ता प्रदर्शित की। जनवरी 2024 में arXiv पर एक वैज्ञानिक लेख के रूप में मॉडल का विस्तृत तकनीकी विवरण प्रकाशित किया गया, जिससे स्वतंत्र शोधकर्ताओं को आर्किटेक्चर के विवरण और परीक्षण परिणामों से परिचित होने का अवसर मिला[2]

आर्किटेक्चर: Sparse Mixture of Experts (SMoE)

Mixtral 8x7B की मुख्य नवीनता Sparse Mixture of Experts आर्किटेक्चर का कार्यान्वयन है। मानक («घने») transformer के विपरीत, जहाँ प्रत्येक परत सभी token के लिए एक ही गणना करती है, Mixtral में प्रत्येक परत में कई समानांतर «एक्सपर्ट» ब्लॉक होते हैं।

आर्किटेक्चर की प्रमुख विशेषताएँ:

  • MoE संरचना: प्रत्येक transformer परत में 8 feed-forward ब्लॉक («एक्सपर्ट») होते हैं। प्रत्येक token के प्रसंस्करण के लिए एक विशेष router नेटवर्क 2 सबसे उपयुक्त एक्सपर्ट चुनता है (Top-2 routing)।
  • पैरामीटर: मॉडल के कुल पैरामीटर की संख्या 46.7 अरब है, लेकिन sparse activation के कारण प्रत्येक token के लिए inference के दौरान केवल 12.9 अरब सक्रिय पैरामीटर उपयोग होते हैं। इससे ~13 अरब पैरामीटर वाले मॉडलों के समकक्ष inference गति प्राप्त होती है।
  • Attention अनुकूलन: मॉडल लंबे अनुक्रमों के कुशल प्रसंस्करण के लिए आधुनिक तकनीकों का उपयोग करता है, जिसमें Sliding Window Attention (SWA) और Grouped Query Attention (GQA) शामिल हैं।
  • संदर्भ लंबाई: मॉडल 32,768 token तक के context window को सपोर्ट करता है।

प्रशिक्षण

Mixtral 8x7B परिवार में दो मुख्य संस्करण शामिल हैं:

  1. Mixtral-8x7B-v0.1 (आधार मॉडल): एक pre-trained मॉडल, जिसे कई यूरोपीय भाषाओं (अंग्रेजी, फ्रेंच, जर्मन, स्पेनिश, इतालवी) में वेब डेटा के बड़े कॉर्पस पर प्रशिक्षित किया गया है। मुख्य कार्य — अगले token की भविष्यवाणी करना।
  2. Mixtral-8x7B-Instruct-v0.1 (निर्देश मॉडल): एक ऐसा संस्करण जिसे supervised fine-tuning (SFT) और Direct Preference Optimization (DPO) की सहायता से fine-tune किया गया है। यह मॉडल उपयोगकर्ता के निर्देशों का बेहतर ढंग से पालन करता है और संवाद प्रारूप में उपयोग के लिए डिज़ाइन किया गया है।

प्रदर्शन

Mixtral 8x7B अधिकांश मानक benchmark पर Llama 2 70B मॉडल से बेहतर या उसके समकक्ष प्रदर्शन करता है, जबकि इसमें 5 गुना कम सक्रिय पैरामीटर हैं और परिणामस्वरूप inference की गति काफी अधिक है (6 गुना तक तेज़)[2]

Mixtral 8x7B की Llama 2 70B और GPT-3.5 के साथ प्रदर्शन तुलना[2]
मेट्रिक Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (सामान्य ज्ञान) 69.9% 70.0% 70.6%
GSM-8K (गणित) 53.6% 57.1% 58.4%
MBPP (कोड निर्माण) 49.8% 52.2% 60.7%
MT-Bench (संवाद मूल्यांकन, Instruct संस्करण) 6.86 8.32 8.30
  • बहुभाषिकता: प्रशिक्षण कॉर्पस में बहुभाषी डेटा की बढ़ी हुई मात्रा के कारण, Mixtral फ्रेंच, जर्मन, स्पेनिश और इतालवी भाषाओं के कार्यों में Llama 2 70B से काफी बेहतर प्रदर्शन करता है।
  • पूर्वाग्रह और मतिभ्रम: Llama 2 70B की तुलना में यह मॉडल BBQ benchmark (सामाजिक पूर्वाग्रहों का मूल्यांकन) पर अधिक सटीकता और BOLD benchmark पर अधिक सकारात्मक भावना प्रोफ़ाइल प्रदर्शित करता है।

लाइसेंसिंग और उपलब्धता

Mixtral 8x7B के दोनों संस्करण (आधार और Instruct) Apache 2.0 लाइसेंस के अंतर्गत जारी किए गए हैं, जो मुक्त शैक्षणिक और व्यावसायिक उपयोग की अनुमति देता है। मॉडल का स्रोत कोड और वेट GitHub और Hugging Face पर उपलब्ध हैं।

संदर्भ

  • Mixtral of Experts — Mistral AI के ब्लॉग पर आधिकारिक घोषणा
  • Hugging Face पर Mixtral 8x7B मॉडल

साहित्य

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

टिप्पणियाँ

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [१]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [२]