DBRX (language model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — एक खुली बड़ी भाषा मॉडल (LLM) है, जिसे Databricks कंपनी के अंतर्गत Mosaic AI अनुसंधान दल द्वारा विकसित किया गया है। मॉडल को आधिकारिक रूप से 27 मार्च 2024 को जारी किया गया और इसे कॉर्पोरेट उपयोग के लिए एक उच्च-प्रदर्शन समाधान के रूप में प्रस्तुत किया गया है[1]

DBRX एक सूक्ष्म-दानेदार Mixture of Experts (MoE) आर्किटेक्चर पर निर्मित है और यह उच्च प्रदर्शन को प्रशिक्षण तथा inference की दक्षता के साथ संयोजित करती है। जारी किए जाने के समय DBRX ने प्रमुख benchmark पर सभी खुली मॉडलों में सर्वश्रेष्ठ परिणाम प्रदर्शित किए, जिसमें LLaMA 2, Mixtral और Grok-1 जैसी मॉडलों को पीछे छोड़ा, और GPT-3.5 Turbo स्तर की बंद मॉडलों के साथ प्रतिस्पर्धात्मकता दिखाई[2]

विकास का इतिहास

DBRX का आगमन Databricks की खुली generative मॉडलों के विकास की रणनीति की निरंतरता था। जून 2023 में Databricks ने MosaicML स्टार्टअप का अधिग्रहण किया, जो बड़ी मॉडलों के प्रशिक्षण में विशेषज्ञ था, और उसके आधार पर Mosaic AI प्रभाग की स्थापना की गई[3]

Mosaic AI की टीम, जिसका नेतृत्व प्रमुख Neural Network आर्किटेक्ट Jonathan Frankle कर रहे थे, ने एक नई बड़ी LLM के विकास में कदम रखा, जिसका लक्ष्य था खुले प्रारूप में सर्वश्रेष्ठ proprietary प्रणालियों के समकक्ष गुणवत्ता प्राप्त करना। इस परियोजना को DBRX नाम दिया गया। मॉडल के विकास और pre-training में लगभग 2.5 महीने लगे और अनुमानतः इसकी लागत लगभग $10 मिलियन रही[3]

आर्किटेक्चर

DBRX एक decoder-only transformer मॉडल है और यह सूक्ष्म-दानेदार (fine-grained) Mixture of Experts (MoE) आर्किटेक्चर को लागू करती है।

आर्किटेक्चर की प्रमुख विशेषताएँ:

  • कुल parameter संख्या: 132 अरब।
  • Experts: मॉडल 16 छोटी विशेषीकृत उप-मॉडलों («experts») से मिलकर बनी है।
  • सक्रियण तंत्र: प्रत्येक इनपुट token के लिए 16 में से केवल 4 experts सक्रिय होते हैं। इसका अर्थ है कि inference के दौरान केवल 36 अरब parameter सक्रिय रहते हैं, जो उच्च गति और दक्षता सुनिश्चित करता है। यह योजना Mixtral (8 experts, 2 सक्रिय) की तुलना में experts के 65 गुना अधिक संभावित संयोजन प्रदान करती है[1]
  • घटक: आधुनिक आर्किटेक्चरल समाधानों का उपयोग किया गया है, जैसे rotary positional embedding (RoPE), gated linear units (GLU) और grouped query attention (GQA)।
  • Context लंबाई: 32,768 token।

यह आर्किटेक्चर मॉडल को विशाल parameter संख्या के लाभ (ज्ञान संग्रहण के लिए) और छोटी मॉडलों की दक्षता (inference गति के लिए) को एक साथ संयोजित करने में सक्षम बनाता है।

प्रशिक्षण

DBRX का pre-training सावधानीपूर्वक क्यूरेट किए गए 12 ट्रिलियन token के dataset पर किया गया, जिसमें पाठ और कोड शामिल थे। डेटा की गुणवत्ता एक प्रमुख प्राथमिकता थी: डेवलपर्स ने डेटा की सफाई, तैयारी और ऑडिट के लिए Databricks क्लाउड प्लेटफ़ॉर्म (Apache Spark, Databricks Notebooks, Unity Catalog) का उपयोग किया[1]

प्रशिक्षण में curriculum learning की विधि अपनाई गई, जिसमें विभिन्न चरणों पर डेटा प्रकारों का अनुपात बदला जाता था। उदाहरण के लिए, प्रशिक्षण का अंतिम भाग जटिल कार्यों की क्रमिक प्रस्तुति पर केंद्रित था, जिससे डेवलपर्स के अनुसार गुणवत्ता में उल्लेखनीय सुधार हुआ। प्रशिक्षण 3072 Nvidia H100 GPU के क्लस्टर पर आयोजित किया गया।

Pre-training के बाद, बेस मॉडल ने उपयोगकर्ता निर्देशों के निष्पादन के लिए अनुकूलित इंटरैक्टिव संस्करण DBRX Instruct बनाने हेतु अतिरिक्त fine-tuning (instruction tuning) से गुजरा।

प्रदर्शन

जारी किए जाने के समय DBRX ने खुली LLM के लिए benchmark की एक विस्तृत श्रृंखला पर एक नया गुणवत्ता मानक स्थापित किया।

खुली मॉडलों से तुलना

प्रमुख benchmark पर DBRX Instruct के परिणाम[1]
Benchmark कार्य DBRX Instruct अगला सर्वश्रेष्ठ (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) सामान्य ज्ञान 74.5% 72.7% (Mixtral Instruct)
HumanEval प्रोग्रामिंग 70.1% 63.2% (Grok-1)
GSM8K गणितीय तर्क 66.9% 62.9% (Grok-1)
MMLU सामान्य ज्ञान 73.7% 71.5% (Mixtral Instruct)

DBRX ने Hugging Face Open LLM Leaderboard की समग्र रैंकिंग और Databricks LLM Gauntlet के व्यापक परीक्षण दोनों में प्रथम स्थान प्राप्त किया, और अपने पूर्ववर्तियों से उल्लेखनीय अंतर प्रदर्शित किया[1]

बंद मॉडलों से तुलना

DBRX Instruct कई प्रमुख संकेतकों पर GPT-3.5 Turbo से बेहतर है, जिसमें MMLU (73.7% बनाम 70.0%) और HumanEval (70.1% बनाम 48.1%) शामिल हैं। कुछ benchmark (जैसे MTBench) पर उत्तरों की गुणवत्ता के मामले में मॉडल Gemini 1.0 Pro और GPT-4 के शुरुआती संस्करणों के स्तर के करीब पहुँचती है[1]

प्रशिक्षण और inference की दक्षता

  • प्रशिक्षण दक्षता: MoE आर्किटेक्चर के उपयोग ने समान गुणवत्ता की dense मॉडलों की तुलना में FLOPS लागत को 2-4 गुना कम करना संभव बनाया।
  • Inference दक्षता: केवल 36 अरब parameter सक्रिय करने के कारण DBRX समान आकार की dense मॉडलों (जैसे LLaMA2-70B) की तुलना में 2-3 गुना अधिक throughput (inference गति) प्रदान करती है[1]

लाइसेंसिंग और उपलब्धता

DBRX को विशेष रूप से विकसित Databricks Open Model License के अंतर्गत वितरित किया जाता है। यह स्वतंत्र उपयोग और संशोधन की अनुमति देती है, जिसमें व्यावसायिक उपयोग भी शामिल है, लेकिन इसमें कुछ प्रतिबंध शामिल हैं। विशेष रूप से, LLaMA 2 के लाइसेंस की तरह, इसके लिए Databricks से अलग अनुमति प्राप्त करना आवश्यक है यदि DBRX पर आधारित सेवाओं का उपयोग प्रति माह 70 करोड़ से अधिक सक्रिय उपयोगकर्ताओं द्वारा किया जाएगा।

मॉडल के pre-trained weights (बेस और Instruct संस्करण) Hugging Face पर रिपॉजिटरी के माध्यम से डाउनलोड के लिए उपलब्ध हैं[4]

साहित्य

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [१]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [२]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [३]
  4. «databricks/dbrx-base». Hugging Face. [४]