Jamba (language model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — यह बड़े भाषा मॉडलों (LLM) का एक परिवार है, जिसे इज़राइली शोध कंपनी AI21 Labs द्वारा विकसित किया गया है। Jamba अपनी तरह की पहली हाइब्रिड आर्किटेक्चर है, जो AI विकास के दो प्रमुख दृष्टिकोणों — transformer और State Space Models (SSM), विशेष रूप से Mamba आर्किटेक्चर — के मुख्य तत्वों को एकीकृत करती है[1]

Jamba का मूल उद्देश्य आधुनिक LLM के एक मौलिक समझौते को हल करना है: उच्च गुणवत्ता और प्रदर्शन (जो transformer में निहित है) बनाम दक्षता और अत्यंत लंबे संदर्भों को संसाधित करने की क्षमता (जो SSM में निहित है)। इन दोनों दृष्टिकोणों को मिलाकर और Mixture-of-Experts (MoE) के माध्यम से विरलता (sparsity) जोड़कर, Jamba एक ऐसा मॉडल प्रस्तुत करती है जो एक साथ शक्तिशाली, कुशल और एकल अनुरोध में विशाल मात्रा में पाठ को संसाधित करने में सक्षम है।

Jamba की आर्किटेक्चर विस्तार से

Jamba केवल transformer और Mamba की परतों को आपस में नहीं बदलती। यह एक सुविचारित ब्लॉक संरचना का उपयोग करती है, जहाँ प्रत्येक ब्लॉक में आठ परतें होती हैं।

Jamba के एक ब्लॉक की संरचना:

  • एक Transformer परत: यह परत "गहरी" समझ और जटिल तर्क के लिए उत्तरदायी है। इस परत में Mixture-of-Experts (MoE) आर्किटेक्चर एकीकृत है।
  • सात Mamba परतें: ये परतें transformer परत के बाद आती हैं और लंबे संदर्भ में अनुक्रम की कुशल प्रसंस्करण तथा जानकारी को "आगे खींचने" के लिए उत्तरदायी हैं[2]

यह असममित संरचना मॉडल को कम्प्यूटेशनल संसाधनों का कुशलतापूर्वक प्रबंधन करने की अनुमति देती है: भारी लेकिन शक्तिशाली transformer संचालन कम बार किए जाते हैं, जबकि हल्के और तेज़ Mamba संचालन अधिक बार किए जाते हैं।

Mixture-of-Experts (MoE) का एकीकरण

Jamba में दक्षता को और बढ़ाने के लिए MoE आर्किटेक्चर का उपयोग किया जाता है।

  • MoE केवल transformer परतों के भीतर पूर्ण-संयोजन ब्लॉकों (FFN) पर लागू होता है[3]। Mamba परतें सघन (dense) बनी रहती हैं।
  • पहले Jamba मॉडल में 16 विशेषज्ञ (experts) थे।
  • प्रत्येक token के लिए राउटर नेटवर्क 2 सर्वश्रेष्ठ विशेषज्ञ चुनता है (Top-2 gating)।

इसका अर्थ यह है कि हालाँकि मॉडल के कुल पैरामीटर की संख्या अधिक है (52 अरब), प्रत्येक token प्रसंस्करण चरण में transformer परत में 16 में से केवल 2 विशेषज्ञ सक्रिय होते हैं, जिससे गणना अत्यंत तीव्र हो जाती है।

Jamba मॉडलों का विकास

Jamba-v0.1 (मार्च 2024)

इस परिवार में प्रस्तुत पहले मॉडल की निम्नलिखित विशेषताएँ हैं:

Jamba-v0.1 की तकनीकी विशेषताएँ
विशेषता मान
कुल पैरामीटर संख्या 52 अरब
सक्रिय पैरामीटर ~12 अरब
विशेषज्ञों की संख्या (MoE) 16 (2 सक्रिय)
संदर्भ विंडो 256,000 token
लाइसेंस Apache 2.0[4]

अपनी हाइब्रिड आर्किटेक्चर के कारण, Jamba-1 256,000 token की संदर्भ लंबाई को संसाधित करने में सक्षम है, जो लगभग 400 पृष्ठों के उपन्यास के बराबर है, और इसे 80 GB मेमोरी वाले एकल उपभोक्ता GPU पर तैनात किया जा सकता है[5]

Jamba-1.5 (2024)

2024 में AI21 Labs ने Jamba 1.5 मॉडलों का अद्यतन परिवार प्रस्तुत किया, जिसमें दो संस्करण शामिल हैं: Jamba 1.5 Mini (52B कुल में से 12B सक्रिय पैरामीटर) और Jamba 1.5 Large (398B कुल में से 94B सक्रिय पैरामीटर)[6]। ये मॉडल प्रदर्शन में उल्लेखनीय सुधार प्रदर्शित करते हैं:

  • प्रतिस्पर्धियों की तुलना में लंबे संदर्भों पर 2.5 गुना तक तेज़ inference।
  • अंग्रेज़ी, स्पेनिश, फ्रेंच और अरबी सहित नौ भाषाओं का समर्थन[7]

मुख्य लाभ और प्रदर्शन

  • विशाल संदर्भ विंडो: 256,000 token — इसके जारी होने के समय सभी उपलब्ध (प्रोप्राइटरी सहित) मॉडलों में सबसे बड़ी विंडो में से एक। यह Jamba को बड़े दस्तावेज़ों के विश्लेषण की आवश्यकता वाले कार्यों के लिए आदर्श बनाती है: कानूनी अनुबंध, शोध पत्र, संपूर्ण कोड आधार या लंबे संवाद।
  • उच्च प्रदर्शन और दक्षता: परीक्षणों में Jamba समान आकार के अग्रणी खुले मॉडलों जैसे Llama और Mixtral के बराबर या उनसे बेहतर प्रदर्शन प्रदर्शित करती है, साथ ही लंबे संदर्भों पर 3 गुना अधिक throughput दिखाती है[8]
  • खुलापन और उपलब्धता: Jamba अनुमेय Apache 2.0 लाइसेंस के तहत वितरित है, जो इसके व्यावसायिक और शोध उद्देश्यों के लिए मुक्त उपयोग की अनुमति देता है। मॉडल के भार Hugging Face प्लेटफ़ॉर्म पर उपलब्ध हैं।

benchmark पर परिणाम

Jamba 1.5 विभिन्न benchmark पर प्रतिस्पर्धात्मक परिणाम दिखाती है[9]:

  • Jamba 1.5 Mini ने Arena Hard में 46.1 अंक प्राप्त किए, जो इसे अपनी श्रेणी में अग्रणी सार्वजनिक मॉडल बनाता है[10]
  • Jamba 1.5 Large ने Arena Hard में 65.4 अंक प्राप्त किए, जो Llama 3.1 70B और 405B से बेहतर है।

अनुप्रयोग और उपलब्धता

Jamba व्यावसायिक अनुप्रयोगों के लिए अनुकूलित है और फ़ंक्शन कॉलिंग, JSON में संरचित आउटपुट और दस्तावेज़ प्रसंस्करण जैसी क्षमताओं का समर्थन करती है। मॉडल अनेक प्लेटफ़ॉर्म पर उपलब्ध है, जिनमें शामिल हैं:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

आर्थिक रूप से प्रभावी inference के समर्थन के लिए AI21 Labs ने ExpertsInt8 प्रस्तुत किया — यह एक नई quantization तकनीक है जो 256K token के संदर्भ को संसाधित करने में गुणवत्ता की हानि के बिना Jamba 1.5 Large को 8 GPU (प्रत्येक 80GB) वाली मशीन पर स्थापित करने की अनुमति देती है[11]

साहित्य

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

टिप्पणियाँ

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [१]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [२]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [३]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [४]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [५]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [६]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [७]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [८]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [९]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [१०]