Jais (language model) (HI)
Jais (उच्चारण «जेस») — यह खुले (open) बड़े भाषा मॉडलों (LLM) का एक परिवार है, जिसे संयुक्त अरब अमीरात में विकसित किया गया है और जो विशेष रूप से अरबी भाषा के लिए अनुकूलित है[1]। मॉडल का नाम जेबेल जेस पर्वत के नाम पर रखा गया है — जो संयुक्त अरब अमीरात की सबसे ऊँची चोटी है[2]।
यह परियोजना अनुसंधान कंपनी Inception (प्रौद्योगिकी समूह G42 की सहायक कंपनी), मोहम्मद बिन ज़ायद विश्वविद्यालय कृत्रिम बुद्धिमत्ता (MBZUAI) और कैलिफ़ोर्निया स्थित AI चिप निर्माता कंपनी Cerebras Systems के सहयोग से बनाई गई है[2]। Jais को एक स्वतंत्र लाइसेंस के अंतर्गत सार्वजनिक रूप से प्रकाशित किया गया, जिसका उद्देश्य अरबी भाषा के लिए AI पारिस्थितिकी तंत्र के विकास को प्रोत्साहित करना, सांस्कृतिक-भाषाई विरासत को संरक्षित करना और आधुनिक AI तकनीकों को अरबी भाषी विश्व के लिए अधिक सुलभ बनाना है[1]।
विकास का इतिहास और संस्करण
Jais परियोजना 2023 में उस समय शुरू की गई जब कम-संसाधन वाली भाषाओं के लिए मौजूदा LLM की सीमाएँ स्पष्ट थीं। डेवलपर्स ने उच्च गुणवत्ता वाले द्विभाषी मॉडलों की कमी को रेखांकित किया, जो अरबी और अंग्रेज़ी दोनों भाषाओं को समान दक्षता से संसाधित कर सकें[2]।
Jais-13B: पहला संस्करण
पहला संस्करण, Jais-13B, 30 अगस्त 2023 को जारी किया गया और इसमें 13 अरब parameters थे[1]। मॉडल को अंग्रेज़ी और अरबी ग्रंथों के मिश्रित corpus पर प्रशिक्षित किया गया था, जिसका आयतन 395 अरब tokens था[3]। अपने लॉन्च के समय इसे «सर्वोच्च गुणवत्ता वाली अरबी LLM» कहा गया[1]।
Jais-30B: पैमाने में वृद्धि
8 नवंबर 2023 को, तीन महीने से भी कम समय में, consortium ने दूसरा, काफ़ी बेहतर संस्करण — Jais-30B — 30 अरब parameters के साथ प्रस्तुत किया[4]। पैमाने में यह वृद्धि सारांशीकरण और अनुवाद जैसे अधिक जटिल व्यावहारिक कार्यों को हल करने की आवश्यकता से प्रेरित थी। मॉडल को एक विस्तृत और परिष्कृत dataset पर प्रशिक्षित किया गया, जिसका आयतन 1.63 ट्रिलियन tokens था[4]।
Jais-70B और मॉडल परिवार
6 अगस्त 2024 को Inception (G42) ने प्रमुख मॉडल Jais-70B (70 अरब parameters) और संबंधित मॉडलों के पूरे परिवार के लॉन्च की घोषणा की[5]। Jais-70B अरबी भाषा पर केंद्रित सबसे बड़ी खुली LLM बनी। इसके विकास में continuous training पद्धति का उपयोग किया गया: शुरू से प्रशिक्षित करने के बजाय, Meta के Llama 2 70B मॉडल को आधार के रूप में लिया गया और उसे अरबी भाषा के 330 अरब tokens पर fine-tune किया गया। इससे Llama 2 से अंग्रेज़ी भाषा के ज्ञान को प्रभावी रूप से स्थानांतरित करना और अरबी प्रशिक्षण पर संसाधन केंद्रित करना संभव हुआ[5]।
आर्किटेक्चर और तकनीकी विशेषताएँ
Jais GPT-3 आर्किटेक्चर (decoder-only) पर आधारित एक autoregressive transformer मॉडल है। मॉडल की प्रमुख विशेषता इसकी अरबी और अंग्रेज़ी में द्विभाषी विशेषज्ञता है, जो कई बहुभाषी LLM से भिन्न है जहाँ अंग्रेज़ी का वर्चस्व रहता है। इससे अरबी भाषा और उसकी बोलियों की गहरी समझ प्राप्त होती है[3]।
Jais के निर्माण में उन्नत तकनीकी समाधान एकीकृत किए गए हैं[3]:
- ALiBi-positioning: Positional embeddings की एक विशेष योजना, जो मॉडल को उससे अधिक लंबे context को संसाधित करने में सक्षम बनाती है जिस पर उसे प्रशिक्षित किया गया था।
- SwiGLU-activation: एक activation function जो प्रशिक्षण की गुणवत्ता और neural layers की अभिव्यक्ति क्षमता को बढ़ाता है।
- Maximal Update Parametrization (µP): Hyperparameters को समायोजित करने की एक विधि जो मॉडल का आकार बढ़ने पर प्रशिक्षण को स्थिर करती है।
- विशेषीकृत tokenizer: अरबी और अंग्रेज़ी भाषाओं की विशेषताओं को ध्यान में रखकर विकसित किया गया, जो सार्वभौमिक tokenizers की तुलना में अरबी पाठ के लिए tokens की संख्या को 3–4 गुना कम करता है और कार्य गति को बढ़ाता है[6]।
Base models (foundation models) के अतिरिक्त, Jais-chat संस्करण भी जारी किया गया, जिसे chatbot और assistant कार्यों के लिए 96 लाख प्रश्न-उत्तर जोड़ियों पर अतिरिक्त fine-tune किया गया है[3]।
प्रशिक्षण और dataset
इस परियोजना की प्रमुख चुनौतियों में से एक अरबी पाठों का एक गुणवत्तापूर्ण और बड़ा corpus तैयार करना था। Jais-13B के लिए अंतिम प्रशिक्षण dataset 395 अरब tokens का था, जिसमें:
- 116 अरब tokens (29%) — अरबी पाठ।
- 279 अरब tokens (71%) — अंग्रेज़ी पाठ और प्रोग्राम कोड।
अरबी घटक को जानबूझकर महत्वपूर्ण (लगभग 30%) रखा गया ताकि भाषा पर उच्च गुणवत्तापूर्ण पकड़ सुनिश्चित हो सके[3]। डेटा में पुस्तकें, समाचार लेख, वेब पेज और स्रोत कोड शामिल थे। उच्च गुणवत्ता वाले अरबी पाठों की मात्रा बढ़ाने के लिए अंग्रेज़ी संसाधनों का मशीनी अनुवाद किया गया[3]।
मॉडलों का प्रशिक्षण अबू धाबी में स्थित सुपरकंप्यूटर Condor Galaxy 1 (CG-1) पर किया गया, जिसे G42 और Cerebras Systems ने संयुक्त रूप से विकसित किया था। इस बुनियादी ढाँचे की बदौलत Jais-13B का प्रशिक्षण केवल लगभग 3.5 दिनों के शुद्ध समय में पूरा हुआ[2]।
उपयोग और महत्त्व
Jais को अरबी भाषा और अन्य भाषाई समुदायों के लिए generative AI के विकास में एक महत्वपूर्ण कदम के रूप में प्रस्तुत किया जाता है, जो आधुनिक LLM में पर्याप्त रूप से प्रतिनिधित्व नहीं पाते। मॉडल तक खुली पहुँच का उद्देश्य मध्य पूर्व और उत्तरी अफ़्रीका के क्षेत्रों में प्राकृतिक भाषा प्रसंस्करण प्रौद्योगिकियों के कार्यान्वयन को प्रोत्साहित करना है।
लॉन्च के बाद से परियोजना ने संयुक्त अरब अमीरात की सरकारी और व्यावसायिक संरचनाओं का ध्यान आकर्षित किया है। मॉडल तक प्रारंभिक पहुँच UAE के विदेश मंत्रालय, तेल और गैस कंपनी ADNOC, एयरलाइन Etihad Airways और First Abu Dhabi Bank को प्रदान की गई[1]। 2024 में Microsoft ने Jais को अपने cloud platform Microsoft Azure पर एकीकृत करने की घोषणा की, जिससे यह वैश्विक उपयोगकर्ताओं के लिए उपलब्ध हो गई[6]।
Jais के निर्माताओं ने अरबी सांस्कृतिक-भाषाई विरासत के संरक्षण में इसकी भूमिका पर ज़ोर दिया है। Inception के कार्यकारी निदेशक Andrew Jackson के शब्दों में, यह परियोजना इसलिए बनाई गई है «ताकि अरबी भाषा, अपनी समृद्ध विरासत के साथ, AI के परिदृश्य में अपनी आवाज़ पा सके»[1]। संचित अनुभव का उपयोग अन्य भाषाओं और संस्कृतियों के लिए समान LLM बनाने में किए जाने की योजना है[1]।
साहित्य
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
टिप्पणियाँ
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [१]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [२]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [३]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [४]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [५]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [६]