IBM Granite (language model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

IBM Granite — यह IBM कॉर्पोरेशन द्वारा कॉर्पोरेट वातावरण में उपयोग के लिए विकसित बड़े भाषा मॉडलों (LLM) की एक श्रृंखला है। Granite मॉडल केवल-डिकोडर आर्किटेक्चर वाले ऑटोरिग्रेसिव transformer हैं, जो दिए गए संदर्भ के आधार पर पाठ उत्पन्न करने में सक्षम हैं[1]

इस परिवार को आधिकारिक रूप से 7 सितंबर 2023 को IBM watsonx.ai क्लाउड प्लेटफ़ॉर्म के लॉन्च के अवसर पर प्रस्तुत किया गया था[2]। IBM, Granite को उद्यमों के लिए खुले, उत्पादक और विश्वसनीय समाधान के रूप में प्रस्तुत करता है, जिसमें प्रशिक्षण डेटा की पारदर्शिता, जोखिम नियंत्रण और व्यावसायिक उपयोग की अनुमति देने वाले लाइसेंसिंग पर विशेष ध्यान दिया जाता है[3]

विकास का इतिहास

Granite मॉडल परिवार, IBM की उस रणनीति का हिस्सा बना जिसके तहत व्यवसायों को साझेदारों के मॉडलों के साथ-साथ अपने स्वयं के जेनरेटिव मॉडल उपलब्ध कराए जाते हैं।

  • सितंबर 2023: watsonx.ai प्लेटफ़ॉर्म पर पहले मॉडलों की आधिकारिक घोषणा और लॉन्च। पहले संस्करण, Granite.13b.instruct और Granite.13b.chat, में लगभग 13 अरब पैरामीटर थे और ये भाषा प्रसंस्करण के प्रमुख कार्यों पर केंद्रित थे[2]
  • मई 2024: IBM ने Apache 2.0 लाइसेंस के तहत कई Granite Code मॉडलों (3 से 34 अरब पैरामीटर तक) का खुला संस्करण जारी करने की घोषणा की। मॉडलों के वज़न Hugging Face प्लेटफ़ॉर्म पर प्रकाशित किए गए, जो खुले AI पारिस्थितिकी तंत्र के समर्थन में एक महत्वपूर्ण कदम था[4]
  • शरद ऋतु 2024: IBM ने Granite 3.0 अपडेट जारी किया, जिसमें छोटे आकार के मॉडल (2 और 8 अरब पैरामीटर) और नई सुविधाएँ शामिल हैं, जो परिवार के विस्तार की दिशा को पुष्ट करती हैं[5]

आर्किटेक्चर और प्रशिक्षण

आर्किटेक्चर

IBM Granite मॉडल transformer डिकोडर (decoder-only) आर्किटेक्चर पर निर्मित हैं, जो GPT मॉडलों के समान है। बेस मॉडल Granite.13b multi-query attention तंत्र का उपयोग करता है और इसकी संदर्भ विंडो 8000 token तक होती है[6]। मॉडलों को self-supervised learning की सहायता से प्रशिक्षित किया जाता है।

प्रशिक्षण डेटा और AI Governance

Granite की एक प्रमुख विशेषता है उद्यमों की आवश्यकताओं के अनुसार चुने गए स्वयं के क्यूरेटेड डेटा कोष का उपयोग। अनेक LLM के विपरीत जो अनफ़िल्टर्ड वेब नमूनों पर प्रशिक्षित होते हैं, Granite को उच्च गुणवत्ता (enterprise-quality) डेटा पर प्रशिक्षित किया गया, जो निम्नलिखित डोमेन को कवर करता है[6]:

  • शैक्षणिक और वैज्ञानिक डेटा: वैज्ञानिक साहित्य, तकनीकी प्रकाशन।
  • प्रोग्राम कोड: अनेक भाषाओं में कोड के संग्रह।
  • विधिशास्त्र: न्यायालय निर्णय, सार्वजनिक रिपोर्ट।
  • वित्त: कंपनियों की वित्तीय रिपोर्ट।
  • इंटरनेट: फ़िल्टरेशन से गुज़रे सामान्य प्रकृति के असंरचित पाठ।

IBM इस बात पर ज़ोर देता है कि विकास में AI Governance (नैतिकता और डेटा प्रबंधन) के कड़े सिद्धांतों का पालन किया गया। डेटा के प्रत्येक भाग को कॉर्पोरेट नीतियों के अनुपालन की जाँच की प्रक्रिया से गुज़ारा गया। अवांछित सामग्री को हटाने के लिए आंतरिक डिटेक्टर «HAP» (Hate and Profanity) के साथ-साथ वेब संसाधनों की स्वचालित ब्लॉक-सूचियों का उपयोग किया गया[1]। IBM ने स्रोतों की सूची के साथ एक विस्तृत तकनीकी रिपोर्ट प्रकाशित की, जो बड़ी प्रौद्योगिकी कंपनियों के लिए एक दुर्लभ कदम है और उच्च स्तर की पारदर्शिता सुनिश्चित करती है।

Granite मॉडल परिवार

IBM Granite परिवार विभिन्न व्यावसायिक कार्यों के लिए कई श्रेणियों के मॉडलों को कवर करता है:

  • भाषा मॉडल (Granite Language Models): पाठ प्रसंस्करण के कार्यों के लिए बेस और निर्देश-फ़ाइन-ट्यून किए गए मॉडल: पाठ उत्पादन, सारांशीकरण, वर्गीकरण आदि।
  • कोड के लिए मॉडल (Granite Code Models): 100+ प्रोग्रामिंग भाषाओं पर प्रशिक्षित विशेष LLM, जो ऑटो-कम्प्लीशन, कोड उत्पादन और सुधार के लिए हैं। ये 3 से 34 अरब पैरामीटर के आकार में उपलब्ध हैं[4]
  • दृष्टि मॉडल (Granite Vision Models): छवियों और दस्तावेज़ों के विश्लेषण, पाठ पहचान और सामग्री समझ के लिए Neural Network।
  • वाक् मॉडल (Granite Speech Models): वाक् पहचान और अनुवाद के लिए कॉम्पैक्ट मॉडल।
  • समय श्रृंखला के लिए मॉडल (Granite for Time Series): समय श्रृंखला के आधार पर पूर्वानुमान के लिए विशेष मॉडल।
  • भू-स्थानिक मॉडल (Granite for Geospatial): उपग्रह चित्रों और अन्य भू-डेटा के विश्लेषण के लिए NASA के सहयोग से विकसित।
  • Embedding मॉडल (Granite Embedding Models): सिमेंटिक खोज और RAG सिस्टम निर्माण के कार्यों के लिए मॉडल।
  • Granite Guardian: अवांछित अनुरोधों की फ़िल्टरिंग और सामग्री निगरानी के लिए डिज़ाइन किया गया विशेष सुरक्षा मॉड्यूल।

खुला कोड और लाइसेंसिंग

IBM ने Granite परिवार की खुलेपन पर महत्वपूर्ण ज़ोर दिया है, इसे बंद प्रोपराइटरी LLM के एक पारदर्शी विकल्प के रूप में प्रस्तुत करते हुए। मई 2024 में कंपनी ने Apache 2.0 लाइसेंस के तहत Granite Code के मूल मॉडल खुले समुदाय को सौंप दिए, जो उन्हें स्वतंत्र रूप से उपयोग, संशोधित और वितरित करने की अनुमति देता है[4]

इस कदम ने, प्रशिक्षण डेटा के बारे में विस्तृत जानकारी के प्रकाशन के साथ, IBM को शोध समुदाय से उच्च प्रशंसा दिलाई। 2024 में मॉडल ने स्टैनफ़ोर्ड विश्वविद्यालय के फ़ाउंडेशन मॉडल पारदर्शिता सूचकांक में अग्रणी स्थान प्राप्त किए[3]

अनुप्रयोग

Granite मॉडल IBM watsonx क्लाउड प्लेटफ़ॉर्म में एकीकृत हैं और विभिन्न कॉर्पोरेट परिदृश्यों में उपयोग किए जाते हैं।

  • खेल विश्लेषण (US Open): अमेरिकी टेनिस संघ (USTA) के सहयोग से IBM, Granite का उपयोग US Open टूर्नामेंट में प्रत्येक मैच के परिणामों पर स्वचालित मैच रिपोर्ट और ऑडियो टिप्पणी बनाने के लिए करता है। यह समाधान मैच समाप्त होने के कुछ ही मिनटों में विस्तृत पाठ समीक्षा तैयार करता है[7]
  • प्रोग्रामरों की सहायता: Granite Code मॉडल IBM watsonx Code Assistant — उपकरणों के एक परिवार का आधार हैं, जो उदाहरण के लिए, IBM Z के लिए पुराने COBOL कोड को आधुनिक माइक्रोसर्विस में स्वचालित रूप से रूपांतरित कर सकते हैं[4]
  • क्षेत्रीय AI अनुप्रयोग: Lockheed Martin ने राष्ट्रीय सुरक्षा कार्यों के लिए Granite मॉडल को अपने AI Factory प्लेटफ़ॉर्म में एकीकृत किया है। ESPN फ़ैंटेसी स्पोर्ट में व्यक्तिगतकृत टिप्पणी उत्पन्न करने के लिए Granite का उपयोग करता है[3]

साहित्य

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

टिप्पणियाँ

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [१]
  2. 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [२]
  3. 3.0 3.1 3.2 «Granite». IBM. [३]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [४]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [५]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [६]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [७]