Open-weight and closed-weight models — खुले और बंद भार वाले मॉडल

From Systems analysis Wiki
Jump to navigation Jump to search

Open-weight और Closed-weight मॉडल — ये बड़े भाषा मॉडलों (LLM) के विकास और वितरण के दो मौलिक रूप से भिन्न दृष्टिकोण हैं, जो आधुनिक कृत्रिम बुद्धिमत्ता पारिस्थितिकी तंत्र में एक प्रमुख द्विभाजन बनाते हैं। इन दृष्टिकोणों के बीच चुनाव तकनीकी संभावनाओं, अर्थव्यवस्था, सुरक्षा और AI के भविष्य के विकास को प्रभावित करता है[1]

अंतर मॉडल के प्रशिक्षित मापदंडों (भारों) की उपलब्धता में निहित है। Open-weight मॉडल अपने भार सार्वजनिक करते हैं, जिससे समुदाय उन्हें उपयोग, संशोधित और स्थानीय रूप से तैनात कर सकता है। Closed-weight मॉडल, इसके विपरीत, भारों को गोपनीय रखते हैं और अपनी क्षमताओं तक पहुँच केवल प्रोप्राइटरी API के माध्यम से प्रदान करते हैं[2]

परिभाषाएँ और प्रमुख अंतर

Open-weight मॉडल (खुले भार वाले मॉडल)

Open-weight मॉडल — ऐसी प्रणालियाँ हैं जिनमें Neural Network के प्रशिक्षित मापदंड (भार) उपयोग, संशोधन और वितरण के लिए सार्वजनिक रूप से उपलब्ध होते हैं। OpenAI के आंद्रेई कार्पाथी की परिभाषा के अनुसार, ऐसा मॉडल "ऑपरेटिंग सिस्टम की बाइनरी फ़ाइल सौंपने" जैसा है — उपयोगकर्ताओं को एक कार्यात्मक उत्पाद मिलता है, लेकिन सामान्यतः प्रशिक्षण के स्रोत कोड या प्रशिक्षण डेटा तक पहुँच के बिना।

मुख्य विशेषताएँ:

  • स्थानीय तैनाती: मॉडल को अपने स्वयं के हार्डवेयर पर चलाने की क्षमता, जो डेटा पर पूर्ण नियंत्रण और गोपनीयता सुनिश्चित करती है।
  • Fine-tuning: विशिष्ट कार्यों और डोमेन के लिए मॉडल को अनुकूलित करने की क्षमता।
  • पारदर्शिता और ऑडिट: शोधकर्ता पूर्वाग्रहों और कमज़ोरियों की पहचान के लिए मॉडल के आंतरिक तंत्र का अध्ययन कर सकते हैं।

Closed-weight मॉडल (बंद भार वाले मॉडल)

Closed-weight मॉडल (जिन्हें प्रोप्राइटरी भी कहा जाता है) — ऐसी प्रणालियाँ हैं जिनके मापदंड व्यावसायिक रहस्य हैं और केवल API या सीमित लाइसेंस के माध्यम से उपलब्ध हैं। OpenAI और Anthropic जैसी विकासकर्ता कंपनियाँ वास्तुकला, प्रशिक्षण विधियों और अनुमान तंत्र पर पूर्ण नियंत्रण रखती हैं। GPT-4 की तकनीकी रिपोर्ट में "प्रतिस्पर्धी वातावरण और बड़े पैमाने के मॉडलों के सुरक्षा परिणामों को ध्यान में रखते हुए" विवरण न प्रकाशित करने का स्पष्ट उल्लेख है[3]

मुख्य विशेषताएँ:

  • केंद्रीकृत नियंत्रण: डेवलपर अपडेट, सुरक्षा और उपयोग नीतियों का प्रबंधन करता है।
  • उपयोग में सरलता: API के माध्यम से पहुँच उपयोगकर्ताओं को जटिल अवसंरचना के प्रबंधन की आवश्यकता से मुक्त करती है।
  • अपारदर्शिता: आंतरिक तंत्र तक पहुँच के अभाव में स्वतंत्र ऑडिट असंभव हो जाता है और गलत या पूर्वाग्रहपूर्ण उत्तरों के कारणों को समझना कठिन हो जाता है।

Open-source से अंतर

open-weight और open-source शब्दों के बीच अंतर करना महत्वपूर्ण है। एक वास्तविक open-source मॉडल में पुनरुत्पादन के लिए आवश्यक सभी कलाकृतियों का प्रकाशन शामिल होता है: भार, वास्तुकला, प्रशिक्षण कोड और dataset। Meta के Llama जैसे अधिकांश आधुनिक "खुले" मॉडल open-weight हैं, लेकिन पूरी तरह open-source नहीं, क्योंकि उनके प्रशिक्षण डेटा और सटीक प्रशिक्षण विधियाँ बंद रहती हैं।

तुलनात्मक विश्लेषण: प्रदर्शन, लागत और नवाचार

प्रदर्शन और कस्टमाइज़ेशन

ऐतिहासिक रूप से, GPT-4 जैसे closed-weight मॉडल सामान्य benchmark पर अग्रणी रहे हैं। हालाँकि, प्रदर्शन का अंतर तेज़ी से कम हो रहा है। Stanford AI Index 2025 के अनुसार, यह पिछले वर्ष में 8% से घटकर 1.7% रह गया है[1]। Meta के LLaMA 3.1 405B और DeepSeek-V3 जैसे शक्तिशाली open-weight मॉडल तुलनीय, और कुछ कार्यों (विशेष रूप से प्रोग्रामिंग में) में बेहतर परिणाम प्रदर्शित करते हैं[4]

Open-weight मॉडलों का प्रमुख लाभ गहरे कस्टमाइज़ेशन में है। विशिष्ट डेटा पर fine-tuning की क्षमता उन्हें चिकित्सा या न्यायशास्त्र जैसे संकीर्ण क्षेत्रों में बड़े लेकिन सार्वभौमिक closed-weight मॉडलों से बेहतर प्रदर्शन करने देती है।

आर्थिक पहलू

  • प्रशिक्षण लागत: अग्रणी (frontier) मॉडलों का निर्माण अत्यंत महँगा है। GPT-4 के प्रशिक्षण का अनुमान $100 मिलियन से अधिक है। DeepSeek-V3 जैसे open-weight मॉडल मात्र $5.5 मिलियन की लागत पर समान प्रदर्शन प्राप्त करते हैं, जिससे शक्तिशाली प्रणालियों के निर्माण तक पहुँच का लोकतंत्रीकरण होता है।
  • उपयोग लागत (inference): Closed-weight मॉडल API के माध्यम से pay-per-use मॉडल पर शुल्क लेते हैं, जो बड़े उपयोग पर उच्च व्यय की ओर ले जा सकता है। स्थानीय रूप से तैनात open-weight मॉडलों के लिए अवसंरचना में प्रारंभिक निवेश की आवश्यकता होती है, लेकिन स्केलिंग पर स्वामित्व की कुल लागत (TCO) काफी कम होती है।

वैज्ञानिक अनुसंधान और नवाचार पर प्रभाव

Open-weight मॉडल पुनरुत्पादनीयता और पहुँच के लोकतंत्रीकरण को सुनिश्चित करके वैज्ञानिक अनुसंधान को मूल रूप से बदल रहे हैं। दुनिया भर के शोधकर्ता खुले मॉडलों का विश्लेषण, आलोचना और सुधार कर सकते हैं, जिससे एक गतिशील पारिस्थितिकी तंत्र बनता है और प्रगति तेज़ होती है। बंद मॉडल, इसके विपरीत, "पुनरुत्पादनीयता का संकट" पैदा करते हैं, क्योंकि घोषित परिणामों को स्वतंत्र रूप से सत्यापित नहीं किया जा सकता।

सुरक्षा और नैतिक दुविधाएँ

सुरक्षा का प्रश्न खुलेपन और नियंत्रण के बीच बहस में केंद्रीय दुविधा है।

  • Closed-weight दृष्टिकोण (केंद्रीकृत रोकथाम): OpenAI और Anthropic जैसे डेवलपर निवारक दृष्टिकोण अपनाते हैं। वे जटिल सुरक्षा फ़िल्टर लागू करते हैं, गहन "red teaming" करते हैं और Anthropic की Responsible Scaling Policy जैसी सख्त नीतियों का पालन करते हैं, जो निश्चित जोखिम सीमाओं से अधिक मॉडलों को तैनात न करने की प्रतिबद्धता जताती है[5]
  • Open-weight दृष्टिकोण (विकेंद्रीकृत लचीलापन): यह दर्शन, जो open-source की दुनिया से मिलता-जुलता है, मानता है कि "अधिक आँखें सभी खामियों को छोटा बनाती हैं"। समुदाय कमज़ोरियों को तेज़ी से खोज और सुधार सकता है। हालाँकि, इससे जोखिम भी उत्पन्न होते हैं: दुर्भावनापूर्ण अभिनेता उतनी ही आसानी से कमज़ोरियों की खोज के लिए मॉडलों का अध्ययन कर सकते हैं या fine-tuning के माध्यम से सुरक्षा तंत्र हटा सकते हैं।

शोध बताते हैं कि मॉडल की उपलब्धता नहीं, बल्कि मानवीय इरादा जोखिम का प्राथमिक कारक है। जनरेटिव AI के दुरुपयोग के दस्तावेज़ीकृत मामलों में से 90% स्वयं प्रणालियों द्वारा उत्पन्न नुकसान से नहीं, बल्कि अनुमत क्षमताओं के शोषण से जुड़े हैं।

नियामक दृष्टिकोण: EU और अमेरिका

  • EU का AI अधिनियम: निवारक, जोखिम-आधारित दृष्टिकोण अपनाता है। यह अधिनियम "प्रणालीगत जोखिम" वाले मॉडलों (जिनके प्रशिक्षण के लिए 1025 से अधिक फ्लॉप्स आवश्यक हों) के लिए कड़े दायित्व लागू करता है, लेकिन ऐसे open-source मॉडलों के लिए सीमित अपवाद प्रदान करता है जो ऐसा जोखिम नहीं रखते। इससे पारदर्शिता के लिए प्रोत्साहन तो मिलता है, साथ ही नियामक जटिलता भी उत्पन्न होती है।
  • अमेरिकी दृष्टिकोण: नवाचार को प्रोत्साहन और उद्योग मानकों के माध्यम से जोखिम प्रबंधन पर आधारित है। राष्ट्रपति बाइडेन का कार्यकारी आदेश 14110 और उसके बाद की NTIA रिपोर्ट open-weight मॉडलों पर तत्काल प्रतिबंध लगाने से बचने की सिफारिश करती है और इसके बजाय तथ्यात्मक डेटा के आधार पर निर्णय लेने के लिए एक निगरानी प्रणाली बनाने का सुझाव देती है[6]

प्रमुख मॉडल और खिलाड़ी

प्रमुख Open-weight और Closed-weight मॉडलों की तुलनात्मक तालिका
मॉडल का प्रकार मॉडल डेवलपर प्रमुख विशेषता
Open-weight LLaMA 3.1 Meta उच्च प्रदर्शन जिसने खुले मॉडलों के लिए मानक स्थापित किया; बड़ा समुदाय।
Mixtral 8x7B Mistral AI \"mixture of experts\" (MoE) वास्तुकला, जो inference पर कम लागत के साथ उच्च प्रदर्शन प्रदान करती है।
Closed-weight GPT-4 / GPT-4o OpenAI प्रदर्शन में ऐतिहासिक अग्रणी, मजबूत मल्टीमॉडल क्षमताएँ।
Claude 4 Opus Anthropic सुरक्षा और नैतिकता पर ध्यान (Constitutional AI), बड़ी context window।

संदर्भ

  • Stanford AI Index Report 2025 — AI की स्थिति पर वार्षिक रिपोर्ट।
  • खुले भार वाले मॉडलों पर NTIA रिपोर्ट

साहित्य

  • OpenAI et al. (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
  • DeepSeek-AI (2025). DeepSeek-V3 Technical Report. arXiv:2412.19437.
  • Kapoor, S.; Bommasani, R. et al. (2024). On the Societal Impact of Open Foundation Models. arXiv:2403.07918.
  • U.S. NTIA (2024). Dual-Use Foundation Models with Widely Available Model Weights. NTIA Report.
  • Stanford HAI (2025). Artificial Intelligence Index Report 2025. Full PDF.
  • Anthropic (2023). Responsible Scaling Policy. Anthropiс RSP.
  • Klyman, K. et al. (2024). A Design Framework for Open-Source Foundation Model Safety. arXiv:2406.10415.
  • Kembery, E.; Reed, T. (2024). AI Safety Frameworks Should Include Procedure for Model Access Decisions. arXiv:2411.10547.
  • European Commission (2024). General-Purpose AI Models in the AI Act – Q&A. EU AI Act FAQ.
  • Zhang, X. et al. (2025). Mitigating Cyber Risk in the Age of Open-Weight LLMs. arXiv:2505.17109.
  • Biderman, S. et al. (2024). Risks and Opportunities of Open-Source Generative AI. arXiv:2405.08597.

टिप्पणियाँ

  1. 1.0 1.1 «Artificial Intelligence Index Report 2025». Stanford University HAI. [१] Проверено 4 июля 2025.
  2. Karpathy, Andrej. «On Open-sourcing LLMs». X (formerly Twitter).
  3. «GPT-4 Technical Report». OpenAI. [२]
  4. «DeepSeek-V2 and DeepSeek-Coder-V2 Technical Report».
  5. «Anthropic's Responsible Scaling Policy». Anthropic.
  6. «Dual-Use Foundation Models with Widely Available Model Weights». U.S. Department of Commerce, NTIA. (2024).