ERNIE (Baidu) — बड़ा भाषा मॉडल

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — पूर्व-प्रशिक्षित भाषा मॉडलों (Large Language Model, LLM) और मल्टीमॉडल फंडामेंटल मॉडलों की एक श्रृंखला है, जिसे Baidu कंपनी द्वारा 2019 से Enhanced Representation through kNowledge IntEgration (ज्ञान एकीकरण के माध्यम से संवर्धित प्रतिनिधित्व) के सामान्य नाम से विकसित किया जा रहा है। यह श्रृंखला Knowledge Graph (KG), ऑन्टोलॉजी और विश्वकोशों से बाहरी ज्ञान के स्पष्ट एकीकरण के माध्यम से अर्थगत समझ और पीढ़ी की गुणवत्ता बढ़ाने पर केंद्रित है।[1][2]

श्रृंखला के मॉडल BERT-आधारित प्रारंभिक संस्करणों से जिनमें सत्ताओं और वाक्यांशों का मास्किंग था (ERNIE 1.0, 2.0), बड़े पैमाने पर एकीकृत आर्किटेक्चर (ERNIE 3.0, ERNIE 3.0 Titan) से लेकर खुले स्रोत कोड के साथ Mixture-of-Experts (MoE) पर आधारित मल्टीमॉडल प्रणालियों (ERNIE 4.5) और नेटिव ऑमनीमॉडल मॉडलों (ERNIE 5.0) तक विकसित हुए हैं। यह श्रृंखला पाठ समझ (Natural Language Understanding, NLU), पाठ पीढ़ी (Natural Language Generation, NLG) और बाद के संस्करणों में मल्टीमॉडल कार्यों (पाठ, चित्र, वीडियो, ऑडियो) का समर्थन करती है, जिसमें चीनी भाषा पर विशेष ध्यान और बहुभाषी समर्थन है।[2][3][4]

इतिहास और पृष्ठभूमि

ERNIE श्रृंखला का विकास 2019 में Baidu के शोध विभाग में BERT मॉडल (Devlin et al., 2018) की सफलता और पूर्व-प्रशिक्षित मॉडलों को चीनी भाषा के अनुकूल बनाने की आवश्यकता के जवाब में शुरू हुआ, जिसमें शब्दों के बीच स्पष्ट रिक्त स्थान की अनुपस्थिति और उच्च अनुपात में बहु-अर्थी वर्णों की उपस्थिति अर्थगत इकाइयों (सत्ताओं, वाक्यांशों) को पकड़ना कठिन बना देती है।[1]

ERNIE 1.0 (2019)

श्रृंखला का पहला मॉडल (Sun et al., arXiv:1904.09223, अप्रैल 2019) ने BERT-जैसी आर्किटेक्चर के लिए बहु-स्तरीय ज्ञान मास्किंग (knowledge masking) की रणनीति प्रस्तुत की: व्यक्तिगत token के यादृच्छिक मास्किंग के बजाय, मॉडल पूरी सत्ताओं और वाक्यांशों को मास्क करता है, जो Named Entity Recognition (NER) और वाक्यांश पैटर्न के आधार पर निर्धारित होते हैं।[1]

ERNIE 1.0 की आर्किटेक्चर Transformer-एन्कोडर (12 परतें, छिपी हुई आयाम 768, 12 attention हेड) पर आधारित है। अतिरिक्त रूप से संवाद डेटा पर प्रशिक्षण के लिए Dialogue Language Model (DLM) कार्य पेश किया गया। मॉडल को Wikipedia, Baidu Baike, समाचार और Baidu Tieba फोरम के कॉर्पस से लगभग 17.3 करोड़ चीनी वाक्यों पर प्रशिक्षित किया गया। प्रकाशन के समय ERNIE 1.0 ने पाँच चीनी NLP कार्यों पर state‑of‑the‑art (SOTA) परिणाम प्राप्त किए: XNLI (परीक्षण में 78.4% सटीकता बनाम BERT की 77.2%), MSRA‑NER (F1 93.8% बनाम 92.6%)।[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412, जुलाई 2019; AAAI 2020 सम्मेलन में स्वीकृत) ने निरंतर बहु-कार्य पूर्व-प्रशिक्षण (continual multi‑task pre‑training) का एक ढाँचा पेश किया, जिसमें साझा Transformer में मॉडल के पूर्ण पुनः प्रशिक्षण के बिना नए पूर्व-प्रशिक्षण कार्य क्रमिक रूप से (incrementally) जोड़े जाते हैं।[5]

ERNIE 2.0 के पूर्व-प्रशिक्षण कार्यों को तीन समूहों में विभाजित किया गया है:

  • Word‑aware — ज्ञान मास्किंग (knowledge masking), अक्षर स्थिति पूर्वानुमान (capitalization prediction), token-दस्तावेज़ संबंध (token‑document relation)।
  • Structure‑aware — वाक्य पुनःक्रमण (sentence reordering), वाक्यों के बीच दूरी निर्धारण (sentence distance)।
  • Semantic‑aware — प्रवचन संबंध पूर्वानुमान (discourse relation prediction), सूचना पुनर्प्राप्ति प्रासंगिकता पूर्वानुमान (IR relevance prediction)।[5]

मॉडल को अंग्रेजी और चीनी कॉर्पस (विश्वकोश, पुस्तकें, Reddit, खोज लॉग) पर प्रशिक्षित किया गया। परिणाम: base-मॉडल के लिए GLUE का औसत स्कोर 80.6 (BERT के 78.3 के विरुद्ध), large-मॉडल के लिए — 83.6; ERNIE 2.0 ने 16 कार्यों में BERT और XLNet को पीछे छोड़ा।[5]

ERNIE 3.0 (2021)

ERNIE 3.0 ढाँचे (Sun et al., arXiv:2107.02137, जुलाई 2021) ने ऑटो-एन्कोडिंग (auto‑encoding, AE) और ऑटो-रिग्रेसिव (auto‑regressive, AR) पूर्व-प्रशिक्षण प्रतिमानों को एक एकीकृत आर्किटेक्चर में जोड़ा, जो Universal Representation Module और NLU और NLG के लिए Task‑specific Representation Modules में विभाजित है।[2]

10 अरब पैरामीटर वाले मॉडल को 4 TB चीनी पाठ (11 श्रेणियाँ: Baidu Baike, Wikipedia, खोज लॉग, प्रश्नोत्तर प्रणालियाँ, डोमेन पाठ) और 5 करोड़ से अधिक तथ्यों वाले knowledge graph पर प्रशिक्षित किया गया। ERNIE 3.0 ने 54 चीनी NLP कार्यों पर SOTA हासिल किया; अंग्रेजी SuperGLUE बेंचमार्क पर — 90.6% (3 जुलाई 2021 की स्थिति के अनुसार, मानव संदर्भ 89.8% से अधिक)।[2]

ERNIE 3.0 Titan (2021)

"ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, दिसंबर 2021) के कार्य में ERNIE 3.0 ढाँचे को PaddlePaddle प्लेटफॉर्म पर कार्यान्वित 260 अरब पैरामीटर वाले dense मॉडल तक स्केल करने का वर्णन है।[6]

Titan ने अतिरिक्त तंत्र पेश किए: उत्पन्न पाठ की विश्वसनीयता का मूल्यांकन करने के लिए self-supervised adversarial loss, पीढ़ी की शैली, विषय, भाव और लंबाई को नियंत्रित करने के लिए controllable language modeling loss, और पूर्व-प्रशिक्षण के दौरान compact student मॉडल प्राप्त करने के लिए ऑनलाइन डिस्टिलेशन (On‑the‑Fly Distillation, OFD)। मॉडल का मूल्यांकन 68 डेटासेट पर किया गया और लेखकों के अनुसार, सभी 68 डेटासेट पर पिछले मॉडलों से बेहतर प्रदर्शन किया।[6]

ERNIE Bot और व्यावसायिक संस्करण (2023–2025)

मार्च 2023 में Baidu ने ERNIE 3.x और PLATO (संवाद मॉडल) मॉडलों पर आधारित चैटबॉट ERNIE Bot (Wenxin Yiyan, 文心一言) लॉन्च किया। नियामकों की स्वीकृति के बाद अगस्त 2023 में सार्वजनिक पहुँच खोली गई। अपडेट में ERNIE 3.5 (जून 2023) और ERNIE 4.0 (अक्टूबर 2023) शामिल थे।[7][8]

सिंघुआ विश्वविद्यालय के SuperBench रिपोर्ट के अनुसार, ERNIE Bot 4.0 ने एकीकृत मीट्रिक पर चीनी LLM में पहला स्थान प्राप्त किया, जो चीनी भाषा की समझ और निर्देश-पालन में मजबूत परिणाम दर्शाता है।[9][10]

2022 में मुख्य भाषा श्रृंखला के साथ-साथ मल्टीमॉडल विस्तार ERNIE‑ViLG 2.0 (arXiv:2210.15257) प्रस्तुत किया गया — एक text-to-image पीढ़ी मॉडल, जो मल्टीमॉडलिटी की दिशा में पहले कदमों में से एक था।[11]

2024 में WAVE SUMMIT सम्मेलन में Baidu ने ERNIE 4.0 Turbo प्रस्तुत किया — उच्च-गति अनुप्रयोगों के लिए एक अनुकूलित संस्करण, जो गुणवत्ता बनाए रखते हुए लगभग 20 सेकंड में एक हजार से अधिक शब्दों का पाठ उत्पन्न करने में सक्षम है।[12]

ERNIE 4.5 (2025)

जून 2025 में Baidu ने ERNIE 4.5 का तकनीकी रिपोर्ट प्रकाशित किया, जो 10 मॉडलों का एक परिवार प्रस्तुत करता है: पाठ LLM और मल्टीमॉडल मॉडल (Vision‑Language, VL)। आर्किटेक्चर मॉडलिटी द्वारा विशेषज्ञों के विभाजन के साथ heterogeneous Mixture-of-Experts (MoE) पर आधारित है। इसमें 424 अरब कुल और 47 अरब सक्रिय पैरामीटर तक के MoE-मॉडल और 0.3 अरब पैरामीटर का dense मॉडल शामिल हैं। परिवार को Hugging Face और GitHub (PaddlePaddle/ERNIE) पर Apache 2.0 लाइसेंस के तहत जारी किया गया है।[3]

ERNIE 5.0 (2026)

फरवरी 2026 में ERNIE 5.0 का तकनीकी रिपोर्ट (arXiv:2602.04705) प्रकाशित किया गया — यह ultra‑sparse MoE के साथ एक नेटिव ऑमनीमॉडल ऑटो-रिग्रेसिव मॉडल है, जो पाठ, चित्र, ऑडियो और वीडियो के संयुक्त मॉडलिंग का समर्थन करता है। मॉडल LMArena लीडरबोर्ड पर उच्च स्थानों पर था।[4][13]

सैद्धांतिक आधार और वास्तुकला सिद्धांत

ज्ञान मास्किंग (Knowledge Masking)

श्रृंखला के प्रारंभिक मॉडलों का मुख्य सिद्धांत — संशोधित मास्किंग रणनीतियों के माध्यम से पूर्व-प्रशिक्षण प्रक्रिया में संरचित ज्ञान का एकीकरण। मानक Masked Language Modeling (MLM) के विपरीत, जहाँ व्यक्तिगत token मास्क किए जाते हैं, ERNIE 1.0 पूरी अर्थगत इकाइयों को मास्क करता है: सत्ताएँ (NER के माध्यम से निर्धारित) और वाक्यांश। सत्ता E={t1,,tk} के लिए, एक निर्दिष्ट संभावना p के साथ token की पूरी अनुक्रम मास्क की जाती है। यह दृष्टिकोण मॉडल को व्यापक संदर्भ पर निर्भर रहने और सत्ताओं के बीच संबंध सीखने के लिए विवश करता है।[1]

ERNIE 2.0 ने incremental बहु-कार्य प्रशिक्षण जोड़कर इस दृष्टिकोण को विकसित किया: शब्द-स्तर, संरचनात्मक और अर्थगत स्तर के कार्य क्रमिक रूप से जोड़े जाते हैं, जबकि पहले सीखा गया ज्ञान निरंतर पूर्व-प्रशिक्षण (continual pre‑training) तंत्र के माध्यम से संरक्षित रहता है।[5]

ERNIE 3.0 का एकीकृत ढाँचा

ERNIE 3.0 ढाँचा आर्किटेक्चर को दो स्तरों में विभाजित करने पर आधारित है:[2][6]

  • Universal Representation Module — एक सामान्य बहु-परत Transformer‑XL, जो विभिन्न पूर्व-प्रशिक्षण कार्यों पर प्रशिक्षित है और सामान्य शाब्दिक और वाक्यात्मक विशेषताएँ निकालता है। Titan संस्करण में इस मॉड्यूल में 48 परतें, 12288 का छिपा प्रतिनिधित्व आकार, 192 attention हेड और feed‑forward नेटवर्क का आंतरिक आकार 196608 है (16×dmodel)।
  • Task‑specific Representation Modules — NLU (द्विदिशात्मक attention) और NLG (Transformer‑XL आवर्ती स्मृति के साथ एकदिशात्मक attention) के लिए अलग मॉड्यूल, प्रत्येक में 12 परतें, 768 का छिपा वेक्टर आकार और 12 attention हेड।

ऑटो-एन्कोडिंग और ऑटो-रिग्रेसिव प्रतिमानों के एकीकरण से एक मॉडल NLU-बेंचमार्क (BERT-जैसे कार्य) और NLG-बेंचमार्क (GPT-जैसे कार्य) दोनों पर उच्च परिणाम प्रदान कर सकता है।[2]

Universal Knowledge‑Text Prediction (UKTP)

UKTP कार्य ERNIE 3.0/Titan में ज्ञान एकीकरण का केंद्रीय तंत्र है। मॉडल को एक जोड़ी (knowledge graph से त्रिक, विश्वकोश से वाक्य) प्राप्त होती है और उसे या तो पाठ का उपयोग करके त्रिक में संबंध पूर्वानुमानित करना होता है, या त्रिक की जानकारी का उपयोग करके पाठ में मास्क किए गए token पूर्वानुमानित करने होते हैं।[6]

पाठ x से जुड़े त्रिक (h,r,t) में संबंध r के पूर्वानुमान में, कार्य को बहु-वर्गीय वर्गीकरण के रूप में तैयार किया जाता है:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

जहाँ fθ — प्रमुख और अनुगामी सत्ता उल्लेखों की स्थिति पर Transformer का आउटपुट है, W,b — वर्गीकरणकर्ता के पैरामीटर हैं, θ — मॉडल के पैरामीटर हैं।[6]

विश्वसनीय और नियंत्रित पीढ़ी के तंत्र (Titan)

ERNIE 3.0 Titan ने दो अतिरिक्त प्रकार के हानि फलन पेश किए।[6]

Self-supervised adversarial loss। एक डेटासेट Da={Doriginal,Dgenerated} बनाया जाता है, जहाँ Doriginal — वास्तविक अनुच्छेद हैं, और Dgenerated — मूल अनुच्छेदों के उपसर्ग से ERNIE के पिछले संस्करण द्वारा उत्पन्न पाठ हैं। कार्य — विशेष [CLS] token की छिपी अवस्था पर आधारित बाइनरी वर्गीकरण (मूल / उत्पन्न) है:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

जहाँ h[CLS](n)n-वें उदाहरण के लिए [CLS] का वेक्टर प्रतिनिधित्व है, I — मूल पाठों से संबंधित होने का संकेतक है।[6]

Controllable language modeling loss। प्रत्येक प्रशिक्षण उदाहरण के साथ शैली, विषय, कीवर्ड, भाव और लंबाई का वर्णन करने वाले गुणों (prompt) का एक समूह होता है। हानि बिना शर्त और शर्त-सहित भाषा मॉडलिंग को जोड़ती है:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

जहाँ p — मोड चक्रण के लिए एक यादृच्छिक चर है, xt(n)n-वें उदाहरण का t-वाँ token है। यह परिभाषा मॉडल की prompt पर अत्यधिक निर्भरता को रोकती है।[6]

Heterogeneous MoE आर्किटेक्चर (ERNIE 4.5)

ERNIE 4.5 मॉडलिटी द्वारा विशेषज्ञों के विभाजन के साथ heterogeneous मल्टीमॉडल Mixture-of-Experts आर्किटेक्चर पेश करता है: पाठ विशेषज्ञ और दृश्य विशेषज्ञ (बाद वाले पाठ विशेषज्ञों के आकार का लगभग 1/3 हैं)। Token रूटिंग मॉडलिटी-पृथक रूटिंग (modality‑isolated routing) और विशेषज्ञ विशेषज्ञता सुनिश्चित करने के लिए router orthogonalization loss (लगभग 103 के गुणांक के साथ) के साथ की जाती है। वीडियो डेटा में समयिक, ऊँचाई और चौड़ाई आयामों के स्थितिगत एन्कोडिंग के लिए 3D RoPE (Rotary Position Embeddings) का उपयोग किया जाता है। FlashMask तंत्र O(N) मास्क के साथ लंबे संदर्भ (1,31,000 token तक) के कुशल प्रसंस्करण के लिए उपयोग किया जाता है।[3]

ERNIE 4.5 का पूर्व-प्रशिक्षण कई चरणों में होता है: पहले केवल पाठ डेटा पर प्रशिक्षण, फिर दृश्य डेटा पर, और अंतिम चरण में — मल्टीमॉडल डेटा पर संयुक्त प्रशिक्षण (text‑only → vision‑only → joint)। छवि प्रसंस्करण के लिए विभिन्न मॉडलिटी के प्रतिनिधित्व को संरेखित करने के लिए pixel shuffle तंत्र के साथ adaptive ViT-एन्कोडर (Vision Transformer) का उपयोग किया जाता है। लंबे वीडियो प्रसंस्करण (32,000 token तक) adaptive frame sampling के साथ समर्थित है।[3]

नेटिव ऑमनीमॉडलिटी (ERNIE 5.0)

ERNIE 5.0 ultra‑sparse MoE के साथ एकल आर्किटेक्चर में कई मॉडलिटी (पाठ, चित्र, ऑडियो, वीडियो) के नेटिव ऑटो-रिग्रेसिव मॉडलिंग को लागू करता है, जिसमें प्रत्येक चरण पर कुल विशेषज्ञों के 3% से कम सक्रिय होते हैं। पूर्व-प्रशिक्षण कार्य के रूप में Next‑Group‑of‑Tokens Prediction का उपयोग किया जाता है — एक के बजाय token के समूह का पूर्वानुमान, जो प्रशिक्षण दक्षता बढ़ाता है। ऑडियो मॉडलिटी के लिए hierarchical codec का उपयोग किया जाता है। Elastic training प्रौद्योगिकी एकल प्रशिक्षण रन के भीतर विभिन्न गहराई, चौड़ाई और विरलता की उप-मॉडल उत्पन्न करने की अनुमति देती है।[4]

पूर्व-प्रशिक्षण कार्य और डेटा

ERNIE 3.0 / Titan के पूर्व-प्रशिक्षण कार्य

ERNIE 3.0 और Titan में निम्नलिखित पूर्व-प्रशिक्षण कार्यों के समूह उपयोग किए जाते हैं:[2][6]

Word‑aware कार्य:

  • Knowledge Masked Language Modeling — स्थानीय और वैश्विक संदर्भों पर निर्भरता सीखने के लिए वाक्यांश और सत्ता मास्किंग।
  • Document Language Modeling — Transformer‑XL आवर्ती स्मृति के उपयोग से 512 token तक की लंबाई वाले दस्तावेजों का ऑटो-रिग्रेसिव मॉडलिंग।

Structure‑aware कार्य:

  • Sentence Reordering — एक अनुच्छेद के लिए जो m खंडों में यादृच्छिक रूप से विभाजित और फेरबदल किया गया है, मॉडल k-वर्गीय वर्गीकरण की समस्या को k=n=1mn! के साथ हल करता है, मूल क्रम को पुनर्स्थापित करता है।
  • Sentence Distance — 3-वर्गीय वर्गीकरण: समीपवर्ती वाक्य, उसी दस्तावेज़ में गैर-समीपवर्ती, अलग-अलग दस्तावेजों से वाक्य।

Knowledge‑aware कार्य:

  • Universal Knowledge‑Text Prediction (UKTP) — पाठ और knowledge graph त्रिक का संयुक्त मॉडलिंग।
  • Credible and Controllable Generations — adversarial loss और controllable LM loss का संयोजन।

पूर्व-प्रशिक्षण डेटा

ERNIE 3.0/Titan के लिए ERNIE 3.0 Corpus का उपयोग किया जाता है — 11 श्रेणियों में लगभग 4 TB का चीनी कॉर्पस, जिसमें वेब-पेज, खोज लॉग, प्रश्नोत्तर डेटा, साहित्यिक, कानूनी, वित्तीय और चिकित्सा पाठ, उपन्यास और कविता शामिल हैं। कॉर्पस के ऊपर 5 करोड़ से अधिक तथ्यों वाला knowledge graph बनाया गया है।[2][6]

Titan के लिए अतिरिक्त रूप से बनाए जाते हैं:

  • Adversarial dataset — 20 लाख मूल अनुच्छेद और संबंधित "नकारात्मक" अनुच्छेद जो मूल के पहले 1-3 वाक्यों के उपसर्ग से ERNIE 3.0 द्वारा 512 token तक की लंबाई में उत्पन्न किए गए हैं।
  • Controllable dataset — शैली, विषय (26 विषय), कीवर्ड, भाव (positive/negative/neutral) और लंबाई के गुणों से युक्त पाठ। शैली के गुण प्रशिक्षण योग्य "soft prompt" (शैली के लिए prompt की संख्या 0 से 64 के बीच यादृच्छिक रूप से चुनी जाती है) के रूप में एन्कोड किए जाते हैं।[6]

बाद के संस्करण (ERNIE 4.5, 5.0) विस्तारित मल्टीमॉडल कॉर्पस (पाठ, चित्र, वीडियो, ऑडियो) का उपयोग करते हैं, जिसमें क्यूरेटेड वेब-सामग्री, वैज्ञानिक प्रकाशन और सिंथेटिक डेटा शामिल हैं।[3][4]

प्रशिक्षण और वितरित अनुकूलन

ERNIE 3.0 Titan का पूर्व-प्रशिक्षण Adam ऑप्टिमाइज़र (सीखने की दर 104, β1=0,9, β2=0,95, L2-नियमितीकरण 0.1, gradient norm clipping 1.0 तक), अधिकतम संदर्भ लंबाई 512 और पीढ़ी कार्यों के लिए आवर्ती स्मृति लंबाई 128 के साथ किया गया। प्रगतिशील प्रशिक्षण योजना (पहले 4000 चरणों में त्वरित अभिसरण) और सीखने की दर का रैखिक ह्रास लागू किया गया।[6]

4D-हाइब्रिड समानांतरीकरण

विषमांगी क्लस्टर (GPU NVIDIA V100 और NPU Ascend 910) पर 260 अरब पैरामीटर वाले dense मॉडल के प्रशिक्षण के लिए PaddlePaddle में 4D-हाइब्रिड समानांतरीकरण लागू किया गया:[6]

  • Data parallelism (DP) — अलग-अलग batch प्रसंस्करण के साथ कई उपकरणों पर मॉडल की प्रतिकृति।
  • Tensor model parallelism (MP) — उपकरणों पर परतों के अंदर Transformer के पैरामीटर और activations का विभाजन।
  • Pipeline model parallelism (PP) — पाइपलाइन पर मॉडल परतों का वितरण।
  • Group Sharded — ऑप्टिमाइज़र अवस्थाओं के दोहराव को कम करने के लिए ZeRO-जैसे sharded-data-parallel का उन्नत संस्करण।

रिपोर्ट में 91.7% throughput दक्षता के साथ हजारों Ascend 910 कार्ड तक weak scaling के डेटा प्रदान किए गए हैं।[6]

ERNIE 4.5 का प्रशिक्षण

ERNIE 4.5 का प्रशिक्षण 2016 GPU NVIDIA H800 के क्लस्टर पर किया गया था, जिसमें Model FLOPs Utilization (MFU) 47% हासिल की गई। FP8 मिश्रित परिशुद्धता, fault-tolerant checkpoints (Zero Cost Checkpoint, 8 मिनट से कम में पुनर्प्राप्ति) और अनुक्रम लंबाई और batch आकार बढ़ाने के साथ प्रगतिशील प्रशिक्षण का उपयोग किया गया।[3]

ऑनलाइन डिस्टिलेशन

ERNIE 3.0 Titan की deployment के लिए कम्प्यूटेशनल संसाधन आवश्यकताओं को कम करने के लिए ऑनलाइन डिस्टिलेशन का उपयोग किया जाता है, जिसमें teacher मॉडल और कई student मॉडल एक साथ प्रशिक्षित होते हैं:[6]

  • On‑the‑Fly Distillation (OFD) — teacher के logits और प्रतिनिधित्व का उपयोग प्रशिक्षण के उन्हीं चरणों पर student को प्रशिक्षित करने के लिए किया जाता है।
  • Teacher assistants — teacher और अंतिम student के बीच क्षमता के अंतर को कम करने वाले मध्यवर्ती आकार के मॉडल।
  • Auxiliary Layer Distillation (ALD) — student में एक अतिरिक्त परत, जिसे fine‑tuning के दौरान हटा दिया जाता है, आंतरिक प्रतिनिधित्व के बेहतर मिलान के लिए।

पोस्ट-प्रशिक्षण और संरेखण

ERNIE के व्यावसायिक संस्करण (ERNIE Bot से शुरू होकर) पोस्ट-प्रशिक्षण चरणों से गुजरते हैं:[7][3]

  • Supervised Fine‑Tuning (SFT) — लेबल किए गए निर्देशात्मक डेटा पर fine-tuning (ERNIE 4.5 में — 23 लाख उदाहरण)।
  • Reinforcement Learning from Human Feedback (RLHF) — मानव प्रतिक्रिया की सहायता से मॉडल के व्यवहार का संरेखण; PPO (Proximal Policy Optimization) और DPO (Direct Preference Optimization) एल्गोरिदम लागू किए जाते हैं।
  • Unified Preference Optimization (UPO) — ERNIE 4.5 में पेश की गई प्राथमिकता अनुकूलन की एकीकृत विधि।
  • Reinforcement Learning with Verifiers (RLVR) — उत्तरों की शुद्धता जाँचने के लिए verifier के उपयोग के साथ प्रबलन सीखना; GRPO (Group Relative Policy Optimization) विधि लागू की जाती है।
  • तर्क मोड (thinking modes) — 4.5 मॉडल reflection, planning के साथ और उसके बिना दोनों मोड का समर्थन करते हैं।

मुख्य परिणाम और बेंचमार्क

मॉडल विकास की सारांश तालिका

संस्करण वर्ष पैरामीटर आर्किटेक्चर मुख्य बेंचमार्क स्रोत
ERNIE 1.0 2019 ~110 मिलियन (base) Transformer-एन्कोडर (BERT-जैसा) XNLI 78.4%; MSRA‑NER F1 93.8% [1]
ERNIE 2.0 2019 ~110–340 मिलियन Continual multi‑task GLUE 80.6 (base) / 83.6 (large); 16 कार्यों में SOTA [5]
ERNIE 3.0 2021 10 अरब Unified Transformer‑XL (AE+AR) SuperGLUE 90.6% (> मानव 89.8%); 54 चीनी कार्यों में SOTA [2]
ERNIE 3.0 Titan 2021 260 अरब (dense) Dense + controllable generation 68 डेटासेट में SOTA; zero/few‑shot [6]
ERNIE 4.5 2025 0.3–424 अरब (MoE, 47 अरब सक्रिय) Heterogeneous multimodal MoE C‑Eval 90.6%; MMLU 86.5%; MMMU 67.3–70% [3]
ERNIE 5.0 2026 ~2.4 ट्रिलियन (ultra‑sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (वैश्विक शीर्ष-10) [4]

ERNIE 3.0 और Titan के परिणाम

ERNIE 3.0 (10 अरब पैरामीटर) ने अंग्रेजी SuperGLUE बेंचमार्क पर 90.6 का औसत परिणाम हासिल किया, जो मानव संदर्भ (89.8) और प्रकाशन के समय GPT‑3, T5 और DeBERTa के परिणामों से अधिक है। ERNIE 3.0 Titan (260 अरब) का मूल्यांकन 68 डेटासेट पर किया गया, जिसमें वर्गीकरण, NLI, QA और पीढ़ी कार्य शामिल थे; लेखक सभी 68 डेटासेट पर पिछले मॉडलों से श्रेष्ठता की सूचना देते हैं। ये परिणाम प्राथमिक स्रोत डेटा हैं; स्वतंत्र पुनरुत्पादन सीमित रूप से वर्णित है।[2][6]

ERNIE 4.5 के परिणाम

2025 के तकनीकी रिपोर्ट के अनुसार, ERNIE 4.5 (300B‑A47B, पोस्ट-ट्रेनिंग) पाठ और मल्टीमॉडल बेंचमार्क पर निम्नलिखित परिणाम दर्शाता है:[3]

बेंचमार्क ERNIE‑4.5‑300B‑A47B शर्तें
C‑Eval 90.6% 5‑shot
CMMLU 90.2%
MMLU 86.5% मानक
IFEval 88.0% instruction following
GSM8K 91.8%
MMMU 67.3–70.0% non‑thinking / thinking
MathVista 78.8% thinking mode
OCRBench 883

रिपोर्ट के अनुसार, ERNIE 4.5 ने 28 में से 22 बेंचमार्क पर DeepSeek‑V3 को पीछे छोड़ा; मल्टीमॉडल संस्करणों (ERNIE‑4.5‑VL‑424B‑A47B) ने दृश्य तर्क कार्यों पर प्रतिस्पर्धी परिणाम दिखाए। कुछ दृश्य तर्क और तकनीकी छवि व्याख्या कार्यों (योजनाओं, इंजीनियरिंग आरेखों का विश्लेषण) में कुछ GPT और Gemini मॉडलों से अधिक परिणाम सूचित किए जाते हैं।[3][14]

ERNIE 4.5 की प्रतिस्पर्धियों से तुलना (चयनित बेंचमार्क, पोस्ट-ट्रेनिंग, 2025 के तकनीकी रिपोर्ट के अनुसार):

बेंचमार्क ERNIE‑4.5‑300B‑A47B DeepSeek‑V3‑671B‑A37B Qwen3‑235B‑A22B टिप्पणी
C‑Eval 90.6% 5‑shot
MMLU 86.5% तुलनीय मानक
IFEval 88.0% 83.2% instruction following
MMMU 67.3–70.0% thinking / non‑thinking
MathVista 78.8% 77.6% (Qwen2.5‑VL) thinking mode

पुनरुत्पादन की शर्तें: मानक प्रोटोकॉल (5‑shot / zero‑shot); डेटासेट खुले हैं (C‑Eval 2023+, MMLU, MMMU)। डैश ("—") का अर्थ है कि रिपोर्ट में उन्हीं शर्तों पर तुलनीय डेटा प्रदान नहीं किए गए हैं।[3]

ERNIE Bot 4.0 के मूल्यांकन

सिंघुआ विश्वविद्यालय की SuperBench रिपोर्ट कार्यों के एक सेट (भाषा समझ, गणित, प्रोग्रामिंग, बहु-कार्य) पर व्यावसायिक LLM को रैंक करती है। ERNIE Bot 4.0 ने चीनी मॉडलों में पहला स्थान हासिल किया, एकीकृत मीट्रिक पर GLM‑4 (Zhipu AI) से लगभग 0.41 अंक आगे रहा; GPT‑4 और Anthropic Claude‑3 वैश्विक रैंकिंग में ऊपर बने रहे। ERNIE Bot 4.0 ने चीनी पाठ समझ और निर्देश-पालन में मजबूत परिणाम दिखाए, जबकि प्रोग्रामिंग और कुछ अंग्रेजी कार्यों में कमज़ोर प्रदर्शन रहा।[9][10]

अनुप्रयोग

Baidu के उत्पाद और सेवाएँ

ERNIE श्रृंखला के मॉडल Baidu के उत्पाद पारिस्थितिकी तंत्र में एकीकृत हैं:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — मल्टीमॉडल पीढ़ी (पाठ, चित्र, वीडियो, ऑडियो) समर्थन वाला चैटबॉट। Baidu के अनुसार, मासिक सक्रिय उपयोगकर्ताओं की संख्या 20 करोड़ से अधिक है (2024–2025)। 2025 से ERNIE Bot निःशुल्क उपलब्ध है।[7]
  • Baidu खोज — खोज परिणामों में उत्तर पीढ़ी और AI-फ़ंक्शन; Baidu के अनुसार, 70% तक शीर्ष परिणाम AI-घटकों से समृद्ध हैं।
  • Qianfan (MaaS-प्लेटफॉर्म) — कॉर्पोरेट ग्राहकों के लिए API; Baidu के अनुसार, 7,60,000 से अधिक उद्यम प्लेटफॉर्म का उपयोग करते हैं, दैनिक API कॉल की संख्या 1.5 अरब से अधिक है (2024)। ग्राहकों में Lenovo, Trip.com और अन्य शामिल हैं।[7]
  • Comate — प्रोग्रामिंग के लिए AI-सहायक।
  • Wenxin Yige — ERNIE‑ViLG मॉडलों पर आधारित चित्र पीढ़ी।[11]
  • बाहरी भागीदारों के साथ एकीकरण: Samsung Galaxy (चीनी बाजार के लिए), डिजिटल अवतार, plugins (खोज, फ़ाइल विश्लेषण)।[7]

उद्योग अनुप्रयोग

मॉडल निम्नलिखित क्षेत्रों में उपयोग किए जाते हैं:[7][3]

  • ज्ञान-संवर्धित पूर्व-प्रशिक्षण का उपयोग करके डोमेन क्षेत्रों (कानून, चिकित्सा, वित्त) में प्रश्नोत्तर प्रणालियाँ।
  • चीनी भाषा में पाठ पीढ़ी और संपादन (समाचार, विपणन पाठ, रचनात्मक सामग्री)।
  • मल्टीमॉडल कार्य: चित्र, इंजीनियरिंग योजनाओं, वीडियो और सारणीबद्ध डेटा का विश्लेषण (संस्करण 4.5 और उससे ऊपर)।
  • शिक्षा (व्यक्तिगत प्रशिक्षण), रोबोटिक्स (कार्य नियोजन), स्वायत्त ड्राइविंग (Apollo)।

खुला कोड

ERNIE 4.5 से शुरू होकर, परिवार के सभी 10 संस्करण Apache 2.0 लाइसेंस के तहत ERNIEKit टूलकिट (SFT, LoRA, DPO, PaddlePaddle/FastDeploy पर inference समर्थन) के साथ जारी किए गए हैं। पहले के संस्करणों (ERNIE 1.0–3.0) का कोड GitHub PaddlePaddle/ERNIE पर उपलब्ध है।[3][15]

सीमाएँ और खुली समस्याएँ

वास्तुकला और डेटासेट की सीमाएँ

ERNIE 3.0 Titan 260 अरब पैरामीटर के बावजूद अलग-अलग मॉड्यूल के लिए 512 token की संदर्भ लंबाई तक सीमित है, जो अतिरिक्त तंत्र (chunking, बाहरी स्मृति) के बिना लंबे पाठों के मॉडलिंग को सीमित करती है। प्रशिक्षण मुख्य रूप से चीनी कॉर्पस पर किया जाता है, जो चीनी और अन्य भाषाओं के बीच गुणवत्ता में असमानता उत्पन्न करता है।[6]

Knowledge graph एकीकरण संरचित तथ्यों के साथ कार्य को बेहतर बनाता है, लेकिन ज्ञान की सटीकता और पूर्णता ग्राफ की गुणवत्ता और "त्रिक–पाठ" मिलान प्रक्रिया (entity linking, relation alignment) द्वारा सीमित है, जो कुछ मामलों में त्रुटिपूर्ण या अपूर्ण संबंध उत्पन्न करती है।[6]

भ्रम और विश्वसनीयता

Adversarial loss और controllable LM loss असत्य पीढ़ी के प्रति प्रतिरोध में सुधार करते हैं, लेकिन भ्रम (तथ्यात्मक रूप से गलत कथनों की पीढ़ी) की समस्या को पूरी तरह समाप्त नहीं कर पाते। adversarial-वर्गीकरणकर्ता के पैरामीटर उस डेटा पर प्रशिक्षित होते हैं जहाँ "उत्पन्न" पाठ ERNIE के पिछले संस्करण द्वारा बनाया जाता है, जो पहचाने जाने वाले त्रुटि पैटर्न के दायरे को सीमित करता है।[6]

सामाजिक पूर्वाग्रह

PeerJ Computer Science (2025) में प्रकाशित एक अध्ययन 240 सामाजिक समूहों और 30,000 से अधिक उत्पन्न विवरणों का उपयोग करके चीनी LLM (ERNIE और Qwen) में सामाजिक पूर्वाग्रहों का विश्लेषण करता है। परिणाम दर्शाते हैं कि ERNIE, Baidu Search या Qwen की तुलना में कम नकारात्मक और रूढ़िबद्ध सामग्री उत्पन्न करता है (Qwen के 1/3 की तुलना में ERNIE में लगभग 1/10 नकारात्मक अर्थ वाले उम्मीदवार शब्द)। हालाँकि, संभावित अपमानजनक विवरणों सहित कुछ रूढ़िवादिता की व्यापकता बनी रहती है।[16][17]

पुनरुत्पादनीयता

श्रृंखला के कुछ मॉडल (ERNIE 3.0 Titan, व्यावसायिक ERNIE Bot 4.0 और 5.0) पूरी तरह खुले कोड और weights के रूप में उपलब्ध नहीं हैं, जो बेंचमार्क की पुनरुत्पादनीयता और स्वतंत्र मूल्यांकन की संभावना को सीमित करता है। Apache 2.0 के तहत ERNIE 4.5 के जारी होने से स्थिति में सुधार हुआ, लेकिन आर्किटेक्चर और प्रशिक्षण सेटिंग प्रारंभिक प्रकाशनों में वर्णित से भिन्न हो सकती हैं।[3][6]

चिकित्सा सुरक्षा

चिकित्सा परिदृश्यों में ERNIE Bot के उपयोग पर शोध (Si et al., 2025) में अत्यधिक नुस्खों की प्रवृत्ति सामने आई: मॉडल परिदृश्यों में 91.9% अनावश्यक परीक्षण और 57.8% अनावश्यक दवाएँ, साथ ही सिफारिशों में आयु और सामाजिक-आर्थिक असमानताएँ।[18]

नैतिक और नियामक पहलू

ERNIE श्रृंखला के मॉडल चीनी generative AI विनियमन के ढाँचे के भीतर कार्य करते हैं, विशेष रूप से "Interim Measures for Generative AI Services" (जेनरेटिव AI सेवाओं के प्रबंधन के अंतरिम उपाय, 2023), जो अनिवार्य सुरक्षा मूल्यांकन, एल्गोरिदम पंजीकरण और सामग्री प्रतिबंध प्रदान करते हैं।[7][17]

ERNIE Bot राष्ट्रीय कानून के अनुसार संवेदनशील राजनीतिक विषयों से संबंधित अनुरोधों पर उच्च स्तर की अस्वीकृति दर्शाता है। शोध (Pan et al., 2026) Baidu के मॉडलों सहित चीनी मूल के LLM में राजनीतिक सेंसरशिप का विश्लेषण करते हैं।[19]

Baidu के प्रकाशन हमेशा मॉडल व्यवहार ऑडिट प्रक्रियाओं, सामग्री फ़िल्टरिंग मानदंडों और स्थानीय नियामक आवश्यकताओं और AI नैतिकता के सामान्य सिद्धांतों के बीच संतुलन का विस्तार से वर्णन नहीं करते, जो स्वतंत्र शोध के लिए एक खुला क्षेत्र बना हुआ है।[17]

संभावनाएँ और शोध दिशाएँ

तकनीकी रिपोर्टों और Baidu के बयानों के आधार पर ERNIE श्रृंखला के विकास की निम्नलिखित दिशाएँ पहचानी जाती हैं:

  • आगे की मल्टीमॉडलाइज़ेशन (पाठ–चित्र–वीडियो–ऑडियो), जिसमें घने तकनीकी दृश्य डेटा (इंजीनियरिंग योजनाएँ, चिकित्सा चित्र) का प्रसंस्करण शामिल है।[3][4]
  • बहुत बड़े कुल मॉडल आकारों पर गुणवत्ता और कम्प्यूटेशनल दक्षता के बीच संतुलन के लिए dense और MoE-आर्किटेक्चर का संयोजन।[3]
  • एजेंट प्रणालियों (GenFlow, Famou) और संरचित पीढ़ी उपकरणों (JSON, API-कॉल) का विकास जो उत्पादन workflows में एकीकरण के लिए हैं।[3]
  • प्रशिक्षण दक्षता में सुधार: elastic training, बेहतर MoE स्केलिंग (MFU), quantization (W4A8, एकल GPU पर deployment के लिए 2-bit)।[3]
  • सांस्कृतिक-विशिष्ट पहलुओं को ध्यान में रखते हुए चीनी LLM में पूर्वाग्रहों को कम करने पर शोध और चीनी भाषा और मल्टीमॉडल कार्यों के लिए बेंचमार्किंग पद्धतियों का विकास।[16][17]
  • लंबे संदर्भ में तर्क का सुधार, verifiable RL और सिंथेटिक कॉर्पस के माध्यम से सीमित डेटा वाले डोमेन में अनुकूलन।[3][4]

अन्य चीनी LLM से तुलना

ERNIE कई प्रमुख चीनी LLM से प्रतिस्पर्धा करता है, जिनमें Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) और Tongyi Qianwen शामिल हैं। ERNIE श्रृंखला की मुख्य विशेषताएँ — पूर्व-प्रशिक्षण में knowledge graph एकीकरण (knowledge enhancement) पर जोर, Baidu पारिस्थितिकी तंत्र (खोज, क्लाउड, API) के साथ घनिष्ठ एकीकरण और PaddlePaddle प्लेटफॉर्म पर ध्यान। स्वतंत्र रैंकिंग (SuperBench, LMArena) के परिणामों के अनुसार, ERNIE श्रृंखला के मॉडल चीनी LLM में उच्च स्थानों पर हैं, विशेषकर चीनी भाषा में समझ और निर्देश-पालन कार्यों में।[9][13][16]

यह भी देखें

  • BERT
  • Transformer आर्किटेक्चर
  • RLHF

साहित्य

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.