ERNIE (Baidu) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — پہلے سے تربیت یافتہ زبانی ماڈلز (Large Language Model, LLM) اور ملٹی موڈل بنیادی ماڈلز کا ایک سلسلہ ہے، جسے Baidu نے 2019 سے Enhanced Representation through kNowledge IntEgration (علم کے انضمام کے ذریعے بہتر نمائندگی) کے عنوان سے تیار کیا ہے۔ یہ سلسلہ معنیاتی فہم اور متن کی تخلیق کے معیار کو بہتر بنانے پر مرکوز ہے، اور اس کے لیے علمی گراف (Knowledge Graph, KG)، آنٹولوجیز اور انسائیکلوپیڈیاز سے بیرونی علم کو پہلے سے تربیت کے عمل میں براہِ راست شامل کیا جاتا ہے۔[1][2]

اس سلسلے کے ماڈلز نے ابتدائی BERT پر مبنی اشکال میں اداروں اور جملوں کے ماسکنگ (ERNIE 1.0، 2.0) سے آغاز کیا، پھر بڑے پیمانے پر یکجا آرکیٹیکچر (ERNIE 3.0، ERNIE 3.0 Titan) کی طرف، اور بعد ازاں کھلے سورس کوڈ کے ساتھ Mixture-of-Experts (MoE) پر مبنی ملٹی موڈل نظاموں (ERNIE 4.5) اور مقامی اومنی موڈل ماڈلز (ERNIE 5.0) کی طرف ارتقاء پایا۔ یہ سلسلہ متن کی فہم (Natural Language Understanding, NLU)، متن کی تخلیق (Natural Language Generation, NLG) اور بعد کے ورژنوں میں ملٹی موڈل کاموں (متن، تصویر، ویڈیو، آڈیو) کو سپورٹ کرتا ہے، اور اس میں چینی زبان پر خصوصی توجہ کے ساتھ کثیر زبانی حمایت بھی موجود ہے۔[2][3][4]

تاریخ اور پسِ منظر

ERNIE سلسلے کی ترقی 2019 میں Baidu کے تحقیقی شعبے میں اس وقت شروع ہوئی جب BERT ماڈل (Devlin et al., 2018) نے کامیابی حاصل کی اور چینی زبان کے لیے پہلے سے تربیت یافتہ ماڈلز کو ڈھالنے کی ضرورت محسوس ہوئی۔ چینی زبان میں الفاظ کے درمیان واضح جگہ کا نہ ہونا اور کثیر المعنی حروف کی زیادہ تعداد معنیاتی اکائیوں (اداروں، جملوں) کو سمجھنا مشکل بناتی ہے۔[1]

ERNIE 1.0 (2019)

سلسلے کے پہلے ماڈل (Sun et al., arXiv:1904.09223، اپریل 2019) نے BERT نما آرکیٹیکچر کے لیے کثیر سطحی علمی ماسکنگ (knowledge masking) کی حکمتِ عملی پیش کی: انفرادی tokens کی بے ترتیب ماسکنگ کی بجائے، ماڈل Named Entity Recognition (NER) اور جملوی پیٹرنز کی بنیاد پر طے کیے گئے مکمل اداروں اور فقروں کو ماسک کرتا ہے۔[1]

ERNIE 1.0 کی آرکیٹیکچر Transformer encoder (12 تہیں، پوشیدہ جہت 768، 12 attention heads) پر مبنی ہے۔ اس میں مکالماتی ڈیٹا پر تربیت کے لیے Dialogue Language Model (DLM) کا اضافی کام بھی متعارف کرایا گیا۔ ماڈل کو Wikipedia، Baidu Baike، خبریں اور Baidu Tieba فورم سے تقریباً 17 کروڑ 30 لاکھ چینی جملوں پر تربیت دی گئی۔ اشاعت کے وقت ERNIE 1.0 نے چینی NLP کے پانچ کاموں میں state-of-the-art (SOTA) نتائج حاصل کیے: XNLI (ٹیسٹ پر 78.4% درستگی بمقابلہ BERT کی 77.2%)، MSRA-NER (F1 93.8% بمقابلہ 92.6%)۔[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412، جولائی 2019؛ AAAI 2020 کانفرنس میں قبول شدہ) نے مسلسل کثیر الکام پہلے سے تربیت (continual multi-task pre-training) کا فریم ورک متعارف کرایا، جس میں مشترک ٹرانسفارمر میں ترتیب وار (بتدریج) نئے پہلے سے تربیتی کام شامل کیے جاتے ہیں اور پورے ماڈل کو از سرِ نو تربیت نہیں دینی پڑتی۔[5]

ERNIE 2.0 کے پہلے سے تربیتی کاموں کو تین گروہوں میں تقسیم کیا گیا ہے:

  • Word-aware — علمی ماسکنگ (knowledge masking)، حروفِ کبیر کی پیش گوئی (capitalization prediction)، token کا دستاویز سے تعلق (token-document relation)۔
  • Structure-aware — جملوں کی ترتیبِ نو (sentence reordering)، جملوں کے درمیان فاصلے کا تعین (sentence distance)۔
  • Semantic-aware — خطابی تعلقات کی پیش گوئی (discourse relation prediction)، معلوماتی تلاش کے لیے مطابقت (IR relevance prediction)۔[5]

ماڈل کو انگریزی اور چینی مجموعوں (انسائیکلوپیڈیاز، کتابیں، Reddit، تلاش کے لاگز) پر تربیت دی گئی۔ نتائج: base ماڈل کا اوسط GLUE سکور 80.6 (بمقابلہ BERT کے 78.3)، large ماڈل کا 83.6 رہا؛ ERNIE 2.0 نے 16 کاموں میں BERT اور XLNet کو پیچھے چھوڑ دیا۔[5]

ERNIE 3.0 (2021)

ERNIE 3.0 فریم ورک (Sun et al., arXiv:2107.02137، جولائی 2021) نے خودکار انکوڈنگ (auto-encoding, AE) اور خودکار بازگشت (auto-regressive, AR) پہلے سے تربیتی طریقوں کو ایک ہی آرکیٹیکچر میں یکجا کیا، جو ایک عالمگیر نمائندگی ماڈیول (Universal Representation Module) اور NLU اور NLG کے لیے کام مخصوص ماڈیولز (Task-specific Representation Modules) میں تقسیم ہے۔[2]

10 ارب پیرامیٹرز والے اس ماڈل کو 4 ٹیرابائٹ چینی متن (11 اقسام: Baidu Baike، Wikipedia، تلاش کے لاگز، سوال و جواب کے نظام، شعبہ جاتی متون) اور 5 کروڑ سے زائد حقائق پر مشتمل علمی گراف پر تربیت دی گئی۔ ERNIE 3.0 نے 54 چینی NLP کاموں میں SOTA حاصل کیا؛ انگریزی بینچ مارک SuperGLUE پر 90.6% (3 جولائی 2021 کی صورتِ حال کے مطابق، انسانی معیار 89.8% سے بھی اوپر)۔[2]

ERNIE 3.0 Titan (2021)

"ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731، دسمبر 2021) کے مقالے میں ERNIE 3.0 فریم ورک کو PaddlePaddle پلیٹ فارم پر 260 ارب پیرامیٹرز کے گھنے (dense) ماڈل تک وسعت دینے کی تفصیل بیان کی گئی ہے۔[6]

Titan نے اضافی طریقہ کار متعارف کرائے: تخلیق کردہ متن کی قابلِ اعتماد اندازہ کاری کے لیے خود نگرانی (self-supervised) adversarial loss، نسل کے انداز، موضوع، لہجے اور طوالت کو کنٹرول کرنے کے لیے controllable language modeling loss، اور پہلے سے تربیت کے دوران کمپیکٹ طالب علم ماڈلز حاصل کرنے کے لیے آن لائن distillation (On-the-Fly Distillation, OFD)۔ ماڈل کا جائزہ 68 datasets پر لیا گیا اور مصنفین کے مطابق اس نے تمام 68 datasets پر پہلے کے ماڈلز کو پیچھے چھوڑ دیا۔[6]

ERNIE Bot اور تجارتی ورژن (2023–2025)

مارچ 2023 میں Baidu نے ERNIE 3.x اور PLATO (مکالماتی ماڈل) کی بنیاد پر چیٹ بوٹ ERNIE Bot (Wenxin Yiyan، 文心一言) جاری کیا۔ ریگولیٹرز کی منظوری کے بعد اگست 2023 میں عوامی رسائی دی گئی۔ اپ ڈیٹس میں ERNIE 3.5 (جون 2023) اور ERNIE 4.0 (اکتوبر 2023) شامل ہیں۔[7][8]

صنghoa یونیورسٹی کی SuperBench رپورٹ کے مطابق، ERNIE Bot 4.0 نے انٹیگرل میٹرک پر چینی LLMs میں پہلا مقام حاصل کیا اور چینی زبان کی فہم اور ہدایات پر عمل کرنے میں بہترین نتائج دکھائے۔[9][10]

2022 میں بنیادی زبانی سلسلے کے ساتھ ساتھ ملٹی موڈل توسیع ERNIE-ViLG 2.0 (arXiv:2210.15257) پیش کی گئی — یہ متن سے تصویر بنانے (text-to-image) کا ماڈل تھا، جو ملٹی موڈیلٹی کی طرف پہلے اقدامات میں سے ایک تھا۔[11]

2024 میں WAVE SUMMIT کانفرنس میں Baidu نے ERNIE 4.0 Turbo پیش کیا — یہ تیز رفتار ایپلیکیشنز کے لیے بہتر بنایا گیا ورژن ہے جو معیار برقرار رکھتے ہوئے تقریباً 20 سیکنڈ میں ایک ہزار سے زائد الفاظ کا متن تخلیق کرنے کی صلاحیت رکھتا ہے۔[12]

ERNIE 4.5 (2025)

جون 2025 میں Baidu نے ERNIE 4.5 کی تکنیکی رپورٹ شائع کی، جو 10 ماڈلز کا ایک خاندان پیش کرتی ہے: متنی LLMs اور ملٹی موڈل ماڈلز (Vision-Language, VL)۔ آرکیٹیکچر ماڈیلٹیز کے اعتبار سے ماہرین کی تقسیم کے ساتھ ہم جنس Mixture-of-Experts (MoE) پر مبنی ہے۔ ورژنوں میں MoE ماڈلز شامل ہیں جن میں کل 424 ارب اور 47 ارب فعال پیرامیٹرز ہیں، نیز 0.3 ارب پیرامیٹرز کا ایک گھنا ماڈل بھی ہے۔ یہ خاندان Hugging Face اور GitHub (PaddlePaddle/ERNIE) پر Apache 2.0 لائسنس کے تحت جاری کیا گیا ہے۔[3]

ERNIE 5.0 (2026)

فروری 2026 میں ERNIE 5.0 (arXiv:2602.04705) کی تکنیکی رپورٹ شائع ہوئی — یہ ایک مقامی اومنی موڈل خودکار بازگشتی ماڈل ہے جس میں انتہائی غیر گھنا (ultra-sparse) MoE ہے اور یہ متن، تصویر، آڈیو اور ویڈیو کی مشترک ماڈلنگ کو سپورٹ کرتا ہے۔ یہ ماڈل LMArena لیڈربورڈ پر اعلیٰ مقامات پر فائز تھا۔[4][13]

نظریاتی بنیادیں اور آرکیٹیکچرل اصول

علمی ماسکنگ - Knowledge Masking

سلسلے کے ابتدائی ماڈلز کا بنیادی اصول — ترمیم شدہ ماسکنگ حکمتِ عملیوں کے ذریعے پہلے سے تربیت کے عمل میں ساختی علم کا انضمام ہے۔ معیاری Masked Language Modeling (MLM) کے برعکس جہاں انفرادی tokens ماسک کیے جاتے ہیں، ERNIE 1.0 مکمل معنیاتی اکائیوں کو ماسک کرتا ہے: ادارے (NER کے ذریعے طے کیے گئے) اور فقرے۔ ادارے E={t1,,tk} کے لیے tokens کی پوری ترتیب کو مخصوص احتمال p کے ساتھ ماسک کیا جاتا ہے۔ یہ طریقہ ماڈل کو وسیع تر سیاق و سباق پر انحصار کرنے اور اداروں کے درمیان روابط سیکھنے پر مجبور کرتا ہے۔[1]

ERNIE 2.0 نے اس طریقے کو مزید ترقی دی، بتدریج کثیر الکام تربیت شامل کی: لغوی، ساختی اور معنیاتی سطحوں کے کام ترتیب وار شامل کیے جاتے ہیں، جبکہ پہلے سیکھے گئے علم کو مسلسل پہلے سے تربیت (continual pre-training) کے طریقہ کار کی بدولت محفوظ رکھا جاتا ہے۔[5]

ERNIE 3.0 کا یکجا فریم ورک

ERNIE 3.0 کا فریم ورک آرکیٹیکچر کو دو سطحوں میں تقسیم کرنے پر مبنی ہے:[2][6]

  • Universal Representation Module — مشترک کثیر تہی Transformer-XL جو متعدد پہلے سے تربیتی کاموں پر تربیت پاتا ہے اور مشترک لغوی اور نحوی خصوصیات نکالتا ہے۔ Titan ورژن میں اس ماڈیول میں 48 تہیں، 12288 کا پوشیدہ نمائندگی حجم، 192 attention heads اور feed-forward نیٹ ورک کا اندرونی حجم 196608 (16×dmodel) ہے۔
  • Task-specific Representation Modules — NLU (دو طرفہ توجہ) اور NLG (Transformer-XL کی بازگشتی یادداشت کے ساتھ یک طرفہ توجہ) کے لیے الگ ماڈیولز، ہر ایک میں 12 تہیں، پوشیدہ ویکٹر کا حجم 768 اور 12 attention heads۔

خودکار انکوڈنگ اور خودکار بازگشتی طریقوں کا انضمام ایک ماڈل کو NLU بینچ مارکس (BERT نما کام) اور NLG بینچ مارکس (GPT نما کام) دونوں پر بہترین نتائج دینے کے قابل بناتا ہے۔[2]

Universal Knowledge-Text Prediction (UKTP)

UKTP کا کام ERNIE 3.0/Titan میں علم کے انضمام کا مرکزی طریقہ کار ہے۔ ماڈل کو ایک جوڑا (علمی گراف سے ثلاثی، انسائیکلوپیڈیا کا جملہ) دیا جاتا ہے اور اسے یا تو متن کا استعمال کرتے ہوئے ثلاثی میں تعلق کی پیش گوئی کرنی ہوتی ہے، یا ثلاثی کی معلومات کا استعمال کرتے ہوئے متن کے ماسک کیے گئے tokens کی پیش گوئی کرنی ہوتی ہے۔[6]

متن x سے منسلک ثلاثی (h,r,t) میں تعلق r کی پیش گوئی کرتے وقت، کام کو کثیر الزمرہ درجہ بندی کے طور پر وضع کیا جاتا ہے:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

جہاں fθ — سربراہ اور دُم کے اداروں کے ذکر کی جگہوں پر ٹرانسفارمر کا آؤٹ پٹ ہے، W,b — درجہ بندی کار کے پیرامیٹرز ہیں، θ — ماڈل کے پیرامیٹرز ہیں۔[6]

قابلِ اعتماد اور قابلِ کنٹرول نسل کے طریقہ کار (Titan)

ERNIE 3.0 Titan نے دو اضافی قسم کے نقصان کے افعال (loss functions) متعارف کرائے۔[6]

خود نگرانی adversarial loss۔ ایک dataset Da={Doriginal,Dgenerated} تشکیل دیا جاتا ہے جہاں Doriginal اصل پیراگراف ہیں اور Dgenerated وہ متون ہیں جو ERNIE کے پچھلے ورژن نے اصل پیراگرافوں کے سابقے سے تخلیق کیے ہیں۔ کام — خصوصی [CLS] token کی پوشیدہ حالت پر بائنری درجہ بندی (اصل / تخلیق شدہ) ہے:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

جہاں h[CLS](n)n ویں مثال کے لیے [CLS] کی ویکٹر نمائندگی ہے، I — اصل متون سے تعلق کا اشارہ ہے۔[6]

Controllable language modeling loss۔ ہر تربیتی مثال کے ساتھ صفات (prompt) کا ایک مجموعہ ہوتا ہے جو صنف، موضوع، کلیدی الفاظ، لہجے اور طوالت کو بیان کرتا ہے۔ نقصان غیر مشروط اور مشروط زبانی ماڈلنگ کو یکجا کرتا ہے:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

جہاں p — طریقوں کے ردوبدل کے لیے بے ترتیب متغیر ہے، xt(n)n ویں مثال کا t واں token ہے۔ یہ تعریف ماڈل کو prompts پر حد سے زیادہ انحصار کرنے سے روکتی ہے۔[6]

ہم جنس MoE آرکیٹیکچر - ERNIE 4.5

ERNIE 4.5 ایک ہم جنس ملٹی موڈل Mixture-of-Experts آرکیٹیکچر متعارف کراتا ہے جس میں ماڈیلٹی کے اعتبار سے ماہرین کی تقسیم ہے: متنی ماہرین اور بصری ماہرین (مؤخر الذکر تقریباً متنی ماہرین کے 1/3 حجم کے)۔ tokens کی راہنمائی ماڈیلٹی کی تنہائی (modality-isolated routing) اور ماہرین کی تخصص یقینی بنانے کے لیے راہنما آرتھوگونلائزیشن جرمانے (router orthogonalization loss، 103 کی ترتیب کا گنجائشی) کے ساتھ کی جاتی ہے۔ ویڈیو ڈیٹا میں وقتی، بلندی اور عرض کے ابعاد کے لیے پوزیشنی انکوڈنگ کے لیے 3D RoPE (Rotary Position Embeddings) استعمال کی جاتی ہے۔ طویل سیاق و سباق (131 ہزار tokens تک) کے ساتھ موثر کام کے لیے O(N) masks کے ساتھ FlashMask طریقہ کار استعمال کیا جاتا ہے۔[3]

ERNIE 4.5 کی پہلے سے تربیت کئی مراحل میں ہوتی ہے: پہلے صرف متنی ڈیٹا پر تربیت، پھر بصری ڈیٹا پر، اور آخری مرحلے میں ملٹی موڈل ڈیٹا پر مشترک تربیت (text-only → vision-only → joint)۔ تصاویر کی پروسیسنگ کے لیے مختلف ماڈیلٹیز کی نمائندگیوں کو ہم آہنگ کرنے کے لیے pixel shuffle طریقہ کار کے ساتھ ایک موافق ViT encoder (Vision Transformer) استعمال کیا جاتا ہے۔ موافق فریم نمونہ برداری (adaptive frame sampling) کے ساتھ طویل ویڈیوز (32 ہزار tokens تک) کی پروسیسنگ بھی سپورٹ کی جاتی ہے۔[3]

مقامی اومنی موڈیلٹی - ERNIE 5.0

ERNIE 5.0 ایک ہی آرکیٹیکچر میں متعدد ماڈیلٹیز (متن، تصویر، آڈیو، ویڈیو) کی مقامی خودکار بازگشتی ماڈلنگ کو انتہائی غیر گھنے MoE کے ساتھ نافذ کرتا ہے جس میں ہر مرحلے پر تمام ماہرین کے 3% سے کم فعال ہوتے ہیں۔ پہلے سے تربیتی کام کے طور پر Next-Group-of-Tokens Prediction استعمال کیا جاتا ہے — ایک کے بجائے tokens کے گروپ کی پیش گوئی، جو تربیت کی کارکردگی بڑھاتی ہے۔ آڈیو ماڈیلٹی کے لیے ایک درجاتی codec (hierarchical codec) استعمال کی جاتی ہے۔ elastic training ٹیکنالوجی ایک ہی تربیتی رن میں مختلف گہرائی، چوڑائی اور غیر گھنے پن کے ذیلی ماڈلز تخلیق کرنا ممکن بناتی ہے۔[4]

پہلے سے تربیتی کام اور ڈیٹا

ERNIE 3.0 / Titan کے پہلے سے تربیتی کام

ERNIE 3.0 اور Titan میں درج ذیل گروہوں کے پہلے سے تربیتی کام استعمال کیے جاتے ہیں:[2][6]

Word-aware کام:

  • Knowledge Masked Language Modeling — مقامی اور عالمی سیاق و سباق پر انحصار کی تربیت کے لیے فقرہ جاتی اور ادارہ جاتی ماسکنگ۔
  • Document Language Modeling — 512 tokens تک کے دستاویزات کی خودکار بازگشتی ماڈلنگ، Transformer-XL کی بازگشتی یادداشت کے استعمال کے ساتھ۔

Structure-aware کام:

  • Sentence Reordering — کسی پیراگراف کے لیے جسے بے ترتیب طور پر m حصوں میں تقسیم کر کے ملا دیا گیا ہو، ماڈل k=n=1mn! کے ساتھ k درجوں کی درجہ بندی کا کام حل کرتے ہوئے اصل ترتیب بحال کرتا ہے۔
  • Sentence Distance — 3 درجوں کی درجہ بندی: ملحق جملے، ایک ہی دستاویز میں غیر ملحق، مختلف دستاویزات کے جملے۔

Knowledge-aware کام:

  • Universal Knowledge-Text Prediction (UKTP) — متن اور علمی گراف کی ثلاثی کی مشترک ماڈلنگ۔
  • Credible and Controllable Generations — adversarial loss اور controllable LM loss کا مجموعہ۔

پہلے سے تربیتی ڈیٹا

ERNIE 3.0/Titan کے لیے ERNIE 3.0 Corpus استعمال کیا جاتا ہے — تقریباً 4 ٹیرابائٹ کا چینی مجموعہ 11 اقسام میں، جس میں ویب صفحات، تلاش کے لاگز، سوال و جواب کا ڈیٹا، ادبی، قانونی، مالیاتی اور طبی متون، ناول اور شاعری شامل ہے۔ اس مجموعے کے اوپر 5 کروڑ سے زائد حقائق کا علمی گراف تشکیل دیا گیا ہے۔[2][6]

Titan کے لیے اضافی طور پر یہ تشکیل دیے جاتے ہیں:

  • Adversarial dataset — 20 لاکھ اصل پیراگراف اور متعلقہ "منفی" پیراگراف جو ERNIE 3.0 نے اصل کے پہلے 1-3 جملوں کے سابقے سے تخلیق کیے، 512 tokens تک کے۔
  • Controllable dataset — صنف، موضوع (26 موضوعات)، کلیدی الفاظ، لہجے (مثبت/منفی/غیر جانبدار) اور طوالت کی صفات سے مزین متون۔ صنف کی صفات کو قابلِ تربیت "نرم prompts" (صنف کے prompts کی تعداد بے ترتیب طور پر 0 سے 64 کے درمیان چنی جاتی ہے) کے ذریعے انکوڈ کیا جاتا ہے۔[6]

بعد کے ورژن (ERNIE 4.5، 5.0) وسیع ملٹی موڈل مجموعے (متن، تصویر، ویڈیو، آڈیو) استعمال کرتے ہیں، جن میں تدوین شدہ ویب مواد، علمی اشاعتیں اور مصنوعی ڈیٹا شامل ہے۔[3][4]

تربیت اور تقسیم شدہ اصلاح

ERNIE 3.0 Titan کی پہلے سے تربیت Adam optimizer (تربیتی رفتار 104، β1=0,9، β2=0,95، L2 ریگولرائزیشن 0.1، gradient norm clipping 1.0 تک)، زیادہ سے زیادہ سیاق و سباق کی لمبائی 512 اور تخلیقی کاموں کے لیے بازگشتی یادداشت کی لمبائی 128 کے ساتھ کی گئی۔ ترقی پذیر تربیتی اسکیم (پہلے 4000 مراحل پر تیز رفتار ہم آہنگی) اور تربیتی رفتار میں خطی کمی استعمال کی گئی۔[6]

چار جہتی ہائبرڈ parallelism

متنوع clusters (GPU NVIDIA V100 اور NPU Ascend 910) پر 260 ارب پیرامیٹرز کے گھنے ماڈل کی تربیت کے لیے PaddlePaddle میں چار جہتی ہائبرڈ parallelism نافذ کی گئی:[6]

  • Data parallelism (DP) — متعدد آلات پر ماڈل کی نقل تیار کرنا اور batches کی الگ الگ پروسیسنگ۔
  • Tensor model parallelism (MP) — تہوں کے اندر آلات کے درمیان transformer کے پیرامیٹرز اور activations کی تقسیم۔
  • Pipeline model parallelism (PP) — ماڈل کی تہوں کو pipeline کے ذریعے تقسیم کرنا۔
  • Group Sharded — optimizer کی حالتوں کی نقل کو کم کرنے کے لیے ZeRO نما sharded-data-parallel کا ایک بہتر ورژن۔

رپورٹ میں Ascend 910 کارڈز کی ہزاروں تک کمزور توسیع کے بارے میں ڈیٹا پیش کیا گیا ہے جس میں throughput کارکردگی تقریباً 91.7% ہے۔[6]

ERNIE 4.5 کی تربیت

ERNIE 4.5 کی تربیت 2016 GPU NVIDIA H800 کے cluster پر ہوئی اور Model FLOPs Utilization (MFU) 47% حاصل ہوئی۔ مخلوط FP8 درستگی، قابلِ اعتماد checkpoint (Zero Cost Checkpoint، 8 منٹ سے کم میں بحالی) اور sequence کی لمبائی اور batch کے حجم میں اضافے کے ساتھ ترقی پذیر تربیت استعمال کی گئی۔[3]

آن لائن distillation

تعیناتی کے وقت computational وسائل کی ضروریات کم کرنے کے لیے ERNIE 3.0 Titan میں آن لائن distillation استعمال کی جاتی ہے جس میں استاد ماڈل اور متعدد طالب علم ماڈلز ایک ساتھ تربیت پاتے ہیں:[6]

  • On-the-Fly Distillation (OFD) — استاد کے logits اور نمائندگیاں تربیت کے انہی مراحل پر طالب علموں کی تربیت کے لیے استعمال ہوتی ہیں۔
  • Teacher assistants — استاد اور آخری طالب علموں کے درمیان صلاحیت کا فرق کم کرنے والے درمیانی حجم کے ماڈلز۔
  • Auxiliary Layer Distillation (ALD) — طالب علم میں ایک اضافی تہہ جو fine-tuning پر چھوڑ دی جاتی ہے، اندرونی نمائندگیوں کی بہتر ہم آہنگی کے لیے۔

بعد از تربیت اور ہم آہنگی

تجارتی ERNIE ورژن (ERNIE Bot سے شروع) بعد از تربیت کے مراحل سے گزرتے ہیں:[7][3]

  • Supervised Fine-Tuning (SFT) — ہدایاتی نشان زدہ ڈیٹا پر مزید تربیت (ERNIE 4.5 میں — 23 لاکھ مثالیں)۔
  • Reinforcement Learning from Human Feedback (RLHF) — انسانی تاثرات کے ذریعے ماڈل کے رویے کی ہم آہنگی؛ PPO (Proximal Policy Optimization) اور DPO (Direct Preference Optimization) الگورتھم استعمال کیے جاتے ہیں۔
  • Unified Preference Optimization (UPO) — ERNIE 4.5 میں متعارف کرایا گیا ترجیحات کی اصلاح کا یکجا طریقہ۔
  • Reinforcement Learning with Verifiers (RLVR) — جوابات کی درستگی کی جانچ کے لیے verifiers کے ساتھ تقویت یافتہ سیکھنا؛ GRPO (Group Relative Policy Optimization) طریقہ استعمال کیا جاتا ہے۔
  • استدلال کے طریقے (thinking modes) — 4.5 کے ماڈلز سوچ بچار (reflection, planning) کے ساتھ اور اس کے بغیر دونوں طریقوں کو سپورٹ کرتے ہیں۔

اہم نتائج اور بینچ مارک

ماڈلز کے ارتقاء کا خلاصہ جدول

ورژن سال پیرامیٹرز آرکیٹیکچر اہم بینچ مارک ماخذ
ERNIE 1.0 2019 ~110 ملین (base) Transformer encoder (BERT نما) XNLI 78.4%؛ MSRA-NER F1 93.8% [1]
ERNIE 2.0 2019 ~110–340 ملین Continual multi-task GLUE 80.6 (base) / 83.6 (large)؛ 16 کاموں میں SOTA [5]
ERNIE 3.0 2021 10 ارب Unified Transformer-XL (AE+AR) SuperGLUE 90.6% (> انسانی معیار 89.8%)؛ 54 چینی کاموں میں SOTA [2]
ERNIE 3.0 Titan 2021 260 ارب (dense) Dense + controllable generation 68 datasets میں SOTA؛ zero/few-shot [6]
ERNIE 4.5 2025 0.3–424 ارب (MoE، 47 ارب فعال) Heterogeneous multimodal MoE C-Eval 90.6%؛ MMLU 86.5%؛ MMMU 67.3–70% [3]
ERNIE 5.0 2026 ~2.4 ٹریلین (ultra-sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (عالمی سطح پر ٹاپ 10) [4]

ERNIE 3.0 اور Titan کے نتائج

ERNIE 3.0 (10 ارب پیرامیٹرز) نے انگریزی بینچ مارک SuperGLUE پر اوسط 90.6 سکور حاصل کیا، جو اشاعت کے وقت انسانی معیار (89.8) اور GPT-3، T5 اور DeBERTa کے نتائج سے بہتر تھا۔ ERNIE 3.0 Titan (260 ارب) کا 68 datasets پر جائزہ لیا گیا، جن میں درجہ بندی، NLI، QA اور تخلیق کے کام شامل تھے؛ مصنفین نے تمام 68 datasets پر پچھلے ماڈلز پر برتری کی اطلاع دی۔ یہ نتائج ابتدائی ماخذ کا ڈیٹا ہے؛ آزادانہ تصدیق محدود حد تک بیان کی گئی ہے۔[2][6]

ERNIE 4.5 کے نتائج

2025 کی تکنیکی رپورٹ کے مطابق، ERNIE 4.5 (300B-A47B، بعد از تربیت) متنی اور ملٹی موڈل بینچ مارکس پر درج ذیل نتائج دکھاتا ہے:[3]

بینچ مارک ERNIE-4.5-300B-A47B شرائط
C-Eval 90.6% 5-shot
CMMLU 90.2%
MMLU 86.5% معیاری
IFEval 88.0% instruction following
GSM8K 91.8%
MMMU 67.3–70.0% non-thinking / thinking
MathVista 78.8% thinking mode
OCRBench 883

رپورٹ کے مطابق، ERNIE 4.5 نے 28 میں سے 22 بینچ مارکس پر DeepSeek-V3 کو پیچھے چھوڑا؛ ملٹی موڈل ورژن (ERNIE-4.5-VL-424B-A47B) نے بصری استدلال کے کاموں میں مسابقتی نتائج دکھائے۔ بصری استدلال اور تکنیکی تصویر تشریح (خاکوں، انجینئرنگ ڈایاگرامز کا تجزیہ) کے بعض کاموں میں بعض GPT اور Gemini ماڈلز سے بہتر نتائج رپورٹ کیے گئے۔[3][14]

ERNIE 4.5 کا حریفوں سے موازنہ (منتخب بینچ مارکس، بعد از تربیت، 2025 کی تکنیکی رپورٹ کے مطابق):

بینچ مارک ERNIE-4.5-300B-A47B DeepSeek-V3-671B-A37B Qwen3-235B-A22B نوٹ
C-Eval 90.6% 5-shot
MMLU 86.5% موازنہ معیاری
IFEval 88.0% 83.2% instruction following
MMMU 67.3–70.0% thinking / non-thinking
MathVista 78.8% 77.6% (Qwen2.5-VL) thinking mode

تصدیق کی شرائط: معیاری پروٹوکول (5-shot / zero-shot)؛ datasets کھلے ہیں (C-Eval 2023+، MMLU، MMMU)۔ ڈیش ("—") کا مطلب ہے کہ انہی شرائط پر موازنہ پذیر ڈیٹا رپورٹ میں نہیں دیا گیا۔[3]

ERNIE Bot 4.0 کی تشخیص

صنghoa یونیورسٹی کی SuperBench رپورٹ تجارتی LLMs کو کاموں کے ایک مجموعے (زبانی فہم، ریاضی، پروگرامنگ، کثیر الکام) پر درجہ بندی کرتی ہے۔ ERNIE Bot 4.0 نے چینی ماڈلز میں پہلا مقام حاصل کیا، GLM-4 (Zhipu AI) کو انٹیگرل میٹرک پر تقریباً 0.41 پوائنٹ سے پیچھے چھوڑا؛ GPT-4 اور Anthropic Claude-3 کے ماڈلز عالمی درجہ بندی میں اوپر رہے۔ ERNIE Bot 4.0 نے چینی متن کی فہم اور ہدایات پر عمل کرنے میں بہترین نتائج دکھائے جبکہ پروگرامنگ اور بعض انگریزی کاموں میں کمزور رہا۔[9][10]

استعمال

Baidu کی مصنوعات اور خدمات

ERNIE سلسلے کے ماڈلز Baidu کی مصنوعات کے نظامِ حیات میں ضم ہیں:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — ملٹی موڈل تخلیق (متن، تصویر، ویڈیو، آڈیو) کی حمایت کے ساتھ چیٹ بوٹ۔ Baidu کے مطابق ماہانہ فعال صارفین کی تعداد 20 کروڑ سے زائد ہے (2024–2025)۔ 2025 سے ERNIE Bot مفت دستیاب ہے۔[7]
  • Baidu Search — تلاش کے نتائج میں جوابات کی تخلیق اور AI خصوصیات؛ Baidu کے مطابق اوپری نتائج میں 70% تک AI اجزاء سے بہتر ہیں۔
  • Qianfan (MaaS پلیٹ فارم) — کارپوریٹ کلائنٹس کے لیے API؛ Baidu کے مطابق 7 لاکھ 60 ہزار سے زائد ادارے پلیٹ فارم استعمال کرتے ہیں، روزانہ API کالز کی تعداد 1.5 ارب سے زائد ہے (2024)۔ کلائنٹس میں Lenovo، Trip.com اور دیگر شامل ہیں۔[7]
  • Comate — پروگرامنگ کے لیے AI اسسٹنٹ۔
  • Wenxin Yige — ERNIE-ViLG ماڈلز کی بنیاد پر تصویر سازی۔[11]
  • بیرونی شراکت داروں کے ساتھ انضمام: Samsung Galaxy (چینی بازار کے لیے)، ڈیجیٹل اوتار، پلگ انز (تلاش، فائل تجزیہ)۔[7]

شعبہ جاتی استعمال

ماڈلز درج ذیل شعبوں میں استعمال ہوتے ہیں:[7][3]

  • علم سے بہتر شدہ پہلے سے تربیت کے استعمال کے ساتھ شعبہ جاتی (قانون، طب، مالیات) سوال و جواب کے نظام۔
  • چینی زبان میں متن کی تخلیق اور ترمیم (خبریں، مارکیٹنگ متون، تخلیقی مواد)۔
  • ملٹی موڈل کام: تصاویر، انجینئرنگ خاکوں، ویڈیو اور جدولی ڈیٹا کا تجزیہ (ورژن 4.5 اور اس سے اوپر میں)۔
  • تعلیم (ذاتی نوعیت کی سیکھنا)، روبوٹکس (کاموں کی منصوبہ بندی)، خودمختار ڈرائیونگ (Apollo)۔

کھلا کوڈ

ERNIE 4.5 سے شروع ہو کر، خاندان کے تمام 10 ورژن Apache 2.0 لائسنس کے تحت ERNIEKit ٹول کٹ کے ساتھ جاری کیے گئے (SFT، LoRA، DPO، PaddlePaddle/FastDeploy پر inference کی حمایت)۔ پہلے کے ورژن (ERNIE 1.0–3.0) کا کوڈ GitHub PaddlePaddle/ERNIE پر دستیاب ہے۔[3][15]

حدود اور کھلے مسائل

آرکیٹیکچرل اور dataset کی حدود

ERNIE 3.0 Titan 260 ارب پیرامیٹرز کے ساتھ ایک ماڈیول کے لیے 512 tokens کی سیاق و سباق کی لمبائی تک محدود ہے، جو اضافی طریقہ کار (chunking، بیرونی یادداشت) کے بغیر لمبے متون کی ماڈلنگ کو محدود کرتا ہے۔ تربیت بنیادی طور پر چینی مجموعے پر ہوتی ہے، جس کی وجہ سے چینی اور دیگر زبانوں کے درمیان معیار میں عدم یکسانیت پیدا ہوتی ہے۔[6]

علمی گراف کا انضمام ساختی حقائق کے ساتھ کام کو بہتر بناتا ہے، تاہم علم کی درستگی اور مکمل پن خود گراف کے معیار اور "ثلاثی-متن" کے ملاپ کے عمل (entity linking، relation alignment) تک محدود ہے، جو بعض صورتوں میں غلط یا نامکمل روابط کا باعث بنتا ہے۔[6]

فریب اور قابلِ اعتمادیت

Adversarial loss اور controllable LM loss ناقابلِ اعتماد تخلیقات کے خلاف مزاحمت کو بہتر بناتے ہیں، لیکن فریب (hallucinations) — یعنی حقیقتاً غلط بیانات کی تخلیق — کا مسئلہ مکمل طور پر حل نہیں ہو سکا۔ adversarial classifier کے پیرامیٹرز ایسے ڈیٹا پر تربیت پاتے ہیں جہاں "تخلیق کردہ" متن ERNIE کے پچھلے ورژن سے آتا ہے، جو پہچانے جانے والے غلط پیٹرنز کی حد کو محدود کرتا ہے۔[6]

سماجی تعصبات

PeerJ Computer Science (2025) میں شائع ایک تحقیق چینی LLMs (ERNIE اور Qwen) میں 240 سماجی گروہوں اور 30 ہزار سے زائد تخلیق کردہ تفصیلات کا استعمال کرتے ہوئے سماجی تعصبات کا تجزیہ کرتی ہے۔ نتائج سے پتہ چلتا ہے کہ ERNIE، Baidu Search یا Qwen کے مقابلے میں کم منفی اور دقیانوسی مواد تخلیق کرتا ہے (ERNIE میں تقریباً 1/10 منفی مفہوم والے امیدوار الفاظ بمقابلہ Qwen میں 1/3)۔ اس کے باوجود، ممکنہ طور پر توہین آمیز تفصیلات سمیت، کچھ دقیانوسی سوچ برقرار رہتی ہے۔[16][17]

تصدیق پذیری

سلسلے کے کچھ ماڈلز (ERNIE 3.0 Titan، تجارتی ERNIE Bot 4.0 اور 5.0) مکمل کھلے کوڈ اور weights کی صورت میں دستیاب نہیں، جو بینچ مارکس کی تصدیق پذیری اور آزادانہ جائزے کی صلاحیت کو محدود کرتا ہے۔ Apache 2.0 کے تحت ERNIE 4.5 کے اجراء سے صورتِ حال بہتر ہوئی ہے، تاہم آرکیٹیکچرز اور تربیتی ترتیبات ابتدائی اشاعتوں میں بیان کردہ سے مختلف ہو سکتی ہیں۔[3][6]

طبی حفاظت

طبی منظرناموں میں ERNIE Bot کے استعمال پر تحقیق (Si et al., 2025) نے ضرورت سے زیادہ تجویزات کا رجحان ظاہر کیا: ماڈل کے منظرناموں میں 91.9% غیر ضروری ٹیسٹس اور 57.8% غیر ضروری دوائیں، نیز سفارشات میں عمر اور سماجی و اقتصادی عدم مساوات۔[18]

اخلاقی اور ریگولیٹری پہلو

ERNIE سلسلے کے ماڈلز چینی generative AI ریگولیشن کے دائرے میں کام کرتے ہیں، خاص طور پر "جنریٹو AI سروسز کے انتظام کے عبوری اقدامات" (Interim Measures for Generative AI Services, 2023) کے تحت، جو لازمی حفاظتی جائزہ، الگورتھم کی رجسٹریشن اور مواد کی پابندیاں تجویز کرتے ہیں۔[7][17]

ERNIE Bot قومی قانون سازی کے مطابق حساس سیاسی موضوعات سے متعلق درخواستوں پر انکار کی اعلیٰ شرح ظاہر کرتا ہے۔ تحقیقات (Pan et al., 2026) Baidu کے ماڈلز سمیت چینی نژاد LLMs میں سیاسی سنسرشپ کا تجزیہ کرتی ہیں۔[19]

Baidu کی اشاعتیں ماڈل کے رویے کی آڈٹ کے طریقہ کار، مواد کی فلٹرنگ کے معیار اور مقامی ریگولیٹری تقاضوں اور AI اخلاقیات کے عمومی اصولوں کے درمیان توازن کی ہمیشہ تفصیل سے وضاحت نہیں کرتیں، جو آزادانہ تحقیق کا ایک کھلا میدان رہتا ہے۔[17]

امکانات اور تحقیق کی سمتیں

تکنیکی رپورٹس اور Baidu کے بیانات کی بنیاد پر ERNIE سلسلے کی ترقی کی درج ذیل سمتیں سامنے آتی ہیں:

  • مزید ملٹی موڈیلائزیشن (متن–تصویر–ویڈیو–آڈیو)، بشمول گھنے تکنیکی بصری ڈیٹا (انجینئرنگ خاکے، طبی تصاویر) کی پروسیسنگ۔[3][4]
  • بہت بڑے کل حجم کے ماڈلز میں معیار اور computational کارکردگی کے درمیان توازن کے لیے گھنی اور MoE آرکیٹیکچرز کا امتزاج۔[3]
  • ایجنٹی نظاموں (GenFlow، Famou) اور پیداواری workflows میں انضمام کے لیے ساختی تخلیق کے ٹولز (JSON، API کالز) کی ترقی۔[3]
  • تربیتی کارکردگی میں بہتری: elastic training، بہتر MoE توسیع (MFU)، کوانٹائزیشن (W4A8، ایک GPU پر تعیناتی کے لیے 2-bit)۔[3]
  • ثقافتی خصوصیات کو مدنظر رکھتے ہوئے چینی LLMs میں تعصبات کو کم کرنے کی تحقیق اور چینی زبان اور ملٹی موڈل کاموں کے لیے بینچ مارکنگ کے طریقہ کار کی ترقی۔[16][17]
  • طویل سیاق و سباق میں استدلال کو بہتر بنانا، قابلِ تصدیق تقویت یافتہ سیکھنا (verifiable RL) اور مصنوعی مجموعوں کے ذریعے محدود ڈیٹا والے شعبوں میں ڈھلائی۔[3][4]

دیگر چینی LLMs سے موازنہ

ERNIE متعدد بڑے چینی LLMs سے مقابلہ کرتا ہے، جن میں Qwen (Alibaba)، GLM / ChatGLM (Zhipu AI)، DeepSeek (DeepSeek AI) اور Tongyi Qianwen شامل ہیں۔ ERNIE سلسلے کی اہم خصوصیات — پہلے سے تربیت میں علمی گراف کے انضمام پر زور (knowledge enhancement)، Baidu کے نظامِ حیات (تلاش، کلاؤڈ، API) کے ساتھ گہرا انضمام اور PaddlePaddle پلیٹ فارم پر توجہ ہے۔ آزادانہ درجہ بندیوں (SuperBench، LMArena) کے نتائج کے مطابق، ERNIE سلسلے کے ماڈلز چینی LLMs میں اعلیٰ مقامات پر ہیں، خاص طور پر چینی زبان میں فہم اور ہدایات پر عمل کرنے کے کاموں میں۔[9][13][16]

یہ بھی دیکھیں

  • BERT
  • Transformer آرکیٹیکچر
  • RLHF

کتابیات

حواشی

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.