ERNIE (Baidu) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — পূর্বপ্রশিক্ষিত ভাষা মডেলের (Large Language Model, LLM) এবং মাল্টিমোডাল ফান্ডামেন্টাল মডেলের একটি সিরিজ, যা Baidu কোম্পানি ২০১৯ সাল থেকে Enhanced Representation through kNowledge IntEgration (জ্ঞান-একীভূতকরণের মাধ্যমে উন্নত উপস্থাপনা) নামে তৈরি করে আসছে। এই সিরিজটি Knowledge Graph (KG), অন্টোলজি এবং বিশ্বকোষ থেকে বাহ্যিক জ্ঞানকে পূর্বপ্রশিক্ষণ প্রক্রিয়ায় সরাসরি একীভূত করার মাধ্যমে শব্দার্থিক বোঝাপড়া ও উৎপাদনের মান উন্নয়নে মনোনিবেশ করে।[1][2]

এই সিরিজের মডেলগুলি সত্তা ও বাক্যাংশ-মাস্কিং সহ BERT-ভিত্তিক প্রাথমিক সংস্করণ (ERNIE 1.0, 2.0) থেকে শুরু করে বৃহৎ-মাপের একীভূত আর্কিটেকচার (ERNIE 3.0, ERNIE 3.0 Titan), তারপর মুক্ত উৎস কোডসহ Mixture-of-Experts (MoE)-ভিত্তিক মাল্টিমোডাল সিস্টেম (ERNIE 4.5) এবং নেটিভ অমনিমোডাল মডেলে (ERNIE 5.0) বিকশিত হয়েছে। এই সিরিজটি Natural Language Understanding (NLU), Natural Language Generation (NLG) এবং পরবর্তী সংস্করণে মাল্টিমোডাল কাজ (পাঠ্য, ছবি, ভিডিও, অডিও) সমর্থন করে, চীনা ভাষায় বিশেষ মনোযোগ দেওয়া হয়েছে এবং বহুভাষিকতাও সমর্থিত।[2][3][4]

ইতিহাস ও পটভূমি

ERNIE সিরিজের উন্নয়ন ২০১৯ সালে Baidu-এর গবেষণা বিভাগে শুরু হয়েছিল BERT মডেলের (Devlin et al., 2018) সাফল্যের পরিপ্রেক্ষিতে এবং চীনা ভাষার জন্য পূর্বপ্রশিক্ষিত মডেল অভিযোজিত করার প্রয়োজনীয়তার কারণে — যেখানে শব্দের মধ্যে স্পষ্ট স্থানের অনুপস্থিতি এবং বহুঅর্থী হ্যানজির উচ্চ অনুপাত শব্দার্থিক একক (সত্তা, বাক্যাংশ) চিহ্নিত করাকে জটিল করে তোলে।[1]

ERNIE 1.0 (2019)

সিরিজের প্রথম মডেল (Sun et al., arXiv:1904.09223, এপ্রিল ২০১৯) BERT-সদৃশ আর্কিটেকচারের জন্য বহুস্তরীয় জ্ঞান-মাস্কিং (knowledge masking) কৌশল উপস্থাপন করেছিল: এলোমেলো টোকেন মাস্কিংয়ের পরিবর্তে মডেলটি Named Entity Recognition (NER) ও বাক্যাংশ প্যাটার্নের উপর ভিত্তি করে নির্ধারিত সম্পূর্ণ সত্তা ও বাক্যাংশ মাস্ক করে।[1]

ERNIE 1.0-এর আর্কিটেকচার Transformer-এনকোডারের উপর ভিত্তি করে তৈরি (১২টি স্তর, গোপন মাত্রা ৭৬৮, ১২টি attention হেড)। অতিরিক্তভাবে ডায়ালগ ডেটায় প্রশিক্ষণের জন্য Dialogue Language Model (DLM) টাস্ক প্রবর্তন করা হয়েছে। মডেলটি Wikipedia, Baidu Baike, সংবাদ এবং Baidu Tieba ফোরামের কর্পাস থেকে প্রায় ১৭৩ মিলিয়ন চীনা বাক্যে প্রশিক্ষিত। প্রকাশনার সময়ে ERNIE 1.0 পাঁচটি চীনা NLP টাস্কে state-of-the-art (SOTA) ফলাফল অর্জন করেছিল: XNLI (পরীক্ষায় নির্ভুলতা ৭৮.৪%, BERT-এর ৭৭.২%-এর বিপরীতে), MSRA-NER (F1 ৯৩.৮%, ৯২.৬%-এর বিপরীতে)।[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412, জুলাই ২০১৯; AAAI 2020 কনফারেন্সে গৃহীত) ক্রমাগত বহু-টাস্ক পূর্বপ্রশিক্ষণের (continual multi-task pre-training) একটি ফ্রেমওয়ার্ক প্রবর্তন করেছে, যেখানে মডেলকে সম্পূর্ণরূপে পুনরায় প্রশিক্ষণ না দিয়ে সাধারণ ট্রান্সফর্মারে ক্রমান্বয়ে (incrementally) নতুন পূর্বপ্রশিক্ষণ টাস্ক যোগ করা হয়।[5]

ERNIE 2.0-এর পূর্বপ্রশিক্ষণ টাস্কগুলি তিনটি গ্রুপে বিভক্ত:

  • Word-aware — জ্ঞান-মাস্কিং (knowledge masking), বড় হাতের অক্ষর পূর্বাভাস (capitalization prediction), টোকেন-ডকুমেন্ট সম্পর্ক (token-document relation)।
  • Structure-aware — বাক্য পুনর্বিন্যাস (sentence reordering), বাক্যের মধ্যে দূরত্ব নির্ধারণ (sentence distance)।
  • Semantic-aware — ডিসকোর্স সম্পর্ক পূর্বাভাস (discourse relation prediction), তথ্য অনুসন্ধান প্রাসঙ্গিকতা পূর্বাভাস (IR relevance prediction)।[5]

মডেলটি ইংরেজি ও চীনা কর্পাসে (বিশ্বকোষ, বই, Reddit, অনুসন্ধান লগ) প্রশিক্ষিত। ফলাফল: base মডেলের GLUE গড় স্কোর ৮০.৬ (BERT-এর ৭৮.৩-এর বিপরীতে), large মডেলের ৮৩.৬; ERNIE 2.0 ১৬টি টাস্কে BERT ও XLNet-কে ছাড়িয়ে গেছে।[5]

ERNIE 3.0 (2021)

ERNIE 3.0 ফ্রেমওয়ার্ক (Sun et al., arXiv:2107.02137, জুলাই ২০২১) একটি একীভূত আর্কিটেকচারে অটো-এনকোডিং (auto-encoding, AE) ও অটোরিগ্রেসিভ (auto-regressive, AR) পূর্বপ্রশিক্ষণ প্যারাডাইম একত্রিত করেছে, যা NLU ও NLG-এর জন্য Universal Representation Module এবং Task-specific Representation Modules-এ বিভক্ত।[2]

১০ বিলিয়ন প্যারামিটারের মডেলটি ৪ টেরাবাইট চীনা টেক্সটে (১১টি বিভাগ: Baidu Baike, Wikipedia, অনুসন্ধান লগ, প্রশ্নোত্তর সিস্টেম, ডোমেইন-নির্দিষ্ট পাঠ্য) এবং ৫ কোটিরও বেশি তথ্য সম্বলিত জ্ঞান গ্রাফে প্রশিক্ষিত। ERNIE 3.0 ৫৪টি চীনা NLP টাস্কে SOTA অর্জন করেছে; ইংরেজি benchmark SuperGLUE-তে — ৯০.৬% (৩ জুলাই ২০২১ অনুযায়ী, মানবীয় রেফারেন্স ৮৯.৮%-এর উপরে)।[2]

ERNIE 3.0 Titan (2021)

"ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, ডিসেম্বর ২০২১) গবেষণাপত্রে ERNIE 3.0 ফ্রেমওয়ার্ককে PaddlePaddle প্ল্যাটফর্মে ২৬০ বিলিয়ন প্যারামিটারের একটি ঘন (dense) মডেলে স্কেল করার বিবরণ দেওয়া হয়েছে।[6]

Titan আরও বেশ কিছু প্রক্রিয়া প্রবর্তন করেছে: উৎপন্ন পাঠ্যের বিশ্বাসযোগ্যতা মূল্যায়নের জন্য স্ব-তত্ত্বাবধানমূলক adversarial loss, শৈলী, বিষয়, মনোভাব এবং উৎপাদনের দৈর্ঘ্য নিয়ন্ত্রণের জন্য controllable language modeling loss, এবং পূর্বপ্রশিক্ষণ চলাকালীন কম্প্যাক্ট ছাত্র-মডেল পাওয়ার জন্য অনলাইন-ডিস্টিলেশন (On-the-Fly Distillation, OFD)। মডেলটি ৬৮টি ডেটাসেটে মূল্যায়ন করা হয়েছিল এবং লেখকদের মতে, সমস্ত ৬৮টি dataset-এ পূর্বসূরি মডেলগুলিকে ছাড়িয়ে গেছে।[6]

ERNIE Bot ও বাণিজ্যিক সংস্করণ (২০২৩–২০২৫)

মার্চ ২০২৩ সালে Baidu ERNIE 3.x ও PLATO (ডায়ালগ মডেল) মডেলের উপর ভিত্তি করে চ্যাটবট ERNIE Bot (Wenxin Yiyan, 文心一言) প্রকাশ করে। নিয়ন্ত্রকদের অনুমোদনের পর আগস্ট ২০২৩ সালে সর্বসাধারণের জন্য উন্মুক্ত করা হয়। আপডেটের মধ্যে রয়েছে ERNIE 3.5 (জুন ২০২৩) এবং ERNIE 4.0 (অক্টোবর ২০২৩)।[7][8]

সিংহুয়া বিশ্ববিদ্যালয়ের SuperBench প্রতিবেদন অনুযায়ী, ERNIE Bot 4.0 সমন্বিত মেট্রিকে চীনা LLM-গুলির মধ্যে প্রথম স্থান অর্জন করেছে, চীনা ভাষা বোঝাপড়া এবং নির্দেশনা অনুসরণে শক্তিশালী ফলাফল দেখিয়েছে।[9][10]

২০২২ সালে মূল ভাষা লাইনআপের পাশাপাশি মাল্টিমোডাল সম্প্রসারণ ERNIE-ViLG 2.0 (arXiv:2210.15257) উপস্থাপন করা হয়েছিল — একটি টেক্সট-থেকে-ছবি উৎপাদন মডেল (text-to-image), যা মাল্টিমোডালিটির দিকে প্রথম পদক্ষেপগুলির একটি।[11]

২০২৪ সালে WAVE SUMMIT কনফারেন্সে Baidu ERNIE 4.0 Turbo উপস্থাপন করেছে — উচ্চ-গতির অ্যাপ্লিকেশনের জন্য একটি অপ্টিমাইজড সংস্করণ, যা গুণমান বজায় রেখে প্রায় ২০ সেকেন্ডে এক হাজারেরও বেশি শব্দের পাঠ্য তৈরি করতে সক্ষম।[12]

ERNIE 4.5 (2025)

জুন ২০২৫ সালে Baidu ERNIE 4.5-এর টেকনিক্যাল রিপোর্ট প্রকাশ করেছে, যা ১০টি মডেলের একটি পরিবার উপস্থাপন করে: টেক্সট LLM ও মাল্টিমোডাল মডেল (Vision-Language, VL)। আর্কিটেকচারটি মডালিটি অনুযায়ী বিশেষজ্ঞ বিভাজন সহ হেটেরোজেনাস Mixture-of-Experts (MoE)-এর উপর ভিত্তি করে। ভেরিয়েন্টগুলিতে সর্বাধিক ৪২৪ বিলিয়ন মোট এবং ৪৭ বিলিয়ন সক্রিয় প্যারামিটার সহ MoE মডেল এবং ০.৩ বিলিয়ন প্যারামিটারের একটি ঘন মডেল অন্তর্ভুক্ত রয়েছে। পরিবারটি Hugging Face ও GitHub (PaddlePaddle/ERNIE)-এ Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত হয়েছে।[3]

ERNIE 5.0 (2026)

ফেব্রুয়ারি ২০২৬ সালে ERNIE 5.0-এর টেকনিক্যাল রিপোর্ট (arXiv:2602.04705) প্রকাশিত হয়েছে — একটি নেটিভ অমনিমোডাল অটোরিগ্রেসিভ মডেল যা অতি-বিরল MoE (ultra-sparse MoE) সহ পাঠ্য, ছবি, অডিও ও ভিডিওর যৌথ মডেলিং সমর্থন করে। মডেলটি LMArena লিডারবোর্ডে উচ্চ স্থানে ছিল।[4][13]

তাত্ত্বিক ভিত্তি ও আর্কিটেকচারাল নীতিমালা

জ্ঞান-মাস্কিং (Knowledge Masking)

সিরিজের প্রাথমিক মডেলগুলির মূল নীতি হলো পরিবর্তিত মাস্কিং কৌশলের মাধ্যমে পূর্বপ্রশিক্ষণ প্রক্রিয়ায় কাঠামোগত জ্ঞানের একীভূতকরণ। মানক Masked Language Modeling (MLM)-এর মতো পৃথক টোকেন মাস্ক করার পরিবর্তে, ERNIE 1.0 সম্পূর্ণ শব্দার্থিক একক মাস্ক করে: সত্তা (NER-এর মাধ্যমে নির্ধারিত) এবং বাক্যাংশ। E={t1,,tk} সত্তার জন্য নির্দিষ্ট সম্ভাব্যতায় p সম্পূর্ণ টোকেন ক্রম মাস্ক করা হয়। এই পদ্ধতিটি মডেলকে বৃহত্তর প্রসঙ্গের উপর নির্ভর করতে এবং সত্তাগুলির মধ্যে সম্পর্ক শেখাতে বাধ্য করে।[1]

ERNIE 2.0 এই পদ্ধতি আরও বিকশিত করেছে, ইনক্রিমেন্টাল বহু-টাস্ক শিক্ষণ যোগ করে: শাব্দিক, কাঠামোগত ও শব্দার্থিক স্তরের টাস্কগুলি ক্রমান্বয়ে যোগ করা হয়, এবং ক্রমাগত পূর্বপ্রশিক্ষণ (continual pre-training) প্রক্রিয়ার মাধ্যমে পূর্বে শেখা জ্ঞান সংরক্ষিত থাকে।[5]

ERNIE 3.0-এর একীভূত ফ্রেমওয়ার্ক

ERNIE 3.0 ফ্রেমওয়ার্ক আর্কিটেকচারকে দুটি স্তরে বিভক্ত করার উপর ভিত্তি করে:[2][6]

  • Universal Representation Module — একটি সাধারণ বহুস্তরীয় Transformer-XL, যা বিভিন্ন পূর্বপ্রশিক্ষণ টাস্কে প্রশিক্ষিত এবং সাধারণ শাব্দিক ও বাক্যগঠনগত বৈশিষ্ট্য নিষ্কাশন করে। Titan সংস্করণে এই মডিউলে ৪৮টি স্তর, ১২২৮৮ আকারের গোপন উপস্থাপনা, ১৯২টি attention হেড এবং ১৯৬৬০৮ আকারের ভেতরের feed-forward নেটওয়ার্ক (16×dmodel) রয়েছে।
  • Task-specific Representation Modules — NLU (দ্বি-দিকনির্দেশক attention) ও NLG (Transformer-XL পুনরাবৃত্তিমূলক মেমরি সহ একমুখী attention) এর জন্য পৃথক মডিউল, প্রতিটিতে ১২টি স্তর, ৭৬৮ আকারের গোপন ভেক্টর এবং ১২টি attention হেড রয়েছে।

অটো-এনকোডিং ও অটোরিগ্রেসিভ প্যারাডাইমের একীভূতকরণ একটি মডেলকে NLU benchmark (BERT-সদৃশ টাস্ক) এবং NLG benchmark (GPT-সদৃশ টাস্ক) উভয়ে উচ্চ ফলাফল অর্জন করতে দেয়।[2]

Universal Knowledge-Text Prediction (UKTP)

UKTP টাস্কটি ERNIE 3.0/Titan-এ জ্ঞান একীভূতকরণের কেন্দ্রীয় প্রক্রিয়া। মডেলটি একটি জোড়া (জ্ঞান গ্রাফের ত্রিক, বিশ্বকোষের বাক্য) পায় এবং হয় পাঠ্য ব্যবহার করে ত্রিকের সম্পর্ক পূর্বাভাস দিতে হয়, অথবা ত্রিকের তথ্য ব্যবহার করে পাঠ্যের মাস্ক করা টোকেন পূর্বাভাস দিতে হয়।[6]

পাঠ্য x-এর সাথে সম্পর্কিত ত্রিক (h,r,t)-এ সম্পর্ক r পূর্বাভাসের ক্ষেত্রে টাস্কটি বহু-শ্রেণী শ্রেণীবিভাগ হিসেবে গঠিত:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

যেখানে fθ — প্রধান ও পুচ্ছ সত্তার উল্লেখের অবস্থানে ট্রান্সফর্মারের আউটপুট, W,b — শ্রেণীবিভাজকের প্যারামিটার, θ — মডেলের প্যারামিটার।[6]

বিশ্বাসযোগ্য ও নিয়ন্ত্রিত উৎপাদনের প্রক্রিয়া (Titan)

ERNIE 3.0 Titan দুই ধরনের অতিরিক্ত ক্ষতি ফাংশন প্রবর্তন করেছে।[6]

স্ব-তত্ত্বাবধানমূলক adversarial loss। Da={Doriginal,Dgenerated} ডেটাসেট তৈরি করা হয়, যেখানে Doriginal — প্রকৃত অনুচ্ছেদ, এবং Dgenerated — মূল অনুচ্ছেদের প্রিফিক্স ব্যবহার করে ERNIE-এর পূর্ববর্তী সংস্করণ দ্বারা উৎপন্ন পাঠ্য। টাস্কটি হলো [CLS] বিশেষ টোকেনের গোপন অবস্থা দিয়ে বাইনারি শ্রেণীবিভাজন (মূল / উৎপাদিত):

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

যেখানে h[CLS](n)n-তম উদাহরণের জন্য [CLS]-এর ভেক্টর উপস্থাপনা, I — মূল পাঠ্যের অন্তর্ভুক্তির সূচক।[6]

Controllable language modeling loss। প্রতিটি প্রশিক্ষণ উদাহরণ অ্যাট্রিবিউটের একটি সেট (prompt) সহ আসে যা ঘরানা, বিষয়, মূল শব্দ, মনোভাব এবং দৈর্ঘ্য বর্ণনা করে। ক্ষতি শর্তহীন ও শর্তযুক্ত ভাষা মডেলিং একত্রিত করে:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

যেখানে p — মোড পরিবর্তনের জন্য একটি এলোমেলো চলক, xt(n)n-তম উদাহরণের t-তম টোকেন। এই সংজ্ঞাটি মডেলের prompt-এর উপর অতিরিক্ত নির্ভরতা রোধ করে।[6]

হেটেরোজেনাস MoE আর্কিটেকচার (ERNIE 4.5)

ERNIE 4.5 মডালিটি অনুযায়ী বিশেষজ্ঞ বিভাজন সহ হেটেরোজেনাস মাল্টিমোডাল Mixture-of-Experts আর্কিটেকচার প্রবর্তন করে: টেক্সট বিশেষজ্ঞ ও ভিজ্যুয়াল বিশেষজ্ঞ (পরেরগুলির আকার টেক্সট বিশেষজ্ঞের প্রায় ১/৩)। টোকেন রাউটিং মডালিটি-বিচ্ছিন্ন রাউটিং (modality-isolated routing) এবং বিশেষজ্ঞদের বিশেষায়ন নিশ্চিত করতে রাউটারের জন্য অর্থোগোনালাইজিং পেনাল্টি (router orthogonalization loss, 103 মাত্রার সহগ) সহ পরিচালিত হয়। ভিডিও ডেটায় সময়গত, উচ্চতা ও প্রস্থ মাত্রার অবস্থানগত কোডিংয়ের জন্য 3D RoPE (Rotary Position Embeddings) ব্যবহার করা হয়। দীর্ঘ প্রসঙ্গের (সর্বাধিক ১৩১ হাজার টোকেন) সাথে দক্ষতার সাথে কাজ করতে O(N) মাস্ক সহ FlashMask প্রক্রিয়া প্রয়োগ করা হয়।[3]

ERNIE 4.5-এর পূর্বপ্রশিক্ষণ কয়েকটি পর্যায়ে পরিচালিত হয়: প্রথমে শুধুমাত্র টেক্সট ডেটায়, তারপর ভিজ্যুয়াল ডেটায়, এবং চূড়ান্ত পর্যায়ে মাল্টিমোডাল ডেটায় যৌথ প্রশিক্ষণ (text-only → vision-only → joint)। ছবি প্রক্রিয়াকরণের জন্য বিভিন্ন মডালিটির উপস্থাপনা সারিবদ্ধ করতে pixel shuffle প্রক্রিয়া সহ একটি অভিযোজিত ViT-এনকোডার (Vision Transformer) ব্যবহার করা হয়। অভিযোজিত ফ্রেম স্যাম্পলিং (adaptive frame sampling) সহ দীর্ঘ ভিডিও (সর্বাধিক ৩২ হাজার টোকেন) প্রক্রিয়াকরণ সমর্থিত।[3]

নেটিভ অমনিমোডালিটি (ERNIE 5.0)

ERNIE 5.0 অতি-বিরল MoE (ultra-sparse MoE) সহ একটি একীভূত আর্কিটেকচারে একাধিক মডালিটির (পাঠ্য, ছবি, অডিও, ভিডিও) নেটিভ অটোরিগ্রেসিভ মডেলিং বাস্তবায়ন করে, যেখানে প্রতিটি ধাপে মোট বিশেষজ্ঞের ৩%-এরও কম সক্রিয় হয়। পূর্বপ্রশিক্ষণ টাস্ক হিসেবে Next-Group-of-Tokens Prediction ব্যবহার করা হয় — একটির পরিবর্তে একটি গ্রুপ টোকেন পূর্বাভাস, যা প্রশিক্ষণের দক্ষতা বাড়ায়। অডিও মডালিটির জন্য একটি শ্রেণীবদ্ধ কোডেক (hierarchical codec) ব্যবহার করা হয়। Elastic training প্রযুক্তি একটি একক প্রশিক্ষণ রানের মধ্যে বিভিন্ন গভীরতা, প্রস্থ ও বিরলতার মাত্রা সহ সাব-মডেল তৈরি করতে দেয়।[4]

পূর্বপ্রশিক্ষণ টাস্ক ও ডেটা

ERNIE 3.0 / Titan-এর পূর্বপ্রশিক্ষণ টাস্ক

ERNIE 3.0 ও Titan-এ নিম্নলিখিত গ্রুপের পূর্বপ্রশিক্ষণ টাস্ক ব্যবহৃত হয়:[2][6]

Word-aware টাস্ক:

  • Knowledge Masked Language Modeling — স্থানীয় ও বৈশ্বিক প্রসঙ্গে নির্ভরতা শেখানোর জন্য বাক্যাংশ ও সত্তা-মাস্কিং।
  • Document Language Modeling — Transformer-XL পুনরাবৃত্তিমূলক মেমরি ব্যবহার করে সর্বাধিক ৫১২ টোকেনের দৈর্ঘ্যের ডকুমেন্টের অটোরিগ্রেসিভ মডেলিং।

Structure-aware টাস্ক:

  • Sentence Reordering — m সেগমেন্টে এলোমেলোভাবে বিভক্ত ও মিশ্রিত একটি অনুচ্ছেদের জন্য মডেলটি k=n=1mn! সহ k-শ্রেণী শ্রেণীবিভাজন সমাধান করে, মূল ক্রম পুনরুদ্ধার করে।
  • Sentence Distance — ৩-শ্রেণী শ্রেণীবিভাজন: পাশাপাশি বাক্য, একই ডকুমেন্টে অ-পাশাপাশি বাক্য, ভিন্ন ডকুমেন্টের বাক্য।

Knowledge-aware টাস্ক:

  • Universal Knowledge-Text Prediction (UKTP) — পাঠ্য ও জ্ঞান গ্রাফের ত্রিকের যৌথ মডেলিং।
  • Credible and Controllable Generations — adversarial loss ও controllable LM loss-এর সমন্বয়।

পূর্বপ্রশিক্ষণ ডেটা

ERNIE 3.0/Titan-এর জন্য ERNIE 3.0 Corpus ব্যবহৃত হয় — ১১টি বিভাগে প্রায় ৪ টেরাবাইটের একটি চীনা কর্পাস, যার মধ্যে রয়েছে ওয়েব পেজ, অনুসন্ধান লগ, প্রশ্নোত্তর ডেটা, সাহিত্যিক, আইনি, আর্থিক ও চিকিৎসা পাঠ্য, উপন্যাস ও কবিতা। কর্পাসের উপরে ৫ কোটিরও বেশি তথ্য সহ একটি জ্ঞান গ্রাফ গঠন করা হয়েছে।[2][6]

Titan-এর জন্য অতিরিক্তভাবে তৈরি করা হয়:

  • Adversarial dataset — ২ মিলিয়ন মূল অনুচ্ছেদ এবং মূলের প্রথম ১–৩ বাক্যের প্রিফিক্স দিয়ে ERNIE 3.0 দ্বারা উৎপন্ন সংশ্লিষ্ট "নেতিবাচক" অনুচ্ছেদ, সর্বাধিক ৫১২ টোকেন দৈর্ঘ্য।
  • Controllable dataset — ঘরানা, বিষয় (২৬টি থিম), মূল শব্দ, মনোভাব (positive/negative/neutral) ও দৈর্ঘ্যের অ্যাট্রিবিউট সহ পাঠ্য। ঘরানার অ্যাট্রিবিউট শেখানো যোগ্য "সফট prompt" দিয়ে কোড করা হয় (ঘরানার জন্য prompt সংখ্যা ০ থেকে ৬৪-এর মধ্যে এলোমেলোভাবে নির্বাচিত)।[6]

পরবর্তী সংস্করণ (ERNIE 4.5, 5.0) বিস্তৃত মাল্টিমোডাল কর্পাস (পাঠ্য, ছবি, ভিডিও, অডিও) ব্যবহার করে, যার মধ্যে কিউরেটেড ওয়েব কন্টেন্ট, বৈজ্ঞানিক প্রকাশনা এবং সিন্থেটিক ডেটা রয়েছে।[3][4]

প্রশিক্ষণ ও বিতরণকৃত অপ্টিমাইজেশন

ERNIE 3.0 Titan-এর পূর্বপ্রশিক্ষণ Adam অপ্টিমাইজার ব্যবহার করে পরিচালিত হয়েছিল (শিক্ষার হার 104, β1=0,9, β2=0,95, L2-রেগুলারাইজেশন ০.১, গ্র্যাডিয়েন্ট নর্ম ক্লিপিং ১.০ পর্যন্ত), সর্বাধিক প্রসঙ্গ দৈর্ঘ্য ৫১২ এবং জেনারেটিভ টাস্কের জন্য পুনরাবৃত্তিমূলক মেমরি দৈর্ঘ্য ১২৮। প্রগতিশীল প্রশিক্ষণ স্কিম (প্রথম ৪০০০ ধাপে ত্বরান্বিত অভিসরণ) এবং শিক্ষার হারের রৈখিক হ্রাস প্রয়োগ করা হয়েছিল।[6]

4D হাইব্রিড প্যারালেলাইজেশন

হেটেরোজেনাস ক্লাস্টারে (GPU NVIDIA V100 ও NPU Ascend 910) ২৬০ বিলিয়ন প্যারামিটারের ঘন মডেল প্রশিক্ষণের জন্য PaddlePaddle-এ 4D হাইব্রিড প্যারালেলাইজেশন বাস্তবায়ন করা হয়েছে:[6]

  • Data parallelism (DP) — পৃথক ব্যাচ প্রক্রিয়াকরণ সহ একাধিক ডিভাইসে মডেলের প্রতিলিপি।
  • Tensor model parallelism (MP) — স্তরের মধ্যে ডিভাইস জুড়ে ট্রান্সফর্মার প্যারামিটার ও অ্যাক্টিভেশনের বিভাজন।
  • Pipeline model parallelism (PP) — পাইপলাইন জুড়ে মডেলের স্তর বিতরণ।
  • Group Sharded — অপ্টিমাইজার অবস্থার নকল কমাতে ZeRO-সদৃশ sharded-data-parallel-এর উন্নত রূপ।

রিপোর্টে থ্রুপুটে প্রায় ৯১.৭% দক্ষতায় হাজার হাজার Ascend 910 কার্ডে দুর্বল স্কেলিংয়ের ডেটা প্রদান করা হয়েছে।[6]

ERNIE 4.5-এর প্রশিক্ষণ

ERNIE 4.5-এর প্রশিক্ষণ ২০১৬টি GPU NVIDIA H800-এর একটি ক্লাস্টারে পরিচালিত হয়েছিল, Model FLOPs Utilization (MFU) ৪৭% অর্জন করে। মিশ্রিত-নির্ভুলতা FP8, ত্রুটি-সহনশীল চেকপয়েন্ট (Zero Cost Checkpoint, ৮ মিনিটেরও কম সময়ে পুনরুদ্ধার) এবং ক্রমবর্ধমান ক্রম দৈর্ঘ্য ও ব্যাচ আকার সহ প্রগতিশীল প্রশিক্ষণ ব্যবহার করা হয়েছিল।[3]

অনলাইন ডিস্টিলেশন

ERNIE 3.0 Titan মোতায়েনের সময় কম্পিউটেশনাল সম্পদের প্রয়োজনীয়তা কমাতে অনলাইন ডিস্টিলেশন ব্যবহার করা হয়, যেখানে শিক্ষক মডেল ও বেশ কয়েকটি ছাত্র মডেল একযোগে প্রশিক্ষিত হয়:[6]

  • On-the-Fly Distillation (OFD) — শিক্ষকের লজিট ও উপস্থাপনা একই প্রশিক্ষণ ধাপে ছাত্রদের প্রশিক্ষণের জন্য ব্যবহৃত হয়।
  • Teacher assistants — শিক্ষক ও চূড়ান্ত ছাত্রদের মধ্যে ক্ষমতার ব্যবধান কমাতে মধ্যবর্তী আকারের মডেল।
  • Auxiliary Layer Distillation (ALD) — ছাত্রের মধ্যে একটি অতিরিক্ত স্তর, যা fine-tuning-এর সময় বাদ দেওয়া হয়, ভেতরের উপস্থাপনা আরও ভালোভাবে মেলানোর জন্য।

পোস্ট-প্রশিক্ষণ ও সারিবদ্ধকরণ

ERNIE-এর বাণিজ্যিক সংস্করণ (ERNIE Bot থেকে শুরু করে) পোস্ট-প্রশিক্ষণ পর্যায়গুলির মধ্য দিয়ে যায়:[7][3]

  • Supervised Fine-Tuning (SFT) — লেবেলযুক্ত নির্দেশনামূলক ডেটায় (ERNIE 4.5-এ — ২.৩ মিলিয়ন উদাহরণ) অতিরিক্ত-প্রশিক্ষণ।
  • Reinforcement Learning from Human Feedback (RLHF) — মানুষের প্রতিক্রিয়া ব্যবহার করে মডেলের আচরণ সারিবদ্ধকরণ; PPO (Proximal Policy Optimization) ও DPO (Direct Preference Optimization) অ্যালগরিদম প্রয়োগ করা হয়।
  • Unified Preference Optimization (UPO) — ERNIE 4.5-এ প্রবর্তিত পছন্দ অপ্টিমাইজেশনের একীভূত পদ্ধতি।
  • Reinforcement Learning with Verifiers (RLVR) — উত্তরের সঠিকতা যাচাই করতে ভেরিফায়ার সহ রিইনফোর্সমেন্ট লার্নিং; GRPO (Group Relative Policy Optimization) পদ্ধতি প্রয়োগ করা হয়।
  • চিন্তার মোড (thinking modes) — 4.5 মডেল চিন্তাভাবনা (reflection, planning) সহ ও ছাড়া উভয় মোড সমর্থন করে।

মূল ফলাফল ও benchmark

মডেল বিবর্তনের সংক্ষিপ্ত টেবিল

সংস্করণ বছর প্যারামিটার আর্কিটেকচার মূল benchmark উৎস
ERNIE 1.0 2019 ~১১০ মিলিয়ন (base) Transformer-এনকোডার (BERT-সদৃশ) XNLI ৭৮.৪%; MSRA-NER F1 ৯৩.৮% [1]
ERNIE 2.0 2019 ~১১০–৩৪০ মিলিয়ন Continual multi-task GLUE ৮০.৬ (base) / ৮৩.৬ (large); ১৬ টাস্কে SOTA [5]
ERNIE 3.0 2021 ১০ বিলিয়ন Unified Transformer-XL (AE+AR) SuperGLUE ৯০.৬% (> human ৮৯.৮%); ৫৪ চীনা টাস্কে SOTA [2]
ERNIE 3.0 Titan 2021 ২৬০ বিলিয়ন (dense) Dense + controllable generation ৬৮ dataset-এ SOTA; zero/few-shot [6]
ERNIE 4.5 2025 ০.৩–৪২৪ বিলিয়ন (MoE, ৪৭ বিলিয়ন সক্রিয়) Heterogeneous multimodal MoE C-Eval ৯০.৬%; MMLU ৮৬.৫%; MMMU ৬৭.৩–৭০% [3]
ERNIE 5.0 2026 ~২.৪ ট্রিলিয়ন (ultra-sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~১৪৬০ (বৈশ্বিকভাবে শীর্ষ-১০) [4]

ERNIE 3.0 ও Titan-এর ফলাফল

ERNIE 3.0 (১০ বিলিয়ন প্যারামিটার) ইংরেজি benchmark SuperGLUE-তে ৯০.৬ গড় ফলাফল অর্জন করেছে, যা মানবীয় রেফারেন্স (৮৯.৮) এবং প্রকাশনার সময়ে GPT-3, T5 ও DeBERTa-এর ফলাফল ছাড়িয়ে গেছে। ERNIE 3.0 Titan (২৬০ বিলিয়ন) শ্রেণীবিভাজন, NLI, QA ও উৎপাদন টাস্ক সহ ৬৮টি ডেটাসেটে মূল্যায়ন করা হয়েছিল; লেখকরা সমস্ত ৬৮টি dataset-এ পূর্বসূরি মডেলের তুলনায় শ্রেষ্ঠত্বের কথা জানিয়েছেন। এই ফলাফলগুলি মূল উৎসের ডেটা; স্বাধীন পুনরুৎপাদন সীমিতভাবে বর্ণিত হয়েছে।[2][6]

ERNIE 4.5-এর ফলাফল

২০২৫ সালের টেকনিক্যাল রিপোর্ট অনুযায়ী, ERNIE 4.5 (300B-A47B, পোস্ট-ট্রেনিং) টেক্সট ও মাল্টিমোডাল benchmark-এ নিম্নলিখিত ফলাফল দেখায়:[3]

Benchmark ERNIE-4.5-300B-A47B শর্তাবলী
C-Eval ৯০.৬% 5-shot
CMMLU ৯০.২%
MMLU ৮৬.৫% মানক
IFEval ৮৮.০% instruction following
GSM8K ৯১.৮%
MMMU ৬৭.৩–৭০.০% non-thinking / thinking
MathVista ৭৮.৮% thinking mode
OCRBench ৮৮৩

রিপোর্ট অনুযায়ী, ERNIE 4.5 ২৮টির মধ্যে ২২টি benchmark-এ DeepSeek-V3-কে ছাড়িয়ে গেছে; মাল্টিমোডাল ভেরিয়েন্ট (ERNIE-4.5-VL-424B-A47B) ভিজ্যুয়াল রিজনিং টাস্কে প্রতিযোগিতামূলক ফলাফল দেখিয়েছে। কিছু ভিজ্যুয়াল রিজনিং ও প্রযুক্তিগত ছবি ব্যাখ্যার টাস্কে (স্কিমা, ইঞ্জিনিয়ারিং ডায়াগ্রাম বিশ্লেষণ) কিছু GPT ও Gemini মডেলের তুলনায় উচ্চতর ফলাফলের কথা জানানো হয়েছে।[3][14]

ERNIE 4.5-এর প্রতিযোগীদের সাথে তুলনা (নির্বাচিত benchmark, পোস্ট-ট্রেনিং, ২০২৫ সালের টেকনিক্যাল রিপোর্ট অনুযায়ী):

Benchmark ERNIE-4.5-300B-A47B DeepSeek-V3-671B-A37B Qwen3-235B-A22B মন্তব্য
C-Eval ৯০.৬% 5-shot
MMLU ৮৬.৫% তুলনীয় মানক
IFEval ৮৮.০% ৮৩.২% instruction following
MMMU ৬৭.৩–৭০.০% thinking / non-thinking
MathVista ৭৮.৮% ৭৭.৬% (Qwen2.5-VL) thinking mode

পুনরুৎপাদনের শর্তাবলী: মানক প্রোটোকল (5-shot / zero-shot); ডেটাসেট উন্মুক্ত (C-Eval 2023+, MMLU, MMMU)। ড্যাশ ("—") মানে রিপোর্টে একই শর্তে তুলনীয় ডেটা প্রদান করা হয়নি।[3]

ERNIE Bot 4.0-এর মূল্যায়ন

সিংহুয়া বিশ্ববিদ্যালয়ের SuperBench রিপোর্ট একটি টাস্ক সেটে (ভাষা বোঝাপড়া, গণিত, প্রোগ্রামিং, মাল্টিটাস্কিং) বাণিজ্যিক LLM-গুলিকে র‍্যাঙ্ক করে। ERNIE Bot 4.0 চীনা মডেলের মধ্যে প্রথম স্থান পেয়েছে, সমন্বিত মেট্রিকে GLM-4 (Zhipu AI)-কে প্রায় ০.৪১ পয়েন্টে পেছনে ফেলেছে; বৈশ্বিক রেটিংয়ে GPT-4 ও Anthropic Claude-3 মডেলগুলি এখনও উচ্চে ছিল। ERNIE Bot 4.0 চীনা পাঠ্য বোঝাপড়া ও নির্দেশনা অনুসরণে শক্তিশালী ফলাফল দেখিয়েছে, তবে প্রোগ্রামিং ও কিছু ইংরেজি টাস্কে তুলনামূলকভাবে দুর্বল।[9][10]

প্রয়োগ

Baidu-এর পণ্য ও সেবা

ERNIE সিরিজের মডেলগুলি Baidu-এর পণ্য ইকোসিস্টেমে একীভূত:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — মাল্টিমোডাল উৎপাদন (পাঠ্য, ছবি, ভিডিও, অডিও) সমর্থন সহ চ্যাটবট। Baidu-এর ডেটা অনুযায়ী, মাসিক সক্রিয় ব্যবহারকারীর সংখ্যা ২০ কোটি ছাড়িয়েছে (২০২৪–২০২৫)। ২০২৫ সাল থেকে ERNIE Bot বিনামূল্যে পাওয়া যাচ্ছে।[7]
  • Baidu অনুসন্ধান — অনুসন্ধান ফলাফলে উত্তর উৎপাদন ও AI-ফিচার; Baidu-এর ডেটা অনুযায়ী, শীর্ষ ফলাফলের সর্বাধিক ৭০% AI-উপাদান দিয়ে সমৃদ্ধ।
  • Qianfan (MaaS প্ল্যাটফর্ম) — কর্পোরেট ক্লায়েন্টদের জন্য API; Baidu-এর ডেটা অনুযায়ী, ৭.৬ লক্ষেরও বেশি উদ্যোগ প্ল্যাটফর্ম ব্যবহার করে, দৈনিক API কল সংখ্যা ১.৫ বিলিয়নেরও বেশি (২০২৪)। ক্লায়েন্টদের মধ্যে Lenovo, Trip.com এবং অন্যান্য।[7]
  • Comate — প্রোগ্রামিংয়ের জন্য AI-সহকারী।
  • Wenxin Yige — ERNIE-ViLG মডেলের উপর ভিত্তি করে ছবি উৎপাদন।[11]
  • বাহ্যিক অংশীদারদের সাথে একীভূতকরণ: Samsung Galaxy (চীনা বাজারের জন্য), ডিজিটাল অবতার, প্লাগইন (অনুসন্ধান, ফাইল বিশ্লেষণ)।[7]

শিল্পখাতের প্রয়োগ

মডেলগুলি নিম্নলিখিত ক্ষেত্রে ব্যবহৃত হয়:[7][3]

  • জ্ঞান-উন্নত পূর্বপ্রশিক্ষণ ব্যবহার করে ডোমেইন ক্ষেত্রে (আইন, চিকিৎসা, অর্থ) প্রশ্নোত্তর সিস্টেম।
  • চীনা ভাষায় পাঠ্য উৎপাদন ও সম্পাদনা (সংবাদ, মার্কেটিং পাঠ্য, সৃজনশীল বিষয়বস্তু)।
  • মাল্টিমোডাল টাস্ক: ছবি, ইঞ্জিনিয়ারিং স্কিমা, ভিডিও ও সারণী ডেটা বিশ্লেষণ (সংস্করণ 4.5 ও উপরে)।
  • শিক্ষা (ব্যক্তিগতকৃত শিক্ষণ), রোবোটিক্স (টাস্ক পরিকল্পনা), স্বায়ত্তশাসিত ড্রাইভিং (Apollo)।

মুক্ত উৎস কোড

ERNIE 4.5 থেকে শুরু করে পরিবারের সমস্ত ১০টি ভেরিয়েন্ট Apache 2.0 লাইসেন্সের অধীনে ERNIEKit টুলকিট সহ প্রকাশিত হয়েছে (SFT, LoRA, DPO, PaddlePaddle/FastDeploy-এ inference সমর্থন)। পূর্ববর্তী সংস্করণের (ERNIE 1.0–3.0) কোড GitHub PaddlePaddle/ERNIE-তে পাওয়া যায়।[3][15]

সীমাবদ্ধতা ও অমীমাংসিত সমস্যা

আর্কিটেকচারাল ও ডেটাসেট সীমাবদ্ধতা

ERNIE 3.0 Titan ২৬০ বিলিয়ন প্যারামিটার নিয়েও পৃথক মডিউলের জন্য ৫১২ টোকেনের প্রসঙ্গ দৈর্ঘ্যে সীমাবদ্ধ, যা অতিরিক্ত প্রক্রিয়া (chunking, বাহ্যিক মেমরি) ছাড়া দীর্ঘ পাঠ্যের মডেলিং সীমিত করে। প্রশিক্ষণ মূলত চীনা কর্পাসে পরিচালিত হয়, যা চীনা ও অন্যান্য ভাষার মধ্যে গুণমানের অসামঞ্জস্য সৃষ্টি করে।[6]

জ্ঞান গ্রাফের একীভূতকরণ কাঠামোগত তথ্যের সাথে কাজ উন্নত করে, তবে জ্ঞানের নির্ভুলতা ও সম্পূর্ণতা গ্রাফটির নিজের গুণমান এবং "ত্রিক–পাঠ্য" মেলানোর পদ্ধতি (entity linking, relation alignment) দ্বারা সীমিত, যা কিছু ক্ষেত্রে ভুল বা অসম্পূর্ণ সংযোগ ঘটায়।[6]

হ্যালুসিনেশন ও বিশ্বাসযোগ্যতা

Adversarial loss ও controllable LM loss অবিশ্বস্ত উৎপাদনের বিরুদ্ধে স্থিতিস্থাপকতা উন্নত করে, কিন্তু হ্যালুসিনেশনের সমস্যা (তথ্যগতভাবে ভুল বিবৃতির উৎপাদন) সম্পূর্ণভাবে নির্মূল করতে পারে না। Adversarial শ্রেণীবিভাজকের প্যারামিটার এমন ডেটায় প্রশিক্ষিত যেখানে "উৎপাদিত" পাঠ্য ERNIE-এর পূর্ববর্তী সংস্করণ দ্বারা তৈরি, যা চেনা যাওয়া ভুল প্যাটার্নের পরিধি সীমিত করে।[6]

সামাজিক পক্ষপাত

PeerJ Computer Science (২০২৫)-এ প্রকাশিত একটি গবেষণা ২৪০টি সামাজিক গোষ্ঠী ও ৩০ হাজারেরও বেশি উৎপন্ন বিবরণ ব্যবহার করে চীনা LLM (ERNIE ও Qwen)-এ সামাজিক পক্ষপাত বিশ্লেষণ করে। ফলাফল দেখায় যে ERNIE Baidu অনুসন্ধান বা Qwen-এর তুলনায় কম নেতিবাচক ও স্টেরিওটাইপিক্যাল বিষয়বস্তু তৈরি করে (ERNIE-তে প্রায় ১/১০ নেতিবাচক অর্থের প্রার্থী শব্দ, Qwen-এ ১/৩-এর বিপরীতে)। তবুও স্টেরিওটাইপের নির্দিষ্ট প্রকোপ, সম্ভাব্য আপত্তিজনক বিবরণ সহ, অব্যাহত থাকে।[16][17]

পুনরুৎপাদনযোগ্যতা

সিরিজের কিছু মডেল (ERNIE 3.0 Titan, বাণিজ্যিক ERNIE Bot 4.0 ও 5.0) সম্পূর্ণ উন্মুক্ত কোড ও ওজন হিসেবে পাওয়া যায় না, যা benchmark-এর পুনরুৎপাদনযোগ্যতা ও স্বাধীন মূল্যায়নের সম্ভাবনা সীমিত করে। Apache 2.0-এর অধীনে ERNIE 4.5 প্রকাশের সাথে পরিস্থিতির উন্নতি হয়েছে, তবে আর্কিটেকচার ও প্রশিক্ষণ সেটিংস প্রাথমিক প্রকাশনায় বর্ণিত থেকে ভিন্ন হতে পারে।[3][6]

চিকিৎসা নিরাপত্তা

চিকিৎসা পরিস্থিতিতে ERNIE Bot ব্যবহারের গবেষণা (Si et al., 2025) অতিরিক্ত প্রেসক্রিপশনের প্রবণতা চিহ্নিত করেছে: মডেল পরিস্থিতিতে ৯১.৯% অপ্রয়োজনীয় পরীক্ষা ও ৫৭.৮% অপ্রয়োজনীয় ওষুধ, এবং সুপারিশে বয়স ও আর্থ-সামাজিক বৈষম্য।[18]

নৈতিক ও নিয়ন্ত্রক দিক

ERNIE সিরিজের মডেলগুলি চীনা জেনারেটিভ AI নিয়ন্ত্রণের কাঠামোর মধ্যে কাজ করে, বিশেষত "জেনারেটিভ AI সেবা পরিচালনার অন্তর্বর্তীকালীন ব্যবস্থা" (Interim Measures for Generative AI Services, 2023), যা বাধ্যতামূলক নিরাপত্তা মূল্যায়ন, অ্যালগরিদম নিবন্ধন এবং বিষয়বস্তুর উপর সীমাবদ্ধতা নির্ধারণ করে।[7][17]

ERNIE Bot জাতীয় আইন অনুযায়ী সংবেদনশীল রাজনৈতিক বিষয়ের সাথে সম্পর্কিত অনুরোধে উচ্চ মাত্রার প্রত্যাখ্যান প্রদর্শন করে। গবেষণা (Pan et al., 2026) Baidu-এর মডেল সহ চীনা উৎসের LLM-এ রাজনৈতিক সেন্সরশিপ বিশ্লেষণ করে।[19]

Baidu-এর প্রকাশনা সবসময় মডেল আচরণ অডিটের পদ্ধতি, বিষয়বস্তু ফিল্টারিং মানদণ্ড এবং স্থানীয় নিয়ন্ত্রক প্রয়োজনীয়তা ও AI নৈতিকতার সাধারণ নীতির মধ্যে ভারসাম্যের বিস্তারিত বর্ণনা দেয় না, যা স্বাধীন গবেষণার একটি উন্মুক্ত ক্ষেত্র হিসেবে রয়ে গেছে।[17]

সম্ভাবনা ও গবেষণার দিকনির্দেশনা

টেকনিক্যাল রিপোর্ট ও Baidu-এর বিবৃতির ভিত্তিতে ERNIE সিরিজের উন্নয়নের নিম্নলিখিত দিকনির্দেশনা চিহ্নিত করা হয়েছে:

  • আরও মাল্টিমোডালাইজেশন (পাঠ্য–ছবি–ভিডিও–অডিও), ঘন প্রযুক্তিগত ভিজ্যুয়াল ডেটা (ইঞ্জিনিয়ারিং স্কিমা, চিকিৎসা ছবি) প্রক্রিয়াকরণ সহ।[3][4]
  • গুণমান ও কম্পিউটেশনাল দক্ষতার মধ্যে ভারসাম্য রাখতে অতি বড় মোট মডেল আকারে ঘন ও MoE আর্কিটেকচারের সমন্বয়।[3]
  • প্রোডাকশন workflow-এ একীভূতকরণের জন্য এজেন্ট সিস্টেম (GenFlow, Famou) ও কাঠামোগত উৎপাদনের টুল (JSON, API কল) উন্নয়ন।[3]
  • প্রশিক্ষণ দক্ষতা উন্নয়ন: elastic training, উন্নত MoE স্কেলিং (MFU), কোয়ান্টাইজেশন (W4A8, একটি GPU-তে ডিপ্লয়মেন্টের জন্য 2-bit)।[3]
  • সংস্কৃতি-নির্দিষ্ট দিক বিবেচনায় চীনা LLM-এ পক্ষপাত হ্রাস গবেষণা এবং চীনা ভাষা ও মাল্টিমোডাল টাস্কের জন্য benchmark পদ্ধতি উন্নয়ন।[16][17]
  • দীর্ঘ প্রসঙ্গে রিজনিং উন্নয়ন, যাচাইযোগ্য রিইনফোর্সমেন্ট লার্নিং (verifiable RL) এবং সিন্থেটিক কর্পাসের মাধ্যমে সীমিত ডেটার ডোমেইনে অভিযোজন।[3][4]

অন্যান্য চীনা LLM-এর সাথে তুলনা

ERNIE Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) ও Tongyi Qianwen সহ বেশ কিছু বড় চীনা LLM-এর সাথে প্রতিযোগিতা করে। ERNIE সিরিজের মূল পার্থক্য হলো পূর্বপ্রশিক্ষণে জ্ঞান গ্রাফের একীভূতকরণে জোর (knowledge enhancement), Baidu ইকোসিস্টেমের সাথে ঘনিষ্ঠ একীভূতকরণ (অনুসন্ধান, ক্লাউড, API) এবং PaddlePaddle প্ল্যাটফর্মে মনোনিবেশ। স্বাধীন রেটিং (SuperBench, LMArena) অনুযায়ী, ERNIE সিরিজের মডেলগুলি চীনা LLM-গুলির মধ্যে উচ্চ স্থান দখল করে, বিশেষত চীনা ভাষায় বোঝাপড়া ও নির্দেশনা অনুসরণের টাস্কে।[9][13][16]

আরও দেখুন

  • BERT
  • Transformer আর্কিটেকচার
  • RLHF

সাহিত্য

টীকা

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.