ERNIE (Baidu) (BN)
ERNIE (Baidu) — পূর্বপ্রশিক্ষিত ভাষা মডেলের (Large Language Model, LLM) এবং মাল্টিমোডাল ফান্ডামেন্টাল মডেলের একটি সিরিজ, যা Baidu কোম্পানি ২০১৯ সাল থেকে Enhanced Representation through kNowledge IntEgration (জ্ঞান-একীভূতকরণের মাধ্যমে উন্নত উপস্থাপনা) নামে তৈরি করে আসছে। এই সিরিজটি Knowledge Graph (KG), অন্টোলজি এবং বিশ্বকোষ থেকে বাহ্যিক জ্ঞানকে পূর্বপ্রশিক্ষণ প্রক্রিয়ায় সরাসরি একীভূত করার মাধ্যমে শব্দার্থিক বোঝাপড়া ও উৎপাদনের মান উন্নয়নে মনোনিবেশ করে।[1][2]
এই সিরিজের মডেলগুলি সত্তা ও বাক্যাংশ-মাস্কিং সহ BERT-ভিত্তিক প্রাথমিক সংস্করণ (ERNIE 1.0, 2.0) থেকে শুরু করে বৃহৎ-মাপের একীভূত আর্কিটেকচার (ERNIE 3.0, ERNIE 3.0 Titan), তারপর মুক্ত উৎস কোডসহ Mixture-of-Experts (MoE)-ভিত্তিক মাল্টিমোডাল সিস্টেম (ERNIE 4.5) এবং নেটিভ অমনিমোডাল মডেলে (ERNIE 5.0) বিকশিত হয়েছে। এই সিরিজটি Natural Language Understanding (NLU), Natural Language Generation (NLG) এবং পরবর্তী সংস্করণে মাল্টিমোডাল কাজ (পাঠ্য, ছবি, ভিডিও, অডিও) সমর্থন করে, চীনা ভাষায় বিশেষ মনোযোগ দেওয়া হয়েছে এবং বহুভাষিকতাও সমর্থিত।[2][3][4]
ইতিহাস ও পটভূমি
ERNIE সিরিজের উন্নয়ন ২০১৯ সালে Baidu-এর গবেষণা বিভাগে শুরু হয়েছিল BERT মডেলের (Devlin et al., 2018) সাফল্যের পরিপ্রেক্ষিতে এবং চীনা ভাষার জন্য পূর্বপ্রশিক্ষিত মডেল অভিযোজিত করার প্রয়োজনীয়তার কারণে — যেখানে শব্দের মধ্যে স্পষ্ট স্থানের অনুপস্থিতি এবং বহুঅর্থী হ্যানজির উচ্চ অনুপাত শব্দার্থিক একক (সত্তা, বাক্যাংশ) চিহ্নিত করাকে জটিল করে তোলে।[1]
ERNIE 1.0 (2019)
সিরিজের প্রথম মডেল (Sun et al., arXiv:1904.09223, এপ্রিল ২০১৯) BERT-সদৃশ আর্কিটেকচারের জন্য বহুস্তরীয় জ্ঞান-মাস্কিং (knowledge masking) কৌশল উপস্থাপন করেছিল: এলোমেলো টোকেন মাস্কিংয়ের পরিবর্তে মডেলটি Named Entity Recognition (NER) ও বাক্যাংশ প্যাটার্নের উপর ভিত্তি করে নির্ধারিত সম্পূর্ণ সত্তা ও বাক্যাংশ মাস্ক করে।[1]
ERNIE 1.0-এর আর্কিটেকচার Transformer-এনকোডারের উপর ভিত্তি করে তৈরি (১২টি স্তর, গোপন মাত্রা ৭৬৮, ১২টি attention হেড)। অতিরিক্তভাবে ডায়ালগ ডেটায় প্রশিক্ষণের জন্য Dialogue Language Model (DLM) টাস্ক প্রবর্তন করা হয়েছে। মডেলটি Wikipedia, Baidu Baike, সংবাদ এবং Baidu Tieba ফোরামের কর্পাস থেকে প্রায় ১৭৩ মিলিয়ন চীনা বাক্যে প্রশিক্ষিত। প্রকাশনার সময়ে ERNIE 1.0 পাঁচটি চীনা NLP টাস্কে state-of-the-art (SOTA) ফলাফল অর্জন করেছিল: XNLI (পরীক্ষায় নির্ভুলতা ৭৮.৪%, BERT-এর ৭৭.২%-এর বিপরীতে), MSRA-NER (F1 ৯৩.৮%, ৯২.৬%-এর বিপরীতে)।[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412, জুলাই ২০১৯; AAAI 2020 কনফারেন্সে গৃহীত) ক্রমাগত বহু-টাস্ক পূর্বপ্রশিক্ষণের (continual multi-task pre-training) একটি ফ্রেমওয়ার্ক প্রবর্তন করেছে, যেখানে মডেলকে সম্পূর্ণরূপে পুনরায় প্রশিক্ষণ না দিয়ে সাধারণ ট্রান্সফর্মারে ক্রমান্বয়ে (incrementally) নতুন পূর্বপ্রশিক্ষণ টাস্ক যোগ করা হয়।[5]
ERNIE 2.0-এর পূর্বপ্রশিক্ষণ টাস্কগুলি তিনটি গ্রুপে বিভক্ত:
- Word-aware — জ্ঞান-মাস্কিং (knowledge masking), বড় হাতের অক্ষর পূর্বাভাস (capitalization prediction), টোকেন-ডকুমেন্ট সম্পর্ক (token-document relation)।
- Structure-aware — বাক্য পুনর্বিন্যাস (sentence reordering), বাক্যের মধ্যে দূরত্ব নির্ধারণ (sentence distance)।
- Semantic-aware — ডিসকোর্স সম্পর্ক পূর্বাভাস (discourse relation prediction), তথ্য অনুসন্ধান প্রাসঙ্গিকতা পূর্বাভাস (IR relevance prediction)।[5]
মডেলটি ইংরেজি ও চীনা কর্পাসে (বিশ্বকোষ, বই, Reddit, অনুসন্ধান লগ) প্রশিক্ষিত। ফলাফল: base মডেলের GLUE গড় স্কোর ৮০.৬ (BERT-এর ৭৮.৩-এর বিপরীতে), large মডেলের ৮৩.৬; ERNIE 2.0 ১৬টি টাস্কে BERT ও XLNet-কে ছাড়িয়ে গেছে।[5]
ERNIE 3.0 (2021)
ERNIE 3.0 ফ্রেমওয়ার্ক (Sun et al., arXiv:2107.02137, জুলাই ২০২১) একটি একীভূত আর্কিটেকচারে অটো-এনকোডিং (auto-encoding, AE) ও অটোরিগ্রেসিভ (auto-regressive, AR) পূর্বপ্রশিক্ষণ প্যারাডাইম একত্রিত করেছে, যা NLU ও NLG-এর জন্য Universal Representation Module এবং Task-specific Representation Modules-এ বিভক্ত।[2]
১০ বিলিয়ন প্যারামিটারের মডেলটি ৪ টেরাবাইট চীনা টেক্সটে (১১টি বিভাগ: Baidu Baike, Wikipedia, অনুসন্ধান লগ, প্রশ্নোত্তর সিস্টেম, ডোমেইন-নির্দিষ্ট পাঠ্য) এবং ৫ কোটিরও বেশি তথ্য সম্বলিত জ্ঞান গ্রাফে প্রশিক্ষিত। ERNIE 3.0 ৫৪টি চীনা NLP টাস্কে SOTA অর্জন করেছে; ইংরেজি benchmark SuperGLUE-তে — ৯০.৬% (৩ জুলাই ২০২১ অনুযায়ী, মানবীয় রেফারেন্স ৮৯.৮%-এর উপরে)।[2]
ERNIE 3.0 Titan (2021)
"ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, ডিসেম্বর ২০২১) গবেষণাপত্রে ERNIE 3.0 ফ্রেমওয়ার্ককে PaddlePaddle প্ল্যাটফর্মে ২৬০ বিলিয়ন প্যারামিটারের একটি ঘন (dense) মডেলে স্কেল করার বিবরণ দেওয়া হয়েছে।[6]
Titan আরও বেশ কিছু প্রক্রিয়া প্রবর্তন করেছে: উৎপন্ন পাঠ্যের বিশ্বাসযোগ্যতা মূল্যায়নের জন্য স্ব-তত্ত্বাবধানমূলক adversarial loss, শৈলী, বিষয়, মনোভাব এবং উৎপাদনের দৈর্ঘ্য নিয়ন্ত্রণের জন্য controllable language modeling loss, এবং পূর্বপ্রশিক্ষণ চলাকালীন কম্প্যাক্ট ছাত্র-মডেল পাওয়ার জন্য অনলাইন-ডিস্টিলেশন (On-the-Fly Distillation, OFD)। মডেলটি ৬৮টি ডেটাসেটে মূল্যায়ন করা হয়েছিল এবং লেখকদের মতে, সমস্ত ৬৮টি dataset-এ পূর্বসূরি মডেলগুলিকে ছাড়িয়ে গেছে।[6]
ERNIE Bot ও বাণিজ্যিক সংস্করণ (২০২৩–২০২৫)
মার্চ ২০২৩ সালে Baidu ERNIE 3.x ও PLATO (ডায়ালগ মডেল) মডেলের উপর ভিত্তি করে চ্যাটবট ERNIE Bot (Wenxin Yiyan, 文心一言) প্রকাশ করে। নিয়ন্ত্রকদের অনুমোদনের পর আগস্ট ২০২৩ সালে সর্বসাধারণের জন্য উন্মুক্ত করা হয়। আপডেটের মধ্যে রয়েছে ERNIE 3.5 (জুন ২০২৩) এবং ERNIE 4.0 (অক্টোবর ২০২৩)।[7][8]
সিংহুয়া বিশ্ববিদ্যালয়ের SuperBench প্রতিবেদন অনুযায়ী, ERNIE Bot 4.0 সমন্বিত মেট্রিকে চীনা LLM-গুলির মধ্যে প্রথম স্থান অর্জন করেছে, চীনা ভাষা বোঝাপড়া এবং নির্দেশনা অনুসরণে শক্তিশালী ফলাফল দেখিয়েছে।[9][10]
২০২২ সালে মূল ভাষা লাইনআপের পাশাপাশি মাল্টিমোডাল সম্প্রসারণ ERNIE-ViLG 2.0 (arXiv:2210.15257) উপস্থাপন করা হয়েছিল — একটি টেক্সট-থেকে-ছবি উৎপাদন মডেল (text-to-image), যা মাল্টিমোডালিটির দিকে প্রথম পদক্ষেপগুলির একটি।[11]
২০২৪ সালে WAVE SUMMIT কনফারেন্সে Baidu ERNIE 4.0 Turbo উপস্থাপন করেছে — উচ্চ-গতির অ্যাপ্লিকেশনের জন্য একটি অপ্টিমাইজড সংস্করণ, যা গুণমান বজায় রেখে প্রায় ২০ সেকেন্ডে এক হাজারেরও বেশি শব্দের পাঠ্য তৈরি করতে সক্ষম।[12]
ERNIE 4.5 (2025)
জুন ২০২৫ সালে Baidu ERNIE 4.5-এর টেকনিক্যাল রিপোর্ট প্রকাশ করেছে, যা ১০টি মডেলের একটি পরিবার উপস্থাপন করে: টেক্সট LLM ও মাল্টিমোডাল মডেল (Vision-Language, VL)। আর্কিটেকচারটি মডালিটি অনুযায়ী বিশেষজ্ঞ বিভাজন সহ হেটেরোজেনাস Mixture-of-Experts (MoE)-এর উপর ভিত্তি করে। ভেরিয়েন্টগুলিতে সর্বাধিক ৪২৪ বিলিয়ন মোট এবং ৪৭ বিলিয়ন সক্রিয় প্যারামিটার সহ MoE মডেল এবং ০.৩ বিলিয়ন প্যারামিটারের একটি ঘন মডেল অন্তর্ভুক্ত রয়েছে। পরিবারটি Hugging Face ও GitHub (PaddlePaddle/ERNIE)-এ Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত হয়েছে।[3]
ERNIE 5.0 (2026)
ফেব্রুয়ারি ২০২৬ সালে ERNIE 5.0-এর টেকনিক্যাল রিপোর্ট (arXiv:2602.04705) প্রকাশিত হয়েছে — একটি নেটিভ অমনিমোডাল অটোরিগ্রেসিভ মডেল যা অতি-বিরল MoE (ultra-sparse MoE) সহ পাঠ্য, ছবি, অডিও ও ভিডিওর যৌথ মডেলিং সমর্থন করে। মডেলটি LMArena লিডারবোর্ডে উচ্চ স্থানে ছিল।[4][13]
তাত্ত্বিক ভিত্তি ও আর্কিটেকচারাল নীতিমালা
জ্ঞান-মাস্কিং (Knowledge Masking)
সিরিজের প্রাথমিক মডেলগুলির মূল নীতি হলো পরিবর্তিত মাস্কিং কৌশলের মাধ্যমে পূর্বপ্রশিক্ষণ প্রক্রিয়ায় কাঠামোগত জ্ঞানের একীভূতকরণ। মানক Masked Language Modeling (MLM)-এর মতো পৃথক টোকেন মাস্ক করার পরিবর্তে, ERNIE 1.0 সম্পূর্ণ শব্দার্থিক একক মাস্ক করে: সত্তা (NER-এর মাধ্যমে নির্ধারিত) এবং বাক্যাংশ। সত্তার জন্য নির্দিষ্ট সম্ভাব্যতায় সম্পূর্ণ টোকেন ক্রম মাস্ক করা হয়। এই পদ্ধতিটি মডেলকে বৃহত্তর প্রসঙ্গের উপর নির্ভর করতে এবং সত্তাগুলির মধ্যে সম্পর্ক শেখাতে বাধ্য করে।[1]
ERNIE 2.0 এই পদ্ধতি আরও বিকশিত করেছে, ইনক্রিমেন্টাল বহু-টাস্ক শিক্ষণ যোগ করে: শাব্দিক, কাঠামোগত ও শব্দার্থিক স্তরের টাস্কগুলি ক্রমান্বয়ে যোগ করা হয়, এবং ক্রমাগত পূর্বপ্রশিক্ষণ (continual pre-training) প্রক্রিয়ার মাধ্যমে পূর্বে শেখা জ্ঞান সংরক্ষিত থাকে।[5]
ERNIE 3.0-এর একীভূত ফ্রেমওয়ার্ক
ERNIE 3.0 ফ্রেমওয়ার্ক আর্কিটেকচারকে দুটি স্তরে বিভক্ত করার উপর ভিত্তি করে:[2][6]
- Universal Representation Module — একটি সাধারণ বহুস্তরীয় Transformer-XL, যা বিভিন্ন পূর্বপ্রশিক্ষণ টাস্কে প্রশিক্ষিত এবং সাধারণ শাব্দিক ও বাক্যগঠনগত বৈশিষ্ট্য নিষ্কাশন করে। Titan সংস্করণে এই মডিউলে ৪৮টি স্তর, ১২২৮৮ আকারের গোপন উপস্থাপনা, ১৯২টি attention হেড এবং ১৯৬৬০৮ আকারের ভেতরের feed-forward নেটওয়ার্ক () রয়েছে।
- Task-specific Representation Modules — NLU (দ্বি-দিকনির্দেশক attention) ও NLG (Transformer-XL পুনরাবৃত্তিমূলক মেমরি সহ একমুখী attention) এর জন্য পৃথক মডিউল, প্রতিটিতে ১২টি স্তর, ৭৬৮ আকারের গোপন ভেক্টর এবং ১২টি attention হেড রয়েছে।
অটো-এনকোডিং ও অটোরিগ্রেসিভ প্যারাডাইমের একীভূতকরণ একটি মডেলকে NLU benchmark (BERT-সদৃশ টাস্ক) এবং NLG benchmark (GPT-সদৃশ টাস্ক) উভয়ে উচ্চ ফলাফল অর্জন করতে দেয়।[2]
Universal Knowledge-Text Prediction (UKTP)
UKTP টাস্কটি ERNIE 3.0/Titan-এ জ্ঞান একীভূতকরণের কেন্দ্রীয় প্রক্রিয়া। মডেলটি একটি জোড়া (জ্ঞান গ্রাফের ত্রিক, বিশ্বকোষের বাক্য) পায় এবং হয় পাঠ্য ব্যবহার করে ত্রিকের সম্পর্ক পূর্বাভাস দিতে হয়, অথবা ত্রিকের তথ্য ব্যবহার করে পাঠ্যের মাস্ক করা টোকেন পূর্বাভাস দিতে হয়।[6]
পাঠ্য -এর সাথে সম্পর্কিত ত্রিক -এ সম্পর্ক পূর্বাভাসের ক্ষেত্রে টাস্কটি বহু-শ্রেণী শ্রেণীবিভাগ হিসেবে গঠিত:
যেখানে — প্রধান ও পুচ্ছ সত্তার উল্লেখের অবস্থানে ট্রান্সফর্মারের আউটপুট, — শ্রেণীবিভাজকের প্যারামিটার, — মডেলের প্যারামিটার।[6]
বিশ্বাসযোগ্য ও নিয়ন্ত্রিত উৎপাদনের প্রক্রিয়া (Titan)
ERNIE 3.0 Titan দুই ধরনের অতিরিক্ত ক্ষতি ফাংশন প্রবর্তন করেছে।[6]
স্ব-তত্ত্বাবধানমূলক adversarial loss। ডেটাসেট তৈরি করা হয়, যেখানে — প্রকৃত অনুচ্ছেদ, এবং — মূল অনুচ্ছেদের প্রিফিক্স ব্যবহার করে ERNIE-এর পূর্ববর্তী সংস্করণ দ্বারা উৎপন্ন পাঠ্য। টাস্কটি হলো [CLS] বিশেষ টোকেনের গোপন অবস্থা দিয়ে বাইনারি শ্রেণীবিভাজন (মূল / উৎপাদিত):
যেখানে — -তম উদাহরণের জন্য [CLS]-এর ভেক্টর উপস্থাপনা, — মূল পাঠ্যের অন্তর্ভুক্তির সূচক।[6]
Controllable language modeling loss। প্রতিটি প্রশিক্ষণ উদাহরণ অ্যাট্রিবিউটের একটি সেট (prompt) সহ আসে যা ঘরানা, বিষয়, মূল শব্দ, মনোভাব এবং দৈর্ঘ্য বর্ণনা করে। ক্ষতি শর্তহীন ও শর্তযুক্ত ভাষা মডেলিং একত্রিত করে:
যেখানে — মোড পরিবর্তনের জন্য একটি এলোমেলো চলক, — -তম উদাহরণের -তম টোকেন। এই সংজ্ঞাটি মডেলের prompt-এর উপর অতিরিক্ত নির্ভরতা রোধ করে।[6]
হেটেরোজেনাস MoE আর্কিটেকচার (ERNIE 4.5)
ERNIE 4.5 মডালিটি অনুযায়ী বিশেষজ্ঞ বিভাজন সহ হেটেরোজেনাস মাল্টিমোডাল Mixture-of-Experts আর্কিটেকচার প্রবর্তন করে: টেক্সট বিশেষজ্ঞ ও ভিজ্যুয়াল বিশেষজ্ঞ (পরেরগুলির আকার টেক্সট বিশেষজ্ঞের প্রায় ১/৩)। টোকেন রাউটিং মডালিটি-বিচ্ছিন্ন রাউটিং (modality-isolated routing) এবং বিশেষজ্ঞদের বিশেষায়ন নিশ্চিত করতে রাউটারের জন্য অর্থোগোনালাইজিং পেনাল্টি (router orthogonalization loss, মাত্রার সহগ) সহ পরিচালিত হয়। ভিডিও ডেটায় সময়গত, উচ্চতা ও প্রস্থ মাত্রার অবস্থানগত কোডিংয়ের জন্য 3D RoPE (Rotary Position Embeddings) ব্যবহার করা হয়। দীর্ঘ প্রসঙ্গের (সর্বাধিক ১৩১ হাজার টোকেন) সাথে দক্ষতার সাথে কাজ করতে মাস্ক সহ FlashMask প্রক্রিয়া প্রয়োগ করা হয়।[3]
ERNIE 4.5-এর পূর্বপ্রশিক্ষণ কয়েকটি পর্যায়ে পরিচালিত হয়: প্রথমে শুধুমাত্র টেক্সট ডেটায়, তারপর ভিজ্যুয়াল ডেটায়, এবং চূড়ান্ত পর্যায়ে মাল্টিমোডাল ডেটায় যৌথ প্রশিক্ষণ (text-only → vision-only → joint)। ছবি প্রক্রিয়াকরণের জন্য বিভিন্ন মডালিটির উপস্থাপনা সারিবদ্ধ করতে pixel shuffle প্রক্রিয়া সহ একটি অভিযোজিত ViT-এনকোডার (Vision Transformer) ব্যবহার করা হয়। অভিযোজিত ফ্রেম স্যাম্পলিং (adaptive frame sampling) সহ দীর্ঘ ভিডিও (সর্বাধিক ৩২ হাজার টোকেন) প্রক্রিয়াকরণ সমর্থিত।[3]
নেটিভ অমনিমোডালিটি (ERNIE 5.0)
ERNIE 5.0 অতি-বিরল MoE (ultra-sparse MoE) সহ একটি একীভূত আর্কিটেকচারে একাধিক মডালিটির (পাঠ্য, ছবি, অডিও, ভিডিও) নেটিভ অটোরিগ্রেসিভ মডেলিং বাস্তবায়ন করে, যেখানে প্রতিটি ধাপে মোট বিশেষজ্ঞের ৩%-এরও কম সক্রিয় হয়। পূর্বপ্রশিক্ষণ টাস্ক হিসেবে Next-Group-of-Tokens Prediction ব্যবহার করা হয় — একটির পরিবর্তে একটি গ্রুপ টোকেন পূর্বাভাস, যা প্রশিক্ষণের দক্ষতা বাড়ায়। অডিও মডালিটির জন্য একটি শ্রেণীবদ্ধ কোডেক (hierarchical codec) ব্যবহার করা হয়। Elastic training প্রযুক্তি একটি একক প্রশিক্ষণ রানের মধ্যে বিভিন্ন গভীরতা, প্রস্থ ও বিরলতার মাত্রা সহ সাব-মডেল তৈরি করতে দেয়।[4]
পূর্বপ্রশিক্ষণ টাস্ক ও ডেটা
ERNIE 3.0 / Titan-এর পূর্বপ্রশিক্ষণ টাস্ক
ERNIE 3.0 ও Titan-এ নিম্নলিখিত গ্রুপের পূর্বপ্রশিক্ষণ টাস্ক ব্যবহৃত হয়:[2][6]
Word-aware টাস্ক:
- Knowledge Masked Language Modeling — স্থানীয় ও বৈশ্বিক প্রসঙ্গে নির্ভরতা শেখানোর জন্য বাক্যাংশ ও সত্তা-মাস্কিং।
- Document Language Modeling — Transformer-XL পুনরাবৃত্তিমূলক মেমরি ব্যবহার করে সর্বাধিক ৫১২ টোকেনের দৈর্ঘ্যের ডকুমেন্টের অটোরিগ্রেসিভ মডেলিং।
Structure-aware টাস্ক:
- Sentence Reordering — সেগমেন্টে এলোমেলোভাবে বিভক্ত ও মিশ্রিত একটি অনুচ্ছেদের জন্য মডেলটি সহ -শ্রেণী শ্রেণীবিভাজন সমাধান করে, মূল ক্রম পুনরুদ্ধার করে।
- Sentence Distance — ৩-শ্রেণী শ্রেণীবিভাজন: পাশাপাশি বাক্য, একই ডকুমেন্টে অ-পাশাপাশি বাক্য, ভিন্ন ডকুমেন্টের বাক্য।
Knowledge-aware টাস্ক:
- Universal Knowledge-Text Prediction (UKTP) — পাঠ্য ও জ্ঞান গ্রাফের ত্রিকের যৌথ মডেলিং।
- Credible and Controllable Generations — adversarial loss ও controllable LM loss-এর সমন্বয়।
পূর্বপ্রশিক্ষণ ডেটা
ERNIE 3.0/Titan-এর জন্য ERNIE 3.0 Corpus ব্যবহৃত হয় — ১১টি বিভাগে প্রায় ৪ টেরাবাইটের একটি চীনা কর্পাস, যার মধ্যে রয়েছে ওয়েব পেজ, অনুসন্ধান লগ, প্রশ্নোত্তর ডেটা, সাহিত্যিক, আইনি, আর্থিক ও চিকিৎসা পাঠ্য, উপন্যাস ও কবিতা। কর্পাসের উপরে ৫ কোটিরও বেশি তথ্য সহ একটি জ্ঞান গ্রাফ গঠন করা হয়েছে।[2][6]
Titan-এর জন্য অতিরিক্তভাবে তৈরি করা হয়:
- Adversarial dataset — ২ মিলিয়ন মূল অনুচ্ছেদ এবং মূলের প্রথম ১–৩ বাক্যের প্রিফিক্স দিয়ে ERNIE 3.0 দ্বারা উৎপন্ন সংশ্লিষ্ট "নেতিবাচক" অনুচ্ছেদ, সর্বাধিক ৫১২ টোকেন দৈর্ঘ্য।
- Controllable dataset — ঘরানা, বিষয় (২৬টি থিম), মূল শব্দ, মনোভাব (positive/negative/neutral) ও দৈর্ঘ্যের অ্যাট্রিবিউট সহ পাঠ্য। ঘরানার অ্যাট্রিবিউট শেখানো যোগ্য "সফট prompt" দিয়ে কোড করা হয় (ঘরানার জন্য prompt সংখ্যা ০ থেকে ৬৪-এর মধ্যে এলোমেলোভাবে নির্বাচিত)।[6]
পরবর্তী সংস্করণ (ERNIE 4.5, 5.0) বিস্তৃত মাল্টিমোডাল কর্পাস (পাঠ্য, ছবি, ভিডিও, অডিও) ব্যবহার করে, যার মধ্যে কিউরেটেড ওয়েব কন্টেন্ট, বৈজ্ঞানিক প্রকাশনা এবং সিন্থেটিক ডেটা রয়েছে।[3][4]
প্রশিক্ষণ ও বিতরণকৃত অপ্টিমাইজেশন
ERNIE 3.0 Titan-এর পূর্বপ্রশিক্ষণ Adam অপ্টিমাইজার ব্যবহার করে পরিচালিত হয়েছিল (শিক্ষার হার , , , L2-রেগুলারাইজেশন ০.১, গ্র্যাডিয়েন্ট নর্ম ক্লিপিং ১.০ পর্যন্ত), সর্বাধিক প্রসঙ্গ দৈর্ঘ্য ৫১২ এবং জেনারেটিভ টাস্কের জন্য পুনরাবৃত্তিমূলক মেমরি দৈর্ঘ্য ১২৮। প্রগতিশীল প্রশিক্ষণ স্কিম (প্রথম ৪০০০ ধাপে ত্বরান্বিত অভিসরণ) এবং শিক্ষার হারের রৈখিক হ্রাস প্রয়োগ করা হয়েছিল।[6]
4D হাইব্রিড প্যারালেলাইজেশন
হেটেরোজেনাস ক্লাস্টারে (GPU NVIDIA V100 ও NPU Ascend 910) ২৬০ বিলিয়ন প্যারামিটারের ঘন মডেল প্রশিক্ষণের জন্য PaddlePaddle-এ 4D হাইব্রিড প্যারালেলাইজেশন বাস্তবায়ন করা হয়েছে:[6]
- Data parallelism (DP) — পৃথক ব্যাচ প্রক্রিয়াকরণ সহ একাধিক ডিভাইসে মডেলের প্রতিলিপি।
- Tensor model parallelism (MP) — স্তরের মধ্যে ডিভাইস জুড়ে ট্রান্সফর্মার প্যারামিটার ও অ্যাক্টিভেশনের বিভাজন।
- Pipeline model parallelism (PP) — পাইপলাইন জুড়ে মডেলের স্তর বিতরণ।
- Group Sharded — অপ্টিমাইজার অবস্থার নকল কমাতে ZeRO-সদৃশ sharded-data-parallel-এর উন্নত রূপ।
রিপোর্টে থ্রুপুটে প্রায় ৯১.৭% দক্ষতায় হাজার হাজার Ascend 910 কার্ডে দুর্বল স্কেলিংয়ের ডেটা প্রদান করা হয়েছে।[6]
ERNIE 4.5-এর প্রশিক্ষণ
ERNIE 4.5-এর প্রশিক্ষণ ২০১৬টি GPU NVIDIA H800-এর একটি ক্লাস্টারে পরিচালিত হয়েছিল, Model FLOPs Utilization (MFU) ৪৭% অর্জন করে। মিশ্রিত-নির্ভুলতা FP8, ত্রুটি-সহনশীল চেকপয়েন্ট (Zero Cost Checkpoint, ৮ মিনিটেরও কম সময়ে পুনরুদ্ধার) এবং ক্রমবর্ধমান ক্রম দৈর্ঘ্য ও ব্যাচ আকার সহ প্রগতিশীল প্রশিক্ষণ ব্যবহার করা হয়েছিল।[3]
অনলাইন ডিস্টিলেশন
ERNIE 3.0 Titan মোতায়েনের সময় কম্পিউটেশনাল সম্পদের প্রয়োজনীয়তা কমাতে অনলাইন ডিস্টিলেশন ব্যবহার করা হয়, যেখানে শিক্ষক মডেল ও বেশ কয়েকটি ছাত্র মডেল একযোগে প্রশিক্ষিত হয়:[6]
- On-the-Fly Distillation (OFD) — শিক্ষকের লজিট ও উপস্থাপনা একই প্রশিক্ষণ ধাপে ছাত্রদের প্রশিক্ষণের জন্য ব্যবহৃত হয়।
- Teacher assistants — শিক্ষক ও চূড়ান্ত ছাত্রদের মধ্যে ক্ষমতার ব্যবধান কমাতে মধ্যবর্তী আকারের মডেল।
- Auxiliary Layer Distillation (ALD) — ছাত্রের মধ্যে একটি অতিরিক্ত স্তর, যা fine-tuning-এর সময় বাদ দেওয়া হয়, ভেতরের উপস্থাপনা আরও ভালোভাবে মেলানোর জন্য।
পোস্ট-প্রশিক্ষণ ও সারিবদ্ধকরণ
ERNIE-এর বাণিজ্যিক সংস্করণ (ERNIE Bot থেকে শুরু করে) পোস্ট-প্রশিক্ষণ পর্যায়গুলির মধ্য দিয়ে যায়:[7][3]
- Supervised Fine-Tuning (SFT) — লেবেলযুক্ত নির্দেশনামূলক ডেটায় (ERNIE 4.5-এ — ২.৩ মিলিয়ন উদাহরণ) অতিরিক্ত-প্রশিক্ষণ।
- Reinforcement Learning from Human Feedback (RLHF) — মানুষের প্রতিক্রিয়া ব্যবহার করে মডেলের আচরণ সারিবদ্ধকরণ; PPO (Proximal Policy Optimization) ও DPO (Direct Preference Optimization) অ্যালগরিদম প্রয়োগ করা হয়।
- Unified Preference Optimization (UPO) — ERNIE 4.5-এ প্রবর্তিত পছন্দ অপ্টিমাইজেশনের একীভূত পদ্ধতি।
- Reinforcement Learning with Verifiers (RLVR) — উত্তরের সঠিকতা যাচাই করতে ভেরিফায়ার সহ রিইনফোর্সমেন্ট লার্নিং; GRPO (Group Relative Policy Optimization) পদ্ধতি প্রয়োগ করা হয়।
- চিন্তার মোড (thinking modes) — 4.5 মডেল চিন্তাভাবনা (reflection, planning) সহ ও ছাড়া উভয় মোড সমর্থন করে।
মূল ফলাফল ও benchmark
মডেল বিবর্তনের সংক্ষিপ্ত টেবিল
| সংস্করণ | বছর | প্যারামিটার | আর্কিটেকচার | মূল benchmark | উৎস |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~১১০ মিলিয়ন (base) | Transformer-এনকোডার (BERT-সদৃশ) | XNLI ৭৮.৪%; MSRA-NER F1 ৯৩.৮% | [1] |
| ERNIE 2.0 | 2019 | ~১১০–৩৪০ মিলিয়ন | Continual multi-task | GLUE ৮০.৬ (base) / ৮৩.৬ (large); ১৬ টাস্কে SOTA | [5] |
| ERNIE 3.0 | 2021 | ১০ বিলিয়ন | Unified Transformer-XL (AE+AR) | SuperGLUE ৯০.৬% (> human ৮৯.৮%); ৫৪ চীনা টাস্কে SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | ২৬০ বিলিয়ন (dense) | Dense + controllable generation | ৬৮ dataset-এ SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | ০.৩–৪২৪ বিলিয়ন (MoE, ৪৭ বিলিয়ন সক্রিয়) | Heterogeneous multimodal MoE | C-Eval ৯০.৬%; MMLU ৮৬.৫%; MMMU ৬৭.৩–৭০% | [3] |
| ERNIE 5.0 | 2026 | ~২.৪ ট্রিলিয়ন (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~১৪৬০ (বৈশ্বিকভাবে শীর্ষ-১০) | [4] |
ERNIE 3.0 ও Titan-এর ফলাফল
ERNIE 3.0 (১০ বিলিয়ন প্যারামিটার) ইংরেজি benchmark SuperGLUE-তে ৯০.৬ গড় ফলাফল অর্জন করেছে, যা মানবীয় রেফারেন্স (৮৯.৮) এবং প্রকাশনার সময়ে GPT-3, T5 ও DeBERTa-এর ফলাফল ছাড়িয়ে গেছে। ERNIE 3.0 Titan (২৬০ বিলিয়ন) শ্রেণীবিভাজন, NLI, QA ও উৎপাদন টাস্ক সহ ৬৮টি ডেটাসেটে মূল্যায়ন করা হয়েছিল; লেখকরা সমস্ত ৬৮টি dataset-এ পূর্বসূরি মডেলের তুলনায় শ্রেষ্ঠত্বের কথা জানিয়েছেন। এই ফলাফলগুলি মূল উৎসের ডেটা; স্বাধীন পুনরুৎপাদন সীমিতভাবে বর্ণিত হয়েছে।[2][6]
ERNIE 4.5-এর ফলাফল
২০২৫ সালের টেকনিক্যাল রিপোর্ট অনুযায়ী, ERNIE 4.5 (300B-A47B, পোস্ট-ট্রেনিং) টেক্সট ও মাল্টিমোডাল benchmark-এ নিম্নলিখিত ফলাফল দেখায়:[3]
| Benchmark | ERNIE-4.5-300B-A47B | শর্তাবলী |
|---|---|---|
| C-Eval | ৯০.৬% | 5-shot |
| CMMLU | ৯০.২% | — |
| MMLU | ৮৬.৫% | মানক |
| IFEval | ৮৮.০% | instruction following |
| GSM8K | ৯১.৮% | — |
| MMMU | ৬৭.৩–৭০.০% | non-thinking / thinking |
| MathVista | ৭৮.৮% | thinking mode |
| OCRBench | ৮৮৩ | — |
রিপোর্ট অনুযায়ী, ERNIE 4.5 ২৮টির মধ্যে ২২টি benchmark-এ DeepSeek-V3-কে ছাড়িয়ে গেছে; মাল্টিমোডাল ভেরিয়েন্ট (ERNIE-4.5-VL-424B-A47B) ভিজ্যুয়াল রিজনিং টাস্কে প্রতিযোগিতামূলক ফলাফল দেখিয়েছে। কিছু ভিজ্যুয়াল রিজনিং ও প্রযুক্তিগত ছবি ব্যাখ্যার টাস্কে (স্কিমা, ইঞ্জিনিয়ারিং ডায়াগ্রাম বিশ্লেষণ) কিছু GPT ও Gemini মডেলের তুলনায় উচ্চতর ফলাফলের কথা জানানো হয়েছে।[3][14]
ERNIE 4.5-এর প্রতিযোগীদের সাথে তুলনা (নির্বাচিত benchmark, পোস্ট-ট্রেনিং, ২০২৫ সালের টেকনিক্যাল রিপোর্ট অনুযায়ী):
| Benchmark | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | মন্তব্য |
|---|---|---|---|---|
| C-Eval | ৯০.৬% | — | — | 5-shot |
| MMLU | ৮৬.৫% | তুলনীয় | — | মানক |
| IFEval | ৮৮.০% | — | ৮৩.২% | instruction following |
| MMMU | ৬৭.৩–৭০.০% | — | — | thinking / non-thinking |
| MathVista | ৭৮.৮% | — | ৭৭.৬% (Qwen2.5-VL) | thinking mode |
পুনরুৎপাদনের শর্তাবলী: মানক প্রোটোকল (5-shot / zero-shot); ডেটাসেট উন্মুক্ত (C-Eval 2023+, MMLU, MMMU)। ড্যাশ ("—") মানে রিপোর্টে একই শর্তে তুলনীয় ডেটা প্রদান করা হয়নি।[3]
ERNIE Bot 4.0-এর মূল্যায়ন
সিংহুয়া বিশ্ববিদ্যালয়ের SuperBench রিপোর্ট একটি টাস্ক সেটে (ভাষা বোঝাপড়া, গণিত, প্রোগ্রামিং, মাল্টিটাস্কিং) বাণিজ্যিক LLM-গুলিকে র্যাঙ্ক করে। ERNIE Bot 4.0 চীনা মডেলের মধ্যে প্রথম স্থান পেয়েছে, সমন্বিত মেট্রিকে GLM-4 (Zhipu AI)-কে প্রায় ০.৪১ পয়েন্টে পেছনে ফেলেছে; বৈশ্বিক রেটিংয়ে GPT-4 ও Anthropic Claude-3 মডেলগুলি এখনও উচ্চে ছিল। ERNIE Bot 4.0 চীনা পাঠ্য বোঝাপড়া ও নির্দেশনা অনুসরণে শক্তিশালী ফলাফল দেখিয়েছে, তবে প্রোগ্রামিং ও কিছু ইংরেজি টাস্কে তুলনামূলকভাবে দুর্বল।[9][10]
প্রয়োগ
Baidu-এর পণ্য ও সেবা
ERNIE সিরিজের মডেলগুলি Baidu-এর পণ্য ইকোসিস্টেমে একীভূত:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — মাল্টিমোডাল উৎপাদন (পাঠ্য, ছবি, ভিডিও, অডিও) সমর্থন সহ চ্যাটবট। Baidu-এর ডেটা অনুযায়ী, মাসিক সক্রিয় ব্যবহারকারীর সংখ্যা ২০ কোটি ছাড়িয়েছে (২০২৪–২০২৫)। ২০২৫ সাল থেকে ERNIE Bot বিনামূল্যে পাওয়া যাচ্ছে।[7]
- Baidu অনুসন্ধান — অনুসন্ধান ফলাফলে উত্তর উৎপাদন ও AI-ফিচার; Baidu-এর ডেটা অনুযায়ী, শীর্ষ ফলাফলের সর্বাধিক ৭০% AI-উপাদান দিয়ে সমৃদ্ধ।
- Qianfan (MaaS প্ল্যাটফর্ম) — কর্পোরেট ক্লায়েন্টদের জন্য API; Baidu-এর ডেটা অনুযায়ী, ৭.৬ লক্ষেরও বেশি উদ্যোগ প্ল্যাটফর্ম ব্যবহার করে, দৈনিক API কল সংখ্যা ১.৫ বিলিয়নেরও বেশি (২০২৪)। ক্লায়েন্টদের মধ্যে Lenovo, Trip.com এবং অন্যান্য।[7]
- Comate — প্রোগ্রামিংয়ের জন্য AI-সহকারী।
- Wenxin Yige — ERNIE-ViLG মডেলের উপর ভিত্তি করে ছবি উৎপাদন।[11]
- বাহ্যিক অংশীদারদের সাথে একীভূতকরণ: Samsung Galaxy (চীনা বাজারের জন্য), ডিজিটাল অবতার, প্লাগইন (অনুসন্ধান, ফাইল বিশ্লেষণ)।[7]
শিল্পখাতের প্রয়োগ
মডেলগুলি নিম্নলিখিত ক্ষেত্রে ব্যবহৃত হয়:[7][3]
- জ্ঞান-উন্নত পূর্বপ্রশিক্ষণ ব্যবহার করে ডোমেইন ক্ষেত্রে (আইন, চিকিৎসা, অর্থ) প্রশ্নোত্তর সিস্টেম।
- চীনা ভাষায় পাঠ্য উৎপাদন ও সম্পাদনা (সংবাদ, মার্কেটিং পাঠ্য, সৃজনশীল বিষয়বস্তু)।
- মাল্টিমোডাল টাস্ক: ছবি, ইঞ্জিনিয়ারিং স্কিমা, ভিডিও ও সারণী ডেটা বিশ্লেষণ (সংস্করণ 4.5 ও উপরে)।
- শিক্ষা (ব্যক্তিগতকৃত শিক্ষণ), রোবোটিক্স (টাস্ক পরিকল্পনা), স্বায়ত্তশাসিত ড্রাইভিং (Apollo)।
মুক্ত উৎস কোড
ERNIE 4.5 থেকে শুরু করে পরিবারের সমস্ত ১০টি ভেরিয়েন্ট Apache 2.0 লাইসেন্সের অধীনে ERNIEKit টুলকিট সহ প্রকাশিত হয়েছে (SFT, LoRA, DPO, PaddlePaddle/FastDeploy-এ inference সমর্থন)। পূর্ববর্তী সংস্করণের (ERNIE 1.0–3.0) কোড GitHub PaddlePaddle/ERNIE-তে পাওয়া যায়।[3][15]
সীমাবদ্ধতা ও অমীমাংসিত সমস্যা
আর্কিটেকচারাল ও ডেটাসেট সীমাবদ্ধতা
ERNIE 3.0 Titan ২৬০ বিলিয়ন প্যারামিটার নিয়েও পৃথক মডিউলের জন্য ৫১২ টোকেনের প্রসঙ্গ দৈর্ঘ্যে সীমাবদ্ধ, যা অতিরিক্ত প্রক্রিয়া (chunking, বাহ্যিক মেমরি) ছাড়া দীর্ঘ পাঠ্যের মডেলিং সীমিত করে। প্রশিক্ষণ মূলত চীনা কর্পাসে পরিচালিত হয়, যা চীনা ও অন্যান্য ভাষার মধ্যে গুণমানের অসামঞ্জস্য সৃষ্টি করে।[6]
জ্ঞান গ্রাফের একীভূতকরণ কাঠামোগত তথ্যের সাথে কাজ উন্নত করে, তবে জ্ঞানের নির্ভুলতা ও সম্পূর্ণতা গ্রাফটির নিজের গুণমান এবং "ত্রিক–পাঠ্য" মেলানোর পদ্ধতি (entity linking, relation alignment) দ্বারা সীমিত, যা কিছু ক্ষেত্রে ভুল বা অসম্পূর্ণ সংযোগ ঘটায়।[6]
হ্যালুসিনেশন ও বিশ্বাসযোগ্যতা
Adversarial loss ও controllable LM loss অবিশ্বস্ত উৎপাদনের বিরুদ্ধে স্থিতিস্থাপকতা উন্নত করে, কিন্তু হ্যালুসিনেশনের সমস্যা (তথ্যগতভাবে ভুল বিবৃতির উৎপাদন) সম্পূর্ণভাবে নির্মূল করতে পারে না। Adversarial শ্রেণীবিভাজকের প্যারামিটার এমন ডেটায় প্রশিক্ষিত যেখানে "উৎপাদিত" পাঠ্য ERNIE-এর পূর্ববর্তী সংস্করণ দ্বারা তৈরি, যা চেনা যাওয়া ভুল প্যাটার্নের পরিধি সীমিত করে।[6]
সামাজিক পক্ষপাত
PeerJ Computer Science (২০২৫)-এ প্রকাশিত একটি গবেষণা ২৪০টি সামাজিক গোষ্ঠী ও ৩০ হাজারেরও বেশি উৎপন্ন বিবরণ ব্যবহার করে চীনা LLM (ERNIE ও Qwen)-এ সামাজিক পক্ষপাত বিশ্লেষণ করে। ফলাফল দেখায় যে ERNIE Baidu অনুসন্ধান বা Qwen-এর তুলনায় কম নেতিবাচক ও স্টেরিওটাইপিক্যাল বিষয়বস্তু তৈরি করে (ERNIE-তে প্রায় ১/১০ নেতিবাচক অর্থের প্রার্থী শব্দ, Qwen-এ ১/৩-এর বিপরীতে)। তবুও স্টেরিওটাইপের নির্দিষ্ট প্রকোপ, সম্ভাব্য আপত্তিজনক বিবরণ সহ, অব্যাহত থাকে।[16][17]
পুনরুৎপাদনযোগ্যতা
সিরিজের কিছু মডেল (ERNIE 3.0 Titan, বাণিজ্যিক ERNIE Bot 4.0 ও 5.0) সম্পূর্ণ উন্মুক্ত কোড ও ওজন হিসেবে পাওয়া যায় না, যা benchmark-এর পুনরুৎপাদনযোগ্যতা ও স্বাধীন মূল্যায়নের সম্ভাবনা সীমিত করে। Apache 2.0-এর অধীনে ERNIE 4.5 প্রকাশের সাথে পরিস্থিতির উন্নতি হয়েছে, তবে আর্কিটেকচার ও প্রশিক্ষণ সেটিংস প্রাথমিক প্রকাশনায় বর্ণিত থেকে ভিন্ন হতে পারে।[3][6]
চিকিৎসা নিরাপত্তা
চিকিৎসা পরিস্থিতিতে ERNIE Bot ব্যবহারের গবেষণা (Si et al., 2025) অতিরিক্ত প্রেসক্রিপশনের প্রবণতা চিহ্নিত করেছে: মডেল পরিস্থিতিতে ৯১.৯% অপ্রয়োজনীয় পরীক্ষা ও ৫৭.৮% অপ্রয়োজনীয় ওষুধ, এবং সুপারিশে বয়স ও আর্থ-সামাজিক বৈষম্য।[18]
নৈতিক ও নিয়ন্ত্রক দিক
ERNIE সিরিজের মডেলগুলি চীনা জেনারেটিভ AI নিয়ন্ত্রণের কাঠামোর মধ্যে কাজ করে, বিশেষত "জেনারেটিভ AI সেবা পরিচালনার অন্তর্বর্তীকালীন ব্যবস্থা" (Interim Measures for Generative AI Services, 2023), যা বাধ্যতামূলক নিরাপত্তা মূল্যায়ন, অ্যালগরিদম নিবন্ধন এবং বিষয়বস্তুর উপর সীমাবদ্ধতা নির্ধারণ করে।[7][17]
ERNIE Bot জাতীয় আইন অনুযায়ী সংবেদনশীল রাজনৈতিক বিষয়ের সাথে সম্পর্কিত অনুরোধে উচ্চ মাত্রার প্রত্যাখ্যান প্রদর্শন করে। গবেষণা (Pan et al., 2026) Baidu-এর মডেল সহ চীনা উৎসের LLM-এ রাজনৈতিক সেন্সরশিপ বিশ্লেষণ করে।[19]
Baidu-এর প্রকাশনা সবসময় মডেল আচরণ অডিটের পদ্ধতি, বিষয়বস্তু ফিল্টারিং মানদণ্ড এবং স্থানীয় নিয়ন্ত্রক প্রয়োজনীয়তা ও AI নৈতিকতার সাধারণ নীতির মধ্যে ভারসাম্যের বিস্তারিত বর্ণনা দেয় না, যা স্বাধীন গবেষণার একটি উন্মুক্ত ক্ষেত্র হিসেবে রয়ে গেছে।[17]
সম্ভাবনা ও গবেষণার দিকনির্দেশনা
টেকনিক্যাল রিপোর্ট ও Baidu-এর বিবৃতির ভিত্তিতে ERNIE সিরিজের উন্নয়নের নিম্নলিখিত দিকনির্দেশনা চিহ্নিত করা হয়েছে:
- আরও মাল্টিমোডালাইজেশন (পাঠ্য–ছবি–ভিডিও–অডিও), ঘন প্রযুক্তিগত ভিজ্যুয়াল ডেটা (ইঞ্জিনিয়ারিং স্কিমা, চিকিৎসা ছবি) প্রক্রিয়াকরণ সহ।[3][4]
- গুণমান ও কম্পিউটেশনাল দক্ষতার মধ্যে ভারসাম্য রাখতে অতি বড় মোট মডেল আকারে ঘন ও MoE আর্কিটেকচারের সমন্বয়।[3]
- প্রোডাকশন workflow-এ একীভূতকরণের জন্য এজেন্ট সিস্টেম (GenFlow, Famou) ও কাঠামোগত উৎপাদনের টুল (JSON, API কল) উন্নয়ন।[3]
- প্রশিক্ষণ দক্ষতা উন্নয়ন: elastic training, উন্নত MoE স্কেলিং (MFU), কোয়ান্টাইজেশন (W4A8, একটি GPU-তে ডিপ্লয়মেন্টের জন্য 2-bit)।[3]
- সংস্কৃতি-নির্দিষ্ট দিক বিবেচনায় চীনা LLM-এ পক্ষপাত হ্রাস গবেষণা এবং চীনা ভাষা ও মাল্টিমোডাল টাস্কের জন্য benchmark পদ্ধতি উন্নয়ন।[16][17]
- দীর্ঘ প্রসঙ্গে রিজনিং উন্নয়ন, যাচাইযোগ্য রিইনফোর্সমেন্ট লার্নিং (verifiable RL) এবং সিন্থেটিক কর্পাসের মাধ্যমে সীমিত ডেটার ডোমেইনে অভিযোজন।[3][4]
অন্যান্য চীনা LLM-এর সাথে তুলনা
ERNIE Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) ও Tongyi Qianwen সহ বেশ কিছু বড় চীনা LLM-এর সাথে প্রতিযোগিতা করে। ERNIE সিরিজের মূল পার্থক্য হলো পূর্বপ্রশিক্ষণে জ্ঞান গ্রাফের একীভূতকরণে জোর (knowledge enhancement), Baidu ইকোসিস্টেমের সাথে ঘনিষ্ঠ একীভূতকরণ (অনুসন্ধান, ক্লাউড, API) এবং PaddlePaddle প্ল্যাটফর্মে মনোনিবেশ। স্বাধীন রেটিং (SuperBench, LMArena) অনুযায়ী, ERNIE সিরিজের মডেলগুলি চীনা LLM-গুলির মধ্যে উচ্চ স্থান দখল করে, বিশেষত চীনা ভাষায় বোঝাপড়া ও নির্দেশনা অনুসরণের টাস্কে।[9][13][16]
আরও দেখুন
- BERT
- Transformer আর্কিটেকচার
- RLHF
সাহিত্য
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.