ERNIE (Baidu) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — مجموعه‌ای از مدل‌های زبانی پیش‌آموزش‌دیده (Large Language Model, LLM) و مدل‌های پایه چندوجهی است که از سال ۲۰۱۹ توسط شرکت Baidu تحت عنوان کلی Enhanced Representation through kNowledge IntEgration (بازنمایی تقویت‌شده از طریق یکپارچه‌سازی دانش) توسعه می‌یابد. این مجموعه بر بهبود کیفیت درک معنایی و تولید متن از طریق یکپارچه‌سازی صریح دانش خارجی از گراف‌های دانش (Knowledge Graph, KG)، هستی‌شناسی‌ها و دانشنامه‌ها در فرآیند پیش‌آموزش تمرکز دارد.[1][2]

مدل‌های این مجموعه از نسخه‌های اولیه مبتنی بر BERT با پوشاندن موجودیت‌ها و عبارات (ERNIE 1.0، 2.0) تا معماری‌های یکپارچه در مقیاس بزرگ (ERNIE 3.0، ERNIE 3.0 Titan)، سیستم‌های چندوجهی مبتنی بر Mixture-of-Experts (MoE) با کد منبع باز (ERNIE 4.5) و مدل‌های omnimodal بومی (ERNIE 5.0) تکامل یافته‌اند. این مجموعه از وظایف درک متن (Natural Language Understanding, NLU)، تولید متن (Natural Language Generation, NLG) و در نسخه‌های جدیدتر، وظایف چندوجهی (متن، تصویر، ویدیو، صدا) پشتیبانی می‌کند و با تأکید بر زبان چینی و پشتیبانی از چندزبانی همراه است.[2][3][4]

تاریخچه و پیش‌زمینه

توسعه مجموعه ERNIE در سال ۲۰۱۹ در بخش پژوهشی Baidu آغاز شد؛ این امر در پاسخ به موفقیت مدل BERT (Devlin et al., 2018) و نیاز به انطباق مدل‌های پیش‌آموزش‌دیده با زبان چینی بود، که در آن نبود فاصله‌های آشکار میان کلمات و نسبت بالای نویسه‌های چندمعنا، استخراج واحدهای معنایی (موجودیت‌ها، عبارات) را دشوارتر می‌کند.[1]

ERNIE 1.0 (2019)

اولین مدل این مجموعه (Sun et al., arXiv:1904.09223، آوریل ۲۰۱۹) راهبرد پوشاندن دانش چندسطحی (knowledge masking) را برای معماری مشابه BERT معرفی کرد: به جای پوشاندن تصادفی توکن‌های منفرد، مدل موجودیت‌ها و عبارات کامل را که بر اساس تشخیص موجودیت‌های نام‌دار (Named Entity Recognition, NER) و الگوهای عبارات تعریف شده‌اند، می‌پوشاند.[1]

معماری ERNIE 1.0 بر اساس Transformer-encoder (۱۲ لایه، بُعد پنهان ۷۶۸، ۱۲ سر توجه) است. وظیفه Dialogue Language Model (DLM) نیز برای آموزش بر داده‌های مکالمه‌ای معرفی شد. این مدل بر روی حدود ۱۷۳ میلیون جمله چینی از مجموعه‌های Wikipedia، Baidu Baike، اخبار و انجمن Baidu Tieba آموزش دیده است. در زمان انتشار، ERNIE 1.0 به نتایج state-of-the-art (SOTA) در پنج وظیفه NLP چینی دست یافت: XNLI (دقت ۷۸٫۴٪ در آزمون در مقابل ۷۷٫۲٪ BERT)، MSRA-NER (F1 برابر ۹۳٫۸٪ در مقابل ۹۲٫۶٪).[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412، جولای ۲۰۱۹؛ پذیرفته‌شده در کنفرانس AAAI 2020) چارچوب پیش‌آموزش چندوظیفه‌ای پیوسته (continual multi-task pre-training) را معرفی کرد که در آن وظایف پیش‌آموزش جدید به صورت متوالی (افزایشی) به transformer مشترک اضافه می‌شوند بدون آنکه مدل به طور کامل بازآموزش شود.[5]

وظایف پیش‌آموزش ERNIE 2.0 به سه گروه تقسیم می‌شوند:

  • Word-aware — پوشاندن دانش (knowledge masking)، پیش‌بینی حروف بزرگ (capitalization prediction)، ارتباط توکن با سند (token-document relation).
  • Structure-aware — بازچینی جملات (sentence reordering)، تعیین فاصله میان جملات (sentence distance).
  • Semantic-aware — پیش‌بینی روابط گفتمانی (discourse relation prediction)، ارتباط‌سنجی برای بازیابی اطلاعات (IR relevance prediction).[5]

مدل بر روی مجموعه‌های انگلیسی و چینی (دانشنامه‌ها، کتب، Reddit، گزارش‌های جستجو) آموزش دیده است. نتایج: میانگین امتیاز GLUE برای مدل base برابر ۸۰٫۶ (در مقابل ۷۸٫۳ برای BERT) و برای مدل large برابر ۸۳٫۶ بود؛ ERNIE 2.0 در ۱۶ وظیفه از BERT و XLNet پیشی گرفت.[5]

ERNIE 3.0 (2021)

چارچوب ERNIE 3.0 (Sun et al., arXiv:2107.02137، جولای ۲۰۲۱) پارادایم‌های پیش‌آموزش auto-encoding (AE) و auto-regressive (AR) را در یک معماری یکپارچه ترکیب کرد که به ماژول بازنمایی جهانی (Universal Representation Module) و ماژول‌های بازنمایی وظیفه‌محور (Task-specific Representation Modules) برای NLU و NLG تقسیم شده است.[2]

مدل با ۱۰ میلیارد پارامتر بر روی ۴ ترابایت متن چینی (۱۱ دسته: Baidu Baike، Wikipedia، گزارش‌های جستجو، سیستم‌های پرسش‌وپاسخ، متون تخصصی) و یک گراف دانش با بیش از ۵۰ میلیون واقعیت آموزش دیده است. ERNIE 3.0 در ۵۴ وظیفه NLP چینی به SOTA دست یافت؛ در معیار SuperGLUE انگلیسی — ۹۰٫۶٪ (تا تاریخ ۳ جولای ۲۰۲۱، بالاتر از مرجع انسانی ۸۹٫۸٪).[2]

ERNIE 3.0 Titan (2021)

مقاله «ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation» (Wang et al., arXiv:2112.12731، دسامبر ۲۰۲۱) مقیاس‌پذیری چارچوب ERNIE 3.0 را تا یک مدل متراکم (dense) با ۲۶۰ میلیارد پارامتر پیاده‌سازی‌شده بر روی پلتفرم PaddlePaddle توصیف می‌کند.[6]

Titan مکانیزم‌های اضافی را معرفی کرد: adversarial loss خودنظارتی برای ارزیابی اعتبار متن تولیدشده، controllable language modeling loss برای کنترل سبک، موضوع، لحن و طول تولید، همچنین distillation آنلاین (On-the-Fly Distillation, OFD) برای به‌دست آوردن مدل‌های فشرده دانش‌آموز در طول پیش‌آموزش. مدل بر روی ۶۸ مجموعه داده ارزیابی شد و به گزارش نویسندگان در تمام ۶۸ مجموعه داده از مدل‌های پیشین پیشی گرفت.[6]

ERNIE Bot و نسخه‌های تجاری (2023–2025)

در مارس ۲۰۲۳، Baidu چت‌بات ERNIE Bot (Wenxin Yiyan، 文心一言) را بر اساس مدل‌های ERNIE 3.x و PLATO (مدل مکالمه‌ای) عرضه کرد. دسترسی عمومی در اوت ۲۰۲۳ پس از تأیید نهادهای نظارتی امکان‌پذیر شد. به‌روزرسانی‌ها شامل ERNIE 3.5 (ژوئن ۲۰۲۳) و ERNIE 4.0 (اکتبر ۲۰۲۳) بودند.[7][8]

بر اساس گزارش SuperBench دانشگاه Tsinghua، ERNIE Bot 4.0 در میان LLMهای چینی رتبه اول را به لحاظ معیار یکپارچه به دست آورد و نتایج قوی در درک زبان چینی و پیروی از دستورالعمل‌ها نشان داد.[9][10]

در سال ۲۰۲۲، به موازات خط اصلی مدل‌های زبانی، گسترش چندوجهی ERNIE-ViLG 2.0 (arXiv:2210.15257) معرفی شد — مدل تولید تصویر از متن (text-to-image)، که یکی از اولین گام‌ها در مسیر چندوجهی بود.[11]

در سال ۲۰۲۴، در کنفرانس WAVE SUMMIT، Baidu ERNIE 4.0 Turbo را معرفی کرد — نسخه‌ای بهینه‌شده برای کاربردهای پرسرعت که قادر است متنی با طول بیش از هزار کلمه را در حدود ۲۰ ثانیه با حفظ کیفیت تولید کند.[12]

ERNIE 4.5 (2025)

در ژوئن ۲۰۲۵، Baidu گزارش فنی ERNIE 4.5 را منتشر کرد که خانواده‌ای از ۱۰ مدل را معرفی می‌کند: LLMهای متنی و مدل‌های چندوجهی (Vision-Language, VL). معماری بر اساس Mixture-of-Experts (MoE) ناهمگن با تفکیک کارشناسان بر اساس وجه (modality) است. انواع مدل شامل مدل‌های MoE با تا ۴۲۴ میلیارد پارامتر کل و ۴۷ میلیارد پارامتر فعال، و همچنین یک مدل متراکم با ۰٫۳ میلیارد پارامتر است. این خانواده تحت مجوز Apache 2.0 بر روی Hugging Face و GitHub (PaddlePaddle/ERNIE) منتشر شده است.[3]

ERNIE 5.0 (2026)

در فوریه ۲۰۲۶، گزارش فنی ERNIE 5.0 (arXiv:2602.04705) منتشر شد — یک مدل autoregressive omnimodal بومی با MoE بسیار تُنُک (ultra-sparse MoE) که از مدل‌سازی مشترک متن، تصویر، صدا و ویدیو پشتیبانی می‌کند. این مدل در لیدربورد LMArena جایگاه‌های بالایی کسب کرد.[4][13]

مبانی نظری و اصول معماری

پوشاندن دانش (Knowledge Masking)

اصل کلیدی مدل‌های اولیه این مجموعه — یکپارچه‌سازی دانش ساختاریافته در فرآیند پیش‌آموزش از طریق راهبردهای پوشاندن اصلاح‌شده است. برخلاف Masked Language Modeling (MLM) استاندارد که در آن توکن‌های منفرد پوشانده می‌شوند، ERNIE 1.0 واحدهای معنایی کامل را می‌پوشاند: موجودیت‌ها (تعریف‌شده از طریق NER) و عبارات. برای موجودیت E={t1,,tk} کل توالی توکن‌ها با احتمال مشخص p پوشانده می‌شود. این رویکرد مدل را وادار می‌کند به بافت گسترده‌تر تکیه کند و روابط میان موجودیت‌ها را فرا بگیرد.[1]

ERNIE 2.0 این رویکرد را با افزودن آموزش چندوظیفه‌ای افزایشی توسعه داد: وظایف در سطوح واژگانی، ساختاری و معنایی به صورت متوالی اضافه می‌شوند، در حالی که دانش قبلاً آموخته‌شده از طریق مکانیزم پیش‌آموزش پیوسته (continual pre-training) حفظ می‌شود.[5]

چارچوب یکپارچه ERNIE 3.0

چارچوب ERNIE 3.0 بر تقسیم معماری به دو سطح استوار است:[2][6]

  • Universal Representation Module — یک Transformer-XL چندلایه مشترک که بر روی مجموعه متنوعی از وظایف پیش‌آموزش آموزش می‌بیند و ویژگی‌های واژگانی و نحوی عمومی را استخراج می‌کند. در نسخه Titan، این ماژول دارای ۴۸ لایه، بازنمایی پنهان با اندازه ۱۲۲۸۸، ۱۹۲ سر توجه و اندازه داخلی شبکه feed-forward برابر ۱۹۶۶۰۸ است (16×dmodel).
  • Task-specific Representation Modules — ماژول‌های مجزا برای NLU (توجه دوطرفه) و NLG (توجه یک‌طرفه با حافظه بازگشتی Transformer-XL)، هریک با ۱۲ لایه، اندازه بردار پنهان ۷۶۸ و ۱۲ سر توجه.

یکپارچه‌سازی پارادایم‌های auto-encoding و auto-regressive به یک مدل واحد اجازه می‌دهد هم در معیارهای NLU (وظایف مشابه BERT) و هم در معیارهای NLG (وظایف مشابه GPT) نتایج بالایی داشته باشد.[2]

Universal Knowledge‑Text Prediction (UKTP)

وظیفه UKTP مکانیزم اصلی یکپارچه‌سازی دانش در ERNIE 3.0/Titan است. مدل یک جفت (سه‌تایی از گراف دانش، جمله‌ای از دانشنامه) دریافت می‌کند و باید یا رابطه موجود در سه‌تایی را با استفاده از متن پیش‌بینی کند، یا توکن‌های پوشانده‌شده در متن را با استفاده از اطلاعات سه‌تایی پیش‌بینی کند.[6]

هنگام پیش‌بینی رابطه r در سه‌تایی (h,r,t) مرتبط با متن x، وظیفه به صورت طبقه‌بندی چندکلاسه فرموله می‌شود:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

که در آن fθ خروجی transformer در موقعیت‌های اشاره به موجودیت‌های سر و دم است، W,b پارامترهای طبقه‌بند، θ پارامترهای مدل هستند.[6]

مکانیزم‌های تولید معتبر و کنترل‌پذیر (Titan)

ERNIE 3.0 Titan دو نوع اضافی از توابع زیان را معرفی کرد.[6]

Adversarial loss خودنظارتی. مجموعه داده Da={Doriginal,Dgenerated} ساخته می‌شود که در آن Doriginal پاراگراف‌های واقعی و Dgenerated متون تولیدشده توسط نسخه قبلی ERNIE بر اساس پیشوند پاراگراف‌های اصلی هستند. وظیفه — طبقه‌بندی دوتایی (اصلی/تولیدی) بر اساس حالت پنهان توکن ویژه [CLS] است:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

که در آن h[CLS](n) بازنمایی برداری [CLS] برای نمونه n-ام، I نشانگر تعلق به متون اصلی است.[6]

Controllable language modeling loss. هر نمونه آموزشی با مجموعه‌ای از ویژگی‌ها (prompt) همراه است که ژانر، موضوع، کلیدواژه‌ها، لحن و طول را توصیف می‌کنند. زیان، مدل‌سازی زبانی بی‌شرط و مشروط را ترکیب می‌کند:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

که در آن p یک متغیر تصادفی برای تناوب حالت‌ها، xt(n) توکن t-ام نمونه n-ام است. این تعریف از وابستگی بیش از حد مدل به prompt جلوگیری می‌کند.[6]

معماری ناهمگن MoE (ERNIE 4.5)

ERNIE 4.5 یک معماری چندوجهی ناهمگن Mixture-of-Experts با تفکیک کارشناسان بر اساس وجه معرفی می‌کند: کارشناسان متنی و کارشناسان بصری (که دومی تقریباً ۱/۳ اندازه متنی دارند). مسیریابی توکن‌ها با جداسازی بر اساس وجه (modality-isolated routing) و اعمال جریمه متعامدسازی برای مسیریاب (router orthogonalization loss، ضریب مرتبه 103) برای تضمین تخصص‌یابی کارشناسان انجام می‌شود. از 3D RoPE (Rotary Position Embeddings) برای کدگذاری موقعیتی ابعاد زمانی، ارتفاعی و عرضی در داده‌های ویدیویی استفاده می‌شود. مکانیزم FlashMask برای کار کارآمد با بافت بلند (تا ۱۳۱ هزار توکن) با ماسک‌های O(N) به کار می‌رود.[3]

پیش‌آموزش ERNIE 4.5 در چند مرحله انجام می‌شود: ابتدا آموزش تنها بر داده‌های متنی، سپس بر داده‌های بصری، و در مرحله نهایی — آموزش مشترک بر داده‌های چندوجهی (text-only → vision-only → joint). برای پردازش تصویر از یک encoder تطبیقی ViT (Vision Transformer) با مکانیزم pixel shuffle برای هم‌راستاسازی بازنمایی‌های وجه‌های مختلف استفاده می‌شود. پردازش ویدیوهای بلند (تا ۳۲ هزار توکن) با نمونه‌برداری تطبیقی فریم (adaptive frame sampling) پشتیبانی می‌شود.[3]

Omnimodality بومی (ERNIE 5.0)

ERNIE 5.0 مدل‌سازی autoregressive بومی چند وجه (متن، تصویر، صدا، ویدیو) را در یک معماری یکپارچه با MoE بسیار تُنُک پیاده‌سازی می‌کند که در هر گام کمتر از ۳٪ از کل کارشناسان فعال می‌شوند. به عنوان وظیفه پیش‌آموزش از Next-Group-of-Tokens Prediction — پیش‌بینی گروهی از توکن‌ها به جای یکی — استفاده می‌شود که کارایی آموزش را افزایش می‌دهد. برای وجه صوتی از یک کدک سلسله‌مراتبی (hierarchical codec) استفاده می‌شود. فناوری elastic training امکان تولید زیر-مدل‌هایی با عمق، پهنا و درجه تُنُکی متفاوت را در یک اجرای آموزشی فراهم می‌کند.[4]

وظایف پیش‌آموزش و داده‌ها

وظایف پیش‌آموزش ERNIE 3.0 / Titan

در ERNIE 3.0 و Titan از گروه‌های زیر از وظایف پیش‌آموزش استفاده می‌شود:[2][6]

وظایف Word-aware:

  • Knowledge Masked Language Modeling — پوشاندن عبارات و موجودیت‌ها برای آموزش وابستگی‌ها در بافت محلی و جهانی.
  • Document Language Modeling — مدل‌سازی autoregressive اسناد با طول تا ۵۱۲ توکن و استفاده از حافظه بازگشتی Transformer-XL.

وظایف Structure-aware:

  • Sentence Reordering — برای یک پاراگراف که به صورت تصادفی به m بخش تقسیم و درهم‌ریخته شده، مدل وظیفه طبقه‌بندی k-کلاسه را با k=n=1mn! حل می‌کند تا ترتیب اصلی را بازیابد.
  • Sentence Distance — طبقه‌بندی ۳-کلاسه: جملات مجاور، جملات غیرمجاور در همان سند، جملات از اسناد مختلف.

وظایف Knowledge-aware:

  • Universal Knowledge-Text Prediction (UKTP) — مدل‌سازی مشترک متن و سه‌تایی گراف دانش.
  • Credible and Controllable Generations — ترکیب adversarial loss و controllable LM loss.

داده‌های پیش‌آموزش

برای ERNIE 3.0/Titan از ERNIE 3.0 Corpus استفاده می‌شود — مجموعه چینی با حجم حدود ۴ ترابایت در ۱۱ دسته، شامل صفحات وب، گزارش‌های جستجو، داده‌های پرسش‌وپاسخ، متون هنری، حقوقی، مالی و پزشکی، داستان‌های کوتاه و شعر. علاوه بر مجموعه، گراف دانشی با بیش از ۵۰ میلیون واقعیت تشکیل شده است.[2][6]

علاوه بر این برای Titan تشکیل می‌شوند:

  • مجموعه داده adversarial — ۲ میلیون پاراگراف اصلی و پاراگراف‌های «منفی» متناظر که توسط ERNIE 3.0 بر اساس پیشوند ۱ تا ۳ جمله اول اصل تولید شده‌اند، با طول تا ۵۱۲ توکن.
  • مجموعه داده controllable — متون مجهز به ویژگی‌های ژانر، موضوع (۲۶ حوزه موضوعی)، کلیدواژه‌ها، لحن (مثبت/منفی/خنثی) و طول. ویژگی‌های ژانر با «prompt نرم» قابل‌آموزش کدگذاری می‌شوند (تعداد promptها برای ژانر به صورت تصادفی از ۰ تا ۶۴ انتخاب می‌شود).[6]

نسخه‌های اخیر (ERNIE 4.5، 5.0) از مجموعه‌های چندوجهی گسترش‌یافته (متن، تصویر، ویدیو، صدا) شامل محتوای وب انتخاب‌شده، انتشارات علمی و داده‌های مصنوعی استفاده می‌کنند.[3][4]

آموزش و بهینه‌سازی توزیع‌شده

پیش‌آموزش ERNIE 3.0 Titan با استفاده از بهینه‌ساز Adam (نرخ یادگیری 104، β1=0,9، β2=0,95، قانون‌گذاری L2 برابر ۰٫۱، برش هنجار گرادیان تا ۱٫۰)، حداکثر طول بافت ۵۱۲ و طول حافظه بازگشتی ۱۲۸ برای وظایف تولیدی انجام شد. از یک طرح آموزش تدریجی (همگرایی سریع‌تر در ۴۰۰۰ گام اول) و کاهش خطی نرخ یادگیری استفاده شد.[6]

موازی‌سازی هیبریدی چهاربُعدی (4D)

برای آموزش مدل متراکم با ۲۶۰ میلیارد پارامتر بر روی خوشه‌های ناهمگن (GPU NVIDIA V100 و NPU Ascend 910) در PaddlePaddle موازی‌سازی هیبریدی 4D پیاده‌سازی شده است:[6]

  • Data parallelism (DP) — تکثیر مدل بر چندین دستگاه با پردازش جداگانه باچ‌ها.
  • Tensor model parallelism (MP) — تقسیم پارامترها و فعال‌سازی‌های transformer در داخل لایه‌ها بین دستگاه‌ها.
  • Pipeline model parallelism (PP) — توزیع لایه‌های مدل در یک خط لوله.
  • Group Sharded — نوع پیشرفته‌شده از sharded-data-parallel مشابه ZeRO برای کاهش تکراری‌شدن حالت‌های بهینه‌ساز.

گزارش‌ها از مقیاس‌پذیری ضعیف تا هزاران کارت Ascend 910 با کارایی حدود ۹۱٫۷٪ از نظر توان عملیاتی حکایت دارند.[6]

آموزش ERNIE 4.5

آموزش ERNIE 4.5 بر روی خوشه‌ای از ۲۰۱۶ GPU NVIDIA H800 با دستیابی به Model FLOPs Utilization (MFU) برابر ۴۷٪ انجام شد. از دقت مختلط FP8، نقاط بازیابی مقاوم در برابر خطا (Zero Cost Checkpoint، بازیابی در کمتر از ۸ دقیقه) و آموزش تدریجی با افزایش طول دنباله و اندازه باچ استفاده شد.[3]

تقطیر آنلاین

برای کاهش نیازمندی‌های محاسباتی در استقرار ERNIE 3.0 Titan از تقطیر آنلاین استفاده می‌شود که در آن مدل معلم و چندین مدل دانش‌آموز به طور همزمان آموزش می‌بینند:[6]

  • On-the-Fly Distillation (OFD) — لاجیت‌ها و بازنمایی‌های معلم برای آموزش دانش‌آموزان در همان گام‌های آموزشی استفاده می‌شوند.
  • Teacher assistants — مدل‌های با اندازه متوسط که شکاف ظرفیتی بین معلم و دانش‌آموزان نهایی را کاهش می‌دهند.
  • Auxiliary Layer Distillation (ALD) — یک لایه کمکی در دانش‌آموز که در هنگام fine-tuning حذف می‌شود، برای تطابق بهتر بازنمایی‌های داخلی.

پس‌آموزش و هم‌راستاسازی

نسخه‌های تجاری ERNIE (از ERNIE Bot به بعد) مراحل پس‌آموزش زیر را طی می‌کنند:[7][3]

  • Supervised Fine-Tuning (SFT) — بازآموزی بر داده‌های دستوری برچسب‌گذاری‌شده (در ERNIE 4.5 — ۲٫۳ میلیون نمونه).
  • Reinforcement Learning from Human Feedback (RLHF) — هم‌راستاسازی رفتار مدل با بازخورد انسانی؛ الگوریتم‌های PPO (Proximal Policy Optimization) و DPO (Direct Preference Optimization) به کار می‌روند.
  • Unified Preference Optimization (UPO) — روش بهینه‌سازی یکپارچه ترجیحات که در ERNIE 4.5 معرفی شده است.
  • Reinforcement Learning with Verifiers (RLVR) — یادگیری تقویتی با استفاده از تأییدکننده‌ها برای بررسی صحت پاسخ‌ها؛ روش GRPO (Group Relative Policy Optimization) به کار می‌رود.
  • حالت‌های استدلال (thinking modes) — مدل‌های 4.5 از حالت‌های با تأمل (reflection، planning) و بدون آن پشتیبانی می‌کنند.

نتایج کلیدی و معیارها

جدول خلاصه تکامل مدل‌ها

نسخه سال پارامترها معماری معیارهای کلیدی منبع
ERNIE 1.0 2019 ~۱۱۰ میلیون (base) Transformer-encoder (مشابه BERT) XNLI 78.4%; MSRA-NER F1 93.8% [1]
ERNIE 2.0 2019 ~۱۱۰–۳۴۰ میلیون Continual multi-task GLUE 80.6 (base) / 83.6 (large)؛ ۱۶ وظیفه SOTA [5]
ERNIE 3.0 2021 ۱۰ میلیارد Unified Transformer-XL (AE+AR) SuperGLUE 90.6% (> human 89.8%)؛ ۵۴ وظیفه چینی SOTA [2]
ERNIE 3.0 Titan 2021 ۲۶۰ میلیارد (dense) Dense + controllable generation ۶۸ مجموعه داده SOTA؛ zero/few-shot [6]
ERNIE 4.5 2025 0.3–424 میلیارد (MoE، ۴۷ میلیارد فعال) Heterogeneous multimodal MoE C-Eval 90.6%; MMLU 86.5%; MMMU 67.3–70% [3]
ERNIE 5.0 2026 ~۲٫۴ تریلیون (ultra-sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (جهانی، جایگاه برتر ۱۰) [4]

نتایج ERNIE 3.0 و Titan

ERNIE 3.0 (۱۰ میلیارد پارامتر) در معیار SuperGLUE انگلیسی به میانگین ۹۰٫۶ دست یافت که از مرجع انسانی (۸۹٫۸) و نتایج GPT-3، T5 و DeBERTa در زمان انتشار پیشی گرفت. ERNIE 3.0 Titan (۲۶۰ میلیارد) بر روی ۶۸ مجموعه داده شامل وظایف طبقه‌بندی، NLI، QA و تولید ارزیابی شد؛ نویسندگان از برتری بر مدل‌های پیشین در تمام ۶۸ مجموعه داده گزارش می‌دهند. این نتایج از منابع اولیه هستند؛ بازتولید مستقل به صورت محدود توصیف شده است.[2][6]

نتایج ERNIE 4.5

بر اساس گزارش فنی ۲۰۲۵، ERNIE 4.5 (300B-A47B، پس از آموزش) نتایج زیر را در معیارهای متنی و چندوجهی نشان می‌دهد:[3]

معیار ERNIE‑4.5‑300B‑A47B شرایط
C‑Eval 90.6% 5-shot
CMMLU 90.2%
MMLU 86.5% استاندارد
IFEval 88.0% instruction following
GSM8K 91.8%
MMMU 67.3–70.0% non-thinking / thinking
MathVista 78.8% thinking mode
OCRBench 883

بر اساس گزارش، ERNIE 4.5 در ۲۲ از ۲۸ معیار از DeepSeek-V3 پیشی گرفت؛ نسخه‌های چندوجهی (ERNIE-4.5-VL-424B-A47B) نتایج رقابتی در وظایف استدلال بصری نشان دادند. در برخی وظایف استدلال بصری و تفسیر فنی تصاویر (تحلیل نقشه‌ها، نمودارهای مهندسی) نتایجی بالاتر از برخی مدل‌های GPT و Gemini گزارش شده است.[3][14]

مقایسه ERNIE 4.5 با رقبا (معیارهای انتخابی، پس از آموزش، بر اساس گزارش فنی ۲۰۲۵):

معیار ERNIE‑4.5‑300B‑A47B DeepSeek‑V3‑671B‑A37B Qwen3‑235B‑A22B یادداشت
C‑Eval 90.6% 5-shot
MMLU 86.5% قابل مقایسه استاندارد
IFEval 88.0% 83.2% instruction following
MMMU 67.3–70.0% thinking / non-thinking
MathVista 78.8% 77.6% (Qwen2.5‑VL) thinking mode

شرایط بازتولید: پروتکل‌های استاندارد (5-shot / zero-shot)؛ مجموعه داده‌های باز (C-Eval 2023+، MMLU، MMMU). خط تیره («—») به این معنی است که داده‌های قابل مقایسه در همان شرایط در گزارش ارائه نشده است.[3]

ارزیابی‌های ERNIE Bot 4.0

گزارش SuperBench دانشگاه Tsinghua LLMهای تجاری را بر اساس مجموعه‌ای از وظایف (درک زبانی، ریاضیات، برنامه‌نویسی، چندوظیفه‌ای) رتبه‌بندی می‌کند. ERNIE Bot 4.0 در میان مدل‌های چینی رتبه اول را کسب کرد و حدود ۰٫۴۱ امتیاز به لحاظ معیار یکپارچه از GLM-4 (Zhipu AI) پیشی گرفت؛ مدل‌های GPT-4 و Anthropic Claude-3 در رتبه‌بندی جهانی بالاتر باقی ماندند. ERNIE Bot 4.0 در درک متن چینی و پیروی از دستورالعمل‌ها نتایج قوی نشان داد، در حالی که در برنامه‌نویسی و برخی وظایف انگلیسی‌زبان نتایج ضعیف‌تری داشت.[9][10]

کاربردها

محصولات و خدمات Baidu

مدل‌های مجموعه ERNIE در اکوسیستم محصولات Baidu یکپارچه شده‌اند:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — چت‌بات با پشتیبانی از تولید چندوجهی (متن، تصویر، ویدیو، صدا). بر اساس داده‌های Baidu، تعداد کاربران فعال ماهانه از ۲۰۰ میلیون فراتر رفته است (۲۰۲۴–۲۰۲۵). از سال ۲۰۲۵ ERNIE Bot به صورت رایگان در دسترس است.[7]
  • موتور جستجوی Baidu — تولید پاسخ و ویژگی‌های هوش مصنوعی در نتایج جستجو؛ بر اساس داده‌های Baidu، تا ۷۰٪ از نتایج برتر با مؤلفه‌های هوش مصنوعی غنی‌شده‌اند.
  • Qianfan (پلتفرم MaaS) — API برای مشتریان سازمانی؛ بر اساس داده‌های Baidu، بیش از ۷۶۰ هزار شرکت از این پلتفرم استفاده می‌کنند و تعداد فراخوانی‌های روزانه API از ۱٫۵ میلیارد فراتر رفته است (۲۰۲۴). از جمله مشتریان Lenovo، Trip.com و دیگران هستند.[7]
  • Comate — دستیار هوش مصنوعی برای برنامه‌نویسی.
  • Wenxin Yige — تولید تصویر بر پایه مدل‌های ERNIE-ViLG.[11]
  • یکپارچه‌سازی با شرکای خارجی: Samsung Galaxy (برای بازار چین)، آواتارهای دیجیتال، افزونه‌ها (جستجو، تحلیل فایل).[7]

کاربردهای صنعتی

مدل‌ها در زمینه‌های زیر به کار می‌روند:[7][3]

  • سیستم‌های پرسش‌وپاسخ در حوزه‌های تخصصی (حقوق، پزشکی، مالی) با استفاده از پیش‌آموزش تقویت‌شده با دانش.
  • تولید و ویرایش متون چینی (اخبار، متون بازاریابی، محتوای خلاقانه).
  • وظایف چندوجهی: تحلیل تصاویر، نقشه‌های مهندسی، ویدیو و داده‌های جدولی (در نسخه‌های ۴٫۵ و بالاتر).
  • آموزش (یادگیری شخصی‌سازی‌شده)، رباتیک (برنامه‌ریزی وظایف)، رانندگی خودکار (Apollo).

کد منبع باز

از ERNIE 4.5 به بعد، تمام ۱۰ نوع خانواده تحت مجوز Apache 2.0 با مجموعه ابزار ERNIEKit (پشتیبانی از SFT، LoRA، DPO، استنتاج بر روی PaddlePaddle/FastDeploy) منتشر شده‌اند. کد نسخه‌های قدیمی‌تر (ERNIE 1.0–3.0) در GitHub PaddlePaddle/ERNIE در دسترس است.[3][15]

محدودیت‌ها و مسائل باز

محدودیت‌های معماری و مجموعه داده

ERNIE 3.0 Titan با ۲۶۰ میلیارد پارامتر به طول بافت ۵۱۲ توکن برای ماژول منفرد محدود است که بدون مکانیزم‌های اضافی (chunking، حافظه خارجی) مدل‌سازی متون بلند را محدود می‌کند. آموزش عمدتاً بر مجموعه چینی انجام شده که به یکنواختی کیفیت بین زبان چینی و سایر زبان‌ها منجر می‌شود.[6]

یکپارچه‌سازی گراف دانش کار با واقعیت‌های ساختاریافته را بهبود می‌بخشد، اما دقت و جامعیت دانش به کیفیت خود گراف و روند تطبیق «سه‌تایی–متن» (entity linking، relation alignment) محدود است که در برخی موارد به ارتباطات اشتباه یا ناقص منجر می‌شود.[6]

توهم‌ها و اعتبارپذیری

Adversarial loss و controllable LM loss مقاومت در برابر تولیدات نامعتبر را بهبود می‌بخشند، اما حذف کامل مشکل توهم‌ها (تولید گزاره‌های واقعاً نادرست) امکان‌پذیر نیست. پارامترهای طبقه‌بند adversarial بر داده‌هایی آموزش می‌بینند که در آن متن «تولیدشده» توسط نسخه قبلی ERNIE ایجاد شده، که این امر طیف الگوهای اشتباه قابل تشخیص را محدود می‌کند.[6]

تعصبات اجتماعی

پژوهشی که در PeerJ Computer Science (2025) منتشر شده، تعصبات اجتماعی در LLMهای چینی (ERNIE و Qwen) را با استفاده از ۲۴۰ گروه اجتماعی و بیش از ۳۰ هزار توصیف تولیدشده تحلیل می‌کند. نتایج نشان می‌دهد که ERNIE محتوای منفی و کلیشه‌ای کمتری نسبت به Baidu Search یا Qwen تولید می‌کند (تقریباً ۱/۱۰ واژه‌های با بار منفی در ERNIE در مقابل ۱/۳ در Qwen). با این حال شیوع معینی از کلیشه‌ها از جمله توصیفات بالقوه توهین‌آمیز همچنان وجود دارد.[16][17]

بازتولیدپذیری

بخشی از مدل‌های این مجموعه (ERNIE 3.0 Titan، نسخه‌های تجاری ERNIE Bot 4.0 و 5.0) به صورت کد کامل باز و وزن‌ها در دسترس نیستند که بازتولید معیارها و امکان ارزیابی مستقل را محدود می‌کند. با انتشار ERNIE 4.5 تحت Apache 2.0 اوضاع بهبود یافته، اما معماری‌ها و تنظیمات آموزش ممکن است با آنچه در انتشارات اولیه توصیف شده متفاوت باشند.[3][6]

ایمنی پزشکی

پژوهش‌های مربوط به استفاده از ERNIE Bot در سناریوهای پزشکی (Si et al., 2025) گرایش به تجویز بیش از حد را آشکار کردند: ۹۱٫۹٪ آزمایش‌های غیرضروری و ۵۷٫۸٪ داروهای غیرضروری در سناریوهای مدل، همچنین عدم تعادل‌های سنی و اجتماعی-اقتصادی در توصیه‌ها.[18]

جنبه‌های اخلاقی و نظارتی

مدل‌های مجموعه ERNIE در چارچوب مقررات چینی در زمینه هوش مصنوعی مولد، به ویژه «اقدامات موقت برای مدیریت سرویس‌های هوش مصنوعی مولد» (Interim Measures for Generative AI Services، ۲۰۲۳) فعالیت می‌کنند که ارزیابی اجباری ایمنی، ثبت الگوریتم‌ها و محدودیت‌های محتوا را پیش‌بینی می‌کند.[7][17]

ERNIE Bot سطح بالایی از رد درخواست‌های مرتبط با موضوعات حساس سیاسی را مطابق با قوانین ملی نشان می‌دهد. پژوهش‌ها (Pan et al., 2026) سانسور سیاسی در LLMهای با منشأ چینی از جمله مدل‌های Baidu را تحلیل می‌کنند.[19]

انتشارات Baidu همیشه روش‌های ممیزی رفتار مدل، معیارهای فیلترینگ محتوا و توازن بین الزامات نظارتی محلی و اصول کلی اخلاق هوش مصنوعی را به تفصیل توصیف نمی‌کنند که این موضوع حوزه‌ای باز برای پژوهش‌های مستقل باقی می‌ماند.[17]

چشم‌اندازها و جهت‌های پژوهشی

بر اساس گزارش‌های فنی و اعلامیه‌های Baidu، جهت‌های توسعه مجموعه ERNIE به شرح زیر است:

  • چندوجهی‌سازی بیشتر (متن–تصویر–ویدیو–صدا) شامل پردازش داده‌های بصری فنی متراکم (نقشه‌های مهندسی، تصاویر پزشکی).[3][4]
  • ترکیب معماری‌های متراکم و MoE برای توازن بین کیفیت و کارایی محاسباتی در اندازه‌های بسیار بزرگ کل مدل.[3]
  • توسعه سیستم‌های عاملی (GenFlow، Famou) و ابزارهای تولید ساختاریافته (JSON، فراخوانی API) برای یکپارچه‌سازی در جریان‌کاری تولیدی.[3]
  • بهبود کارایی آموزش: elastic training، مقیاس‌پذیری بهبودیافته MoE (MFU)، کوانتیزاسیون (W4A8، ۲-bit برای استقرار روی یک GPU).[3]
  • پژوهش برای کاهش تعصبات در LLMهای چینی با در نظر گرفتن جنبه‌های فرهنگی-خاص و توسعه روش‌های ارزیابی برای زبان چینی و وظایف چندوجهی.[16][17]
  • بهبود استدلال در بافت بلند، یادگیری تقویتی قابل تأیید (verifiable RL) و انطباق با حوزه‌های دارای داده محدود از طریق مجموعه‌های مصنوعی.[3][4]

مقایسه با سایر LLMهای چینی

ERNIE با تعدادی از LLMهای بزرگ چینی از جمله Qwen (Alibaba)، GLM / ChatGLM (Zhipu AI)، DeepSeek (DeepSeek AI) و Tongyi Qianwen رقابت می‌کند. تمایزات اصلی مجموعه ERNIE — تأکید بر یکپارچه‌سازی گراف‌های دانش در پیش‌آموزش (knowledge enhancement)، یکپارچه‌سازی نزدیک با اکوسیستم Baidu (جستجو، ابر، API) و تمرکز بر پلتفرم PaddlePaddle است. بر اساس رتبه‌بندی‌های مستقل (SuperBench، LMArena)، مدل‌های مجموعه ERNIE در میان LLMهای چینی جایگاه‌های بالایی دارند، به ویژه در وظایف درک و پیروی از دستورالعمل‌ها به زبان چینی.[9][13][16]

همچنین ببینید

  • BERT
  • معماری Transformer
  • RLHF

منابع

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.