ERNIE (Baidu) (FA)
ERNIE (Baidu) — مجموعهای از مدلهای زبانی پیشآموزشدیده (Large Language Model, LLM) و مدلهای پایه چندوجهی است که از سال ۲۰۱۹ توسط شرکت Baidu تحت عنوان کلی Enhanced Representation through kNowledge IntEgration (بازنمایی تقویتشده از طریق یکپارچهسازی دانش) توسعه مییابد. این مجموعه بر بهبود کیفیت درک معنایی و تولید متن از طریق یکپارچهسازی صریح دانش خارجی از گرافهای دانش (Knowledge Graph, KG)، هستیشناسیها و دانشنامهها در فرآیند پیشآموزش تمرکز دارد.[1][2]
مدلهای این مجموعه از نسخههای اولیه مبتنی بر BERT با پوشاندن موجودیتها و عبارات (ERNIE 1.0، 2.0) تا معماریهای یکپارچه در مقیاس بزرگ (ERNIE 3.0، ERNIE 3.0 Titan)، سیستمهای چندوجهی مبتنی بر Mixture-of-Experts (MoE) با کد منبع باز (ERNIE 4.5) و مدلهای omnimodal بومی (ERNIE 5.0) تکامل یافتهاند. این مجموعه از وظایف درک متن (Natural Language Understanding, NLU)، تولید متن (Natural Language Generation, NLG) و در نسخههای جدیدتر، وظایف چندوجهی (متن، تصویر، ویدیو، صدا) پشتیبانی میکند و با تأکید بر زبان چینی و پشتیبانی از چندزبانی همراه است.[2][3][4]
تاریخچه و پیشزمینه
توسعه مجموعه ERNIE در سال ۲۰۱۹ در بخش پژوهشی Baidu آغاز شد؛ این امر در پاسخ به موفقیت مدل BERT (Devlin et al., 2018) و نیاز به انطباق مدلهای پیشآموزشدیده با زبان چینی بود، که در آن نبود فاصلههای آشکار میان کلمات و نسبت بالای نویسههای چندمعنا، استخراج واحدهای معنایی (موجودیتها، عبارات) را دشوارتر میکند.[1]
ERNIE 1.0 (2019)
اولین مدل این مجموعه (Sun et al., arXiv:1904.09223، آوریل ۲۰۱۹) راهبرد پوشاندن دانش چندسطحی (knowledge masking) را برای معماری مشابه BERT معرفی کرد: به جای پوشاندن تصادفی توکنهای منفرد، مدل موجودیتها و عبارات کامل را که بر اساس تشخیص موجودیتهای نامدار (Named Entity Recognition, NER) و الگوهای عبارات تعریف شدهاند، میپوشاند.[1]
معماری ERNIE 1.0 بر اساس Transformer-encoder (۱۲ لایه، بُعد پنهان ۷۶۸، ۱۲ سر توجه) است. وظیفه Dialogue Language Model (DLM) نیز برای آموزش بر دادههای مکالمهای معرفی شد. این مدل بر روی حدود ۱۷۳ میلیون جمله چینی از مجموعههای Wikipedia، Baidu Baike، اخبار و انجمن Baidu Tieba آموزش دیده است. در زمان انتشار، ERNIE 1.0 به نتایج state-of-the-art (SOTA) در پنج وظیفه NLP چینی دست یافت: XNLI (دقت ۷۸٫۴٪ در آزمون در مقابل ۷۷٫۲٪ BERT)، MSRA-NER (F1 برابر ۹۳٫۸٪ در مقابل ۹۲٫۶٪).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412، جولای ۲۰۱۹؛ پذیرفتهشده در کنفرانس AAAI 2020) چارچوب پیشآموزش چندوظیفهای پیوسته (continual multi-task pre-training) را معرفی کرد که در آن وظایف پیشآموزش جدید به صورت متوالی (افزایشی) به transformer مشترک اضافه میشوند بدون آنکه مدل به طور کامل بازآموزش شود.[5]
وظایف پیشآموزش ERNIE 2.0 به سه گروه تقسیم میشوند:
- Word-aware — پوشاندن دانش (knowledge masking)، پیشبینی حروف بزرگ (capitalization prediction)، ارتباط توکن با سند (token-document relation).
- Structure-aware — بازچینی جملات (sentence reordering)، تعیین فاصله میان جملات (sentence distance).
- Semantic-aware — پیشبینی روابط گفتمانی (discourse relation prediction)، ارتباطسنجی برای بازیابی اطلاعات (IR relevance prediction).[5]
مدل بر روی مجموعههای انگلیسی و چینی (دانشنامهها، کتب، Reddit، گزارشهای جستجو) آموزش دیده است. نتایج: میانگین امتیاز GLUE برای مدل base برابر ۸۰٫۶ (در مقابل ۷۸٫۳ برای BERT) و برای مدل large برابر ۸۳٫۶ بود؛ ERNIE 2.0 در ۱۶ وظیفه از BERT و XLNet پیشی گرفت.[5]
ERNIE 3.0 (2021)
چارچوب ERNIE 3.0 (Sun et al., arXiv:2107.02137، جولای ۲۰۲۱) پارادایمهای پیشآموزش auto-encoding (AE) و auto-regressive (AR) را در یک معماری یکپارچه ترکیب کرد که به ماژول بازنمایی جهانی (Universal Representation Module) و ماژولهای بازنمایی وظیفهمحور (Task-specific Representation Modules) برای NLU و NLG تقسیم شده است.[2]
مدل با ۱۰ میلیارد پارامتر بر روی ۴ ترابایت متن چینی (۱۱ دسته: Baidu Baike، Wikipedia، گزارشهای جستجو، سیستمهای پرسشوپاسخ، متون تخصصی) و یک گراف دانش با بیش از ۵۰ میلیون واقعیت آموزش دیده است. ERNIE 3.0 در ۵۴ وظیفه NLP چینی به SOTA دست یافت؛ در معیار SuperGLUE انگلیسی — ۹۰٫۶٪ (تا تاریخ ۳ جولای ۲۰۲۱، بالاتر از مرجع انسانی ۸۹٫۸٪).[2]
ERNIE 3.0 Titan (2021)
مقاله «ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation» (Wang et al., arXiv:2112.12731، دسامبر ۲۰۲۱) مقیاسپذیری چارچوب ERNIE 3.0 را تا یک مدل متراکم (dense) با ۲۶۰ میلیارد پارامتر پیادهسازیشده بر روی پلتفرم PaddlePaddle توصیف میکند.[6]
Titan مکانیزمهای اضافی را معرفی کرد: adversarial loss خودنظارتی برای ارزیابی اعتبار متن تولیدشده، controllable language modeling loss برای کنترل سبک، موضوع، لحن و طول تولید، همچنین distillation آنلاین (On-the-Fly Distillation, OFD) برای بهدست آوردن مدلهای فشرده دانشآموز در طول پیشآموزش. مدل بر روی ۶۸ مجموعه داده ارزیابی شد و به گزارش نویسندگان در تمام ۶۸ مجموعه داده از مدلهای پیشین پیشی گرفت.[6]
ERNIE Bot و نسخههای تجاری (2023–2025)
در مارس ۲۰۲۳، Baidu چتبات ERNIE Bot (Wenxin Yiyan، 文心一言) را بر اساس مدلهای ERNIE 3.x و PLATO (مدل مکالمهای) عرضه کرد. دسترسی عمومی در اوت ۲۰۲۳ پس از تأیید نهادهای نظارتی امکانپذیر شد. بهروزرسانیها شامل ERNIE 3.5 (ژوئن ۲۰۲۳) و ERNIE 4.0 (اکتبر ۲۰۲۳) بودند.[7][8]
بر اساس گزارش SuperBench دانشگاه Tsinghua، ERNIE Bot 4.0 در میان LLMهای چینی رتبه اول را به لحاظ معیار یکپارچه به دست آورد و نتایج قوی در درک زبان چینی و پیروی از دستورالعملها نشان داد.[9][10]
در سال ۲۰۲۲، به موازات خط اصلی مدلهای زبانی، گسترش چندوجهی ERNIE-ViLG 2.0 (arXiv:2210.15257) معرفی شد — مدل تولید تصویر از متن (text-to-image)، که یکی از اولین گامها در مسیر چندوجهی بود.[11]
در سال ۲۰۲۴، در کنفرانس WAVE SUMMIT، Baidu ERNIE 4.0 Turbo را معرفی کرد — نسخهای بهینهشده برای کاربردهای پرسرعت که قادر است متنی با طول بیش از هزار کلمه را در حدود ۲۰ ثانیه با حفظ کیفیت تولید کند.[12]
ERNIE 4.5 (2025)
در ژوئن ۲۰۲۵، Baidu گزارش فنی ERNIE 4.5 را منتشر کرد که خانوادهای از ۱۰ مدل را معرفی میکند: LLMهای متنی و مدلهای چندوجهی (Vision-Language, VL). معماری بر اساس Mixture-of-Experts (MoE) ناهمگن با تفکیک کارشناسان بر اساس وجه (modality) است. انواع مدل شامل مدلهای MoE با تا ۴۲۴ میلیارد پارامتر کل و ۴۷ میلیارد پارامتر فعال، و همچنین یک مدل متراکم با ۰٫۳ میلیارد پارامتر است. این خانواده تحت مجوز Apache 2.0 بر روی Hugging Face و GitHub (PaddlePaddle/ERNIE) منتشر شده است.[3]
ERNIE 5.0 (2026)
در فوریه ۲۰۲۶، گزارش فنی ERNIE 5.0 (arXiv:2602.04705) منتشر شد — یک مدل autoregressive omnimodal بومی با MoE بسیار تُنُک (ultra-sparse MoE) که از مدلسازی مشترک متن، تصویر، صدا و ویدیو پشتیبانی میکند. این مدل در لیدربورد LMArena جایگاههای بالایی کسب کرد.[4][13]
مبانی نظری و اصول معماری
پوشاندن دانش (Knowledge Masking)
اصل کلیدی مدلهای اولیه این مجموعه — یکپارچهسازی دانش ساختاریافته در فرآیند پیشآموزش از طریق راهبردهای پوشاندن اصلاحشده است. برخلاف Masked Language Modeling (MLM) استاندارد که در آن توکنهای منفرد پوشانده میشوند، ERNIE 1.0 واحدهای معنایی کامل را میپوشاند: موجودیتها (تعریفشده از طریق NER) و عبارات. برای موجودیت کل توالی توکنها با احتمال مشخص پوشانده میشود. این رویکرد مدل را وادار میکند به بافت گستردهتر تکیه کند و روابط میان موجودیتها را فرا بگیرد.[1]
ERNIE 2.0 این رویکرد را با افزودن آموزش چندوظیفهای افزایشی توسعه داد: وظایف در سطوح واژگانی، ساختاری و معنایی به صورت متوالی اضافه میشوند، در حالی که دانش قبلاً آموختهشده از طریق مکانیزم پیشآموزش پیوسته (continual pre-training) حفظ میشود.[5]
چارچوب یکپارچه ERNIE 3.0
چارچوب ERNIE 3.0 بر تقسیم معماری به دو سطح استوار است:[2][6]
- Universal Representation Module — یک Transformer-XL چندلایه مشترک که بر روی مجموعه متنوعی از وظایف پیشآموزش آموزش میبیند و ویژگیهای واژگانی و نحوی عمومی را استخراج میکند. در نسخه Titan، این ماژول دارای ۴۸ لایه، بازنمایی پنهان با اندازه ۱۲۲۸۸، ۱۹۲ سر توجه و اندازه داخلی شبکه feed-forward برابر ۱۹۶۶۰۸ است ().
- Task-specific Representation Modules — ماژولهای مجزا برای NLU (توجه دوطرفه) و NLG (توجه یکطرفه با حافظه بازگشتی Transformer-XL)، هریک با ۱۲ لایه، اندازه بردار پنهان ۷۶۸ و ۱۲ سر توجه.
یکپارچهسازی پارادایمهای auto-encoding و auto-regressive به یک مدل واحد اجازه میدهد هم در معیارهای NLU (وظایف مشابه BERT) و هم در معیارهای NLG (وظایف مشابه GPT) نتایج بالایی داشته باشد.[2]
Universal Knowledge‑Text Prediction (UKTP)
وظیفه UKTP مکانیزم اصلی یکپارچهسازی دانش در ERNIE 3.0/Titan است. مدل یک جفت (سهتایی از گراف دانش، جملهای از دانشنامه) دریافت میکند و باید یا رابطه موجود در سهتایی را با استفاده از متن پیشبینی کند، یا توکنهای پوشاندهشده در متن را با استفاده از اطلاعات سهتایی پیشبینی کند.[6]
هنگام پیشبینی رابطه در سهتایی مرتبط با متن ، وظیفه به صورت طبقهبندی چندکلاسه فرموله میشود:
که در آن خروجی transformer در موقعیتهای اشاره به موجودیتهای سر و دم است، پارامترهای طبقهبند، پارامترهای مدل هستند.[6]
مکانیزمهای تولید معتبر و کنترلپذیر (Titan)
ERNIE 3.0 Titan دو نوع اضافی از توابع زیان را معرفی کرد.[6]
Adversarial loss خودنظارتی. مجموعه داده ساخته میشود که در آن پاراگرافهای واقعی و متون تولیدشده توسط نسخه قبلی ERNIE بر اساس پیشوند پاراگرافهای اصلی هستند. وظیفه — طبقهبندی دوتایی (اصلی/تولیدی) بر اساس حالت پنهان توکن ویژه [CLS] است:
که در آن بازنمایی برداری [CLS] برای نمونه -ام، نشانگر تعلق به متون اصلی است.[6]
Controllable language modeling loss. هر نمونه آموزشی با مجموعهای از ویژگیها (prompt) همراه است که ژانر، موضوع، کلیدواژهها، لحن و طول را توصیف میکنند. زیان، مدلسازی زبانی بیشرط و مشروط را ترکیب میکند:
که در آن یک متغیر تصادفی برای تناوب حالتها، توکن -ام نمونه -ام است. این تعریف از وابستگی بیش از حد مدل به prompt جلوگیری میکند.[6]
معماری ناهمگن MoE (ERNIE 4.5)
ERNIE 4.5 یک معماری چندوجهی ناهمگن Mixture-of-Experts با تفکیک کارشناسان بر اساس وجه معرفی میکند: کارشناسان متنی و کارشناسان بصری (که دومی تقریباً ۱/۳ اندازه متنی دارند). مسیریابی توکنها با جداسازی بر اساس وجه (modality-isolated routing) و اعمال جریمه متعامدسازی برای مسیریاب (router orthogonalization loss، ضریب مرتبه ) برای تضمین تخصصیابی کارشناسان انجام میشود. از 3D RoPE (Rotary Position Embeddings) برای کدگذاری موقعیتی ابعاد زمانی، ارتفاعی و عرضی در دادههای ویدیویی استفاده میشود. مکانیزم FlashMask برای کار کارآمد با بافت بلند (تا ۱۳۱ هزار توکن) با ماسکهای به کار میرود.[3]
پیشآموزش ERNIE 4.5 در چند مرحله انجام میشود: ابتدا آموزش تنها بر دادههای متنی، سپس بر دادههای بصری، و در مرحله نهایی — آموزش مشترک بر دادههای چندوجهی (text-only → vision-only → joint). برای پردازش تصویر از یک encoder تطبیقی ViT (Vision Transformer) با مکانیزم pixel shuffle برای همراستاسازی بازنماییهای وجههای مختلف استفاده میشود. پردازش ویدیوهای بلند (تا ۳۲ هزار توکن) با نمونهبرداری تطبیقی فریم (adaptive frame sampling) پشتیبانی میشود.[3]
Omnimodality بومی (ERNIE 5.0)
ERNIE 5.0 مدلسازی autoregressive بومی چند وجه (متن، تصویر، صدا، ویدیو) را در یک معماری یکپارچه با MoE بسیار تُنُک پیادهسازی میکند که در هر گام کمتر از ۳٪ از کل کارشناسان فعال میشوند. به عنوان وظیفه پیشآموزش از Next-Group-of-Tokens Prediction — پیشبینی گروهی از توکنها به جای یکی — استفاده میشود که کارایی آموزش را افزایش میدهد. برای وجه صوتی از یک کدک سلسلهمراتبی (hierarchical codec) استفاده میشود. فناوری elastic training امکان تولید زیر-مدلهایی با عمق، پهنا و درجه تُنُکی متفاوت را در یک اجرای آموزشی فراهم میکند.[4]
وظایف پیشآموزش و دادهها
وظایف پیشآموزش ERNIE 3.0 / Titan
در ERNIE 3.0 و Titan از گروههای زیر از وظایف پیشآموزش استفاده میشود:[2][6]
وظایف Word-aware:
- Knowledge Masked Language Modeling — پوشاندن عبارات و موجودیتها برای آموزش وابستگیها در بافت محلی و جهانی.
- Document Language Modeling — مدلسازی autoregressive اسناد با طول تا ۵۱۲ توکن و استفاده از حافظه بازگشتی Transformer-XL.
وظایف Structure-aware:
- Sentence Reordering — برای یک پاراگراف که به صورت تصادفی به بخش تقسیم و درهمریخته شده، مدل وظیفه طبقهبندی -کلاسه را با حل میکند تا ترتیب اصلی را بازیابد.
- Sentence Distance — طبقهبندی ۳-کلاسه: جملات مجاور، جملات غیرمجاور در همان سند، جملات از اسناد مختلف.
وظایف Knowledge-aware:
- Universal Knowledge-Text Prediction (UKTP) — مدلسازی مشترک متن و سهتایی گراف دانش.
- Credible and Controllable Generations — ترکیب adversarial loss و controllable LM loss.
دادههای پیشآموزش
برای ERNIE 3.0/Titan از ERNIE 3.0 Corpus استفاده میشود — مجموعه چینی با حجم حدود ۴ ترابایت در ۱۱ دسته، شامل صفحات وب، گزارشهای جستجو، دادههای پرسشوپاسخ، متون هنری، حقوقی، مالی و پزشکی، داستانهای کوتاه و شعر. علاوه بر مجموعه، گراف دانشی با بیش از ۵۰ میلیون واقعیت تشکیل شده است.[2][6]
علاوه بر این برای Titan تشکیل میشوند:
- مجموعه داده adversarial — ۲ میلیون پاراگراف اصلی و پاراگرافهای «منفی» متناظر که توسط ERNIE 3.0 بر اساس پیشوند ۱ تا ۳ جمله اول اصل تولید شدهاند، با طول تا ۵۱۲ توکن.
- مجموعه داده controllable — متون مجهز به ویژگیهای ژانر، موضوع (۲۶ حوزه موضوعی)، کلیدواژهها، لحن (مثبت/منفی/خنثی) و طول. ویژگیهای ژانر با «prompt نرم» قابلآموزش کدگذاری میشوند (تعداد promptها برای ژانر به صورت تصادفی از ۰ تا ۶۴ انتخاب میشود).[6]
نسخههای اخیر (ERNIE 4.5، 5.0) از مجموعههای چندوجهی گسترشیافته (متن، تصویر، ویدیو، صدا) شامل محتوای وب انتخابشده، انتشارات علمی و دادههای مصنوعی استفاده میکنند.[3][4]
آموزش و بهینهسازی توزیعشده
پیشآموزش ERNIE 3.0 Titan با استفاده از بهینهساز Adam (نرخ یادگیری ، ، ، قانونگذاری L2 برابر ۰٫۱، برش هنجار گرادیان تا ۱٫۰)، حداکثر طول بافت ۵۱۲ و طول حافظه بازگشتی ۱۲۸ برای وظایف تولیدی انجام شد. از یک طرح آموزش تدریجی (همگرایی سریعتر در ۴۰۰۰ گام اول) و کاهش خطی نرخ یادگیری استفاده شد.[6]
موازیسازی هیبریدی چهاربُعدی (4D)
برای آموزش مدل متراکم با ۲۶۰ میلیارد پارامتر بر روی خوشههای ناهمگن (GPU NVIDIA V100 و NPU Ascend 910) در PaddlePaddle موازیسازی هیبریدی 4D پیادهسازی شده است:[6]
- Data parallelism (DP) — تکثیر مدل بر چندین دستگاه با پردازش جداگانه باچها.
- Tensor model parallelism (MP) — تقسیم پارامترها و فعالسازیهای transformer در داخل لایهها بین دستگاهها.
- Pipeline model parallelism (PP) — توزیع لایههای مدل در یک خط لوله.
- Group Sharded — نوع پیشرفتهشده از sharded-data-parallel مشابه ZeRO برای کاهش تکراریشدن حالتهای بهینهساز.
گزارشها از مقیاسپذیری ضعیف تا هزاران کارت Ascend 910 با کارایی حدود ۹۱٫۷٪ از نظر توان عملیاتی حکایت دارند.[6]
آموزش ERNIE 4.5
آموزش ERNIE 4.5 بر روی خوشهای از ۲۰۱۶ GPU NVIDIA H800 با دستیابی به Model FLOPs Utilization (MFU) برابر ۴۷٪ انجام شد. از دقت مختلط FP8، نقاط بازیابی مقاوم در برابر خطا (Zero Cost Checkpoint، بازیابی در کمتر از ۸ دقیقه) و آموزش تدریجی با افزایش طول دنباله و اندازه باچ استفاده شد.[3]
تقطیر آنلاین
برای کاهش نیازمندیهای محاسباتی در استقرار ERNIE 3.0 Titan از تقطیر آنلاین استفاده میشود که در آن مدل معلم و چندین مدل دانشآموز به طور همزمان آموزش میبینند:[6]
- On-the-Fly Distillation (OFD) — لاجیتها و بازنماییهای معلم برای آموزش دانشآموزان در همان گامهای آموزشی استفاده میشوند.
- Teacher assistants — مدلهای با اندازه متوسط که شکاف ظرفیتی بین معلم و دانشآموزان نهایی را کاهش میدهند.
- Auxiliary Layer Distillation (ALD) — یک لایه کمکی در دانشآموز که در هنگام fine-tuning حذف میشود، برای تطابق بهتر بازنماییهای داخلی.
پسآموزش و همراستاسازی
نسخههای تجاری ERNIE (از ERNIE Bot به بعد) مراحل پسآموزش زیر را طی میکنند:[7][3]
- Supervised Fine-Tuning (SFT) — بازآموزی بر دادههای دستوری برچسبگذاریشده (در ERNIE 4.5 — ۲٫۳ میلیون نمونه).
- Reinforcement Learning from Human Feedback (RLHF) — همراستاسازی رفتار مدل با بازخورد انسانی؛ الگوریتمهای PPO (Proximal Policy Optimization) و DPO (Direct Preference Optimization) به کار میروند.
- Unified Preference Optimization (UPO) — روش بهینهسازی یکپارچه ترجیحات که در ERNIE 4.5 معرفی شده است.
- Reinforcement Learning with Verifiers (RLVR) — یادگیری تقویتی با استفاده از تأییدکنندهها برای بررسی صحت پاسخها؛ روش GRPO (Group Relative Policy Optimization) به کار میرود.
- حالتهای استدلال (thinking modes) — مدلهای 4.5 از حالتهای با تأمل (reflection، planning) و بدون آن پشتیبانی میکنند.
نتایج کلیدی و معیارها
جدول خلاصه تکامل مدلها
| نسخه | سال | پارامترها | معماری | معیارهای کلیدی | منبع |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~۱۱۰ میلیون (base) | Transformer-encoder (مشابه BERT) | XNLI 78.4%; MSRA-NER F1 93.8% | [1] |
| ERNIE 2.0 | 2019 | ~۱۱۰–۳۴۰ میلیون | Continual multi-task | GLUE 80.6 (base) / 83.6 (large)؛ ۱۶ وظیفه SOTA | [5] |
| ERNIE 3.0 | 2021 | ۱۰ میلیارد | Unified Transformer-XL (AE+AR) | SuperGLUE 90.6% (> human 89.8%)؛ ۵۴ وظیفه چینی SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | ۲۶۰ میلیارد (dense) | Dense + controllable generation | ۶۸ مجموعه داده SOTA؛ zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0.3–424 میلیارد (MoE، ۴۷ میلیارد فعال) | Heterogeneous multimodal MoE | C-Eval 90.6%; MMLU 86.5%; MMMU 67.3–70% | [3] |
| ERNIE 5.0 | 2026 | ~۲٫۴ تریلیون (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (جهانی، جایگاه برتر ۱۰) | [4] |
نتایج ERNIE 3.0 و Titan
ERNIE 3.0 (۱۰ میلیارد پارامتر) در معیار SuperGLUE انگلیسی به میانگین ۹۰٫۶ دست یافت که از مرجع انسانی (۸۹٫۸) و نتایج GPT-3، T5 و DeBERTa در زمان انتشار پیشی گرفت. ERNIE 3.0 Titan (۲۶۰ میلیارد) بر روی ۶۸ مجموعه داده شامل وظایف طبقهبندی، NLI، QA و تولید ارزیابی شد؛ نویسندگان از برتری بر مدلهای پیشین در تمام ۶۸ مجموعه داده گزارش میدهند. این نتایج از منابع اولیه هستند؛ بازتولید مستقل به صورت محدود توصیف شده است.[2][6]
نتایج ERNIE 4.5
بر اساس گزارش فنی ۲۰۲۵، ERNIE 4.5 (300B-A47B، پس از آموزش) نتایج زیر را در معیارهای متنی و چندوجهی نشان میدهد:[3]
| معیار | ERNIE‑4.5‑300B‑A47B | شرایط |
|---|---|---|
| C‑Eval | 90.6% | 5-shot |
| CMMLU | 90.2% | — |
| MMLU | 86.5% | استاندارد |
| IFEval | 88.0% | instruction following |
| GSM8K | 91.8% | — |
| MMMU | 67.3–70.0% | non-thinking / thinking |
| MathVista | 78.8% | thinking mode |
| OCRBench | 883 | — |
بر اساس گزارش، ERNIE 4.5 در ۲۲ از ۲۸ معیار از DeepSeek-V3 پیشی گرفت؛ نسخههای چندوجهی (ERNIE-4.5-VL-424B-A47B) نتایج رقابتی در وظایف استدلال بصری نشان دادند. در برخی وظایف استدلال بصری و تفسیر فنی تصاویر (تحلیل نقشهها، نمودارهای مهندسی) نتایجی بالاتر از برخی مدلهای GPT و Gemini گزارش شده است.[3][14]
مقایسه ERNIE 4.5 با رقبا (معیارهای انتخابی، پس از آموزش، بر اساس گزارش فنی ۲۰۲۵):
| معیار | ERNIE‑4.5‑300B‑A47B | DeepSeek‑V3‑671B‑A37B | Qwen3‑235B‑A22B | یادداشت |
|---|---|---|---|---|
| C‑Eval | 90.6% | — | — | 5-shot |
| MMLU | 86.5% | قابل مقایسه | — | استاندارد |
| IFEval | 88.0% | — | 83.2% | instruction following |
| MMMU | 67.3–70.0% | — | — | thinking / non-thinking |
| MathVista | 78.8% | — | 77.6% (Qwen2.5‑VL) | thinking mode |
شرایط بازتولید: پروتکلهای استاندارد (5-shot / zero-shot)؛ مجموعه دادههای باز (C-Eval 2023+، MMLU، MMMU). خط تیره («—») به این معنی است که دادههای قابل مقایسه در همان شرایط در گزارش ارائه نشده است.[3]
ارزیابیهای ERNIE Bot 4.0
گزارش SuperBench دانشگاه Tsinghua LLMهای تجاری را بر اساس مجموعهای از وظایف (درک زبانی، ریاضیات، برنامهنویسی، چندوظیفهای) رتبهبندی میکند. ERNIE Bot 4.0 در میان مدلهای چینی رتبه اول را کسب کرد و حدود ۰٫۴۱ امتیاز به لحاظ معیار یکپارچه از GLM-4 (Zhipu AI) پیشی گرفت؛ مدلهای GPT-4 و Anthropic Claude-3 در رتبهبندی جهانی بالاتر باقی ماندند. ERNIE Bot 4.0 در درک متن چینی و پیروی از دستورالعملها نتایج قوی نشان داد، در حالی که در برنامهنویسی و برخی وظایف انگلیسیزبان نتایج ضعیفتری داشت.[9][10]
کاربردها
محصولات و خدمات Baidu
مدلهای مجموعه ERNIE در اکوسیستم محصولات Baidu یکپارچه شدهاند:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — چتبات با پشتیبانی از تولید چندوجهی (متن، تصویر، ویدیو، صدا). بر اساس دادههای Baidu، تعداد کاربران فعال ماهانه از ۲۰۰ میلیون فراتر رفته است (۲۰۲۴–۲۰۲۵). از سال ۲۰۲۵ ERNIE Bot به صورت رایگان در دسترس است.[7]
- موتور جستجوی Baidu — تولید پاسخ و ویژگیهای هوش مصنوعی در نتایج جستجو؛ بر اساس دادههای Baidu، تا ۷۰٪ از نتایج برتر با مؤلفههای هوش مصنوعی غنیشدهاند.
- Qianfan (پلتفرم MaaS) — API برای مشتریان سازمانی؛ بر اساس دادههای Baidu، بیش از ۷۶۰ هزار شرکت از این پلتفرم استفاده میکنند و تعداد فراخوانیهای روزانه API از ۱٫۵ میلیارد فراتر رفته است (۲۰۲۴). از جمله مشتریان Lenovo، Trip.com و دیگران هستند.[7]
- Comate — دستیار هوش مصنوعی برای برنامهنویسی.
- Wenxin Yige — تولید تصویر بر پایه مدلهای ERNIE-ViLG.[11]
- یکپارچهسازی با شرکای خارجی: Samsung Galaxy (برای بازار چین)، آواتارهای دیجیتال، افزونهها (جستجو، تحلیل فایل).[7]
کاربردهای صنعتی
مدلها در زمینههای زیر به کار میروند:[7][3]
- سیستمهای پرسشوپاسخ در حوزههای تخصصی (حقوق، پزشکی، مالی) با استفاده از پیشآموزش تقویتشده با دانش.
- تولید و ویرایش متون چینی (اخبار، متون بازاریابی، محتوای خلاقانه).
- وظایف چندوجهی: تحلیل تصاویر، نقشههای مهندسی، ویدیو و دادههای جدولی (در نسخههای ۴٫۵ و بالاتر).
- آموزش (یادگیری شخصیسازیشده)، رباتیک (برنامهریزی وظایف)، رانندگی خودکار (Apollo).
کد منبع باز
از ERNIE 4.5 به بعد، تمام ۱۰ نوع خانواده تحت مجوز Apache 2.0 با مجموعه ابزار ERNIEKit (پشتیبانی از SFT، LoRA، DPO، استنتاج بر روی PaddlePaddle/FastDeploy) منتشر شدهاند. کد نسخههای قدیمیتر (ERNIE 1.0–3.0) در GitHub PaddlePaddle/ERNIE در دسترس است.[3][15]
محدودیتها و مسائل باز
محدودیتهای معماری و مجموعه داده
ERNIE 3.0 Titan با ۲۶۰ میلیارد پارامتر به طول بافت ۵۱۲ توکن برای ماژول منفرد محدود است که بدون مکانیزمهای اضافی (chunking، حافظه خارجی) مدلسازی متون بلند را محدود میکند. آموزش عمدتاً بر مجموعه چینی انجام شده که به یکنواختی کیفیت بین زبان چینی و سایر زبانها منجر میشود.[6]
یکپارچهسازی گراف دانش کار با واقعیتهای ساختاریافته را بهبود میبخشد، اما دقت و جامعیت دانش به کیفیت خود گراف و روند تطبیق «سهتایی–متن» (entity linking، relation alignment) محدود است که در برخی موارد به ارتباطات اشتباه یا ناقص منجر میشود.[6]
توهمها و اعتبارپذیری
Adversarial loss و controllable LM loss مقاومت در برابر تولیدات نامعتبر را بهبود میبخشند، اما حذف کامل مشکل توهمها (تولید گزارههای واقعاً نادرست) امکانپذیر نیست. پارامترهای طبقهبند adversarial بر دادههایی آموزش میبینند که در آن متن «تولیدشده» توسط نسخه قبلی ERNIE ایجاد شده، که این امر طیف الگوهای اشتباه قابل تشخیص را محدود میکند.[6]
تعصبات اجتماعی
پژوهشی که در PeerJ Computer Science (2025) منتشر شده، تعصبات اجتماعی در LLMهای چینی (ERNIE و Qwen) را با استفاده از ۲۴۰ گروه اجتماعی و بیش از ۳۰ هزار توصیف تولیدشده تحلیل میکند. نتایج نشان میدهد که ERNIE محتوای منفی و کلیشهای کمتری نسبت به Baidu Search یا Qwen تولید میکند (تقریباً ۱/۱۰ واژههای با بار منفی در ERNIE در مقابل ۱/۳ در Qwen). با این حال شیوع معینی از کلیشهها از جمله توصیفات بالقوه توهینآمیز همچنان وجود دارد.[16][17]
بازتولیدپذیری
بخشی از مدلهای این مجموعه (ERNIE 3.0 Titan، نسخههای تجاری ERNIE Bot 4.0 و 5.0) به صورت کد کامل باز و وزنها در دسترس نیستند که بازتولید معیارها و امکان ارزیابی مستقل را محدود میکند. با انتشار ERNIE 4.5 تحت Apache 2.0 اوضاع بهبود یافته، اما معماریها و تنظیمات آموزش ممکن است با آنچه در انتشارات اولیه توصیف شده متفاوت باشند.[3][6]
ایمنی پزشکی
پژوهشهای مربوط به استفاده از ERNIE Bot در سناریوهای پزشکی (Si et al., 2025) گرایش به تجویز بیش از حد را آشکار کردند: ۹۱٫۹٪ آزمایشهای غیرضروری و ۵۷٫۸٪ داروهای غیرضروری در سناریوهای مدل، همچنین عدم تعادلهای سنی و اجتماعی-اقتصادی در توصیهها.[18]
جنبههای اخلاقی و نظارتی
مدلهای مجموعه ERNIE در چارچوب مقررات چینی در زمینه هوش مصنوعی مولد، به ویژه «اقدامات موقت برای مدیریت سرویسهای هوش مصنوعی مولد» (Interim Measures for Generative AI Services، ۲۰۲۳) فعالیت میکنند که ارزیابی اجباری ایمنی، ثبت الگوریتمها و محدودیتهای محتوا را پیشبینی میکند.[7][17]
ERNIE Bot سطح بالایی از رد درخواستهای مرتبط با موضوعات حساس سیاسی را مطابق با قوانین ملی نشان میدهد. پژوهشها (Pan et al., 2026) سانسور سیاسی در LLMهای با منشأ چینی از جمله مدلهای Baidu را تحلیل میکنند.[19]
انتشارات Baidu همیشه روشهای ممیزی رفتار مدل، معیارهای فیلترینگ محتوا و توازن بین الزامات نظارتی محلی و اصول کلی اخلاق هوش مصنوعی را به تفصیل توصیف نمیکنند که این موضوع حوزهای باز برای پژوهشهای مستقل باقی میماند.[17]
چشماندازها و جهتهای پژوهشی
بر اساس گزارشهای فنی و اعلامیههای Baidu، جهتهای توسعه مجموعه ERNIE به شرح زیر است:
- چندوجهیسازی بیشتر (متن–تصویر–ویدیو–صدا) شامل پردازش دادههای بصری فنی متراکم (نقشههای مهندسی، تصاویر پزشکی).[3][4]
- ترکیب معماریهای متراکم و MoE برای توازن بین کیفیت و کارایی محاسباتی در اندازههای بسیار بزرگ کل مدل.[3]
- توسعه سیستمهای عاملی (GenFlow، Famou) و ابزارهای تولید ساختاریافته (JSON، فراخوانی API) برای یکپارچهسازی در جریانکاری تولیدی.[3]
- بهبود کارایی آموزش: elastic training، مقیاسپذیری بهبودیافته MoE (MFU)، کوانتیزاسیون (W4A8، ۲-bit برای استقرار روی یک GPU).[3]
- پژوهش برای کاهش تعصبات در LLMهای چینی با در نظر گرفتن جنبههای فرهنگی-خاص و توسعه روشهای ارزیابی برای زبان چینی و وظایف چندوجهی.[16][17]
- بهبود استدلال در بافت بلند، یادگیری تقویتی قابل تأیید (verifiable RL) و انطباق با حوزههای دارای داده محدود از طریق مجموعههای مصنوعی.[3][4]
مقایسه با سایر LLMهای چینی
ERNIE با تعدادی از LLMهای بزرگ چینی از جمله Qwen (Alibaba)، GLM / ChatGLM (Zhipu AI)، DeepSeek (DeepSeek AI) و Tongyi Qianwen رقابت میکند. تمایزات اصلی مجموعه ERNIE — تأکید بر یکپارچهسازی گرافهای دانش در پیشآموزش (knowledge enhancement)، یکپارچهسازی نزدیک با اکوسیستم Baidu (جستجو، ابر، API) و تمرکز بر پلتفرم PaddlePaddle است. بر اساس رتبهبندیهای مستقل (SuperBench، LMArena)، مدلهای مجموعه ERNIE در میان LLMهای چینی جایگاههای بالایی دارند، به ویژه در وظایف درک و پیروی از دستورالعملها به زبان چینی.[9][13][16]
همچنین ببینید
- BERT
- معماری Transformer
- RLHF
منابع
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.