ERNIE (Baidu) (BG)
ERNIE (Baidu) — серия предобучени езикови модели (Large Language Model, LLM) и мултимодални фундаментални модели, разработвани от компанията Baidu от 2019 година под общото наименование Enhanced Representation through kNowledge IntEgration (усилено представяне чрез интеграция на знания). Серията е насочена към подобряване на качеството на семантичното разбиране и генериране чрез явна интеграция на външни знания от графи на знания (Knowledge Graph, KG), онтологии и енциклопедии в процеса на предобучение.[1][2]
Моделите от серията еволюираха от ранни варианти на базата на BERT с маскиране на същности и фрази (ERNIE 1.0, 2.0) през мащабни унифицирани архитектури (ERNIE 3.0, ERNIE 3.0 Titan) до мултимодални системи на основата на Mixture-of-Experts (MoE) с отворен изходен код (ERNIE 4.5) и нативни омнимодални модели (ERNIE 5.0). Серията поддържа задачи за разбиране на текст (Natural Language Understanding, NLU), генериране на текст (Natural Language Generation, NLG) и, в по-късните версии, мултимодални задачи (текст, изображение, видео, аудио), с акцент върху китайския език и поддръжка на многоезичност.[2][3][4]
История и предпоставки
Разработката на серията ERNIE започна през 2019 година в изследователското подразделение на Baidu в отговор на успеха на модела BERT (Devlin et al., 2018) и необходимостта от адаптиране на предобучени модели към китайския език, при който липсата на явни интервали между думите и високият дял на многозначни йероглифи усложняват улавянето на семантични единици (същности, фрази).[1]
ERNIE 1.0 (2019)
Първият модел от серията (Sun et al., arXiv:1904.09223, април 2019) въведе стратегия за многостепенно маскиране на знания (knowledge masking) за BERT‑подобна архитектура: вместо произволно маскиране на отделни токени, моделът маскира цели същности и фрази, определени въз основа на разпознаване на именувани същности (Named Entity Recognition, NER) и фразови шаблони.[1]
Архитектурата на ERNIE 1.0 се основава на Transformer‑енкодер (12 слоя, скрита размерност 768, 12 глави на внимание). Допълнително е въведена задача Dialogue Language Model (DLM) за обучение върху диалогови данни. Моделът е обучен върху ~173 млн китайски изречения от корпуси на Wikipedia, Baidu Baike, новини и форума Baidu Tieba. По времето на публикуването ERNIE 1.0 постигна state‑of‑the‑art (SOTA) резултати на пет китайски NLP задачи: XNLI (точност 78,4 % на теста срещу 77,2 % при BERT), MSRA‑NER (F1 93,8 % срещу 92,6 %).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412, юли 2019; приета на конференцията AAAI 2020) въведе фреймуърк за непрекъснато многозадачно предобучение (continual multi‑task pre‑training), при което нови предобучаващи задачи се добавят последователно (инкрементално) към общия трансформер без пълно преобучаване на модела.[5]
Задачите за предобучение на ERNIE 2.0 са разделени на три групи:
- Word‑aware — маскиране на знания (knowledge masking), предсказване на регистъра (capitalization prediction), връзка на токена с документа (token‑document relation).
- Structure‑aware — пренареждане на изречения (sentence reordering), определяне на разстоянието между изречения (sentence distance).
- Semantic‑aware — предсказване на дискурсивни отношения (discourse relation prediction), релевантност за информационно търсене (IR relevance prediction).[5]
Моделът е обучен върху английски и китайски корпуси (енциклопедии, книги, Reddit, логове от търсене). Резултати: средният резултат на GLUE за base‑модела е 80,6 (срещу 78,3 при BERT), за large‑модела — 83,6; ERNIE 2.0 превъзхожда BERT и XLNet на 16 задачи.[5]
ERNIE 3.0 (2021)
Фреймуъркът ERNIE 3.0 (Sun et al., arXiv:2107.02137, юли 2021) обедини авто-енкодерната (auto‑encoding, AE) и авторегресивната (auto‑regressive, AR) парадигми за предобучение в единна архитектура, разделена на универсален модул за представяния (Universal Representation Module) и задачно-специфични модули (Task‑specific Representation Modules) за NLU и NLG.[2]
Моделът с 10 млрд параметра е обучен върху 4 ТБ китайски текст (11 категории: Baidu Baike, Wikipedia, логове от търсене, системи за въпроси и отговори, домейн-специфични текстове) и граф на знания с повече от 50 млн факта. ERNIE 3.0 постигна SOTA на 54 китайски NLP задачи; на английския benchmark SuperGLUE — 90,6 % (към 3 юли 2021 г., над човешкия ориентир от 89,8 %).[2]
ERNIE 3.0 Titan (2021)
В статията „ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, декември 2021) е описано мащабирането на фреймуърка ERNIE 3.0 до плътен (dense) модел с 260 млрд параметра, реализиран на платформата PaddlePaddle.[6]
Titan въведе допълнителни механизми: самосупервизиран adversarial loss за оценка на достоверността на генерирания текст, controllable language modeling loss за управление на стила, темата, тоналността и дължината на генерирането, както и онлайн дистилация (On‑the‑Fly Distillation, OFD) за получаване на компактни модели-студенти по време на предобучението. Моделът е оценяван върху 68 набора от данни и, по данни на авторите, превъзхожда предшестващите модели на всички 68 dataset-а.[6]
ERNIE Bot и търговски версии (2023–2025)
През март 2023 година Baidu пусна чат‑бота ERNIE Bot (Wenxin Yiyan, 文心一言) на базата на моделите ERNIE 3.x и PLATO (диалогов модел). Публичният достъп беше открит през август 2023 година след одобрение от регулаторите. Актуализациите включваха ERNIE 3.5 (юни 2023) и ERNIE 4.0 (октомври 2023).[7][8]
Според доклада SuperBench на Университета Цинхуа, ERNIE Bot 4.0 зае първо място сред китайските LLM по интегрална метрика, показвайки силни резултати в китайското езиково разбиране и следването на инструкции.[9][10]
През 2022 година, успоредно с основната езикова линия, беше представено мултимодалното разширение ERNIE‑ViLG 2.0 (arXiv:2210.15257) — модел за генериране на изображения по текст (text‑to‑image), което беше една от първите стъпки в посока мултимодалност.[11]
През 2024 година на конференцията WAVE SUMMIT Baidu представи ERNIE 4.0 Turbo — оптимизирана версия за високоскоростни приложения, способна да генерира текст с дължина над хиляда думи за около 20 секунди при запазване на качеството.[12]
ERNIE 4.5 (2025)
През юни 2025 година Baidu публикува технически доклад за ERNIE 4.5, представящ семейство от 10 модела: текстови LLM и мултимодални модели (Vision‑Language, VL). Архитектурата се основава на хетерогенен Mixture-of-Experts (MoE) с разделяне на експертите по модалности. Вариантите включват MoE‑модели с до 424 млрд общи и 47 млрд активни параметра, както и плътен модел с 0,3 млрд параметра. Семейството е публикувано под лицензия Apache 2.0 в Hugging Face и GitHub (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
През февруари 2026 година е публикуван техническият доклад за ERNIE 5.0 (arXiv:2602.04705) — нативен омнимодален авторегресивен модел с ултра-разредена MoE (ultra‑sparse MoE), поддържащ съвместно моделиране на текст, изображения, аудио и видео. Моделът заемаше високи позиции в класацията LMArena.[4][13]
Теоретични основи и архитектурни принципи
Маскиране на знания (Knowledge Masking)
Ключовият принцип на ранните модели от серията е интеграцията на структурирани знания в процеса на предобучение чрез модифицирани стратегии за маскиране. За разлика от стандартното Masked Language Modeling (MLM), при което се маскират отделни токени, ERNIE 1.0 маскира цели семантични единици: същности (определени чрез NER) и фрази. За същност се маскира цялата последователност от токени с дадена вероятност . Този подход принуждава модела да се опира на по-широк контекст и да научава връзки между същностите.[1]
ERNIE 2.0 разви този подход, добавяйки инкрементално многозадачно обучение: задачи на лексикално, структурно и семантично ниво се добавят последователно, като вече научените знания се запазват благодарение на механизма за непрекъснато предобучение (continual pre‑training).[5]
Унифициран фреймуърк ERNIE 3.0
Фреймуъркът ERNIE 3.0 се основава на разделянето на архитектурата на две нива:[2][6]
- Universal Representation Module — общ многослоен Transformer‑XL, обучаван на разнообразие от предобучаващи задачи и извличащ общи лексикални и синтактични признаци. В версията Titan този модул съдържа 48 слоя, скрито представяне с размер 12288, 192 глави на внимание и вътрешен размер на feed‑forward мрежата 196608 ().
- Task‑specific Representation Modules — отделни модули за NLU (двупосочно внимание) и NLG (еднопосочно внимание с рекурентна памет Transformer‑XL), всеки с 12 слоя, размер на скрития вектор 768 и 12 глави на внимание.
Интеграцията на авто-енкодерната и авторегресивната парадигми позволява на един модел да осигурява високи показатели на NLU‑benchmark-ове (задачи от типа на BERT) и на NLG‑benchmark-ове (задачи от типа на GPT).[2]
Universal Knowledge‑Text Prediction (UKTP)
Задачата UKTP е централният механизъм за интеграция на знания в ERNIE 3.0/Titan. Моделът получава двойка (тройка от граф на знания, изречение от енциклопедия) и трябва или да предскаже отношението в тройката, използвайки текста, или да предскаже маскираните токени в текста, използвайки информацията от тройката.[6]
При предсказване на отношение в тройка , свързана с текст , задачата се формулира като многокласова класификация:
където е изходът на трансформера по позициите на упоменаванията на главната и опашната същност, са параметрите на класификатора, са параметрите на модела.[6]
Механизми за достоверна и управлявана генерация (Titan)
ERNIE 3.0 Titan въведе два допълнителни типа функции на загуба.[6]
Самосупервизиран adversarial loss. Формира се dataset , където са реални параграфи, а са текстове, генерирани от предишната версия на ERNIE по префикса на оригиналните параграфи. Задачата е бинарна класификация (оригинал / генерация) по скритото състояние на специалния токен [CLS]:
където е векторното представяне на [CLS] за ‑ия пример, е индикатор за принадлежност към оригиналните текстове.[6]
Controllable language modeling loss. Всеки обучаващ пример е придружен от набор от атрибути (prompt), описващи жанр, тема, ключови думи, тоналност и дължина. Загубата комбинира безусловно и условно езиково моделиране:
Failed to parse (unknown function "\begin{cases}"): {\displaystyle L_c(D_c) = \begin{cases} -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}), & ext{если } p \le 0{,}5,\\ -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}, ext{prompts}_n), & ext{если } p > 0{,}5, \end{cases}}
където е случайна величина за редуване на режимите, е ‑ият токен на ‑ия пример. Това определение предотвратява прекомерната зависимост на модела от prompt-овете.[6]
Хетерогенна MoE‑архитектура (ERNIE 4.5)
ERNIE 4.5 въвежда хетерогенна мултимодална архитектура Mixture-of-Experts с разделяне на експертите по модалности: текстови експерти и визуални експерти (последните имат около 1/3 от размера на текстовите). Маршрутизацията на токените се осъществява с изолация по модалност (modality‑isolated routing) и прилагане на ортогонализиращо наказание за маршрутизатора (router orthogonalization loss, коефициент от порядъка на ) за осигуряване на специализация на експертите. Използва се 3D RoPE (Rotary Position Embeddings) за позиционно кодиране на времевото, височинното и ширинното измерение във видео данните. Механизмът FlashMask се прилага за ефективна работа с дълъг контекст (до 131 хил. токена) с маски.[3]
Предобучението на ERNIE 4.5 се провежда на няколко етапа: първо обучение само върху текстови данни, след това върху визуални данни, и в заключителната фаза — съвместно обучение върху мултимодални данни (text‑only → vision‑only → joint). За обработка на изображения се използва адаптивен ViT‑енкодер (Vision Transformer) с механизъм pixel shuffle за изравняване на представянията на различните модалности. Поддържа се обработка на дълги видеа (до 32 хил. токена) с адаптивна извадка на кадри (adaptive frame sampling).[3]
Нативна омнимодалност (ERNIE 5.0)
ERNIE 5.0 реализира нативно авторегресивно моделиране на няколко модалности (текст, изображение, аудио, видео) в единна архитектура с ултра-разредена MoE (ultra‑sparse MoE), при която на всяка стъпка се активират по-малко от 3 % от общия брой експерти. Като предобучаваща задача се използва Next‑Group‑of‑Tokens Prediction — предсказване на група токени вместо един, което повишава ефективността на обучението. За аудио модалността се прилага йерархичен кодек (hierarchical codec). Технологията elastic training позволява генериране на суб-модели с различна дълбочина, ширина и степен на разреденост в рамките на един обучаващ цикъл.[4]
Предобучаващи задачи и данни
Задачи за предобучение на ERNIE 3.0 / Titan
В ERNIE 3.0 и Titan се използват следните групи предобучаващи задачи:[2][6]
Word‑aware задачи:
- Knowledge Masked Language Modeling — фразово и същностно маскиране за обучение на зависимости в локален и глобален контекст.
- Document Language Modeling — авторегресивно моделиране на документи с дължина до 512 токена и използване на рекурентна памет Transformer‑XL.
Structure‑aware задачи:
- Sentence Reordering — за параграф, произволно разделен на сегмента и разбъркан, моделът решава задача за ‑класова класификация с , възстановявайки оригиналния ред.
- Sentence Distance — 3‑класова класификация: съседни изречения, несъседни в същия документ, изречения от различни документи.
Knowledge‑aware задачи:
- Universal Knowledge‑Text Prediction (UKTP) — съвместно моделиране на текст и тройка от граф на знания.
- Credible and Controllable Generations — комбинация от adversarial loss и controllable LM loss.
Данни за предобучение
За ERNIE 3.0/Titan се използва ERNIE 3.0 Corpus — китайски корпус с обем около 4 ТБ в 11 категории, включващ уеб страници, логове от търсене, данни за въпроси и отговори, художествени, правни, финансови и медицински текстове, повести и поезия. Върху корпуса е изграден граф на знания с повече от 50 млн факта.[2][6]
Допълнително за Titan се формират:
- Adversarial dataset — 2 млн оригинални параграфа и съответните „негативни" параграфи, генерирани от ERNIE 3.0 по префикса на първите 1–3 изречения на оригинала, с дължина до 512 токена.
- Controllable dataset — текстове, снабдени с атрибути на жанр, тема (26 тематики), ключови думи, тоналност (positive/negative/neutral) и дължина. Атрибутите на жанра се кодират с обучаеми „меки prompt-ове" (броят на prompt-овете за жанра се избира произволно от 0 до 64).[6]
По-късните версии (ERNIE 4.5, 5.0) използват разширени мултимодални корпуси (текст, изображения, видео, аудио), включително куриран уеб контент, научни публикации и синтетични данни.[3][4]
Обучение и разпределена оптимизация
Предобучението на ERNIE 3.0 Titan се провеждаше с използване на оптимизатора Adam (скорост на обучение , , , L2‑регуляризация 0,1, изрязване на нормата на градиента до 1,0), максимална дължина на контекста 512 и дължина на рекурентната памет 128 за генеративни задачи. Прилагаше се прогресивна схема на обучение (ускорена сходимост в първите 4000 стъпки) и линейно затихване на скоростта на обучение.[6]
4D‑хибридна паралелизация
За обучение на плътния модел с 260 млрд параметра върху хетерогенни клъстери (GPU NVIDIA V100 и NPU Ascend 910) в PaddlePaddle е реализирана 4D‑хибридна паралелизация:[6]
- Data parallelism (DP) — репликиране на модела на множество устройства с отделна обработка на пакети.
- Tensor model parallelism (MP) — разделяне на параметрите и активациите на трансформера вътре в слоевете между устройствата.
- Pipeline model parallelism (PP) — разпределяне на слоевете на модела по конвейер.
- Group Sharded — усъвършенстван вариант на ZeRO‑подобен sharded‑data‑parallel за намаляване на дублирането на състоянията на оптимизатора.
В доклада са представени данни за слабо мащабиране до хиляди карти Ascend 910 с ефективност от порядъка на 91,7 % по пропускателна способност.[6]
Обучение на ERNIE 4.5
Обучението на ERNIE 4.5 се провеждаше в клъстер от 2016 GPU NVIDIA H800 с постигане на Model FLOPs Utilization (MFU) 47 %. Използвани бяха смесена точност FP8, отказоустойчиви контролни точки (Zero Cost Checkpoint, възстановяване за по-малко от 8 минути) и прогресивно обучение с увеличаване на дължината на последователността и размера на пакета.[3]
Онлайн дистилация
За намаляване на изискванията към изчислителни ресурси при разгръщане на ERNIE 3.0 Titan се използва онлайн дистилация, при която моделът-учител и няколко модела-студенти се обучават едновременно:[6]
- On‑the‑Fly Distillation (OFD) — логитите и представянията на учителя се използват за обучение на студентите на същите стъпки на обучение.
- Teacher assistants — модели с междинен размер, намаляващи разликата в капацитета между учителя и крайните студенти.
- Auxiliary Layer Distillation (ALD) — допълнителен слой в студента, отстраняван при fine‑tuning, за по-добро съвпадение на вътрешните представяния.
Следобучение и изравняване
Търговските версии на ERNIE (започвайки от ERNIE Bot) преминават етапи на следобучение:[7][3]
- Supervised Fine‑Tuning (SFT) — дообучение върху размечени инструкционни данни (в ERNIE 4.5 — 2,3 млн примера).
- Reinforcement Learning from Human Feedback (RLHF) — изравняване на поведението на модела с помощта на обратна връзка от човек; прилагат се алгоритмите PPO (Proximal Policy Optimization) и DPO (Direct Preference Optimization).
- Unified Preference Optimization (UPO) — унифициран метод за оптимизация на предпочитания, въведен в ERNIE 4.5.
- Reinforcement Learning with Verifiers (RLVR) — обучение с подкрепление с използване на верификатори за проверка на коректността на отговорите; прилага се методът GRPO (Group Relative Policy Optimization).
- Режими на разсъждение (thinking modes) — моделите 4.5 поддържат режими с размисъл (reflection, planning) и без него.
Ключови резултати и benchmark-ове
Обобщена таблица на еволюцията на моделите
| Версия | Година | Параметри | Архитектура | Ключови benchmark-ове | Източник |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 млн (base) | Transformer‑енкодер (подобен на BERT) | XNLI 78,4 %; MSRA‑NER F1 93,8 % | [1] |
| ERNIE 2.0 | 2019 | ~110–340 млн | Continual multi‑task | GLUE 80,6 (base) / 83,6 (large); 16 задачи SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 млрд | Unified Transformer‑XL (AE+AR) | SuperGLUE 90,6 % (> човешки ориентир 89,8 %); 54 кит. задачи SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 млрд (dense) | Dense + controllable generation | 68 dataset-а SOTA; zero/few‑shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 млрд (MoE, 47 млрд акт.) | Heterogeneous multimodal MoE | C‑Eval 90,6 %; MMLU 86,5 %; MMMU 67,3–70 % | [3] |
| ERNIE 5.0 | 2026 | ~2,4 трлн (ultra‑sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (топ‑10 глобално) | [4] |
Резултати на ERNIE 3.0 и Titan
ERNIE 3.0 (10 млрд параметра) на английския benchmark SuperGLUE постигна среден резултат 90,6, превъзхождащ човешкия ориентир (89,8) и показателите на GPT‑3, T5 и DeBERTa към момента на публикуване. ERNIE 3.0 Titan (260 млрд) беше оценяван върху 68 набора от данни, включително задачи за класификация, NLI, QA и генериране; авторите съобщават за превъзходство над предшестващите модели на всички 68 dataset-а. Тези резултати са данни от първоизточниците; независимото възпроизвеждане е описано в ограничен мащаб.[2][6]
Резултати на ERNIE 4.5
Според техническия доклад от 2025 година, ERNIE 4.5 (300B‑A47B, след следобучение) показва следните резултати на текстови и мултимодални benchmark-ове:[3]
| Benchmark | ERNIE‑4.5‑300B‑A47B | Условия |
|---|---|---|
| C‑Eval | 90,6 % | 5‑shot |
| CMMLU | 90,2 % | — |
| MMLU | 86,5 % | стандартен |
| IFEval | 88,0 % | instruction following |
| GSM8K | 91,8 % | — |
| MMMU | 67,3–70,0 % | non‑thinking / thinking |
| MathVista | 78,8 % | thinking mode |
| OCRBench | 883 | — |
Според данните от доклада, ERNIE 4.5 превъзхожда DeepSeek‑V3 на 22 от 28 benchmark-а; мултимодалните варианти (ERNIE‑4.5‑VL‑424B‑A47B) показаха конкурентни резултати на задачи за визуално разсъждение. При редица задачи за визуално разсъждение и техническа интерпретация на изображения (анализ на схеми, инженерни диаграми) се съобщават резултати по-добри от тези на отделни модели GPT и Gemini.[3][14]
Сравнение на ERNIE 4.5 с конкуренти (избрани benchmark-ове, след следобучение, по данни от техническия доклад от 2025 г.):
| Benchmark | ERNIE‑4.5‑300B‑A47B | DeepSeek‑V3‑671B‑A37B | Qwen3‑235B‑A22B | Бележка |
|---|---|---|---|---|
| C‑Eval | 90,6 % | — | — | 5‑shot |
| MMLU | 86,5 % | сравнимо | — | стандартен |
| IFEval | 88,0 % | — | 83,2 % | instruction following |
| MMMU | 67,3–70,0 % | — | — | thinking / non‑thinking |
| MathVista | 78,8 % | — | 77,6 % (Qwen2.5‑VL) | thinking mode |
Условия за възпроизвеждане: стандартни протоколи (5‑shot / zero‑shot); dataset-ите са отворени (C‑Eval 2023+, MMLU, MMMU). Тире („—") означава, че сравними данни при същите условия не са представени в доклада.[3]
Оценки на ERNIE Bot 4.0
Докладът SuperBench на Университета Цинхуа класира търговски LLM по набор от задачи (езиково разбиране, математика, програмиране, многозадачност). ERNIE Bot 4.0 зае първо място сред китайските модели, изпреварвайки GLM‑4 (Zhipu AI) с около 0,41 точки по интегрална метрика; моделите GPT‑4 и Anthropic Claude‑3 оставаха по-горе в глобалната класация. ERNIE Bot 4.0 показваше силни резултати в китайското разбиране на текст и следването на инструкции при по-слаби показатели в програмирането и някои англоезични задачи.[9][10]
Приложения
Продукти и услуги на Baidu
Моделите от серията ERNIE са интегрирани в екосистемата от продукти на Baidu:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — чат‑бот с поддръжка на мултимодална генерация (текст, изображения, видео, аудио). По данни на Baidu, броят на месечно активните потребители надхвърля 200 млн (2024–2025). От 2025 година ERNIE Bot е достъпен безплатно.[7]
- Търсачка Baidu — генериране на отговори и AI‑функции в резултатите от търсенето; по данни на Baidu, до 70 % от горните резултати са обогатени с AI‑компоненти.
- Qianfan (MaaS‑платформа) — API за корпоративни клиенти; по данни на Baidu, повече от 760 хил. предприятия използват платформата, а броят на дневните извиквания на API надхвърля 1,5 млрд (2024). Сред клиентите са Lenovo, Trip.com и други.[7]
- Comate — AI‑асистент за програмиране.
- Wenxin Yige — генериране на изображения на базата на моделите ERNIE‑ViLG.[11]
- Интеграции с външни партньори: Samsung Galaxy (за китайския пазар), цифрови аватари, плъгини (търсене, анализ на файлове).[7]
Отраслови приложения
Моделите се прилагат в следните области:[7][3]
- Системи за въпроси и отговори в домейн-специфични области (право, медицина, финанси) с използване на знание-усилено предобучение.
- Генериране и редактиране на текстове на китайски език (новини, маркетингови текстове, творческо съдържание).
- Мултимодални задачи: анализ на изображения, инженерни схеми, видео и таблични данни (във версии 4.5 и по-нови).
- Образование (персонализирано обучение), роботика (планиране на задачи), автономно шофиране (Apollo).
Отворен код
Започвайки от ERNIE 4.5, всички 10 варианта от семейството са публикувани под лицензия Apache 2.0 с инструментариум ERNIEKit (поддръжка на SFT, LoRA, DPO, инференс на PaddlePaddle/FastDeploy). Кодът на по-ранните версии (ERNIE 1.0–3.0) е достъпен в GitHub PaddlePaddle/ERNIE.[3][15]
Ограничения и открити проблеми
Архитектурни и dataset ограничения
ERNIE 3.0 Titan при 260 млрд параметра е ограничена до дължина на контекста от 512 токена за отделния модул, което ограничава моделирането на текстове с голяма дължина без допълнителни механизми (chunking, външна памет). Обучението се провежда предимно върху китайски корпус, което води до неравномерност на качеството между китайски и други езици.[6]
Интеграцията на граф на знания подобрява работата със структурирани факти, но точността и пълнотата на знанията са ограничени от качеството на самия граф и процедурата за съпоставяне „тройка–текст" (entity linking, relation alignment), което в редица случаи води до грешни или непълни асоциации.[6]
Халюцинации и достоверност
Adversarial loss и controllable LM loss подобряват устойчивостта срещу недостоверни генерации, но не успяват напълно да премахнат проблема с халюцинациите (генериране на фактически неверни твърдения). Параметрите на adversarial‑класификатора се обучават върху данни, при които „генерираният" текст е създаден от предишната версия на ERNIE, което ограничава спектъра на разпознаваните грешни шаблони.[6]
Социални предубеждения
Изследване, публикувано в PeerJ Computer Science (2025), анализира социалните предубеждения в китайски LLM (ERNIE и Qwen) с използване на 240 социални групи и повече от 30 хил. генерирани описания. Резултатите показват, че ERNIE генерира по-малко негативно и стереотипно съдържание от Baidu Search или Qwen (около 1/10 думи-кандидати с негативна конотация при ERNIE срещу 1/3 при Qwen). Въпреки това определена разпространеност на стереотипите, включително потенциално обидни описания, се запазва.[16][17]
Възпроизводимост
Част от моделите от серията (ERNIE 3.0 Titan, търговски ERNIE Bot 4.0 и 5.0) не са достъпни като напълно отворен код и тегла, което ограничава възпроизводимостта на benchmark-овете и възможността за независима оценка. С публикуването на ERNIE 4.5 под Apache 2.0 ситуацията се подобри, но архитектурите и настройките за обучение могат да се различават от описаните в ранните публикации.[3][6]
Медицинска безопасност
Изследвания на използването на ERNIE Bot в медицински сценарии (Si et al., 2025) разкриха тенденция към прекомерни назначения: 91,9 % ненужни изследвания и 57,8 % ненужни медикаменти в модели на сценарии, както и възрастови и социално-икономически диспропорции в препоръките.[18]
Етични и регулаторни аспекти
Моделите от серията ERNIE функционират в рамките на китайската регулация на генеративния AI, по-специално „Временните мерки за управление на генеративни AI услуги" (Interim Measures for Generative AI Services, 2023), които предвиждат задължителна оценка на безопасността, регистрация на алгоритми и ограничения върху съдържанието.[7][17]
ERNIE Bot демонстрира висока степен на отказ при заявки, свързани с чувствителни политически теми, в съответствие с националното законодателство. Изследвания (Pan et al., 2026) анализират политическата цензура в LLM от китайски произход, включително модели на Baidu.[19]
Публикациите на Baidu не винаги описват подробно процедурите за одит на поведението на модела, критериите за филтриране на съдържанието и баланса между местните нормативни изисквания и общите принципи на AI етика, което остава открита област за независими изследвания.[17]
Перспективи и направления за изследване
Въз основа на технически доклади и изявления на Baidu се очертават следните направления за развитие на серията ERNIE:
- По-нататъшна мултимодализация (текст–изображение–видео–аудио), включително обработка на плътни технически визуални данни (инженерни схеми, медицински изображения).[3][4]
- Комбиниране на плътни и MoE‑архитектури за баланс между качество и изчислителна ефективност при много големи общи размери на моделите.[3]
- Развитие на агентни системи (GenFlow, Famou) и инструменти за структурирана генерация (JSON, API‑извиквания) за интеграция в производствени работни потоци.[3]
- Повишаване на ефективността на обучението: elastic training, подобрено мащабиране на MoE (MFU), квантуване (W4A8, 2‑bit за разгръщане на единичен GPU).[3]
- Изследвания за намаляване на предубежденията в китайски LLM с отчитане на културно специфични аспекти и развитие на методики за benchmark-иране за китайски език и мултимодални задачи.[16][17]
- Подобряване на разсъждението в дълъг контекст, верифицируемо обучение с подкрепление (verifiable RL) и адаптация към домейни с ограничени данни чрез синтетични корпуси.[3][4]
Сравнение с други китайски LLM
ERNIE се конкурира с редица крупни китайски LLM, сред които Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) и Tongyi Qianwen. Основните отличия на серията ERNIE са акцентът върху интеграцията на графи на знания в предобучението (knowledge enhancement), тясната интеграция с екосистемата на Baidu (търсене, облак, API) и ориентацията към платформата PaddlePaddle. Според независими класации (SuperBench, LMArena), моделите от серията ERNIE заемат високи позиции сред китайските LLM, особено в задачи за разбиране и следване на инструкции на китайски език.[9][13][16]
Вижте също
- BERT
- Архитектура Transformer
- RLHF
Литература
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Бележки
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.