ERNIE (Baidu) (RO)
ERNIE (Baidu) — o serie de modele lingvistice pre-antrenate (Large Language Model, LLM) și modele fundamentale multimodale, dezvoltate de compania Baidu începând din 2019 sub denumirea generală Enhanced Representation through kNowledge IntEgration (reprezentare îmbunătățită prin integrarea cunoștințelor). Seria este orientată spre îmbunătățirea calității înțelegerii semantice și a generării prin integrarea explicită a cunoștințelor externe din grafuri de cunoștințe (Knowledge Graph, KG), ontologii și enciclopedii în procesul de pre-antrenare.[1][2]
Modelele seriei au evoluat de la variantele timpurii bazate pe BERT cu mascarea entităților și frazelor (ERNIE 1.0, 2.0), prin arhitecturi unificate la scară largă (ERNIE 3.0, ERNIE 3.0 Titan), până la sisteme multimodale bazate pe Mixture-of-Experts (MoE) cu cod sursă deschis (ERNIE 4.5) și modele omnimodale native (ERNIE 5.0). Seria suportă sarcini de înțelegere a textului (Natural Language Understanding, NLU), generare de text (Natural Language Generation, NLG) și, în versiunile mai recente, sarcini multimodale (text, imagine, video, audio), cu accent pe limba chineză și suport pentru multilingvism.[2][3][4]
Istoric și premise
Dezvoltarea seriei ERNIE a început în 2019 în divizia de cercetare a Baidu, ca răspuns la succesul modelului BERT (Devlin et al., 2018) și la necesitatea adaptării modelelor pre-antrenate pentru limba chineză, în care absența spațiilor explicite între cuvinte și ponderea ridicată a ideogramelor polisemantice complică captarea unităților semantice (entități, fraze).[1]
ERNIE 1.0 (2019)
Primul model al seriei (Sun et al., arXiv:1904.09223, aprilie 2019) a introdus o strategie de mascare ierarhică a cunoștințelor (knowledge masking) pentru o arhitectură de tip BERT: în loc de mascarea aleatorie a token-urilor individuale, modelul maschează entități și fraze întregi, identificate pe baza recunoașterii entităților denumite (Named Entity Recognition, NER) și a tiparelor frazeologice.[1]
Arhitectura ERNIE 1.0 este bazată pe un encoder Transformer (12 straturi, dimensiune ascunsă 768, 12 capete de atenție). S-a introdus suplimentar sarcina Dialogue Language Model (DLM) pentru antrenarea pe date de dialog. Modelul a fost antrenat pe ~173 milioane de propoziții chineze din corpusuri Wikipedia, Baidu Baike, știri și forumul Baidu Tieba. La momentul publicării, ERNIE 1.0 a atins rezultate state-of-the-art (SOTA) pe cinci sarcini NLP în limba chineză: XNLI (acuratețe 78,4% pe test față de 77,2% la BERT), MSRA-NER (F1 93,8% față de 92,6%).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412, iulie 2019; acceptată la conferința AAAI 2020) a introdus un framework de pre-antrenare multi-sarcină continuă (continual multi-task pre-training), în care noi sarcini de pre-antrenare sunt adăugate secvențial (incremental) unui transformer comun, fără re-antrenare completă a modelului.[5]
Sarcinile de pre-antrenare ale ERNIE 2.0 sunt împărțite în trei grupuri:
- Word-aware — mascarea cunoștințelor (knowledge masking), predicția majusculelor (capitalization prediction), relația token-document (token-document relation).
- Structure-aware — reordonarea propozițiilor (sentence reordering), determinarea distanței dintre propoziții (sentence distance).
- Semantic-aware — predicția relațiilor discursive (discourse relation prediction), relevanța pentru recuperarea informațiilor (IR relevance prediction).[5]
Modelul a fost antrenat pe corpusuri în engleză și chineză (enciclopedii, cărți, Reddit, jurnale de căutare). Rezultate: scorul mediu GLUE pentru modelul base a fost 80,6 (față de 78,3 la BERT), pentru modelul large — 83,6; ERNIE 2.0 a depășit BERT și XLNet pe 16 sarcini.[5]
ERNIE 3.0 (2021)
Framework-ul ERNIE 3.0 (Sun et al., arXiv:2107.02137, iulie 2021) a unificat paradigmele de pre-antrenare auto-encodere (auto-encoding, AE) și autoregresive (auto-regressive, AR) într-o singură arhitectură, împărțită într-un modul universal de reprezentări (Universal Representation Module) și module specifice sarcinilor (Task-specific Representation Modules) pentru NLU și NLG.[2]
Modelul cu 10 miliarde de parametri a fost antrenat pe 4 TB de text chinezesc (11 categorii: Baidu Baike, Wikipedia, jurnale de căutare, sisteme de întrebări și răspunsuri, texte de domeniu) și un graf de cunoștințe cu peste 50 de milioane de fapte. ERNIE 3.0 a atins SOTA pe 54 de sarcini NLP în limba chineză; pe benchmark-ul în engleză SuperGLUE — 90,6% (la data de 3 iulie 2021, peste pragul uman de referință de 89,8%).[2]
ERNIE 3.0 Titan (2021)
Lucrarea „ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, decembrie 2021) descrie scalarea framework-ului ERNIE 3.0 la un model dens (dense) cu 260 de miliarde de parametri, implementat pe platforma PaddlePaddle.[6]
Titan a introdus mecanisme suplimentare: o funcție de pierdere adversarială auto-supervizată pentru evaluarea credibilității textului generat, o funcție de pierdere controllable language modeling pentru controlul stilului, temei, tonului și lungimii generării, precum și distilarea online (On-the-Fly Distillation, OFD) pentru obținerea de modele-student compacte în cursul pre-antrenării. Modelul a fost evaluat pe 68 de seturi de date și, conform autorilor, a depășit modelele anterioare pe toate cele 68 de seturi de date.[6]
ERNIE Bot și versiunile comerciale (2023–2025)
În martie 2023, Baidu a lansat chatbot-ul ERNIE Bot (Wenxin Yiyan, 文心一言) bazat pe modelele ERNIE 3.x și PLATO (model de dialog). Accesul public a fost deschis în august 2023, după aprobarea autorităților de reglementare. Actualizările au inclus ERNIE 3.5 (iunie 2023) și ERNIE 4.0 (octombrie 2023).[7][8]
Conform raportului SuperBench al Universității Tsinghua, ERNIE Bot 4.0 a ocupat primul loc dintre LLM-urile chineze pe metrica integrală, demonstrând rezultate puternice în înțelegerea limbii chineze și urmărirea instrucțiunilor.[9][10]
În 2022, în paralel cu linia principală de modele lingvistice, a fost prezentat ERNIE-ViLG 2.0 (arXiv:2210.15257) — un model de generare a imaginilor din text (text-to-image), reprezentând unul dintre primii pași în direcția multimodalității.[11]
În 2024, la conferința WAVE SUMMIT, Baidu a prezentat ERNIE 4.0 Turbo — o versiune optimizată pentru aplicații de mare viteză, capabilă să genereze texte de peste o mie de cuvinte în aproximativ 20 de secunde, menținând calitatea.[12]
ERNIE 4.5 (2025)
În iunie 2025, Baidu a publicat raportul tehnic ERNIE 4.5, prezentând o familie de 10 modele: LLM-uri text și modele multimodale (Vision-Language, VL). Arhitectura este bazată pe un Mixture-of-Experts (MoE) eterogen cu separarea experților pe modalități. Variantele includ modele MoE cu până la 424 de miliarde de parametri totali și 47 de miliarde de parametri activi, precum și un model dens cu 0,3 miliarde de parametri. Familia este lansată sub licența Apache 2.0 pe Hugging Face și GitHub (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
În februarie 2026 a fost publicat raportul tehnic ERNIE 5.0 (arXiv:2602.04705) — un model autoregresiv omnimodal nativ cu MoE ultra-rar (ultra-sparse MoE), care suportă modelarea comună a textului, imaginilor, audio și video. Modelul ocupa poziții înalte pe clasamentul LMArena.[4][13]
Fundamente teoretice și principii arhitecturale
Mascarea cunoștințelor (Knowledge Masking)
Principiul cheie al modelelor timpurii din serie este integrarea cunoștințelor structurate în procesul de pre-antrenare prin strategii modificate de mascare. Spre deosebire de Masked Language Modeling (MLM) standard, unde sunt mascate token-uri individuale, ERNIE 1.0 maschează unități semantice întregi: entități (identificate prin NER) și fraze. Pentru entitatea este mascată întreaga secvență de token-uri cu probabilitatea . Această abordare obligă modelul să se bazeze pe un context mai larg și să învețe relațiile dintre entități.[1]
ERNIE 2.0 a dezvoltat această abordare, adăugând antrenarea multi-sarcină incrementală: sarcinile de nivel lexical, structural și semantic sunt adăugate secvențial, iar cunoștințele acumulate anterior sunt păstrate datorită mecanismului de pre-antrenare continuă (continual pre-training).[5]
Framework-ul unificat ERNIE 3.0
Framework-ul ERNIE 3.0 se bazează pe împărțirea arhitecturii în două niveluri:[2][6]
- Universal Representation Module — un Transformer-XL comun cu mai multe straturi, antrenat pe o varietate de sarcini de pre-antrenare și extragând trăsături lexicale și sintactice generale. În versiunea Titan, acest modul conține 48 de straturi, o reprezentare ascunsă de dimensiunea 12288, 192 de capete de atenție și o dimensiune internă a rețelei feed-forward de 196608 ().
- Task-specific Representation Modules — module separate pentru NLU (atenție bidirecțională) și NLG (atenție unidirecțională cu memorie recurentă Transformer-XL), fiecare cu 12 straturi, dimensiunea vectorului ascuns 768 și 12 capete de atenție.
Integrarea paradigmelor auto-encoder și autoregresive permite unui singur model să obțină performanțe ridicate atât pe benchmark-urile NLU (sarcini de tip BERT), cât și pe benchmark-urile NLG (sarcini de tip GPT).[2]
Universal Knowledge-Text Prediction (UKTP)
Sarcina UKTP reprezintă mecanismul central de integrare a cunoștințelor în ERNIE 3.0/Titan. Modelul primește o pereche (triplet din graful de cunoștințe, propoziție din enciclopedie) și trebuie fie să prezică relația din triplet folosind textul, fie să prezică token-urile mascate din text folosind informațiile din triplet.[6]
La predicția relației în tripletul , asociat cu textul , sarcina este formulată ca o clasificare multi-clasă:
unde — ieșirea transformerului pe pozițiile mențiunilor entităților cap și coadă, — parametrii clasificatorului, — parametrii modelului.[6]
Mecanisme de generare credibilă și controlabilă (Titan)
ERNIE 3.0 Titan a introdus două tipuri suplimentare de funcții de pierdere.[6]
Funcție de pierdere adversarială auto-supervizată. Se formează un set de date , unde — paragrafe reale, iar — texte generate de versiunea anterioară a ERNIE pe baza prefixului paragrafelor originale. Sarcina este clasificarea binară (original / generat) pe baza stării ascunse a token-ului special [CLS]:
unde — reprezentarea vectorială [CLS] pentru exemplul , — indicatorul de apartenență la textele originale.[6]
Funcție de pierdere controllable language modeling. Fiecare exemplu de antrenare este însoțit de un set de atribute (prompt) care descriu genul, tema, cuvintele cheie, tonul și lungimea. Pierderea combină modelarea lingvistică condiționată și necondiționată:
Failed to parse (unknown function "\begin{cases}"): {\displaystyle L_c(D_c) = \begin{cases} -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}), & ext{если } p \le 0{,}5,\\ -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}, ext{prompts}_n), & ext{если } p > 0{,}5, \end{cases}}
unde — variabilă aleatoare pentru alternarea modurilor, — token-ul al exemplului . Această definiție previne dependența excesivă a modelului de prompturi.[6]
Arhitectura MoE eterogenă (ERNIE 4.5)
ERNIE 4.5 introduce o arhitectură Mixture-of-Experts multimodală eterogenă cu separarea experților pe modalități: experți textuali și experți vizuali (aceștia din urmă având aproximativ 1/3 din dimensiunea celor textuali). Rutarea token-urilor se realizează cu izolare pe modalitate (modality-isolated routing) și aplicarea unei penalități de ortogonalizare pentru router (router orthogonalization loss, coeficient de ordinul ) pentru a asigura specializarea experților. Se utilizează 3D RoPE (Rotary Position Embeddings) pentru codificarea pozițională a dimensiunilor temporale, de înălțime și de lățime în datele video. Mecanismul FlashMask este aplicat pentru lucrul eficient cu context lung (până la 131 de mii de token-uri) cu măști .[3]
Pre-antrenarea ERNIE 4.5 se desfășoară în mai multe etape: mai întâi antrenarea exclusiv pe date text, apoi pe date vizuale, și în faza finală — antrenarea comună pe date multimodale (text-only → vision-only → joint). Pentru procesarea imaginilor se utilizează un encoder ViT (Vision Transformer) adaptiv cu un mecanism pixel shuffle pentru alinierea reprezentărilor diferitelor modalități. Se suportă procesarea videoclipurilor lungi (până la 32 de mii de token-uri) cu eșantionare adaptivă a cadrelor (adaptive frame sampling).[3]
Omnimodalitate nativă (ERNIE 5.0)
ERNIE 5.0 implementează modelarea autoregresivă nativă a mai multor modalități (text, imagine, audio, video) într-o singură arhitectură cu MoE ultra-rar, în care la fiecare pas sunt activate mai puțin de 3% din numărul total de experți. Ca sarcină de pre-antrenare se utilizează Next-Group-of-Tokens Prediction — predicția unui grup de token-uri în loc de unul singur, ceea ce sporește eficiența antrenării. Pentru modalitatea audio se aplică un codec ierarhic (hierarchical codec). Tehnologia elastic training permite generarea de sub-modele cu adâncime, lățime și grad de raritate variabile în cadrul unui singur proces de antrenare.[4]
Sarcini de pre-antrenare și date
Sarcinile de pre-antrenare ERNIE 3.0 / Titan
În ERNIE 3.0 și Titan sunt utilizate următoarele grupuri de sarcini de pre-antrenare:[2][6]
Sarcini Word-aware:
- Knowledge Masked Language Modeling — mascarea frazelor și entităților pentru antrenarea dependențelor pe contexte locale și globale.
- Document Language Modeling — modelarea autoregresivă a documentelor cu lungime de până la 512 token-uri și utilizarea memoriei recurente Transformer-XL.
Sarcini Structure-aware:
- Sentence Reordering — pentru un paragraf împărțit aleatoriu în segmente și amestecat, modelul rezolvă o sarcină de clasificare cu clase unde , restaurând ordinea originală.
- Sentence Distance — clasificare cu 3 clase: propoziții adiacente, neadiacente în același document, propoziții din documente diferite.
Sarcini Knowledge-aware:
- Universal Knowledge-Text Prediction (UKTP) — modelarea comună a textului și a tripletului din graful de cunoștințe.
- Credible and Controllable Generations — combinație de funcție de pierdere adversarială și funcție de pierdere controllable LM.
Date de pre-antrenare
Pentru ERNIE 3.0/Titan se utilizează ERNIE 3.0 Corpus — un corpus chinezesc de aproximativ 4 TB în 11 categorii, incluzând pagini web, jurnale de căutare, date de întrebări și răspunsuri, texte literare, juridice, financiare și medicale, romane și poezie. Pe baza corpusului este construit un graf de cunoștințe cu peste 50 de milioane de fapte.[2][6]
Suplimentar pentru Titan sunt formate:
- Setul de date adversarial — 2 milioane de paragrafe originale și paragrafele „negative" corespunzătoare, generate de ERNIE 3.0 pe baza prefixului primelor 1–3 propoziții ale originalului, cu lungime de până la 512 token-uri.
- Setul de date controlabil — texte însoțite de atribute de gen, temă (26 de tematici), cuvinte cheie, ton (pozitiv/negativ/neutru) și lungime. Atributele de gen sunt codificate prin „prompt-uri moi" antrenabile (numărul de prompt-uri pentru gen este ales aleatoriu între 0 și 64).[6]
Versiunile mai recente (ERNIE 4.5, 5.0) utilizează corpusuri multimodale extinse (text, imagini, video, audio), inclusiv conținut web curatorizat, publicații științifice și date sintetice.[3][4]
Antrenare și optimizare distribuită
Pre-antrenarea ERNIE 3.0 Titan s-a desfășurat utilizând optimizatorul Adam (rata de învățare , , , regularizare L2 de 0,1, tăierea normei gradientului la 1,0), lungimea maximă a contextului de 512 și lungimea memoriei recurente de 128 pentru sarcinile generative. S-a aplicat o schemă de antrenare progresivă (convergență accelerată în primii 4000 de pași) și o descreștere liniară a ratei de învățare.[6]
Paralelizare hibridă 4D
Pentru antrenarea modelului dens cu 260 de miliarde de parametri pe clustere eterogene (GPU NVIDIA V100 și NPU Ascend 910), în PaddlePaddle a fost implementată paralelizarea hibridă 4D:[6]
- Paralelism de date (DP) — replicarea modelului pe mai multe dispozitive cu procesarea separată a batch-urilor.
- Paralelism tensor al modelului (MP) — împărțirea parametrilor și activărilor transformerului în interiorul straturilor pe dispozitive.
- Paralelism de conductă al modelului (PP) — distribuirea straturilor modelului pe o conductă.
- Group Sharded — o variantă îmbunătățită a paralelismului date shard de tip ZeRO pentru reducerea duplicării stărilor optimizatorului.
În raport sunt prezentate date privind scalarea slabă la mii de carduri Ascend 910 cu o eficiență de aproximativ 91,7% în ceea ce privește debitul.[6]
Antrenarea ERNIE 4.5
Antrenarea ERNIE 4.5 s-a desfășurat pe un cluster de 2016 GPU NVIDIA H800, atingând o utilizare Model FLOPs (MFU) de 47%. S-au utilizat precizie mixtă FP8, puncte de control tolerante la erori (Zero Cost Checkpoint, recuperare în mai puțin de 8 minute) și antrenare progresivă cu creșterea lungimii secvenței și a dimensiunii batch-ului.[3]
Distilare online
Pentru reducerea cerințelor de resurse de calcul la implementarea ERNIE 3.0 Titan se utilizează distilarea online, în care modelul-profesor și mai multe modele-student sunt antrenate simultan:[6]
- On-the-Fly Distillation (OFD) — logit-urile și reprezentările profesorului sunt utilizate pentru antrenarea studenților pe aceiași pași de antrenare.
- Asistenți profesor — modele de dimensiune intermediară care reduc decalajul de capacitate dintre profesor și studenții finali.
- Auxiliary Layer Distillation (ALD) — un strat suplimentar în student, eliminat la fine-tuning, pentru o mai bună potrivire a reprezentărilor interne.
Post-antrenare și aliniere
Versiunile comerciale ale ERNIE (începând cu ERNIE Bot) parcurg etape de post-antrenare:[7][3]
- Supervised Fine-Tuning (SFT) — ajustare fină pe date de instrucțiuni etichetate (în ERNIE 4.5 — 2,3 milioane de exemple).
- Reinforcement Learning from Human Feedback (RLHF) — alinierea comportamentului modelului cu ajutorul feedback-ului uman; se aplică algoritmii PPO (Proximal Policy Optimization) și DPO (Direct Preference Optimization).
- Unified Preference Optimization (UPO) — metodă unificată de optimizare a preferințelor, introdusă în ERNIE 4.5.
- Reinforcement Learning with Verifiers (RLVR) — învățare prin consolidare cu utilizarea verificatorilor pentru verificarea corectitudinii răspunsurilor; se aplică metoda GRPO (Group Relative Policy Optimization).
- Moduri de raționament (thinking modes) — modelele 4.5 suportă moduri cu reflecție (reflection, planning) și fără aceasta.
Rezultate cheie și benchmark-uri
Tabel rezumativ al evoluției modelelor
| Versiune | An | Parametri | Arhitectură | Benchmark-uri cheie | Sursă |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 mln (base) | Encoder Transformer (similar BERT) | XNLI 78,4%; MSRA-NER F1 93,8% | [1] |
| ERNIE 2.0 | 2019 | ~110–340 mln | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 sarcini SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 mld | Unified Transformer-XL (AE+AR) | SuperGLUE 90,6% (> uman 89,8%); 54 sarcini chineze SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 mld (dens) | Dense + generare controlabilă | 68 seturi de date SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 mld (MoE, 47 mld act.) | MoE multimodal eterogen | C-Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% | [3] |
| ERNIE 5.0 | 2026 | ~2,4 trl (ultra-sparse MoE) | MoE multimodal autoregresiv unificat | LMArena Elo ~1460 (top-10 global) | [4] |
Rezultatele ERNIE 3.0 și Titan
ERNIE 3.0 (10 miliarde de parametri) pe benchmark-ul în engleză SuperGLUE a atins un scor mediu de 90,6, depășind pragul uman de referință (89,8) și rezultatele GPT-3, T5 și DeBERTa la momentul publicării. ERNIE 3.0 Titan (260 de miliarde) a fost evaluat pe 68 de seturi de date, inclusiv sarcini de clasificare, NLI, QA și generare; autorii raportează superioritate față de modelele anterioare pe toate cele 68 de seturi de date. Aceste rezultate provin din sursele primare; reproducerea independentă este descrisă în mod limitat.[2][6]
Rezultatele ERNIE 4.5
Conform raportului tehnic din 2025, ERNIE 4.5 (300B-A47B, post-antrenare) obține următoarele rezultate pe benchmark-urile text și multimodale:[3]
| Benchmark | ERNIE-4.5-300B-A47B | Condiții |
|---|---|---|
| C-Eval | 90,6% | 5-shot |
| CMMLU | 90,2% | — |
| MMLU | 86,5% | standard |
| IFEval | 88,0% | instruction following |
| GSM8K | 91,8% | — |
| MMMU | 67,3–70,0% | non-thinking / thinking |
| MathVista | 78,8% | thinking mode |
| OCRBench | 883 | — |
Conform raportului, ERNIE 4.5 a depășit DeepSeek-V3 pe 22 din 28 de benchmark-uri; variantele multimodale (ERNIE-4.5-VL-424B-A47B) au obținut rezultate competitive pe sarcinile de raționament vizual. Pe unele sarcini de raționament vizual și interpretare tehnică a imaginilor (analiza schemelor, diagramelor inginerești) sunt raportate rezultate superioare față de anumite modele GPT și Gemini.[3][14]
Comparație ERNIE 4.5 cu concurenții (benchmark-uri selective, post-antrenare, conform raportului tehnic din 2025):
| Benchmark | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Notă |
|---|---|---|---|---|
| C-Eval | 90,6% | — | — | 5-shot |
| MMLU | 86,5% | comparabil | — | standard |
| IFEval | 88,0% | — | 83,2% | instruction following |
| MMMU | 67,3–70,0% | — | — | thinking / non-thinking |
| MathVista | 78,8% | — | 77,6% (Qwen2.5-VL) | thinking mode |
Condiții de reproducere: protocoale standard (5-shot / zero-shot); seturi de date deschise (C-Eval 2023+, MMLU, MMMU). Linia („—") indică faptul că date comparabile în aceleași condiții nu sunt prezentate în raport.[3]
Evaluări ERNIE Bot 4.0
Raportul SuperBench al Universității Tsinghua clasifică LLM-urile comerciale pe un set de sarcini (înțelegerea limbii, matematică, programare, multitasking). ERNIE Bot 4.0 a ocupat primul loc dintre modelele chineze, depășind GLM-4 (Zhipu AI) cu aproximativ 0,41 puncte pe metrica integrală; modelele GPT-4 și Anthropic Claude-3 rămâneau mai sus în clasamentul global. ERNIE Bot 4.0 demonstra rezultate puternice în înțelegerea textului în limba chineză și urmărirea instrucțiunilor, cu performanțe mai slabe la programare și unele sarcini în engleză.[9][10]
Aplicații
Produse și servicii Baidu
Modelele seriei ERNIE sunt integrate în ecosistemul de produse Baidu:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — chatbot cu suport pentru generare multimodală (text, imagini, video, audio). Conform datelor Baidu, numărul utilizatorilor activi lunari depășește 200 de milioane (2024–2025). Din 2025, ERNIE Bot este disponibil gratuit.[7]
- Căutarea Baidu — generarea răspunsurilor și funcții AI în rezultatele căutării; conform datelor Baidu, până la 70% din rezultatele de top sunt îmbogățite cu componente AI.
- Qianfan (platforma MaaS) — API pentru clienți corporativi; conform datelor Baidu, peste 760 de mii de companii utilizează platforma, numărul apelurilor API zilnice depășind 1,5 miliarde (2024). Printre clienți se numără Lenovo, Trip.com și alții.[7]
- Comate — asistent AI pentru programare.
- Wenxin Yige — generare de imagini bazată pe modelele ERNIE-ViLG.[11]
- Integrări cu parteneri externi: Samsung Galaxy (pentru piața chineză), avataruri digitale, plugin-uri (căutare, analiză de fișiere).[7]
Aplicații în domenii specifice
Modelele sunt utilizate în următoarele domenii:[7][3]
- Sisteme de întrebări și răspunsuri în domenii specifice (drept, medicină, finanțe) cu utilizarea pre-antrenării îmbunătățite cu cunoștințe.
- Generarea și editarea textelor în limba chineză (știri, texte de marketing, conținut creativ).
- Sarcini multimodale: analiza imaginilor, schemelor inginerești, videoclipurilor și datelor tabelare (în versiunile 4.5 și ulterioare).
- Educație (învățare personalizată), robotică (planificarea sarcinilor), conducere autonomă (Apollo).
Cod sursă deschis
Începând cu ERNIE 4.5, toate cele 10 variante ale familiei au fost lansate sub licența Apache 2.0 cu instrumentarul ERNIEKit (suport pentru SFT, LoRA, DPO, inferență pe PaddlePaddle/FastDeploy). Codul versiunilor anterioare (ERNIE 1.0–3.0) este disponibil pe GitHub PaddlePaddle/ERNIE.[3][15]
Limitări și probleme deschise
Limitări arhitecturale și ale seturilor de date
ERNIE 3.0 Titan, cu 260 de miliarde de parametri, este limitată la o lungime de context de 512 token-uri pentru un modul individual, ceea ce restricționează modelarea textelor de lungime mare fără mecanisme suplimentare (chunking, memorie externă). Antrenarea se desfășoară predominant pe corpusuri chineze, ceea ce conduce la o neomogenitate a calității între limba chineză și alte limbi.[6]
Integrarea grafului de cunoștințe îmbunătățește lucrul cu fapte structurate, însă acuratețea și completitudinea cunoștințelor sunt limitate de calitatea grafului însuși și de procedura de aliniere „triplet–text" (entity linking, relation alignment), ceea ce în unele cazuri conduce la asocieri eronate sau incomplete.[6]
Halucinații și credibilitate
Funcția de pierdere adversarială și funcția de pierdere controllable LM îmbunătățesc robustețea față de generările necredibile, însă nu reușesc să elimine complet problema halucinațiilor (generarea de afirmații factual incorecte). Parametrii clasificatorului adversarial sunt antrenați pe date în care textul „generat" este creat de versiunea anterioară a ERNIE, ceea ce limitează spectrul de tipare eronate recunoscute.[6]
Prejudecăți sociale
Un studiu publicat în PeerJ Computer Science (2025) analizează prejudecățile sociale în LLM-urile chineze (ERNIE și Qwen) utilizând 240 de grupuri sociale și peste 30 de mii de descrieri generate. Rezultatele arată că ERNIE generează mai puțin conținut negativ și stereotip decât Baidu Search sau Qwen (aproximativ 1/10 din cuvintele-candidat cu conotație negativă la ERNIE față de 1/3 la Qwen). Cu toate acestea, o anumită prevalență a stereotipurilor, inclusiv descrieri potențial ofensatoare, persistă.[16][17]
Reproductibilitate
O parte din modelele seriei (ERNIE 3.0 Titan, versiunile comerciale ERNIE Bot 4.0 și 5.0) nu este disponibilă sub formă de cod sursă complet deschis și ponderi, ceea ce limitează reproductibilitatea benchmark-urilor și posibilitatea evaluării independente. Odată cu lansarea ERNIE 4.5 sub Apache 2.0, situația s-a îmbunătățit, însă arhitecturile și setările de antrenare pot diferi față de cele descrise în publicațiile anterioare.[3][6]
Siguranța medicală
Studiile privind utilizarea ERNIE Bot în scenarii medicale (Si et al., 2025) au identificat o tendință spre prescripții excesive: 91,9% din testele inutile și 57,8% din medicamentele inutile în scenariile modelate, precum și disparități legate de vârstă și nivel socioeconomic în recomandări.[18]
Aspecte etice și de reglementare
Modelele seriei ERNIE funcționează în cadrul reglementărilor chineze privind AI generativ, în special „Măsurile provizorii pentru gestionarea serviciilor AI generative" (Interim Measures for Generative AI Services, 2023), care prevăd evaluarea obligatorie a siguranței, înregistrarea algoritmilor și restricții privind conținutul.[7][17]
ERNIE Bot demonstrează un nivel ridicat de refuz la solicitările legate de subiecte politice sensibile, în conformitate cu legislația națională. Studiile (Pan et al., 2026) analizează cenzura politică în LLM-urile de origine chineză, inclusiv modelele Baidu.[19]
Publicațiile Baidu nu descriu întotdeauna în detaliu procedurile de audit al comportamentului modelului, criteriile de filtrare a conținutului și echilibrul dintre cerințele normative locale și principiile generale ale eticii AI, ceea ce rămâne un domeniu deschis pentru cercetări independente.[17]
Perspective și direcții de cercetare
Pe baza rapoartelor tehnice și a declarațiilor Baidu, sunt identificate următoarele direcții de dezvoltare ale seriei ERNIE:
- Extinderea multimodalității (text–imagine–video–audio), inclusiv procesarea datelor vizuale tehnice dense (scheme inginerești, imagini medicale).[3][4]
- Combinarea arhitecturilor dense și MoE pentru echilibrarea calității și eficienței computaționale la dimensiuni totale ale modelelor foarte mari.[3]
- Dezvoltarea sistemelor agentice (GenFlow, Famou) și a instrumentelor de generare structurată (JSON, apeluri API) pentru integrarea în fluxuri de producție.[3]
- Creșterea eficienței antrenării: elastic training, scalare MoE îmbunătățită (MFU), cuantizare (W4A8, 2-bit pentru implementare pe un singur GPU).[3]
- Cercetări privind reducerea prejudecăților în LLM-urile chineze, ținând cont de aspectele culturale specifice, și dezvoltarea metodologiilor de benchmark pentru limba chineză și sarcinile multimodale.[16][17]
- Îmbunătățirea raționamentului în context lung, învățare prin consolidare verificabilă (verifiable RL) și adaptarea la domenii cu date limitate prin corpusuri sintetice.[3][4]
Comparație cu alte LLM-uri chineze
ERNIE concurează cu o serie de LLM-uri chineze importante, printre care Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) și Tongyi Qianwen. Principalele caracteristici distinctive ale seriei ERNIE sunt accentul pus pe integrarea grafurilor de cunoștințe în pre-antrenare (knowledge enhancement), integrarea strânsă cu ecosistemul Baidu (căutare, cloud, API) și orientarea spre platforma PaddlePaddle. Conform clasamentelor independente (SuperBench, LMArena), modelele seriei ERNIE ocupă poziții înalte printre LLM-urile chineze, în special în sarcinile de înțelegere și urmărire a instrucțiunilor în limba chineză.[9][13][16]
Vezi și
- BERT
- Arhitectura Transformer
- RLHF
Bibliografie
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.