ERNIE (Baidu) (SV)
ERNIE (Baidu) — en serie förtränade språkmodeller (Large Language Model, LLM) och multimodala grundmodeller som utvecklats av Baidu sedan 2019 under det gemensamma namnet Enhanced Representation through kNowledge IntEgration (förstärkt representation genom kunskapsintegration). Serien är inriktad på att förbättra kvaliteten på semantisk förståelse och generering genom explicit integration av extern kunskap från kunskapsgrafer (Knowledge Graph, KG), ontologier och encyklopedier i förträningsprocessen.[1][2]
Modellerna i serien har utvecklats från tidiga BERT-baserade varianter med maskering av entiteter och fraser (ERNIE 1.0, 2.0) via storskaliga enhetliga arkitekturer (ERNIE 3.0, ERNIE 3.0 Titan) till multimodala system baserade på Mixture-of-Experts (MoE) med öppen källkod (ERNIE 4.5) och nativa omnimodala modeller (ERNIE 5.0). Serien stöder uppgifter inom textförståelse (Natural Language Understanding, NLU), textgenerering (Natural Language Generation, NLG) och, i senare versioner, multimodala uppgifter (text, bild, video, ljud), med fokus på kinesiska och stöd för flerspråkighet.[2][3][4]
Historia och bakgrund
Utvecklingen av ERNIE-serien inleddes 2019 vid Baidus forskningsavdelning som svar på framgångarna med modellen BERT (Devlin et al., 2018) och behovet av att anpassa förtränade modeller till kinesiska, där avsaknaden av tydliga ordmellanrum och den höga andelen flertydiga skrifttecken försvårar fångst av semantiska enheter (entiteter, fraser).[1]
ERNIE 1.0 (2019)
Seriens första modell (Sun et al., arXiv:1904.09223, april 2019) introducerade en strategi för flernivåmaskering av kunskap (knowledge masking) för en BERT-liknande arkitektur: istället för slumpmässig maskering av enskilda token maskerar modellen hela entiteter och fraser, identifierade med hjälp av igenkänning av namngivna entiteter (Named Entity Recognition, NER) och frasmönster.[1]
ERNIE 1.0:s arkitektur bygger på en Transformer-enkoder (12 lager, dold dimension 768, 12 uppmärksamhetshuvuden). Dessutom introducerades uppgiften Dialogue Language Model (DLM) för träning på dialogdata. Modellen träinades på ~173 miljoner kinesiska meningar från korpusar som Wikipedia, Baidu Baike, nyheter och forumet Baidu Tieba. Vid publiceringen uppnådde ERNIE 1.0 state-of-the-art (SOTA)-resultat på fem kinesiska NLP-uppgifter: XNLI (noggrannhet 78,4 % på test mot 77,2 % för BERT), MSRA-NER (F1 93,8 % mot 92,6 %).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412, juli 2019; antagen till konferensen AAAI 2020) introducerade ett ramverk för kontinuerlig multitask-förträning (continual multi-task pre-training), där nya förträningsuppgifter sekventiellt (inkrementellt) läggs till den gemensamma transformern utan att modellen tränas om helt från grunden.[5]
Förträningsuppgifterna i ERNIE 2.0 är indelade i tre grupper:
- Word-aware — kunskapsmaskering (knowledge masking), prediktion av versalisering (capitalization prediction), token-dokumentrelation (token-document relation).
- Structure-aware — omordning av meningar (sentence reordering), bestämning av avstånd mellan meningar (sentence distance).
- Semantic-aware — prediktion av diskursrelationer (discourse relation prediction), relevansprediktion för informationssökning (IR relevance prediction).[5]
Modellen träinades på engelska och kinesiska korpusar (encyklopedier, böcker, Reddit, sökloggar). Resultat: genomsnittligt GLUE-poäng för base-modellen var 80,6 (mot 78,3 för BERT), för large-modellen — 83,6; ERNIE 2.0 överträffade BERT och XLNet på 16 uppgifter.[5]
ERNIE 3.0 (2021)
Ramverket ERNIE 3.0 (Sun et al., arXiv:2107.02137, juli 2021) kombinerade autoenkodande (auto-encoding, AE) och autoregressive (auto-regressive, AR) förträningsparadigm i en enhetlig arkitektur, uppdelad i en universell representationsmodul (Universal Representation Module) och uppgiftsspecifika moduler (Task-specific Representation Modules) för NLU och NLG.[2]
Modellen med 10 miljarder parametrar träinades på 4 TB kinesisk text (11 kategorier: Baidu Baike, Wikipedia, sökloggar, fråge- och svarssystem, domänspecifika texter) och en kunskapsgraf med mer än 50 miljoner fakta. ERNIE 3.0 uppnådde SOTA på 54 kinesiska NLP-uppgifter; på det engelskspråkiga riktmärket SuperGLUE — 90,6 % (per den 3 juli 2021, över det mänskliga referensvärdet 89,8 %).[2]
ERNIE 3.0 Titan (2021)
I artikeln "ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, december 2021) beskrivs en uppskalning av ERNIE 3.0-ramverket till en tät (dense) modell med 260 miljarder parametrar, implementerad på plattformen PaddlePaddle.[6]
Titan introducerade ytterligare mekanismer: en självövervakad adversarial loss för bedömning av tillförlitligheten hos genererad text, en controllable language modeling loss för styrning av stil, ämne, ton och genereringslängd, samt online-destillering (On-the-Fly Distillation, OFD) för att erhålla kompakta studentmodeller under förträningen. Modellen utvärderades på 68 datamängder och, enligt författarna, överträffade föregående modeller på samtliga 68 datamängder.[6]
ERNIE Bot och kommersiella versioner (2023–2025)
I mars 2023 lanserade Baidu chattboten ERNIE Bot (Wenxin Yiyan, 文心一言) baserad på ERNIE 3.x-modellerna och PLATO (en dialogmodell). Allmän tillgång öppnades i augusti 2023 efter regulatorernas godkännande. Uppdateringar inkluderade ERNIE 3.5 (juni 2023) och ERNIE 4.0 (oktober 2023).[7][8]
Enligt rapporten SuperBench från Tsinghua University intog ERNIE Bot 4.0 förstaplatsen bland kinesiska LLM:er utifrån ett integrerat mått, med starka resultat inom kinesisk språkförståelse och instruktionsföljning.[9][10]
År 2022 presenterades parallellt med den huvudsakliga språkserien en multimodal utvidgning, ERNIE-ViLG 2.0 (arXiv:2210.15257) — en modell för generering av bilder från text (text-to-image), vilket var ett av de första stegen mot multimodalitet.[11]
Vid konferensen WAVE SUMMIT 2024 presenterade Baidu ERNIE 4.0 Turbo — en optimerad version för höghastighetstillämpningar, kapabel att generera text på över tusen ord på ungefär 20 sekunder med bibehållen kvalitet.[12]
ERNIE 4.5 (2025)
I juni 2025 publicerade Baidu den tekniska rapporten för ERNIE 4.5, som presenterar en familj av 10 modeller: text-LLM:er och multimodala modeller (Vision-Language, VL). Arkitekturen bygger på en heterogen Mixture-of-Experts (MoE) med uppdelning av experter per modalitet. Varianterna inkluderar MoE-modeller med upp till 424 miljarder totala och 47 miljarder aktiva parametrar, samt en tät modell med 0,3 miljarder parametrar. Familjen har släppts under Apache 2.0-licensen på Hugging Face och GitHub (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
I februari 2026 publicerades den tekniska rapporten för ERNIE 5.0 (arXiv:2602.04705) — en nativ omnimodal autoregressive modell med ultraglest MoE (ultra-sparse MoE), som stöder gemensam modellering av text, bilder, ljud och video. Modellen intog höga positioner på LMArena-ranglistan.[4][13]
Teoretiska grunder och arkitekturella principer
Kunskapsmaskering (Knowledge Masking)
Det grundläggande principen i seriens tidiga modeller är integrationen av strukturerad kunskap i förträningsprocessen via modifierade maskeringsstrategier. Till skillnad från standardmetoden Masked Language Modeling (MLM), där enskilda token maskeras, maskerar ERNIE 1.0 hela semantiska enheter: entiteter (identifierade via NER) och fraser. För en entitet maskeras hela tokenföljden med en given sannolikhet . Detta tillvägagångssätt tvingar modellen att förlita sig på ett bredare sammanhang och lära sig sambanden mellan entiteter.[1]
ERNIE 2.0 vidareutvecklade detta tillvägagångssätt genom att lägga till inkrementell multitask-träning: uppgifter på lexikal, strukturell och semantisk nivå läggs till sekventiellt, medan tidigare inlärd kunskap bevaras tack vare mekanismen för kontinuerlig förträning (continual pre-training).[5]
Enhetligt ramverk ERNIE 3.0
Ramverket ERNIE 3.0 bygger på en uppdelning av arkitekturen i två nivåer:[2][6]
- Universal Representation Module — en gemensam flerskiktad Transformer-XL, tränad på en mångfald förträningsuppgifter och som extraherar gemensamma lexikala och syntaktiska egenskaper. I Titan-versionen innehåller denna modul 48 lager, en dold representation med storlek 12288, 192 uppmärksamhetshuvuden och en intern feed-forward-nätverksstorlek på 196608 ().
- Task-specific Representation Modules — separata moduler för NLU (dubbelriktat uppmärksamhet) och NLG (enkelriktat uppmärksamhet med återkommande minne i Transformer-XL), vardera med 12 lager, en dold vektorstorlek på 768 och 12 uppmärksamhetshuvuden.
Integrationen av autoenkodande och autoregressive paradigm gör att en och samma modell kan uppnå höga resultat på NLU-riktmärken (BERT-liknande uppgifter) och NLG-riktmärken (GPT-liknande uppgifter).[2]
Universal Knowledge-Text Prediction (UKTP)
UKTP-uppgiften är den centrala mekanismen för kunskapsintegration i ERNIE 3.0/Titan. Modellen tar emot ett par (en tripel från kunskapsgrafen, en mening från en encyklopedi) och ska antingen prediktera relationen i tripletten med hjälp av texten, eller prediktera maskerade token i texten med hjälp av information från tripletten.[6]
Vid prediktion av relationen i tripletten , kopplad till texten , formuleras uppgiften som multiklassklassificering:
där är transformerns utdata för positionerna för omnämnandena av huvud- och svansenheten, är klassificerarens parametrar, är modellens parametrar.[6]
Mekanismer för tillförlitlig och styrd generering (Titan)
ERNIE 3.0 Titan introducerade två ytterligare typer av förlustfunktioner.[6]
Självövervakad adversarial loss. En datamängd konstrueras, där är verkliga stycken och är texter genererade av en tidigare version av ERNIE utifrån ett prefix av de ursprungliga styckena. Uppgiften är binär klassificering (original / genererat) baserat på det dolda tillståndet hos den speciella token [CLS]:
där är vektorn för [CLS] för det :e exemplet, är indikatorn för tillhörighet till originaltexterna.[6]
Controllable language modeling loss. Varje träningsexempel åtföljs av en uppsättning attribut (prompt) som beskriver genre, ämne, nyckelord, ton och längd. Förlusten kombinerar ovillkorlig och villkorlig språkmodellering:
där är en slumpvariabel för omväxling mellan lägena, är den :e token i det :e exemplet. Denna definition förhindrar att modellen blir alltför beroende av promptar.[6]
Heterogen MoE-arkitektur (ERNIE 4.5)
ERNIE 4.5 introducerar en heterogen multimodal Mixture-of-Experts-arkitektur med uppdelning av experter per modalitet: textexperter och visuella experter (de senare har ungefär 1/3 av textexperternas storlek). Routing av token sker med modalitetsisolering (modality-isolated routing) och tillämpning av ett ortogonaliseringsstraff för routern (router orthogonalization loss, koefficient av storleksordningen ) för att säkerställa expertspecialisering. 3D RoPE (Rotary Position Embeddings) används för positionskodning av de temporala, höjdmässiga och breddmässiga dimensionerna i videodata. Mekanismen FlashMask tillämpas för effektiv hantering av lång kontext (upp till 131 000 token) med masker.[3]
Förträningen av ERNIE 4.5 genomförs i flera steg: först träning enbart på textdata, sedan på visuell data, och i den avslutande fasen — gemensam träning på multimodal data (text-only → vision-only → joint). För bildbehandling används en adaptiv ViT-enkoder (Vision Transformer) med en pixel shuffle-mekanism för att anpassa representationer av olika modaliteter. Hantering av långa videor stöds (upp till 32 000 token) med adaptiv bildrutesampling (adaptive frame sampling).[3]
Nativ omnimodalitet (ERNIE 5.0)
ERNIE 5.0 implementerar nativ autoregressive modellering av flera modaliteter (text, bild, ljud, video) i en enhetlig arkitektur med ultraglest MoE, där mindre än 3 % av det totala antalet experter aktiveras vid varje steg. Som förträningsuppgift används Next-Group-of-Tokens Prediction — prediktion av en grupp token istället för en enda, vilket ökar träningseffektiviteten. För ljudmodaliteten används en hierarkisk kodek (hierarchical codec). Tekniken elastic training gör det möjligt att generera delmodeller med varierande djup, bredd och gleshetsgrad inom ett och samma träningskörning.[4]
Förträningsuppgifter och data
Förträningsuppgifter för ERNIE 3.0 / Titan
I ERNIE 3.0 och Titan används följande grupper av förträningsuppgifter:[2][6]
Word-aware-uppgifter:
- Knowledge Masked Language Modeling — fras- och entitetsmaskering för inlärning av beroenden i lokala och globala sammanhang.
- Document Language Modeling — autoregressive modellering av dokument med längd upp till 512 token och användning av återkommande minne i Transformer-XL.
Structure-aware-uppgifter:
- Sentence Reordering — för ett stycke som slumpmässigt delats i segment och blandats löser modellen en -klassklassificeringsuppgift med och återställer den ursprungliga ordningen.
- Sentence Distance — 3-klassklassificering: angränsande meningar, icke-angränsande meningar i samma dokument, meningar från olika dokument.
Knowledge-aware-uppgifter:
- Universal Knowledge-Text Prediction (UKTP) — gemensam modellering av text och triplar från kunskapsgrafen.
- Credible and Controllable Generations — kombination av adversarial loss och controllable LM loss.
Förträningsdata
För ERNIE 3.0/Titan används ERNIE 3.0 Corpus — ett kinesiskt korpus på cirka 4 TB i 11 kategorier, som inkluderar webbsidor, sökloggar, fråge- och svarsdata, skönlitterära, juridiska, finansiella och medicinska texter, noveller och poesi. Ovanpå korpuset har en kunskapsgraf med mer än 50 miljoner fakta skapats.[2][6]
Ytterligare för Titan konstrueras:
- Adversarial dataset — 2 miljoner originalsycken och motsvarande "negativa" stycken genererade av ERNIE 3.0 utifrån prefixet av de första 1–3 meningarna i originalet, med en längd på upp till 512 token.
- Controllable dataset — texter försedda med attribut för genre, ämne (26 teman), nyckelord, ton (positive/negative/neutral) och längd. Genreattribut kodas med träningsbara "mjuka promptar" (antalet promptar för genre väljs slumpmässigt från 0 till 64).[6]
Senare versioner (ERNIE 4.5, 5.0) använder utökade multimodala korpusar (text, bilder, video, ljud), inklusive kurerat webbinnehåll, vetenskapliga publikationer och syntetisk data.[3][4]
Träning och distribuerad optimering
Förträningen av ERNIE 3.0 Titan genomfördes med optimeraren Adam (inlärningshastighet , , , L2-regularisering 0,1, gradientnormklippning till 1,0), maximal kontextlängd 512 och återkommande minneslängd 128 för generativa uppgifter. En progressiv träningsschema tillämpades (accelererad konvergens under de första 4 000 stegen) samt linjärt avtagande inlärningshastighet.[6]
4D-hybrid parallellisering
För träning av en tät modell med 260 miljarder parametrar på heterogena kluster (GPU NVIDIA V100 och NPU Ascend 910) implementerades 4D-hybrid parallellisering i PaddlePaddle:[6]
- Data parallelism (DP) — replikering av modellen på flera enheter med separat batchbehandling.
- Tensor model parallelism (MP) — uppdelning av parametrar och aktiveringar i transformerlagren mellan enheter.
- Pipeline model parallelism (PP) — fördelning av modellens lager i en pipeline.
- Group Sharded — en förbättrad variant av ZeRO-liknande sharded-data-parallel för att minska duplicering av optimerartillstånd.
Rapporten redovisar svag skalning till tusentals Ascend 910-kort med en effektivitet på cirka 91,7 % avseende genomströmning.[6]
Träning av ERNIE 4.5
Träningen av ERNIE 4.5 genomfördes på ett kluster med 2 016 GPU NVIDIA H800 och uppnådde en Model FLOPs Utilization (MFU) på 47 %. Blandad precision FP8, feltoleranta kontrollpunkter (Zero Cost Checkpoint, återställning på under 8 minuter) och progressiv träning med ökande sekvens- och batchstorlekar användes.[3]
Online-destillering
För att minska resurskraven vid driftsättning av ERNIE 3.0 Titan används online-destillering, där lärarmodellen och flera studentmodeller tränas samtidigt:[6]
- On-the-Fly Distillation (OFD) — lärarens logits och representationer används för att träna studenter på samma träningssteg.
- Teacher assistants — mellanstora modeller som minskar kapacitetsgapet mellan läraren och de slutliga studenterna.
- Auxiliary Layer Distillation (ALD) — ett extra lager i studenten som tas bort vid fine-tuning, för bättre matchning av interna representationer.
Efterträning och anpassning
Kommersiella versioner av ERNIE (med start från ERNIE Bot) genomgår efterträningssteg:[7][3]
- Supervised Fine-Tuning (SFT) — finjustering på märkta instruktionsdata (i ERNIE 4.5 — 2,3 miljoner exempel).
- Reinforcement Learning from Human Feedback (RLHF) — anpassning av modellbeteende med hjälp av mänsklig återkoppling; algoritmerna PPO (Proximal Policy Optimization) och DPO (Direct Preference Optimization) tillämpas.
- Unified Preference Optimization (UPO) — en enhetlig metod för preferensoptimering som introducerades i ERNIE 4.5.
- Reinforcement Learning with Verifiers (RLVR) — förstärkningsinlärning med verifierare för kontroll av svarens korrekthet; metoden GRPO (Group Relative Policy Optimization) tillämpas.
- Resonemangslägen (thinking modes) — modellerna i version 4.5 stöder lägen med reflektion (reflection, planning) och utan.
Viktiga resultat och riktmärken
Sammanfattande tabell över modellernas evolution
| Version | År | Parametrar | Arkitektur | Viktiga riktmärken | Källa |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 milj. (base) | Transformer-enkoder (BERT-liknande) | XNLI 78,4 %; MSRA-NER F1 93,8 % | [1] |
| ERNIE 2.0 | 2019 | ~110–340 milj. | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 uppgifter SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 milj. | Unified Transformer-XL (AE+AR) | SuperGLUE 90,6 % (> human 89,8 %); 54 kin. uppgifter SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 milj. (dense) | Dense + controllable generation | 68 datamängder SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 milj. (MoE, 47 milj. akt.) | Heterogeneous multimodal MoE | C-Eval 90,6 %; MMLU 86,5 %; MMMU 67,3–70 % | [3] |
| ERNIE 5.0 | 2026 | ~2,4 biljoner (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (topp-10 globalt) | [4] |
Resultat för ERNIE 3.0 och Titan
ERNIE 3.0 (10 miljarder parametrar) uppnådde på det engelskspråkiga riktmärket SuperGLUE ett genomsnittligt resultat på 90,6, vilket översteg det mänskliga referensvärdet (89,8) och resultaten för GPT-3, T5 och DeBERTa vid tidpunkten för publiceringen. ERNIE 3.0 Titan (260 miljarder) utvärderades på 68 datamängder, inklusive klassificerings-, NLI-, QA- och genereringsuppgifter; författarna rapporterar överlägsenhet gentemot föregående modeller på samtliga 68 datamängder. Dessa resultat är hämtade från primärkällorna; oberoende reproducerbarhet är begränsat beskriven.[2][6]
Resultat för ERNIE 4.5
Enligt den tekniska rapporten från 2025 uppvisar ERNIE 4.5 (300B-A47B, efter efterträning) följande resultat på text- och multimodala riktmärken:[3]
| Riktmärke | ERNIE-4.5-300B-A47B | Villkor |
|---|---|---|
| C-Eval | 90,6 % | 5-shot |
| CMMLU | 90,2 % | — |
| MMLU | 86,5 % | standard |
| IFEval | 88,0 % | instruction following |
| GSM8K | 91,8 % | — |
| MMMU | 67,3–70,0 % | non-thinking / thinking |
| MathVista | 78,8 % | thinking mode |
| OCRBench | 883 | — |
Enligt rapporten överträffade ERNIE 4.5 DeepSeek-V3 på 22 av 28 riktmärken; de multimodala varianterna (ERNIE-4.5-VL-424B-A47B) visade konkurrenskraftiga resultat på uppgifter inom visuellt resonemang. På ett antal uppgifter inom visuellt resonemang och teknisk bildtolkning (analys av scheman, ingenjörsdiagram) rapporteras resultat som överträffar vissa GPT- och Gemini-modeller.[3][14]
Jämförelse av ERNIE 4.5 med konkurrenter (utvalda riktmärken, efter efterträning, enligt den tekniska rapporten från 2025):
| Riktmärke | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Anmärkning |
|---|---|---|---|---|
| C-Eval | 90,6 % | — | — | 5-shot |
| MMLU | 86,5 % | jämförbart | — | standard |
| IFEval | 88,0 % | — | 83,2 % | instruction following |
| MMMU | 67,3–70,0 % | — | — | thinking / non-thinking |
| MathVista | 78,8 % | — | 77,6 % (Qwen2.5-VL) | thinking mode |
Reproduceringsvillkor: standardprotokoll (5-shot / zero-shot); datamängderna är öppna (C-Eval 2023+, MMLU, MMMU). Tankstreck ("—") innebär att jämförbara data under samma villkor inte anges i rapporten.[3]
Utvärderingar av ERNIE Bot 4.0
Rapporten SuperBench från Tsinghua University rangordnar kommersiella LLM:er utifrån en uppsättning uppgifter (språkförståelse, matematik, programmering, multitask). ERNIE Bot 4.0 intog förstaplatsen bland kinesiska modeller och översteg GLM-4 (Zhipu AI) med ungefär 0,41 poäng på det integrerade måttet; GPT-4 och Anthropic Claude-3 placerade sig fortfarande högre i den globala rankningen. ERNIE Bot 4.0 visade starka resultat i kinesisk textförståelse och instruktionsföljning, med svagare resultat inom programmering och vissa engelskspråkiga uppgifter.[9][10]
Tillämpningar
Baidus produkter och tjänster
ERNIE-seriens modeller är integrerade i Baidus produktekosystem:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — en chattbot med stöd för multimodal generering (text, bilder, video, ljud). Enligt Baidu överstiger antalet månatliga aktiva användare 200 miljoner (2024–2025). Från och med 2025 är ERNIE Bot tillgänglig kostnadsfritt.[7]
- Baidu Search — generering av svar och AI-funktioner i sökresultaten; enligt Baidu berikas upp till 70 % av de översta resultaten med AI-komponenter.
- Qianfan (MaaS-plattform) — API för företagskunder; enligt Baidu använder mer än 760 000 företag plattformen, och antalet dagliga API-anrop överstiger 1,5 miljarder (2024). Bland kunderna finns Lenovo, Trip.com och andra.[7]
- Comate — en AI-assistent för programmering.
- Wenxin Yige — bildgenerering baserad på ERNIE-ViLG-modellerna.[11]
- Integrationer med externa partner: Samsung Galaxy (för den kinesiska marknaden), digitala avatarer, tillägg (sökning, filanalys).[7]
Branschspecifika tillämpningar
Modellerna tillämpas inom följande områden:[7][3]
- Fråge- och svarssystem inom domänspecifika områden (juridik, medicin, finans) med kunskapsförstärkt förträning.
- Generering och redigering av texter på kinesiska (nyheter, marknadsföringstext, kreativt innehåll).
- Multimodala uppgifter: analys av bilder, ingenjörsscheman, video och tabelldata (i version 4.5 och senare).
- Utbildning (personaliserat lärande), robotik (uppgiftsplanering), autonom körning (Apollo).
Öppen källkod
Från och med ERNIE 4.5 har samtliga 10 varianter av familjen släppts under Apache 2.0-licensen med verktygssviten ERNIEKit (stöd för SFT, LoRA, DPO, inferens på PaddlePaddle/FastDeploy). Koden för tidigare versioner (ERNIE 1.0–3.0) finns tillgänglig på GitHub PaddlePaddle/ERNIE.[3][15]
Begränsningar och öppna frågor
Arkitekturella begränsningar och databegränsningar
ERNIE 3.0 Titan med 260 miljarder parametrar är begränsad till en kontextlängd på 512 token för den individuella modulen, vilket begränsar modelleringen av långa texter utan ytterligare mekanismer (chunking, externt minne). Träningen genomförs huvudsakligen på ett kinesiskt korpus, vilket leder till ojämn kvalitet mellan kinesiska och andra språk.[6]
Integration av kunskapsgrafen förbättrar hanteringen av strukturerade fakta, men noggrannheten och fullständigheten i kunskapen begränsas av kvaliteten på själva grafen och proceduren för matchning av tripel mot text (entity linking, relation alignment), vilket i vissa fall leder till felaktiga eller ofullständiga associationer.[6]
Hallucinationer och tillförlitlighet
Adversarial loss och controllable LM loss förbättrar robustheten mot otillförlitliga genereringar, men hallucinationsproblemet (generering av faktiskt felaktiga påståenden) kan inte elimineras helt. Adversarial-klassificerarens parametrar tränas på data där den "genererade" texten produceras av en tidigare version av ERNIE, vilket begränsar spektrumet av igenkänningsbara felaktiga mönster.[6]
Sociala fördomar
En studie publicerad i PeerJ Computer Science (2025) analyserar sociala fördomar i kinesiska LLM:er (ERNIE och Qwen) med hjälp av 240 sociala grupper och mer än 30 000 genererade beskrivningar. Resultaten visar att ERNIE genererar mindre negativt och stereotypt innehåll än Baidu Search eller Qwen (ungefär 1/10 av kandidatorden med negativ konnotation hos ERNIE mot 1/3 hos Qwen). Likväl kvarstår en viss förekomst av stereotyper, inklusive potentiellt kränkande beskrivningar.[16][17]
Reproducerbarhet
En del av seriens modeller (ERNIE 3.0 Titan, de kommersiella ERNIE Bot 4.0 och 5.0) finns inte tillgängliga som helt öppen källkod med vikter, vilket begränsar reproducerbarheten av riktmärken och möjligheten till oberoende utvärdering. I och med lanseringen av ERNIE 4.5 under Apache 2.0 har situationen förbättrats, men arkitekturer och träningsinställningar kan skilja sig från vad som beskrivs i tidigare publikationer.[3][6]
Medicinsk säkerhet
Studier av ERNIE Bots användning i medicinska scenarier (Si et al., 2025) påvisade en tendens till överförskrivning: 91,9 % onödiga tester och 57,8 % onödiga läkemedel i modellscenarier, samt ålders- och socioekonomiska ojämlikheter i rekommendationerna.[18]
Etiska och regulatoriska aspekter
ERNIE-seriens modeller verkar inom ramen för kinesisk reglering av generativ AI, i synnerhet "Interim Measures for Generative AI Services" (2023), som föreskriver obligatorisk säkerhetsbedömning, algoritmregistrering och innehållsbegränsningar.[7][17]
ERNIE Bot uppvisar en hög avvisningsfrekvens för förfrågningar om känsliga politiska ämnen i enlighet med nationell lagstiftning. Studier (Pan et al., 2026) analyserar politisk censur i LLM:er av kinesiskt ursprung, inklusive Baidus modeller.[19]
Baidus publikationer beskriver inte alltid i detalj förfarandena för granskning av modellbeteende, kriterierna för innehållsfiltrering och balansen mellan lokala normativa krav och allmänna principer för AI-etik, vilket kvarstår som ett öppet område för oberoende forskning.[17]
Framtida perspektiv och forskningsinriktningar
Utifrån tekniska rapporter och Baidus uttalanden identifieras följande utvecklingsriktningar för ERNIE-serien:
- Fortsatt multimodalisering (text–bild–video–ljud), inklusive hantering av täta tekniska visuella data (ingenjörsscheman, medicinska bilder).[3][4]
- Kombination av täta och MoE-arkitekturer för balans mellan kvalitet och beräkningseffektivitet vid mycket stora totala modellstorlekar.[3]
- Utveckling av agentbaserade system (GenFlow, Famou) och verktyg för strukturerad generering (JSON, API-anrop) för integration i produktionsmiljöer.[3]
- Ökad träningseffektivitet: elastic training, förbättrad MoE-skalning (MFU), kvantering (W4A8, 2-bitars för driftsättning på en enda GPU).[3]
- Forskning om minskning av fördomar i kinesiska LLM:er med hänsyn till kulturspecifika aspekter och utveckling av metoder för riktmärkning av kinesiska och multimodala uppgifter.[16][17]
- Förbättrat resonemang i långa sammanhang, verifierbar förstärkningsinlärning (verifiable RL) och domänanpassning med begränsad data via syntetiska korpusar.[3][4]
Jämförelse med andra kinesiska LLM:er
ERNIE konkurrerar med ett antal stora kinesiska LLM:er, bland dem Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) och Tongyi Qianwen. De viktigaste särdragen hos ERNIE-serien är fokus på integration av kunskapsgrafer i förträningen (knowledge enhancement), nära integration med Baidus ekosystem (sökning, moln, API) och inriktning på plattformen PaddlePaddle. Enligt oberoende rankningar (SuperBench, LMArena) intar ERNIE-seriens modeller höga positioner bland kinesiska LLM:er, särskilt inom uppgifter om förståelse och instruktionsföljning på kinesiska.[9][13][16]
Se även
- BERT
- Transformer - Transformer-arkitektur
- RLHF
Litteratur
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Noter
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.