ERNIE (Baidu) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — een serie voorgetrainde taalmodellen (Large Language Model, LLM) en multimodale fundamentele modellen, ontwikkeld door Baidu sinds 2019 onder de verzamelnaam Enhanced Representation through kNowledge IntEgration (versterkte representatie via kennisintegratie). De serie is gericht op het verbeteren van de kwaliteit van semantisch begrip en generatie door middel van expliciete integratie van externe kennis uit kennisgrafen (Knowledge Graph, KG), ontologieën en encyclopedieën in het voortrainingsproces.[1][2]

De modellen in de serie zijn geëvolueerd van vroege varianten op basis van BERT met maskering van entiteiten en zinsdelen (ERNIE 1.0, 2.0) via grootschalige uniforme architecturen (ERNIE 3.0, ERNIE 3.0 Titan) naar multimodale systemen op basis van Mixture-of-Experts (MoE) met open broncode (ERNIE 4.5) en native omnimodale modellen (ERNIE 5.0). De serie ondersteunt taken op het gebied van tekstbegrip (Natural Language Understanding, NLU), tekstgeneratie (Natural Language Generation, NLG) en, in latere versies, multimodale taken (tekst, beeld, video, audio), met nadruk op de Chinese taal en ondersteuning voor meertaligheid.[2][3][4]

Geschiedenis en achtergrond

De ontwikkeling van de ERNIE-serie begon in 2019 bij de onderzoeksafdeling van Baidu, als reactie op het succes van het BERT-model (Devlin et al., 2018) en de noodzaak om voorgetrainde modellen aan te passen voor de Chinese taal, waarin het ontbreken van expliciete spaties tussen woorden en het grote aandeel meerduidig te interpreteren schrifttekens het vastleggen van semantische eenheden (entiteiten, zinsdelen) bemoeilijkt.[1]

ERNIE 1.0 (2019)

Het eerste model in de serie (Sun et al., arXiv:1904.09223, april 2019) introduceerde een meerlaagse kennismaskeringsstrategie (knowledge masking) voor een BERT-achtige architectuur: in plaats van willekeurige maskering van afzonderlijke tokens maskeert het model volledige entiteiten en zinsdelen, bepaald op basis van herkenning van benoemde entiteiten (Named Entity Recognition, NER) en zinsdeel-patronen.[1]

De architectuur van ERNIE 1.0 is gebaseerd op een Transformer-encoder (12 lagen, verborgen dimensie 768, 12 aandachtshoofden). Aanvullend werd de taak Dialogue Language Model (DLM) geïntroduceerd voor training op dialooggegevens. Het model is getraind op ~173 miljoen Chinese zinnen uit de corpora Wikipedia, Baidu Baike, nieuws en het Baidu Tieba-forum. Ten tijde van publicatie bereikte ERNIE 1.0 state‑of‑the‑art (SOTA)-resultaten op vijf Chinese NLP-taken: XNLI (nauwkeurigheid 78,4% op de testset versus 77,2% bij BERT), MSRA‑NER (F1 93,8% versus 92,6%).[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412, juli 2019; aanvaard op de conferentie AAAI 2020) introduceerde een raamwerk voor continueel meertaken-voortraining (continual multi‑task pre‑training), waarbij nieuwe voortrainingstaken sequentieel (incrementeel) worden toegevoegd aan een gedeelde transformer zonder het model volledig opnieuw te trainen.[5]

De voortrainingstaken van ERNIE 2.0 zijn verdeeld in drie groepen:

  • Word‑aware — kennismaskering (knowledge masking), voorspelling van hoofdlettergebruik (capitalization prediction), relatie tussen token en document (token‑document relation).
  • Structure‑aware — herordening van zinnen (sentence reordering), bepaling van de afstand tussen zinnen (sentence distance).
  • Semantic‑aware — voorspelling van discursieve relaties (discourse relation prediction), relevantie voor informatiezoekopdrachten (IR relevance prediction).[5]

Het model is getraind op Engelse en Chinese corpora (encyclopedieën, boeken, Reddit, zoeklogboeken). Resultaten: de gemiddelde GLUE-score voor het base-model bedroeg 80,6 (versus 78,3 bij BERT), voor het large-model — 83,6; ERNIE 2.0 overtrof BERT en XLNet op 16 taken.[5]

ERNIE 3.0 (2021)

Het ERNIE 3.0-raamwerk (Sun et al., arXiv:2107.02137, juli 2021) combineerde de auto-encoderende (auto‑encoding, AE) en autoregressieve (auto‑regressive, AR) voortrainingsparadigma's in één architectuur, verdeeld in een universele representatiemodule (Universal Representation Module) en taakspecifieke modules (Task‑specific Representation Modules) voor NLU en NLG.[2]

Het model met 10 miljard parameters is getraind op 4 TB Chinese tekst (11 categorieën: Baidu Baike, Wikipedia, zoeklogboeken, vraag-antwoordsystemen, domeinspecifieke teksten) en een kennisgraaf met meer dan 50 miljoen feiten. ERNIE 3.0 bereikte SOTA op 54 Chinese NLP-taken; op de Engelstalige benchmark SuperGLUE — 90,6% (per 3 juli 2021, boven de menselijke referentie van 89,8%).[2]

ERNIE 3.0 Titan (2021)

In het artikel "ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, december 2021) wordt de opschaling van het ERNIE 3.0-raamwerk beschreven tot een dicht (dense) model met 260 miljard parameters, geïmplementeerd op het PaddlePaddle-platform.[6]

Titan introduceerde aanvullende mechanismen: een zelfsuperviserend adversarial loss voor de beoordeling van de geloofwaardigheid van gegenereerde tekst, controllable language modeling loss voor het sturen van stijl, thema, toon en lengte van de generatie, en online-destillatie (On‑the‑Fly Distillation, OFD) voor het verkrijgen van compacte studentmodellen tijdens het voortrainen. Het model werd geëvalueerd op 68 datasets en overtrof, volgens de auteurs, alle voorafgaande modellen op alle 68 datasets.[6]

ERNIE Bot en commerciële versies (2023–2025)

In maart 2023 bracht Baidu de chatbot ERNIE Bot (Wenxin Yiyan, 文心一言) uit, gebaseerd op de modellen ERNIE 3.x en PLATO (een dialoogmodel). Openbare toegang werd verleend in augustus 2023 na goedkeuring door toezichthouders. Updates omvatten ERNIE 3.5 (juni 2023) en ERNIE 4.0 (oktober 2023).[7][8]

Volgens het SuperBench-rapport van de Tsinghua Universiteit behaalde ERNIE Bot 4.0 de eerste plaats onder Chinese LLM's op de geïntegreerde meetwaarde, met sterke resultaten in Chinees taalbegrip en het opvolgen van instructies.[9][10]

In 2022 werd parallel aan de belangrijkste taalreeks de multimodale uitbreiding ERNIE‑ViLG 2.0 (arXiv:2210.15257) gepresenteerd — een model voor het genereren van afbeeldingen op basis van tekst (text‑to‑image), wat een van de eerste stappen in de richting van multimodaliteit was.[11]

In 2024 presenteerde Baidu op de conferentie WAVE SUMMIT ERNIE 4.0 Turbo — een geoptimaliseerde versie voor toepassingen met hoge snelheid, die tekst van meer dan duizend woorden in ongeveer 20 seconden kan genereren met behoud van kwaliteit.[12]

ERNIE 4.5 (2025)

In juni 2025 publiceerde Baidu het technische rapport van ERNIE 4.5, dat een familie van 10 modellen presenteert: tekstuele LLM's en multimodale modellen (Vision‑Language, VL). De architectuur is gebaseerd op een heterogene Mixture-of-Experts (MoE) met scheiding van experts per modaliteit. Varianten omvatten MoE-modellen met tot 424 miljard totale en 47 miljard actieve parameters, alsmede een dicht model met 0,3 miljard parameters. De familie is uitgebracht onder de Apache 2.0-licentie op Hugging Face en GitHub (PaddlePaddle/ERNIE).[3]

ERNIE 5.0 (2026)

In februari 2026 werd het technische rapport van ERNIE 5.0 (arXiv:2602.04705) gepubliceerd — een native omnimodaal autoregressief model met ultra-sparse MoE, dat gezamenlijke modellering van tekst, afbeeldingen, audio en video ondersteunt. Het model bezette hoge posities op het LMArena-leaderboard.[4][13]

Theoretische grondslagen en architectuurprincipes

Kennismaskering (Knowledge Masking)

Het sleutelprincipe van de vroege modellen in de serie is de integratie van gestructureerde kennis in het voortrainingsproces via gewijzigde maskeringsstrategieën. In tegenstelling tot standaard Masked Language Modeling (MLM), waarbij afzonderlijke tokens worden gemaskeerd, maskeert ERNIE 1.0 volledige semantische eenheden: entiteiten (bepaald via NER) en zinsdelen. Voor een entiteit E={t1,,tk} wordt de gehele tokenreeks gemaskeerd met een bepaalde kans p. Deze aanpak dwingt het model om te vertrouwen op een bredere context en verbanden tussen entiteiten te leren.[1]

ERNIE 2.0 ontwikkelde deze aanpak verder door incrementeel meertaken-leren toe te voegen: taken op lexicaal, structureel en semantisch niveau worden opeenvolgend toegevoegd, waarbij eerder geleerde kennis behouden blijft dankzij het mechanisme voor continueel voortrainen (continual pre‑training).[5]

Uniform ERNIE 3.0-raamwerk

Het ERNIE 3.0-raamwerk is gebaseerd op een verdeling van de architectuur in twee niveaus:[2][6]

  • Universal Representation Module — een gedeelde meerlaagse Transformer‑XL, getraind op een verscheidenheid aan voortrainingstaken en die gemeenschappelijke lexicale en syntactische kenmerken extraheert. In de Titan-versie bevat deze module 48 lagen, een verborgen representatie van grootte 12288, 192 aandachtshoofden en een interne feed‑forward netwerkgrootte van 196608 (16×dmodel).
  • Task‑specific Representation Modules — afzonderlijke modules voor NLU (bidirectionele aandacht) en NLG (unidirectionele aandacht met recurrente Transformer‑XL-geheugen), elk met 12 lagen, een verborgen vectorgrootte van 768 en 12 aandachtshoofden.

De integratie van de auto-encoderende en autoregressieve paradigma's stelt één model in staat hoge scores te behalen op zowel NLU-benchmarks (BERT-achtige taken) als NLG-benchmarks (GPT-achtige taken).[2]

Universal Knowledge‑Text Prediction (UKTP)

De UKTP-taak vormt het centrale kennisintegratiemechanisme in ERNIE 3.0/Titan. Het model ontvangt een paar (drieledige tuple uit de kennisgraaf, zin uit een encyclopedie) en moet ofwel de relatie in de tuple voorspellen aan de hand van de tekst, ofwel de gemaskeerde tokens in de tekst voorspellen aan de hand van de informatie uit de tuple.[6]

Bij het voorspellen van de relatie r in de tuple (h,r,t), gekoppeld aan de tekst x, wordt de taak geformuleerd als een meerdimensionale classificatie:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

waar fθ de uitvoer van de transformer is op de posities van de vermeldingen van de hoofd- en staartentiteit, W,b de parameters van de classifier zijn, en θ de modelparameters zijn.[6]

Mechanismen voor betrouwbare en gestuurde generatie (Titan)

ERNIE 3.0 Titan introduceerde twee aanvullende typen verliesfuncties.[6]

Zelfsuperviserende adversarial loss. Er wordt een dataset Da={Doriginal,Dgenerated} samengesteld, waarbij Doriginal echte alinea's zijn en Dgenerated teksten die door een eerdere versie van ERNIE zijn gegenereerd op basis van het prefix van de originele alinea's. De taak is binaire classificatie (origineel / gegenereerd) op basis van de verborgen toestand van het speciale token [CLS]:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

waar h[CLS](n) de vectorrepresentatie van [CLS] is voor het n-de voorbeeld, en I de indicator is voor behorend tot de originele teksten.[6]

Controllable language modeling loss. Elk trainingsvoorbeeld wordt vergezeld van een reeks attributen (prompt) die genre, thema, trefwoorden, toon en lengte beschrijven. De verliesfunctie combineert onvoorwaardelijke en voorwaardelijke taalmodellering:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

waar p een willekeurige grootheid is voor het afwisselen van modi, en xt(n) het t-de token is van het n-de voorbeeld. Deze definitie voorkomt dat het model overmatig afhankelijk wordt van prompts.[6]

Heterogene MoE-architectuur (ERNIE 4.5)

ERNIE 4.5 introduceert een heterogene multimodale Mixture-of-Experts-architectuur met scheiding van experts per modaliteit: tekstexperts en visuele experts (de laatste hebben ongeveer 1/3 van de omvang van de tekstexperts). De routering van tokens vindt plaats met modaliteitsisolatie (modality‑isolated routing) en de toepassing van een orthogonaliserende straf voor de router (router orthogonalization loss, coëfficiënt van de orde 103) om specialisatie van experts te waarborgen. Er wordt gebruikgemaakt van 3D RoPE (Rotary Position Embeddings) voor positionele codering van de tijdsdimensie, hoogte en breedte in videogegevens. Het FlashMask-mechanisme wordt toegepast voor efficiënte verwerking van lange context (tot 131 duizend tokens) met O(N) maskers.[3]

Het voortrainen van ERNIE 4.5 verloopt in meerdere fasen: eerst training op uitsluitend tekstgegevens, vervolgens op visuele gegevens, en in de laatste fase gezamenlijke training op multimodale gegevens (text‑only → vision‑only → joint). Voor de verwerking van afbeeldingen wordt een adaptieve ViT-encoder (Vision Transformer) gebruikt met een pixel shuffle-mechanisme voor het uitlijnen van representaties van verschillende modaliteiten. Verwerking van lange video's (tot 32 duizend tokens) wordt ondersteund met adaptieve frame-sampling.[3]

Native omnimodaliteit (ERNIE 5.0)

ERNIE 5.0 implementeert native autoregressief modelleren van meerdere modaliteiten (tekst, afbeelding, audio, video) in een uniforme architectuur met ultra-sparse MoE, waarbij bij elke stap minder dan 3% van het totale aantal experts wordt geactiveerd. Als voortrainigstaak wordt Next‑Group‑of‑Tokens Prediction gebruikt — het voorspellen van een groep tokens in plaats van één, wat de trainingsefficiëntie verhoogt. Voor de audiomodaliteit wordt een hiërarchische codec (hierarchical codec) toegepast. De elastic training-technologie maakt het mogelijk submodellen te genereren met verschillende diepte, breedte en mate van schaarsheid binnen één trainingsronde.[4]

Voortrainingstaken en gegevens

Voortrainingstaken van ERNIE 3.0 / Titan

In ERNIE 3.0 en Titan worden de volgende groepen voortrainingstaken gebruikt:[2][6]

Word‑aware taken:

  • Knowledge Masked Language Modeling — zinsdeel- en entiteitsmaskering voor het leren van afhankelijkheden in lokale en globale context.
  • Document Language Modeling — autoregressief modelleren van documenten met een lengte tot 512 tokens en gebruik van het recurrente Transformer‑XL-geheugen.

Structure‑aware taken:

  • Sentence Reordering — voor een alinea die willekeurig is opgedeeld in m segmenten en geschud, lost het model een k-klassige classificatietaak op met k=n=1mn! door de oorspronkelijke volgorde te herstellen.
  • Sentence Distance — 3-klassige classificatie: aangrenzende zinnen, niet-aangrenzende zinnen in hetzelfde document, zinnen uit verschillende documenten.

Knowledge‑aware taken:

  • Universal Knowledge‑Text Prediction (UKTP) — gezamenlijk modelleren van tekst en een tuple uit de kennisgraaf.
  • Credible and Controllable Generations — combinatie van adversarial loss en controllable LM loss.

Voortrainingsgegevens

Voor ERNIE 3.0/Titan wordt het ERNIE 3.0 Corpus gebruikt — een Chinees corpus van ongeveer 4 TB in 11 categorieën, waaronder webpagina's, zoeklogboeken, vraag-antwoordgegevens, literaire, juridische, financiële en medische teksten, romans en poëzie. Bovenop het corpus is een kennisgraaf opgebouwd met meer dan 50 miljoen feiten.[2][6]

Aanvullend worden voor Titan samengesteld:

  • Adversarial dataset — 2 miljoen originele alinea's en bijbehorende "negatieve" alinea's, gegenereerd door ERNIE 3.0 op basis van het prefix van de eerste 1–3 zinnen van het origineel, met een lengte tot 512 tokens.
  • Controllable dataset — teksten voorzien van attributen voor genre, thema (26 thema's), trefwoorden, toon (positief/negatief/neutraal) en lengte. Genre-attributen worden gecodeerd als traineerbare "zachte prompts" (het aantal prompts voor het genre wordt willekeurig gekozen van 0 tot 64).[6]

Latere versies (ERNIE 4.5, 5.0) maken gebruik van uitgebreide multimodale corpora (tekst, afbeeldingen, video, audio), waaronder gecureerde webinhoud, wetenschappelijke publicaties en synthetische gegevens.[3][4]

Training en gedistribueerde optimalisatie

Het voortrainen van ERNIE 3.0 Titan werd uitgevoerd met de Adam-optimizer (leersnelheid 104, β1=0,9, β2=0,95, L2-regularisatie 0,1, afkappen van de gradientnorm tot 1,0), een maximale contextlengte van 512 en een recurrente geheugenlengte van 128 voor generatieve taken. Er werd gebruik gemaakt van een progressief trainingsschema (versnelde convergentie in de eerste 4000 stappen) en lineair afnemende leersnelheid.[6]

4D-hybride parallellisering

Voor het trainen van het dichte model met 260 miljard parameters op heterogene clusters (GPU NVIDIA V100 en NPU Ascend 910) is in PaddlePaddle 4D-hybride parallellisering geïmplementeerd:[6]

  • Data parallelism (DP) — replicatie van het model op meerdere apparaten met afzonderlijke verwerking van batches.
  • Tensor model parallelism (MP) — verdeling van parameters en activaties van de transformer binnen lagen over apparaten.
  • Pipeline model parallelism (PP) — verdeling van de modellagen over een pijplijn.
  • Group Sharded — een verbeterde variant van ZeRO-achtige sharded-data-parallel voor het verminderen van duplicatie van optimizertoestanden.

Het rapport vermeldt gegevens over zwakke opschaling tot duizenden Ascend 910-kaarten met een efficiëntie van ongeveer 91,7% qua doorvoer.[6]

Training van ERNIE 4.5

De training van ERNIE 4.5 werd uitgevoerd op een cluster van 2016 GPU's NVIDIA H800, waarbij een Model FLOPs Utilization (MFU) van 47% werd bereikt. Er werd gebruik gemaakt van gemengde precisie FP8, fouttolerante controlepunten (Zero Cost Checkpoint, herstel in minder dan 8 minuten) en progressieve training met toenemende sequentielengte en batchgrootte.[3]

Online destillatie

Om de rekenvereisten bij het inzetten van ERNIE 3.0 Titan te verlagen, wordt online destillatie gebruikt, waarbij het leraarsmodel en meerdere studentmodellen gelijktijdig worden getraind:[6]

  • On‑the‑Fly Distillation (OFD) — de logits en representaties van de leraar worden gebruikt voor het trainen van studenten op dezelfde trainingsstappen.
  • Teacher assistants — tussenliggende modellen qua grootte, die de kloof in capaciteit tussen de leraar en de uiteindelijke studenten verkleinen.
  • Auxiliary Layer Distillation (ALD) — een extra laag in de student die wordt weggelaten bij fine‑tuning, voor een betere afstemming van interne representaties.

Natraining en uitlijning

Commerciële versies van ERNIE (vanaf ERNIE Bot) doorlopen fasen van natraining:[7][3]

  • Supervised Fine‑Tuning (SFT) — bijtraining op gelabelde instructiegegevens (in ERNIE 4.5 — 2,3 miljoen voorbeelden).
  • Reinforcement Learning from Human Feedback (RLHF) — uitlijning van het modelgedrag met behulp van menselijke feedback; de algoritmen PPO (Proximal Policy Optimization) en DPO (Direct Preference Optimization) worden toegepast.
  • Unified Preference Optimization (UPO) — een uniforme methode voor voorkeuroptimalisatie, geïntroduceerd in ERNIE 4.5.
  • Reinforcement Learning with Verifiers (RLVR) — bekrachtigingsleren met gebruik van verificatoren voor het controleren van de juistheid van antwoorden; de methode GRPO (Group Relative Policy Optimization) wordt toegepast.
  • Redeneermodi (thinking modes) — modellen van versie 4.5 ondersteunen modi met nadenken (reflection, planning) en zonder.

Belangrijkste resultaten en benchmarks

Overzichtstabel van de evolutie van de modellen

Versie Jaar Parameters Architectuur Belangrijkste benchmarks Bron
ERNIE 1.0 2019 ~110 mln (base) Transformer‑encoder (BERT-achtig) XNLI 78,4%; MSRA‑NER F1 93,8% [1]
ERNIE 2.0 2019 ~110–340 mln Continual multi‑task GLUE 80,6 (base) / 83,6 (large); 16 taken SOTA [5]
ERNIE 3.0 2021 10 mld Unified Transformer‑XL (AE+AR) SuperGLUE 90,6% (> menselijk 89,8%); 54 Chinese taken SOTA [2]
ERNIE 3.0 Titan 2021 260 mld (dense) Dense + controllable generation 68 datasets SOTA; zero/few‑shot [6]
ERNIE 4.5 2025 0,3–424 mld (MoE, 47 mld act.) Heterogeneous multimodal MoE C‑Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% [3]
ERNIE 5.0 2026 ~2,4 bln (ultra‑sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (top‑10 wereldwijd) [4]

Resultaten van ERNIE 3.0 en Titan

ERNIE 3.0 (10 miljard parameters) behaalde op de Engelstalige benchmark SuperGLUE een gemiddeld resultaat van 90,6, waarmee het de menselijke referentie (89,8) en de scores van GPT‑3, T5 en DeBERTa overtrof op het moment van publicatie. ERNIE 3.0 Titan (260 miljard) werd geëvalueerd op 68 datasets, waaronder classificatietaken, NLI, QA en generatie; de auteurs melden dat het alle voorgaande modellen overtreft op alle 68 datasets. Deze resultaten zijn afkomstig uit primaire bronnen; onafhankelijke reproduceerbaarheid is beperkt beschreven.[2][6]

Resultaten van ERNIE 4.5

Volgens het technische rapport van 2025 behaalt ERNIE 4.5 (300B‑A47B, na natraining) de volgende resultaten op tekstuele en multimodale benchmarks:[3]

Benchmark ERNIE‑4.5‑300B‑A47B Omstandigheden
C‑Eval 90,6% 5‑shot
CMMLU 90,2%
MMLU 86,5% standaard
IFEval 88,0% instruction following
GSM8K 91,8%
MMMU 67,3–70,0% non‑thinking / thinking
MathVista 78,8% thinking mode
OCRBench 883

Volgens het rapport overtrof ERNIE 4.5 DeepSeek‑V3 op 22 van de 28 benchmarks; de multimodale varianten (ERNIE‑4.5‑VL‑424B‑A47B) toonden competitieve resultaten op taken voor visueel redeneren. Op een aantal taken voor visueel redeneren en technische beeldinterpretatie (analyse van schema's, technische diagrammen) worden resultaten gerapporteerd die hoger liggen dan die van afzonderlijke GPT- en Gemini-modellen.[3][14]

Vergelijking van ERNIE 4.5 met concurrenten (geselecteerde benchmarks, na natraining, op basis van het technische rapport van 2025):

Benchmark ERNIE‑4.5‑300B‑A47B DeepSeek‑V3‑671B‑A37B Qwen3‑235B‑A22B Opmerking
C‑Eval 90,6% 5‑shot
MMLU 86,5% vergelijkbaar standaard
IFEval 88,0% 83,2% instruction following
MMMU 67,3–70,0% thinking / non‑thinking
MathVista 78,8% 77,6% (Qwen2.5‑VL) thinking mode

Reproductieomstandigheden: standaardprotocollen (5‑shot / zero‑shot); datasets zijn openbaar (C‑Eval 2023+, MMLU, MMMU). Een streepje («—») betekent dat vergelijkbare gegevens onder dezelfde omstandigheden niet in het rapport zijn opgenomen.[3]

Beoordelingen van ERNIE Bot 4.0

Het SuperBench-rapport van de Tsinghua Universiteit rangschikt commerciële LLM's op basis van een reeks taken (taalbegrip, wiskunde, programmeren, multitasking). ERNIE Bot 4.0 behaalde de eerste plaats onder Chinese modellen, waarbij het GLM‑4 (Zhipu AI) met ongeveer 0,41 punt op de geïntegreerde meetwaarde overtrof; GPT‑4- en Anthropic Claude‑3-modellen stonden hoger in de wereldwijde ranglijst. ERNIE Bot 4.0 toonde sterke resultaten in Chinees tekstbegrip en het opvolgen van instructies, met zwakkere scores op programmeren en bepaalde Engelstalige taken.[9][10]

Toepassingen

Producten en diensten van Baidu

De modellen van de ERNIE-serie zijn geïntegreerd in het ecosysteem van Baidu-producten:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — een chatbot met ondersteuning voor multimodale generatie (tekst, afbeeldingen, video, audio). Volgens Baidu bedraagt het aantal maandelijkse actieve gebruikers meer dan 200 miljoen (2024–2025). Vanaf 2025 is ERNIE Bot gratis beschikbaar.[7]
  • Baidu Zoeken — generatie van antwoorden en AI-functies in zoekresultaten; volgens Baidu is tot 70% van de topresultaten verrijkt met AI-componenten.
  • Qianfan (MaaS-platform) — API voor zakelijke klanten; volgens Baidu maken meer dan 760 duizend bedrijven gebruik van het platform, met meer dan 1,5 miljard dagelijkse API-aanroepen (2024). Tot de klanten behoren Lenovo, Trip.com en anderen.[7]
  • Comate — een AI-assistent voor programmeren.
  • Wenxin Yige — het genereren van afbeeldingen op basis van ERNIE‑ViLG-modellen.[11]
  • Integraties met externe partners: Samsung Galaxy (voor de Chinese markt), digitale avatars, plug-ins (zoeken, bestandsanalyse).[7]

Sectorale toepassingen

De modellen worden toegepast in de volgende gebieden:[7][3]

  • Vraag-antwoordsystemen in domeinspecifieke gebieden (recht, geneeskunde, financiën) met gebruik van kennisversterkt voortrainen.
  • Generatie en bewerking van teksten in het Chinees (nieuws, marketingteksten, creatieve inhoud).
  • Multimodale taken: analyse van afbeeldingen, technische schema's, video en tabelgegevens (in versies 4.5 en hoger).
  • Onderwijs (gepersonaliseerd leren), robotica (taakplanning), autonoom rijden (Apollo).

Open broncode

Vanaf ERNIE 4.5 zijn alle 10 varianten van de familie uitgebracht onder de Apache 2.0-licentie met de ERNIEKit-toolkit (ondersteuning voor SFT, LoRA, DPO, inferentie op PaddlePaddle/FastDeploy). De code van eerdere versies (ERNIE 1.0–3.0) is beschikbaar op GitHub PaddlePaddle/ERNIE.[3][15]

Beperkingen en openstaande problemen

Architectuur- en datasetbeperkingen

ERNIE 3.0 Titan heeft bij 260 miljard parameters een contextlengtebegrenzing van 512 tokens per afzonderlijke module, wat het modelleren van lange teksten zonder aanvullende mechanismen (chunking, extern geheugen) beperkt. De training vindt voornamelijk plaats op een Chinees corpus, wat leidt tot ongelijkmatige kwaliteit tussen het Chinees en andere talen.[6]

De integratie van de kennisgraaf verbetert de verwerking van gestructureerde feiten, maar de nauwkeurigheid en volledigheid van de kennis worden beperkt door de kwaliteit van de graaf zelf en de procedure voor het koppelen van tuple aan tekst (entity linking, relation alignment), wat in sommige gevallen leidt tot onjuiste of onvolledige associaties.[6]

Hallucinaties en betrouwbaarheid

Adversarial loss en controllable LM loss verbeteren de robuustheid tegen onbetrouwbare generaties, maar elimineren het probleem van hallucinaties (het genereren van feitelijk onjuiste beweringen) niet volledig. De parameters van de adversariale classifier worden getraind op gegevens waarbij de "gegenereerde" tekst is aangemaakt door een eerdere versie van ERNIE, wat het spectrum van herkenbare foutieve patronen beperkt.[6]

Sociale vooroordelen

Een onderzoek gepubliceerd in PeerJ Computer Science (2025) analyseert sociale vooroordelen in Chinese LLM's (ERNIE en Qwen) met gebruik van 240 sociale groepen en meer dan 30 duizend gegenereerde beschrijvingen. De resultaten tonen aan dat ERNIE minder negatieve en stereotiepe inhoud genereert dan Baidu Search of Qwen (ongeveer 1/10 kandidaatwoorden met een negatieve connotatie bij ERNIE versus 1/3 bij Qwen). Desalniettemin blijft een zekere prevalentie van stereotypen, waaronder potentieel beledigende beschrijvingen, aanwezig.[16][17]

Reproduceerbaarheid

Een deel van de modellen in de serie (ERNIE 3.0 Titan, de commerciële ERNIE Bot 4.0 en 5.0) is niet beschikbaar als volledig open broncode met gewichten, wat de reproduceerbaarheid van benchmarks en de mogelijkheid tot onafhankelijke evaluatie beperkt. Met de uitbrenging van ERNIE 4.5 onder Apache 2.0 is de situatie verbeterd, maar de architecturen en trainingsinstellingen kunnen afwijken van wat in eerdere publicaties is beschreven.[3][6]

Medische veiligheid

Onderzoek naar het gebruik van ERNIE Bot in medische scenario's (Si et al., 2025) bracht een neiging tot overmatig voorschrijven aan het licht: 91,9% onnodige tests en 57,8% onnodige medicijnen in modelscenario's, alsook leeftijds- en sociaaleconomische ongelijkheden in aanbevelingen.[18]

Ethische en regelgevende aspecten

De modellen van de ERNIE-serie functioneren binnen het kader van de Chinese regulering van generatieve AI, met name de "Tijdelijke maatregelen voor het beheer van generatieve AI-diensten" (Interim Measures for Generative AI Services, 2023), die verplichte veiligheidsevaluatie, registratie van algoritmen en inhoudsbeperkingen voorschrijven.[7][17]

ERNIE Bot vertoont een hoge mate van weigering op verzoeken die betrekking hebben op gevoelige politieke onderwerpen, in overeenstemming met de nationale wetgeving. Onderzoek (Pan et al., 2026) analyseert politieke censuur in LLM's van Chinese oorsprong, waaronder modellen van Baidu.[19]

Publicaties van Baidu beschrijven niet altijd gedetailleerd de procedures voor auditing van modelgedrag, de criteria voor het filteren van inhoud en de balans tussen lokale normatieve vereisten en algemene AI-ethiekprincipes, wat een open onderzoeksgebied blijft voor onafhankelijke onderzoekers.[17]

Vooruitzichten en onderzoeksrichtingen

Op basis van technische rapporten en verklaringen van Baidu worden de volgende ontwikkelingsrichtingen voor de ERNIE-serie onderscheiden:

  • Verdere multimodalisering (tekst–beeld–video–audio), waaronder de verwerking van dichte technische visuele gegevens (technische schema's, medische beelden).[3][4]
  • Combinatie van dichte en MoE-architecturen voor een balans tussen kwaliteit en rekenkunde-efficiëntie bij zeer grote totale modelomvangen.[3]
  • Ontwikkeling van agentsystemen (GenFlow, Famou) en tools voor gestructureerde generatie (JSON, API-aanroepen) voor integratie in productie-workflows.[3]
  • Verhoging van de trainingsefficiëntie: elastic training, verbeterde MoE-opschaling (MFU), kwantisering (W4A8, 2‑bit voor inzet op één GPU).[3]
  • Onderzoek naar het verminderen van vooroordelen in Chinese LLM's met inachtneming van cultuurspecifieke aspecten, en de ontwikkeling van benchmarkingmethoden voor de Chinese taal en multimodale taken.[16][17]
  • Verbetering van redeneren in lange context, verifieerbaar bekrachtigingsleren (verifiable RL) en domeinadaptatie met beperkte gegevens via synthetische corpora.[3][4]

Vergelijking met andere Chinese LLM's

ERNIE concurreert met een aantal grote Chinese LLM's, waaronder Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) en Tongyi Qianwen. De belangrijkste kenmerken van de ERNIE-serie zijn de nadruk op integratie van kennisgrafen in het voortrainen (knowledge enhancement), de nauwe integratie met het Baidu-ecosysteem (zoeken, cloud, API) en de gerichtheid op het PaddlePaddle-platform. Volgens onafhankelijke ranglijsten (SuperBench, LMArena) nemen de modellen van de ERNIE-serie hoge posities in onder Chinese LLM's, met name op het gebied van begrip en het opvolgen van instructies in het Chinees.[9][13][16]

Zie ook

  • BERT
  • Transformer-architectuur
  • RLHF

Literatuur

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.