ERNIE (Baidu) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — série předtrénovaných jazykových modelů (Large Language Model, LLM) a multimodálních základních modelů, vyvíjených společností Baidu od roku 2019 pod souhrnným názvem Enhanced Representation through kNowledge IntEgration (posílená reprezentace prostřednictvím integrace znalostí). Série je zaměřena na zvyšování kvality sémantického porozumění a generování díky explicitní integraci externích znalostí z grafů znalostí (Knowledge Graph, KG), ontologií a encyklopedií do procesu předtrénování.[1][2]

Modely série se vyvíjely od raných variant na bázi BERT s maskováním entit a frází (ERNIE 1.0, 2.0) přes rozsáhlé unifikované architektury (ERNIE 3.0, ERNIE 3.0 Titan) k multimodálním systémům na bázi Mixture-of-Experts (MoE) s otevřeným zdrojovým kódem (ERNIE 4.5) a nativním omnimodálním modelům (ERNIE 5.0). Série podporuje úlohy porozumění textu (Natural Language Understanding, NLU), generování textu (Natural Language Generation, NLG) a v pozdějších verzích také multimodální úlohy (text, obrázek, video, zvuk), s důrazem na čínský jazyk a podporou vícejazyčnosti.[2][3][4]

Historie a předpoklady

Vývoj série ERNIE začal v roce 2019 ve výzkumném oddělení Baidu jako reakce na úspěch modelu BERT (Devlin et al., 2018) a potřebu adaptace předtrénovaných modelů pro čínský jazyk, v němž absence explicitních mezer mezi slovy a vysoký podíl víceznačných znaků komplikují zachycení sémantických jednotek (entit, frází).[1]

ERNIE 1.0 (2019)

První model série (Sun et al., arXiv:1904.09223, duben 2019) představil strategii víceúrovňového maskování znalostí (knowledge masking) pro architekturu podobnou BERT: namísto náhodného maskování jednotlivých tokenů model maskuje celé entity a fráze, určené na základě rozpoznávání pojmenovaných entit (Named Entity Recognition, NER) a frázových vzorů.[1]

Architektura ERNIE 1.0 je založena na Transformer enkodéru (12 vrstev, skrytá dimenze 768, 12 hlav pozornosti). Dále byla zavedena úloha Dialogue Language Model (DLM) pro trénování na dialogových datech. Model byl trénován na ~173 milionech čínských vět z korpusů Wikipedia, Baidu Baike, zpráv a fóra Baidu Tieba. V době publikace dosáhla ERNIE 1.0 výsledků state‑of‑the‑art (SOTA) na pěti čínských úlohách NLP: XNLI (přesnost 78,4 % na testu oproti 77,2 % u BERT), MSRA‑NER (F1 93,8 % oproti 92,6 %).[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412, červenec 2019; přijato na konferenci AAAI 2020) zavedla framework kontinuálního víceúlohového předtrénování (continual multi‑task pre‑training), v němž jsou ke společnému transformeru postupně (inkrementálně) přidávány nové předtréninkové úlohy bez úplného přetrénování modelu.[5]

Předtréninkové úlohy ERNIE 2.0 jsou rozděleny do tří skupin:

  • Word‑aware — maskování znalostí (knowledge masking), předpověď velikosti písmen (capitalization prediction), vztah tokenu k dokumentu (token‑document relation).
  • Structure‑aware — přeuspořádání vět (sentence reordering), určení vzdálenosti mezi větami (sentence distance).
  • Semantic‑aware — předpověď diskurzivních vztahů (discourse relation prediction), relevance pro vyhledávání informací (IR relevance prediction).[5]

Model byl trénován na anglických a čínských korpusech (encyklopedie, knihy, Reddit, vyhledávací logy). Výsledky: průměrné skóre GLUE pro base model bylo 80,6 (oproti 78,3 u BERT), pro large model — 83,6; ERNIE 2.0 překonala BERT a XLNet na 16 úlohách.[5]

ERNIE 3.0 (2021)

Framework ERNIE 3.0 (Sun et al., arXiv:2107.02137, červenec 2021) spojil autoenkodérové (auto‑encoding, AE) a autoregresivní (auto‑regressive, AR) paradigma předtrénování v jediné architektuře, rozdělené na univerzální modul reprezentací (Universal Representation Module) a úlohově specifické moduly (Task‑specific Representation Modules) pro NLU a NLG.[2]

Model s 10 miliardami parametrů byl trénován na 4 TB čínského textu (11 kategorií: Baidu Baike, Wikipedia, vyhledávací logy, systémy otázek a odpovědí, doménové texty) a grafu znalostí s více než 50 miliony faktů. ERNIE 3.0 dosáhla SOTA na 54 čínských úlohách NLP; na anglickém benchmarku SuperGLUE — 90,6 % (k 3. červenci 2021, nad lidským referenčním výkonem 89,8 %).[2]

ERNIE 3.0 Titan (2021)

V práci „ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, prosinec 2021) je popsáno škálování frameworku ERNIE 3.0 na hustý (dense) model s 260 miliardami parametrů implementovaný na platformě PaddlePaddle.[6]

Titan zavedl další mechanismy: samosupervizovaný adversarial loss pro hodnocení věrohodnosti generovaného textu, controllable language modeling loss pro řízení stylu, tématu, tónu a délky generování, jakož i online distilaci (On‑the‑Fly Distillation, OFD) pro získání kompaktních modelů‑studentů v průběhu předtrénování. Model byl hodnocen na 68 datových sadách a podle autorů překonal předchozí modely na všech 68 datasetech.[6]

ERNIE Bot a komerční verze (2023–2025)

V březnu 2023 vydal Baidu chatbota ERNIE Bot (Wenxin Yiyan, 文心一言) na bázi modelů ERNIE 3.x a PLATO (dialogový model). Veřejný přístup byl otevřen v srpnu 2023 po schválení regulátory. Aktualizace zahrnovaly ERNIE 3.5 (červen 2023) a ERNIE 4.0 (říjen 2023).[7][8]

Podle zprávy SuperBench Univerzity Tsinghua obsadil ERNIE Bot 4.0 první místo mezi čínskými LLM podle souhrnné metriky, přičemž vykázal silné výsledky v porozumění čínského jazyka a dodržování instrukcí.[9][10]

V roce 2022 bylo paralelně s hlavní jazykovou řadou představeno multimodální rozšíření ERNIE‑ViLG 2.0 (arXiv:2210.15257) — model generování obrázků z textu (text‑to‑image), což byl jeden z prvních kroků směrem k multimodalitě.[11]

V roce 2024 na konferenci WAVE SUMMIT představil Baidu ERNIE 4.0 Turbo — optimalizovanou verzi pro vysokorychlostní aplikace schopnou generovat text o délce více než tisíc slov přibližně za 20 sekund při zachování kvality.[12]

ERNIE 4.5 (2025)

V červnu 2025 zveřejnil Baidu technickou zprávu ERNIE 4.5, která představuje rodinu 10 modelů: textové LLM a multimodální modely (Vision‑Language, VL). Architektura je založena na heterogenním Mixture-of-Experts (MoE) s rozdělením expertů podle modalit. Varianty zahrnují MoE modely s až 424 miliardami celkových a 47 miliardami aktivních parametrů, jakož i hustý model s 0,3 miliardami parametrů. Rodina byla vydána pod licencí Apache 2.0 na Hugging Face a GitHubu (PaddlePaddle/ERNIE).[3]

ERNIE 5.0 (2026)

V únoru 2026 byla zveřejněna technická zpráva ERNIE 5.0 (arXiv:2602.04705) — nativní omnimodální autoregresivní model s ultra-řídkým MoE (ultra‑sparse MoE), podporující společné modelování textu, obrázků, zvuku a videa. Model obsazoval vysoké pozice na žebříčku LMArena.[4][13]

Teoretické základy a architektonické principy

Maskování znalostí (Knowledge Masking)

Klíčovým principem raných modelů série je integrace strukturovaných znalostí do procesu předtrénování prostřednictvím modifikovaných strategií maskování. Na rozdíl od standardního Masked Language Modeling (MLM), kde jsou maskovány jednotlivé tokeny, ERNIE 1.0 maskuje celé sémantické jednotky: entity (určované přes NER) a fráze. Pro entitu E={t1,,tk} je celá sekvence tokenů maskována s danou pravděpodobností p. Tento přístup nutí model spoléhat se na širší kontext a naučit se vztahy mezi entitami.[1]

ERNIE 2.0 tento přístup rozvinula přidáním inkrementálního víceúlohového trénování: úlohy lexikální, strukturální a sémantické úrovně jsou přidávány postupně, přičemž dříve naučené znalosti jsou zachovány díky mechanismu kontinuálního předtrénování (continual pre‑training).[5]

Unifikovaný framework ERNIE 3.0

Framework ERNIE 3.0 je založen na rozdělení architektury do dvou úrovní:[2][6]

  • Universal Representation Module — společný vícevrstvý Transformer‑XL, trénovaný na různorodých předtréninkových úlohách a extrahující společné lexikální a syntaktické příznaky. Ve verzi Titan tento modul obsahuje 48 vrstev, skrytou reprezentaci o velikosti 12288, 192 hlav pozornosti a vnitřní velikost feed‑forward sítě 196608 (16imesdmodel).
  • Task‑specific Representation Modules — samostatné moduly pro NLU (obousměrná pozornost) a NLG (jednosměrná pozornost s rekurentní pamětí Transformer‑XL), každý s 12 vrstvami, velikostí skrytého vektoru 768 a 12 hlavami pozornosti.

Integrace autoenkodérového a autoregresivního paradigmatu umožňuje jednomu modelu dosahovat vysokých výsledků jak na NLU benchmarcích (úlohy podobné BERT), tak na NLG benchmarcích (úlohy podobné GPT).[2]

Universal Knowledge‑Text Prediction (UKTP)

Úloha UKTP je ústředním mechanismem integrace znalostí v ERNIE 3.0/Titan. Model dostane dvojici (trojice z grafu znalostí, věta z encyklopedie) a musí buď předpovědět vztah v trojici pomocí textu, nebo předpovědět maskované tokeny v textu pomocí informací z trojice.[6]

Při předpovědi vztahu r v trojici (h,r,t) spojené s textem x je úloha formulována jako víceřídná klasifikace:

Pheta(rx,h,t)=softmax(Wfheta(x,h,t)+b)

kde fheta — výstup transformeru na pozicích zmínek hlavní a ocasní entity, W,b — parametry klasifikátoru, heta — parametry modelu.[6]

Mechanismy věrohodné a řízené generace (Titan)

ERNIE 3.0 Titan zavedl dva dodatečné typy ztrátových funkcí.[6]

Samosupervizovaný adversarial loss. Je sestavena datová sada Da={Dextoriginal,Dextgenerated}, kde Dextoriginal — skutečné odstavce a Dextgenerated — texty generované předchozí verzí ERNIE z prefixu původních odstavců. Úlohou je binární klasifikace (originál / generace) podle skrytého stavu speciálního tokenu [CLS]:

La(Da)=n=1|Da|logPheta(yn=Ih[CLS](n)Dextoriginalh[CLS](n))

kde h[CLS](n) — vektorová reprezentace [CLS] pro n‑tý příklad, I — indikátor příslušnosti k původním textům.[6]

Controllable language modeling loss. Každý tréninkový příklad je doprovázen sadou atributů (prompt) popisujících žánr, téma, klíčová slova, tón a délku. Ztráta kombinuje nepodmíněné a podmíněné jazykové modelování:

Failed to parse (unknown function "\begin{cases}"): {\displaystyle L_c(D_c) = \begin{cases} -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}), & ext{если } p \le 0{,}5,\\ -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}, ext{prompts}_n), & ext{если } p > 0{,}5, \end{cases}}

kde p — náhodná veličina pro střídání režimů, xt(n)t‑tý token n‑tého příkladu. Tato definice zabraňuje nadměrné závislosti modelu na promptech.[6]

Heterogenní MoE architektura (ERNIE 4.5)

ERNIE 4.5 zavádí heterogenní multimodální architekturu Mixture-of-Experts s rozdělením expertů podle modalit: textové experti a vizuální experti (poslední mají přibližně 1/3 velikosti textových). Směrování tokenů je prováděno s izolací podle modality (modality‑isolated routing) a aplikací ortogonalizačního penálního členu pro směrovač (router orthogonalization loss, koeficient řádu 103) pro zajištění specializace expertů. Používá se 3D RoPE (Rotary Position Embeddings) pro poziční kódování časové, výškové a šířkové dimenze ve video datech. Mechanismus FlashMask je aplikován pro efektivní práci s dlouhým kontextem (až 131 tisíc tokenů) s maskami O(N).[3]

Předtrénování ERNIE 4.5 probíhá v několika fázích: nejprve trénování pouze na textových datech, poté na vizuálních datech a v závěrečné fázi — společné trénování na multimodálních datech (text‑only → vision‑only → joint). Pro zpracování obrázků je použit adaptivní ViT enkodér (Vision Transformer) s mechanismem pixel shuffle pro vyrovnání reprezentací různých modalit. Je podporováno zpracování dlouhých videí (až 32 tisíc tokenů) s adaptivním vzorkováním snímků (adaptive frame sampling).[3]

Nativní omnimodalita (ERNIE 5.0)

ERNIE 5.0 implementuje nativní autoregresivní modelování více modalit (text, obrázek, zvuk, video) v jediné architektuře s ultra-řídkým MoE, v němž je v každém kroku aktivováno méně než 3 % z celkového počtu expertů. Jako předtréninková úloha je použita Next‑Group‑of‑Tokens Prediction — předpověď skupiny tokenů namísto jednoho, což zvyšuje efektivitu trénování. Pro zvukovou modalitu je aplikován hierarchický kodek (hierarchical codec). Technologie elastic training umožňuje generovat sub-modely s různou hloubkou, šířkou a mírou řídkosti v rámci jediného tréninkového běhu.[4]

Předtréninkové úlohy a data

Předtréninkové úlohy ERNIE 3.0 / Titan

V ERNIE 3.0 a Titan jsou používány následující skupiny předtréninkových úloh:[2][6]

Word‑aware úlohy:

  • Knowledge Masked Language Modeling — frázové a entitní maskování pro trénování závislostí v lokálním a globálním kontextu.
  • Document Language Modeling — autoregresivní modelování dokumentů s délkou až 512 tokenů a využitím rekurentní paměti Transformer‑XL.

Structure‑aware úlohy:

  • Sentence Reordering — pro odstavec náhodně rozdělený na m segmentů a zamíchaný model řeší úlohu k‑třídní klasifikace s k=n=1mn!, čímž obnovuje původní pořadí.
  • Sentence Distance — 3‑třídní klasifikace: sousední věty, nesousední ve stejném dokumentu, věty z různých dokumentů.

Knowledge‑aware úlohy:

  • Universal Knowledge‑Text Prediction (UKTP) — společné modelování textu a trojice grafu znalostí.
  • Credible and Controllable Generations — kombinace adversarial loss a controllable LM loss.

Předtréninkové datové sady

Pro ERNIE 3.0/Titan je použit ERNIE 3.0 Corpus — čínský korpus o objemu přibližně 4 TB ve 11 kategoriích, zahrnující webové stránky, vyhledávací logy, data otázek a odpovědí, beletristické, právní, finanční a lékařské texty, novely a poezii. Na základě korpusu byl sestaven graf znalostí s více než 50 miliony faktů.[2][6]

Pro Titan jsou dále sestaveny:

  • Adversarial dataset — 2 miliony původních odstavců a odpovídající „negativní" odstavce generované modelem ERNIE 3.0 z prefixu prvních 1–3 vět originálu o délce až 512 tokenů.
  • Controllable dataset — texty opatřené atributy žánru, tématu (26 tematických okruhů), klíčových slov, tónu (positive/negative/neutral) a délky. Atributy žánru jsou kódovány trénovatelnými „měkkými prompty" (počet promptů pro žánr je náhodně vybírán od 0 do 64).[6]

Pozdější verze (ERNIE 4.5, 5.0) využívají rozšířené multimodální korpusy (text, obrázky, video, zvuk), včetně kurátorovaného webového obsahu, vědeckých publikací a syntetických dat.[3][4]

Trénování a distribuovaná optimalizace

Předtrénování ERNIE 3.0 Titan bylo prováděno s použitím optimalizátoru Adam (rychlost učení 104, β1=0,9, β2=0,95, L2 regularizace 0,1, ořez normy gradientu na 1,0), maximální délky kontextu 512 a délky rekurentní paměti 128 pro generativní úlohy. Byl aplikován progresivní tréninkový plán (urychlená konvergence v prvních 4000 krocích) a lineární pokles rychlosti učení.[6]

4D hybridní paralelizace

Pro trénování hustého modelu s 260 miliardami parametrů na heterogenních clusterech (GPU NVIDIA V100 a NPU Ascend 910) byla v PaddlePaddle implementována 4D hybridní paralelizace:[6]

  • Data parallelism (DP) — replikace modelu na více zařízeních se samostatným zpracováním dávek.
  • Tensor model parallelism (MP) — rozdělení parametrů a aktivací transformeru uvnitř vrstev mezi zařízení.
  • Pipeline model parallelism (PP) — distribuce vrstev modelu do řetězu zpracování.
  • Group Sharded — zdokonalená varianta ZeRO‑podobného sharded‑data‑parallel pro snížení duplikace stavů optimalizátoru.

Zpráva uvádí data o slabé škálovatelnosti až na tisíce karet Ascend 910 s efektivitou přibližně 91,7 % v propustnosti.[6]

Trénování ERNIE 4.5

Trénování ERNIE 4.5 probíhalo na clusteru 2016 GPU NVIDIA H800 s dosažením Model FLOPs Utilization (MFU) 47 %. Byla použita smíšená přesnost FP8, odolné kontrolní body (Zero Cost Checkpoint, obnova za méně než 8 minut) a progresivní trénování s postupným prodlužováním sekvencí a zvětšováním velikosti dávky.[3]

Online distilace

Pro snížení výpočetních nároků při nasazení ERNIE 3.0 Titan je použita online distilace, při níž jsou model‑učitel a několik modelů‑studentů trénovány současně:[6]

  • On‑the‑Fly Distillation (OFD) — logity a reprezentace učitele jsou využívány k trénování studentů ve stejných tréninkových krocích.
  • Teacher assistants — modely středních velikostí snižující kapacitní rozdíl mezi učitelem a koncovými studenty.
  • Auxiliary Layer Distillation (ALD) — doplňková vrstva ve studentovi, která je při fine‑tuningu odstraněna, pro lepší shodu vnitřních reprezentací.

Posttrénování a zarovnání

Komerční verze ERNIE (počínaje ERNIE Bot) procházejí fázemi posttrénování:[7][3]

  • Supervised Fine‑Tuning (SFT) — dotrénování na označených instrukčních datech (v ERNIE 4.5 — 2,3 milionu příkladů).
  • Reinforcement Learning from Human Feedback (RLHF) — zarovnání chování modelu pomocí zpětné vazby od člověka; jsou aplikovány algoritmy PPO (Proximal Policy Optimization) a DPO (Direct Preference Optimization).
  • Unified Preference Optimization (UPO) — unifikovaná metoda optimalizace preferencí zavedená v ERNIE 4.5.
  • Reinforcement Learning with Verifiers (RLVR) — posilované učení s využitím verifikátorů pro ověření správnosti odpovědí; je aplikována metoda GRPO (Group Relative Policy Optimization).
  • Režimy uvažování (thinking modes) — modely 4.5 podporují režimy s uvažováním (reflection, planning) i bez něj.

Klíčové výsledky a benchmarky

Přehledná tabulka vývoje modelů

Verze Rok Parametry Architektura Klíčové benchmarky Zdroj
ERNIE 1.0 2019 ~110 mil. (base) Transformer enkodér (podobný BERT) XNLI 78,4 %; MSRA‑NER F1 93,8 % [1]
ERNIE 2.0 2019 ~110–340 mil. Continual multi‑task GLUE 80,6 (base) / 83,6 (large); 16 úloh SOTA [5]
ERNIE 3.0 2021 10 mld. Unified Transformer‑XL (AE+AR) SuperGLUE 90,6 % (> human 89,8 %); 54 čín. úloh SOTA [2]
ERNIE 3.0 Titan 2021 260 mld. (dense) Dense + controllable generation 68 datasetů SOTA; zero/few‑shot [6]
ERNIE 4.5 2025 0,3–424 mld. (MoE, 47 mld. akt.) Heterogeneous multimodal MoE C‑Eval 90,6 %; MMLU 86,5 %; MMMU 67,3–70 % [3]
ERNIE 5.0 2026 ~2,4 bil. (ultra‑sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (top‑10 globálně) [4]

Výsledky ERNIE 3.0 a Titan

ERNIE 3.0 (10 miliard parametrů) na anglickém benchmarku SuperGLUE dosáhla průměrného výsledku 90,6, který překonává lidský referenční výkon (89,8) a výsledky GPT‑3, T5 a DeBERTa v době publikace. ERNIE 3.0 Titan (260 miliard) byla hodnocena na 68 datových sadách, včetně úloh klasifikace, NLI, QA a generování; autoři uvádějí, že model překonává předchozí modely na všech 68 datasetech. Tyto výsledky jsou údaji z primárních zdrojů; nezávislé ověření je popsáno omezeně.[2][6]

Výsledky ERNIE 4.5

Podle technické zprávy z roku 2025 vykazuje ERNIE 4.5 (300B‑A47B, po posttrénování) následující výsledky na textových a multimodálních benchmarcích:[3]

Benchmark ERNIE‑4.5‑300B‑A47B Podmínky
C‑Eval 90,6 % 5‑shot
CMMLU 90,2 %
MMLU 86,5 % standardní
IFEval 88,0 % instruction following
GSM8K 91,8 %
MMMU 67,3–70,0 % non‑thinking / thinking
MathVista 78,8 % thinking mode
OCRBench 883

Podle zprávy ERNIE 4.5 překonala DeepSeek‑V3 na 22 z 28 benchmarků; multimodální varianty (ERNIE‑4.5‑VL‑424B‑A47B) vykázaly konkurenceschopné výsledky na úlohách vizuálního uvažování. V řadě úloh vizuálního uvažování a technické interpretace obrázků (analýza schémat, technických výkresů) jsou uváděny výsledky vyšší než u některých modelů GPT a Gemini.[3][14]

Srovnání ERNIE 4.5 s konkurenty (vybrané benchmarky, po posttrénování, podle technické zprávy 2025):

Benchmark ERNIE‑4.5‑300B‑A47B DeepSeek‑V3‑671B‑A37B Qwen3‑235B‑A22B Poznámka
C‑Eval 90,6 % 5‑shot
MMLU 86,5 % srovnatelně standardní
IFEval 88,0 % 83,2 % instruction following
MMMU 67,3–70,0 % thinking / non‑thinking
MathVista 78,8 % 77,6 % (Qwen2.5‑VL) thinking mode

Podmínky reprodukce: standardní protokoly (5‑shot / zero‑shot); datové sady otevřené (C‑Eval 2023+, MMLU, MMMU). Pomlčka („—") znamená, že srovnatelné údaje za stejných podmínek ve zprávě nejsou uvedeny.[3]

Hodnocení ERNIE Bot 4.0

Zpráva SuperBench Univerzity Tsinghua řadí komerční LLM podle souboru úloh (jazykové porozumění, matematika, programování, multitasking). ERNIE Bot 4.0 obsadil první místo mezi čínskými modely, předstihuje GLM‑4 (Zhipu AI) přibližně o 0,41 bodu v souhrnné metrice; modely GPT‑4 a Anthropic Claude‑3 zůstávaly výše v globálním žebříčku. ERNIE Bot 4.0 vykazoval silné výsledky v porozumění čínského textu a dodržování instrukcí při slabších výsledcích v programování a některých anglických úlohách.[9][10]

Aplikace

Produkty a služby Baidu

Modely série ERNIE jsou integrovány do ekosystému produktů Baidu:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — chatbot s podporou multimodální generace (text, obrázky, video, zvuk). Podle údajů Baidu počet měsíčně aktivních uživatelů přesahuje 200 milionů (2024–2025). Od roku 2025 je ERNIE Bot dostupný zdarma.[7]
  • Vyhledávač Baidu — generování odpovědí a AI funkce ve výsledcích vyhledávání; podle údajů Baidu je až 70 % výsledků obohaceno AI komponentami.
  • Qianfan (MaaS platforma) — API pro firemní zákazníky; podle údajů Baidu platformu využívá více než 760 tisíc podniků, denní počet volání API přesahuje 1,5 miliardy (2024). Mezi zákazníky patří Lenovo, Trip.com a další.[7]
  • Comate — AI asistent pro programování.
  • Wenxin Yige — generování obrázků na bázi modelů ERNIE‑ViLG.[11]
  • Integrace s externími partnery: Samsung Galaxy (pro čínský trh), digitální avatary, zásuvné moduly (vyhledávání, analýza souborů).[7]

Odvětvové aplikace

Modely jsou využívány v následujících oblastech:[7][3]

  • Systémy otázek a odpovědí v doménových oblastech (právo, medicína, finance) s využitím znalostně posíleného předtrénování.
  • Generování a editace textů v čínském jazyce (zpravodajství, marketingové texty, kreativní obsah).
  • Multimodální úlohy: analýza obrázků, technických schémat, videa a tabulkových dat (ve verzích 4.5 a vyšších).
  • Vzdělávání (personalizovaná výuka), robotika (plánování úloh), autonomní řízení (Apollo).

Otevřený zdrojový kód

Počínaje ERNIE 4.5 jsou všech 10 variant rodiny vydáno pod licencí Apache 2.0 s nástrojovou sadou ERNIEKit (podpora SFT, LoRA, DPO, inference na PaddlePaddle/FastDeploy). Kód starších verzí (ERNIE 1.0–3.0) je dostupný na GitHubu PaddlePaddle/ERNIE.[3][15]

Omezení a otevřené problémy

Architektonická a datová omezení

ERNIE 3.0 Titan při 260 miliardách parametrů je omezena délkou kontextu 512 tokenů pro jednotlivý modul, což omezuje modelování dlouhých textů bez dodatečných mechanismů (chunking, externí paměť). Trénování probíhá převážně na čínském korpusu, což vede k nerovnoměrné kvalitě mezi čínštinou a ostatními jazyky.[6]

Integrace grafu znalostí zlepšuje práci se strukturovanými fakty, avšak přesnost a úplnost znalostí jsou omezeny kvalitou samotného grafu a procedurou párování „trojice–text" (entity linking, relation alignment), což v některých případech vede k chybným nebo neúplným asociacím.[6]

Halucinace a věrohodnost

Adversarial loss a controllable LM loss zlepšují odolnost vůči nevěrohodným generacím, avšak zcela eliminovat problém halucinací (generování fakticky nesprávných tvrzení) se nepodaří. Parametry adversarial klasifikátoru jsou trénovány na datech, kde „generovaný" text vytváří předchozí verze ERNIE, což omezuje spektrum rozpoznávaných chybných vzorů.[6]

Společenské předsudky

Studie publikovaná v PeerJ Computer Science (2025) analyzuje společenské předsudky v čínských LLM (ERNIE a Qwen) s využitím 240 společenských skupin a více než 30 tisíc vygenerovaných popisů. Výsledky ukazují, že ERNIE generuje méně negativního a stereotypního obsahu než Baidu Search nebo Qwen (přibližně 1/10 kandidátních slov s negativní konotací u ERNIE oproti 1/3 u Qwen). Zároveň určitá míra výskytu stereotypů, včetně potenciálně urážlivých popisů, přetrvává.[16][17]

Reprodukovatelnost

Část modelů série (ERNIE 3.0 Titan, komerční ERNIE Bot 4.0 a 5.0) není dostupná ve formě plně otevřeného kódu a vah, což omezuje reprodukovatelnost benchmarků a možnost nezávislého hodnocení. S vydáním ERNIE 4.5 pod Apache 2.0 se situace zlepšila, avšak architektury a nastavení trénování se mohou lišit od popsaných v raných publikacích.[3][6]

Bezpečnost v medicíně

Výzkumy využití ERNIE Bot v medicínských scénářích (Si et al., 2025) odhalily tendenci k nadměrným doporučením: 91,9 % zbytečných testů a 57,8 % zbytečných medikamentů v modelových scénářích, jakož i věkové a socioekonomické disproporce v doporučeních.[18]

Etické a regulatorní aspekty

Modely série ERNIE fungují v rámci čínské regulace generativní AI, zejména „Dočasných opatření pro správu generativních AI služeb" (Interim Measures for Generative AI Services, 2023), která stanovují povinné hodnocení bezpečnosti, registraci algoritmů a omezení obsahu.[7][17]

ERNIE Bot vykazuje vysokou míru odmítnutí dotazů týkajících se citlivých politických témat v souladu s národní legislativou. Výzkumy (Pan et al., 2026) analyzují politickou cenzuru v LLM čínského původu, včetně modelů Baidu.[19]

Publikace Baidu ne vždy podrobně popisují postupy auditu chování modelů, kritéria filtrování obsahu a rovnováhu mezi místními regulačními požadavky a obecnými principy etiky AI, což zůstává otevřenou oblastí pro nezávislý výzkum.[17]

Výhledy a směry výzkumu

Na základě technických zpráv a prohlášení Baidu jsou identifikovány následující směry rozvoje série ERNIE:

  • Další multimodalizace (text–obrázek–video–zvuk), včetně zpracování hustých technických vizuálních dat (technické výkresy, lékařské snímky).[3][4]
  • Kombinování hustých a MoE architektur pro rovnováhu mezi kvalitou a výpočetní efektivitou při velmi velkých celkových velikostech modelů.[3]
  • Rozvoj agentních systémů (GenFlow, Famou) a nástrojů pro strukturovanou generaci (JSON, volání API) pro integraci do produkčních pracovních postupů.[3]
  • Zvyšování efektivity trénování: elastic training, zlepšené škálování MoE (MFU), kvantování (W4A8, 2‑bit pro nasazení na jednom GPU).[3]
  • Výzkum snižování předsudků v čínských LLM s ohledem na kulturně specifické aspekty a rozvoj metodiky benchmarkingu pro čínský jazyk a multimodální úlohy.[16][17]
  • Zlepšení uvažování v dlouhém kontextu, ověřitelné posilované učení (verifiable RL) a adaptace na domény s omezenými daty prostřednictvím syntetických korpusů.[3][4]

Srovnání s jinými čínskými LLM

ERNIE konkuruje řadě velkých čínských LLM, mezi nimiž jsou Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) a Tongyi Qianwen. Hlavními odlišnostmi série ERNIE jsou důraz na integraci grafů znalostí do předtrénování (knowledge enhancement), těsná integrace s ekosystémem Baidu (vyhledávání, cloud, API) a orientace na platformu PaddlePaddle. Podle výsledků nezávislých žebříčků (SuperBench, LMArena) zaujímají modely série ERNIE vysoké pozice mezi čínskými LLM, zejména v úlohách porozumění a dodržování instrukcí v čínském jazyce.[9][13][16]

Viz také

  • BERT
  • Architektura Transformer
  • RLHF

Literatura

Poznámky

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.