ERNIE (Baidu) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — isang serye ng mga pre-trained na language model (Large Language Model, LLM) at multimodal na pundamental na modelo, na pinauunlad ng kumpanyang Baidu mula pa noong 2019 sa ilalim ng pangkalahatang pangalang Enhanced Representation through kNowledge IntEgration (pinahusay na representasyon sa pamamagitan ng integrasyon ng kaalaman). Ang serye ay nakatuon sa pagpapabuti ng kalidad ng semantic na pag-unawa at pagbuo sa pamamagitan ng malinaw na integrasyon ng panlabas na kaalaman mula sa mga knowledge graph (Knowledge Graph, KG), ontolohiya, at ensiklopedya sa proseso ng pre-training.[1][2]

Ang mga modelo ng serye ay nag-evolve mula sa mga maagang bersyon batay sa BERT na may entity at phrase masking (ERNIE 1.0, 2.0), sa pamamagitan ng malalaking pinag-isang arkitektura (ERNIE 3.0, ERNIE 3.0 Titan), patungo sa multimodal na mga sistema batay sa Mixture-of-Experts (MoE) na may bukas na source code (ERNIE 4.5) at mga native na omnimodal na modelo (ERNIE 5.0). Sinusuportahan ng serye ang mga gawain ng pag-unawa sa teksto (Natural Language Understanding, NLU), pagbuo ng teksto (Natural Language Generation, NLG), at sa mga huling bersyon, ang mga multimodal na gawain (teksto, larawan, video, audio), na may pagtuon sa wikang Tsino at suporta sa maraming wika.[2][3][4]

Kasaysayan at mga Paunang Kondisyon

Ang pagbuo ng serye ng ERNIE ay nagsimula noong 2019 sa dibisyon ng pananaliksik ng Baidu bilang tugon sa tagumpay ng modelo ng BERT (Devlin et al., 2018) at sa pangangailangan na iakma ang mga pre-trained na modelo para sa wikang Tsino, kung saan ang kawalan ng malinaw na mga puwang sa pagitan ng mga salita at ang mataas na proporsyon ng mga maraming kahulugang character ay nagpapahirap sa pagkuha ng mga semantic na yunit (mga entidad, mga parirala).[1]

ERNIE 1.0 (2019)

Ang unang modelo ng serye (Sun et al., arXiv:1904.09223, Abril 2019) ay nagpakilala ng estratehiya ng multi-level knowledge masking para sa arkitekturang katulad ng BERT: sa halip na random na masking ng mga indibidwal na token, ang modelo ay nagtatakip ng buong mga entidad at parirala na tinutukoy batay sa Named Entity Recognition (NER) at mga phrasal pattern.[1]

Ang arkitektura ng ERNIE 1.0 ay batay sa Transformer encoder (12 layer, nakatagong dimensyon 768, 12 attention head). Bukod pa rito, ipinakilala ang gawain ng Dialogue Language Model (DLM) para sa pagsasanay sa mga datos ng diyalogo. Ang modelo ay sinanay sa ~173 milyong pangungusap sa wikang Tsino mula sa mga corpus ng Wikipedia, Baidu Baike, balita, at forum ng Baidu Tieba. Sa oras ng publikasyon, nakamit ng ERNIE 1.0 ang mga resulta ng state-of-the-art (SOTA) sa limang gawain ng Chinese NLP: XNLI (katumpakan 78.4% sa pagsubok kumpara sa 77.2% ng BERT), MSRA-NER (F1 93.8% kumpara sa 92.6%).[1]

ERNIE 2.0 (2019)

Ang ERNIE 2.0 (Sun et al., arXiv:1907.12412, Hulyo 2019; tinanggap sa kumperensya ng AAAI 2020) ay nagpakilala ng framework ng patuloy na multi-task pre-training (continual multi-task pre-training), kung saan ang mga bagong gawain sa pre-training ay sunud-sunod (incremental) na idinaragdag sa karaniwang transformer nang hindi ganap na muling sinasanay ang modelo.[5]

Ang mga gawain sa pre-training ng ERNIE 2.0 ay nahahati sa tatlong grupo:

  • Word-aware — knowledge masking, capitalization prediction, token-document relation.
  • Structure-aware — pagkakasunud-sunod ng mga pangungusap (sentence reordering), pagpapasiya ng distansya sa pagitan ng mga pangungusap (sentence distance).
  • Semantic-aware — discourse relation prediction, IR relevance prediction.[5]

Ang modelo ay sinanay sa mga corpus sa Ingles at Tsino (mga ensiklopedya, libro, Reddit, mga log ng paghahanap). Mga resulta: ang average na marka ng GLUE para sa base na modelo ay 80.6 (kumpara sa 78.3 ng BERT), para sa large na modelo — 83.6; nalampasan ng ERNIE 2.0 ang BERT at XLNet sa 16 na gawain.[5]

ERNIE 3.0 (2021)

Ang framework ng ERNIE 3.0 (Sun et al., arXiv:2107.02137, Hulyo 2021) ay pinagsama ang auto-encoding (AE) at auto-regressive (AR) na paradigma ng pre-training sa isang pinag-isang arkitektura, na nahahati sa Universal Representation Module at mga task-specific na module (Task-specific Representation Modules) para sa NLU at NLG.[2]

Ang modelo na may 10 bilyong parameter ay sinanay sa 4 TB ng tekstong Tsino (11 kategorya: Baidu Baike, Wikipedia, mga log ng paghahanap, mga sistema ng tanong-at-sagot, mga teksto ng domain) at isang knowledge graph na may mahigit 50 milyong katotohanan. Nakamit ng ERNIE 3.0 ang SOTA sa 54 na gawain ng Chinese NLP; sa benchmark na SuperGLUE sa Ingles — 90.6% (noong Hulyo 3, 2021, mas mataas kaysa sa human baseline na 89.8%).[2]

ERNIE 3.0 Titan (2021)

Sa papel na "ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, Disyembre 2021) ay inilalarawan ang pag-scale ng framework ng ERNIE 3.0 sa isang dense na modelo na may 260 bilyong parameter, na isinagawa sa platform ng PaddlePaddle.[6]

Ipinakilala ng Titan ang mga karagdagang mekanismo: self-supervised adversarial loss para sa pagsusuri ng pagiging kapani-paniwala ng nabuong teksto, controllable language modeling loss para sa pamamahala ng istilo, paksa, tono, at haba ng pagbuo, pati na rin ang online distillation (On-the-Fly Distillation, OFD) para sa pagkuha ng mga compact na student model sa panahon ng pre-training. Ang modelo ay sinuri sa 68 dataset at, ayon sa mga may-akda, nalampasan ang mga nakaraang modelo sa lahat ng 68 dataset.[6]

ERNIE Bot at mga Komersyal na Bersyon (2023–2025)

Noong Marso 2023, inilabas ng Baidu ang chatbot na ERNIE Bot (Wenxin Yiyan, 文心一言) batay sa mga modelo ng ERNIE 3.x at PLATO (modelo ng diyalogo). Ang pampublikong access ay binuksan noong Agosto 2023 pagkatapos ng pag-apruba ng mga regulator. Kasama sa mga update ang ERNIE 3.5 (Hunyo 2023) at ERNIE 4.0 (Oktubre 2023).[7][8]

Ayon sa ulat ng SuperBench ng Unibersidad ng Tsinghua, ang ERNIE Bot 4.0 ay nanguna sa mga Chinese LLM ayon sa pinagsamang sukatan, na nagpakita ng malakas na mga resulta sa pag-unawa sa wikang Tsino at pagsunod sa mga tagubilin.[9][10]

Noong 2022, kasabay ng pangunahing linyang pangwika, ipinakita ang multimodal na extension na ERNIE-ViLG 2.0 (arXiv:2210.15257) — isang modelo ng pagbuo ng larawan mula sa teksto (text-to-image), na isa sa mga unang hakbang tungo sa multimodality.[11]

Noong 2024, sa kumperensya ng WAVE SUMMIT, ipinakita ng Baidu ang ERNIE 4.0 Turbo — isang optimisadong bersyon para sa mataas na bilis na mga aplikasyon, na kayang bumuo ng teksto na mahigit isang libong salita sa loob ng humigit-kumulang 20 segundo habang pinapanatili ang kalidad.[12]

ERNIE 4.5 (2025)

Noong Hunyo 2025, inilathala ng Baidu ang teknikal na ulat ng ERNIE 4.5, na kumakatawan sa pamilya ng 10 modelo: mga tekstuwal na LLM at multimodal na modelo (Vision-Language, VL). Ang arkitektura ay batay sa heterogeneous Mixture-of-Experts (MoE) na may paghihiwalay ng mga eksperto ayon sa modalidad. Kasama sa mga variant ang mga MoE na modelo na may hanggang 424 bilyong kabuuan at 47 bilyong aktibong parameter, pati na rin ang isang dense na modelo na may 0.3 bilyong parameter. Ang pamilya ay inilabas sa ilalim ng lisensya ng Apache 2.0 sa Hugging Face at GitHub (PaddlePaddle/ERNIE).[3]

ERNIE 5.0 (2026)

Noong Pebrero 2026, inilathala ang teknikal na ulat ng ERNIE 5.0 (arXiv:2602.04705) — isang native na omnimodal na autoregressive na modelo na may ultra-sparse MoE, na sumusuporta sa pinagsamang pagmomodelo ng teksto, larawan, audio, at video. Ang modelo ay nasa mataas na posisyon sa leaderboard ng LMArena.[4][13]

Teoretikal na Pundasyon at mga Prinsipyo ng Arkitektura

Knowledge Masking - Pagtatakip ng Kaalaman

Ang pangunahing prinsipyo ng mga maagang modelo ng serye — ang integrasyon ng nakabalangkas na kaalaman sa proseso ng pre-training sa pamamagitan ng mga binagong estratehiya ng masking. Sa kaibahan ng karaniwang Masked Language Modeling (MLM), kung saan ang mga indibidwal na token ay natatakpan, ang ERNIE 1.0 ay nagtatakip ng buong mga semantic na yunit: mga entidad (tinutukoy sa pamamagitan ng NER) at mga parirala. Para sa entidad na E={t1,,tk} ang buong pagkakasunud-sunod ng mga token ay natatakpan na may ibinigay na posibilidad na p. Ang ganitong diskarte ay pinipilit ang modelo na umasa sa mas malawak na konteksto at matuto ng mga ugnayan sa pagitan ng mga entidad.[1]

Pinahusay ng ERNIE 2.0 ang diskarteng ito sa pamamagitan ng pagdaragdag ng incremental na multi-task na pagsasanay: ang mga gawain ng leksikal, istruktura, at semantic na antas ay idinaragdag nang sunud-sunod, habang ang mga natutunan nang kaalaman ay pinapanatili salamat sa mekanismo ng continual pre-training.[5]

Pinag-isang Framework ng ERNIE 3.0

Ang framework ng ERNIE 3.0 ay batay sa paghahati ng arkitektura sa dalawang antas:[2][6]

  • Universal Representation Module — isang karaniwang multi-layer na Transformer-XL, na sinagsanay sa iba't ibang gawain ng pre-training at nagkukuha ng mga karaniwang leksikal at syntactic na tampok. Sa bersyon ng Titan, ang module na ito ay naglalaman ng 48 layer, nakatagong representasyon na may sukat na 12288, 192 attention head, at panloob na laki ng feed-forward network na 196608 (16×dmodel).
  • Task-specific Representation Modules — mga hiwalay na module para sa NLU (bidirectional attention) at NLG (unidirectional attention na may recurrent memory ng Transformer-XL), bawat isa ay may 12 layer, laki ng nakatagong vector na 768 at 12 attention head.

Ang integrasyon ng auto-encoding at auto-regressive na paradigma ay nagbibigay-daan sa isang modelo na makamit ang mataas na resulta sa mga NLU benchmark (mga gawaing katulad ng BERT) at sa mga NLG benchmark (mga gawaing katulad ng GPT).[2]

Universal Knowledge-Text Prediction (UKTP)

Ang gawain ng UKTP ay ang pangunahing mekanismo ng integrasyon ng kaalaman sa ERNIE 3.0/Titan. Ang modelo ay tumatanggap ng pares (triple mula sa knowledge graph, pangungusap mula sa ensiklopedya) at kailangang hulaan ang ugnayan sa triple gamit ang teksto, o hulaan ang mga natatakpan na token sa teksto gamit ang impormasyon mula sa triple.[6]

Sa paghula ng ugnayan na r sa triple na (h,r,t), na nauugnay sa teksto na x, ang gawain ay binubuo bilang isang multi-class na klasipikasyon:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

kung saan ang fθ — ang output ng transformer sa mga posisyon ng mga pagbanggit ng head at tail na entidad, W,b — mga parameter ng classifier, θ — mga parameter ng modelo.[6]

Mga Mekanismo ng Mapagkakatiwalaang at Kontroladong Pagbuo (Titan)

Ipinakilala ng ERNIE 3.0 Titan ang dalawang karagdagang uri ng loss function.[6]

Self-supervised adversarial loss. Isang dataset na Da={Doriginal,Dgenerated} ay nabubuo, kung saan ang Doriginal — mga tunay na talata, at ang Dgenerated — mga teksto na nabuo ng nakaraang bersyon ng ERNIE batay sa prefix ng mga orihinal na talata. Ang gawain — binary na klasipikasyon (orihinal / nabuo) batay sa nakatagong estado ng espesyal na token na [CLS]:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

kung saan ang h[CLS](n) — vector na representasyon ng [CLS] para sa n-th na halimbawa, I — tagapagpahiwatig ng pagkabilang sa mga orihinal na teksto.[6]

Controllable language modeling loss. Ang bawat halimbawa ng pagsasanay ay sinasamahan ng isang hanay ng mga katangian (prompt), na naglalarawan ng genre, paksa, mga keyword, tono, at haba. Ang loss ay pinagsasama ang walang kondisyon at may kondisyon na language modeling:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

kung saan ang p — isang random na variable para sa pagpapalit ng mga mode, xt(n)t-th na token ng n-th na halimbawa. Ang ganitong kahulugan ay pumipigil sa labis na pag-asa ng modelo sa mga prompt.[6]

Heterogeneous MoE Architecture - Heterogeneous na Arkitektura ng MoE (ERNIE 4.5)

Ipinakilala ng ERNIE 4.5 ang isang heterogeneous na multimodal na arkitektura ng Mixture-of-Experts na may paghihiwalay ng mga eksperto ayon sa modalidad: mga tekstuwal na eksperto at visual na eksperto (ang huli ay may humigit-kumulang 1/3 ng laki ng mga tekstuwal). Ang routing ng mga token ay isinasagawa na may modality-isolated routing at paglalapat ng router orthogonalization loss (na may coefficient na 103) para sa router upang matiyak ang espesyalisasyon ng mga eksperto. Ginagamit ang 3D RoPE (Rotary Position Embeddings) para sa positional encoding ng temporal, taas, at lapad na dimensyon sa datos ng video. Ang mekanismo ng FlashMask ay ginagamit para sa mahusay na paggawa sa mahabang konteksto (hanggang 131 libong token) na may O(N) mask.[3]

Ang pre-training ng ERNIE 4.5 ay isinasagawa sa ilang yugto: una ang pagsasanay sa tekstuwal na datos lamang, pagkatapos sa visual na datos, at sa huling yugto — pinagsamang pagsasanay sa multimodal na datos (text-only → vision-only → joint). Para sa pagproseso ng mga larawan, ginagamit ang adaptive na ViT encoder (Vision Transformer) na may mekanismo ng pixel shuffle para sa pag-align ng mga representasyon ng iba't ibang modalidad. Sinusuportahan ang pagproseso ng mahabang video (hanggang 32 libong token) na may adaptive frame sampling.[3]

Native Omnimodality - Native na Omnimodality (ERNIE 5.0)

Isinasagawa ng ERNIE 5.0 ang native na autoregressive na pagmomodelo ng maraming modalidad (teksto, larawan, audio, video) sa isang pinag-isang arkitektura na may ultra-sparse MoE, kung saan sa bawat hakbang ay wala pang 3% ng kabuuang bilang ng mga eksperto ang ina-activate. Bilang gawain ng pre-training, ginagamit ang Next-Group-of-Tokens Prediction — ang paghula ng isang grupo ng mga token sa halip na isa, na nagpapabuti ng kahusayan ng pagsasanay. Para sa audio na modalidad, ginagamit ang hierarchical codec. Ang teknolohiya ng elastic training ay nagbibigay-daan na bumuo ng mga sub-modelo na may iba't ibang lalim, lapad, at antas ng pagkadurog sa loob ng isang pagsasanay na run.[4]

Mga Gawain sa Pre-training at Datos

Mga Gawain sa Pre-training ng ERNIE 3.0 / Titan

Sa ERNIE 3.0 at Titan, ang mga sumusunod na grupo ng mga gawain sa pre-training ay ginagamit:[2][6]

Mga gawain na Word-aware:

  • Knowledge Masked Language Modeling — phrasal at entity masking para sa pagsasanay ng mga dependency sa lokal at pandaigdigang konteksto.
  • Document Language Modeling — autoregressive na pagmomodelo ng mga dokumento na may haba na hanggang 512 token at paggamit ng recurrent memory ng Transformer-XL.

Mga gawain na Structure-aware:

  • Sentence Reordering — para sa isang talata na random na hinati sa m segment at binago ang pagkakasunud-sunod, ang modelo ay naglulutas ng gawain ng k-class na klasipikasyon na may k=n=1mn!, na ibinabalik ang orihinal na pagkakasunud-sunod.
  • Sentence Distance — 3-class na klasipikasyon: mga katabing pangungusap, mga hindi katabing pangungusap sa parehong dokumento, mga pangungusap mula sa iba't ibang dokumento.

Mga gawain na Knowledge-aware:

  • Universal Knowledge-Text Prediction (UKTP) — pinagsamang pagmomodelo ng teksto at triple ng knowledge graph.
  • Credible and Controllable Generations — kombinasyon ng adversarial loss at controllable LM loss.

Datos sa Pre-training

Para sa ERNIE 3.0/Titan, ginagamit ang ERNIE 3.0 Corpus — isang Chinese corpus na may dami na humigit-kumulang 4 TB sa 11 kategorya, na kinabibilangan ng mga web page, mga log ng paghahanap, datos ng tanong-at-sagot, mga teksto ng sining, batas, pananalapi, at medisina, mga nobela, at tula. Sa ibabaw ng corpus, isang knowledge graph na may mahigit 50 milyong katotohanan ang nabuo.[2][6]

Bukod pa rito, para sa Titan ay nabubuo ang:

  • Adversarial dataset — 2 milyong orihinal na talata at kaukulang "negatibong" mga talata na nabuo ng ERNIE 3.0 batay sa prefix ng unang 1–3 pangungusap ng orihinal, na may haba na hanggang 512 token.
  • Controllable dataset — mga teksto na nilagyan ng mga katangian ng genre, paksa (26 paksa), mga keyword, tono (positibo/negatibo/neutral) at haba. Ang mga katangian ng genre ay naka-encode sa pamamagitan ng mga natutunang "malambot na prompt" (ang bilang ng mga prompt para sa genre ay random na pinipili mula 0 hanggang 64).[6]

Ang mga huling bersyon (ERNIE 4.5, 5.0) ay gumagamit ng mga pinalawak na multimodal na corpus (teksto, mga larawan, video, audio), kabilang ang curated na web content, mga siyentipikong publikasyon, at mga synthetic na datos.[3][4]

Pagsasanay at Ipinamamahaging Optimisasyon

Ang pre-training ng ERNIE 3.0 Titan ay isinagawa gamit ang Adam optimizer (bilis ng pagsasanay 104, β1=0,9, β2=0,95, L2-regularisasyon 0.1, pag-trim ng gradient norm hanggang 1.0), maximum na haba ng konteksto na 512 at haba ng recurrent memory na 128 para sa mga generative na gawain. Ginamit ang progressive na scheme ng pagsasanay (pinabilis na convergence sa unang 4000 hakbang) at linear na pagbaba ng bilis ng pagsasanay.[6]

4D Hybrid Parallelism - 4D-Hybrid na Parallelism

Para sa pagsasanay ng dense na modelo na may 260 bilyong parameter sa mga heterogeneous na cluster (GPU ng NVIDIA V100 at NPU ng Ascend 910) sa PaddlePaddle, isinagawa ang 4D-hybrid na parallelism:[6]

  • Data parallelism (DP) — pagreplikasyon ng modelo sa maraming device na may hiwalay na pagpoproseso ng mga batch.
  • Tensor model parallelism (MP) — paghahati ng mga parameter at activation ng transformer sa loob ng mga layer sa mga device.
  • Pipeline model parallelism (PP) — pamamahagi ng mga layer ng modelo sa kahabaan ng pipeline.
  • Group Sharded — isang pinahusay na variant ng ZeRO-like sharded-data-parallel para sa pagbabawas ng pagdoble ng mga estado ng optimizer.

Sa ulat, may mga datos tungkol sa mahinang scaling hanggang libu-libong card ng Ascend 910 na may kahusayan na humigit-kumulang 91.7% ayon sa throughput.[6]

Pagsasanay ng ERNIE 4.5

Ang pagsasanay ng ERNIE 4.5 ay isinagawa sa isang cluster ng 2016 GPU ng NVIDIA H800 na may Model FLOPs Utilization (MFU) na 47%. Ginamit ang mixed precision na FP8, fault-tolerant na mga checkpoint (Zero Cost Checkpoint, pagbawi sa loob ng wala pang 8 minuto), at progressive na pagsasanay na may pagtaas ng haba ng sequence at laki ng batch.[3]

Online Distillation - Online na Distillation

Para sa pagbabawas ng mga kinakailangan sa computational resources sa pag-deploy ng ERNIE 3.0 Titan, ginagamit ang online distillation, kung saan ang teacher model at ilang student model ay sinagsanay nang sabay-sabay:[6]

  • On-the-Fly Distillation (OFD) — ang mga logit at representasyon ng teacher ay ginagamit para sa pagsasanay ng mga student sa parehong mga hakbang ng pagsasanay.
  • Teacher assistants — mga intermediate na modelo sa laki, na nagpapababa ng agwat sa kapasidad sa pagitan ng teacher at ng mga pangwakas na student.
  • Auxiliary Layer Distillation (ALD) — isang karagdagang layer sa student na itinatanggal sa fine-tuning, para sa mas mahusay na pagtutugma ng mga panloob na representasyon.

Post-training at Alignment

Ang mga komersyal na bersyon ng ERNIE (simula sa ERNIE Bot) ay sumasailalim sa mga yugto ng post-training:[7][3]

  • Supervised Fine-Tuning (SFT) — karagdagang pagsasanay sa mga namarkahang instructional na datos (sa ERNIE 4.5 — 2.3 milyong halimbawa).
  • Reinforcement Learning from Human Feedback (RLHF) — pag-align ng gawi ng modelo gamit ang feedback mula sa tao; ginagamit ang mga algorithm na PPO (Proximal Policy Optimization) at DPO (Direct Preference Optimization).
  • Unified Preference Optimization (UPO) — pinag-isang paraan ng pag-optimize ng kagustuhan, na ipinakilala sa ERNIE 4.5.
  • Reinforcement Learning with Verifiers (RLVR) — reinforcement learning gamit ang mga verifier para sa pagsusuri ng kawastuhan ng mga sagot; ginagamit ang paraan ng GRPO (Group Relative Policy Optimization).
  • Mga Mode ng Pangangatuwiran (thinking modes) — ang mga modelo ng 4.5 ay sumusuporta sa mga mode na may pag-iisip (reflection, planning) at wala.

Mga Pangunahing Resulta at Benchmark

Buod na Talahanayan ng Ebolusyon ng mga Modelo

Bersyon Taon Mga Parameter Arkitektura Mga Pangunahing Benchmark Pinagmulan
ERNIE 1.0 2019 ~110 milyon (base) Transformer encoder (katulad ng BERT) XNLI 78.4%; MSRA-NER F1 93.8% [1]
ERNIE 2.0 2019 ~110–340 milyon Continual multi-task GLUE 80.6 (base) / 83.6 (large); 16 na gawain SOTA [5]
ERNIE 3.0 2021 10 bilyon Unified Transformer-XL (AE+AR) SuperGLUE 90.6% (> human 89.8%); 54 na gawain sa Tsino SOTA [2]
ERNIE 3.0 Titan 2021 260 bilyon (dense) Dense + controllable generation 68 dataset SOTA; zero/few-shot [6]
ERNIE 4.5 2025 0.3–424 bilyon (MoE, 47 bilyon aktibo) Heterogeneous multimodal MoE C-Eval 90.6%; MMLU 86.5%; MMMU 67.3–70% [3]
ERNIE 5.0 2026 ~2.4 trilyon (ultra-sparse MoE) Unified autoregressive multimodal MoE LMArena Elo ~1460 (nangungunang-10 sa buong mundo) [4]

Mga Resulta ng ERNIE 3.0 at Titan

Ang ERNIE 3.0 (10 bilyong parameter) sa English na benchmark na SuperGLUE ay nakamit ang average na resulta na 90.6, na lumalagpas sa human baseline (89.8) at sa mga resulta ng GPT-3, T5, at DeBERTa sa oras ng publikasyon. Ang ERNIE 3.0 Titan (260 bilyon) ay sinuri sa 68 dataset, kabilang ang mga gawain ng klasipikasyon, NLI, QA, at pagbuo; iniuulat ng mga may-akda ang paglamang sa mga nakaraang modelo sa lahat ng 68 dataset. Ang mga resultang ito ay mula sa mga pangunahing pinagkukunan; ang independyenteng reproduksyon ay limitadong inilalarawan.[2][6]

Mga Resulta ng ERNIE 4.5

Ayon sa teknikal na ulat ng 2025, ang ERNIE 4.5 (300B-A47B, post-training) ay nagpapakita ng mga sumusunod na resulta sa mga tekstuwal at multimodal na benchmark:[3]

Benchmark ERNIE-4.5-300B-A47B Mga Kondisyon
C-Eval 90.6% 5-shot
CMMLU 90.2%
MMLU 86.5% pamantayan
IFEval 88.0% instruction following
GSM8K 91.8%
MMMU 67.3–70.0% non-thinking / thinking
MathVista 78.8% thinking mode
OCRBench 883

Ayon sa ulat, nalampasan ng ERNIE 4.5 ang DeepSeek-V3 sa 22 sa 28 benchmark; ang mga multimodal na variant (ERNIE-4.5-VL-424B-A47B) ay nagpakita ng mapagkumpitensyang mga resulta sa mga gawain ng visual reasoning. Sa ilang gawain ng visual reasoning at teknikal na interpretasyon ng larawan (pagsusuri ng mga diagram at engineering diagram) ay iniuulat ang mga resulta na mas mataas kaysa sa ilang modelo ng GPT at Gemini.[3][14]

Paghahambing ng ERNIE 4.5 sa mga kakumpitensya (piniling benchmark, post-training, ayon sa teknikal na ulat ng 2025):

Benchmark ERNIE-4.5-300B-A47B DeepSeek-V3-671B-A37B Qwen3-235B-A22B Tala
C-Eval 90.6% 5-shot
MMLU 86.5% maihahambing pamantayan
IFEval 88.0% 83.2% instruction following
MMMU 67.3–70.0% thinking / non-thinking
MathVista 78.8% 77.6% (Qwen2.5-VL) thinking mode

Mga kondisyon ng reproduksyon: mga karaniwang protokol (5-shot / zero-shot); bukas na mga dataset (C-Eval 2023+, MMLU, MMMU). Ang gitling ("—") ay nangangahulugang ang maihahambing na datos sa parehong mga kondisyon ay hindi ibinigay sa ulat.[3]

Mga Pagtatasa ng ERNIE Bot 4.0

Ang ulat ng SuperBench ng Unibersidad ng Tsinghua ay nag-uuri ng mga komersyal na LLM ayon sa isang hanay ng mga gawain (pag-unawa sa wika, matematika, programming, multi-tasking). Ang ERNIE Bot 4.0 ay nanguna sa mga Chinese na modelo, na nangunguna sa GLM-4 (Zhipu AI) ng humigit-kumulang 0.41 puntos sa pinagsamang sukatan; ang mga modelo ng GPT-4 at Anthropic Claude-3 ay nanatiling mas mataas sa pandaigdigang ranggo. Ang ERNIE Bot 4.0 ay nagpakita ng malakas na mga resulta sa pag-unawa sa tekstong Tsino at pagsunod sa mga tagubilin, habang nagpapakita ng mas mahinang mga resulta sa programming at ilang gawain sa Ingles.[9][10]

Aplikasyon

Mga Produkto at Serbisyo ng Baidu

Ang mga modelo ng serye ng ERNIE ay integrated sa ecosystem ng mga produkto ng Baidu:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — isang chatbot na may suporta sa multimodal na pagbuo (teksto, mga larawan, video, audio). Ayon sa datos ng Baidu, ang bilang ng mga buwanang aktibong gumagamit ay lumalagpas sa 200 milyon (2024–2025). Mula 2025, ang ERNIE Bot ay available nang libre.[7]
  • Paghahanap ng Baidu — pagbuo ng mga sagot at mga AI na function sa mga resulta ng paghahanap; ayon sa datos ng Baidu, hanggang 70% ng mga nangungunang resulta ay pinahusay ng mga AI na sangkap.
  • Qianfan (MaaS-platform) — API para sa mga corporate na kliyente; ayon sa datos ng Baidu, mahigit 760 libong negosyo ang gumagamit ng platform, ang bilang ng pang-araw-araw na tawag sa API ay lumalagpas sa 1.5 bilyon (2024). Kabilang sa mga kliyente — Lenovo, Trip.com, at iba pa.[7]
  • Comate — AI assistant para sa programming.
  • Wenxin Yige — pagbuo ng larawan batay sa mga modelo ng ERNIE-ViLG.[11]
  • Mga integrasyon sa mga panlabas na kasosyo: Samsung Galaxy (para sa Chinese na merkado), mga digital na avatar, mga plugin (paghahanap, pagsusuri ng file).[7]

Mga Aplikasyon sa Industriya

Ang mga modelo ay ginagamit sa mga sumusunod na larangan:[7][3]

  • Mga sistema ng tanong-at-sagot sa mga domain na larangan (batas, medisina, pananalapi) gamit ang knowledge-enhanced pre-training.
  • Pagbuo at pag-edit ng mga teksto sa wikang Tsino (balita, mga teksto sa marketing, creative na nilalaman).
  • Mga multimodal na gawain: pagsusuri ng mga larawan, engineering diagram, video, at tabular na datos (sa mga bersyon ng 4.5 at mas bago).
  • Edukasyon (personalisadong pagsasanay), robotics (pagpaplano ng gawain), autonomous driving (Apollo).

Bukas na Code

Simula sa ERNIE 4.5, lahat ng 10 variant ng pamilya ay inilabas sa ilalim ng lisensya ng Apache 2.0 na may toolkit na ERNIEKit (suporta para sa SFT, LoRA, DPO, inference sa PaddlePaddle/FastDeploy). Ang code ng mga mas maagang bersyon (ERNIE 1.0–3.0) ay available sa GitHub PaddlePaddle/ERNIE.[3][15]

Mga Limitasyon at Bukas na Problema

Mga Limitasyon ng Arkitektura at Dataset

Ang ERNIE 3.0 Titan na may 260 bilyong parameter ay limitado sa haba ng konteksto na 512 token para sa isang indibidwal na module, na nagpapahigpit sa pagmomodelo ng mahahabang teksto nang walang karagdagang mga mekanismo (chunking, panlabas na memorya). Ang pagsasanay ay isinasagawa pangunahin sa Chinese corpus, na humahantong sa hindi pantay na kalidad sa pagitan ng wikang Tsino at ng iba pang wika.[6]

Ang integrasyon ng knowledge graph ay nagpapabuti ng paggawa sa mga nakabalangkas na katotohanan, ngunit ang katumpakan at pagkakumpleto ng kaalaman ay limitado ng kalidad ng graph mismo at ng pamamaraan ng pagtutugma ng "triple–teksto" (entity linking, relation alignment), na sa ilang kaso ay humahantong sa mga maling o hindi kumpleto na asosasyon.[6]

Mga Hallucination at Pagiging Kapani-paniwala

Ang adversarial loss at controllable LM loss ay nagpapabuti ng katatagan laban sa mga hindi mapagkakatiwalaang pagbuo, ngunit ang problema ng mga hallucination (pagbuo ng mga katotohanang maling pahayag) ay hindi ganap na naaalis. Ang mga parameter ng adversarial classifier ay sinagsanay sa datos kung saan ang "nabuong" teksto ay nilikha ng nakaraang bersyon ng ERNIE, na nagpapahigpit sa hanay ng mga natutukoy na maling pattern.[6]

Mga Panlipunang Bias

Isang pag-aaral na inilathala sa PeerJ Computer Science (2025) ay nagsusuri ng mga panlipunang bias sa mga Chinese LLM (ERNIE at Qwen) gamit ang 240 panlipunang grupo at mahigit 30 libong nabuong paglalarawan. Ang mga resulta ay nagpapakita na ang ERNIE ay bumubuo ng mas kaunting negatibo at stereotypical na nilalaman kaysa sa Baidu Search o Qwen (humigit-kumulang 1/10 ng mga kandidatong salita na may negatibong konotasyon sa ERNIE kumpara sa 1/3 sa Qwen). Gayunpaman, ang ilang antas ng mga stereotype, kabilang ang mga potensyal na nakakasakit na paglalarawan, ay nananatili.[16][17]

Reproducibility - Reproducibility

Ang ilang bahagi ng mga modelo ng serye (ERNIE 3.0 Titan, komersyal na ERNIE Bot 4.0 at 5.0) ay hindi available bilang ganap na bukas na code at mga weight, na nagpapahigpit sa reproducibility ng mga benchmark at sa posibilidad ng independyenteng pagtatasa. Sa paglabas ng ERNIE 4.5 sa ilalim ng Apache 2.0, ang sitwasyon ay bumuti, ngunit ang mga arkitektura at mga setting ng pagsasanay ay maaaring magkaiba mula sa mga inilarawan sa mga maagang publikasyon.[3][6]

Kaligtasan sa Medisina

Ang mga pag-aaral ng paggamit ng ERNIE Bot sa mga medikal na senaryo (Si et al., 2025) ay nagtuklas ng tendensiya sa labis na mga reseta: 91.9% ng mga hindi kinakailangang pagsubok at 57.8% ng mga hindi kinakailangang gamot sa mga modelo ng senaryo, pati na rin ang mga disproporsyon batay sa edad at socioeconomic status sa mga rekomendasyon.[18]

Mga Etikal at Regulatoryong Aspeto

Ang mga modelo ng serye ng ERNIE ay gumagana sa loob ng balangkas ng Chinese na regulasyon ng generative AI, lalo na ng "Interim Measures for Generative AI Services" (Mga Pansamantalang Hakbang para sa Pamamahala ng mga Generative AI Service, 2023), na nagtatakda ng obligatoryong pagsusuri ng kaligtasan, pagpaparehistro ng algorithm, at mga paghihigpit sa nilalaman.[7][17]

Ipinakikita ng ERNIE Bot ang mataas na antas ng pagtanggi sa mga kahilingan na may kaugnayan sa sensitibong pampulitikang paksa, alinsunod sa pambansang batas. Ang mga pag-aaral (Pan et al., 2026) ay nag-aanalisa ng pampulitikang censorship sa mga LLM na nagmula sa Tsino, kabilang ang mga modelo ng Baidu.[19]

Hindi laging detalyadong inilalarawan ng mga publikasyon ng Baidu ang mga pamamaraan ng pag-audit ng gawi ng modelo, mga pamantayan sa pag-filter ng nilalaman, at ang balanse sa pagitan ng mga lokal na regulatoryong kinakailangan at ng mga pangkalahatang prinsipyo ng AI ethics, na nananatiling isang bukas na larangan para sa mga independyenteng pananaliksik.[17]

Mga Pananaw at Direksyon ng Pananaliksik

Batay sa mga teknikal na ulat at mga pahayag ng Baidu, ang mga sumusunod na direksyon ng pagpapaunlad ng serye ng ERNIE ay natutukoy:

  • Karagdagang multimodalization (teksto–larawan–video–audio), kabilang ang pagproseso ng makapal na teknikal na visual na datos (mga engineering diagram, medikal na larawan).[3][4]
  • Pagsasama ng mga dense at MoE na arkitektura para sa balanse sa pagitan ng kalidad at computational efficiency sa napakalalaking kabuuang laki ng modelo.[3]
  • Pagpapaunlad ng mga agentic na sistema (GenFlow, Famou) at mga kasangkapan ng nakabalangkas na pagbuo (JSON, mga tawag sa API) para sa integrasyon sa mga production workflow.[3]
  • Pagpapabuti ng kahusayan ng pagsasanay: elastic training, pinahusay na scaling ng MoE (MFU), quantization (W4A8, 2-bit para sa pag-deploy sa isang GPU).[3]
  • Mga pananaliksik sa pagbabawas ng mga bias sa Chinese LLM na isinasaalang-alang ang mga kultura-espesipikong aspeto at pagpapaunlad ng mga paraan ng benchmarking para sa wikang Tsino at mga multimodal na gawain.[16][17]
  • Pagpapabuti ng pangangatuwiran sa mahabang konteksto, verifiable reinforcement learning, at pag-angkop sa mga domain na may limitadong datos sa pamamagitan ng mga synthetic na corpus.[3][4]

Paghahambing sa Iba pang Chinese LLM

Nakikipagkumpitensya ang ERNIE sa ilang malalaking Chinese LLM, kabilang ang Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI), at Tongyi Qianwen. Ang mga pangunahing pagkakaiba ng serye ng ERNIE — ang pagtuon sa integrasyon ng mga knowledge graph sa pre-training (knowledge enhancement), malapit na integrasyon sa ecosystem ng Baidu (paghahanap, cloud, API), at oryentasyon sa platform ng PaddlePaddle. Ayon sa mga resulta ng mga independyenteng ranggo (SuperBench, LMArena), ang mga modelo ng serye ng ERNIE ay nasa mataas na posisyon sa mga Chinese LLM, lalo na sa mga gawain ng pag-unawa at pagsunod sa mga tagubilin sa wikang Tsino.[9][13][16]

Tingnan din

  • BERT
  • Arkitektura ng Transformer
  • RLHF

Mga Sanggunian

Mga Tala

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.