ERNIE (Baidu) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — serie di modelli linguistici pre-addestrati (Large Language Model, LLM) e modelli fondazionali multimodali, sviluppati da Baidu a partire dal 2019 sotto il nome comune Enhanced Representation through kNowledge IntEgration (rappresentazione potenziata tramite integrazione della conoscenza). La serie è orientata al miglioramento della qualità della comprensione semantica e della generazione attraverso l'integrazione esplicita di conoscenza esterna proveniente da grafi della conoscenza (Knowledge Graph, KG), ontologie ed enciclopedie nel processo di pre-addestramento.[1][2]

I modelli della serie si sono evoluti dalle prime varianti basate su BERT con mascheramento di entità e frasi (ERNIE 1.0, 2.0), passando per architetture unificate su larga scala (ERNIE 3.0, ERNIE 3.0 Titan), fino a sistemi multimodali basati su Mixture-of-Experts (MoE) con codice sorgente aperto (ERNIE 4.5) e modelli omnimodali nativi (ERNIE 5.0). La serie supporta attività di comprensione del testo (Natural Language Understanding, NLU), generazione del testo (Natural Language Generation, NLG) e, nelle versioni più recenti, attività multimodali (testo, immagini, video, audio), con un focus sulla lingua cinese e supporto al multilinguismo.[2][3][4]

Storia e presupposti

Lo sviluppo della serie ERNIE è iniziato nel 2019 presso la divisione di ricerca di Baidu, in risposta al successo del modello BERT (Devlin et al., 2018) e alla necessità di adattare i modelli pre-addestrati alla lingua cinese, nella quale l'assenza di spazi espliciti tra le parole e l'alta frequenza di caratteri polisemici complicano la cattura delle unità semantiche (entità, frasi).[1]

ERNIE 1.0 (2019)

Il primo modello della serie (Sun et al., arXiv:1904.09223, aprile 2019) ha introdotto una strategia di mascheramento della conoscenza a più livelli (knowledge masking) per un'architettura di tipo BERT: invece di mascherare casualmente singoli token, il modello maschera interi entità e frasi, identificate tramite il riconoscimento di entità nominate (Named Entity Recognition, NER) e pattern frasali.[1]

L'architettura di ERNIE 1.0 è basata su un Transformer encoder (12 strati, dimensione nascosta 768, 12 teste di attenzione). È stato inoltre introdotto il compito Dialogue Language Model (DLM) per l'addestramento su dati dialogici. Il modello è stato addestrato su circa 173 milioni di frasi cinesi provenienti da corpus di Wikipedia, Baidu Baike, notizie e dal forum Baidu Tieba. Al momento della pubblicazione, ERNIE 1.0 ha raggiunto risultati state‑of‑the‑art (SOTA) su cinque attività cinesi di NLP: XNLI (accuratezza 78,4% sul test contro 77,2% di BERT), MSRA‑NER (F1 93,8% contro 92,6%).[1]

ERNIE 2.0 (2019)

ERNIE 2.0 (Sun et al., arXiv:1907.12412, luglio 2019; accettato alla conferenza AAAI 2020) ha introdotto un framework di pre-addestramento multi-task continuo (continual multi‑task pre‑training), in cui nuovi compiti di pre-addestramento vengono aggiunti in modo sequenziale (incrementale) a un transformer condiviso senza dover riaddestrare completamente il modello.[5]

I compiti di pre-addestramento di ERNIE 2.0 sono suddivisi in tre gruppi:

  • Word‑aware — mascheramento della conoscenza (knowledge masking), predizione delle maiuscole (capitalization prediction), relazione token-documento (token‑document relation).
  • Structure‑aware — riordinamento delle frasi (sentence reordering), determinazione della distanza tra frasi (sentence distance).
  • Semantic‑aware — predizione delle relazioni discorsive (discourse relation prediction), rilevanza per il recupero delle informazioni (IR relevance prediction).[5]

Il modello è stato addestrato su corpus in inglese e cinese (enciclopedie, libri, Reddit, log di ricerca). Risultati: il punteggio medio GLUE per il modello base è stato 80,6 (contro 78,3 di BERT), per il modello large — 83,6; ERNIE 2.0 ha superato BERT e XLNet in 16 attività.[5]

ERNIE 3.0 (2021)

Il framework ERNIE 3.0 (Sun et al., arXiv:2107.02137, luglio 2021) ha unificato i paradigmi di pre-addestramento auto-encoding (AE) e auto-regressivo (AR) in un'unica architettura, suddivisa in un modulo di rappresentazione universale (Universal Representation Module) e moduli di rappresentazione specifici per i compiti (Task‑specific Representation Modules) per NLU e NLG.[2]

Il modello con 10 miliardi di parametri è stato addestrato su 4 TB di testo cinese (11 categorie: Baidu Baike, Wikipedia, log di ricerca, sistemi di domande e risposte, testi di dominio) e su un grafo della conoscenza con oltre 50 milioni di fatti. ERNIE 3.0 ha raggiunto risultati SOTA in 54 attività cinesi di NLP; nel benchmark in lingua inglese SuperGLUE ha ottenuto il 90,6% (al 3 luglio 2021, superando il riferimento umano dell'89,8%).[2]

ERNIE 3.0 Titan (2021)

Nel lavoro «ERNIE 3.0 Titan: Exploring Larger‑scale Knowledge Enhanced Pre‑training for Language Understanding and Generation» (Wang et al., arXiv:2112.12731, dicembre 2021) viene descritto il ridimensionamento del framework ERNIE 3.0 fino a un modello denso (dense) con 260 miliardi di parametri, implementato sulla piattaforma PaddlePaddle.[6]

Titan ha introdotto meccanismi aggiuntivi: un adversarial loss auto-supervisionato per valutare l'affidabilità del testo generato, un controllable language modeling loss per controllare lo stile, il tema, il tono e la lunghezza della generazione, nonché la distillazione online (On‑the‑Fly Distillation, OFD) per ottenere modelli studente compatti durante il pre-addestramento. Il modello è stato valutato su 68 dataset e, secondo gli autori, ha superato i modelli precedenti su tutti i 68 dataset.[6]

ERNIE Bot e versioni commerciali (2023–2025)

Nel marzo 2023 Baidu ha rilasciato il chatbot ERNIE Bot (Wenxin Yiyan, 文心一言) basato sui modelli ERNIE 3.x e PLATO (modello dialogico). L'accesso pubblico è stato aperto nell'agosto 2023 dopo l'approvazione delle autorità di regolamentazione. Gli aggiornamenti includevano ERNIE 3.5 (giugno 2023) e ERNIE 4.0 (ottobre 2023).[7][8]

Secondo il rapporto SuperBench dell'Università di Tsinghua, ERNIE Bot 4.0 si è classificato al primo posto tra gli LLM cinesi per metrica integrale, mostrando risultati forti nella comprensione della lingua cinese e nel seguire le istruzioni.[9][10]

Nel 2022, parallelamente alla linea linguistica principale, è stata presentata l'estensione multimodale ERNIE‑ViLG 2.0 (arXiv:2210.15257) — un modello di generazione di immagini a partire dal testo (text‑to‑image), che ha rappresentato uno dei primi passi verso la multimodalità.[11]

Nel 2024, alla conferenza WAVE SUMMIT, Baidu ha presentato ERNIE 4.0 Turbo — una versione ottimizzata per applicazioni ad alta velocità, in grado di generare testi di lunghezza superiore a mille parole in circa 20 secondi mantenendo la qualità.[12]

ERNIE 4.5 (2025)

Nel giugno 2025 Baidu ha pubblicato il rapporto tecnico di ERNIE 4.5, che presenta una famiglia di 10 modelli: LLM testuali e modelli multimodali (Vision‑Language, VL). L'architettura è basata su un Mixture-of-Experts (MoE) eterogeneo con separazione degli esperti per modalità. Le varianti includono modelli MoE con fino a 424 miliardi di parametri totali e 47 miliardi di parametri attivi, nonché un modello denso con 0,3 miliardi di parametri. La famiglia è stata rilasciata con licenza Apache 2.0 su Hugging Face e GitHub (PaddlePaddle/ERNIE).[3]

ERNIE 5.0 (2026)

Nel febbraio 2026 è stato pubblicato il rapporto tecnico di ERNIE 5.0 (arXiv:2602.04705) — un modello auto-regressivo omnimodale nativo con MoE ultra-sparso (ultra‑sparse MoE), che supporta la modellazione congiunta di testo, immagini, audio e video. Il modello occupava posizioni elevate nella classifica LMArena.[4][13]

Fondamenti teorici e principi architetturali

Mascheramento della conoscenza (Knowledge Masking)

Il principio chiave dei primi modelli della serie è l'integrazione della conoscenza strutturata nel processo di pre-addestramento attraverso strategie di mascheramento modificate. A differenza del Masked Language Modeling (MLM) standard, in cui vengono mascherati singoli token, ERNIE 1.0 maschera intere unità semantiche: entità (identificate tramite NER) e frasi. Per un'entità E={t1,,tk} viene mascherata l'intera sequenza di token con una probabilità assegnata p. Tale approccio costringe il modello a fare affidamento su un contesto più ampio e ad apprendere le relazioni tra le entità.[1]

ERNIE 2.0 ha sviluppato ulteriormente questo approccio, aggiungendo l'apprendimento multi-task incrementale: i compiti di livello lessicale, strutturale e semantico vengono aggiunti in sequenza, mentre le conoscenze apprese in precedenza vengono preservate grazie al meccanismo di pre-addestramento continuo (continual pre‑training).[5]

Framework unificato ERNIE 3.0

Il framework ERNIE 3.0 si basa sulla suddivisione dell'architettura in due livelli:[2][6]

  • Universal Representation Module — un Transformer‑XL multistrato condiviso, addestrato su una varietà di compiti di pre-addestramento che estrae caratteristiche lessicali e sintattiche generali. Nella versione Titan questo modulo contiene 48 strati, una rappresentazione nascosta di dimensione 12288, 192 teste di attenzione e una dimensione interna della rete feed-forward di 196608 (16×dmodel).
  • Task‑specific Representation Modules — moduli separati per NLU (attenzione bidirezionale) e NLG (attenzione unidirezionale con memoria ricorrente Transformer‑XL), ciascuno con 12 strati, dimensione del vettore nascosto 768 e 12 teste di attenzione.

L'integrazione dei paradigmi auto-encoding e auto-regressivo consente a un unico modello di ottenere prestazioni elevate sia sui benchmark NLU (compiti di tipo BERT) sia sui benchmark NLG (compiti di tipo GPT).[2]

Universal Knowledge‑Text Prediction (UKTP)

Il compito UKTP è il meccanismo centrale di integrazione della conoscenza in ERNIE 3.0/Titan. Il modello riceve una coppia (tripla del grafo della conoscenza, frase dell'enciclopedia) e deve o predire la relazione nella tripla utilizzando il testo, oppure predire i token mascherati nel testo utilizzando le informazioni della tripla.[6]

Nella predizione della relazione r nella tripla (h,r,t) associata al testo x, il compito è formulato come classificazione multiclasse:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

dove fθ è l'output del transformer nelle posizioni delle menzioni dell'entità testa e coda, W,b sono i parametri del classificatore e θ sono i parametri del modello.[6]

Meccanismi di generazione affidabile e controllabile (Titan)

ERNIE 3.0 Titan ha introdotto due tipi aggiuntivi di funzioni di perdita.[6]

Adversarial loss auto-supervisionato. Viene formato un dataset Da={Doriginal,Dgenerated}, dove Doriginal sono paragrafi reali e Dgenerated sono testi generati dalla versione precedente di ERNIE a partire dal prefisso dei paragrafi originali. Il compito è una classificazione binaria (originale / generato) sullo stato nascosto del token speciale [CLS]:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

dove h[CLS](n) è la rappresentazione vettoriale di [CLS] per l'n-esimo esempio e I è l'indicatore di appartenenza ai testi originali.[6]

Controllable language modeling loss. Ogni esempio di addestramento è accompagnato da un insieme di attributi (prompt) che descrivono il genere, il tema, le parole chiave, il tono e la lunghezza. La perdita combina la modellazione linguistica condizionata e non condizionata:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

dove p è una variabile casuale per alternare le modalità, xt(n) è il t-esimo token del n-esimo esempio. Tale definizione previene una dipendenza eccessiva del modello dai prompt.[6]

Architettura MoE eterogenea (ERNIE 4.5)

ERNIE 4.5 introduce un'architettura Mixture-of-Experts multimodale eterogenea con separazione degli esperti per modalità: esperti testuali ed esperti visivi (questi ultimi hanno circa 1/3 delle dimensioni di quelli testuali). Il routing dei token avviene con isolamento per modalità (modality‑isolated routing) e applicazione di una penalità di ortogonalizzazione per il router (router orthogonalization loss, coefficiente dell'ordine di 103) per garantire la specializzazione degli esperti. Viene utilizzato il 3D RoPE (Rotary Position Embeddings) per la codifica posizionale delle dimensioni temporale, altezza e larghezza nei dati video. Il meccanismo FlashMask viene applicato per una gestione efficiente dei contesti lunghi (fino a 131 mila token) con maschere O(N).[3]

Il pre-addestramento di ERNIE 4.5 avviene in più fasi: prima l'addestramento solo su dati testuali, poi su dati visivi, e nella fase finale — addestramento congiunto su dati multimodali (text‑only → vision‑only → joint). Per l'elaborazione delle immagini viene utilizzato un encoder ViT (Vision Transformer) adattivo con un meccanismo pixel shuffle per l'allineamento delle rappresentazioni di diverse modalità. È supportata l'elaborazione di video lunghi (fino a 32 mila token) con campionamento adattivo dei fotogrammi (adaptive frame sampling).[3]

Omnimodalità nativa (ERNIE 5.0)

ERNIE 5.0 implementa la modellazione auto-regressiva nativa di più modalità (testo, immagini, audio, video) in un'unica architettura con MoE ultra-sparso, in cui a ogni passo viene attivato meno del 3% del numero totale di esperti. Come compito di pre-addestramento viene utilizzata la Next‑Group‑of‑Tokens Prediction — la predizione di un gruppo di token anziché di uno solo, che aumenta l'efficienza dell'addestramento. Per la modalità audio viene applicato un codec gerarchico (hierarchical codec). La tecnologia elastic training consente di generare sotto-modelli con profondità, larghezza e grado di sparsità variabili nell'ambito di una singola sessione di addestramento.[4]

Compiti di pre-addestramento e dati

Compiti di pre-addestramento di ERNIE 3.0 / Titan

In ERNIE 3.0 e Titan vengono utilizzati i seguenti gruppi di compiti di pre-addestramento:[2][6]

Compiti Word‑aware:

  • Knowledge Masked Language Modeling — mascheramento frasale e di entità per apprendere le dipendenze nei contesti locali e globali.
  • Document Language Modeling — modellazione auto-regressiva di documenti con lunghezza fino a 512 token e utilizzo della memoria ricorrente Transformer‑XL.

Compiti Structure‑aware:

  • Sentence Reordering — per un paragrafo diviso casualmente in m segmenti e rimescolato, il modello risolve un compito di classificazione a k classi con k=n=1mn!, ripristinando l'ordine originale.
  • Sentence Distance — classificazione a 3 classi: frasi adiacenti, non adiacenti nello stesso documento, frasi di documenti diversi.

Compiti Knowledge‑aware:

  • Universal Knowledge‑Text Prediction (UKTP) — modellazione congiunta di testo e tripla del grafo della conoscenza.
  • Credible and Controllable Generations — combinazione di adversarial loss e controllable LM loss.

Dati di pre-addestramento

Per ERNIE 3.0/Titan viene utilizzato l'ERNIE 3.0 Corpus — un corpus cinese di circa 4 TB in 11 categorie, comprendente pagine web, log di ricerca, dati di domande e risposte, testi letterari, giuridici, finanziari e medici, romanzi e poesie. Sopra il corpus è stato costruito un grafo della conoscenza con oltre 50 milioni di fatti.[2][6]

Additivamente per Titan vengono formati:

  • Dataset adversariale — 2 milioni di paragrafi originali e corrispondenti paragrafi «negativi» generati da ERNIE 3.0 a partire dal prefisso delle prime 1–3 frasi dell'originale, con lunghezza fino a 512 token.
  • Dataset controllabile — testi dotati di attributi di genere, tema (26 tematiche), parole chiave, tono (positivo/negativo/neutro) e lunghezza. Gli attributi di genere sono codificati tramite «soft prompt» addestrabili (il numero di prompt per il genere viene selezionato casualmente da 0 a 64).[6]

Le versioni più recenti (ERNIE 4.5, 5.0) utilizzano corpus multimodali estesi (testo, immagini, video, audio), inclusi contenuti web curati, pubblicazioni scientifiche e dati sintetici.[3][4]

Addestramento e ottimizzazione distribuita

Il pre-addestramento di ERNIE 3.0 Titan è stato condotto utilizzando l'ottimizzatore Adam (tasso di apprendimento 104, β1=0,9, β2=0,95, regolarizzazione L2 0,1, clipping della norma del gradiente a 1,0), lunghezza massima del contesto 512 e lunghezza della memoria ricorrente 128 per i compiti generativi. È stato applicato uno schema di addestramento progressivo (convergenza accelerata nei primi 4000 passi) e un decadimento lineare del tasso di apprendimento.[6]

Parallelismo ibrido 4D

Per l'addestramento del modello denso con 260 miliardi di parametri su cluster eterogenei (GPU NVIDIA V100 e NPU Ascend 910), in PaddlePaddle è stato implementato il parallelismo ibrido 4D:[6]

  • Data parallelism (DP) — replica del modello su più dispositivi con elaborazione separata dei batch.
  • Tensor model parallelism (MP) — suddivisione dei parametri e delle attivazioni del transformer all'interno degli strati tra i dispositivi.
  • Pipeline model parallelism (PP) — distribuzione degli strati del modello lungo una pipeline.
  • Group Sharded — variante avanzata dello sharded data parallel di tipo ZeRO per ridurre la duplicazione degli stati dell'ottimizzatore.

Nel rapporto vengono riportati dati sul weak scaling fino a migliaia di schede Ascend 910 con un'efficienza dell'ordine del 91,7% in termini di throughput.[6]

Addestramento di ERNIE 4.5

L'addestramento di ERNIE 4.5 è stato condotto su un cluster di 2016 GPU NVIDIA H800 raggiungendo un Model FLOPs Utilization (MFU) del 47%. Sono stati utilizzati la precisione mista FP8, checkpoint fault-tolerant (Zero Cost Checkpoint, ripristino in meno di 8 minuti) e l'addestramento progressivo con aumento della lunghezza della sequenza e della dimensione del batch.[3]

Distillazione online

Per ridurre i requisiti computazionali durante il deployment di ERNIE 3.0 Titan viene utilizzata la distillazione online, in cui il modello insegnante e diversi modelli studente vengono addestrati simultaneamente:[6]

  • On‑the‑Fly Distillation (OFD) — i logit e le rappresentazioni dell'insegnante vengono utilizzati per addestrare gli studenti negli stessi passi di addestramento.
  • Teacher assistants — modelli di dimensioni intermedie che riducono il divario di capacità tra l'insegnante e gli studenti finali.
  • Auxiliary Layer Distillation (ALD) — uno strato ausiliario nello studente, rimosso durante il fine‑tuning, per una migliore corrispondenza delle rappresentazioni interne.

Post-addestramento e allineamento

Le versioni commerciali di ERNIE (a partire da ERNIE Bot) attraversano fasi di post-addestramento:[7][3]

  • Supervised Fine‑Tuning (SFT) — fine-tuning su dati di istruzioni annotati (in ERNIE 4.5 — 2,3 milioni di esempi).
  • Reinforcement Learning from Human Feedback (RLHF) — allineamento del comportamento del modello tramite feedback umano; vengono applicati gli algoritmi PPO (Proximal Policy Optimization) e DPO (Direct Preference Optimization).
  • Unified Preference Optimization (UPO) — metodo unificato di ottimizzazione delle preferenze, introdotto in ERNIE 4.5.
  • Reinforcement Learning with Verifiers (RLVR) — apprendimento per rinforzo con l'uso di verificatori per controllare la correttezza delle risposte; viene applicato il metodo GRPO (Group Relative Policy Optimization).
  • Modalità di ragionamento (thinking modes) — i modelli 4.5 supportano modalità con riflessione (reflection, planning) e senza.

Risultati principali e benchmark

Tabella riassuntiva dell'evoluzione dei modelli

Versione Anno Parametri Architettura Benchmark principali Fonte
ERNIE 1.0 2019 ~110 mln (base) Transformer encoder (tipo BERT) XNLI 78,4%; MSRA‑NER F1 93,8% [1]
ERNIE 2.0 2019 ~110–340 mln Continual multi‑task GLUE 80,6 (base) / 83,6 (large); 16 attività SOTA [5]
ERNIE 3.0 2021 10 mld Unified Transformer‑XL (AE+AR) SuperGLUE 90,6% (> human 89,8%); 54 attività cinesi SOTA [2]
ERNIE 3.0 Titan 2021 260 mld (dense) Dense + generazione controllabile 68 dataset SOTA; zero/few‑shot [6]
ERNIE 4.5 2025 0,3–424 mld (MoE, 47 mld att.) MoE multimodale eterogeneo C‑Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% [3]
ERNIE 5.0 2026 ~2,4 trl (ultra‑sparse MoE) MoE multimodale auto-regressivo unificato LMArena Elo ~1460 (top‑10 globale) [4]

Risultati di ERNIE 3.0 e Titan

ERNIE 3.0 (10 miliardi di parametri) sul benchmark in lingua inglese SuperGLUE ha raggiunto un risultato medio di 90,6, superando il riferimento umano (89,8) e le prestazioni di GPT‑3, T5 e DeBERTa al momento della pubblicazione. ERNIE 3.0 Titan (260 miliardi) è stato valutato su 68 dataset, inclusi compiti di classificazione, NLI, QA e generazione; gli autori riportano la superiorità rispetto ai modelli precedenti su tutti i 68 dataset. Questi risultati sono dati delle fonti primarie; la riproducibilità indipendente è descritta in modo limitato.[2][6]

Risultati di ERNIE 4.5

Secondo il rapporto tecnico del 2025, ERNIE 4.5 (300B‑A47B, post-training) mostra i seguenti risultati sui benchmark testuali e multimodali:[3]

Benchmark ERNIE‑4.5‑300B‑A47B Condizioni
C‑Eval 90,6% 5‑shot
CMMLU 90,2%
MMLU 86,5% standard
IFEval 88,0% instruction following
GSM8K 91,8%
MMMU 67,3–70,0% non‑thinking / thinking
MathVista 78,8% thinking mode
OCRBench 883

Secondo il rapporto, ERNIE 4.5 ha superato DeepSeek‑V3 in 22 dei 28 benchmark; le varianti multimodali (ERNIE‑4.5‑VL‑424B‑A47B) hanno mostrato risultati competitivi nei compiti di ragionamento visivo. In alcune attività di ragionamento visivo e interpretazione tecnica di immagini (analisi di schemi, diagrammi ingegneristici) vengono riportati risultati superiori rispetto ad alcuni modelli GPT e Gemini.[3][14]

Confronto di ERNIE 4.5 con i concorrenti (benchmark selezionati, post-training, secondo il rapporto tecnico del 2025):

Benchmark ERNIE‑4.5‑300B‑A47B DeepSeek‑V3‑671B‑A37B Qwen3‑235B‑A22B Nota
C‑Eval 90,6% 5‑shot
MMLU 86,5% comparabile standard
IFEval 88,0% 83,2% instruction following
MMMU 67,3–70,0% thinking / non‑thinking
MathVista 78,8% 77,6% (Qwen2.5‑VL) thinking mode

Condizioni di riproducibilità: protocolli standard (5‑shot / zero‑shot); dataset aperti (C‑Eval 2023+, MMLU, MMMU). Il trattino («—») indica che i dati comparabili nelle stesse condizioni non sono riportati nel rapporto.[3]

Valutazioni di ERNIE Bot 4.0

Il rapporto SuperBench dell'Università di Tsinghua classifica gli LLM commerciali in base a una serie di attività (comprensione linguistica, matematica, programmazione, multitasking). ERNIE Bot 4.0 si è classificato al primo posto tra i modelli cinesi, superando GLM‑4 (Zhipu AI) di circa 0,41 punti nella metrica integrale; i modelli GPT‑4 e Anthropic Claude‑3 si mantenevano al di sopra nella classifica globale. ERNIE Bot 4.0 mostrava risultati forti nella comprensione del testo cinese e nel seguire le istruzioni, con prestazioni più deboli nella programmazione e in alcuni compiti in lingua inglese.[9][10]

Applicazioni

Prodotti e servizi Baidu

I modelli della serie ERNIE sono integrati nell'ecosistema dei prodotti Baidu:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — chatbot con supporto alla generazione multimodale (testo, immagini, video, audio). Secondo i dati di Baidu, il numero di utenti attivi mensili supera i 200 milioni (2024–2025). Dal 2025 ERNIE Bot è disponibile gratuitamente.[7]
  • Ricerca Baidu — generazione di risposte e funzionalità AI nei risultati di ricerca; secondo i dati di Baidu, fino al 70% dei risultati principali sono arricchiti da componenti AI.
  • Qianfan (piattaforma MaaS) — API per clienti aziendali; secondo i dati di Baidu, oltre 760 mila aziende utilizzano la piattaforma, con un numero di chiamate API giornaliere superiore a 1,5 miliardi (2024). Tra i clienti figurano Lenovo, Trip.com e altri.[7]
  • Comate — assistente AI per la programmazione.
  • Wenxin Yige — generazione di immagini basata sui modelli ERNIE‑ViLG.[11]
  • Integrazioni con partner esterni: Samsung Galaxy (per il mercato cinese), avatar digitali, plugin (ricerca, analisi di file).[7]

Applicazioni settoriali

I modelli vengono applicati nei seguenti ambiti:[7][3]

  • Sistemi di domande e risposte in aree di dominio (diritto, medicina, finanza) con pre-addestramento potenziato dalla conoscenza.
  • Generazione e modifica di testi in lingua cinese (notizie, testi di marketing, contenuto creativo).
  • Attività multimodali: analisi di immagini, schemi ingegneristici, video e dati tabulari (nelle versioni 4.5 e successive).
  • Istruzione (apprendimento personalizzato), robotica (pianificazione dei compiti), guida autonoma (Apollo).

Codice aperto

A partire da ERNIE 4.5, tutte le 10 varianti della famiglia sono state rilasciate con licenza Apache 2.0 con il toolkit ERNIEKit (supporto a SFT, LoRA, DPO, inferenza su PaddlePaddle/FastDeploy). Il codice delle versioni precedenti (ERNIE 1.0–3.0) è disponibile su GitHub PaddlePaddle/ERNIE.[3][15]

Limitazioni e problemi aperti

Limitazioni architetturali e dei dataset

ERNIE 3.0 Titan con 260 miliardi di parametri è limitata a una lunghezza del contesto di 512 token per il singolo modulo, il che vincola la modellazione di testi di grande lunghezza senza meccanismi aggiuntivi (chunking, memoria esterna). L'addestramento viene condotto principalmente su corpus cinese, il che porta a una disomogeneità della qualità tra il cinese e le altre lingue.[6]

L'integrazione del grafo della conoscenza migliora il trattamento dei fatti strutturati, tuttavia l'accuratezza e la completezza delle conoscenze sono limitate dalla qualità del grafo stesso e dalla procedura di corrispondenza tripla–testo (entity linking, relation alignment), che in alcuni casi produce associazioni errate o incomplete.[6]

Allucinazioni e affidabilità

L'adversarial loss e il controllable LM loss migliorano la robustezza rispetto alle generazioni inaffidabili, ma non è possibile eliminare completamente il problema delle allucinazioni (generazione di affermazioni fattualmente errate). I parametri del classificatore adversariale vengono addestrati su dati in cui il testo «generato» è prodotto dalla versione precedente di ERNIE, il che limita lo spettro dei pattern erronei riconoscibili.[6]

Pregiudizi sociali

Uno studio pubblicato su PeerJ Computer Science (2025) analizza i pregiudizi sociali negli LLM cinesi (ERNIE e Qwen) utilizzando 240 gruppi sociali e oltre 30 mila descrizioni generate. I risultati mostrano che ERNIE genera meno contenuti negativi e stereotipati rispetto a Baidu Search o Qwen (circa 1/10 delle parole candidate con connotazione negativa in ERNIE contro 1/3 in Qwen). Tuttavia, una certa prevalenza di stereotipi, incluse descrizioni potenzialmente offensive, persiste.[16][17]

Riproducibilità

Alcuni modelli della serie (ERNIE 3.0 Titan, ERNIE Bot commerciale 4.0 e 5.0) non sono disponibili come codice completamente aperto con pesi, il che limita la riproducibilità dei benchmark e la possibilità di valutazione indipendente. Con il rilascio di ERNIE 4.5 sotto Apache 2.0 la situazione è migliorata, tuttavia le architetture e le impostazioni di addestramento possono differire da quanto descritto nelle pubblicazioni precedenti.[3][6]

Sicurezza in ambito medico

Studi sull'utilizzo di ERNIE Bot in scenari medici (Si et al., 2025) hanno evidenziato una tendenza alla sovraprescrizione: il 91,9% di esami non necessari e il 57,8% di farmaci non necessari in scenari modello, nonché disparità legate all'età e al livello socioeconomico nelle raccomandazioni.[18]

Aspetti etici e regolatori

I modelli della serie ERNIE operano nell'ambito della regolamentazione cinese sull'AI generativa, in particolare delle «Misure provvisorie per la gestione dei servizi di AI generativa» (Interim Measures for Generative AI Services, 2023), che prevedono la valutazione obbligatoria della sicurezza, la registrazione degli algoritmi e restrizioni sui contenuti.[7][17]

ERNIE Bot mostra un elevato tasso di rifiuto per le richieste legate ad argomenti politici sensibili, in conformità con la legislazione nazionale. Studi (Pan et al., 2026) analizzano la censura politica negli LLM di origine cinese, inclusi i modelli di Baidu.[19]

Le pubblicazioni di Baidu non sempre descrivono in dettaglio le procedure di audit del comportamento del modello, i criteri di filtraggio dei contenuti e il bilanciamento tra i requisiti normativi locali e i principi generali dell'etica dell'AI, il che rimane un'area aperta per la ricerca indipendente.[17]

Prospettive e direzioni di ricerca

Sulla base dei rapporti tecnici e delle dichiarazioni di Baidu, emergono le seguenti direzioni di sviluppo della serie ERNIE:

  • Ulteriore espansione multimodale (testo–immagine–video–audio), inclusa l'elaborazione di dati visivi tecnici densi (schemi ingegneristici, immagini mediche).[3][4]
  • Combinazione di architetture dense e MoE per bilanciare qualità ed efficienza computazionale con dimensioni totali dei modelli molto grandi.[3]
  • Sviluppo di sistemi agentici (GenFlow, Famou) e strumenti di generazione strutturata (JSON, chiamate API) per l'integrazione in workflow produttivi.[3]
  • Miglioramento dell'efficienza dell'addestramento: elastic training, scaling migliorato del MoE (MFU), quantizzazione (W4A8, 2‑bit per il deployment su singola GPU).[3]
  • Ricerche sulla riduzione dei pregiudizi negli LLM cinesi tenendo conto degli aspetti culturali specifici e sviluppo di metodologie di benchmarking per la lingua cinese e i compiti multimodali.[16][17]
  • Miglioramento del ragionamento in contesti lunghi, apprendimento per rinforzo verificabile (verifiable RL) e adattamento a domini con dati limitati tramite corpus sintetici.[3][4]

Confronto con altri LLM cinesi

ERNIE è in competizione con diversi grandi LLM cinesi, tra cui Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) e Tongyi Qianwen. Le principali caratteristiche distintive della serie ERNIE sono l'accento sull'integrazione dei grafi della conoscenza nel pre-addestramento (knowledge enhancement), la stretta integrazione con l'ecosistema Baidu (ricerca, cloud, API) e l'orientamento alla piattaforma PaddlePaddle. Secondo le classifiche indipendenti (SuperBench, LMArena), i modelli della serie ERNIE occupano posizioni elevate tra gli LLM cinesi, specialmente nei compiti di comprensione e seguire le istruzioni in lingua cinese.[9][13][16]

Vedi anche

  • BERT
  • Architettura Transformer
  • RLHF

Bibliografia

Note

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.