ERNIE (Baidu) (HU)
ERNIE (Baidu) — előre betanított nyelvi modellek (Large Language Model, LLM) és multimodális alapmodellek sorozata, amelyet a Baidu vállalat 2019 óta fejleszt Enhanced Representation through kNowledge IntEgration (tudásintegráción alapuló erősített reprezentáció) közös elnevezés alatt. A sorozat célja a szemantikai megértés és generálás minőségének javítása a külső tudás — tudásgráfok (Knowledge Graph, KG), ontológiák és enciklopédiák — explicit integrálásával az előtanítási folyamatba.[1][2]
A sorozat modelljei a korai, entitás- és frázismaszkírozáson alapuló BERT-változatoktól (ERNIE 1.0, 2.0) a nagyszabású egységesített architektúrákon (ERNIE 3.0, ERNIE 3.0 Titan) át a nyílt forráskódú, Mixture-of-Experts (MoE) alapú multimodális rendszerekig (ERNIE 4.5) és a natív omnimultimodális modellekig (ERNIE 5.0) fejlődtek. A sorozat támogatja a szövegmegértési (Natural Language Understanding, NLU), szöveggenerálási (Natural Language Generation, NLG) feladatokat, a késői változatokban pedig multimodális feladatokat is (szöveg, kép, videó, hang), kínai nyelvi fókusszal és többnyelvű támogatással.[2][3][4]
История и предпосылки - Előzmények és háttér
Az ERNIE sorozat fejlesztése 2019-ben kezdődött a Baidu kutatási részlegénél, válaszul a BERT modell (Devlin et al., 2018) sikerére, valamint arra az igényre, hogy az előre betanított modelleket a kínai nyelvhez igazítsák, ahol a szavak közötti szóközök hiánya és az ideogrammok magas poliszémiája megnehezíti a szemantikai egységek (entitások, frázisok) azonosítását.[1]
ERNIE 1.0 (2019)
A sorozat első modellje (Sun et al., arXiv:1904.09223, 2019. április) többszintű tudásmaszkírozási (knowledge masking) stratégiát vezetett be a BERT-szerű architektúrához: a véletlenszerű tokenmaszkírozás helyett a modell teljes entitásokat és frázisokat maskol, amelyeket névfelismerés (Named Entity Recognition, NER) és frázisminták alapján azonosít.[1]
Az ERNIE 1.0 architektúrája Transformer-enkóderre épül (12 réteg, 768-as rejtett dimenzió, 12 figyelemfej). Kiegészítésként bevezették a Dialogue Language Model (DLM) feladatot a párbeszédes adatokon való tanítás céljából. A modellt ~173 millió kínai mondaton tanították, amelyek a Wikipedia, a Baidu Baike, hírforrások és a Baidu Tieba fórum korpuszaiból származnak. A közzétételkor az ERNIE 1.0 öt kínai NLP-feladaton ért el state-of-the-art (SOTA) eredményt: XNLI (teszt pontosság 78,4% a BERT 77,2%-ával szemben), MSRA-NER (F1 93,8% a 92,6%-kal szemben).[1]
ERNIE 2.0 (2019)
Az ERNIE 2.0 (Sun et al., arXiv:1907.12412, 2019. július; elfogadva az AAAI 2020 konferenciára) bevezette a folyamatos többfeladatos előtanítási (continual multi-task pre-training) keretrendszert, amelyben az egységes transzformerhez szekvenciálisan (inkrementálisan) adhatók hozzá új előtanítási feladatok a modell teljes újratanítása nélkül.[5]
Az ERNIE 2.0 előtanítási feladatai három csoportra oszthatók:
- Word-aware — tudásmaszkírozás (knowledge masking), nagybetűhasználat-előrejelzés (capitalization prediction), token–dokumentum kapcsolat (token-document relation).
- Structure-aware — mondatátrendezés (sentence reordering), mondatok közötti távolság meghatározása (sentence distance).
- Semantic-aware — diszkurzív viszonyok előrejelzése (discourse relation prediction), információkeresési relevancia előrejelzése (IR relevance prediction).[5]
A modellt angol és kínai korpuszokon tanították (enciklopédiák, könyvek, Reddit, keresési naplók). Eredmények: az alap modell GLUE átlagpontszáma 80,6 (a BERT 78,3-ával szemben), a nagy modellé 83,6; az ERNIE 2.0 16 feladaton múlta felül a BERT-et és az XLNet-et.[5]
ERNIE 3.0 (2021)
Az ERNIE 3.0 keretrendszer (Sun et al., arXiv:2107.02137, 2021. július) egyetlen architektúrában egyesítette az autoenkóderes (auto-encoding, AE) és az autoregresszív (auto-regressive, AR) előtanítási paradigmákat, amelyek egy univerzális reprezentációs modulra (Universal Representation Module) és feladatspecifikus modulokra (Task-specific Representation Modules) — NLU-ra és NLG-re — oszlanak.[2]
A 10 milliárd paraméteres modellt 4 TB kínai szövegen tanították (11 kategória: Baidu Baike, Wikipedia, keresési naplók, kérdés-válasz rendszerek, domain szövegek), valamint egy több mint 50 millió tényt tartalmazó tudásgráfon. Az ERNIE 3.0 54 kínai NLP-feladaton ért el SOTA eredményt; az angol nyelvű SuperGLUE benchmarkon 90,6%-ot ért el (2021. július 3-án, az emberi referencia 89,8% felett).[2]
ERNIE 3.0 Titan (2021)
A „ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, 2021. december) tanulmány az ERNIE 3.0 keretrendszer 260 milliárd paraméteres sűrű (dense) modellre való skálázását írja le, amelyet a PaddlePaddle platformon valósítottak meg.[6]
A Titan további mechanizmusokat vezetett be: önfelügyelt adversarial loss-t a generált szöveg hitelességének értékelésére, controllable language modeling loss-t a generálás stílusának, témájának, tónusának és hosszának vezérléséhez, valamint online desztillációt (On-the-Fly Distillation, OFD) kompakt tanítványmodellek előtanítás közbeni előállítására. A modellt 68 adathalmazon értékelték, és a szerzők szerint minden 68 dataseten felülmúlta az elődmodelleket.[6]
ERNIE Bot és kereskedelmi verziók (2023–2025)
2023 márciusában a Baidu kiadta az ERNIE Bot chatbotot (Wenxin Yiyan, 文心一言), amely az ERNIE 3.x és a PLATO (párbeszédes modell) modelleken alapul. A nyilvános hozzáférés 2023 augusztusában nyílt meg a szabályozók jóváhagyása után. A frissítések közé tartozott az ERNIE 3.5 (2023. június) és az ERNIE 4.0 (2023. október).[7][8]
A Tsinghua Egyetem SuperBench jelentése szerint az ERNIE Bot 4.0 az első helyen végzett a kínai LLM-ek között az integrált metrika alapján, erős eredményeket mutatva a kínai szövegmegértésben és az utasításkövetésben.[9][10]
2022-ben, a fő nyelvi sorozattal párhuzamosan, bemutatták a ERNIE-ViLG 2.0 multimodális kiterjesztést (arXiv:2210.15257) — egy szövegből képet generáló (text-to-image) modellt, amely az egyik első lépés volt a multimodalitás irányába.[11]
2024-ben a WAVE SUMMIT konferencián a Baidu bemutatta az ERNIE 4.0 Turbo-t — a nagy sebességű alkalmazásokhoz optimalizált verziót, amely képes több mint ezer szó hosszúságú szöveget nagyjából 20 másodperc alatt generálni, megőrizve a minőséget.[12]
ERNIE 4.5 (2025)
2025 júniusában a Baidu közzétette az ERNIE 4.5 technikai jelentését, amely 10 modellből álló sorozatot mutat be: szöveges LLM-eket és multimodális (Vision-Language, VL) modelleket. Az architektúra heterogén Mixture-of-Experts (MoE) alapú, modalitásonként elkülönített szakértőkkel. A változatok közé tartoznak MoE-modellek akár 424 milliárd összesített és 47 milliárd aktív paraméterrel, valamint egy 0,3 milliárd paraméteres sűrű modell. A sorozatot Apache 2.0 licenc alatt adták ki a Hugging Face-en és a GitHubon (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
2026 februárjában jelent meg az ERNIE 5.0 technikai jelentése (arXiv:2602.04705) — egy natív omnimultimodális autoregresszív modell ultra-ritka MoE-val (ultra-sparse MoE), amely egységes architektúrában támogatja szöveg, képek, hang és videó együttes modellezését. A modell magas pozíciókat ért el az LMArena ranglistán.[4][13]
Теоретические основы и архитектурные принципы - Elméleti alapok és architekturális elvek
Маскирование знаний - Tudásmaszkírozás (Knowledge Masking)
A korai sorozatmodellek kulcselve a strukturált tudás integrálása az előtanítási folyamatba módosított maszkírozási stratégiákon keresztül. A standard Masked Language Modeling (MLM) megközelítéssel ellentétben, ahol egyes tokeneket maszkíroznak, az ERNIE 1.0 teljes szemantikai egységeket maskol: entitásokat (NER-en keresztül azonosítva) és frázisokat. A entitás esetén az összes tokent tartalmazó szekvenciát valószínűséggel maszkírozzák. Ez a megközelítés arra kényszeríti a modellt, hogy szélesebb kontextusra támaszkodjon, és megtanulja az entitások közötti összefüggéseket.[1]
Az ERNIE 2.0 továbbfejlesztette ezt a megközelítést inkrementális többfeladatos tanulással: a lexikális, strukturális és szemantikai szintű feladatokat szekvenciálisan adják hozzá, miközben a korábban megtanult tudás megmarad a folyamatos előtanítás (continual pre-training) mechanizmusának köszönhetően.[5]
ERNIE 3.0 egységesített keretrendszer
Az ERNIE 3.0 keretrendszer az architektúra két szintre osztásán alapul:[2][6]
- Universal Representation Module — közös többrétegű Transformer-XL, amelyet előtanítási feladatok sokféleségén tanítanak, és amely általános lexikális és szintaktikai jellemzőket von ki. A Titan verzióban ez a modul 48 réteget, 12 288-as rejtett reprezentációt, 192 figyelemfejet és 196 608-as belső feed-forward hálózatméretet tartalmaz ().
- Task-specific Representation Modules — külön modulok NLU-hoz (kétirányú figyelem) és NLG-hez (egyirányú figyelem Transformer-XL rekurrens memóriával), mindkettő 12 réteggel, 768-as rejtett vektormérettel és 12 figyelemfejjel.
Az autoenkóderes és az autoregresszív paradigmák integrálása lehetővé teszi, hogy egyetlen modell magas teljesítményt nyújtson mind az NLU-benchmarkokon (BERT-szerű feladatok), mind az NLG-benchmarkokon (GPT-szerű feladatok).[2]
Universal Knowledge-Text Prediction (UKTP)
Az UKTP feladat a tudásintegráció központi mechanizmusa az ERNIE 3.0/Titan rendszerben. A modell egy (tudásgráf-hármas, enciklopédiai mondat) párt kap, és vagy a hármasban lévő relációt kell előrejeleznie a szöveg segítségével, vagy a szöveg maszkírozott tokenjeit a hármasból nyert információ alapján.[6]
A reláció előrejelzésénél a szöveghez kapcsolt hármasban a feladat többosztályos osztályozásként fogalmazható meg:
ahol a transzformer kimenete a fej- és farokentitás-megemlítések pozícióiban, az osztályozó paraméterei, a modell paraméterei.[6]
Hiteles és vezérelt generálás mechanizmusai (Titan)
Az ERNIE 3.0 Titan két további veszteségfüggvény-típust vezetett be.[6]
Önfelügyelt adversarial loss. A datasetet hozták létre, ahol valódi bekezdések, pedig az ERNIE korábbi verziója által az eredeti bekezdések előtagjaiból generált szövegek. A feladat bináris osztályozás (eredeti / generált) a speciális [CLS] token rejtett állapota alapján:
ahol a [CLS] vektoros reprezentációja a -ik példára, az eredeti szövegekhez való tartozás indikátora.[6]
Controllable language modeling loss. Minden tanítási példához attribútumok halmaza (prompt) tartozik, amelyek leírják a műfajt, témát, kulcsszavakat, tónust és hosszt. A veszteség a feltétel nélküli és a feltételes nyelvi modellezést kombinálja:
Failed to parse (unknown function "\begin{cases}"): {\displaystyle L_c(D_c) = \begin{cases} -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}), & ext{если } p \le 0{,}5,\\ -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}, ext{prompts}_n), & ext{если } p > 0{,}5, \end{cases}}
ahol egy véletlen változó a módok váltakozásához, a -ik példa -ik tokenje. Ez a definíció megakadályozza, hogy a modell túlzottan függővé váljon a promptoktól.[6]
Heterogén MoE-architektúra (ERNIE 4.5)
Az ERNIE 4.5 heterogén multimodális Mixture-of-Experts architektúrát vezet be, ahol a szakértők modalitásonként különülnek el: szöveges szakértők és vizuális szakértők (utóbbiak mérete körülbelül 1/3-a a szövegesneknek). A tokenek irányítása modalitásizoláción alapuló útválasztással (modality-isolated routing) és ortogonalizáló büntetőtaggal (router orthogonalization loss, nagyságrendű együtthatóval) történik a szakértők specializációjának biztosítása érdekében. 3D RoPE (Rotary Position Embeddings) módszert alkalmaznak a videóadatok időbeli, magassági és szélességi dimenzióinak pozíciókódolásához. A FlashMask mechanizmus a hosszú kontextus hatékony kezelésére szolgál (legfeljebb 131 ezer token) maszkokkal.[3]
Az ERNIE 4.5 előtanítása több szakaszban zajlik: először csak szöveges adatokon, majd vizuális adatokon, végül közös multimodális tanítási fázisban (text-only → vision-only → joint). A képek feldolgozásához adaptív ViT-enkódert (Vision Transformer) alkalmaznak pixel shuffle mechanizmussal a különböző modalitások reprezentációinak összehangolásához. Hosszú videók feldolgozása is támogatott (legfeljebb 32 ezer token) adaptív keretkiválasztással (adaptive frame sampling).[3]
Natív omnimultimodalitás (ERNIE 5.0)
Az ERNIE 5.0 több modalitás (szöveg, kép, hang, videó) natív autoregresszív modellezését valósítja meg egyetlen architektúrában, ultra-ritka MoE-val, amelynél minden lépésnél az összes szakértő kevesebb mint 3%-a aktiválódik. Előtanítási feladatként a Next-Group-of-Tokens Prediction módszert alkalmazzák — egyszerre tokencsoportot jósolnak meg egyetlen token helyett, ami növeli a tanítás hatékonyságát. A hangmodalitáshoz hierarchikus kodeket (hierarchical codec) alkalmaznak. Az elastic training technológia lehetővé teszi különböző mélységű, szélességű és ritkaságú részmodellek generálását egyetlen tanítási futtatáson belül.[4]
Предобучающие задачи и данные - Előtanítási feladatok és adatok
ERNIE 3.0 / Titan előtanítási feladatai
Az ERNIE 3.0 és a Titan az alábbi előtanítási feladatcsoportokat alkalmazza:[2][6]
Word-aware feladatok:
- Knowledge Masked Language Modeling — frázis- és entitásmaszkírozás a lokális és globális kontextusok közötti összefüggések megtanításához.
- Document Language Modeling — dokumentumok autoregresszív modellezése legfeljebb 512 tokenig, Transformer-XL rekurrens memória alkalmazásával.
Structure-aware feladatok:
- Sentence Reordering — egy véletlenszerűen szegmensre osztott és összekevert bekezdésnél a modell -osztályos osztályozási feladatot old meg ( értékkel), visszaállítva az eredeti sorrendet.
- Sentence Distance — 3-osztályos osztályozás: szomszédos mondatok, nem szomszédos mondatok ugyanabból a dokumentumból, különböző dokumentumokból származó mondatok.
Knowledge-aware feladatok:
- Universal Knowledge-Text Prediction (UKTP) — szöveg és tudásgráf-hármas együttes modellezése.
- Credible and Controllable Generations — adversarial loss és controllable LM loss kombinációja.
Előtanítási adatok
Az ERNIE 3.0/Titan esetében az ERNIE 3.0 Corpus-t használják — egy körülbelül 4 TB méretű kínai korpuszt 11 kategóriában, amely weboldalakat, keresési naplókat, kérdés-válasz adatokat, szépirodalmi, jogi, pénzügyi és orvosi szövegeket, regényeket és verseket tartalmaz. A korpuszra épülve egy több mint 50 millió tényt tartalmazó tudásgráfot alakítottak ki.[2][6]
A Titan számára további adathalmazokat is készítettek:
- Adversarial dataset — 2 millió eredeti bekezdés és a megfelelő „negatív" bekezdések, amelyeket az ERNIE 3.0 generált az eredeti első 1–3 mondatának előtagja alapján, legfeljebb 512 token hosszban.
- Controllable dataset — műfaj, téma (26 tematika), kulcsszavak, tónus (pozitív/negatív/semleges) és hossz attribútumokkal ellátott szövegek. A műfaji attribútumokat tanulható „soft promptok" kódolják (a promptok száma műfajonként véletlenszerűen 0 és 64 között választódik).[6]
A késői verziók (ERNIE 4.5, 5.0) kibővített multimodális korpuszokat használnak (szöveg, képek, videó, hang), beleértve válogatott webes tartalmakat, tudományos publikációkat és szintetikus adatokat.[3][4]
Обучение и распределённая оптимизация - Tanítás és elosztott optimalizálás
Az ERNIE 3.0 Titan előtanítása Adam optimalizálóval történt (tanulási ráta , , , L2-regularizáció 0,1, gradiensnorma vágása 1,0-ra), 512-es maximális kontexthosszal és 128-as rekurrens memóriahosszal a generatív feladatokhoz. Progresszív tanítási sémát alkalmaztak (gyorsított konvergencia az első 4000 lépésben) és lineáris tanulási ráta csökkentést.[6]
4D hibrid párhuzamosítás
A 260 milliárd paraméteres sűrű modell heterogén klasztereken (NVIDIA V100 GPU és Ascend 910 NPU) való tanításához a PaddlePaddle platformon 4D hibrid párhuzamosítást valósítottak meg:[6]
- Data parallelism (DP) — a modell replikációja több eszközön, külön kötegek feldolgozásával.
- Tensor model parallelism (MP) — a transzformer paramétereinek és aktivációinak elosztása az eszközök között a rétegeken belül.
- Pipeline model parallelism (PP) — a modell rétegeinek elosztása a csővezetéken.
- Group Sharded — ZeRO-szerű sharded-data-parallel továbbfejlesztett változata az optimalizáló állapotok duplikációjának csökkentésére.
A jelentés adatokat közöl az Ascend 910 kártyák ezreire való gyenge skálázásról, körülbelül 91,7%-os átviteli hatékonysággal.[6]
ERNIE 4.5 tanítása
Az ERNIE 4.5 tanítása 2016 darab NVIDIA H800 GPU-ból álló klaszteren zajlott, 47%-os Model FLOPs Utilization (MFU) elérésével. FP8 vegyes pontosságot, hibatűrő ellenőrzőpontokat (Zero Cost Checkpoint, 8 percnél rövidebb helyreállítási idő) és progresszív tanítást alkalmaztak növekvő szekvenciahosszal és kötegmérettel.[3]
Online desztilláció
Az ERNIE 3.0 Titan telepítési számítási igényeinek csökkentéséhez online desztillációt alkalmaznak, amelynek során a tanítómodell és több tanítványmodell egyidejűleg tanul:[6]
- On-the-Fly Distillation (OFD) — a tanítói logitokat és reprezentációkat ugyanazokon a tanítási lépéseken használják a tanítványok tanítására.
- Teacher assistants — közepes méretű közbenső modellek, amelyek csökkentik a tanító és a végső tanítványok közötti kapacitáskülönbséget.
- Auxiliary Layer Distillation (ALD) — a tanítványban lévő kiegészítő réteg, amelyet fine-tuning során eldobnak, a belső reprezentációk jobb illeszkedéséhez.
Постобучение и выравнивание - Utótanítás és igazítás
Az ERNIE kereskedelmi verziói (az ERNIE Bottól kezdve) utótanítási fázisokon mennek keresztül:[7][3]
- Supervised Fine-Tuning (SFT) — továbbtanítás annotált instrukciós adatokon (az ERNIE 4.5-ben 2,3 millió példa).
- Reinforcement Learning from Human Feedback (RLHF) — a modell viselkedésének igazítása emberi visszajelzéssel; PPO (Proximal Policy Optimization) és DPO (Direct Preference Optimization) algoritmusokat alkalmaznak.
- Unified Preference Optimization (UPO) — az ERNIE 4.5-ben bevezetett egységesített preferencia-optimalizálási módszer.
- Reinforcement Learning with Verifiers (RLVR) — megerősítéses tanulás verifikátorokkal a válaszok helyességének ellenőrzésére; GRPO (Group Relative Policy Optimization) módszert alkalmaznak.
- Gondolkodási módok (thinking modes) — a 4.5-ös modellek támogatják mind a reflektív (reflection, planning), mind a közvetlen válaszadási módot.
Ключевые результаты и бенчмарки - Főbb eredmények és benchmarkok
A modellek fejlődésének összefoglaló táblázata
| Verzió | Év | Paraméterek | Architektúra | Főbb benchmarkok | Forrás |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 millió (base) | Transformer-enkóder (BERT-szerű) | XNLI 78,4%; MSRA-NER F1 93,8% | [1] |
| ERNIE 2.0 | 2019 | ~110–340 millió | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 feladaton SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 milliárd | Unified Transformer-XL (AE+AR) | SuperGLUE 90,6% (> emberi 89,8%); 54 kínai feladaton SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 milliárd (dense) | Dense + controllable generation | 68 dataseten SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 milliárd (MoE, 47 milliárd aktív) | Heterogeneous multimodal MoE | C-Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% | [3] |
| ERNIE 5.0 | 2026 | ~2,4 billió (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (globálisan top-10) | [4] |
ERNIE 3.0 és Titan eredmények
Az ERNIE 3.0 (10 milliárd paraméter) az angol nyelvű SuperGLUE benchmarkon 90,6-os átlageredményt ért el, meghaladva az emberi referenciát (89,8), valamint a GPT-3, T5 és DeBERTa mutatóit a közzétételkor. Az ERNIE 3.0 Titant (260 milliárd) 68 adathalmazon értékelték, beleértve osztályozási, NLI, QA és generálási feladatokat; a szerzők minden 68 dataseten az előző modelleket meghaladó teljesítményről számolnak be. Ezek az eredmények az elsődleges forrásokból származnak; a független reprodukció korlátozott mértékben dokumentált.[2][6]
ERNIE 4.5 eredmények
A 2025-ös technikai jelentés adatai szerint az ERNIE 4.5 (300B-A47B, utótanítás után) az alábbi eredményeket éri el szöveges és multimodális benchmarkokon:[3]
| Benchmark | ERNIE-4.5-300B-A47B | Feltételek |
|---|---|---|
| C-Eval | 90,6% | 5-shot |
| CMMLU | 90,2% | — |
| MMLU | 86,5% | standard |
| IFEval | 88,0% | instruction following |
| GSM8K | 91,8% | — |
| MMMU | 67,3–70,0% | non-thinking / thinking |
| MathVista | 78,8% | thinking mode |
| OCRBench | 883 | — |
A jelentés szerint az ERNIE 4.5 a 28 benchmarkból 22-n felülmúlta a DeepSeek-V3-at; a multimodális változatok (ERNIE-4.5-VL-424B-A47B) versenyképes eredményeket mutattak vizuális következtetési feladatokon. Egyes vizuális következtetési és műszaki képértelmezési feladatokban (áramkörelemzés, mérnöki diagramok) magasabb eredményeket jeleznek, mint egyes GPT és Gemini modelleknél.[3][14]
Az ERNIE 4.5 összehasonlítása versenytársakkal (válogatott benchmarkok, utótanítás után, a 2025-ös technikai jelentés alapján):
| Benchmark | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Megjegyzés |
|---|---|---|---|---|
| C-Eval | 90,6% | — | — | 5-shot |
| MMLU | 86,5% | összehasonlítható | — | standard |
| IFEval | 88,0% | — | 83,2% | instruction following |
| MMMU | 67,3–70,0% | — | — | thinking / non-thinking |
| MathVista | 78,8% | — | 77,6% (Qwen2.5-VL) | thinking mode |
Reprodukciós feltételek: standard protokollok (5-shot / zero-shot); nyílt adathalmazok (C-Eval 2023+, MMLU, MMMU). A gondolatjel („—") azt jelenti, hogy a jelentésben nem szerepelnek azonos feltételek melletti összehasonlítható adatok.[3]
ERNIE Bot 4.0 értékelések
A Tsinghua Egyetem SuperBench jelentése rangsorolja a kereskedelmi LLM-eket feladatok sorozatán (szövegmegértés, matematika, programozás, multitask). Az ERNIE Bot 4.0 az első helyen végzett a kínai modellek között, körülbelül 0,41 ponttal megelőzve a GLM-4-et (Zhipu AI) az integrált metrika alapján; a GPT-4 és az Anthropic Claude-3 modellek magasabb pozícióban maradtak a globális rangsorban. Az ERNIE Bot 4.0 erős eredményeket mutatott kínai szövegmegértésben és utasításkövetésben, gyengébb teljesítmény mellett programozásban és egyes angol nyelvű feladatokban.[9][10]
Применение - Alkalmazások
Baidu termékek és szolgáltatások
Az ERNIE sorozat modelljei integrálva vannak a Baidu termékökoszisztémájába:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — chatbot multimodális generálás támogatásával (szöveg, képek, videó, hang). A Baidu adatai szerint a havi aktív felhasználók száma meghaladja a 200 millió főt (2024–2025). 2025-től az ERNIE Bot ingyenesen elérhető.[7]
- Baidu Keresés — válaszgenerálás és AI-funkciók a keresési találatok között; a Baidu adatai szerint a felső találatok akár 70%-a AI-komponensekkel gazdagított.
- Qianfan (MaaS-platform) — API vállalati ügyfelek számára; a Baidu adatai szerint több mint 760 ezer vállalat használja a platformot, a napi API-hívások száma meghaladja az 1,5 milliárdot (2024). Az ügyfelek között szerepel a Lenovo, a Trip.com és mások.[7]
- Comate — AI-asszisztens programozáshoz.
- Wenxin Yige — képgenerálás ERNIE-ViLG modellek alapján.[11]
- Külső partnerekkel való integrációk: Samsung Galaxy (kínai piac), digitális avatarok, bővítmények (keresés, fájlelemzés).[7]
Ágazati alkalmazások
A modellek az alábbi területeken kerülnek alkalmazásra:[7][3]
- Kérdés-válasz rendszerek szakterületeken (jog, orvostudomány, pénzügy) tudáserősített előtanítással.
- Kínai nyelvű szövegek generálása és szerkesztése (hírek, marketing szövegek, kreatív tartalom).
- Multimodális feladatok: képelemzés, mérnöki sémák, videó- és táblázatos adatok elemzése (4.5-ös és újabb verziókban).
- Oktatás (személyre szabott tanulás), robotika (feladattervezés), autonóm vezetés (Apollo).
Nyílt forráskód
Az ERNIE 4.5-től kezdve a sorozat mind a 10 változata Apache 2.0 licenc alatt jelent meg az ERNIEKit eszközkészlettel (SFT, LoRA, DPO, inferencia PaddlePaddle/FastDeploy támogatással). A korábbi verziók (ERNIE 1.0–3.0) kódja elérhető a GitHub PaddlePaddle/ERNIE oldalán.[3][15]
Ограничения и открытые проблемы - Korlátok és nyitott kérdések
Architekturális és adathalmaz korlátok
Az ERNIE 3.0 Titan 260 milliárd paraméterrel az egyes modulokban 512 tokenes kontexthossz-korláttal rendelkezik, ami a hosszú szövegek modellezését korlátozza kiegészítő mechanizmusok (darabolás, külső memória) nélkül. A tanítás elsősorban kínai korpuszon zajlik, ami egyenetlen minőséget eredményez a kínai és más nyelvek között.[6]
A tudásgráf integrációja javítja a strukturált tényekkel való bánásmódot, azonban a tudás pontossága és teljessége korlátozott magának a gráfnak a minőségétől és a hármas–szöveg megfeleltetési eljárástól (entity linking, relation alignment), ami egyes esetekben hibás vagy hiányos asszociációkhoz vezet.[6]
Hallucinációk és megbízhatóság
Az adversarial loss és a controllable LM loss javítja a megbízhatatlan generálásokkal szembeni robusztusságot, azonban a hallucinációk (tényszerűen helytelen állítások generálása) problémáját nem sikerül teljesen kiküszöbölni. Az adversarial osztályozó paraméterei olyan adatokon tanulnak, ahol a „generált" szövegeket az ERNIE korábbi verziója hozta létre, ami korlátozza a felismerhető hibás minták körét.[6]
Társadalmi előítéletek
Egy, a PeerJ Computer Science folyóiratban megjelent tanulmány (2025) a kínai LLM-ek (ERNIE és Qwen) társadalmi előítéleteit elemzi 240 társadalmi csoportot és több mint 30 ezer generált leírást felhasználva. Az eredmények azt mutatják, hogy az ERNIE kevesebb negatív és sztereotip tartalmat generál, mint a Baidu Search vagy a Qwen (az ERNIE-nél a jelölt szavak körülbelül 1/10-e negatív konnotációjú, a Qwen-nél ez az arány 1/3). Ugyanakkor bizonyos mértékű sztereotípia-előfordulás, beleértve potenciálisan sértő leírásokat, megmarad.[16][17]
Reprodukálhatóság
A sorozat egyes modelljei (ERNIE 3.0 Titan, kereskedelmi ERNIE Bot 4.0 és 5.0) nem érhetők el teljesen nyílt kódként és súlyokként, ami korlátozza a benchmarkok reprodukálhatóságát és a független értékelés lehetőségét. Az ERNIE 4.5 Apache 2.0 alatt való kiadásával a helyzet javult, azonban az architektúrák és a tanítási beállítások eltérhetnek a korábbi publikációkban leírtaktól.[3][6]
Orvosi biztonság
Az ERNIE Bot orvosi forgatókönyvekben való alkalmazásával kapcsolatos kutatások (Si et al., 2025) a túlzott előírásokra való hajlamot mutatták ki: a modell forgatókönyvekben a szükségtelen vizsgálatok 91,9%-át és a szükségtelen gyógyszerek 57,8%-át rendelte fel, valamint életkori és társadalmi-gazdasági egyenlőtlenségeket mutatott az ajánlásokban.[18]
Этические и регуляторные аспекты - Etikai és szabályozási szempontok
Az ERNIE sorozat modelljei a kínai generatív AI-szabályozás keretein belül működnek, különösen a „Generatív AI Szolgáltatások Kezelésére Vonatkozó Ideiglenes Intézkedések" (Interim Measures for Generative AI Services, 2023) alapján, amelyek kötelező biztonsági értékelést, algoritmus-regisztrációt és tartalomkorlátozásokat írnak elő.[7][17]
Az ERNIE Bot magas elutasítási arányt mutat az érzékeny politikai témákkal kapcsolatos lekérdezéseknél, a nemzeti jogszabályoknak megfelelően. Kutatások (Pan et al., 2026) a kínai LLM-ekben — beleértve a Baidu modelljeit — megfigyelhető politikai cenzúrát elemzik.[19]
A Baidu publikációi nem minden esetben részletezik a modell viselkedésének auditálási eljárásait, a tartalomszűrési kritériumokat és a helyi szabályozási követelmények, valamint az általános AI-etikai elvek közötti egyensúlyt, ami a független kutatások számára nyitott terület marad.[17]
Перспективы и направления исследований - Perspektívák és kutatási irányok
A Baidu technikai jelentései és közleményei alapján az ERNIE sorozat fejlesztésének következő irányai azonosíthatók:
- A multimodalitás további fejlesztése (szöveg–kép–videó–hang), beleértve a sűrű technikai vizuális adatok (mérnöki sémák, orvosi képek) feldolgozását.[3][4]
- Sűrű és MoE-architektúrák kombinálása a minőség és a számítási hatékonyság egyensúlyának megteremtéséhez nagyon nagy összesített modellek esetén.[3]
- Ágens rendszerek fejlesztése (GenFlow, Famou) és strukturált generálási eszközök (JSON, API-hívások) az éles munkamenetekbe való integráláshoz.[3]
- A tanítási hatékonyság javítása: elastic training, fejlettebb MoE skálázás (MFU), kvantálás (W4A8, 2-bit egyetlen GPU-n való telepítéshez).[3]
- Kutatások a kínai LLM-ek előítéleteinek csökkentésére kulturálisan specifikus szempontok figyelembevételével, valamint benchmarkolási módszertanok fejlesztése kínai nyelvű és multimodális feladatokhoz.[16][17]
- A hosszú kontextusbeli következtetés javítása, verifikálható megerősítéses tanulás (verifiable RL) és szintetikus korpuszokon keresztüli adaptáció korlátozott adatú szakterületekhez.[3][4]
Сравнение с другими китайскими LLM - Összehasonlítás más kínai LLM-ekkel
Az ERNIE számos nagy kínai LLM-mel versenyez, köztük a Qwen (Alibaba), a GLM / ChatGLM (Zhipu AI), a DeepSeek (DeepSeek AI) és a Tongyi Qianwen modellekkel. Az ERNIE sorozat fő megkülönböztető jellemzői: a tudásgráfok integrálásának hangsúlyozása az előtanításban (knowledge enhancement), szoros integráció a Baidu ökoszisztémájával (keresés, felhő, API) és a PaddlePaddle platformra való orientáció. A független rangsorok (SuperBench, LMArena) szerint az ERNIE sorozat modelljei magas pozíciókat foglalnak el a kínai LLM-ek között, különösen kínai nyelvű megértési és utasításkövetési feladatokban.[9][13][16]
Lásd még
- BERT
- Transformer architektúra
- RLHF
Irodalom
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Megjegyzések
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.