ERNIE (Baidu) (PL)
ERNIE (Baidu) — seria wstępnie wytrenowanych modeli językowych (Large Language Model, LLM) oraz multimodalnych modeli fundamentalnych, rozwijanych przez firmę Baidu od 2019 roku pod wspólną nazwą Enhanced Representation through kNowledge IntEgration (wzmocniona reprezentacja poprzez integrację wiedzy). Seria nastawiona jest na poprawę jakości rozumienia semantycznego i generowania poprzez jawną integrację wiedzy zewnętrznej z grafów wiedzy (Knowledge Graph, KG), ontologii i encyklopedii w procesie wstępnego trenowania.[1][2]
Modele serii ewoluowały od wczesnych wariantów opartych na BERT z maskowaniem encji i fraz (ERNIE 1.0, 2.0), przez wielkoskalowe zunifikowane architektury (ERNIE 3.0, ERNIE 3.0 Titan), do multimodalnych systemów opartych na Mixture-of-Experts (MoE) z otwartym kodem źródłowym (ERNIE 4.5) i natywnych modeli omnimodalnych (ERNIE 5.0). Seria obsługuje zadania rozumienia tekstu (Natural Language Understanding, NLU), generowania tekstu (Natural Language Generation, NLG) oraz — w późniejszych wersjach — zadania multimodalne (tekst, obraz, wideo, audio), z naciskiem na język chiński i obsługą wielojęzyczności.[2][3][4]
Historia i kontekst powstania
Rozwój serii ERNIE rozpoczął się w 2019 roku w dziale badawczym Baidu w odpowiedzi na sukces modelu BERT (Devlin et al., 2018) oraz konieczność adaptacji wstępnie trenowanych modeli do języka chińskiego, w którym brak wyraźnych spacji między wyrazami i wysoki odsetek wieloznacznych znaków utrudniają uchwycenie jednostek semantycznych (encji, fraz).[1]
ERNIE 1.0 (2019)
Pierwszy model serii (Sun et al., arXiv:1904.09223, kwiecień 2019) wprowadził strategię wielopoziomowego maskowania wiedzy (knowledge masking) dla architektury podobnej do BERT: zamiast losowego maskowania pojedynczych tokenów model maskuje całe encje i frazy, identyfikowane na podstawie rozpoznawania jednostek nazwanych (Named Entity Recognition, NER) oraz wzorców frazowych.[1]
Architektura ERNIE 1.0 opiera się na enkoderze Transformer (12 warstw, wymiar ukryty 768, 12 głów uwagi). Dodatkowo wprowadzono zadanie Dialogue Language Model (DLM) do uczenia na danych dialogowych. Model był trenowany na około 173 milionach chińskich zdań z korpusów Wikipedia, Baidu Baike, wiadomości oraz forum Baidu Tieba. W momencie publikacji ERNIE 1.0 osiągnął wyniki state-of-the-art (SOTA) na pięciu chińskich zadaniach NLP: XNLI (dokładność 78,4% na zbiorze testowym wobec 77,2% u BERT), MSRA-NER (F1 93,8% wobec 92,6%).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun et al., arXiv:1907.12412, lipiec 2019; przyjęty na konferencję AAAI 2020) wprowadził framework ciągłego wielozadaniowego wstępnego trenowania (continual multi-task pre-training), w którym do wspólnego transformera sekwencyjnie (inkrementalnie) dodawane są nowe zadania wstępnego trenowania bez konieczności ponownego trenowania modelu od początku.[5]
Zadania wstępnego trenowania ERNIE 2.0 podzielone są na trzy grupy:
- Word-aware — maskowanie wiedzy (knowledge masking), przewidywanie wielkości liter (capitalization prediction), relacja tokena z dokumentem (token-document relation).
- Structure-aware — zmiana kolejności zdań (sentence reordering), określanie odległości między zdaniami (sentence distance).
- Semantic-aware — przewidywanie relacji dyskursywnych (discourse relation prediction), trafność dla wyszukiwania informacji (IR relevance prediction).[5]
Model był trenowany na angielskich i chińskich korpusach (encyklopedie, książki, Reddit, logi wyszukiwania). Wyniki: średni wynik GLUE dla modelu base wyniósł 80,6 (wobec 78,3 u BERT), dla modelu large — 83,6; ERNIE 2.0 przewyższył BERT i XLNet na 16 zadaniach.[5]
ERNIE 3.0 (2021)
Framework ERNIE 3.0 (Sun et al., arXiv:2107.02137, lipiec 2021) połączył paradygmat autoenkoderowy (auto-encoding, AE) i autoregresyjny (auto-regressive, AR) w jednej architekturze, podzielonej na moduł reprezentacji uniwersalnej (Universal Representation Module) oraz moduły reprezentacji zadaniowej (Task-specific Representation Modules) dla NLU i NLG.[2]
Model z 10 miliardami parametrów był trenowany na 4 TB chińskiego tekstu (11 kategorii: Baidu Baike, Wikipedia, logi wyszukiwania, systemy pytań i odpowiedzi, teksty dziedzinowe) oraz grafie wiedzy zawierającym ponad 50 milionów faktów. ERNIE 3.0 osiągnął wyniki SOTA na 54 chińskich zadaniach NLP; na angielskim benchmarku SuperGLUE — 90,6% (stan na 3 lipca 2021 roku, powyżej ludzkiego punktu odniesienia 89,8%).[2]
ERNIE 3.0 Titan (2021)
W pracy „ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" (Wang et al., arXiv:2112.12731, grudzień 2021) opisano skalowanie frameworku ERNIE 3.0 do gęstego (dense) modelu z 260 miliardami parametrów, zaimplementowanego na platformie PaddlePaddle.[6]
Titan wprowadził dodatkowe mechanizmy: samosuperwizowaną stratę adversarialną (adversarial loss) do oceny wiarygodności generowanego tekstu, stratę modelowania języka z kontrolą (controllable language modeling loss) do sterowania stylem, tematem, wydźwiękiem i długością generowania, a także destylację online (On-the-Fly Distillation, OFD) pozwalającą uzyskiwać kompaktowe modele-uczniów (student models) w trakcie wstępnego trenowania. Model był oceniany na 68 zbiorach danych i według autorów przewyższył wcześniejsze modele na wszystkich 68 zbiorach.[6]
ERNIE Bot i wersje komercyjne (2023–2025)
W marcu 2023 roku Baidu wydał chatbot ERNIE Bot (Wenxin Yiyan, 文心一言) oparty na modelach ERNIE 3.x i PLATO (model dialogowy). Publiczny dostęp został otwarty w sierpniu 2023 roku po uzyskaniu zgody regulatorów. Aktualizacje obejmowały ERNIE 3.5 (czerwiec 2023) i ERNIE 4.0 (październik 2023).[7][8]
Zgodnie z raportem SuperBench Uniwersytetu Tsinghua, ERNIE Bot 4.0 zajął pierwsze miejsce wśród chińskich LLM według metryki zagregowanej, osiągając silne wyniki w rozumieniu języka chińskiego i wykonywaniu instrukcji.[9][10]
W 2022 roku, równolegle do głównej linii modeli językowych, zaprezentowano multimodalne rozszerzenie ERNIE-ViLG 2.0 (arXiv:2210.15257) — model generowania obrazów na podstawie tekstu (text-to-image), co stanowiło jeden z pierwszych kroków w kierunku multimodalności.[11]
W 2024 roku podczas konferencji WAVE SUMMIT Baidu zaprezentował ERNIE 4.0 Turbo — zoptymalizowaną wersję do zastosowań wymagających wysokiej szybkości, zdolną do generowania tekstu o długości ponad tysiąca słów w około 20 sekund przy zachowaniu jakości.[12]
ERNIE 4.5 (2025)
W czerwcu 2025 roku Baidu opublikował raport techniczny ERNIE 4.5, przedstawiający rodzinę 10 modeli: tekstowe LLM oraz modele multimodalne (Vision-Language, VL). Architektura opiera się na heterogenicznym Mixture-of-Experts (MoE) z podziałem ekspertów według modalności. Warianty obejmują modele MoE z łączną liczbą do 424 miliardów parametrów i 47 miliardami parametrów aktywnych, a także model gęsty z 0,3 miliarda parametrów. Rodzina została udostępniona na licencji Apache 2.0 na Hugging Face i GitHub (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
W lutym 2026 roku opublikowano raport techniczny ERNIE 5.0 (arXiv:2602.04705) — natywny omnimodalny model autoregresyjny z ultrarzadkim MoE (ultra-sparse MoE), obsługujący wspólne modelowanie tekstu, obrazów, audio i wideo. Model zajmował wysokie pozycje w tabeli liderów LMArena.[4][13]
Podstawy teoretyczne i zasady architektoniczne
Maskowanie wiedzy (Knowledge Masking)
Kluczową zasadą wczesnych modeli serii jest integracja wiedzy strukturalnej w procesie wstępnego trenowania poprzez zmodyfikowane strategie maskowania. W odróżnieniu od standardowego Masked Language Modeling (MLM), gdzie maskowane są pojedyncze tokeny, ERNIE 1.0 maskuje całe jednostki semantyczne: encje (identyfikowane przez NER) oraz frazy. Dla encji maskowana jest cała sekwencja tokenów z zadanym prawdopodobieństwem . Takie podejście zmusza model do opierania się na szerszym kontekście i uczenia się powiązań między encjami.[1]
ERNIE 2.0 rozwinął to podejście, dodając inkrementalne uczenie wielozadaniowe: zadania na poziomie leksykalnym, strukturalnym i semantycznym dodawane są sekwencyjnie, a wcześniej zdobyta wiedza jest zachowywana dzięki mechanizmowi ciągłego wstępnego trenowania (continual pre-training).[5]
Zunifikowany framework ERNIE 3.0
Framework ERNIE 3.0 opiera się na podziale architektury na dwa poziomy:[2][6]
- Universal Representation Module — wspólny wielowarstwowy Transformer-XL, trenowany na różnorodnych zadaniach wstępnego trenowania i wyodrębniający ogólne cechy leksykalne i syntaktyczne. W wersji Titan moduł ten zawiera 48 warstw, reprezentację ukrytą o rozmiarze 12288, 192 głowy uwagi i wewnętrzny rozmiar sieci feed-forward równy 196608 ().
- Task-specific Representation Modules — oddzielne moduły dla NLU (uwaga dwukierunkowa) i NLG (uwaga jednokierunkowa z pamięcią rekurencyjną Transformer-XL), każdy z 12 warstwami, rozmiarem wektora ukrytego 768 i 12 głowami uwagi.
Integracja paradygmatu autoenkoderowego i autoregresyjnego pozwala jednemu modelowi osiągać wysokie wyniki zarówno na benchmarkach NLU (zadania podobne do BERT), jak i na benchmarkach NLG (zadania podobne do GPT).[2]
Universal Knowledge-Text Prediction (UKTP)
Zadanie UKTP jest centralnym mechanizmem integracji wiedzy w ERNIE 3.0/Titan. Model otrzymuje parę (trójka z grafu wiedzy, zdanie z encyklopedii) i musi albo przewidzieć relację w trójce, korzystając z tekstu, albo przewidzieć zamaskowane tokeny w tekście, korzystając z informacji z trójki.[6]
Przy przewidywaniu relacji w trójce powiązanej z tekstem zadanie jest formułowane jako klasyfikacja wieloklasowa:
gdzie — wyjście transformera na pozycjach wzmianek encji głowy i ogona, — parametry klasyfikatora, — parametry modelu.[6]
Mechanizmy wiarygodnej i kontrolowanej generacji (Titan)
ERNIE 3.0 Titan wprowadził dwa dodatkowe typy funkcji straty.[6]
Samosuperwizowana strata adversarialna. Tworzony jest zbiór danych , gdzie — oryginalne akapity, a — teksty wygenerowane przez poprzednią wersję ERNIE na podstawie prefiksu oryginalnych akapitów. Zadaniem jest binarna klasyfikacja (oryginał / wygenerowany) na podstawie ukrytego stanu specjalnego tokena [CLS]:
gdzie — wektorowa reprezentacja [CLS] dla -tego przykładu, — wskaźnik przynależności do tekstów oryginalnych.[6]
Strata modelowania języka z kontrolą. Każdy przykład treningowy jest opatrzony zestawem atrybutów (prompt) opisujących gatunek, temat, słowa kluczowe, wydźwięk i długość. Strata łączy bezwarunkowe i warunkowe modelowanie języka:
Failed to parse (unknown function "\begin{cases}"): {\displaystyle L_c(D_c) = \begin{cases} -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}), & ext{если } p \le 0{,}5,\\ -\sum_{n=1}^{|D_c|} \log P_{ heta}(x^{(n)}_t \mid x^{(n)}_{<t}, ext{prompts}_n), & ext{если } p > 0{,}5, \end{cases}}
gdzie — zmienna losowa służąca do przeplatania trybów, — -ty token -tego przykładu. Takie sformułowanie zapobiega nadmiernemu uzależnieniu modelu od promptów.[6]
Heterogeniczna architektura MoE (ERNIE 4.5)
ERNIE 4.5 wprowadza heterogeniczną multimodalną architekturę Mixture-of-Experts z podziałem ekspertów według modalności: eksperci tekstowi i eksperci wizualni (ci ostatni mają około 1/3 rozmiaru ekspertów tekstowych). Routing tokenów odbywa się z izolacją modalności (modality-isolated routing) oraz zastosowaniem kary ortogonalizującej dla routera (router orthogonalization loss, współczynnik rzędu ) w celu zapewnienia specjalizacji ekspertów. Stosowane jest 3D RoPE (Rotary Position Embeddings) do kodowania pozycyjnego wymiarów czasowego, wysokościowego i szerokościowego w danych wideo. Mechanizm FlashMask jest stosowany do efektywnej obsługi długiego kontekstu (do 131 tys. tokenów) z maskami .[3]
Wstępne trenowanie ERNIE 4.5 przebiega w kilku etapach: najpierw uczenie wyłącznie na danych tekstowych, następnie na danych wizualnych, a w końcowej fazie — wspólne uczenie na danych multimodalnych (text-only → vision-only → joint). Do przetwarzania obrazów używany jest adaptacyjny enkoder ViT (Vision Transformer) z mechanizmem pixel shuffle do wyrównania reprezentacji różnych modalności. Obsługiwane jest przetwarzanie długich filmów wideo (do 32 tys. tokenów) z adaptacyjnym próbkowaniem klatek (adaptive frame sampling).[3]
Natywna omnimodalność (ERNIE 5.0)
ERNIE 5.0 realizuje natywne autoregresyjne modelowanie wielu modalności (tekst, obraz, audio, wideo) w jednolitej architekturze z ultrarzadkim MoE, w którym na każdym kroku aktywuje się mniej niż 3% wszystkich ekspertów. Jako zadanie wstępnego trenowania stosowane jest przewidywanie następnej grupy tokenów (Next-Group-of-Tokens Prediction) — przewidywanie grupy tokenów zamiast pojedynczego tokena, co zwiększa efektywność uczenia. Dla modalności audio stosowany jest hierarchiczny kodek (hierarchical codec). Technologia elastic training umożliwia generowanie podmodeli o różnej głębokości, szerokości i stopniu rzadkości w ramach jednego procesu trenowania.[4]
Zadania wstępnego trenowania i dane
Zadania wstępnego trenowania ERNIE 3.0 / Titan
W ERNIE 3.0 i Titan stosowane są następujące grupy zadań wstępnego trenowania:[2][6]
Zadania Word-aware:
- Knowledge Masked Language Modeling — frazowe i encyjne maskowanie służące uczeniu zależności w lokalnym i globalnym kontekście.
- Document Language Modeling — autoregresyjne modelowanie dokumentów o długości do 512 tokenów z wykorzystaniem pamięci rekurencyjnej Transformer-XL.
Zadania Structure-aware:
- Sentence Reordering — dla akapitu losowo podzielonego na segmentów i potasowanego model rozwiązuje zadanie klasyfikacji -klasowej z , odtwarzając oryginalną kolejność.
- Sentence Distance — klasyfikacja 3-klasowa: zdania sąsiednie, niesąsiednie w tym samym dokumencie, zdania z różnych dokumentów.
Zadania Knowledge-aware:
- Universal Knowledge-Text Prediction (UKTP) — wspólne modelowanie tekstu i trójki z grafu wiedzy.
- Credible and Controllable Generations — kombinacja straty adversarialnej i straty kontrolowanego modelowania języka.
Dane do wstępnego trenowania
Dla ERNIE 3.0/Titan używany jest korpus ERNIE 3.0 Corpus — chiński korpus o objętości około 4 TB w 11 kategoriach, zawierający strony internetowe, logi wyszukiwania, dane pytań i odpowiedzi, teksty beletrystyczne, prawnicze, finansowe i medyczne, nowele oraz poezję. Na podstawie korpusu zbudowany jest graf wiedzy zawierający ponad 50 milionów faktów.[2][6]
Dodatkowo dla Titan tworzone są:
- Zbiór adversarialny — 2 miliony oryginalnych akapitów i odpowiadające im „negatywne" akapity wygenerowane przez ERNIE 3.0 na podstawie prefiksu pierwszych 1–3 zdań oryginału, o długości do 512 tokenów.
- Zbiór kontrolowany — teksty opatrzone atrybutami gatunku, tematu (26 kategorii tematycznych), słów kluczowych, wydźwięku (positive/negative/neutral) i długości. Atrybuty gatunku kodowane są za pomocą uczonych „miękkich promptów" (liczba promptów dla gatunku wybierana losowo od 0 do 64).[6]
Późniejsze wersje (ERNIE 4.5, 5.0) korzystają z rozszerzonych multimodalnych korpusów (tekst, obrazy, wideo, audio), w tym z wyselekcjonowanych treści internetowych, publikacji naukowych i danych syntetycznych.[3][4]
Trenowanie i optymalizacja rozproszona
Wstępne trenowanie ERNIE 3.0 Titan było prowadzone z użyciem optymalizatora Adam (współczynnik uczenia , , , regularyzacja L2 równa 0,1, obcinanie normy gradientu do 1,0), maksymalnej długości kontekstu 512 i długości pamięci rekurencyjnej 128 dla zadań generatywnych. Stosowano progresywny harmonogram uczenia (przyspieszona zbieżność przez pierwsze 4000 kroków) oraz liniowy zanik współczynnika uczenia.[6]
4D-hybrydowy paralelizm
Do trenowania gęstego modelu z 260 miliardami parametrów na heterogenicznych klastrach (GPU NVIDIA V100 i NPU Ascend 910) w PaddlePaddle zaimplementowano 4D-hybrydowy paralelizm:[6]
- Data parallelism (DP) — replikacja modelu na wielu urządzeniach z oddzielnym przetwarzaniem batchy.
- Tensor model parallelism (MP) — podział parametrów i aktywacji transformera wewnątrz warstw między urządzenia.
- Pipeline model parallelism (PP) — dystrybucja warstw modelu w potoku przetwarzania.
- Group Sharded — udoskonalony wariant równoległości danych podzielonych (sharded data parallel) podobny do ZeRO, mający na celu zmniejszenie duplikacji stanów optymalizatora.
W raporcie przytaczane są dane o słabym skalowaniu do tysięcy kart Ascend 910 z efektywnością rzędu 91,7% pod względem przepustowości.[6]
Trenowanie ERNIE 4.5
Trenowanie ERNIE 4.5 odbywało się na klastrze złożonym z 2016 GPU NVIDIA H800, osiągając wskaźnik Model FLOPs Utilization (MFU) równy 47%. Zastosowano mieszaną precyzję FP8, odporne na awarie punkty kontrolne (Zero Cost Checkpoint, odtwarzanie w czasie poniżej 8 minut) oraz progresywne trenowanie z wydłużaniem sekwencji i rozmiaru batcha.[3]
Destylacja online
Aby zmniejszyć wymagania obliczeniowe przy wdrażaniu ERNIE 3.0 Titan, stosowana jest destylacja online, w której model-nauczyciel i kilka modeli-uczniów są trenowane jednocześnie:[6]
- On-the-Fly Distillation (OFD) — logity i reprezentacje nauczyciela są używane do uczenia uczniów na tych samych krokach trenowania.
- Teacher assistants — modele o pośrednim rozmiarze, zmniejszające lukę pojemnościową między nauczycielem a docelowymi uczniami.
- Auxiliary Layer Distillation (ALD) — dodatkowa warstwa w uczniu, odrzucana podczas fine-tuningu, służąca lepszemu dopasowaniu wewnętrznych reprezentacji.
Dotrenowanie i wyrównanie
Komercyjne wersje ERNIE (począwszy od ERNIE Bot) przechodzą etapy dotrenowania:[7][3]
- Supervised Fine-Tuning (SFT) — dotrenowanie na oznakowanych danych instrukcyjnych (w ERNIE 4.5 — 2,3 miliona przykładów).
- Reinforcement Learning from Human Feedback (RLHF) — wyrównanie zachowania modelu za pomocą informacji zwrotnej od człowieka; stosowane są algorytmy PPO (Proximal Policy Optimization) i DPO (Direct Preference Optimization).
- Unified Preference Optimization (UPO) — ujednolicona metoda optymalizacji preferencji wprowadzona w ERNIE 4.5.
- Reinforcement Learning with Verifiers (RLVR) — uczenie ze wzmocnieniem z użyciem weryfikatorów do sprawdzania poprawności odpowiedzi; stosowana jest metoda GRPO (Group Relative Policy Optimization).
- Tryby rozumowania (thinking modes) — modele 4.5 obsługują tryby z refleksją (reflection, planning) i bez niej.
Kluczowe wyniki i benchmarki
Zestawienie ewolucji modeli
| Wersja | Rok | Parametry | Architektura | Kluczowe benchmarki | Źródło |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 mln (base) | Enkoder Transformer (podobny do BERT) | XNLI 78,4%; MSRA-NER F1 93,8% | [1] |
| ERNIE 2.0 | 2019 | ~110–340 mln | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 zadań SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 mld | Unified Transformer-XL (AE+AR) | SuperGLUE 90,6% (> human 89,8%); 54 chin. zadania SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 mld (dense) | Dense + controllable generation | 68 zbiorów danych SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 mld (MoE, 47 mld akt.) | Heterogeneous multimodal MoE | C-Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% | [3] |
| ERNIE 5.0 | 2026 | ~2,4 bln (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (top-10 globalnie) | [4] |
Wyniki ERNIE 3.0 i Titan
ERNIE 3.0 (10 miliardów parametrów) na angielskim benchmarku SuperGLUE osiągnął średni wynik 90,6, przewyższający ludzki punkt odniesienia (89,8) oraz wyniki GPT-3, T5 i DeBERTa w momencie publikacji. ERNIE 3.0 Titan (260 mld) był oceniany na 68 zbiorach danych, obejmujących zadania klasyfikacji, NLI, QA i generowania; autorzy informują o przewyższeniu wcześniejszych modeli na wszystkich 68 zbiorach. Wyniki te pochodzą ze źródeł pierwotnych; niezależna reprodukcja jest opisana w ograniczonym zakresie.[2][6]
Wyniki ERNIE 4.5
Zgodnie z raportem technicznym z 2025 roku, ERNIE 4.5 (300B-A47B, po dotrenowaniu) osiąga następujące wyniki na tekstowych i multimodalnych benchmarkach:[3]
| Benchmark | ERNIE-4.5-300B-A47B | Warunki |
|---|---|---|
| C-Eval | 90,6% | 5-shot |
| CMMLU | 90,2% | — |
| MMLU | 86,5% | standardowy |
| IFEval | 88,0% | instruction following |
| GSM8K | 91,8% | — |
| MMMU | 67,3–70,0% | non-thinking / thinking |
| MathVista | 78,8% | thinking mode |
| OCRBench | 883 | — |
Zgodnie z raportem, ERNIE 4.5 przewyższył DeepSeek-V3 na 22 z 28 benchmarków; warianty multimodalne (ERNIE-4.5-VL-424B-A47B) wykazały konkurencyjne wyniki na zadaniach wizualnego rozumowania. W części zadań wizualnego rozumowania i technicznej interpretacji obrazów (analiza schematów, diagramów inżynierskich) podawane są wyniki wyższe niż dla niektórych modeli GPT i Gemini.[3][14]
Porównanie ERNIE 4.5 z konkurentami (wybrane benchmarki, po dotrenowaniu, według raportu technicznego z 2025 roku):
| Benchmark | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Uwaga |
|---|---|---|---|---|
| C-Eval | 90,6% | — | — | 5-shot |
| MMLU | 86,5% | porównywalnie | — | standardowy |
| IFEval | 88,0% | — | 83,2% | instruction following |
| MMMU | 67,3–70,0% | — | — | thinking / non-thinking |
| MathVista | 78,8% | — | 77,6% (Qwen2.5-VL) | thinking mode |
Warunki reprodukcji: standardowe protokoły (5-shot / zero-shot); zbiory danych otwarte (C-Eval 2023+, MMLU, MMMU). Myślnik („—") oznacza, że porównywalne dane w tych samych warunkach nie zostały podane w raporcie.[3]
Oceny ERNIE Bot 4.0
Raport SuperBench Uniwersytetu Tsinghua klasyfikuje komercyjne LLM według zestawu zadań (rozumienie języka, matematyka, programowanie, wielozadaniowość). ERNIE Bot 4.0 zajął pierwsze miejsce wśród chińskich modeli, wyprzedzając GLM-4 (Zhipu AI) o około 0,41 punktu według metryki zagregowanej; modele GPT-4 i Anthropic Claude-3 pozostawały wyżej w globalnym rankingu. ERNIE Bot 4.0 wykazywał silne wyniki w chińskim rozumieniu tekstu i wykonywaniu instrukcji przy słabszych wynikach w programowaniu i niektórych zadaniach anglojęzycznych.[9][10]
Zastosowania
Produkty i usługi Baidu
Modele serii ERNIE są zintegrowane z ekosystemem produktów Baidu:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — chatbot z obsługą multimodalnego generowania (tekst, obrazy, wideo, audio). Według danych Baidu, liczba miesięcznie aktywnych użytkowników przekracza 200 milionów (2024–2025). Od 2025 roku ERNIE Bot jest dostępny bezpłatnie.[7]
- Wyszukiwarka Baidu — generowanie odpowiedzi i funkcje AI w wynikach wyszukiwania; według danych Baidu, nawet 70% najlepszych wyników jest wzbogaconych komponentami AI.
- Qianfan (platforma MaaS) — API dla klientów korporacyjnych; według danych Baidu, ponad 760 tysięcy przedsiębiorstw korzysta z platformy, a liczba dziennych wywołań API przekracza 1,5 miliarda (2024). Wśród klientów znajdują się Lenovo, Trip.com i inni.[7]
- Comate — asystent AI do programowania.
- Wenxin Yige — generowanie obrazów na bazie modeli ERNIE-ViLG.[11]
- Integracje z zewnętrznymi partnerami: Samsung Galaxy (na rynek chiński), cyfrowe awatary, wtyczki (wyszukiwanie, analiza plików).[7]
Zastosowania branżowe
Modele są stosowane w następujących obszarach:[7][3]
- Systemy pytań i odpowiedzi w dziedzinach specjalistycznych (prawo, medycyna, finanse) z wykorzystaniem wstępnego trenowania wzbogaconego wiedzą.
- Generowanie i redagowanie tekstów w języku chińskim (wiadomości, teksty marketingowe, treści kreatywne).
- Zadania multimodalne: analiza obrazów, schematów inżynierskich, wideo i danych tabelarycznych (w wersjach 4.5 i nowszych).
- Edukacja (spersonalizowane uczenie), robotyka (planowanie zadań), autonomiczna jazda (Apollo).
Otwarty kod
Począwszy od ERNIE 4.5, wszystkie 10 wariantów rodziny zostało udostępnionych na licencji Apache 2.0 wraz z narzędziami ERNIEKit (obsługa SFT, LoRA, DPO, wnioskowanie na PaddlePaddle/FastDeploy). Kod wcześniejszych wersji (ERNIE 1.0–3.0) jest dostępny na GitHub PaddlePaddle/ERNIE.[3][15]
Ograniczenia i otwarte problemy
Ograniczenia architektoniczne i związane ze zbiorami danych
ERNIE 3.0 Titan przy 260 miliardach parametrów jest ograniczony długością kontekstu wynoszącą 512 tokenów dla pojedynczego modułu, co ogranicza modelowanie długich tekstów bez dodatkowych mechanizmów (chunking, pamięć zewnętrzna). Trenowanie odbywa się głównie na chińskim korpusie, co prowadzi do niejednolitości jakości między językiem chińskim a innymi językami.[6]
Integracja grafu wiedzy poprawia działanie ze strukturalnymi faktami, jednak dokładność i kompletność wiedzy jest ograniczona jakością samego grafu oraz procedurą dopasowywania „trójka–tekst" (entity linking, relation alignment), co w niektórych przypadkach prowadzi do błędnych lub niepełnych skojarzeń.[6]
Halucynacje i wiarygodność
Strata adversarialna i strata kontrolowanego modelowania języka poprawiają odporność na niewiarygodne generacje, jednak całkowite wyeliminowanie problemu halucynacji (generowania faktycznie nieprawdziwych stwierdzeń) nie jest możliwe. Parametry klasyfikatora adversarialnego są trenowane na danych, gdzie tekst „wygenerowany" jest tworzony przez poprzednią wersję ERNIE, co ogranicza spektrum rozpoznawalnych błędnych wzorców.[6]
Uprzedzenia społeczne
Badanie opublikowane w PeerJ Computer Science (2025) analizuje uprzedzenia społeczne w chińskich LLM (ERNIE i Qwen) z wykorzystaniem 240 grup społecznych i ponad 30 tysięcy wygenerowanych opisów. Wyniki pokazują, że ERNIE generuje mniej negatywnych i stereotypowych treści niż Baidu Search lub Qwen (około 1/10 słów kandydatów z negatywną konotacją w ERNIE wobec 1/3 w Qwen). Jednocześnie pewne rozpowszechnienie stereotypów, w tym potencjalnie obraźliwych opisów, nadal się utrzymuje.[16][17]
Odtwarzalność
Część modeli serii (ERNIE 3.0 Titan, komercyjne ERNIE Bot 4.0 i 5.0) nie jest dostępna w postaci w pełni otwartego kodu i wag, co ogranicza odtwarzalność benchmarków i możliwość niezależnej oceny. Wraz z wydaniem ERNIE 4.5 na licencji Apache 2.0 sytuacja uległa poprawie, jednak architektury i ustawienia trenowania mogą różnić się od opisanych we wcześniejszych publikacjach.[3][6]
Bezpieczeństwo medyczne
Badania dotyczące zastosowania ERNIE Bot w scenariuszach medycznych (Si et al., 2025) ujawniły tendencję do nadmiernych zaleceń: 91,9% zbędnych badań i 57,8% zbędnych leków w modelowych scenariuszach, a także dysproporcje związane z wiekiem i statusem społeczno-ekonomicznym w rekomendacjach.[18]
Aspekty etyczne i regulacyjne
Modele serii ERNIE funkcjonują w ramach chińskich regulacji dotyczących generatywnej sztucznej inteligencji, w szczególności „Tymczasowych środków zarządzania generatywnymi usługami AI" (Interim Measures for Generative AI Services, 2023), które przewidują obowiązkową ocenę bezpieczeństwa, rejestrację algorytmów i ograniczenia dotyczące treści.[7][17]
ERNIE Bot wykazuje wysoki poziom odmów na zapytania dotyczące wrażliwych tematów politycznych, zgodnie z krajowym ustawodawstwem. Badania (Pan et al., 2026) analizują cenzurę polityczną w LLM chińskiego pochodzenia, w tym modele Baidu.[19]
Publikacje Baidu nie zawsze szczegółowo opisują procedury audytu zachowania modelu, kryteria filtrowania treści oraz równowagę między lokalnymi wymogami regulacyjnymi a ogólnymi zasadami etyki AI, co pozostaje otwartym obszarem dla niezależnych badań.[17]
Perspektywy i kierunki badań
Na podstawie raportów technicznych i komunikatów Baidu wyróżnia się następujące kierunki rozwoju serii ERNIE:
- Dalsza multimodalizacja (tekst–obraz–wideo–audio), w tym przetwarzanie gęstych technicznych danych wizualnych (schematy inżynierskie, obrazy medyczne).[3][4]
- Łączenie gęstych architektur i MoE dla zrównoważenia jakości i efektywności obliczeniowej przy bardzo dużych łącznych rozmiarach modeli.[3]
- Rozwój systemów agentowych (GenFlow, Famou) i narzędzi do strukturowanego generowania (JSON, wywołania API) do integracji z produkcyjnymi procesami roboczymi.[3]
- Poprawa efektywności trenowania: elastic training, ulepszone skalowanie MoE (MFU), kwantyzacja (W4A8, 2-bitowa do wdrożenia na jednym GPU).[3]
- Badania nad redukcją uprzedzeń w chińskich LLM z uwzględnieniem aspektów kulturowo-specyficznych oraz rozwój metodologii benchmarkingu dla języka chińskiego i zadań multimodalnych.[16][17]
- Poprawa rozumowania w długim kontekście, weryfikowalne uczenie ze wzmocnieniem (verifiable RL) i adaptacja do dziedzin z ograniczonymi danymi za pomocą syntetycznych korpusów.[3][4]
Porównanie z innymi chińskimi LLM
ERNIE konkuruje z szeregiem dużych chińskich LLM, wśród których znajdują się Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) i Tongyi Qianwen. Główne wyróżniki serii ERNIE to nacisk na integrację grafów wiedzy w wstępnym trenowaniu (knowledge enhancement), ścisła integracja z ekosystemem Baidu (wyszukiwanie, chmura, API) oraz orientacja na platformę PaddlePaddle. Według niezależnych rankingów (SuperBench, LMArena), modele serii ERNIE zajmują wysokie pozycje wśród chińskich LLM, szczególnie w zadaniach rozumienia i wykonywania instrukcji w języku chińskim.[9][13][16]
Zobacz też
- BERT
- Architektura Transformer
- RLHF
Literatura
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Przypisy
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.