ERNIE (Baidu) (TR)
ERNIE (Baidu) — Baidu tarafından 2019 yılından itibaren Enhanced Representation through kNowledge IntEgration (bilgi entegrasyonu yoluyla güçlendirilmiş temsil) genel adıyla geliştirilen önceden eğitilmiş dil modelleri (Large Language Model, LLM) ve çok modlu temel modeller serisidir. Seri, harici bilgilerin bilgi grafikleri (Knowledge Graph, KG), ontolojiler ve ansiklopedilerden ön eğitim sürecine açıkça entegre edilmesi yoluyla anlamsal anlama ve üretim kalitesini artırmaya yöneliktir.[1][2]
Seri modelleri; sözlük ögesi ve öbek maskeleme tabanlı erken BERT varyantlarından (ERNIE 1.0, 2.0), büyük ölçekli birleşik mimarilere (ERNIE 3.0, ERNIE 3.0 Titan), açık kaynaklı Mixture-of-Experts (MoE) tabanlı çok modlu sistemlere (ERNIE 4.5) ve yerel omni-modal modellere (ERNIE 5.0) doğru evrilmiştir. Seri; metin anlama (Natural Language Understanding, NLU), metin üretme (Natural Language Generation, NLG) görevlerini ve sonraki sürümlerde çok modlu görevleri (metin, görüntü, video, ses) desteklemekte olup Çince diline odaklanmakta ve çok dilli desteğe sahiptir.[2][3][4]
Tarihçe ve Arka Plan
ERNIE serisi geliştirmesi, 2019 yılında Baidu araştırma bölümünde; BERT modelinin (Devlin ve ark., 2018) başarısı ve sözcükler arasındaki belirgin boşlukların yokluğu ile yüksek oranlı çok anlamlı karakter yapısının anlamsal birimlerin (varlıklar, öbekler) yakalanmasını güçleştirdiği Çince için önceden eğitilmiş modellerin uyarlanması gerekliliğine yanıt olarak başladı.[1]
ERNIE 1.0 (2019)
Serinin ilk modeli (Sun ve ark., arXiv:1904.09223, Nisan 2019), BERT benzeri mimari için çok düzeyli bilgi maskeleme (knowledge masking) stratejisi sundu: rastgele ayrı token maskelemek yerine model, Adlandırılmış Varlık Tanıma (Named Entity Recognition, NER) ve öbek kalıplarına dayalı olarak belirlenen tüm varlıkları ve öbekleri maskeler.[1]
ERNIE 1.0 mimarisi bir Transformer enkodere dayanmaktadır (12 katman, gizli boyut 768, 12 dikkat başlığı). Ayrıca diyalog verileri üzerinde eğitim için Dialogue Language Model (DLM) görevi eklenmiştir. Model, Wikipedia, Baidu Baike, haber ve Baidu Tieba forumundan oluşan külliyatlardan yaklaşık 173 milyon Çince cümle üzerinde eğitilmiştir. Yayımlandığı dönemde ERNIE 1.0, beş Çince NLP görevinde state-of-the-art (SOTA) sonuçlar elde etti: XNLI (test doğruluğu %78,4'e karşı BERT'in %77,2'si), MSRA-NER (F1 93,8'e karşı 92,6).[1]
ERNIE 2.0 (2019)
ERNIE 2.0 (Sun ve ark., arXiv:1907.12412, Temmuz 2019; AAAI 2020 konferansına kabul edildi), modelin tamamı yeniden eğitilmeksizin ortak transformere yeni ön eğitim görevlerinin sıralı (artımlı) olarak eklendiği sürekli çok görevli ön eğitim (continual multi-task pre-training) çerçevesini tanıttı.[5]
ERNIE 2.0 ön eğitim görevleri üç gruba ayrılmaktadır:
- Word-aware — bilgi maskeleme (knowledge masking), büyük/küçük harf tahmini (capitalization prediction), token ile belge ilişkisi (token-document relation).
- Structure-aware — cümle yeniden sıralama (sentence reordering), cümleler arası mesafe belirleme (sentence distance).
- Semantic-aware — söylem ilişkisi tahmini (discourse relation prediction), bilgi erişimi ile ilgililik tahmini (IR relevance prediction).[5]
Model, İngilizce ve Çince külliyatlar üzerinde eğitildi (ansiklopediler, kitaplar, Reddit, arama günlükleri). Sonuçlar: base modelin GLUE ortalama puanı 80,6 (BERT'in 78,3'üne karşı), large model için 83,6; ERNIE 2.0, BERT ve XLNet'i 16 görevde geride bıraktı.[5]
ERNIE 3.0 (2021)
ERNIE 3.0 çerçevesi (Sun ve ark., arXiv:2107.02137, Temmuz 2021), otomatik enkoder (auto-encoding, AE) ve öz-bağlanımlı (auto-regressive, AR) ön eğitim paradigmalarını; Evrensel Temsil Modülü (Universal Representation Module) ile NLU ve NLG için göreve özgü modüllere (Task-specific Representation Modules) bölünmüş tek bir mimaride birleştirdi.[2]
10 milyar parametreli model, 4 TB Çince metin (11 kategori: Baidu Baike, Wikipedia, arama günlükleri, soru-cevap sistemleri, alan metinleri) ve 50 milyondan fazla gerçeği içeren bir bilgi grafiği üzerinde eğitildi. ERNIE 3.0, 54 Çince NLP görevinde SOTA'ya ulaştı; İngilizce SuperGLUE kıyaslamasında %90,6 elde etti (3 Temmuz 2021 itibarıyla insan referansı olan %89,8'in üzerinde).[2]
ERNIE 3.0 Titan (2021)
"ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation" başlıklı çalışmada (Wang ve ark., arXiv:2112.12731, Aralık 2021), ERNIE 3.0 çerçevesinin PaddlePaddle platformunda uygulanan 260 milyar parametreli yoğun (dense) bir modele ölçeklendirilmesi aktarılmaktadır.[6]
Titan, ek mekanizmalar tanıttı: oluşturulan metnin güvenilirliğini değerlendirmek için kendi kendine denetimli adversarial loss, üretimin üslubunu, konusunu, duygusal tonunu ve uzunluğunu kontrol etmek için controllable language modeling loss ve ön eğitim sürecinde kompakt öğrenci modeller elde etmek için çevrimiçi damıtma (On-the-Fly Distillation, OFD). Model 68 veri kümesinde değerlendirildi ve yazarlar tüm 68 veri kümesinde önceki modelleri geride bıraktığını bildirdi.[6]
ERNIE Bot ve Ticari Sürümler (2023–2025)
Mart 2023'te Baidu, ERNIE 3.x ve PLATO (diyalog modeli) modellerine dayalı ERNIE Bot (Wenxin Yiyan, 文心一言) sohbet botunu yayımladı. Halka açık erişim, düzenleyici onayın ardından Ağustos 2023'te başladı. Güncellemeler arasında ERNIE 3.5 (Haziran 2023) ve ERNIE 4.0 (Ekim 2023) yer aldı.[7][8]
Tsinghua Üniversitesi SuperBench raporuna göre ERNIE Bot 4.0, bütünleşik metrikte Çince LLM'ler arasında birinci sıraya yerleşerek Çince dil anlama ve talimatlara uyma konularında güçlü sonuçlar sergiledi.[9][10]
2022 yılında, ana dil serisinin yanı sıra metin tabanlı görüntü üretimi (text-to-image) modeli olan ERNIE-ViLG 2.0 (arXiv:2210.15257) çok modlu bir genişleme olarak sunuldu ve bu, çok modalite yönündeki ilk adımlardan birini oluşturdu.[11]
2024 yılında Baidu, WAVE SUMMIT konferansında yüksek hızlı uygulamalar için optimize edilmiş ve kaliteden ödün vermeksizin yaklaşık 20 saniyede binden fazla sözcük içeren metin üretebilen ERNIE 4.0 Turboyu tanıttı.[12]
ERNIE 4.5 (2025)
Haziran 2025'te Baidu, 10 modelden oluşan bir aile sunan ERNIE 4.5 teknik raporunu yayımladı: metin LLM'leri ve çok modlu modeller (Vision-Language, VL). Mimari, modelliklere göre uzmanların ayrıldığı heterojen Mixture-of-Experts (MoE) yapısına dayanmaktadır. Varyantlar; toplam 424 milyar ve 47 milyar etkin parametreli MoE modellerini ve 0,3 milyar parametreli yoğun modeli kapsamaktadır. Aile, Hugging Face ve GitHub'da (PaddlePaddle/ERNIE) Apache 2.0 lisansıyla yayımlandı.[3]
ERNIE 5.0 (2026)
Şubat 2026'da ERNIE 5.0 teknik raporu (arXiv:2602.04705) yayımlandı; bu, metin, görüntü, ses ve video ortak modellemesini destekleyen ultra seyrek MoE (ultra-sparse MoE) içeren yerel omni-modal bir öz-bağlanımlı modeldir ve her adımda toplam uzman sayısının %3'ünden azı etkinleştirilir. Model, LMArena liderlik sıralamasında üst sıralarda yer aldı.[4][13]
Teorik Temeller ve Mimari İlkeler
Bilgi Maskeleme - Knowledge Masking
Serinin erken modellerinin temel ilkesi, değiştirilmiş maskeleme stratejileri aracılığıyla yapılandırılmış bilginin ön eğitim sürecine entegre edilmesidir. Ayrı tokenlerin maskelendiği standart Masked Language Modeling'in (MLM) aksine ERNIE 1.0, tüm anlamsal birimleri maskeler: varlıklar (NER aracılığıyla belirlenen) ve öbekler. varlığı için, tüm token dizisi belirli bir olasılığıyla maskelenir. Bu yaklaşım, modeli daha geniş bir bağlama dayanmaya ve varlıklar arasındaki ilişkileri öğrenmeye zorlar.[1]
ERNIE 2.0 bu yaklaşımı geliştirerek artımlı çok görevli eğitim ekledi: sözcüksel, yapısal ve anlamsal düzey görevleri sırayla eklenir; önceden edinilen bilgiler ise sürekli ön eğitim (continual pre-training) mekanizması sayesinde korunur.[5]
ERNIE 3.0 Birleşik Çerçevesi
ERNIE 3.0 çerçevesi, mimarinin iki katmana ayrılmasına dayanmaktadır:[2][6]
- Universal Representation Module — çeşitli ön eğitim görevleri üzerinde eğitilen ve genel sözcüksel ve sözdizimsel özellikleri çıkaran ortak çok katmanlı Transformer-XL. Titan sürümünde bu modül 48 katman, 12288 boyutunda gizli temsil, 192 dikkat başlığı ve 196608 iç boyutunda feed-forward ağı içerir ().
- Task-specific Representation Modules — NLU (çift yönlü dikkat) ve NLG (Transformer-XL yinelemeli belleğiyle tek yönlü dikkat) için ayrı modüller; her biri 12 katman, 768 boyutunda gizli vektör ve 12 dikkat başlığına sahiptir.
Otomatik enkoder ve öz-bağlanımlı paradigmaların entegrasyonu, tek bir modelin NLU kıyaslamalarında (BERT benzeri görevler) ve NLG kıyaslamalarında (GPT benzeri görevler) yüksek performans göstermesini sağlar.[2]
Universal Knowledge-Text Prediction (UKTP)
UKTP görevi, ERNIE 3.0/Titan'da bilgi entegrasyonunun temel mekanizmasıdır. Model bir çift (bilgi grafiğinden üçlü, ansiklopedi cümlesi) alır ve ya metni kullanarak üçlüdeki ilişkiyi tahmin etmeli ya da üçlüden gelen bilgiyi kullanarak metindeki maskelenmiş tokenleri tahmin etmelidir.[6]
metniyle ilişkili üçlüsündeki ilişkisini tahmin etme görevi, çok sınıflı sınıflandırma olarak formüle edilir:
Burada — baş ve kuyruk varlık sözü geçen konumlardaki transformer çıktısı, — sınıflandırıcı parametreleri, — model parametreleridir.[6]
Güvenilir ve Kontrollü Üretim Mekanizmaları (Titan)
ERNIE 3.0 Titan, iki ek kayıp fonksiyonu türü tanıttı.[6]
Kendi kendine denetimli adversarial loss. veri kümesi oluşturulur; burada gerçek paragraflar, ise önceki ERNIE sürümü tarafından orijinal paragrafların öneki kullanılarak üretilen metinlerdir. Görev, özel [CLS] tokeninin gizli durumuna dayalı ikili sınıflandırmadır (orijinal / üretilmiş):
Burada — . örnek için [CLS] vektör temsili, — orijinal metinlere ait olma göstergesidir.[6]
Controllable language modeling loss. Her eğitim örneği, tür, konu, anahtar sözcükler, duygusal ton ve uzunluğu açıklayan bir dizi özellik (prompt) ile birlikte gelir. Kayıp, koşulsuz ve koşullu dil modellemesini birleştirir:
Burada — modların dönüşümü için rastgele değişken, — . örneğin . tokenidir. Bu tanım, modelin prompt'lara aşırı bağımlı hale gelmesini önler.[6]
Heterojen MoE Mimarisi (ERNIE 4.5)
ERNIE 4.5, modalitelere göre uzmanların ayrıldığı heterojen çok modlu Mixture-of-Experts mimarisini tanıtır: metin uzmanları ve görsel uzmanlar (sonuncular metin uzmanlarının yaklaşık 1/3 boyutundadır). Token yönlendirmesi, modalite izolasyonlu yönlendirme (modality-isolated routing) ve uzman uzmanlaşmasını sağlamak amacıyla yönlendirici dikeyselleştirme kaybı (router orthogonalization loss, yaklaşık katsayısı) kullanılarak gerçekleştirilir. Video verilerinde zamansal, yükseklik ve enlem boyutları için konumsal kodlamaya 3D RoPE (Rotary Position Embeddings) kullanılmaktadır. FlashMask mekanizması, maskeleriyle uzun bağlamla (131 bine kadar token) verimli çalışmak için uygulanır.[3]
ERNIE 4.5 ön eğitimi birkaç aşamada gerçekleştirilir: önce yalnızca metin verileri, ardından görsel veriler ve son aşamada çok modlu veriler üzerinde ortak eğitim (text-only → vision-only → joint). Görüntü işleme için farklı modalite temsillerini hizalamak amacıyla pixel shuffle mekanizmasına sahip uyarlanabilir ViT enkoderi (Vision Transformer) kullanılır. Uzun videoların işlenmesi desteklenir (32 bine kadar token) ve uyarlanabilir kare örnekleme (adaptive frame sampling) uygulanır.[3]
Yerel Omni-Modalite (ERNIE 5.0)
ERNIE 5.0, her adımda toplam uzman sayısının %3'ünden azının etkinleştirildiği ultra seyrek MoE ile birden fazla modaliteyi (metin, görüntü, ses, video) tek bir mimaride yerel öz-bağlanımlı modelleme olarak gerçekleştirir. Ön eğitim görevi olarak, eğitim verimliliğini artıran Next-Group-of-Tokens Prediction — tek token yerine token grubu tahmini kullanılmaktadır. Ses modalitesi için hiyerarşik codec (hierarchical codec) uygulanır. Esnek eğitim (elastic training) teknolojisi, tek bir eğitim geçişinde farklı derinlik, genişlik ve seyreklik derecesiyle alt modellerin üretilmesine olanak tanır.[4]
Ön Eğitim Görevleri ve Verileri
ERNIE 3.0 / Titan Ön Eğitim Görevleri
ERNIE 3.0 ve Titan'da şu ön eğitim görevi grupları kullanılmaktadır:[2][6]
Word-aware görevler:
- Knowledge Masked Language Modeling — yerel ve küresel bağlam bağımlılıklarının öğrenilmesi için öbek ve varlık maskeleme.
- Document Language Modeling — Transformer-XL yinelemeli belleği kullanılarak 512 tokene kadar uzunlukta belgelerin öz-bağlanımlı modellemesi.
Structure-aware görevler:
- Sentence Reordering — segmente rastgele bölünmüş ve karıştırılmış bir paragraf için model, ile sınıflı sınıflandırma görevi çözerek orijinal sırayı yeniden oluşturur.
- Sentence Distance — 3 sınıflı sınıflandırma: bitişik cümleler, aynı belgede bitişik olmayan cümleler, farklı belgelerden cümleler.
Knowledge-aware görevler:
- Universal Knowledge-Text Prediction (UKTP) — metin ve bilgi grafiği üçlüsünün ortak modellemesi.
- Credible and Controllable Generations — adversarial loss ve controllable LM loss kombinasyonu.
Ön Eğitim Verileri
ERNIE 3.0/Titan için ERNIE 3.0 Külliyatı kullanılmaktadır; bu, web sayfaları, arama günlükleri, soru-cevap verileri, edebi, hukuki, finansal ve tıbbi metinler, romanlar ve şiir dahil 11 kategoride yaklaşık 4 TB Çince içerikten oluşan bir külliyattır. Külliyatın üstünde 50 milyondan fazla gerçeği içeren bir bilgi grafiği oluşturulmuştur.[2][6]
Titan için ek olarak şunlar oluşturulmuştur:
- Adversarial dataset — 2 milyon orijinal paragraf ve ERNIE 3.0 tarafından orijinalin ilk 1–3 cümlesinin öneki kullanılarak üretilen, 512 tokene kadar uzunlukta karşılık gelen "negatif" paragraflar.
- Controllable dataset — tür, konu (26 konu), anahtar sözcükler, duygusal ton (positive/negative/neutral) ve uzunluk özelliklerini içeren metinler. Tür özellikleri, öğrenilebilir "yumuşak prompt'lar" olarak kodlanır (tür için prompt sayısı 0 ile 64 arasında rastgele seçilir).[6]
Sonraki sürümler (ERNIE 4.5, 5.0), küratörlüğü yapılmış web içeriği, bilimsel yayınlar ve sentetik veriler dahil genişletilmiş çok modlu külliyatlar (metin, görüntü, video, ses) kullanmaktadır.[3][4]
Eğitim ve Dağıtık Optimizasyon
ERNIE 3.0 Titan ön eğitimi, Adam optimize edici (öğrenme hızı , , , L2 düzenlileştirme 0,1, gradyan normu 1,0'a kırpma), maksimum bağlam uzunluğu 512 ve üretici görevler için 128 yinelemeli bellek uzunluğuyla gerçekleştirildi. Aşamalı eğitim planı (ilk 4000 adımda hızlandırılmış yakınsama) ve öğrenme hızının doğrusal azalması uygulandı.[6]
4D Hibrit Paralelleştirme
Heterojen kümelerde (GPU NVIDIA V100 ve NPU Ascend 910) 260 milyar parametreli yoğun modelin eğitimi için PaddlePaddle'da 4D hibrit paralelleştirme uygulandı:[6]
- Veri paralelliği (Data parallelism, DP) — modelin birden fazla cihazda çoğaltılması ve partilerin ayrı ayrı işlenmesi.
- Tensör model paralelliği (Tensor model parallelism, MP) — transformer parametrelerinin ve etkinleşmelerinin katmanlar içinde cihazlara bölünmesi.
- Boru hattı model paralelliği (Pipeline model parallelism, PP) — model katmanlarının bir boru hattına dağıtılması.
- Group Sharded — optimize edici durum çoğaltmasını azaltmak için geliştirilmiş ZeRO benzeri sharded-data-parallel varyantı.
Raporda Ascend 910 kartlarına ~%91,7 iş hacmi verimliliğiyle binlere kadar zayıf ölçekleme verileri sunulmaktadır.[6]
ERNIE 4.5 Eğitimi
ERNIE 4.5 eğitimi, %47 Model FLOPs Kullanımı (MFU) elde edilerek 2016 NVIDIA H800 GPU'dan oluşan bir kümede gerçekleştirildi. FP8 karışık hassasiyet, hata toleranslı kontrol noktaları (Zero Cost Checkpoint, 8 dakikadan kısa sürede kurtarma) ve dizi uzunluğunun ve parti boyutunun kademeli olarak artırıldığı aşamalı eğitim kullanıldı.[3]
Çevrimiçi Damıtma
ERNIE 3.0 Titan dağıtımındaki hesaplama gereksinimlerini azaltmak için, öğretmen modelin ve birkaç öğrenci modelin aynı anda eğitildiği çevrimiçi damıtma kullanılır:[6]
- On-the-Fly Distillation (OFD) — öğretmen logitleri ve temsilleri, aynı eğitim adımlarında öğrencilerin eğitimi için kullanılır.
- Teacher assistants — öğretmen ile nihai öğrenciler arasındaki kapasite farkını azaltan orta büyüklükteki ara modeller.
- Auxiliary Layer Distillation (ALD) — iç temsillerin daha iyi eşleşmesi için öğrenciye eklenen ve ince ayar sırasında kaldırılan ek katman.
Son Eğitim ve Hizalama
Ticari ERNIE sürümleri (ERNIE Bot'tan başlayarak) son eğitim aşamalarından geçer:[7][3]
- Supervised Fine-Tuning (SFT) — etiketlenmiş talimat verisi üzerinde ince ayar (ERNIE 4.5'te 2,3 milyon örnek).
- Reinforcement Learning from Human Feedback (RLHF) — insan geri bildirimi kullanarak model davranışını hizalama; PPO (Proximal Policy Optimization) ve DPO (Direct Preference Optimization) algoritmaları kullanılır.
- Unified Preference Optimization (UPO) — ERNIE 4.5'te sunulan birleşik tercih optimizasyonu yöntemi.
- Reinforcement Learning with Verifiers (RLVR) — yanıtların doğruluğunu kontrol etmek için doğrulayıcı kullanan pekiştirmeli öğrenme; GRPO (Group Relative Policy Optimization) yöntemi uygulanır.
- Akıl yürütme modları (thinking modes) — 4.5 modelleri, yansıma (reflection, planning) içeren ve içermeyen modları destekler.
Temel Sonuçlar ve Kıyaslamalar
Model Evrimi Özet Tablosu
| Sürüm | Yıl | Parametre Sayısı | Mimari | Temel Kıyaslamalar | Kaynak |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 milyon (base) | Transformer enkoder (BERT benzeri) | XNLI %78,4; MSRA-NER F1 93,8 % | [1] |
| ERNIE 2.0 | 2019 | ~110–340 milyon | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 görevde SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 milyar | Unified Transformer-XL (AE+AR) | SuperGLUE %90,6 (> insan %89,8); 54 Çince görevde SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 milyar (yoğun) | Dense + controllable generation | 68 veri kümesinde SOTA; sıfır/az atışlı | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 milyar (MoE, 47 milyar etkin) | Heterojen çok modlu MoE | C-Eval %90,6; MMLU %86,5; MMMU %67,3–70 | [3] |
| ERNIE 5.0 | 2026 | ~2,4 trilyon (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (küresel ilk 10) | [4] |
ERNIE 3.0 ve Titan Sonuçları
ERNIE 3.0 (10 milyar parametre), İngilizce SuperGLUE kıyaslamasında insan referansının (89,8) ve yayımlandığı dönemdeki GPT-3, T5 ve DeBERTa modellerinin üzerinde 90,6 ortalama puan elde etti. ERNIE 3.0 Titan (260 milyar), sınıflandırma, NLI, soru-cevap ve üretim görevlerini kapsayan 68 veri kümesinde değerlendirildi; yazarlar tüm 68 veri kümesinde önceki modelleri geride bıraktığını bildirdi. Bu sonuçlar birincil kaynaklara aittir; bağımsız çoğaltma sınırlı biçimde tanımlanmıştır.[2][6]
ERNIE 4.5 Sonuçları
2025 teknik raporuna göre ERNIE 4.5 (300B-A47B, son eğitim sonrası), metin ve çok modlu kıyaslamalarda şu sonuçları elde etmiştir:[3]
| Kıyaslama | ERNIE-4.5-300B-A47B | Koşullar |
|---|---|---|
| C-Eval | %90,6 | 5-shot |
| CMMLU | %90,2 | — |
| MMLU | %86,5 | standart |
| IFEval | %88,0 | instruction following |
| GSM8K | %91,8 | — |
| MMMU | %67,3–70,0 | non-thinking / thinking |
| MathVista | %78,8 | thinking mode |
| OCRBench | 883 | — |
Rapora göre ERNIE 4.5, 28 kıyaslamadan 22'sinde DeepSeek-V3'ü geride bıraktı; çok modlu varyantlar (ERNIE-4.5-VL-424B-A47B) görsel akıl yürütme görevlerinde rekabetçi sonuçlar sergiledi. Bazı görsel akıl yürütme ve teknik görüntü yorumlama görevlerinde (şema analizi, mühendislik diyagramları), belirli GPT ve Gemini modellerinin üzerinde sonuçlar bildirildi.[3][14]
ERNIE 4.5'in Rakipler ile Karşılaştırması (seçili kıyaslamalar, son eğitim sonrası, 2025 teknik raporuna göre):
| Kıyaslama | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Not |
|---|---|---|---|---|
| C-Eval | %90,6 | — | — | 5-shot |
| MMLU | %86,5 | karşılaştırılabilir | — | standart |
| IFEval | %88,0 | — | %83,2 | instruction following |
| MMMU | %67,3–70,0 | — | — | thinking / non-thinking |
| MathVista | %78,8 | — | %77,6 (Qwen2.5-VL) | thinking mode |
Çoğaltma koşulları: standart protokoller (5-shot / zero-shot); açık veri kümeleri (C-Eval 2023+, MMLU, MMMU). Tire ("—"), rapora aynı koşullarda karşılaştırılabilir verilerin yer almadığı anlamına gelir.[3]
ERNIE Bot 4.0 Değerlendirmeleri
Tsinghua Üniversitesi SuperBench raporu, ticari LLM'leri bir dizi görev üzerinden sıralar (dil anlama, matematik, programlama, çok görevlilik). ERNIE Bot 4.0, bütünleşik metrikte GLM-4'ün (Zhipu AI) yaklaşık 0,41 puan önünde Çince modeller arasında birinci sıraya yerleşti; GPT-4 ve Anthropic Claude-3 modelleri küresel sıralamada daha yüksekte kaldı. ERNIE Bot 4.0, Çince metin anlama ve talimatlara uyma konularında güçlü sonuçlar gösterirken programlama ve bazı İngilizce görevlerde daha zayıf performans sergiledi.[9][10]
Uygulamalar
Baidu Ürünleri ve Hizmetleri
ERNIE serisi modelleri, Baidu ürünleri ekosistemiyle entegre edilmiştir:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — çok modlu üretim desteğiyle (metin, görüntü, video, ses) sohbet botu. Baidu'nun verilerine göre aylık aktif kullanıcı sayısı 200 milyonu aşmaktadır (2024–2025). ERNIE Bot 2025 yılından itibaren ücretsiz kullanılabilmektedir.[7]
- Baidu Arama — arama sonuçlarında yanıt üretme ve yapay zeka işlevleri; Baidu'nun verilerine göre üst sonuçların %70'e kadarı yapay zeka bileşenleriyle zenginleştirilmektedir.
- Qianfan (MaaS Platformu) — kurumsal müşteriler için API; Baidu'nun verilerine göre 760 binden fazla işletme platformu kullanmakta ve günlük API çağrısı sayısı 1,5 milyarı aşmaktadır (2024). Müşteriler arasında Lenovo, Trip.com ve diğerleri yer almaktadır.[7]
- Comate — programlama için yapay zeka asistanı.
- Wenxin Yige — ERNIE-ViLG modelleri tabanlı görüntü üretimi.[11]
- Harici iş ortaklarıyla entegrasyonlar: Samsung Galaxy (Çin pazarı için), dijital avatarlar, eklentiler (arama, dosya analizi).[7]
Sektörel Uygulamalar
Modeller aşağıdaki alanlarda kullanılmaktadır:[7][3]
- Bilgi artırımlı ön eğitim kullanan alan özgü soru-cevap sistemleri (hukuk, tıp, finans).
- Çince metin üretimi ve düzenleme (haberler, pazarlama metinleri, yaratıcı içerik).
- Çok modlu görevler: görüntü analizi, mühendislik şemaları, video ve tablo verisi analizi (4.5 ve sonraki sürümlerde).
- Eğitim (kişiselleştirilmiş öğrenme), robotik (görev planlama), otonom sürüş (Apollo).
Açık Kaynak
ERNIE 4.5'ten itibaren ailenin tüm 10 varyantı, Apache 2.0 lisansıyla ERNIEKit araç setiyle (PaddlePaddle/FastDeploy üzerinde SFT, LoRA, DPO, çıkarım desteği) yayımlandı. Önceki sürümlerin kodu (ERNIE 1.0–3.0) GitHub PaddlePaddle/ERNIE'de mevcuttur.[3][15]
Kısıtlamalar ve Açık Sorunlar
Mimari ve Veri Kümesi Kısıtlamaları
ERNIE 3.0 Titan, 260 milyar parametreye sahip olmasına karşın tek modül için bağlam uzunluğu 512 token ile sınırlıdır; bu durum ek mekanizmalar (bölümleme, harici bellek) olmaksızın uzun metin modellemesini kısıtlamaktadır. Eğitim ağırlıklı olarak Çince külliyat üzerinde gerçekleştirildiğinden Çince ve diğer diller arasındaki kalite değişkenlik göstermektedir.[6]
Bilgi grafiği entegrasyonu, yapılandırılmış olgularla çalışmayı iyileştirirken bilgilerin doğruluğu ve eksiksizliği, grafiğin kendi kalitesiyle ve "üçlü–metin" eşleştirme prosedürüyle (entity linking, relation alignment) sınırlı kalmakta; bu durum bazı durumlarda hatalı veya eksik ilişkilendirmelere yol açmaktadır.[6]
Halüsinasyonlar ve Güvenilirlik
Adversarial loss ve controllable LM loss, güvenilir olmayan üretimlere karşı dayanıklılığı iyileştirse de halüsinasyon sorununu (olgusal olarak yanlış ifadelerin üretimi) tamamen ortadan kaldırmaz. Adversarial sınıflandırıcının parametreleri, "üretilmiş" metnin önceki ERNIE sürümü tarafından oluşturulduğu veriler üzerinde eğitilir; bu durum tanınabilecek hatalı kalıpların kapsamını sınırlandırır.[6]
Toplumsal Önyargılar
PeerJ Computer Science (2025) dergisinde yayımlanan bir araştırma, 240 toplumsal grup ve 30 binden fazla üretilmiş açıklama kullanarak Çince LLM'lerdeki (ERNIE ve Qwen) toplumsal önyargıları inceledi. Sonuçlar, ERNIE'nin Baidu Arama veya Qwen'e kıyasla daha az olumsuz ve kalıplaşmış içerik ürettiğini göstermektedir (ERNIE'de olumsuz çağrışımlı yaklaşık 1/10 aday sözcüğe karşın Qwen'de 1/3). Bununla birlikte, potansiyel olarak rahatsız edici açıklamalar da dahil olmak üzere belirli düzeyde kalıp yargı varlığı sürmektedir.[16][17]
Yeniden Üretilebilirlik
Serinin bazı modelleri (ERNIE 3.0 Titan, ticari ERNIE Bot 4.0 ve 5.0), tam açık kod ve ağırlıklar biçiminde sunulmamaktadır; bu durum kıyaslama sonuçlarının yeniden üretilebilirliğini ve bağımsız değerlendirme olanaklarını kısıtlamaktadır. ERNIE 4.5'in Apache 2.0 ile yayımlanmasıyla durum iyileşmiş olmakla birlikte mimari ve eğitim ayarları, erken yayınlarda açıklananlardan farklılık gösterebilir.[3][6]
Tıbbi Güvenlik
ERNIE Bot'un tıbbi senaryolardaki kullanımına ilişkin araştırmalar (Si ve ark., 2025), model senaryolarında %91,9 gereksiz test ve %57,8 gereksiz ilaç yazılması eğilimini ve önerilerde yaşa ve sosyoekonomik duruma bağlı orantısızlıkları ortaya koymuştur.[18]
Etik ve Düzenleyici Boyutlar
ERNIE serisi modelleri, 2023 yılında yayımlanan ve zorunlu güvenlik değerlendirmesi, algoritma kaydı ve içerik kısıtlamalarını öngören "Üretici Yapay Zeka Hizmetlerinin Yönetimine İlişkin Geçici Önlemler" (Interim Measures for Generative AI Services, 2023) başta olmak üzere Çin'in üretici yapay zeka düzenlemeleri çerçevesinde faaliyet göstermektedir.[7][17]
ERNIE Bot, ulusal mevzuata uygun olarak hassas siyasi konularla ilgili taleplerde yüksek düzeyde ret yanıtı vermektedir. Araştırmalar (Pan ve ark., 2026), Baidu modelleri de dahil olmak üzere Çin kaynaklı LLM'lerdeki siyasi sansürü incelemektedir.[19]
Baidu'nun yayınları, model davranışı denetim prosedürlerini, içerik filtreleme ölçütlerini ve yerel mevzuat gereksinimleri ile genel yapay zeka etiği ilkeleri arasındaki dengeyi her zaman ayrıntılı biçimde ele almamaktadır; bu alan bağımsız araştırmalar için açık olmaya devam etmektedir.[17]
Araştırma Perspektifleri ve Yönelimleri
Teknik raporlara ve Baidu'nun açıklamalarına dayanarak ERNIE serisinin gelişim yöntemleri şu şekilde özetlenebilir:
- Yoğun teknik görsel verilerin (mühendislik şemaları, tıbbi görüntüler) işlenmesi dahil ileri çok modalitelilik (metin–görüntü–video–ses).[3][4]
- Çok büyük toplam model boyutlarında kalite ile hesaplama verimliliği arasındaki dengeyi sağlamak amacıyla yoğun ve MoE mimarilerinin birleştirilmesi.[3]
- Üretim iş akışlarına entegrasyon için ajan sistemlerinin (GenFlow, Famou) ve yapılandırılmış üretim araçlarının (JSON, API çağrıları) geliştirilmesi.[3]
- Eğitim verimliliğinin artırılması: esnek eğitim (elastic training), iyileştirilmiş MoE ölçekleme (MFU), nicemleme (W4A8, tek GPU dağıtımı için 2-bit).[3]
- Kültüre özgü boyutlar gözetilerek Çince LLM'lerdeki önyargıları azaltmaya yönelik araştırmalar ve Çince ile çok modlu görevler için kıyaslama metodolojilerinin geliştirilmesi.[16][17]
- Uzun bağlamda akıl yürütmenin iyileştirilmesi, doğrulanabilir pekiştirmeli öğrenme (verifiable RL) ve sentetik külliyatlar aracılığıyla sınırlı verili alanlara uyarlama.[3][4]
Diğer Çince LLM'lerle Karşılaştırma
ERNIE, Qwen (Alibaba), GLM / ChatGLM (Zhipu AI), DeepSeek (DeepSeek AI) ve Tongyi Qianwen dahil çeşitli büyük Çince LLM'lerle rekabet etmektedir. ERNIE serisinin temel farklılıkları — ön eğitime bilgi grafiklerinin entegrasyonuna (knowledge enhancement) verilen önem, Baidu ekosistemiyle (arama, bulut, API) sıkı entegrasyon ve PaddlePaddle platformuna odaklanma — olarak öne çıkmaktadır. Bağımsız sıralamalar (SuperBench, LMArena) açısından ERNIE serisi modelleri, özellikle Çincede anlama ve talimatlara uyma görevlerinde Çince LLM'ler arasında üst sıralarda yer almaktadır.[9][13][16]
Ayrıca bakınız
- BERT
- Transformer Mimarisi
- RLHF
Kaynakça
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.