ERNIE (Baidu) (EL)
ERNIE (Baidu) — σειρά προεκπαιδευμένων γλωσσικών μοντέλων (Large Language Model, LLM) και πολυτροπικών θεμελιωδών μοντέλων, που αναπτύσσονται από την εταιρεία Baidu από το 2019 υπό την κοινή ονομασία Enhanced Representation through kNowledge IntEgration (ενισχυμένη αναπαράσταση μέσω ενσωμάτωσης γνώσης). Η σειρά στοχεύει στη βελτίωση της ποιότητας σημασιολογικής κατανόησης και παραγωγής μέσω της ρητής ενσωμάτωσης εξωτερικών γνώσεων από γράφους γνώσης (Knowledge Graph, KG), οντολογίες και εγκυκλοπαίδειες στη διαδικασία προεκπαίδευσης.[1][2]
Τα μοντέλα της σειράς εξελίχθηκαν από τις πρώιμες παραλλαγές βασισμένες στο BERT με κάλυψη οντοτήτων και φράσεων (ERNIE 1.0, 2.0) μέσω μεγάλης κλίμακας ενοποιημένων αρχιτεκτονικών (ERNIE 3.0, ERNIE 3.0 Titan) σε πολυτροπικά συστήματα βασισμένα στο Mixture-of-Experts (MoE) με ανοιχτό κώδικα (ERNIE 4.5) και σε νατιβιστικά ολοτροπικά μοντέλα (ERNIE 5.0). Η σειρά υποστηρίζει εργασίες κατανόησης κειμένου (Natural Language Understanding, NLU), παραγωγής κειμένου (Natural Language Generation, NLG) και, στις πρόσφατες εκδόσεις, πολυτροπικές εργασίες (κείμενο, εικόνα, βίντεο, ήχος), με έμφαση στην κινεζική γλώσσα και υποστήριξη πολυγλωσσίας.[2][3][4]
Ιστορία και προϋποθέσεις
Η ανάπτυξη της σειράς ERNIE ξεκίνησε το 2019 στον ερευνητικό κλάδο της Baidu ως απόκριση στην επιτυχία του μοντέλου BERT (Devlin et al., 2018) και στην ανάγκη προσαρμογής προεκπαιδευμένων μοντέλων για την κινεζική γλώσσα, στην οποία η απουσία σαφών κενών μεταξύ λέξεων και το υψηλό ποσοστό πολύσημων ιερογλυφικών χαρακτήρων δυσχεραίνουν τη σύλληψη σημασιολογικών μονάδων (οντοτήτων, φράσεων).[1]
ERNIE 1.0 (2019)
Το πρώτο μοντέλο της σειράς (Sun et al., arXiv:1904.09223, Απρίλιος 2019) εισήγαγε στρατηγική πολυεπίπεδης κάλυψης γνώσης (knowledge masking) για αρχιτεκτονική τύπου BERT: αντί για τυχαία κάλυψη μεμονωμένων token, το μοντέλο καλύπτει ολόκληρες οντότητες και φράσεις, που προσδιορίζονται βάσει αναγνώρισης ονοματικών οντοτήτων (Named Entity Recognition, NER) και φραστικών προτύπων.[1]
Η αρχιτεκτονική του ERNIE 1.0 βασίζεται στον κωδικοποιητή Transformer (12 στρώματα, κρυφή διάσταση 768, 12 κεφαλές attention). Επιπλέον εισήχθη η εργασία Dialogue Language Model (DLM) για εκπαίδευση σε διαλογικά δεδομένα. Το μοντέλο εκπαιδεύτηκε σε ~173 εκατομμύρια κινεζικές προτάσεις από σώματα κειμένων Wikipedia, Baidu Baike, ειδήσεων και του φόρουμ Baidu Tieba. Κατά τη δημοσίευση, το ERNIE 1.0 επέτυχε αποτελέσματα state-of-the-art (SOTA) σε πέντε κινεζικές εργασίες NLP: XNLI (ακρίβεια 78,4% στη δοκιμή έναντι 77,2% του BERT), MSRA-NER (F1 93,8% έναντι 92,6%).[1]
ERNIE 2.0 (2019)
Το ERNIE 2.0 (Sun et al., arXiv:1907.12412, Ιούλιος 2019· παρουσιάστηκε στο συνέδριο AAAI 2020) εισήγαγε ένα πλαίσιο συνεχούς πολυεργασιακής προεκπαίδευσης (continual multi-task pre-training), στο οποίο νέες εργασίες προεκπαίδευσης προστίθενται διαδοχικά (με αυξητικό τρόπο) στον κοινό μετασχηματιστή χωρίς πλήρη επανεκπαίδευση του μοντέλου.[5]
Οι εργασίες προεκπαίδευσης του ERNIE 2.0 χωρίζονται σε τρεις ομάδες:
- Word-aware — κάλυψη γνώσης (knowledge masking), πρόβλεψη κεφαλαίων γραμμάτων (capitalization prediction), σχέση token με έγγραφο (token-document relation).
- Structure-aware — αναδιάταξη προτάσεων (sentence reordering), προσδιορισμός απόστασης μεταξύ προτάσεων (sentence distance).
- Semantic-aware — πρόβλεψη λεκτικών σχέσεων (discourse relation prediction), συνάφεια για ανάκτηση πληροφοριών (IR relevance prediction).[5]
Το μοντέλο εκπαιδεύτηκε σε αγγλικά και κινεζικά σώματα κειμένων (εγκυκλοπαίδειες, βιβλία, Reddit, αρχεία καταγραφής αναζήτησης). Αποτελέσματα: ο μέσος βαθμός GLUE για το μοντέλο base ήταν 80,6 (έναντι 78,3 του BERT), για το μοντέλο large — 83,6· το ERNIE 2.0 ξεπέρασε το BERT και το XLNet σε 16 εργασίες.[5]
ERNIE 3.0 (2021)
Το πλαίσιο ERNIE 3.0 (Sun et al., arXiv:2107.02137, Ιούλιος 2021) συνδύασε το παράδειγμα αυτοκωδικοποίησης (auto-encoding, AE) και το αυτοπαλίνδρομο (auto-regressive, AR) παράδειγμα προεκπαίδευσης σε μια ενιαία αρχιτεκτονική, χωρισμένη σε ένα καθολικό άρθρωμα αναπαραστάσεων (Universal Representation Module) και σε εργασιοειδικά αρθρώματα (Task-specific Representation Modules) για NLU και NLG.[2]
Το μοντέλο με 10 δισεκατομμύρια παραμέτρους εκπαιδεύτηκε σε 4 TB κινεζικού κειμένου (11 κατηγορίες: Baidu Baike, Wikipedia, αρχεία καταγραφής αναζήτησης, συστήματα ερωτήσεων-απαντήσεων, τομεακά κείμενα) και σε γράφο γνώσης με περισσότερα από 50 εκατομμύρια γεγονότα. Το ERNIE 3.0 επέτυχε SOTA σε 54 κινεζικές εργασίες NLP· στο αγγλόφωνο benchmark SuperGLUE — 90,6% (στις 3 Ιουλίου 2021, πάνω από το ανθρώπινο όριο 89,8%).[2]
ERNIE 3.0 Titan (2021)
Στο άρθρο «ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation» (Wang et al., arXiv:2112.12731, Δεκέμβριος 2021) περιγράφεται η κλιμάκωση του πλαισίου ERNIE 3.0 σε ένα πυκνό (dense) μοντέλο με 260 δισεκατομμύρια παραμέτρους, υλοποιημένο στην πλατφόρμα PaddlePaddle.[6]
Το Titan εισήγαγε πρόσθετους μηχανισμούς: αυτοεπιβλεπόμενη adversarial loss για αξιολόγηση της αξιοπιστίας του παραγόμενου κειμένου, controllable language modeling loss για τον έλεγχο του ύφους, του θέματος, του τόνου και του μήκους της παραγωγής, καθώς και διαδικτυακή απόσταξη (On-the-Fly Distillation, OFD) για την απόκτηση συμπαγών μοντέλων-μαθητών κατά τη διάρκεια της προεκπαίδευσης. Το μοντέλο αξιολογήθηκε σε 68 σύνολα δεδομένων και, σύμφωνα με τους συγγραφείς, ξεπέρασε τα προηγούμενα μοντέλα σε όλα τα 68 dataset.[6]
ERNIE Bot και εμπορικές εκδόσεις (2023–2025)
Τον Μάρτιο του 2023 η Baidu κυκλοφόρησε το chatbot ERNIE Bot (Wenxin Yiyan, 文心一言) βασισμένο στα μοντέλα ERNIE 3.x και PLATO (διαλογικό μοντέλο). Η δημόσια πρόσβαση ανοίχτηκε τον Αύγουστο του 2023 μετά από έγκριση των ρυθμιστικών αρχών. Οι ενημερώσεις περιελάμβαναν το ERNIE 3.5 (Ιούνιος 2023) και το ERNIE 4.0 (Οκτώβριος 2023).[7][8]
Σύμφωνα με την έκθεση SuperBench του Πανεπιστημίου Tsinghua, το ERNIE Bot 4.0 κατέλαβε την πρώτη θέση μεταξύ των κινεζικών LLM βάσει συνολικής μετρικής, παρουσιάζοντας ισχυρά αποτελέσματα στην κατανόηση κινεζικής γλώσσας και στην εκτέλεση οδηγιών.[9][10]
Το 2022, παράλληλα με την κύρια γλωσσική σειρά, παρουσιάστηκε η πολυτροπική επέκταση ERNIE-ViLG 2.0 (arXiv:2210.15257) — ένα μοντέλο παραγωγής εικόνων από κείμενο (text-to-image), που αποτέλεσε ένα από τα πρώτα βήματα προς την πολυτροπικότητα.[11]
Το 2024, στο συνέδριο WAVE SUMMIT, η Baidu παρουσίασε το ERNIE 4.0 Turbo — μια βελτιστοποιημένη έκδοση για εφαρμογές υψηλής ταχύτητας, ικανή να παράγει κείμενο μήκους άνω των χιλίων λέξεων σε περίπου 20 δευτερόλεπτα διατηρώντας την ποιότητα.[12]
ERNIE 4.5 (2025)
Τον Ιούνιο του 2025 η Baidu δημοσίευσε την τεχνική έκθεση ERNIE 4.5, που παρουσιάζει μια οικογένεια 10 μοντέλων: κειμενικά LLM και πολυτροπικά μοντέλα (Vision-Language, VL). Η αρχιτεκτονική βασίζεται στο ετερογενές Mixture-of-Experts (MoE) με διαχωρισμό εμπειρογνωμόνων ανά τροπικότητα. Οι παραλλαγές περιλαμβάνουν μοντέλα MoE με έως 424 δισεκατομμύρια συνολικές και 47 δισεκατομμύρια ενεργές παραμέτρους, καθώς και ένα πυκνό μοντέλο με 0,3 δισεκατομμύρια παραμέτρους. Η οικογένεια κυκλοφόρησε υπό την άδεια Apache 2.0 στο Hugging Face και στο GitHub (PaddlePaddle/ERNIE).[3]
ERNIE 5.0 (2026)
Τον Φεβρουάριο του 2026 δημοσιεύτηκε η τεχνική έκθεση ERNIE 5.0 (arXiv:2602.04705) — ένα νατιβιστικό ολοτροπικό αυτοπαλίνδρομο μοντέλο με υπέρ-αραιό MoE (ultra-sparse MoE), που υποστηρίζει κοινή μοντελοποίηση κειμένου, εικόνων, ήχου και βίντεο. Το μοντέλο κατείχε υψηλές θέσεις στον πίνακα κατάταξης LMArena.[4][13]
Θεωρητικά θεμέλια και αρχιτεκτονικές αρχές
Κάλυψη Γνώσης (Knowledge Masking)
Η βασική αρχή των πρώιμων μοντέλων της σειράς είναι η ενσωμάτωση δομημένης γνώσης στη διαδικασία προεκπαίδευσης μέσω τροποποιημένων στρατηγικών κάλυψης. Σε αντίθεση με το τυπικό Masked Language Modeling (MLM), όπου καλύπτονται μεμονωμένα token, το ERNIE 1.0 καλύπτει ολόκληρες σημασιολογικές μονάδες: οντότητες (που ορίζονται μέσω NER) και φράσεις. Για μια οντότητα καλύπτεται ολόκληρη η ακολουθία token με δεδομένη πιθανότητα . Αυτή η προσέγγιση αναγκάζει το μοντέλο να στηρίζεται σε ευρύτερο πλαίσιο και να μαθαίνει τις συνδέσεις μεταξύ οντοτήτων.[1]
Το ERNIE 2.0 ανέπτυξε αυτή την προσέγγιση, προσθέτοντας αυξητική πολυεργασιακή εκπαίδευση: εργασίες λεξικού, δομικού και σημασιολογικού επιπέδου προστίθενται διαδοχικά, ενώ οι ήδη αποκτηθείσες γνώσεις διατηρούνται χάρη στον μηχανισμό συνεχούς προεκπαίδευσης (continual pre-training).[5]
Ενοποιημένο πλαίσιο ERNIE 3.0
Το πλαίσιο ERNIE 3.0 βασίζεται στη διαίρεση της αρχιτεκτονικής σε δύο επίπεδα:[2][6]
- Universal Representation Module — ένας κοινός πολυστρωματικός Transformer-XL, εκπαιδευμένος σε ποικιλία εργασιών προεκπαίδευσης και εξάγων κοινά λεξικά και συντακτικά χαρακτηριστικά. Στην έκδοση Titan αυτό το άρθρωμα περιέχει 48 στρώματα, κρυφή αναπαράσταση μεγέθους 12288, 192 κεφαλές attention και εσωτερικό μέγεθος δικτύου feed-forward 196608 ().
- Task-specific Representation Modules — ξεχωριστά αρθρώματα για NLU (αμφίδρομη attention) και NLG (μονοκατευθυντήρια attention με αναδρομική μνήμη Transformer-XL), καθένα με 12 στρώματα, μέγεθος κρυφού διανύσματος 768 και 12 κεφαλές attention.
Η ενσωμάτωση των παραδειγμάτων αυτοκωδικοποίησης και αυτοπαλίνδρομης παραγωγής επιτρέπει σε ένα μοντέλο να επιτυγχάνει υψηλές επιδόσεις τόσο σε benchmarks NLU (εργασίες τύπου BERT) όσο και σε benchmarks NLG (εργασίες τύπου GPT).[2]
Universal Knowledge-Text Prediction (UKTP)
Η εργασία UKTP αποτελεί τον κεντρικό μηχανισμό ενσωμάτωσης γνώσης στο ERNIE 3.0/Titan. Το μοντέλο λαμβάνει ένα ζεύγος (τριάδα από γράφο γνώσης, πρόταση από εγκυκλοπαίδεια) και πρέπει είτε να προβλέψει τη σχέση στην τριάδα χρησιμοποιώντας το κείμενο, είτε να προβλέψει τα καλυμμένα token στο κείμενο χρησιμοποιώντας πληροφορίες από την τριάδα.[6]
Για την πρόβλεψη της σχέσης στην τριάδα , συνδεδεμένη με το κείμενο , η εργασία διατυπώνεται ως πολυκλασική ταξινόμηση:
όπου — η έξοδος του μετασχηματιστή στις θέσεις των αναφορών της κεφαλικής και της ουραίας οντότητας, — οι παράμετροι του ταξινομητή, — οι παράμετροι του μοντέλου.[6]
Μηχανισμοί αξιόπιστης και ελεγχόμενης παραγωγής (Titan)
Το ERNIE 3.0 Titan εισήγαγε δύο επιπλέον τύπους συναρτήσεων απωλειών.[6]
Αυτοεπιβλεπόμενη adversarial loss. Δημιουργείται ένα dataset , όπου — πραγματικές παράγραφοι και — κείμενα παραγόμενα από προηγούμενη έκδοση του ERNIE βάσει του προθέματος των αρχικών παραγράφων. Η εργασία είναι δυαδική ταξινόμηση (αυθεντικό / παραγόμενο) βάσει της κρυφής κατάστασης του ειδικού token [CLS]:
όπου — η διανυσματική αναπαράσταση του [CLS] για το -ο παράδειγμα, — δείκτης ανήκει στα αυθεντικά κείμενα.[6]
Controllable language modeling loss. Κάθε παράδειγμα εκπαίδευσης συνοδεύεται από ένα σύνολο χαρακτηριστικών (prompt), που περιγράφουν το είδος, το θέμα, τις λέξεις-κλειδιά, τον τόνο και το μήκος. Η απώλεια συνδυάζει άνευ όρων και υπό συνθήκη γλωσσική μοντελοποίηση:
όπου — τυχαία μεταβλητή για εναλλαγή λειτουργιών, — το -ο token του -ου παραδείγματος. Αυτός ο ορισμός αποτρέπει την υπερβολική εξάρτηση του μοντέλου από τα prompt.[6]
Ετερογενής αρχιτεκτονική MoE (ERNIE 4.5)
Το ERNIE 4.5 εισάγει μια ετερογενή πολυτροπική αρχιτεκτονική Mixture-of-Experts με διαχωρισμό εμπειρογνωμόνων ανά τροπικότητα: κειμενικοί εμπειρογνώμονες και οπτικοί εμπειρογνώμονες (οι τελευταίοι έχουν περίπου 1/3 του μεγέθους των κειμενικών). Η δρομολόγηση token πραγματοποιείται με απομόνωση ανά τροπικότητα (modality-isolated routing) και εφαρμογή ποινής ορθογωνιοποίησης για τον δρομολογητή (router orthogonalization loss, συντελεστής τάξης ) για τη διασφάλιση εξειδίκευσης των εμπειρογνωμόνων. Χρησιμοποιείται 3D RoPE (Rotary Position Embeddings) για τη θεσιακή κωδικοποίηση των χρονικών, ύψους και πλάτους διαστάσεων σε βιντεοδεδομένα. Ο μηχανισμός FlashMask χρησιμοποιείται για αποτελεσματική επεξεργασία μεγάλου πλαισίου (έως 131 χιλιάδες token) με μάσκες .[3]
Η προεκπαίδευση του ERNIE 4.5 πραγματοποιείται σε διάφορα στάδια: αρχικά εκπαίδευση μόνο σε κειμενικά δεδομένα, στη συνέχεια σε οπτικά δεδομένα, και στην τελική φάση — κοινή εκπαίδευση σε πολυτροπικά δεδομένα (text-only → vision-only → joint). Για την επεξεργασία εικόνων χρησιμοποιείται ένας προσαρμοστικός κωδικοποιητής ViT (Vision Transformer) με μηχανισμό pixel shuffle για την ευθυγράμμιση αναπαραστάσεων διαφορετικών τροπικοτήτων. Υποστηρίζεται η επεξεργασία μακρών βίντεο (έως 32 χιλιάδες token) με προσαρμοστική δειγματοληψία καρέ (adaptive frame sampling).[3]
Νατιβιστική ολοτροπικότητα (ERNIE 5.0)
Το ERNIE 5.0 υλοποιεί νατιβιστική αυτοπαλίνδρομη μοντελοποίηση πολλαπλών τροπικοτήτων (κείμενο, εικόνα, ήχος, βίντεο) σε μια ενιαία αρχιτεκτονική με υπέρ-αραιό MoE, στο οποίο σε κάθε βήμα ενεργοποιείται λιγότερο από το 3% του συνολικού αριθμού εμπειρογνωμόνων. Ως εργασία προεκπαίδευσης χρησιμοποιείται η Next-Group-of-Tokens Prediction — πρόβλεψη μιας ομάδας token αντί για ένα μόνο, γεγονός που αυξάνει την αποδοτικότητα της εκπαίδευσης. Για την ακουστική τροπικότητα εφαρμόζεται ιεραρχικός κωδικοποιητής (hierarchical codec). Η τεχνολογία elastic training επιτρέπει τη δημιουργία υπο-μοντέλων με διάφορα βάθη, πλάτη και βαθμούς αραιότητας στο πλαίσιο ενός μόνο κύκλου εκπαίδευσης.[4]
Εργασίες προεκπαίδευσης και δεδομένα
Εργασίες προεκπαίδευσης ERNIE 3.0 / Titan
Στο ERNIE 3.0 και Titan χρησιμοποιούνται οι ακόλουθες ομάδες εργασιών προεκπαίδευσης:[2][6]
Εργασίες Word-aware:
- Knowledge Masked Language Modeling — φραστική και οντοτητική κάλυψη για εκπαίδευση εξαρτήσεων σε τοπικά και παγκόσμια πλαίσια.
- Document Language Modeling — αυτοπαλίνδρομη μοντελοποίηση εγγράφων με μήκος έως 512 token και χρήση αναδρομικής μνήμης Transformer-XL.
Εργασίες Structure-aware:
- Sentence Reordering — για μια παράγραφο τυχαία χωρισμένη σε τμήματα και ανακατεμένη, το μοντέλο επιλύει εργασία -κλασικής ταξινόμησης με , αποκαθιστώντας την αρχική σειρά.
- Sentence Distance — 3-κλασική ταξινόμηση: συνεχόμενες προτάσεις, μη συνεχόμενες στο ίδιο έγγραφο, προτάσεις από διαφορετικά έγγραφα.
Εργασίες Knowledge-aware:
- Universal Knowledge-Text Prediction (UKTP) — κοινή μοντελοποίηση κειμένου και τριάδας γράφου γνώσης.
- Credible and Controllable Generations — συνδυασμός adversarial loss και controllable LM loss.
Δεδομένα προεκπαίδευσης
Για το ERNIE 3.0/Titan χρησιμοποιείται το ERNIE 3.0 Corpus — ένα κινεζικό σώμα κειμένων όγκου περίπου 4 TB σε 11 κατηγορίες, που περιλαμβάνει ιστοσελίδες, αρχεία καταγραφής αναζήτησης, δεδομένα ερωτήσεων-απαντήσεων, λογοτεχνικά, νομικά, οικονομικά και ιατρικά κείμενα, μυθιστορήματα και ποίηση. Πάνω από το σώμα κειμένων διαμορφώθηκε ένας γράφος γνώσης με περισσότερα από 50 εκατομμύρια γεγονότα.[2][6]
Επιπλέον για το Titan σχηματίζονται:
- Adversarial dataset — 2 εκατομμύρια αυθεντικές παράγραφοι και αντίστοιχες «αρνητικές» παράγραφοι παραγόμενες από το ERNIE 3.0 βάσει του προθέματος των 1–3 πρώτων προτάσεων του πρωτοτύπου, μήκους έως 512 token.
- Controllable dataset — κείμενα εφοδιασμένα με χαρακτηριστικά είδους, θέματος (26 θεματικές), λέξεων-κλειδιών, τόνου (θετικός/αρνητικός/ουδέτερος) και μήκους. Τα χαρακτηριστικά είδους κωδικοποιούνται με εκπαιδεύσιμα «μαλακά prompt» (ο αριθμός των prompt για το είδος επιλέγεται τυχαία από 0 έως 64).[6]
Οι μεταγενέστερες εκδόσεις (ERNIE 4.5, 5.0) χρησιμοποιούν εκτεταμένα πολυτροπικά σώματα κειμένων (κείμενο, εικόνες, βίντεο, ήχος), συμπεριλαμβανομένου επιμελημένου διαδικτυακού περιεχομένου, επιστημονικών δημοσιεύσεων και συνθετικών δεδομένων.[3][4]
Εκπαίδευση και κατανεμημένη βελτιστοποίηση
Η προεκπαίδευση του ERNIE 3.0 Titan πραγματοποιήθηκε με τη χρήση του βελτιστοποιητή Adam (ρυθμός εκμάθησης , , , L2-κανονικοποίηση 0,1, περικοπή νόρμας κλίσης στο 1,0), μέγιστο μήκος πλαισίου 512 και μήκος αναδρομικής μνήμης 128 για παραγωγικές εργασίες. Εφαρμόστηκε ένα προοδευτικό σχήμα εκπαίδευσης (επιταχυνόμενη σύγκλιση στα πρώτα 4000 βήματα) και γραμμική φθίνουσα ρυθμός εκμάθησης.[6]
4D-υβριδική παραλληλοποίηση
Για την εκπαίδευση του πυκνού μοντέλου με 260 δισεκατομμύρια παραμέτρους σε ετερογενή συστάδα (GPU NVIDIA V100 και NPU Ascend 910) υλοποιήθηκε στο PaddlePaddle η 4D-υβριδική παραλληλοποίηση:[6]
- Data parallelism (DP) — αντιγραφή μοντέλου σε πολλαπλές συσκευές με ξεχωριστή επεξεργασία δεσμίδων.
- Tensor model parallelism (MP) — διαίρεση παραμέτρων και ενεργοποιήσεων του μετασχηματιστή εντός στρωμάτων ανά συσκευή.
- Pipeline model parallelism (PP) — κατανομή στρωμάτων μοντέλου κατά μήκος αγωγού.
- Group Sharded — βελτιωμένη παραλλαγή κατατμημένης παράλληλης επεξεργασίας δεδομένων τύπου ZeRO για μείωση της αντιγραφής καταστάσεων βελτιστοποιητή.
Στην έκθεση παρατίθενται δεδομένα αδύναμης κλιμάκωσης σε χιλιάδες κάρτες Ascend 910 με απόδοση περίπου 91,7% ως προς ρυθμό διαμεταγωγής.[6]
Εκπαίδευση ERNIE 4.5
Η εκπαίδευση του ERNIE 4.5 πραγματοποιήθηκε σε συστάδα από 2016 GPU NVIDIA H800 με επίτευξη Model FLOPs Utilization (MFU) 47%. Χρησιμοποιήθηκαν μικτή ακρίβεια FP8, ανθεκτικά σημεία ελέγχου (Zero Cost Checkpoint, ανάκτηση σε λιγότερο από 8 λεπτά) και προοδευτική εκπαίδευση με αύξηση μήκους ακολουθίας και μεγέθους δεσμίδας.[3]
Διαδικτυακή απόσταξη
Για τη μείωση των υπολογιστικών απαιτήσεων κατά την ανάπτυξη του ERNIE 3.0 Titan χρησιμοποιείται διαδικτυακή απόσταξη, στην οποία το μοντέλο-δάσκαλος και πολλά μοντέλα-μαθητές εκπαιδεύονται ταυτόχρονα:[6]
- On-the-Fly Distillation (OFD) — τα logit και οι αναπαραστάσεις του δασκάλου χρησιμοποιούνται για την εκπαίδευση μαθητών στα ίδια βήματα εκπαίδευσης.
- Teacher assistants — ενδιάμεσα σε μέγεθος μοντέλα, που μειώνουν το χάσμα ικανότητας μεταξύ δασκάλου και τελικών μαθητών.
- Auxiliary Layer Distillation (ALD) — ένα πρόσθετο στρώμα στον μαθητή, που απορρίπτεται κατά το fine-tuning, για καλύτερη αντιστοίχιση εσωτερικών αναπαραστάσεων.
Μετα-εκπαίδευση και ευθυγράμμιση
Οι εμπορικές εκδόσεις ERNIE (από το ERNIE Bot και εξής) υπόκεινται σε στάδια μετα-εκπαίδευσης:[7][3]
- Supervised Fine-Tuning (SFT) — περαιτέρω εκπαίδευση σε σημειολογημένα δεδομένα οδηγιών (στο ERNIE 4.5 — 2,3 εκατομμύρια παραδείγματα).
- Reinforcement Learning from Human Feedback (RLHF) — ευθυγράμμιση της συμπεριφοράς μοντέλου με ανατροφοδότηση από ανθρώπους· χρησιμοποιούνται αλγόριθμοι PPO (Proximal Policy Optimization) και DPO (Direct Preference Optimization).
- Unified Preference Optimization (UPO) — ενοποιημένη μέθοδος βελτιστοποίησης προτιμήσεων, εισαχθείσα στο ERNIE 4.5.
- Reinforcement Learning with Verifiers (RLVR) — ενισχυτική μάθηση με χρήση επαληθευτών για τον έλεγχο ορθότητας απαντήσεων· χρησιμοποιείται η μέθοδος GRPO (Group Relative Policy Optimization).
- Λειτουργίες συλλογισμού (thinking modes) — τα μοντέλα 4.5 υποστηρίζουν λειτουργίες με αναστοχασμό (reflection, planning) και χωρίς αυτόν.
Βασικά αποτελέσματα και benchmarks
Συνοπτικός πίνακας εξέλιξης μοντέλων
| Έκδοση | Έτος | Παράμετροι | Αρχιτεκτονική | Βασικά benchmarks | Πηγή |
|---|---|---|---|---|---|
| ERNIE 1.0 | 2019 | ~110 εκατ. (base) | Κωδικοποιητής Transformer (τύπου BERT) | XNLI 78,4%; MSRA-NER F1 93,8% | [1] |
| ERNIE 2.0 | 2019 | ~110–340 εκατ. | Continual multi-task | GLUE 80,6 (base) / 83,6 (large); 16 εργασίες SOTA | [5] |
| ERNIE 3.0 | 2021 | 10 δισ. | Unified Transformer-XL (AE+AR) | SuperGLUE 90,6% (> ανθρώπινο 89,8%); 54 κινεζικές εργασίες SOTA | [2] |
| ERNIE 3.0 Titan | 2021 | 260 δισ. (dense) | Dense + controllable generation | 68 dataset SOTA; zero/few-shot | [6] |
| ERNIE 4.5 | 2025 | 0,3–424 δισ. (MoE, 47 δισ. ενεργές) | Heterogeneous multimodal MoE | C-Eval 90,6%; MMLU 86,5%; MMMU 67,3–70% | [3] |
| ERNIE 5.0 | 2026 | ~2,4 τρισ. (ultra-sparse MoE) | Unified autoregressive multimodal MoE | LMArena Elo ~1460 (κορυφαίοι 10 παγκοσμίως) | [4] |
Αποτελέσματα ERNIE 3.0 και Titan
Το ERNIE 3.0 (10 δισεκατομμύρια παράμετροι) στο αγγλόφωνο benchmark SuperGLUE επέτυχε μέσο αποτέλεσμα 90,6, που υπερβαίνει το ανθρώπινο όριο (89,8) και τις επιδόσεις των GPT-3, T5 και DeBERTa κατά τη δημοσίευση. Το ERNIE 3.0 Titan (260 δισ.) αξιολογήθηκε σε 68 σύνολα δεδομένων, συμπεριλαμβανομένων εργασιών ταξινόμησης, NLI, QA και παραγωγής· οι συγγραφείς αναφέρουν ανωτερότητα έναντι των προηγούμενων μοντέλων σε όλα τα 68 dataset. Αυτά τα αποτελέσματα προέρχονται από πρωτογενείς πηγές· η ανεξάρτητη αναπαραγωγή τους είναι περιορισμένα τεκμηριωμένη.[2][6]
Αποτελέσματα ERNIE 4.5
Σύμφωνα με την τεχνική έκθεση του 2025, το ERNIE 4.5 (300B-A47B, μετά από εκπαίδευση μετα-επεξεργασίας) παρουσιάζει τα ακόλουθα αποτελέσματα σε κειμενικά και πολυτροπικά benchmarks:[3]
| Benchmark | ERNIE-4.5-300B-A47B | Συνθήκες |
|---|---|---|
| C-Eval | 90,6% | 5-shot |
| CMMLU | 90,2% | — |
| MMLU | 86,5% | τυπικό |
| IFEval | 88,0% | instruction following |
| GSM8K | 91,8% | — |
| MMMU | 67,3–70,0% | non-thinking / thinking |
| MathVista | 78,8% | thinking mode |
| OCRBench | 883 | — |
Σύμφωνα με την έκθεση, το ERNIE 4.5 ξεπέρασε το DeepSeek-V3 σε 22 από τα 28 benchmarks· οι πολυτροπικές παραλλαγές (ERNIE-4.5-VL-424B-A47B) παρουσίασαν ανταγωνιστικά αποτελέσματα σε εργασίες οπτικού συλλογισμού. Σε ορισμένες εργασίες οπτικού συλλογισμού και τεχνικής ερμηνείας εικόνων (ανάλυση διαγραμμάτων, μηχανολογικών σχεδίων) αναφέρονται αποτελέσματα υψηλότερα από ορισμένα μοντέλα GPT και Gemini.[3][14]
Σύγκριση ERNIE 4.5 με ανταγωνιστές (επιλεγμένα benchmarks, μετά από εκπαίδευση μετα-επεξεργασίας, σύμφωνα με την τεχνική έκθεση 2025):
| Benchmark | ERNIE-4.5-300B-A47B | DeepSeek-V3-671B-A37B | Qwen3-235B-A22B | Σημείωση |
|---|---|---|---|---|
| C-Eval | 90,6% | — | — | 5-shot |
| MMLU | 86,5% | συγκρίσιμο | — | τυπικό |
| IFEval | 88,0% | — | 83,2% | instruction following |
| MMMU | 67,3–70,0% | — | — | thinking / non-thinking |
| MathVista | 78,8% | — | 77,6% (Qwen2.5-VL) | thinking mode |
Συνθήκες αναπαραγωγής: τυπικά πρωτόκολλα (5-shot / zero-shot)· τα dataset είναι ανοιχτά (C-Eval 2023+, MMLU, MMMU). Η παύλα («—») σημαίνει ότι τα συγκρίσιμα δεδομένα υπό τις ίδιες συνθήκες δεν παρατίθενται στην έκθεση.[3]
Αξιολογήσεις ERNIE Bot 4.0
Η έκθεση SuperBench του Πανεπιστημίου Tsinghua κατατάσσει τα εμπορικά LLM βάσει ενός συνόλου εργασιών (γλωσσική κατανόηση, μαθηματικά, προγραμματισμός, πολυεργασιακότητα). Το ERNIE Bot 4.0 κατέλαβε την πρώτη θέση μεταξύ των κινεζικών μοντέλων, ξεπερνώντας το GLM-4 (Zhipu AI) κατά περίπου 0,41 βαθμούς στη συνολική μετρική· τα μοντέλα GPT-4 και Anthropic Claude-3 παρέμεναν υψηλότερα στην παγκόσμια κατάταξη. Το ERNIE Bot 4.0 παρουσίαζε ισχυρά αποτελέσματα στην κατανόηση κινεζικού κειμένου και στην εκτέλεση οδηγιών, με ασθενέστερες επιδόσεις στον προγραμματισμό και σε ορισμένες αγγλόφωνες εργασίες.[9][10]
Εφαρμογές
Προϊόντα και υπηρεσίες Baidu
Τα μοντέλα της σειράς ERNIE ενσωματώνονται στο οικοσύστημα προϊόντων Baidu:[7][8][3]
- ERNIE Bot (Wenxin Yiyan) — chatbot με υποστήριξη πολυτροπικής παραγωγής (κείμενο, εικόνες, βίντεο, ήχος). Σύμφωνα με δεδομένα της Baidu, ο αριθμός μηνιαίων ενεργών χρηστών υπερβαίνει τα 200 εκατομμύρια (2024–2025). Από το 2025 το ERNIE Bot είναι διαθέσιμο δωρεάν.[7]
- Αναζήτηση Baidu — παραγωγή απαντήσεων και λειτουργίες AI στα αποτελέσματα αναζήτησης· σύμφωνα με τη Baidu, έως το 70% των κορυφαίων αποτελεσμάτων εμπλουτίζονται με AI-συστατικά.
- Qianfan (πλατφόρμα MaaS) — API για εταιρικούς πελάτες· σύμφωνα με τη Baidu, περισσότερες από 760 χιλιάδες επιχειρήσεις χρησιμοποιούν την πλατφόρμα, ο αριθμός ημερήσιων κλήσεων API υπερβαίνει τα 1,5 δισεκατομμύρια (2024). Μεταξύ των πελατών — Lenovo, Trip.com και άλλοι.[7]
- Comate — AI-βοηθός για προγραμματισμό.
- Wenxin Yige — παραγωγή εικόνων βασισμένη στα μοντέλα ERNIE-ViLG.[11]
- Ενσωματώσεις με εξωτερικούς συνεργάτες: Samsung Galaxy (για την κινεζική αγορά), ψηφιακοί άβατάρ, πρόσθετα (αναζήτηση, ανάλυση αρχείων).[7]
Εφαρμογές σε κλάδους
Τα μοντέλα εφαρμόζονται στους ακόλουθους τομείς:[7][3]
- Συστήματα ερωτήσεων-απαντήσεων σε τομεακά πεδία (δίκαιο, ιατρική, οικονομικά) με χρήση γνωσιακά-ενισχυμένης προεκπαίδευσης.
- Παραγωγή και επεξεργασία κειμένων στα κινεζικά (ειδήσεις, marketing κείμενα, δημιουργικό περιεχόμενο).
- Πολυτροπικές εργασίες: ανάλυση εικόνων, μηχανολογικών σχεδίων, βίντεο και πινακοειδών δεδομένων (στις εκδόσεις 4.5 και άνω).
- Εκπαίδευση (εξατομικευμένη μάθηση), ρομποτική (σχεδιασμός εργασιών), αυτόνομη οδήγηση (Apollo).
Ανοιχτός κώδικας
Από το ERNIE 4.5 και εξής, και οι 10 παραλλαγές της οικογένειας κυκλοφόρησαν υπό την άδεια Apache 2.0 με το εργαλείο ERNIEKit (υποστήριξη SFT, LoRA, DPO, inference σε PaddlePaddle/FastDeploy). Ο κώδικας προγενέστερων εκδόσεων (ERNIE 1.0–3.0) είναι διαθέσιμος στο GitHub PaddlePaddle/ERNIE.[3][15]
Περιορισμοί και ανοιχτά ζητήματα
Αρχιτεκτονικοί και δεδομενολογικοί περιορισμοί
Το ERNIE 3.0 Titan με 260 δισεκατομμύρια παραμέτρους περιορίζεται σε μήκος πλαισίου 512 token για ένα μεμονωμένο άρθρωμα, γεγονός που περιορίζει τη μοντελοποίηση κειμένων μεγάλου μήκους χωρίς πρόσθετους μηχανισμούς (chunking, εξωτερική μνήμη). Η εκπαίδευση πραγματοποιείται κυρίως σε κινεζικό σώμα κειμένων, με αποτέλεσμα ανομοιογένεια ποιότητας μεταξύ κινεζικής και άλλων γλωσσών.[6]
Η ενσωμάτωση γράφου γνώσης βελτιώνει την επεξεργασία δομημένων γεγονότων, ωστόσο η ακρίβεια και η πληρότητα της γνώσης περιορίζονται από την ποιότητα του ίδιου του γράφου και τη διαδικασία αντιστοίχισης «τριάδα–κείμενο» (entity linking, relation alignment), που σε ορισμένες περιπτώσεις οδηγεί σε εσφαλμένες ή ελλιπείς συνδέσεις.[6]
Παραισθήσεις και αξιοπιστία
Η adversarial loss και η controllable LM loss βελτιώνουν την ανθεκτικότητα σε αναξιόπιστες παραγωγές, ωστόσο δεν εξαλείφουν πλήρως το πρόβλημα των παραισθήσεων (παραγωγή πραγματικά εσφαλμένων ισχυρισμών). Οι παράμετροι του adversarial ταξινομητή εκπαιδεύονται σε δεδομένα όπου το «παραγόμενο» κείμενο δημιουργείται από προηγούμενη έκδοση του ERNIE, γεγονός που περιορίζει το φάσμα των αναγνωρίσιμων εσφαλμένων μοτίβων.[6]
Κοινωνικές προκαταλήψεις
Μία έρευνα που δημοσιεύτηκε στο PeerJ Computer Science (2025) αναλύει τις κοινωνικές προκαταλήψεις σε κινεζικά LLM (ERNIE και Qwen) χρησιμοποιώντας 240 κοινωνικές ομάδες και περισσότερες από 30 χιλιάδες παραγόμενες περιγραφές. Τα αποτελέσματα δείχνουν ότι το ERNIE παράγει λιγότερο αρνητικό και στερεότυπο περιεχόμενο σε σχέση με το Baidu Search ή το Qwen (περίπου 1/10 λέξεων-υποψηφίων με αρνητική χροιά για το ERNIE έναντι 1/3 για το Qwen). Ωστόσο, η παρουσία ορισμένων στερεοτύπων, συμπεριλαμβανομένων δυνητικά προσβλητικών περιγραφών, παραμένει.[16][17]
Αναπαραγωγιμότητα
Ορισμένα μοντέλα της σειράς (ERNIE 3.0 Titan, εμπορικά ERNIE Bot 4.0 και 5.0) δεν είναι διαθέσιμα ως πλήρως ανοιχτός κώδικας με βάρη, γεγονός που περιορίζει την αναπαραγωγιμότητα των benchmarks και τη δυνατότητα ανεξάρτητης αξιολόγησης. Με την κυκλοφορία του ERNIE 4.5 υπό Apache 2.0 η κατάσταση βελτιώθηκε, ωστόσο οι αρχιτεκτονικές και οι ρυθμίσεις εκπαίδευσης ενδέχεται να διαφέρουν από αυτές που περιγράφονται σε πρώιμες δημοσιεύσεις.[3][6]
Ιατρική ασφάλεια
Έρευνες σχετικά με τη χρήση του ERNIE Bot σε ιατρικά σενάρια (Si et al., 2025) ανέδειξαν τάση προς υπερβολικές συνταγογραφήσεις: 91,9% περιττών εξετάσεων και 57,8% περιττών φαρμάκων σε μοντελικά σενάρια, καθώς και ηλικιακές και κοινωνικοοικονομικές ανισότητες στις συστάσεις.[18]
Ηθικές και ρυθμιστικές πτυχές
Τα μοντέλα της σειράς ERNIE λειτουργούν στο πλαίσιο της κινεζικής ρύθμισης για γενετική AI, ειδικότερα των «Προσωρινών Μέτρων για τη Διαχείριση Γενετικών Υπηρεσιών AI» (Interim Measures for Generative AI Services, 2023), που προβλέπουν υποχρεωτική αξιολόγηση ασφάλειας, καταχώριση αλγορίθμων και περιορισμούς περιεχομένου.[7][17]
Το ERNIE Bot επιδεικνύει υψηλό ποσοστό άρνησης σε ερωτήματα σχετικά με ευαίσθητα πολιτικά θέματα, σύμφωνα με την εθνική νομοθεσία. Έρευνες (Pan et al., 2026) αναλύουν την πολιτική λογοκρισία σε LLM κινεζικής προέλευσης, συμπεριλαμβανομένων μοντέλων Baidu.[19]
Οι δημοσιεύσεις της Baidu δεν περιγράφουν πάντα λεπτομερώς τις διαδικασίες ελέγχου συμπεριφοράς μοντέλου, τα κριτήρια φιλτραρίσματος περιεχομένου και την ισορροπία μεταξύ τοπικών κανονιστικών απαιτήσεων και γενικών αρχών ηθικής AI, γεγονός που παραμένει ανοιχτό πεδίο για ανεξάρτητες έρευνες.[17]
Προοπτικές και ερευνητικές κατευθύνσεις
Βάσει τεχνικών εκθέσεων και ανακοινώσεων της Baidu, αναδεικνύονται οι ακόλουθες κατευθύνσεις ανάπτυξης της σειράς ERNIE:
- Περαιτέρω πολυτροπικοποίηση (κείμενο–εικόνα–βίντεο–ήχος), συμπεριλαμβανομένης της επεξεργασίας πυκνών τεχνικών οπτικών δεδομένων (μηχανολογικά σχέδια, ιατρικές εικόνες).[3][4]
- Συνδυασμός πυκνών αρχιτεκτονικών και MoE για ισορροπία μεταξύ ποιότητας και υπολογιστικής αποδοτικότητας σε πολύ μεγάλα συνολικά μεγέθη μοντέλων.[3]
- Ανάπτυξη πρακτορικών συστημάτων (GenFlow, Famou) και εργαλείων δομημένης παραγωγής (JSON, κλήσεις API) για ενσωμάτωση σε παραγωγικές ροές εργασίας.[3]
- Βελτίωση αποδοτικότητας εκπαίδευσης: elastic training, βελτιωμένη κλιμάκωση MoE (MFU), κβαντισμός (W4A8, 2-bit για ανάπτυξη σε ένα GPU).[3]
- Έρευνες για τη μείωση προκαταλήψεων σε κινεζικά LLM λαμβάνοντας υπόψη πολιτισμικά-ειδικές πτυχές και ανάπτυξη μεθοδολογιών benchmarking για την κινεζική γλώσσα και πολυτροπικές εργασίες.[16][17]
- Βελτίωση συλλογισμού σε μεγάλο πλαίσιο, επαληθεύσιμη ενισχυτική μάθηση (verifiable RL) και προσαρμογή σε τομείς με περιορισμένα δεδομένα μέσω συνθετικών σωμάτων κειμένων.[3][4]
Σύγκριση με άλλα κινεζικά LLM
Το ERNIE ανταγωνίζεται με αρκετά μεγάλα κινεζικά LLM, μεταξύ των οποίων το Qwen (Alibaba), το GLM / ChatGLM (Zhipu AI), το DeepSeek (DeepSeek AI) και το Tongyi Qianwen. Τα κύρια χαρακτηριστικά της σειράς ERNIE είναι η έμφαση στην ενσωμάτωση γράφων γνώσης στην προεκπαίδευση (knowledge enhancement), η στενή ενσωμάτωση με το οικοσύστημα Baidu (αναζήτηση, υπολογιστικό νέφος, API) και ο προσανατολισμός στην πλατφόρμα PaddlePaddle. Σύμφωνα με ανεξάρτητες κατατάξεις (SuperBench, LMArena), τα μοντέλα της σειράς ERNIE κατέχουν υψηλές θέσεις μεταξύ των κινεζικών LLM, ιδιαίτερα σε εργασίες κατανόησης και εκτέλεσης οδηγιών στα κινεζικά.[9][13][16]
Δείτε επίσης
- BERT
- Αρχιτεκτονική Transformer
- RLHF
Βιβλιογραφία
- Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. AAAI 2020. arXiv:1907.12412. https://arxiv.org/abs/1907.12412
- Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.
- Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ArtificialIntelligence-News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ERNIE Official Blog (2025). Announcing the Open Source Release of the ERNIE 4.5 Model Family. https://ernie.baidu.com/blog/posts/ernie4.5/
Παραπομπές
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
- ↑ 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
- ↑ 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
- ↑ 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
- ↑ 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
- ↑ 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
- ↑ 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
- ↑ 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
- ↑ AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
- ↑ 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
- ↑ ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
- ↑ PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
- ↑ 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
- ↑ 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
- ↑ Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
- ↑ Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.