ERNIE (Baidu) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

ERNIE (Baidu) — 2019년부터 Baidu가 개발해 온 사전학습 언어 모델(Large Language Model, LLM) 및 멀티모달 기반 모델 시리즈로, 공식 명칭은 Enhanced Representation through kNowledge IntEgration(지식 통합을 통한 강화된 표현)이다. 이 시리즈는 지식 그래프(Knowledge Graph, KG), 온톨로지, 백과사전 등 외부 지식을 사전학습 과정에 명시적으로 통합함으로써 의미 이해 및 생성 품질을 향상시키는 것을 목표로 한다.[1][2]

이 시리즈의 모델들은 개체 및 구문 마스킹을 적용한 초기 BERT 기반 모델(ERNIE 1.0, 2.0)에서 출발하여, 대규모 통합 아키텍처(ERNIE 3.0, ERNIE 3.0 Titan), 오픈소스 Mixture-of-Experts(MoE) 기반 멀티모달 시스템(ERNIE 4.5), 그리고 네이티브 옴니모달 모델(ERNIE 5.0)로 발전해 왔다. 이 시리즈는 텍스트 이해(Natural Language Understanding, NLU), 텍스트 생성(Natural Language Generation, NLG), 그리고 후기 버전에서는 멀티모달 태스크(텍스트, 이미지, 영상, 오디오)를 지원하며, 중국어에 중점을 두면서 다국어도 지원한다.[2][3][4]

역사 및 배경

ERNIE 시리즈 개발은 2019년 Baidu 연구 부문에서 BERT(Devlin et al., 2018)의 성공과, 단어 사이에 명시적 공백이 없고 다의적 한자 비율이 높아 의미 단위(개체, 구문) 포착을 어렵게 만드는 중국어에 사전학습 모델을 적용해야 할 필요성에 부응하여 시작되었다.[1]

ERNIE 1.0 (2019)

시리즈의 첫 번째 모델(Sun et al., arXiv:1904.09223, 2019년 4월)은 BERT 유사 아키텍처를 위한 다단계 지식 마스킹(knowledge masking) 전략을 도입하였다. 개별 토큰을 무작위로 마스킹하는 대신, 개체명 인식(Named Entity Recognition, NER)과 구문 패턴에 기반하여 식별된 전체 개체 및 구문을 마스킹한다.[1]

ERNIE 1.0의 아키텍처는 Transformer 인코더(12개 레이어, 은닉 차원 768, 12개 어텐션 헤드)를 기반으로 한다. 대화 데이터 학습을 위한 Dialogue Language Model(DLM) 태스크가 추가로 도입되었다. 모델은 위키백과, Baidu Baike, 뉴스, Baidu Tieba 포럼 등의 코퍼스에서 수집된 약 1억 7,300만 개의 중국어 문장으로 학습되었다. 발표 당시 ERNIE 1.0은 5개의 중국어 NLP 태스크에서 최고 성능(state-of-the-art, SOTA)을 달성하였다: XNLI(테스트 정확도 78.4% 대 BERT의 77.2%), MSRA-NER(F1 93.8% 대 92.6%).[1]

ERNIE 2.0 (2019)

ERNIE 2.0(Sun et al., arXiv:1907.12412, 2019년 7월; AAAI 2020 채택)은 지속적 다중 태스크 사전학습(continual multi-task pre-training) 프레임워크를 도입하였다. 이 프레임워크에서는 공통 Transformer에 새로운 사전학습 태스크가 전체 재학습 없이 순차적(점진적)으로 추가된다.[5]

ERNIE 2.0의 사전학습 태스크는 세 그룹으로 분류된다:

  • Word-aware — 지식 마스킹(knowledge masking), 대소문자 예측(capitalization prediction), 토큰-문서 관계(token-document relation).
  • Structure-aware — 문장 재정렬(sentence reordering), 문장 간 거리 판별(sentence distance).
  • Semantic-aware — 담화 관계 예측(discourse relation prediction), 정보 검색 관련성 예측(IR relevance prediction).[5]

모델은 영어 및 중국어 코퍼스(백과사전, 도서, Reddit, 검색 로그)로 학습되었다. 결과: base 모델의 GLUE 평균 점수는 80.6(BERT의 78.3 대비), large 모델은 83.6; ERNIE 2.0은 16개 태스크에서 BERT 및 XLNet을 능가하였다.[5]

ERNIE 3.0 (2021)

ERNIE 3.0 프레임워크(Sun et al., arXiv:2107.02137, 2021년 7월)는 자동 인코딩(auto-encoding, AE)과 자동 회귀(auto-regressive, AR) 사전학습 패러다임을 단일 아키텍처로 통합하였다. 아키텍처는 범용 표현 모듈(Universal Representation Module)과 NLU 및 NLG를 위한 태스크별 표현 모듈(Task-specific Representation Modules)로 분리된다.[2]

100억 개 파라미터를 가진 이 모델은 4TB의 중국어 텍스트(11개 카테고리: Baidu Baike, 위키백과, 검색 로그, 질의응답 시스템, 도메인 텍스트)와 5,000만 개 이상의 사실을 포함한 지식 그래프로 학습되었다. ERNIE 3.0은 54개 중국어 NLP 태스크에서 SOTA를 달성하였으며, 영어 벤치마크 SuperGLUE에서 90.6%(2021년 7월 3일 기준, 인간 기준선 89.8% 초과)를 기록하였다.[2]

ERNIE 3.0 Titan (2021)

「ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation」(Wang et al., arXiv:2112.12731, 2021년 12월) 논문에서는 ERNIE 3.0 프레임워크를 PaddlePaddle 플랫폼에서 구현된 2,600억 파라미터 밀집(dense) 모델로 확장한 내용이 기술된다.[6]

Titan은 추가 메커니즘을 도입하였다: 생성 텍스트의 신뢰도를 평가하기 위한 자기지도 adversarial loss, 생성의 스타일, 주제, 감성, 길이를 제어하기 위한 controllable language modeling loss, 그리고 사전학습 과정에서 소형 학생 모델을 생성하기 위한 온라인 증류(On-the-Fly Distillation, OFD). 모델은 68개 데이터셋으로 평가되었으며, 저자들에 따르면 68개 데이터셋 전체에서 기존 모델들을 능가하였다.[6]

ERNIE Bot 및 상업 버전 (2023–2025)

2023년 3월 Baidu는 ERNIE 3.x 모델과 PLATO(대화 모델)를 기반으로 한 챗봇 ERNIE Bot(Wenxin Yiyan, 문심일언)을 출시하였다. 규제 당국의 승인을 받은 후 2023년 8월에 일반 공개되었다. 이후 업데이트에는 ERNIE 3.5(2023년 6월)와 ERNIE 4.0(2023년 10월)이 포함되었다.[7][8]

칭화대학교 SuperBench 보고서에 따르면, ERNIE Bot 4.0은 통합 지표 기준으로 중국 LLM 중 1위를 차지하며, 중국어 언어 이해 및 지시 따르기 영역에서 강력한 성능을 보였다.[9][10]

2022년에는 주요 언어 모델 라인과 병행하여 멀티모달 확장 모델인 ERNIE-ViLG 2.0(arXiv:2210.15257)이 공개되었다. 이 모델은 텍스트-이미지 생성(text-to-image)을 수행하는 모델로, 멀티모달 방향으로의 첫 번째 주요 단계 중 하나가 되었다.[11]

2024년 WAVE SUMMIT 컨퍼런스에서 Baidu는 고속 애플리케이션을 위한 최적화 버전인 ERNIE 4.0 Turbo를 공개하였다. 이 버전은 품질을 유지하면서 약 20초 이내에 1,000단어 이상의 텍스트를 생성할 수 있다.[12]

ERNIE 4.5 (2025)

2025년 6월 Baidu는 ERNIE 4.5 기술 보고서를 발표하였다. 이 보고서는 텍스트 LLM과 멀티모달 모델(Vision-Language, VL)을 포함한 10개 모델로 구성된 패밀리를 소개한다. 아키텍처는 모달리티별로 전문가를 분리한 이종(heterogeneous) Mixture-of-Experts(MoE)를 기반으로 한다. 변형 모델로는 최대 4,240억 개의 전체 파라미터와 470억 개의 활성 파라미터를 가진 MoE 모델, 그리고 3억 개 파라미터의 밀집 모델이 있다. 이 패밀리는 Hugging Face 및 GitHub(PaddlePaddle/ERNIE)에서 Apache 2.0 라이선스로 공개되었다.[3]

ERNIE 5.0 (2026)

2026년 2월 ERNIE 5.0 기술 보고서(arXiv:2602.04705)가 발표되었다. 이 모델은 텍스트, 이미지, 오디오, 영상의 공동 모델링을 지원하는 초희소 MoE(ultra-sparse MoE)를 갖춘 네이티브 옴니모달 자동 회귀 모델이다. 모델은 LMArena 리더보드에서 높은 순위를 기록하였다.[4][13]

이론적 기반 및 아키텍처 원칙

지식 마스킹(Knowledge Masking)

초기 시리즈 모델의 핵심 원칙은 수정된 마스킹 전략을 통해 구조화된 지식을 사전학습 과정에 통합하는 것이다. 개별 토큰을 마스킹하는 표준 Masked Language Modeling(MLM)과 달리, ERNIE 1.0은 NER을 통해 식별된 개체와 구문 등 전체 의미 단위를 마스킹한다. 개체 E={t1,,tk}에 대해서는 지정된 확률 p로 전체 토큰 시퀀스가 마스킹된다. 이 접근 방식은 모델이 더 넓은 문맥에 의존하고 개체 간의 관계를 학습하도록 유도한다.[1]

ERNIE 2.0은 점진적 다중 태스크 학습을 추가하여 이 접근 방식을 발전시켰다. 어휘, 구조, 의미 수준의 태스크가 순차적으로 추가되며, 이전에 학습된 지식은 지속적 사전학습(continual pre-training) 메커니즘을 통해 보존된다.[5]

ERNIE 3.0 통합 프레임워크

ERNIE 3.0 프레임워크는 아키텍처를 두 수준으로 분리하는 것을 기반으로 한다:[2][6]

  • Universal Representation Module — 다양한 사전학습 태스크에서 공통 어휘 및 구문 특성을 추출하도록 학습된 공통 다층 Transformer-XL. Titan 버전에서 이 모듈은 48개 레이어, 은닉 표현 크기 12288, 192개 어텐션 헤드, feed-forward 네트워크 내부 크기 196608(16×dmodel)을 갖는다.
  • Task-specific Representation Modules — NLU(양방향 어텐션)와 NLG(Transformer-XL 순환 메모리를 사용한 단방향 어텐션)를 위한 별도 모듈로, 각각 12개 레이어, 은닉 벡터 크기 768, 12개 어텐션 헤드를 갖는다.

자동 인코딩과 자동 회귀 패러다임의 통합을 통해 단일 모델이 NLU 벤치마크(BERT 유사 태스크)와 NLG 벤치마크(GPT 유사 태스크) 모두에서 높은 성능을 발휘할 수 있다.[2]

Universal Knowledge-Text Prediction (UKTP)

UKTP 태스크는 ERNIE 3.0/Titan에서 지식 통합의 핵심 메커니즘이다. 모델은 (지식 그래프 트리플, 백과사전 문장) 쌍을 입력받아, 텍스트를 활용하여 트리플의 관계를 예측하거나 트리플 정보를 활용하여 텍스트의 마스킹된 토큰을 예측해야 한다.[6]

텍스트 x와 연결된 트리플 (h,r,t)에서 관계 r를 예측할 때, 태스크는 다중 클래스 분류로 공식화된다:

Pθ(rx,h,t)=softmax(Wfθ(x,h,t)+b)

여기서 fθ은 머리 개체와 꼬리 개체 언급 위치에 대한 Transformer 출력이고, W,b는 분류기의 파라미터, θ은 모델의 파라미터이다.[6]

신뢰할 수 있고 제어 가능한 생성 메커니즘 (Titan)

ERNIE 3.0 Titan은 두 가지 추가 손실 함수 유형을 도입하였다.[6]

자기지도 adversarial loss. 데이터셋 Da={Doriginal,Dgenerated}이 구성되며, 여기서 Doriginal는 실제 단락이고 Dgenerated은 원본 단락의 접두사로부터 이전 버전의 ERNIE가 생성한 텍스트이다. 태스크는 특수 토큰 [CLS]의 은닉 상태에 기반한 이진 분류(원본 / 생성)이다:

La(Da)=n=1|Da|logPθ(yn=Ih[CLS](n)Doriginalh[CLS](n))

여기서 h[CLS](n)n번째 예시에 대한 [CLS]의 벡터 표현이고, I은 원본 텍스트 소속 여부를 나타내는 지시자이다.[6]

Controllable language modeling loss. 각 학습 예시에는 장르, 주제, 핵심어, 감성, 길이를 설명하는 속성(프롬프트) 세트가 첨부된다. 손실은 비조건부 및 조건부 언어 모델링을 결합한다:

Lc(Dc)={n=1|Dc|logPθ(xt(n)x<t(n)),если p0,5,n=1|Dc|logPθ(xt(n)x<t(n),promptsn),если p>0,5,

여기서 p는 모드를 교체하기 위한 확률 변수이고, xt(n)n번째 예시의 t번째 토큰이다. 이 정의는 모델이 프롬프트에 과도하게 의존하는 것을 방지한다.[6]

이종 MoE 아키텍처 (ERNIE 4.5)

ERNIE 4.5는 텍스트 전문가와 시각 전문가(후자는 텍스트 전문가의 약 1/3 크기)로 전문가를 분리하는 이종 멀티모달 Mixture-of-Experts 아키텍처를 도입한다. 토큰 라우팅은 모달리티 격리 라우팅(modality-isolated routing)과 전문가 특화를 보장하기 위한 라우터 직교화 손실(router orthogonalization loss, 계수 차수 103)을 적용하여 수행된다. 영상 데이터에서 시간, 높이, 너비 차원의 위치 인코딩을 위해 3D RoPE(Rotary Position Embeddings)가 사용된다. FlashMask 메커니즘은 O(N) 마스크를 사용하여 긴 문맥(최대 131,000개 토큰)의 효율적 처리를 위해 적용된다.[3]

ERNIE 4.5의 사전학습은 여러 단계로 진행된다: 먼저 텍스트 전용 데이터로 학습한 후, 시각 데이터로 학습하고, 마지막 단계에서 멀티모달 데이터를 함께 학습한다(텍스트 전용 → 시각 전용 → 공동). 이미지 처리를 위해 서로 다른 모달리티의 표현 정렬을 위한 pixel shuffle 메커니즘이 포함된 적응형 ViT 인코더(Vision Transformer)가 사용된다. 적응형 프레임 샘플링(adaptive frame sampling)을 통해 긴 영상(최대 32,000개 토큰)의 처리가 지원된다.[3]

네이티브 옴니모달리티 (ERNIE 5.0)

ERNIE 5.0은 각 단계에서 전체 전문가 수의 3% 미만이 활성화되는 초희소 MoE를 갖춘 단일 아키텍처에서 텍스트, 이미지, 오디오, 영상 등 여러 모달리티의 네이티브 자동 회귀 모델링을 구현한다. 사전학습 태스크로는 단일 토큰 대신 토큰 그룹을 예측하는 Next-Group-of-Tokens Prediction을 사용하여 학습 효율성을 높인다. 오디오 모달리티에는 계층적 코덱(hierarchical codec)이 사용된다. Elastic training 기술을 통해 단일 학습 실행 내에서 다양한 깊이, 너비, 희소도를 가진 서브 모델을 생성할 수 있다.[4]

사전학습 태스크 및 데이터

ERNIE 3.0 / Titan 사전학습 태스크

ERNIE 3.0 및 Titan에서는 다음과 같은 사전학습 태스크 그룹이 사용된다:[2][6]

Word-aware 태스크:

  • Knowledge Masked Language Modeling — 로컬 및 글로벌 문맥에서의 의존 관계 학습을 위한 구문 및 개체 마스킹.
  • Document Language Modeling — 최대 512개 토큰 길이 및 Transformer-XL 순환 메모리를 사용한 문서의 자동 회귀 모델링.

Structure-aware 태스크:

  • Sentence Reordering — m개의 세그먼트로 무작위로 분할 및 섞인 단락에 대해 모델이 k=n=1mn!k-클래스 분류 태스크를 풀어 원래 순서를 복원한다.
  • Sentence Distance — 3-클래스 분류: 인접한 문장, 같은 문서 내에서 인접하지 않은 문장, 다른 문서의 문장.

Knowledge-aware 태스크:

  • Universal Knowledge-Text Prediction(UKTP) — 텍스트와 지식 그래프 트리플의 공동 모델링.
  • Credible and Controllable Generations — adversarial loss와 controllable LM loss의 조합.

사전학습 데이터

ERNIE 3.0/Titan에는 웹 페이지, 검색 로그, 질의응답 데이터, 문학, 법률, 금융, 의료 텍스트, 소설 및 시를 포함하는 11개 카테고리의 약 4TB 규모 중국어 코퍼스인 ERNIE 3.0 Corpus가 사용된다. 코퍼스 위에는 5,000만 개 이상의 사실로 구성된 지식 그래프가 구축되어 있다.[2][6]

Titan을 위해 추가로 다음이 구성된다:

  • Adversarial dataset — 200만 개의 원본 단락과, ERNIE 3.0이 원본의 처음 1~3개 문장의 접두사를 기반으로 생성한 대응하는 「부정적」 단락(최대 512개 토큰 길이).
  • Controllable dataset — 장르, 주제(26개 토픽), 핵심어, 감성(긍정/부정/중립), 길이 속성이 부여된 텍스트. 장르 속성은 학습 가능한 「소프트 프롬프트」로 인코딩되며(장르의 프롬프트 수는 0에서 64 사이에서 무작위 선택).[6]

후기 버전(ERNIE 4.5, 5.0)은 큐레이션된 웹 콘텐츠, 학술 논문, 합성 데이터를 포함한 확장된 멀티모달 코퍼스(텍스트, 이미지, 영상, 오디오)를 사용한다.[3][4]

학습 및 분산 최적화

ERNIE 3.0 Titan의 사전학습은 Adam 옵티마이저(학습률 104, β1=0,9, β2=0,95, L2 정규화 0.1, 기울기 노름 클리핑 1.0), 최대 문맥 길이 512, 생성 태스크를 위한 순환 메모리 길이 128을 사용하여 수행되었다. 점진적 학습 스케줄(처음 4,000 스텝에서 빠른 수렴)과 선형 학습률 감소가 적용되었다.[6]

4D 하이브리드 병렬화

이종 클러스터(GPU NVIDIA V100 및 NPU Ascend 910)에서 2,600억 파라미터 밀집 모델을 학습하기 위해 PaddlePaddle에서 4D 하이브리드 병렬화가 구현되었다:[6]

  • 데이터 병렬화(Data parallelism, DP) — 여러 장치에 모델을 복제하고 배치를 분리하여 처리.
  • 텐서 모델 병렬화(Tensor model parallelism, MP) — 레이어 내에서 Transformer의 파라미터와 활성화를 장치들에 분할.
  • 파이프라인 모델 병렬화(Pipeline model parallelism, PP) — 모델의 레이어를 파이프라인으로 분산.
  • Group Sharded — 옵티마이저 상태의 중복을 줄이기 위한 ZeRO 유사 sharded-data-parallel의 개선 변형.

보고서에는 Ascend 910 카드 수천 개로의 약 91.7% 처리량 효율의 약한 확장성 결과가 제시되어 있다.[6]

ERNIE 4.5 학습

ERNIE 4.5 학습은 2,016개의 GPU NVIDIA H800 클러스터에서 수행되었으며, Model FLOPs Utilization(MFU) 47%를 달성하였다. FP8 혼합 정밀도, 내결함성 체크포인트(Zero Cost Checkpoint, 8분 이내 복구), 시퀀스 길이와 배치 크기를 점진적으로 늘리는 점진적 학습이 사용되었다.[3]

온라인 증류

ERNIE 3.0 Titan의 배포 시 계산 자원 요구사항을 줄이기 위해, 교사 모델과 여러 학생 모델이 동시에 학습되는 온라인 증류가 사용된다:[6]

  • On-the-Fly Distillation (OFD) — 교사 로짓과 표현이 동일한 학습 스텝에서 학생 학습에 활용됨.
  • Teacher assistants — 교사와 최종 학생 간의 용량 격차를 줄이는 중간 크기 모델.
  • Auxiliary Layer Distillation (ALD) — 내부 표현의 더 나은 매칭을 위해 학생에 추가된 레이어로, fine-tuning 시 제거됨.

사후 학습 및 정렬

상업 버전의 ERNIE(ERNIE Bot부터)는 다음 사후 학습 단계를 거친다:[7][3]

  • Supervised Fine-Tuning (SFT) — 레이블링된 지시 데이터(ERNIE 4.5에서는 230만 개 예시)로 추가 학습.
  • Reinforcement Learning from Human Feedback (RLHF) — 인간 피드백을 통한 모델 행동 정렬; PPO(Proximal Policy Optimization) 및 DPO(Direct Preference Optimization) 알고리즘 적용.
  • Unified Preference Optimization (UPO) — ERNIE 4.5에서 도입된 통합 선호도 최적화 방법.
  • Reinforcement Learning with Verifiers (RLVR) — 답변의 정확성 검증을 위한 검증기를 활용한 강화 학습; GRPO(Group Relative Policy Optimization) 방법 적용.
  • 추론 모드(thinking modes) — 4.5 모델은 반성(reflection), 계획(planning)을 포함한 추론 모드와 그렇지 않은 모드를 모두 지원한다.

주요 결과 및 벤치마크

모델 발전 요약 표

버전 연도 파라미터 수 아키텍처 주요 벤치마크 출처
ERNIE 1.0 2019 약 1억 1,000만 (base) Transformer 인코더 (BERT 유사) XNLI 78.4%; MSRA-NER F1 93.8% [1]
ERNIE 2.0 2019 약 1억 1,000만~3억 4,000만 Continual multi-task GLUE 80.6 (base) / 83.6 (large); 16개 태스크 SOTA [5]
ERNIE 3.0 2021 100억 Unified Transformer-XL (AE+AR) SuperGLUE 90.6% (인간 기준선 89.8% 초과); 54개 중국어 태스크 SOTA [2]
ERNIE 3.0 Titan 2021 2,600억 (dense) Dense + controllable generation 68개 데이터셋 SOTA; zero/few-shot [6]
ERNIE 4.5 2025 3억~4,240억 (MoE, 470억 활성) Heterogeneous multimodal MoE C-Eval 90.6%; MMLU 86.5%; MMMU 67.3~70% [3]
ERNIE 5.0 2026 약 2조 4,000억 (ultra-sparse MoE) Unified autoregressive multimodal MoE LMArena Elo 약 1460 (글로벌 상위 10위) [4]

ERNIE 3.0 및 Titan 결과

ERNIE 3.0(100억 파라미터)은 영어 벤치마크 SuperGLUE에서 평균 90.6을 달성하여, 발표 당시 인간 기준선(89.8)과 GPT-3, T5, DeBERTa의 성능을 모두 능가하였다. ERNIE 3.0 Titan(2,600억 파라미터)은 분류, NLI, QA, 생성 태스크를 포함한 68개 데이터셋으로 평가되었으며, 저자들은 68개 데이터셋 전체에서 기존 모델들을 능가했다고 보고하였다. 이 결과들은 원저자 데이터이며, 독립적인 재현은 제한적으로 기술되어 있다.[2][6]

ERNIE 4.5 결과

2025년 기술 보고서에 따르면, ERNIE 4.5(300B-A47B, 사후 학습)는 텍스트 및 멀티모달 벤치마크에서 다음 결과를 보여준다:[3]

벤치마크 ERNIE-4.5-300B-A47B 조건
C-Eval 90.6% 5-shot
CMMLU 90.2%
MMLU 86.5% 표준
IFEval 88.0% instruction following
GSM8K 91.8%
MMMU 67.3~70.0% non-thinking / thinking
MathVista 78.8% thinking mode
OCRBench 883

보고서에 따르면 ERNIE 4.5는 28개 벤치마크 중 22개에서 DeepSeek-V3를 능가하였으며, 멀티모달 변형 모델(ERNIE-4.5-VL-424B-A47B)은 시각적 추론 태스크에서 경쟁력 있는 결과를 보였다. 일부 시각적 추론 및 기술 이미지 해석 태스크(회로도, 공학 다이어그램 분석)에서는 일부 GPT 및 Gemini 모델보다 높은 결과가 보고되었다.[3][14]

ERNIE 4.5와 경쟁 모델 비교 (선별 벤치마크, 사후 학습, 2025년 기술 보고서 기준):

벤치마크 ERNIE-4.5-300B-A47B DeepSeek-V3-671B-A37B Qwen3-235B-A22B 비고
C-Eval 90.6% 5-shot
MMLU 86.5% 유사 표준
IFEval 88.0% 83.2% instruction following
MMMU 67.3~70.0% thinking / non-thinking
MathVista 78.8% 77.6% (Qwen2.5-VL) thinking mode

재현 조건: 표준 프로토콜(5-shot / zero-shot); 공개 데이터셋(C-Eval 2023+, MMLU, MMMU). 줄표(「—」)는 보고서에서 동일 조건의 비교 데이터가 제시되지 않은 경우를 의미한다.[3]

ERNIE Bot 4.0 평가

칭화대학교 SuperBench 보고서는 상업 LLM을 일련의 태스크(언어 이해, 수학, 코딩, 멀티태스킹)로 순위를 매긴다. ERNIE Bot 4.0은 통합 지표 기준으로 중국 모델 중 1위를 차지하며, GLM-4(Zhipu AI)보다 약 0.41점 앞섰다. GPT-4 및 Anthropic Claude-3 모델은 글로벌 순위에서 더 높은 위치를 유지하였다. ERNIE Bot 4.0은 중국어 텍스트 이해 및 지시 따르기에서 강력한 성능을 보였으나, 코딩 및 일부 영어 태스크에서는 상대적으로 약한 결과를 보였다.[9][10]

활용

Baidu의 제품 및 서비스

ERNIE 시리즈 모델은 Baidu의 제품 생태계에 통합되어 있다:[7][8][3]

  • ERNIE Bot (Wenxin Yiyan) — 멀티모달 생성(텍스트, 이미지, 영상, 오디오)을 지원하는 챗봇. Baidu에 따르면 월간 활성 사용자 수는 2억 명 이상(2024~2025년). 2025년부터 ERNIE Bot이 무료로 제공된다.[7]
  • Baidu 검색 — 검색 결과에서의 답변 생성 및 AI 기능; Baidu에 따르면 상위 결과의 최대 70%가 AI 구성 요소로 강화되어 있다.
  • Qianfan (MaaS 플랫폼) — 기업 고객을 위한 API; Baidu에 따르면 76만 개 이상의 기업이 플랫폼을 사용하며, 일일 API 호출 횟수는 15억 회 이상(2024년). 고객으로는 Lenovo, Trip.com 등이 있다.[7]
  • Comate — 코딩 AI 어시스턴트.
  • Wenxin Yige — ERNIE-ViLG 모델 기반 이미지 생성.[11]
  • 외부 파트너 통합: Samsung Galaxy(중국 시장용), 디지털 아바타, 플러그인(검색, 파일 분석).[7]

산업별 활용

모델은 다음 분야에 적용된다:[7][3]

  • 지식 강화 사전학습을 활용한 도메인별 질의응답 시스템(법률, 의료, 금융).
  • 중국어 텍스트 생성 및 편집(뉴스, 마케팅 텍스트, 창작 콘텐츠).
  • 멀티모달 태스크: 이미지, 공학 도면, 영상, 테이블 데이터 분석(4.5 이상 버전).
  • 교육(맞춤형 학습), 로보틱스(태스크 계획), 자율 주행(Apollo).

오픈소스

ERNIE 4.5부터 패밀리의 10개 변형 모델 전체가 ERNIEKit 툴킷(SFT, LoRA, DPO, PaddlePaddle/FastDeploy 추론 지원)과 함께 Apache 2.0 라이선스로 공개되었다. 초기 버전(ERNIE 1.0~3.0)의 코드는 GitHub PaddlePaddle/ERNIE에서 이용 가능하다.[3][15]

한계 및 미해결 문제

아키텍처 및 데이터셋 한계

ERNIE 3.0 Titan은 2,600억 파라미터임에도 불구하고, 개별 모듈의 문맥 길이가 512개 토큰으로 제한되어, 추가적인 메커니즘(청킹, 외부 메모리) 없이는 긴 텍스트 모델링이 제한된다. 학습이 주로 중국어 코퍼스로 이루어져 중국어와 다른 언어 간의 품질 불균형이 발생한다.[6]

지식 그래프 통합은 구조화된 사실 처리를 향상시키지만, 지식의 정확성과 완전성은 그래프 자체의 품질 및 트리플-텍스트 매핑 절차(개체 연결, 관계 정렬)에 의해 제한되며, 이는 경우에 따라 잘못되거나 불완전한 연관으로 이어질 수 있다.[6]

환각 및 신뢰도

Adversarial loss와 controllable LM loss는 신뢰할 수 없는 생성에 대한 견고성을 향상시키지만, 환각(사실적으로 잘못된 진술 생성) 문제를 완전히 해결하지는 못한다. Adversarial 분류기의 파라미터는 「생성된」 텍스트가 이전 버전 ERNIE에 의해 생성되는 데이터로 학습되므로, 인식 가능한 오류 패턴의 범위가 제한된다.[6]

사회적 편향

PeerJ Computer Science(2025)에 발표된 연구는 240개의 사회 집단과 3만 개 이상의 생성된 설명을 사용하여 중국어 LLM(ERNIE 및 Qwen)에서의 사회적 편향을 분석하였다. 결과에 따르면 ERNIE는 Baidu Search 또는 Qwen보다 부정적이고 고정관념적인 콘텐츠를 덜 생성한다(ERNIE의 부정적 의미 후보 단어 비율은 약 1/10, Qwen은 약 1/3). 그러나 잠재적으로 모욕적인 묘사를 포함한 일부 고정관념은 여전히 존재한다.[16][17]

재현 가능성

시리즈의 일부 모델(ERNIE 3.0 Titan, 상업 버전 ERNIE Bot 4.0 및 5.0)은 완전히 오픈소스 코드 및 가중치 형태로 제공되지 않아, 벤치마크 재현성과 독립적인 평가 가능성이 제한된다. ERNIE 4.5가 Apache 2.0으로 출시되면서 상황이 개선되었으나, 아키텍처와 학습 설정이 초기 논문의 기술과 다를 수 있다.[3][6]

의료 안전성

의료 시나리오에서 ERNIE Bot 사용에 관한 연구(Si et al., 2025)에서는 과도한 처방 경향이 확인되었다: 모델 시나리오에서 불필요한 검사의 91.9%, 불필요한 약물의 57.8%, 그리고 권고 사항에서 연령 및 사회경제적 불균형이 나타났다.[18]

윤리적 및 규제적 측면

ERNIE 시리즈 모델은 중국의 생성 AI 규제 체계, 특히 안전성 평가 의무, 알고리즘 등록, 콘텐츠 제한을 규정하는 「생성 AI 서비스 관리 임시 조치」(Interim Measures for Generative AI Services, 2023) 내에서 운영된다.[7][17]

ERNIE Bot은 국내 법률에 따라 정치적으로 민감한 주제와 관련된 요청에 대해 높은 거부율을 보인다. 연구(Pan et al., 2026)는 Baidu 모델을 포함한 중국산 LLM의 정치적 검열을 분석하고 있다.[19]

Baidu의 출판물이 모델 행동 감사 절차, 콘텐츠 필터링 기준, 지역 규범 요구사항과 AI 윤리 일반 원칙 간의 균형을 항상 상세히 기술하지는 않으며, 이는 독립적인 연구를 위한 열린 영역으로 남아 있다.[17]

전망 및 연구 방향

기술 보고서와 Baidu의 발표를 바탕으로 ERNIE 시리즈의 발전 방향은 다음과 같다:

  • 밀집 기술 시각 데이터(공학 도면, 의료 이미지)의 처리를 포함한 멀티모달화(텍스트-이미지-영상-오디오)의 지속적 발전.[3][4]
  • 매우 큰 총 모델 크기에서 품질과 계산 효율성의 균형을 위한 밀집 및 MoE 아키텍처의 결합.[3]
  • 생산 워크플로우 통합을 위한 에이전트 시스템(GenFlow, Famou) 및 구조화된 생성 도구(JSON, API 호출)의 개발.[3]
  • 학습 효율성 향상: elastic training, 개선된 MoE 확장(MFU), 양자화(W4A8, 단일 GPU 배포를 위한 2비트).[3]
  • 문화적 특수성을 고려한 중국어 LLM의 편향 감소 연구 및 중국어와 멀티모달 태스크를 위한 벤치마크 방법론 개발.[16][17]
  • 긴 문맥 추론 개선, 검증 가능한 강화 학습(verifiable RL), 합성 코퍼스를 통한 데이터 제한 도메인 적응.[3][4]

다른 중국어 LLM과의 비교

ERNIE는 Qwen(Alibaba), GLM/ChatGLM(Zhipu AI), DeepSeek(DeepSeek AI), Tongyi Qianwen 등 다수의 주요 중국어 LLM과 경쟁한다. ERNIE 시리즈의 주요 특징은 사전학습에 지식 그래프를 통합하는 것(지식 강화), Baidu 생태계(검색, 클라우드, API)와의 긴밀한 통합, PaddlePaddle 플랫폼 중심의 운영이다. 독립적인 순위(SuperBench, LMArena)에서 ERNIE 시리즈 모델은 특히 중국어 이해 및 지시 따르기 태스크에서 중국어 LLM 중 높은 순위를 기록하고 있다.[9][13][16]

같이 보기

  • BERT
  • Transformer 아키텍처
  • RLHF

참고 문헌

각주

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Sun, Y. et al. (2019). ERNIE: Enhanced Representation through Knowledge Integration. arXiv:1904.09223. https://arxiv.org/abs/1904.09223
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 Sun, Y. et al. (2021). ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2107.02137. https://arxiv.org/abs/2107.02137
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 Baidu ERNIE Team (2025). ERNIE 4.5 Technical Report. https://ernie.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 Wang, H. et al. (2026). ERNIE 5.0 Technical Report. arXiv:2602.04705. https://arxiv.org/abs/2602.04705
  5. 5.0 5.1 5.2 5.3 5.4 Sun, Y. et al. (2019). ERNIE 2.0: A Continual Pre-training Framework for Language Understanding. arXiv:1907.12412. AAAI 2020. https://arxiv.org/abs/1907.12412
  6. 6.00 6.01 6.02 6.03 6.04 6.05 6.06 6.07 6.08 6.09 6.10 6.11 6.12 6.13 6.14 6.15 6.16 6.17 6.18 6.19 6.20 Wang, S. et al. (2021). ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. arXiv:2112.12731. https://arxiv.org/abs/2112.12731
  7. 7.0 7.1 7.2 7.3 7.4 7.5 7.6 7.7 Wikipedia. Ernie Bot. https://en.wikipedia.org/wiki/Ernie_Bot
  8. 8.0 8.1 Baidu Research Blog (2023). ERNIE Bot: Baidu's Knowledge-Enhanced Large Language Model. https://research.baidu.com/Blog/index-view?id=183
  9. 9.0 9.1 9.2 DaoInsights (2024). Baidu's ERNIE bot tops the Tsinghua University LLM report ranking. https://daoinsights.com/news/far-ahead-baidus-ernie-bot-tops-the-tsinghua-university-llm-report-ranking/
  10. 10.0 10.1 Multiplatform.ai (2024). ERNIE Bot Leads Tsinghua University's LLM Report Rankings in China. https://multiplatform.ai/ernie-bot-leads-tsinghua-universitys-llm-report-rankings-in-china/
  11. 11.0 11.1 Feng, Z. et al. (2022). ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts. arXiv:2210.15257. https://arxiv.org/abs/2210.15257
  12. AI Base News (2025). Free Limited-Time Trial! Baidu's ERNIE 4.0 Turbo Launches on the ERNIE Bot Official Website. https://news.aibase.com/news/9958
  13. 13.0 13.1 ERNIE Official Blog (2025). ERNIE-5.0-Preview-1022 now ranks #2 globally on the LMArena Text leaderboard. https://ernie.baidu.com/blog/posts/ernie-5.0-preview-1022-release-on-lmarena/
  14. ArtificialIntelligence‑News (2025). Baidu ERNIE multimodal AI beats GPT and Gemini in benchmarks. https://www.artificialintelligence-news.com/news/baidu-ernie-multimodal-ai-gpt-and-gemini-benchmarks/
  15. PaddlePaddle/ERNIE. GitHub. https://github.com/PaddlePaddle/ERNIE
  16. 16.0 16.1 16.2 Song, X. et al. (2024). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: a case study on Baidu, Ernie and Qwen. arXiv:2408.15696. https://arxiv.org/abs/2408.15696
  17. 17.0 17.1 17.2 17.3 PeerJ Computer Science (2025). Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies. https://peerj.com/articles/cs-2694/
  18. Si, Y. et al. (2025). Quality safety and disparity of an AI chatbot. PMC.
  19. Pan et al. (2026). Political censorship in large language models originating from China. PNAS Nexus.