GLM (Zhipu AI) (KO)
GLM (General Language Model) — 대형 언어 모델(Large Language Model, LLM) 패밀리로, Zhipu AI(2025년부터 Z.ai) 기업과 베이징 칭화대학교 컴퓨터과학부 산하 Knowledge Engineering Group(KEG) 연구실이 공동 개발하였다. 이 시리즈는 60억에서 7,440억 개의 파라미터를 갖는 모델들을 포괄하며, 주로 중국어와 영어를 대상으로 한다. 아키텍처 기반의 핵심적인 특징은 자기회귀적 빈칸 채우기(autoregressive blank infilling)에 기반한 사전학습 목적 함수로, 인코더 트랜스포머와 디코더 트랜스포머의 특성을 하나의 통합된 방식으로 결합한다.[1][2][3]
이 시리즈는 기본 사전학습 모델, 대화형 변형(ChatGLM), 멀티모달 확장(GLM‑4V, CogVLM), 전문화 도구(코드 생성을 위한 CodeGeeX, 웹 검색을 위한 WebGLM), 그리고 에이전트 시스템(GLM‑4 All Tools, AutoGLM)을 포함한다. 패밀리의 발전은 GLM‑10B(2021)와 GLM‑130B(2022)부터 GLM‑4(2024), GLM‑4.5(2025), GLM‑5(2026)까지 이어지며, 밀집(dense) 아키텍처에서 Mixture‑of‑Experts(MoE)로의 전환과 에이전트 시나리오에 대한 강조가 특징이다.[2][4]
역사 및 배경
기관적 맥락
Zhipu AI는 2019년 그래프 지식 분야를 전문으로 하는 KEG 연구실을 기반으로 칭화대학교 교수 탕제(Tang Jie)와 리쥐안쯔(Li Juanzi)가 설립하였다. 2020년에 회사는 대규모 언어 모델에 역량을 집중하였다. 2023년에는 Alibaba Group, Tencent, Ant Group, Meituan, Xiaomi가 참여한 가운데 25억 위안(약 3억 5,000만 달러)의 투자를 유치하였다. 2025년 7월에 회사는 공개 브랜드를 Z.ai로 변경하였으며, 2026년 1월에는 홍콩증권거래소에서 기업공개(IPO)를 실시하였다.[5][6]
창시적 연구: GLM(2021–2022)
기본 프리프린트 「GLM: General Language Model Pretraining with Autoregressive Blank Infilling」은 2021년 3월 arXiv에 게재되었으며(arXiv:2103.10360), ACL 2022에 채택되었다. 저자는 Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang이다. 이 연구는 기존 아키텍처 패러다임의 한계에서 동기를 얻었다. 인코더 모델(BERT)은 자연어 이해(Natural Language Understanding, NLU) 과제에 최적화되어 있고, 디코더 모델(GPT)은 생성에 최적화되어 있으며, 인코더-디코더 모델(T5)은 더 많은 파라미터를 필요로 한다. GLM은 두 가지 유형의 과제를 모두 해결할 수 있는 통합 접근법을 제안하였다.[1][7]
주요 출시 연표
| 연도 | 모델 | 주요 특징 |
|---|---|---|
| 2021 | GLM(기본), GLM‑10B | 자기회귀적 빈칸 채우기, 2D 위치 인코딩; 파라미터 최대 515M(기본) 및 10B |
| 2022 | GLM‑130B | 1,300억 개 파라미터, 이중 언어(중국어/영어), 공개 가중치, 추가 파인튜닝 없는 INT4 양자화; ICLR 2023 채택 |
| 2023년 3월 | ChatGLM‑6B(v1) | 62억 개 파라미터, 약 1조 토큰 사전학습, SFT + RLHF 정렬, INT4 양자화(약 6GB 메모리) |
| 2023년 6월 | ChatGLM2‑6B | 1.4조 토큰, FlashAttention, Multi‑Query Attention(MQA), 최대 32K 토큰 컨텍스트 |
| 2023년 10월 | ChatGLM3‑6B | 향상된 명령어 수행, 도구 호출(tool calling) 지원, Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | 약 10조 토큰 사전학습, RoPE + GQA, 최대 128K / 1M 토큰 컨텍스트; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | 시각 인코더를 갖춘 멀티모달 버전 |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | MoE 아키텍처(GLM‑4.5), 추론 및 코딩의 순차적 개선 |
| 2025 | GLM‑4.1V‑Thinking | 강화된 다단계 추론을 갖춘 시각-언어 모델(arXiv:2507.01006) |
| 2026년 2월 | GLM‑5 | 7,440억 개 파라미터(MoE), 약 400~440억 개 활성, 200K 토큰 컨텍스트, 에이전트 과제; Huawei Ascend에서 학습 |
GLM 패밀리는 Zhipu AI의 관련 모델들과 연계하여 발전하고 있다: 코드 모델 CodeGeeX, 시각-언어 모델 CogVLM / CogAgent, 생성 모델 CogView, 그리고 전문화 시스템 WebGLM 및 AgentLM이 여기에 포함된다.[2]
이론적 및 아키텍처적 기반
사전학습 목적 함수
GLM의 기본 아키텍처는 Transformer를 기반으로 한다. 핵심적인 특징은 autoregressive blank infilling으로, 이는 자기회귀적 모델링의 변형으로 모델이 문맥을 바탕으로 텍스트의 빈칸(span)을 복원하는 방법을 학습하는 것이다.[1][7]
을 입력 시퀀스라 하자. 연속적인 구간(span) 를 무작위로 선택하여 단일 토큰 [MASK]로 대체함으로써 손상된 텍스트 를 형성한다. 모델은 무작위 순열 순서로 각 구간을 자기회귀적으로 복원한다:
여기서 는 마스킹된 구간이 있는 손상된 시퀀스이고, 은 현재 구간 에서 이미 복원된 토큰이며, 은 이전에 완전히 복원된 구간이다. 구간 복원 순서는 집합 에서의 무작위 순열로 정해지며, 이를 통해 모델은 구간 간의 의존성을 처리할 수 있다.[1]
과제 조절을 위해: 짧은 빈칸(약 15% 토큰)의 경우 모델은 NLU에 최적화되고, 긴 구간(최대 50~100% 토큰)의 경우 생성 과제에 최적화된다. 이를 통해 단일 모델이 다중 과제 사전학습(multi‑task learning)을 통해 두 가지 모드를 모두 커버할 수 있다.[1][7]
2D 위치 인코딩
GLM은 원본 손상 시퀀스에서의 위치와 복원되는 구간 내부의 위치를 구분하기 위해 2차원 위치 인코딩을 도입한다:[1]
- 첫 번째 차원 : 손상된 시퀀스에서 토큰(또는 마스크)의 절대적 위치.
- 두 번째 차원 : 자기회귀적 생성 시 구간 내부에서 토큰의 위치(원본 토큰의 경우 0).
이 방식은 인코더에 유사한 추가적인 아키텍처 요소 없이도 문맥과 생성된 텍스트를 올바르게 구분할 수 있게 해준다.
어텐션 마스크
GLM에서는 이중 구조의 어텐션 마스크가 적용된다: 마스킹되지 않은 토큰에 대한 양방향(bidirectional) 어텐션(Part A — 문맥)과 구간 내부 토큰에 대한 인과적(causal) 어텐션(Part B — 복원되는 span)이 사용된다. 이는 복원 부분의 자기회귀적 생성 시 원본 텍스트에 대한 완전한 문맥 이해를 보장한다. BERT(독립적인 마스크 예측)와 달리 GLM은 span 간의 의존성을 고려하며, GPT와 달리 Part A의 양방향 문맥을 활용하고, T5와 달리 별도의 인코더를 필요로 하지 않는다.[1][7]
아키텍처 구성요소의 발전
Transformer 블록의 파라미터 수준에서, GLM‑4부터 레이어에서의 숨겨진 상태 는 다음과 같이 업데이트된다:
여기서 GQA는 Grouped‑Query Attention(완전한 Multi‑Head Attention 대신)이고, FFN은 SwiGLU를 통해 구현된다.[2]
GLM‑130B부터 시리즈 전반에 걸쳐 다음과 같은 아키텍처 구성요소가 사용된다:
- GLM‑130B: 깊은 네트워크 학습 안정화를 위한 DeepNorm; 2D 확장을 갖춘 Rotary Positional Encoding(RoPE); GeLU 활성화 함수를 사용하는 Gated Linear Units(GLU)(GeGLU).[8]
- GLM‑4: RMSNorm 및 SwiGLU로의 전환; KV 캐시 감소를 위해 Multi‑Head Attention(MHA) 대신 Group Query Attention(GQA) 적용; attention의 Q/K/V를 제외한 모든 bias 항 제거; GQA 적용 시 파라미터 수 유지를 위해 FFN 크기를 로 증대.[2]
- GLM‑4.5: loss‑free balance routing과 sigmoid gate를 적용한 Mixture‑of‑Experts(MoE); 하이브리드 추론 모드(thinking / non‑thinking).[3]
- GLM‑5: 200K 토큰까지의 긴 컨텍스트를 효율적으로 처리하기 위한 DeepSeek Sparse Attention(DSA); 투기적 디코딩을 위한 Multi‑Token Prediction(MTP); MindSpore를 사용하는 Huawei Ascend 프로세서에서의 완전한 학습.[4]
스케일링 및 스케일링 법칙
ChatGLM 라인업 개발 과정에서 사전학습 손실과 과제 성능 간의 경험적 의존성이 연구되었으며, 여기에는 '창발적 능력(emergent abilities)' 현상도 포함된다. 고정된 사전학습 손실 수준에서 서로 다른 크기(및 토큰 수)의 모델이 유사한 성능을 보이며, 일부 과제(MMLU, GSM8K)에서는 특정 사전학습 손실 임계값에 도달한 이후에야 무작위 수준을 초과하는 성능이 나타나기 시작하는 것으로 확인되었다.[2]
GLM 시리즈의 아키텍처와 모델
GLM‑10B 및 GLM‑130B
GLM‑10B(2021)는 100억 개 파라미터를 가진 모델로, blank infilling을 적용한 GLM 아키텍처의 적용 가능성을 입증하고 이후 스케일링의 기반이 되었다.[1]
GLM‑130B(2022)는 2022년 10월에 발표되었으며 ICLR 2023에 채택되었다(arXiv:2210.02414):[8]
- 파라미터 수: 약 1,300억 개(밀집 이중 언어 모델).
- 사전학습 규모: 4,000억 토큰 이상(약 2,000억 토큰은 중국어, 약 2,000억 토큰은 영어).
- 아키텍처: 70개 레이어, 숨겨진 크기 12,288, 96개 어텐션 헤드; DeepNorm, RoPE, GeGLU; 추가적인 다중 과제 학습(Multi‑Task Instruction Pretraining, MIP) — NLU/NLG 과제 74개 데이터셋에서 약 5% 토큰.
- 양자화: 양자화 후 추가 파인튜닝 없는 INT4(post‑training quantization) — 100B+ 모델 중 이 방식의 최초 문서화된 결과; 4×RTX 3090(24GB) 또는 8×RTX 2080 Ti(11GB)에서 추론 가능.
- 학습 안정성: 저자들은 수많은 손실 급등(loss spike)을 기록하고 적용된 안정화 전략(그래디언트 클리핑, Embedding Gradient Shrink)을 설명한다.
발표 당시 GLM‑130B는 다양한 영어 벤치마크(총 112개 과제)에서 GPT‑3 175B(davinci)를, 중국어 과제에서 ERNIE TITAN 3.0 260B를 능가하였다. 다만 OPT‑175B 및 BLOOM‑176B에 대한 우위는 재현되지 않았으며, 저자들은 이 한계를 명시적으로 언급하고 있다. HELM(2022년 11월) 평가에 따르면 GLM‑130B는 일부 지표에서 GPT‑3과 비슷한 수준이다.[8][2]
ChatGLM‑6B/2/3 패밀리
ChatGLM‑6B(2023년 3월)는 62억 개 파라미터를 가진 대화형 모델로, KEG와 Zhipu AI가 공동으로 개발하여 오픈 프로젝트로 공개하였다:[2][9]
- 약 1조 토큰(중국어 + 영어)으로 사전학습, 컨텍스트 2K.
- 대화에 초점을 맞추었으며, 초기 정렬은 주로 SFT와 RLHF로 수행됨.
- INT4 양자화로 약 6GB 메모리를 소비하여 소비자용 하드웨어에서 로컬 실행이 가능하였다.
ChatGLM2‑6B(2023년 6월):[2]
- 사전학습 규모를 1.4조 토큰으로 확대.
- FlashAttention 및 Multi‑Query Attention(MQA) 도입; 컨텍스트가 32K 토큰으로 확장됨.
- 벤치마크에서 현저한 향상: ChatGLM‑6B 대비 MMLU +23포인트, GSM8K +571%, BBH +60%.
ChatGLM3‑6B(2023년 10월):[2]
- 의미론, 수학, 추론, 코드, 지식 영역의 42개 벤치마크에서 추가적인 성능 향상.
- function call, 내장 Code Interpreter, AgentTuning / AgentLM을 통한 에이전트 과제의 기본 지원.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B 및 GLM‑4 All Tools
기술 보고서(arXiv:2406.12793)는 GLM‑4를 주로 중국어와 영어(및 24개 추가 언어)로 구성된 약 10조 토큰으로 사전학습하고 중국어와 영어에 맞게 정렬된 모델 패밀리로 설명한다.[2]
주요 변형 모델:
- GLM‑4(플래그십 모델, 버전 0116 및 0520): 밀집 트랜스포머, 숨겨진 크기 6,144, 61개 레이어, 48개 어텐션 헤드, 128K 컨텍스트.
- GLM‑4‑Air — 더 작고 빠른 모델로, 더 낮은 지연 시간에서 GLM‑4‑0116에 근접한 품질.
- GLM‑4‑9B — 90억 개 파라미터 모델(컨텍스트 8K, 128K 및 실험적 1M 변형), 동일한 사후 학습 파이프라인 적용.
- GLM‑4 All Tools — 도구 사용에 추가적으로 정렬된 버전: 웹 브라우저, Python 인터프리터, 이미지 생성(CogView3), 사용자 정의 함수.
GLM‑4의 아키텍처 특징:[2]
- attention의 Q/K/V를 제외한 bias 항 없음.
- RMSNorm 및 SwiGLU.
- 2D‑RoPE.
- 확대된 FFN을 갖춘 Group Query Attention(GQA).
- 중국어 및 다국어 코퍼스에 대해 별도로 학습된 BPE 어휘를 cl100k_base와 결합하여 얻은 150K 토큰 크기의 바이트 BPE 토크나이저.
GLM‑4.5(ARC 기반 모델)
GLM‑4.5는 에이전트, 추론 및 코딩 과제(Agentic, Reasoning, Coding — ARC)에 중점을 둔 오픈 Mixture‑of‑Experts(MoE) 모델이다:[3]
- 총 3,550억 개 파라미터, 320억 개 활성 파라미터(sparse 활성화 MoE 아키텍처): 89개 레이어, 160명의 전문가, 토큰당 8명 활성; 96개 어텐션 헤드, 숨겨진 크기 5,120.
- GLM‑4.5‑Air: 총 1,060억 개 / 120억 개 활성 파라미터 — 효율적인 변형.
- 전문가 모델 반복 및 RLHF를 포함하는 다단계 사후 학습으로 23조 토큰 학습.
- 하이브리드 추론 모드(thinking 모드와 직접 응답): 전자는 모델이 확장된 추론 추적을 생성하고, 후자는 직접 응답한다. 전환은 추론 파이프라인 수준에서 제어된다.
- 전문가 라우팅을 위한 sigmoid gate를 갖춘 loss‑free balance routing.
- Muon 옵티마이저; deeper‑and‑narrower 설계.
GLM‑4.6 / GLM‑4.7
GLM‑4.6 / 4.7 시리즈(2025년 9~12월)는 GLM‑4.5의 아이디어를 발전시켜 프로그래밍(SWE‑bench Verified / 다국어), 복잡한 추론(Humanity's Last Exam, AIME) 및 에이전트 과제를 강화한다. GLM‑4.7은 SWE‑bench Verified에서 73.8%를 달성하고, 대화에서 추론을 통합하는 세 가지 모드인 Interleaved / Preserved / Turn‑level Thinking을 도입한다. 일부 구성은 오픈 가중치 모델로 공개되었다.[3][10]
GLM‑5
기술 보고서는 2026년 2월 21일에 게재되었다(arXiv:2602.15763). 주요 특성:[4]
- 아키텍처: 총 약 7,440~7,450억 개 파라미터를 갖는 Mixture‑of‑Experts, 256명의 전문가, 각 토큰당 8명 활성화(약 400~440억 개 활성 파라미터, 약 5.9% 밀도); 75개 MoE 레이어 + 3개 밀집 레이어.
- 사전학습: 28.5조 토큰.
- 컨텍스트 창: 200K 토큰.
- Dynamic Sparse Attention(DSA): 긴 컨텍스트에서 품질을 유지하면서 학습 및 추론 비용을 절감하는 희소 어텐션 메커니즘.
- Multi‑Token Prediction(MTP): 추론 시 투기적 디코딩을 위한 기술.
- 기술 인프라: 미국 제조 GPU 장비에 대한 의존 없이 MindSpore 프레임워크를 사용하는 Huawei Ascend 프로세서에서 완전히 학습됨.
- 사후 학습: 생성과 학습의 분리(decoupling inference / training)를 적용한 비동기 강화 학습(RL) 인프라; 장기 계획 상호작용을 위한 에이전트 RL 알고리즘 적용; 장기 계획 에이전트 과제를 위한 Token‑in‑Token‑out(TITO) 및 계층적 컨텍스트 관리.
- 라이선스: MIT 라이선스 하의 오픈 가중치.
시리즈 모델 종합 표
| 모델 | 연도 | 파라미터(전체 / 활성) | 사전학습 토큰 수 | 컨텍스트 | 주요 특징 |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 1,300억 / — | 약 4,000억 | 2K | 밀집, 이중 언어, DeepNorm, INT4 양자화 |
| ChatGLM‑6B | 2023 | 62억 / — | 약 1조 | 2K | 대화형, SFT + RLHF, INT4(약 6GB) |
| ChatGLM2‑6B | 2023 | 62억 / — | 1.4조 | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 62억 / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | 미공개(API) | 약 10조 | 128K–1M | All Tools, 멀티모달(V) |
| GLM‑4‑9B | 2024 | 약 90억 / — | 약 10조 | 128K–1M | 오픈 버전, GQA |
| GLM‑4.5 | 2025 | 3,550억 / 320억 | 23조 | 128K | MoE, 하이브리드 추론, ARC 중점 |
| GLM‑4.5‑Air | 2025 | 1,060억 / 120억 | 23조 | 128K | 효율적인 MoE 변형 |
| GLM‑4.7 | 2025 | — | — | 128K | 향상된 코딩, Interleaved Thinking |
| GLM‑5 | 2026 | 7,440억 / 약 400억 | 28.5조 | 200K | DSA, MTP, 에이전트 엔지니어링, Huawei Ascend |
멀티모달 및 전문화 확장
- GLM‑4V‑9B — 이미지 및 문서 처리를 위한 시각 인코더를 갖춘 멀티모달 버전.[2]
- GLM‑4.1V‑Thinking — 강화된 다단계 추론을 갖춘 시각-언어 모델(arXiv:2507.01006).[11]
- GLM‑4‑Voice — 엔드투엔드 음성 모델(9B 기본, 약 1조 음성-텍스트 토큰, 175비트/초 토크나이저).[12]
- CodeGeeX — 여러 언어에서의 코드 생성, 보완 및 리팩토링을 위한 코드 모델 패밀리(CodeGeeX‑13B, CodeGeeX2‑6B); IDE 플러그인에 내장됨.[2]
- CogVLM / CogAgent — 이미지 이해 및 GUI 자율 탐색을 위한 시각-언어 모델.[2]
- WebGLM — 웹 지향 검색 및 QA를 위한 모델; 약 100억 파라미터 모델이 일부 과제에서 WebGPT‑175B에 근접한 성능을 보이는 것으로 나타났다(KDD 2023).[2]
학습, 데이터 및 보조 기술
사전학습 데이터
GLM‑4 및 이전 모델들의 사전학습 코퍼스에는 다음이 포함된다:[2]
- 다국어(주로 중국어와 영어) 웹 페이지, 위키피디아, 도서, 코드 및 학술 논문.
- 3단계 처리 파이프라인: 중복 제거(정확 및 퍼지), 필터링(노이즈 및 잠재적으로 위험한 텍스트 제거), 토크나이징.
- 중국어 및 다국어 코퍼스에 대해 별도로 학습된 BPE 어휘를 cl100k_base(tiktoken)와 결합하여 얻은 150K 토큰 크기의 통합 어휘.
데이터 품질과 다양성의 중요성이 경험적으로 확인되었지만, 발표된 경험적 패턴을 넘어서는 데이터 선택의 명확한 근본적 기준은 저자들이 제시하지 않는다.[2]
컨텍스트 확장 및 LongAlign
컨텍스트 창은 ChatGLM‑6B의 2K에서 ChatGLM2/3의 32K로, 이후 GLM‑4에서 128K 및 1M 토큰으로, 그리고 GLM‑5에서 200K로 순차적으로 확대된다. 위치 인코딩 확장(RoPE 기반 주파수 스케일링 방법)과 긴 텍스트에 대한 추가 파인튜닝의 조합이 사용된다. 특별한 정렬 레시피인 LongAlign은 긴 입력에서의 품질을 유지할 수 있게 해준다. LongBench‑Chat에서 GLM‑4(0520)는 영어 부분에서 87.3을 달성하여(GPT‑4 Turbo 1106: 87.2, Claude 3 Opus: 87.7과 비슷), 중국어 부분에서는 84.0을 달성하여 GPT‑4 Turbo와 Claude 3 Opus를 능가하였다.[2]
사후 학습 및 정렬(SFT, RLHF)
사후 학습은 두 가지 주요 단계로 구성된다:[2]
- Supervised Fine‑Tuning(SFT): 템플릿 방식이나 생성된 것이 아닌 실제(사람이 작성한) 상호작용에 중점을 둔 「요청-응답」 쌍으로 학습.
- Reinforcement Learning from Human Feedback(RLHF): PPO, DPO 및 자체 방식(특히 ChatGLM‑RLHF와 Self‑Contrast — 부정적 예시를 모델 자체가 생성하여 선호 데이터 필요성을 줄임)을 통해 주석자의 선호도에 따라 최적화.
응답 평가를 위한 특징 벡터에는 안전성, 사실성, 관련성, 유용성 및 선호도 일치 지표가 포함된다. 저자들은 RLHF가 거절 빈도를 줄이고, 안전성을 높이며, 다회전 대화에서의 일관성을 향상시킨다고 언급한다.[2]
GLM 생태계의 전문화 기술
- LongAlign — 최대 128K의 긴 컨텍스트 정렬 레시피.[2]
- ChatGLM‑Math — 외부 모델 없이 자기 비평(self‑critique) 방식을 통한 수학 문제 해결 능력 향상.[2]
- Self‑Contrast — 부정적 예시를 모델 자체가 생성하는 RLHF 방식.[2]
- AgentTuning / AgentInstruct — 환경과의 에이전트 상호작용 궤적을 바탕으로 에이전트 기술을 학습하기 위한 프레임워크와 데이터셋.[2]
- APAR(Auto‑Parallel Auto‑Regressive) — 추론 가속화를 위한 자동 병렬 자기회귀 생성 알고리즘.[2]
또한 다음과 같은 벤치마크들도 개발되었다: AgentBench(에이전트 과제), LongBench(긴 컨텍스트), AlignBench(중국어 정렬), HumanEval‑X(Python 이외의 코드), NaturalCodeBench(실용적인 프로그래밍 과제).[2]
주요 결과 및 벤치마크
모든 지표는 조건(zero‑/few‑shot, 데이터셋, 모델 버전)을 명시하여 원본 기술 보고서에서 인용되었다. 비교는 기술 보고서 저자들에 의해 수행되었으며, 표준화된 플랫폼(LMSYS Chatbot Arena, Open LLM Leaderboard)에서의 독립적인 재현은 모든 버전에 대해 체계적으로 이루어지지 않았다.
성능 변화: ChatGLM‑6B → GLM‑4‑9B
| 벤치마크 | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K(%) | 1.5 | 25.9 | 72.3 | 84.0 |
| MMLU(%) | 25.2 | 45.2 | 61.4 | 74.7 |
| HumanEval(%) | 0.0 | 9.8 | 58.5 | 70.1 |
| C‑Eval(%, 중국어) | 23.7 | 51.7 | 69.0 | 77.1 |
모든 모델은 동일한 설정으로 BF16에서 평가됨.[2]
학술 벤치마크에서의 GLM‑4
| 벤치마크 | GLM‑4(0520) | GPT‑4(0314) | GPT‑4 Turbo(2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU(%) | 83.3 | 86.4 | 86.7 | 86.8 |
| GSM8K(%) | 93.3 | 92.0 | 95.6 | 95.0 |
| MATH(%) | 61.3 | 52.9 | 73.4 | 60.1 |
| BBH(%) | 84.7 | 83.1 | 88.2 | 86.8 |
| GPQA(%) | 39.9 | 35.7 | 49.3 | 50.4 |
| HumanEval(%) | 78.5 | 67.0 | 88.2 | 84.9 |
GLM‑4(0520)는 MMLU에서 GPT‑4 결과의 약 96.3%를 달성하며, MATH와 GSM8K에서 GPT‑4(0314)를 능가하지만 MATH와 HumanEval에서는 GPT‑4 Turbo에 뒤처진다.[2]
AlignBench v1.1(중국어 정렬)에서 GLM‑4(0520)는 GPT‑4 Turbo의 7.90, Claude 3 Opus의 7.53 대비 종합 점수 8.00을 기록하며 「논리」, 「언어」, 「전문성」 하위 지표에서 뚜렷한 우위를 보인다.[2]
AgentBench에서 GLM‑4(0520)는 GPT‑4 Turbo(1106) 및 Claude 3 Opus와 비슷하거나 약간 높은 3.79의 종합 점수를 달성한다. Database, House‑Holding, Web‑Shopping 과제에서 높은 점수를 보이며, Operating System 및 Lateral Thinking Puzzles 과제에서는 뒤처진다.[2]
Berkeley Function Call Leaderboard에서 GLM‑4(0520)는 81.76%를 달성하며(GPT‑4 Turbo: 81.24%), GLM‑4‑9B‑Chat은 Llama‑3‑8B‑Instruct를 크게 능가한다(81.00% 대 58.88%).[2]
GLM‑4.5
| 벤치마크 | GLM‑4.5 | 비고 |
|---|---|---|
| TAU‑Bench(에이전트 평균) | 70.1% | 에이전트 과제 |
| AIME 2024 | 91.0% | 수학 경시대회 |
| SWE‑bench Verified | 64.2% | 실제 저장소 과제 해결 |
| GPQA(Avg@8) | 79.1% | 대학원 수준 질문 |
| MATH‑500 | 98.2% | 수학 |
| MMLU‑Pro | 84.6% | 확장 MMLU |
더 적은 수의 활성 파라미터를 고려할 때, GLM‑4.5는 보고서 발표 당시 기준으로 12개 벤치마크의 종합 순위에서 모든 평가된 모델 중 3위, 에이전트 벤치마크에서 2위를 차지하였다.[3]
GLM‑4.7
- SWE‑bench Verified: 73.8%(GLM‑4.5 대비 +5.8포인트).
- Terminal‑Bench 2.0: 41.0%(+16.5포인트).
- Humanity's Last Exam(도구 사용): 42.8%.[10]
GLM‑5
| 벤치마크 | GLM‑5 | 비고 |
|---|---|---|
| SWE‑bench Verified | 77.8% | 발표 당시 오픈 가중치 모델 중 선두 |
| GPQA‑Diamond | 86.0% | 대학원 수준 질문 |
| Terminal‑Bench 2.0 | 56.2–61.1% | 엔지니어링 과제 |
| Humanity's Last Exam(도구 사용) | 50.4% | 복잡한 학제간 질문 |
| BrowseComp | 62.0% | 웹 탐색 |
GLM‑5는 GLM‑4.7 대비 평균 약 20% 향상을 보이며, 일부 에이전트 및 코드 벤치마크에서 Claude Opus 4.5 수준의 비공개 모델에 비견되는 오픈 가중치 모델 위치를 차지한다.[4]
안전성(SafetyBench)
SafetyBench(중국어 하위 샘플)에서 GLM‑4(0520)는 종합 지표에서 87.2%를 달성하였는데, 이는 Claude 3 Opus(87.5%)와 비슷하고 GPT‑4(약 88~89.7%)보다 약간 낮다. GPT‑4와의 가장 눈에 띄는 차이는 「신체 건강(Physical Health)」 측정 항목에서 나타난다.[2]
적용 분야 및 생태계
대화형 및 어시스턴트 시나리오
ChatGLM 시리즈 및 이후 모델들은 다국어 소통, 다회전 대화 및 명령어 수행 모드를 지원하는 상업적 서비스 Zhipu Qingyan(chatglm.cn / chat.z.ai)을 포함한 대화형 어시스턴트로 사용된다.[2]
에이전트 시스템 및 도구
GLM‑4 All Tools 및 이후 모델들은 사용자 정의 에이전트 생성, 내장 Python 인터프리터, 웹 브라우저, VLM/T2I 모델(CogView3) 연결 및 외부 API 사용이 가능한 에이전트 플랫폼 GLMs에 통합된다. 웹 검색, Python을 통한 데이터 분석, 복합 도구 체인 등의 복합 과제가 지원된다. GLM‑5는 장기 계획을 갖춘 프로그래밍 엔지니어링 과제(에이전트 엔지니어링)에 집중하며 MCP‑Atlas 및 BrowseComp 벤치마크에서 테스트되었다.[2][4]
코드 생성 및 소프트웨어 개발
CodeGeeX 패밀리(CodeGeeX‑13B, CodeGeeX2‑6B)와 GLM의 코드 모드는 여러 언어에서의 코드 생성, 보완 및 리팩토링, HumanEval 및 HumanEval‑X 과제 해결에 사용된다. HumanEval‑X에서 CodeGeeX2‑6B는 CodeGeeX‑13B 대비 Pass@1을 향상시킨다(저자 발표 기준: Python에서 +57%, C++에서 +71%). CodeGeeX 제품은 개발자용 IDE 플러그인에 내장되어 있다.[2]
긴 컨텍스트 및 문서 중심 시나리오
GLM‑4‑9B‑Chat‑1M 및 상위 모델들은 대형 문서 및 컬렉션(최대 1M 토큰)의 분석, 요약, 긴 문서 검색, 긴 코드 작업에 활용된다.[2]
배포 인프라
모델은 Z.ai / bigmodel.cn API 플랫폼(tool calling, 에이전트 프레임워크)을 통해 이용 가능하다. 오픈 버전은 vLLM, SGLang을 통한 로컬 배포를 지원한다. Huawei Ascend 지원으로 NVIDIA 장비 없이도 배포가 가능하다. 시리즈의 오픈 모델은 Hugging Face에서 1,000만 회 이상 다운로드되었다(2023~2024년).[2][4][13]
한계 및 미해결 문제
- 언어 불균형: GLM 시리즈는 주로 중국어와 영어로 사전학습되었으며, 다른 언어에서의 품질은 현저히 낮다. 이 점은 기술 보고서 arXiv:2406.12793에 명시적으로 언급되어 있다.[2]
- 벤치마크 재현성: 대부분의 비교 결과는 개발자 자체 기술 보고서에 제시된 것이다. 표준화된 플랫폼(LMSYS Chatbot Arena, Open LLM Leaderboard)에서의 독립적인 외부 검증이 모든 버전에 대해 체계적으로 이루어지지 않았다.
- 스케일링 시 손실 급등: GLM‑130B 학습은 수많은 손실 급등을 동반하여 수동 개입이 필요하였으며, 저자들은 이를 스케일링 시 미해결된 엔지니어링 문제로 기록하고 있다.[8]
- 하드웨어 의존성: GLM‑5부터 학습이 Huawei Ascend / MindSpore로 이전되었으며, 다른 하드웨어 플랫폼에서의 독립적인 재현이 어렵다.[4]
- 정렬 및 안전성: RLHF 적용에도 불구하고 응답 거부, 다회전 대화에서의 일관성, 안전 메커니즘 우회 문제가 여전히 과제로 남아 있다. arXiv:2406.12793의 저자들은 RLHF가 도움이 되지만 문제를 완전히 해결하지는 못한다고 언급한다.[2]
- 환각: 다른 LLM과 마찬가지로 사실적 오류 문제가 문서화되어 있으며, 정량적 평가는 과제와 방법론에 따라 다양하다.
- 수학적 추론: GLM‑4는 MATH 및 일부 복잡한 산술 과제에서 GPT‑4 Turbo에 뒤처지는데, 전문화된 방법론(ChatGLM‑Math)을 사용함에도 불구하고 그렇다.[2]
- 에이전트 과제: AgentBench에서 저수준 운영 체제 상호작용 및 복잡한 논리 퍼즐과 관련된 과제에서 격차가 남아 있으며, 장기 계획(long‑horizon) 품질은 연쇄 과제에서 오류 누적으로 인해 미해결 과제로 남아 있다.[2][4]
- 코드 및 실용적 과제: NaturalCodeBench에서 GLM‑4(종합 47.1%)는 GPT‑4 Turbo(53.8%)보다 낮지만 Claude 3 Opus(48.3%)와는 비슷한 수준이다.[2]
윤리적 및 규제적 측면
GLM 시리즈는 생성형 모델 등록 및 안전성 평가에 관한 중국 규제 기관(중국 국가인터넷정보판공실, CAC)의 요구사항에 따라 개발되었다. 사후 학습에는 독성 및 유해 콘텐츠를 줄이기 위한 SFT와 RLHF가 포함된다.[2]
GLM‑4 기술 보고서는 다단계 위험 관리 프로세스를 설명한다:[2]
- 잠재적으로 위험한 내용이 포함된 텍스트를 사전학습 코퍼스에서 사전 제거.
- 안전성 기준에 따른 정렬 데이터 필터링.
- Red‑team 테스트: 파인튜닝을 위한 복잡한 악의적 요청 생성.
- 안전성의 정량적 평가를 위해 SafetyBench 활용(7가지 측정 항목).
초기 모델(GLM‑130B)은 이중 언어 학습 덕분에 CrowS‑Pairs에서 GPT‑3 및 OPT 대비 낮은 편향 수준, RealToxicPrompts에서 낮은 독성을 보인다.[8][2]
MIT 라이선스 하에 GLM‑5를 공개한다는 것은 오픈 가중치의 상업적 이용에 대한 공식적인 제한이 없음을 의미하며, 이는 오픈 LLM에 일반적인 통제되지 않은 사용의 표준적 위험을 수반한다.[4] 중국어 및 문화적 맥락에 특화된 사전학습 코퍼스의 편향 문제는 본 글 작성 시점에 공개된 연구에서 체계적으로 조사되지 않았다.
전망 및 연구 방향
Z.ai의 발표된 기술 보고서 및 관련 자료에 기반하여 다음과 같은 선언된 방향들이 도출된다:[3][4]
- 토큰당 활성 파라미터 비용을 줄이면서 MoE 아키텍처의 스케일링.
- 장기 계획 과제를 위한 비동기 에이전트 RL 알고리즘 개발.
- 200K 토큰을 초과하는 컨텍스트를 위한 희소 어텐션 메커니즘(DSA) 개선.
- 멀티모달 추론: 비디오 및 문서 이해 방향으로의 GLM‑4.1V‑Thinking 발전.
- 실제 상호작용으로 최종 에이전트를 학습하여 에이전트 과제 수행 시 외부 API 의존도 감소.
- 국내(중국) 하드웨어(Huawei Ascend, Cambricon)에 대한 최적화 및 학습의 탄소 발자국 감소.
- 로보틱스 및 과학 컴퓨팅 플랫폼과의 통합.
같이 보기
- Transformer 아키텍처
- BERT
- GPT
- T5
- Decoder‑only 아키텍처
- Reinforcement Learning from Human Feedback
- DeepSeek
참고 문헌
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
각주
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)