GLM (Zhipu AI) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

GLM (General Language Model) — isang pamilya ng malalaking modelo ng wika (Large Language Model, LLM), na binuo ng kumpanyang Zhipu AI (mula 2025 — Z.ai) kasama ang laboratoryo ng Knowledge Engineering Group (KEG) ng kagawaran ng agham ng kompyuter ng Unibersidad ng Tsinghua (Beijing). Sinasaklaw ng serye ang mga modelo mula 6 hanggang 744 bilyong parameter, na nakatuon pangunahin sa Chinese at Ingles na wika. Ang natatanging katangian ng arkitekturang pundasyon ay ang layunin ng pag-aaral (pretraining objective) batay sa autoregressive blank infilling, na pinagsama ang mga katangian ng encoder at decoder transformer sa iisang pinag-isang pamamaraan.[1][2][3]

Kasama sa serye ang mga batayang pre-trained na modelo, mga variant ng diyalogo (ChatGLM), mga multimodal na extension (GLM‑4V, CogVLM), mga espesyalisadong kasangkapan (CodeGeeX para sa pagbuo ng code, WebGLM para sa web search) at mga ahenteng sistema (GLM‑4 All Tools, AutoGLM). Ang ebolusyon ng pamilya ay masusubaybayan mula sa GLM‑10B (2021) at GLM‑130B (2022) hanggang sa GLM‑4 (2024), GLM‑4.5 (2025) at GLM‑5 (2026), na may paglipat mula sa mga dense na arkitektura patungo sa Mixture‑of‑Experts (MoE) at diin sa mga ahenteng senaryo.[2][4]

Kasaysayan at mga Paunang Kondisyon

Institusyonal na Konteksto

Itinayo ang Zhipu AI noong 2019 ng mga propesor ng Unibersidad ng Tsinghua na sina Tang Jie at Li Juanzi batay sa laboratoryo ng KEG, na dalubhasa sa mga graph ng kaalaman. Noong 2020, itinuon ng kumpanya ang mga pagsisikap nito sa malalaking modelo ng wika. Noong 2023, nakalikom ng 2.5 bilyong yuan na pamumuhunan (≈350 milyong dolyar ng US) na may pakikilahok ng Alibaba Group, Tencent, Ant Group, Meituan at Xiaomi. Noong Hulyo 2025, binago ng kumpanya ang pampublikong tatak nito sa Z.ai, at noong Enero 2026 ay nagsagawa ito ng IPO sa Hong Kong Stock Exchange.[5][6]

Seminal na Gawa: GLM (2021–2022)

Ang batayang preprint na «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» ay nailathala sa arXiv noong Marso 2021 (arXiv:2103.10360) at tinanggap sa kumperensya ng ACL 2022. Mga may-akda: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Ang gawa ay nagtatapos sa mga limitasyon ng mga umiiral na arkitekturang paradigma: ang mga encoder na modelo (BERT) ay pinakamabuti para sa mga gawain ng pag-unawa sa natural na wika (Natural Language Understanding, NLU), ang mga decoder (GPT) — para sa pagbuo, at ang encoder‑decoder (T5) ay nangangailangan ng mas malaking bilang ng mga parameter. Iminungkahi ng GLM ang isang pinag-isang pamamaraan na kayang harapin ang parehong klase ng mga gawain.[1][7]

Kronolohiya ng mga Pangunahing Paglalabas

Taon Modelo Mga Pangunahing Katangian
2021 GLM (batayang), GLM‑10B Autoregressive blank infilling, 2D positional encoding; mga parameter hanggang 515M (batayang) at 10B
2022 GLM‑130B 130B parameter, dalawahang wika (Chinese / Ingles), bukas na timbang, INT4 quantization nang walang karagdagang pag-aaral; tinanggap sa ICLR 2023
2023, Marso ChatGLM‑6B (v1) 6.2B parameter, ≈1T token ng pretraining, SFT + RLHF alignment, INT4 quantization (≈6 GB ng memorya)
2023, Hunyo ChatGLM2‑6B 1.4T token, FlashAttention, Multi‑Query Attention (MQA), konteksto hanggang 32K token
2023, Oktubre ChatGLM3‑6B Pinahusay na pagsunod sa mga instruksyon, suporta sa pagtawag ng kasangkapan (tool calling), Code Interpreter
2024 GLM‑4, GLM‑4‑Air, GLM‑4‑9B ≈10T token ng pretraining, RoPE + GQA, konteksto hanggang 128K / 1M token; GLM‑4 All Tools
2024 GLM‑4V‑9B Multimodal na bersyon na may visual encoder
2025 GLM‑4.5, GLM‑4.6, GLM‑4.7 MoE arkitektura (GLM‑4.5), sunud-sunod na pagpapabuti ng pag-iisip at pagkokodigo
2025 GLM‑4.1V‑Thinking Visual‑language na modelo na may pinahusay na multi-step reasoning (arXiv:2507.01006)
2026, Pebrero GLM‑5 744B parameter (MoE), ≈40–44B aktibo, 200K‑token na konteksto, mga ahenteng gawain; pagsasanay sa Huawei Ascend

[1][2][3][4][8]

Ang pamilya ng GLM ay umuunlad nang magkasabay sa mga kasamang modelo ng Zhipu AI: mga code na modelo ng CodeGeeX, mga visual‑language na modelo ng CogVLM / CogAgent, mga generative na modelo ng CogView, pati na rin ang mga espesyalisadong sistema ng WebGLM at AgentLM.[2]

Teoretikal at Arkitekturang Pundasyon

Layunin ng Pretraining

Ang batayang arkitektura ng GLM ay nakabatay sa Transformer. Ang pangunahing natatanging katangian ay ang autoregressive blank infilling — isang variant ng autoregressive modeling kung saan natututo ang modelo na ibalik ang mga nawawalang bahagi (spans) ng teksto batay sa konteksto.[1][7]

Kunin natin na ang x=[x1,,xn] ay ang input na sequence. Ang mga random na piniling magkadikit na fragment (spans) {s1,,sm} ay pinapalitan ng isang [MASK] token, na bumubuo ng nasirang teksto xcorrupt. Ang modelo ay autoregressive na nagpapanumbalik ng bawat fragment sa random na pagkakasunod-sunod ng permutasyon:

=i=1mj=1|si|logP(si,jxcorrupt,si,<j,s<i)

kung saan ang xcorrupt — ang nasirang sequence na may mga naka-mask na fragment, si,<j — ang mga token na naibalik na ng kasalukuyang fragment si, s<i — ang mga ganap na naibalik na naunang fragment. Ang pagkakasunod-sunod ng pagpapanumbalik ng mga fragment ay tinutukoy ng isang random na permutasyon mula sa hanay Zm, na nagbibigay-daan sa modelo na pangasiwaan ang mga dependency sa pagitan ng mga fragment.[1]

Para sa regulasyon ng gawain: sa maikli mga puwang (≈15% ng mga token) ang modelo ay ino-optimize para sa NLU, sa mahahabang fragment (hanggang 50–100% ng mga token) — para sa mga generative na gawain. Nagbibigay-daan ito sa iisang modelo na masaklaw ang parehong mode sa pamamagitan ng multi‑task learning.[1][7]

2D Positional Encoding

Ipinakilala ng GLM ang dalawang-dimensyonal na positional encoding upang maihiwalay ang mga posisyon sa orihinal na nasiraan sequence at ang mga posisyon sa loob ng mga fragment na inirerekonstrukto:[1]

  • Unang dimensyon pos1: ang ganap na posisyon ng token (o mask) sa nasiraan sequence.
  • Pangalawang dimensyon pos2: ang posisyon ng token sa loob ng sarili nitong fragment sa panahon ng autoregressive generation (0 para sa mga token ng orihinal).

Ang pamamaraang ito ay nagbibigay-daan na wastong maihiwalay ang konteksto at ang nabubuong teksto nang walang karagdagang arkitekturang elemento na katulad ng encoder.

Attention Mask

Sa GLM ay ginagamit ang dalawang-bahaging attention mask: bidirectional na atensyon para sa mga hindi naka-mask na token (Part A — konteksto) at causal na atensyon para sa mga token sa loob ng mga fragment (Part B — mga span na inirerekonstrukto). Tinitiyak nito ang buong-kontekstong pag-unawa sa orihinal na teksto sa panahon ng autoregressive generation ng mga inirerekonstruktong bahagi. Hindi tulad ng BERT (mga independyenteng hula ng mask) ang GLM ay isinasaalang-alang ang mga dependency sa pagitan ng mga span; hindi tulad ng GPT — gumagamit ng bidirectional na konteksto ng Part A; hindi tulad ng T5 — hindi nangangailangan ng hiwalay na encoder.[1][7]

Ebolusyon ng mga Arkitekturang Komponent

Sa antas ng mga parameter ng Transformer block, ang nakatagong estado hld sa layer l sa mga modelo simula sa GLM‑4 ay ina-update bilang:

h~l=hl+GQAl(RMSNorm(hl)),hl+1=h~l+FFNl(RMSNorm(h~l))

kung saan ang GQA — Grouped‑Query Attention (sa halip na buong Multi‑Head Attention), at ang FFN ay isinasagawa sa pamamagitan ng SwiGLU.[2]

Simula sa GLM‑130B at higit pa sa serye, ang mga sumusunod na arkitekturang komponent ay ginagamit:

  • GLM‑130B: DeepNorm para sa pag-stabilize ng pagsasanay ng malalim na network; Rotary Positional Encoding (RoPE) na may 2D extension; Gated Linear Units (GLU) na may GeLU activation (GeGLU).[8]
  • GLM‑4: paglipat sa RMSNorm at SwiGLU; Group Query Attention (GQA) sa halip na Multi‑Head Attention (MHA) upang mabawasan ang KV cache; inalis ang lahat ng bias term, maliban sa Q/K/V sa attention; pinapalaking laki ng FFN hanggang 103dhidden upang mapanatili ang bilang ng mga parameter sa GQA.[2]
  • GLM‑4.5: Mixture‑of‑Experts (MoE) na may loss‑free balance routing at sigmoid gates; hybrid na mode ng pag-iisip (thinking / non‑thinking).[3]
  • GLM‑5: DeepSeek Sparse Attention (DSA) para sa epektibong pagproseso ng mahabang konteksto hanggang 200K token; Multi‑Token Prediction (MTP) para sa speculative decoding; pagsasanay nang buo sa mga processor ng Huawei Ascend gamit ang MindSpore.[4]

Pag-scale at mga Batas ng Pag-scale

Sa panahon ng pagbuo ng linya ng ChatGLM, sinisiyasat ang mga empirical na dependency sa pagitan ng pretraining loss at kalidad sa mga gawain, kabilang ang penomenon ng «emergent abilities». Ipinakita na sa isang nakapirming antas ng pretraining loss, ang mga modelo ng iba't ibang laki (at bilang ng mga token) ay nagpapakita ng katulad na pagganap, at sa ilang mga gawain (MMLU, GSM8K) ang kalidad ay nagsisimulang malampasan ang antas ng pagkakataon lamang pagkatapos maabot ang isang tiyak na threshold ng pretraining loss.[2]

Mga Arkitektura at Modelo sa Serye ng GLM

GLM‑10B at GLM‑130B

GLM‑10B (2021) — isang 10-bilyong modelo na nagpapakita ng pagiging angkop ng arkitektura ng GLM na may blank infilling at nagsisilbing pundasyon para sa kasunod na pag-scale.[1]

GLM‑130B (2022) ay iprinisenta noong Oktubre 2022 at tinanggap sa ICLR 2023 (arXiv:2210.02414):[8]

  • Bilang ng mga parameter: ≈130 bilyon (isang dense na dalawang-wikang modelo).
  • Dami ng pretraining: mahigit 400 bilyong token (≈200 bilyon sa Chinese, ≈200 bilyon sa Ingles).
  • Arkitektura: 70 layer, hidden size 12 288, 96 attention head; DeepNorm, RoPE, GeGLU; karagdagang multi-task na pagsasanay (Multi‑Task Instruction Pretraining, MIP) — ≈5% ng mga token sa 74 dataset ng mga gawain sa NLU/NLG.
  • Quantization: INT4 nang walang karagdagang pagsasanay pagkatapos ng quantization (post‑training quantization) — ang unang dokumentadong resulta ng ganitong uri sa mga 100B+ na modelo; posible ang inference sa 4×RTX 3090 (24 GB) o 8×RTX 2080 Ti (11 GB).
  • Katatagan ng pagsasanay: ang mga may-akda ay nagdodokumento ng maraming mga tumaas na loss spike at naglalarawan ng mga estratehiya ng pag-stabilize na ginamit (gradient clipping, Embedding Gradient Shrink).

Noong oras ng paglalathala, ang GLM‑130B ay nakahigit sa GPT‑3 175B (davinci) sa isang malawak na hanay ng mga Ingles na benchmark (kabuuang 112 gawain) at ERNIE TITAN 3.0 260B sa mga gawaing Chinese; sa parehong oras ang kahigtan sa OPT‑175B at BLOOM‑176B ay hindi naiparami — malinaw na isinasaad ito ng mga may-akda bilang isang limitasyon. Ayon sa pagtatasa ng HELM (Nobyembre 2022) ang GLM‑130B ay maihahambing sa GPT‑3 sa ilang mga sukatan.[8][2]

Pamilya ng ChatGLM‑6B/2/3

ChatGLM‑6B (Marso 2023) — isang modelo ng diyalogo na may 6.2 bilyong parameter, na magkasamang binuo ng KEG at Zhipu AI, na inilathala bilang bukas na proyekto:[2][9]

  • Pretraining sa ≈1 trilyong token (Chinese + Ingles), konteksto 2K.
  • Nakatuon sa diyalogo; ang paunang alignment ay pangunahing isinasagawa ng SFT at RLHF.
  • INT4 quantization na may pagkonsumo ng ≈6 GB ng memorya, na nagbigay-daan sa lokal na pagpapatakbo sa consumer hardware.

ChatGLM2‑6B (Hunyo 2023):[2]

  • Nadagdagan ang dami ng pretraining hanggang 1.4 trilyong token.
  • Ipinakilala ang FlashAttention at Multi‑Query Attention (MQA); pinalawak ang konteksto hanggang 32K token.
  • Malaking pagtaas sa mga benchmark: MMLU +23 p.p., GSM8K +571%, BBH +60% kumpara sa ChatGLM‑6B.

ChatGLM3‑6B (Oktubre 2023):[2]

  • Karagdagang pagtaas sa 42 benchmark sa mga larangan ng semantics, matematika, reasoning, code at kaalaman.
  • Katutubong suporta sa function call, built-in Code Interpreter at mga ahenteng gawain sa pamamagitan ng AgentTuning / AgentLM.

GLM‑4, GLM‑4‑Air, GLM‑4‑9B at GLM‑4 All Tools

Ang teknikal na ulat (arXiv:2406.12793) ay naglalarawan ng GLM‑4 bilang isang pamilya ng mga modelo na pre-trained sa ≈10 trilyong token (pangunahin Chinese at Ingles, kasama ang 24 karagdagang wika) at aligned para sa Chinese at Ingles.[2]

Mga Pangunahing Variant:

  • GLM‑4 (flagship na modelo, mga bersyon 0116 at 0520): dense na transformer, hidden size 6144, 61 layer, 48 attention head, konteksto 128K.
  • GLM‑4‑Air — isang mas compact at mas mabilis na modelo na may kalidad na malapit sa GLM‑4‑0116, na may mas mababang latency.
  • GLM‑4‑9B — isang 9-bilyong modelo (konteksto 8K, mga variant na 128K at eksperimental na 1M) na may parehong post-training pipeline.
  • GLM‑4 All Tools — isang bersyon na karagdagang aligned sa paggamit ng mga kasangkapan: web browser, Python interpreter, pagbuo ng larawan (CogView3) at mga custom na function.

Mga Arkitekturang Katangian ng GLM‑4:[2]

  • Kawalan ng mga bias term, maliban sa Q/K/V sa attention.
  • RMSNorm at SwiGLU.
  • 2D‑RoPE.
  • Group Query Attention (GQA) na may pinapalaking FFN.
  • Byte BPE tokenizer na may laki na 150K token, na nakuha sa pamamagitan ng pagsasama ng mga hiwalay na sinanay na BPE vocabulary para sa Chinese at multilingual na corpus na may cl100k_base.

GLM‑4.5 (ARC foundation models)

Ang GLM‑4.5 — isang bukas na Mixture‑of‑Experts (MoE) na modelo na may diin sa mga ahente, reasoning at code na gawain (Agentic, Reasoning, Coding — ARC):[3]

  • 355 bilyong kabuuang parameter, 32 bilyong aktibo (MoE arkitektura na may sparse activation): 89 layer, 160 eksperto, 8 aktibo sa bawat token; 96 attention head, hidden size 5120.
  • GLM‑4.5‑Air: 106 bilyong kabuuan / 12 bilyong aktibong parameter — isang epektibong variant.
  • Pagsasanay sa 23 trilyong token na may multi-stage post-training, kabilang ang iterasyon ng mga expert na modelo at RLHF.
  • Hybrid na mode ng output (thinking mode at direct response): sa unang kaso, ang modelo ay bumubuo ng detalyadong reasoning trace; sa ikalawa — direktang sumasagot. Ang paglipat ay kinokontrol sa antas ng inference pipeline.
  • Loss‑free balance routing na may sigmoid gates para sa expert routing.
  • Muon optimizer; deeper‑and‑narrower na disenyo.

GLM‑4.6 / GLM‑4.7

Ang serye ng GLM‑4.6 / 4.7 (Setyembre–Disyembre 2025) ay nagpapalawak ng mga ideya ng GLM‑4.5, pinapalakas ang programming (SWE‑bench Verified / Multilingual), kumplikadong reasoning (Humanity's Last Exam, AIME) at mga ahenteng gawain. Ang GLM‑4.7 ay nakakamit ng 73.8% sa SWE‑bench Verified at nagpapakilala ng Interleaved / Preserved / Turn‑level Thinking — tatlong mode ng integrasyon ng reasoning sa diyalogo. Ang mga hiwalay na configuration ay bukas bilang open‑weight na mga modelo.[3][10]

GLM‑5

Ang teknikal na ulat ay inilathala noong Pebrero 21, 2026 (arXiv:2602.15763). Mga pangunahing katangian:[4]

  • Arkitektura: Mixture‑of‑Experts na may ≈744–745 bilyong kabuuang parameter, 256 eksperto, 8 na ina-activate sa bawat token (≈40–44 bilyong aktibong parameter, ≈5.9% densidad); 75 MoE layer + 3 dense layer.
  • Pretraining: 28.5 trilyong token.
  • Context window: 200K token.
  • Dynamic Sparse Attention (DSA): isang mekanismo ng sparse attention na nagpapababa ng gastos sa pagsasanay at inference habang pinapanatili ang kalidad sa mga mahabang konteksto.
  • Multi‑Token Prediction (MTP): isang teknik para sa speculative decoding sa panahon ng inference.
  • Teknikal na imprastraktura: ang pagsasanay ay isinagawa nang buo sa mga processor ng Huawei Ascend gamit ang MindSpore framework, nang walang pag-asa sa GPU hardware ng American na produksyon.
  • Post-training: asynchronous na imprastraktura ng Reinforcement Learning (RL) na may decoupling ng generation at pagsasanay (decoupling inference / training); paglalapat ng mga ahenteng RL algorithm para sa mga long-horizon na pakikipag-ugnayan; Token‑in‑Token‑out (TITO) at hierarchical na pamamahala ng konteksto para sa mga long-horizon na ahenteng gawain.
  • Lisensya: bukas na timbang sa ilalim ng lisensya ng MIT.

Buod na Talahanayan ng mga Modelo ng Serye

Modelo Taon Mga Parameter (kabuuan / aktibo) Mga Token ng Pretraining Konteksto Mga Pangunahing Katangian
GLM‑130B 2022 130 bilyon / — ≈400 bilyon 2K Dense, dalawang-wika, DeepNorm, INT4 quantization
ChatGLM‑6B 2023 6.2 bilyon / — ≈1 trilyon 2K Diyalogo, SFT + RLHF, INT4 (≈6 GB)
ChatGLM2‑6B 2023 6.2 bilyon / — 1.4 trilyon 32K FlashAttention, MQA
ChatGLM3‑6B 2023 6.2 bilyon / — 32K Function call, Code Interpreter, AgentTuning
GLM‑4 2024 hindi inilalabas (API) ≈10 trilyon 128K–1M All Tools, multimodality (V)
GLM‑4‑9B 2024 ≈9 bilyon / — ≈10 trilyon 128K–1M Bukas na bersyon, GQA
GLM‑4.5 2025 355 bilyon / 32 bilyon 23 trilyon 128K MoE, hybrid thinking, ARC focus
GLM‑4.5‑Air 2025 106 bilyon / 12 bilyon 23 trilyon 128K Epektibong variant ng MoE
GLM‑4.7 2025 128K Pinahusay na coding, Interleaved Thinking
GLM‑5 2026 744 bilyon / ≈40 bilyon 28.5 trilyon 200K DSA, MTP, ahenteng engineering, Huawei Ascend

[2][3][4][8]

Mga Multimodal at Espesyalisadong Extension

  • GLM‑4V‑9B — multimodal na bersyon na may visual encoder para sa pagproseso ng mga larawan at dokumento.[2]
  • GLM‑4.1V‑Thinking — visual‑language na modelo na may pinahusay na multi-step reasoning (arXiv:2507.01006).[11]
  • GLM‑4‑Voice — end‑to‑end na modelo ng pagsasalita (9B base, ≈1 trilyong speech-text token, tokenizer na 175 bit/s).[12]
  • CodeGeeX — pamilya ng mga code na modelo (CodeGeeX‑13B, CodeGeeX2‑6B) para sa pagbuo, pagdaragdag at refactoring ng code sa maraming wika; itinayo sa mga IDE plugin.[2]
  • CogVLM / CogAgent — mga visual‑language na modelo para sa pag-unawa ng larawan at autonomous na navigation sa GUI.[2]
  • WebGLM — isang modelo para sa web-oriented na paghahanap at QA; ipinakita na ang modelo na ≈10 bilyong parameter ay humahalapit sa WebGPT‑175B sa ilang mga gawain (KDD 2023).[2]

Pagsasanay, Data at mga Karagdagang Teknolohiya

Mga Data ng Pretraining

Ang pretraining corpus para sa GLM‑4 at mga naunang modelo ay kinabibilangan ng:[2]

  • Mga multilingual (pangunahin Chinese at Ingles) na web page, Wikipedia, mga libro, code at mga siyentipikong artikulo.
  • Tatlong-yugto na pipeline ng pagproseso: deduplication (eksaktong at fuzzy), filtering (pagtanggal ng mga maingay at potensyal na mapanganib na teksto) at tokenization.
  • Isang pinag-isang bokabularyo na may laki na 150K token, na nakuha sa pamamagitan ng pagsasama ng mga hiwalay na sinanay na BPE vocabulary para sa Chinese at multilingual na corpus na may cl100k_base (tiktoken).

Empirical na nakumpirma ang kahalagahan ng kalidad at pagkakaiba-iba ng data, ngunit ang mga may-akda ay hindi bumalangkas ng malinaw na pundamental na pamantayan sa pagpili ng data na higit pa sa mga nailathala na empirical na pattern.[2]

Pagpapalawak ng Konteksto at LongAlign

Ang mga context window ay sunud-sunod na pinalawak mula 2K (ChatGLM‑6B) hanggang 32K (ChatGLM2/3) at higit pa hanggang 128K at 1M token sa GLM‑4, at pagkatapos ay hanggang 200K sa GLM‑5. Ginagamit ang kombinasyon ng pagpapalawak ng positional encoding (mga paraan ng pag-scale ng frequency batay sa RoPE) at karagdagang fine-tuning sa mga mahabang teksto. Ang espesyal na recipe ng alignment na LongAlign ay nagbibigay-daan upang mapanatili ang kalidad sa mga mahabang input: ayon sa LongBench‑Chat ang GLM‑4 (0520) ay nagpapakita ng 87.3 sa Ingles na bahagi (maihahambing sa GPT‑4 Turbo 1106: 87.2 at Claude 3 Opus: 87.7) at 84.0 sa Chinese (mas mataas kaysa sa GPT‑4 Turbo at Claude 3 Opus).[2]

Post-Training at Alignment (SFT, RLHF)

Ang post-training ay kinabibilangan ng dalawang pangunahing yugto:[2]

  • Supervised Fine‑Tuning (SFT): pagsasanay sa mga pares ng «tanong–sagot» na may diin sa mga tunay na (human-authored) pakikipag-ugnayan, hindi mga template o nabuong.
  • Reinforcement Learning from Human Feedback (RLHF): pag-optimize ayon sa mga kagustuhan ng mga annotator sa pamamagitan ng PPO, DPO at mga sariling pamamaraan, lalo na ang ChatGLM‑RLHF at Self‑Contrast (ang mga negatibong halimbawa ay binubuo ng mismong modelo, na nagpapababa ng pangangailangan para sa mga data ng kagustuhan).

Ang feature vector para sa pagsusuri ng mga sagot ay kinabibilangan ng mga tagapagpahiwatig ng kaligtasan, katotohanan, kaugnayan, pagiging kapaki-pakinabang at pagsunod sa mga kagustuhan. Nabanggit ng mga may-akda na ang RLHF ay nagpapababa ng dalas ng mga pagtanggi, nagpapataas ng kaligtasan at pagkakatugma sa mga multi-turn na diyalogo.[2]

Mga Espesyalisadong Teknik ng Ecosystem ng GLM

  • LongAlign — recipe ng alignment para sa mahabang konteksto (hanggang 128K).[2]
  • ChatGLM‑Math — pagpapabuti ng paglutas ng mga gawaing matematikal gamit ang scheme ng self‑critique (self-evaluation ng mga sagot nang walang mga panlabas na modelo).[2]
  • Self‑Contrast — RLHF scheme kung saan ang mga negatibong halimbawa ay binubuo ng mismong modelo.[2]
  • AgentTuning / AgentInstruct — isang framework at dataset para sa pagsasanay ng mga ahenteng kasanayan sa mga trajectory ng pakikipag-ugnayan ng ahente sa kapaligiran.[2]
  • APAR (Auto‑Parallel Auto‑Regressive) — isang algorithm ng auto-parallel autoregressive generation para sa pagpapabilis ng inference.[2]

Nabuo rin ang isang bilang ng mga benchmark: AgentBench (mga ahenteng gawain), LongBench (mahabang konteksto), AlignBench (Chinese alignment), HumanEval‑X (code na lampas sa Python), NaturalCodeBench (mga praktikal na gawain sa programming).[2]

Mga Pangunahing Resulta at Benchmark

Lahat ng sukatan ay ibinibigay ayon sa mga orihinal na teknikal na ulat na may indikasyon ng mga kondisyon (zero‑/few‑shot, dataset, bersyon ng modelo). Ang paghahambing ay ginawa ng mga may-akda ng mga teknikal na ulat; ang independyenteng pagpaparami sa mga standardized na platform (LMSYS Chatbot Arena, Open LLM Leaderboard) para sa lahat ng bersyon ay hindi sistematisado.

Dinamika ng Kalidad: ChatGLM‑6B → GLM‑4‑9B

Benchmark ChatGLM‑6B ChatGLM2‑6B ChatGLM3‑6B GLM‑4‑9B
GSM8K (%) 1.5 25.9 72.3 84.0
MMLU (%) 25.2 45.2 61.4 74.7
HumanEval (%) 0.0 9.8 58.5 70.1
C‑Eval (%, Chinese) 23.7 51.7 69.0 77.1

Lahat ng modelo ay sinuri sa BF16 na may parehong mga setting.[2]

GLM‑4 sa mga Akademikong Benchmark

Benchmark GLM‑4 (0520) GPT‑4 (0314) GPT‑4 Turbo (2024‑04‑09) Claude 3 Opus
MMLU (%) 83.3 86.4 86.7 86.8
GSM8K (%) 93.3 92.0 95.6 95.0
MATH (%) 61.3 52.9 73.4 60.1
BBH (%) 84.7 83.1 88.2 86.8
GPQA (%) 39.9 35.7 49.3 50.4
HumanEval (%) 78.5 67.0 88.2 84.9

Ang GLM‑4 (0520) ay nakakamit ng ≈96.3% ng resulta ng GPT‑4 sa MMLU, nakahihigit sa GPT‑4 (0314) sa MATH at GSM8K, ngunit natalo ng GPT‑4 Turbo sa MATH at HumanEval.[2]

Ayon sa AlignBench v1.1 (Chinese alignment) ang GLM‑4 (0520) ay nagpapakita ng kabuuang marka na 8.00 kumpara sa 7.90 ng GPT‑4 Turbo at 7.53 ng Claude 3 Opus na may kapansin-pansing kalamangan sa mga sub-indicator na «Logic», «Language», «Professional».[2]

Ayon sa AgentBench ang GLM‑4 (0520) ay nakakamit ng kabuuang marka na 3.79, na maihahambing o bahagyang mas mataas kaysa sa GPT‑4 Turbo (1106) at Claude 3 Opus. Mataas na mga marka sa mga gawaing Database, House‑Holding at Web‑Shopping; pagkaatrasado — sa mga gawaing Operating System at Lateral Thinking Puzzles.[2]

Ayon sa Berkeley Function Call Leaderboard ang GLM‑4 (0520) ay nakakamit ng 81.76% (GPT‑4 Turbo: 81.24%); ang GLM‑4‑9B‑Chat ay malaki ang kahigtan sa Llama‑3‑8B‑Instruct (81.00% vs 58.88%).[2]

GLM‑4.5

Benchmark GLM‑4.5 Tala
TAU‑Bench (agentic avg) 70.1% Mga ahenteng gawain
AIME 2024 91.0% Mga kompetisyon sa matematika
SWE‑bench Verified 64.2% Paglutas ng mga gawain sa mga tunay na repositoryo
GPQA (Avg@8) 79.1% Mga tanong sa antas ng graduate
MATH‑500 98.2% Matematika
MMLU‑Pro 84.6% Pinalawak na MMLU

Kinikilala ang mas maliit na bilang ng mga aktibong parameter, ang GLM‑4.5 ay nasa ika-3 puwesto sa lahat ng sinusukat na modelo (ayon sa pinagsama-samang ranggo mula sa 12 benchmark) at ika-2 — sa mga ahenteng benchmark sa oras ng paglalathala ng ulat.[3]

GLM‑4.7

  • SWE‑bench Verified: 73.8% (+5.8 p.p. kumpara sa GLM‑4.5).
  • Terminal‑Bench 2.0: 41.0% (+16.5 p.p.).
  • Humanity's Last Exam (with tools): 42.8%.[10]

GLM‑5

Benchmark GLM‑5 Tala
SWE‑bench Verified 77.8% Nangunguna sa mga open‑weight na modelo sa oras ng paglalathala
GPQA‑Diamond 86.0% Mga tanong sa antas ng graduate
Terminal‑Bench 2.0 56.2–61.1% Mga gawaing engineering
Humanity's Last Exam (with tools) 50.4% Mga kumplikadong multidisiplinaryong tanong
BrowseComp 62.0% Web navigation

Ang GLM‑5 ay nagpapakita ng pagpapabuti na ≈20% sa average na tagapagpahiwatig kumpara sa GLM‑4.7 at sumasakop sa mga posisyon sa mga open‑weight na modelo na maihahambing sa mga closed na modelo sa antas ng Claude Opus 4.5 sa ilang mga ahente at code na benchmark.[4]

Kaligtasan (SafetyBench)

Ayon sa SafetyBench (Chinese na sub-sample) ang GLM‑4 (0520) ay nakakamit ng 87.2% sa integral na tagapagpahiwatig, na maihahambing sa Claude 3 Opus (87.5%) at bahagyang mas mababa kaysa sa GPT‑4 (≈88–89.7%). Ang pinakakapansin-pansing agwat kumpara sa GPT‑4 ay napapansin sa sukatan ng «Physical Health» (pisikal na kaligtasan).[2]

Paggamit at Ecosystem

Mga Senaryo ng Diyalogo at Asistente

Ang serye ng ChatGLM at mga kasunod na modelo ay ginagamit bilang mga diyalogong asistente, kabilang ang komersyal na serbisyo ng Zhipu Qingyan (chatglm.cn / chat.z.ai), na may suporta para sa multilingual na komunikasyon, multi-turn na diyalogo at instructional mode.[2]

Mga Ahenteng Sistema at Kasangkapan

Ang GLM‑4 All Tools at mga kasunod na modelo ay isinasama sa ahenteng platform na GLMs, na nagbibigay-daan sa paglikha ng mga custom na ahente, pagkonekta ng built-in Python interpreter, web browser, VLM/T2I na modelo (CogView3) at paggamit ng mga panlabas na API. Sinusuportahan ang mga compound na gawain: web search, pagsusuri ng data sa pamamagitan ng Python, mga pinagsama-samang chain ng kasangkapan. Ang GLM‑5 ay nakatuon sa mga gawain ng software engineering na may mahabang horizon ng pagpaplano (agentic engineering) at sinubukan sa mga benchmark ng MCP‑Atlas at BrowseComp.[2][4]

Pagbuo ng Code at Pagbuo ng Software

Ang pamilya ng CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) at mga code na mode ng GLM ay ginagamit para sa pagbuo ng code sa maraming wika, pagdaragdag at refactoring, paglutas ng mga gawain ng HumanEval at HumanEval‑X. Sa HumanEval‑X ang CodeGeeX2‑6B ay nagpapabuti ng Pass@1 kumpara sa CodeGeeX‑13B (ayon sa mga may-akda: +57% sa Python, +71% sa C++). Ang produkto ng CodeGeeX ay itinayo sa mga IDE plugin para sa mga developer.[2]

Mahabang Konteksto at mga Senaryo na Nakasentro sa Dokumento

Ang GLM‑4‑9B‑Chat‑1M at mga mas mataas na modelo ay ginagamit para sa pagsusuri ng malalaking dokumento at koleksyon (hanggang 1M token), pagbubuod, paghahanap sa mga mahabang dokumento, at trabaho sa mahabang code.[2]

Imprastraktura ng Deployment

Ang mga modelo ay available sa pamamagitan ng API platform ng Z.ai / bigmodel.cn (tool calling, agent frameworks). Sinusuportahan ng mga bukas na bersyon ang lokal na deployment sa pamamagitan ng vLLM, SGLang. Ang suporta ng Huawei Ascend ay nagbibigay-daan sa deployment nang walang NVIDIA hardware. Ang mga bukas na modelo ng serye ay na-download nang mahigit 10 milyong beses sa Hugging Face (2023–2024).[2][4][13]

Mga Limitasyon at Bukas na Problema

  • Kawalan ng balanse sa wika: ang serye ng GLM ay pangunahing pre-trained sa Chinese at Ingles na wika; ang kalidad sa ibang mga wika ay mas mababa, na malinaw na isinasaad sa teknikal na ulat na arXiv:2406.12793.[2]
  • Reproducibility ng mga benchmark: karamihan sa mga comparative na resulta ay ibinibigay sa mga teknikal na ulat ng mga developer mismo. Ang independyenteng panlabas na validation sa mga standardized na platform (LMSYS Chatbot Arena, Open LLM Leaderboard) para sa lahat ng bersyon ay hindi sistematisado.
  • Mga loss spike sa panahon ng pag-scale: ang pagsasanay ng GLM‑130B ay sinamahan ng maraming pagtaas ng loss function na nangangailangan ng manu-manong interbensyon; inilalagay ito ng mga may-akda bilang isang hindi nalutas na problema ng engineering sa panahon ng pag-scale.[8]
  • Pag-asa sa hardware: simula sa GLM‑5, ang pagsasanay ay inilipat sa Huawei Ascend / MindSpore; ang independyenteng pagpaparami sa iba pang mga hardware platform ay mahirap.[4]
  • Alignment at kaligtasan: kahit na gumagamit ng RLHF, ang mga isyu ng pagtanggi sa pagsagot, pagkakatugma sa mga multi-turn na diyalogo at pag-bypass ng mga mekanismo ng kaligtasan ay nananatiling may kaugnayan; isinasaad ng mga may-akda ng arXiv:2406.12793 na ang RLHF ay tumutulong, ngunit hindi ganap na nireresolta ang mga problema.[2]
  • Mga halusinasyon: tulad ng sa ibang LLM, ang problema ng mga pagkakamali sa katotohanan ay dokumentado; ang mga dami ng pagtatasa ay nag-iiba depende sa gawain at metodolohiya.
  • Matematikal na reasoning: ang GLM‑4 ay natalo ng GPT‑4 Turbo sa MATH at sa ilang mga gawain ng kumplikadong aritmetika, bagaman gumagamit ito ng mga espesyalisadong pamamaraan (ChatGLM‑Math).[2]
  • Mga ahenteng gawain: sa AgentBench nananatili ang agwat sa mga gawaing may kaugnayan sa low-level OS interaction at mga kumplikadong lohikal na palaisipan; ang kalidad ng mahabang horizon (long‑horizon) ay nananatiling isang hindi nalutas na gawain (akumulasyon ng mga error sa mga chained na gawain).[2][4]
  • Code at mga praktikal na gawain: sa NaturalCodeBench ang GLM‑4 (overall 47.1%) ay mas mababa kaysa sa GPT‑4 Turbo (53.8%), bagaman maihahambing sa Claude 3 Opus (48.3%).[2]

Mga Etikal at Regulatoryong Aspeto

Ang serye ng GLM ay binuo alinsunod sa mga kinakailangan ng Chinese regulator (Cyberspace Administration of China, CAC) sa bahagi ng pagpaparehistro ng mga generative na modelo at pagsasagawa ng pagsusuri sa kaligtasan. Ang post-training ay kinabibilangan ng SFT at RLHF upang mabawasan ang toxicity at mapanganib na nilalaman.[2]

Ang teknikal na ulat ng GLM‑4 ay naglalarawan ng multi-stage na proseso ng pamamahala ng panganib:[2]

  • Paunang paglilinis ng pretraining corpus mula sa mga teksto na may potensyal na mapanganib na nilalaman.
  • Pag-filter ng mga data ng alignment ayon sa mga pamantayan ng kaligtasan.
  • Red‑team testing: pagbuo ng mga kumplikadong mapaminsalang kahilingan para sa karagdagang pagsasanay.
  • Paggamit ng SafetyBench para sa dami ng pagtatasa ng kaligtasan (7 dimensyon).

Ang mga maagang modelo (GLM‑130B) ay nagpapakita ng mas mababang antas ng bias ayon sa CrowS‑Pairs at pinababang toxicity ayon sa RealToxicPrompts kumpara sa GPT‑3 at OPT dahil sa bilingual na pagsasanay.[8][2]

Ang paglalabas ng GLM‑5 sa ilalim ng lisensya ng MIT ay nangangahulugang walang pormal na mga paghihigpit sa komersyal na paggamit ng bukas na timbang, na nagdudulot ng karaniwang mga panganib ng hindi kontroladong paggamit na katangian ng mga bukas na LLM.[4] Ang mga tanong ng mga pagkiling (bias) sa mga corpus ng pretraining, na espesipiko para sa Chinese na wika at kultural na konteksto, ay hindi sistematikong siniyasat sa mga pampublikong gawa sa oras ng pagsusulat ng artikulo.

Mga Pananaw at Direksyon ng Pananaliksik

Batay sa mga nailathala na teknikal na ulat at karagdagang materyales ng Z.ai, ang mga sumusunod na idineklara na direksyon ay ninilinaw:[3][4]

  • Pag-scale ng mga MoE arkitektura habang binabawasan ang gastos ng mga aktibong parameter sa bawat token.
  • Pagbuo ng mga asynchronous na algorithm ng ahenteng RL para sa mga long-horizon na gawain.
  • Pagpapabuti ng mga mekanismo ng sparse attention (DSA) para sa mga konteksto na higit sa 200K token.
  • Multimodal na reasoning: pagbuo ng GLM‑4.1V‑Thinking patungo sa pag-unawa ng video at mga dokumento.
  • Pagbabawas ng pag-asa sa mga panlabas na API sa panahon ng ahenteng pagpapatupad ng mga gawain sa pamamagitan ng pagsasanay ng mga terminal na ahente sa mga tunay na pakikipag-ugnayan.
  • Pag-optimize para sa domestic (para sa China) hardware (Huawei Ascend, Cambricon) at pagbabawas ng carbon footprint ng pagsasanay.
  • Integrasyon sa mga robotics at siyentipikong computing platform.

Tingnan Din

  • Arkitektura ng Transformer
  • BERT
  • GPT
  • T5
  • Decoder‑only na mga arkitektura
  • Reinforcement Learning from Human Feedback
  • DeepSeek

Mga Sanggunian

Mga Tala

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
  5. Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
  6. Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
  7. 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
  9. THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
  10. 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
  11. Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
  12. Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
  13. Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)