GLM (Zhipu AI) (NL)
GLM (General Language Model) — een familie van grote taalmodellen (Large Language Model, LLM), ontwikkeld door het bedrijf Zhipu AI (vanaf 2025 — Z.ai) in samenwerking met het Knowledge Engineering Group (KEG) laboratorium van de faculteit Informatica van de Universiteit Tsinghua (Peking). De serie omvat modellen van 6 tot 744 miljard parameters, voornamelijk gericht op het Chinees en Engels. Het onderscheidende kenmerk van de architecturale basis is de pretrainingsdoelfunctie op basis van autoregressive blank infilling, die eigenschappen van encoder- en decoder-transformers combineert in één uniform schema.[1][2][3]
De serie omvat basismodellen voor voortraining, dialoogvarianten (ChatGLM), multimodale uitbreidingen (GLM‑4V, CogVLM), gespecialiseerde tools (CodeGeeX voor codegeneratie, WebGLM voor webzoekopdrachten) en agentsystemen (GLM‑4 All Tools, AutoGLM). De evolutie van de familie is te volgen van GLM‑10B (2021) en GLM‑130B (2022) tot GLM‑4 (2024), GLM‑4.5 (2025) en GLM‑5 (2026), met een overgang van dense architecturen naar Mixture‑of‑Experts (MoE) en een nadruk op agentscenario's.[2][4]
Geschiedenis en achtergrond
Institutionele context
Zhipu AI is in 2019 opgericht door de Tsinghua-professoren Tang Jie en Li Juanzi op basis van het KEG-laboratorium, dat gespecialiseerd was in kennisgrafen. In 2020 richtte het bedrijf zijn inspanningen op grootschalige taalmodellen. In 2023 werd 2,5 miljard yuan aan investeringen aangetrokken (≈350 miljoen USD) met deelname van Alibaba Group, Tencent, Ant Group, Meituan en Xiaomi. In juli 2025 veranderde het bedrijf zijn publieke merknaam in Z.ai en in januari 2026 vond een beursintroductie plaats op de Hongkongse effectenbeurs.[5][6]
Baanbrekend werk: GLM (2021–2022)
De oorspronkelijke preprint «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» werd in maart 2021 gepubliceerd op arXiv (arXiv:2103.10360) en aanvaard voor de ACL 2022-conferentie. Auteurs: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Het werk is gemotiveerd door de beperkingen van bestaande architecturale paradigma's: encodermodellen (BERT) zijn optimaal voor Natural Language Understanding (NLU)-taken, decodermodellen (GPT) voor generatie, en encoder-decoder-modellen (T5) vereisen een groter aantal parameters. GLM stelde een uniforme aanpak voor die beide klassen van taken kan oplossen.[1][7]
Tijdlijn van belangrijkste releases
| Jaar | Model | Belangrijkste kenmerken |
|---|---|---|
| 2021 | GLM (basis), GLM‑10B | Autoregressive blank infilling, 2D-positionele coderingen; parameters tot 515M (basis) en 10B |
| 2022 | GLM‑130B | 130B parameters, tweetalig (Chinees / Engels), open gewichten, INT4-kwantisatie zonder fine-tuning; aanvaard op ICLR 2023 |
| 2023, maart | ChatGLM‑6B (v1) | 6,2B parameters, ≈1T tokens voortraining, SFT + RLHF-afstemming, INT4-kwantisatie (≈6 GB geheugen) |
| 2023, juni | ChatGLM2‑6B | 1,4T tokens, FlashAttention, Multi‑Query Attention (MQA), context tot 32K tokens |
| 2023, oktober | ChatGLM3‑6B | Verbeterde instructieopvolging, ondersteuning voor tool calling, Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T tokens voortraining, RoPE + GQA, context tot 128K / 1M tokens; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | Multimodale versie met visuele encoder |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | MoE-architectuur (GLM‑4.5), opeenvolgende verbeteringen in redeneren en coderen |
| 2025 | GLM‑4.1V‑Thinking | Visueel-taalmodel met versterkt meerstaps-redeneren (arXiv:2507.01006) |
| 2026, februari | GLM‑5 | 744B parameters (MoE), ≈40–44B actief, 200K-token context, agentische taken; training op Huawei Ascend |
De GLM-familie ontwikkelt zich in samenhang met bijbehorende Zhipu AI-modellen: de codemodellen CodeGeeX, de visueel-taalmodellen CogVLM / CogAgent, de generatieve modellen CogView, evenals de gespecialiseerde systemen WebGLM en AgentLM.[2]
Theoretische en architecturale grondslagen
Pretrainingsdoelfunctie
De basisarchitectuur van GLM is gebaseerd op de Transformer. Het belangrijkste onderscheidende kenmerk is autoregressive blank infilling — een variant van autoregressief modelleren waarbij het model leert om ontbrekende stukken (spans) in tekst te reconstrueren op basis van de context.[1][7]
Laat de invoerreeks zijn. Willekeurig gekozen aaneengesloten fragmenten (spans) worden vervangen door één enkel [MASK]-token, waardoor een beschadigde tekst ontstaat. Het model reconstrueert elk fragment autoregressief in een willekeurige volgorde van permutatie:
waar de beschadigde reeks is met gemaskeerde fragmenten, de al gereconstrueerde tokens van het huidige fragment , en de volledig gereconstrueerde voorafgaande fragmenten. De volgorde van reconstructie van fragmenten wordt bepaald door een willekeurige permutatie uit de verzameling , waardoor het model afhankelijkheden tussen fragmenten kan verwerken.[1]
Voor de regeling van de taak: bij korte ontbrekende stukken (≈15% van de tokens) wordt het model geoptimaliseerd voor NLU, bij lange fragmenten (tot 50–100% van de tokens) voor generatieve taken. Dit stelt één model in staat beide modi te bestrijken via multi‑task learning.[1][7]
2D-positionele coderingen
GLM introduceert tweedimensionale positionele coderingen om posities in de oorspronkelijke beschadigde reeks te onderscheiden van posities binnen de te reconstrueren fragmenten:[1]
- Eerste dimensie : de absolute positie van het token (of masker) in de beschadigde reeks.
- Tweede dimensie : de positie van het token binnen zijn fragment bij autoregressieve generatie (0 voor tokens uit het origineel).
Dit schema maakt het mogelijk context en gegenereerde tekst correct te onderscheiden zonder aanvullende architecturale elementen vergelijkbaar met een encoder.
Aandachtsmasker
In GLM wordt een tweedelig aandachtsmasker toegepast: bidirectionele (bidirectional) aandacht voor niet-gemaskeerde tokens (Part A — context) en causale (causal) aandacht voor tokens binnen fragmenten (Part B — te reconstrueren spans). Dit zorgt voor volledig contextueel begrip van de oorspronkelijke tekst bij autoregressieve generatie van de te reconstrueren delen. In tegenstelling tot BERT (onafhankelijke maskervoorspellingen) houdt GLM rekening met afhankelijkheden tussen spans; in tegenstelling tot GPT maakt het gebruik van bidirectionele context in Part A; in tegenstelling tot T5 vereist het geen afzonderlijke encoder.[1][7]
Evolutie van architecturale componenten
Op het niveau van Transformer-blokparameters wordt de verborgen toestand op laag in modellen vanaf GLM‑4 bijgewerkt als:
waar GQA staat voor Grouped‑Query Attention (in plaats van volledige Multi‑Head Attention), en FFN is geïmplementeerd via SwiGLU.[2]
Vanaf GLM‑130B en verder in de serie worden de volgende architecturale componenten gebruikt:
- GLM‑130B: DeepNorm voor stabilisering van de training van diepe netwerken; Rotary Positional Encoding (RoPE) met 2D-uitbreiding; Gated Linear Units (GLU) met GeLU-activatie (GeGLU).[8]
- GLM‑4: overgang naar RMSNorm en SwiGLU; Group Query Attention (GQA) in plaats van Multi‑Head Attention (MHA) om de KV-cache te verkleinen; alle bias-termen verwijderd, behalve Q/K/V in attention; vergroot FFN-formaat tot om het aantal parameters te behouden bij GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) met loss‑free balance routing en sigmoid gates; hybride redeneerstand (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) voor efficiënte verwerking van lange context tot 200K tokens; Multi‑Token Prediction (MTP) voor speculatief decoderen; volledige training op Huawei Ascend-processors met gebruik van MindSpore.[4]
Schaling en schaalwetten
Tijdens de ontwikkeling van de ChatGLM-reeks worden empirische verbanden onderzocht tussen het pretrainingsverlies en de prestaties op taken, inclusief het fenomeen van «emergent abilities». Er is aangetoond dat bij een vast niveau van pretrainingsverlies modellen van verschillende groottes (en aantallen tokens) vergelijkbare prestaties vertonen, en dat de kwaliteit op bepaalde taken (MMLU, GSM8K) pas het kansgevalniveau begint te overstijgen nadat een bepaalde drempelwaarde van het pretrainingsverlies is bereikt.[2]
Architecturen en modellen in de GLM-serie
GLM‑10B en GLM‑130B
GLM‑10B (2021) — een model met 10 miljard parameters dat de toepasbaarheid van de GLM-architectuur met blank infilling aantoont en als basis dient voor verdere schaling.[1]
GLM‑130B (2022) werd gepresenteerd in oktober 2022 en aanvaard op ICLR 2023 (arXiv:2210.02414):[8]
- Aantal parameters: ≈130 miljard (dense tweetalig model).
- Omvang van voortraining: meer dan 400 miljard tokens (≈200 miljard in het Chinees, ≈200 miljard in het Engels).
- Architectuur: 70 lagen, hidden size 12 288, 96 aandachtshoofden; DeepNorm, RoPE, GeGLU; aanvullende multi-taak voortraining (Multi‑Task Instruction Pretraining, MIP) — ≈5% tokens op 74 datasets van NLU/NLG-taken.
- Kwantisatie: INT4 zonder fine-tuning na kwantisatie (post‑training quantization) — het eerste gedocumenteerde resultaat van deze aard voor 100B+-modellen; inferentie mogelijk op 4×RTX 3090 (24 GB) of 8×RTX 2080 Ti (11 GB).
- Trainingsstabiliteit: de auteurs documenteren talrijke pieken in de verliesfunctie (loss spikes) en beschrijven de toegepaste stabilisatiestrategieën (gradient clipping, Embedding Gradient Shrink).
Ten tijde van publicatie overtrof GLM‑130B GPT‑3 175B (davinci) op een brede reeks Engelstalige benchmarks (in totaal 112 taken) en ERNIE TITAN 3.0 260B op Chineestalige taken; de beweerde superioriteit over OPT‑175B en BLOOM‑176B werd echter niet gereproduceerd — de auteurs vermelden deze beperking expliciet. Volgens de HELM-evaluatie (november 2022) is GLM‑130B vergelijkbaar met GPT‑3 op een aantal statistieken.[8][2]
De ChatGLM‑6B/2/3-familie
ChatGLM‑6B (maart 2023) — een dialoogmodel met 6,2 miljard parameters, gezamenlijk ontwikkeld door KEG en Zhipu AI en gepubliceerd als open project:[2][9]
- Voortraining op ≈1 biljoen tokens (Chinees + Engels), context 2K.
- Gericht op dialoog; initiële afstemming wordt voornamelijk uitgevoerd met SFT en RLHF.
- INT4-kwantisatie met een geheugenverbruik van ≈6 GB, waardoor lokaal gebruik op consumentenhardware mogelijk werd.
ChatGLM2‑6B (juni 2023):[2]
- Omvang van voortraining uitgebreid tot 1,4 biljoen tokens.
- FlashAttention en Multi‑Query Attention (MQA) geïntroduceerd; context uitgebreid tot 32K tokens.
- Aanzienlijke prestatieverbetering op benchmarks: MMLU +23 procentpunten, GSM8K +571%, BBH +60% ten opzichte van ChatGLM‑6B.
ChatGLM3‑6B (oktober 2023):[2]
- Aanvullende verbetering op 42 benchmarks op het gebied van semantiek, wiskunde, redeneren, code en kennis.
- Native ondersteuning voor function call, ingebouwde Code Interpreter en agentische taken via AgentTuning / AgentLM.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B en GLM‑4 All Tools
Het technisch rapport (arXiv:2406.12793) beschrijft GLM‑4 als een familie van modellen die zijn voorgetraind op ≈10 biljoen tokens (voornamelijk Chinees en Engels, plus 24 aanvullende talen) en afgestemd op Chinees en Engels.[2]
Belangrijkste varianten:
- GLM‑4 (vlaggenschipmodel, versies 0116 en 0520): dense transformer, hidden size 6144, 61 lagen, 48 aandachtshoofden, context 128K.
- GLM‑4‑Air — een compacter en sneller model met kwaliteit vergelijkbaar met GLM‑4‑0116, maar met lagere latentie.
- GLM‑4‑9B — een model met 9 miljard parameters (context 8K, varianten 128K en experimenteel 1M) met dezelfde post-trainingspijplijn.
- GLM‑4 All Tools — een versie die aanvullend is afgestemd op het gebruik van tools: webbrowser, Python-interpreter, beeldgeneratie (CogView3) en aangepaste functies.
Architecturale kenmerken van GLM‑4:[2]
- Geen bias-termen, behalve Q/K/V in attention.
- RMSNorm en SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) met vergroot FFN.
- Byte-level BPE-tokenizer met een vocabulaire van 150K tokens, verkregen door samenvoeging van afzonderlijk getrainde BPE-woordenboeken voor Chinees en meertalig corpus met cl100k_base.
GLM‑4.5 (ARC foundation models)
GLM‑4.5 is een open Mixture‑of‑Experts (MoE)-model met de nadruk op agentische, redeneer- en codetaken (Agentic, Reasoning, Coding — ARC):[3]
- 355 miljard totale parameters, 32 miljard actief (MoE-architectuur met sparse-activering): 89 lagen, 160 experts, 8 actief per token; 96 aandachtshoofden, hidden size 5120.
- GLM‑4.5‑Air: 106 miljard totaal / 12 miljard actieve parameters — een efficiënte variant.
- Training op 23 biljoen tokens met meerfasige post-training, inclusief iteratie van expertmodellen en RLHF.
- Hybride inferentiemodus (thinking mode en directe respons): in het eerste geval genereert het model een uitgebreid redeneerspoor; in het tweede antwoordt het direct. Schakelen wordt beheerd op het niveau van de inference-pijplijn.
- Loss‑free balance routing met sigmoid gates voor expertrouting.
- Muon-optimalisator; dieper-en-smaller ontwerp.
GLM‑4.6 / GLM‑4.7
De GLM‑4.6 / 4.7-serie (september–december 2025) bouwt voort op de ideeën van GLM‑4.5 en versterkt programmering (SWE‑bench Verified / Multilingual), complex redeneren (Humanity's Last Exam, AIME) en agentische taken. GLM‑4.7 bereikt 73,8% op SWE‑bench Verified en introduceert Interleaved / Preserved / Turn‑level Thinking — drie modi voor de integratie van redeneren in dialoog. Afzonderlijke configuraties zijn gepubliceerd als open-weight-modellen.[3][10]
GLM‑5
Het technisch rapport werd gepubliceerd op 21 februari 2026 (arXiv:2602.15763). Belangrijkste kenmerken:[4]
- Architectuur: Mixture‑of‑Experts met ≈744–745 miljard totale parameters, 256 experts, 8 worden geactiveerd per token (≈40–44 miljard actieve parameters, ≈5,9% dichtheid); 75 MoE-lagen + 3 dense lagen.
- Voortraining: 28,5 biljoen tokens.
- Contextvenster: 200K tokens.
- Dynamic Sparse Attention (DSA): een mechanisme voor schaarse aandacht dat de trainings- en inferentiekosten verlaagt met behoud van kwaliteit bij lange contexten.
- Multi‑Token Prediction (MTP): een techniek voor speculatief decoderen tijdens inferentie.
- Technische infrastructuur: training volledig uitgevoerd op Huawei Ascend-processors met het MindSpore-framework, zonder afhankelijkheid van GPU-hardware van Amerikaanse makelij.
- Post-training: asynchrone Reinforcement Learning (RL)-infrastructuur met ontkoppeling van generatie en training (decoupling inference / training); toepassing van agentische RL-algoritmen voor taken met een lange horizon; Token‑in‑Token‑out (TITO) en hiërarchisch contextbeheer voor agentische taken met lange horizon.
- Licentie: open gewichten onder MIT-licentie.
Overzichtstabel van modellen in de serie
| Model | Jaar | Parameters (totaal / actief) | Tokens voortraining | Context | Belangrijkste kenmerken |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 mld / — | ≈400 mld | 2K | Dense, tweetalig, DeepNorm, INT4-kwantisatie |
| ChatGLM‑6B | 2023 | 6,2 mld / — | ≈1 bln | 2K | Dialoog, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6,2 mld / — | 1,4 bln | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6,2 mld / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | niet openbaar (API) | ≈10 bln | 128K–1M | All Tools, multimodaliteit (V) |
| GLM‑4‑9B | 2024 | ≈9 mld / — | ≈10 bln | 128K–1M | Open versie, GQA |
| GLM‑4.5 | 2025 | 355 mld / 32 mld | 23 bln | 128K | MoE, hybride redeneren, ARC-focus |
| GLM‑4.5‑Air | 2025 | 106 mld / 12 mld | 23 bln | 128K | Efficiënte MoE-variant |
| GLM‑4.7 | 2025 | — | — | 128K | Verbeterd coderen, Interleaved Thinking |
| GLM‑5 | 2026 | 744 mld / ≈40 mld | 28,5 bln | 200K | DSA, MTP, agentische engineering, Huawei Ascend |
Multimodale en gespecialiseerde uitbreidingen
- GLM‑4V‑9B — multimodale versie met visuele encoder voor de verwerking van afbeeldingen en documenten.[2]
- GLM‑4.1V‑Thinking — visueel-taalmodel met versterkt meerstaps-redeneren (arXiv:2507.01006).[11]
- GLM‑4‑Voice — end‑to‑end spraakmodel (9B basis, ≈1 biljoen spraak-tekst-tokens, tokenizer 175 bits/s).[12]
- CodeGeeX — familie van codemodellen (CodeGeeX‑13B, CodeGeeX2‑6B) voor het genereren, aanvullen en refactoren van code in meerdere programmeertalen; ingebouwd in IDE-plug-ins.[2]
- CogVLM / CogAgent — visueel-taalmodellen voor beeldherkenning en autonome navigatie in een GUI.[2]
- WebGLM — model voor webgericht zoeken en vraag-antwoord; er is aangetoond dat een model van ≈10 miljard parameters GPT‑WebGPT‑175B benadert op een aantal taken (KDD 2023).[2]
Training, gegevens en ondersteunende technologieën
Voortrainingsgegevens
Het voortrainingscorpus voor GLM‑4 en voorgaande modellen omvat:[2]
- Meertalige (voornamelijk Chinees en Engels) webpagina's, Wikipedia, boeken, code en wetenschappelijke artikelen.
- Een driefasige verwerkingspijplijn: deduplicatie (exact en fuzzy), filtering (verwijdering van ruizige en potentieel schadelijke teksten) en tokenisatie.
- Een uniforme woordenschat van 150K tokens, verkregen door samenvoeging van afzonderlijk getrainde BPE-woordenboeken voor Chinees en meertalig corpus met cl100k_base (tiktoken).
Empirisch wordt het belang van kwaliteit en diversiteit van gegevens bevestigd, maar de auteurs formuleren geen expliciete fundamentele selectiecriteria voor gegevens die verder gaan dan de gepubliceerde empirische wetmatigheden.[2]
Contextuitbreiding en LongAlign
Contextvensters worden stapsgewijs vergroot van 2K (ChatGLM‑6B) tot 32K (ChatGLM2/3) en verder tot 128K en 1M tokens in GLM‑4, en vervolgens tot 200K in GLM‑5. Er wordt een combinatie gebruikt van uitbreiding van positionele codering (RoPE-gebaseerde methoden voor frequentieschaling) en aanvullende fine-tuning op lange teksten. Het speciale afstemmingsrecept LongAlign maakt het mogelijk de kwaliteit op lange invoer te handhaven: op LongBench‑Chat laat GLM‑4 (0520) een score van 87,3 zien in het Engelse deel (vergelijkbaar met GPT‑4 Turbo 1106: 87,2 en Claude 3 Opus: 87,7) en 84,0 in het Chinese deel (hoger dan GPT‑4 Turbo en Claude 3 Opus).[2]
Post-training en afstemming (SFT, RLHF)
Post-training omvat twee hoofdfasen:[2]
- Supervised Fine‑Tuning (SFT): training op vraag-antwoordparen met de nadruk op echte (door mensen geschreven) interacties, niet op sjabloonmatige of gegenereerde.
- Reinforcement Learning from Human Feedback (RLHF): optimalisatie op basis van annotateurvoorkeuren via PPO, DPO en eigen schema's, met name ChatGLM‑RLHF en Self‑Contrast (negatieve voorbeelden worden gegenereerd door het model zelf, waardoor de behoefte aan voorkeursgegevens afneemt).
De kenmerkvector voor het beoordelen van antwoorden omvat indicatoren voor veiligheid, feitelijkheid, relevantie, nuttigheid en overeenkomst met voorkeuren. De auteurs merken op dat RLHF het weigeringspercentage verlaagt, de veiligheid verbetert en de consistentie in dialogen met meerdere beurten vergroot.[2]
Gespecialiseerde technieken van het GLM-ecosysteem
- LongAlign — een afstemmingsrecept voor lange context (tot 128K).[2]
- ChatGLM‑Math — verbetering van het oplossen van wiskundige problemen met behulp van een self‑critique-schema (zelfevaluatie van antwoorden zonder externe modellen).[2]
- Self‑Contrast — een RLHF-schema waarbij negatieve voorbeelden door het model zelf worden gegenereerd.[2]
- AgentTuning / AgentInstruct — een framework en dataset voor het trainen van agentische vaardigheden op basis van interactietrajectorieën van een agent met zijn omgeving.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — een algoritme voor automatisch parallelle autoregressieve generatie ter versnelling van inferentie.[2]
Er is ook een reeks benchmarks ontwikkeld: AgentBench (agentische taken), LongBench (lange context), AlignBench (Chinese afstemming), HumanEval‑X (code buiten Python), NaturalCodeBench (praktische programmeertaken).[2]
Belangrijkste resultaten en benchmarks
Alle statistieken zijn ontleend aan originele technische rapporten met vermelding van de omstandigheden (zero‑/few‑shot, dataset, modelversie). De vergelijking is uitgevoerd door de auteurs van de technische rapporten; onafhankelijke reproductie op gestandaardiseerde platforms (LMSYS Chatbot Arena, Open LLM Leaderboard) is voor alle versies niet systematisch gedaan.
Kwaliteitsdynamiek: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1,5 | 25,9 | 72,3 | 84,0 |
| MMLU (%) | 25,2 | 45,2 | 61,4 | 74,7 |
| HumanEval (%) | 0,0 | 9,8 | 58,5 | 70,1 |
| C‑Eval (%, Chin.) | 23,7 | 51,7 | 69,0 | 77,1 |
Alle modellen zijn geëvalueerd in BF16 met identieke instellingen.[2]
GLM‑4 op academische benchmarks
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83,3 | 86,4 | 86,7 | 86,8 |
| GSM8K (%) | 93,3 | 92,0 | 95,6 | 95,0 |
| MATH (%) | 61,3 | 52,9 | 73,4 | 60,1 |
| BBH (%) | 84,7 | 83,1 | 88,2 | 86,8 |
| GPQA (%) | 39,9 | 35,7 | 49,3 | 50,4 |
| HumanEval (%) | 78,5 | 67,0 | 88,2 | 84,9 |
GLM‑4 (0520) bereikt ≈96,3% van het resultaat van GPT‑4 op MMLU, overtreft GPT‑4 (0314) op MATH en GSM8K, maar scoort lager dan GPT‑4 Turbo op MATH en HumanEval.[2]
Op AlignBench v1.1 (Chinese afstemming) laat GLM‑4 (0520) een totaalscore zien van 8,00 tegenover 7,90 voor GPT‑4 Turbo en 7,53 voor Claude 3 Opus, met een duidelijk voordeel op de subcategorieën «Logic», «Language» en «Professional».[2]
Op AgentBench bereikt GLM‑4 (0520) een totaalscore van 3,79, vergelijkbaar met of iets hoger dan GPT‑4 Turbo (1106) en Claude 3 Opus. Hoge scores op Database-, House‑Holding- en Web‑Shopping-taken; achterblijvend op Operating System- en Lateral Thinking Puzzles-taken.[2]
Op de Berkeley Function Call Leaderboard bereikt GLM‑4 (0520) 81,76% (GPT‑4 Turbo: 81,24%); GLM‑4‑9B‑Chat overtreft Llama‑3‑8B‑Instruct aanzienlijk (81,00% vs 58,88%).[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | Opmerking |
|---|---|---|
| TAU‑Bench (agentic gem.) | 70,1% | Agentische taken |
| AIME 2024 | 91,0% | Wiskundige wedstrijden |
| SWE‑bench Verified | 64,2% | Oplossen van taken op echte repositories |
| GPQA (Avg@8) | 79,1% | Vragen op academisch niveau |
| MATH‑500 | 98,2% | Wiskunde |
| MMLU‑Pro | 84,6% | Uitgebreide MMLU |
Gezien het kleinere aantal actieve parameters bezet GLM‑4.5 de 3e plaats onder alle geëvalueerde modellen (op basis van de gecombineerde ranglijst van 12 benchmarks) en de 2e plaats op agentische benchmarks op het moment van publicatie van het rapport.[3]
GLM‑4.7
- SWE‑bench Verified: 73,8% (+5,8 procentpunten ten opzichte van GLM‑4.5).
- Terminal‑Bench 2.0: 41,0% (+16,5 procentpunten).
- Humanity's Last Exam (with tools): 42,8%.[10]
GLM‑5
| Benchmark | GLM‑5 | Opmerking |
|---|---|---|
| SWE‑bench Verified | 77,8% | Koploper onder open-weight modellen op het moment van publicatie |
| GPQA‑Diamond | 86,0% | Vragen op academisch niveau |
| Terminal‑Bench 2.0 | 56,2–61,1% | Technische taken |
| Humanity's Last Exam (with tools) | 50,4% | Complexe interdisciplinaire vragen |
| BrowseComp | 62,0% | Webnavigatie |
GLM‑5 laat een verbetering zien van ≈20% op de gemiddelde score ten opzichte van GLM‑4.7 en neemt posities in onder open‑weight-modellen die vergelijkbaar zijn met gesloten modellen op het niveau van Claude Opus 4.5 op een aantal agentische en code-benchmarks.[4]
Veiligheid (SafetyBench)
Op SafetyBench (Chinese deelsteekproef) bereikt GLM‑4 (0520) 87,2% op de integrale indicator, vergelijkbaar met Claude 3 Opus (87,5%) en iets lager dan GPT‑4 (≈88–89,7%). Het meest opvallende verschil ten opzichte van GPT‑4 is zichtbaar op de dimensie «Physical Health» (lichamelijke veiligheid).[2]
Toepassingen en ecosysteem
Dialoog- en assistentscenario's
De ChatGLM-serie en latere modellen worden gebruikt als dialoogassistenten, waaronder de commerciële dienst Zhipu Qingyan (chatglm.cn / chat.z.ai), met ondersteuning voor meertalige communicatie, dialogen met meerdere stappen en een instructiemodus.[2]
Agentsystemen en tools
GLM‑4 All Tools en latere modellen worden geïntegreerd in het agentplatform GLMs, waarmee gebruikers aangepaste agents kunnen maken, een ingebouwde Python-interpreter, webbrowser, VLM/T2I-modellen (CogView3) kunnen aansluiten en externe API's kunnen gebruiken. Samengestelde taken worden ondersteund: webzoekopdrachten, gegevensanalyse via Python, gecombineerde toolketens. GLM‑5 richt zich op software-engineeringtaken met een lange planningshorizon (agentic engineering) en werd getest op de benchmarks MCP‑Atlas en BrowseComp.[2][4]
Codegeneratie en softwareontwikkeling
De CodeGeeX-familie (CodeGeeX‑13B, CodeGeeX2‑6B) en de codemodi van GLM worden gebruikt voor het genereren van code in meerdere programmeertalen, aanvullen en refactoren, en het oplossen van HumanEval- en HumanEval‑X-taken. Op HumanEval‑X verbetert CodeGeeX2‑6B Pass@1 ten opzichte van CodeGeeX‑13B (volgens de auteurs: +57% in Python, +71% in C++). Het product CodeGeeX is ingebouwd in IDE-plug-ins voor ontwikkelaars.[2]
Lange context en documentgerichte scenario's
GLM‑4‑9B‑Chat‑1M en hogere modellen worden gebruikt voor de analyse van grote documenten en verzamelingen (tot 1M tokens), samenvatten, zoeken in lange documenten en werken met lange code.[2]
Implementatie-infrastructuur
Modellen zijn beschikbaar via het API-platform Z.ai / bigmodel.cn (tool calling, agent frameworks). Open versies ondersteunen lokale implementatie via vLLM, SGLang. Ondersteuning voor Huawei Ascend maakt implementatie mogelijk zonder NVIDIA-hardware. Open modellen uit de serie zijn meer dan 10 miljoen keer gedownload op Hugging Face (2023–2024).[2][4][13]
Beperkingen en open problemen
- Taalonbalans: de GLM-serie is voornamelijk voorgetraind op Chinees en Engels; de kwaliteit in andere talen is aanzienlijk lager, wat expliciet wordt vermeld in het technisch rapport arXiv:2406.12793.[2]
- Reproduceerbaarheid van benchmarks: de meeste vergelijkende resultaten zijn afkomstig uit technische rapporten van de ontwikkelaars zelf. Onafhankelijke externe validatie op gestandaardiseerde platforms (LMSYS Chatbot Arena, Open LLM Leaderboard) is voor alle versies niet systematisch uitgevoerd.
- Loss spikes bij schaling: de training van GLM‑130B ging gepaard met talrijke pieken in de verliesfunctie die handmatig ingrijpen vereisten; de auteurs documenteren dit als een onopgelost technisch probleem bij schaling.[8]
- Afhankelijkheid van hardware: vanaf GLM‑5 is de training overgebracht naar Huawei Ascend / MindSpore; onafhankelijke reproductie op andere hardwareplatforms is moeilijk.[4]
- Afstemming en veiligheid: ondanks het gebruik van RLHF blijven problemen met weigeringen, consistentie in dialogen met meerdere beurten en het omzeilen van veiligheidsmechanismen actueel; de auteurs van arXiv:2406.12793 geven aan dat RLHF helpt, maar de problemen niet volledig oplost.[2]
- Hallucinaties: net als bij andere LLM's is het probleem van feitelijke fouten gedocumenteerd; kwantitatieve schattingen variëren afhankelijk van de taak en methodologie.
- Wiskundig redeneren: GLM‑4 scoort lager dan GPT‑4 Turbo op MATH en een aantal complexe rekentaken, hoewel gespecialiseerde methoden worden gebruikt (ChatGLM‑Math).[2]
- Agentische taken: op AgentBench blijft een kloof bestaan bij taken die betrekking hebben op laagniveau-besturingssysteeminteractie en complexe logische puzzels; de kwaliteit bij lange horizon (long‑horizon) blijft een onopgelost probleem (foutaccumulatie bij geketende taken).[2][4]
- Code en praktische taken: op NaturalCodeBench scoort GLM‑4 (totaal 47,1%) lager dan GPT‑4 Turbo (53,8%), maar vergelijkbaar met Claude 3 Opus (48,3%).[2]
Ethische en regulatoire aspecten
De GLM-serie wordt ontwikkeld in overeenstemming met de vereisten van de Chinese toezichthouder (Cyberspace Administration of China, CAC) op het gebied van registratie van generatieve modellen en het doorlopen van veiligheidsevaluaties. Post-training omvat SFT en RLHF voor het verminderen van toxiciteit en schadelijke inhoud.[2]
Het technisch rapport van GLM‑4 beschrijft een meerstappenproces voor risicobeheer:[2]
- Voorafgaande reiniging van het voortrainingscorpus van teksten met potentieel schadelijke inhoud.
- Filtering van afstemmingsgegevens op basis van veiligheidscriteria.
- Red‑team-testen: het opstellen van complexe schadelijke verzoeken voor fine-tuning.
- Gebruik van SafetyBench voor kwantitatieve veiligheidsevaluatie (7 dimensies).
Vroege modellen (GLM‑130B) vertonen een lager niveau van vooringenomenheid op CrowS‑Pairs en verminderde toxiciteit op RealToxicPrompts in vergelijking met GPT‑3 en OPT, dankzij tweetalige training.[8][2]
De release van GLM‑5 onder de MIT-licentie betekent dat er geen formele beperkingen zijn op commercieel gebruik van de open gewichten, wat de standaardrisico's van ongecontroleerde toepassing met zich meebrengt die kenmerkend zijn voor open LLM's.[4] Kwesties van vooroordelen (bias) in voortrainingscorpora die specifiek zijn voor de Chinese taal en culturele context, zijn op het moment van schrijven van dit artikel niet systematisch onderzocht in publieke werken.
Perspectieven en onderzoeksrichtingen
Op basis van gepubliceerde technische rapporten en begeleidend materiaal van Z.ai worden de volgende gedeclareerde richtingen onderscheiden:[3][4]
- Schaling van MoE-architecturen met verlaging van de kosten van actieve parameters per token.
- Ontwikkeling van asynchrone agentische RL-algoritmen voor taken met een lange horizon.
- Verbetering van mechanismen voor schaarse aandacht (DSA) voor contexten van meer dan 200K tokens.
- Multimodaal redeneren: ontwikkeling van GLM‑4.1V‑Thinking in de richting van begrip van video en documenten.
- Vermindering van afhankelijkheid van externe API's bij agentische uitvoering van taken via training van eindagenten op echte interacties.
- Optimalisatie voor eigen (Chinese) hardware (Huawei Ascend, Cambricon) en vermindering van de koolstofvoetafdruk van training.
- Integratie met robotica- en wetenschappelijke computerplatforms.
Zie ook
- Transformer-architectuur
- BERT
- GPT
- T5
- Decoder-only-architecturen
- Reinforcement Learning from Human Feedback
- DeepSeek
Literatuur
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
Noten
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)