GLM (Zhipu AI) (SV)
GLM (General Language Model) — en familj av stora språkmodeller (Large Language Model, LLM), utvecklade av företaget Zhipu AI (från 2025 — Z.ai) i samarbete med laboratoriet Knowledge Engineering Group (KEG) vid datavetenskapfakulteten på Tsinghua-universitetet (Peking). Serien omfattar modeller från 6 till 744 miljarder parametrar, primärt inriktade på kinesiska och engelska. Det arkitektoniska fundamentets utmärkande drag är förträningsfunktionen baserad på autoregressive blank infilling, som förenar egenskaperna hos encoder- och decoder-transformers i ett enda enhetligt schema.[1][2][3]
Serien inkluderar basmodeller för förträning, dialogvarianter (ChatGLM), multimodala utökningar (GLM‑4V, CogVLM), specialiserade verktyg (CodeGeeX för kodgenerering, WebGLM för webbsökning) och agentsystem (GLM‑4 All Tools, AutoGLM). Familjens utveckling kan spåras från GLM‑10B (2021) och GLM‑130B (2022) till GLM‑4 (2024), GLM‑4.5 (2025) och GLM‑5 (2026), med övergången från täta (dense) arkitekturer till Mixture‑of‑Experts (MoE) och betoning på agentscenarier.[2][4]
Historia och förutsättningar
Institutionellt sammanhang
Zhipu AI grundades 2019 av professorerna Tang Jie och Li Juanzi vid Tsinghua-universitetet, baserat på laboratoriet KEG som specialiserade sig på kunskapsgrafer. År 2020 koncentrerade företaget sina ansträngningar på storskaliga språkmodeller. År 2023 attraherades 2,5 miljarder yuan i investeringar (≈350 miljoner USD) med deltagande av Alibaba Group, Tencent, Ant Group, Meituan och Xiaomi. I juli 2025 bytte företaget sitt publika varumärke till Z.ai, och i januari 2026 genomförde det en börsintroduktion på Hongkongbörsen.[5][6]
Grundläggande arbete: GLM (2021–2022)
Det grundläggande preprinted «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» publicerades på arXiv i mars 2021 (arXiv:2103.10360) och antogs till konferensen ACL 2022. Författare: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Arbetet motiverades av begränsningarna hos befintliga arkitekturparadigm: encodermodeller (BERT) är optimala för uppgifter inom förståelse av naturligt språk (Natural Language Understanding, NLU), decodermodeller (GPT) — för generering, medan encoder‑decoder-modeller (T5) kräver ett större antal parametrar. GLM föreslog ett enhetligt tillvägagångssätt som kan lösa båda klasserna av uppgifter.[1][7]
Kronologi över viktiga versioner
| År | Modell | Viktigaste egenskaper |
|---|---|---|
| 2021 | GLM (bas), GLM‑10B | Autoregressive blank infilling, 2D-positionskodningar; parametrar upp till 515M (bas) och 10B |
| 2022 | GLM‑130B | 130B parametrar, tvåspråkig (kinesiska / engelska), öppna vikter, INT4-kvantering utan ytterligare träning; antagen till ICLR 2023 |
| 2023, mars | ChatGLM‑6B (v1) | 6,2B parametrar, ≈1T tokens förträning, SFT + RLHF-anpassning, INT4-kvantering (≈6 GB minne) |
| 2023, juni | ChatGLM2‑6B | 1,4T tokens, FlashAttention, Multi‑Query Attention (MQA), kontext upp till 32K tokens |
| 2023, oktober | ChatGLM3‑6B | Förbättrad instruktionsföljning, stöd för verktygsanrop (tool calling), Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T tokens förträning, RoPE + GQA, kontext upp till 128K / 1M tokens; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | Multimodal version med visuell encoder |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | MoE-arkitektur (GLM‑4.5), successiva förbättringar av resonerande och kodning |
| 2025 | GLM‑4.1V‑Thinking | Visuell-språklig modell med förstärkt flerstegsinferens (arXiv:2507.01006) |
| 2026, februari | GLM‑5 | 744B parametrar (MoE), ≈40–44B aktiva, 200K-tokens kontext, agentuppgifter; träning på Huawei Ascend |
GLM-familjen utvecklas i samband med Zhipu AI:s tillhörande modeller: kodmodellerna CodeGeeX, visuell-språkliga CogVLM / CogAgent, generativa CogView, samt specialiserade system WebGLM och AgentLM.[2]
Teoretiska och arkitektoniska grunder
Förträningens målfunktion
GLM:s grundläggande arkitektur är baserad på Transformer. Den viktigaste utmärkande egenskapen är autoregressive blank infilling — en variant av autoregressiv modellering där modellen lär sig att återskapa luckor (spans) i texten utifrån kontexten.[1][7]
Låt vara inmatningssekvensen. Slumpmässigt valda sammanhängande fragment (spans) ersätts med en enda [MASK]-token, vilket bildar den förvanskade texten . Modellen återställer autoregressivt varje fragment i slumpmässig permutationsordning:
där är den skadade sekvensen med maskerade fragment, är redan återställda tokens i det aktuella fragmentet , är helt återställda tidigare fragment. Återställningsordningen för fragment bestäms av en slumpmässig permutation från mängden , vilket gör det möjligt för modellen att hantera beroenden mellan fragment.[1]
För att reglera uppgiften: vid korta luckor (≈15% av tokens) optimeras modellen för NLU, vid långa fragment (upp till 50–100% av tokens) — för generativa uppgifter. Detta gör att en enda modell kan täcka båda lägena via multi‑task learning.[1][7]
2D-positionskodningar
GLM introducerar tvådimensionella positionskodningar för att skilja positioner i den ursprungliga förvanskade sekvensen från positioner inom de fragment som återställs:[1]
- Första dimensionen : tokenens (eller maskens) absoluta position i den förvanskade sekvensen.
- Andra dimensionen : tokenens position inom sitt fragment vid autoregressiv generering (0 för tokens i originalet).
Detta schema möjliggör korrekt åtskillnad mellan kontext och genererad text utan ytterligare arkitektoniska element liknande en encoder.
Uppmärksamhetsmask
GLM använder en tvådelad uppmärksamhetsmask: dubbelriktad (bidirectional) uppmärksamhet för omaskerade tokens (Part A — kontext) och kausal (causal) uppmärksamhet för tokens inom fragment (Part B — återställda spans). Detta säkerställer fullständig kontextuell förståelse av originaltexten vid autoregressiv generering av de återställda delarna. Till skillnad från BERT (oberoende maskförutsägelser) tar GLM hänsyn till beroenden mellan spans; till skillnad från GPT — använder dubbelriktad kontext från Part A; till skillnad från T5 — kräver ingen separat encoder.[1][7]
Utveckling av arkitektoniska komponenter
På parameternivå för Transformer-blocket uppdateras det dolda tillståndet i lager i modeller från och med GLM‑4 som:
där GQA är Grouped‑Query Attention (i stället för fullständig Multi‑Head Attention), och FFN implementeras via SwiGLU.[2]
Från och med GLM‑130B och framåt i serien används följande arkitektoniska komponenter:
- GLM‑130B: DeepNorm för stabilisering av djupa nätverks träning; Rotary Positional Encoding (RoPE) med 2D-utökning; Gated Linear Units (GLU) med GeLU-aktivering (GeGLU).[8]
- GLM‑4: övergång till RMSNorm och SwiGLU; Group Query Attention (GQA) i stället för Multi‑Head Attention (MHA) för att minska KV-cachen; alla bias-termer borttagna utom Q/K/V i attention; ökad FFN-storlek till för att bibehålla antalet parametrar vid GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) med loss-free balance routing och sigmoid gates; hybridläge för inferens (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) för effektiv hantering av lång kontext upp till 200K tokens; Multi‑Token Prediction (MTP) för spekulativ avkodning; träning helt på Huawei Ascend-processorer med användning av MindSpore.[4]
Skalning och skalningslagar
Under utvecklingen av ChatGLM-serien studeras empiriska samband mellan förträningsförlust och kvalitet på uppgifter, inklusive fenomenet «emergent abilities». Det har visats att vid en fast förträningsförlustnivå uppvisar modeller av olika storlek (och antal tokens) jämförbar prestanda, och på vissa uppgifter (MMLU, GSM8K) börjar kvaliteten överstiga slumpmässig nivå först efter att en viss tröskel för förträningsförlust uppnåtts.[2]
Arkitekturer och modeller i GLM-serien
GLM‑10B och GLM‑130B
GLM‑10B (2021) — en 10-miljardersmodell som demonstrerar tillämpligheten av GLM-arkitekturen med blank infilling och fungerar som bas för efterföljande skalning.[1]
GLM‑130B (2022) presenterades i oktober 2022 och antogs till ICLR 2023 (arXiv:2210.02414):[8]
- Antal parametrar: ≈130 miljarder (tät tvåspråkig modell).
- Förträningsvolym: över 400 miljarder tokens (≈200 miljarder på kinesiska, ≈200 miljarder på engelska).
- Arkitektur: 70 lager, hidden size 12 288, 96 uppmärksamhetshuvuden; DeepNorm, RoPE, GeGLU; ytterligare multi-task-träning (Multi‑Task Instruction Pretraining, MIP) — ≈5% av tokens på 74 dataset för NLU/NLG-uppgifter.
- Kvantering: INT4 utan ytterligare träning efter kvantering (post‑training quantization) — det första dokumenterade resultatet av detta slag bland modeller med 100B+ parametrar; inferens möjlig på 4×RTX 3090 (24 GB) eller 8×RTX 2080 Ti (11 GB).
- Träningsstabilitet: författarna dokumenterar talrika toppar i förlustfunktionen (loss spikes) och beskriver de tillämpade stabiliseringsstrategierna (gradient clipping, Embedding Gradient Shrink).
Vid publiceringstillfället överträffade GLM‑130B GPT‑3 175B (davinci) på ett brett urval av engelskspråkiga benchmark (totalt 112 uppgifter) och ERNIE TITAN 3.0 260B på kinesiskspråkiga uppgifter; dock reproducerades inte överlägsenhet gentemot OPT‑175B och BLOOM‑176B — författarna anger detta explicit som en begränsning. Enligt HELM-utvärderingen (november 2022) är GLM‑130B jämförbar med GPT‑3 på ett antal mätvärden.[8][2]
Familjen ChatGLM‑6B/2/3
ChatGLM‑6B (mars 2023) — en dialogmodell med 6,2 miljarder parametrar, gemensamt utvecklad av KEG och Zhipu AI, publicerad som ett öppet projekt:[2][9]
- Förträning på ≈1 biljon tokens (kinesiska + engelska), kontext 2K.
- Inriktad på dialog; initial anpassning sker huvudsakligen via SFT och RLHF.
- INT4-kvantering med minnesförbrukning på ≈6 GB, vilket möjliggjorde lokal körning på konsumentutrustning.
ChatGLM2‑6B (juni 2023):[2]
- Förträningsvolymen ökad till 1,4 biljoner tokens.
- FlashAttention och Multi‑Query Attention (MQA) introducerades; kontexten utökades till 32K tokens.
- Väsentlig förbättring på benchmark: MMLU +23 procentenheter, GSM8K +571%, BBH +60% relativt ChatGLM‑6B.
ChatGLM3‑6B (oktober 2023):[2]
- Ytterligare förbättring på 42 benchmark inom semantik, matematik, resonemang, kod och kunskap.
- Inbyggt stöd för function call, inbyggd Code Interpreter och agentuppgifter via AgentTuning / AgentLM.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B och GLM‑4 All Tools
Den tekniska rapporten (arXiv:2406.12793) beskriver GLM‑4 som en modellfamilj förtränad på ≈10 biljoner tokens (huvudsakligen kinesiska och engelska, plus 24 ytterligare språk) och anpassad för kinesiska och engelska.[2]
Viktiga varianter:
- GLM‑4 (flaggskepp, versionerna 0116 och 0520): tät transformer, hidden size 6144, 61 lager, 48 uppmärksamhetshuvuden, kontext 128K.
- GLM‑4‑Air — en mer kompakt och snabb modell med kvalitet nära GLM‑4‑0116, men med lägre latens.
- GLM‑4‑9B — en 9-miljardersmodell (kontext 8K, varianter 128K och experimentell 1M) med samma pipeline för efterträning.
- GLM‑4 All Tools — version ytterligare anpassad för verktygsanvändning: webbläsare, Python-tolk, bildgenerering (CogView3) och anpassade funktioner.
Arkitektoniska egenskaper hos GLM‑4:[2]
- Inga bias-termer utom Q/K/V i attention.
- RMSNorm och SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) med utökad FFN.
- Byte-BPE-tokeniserare med storleken 150K tokens, erhållen genom sammanslagning av separat tränade BPE-ordlistor för kinesiska och multilingvala korpusar med cl100k_base.
GLM‑4.5 (ARC foundation models)
GLM‑4.5 är en öppen Mixture‑of‑Experts (MoE)-modell med fokus på agentbaserade, resonerande och kodningsuppgifter (Agentic, Reasoning, Coding — ARC):[3]
- 355 miljarder totala parametrar, 32 miljarder aktiva (MoE-arkitektur med sparse-aktivering): 89 lager, 160 experter, 8 aktiva per token; 96 uppmärksamhetshuvuden, hidden size 5120.
- GLM‑4.5‑Air: 106 miljarder totala / 12 miljarder aktiva parametrar — en effektiv variant.
- Träning på 23 biljoner tokens med flerstegig efterträning, inklusive iteration av expertmodeller och RLHF.
- Hybridläge för inferens (thinking mode och direct response): i det första fallet genererar modellen ett utförligt resonemangsspår; i det andra svarar den direkt. Växling styrs på inference-pipeline-nivå.
- Loss-free balance routing med sigmoid gates för expertroutning.
- Optimeraren Muon; deeper-and-narrower design.
GLM‑4.6 / GLM‑4.7
Serien GLM‑4.6 / 4.7 (september–december 2025) utvecklar idéerna från GLM‑4.5 och förstärker programmering (SWE‑bench Verified / Multilingual), komplext resonemang (Humanity's Last Exam, AIME) och agentuppgifter. GLM‑4.7 uppnår 73,8% på SWE‑bench Verified och introducerar Interleaved / Preserved / Turn‑level Thinking — tre lägen för integrering av resonemang i dialog. Separata konfigurationer är öppna som open‑weight-modeller.[3][10]
GLM‑5
Den tekniska rapporten publicerades den 21 februari 2026 (arXiv:2602.15763). Huvudegenskaper:[4]
- Arkitektur: Mixture‑of‑Experts med ≈744–745 miljarder totala parametrar, 256 experter, 8 aktiveras per token (≈40–44 miljarder aktiva parametrar, ≈5,9% densitet); 75 MoE-lager + 3 täta lager.
- Förträning: 28,5 biljoner tokens.
- Kontextfönster: 200K tokens.
- Dynamic Sparse Attention (DSA): mekanism för gles uppmärksamhet som minskar tränings- och inferenskostnaderna med bibehållen kvalitet på långa kontexter.
- Multi‑Token Prediction (MTP): teknik för spekulativ avkodning vid inferens.
- Teknisk infrastruktur: träning genomförd helt på Huawei Ascend-processorer med ramverket MindSpore, utan beroende av GPU-utrustning av amerikanskt tillverkning.
- Efterträning: asynkron Reinforcement Learning (RL)-infrastruktur med frikoppling av generering och träning (decoupling inference / training); tillämpning av agentbaserade RL-algoritmer för långsiktiga interaktioner; Token‑in‑Token‑out (TITO) och hierarkisk kontexthantering för long‑horizon agentuppgifter.
- Licens: öppna vikter under MIT-licensen.
Sammanfattande tabell över modeller i serien
| Modell | År | Parametrar (totalt / aktiva) | Tokens för förträning | Kontext | Viktigaste egenskaper |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 miljarder / — | ≈400 miljarder | 2K | Tät, tvåspråkig, DeepNorm, INT4-kvantering |
| ChatGLM‑6B | 2023 | 6,2 miljarder / — | ≈1 biljon | 2K | Dialogmodell, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6,2 miljarder / — | 1,4 biljoner | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6,2 miljarder / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | ej tillkännagivet (API) | ≈10 biljoner | 128K–1M | All Tools, multimodalitet (V) |
| GLM‑4‑9B | 2024 | ≈9 miljarder / — | ≈10 biljoner | 128K–1M | Öppen version, GQA |
| GLM‑4.5 | 2025 | 355 miljarder / 32 miljarder | 23 biljoner | 128K | MoE, hybridt tänkande, ARC-fokus |
| GLM‑4.5‑Air | 2025 | 106 miljarder / 12 miljarder | 23 biljoner | 128K | Effektiv MoE-variant |
| GLM‑4.7 | 2025 | — | — | 128K | Förbättrad kodning, Interleaved Thinking |
| GLM‑5 | 2026 | 744 miljarder / ≈40 miljarder | 28,5 biljoner | 200K | DSA, MTP, agentbaserad ingenjörskonst, Huawei Ascend |
Multimodala och specialiserade utökningar
- GLM‑4V‑9B — multimodal version med visuell encoder för bearbetning av bilder och dokument.[2]
- GLM‑4.1V‑Thinking — visuell-språklig modell med förstärkt flerstegsinferens (arXiv:2507.01006).[11]
- GLM‑4‑Voice — end‑to‑end talmodell (9B bas, ≈1 biljon tal-text-tokens, tokeniserare 175 bitar/s).[12]
- CodeGeeX — en familj kodmodeller (CodeGeeX‑13B, CodeGeeX2‑6B) för generering, komplettering och refaktorering av kod på flera språk; inbyggd i IDE-plugin-program.[2]
- CogVLM / CogAgent — visuell-språkliga modeller för bildförståelse och autonom navigering i GUI.[2]
- WebGLM — modell för webborienterad sökning och QA; det har visats att en modell med ≈10 miljarder parametrar närmar sig WebGPT‑175B på ett antal uppgifter (KDD 2023).[2]
Träning, data och stödteknologier
Förträningsdata
Förträningskåren för GLM‑4 och föregående modeller inkluderar:[2]
- Flerspråkiga (huvudsakligen kinesiska och engelska) webbsidor, Wikipedia, böcker, kod och vetenskapliga artiklar.
- En trestegig bearbetningspipeline: deduplicering (exakt och fuzzy), filtrering (borttagning av brusiga och potentiellt skadliga texter) och tokenisering.
- Ett enhetligt ordförråd på 150K tokens, erhållet genom sammanslagning av separat tränade BPE-ordlistor för kinesiska och multilingvala korpusar med cl100k_base (tiktoken).
Vikten av datakvalitet och -mångfald bekräftas empiriskt, men författarna formulerar inga explicita grundläggande urvalskriterier för data utöver publicerade empiriska mönster.[2]
Kontextutvidgning och LongAlign
Kontextfönstren ökas successivt från 2K (ChatGLM‑6B) till 32K (ChatGLM2/3) och vidare till 128K och 1M tokens i GLM‑4, och sedan till 200K i GLM‑5. En kombination av utökning av positionskodning (RoPE-baserade frekvenskalningsmetoder) och ytterligare finjustering på långa texter används. Det speciella anpassningsreceptet LongAlign gör det möjligt att bibehålla kvaliteten på långa indata: enligt LongBench‑Chat uppvisar GLM‑4 (0520) 87,3 i den engelska delen (jämförbart med GPT‑4 Turbo 1106: 87,2 och Claude 3 Opus: 87,7) och 84,0 i den kinesiska (högre än GPT‑4 Turbo och Claude 3 Opus).[2]
Efterträning och anpassning (SFT, RLHF)
Efterträning omfattar två huvudsteg:[2]
- Supervised Fine‑Tuning (SFT): träning på fråga–svar-par med fokus på verkliga (human-authored) interaktioner snarare än mallbaserade eller genererade.
- Reinforcement Learning from Human Feedback (RLHF): optimering utifrån annotatörers preferenser via PPO, DPO och egna scheman, i synnerhet ChatGLM‑RLHF och Self‑Contrast (negativa exempel genereras av modellen själv, vilket minskar behovet av preferensdata).
Funktionsvektorn för bedömning av svar inkluderar mätvärden för säkerhet, faktaenlighet, relevans, användbarhet och preferensöverensstämmelse. Författarna noterar att RLHF minskar antalet avvisanden, ökar säkerheten och konsekvensen i flertursdialoger.[2]
Specialiserade tekniker i GLM-ekosystemet
- LongAlign — recept för anpassning av lång kontext (upp till 128K).[2]
- ChatGLM‑Math — förbättring av lösning av matematiska uppgifter med hjälp av ett self‑critique-schema (självutvärdering av svar utan externa modeller).[2]
- Self‑Contrast — RLHF-schema där negativa exempel genereras av modellen själv.[2]
- AgentTuning / AgentInstruct — ramverk och dataset för träning av agentfärdigheter på spår av agentens interaktion med miljön.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — algoritm för auto-parallell autoregressiv generering för att påskynda inferens.[2]
Ett antal benchmark har också utvecklats: AgentBench (agentuppgifter), LongBench (lång kontext), AlignBench (kinesisk anpassning), HumanEval‑X (kod utanför Python), NaturalCodeBench (praktiska programmeringsuppgifter).[2]
Viktiga resultat och benchmark
Alla mätvärden anges enligt de ursprungliga tekniska rapporterna med angivelse av villkoren (zero-/few-shot, dataset, modellversion). Jämförelsen har utförts av de tekniska rapporternas författare; oberoende reproduktion på standardiserade plattformar (LMSYS Chatbot Arena, Open LLM Leaderboard) för alla versioner är inte systematiserad.
Kvalitetsutveckling: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1,5 | 25,9 | 72,3 | 84,0 |
| MMLU (%) | 25,2 | 45,2 | 61,4 | 74,7 |
| HumanEval (%) | 0,0 | 9,8 | 58,5 | 70,1 |
| C‑Eval (%, kinesiska) | 23,7 | 51,7 | 69,0 | 77,1 |
Alla modeller utvärderade i BF16 med identiska inställningar.[2]
GLM‑4 på akademiska benchmark
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83,3 | 86,4 | 86,7 | 86,8 |
| GSM8K (%) | 93,3 | 92,0 | 95,6 | 95,0 |
| MATH (%) | 61,3 | 52,9 | 73,4 | 60,1 |
| BBH (%) | 84,7 | 83,1 | 88,2 | 86,8 |
| GPQA (%) | 39,9 | 35,7 | 49,3 | 50,4 |
| HumanEval (%) | 78,5 | 67,0 | 88,2 | 84,9 |
GLM‑4 (0520) uppnår ≈96,3% av GPT‑4:s resultat på MMLU, överträffar GPT‑4 (0314) på MATH och GSM8K, men är sämre än GPT‑4 Turbo på MATH och HumanEval.[2]
Enligt AlignBench v1.1 (kinesisk anpassning) uppvisar GLM‑4 (0520) ett totalt poäng på 8,00 mot 7,90 för GPT‑4 Turbo och 7,53 för Claude 3 Opus, med en märkbar fördel på delindikatorerna «Logic», «Language», «Professional».[2]
Enligt AgentBench uppnår GLM‑4 (0520) ett totalt poäng på 3,79, jämförbart med eller något högre än GPT‑4 Turbo (1106) och Claude 3 Opus. Höga poäng på uppgifterna Database, House‑Holding och Web‑Shopping; eftersläpning — på uppgifterna Operating System och Lateral Thinking Puzzles.[2]
Enligt Berkeley Function Call Leaderboard uppnår GLM‑4 (0520) 81,76% (GPT‑4 Turbo: 81,24%); GLM‑4‑9B‑Chat överträffar avsevärt Llama‑3‑8B‑Instruct (81,00% mot 58,88%).[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | Kommentar |
|---|---|---|
| TAU‑Bench (agentic avg) | 70,1% | Agentuppgifter |
| AIME 2024 | 91,0% | Matematiktävlingar |
| SWE‑bench Verified | 64,2% | Lösning av uppgifter på verkliga kodbaser |
| GPQA (Avg@8) | 79,1% | Frågor på doktorandnivå |
| MATH‑500 | 98,2% | Matematik |
| MMLU‑Pro | 84,6% | Utökad MMLU |
Med hänsyn till det lägre antalet aktiva parametrar intar GLM‑4.5 tredje plats bland alla utvärderade modeller (enligt samlat betyg från 12 benchmark) och andra plats — på agentbenchmark vid rapportens publiceringstillfälle.[3]
GLM‑4.7
- SWE‑bench Verified: 73,8% (+5,8 procentenheter jämfört med GLM‑4.5).
- Terminal‑Bench 2.0: 41,0% (+16,5 procentenheter).
- Humanity's Last Exam (with tools): 42,8%.[10]
GLM‑5
| Benchmark | GLM‑5 | Kommentar |
|---|---|---|
| SWE‑bench Verified | 77,8% | Ledande bland open‑weight-modeller vid publiceringstillfället |
| GPQA‑Diamond | 86,0% | Frågor på doktorandnivå |
| Terminal‑Bench 2.0 | 56,2–61,1% | Ingenjörsmässiga uppgifter |
| Humanity's Last Exam (with tools) | 50,4% | Komplexa tvärvetenskapliga frågor |
| BrowseComp | 62,0% | Webbnavigering |
GLM‑5 uppvisar en förbättring på ≈20% i genomsnittliga mätvärden jämfört med GLM‑4.7 och intar positioner bland open‑weight-modeller som är jämförbara med slutna modeller på Claude Opus 4.5-nivå på ett antal agent- och kodbenchmark.[4]
Säkerhet (SafetyBench)
Enligt SafetyBench (kinesiskt delurval) uppnår GLM‑4 (0520) 87,2% på det integrerade mätvärdet, vilket är jämförbart med Claude 3 Opus (87,5%) och något lägre än GPT‑4 (≈88–89,7%). Den mest märkbara skillnaden jämfört med GPT‑4 observeras på dimensionen «Physical Health» (fysisk säkerhet).[2]
Tillämpning och ekosystem
Dialog- och assistentscenarier
ChatGLM-serien och efterföljande modeller används som dialogassistenter, inklusive den kommersiella tjänsten Zhipu Qingyan (chatglm.cn / chat.z.ai), med stöd för flerspråkig kommunikation, flertursdialoger och instruktionsläge.[2]
Agentsystem och verktyg
GLM‑4 All Tools och efterföljande modeller integreras i agentplattformen GLMs, som gör det möjligt att skapa anpassade agenter, ansluta en inbyggd Python-tolk, webbläsare, VLM/T2I-modeller (CogView3) och använda externa API:er. Sammansatta uppgifter stöds: webbsökning, dataanalys via Python, kombinerade verktygskedjor. GLM‑5 fokuserar på programvaruingenjörsuppgifter med lång planeringshorisont (agentic engineering) och testades på benchmark MCP‑Atlas och BrowseComp.[2][4]
Kodgenerering och programvaruutveckling
Familjen CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) och kodlägen i GLM används för kodgenerering på flera språk, komplettering och refaktorering, lösning av HumanEval- och HumanEval‑X-uppgifter. På HumanEval‑X förbättrar CodeGeeX2‑6B Pass@1 jämfört med CodeGeeX‑13B (enligt författarnas uppgifter: +57% i Python, +71% i C++). Produkten CodeGeeX är inbyggd i IDE-plugin-program för utvecklare.[2]
Lång kontext och dokumentcentrerade scenarier
GLM‑4‑9B‑Chat‑1M och äldre modeller används för analys av stora dokument och samlingar (upp till 1M tokens), sammanfattning, sökning i långa dokument och arbete med lång kod.[2]
Driftsättningsinfrastruktur
Modellerna är tillgängliga via API-plattformen Z.ai / bigmodel.cn (tool calling, agent frameworks). Öppna versioner stöder lokal driftsättning via vLLM, SGLang. Stöd för Huawei Ascend möjliggör driftsättning utan NVIDIA-utrustning. Öppna modeller i serien har laddats ner över 10 miljoner gånger på Hugging Face (2023–2024).[2][4][13]
Begränsningar och öppna problem
- Språklig obalans: GLM-serien är huvudsakligen förtränad på kinesiska och engelska; kvaliteten på andra språk är väsentligt lägre, vilket uttryckligen anges i den tekniska rapporten arXiv:2406.12793.[2]
- Reproducerbarhet av benchmark: de flesta jämförande resultat anges i de tekniska rapporter som utvecklarna själva tagit fram. Oberoende extern validering på standardiserade plattformar (LMSYS Chatbot Arena, Open LLM Leaderboard) för alla versioner är inte systematiserad.
- Loss spikes vid skalning: träningen av GLM‑130B åtföljdes av talrika toppar i förlustfunktionen som krävde manuellt ingripande; författarna dokumenterar detta som ett olöst ingenjörsmässigt problem vid skalning.[8]
- Beroende av hårdvara: från och med GLM‑5 har träningen flyttats till Huawei Ascend / MindSpore; oberoende reproduktion på andra hårdvaruplattformar är svår.[4]
- Anpassning och säkerhet: trots tillämpning av RLHF kvarstår problemen med avvisanden, konsekvens i flertursdialoger och kringgående av säkerhetsmekanismer; författarna till arXiv:2406.12793 påpekar att RLHF hjälper men inte löser problemen helt.[2]
- Hallucineringar: som i andra LLM är problemet med faktuella fel dokumenterat; kvantitativa uppskattningar varierar beroende på uppgift och metodik.
- Matematiskt resonemang: GLM‑4 är sämre än GPT‑4 Turbo på MATH och ett antal komplexa aritmetikuppgifter, trots att specialiserade metoder används (ChatGLM‑Math).[2]
- Agentuppgifter: enligt AgentBench kvarstår en eftersläpning på uppgifter relaterade till lågnivå-OS-interaktion och komplexa logiska pussel; kvaliteten för lång horisont (long‑horizon) förblir ett olöst problem (felackumulering i kedjekopplade uppgifter).[2][4]
- Kod och praktiska uppgifter: på NaturalCodeBench är GLM‑4 (totalt 47,1%) lägre än GPT‑4 Turbo (53,8%), även om det är jämförbart med Claude 3 Opus (48,3%).[2]
Etiska och regulatoriska aspekter
GLM-serien utvecklas i enlighet med krav från den kinesiska regulatorn (Cyberspace Administration of China, CAC) vad gäller registrering av generativa modeller och genomgång av säkerhetsutvärdering. Efterträning inkluderar SFT och RLHF för att minska toxicitet och skadligt innehåll.[2]
Den tekniska rapporten för GLM‑4 beskriver en flerstegsprocess för riskhantering:[2]
- Preliminär rensning av förträningskåren från texter med potentiellt farligt innehåll.
- Filtrering av anpassningsdata enligt säkerhetskriterier.
- Red‑team-testning: formulering av komplexa skadliga förfrågningar för finjustering.
- Användning av SafetyBench för kvantitativ säkerhetsbedömning (7 dimensioner).
Tidiga modeller (GLM‑130B) uppvisar lägre grad av partiskhet enligt CrowS‑Pairs och minskad toxicitet enligt RealToxicPrompts jämfört med GPT‑3 och OPT, tack vare tvåspråkig träning.[8][2]
Publiceringen av GLM‑5 under MIT-licensen innebär avsaknad av formella begränsningar för kommersiell användning av öppna vikter, vilket medför de standardmässiga riskerna med okontrollerad användning som är karakteristiska för öppna LLM.[4] Frågor om partiskhet (bias) i förträningskårerna, specifika för det kinesiska språket och det kulturella sammanhanget, har inte systematiskt undersökts i offentliga arbeten vid tidpunkten för artikelns skrivande.
Framtidsutsikter och forskningsinriktningar
Baserat på publicerade tekniska rapporter och kompletterande material från Z.ai identifieras följande deklarerade inriktningar:[3][4]
- Skalning av MoE-arkitekturer med minskad kostnad för aktiva parametrar per token.
- Utveckling av asynkrona agentbaserade RL-algoritmer för långsiktiga uppgifter.
- Förbättring av mekanismer för gles uppmärksamhet (DSA) för kontexter överstigande 200K tokens.
- Multimodalt resonemang: utveckling av GLM‑4.1V‑Thinking i riktning mot förståelse av video och dokument.
- Minskning av beroendet av externa API:er vid agentbaserat uppgiftsutförande genom träning av slutliga agenter på verkliga interaktioner.
- Optimering för inhemsk (för Kina) hårdvara (Huawei Ascend, Cambricon) och minskning av träningens koldioxidavtryck.
- Integration med robotik- och vetenskapliga beräkningsplattformar.
Se även
- Transformer-arkitektur
- BERT
- GPT
- T5
- Decoder-only-arkitekturer
- Reinforcement Learning from Human Feedback
- DeepSeek
Litteratur
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
Noter
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)