GLM (Zhipu AI) (CS)
GLM (General Language Model) — rodina velkých jazykových modelů (Large Language Model, LLM), vyvinutých společností Zhipu AI (od roku 2025 — Z.ai) ve spolupráci s laboratoří Knowledge Engineering Group (KEG) fakulty informatiky Univerzity Tsinghua (Peking). Série zahrnuje modely od 6 do 744 miliard parametrů, zaměřené především na čínský a anglický jazyk. Charakteristickým rysem architektonického základu je předtrénovací účelová funkce založená na autoregresivním doplňování mezer (autoregressive blank infilling), která v rámci jednotného unifikovaného schématu spojuje vlastnosti encoderových a decoderových transformerů.[1][2][3]
Série zahrnuje základní předtrénované modely, dialogové varianty (ChatGLM), multimodální rozšíření (GLM‑4V, CogVLM), specializované nástroje (CodeGeeX pro generování kódu, WebGLM pro webové vyhledávání) a agentní systémy (GLM‑4 All Tools, AutoGLM). Vývoj rodiny je sledovatelný od GLM‑10B (2021) a GLM‑130B (2022) až po GLM‑4 (2024), GLM‑4.5 (2025) a GLM‑5 (2026), s přechodem od hustých (dense) architektur k Mixture‑of‑Experts (MoE) a důrazem na agentní scénáře.[2][4]
Historie a předpoklady
Institucionální kontext
Zhipu AI byla založena v roce 2019 profesory Univerzity Tsinghua Tang Jiem a Li Juanzi na základě laboratoře KEG, specializující se na znalostní grafy. V roce 2020 se společnost soustředila na rozsáhlé jazykové modely. V roce 2023 bylo získáno 2,5 miliardy jüanů investic (≈350 milionů USD) za účasti Alibaba Group, Tencent, Ant Group, Meituan a Xiaomi. V červenci 2025 společnost změnila veřejnou značku na Z.ai a v lednu 2026 provedla IPO na Hongkongské burze cenných papírů.[5][6]
Seminální práce: GLM (2021–2022)
Základní preprint „GLM: General Language Model Pretraining with Autoregressive Blank Infilling" byl zveřejněn na arXiv v březnu 2021 (arXiv:2103.10360) a přijat na konferenci ACL 2022. Autoři: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Práce je motivována omezeními existujících architektonických paradigmat: encoderové modely (BERT) jsou optimální pro úlohy porozumění přirozenému jazyku (Natural Language Understanding, NLU), decoderové (GPT) — pro generování, a encoder‑decoderové (T5) vyžadují větší počet parametrů. GLM navrhl jednotný přístup schopný řešit oba typy úloh.[1][7]
Chronologie hlavních vydání
| Rok | Model | Klíčové vlastnosti |
|---|---|---|
| 2021 | GLM (základní), GLM‑10B | Autoregresivní doplňování mezer, 2D poziční kódování; parametry až 515M (základní) a 10B |
| 2022 | GLM‑130B | 130B parametrů, dvojjazyčný (čínský / anglický), otevřené váhy, INT4 kvantizace bez doladění; přijat na ICLR 2023 |
| 2023, březen | ChatGLM‑6B (v1) | 6,2B parametrů, ≈1T tokenů předtrénování, SFT + RLHF zarovnání, INT4 kvantizace (≈6 GB paměti) |
| 2023, červen | ChatGLM2‑6B | 1,4T tokenů, FlashAttention, Multi‑Query Attention (MQA), kontext až 32K tokenů |
| 2023, říjen | ChatGLM3‑6B | Vylepšené sledování instrukcí, podpora volání nástrojů (tool calling), Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T tokenů předtrénování, RoPE + GQA, kontext až 128K / 1M tokenů; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | Multimodální verze s vizuálním encoderem |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | MoE architektura (GLM‑4.5), postupná vylepšení uvažování a kódování |
| 2025 | GLM‑4.1V‑Thinking | Vizuálně‑jazykový model s posíleným vícekrokovým uvažováním (arXiv:2507.01006) |
| 2026, únor | GLM‑5 | 744B parametrů (MoE), ≈40–44B aktivních, kontext 200K tokenů, agentní úlohy; trénink na Huawei Ascend |
Rodina GLM se rozvíjí v součinnosti se souvisejícími modely Zhipu AI: kódovými CodeGeeX, vizuálně‑jazykovými CogVLM / CogAgent, generativními CogView a specializovanými systémy WebGLM a AgentLM.[2]
Teoretické a architektonické základy
Předtrénovací účelová funkce
Základní architektura GLM je postavena na Transformeru. Klíčovým charakteristickým rysem je autoregressive blank infilling — variace autoregresivního modelování, při níž se model učí obnovovat mezery (spans) v textu podle kontextu.[1][7]
Nechť je vstupní posloupnost. Náhodně jsou vybrány souvislé úseky (spans) , které jsou nahrazeny jediným tokenem [MASK], čímž vznikne narušený text . Model autoregresivně obnovuje každý úsek v náhodném pořadí permutace:
kde je poškozená posloupnost s maskovanými úseky, jsou již obnovené tokeny aktuálního úseku , jsou zcela obnovené předcházející úseky. Pořadí obnovy úseků je dáno náhodnou permutací z množiny , což modelu umožňuje zpracovávat závislosti mezi úseky.[1]
Pro regulaci úlohy: při krátkých mezerách (≈15 % tokenů) je model optimalizován pro NLU, při dlouhých úsecích (až 50–100 % tokenů) — pro generativní úlohy. To umožňuje jedinému modelu pokrývat oba režimy prostřednictvím víceúlohového předtrénování (multi‑task learning).[1][7]
2D poziční kódování
GLM zavádí dvourozměrné poziční kódování pro rozlišení pozic v původní narušené posloupnosti a pozic uvnitř obnovovaných úseků:[1]
- První rozměr : absolutní pozice tokenu (nebo masky) v narušené posloupnosti.
- Druhý rozměr : pozice tokenu uvnitř svého úseku při autoregresivní generaci (0 pro tokeny originálu).
Toto schéma umožňuje správně rozlišit kontext a generovaný text bez dalších architektonických prvků analogických encoderu.
Maska pozornosti
V GLM je použita dvoudílná maska pozornosti: obousměrná (bidirectional) pozornost pro nemaskované tokeny (Part A — kontext) a kauzální (causal) pozornost pro tokeny uvnitř úseků (Part B — obnovované spany). To zajišťuje plné kontextové porozumění původnímu textu při autoregresivní generaci obnovovaných částí. Na rozdíl od BERT (nezávislé predikce masek) GLM zohledňuje závislosti mezi spany; na rozdíl od GPT — využívá obousměrný kontext Part A; na rozdíl od T5 — nevyžaduje oddělený encoder.[1][7]
Vývoj architektonických komponent
Na úrovni parametrů Transformer bloku je skrytý stav na vrstvě v modelech počínaje GLM‑4 aktualizován jako:
kde GQA je Grouped‑Query Attention (namísto plného Multi‑Head Attention) a FFN je realizován přes SwiGLU.[2]
Počínaje GLM‑130B a dále v sérii jsou používány následující architektonické komponenty:
- GLM‑130B: DeepNorm pro stabilizaci trénování hlubokých sítí; Rotary Positional Encoding (RoPE) s 2D rozšířením; Gated Linear Units (GLU) s GeLU aktivací (GeGLU).[8]
- GLM‑4: přechod na RMSNorm a SwiGLU; Group Query Attention (GQA) namísto Multi‑Head Attention (MHA) pro zmenšení KV cache; odstraněny všechny bias členy kromě Q/K/V v attention; zvětšená velikost FFN na pro zachování počtu parametrů při GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) s loss‑free balance routingem a sigmoid gates; hybridní režim uvažování (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) pro efektivní zpracování dlouhého kontextu až 200K tokenů; Multi‑Token Prediction (MTP) pro spekulativní dekódování; trénink plně na procesorech Huawei Ascend s využitím MindSpore.[4]
Škálování a zákony škálování
Při vývoji řady ChatGLM jsou zkoumány empirické závislosti mezi předtrénovací ztrátou a kvalitou na úlohách, včetně fenoménu „emergent abilities". Je ukázáno, že při fixované úrovni předtrénovací ztráty modely různých velikostí (a počtu tokenů) vykazují srovnatelný výkon, a na některých úlohách (MMLU, GSM8K) začíná kvalita překračovat náhodnou úroveň až po dosažení určitého prahu předtrénovací ztráty.[2]
Architektury a modely v sérii GLM
GLM‑10B a GLM‑130B
GLM‑10B (2021) — desetimiliardový model demonstrující použitelnost architektury GLM s blank infilling a sloužící jako základ pro následné škálování.[1]
GLM‑130B (2022) byl představen v říjnu 2022 a přijat na ICLR 2023 (arXiv:2210.02414):[8]
- Počet parametrů: ≈130 miliard (hustý dvojjazyčný model).
- Objem předtrénování: přes 400 miliard tokenů (≈200 miliard v čínštině, ≈200 miliard v angličtině).
- Architektura: 70 vrstev, hidden size 12 288, 96 hlav pozornosti; DeepNorm, RoPE, GeGLU; dodatečné víceúlohové trénování (Multi‑Task Instruction Pretraining, MIP) — ≈5 % tokenů na 74 datasetech úloh NLU/NLG.
- Kvantizace: INT4 bez doladění po kvantizaci (post‑training quantization) — první zdokumentovaný výsledek tohoto druhu mezi modely s 100B+ parametry; inference je možná na 4×RTX 3090 (24 GB) nebo 8×RTX 2080 Ti (11 GB).
- Stabilita trénování: autoři dokumentují četné skoky v hodnotě ztrátové funkce (loss spikes) a popisují použité stabilizační strategie (gradient clipping, Embedding Gradient Shrink).
V době publikace GLM‑130B překonal GPT‑3 175B (davinci) na široké sadě anglických benchmarků (celkem 112 úloh) a ERNIE TITAN 3.0 260B na čínských úlohách; přitom převaha nad OPT‑175B a BLOOM‑176B nebyla reprodukována — autoři toto omezení explicitně uvádějí. Podle hodnocení HELM (listopad 2022) je GLM‑130B srovnatelný s GPT‑3 v řadě metrik.[8][2]
Rodina ChatGLM‑6B/2/3
ChatGLM‑6B (březen 2023) — dialogový model se 6,2 miliardami parametrů, společně vyvinutý KEG a Zhipu AI, zveřejněný jako otevřený projekt:[2][9]
- Předtrénování na ≈1 bilionu tokenů (čínský + anglický), kontext 2K.
- Zaměřen na dialog; počáteční zarovnání je provedeno převážně pomocí SFT a RLHF.
- INT4 kvantizace při spotřebě ≈6 GB paměti, což umožňovalo lokální spuštění na spotřebitelském hardwaru.
ChatGLM2‑6B (červen 2023):[2]
- Zvětšen objem předtrénování na 1,4 bilionu tokenů.
- Zavedeny FlashAttention a Multi‑Query Attention (MQA); kontext rozšířen na 32K tokenů.
- Výrazný nárůst na benchmarcích: MMLU +23 p. b., GSM8K +571 %, BBH +60 % oproti ChatGLM‑6B.
ChatGLM3‑6B (říjen 2023):[2]
- Dodatečný nárůst na 42 benchmarcích v oblastech sémantiky, matematiky, uvažování, kódu a znalostí.
- Nativní podpora function call, vestavěného Code Interpreteru a agentních úloh přes AgentTuning / AgentLM.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B a GLM‑4 All Tools
Technická zpráva (arXiv:2406.12793) popisuje GLM‑4 jako rodinu modelů předtrénovaných na ≈10 biliónech tokenů (převážně čínský a anglický, plus 24 dalších jazyků) a zarovnaných pro čínský a anglický jazyk.[2]
Klíčové varianty:
- GLM‑4 (vlajková verze, verze 0116 a 0520): hustý transformer, hidden size 6144, 61 vrstev, 48 hlav pozornosti, kontext 128K.
- GLM‑4‑Air — kompaktnější a rychlejší model s kvalitou blízkým GLM‑4‑0116 při menší latenci.
- GLM‑4‑9B — devítimiliardový model (kontext 8K, varianty 128K a experimentální 1M) se stejným pipeline post‑trénování.
- GLM‑4 All Tools — verze dodatečně zarovnaná na využívání nástrojů: webový prohlížeč, Python interpret, generování obrázků (CogView3) a uživatelské funkce.
Architektonické vlastnosti GLM‑4:[2]
- Absence bias členů kromě Q/K/V v attention.
- RMSNorm a SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) se zvětšeným FFN.
- Bajtový BPE tokenizátor o velikosti 150K tokenů, získaný sloučením samostatně trénovaných BPE slovníků pro čínský a vícejazyčný korpus s cl100k_base.
GLM‑4.5 (ARC foundation models)
GLM‑4.5 je otevřený Mixture‑of‑Experts (MoE) model s důrazem na agentní, uvažovací a kódovací úlohy (Agentic, Reasoning, Coding — ARC):[3]
- 355 miliard celkových parametrů, 32 miliard aktivních (MoE architektura se sparse aktivací): 89 vrstev, 160 expertů, 8 aktivních na token; 96 hlav pozornosti, hidden size 5120.
- GLM‑4.5‑Air: 106 miliard celkových / 12 miliard aktivních parametrů — efektivní varianta.
- Trénink na 23 biliónech tokenů s vícestupňovým post‑trénováním zahrnujícím iteraci expertních modelů a RLHF.
- Hybridní režim inference (thinking mode a přímá odpověď): v prvním případě model generuje rozvinutou uvažovací stopu; ve druhém — odpovídá přímo. Přepínání je řízeno na úrovni inference pipeline.
- Loss‑free balance routing se sigmoid gates pro směrování expertů.
- Optimalizátor Muon; deeper‑and‑narrower design.
GLM‑4.6 / GLM‑4.7
Série GLM‑4.6 / 4.7 (září–prosinec 2025) rozvíjí myšlenky GLM‑4.5, posiluje programování (SWE‑bench Verified / Multilingual), složité uvažování (Humanity's Last Exam, AIME) a agentní úlohy. GLM‑4.7 dosahuje 73,8 % na SWE‑bench Verified a zavádí Interleaved / Preserved / Turn‑level Thinking — tři režimy integrace uvažování do dialogu. Některé konfigurace jsou zveřejněny jako open‑weight modely.[3][10]
GLM‑5
Technická zpráva byla zveřejněna 21. února 2026 (arXiv:2602.15763). Hlavní charakteristiky:[4]
- Architektura: Mixture‑of‑Experts s ≈744–745 miliardami celkových parametrů, 256 expertů, 8 se aktivuje na každý token (≈40–44 miliard aktivních parametrů, ≈5,9 % hustoty); 75 MoE vrstev + 3 husté vrstvy.
- Předtrénování: 28,5 bilionu tokenů.
- Kontextové okno: 200K tokenů.
- Dynamic Sparse Attention (DSA): mechanismus řídké pozornosti snižující náklady na trénování a inference při zachování kvality na dlouhých kontextech.
- Multi‑Token Prediction (MTP): technika pro spekulativní dekódování při inferenci.
- Technická infrastruktura: trénink byl proveden zcela na procesorech Huawei Ascend s využitím frameworku MindSpore, bez závislosti na GPU hardwaru americké výroby.
- Post‑trénování: asynchronní infrastruktura Reinforcement Learning (RL) s oddělením generování a trénování (decoupling inference / training); využití agentních algoritmů RL pro dlouhohorizontní interakci; Token‑in‑Token‑out (TITO) a hierarchické řízení kontextu pro long‑horizon agentní úlohy.
- Licence: otevřené váhy pod licencí MIT.
Souhrnná tabulka modelů série
| Model | Rok | Parametry (celkem / aktivní) | Tokenů předtrénování | Kontext | Klíčové vlastnosti |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 mld / — | ≈400 mld | 2K | Hustý, dvojjazyčný, DeepNorm, INT4 kvantizace |
| ChatGLM‑6B | 2023 | 6,2 mld / — | ≈1 bil. | 2K | Dialogový, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6,2 mld / — | 1,4 bil. | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6,2 mld / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | nezveřejněno (API) | ≈10 bil. | 128K–1M | All Tools, multimodalita (V) |
| GLM‑4‑9B | 2024 | ≈9 mld / — | ≈10 bil. | 128K–1M | Otevřená verze, GQA |
| GLM‑4.5 | 2025 | 355 mld / 32 mld | 23 bil. | 128K | MoE, hybridní myšlení, ARC zaměření |
| GLM‑4.5‑Air | 2025 | 106 mld / 12 mld | 23 bil. | 128K | Efektivní varianta MoE |
| GLM‑4.7 | 2025 | — | — | 128K | Vylepšené kódování, Interleaved Thinking |
| GLM‑5 | 2026 | 744 mld / ≈40 mld | 28,5 bil. | 200K | DSA, MTP, agentní inženýrství, Huawei Ascend |
Multimodální a specializovaná rozšíření
- GLM‑4V‑9B — multimodální verze s vizuálním encoderem pro zpracování obrázků a dokumentů.[2]
- GLM‑4.1V‑Thinking — vizuálně‑jazykový model s posíleným vícekrokovým uvažováním (arXiv:2507.01006).[11]
- GLM‑4‑Voice — end‑to‑end řečový model (9B base, ≈1 bilion řečově‑textových tokenů, tokenizátor 175 bitů/s).[12]
- CodeGeeX — rodina kódových modelů (CodeGeeX‑13B, CodeGeeX2‑6B) pro generování, doplňování a refaktoring kódu v několika jazycích; zabudováno do IDE pluginů.[2]
- CogVLM / CogAgent — vizuálně‑jazykové modely pro porozumění obrázkům a autonomní navigaci v GUI.[2]
- WebGLM — model pro webově orientované vyhledávání a QA; je ukázáno, že model s ≈10 miliardami parametrů se přibližuje WebGPT‑175B v řadě úloh (KDD 2023).[2]
Trénování, data a pomocné technologie
Předtrénovací data
Předtrénovací korpus pro GLM‑4 a předchozí modely zahrnuje:[2]
- Vícejazyčné (převážně čínské a anglické) webové stránky, Wikipedii, knihy, kód a vědecké články.
- Třístupňový pipeline zpracování: deduplikace (přesná a fuzzy), filtrování (odstranění zašuměných a potenciálně škodlivých textů) a tokenizace.
- Jednotný slovník o velikosti 150K tokenů, získaný sloučením samostatně trénovaných BPE slovníků pro čínský a vícejazyčný korpus s cl100k_base (tiktoken).
Empirickyje potvrzena důležitost kvality a různorodosti dat, avšak žádná explicitní fundamentální kritéria výběru dat přesahující zveřejněné empirické zákonitosti autoři neformulují.[2]
Rozšíření kontextu a LongAlign
Kontextová okna jsou postupně zvětšována od 2K (ChatGLM‑6B) přes 32K (ChatGLM2/3) a dále na 128K a 1M tokenů v GLM‑4, a poté na 200K v GLM‑5. Je použita kombinace rozšíření pozičního kódování (metody škálování frekvencí na bázi RoPE) a dodatečného dolaďování na dlouhých textech. Speciální recept zarovnání LongAlign umožňuje zachovat kvalitu na dlouhých vstupech: podle LongBench‑Chat GLM‑4 (0520) dosahuje 87,3 v anglické části (srovnatelné s GPT‑4 Turbo 1106: 87,2 a Claude 3 Opus: 87,7) a 84,0 v čínské (výše než GPT‑4 Turbo a Claude 3 Opus).[2]
Post‑trénování a zarovnání (SFT, RLHF)
Post‑trénování zahrnuje dvě hlavní fáze:[2]
- Supervised Fine‑Tuning (SFT): trénování na párech „dotaz–odpověď" s důrazem na reálné (člověkem vytvořené) interakce, nikoli šablonové nebo generované.
- Reinforcement Learning from Human Feedback (RLHF): optimalizace podle preferencí anotátorů přes PPO, DPO a vlastní schémata, zejména ChatGLM‑RLHF a Self‑Contrast (negativní příklady jsou generovány samotným modelem, což snižuje potřebu dat o preferencích).
Vektor příznaků pro hodnocení odpovědí zahrnuje ukazatele bezpečnosti, faktičnosti, relevance, užitečnosti a souladu s preferencemi. Autoři konstatují, že RLHF snižuje četnost odmítnutí, zvyšuje bezpečnost a konzistenci ve víceobrátových dialozích.[2]
Specializované techniky ekosystému GLM
- LongAlign — recept zarovnání dlouhého kontextu (až 128K).[2]
- ChatGLM‑Math — zlepšení řešení matematických úloh pomocí schématu self‑critique (sebehodnocení odpovědí bez externích modelů).[2]
- Self‑Contrast — RLHF schéma, kde negativní příklady generuje sám model.[2]
- AgentTuning / AgentInstruct — framework a dataset pro trénování agentních dovedností na trajektoriích interakce agenta s prostředím.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — algoritmus autoparalelní autoregresivní generace pro urychlení inference.[2]
Rovněž byla vyvinuta řada benchmarků: AgentBench (agentní úlohy), LongBench (dlouhý kontext), AlignBench (čínské zarovnání), HumanEval‑X (kód mimo Python), NaturalCodeBench (praktické programátorské úlohy).[2]
Klíčové výsledky a benchmarky
Všechny metriky jsou uváděny podle původních technických zpráv s uvedením podmínek (zero‑/few‑shot, dataset, verze modelu). Srovnání bylo provedeno autory technických zpráv; nezávislá reprodukce na standardizovaných platformách (LMSYS Chatbot Arena, Open LLM Leaderboard) pro všechny verze není systematizována.
Dynamika kvality: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1,5 | 25,9 | 72,3 | 84,0 |
| MMLU (%) | 25,2 | 45,2 | 61,4 | 74,7 |
| HumanEval (%) | 0,0 | 9,8 | 58,5 | 70,1 |
| C‑Eval (%, čín.) | 23,7 | 51,7 | 69,0 | 77,1 |
Všechny modely jsou hodnoceny v BF16 se stejným nastavením.[2]
GLM‑4 na akademických benchmarcích
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83,3 | 86,4 | 86,7 | 86,8 |
| GSM8K (%) | 93,3 | 92,0 | 95,6 | 95,0 |
| MATH (%) | 61,3 | 52,9 | 73,4 | 60,1 |
| BBH (%) | 84,7 | 83,1 | 88,2 | 86,8 |
| GPQA (%) | 39,9 | 35,7 | 49,3 | 50,4 |
| HumanEval (%) | 78,5 | 67,0 | 88,2 | 84,9 |
GLM‑4 (0520) dosahuje ≈96,3 % výsledku GPT‑4 na MMLU, překonává GPT‑4 (0314) na MATH a GSM8K, ale zaostává za GPT‑4 Turbo na MATH a HumanEval.[2]
Podle AlignBench v1.1 (čínské zarovnání) dosahuje GLM‑4 (0520) celkového skóre 8,00 oproti 7,90 u GPT‑4 Turbo a 7,53 u Claude 3 Opus s výraznou převahou v dílčích ukazatelích „Logic", „Language", „Professional".[2]
Podle AgentBench dosahuje GLM‑4 (0520) celkového skóre 3,79, srovnatelného nebo mírně vyššího než GPT‑4 Turbo (1106) a Claude 3 Opus. Vysoké výsledky v úlohách Database, House‑Holding a Web‑Shopping; zaostávání — v úlohách Operating System a Lateral Thinking Puzzles.[2]
Podle Berkeley Function Call Leaderboard dosahuje GLM‑4 (0520) 81,76 % (GPT‑4 Turbo: 81,24 %); GLM‑4‑9B‑Chat výrazně překonává Llama‑3‑8B‑Instruct (81,00 % vs 58,88 %).[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | Poznámka |
|---|---|---|
| TAU‑Bench (agentic avg) | 70,1% | Agentní úlohy |
| AIME 2024 | 91,0% | Matematické soutěže |
| SWE‑bench Verified | 64,2% | Řešení úloh na reálných repozitářích |
| GPQA (Avg@8) | 79,1% | Otázky na úrovni postgraduálního studia |
| MATH‑500 | 98,2% | Matematika |
| MMLU‑Pro | 84,6% | Rozšířené MMLU |
S ohledem na menší počet aktivních parametrů zaujímá GLM‑4.5 3. místo mezi všemi hodnocenými modely (podle souhrnného pořadí z 12 benchmarků) a 2. místo — na agentních benchmarcích v době publikace zprávy.[3]
GLM‑4.7
- SWE‑bench Verified: 73,8 % (+5,8 p. b. oproti GLM‑4.5).
- Terminal‑Bench 2.0: 41,0 % (+16,5 p. b.).
- Humanity's Last Exam (with tools): 42,8 %.[10]
GLM‑5
| Benchmark | GLM‑5 | Poznámka |
|---|---|---|
| SWE‑bench Verified | 77,8% | Lídr mezi open‑weight modely v době publikace |
| GPQA‑Diamond | 86,0% | Otázky na úrovni postgraduálního studia |
| Terminal‑Bench 2.0 | 56,2–61,1% | Inženýrské úlohy |
| Humanity's Last Exam (with tools) | 50,4% | Složité mezioborové otázky |
| BrowseComp | 62,0% | Webová navigace |
GLM‑5 vykazuje zlepšení ≈20 % v průměrném ukazateli oproti GLM‑4.7 a zaujímá pozice mezi open‑weight modely srovnatelné s uzavřenými modely na úrovni Claude Opus 4.5 v řadě agentních a kódových benchmarků.[4]
Bezpečnost (SafetyBench)
Podle SafetyBench (čínská podvzorka) dosahuje GLM‑4 (0520) 87,2 % v souhrnném ukazateli, což je srovnatelné s Claude 3 Opus (87,5 %) a mírně nižší než GPT‑4 (≈88–89,7 %). Nejzřetelnější rozdíl oproti GPT‑4 je patrný v dimenzi „Physical Health" (fyzická bezpečnost).[2]
Využití a ekosystém
Dialogové a asistentní scénáře
Série ChatGLM a následné modely jsou využívány jako dialogoví asistenti, včetně komerční služby Zhipu Qingyan (chatglm.cn / chat.z.ai), s podporou vícejazyčné komunikace, vícestupňového dialogu a instrukčního režimu.[2]
Agentní systémy a nástroje
GLM‑4 All Tools a následné modely jsou integrovány do agentní platformy GLMs, která umožňuje vytvářet vlastní agenty, připojovat vestavěný Python interpret, webový prohlížeč, VLM/T2I modely (CogView3) a využívat externí API. Jsou podporovány složené úlohy: webové vyhledávání, analýza dat přes Python, kombinované řetězce nástrojů. GLM‑5 se zaměřuje na úlohy softwarového inženýrství s dlouhým horizontem plánování (agentic engineering) a byl testován na benchmarcích MCP‑Atlas a BrowseComp.[2][4]
Generování kódu a vývoj softwaru
Rodina CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) a kódové režimy GLM jsou využívány pro generování kódu v několika jazycích, doplňování a refaktoring, řešení úloh HumanEval a HumanEval‑X. Na HumanEval‑X CodeGeeX2‑6B zlepšuje Pass@1 oproti CodeGeeX‑13B (podle autorů: +57 % v Pythonu, +71 % v C++). Produkt CodeGeeX je zabudován do IDE pluginů pro vývojáře.[2]
Dlouhý kontext a dokumentově zaměřené scénáře
GLM‑4‑9B‑Chat‑1M a vyšší modely jsou využívány pro analýzu rozsáhlých dokumentů a kolekcí (až 1M tokenů), sumarizaci, vyhledávání v dlouhých dokumentech a práci s dlouhým kódem.[2]
Infrastruktura nasazení
Modely jsou dostupné přes API platformu Z.ai / bigmodel.cn (tool calling, agent frameworks). Otevřené verze podporují lokální nasazení přes vLLM, SGLang. Podpora Huawei Ascend umožňuje nasazení bez hardwaru NVIDIA. Otevřené modely série byly staženy přes 10 milionů krát na Hugging Face (2023–2024).[2][4][13]
Omezení a otevřené problémy
- Jazyková nerovnováha: série GLM je předtrénována převážně na čínském a anglickém jazyce; kvalita v ostatních jazycích je výrazně nižší, jak je explicitně uvedeno v technické zprávě arXiv:2406.12793.[2]
- Reprodukovatelnost benchmarků: většina srovnávacích výsledků je uvedena v technických zprávách samotných vývojářů. Nezávislá externí validace na standardizovaných platformách (LMSYS Chatbot Arena, Open LLM Leaderboard) pro všechny verze není systematizována.
- Loss spikes při škálování: trénování GLM‑130B bylo provázeno četnými skoky v hodnotě ztrátové funkce vyžadujícími ruční zásah; autoři to dokumentují jako nevyřešený inženýrský problém při škálování.[8]
- Závislost na hardwaru: počínaje GLM‑5 bylo trénování přesunuto na Huawei Ascend / MindSpore; nezávislá reprodukce na jiných hardwarových platformách je obtížná.[4]
- Zarovnání a bezpečnost: navzdory využití RLHF zůstávají aktuální problémy odmítání odpovědí, konzistentnosti ve víceobrátových dialozích a obcházení bezpečnostních mechanismů; autoři arXiv:2406.12793 uvádějí, že RLHF pomáhá, ale problémy zcela neřeší.[2]
- Halucinace: stejně jako u jiných LLM je problém faktografických chyb zdokumentován; kvantitativní hodnocení se liší v závislosti na úloze a metodologii.
- Matematické uvažování: GLM‑4 zaostává za GPT‑4 Turbo na MATH a v řadě úloh složité aritmetiky, přestože využívá specializované techniky (ChatGLM‑Math).[2]
- Agentní úlohy: v AgentBench přetrvává mezera v úlohách spojených s nízkoúrovňovou OS interakcí a složitými logickými hádankami; kvalita dlouhého horizontu (long‑horizon) zůstává nevyřešeným problémem (hromadění chyb v řetězených úlohách).[2][4]
- Kód a praktické úlohy: na NaturalCodeBench dosahuje GLM‑4 (celkově 47,1 %) nižší hodnoty než GPT‑4 Turbo (53,8 %), přestože je srovnatelný s Claude 3 Opus (48,3 %).[2]
Etické a regulatorní aspekty
Série GLM je vyvíjena v souladu s požadavky čínského regulátora (Správa pro kybernetický prostor ČLR, CAC) v oblasti registrace generativních modelů a absolvování bezpečnostního hodnocení. Post‑trénování zahrnuje SFT a RLHF pro snížení toxicity a škodlivého obsahu.[2]
V technické zprávě GLM‑4 je popsán vícestupňový proces řízení rizik:[2]
- Předběžné čištění předtrénovacího korpusu od textů s potenciálně škodlivým obsahem.
- Filtrování zarovnávacích dat podle bezpečnostních kritérií.
- Red‑team testování: tvorba složitých škodlivých dotazů pro dolaďování.
- Využití SafetyBench pro kvantitativní hodnocení bezpečnosti (7 dimenzí).
Rané modely (GLM‑130B) vykazují nižší míru předpojatosti podle CrowS‑Pairs a sníženou toxicitu podle RealToxicPrompts ve srovnání s GPT‑3 a OPT díky dvojjazyčnému trénování.[8][2]
Vydání GLM‑5 pod licencí MIT znamená absenci formálních omezení komerčního využití otevřených vah, což s sebou nese standardní rizika nekontrolovaného použití typická pro otevřené LLM.[4] Otázky zkreslení (bias) v předtrénovacích korpusech specifických pro čínský jazyk a kulturní kontext nejsou v době psaní tohoto článku systematicky prozkoumány ve veřejných pracích.
Perspektivy a směry výzkumu
Na základě zveřejněných technických zpráv a doprovodných materiálů Z.ai jsou vymezeny následující deklarované směry:[3][4]
- Škálování MoE architektur při snižování nákladů na aktivní parametry na token.
- Rozvoj asynchronních algoritmů agentního RL pro dlouhohorizontní úlohy.
- Vylepšení mechanismů řídké pozornosti (DSA) pro kontexty přesahující 200K tokenů.
- Multimodální uvažování: rozvoj GLM‑4.1V‑Thinking směrem k porozumění videu a dokumentům.
- Snižování závislosti na externích API při agentním plnění úloh prostřednictvím trénování koncových agentů na reálných interakcích.
- Optimalizace pro domácí (pro ČLR) hardware (Huawei Ascend, Cambricon) a snižování uhlíkové stopy trénování.
- Integrace s robotickými a vědecko‑výpočetními platformami.
Viz také
- Architektura Transformer
- BERT
- GPT
- T5
- Decoder‑only architektury
- Reinforcement Learning from Human Feedback
- DeepSeek
Literatura
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
Poznámky
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)