GLM (Zhipu AI) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

GLM (General Language Model) — familie de modele lingvistice de mari dimensiuni (Large Language Model, LLM), dezvoltate de compania Zhipu AI (din 2025 — Z.ai) împreună cu laboratorul Knowledge Engineering Group (KEG) al Facultății de Informatică a Universității Tsinghua (Beijing). Seria cuprinde modele de la 6 până la 744 de miliarde de parametri, orientate în principal spre limbile chineză și engleză. Caracteristica distinctivă a bazei arhitecturale este funcția obiectiv de preantrenare bazată pe completarea autoregresiвă a lacunelor (autoregressive blank infilling), care combină proprietățile transformerelor de tip encoder și decoder într-o schemă unificată.[1][2][3]

Seria include modele de bază preantrenate, variante de dialog (ChatGLM), extensii multimodale (GLM‑4V, CogVLM), instrumente specializate (CodeGeeX pentru generarea de cod, WebGLM pentru căutare web) și sisteme agentice (GLM‑4 All Tools, AutoGLM). Evoluția familiei poate fi urmărită de la GLM‑10B (2021) și GLM‑130B (2022) până la GLM‑4 (2024), GLM‑4.5 (2025) și GLM‑5 (2026), cu tranziția de la arhitecturi dense (dense) la Mixture‑of‑Experts (MoE) și accent pe scenarii agentice.[2][4]

Istoric și context

Context instituțional

Zhipu AI a fost fondată în 2019 de profesorii Universității Tsinghua Tang Jie și Li Juanzi, pe baza laboratorului KEG, specializat în grafuri de cunoaștere. În 2020, compania și-a concentrat eforturile pe modele lingvistice la scară largă. În 2023 au fost atrase investiții de 2,5 miliarde de yuani (≈350 milioane dolari SUA) cu participarea Alibaba Group, Tencent, Ant Group, Meituan și Xiaomi. În iulie 2025, compania și-a schimbat brandul public în Z.ai, iar în ianuarie 2026 a realizat un IPO la Bursa de Valori din Hong Kong.[5][6]

Lucrarea seminală: GLM (2021–2022)

Preprintul de bază «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» a fost publicat pe arXiv în martie 2021 (arXiv:2103.10360) și acceptat la conferința ACL 2022. Autori: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Lucrarea este motivată de limitările paradigmelor arhitecturale existente: modelele de tip encoder (BERT) sunt optime pentru sarcinile de înțelegere a limbajului natural (Natural Language Understanding, NLU), cele de tip decoder (GPT) — pentru generare, iar cele encoder‑decoder (T5) necesită un număr mai mare de parametri. GLM a propus o abordare unitară, capabilă să rezolve ambele clase de sarcini.[1][7]

Cronologia principalelor lansări

An Model Caracteristici principale
2021 GLM (de bază), GLM‑10B Completare autoregresiвă a lacunelor, codificări poziționale 2D; parametri până la 515M (de bază) și 10B
2022 GLM‑130B 130B parametri, bilingv (chineză / engleză), ponderi deschise, cuantizare INT4 fără fine-tuning; acceptat la ICLR 2023
2023, martie ChatGLM‑6B (v1) 6,2B parametri, ≈1T tokeni de preantrenare, aliniere SFT + RLHF, cuantizare INT4 (≈6 GB memorie)
2023, iunie ChatGLM2‑6B 1,4T tokeni, FlashAttention, Multi‑Query Attention (MQA), context până la 32K tokeni
2023, octombrie ChatGLM3‑6B Urmărire îmbunătățită a instrucțiunilor, suport pentru apelarea instrumentelor (tool calling), Code Interpreter
2024 GLM‑4, GLM‑4‑Air, GLM‑4‑9B ≈10T tokeni de preantrenare, RoPE + GQA, context până la 128K / 1M tokeni; GLM‑4 All Tools
2024 GLM‑4V‑9B Versiune multimodală cu encoder vizual
2025 GLM‑4.5, GLM‑4.6, GLM‑4.7 Arhitectură MoE (GLM‑4.5), îmbunătățiri succesive ale raționamentului și codării
2025 GLM‑4.1V‑Thinking Model vizual-lingvistic cu raționament multietapă consolidat (arXiv:2507.01006)
2026, februarie GLM‑5 744B parametri (MoE), ≈40–44B activi, context de 200K tokeni, sarcini agentice; antrenament pe Huawei Ascend

[1][2][3][4][8]

Familia GLM evoluează în strânsă legătură cu modelele conexe Zhipu AI: CodeGeeX pentru cod, CogVLM / CogAgent vizual-lingvistice, CogView generative, precum și sistemele specializate WebGLM și AgentLM.[2]

Fundamente teoretice și arhitecturale

Funcția obiectiv de preantrenare

Arhitectura de bază a GLM se bazează pe Transformer. Caracteristica distinctivă cheie este autoregressive blank infilling — o variantă a modelării autoregresive, în care modelul învață să restaureze lacunele (spans) din text pe baza contextului.[1][7]

Fie x=[x1,,xn] — secvența de intrare. Se selectează aleatoriu fragmente continue (spans) {s1,,sm}, care sunt înlocuite cu un singur token [MASK], formând textul alterat xcorrupt. Modelul restaurează autoregresiv fiecare fragment într-o ordine aleatorie de permutare:

=i=1mj=1|si|logP(si,jxcorrupt,si,<j,s<i)

unde xcorrupt — secvența deteriorată cu fragmente mascate, si,<j — tokenii deja restaurați ai fragmentului curent si, s<i — fragmentele precedente complet restaurate. Ordinea restaurării fragmentelor este dată de o permutare aleatorie din mulțimea Zm, ceea ce permite modelului să proceseze dependențele dintre fragmente.[1]

Pentru reglarea sarcinii: cu lacune scurte (≈15% din tokeni) modelul se optimizează pentru NLU, cu fragmente lungi (până la 50–100% din tokeni) — pentru sarcini generative. Aceasta permite unui singur model să acopere ambele regimuri prin preantrenare multisarcină (multi‑task learning).[1][7]

Codificări poziționale 2D

GLM introduce codificări poziționale bidimensionale pentru a diferenția pozițiile din secvența originală deteriorată și pozițiile din interiorul fragmentelor restaurate:[1]

  • Prima dimensiune pos1: poziția absolută a tokenului (sau a măștii) în secvența deteriorată.
  • A doua dimensiune pos2: poziția tokenului în interiorul fragmentului propriu la generarea autoregresiвă (0 pentru tokenii originali).

Această schemă permite delimitarea corectă a contextului și a textului generat fără elemente arhitecturale suplimentare similare unui encoder.

Masca de atenție

În GLM se aplică o mască de atenție în două părți: atenție bidirecțională (bidirectional) pentru tokenii nemascați (Partea A — contextul) și atenție cauzală (causal) pentru tokenii din interiorul fragmentelor (Partea B — spanurile restaurate). Aceasta asigură înțelegerea deplină a contextului textului original la generarea autoregresiвă a părților restaurate. Spre deosebire de BERT (predicții independente ale măștilor), GLM ține cont de dependențele dintre spanuri; spre deosebire de GPT — folosește contextul bidirecțional al Părții A; spre deosebire de T5 — nu necesită un encoder separat.[1][7]

Evoluția componentelor arhitecturale

La nivelul parametrilor blocului Transformer, starea ascunsă hld la stratul l în modelele începând cu GLM‑4 se actualizează astfel:

h~l=hl+GQAl(RMSNorm(hl)),hl+1=h~l+FFNl(RMSNorm(h~l))

unde GQA — Grouped‑Query Attention (în locul Multi‑Head Attention complet), iar FFN este implementat prin SwiGLU.[2]

Începând cu GLM‑130B și ulterior în serie se utilizează următoarele componente arhitecturale:

  • GLM‑130B: DeepNorm pentru stabilizarea antrenamentului rețelelor profunde; Rotary Positional Encoding (RoPE) cu extensie 2D; Gated Linear Units (GLU) cu activare GeLU (GeGLU).[8]
  • GLM‑4: tranziție la RMSNorm și SwiGLU; Group Query Attention (GQA) în locul Multi‑Head Attention (MHA) pentru reducerea cache-ului KV; eliminarea tuturor termenilor de bias, cu excepția Q/K/V în atenție; dimensiune FFN mărită la 103dhidden pentru păstrarea numărului de parametri la GQA.[2]
  • GLM‑4.5: Mixture‑of‑Experts (MoE) cu rutare de echilibrare fără pierderi (loss‑free balance routing) și porți sigmoid; regim hibrid de raționament (thinking / non‑thinking).[3]
  • GLM‑5: DeepSeek Sparse Attention (DSA) pentru procesarea eficientă a contextului lung până la 200K tokeni; Multi‑Token Prediction (MTP) pentru decodare speculativă; antrenament realizat integral pe procesoare Huawei Ascend folosind MindSpore.[4]

Scalare și legi de scalare

În cursul dezvoltării liniei ChatGLM sunt studiate dependențele empirice dintre pierderea de preantrenare și calitatea la sarcini, inclusiv fenomenul «emergent abilities». S-a demonstrat că la un nivel fix al pierderii de preantrenare, modelele de dimensiuni diferite (și cu număr diferit de tokeni) prezintă performanțe comparabile, iar la anumite sarcini (MMLU, GSM8K) calitatea depășește nivelul aleatoriu abia după atingerea unui anumit prag al pierderii de preantrenare.[2]

Arhitecturi și modele din seria GLM

GLM‑10B și GLM‑130B

GLM‑10B (2021) — model cu 10 miliarde de parametri, demonstrând aplicabilitatea arhitecturii GLM cu blank infilling și servind ca bază pentru scalarea ulterioară.[1]

GLM‑130B (2022) a fost prezentat în octombrie 2022 și acceptat la ICLR 2023 (arXiv:2210.02414):[8]

  • Număr de parametri: ≈130 de miliarde (model dens bilingv).
  • Volum de preantrenare: peste 400 de miliarde de tokeni (≈200 de miliarde în chineză, ≈200 de miliarde în engleză).
  • Arhitectură: 70 de straturi, dimensiune ascunsă 12 288, 96 de capete de atenție; DeepNorm, RoPE, GeGLU; antrenament multisarcină suplimentar (Multi‑Task Instruction Pretraining, MIP) — ≈5% din tokeni pe 74 de seturi de date pentru sarcini NLU/NLG.
  • Cuantizare: INT4 fără fine-tuning post-cuantizare (post‑training quantization) — primul rezultat documentat de acest tip pentru modele 100B+; inferența este posibilă pe 4×RTX 3090 (24 GB) sau 8×RTX 2080 Ti (11 GB).
  • Stabilitatea antrenamentului: autorii documentează numeroase vârfuri ale funcției de pierdere (loss spikes) și descriu strategiile de stabilizare aplicate (gradient clipping, Embedding Gradient Shrink).

La momentul publicării, GLM‑130B depășea GPT‑3 175B (davinci) pe un set larg de benchmark-uri în limba engleză (în total 112 sarcini) și ERNIE TITAN 3.0 260B pe sarcinile în limba chineză; totodată, superioritatea față de OPT‑175B și BLOOM‑176B nu a fost reprodusă — autorii indică explicit această limitare. Conform evaluării HELM (noiembrie 2022), GLM‑130B este comparabil cu GPT‑3 pe mai multe metrici.[8][2]

Familia ChatGLM‑6B/2/3

ChatGLM‑6B (martie 2023) — model de dialog cu 6,2 miliarde de parametri, dezvoltat în comun de KEG și Zhipu AI, publicat ca proiect deschis:[2][9]

  • Preantrenare pe ≈1 trilion de tokeni (chineză + engleză), context 2K.
  • Orientat spre dialog; alinierea inițială este realizată în principal prin SFT și RLHF.
  • Cuantizare INT4 cu un consum de ≈6 GB memorie, ceea ce permitea rularea locală pe echipamente de uz personal.

ChatGLM2‑6B (iunie 2023):[2]

  • Volumul de preantrenare a crescut la 1,4 trilioane de tokeni.
  • Au fost introduse FlashAttention și Multi‑Query Attention (MQA); contextul a fost extins la 32K tokeni.
  • Progres semnificativ pe benchmark-uri: MMLU +23 p.p., GSM8K +571%, BBH +60% față de ChatGLM‑6B.

ChatGLM3‑6B (octombrie 2023):[2]

  • Progres suplimentar pe 42 de benchmark-uri în domeniile semanticii, matematicii, raționamentului, codului și cunoștințelor.
  • Suport nativ pentru function call, Code Interpreter integrat și sarcini agentice prin AgentTuning / AgentLM.

GLM‑4, GLM‑4‑Air, GLM‑4‑9B și GLM‑4 All Tools

Raportul tehnic (arXiv:2406.12793) descrie GLM‑4 ca o familie de modele preantrenate pe ≈10 trilioane de tokeni (preponderent chineză și engleză, plus 24 de limbi suplimentare) și aliniate pentru chineză și engleză.[2]

Variante principale:

  • GLM‑4 (model flagship, versiunile 0116 și 0520): transformer dens, dimensiune ascunsă 6144, 61 de straturi, 48 de capete de atenție, context 128K.
  • GLM‑4‑Air — model mai compact și mai rapid, cu calitate apropiată de GLM‑4‑0116, la latențe mai mici.
  • GLM‑4‑9B — model cu 9 miliarde de parametri (context 8K, variante 128K și experimental 1M) cu același pipeline de post-antrenare.
  • GLM‑4 All Tools — versiune aliniată suplimentar pentru utilizarea instrumentelor: browser web, interpretor Python, generare de imagini (CogView3) și funcții personalizate.

Particularități arhitecturale ale GLM‑4:[2]

  • Absența termenilor de bias, cu excepția Q/K/V în atenție.
  • RMSNorm și SwiGLU.
  • 2D‑RoPE.
  • Group Query Attention (GQA) cu FFN mărit.
  • Tokenizator BPE pe octeți cu un vocabular de 150K tokeni, obținut prin combinarea vocabularelor BPE antrenate separat pentru corpusul chinez și cel multilingv cu cl100k_base.

GLM‑4.5 (modele de bază ARC)

GLM‑4.5 — model deschis Mixture‑of‑Experts (MoE) cu accent pe sarcini agentice, de raționament și de codare (Agentic, Reasoning, Coding — ARC):[3]

  • 355 de miliarde de parametri totali, 32 de miliarde activi (arhitectură MoE cu activare sparse): 89 de straturi, 160 de experți, 8 activi per token; 96 de capete de atenție, dimensiune ascunsă 5120.
  • GLM‑4.5‑Air: 106 miliarde totali / 12 miliarde de parametri activi — variantă eficientă.
  • Antrenament pe 23 de trilioane de tokeni cu post-antrenare multietapă, incluzând iterarea modelelor experte și RLHF.
  • Regim hibrid de inferență (thinking mode și direct response): în primul caz, modelul generează o urmă de raționament detaliată; în al doilea — răspunde direct. Comutarea este controlată la nivelul pipeline-ului de inferență.
  • Rutare de echilibrare fără pierderi (loss‑free balance routing) cu porți sigmoid pentru rutarea experților.
  • Optimizatorul Muon; design deeper‑and‑narrower.

GLM‑4.6 / GLM‑4.7

Seria GLM‑4.6 / 4.7 (septembrie–decembrie 2025) dezvoltă ideile GLM‑4.5, consolidând programarea (SWE‑bench Verified / Multilingual), raționamentul complex (Humanity's Last Exam, AIME) și sarcinile agentice. GLM‑4.7 atinge 73,8% pe SWE‑bench Verified și introduce Interleaved / Preserved / Turn‑level Thinking — trei moduri de integrare a raționamentului în dialog. Anumite configurații sunt publicate ca modele open‑weight.[3][10]

GLM‑5

Raportul tehnic a fost publicat pe 21 februarie 2026 (arXiv:2602.15763). Caracteristici principale:[4]

  • Arhitectură: Mixture‑of‑Experts cu ≈744–745 de miliarde de parametri totali, 256 de experți, 8 activați pentru fiecare token (≈40–44 de miliarde de parametri activi, ≈5,9% densitate); 75 de straturi MoE + 3 straturi dense.
  • Preantrenare: 28,5 trilioane de tokeni.
  • Fereastra de context: 200K tokeni.
  • Dynamic Sparse Attention (DSA): mecanism de atenție sparse care reduce costurile de antrenament și inferență păstrând calitatea pe contexte lungi.
  • Multi‑Token Prediction (MTP): tehnică pentru decodare speculativă la inferență.
  • Infrastructură tehnică: antrenamentul a fost realizat integral pe procesoare Huawei Ascend folosind framework-ul MindSpore, fără dependență de echipamente GPU de producție americană.
  • Post-antrenare: infrastructură asincronă de Reinforcement Learning (RL) cu decuplarea generării și antrenamentului (decoupling inference / training); aplicarea algoritmilor agentici RL pentru interacțiuni cu orizont lung; Token‑in‑Token‑out (TITO) și gestionare ierarhică a contextului pentru sarcini agentice cu orizont lung.
  • Licență: ponderi deschise sub licența MIT.

Tabel rezumativ al modelelor din serie

Model An Parametri (total / activi) Tokeni de preantrenare Context Caracteristici principale
GLM‑130B 2022 130 mld / — ≈400 mld 2K Dens, bilingv, DeepNorm, cuantizare INT4
ChatGLM‑6B 2023 6,2 mld / — ≈1 tril 2K De dialog, SFT + RLHF, INT4 (≈6 GB)
ChatGLM2‑6B 2023 6,2 mld / — 1,4 tril 32K FlashAttention, MQA
ChatGLM3‑6B 2023 6,2 mld / — 32K Function call, Code Interpreter, AgentTuning
GLM‑4 2024 nedivulgat (API) ≈10 tril 128K–1M All Tools, multimodalitate (V)
GLM‑4‑9B 2024 ≈9 mld / — ≈10 tril 128K–1M Versiune deschisă, GQA
GLM‑4.5 2025 355 mld / 32 mld 23 tril 128K MoE, gândire hibridă, focus ARC
GLM‑4.5‑Air 2025 106 mld / 12 mld 23 tril 128K Variantă eficientă MoE
GLM‑4.7 2025 128K Codare îmbunătățită, Interleaved Thinking
GLM‑5 2026 744 mld / ≈40 mld 28,5 tril 200K DSA, MTP, inginerie agentică, Huawei Ascend

[2][3][4][8]

Extensii multimodale și specializate

  • GLM‑4V‑9B — versiune multimodală cu encoder vizual pentru procesarea imaginilor și documentelor.[2]
  • GLM‑4.1V‑Thinking — model vizual-lingvistic cu raționament multietapă consolidat (arXiv:2507.01006).[11]
  • GLM‑4‑Voice — model vocal end‑to‑end (9B de bază, ≈1 trilion de tokeni voce-text, tokenizator 175 biți/s).[12]
  • CodeGeeX — familie de modele de cod (CodeGeeX‑13B, CodeGeeX2‑6B) pentru generarea, completarea și refactorizarea codului în mai multe limbaje; integrat în plugin-uri IDE.[2]
  • CogVLM / CogAgent — modele vizual-lingvistice pentru înțelegerea imaginilor și navigarea autonomă în interfețe grafice (GUI).[2]
  • WebGLM — model pentru căutare web și QA; s-a demonstrat că un model de ≈10 miliarde de parametri se apropie de WebGPT‑175B pe o serie de sarcini (KDD 2023).[2]

Antrenament, date și tehnologii auxiliare

Date de preantrenare

Corpusul de preantrenare pentru GLM‑4 și modelele anterioare include:[2]

  • Pagini web multilingve (preponderent chineză și engleză), Wikipedia, cărți, cod și articole științifice.
  • Pipeline de procesare în trei etape: deduplicare (exactă și fuzzy), filtrare (eliminarea textelor zgomotoase și potențial dăunătoare) și tokenizare.
  • Vocabular unificat de 150K tokeni, obținut prin combinarea vocabularelor BPE antrenate separat pentru corpusul chinez și cel multilingv cu cl100k_base (tiktoken).

Se confirmă empiric importanța calității și diversității datelor, însă autorii nu formulează criterii fundamentale explicite de selecție a datelor care să depășească tiparele empirice publicate.[2]

Extinderea contextului și LongAlign

Ferestrele de context cresc succesiv de la 2K (ChatGLM‑6B) la 32K (ChatGLM2/3) și mai departe la 128K și 1M de tokeni în GLM‑4, apoi la 200K în GLM‑5. Se folosește o combinație de extindere a codificării poziționale (metode de scalare a frecvenței bazate pe RoPE) și fine-tuning suplimentar pe texte lungi. Rețeta specială de aliniere LongAlign permite menținerea calității pe intrări lungi: conform LongBench‑Chat, GLM‑4 (0520) obține 87,3 în secțiunea engleză (comparabil cu GPT‑4 Turbo 1106: 87,2 și Claude 3 Opus: 87,7) și 84,0 în cea chineză (mai mare decât GPT‑4 Turbo și Claude 3 Opus).[2]

Post-antrenare și aliniere (SFT, RLHF)

Post-antrenarea include două etape principale:[2]

  • Supervised Fine‑Tuning (SFT): antrenament pe perechi «interogare–răspuns» cu accent pe interacțiuni reale (human‑authored), nu șabloane sau generate.
  • Reinforcement Learning from Human Feedback (RLHF): optimizare conform preferințelor adnotatorilor prin PPO, DPO și scheme proprii, în special ChatGLM‑RLHF și Self‑Contrast (exemplele negative sunt generate de modelul însuși, ceea ce reduce nevoia de date de preferință).

Vectorul de caracteristici pentru evaluarea răspunsurilor include indicatori de siguranță, factualitate, relevanță, utilitate și conformitate cu preferințele. Autorii notează că RLHF reduce frecvența refuzurilor, sporește siguranța și coerența în dialogurile cu mai multe runde.[2]

Tehnici specializate ale ecosistemului GLM

  • LongAlign — rețetă de aliniere pentru context lung (până la 128K).[2]
  • ChatGLM‑Math — îmbunătățirea rezolvării problemelor matematice cu ajutorul schemei de self‑critique (autoevaluarea răspunsurilor fără modele externe).[2]
  • Self‑Contrast — schemă RLHF în care exemplele negative sunt generate de modelul însuși.[2]
  • AgentTuning / AgentInstruct — framework și set de date pentru antrenarea abilităților agentice pe traiectorii de interacțiune agent-mediu.[2]
  • APAR (Auto‑Parallel Auto‑Regressive) — algoritm de generare autoregresivă auto-paralelă pentru accelerarea inferenței.[2]

De asemenea, au fost dezvoltate o serie de benchmark-uri: AgentBench (sarcini agentice), LongBench (context lung), AlignBench (aliniere în chineză), HumanEval‑X (cod dincolo de Python), NaturalCodeBench (sarcini practice de programare).[2]

Rezultate cheie și benchmark-uri

Toate metricile sunt citate din rapoartele tehnice originale cu indicarea condițiilor (zero-/few-shot, set de date, versiunea modelului). Comparațiile sunt realizate de autorii rapoartelor tehnice; reproducerea independentă pe platforme standardizate (LMSYS Chatbot Arena, Open LLM Leaderboard) nu este sistematizată pentru toate versiunile.

Dinamica calității: ChatGLM‑6B → GLM‑4‑9B

Benchmark ChatGLM‑6B ChatGLM2‑6B ChatGLM3‑6B GLM‑4‑9B
GSM8K (%) 1,5 25,9 72,3 84,0
MMLU (%) 25,2 45,2 61,4 74,7
HumanEval (%) 0,0 9,8 58,5 70,1
C‑Eval (%, chin.) 23,7 51,7 69,0 77,1

Toate modelele au fost evaluate în BF16 cu aceleași setări.[2]

GLM‑4 pe benchmark-uri academice

Benchmark GLM‑4 (0520) GPT‑4 (0314) GPT‑4 Turbo (2024‑04‑09) Claude 3 Opus
MMLU (%) 83,3 86,4 86,7 86,8
GSM8K (%) 93,3 92,0 95,6 95,0
MATH (%) 61,3 52,9 73,4 60,1
BBH (%) 84,7 83,1 88,2 86,8
GPQA (%) 39,9 35,7 49,3 50,4
HumanEval (%) 78,5 67,0 88,2 84,9

GLM‑4 (0520) atinge ≈96,3% din rezultatul GPT‑4 la MMLU, depășind GPT‑4 (0314) la MATH și GSM8K, dar rămânând în urma GPT‑4 Turbo la MATH și HumanEval.[2]

Conform AlignBench v1.1 (aliniere în chineză), GLM‑4 (0520) obține un scor general de 8,00 față de 7,90 pentru GPT‑4 Turbo și 7,53 pentru Claude 3 Opus, cu un avantaj notabil la subindicatorii «Logic», «Language», «Professional».[2]

Conform AgentBench, GLM‑4 (0520) atinge un scor general de 3,79, comparabil sau ușor superior față de GPT‑4 Turbo (1106) și Claude 3 Opus. Scoruri ridicate la sarcinile Database, House‑Holding și Web‑Shopping; decalaj la sarcinile Operating System și Lateral Thinking Puzzles.[2]

Conform Berkeley Function Call Leaderboard, GLM‑4 (0520) atinge 81,76% (GPT‑4 Turbo: 81,24%); GLM‑4‑9B‑Chat depășește semnificativ Llama‑3‑8B‑Instruct (81,00% față de 58,88%).[2]

GLM‑4.5

Benchmark GLM‑4.5 Notă
TAU‑Bench (agentic avg) 70,1% Sarcini agentice
AIME 2024 91,0% Competiții matematice
SWE‑bench Verified 64,2% Rezolvarea sarcinilor pe repozitorii reale
GPQA (Avg@8) 79,1% Întrebări de nivel universitar avansat
MATH‑500 98,2% Matematică
MMLU‑Pro 84,6% MMLU extins

Luând în considerare numărul mai mic de parametri activi, GLM‑4.5 ocupă locul 3 dintre toate modelele evaluate (conform clasamentului agregat din 12 benchmark-uri) și locul 2 pe benchmark-urile agentice la momentul publicării raportului.[3]

GLM‑4.7

  • SWE‑bench Verified: 73,8% (+5,8 p.p. față de GLM‑4.5).
  • Terminal‑Bench 2.0: 41,0% (+16,5 p.p.).
  • Humanity's Last Exam (with tools): 42,8%.[10]

GLM‑5

Benchmark GLM‑5 Notă
SWE‑bench Verified 77,8% Lider printre modelele open‑weight la momentul publicării
GPQA‑Diamond 86,0% Întrebări de nivel universitar avansat
Terminal‑Bench 2.0 56,2–61,1% Sarcini de inginerie
Humanity's Last Exam (with tools) 50,4% Întrebări complexe interdisciplinare
BrowseComp 62,0% Navigare web

GLM‑5 demonstrează o îmbunătățire de ≈20% față de media GLM‑4.7 și ocupă poziții printre modelele open‑weight comparabile cu modelele închise de nivelul Claude Opus 4.5 pe o serie de benchmark-uri agentice și de codare.[4]

Siguranță (SafetyBench)

Conform SafetyBench (subsetul chinezesc), GLM‑4 (0520) atinge 87,2% la indicatorul integral, comparabil cu Claude 3 Opus (87,5%) și ușor sub GPT‑4 (≈88–89,7%). Cel mai notabil decalaj față de GPT‑4 se observă la dimensiunea «Physical Health» (siguranță fizică).[2]

Aplicare și ecosistem

Scenarii de dialog și asistent

Seria ChatGLM și modelele ulterioare sunt utilizate ca asistenți de dialog, inclusiv în serviciul comercial Zhipu Qingyan (chatglm.cn / chat.z.ai), cu suport pentru comunicare multilingvă, dialog multietapă și mod instrucțional.[2]

Sisteme agentice și instrumente

GLM‑4 All Tools și modelele ulterioare se integrează în platforma agentică GLMs, permițând crearea de agenți personalizați, conectarea unui interpretor Python integrat, browser web, modele VLM/T2I (CogView3) și utilizarea API-urilor externe. Sunt suportate sarcini compuse: căutare web, analiză de date prin Python, lanțuri combinate de instrumente. GLM‑5 se concentrează pe sarcini de inginerie software cu orizont lung de planificare (agentic engineering) și a fost testat pe benchmark-urile MCP‑Atlas și BrowseComp.[2][4]

Generarea de cod și dezvoltarea de software

Familia CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) și modurile de cod ale GLM sunt utilizate pentru generarea de cod în mai multe limbaje, completare și refactorizare, rezolvarea sarcinilor HumanEval și HumanEval‑X. Pe HumanEval‑X, CodeGeeX2‑6B îmbunătățește Pass@1 față de CodeGeeX‑13B (conform autorilor: +57% în Python, +71% în C++). Produsul CodeGeeX este integrat în plugin-uri IDE pentru dezvoltatori.[2]

Context lung și scenarii centrate pe documente

GLM‑4‑9B‑Chat‑1M și modelele superioare sunt utilizate pentru analiza documentelor și colecțiilor mari (până la 1M de tokeni), sumarizare, căutare în documente lungi, lucru cu cod de lungime mare.[2]

Infrastructura de implementare

Modelele sunt disponibile prin platforma API Z.ai / bigmodel.cn (tool calling, agent frameworks). Versiunile deschise suportă implementarea locală prin vLLM, SGLang. Suportul pentru Huawei Ascend permite implementarea fără echipamente NVIDIA. Modelele deschise din serie au fost descărcate de peste 10 milioane de ori pe Hugging Face (2023–2024).[2][4][13]

Limitări și probleme deschise

  • Dezechilibru lingvistic: seria GLM este preantrenată preponderent în chineză și engleză; calitatea în alte limbi este semnificativ mai scăzută, aspect menționat explicit în raportul tehnic arXiv:2406.12793.[2]
  • Reproductibilitatea benchmark-urilor: majoritatea rezultatelor comparative sunt prezentate în rapoartele tehnice ale dezvoltatorilor înșiși. Validarea externă independentă pe platforme standardizate (LMSYS Chatbot Arena, Open LLM Leaderboard) nu este sistematizată pentru toate versiunile.
  • Loss spikes la scalare: antrenamentul GLM‑130B a fost însoțit de numeroase vârfuri ale funcției de pierdere, care au necesitat intervenție manuală; autorii documentează aceasta ca problemă de inginerie nerezolvată la scalare.[8]
  • Dependența de infrastructura hardware: începând cu GLM‑5, antrenamentul a fost mutat pe Huawei Ascend / MindSpore; reproducerea independentă pe alte platforme hardware este dificilă.[4]
  • Aliniere și siguranță: în ciuda aplicării RLHF, problemele legate de refuzul răspunsului, coerența în dialogurile multirunde și eludarea mecanismelor de siguranță rămân actuale; autorii arXiv:2406.12793 indică faptul că RLHF ajută, dar nu rezolvă problemele complet.[2]
  • Halucinații: ca și în cazul altor LLM, problema erorilor factuale este documentată; estimările cantitative variază în funcție de sarcină și metodologie.
  • Raționament matematic: GLM‑4 este inferior GPT‑4 Turbo la MATH și o serie de sarcini de aritmetică complexă, deși utilizează metode specializate (ChatGLM‑Math).[2]
  • Sarcini agentice: pe AgentBench persistă un decalaj la sarcinile legate de interacțiunea cu sistemul de operare la nivel scăzut și puzzle-uri logice complexe; calitatea pe orizont lung (long‑horizon) rămâne o problemă nerezolvată (acumularea erorilor în sarcini înlănțuite).[2][4]
  • Cod și sarcini practice: pe NaturalCodeBench, GLM‑4 (overall 47,1%) este sub GPT‑4 Turbo (53,8%), deși comparabil cu Claude 3 Opus (48,3%).[2]

Aspecte etice și de reglementare

Seria GLM este dezvoltată în conformitate cu cerințele regulatorului chinez (Administrația Spațiului Cibernetic al Republicii Populare Chineze, CAC) privind înregistrarea modelelor generative și trecerea evaluărilor de siguranță. Post-antrenarea include SFT și RLHF pentru reducerea toxicității și a conținutului dăunător.[2]

Raportul tehnic GLM‑4 descrie un proces în mai multe etape de gestionare a riscurilor:[2]

  • Curățarea prealabilă a corpusului de preantrenare de texte cu conținut potențial periculos.
  • Filtrarea datelor de aliniere conform criteriilor de siguranță.
  • Testare red‑team: formularea unor interogări dăunătoare complexe pentru fine-tuning.
  • Utilizarea SafetyBench pentru evaluarea cantitativă a siguranței (7 dimensiuni).

Modelele timpurii (GLM‑130B) demonstrează un nivel mai scăzut de prejudecată conform CrowS‑Pairs și toxicitate redusă conform RealToxicPrompts față de GPT‑3 și OPT, grație antrenamentului bilingv.[8][2]

Publicarea GLM‑5 sub licența MIT înseamnă absența restricțiilor formale privind utilizarea comercială a ponderilor deschise, ceea ce implică riscurile standard ale utilizării necontrolate, caracteristice LLM-urilor deschise.[4] Problemele legate de prejudecăți (bias) în corpusurile de preantrenare specifice limbii chineze și contextului cultural nu au fost cercetate sistematic în lucrările publice la momentul redactării acestui articol.

Perspective și direcții de cercetare

Pe baza rapoartelor tehnice publicate și a materialelor însoțitoare ale Z.ai, se evidențiază următoarele direcții declarate:[3][4]

  • Scalarea arhitecturilor MoE cu reducerea costului parametrilor activi per token.
  • Dezvoltarea algoritmilor asincrone de RL agentric pentru sarcini cu orizont lung.
  • Îmbunătățirea mecanismelor de atenție sparse (DSA) pentru contexte de peste 200K tokeni.
  • Raționament multimodal: dezvoltarea GLM‑4.1V‑Thinking spre înțelegerea video și a documentelor.
  • Reducerea dependenței de API-uri externe la execuția agentică a sarcinilor prin antrenarea agenților finali pe interacțiuni reale.
  • Optimizarea pentru infrastructura hardware națională (pentru Republica Populară Chineză) (Huawei Ascend, Cambricon) și reducerea amprentei de carbon a antrenamentului.
  • Integrarea cu platforme robotice și de calcul științific.

Vezi și

  • Arhitectura Transformer
  • BERT
  • GPT
  • T5
  • Arhitecturi Decoder‑only
  • Reinforcement Learning from Human Feedback
  • DeepSeek

Bibliografie

Note

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
  5. Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
  6. Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
  7. 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
  9. THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
  10. 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
  11. Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
  12. Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
  13. Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)