GLM (Zhipu AI) (EL)
GLM (General Language Model) — οικογένεια μεγάλων γλωσσικών μοντέλων (Large Language Model, LLM), που αναπτύχθηκαν από την εταιρεία Zhipu AI (από το 2025 — Z.ai) σε συνεργασία με το εργαστήριο Knowledge Engineering Group (KEG) της σχολής Πληροφορικής του Πανεπιστημίου Tsinghua (Πεκίνο). Η σειρά καλύπτει μοντέλα από 6 έως 744 δισεκατομμύρια παραμέτρους, προσανατολισμένα κυρίως στην κινεζική και την αγγλική γλώσσα. Χαρακτηριστικό γνώρισμα της αρχιτεκτονικής βάσης είναι η συνάρτηση στόχου προεκπαίδευσης βασισμένη στο αυτοπαλίνδρομο γέμισμα κενών (autoregressive blank infilling), που ενοποιεί τις ιδιότητες των transformer encoder και decoder σε ένα ενιαίο σχήμα.[1][2][3]
Η σειρά περιλαμβάνει βασικά προεκπαιδευμένα μοντέλα, διαλογικές παραλλαγές (ChatGLM), πολυτροπικές επεκτάσεις (GLM‑4V, CogVLM), εξειδικευμένα εργαλεία (CodeGeeX για παραγωγή κώδικα, WebGLM για αναζήτηση στον ιστό) και συστήματα πρακτόρων (GLM‑4 All Tools, AutoGLM). Η εξέλιξη της οικογένειας ιχνηλατείται από το GLM‑10B (2021) και το GLM‑130B (2022) έως το GLM‑4 (2024), το GLM‑4.5 (2025) και το GLM‑5 (2026), με μετάβαση από πυκνές (dense) αρχιτεκτονικές σε Mixture‑of‑Experts (MoE) και έμφαση στα σενάρια πρακτόρων.[2][4]
Ιστορία και προϋποθέσεις
Θεσμικό πλαίσιο
Η Zhipu AI ιδρύθηκε το 2019 από τους καθηγητές του Πανεπιστημίου Tsinghua Tang Jie και Li Juanzi στη βάση του εργαστηρίου KEG, το οποίο ειδικευόταν σε γράφους γνώσης. Το 2020 η εταιρεία εστίασε τις προσπάθειές της σε μεγάλης κλίμακας γλωσσικά μοντέλα. Το 2023 άντλησε επενδύσεις 2,5 δισεκατομμυρίων γιουάν (≈350 εκατ. δολάρια ΗΠΑ) με τη συμμετοχή των Alibaba Group, Tencent, Ant Group, Meituan και Xiaomi. Τον Ιούλιο 2025 η εταιρεία άλλαξε το δημόσιο brand της σε Z.ai, ενώ τον Ιανουάριο 2026 πραγματοποίησε IPO στο Χρηματιστήριο του Χονγκ Κονγκ.[5][6]
Θεμελιώδης εργασία: GLM (2021–2022)
Η βασική προδημοσίευση «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» δημοσιεύτηκε στο arXiv τον Μάρτιο 2021 (arXiv:2103.10360) και έγινε δεκτή στο συνέδριο ACL 2022. Συγγραφείς: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Η εργασία κινητοποιήθηκε από τους περιορισμούς των υφιστάμενων αρχιτεκτονικών παραδειγμάτων: τα μοντέλα encoder (BERT) είναι βέλτιστα για εργασίες κατανόησης φυσικής γλώσσας (Natural Language Understanding, NLU), τα decoder (GPT) — για παραγωγή, ενώ τα encoder‑decoder (T5) απαιτούν μεγαλύτερο αριθμό παραμέτρων. Το GLM πρότεινε μια ενιαία προσέγγιση ικανή να χειρίζεται και τις δύο κατηγορίες εργασιών.[1][7]
Χρονολόγιο κύριων εκδόσεων
| Έτος | Μοντέλο | Κύρια χαρακτηριστικά |
|---|---|---|
| 2021 | GLM (βασικό), GLM‑10B | Autoregressive blank infilling, 2D positional encoding· παράμετροι έως 515M (βασικό) και 10B |
| 2022 | GLM‑130B | 130B παράμετροι, δίγλωσσο (κινεζικά / αγγλικά), ανοιχτά βάρη, INT4‑κβαντισμός χωρίς fine-tuning· εγκρίθηκε στο ICLR 2023 |
| 2023, Μάρτιος | ChatGLM‑6B (v1) | 6,2B παράμετροι, ≈1T token προεκπαίδευσης, SFT + RLHF‑ευθυγράμμιση, INT4‑κβαντισμός (≈6 GB μνήμης) |
| 2023, Ιούνιος | ChatGLM2‑6B | 1,4T token, FlashAttention, Multi‑Query Attention (MQA), πλαίσιο έως 32K token |
| 2023, Οκτώβριος | ChatGLM3‑6B | Βελτιωμένη ακολουθία οδηγιών, υποστήριξη κλήσης εργαλείων (tool calling), Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T token προεκπαίδευσης, RoPE + GQA, πλαίσιο έως 128K / 1M token· GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | Πολυτροπική έκδοση με visual encoder |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | Αρχιτεκτονική MoE (GLM‑4.5), διαδοχικές βελτιώσεις συλλογισμού και κωδικοποίησης |
| 2025 | GLM‑4.1V‑Thinking | Οπτικο‑γλωσσικό μοντέλο με ενισχυμένο πολυβηματικό συλλογισμό (arXiv:2507.01006) |
| 2026, Φεβρουάριος | GLM‑5 | 744B παράμετροι (MoE), ≈40–44B ενεργοί, πλαίσιο 200K token, εργασίες πρακτόρων· εκπαίδευση σε Huawei Ascend |
Η οικογένεια GLM εξελίσσεται σε συνδυασμό με τα συνοδευτικά μοντέλα της Zhipu AI: τα μοντέλα κώδικα CodeGeeX, τα οπτικο‑γλωσσικά CogVLM / CogAgent, τα γεννητικά CogView, καθώς και τα εξειδικευμένα συστήματα WebGLM και AgentLM.[2]
Θεωρητικές και αρχιτεκτονικές βάσεις
Συνάρτηση στόχου προεκπαίδευσης
Η βασική αρχιτεκτονική GLM βασίζεται στον Transformer. Κύριο διακριτικό χαρακτηριστικό είναι το autoregressive blank infilling — μια παραλλαγή αυτοπαλίνδρομης μοντελοποίησης, στην οποία το μοντέλο μαθαίνει να αποκαθιστά κενά (spans) στο κείμενο βάσει του πλαισίου.[1][7]
Έστω — η ακολουθία εισόδου. Τυχαία επιλέγονται συνεχή τμήματα (spans) , τα οποία αντικαθίστανται από ένα μοναδικό token [MASK], σχηματίζοντας το αλλοιωμένο κείμενο . Το μοντέλο αποκαθιστά αυτοπαλίνδρομα κάθε τμήμα με τυχαία σειρά μεταθέσεων:
όπου — η κατεστραμμένη ακολουθία με αποκρυπτογραφημένα τμήματα, — τα ήδη αποκατεστημένα token του τρέχοντος τμήματος , — τα πλήρως αποκατεστημένα προηγούμενα τμήματα. Η σειρά αποκατάστασης των τμημάτων καθορίζεται από τυχαία μετάθεση από το σύνολο , επιτρέποντας στο μοντέλο να χειρίζεται εξαρτήσεις μεταξύ τμημάτων.[1]
Για τη ρύθμιση της εργασίας: με σύντομα κενά (≈15% token) το μοντέλο βελτιστοποιείται για NLU, με μεγάλα τμήματα (έως 50–100% token) — για γεννητικές εργασίες. Αυτό επιτρέπει σε ένα ενιαίο μοντέλο να καλύπτει και τους δύο τρόπους μέσω πολυεργασιακής προεκπαίδευσης (multi‑task learning).[1][7]
2D positional encoding
Το GLM εισάγει δισδιάστατες positional encoding για τη διάκριση θέσεων στην αρχική αλλοιωμένη ακολουθία και θέσεων εντός των αποκαθιστάμενων τμημάτων:[1]
- Πρώτη διάσταση : η απόλυτη θέση του token (ή της μάσκας) στην αλλοιωμένη ακολουθία.
- Δεύτερη διάσταση : η θέση του token εντός του τμήματός του κατά την αυτοπαλίνδρομη παραγωγή (0 για token του πρωτοτύπου).
Αυτό το σχήμα επιτρέπει την ορθή διάκριση πλαισίου και παραγόμενου κειμένου χωρίς πρόσθετα αρχιτεκτονικά στοιχεία ανάλογα του encoder.
Μάσκα προσοχής
Στο GLM εφαρμόζεται διμερής μάσκα προσοχής: αμφίδρομη (bidirectional) προσοχή για τα μη αποκρυπτογραφημένα token (Μέρος A — πλαίσιο) και αιτιώδης (causal) προσοχή για τα token εντός των τμημάτων (Μέρος B — αποκαθιστάμενα spans). Αυτό εξασφαλίζει πλήρη κατανόηση πλαισίου του αρχικού κειμένου κατά την αυτοπαλίνδρομη παραγωγή των αποκαθιστάμενων τμημάτων. Σε αντίθεση με το BERT (ανεξάρτητες προβλέψεις μασκών), το GLM λαμβάνει υπόψη τις εξαρτήσεις μεταξύ spans· σε αντίθεση με το GPT — χρησιμοποιεί αμφίδρομο πλαίσιο Μέρους A· σε αντίθεση με το T5 — δεν απαιτεί ξεχωριστό encoder.[1][7]
Εξέλιξη αρχιτεκτονικών στοιχείων
Στο επίπεδο παραμέτρων του μπλοκ Transformer, η κρυφή κατάσταση στο στρώμα στα μοντέλα από GLM‑4 και μετά ενημερώνεται ως:
όπου GQA — Grouped‑Query Attention (αντί του πλήρους Multi‑Head Attention), ενώ το FFN υλοποιείται μέσω SwiGLU.[2]
Από το GLM‑130B και μετά στη σειρά χρησιμοποιούνται τα ακόλουθα αρχιτεκτονικά στοιχεία:
- GLM‑130B: DeepNorm για σταθεροποίηση εκπαίδευσης βαθιών δικτύων· Rotary Positional Encoding (RoPE) με 2D‑επέκταση· Gated Linear Units (GLU) με GeLU‑ενεργοποίηση (GeGLU).[8]
- GLM‑4: μετάβαση σε RMSNorm και SwiGLU· Group Query Attention (GQA) αντί Multi‑Head Attention (MHA) για μείωση της KV‑κρυφής μνήμης· αφαιρέθηκαν όλοι οι bias όροι εκτός των Q/K/V στο attention· αυξημένο μέγεθος FFN σε για διατήρηση του αριθμού παραμέτρων με GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) με loss‑free balance routing και sigmoid gates· υβριδικός τρόπος συλλογισμού (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) για αποδοτική επεξεργασία μεγάλου πλαισίου έως 200K token· Multi‑Token Prediction (MTP) για κερδοσκοπική αποκωδικοποίηση· εκπαίδευση αποκλειστικά σε επεξεργαστές Huawei Ascend με χρήση MindSpore.[4]
Κλιμάκωση και νόμοι κλιμάκωσης
Κατά την ανάπτυξη της σειράς ChatGLM διερευνώνται εμπειρικές εξαρτήσεις μεταξύ της απώλειας προεκπαίδευσης και της ποιότητας σε εργασίες, συμπεριλαμβανομένου του φαινομένου των «emergent abilities». Αποδεικνύεται ότι για σταθερό επίπεδο απώλειας προεκπαίδευσης, μοντέλα διαφορετικών μεγεθών (και αριθμού token) επιδεικνύουν συγκρίσιμη απόδοση, ενώ σε ορισμένες εργασίες (MMLU, GSM8K) η ποιότητα ξεπερνά το τυχαίο επίπεδο μόνο αφού επιτευχθεί ένα ορισμένο κατώφλι απώλειας προεκπαίδευσης.[2]
Αρχιτεκτονικές και μοντέλα στη σειρά GLM
GLM‑10B και GLM‑130B
GLM‑10B (2021) — μοντέλο 10 δισεκατομμυρίων παραμέτρων που αποδεικνύει την εφαρμοσιμότητα της αρχιτεκτονικής GLM με blank infilling και χρησιμεύει ως βάση για την επακόλουθη κλιμάκωση.[1]
GLM‑130B (2022) παρουσιάστηκε τον Οκτώβριο 2022 και έγινε δεκτό στο ICLR 2023 (arXiv:2210.02414):[8]
- Αριθμός παραμέτρων: ≈130 δισεκατομμύρια (πυκνό δίγλωσσο μοντέλο).
- Όγκος προεκπαίδευσης: άνω των 400 δισεκατομμυρίων token (≈200 δισεκ. στα κινεζικά, ≈200 δισεκ. στα αγγλικά).
- Αρχιτεκτονική: 70 στρώματα, hidden size 12 288, 96 κεφαλές προσοχής· DeepNorm, RoPE, GeGLU· πρόσθετη πολυεργασιακή εκπαίδευση (Multi‑Task Instruction Pretraining, MIP) — ≈5% token σε 74 dataset εργασιών NLU/NLG.
- Κβαντισμός: INT4 χωρίς fine-tuning μετά τον κβαντισμό (post‑training quantization) — το πρώτο τεκμηριωμένο αποτέλεσμα αυτού του είδους μεταξύ μοντέλων 100B+· η εκτέλεση είναι δυνατή σε 4×RTX 3090 (24 GB) ή 8×RTX 2080 Ti (11 GB).
- Σταθερότητα εκπαίδευσης: οι συγγραφείς τεκμηριώνουν πολυάριθμες εκτοξεύσεις της συνάρτησης απώλειας (loss spikes) και περιγράφουν τις εφαρμοσθείσες στρατηγικές σταθεροποίησης (gradient clipping, Embedding Gradient Shrink).
Τη στιγμή της δημοσίευσης, το GLM‑130B υπερτερούσε του GPT‑3 175B (davinci) σε ένα ευρύ σύνολο αγγλόγλωσσων benchmark (συνολικά 112 εργασίες) και του ERNIE TITAN 3.0 260B σε κινεζόγλωσσες εργασίες· παράλληλα, η υπεροχή έναντι OPT‑175B και BLOOM‑176B δεν αναπαράχθηκε — οι συγγραφείς το αναφέρουν ρητά ως περιορισμό. Σύμφωνα με την αξιολόγηση HELM (Νοέμβριος 2022), το GLM‑130B είναι συγκρίσιμο με το GPT‑3 σε ορισμένες μετρικές.[8][2]
Οικογένεια ChatGLM‑6B/2/3
ChatGLM‑6B (Μάρτιος 2023) — διαλογικό μοντέλο με 6,2 δισεκατομμύρια παραμέτρους, που αναπτύχθηκε από κοινού από την KEG και τη Zhipu AI και δημοσιεύτηκε ως ανοιχτό έργο:[2][9]
- Προεκπαίδευση σε ≈1 τρισεκατομμύριο token (κινεζικά + αγγλικά), πλαίσιο 2K.
- Προσανατολισμένο στον διάλογο· η αρχική ευθυγράμμιση εκτελείται κυρίως με SFT και RLHF.
- INT4‑κβαντισμός με κατανάλωση ≈6 GB μνήμης, επιτρέποντας τοπική εκτέλεση σε καταναλωτικό εξοπλισμό.
ChatGLM2‑6B (Ιούνιος 2023):[2]
- Αυξημένος όγκος προεκπαίδευσης σε 1,4 τρισεκατομμύρια token.
- Εισαγωγή FlashAttention και Multi‑Query Attention (MQA)· πλαίσιο διευρυμένο σε 32K token.
- Σημαντική βελτίωση σε benchmark: MMLU +23 μ.μ., GSM8K +571%, BBH +60% σε σχέση με ChatGLM‑6B.
ChatGLM3‑6B (Οκτώβριος 2023):[2]
- Πρόσθετη βελτίωση σε 42 benchmark στους τομείς σημασιολογίας, μαθηματικών, συλλογισμού, κώδικα και γνώσης.
- Εγγενής υποστήριξη function call, ενσωματωμένου Code Interpreter και εργασιών πρακτόρων μέσω AgentTuning / AgentLM.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B και GLM‑4 All Tools
Η τεχνική έκθεση (arXiv:2406.12793) περιγράφει το GLM‑4 ως οικογένεια μοντέλων προεκπαιδευμένων σε ≈10 τρισεκατομμύρια token (κυρίως κινεζικά και αγγλικά, συν 24 επιπλέον γλώσσες) και ευθυγραμμισμένων για κινεζικά και αγγλικά.[2]
Κύριες παραλλαγές:
- GLM‑4 (flagship μοντέλο, εκδόσεις 0116 και 0520): πυκνός transformer, hidden size 6144, 61 στρώματα, 48 κεφαλές προσοχής, πλαίσιο 128K.
- GLM‑4‑Air — πιο συμπαγές και γρήγορο μοντέλο με ποιότητα κοντά στο GLM‑4‑0116 με μικρότερες καθυστερήσεις.
- GLM‑4‑9B — μοντέλο 9 δισεκατομμυρίων παραμέτρων (πλαίσιο 8K, παραλλαγές 128K και πειραματικό 1M) με τον ίδιο pipeline μεταεκπαίδευσης.
- GLM‑4 All Tools — έκδοση με πρόσθετη ευθυγράμμιση στη χρήση εργαλείων: πρόγραμμα περιήγησης ιστού, διερμηνευτής Python, παραγωγή εικόνων (CogView3) και προσαρμοσμένες συναρτήσεις.
Αρχιτεκτονικά χαρακτηριστικά GLM‑4:[2]
- Απουσία bias όρων εκτός των Q/K/V στο attention.
- RMSNorm και SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) με αυξημένο FFN.
- Byte BPE tokenizer μεγέθους 150K token, που προέκυψε από συνδυασμό ξεχωριστά εκπαιδευμένων BPE λεξιλογίων για κινεζικό και πολύγλωσσο σώμα κειμένου με cl100k_base.
GLM‑4.5 (ARC foundation models)
Το GLM‑4.5 είναι ανοιχτό μοντέλο Mixture‑of‑Experts (MoE) με έμφαση σε εργασίες πρακτόρων, συλλογισμού και κώδικα (Agentic, Reasoning, Coding — ARC):[3]
- 355 δισεκατομμύρια συνολικές παράμετροι, 32 δισεκατομμύρια ενεργές (αρχιτεκτονική MoE με sparse ενεργοποίηση): 89 στρώματα, 160 εμπειρογνώμονες, 8 ενεργοί ανά token· 96 κεφαλές προσοχής, hidden size 5120.
- GLM‑4.5‑Air: 106 δισεκ. συνολικές / 12 δισεκ. ενεργές παράμετροι — αποδοτική παραλλαγή.
- Εκπαίδευση σε 23 τρισεκατομμύρια token με πολυσταδιακή μεταεκπαίδευση που περιλαμβάνει επανάληψη εμπειρογνωμόνων μοντέλων και RLHF.
- Υβριδικός τρόπος εξόδου (thinking mode και direct response): στην πρώτη περίπτωση το μοντέλο παράγει αναλυτικό ίχνος συλλογισμού· στη δεύτερη — απαντά άμεσα. Η εναλλαγή ελέγχεται σε επίπεδο inference pipeline.
- Loss‑free balance routing με sigmoid gates για δρομολόγηση εμπειρογνωμόνων.
- Βελτιστοποιητής Muon· σχεδιασμός deeper‑and‑narrower.
GLM‑4.6 / GLM‑4.7
Η σειρά GLM‑4.6 / 4.7 (Σεπτέμβριος–Δεκέμβριος 2025) αναπτύσσει τις ιδέες του GLM‑4.5, ενισχύοντας τον προγραμματισμό (SWE‑bench Verified / Multilingual), τον πολύπλοκο συλλογισμό (Humanity's Last Exam, AIME) και τις εργασίες πρακτόρων. Το GLM‑4.7 επιτυγχάνει 73,8% στο SWE‑bench Verified και εισάγει Interleaved / Preserved / Turn‑level Thinking — τρεις τρόπους ενσωμάτωσης συλλογισμού στον διάλογο. Ορισμένες διαμορφώσεις είναι ανοιχτές ως open‑weight μοντέλα.[3][10]
GLM‑5
Η τεχνική έκθεση δημοσιεύτηκε στις 21 Φεβρουαρίου 2026 (arXiv:2602.15763). Κύρια χαρακτηριστικά:[4]
- Αρχιτεκτονική: Mixture‑of‑Experts με ≈744–745 δισεκατομμύρια συνολικές παραμέτρους, 256 εμπειρογνώμονες, 8 ενεργοποιούνται ανά token (≈40–44 δισεκ. ενεργές παράμετροι, ≈5,9% πυκνότητα)· 75 MoE στρώματα + 3 πυκνά στρώματα.
- Προεκπαίδευση: 28,5 τρισεκατομμύρια token.
- Παράθυρο πλαισίου: 200K token.
- Dynamic Sparse Attention (DSA): μηχανισμός αραιής προσοχής που μειώνει το κόστος εκπαίδευσης και εκτέλεσης διατηρώντας την ποιότητα σε μεγάλα πλαίσια.
- Multi‑Token Prediction (MTP): τεχνική για κερδοσκοπική αποκωδικοποίηση κατά την εκτέλεση.
- Τεχνική υποδομή: η εκπαίδευση εκτελέστηκε αποκλειστικά σε επεξεργαστές Huawei Ascend με χρήση του framework MindSpore, χωρίς εξάρτηση από εξοπλισμό GPU αμερικανικής κατασκευής.
- Μεταεκπαίδευση: ασύγχρονη υποδομή Reinforcement Learning (RL) με αποσύζευξη παραγωγής και εκπαίδευσης (decoupling inference / training)· εφαρμογή αλγορίθμων RL πρακτόρων για μακρόχρονη αλληλεπίδραση· Token‑in‑Token‑out (TITO) και ιεραρχική διαχείριση πλαισίου για εργασίες πρακτόρων με μεγάλο ορίζοντα.
- Άδεια: ανοιχτά βάρη υπό άδεια MIT.
Συγκεντρωτικός πίνακας μοντέλων της σειράς
| Μοντέλο | Έτος | Παράμετροι (σύνολο / ενεργές) | Token προεκπαίδευσης | Πλαίσιο | Κύρια χαρακτηριστικά |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 δισεκ. / — | ≈400 δισεκ. | 2K | Πυκνό, δίγλωσσο, DeepNorm, INT4‑κβαντισμός |
| ChatGLM‑6B | 2023 | 6,2 δισεκ. / — | ≈1 τρισεκ. | 2K | Διαλογικό, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6,2 δισεκ. / — | 1,4 τρισεκ. | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6,2 δισεκ. / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | δεν αποκαλύφθηκε (API) | ≈10 τρισεκ. | 128K–1M | All Tools, πολυτροπικότητα (V) |
| GLM‑4‑9B | 2024 | ≈9 δισεκ. / — | ≈10 τρισεκ. | 128K–1M | Ανοιχτή έκδοση, GQA |
| GLM‑4.5 | 2025 | 355 δισεκ. / 32 δισεκ. | 23 τρισεκ. | 128K | MoE, υβριδική σκέψη, εστίαση ARC |
| GLM‑4.5‑Air | 2025 | 106 δισεκ. / 12 δισεκ. | 23 τρισεκ. | 128K | Αποδοτική παραλλαγή MoE |
| GLM‑4.7 | 2025 | — | — | 128K | Βελτιωμένο coding, Interleaved Thinking |
| GLM‑5 | 2026 | 744 δισεκ. / ≈40 δισεκ. | 28,5 τρισεκ. | 200K | DSA, MTP, μηχανική πρακτόρων, Huawei Ascend |
Πολυτροπικές και εξειδικευμένες επεκτάσεις
- GLM‑4V‑9B — πολυτροπική έκδοση με visual encoder για επεξεργασία εικόνων και εγγράφων.[2]
- GLM‑4.1V‑Thinking — οπτικο‑γλωσσικό μοντέλο με ενισχυμένο πολυβηματικό συλλογισμό (arXiv:2507.01006).[11]
- GLM‑4‑Voice — end‑to‑end ομιλητικό μοντέλο (9B base, ≈1 τρισεκ. ομιλητικών‑κειμενικών token, tokenizer 175 bit/s).[12]
- CodeGeeX — οικογένεια μοντέλων κώδικα (CodeGeeX‑13B, CodeGeeX2‑6B) για παραγωγή, συμπλήρωση και αναδιοργάνωση κώδικα σε πολλές γλώσσες· ενσωματωμένο σε plugins IDE.[2]
- CogVLM / CogAgent — οπτικο‑γλωσσικά μοντέλα για κατανόηση εικόνων και αυτόνομη πλοήγηση σε GUI.[2]
- WebGLM — μοντέλο για αναζήτηση στον ιστό και QA· αποδείχθηκε ότι το μοντέλο ≈10 δισεκ. παραμέτρων πλησιάζει το WebGPT‑175B σε ορισμένες εργασίες (KDD 2023).[2]
Εκπαίδευση, δεδομένα και βοηθητικές τεχνολογίες
Δεδομένα προεκπαίδευσης
Το προεκπαιδευτικό σώμα κειμένου για το GLM‑4 και τα προηγούμενα μοντέλα περιλαμβάνει:[2]
- Πολύγλωσσες (κυρίως κινεζικές και αγγλικές) ιστοσελίδες, Wikipedia, βιβλία, κώδικα και επιστημονικά άρθρα.
- Τριστάδιο pipeline επεξεργασίας: αφαίρεση διπλοτύπων (ακριβής και fuzzy), φιλτράρισμα (αφαίρεση θορυβωδών και δυνητικά επικίνδυνων κειμένων) και tokenization.
- Ενιαίο λεξιλόγιο μεγέθους 150K token, που προέκυψε από συνδυασμό ξεχωριστά εκπαιδευμένων BPE λεξιλογίων για κινεζικό και πολύγλωσσο σώμα κειμένου με cl100k_base (tiktoken).
Εμπειρικά επιβεβαιώνεται η σημασία της ποιότητας και ποικιλίας των δεδομένων, ωστόσο οι συγγραφείς δεν διατυπώνουν ρητά θεμελιώδη κριτήρια επιλογής δεδομένων που να υπερβαίνουν τις δημοσιευμένες εμπειρικές νομοτέλειες.[2]
Επέκταση πλαισίου και LongAlign
Τα παράθυρα πλαισίου αυξάνονται σταδιακά από 2K (ChatGLM‑6B) σε 32K (ChatGLM2/3) και έπειτα σε 128K και 1M token στο GLM‑4, και στη συνέχεια σε 200K στο GLM‑5. Χρησιμοποιείται συνδυασμός επέκτασης positional encoding (μέθοδοι κλιμάκωσης συχνοτήτων βασισμένες σε RoPE) και πρόσθετου fine-tuning σε μεγάλα κείμενα. Η ειδική συνταγή ευθυγράμμισης LongAlign επιτρέπει τη διατήρηση ποιότητας σε μεγάλες εισόδους: στο LongBench‑Chat, το GLM‑4 (0520) επιτυγχάνει 87,3 στο αγγλικό τμήμα (συγκρίσιμο με GPT‑4 Turbo 1106: 87,2 και Claude 3 Opus: 87,7) και 84,0 στο κινεζικό (υψηλότερο από GPT‑4 Turbo και Claude 3 Opus).[2]
Μεταεκπαίδευση και ευθυγράμμιση (SFT, RLHF)
Η μεταεκπαίδευση περιλαμβάνει δύο κύρια στάδια:[2]
- Supervised Fine‑Tuning (SFT): εκπαίδευση σε ζεύγη «ερώτηση–απάντηση» με έμφαση σε πραγματικές (human‑authored) αλληλεπιδράσεις και όχι σε πρότυπα ή παραγόμενες.
- Reinforcement Learning from Human Feedback (RLHF): βελτιστοποίηση βάσει προτιμήσεων σχολιαστών μέσω PPO, DPO και ιδιόκτητων σχημάτων, ιδίως ChatGLM‑RLHF και Self‑Contrast (τα αρνητικά παραδείγματα παράγονται από το ίδιο το μοντέλο, μειώνοντας την ανάγκη για δεδομένα προτιμήσεων).
Ο διάνυσμα χαρακτηριστικών για την αξιολόγηση απαντήσεων περιλαμβάνει δείκτες ασφάλειας, ακρίβειας, συνάφειας, χρησιμότητας και συμμόρφωσης με προτιμήσεις. Οι συγγραφείς σημειώνουν ότι το RLHF μειώνει τη συχνότητα αρνήσεων, αυξάνει την ασφάλεια και τη συνεκτικότητα σε πολυγύριους διαλόγους.[2]
Εξειδικευμένες τεχνικές οικοσυστήματος GLM
- LongAlign — συνταγή ευθυγράμμισης μεγάλου πλαισίου (έως 128K).[2]
- ChatGLM‑Math — βελτίωση επίλυσης μαθηματικών προβλημάτων μέσω σχήματος self‑critique (αυτοαξιολόγηση απαντήσεων χωρίς εξωτερικά μοντέλα).[2]
- Self‑Contrast — σχήμα RLHF όπου τα αρνητικά παραδείγματα παράγονται από το ίδιο το μοντέλο.[2]
- AgentTuning / AgentInstruct — framework και dataset για εκπαίδευση ικανοτήτων πρακτόρων σε τροχιές αλληλεπίδρασης πράκτορα με περιβάλλον.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — αλγόριθμος αυτο‑παράλληλης αυτοπαλίνδρομης παραγωγής για επιτάχυνση της εκτέλεσης.[2]
Επίσης αναπτύχθηκε σειρά benchmark: AgentBench (εργασίες πρακτόρων), LongBench (μεγάλο πλαίσιο), AlignBench (κινεζική ευθυγράμμιση), HumanEval‑X (κώδικας πέραν Python), NaturalCodeBench (πρακτικές εργασίες προγραμματισμού).[2]
Κύρια αποτελέσματα και benchmark
Όλες οι μετρικές παρατίθενται σύμφωνα με τις πρωτότυπες τεχνικές εκθέσεις με αναφορά στις συνθήκες (zero‑/few‑shot, dataset, έκδοση μοντέλου). Η σύγκριση εκτελέστηκε από τους συγγραφείς των τεχνικών εκθέσεων· η ανεξάρτητη αναπαραγωγή σε τυποποιημένες πλατφόρμες (LMSYS Chatbot Arena, Open LLM Leaderboard) δεν έχει συστηματοποιηθεί για όλες τις εκδόσεις.
Δυναμική ποιότητας: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1,5 | 25,9 | 72,3 | 84,0 |
| MMLU (%) | 25,2 | 45,2 | 61,4 | 74,7 |
| HumanEval (%) | 0,0 | 9,8 | 58,5 | 70,1 |
| C‑Eval (%, κιν.) | 23,7 | 51,7 | 69,0 | 77,1 |
Όλα τα μοντέλα αξιολογήθηκαν σε BF16 με ίδιες ρυθμίσεις.[2]
GLM‑4 σε ακαδημαϊκά benchmark
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83,3 | 86,4 | 86,7 | 86,8 |
| GSM8K (%) | 93,3 | 92,0 | 95,6 | 95,0 |
| MATH (%) | 61,3 | 52,9 | 73,4 | 60,1 |
| BBH (%) | 84,7 | 83,1 | 88,2 | 86,8 |
| GPQA (%) | 39,9 | 35,7 | 49,3 | 50,4 |
| HumanEval (%) | 78,5 | 67,0 | 88,2 | 84,9 |
Το GLM‑4 (0520) επιτυγχάνει ≈96,3% του αποτελέσματος του GPT‑4 στο MMLU, υπερτερεί του GPT‑4 (0314) στα MATH και GSM8K, αλλά υστερεί έναντι του GPT‑4 Turbo στα MATH και HumanEval.[2]
Στο AlignBench v1.1 (κινεζική ευθυγράμμιση), το GLM‑4 (0520) επιτυγχάνει συνολική βαθμολογία 8,00 έναντι 7,90 του GPT‑4 Turbo και 7,53 του Claude 3 Opus, με αξιοσημείωτο πλεονέκτημα στους επιμέρους δείκτες «Logic», «Language», «Professional».[2]
Στο AgentBench, το GLM‑4 (0520) επιτυγχάνει συνολική βαθμολογία 3,79, συγκρίσιμη ή ελαφρώς υψηλότερη από το GPT‑4 Turbo (1106) και το Claude 3 Opus. Υψηλές επιδόσεις στις εργασίες Database, House‑Holding και Web‑Shopping· υστέρηση στις εργασίες Operating System και Lateral Thinking Puzzles.[2]
Στο Berkeley Function Call Leaderboard, το GLM‑4 (0520) επιτυγχάνει 81,76% (GPT‑4 Turbo: 81,24%)· το GLM‑4‑9B‑Chat υπερτερεί σημαντικά του Llama‑3‑8B‑Instruct (81,00% vs 58,88%).[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | Σημείωση |
|---|---|---|
| TAU‑Bench (agentic avg) | 70,1% | Εργασίες πρακτόρων |
| AIME 2024 | 91,0% | Μαθηματικοί διαγωνισμοί |
| SWE‑bench Verified | 64,2% | Επίλυση εργασιών σε πραγματικά αποθετήρια |
| GPQA (Avg@8) | 79,1% | Ερωτήσεις επιπέδου μεταπτυχιακού |
| MATH‑500 | 98,2% | Μαθηματικά |
| MMLU‑Pro | 84,6% | Εκτεταμένο MMLU |
Λαμβάνοντας υπόψη τον μικρότερο αριθμό ενεργών παραμέτρων, το GLM‑4.5 καταλαμβάνει την 3η θέση μεταξύ όλων των αξιολογημένων μοντέλων (σύμφωνα με τη συνολική κατάταξη από 12 benchmark) και τη 2η — στα benchmark πρακτόρων κατά τη στιγμή δημοσίευσης της έκθεσης.[3]
GLM‑4.7
- SWE‑bench Verified: 73,8% (+5,8 μ.μ. σε σχέση με το GLM‑4.5).
- Terminal‑Bench 2.0: 41,0% (+16,5 μ.μ.).
- Humanity's Last Exam (with tools): 42,8%.[10]
GLM‑5
| Benchmark | GLM‑5 | Σημείωση |
|---|---|---|
| SWE‑bench Verified | 77,8% | Κορυφαίο μεταξύ open‑weight μοντέλων κατά τη δημοσίευση |
| GPQA‑Diamond | 86,0% | Ερωτήσεις επιπέδου μεταπτυχιακού |
| Terminal‑Bench 2.0 | 56,2–61,1% | Μηχανικές εργασίες |
| Humanity's Last Exam (with tools) | 50,4% | Σύνθετες διεπιστημονικές ερωτήσεις |
| BrowseComp | 62,0% | Πλοήγηση στον ιστό |
Το GLM‑5 επιδεικνύει βελτίωση ≈20% κατά μέσο όρο σε σχέση με το GLM‑4.7 και κατέχει θέσεις μεταξύ open‑weight μοντέλων συγκρίσιμες με κλειστά μοντέλα επιπέδου Claude Opus 4.5 σε ορισμένα benchmark πρακτόρων και κώδικα.[4]
Ασφάλεια (SafetyBench)
Στο SafetyBench (κινεζικό υποσύνολο), το GLM‑4 (0520) επιτυγχάνει 87,2% στον συνολικό δείκτη, συγκρίσιμο με Claude 3 Opus (87,5%) και ελαφρώς κάτω από GPT‑4 (≈88–89,7%). Η πιο αισθητή διαφορά σε σχέση με το GPT‑4 παρατηρείται στη διάσταση «Physical Health» (σωματική ασφάλεια).[2]
Εφαρμογές και οικοσύστημα
Διαλογικά και βοηθητικά σενάρια
Η σειρά ChatGLM και τα επακόλουθα μοντέλα χρησιμοποιούνται ως διαλογικοί βοηθοί, συμπεριλαμβανομένης της εμπορικής υπηρεσίας Zhipu Qingyan (chatglm.cn / chat.z.ai), με υποστήριξη πολύγλωσσης επικοινωνίας, πολυγύριου διαλόγου και τρόπου οδηγιών.[2]
Συστήματα πρακτόρων και εργαλεία
Το GLM‑4 All Tools και τα επακόλουθα μοντέλα ενσωματώνονται στην πλατφόρμα πρακτόρων GLMs, επιτρέποντας τη δημιουργία προσαρμοσμένων πρακτόρων, τη σύνδεση ενσωματωμένου διερμηνευτή Python, προγράμματος περιήγησης ιστού, μοντέλων VLM/T2I (CogView3) και τη χρήση εξωτερικών API. Υποστηρίζονται σύνθετες εργασίες: αναζήτηση στον ιστό, ανάλυση δεδομένων μέσω Python, συνδυαστικές αλυσίδες εργαλείων. Το GLM‑5 εστιάζει σε εργασίες μηχανικής λογισμικού με μεγάλο ορίζοντα σχεδιασμού (agentic engineering) και δοκιμάστηκε στα benchmark MCP‑Atlas και BrowseComp.[2][4]
Παραγωγή κώδικα και ανάπτυξη λογισμικού
Η οικογένεια CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) και οι τρόποι κώδικα GLM χρησιμοποιούνται για παραγωγή κώδικα σε πολλές γλώσσες, συμπλήρωση και αναδιοργάνωση, επίλυση εργασιών HumanEval και HumanEval‑X. Στο HumanEval‑X, το CodeGeeX2‑6B βελτιώνει το Pass@1 σε σχέση με το CodeGeeX‑13B (σύμφωνα με τα στοιχεία των συγγραφέων: +57% σε Python, +71% σε C++). Το προϊόν CodeGeeX είναι ενσωματωμένο σε plugins IDE για προγραμματιστές.[2]
Μεγάλο πλαίσιο και σενάρια εστιασμένα σε έγγραφα
Το GLM‑4‑9B‑Chat‑1M και τα ανώτερα μοντέλα χρησιμοποιούνται για ανάλυση μεγάλων εγγράφων και συλλογών (έως 1M token), σύνοψη, αναζήτηση σε μεγάλα έγγραφα, εργασία με μεγάλο κώδικα.[2]
Υποδομή ανάπτυξης
Τα μοντέλα διατίθενται μέσω της πλατφόρμας API Z.ai / bigmodel.cn (tool calling, agent frameworks). Οι ανοιχτές εκδόσεις υποστηρίζουν τοπική ανάπτυξη μέσω vLLM, SGLang. Η υποστήριξη Huawei Ascend επιτρέπει ανάπτυξη χωρίς εξοπλισμό NVIDIA. Τα ανοιχτά μοντέλα της σειράς έχουν ληφθεί άνω των 10 εκατομμυρίων φορών στο Hugging Face (2023–2024).[2][4][13]
Περιορισμοί και ανοιχτά ζητήματα
- Γλωσσική ανισορροπία: η σειρά GLM έχει προεκπαιδευτεί κυρίως σε κινεζικά και αγγλικά· η ποιότητα σε άλλες γλώσσες είναι σημαντικά χαμηλότερη, κάτι που αναφέρεται ρητά στην τεχνική έκθεση arXiv:2406.12793.[2]
- Αναπαραγωγιμότητα benchmark: τα περισσότερα συγκριτικά αποτελέσματα παρατίθενται στις τεχνικές εκθέσεις των ίδιων των προγραμματιστών. Η ανεξάρτητη εξωτερική επικύρωση σε τυποποιημένες πλατφόρμες (LMSYS Chatbot Arena, Open LLM Leaderboard) δεν έχει συστηματοποιηθεί για όλες τις εκδόσεις.
- Loss spikes κατά την κλιμάκωση: η εκπαίδευση του GLM‑130B συνοδεύτηκε από πολυάριθμες εκτοξεύσεις της συνάρτησης απώλειας που απαιτούσαν χειροκίνητη παρέμβαση· οι συγγραφείς το τεκμηριώνουν ως άλυτο μηχανικό πρόβλημα κατά την κλιμάκωση.[8]
- Εξάρτηση από υλικό: από το GLM‑5 και μετά, η εκπαίδευση μεταφέρθηκε στο Huawei Ascend / MindSpore· η ανεξάρτητη αναπαραγωγή σε άλλες πλατφόρμες υλικού είναι δυσχερής.[4]
- Ευθυγράμμιση και ασφάλεια: παρά την εφαρμογή RLHF, τα ζητήματα άρνησης απάντησης, συνεκτικότητας σε πολυγύριους διαλόγους και παράκαμψης μηχανισμών ασφάλειας παραμένουν επίκαιρα· οι συγγραφείς του arXiv:2406.12793 αναφέρουν ότι το RLHF βοηθά αλλά δεν λύνει τα προβλήματα πλήρως.[2]
- Παραισθήσεις (Hallucinations): όπως και σε άλλα LLM, το πρόβλημα των πραγματολογικών σφαλμάτων είναι τεκμηριωμένο· οι ποσοτικές εκτιμήσεις ποικίλλουν ανάλογα με την εργασία και τη μεθοδολογία.
- Μαθηματικός συλλογισμός: το GLM‑4 υστερεί του GPT‑4 Turbo στο MATH και σε ορισμένες εργασίες σύνθετης αριθμητικής, αν και χρησιμοποιεί εξειδικευμένες μεθόδους (ChatGLM‑Math).[2]
- Εργασίες πρακτόρων: στο AgentBench παραμένει διαφορά στις εργασίες που σχετίζονται με αλληλεπίδραση χαμηλού επιπέδου με ΛΣ και σύνθετους λογικούς γρίφους· η ποιότητα μεγάλου ορίζοντα (long‑horizon) παραμένει άλυτο ζήτημα (συσσώρευση σφαλμάτων σε αλυσιδωτές εργασίες).[2][4]
- Κώδικας και πρακτικές εργασίες: στο NaturalCodeBench το GLM‑4 (overall 47,1%) υστερεί του GPT‑4 Turbo (53,8%), αν και είναι συγκρίσιμο με το Claude 3 Opus (48,3%).[2]
Ηθικές και ρυθμιστικές πτυχές
Η σειρά GLM αναπτύσσεται σύμφωνα με τις απαιτήσεις του κινεζικού ρυθμιστή (Διοίκηση Κυβερνοχώρου της ΛΔΚ, CAC) όσον αφορά την καταχώριση γεννητικών μοντέλων και την αξιολόγηση ασφάλειας. Η μεταεκπαίδευση περιλαμβάνει SFT και RLHF για τη μείωση τοξικότητας και επιβλαβούς περιεχομένου.[2]
Η τεχνική έκθεση GLM‑4 περιγράφει μια πολυσταδιακή διαδικασία διαχείρισης κινδύνων:[2]
- Προκαταρκτικός καθαρισμός του προεκπαιδευτικού σώματος κειμένου από κείμενα με δυνητικά επικίνδυνο περιεχόμενο.
- Φιλτράρισμα δεδομένων ευθυγράμμισης βάσει κριτηρίων ασφάλειας.
- Red‑team testing: δημιουργία σύνθετων κακόβουλων ερωτημάτων για fine-tuning.
- Χρήση SafetyBench για ποσοτική αξιολόγηση ασφάλειας (7 διαστάσεις).
Τα πρώιμα μοντέλα (GLM‑130B) επιδεικνύουν χαμηλότερο επίπεδο μεροληψίας στο CrowS‑Pairs και μειωμένη τοξικότητα στο RealToxicPrompts σε σύγκριση με GPT‑3 και OPT, χάρη στη δίγλωσση εκπαίδευση.[8][2]
Η κυκλοφορία του GLM‑5 υπό άδεια MIT σημαίνει απουσία τυπικών περιορισμών στη εμπορική χρήση ανοιχτών βαρών, κάτι που συνεπάγεται τους τυπικούς κινδύνους ανεξέλεγκτης χρήσης χαρακτηριστικούς για ανοιχτά LLM.[4] Τα ζητήματα μεροληψιών (bias) στα σώματα κειμένου προεκπαίδευσης, ειδικά για την κινεζική γλώσσα και πολιτισμικό πλαίσιο, δεν έχουν συστηματικά ερευνηθεί σε δημόσιες εργασίες κατά τη στιγμή συγγραφής του άρθρου.
Προοπτικές και κατευθύνσεις έρευνας
Βάσει των δημοσιευμένων τεχνικών εκθέσεων και συνοδευτικού υλικού της Z.ai, διακρίνονται οι ακόλουθες δηλωμένες κατευθύνσεις:[3][4]
- Κλιμάκωση αρχιτεκτονικών MoE με μείωση του κόστους ενεργών παραμέτρων ανά token.
- Ανάπτυξη ασύγχρονων αλγορίθμων RL πρακτόρων για εργασίες μεγάλου ορίζοντα.
- Βελτίωση μηχανισμών αραιής προσοχής (DSA) για πλαίσια άνω των 200K token.
- Πολυτροπικός συλλογισμός: ανάπτυξη του GLM‑4.1V‑Thinking προς κατανόηση βίντεο και εγγράφων.
- Μείωση εξάρτησης από εξωτερικά API κατά την εκτέλεση εργασιών πρακτόρων μέσω εκπαίδευσης τελικών πρακτόρων σε πραγματικές αλληλεπιδράσεις.
- Βελτιστοποίηση για εγχώριο (για την ΛΔΚ) υλικό (Huawei Ascend, Cambricon) και μείωση του αποτυπώματος άνθρακα κατά την εκπαίδευση.
- Ενσωμάτωση με ρομποτικές και επιστημονικές υπολογιστικές πλατφόρμες.
Δείτε επίσης
- Αρχιτεκτονική Transformer
- BERT
- GPT
- T5
- Αρχιτεκτονικές Decoder‑only
- Reinforcement Learning from Human Feedback
- DeepSeek
Βιβλιογραφία
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
Παραπομπές
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)