GLM (Zhipu AI) (TH)
GLM (General Language Model) — ตระกูลโมเดลภาษาขนาดใหญ่ (Large Language Model, LLM) ที่พัฒนาโดยบริษัท Zhipu AI (ตั้งแต่ปี 2025 ใช้ชื่อ Z.ai) ร่วมกับห้องปฏิบัติการ Knowledge Engineering Group (KEG) ภาควิชาวิทยาการคอมพิวเตอร์ มหาวิทยาลัยชิงหัว (ปักกิ่ง) ซีรีส์นี้ครอบคลุมโมเดลตั้งแต่ 6 ถึง 744 พันล้านพารามิเตอร์ โดยมุ่งเน้นภาษาจีนและภาษาอังกฤษเป็นหลัก จุดเด่นของสถาปัตยกรรมพื้นฐานคือฟังก์ชันวัตถุประสงค์ในการเรียนรู้ล่วงหน้าบนพื้นฐาน autoregressive blank infilling ซึ่งรวมคุณสมบัติของ encoder transformer และ decoder transformer ไว้ในรูปแบบเดียวกัน[1][2][3]
ซีรีส์นี้ประกอบด้วยโมเดลที่เรียนรู้ล่วงหน้าพื้นฐาน โมเดลสำหรับการสนทนา (ChatGLM) การขยายแบบ multimodal (GLM‑4V, CogVLM) เครื่องมือเฉพาะทาง (CodeGeeX สำหรับการสร้างโค้ด, WebGLM สำหรับการค้นหาเว็บ) และระบบเอเจนต์ (GLM‑4 All Tools, AutoGLM) วิวัฒนาการของตระกูลนี้สามารถติดตามได้ตั้งแต่ GLM‑10B (2021) และ GLM‑130B (2022) จนถึง GLM‑4 (2024), GLM‑4.5 (2025) และ GLM‑5 (2026) โดยมีการเปลี่ยนแปลงจากสถาปัตยกรรมแบบ dense ไปสู่ Mixture‑of‑Experts (MoE) และเน้นที่สถานการณ์เอเจนต์[2][4]
ประวัติและบริบท
บริบทเชิงสถาบัน
Zhipu AI ก่อตั้งในปี 2019 โดยศาสตราจารย์จากมหาวิทยาลัยชิงหัว ได้แก่ Tang Jie และ Li Juanzi บนพื้นฐานของห้องปฏิบัติการ KEG ที่เชี่ยวชาญด้านกราฟความรู้ ในปี 2020 บริษัทมุ่งความพยายามไปที่โมเดลภาษาขนาดใหญ่ ในปี 2023 ระดมทุนได้ 2.5 พันล้านหยวน (≈350 ล้านดอลลาร์สหรัฐ) โดยมีผู้ร่วมลงทุนได้แก่ Alibaba Group, Tencent, Ant Group, Meituan และ Xiaomi ในเดือนกรกฎาคม 2025 บริษัทเปลี่ยนชื่อแบรนด์สาธารณะเป็น Z.ai และในเดือนมกราคม 2026 ได้เข้าจดทะเบียนในตลาดหลักทรัพย์ฮ่องกง[5][6]
ผลงานสำคัญต้นกำเนิด: GLM (2021–2022)
บทความพื้นฐาน «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» เผยแพร่บน arXiv ในเดือนมีนาคม 2021 (arXiv:2103.10360) และได้รับการตอบรับในการประชุม ACL 2022 ผู้เขียน ได้แก่ Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang งานนี้มีแรงจูงใจจากข้อจำกัดของกระบวนทัศน์สถาปัตยกรรมที่มีอยู่เดิม: โมเดลประเภท encoder (BERT) เหมาะสมที่สุดสำหรับงาน Natural Language Understanding (NLU) โมเดลประเภท decoder (GPT) เหมาะสำหรับการสร้างข้อความ ส่วนโมเดลประเภท encoder‑decoder (T5) ต้องการพารามิเตอร์จำนวนมากขึ้น GLM เสนอแนวทางเดียวที่สามารถแก้ปัญหาทั้งสองประเภทได้[1][7]
ลำดับเวลาของการเปิดตัวหลัก
| ปี | โมเดล | คุณสมบัติสำคัญ |
|---|---|---|
| 2021 | GLM (พื้นฐาน), GLM‑10B | Autoregressive blank infilling, การเข้ารหัสตำแหน่งแบบ 2 มิติ; พารามิเตอร์ถึง 515M (พื้นฐาน) และ 10B |
| 2022 | GLM‑130B | 130B พารามิเตอร์, สองภาษา (จีน / อังกฤษ), น้ำหนักเปิด, การ quantization แบบ INT4 โดยไม่ต้อง fine-tuning; ได้รับการตอบรับใน ICLR 2023 |
| 2023, มีนาคม | ChatGLM‑6B (v1) | 6.2B พารามิเตอร์, ≈1T token สำหรับการเรียนรู้ล่วงหน้า, SFT + RLHF alignment, การ quantization แบบ INT4 (≈6 GB หน่วยความจำ) |
| 2023, มิถุนายน | ChatGLM2‑6B | 1.4T token, FlashAttention, Multi‑Query Attention (MQA), บริบทถึง 32K token |
| 2023, ตุลาคม | ChatGLM3‑6B | การปฏิบัติตามคำสั่งที่ดีขึ้น, รองรับ tool calling, Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T token สำหรับการเรียนรู้ล่วงหน้า, RoPE + GQA, บริบทถึง 128K / 1M token; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | เวอร์ชัน multimodal พร้อม visual encoder |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | สถาปัตยกรรม MoE (GLM‑4.5), การปรับปรุงการให้เหตุผลและการเขียนโค้ดต่อเนื่อง |
| 2025 | GLM‑4.1V‑Thinking | โมเดล visual-language พร้อมการให้เหตุผลแบบหลายขั้นตอนที่เสริมสร้างขึ้น (arXiv:2507.01006) |
| 2026, กุมภาพันธ์ | GLM‑5 | 744B พารามิเตอร์ (MoE), ≈40–44B ที่ใช้งานอยู่, บริบท 200K token, งานเอเจนต์; การฝึกบน Huawei Ascend |
ตระกูล GLM พัฒนาควบคู่กับโมเดลอื่นๆ ของ Zhipu AI ได้แก่ CodeGeeX สำหรับโค้ด, CogVLM / CogAgent สำหรับ visual-language, CogView สำหรับการสร้างภาพ รวมถึงระบบเฉพาะทาง WebGLM และ AgentLM[2]
พื้นฐานทางทฤษฎีและสถาปัตยกรรม
ฟังก์ชันวัตถุประสงค์ในการเรียนรู้ล่วงหน้า
สถาปัตยกรรมพื้นฐานของ GLM อิงบน Transformer จุดเด่นสำคัญคือ autoregressive blank infilling — รูปแบบของการสร้างแบบ autoregressive ที่โมเดลเรียนรู้การกู้คืนส่วนที่ขาดหายไป (spans) ในข้อความจากบริบท[1][7]
สมมติว่า คือลำดับอินพุต มีการเลือกส่วนต่อเนื่อง (spans) แบบสุ่ม ซึ่งถูกแทนที่ด้วย token [MASK] เดียว ก่อให้เกิดข้อความที่ถูกบิดเบือน โมเดลกู้คืนแต่ละส่วนแบบ autoregressive ตามลำดับการสลับที่สุ่ม:
โดยที่ คือลำดับที่เสียหายพร้อมส่วนที่ถูกปิดบัง, คือ token ที่กู้คืนแล้วของส่วนปัจจุบัน , คือส่วนก่อนหน้าที่กู้คืนอย่างสมบูรณ์แล้ว ลำดับการกู้คืนส่วนต่างๆ กำหนดโดยการสลับแบบสุ่มจากเซต ซึ่งช่วยให้โมเดลจัดการกับการพึ่งพากันระหว่างส่วนต่างๆ[1]
สำหรับการปรับงาน: เมื่อมีส่วนที่ขาดหายไปสั้น (≈15% ของ token) โมเดลจะถูกปรับให้เหมาะสมสำหรับ NLU เมื่อมีส่วนที่ยาว (ถึง 50–100% ของ token) จะเหมาะสำหรับงานสร้างข้อความ ทำให้โมเดลเดียวครอบคลุมทั้งสองโหมดผ่านการเรียนรู้ล่วงหน้าแบบหลายงาน (multi‑task learning)[1][7]
การเข้ารหัสตำแหน่งแบบ 2 มิติ
GLM นำเสนอ การเข้ารหัสตำแหน่งแบบสองมิติ เพื่อแยกแยะตำแหน่งในลำดับที่เสียหายต้นฉบับและตำแหน่งภายในส่วนที่กำลังกู้คืน:[1]
- มิติแรก : ตำแหน่งสัมบูรณ์ของ token (หรือ mask) ในลำดับที่เสียหาย
- มิติที่สอง : ตำแหน่งของ token ภายในส่วนของตัวเองระหว่างการสร้างแบบ autoregressive (0 สำหรับ token ต้นฉบับ)
รูปแบบนี้ช่วยให้สามารถแยกบริบทและข้อความที่สร้างขึ้นได้อย่างถูกต้องโดยไม่ต้องใช้องค์ประกอบสถาปัตยกรรมเพิ่มเติมคล้าย encoder
Attention Mask
ใน GLM ใช้ attention mask แบบสองส่วน: การ attention แบบสองทิศทาง (bidirectional) สำหรับ token ที่ไม่ถูกปิดบัง (Part A — บริบท) และการ attention แบบ causal สำหรับ token ภายในส่วนต่างๆ (Part B — spans ที่กู้คืน) ซึ่งช่วยให้เข้าใจบริบทของข้อความต้นฉบับได้อย่างสมบูรณ์ระหว่างการสร้างแบบ autoregressive ของส่วนที่กู้คืน ต่างจาก BERT (การทำนาย mask อิสระ) GLM คำนึงถึงการพึ่งพากันระหว่าง spans; ต่างจาก GPT — ใช้บริบทสองทิศทางของ Part A; ต่างจาก T5 — ไม่ต้องการ encoder แยกต่างหาก[1][7]
วิวัฒนาการขององค์ประกอบสถาปัตยกรรม
ในระดับพารามิเตอร์ของบล็อก Transformer สถานะซ่อน ที่ชั้น ในโมเดลตั้งแต่ GLM‑4 เป็นต้นไปได้รับการอัปเดตเป็น:
โดยที่ GQA คือ Grouped‑Query Attention (แทน Multi‑Head Attention เต็มรูปแบบ) และ FFN ถูกใช้งานผ่าน SwiGLU[2]
ตั้งแต่ GLM‑130B เป็นต้นไปในซีรีส์ มีการใช้องค์ประกอบสถาปัตยกรรมดังต่อไปนี้:
- GLM‑130B: DeepNorm สำหรับการทำให้การฝึกเครือข่ายลึกมีเสถียรภาพ; Rotary Positional Encoding (RoPE) พร้อมการขยายแบบ 2 มิติ; Gated Linear Units (GLU) พร้อม GeLU activation (GeGLU)[8]
- GLM‑4: เปลี่ยนมาใช้ RMSNorm และ SwiGLU; Group Query Attention (GQA) แทน Multi‑Head Attention (MHA) เพื่อลด KV‑cache; ลบเทอม bias ทั้งหมด ยกเว้น Q/K/V ใน attention; เพิ่มขนาด FFN เป็น เพื่อรักษาจำนวนพารามิเตอร์เมื่อใช้ GQA[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) พร้อม loss‑free balance routing และ sigmoid gates; โหมดการให้เหตุผลแบบผสม (thinking / non‑thinking)[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) สำหรับการประมวลผลบริบทยาวถึง 200K token อย่างมีประสิทธิภาพ; Multi‑Token Prediction (MTP) สำหรับ speculative decoding; การฝึกทั้งหมดบนโปรเซสเซอร์ Huawei Ascend โดยใช้ MindSpore[4]
การขยายขนาดและกฎการขยายขนาด
ในระหว่างการพัฒนาซีรีส์ ChatGLM มีการศึกษาความสัมพันธ์เชิงประจักษ์ระหว่างการสูญเสียในการเรียนรู้ล่วงหน้าและคุณภาพของงาน รวมถึงปรากฏการณ์ «emergent abilities» พบว่าเมื่อระดับการสูญเสียในการเรียนรู้ล่วงหน้าคงที่ โมเดลขนาดต่างๆ (และจำนวน token ต่างๆ) แสดงประสิทธิภาพที่ใกล้เคียงกัน และในงานบางอย่าง (MMLU, GSM8K) คุณภาพเริ่มเกินระดับสุ่มเฉพาะหลังจากถึงเกณฑ์การสูญเสียในการเรียนรู้ล่วงหน้าที่กำหนดเท่านั้น[2]
สถาปัตยกรรมและโมเดลในซีรีส์ GLM
GLM‑10B และ GLM‑130B
GLM‑10B (2021) — โมเดล 10 พันล้านพารามิเตอร์ที่แสดงให้เห็นถึงความเป็นไปได้ของสถาปัตยกรรม GLM พร้อม blank infilling และทำหน้าที่เป็นพื้นฐานสำหรับการขยายขนาดในภายหลัง[1]
GLM‑130B (2022) นำเสนอในเดือนตุลาคม 2022 และได้รับการตอบรับใน ICLR 2023 (arXiv:2210.02414):[8]
- จำนวนพารามิเตอร์: ≈130 พันล้าน (โมเดล dense สองภาษา)
- ปริมาณการเรียนรู้ล่วงหน้า: มากกว่า 400 พันล้าน token (≈200 พันล้านภาษาจีน, ≈200 พันล้านภาษาอังกฤษ)
- สถาปัตยกรรม: 70 ชั้น, hidden size 12,288, 96 attention head; DeepNorm, RoPE, GeGLU; การฝึกแบบหลายงานเพิ่มเติม (Multi‑Task Instruction Pretraining, MIP) — ≈5% ของ token บน 74 dataset สำหรับงาน NLU/NLG
- การ quantization: INT4 โดยไม่ต้อง fine-tuning หลัง quantization (post‑training quantization) — ผลลัพธ์ที่บันทึกไว้เป็นครั้งแรกในโมเดลขนาด 100B+ ประเภทนี้; สามารถ inference บน 4×RTX 3090 (24 GB) หรือ 8×RTX 2080 Ti (11 GB)
- ความเสถียรในการฝึก: ผู้เขียนบันทึก loss spike จำนวนมากและอธิบายกลยุทธ์การทำให้เสถียรที่ใช้ (gradient clipping, Embedding Gradient Shrink)
ในขณะที่เผยแพร่ GLM‑130B เหนือกว่า GPT‑3 175B (davinci) บน benchmark ภาษาอังกฤษชุดกว้าง (รวม 112 งาน) และ ERNIE TITAN 3.0 260B บนงานภาษาจีน; อย่างไรก็ตาม การเหนือกว่า OPT‑175B และ BLOOM‑176B ไม่ได้รับการยืนยัน — ผู้เขียนระบุข้อจำกัดนี้อย่างชัดเจน จากการประเมิน HELM (พฤศจิกายน 2022) GLM‑130B เทียบเคียงได้กับ GPT‑3 ในหลายตัวชี้วัด[8][2]
ตระกูล ChatGLM‑6B/2/3
ChatGLM‑6B (มีนาคม 2023) — โมเดลสนทนาที่มี 6.2 พันล้านพารามิเตอร์ พัฒนาร่วมกันโดย KEG และ Zhipu AI และเผยแพร่เป็นโครงการเปิด:[2][9]
- เรียนรู้ล่วงหน้าบน ≈1 ล้านล้าน token (จีน + อังกฤษ), บริบท 2K
- มุ่งเน้นการสนทนา; การ alignment เบื้องต้นดำเนินการส่วนใหญ่ด้วย SFT และ RLHF
- การ quantization แบบ INT4 ที่ใช้หน่วยความจำ ≈6 GB ซึ่งช่วยให้สามารถรันได้บนอุปกรณ์ของผู้ใช้ทั่วไป
ChatGLM2‑6B (มิถุนายน 2023):[2]
- เพิ่มปริมาณการเรียนรู้ล่วงหน้าเป็น 1.4 ล้านล้าน token
- เพิ่ม FlashAttention และ Multi‑Query Attention (MQA); ขยายบริบทเป็น 32K token
- การปรับปรุงที่สำคัญบน benchmark: MMLU +23 p.p., GSM8K +571%, BBH +60% เทียบกับ ChatGLM‑6B
ChatGLM3‑6B (ตุลาคม 2023):[2]
- การปรับปรุงเพิ่มเติมบน 42 benchmark ในด้านความหมาย คณิตศาสตร์ การให้เหตุผล โค้ด และความรู้
- รองรับ function call แบบ native, Code Interpreter ในตัว และงานเอเจนต์ผ่าน AgentTuning / AgentLM
GLM‑4, GLM‑4‑Air, GLM‑4‑9B และ GLM‑4 All Tools
รายงานทางเทคนิค (arXiv:2406.12793) อธิบาย GLM‑4 ว่าเป็นตระกูลโมเดลที่เรียนรู้ล่วงหน้าบน ≈10 ล้านล้าน token (ส่วนใหญ่ภาษาจีนและอังกฤษ บวกอีก 24 ภาษา) และ align สำหรับภาษาจีนและอังกฤษ[2]
รูปแบบหลัก:
- GLM‑4 (โมเดลหลัก เวอร์ชัน 0116 และ 0520): transformer แบบ dense, hidden size 6144, 61 ชั้น, 48 attention head, บริบท 128K
- GLM‑4‑Air — โมเดลที่กะทัดรัดและเร็วกว่า มีคุณภาพใกล้เคียง GLM‑4‑0116 แต่มีความล่าช้าน้อยกว่า
- GLM‑4‑9B — โมเดล 9 พันล้านพารามิเตอร์ (บริบท 8K, รูปแบบ 128K และทดลอง 1M) พร้อม pipeline หลัง training เดียวกัน
- GLM‑4 All Tools — เวอร์ชันที่ align เพิ่มเติมสำหรับการใช้งานเครื่องมือ: เว็บเบราว์เซอร์, Python interpreter, การสร้างภาพ (CogView3) และฟังก์ชันที่กำหนดเอง
คุณสมบัติสถาปัตยกรรมของ GLM‑4:[2]
- ไม่มีเทอม bias ยกเว้น Q/K/V ใน attention
- RMSNorm และ SwiGLU
- 2D‑RoPE
- Group Query Attention (GQA) พร้อม FFN ขยาย
- BPE tokenizer แบบ byte ขนาด 150K token ที่ได้จากการรวม BPE vocabulary ที่ฝึกแยกกันสำหรับภาษาจีนและ corpus หลายภาษาเข้ากับ cl100k_base
GLM‑4.5 (ARC foundation models)
GLM‑4.5 — โมเดล Mixture‑of‑Experts (MoE) แบบเปิดที่มุ่งเน้นงานเอเจนต์ การให้เหตุผล และการเขียนโค้ด (Agentic, Reasoning, Coding — ARC):[3]
- 355 พันล้านพารามิเตอร์รวม, 32 พันล้านพารามิเตอร์ที่ใช้งานอยู่ (สถาปัตยกรรม MoE แบบ sparse activation): 89 ชั้น, 160 ผู้เชี่ยวชาญ, 8 ที่ใช้งานต่อ token; 96 attention head, hidden size 5120
- GLM‑4.5‑Air: 106 พันล้านรวม / 12 พันล้านพารามิเตอร์ที่ใช้งานอยู่ — รูปแบบที่มีประสิทธิภาพ
- ฝึกบน 23 ล้านล้าน token พร้อม post‑training หลายขั้นตอนที่รวมการวนซ้ำโมเดลผู้เชี่ยวชาญและ RLHF
- โหมดการอนุมานแบบผสม (thinking mode และ direct response): ในกรณีแรกโมเดลสร้างเส้นทางการให้เหตุผลอย่างละเอียด; ในกรณีที่สองตอบโดยตรง การสลับควบคุมที่ระดับ inference pipeline
- Loss‑free balance routing พร้อม sigmoid gates สำหรับการกำหนดเส้นทางผู้เชี่ยวชาญ
- Optimizer Muon; การออกแบบ deeper‑and‑narrower
GLM‑4.6 / GLM‑4.7
ซีรีส์ GLM‑4.6 / 4.7 (กันยายน–ธันวาคม 2025) พัฒนาต่อยอดจากแนวคิด GLM‑4.5 โดยเสริมความสามารถด้านการเขียนโปรแกรม (SWE‑bench Verified / Multilingual) การให้เหตุผลที่ซับซ้อน (Humanity's Last Exam, AIME) และงานเอเจนต์ GLM‑4.7 บรรลุ 73.8% บน SWE‑bench Verified และนำเสนอ Interleaved / Preserved / Turn‑level Thinking — สามโหมดการรวมการให้เหตุผลในการสนทนา การกำหนดค่าบางส่วนเปิดเป็นโมเดล open‑weight[3][10]
GLM‑5
รายงานทางเทคนิคเผยแพร่เมื่อวันที่ 21 กุมภาพันธ์ 2026 (arXiv:2602.15763) คุณสมบัติหลัก:[4]
- สถาปัตยกรรม: Mixture‑of‑Experts ที่มีพารามิเตอร์รวม ≈744–745 พันล้าน, 256 ผู้เชี่ยวชาญ, 8 ถูกเปิดใช้งานสำหรับแต่ละ token (≈40–44 พันล้านพารามิเตอร์ที่ใช้งานอยู่, ≈5.9% ความหนาแน่น); 75 ชั้น MoE + 3 ชั้น dense
- การเรียนรู้ล่วงหน้า: 28.5 ล้านล้าน token
- หน้าต่างบริบท: 200K token
- Dynamic Sparse Attention (DSA): กลไก attention แบบ sparse ที่ลดต้นทุนการฝึกและ inference ในขณะที่รักษาคุณภาพบนบริบทยาว
- Multi‑Token Prediction (MTP): เทคนิคสำหรับ speculative decoding ระหว่าง inference
- โครงสร้างพื้นฐานทางเทคนิค: การฝึกดำเนินการทั้งหมดบนโปรเซสเซอร์ Huawei Ascend โดยใช้ framework MindSpore โดยไม่ต้องพึ่งพาอุปกรณ์ GPU จากผู้ผลิตอเมริกัน
- Post‑training: โครงสร้างพื้นฐาน Reinforcement Learning (RL) แบบ asynchronous พร้อมการแยก inference / training (decoupling inference / training); การใช้อัลกอริทึม RL แบบเอเจนต์สำหรับการโต้ตอบระยะยาว; Token‑in‑Token‑out (TITO) และการจัดการบริบทแบบลำดับชั้นสำหรับงานเอเจนต์ long‑horizon
- ใบอนุญาต: น้ำหนักเปิดภายใต้ใบอนุญาต MIT
ตารางสรุปโมเดลในซีรีส์
| โมเดล | ปี | พารามิเตอร์ (ทั้งหมด / ที่ใช้งานอยู่) | Token สำหรับการเรียนรู้ล่วงหน้า | บริบท | คุณสมบัติสำคัญ |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 พันล้าน / — | ≈400 พันล้าน | 2K | Dense, สองภาษา, DeepNorm, INT4 quantization |
| ChatGLM‑6B | 2023 | 6.2 พันล้าน / — | ≈1 ล้านล้าน | 2K | สนทนา, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6.2 พันล้าน / — | 1.4 ล้านล้าน | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6.2 พันล้าน / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | ไม่เปิดเผย (API) | ≈10 ล้านล้าน | 128K–1M | All Tools, multimodal (V) |
| GLM‑4‑9B | 2024 | ≈9 พันล้าน / — | ≈10 ล้านล้าน | 128K–1M | เวอร์ชันเปิด, GQA |
| GLM‑4.5 | 2025 | 355 พันล้าน / 32 พันล้าน | 23 ล้านล้าน | 128K | MoE, การคิดแบบผสม, ARC‑focus |
| GLM‑4.5‑Air | 2025 | 106 พันล้าน / 12 พันล้าน | 23 ล้านล้าน | 128K | รูปแบบ MoE ที่มีประสิทธิภาพ |
| GLM‑4.7 | 2025 | — | — | 128K | การเขียนโค้ดที่ปรับปรุงแล้ว, Interleaved Thinking |
| GLM‑5 | 2026 | 744 พันล้าน / ≈40 พันล้าน | 28.5 ล้านล้าน | 200K | DSA, MTP, วิศวกรรมเอเจนต์, Huawei Ascend |
การขยาย multimodal และเฉพาะทาง
- GLM‑4V‑9B — เวอร์ชัน multimodal พร้อม visual encoder สำหรับการประมวลผลภาพและเอกสาร[2]
- GLM‑4.1V‑Thinking — โมเดล visual-language พร้อมการให้เหตุผลแบบหลายขั้นตอนที่เสริมสร้างขึ้น (arXiv:2507.01006)[11]
- GLM‑4‑Voice — โมเดลเสียงแบบ end‑to‑end (9B base, ≈1 ล้านล้าน token เสียง‑ข้อความ, tokenizer 175 บิต/วินาที)[12]
- CodeGeeX — ตระกูลโมเดลโค้ด (CodeGeeX‑13B, CodeGeeX2‑6B) สำหรับการสร้าง เติมเต็ม และ refactor โค้ดในหลายภาษา; ฝังอยู่ใน IDE plugin[2]
- CogVLM / CogAgent — โมเดล visual-language สำหรับการเข้าใจภาพและการนำทาง GUI แบบอัตโนมัติ[2]
- WebGLM — โมเดลสำหรับการค้นหาเว็บและ QA; แสดงให้เห็นว่าโมเดลขนาด ≈10 พันล้านพารามิเตอร์ใกล้เคียงกับ WebGPT‑175B ในงานบางอย่าง (KDD 2023)[2]
การฝึก ข้อมูล และเทคโนโลยีช่วยเหลือ
ข้อมูลสำหรับการเรียนรู้ล่วงหน้า
คลังข้อมูลสำหรับการเรียนรู้ล่วงหน้าสำหรับ GLM‑4 และโมเดลก่อนหน้าประกอบด้วย:[2]
- หน้าเว็บหลายภาษา (ส่วนใหญ่ภาษาจีนและอังกฤษ), Wikipedia, หนังสือ, โค้ด และบทความวิชาการ
- Pipeline การประมวลผลสามขั้นตอน: การลบข้อมูลซ้ำ (ตรงทั้งหมดและ fuzzy), การกรอง (ลบข้อความที่มีเสียงรบกวนและอาจเป็นอันตราย) และการ tokenization
- Vocabulary เดียวขนาด 150K token ที่ได้จากการรวม BPE vocabulary ที่ฝึกแยกกันสำหรับภาษาจีนและ corpus หลายภาษาเข้ากับ cl100k_base (tiktoken)
ยืนยันเชิงประจักษ์ถึงความสำคัญของคุณภาพและความหลากหลายของข้อมูล อย่างไรก็ตามผู้เขียนไม่ได้กำหนดเกณฑ์พื้นฐานสำหรับการเลือกข้อมูลที่ชัดเจนนอกเหนือจากรูปแบบเชิงประจักษ์ที่เผยแพร่[2]
การขยายบริบทและ LongAlign
หน้าต่างบริบทเพิ่มขึ้นตามลำดับจาก 2K (ChatGLM‑6B) เป็น 32K (ChatGLM2/3) และต่อไปถึง 128K และ 1M token ใน GLM‑4 จากนั้นถึง 200K ใน GLM‑5 โดยใช้การรวมการขยายการเข้ารหัสตำแหน่ง (วิธีการปรับขนาดความถี่ตาม RoPE) และการ fine-tuning เพิ่มเติมบนข้อความยาว สูตรการ align พิเศษ LongAlign ช่วยรักษาคุณภาพบนอินพุตยาว: โดย LongBench‑Chat GLM‑4 (0520) แสดงผล 87.3 ในส่วนภาษาอังกฤษ (เทียบเคียงกับ GPT‑4 Turbo 1106: 87.2 และ Claude 3 Opus: 87.7) และ 84.0 ในภาษาจีน (สูงกว่า GPT‑4 Turbo และ Claude 3 Opus)[2]
Post‑training และการ align (SFT, RLHF)
Post‑training ประกอบด้วยสองขั้นตอนหลัก:[2]
- Supervised Fine‑Tuning (SFT): การฝึกบนคู่ «คำถาม–คำตอบ» โดยเน้นที่การโต้ตอบจริง (human‑authored) ไม่ใช่แบบเทมเพลตหรือที่สร้างขึ้น
- Reinforcement Learning from Human Feedback (RLHF): การปรับให้เหมาะสมตามความชอบของผู้ทำ annotation ผ่าน PPO, DPO และรูปแบบของตนเอง โดยเฉพาะ ChatGLM‑RLHF และ Self‑Contrast (ตัวอย่างเชิงลบสร้างขึ้นโดยโมเดลเอง ซึ่งช่วยลดความต้องการข้อมูลความชอบ)
เวกเตอร์คุณสมบัติสำหรับการประเมินคำตอบรวมถึงตัวชี้วัดด้านความปลอดภัย ความถูกต้องตามข้อเท็จจริง ความเกี่ยวข้อง ประโยชน์ และความสอดคล้องกับความชอบ ผู้เขียนสังเกตว่า RLHF ช่วยลดความถี่ในการปฏิเสธตอบ เพิ่มความปลอดภัย และความสอดคล้องในการสนทนาหลายรอบ[2]
เทคนิคเฉพาะทางในระบบนิเวศ GLM
- LongAlign — สูตรการ align บริบทยาว (ถึง 128K)[2]
- ChatGLM‑Math — การปรับปรุงการแก้โจทย์คณิตศาสตร์ด้วยรูปแบบ self‑critique (ประเมินคำตอบตัวเองโดยไม่ต้องใช้โมเดลภายนอก)[2]
- Self‑Contrast — รูปแบบ RLHF ที่ตัวอย่างเชิงลบสร้างขึ้นโดยโมเดลเอง[2]
- AgentTuning / AgentInstruct — framework และ dataset สำหรับการฝึกทักษะเอเจนต์บนเส้นทางการโต้ตอบของเอเจนต์กับสภาพแวดล้อม[2]
- APAR (Auto‑Parallel Auto‑Regressive) — อัลกอริทึม autoregressive generation แบบ auto-parallel สำหรับเร่งความเร็วในการ inference[2]
นอกจากนี้ยังมีการพัฒนา benchmark ต่างๆ ได้แก่: AgentBench (งานเอเจนต์), LongBench (บริบทยาว), AlignBench (การ align ภาษาจีน), HumanEval‑X (โค้ดนอกเหนือจาก Python), NaturalCodeBench (งานโปรแกรมเชิงปฏิบัติ)[2]
ผลลัพธ์สำคัญและ benchmark
ตัวชี้วัดทั้งหมดอ้างอิงจากรายงานทางเทคนิคต้นฉบับพร้อมระบุเงื่อนไข (zero‑/few‑shot, dataset, เวอร์ชันโมเดล) การเปรียบเทียบดำเนินการโดยผู้เขียนรายงานทางเทคนิค; การยืนยันจากภายนอกอิสระบนแพลตฟอร์มมาตรฐาน (LMSYS Chatbot Arena, Open LLM Leaderboard) สำหรับทุกเวอร์ชันยังไม่ได้รับการจัดระบบ
พลวัตคุณภาพ: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1.5 | 25.9 | 72.3 | 84.0 |
| MMLU (%) | 25.2 | 45.2 | 61.4 | 74.7 |
| HumanEval (%) | 0.0 | 9.8 | 58.5 | 70.1 |
| C‑Eval (%, จีน) | 23.7 | 51.7 | 69.0 | 77.1 |
โมเดลทั้งหมดประเมินใน BF16 ด้วยการตั้งค่าเดียวกัน[2]
GLM‑4 บน benchmark วิชาการ
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83.3 | 86.4 | 86.7 | 86.8 |
| GSM8K (%) | 93.3 | 92.0 | 95.6 | 95.0 |
| MATH (%) | 61.3 | 52.9 | 73.4 | 60.1 |
| BBH (%) | 84.7 | 83.1 | 88.2 | 86.8 |
| GPQA (%) | 39.9 | 35.7 | 49.3 | 50.4 |
| HumanEval (%) | 78.5 | 67.0 | 88.2 | 84.9 |
GLM‑4 (0520) บรรลุ ≈96.3% ของผลลัพธ์ GPT‑4 บน MMLU, เหนือกว่า GPT‑4 (0314) ใน MATH และ GSM8K แต่ยังตามหลัง GPT‑4 Turbo ใน MATH และ HumanEval[2]
บน AlignBench v1.1 (การ align ภาษาจีน) GLM‑4 (0520) แสดงคะแนนรวม 8.00 เทียบกับ 7.90 ของ GPT‑4 Turbo และ 7.53 ของ Claude 3 Opus โดยมีข้อได้เปรียบที่เห็นได้ชัดในตัวชี้วัดย่อย «Logic», «Language», «Professional»[2]
บน AgentBench GLM‑4 (0520) บรรลุคะแนนรวม 3.79 ซึ่งเทียบเคียงหรือสูงกว่า GPT‑4 Turbo (1106) และ Claude 3 Opus เล็กน้อย คะแนนสูงในงาน Database, House‑Holding และ Web‑Shopping; ตามหลังในงาน Operating System และ Lateral Thinking Puzzles[2]
บน Berkeley Function Call Leaderboard GLM‑4 (0520) บรรลุ 81.76% (GPT‑4 Turbo: 81.24%); GLM‑4‑9B‑Chat เหนือกว่า Llama‑3‑8B‑Instruct อย่างมีนัยสำคัญ (81.00% เทียบกับ 58.88%)[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | หมายเหตุ |
|---|---|---|
| TAU‑Bench (agentic avg) | 70.1% | งานเอเจนต์ |
| AIME 2024 | 91.0% | การแข่งขันคณิตศาสตร์ |
| SWE‑bench Verified | 64.2% | การแก้งานบน repository จริง |
| GPQA (Avg@8) | 79.1% | คำถามระดับบัณฑิตศึกษา |
| MATH‑500 | 98.2% | คณิตศาสตร์ |
| MMLU‑Pro | 84.6% | MMLU ขยาย |
เมื่อพิจารณาจำนวนพารามิเตอร์ที่ใช้งานอยู่ที่น้อยกว่า GLM‑4.5 อยู่ในอันดับที่ 3 ในบรรดาโมเดลที่ประเมินทั้งหมด (ตามการจัดอันดับรวมจาก 12 benchmark) และอันดับที่ 2 ในด้าน benchmark เอเจนต์ ณ เวลาที่เผยแพร่รายงาน[3]
GLM‑4.7
- SWE‑bench Verified: 73.8% (+5.8 p.p. เทียบกับ GLM‑4.5)
- Terminal‑Bench 2.0: 41.0% (+16.5 p.p.)
- Humanity's Last Exam (with tools): 42.8%[10]
GLM‑5
| Benchmark | GLM‑5 | หมายเหตุ |
|---|---|---|
| SWE‑bench Verified | 77.8% | ผู้นำในบรรดาโมเดล open‑weight ณ เวลาที่เผยแพร่ |
| GPQA‑Diamond | 86.0% | คำถามระดับบัณฑิตศึกษา |
| Terminal‑Bench 2.0 | 56.2–61.1% | งานวิศวกรรม |
| Humanity's Last Exam (with tools) | 50.4% | คำถามสหวิชาการที่ซับซ้อน |
| BrowseComp | 62.0% | การนำทางเว็บ |
GLM‑5 แสดงการปรับปรุง ≈20% ในตัวชี้วัดเฉลี่ยเทียบกับ GLM‑4.7 และอยู่ในตำแหน่งท่ามกลางโมเดล open‑weight ที่เทียบเคียงได้กับโมเดลปิดระดับ Claude Opus 4.5 ใน benchmark เอเจนต์และโค้ดบางส่วน[4]
ความปลอดภัย (SafetyBench)
บน SafetyBench (ชุดย่อยภาษาจีน) GLM‑4 (0520) บรรลุ 87.2% ในตัวชี้วัดแบบรวม ซึ่งเทียบเคียงกับ Claude 3 Opus (87.5%) และต่ำกว่า GPT‑4 เล็กน้อย (≈88–89.7%) ช่องว่างที่เห็นได้ชัดที่สุดเมื่อเทียบกับ GPT‑4 อยู่ในมิติ «Physical Health» (ความปลอดภัยทางกายภาพ)[2]
การประยุกต์ใช้และระบบนิเวศ
สถานการณ์การสนทนาและผู้ช่วย
ซีรีส์ ChatGLM และโมเดลที่ตามมาถูกใช้เป็นผู้ช่วยสนทนา รวมถึงบริการเชิงพาณิชย์ Zhipu Qingyan (chatglm.cn / chat.z.ai) พร้อมรองรับการสื่อสารหลายภาษา การสนทนาหลายรอบ และโหมดคำสั่ง[2]
ระบบเอเจนต์และเครื่องมือ
GLM‑4 All Tools และโมเดลที่ตามมาถูกรวมเข้ากับแพลตฟอร์มเอเจนต์ GLMs ที่ช่วยให้สร้างเอเจนต์ที่กำหนดเอง เชื่อมต่อ Python interpreter ในตัว เว็บเบราว์เซอร์ โมเดล VLM/T2I (CogView3) และใช้ API ภายนอกได้ รองรับงานประกอบ: การค้นหาเว็บ การวิเคราะห์ข้อมูลผ่าน Python, chain เครื่องมือแบบผสม GLM‑5 มุ่งเน้นงานวิศวกรรมซอฟต์แวร์ที่มีการวางแผนระยะยาว (agentic engineering) และทดสอบบน benchmark MCP‑Atlas และ BrowseComp[2][4]
การสร้างโค้ดและการพัฒนาซอฟต์แวร์
ตระกูล CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) และโหมดโค้ดของ GLM ใช้สำหรับการสร้างโค้ดในหลายภาษา การเติมเต็มและ refactoring การแก้งาน HumanEval และ HumanEval‑X บน HumanEval‑X CodeGeeX2‑6B ปรับปรุง Pass@1 เทียบกับ CodeGeeX‑13B (ตามข้อมูลของผู้เขียน: +57% ใน Python, +71% ใน C++) ผลิตภัณฑ์ CodeGeeX ฝังอยู่ใน IDE plugin สำหรับนักพัฒนา[2]
บริบทยาวและสถานการณ์ที่เน้นเอกสาร
GLM‑4‑9B‑Chat‑1M และโมเดลระดับสูงกว่าใช้สำหรับการวิเคราะห์เอกสารและคอลเลกชันขนาดใหญ่ (ถึง 1M token), การสรุป, การค้นหาในเอกสารยาว, การทำงานกับโค้ดยาว[2]
โครงสร้างพื้นฐานการปรับใช้
โมเดลมีให้บริการผ่านแพลตฟอร์ม API ของ Z.ai / bigmodel.cn (tool calling, agent frameworks) เวอร์ชันเปิดรองรับการปรับใช้ในเครื่องผ่าน vLLM, SGLang การรองรับ Huawei Ascend ช่วยให้ปรับใช้ได้โดยไม่ต้องใช้อุปกรณ์ NVIDIA โมเดลเปิดในซีรีส์ถูกดาวน์โหลดมากกว่า 10 ล้านครั้งบน Hugging Face (2023–2024)[2][4][13]
ข้อจำกัดและปัญหาที่ยังเปิดอยู่
- ความไม่สมดุลทางภาษา: ซีรีส์ GLM เรียนรู้ล่วงหน้าส่วนใหญ่บนภาษาจีนและอังกฤษ; คุณภาพในภาษาอื่นๆ ต่ำกว่าอย่างมีนัยสำคัญ ซึ่งระบุไว้อย่างชัดเจนในรายงานทางเทคนิค arXiv:2406.12793[2]
- การทำซ้ำ benchmark: ผลการเปรียบเทียบส่วนใหญ่อ้างอิงในรายงานทางเทคนิคของนักพัฒนาเอง การยืนยันจากภายนอกอิสระบนแพลตฟอร์มมาตรฐาน (LMSYS Chatbot Arena, Open LLM Leaderboard) สำหรับทุกเวอร์ชันยังไม่ได้รับการจัดระบบ
- Loss spike เมื่อขยายขนาด: การฝึก GLM‑130B มี loss spike จำนวนมากที่ต้องการการแทรกแซงด้วยตนเอง; ผู้เขียนบันทึกสิ่งนี้เป็นปัญหาวิศวกรรมที่ยังไม่ได้รับการแก้ไขเมื่อขยายขนาด[8]
- การพึ่งพาฮาร์ดแวร์: ตั้งแต่ GLM‑5 เป็นต้นไป การฝึกย้ายไปใช้ Huawei Ascend / MindSpore; การทำซ้ำอิสระบนแพลตฟอร์มฮาร์ดแวร์อื่นๆ ทำได้ยาก[4]
- Alignment และความปลอดภัย: แม้จะใช้ RLHF ปัญหาการปฏิเสธตอบ ความสอดคล้องในการสนทนาหลายรอบ และการหลีกเลี่ยงกลไกความปลอดภัยยังคงมีความเกี่ยวข้อง; ผู้เขียน arXiv:2406.12793 ระบุว่า RLHF ช่วยได้แต่ไม่แก้ปัญหาได้อย่างสมบูรณ์[2]
- Hallucination: เช่นเดียวกับ LLM อื่นๆ ปัญหาข้อผิดพลาดทางข้อเท็จจริงได้รับการบันทึก; การประเมินเชิงปริมาณแตกต่างกันตามงานและวิธีการ
- การให้เหตุผลทางคณิตศาสตร์: GLM‑4 ยังตามหลัง GPT‑4 Turbo ใน MATH และงานเลขคณิตที่ซับซ้อนบางส่วน แม้จะใช้วิธีการเฉพาะทาง (ChatGLM‑Math)[2]
- งานเอเจนต์: บน AgentBench ยังมีช่องว่างในงานที่เกี่ยวข้องกับการโต้ตอบระดับต่ำกับระบบปฏิบัติการและปริศนาตรรกะที่ซับซ้อน; คุณภาพ long‑horizon ยังเป็นปัญหาที่ยังไม่ได้รับการแก้ไข (การสะสมข้อผิดพลาดในงาน chained)[2][4]
- โค้ดและงานเชิงปฏิบัติ: บน NaturalCodeBench GLM‑4 (overall 47.1%) ต่ำกว่า GPT‑4 Turbo (53.8%) แม้จะเทียบเคียงได้กับ Claude 3 Opus (48.3%)[2]
ด้านจริยธรรมและกฎระเบียบ
ซีรีส์ GLM พัฒนาตามข้อกำหนดของหน่วยงานกำกับดูแลจีน (สำนักงานบริหารไซเบอร์สเปซของจีน, CAC) ในส่วนที่เกี่ยวกับการลงทะเบียนโมเดล generative และการผ่านการประเมินความปลอดภัย Post‑training รวมถึง SFT และ RLHF เพื่อลดความเป็นพิษและเนื้อหาที่เป็นอันตราย[2]
รายงานทางเทคนิค GLM‑4 อธิบายกระบวนการจัดการความเสี่ยงหลายขั้นตอน:[2]
- การทำความสะอาดล่วงหน้าของคลังข้อมูลสำหรับการเรียนรู้ล่วงหน้าจากข้อความที่มีเนื้อหาอาจเป็นอันตราย
- การกรองข้อมูล alignment ตามเกณฑ์ความปลอดภัย
- การทดสอบ red‑team: การสร้างคำขอที่เป็นอันตรายที่ซับซ้อนสำหรับการ fine-tuning
- การใช้ SafetyBench สำหรับการประเมินความปลอดภัยเชิงปริมาณ (7 มิติ)
โมเดลรุ่นแรก (GLM‑130B) แสดงระดับความลำเอียงที่ต่ำกว่าบน CrowS‑Pairs และความเป็นพิษที่ลดลงบน RealToxicPrompts เมื่อเทียบกับ GPT‑3 และ OPT ด้วยการฝึกสองภาษา[8][2]
การเปิดตัว GLM‑5 ภายใต้ใบอนุญาต MIT หมายความว่าไม่มีข้อจำกัดทางการสำหรับการใช้งานเชิงพาณิชย์ของน้ำหนักเปิด ซึ่งนำมาซึ่งความเสี่ยงมาตรฐานจากการใช้งานที่ไม่ถูกควบคุม ซึ่งเป็นลักษณะของ LLM แบบเปิด[4] ประเด็นความลำเอียง (bias) ในคลังข้อมูลสำหรับการเรียนรู้ล่วงหน้าที่เฉพาะเจาะจงสำหรับภาษาจีนและบริบททางวัฒนธรรม ยังไม่ได้รับการศึกษาอย่างเป็นระบบในผลงานสาธารณะ ณ เวลาที่เขียนบทความนี้
แนวโน้มและทิศทางการวิจัย
บนพื้นฐานของรายงานทางเทคนิคและเอกสารประกอบที่เผยแพร่ Z.ai ระบุทิศทางที่ประกาศไว้ดังต่อไปนี้:[3][4]
- การขยายขนาดสถาปัตยกรรม MoE พร้อมลดต้นทุนพารามิเตอร์ที่ใช้งานอยู่ต่อ token
- การพัฒนาอัลกอริทึม RL แบบเอเจนต์ asynchronous สำหรับงาน long‑horizon
- การปรับปรุงกลไก sparse attention (DSA) สำหรับบริบทที่เกิน 200K token
- การให้เหตุผลแบบ multimodal: การพัฒนา GLM‑4.1V‑Thinking ไปสู่การเข้าใจวิดีโอและเอกสาร
- การลดการพึ่งพา API ภายนอกระหว่างการดำเนินงานเอเจนต์ผ่านการฝึกเอเจนต์ปลายทางบนการโต้ตอบจริง
- การปรับให้เหมาะสมสำหรับฮาร์ดแวร์ในประเทศ (สำหรับจีน) (Huawei Ascend, Cambricon) และการลดรอยเท้าคาร์บอนในการฝึก
- การบูรณาการกับแพลตฟอร์มหุ่นยนต์และการคำนวณทางวิทยาศาสตร์
ดูเพิ่มเติม
- สถาปัตยกรรม Transformer
- BERT
- GPT
- T5
- สถาปัตยกรรม Decoder‑only
- Reinforcement Learning from Human Feedback
- DeepSeek
เอกสารอ้างอิง
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)