GLM (Zhipu AI) (FA)
GLM (General Language Model) — خانوادهای از مدلهای زبانی بزرگ (Large Language Model, LLM) که توسط شرکت Zhipu AI (از سال ۲۰۲۵ با نام Z.ai) به همراه آزمایشگاه Knowledge Engineering Group (KEG) دانشکده علوم کامپیوتر دانشگاه تسینگهوا (پکن) توسعه یافتهاند. این مجموعه شامل مدلهایی با پارامترهای ۶ تا ۷۴۴ میلیارد است که عمدتاً بر زبانهای چینی و انگلیسی تمرکز دارند. ویژگی بارز بنیان معماری آن، تابع هدف پیشآموزش مبتنی بر autoregressive blank infilling است که خواص transformerهای encoder و decoder را در یک طرح یکپارچه ادغام میکند.[1][2][3]
این مجموعه شامل مدلهای پایه پیشآموزشدیده، نسخههای گفتگومحور (ChatGLM)، بسطهای چندوجهی (GLM‑4V، CogVLM)، ابزارهای تخصصی (CodeGeeX برای تولید کد، WebGLM برای جستجوی وب) و سیستمهای عاملیتی (GLM‑4 All Tools، AutoGLM) میشود. تکامل این خانواده از GLM‑10B (2021) و GLM‑130B (2022) تا GLM‑4 (2024)، GLM‑4.5 (2025) و GLM‑5 (2026) قابل ردیابی است، با گذار از معماریهای متراکم (dense) به Mixture‑of‑Experts (MoE) و تأکید بر سناریوهای عاملیتی.[2][4]
تاریخچه و پیشزمینهها
بستر نهادی
Zhipu AI در سال ۲۰۱۹ توسط استادان دانشگاه تسینگهوا، تانگ جی (Tang Jie) و لی جوانزی (Li Juanzi)، بر پایه آزمایشگاه KEG که در گرافهای دانش تخصص داشت، تأسیس شد. در سال ۲۰۲۰، شرکت تمرکز خود را بر مدلهای زبانی در مقیاس بزرگ گذاشت. در سال ۲۰۲۳، ۲.۵ میلیارد یوان سرمایهگذاری (≈۳۵۰ میلیون دلار آمریکا) با مشارکت Alibaba Group، Tencent، Ant Group، Meituan و Xiaomi جذب شد. در ژوئیه ۲۰۲۵ شرکت برند عمومی خود را به Z.ai تغییر داد و در ژانویه ۲۰۲۶ در بورس اوراق بهادار هنگکنگ عرضه اولیه عمومی انجام داد.[5][6]
اثر بنیادی: GLM (2021–2022)
پیشنویس اصلی «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» در مارس ۲۰۲۱ در arXiv منتشر شد (arXiv:2103.10360) و در کنفرانس ACL 2022 پذیرفته گردید. نویسندگان: Zhengxiao Du، Yujie Qian، Xiao Liu، Ming Ding، Jiezhong Qiu، Zhilin Yang، Jie Tang. این اثر با انگیزه رفع محدودیتهای پارادایمهای معماری موجود نوشته شد: مدلهای encoder (BERT) برای وظایف درک زبان طبیعی (Natural Language Understanding, NLU) بهینه هستند، مدلهای decoder (GPT) برای تولید، و مدلهای encoder‑decoder (T5) به پارامترهای بیشتری نیاز دارند. GLM رویکردی یکپارچه پیشنهاد داد که قادر به حل هر دو دسته وظیفه است.[1][7]
جدول زمانی انتشارهای اصلی
| سال | مدل | ویژگیهای کلیدی |
|---|---|---|
| 2021 | GLM (پایه)، GLM‑10B | autoregressive blank infilling، کدگذاری موضعی دوبُعدی؛ پارامترها تا ۵۱۵M (پایه) و ۱۰B |
| 2022 | GLM‑130B | ۱۳۰ میلیارد پارامتر، دوزبانه (چینی / انگلیسی)، وزنهای باز، کوانتیزاسیون INT4 بدون fine-tuning؛ پذیرفتهشده در ICLR 2023 |
| ۲۰۲۳، مارس | ChatGLM‑6B (v1) | ۶.۲ میلیارد پارامتر، ≈۱ تریلیون token پیشآموزش، همراستایی SFT + RLHF، کوانتیزاسیون INT4 (≈۶ گیگابایت حافظه) |
| ۲۰۲۳، ژوئن | ChatGLM2‑6B | ۱.۴ تریلیون token، FlashAttention، Multi‑Query Attention (MQA)، پنجره context تا ۳۲K token |
| ۲۰۲۳، اکتبر | ChatGLM3‑6B | پیروی بهبودیافته از دستورالعملها، پشتیبانی از tool calling، Code Interpreter |
| 2024 | GLM‑4، GLM‑4‑Air، GLM‑4‑9B | ≈۱۰ تریلیون token پیشآموزش، RoPE + GQA، پنجره context تا ۱۲۸K / ۱M token؛ GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | نسخه چندوجهی با encoder بصری |
| 2025 | GLM‑4.5، GLM‑4.6، GLM‑4.7 | معماری MoE (GLM‑4.5)، بهبودهای پیاپی در استدلال و کدنویسی |
| 2025 | GLM‑4.1V‑Thinking | مدل زبانی‑بصری با استدلال چندمرحلهای تقویتشده (arXiv:2507.01006) |
| ۲۰۲۶، فوریه | GLM‑5 | ۷۴۴ میلیارد پارامتر (MoE)، ≈۴۰–۴۴ میلیارد فعال، پنجره context 200K token، وظایف عاملیتی؛ آموزش روی Huawei Ascend |
خانواده GLM در پیوند با مدلهای جانبی Zhipu AI توسعه مییابد: مدلهای کدنویسی CodeGeeX، مدلهای زبانی‑بصری CogVLM / CogAgent، مدلهای مولد CogView، و همچنین سیستمهای تخصصی WebGLM و AgentLM.[2]
مبانی نظری و معماری
تابع هدف پیشآموزش
معماری پایه GLM بر Transformer استوار است. ویژگی متمایز کلیدی آن autoregressive blank infilling است — نوعی مدلسازی خودبازگشتی که مدل در آن یاد میگیرد بخشهای حذفشده (span) را از روی context بازیابی کند.[1][7]
فرض کنید دنباله ورودی باشد. بخشهای پیوسته (span) به صورت تصادفی انتخاب میشوند و با یک token واحد [MASK] جایگزین میشوند تا متن آسیبدیده شکل گیرد. مدل هر بخش را به صورت خودبازگشتی با ترتیب جایگشت تصادفی بازیابی میکند:
که در آن دنباله آسیبدیده با بخشهای ماسکشده است، tokenهای از پیش بازیابیشده بخش جاری هستند، و بخشهای پیشین کاملاً بازیابیشدهاند. ترتیب بازیابی بخشها توسط جایگشت تصادفی از مجموعه تعیین میشود که به مدل امکان میدهد وابستگیهای بین بخشها را پردازش کند.[1]
برای تنظیم وظیفه: با spanهای کوتاه (≈۱۵٪ از tokenها) مدل برای NLU بهینه میشود، و با بخشهای طولانی (تا ۵۰–۱۰۰٪ tokenها) برای وظایف مولد. این امر به یک مدل واحد اجازه میدهد هر دو رژیم را از طریق پیشآموزش چندوظیفهای (multi‑task learning) پوشش دهد.[1][7]
کدگذاری موضعی دوبُعدی
GLM کدگذاریهای موضعی دوبُعدی را برای تمایز موضعها در دنباله آسیبدیده اصلی و موضعها درون بخشهای در حال بازیابی معرفی میکند:[1]
- بُعد اول : موضع مطلق token (یا ماسک) در دنباله آسیبدیده.
- بُعد دوم : موضع token درون بخش خود هنگام تولید خودبازگشتی (۰ برای tokenهای اصلی).
این طرح امکان تمایز صحیح بین context و متن تولیدشده را بدون نیاز به عناصر معماری اضافی مشابه encoder فراهم میکند.
ماسک توجه
در GLM یک ماسک توجه دوبخشی بهکار میرود: توجه دوطرفه (bidirectional) برای tokenهای بدون ماسک (بخش A — context) و توجه علّی (causal) برای tokenهای درون spanها (بخش B — spanهای در حال بازیابی). این امر درک تمامپیوند متن اصلی را در کنار تولید خودبازگشتی بخشهای بازیابیشده تضمین میکند. برخلاف BERT (پیشبینیهای مستقل ماسک) GLM وابستگیهای بین spanها را در نظر میگیرد؛ برخلاف GPT از context دوطرفه بخش A استفاده میکند؛ و برخلاف T5 به encoder جداگانه نیاز ندارد.[1][7]
تکامل اجزای معماری
در سطح پارامترهای بلوک Transformer، حالت پنهان در لایه در مدلهای از GLM‑4 به بعد به صورت زیر بهروزرسانی میشود:
که در آن GQA همان Grouped‑Query Attention (به جای Multi‑Head Attention کامل) است، و FFN از طریق SwiGLU پیادهسازی شده است.[2]
از GLM‑130B به بعد و در ادامه مجموعه، اجزای معماری زیر استفاده میشوند:
- GLM‑130B: DeepNorm برای پایدارسازی آموزش شبکههای عمیق؛ Rotary Positional Encoding (RoPE) با بسط دوبُعدی؛ Gated Linear Units (GLU) با فعالسازی GeLU (GeGLU).[8]
- GLM‑4: گذار به RMSNorm و SwiGLU؛ Group Query Attention (GQA) به جای Multi‑Head Attention (MHA) برای کاهش KV‑cache؛ حذف تمام جملات bias به جز Q/K/V در attention؛ افزایش اندازه FFN به برای حفظ تعداد پارامترها با GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) با مسیریابی loss‑free balance و sigmoid gates؛ رژیم ترکیبی استدلال (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) برای پردازش کارآمد context طولانی تا ۲۰۰K token؛ Multi‑Token Prediction (MTP) برای رمزگشایی احتمالی (speculative decoding)؛ آموزش کامل روی پردازندههای Huawei Ascend با استفاده از MindSpore.[4]
مقیاسبندی و قوانین مقیاسبندی
در جریان توسعه خط ChatGLM، وابستگیهای تجربی میان افت پیشآموزش و کیفیت در وظایف، از جمله پدیده «emergent abilities»، بررسی میشوند. نشان داده شده است که با سطح ثابت افت پیشآموزش، مدلهای با اندازههای مختلف (و تعداد tokenهای مختلف) عملکرد مشابهی نشان میدهند، و در برخی وظایف (MMLU، GSM8K) کیفیت تنها پس از رسیدن به آستانه مشخصی از افت پیشآموزش از سطح تصادفی فراتر میرود.[2]
معماریها و مدلهای مجموعه GLM
GLM‑10B و GLM‑130B
GLM‑10B (2021) — مدلی با ۱۰ میلیارد پارامتر که کاربردپذیری معماری GLM با blank infilling را نشان داده و به عنوان پایه برای مقیاسبندی بعدی عمل میکند.[1]
GLM‑130B (2022) در اکتبر ۲۰۲۲ معرفی شد و در ICLR 2023 پذیرفته گردید (arXiv:2210.02414):[8]
- تعداد پارامترها: ≈۱۳۰ میلیارد (مدل متراکم دوزبانه).
- حجم پیشآموزش: بیش از ۴۰۰ میلیارد token (≈۲۰۰ میلیارد به چینی، ≈۲۰۰ میلیارد به انگلیسی).
- معماری: ۷۰ لایه، hidden size 12288، ۹۶ سر توجه؛ DeepNorm، RoPE، GeGLU؛ آموزش چندوظیفهای اضافی (Multi‑Task Instruction Pretraining, MIP) — ≈۵٪ tokenها روی ۷۴ dataset وظیفه NLU/NLG.
- کوانتیزاسیون: INT4 بدون fine-tuning پس از کوانتیزاسیون (post‑training quantization) — اولین نتیجه مستند از این نوع در میان مدلهای +100B؛ استنتاج روی 4×RTX 3090 (24 گیگابایت) یا 8×RTX 2080 Ti (11 گیگابایت) امکانپذیر است.
- پایداری آموزش: نویسندگان جهشهای متعدد تابع افت (loss spikes) را مستند کرده و استراتژیهای پایدارسازی بهکاررفته (gradient clipping، Embedding Gradient Shrink) را شرح میدهند.
در زمان انتشار، GLM‑130B از GPT‑3 175B (davinci) در مجموعه گستردهای از benchmarkهای انگلیسیزبان (در مجموع ۱۱۲ وظیفه) و از ERNIE TITAN 3.0 260B در وظایف چینیزبان پیشی گرفت؛ اما برتری نسبت به OPT‑175B و BLOOM‑176B بازتولید نشد — نویسندگان صریحاً به این محدودیت اشاره میکنند. بر اساس ارزیابی HELM (نوامبر ۲۰۲۲) GLM‑130B از نظر برخی معیارها با GPT‑3 قابل مقایسه است.[8][2]
خانواده ChatGLM‑6B/2/3
ChatGLM‑6B (مارس ۲۰۲۳) — مدل گفتگومحور با ۶.۲ میلیارد پارامتر که به صورت مشترک توسط KEG و Zhipu AI توسعه یافته و به عنوان پروژهای متنباز منتشر شده است:[2][9]
- پیشآموزش روی ≈۱ تریلیون token (چینی + انگلیسی)، پنجره context 2K.
- بهینهشده برای گفتگو؛ همراستایی اولیه عمدتاً با SFT و RLHF انجام میشود.
- کوانتیزاسیون INT4 با مصرف ≈۶ گیگابایت حافظه، که اجرای محلی روی سختافزار مصرفکننده را ممکن میساخت.
ChatGLM2‑6B (ژوئن ۲۰۲۳):[2]
- حجم پیشآموزش به ۱.۴ تریلیون token افزایش یافت.
- FlashAttention و Multi‑Query Attention (MQA) معرفی شدند؛ پنجره context به ۳۲K token گسترش یافت.
- پیشرفت قابل توجه در benchmarkها: MMLU +23 امتیاز درصدی، GSM8K +571٪، BBH +60٪ نسبت به ChatGLM‑6B.
ChatGLM3‑6B (اکتبر ۲۰۲۳):[2]
- پیشرفت اضافی در ۴۲ benchmark در حوزههای معنایی، ریاضیات، استدلال، کد و دانش.
- پشتیبانی بومی از function call، Code Interpreter داخلی و وظایف عاملیتی از طریق AgentTuning / AgentLM.
GLM‑4، GLM‑4‑Air، GLM‑4‑9B و GLM‑4 All Tools
گزارش فنی (arXiv:2406.12793) GLM‑4 را به عنوان خانوادهای از مدلها توصیف میکند که روی ≈۱۰ تریلیون token (عمدتاً چینی و انگلیسی، به علاوه ۲۴ زبان دیگر) پیشآموزش دیدهاند و برای چینی و انگلیسی همراستا شدهاند.[2]
نسخههای کلیدی:
- GLM‑4 (مدل پرچمدار، نسخههای 0116 و 0520): transformer متراکم، hidden size 6144، ۶۱ لایه، ۴۸ سر توجه، پنجره context 128K.
- GLM‑4‑Air — مدلی فشردهتر و سریعتر با کیفیتی نزدیک به GLM‑4‑0116 با تأخیر کمتر.
- GLM‑4‑9B — مدل ۹ میلیارد پارامتری (context 8K، نسخههای 128K و آزمایشی 1M) با همان pipeline پسآموزش.
- GLM‑4 All Tools — نسخهای که به طور اضافی برای استفاده از ابزارها همراستا شده است: مرورگر وب، مفسر Python، تولید تصویر (CogView3) و توابع سفارشی.
ویژگیهای معماری GLM‑4:[2]
- عدم وجود جملات bias به جز Q/K/V در attention.
- RMSNorm و SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) با FFN بزرگتر.
- tokenizer بایتی BPE با اندازه ۱۵۰K token، به دست آمده از ترکیب دیکشنریهای BPE بهطور جداگانه آموزشدیده برای corpus چینی و چندزبانه با cl100k_base.
GLM‑4.5 (مدلهای بنیادی ARC)
GLM‑4.5 یک مدل باز Mixture‑of‑Experts (MoE) با تأکید بر وظایف عاملیتی، استدلالی و کدنویسی (Agentic، Reasoning، Coding — ARC) است:[3]
- ۳۵۵ میلیارد پارامتر کل، ۳۲ میلیارد فعال (معماری MoE با فعالسازی sparse): ۸۹ لایه، ۱۶۰ متخصص، ۸ فعال به ازای هر token؛ ۹۶ سر توجه، hidden size 5120.
- GLM‑4.5‑Air: ۱۰۶ میلیارد کل / ۱۲ میلیارد پارامتر فعال — نسخهای کارآمد.
- آموزش روی ۲۳ تریلیون token با پسآموزش چندمرحلهای شامل تکرار مدلهای متخصص و RLHF.
- رژیم ترکیبی استنتاج (حالت thinking و پاسخ مستقیم): در حالت اول مدل یک trace استدلالی گسترده تولید میکند؛ در حالت دوم مستقیماً پاسخ میدهد. سوئیچینگ در سطح inference pipeline مدیریت میشود.
- مسیریابی loss‑free balance با sigmoid gates برای هدایت متخصصان.
- بهینهساز Muon؛ طراحی deeper‑and‑narrower.
GLM‑4.6 / GLM‑4.7
مجموعه GLM‑4.6 / 4.7 (سپتامبر–دسامبر ۲۰۲۵) ایدههای GLM‑4.5 را توسعه میدهد و برنامهنویسی (SWE‑bench Verified / Multilingual)، استدلال پیچیده (Humanity's Last Exam، AIME) و وظایف عاملیتی را تقویت میکند. GLM‑4.7 به ۷۳.۸٪ در SWE‑bench Verified دست مییابد و سه رژیم ادغام استدلال در گفتگو را معرفی میکند: Interleaved / Preserved / Turn‑level Thinking. پیکربندیهای جداگانه به صورت مدلهای open‑weight منتشر شدهاند.[3][10]
GLM‑5
گزارش فنی در ۲۱ فوریه ۲۰۲۶ منتشر شد (arXiv:2602.15763). مشخصات اصلی:[4]
- معماری: Mixture‑of‑Experts با ≈۷۴۴–۷۴۵ میلیارد پارامتر کل، ۲۵۶ متخصص، ۸ متخصص به ازای هر token فعال میشوند (≈۴۰–۴۴ میلیارد پارامتر فعال، ≈۵.۹٪ چگالی)؛ ۷۵ لایه MoE + ۳ لایه متراکم.
- پیشآموزش: ۲۸.۵ تریلیون token.
- پنجره context: ۲۰۰K token.
- Dynamic Sparse Attention (DSA): مکانیزم توجه تُنُک که هزینههای آموزش و استنتاج را در حین حفظ کیفیت روی contextهای طولانی کاهش میدهد.
- Multi‑Token Prediction (MTP): تکنیکی برای رمزگشایی احتمالی (speculative decoding) در استنتاج.
- زیرساخت فنی: آموزش کامل روی پردازندههای Huawei Ascend با استفاده از چارچوب MindSpore، بدون وابستگی به تجهیزات GPU ساخت آمریکا انجام شده است.
- پسآموزش: زیرساخت Reinforcement Learning (RL) ناهمزمان با جداسازی تولید و آموزش (decoupling inference / training)؛ بهکارگیری الگوریتمهای RL عاملیتی برای تعامل با افق بلندمدت؛ Token‑in‑Token‑out (TITO) و مدیریت سلسلهمراتبی context برای وظایف عاملیتی long‑horizon.
- مجوز: وزنهای باز تحت مجوز MIT.
جدول مقایسهای مدلهای مجموعه
| مدل | سال | پارامترها (کل / فعال) | tokenهای پیشآموزش | context | ویژگیهای کلیدی |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | ۱۳۰ میلیارد / — | ≈۴۰۰ میلیارد | 2K | متراکم، دوزبانه، DeepNorm، کوانتیزاسیون INT4 |
| ChatGLM‑6B | 2023 | ۶.۲ میلیارد / — | ≈۱ تریلیون | 2K | گفتگومحور، SFT + RLHF، INT4 (≈۶ گیگابایت) |
| ChatGLM2‑6B | 2023 | ۶.۲ میلیارد / — | ۱.۴ تریلیون | 32K | FlashAttention، MQA |
| ChatGLM3‑6B | 2023 | ۶.۲ میلیارد / — | — | 32K | Function call، Code Interpreter، AgentTuning |
| GLM‑4 | 2024 | فاش نشده (API) | ≈۱۰ تریلیون | 128K–1M | All Tools، چندوجهی (V) |
| GLM‑4‑9B | 2024 | ≈۹ میلیارد / — | ≈۱۰ تریلیون | 128K–1M | نسخه باز، GQA |
| GLM‑4.5 | 2025 | ۳۵۵ میلیارد / ۳۲ میلیارد | ۲۳ تریلیون | 128K | MoE، تفکر ترکیبی، تمرکز ARC |
| GLM‑4.5‑Air | 2025 | ۱۰۶ میلیارد / ۱۲ میلیارد | ۲۳ تریلیون | 128K | نسخه کارآمد MoE |
| GLM‑4.7 | 2025 | — | — | 128K | کدنویسی بهبودیافته، Interleaved Thinking |
| GLM‑5 | 2026 | ۷۴۴ میلیارد / ≈۴۰ میلیارد | ۲۸.۵ تریلیون | 200K | DSA، MTP، مهندسی عاملیتی، Huawei Ascend |
بسطهای چندوجهی و تخصصی
- GLM‑4V‑9B — نسخه چندوجهی با encoder بصری برای پردازش تصاویر و اسناد.[2]
- GLM‑4.1V‑Thinking — مدل زبانی‑بصری با استدلال چندمرحلهای تقویتشده (arXiv:2507.01006).[11]
- GLM‑4‑Voice — مدل گفتاری end‑to‑end (پایه ۹B، ≈۱ تریلیون token گفتاری‑متنی، tokenizer 175 بیت بر ثانیه).[12]
- CodeGeeX — خانواده مدلهای کدنویسی (CodeGeeX‑13B، CodeGeeX2‑6B) برای تولید، تکمیل و بازنویسی کد در چندین زبان؛ در پلاگینهای IDE جاسازی شدهاند.[2]
- CogVLM / CogAgent — مدلهای زبانی‑بصری برای درک تصویر و ناوبری خودمختار در GUI.[2]
- WebGLM — مدلی برای جستجو و QA وبمحور؛ نشان داده شده که مدل با ≈۱۰ میلیارد پارامتر در برخی وظایف به WebGPT‑175B نزدیک میشود (KDD 2023).[2]
آموزش، دادهها و فناوریهای کمکی
دادههای پیشآموزش
مجموعه داده پیشآموزش برای GLM‑4 و مدلهای پیشین شامل موارد زیر است:[2]
- صفحات وب چندزبانه (عمدتاً چینی و انگلیسی)، Wikipedia، کتابها، کد و مقالات علمی.
- pipeline پردازش سهمرحلهای: حذف تکراری (دقیق و fuzzy)، فیلتر کردن (حذف متون نویزدار و بالقوه مضر) و tokenization.
- دیکشنری یکپارچه با اندازه ۱۵۰K token که از ترکیب دیکشنریهای BPE بهطور جداگانه آموزشدیده برای corpus چینی و چندزبانه با cl100k_base (tiktoken) به دست آمده است.
اهمیت کیفیت و تنوع دادهها به صورت تجربی تأیید شده است، اما نویسندگان معیارهای اساسی صریحی برای انتخاب دادهها فراتر از قانونمندیهای تجربی منتشرشده بیان نمیکنند.[2]
گسترش context و LongAlign
پنجرههای context به تدریج از 2K (ChatGLM‑6B) به 32K (ChatGLM2/3) و سپس به 128K و 1M token در GLM‑4، و بعد به 200K در GLM‑5 افزایش مییابند. از ترکیب گسترش کدگذاری موضعی (روشهای مقیاسبندی فرکانس مبتنی بر RoPE) و fine-tuning اضافی روی متون طولانی استفاده میشود. دستورالعمل همراستایی ویژه LongAlign امکان حفظ کیفیت روی ورودیهای طولانی را فراهم میکند: بر اساس LongBench‑Chat، GLM‑4 (0520) در بخش انگلیسی ۸۷.۳ (قابل مقایسه با GPT‑4 Turbo 1106: ۸۷.۲ و Claude 3 Opus: ۸۷.۷) و در بخش چینی ۸۴.۰ (بالاتر از GPT‑4 Turbo و Claude 3 Opus) کسب میکند.[2]
پسآموزش و همراستایی (SFT، RLHF)
پسآموزش شامل دو مرحله اصلی است:[2]
- Supervised Fine‑Tuning (SFT): آموزش روی جفتهای «درخواست–پاسخ» با تأکید بر تعاملات واقعی (نوشتهشده توسط انسان) نه الگویی یا تولیدشده.
- Reinforcement Learning from Human Feedback (RLHF): بهینهسازی بر اساس ترجیحات مفسران از طریق PPO، DPO و طرحهای اختصاصی، از جمله ChatGLM‑RLHF و Self‑Contrast (نمونههای منفی توسط خود مدل تولید میشوند، که نیاز به دادههای ترجیحی را کاهش میدهد).
بردار ویژگیها برای ارزیابی پاسخها شامل شاخصهای ایمنی، واقعبینی، ارتباط، مفید بودن و تطابق با ترجیحات است. نویسندگان اشاره میکنند که RLHF فراوانی رد پاسخ را کاهش، ایمنی و سازگاری در گفتگوهای چندنوبتی را افزایش میدهد.[2]
تکنیکهای تخصصی اکوسیستم GLM
- LongAlign — دستورالعمل همراستایی context طولانی (تا 128K).[2]
- ChatGLM‑Math — بهبود حل مسائل ریاضی با طرح self‑critique (خودارزیابی پاسخها بدون مدلهای خارجی).[2]
- Self‑Contrast — طرح RLHF که در آن نمونههای منفی توسط خود مدل تولید میشوند.[2]
- AgentTuning / AgentInstruct — چارچوب و dataset برای آموزش مهارتهای عاملیتی روی مسیرهای تعامل عامل با محیط.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — الگوریتم تولید خودبازگشتی موازیخودکار برای تسریع استنتاج.[2]
همچنین تعدادی benchmark توسعه یافته است: AgentBench (وظایف عاملیتی)، LongBench (context طولانی)، AlignBench (همراستایی چینی)، HumanEval‑X (کد فراتر از Python)، NaturalCodeBench (وظایف عملی برنامهنویسی).[2]
نتایج کلیدی و benchmarkها
تمام معیارها بر اساس گزارشهای فنی اصلی با ذکر شرایط (zero‑/few‑shot، dataset، نسخه مدل) ارائه میشوند. مقایسه توسط نویسندگان گزارشهای فنی انجام شده است؛ اعتبارسنجی مستقل خارجی روی پلتفرمهای استانداردشده (LMSYS Chatbot Arena، Open LLM Leaderboard) برای تمام نسخهها به صورت منظم انجام نشده است.
پویایی کیفیت: ChatGLM‑6B → GLM‑4‑9B
| Benchmark | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1.5 | 25.9 | 72.3 | 84.0 |
| MMLU (%) | 25.2 | 45.2 | 61.4 | 74.7 |
| HumanEval (%) | 0.0 | 9.8 | 58.5 | 70.1 |
| C‑Eval (٪، چینی) | 23.7 | 51.7 | 69.0 | 77.1 |
تمام مدلها در BF16 با تنظیمات یکسان ارزیابی شدند.[2]
GLM‑4 در benchmarkهای دانشگاهی
| Benchmark | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83.3 | 86.4 | 86.7 | 86.8 |
| GSM8K (%) | 93.3 | 92.0 | 95.6 | 95.0 |
| MATH (%) | 61.3 | 52.9 | 73.4 | 60.1 |
| BBH (%) | 84.7 | 83.1 | 88.2 | 86.8 |
| GPQA (%) | 39.9 | 35.7 | 49.3 | 50.4 |
| HumanEval (%) | 78.5 | 67.0 | 88.2 | 84.9 |
GLM‑4 (0520) به ≈۹۶.۳٪ از نتیجه GPT‑4 در MMLU دست مییابد، از GPT‑4 (0314) در MATH و GSM8K پیشی میگیرد، اما در MATH و HumanEval از GPT‑4 Turbo عقب است.[2]
بر اساس AlignBench v1.1 (همراستایی چینی)، GLM‑4 (0520) امتیاز کلی 8.00 را در برابر 7.90 GPT‑4 Turbo و 7.53 Claude 3 Opus نشان میدهد، با مزیت قابل توجه در زیرشاخصهای «منطق»، «زبان» و «حرفهای».[2]
بر اساس AgentBench، GLM‑4 (0520) به امتیاز کلی 3.79 میرسد که با GPT‑4 Turbo (1106) و Claude 3 Opus قابل مقایسه یا اندکی بالاتر است. شاخصهای بالا در وظایف Database، House‑Holding و Web‑Shopping؛ عقبماندگی در وظایف سیستمعامل و Lateral Thinking Puzzles.[2]
بر اساس Berkeley Function Call Leaderboard، GLM‑4 (0520) به ۸۱.۷۶٪ دست مییابد (GPT‑4 Turbo: ۸۱.۲۴٪)؛ GLM‑4‑9B‑Chat به طور قابل توجهی از Llama‑3‑8B‑Instruct پیشی میگیرد (۸۱.۰۰٪ در برابر ۵۸.۸۸٪).[2]
GLM‑4.5
| Benchmark | GLM‑4.5 | توضیح |
|---|---|---|
| TAU‑Bench (میانگین عاملیتی) | 70.1% | وظایف عاملیتی |
| AIME 2024 | 91.0% | مسابقات ریاضی |
| SWE‑bench Verified | 64.2% | حل مسائل در مخازن واقعی |
| GPQA (Avg@8) | 79.1% | سؤالات سطح دانشگاهی |
| MATH‑500 | 98.2% | ریاضیات |
| MMLU‑Pro | 84.6% | MMLU گسترشیافته |
با توجه به تعداد کمتر پارامترهای فعال، GLM‑4.5 در زمان انتشار گزارش در میان تمام مدلهای ارزیابیشده رتبه سوم (بر اساس رتبهبندی ترکیبی از ۱۲ benchmark) و رتبه دوم در benchmarkهای عاملیتی را کسب کرد.[3]
GLM‑4.7
- SWE‑bench Verified: 73.8% (5.8+ امتیاز درصدی نسبت به GLM‑4.5).
- Terminal‑Bench 2.0: 41.0% (+16.5 امتیاز درصدی).
- Humanity's Last Exam (with tools): 42.8%.[10]
GLM‑5
| Benchmark | GLM‑5 | توضیح |
|---|---|---|
| SWE‑bench Verified | 77.8% | پیشرو در میان مدلهای open‑weight در زمان انتشار |
| GPQA‑Diamond | 86.0% | سؤالات سطح دانشگاهی |
| Terminal‑Bench 2.0 | 56.2–61.1% | وظایف مهندسی |
| Humanity's Last Exam (with tools) | 50.4% | سؤالات میانرشتهای دشوار |
| BrowseComp | 62.0% | ناوبری وب |
GLM‑5 بهبود ≈۲۰٪ در میانگین شاخص نسبت به GLM‑4.7 نشان میدهد و در میان مدلهای open‑weight در موقعیتهایی قابل مقایسه با مدلهای بسته سطح Claude Opus 4.5 در برخی benchmarkهای عاملیتی و کدنویسی قرار دارد.[4]
ایمنی (SafetyBench)
بر اساس SafetyBench (زیرمجموعه چینی)، GLM‑4 (0520) به ۸۷.۲٪ در شاخص یکپارچه دست مییابد که با Claude 3 Opus (87.5٪) قابل مقایسه و اندکی کمتر از GPT‑4 (≈88–89.7٪) است. قابل توجهترین شکاف در مقایسه با GPT‑4 در بُعد «سلامت جسمانی» مشاهده میشود.[2]
کاربردها و اکوسیستم
سناریوهای گفتگومحور و دستیار
مجموعه ChatGLM و مدلهای بعدی به عنوان دستیارهای گفتگومحور استفاده میشوند، از جمله سرویس تجاری Zhipu Qingyan (chatglm.cn / chat.z.ai)، با پشتیبانی از ارتباط چندزبانه، گفتگوی چندمرحلهای و حالت دستوری.[2]
سیستمهای عاملیتی و ابزارها
GLM‑4 All Tools و مدلهای بعدی در پلتفرم عاملیتی GLMs ادغام میشوند که امکان ایجاد عوامل سفارشی، اتصال مفسر Python داخلی، مرورگر وب، مدلهای VLM/T2I (CogView3) و استفاده از APIهای خارجی را فراهم میکند. وظایف ترکیبی پشتیبانی میشوند: جستجوی وب، تحلیل داده از طریق Python، زنجیرههای ترکیبی ابزار. GLM‑5 بر وظایف مهندسی نرمافزار با برنامهریزی بلندمدت (agentic engineering) تمرکز دارد و روی benchmarkهای MCP‑Atlas و BrowseComp آزمایش شده است.[2][4]
تولید کد و توسعه نرمافزار
خانواده CodeGeeX (CodeGeeX‑13B، CodeGeeX2‑6B) و حالتهای کدنویسی GLM برای تولید کد در چندین زبان، تکمیل و بازنویسی، حل مسائل HumanEval و HumanEval‑X استفاده میشوند. در HumanEval‑X، CodeGeeX2‑6B نسبت به CodeGeeX‑13B در Pass@1 بهبود نشان میدهد (بر اساس دادههای نویسندگان: +۵۷٪ در Python، +۷۱٪ در C++). محصول CodeGeeX در پلاگینهای IDE برای توسعهدهندگان جاسازی شده است.[2]
context طولانی و سناریوهای سندمحور
GLM‑4‑9B‑Chat‑1M و مدلهای بالاتر برای تحلیل اسناد و مجموعههای بزرگ (تا 1M token)، خلاصهسازی، جستجو در اسناد طولانی و کار با کد طولانی استفاده میشوند.[2]
زیرساخت استقرار
مدلها از طریق پلتفرم API مربوط به Z.ai / bigmodel.cn (tool calling، چارچوبهای agent) در دسترس هستند. نسخههای باز از استقرار محلی از طریق vLLM، SGLang پشتیبانی میکنند. پشتیبانی از Huawei Ascend امکان استقرار بدون تجهیزات NVIDIA را فراهم میکند. مدلهای باز این مجموعه بیش از ۱۰ میلیون بار در Hugging Face (2023–2024) دانلود شدهاند.[2][4][13]
محدودیتها و مشکلات باز
- عدم تعادل زبانی: مجموعه GLM عمدتاً روی زبانهای چینی و انگلیسی پیشآموزش دیده است؛ کیفیت در سایر زبانها به طور قابل توجهی پایینتر است، که صریحاً در گزارش فنی arXiv:2406.12793 ذکر شده است.[2]
- بازتولیدپذیری benchmarkها: اکثر نتایج مقایسهای در گزارشهای فنی خود توسعهدهندگان ارائه شدهاند. اعتبارسنجی مستقل خارجی روی پلتفرمهای استانداردشده (LMSYS Chatbot Arena، Open LLM Leaderboard) برای تمام نسخهها به صورت منظم انجام نشده است.
- جهشهای تابع افت در مقیاسبندی: آموزش GLM‑130B با جهشهای متعدد تابع افت همراه بود که نیاز به مداخله دستی داشت؛ نویسندگان این را به عنوان یک مشکل مهندسی حلنشده در مقیاسبندی مستند میکنند.[8]
- وابستگی به سختافزار: از GLM‑5 به بعد، آموزش به Huawei Ascend / MindSpore منتقل شده است؛ بازتولید مستقل روی سایر پلتفرمهای سختافزاری دشوار است.[4]
- همراستایی و ایمنی: علیرغم استفاده از RLHF، مشکلات رد پاسخ، سازگاری در گفتگوهای چندنوبتی و دور زدن مکانیزمهای ایمنی همچنان مطرح هستند؛ نویسندگان arXiv:2406.12793 اشاره میکنند که RLHF کمک میکند اما مشکلات را به طور کامل حل نمیکند.[2]
- توهمات: مانند سایر LLMها، مشکل خطاهای واقعی مستند شده است؛ ارزیابیهای کمّی بسته به وظیفه و روششناسی متفاوت است.
- استدلال ریاضی: GLM‑4 در MATH و برخی وظایف حساب پیچیده از GPT‑4 Turbo عقب است، هرچند از روشهای تخصصی (ChatGLM‑Math) استفاده میکند.[2]
- وظایف عاملیتی: در AgentBench شکافی در وظایف مربوط به تعامل سطح پایین با سیستمعامل و پازلهای منطقی پیچیده باقی میماند؛ کیفیت بلندمدت (long‑horizon) همچنان یک مشکل حلنشده است (تجمع خطا در وظایف زنجیرهای).[2][4]
- کد و وظایف عملی: در NaturalCodeBench، GLM‑4 (کلی ۴۷.۱٪) از GPT‑4 Turbo (53.8٪) عقب است، هرچند با Claude 3 Opus (48.3٪) قابل مقایسه است.[2]
جنبههای اخلاقی و نظارتی
مجموعه GLM در انطباق با الزامات نهاد نظارتی چینی (اداره فضای مجازی جمهوری خلق چین، CAC) در زمینه ثبت مدلهای مولد و گذراندن ارزیابی ایمنی توسعه مییابد. پسآموزش شامل SFT و RLHF برای کاهش سمیت و محتوای مضر میشود.[2]
گزارش فنی GLM‑4 یک فرآیند مدیریت ریسک چندمرحلهای را شرح میدهد:[2]
- پاکسازی اولیه corpus پیشآموزش از متون با محتوای بالقوه مضر.
- فیلترسازی دادههای همراستایی بر اساس معیارهای ایمنی.
- آزمون Red‑team: تشکیل درخواستهای مخرب پیچیده برای fine-tuning.
- استفاده از SafetyBench برای ارزیابی کمّی ایمنی (۷ بُعد).
مدلهای اولیه (GLM‑130B) در مقایسه با GPT‑3 و OPT بر اساس CrowS‑Pairs و RealToxicPrompts سطح پایینتری از تعصب و سمیت از خود نشان میدهند که به آموزش دوزبانه نسبت داده میشود.[8][2]
انتشار GLM‑5 تحت مجوز MIT به معنای عدم وجود محدودیتهای رسمی برای استفاده تجاری از وزنهای باز است، که خطرات استاندارد استفاده غیرکنترلشده را که در LLMهای باز رایج است به همراه میآورد.[4] مسائل مربوط به سوگیریهای (bias) corpusهای پیشآموزش خاص به زبان چینی و بستر فرهنگی در آثار عمومی تا زمان نگارش این مقاله به صورت منظم بررسی نشدهاند.
چشماندازها و جهتهای پژوهشی
بر اساس گزارشهای فنی منتشرشده و مواد همراه Z.ai، جهتهای اعلامشده زیر قابل تشخیص هستند:[3][4]
- مقیاسبندی معماریهای MoE با کاهش هزینه پارامترهای فعال به ازای هر token.
- توسعه الگوریتمهای RL عاملیتی ناهمزمان برای وظایف بلندمدت.
- بهبود مکانیزمهای توجه تُنُک (DSA) برای contextهای بیش از 200K token.
- استدلال چندوجهی: توسعه GLM‑4.1V‑Thinking در جهت درک ویدیو و اسناد.
- کاهش وابستگی به APIهای خارجی در اجرای عاملیتی وظایف از طریق آموزش عوامل نهایی روی تعاملات واقعی.
- بهینهسازی برای سختافزار داخلی (برای جمهوری خلق چین) (Huawei Ascend، Cambricon) و کاهش ردپای کربنی آموزش.
- ادغام با پلتفرمهای رباتیک و محاسبات علمی.
همچنین ببینید
- معماری Transformer
- BERT
- GPT
- T5
- معماریهای Decoder‑only
- Reinforcement Learning from Human Feedback
- DeepSeek
منابع
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)