GLM (Zhipu AI) (HE)
GLM (General Language Model) — משפחה של מודלי שפה גדולים (Large Language Model, LLM), שפותחה על ידי חברת Zhipu AI (משנת 2025 — Z.ai) בשיתוף עם מעבדת Knowledge Engineering Group (KEG) בפקולטה למדעי המחשב של אוניברסיטת צינגחואה (בייג'ינג). הסדרה כוללת מודלים בטווח של 6 עד 744 מיליארד פרמטרים, המיועדים בעיקר לשפה הסינית והאנגלית. המאפיין הייחודי של הבסיס האדריכלי הוא פונקציית המטרה של הקדם-אימון המבוססת על autoregressive blank infilling, המשלבת תכונות של transformer מסוג encoder ומסוג decoder בסכמה מאוחדת אחת.[1][2][3]
הסדרה כוללת מודלים בסיסיים שעברו קדם-אימון, גרסאות דיאלוגיות (ChatGLM), הרחבות מולטימודאליות (GLM‑4V, CogVLM), כלים מיוחדים (CodeGeeX לייצור קוד, WebGLM לחיפוש ברשת) ומערכות אג'נטיות (GLM‑4 All Tools, AutoGLM). התפתחות המשפחה ניתנת למעקב מ-GLM‑10B (2021) ו-GLM‑130B (2022) ועד GLM‑4 (2024), GLM‑4.5 (2025) ו-GLM‑5 (2026), עם מעבר מארכיטקטורות צפופות (dense) ל-Mixture‑of‑Experts (MoE) ודגש על תרחישים אג'נטיים.[2][4]
היסטוריה ורקע
ההקשר המוסדי
Zhipu AI נוסדה בשנת 2019 על ידי פרופסורים מאוניברסיטת צינגחואה — Tang Jie ו-Li Juanzi — על בסיס מעבדת KEG, שהתמחתה בגרפי ידע. בשנת 2020 התמקדה החברה במודלי שפה בקנה מידה גדול. בשנת 2023 גויסו 2.5 מיליארד יואן השקעות (≈350 מיליון דולר) בהשתתפות Alibaba Group, Tencent, Ant Group, Meituan ו-Xiaomi. ביולי 2025 שינתה החברה את המותג הציבורי שלה ל-Z.ai, ובינואר 2026 ביצעה הנפקה בבורסת הונג קונג.[5][6]
העבודה המכוננת: GLM (2021–2022)
המאמר הבסיסי «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» פורסם ב-arXiv במרץ 2021 (arXiv:2103.10360) והתקבל לכנס ACL 2022. המחברים: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. המחקר מונע על ידי מגבלות הפרדיגמות האדריכליות הקיימות: מודלי encoder (BERT) אופטימליים למשימות הבנת שפה טבעית (Natural Language Understanding, NLU), מודלי decoder (GPT) — לייצור טקסט, ומודלי encoder‑decoder (T5) דורשים מספר גדול יותר של פרמטרים. GLM הציע גישה מאוחדת המסוגלת לפתור את שני סוגי המשימות.[1][7]
ציר הזמן של הגרסאות המרכזיות
| שנה | מודל | מאפיינים מרכזיים |
|---|---|---|
| 2021 | GLM (בסיסי), GLM‑10B | Autoregressive blank infilling, קידודי מיקום דו-ממדיים; פרמטרים עד 515M (בסיסי) ו-10B |
| 2022 | GLM‑130B | 130B פרמטרים, דו-לשוני (סינית / אנגלית), משקלים פתוחים, קוונטיזציית INT4 ללא fine-tuning; התקבל ל-ICLR 2023 |
| 2023, מרץ | ChatGLM‑6B (v1) | 6.2B פרמטרים, ≈1T טוקנים של קדם-אימון, SFT + יישור RLHF, קוונטיזציית INT4 (≈6 GB זיכרון) |
| 2023, יוני | ChatGLM2‑6B | 1.4T טוקנים, FlashAttention, Multi‑Query Attention (MQA), הקשר עד 32K טוקנים |
| 2023, אוקטובר | ChatGLM3‑6B | שיפור מעקב אחר הוראות, תמיכה בקריאת כלים (tool calling), Code Interpreter |
| 2024 | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈10T טוקנים של קדם-אימון, RoPE + GQA, הקשר עד 128K / 1M טוקנים; GLM‑4 All Tools |
| 2024 | GLM‑4V‑9B | גרסה מולטימודאלית עם visual encoder |
| 2025 | GLM‑4.5, GLM‑4.6, GLM‑4.7 | ארכיטקטורת MoE (GLM‑4.5), שיפורים עוקבים בהיסק ובקידוד |
| 2025 | GLM‑4.1V‑Thinking | מודל שפה-חזותי עם היסק רב-שלבי מועצם (arXiv:2507.01006) |
| 2026, פברואר | GLM‑5 | 744B פרמטרים (MoE), ≈40–44B פעילים, הקשר של 200K טוקנים, משימות אג'נטיות; אימון על Huawei Ascend |
משפחת GLM מתפתחת בשילוב עם מודלים נלווים של Zhipu AI: מודלי קוד CodeGeeX, מודלי שפה-חזותיים CogVLM / CogAgent, מודלים גנרטיביים CogView, וכן מערכות מיוחדות WebGLM ו-AgentLM.[2]
יסודות תיאורטיים ואדריכליים
פונקציית המטרה של הקדם-אימון
הארכיטקטורה הבסיסית של GLM מבוססת על Transformer. המאפיין הייחודי המרכזי הוא autoregressive blank infilling — וריאציה של מידול אוטורגרסיבי, שבה המודל לומד לשחזר פערים (spans) בטקסט על פי הקשר.[1][7]
יהא — רצף הקלט. נבחרים באקראי קטעים רצופים (spans) , המוחלפים בטוקן יחיד [MASK], ויוצרים טקסט מעוות . המודל משחזר כל קטע באופן אוטורגרסיבי בסדר תמורה אקראי:
כאשר — הרצף הפגום עם קטעים מוסתרים, — טוקנים שכבר שוחזרו של הקטע הנוכחי , — קטעים קודמים ששוחזרו במלואם. סדר שחזור הקטעים נקבע על ידי תמורה אקראית מהקבוצה , המאפשרת למודל לטפל בתלויות בין קטעים.[1]
לצורך כוונון המשימה: כאשר הפערים קצרים (≈15% מהטוקנים) המודל מותאם ל-NLU, וכאשר הקטעים ארוכים (עד 50–100% מהטוקנים) — למשימות גנרטיביות. זה מאפשר למודל יחיד לכסות את שני המצבים באמצעות קדם-אימון רב-משימתי (multi‑task learning).[1][7]
קידודי מיקום דו-ממדיים
GLM מציג קידודי מיקום דו-ממדיים להבחנה בין מיקומים ברצף הפגום המקורי ובין מיקומים בתוך הקטעים המשוחזרים:[1]
- הממד הראשון : מיקום מוחלט של הטוקן (או המסכה) ברצף הפגום.
- הממד השני : מיקום הטוקן בתוך הקטע שלו בעת ייצור אוטורגרסיבי (0 עבור טוקנים מהמקור).
סכמה זו מאפשרת להבחין כהלכה בין ההקשר לטקסט המיוצר ללא רכיבים אדריכליים נוספים הדומים ל-encoder.
מסכת תשומת הלב
ב-GLM משמשת מסכת תשומת לב דו-חלקית: תשומת לב דו-כיוונית (bidirectional) עבור טוקנים לא מוסתרים (Part A — הקשר) ותשומת לב סיבתית (causal) עבור טוקנים בתוך קטעים (Part B — spans משוחזרים). זה מבטיח הבנת הקשר מלא של הטקסט המקורי בעת ייצור אוטורגרסיבי של החלקים המשוחזרים. בניגוד ל-BERT (תחזיות מסכות עצמאיות) — GLM לוקח בחשבון תלויות בין spans; בניגוד ל-GPT — משתמש בהקשר דו-כיווני של Part A; בניגוד ל-T5 — אינו דורש encoder נפרד.[1][7]
התפתחות רכיבים אדריכליים
ברמת הפרמטרים של בלוק ה-Transformer, מצב הסמוי בשכבה במודלים החל מ-GLM‑4 מתעדכן כ:
כאשר GQA — Grouped‑Query Attention (במקום Multi‑Head Attention מלא), ו-FFN מיושם דרך SwiGLU.[2]
החל מ-GLM‑130B ובהמשך הסדרה, נעשה שימוש ברכיבים אדריכליים הבאים:
- GLM‑130B: DeepNorm לייצוב אימון רשתות עמוקות; Rotary Positional Encoding (RoPE) עם הרחבה דו-ממדית; Gated Linear Units (GLU) עם אקטיבציית GeLU (GeGLU).[8]
- GLM‑4: מעבר ל-RMSNorm ו-SwiGLU; Group Query Attention (GQA) במקום Multi‑Head Attention (MHA) לצמצום KV‑cache; הוסרו כל מונחי ה-bias למעט Q/K/V ב-attention; גודל FFN מוגדל ל- לשמירת מספר הפרמטרים בעת GQA.[2]
- GLM‑4.5: Mixture‑of‑Experts (MoE) עם loss‑free balance routing ו-sigmoid gates; מצב היסק היברידי (thinking / non‑thinking).[3]
- GLM‑5: DeepSeek Sparse Attention (DSA) לעיבוד יעיל של הקשר ארוך עד 200K טוקנים; Multi‑Token Prediction (MTP) לפענוח ספקולטיבי; אימון מלא על מעבדי Huawei Ascend תוך שימוש ב-MindSpore.[4]
קנה מידה וחוקי קנה המידה
במהלך פיתוח סדרת ChatGLM נחקרות תלויות אמפיריות בין הפסד הקדם-אימון לבין האיכות במשימות, כולל תופעת «emergent abilities». הוצג כי בהינתן רמת הפסד קבועה של קדם-אימון, מודלים בגדלים שונים (ומספרי טוקנים שונים) מדגימים ביצועים דומים, ובמשימות מסוימות (MMLU, GSM8K) האיכות מתחילה לחרוג מרמת האקראי רק לאחר הגעה לסף מסוים של הפסד הקדם-אימון.[2]
ארכיטקטורות ומודלים בסדרת GLM
GLM‑10B ו-GLM‑130B
GLM‑10B (2021) — מודל בעל 10 מיליארד פרמטרים, המדגים את ישימות ארכיטקטורת GLM עם blank infilling ומשמש בסיס להרחבה עוקבת.[1]
GLM‑130B (2022) הוצג באוקטובר 2022 והתקבל ל-ICLR 2023 (arXiv:2210.02414):[8]
- מספר פרמטרים: ≈130 מיליארד (מודל דו-לשוני צפוף).
- נפח קדם-אימון: מעל 400 מיליארד טוקנים (≈200 מיליארד בסינית, ≈200 מיליארד באנגלית).
- ארכיטקטורה: 70 שכבות, hidden size 12,288, 96 ראשי תשומת לב; DeepNorm, RoPE, GeGLU; אימון רב-משימתי נוסף (Multi‑Task Instruction Pretraining, MIP) — ≈5% מהטוקנים על 74 מערכי נתונים של משימות NLU/NLG.
- קוונטיזציה: INT4 ללא fine-tuning לאחר הקוונטיזציה (post‑training quantization) — התוצאה הראשונה המתועדת מסוג זה בקרב מודלים בני 100B+ פרמטרים; היסק אפשרי על 4×RTX 3090 (24 GB) או 8×RTX 2080 Ti (11 GB).
- יציבות אימון: המחברים מתעדים עליות רבות בפונקציית ההפסד (loss spikes) ומתארים את אסטרטגיות הייצוב שיושמו (gradient clipping, Embedding Gradient Shrink).
במועד הפרסום עלה GLM‑130B על GPT‑3 175B (davinci) במגוון רחב של מבחני השוואה באנגלית (סך הכל 112 משימות) ועל ERNIE TITAN 3.0 260B במשימות בסינית; יחד עם זאת, עליונות על OPT‑175B ו-BLOOM‑176B לא שוחזרה — המחברים מציינים מגבלה זו במפורש. לפי הערכת HELM (נובמבר 2022) GLM‑130B דומה ל-GPT‑3 במספר מדדים.[8][2]
משפחת ChatGLM‑6B/2/3
ChatGLM‑6B (מרץ 2023) — מודל דיאלוגי עם 6.2 מיליארד פרמטרים, שפותח במשותף על ידי KEG ו-Zhipu AI ופורסם כפרויקט פתוח:[2][9]
- קדם-אימון על ≈1 טריליון טוקנים (סינית + אנגלית), הקשר 2K.
- מיועד לדיאלוג; היישור הראשוני מבוצע בעיקר באמצעות SFT ו-RLHF.
- קוונטיזציית INT4 עם צריכה של ≈6 GB זיכרון, שאיפשרה הפעלה מקומית על ציוד צרכני.
ChatGLM2‑6B (יוני 2023):[2]
- נפח הקדם-אימון הוגדל ל-1.4 טריליון טוקנים.
- הוכנסו FlashAttention ו-Multi‑Query Attention (MQA); ההקשר הורחב ל-32K טוקנים.
- שיפור משמעותי במבחני השוואה: MMLU +23 נ"א, GSM8K +571%, BBH +60% ביחס ל-ChatGLM‑6B.
ChatGLM3‑6B (אוקטובר 2023):[2]
- שיפור נוסף ב-42 מבחני השוואה בתחומי סמנטיקה, מתמטיקה, היסק, קוד וידע.
- תמיכה מובנית ב-function call, Code Interpreter מובנה ומשימות אג'נטיות באמצעות AgentTuning / AgentLM.
GLM‑4, GLM‑4‑Air, GLM‑4‑9B ו-GLM‑4 All Tools
הדוח הטכני (arXiv:2406.12793) מתאר את GLM‑4 כמשפחת מודלים שעברה קדם-אימון על ≈10 טריליון טוקנים (בעיקר סינית ואנגלית, בתוספת 24 שפות נוספות) ויושרה לסינית ואנגלית.[2]
גרסאות מרכזיות:
- GLM‑4 (מודל דגל, גרסאות 0116 ו-0520): transformer צפוף, hidden size 6144, 61 שכבות, 48 ראשי תשומת לב, הקשר 128K.
- GLM‑4‑Air — מודל קומפקטי ומהיר יותר עם איכות הקרובה ל-GLM‑4‑0116 בזמני תגובה קצרים יותר.
- GLM‑4‑9B — מודל בן 9 מיליארד פרמטרים (הקשר 8K, גרסאות 128K וניסיוני של 1M) עם אותה צינורית post-training.
- GLM‑4 All Tools — גרסה שיושרה נוסף לשימוש בכלים: דפדפן רשת, מפרש Python, יצירת תמונות (CogView3) ופונקציות מותאמות אישית.
מאפיינים אדריכליים של GLM‑4:[2]
- היעדר מונחי bias למעט Q/K/V ב-attention.
- RMSNorm ו-SwiGLU.
- 2D‑RoPE.
- Group Query Attention (GQA) עם FFN מוגדל.
- טוקניזר BPE בייטי בגודל 150K טוקנים, שהתקבל על ידי איחוד מילוני BPE שאומנו בנפרד עבור קורפוס סיני ורב-לשוני עם cl100k_base.
GLM‑4.5 (מודלי בסיס ARC)
GLM‑4.5 — מודל Mixture‑of‑Experts (MoE) פתוח עם דגש על משימות אג'נטיות, היסק וקידוד (Agentic, Reasoning, Coding — ARC):[3]
- 355 מיליארד פרמטרים כולל, 32 מיליארד פעילים (ארכיטקטורת MoE עם אקטיבציה מפוזרת): 89 שכבות, 160 מומחים, 8 פעילים לטוקן; 96 ראשי תשומת לב, hidden size 5120.
- GLM‑4.5‑Air: 106 מיליארד כולל / 12 מיליארד פעילים — גרסה יעילה.
- אימון על 23 טריליון טוקנים עם post-training רב-שלבי הכולל איטרציית מודלים מומחים ו-RLHF.
- מצב היסק היברידי (thinking mode ו-direct response): במקרה הראשון המודל מייצר עקבות היסק מפורטות; במקרה השני — עונה ישירות. המיתוג מנוהל ברמת צינורית ה-inference.
- Loss‑free balance routing עם sigmoid gates לניתוב מומחים.
- אופטימיזטור Muon; עיצוב deeper‑and‑narrower.
GLM‑4.6 / GLM‑4.7
סדרת GLM‑4.6 / 4.7 (ספטמבר–דצמבר 2025) מפתחת את רעיונות GLM‑4.5, ומחזקת תכנות (SWE‑bench Verified / Multilingual), היסק מורכב (Humanity's Last Exam, AIME) ומשימות אג'נטיות. GLM‑4.7 משיג 73.8% ב-SWE‑bench Verified ומציג Interleaved / Preserved / Turn‑level Thinking — שלושה מצבי שילוב של היסק בדיאלוג. תצורות נפרדות פורסמו כמודלי open‑weight.[3][10]
GLM‑5
הדוח הטכני פורסם ב-21 בפברואר 2026 (arXiv:2602.15763). המאפיינים המרכזיים:[4]
- ארכיטקטורה: Mixture‑of‑Experts עם ≈744–745 מיליארד פרמטרים כולל, 256 מומחים, 8 מופעלים לכל טוקן (≈40–44 מיליארד פרמטרים פעילים, ≈5.9% צפיפות); 75 שכבות MoE + 3 שכבות צפופות.
- קדם-אימון: 28.5 טריליון טוקנים.
- חלון הקשר: 200K טוקנים.
- Dynamic Sparse Attention (DSA): מנגנון תשומת לב מפוזרת המפחית עלויות אימון והיסק תוך שמירת האיכות על הקשרים ארוכים.
- Multi‑Token Prediction (MTP): טכניקה לפענוח ספקולטיבי בעת היסק.
- תשתית טכנית: האימון בוצע במלואו על מעבדי Huawei Ascend תוך שימוש ב-framework של MindSpore, ללא תלות בציוד GPU מתוצרת אמריקאית.
- Post-training: תשתית Reinforcement Learning (RL) אסינכרונית עם דקאפלינג של ייצור ואימון (decoupling inference / training); שימוש באלגוריתמי RL אג'נטיים למשימות ארוכות-אופק; Token‑in‑Token‑out (TITO) וניהול הקשר היררכי למשימות אג'נטיות ארוכות-אופק.
- רישיון: משקלים פתוחים תחת רישיון MIT.
טבלת סיכום מודלי הסדרה
| מודל | שנה | פרמטרים (כולל / פעילים) | טוקנים בקדם-אימון | הקשר | מאפיינים מרכזיים |
|---|---|---|---|---|---|
| GLM‑130B | 2022 | 130 מיליארד / — | ≈400 מיליארד | 2K | צפוף, דו-לשוני, DeepNorm, קוונטיזציית INT4 |
| ChatGLM‑6B | 2023 | 6.2 מיליארד / — | ≈1 טריליון | 2K | דיאלוגי, SFT + RLHF, INT4 (≈6 GB) |
| ChatGLM2‑6B | 2023 | 6.2 מיליארד / — | 1.4 טריליון | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | 2023 | 6.2 מיליארד / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | 2024 | לא נחשף (API) | ≈10 טריליון | 128K–1M | All Tools, מולטימודאליות (V) |
| GLM‑4‑9B | 2024 | ≈9 מיליארד / — | ≈10 טריליון | 128K–1M | גרסה פתוחה, GQA |
| GLM‑4.5 | 2025 | 355 מיליארד / 32 מיליארד | 23 טריליון | 128K | MoE, חשיבה היברידית, פוקוס ARC |
| GLM‑4.5‑Air | 2025 | 106 מיליארד / 12 מיליארד | 23 טריליון | 128K | גרסת MoE יעילה |
| GLM‑4.7 | 2025 | — | — | 128K | קידוד משופר, Interleaved Thinking |
| GLM‑5 | 2026 | 744 מיליארד / ≈40 מיליארד | 28.5 טריליון | 200K | DSA, MTP, הנדסה אג'נטית, Huawei Ascend |
הרחבות מולטימודאליות ומיוחדות
- GLM‑4V‑9B — גרסה מולטימודאלית עם visual encoder לעיבוד תמונות ומסמכים.[2]
- GLM‑4.1V‑Thinking — מודל שפה-חזותי עם היסק רב-שלבי מועצם (arXiv:2507.01006).[11]
- GLM‑4‑Voice — מודל דיבור end‑to‑end (9B base, ≈1 טריליון טוקנים של דיבור-טקסט, טוקניזר של 175 ביט/שנייה).[12]
- CodeGeeX — משפחת מודלי קוד (CodeGeeX‑13B, CodeGeeX2‑6B) לייצור, השלמה ורפקטורינג של קוד בשפות מרובות; משולב בתוספי IDE.[2]
- CogVLM / CogAgent — מודלי שפה-חזותיים להבנת תמונות וניווט אוטונומי ב-GUI.[2]
- WebGLM — מודל לחיפוש ממוקד-רשת ו-QA; הוצג כי מודל בן ≈10 מיליארד פרמטרים מתקרב ל-WebGPT‑175B במספר משימות (KDD 2023).[2]
אימון, נתונים וטכנולוגיות עזר
נתוני הקדם-אימון
קורפוס הקדם-אימון עבור GLM‑4 ומודלים קודמים כולל:[2]
- דפי רשת רב-לשוניים (בעיקר סינית ואנגלית), Wikipedia, ספרים, קוד ומאמרים מדעיים.
- צינורית עיבוד תלת-שלבית: כפילות (מדויקת ו-fuzzy), סינון (הסרת טקסטים רועשים ועם תוכן פוגעני אפשרי) וטוקניזציה.
- מילון מאוחד בגודל 150K טוקנים, שהתקבל על ידי איחוד מילוני BPE שאומנו בנפרד עבור קורפוס סיני ורב-לשוני עם cl100k_base (tiktoken).
החשיבות של איכות ומגוון הנתונים מאוששת אמפירית, אולם המחברים אינם מנסחים קריטריונים בסיסיים מפורשים לבחירת נתונים מעבר לדפוסים האמפיריים שפורסמו.[2]
הרחבת הקשר ו-LongAlign
חלונות ההקשר גדלים בהדרגה מ-2K (ChatGLM‑6B) ל-32K (ChatGLM2/3) ועוד ל-128K ו-1M טוקנים ב-GLM‑4, ולאחר מכן ל-200K ב-GLM‑5. נעשה שימוש בשילוב של הרחבת קידוד מיקום (שיטות מבוססות-RoPE לשינוי קנה מידה תדירות) ו-fine-tuning נוסף על טקסטים ארוכים. מתכון יישור מיוחד בשם LongAlign מאפשר שמירת האיכות על קלטים ארוכים: על פי LongBench‑Chat GLM‑4 (0520) מגיע ל-87.3 בחלק האנגלי (דומה ל-GPT‑4 Turbo 1106: 87.2 וב-Claude 3 Opus: 87.7) ול-84.0 בחלק הסיני (גבוה מ-GPT‑4 Turbo וב-Claude 3 Opus).[2]
Post-training ויישור (SFT, RLHF)
ה-post-training כולל שני שלבים עיקריים:[2]
- Supervised Fine‑Tuning (SFT): אימון על זוגות «שאילתה–תגובה» עם דגש על אינטראקציות אנושיות אמיתיות (human‑authored) ולא על אינטראקציות תבניתיות או מיוצרות.
- Reinforcement Learning from Human Feedback (RLHF): אופטימיזציה על פי העדפות מוערכים באמצעות PPO, DPO וסכמות קנייניות, בפרט ChatGLM‑RLHF ו-Self‑Contrast (דוגמאות שליליות מיוצרות על ידי המודל עצמו, מה שמפחית את הצורך בנתוני העדפות).
וקטור המאפיינים להערכת תגובות כולל אינדיקטורים של בטיחות, עובדתיות, רלוונטיות, שימושיות ועמידה בהעדפות. המחברים מציינים כי RLHF מפחית את שיעור הסירובים, משפר את הבטיחות ואת העקביות בדיאלוגים רב-תורניים.[2]
טכניקות מיוחדות של מערכת GLM
- LongAlign — מתכון יישור לטקסט ארוך (עד 128K).[2]
- ChatGLM‑Math — שיפור פתרון משימות מתמטיות באמצעות סכמת self‑critique (הערכה עצמית של תגובות ללא מודלים חיצוניים).[2]
- Self‑Contrast — סכמת RLHF שבה דוגמאות שליליות מיוצרות על ידי המודל עצמו.[2]
- AgentTuning / AgentInstruct — framework ומערך נתונים לאימון כישורים אג'נטיים על מסלולי אינטראקציה של הסוכן עם הסביבה.[2]
- APAR (Auto‑Parallel Auto‑Regressive) — אלגוריתם ייצור אוטורגרסיבי מקבילי-אוטומטי להאצת ההיסק.[2]
כמו כן פותח מספר מבחני השוואה: AgentBench (משימות אג'נטיות), LongBench (הקשר ארוך), AlignBench (יישור סיני), HumanEval‑X (קוד מעבר ל-Python), NaturalCodeBench (משימות תכנות מעשיות).[2]
תוצאות מרכזיות ומבחני השוואה
כל המדדים מצוטטים מהדוחות הטכניים המקוריים עם ציון התנאים (zero‑/few‑shot, מערך נתונים, גרסת מודל). ההשוואה בוצעה על ידי מחברי הדוחות הטכניים; אימות עצמאי חיצוני על פלטפורמות סטנדרטיות (LMSYS Chatbot Arena, Open LLM Leaderboard) לכל הגרסאות אינו מסודר.
דינמיקת האיכות: ChatGLM‑6B → GLM‑4‑9B
| מבחן השוואה | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | 1.5 | 25.9 | 72.3 | 84.0 |
| MMLU (%) | 25.2 | 45.2 | 61.4 | 74.7 |
| HumanEval (%) | 0.0 | 9.8 | 58.5 | 70.1 |
| C‑Eval (%, סינית) | 23.7 | 51.7 | 69.0 | 77.1 |
כל המודלים הוערכו ב-BF16 עם הגדרות זהות.[2]
GLM‑4 במבחני השוואה אקדמיים
| מבחן השוואה | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | 83.3 | 86.4 | 86.7 | 86.8 |
| GSM8K (%) | 93.3 | 92.0 | 95.6 | 95.0 |
| MATH (%) | 61.3 | 52.9 | 73.4 | 60.1 |
| BBH (%) | 84.7 | 83.1 | 88.2 | 86.8 |
| GPQA (%) | 39.9 | 35.7 | 49.3 | 50.4 |
| HumanEval (%) | 78.5 | 67.0 | 88.2 | 84.9 |
GLM‑4 (0520) משיג ≈96.3% מתוצאת GPT‑4 ב-MMLU, עולה על GPT‑4 (0314) ב-MATH וב-GSM8K, אך נופל מ-GPT‑4 Turbo ב-MATH וב-HumanEval.[2]
לפי AlignBench v1.1 (יישור סיני) GLM‑4 (0520) מציג ציון כולל 8.00 לעומת 7.90 של GPT‑4 Turbo ו-7.53 של Claude 3 Opus עם יתרון בולט במדדי-המשנה «Logic», «Language», «Professional».[2]
לפי AgentBench GLM‑4 (0520) משיג ציון כולל של 3.79, הדומה או מעט גבוה מ-GPT‑4 Turbo (1106) ומ-Claude 3 Opus. ציונים גבוהים במשימות Database, House‑Holding ו-Web‑Shopping; פיגור — במשימות Operating System ו-Lateral Thinking Puzzles.[2]
לפי Berkeley Function Call Leaderboard GLM‑4 (0520) משיג 81.76% (GPT‑4 Turbo: 81.24%); GLM‑4‑9B‑Chat עולה משמעותית על Llama‑3‑8B‑Instruct (81.00% לעומת 58.88%).[2]
GLM‑4.5
| מבחן השוואה | GLM‑4.5 | הערה |
|---|---|---|
| TAU‑Bench (ממוצע אג'נטי) | 70.1% | משימות אג'נטיות |
| AIME 2024 | 91.0% | תחרויות מתמטיקה |
| SWE‑bench Verified | 64.2% | פתרון משימות על מאגרים אמיתיים |
| GPQA (Avg@8) | 79.1% | שאלות ברמת תואר שני |
| MATH‑500 | 98.2% | מתמטיקה |
| MMLU‑Pro | 84.6% | MMLU מורחב |
בהתחשב במספר הקטן יותר של פרמטרים פעילים, GLM‑4.5 תופס את המקום ה-3 בין כל המודלים שהוערכו (לפי דירוג מצרפי של 12 מבחני השוואה) ואת המקום ה-2 — במבחני ההשוואה האג'נטיים במועד פרסום הדוח.[3]
GLM‑4.7
- SWE‑bench Verified: 73.8% (+5.8 נ"א ביחס ל-GLM‑4.5).
- Terminal‑Bench 2.0: 41.0% (+16.5 נ"א).
- Humanity's Last Exam (with tools): 42.8%.[10]
GLM‑5
| מבחן השוואה | GLM‑5 | הערה |
|---|---|---|
| SWE‑bench Verified | 77.8% | מוביל בין מודלי open‑weight במועד הפרסום |
| GPQA‑Diamond | 86.0% | שאלות ברמת תואר שני |
| Terminal‑Bench 2.0 | 56.2–61.1% | משימות הנדסיות |
| Humanity's Last Exam (with tools) | 50.4% | שאלות בינתחומיות מורכבות |
| BrowseComp | 62.0% | ניווט ברשת |
GLM‑5 מדגים שיפור של ≈20% במדד הממוצע ביחס ל-GLM‑4.7 ותופס עמדות בין מודלי open‑weight הדומות למודלים סגורים ברמת Claude Opus 4.5 במספר מבחני השוואה אג'נטיים וקוד.[4]
בטיחות (SafetyBench)
לפי SafetyBench (מדגם סיני) GLM‑4 (0520) משיג 87.2% במדד המשולב, הדומה ל-Claude 3 Opus (87.5%) ומעט נמוך מ-GPT‑4 (≈88–89.7%). הפער הבולט ביותר בהשוואה ל-GPT‑4 נצפה במימד «Physical Health» (בטיחות פיזית).[2]
יישום ומערכת אקולוגית
תרחישי דיאלוג ועוזר אישי
סדרת ChatGLM והמודלים העוקבים משמשים כעוזרי דיאלוג, כולל השירות המסחרי Zhipu Qingyan (chatglm.cn / chat.z.ai), עם תמיכה בתקשורת רב-לשונית, דיאלוג רב-תורני ומצב הוראות.[2]
מערכות אג'נטיות וכלים
GLM‑4 All Tools והמודלים העוקבים משתלבים בפלטפורמה האג'נטית GLMs, המאפשרת יצירת סוכנים מותאמים אישית, חיבור מפרש Python מובנה, דפדפן רשת, מודלי VLM/T2I (CogView3) ושימוש ב-API חיצוניים. נתמכות משימות מורכבות: חיפוש ברשת, ניתוח נתונים דרך Python, שרשראות כלים משולבות. GLM‑5 מתמקד במשימות הנדסת תוכנה עם אופק תכנון ארוך (agentic engineering) ונבדק על מבחני ה-MCP‑Atlas ו-BrowseComp.[2][4]
ייצור קוד ופיתוח תוכנה
משפחת CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) ומצבי הקוד של GLM משמשים לייצור קוד בשפות מרובות, השלמה ורפקטורינג, פתרון משימות HumanEval ו-HumanEval‑X. ב-HumanEval‑X CodeGeeX2‑6B משפר את Pass@1 בהשוואה ל-CodeGeeX‑13B (לפי המחברים: +57% ב-Python, +71% ב-C++). המוצר CodeGeeX משולב בתוספי IDE עבור מפתחים.[2]
הקשר ארוך ותרחישים ממוקדי מסמכים
GLM‑4‑9B‑Chat‑1M ומודלים בכירים משמשים לניתוח מסמכים ואוספים גדולים (עד 1M טוקנים), סיכום, חיפוש במסמכים ארוכים ועבודה עם קוד ארוך.[2]
תשתית פריסה
המודלים זמינים דרך פלטפורמת ה-API של Z.ai / bigmodel.cn (tool calling, agent frameworks). גרסאות פתוחות תומכות בפריסה מקומית דרך vLLM, SGLang. תמיכת Huawei Ascend מאפשרת פריסה ללא ציוד NVIDIA. מודלים פתוחים בסדרה הורדו מעל 10 מיליון פעמים ב-Hugging Face (2023–2024).[2][4][13]
מגבלות ובעיות פתוחות
- חוסר איזון לשוני: סדרת GLM עברה קדם-אימון בעיקר בסינית ובאנגלית; האיכות בשפות אחרות נמוכה משמעותית, כפי שצוין במפורש בדוח הטכני arXiv:2406.12793.[2]
- רבייה של מבחני השוואה: רוב תוצאות ההשוואה מצוטטות מהדוחות הטכניים של המפתחים עצמם. אימות חיצוני עצמאי על פלטפורמות סטנדרטיות (LMSYS Chatbot Arena, Open LLM Leaderboard) לכל הגרסאות אינו מסודר.
- עליות הפסד בעת קנה מידה: אימון GLM‑130B התלווה בעליות רבות של פונקציית ההפסד שדרשו התערבות ידנית; המחברים מתעדים זאת כבעיה הנדסית לא פתורה בעת קנה מידה.[8]
- תלות בחומרה: החל מ-GLM‑5, האימון הועבר ל-Huawei Ascend / MindSpore; שחזור עצמאי על פלטפורמות חומרה אחרות הוא קשה.[4]
- יישור ובטיחות: למרות שימוש ב-RLHF, בעיות של סירוב לענות, עקביות בדיאלוגים רב-תורניים ועקיפת מנגנוני בטיחות נותרות רלוונטיות; מחברי arXiv:2406.12793 מציינים כי RLHF עוזר אך אינו פותר את הבעיות לחלוטין.[2]
- הזיות: כמו ב-LLM אחרים, בעיית שגיאות עובדתיות מתועדת; הערכות כמותיות משתנות בהתאם למשימה ולמתודולוגיה.
- היסק מתמטי: GLM‑4 נופל מ-GPT‑4 Turbo ב-MATH ובמספר משימות של חשבון מורכב, למרות שימוש בשיטות מיוחדות (ChatGLM‑Math).[2]
- משימות אג'נטיות: לפי AgentBench נותר פער במשימות הקשורות לאינטראקציה ברמת מערכת הפעלה ולפאזלים לוגיים מורכבים; איכות האופק הארוך (long‑horizon) נותרת אתגר לא פתור (הצטברות שגיאות במשימות מקושרות).[2][4]
- קוד ומשימות מעשיות: ב-NaturalCodeBench GLM‑4 (overall 47.1%) נמוך מ-GPT‑4 Turbo (53.8%), אם כי דומה ל-Claude 3 Opus (48.3%).[2]
היבטים אתיים ורגולטוריים
סדרת GLM מפותחת בהתאם לדרישות הרגולטור הסיני (מינהל מרחב הסייבר של סין, CAC) בכל הנוגע לרישום מודלים גנרטיביים ועמידה בהערכות בטיחות. ה-post-training כולל SFT ו-RLHF להפחתת רעילות ותכנים מזיקים.[2]
הדוח הטכני של GLM‑4 מתאר תהליך ניהול סיכונים רב-שלבי:[2]
- ניקוי מוקדם של קורפוס הקדם-אימון מטקסטים בעלי תוכן פוגעני אפשרי.
- סינון נתוני היישור לפי קריטריוני בטיחות.
- בדיקת Red‑team: גיבוש בקשות מזיקות מורכבות ל-fine-tuning.
- שימוש ב-SafetyBench להערכה כמותית של בטיחות (7 מימדים).
מודלים מוקדמים (GLM‑130B) מדגימים רמת הטיה נמוכה יותר לפי CrowS‑Pairs ורעילות מופחתת לפי RealToxicPrompts בהשוואה ל-GPT‑3 ו-OPT בשל האימון הדו-לשוני.[8][2]
שחרור GLM‑5 תחת רישיון MIT משמעו היעדר הגבלות פורמליות על שימוש מסחרי במשקלים הפתוחים, מה שגורר סיכונים סטנדרטיים של שימוש בלתי מבוקר האופייניים ל-LLM פתוחים.[4] שאלות של הטיות (bias) בקורפוסי הקדם-אימון הספציפיים לשפה הסינית ולהקשר התרבותי אינן נחקרות באופן שיטתי בעבודות פומביות נכון למועד כתיבת המאמר.
פרספקטיבות וכיווני מחקר
על בסיס הדוחות הטכניים ממוצמדים החומרים של Z.ai, מסומנות הכיוונים הבאים שהוצהרו:[3][4]
- קנה מידה של ארכיטקטורות MoE תוך הפחתת עלות הפרמטרים הפעילים לטוקן.
- פיתוח אלגוריתמי RL אג'נטיים אסינכרוניים למשימות ארוכות-אופק.
- שיפור מנגנוני תשומת לב מפוזרת (DSA) להקשרים מעל 200K טוקנים.
- היסק מולטימודאלי: פיתוח GLM‑4.1V‑Thinking לכיוון הבנת וידאו ומסמכים.
- הפחתת תלות ב-API חיצוניים בביצוע משימות אג'נטיות באמצעות אימון סוכנים סופיים על אינטראקציות אמיתיות.
- אופטימיזציה לחומרה מקומית (עבור סין) (Huawei Ascend, Cambricon) והפחתת טביעת הפחמן של האימון.
- אינטגרציה עם פלטפורמות רובוטיות ומדעיות-חישוביות.
ראו גם
- ארכיטקטורת Transformer
- BERT
- GPT
- T5
- ארכיטקטורות Decoder‑only
- Reinforcement Learning from Human Feedback
- DeepSeek
ספרות
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
הערות
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)