GLM (Zhipu AI) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

GLM (General Language Model) — משפחה של מודלי שפה גדולים (Large Language Model, LLM), שפותחה על ידי חברת Zhipu AI (משנת 2025 — Z.ai) בשיתוף עם מעבדת Knowledge Engineering Group (KEG) בפקולטה למדעי המחשב של אוניברסיטת צינגחואה (בייג'ינג). הסדרה כוללת מודלים בטווח של 6 עד 744 מיליארד פרמטרים, המיועדים בעיקר לשפה הסינית והאנגלית. המאפיין הייחודי של הבסיס האדריכלי הוא פונקציית המטרה של הקדם-אימון המבוססת על autoregressive blank infilling, המשלבת תכונות של transformer מסוג encoder ומסוג decoder בסכמה מאוחדת אחת.[1][2][3]

הסדרה כוללת מודלים בסיסיים שעברו קדם-אימון, גרסאות דיאלוגיות (ChatGLM), הרחבות מולטימודאליות (GLM‑4V, CogVLM), כלים מיוחדים (CodeGeeX לייצור קוד, WebGLM לחיפוש ברשת) ומערכות אג'נטיות (GLM‑4 All Tools, AutoGLM). התפתחות המשפחה ניתנת למעקב מ-GLM‑10B (2021) ו-GLM‑130B (2022) ועד GLM‑4 (2024), GLM‑4.5 (2025) ו-GLM‑5 (2026), עם מעבר מארכיטקטורות צפופות (dense) ל-Mixture‑of‑Experts (MoE) ודגש על תרחישים אג'נטיים.[2][4]

היסטוריה ורקע

ההקשר המוסדי

Zhipu AI נוסדה בשנת 2019 על ידי פרופסורים מאוניברסיטת צינגחואה — Tang Jie ו-Li Juanzi — על בסיס מעבדת KEG, שהתמחתה בגרפי ידע. בשנת 2020 התמקדה החברה במודלי שפה בקנה מידה גדול. בשנת 2023 גויסו 2.5 מיליארד יואן השקעות (≈350 מיליון דולר) בהשתתפות Alibaba Group, Tencent, Ant Group, Meituan ו-Xiaomi. ביולי 2025 שינתה החברה את המותג הציבורי שלה ל-Z.ai, ובינואר 2026 ביצעה הנפקה בבורסת הונג קונג.[5][6]

העבודה המכוננת: GLM (2021–2022)

המאמר הבסיסי «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» פורסם ב-arXiv במרץ 2021 (arXiv:2103.10360) והתקבל לכנס ACL 2022. המחברים: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. המחקר מונע על ידי מגבלות הפרדיגמות האדריכליות הקיימות: מודלי encoder (BERT) אופטימליים למשימות הבנת שפה טבעית (Natural Language Understanding, NLU), מודלי decoder (GPT) — לייצור טקסט, ומודלי encoder‑decoder (T5) דורשים מספר גדול יותר של פרמטרים. GLM הציע גישה מאוחדת המסוגלת לפתור את שני סוגי המשימות.[1][7]

ציר הזמן של הגרסאות המרכזיות

שנה מודל מאפיינים מרכזיים
2021 GLM (בסיסי), GLM‑10B Autoregressive blank infilling, קידודי מיקום דו-ממדיים; פרמטרים עד 515M (בסיסי) ו-10B
2022 GLM‑130B 130B פרמטרים, דו-לשוני (סינית / אנגלית), משקלים פתוחים, קוונטיזציית INT4 ללא fine-tuning; התקבל ל-ICLR 2023
2023, מרץ ChatGLM‑6B (v1) 6.2B פרמטרים, ≈1T טוקנים של קדם-אימון, SFT + יישור RLHF, קוונטיזציית INT4 (≈6 GB זיכרון)
2023, יוני ChatGLM2‑6B 1.4T טוקנים, FlashAttention, Multi‑Query Attention (MQA), הקשר עד 32K טוקנים
2023, אוקטובר ChatGLM3‑6B שיפור מעקב אחר הוראות, תמיכה בקריאת כלים (tool calling), Code Interpreter
2024 GLM‑4, GLM‑4‑Air, GLM‑4‑9B ≈10T טוקנים של קדם-אימון, RoPE + GQA, הקשר עד 128K / 1M טוקנים; GLM‑4 All Tools
2024 GLM‑4V‑9B גרסה מולטימודאלית עם visual encoder
2025 GLM‑4.5, GLM‑4.6, GLM‑4.7 ארכיטקטורת MoE (GLM‑4.5), שיפורים עוקבים בהיסק ובקידוד
2025 GLM‑4.1V‑Thinking מודל שפה-חזותי עם היסק רב-שלבי מועצם (arXiv:2507.01006)
2026, פברואר GLM‑5 744B פרמטרים (MoE), ≈40–44B פעילים, הקשר של 200K טוקנים, משימות אג'נטיות; אימון על Huawei Ascend

[1][2][3][4][8]

משפחת GLM מתפתחת בשילוב עם מודלים נלווים של Zhipu AI: מודלי קוד CodeGeeX, מודלי שפה-חזותיים CogVLM / CogAgent, מודלים גנרטיביים CogView, וכן מערכות מיוחדות WebGLM ו-AgentLM.[2]

יסודות תיאורטיים ואדריכליים

פונקציית המטרה של הקדם-אימון

הארכיטקטורה הבסיסית של GLM מבוססת על Transformer. המאפיין הייחודי המרכזי הוא autoregressive blank infilling — וריאציה של מידול אוטורגרסיבי, שבה המודל לומד לשחזר פערים (spans) בטקסט על פי הקשר.[1][7]

יהא x=[x1,,xn] — רצף הקלט. נבחרים באקראי קטעים רצופים (spans) {s1,,sm}, המוחלפים בטוקן יחיד [MASK], ויוצרים טקסט מעוות xcorrupt. המודל משחזר כל קטע באופן אוטורגרסיבי בסדר תמורה אקראי:

=i=1mj=1|si|logP(si,jxcorrupt,si,<j,s<i)

כאשר xcorrupt — הרצף הפגום עם קטעים מוסתרים, si,<j — טוקנים שכבר שוחזרו של הקטע הנוכחי si, s<i — קטעים קודמים ששוחזרו במלואם. סדר שחזור הקטעים נקבע על ידי תמורה אקראית מהקבוצה Zm, המאפשרת למודל לטפל בתלויות בין קטעים.[1]

לצורך כוונון המשימה: כאשר הפערים קצרים (≈15% מהטוקנים) המודל מותאם ל-NLU, וכאשר הקטעים ארוכים (עד 50–100% מהטוקנים) — למשימות גנרטיביות. זה מאפשר למודל יחיד לכסות את שני המצבים באמצעות קדם-אימון רב-משימתי (multi‑task learning).[1][7]

קידודי מיקום דו-ממדיים

GLM מציג קידודי מיקום דו-ממדיים להבחנה בין מיקומים ברצף הפגום המקורי ובין מיקומים בתוך הקטעים המשוחזרים:[1]

  • הממד הראשון pos1: מיקום מוחלט של הטוקן (או המסכה) ברצף הפגום.
  • הממד השני pos2: מיקום הטוקן בתוך הקטע שלו בעת ייצור אוטורגרסיבי (0 עבור טוקנים מהמקור).

סכמה זו מאפשרת להבחין כהלכה בין ההקשר לטקסט המיוצר ללא רכיבים אדריכליים נוספים הדומים ל-encoder.

מסכת תשומת הלב

ב-GLM משמשת מסכת תשומת לב דו-חלקית: תשומת לב דו-כיוונית (bidirectional) עבור טוקנים לא מוסתרים (Part A — הקשר) ותשומת לב סיבתית (causal) עבור טוקנים בתוך קטעים (Part B — spans משוחזרים). זה מבטיח הבנת הקשר מלא של הטקסט המקורי בעת ייצור אוטורגרסיבי של החלקים המשוחזרים. בניגוד ל-BERT (תחזיות מסכות עצמאיות) — GLM לוקח בחשבון תלויות בין spans; בניגוד ל-GPT — משתמש בהקשר דו-כיווני של Part A; בניגוד ל-T5 — אינו דורש encoder נפרד.[1][7]

התפתחות רכיבים אדריכליים

ברמת הפרמטרים של בלוק ה-Transformer, מצב הסמוי hld בשכבה l במודלים החל מ-GLM‑4 מתעדכן כ:

h~l=hl+GQAl(RMSNorm(hl)),hl+1=h~l+FFNl(RMSNorm(h~l))

כאשר GQA — Grouped‑Query Attention (במקום Multi‑Head Attention מלא), ו-FFN מיושם דרך SwiGLU.[2]

החל מ-GLM‑130B ובהמשך הסדרה, נעשה שימוש ברכיבים אדריכליים הבאים:

  • GLM‑130B: DeepNorm לייצוב אימון רשתות עמוקות; Rotary Positional Encoding (RoPE) עם הרחבה דו-ממדית; Gated Linear Units (GLU) עם אקטיבציית GeLU (GeGLU).[8]
  • GLM‑4: מעבר ל-RMSNorm ו-SwiGLU; Group Query Attention (GQA) במקום Multi‑Head Attention (MHA) לצמצום KV‑cache; הוסרו כל מונחי ה-bias למעט Q/K/V ב-attention; גודל FFN מוגדל ל-103dhidden לשמירת מספר הפרמטרים בעת GQA.[2]
  • GLM‑4.5: Mixture‑of‑Experts (MoE) עם loss‑free balance routing ו-sigmoid gates; מצב היסק היברידי (thinking / non‑thinking).[3]
  • GLM‑5: DeepSeek Sparse Attention (DSA) לעיבוד יעיל של הקשר ארוך עד 200K טוקנים; Multi‑Token Prediction (MTP) לפענוח ספקולטיבי; אימון מלא על מעבדי Huawei Ascend תוך שימוש ב-MindSpore.[4]

קנה מידה וחוקי קנה המידה

במהלך פיתוח סדרת ChatGLM נחקרות תלויות אמפיריות בין הפסד הקדם-אימון לבין האיכות במשימות, כולל תופעת «emergent abilities». הוצג כי בהינתן רמת הפסד קבועה של קדם-אימון, מודלים בגדלים שונים (ומספרי טוקנים שונים) מדגימים ביצועים דומים, ובמשימות מסוימות (MMLU, GSM8K) האיכות מתחילה לחרוג מרמת האקראי רק לאחר הגעה לסף מסוים של הפסד הקדם-אימון.[2]

ארכיטקטורות ומודלים בסדרת GLM

GLM‑10B ו-GLM‑130B

GLM‑10B (2021) — מודל בעל 10 מיליארד פרמטרים, המדגים את ישימות ארכיטקטורת GLM עם blank infilling ומשמש בסיס להרחבה עוקבת.[1]

GLM‑130B (2022) הוצג באוקטובר 2022 והתקבל ל-ICLR 2023 (arXiv:2210.02414):[8]

  • מספר פרמטרים: ≈130 מיליארד (מודל דו-לשוני צפוף).
  • נפח קדם-אימון: מעל 400 מיליארד טוקנים (≈200 מיליארד בסינית, ≈200 מיליארד באנגלית).
  • ארכיטקטורה: 70 שכבות, hidden size 12,288, 96 ראשי תשומת לב; DeepNorm, RoPE, GeGLU; אימון רב-משימתי נוסף (Multi‑Task Instruction Pretraining, MIP) — ≈5% מהטוקנים על 74 מערכי נתונים של משימות NLU/NLG.
  • קוונטיזציה: INT4 ללא fine-tuning לאחר הקוונטיזציה (post‑training quantization) — התוצאה הראשונה המתועדת מסוג זה בקרב מודלים בני 100B+ פרמטרים; היסק אפשרי על 4×RTX 3090 (24 GB) או 8×RTX 2080 Ti (11 GB).
  • יציבות אימון: המחברים מתעדים עליות רבות בפונקציית ההפסד (loss spikes) ומתארים את אסטרטגיות הייצוב שיושמו (gradient clipping, Embedding Gradient Shrink).

במועד הפרסום עלה GLM‑130B על GPT‑3 175B (davinci) במגוון רחב של מבחני השוואה באנגלית (סך הכל 112 משימות) ועל ERNIE TITAN 3.0 260B במשימות בסינית; יחד עם זאת, עליונות על OPT‑175B ו-BLOOM‑176B לא שוחזרה — המחברים מציינים מגבלה זו במפורש. לפי הערכת HELM (נובמבר 2022) GLM‑130B דומה ל-GPT‑3 במספר מדדים.[8][2]

משפחת ChatGLM‑6B/2/3

ChatGLM‑6B (מרץ 2023) — מודל דיאלוגי עם 6.2 מיליארד פרמטרים, שפותח במשותף על ידי KEG ו-Zhipu AI ופורסם כפרויקט פתוח:[2][9]

  • קדם-אימון על ≈1 טריליון טוקנים (סינית + אנגלית), הקשר 2K.
  • מיועד לדיאלוג; היישור הראשוני מבוצע בעיקר באמצעות SFT ו-RLHF.
  • קוונטיזציית INT4 עם צריכה של ≈6 GB זיכרון, שאיפשרה הפעלה מקומית על ציוד צרכני.

ChatGLM2‑6B (יוני 2023):[2]

  • נפח הקדם-אימון הוגדל ל-1.4 טריליון טוקנים.
  • הוכנסו FlashAttention ו-Multi‑Query Attention (MQA); ההקשר הורחב ל-32K טוקנים.
  • שיפור משמעותי במבחני השוואה: MMLU +23 נ"א, GSM8K +571%, BBH +60% ביחס ל-ChatGLM‑6B.

ChatGLM3‑6B (אוקטובר 2023):[2]

  • שיפור נוסף ב-42 מבחני השוואה בתחומי סמנטיקה, מתמטיקה, היסק, קוד וידע.
  • תמיכה מובנית ב-function call, Code Interpreter מובנה ומשימות אג'נטיות באמצעות AgentTuning / AgentLM.

GLM‑4, GLM‑4‑Air, GLM‑4‑9B ו-GLM‑4 All Tools

הדוח הטכני (arXiv:2406.12793) מתאר את GLM‑4 כמשפחת מודלים שעברה קדם-אימון על ≈10 טריליון טוקנים (בעיקר סינית ואנגלית, בתוספת 24 שפות נוספות) ויושרה לסינית ואנגלית.[2]

גרסאות מרכזיות:

  • GLM‑4 (מודל דגל, גרסאות 0116 ו-0520): transformer צפוף, hidden size 6144, 61 שכבות, 48 ראשי תשומת לב, הקשר 128K.
  • GLM‑4‑Air — מודל קומפקטי ומהיר יותר עם איכות הקרובה ל-GLM‑4‑0116 בזמני תגובה קצרים יותר.
  • GLM‑4‑9B — מודל בן 9 מיליארד פרמטרים (הקשר 8K, גרסאות 128K וניסיוני של 1M) עם אותה צינורית post-training.
  • GLM‑4 All Tools — גרסה שיושרה נוסף לשימוש בכלים: דפדפן רשת, מפרש Python, יצירת תמונות (CogView3) ופונקציות מותאמות אישית.

מאפיינים אדריכליים של GLM‑4:[2]

  • היעדר מונחי bias למעט Q/K/V ב-attention.
  • RMSNorm ו-SwiGLU.
  • 2D‑RoPE.
  • Group Query Attention (GQA) עם FFN מוגדל.
  • טוקניזר BPE בייטי בגודל 150K טוקנים, שהתקבל על ידי איחוד מילוני BPE שאומנו בנפרד עבור קורפוס סיני ורב-לשוני עם cl100k_base.

GLM‑4.5 (מודלי בסיס ARC)

GLM‑4.5 — מודל Mixture‑of‑Experts (MoE) פתוח עם דגש על משימות אג'נטיות, היסק וקידוד (Agentic, Reasoning, Coding — ARC):[3]

  • 355 מיליארד פרמטרים כולל, 32 מיליארד פעילים (ארכיטקטורת MoE עם אקטיבציה מפוזרת): 89 שכבות, 160 מומחים, 8 פעילים לטוקן; 96 ראשי תשומת לב, hidden size 5120.
  • GLM‑4.5‑Air: 106 מיליארד כולל / 12 מיליארד פעילים — גרסה יעילה.
  • אימון על 23 טריליון טוקנים עם post-training רב-שלבי הכולל איטרציית מודלים מומחים ו-RLHF.
  • מצב היסק היברידי (thinking mode ו-direct response): במקרה הראשון המודל מייצר עקבות היסק מפורטות; במקרה השני — עונה ישירות. המיתוג מנוהל ברמת צינורית ה-inference.
  • Loss‑free balance routing עם sigmoid gates לניתוב מומחים.
  • אופטימיזטור Muon; עיצוב deeper‑and‑narrower.

GLM‑4.6 / GLM‑4.7

סדרת GLM‑4.6 / 4.7 (ספטמבר–דצמבר 2025) מפתחת את רעיונות GLM‑4.5, ומחזקת תכנות (SWE‑bench Verified / Multilingual), היסק מורכב (Humanity's Last Exam, AIME) ומשימות אג'נטיות. GLM‑4.7 משיג 73.8% ב-SWE‑bench Verified ומציג Interleaved / Preserved / Turn‑level Thinking — שלושה מצבי שילוב של היסק בדיאלוג. תצורות נפרדות פורסמו כמודלי open‑weight.[3][10]

GLM‑5

הדוח הטכני פורסם ב-21 בפברואר 2026 (arXiv:2602.15763). המאפיינים המרכזיים:[4]

  • ארכיטקטורה: Mixture‑of‑Experts עם ≈744–745 מיליארד פרמטרים כולל, 256 מומחים, 8 מופעלים לכל טוקן (≈40–44 מיליארד פרמטרים פעילים, ≈5.9% צפיפות); 75 שכבות MoE + 3 שכבות צפופות.
  • קדם-אימון: 28.5 טריליון טוקנים.
  • חלון הקשר: 200K טוקנים.
  • Dynamic Sparse Attention (DSA): מנגנון תשומת לב מפוזרת המפחית עלויות אימון והיסק תוך שמירת האיכות על הקשרים ארוכים.
  • Multi‑Token Prediction (MTP): טכניקה לפענוח ספקולטיבי בעת היסק.
  • תשתית טכנית: האימון בוצע במלואו על מעבדי Huawei Ascend תוך שימוש ב-framework של MindSpore, ללא תלות בציוד GPU מתוצרת אמריקאית.
  • Post-training: תשתית Reinforcement Learning (RL) אסינכרונית עם דקאפלינג של ייצור ואימון (decoupling inference / training); שימוש באלגוריתמי RL אג'נטיים למשימות ארוכות-אופק; Token‑in‑Token‑out (TITO) וניהול הקשר היררכי למשימות אג'נטיות ארוכות-אופק.
  • רישיון: משקלים פתוחים תחת רישיון MIT.

טבלת סיכום מודלי הסדרה

מודל שנה פרמטרים (כולל / פעילים) טוקנים בקדם-אימון הקשר מאפיינים מרכזיים
GLM‑130B 2022 130 מיליארד / — ≈400 מיליארד 2K צפוף, דו-לשוני, DeepNorm, קוונטיזציית INT4
ChatGLM‑6B 2023 6.2 מיליארד / — ≈1 טריליון 2K דיאלוגי, SFT + RLHF, INT4 (≈6 GB)
ChatGLM2‑6B 2023 6.2 מיליארד / — 1.4 טריליון 32K FlashAttention, MQA
ChatGLM3‑6B 2023 6.2 מיליארד / — 32K Function call, Code Interpreter, AgentTuning
GLM‑4 2024 לא נחשף (API) ≈10 טריליון 128K–1M All Tools, מולטימודאליות (V)
GLM‑4‑9B 2024 ≈9 מיליארד / — ≈10 טריליון 128K–1M גרסה פתוחה, GQA
GLM‑4.5 2025 355 מיליארד / 32 מיליארד 23 טריליון 128K MoE, חשיבה היברידית, פוקוס ARC
GLM‑4.5‑Air 2025 106 מיליארד / 12 מיליארד 23 טריליון 128K גרסת MoE יעילה
GLM‑4.7 2025 128K קידוד משופר, Interleaved Thinking
GLM‑5 2026 744 מיליארד / ≈40 מיליארד 28.5 טריליון 200K DSA, MTP, הנדסה אג'נטית, Huawei Ascend

[2][3][4][8]

הרחבות מולטימודאליות ומיוחדות

  • GLM‑4V‑9B — גרסה מולטימודאלית עם visual encoder לעיבוד תמונות ומסמכים.[2]
  • GLM‑4.1V‑Thinking — מודל שפה-חזותי עם היסק רב-שלבי מועצם (arXiv:2507.01006).[11]
  • GLM‑4‑Voice — מודל דיבור end‑to‑end (9B base, ≈1 טריליון טוקנים של דיבור-טקסט, טוקניזר של 175 ביט/שנייה).[12]
  • CodeGeeX — משפחת מודלי קוד (CodeGeeX‑13B, CodeGeeX2‑6B) לייצור, השלמה ורפקטורינג של קוד בשפות מרובות; משולב בתוספי IDE.[2]
  • CogVLM / CogAgent — מודלי שפה-חזותיים להבנת תמונות וניווט אוטונומי ב-GUI.[2]
  • WebGLM — מודל לחיפוש ממוקד-רשת ו-QA; הוצג כי מודל בן ≈10 מיליארד פרמטרים מתקרב ל-WebGPT‑175B במספר משימות (KDD 2023).[2]

אימון, נתונים וטכנולוגיות עזר

נתוני הקדם-אימון

קורפוס הקדם-אימון עבור GLM‑4 ומודלים קודמים כולל:[2]

  • דפי רשת רב-לשוניים (בעיקר סינית ואנגלית), Wikipedia, ספרים, קוד ומאמרים מדעיים.
  • צינורית עיבוד תלת-שלבית: כפילות (מדויקת ו-fuzzy), סינון (הסרת טקסטים רועשים ועם תוכן פוגעני אפשרי) וטוקניזציה.
  • מילון מאוחד בגודל 150K טוקנים, שהתקבל על ידי איחוד מילוני BPE שאומנו בנפרד עבור קורפוס סיני ורב-לשוני עם cl100k_base (tiktoken).

החשיבות של איכות ומגוון הנתונים מאוששת אמפירית, אולם המחברים אינם מנסחים קריטריונים בסיסיים מפורשים לבחירת נתונים מעבר לדפוסים האמפיריים שפורסמו.[2]

הרחבת הקשר ו-LongAlign

חלונות ההקשר גדלים בהדרגה מ-2K (ChatGLM‑6B) ל-32K (ChatGLM2/3) ועוד ל-128K ו-1M טוקנים ב-GLM‑4, ולאחר מכן ל-200K ב-GLM‑5. נעשה שימוש בשילוב של הרחבת קידוד מיקום (שיטות מבוססות-RoPE לשינוי קנה מידה תדירות) ו-fine-tuning נוסף על טקסטים ארוכים. מתכון יישור מיוחד בשם LongAlign מאפשר שמירת האיכות על קלטים ארוכים: על פי LongBench‑Chat GLM‑4 (0520) מגיע ל-87.3 בחלק האנגלי (דומה ל-GPT‑4 Turbo 1106: 87.2 וב-Claude 3 Opus: 87.7) ול-84.0 בחלק הסיני (גבוה מ-GPT‑4 Turbo וב-Claude 3 Opus).[2]

Post-training ויישור (SFT, RLHF)

ה-post-training כולל שני שלבים עיקריים:[2]

  • Supervised Fine‑Tuning (SFT): אימון על זוגות «שאילתה–תגובה» עם דגש על אינטראקציות אנושיות אמיתיות (human‑authored) ולא על אינטראקציות תבניתיות או מיוצרות.
  • Reinforcement Learning from Human Feedback (RLHF): אופטימיזציה על פי העדפות מוערכים באמצעות PPO, DPO וסכמות קנייניות, בפרט ChatGLM‑RLHF ו-Self‑Contrast (דוגמאות שליליות מיוצרות על ידי המודל עצמו, מה שמפחית את הצורך בנתוני העדפות).

וקטור המאפיינים להערכת תגובות כולל אינדיקטורים של בטיחות, עובדתיות, רלוונטיות, שימושיות ועמידה בהעדפות. המחברים מציינים כי RLHF מפחית את שיעור הסירובים, משפר את הבטיחות ואת העקביות בדיאלוגים רב-תורניים.[2]

טכניקות מיוחדות של מערכת GLM

  • LongAlign — מתכון יישור לטקסט ארוך (עד 128K).[2]
  • ChatGLM‑Math — שיפור פתרון משימות מתמטיות באמצעות סכמת self‑critique (הערכה עצמית של תגובות ללא מודלים חיצוניים).[2]
  • Self‑Contrast — סכמת RLHF שבה דוגמאות שליליות מיוצרות על ידי המודל עצמו.[2]
  • AgentTuning / AgentInstruct — framework ומערך נתונים לאימון כישורים אג'נטיים על מסלולי אינטראקציה של הסוכן עם הסביבה.[2]
  • APAR (Auto‑Parallel Auto‑Regressive) — אלגוריתם ייצור אוטורגרסיבי מקבילי-אוטומטי להאצת ההיסק.[2]

כמו כן פותח מספר מבחני השוואה: AgentBench (משימות אג'נטיות), LongBench (הקשר ארוך), AlignBench (יישור סיני), HumanEval‑X (קוד מעבר ל-Python), NaturalCodeBench (משימות תכנות מעשיות).[2]

תוצאות מרכזיות ומבחני השוואה

כל המדדים מצוטטים מהדוחות הטכניים המקוריים עם ציון התנאים (zero‑/few‑shot, מערך נתונים, גרסת מודל). ההשוואה בוצעה על ידי מחברי הדוחות הטכניים; אימות עצמאי חיצוני על פלטפורמות סטנדרטיות (LMSYS Chatbot Arena, Open LLM Leaderboard) לכל הגרסאות אינו מסודר.

דינמיקת האיכות: ChatGLM‑6B → GLM‑4‑9B

מבחן השוואה ChatGLM‑6B ChatGLM2‑6B ChatGLM3‑6B GLM‑4‑9B
GSM8K (%) 1.5 25.9 72.3 84.0
MMLU (%) 25.2 45.2 61.4 74.7
HumanEval (%) 0.0 9.8 58.5 70.1
C‑Eval (%, סינית) 23.7 51.7 69.0 77.1

כל המודלים הוערכו ב-BF16 עם הגדרות זהות.[2]

GLM‑4 במבחני השוואה אקדמיים

מבחן השוואה GLM‑4 (0520) GPT‑4 (0314) GPT‑4 Turbo (2024‑04‑09) Claude 3 Opus
MMLU (%) 83.3 86.4 86.7 86.8
GSM8K (%) 93.3 92.0 95.6 95.0
MATH (%) 61.3 52.9 73.4 60.1
BBH (%) 84.7 83.1 88.2 86.8
GPQA (%) 39.9 35.7 49.3 50.4
HumanEval (%) 78.5 67.0 88.2 84.9

GLM‑4 (0520) משיג ≈96.3% מתוצאת GPT‑4 ב-MMLU, עולה על GPT‑4 (0314) ב-MATH וב-GSM8K, אך נופל מ-GPT‑4 Turbo ב-MATH וב-HumanEval.[2]

לפי AlignBench v1.1 (יישור סיני) GLM‑4 (0520) מציג ציון כולל 8.00 לעומת 7.90 של GPT‑4 Turbo ו-7.53 של Claude 3 Opus עם יתרון בולט במדדי-המשנה «Logic», «Language», «Professional».[2]

לפי AgentBench GLM‑4 (0520) משיג ציון כולל של 3.79, הדומה או מעט גבוה מ-GPT‑4 Turbo (1106) ומ-Claude 3 Opus. ציונים גבוהים במשימות Database, House‑Holding ו-Web‑Shopping; פיגור — במשימות Operating System ו-Lateral Thinking Puzzles.[2]

לפי Berkeley Function Call Leaderboard GLM‑4 (0520) משיג 81.76% (GPT‑4 Turbo: 81.24%); GLM‑4‑9B‑Chat עולה משמעותית על Llama‑3‑8B‑Instruct (81.00% לעומת 58.88%).[2]

GLM‑4.5

מבחן השוואה GLM‑4.5 הערה
TAU‑Bench (ממוצע אג'נטי) 70.1% משימות אג'נטיות
AIME 2024 91.0% תחרויות מתמטיקה
SWE‑bench Verified 64.2% פתרון משימות על מאגרים אמיתיים
GPQA (Avg@8) 79.1% שאלות ברמת תואר שני
MATH‑500 98.2% מתמטיקה
MMLU‑Pro 84.6% MMLU מורחב

בהתחשב במספר הקטן יותר של פרמטרים פעילים, GLM‑4.5 תופס את המקום ה-3 בין כל המודלים שהוערכו (לפי דירוג מצרפי של 12 מבחני השוואה) ואת המקום ה-2 — במבחני ההשוואה האג'נטיים במועד פרסום הדוח.[3]

GLM‑4.7

  • SWE‑bench Verified: 73.8% (+5.8 נ"א ביחס ל-GLM‑4.5).
  • Terminal‑Bench 2.0: 41.0% (+16.5 נ"א).
  • Humanity's Last Exam (with tools): 42.8%.[10]

GLM‑5

מבחן השוואה GLM‑5 הערה
SWE‑bench Verified 77.8% מוביל בין מודלי open‑weight במועד הפרסום
GPQA‑Diamond 86.0% שאלות ברמת תואר שני
Terminal‑Bench 2.0 56.2–61.1% משימות הנדסיות
Humanity's Last Exam (with tools) 50.4% שאלות בינתחומיות מורכבות
BrowseComp 62.0% ניווט ברשת

GLM‑5 מדגים שיפור של ≈20% במדד הממוצע ביחס ל-GLM‑4.7 ותופס עמדות בין מודלי open‑weight הדומות למודלים סגורים ברמת Claude Opus 4.5 במספר מבחני השוואה אג'נטיים וקוד.[4]

בטיחות (SafetyBench)

לפי SafetyBench (מדגם סיני) GLM‑4 (0520) משיג 87.2% במדד המשולב, הדומה ל-Claude 3 Opus (87.5%) ומעט נמוך מ-GPT‑4 (≈88–89.7%). הפער הבולט ביותר בהשוואה ל-GPT‑4 נצפה במימד «Physical Health» (בטיחות פיזית).[2]

יישום ומערכת אקולוגית

תרחישי דיאלוג ועוזר אישי

סדרת ChatGLM והמודלים העוקבים משמשים כעוזרי דיאלוג, כולל השירות המסחרי Zhipu Qingyan (chatglm.cn / chat.z.ai), עם תמיכה בתקשורת רב-לשונית, דיאלוג רב-תורני ומצב הוראות.[2]

מערכות אג'נטיות וכלים

GLM‑4 All Tools והמודלים העוקבים משתלבים בפלטפורמה האג'נטית GLMs, המאפשרת יצירת סוכנים מותאמים אישית, חיבור מפרש Python מובנה, דפדפן רשת, מודלי VLM/T2I (CogView3) ושימוש ב-API חיצוניים. נתמכות משימות מורכבות: חיפוש ברשת, ניתוח נתונים דרך Python, שרשראות כלים משולבות. GLM‑5 מתמקד במשימות הנדסת תוכנה עם אופק תכנון ארוך (agentic engineering) ונבדק על מבחני ה-MCP‑Atlas ו-BrowseComp.[2][4]

ייצור קוד ופיתוח תוכנה

משפחת CodeGeeX (CodeGeeX‑13B, CodeGeeX2‑6B) ומצבי הקוד של GLM משמשים לייצור קוד בשפות מרובות, השלמה ורפקטורינג, פתרון משימות HumanEval ו-HumanEval‑X. ב-HumanEval‑X CodeGeeX2‑6B משפר את Pass@1 בהשוואה ל-CodeGeeX‑13B (לפי המחברים: +57% ב-Python, +71% ב-C++). המוצר CodeGeeX משולב בתוספי IDE עבור מפתחים.[2]

הקשר ארוך ותרחישים ממוקדי מסמכים

GLM‑4‑9B‑Chat‑1M ומודלים בכירים משמשים לניתוח מסמכים ואוספים גדולים (עד 1M טוקנים), סיכום, חיפוש במסמכים ארוכים ועבודה עם קוד ארוך.[2]

תשתית פריסה

המודלים זמינים דרך פלטפורמת ה-API של Z.ai / bigmodel.cn (tool calling, agent frameworks). גרסאות פתוחות תומכות בפריסה מקומית דרך vLLM, SGLang. תמיכת Huawei Ascend מאפשרת פריסה ללא ציוד NVIDIA. מודלים פתוחים בסדרה הורדו מעל 10 מיליון פעמים ב-Hugging Face (2023–2024).[2][4][13]

מגבלות ובעיות פתוחות

  • חוסר איזון לשוני: סדרת GLM עברה קדם-אימון בעיקר בסינית ובאנגלית; האיכות בשפות אחרות נמוכה משמעותית, כפי שצוין במפורש בדוח הטכני arXiv:2406.12793.[2]
  • רבייה של מבחני השוואה: רוב תוצאות ההשוואה מצוטטות מהדוחות הטכניים של המפתחים עצמם. אימות חיצוני עצמאי על פלטפורמות סטנדרטיות (LMSYS Chatbot Arena, Open LLM Leaderboard) לכל הגרסאות אינו מסודר.
  • עליות הפסד בעת קנה מידה: אימון GLM‑130B התלווה בעליות רבות של פונקציית ההפסד שדרשו התערבות ידנית; המחברים מתעדים זאת כבעיה הנדסית לא פתורה בעת קנה מידה.[8]
  • תלות בחומרה: החל מ-GLM‑5, האימון הועבר ל-Huawei Ascend / MindSpore; שחזור עצמאי על פלטפורמות חומרה אחרות הוא קשה.[4]
  • יישור ובטיחות: למרות שימוש ב-RLHF, בעיות של סירוב לענות, עקביות בדיאלוגים רב-תורניים ועקיפת מנגנוני בטיחות נותרות רלוונטיות; מחברי arXiv:2406.12793 מציינים כי RLHF עוזר אך אינו פותר את הבעיות לחלוטין.[2]
  • הזיות: כמו ב-LLM אחרים, בעיית שגיאות עובדתיות מתועדת; הערכות כמותיות משתנות בהתאם למשימה ולמתודולוגיה.
  • היסק מתמטי: GLM‑4 נופל מ-GPT‑4 Turbo ב-MATH ובמספר משימות של חשבון מורכב, למרות שימוש בשיטות מיוחדות (ChatGLM‑Math).[2]
  • משימות אג'נטיות: לפי AgentBench נותר פער במשימות הקשורות לאינטראקציה ברמת מערכת הפעלה ולפאזלים לוגיים מורכבים; איכות האופק הארוך (long‑horizon) נותרת אתגר לא פתור (הצטברות שגיאות במשימות מקושרות).[2][4]
  • קוד ומשימות מעשיות: ב-NaturalCodeBench GLM‑4 (overall 47.1%) נמוך מ-GPT‑4 Turbo (53.8%), אם כי דומה ל-Claude 3 Opus (48.3%).[2]

היבטים אתיים ורגולטוריים

סדרת GLM מפותחת בהתאם לדרישות הרגולטור הסיני (מינהל מרחב הסייבר של סין, CAC) בכל הנוגע לרישום מודלים גנרטיביים ועמידה בהערכות בטיחות. ה-post-training כולל SFT ו-RLHF להפחתת רעילות ותכנים מזיקים.[2]

הדוח הטכני של GLM‑4 מתאר תהליך ניהול סיכונים רב-שלבי:[2]

  • ניקוי מוקדם של קורפוס הקדם-אימון מטקסטים בעלי תוכן פוגעני אפשרי.
  • סינון נתוני היישור לפי קריטריוני בטיחות.
  • בדיקת Red‑team: גיבוש בקשות מזיקות מורכבות ל-fine-tuning.
  • שימוש ב-SafetyBench להערכה כמותית של בטיחות (7 מימדים).

מודלים מוקדמים (GLM‑130B) מדגימים רמת הטיה נמוכה יותר לפי CrowS‑Pairs ורעילות מופחתת לפי RealToxicPrompts בהשוואה ל-GPT‑3 ו-OPT בשל האימון הדו-לשוני.[8][2]

שחרור GLM‑5 תחת רישיון MIT משמעו היעדר הגבלות פורמליות על שימוש מסחרי במשקלים הפתוחים, מה שגורר סיכונים סטנדרטיים של שימוש בלתי מבוקר האופייניים ל-LLM פתוחים.[4] שאלות של הטיות (bias) בקורפוסי הקדם-אימון הספציפיים לשפה הסינית ולהקשר התרבותי אינן נחקרות באופן שיטתי בעבודות פומביות נכון למועד כתיבת המאמר.

פרספקטיבות וכיווני מחקר

על בסיס הדוחות הטכניים ממוצמדים החומרים של Z.ai, מסומנות הכיוונים הבאים שהוצהרו:[3][4]

  • קנה מידה של ארכיטקטורות MoE תוך הפחתת עלות הפרמטרים הפעילים לטוקן.
  • פיתוח אלגוריתמי RL אג'נטיים אסינכרוניים למשימות ארוכות-אופק.
  • שיפור מנגנוני תשומת לב מפוזרת (DSA) להקשרים מעל 200K טוקנים.
  • היסק מולטימודאלי: פיתוח GLM‑4.1V‑Thinking לכיוון הבנת וידאו ומסמכים.
  • הפחתת תלות ב-API חיצוניים בביצוע משימות אג'נטיות באמצעות אימון סוכנים סופיים על אינטראקציות אמיתיות.
  • אופטימיזציה לחומרה מקומית (עבור סין) (Huawei Ascend, Cambricon) והפחתת טביעת הפחמן של האימון.
  • אינטגרציה עם פלטפורמות רובוטיות ומדעיות-חישוביות.

ראו גם

  • ארכיטקטורת Transformer
  • BERT
  • GPT
  • T5
  • ארכיטקטורות Decoder‑only
  • Reinforcement Learning from Human Feedback
  • DeepSeek

ספרות

הערות

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
  5. Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
  6. Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
  7. 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
  9. THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
  10. 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
  11. Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
  12. Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
  13. Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)