GLM (General Language Model) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

GLM (General Language Model) — Zhipu AI şirketi (2025'ten itibaren Z.ai) tarafından Pekin Tsinghua Üniversitesi Bilgisayar Bilimleri Fakültesi'nin Knowledge Engineering Group (KEG) laboratuvarıyla ortaklaşa geliştirilen büyük dil modelleri (Large Language Model, LLM) ailesidir. Seri, ağırlıklı olarak Çince ve İngilizceye yönelik 6 ila 744 milyar parametreli modelleri kapsamaktadır. Mimari temelin belirgin özelliği, encoder ve decoder transformer'larının özelliklerini tek bir birleşik şemada birleştiren, autoregressive blank infilling (özgüdeğimli boşluk doldurma) tabanlı ön eğitim amaç fonksiyonudur.[1][2][3]

Seri; temel ön eğitimli modeller, diyalog varyantları (ChatGLM), çok modlu uzantılar (GLM‑4V, CogVLM), özelleşmiş araçlar (kod üretimi için CodeGeeX, web araması için WebGLM) ve ajan sistemleri (GLM‑4 All Tools, AutoGLM) içermektedir. Ailenin evrimi GLM‑10B (2021) ve GLM‑130B (2022)'den GLM‑4 (2024), GLM‑4.5 (2025) ve GLM‑5 (2026)'ya uzanmakta; yoğun (dense) mimarilerden Mixture‑of‑Experts (MoE) mimarisine geçişi ve ajan senaryolarına vurguyu yansıtmaktadır.[2][4]

Tarihçe ve Ön Koşullar

Kurumsal Bağlam

Zhipu AI, 2019 yılında Tsinghua Üniversitesi öğretim üyeleri Tang Jie ve Li Juanzi tarafından, bilgi grafiklerine odaklanan KEG laboratuvarı bünyesinde kurulmuştur. 2020 yılında şirket, büyük ölçekli dil modelleri üzerine yoğunlaşmıştır. 2023 yılında Alibaba Group, Tencent, Ant Group, Meituan ve Xiaomi'nin katılımıyla 2,5 milyar yuan (≈350 milyon ABD doları) yatırım sağlanmıştır. Temmuz 2025'te şirket, kamuya açık markasını Z.ai olarak değiştirmiş; Ocak 2026'da ise Hong Kong Menkul Kıymetler Borsası'nda halka arz gerçekleştirmiştir.[5][6]

Temel Çalışma: GLM (2021–2022)

Temel ön baskı "GLM: General Language Model Pretraining with Autoregressive Blank Infilling", Mart 2021'de arXiv'de yayımlanmış (arXiv:2103.10360) ve ACL 2022 konferansında kabul edilmiştir. Yazarlar: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang. Çalışma, mevcut mimari paradigmaların sınırlılıklarından hareketle yapılmıştır: encoder modeller (BERT) doğal dil anlama (Natural Language Understanding, NLU) görevleri için optimaldır, decoder modeller (GPT) üretim için uygundur, encoder‑decoder modeller (T5) ise daha fazla parametre gerektirir. GLM, her iki görev sınıfını da çözebilecek birleşik bir yaklaşım önermiştir.[1][7]

Temel Sürümlerin Kronolojisi

Yıl Model Temel Özellikler
2021 GLM (temel), GLM‑10B Autoregressive blank infilling, 2B pozisyon kodlamaları; 515M'a kadar (temel) ve 10B parametre
2022 GLM‑130B 130B parametre, iki dilli (Çince / İngilizce), açık ağırlıklar, ek ince ayar gerektirmeyen INT4 kuantizasyonu; ICLR 2023'te kabul edildi
2023, Mart ChatGLM‑6B (v1) 6,2B parametre, ≈1T token ön eğitim, SFT + RLHF hizalama, INT4 kuantizasyonu (≈6 GB bellek)
2023, Haziran ChatGLM2‑6B 1,4T token, FlashAttention, Multi‑Query Attention (MQA), 32K tokena kadar bağlam
2023, Ekim ChatGLM3‑6B Geliştirilmiş talimat takibi, araç çağırma (tool calling) desteği, Code Interpreter
2024 GLM‑4, GLM‑4‑Air, GLM‑4‑9B ≈10T token ön eğitim, RoPE + GQA, 128K / 1M tokena kadar bağlam; GLM‑4 All Tools
2024 GLM‑4V‑9B Görsel encoder ile çok modlu sürüm
2025 GLM‑4.5, GLM‑4.6, GLM‑4.7 MoE mimarisi (GLM‑4.5), akıl yürütme ve kodlamada ardışık iyileştirmeler
2025 GLM‑4.1V‑Thinking Güçlendirilmiş çok adımlı akıl yürütmeye sahip görsel‑dil modeli (arXiv:2507.01006)
2026, Şubat GLM‑5 744B parametre (MoE), ≈40–44B aktif, 200K tokenlik bağlam, ajan görevleri; Huawei Ascend üzerinde eğitim

[1][2][3][4][8]

GLM ailesi, Zhipu AI'ın eşlik eden modelleriyle birlikte gelişmektedir: kod modelleri CodeGeeX, görsel‑dil modelleri CogVLM / CogAgent, üretken modeller CogView ve özelleşmiş sistemler WebGLM ile AgentLM.[2]

Teorik ve Mimari Temeller

Ön Eğitim Amaç Fonksiyonu

GLM'nin temel mimarisi Transformer'a dayanmaktadır. Temel belirgin özellik, autoregressive blank infillingdır — modelin bağlama göre metindeki boşlukları (span) öğrendiği özgüdeğimli modellemenin bir varyasyonudur.[1][7]

x=[x1,,xn] giriş dizisi olsun. Rastgele seçilen sürekli parçalar (span) {s1,,sm}, tek bir [MASK] token'ıyla değiştirilerek bozulmuş metin xcorrupt oluşturulur. Model, her parçayı rastgele permütasyon sırasıyla özgüdeğimli olarak yeniden oluşturur:

=i=1mj=1|si|logP(si,jxcorrupt,si,<j,s<i)

Burada xcorrupt — maskeli parçalarla bozulmuş dizi, si,<j — mevcut si parçasının halihazırda yeniden oluşturulmuş token'ları, s<i — tamamen yeniden oluşturulmuş önceki parçalardır. Parçaların yeniden oluşturma sırası, Zm kümesinden rastgele permütasyonla belirlenir; bu, modelin parçalar arasındaki bağımlılıkları işlemesine olanak tanır.[1]

Görev ayarlaması için: kısa boşluklarda (≈%15 token) model NLU için, uzun parçalarda (token'ların %50–100'üne kadar) üretken görevler için optimize edilir. Bu, tek bir modelin çok görevli ön eğitim (multi‑task learning) yoluyla her iki modu da kapsamasına olanak tanır.[1][7]

2B Pozisyon Kodlamaları

GLM, orijinal bozulmuş dizideki konumlar ile yeniden oluşturulan parçalar içindeki konumları birbirinden ayırt etmek için iki boyutlu pozisyon kodlamaları tanıtmaktadır:[1]

  • Birinci boyut pos1: bozulmuş dizideki token'ın (veya maskenin) mutlak konumu.
  • İkinci boyut pos2: özgüdeğimli üretim sırasında token'ın kendi parçası içindeki konumu (orijinal token'lar için 0).

Bu şema, encoder'a benzer ek mimari öğeler gerektirmeksizin bağlamı ve üretilen metni doğru biçimde ayırt etmeye olanak tanır.

Dikkat Maskesi

GLM, iki bileşenli bir dikkat maskesi kullanır: maskesiz token'lar için çift yönlü (bidirectional) dikkat (A Bölümü — bağlam) ve parçalar içindeki token'lar için nedensel (causal) dikkat (B Bölümü — yeniden oluşturulan span'lar). Bu, yeniden oluşturulan bölümlerin özgüdeğimli üretimi sırasında orijinal metnin tam bağlamsal anlaşılmasını sağlar. BERT'in aksine (bağımsız maske tahminleri) GLM, span'lar arasındaki bağımlılıkları göz önünde bulundurur; GPT'nin aksine — A Bölümünün çift yönlü bağlamını kullanır; T5'in aksine — ayrı bir encoder gerektirmez.[1][7]

Mimari Bileşenlerin Evrimi

Transformer bloğunun parametre düzeyinde, GLM‑4'ten itibaren l katmanındaki hld gizli durumu şu şekilde güncellenir:

h~l=hl+GQAl(RMSNorm(hl)),hl+1=h~l+FFNl(RMSNorm(h~l))

Burada GQA — tam Multi‑Head Attention yerine Grouped‑Query Attention ve FFN, SwiGLU ile gerçekleştirilmiştir.[2]

GLM‑130B'den itibaren seride aşağıdaki mimari bileşenler kullanılmaktadır:

  • GLM‑130B: Derin ağların eğitimini kararlı kılmak için DeepNorm; 2B uzantılı Rotary Positional Encoding (RoPE); GeLU aktivasyonlu (GeGLU) Gated Linear Units (GLU).[8]
  • GLM‑4: RMSNorm ve SwiGLU'ya geçiş; KV önbelleğini azaltmak için Multi‑Head Attention (MHA) yerine Group Query Attention (GQA); attention'daki Q/K/V dışındaki tüm bias terimleri kaldırılmış; GQA ile parametre sayısını korumak için FFN boyutu 103dhidden'e büyütülmüş.[2]
  • GLM‑4.5: Loss-free balance routing ve sigmoid gates ile Mixture‑of‑Experts (MoE); hibrit akıl yürütme modu (thinking / non‑thinking).[3]
  • GLM‑5: 200K tokena kadar uzun bağlamın verimli işlenmesi için DeepSeek Sparse Attention (DSA); spekülatif kod çözme için Multi‑Token Prediction (MTP); MindSpore kullanılarak tamamen Huawei Ascend işlemcilerinde eğitim.[4]

Ölçekleme ve Ölçekleme Yasaları

ChatGLM serisinin geliştirilmesi sürecinde, "emergent abilities" fenomeni dahil olmak üzere ön eğitim kaybı ile görev kalitesi arasındaki deneysel bağımlılıklar incelenmektedir. Sabit bir ön eğitim kaybı seviyesinde, farklı boyuttaki modellerin (ve token sayısının) karşılaştırılabilir performans sergilediği; bazı görevlerde ise (MMLU, GSM8K) kalitanin yalnızca belirli bir ön eğitim kaybı eşiğine ulaşıldıktan sonra rastlantısal seviyeyi aşmaya başladığı gösterilmiştir.[2]

GLM Serisindeki Mimariler ve Modeller

GLM‑10B ve GLM‑130B

GLM‑10B (2021) — blank infilling ile GLM mimarisinin uygulanabilirliğini gösteren ve sonraki ölçeklendirme için temel oluşturan 10 milyar parametreli model.[1]

GLM‑130B (2022), Ekim 2022'de tanıtılmış ve ICLR 2023'te kabul edilmiştir (arXiv:2210.02414):[8]

  • Parametre sayısı: ≈130 milyar (yoğun iki dilli model).
  • Ön eğitim hacmi: 400 milyar tokenın üzerinde (≈200 milyar Çince, ≈200 milyar İngilizce).
  • Mimari: 70 katman, gizli boyut 12.288, 96 dikkat kafası; DeepNorm, RoPE, GeGLU; ek çok görevli eğitim (Multi‑Task Instruction Pretraining, MIP) — 74 NLU/NLG görev veri kümesinde token'ların ≈%5'i.
  • Kuantizasyon: Kuantizasyon sonrası ek ince ayar (post-training quantization) gerektirmeyen INT4 — 100B+ modeller arasında bu türden ilk belgelenmiş sonuç; çıkarım 4×RTX 3090 (24 GB) veya 8×RTX 2080 Ti (11 GB) üzerinde mümkündür.
  • Eğitim kararlılığı: Yazarlar çok sayıda kayıp fonksiyonu sıçramasını (loss spikes) belgelemekte ve uygulanan kararlılaştırma stratejilerini (gradient clipping, Embedding Gradient Shrink) açıklamaktadır.

Yayın anında GLM‑130B, İngilizce kıyaslama testlerinin geniş bir kümesinde (toplam 112 görev) GPT‑3 175B'yi (davinci) ve Çince görevlerde ERNIE TITAN 3.0 260B'yi geride bırakmıştır; ancak OPT‑175B ve BLOOM‑176B üzerindeki üstünlük yeniden üretilememiş — yazarlar bu sınırlamayı açıkça belirtmektedir. HELM değerlendirmesine göre (Kasım 2022) GLM‑130B, çeşitli ölçütlerde GPT‑3 ile karşılaştırılabilir düzeydedir.[8][2]

ChatGLM‑6B/2/3 Ailesi

ChatGLM‑6B (Mart 2023) — KEG ve Zhipu AI tarafından ortaklaşa geliştirilen, açık kaynak projesi olarak yayımlanan 6,2 milyar parametreli diyalog modeli:[2][9]

  • ≈1 trilyon token (Çince + İngilizce) üzerinde ön eğitim, 2K bağlam.
  • Diyaloga yönelik; başlangıç hizalaması ağırlıklı olarak SFT ve RLHF ile gerçekleştirilmiştir.
  • ≈6 GB bellek tüketimiyle INT4 kuantizasyonu, tüketici donanımında yerel çalışmayı mümkün kılmıştır.

ChatGLM2‑6B (Haziran 2023):[2]

  • Ön eğitim hacmi 1,4 trilyon tokena çıkarılmıştır.
  • FlashAttention ve Multi‑Query Attention (MQA) tanıtılmış; bağlam 32K tokena genişletilmiştir.
  • Kıyaslama testlerinde önemli artış: ChatGLM‑6B'ye kıyasla MMLU +23 p.p., GSM8K +%571, BBH +%60.

ChatGLM3‑6B (Ekim 2023):[2]

  • Anlambilim, matematik, akıl yürütme, kod ve bilgi alanlarında 42 kıyaslama testinde ek artış.
  • Yerel function call, yerleşik Code Interpreter ve AgentTuning / AgentLM aracılığıyla ajan görevleri desteği.

GLM‑4, GLM‑4‑Air, GLM‑4‑9B ve GLM‑4 All Tools

Teknik rapor (arXiv:2406.12793), GLM‑4'ü ≈10 trilyon token (ağırlıklı olarak Çince ve İngilizce, artı 24 ek dil) üzerinde ön eğitim görmüş ve Çince ile İngilizceye hizalanmış bir model ailesi olarak tanımlamaktadır.[2]

Temel varyantlar:

  • GLM‑4 (amiral gemisi model, 0116 ve 0520 sürümleri): yoğun transformer, gizli boyut 6144, 61 katman, 48 dikkat kafası, 128K bağlam.
  • GLM‑4‑Air — daha düşük gecikmeyle GLM‑4‑0116'ya yakın kalitede, daha kompakt ve hızlı model.
  • GLM‑4‑9B — aynı eğitim sonrası hattıyla 9 milyar parametreli model (8K bağlam, 128K ve deneysel 1M varyantları).
  • GLM‑4 All Tools — araç kullanımı için ek hizalamalı sürüm: web tarayıcısı, Python yorumlayıcı, görüntü üretimi (CogView3) ve özel fonksiyonlar.

GLM‑4'ün mimari özellikleri:[2]

  • Attention'daki Q/K/V dışında bias terimi bulunmamaktadır.
  • RMSNorm ve SwiGLU.
  • 2B‑RoPE.
  • Büyütülmüş FFN ile Group Query Attention (GQA).
  • Çince ve çok dilli korpuslar için ayrı ayrı eğitilmiş BPE sözlüklerinin cl100k_base ile birleştirilmesiyle elde edilen 150K tokenlik bayt BPE tokenizer.

GLM‑4.5 (ARC temel modelleri)

GLM‑4.5 — ajan, akıl yürütme ve kodlama görevlerine (Agentic, Reasoning, Coding — ARC) odaklanan açık Mixture‑of‑Experts (MoE) modelidir:[3]

  • 355 milyar toplam parametre, 32 milyar aktif (seyrek aktivasyonlu MoE mimarisi): 89 katman, 160 uzman, token başına 8 aktif; 96 dikkat kafası, gizli boyut 5120.
  • GLM‑4.5‑Air: 106 milyar toplam / 12 milyar aktif parametre — verimli varyant.
  • Uzman modellerin yinelenmesi ve RLHF dahil çok aşamalı eğitim sonrası süreçle 23 trilyon token üzerinde eğitim.
  • Hibrit çıkarım modu (düşünme modu ve doğrudan yanıt): birincisinde model ayrıntılı bir akıl yürütme izi üretir; ikincisinde doğrudan yanıt verir. Geçiş, çıkarım hattı düzeyinde yönetilir.
  • Uzman yönlendirme için sigmoid gates ile loss-free balance routing.
  • Muon optimizatörü; daha derin ve dar tasarım.

GLM‑4.6 / GLM‑4.7

GLM‑4.6 / 4.7 serisi (Eylül–Aralık 2025), GLM‑4.5 fikirlerini geliştirerek programlamayı (SWE‑bench Verified / Multilingual), karmaşık akıl yürütmeyi (Humanity's Last Exam, AIME) ve ajan görevlerini güçlendirmektedir. GLM‑4.7, SWE‑bench Verified'da %73,8 değerine ulaşmakta ve diyaloga akıl yürütme entegrasyonunun üç modunu tanıtmaktadır: Interleaved / Preserved / Turn‑level Thinking. Belirli konfigürasyonlar open‑weight modeller olarak açılmıştır.[3][10]

GLM‑5

Teknik rapor 21 Şubat 2026'da yayımlanmıştır (arXiv:2602.15763). Temel özellikler:[4]

  • Mimari: ≈744–745 milyar toplam parametre, 256 uzman, token başına 8 aktif (≈40–44 milyar aktif parametre, ≈%5,9 yoğunluk) ile Mixture‑of‑Experts; 75 MoE katmanı + 3 yoğun katman.
  • Ön eğitim: 28,5 trilyon token.
  • Bağlam penceresi: 200K token.
  • Dynamic Sparse Attention (DSA): Uzun bağlamlarda kaliteyi korurken eğitim ve çıkarım maliyetlerini azaltan seyrek dikkat mekanizması.
  • Multi‑Token Prediction (MTP): Çıkarımda spekülatif kod çözme için teknik.
  • Teknik altyapı: Eğitim, ABD üretimi GPU donanımına bağımlılık olmaksızın MindSpore çerçevesi kullanılarak tamamen Huawei Ascend işlemcileri üzerinde gerçekleştirilmiştir.
  • Eğitim sonrası: Üretim ve eğitimin ayrıştırılmasıyla (decoupling inference / training) asenkron Reinforcement Learning (RL) altyapısı; uzun ufuklu etkileşim için ajan RL algoritmalarının uygulanması; uzun ufuklu ajan görevleri için Token‑in‑Token‑out (TITO) ve hiyerarşik bağlam yönetimi.
  • Lisans: MIT lisansı altında açık ağırlıklar.

Seri Modellerinin Özet Tablosu

Model Yıl Parametre (toplam / aktif) Ön eğitim token'ı Bağlam Temel özellikler
GLM‑130B 2022 130 milyar / — ≈400 milyar 2K Yoğun, iki dilli, DeepNorm, INT4 kuantizasyonu
ChatGLM‑6B 2023 6,2 milyar / — ≈1 trilyon 2K Diyalog, SFT + RLHF, INT4 (≈6 GB)
ChatGLM2‑6B 2023 6,2 milyar / — 1,4 trilyon 32K FlashAttention, MQA
ChatGLM3‑6B 2023 6,2 milyar / — 32K Function call, Code Interpreter, AgentTuning
GLM‑4 2024 açıklanmamış (API) ≈10 trilyon 128K–1M All Tools, çok modallilik (V)
GLM‑4‑9B 2024 ≈9 milyar / — ≈10 trilyon 128K–1M Açık sürüm, GQA
GLM‑4.5 2025 355 milyar / 32 milyar 23 trilyon 128K MoE, hibrit düşünme, ARC odaklı
GLM‑4.5‑Air 2025 106 milyar / 12 milyar 23 trilyon 128K Verimli MoE varyantı
GLM‑4.7 2025 128K Geliştirilmiş kodlama, Interleaved Thinking
GLM‑5 2026 744 milyar / ≈40 milyar 28,5 trilyon 200K DSA, MTP, ajan mühendisliği, Huawei Ascend

[2][3][4][8]

Çok Modlu ve Özelleşmiş Uzantılar

  • GLM‑4V‑9B — görüntü ve belge işleme için görsel encoder'lı çok modlu sürüm.[2]
  • GLM‑4.1V‑Thinking — güçlendirilmiş çok adımlı akıl yürütmeye sahip görsel‑dil modeli (arXiv:2507.01006).[11]
  • GLM‑4‑Voice — uçtan uca konuşma modeli (9B temel, ≈1 trilyon konuşma‑metin tokeni, 175 bit/s tokenizer).[12]
  • CodeGeeX — birden fazla dilde kod üretimi, tamamlama ve yeniden düzenleme için kod modelleri ailesi (CodeGeeX‑13B, CodeGeeX2‑6B); IDE eklentilerine entegre edilmiştir.[2]
  • CogVLM / CogAgent — görüntü anlama ve GUI'de özerk gezinme için görsel‑dil modelleri.[2]
  • WebGLM — web odaklı arama ve soru yanıtlama modeli; ≈10 milyar parametreli modelin bazı görevlerde WebGPT‑175B'ye yaklaştığı gösterilmiştir (KDD 2023).[2]

Eğitim, Veriler ve Yardımcı Teknolojiler

Ön Eğitim Verileri

GLM‑4 ve önceki modeller için ön eğitim korpusu şunları içermektedir:[2]

  • Ağırlıklı olarak Çince ve İngilizce çok dilli web sayfaları, Wikipedia, kitaplar, kod ve bilimsel makaleler.
  • Üç aşamalı işleme hattı: tekilleştirme (tam ve bulanık), filtreleme (gürültülü ve potansiyel olarak zararlı metinlerin kaldırılması) ve tokenizasyon.
  • Çince ve çok dilli korpuslar için ayrı ayrı eğitilmiş BPE sözlüklerinin cl100k_base (tiktoken) ile birleştirilmesiyle elde edilen 150K tokenlik birleşik sözlük.

Veri kalitesinin ve çeşitliliğinin önemi deneysel olarak doğrulanmaktadır; ancak yazarlar, yayımlanan deneysel düzenliliklerin ötesinde açık temel veri seçim kriterleri formüle etmemektedir.[2]

Bağlam Genişletme ve LongAlign

Bağlam pencereleri, ChatGLM‑6B'de 2K'dan ChatGLM2/3'te 32K'ya, ardından GLM‑4'te 128K ve 1M tokena, sonrasında GLM‑5'te 200K tokena kadar kademeli olarak artırılmaktadır. Konum kodlaması genişletme (RoPE tabanlı frekans ölçekleme yöntemleri) ile uzun metinler üzerinde ek ince ayarın bir kombinasyonu kullanılmaktadır. Özel LongAlign hizalama tarifi, uzun girişlerde kalitenin korunmasına olanak tanımaktadır: LongBench‑Chat'ta GLM‑4 (0520), İngilizce bölümde 87,3 değerine ulaşmaktadır (GPT‑4 Turbo 1106: 87,2 ve Claude 3 Opus: 87,7 ile karşılaştırılabilir) ve Çince bölümde 84,0'a (GPT‑4 Turbo ve Claude 3 Opus'un üzerinde).[2]

Eğitim Sonrası ve Hizalama (SFT, RLHF)

Eğitim sonrası iki temel aşama içermektedir:[2]

  • Supervised Fine‑Tuning (SFT): Şablon veya oluşturulmuş etkileşimler yerine gerçek (insan yazarlı) etkileşimlere odaklanan "istek–yanıt" çiftleri üzerinde eğitim.
  • Reinforcement Learning from Human Feedback (RLHF): PPO, DPO ve özel şemalar aracılığıyla açıklayıcı tercihlerine göre optimizasyon; bu şemalar arasında ChatGLM‑RLHF ve Self‑Contrast (olumsuz örneklerin modelin kendisi tarafından üretilmesiyle tercih verisi ihtiyacını azaltan) yer almaktadır.

Yanıtları değerlendirme özellik vektörü; güvenlik, olgusallık, alaka, yararlılık ve tercih uyumu göstergelerini kapsamaktadır. Yazarlar, RLHF'nin ret sıklığını azalttığını, güvenliği artırdığını ve çok turlu diyaloglarda tutarlılığı iyileştirdiğini belirtmektedir.[2]

GLM Ekosisteminin Özelleşmiş Teknikleri

  • LongAlign — uzun bağlam hizalama tarifi (128K'ya kadar).[2]
  • ChatGLM‑Math — dış modeller gerektirmeyen öz değerlendirme (self-critique) şemasıyla matematik problemlerini çözmenin iyileştirilmesi.[2]
  • Self‑Contrast — olumsuz örneklerin modelin kendisi tarafından üretildiği RLHF şeması.[2]
  • AgentTuning / AgentInstruct — ajanın çevreyle etkileşim yörüngeleri üzerinde ajan becerilerinin öğretilmesi için çerçeve ve veri kümesi.[2]
  • APAR (Auto‑Parallel Auto‑Regressive) — çıkarımı hızlandırmak için otomatik paralel özgüdeğimsel üretim algoritması.[2]

Ayrıca çeşitli kıyaslama testleri geliştirilmiştir: AgentBench (ajan görevleri), LongBench (uzun bağlam), AlignBench (Çince hizalama), HumanEval‑X (Python dışında kod), NaturalCodeBench (pratik programlama görevleri).[2]

Temel Sonuçlar ve Kıyaslama Testleri

Tüm ölçütler, koşullar belirtilerek (zero‑/few‑shot, veri kümesi, model sürümü) orijinal teknik raporlardan alınmıştır. Karşılaştırma, teknik rapor yazarları tarafından gerçekleştirilmiştir; standartlaştırılmış platformlarda (LMSYS Chatbot Arena, Open LLM Leaderboard) tüm sürümler için bağımsız yeniden üretim sistematik biçimde yapılmamıştır.

Kalite Dinamiği: ChatGLM‑6B → GLM‑4‑9B

Kıyaslama Testi ChatGLM‑6B ChatGLM2‑6B ChatGLM3‑6B GLM‑4‑9B
GSM8K (%) 1,5 25,9 72,3 84,0
MMLU (%) 25,2 45,2 61,4 74,7
HumanEval (%) 0,0 9,8 58,5 70,1
C‑Eval (%, Çince) 23,7 51,7 69,0 77,1

Tüm modeller aynı ayarlarla BF16 formatında değerlendirilmiştir.[2]

Akademik Kıyaslama Testlerinde GLM‑4

Kıyaslama Testi GLM‑4 (0520) GPT‑4 (0314) GPT‑4 Turbo (2024‑04‑09) Claude 3 Opus
MMLU (%) 83,3 86,4 86,7 86,8
GSM8K (%) 93,3 92,0 95,6 95,0
MATH (%) 61,3 52,9 73,4 60,1
BBH (%) 84,7 83,1 88,2 86,8
GPQA (%) 39,9 35,7 49,3 50,4
HumanEval (%) 78,5 67,0 88,2 84,9

GLM‑4 (0520), MMLU'da GPT‑4 sonucunun ≈%96,3'üne ulaşmakta, MATH ve GSM8K'da GPT‑4 (0314)'ü geride bırakmakta, ancak MATH ve HumanEval'de GPT‑4 Turbo'ya yetişememektedir.[2]

AlignBench v1.1 (Çince hizalama) değerlendirmesinde GLM‑4 (0520), "Logic", "Language", "Professional" alt göstergelerinde belirgin bir üstünlükle GPT‑4 Turbo'nun 7,90 ve Claude 3 Opus'un 7,53 değerlerine karşın 8,00 genel puan elde etmektedir.[2]

AgentBench değerlendirmesinde GLM‑4 (0520), GPT‑4 Turbo (1106) ve Claude 3 Opus ile karşılaştırılabilir veya biraz daha yüksek 3,79 genel puanına ulaşmaktadır. Database, House‑Holding ve Web‑Shopping görevlerinde yüksek puanlar; Operating System ve Lateral Thinking Puzzles görevlerinde ise geride kalmaktadır.[2]

Berkeley Function Call Leaderboard değerlendirmesinde GLM‑4 (0520) %81,76'ya ulaşmaktadır (GPT‑4 Turbo: %81,24); GLM‑4‑9B‑Chat, Llama‑3‑8B‑Instruct'ı önemli ölçüde geride bırakmaktadır (%81,00 - %58,88).[2]

GLM‑4.5

Kıyaslama Testi GLM‑4.5 Not
TAU‑Bench (ajan ortalaması) %70,1 Ajan görevleri
AIME 2024 %91,0 Matematik yarışmaları
SWE‑bench Verified %64,2 Gerçek depolarda görev çözme
GPQA (Avg@8) %79,1 Lisansüstü düzey sorular
MATH‑500 %98,2 Matematik
MMLU‑Pro %84,6 Genişletilmiş MMLU

Daha az sayıda aktif parametreye karşın GLM‑4.5, rapor yayımlandığı anda (12 kıyaslama testinden oluşan toplu sıralamaya göre) değerlendirilen tüm modeller arasında 3. sıraya ve ajan kıyaslama testlerinde 2. sıraya yerleşmektedir.[3]

GLM‑4.7

  • SWE‑bench Verified: %73,8 (GLM‑4.5'e göre +5,8 p.p.).
  • Terminal‑Bench 2.0: %41,0 (+16,5 p.p.).
  • Humanity's Last Exam (araçlarla): %42,8.[10]

GLM‑5

Kıyaslama Testi GLM‑5 Not
SWE‑bench Verified %77,8 Yayın anında open‑weight modeller arasında lider
GPQA‑Diamond %86,0 Lisansüstü düzey sorular
Terminal‑Bench 2.0 %56,2–61,1 Mühendislik görevleri
Humanity's Last Exam (araçlarla) %50,4 Karmaşık disiplinlerarası sorular
BrowseComp %62,0 Web gezinme

GLM‑5, GLM‑4.7'ye kıyasla ortalamada ≈%20 iyileşme sergilemekte ve çeşitli ajan ile kodlama kıyaslama testlerinde Claude Opus 4.5 düzeyindeki kapalı modellerle karşılaştırılabilir konumlarda yer almaktadır.[4]

Güvenlik (SafetyBench)

SafetyBench'te (Çince alt örnek) GLM‑4 (0520), Claude 3 Opus (%87,5) ile karşılaştırılabilir ve GPT‑4'ün (≈%88–89,7) biraz altında %87,2 bütünleşik puana ulaşmaktadır. GPT‑4'e kıyasla en belirgin fark "Physical Health" (fiziksel güvenlik) boyutunda gözlemlenmektedir.[2]

Kullanım ve Ekosistem

Diyalog ve Asistan Senaryoları

ChatGLM serisi ve sonraki modeller, çok dilli iletişim, çok turlu diyalog ve talimat modunu destekleyen ticari Zhipu Qingyan servisi (chatglm.cn / chat.z.ai) dahil olmak üzere diyalog asistanları olarak kullanılmaktadır.[2]

Ajan Sistemleri ve Araçlar

GLM‑4 All Tools ve sonraki modeller, kullanıcı özel ajanları oluşturmayı, yerleşik Python yorumlayıcısı, web tarayıcısı, VLM/T2I modelleri (CogView3) bağlamayı ve harici API'lar kullanmayı sağlayan GLMs ajan platformuyla entegre olmaktadır. Bileşik görevler desteklenmektedir: web araması, Python aracılığıyla veri analizi, birleşik araç zincirleri. GLM‑5, uzun ufuklu planlama gerektiren yazılım mühendisliği görevlerine (agentic engineering) odaklanmakta ve MCP‑Atlas ile BrowseComp kıyaslama testlerinde değerlendirilmektedir.[2][4]

Kod Üretimi ve Yazılım Geliştirme

CodeGeeX ailesi (CodeGeeX‑13B, CodeGeeX2‑6B) ve GLM'nin kod modları; birden fazla dilde kod üretimi, tamamlama ve yeniden düzenleme, HumanEval ve HumanEval‑X görevleri için kullanılmaktadır. HumanEval‑X'te CodeGeeX2‑6B, CodeGeeX‑13B'ye kıyasla Pass@1 değerini iyileştirmektedir (yazarlara göre: Python'da +%57, C++'da +%71). CodeGeeX ürünü, geliştiriciler için IDE eklentilerine entegre edilmiştir.[2]

Uzun Bağlam ve Belge Merkezli Senaryolar

GLM‑4‑9B‑Chat‑1M ve üst modeller, büyük belgelerin ve koleksiyonların (1M tokena kadar) analizi, özetleme, uzun belgelerde arama ve uzun kodlarla çalışma için kullanılmaktadır.[2]

Dağıtım Altyapısı

Modeller, Z.ai / bigmodel.cn API platformu aracılığıyla erişilebilirdir (tool calling, ajan çerçeveleri). Açık sürümler, vLLM ve SGLang aracılığıyla yerel dağıtımı desteklemektedir. Huawei Ascend desteği, NVIDIA donanımı olmadan dağıtıma olanak tanımaktadır. Serinin açık modelleri Hugging Face'te 10 milyonun üzerinde indirilmiştir (2023–2024).[2][4][13]

Sınırlılıklar ve Açık Sorunlar

  • Dil dengesizliği: GLM serisi ağırlıklı olarak Çince ve İngilizce üzerinde ön eğitim görmüştür; diğer dillerdeki kalite önemli ölçüde düşük olup bu durum arXiv:2406.12793 teknik raporunda açıkça belirtilmektedir.[2]
  • Kıyaslama yeniden üretilebilirliği: Karşılaştırmalı sonuçların büyük bölümü, geliştiricilerin kendi teknik raporlarında yer almaktadır. Tüm sürümler için standartlaştırılmış platformlarda (LMSYS Chatbot Arena, Open LLM Leaderboard) bağımsız dış doğrulama sistematik biçimde yapılmamıştır.
  • Ölçeklendirmede kayıp sıçramaları: GLM‑130B eğitimi, manuel müdahale gerektiren çok sayıda kayıp fonksiyonu sıçramasıyla karşılaşmıştır; yazarlar bunu ölçeklendirmede çözüme kavuşturulmamış bir mühendislik sorunu olarak belgelemektedir.[8]
  • Donanım bağımlılığı: GLM‑5'ten itibaren eğitim Huawei Ascend / MindSpore'a taşınmıştır; farklı donanım platformlarında bağımsız yeniden üretim güçtür.[4]
  • Hizalama ve güvenlik: RLHF uygulamasına karşın yanıt reddi, çok turlu diyalogda tutarlılık ve güvenlik mekanizmalarının atlatılması sorunları güncelliğini korumaktadır; arXiv:2406.12793 yazarları, RLHF'nin yardımcı olmakla birlikte sorunları tam olarak çözmediğini belirtmektedir.[2]
  • Halüsinasyonlar: Diğer LLM'lerde olduğu gibi olgusal hata sorunu belgelenmiştir; nicel değerlendirmeler göreve ve metodolojiye göre değişmektedir.
  • Matematiksel akıl yürütme: GLM‑4, özelleşmiş yöntemler (ChatGLM‑Math) kullanmasına karşın MATH ve bazı karmaşık aritmetik görevlerde GPT‑4 Turbo'nun gerisinde kalmaktadır.[2]
  • Ajan görevleri: AgentBench'te düşük düzey işletim sistemi etkileşimi ve karmaşık mantıksal bulmacalarla ilgili görevlerde fark devam etmektedir; uzun ufuklu (long-horizon) kalite, zincirleme görevlerde hata birikimi nedeniyle hâlâ çözüme kavuşturulmamış bir sorun olmaya devam etmektedir.[2][4]
  • Kod ve pratik görevler: NaturalCodeBench'te GLM‑4 (genel %47,1) GPT‑4 Turbo'nun (%53,8) gerisinde kalmakla birlikte Claude 3 Opus (%48,3) ile karşılaştırılabilir düzeydedir.[2]

Etik ve Düzenleyici Boyutlar

GLM serisi, üretken modellerin kaydı ve güvenlik değerlendirmesinden geçirilmesine ilişkin Çin düzenleyicisi (Çin Ulusal Siber Uzay İdaresi, CAC) gereklilikleri doğrultusunda geliştirilmektedir. Eğitim sonrası süreç, toksisite ve zararlı içeriği azaltmak amacıyla SFT ve RLHF içermektedir.[2]

GLM‑4 teknik raporunda çok aşamalı risk yönetimi süreci açıklanmaktadır:[2]

  • Ön eğitim korpusunun potansiyel olarak zararlı içerikli metinlerden önceden temizlenmesi.
  • Güvenlik kriterleri temelinde hizalama verilerinin filtrelenmesi.
  • Red-team testi: ek ince ayar için karmaşık zararlı sorgular oluşturulması.
  • Güvenliğin nicel değerlendirmesi (7 boyut) için SafetyBench kullanımı.

Erken modeller (GLM‑130B), iki dilli eğitim sayesinde CrowS‑Pairs'te GPT‑3 ve OPT'a kıyasla daha düşük önyargı ve RealToxicPrompts'ta azalmış toksisite sergilemektedir.[8][2]

GLM‑5'in MIT lisansı altında yayımlanması, açık ağırlıkların ticari kullanımına yönelik biçimsel kısıtlamaların bulunmadığı anlamına gelmekte; bu da açık LLM'lere özgü denetimsiz kullanım risklerini beraberinde getirmektedir.[4] Ön eğitim korpuslarındaki Çince dil ve kültürel bağlama özgü önyargı (bias) sorunları, makale yazımı sırasında yayımlanmış çalışmalarda sistematik biçimde incelenmemiştir.

Beklentiler ve Araştırma Yönleri

Yayımlanan teknik raporlar ve Z.ai'nin eşlik eden materyallerine dayanarak aşağıdaki açıklanan yönler öne çıkmaktadır:[3][4]

  • Token başına aktif parametre maliyetini düşürürken MoE mimarilerinin ölçeklendirilmesi.
  • Uzun ufuklu görevler için asenkron ajan RL algoritmalarının geliştirilmesi.
  • 200K tokeni aşan bağlamlar için seyrek dikkat mekanizmalarının (DSA) iyileştirilmesi.
  • Çok modlu akıl yürütme: GLM‑4.1V‑Thinking'in video ve belge anlama yönünde geliştirilmesi.
  • Ajan görevlerinin yürütülmesinde harici API'lara bağımlılığın azaltılması; bu amaçla gerçek etkileşimler üzerinde uçtan uca ajan eğitimi.
  • Çin'e özgü donanım (Huawei Ascend, Cambricon) için optimizasyon ve eğitimin karbon ayak izinin azaltılması.
  • Robotik ve bilimsel hesaplama platformlarıyla entegrasyon.

Ayrıca bakınız

  • Transformer Mimarisi
  • BERT
  • GPT
  • T5
  • Decoder-only mimariler
  • Reinforcement Learning from Human Feedback
  • DeepSeek

Kaynakça

Notlar

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
  5. Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
  6. Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
  7. 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
  9. THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
  10. 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
  11. Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
  12. Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
  13. Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)