GLM (Zhipu AI) (BN)
GLM (General Language Model) — বৃহৎ ভাষা মডেলের (Large Language Model, LLM) একটি পরিবার, যা Zhipu AI কোম্পানি (২০২৫ সাল থেকে — Z.ai) কর্তৃক বেইজিংয়ের সিংহুয়া বিশ্ববিদ্যালয়ের কম্পিউটার বিজ্ঞান অনুষদের Knowledge Engineering Group (KEG) ল্যাবরেটরির সাথে যৌথভাবে তৈরি করা হয়েছে। এই সিরিজে ৬ থেকে ৭৪৪ বিলিয়ন প্যারামিটারের মডেল অন্তর্ভুক্ত রয়েছে, যা প্রধানত চীনা ও ইংরেজি ভাষার জন্য প্রস্তুত। স্থাপত্যগত ভিত্তির একটি বিশেষ বৈশিষ্ট্য হলো autoregressive blank infilling-ভিত্তিক প্রি-ট্রেনিং অবজেক্টিভ ফাংশন, যা এনকোডার ও ডিকোডার ট্রান্সফর্মারের বৈশিষ্ট্যগুলোকে একটি ঐক্যবদ্ধ স্কিমে একত্রিত করে।[1][2][3]
এই সিরিজে অন্তর্ভুক্ত রয়েছে মূল প্রি-ট্রেইনড মডেল, ডায়ালগ ভেরিয়েন্ট (ChatGLM), মাল্টিমোডাল সম্প্রসারণ (GLM‑4V, CogVLM), বিশেষায়িত টুল (কোড জেনারেশনের জন্য CodeGeeX, ওয়েব সার্চের জন্য WebGLM) এবং এজেন্টিক সিস্টেম (GLM‑4 All Tools, AutoGLM)। পরিবারটির বিবর্তন GLM‑10B (২০২১) ও GLM‑130B (২০২২) থেকে GLM‑4 (২০২৪), GLM‑4.5 (২০২৫) এবং GLM‑5 (২০২৬) পর্যন্ত প্রসারিত, যেখানে ঘন (dense) আর্কিটেকচার থেকে Mixture‑of‑Experts (MoE)-তে রূপান্তর ঘটেছে এবং এজেন্টিক দৃশ্যকল্পের উপর জোর দেওয়া হয়েছে।[2][4]
ইতিহাস ও পটভূমি
প্রাতিষ্ঠানিক প্রেক্ষাপট
Zhipu AI প্রতিষ্ঠিত হয়েছিল ২০১৯ সালে সিংহুয়া বিশ্ববিদ্যালয়ের অধ্যাপক Tang Jie ও Li Juanzi-এর দ্বারা, জ্ঞান গ্রাফে বিশেষজ্ঞ KEG ল্যাবরেটরির ভিত্তিতে। ২০২০ সালে কোম্পানিটি বৃহৎ ভাষা মডেলে প্রচেষ্টা কেন্দ্রীভূত করে। ২০২৩ সালে Alibaba Group, Tencent, Ant Group, Meituan ও Xiaomi-এর অংশগ্রহণে ২.৫ বিলিয়ন ইউয়ান বিনিয়োগ (≈৩৫০ মিলিয়ন মার্কিন ডলার) আকৃষ্ট করা হয়। ২০২৫ সালের জুলাই মাসে কোম্পানিটি তার পাবলিক ব্র্যান্ড Z.ai-তে পরিবর্তন করে, এবং ২০২৬ সালের জানুয়ারিতে হংকং স্টক এক্সচেঞ্জে IPO পরিচালনা করে।[5][6]
মূল গবেষণাপত্র: GLM (২০২১–২০২২)
মূল প্রিপ্রিন্ট «GLM: General Language Model Pretraining with Autoregressive Blank Infilling» ২০২১ সালের মার্চ মাসে arXiv-এ প্রকাশিত হয় (arXiv:2103.10360) এবং ACL 2022 সম্মেলনে গৃহীত হয়। লেখকগণ: Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang। এই গবেষণাটি বিদ্যমান আর্কিটেকচারাল প্যারাডাইমগুলোর সীমাবদ্ধতা দ্বারা অনুপ্রাণিত: এনকোডার মডেলগুলো (BERT) প্রাকৃতিক ভাষা বোঝার (Natural Language Understanding, NLU) জন্য সর্বোত্তম, ডিকোডার মডেলগুলো (GPT) জেনারেশনের জন্য, এবং এনকোডার-ডিকোডার মডেলগুলো (T5) বেশি প্যারামিটার প্রয়োজন করে। GLM একটি ঐক্যবদ্ধ পদ্ধতি প্রস্তাব করেছিল যা উভয় শ্রেণীর কাজ সমাধান করতে পারে।[1][7]
প্রধান প্রকাশনার কালপঞ্জি
| বছর | মডেল | মূল বৈশিষ্ট্যসমূহ |
|---|---|---|
| ২০২১ | GLM (মূল), GLM‑10B | Autoregressive blank infilling, 2D পজিশনাল এনকোডিং; প্যারামিটার সংখ্যা ৫১৫M (মূল) এবং 10B পর্যন্ত |
| ২০২২ | GLM‑130B | ১৩০B প্যারামিটার, দ্বিভাষিক (চীনা / ইংরেজি), উন্মুক্ত ওজন, ফাইন-টিউনিং ছাড়া INT4 কোয়ান্টাইজেশন; ICLR 2023-এ গৃহীত |
| ২০২৩, মার্চ | ChatGLM‑6B (v1) | ৬.২B প্যারামিটার, ≈১T টোকেন প্রি-ট্রেনিং, SFT + RLHF অ্যালাইনমেন্ট, INT4 কোয়ান্টাইজেশন (≈৬ জিবি মেমরি) |
| ২০২৩, জুন | ChatGLM2‑6B | ১.৪T টোকেন, FlashAttention, Multi‑Query Attention (MQA), ৩২K টোকেন পর্যন্ত কনটেক্সট |
| ২০২৩, অক্টোবর | ChatGLM3‑6B | উন্নত নির্দেশনা অনুসরণ, টুল কলিং (tool calling) সমর্থন, Code Interpreter |
| ২০২৪ | GLM‑4, GLM‑4‑Air, GLM‑4‑9B | ≈১০T টোকেন প্রি-ট্রেনিং, RoPE + GQA, ১২৮K / ১M টোকেন পর্যন্ত কনটেক্সট; GLM‑4 All Tools |
| ২০২৪ | GLM‑4V‑9B | ভিজ্যুয়াল এনকোডার সহ মাল্টিমোডাল সংস্করণ |
| ২০২৫ | GLM‑4.5, GLM‑4.6, GLM‑4.7 | MoE আর্কিটেকচার (GLM‑4.5), ক্রমাগত রিজনিং ও কোডিং উন্নতি |
| ২০২৫ | GLM‑4.1V‑Thinking | উন্নত বহু-ধাপ রিজনিং সহ ভিজ্যুয়াল-ভাষা মডেল (arXiv:2507.01006) |
| ২০২৬, ফেব্রুয়ারি | GLM‑5 | ৭৪৪B প্যারামিটার (MoE), ≈৪০–৪৪B সক্রিয়, ২০০K-টোকেন কনটেক্সট, এজেন্টিক কাজ; Huawei Ascend-এ প্রশিক্ষণ |
GLM পরিবার Zhipu AI-এর সহগামী মডেলগুলোর সাথে সম্মিলিতভাবে বিকশিত হয়: কোড মডেল CodeGeeX, ভিজ্যুয়াল-ভাষা মডেল CogVLM / CogAgent, জেনারেটিভ CogView, এবং বিশেষায়িত WebGLM ও AgentLM সিস্টেম।[2]
তাত্ত্বিক ও আর্কিটেকচারাল ভিত্তি
প্রি-ট্রেনিং অবজেক্টিভ ফাংশন
GLM-এর মূল আর্কিটেকচার Transformer-এর উপর ভিত্তি করে গড়ে উঠেছে। মূল বৈশিষ্ট্য হলো autoregressive blank infilling — অটোরিগ্রেসিভ মডেলিংয়ের একটি রূপান্তর, যেখানে মডেল প্রসঙ্গ অনুযায়ী পাঠ্যের মধ্যে ফাঁকা অংশ (span) পুনরুদ্ধার করতে শেখে।[1][7]
ধরা যাক — ইনপুট সিকোয়েন্স। এলোমেলোভাবে নির্বাচিত ধারাবাহিক খণ্ড (span) একটি [MASK] টোকেন দ্বারা প্রতিস্থাপিত হয়, যা বিকৃত পাঠ্য তৈরি করে। মডেল প্রতিটি খণ্ড এলোমেলো পারমুটেশন ক্রমে অটোরিগ্রেসিভলি পুনরুদ্ধার করে:
যেখানে — মাস্কড খণ্ড সহ বিকৃত সিকোয়েন্স, — বর্তমান খণ্ড -এর ইতিমধ্যে পুনরুদ্ধারকৃত টোকেন, — সম্পূর্ণরূপে পুনরুদ্ধারকৃত পূর্ববর্তী খণ্ড। খণ্ড পুনরুদ্ধারের ক্রম সেট থেকে এলোমেলো পারমুটেশন দ্বারা নির্ধারিত হয়, যা মডেলকে খণ্ডগুলোর মধ্যে নির্ভরতা প্রক্রিয়া করতে সক্ষম করে।[1]
কাজটি নিয়ন্ত্রণের জন্য: ছোট ফাঁক (≈১৫% টোকেন) দিয়ে মডেল NLU-র জন্য অপ্টিমাইজ হয়, দীর্ঘ খণ্ডের ক্ষেত্রে (৫০–১০০% টোকেন পর্যন্ত) — জেনারেটিভ কাজের জন্য। এটি multi-task learning-এর মাধ্যমে একটি মডেলকে উভয় মোড কভার করতে দেয়।[1][7]
2D পজিশনাল এনকোডিং
GLM মূল বিকৃত সিকোয়েন্সে এবং পুনরুদ্ধারযোগ্য খণ্ডের মধ্যে অবস্থান পৃথক করতে দ্বিমাত্রিক পজিশনাল এনকোডিং প্রবর্তন করে:[1]
- প্রথম মাত্রা : বিকৃত সিকোয়েন্সে টোকেন (বা মাস্ক)-এর পরম অবস্থান।
- দ্বিতীয় মাত্রা : অটোরিগ্রেসিভ জেনারেশনের সময় নিজস্ব খণ্ডের মধ্যে টোকেনের অবস্থান (মূল টোকেনের জন্য ০)।
এই স্কিমটি এনকোডারের অনুরূপ অতিরিক্ত আর্কিটেকচারাল উপাদান ছাড়াই প্রসঙ্গ ও জেনারেটেড পাঠ্যের মধ্যে সঠিকভাবে পার্থক্য করতে দেয়।
অ্যাটেনশন মাস্ক
GLM-এ দ্বিখণ্ডিত অ্যাটেনশন মাস্ক ব্যবহার করা হয়: অমাস্কড টোকেনের জন্য দ্বিমুখী (bidirectional) অ্যাটেনশন (Part A — প্রসঙ্গ) এবং খণ্ডের মধ্যে টোকেনের জন্য কজাল (causal) অ্যাটেনশন (Part B — পুনরুদ্ধারযোগ্য span)। এটি পুনরুদ্ধারযোগ্য অংশের অটোরিগ্রেসিভ জেনারেশনের সময় মূল পাঠ্যের পূর্ণ-প্রাসঙ্গিক বোঝাপড়া নিশ্চিত করে। BERT-এর বিপরীতে (স্বাধীন মাস্ক প্রেডিকশন) GLM span-গুলোর মধ্যে নির্ভরতা বিবেচনা করে; GPT-এর বিপরীতে — Part A-এর দ্বিমুখী প্রসঙ্গ ব্যবহার করে; T5-এর বিপরীতে — পৃথক এনকোডার প্রয়োজন হয় না।[1][7]
আর্কিটেকচারাল উপাদানগুলোর বিবর্তন
Transformer ব্লকের প্যারামিটার স্তরে GLM‑4 থেকে শুরু হওয়া মডেলগুলোতে স্তর -এ লুকানো অবস্থা নিম্নরূপ আপডেট হয়:
যেখানে GQA — Grouped‑Query Attention (পূর্ণ Multi‑Head Attention-এর পরিবর্তে), এবং FFN SwiGLU-এর মাধ্যমে বাস্তবায়িত।[2]
GLM‑130B থেকে শুরু করে সিরিজে নিম্নলিখিত আর্কিটেকচারাল উপাদান ব্যবহার করা হয়:
- GLM‑130B: গভীর নেটওয়ার্কের প্রশিক্ষণ স্থিতিশীলতার জন্য DeepNorm; 2D সম্প্রসারণ সহ Rotary Positional Encoding (RoPE); GeLU অ্যাক্টিভেশন সহ Gated Linear Units (GLU) (GeGLU)।[8]
- GLM‑4: RMSNorm ও SwiGLU-তে রূপান্তর; KV ক্যাশ হ্রাসের জন্য Multi‑Head Attention (MHA)-এর পরিবর্তে Group Query Attention (GQA); attention-এ Q/K/V ছাড়া সকল bias পদ অপসারণ; GQA-তে প্যারামিটার সংখ্যা বজায় রাখতে FFN আকার -এ বৃদ্ধি।[2]
- GLM‑4.5: loss-free balance routing ও sigmoid gates সহ Mixture‑of‑Experts (MoE); হাইব্রিড ইনফারেন্স মোড (thinking / non‑thinking)।[3]
- GLM‑5: ২০০K টোকেন পর্যন্ত দীর্ঘ কনটেক্সটের দক্ষ প্রক্রিয়াকরণের জন্য DeepSeek Sparse Attention (DSA); ইনফারেন্সে স্পেকুলেটিভ ডিকোডিংয়ের জন্য Multi‑Token Prediction (MTP); MindSpore ব্যবহার করে সম্পূর্ণরূপে Huawei Ascend প্রসেসরে প্রশিক্ষণ।[4]
স্কেলিং ও স্কেলিং আইন
ChatGLM সিরিজ বিকাশের সময় প্রি-ট্রেনিং লস এবং কাজের মানের মধ্যে অভিজ্ঞতামূলক সম্পর্ক অন্বেষণ করা হয়, যার মধ্যে «emergent abilities» ঘটনাও অন্তর্ভুক্ত। দেখা গেছে যে নির্দিষ্ট প্রি-ট্রেনিং লস স্তরে বিভিন্ন আকারের (এবং টোকেন সংখ্যার) মডেলগুলো তুলনীয় কর্মক্ষমতা প্রদর্শন করে, এবং কিছু কাজে (MMLU, GSM8K) মান শুধুমাত্র একটি নির্দিষ্ট প্রি-ট্রেনিং লস থ্রেশহোল্ড অতিক্রমের পরেই র্যান্ডম স্তর ছাড়িয়ে যায়।[2]
GLM সিরিজের আর্কিটেকচার ও মডেলসমূহ
GLM‑10B ও GLM‑130B
GLM‑10B (২০২১) — ১০ বিলিয়ন প্যারামিটারের একটি মডেল, যা blank infilling সহ GLM আর্কিটেকচারের প্রযোজ্যতা প্রদর্শন করে এবং পরবর্তী স্কেলিংয়ের ভিত্তি হিসেবে কাজ করে।[1]
GLM‑130B (২০২২) ২০২২ সালের অক্টোবরে উপস্থাপিত হয় এবং ICLR 2023-এ গৃহীত হয় (arXiv:2210.02414):[8]
- প্যারামিটার সংখ্যা: ≈১৩০ বিলিয়ন (ঘন দ্বিভাষিক মডেল)।
- প্রি-ট্রেনিং আয়তন: ৪০০ বিলিয়নের বেশি টোকেন (≈২০০ বিলিয়ন চীনা, ≈২০০ বিলিয়ন ইংরেজি)।
- আর্কিটেকচার: ৭০ স্তর, hidden size ১২,২৮৮, ৯৬টি অ্যাটেনশন হেড; DeepNorm, RoPE, GeGLU; অতিরিক্ত বহু-কাজের প্রশিক্ষণ (Multi‑Task Instruction Pretraining, MIP) — ৭৪টি NLU/NLG ডেটাসেটে ≈৫% টোকেন।
- কোয়ান্টাইজেশন: কোয়ান্টাইজেশন-পরবর্তী ফাইন-টিউনিং ছাড়া INT4 (post-training quantization) — ১০০B+ মডেলের মধ্যে এই ধরনের প্রথম নথিভুক্ত ফলাফল; ৪×RTX 3090 (২৪ জিবি) বা ৮×RTX 2080 Ti (১১ জিবি)-তে ইনফারেন্স সম্ভব।
- প্রশিক্ষণের স্থিতিশীলতা: লেখকরা লস ফাংশনে অসংখ্য স্পাইক নথিভুক্ত করেছেন এবং প্রয়োগকৃত স্থিতিশীলকরণ কৌশলগুলো (gradient clipping, Embedding Gradient Shrink) বর্ণনা করেছেন।
প্রকাশের সময় GLM‑130B বিস্তৃত ইংরেজি বেঞ্চমার্ক সেটে (মোট ১১২টি কাজ) GPT‑3 175B (davinci)-কে এবং চীনা ভাষার কাজে ERNIE TITAN 3.0 260B-কে ছাড়িয়ে গিয়েছিল; তবে OPT‑175B ও BLOOM‑176B-এর উপর শ্রেষ্ঠত্ব পুনরুৎপাদিত হয়নি — লেখকরা স্পষ্টভাবে এই সীমাবদ্ধতা উল্লেখ করেছেন। HELM মূল্যায়নে (নভেম্বর ২০২২) GLM‑130B কিছু মেট্রিক্সে GPT‑3-এর সাথে তুলনীয়।[8][2]
ChatGLM‑6B/2/3 পরিবার
ChatGLM‑6B (মার্চ ২০২৩) — ৬.২ বিলিয়ন প্যারামিটারের একটি ডায়ালগ মডেল, যা KEG ও Zhipu AI-এর যৌথ উন্নয়নে তৈরি এবং উন্মুক্ত প্রকল্প হিসেবে প্রকাশিত:[2][9]
- ≈১ ট্রিলিয়ন টোকেনে (চীনা + ইংরেজি) প্রি-ট্রেনিং, ২K কনটেক্সট।
- ডায়ালগমুখী; প্রাথমিক অ্যালাইনমেন্ট মূলত SFT ও RLHF দ্বারা সম্পন্ন।
- ≈৬ জিবি মেমরি ব্যবহারে INT4 কোয়ান্টাইজেশন, যা ভোক্তা হার্ডওয়্যারে স্থানীয় চালু করার সুবিধা দিয়েছিল।
ChatGLM2‑6B (জুন ২০২৩):[2]
- প্রি-ট্রেনিংয়ের আয়তন ১.৪ ট্রিলিয়ন টোকেনে বৃদ্ধি করা হয়েছে।
- FlashAttention ও Multi‑Query Attention (MQA) প্রবর্তিত; কনটেক্সট ৩২K টোকেনে প্রসারিত।
- বেঞ্চমার্কে উল্লেখযোগ্য অগ্রগতি: MMLU +২৩ পি.পি., GSM8K +৫৭১%, BBH +৬০% ChatGLM‑6B-এর তুলনায়।
ChatGLM3‑6B (অক্টোবর ২০২৩):[2]
- শব্দার্থ, গণিত, রিজনিং, কোড ও জ্ঞানের ক্ষেত্রে ৪২টি বেঞ্চমার্কে অতিরিক্ত অগ্রগতি।
- নেটিভ function call, অন্তর্নির্মিত Code Interpreter এবং AgentTuning / AgentLM-এর মাধ্যমে এজেন্টিক কাজের সমর্থন।
GLM‑4, GLM‑4‑Air, GLM‑4‑9B ও GLM‑4 All Tools
টেকনিক্যাল রিপোর্ট (arXiv:2406.12793) GLM‑4-কে মডেলের একটি পরিবার হিসেবে বর্ণনা করে যা ≈১০ ট্রিলিয়ন টোকেনে (প্রধানত চীনা ও ইংরেজি, এবং অতিরিক্ত ২৪টি ভাষা) প্রি-ট্রেইন করা এবং চীনা ও ইংরেজির জন্য অ্যালাইন করা হয়েছে।[2]
মূল ভেরিয়েন্টসমূহ:
- GLM‑4 (ফ্ল্যাগশিপ মডেল, ০১১৬ ও ০৫২০ সংস্করণ): ঘন ট্রান্সফর্মার, hidden size ৬১৪৪, ৬১ স্তর, ৪৮টি অ্যাটেনশন হেড, ১২৮K কনটেক্সট।
- GLM‑4‑Air — কম বিলম্বে GLM‑4‑0116-এর কাছাকাছি মানের আরও কম্প্যাক্ট ও দ্রুত মডেল।
- GLM‑4‑9B — ৯ বিলিয়ন প্যারামিটারের মডেল (৮K কনটেক্সট, ১২৮K ও এক্সপেরিমেন্টাল ১M ভেরিয়েন্ট) একই পোস্ট-ট্রেনিং পাইপলাইন সহ।
- GLM‑4 All Tools — টুল ব্যবহারে অতিরিক্তভাবে অ্যালাইনড সংস্করণ: ওয়েব ব্রাউজার, Python ইন্টারপ্রেটার, ছবি জেনারেশন (CogView3) এবং কাস্টম ফাংশন।
GLM‑4-এর আর্কিটেকচারাল বৈশিষ্ট্য:[2]
- attention-এ Q/K/V ছাড়া কোনো bias পদ নেই।
- RMSNorm ও SwiGLU।
- 2D‑RoPE।
- বর্ধিত FFN সহ Group Query Attention (GQA)।
- চীনা ও মাল্টিলিঙ্গুয়াল কর্পাসের জন্য আলাদাভাবে প্রশিক্ষিত BPE শব্দকোষ cl100k_base-এর সাথে একীভূত করে প্রাপ্ত ১৫০K টোকেনের বাইট BPE টোকেনাইজার।
GLM‑4.5 (ARC foundation models)
GLM‑4.5 হলো এজেন্টিক, রিজনিং ও কোডিং কাজে (Agentic, Reasoning, Coding — ARC) মনোযোগ দিয়ে একটি উন্মুক্ত Mixture‑of‑Experts (MoE) মডেল:[3]
- মোট ৩৫৫ বিলিয়ন প্যারামিটার, ৩২ বিলিয়ন সক্রিয় (sparse অ্যাক্টিভেশন সহ MoE আর্কিটেকচার): ৮৯ স্তর, ১৬০ এক্সপার্ট, প্রতি টোকেনে ৮টি সক্রিয়; ৯৬টি অ্যাটেনশন হেড, hidden size ৫১২০।
- GLM‑4.5‑Air: মোট ১০৬ বিলিয়ন / ১২ বিলিয়ন সক্রিয় প্যারামিটার — কার্যকর ভেরিয়েন্ট।
- এক্সপার্ট মডেলের পুনরাবৃত্তি ও RLHF সহ বহু-পর্যায়ের পোস্ট-ট্রেনিং সহ ২৩ ট্রিলিয়ন টোকেনে প্রশিক্ষণ।
- হাইব্রিড আউটপুট মোড (thinking mode ও direct response): প্রথম ক্ষেত্রে মডেল বিস্তারিত রিজনিং ট্রেস তৈরি করে; দ্বিতীয়তে — সরাসরি উত্তর দেয়। স্যুইচিং inference পাইপলাইন স্তরে নিয়ন্ত্রিত হয়।
- এক্সপার্ট রাউটিংয়ের জন্য sigmoid gates সহ loss-free balance routing।
- Muon অপ্টিমাইজার; deeper-and-narrower ডিজাইন।
GLM‑4.6 / GLM‑4.7
GLM‑4.6 / 4.7 সিরিজ (সেপ্টেম্বর–ডিসেম্বর ২০২৫) GLM‑4.5-এর ধারণাগুলো উন্নত করে, প্রোগ্রামিং (SWE‑bench Verified / Multilingual), জটিল রিজনিং (Humanity's Last Exam, AIME) এবং এজেন্টিক কাজ শক্তিশালী করে। GLM‑4.7 SWE‑bench Verified-এ ৭৩.৮% অর্জন করে এবং তিনটি রিজনিং ইন্টিগ্রেশন মোড প্রবর্তন করে — Interleaved / Preserved / Turn‑level Thinking। পৃথক কনফিগারেশন open-weight মডেল হিসেবে উন্মুক্ত করা হয়েছে।[3][10]
GLM‑5
টেকনিক্যাল রিপোর্ট ২০২৬ সালের ২১ ফেব্রুয়ারি প্রকাশিত হয় (arXiv:2602.15763)। মূল বৈশিষ্ট্যসমূহ:[4]
- আর্কিটেকচার: Mixture‑of‑Experts সহ ≈৭৪৪–৭৪৫ বিলিয়ন মোট প্যারামিটার, ২৫৬ এক্সপার্ট, প্রতি টোকেনে ৮টি সক্রিয় (≈৪০–৪৪ বিলিয়ন সক্রিয় প্যারামিটার, ≈৫.৯% ঘনত্ব); ৭৫টি MoE স্তর + ৩টি ঘন স্তর।
- প্রি-ট্রেনিং: ২৮.৫ ট্রিলিয়ন টোকেন।
- কনটেক্সট উইন্ডো: ২০০K টোকেন।
- Dynamic Sparse Attention (DSA): বিরল অ্যাটেনশন মেকানিজম যা দীর্ঘ কনটেক্সটে মান বজায় রেখে প্রশিক্ষণ ও ইনফারেন্স খরচ হ্রাস করে।
- Multi‑Token Prediction (MTP): ইনফারেন্সে স্পেকুলেটিভ ডিকোডিংয়ের জন্য কৌশল।
- প্রযুক্তিগত অবকাঠামো: প্রশিক্ষণ সম্পূর্ণরূপে MindSpore ফ্রেমওয়ার্ক ব্যবহার করে Huawei Ascend প্রসেসরে সম্পন্ন, মার্কিন উৎপাদনের GPU সরঞ্জামের উপর নির্ভরতা ছাড়াই।
- পোস্ট-ট্রেনিং: জেনারেশন ও প্রশিক্ষণ বিচ্ছিন্ন করে (decoupling inference / training) অ্যাসিঙ্ক্রোনাস Reinforcement Learning (RL) অবকাঠামো; দীর্ঘ-দিগন্ত মিথস্ক্রিয়ার জন্য এজেন্টিক RL অ্যালগরিদম প্রয়োগ; long-horizon এজেন্টিক কাজের জন্য Token‑in‑Token‑out (TITO) এবং শ্রেণিবদ্ধ কনটেক্সট ব্যবস্থাপনা।
- লাইসেন্স: MIT লাইসেন্সের অধীনে উন্মুক্ত ওজন।
সিরিজের মডেলের সারসংক্ষেপ তালিকা
| মডেল | বছর | প্যারামিটার (মোট / সক্রিয়) | প্রি-ট্রেনিং টোকেন | কনটেক্সট | মূল বৈশিষ্ট্যসমূহ |
|---|---|---|---|---|---|
| GLM‑130B | ২০২২ | ১৩০ বিলিয়ন / — | ≈৪০০ বিলিয়ন | 2K | ঘন, দ্বিভাষিক, DeepNorm, INT4 কোয়ান্টাইজেশন |
| ChatGLM‑6B | ২০২৩ | ৬.২ বিলিয়ন / — | ≈১ ট্রিলিয়ন | 2K | ডায়ালগ, SFT + RLHF, INT4 (≈৬ জিবি) |
| ChatGLM2‑6B | ২০২৩ | ৬.২ বিলিয়ন / — | ১.৪ ট্রিলিয়ন | 32K | FlashAttention, MQA |
| ChatGLM3‑6B | ২০২৩ | ৬.২ বিলিয়ন / — | — | 32K | Function call, Code Interpreter, AgentTuning |
| GLM‑4 | ২০২৪ | অপ্রকাশিত (API) | ≈১০ ট্রিলিয়ন | 128K–1M | All Tools, মাল্টিমোডালিটি (V) |
| GLM‑4‑9B | ২০২৪ | ≈৯ বিলিয়ন / — | ≈১০ ট্রিলিয়ন | 128K–1M | উন্মুক্ত সংস্করণ, GQA |
| GLM‑4.5 | ২০২৫ | ৩৫৫ বিলিয়ন / ৩২ বিলিয়ন | ২৩ ট্রিলিয়ন | 128K | MoE, হাইব্রিড থিংকিং, ARC ফোকাস |
| GLM‑4.5‑Air | ২০২৫ | ১০৬ বিলিয়ন / ১২ বিলিয়ন | ২৩ ট্রিলিয়ন | 128K | কার্যকর MoE ভেরিয়েন্ট |
| GLM‑4.7 | ২০২৫ | — | — | 128K | উন্নত coding, Interleaved Thinking |
| GLM‑5 | ২০২৬ | ৭৪৪ বিলিয়ন / ≈৪০ বিলিয়ন | ২৮.৫ ট্রিলিয়ন | 200K | DSA, MTP, এজেন্টিক ইঞ্জিনিয়ারিং, Huawei Ascend |
মাল্টিমোডাল ও বিশেষায়িত সম্প্রসারণ
- GLM‑4V‑9B — ছবি ও ডকুমেন্ট প্রক্রিয়াকরণের জন্য ভিজ্যুয়াল এনকোডার সহ মাল্টিমোডাল সংস্করণ।[2]
- GLM‑4.1V‑Thinking — উন্নত বহু-ধাপ রিজনিং সহ ভিজ্যুয়াল-ভাষা মডেল (arXiv:2507.01006)।[11]
- GLM‑4‑Voice — end-to-end বাক্ মডেল (9B বেস, ≈১ ট্রিলিয়ন বাক্য-পাঠ্য টোকেন, ১৭৫ বিট/সেকেন্ড টোকেনাইজার)।[12]
- CodeGeeX — একাধিক ভাষায় কোড জেনারেশন, সম্পূরণ ও রিফ্যাক্টরিংয়ের জন্য কোড মডেলের পরিবার (CodeGeeX‑13B, CodeGeeX2‑6B); IDE প্লাগইনে সংযুক্ত।[2]
- CogVLM / CogAgent — ছবি বোঝার ও GUI-তে স্বায়ত্তশাসিত নেভিগেশনের জন্য ভিজ্যুয়াল-ভাষা মডেল।[2]
- WebGLM — ওয়েব-ভিত্তিক অনুসন্ধান ও QA-এর জন্য মডেল; দেখানো হয়েছে যে ≈১০ বিলিয়ন প্যারামিটারের মডেলটি কিছু কাজে WebGPT‑175B-এর কাছাকাছি পৌঁছায় (KDD 2023)।[2]
প্রশিক্ষণ, ডেটা ও সহায়ক প্রযুক্তি
প্রি-ট্রেনিং ডেটা
GLM‑4 ও পূর্ববর্তী মডেলগুলোর প্রি-ট্রেনিং কর্পাসে অন্তর্ভুক্ত রয়েছে:[2]
- বহুভাষিক (প্রধানত চীনা ও ইংরেজি) ওয়েব পেজ, Wikipedia, বই, কোড ও বৈজ্ঞানিক নিবন্ধ।
- তিন-পর্যায়ের প্রক্রিয়াকরণ পাইপলাইন: ডিডুপ্লিকেশন (সঠিক ও fuzzy), ফিল্টারিং (শোরগোলপূর্ণ ও সম্ভাব্য ক্ষতিকর পাঠ্য অপসারণ) এবং টোকেনাইজেশন।
- চীনা ও মাল্টিলিঙ্গুয়াল কর্পাসের জন্য আলাদাভাবে প্রশিক্ষিত BPE শব্দকোষ cl100k_base (tiktoken)-এর সাথে একীভূত করে প্রাপ্ত ১৫০K টোকেনের একীভূত শব্দকোষ।
ডেটার গুণমান ও বৈচিত্র্যের গুরুত্ব অভিজ্ঞতামূলকভাবে নিশ্চিত করা হয়েছে, তবে প্রকাশিত অভিজ্ঞতামূলক নিয়মাবলীর বাইরে ডেটা নির্বাচনের কোনো স্পষ্ট মৌলিক মানদণ্ড লেখকরা প্রণয়ন করেননি।[2]
কনটেক্সট বিস্তার ও LongAlign
কনটেক্সট উইন্ডো ক্রমাগত ২K (ChatGLM‑6B) থেকে ৩২K (ChatGLM2/3) এবং পরে GLM‑4-এ ১২৮K ও ১M টোকেনে, তারপর GLM‑5-এ ২০০K-এ বৃদ্ধি পেয়েছে। পজিশনাল এনকোডিং বিস্তার (RoPE-ভিত্তিক ফ্রিকোয়েন্সি স্কেলিং পদ্ধতি) এবং দীর্ঘ পাঠ্যে অতিরিক্ত ফাইন-টিউনিংয়ের সমন্বয় ব্যবহার করা হয়। বিশেষ অ্যালাইনমেন্ট রেসিপি LongAlign দীর্ঘ ইনপুটে মান বজায় রাখতে দেয়: LongBench‑Chat-এ GLM‑4 (0520) ইংরেজি অংশে ৮৭.৩ প্রদর্শন করে (GPT‑4 Turbo 1106: ৮৭.২ ও Claude 3 Opus: ৮৭.৭-এর সাথে তুলনীয়) এবং চীনা অংশে ৮৪.০ (GPT‑4 Turbo ও Claude 3 Opus-এর উপরে)।[2]
পোস্ট-ট্রেনিং ও অ্যালাইনমেন্ট (SFT, RLHF)
পোস্ট-ট্রেনিংয়ে দুটি মূল পর্যায় অন্তর্ভুক্ত:[2]
- Supervised Fine‑Tuning (SFT): টেমপ্লেট বা জেনারেটেড নয়, বরং বাস্তব (human-authored) মিথস্ক্রিয়ার উপর জোর দিয়ে «প্রশ্ন–উত্তর» জোড়ায় প্রশিক্ষণ।
- Reinforcement Learning from Human Feedback (RLHF): PPO, DPO এবং নিজস্ব স্কিম, বিশেষত ChatGLM‑RLHF ও Self‑Contrast-এর মাধ্যমে অ্যানোটেটরদের পছন্দ অনুযায়ী অপ্টিমাইজেশন (নেতিবাচক উদাহরণ স্বয়ং মডেল দ্বারা তৈরি, যা পছন্দ ডেটার প্রয়োজনীয়তা হ্রাস করে)।
উত্তর মূল্যায়নের ফিচার ভেক্টরে নিরাপত্তা, তথ্যানুগতা, প্রাসঙ্গিকতা, উপযোগিতা ও পছন্দ সামঞ্জস্যের সূচক অন্তর্ভুক্ত। লেখকরা উল্লেখ করেছেন যে RLHF প্রত্যাখ্যানের হার হ্রাস করে, নিরাপত্তা ও বহু-টার্ন ডায়ালগে সামঞ্জস্য বৃদ্ধি করে।[2]
GLM ইকোসিস্টেমের বিশেষায়িত কৌশল
- LongAlign — দীর্ঘ কনটেক্সট অ্যালাইনমেন্ট রেসিপি (১২৮K পর্যন্ত)।[2]
- ChatGLM‑Math — বাহ্যিক মডেল ছাড়াই self-critique স্কিম (স্বয়ং-মূল্যায়ন উত্তর) ব্যবহার করে গণিতের সমস্যা সমাধান উন্নতি।[2]
- Self‑Contrast — RLHF স্কিম যেখানে নেতিবাচক উদাহরণ স্বয়ং মডেল দ্বারা তৈরি।[2]
- AgentTuning / AgentInstruct — এজেন্টের পরিবেশের সাথে মিথস্ক্রিয়ার ট্র্যাজেক্টরিতে এজেন্টিক দক্ষতা প্রশিক্ষণের জন্য ফ্রেমওয়ার্ক ও ডেটাসেট।[2]
- APAR (Auto‑Parallel Auto‑Regressive) — আউটপুট ত্বরান্বিত করতে স্বয়ংক্রিয়-সমান্তরাল অটোরিগ্রেসিভ জেনারেশন অ্যালগরিদম।[2]
কিছু বেঞ্চমার্কও তৈরি করা হয়েছে: AgentBench (এজেন্টিক কাজ), LongBench (দীর্ঘ কনটেক্সট), AlignBench (চীনা অ্যালাইনমেন্ট), HumanEval‑X (Python-এর বাইরে কোড), NaturalCodeBench (ব্যবহারিক প্রোগ্রামিং কাজ)।[2]
মূল ফলাফল ও বেঞ্চমার্ক
সমস্ত মেট্রিক্স মূল টেকনিক্যাল রিপোর্ট থেকে শর্ত সহ (zero-/few-shot, ডেটাসেট, মডেল সংস্করণ) উদ্ধৃত। তুলনা টেকনিক্যাল রিপোর্টের লেখকদের দ্বারা সম্পন্ন; মানকীকৃত প্ল্যাটফর্মে (LMSYS Chatbot Arena, Open LLM Leaderboard) সমস্ত সংস্করণের স্বাধীন পুনরুৎপাদন পদ্ধতিগতভাবে সংকলিত হয়নি।
মানের গতিশীলতা: ChatGLM‑6B → GLM‑4‑9B
| বেঞ্চমার্ক | ChatGLM‑6B | ChatGLM2‑6B | ChatGLM3‑6B | GLM‑4‑9B |
|---|---|---|---|---|
| GSM8K (%) | ১.৫ | ২৫.৯ | ৭২.৩ | ৮৪.০ |
| MMLU (%) | ২৫.২ | ৪৫.২ | ৬১.৪ | ৭৪.৭ |
| HumanEval (%) | ০.০ | ৯.৮ | ৫৮.৫ | ৭০.১ |
| C‑Eval (%, চীনা) | ২৩.৭ | ৫১.৭ | ৬৯.০ | ৭৭.১ |
সমস্ত মডেল একই সেটিংসে BF16-এ মূল্যায়ন করা হয়েছে।[2]
একাডেমিক বেঞ্চমার্কে GLM‑4
| বেঞ্চমার্ক | GLM‑4 (0520) | GPT‑4 (0314) | GPT‑4 Turbo (2024‑04‑09) | Claude 3 Opus |
|---|---|---|---|---|
| MMLU (%) | ৮৩.৩ | ৮৬.৪ | ৮৬.৭ | ৮৬.৮ |
| GSM8K (%) | ৯৩.৩ | ৯২.০ | ৯৫.৬ | ৯৫.০ |
| MATH (%) | ৬১.৩ | ৫২.৯ | ৭৩.৪ | ৬০.১ |
| BBH (%) | ৮৪.৭ | ৮৩.১ | ৮৮.২ | ৮৬.৮ |
| GPQA (%) | ৩৯.৯ | ৩৫.৭ | ৪৯.৩ | ৫০.৪ |
| HumanEval (%) | ৭৮.৫ | ৬৭.০ | ৮৮.২ | ৮৪.৯ |
GLM‑4 (0520) MMLU-তে GPT‑4-এর ফলাফলের ≈৯৬.৩% অর্জন করে, MATH ও GSM8K-এ GPT‑4 (0314)-কে ছাড়িয়ে যায়, কিন্তু MATH ও HumanEval-এ GPT‑4 Turbo-র কাছে হেরে যায়।[2]
AlignBench v1.1 (চীনা অ্যালাইনমেন্ট) অনুযায়ী GLM‑4 (0520) সামগ্রিক স্কোর ৮.০০ দেখায়, যেখানে GPT‑4 Turbo: ৭.৯০ এবং Claude 3 Opus: ৭.৫৩, এবং «Logic», «Language», «Professional» উপ-সূচকে উল্লেখযোগ্য সুবিধা রয়েছে।[2]
AgentBench অনুযায়ী GLM‑4 (0520) সামগ্রিক স্কোর ৩.৭৯ অর্জন করে, যা GPT‑4 Turbo (1106) ও Claude 3 Opus-এর সমতুল্য বা সামান্য বেশি। Database, House‑Holding ও Web‑Shopping কাজে উচ্চ স্কোর; Operating System ও Lateral Thinking Puzzles কাজে পিছিয়ে।[2]
Berkeley Function Call Leaderboard অনুযায়ী GLM‑4 (0520) ৮১.৭৬% অর্জন করে (GPT‑4 Turbo: ৮১.২৪%); GLM‑4‑9B‑Chat উল্লেখযোগ্যভাবে Llama‑3‑8B‑Instruct-কে ছাড়িয়ে যায় (৮১.০০% বনাম ৫৮.৮৮%)।[2]
GLM‑4.5
| বেঞ্চমার্ক | GLM‑4.5 | মন্তব্য |
|---|---|---|
| TAU‑Bench (agentic avg) | ৭০.১% | এজেন্টিক কাজ |
| AIME 2024 | ৯১.০% | গণিত প্রতিযোগিতা |
| SWE‑bench Verified | ৬৪.২% | বাস্তব রিপোজিটরিতে সমস্যা সমাধান |
| GPQA (Avg@8) | ৭৯.১% | স্নাতক-স্তরের প্রশ্ন |
| MATH‑500 | ৯৮.২% | গণিত |
| MMLU‑Pro | ৮৪.৬% | বর্ধিত MMLU |
কম সংখ্যক সক্রিয় প্যারামিটার বিবেচনা করে, GLM‑4.5 রিপোর্ট প্রকাশের সময় সমস্ত মূল্যায়িত মডেলের মধ্যে (১২টি বেঞ্চমার্কের সামগ্রিক রেটিং অনুযায়ী) ৩য় স্থানে এবং এজেন্টিক বেঞ্চমার্কে ২য় স্থানে রয়েছে।[3]
GLM‑4.7
- SWE‑bench Verified: ৭৩.৮% (GLM‑4.5-এর তুলনায় +৫.৮ পি.পি.)।
- Terminal‑Bench 2.0: ৪১.০% (+১৬.৫ পি.পি.)।
- Humanity's Last Exam (with tools): ৪২.৮%।[10]
GLM‑5
| বেঞ্চমার্ক | GLM‑5 | মন্তব্য |
|---|---|---|
| SWE‑bench Verified | ৭৭.৮% | প্রকাশের সময় open-weight মডেলগুলোর মধ্যে শীর্ষে |
| GPQA‑Diamond | ৮৬.০% | স্নাতক-স্তরের প্রশ্ন |
| Terminal‑Bench 2.0 | ৫৬.২–৬১.১% | প্রকৌশল কাজ |
| Humanity's Last Exam (with tools) | ৫০.৪% | জটিল আন্তঃবিষয়ক প্রশ্ন |
| BrowseComp | ৬২.০% | ওয়েব নেভিগেশন |
GLM‑5 GLM‑4.7-এর তুলনায় গড় সূচকে ≈২০% উন্নতি প্রদর্শন করে এবং কিছু এজেন্টিক ও কোড বেঞ্চমার্কে Claude Opus 4.5 স্তরের বন্ধ মডেলের সাথে তুলনীয় open-weight মডেলের অবস্থানে রয়েছে।[4]
নিরাপত্তা (SafetyBench)
SafetyBench (চীনা উপনমুনা) অনুযায়ী GLM‑4 (0520) সমন্বিত সূচকে ৮৭.২% অর্জন করে, যা Claude 3 Opus (৮৭.৫%)-এর সাথে তুলনীয় এবং GPT‑4 (≈৮৮–৮৯.৭%)-এর চেয়ে সামান্য কম। GPT‑4-এর তুলনায় সবচেয়ে উল্লেখযোগ্য ব্যবধান «Physical Health» (শারীরিক নিরাপত্তা) মাত্রায় পরিলক্ষিত হয়।[2]
প্রয়োগ ও ইকোসিস্টেম
ডায়ালগ ও সহায়ক দৃশ্যকল্প
ChatGLM সিরিজ ও পরবর্তী মডেলগুলো ডায়ালগ অ্যাসিস্ট্যান্ট হিসেবে ব্যবহৃত হয়, যার মধ্যে বাণিজ্যিক সেবা Zhipu Qingyan (chatglm.cn / chat.z.ai) অন্তর্ভুক্ত, বহুভাষিক যোগাযোগ, বহু-ধাপ ডায়ালগ ও নির্দেশনামূলক মোডের সমর্থন সহ।[2]
এজেন্টিক সিস্টেম ও টুল
GLM‑4 All Tools ও পরবর্তী মডেলগুলো GLMs এজেন্টিক প্ল্যাটফর্মে একীভূত, যা কাস্টম এজেন্ট তৈরি, অন্তর্নির্মিত Python ইন্টারপ্রেটার, ওয়েব ব্রাউজার, VLM/T2I মডেল (CogView3) সংযোগ এবং বাহ্যিক API ব্যবহারের সুযোগ দেয়। যৌগিক কাজ সমর্থিত: ওয়েব অনুসন্ধান, Python-এর মাধ্যমে ডেটা বিশ্লেষণ, সম্মিলিত টুল চেইন। GLM‑5 দীর্ঘ পরিকল্পনা দিগন্তের (agentic engineering) সফটওয়্যার ইঞ্জিনিয়ারিং কাজে মনোযোগ দেয় এবং MCP‑Atlas ও BrowseComp বেঞ্চমার্কে পরীক্ষিত হয়েছে।[2][4]
কোড জেনারেশন ও সফটওয়্যার ডেভেলপমেন্ট
CodeGeeX পরিবার (CodeGeeX‑13B, CodeGeeX2‑6B) এবং GLM-এর কোড মোডগুলো একাধিক ভাষায় কোড জেনারেশন, সম্পূরণ ও রিফ্যাক্টরিং, HumanEval ও HumanEval‑X সমস্যা সমাধানের জন্য ব্যবহৃত হয়। HumanEval‑X-এ CodeGeeX2‑6B, CodeGeeX‑13B-এর তুলনায় Pass@1 উন্নত করে (লেখকদের তথ্য অনুযায়ী: Python-এ +৫৭%, C++-এ +৭১%)। CodeGeeX পণ্যটি ডেভেলপারদের জন্য IDE প্লাগইনে সংযুক্ত।[2]
দীর্ঘ কনটেক্সট ও ডকুমেন্ট-কেন্দ্রিক দৃশ্যকল্প
GLM‑4‑9B‑Chat‑1M ও উচ্চতর মডেলগুলো বড় ডকুমেন্ট ও সংগ্রহ (১M টোকেন পর্যন্ত) বিশ্লেষণ, সংক্ষেপণ, দীর্ঘ ডকুমেন্টে অনুসন্ধান, দীর্ঘ কোডের সাথে কাজের জন্য প্রয়োগ করা হয়।[2]
ডিপ্লয়মেন্ট অবকাঠামো
মডেলগুলো Z.ai / bigmodel.cn API প্ল্যাটফর্মের মাধ্যমে পাওয়া যায় (tool calling, agent frameworks)। উন্মুক্ত সংস্করণগুলো vLLM, SGLang-এর মাধ্যমে স্থানীয় ডিপ্লয়মেন্ট সমর্থন করে। Huawei Ascend সমর্থন NVIDIA সরঞ্জাম ছাড়া ডিপ্লয়মেন্টের সুযোগ দেয়। সিরিজের উন্মুক্ত মডেলগুলো Hugging Face-এ ১ কোটিরও বেশিবার ডাউনলোড করা হয়েছে (২০২৩–২০২৪)।[2][4][13]
সীমাবদ্ধতা ও উন্মুক্ত সমস্যা
- ভাষাগত ভারসাম্যহীনতা: GLM সিরিজ প্রধানত চীনা ও ইংরেজি ভাষায় প্রি-ট্রেইন করা; অন্যান্য ভাষায় মান উল্লেখযোগ্যভাবে কম, যা টেকনিক্যাল রিপোর্ট arXiv:2406.12793-এ স্পষ্টভাবে উল্লেখ করা হয়েছে।[2]
- বেঞ্চমার্কের পুনরুৎপাদনযোগ্যতা: বেশিরভাগ তুলনামূলক ফলাফল স্বয়ং ডেভেলপারদের টেকনিক্যাল রিপোর্টে উপস্থাপিত। মানকীকৃত প্ল্যাটফর্মে (LMSYS Chatbot Arena, Open LLM Leaderboard) স্বাধীন বাহ্যিক বৈধতা সমস্ত সংস্করণের জন্য পদ্ধতিগতভাবে সংকলিত হয়নি।
- স্কেলিংয়ে loss spike: GLM‑130B-এর প্রশিক্ষণে লস ফাংশনে অসংখ্য স্পাইক ছিল যার জন্য ম্যানুয়াল হস্তক্ষেপ প্রয়োজন হয়েছিল; লেখকরা এটিকে স্কেলিংয়ে অসমাধানকৃত ইঞ্জিনিয়ারিং সমস্যা হিসেবে নথিভুক্ত করেছেন।[8]
- হার্ডওয়্যারের উপর নির্ভরতা: GLM‑5 থেকে শুরু করে প্রশিক্ষণ Huawei Ascend / MindSpore-এ স্থানান্তরিত; অন্যান্য হার্ডওয়্যার প্ল্যাটফর্মে স্বাধীন পুনরুৎপাদন কঠিন।[4]
- অ্যালাইনমেন্ট ও নিরাপত্তা: RLHF প্রয়োগ সত্ত্বেও, উত্তর প্রত্যাখ্যান, বহু-টার্ন ডায়ালগে সামঞ্জস্য এবং নিরাপত্তা প্রক্রিয়া বাইপাসের সমস্যা প্রাসঙ্গিক থাকে; arXiv:2406.12793-এর লেখকরা উল্লেখ করেছেন যে RLHF সাহায্য করে কিন্তু সমস্যা সম্পূর্ণ সমাধান করে না।[2]
- হ্যালুসিনেশন: অন্যান্য LLM-এর মতোই, তথ্যগত ত্রুটির সমস্যা নথিভুক্ত; পরিমাণগত মূল্যায়ন কাজ ও পদ্ধতি অনুযায়ী পরিবর্তিত হয়।
- গাণিতিক রিজনিং: GLM‑4 MATH ও জটিল পাটিগণিতের কিছু কাজে GPT‑4 Turbo-র কাছে হেরে যায়, যদিও বিশেষ পদ্ধতি (ChatGLM‑Math) ব্যবহার করে।[2]
- এজেন্টিক কাজ: AgentBench-এ নিম্ন-স্তরের OS ইন্টারঅ্যাকশন ও জটিল লজিক্যাল পাজলের সাথে সম্পর্কিত কাজে ব্যবধান রয়েছে; দীর্ঘ দিগন্তের (long-horizon) মান অসমাধানকৃত সমস্যা থেকে যায় (চেইনড কাজে ত্রুটির সঞ্চয়)।[2][4]
- কোড ও ব্যবহারিক কাজ: NaturalCodeBench-এ GLM‑4 (সামগ্রিক ৪৭.১%) GPT‑4 Turbo (৫৩.৮%)-এর চেয়ে কম, যদিও Claude 3 Opus (৪৮.৩%)-এর সাথে তুলনীয়।[2]
নৈতিক ও নিয়ন্ত্রক দিক
GLM সিরিজ চীনের নিয়ন্ত্রক (চীনের সাইবারস্পেস অ্যাডমিনিস্ট্রেশন, CAC)-এর জেনারেটিভ মডেল নিবন্ধন ও নিরাপত্তা মূল্যায়ন পাশ করার প্রয়োজনীয়তা অনুসারে বিকশিত হয়। পোস্ট-ট্রেনিংয়ে বিষাক্ততা ও ক্ষতিকর বিষয়বস্তু হ্রাস করতে SFT ও RLHF অন্তর্ভুক্ত।[2]
GLM‑4-এর টেকনিক্যাল রিপোর্টে বহু-পর্যায়ের ঝুঁকি ব্যবস্থাপনা প্রক্রিয়া বর্ণিত হয়েছে:[2]
- সম্ভাব্য বিপজ্জনক বিষয়বস্তু সম্পন্ন পাঠ্য থেকে প্রি-ট্রেনিং কর্পাসের প্রাথমিক পরিষ্কার।
- নিরাপত্তার মানদণ্ড অনুযায়ী অ্যালাইনমেন্ট ডেটা ফিল্টারিং।
- Red-team পরীক্ষা: ফাইন-টিউনিংয়ের জন্য জটিল ক্ষতিকর প্রশ্ন প্রণয়ন।
- নিরাপত্তার পরিমাণগত মূল্যায়নের জন্য SafetyBench ব্যবহার (৭টি মাত্রা)।
প্রাথমিক মডেলগুলো (GLM‑130B) দ্বিভাষিক প্রশিক্ষণের কারণে CrowS‑Pairs-এ GPT‑3 ও OPT-এর তুলনায় কম পক্ষপাতিত্ব এবং RealToxicPrompts-এ কম বিষাক্ততা প্রদর্শন করে।[8][2]
MIT লাইসেন্সের অধীনে GLM‑5-এর প্রকাশ মানে উন্মুক্ত ওজনের বাণিজ্যিক ব্যবহারে কোনো আনুষ্ঠানিক বিধিনিষেধ নেই, যা উন্মুক্ত LLM-এর জন্য সাধারণ অনিয়ন্ত্রিত প্রয়োগের ঝুঁকি বহন করে।[4] চীনা ভাষা ও সাংস্কৃতিক প্রেক্ষাপটের জন্য নির্দিষ্ট প্রি-ট্রেনিং কর্পাসে পক্ষপাতিত্বের (bias) প্রশ্নগুলো নিবন্ধ রচনার সময় পর্যন্ত প্রকাশ্য কাজে পদ্ধতিগতভাবে অন্বেষণ করা হয়নি।
সম্ভাবনা ও গবেষণার দিকনির্দেশনা
প্রকাশিত টেকনিক্যাল রিপোর্ট ও সহগামী উপকরণের ভিত্তিতে Z.ai-এর নিম্নলিখিত ঘোষিত দিকনির্দেশনা চিহ্নিত করা হয়েছে:[3][4]
- প্রতি টোকেনে সক্রিয় প্যারামিটারের খরচ হ্রাস করে MoE আর্কিটেকচারের স্কেলিং।
- দীর্ঘ-দিগন্ত কাজের জন্য অ্যাসিঙ্ক্রোনাস এজেন্টিক RL অ্যালগরিদমের বিকাশ।
- ২০০K টোকেনের বেশি কনটেক্সটের জন্য বিরল অ্যাটেনশন (DSA) প্রক্রিয়ার উন্নতি।
- মাল্টিমোডাল রিজনিং: ভিডিও ও ডকুমেন্ট বোঝার দিকে GLM‑4.1V‑Thinking-এর বিকাশ।
- বাস্তব মিথস্ক্রিয়ায় টার্মিনাল এজেন্ট প্রশিক্ষণের মাধ্যমে এজেন্টিক কাজ সম্পাদনে বাহ্যিক API-এর উপর নির্ভরতা হ্রাস।
- দেশীয় (চীনের জন্য) হার্ডওয়্যার (Huawei Ascend, Cambricon)-এর জন্য অপ্টিমাইজেশন এবং প্রশিক্ষণের কার্বন ফুটপ্রিন্ট হ্রাস।
- রোবোটিক্স ও বৈজ্ঞানিক-কম্পিউটেশনাল প্ল্যাটফর্মের সাথে একীকরণ।
আরও দেখুন
- Transformer আর্কিটেকচার
- BERT
- GPT
- T5
- Decoder-only আর্কিটেকচার
- Reinforcement Learning from Human Feedback
- DeepSeek
তথ্যসূত্র
- Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL. https://arxiv.org/abs/1810.04805
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5). JMLR. https://jmlr.org/papers/volume21/20-074/20-074.pdf
- Brown, T. et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS. https://arxiv.org/abs/2005.14165
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Du, Z., Qian, Y., Liu, X., Ding, M., Qiu, J., Yang, Z., Tang, J. (2022). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. ACL 2022. https://aclanthology.org/2022.acl-long.26/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 2.39 2.40 2.41 2.42 2.43 2.44 2.45 2.46 2.47 Team GLM. (2024). ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793. https://arxiv.org/abs/2406.12793
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 GLM-4.5 Team. (2025). GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models. arXiv:2508.06471. https://arxiv.org/abs/2508.06471
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 GLM-5 Team. (2026). GLM-5: from Vibe Coding to Agentic Engineering. arXiv:2602.15763. https://arxiv.org/abs/2602.15763
- ↑ Wikipedia. Zhipu AI. https://en.wikipedia.org/wiki/Zhipu_AI (дата обращения: 01.03.2026)
- ↑ Pandaily. Zhipu AI's Rise: From Tsinghua Lab to China's First Foundation Model Company. https://pro.pandaily.com/p/zhipu-ais-rise-from-tsinghua-lab (дата обращения: 01.03.2026)
- ↑ 7.0 7.1 7.2 7.3 Du, Z. et al. (2021). GLM: General Language Model Pretraining with Autoregressive Blank Infilling. arXiv:2103.10360. https://arxiv.org/abs/2103.10360
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Zeng, A. et al. (2022). GLM-130B: An Open Bilingual Pre-trained Model. ICLR 2023. arXiv:2210.02414. https://arxiv.org/abs/2210.02414
- ↑ THUDM. ChatGLM-6B README. https://github.com/THUDM/ChatGLM-6B (дата обращения: 01.03.2026)
- ↑ 10.0 10.1 Z.ai. GLM-4.7: Advancing the Coding Capability. Официальный блог Z.ai, 22.12.2025. https://z.ai/blog/glm-4.7 (дата обращения: 01.03.2026)
- ↑ Zhipu AI. (2025). GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning Models. arXiv:2507.01006. https://arxiv.org/abs/2507.01006
- ↑ Zeng, A. et al. (2024). GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot. arXiv:2412.02612. https://arxiv.org/abs/2412.02612
- ↑ Hugging Face. zai-org/GLM-4.5. https://huggingface.co/zai-org/GLM-4.5 (дата обращения: 01.03.2026)