Kimi (Moonshot AI) (BN)
Kimi (Moonshot AI-এর মডেল সিরিজ) — চীনা কোম্পানি Moonshot AI (বেইজিং, গণপ্রজাতন্ত্রী চীন) কর্তৃক পাঠ্য ও মাল্টিমোডাল জেনারেশন, প্রোগ্রামিং এবং এজেন্টিক সিস্টেমের (agentic systems — যে সিস্টেম স্বায়ত্তশাসিত পরিকল্পনা, যুক্তি প্রদর্শন ও বাহ্যিক টুল ব্যবহার করে কাজ সম্পাদনে সক্ষম) কাজের জন্য তৈরি বৃহৎ ভাষা মডেলের (Large Language Model, LLM) একটি সিরিজ। এই পরিবারে Mixture-of-Experts (MoE) আর্কিটেকচারের টেক্সট ও মাল্টিমোডাল মডেল রয়েছে, যার মোট প্যারামিটার প্রায় ১ ট্রিলিয়ন এবং প্রতিটি token-এ সক্রিয় প্যারামিটার প্রায় ৩২ বিলিয়ন।[1][2] এই সিরিজের একটি গুরুত্বপূর্ণ বৈশিষ্ট্য হলো এজেন্ট আচরণের (বাহ্যিক টুল কলসহ বহুধাপ পরিকল্পনা) উপর মনোযোগ এবং Kimi K2 ও Kimi K2.5 সংস্করণে ২৫৬,০০০ token পর্যন্ত দীর্ঘ প্রসঙ্গের (context) সমর্থন।[1][2]
Kimi সিরিজের মডেলগুলি Hugging Face প্ল্যাটফর্মে পরিবর্তিত MIT লাইসেন্সের অধীনে open-weight হিসেবে এবং Moonshot AI Open Platform-এর মাধ্যমে প্রোপ্রাইটারি API হিসেবে উভয়ভাবেই পাওয়া যায়।[3][4]
ইতিহাস ও পটভূমি
Moonshot AI-এর প্রতিষ্ঠা
Moonshot AI ২০২৩ সালের মার্চ মাসে বেইজিংয়ে ইয়াং ঝিলিন (Yang Zhilin, CEO), ঝৌ সিনইউ (Zhou Xinyu) এবং উ ইউসিন (Wu Yuxin) কর্তৃক প্রতিষ্ঠিত হয়েছিল — এঁরা সবাই সিংহুয়া বিশ্ববিদ্যালয়ের (Tsinghua University) স্নাতক। ইয়াং ঝিলিন আগে Google Brain ও Meta-তে কাজ করেছিলেন এবং কম্পিউটার ভিশন ও যুক্তি প্রদর্শনের গবেষণায় অংশগ্রহণ করেছিলেন। কোম্পানিটি Alibaba (ফেব্রুয়ারি ২০২৪-এ $১ বিলিয়ন রাউন্ড), Tencent এবং অন্যান্য বিনিয়োগকারীদের কাছ থেকে অর্থায়ন পেয়েছে।[5][6]
মূল প্রকাশের কালপঞ্জি
- অক্টোবর–নভেম্বর ২০২৩ — ১,২৮,০০০ token (২ লক্ষ চীনা অক্ষর পর্যন্ত) প্রসঙ্গ সমর্থন সহ Kimi চ্যাটবট চালু। প্রথম সংস্করণগুলি সীমিতভাবে প্রকাশিত কারিগরি বিবরণ সহ প্রোপ্রাইটারি মডেল ব্যবহার করেছিল।[6][7]
- মার্চ ২০২৪ — বেটা সংস্করণে ২০ লক্ষ চীনা অক্ষর পর্যন্ত প্রসঙ্গ সম্প্রসারণ।[6]
- জানুয়ারি ২০২৫ — Kimi k1.5 প্রকাশ — একটি মাল্টিমোডাল মডেল যাতে স্কেলড Reinforcement Learning (RL) ব্যবহার করা হয়েছে এবং যা গণিত, প্রোগ্রামিং ও মাল্টিমোডাল যুক্তি প্রদর্শনের কাজে OpenAI o1-এর সমতুল্য বলে দাবি করা হয়েছে। প্রসঙ্গ ১,২৮,০০০ token পর্যন্ত।[8]
- এপ্রিল ২০২৫ — Kimi-VL উপস্থাপন — একটি মুক্ত মাল্টিমোডাল MoE মডেল (vision-language model, VLM) যাতে MoonViT ভিজ্যুয়াল এনকোডার (~৪০০ মিলিয়ন প্যারামিটার) এবং ডিকোডারে ~২.৮ বিলিয়ন সক্রিয় প্যারামিটার রয়েছে। কারিগরি প্রতিবেদন arXiv-এ প্রকাশিত হয়েছে।[9]
- জুলাই ২০২৫ — Kimi K2 প্রকাশ — ১ ট্রিলিয়ন মোট প্যারামিটার এবং ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ মূল মুক্ত MoE মডেল। কারিগরি প্রতিবেদন arXiv-এ প্রকাশিত।[1] প্রকাশের সময় মডেলটি LMSYS Chatbot Arena-তে মুক্ত মডেলগুলির মধ্যে প্রথম স্থান অধিকার করেছিল (৩,০০০-এরও বেশি ভোট)।[1]
- সেপ্টেম্বর ২০২৫ — Kimi-K2-Instruct-0905 আপডেট প্রকাশ, যাতে প্রসঙ্গ ২,৫৬,০০০ token পর্যন্ত বিস্তৃত করা হয়েছে এবং এজেন্ট কোডিং উন্নত করা হয়েছে।[1]
- নভেম্বর ২০২৫ — Kimi K2 Thinking প্রকাশ — উন্নত ধাপে-ধাপে যুক্তি প্রদর্শন (chain-of-thought) এবং ২০০–৩০০ ধারাবাহিক টুল কল (tool calls) সমর্থন সহ একটি সংস্করণ।[10]
- জানুয়ারি ২০২৬ — Kimi K2.5 উপস্থাপন — নেটিভ মাল্টিমোডালিটি এবং Agent Swarm প্রক্রিয়া (সাব-এজেন্টের সমান্তরাল অর্কেস্ট্রেশন) সহ একটি মাল্টিমোডাল MoE মডেল।[2]
মডেল তৈরির পাশাপাশি ২০২৪ সালে নিজস্ব ইনফারেন্স সার্ভিস Mooncake উপস্থাপিত হয়েছিল — দীর্ঘ প্রসঙ্গ সহ LLM পরিষেবার জন্য KVCache-কেন্দ্রিক বিচ্ছিন্ন আর্কিটেকচার।[11]
তাত্ত্বিক ভিত্তি ও আর্কিটেকচার
Mixture-of-Experts আর্কিটেকচার
Kimi K2 ও K2.5 সিরিজের মডেলগুলি পৃথক স্তরে Mixture-of-Experts সহ Transformer আর্কিটেকচার বাস্তবায়ন করে। ট্রান্সফর্মারের একটি আদর্শ ব্লক হলো মাল্টি-হেড সেলফ-অ্যাটেনশন (Multi-Head Attention, MHA) এবং পজিশন-ওয়াইজ MLP (মাল্টিলেয়ার পার্সেপ্ট্রন) স্তরের আবাসিক সংযোগসহ একটি রচনা:[1][12]
যেখানে — ইনপুট token উপস্থাপনা, — ক্রমের দৈর্ঘ্য, — গুপ্ত অবস্থার আকার।
MoE স্তরে একটি MLP-এর পরিবর্তে বিশেষজ্ঞদের একটি সেট ব্যবহার করা হয়, যেখানে প্রতিটি বিশেষজ্ঞ প্যারামিটার সহ একটি পৃথক MLP। রাউটার (gating network) প্রতিটি token-এর জন্য বিশেষজ্ঞদের একটি উপসেট নির্বাচন করে। উপস্থাপনা সহ token-এর জন্য MoE স্তরের আউটপুট নিম্নরূপ:[1]
যেখানে — প্রদত্ত token-এর জন্য নির্বাচিত বিশেষজ্ঞদের সেট, — রাউটারের নরমালাইজড ওজন, । রাউটিং ফাংশন TopK অপারেশনের মাধ্যমে বিশেষজ্ঞ নির্বাচন করে:[1]
যেখানে — প্রশিক্ষণযোগ্য রাউটার ম্যাট্রিক্স। এই পদ্ধতি প্রতিটি token-এ সক্রিয় প্যারামিটারের সীমিত সংখ্যার সাথে মোট প্যারামিটার স্কেল করতে দেয়।
Kimi K2 / K2.5-এর আর্কিটেকচারাল হাইপারপ্যারামিটার
| প্যারামিটার | মান |
|---|---|
| আর্কিটেকচারের ধরন | Mixture-of-Experts সহ Transformer |
| মোট প্যারামিটারের সংখ্যা | ১.০৪ ট্রিলিয়ন |
| প্রতি token-এ সক্রিয় প্যারামিটার | ৩২ বিলিয়ন |
| স্তরের সংখ্যা | ৬১ (১টি ঘন + ৬০টি MoE) |
| গুপ্ত অবস্থার আকার | 7168 |
| অ্যাটেনশন হেডের সংখ্যা | 64 |
| বিশেষজ্ঞের সংখ্যা | ৩৮৪ (প্রতি token-এ ৮টি নির্বাচিত + ১টি সাধারণ) |
| বিশেষজ্ঞের গুপ্ত অবস্থার আকার (MoE hidden size) | 2048 |
| শব্দভান্ডারের আকার | ১,৬০,০০০ token |
| অ্যাক্টিভেশন ফাংশন | SwiGLU |
| অ্যাটেনশন প্রক্রিয়া | Multi-head Latent Attention (MLA) |
| সর্বোচ্চ প্রসঙ্গ | ২,৫৬,০০০ token (YaRN-এর মাধ্যমে সম্প্রসারণ) |
| ভিজ্যুয়াল এনকোডার (K2.5) | MoonViT-3D, ~৪০০ মিলিয়ন প্যারামিটার |
স্পার্সিটি (মোট বিশেষজ্ঞ সংখ্যার সাথে সক্রিয় বিশেষজ্ঞ সংখ্যার অনুপাত) ৪৮:১ (৩৮৪ বিশেষজ্ঞ, ৮টি সক্রিয়), যা একই স্কেলের ঘন (dense) মডেলের তুলনায় কম্পিউটেশনাল খরচে উল্লেখযোগ্য হ্রাস নিশ্চিত করে।[1]
Multi-head Latent Attention (MLA) প্রক্রিয়া
Kimi K2/K2.5 সিরিজের মডেলে Multi-head Latent Attention (MLA) প্রক্রিয়া ব্যবহার করা হয়েছে — এটি স্ট্যান্ডার্ড মাল্টি-হেড অ্যাটেনশনের একটি পরিবর্তন যা দক্ষতা ও মাপযোগ্যতা বৃদ্ধির লক্ষ্যে তৈরি। একটি স্তরের জন্য স্ট্যান্ডার্ড অ্যাটেনশন নিম্নরূপ গণনা করা হয়:[12]
যেখানে — কোয়েরি, কী ও মানের ম্যাট্রিক্স। MLA-তে লেটেন্ট উপস্থাপনা প্রবর্তন করা হয়েছে যার উপর কোয়েরি ও কী প্রজেক্ট করা হয়, যা মধ্যবর্তী অপারেশনের মাত্রা হ্রাস করে এবং KV-ক্যাশের আকার কমাতে দেয়। এই পদ্ধতি DeepSeek-V3-এ ব্যবহৃত প্রক্রিয়ার অনুরূপ।[1][13]
MuonClip অপ্টিমাইজার ও QK-clip
Kimi K2 মডেলের প্রশিক্ষণের জন্য MuonClip অপ্টিমাইজার প্রস্তাব করা হয়েছে — এটি Muon অপ্টিমাইজারের (Newton-Schulz নরমালাইজেশন সহ মোমেন্টাম অপ্টিমাইজার) একটি পরিবর্তন যাতে MoE আর্কিটেকচারের বৃহৎ ভাষা মডেলের প্রশিক্ষণ স্থিতিশীল করার জন্য QK-clip কৌশল যোগ করা হয়েছে।[1]
QK-clip ক্লিপিং অপারেশনের মাধ্যমে অ্যাটেনশন লগিট -এ সীমাবদ্ধতা প্রয়োগ করে। প্রতিটি অ্যাটেনশন হেড -এর জন্য সর্বোচ্চ লগিট নির্ধারণ করা হয়:
এবং স্কেলিং সহগ গণনা করা হয়:
যেখানে — থ্রেশহোল্ড হাইপারপ্যারামিটার, — হেডের আকার। সহগ ওজন স্কেল করতে প্রয়োগ করা হয় যদি সর্বোচ্চ লগিট থ্রেশহোল্ড অতিক্রম করে। এটি softmax-এর আগে লগিট মানের পরিসর সীমিত করে এবং বড় স্কেলে প্রশিক্ষণের সময় তীব্র ক্ষতির (loss spikes) ঝুঁকি হ্রাস করে।[1]
লেখকদের তথ্য অনুযায়ী, MuonClip সহ ১৫.৫ ট্রিলিয়ন token-এ Kimi K2-এর প্রি-ট্রেনিং সমগ্র সময়কাল জুড়ে একটিও ক্ষতির স্পাইক (zero loss spikes) ছাড়াই সম্পন্ন হয়েছে।[1]
মাল্টিমোডালিটি ও MoonViT
Kimi K2.5 ও Kimi-VL মডেলে MoonViT ভিজ্যুয়াল এনকোডার (K2.5 সংস্করণে — MoonViT-3D) ব্যবহার করা হয়েছে, যার প্রায় ৪০০ মিলিয়ন প্যারামিটার রয়েছে। এটি NaViT প্যাকিং সহ SigLIP-SO-400M-এর উপর ভিত্তি করে তৈরি (পরিবর্তনশীল রেজোলিউশনের ইনপুট ছবি সমর্থন করে) এবং ভিডিও প্রক্রিয়াকরণের জন্য 3D সম্প্রসারণ (৪টি ফ্রেমের গ্রুপিং) রয়েছে।[2][9]
ভিজ্যুয়াল এনকোডার ইনপুট ছবি ও ভিডিওকে ভিজ্যুয়াল token-এর একটি ক্রমে রূপান্তরিত করে। ধরি — ইনপুট ছবি, — ভিজ্যুয়াল এনকোডার:
তারপর রৈখিক প্রজেকশনের মাধ্যমে (দুই-স্তরীয় MLP) :
যেখানে — মডেলের ভাষা অংশের গুপ্ত স্থানের আকার। মাল্টিমোডাল মোডে পাঠ্য token-এর সাথে সংযুক্ত হয়ে ট্রান্সফর্মারে প্রেরণ করা হয়।[9][2]
দুই-পর্যায়ের পদ্ধতির (পাঠ্য মডেলের উপরে ভিজ্যুয়াল অ্যাডাপ্টার যোগ করা) বিপরীতে, K2.5 প্রি-ট্রেনিংয়ের শুরু থেকেই মিশ্রিত ভিজ্যুয়াল-পাঠ্য ডেটায় (joint text-vision pre-training) প্রশিক্ষিত হয়েছে, প্রাথমিক পর্যায়ে ভিজ্যুয়াল token-এর কম অনুপাত (~১০%) রেখে ধীরে ধীরে বৃদ্ধি করা হয়েছে। মোট পরিমাণ — প্রায় ১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token।[2]
প্রি-ট্রেনিং ও পোস্ট-ট্রেনিং
প্রি-ট্রেনিং
Kimi K2 ১৫.৫ ট্রিলিয়ন token (ওয়েব টেক্সট, কোড, গণিত, বিশ্বকোষীয় জ্ঞান) এ MuonClip অপ্টিমাইজার ব্যবহার করে প্রি-ট্রেইন করা হয়েছে। সমগ্র প্রি-ট্রেনিং সময়কালে একটিও ক্ষতির স্পাইক (loss spike) রেকর্ড করা হয়নি।[1]
Kimi K2.5 K2 চেকপয়েন্ট থেকে মডালিটিগুলির যৌথ অপ্টিমাইজেশন (joint pre-training) সহ অতিরিক্ত ~১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token-এ ক্রমাগত প্রি-ট্রেনিং (continual pre-training) এর মধ্য দিয়ে গেছে। আলাদাভাবে ১ ট্রিলিয়ন token-এ ভিজ্যুয়াল এনকোডারের standalone প্রশিক্ষণ এবং প্রসঙ্গ বিস্তারের জন্য একটি অতিরিক্ত long-context mid-training পর্যায় পরিচালিত হয়েছে।[2]
পোস্ট-ট্রেনিং
K2 সিরিজের মডেলের পোস্ট-ট্রেনিংয়ে বেশ কয়েকটি পর্যায় রয়েছে:[1][2]
Supervised Fine-Tuning (SFT, তত্ত্বাবধায়িত সূক্ষ্ম সমন্বয়):
- সিন্থেটিক এজেন্ট ট্রাজেক্টরি (agentic data synthesis) — টুল স্পেসিফিকেশন তৈরি, পরিবেশের সাথে মিথস্ক্রিয়া মডেলিং, ফলাফলের যাচাই।
- K2.5-এর জন্য অতিরিক্তভাবে zero-vision SFT প্রয়োগ করা হয় — একটি পাঠ্য SFT যা fine-tuning পর্যায়ে সরাসরি ছবি ব্যবহার ছাড়াই ভিজ্যুয়াল ক্ষমতা সক্রিয় করে।
Reinforcement Learning (RL, শক্তিবর্ধন শিক্ষা):
- গণিত, কোড ও নিরাপত্তার কাজের জন্য যাচাইযোগ্য পুরষ্কারের (Reinforcement Learning with Verifiable Rewards, RLVR) সমন্বয়।
- রুব্রিক অনুযায়ী স্ব-মূল্যায়ন (self-critique rubric rewards) — এজেন্ট পরিস্থিতির গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের জন্য LLM মূল্যায়নকারী ব্যবহার।
- K2.5-এর জন্য — যৌথ মাল্টিমোডাল RL (joint multimodal RL)।
Quantization-Aware Training (QAT):
- Kimi K2 Thinking ও K2.5 নেটিভ INT4 ওজন কোয়ান্টাইজেশন (weight-only quantization, গ্রুপ ৩২, সংকুচিত টেনসর) সমর্থন করে, যা NVIDIA Hopper আর্কিটেকচারের জন্য অপ্টিমাইজ করা হয়েছে এবং ইনফারেন্সের সময় মেমরির প্রয়োজনীয়তা হ্রাস করে।[10][2]
Agent Swarm (K2.5)
K2.5 মডেলের জন্য Agent Swarm প্রক্রিয়া তৈরি করা হয়েছে — স্ব-পরিচালিত সমান্তরাল এজেন্ট অর্কেস্ট্রেশনের একটি ফ্রেমওয়ার্ক। অর্কেস্ট্রেটর মডেল গতিশীলভাবে সাব-এজেন্ট তৈরি করে (create_subagent, assign_task অপারেশনের মাধ্যমে), উপকাজ বিতরণ করে এবং ফলাফল একত্রিত করে। প্রতিটি সাব-এজেন্ট স্বাধীনভাবে টুল কল করতে পারে এবং অন্যান্য সাব-এজেন্টের সমান্তরালে কাজ করতে পারে।[2]
Agent Swarm প্রক্রিয়ার প্রশিক্ষণ Parallel-Agent Reinforcement Learning (PARL) এর মাধ্যমে বাস্তবায়িত হয়েছে, যাতে এক্সিকিউশন ও অপ্টিমাইজেশন বিচ্ছিন্ন করা হয়েছে (decoupling execution/optimization)। লেখকদের তথ্য অনুযায়ী, Agent Swarm একক-থ্রেড এজেন্ট মোডের (single-agent) তুলনায় লেটেন্সি ৪.৫ গুণ পর্যন্ত কমিয়ে আনে।[2]
সিরিজের মূল মডেলসমূহ
| মডেল | ধরন | প্যারামিটার (মোট / সক্রিয়) | প্রসঙ্গ, token | মাল্টিমোডালিটি | প্রকাশের তারিখ |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | প্রকাশিত নয় | 128 000 | হ্যাঁ (সীমিত) | জানুয়ারি ২০২৫ |
| Kimi-VL | VLM, MoE | কম্প্যাক্ট / ~২.৮ বিলিয়ন সক্রিয় + ৪০০ মিলিয়ন ViT | দীর্ঘ প্রসঙ্গ | হ্যাঁ (ছবি) | এপ্রিল ২০২৫ |
| Kimi K2 | LLM, MoE | ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন | 256 000 | না (পাঠ্য) | জুলাই ২০২৫ |
| Kimi K2 Thinking | LLM, MoE | ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন | 256 000 | না (পাঠ্য) | নভেম্বর ২০২৫ |
| Kimi K2.5 | VLM-LLM, MoE | ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন | 256 000 | হ্যাঁ (ছবি, ভিডিও, PDF) | জানুয়ারি ২০২৬ |
Kimi K2
Kimi K2 — ১.০৪ ট্রিলিয়ন মোট প্যারামিটার এবং প্রতি token-এ ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ একটি Mixture-of-Experts LLM। MuonClip অপ্টিমাইজার দিয়ে ১৫.৫ ট্রিলিয়ন token-এ প্রি-ট্রেইন করা হয়েছে। আর্কিটেকচারে ৩৮৪টি বিশেষজ্ঞ এবং দীর্ঘ প্রসঙ্গের সাথে সামঞ্জস্যপূর্ণ MLA প্রক্রিয়া রয়েছে। মডেলটি প্রোগ্রামিং, গাণিতিক যুক্তি প্রদর্শন এবং ধারাবাহিক টুল কলসহ এজেন্ট পরিস্থিতির কাজের জন্য তৈরি।[1]
কারিগরি প্রতিবেদনে বহু-পর্যায়ের পোস্ট-ট্রেনিং পাইপলাইন বর্ণনা করা হয়েছে: টুলের সাথে মিথস্ক্রিয়া মডেলিং করে এজেন্ট ডেটার বৃহৎ পরিসরে সংশ্লেষণ; বাস্তব ও সিন্থেটিক কাজের মিশ্রিত পরিবেশে Reinforcement Learning প্রশিক্ষণ; গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের জন্য LLM মূল্যায়নকারী ব্যবহার।[1][14]
Kimi K2 Thinking
Kimi K2 Thinking ভেরিয়্যান্টটি গতিশীল টুল কলের সুবিধা এবং ২,৫৬,০০০ token পর্যন্ত প্রসঙ্গ সমর্থন সহ বহুধাপ যুক্তি প্রদর্শনের (chain-of-thought) জন্য অপ্টিমাইজ করা হয়েছে। মডেলটি একটি পৃথক "Thinking" মোড বাস্তবায়ন করে যেখানে অভ্যন্তরীণ যুক্তি প্রদর্শন ধারণকারী reasoning_content ফিল্ড স্পষ্টভাবে ফেরত দেওয়া হয়। K2 Thinking একটি এজেন্ট এপিসোডে উল্লেখযোগ্য আচরণগত অবনতি ছাড়াই ২০০–৩০০টি ধারাবাহিক টুল কল সমর্থন করে, সেই সাথে QAT ব্যবহার করে নেটিভ INT4 কোয়ান্টাইজেশনও সমর্থন করে।[10]
Kimi-VL
Kimi-VL — একটি মুক্ত মাল্টিমোডাল MoE-VLM (vision-language model), যা ভিজ্যুয়াল বোঝাপড়া, ভিজ্যুয়াল-পাঠ্য যুক্তি প্রদর্শন এবং বাস্তব দৃশ্যের কাজের জন্য তৈরি। মডেলটিকে MoonViT ভিজ্যুয়াল এনকোডার সহ একটি কম্প্যাক্ট MoE আর্কিটেকচার হিসেবে বর্ণনা করা হয়েছে। কারিগরি প্রতিবেদন ২০২৫ সালের এপ্রিল মাসে arXiv-এ প্রকাশিত হয়েছে।[9]
Kimi K2.5
Kimi K2.5 — ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ ১.০৪ ট্রিলিয়ন প্যারামিটার স্কেলের একটি মাল্টিমোডাল MoE মডেল, যা Kimi-K2-Base চেকপয়েন্টের উপর ভিত্তি করে ~১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token-এ অব্যাহত প্রি-ট্রেনিং সহ তৈরি। মডেলটি ২,৫৬,০০০ token পর্যন্ত প্রসঙ্গ সহ ছবি, ভিডিও, PDF ও পাঠ্য ইনপুট সমর্থন করে।[2]
K2.5 দুটি মূল ইনফারেন্স মোড সমর্থন করে:
- Thinking mode — স্পষ্ট
reasoning_contentএবং বহুধাপ জেনারেশন সহ; - Instant mode — যুক্তি আউটপুট ছাড়া, কম লেটেন্সি সহ।[2][13]
মডেলটি NVIDIA Hopper আর্কিটেকচারের জন্য অপ্টিমাইজ করা নেটিভ INT4 ওজন কোয়ান্টাইজেশন (weight-only, গ্রুপ ৩২) বাস্তবায়ন করে।[2]
মূল ফলাফল ও benchmark
Kimi K2-এর পাঠ্য ও এজেন্ট benchmark
কারিগরি প্রতিবেদনের তথ্য অনুযায়ী, ফলাফলগুলি non-thinking মোডে (বিস্তৃত chain-of-thought ছাড়া) Kimi-K2-Instruct-এর জন্য প্রদান করা হয়েছে।[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | উৎস |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65,8 % | 38,8 % | 72,5 % / 72,7 % | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47,3 % | 20,9 % | 51,0 % | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53,7 % | 44,7 % | 46,9 % | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66,1 % | 48,8 % | 66,1 % | arXiv:2507.20534 |
| ACEBench (En) | 76,5 % | 75,6 % | 80,1 % | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49,5 % | 33,9 % | 46,7 % | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75,1 % | 68,2 % | 74,9 % | arXiv:2507.20534 |
লেখকদের বিবৃতি অনুযায়ী, এই ফলাফলগুলি বিশেষত প্রকৌশল ও এজেন্ট কাজে thinking-উন্মোচন ছাড়া মোডে K2-কে মুক্ত মডেলগুলির মধ্যে নেতৃস্থানীয় হিসেবে স্থান দেয় (প্রতিবেদন প্রকাশের সময় অনুযায়ী)।[1]
Kimi-VL-এর benchmark
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | উৎস |
|---|---|---|---|---|
| MMVet (নির্ভুলতা) | 66,7 % | 67,1 % | 66,9 % | arXiv:2504.07491 |
| RealWorldQA | 68,1 % | 68,5 % | — | arXiv:2504.07491 |
ফলাফলগুলি দেখায় যে কম্প্যাক্ট মাল্টিমোডাল MoE আর্কিটেকচার কম সক্রিয় প্যারামিটারে বৃহত্তর মডেলের সাথে তুলনীয় মাত্রায় পৌঁছায়।[9]
Kimi K2.5-এর benchmark
ফলাফলগুলি NVIDIA NIM প্ল্যাটফর্মে মডেল কার্ড এবং কারিগরি প্রতিবেদনের তথ্য অনুযায়ী Thinking মোডে (temperature = 1.0; top-p = 0.95; প্রসঙ্গ ২,৫৬,০০০ token; vLLM ইঞ্জিন; NVIDIA H200 হার্ডওয়্যার প্ল্যাটফর্ম) প্রদান করা হয়েছে।[2][13]
| বিভাগ | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (টুল ছাড়া) | 30,1 |
| HLE-Full (টুলসহ) | 50,2 | |
| AIME 2025 | 96,1 | |
| HMMT 2025 (Feb) | 95,4 | |
| GPQA-Diamond | 87,6 | |
| MMLU-Pro | 87,1 | |
| Vision & Video | MMMU-Pro | 78,5 |
| MathVision | 84,2 | |
| MathVista (mini) | 90,1 | |
| OCRBench | 92,3 | |
| OmniDocBench 1.5 | 88,8 | |
| VideoMMMU | 86,6 | |
| LongVideoBench | 79,8 | |
| Coding | SWE-Bench Verified | 76,8 |
| SWE-Bench Pro | 50,7 | |
| SWE-Bench Multilingual | 73,0 | |
| Terminal Bench 2.0 | 50,8 | |
| PaperBench | 63,5 | |
| LiveCodeBench v6 | 85,0 | |
| OJBench (C++) | 57,4 | |
| Long Context | Longbench v2 | 61,0 |
| AA-LCR | 70,0 | |
| Agentic Search | BrowseComp | 60,6 |
| BrowseComp (Agent Swarm) | 78,4 | |
| WideSearch (iter-F1) | 72,7 | |
| DeepSearchQA | 77,1 |
অতিরিক্তভাবে K2.5 পাঠ্য কাজে ভিজ্যুয়াল প্রশিক্ষণের ইতিবাচক স্থানান্তর প্রদর্শন করে: পাঠ্য বেস মডেল K2-এর তুলনায় MMLU-Pro-তে +১.৭% এবং GPQA-Diamond-এ +২.১%।[2]
চূড়ান্ত তুলনামূলক মূল্যায়ন মেট্রিক্স ও পরিস্থিতির নির্বাচনের উপর নির্ভর করে; ফলাফলগুলি লেখকদের তথ্য অনুযায়ী প্রদান করা হয়েছে। প্রকাশের সময় benchmark-এর একটি অংশের স্বাধীন যাচাই সীমিত।[2][15]
প্রয়োগ
পাঠ্য সহকারী ও অনুসন্ধান
Kimi প্ল্যাটফর্ম দীর্ঘ দলিল প্রক্রিয়াকরণ (গবেষণা প্রতিবেদন, আর্থিক ডেটা), স্বয়ংক্রিয় বিশ্লেষণ এবং তথ্য একত্রীকরণ সহ অনলাইন অনুসন্ধানের সমর্থন সহ একটি সহকারী হিসেবে ব্যবহৃত হয়। Moonshot AI জানায় যে Kimi একটি এজেন্ট পরিস্থিতির মধ্যে ৩০০-এরও বেশি টুল কল (tool calls) সমর্থন করে।[7][4]
প্রোগ্রামিং ও প্রকৌশল কাজ
Kimi K2 ও K2.5 SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench এবং অন্যান্য প্রোগ্রামিং benchmark-এ উচ্চ ফলাফল প্রদর্শন করে। মডেলগুলি রিপোজিটরিতে ত্রুটি সংশোধনের স্বয়ংক্রিয়করণ, কোড জেনারেশন ও রিফ্যাক্টরিং, অনলাইন জাজের কাজ সমাধানে (OJBench, LiveCodeBench) ব্যবহৃত হয়। K2-এর কারিগরি প্রতিবেদন ইঙ্গিত করে যে মডেলটি ভার্সন কন্ট্রোল সিস্টেম, প্যাকেজ ম্যানেজার ও এক্সিকিউশন পরিবেশের সাথে মিথস্ক্রিয়া সহ বৃহৎ পরিসরের সিন্থেটিক এজেন্ট কর্পাসে প্রশিক্ষিত হয়েছিল।[1][2][14]
মাল্টিমোডাল অ্যাপ্লিকেশন
Kimi-VL ও K2.5 ছবি ও দলিলে ভিজ্যুয়াল প্রশ্নোত্তর (VQA); দলিল বোঝাপড়া (OCRBench, OmniDocBench); ভিডিও বিশ্লেষণ (VideoMMMU, LongVideoBench); ভিজ্যুয়াল স্পেসিফিকেশন অনুযায়ী প্রোগ্রামিংয়ের সমন্বিত কাজের (যেমন ছবির লেআউট অনুযায়ী ইন্টারফেস জেনারেশন) জন্য তৈরি। K2.5-এর জন্য "vision-grounded coding" ও "autonomous visual debugging" পরিস্থিতির বিবরণ দেওয়া হয়েছে, যেখানে মডেল ভিজ্যুয়াল বিবরণ অনুযায়ী কোড তৈরি করে এবং পুনরাবৃত্তিমূলকভাবে ভিজ্যুয়াল ফলাফল বিশ্লেষণ করে।[2][9][15]
API ও ডিপ্লয়মেন্ট
মডেলগুলি tool calling, thinking মোড, JSON মোড ও প্রসঙ্গ ক্যাশিং সমর্থন সহ Moonshot AI Open Platform-এর API-এর মাধ্যমে পাওয়া যায়। মুক্ত ওজনগুলি vLLM, SGLang ও TensorRT-LLM-এর মাধ্যমে স্থানীয় ডিপ্লয়মেন্টের জন্য ব্যবহৃত হয়। Mooncake সার্ভিস দীর্ঘ প্রসঙ্গের ইনফারেন্স স্কেলিং নিশ্চিত করে।[4][11][16]
সীমাবদ্ধতা ও উন্মুক্ত সমস্যা
রিসোর্সের প্রয়োজনীয়তা
১ ট্রিলিয়ন প্যারামিটার স্কেলের MoE মডেলগুলি, এমনকি ৩২ বিলিয়ন সক্রিয় প্যারামিটার এবং INT4 কোয়ান্টাইজেশন সহ, উল্লেখযোগ্য মেমরি এবং ব্যান্ডউইথের প্রয়োজন। Kimi K2.5 ডিপ্লয়মেন্টের প্রকৌশলীয় আলোচনায় সম্পূর্ণ মডেল লোড করার জন্য শত শত গিগাবাইট ভিডিও মেমরির অনুমান উল্লেখ করা হয়েছে; নির্দিষ্ট সংখ্যা কোয়ান্টাইজেশনের ধরন ও ফ্রেমওয়ার্কের (vLLM, SGLang ইত্যাদি) উপর নির্ভর করে।[2][17]
হ্যালুসিনেশন ও জেনারেশনের গুণমান
অন্যান্য LLM-এর মতো, Kimi সিরিজের মডেলগুলিও হ্যালুসিনেশনের প্রবণ। FACTS Grounding ও FaithJudge পরীক্ষার প্রতিবেদনে RAG পরিস্থিতিতে hallucination rate ১.১–৭.৪%-এর মধ্যে নথিভুক্ত করা হয়েছে। Non-thinking মোডে মডেলটি টুল স্পেসিফিকেশন অস্পষ্ট হলে অতিরিক্ত token তৈরি করতে পারে; জোরপূর্বক tool-use সক্রিয় করলে কিছু কাজে পারফরম্যান্স হ্রাস পায়।[1]
সিন্থেটিক ডেটা ও RL পাইপলাইনের উপর নির্ভরতা
এজেন্ট ডেটা সংশ্লেষণ ও Reinforcement Learning প্রশিক্ষণের পাইপলাইন বৃহৎ সংগ্রহের সিন্থেটিক টুল ও দৃশ্য এবং স্বয়ংক্রিয় মূল্যায়নের জন্য LLM মূল্যায়নকারীর (self-judging) উপর নির্ভর করে। এই পদ্ধতি কিছু উন্মুক্ত প্রশ্ন তৈরি করে: স্ব-মূল্যায়নের পক্ষপাত (bias)-এর প্রতি স্থিতিস্থাপকতা; বারবার পুনরাবৃত্তিতে সম্ভাব্য অবনতি (bootstrap); সিমুলেটেড থেকে ভিন্ন বাস্তব পরিবেশে এজেন্ট দক্ষতার স্থানান্তরযোগ্যতা; সিন্থেটিক কাজের বিতরণের সাধারণীকরণ ক্ষমতার উপর প্রভাব।[1][14]
স্বচ্ছতা ও পুনরুৎপাদনযোগ্যতা
প্রশিক্ষণ ডেটার গঠন, ফিল্টারিং প্রক্রিয়া, ভাষা ও ডোমেনের বিতরণ সম্পর্কিত কিছু তথ্য প্রকাশিত হয়নি বা সীমিতভাবে প্রকাশিত হয়েছে। এটি পক্ষপাতের উৎসের সঠিক মূল্যায়ন, প্রশিক্ষণের পুনরুৎপাদনযোগ্যতা এবং স্থিতিশীলতার উপর পৃথক উপাদানগুলির (MuonClip, QK-clip) প্রভাবের স্বাধীন যাচাইকে কঠিন করে তোলে। ফেব্রুয়ারি ২০২৬ পর্যন্ত মুক্ত সাহিত্যে তৃতীয় পক্ষ কর্তৃক Kimi K2 ও K2.5-এর প্রশিক্ষণের সম্পূর্ণ পুনরুৎপাদন নথিভুক্ত হয়নি।[1][2]
নৈতিক ও নিয়ন্ত্রক দিকসমূহ
মডেল কার্ড ও কারিগরি প্রতিবেদনে জোর দেওয়া হয়েছে যে ডেভেলপাররা মডেলের ইনপুট ও আউটপুটের জন্য দায়িত্বশীল; বাস্তবায়নের আগে সুরক্ষামূলক প্রক্রিয়া (guardrails) যোগ করা এবং নির্দিষ্ট পরিস্থিতির ডেটায় পরীক্ষা করা প্রয়োজন; মডেলটি ব্যক্তিগত ডেটা ধারণ করতে পারে এমন ছবি ও ভিডিও প্রক্রিয়া করতে পারে এবং ইন্টিগ্রেটরকে প্রাসঙ্গিক আইন মেনে চলতে হবে।[2][16]
কারিগরি প্রতিবেদনে Promptfoo ধরনের টুল ব্যবহার করে নিরাপত্তা মূল্যায়নের (জৈবিক, রাসায়নিক, সাইবার ঝুঁকি) বিবরণ দেওয়া হয়েছে। মডেলগুলি যাচাইযোগ্য পুরষ্কার ও স্ব-মূল্যায়ন সহ RL সারিবদ্ধতা (alignment) এর মধ্য দিয়ে যায়।[1]
একটি চীনা কোম্পানির পণ্য হিসেবে, মডেলগুলি AI-এর ক্ষেত্রে গণপ্রজাতন্ত্রী চীনের জাতীয় নিয়ন্ত্রণের অধীন। লেখার সময় Kimi মডেলগুলিকে বিশেষভাবে নিবেদিত পৃথক জনসাধারণের নিয়ন্ত্রক দলিল পাওয়া যায়নি; নিয়ন্ত্রণ সংশ্লিষ্ট এখতিয়ারে জেনারেটিভ মডেল ও AI-এর সাধারণ পদ্ধতির কাঠামোর মধ্যে পরিচালিত হয়।[18]
ফেব্রুয়ারি ২০২৬ সালে Anthropic কোম্পানি দাবি করে যে Moonshot AI (অন্যান্য চীনা ডেভেলপারদের সাথে) মডেল প্রশিক্ষণের জন্য ডেটা distillation-এর উদ্দেশ্যে Claude-এর সাথে মিথস্ক্রিয়া তৈরি করতে জাল অ্যাকাউন্ট ব্যবহার করেছে। তথ্যটি একটি পক্ষের দাবির চরিত্র বহন করে এবং প্রকাশের সময় স্বাধীন তদন্তে নিশ্চিত হয়নি; Moonshot AI কোনো আনুষ্ঠানিক প্রতিক্রিয়া প্রকাশ করেনি।[5]
প্রেক্ষাপট ও গবেষণার দিকনির্দেশনা
প্রকাশিত উপকরণ থেকে কয়েকটি আরও গবেষণার দিক চিহ্নিত করা যায়:
- মাপযোগ্য এজেন্ট সিস্টেম। সিন্থেটিক টুলসেট, RL ও self-judging ব্যবহার করে এজেন্ট সিস্টেম হিসেবে LLM প্রশিক্ষণের পদ্ধতির উন্নয়ন। বৃহত্তর সংখ্যক সাব-এজেন্ট ও নতুন ধরনের কাজে Agent Swarm সম্প্রসারণ।[2][1]
- দক্ষ MoE আর্কিটেকচার। ৩২ বিলিয়ন সক্রিয় সহ ১ ট্রিলিয়ন প্যারামিটার এবং ৩৮৪ বিশেষজ্ঞ ব্যবহার স্কেল ও দক্ষতার মধ্যে আপোসের একটি রূপ প্রতিনিধিত্ব করে; বিভিন্ন রাউটিং স্কিম সহ বিকল্পগুলি অনুসন্ধান করা হচ্ছে।[1]
- নেটিভ মাল্টিমোডালিটি। প্রি-ট্রেনিংয়ের শুরু থেকে মিশ্রিত ভিজ্যুয়াল-পাঠ্য ডেটায় K2.5-এর প্রশিক্ষণ "নেটিভ" মাল্টিমোডালিটির একটি পদ্ধতির প্রতিনিধিত্ব করে, যা দুই-পর্যায়ের স্কিমের সাথে তুলনা করা হচ্ছে।[2][9]
- দক্ষ ইনফারেন্স ও দীর্ঘ প্রসঙ্গ। INT4 কোয়ান্টাইজেশন ও ২,৫৬,০০০ token প্রসঙ্গ সমর্থন স্পার্স অ্যাটেনশন, লেটেন্ট উপস্থাপনা ও বাহ্যিক মেমরির ক্ষেত্রে আরও গবেষণাকে উৎসাহিত করছে। আলাদাভাবে Kimi Linear প্রকল্পের বিবরণ দেওয়া হয়েছে — হাইব্রিড লিনিয়ার অ্যাটেনশন যাতে ১ মিলিয়ন token প্রসঙ্গে KV-ক্যাশ ৭৫% হ্রাস এবং ডিকোডিং ৬ গুণ ত্বরান্বিত করা হয়েছে।[2][19]
Moonshot AI-এর আনুষ্ঠানিক উপকরণে Kimi-এর ভবিষ্যৎ সংস্করণ সম্পর্কে বিস্তারিত রোডম্যাপ প্রকাশিত হয় না; তালিকাভুক্ত দিকগুলি প্রকাশিত গবেষণার উপর ভিত্তি করে।
আরও দেখুন
- Transformer আর্কিটেকচার
- DeepSeek
- Qwen
তথ্যসূত্র
- https://www.moonshot.ai/ — Moonshot AI-এর আনুষ্ঠানিক ওয়েবসাইট
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — Kimi K2.5-এর GitHub রিপোজিটরি
- https://huggingface.co/moonshotai — Hugging Face-এ Moonshot AI-এর প্রোফাইল
সাহিত্য
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692