Kimi (Moonshot AI) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (Moonshot AI-এর মডেল সিরিজ) — চীনা কোম্পানি Moonshot AI (বেইজিং, গণপ্রজাতন্ত্রী চীন) কর্তৃক পাঠ্য ও মাল্টিমোডাল জেনারেশন, প্রোগ্রামিং এবং এজেন্টিক সিস্টেমের (agentic systems — যে সিস্টেম স্বায়ত্তশাসিত পরিকল্পনা, যুক্তি প্রদর্শন ও বাহ্যিক টুল ব্যবহার করে কাজ সম্পাদনে সক্ষম) কাজের জন্য তৈরি বৃহৎ ভাষা মডেলের (Large Language Model, LLM) একটি সিরিজ। এই পরিবারে Mixture-of-Experts (MoE) আর্কিটেকচারের টেক্সট ও মাল্টিমোডাল মডেল রয়েছে, যার মোট প্যারামিটার প্রায় ১ ট্রিলিয়ন এবং প্রতিটি token-এ সক্রিয় প্যারামিটার প্রায় ৩২ বিলিয়ন।[1][2] এই সিরিজের একটি গুরুত্বপূর্ণ বৈশিষ্ট্য হলো এজেন্ট আচরণের (বাহ্যিক টুল কলসহ বহুধাপ পরিকল্পনা) উপর মনোযোগ এবং Kimi K2 ও Kimi K2.5 সংস্করণে ২৫৬,০০০ token পর্যন্ত দীর্ঘ প্রসঙ্গের (context) সমর্থন।[1][2]

Kimi সিরিজের মডেলগুলি Hugging Face প্ল্যাটফর্মে পরিবর্তিত MIT লাইসেন্সের অধীনে open-weight হিসেবে এবং Moonshot AI Open Platform-এর মাধ্যমে প্রোপ্রাইটারি API হিসেবে উভয়ভাবেই পাওয়া যায়।[3][4]

ইতিহাস ও পটভূমি

Moonshot AI-এর প্রতিষ্ঠা

Moonshot AI ২০২৩ সালের মার্চ মাসে বেইজিংয়ে ইয়াং ঝিলিন (Yang Zhilin, CEO), ঝৌ সিনইউ (Zhou Xinyu) এবং উ ইউসিন (Wu Yuxin) কর্তৃক প্রতিষ্ঠিত হয়েছিল — এঁরা সবাই সিংহুয়া বিশ্ববিদ্যালয়ের (Tsinghua University) স্নাতক। ইয়াং ঝিলিন আগে Google Brain ও Meta-তে কাজ করেছিলেন এবং কম্পিউটার ভিশন ও যুক্তি প্রদর্শনের গবেষণায় অংশগ্রহণ করেছিলেন। কোম্পানিটি Alibaba (ফেব্রুয়ারি ২০২৪-এ $১ বিলিয়ন রাউন্ড), Tencent এবং অন্যান্য বিনিয়োগকারীদের কাছ থেকে অর্থায়ন পেয়েছে।[5][6]

মূল প্রকাশের কালপঞ্জি

  • অক্টোবর–নভেম্বর ২০২৩ — ১,২৮,০০০ token (২ লক্ষ চীনা অক্ষর পর্যন্ত) প্রসঙ্গ সমর্থন সহ Kimi চ্যাটবট চালু। প্রথম সংস্করণগুলি সীমিতভাবে প্রকাশিত কারিগরি বিবরণ সহ প্রোপ্রাইটারি মডেল ব্যবহার করেছিল।[6][7]
  • মার্চ ২০২৪ — বেটা সংস্করণে ২০ লক্ষ চীনা অক্ষর পর্যন্ত প্রসঙ্গ সম্প্রসারণ।[6]
  • জানুয়ারি ২০২৫Kimi k1.5 প্রকাশ — একটি মাল্টিমোডাল মডেল যাতে স্কেলড Reinforcement Learning (RL) ব্যবহার করা হয়েছে এবং যা গণিত, প্রোগ্রামিং ও মাল্টিমোডাল যুক্তি প্রদর্শনের কাজে OpenAI o1-এর সমতুল্য বলে দাবি করা হয়েছে। প্রসঙ্গ ১,২৮,০০০ token পর্যন্ত।[8]
  • এপ্রিল ২০২৫Kimi-VL উপস্থাপন — একটি মুক্ত মাল্টিমোডাল MoE মডেল (vision-language model, VLM) যাতে MoonViT ভিজ্যুয়াল এনকোডার (~৪০০ মিলিয়ন প্যারামিটার) এবং ডিকোডারে ~২.৮ বিলিয়ন সক্রিয় প্যারামিটার রয়েছে। কারিগরি প্রতিবেদন arXiv-এ প্রকাশিত হয়েছে।[9]
  • জুলাই ২০২৫Kimi K2 প্রকাশ — ১ ট্রিলিয়ন মোট প্যারামিটার এবং ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ মূল মুক্ত MoE মডেল। কারিগরি প্রতিবেদন arXiv-এ প্রকাশিত।[1] প্রকাশের সময় মডেলটি LMSYS Chatbot Arena-তে মুক্ত মডেলগুলির মধ্যে প্রথম স্থান অধিকার করেছিল (৩,০০০-এরও বেশি ভোট)।[1]
  • সেপ্টেম্বর ২০২৫Kimi-K2-Instruct-0905 আপডেট প্রকাশ, যাতে প্রসঙ্গ ২,৫৬,০০০ token পর্যন্ত বিস্তৃত করা হয়েছে এবং এজেন্ট কোডিং উন্নত করা হয়েছে।[1]
  • নভেম্বর ২০২৫Kimi K2 Thinking প্রকাশ — উন্নত ধাপে-ধাপে যুক্তি প্রদর্শন (chain-of-thought) এবং ২০০–৩০০ ধারাবাহিক টুল কল (tool calls) সমর্থন সহ একটি সংস্করণ।[10]
  • জানুয়ারি ২০২৬Kimi K2.5 উপস্থাপন — নেটিভ মাল্টিমোডালিটি এবং Agent Swarm প্রক্রিয়া (সাব-এজেন্টের সমান্তরাল অর্কেস্ট্রেশন) সহ একটি মাল্টিমোডাল MoE মডেল।[2]

মডেল তৈরির পাশাপাশি ২০২৪ সালে নিজস্ব ইনফারেন্স সার্ভিস Mooncake উপস্থাপিত হয়েছিল — দীর্ঘ প্রসঙ্গ সহ LLM পরিষেবার জন্য KVCache-কেন্দ্রিক বিচ্ছিন্ন আর্কিটেকচার।[11]

তাত্ত্বিক ভিত্তি ও আর্কিটেকচার

Mixture-of-Experts আর্কিটেকচার

Kimi K2 ও K2.5 সিরিজের মডেলগুলি পৃথক স্তরে Mixture-of-Experts সহ Transformer আর্কিটেকচার বাস্তবায়ন করে। ট্রান্সফর্মারের একটি আদর্শ ব্লক হলো মাল্টি-হেড সেলফ-অ্যাটেনশন (Multi-Head Attention, MHA) এবং পজিশন-ওয়াইজ MLP (মাল্টিলেয়ার পার্সেপ্ট্রন) স্তরের আবাসিক সংযোগসহ একটি রচনা:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

যেখানে 𝐇L×d — ইনপুট token উপস্থাপনা, L — ক্রমের দৈর্ঘ্য, d — গুপ্ত অবস্থার আকার।

MoE স্তরে একটি MLP-এর পরিবর্তে বিশেষজ্ঞদের একটি সেট {Ei}i=1N ব্যবহার করা হয়, যেখানে প্রতিটি বিশেষজ্ঞ প্যারামিটার θi সহ একটি পৃথক MLP। রাউটার (gating network) প্রতিটি token-এর জন্য বিশেষজ্ঞদের একটি উপসেট নির্বাচন করে। উপস্থাপনা 𝐡 সহ token-এর জন্য MoE স্তরের আউটপুট নিম্নরূপ:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

যেখানে 𝒮(𝐡){1,,N} — প্রদত্ত token-এর জন্য নির্বাচিত বিশেষজ্ঞদের সেট, gi(𝐡) — রাউটারের নরমালাইজড ওজন, i𝒮gi=1। রাউটিং ফাংশন TopK অপারেশনের মাধ্যমে বিশেষজ্ঞ নির্বাচন করে:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

যেখানে Wg — প্রশিক্ষণযোগ্য রাউটার ম্যাট্রিক্স। এই পদ্ধতি প্রতিটি token-এ সক্রিয় প্যারামিটারের সীমিত সংখ্যার সাথে মোট প্যারামিটার স্কেল করতে দেয়।

Kimi K2 / K2.5-এর আর্কিটেকচারাল হাইপারপ্যারামিটার

প্যারামিটার মান
আর্কিটেকচারের ধরন Mixture-of-Experts সহ Transformer
মোট প্যারামিটারের সংখ্যা ১.০৪ ট্রিলিয়ন
প্রতি token-এ সক্রিয় প্যারামিটার ৩২ বিলিয়ন
স্তরের সংখ্যা ৬১ (১টি ঘন + ৬০টি MoE)
গুপ্ত অবস্থার আকার 7168
অ্যাটেনশন হেডের সংখ্যা 64
বিশেষজ্ঞের সংখ্যা ৩৮৪ (প্রতি token-এ ৮টি নির্বাচিত + ১টি সাধারণ)
বিশেষজ্ঞের গুপ্ত অবস্থার আকার (MoE hidden size) 2048
শব্দভান্ডারের আকার ১,৬০,০০০ token
অ্যাক্টিভেশন ফাংশন SwiGLU
অ্যাটেনশন প্রক্রিয়া Multi-head Latent Attention (MLA)
সর্বোচ্চ প্রসঙ্গ ২,৫৬,০০০ token (YaRN-এর মাধ্যমে সম্প্রসারণ)
ভিজ্যুয়াল এনকোডার (K2.5) MoonViT-3D, ~৪০০ মিলিয়ন প্যারামিটার

[1][2][13]

স্পার্সিটি (মোট বিশেষজ্ঞ সংখ্যার সাথে সক্রিয় বিশেষজ্ঞ সংখ্যার অনুপাত) ৪৮:১ (৩৮৪ বিশেষজ্ঞ, ৮টি সক্রিয়), যা একই স্কেলের ঘন (dense) মডেলের তুলনায় কম্পিউটেশনাল খরচে উল্লেখযোগ্য হ্রাস নিশ্চিত করে।[1]

Multi-head Latent Attention (MLA) প্রক্রিয়া

Kimi K2/K2.5 সিরিজের মডেলে Multi-head Latent Attention (MLA) প্রক্রিয়া ব্যবহার করা হয়েছে — এটি স্ট্যান্ডার্ড মাল্টি-হেড অ্যাটেনশনের একটি পরিবর্তন যা দক্ষতা ও মাপযোগ্যতা বৃদ্ধির লক্ষ্যে তৈরি। একটি স্তরের জন্য স্ট্যান্ডার্ড অ্যাটেনশন নিম্নরূপ গণনা করা হয়:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

যেখানে 𝐐,𝐊,𝐕L×dk — কোয়েরি, কী ও মানের ম্যাট্রিক্স। MLA-তে লেটেন্ট উপস্থাপনা প্রবর্তন করা হয়েছে যার উপর কোয়েরি ও কী প্রজেক্ট করা হয়, যা মধ্যবর্তী অপারেশনের মাত্রা হ্রাস করে এবং KV-ক্যাশের আকার কমাতে দেয়। এই পদ্ধতি DeepSeek-V3-এ ব্যবহৃত প্রক্রিয়ার অনুরূপ।[1][13]

MuonClip অপ্টিমাইজার ও QK-clip

Kimi K2 মডেলের প্রশিক্ষণের জন্য MuonClip অপ্টিমাইজার প্রস্তাব করা হয়েছে — এটি Muon অপ্টিমাইজারের (Newton-Schulz নরমালাইজেশন সহ মোমেন্টাম অপ্টিমাইজার) একটি পরিবর্তন যাতে MoE আর্কিটেকচারের বৃহৎ ভাষা মডেলের প্রশিক্ষণ স্থিতিশীল করার জন্য QK-clip কৌশল যোগ করা হয়েছে।[1]

QK-clip ক্লিপিং অপারেশনের মাধ্যমে অ্যাটেনশন লগিট 𝐐𝐊-এ সীমাবদ্ধতা প্রয়োগ করে। প্রতিটি অ্যাটেনশন হেড h-এর জন্য সর্বোচ্চ লগিট নির্ধারণ করা হয়:

Shmax=1dmaxi,j(Qhi(Khj)),

এবং স্কেলিং সহগ গণনা করা হয়:

γh=min(1,τShmax),

যেখানে τ=100 — থ্রেশহোল্ড হাইপারপ্যারামিটার, d — হেডের আকার। সহগ γh ওজন Wq,Wk স্কেল করতে প্রয়োগ করা হয় যদি সর্বোচ্চ লগিট থ্রেশহোল্ড অতিক্রম করে। এটি softmax-এর আগে লগিট মানের পরিসর সীমিত করে এবং বড় স্কেলে প্রশিক্ষণের সময় তীব্র ক্ষতির (loss spikes) ঝুঁকি হ্রাস করে।[1]

লেখকদের তথ্য অনুযায়ী, MuonClip সহ ১৫.৫ ট্রিলিয়ন token-এ Kimi K2-এর প্রি-ট্রেনিং সমগ্র সময়কাল জুড়ে একটিও ক্ষতির স্পাইক (zero loss spikes) ছাড়াই সম্পন্ন হয়েছে।[1]

মাল্টিমোডালিটি ও MoonViT

Kimi K2.5 ও Kimi-VL মডেলে MoonViT ভিজ্যুয়াল এনকোডার (K2.5 সংস্করণে — MoonViT-3D) ব্যবহার করা হয়েছে, যার প্রায় ৪০০ মিলিয়ন প্যারামিটার রয়েছে। এটি NaViT প্যাকিং সহ SigLIP-SO-400M-এর উপর ভিত্তি করে তৈরি (পরিবর্তনশীল রেজোলিউশনের ইনপুট ছবি সমর্থন করে) এবং ভিডিও প্রক্রিয়াকরণের জন্য 3D সম্প্রসারণ (৪টি ফ্রেমের গ্রুপিং) রয়েছে।[2][9]

ভিজ্যুয়াল এনকোডার ইনপুট ছবি ও ভিডিওকে ভিজ্যুয়াল token-এর একটি ক্রমে রূপান্তরিত করে। ধরি 𝐗H×W×3 — ইনপুট ছবি, Φvis — ভিজ্যুয়াল এনকোডার:

𝐙vis=Φvis(𝐗)Lv×dv,

তারপর রৈখিক প্রজেকশনের মাধ্যমে (দুই-স্তরীয় MLP) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

যেখানে d — মডেলের ভাষা অংশের গুপ্ত স্থানের আকার। মাল্টিমোডাল মোডে 𝐇vis পাঠ্য token-এর সাথে সংযুক্ত হয়ে ট্রান্সফর্মারে প্রেরণ করা হয়।[9][2]

দুই-পর্যায়ের পদ্ধতির (পাঠ্য মডেলের উপরে ভিজ্যুয়াল অ্যাডাপ্টার যোগ করা) বিপরীতে, K2.5 প্রি-ট্রেনিংয়ের শুরু থেকেই মিশ্রিত ভিজ্যুয়াল-পাঠ্য ডেটায় (joint text-vision pre-training) প্রশিক্ষিত হয়েছে, প্রাথমিক পর্যায়ে ভিজ্যুয়াল token-এর কম অনুপাত (~১০%) রেখে ধীরে ধীরে বৃদ্ধি করা হয়েছে। মোট পরিমাণ — প্রায় ১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token।[2]

প্রি-ট্রেনিং ও পোস্ট-ট্রেনিং

প্রি-ট্রেনিং

Kimi K2 ১৫.৫ ট্রিলিয়ন token (ওয়েব টেক্সট, কোড, গণিত, বিশ্বকোষীয় জ্ঞান) এ MuonClip অপ্টিমাইজার ব্যবহার করে প্রি-ট্রেইন করা হয়েছে। সমগ্র প্রি-ট্রেনিং সময়কালে একটিও ক্ষতির স্পাইক (loss spike) রেকর্ড করা হয়নি।[1]

Kimi K2.5 K2 চেকপয়েন্ট থেকে মডালিটিগুলির যৌথ অপ্টিমাইজেশন (joint pre-training) সহ অতিরিক্ত ~১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token-এ ক্রমাগত প্রি-ট্রেনিং (continual pre-training) এর মধ্য দিয়ে গেছে। আলাদাভাবে ১ ট্রিলিয়ন token-এ ভিজ্যুয়াল এনকোডারের standalone প্রশিক্ষণ এবং প্রসঙ্গ বিস্তারের জন্য একটি অতিরিক্ত long-context mid-training পর্যায় পরিচালিত হয়েছে।[2]

পোস্ট-ট্রেনিং

K2 সিরিজের মডেলের পোস্ট-ট্রেনিংয়ে বেশ কয়েকটি পর্যায় রয়েছে:[1][2]

Supervised Fine-Tuning (SFT, তত্ত্বাবধায়িত সূক্ষ্ম সমন্বয়):

  • সিন্থেটিক এজেন্ট ট্রাজেক্টরি (agentic data synthesis) — টুল স্পেসিফিকেশন তৈরি, পরিবেশের সাথে মিথস্ক্রিয়া মডেলিং, ফলাফলের যাচাই।
  • K2.5-এর জন্য অতিরিক্তভাবে zero-vision SFT প্রয়োগ করা হয় — একটি পাঠ্য SFT যা fine-tuning পর্যায়ে সরাসরি ছবি ব্যবহার ছাড়াই ভিজ্যুয়াল ক্ষমতা সক্রিয় করে।

Reinforcement Learning (RL, শক্তিবর্ধন শিক্ষা):

  • গণিত, কোড ও নিরাপত্তার কাজের জন্য যাচাইযোগ্য পুরষ্কারের (Reinforcement Learning with Verifiable Rewards, RLVR) সমন্বয়।
  • রুব্রিক অনুযায়ী স্ব-মূল্যায়ন (self-critique rubric rewards) — এজেন্ট পরিস্থিতির গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের জন্য LLM মূল্যায়নকারী ব্যবহার।
  • K2.5-এর জন্য — যৌথ মাল্টিমোডাল RL (joint multimodal RL)।

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking ও K2.5 নেটিভ INT4 ওজন কোয়ান্টাইজেশন (weight-only quantization, গ্রুপ ৩২, সংকুচিত টেনসর) সমর্থন করে, যা NVIDIA Hopper আর্কিটেকচারের জন্য অপ্টিমাইজ করা হয়েছে এবং ইনফারেন্সের সময় মেমরির প্রয়োজনীয়তা হ্রাস করে।[10][2]

Agent Swarm (K2.5)

K2.5 মডেলের জন্য Agent Swarm প্রক্রিয়া তৈরি করা হয়েছে — স্ব-পরিচালিত সমান্তরাল এজেন্ট অর্কেস্ট্রেশনের একটি ফ্রেমওয়ার্ক। অর্কেস্ট্রেটর মডেল গতিশীলভাবে সাব-এজেন্ট তৈরি করে (create_subagent, assign_task অপারেশনের মাধ্যমে), উপকাজ বিতরণ করে এবং ফলাফল একত্রিত করে। প্রতিটি সাব-এজেন্ট স্বাধীনভাবে টুল কল করতে পারে এবং অন্যান্য সাব-এজেন্টের সমান্তরালে কাজ করতে পারে।[2]

Agent Swarm প্রক্রিয়ার প্রশিক্ষণ Parallel-Agent Reinforcement Learning (PARL) এর মাধ্যমে বাস্তবায়িত হয়েছে, যাতে এক্সিকিউশন ও অপ্টিমাইজেশন বিচ্ছিন্ন করা হয়েছে (decoupling execution/optimization)। লেখকদের তথ্য অনুযায়ী, Agent Swarm একক-থ্রেড এজেন্ট মোডের (single-agent) তুলনায় লেটেন্সি ৪.৫ গুণ পর্যন্ত কমিয়ে আনে।[2]

সিরিজের মূল মডেলসমূহ

মডেল ধরন প্যারামিটার (মোট / সক্রিয়) প্রসঙ্গ, token মাল্টিমোডালিটি প্রকাশের তারিখ
Kimi k1.5 LLM, RL-scaling প্রকাশিত নয় 128 000 হ্যাঁ (সীমিত) জানুয়ারি ২০২৫
Kimi-VL VLM, MoE কম্প্যাক্ট / ~২.৮ বিলিয়ন সক্রিয় + ৪০০ মিলিয়ন ViT দীর্ঘ প্রসঙ্গ হ্যাঁ (ছবি) এপ্রিল ২০২৫
Kimi K2 LLM, MoE ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন 256 000 না (পাঠ্য) জুলাই ২০২৫
Kimi K2 Thinking LLM, MoE ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন 256 000 না (পাঠ্য) নভেম্বর ২০২৫
Kimi K2.5 VLM-LLM, MoE ১.০৪ ট্রিলিয়ন / ৩২ বিলিয়ন 256 000 হ্যাঁ (ছবি, ভিডিও, PDF) জানুয়ারি ২০২৬

[8][9][1][10][2]

Kimi K2

Kimi K2 — ১.০৪ ট্রিলিয়ন মোট প্যারামিটার এবং প্রতি token-এ ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ একটি Mixture-of-Experts LLM। MuonClip অপ্টিমাইজার দিয়ে ১৫.৫ ট্রিলিয়ন token-এ প্রি-ট্রেইন করা হয়েছে। আর্কিটেকচারে ৩৮৪টি বিশেষজ্ঞ এবং দীর্ঘ প্রসঙ্গের সাথে সামঞ্জস্যপূর্ণ MLA প্রক্রিয়া রয়েছে। মডেলটি প্রোগ্রামিং, গাণিতিক যুক্তি প্রদর্শন এবং ধারাবাহিক টুল কলসহ এজেন্ট পরিস্থিতির কাজের জন্য তৈরি।[1]

কারিগরি প্রতিবেদনে বহু-পর্যায়ের পোস্ট-ট্রেনিং পাইপলাইন বর্ণনা করা হয়েছে: টুলের সাথে মিথস্ক্রিয়া মডেলিং করে এজেন্ট ডেটার বৃহৎ পরিসরে সংশ্লেষণ; বাস্তব ও সিন্থেটিক কাজের মিশ্রিত পরিবেশে Reinforcement Learning প্রশিক্ষণ; গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের জন্য LLM মূল্যায়নকারী ব্যবহার।[1][14]

Kimi K2 Thinking

Kimi K2 Thinking ভেরিয়্যান্টটি গতিশীল টুল কলের সুবিধা এবং ২,৫৬,০০০ token পর্যন্ত প্রসঙ্গ সমর্থন সহ বহুধাপ যুক্তি প্রদর্শনের (chain-of-thought) জন্য অপ্টিমাইজ করা হয়েছে। মডেলটি একটি পৃথক "Thinking" মোড বাস্তবায়ন করে যেখানে অভ্যন্তরীণ যুক্তি প্রদর্শন ধারণকারী reasoning_content ফিল্ড স্পষ্টভাবে ফেরত দেওয়া হয়। K2 Thinking একটি এজেন্ট এপিসোডে উল্লেখযোগ্য আচরণগত অবনতি ছাড়াই ২০০–৩০০টি ধারাবাহিক টুল কল সমর্থন করে, সেই সাথে QAT ব্যবহার করে নেটিভ INT4 কোয়ান্টাইজেশনও সমর্থন করে।[10]

Kimi-VL

Kimi-VL — একটি মুক্ত মাল্টিমোডাল MoE-VLM (vision-language model), যা ভিজ্যুয়াল বোঝাপড়া, ভিজ্যুয়াল-পাঠ্য যুক্তি প্রদর্শন এবং বাস্তব দৃশ্যের কাজের জন্য তৈরি। মডেলটিকে MoonViT ভিজ্যুয়াল এনকোডার সহ একটি কম্প্যাক্ট MoE আর্কিটেকচার হিসেবে বর্ণনা করা হয়েছে। কারিগরি প্রতিবেদন ২০২৫ সালের এপ্রিল মাসে arXiv-এ প্রকাশিত হয়েছে।[9]

Kimi K2.5

Kimi K2.5 — ৩২ বিলিয়ন সক্রিয় প্যারামিটার সহ ১.০৪ ট্রিলিয়ন প্যারামিটার স্কেলের একটি মাল্টিমোডাল MoE মডেল, যা Kimi-K2-Base চেকপয়েন্টের উপর ভিত্তি করে ~১৫ ট্রিলিয়ন মিশ্রিত ভিজ্যুয়াল-পাঠ্য token-এ অব্যাহত প্রি-ট্রেনিং সহ তৈরি। মডেলটি ২,৫৬,০০০ token পর্যন্ত প্রসঙ্গ সহ ছবি, ভিডিও, PDF ও পাঠ্য ইনপুট সমর্থন করে।[2]

K2.5 দুটি মূল ইনফারেন্স মোড সমর্থন করে:

  • Thinking mode — স্পষ্ট reasoning_content এবং বহুধাপ জেনারেশন সহ;
  • Instant mode — যুক্তি আউটপুট ছাড়া, কম লেটেন্সি সহ।[2][13]

মডেলটি NVIDIA Hopper আর্কিটেকচারের জন্য অপ্টিমাইজ করা নেটিভ INT4 ওজন কোয়ান্টাইজেশন (weight-only, গ্রুপ ৩২) বাস্তবায়ন করে।[2]

মূল ফলাফল ও benchmark

Kimi K2-এর পাঠ্য ও এজেন্ট benchmark

কারিগরি প্রতিবেদনের তথ্য অনুযায়ী, ফলাফলগুলি non-thinking মোডে (বিস্তৃত chain-of-thought ছাড়া) Kimi-K2-Instruct-এর জন্য প্রদান করা হয়েছে।[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet উৎস
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

লেখকদের বিবৃতি অনুযায়ী, এই ফলাফলগুলি বিশেষত প্রকৌশল ও এজেন্ট কাজে thinking-উন্মোচন ছাড়া মোডে K2-কে মুক্ত মডেলগুলির মধ্যে নেতৃস্থানীয় হিসেবে স্থান দেয় (প্রতিবেদন প্রকাশের সময় অনুযায়ী)।[1]

Kimi-VL-এর benchmark

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini উৎস
MMVet (নির্ভুলতা) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

ফলাফলগুলি দেখায় যে কম্প্যাক্ট মাল্টিমোডাল MoE আর্কিটেকচার কম সক্রিয় প্যারামিটারে বৃহত্তর মডেলের সাথে তুলনীয় মাত্রায় পৌঁছায়।[9]

Kimi K2.5-এর benchmark

ফলাফলগুলি NVIDIA NIM প্ল্যাটফর্মে মডেল কার্ড এবং কারিগরি প্রতিবেদনের তথ্য অনুযায়ী Thinking মোডে (temperature = 1.0; top-p = 0.95; প্রসঙ্গ ২,৫৬,০০০ token; vLLM ইঞ্জিন; NVIDIA H200 হার্ডওয়্যার প্ল্যাটফর্ম) প্রদান করা হয়েছে।[2][13]

বিভাগ Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (টুল ছাড়া) 30,1
HLE-Full (টুলসহ) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

অতিরিক্তভাবে K2.5 পাঠ্য কাজে ভিজ্যুয়াল প্রশিক্ষণের ইতিবাচক স্থানান্তর প্রদর্শন করে: পাঠ্য বেস মডেল K2-এর তুলনায় MMLU-Pro-তে +১.৭% এবং GPQA-Diamond-এ +২.১%।[2]

চূড়ান্ত তুলনামূলক মূল্যায়ন মেট্রিক্স ও পরিস্থিতির নির্বাচনের উপর নির্ভর করে; ফলাফলগুলি লেখকদের তথ্য অনুযায়ী প্রদান করা হয়েছে। প্রকাশের সময় benchmark-এর একটি অংশের স্বাধীন যাচাই সীমিত।[2][15]

প্রয়োগ

পাঠ্য সহকারী ও অনুসন্ধান

Kimi প্ল্যাটফর্ম দীর্ঘ দলিল প্রক্রিয়াকরণ (গবেষণা প্রতিবেদন, আর্থিক ডেটা), স্বয়ংক্রিয় বিশ্লেষণ এবং তথ্য একত্রীকরণ সহ অনলাইন অনুসন্ধানের সমর্থন সহ একটি সহকারী হিসেবে ব্যবহৃত হয়। Moonshot AI জানায় যে Kimi একটি এজেন্ট পরিস্থিতির মধ্যে ৩০০-এরও বেশি টুল কল (tool calls) সমর্থন করে।[7][4]

প্রোগ্রামিং ও প্রকৌশল কাজ

Kimi K2 ও K2.5 SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench এবং অন্যান্য প্রোগ্রামিং benchmark-এ উচ্চ ফলাফল প্রদর্শন করে। মডেলগুলি রিপোজিটরিতে ত্রুটি সংশোধনের স্বয়ংক্রিয়করণ, কোড জেনারেশন ও রিফ্যাক্টরিং, অনলাইন জাজের কাজ সমাধানে (OJBench, LiveCodeBench) ব্যবহৃত হয়। K2-এর কারিগরি প্রতিবেদন ইঙ্গিত করে যে মডেলটি ভার্সন কন্ট্রোল সিস্টেম, প্যাকেজ ম্যানেজার ও এক্সিকিউশন পরিবেশের সাথে মিথস্ক্রিয়া সহ বৃহৎ পরিসরের সিন্থেটিক এজেন্ট কর্পাসে প্রশিক্ষিত হয়েছিল।[1][2][14]

মাল্টিমোডাল অ্যাপ্লিকেশন

Kimi-VL ও K2.5 ছবি ও দলিলে ভিজ্যুয়াল প্রশ্নোত্তর (VQA); দলিল বোঝাপড়া (OCRBench, OmniDocBench); ভিডিও বিশ্লেষণ (VideoMMMU, LongVideoBench); ভিজ্যুয়াল স্পেসিফিকেশন অনুযায়ী প্রোগ্রামিংয়ের সমন্বিত কাজের (যেমন ছবির লেআউট অনুযায়ী ইন্টারফেস জেনারেশন) জন্য তৈরি। K2.5-এর জন্য "vision-grounded coding" ও "autonomous visual debugging" পরিস্থিতির বিবরণ দেওয়া হয়েছে, যেখানে মডেল ভিজ্যুয়াল বিবরণ অনুযায়ী কোড তৈরি করে এবং পুনরাবৃত্তিমূলকভাবে ভিজ্যুয়াল ফলাফল বিশ্লেষণ করে।[2][9][15]

API ও ডিপ্লয়মেন্ট

মডেলগুলি tool calling, thinking মোড, JSON মোড ও প্রসঙ্গ ক্যাশিং সমর্থন সহ Moonshot AI Open Platform-এর API-এর মাধ্যমে পাওয়া যায়। মুক্ত ওজনগুলি vLLM, SGLang ও TensorRT-LLM-এর মাধ্যমে স্থানীয় ডিপ্লয়মেন্টের জন্য ব্যবহৃত হয়। Mooncake সার্ভিস দীর্ঘ প্রসঙ্গের ইনফারেন্স স্কেলিং নিশ্চিত করে।[4][11][16]

সীমাবদ্ধতা ও উন্মুক্ত সমস্যা

রিসোর্সের প্রয়োজনীয়তা

১ ট্রিলিয়ন প্যারামিটার স্কেলের MoE মডেলগুলি, এমনকি ৩২ বিলিয়ন সক্রিয় প্যারামিটার এবং INT4 কোয়ান্টাইজেশন সহ, উল্লেখযোগ্য মেমরি এবং ব্যান্ডউইথের প্রয়োজন। Kimi K2.5 ডিপ্লয়মেন্টের প্রকৌশলীয় আলোচনায় সম্পূর্ণ মডেল লোড করার জন্য শত শত গিগাবাইট ভিডিও মেমরির অনুমান উল্লেখ করা হয়েছে; নির্দিষ্ট সংখ্যা কোয়ান্টাইজেশনের ধরন ও ফ্রেমওয়ার্কের (vLLM, SGLang ইত্যাদি) উপর নির্ভর করে।[2][17]

হ্যালুসিনেশন ও জেনারেশনের গুণমান

অন্যান্য LLM-এর মতো, Kimi সিরিজের মডেলগুলিও হ্যালুসিনেশনের প্রবণ। FACTS Grounding ও FaithJudge পরীক্ষার প্রতিবেদনে RAG পরিস্থিতিতে hallucination rate ১.১–৭.৪%-এর মধ্যে নথিভুক্ত করা হয়েছে। Non-thinking মোডে মডেলটি টুল স্পেসিফিকেশন অস্পষ্ট হলে অতিরিক্ত token তৈরি করতে পারে; জোরপূর্বক tool-use সক্রিয় করলে কিছু কাজে পারফরম্যান্স হ্রাস পায়।[1]

সিন্থেটিক ডেটা ও RL পাইপলাইনের উপর নির্ভরতা

এজেন্ট ডেটা সংশ্লেষণ ও Reinforcement Learning প্রশিক্ষণের পাইপলাইন বৃহৎ সংগ্রহের সিন্থেটিক টুল ও দৃশ্য এবং স্বয়ংক্রিয় মূল্যায়নের জন্য LLM মূল্যায়নকারীর (self-judging) উপর নির্ভর করে। এই পদ্ধতি কিছু উন্মুক্ত প্রশ্ন তৈরি করে: স্ব-মূল্যায়নের পক্ষপাত (bias)-এর প্রতি স্থিতিস্থাপকতা; বারবার পুনরাবৃত্তিতে সম্ভাব্য অবনতি (bootstrap); সিমুলেটেড থেকে ভিন্ন বাস্তব পরিবেশে এজেন্ট দক্ষতার স্থানান্তরযোগ্যতা; সিন্থেটিক কাজের বিতরণের সাধারণীকরণ ক্ষমতার উপর প্রভাব।[1][14]

স্বচ্ছতা ও পুনরুৎপাদনযোগ্যতা

প্রশিক্ষণ ডেটার গঠন, ফিল্টারিং প্রক্রিয়া, ভাষা ও ডোমেনের বিতরণ সম্পর্কিত কিছু তথ্য প্রকাশিত হয়নি বা সীমিতভাবে প্রকাশিত হয়েছে। এটি পক্ষপাতের উৎসের সঠিক মূল্যায়ন, প্রশিক্ষণের পুনরুৎপাদনযোগ্যতা এবং স্থিতিশীলতার উপর পৃথক উপাদানগুলির (MuonClip, QK-clip) প্রভাবের স্বাধীন যাচাইকে কঠিন করে তোলে। ফেব্রুয়ারি ২০২৬ পর্যন্ত মুক্ত সাহিত্যে তৃতীয় পক্ষ কর্তৃক Kimi K2 ও K2.5-এর প্রশিক্ষণের সম্পূর্ণ পুনরুৎপাদন নথিভুক্ত হয়নি।[1][2]

নৈতিক ও নিয়ন্ত্রক দিকসমূহ

মডেল কার্ড ও কারিগরি প্রতিবেদনে জোর দেওয়া হয়েছে যে ডেভেলপাররা মডেলের ইনপুট ও আউটপুটের জন্য দায়িত্বশীল; বাস্তবায়নের আগে সুরক্ষামূলক প্রক্রিয়া (guardrails) যোগ করা এবং নির্দিষ্ট পরিস্থিতির ডেটায় পরীক্ষা করা প্রয়োজন; মডেলটি ব্যক্তিগত ডেটা ধারণ করতে পারে এমন ছবি ও ভিডিও প্রক্রিয়া করতে পারে এবং ইন্টিগ্রেটরকে প্রাসঙ্গিক আইন মেনে চলতে হবে।[2][16]

কারিগরি প্রতিবেদনে Promptfoo ধরনের টুল ব্যবহার করে নিরাপত্তা মূল্যায়নের (জৈবিক, রাসায়নিক, সাইবার ঝুঁকি) বিবরণ দেওয়া হয়েছে। মডেলগুলি যাচাইযোগ্য পুরষ্কার ও স্ব-মূল্যায়ন সহ RL সারিবদ্ধতা (alignment) এর মধ্য দিয়ে যায়।[1]

একটি চীনা কোম্পানির পণ্য হিসেবে, মডেলগুলি AI-এর ক্ষেত্রে গণপ্রজাতন্ত্রী চীনের জাতীয় নিয়ন্ত্রণের অধীন। লেখার সময় Kimi মডেলগুলিকে বিশেষভাবে নিবেদিত পৃথক জনসাধারণের নিয়ন্ত্রক দলিল পাওয়া যায়নি; নিয়ন্ত্রণ সংশ্লিষ্ট এখতিয়ারে জেনারেটিভ মডেল ও AI-এর সাধারণ পদ্ধতির কাঠামোর মধ্যে পরিচালিত হয়।[18]

ফেব্রুয়ারি ২০২৬ সালে Anthropic কোম্পানি দাবি করে যে Moonshot AI (অন্যান্য চীনা ডেভেলপারদের সাথে) মডেল প্রশিক্ষণের জন্য ডেটা distillation-এর উদ্দেশ্যে Claude-এর সাথে মিথস্ক্রিয়া তৈরি করতে জাল অ্যাকাউন্ট ব্যবহার করেছে। তথ্যটি একটি পক্ষের দাবির চরিত্র বহন করে এবং প্রকাশের সময় স্বাধীন তদন্তে নিশ্চিত হয়নি; Moonshot AI কোনো আনুষ্ঠানিক প্রতিক্রিয়া প্রকাশ করেনি।[5]

প্রেক্ষাপট ও গবেষণার দিকনির্দেশনা

প্রকাশিত উপকরণ থেকে কয়েকটি আরও গবেষণার দিক চিহ্নিত করা যায়:

  • মাপযোগ্য এজেন্ট সিস্টেম। সিন্থেটিক টুলসেট, RL ও self-judging ব্যবহার করে এজেন্ট সিস্টেম হিসেবে LLM প্রশিক্ষণের পদ্ধতির উন্নয়ন। বৃহত্তর সংখ্যক সাব-এজেন্ট ও নতুন ধরনের কাজে Agent Swarm সম্প্রসারণ।[2][1]
  • দক্ষ MoE আর্কিটেকচার। ৩২ বিলিয়ন সক্রিয় সহ ১ ট্রিলিয়ন প্যারামিটার এবং ৩৮৪ বিশেষজ্ঞ ব্যবহার স্কেল ও দক্ষতার মধ্যে আপোসের একটি রূপ প্রতিনিধিত্ব করে; বিভিন্ন রাউটিং স্কিম সহ বিকল্পগুলি অনুসন্ধান করা হচ্ছে।[1]
  • নেটিভ মাল্টিমোডালিটি। প্রি-ট্রেনিংয়ের শুরু থেকে মিশ্রিত ভিজ্যুয়াল-পাঠ্য ডেটায় K2.5-এর প্রশিক্ষণ "নেটিভ" মাল্টিমোডালিটির একটি পদ্ধতির প্রতিনিধিত্ব করে, যা দুই-পর্যায়ের স্কিমের সাথে তুলনা করা হচ্ছে।[2][9]
  • দক্ষ ইনফারেন্স ও দীর্ঘ প্রসঙ্গ। INT4 কোয়ান্টাইজেশন ও ২,৫৬,০০০ token প্রসঙ্গ সমর্থন স্পার্স অ্যাটেনশন, লেটেন্ট উপস্থাপনা ও বাহ্যিক মেমরির ক্ষেত্রে আরও গবেষণাকে উৎসাহিত করছে। আলাদাভাবে Kimi Linear প্রকল্পের বিবরণ দেওয়া হয়েছে — হাইব্রিড লিনিয়ার অ্যাটেনশন যাতে ১ মিলিয়ন token প্রসঙ্গে KV-ক্যাশ ৭৫% হ্রাস এবং ডিকোডিং ৬ গুণ ত্বরান্বিত করা হয়েছে।[2][19]

Moonshot AI-এর আনুষ্ঠানিক উপকরণে Kimi-এর ভবিষ্যৎ সংস্করণ সম্পর্কে বিস্তারিত রোডম্যাপ প্রকাশিত হয় না; তালিকাভুক্ত দিকগুলি প্রকাশিত গবেষণার উপর ভিত্তি করে।

আরও দেখুন

  • Transformer আর্কিটেকচার
  • DeepSeek
  • Qwen

তথ্যসূত্র

সাহিত্য

টীকা

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692