Kimi (Moonshot AI) (UR)
Kimi (Moonshot AI ماڈلز کا سلسلہ) — بڑے لسانی ماڈلز (Large Language Model, LLM) کا ایک سلسلہ ہے جسے چینی کمپنی Moonshot AI (بیجنگ، چین) متنی اور ملٹی موڈل نسل، پروگرامنگ اور agentive systems (agentic systems — وہ نظام جو خودمختار منصوبہ بندی، استدلال اور بیرونی اوزاروں کے استعمال سے عمل کرنے کی صلاحیت رکھتے ہیں) کے لیے تیار کر رہی ہے۔ اس خاندان میں Mixture-of-Experts (MoE، ماہرین کا اشتراک) فن تعمیر کے ساتھ متنی اور ملٹی موڈل ماڈل شامل ہیں جن کا کل پیمانہ تقریباً 1 ٹریلین parameters اور ہر token پر تقریباً 32 ارب parameters فعال ہوتے ہیں۔[1][2] اس سلسلے کی اہم خصوصیت agentive رویے (بیرونی اوزاروں کی کالنگ کے ساتھ کثیر مرحلہ منصوبہ بندی) پر توجہ اور Kimi K2 اور Kimi K2.5 کے ورژنز میں 256,000 tokens تک کے لمبے context کی حمایت ہے۔[1][2]
Kimi سلسلے کے ماڈل Hugging Face پلیٹ فارم پر ترمیم شدہ MIT لائسنس کے تحت کھلے weights (open-weight) کے ساتھ اور Moonshot AI Open Platform کے ملکیتی API کے ذریعے بھی دستیاب ہیں۔[3][4]
تاریخ اور پس منظر
Moonshot AI کا قیام
Moonshot AI مارچ 2023 میں بیجنگ میں Yang Zhilin (CEO)، Zhou Xinyu اور Wu Yuxin نے قائم کی — یہ تینوں Tsinghua University کے فارغ التحصیل ہیں۔ Yang Zhilin اس سے پہلے Google Brain اور Meta میں کام کر چکے تھے اور computer vision اور استدلال کے شعبوں میں تحقیق میں حصہ لے چکے تھے۔ کمپنی کو Alibaba (فروری 2024 میں 1 ارب ڈالر کا راؤنڈ)، Tencent اور دیگر سرمایہ کاروں سے مالی اعانت ملی۔[5][6]
اہم اجراء کی تاریخ
- اکتوبر–نومبر 2023 — 128 ہزار tokens (200 ہزار چینی حروف تک) کے context کی حمایت کے ساتھ Kimi chatbot کا آغاز۔ ابتدائی ورژنز نے ملکیتی ماڈلز استعمال کیے جن کی تکنیکی تفصیلات محدود حد تک ظاہر کی گئی تھیں۔[6][7]
- مارچ 2024 — بیٹا ورژن میں context کو 20 لاکھ حروف تک بڑھانا۔[6]
- جنوری 2025 — Kimi k1.5 کا اجراء — ایک ملٹی موڈل ماڈل جس میں توسیع شدہ Reinforcement Learning (RL) تربیت ہے، جسے ریاضی، پروگرامنگ اور ملٹی موڈل استدلال کے کاموں میں OpenAI o1 سے ہم پلہ قرار دیا گیا ہے۔ 128 ہزار tokens تک کا context۔[8]
- اپریل 2025 — Kimi-VL متعارف کرائی گئی — ایک کھلا ملٹی موڈل MoE ماڈل (vision-language model, VLM) جس میں MoonViT بصری encoder (~400 ملین parameters) اور decoder میں ~2.8 ارب فعال parameters ہیں۔ تکنیکی رپورٹ arXiv پر شائع ہوئی۔[9]
- جولائی 2025 — Kimi K2 کا اجراء — 1 ٹریلین parameters اور 32 ارب فعال parameters کا بنیادی کھلا MoE ماڈل۔ تکنیکی رپورٹ arXiv پر شائع ہوئی۔[1] اجراء کے وقت ماڈل LMSYS Chatbot Arena پر کھلے ماڈلز میں پہلے نمبر پر تھا (3000 سے زیادہ ووٹس)۔[1]
- ستمبر 2025 — Kimi-K2-Instruct-0905 کی تجدید جس میں context کو 256 ہزار tokens تک بڑھایا گیا اور agentive کوڈنگ بہتر کی گئی۔[1]
- نومبر 2025 — Kimi K2 Thinking کا اجراء — بہتر مرحلہ وار استدلال (chain-of-thought) اور 200–300 متواتر tool calls کی حمایت کے ساتھ۔[10]
- جنوری 2026 — Kimi K2.5 متعارف کرائی گئی — ملٹی موڈل MoE ماڈل جس میں مقامی ملٹی موڈلٹی اور Agent Swarm میکانزم (ذیلی ایجنٹوں کی متوازی ترتیب) ہے۔[2]
ماڈلز کی ترقی کے ساتھ ساتھ 2024 میں اپنی inference سروس Mooncake بھی پیش کی گئی — لمبے context کے ساتھ LLM کی خدمت کے لیے ایک KVCache-مرکزی غیر مرکوز فن تعمیر۔[11]
نظریاتی بنیادیں اور فن تعمیر
Mixture-of-Experts فن تعمیر
Kimi K2 اور K2.5 سلسلے کے ماڈل مخصوص تہوں میں Mixture-of-Experts کے ساتھ Transformer فن تعمیر نافذ کرتے ہیں۔ transformer کا معیاری بلاک residual connections کے ساتھ کثیر سربلند خود توجہ (Multi-Head Attention, MHA) اور position-wise MLP (کثیر تہہ perceptron) کی تہوں کا مجموعہ ہے:[1][12]
جہاں — ان پٹ token نمائندگی، — تسلسل کی لمبائی، — پوشیدہ حالت کا حجم۔
MoE تہہ میں ایک MLP کی بجائے ماہرین کا مجموعہ استعمال ہوتا ہے، جن میں سے ہر ایک الگ parameters کے ساتھ علیحدہ MLP ہے۔ router (gating network) ہر token کے لیے ماہرین کا ذیلی مجموعہ منتخب کرتا ہے۔ نمائندگی کے ساتھ token کے لیے MoE تہہ کی آؤٹ پٹ یوں بیان کی جاتی ہے:[1]
جہاں — دیے گئے token کے لیے منتخب ماہرین کا مجموعہ، — router کے معیاری وزن، ۔ routing فنکشن TopK آپریشن کے ذریعے ماہرین کا انتخاب کرتا ہے:[1]
جہاں — router کا قابلِ تربیت میٹرکس۔ یہ اسکیم ہر token پر فعال ہونے والے parameters کی محدود تعداد کے ساتھ parameters کی کل تعداد کو بڑھانے کی اجازت دیتی ہے۔
Kimi K2 / K2.5 کے معماری hyper-parameters
| پیرامیٹر | قدر |
|---|---|
| فن تعمیر کی قسم | Mixture-of-Experts کے ساتھ Transformer |
| parameters کی کل تعداد | 1.04 ٹریلین |
| ہر token پر فعال parameters | 32 ارب |
| تہوں کی تعداد | 61 (1 گھنا + 60 MoE) |
| پوشیدہ حالت کا حجم | 7168 |
| توجہ کے سروں کی تعداد | 64 |
| ماہرین کی تعداد | 384 (ہر token پر 8 منتخب + 1 مشترک) |
| ماہر کی پوشیدہ حالت کا حجم (MoE hidden size) | 2048 |
| vocabulary کا حجم | 160,000 tokens |
| activation فنکشن | SwiGLU |
| توجہ کا میکانزم | Multi-head Latent Attention (MLA) |
| زیادہ سے زیادہ context | 256,000 tokens (YaRN کے ذریعے توسیع) |
| بصری encoder (K2.5) | MoonViT-3D، ~400 ملین parameters |
تنکگی (ماہرین کی کل تعداد اور فعال تعداد کا تناسب) 48:1 ہے (384 ماہر، 8 فعال)، جو ایک ہی پیمانے کے گھنے (dense) ماڈل کے مقابلے میں حسابی اخراجات میں نمایاں کمی فراہم کرتا ہے۔[1]
Multi-head Latent Attention (MLA) میکانزم
Kimi K2/K2.5 سلسلے کے ماڈلز میں Multi-head Latent Attention (MLA) میکانزم استعمال کیا گیا ہے — یہ معیاری کثیر سربلند توجہ کی ایک ترمیم ہے جو کارکردگی اور توسیع پذیری کو بہتر بنانے کے لیے ڈیزائن کی گئی ہے۔ ایک تہہ کے لیے معیاری توجہ یوں حساب لگائی جاتی ہے:[12]
جہاں — queries، keys اور values کی میٹریسز۔ MLA میں latent نمائندگی متعارف کرائی جاتی ہے جن پر queries اور keys کو project کیا جاتا ہے، جو درمیانی آپریشنز کی dimensionality کم کرتا ہے اور KV-cache کا حجم گھٹانے کی اجازت دیتا ہے۔ یہ طریقہ DeepSeek-V3 میں استعمال ہونے والے میکانزم سے مشابہ ہے۔[1][13]
MuonClip optimizer اور QK-clip
Kimi K2 ماڈل کی تربیت کے لیے MuonClip optimizer پیش کیا گیا — یہ Muon optimizer (Newton-Schulz normalization کے ساتھ momentum optimizer) کی ترمیم ہے جس میں MoE فن تعمیر کے ساتھ بڑے لسانی ماڈلز کی تربیت کو مستحکم کرنے کے لیے QK-clip تکنیک شامل کی گئی ہے۔[1]
QK-clip توجہ کے logits پر clipping آپریشن کے ذریعے پابندیاں لگاتا ہے۔ ہر توجہ کے سر کے لیے زیادہ سے زیادہ logit متعین کیا جاتا ہے:
اور اسکیلنگ coefficient حساب کیا جاتا ہے:
جہاں — threshold hyper-parameter، — توجہ کے سر کا حجم۔ coefficient کو weights کو scale کرنے کے لیے استعمال کیا جاتا ہے اگر زیادہ سے زیادہ logit threshold سے تجاوز کرے۔ یہ softmax سے پہلے logits کی اقدار کی حد کو محدود کرتا ہے اور بڑے پیمانے پر تربیت کے دوران loss spikes کے خطرے کو کم کرتا ہے۔[1]
مصنفین کے مطابق، MuonClip کے ساتھ 15.5 ٹریلین tokens پر Kimi K2 کی پری ٹریننگ کے دوران کوئی بھی loss spike ریکارڈ نہیں ہوا (zero loss spikes)۔[1]
ملٹی موڈلٹی اور MoonViT
Kimi K2.5 اور Kimi-VL ماڈلز بصری encoder MoonViT (K2.5 ورژن میں — MoonViT-3D) استعمال کرتے ہیں جس میں تقریباً 400 ملین parameters ہیں، جو SigLIP-SO-400M پر NaViT-packing (متغیر ریزولیوشن ان پٹ تصاویر کی حمایت) اور ویڈیو پروسیسنگ کے لیے 3D توسیع (4 frames کی گروپ بندی) کے ساتھ بنایا گیا ہے۔[2][9]
بصری encoder ان پٹ تصاویر اور ویڈیو کو بصری tokens کی تسلسل میں تبدیل کرتا ہے۔ فرض کریں — ان پٹ تصویر، — بصری encoder:
پھر خطی projection (دو تہہ MLP) کے ذریعے:
جہاں — ماڈل کے لسانی حصے کی پوشیدہ فضا کا حجم۔ ملٹی موڈل حالت میں کو متنی tokens کے ساتھ concatenate کیا جاتا ہے اور transformer میں بھیجا جاتا ہے۔[9][2]
دو مرحلہ اسکیموں (متنی ماڈل کے اوپر بصری adapter شامل کرنا) کے برعکس، K2.5 کو پری ٹریننگ کے آغاز سے ہی ملے جلے بصری-متنی ڈیٹا پر تربیت دی گئی (joint text-vision pre-training)، ابتدائی مراحل میں بصری tokens کی کم شرح (~10%) کے ساتھ اور بتدریج اضافے کے ساتھ۔ مجموعی حجم — تقریباً 15 ٹریلین ملے جلے بصری-متنی tokens۔[2]
پری ٹریننگ اور پوسٹ ٹریننگ
پری ٹریننگ
Kimi K2 کو MuonClip optimizer کے ساتھ 15.5 ٹریلین tokens (ویب متون، کوڈ، ریاضی، انسائیکلوپیڈیک علم) پر پری ٹرین کیا گیا۔ پوری پری ٹریننگ کے دوران کوئی بھی loss spike (نقصان میں اچانک اضافہ) ریکارڈ نہیں ہوا۔[1]
Kimi K2.5 نے K2 checkpoint سے اضافی ~15 ٹریلین ملے جلے بصری-متنی tokens پر joint modality optimization (joint pre-training) کے ساتھ مسلسل پری ٹریننگ (continual pre-training) مکمل کی۔ علیحدہ طور پر بصری encoder کی 1 ٹریلین tokens standalone تربیت اور context کو بڑھانے کے لیے اضافی long-context mid-training مرحلہ بھی کیا گیا۔[2]
پوسٹ ٹریننگ
K2 سلسلے کے ماڈلز کی پوسٹ ٹریننگ میں کئی مراحل شامل ہیں:[1][2]
Supervised Fine-Tuning (SFT، زیر نگرانی باریک ہم آہنگی):
- مصنوعی agentive trajectories (agentic data synthesis) — tool specifications کی نسل، ماحول کے ساتھ تعاملات کی ماڈلنگ، نتائج کی تصدیق۔
- K2.5 کے لیے اضافی طور پر zero-vision SFT استعمال کیا گیا — متنی SFT جو fine-tuning کے مرحلے میں تصاویر کے براہ راست استعمال کے بغیر بصری صلاحیتوں کو فعال کرتا ہے۔
Reinforcement Learning (RL، تقویتی تربیت):
- ریاضی، کوڈ اور حفاظت کے کاموں کے لیے قابل تصدیق انعامات (Reinforcement Learning with Verifiable Rewards, RLVR) کا مجموعہ۔
- Rubrics کے ذریعے خود جائزہ (self-critique rubric rewards) — agentive منظرناموں کی معیار کی خودکار جانچ کے لیے LLM جائزہ کاروں کا استعمال۔
- K2.5 کے لیے — مشترک ملٹی موڈل RL (joint multimodal RL)۔
Quantization-Aware Training (QAT):
- Kimi K2 Thinking اور K2.5 مقامی INT4 weight quantization (weight-only quantization، گروپ 32، compressed tensors) کی حمایت کرتے ہیں جو NVIDIA Hopper فن تعمیر کے لیے بہتر بنائی گئی ہے، جس سے inference کے دوران میموری کی ضرورت کم ہوتی ہے۔[10][2]
Agent Swarm (K2.5)
K2.5 ماڈل کے لیے Agent Swarm میکانزم تیار کیا گیا — خود انتظامی متوازی ایجنٹ ترتیب کا فریم ورک۔ orchestrator ماڈل متحرک طور پر ذیلی ایجنٹ بناتا ہے (create_subagent، assign_task آپریشنز کے ذریعے)، ذیلی کاموں کو تقسیم کرتا ہے اور نتائج جمع کرتا ہے۔ ہر ذیلی ایجنٹ آزادانہ طور پر اوزار استعمال کر سکتا ہے اور دوسرے ذیلی ایجنٹوں کے ساتھ متوازی کام کر سکتا ہے۔[2]
Agent Swarm میکانزم کی تربیت Parallel-Agent Reinforcement Learning (PARL) کے ذریعے نافذ کی گئی جس میں execution اور optimization کو الگ کیا گیا (decoupling execution/optimization)۔ مصنفین کے مطابق، Agent Swarm واحد ایجنٹ حالت (single-agent) کے مقابلے میں latency میں 4.5 گنا تک کمی فراہم کرتا ہے۔[2]
سلسلے کے اہم ماڈلز
| ماڈل | قسم | Parameters (کل / فعال) | Context، tokens | ملٹی موڈلٹی | اجراء کی تاریخ |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM، RL-scaling | ظاہر نہیں | 128,000 | ہاں (محدود) | جنوری 2025 |
| Kimi-VL | VLM، MoE | کمپیکٹ / ~2.8 ارب فعال + 400 ملین ViT | لمبا context | ہاں (تصاویر) | اپریل 2025 |
| Kimi K2 | LLM، MoE | 1.04 ٹریلین / 32 ارب | 256,000 | نہیں (متن) | جولائی 2025 |
| Kimi K2 Thinking | LLM، MoE | 1.04 ٹریلین / 32 ارب | 256,000 | نہیں (متن) | نومبر 2025 |
| Kimi K2.5 | VLM-LLM، MoE | 1.04 ٹریلین / 32 ارب | 256,000 | ہاں (تصاویر، ویڈیو، PDF) | جنوری 2026 |
Kimi K2
Kimi K2 ایک Mixture-of-Experts LLM ہے جس میں 1.04 ٹریلین کل parameters اور ہر token پر 32 ارب فعال parameters ہیں۔ MuonClip optimizer کے ساتھ 15.5 ٹریلین tokens پر پری ٹرین کیا گیا۔ فن تعمیر میں 384 ماہر اور لمبے context سے ہم آہنگ MLA میکانزم شامل ہے۔ ماڈل پروگرامنگ، ریاضی استدلال اور tool calls کے متواتر استعمال کے ساتھ agentive منظرناموں کے کاموں کے لیے توجہ مرکوز کرتا ہے۔[1]
تکنیکی رپورٹ میں پوسٹ ٹریننگ کا کثیر مرحلہ pipeline بیان کیا گیا ہے: اوزاروں کے ساتھ تعاملات کی ماڈلنگ کے ذریعے agentive ڈیٹا کی وسیع مصنوعی نسل؛ حقیقی اور مصنوعی کاموں کے ملے جلے ماحول میں Reinforcement Learning؛ خودکار معیار جانچ کے لیے LLM جائزہ کاروں کا استعمال۔[1][14]
Kimi K2 Thinking
Kimi K2 Thinking کا ورژن کثیر مرحلہ استدلال (chain-of-thought) کے لیے بہتر بنایا گیا ہے جس میں اوزاروں کی متحرک کالنگ اور 256,000 tokens تک کے context کی حمایت ہے۔ ماڈل ایک علیحدہ Thinking حالت نافذ کرتا ہے جس میں واضح طور پر واپس آنے والا reasoning_content فیلڈ ہوتا ہے جس میں اندرونی استدلال ہوتا ہے۔ K2 Thinking رویے میں نمایاں خرابی کے بغیر ایک agentive episode میں 200–300 متواتر tool calls کی حمایت کرتا ہے، نیز QAT کے ساتھ مقامی INT4 quantization کی بھی حمایت کرتا ہے۔[10]
Kimi-VL
Kimi-VL ایک کھلا ملٹی موڈل MoE-VLM (vision-language model) ہے جو بصری سمجھ، بصری-متنی استدلال اور حقیقی منظرناموں کے کاموں کے لیے توجہ مرکوز کرتا ہے۔ ماڈل کو MoonViT بصری encoder کے ساتھ کمپیکٹ MoE فن تعمیر کے طور پر بیان کیا گیا ہے۔ تکنیکی رپورٹ اپریل 2025 میں arXiv پر شائع ہوئی۔[9]
Kimi K2.5
Kimi K2.5 ایک ملٹی موڈل MoE ماڈل ہے جس میں 1.04 ٹریلین parameters اور 32 ارب فعال parameters ہیں، جو Kimi-K2-Base checkpoint پر مبنی ہے اور ~15 ٹریلین ملے جلے بصری-متنی tokens پر جاری پری ٹریننگ کے ساتھ ہے۔ ماڈل 256,000 tokens تک کے context کے ساتھ تصاویر، ویڈیو، PDF اور متن کے ان پٹ کی حمایت کرتا ہے۔[2]
K2.5 دو بنیادی inference حالتوں کی حمایت کرتا ہے:
- Thinking mode — واضح
reasoning_contentاور کثیر مرحلہ نسل کے ساتھ؛ - Instant mode — استدلال کی آؤٹ پٹ کے بغیر، کم latency کے ساتھ۔[2][13]
ماڈل NVIDIA Hopper فن تعمیر کے لیے بہتر بنائی گئی مقامی INT4 weight quantization (weight-only، گروپ 32) نافذ کرتا ہے۔[2]
اہم نتائج اور benchmarks
Kimi K2 کے متنی اور agentive benchmarks
نتائج تکنیکی رپورٹ کے ڈیٹا کے مطابق Kimi-K2-Instruct کے non-thinking حالت (بغیر توسیعی chain-of-thought کے) میں دیے گئے ہیں۔[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | ماخذ |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65.8% | 38.8% | 72.5% / 72.7% | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47.3% | 20.9% | 51.0% | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53.7% | 44.7% | 46.9% | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66.1% | 48.8% | 66.1% | arXiv:2507.20534 |
| ACEBench (En) | 76.5% | 75.6% | 80.1% | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49.5% | 33.9% | 46.7% | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75.1% | 68.2% | 74.9% | arXiv:2507.20534 |
مصنفین کے بیان کے مطابق، یہ نتائج K2 کو رپورٹ کی اشاعت کے وقت thinking توسیع کے بغیر حالت میں کھلے ماڈلز کے رہنماؤں میں، خاص طور پر انجینیرنگ اور agentive کاموں پر، شامل کرتے ہیں۔[1]
Kimi-VL کے benchmarks
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | ماخذ |
|---|---|---|---|---|
| MMVet (درستگی) | 66.7% | 67.1% | 66.9% | arXiv:2504.07491 |
| RealWorldQA | 68.1% | 68.5% | — | arXiv:2504.07491 |
نتائج ظاہر کرتے ہیں کہ کمپیکٹ ملٹی موڈل MoE فن تعمیر کم فعال parameters کے ساتھ بڑے ماڈلز سے ہم پلہ سطح حاصل کرتا ہے۔[9]
Kimi K2.5 کے benchmarks
نتائج Thinking حالت میں NVIDIA NIM پلیٹ فارم پر ماڈل کارڈ اور تکنیکی رپورٹ کے ڈیٹا کے مطابق دیے گئے ہیں (temperature = 1.0؛ top-p = 0.95؛ context 256,000 tokens؛ vLLM engine؛ NVIDIA H200 hardware platform)۔[2][13]
| زمرہ | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (اوزاروں کے بغیر) | 30.1 |
| HLE-Full (اوزاروں کے ساتھ) | 50.2 | |
| AIME 2025 | 96.1 | |
| HMMT 2025 (Feb) | 95.4 | |
| GPQA-Diamond | 87.6 | |
| MMLU-Pro | 87.1 | |
| Vision & Video | MMMU-Pro | 78.5 |
| MathVision | 84.2 | |
| MathVista (mini) | 90.1 | |
| OCRBench | 92.3 | |
| OmniDocBench 1.5 | 88.8 | |
| VideoMMMU | 86.6 | |
| LongVideoBench | 79.8 | |
| Coding | SWE-Bench Verified | 76.8 |
| SWE-Bench Pro | 50.7 | |
| SWE-Bench Multilingual | 73.0 | |
| Terminal Bench 2.0 | 50.8 | |
| PaperBench | 63.5 | |
| LiveCodeBench v6 | 85.0 | |
| OJBench (C++) | 57.4 | |
| Long Context | Longbench v2 | 61.0 |
| AA-LCR | 70.0 | |
| Agentic Search | BrowseComp | 60.6 |
| BrowseComp (Agent Swarm) | 78.4 | |
| WideSearch (iter-F1) | 72.7 | |
| DeepSearchQA | 77.1 |
اضافی طور پر K2.5 بصری تربیت کا متنی کاموں پر مثبت transfer ظاہر کرتا ہے: متنی بنیادی ماڈل K2 کے مقابلے میں MMLU-Pro پر +1.7% اور GPQA-Diamond پر +2.1%۔[2]
حتمی تقابلی جائزہ metrics اور منظرناموں کے انتخاب پر منحصر ہے؛ نتائج مصنفین کے ڈیٹا کے مطابق دیے گئے ہیں۔ اشاعت کے وقت benchmarks کے ایک حصے کی آزادانہ تصدیق محدود ہے۔[2][15]
استعمال
متنی معاون اور تلاش
Kimi پلیٹ فارم ایک ایسے معاون کے طور پر استعمال ہوتا ہے جو طویل دستاویزات (تحقیقی رپورٹیں، مالیاتی ڈیٹا) کی پروسیسنگ، خودکار تجزیے اور معلومات کو یکجا کرنے کے ساتھ آن لائن تلاش کی حمایت کرتا ہے۔ Moonshot AI بتاتی ہے کہ Kimi ایک agentive منظرنامے کے اندر 300 سے زیادہ tool calls کی حمایت کرتا ہے۔[7][4]
پروگرامنگ اور انجینیرنگ کے کام
Kimi K2 اور K2.5 SWE-Bench Verified، SWE-Bench Multilingual، LiveCodeBench اور پروگرامنگ کے دیگر benchmarks پر اعلیٰ نتائج ظاہر کرتے ہیں۔ ماڈلز repositories میں خرابیوں کی خودکار اصلاح، کوڈ کی نسل اور refactoring، آن لائن judges کے مسائل حل کرنے (OJBench، LiveCodeBench) کے لیے استعمال ہوتے ہیں۔ K2 کی تکنیکی رپورٹ بتاتی ہے کہ ماڈل کو ورژن کنٹرول سسٹمز، package managers اور execution environments کے ساتھ تعاملات سمیت وسیع پیمانے پر مصنوعی agentive corpus پر تربیت دی گئی۔[1][2][14]
ملٹی موڈل استعمال
Kimi-VL اور K2.5 تصاویر اور دستاویزات پر بصری سوال-جواب (VQA) کے لیے؛ دستاویز سمجھ (OCRBench، OmniDocBench) کے لیے؛ ویڈیو تجزیے (VideoMMMU، LongVideoBench) کے لیے؛ بصری وضاحتوں کے مطابق پروگرامنگ کے ملے جلے کاموں (مثلاً تصویری ڈیزائن کے مطابق interface کی نسل) کے لیے ڈیزائن کیے گئے ہیں۔ K2.5 کے لیے vision-grounded coding اور autonomous visual debugging کے منظرنامے بیان کیے گئے ہیں جہاں ماڈل بصری تفصیل کے مطابق کوڈ بناتا ہے اور بصری نتیجے کا تکراری تجزیہ کرتا ہے۔[2][9][15]
API اور deployment
ماڈلز Moonshot AI Open Platform کے API کے ذریعے tool calling، thinking-mode، JSON-mode اور context caching کی حمایت کے ساتھ دستیاب ہیں۔ کھلے weights vLLM، SGLang اور TensorRT-LLM کے ذریعے مقامی deployment کے لیے استعمال ہوتے ہیں۔ Mooncake سروس لمبے context کے لیے inference کی توسیع فراہم کرتی ہے۔[4][11][16]
حدود اور کھلے مسائل
وسائل کی ضروریات
1 ٹریلین parameters کے پیمانے کے MoE ماڈلز، یہاں تک کہ 32 ارب فعال parameters اور INT4 quantization کے ساتھ بھی، میموری اور bandwidth کے لحاظ سے نمایاں وسائل کی ضرورت ہوتی ہے۔ Kimi K2.5 کی deployment پر انجینیرنگ بحثوں میں ماڈل کو مکمل طور پر لوڈ کرنے کے لیے سینکڑوں گیگابائٹ video memory کی ضرورت کا ذکر ہے؛ مخصوص اعداد quantization کی شکل اور framework (vLLM، SGLang وغیرہ) پر منحصر ہیں۔[2][17]
hallucinations اور نسل کا معیار
دوسرے LLM کی طرح Kimi سلسلے کے ماڈلز بھی hallucinations کا شکار ہوتے ہیں۔ FACTS Grounding اور FaithJudge ٹیسٹوں کی رپورٹوں میں RAG منظرناموں میں hallucination rate 1.1–7.4% کی حد میں ریکارڈ کی گئی۔ non-thinking حالت میں ماڈل tool specifications غیر واضح ہونے پر اضافی tokens پیدا کر سکتا ہے؛ tool-use کو زبردستی فعال کرنے پر کچھ کاموں میں کارکردگی گرتی ہے۔[1]
مصنوعی ڈیٹا اور RL pipeline پر انحصار
agentive ڈیٹا کی نسل اور Reinforcement Learning کا pipeline مصنوعی اوزاروں اور منظرناموں کے بڑے مجموعے اور خودکار جانچ (self-judging) کے لیے LLM جائزہ کاروں پر انحصار کرتا ہے۔ ایسی اسکیم کئی کھلے سوالات کو جنم دیتی ہے: خود جائزہ کے تعصب (bias) کے خلاف استحکام؛ بار بار تکرار (bootstrap) پر ممکنہ خرابی؛ agentive مہارتوں کا حقیقی ماحولوں میں منتقلی جو simulated سے مختلف ہیں؛ مصنوعی کاموں کی تقسیم کا عمومی کرنے کی صلاحیت پر اثر۔[1][14]
شفافیت اور دہرانے کی صلاحیت
تربیتی ڈیٹا کی ساخت، filtering کے عمل، زبانوں اور domains کی تقسیم کے بارے میں کچھ معلومات ظاہر نہیں کی گئیں یا محدود طور پر ظاہر کی گئیں۔ اس سے تعصب کے ذرائع کا درست اندازہ، تربیت کو دہرانا اور انفرادی اجزاء (MuonClip، QK-clip) کے استحکام پر اثر کی آزادانہ تصدیق مشکل ہوتی ہے۔ فروری 2026 کی صورت حال کے مطابق Kimi K2 اور K2.5 کی تربیت کا مکمل دہرانا تیسرے فریقوں کی طرف سے کھلے ادبیات میں ریکارڈ نہیں ہوا۔[1][2]
اخلاقی اور ریگولیٹری پہلو
ماڈل کارڈز اور تکنیکی رپورٹوں میں زور دیا گیا ہے کہ developers ماڈل کے inputs اور outputs کی ذمہ داری برداشت کرتے ہیں؛ حفاظتی میکانزم (guardrails) شامل کرنا اور مخصوص معاملے کے ڈیٹا پر تجربہ کرنا نافذ کرنے سے پہلے ضروری ہے؛ ماڈل ایسی تصاویر اور ویڈیو پروسیس کر سکتا ہے جن میں ذاتی ڈیٹا ہو سکتا ہے، اور integrator کو متعلقہ قانون سازی کی پابندی کرنی ہوگی۔[2][16]
تکنیکی رپورٹوں میں Promptfoo جیسے اوزاروں کا استعمال کرتے ہوئے حفاظتی جائزوں (حیاتیاتی، کیمیائی، سائبر خطرات) کا بیان ہے۔ ماڈلز قابل تصدیق انعامات اور خود جائزہ کے ساتھ RL alignment سے گزرتے ہیں۔[1]
ایک چینی کمپنی کی مصنوع کے طور پر ماڈلز چین کی قومی AI ریگولیشن کے تابع ہیں۔ تحریر کے وقت صرف Kimi ماڈلز سے متعلق کوئی علیحدہ عوامی ریگولیٹری دستاویز نہیں ملی؛ ریگولیشن متعلقہ قانونی دائرے میں generative ماڈلز اور AI کے عمومی طریقوں کے فریم ورک میں ہوتی ہے۔[18]
فروری 2026 میں Anthropic نے بیان دیا کہ Moonshot AI نے (دیگر چینی developers کے ساتھ) تربیتی ماڈلز کے لیے ڈیٹا distillation کی غرض سے Claude کے ساتھ تعاملات پیدا کرنے کے لیے جعلی اکاؤنٹس استعمال کیے۔ معلومات ایک فریق کے دعوے کی نوعیت رکھتی ہے اور اشاعت کے وقت آزادانہ تحقیقات سے اس کی تصدیق نہیں ہوئی؛ Moonshot AI نے کوئی سرکاری جواب شائع نہیں کیا۔[5]
امکانات اور تحقیق کی سمتیں
شائع شدہ مواد کی بنیاد پر مزید تحقیق کی کئی سمتیں نمایاں ہوتی ہیں:
- قابل توسیع agentive نظام۔ مصنوعی اوزار، RL اور self-judging کے استعمال سے LLM کو agentive نظام کے طور پر تربیت دینے کے طریقوں کی ترقی۔ Agent Swarm کو ذیلی ایجنٹوں کی بڑی تعداد اور کاموں کی نئی اقسام تک وسعت دینا۔[2][1]
- موثر MoE فن تعمیر۔ 32 ارب فعال اور 384 ماہرین کے ساتھ 1 ٹریلین parameters کا استعمال پیمانے اور کارکردگی کے درمیان ایک سمجھوتے کی نمائندگی کرتا ہے؛ مختلف routing اسکیموں کے ساتھ متبادل زیر تحقیق ہیں۔[1]
- مقامی ملٹی موڈلٹی۔ پری ٹریننگ کے آغاز سے ملے جلے بصری-متنی ڈیٹا پر K2.5 کی تربیت مقامی ملٹی موڈلٹی کا طریقہ پیش کرتی ہے، جس کا دو مرحلہ اسکیموں سے موازنہ کیا جاتا ہے۔[2][9]
- موثر inference اور لمبا context۔ INT4 quantization اور 256,000 tokens کے context کی حمایت sparse-attention، latent نمائندگیوں اور بیرونی میموری کے شعبے میں مزید تحقیق کی ترغیب دیتی ہے۔ علیحدہ طور پر Kimi Linear منصوبہ بیان کیا گیا ہے — hybrid linear attention جس میں 1 ملین tokens کے context پر KV-cache میں 75% کمی اور decoding میں 6 گنا تیزی ہے۔[2][19]
Moonshot AI کے سرکاری مواد میں Kimi کے مستقبل کے ورژنز کے لیے تفصیلی roadmaps شائع نہیں کی جاتیں؛ درج کردہ سمتیں شائع شدہ تحقیقات پر مبنی ہیں۔
یہ بھی دیکھیں
- Transformer فن تعمیر
- DeepSeek
- Qwen
حوالہ جات
- https://www.moonshot.ai/ — Moonshot AI کی سرکاری ویب سائٹ
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — Kimi K2.5 کا GitHub repository
- https://huggingface.co/moonshotai — Hugging Face پر Moonshot AI کا پروفائل
ادبیات
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
حواشی
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692