Kimi (Moonshot AI) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (سری مدل‌های Moonshot AI) — مجموعه‌ای از مدل‌های زبانی بزرگ (Large Language Model, LLM) است که توسط شرکت چینی Moonshot AI (پکن، جمهوری خلق چین) برای وظایف تولید متن و مولتی‌مودال، برنامه‌نویسی و سیستم‌های عاملی (agentic systems — سیستم‌هایی که قادر به برنامه‌ریزی خودمختار، استدلال و عمل با استفاده از ابزارهای خارجی هستند) توسعه می‌یابد. این خانواده شامل مدل‌های متنی و مولتی‌مودال با معماری Mixture-of-Experts (MoE، ترکیب متخصصان) در مقیاس حدود ۱ تریلیون پارامتر و زیرمجموعه‌ای فعال‌شونده در حدود ۳۲ میلیارد پارامتر به ازای هر token است.[1][2] ویژگی مهم این سری، تمرکز بر رفتار عاملی (برنامه‌ریزی چندمرحله‌ای با فراخوانی ابزارهای خارجی) و پشتیبانی از context طولانی تا ۲۵۶٬۰۰۰ token در نسخه‌های Kimi K2 و Kimi K2.5 است.[1][2]

مدل‌های سری Kimi هم با وزن‌های باز (open-weight) در بستر Hugging Face تحت مجوز اصلاح‌شده MIT و هم از طریق API اختصاصی پلتفرم Moonshot AI Open Platform توزیع می‌شوند.[3][4]

تاریخچه و پیش‌زمینه

تأسیس Moonshot AI

Moonshot AI در مارس ۲۰۲۳ در پکن توسط یانگ ژی‌لین (Yang Zhilin، مدیرعامل)، ژوو شین‌یو (Zhou Xinyu) و وو یوشین (Wu Yuxin) — فارغ‌التحصیلان دانشگاه Tsinghua — تأسیس شد. یانگ ژی‌لین پیش از این در Google Brain و Meta فعالیت کرده و در پژوهش‌های حوزه بینایی کامپیوتری و استدلال مشارکت داشته است. شرکت از Alibaba (دور تأمین مالی به ارزش ۱ میلیارد دلار، فوریه ۲۰۲۴)، Tencent و سایر سرمایه‌گذاران تأمین مالی دریافت کرده است.[5][6]

جدول زمانی انتشارهای کلیدی

  • اکتبر–نوامبر ۲۰۲۳ — راه‌اندازی chatbot Kimi با پشتیبانی از context تا ۱۲۸ هزار token (تا ۲۰۰ هزار کاراکتر چینی). نسخه‌های اولیه از مدل‌های اختصاصی با جزئیات فنی محدود استفاده می‌کردند.[6][7]
  • مارس ۲۰۲۴ — گسترش context تا ۲ میلیون کاراکتر در نسخه بتا.[6]
  • ژانویه ۲۰۲۵ — انتشار Kimi k1.5 — مدل مولتی‌مودال با Reinforcement Learning مقیاس‌شده، که عملکردی برابر با OpenAI o1 در وظایف ریاضیات، برنامه‌نویسی و استدلال مولتی‌مودال ادعا شده است. Context تا ۱۲۸ هزار token.[8]
  • آوریل ۲۰۲۵ — معرفی Kimi-VL — مدل مولتی‌مودال باز MoE (vision-language model, VLM) با encoder بصری MoonViT (~۴۰۰ میلیون پارامتر) و ~۲٫۸ میلیارد پارامتر فعال در decoder. گزارش فنی در arXiv منتشر شد.[9]
  • جولای ۲۰۲۵ — انتشار Kimi K2 — مدل اصلی باز MoE با ۱ تریلیون پارامتر و ۳۲ میلیارد پارامتر فعال. گزارش فنی در arXiv منتشر شد.[1] مدل در زمان انتشار در رتبه اول بین مدل‌های باز در LMSYS Chatbot Arena قرار داشت (بیش از ۳۰۰۰ رأی).[1]
  • سپتامبر ۲۰۲۵ — به‌روزرسانی Kimi-K2-Instruct-0905 با context گسترش‌یافته تا ۲۵۶ هزار token و بهبود برنامه‌نویسی عاملی.[1]
  • نوامبر ۲۰۲۵ — انتشار Kimi K2 Thinking — نسخه‌ای با استدلال گام‌به‌گام تقویت‌شده (chain-of-thought) و پشتیبانی از ۲۰۰–۳۰۰ فراخوانی متوالی ابزار (tool calls).[10]
  • ژانویه ۲۰۲۶ — معرفی Kimi K2.5 — مدل مولتی‌مودال MoE با مولتی‌مودالیتی بومی و مکانیزم Agent Swarm (هماهنگ‌سازی موازی زیر-عوامل).[2]

موازی با توسعه مدل‌ها، در سال ۲۰۲۴ سرویس inference اختصاصی Mooncake معرفی شد — معماری KVCache-محور غیرمتمرکز برای ارائه LLM با context طولانی.[11]

مبانی نظری و معماری

معماری Mixture-of-Experts

مدل‌های سری Kimi K2 و K2.5 معماری Transformer با Mixture-of-Experts را در لایه‌های جداگانه پیاده‌سازی می‌کنند. بلوک استاندارد transformer ترکیبی از لایه‌های توجه چندسری (Multi-Head Attention, MHA) و MLP (پرسپترون چندلایه) موقعیت‌محور با اتصالات پسماند است:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

که در آن 𝐇L×d — بازنمایی‌های token ورودی، L — طول دنباله، d — اندازه حالت پنهان است.

در لایه MoE به جای یک MLP، مجموعه‌ای از متخصصان {Ei}i=1N استفاده می‌شود که هرکدام یک MLP مستقل با پارامترهای θi هستند. شبکه مسیریاب (gating network) برای هر token زیرمجموعه‌ای از متخصصان را انتخاب می‌کند. خروجی لایه MoE برای token با بازنمایی 𝐡 به صورت زیر تعریف می‌شود:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

که در آن 𝒮(𝐡){1,,N} — مجموعه متخصصان انتخاب‌شده برای token مربوطه، gi(𝐡) — وزن‌های نرمال‌شده مسیریاب، i𝒮gi=1 است. تابع مسیریابی متخصصان را از طریق عملیات TopK انتخاب می‌کند:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

که Wg — ماتریس قابل آموزش مسیریاب است. این طرح امکان مقیاس‌پذیری تعداد کل پارامترها را با محدود کردن پارامترهای فعال‌شونده به ازای هر token فراهم می‌کند.

ابرپارامترهای معماری Kimi K2 / K2.5

پارامتر مقدار
نوع معماری Transformer با Mixture-of-Experts
تعداد کل پارامترها ۱٫۰۴ تریلیون
پارامترهای فعال‌شونده به ازای هر token ۳۲ میلیارد
تعداد لایه‌ها ۶۱ (۱ متراکم + ۶۰ MoE)
اندازه حالت پنهان ۷۱۶۸
تعداد سرهای توجه ۶۴
تعداد متخصصان ۳۸۴ (۸ انتخاب‌شونده به ازای هر token + ۱ مشترک)
اندازه حالت پنهان متخصص (MoE hidden size) ۲۰۴۸
اندازه واژگان ۱۶۰٬۰۰۰ token
تابع فعال‌سازی SwiGLU
مکانیزم توجه Multi-head Latent Attention (MLA)
حداکثر context ۲۵۶٬۰۰۰ token (گسترش از طریق YaRN)
encoder بصری (K2.5) MoonViT-3D، ~۴۰۰ میلیون پارامتر

[1][2][13]

نسبت تُنُکی (نسبت تعداد کل متخصصان به تعداد فعال) ۴۸ به ۱ است (۳۸۴ متخصص، ۸ فعال)، که کاهش قابل توجهی در هزینه محاسباتی نسبت به مدل متراکم (dense) در همان مقیاس فراهم می‌کند.[1]

مکانیزم Multi-head Latent Attention (MLA)

در مدل‌های سری Kimi K2/K2.5 از مکانیزم Multi-head Latent Attention (MLA) استفاده می‌شود — نوعی اصلاح توجه چندسری استاندارد با هدف افزایش کارایی و مقیاس‌پذیری. توجه استاندارد برای یک لایه به صورت زیر محاسبه می‌شود:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

که 𝐐,𝐊,𝐕L×dk — ماتریس‌های query، key و value هستند. در MLA بازنمایی‌های نهفته معرفی می‌شوند که query و key به آن‌ها تصویر می‌شوند؛ این کار ابعاد عملیات میانی را کاهش می‌دهد و امکان کوچک‌تر کردن KV-cache را فراهم می‌کند. این رویکرد مشابه مکانیزم استفاده‌شده در DeepSeek-V3 است.[1][13]

بهینه‌ساز MuonClip و QK-clip

برای آموزش مدل Kimi K2، بهینه‌ساز MuonClip پیشنهاد شده است — اصلاحی از بهینه‌ساز Muon (بهینه‌ساز تکانه‌ای با نرمال‌سازی Newton-Schulz) با افزودن تکنیک QK-clip برای پایدارسازی آموزش مدل‌های زبانی بزرگ با معماری MoE.[1]

QK-clip از طریق عملیات برش (clipping) محدودیت‌هایی روی logit‌های توجه 𝐐𝐊 اعمال می‌کند. برای هر سر توجه h حداکثر logit تعریف می‌شود:

Shmax=1dmaxi,j(Qhi(Khj)),

و ضریب مقیاس‌بندی محاسبه می‌شود:

γh=min(1,τShmax),

که τ=100 — ابرپارامتر آستانه و d — اندازه سر توجه است. ضریب γh برای مقیاس‌بندی وزن‌های Wq,Wk اعمال می‌شود اگر حداکثر logit از آستانه تجاوز کند. این کار دامنه مقادیر logit را قبل از softmax محدود کرده و خطر جهش‌های ناگهانی در تابع زیان (loss spikes) در آموزش در مقیاس بزرگ را کاهش می‌دهد.[1]

بر اساس داده‌های نویسندگان، پیش‌آموزش Kimi K2 روی ۱۵٫۵ تریلیون token با MuonClip بدون یک جهش ثبت‌شده در تابع زیان انجام شد (zero loss spikes).[1]

مولتی‌مودالیتی و MoonViT

مدل‌های Kimi K2.5 و Kimi-VL از encoder بصری MoonViT (در نسخه K2.5 — MoonViT-3D) با تقریباً ۴۰۰ میلیون پارامتر استفاده می‌کنند که بر پایه SigLIP-SO-400M با NaViT-packing (پشتیبانی از وضوح متغیر تصاویر ورودی) و گسترش سه‌بعدی برای پردازش ویدیو (گروه‌بندی به ازای هر ۴ فریم) ساخته شده است.[2][9]

encoder بصری تصاویر و ویدیوهای ورودی را به دنباله‌ای از token‌های بصری تبدیل می‌کند. فرض کنید 𝐗H×W×3 — تصویر ورودی، Φvis — encoder بصری:

𝐙vis=Φvis(𝐗)Lv×dv,

سپس از طریق تصویر خطی (MLP دو لایه) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

که d — اندازه فضای پنهان بخش زبانی مدل است. در حالت مولتی‌مودال، 𝐇vis با token‌های متنی الحاق شده و به transformer وارد می‌شود.[9][2]

برخلاف طرح‌های دو مرحله‌ای (افزودن adapter بصری بر روی مدل متنی)، K2.5 از ابتدای پیش‌آموزش روی داده‌های مخلوط بصری-متنی آموزش دیده است (joint text-vision pre-training)، با سهم اندک token‌های بصری (~۱۰٪) در مراحل اولیه و افزایش تدریجی آن. حجم کل — تقریباً ۱۵ تریلیون token مخلوط بصری-متنی.[2]

پیش‌آموزش و پس‌آموزش

پیش‌آموزش

Kimi K2 روی ۱۵٫۵ تریلیون token (متون وب، کد، ریاضیات، دانش دانشنامه‌ای) با استفاده از بهینه‌ساز MuonClip پیش‌آموزش دیده است. در تمام دوره پیش‌آموزش هیچ جهشی در تابع زیان (loss spike) ثبت نشده است.[1]

Kimi K2.5 پیش‌آموزش پیوسته (continual pre-training) از نقطه بازیابی K2 روی ~۱۵ تریلیون token اضافی مخلوط بصری-متنی با بهینه‌سازی مشترک modalityها (joint pre-training) را گذرانده است. جداگانه، ۱ تریلیون token آموزش مستقل encoder بصری و یک مرحله اضافی long-context mid-training برای گسترش context انجام شده است.[2]

پس‌آموزش

پس‌آموزش مدل‌های سری K2 شامل چند مرحله است:[1][2]

Supervised Fine-Tuning (SFT، تنظیم دقیق نظارت‌شده):

  • مسیرهای عاملی مصنوعی (agentic data synthesis) — تولید مشخصات ابزار، شبیه‌سازی تعاملات با محیط، تأیید نتایج.
  • برای K2.5 علاوه بر این zero-vision SFT اعمال می‌شود — SFT متنی که توانایی‌های بصری را بدون استفاده مستقیم از تصاویر در مرحله fine-tuning فعال می‌کند.

Reinforcement Learning (RL، یادگیری تقویتی):

  • ترکیب پاداش‌های قابل تأیید (Reinforcement Learning with Verifiable Rewards, RLVR) برای وظایف ریاضیات، کد و ایمنی.
  • خودارزیابی بر اساس معیارها (self-critique rubric rewards) — استفاده از ارزیاب‌های LLM برای ارزیابی خودکار کیفیت سناریوهای عاملی.
  • برای K2.5 — RL مولتی‌مودال مشترک (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking و K2.5 از کوانتیزاسیون بومی INT4 وزن‌ها (weight-only quantization، گروه ۳۲، tensor‌های فشرده) بهینه‌شده برای معماری NVIDIA Hopper پشتیبانی می‌کنند که نیاز به حافظه در هنگام inference را کاهش می‌دهد.[10][2]

Agent Swarm (K2.5)

برای مدل K2.5 مکانیزم Agent Swarm — فریم‌ورکی برای هماهنگ‌سازی موازی خودمدیریت عوامل — توسعه یافته است. مدل هماهنگ‌ساز به صورت پویا زیر-عوامل ایجاد می‌کند (از طریق عملیات create_subagent و assign_task)، زیروظایف را توزیع کرده و نتایج را جمع‌آوری می‌کند. هر زیر-عامل می‌تواند مستقلاً ابزارها را فراخوانی کرده و به صورت موازی با سایر زیر-عوامل کار کند.[2]

آموزش مکانیزم Agent Swarm از طریق Parallel-Agent Reinforcement Learning (PARL) با جداسازی اجرا و بهینه‌سازی (decoupling execution/optimization) پیاده‌سازی شده است. بر اساس داده‌های نویسندگان، Agent Swarm کاهش تأخیر (latency) تا ۴٫۵ برابر نسبت به حالت عاملی تک‌نخی (single-agent) را فراهم می‌کند.[2]

مدل‌های اصلی سری

مدل نوع پارامترها (کل / فعال) Context، token مولتی‌مودال تاریخ انتشار
Kimi k1.5 LLM، RL-scaling فاش نشده ۱۲۸٬۰۰۰ بله (محدود) ژانویه ۲۰۲۵
Kimi-VL VLM، MoE فشرده / ~۲٫۸ میلیارد فعال + ۴۰۰ میلیون ViT context طولانی بله (تصاویر) آوریل ۲۰۲۵
Kimi K2 LLM، MoE ۱٫۰۴ تریلیون / ۳۲ میلیارد ۲۵۶٬۰۰۰ خیر (متن) جولای ۲۰۲۵
Kimi K2 Thinking LLM، MoE ۱٫۰۴ تریلیون / ۳۲ میلیارد ۲۵۶٬۰۰۰ خیر (متن) نوامبر ۲۰۲۵
Kimi K2.5 VLM-LLM، MoE ۱٫۰۴ تریلیون / ۳۲ میلیارد ۲۵۶٬۰۰۰ بله (تصاویر، ویدیو، PDF) ژانویه ۲۰۲۶

[8][9][1][10][2]

Kimi K2

Kimi K2 یک LLM از نوع Mixture-of-Experts با ۱٫۰۴ تریلیون پارامتر کل و ۳۲ میلیارد پارامتر فعال‌شونده به ازای هر token است. روی ۱۵٫۵ تریلیون token با بهینه‌ساز MuonClip پیش‌آموزش دیده است. معماری شامل ۳۸۴ متخصص و مکانیزم MLA سازگار با context طولانی است. مدل برای وظایف برنامه‌نویسی، استدلال ریاضی و سناریوهای عاملی با فراخوانی‌های متوالی ابزار طراحی شده است.[1]

در گزارش فنی، pipeline چندمرحله‌ای پس‌آموزش شرح داده شده است: سنتز گسترده داده‌های عاملی از طریق شبیه‌سازی تعامل با ابزارها؛ آموزش با تقویت در محیط مخلوط از وظایف واقعی و مصنوعی؛ استفاده از ارزیاب‌های LLM برای ارزیابی خودکار کیفیت.[1][14]

Kimi K2 Thinking

نوع Kimi K2 Thinking برای استدلال چندمرحله‌ای (chain-of-thought) با قابلیت فراخوانی پویای ابزار و پشتیبانی از context تا ۲۵۶٬۰۰۰ token بهینه شده است. مدل یک حالت جداگانه «Thinking» با فیلد reasoning_content صریحاً بازگشتی که استدلال‌های داخلی را در بر می‌گیرد پیاده‌سازی می‌کند. K2 Thinking از ۲۰۰–۳۰۰ فراخوانی متوالی ابزار در یک اپیزود عاملی واحد بدون تخریب قابل توجه رفتار پشتیبانی می‌کند و همچنین از کوانتیزاسیون بومی INT4 با استفاده از QAT برخوردار است.[10]

Kimi-VL

Kimi-VL یک VLM مولتی‌مودال باز از نوع MoE (vision-language model) است که برای وظایف درک بصری، استدلال بصری-متنی و صحنه‌های واقعی طراحی شده است. مدل به عنوان یک معماری فشرده MoE با encoder بصری MoonViT توصیف می‌شود. گزارش فنی در آوریل ۲۰۲۵ در arXiv منتشر شد.[9]

Kimi K2.5

Kimi K2.5 یک مدل مولتی‌مودال MoE با مقیاس ۱٫۰۴ تریلیون پارامتر و ۳۲ میلیارد پارامتر فعال‌شونده است که بر پایه نقطه بازیابی Kimi-K2-Base با پیش‌آموزش ادامه‌یافته روی ~۱۵ تریلیون token مخلوط بصری-متنی ساخته شده است. مدل از ورودی‌های تصویر، ویدیو، PDF و متن با context تا ۲۵۶٬۰۰۰ token پشتیبانی می‌کند.[2]

K2.5 از دو حالت اصلی خروجی پشتیبانی می‌کند:

  • Thinking mode — با reasoning_content صریح و تولید چندمرحله‌ای;
  • Instant mode — بدون خروجی استدلال، با تأخیر کمتر.[2][13]

مدل از کوانتیزاسیون بومی INT4 وزن‌ها (weight-only، گروه ۳۲) بهینه‌شده برای معماری NVIDIA Hopper پشتیبانی می‌کند.[2]

نتایج کلیدی و benchmark‌ها

benchmark‌های متنی و عاملی Kimi K2

نتایج برای Kimi-K2-Instruct در حالت non-thinking (بدون chain-of-thought گسترش‌یافته) بر اساس داده‌های گزارش فنی ارائه شده است.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet منبع
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

بر اساس اعلام نویسندگان، این نتایج K2 را در میان پیشتازان مدل‌های باز در حالت بدون thinking بویژه در وظایف مهندسی و عاملی قرار می‌دهد (به وضعیت در زمان انتشار گزارش).[1]

benchmark‌های Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini منبع
MMVet (دقت) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

نتایج نشان می‌دهد که معماری فشرده مولتی‌مودال MoE به سطحی قابل مقایسه با مدل‌های بزرگ‌تر با تعداد پارامترهای فعال کمتر دست می‌یابد.[9]

benchmark‌های Kimi K2.5

نتایج در حالت Thinking (temperature = 1٫0؛ top-p = 0٫95؛ context 256٬000 token؛ موتور vLLM؛ سکوی سخت‌افزاری NVIDIA H200) بر اساس داده‌های کارت مدل در پلتفرم NVIDIA NIM و گزارش فنی ارائه شده است.[2][13]

دسته‌بندی Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (بدون ابزار) 30,1
HLE-Full (با ابزار) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

علاوه بر این، K2.5 انتقال مثبت آموزش بصری به وظایف متنی را نشان می‌دهد: +۱٫۷٪ در MMLU-Pro و +۲٫۱٪ در GPQA-Diamond نسبت به مدل پایه متنی K2.[2]

ارزیابی مقایسه‌ای نهایی به انتخاب معیارها و سناریوها بستگی دارد؛ نتایج بر اساس داده‌های نویسندگان ارائه شده است. اعتبارسنجی مستقل بخشی از benchmark‌ها در زمان انتشار محدود است.[2][15]

کاربردها

دستیار متنی و جستجو

پلتفرم Kimi به عنوان دستیاری با پشتیبانی از پردازش اسناد طولانی (گزارش‌های پژوهشی، داده‌های مالی)، تحلیل خودکار و جستجوی آنلاین با تجمیع اطلاعات استفاده می‌شود. Moonshot AI اعلام می‌کند که Kimi از بیش از ۳۰۰ فراخوانی ابزار (tool calls) در چارچوب یک سناریوی عاملی واحد پشتیبانی می‌کند.[7][4]

برنامه‌نویسی و وظایف مهندسی

Kimi K2 و K2.5 نتایج بالایی در SWE-Bench Verified، SWE-Bench Multilingual، LiveCodeBench و سایر benchmark‌های برنامه‌نویسی نشان می‌دهند. این مدل‌ها برای خودکارسازی رفع اشکال در مخازن، تولید و بازنویسی کد، حل وظایف داوران آنلاین (OJBench، LiveCodeBench) به کار می‌روند. گزارش فنی K2 نشان می‌دهد که مدل روی یک corpus مصنوعی عاملی گسترده از جمله تعاملات با سیستم‌های کنترل نسخه، مدیران بسته و محیط‌های اجرا آموزش دیده است.[1][2][14]

کاربردهای مولتی‌مودال

Kimi-VL و K2.5 برای پرسش و پاسخ بصری (VQA) روی تصاویر و اسناد؛ درک اسناد (OCRBench، OmniDocBench)؛ تحلیل ویدیو (VideoMMMU، LongVideoBench)؛ وظایف ترکیبی برنامه‌نویسی بر اساس مشخصات بصری (مثلاً تولید رابط کاربری بر اساس تصویر طرح‌بندی) طراحی شده‌اند. برای K2.5 سناریوهای «vision-grounded coding» و «autonomous visual debugging» توصیف شده است که در آن‌ها مدل کد را بر اساس توصیف بصری تولید کرده و نتیجه بصری را به صورت تکراری تحلیل می‌کند.[2][9][15]

API و استقرار

مدل‌ها از طریق API پلتفرم Moonshot AI Open Platform با پشتیبانی از tool calling، حالت thinking، حالت JSON و کش‌گذاری context در دسترس هستند. وزن‌های باز برای استقرار محلی از طریق vLLM، SGLang و TensorRT-LLM استفاده می‌شوند. سرویس Mooncake مقیاس‌پذیری inference برای context طولانی را فراهم می‌کند.[4][11][16]

محدودیت‌ها و مسائل باز

نیازهای منابع

مدل‌های MoE در مقیاس ۱ تریلیون پارامتر، حتی با ۳۲ میلیارد پارامتر فعال‌شونده و کوانتیزاسیون INT4، به منابع حافظه و پهنای باند قابل توجهی نیاز دارند. در بحث‌های مهندسی پیرامون استقرار Kimi K2.5، برآوردهایی در حدود صدها گیگابایت حافظه گرافیکی برای بارگذاری کامل مدل ذکر می‌شود؛ اعداد دقیق به شکل کوانتیزاسیون و فریم‌ورک (vLLM، SGLang و غیره) بستگی دارند.[2][17]

توهمات و کیفیت تولید

مانند سایر LLMها، مدل‌های سری Kimi در معرض توهمات هستند. در گزارش‌های آزمون‌های FACTS Grounding و FaithJudge، نرخ توهم در محدوده ۱٫۱–۷٫۴٪ در سناریوهای RAG ثبت شده است. در حالت non-thinking ممکن است مدل token‌های اضافی در صورت مشخصات نامشخص ابزار تولید کند؛ با فعال‌سازی اجباری tool-use، عملکرد در برخی وظایف کاهش می‌یابد.[1]

وابستگی به داده‌های مصنوعی و pipeline یادگیری تقویتی

pipeline سنتز داده‌های عاملی و آموزش با تقویت بر مجموعه بزرگی از ابزارها و صحنه‌های مصنوعی و همچنین ارزیاب‌های LLM برای ارزیابی خودکار (self-judging) متکی است. چنین طرحی سؤالات باز ایجاد می‌کند: پایداری در برابر انحراف (bias) خودارزیابی؛ تخریب بالقوه در تکرار چندباره (bootstrap)؛ قابلیت انتقال مهارت‌های عاملی به محیط‌های واقعی متفاوت از شبیه‌سازی‌شده؛ تأثیر توزیع وظایف مصنوعی بر توانایی تعمیم.[1][14]

شفافیت و بازتولیدپذیری

bخشی از اطلاعات مربوط به ترکیب داده‌های آموزشی، فرایند فیلترینگ، توزیع زبان‌ها و حوزه‌ها فاش نشده یا به طور محدود فاش شده است. این امر ارزیابی دقیق منابع انحراف، بازتولیدپذیری آموزش و اعتبارسنجی مستقل تأثیر اجزای جداگانه (MuonClip، QK-clip) بر پایداری را دشوار می‌کند. تا وضعیت فوریه ۲۰۲۶، بازتولید کامل آموزش Kimi K2 و K2.5 توسط اشخاص ثالث در ادبیات باز ثبت نشده است.[1][2]

جنبه‌های اخلاقی و نظارتی

در کارت‌های مدل و گزارش‌های فنی تأکید شده است که توسعه‌دهندگان مسئول ورودی‌ها و خروجی‌های مدل هستند؛ پیش از استقرار نیاز به افزودن سازوکارهای محافظتی (guardrails) و آزمایش روی داده‌های مورد خاص وجود دارد؛ مدل می‌تواند تصاویر و ویدیوهایی را که احتمالاً حاوی داده‌های شخصی هستند پردازش کند و یکپارچه‌ساز موظف است قوانین مرتبط را رعایت کند.[2][16]

در گزارش‌های فنی، ارزیابی‌های ایمنی (خطرات زیستی، شیمیایی، سایبری) با استفاده از ابزارهایی مانند Promptfoo شرح داده شده است. مدل‌ها از طریق RL با پاداش‌های قابل تأیید و خودارزیابی هم‌راستا (alignment) می‌شوند.[1]

به عنوان محصول یک شرکت چینی، این مدل‌ها تابع مقررات ملی جمهوری خلق چین در حوزه هوش مصنوعی هستند. در زمان نگارش، هیچ سند نظارتی عمومی جداگانه‌ای که صرفاً به مدل‌های Kimi اختصاص داشته باشد یافت نشد؛ نظارت در چارچوب رویکردهای کلی نسبت به مدل‌های مولد و هوش مصنوعی در حوزه‌های قضایی مربوطه اعمال می‌شود.[18]

در فوریه ۲۰۲۶، شرکت Anthropic اعلام کرد که Moonshot AI (همراه با سایر توسعه‌دهندگان چینی) از حساب‌های جعلی برای تولید تعاملات با Claude با هدف تقطیر داده‌ها برای آموزش مدل‌ها استفاده کرده است. این اطلاعات ماهیت ادعای یک طرف را دارد و تا زمان انتشار توسط تحقیقات مستقل تأیید نشده است؛ Moonshot AI پاسخ رسمی منتشر نکرده است.[5]

چشم‌اندازها و جهت‌گیری‌های پژوهشی

بر اساس مواد منتشرشده، چند جهت برای تحقیقات آتی قابل تشخیص است:

  • سیستم‌های عاملی مقیاس‌پذیر. توسعه رویکردهای آموزش LLM به عنوان سیستم‌های عاملی با استفاده از ابزارهای مصنوعی، RL و self-judging. گسترش Agent Swarm به تعداد بیشتری زیر-عامل و انواع جدید وظایف.[2][1]
  • معماری‌های MoE کارآمد. استفاده از ۱ تریلیون پارامتر با ۳۲ میلیارد فعال‌شونده و ۳۸۴ متخصص یکی از گزینه‌های مصالحه بین مقیاس و کارایی است؛ گزینه‌هایی با طرح‌های مختلف مسیریابی در حال بررسی هستند.[1]
  • مولتی‌مودالیتی بومی. آموزش K2.5 روی داده‌های مخلوط بصری-متنی از ابتدای پیش‌آموزش رویکردی به «مولتی‌مودالیتی بومی» را نشان می‌دهد که با طرح‌های دو مرحله‌ای مقایسه می‌شود.[2][9]
  • inference کارآمد و context طولانی. کوانتیزاسیون INT4 و پشتیبانی از context 256٬000 token پژوهش‌های بیشتری را در زمینه توجه تُنُک، بازنمایی‌های نهفته و حافظه خارجی تحریک می‌کند. به طور جداگانه پروژه Kimi Linear توصیف شده است — توجه خطی ترکیبی با کاهش ۷۵٪ KV-cache و تسریع ۶ برابری decoding در context یک میلیون token.[2][19]

در مواد رسمی Moonshot AI، نقشه راه تفصیلی برای نسخه‌های آتی Kimi منتشر نمی‌شود؛ جهت‌گیری‌های فهرست‌شده بر اساس پژوهش‌های منتشرشده است.

همچنین ببینید

  • معماری Transformer
  • DeepSeek
  • Qwen

منابع

منابع

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692