Kimi (Moonshot AI) (FA)
Kimi (سری مدلهای Moonshot AI) — مجموعهای از مدلهای زبانی بزرگ (Large Language Model, LLM) است که توسط شرکت چینی Moonshot AI (پکن، جمهوری خلق چین) برای وظایف تولید متن و مولتیمودال، برنامهنویسی و سیستمهای عاملی (agentic systems — سیستمهایی که قادر به برنامهریزی خودمختار، استدلال و عمل با استفاده از ابزارهای خارجی هستند) توسعه مییابد. این خانواده شامل مدلهای متنی و مولتیمودال با معماری Mixture-of-Experts (MoE، ترکیب متخصصان) در مقیاس حدود ۱ تریلیون پارامتر و زیرمجموعهای فعالشونده در حدود ۳۲ میلیارد پارامتر به ازای هر token است.[1][2] ویژگی مهم این سری، تمرکز بر رفتار عاملی (برنامهریزی چندمرحلهای با فراخوانی ابزارهای خارجی) و پشتیبانی از context طولانی تا ۲۵۶٬۰۰۰ token در نسخههای Kimi K2 و Kimi K2.5 است.[1][2]
مدلهای سری Kimi هم با وزنهای باز (open-weight) در بستر Hugging Face تحت مجوز اصلاحشده MIT و هم از طریق API اختصاصی پلتفرم Moonshot AI Open Platform توزیع میشوند.[3][4]
تاریخچه و پیشزمینه
تأسیس Moonshot AI
Moonshot AI در مارس ۲۰۲۳ در پکن توسط یانگ ژیلین (Yang Zhilin، مدیرعامل)، ژوو شینیو (Zhou Xinyu) و وو یوشین (Wu Yuxin) — فارغالتحصیلان دانشگاه Tsinghua — تأسیس شد. یانگ ژیلین پیش از این در Google Brain و Meta فعالیت کرده و در پژوهشهای حوزه بینایی کامپیوتری و استدلال مشارکت داشته است. شرکت از Alibaba (دور تأمین مالی به ارزش ۱ میلیارد دلار، فوریه ۲۰۲۴)، Tencent و سایر سرمایهگذاران تأمین مالی دریافت کرده است.[5][6]
جدول زمانی انتشارهای کلیدی
- اکتبر–نوامبر ۲۰۲۳ — راهاندازی chatbot Kimi با پشتیبانی از context تا ۱۲۸ هزار token (تا ۲۰۰ هزار کاراکتر چینی). نسخههای اولیه از مدلهای اختصاصی با جزئیات فنی محدود استفاده میکردند.[6][7]
- مارس ۲۰۲۴ — گسترش context تا ۲ میلیون کاراکتر در نسخه بتا.[6]
- ژانویه ۲۰۲۵ — انتشار Kimi k1.5 — مدل مولتیمودال با Reinforcement Learning مقیاسشده، که عملکردی برابر با OpenAI o1 در وظایف ریاضیات، برنامهنویسی و استدلال مولتیمودال ادعا شده است. Context تا ۱۲۸ هزار token.[8]
- آوریل ۲۰۲۵ — معرفی Kimi-VL — مدل مولتیمودال باز MoE (vision-language model, VLM) با encoder بصری MoonViT (~۴۰۰ میلیون پارامتر) و ~۲٫۸ میلیارد پارامتر فعال در decoder. گزارش فنی در arXiv منتشر شد.[9]
- جولای ۲۰۲۵ — انتشار Kimi K2 — مدل اصلی باز MoE با ۱ تریلیون پارامتر و ۳۲ میلیارد پارامتر فعال. گزارش فنی در arXiv منتشر شد.[1] مدل در زمان انتشار در رتبه اول بین مدلهای باز در LMSYS Chatbot Arena قرار داشت (بیش از ۳۰۰۰ رأی).[1]
- سپتامبر ۲۰۲۵ — بهروزرسانی Kimi-K2-Instruct-0905 با context گسترشیافته تا ۲۵۶ هزار token و بهبود برنامهنویسی عاملی.[1]
- نوامبر ۲۰۲۵ — انتشار Kimi K2 Thinking — نسخهای با استدلال گامبهگام تقویتشده (chain-of-thought) و پشتیبانی از ۲۰۰–۳۰۰ فراخوانی متوالی ابزار (tool calls).[10]
- ژانویه ۲۰۲۶ — معرفی Kimi K2.5 — مدل مولتیمودال MoE با مولتیمودالیتی بومی و مکانیزم Agent Swarm (هماهنگسازی موازی زیر-عوامل).[2]
موازی با توسعه مدلها، در سال ۲۰۲۴ سرویس inference اختصاصی Mooncake معرفی شد — معماری KVCache-محور غیرمتمرکز برای ارائه LLM با context طولانی.[11]
مبانی نظری و معماری
معماری Mixture-of-Experts
مدلهای سری Kimi K2 و K2.5 معماری Transformer با Mixture-of-Experts را در لایههای جداگانه پیادهسازی میکنند. بلوک استاندارد transformer ترکیبی از لایههای توجه چندسری (Multi-Head Attention, MHA) و MLP (پرسپترون چندلایه) موقعیتمحور با اتصالات پسماند است:[1][12]
که در آن — بازنماییهای token ورودی، — طول دنباله، — اندازه حالت پنهان است.
در لایه MoE به جای یک MLP، مجموعهای از متخصصان استفاده میشود که هرکدام یک MLP مستقل با پارامترهای هستند. شبکه مسیریاب (gating network) برای هر token زیرمجموعهای از متخصصان را انتخاب میکند. خروجی لایه MoE برای token با بازنمایی به صورت زیر تعریف میشود:[1]
که در آن — مجموعه متخصصان انتخابشده برای token مربوطه، — وزنهای نرمالشده مسیریاب، است. تابع مسیریابی متخصصان را از طریق عملیات TopK انتخاب میکند:[1]
که — ماتریس قابل آموزش مسیریاب است. این طرح امکان مقیاسپذیری تعداد کل پارامترها را با محدود کردن پارامترهای فعالشونده به ازای هر token فراهم میکند.
ابرپارامترهای معماری Kimi K2 / K2.5
| پارامتر | مقدار |
|---|---|
| نوع معماری | Transformer با Mixture-of-Experts |
| تعداد کل پارامترها | ۱٫۰۴ تریلیون |
| پارامترهای فعالشونده به ازای هر token | ۳۲ میلیارد |
| تعداد لایهها | ۶۱ (۱ متراکم + ۶۰ MoE) |
| اندازه حالت پنهان | ۷۱۶۸ |
| تعداد سرهای توجه | ۶۴ |
| تعداد متخصصان | ۳۸۴ (۸ انتخابشونده به ازای هر token + ۱ مشترک) |
| اندازه حالت پنهان متخصص (MoE hidden size) | ۲۰۴۸ |
| اندازه واژگان | ۱۶۰٬۰۰۰ token |
| تابع فعالسازی | SwiGLU |
| مکانیزم توجه | Multi-head Latent Attention (MLA) |
| حداکثر context | ۲۵۶٬۰۰۰ token (گسترش از طریق YaRN) |
| encoder بصری (K2.5) | MoonViT-3D، ~۴۰۰ میلیون پارامتر |
نسبت تُنُکی (نسبت تعداد کل متخصصان به تعداد فعال) ۴۸ به ۱ است (۳۸۴ متخصص، ۸ فعال)، که کاهش قابل توجهی در هزینه محاسباتی نسبت به مدل متراکم (dense) در همان مقیاس فراهم میکند.[1]
مکانیزم Multi-head Latent Attention (MLA)
در مدلهای سری Kimi K2/K2.5 از مکانیزم Multi-head Latent Attention (MLA) استفاده میشود — نوعی اصلاح توجه چندسری استاندارد با هدف افزایش کارایی و مقیاسپذیری. توجه استاندارد برای یک لایه به صورت زیر محاسبه میشود:[12]
که — ماتریسهای query، key و value هستند. در MLA بازنماییهای نهفته معرفی میشوند که query و key به آنها تصویر میشوند؛ این کار ابعاد عملیات میانی را کاهش میدهد و امکان کوچکتر کردن KV-cache را فراهم میکند. این رویکرد مشابه مکانیزم استفادهشده در DeepSeek-V3 است.[1][13]
بهینهساز MuonClip و QK-clip
برای آموزش مدل Kimi K2، بهینهساز MuonClip پیشنهاد شده است — اصلاحی از بهینهساز Muon (بهینهساز تکانهای با نرمالسازی Newton-Schulz) با افزودن تکنیک QK-clip برای پایدارسازی آموزش مدلهای زبانی بزرگ با معماری MoE.[1]
QK-clip از طریق عملیات برش (clipping) محدودیتهایی روی logitهای توجه اعمال میکند. برای هر سر توجه حداکثر logit تعریف میشود:
و ضریب مقیاسبندی محاسبه میشود:
که — ابرپارامتر آستانه و — اندازه سر توجه است. ضریب برای مقیاسبندی وزنهای اعمال میشود اگر حداکثر logit از آستانه تجاوز کند. این کار دامنه مقادیر logit را قبل از softmax محدود کرده و خطر جهشهای ناگهانی در تابع زیان (loss spikes) در آموزش در مقیاس بزرگ را کاهش میدهد.[1]
بر اساس دادههای نویسندگان، پیشآموزش Kimi K2 روی ۱۵٫۵ تریلیون token با MuonClip بدون یک جهش ثبتشده در تابع زیان انجام شد (zero loss spikes).[1]
مولتیمودالیتی و MoonViT
مدلهای Kimi K2.5 و Kimi-VL از encoder بصری MoonViT (در نسخه K2.5 — MoonViT-3D) با تقریباً ۴۰۰ میلیون پارامتر استفاده میکنند که بر پایه SigLIP-SO-400M با NaViT-packing (پشتیبانی از وضوح متغیر تصاویر ورودی) و گسترش سهبعدی برای پردازش ویدیو (گروهبندی به ازای هر ۴ فریم) ساخته شده است.[2][9]
encoder بصری تصاویر و ویدیوهای ورودی را به دنبالهای از tokenهای بصری تبدیل میکند. فرض کنید — تصویر ورودی، — encoder بصری:
سپس از طریق تصویر خطی (MLP دو لایه) :
که — اندازه فضای پنهان بخش زبانی مدل است. در حالت مولتیمودال، با tokenهای متنی الحاق شده و به transformer وارد میشود.[9][2]
برخلاف طرحهای دو مرحلهای (افزودن adapter بصری بر روی مدل متنی)، K2.5 از ابتدای پیشآموزش روی دادههای مخلوط بصری-متنی آموزش دیده است (joint text-vision pre-training)، با سهم اندک tokenهای بصری (~۱۰٪) در مراحل اولیه و افزایش تدریجی آن. حجم کل — تقریباً ۱۵ تریلیون token مخلوط بصری-متنی.[2]
پیشآموزش و پسآموزش
پیشآموزش
Kimi K2 روی ۱۵٫۵ تریلیون token (متون وب، کد، ریاضیات، دانش دانشنامهای) با استفاده از بهینهساز MuonClip پیشآموزش دیده است. در تمام دوره پیشآموزش هیچ جهشی در تابع زیان (loss spike) ثبت نشده است.[1]
Kimi K2.5 پیشآموزش پیوسته (continual pre-training) از نقطه بازیابی K2 روی ~۱۵ تریلیون token اضافی مخلوط بصری-متنی با بهینهسازی مشترک modalityها (joint pre-training) را گذرانده است. جداگانه، ۱ تریلیون token آموزش مستقل encoder بصری و یک مرحله اضافی long-context mid-training برای گسترش context انجام شده است.[2]
پسآموزش
پسآموزش مدلهای سری K2 شامل چند مرحله است:[1][2]
Supervised Fine-Tuning (SFT، تنظیم دقیق نظارتشده):
- مسیرهای عاملی مصنوعی (agentic data synthesis) — تولید مشخصات ابزار، شبیهسازی تعاملات با محیط، تأیید نتایج.
- برای K2.5 علاوه بر این zero-vision SFT اعمال میشود — SFT متنی که تواناییهای بصری را بدون استفاده مستقیم از تصاویر در مرحله fine-tuning فعال میکند.
Reinforcement Learning (RL، یادگیری تقویتی):
- ترکیب پاداشهای قابل تأیید (Reinforcement Learning with Verifiable Rewards, RLVR) برای وظایف ریاضیات، کد و ایمنی.
- خودارزیابی بر اساس معیارها (self-critique rubric rewards) — استفاده از ارزیابهای LLM برای ارزیابی خودکار کیفیت سناریوهای عاملی.
- برای K2.5 — RL مولتیمودال مشترک (joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking و K2.5 از کوانتیزاسیون بومی INT4 وزنها (weight-only quantization، گروه ۳۲، tensorهای فشرده) بهینهشده برای معماری NVIDIA Hopper پشتیبانی میکنند که نیاز به حافظه در هنگام inference را کاهش میدهد.[10][2]
Agent Swarm (K2.5)
برای مدل K2.5 مکانیزم Agent Swarm — فریمورکی برای هماهنگسازی موازی خودمدیریت عوامل — توسعه یافته است. مدل هماهنگساز به صورت پویا زیر-عوامل ایجاد میکند (از طریق عملیات create_subagent و assign_task)، زیروظایف را توزیع کرده و نتایج را جمعآوری میکند. هر زیر-عامل میتواند مستقلاً ابزارها را فراخوانی کرده و به صورت موازی با سایر زیر-عوامل کار کند.[2]
آموزش مکانیزم Agent Swarm از طریق Parallel-Agent Reinforcement Learning (PARL) با جداسازی اجرا و بهینهسازی (decoupling execution/optimization) پیادهسازی شده است. بر اساس دادههای نویسندگان، Agent Swarm کاهش تأخیر (latency) تا ۴٫۵ برابر نسبت به حالت عاملی تکنخی (single-agent) را فراهم میکند.[2]
مدلهای اصلی سری
| مدل | نوع | پارامترها (کل / فعال) | Context، token | مولتیمودال | تاریخ انتشار |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM، RL-scaling | فاش نشده | ۱۲۸٬۰۰۰ | بله (محدود) | ژانویه ۲۰۲۵ |
| Kimi-VL | VLM، MoE | فشرده / ~۲٫۸ میلیارد فعال + ۴۰۰ میلیون ViT | context طولانی | بله (تصاویر) | آوریل ۲۰۲۵ |
| Kimi K2 | LLM، MoE | ۱٫۰۴ تریلیون / ۳۲ میلیارد | ۲۵۶٬۰۰۰ | خیر (متن) | جولای ۲۰۲۵ |
| Kimi K2 Thinking | LLM، MoE | ۱٫۰۴ تریلیون / ۳۲ میلیارد | ۲۵۶٬۰۰۰ | خیر (متن) | نوامبر ۲۰۲۵ |
| Kimi K2.5 | VLM-LLM، MoE | ۱٫۰۴ تریلیون / ۳۲ میلیارد | ۲۵۶٬۰۰۰ | بله (تصاویر، ویدیو، PDF) | ژانویه ۲۰۲۶ |
Kimi K2
Kimi K2 یک LLM از نوع Mixture-of-Experts با ۱٫۰۴ تریلیون پارامتر کل و ۳۲ میلیارد پارامتر فعالشونده به ازای هر token است. روی ۱۵٫۵ تریلیون token با بهینهساز MuonClip پیشآموزش دیده است. معماری شامل ۳۸۴ متخصص و مکانیزم MLA سازگار با context طولانی است. مدل برای وظایف برنامهنویسی، استدلال ریاضی و سناریوهای عاملی با فراخوانیهای متوالی ابزار طراحی شده است.[1]
در گزارش فنی، pipeline چندمرحلهای پسآموزش شرح داده شده است: سنتز گسترده دادههای عاملی از طریق شبیهسازی تعامل با ابزارها؛ آموزش با تقویت در محیط مخلوط از وظایف واقعی و مصنوعی؛ استفاده از ارزیابهای LLM برای ارزیابی خودکار کیفیت.[1][14]
Kimi K2 Thinking
نوع Kimi K2 Thinking برای استدلال چندمرحلهای (chain-of-thought) با قابلیت فراخوانی پویای ابزار و پشتیبانی از context تا ۲۵۶٬۰۰۰ token بهینه شده است. مدل یک حالت جداگانه «Thinking» با فیلد reasoning_content صریحاً بازگشتی که استدلالهای داخلی را در بر میگیرد پیادهسازی میکند. K2 Thinking از ۲۰۰–۳۰۰ فراخوانی متوالی ابزار در یک اپیزود عاملی واحد بدون تخریب قابل توجه رفتار پشتیبانی میکند و همچنین از کوانتیزاسیون بومی INT4 با استفاده از QAT برخوردار است.[10]
Kimi-VL
Kimi-VL یک VLM مولتیمودال باز از نوع MoE (vision-language model) است که برای وظایف درک بصری، استدلال بصری-متنی و صحنههای واقعی طراحی شده است. مدل به عنوان یک معماری فشرده MoE با encoder بصری MoonViT توصیف میشود. گزارش فنی در آوریل ۲۰۲۵ در arXiv منتشر شد.[9]
Kimi K2.5
Kimi K2.5 یک مدل مولتیمودال MoE با مقیاس ۱٫۰۴ تریلیون پارامتر و ۳۲ میلیارد پارامتر فعالشونده است که بر پایه نقطه بازیابی Kimi-K2-Base با پیشآموزش ادامهیافته روی ~۱۵ تریلیون token مخلوط بصری-متنی ساخته شده است. مدل از ورودیهای تصویر، ویدیو، PDF و متن با context تا ۲۵۶٬۰۰۰ token پشتیبانی میکند.[2]
K2.5 از دو حالت اصلی خروجی پشتیبانی میکند:
- Thinking mode — با
reasoning_contentصریح و تولید چندمرحلهای; - Instant mode — بدون خروجی استدلال، با تأخیر کمتر.[2][13]
مدل از کوانتیزاسیون بومی INT4 وزنها (weight-only، گروه ۳۲) بهینهشده برای معماری NVIDIA Hopper پشتیبانی میکند.[2]
نتایج کلیدی و benchmarkها
benchmarkهای متنی و عاملی Kimi K2
نتایج برای Kimi-K2-Instruct در حالت non-thinking (بدون chain-of-thought گسترشیافته) بر اساس دادههای گزارش فنی ارائه شده است.[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | منبع |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65,8 % | 38,8 % | 72,5 % / 72,7 % | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47,3 % | 20,9 % | 51,0 % | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53,7 % | 44,7 % | 46,9 % | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66,1 % | 48,8 % | 66,1 % | arXiv:2507.20534 |
| ACEBench (En) | 76,5 % | 75,6 % | 80,1 % | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49,5 % | 33,9 % | 46,7 % | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75,1 % | 68,2 % | 74,9 % | arXiv:2507.20534 |
بر اساس اعلام نویسندگان، این نتایج K2 را در میان پیشتازان مدلهای باز در حالت بدون thinking بویژه در وظایف مهندسی و عاملی قرار میدهد (به وضعیت در زمان انتشار گزارش).[1]
benchmarkهای Kimi-VL
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | منبع |
|---|---|---|---|---|
| MMVet (دقت) | 66,7 % | 67,1 % | 66,9 % | arXiv:2504.07491 |
| RealWorldQA | 68,1 % | 68,5 % | — | arXiv:2504.07491 |
نتایج نشان میدهد که معماری فشرده مولتیمودال MoE به سطحی قابل مقایسه با مدلهای بزرگتر با تعداد پارامترهای فعال کمتر دست مییابد.[9]
benchmarkهای Kimi K2.5
نتایج در حالت Thinking (temperature = 1٫0؛ top-p = 0٫95؛ context 256٬000 token؛ موتور vLLM؛ سکوی سختافزاری NVIDIA H200) بر اساس دادههای کارت مدل در پلتفرم NVIDIA NIM و گزارش فنی ارائه شده است.[2][13]
| دستهبندی | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (بدون ابزار) | 30,1 |
| HLE-Full (با ابزار) | 50,2 | |
| AIME 2025 | 96,1 | |
| HMMT 2025 (Feb) | 95,4 | |
| GPQA-Diamond | 87,6 | |
| MMLU-Pro | 87,1 | |
| Vision & Video | MMMU-Pro | 78,5 |
| MathVision | 84,2 | |
| MathVista (mini) | 90,1 | |
| OCRBench | 92,3 | |
| OmniDocBench 1.5 | 88,8 | |
| VideoMMMU | 86,6 | |
| LongVideoBench | 79,8 | |
| Coding | SWE-Bench Verified | 76,8 |
| SWE-Bench Pro | 50,7 | |
| SWE-Bench Multilingual | 73,0 | |
| Terminal Bench 2.0 | 50,8 | |
| PaperBench | 63,5 | |
| LiveCodeBench v6 | 85,0 | |
| OJBench (C++) | 57,4 | |
| Long Context | Longbench v2 | 61,0 |
| AA-LCR | 70,0 | |
| Agentic Search | BrowseComp | 60,6 |
| BrowseComp (Agent Swarm) | 78,4 | |
| WideSearch (iter-F1) | 72,7 | |
| DeepSearchQA | 77,1 |
علاوه بر این، K2.5 انتقال مثبت آموزش بصری به وظایف متنی را نشان میدهد: +۱٫۷٪ در MMLU-Pro و +۲٫۱٪ در GPQA-Diamond نسبت به مدل پایه متنی K2.[2]
ارزیابی مقایسهای نهایی به انتخاب معیارها و سناریوها بستگی دارد؛ نتایج بر اساس دادههای نویسندگان ارائه شده است. اعتبارسنجی مستقل بخشی از benchmarkها در زمان انتشار محدود است.[2][15]
کاربردها
دستیار متنی و جستجو
پلتفرم Kimi به عنوان دستیاری با پشتیبانی از پردازش اسناد طولانی (گزارشهای پژوهشی، دادههای مالی)، تحلیل خودکار و جستجوی آنلاین با تجمیع اطلاعات استفاده میشود. Moonshot AI اعلام میکند که Kimi از بیش از ۳۰۰ فراخوانی ابزار (tool calls) در چارچوب یک سناریوی عاملی واحد پشتیبانی میکند.[7][4]
برنامهنویسی و وظایف مهندسی
Kimi K2 و K2.5 نتایج بالایی در SWE-Bench Verified، SWE-Bench Multilingual، LiveCodeBench و سایر benchmarkهای برنامهنویسی نشان میدهند. این مدلها برای خودکارسازی رفع اشکال در مخازن، تولید و بازنویسی کد، حل وظایف داوران آنلاین (OJBench، LiveCodeBench) به کار میروند. گزارش فنی K2 نشان میدهد که مدل روی یک corpus مصنوعی عاملی گسترده از جمله تعاملات با سیستمهای کنترل نسخه، مدیران بسته و محیطهای اجرا آموزش دیده است.[1][2][14]
کاربردهای مولتیمودال
Kimi-VL و K2.5 برای پرسش و پاسخ بصری (VQA) روی تصاویر و اسناد؛ درک اسناد (OCRBench، OmniDocBench)؛ تحلیل ویدیو (VideoMMMU، LongVideoBench)؛ وظایف ترکیبی برنامهنویسی بر اساس مشخصات بصری (مثلاً تولید رابط کاربری بر اساس تصویر طرحبندی) طراحی شدهاند. برای K2.5 سناریوهای «vision-grounded coding» و «autonomous visual debugging» توصیف شده است که در آنها مدل کد را بر اساس توصیف بصری تولید کرده و نتیجه بصری را به صورت تکراری تحلیل میکند.[2][9][15]
API و استقرار
مدلها از طریق API پلتفرم Moonshot AI Open Platform با پشتیبانی از tool calling، حالت thinking، حالت JSON و کشگذاری context در دسترس هستند. وزنهای باز برای استقرار محلی از طریق vLLM، SGLang و TensorRT-LLM استفاده میشوند. سرویس Mooncake مقیاسپذیری inference برای context طولانی را فراهم میکند.[4][11][16]
محدودیتها و مسائل باز
نیازهای منابع
مدلهای MoE در مقیاس ۱ تریلیون پارامتر، حتی با ۳۲ میلیارد پارامتر فعالشونده و کوانتیزاسیون INT4، به منابع حافظه و پهنای باند قابل توجهی نیاز دارند. در بحثهای مهندسی پیرامون استقرار Kimi K2.5، برآوردهایی در حدود صدها گیگابایت حافظه گرافیکی برای بارگذاری کامل مدل ذکر میشود؛ اعداد دقیق به شکل کوانتیزاسیون و فریمورک (vLLM، SGLang و غیره) بستگی دارند.[2][17]
توهمات و کیفیت تولید
مانند سایر LLMها، مدلهای سری Kimi در معرض توهمات هستند. در گزارشهای آزمونهای FACTS Grounding و FaithJudge، نرخ توهم در محدوده ۱٫۱–۷٫۴٪ در سناریوهای RAG ثبت شده است. در حالت non-thinking ممکن است مدل tokenهای اضافی در صورت مشخصات نامشخص ابزار تولید کند؛ با فعالسازی اجباری tool-use، عملکرد در برخی وظایف کاهش مییابد.[1]
وابستگی به دادههای مصنوعی و pipeline یادگیری تقویتی
pipeline سنتز دادههای عاملی و آموزش با تقویت بر مجموعه بزرگی از ابزارها و صحنههای مصنوعی و همچنین ارزیابهای LLM برای ارزیابی خودکار (self-judging) متکی است. چنین طرحی سؤالات باز ایجاد میکند: پایداری در برابر انحراف (bias) خودارزیابی؛ تخریب بالقوه در تکرار چندباره (bootstrap)؛ قابلیت انتقال مهارتهای عاملی به محیطهای واقعی متفاوت از شبیهسازیشده؛ تأثیر توزیع وظایف مصنوعی بر توانایی تعمیم.[1][14]
شفافیت و بازتولیدپذیری
bخشی از اطلاعات مربوط به ترکیب دادههای آموزشی، فرایند فیلترینگ، توزیع زبانها و حوزهها فاش نشده یا به طور محدود فاش شده است. این امر ارزیابی دقیق منابع انحراف، بازتولیدپذیری آموزش و اعتبارسنجی مستقل تأثیر اجزای جداگانه (MuonClip، QK-clip) بر پایداری را دشوار میکند. تا وضعیت فوریه ۲۰۲۶، بازتولید کامل آموزش Kimi K2 و K2.5 توسط اشخاص ثالث در ادبیات باز ثبت نشده است.[1][2]
جنبههای اخلاقی و نظارتی
در کارتهای مدل و گزارشهای فنی تأکید شده است که توسعهدهندگان مسئول ورودیها و خروجیهای مدل هستند؛ پیش از استقرار نیاز به افزودن سازوکارهای محافظتی (guardrails) و آزمایش روی دادههای مورد خاص وجود دارد؛ مدل میتواند تصاویر و ویدیوهایی را که احتمالاً حاوی دادههای شخصی هستند پردازش کند و یکپارچهساز موظف است قوانین مرتبط را رعایت کند.[2][16]
در گزارشهای فنی، ارزیابیهای ایمنی (خطرات زیستی، شیمیایی، سایبری) با استفاده از ابزارهایی مانند Promptfoo شرح داده شده است. مدلها از طریق RL با پاداشهای قابل تأیید و خودارزیابی همراستا (alignment) میشوند.[1]
به عنوان محصول یک شرکت چینی، این مدلها تابع مقررات ملی جمهوری خلق چین در حوزه هوش مصنوعی هستند. در زمان نگارش، هیچ سند نظارتی عمومی جداگانهای که صرفاً به مدلهای Kimi اختصاص داشته باشد یافت نشد؛ نظارت در چارچوب رویکردهای کلی نسبت به مدلهای مولد و هوش مصنوعی در حوزههای قضایی مربوطه اعمال میشود.[18]
در فوریه ۲۰۲۶، شرکت Anthropic اعلام کرد که Moonshot AI (همراه با سایر توسعهدهندگان چینی) از حسابهای جعلی برای تولید تعاملات با Claude با هدف تقطیر دادهها برای آموزش مدلها استفاده کرده است. این اطلاعات ماهیت ادعای یک طرف را دارد و تا زمان انتشار توسط تحقیقات مستقل تأیید نشده است؛ Moonshot AI پاسخ رسمی منتشر نکرده است.[5]
چشماندازها و جهتگیریهای پژوهشی
بر اساس مواد منتشرشده، چند جهت برای تحقیقات آتی قابل تشخیص است:
- سیستمهای عاملی مقیاسپذیر. توسعه رویکردهای آموزش LLM به عنوان سیستمهای عاملی با استفاده از ابزارهای مصنوعی، RL و self-judging. گسترش Agent Swarm به تعداد بیشتری زیر-عامل و انواع جدید وظایف.[2][1]
- معماریهای MoE کارآمد. استفاده از ۱ تریلیون پارامتر با ۳۲ میلیارد فعالشونده و ۳۸۴ متخصص یکی از گزینههای مصالحه بین مقیاس و کارایی است؛ گزینههایی با طرحهای مختلف مسیریابی در حال بررسی هستند.[1]
- مولتیمودالیتی بومی. آموزش K2.5 روی دادههای مخلوط بصری-متنی از ابتدای پیشآموزش رویکردی به «مولتیمودالیتی بومی» را نشان میدهد که با طرحهای دو مرحلهای مقایسه میشود.[2][9]
- inference کارآمد و context طولانی. کوانتیزاسیون INT4 و پشتیبانی از context 256٬000 token پژوهشهای بیشتری را در زمینه توجه تُنُک، بازنماییهای نهفته و حافظه خارجی تحریک میکند. به طور جداگانه پروژه Kimi Linear توصیف شده است — توجه خطی ترکیبی با کاهش ۷۵٪ KV-cache و تسریع ۶ برابری decoding در context یک میلیون token.[2][19]
در مواد رسمی Moonshot AI، نقشه راه تفصیلی برای نسخههای آتی Kimi منتشر نمیشود؛ جهتگیریهای فهرستشده بر اساس پژوهشهای منتشرشده است.
همچنین ببینید
- معماری Transformer
- DeepSeek
- Qwen
منابع
- https://www.moonshot.ai/ — وبسایت رسمی Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — مخزن GitHub مربوط به Kimi K2.5
- https://huggingface.co/moonshotai — پروفایل Moonshot AI در Hugging Face
منابع
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692