Kimi (Moonshot AI) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (serye ng mga modelo ng Moonshot AI) — isang serye ng malalaking modelo ng wika (Large Language Model, LLM), na binubuo ng Chinese na kumpanyang Moonshot AI (Beijing, PRC) para sa mga gawain ng pagtukoy ng teksto at multimodal na pagbuo, programming, at agentic systems (agentic systems — mga sistemang may kakayahang autonomous na pagpaplano, pag-iisip, at pagkilos gamit ang mga panlabas na kagamitan). Kasama sa pamilya ang mga modelo ng teksto at multimodal na may Mixture-of-Experts (MoE) na arkitektura na may sukat na humigit-kumulang 1 trilyon na parameter at na-activate na subset na humigit-kumulang 32 bilyon na parameter bawat token.[1][2] Isang mahalagang katangian ng serye ay ang pokus sa agentic na gawi (multi-step na pagpaplano na may mga tawag sa panlabas na kagamitan) at suporta para sa mahabang konteksto na hanggang 256,000 na token sa mga bersyon ng Kimi K2 at Kimi K2.5.[1][2]

Ang mga modelo ng serye ng Kimi ay ipinamamahagi parehong may bukas na mga timbang (open-weight) sa platform ng Hugging Face sa ilalim ng binagong MIT-lisensya, at sa pamamagitan ng proprietary API ng platform ng Moonshot AI Open Platform.[3][4]

Kasaysayan at mga paunang kondisyon

Pagtatag ng Moonshot AI

Ang Moonshot AI ay itinatag noong Marso 2023 sa Beijing nina Yang Zhilin (CEO), Zhou Xinyu, at Wu Yuxin — mga nagtapos mula sa Tsinghua University. Si Yang Zhilin ay dati nang nagtrabaho sa Google Brain at Meta, at lumahok sa pananaliksik sa larangan ng computer vision at pag-iisip. Ang kumpanya ay nakatanggap ng pagpopondo mula sa Alibaba (isang round na nagkakahalaga ng $1 bilyon, Pebrero 2024), Tencent, at iba pang mga mamumuhunan.[5][6]

Kronolohiya ng mga pangunahing release

  • Oktubre–Nobyembre 2023 — paglulunsad ng chatbot na Kimi na may suporta ng konteksto na hanggang 128,000 na token (hanggang 200,000 Chinese na karakter). Ang mga unang bersyon ay gumamit ng mga proprietary na modelo na may limitadong nabunyag na mga teknikal na detalye.[6][7]
  • Marso 2024 — pagpapalawak ng konteksto hanggang 2 milyong karakter sa beta na bersyon.[6]
  • Enero 2025 — paglabas ng Kimi k1.5 — isang multimodal na modelo na may scaled na Reinforcement Learning (RL), na iminungkahing katumbas ng performans ng OpenAI o1 sa mga gawain ng matematika, programming, at multimodal na pag-iisip. Konteksto na hanggang 128,000 na token.[8]
  • Abril 2025 — ipinakita ang Kimi-VL — isang bukas na multimodal na MoE-modelo (vision-language model, VLM) na may visual encoder na MoonViT (~400 milyong parameter) at ~2.8 bilyong aktibong parameter sa decoder. Ang teknikal na ulat ay nailathala sa arXiv.[9]
  • Hulyo 2025 — paglabas ng Kimi K2 — ang pangunahing bukas na MoE-modelo na may 1 trilyon na parameter at 32 bilyong aktibong parameter. Ang teknikal na ulat ay nailathala sa arXiv.[1] Ang modelo ay nanguna sa mga bukas na modelo sa LMSYS Chatbot Arena sa oras ng paglabas nito (mahigit 3,000 boto).[1]
  • Setyembre 2025 — pag-update ng Kimi-K2-Instruct-0905 na may pinalawak na konteksto hanggang 256,000 na token at pinahusay na agentic na pag-coding.[1]
  • Nobyembre 2025 — paglabas ng Kimi K2 Thinking — isang bersyon na may pinahusay na sunud-sunod na pag-iisip (chain-of-thought) at suporta para sa 200–300 magkakasunod na mga tawag sa kagamitan (tool calls).[10]
  • Enero 2026 — ipinakita ang Kimi K2.5 — isang multimodal na MoE-modelo na may native na multimodality at mekanismong Agent Swarm (parallel na orchestration ng mga sub-agent).[2]

Kasabay ng pagbuo ng mga modelo noong 2024, ipinakita ang sariling serbisyo ng inference na Mooncake — isang KVCache-centric na disaggregated na arkitektura para sa pagse-serve ng LLM na may mahabang konteksto.[11]

Mga teoretikal na pundasyon at arkitektura

Arkitektura ng Mixture-of-Experts

Ang mga modelo ng serye ng Kimi K2 at K2.5 ay nagpapatupad ng arkitektura ng Transformer na may Mixture-of-Experts sa mga indibidwal na layer. Ang karaniwang bloke ng transformer ay isang komposisyon ng mga layer ng multi-head self-attention (Multi-Head Attention, MHA) at position-wise MLP (multilayer perceptron) na may residual na koneksyon:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

kung saan ang 𝐇L×d — mga representasyon ng input token, L — haba ng sequence, d — laki ng nakatagong estado.

Sa MoE-layer, sa halip ng isang MLP, ginagamit ang isang set ng mga eksperto {Ei}i=1N, bawat isa ay kumakatawan sa isang hiwalay na MLP na may mga parameter na θi. Ang router (gating network) para sa bawat token ay pumipili ng isang subset ng mga eksperto. Ang output ng MoE-layer para sa token na may representasyong 𝐡 ay tinukoy bilang:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

kung saan ang 𝒮(𝐡){1,,N} — ang set ng mga piniling eksperto para sa ibinigay na token, gi(𝐡) — mga normalized na timbang ng router, i𝒮gi=1. Ang routing function ay pumipili ng mga eksperto sa pamamagitan ng operasyong TopK:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

kung saan ang Wg — isang naaral na matrix ng router. Ang ganitong scheme ay nagbibigay-daan sa pag-scale ng kabuuang bilang ng mga parameter habang nililimitahan ang bilang ng mga parameter na na-activate sa bawat token.

Mga arkitektural na hyperparameter ng Kimi K2 / K2.5

Parameter Halaga
Uri ng arkitektura Transformer na may Mixture-of-Experts
Kabuuang bilang ng mga parameter 1.04 trilyon
Mga na-activate na parameter bawat token 32 bilyon
Bilang ng mga layer 61 (1 makapal + 60 MoE)
Laki ng nakatagong estado 7168
Bilang ng mga attention head 64
Bilang ng mga eksperto 384 (8 na pinipili bawat token + 1 pangkalahatan)
Laki ng nakatagong estado ng eksperto (MoE hidden size) 2048
Laki ng bokabularyo 160,000 na token
Activation function SwiGLU
Mekanismo ng attention Multi-head Latent Attention (MLA)
Pinakamataas na konteksto 256,000 na token (pagpapalawak sa pamamagitan ng YaRN)
Visual encoder (K2.5) MoonViT-3D, ~400 milyong parameter

[1][2][13]

Ang sparsity (ratio ng kabuuang bilang ng mga eksperto sa na-activate na bilang) ay 48:1 (384 na eksperto, 8 aktibo), na nagbibigay ng makabuluhang pagbabawas ng mga gastos sa pagkalkula kumpara sa isang dense na modelo ng parehong sukat.[1]

Mekanismo ng Multi-head Latent Attention (MLA)

Sa mga modelo ng serye ng Kimi K2/K2.5, ginagamit ang mekanismong Multi-head Latent Attention (MLA) — isang pagbabago ng karaniwang multi-head attention na naglalayong mapabuti ang kahusayan at scalability. Ang karaniwang attention para sa isang layer ay kinakalkula bilang:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

kung saan ang 𝐐,𝐊,𝐕L×dk — mga matrix ng mga query, key, at value. Sa MLA, ipinakilala ang mga latent na representasyon kung saan naka-project ang mga query at key, na nagpapababa ng dimensionality ng mga intermediate na operasyon at nagpapahintulot na mabawasan ang dami ng KV-cache. Ang diskarte ay katulad ng mekanismong ginamit sa DeepSeek-V3.[1][13]

Optimizer na MuonClip at QK-clip

Para sa pagsasanay ng modelo ng Kimi K2, iminungkahi ang optimizer na MuonClip — isang pagbabago ng optimizer na Muon (momentum optimizer na may Newton-Schulz normalization) na may karagdagang teknik na QK-clip para sa pagpapanatag ng pagsasanay ng malalaking modelo ng wika na may MoE-arkitektura.[1]

Ang QK-clip ay nag-aaplay ng mga paghihigpit sa mga attention logit na 𝐐𝐊 sa pamamagitan ng operasyong clipping. Para sa bawat attention head na h, natutukoy ang pinakamataas na logit:

Shmax=1dmaxi,j(Qhi(Khj)),

at kinakalkula ang scaling coefficient:

γh=min(1,τShmax),

kung saan ang τ=100 — isang hyperparameter-threshold, d — laki ng attention head. Ang coefficient na γh ay ginagamit para sa pag-scale ng mga timbang na Wq,Wk, kung ang pinakamataas na logit ay lumagpas sa threshold. Nililimitahan nito ang hanay ng mga halaga ng logit bago ang softmax at binabawasan ang panganib ng mga biglaang pagtaas ng pagkawala (loss spikes) sa panahon ng pagsasanay sa malalaking sukat.[1]

Ayon sa mga may-akda, ang pre-training ng Kimi K2 sa 15.5 trilyon na token gamit ang MuonClip ay naganap nang walang ni isang naitala na pagsabog ng loss function (zero loss spikes).[1]

Multimodality at MoonViT

Ang mga modelo ng Kimi K2.5 at Kimi-VL ay gumagamit ng visual encoder na MoonViT (sa bersyon ng K2.5 — MoonViT-3D) na may humigit-kumulang 400 milyong parameter, na itinayo batay sa SigLIP-SO-400M na may NaViT packing (suporta para sa variable resolution ng mga input na larawan) at 3D na pagpapalawak para sa pagpoproseso ng video (pagpapangkat ayon sa 4 na frame).[2][9]

Ang visual encoder ay nagko-convert ng mga input na larawan at video sa isang sequence ng mga visual token. Hayaan ang 𝐗H×W×3 — input na larawan, Φvis — visual encoder:

𝐙vis=Φvis(𝐗)Lv×dv,

karagdagan sa pamamagitan ng linear projection (dalawang-layer na MLP) na 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

kung saan ang d — laki ng nakatagong espasyo ng bahaging pangwika ng modelo. Sa multimodal na mode, ang 𝐇vis ay pinagsama sa mga text token at ipinasa sa transformer.[9][2]

Kaiba sa mga dalawang-yugto na scheme (pagdaragdag ng visual adapter sa ibabaw ng text model), ang K2.5 ay sinanay sa mixed na visual-text na data mula sa simula ng pre-training (joint text-vision pre-training), na may mababang proporsyon ng mga visual token (~10%) sa mga maagang yugto at unti-unting pagtaas. Ang kabuuang dami ay humigit-kumulang 15 trilyon na mixed na visual-text token.[2]

Pre-training at post-training

Pre-training

Ang Kimi K2 ay na-pre-train sa 15.5 trilyon na token (mga web text, code, matematika, encyclopedic na kaalaman) gamit ang optimizer na MuonClip. Wala ni isang pagsabog ng pagkawala (loss spike) ang naitala sa buong panahon ng pre-training.[1]

Ang Kimi K2.5 ay sumailalim sa tuloy-tuloy na pre-training (continual pre-training) mula sa checkpoint ng K2 sa karagdagang ~15 trilyon na mixed na visual-text token na may joint optimization ng mga modalidad (joint pre-training). Hiwalay na isinagawa ang 1 trilyon na token ng standalone training ng visual encoder at isang karagdagang yugto ng long-context mid-training para sa pagpapalawak ng konteksto.[2]

Post-training

Ang post-training ng mga modelo ng serye ng K2 ay kinabibilangan ng ilang yugto:[1][2]

Supervised Fine-Tuning (SFT, kontroladong fine-tuning):

  • Synthetic agentic trajectories (agentic data synthesis) — pagbuo ng mga detalye ng kagamitan, pagmomodelo ng mga pakikipag-ugnayan sa kapaligiran, pag-verify ng mga resulta.
  • Para sa K2.5, karagdagang ginagamit ang zero-vision SFT — text SFT na nag-aaktibo ng mga kakayahang visual nang hindi direktang gumagamit ng mga larawan sa yugto ng fine-tuning.

Reinforcement Learning (RL, pagsasanay na may reinforcement):

  • Kombinasyon ng mga verifiable reward (Reinforcement Learning with Verifiable Rewards, RLVR) para sa mga gawain ng matematika, code, at kaligtasan.
  • Self-critique rubric rewards — paggamit ng mga LLM-evaluator para sa awtomatikong pagtatasa ng kalidad ng mga agentic na senaryo.
  • Para sa K2.5 — joint multimodal RL.

Quantization-Aware Training (QAT):

  • Ang Kimi K2 Thinking at K2.5 ay sumusuporta sa native na INT4 quantization ng mga timbang (weight-only quantization, grupo 32, compressed tensor), na na-optimize para sa arkitektura ng NVIDIA Hopper, na nagpapababa ng mga kinakailangan sa memorya sa panahon ng inference.[10][2]

Agent Swarm (K2.5)

Para sa modelo ng K2.5, binuo ang mekanismong Agent Swarm — isang framework ng self-managed na parallel na orchestration ng mga agent. Ang orchestrator model ay dinamikong lumilikha ng mga sub-agent (sa pamamagitan ng mga operasyong create_subagent, assign_task), namamahagi ng mga subtask, at nangongolekta ng mga resulta. Ang bawat sub-agent ay maaaring independyenteng tumawag ng mga kagamitan at magtrabaho nang kahalintulad sa iba pang mga sub-agent.[2]

Ang pagsasanay ng mekanismong Agent Swarm ay isinagawa sa pamamagitan ng Parallel-Agent Reinforcement Learning (PARL) na may pagpapaghiwalay ng pagpapatupad at optimisasyon (decoupling execution/optimization). Ayon sa mga may-akda, ang Agent Swarm ay nagbibigay ng pagbabawas ng latency na hanggang 4.5× kumpara sa single-thread na agentic mode (single-agent).[2]

Mga pangunahing modelo ng serye

Modelo Uri Mga parameter (kabuuan / aktibo) Konteksto, mga token Multimodality Petsa ng paglabas
Kimi k1.5 LLM, RL-scaling hindi inihayag 128,000 Oo (limitado) Enero 2025
Kimi-VL VLM, MoE compact / ~2.8 bilyong aktibo + 400 milyong ViT mahabang konteksto Oo (mga larawan) Abril 2025
Kimi K2 LLM, MoE 1.04 trilyon / 32 bilyon 256,000 Hindi (teksto) Hulyo 2025
Kimi K2 Thinking LLM, MoE 1.04 trilyon / 32 bilyon 256,000 Hindi (teksto) Nobyembre 2025
Kimi K2.5 VLM-LLM, MoE 1.04 trilyon / 32 bilyon 256,000 Oo (mga larawan, video, PDF) Enero 2026

[8][9][1][10][2]

Kimi K2

Ang Kimi K2 ay isang Mixture-of-Experts LLM na may 1.04 trilyon na kabuuang parameter at 32 bilyong na-activate na parameter bawat token. Na-pre-train sa 15.5 trilyon na token gamit ang optimizer na MuonClip. Kasama sa arkitektura ang 384 na eksperto at mekanismong MLA na compatible sa mahabang konteksto. Ang modelo ay nakatuon sa mga gawain ng programming, mathematical reasoning, at mga agentic na senaryo na may mga sunud-sunod na tawag sa kagamitan.[1]

Sa teknikal na ulat, inilalarawan ang multi-stage na pipeline ng post-training: malaking sukat na synthesis ng agentic na data sa pamamagitan ng pagmomodelo ng mga pakikipag-ugnayan sa mga kagamitan; pagsasanay na may reinforcement sa isang halo ng mga tunay at synthetic na gawain; paggamit ng mga LLM-evaluator para sa awtomatikong pagtatasa ng kalidad.[1][14]

Kimi K2 Thinking

Ang variant ng Kimi K2 Thinking ay na-optimize para sa multi-step reasoning (chain-of-thought) na may kakayahang dynamic na pagtawag ng mga kagamitan at suporta ng konteksto na hanggang 256,000 na token. Ang modelo ay nagpapatupad ng isang hiwalay na mode na "Thinking" na may explicitly na ibinibigay na field na reasoning_content, na naglalaman ng mga panloob na pag-iisip. Sinusuportahan ng K2 Thinking ang 200–300 magkakasunod na tawag sa kagamitan sa isang agentic na episode nang walang makabuluhang pagbaba ng gawi, pati na rin ang native INT4 quantization gamit ang QAT.[10]

Kimi-VL

Ang Kimi-VL ay isang bukas na multimodal na MoE-VLM (vision-language model), na nakatuon sa mga gawain ng visual na pag-unawa, visual-text reasoning, at mga totoong eksena. Ang modelo ay inilalarawan bilang isang compact na MoE-arkitektura na may visual encoder na MoonViT. Ang teknikal na ulat ay nailathala sa arXiv noong Abril 2025.[9]

Kimi K2.5

Ang Kimi K2.5 ay isang multimodal na MoE-modelo na may sukat na 1.04 trilyon na parameter na may 32 bilyong na-activate, batay sa checkpoint ng Kimi-K2-Base na may patuloy na pre-training sa ~15 trilyon na mixed na visual-text token. Sinusuportahan ng modelo ang mga input ng mga larawan, video, PDF, at teksto na may konteksto na hanggang 256,000 na token.[2]

Sinusuportahan ng K2.5 ang dalawang pangunahing mode ng inference:

  • Thinking mode — na may explicit na reasoning_content at multi-step na pagbuo;
  • Instant mode — nang walang output ng pag-iisip, na may mas mababang latency.[2][13]

Ang modelo ay nagpapatupad ng native INT4 quantization ng mga timbang (weight-only, grupo 32), na na-optimize para sa arkitektura ng NVIDIA Hopper.[2]

Mga pangunahing resulta at benchmark

Mga text at agentic benchmark ng Kimi K2

Ang mga resulta ay ibinibigay para sa Kimi-K2-Instruct sa non-thinking mode (nang walang extended na chain-of-thought) ayon sa data ng teknikal na ulat.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Pinagmulan
SWE-Bench Verified (Pass@1) 65.8% 38.8% 72.5% / 72.7% arXiv:2507.20534
SWE-Bench Multilingual 47.3% 20.9% 51.0% arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53.7% 44.7% 46.9% arXiv:2507.20534
Tau2-Bench (micro-avg) 66.1% 48.8% 66.1% arXiv:2507.20534
ACEBench (En) 76.5% 75.6% 80.1% arXiv:2507.20534
AIME 2025 (Avg@64) 49.5% 33.9% 46.7% arXiv:2507.20534
GPQA-Diamond (Avg@8) 75.1% 68.2% 74.9% arXiv:2507.20534

Ayon sa pahayag ng mga may-akda, ang mga resultang ito ay naglalagay sa K2 sa mga lider ng mga bukas na modelo sa mode na walang thinking-deployment, lalo na sa mga gawaing engineering at agentic (sa oras ng publikasyon ng ulat).[1]

Mga benchmark ng Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Pinagmulan
MMVet (katumpakan) 66.7% 67.1% 66.9% arXiv:2504.07491
RealWorldQA 68.1% 68.5% arXiv:2504.07491

Ipinapakita ng mga resulta na ang compact na multimodal na MoE-arkitektura ay umaabot sa isang antas na maihahambing sa mas malalaking modelo na may mas kaunting aktibong parameter.[9]

Mga benchmark ng Kimi K2.5

Ang mga resulta ay ibinibigay sa Thinking mode (temperature = 1.0; top-p = 0.95; konteksto 256,000 na token; engine ng vLLM; hardware platform na NVIDIA H200) ayon sa data ng model card sa platform ng NVIDIA NIM at teknikal na ulat.[2][13]

Kategorya Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (nang walang mga kagamitan) 30.1
HLE-Full (na may mga kagamitan) 50.2
AIME 2025 96.1
HMMT 2025 (Feb) 95.4
GPQA-Diamond 87.6
MMLU-Pro 87.1
Vision & Video MMMU-Pro 78.5
MathVision 84.2
MathVista (mini) 90.1
OCRBench 92.3
OmniDocBench 1.5 88.8
VideoMMMU 86.6
LongVideoBench 79.8
Coding SWE-Bench Verified 76.8
SWE-Bench Pro 50.7
SWE-Bench Multilingual 73.0
Terminal Bench 2.0 50.8
PaperBench 63.5
LiveCodeBench v6 85.0
OJBench (C++) 57.4
Long Context Longbench v2 61.0
AA-LCR 70.0
Agentic Search BrowseComp 60.6
BrowseComp (Agent Swarm) 78.4
WideSearch (iter-F1) 72.7
DeepSearchQA 77.1

Karagdagan pa rito, ang K2.5 ay nagpapakita ng positibong paglipat ng visual na pagsasanay sa mga gawaing teksto: +1.7% sa MMLU-Pro at +2.1% sa GPQA-Diamond kumpara sa text base model na K2.[2]

Ang panghuling comparative na pagtatasa ay nakasalalay sa pagpili ng mga sukatan at senaryo; ang mga resulta ay ibinibigay ayon sa data ng mga may-akda. Ang independyenteng validation ng bahagi ng mga benchmark ay limitado sa oras ng publikasyon.[2][15]

Paggamit

Text assistant at paghahanap

Ang platform ng Kimi ay ginagamit bilang isang assistant na may suporta para sa pagpoproseso ng mahahabang dokumento (mga ulat sa pananaliksik, financial na data), automated na pagsusuri, at online na paghahanap na may aggregation ng impormasyon. Tinukoy ng Moonshot AI na sinusuportahan ng Kimi ang mahigit 300 na tawag sa kagamitan (tool calls) sa loob ng isang agentic na senaryo.[7][4]

Programming at mga gawaing engineering

Ang Kimi K2 at K2.5 ay nagpapakita ng mataas na mga resulta sa SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench, at iba pang mga benchmark ng programming. Ang mga modelo ay ginagamit para sa awtomatikong pag-aayos ng mga bug sa mga repository, pagbuo at pag-refactor ng code, at paglutas ng mga gawain ng online judge (OJBench, LiveCodeBench). Tinutukoy ng teknikal na ulat ng K2 na ang modelo ay sinanay sa isang malaking sukat na synthetic na agentic corpus, kasama ang mga pakikipag-ugnayan sa mga sistema ng version control, package manager, at mga kapaligiran ng pagpapatupad.[1][2][14]

Mga multimodal na aplikasyon

Ang Kimi-VL at K2.5 ay nilayon para sa visual question answering (VQA) sa mga larawan at dokumento; pag-unawa ng dokumento (OCRBench, OmniDocBench); pagsusuri ng video (VideoMMMU, LongVideoBench); at mga pinagsama-samang gawain ng programming ayon sa mga visual na detalye (halimbawa, pagbuo ng interface batay sa larawan ng layout). Para sa K2.5, inilalarawan ang mga senaryo ng "vision-grounded coding" at "autonomous visual debugging", kung saan ang modelo ay bumubuo ng code batay sa visual na paglalarawan at paulit-ulit na sinusuri ang visual na resulta.[2][9][15]

API at pag-deploy

Ang mga modelo ay available sa pamamagitan ng API ng platform ng Moonshot AI Open Platform na may suporta para sa tool calling, thinking mode, JSON mode, at caching ng konteksto. Ang mga bukas na timbang ay ginagamit para sa lokal na pag-deploy sa pamamagitan ng vLLM, SGLang, at TensorRT-LLM. Ang serbisyo ng Mooncake ay nagbibigay ng scaling ng inference para sa mahabang konteksto.[4][11][16]

Mga limitasyon at bukas na problema

Mga kinakailangan sa mapagkukunan

Ang mga MoE-modelo na may sukat na 1 trilyon na parameter, kahit na may 32 bilyong na-activate na parameter at INT4 quantization, ay nangangailangan ng makabuluhang mga mapagkukunan ng memorya at bandwidth. Sa mga talakayan sa engineering tungkol sa pag-deploy ng Kimi K2.5, nabanggit ang mga pagtatantya na may ilang daang gigabyte ng video memory para sa buong pag-load ng modelo; ang mga tiyak na numero ay nakasalalay sa anyo ng quantization at framework (vLLM, SGLang, atbp.).[2][17]

Mga hallucination at kalidad ng pagbuo

Tulad ng iba pang LLM, ang mga modelo ng serye ng Kimi ay may kasamang hallucination. Sa mga ulat ng mga pagsubok sa FACTS Grounding at FaithJudge, naitala ang mga tagapagpakita ng hallucination rate sa loob ng 1.1–7.4% sa mga RAG-senaryo. Sa non-thinking mode, maaaring bumuo ang modelo ng sobrang token kapag may hindi malinaw na mga detalye ng kagamitan; kapag pinilit ang paggamit ng tool-use, bumababa ang performans sa ilang mga gawain.[1]

Pag-asa sa synthetic na data at RL-pipeline

Ang pipeline ng synthesis ng agentic na data at pagsasanay na may reinforcement ay umaasa sa isang malaking koleksyon ng mga synthetic na kagamitan at eksena, pati na rin ang mga LLM-evaluator para sa awtomatikong pagtatasa (self-judging). Ang ganitong scheme ay nagdudulot ng mga bukas na tanong: katatagan laban sa bias ng self-assessment; potensyal na pagbaba sa maraming paulit-ulit na iterasyon (bootstrap); paglilipat ng mga agentic na kasanayan sa mga tunay na kapaligiran na naiiba sa mga simulate; epekto ng pamamahagi ng mga synthetic na gawain sa kakayahang mag-generalize.[1][14]

Transparency at reproducibility

Ang bahagi ng impormasyon tungkol sa komposisyon ng training data, proseso ng pag-filter, pamamahagi ng mga wika at domain ay hindi inihahayag o limitadong inihahayag. Nagpapahirap ito sa tumpak na pagtatasa ng mga pinagmulan ng bias, reproducibility ng pagsasanay, at independyenteng validation ng epekto ng mga indibidwal na component (MuonClip, QK-clip) sa katatagan. Sa oras ng Pebrero 2026, ang kumpletong reproducibility ng pagsasanay ng Kimi K2 at K2.5 ng mga third party ay hindi naitala sa bukas na literatura.[1][2]

Mga etikal at regulasyon na aspeto

Sa mga model card at teknikal na ulat, binibigyang-diin na ang mga developer ay may responsibilidad para sa mga input at output ng modelo; kinakailangan ang pagdaragdag ng mga protective mechanism (guardrails) at pagsubok sa data ng partikular na kaso bago ipatupad; maaaring iproseso ng modelo ang mga larawan at video na potensyal na naglalaman ng personal na data, at ang integrator ay obligado na sumunod sa naaangkop na batas.[2][16]

Sa mga teknikal na ulat, inilalarawan ang mga pagtatasa ng kaligtasan (mga biolohikal, kemikal, at cyberisk) gamit ang mga kagamitan tulad ng Promptfoo. Ang mga modelo ay sumasailalim sa RL alignment na may verifiable na mga reward at self-assessment.[1]

Bilang produkto ng isang Chinese na kumpanya, ang mga modelo ay sumusunod sa pambansang regulasyon ng PRC sa larangan ng AI. Sa oras ng pagsulat, walang nahanap na hiwalay na pampublikong regulasyong dokumento na nakatuon nang eksklusibo sa mga modelo ng Kimi; ang regulasyon ay isinasagawa sa loob ng pangkalahatang mga diskarte sa mga generative na modelo at AI sa mga nauugnay na hurisdiksyon.[18]

Noong Pebrero 2026, isinaalang-alang ng Anthropic na ang Moonshot AI (kasama ang iba pang mga Chinese na developer) ay gumamit ng mga pekeng account para bumuo ng mga pakikipag-ugnayan sa Claude para sa layunin ng distillation ng data para sa pagsasanay ng mga modelo. Ang impormasyon ay may katangian ng pahayag ng isang panig at hindi kumpirmado ng mga independyenteng imbestigasyon sa oras ng publikasyon; ang Moonshot AI ay hindi nag-publish ng opisyal na tugon.[5]

Mga pananaw at direksyon ng pananaliksik

Batay sa mga nailathala na materyales, maaaring matukoy ang ilang direksyon ng karagdagang pananaliksik:

  • Mga scalable na agentic na sistema. Pag-unlad ng mga diskarte sa pagsasanay ng LLM bilang mga agentic na sistema gamit ang synthetic na kagamitan, RL, at self-judging. Pagpapalawak ng Agent Swarm sa mas maraming sub-agent at mga bagong uri ng gawain.[2][1]
  • Mga efficient na MoE-arkitektura. Ang paggamit ng 1 trilyon na parameter na may 32 bilyong na-activate at 384 na eksperto ay kumakatawan sa isa sa mga variant ng kompromiso sa pagitan ng sukat at kahusayan; pinag-aaralan ang mga alternatibo na may iba't ibang routing scheme.[1]
  • Native na multimodality. Ang pagsasanay ng K2.5 sa mixed na visual-text na data mula sa simula ng pre-training ay kumakatawan sa isang diskarte sa "native" na multimodality, na inihambing sa mga dalawang-yugto na scheme.[2][9]
  • Efficient na inference at mahabang konteksto. Ang INT4 quantization at suporta ng konteksto na 256,000 na token ay nagpapasigla ng karagdagang pananaliksik sa larangan ng sparse attention, mga latent na representasyon, at panlabas na memorya. Hiwalay na inilalarawan ang proyekto ng Kimi Linear — hybrid na linear attention na may 75% na pagbabawas ng KV-cache at 6× na pagpapabilis ng decoding sa konteksto ng 1 milyong token.[2][19]

Sa mga opisyal na materyales, hindi nag-publish ang Moonshot AI ng mga detalyadong roadmap para sa mga susunod na bersyon ng Kimi; ang mga nakalista na direksyon ay batay sa mga nailathala na pananaliksik.

Tingnan din

  • Arkitektura ng Transformer
  • DeepSeek
  • Qwen

Mga sanggunian

Literatura

Mga tala

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692