Kimi (Moonshot AI) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (série modelů Moonshot AI) — série velkých jazykových modelů (Large Language Model, LLM), vyvíjených čínskou společností Moonshot AI (Peking, ČLR) pro úlohy textové a multimodální generace, programování a agentních systémů (agentic systems — systémů schopných autonomního plánování, uvažování a jednání s využitím externích nástrojů). Rodina zahrnuje textové a multimodální modely s architekturou Mixture-of-Experts (MoE, směs expertů) v řádu 1 bilionu parametrů a aktivovanou podmnožinou v řádu 32 miliard parametrů na token.[1][2] Důležitou vlastností série je orientace na agentní chování (vícekrokové plánování s voláním externích nástrojů) a podpora dlouhého kontextu až 256 000 tokenů ve verzích Kimi K2 a Kimi K2.5.[1][2]\n\nModely série Kimi jsou distribuovány jak s otevřenými váhami (open-weight) na platformě Hugging Face pod modifikovanou licencí MIT, tak prostřednictvím proprietárního API platformy Moonshot AI Open Platform.[3][4]\n\n== Historie a předpoklady ==\n\n=== Založení Moonshot AI ===\n\nMoonshot AI byla založena v březnu 2023 v Pekingu Yangem Zhilinem (Yang Zhilin, CEO), Zhouem Xinyuem (Zhou Xinyu) a Wu Yuxinem (Wu Yuxin) — absolventy Univerzity Tsinghua (Tsinghua University). Yang Zhilin dříve pracoval v Google Brain a Meta, podílel se na výzkumu v oblasti počítačového vidění a uvažování. Společnost získala financování od Alibaba (kolo ve výši 1 miliardy USD, únor 2024), Tencent a dalších investorů.[5][6]\n\n=== Chronologie klíčových vydání ===\n\n* Říjen–listopad 2023 — spuštění chatbotu Kimi s podporou kontextu až 128 tisíc tokenů (až 200 tisíc čínských znaků). První verze používaly proprietární modely s omezeně zveřejněnými technickými detaily.[6][7]\n* Březen 2024 — rozšíření kontextu na 2 miliony znaků v beta verzi.[6]\n* Leden 2025 — vydání Kimi k1.5 — multimodálního modelu se škálovaným Reinforcement Learning (RL), deklarovaného jako srovnatelného s OpenAI o1 v úlohách matematiky, programování a multimodálního uvažování. Kontext až 128 tisíc tokenů.[8]\n* Duben 2025 — představena Kimi-VL — otevřený multimodální MoE model (vision-language model, VLM) s vizuálním enkodérem MoonViT (~400 milionů parametrů) a ~2,8 miliardami aktivních parametrů v dekodéru. Technická zpráva zveřejněna na arXiv.[9]\n* Červenec 2025 — vydání Kimi K2 — hlavního otevřeného MoE modelu s 1 bilionem parametrů a 32 miliardami aktivních parametrů. Technická zpráva zveřejněna na arXiv.[1] Model obsadil první místo mezi otevřenými modely na LMSYS Chatbot Arena v době vydání (více než 3000 hlasů).[1]\n* Září 2025 — aktualizace Kimi-K2-Instruct-0905 s rozšířeným kontextem na 256 tisíc tokenů a vylepšeným agentním kódováním.[1]\n* Listopad 2025 — vydání Kimi K2 Thinking — verze s posíleným postupným uvažováním (chain-of-thought) a podporou 200–300 po sobě jdoucích volání nástrojů (tool calls).[10]\n* Leden 2026 — představena Kimi K2.5 — multimodální MoE model s nativní multimodalitou a mechanismem Agent Swarm (paralelní orchestrace sub-agentů).[2]\n\nParalelně s vývojem modelů byl v roce 2024 představen vlastní inferenční servis Mooncake — KVCache-centrická dezagregovaná architektura pro obsluhu LLM s dlouhým kontextem.[11]\n\n== Teoretické základy a architektura ==\n\n=== Architektura Mixture-of-Experts ===\n\nModely série Kimi K2 a K2.5 implementují architekturu Transformer s Mixture-of-Experts v samostatných vrstvách. Standardní blok transformeru představuje kompozici vrstev vícehlav\u00e9ho samo-attention (Multi-Head Attention, MHA) a pozičně-wise MLP (vícevrstvého perceptronu) s reziduálními spojeními:[1][12]\n\n𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,\n\nkde 𝐇L×d — vstupní tokenové reprezentace, L — délka sekvence, d — velikost skrytého stavu.\n\nV MoE vrstvě se místo jednoho MLP používá sada expertů {Ei}i=1N, z nichž každý představuje samostatný MLP s parametry θi. Směrovač (gating network) pro každý token vybírá podmnožinu expertů. Výstup MoE vrstvy pro token s reprezentací 𝐡 je definován jako:[1]\n\nMoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),\n\nkde 𝒮(𝐡){1,,N} — množina vybraných expertů pro daný token, gi(𝐡) — normalizované váhy směrovače, i𝒮gi=1. Funkce směrování vybírá experty prostřednictvím operace TopK:[1]\n\ng(𝐡)=TopK(Softmax(𝐡Wg)),\n\nkde Wg — trénovatelná matice směrovače. Toto schéma umožňuje škálovat celkový počet parametrů při omezeném počtu parametrů aktivovaných na každý token.\n\n=== Architektonické hyperparametry Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Parametr !! Hodnota\n|-\n| Typ architektury || Transformer s Mixture-of-Experts\n|-\n| Celkový počet parametrů || 1,04 bilionu\n|-\n| Aktivované parametry na token || 32 miliard\n|-\n| Počet vrstev || 61 (1 hustá + 60 MoE)\n|-\n| Velikost skrytého stavu || 7168\n|-\n| Počet attention hlav || 64\n|-\n| Počet expertů || 384 (8 vybíraných na token + 1 sdílený)\n|-\n| Velikost skrytého stavu experta (MoE hidden size) || 2048\n|-\n| Velikost slovníku || 160 000 tokenů\n|-\n| Aktivační funkce || SwiGLU\n|-\n| Mechanismus attention || Multi-head Latent Attention (MLA)\n|-\n| Maximální kontext || 256 000 tokenů (rozšíření přes YaRN)\n|-\n| Vizuální enkodér (K2.5) || MoonViT-3D, ~400 milionů parametrů\n|}\n[1][2][13]\n\nSparsita (poměr celkového počtu expertů k aktivovanému) činí 48:1 (384 expertů, 8 aktivních), což zajišťuje výrazné snížení výpočetních nákladů oproti hustému (dense) modelu stejného měřítka.[1]\n\n=== Mechanismus Multi-head Latent Attention (MLA) ===\n\nV modelech série Kimi K2/K2.5 se používá mechanismus Multi-head Latent Attention (MLA) — modifikace standardní vícehlav\u00e9 attention zaměřená na zvýšení efektivity a škálovatelnosti. Standardní attention pro jednu vrstvu se vypočítá jako:[12]\n\nAttention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,\n\nkde 𝐐,𝐊,𝐕L×dk — matice dotazů, klíčů a hodnot. V MLA jsou zavedeny latentní reprezentace, na které jsou projektovány dotazy a klíče, což snižuje dimenzionalitu mezioperací a umožňuje zmenšit objem KV-cache. Přístup je analogický mechanismu použitému v DeepSeek-V3.[1][13]\n\n=== Optimalizátor MuonClip a QK-clip ===\n\nPro trénování modelu Kimi K2 byl navržen optimalizátor MuonClip — modifikace optimalizátoru Muon (momentový optimalizátor s normalizací Newton-Schulz) s přidáním techniky QK-clip pro stabilizaci trénování velkých jazykových modelů s MoE architekturou.[1]\n\nQK-clip aplikuje omezení na attention logity 𝐐𝐊 prostřednictvím operace oříznutí (clipping). Pro každou attention hlavu h je definován maximální logit:\n\nShmax=1dmaxi,j(Qhi(Khj)),\n\na vypočítá se koeficient škálování:\n\nγh=min(1,τShmax),\n\nkde τ=100 — hyperparametr-práh, d — velikost attention hlavy. Koeficient γh se používá pro škálování vah Wq,Wk, pokud maximální logit překročí práh. To omezuje rozsah hodnot logitů před softmax a snižuje riziko náhlých skoků ztrátové funkce (loss spikes) při trénování ve velkém měřítku.[1]\n\nPo údajích autorů proběhlo předtrénování Kimi K2 na 15,5 bilionu tokenů s MuonClip bez jediného zaznamenaného nárůstu ztrátové funkce (zero loss spikes).[1]\n\n=== Multimodalita a MoonViT ===\n\nModely Kimi K2.5 a Kimi-VL používají vizuální enkodér MoonViT (ve verzi K2.5 — MoonViT-3D) s přibližně 400 miliony parametrů, postavený na základě SigLIP-SO-400M s NaViT-packingem (podpora proměnného rozlišení vstupních obrázků) a 3D rozšířením pro zpracování videa (seskupení po 4 snímcích).[2][9]\n\nVizuální enkodér převádí vstupní obrázky a video na sekvenci vizuálních tokenů. Nechť 𝐗H×W×3 — vstupní obrázek, Φvis — vizuální enkodér:\n\n𝐙vis=Φvis(𝐗)Lv×dv,\n\ndále přes lineární projekci (dvouvrstvý MLP) 𝐏dv×d:\n\n𝐇vis=𝐙vis𝐏,\n\nkde d — velikost skrytého prostoru jazykové části modelu. V multimodálním režimu je 𝐇vis konkatenováno s textovými tokeny a předáno do transformeru.[9][2]\n\nNa rozdíl od dvoustupňových schémat (přidání vizuálního adaptéru na textový model) byl K2.5 trénován na smíšených vizuálně-textových datech od začátku předtrénování (joint text-vision pre-training), s nízkým podílem vizuálních tokenů (~10 %) v raných fázích a postupným nárůstem. Celkový objem — přibližně 15 bilionů smíšených vizuálně-textových tokenů.[2]\n\n== Předtrénování a dotrénování ==\n\n=== Předtrénování ===\n\nKimi K2 byl předtrénován na 15,5 bilionu tokenů (webové texty, kód, matematika, encyklopedické znalosti) s využitím optimalizátoru MuonClip. Během celého období předtrénování nebyl zaznamenán ani jeden nárůst ztrátové funkce (loss spike).[1]\n\nKimi K2.5 prošel kontinuálním předtrénováním (continual pre-training) od kontrolního bodu K2 na dalších ~15 bilionech smíšených vizuálně-textových tokenů se sdílenou optimalizací modalit (joint pre-training). Samostatně bylo provedeno 1 bilion tokenů standalone trénování vizuálního enkodéru a dodatečná fáze long-context mid-training pro rozšíření kontextu.[2]\n\n=== Dotrénování ===\n\nDotrénování modelů série K2 zahrnuje několik fází:[1][2]\n\nSupervised Fine-Tuning (SFT, řízené doladění):\n* Syntetické agentní trajektorie (agentic data synthesis) — generování specifikací nástrojů, simulace interakcí s prostředím, ověřování výsledků.\n* Pro K2.5 se navíc používá zero-vision SFT — textový SFT aktivující vizuální schopnosti bez přímého využití obrázků ve fázi fine-tuning.\n\nReinforcement Learning (RL, zpětnovazební učení):\n* Kombinace ověřitelných odměn (Reinforcement Learning with Verifiable Rewards, RLVR) pro úlohy matematiky, kódu a bezpečnosti.\n* Sebehodnocení podle rubrik (self-critique rubric rewards) — využití LLM hodnotitelů pro automatické hodnocení kvality agentních scénářů.\n* Pro K2.5 — společné multimodální RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking a K2.5 podporují nativní INT4 kvantizaci vah (weight-only quantization, skupina 32, komprimované tenzory), optimalizovanou pro architekturu NVIDIA Hopper, což snižuje paměťové nároky při inferenci.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nPro model K2.5 byl vyvinut mechanismus Agent Swarm — framework samořízeného paralelního orchestrování agentů. Model-orchestrátor dynamicky vytváří sub-agenty (prostřednictvím operací create_subagent, assign_task), rozděluje dílčí úlohy a shromažďuje výsledky. Každý sub-agent může samostatně volat nástroje a pracovat paralelně s ostatními sub-agenty.[2]\n\nTrénování mechanismu Agent Swarm je realizováno prostřednictvím Parallel-Agent Reinforcement Learning (PARL) s oddělením provádění a optimalizace (decoupling execution/optimization). Podle údajů autorů zajišťuje Agent Swarm snížení latence až 4,5× ve srovnání s jednovláknovým agentním režimem (single-agent).[2]\n\n== Hlavní modely série ==\n\n{| class=\"wikitable\"\n! Model !! Typ !! Parametry (celkové / aktivní) !! Kontext, tokenů !! Multimodalita !! Datum vydání\n|-\n| Kimi k1.5 || LLM, RL-scaling || nezveřejněno || 128 000 || Ano (omezená) || Leden 2025\n|-\n| Kimi-VL || VLM, MoE || kompaktní / ~2,8 miliardy aktivních + 400 milionů ViT || dlouhý kontext || Ano (obrázky) || Duben 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ne (text) || Červenec 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ne (text) || Listopad 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ano (obrázky, video, PDF) || Leden 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — Mixture-of-Experts LLM s 1,04 bilionu celkových parametrů a 32 miliardami aktivovaných parametrů na token. Předtrénován na 15,5 bilionu tokenů s optimalizátorem MuonClip. Architektura zahrnuje 384 expertů a mechanismus MLA kompatibilní s dlouhým kontextem. Model je zaměřen na úlohy programování, matematického uvažování a agentních scénářů s postupnými voláními nástrojů.[1]\n\nTechnická zpráva popisuje vícestupňový pipeline dotrénování: rozsáhlou syntézu agentních dat prostřednictvím simulace interakcí s nástroji; Reinforcement Learning ve smíšeném prostředí reálných a syntetických úloh; využití LLM hodnotitelů pro automatické hodnocení kvality.[1][14]\n\n=== Kimi K2 Thinking ===\n\nVarianta Kimi K2 Thinking je optimalizována pro vícekrokové uvažování (chain-of-thought) s možností dynamického volání nástrojů a podporou kontextu až 256 000 tokenů. Model implementuje samostatný režim „Thinking" s explicitně vráceným polem reasoning_content obsahujícím vnitřní úvahy. K2 Thinking podporuje 200–300 po sobě jdoucích volání nástrojů v jedné agentní epizodě bez výrazné degradace chování, jakož i nativní INT4 kvantizaci s využitím QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — otevřený multimodální MoE-VLM (vision-language model) zaměřený na úlohy vizuálního porozumění, vizuálně-textového uvažování a scén reálného světa. Model je popsán jako kompaktní MoE architektura s vizuálním enkodérem MoonViT. Technická zpráva byla zveřejněna na arXiv v dubnu 2025.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — multimodální MoE model v měřítku 1,04 bilionu parametrů s 32 miliardami aktivovaných, založený na kontrolním bodě Kimi-K2-Base s pokračujícím předtrénováním na ~15 bilionech smíšených vizuálně-textových tokenů. Model podporuje vstupy obrázků, videa, PDF a textu s kontextem až 256 000 tokenů.[2]\n\nK2.5 podporuje dva hlavní režimy výstupu:\n* Thinking mode — s explicitním reasoning_content a vícekrokovou generací;\n* Instant mode — bez výstupu úvah, s nižší latencí.[2][13]\n\nModel implementuje nativní INT4 kvantizaci vah (weight-only, skupina 32), optimalizovanou pro architekturu NVIDIA Hopper.[2]\n\n== Klíčové výsledky a benchmarky ==\n\n=== Textové a agentní benchmarky Kimi K2 ===\n\nVýsledky jsou uvedeny pro Kimi-K2-Instruct v režimu non-thinking (bez rozšířeného chain-of-thought) dle údajů technické zprávy.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Zdroj\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nPo vyjádření autorů tyto výsledky řadí K2 mezi přední otevřené modely v režimu bez thinking rozvinutí, zejména v inženýrských a agentních úlohách (ke dni zveřejnění zprávy).[1]\n\n=== Benchmarky Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Zdroj\n|-\n| MMVet (přesnost) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nVýsledky ukazují, že kompaktní multimodální MoE architektura dosahuje úrovně srovnatelné s většími modely při menším počtu aktivních parametrů.[9]\n\n=== Benchmarky Kimi K2.5 ===\n\nVýsledky jsou uvedeny v režimu Thinking (temperature = 1,0; top-p = 0,95; kontext 256 000 tokenů; engine vLLM; hardwarová platforma NVIDIA H200) dle údajů modelové karty na platformě NVIDIA NIM a technické zprávy.[2][13]\n\n{| class=\"wikitable\"\n! Kategorie !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (bez nástrojů) || 30,1\n|-\n| HLE-Full (s nástroji) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nNavíc K2.5 vykazuje pozitivní přenos vizuálního trénování na textové úlohy: +1,7 % na MMLU-Pro a +2,1 % na GPQA-Diamond ve srovnání s textovým základním modelem K2.[2]\n\nKonečné srovnávací hodnocení závisí na výběru metrik a scénářů; výsledky jsou uvedeny dle údajů autorů. Nezávislá validace části benchmarků je ke dni publikace omezená.[2][15]\n\n== Využití ==\n\n=== Textový asistent a vyhledávání ===\n\nPlatforma Kimi se používá jako asistent s podporou zpracování dlouhých dokumentů (výzkumné zprávy, finanční data), automatizované analýzy a online vyhledávání s agregací informací. Moonshot AI uvádí, že Kimi podporuje více než 300 volání nástrojů (tool calls) v rámci jednoho agentního scénáře.[7][4]\n\n=== Programování a inženýrské úlohy ===\n\nKimi K2 a K2.5 dosahují vysokých výsledků na SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench a dalších programovacích benchmarcích. Modely se využívají pro automatizaci oprav chyb v repozitářích, generování a refaktoring kódu, řešení úloh online soudců (OJBench, LiveCodeBench). Technická zpráva K2 uvádí, že model byl trénován na rozsáhlém syntetickém agentním korpusu zahrnujícím interakce se systémy správy verzí, správci balíčků a spouštěcími prostředími.[1][2][14]\n\n=== Multimodální aplikace ===\n\nKimi-VL a K2.5 jsou určeny pro vizuální otázky a odpovědi (VQA) na obrázcích a dokumentech; porozumění dokumentům (OCRBench, OmniDocBench); analýzu videa (VideoMMMU, LongVideoBench); kombinované úlohy programování podle vizuálních specifikací (například generování rozhraní podle rozvržení obrázku). Pro K2.5 jsou popsány scénáře „vision-grounded coding" a „autonomous visual debugging", kde model generuje kód podle vizuálního popisu a iterativně analyzuje vizuální výsledek.[2][9][15]\n\n=== API a nasazení ===\n\nModely jsou dostupné prostřednictvím API platformy Moonshot AI Open Platform s podporou tool calling, thinking režimu, JSON režimu a ukládání kontextu do mezipaměti. Otevřené váhy se používají pro lokální nasazení přes vLLM, SGLang a TensorRT-LLM. Servis Mooncake zajišťuje škálování inference pro dlouhý kontext.[4][11][16]\n\n== Omezení a otevřené problémy ==\n\n=== Požadavky na zdroje ===\n\nMoE modely v měřítku 1 bilionu parametrů, i při aktivovaných 32 miliardách parametrů a INT4 kvantizaci, vyžadují značné paměťové prostředky a propustnost. V inženýrských diskusích o nasazení Kimi K2.5 se zmiňují odhady v řádu stovek gigabajtů video paměti pro úplné načtení modelu; konkrétní čísla závisí na formě kvantizace a frameworku (vLLM, SGLang apod.).[2][17]\n\n=== Halucinace a kvalita generace ===\n\nJako ostatní LLM jsou i modely série Kimi náchylné k halucinacím. V testech FACTS Grounding a FaithJudge byly zaznamenány hodnoty hallucination rate v rozsahu 1,1–7,4 % v RAG scénářích. V non-thinking režimu může model generovat nadbytečné tokeny při nejasných specifikacích nástrojů; při vynuceném zapnutí tool-use výkon klesá u některých úloh.[1]\n\n=== Závislost na syntetických datech a RL pipeline ===\n\nPipeline syntézy agentních dat a zpětnovazebního učení se opírá o rozsáhlou kolekci syntetických nástrojů a scén, jakož i LLM hodnotitelů pro automatické hodnocení (self-judging). Toto schéma generuje otevřené otázky: odolnost vůči zkreslení (bias) sebehodnocení; potenciální degradace při opakované iteraci (bootstrap); přenositelnost agentních dovedností do reálných prostředí odlišných od simulovaných; vliv distribuce syntetických úloh na schopnost zobecnění.[1][14]\n\n=== Transparentnost a reprodukovatelnost ===\n\nČást informací o složení tréninkových dat, procesu filtrování, distribuci jazyků a domén není zveřejněna nebo je zveřejněna omezeně. To ztěžuje přesné hodnocení zdrojů zkreslení, reprodukovatelnost trénování a nezávislou validaci dopadu jednotlivých komponent (MuonClip, QK-clip) na stabilitu. K únoru 2026 nebylo v otevřené literatuře zaznamenáno úplné reprodukování trénování Kimi K2 a K2.5 třetími stranami.[1][2]\n\n== Etické a regulatorní aspekty ==\n\nV modelových kartách a technických zprávách je zdůrazněno, že vývojáři nesou odpovědnost za vstupy a výstupy modelu; je vyžadováno přidání ochranných mechanismů (guardrails) a testování na datech konkrétního případu před nasazením; model může zpracovávat obrázky a video potenciálně obsahující osobní údaje a integrátor je povinen dodržovat příslušné právní předpisy.[2][16]\n\nTechnické zprávy popisují hodnocení bezpečnosti (biologická, chemická, kybernetická rizika) s využitím nástrojů typu Promptfoo. Modely procházejí RL vyrovnáváním (alignment) s ověřitelnými odměnami a sebehodnocením.[1]\n\nJako produkt čínské společnosti podléhají modely národní regulaci ČLR v oblasti AI. V době psaní nebyly nalezeny samostatné veřejné regulatorní dokumenty věnované výhradně modelům Kimi; regulace probíhá v rámci obecných přístupů ke generativním modelům a AI v příslušných jurisdikcích.[18]\n\nV únoru 2026 společnost Anthropic prohlásila, že Moonshot AI (společně s dalšími čínskými vývojáři) používala falešné účty pro generování interakcí s Claude za účelem destilace dat pro trénování modelů. Tato informace má charakter tvrzení jedné strany a není potvrzena nezávislými šetřeními ke dni publikace; Moonshot AI nezveřejnila oficiální vyjádření.[5]\n\n== Perspektivy a směry výzkumu ==\n\nNa základě zveřejněných materiálů lze identifikovat několik směrů dalšího výzkumu:\n\n* Škálovatelné agentní systémy. Rozvoj přístupů k trénování LLM jako agentních systémů s využitím syntetických nástrojů, RL a self-judging. Rozšíření Agent Swarm na větší počet sub-agentů a nové typy úloh.[2][1]\n* Efektivní MoE architektury. Využití 1 bilionu parametrů s 32 miliardami aktivovaných a 384 experty představuje jeden z kompromisů mezi měřítkem a efektivitou; zkoumají se alternativy s různými schématy směrování.[1]\n* Nativní multimodalita. Trénování K2.5 na smíšených vizuálně-textových datech od začátku předtrénování představuje přístup k „nativní" multimodalitě, který je srovnáván s dvoustupňovými schématy.[2][9]\n* Efektivní inference a dlouhý kontext. INT4 kvantizace a podpora kontextu 256 000 tokenů stimulují další výzkum v oblasti řídké attention, latentních reprezentací a externí paměti. Samostatně je popsán projekt Kimi Linear — hybridní lineární attention se snížením KV-cache o 75 % a zrychlením dekódování 6× při kontextu 1 milionu tokenů.[2][19]\n\nV oficiálních materiálech Moonshot AI nejsou zveřejňovány podrobné plány budoucích verzí Kimi; uvedené směry vycházejí ze zveřejněných výzkumů.\n\n== Viz také ==\n* Architektura Transformer\n* DeepSeek\n* Qwen\n\n== Odkazy ==\n* https://www.moonshot.ai/ — oficiální web Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — GitHub repozitář Kimi K2.5\n* https://huggingface.co/moonshotai — profil Moonshot AI na Hugging Face\n\n== Literatura ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Poznámky ==\n\n\n\nTemplate:SEOMeta\n

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692