Kimi (Moonshot AI) (CS)
Kimi (série modelů Moonshot AI) — série velkých jazykových modelů (Large Language Model, LLM), vyvíjených čínskou společností Moonshot AI (Peking, ČLR) pro úlohy textové a multimodální generace, programování a agentních systémů (agentic systems — systémů schopných autonomního plánování, uvažování a jednání s využitím externích nástrojů). Rodina zahrnuje textové a multimodální modely s architekturou Mixture-of-Experts (MoE, směs expertů) v řádu 1 bilionu parametrů a aktivovanou podmnožinou v řádu 32 miliard parametrů na token.[1][2] Důležitou vlastností série je orientace na agentní chování (vícekrokové plánování s voláním externích nástrojů) a podpora dlouhého kontextu až 256 000 tokenů ve verzích Kimi K2 a Kimi K2.5.[1][2]\n\nModely série Kimi jsou distribuovány jak s otevřenými váhami (open-weight) na platformě Hugging Face pod modifikovanou licencí MIT, tak prostřednictvím proprietárního API platformy Moonshot AI Open Platform.[3][4]\n\n== Historie a předpoklady ==\n\n=== Založení Moonshot AI ===\n\nMoonshot AI byla založena v březnu 2023 v Pekingu Yangem Zhilinem (Yang Zhilin, CEO), Zhouem Xinyuem (Zhou Xinyu) a Wu Yuxinem (Wu Yuxin) — absolventy Univerzity Tsinghua (Tsinghua University). Yang Zhilin dříve pracoval v Google Brain a Meta, podílel se na výzkumu v oblasti počítačového vidění a uvažování. Společnost získala financování od Alibaba (kolo ve výši 1 miliardy USD, únor 2024), Tencent a dalších investorů.[5][6]\n\n=== Chronologie klíčových vydání ===\n\n* Říjen–listopad 2023 — spuštění chatbotu Kimi s podporou kontextu až 128 tisíc tokenů (až 200 tisíc čínských znaků). První verze používaly proprietární modely s omezeně zveřejněnými technickými detaily.[6][7]\n* Březen 2024 — rozšíření kontextu na 2 miliony znaků v beta verzi.[6]\n* Leden 2025 — vydání Kimi k1.5 — multimodálního modelu se škálovaným Reinforcement Learning (RL), deklarovaného jako srovnatelného s OpenAI o1 v úlohách matematiky, programování a multimodálního uvažování. Kontext až 128 tisíc tokenů.[8]\n* Duben 2025 — představena Kimi-VL — otevřený multimodální MoE model (vision-language model, VLM) s vizuálním enkodérem MoonViT (~400 milionů parametrů) a ~2,8 miliardami aktivních parametrů v dekodéru. Technická zpráva zveřejněna na arXiv.[9]\n* Červenec 2025 — vydání Kimi K2 — hlavního otevřeného MoE modelu s 1 bilionem parametrů a 32 miliardami aktivních parametrů. Technická zpráva zveřejněna na arXiv.[1] Model obsadil první místo mezi otevřenými modely na LMSYS Chatbot Arena v době vydání (více než 3000 hlasů).[1]\n* Září 2025 — aktualizace Kimi-K2-Instruct-0905 s rozšířeným kontextem na 256 tisíc tokenů a vylepšeným agentním kódováním.[1]\n* Listopad 2025 — vydání Kimi K2 Thinking — verze s posíleným postupným uvažováním (chain-of-thought) a podporou 200–300 po sobě jdoucích volání nástrojů (tool calls).[10]\n* Leden 2026 — představena Kimi K2.5 — multimodální MoE model s nativní multimodalitou a mechanismem Agent Swarm (paralelní orchestrace sub-agentů).[2]\n\nParalelně s vývojem modelů byl v roce 2024 představen vlastní inferenční servis Mooncake — KVCache-centrická dezagregovaná architektura pro obsluhu LLM s dlouhým kontextem.[11]\n\n== Teoretické základy a architektura ==\n\n=== Architektura Mixture-of-Experts ===\n\nModely série Kimi K2 a K2.5 implementují architekturu Transformer s Mixture-of-Experts v samostatných vrstvách. Standardní blok transformeru představuje kompozici vrstev vícehlav\u00e9ho samo-attention (Multi-Head Attention, MHA) a pozičně-wise MLP (vícevrstvého perceptronu) s reziduálními spojeními:[1][12]\n\n\n\nkde — vstupní tokenové reprezentace, — délka sekvence, — velikost skrytého stavu.\n\nV MoE vrstvě se místo jednoho MLP používá sada expertů , z nichž každý představuje samostatný MLP s parametry . Směrovač (gating network) pro každý token vybírá podmnožinu expertů. Výstup MoE vrstvy pro token s reprezentací je definován jako:[1]\n\n\n\nkde — množina vybraných expertů pro daný token, — normalizované váhy směrovače, . Funkce směrování vybírá experty prostřednictvím operace TopK:[1]\n\n\n\nkde — trénovatelná matice směrovače. Toto schéma umožňuje škálovat celkový počet parametrů při omezeném počtu parametrů aktivovaných na každý token.\n\n=== Architektonické hyperparametry Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Parametr !! Hodnota\n|-\n| Typ architektury || Transformer s Mixture-of-Experts\n|-\n| Celkový počet parametrů || 1,04 bilionu\n|-\n| Aktivované parametry na token || 32 miliard\n|-\n| Počet vrstev || 61 (1 hustá + 60 MoE)\n|-\n| Velikost skrytého stavu || 7168\n|-\n| Počet attention hlav || 64\n|-\n| Počet expertů || 384 (8 vybíraných na token + 1 sdílený)\n|-\n| Velikost skrytého stavu experta (MoE hidden size) || 2048\n|-\n| Velikost slovníku || 160 000 tokenů\n|-\n| Aktivační funkce || SwiGLU\n|-\n| Mechanismus attention || Multi-head Latent Attention (MLA)\n|-\n| Maximální kontext || 256 000 tokenů (rozšíření přes YaRN)\n|-\n| Vizuální enkodér (K2.5) || MoonViT-3D, ~400 milionů parametrů\n|}\n[1][2][13]\n\nSparsita (poměr celkového počtu expertů k aktivovanému) činí 48:1 (384 expertů, 8 aktivních), což zajišťuje výrazné snížení výpočetních nákladů oproti hustému (dense) modelu stejného měřítka.[1]\n\n=== Mechanismus Multi-head Latent Attention (MLA) ===\n\nV modelech série Kimi K2/K2.5 se používá mechanismus Multi-head Latent Attention (MLA) — modifikace standardní vícehlav\u00e9 attention zaměřená na zvýšení efektivity a škálovatelnosti. Standardní attention pro jednu vrstvu se vypočítá jako:[12]\n\n\n\nkde — matice dotazů, klíčů a hodnot. V MLA jsou zavedeny latentní reprezentace, na které jsou projektovány dotazy a klíče, což snižuje dimenzionalitu mezioperací a umožňuje zmenšit objem KV-cache. Přístup je analogický mechanismu použitému v DeepSeek-V3.[1][13]\n\n=== Optimalizátor MuonClip a QK-clip ===\n\nPro trénování modelu Kimi K2 byl navržen optimalizátor MuonClip — modifikace optimalizátoru Muon (momentový optimalizátor s normalizací Newton-Schulz) s přidáním techniky QK-clip pro stabilizaci trénování velkých jazykových modelů s MoE architekturou.[1]\n\nQK-clip aplikuje omezení na attention logity prostřednictvím operace oříznutí (clipping). Pro každou attention hlavu je definován maximální logit:\n\n\n\na vypočítá se koeficient škálování:\n\n\n\nkde — hyperparametr-práh, — velikost attention hlavy. Koeficient se používá pro škálování vah , pokud maximální logit překročí práh. To omezuje rozsah hodnot logitů před softmax a snižuje riziko náhlých skoků ztrátové funkce (loss spikes) při trénování ve velkém měřítku.[1]\n\nPo údajích autorů proběhlo předtrénování Kimi K2 na 15,5 bilionu tokenů s MuonClip bez jediného zaznamenaného nárůstu ztrátové funkce (zero loss spikes).[1]\n\n=== Multimodalita a MoonViT ===\n\nModely Kimi K2.5 a Kimi-VL používají vizuální enkodér MoonViT (ve verzi K2.5 — MoonViT-3D) s přibližně 400 miliony parametrů, postavený na základě SigLIP-SO-400M s NaViT-packingem (podpora proměnného rozlišení vstupních obrázků) a 3D rozšířením pro zpracování videa (seskupení po 4 snímcích).[2][9]\n\nVizuální enkodér převádí vstupní obrázky a video na sekvenci vizuálních tokenů. Nechť — vstupní obrázek, — vizuální enkodér:\n\n\n\ndále přes lineární projekci (dvouvrstvý MLP) :\n\n\n\nkde — velikost skrytého prostoru jazykové části modelu. V multimodálním režimu je konkatenováno s textovými tokeny a předáno do transformeru.[9][2]\n\nNa rozdíl od dvoustupňových schémat (přidání vizuálního adaptéru na textový model) byl K2.5 trénován na smíšených vizuálně-textových datech od začátku předtrénování (joint text-vision pre-training), s nízkým podílem vizuálních tokenů (~10 %) v raných fázích a postupným nárůstem. Celkový objem — přibližně 15 bilionů smíšených vizuálně-textových tokenů.[2]\n\n== Předtrénování a dotrénování ==\n\n=== Předtrénování ===\n\nKimi K2 byl předtrénován na 15,5 bilionu tokenů (webové texty, kód, matematika, encyklopedické znalosti) s využitím optimalizátoru MuonClip. Během celého období předtrénování nebyl zaznamenán ani jeden nárůst ztrátové funkce (loss spike).[1]\n\nKimi K2.5 prošel kontinuálním předtrénováním (continual pre-training) od kontrolního bodu K2 na dalších ~15 bilionech smíšených vizuálně-textových tokenů se sdílenou optimalizací modalit (joint pre-training). Samostatně bylo provedeno 1 bilion tokenů standalone trénování vizuálního enkodéru a dodatečná fáze long-context mid-training pro rozšíření kontextu.[2]\n\n=== Dotrénování ===\n\nDotrénování modelů série K2 zahrnuje několik fází:[1][2]\n\nSupervised Fine-Tuning (SFT, řízené doladění):\n* Syntetické agentní trajektorie (agentic data synthesis) — generování specifikací nástrojů, simulace interakcí s prostředím, ověřování výsledků.\n* Pro K2.5 se navíc používá zero-vision SFT — textový SFT aktivující vizuální schopnosti bez přímého využití obrázků ve fázi fine-tuning.\n\nReinforcement Learning (RL, zpětnovazební učení):\n* Kombinace ověřitelných odměn (Reinforcement Learning with Verifiable Rewards, RLVR) pro úlohy matematiky, kódu a bezpečnosti.\n* Sebehodnocení podle rubrik (self-critique rubric rewards) — využití LLM hodnotitelů pro automatické hodnocení kvality agentních scénářů.\n* Pro K2.5 — společné multimodální RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking a K2.5 podporují nativní INT4 kvantizaci vah (weight-only quantization, skupina 32, komprimované tenzory), optimalizovanou pro architekturu NVIDIA Hopper, což snižuje paměťové nároky při inferenci.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nPro model K2.5 byl vyvinut mechanismus Agent Swarm — framework samořízeného paralelního orchestrování agentů. Model-orchestrátor dynamicky vytváří sub-agenty (prostřednictvím operací create_subagent, assign_task), rozděluje dílčí úlohy a shromažďuje výsledky. Každý sub-agent může samostatně volat nástroje a pracovat paralelně s ostatními sub-agenty.[2]\n\nTrénování mechanismu Agent Swarm je realizováno prostřednictvím Parallel-Agent Reinforcement Learning (PARL) s oddělením provádění a optimalizace (decoupling execution/optimization). Podle údajů autorů zajišťuje Agent Swarm snížení latence až 4,5× ve srovnání s jednovláknovým agentním režimem (single-agent).[2]\n\n== Hlavní modely série ==\n\n{| class=\"wikitable\"\n! Model !! Typ !! Parametry (celkové / aktivní) !! Kontext, tokenů !! Multimodalita !! Datum vydání\n|-\n| Kimi k1.5 || LLM, RL-scaling || nezveřejněno || 128 000 || Ano (omezená) || Leden 2025\n|-\n| Kimi-VL || VLM, MoE || kompaktní / ~2,8 miliardy aktivních + 400 milionů ViT || dlouhý kontext || Ano (obrázky) || Duben 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ne (text) || Červenec 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ne (text) || Listopad 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 bilionu / 32 miliard || 256 000 || Ano (obrázky, video, PDF) || Leden 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — Mixture-of-Experts LLM s 1,04 bilionu celkových parametrů a 32 miliardami aktivovaných parametrů na token. Předtrénován na 15,5 bilionu tokenů s optimalizátorem MuonClip. Architektura zahrnuje 384 expertů a mechanismus MLA kompatibilní s dlouhým kontextem. Model je zaměřen na úlohy programování, matematického uvažování a agentních scénářů s postupnými voláními nástrojů.[1]\n\nTechnická zpráva popisuje vícestupňový pipeline dotrénování: rozsáhlou syntézu agentních dat prostřednictvím simulace interakcí s nástroji; Reinforcement Learning ve smíšeném prostředí reálných a syntetických úloh; využití LLM hodnotitelů pro automatické hodnocení kvality.[1][14]\n\n=== Kimi K2 Thinking ===\n\nVarianta Kimi K2 Thinking je optimalizována pro vícekrokové uvažování (chain-of-thought) s možností dynamického volání nástrojů a podporou kontextu až 256 000 tokenů. Model implementuje samostatný režim „Thinking" s explicitně vráceným polem reasoning_content obsahujícím vnitřní úvahy. K2 Thinking podporuje 200–300 po sobě jdoucích volání nástrojů v jedné agentní epizodě bez výrazné degradace chování, jakož i nativní INT4 kvantizaci s využitím QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — otevřený multimodální MoE-VLM (vision-language model) zaměřený na úlohy vizuálního porozumění, vizuálně-textového uvažování a scén reálného světa. Model je popsán jako kompaktní MoE architektura s vizuálním enkodérem MoonViT. Technická zpráva byla zveřejněna na arXiv v dubnu 2025.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — multimodální MoE model v měřítku 1,04 bilionu parametrů s 32 miliardami aktivovaných, založený na kontrolním bodě Kimi-K2-Base s pokračujícím předtrénováním na ~15 bilionech smíšených vizuálně-textových tokenů. Model podporuje vstupy obrázků, videa, PDF a textu s kontextem až 256 000 tokenů.[2]\n\nK2.5 podporuje dva hlavní režimy výstupu:\n* Thinking mode — s explicitním reasoning_content a vícekrokovou generací;\n* Instant mode — bez výstupu úvah, s nižší latencí.[2][13]\n\nModel implementuje nativní INT4 kvantizaci vah (weight-only, skupina 32), optimalizovanou pro architekturu NVIDIA Hopper.[2]\n\n== Klíčové výsledky a benchmarky ==\n\n=== Textové a agentní benchmarky Kimi K2 ===\n\nVýsledky jsou uvedeny pro Kimi-K2-Instruct v režimu non-thinking (bez rozšířeného chain-of-thought) dle údajů technické zprávy.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Zdroj\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nPo vyjádření autorů tyto výsledky řadí K2 mezi přední otevřené modely v režimu bez thinking rozvinutí, zejména v inženýrských a agentních úlohách (ke dni zveřejnění zprávy).[1]\n\n=== Benchmarky Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Zdroj\n|-\n| MMVet (přesnost) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nVýsledky ukazují, že kompaktní multimodální MoE architektura dosahuje úrovně srovnatelné s většími modely při menším počtu aktivních parametrů.[9]\n\n=== Benchmarky Kimi K2.5 ===\n\nVýsledky jsou uvedeny v režimu Thinking (temperature = 1,0; top-p = 0,95; kontext 256 000 tokenů; engine vLLM; hardwarová platforma NVIDIA H200) dle údajů modelové karty na platformě NVIDIA NIM a technické zprávy.[2][13]\n\n{| class=\"wikitable\"\n! Kategorie !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (bez nástrojů) || 30,1\n|-\n| HLE-Full (s nástroji) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nNavíc K2.5 vykazuje pozitivní přenos vizuálního trénování na textové úlohy: +1,7 % na MMLU-Pro a +2,1 % na GPQA-Diamond ve srovnání s textovým základním modelem K2.[2]\n\nKonečné srovnávací hodnocení závisí na výběru metrik a scénářů; výsledky jsou uvedeny dle údajů autorů. Nezávislá validace části benchmarků je ke dni publikace omezená.[2][15]\n\n== Využití ==\n\n=== Textový asistent a vyhledávání ===\n\nPlatforma Kimi se používá jako asistent s podporou zpracování dlouhých dokumentů (výzkumné zprávy, finanční data), automatizované analýzy a online vyhledávání s agregací informací. Moonshot AI uvádí, že Kimi podporuje více než 300 volání nástrojů (tool calls) v rámci jednoho agentního scénáře.[7][4]\n\n=== Programování a inženýrské úlohy ===\n\nKimi K2 a K2.5 dosahují vysokých výsledků na SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench a dalších programovacích benchmarcích. Modely se využívají pro automatizaci oprav chyb v repozitářích, generování a refaktoring kódu, řešení úloh online soudců (OJBench, LiveCodeBench). Technická zpráva K2 uvádí, že model byl trénován na rozsáhlém syntetickém agentním korpusu zahrnujícím interakce se systémy správy verzí, správci balíčků a spouštěcími prostředími.[1][2][14]\n\n=== Multimodální aplikace ===\n\nKimi-VL a K2.5 jsou určeny pro vizuální otázky a odpovědi (VQA) na obrázcích a dokumentech; porozumění dokumentům (OCRBench, OmniDocBench); analýzu videa (VideoMMMU, LongVideoBench); kombinované úlohy programování podle vizuálních specifikací (například generování rozhraní podle rozvržení obrázku). Pro K2.5 jsou popsány scénáře „vision-grounded coding" a „autonomous visual debugging", kde model generuje kód podle vizuálního popisu a iterativně analyzuje vizuální výsledek.[2][9][15]\n\n=== API a nasazení ===\n\nModely jsou dostupné prostřednictvím API platformy Moonshot AI Open Platform s podporou tool calling, thinking režimu, JSON režimu a ukládání kontextu do mezipaměti. Otevřené váhy se používají pro lokální nasazení přes vLLM, SGLang a TensorRT-LLM. Servis Mooncake zajišťuje škálování inference pro dlouhý kontext.[4][11][16]\n\n== Omezení a otevřené problémy ==\n\n=== Požadavky na zdroje ===\n\nMoE modely v měřítku 1 bilionu parametrů, i při aktivovaných 32 miliardách parametrů a INT4 kvantizaci, vyžadují značné paměťové prostředky a propustnost. V inženýrských diskusích o nasazení Kimi K2.5 se zmiňují odhady v řádu stovek gigabajtů video paměti pro úplné načtení modelu; konkrétní čísla závisí na formě kvantizace a frameworku (vLLM, SGLang apod.).[2][17]\n\n=== Halucinace a kvalita generace ===\n\nJako ostatní LLM jsou i modely série Kimi náchylné k halucinacím. V testech FACTS Grounding a FaithJudge byly zaznamenány hodnoty hallucination rate v rozsahu 1,1–7,4 % v RAG scénářích. V non-thinking režimu může model generovat nadbytečné tokeny při nejasných specifikacích nástrojů; při vynuceném zapnutí tool-use výkon klesá u některých úloh.[1]\n\n=== Závislost na syntetických datech a RL pipeline ===\n\nPipeline syntézy agentních dat a zpětnovazebního učení se opírá o rozsáhlou kolekci syntetických nástrojů a scén, jakož i LLM hodnotitelů pro automatické hodnocení (self-judging). Toto schéma generuje otevřené otázky: odolnost vůči zkreslení (bias) sebehodnocení; potenciální degradace při opakované iteraci (bootstrap); přenositelnost agentních dovedností do reálných prostředí odlišných od simulovaných; vliv distribuce syntetických úloh na schopnost zobecnění.[1][14]\n\n=== Transparentnost a reprodukovatelnost ===\n\nČást informací o složení tréninkových dat, procesu filtrování, distribuci jazyků a domén není zveřejněna nebo je zveřejněna omezeně. To ztěžuje přesné hodnocení zdrojů zkreslení, reprodukovatelnost trénování a nezávislou validaci dopadu jednotlivých komponent (MuonClip, QK-clip) na stabilitu. K únoru 2026 nebylo v otevřené literatuře zaznamenáno úplné reprodukování trénování Kimi K2 a K2.5 třetími stranami.[1][2]\n\n== Etické a regulatorní aspekty ==\n\nV modelových kartách a technických zprávách je zdůrazněno, že vývojáři nesou odpovědnost za vstupy a výstupy modelu; je vyžadováno přidání ochranných mechanismů (guardrails) a testování na datech konkrétního případu před nasazením; model může zpracovávat obrázky a video potenciálně obsahující osobní údaje a integrátor je povinen dodržovat příslušné právní předpisy.[2][16]\n\nTechnické zprávy popisují hodnocení bezpečnosti (biologická, chemická, kybernetická rizika) s využitím nástrojů typu Promptfoo. Modely procházejí RL vyrovnáváním (alignment) s ověřitelnými odměnami a sebehodnocením.[1]\n\nJako produkt čínské společnosti podléhají modely národní regulaci ČLR v oblasti AI. V době psaní nebyly nalezeny samostatné veřejné regulatorní dokumenty věnované výhradně modelům Kimi; regulace probíhá v rámci obecných přístupů ke generativním modelům a AI v příslušných jurisdikcích.[18]\n\nV únoru 2026 společnost Anthropic prohlásila, že Moonshot AI (společně s dalšími čínskými vývojáři) používala falešné účty pro generování interakcí s Claude za účelem destilace dat pro trénování modelů. Tato informace má charakter tvrzení jedné strany a není potvrzena nezávislými šetřeními ke dni publikace; Moonshot AI nezveřejnila oficiální vyjádření.[5]\n\n== Perspektivy a směry výzkumu ==\n\nNa základě zveřejněných materiálů lze identifikovat několik směrů dalšího výzkumu:\n\n* Škálovatelné agentní systémy. Rozvoj přístupů k trénování LLM jako agentních systémů s využitím syntetických nástrojů, RL a self-judging. Rozšíření Agent Swarm na větší počet sub-agentů a nové typy úloh.[2][1]\n* Efektivní MoE architektury. Využití 1 bilionu parametrů s 32 miliardami aktivovaných a 384 experty představuje jeden z kompromisů mezi měřítkem a efektivitou; zkoumají se alternativy s různými schématy směrování.[1]\n* Nativní multimodalita. Trénování K2.5 na smíšených vizuálně-textových datech od začátku předtrénování představuje přístup k „nativní" multimodalitě, který je srovnáván s dvoustupňovými schématy.[2][9]\n* Efektivní inference a dlouhý kontext. INT4 kvantizace a podpora kontextu 256 000 tokenů stimulují další výzkum v oblasti řídké attention, latentních reprezentací a externí paměti. Samostatně je popsán projekt Kimi Linear — hybridní lineární attention se snížením KV-cache o 75 % a zrychlením dekódování 6× při kontextu 1 milionu tokenů.[2][19]\n\nV oficiálních materiálech Moonshot AI nejsou zveřejňovány podrobné plány budoucích verzí Kimi; uvedené směry vycházejí ze zveřejněných výzkumů.\n\n== Viz také ==\n* Architektura Transformer\n* DeepSeek\n* Qwen\n\n== Odkazy ==\n* https://www.moonshot.ai/ — oficiální web Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — GitHub repozitář Kimi K2.5\n* https://huggingface.co/moonshotai — profil Moonshot AI na Hugging Face\n\n== Literatura ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Poznámky ==\n\n\n\nTemplate:SEOMeta\n
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692