Kimi (Moonshot AI) (SV)
Kimi (modellserien Moonshot AI) — en serie stora språkmodeller (Large Language Model, LLM), utvecklade av det kinesiska företaget Moonshot AI (Peking, Kina) för uppgifter inom textgenerering och multimodal generering, programmering samt agentbaserade system (agentic systems — system med förmåga till autonom planering, resonemang och handling med hjälp av externa verktyg). Familjen inkluderar text- och multimodala modeller med Mixture-of-Experts-arkitektur (MoE) i storleksordningen 1 biljon parametrar och ett aktiverat delmängd i storleksordningen 32 miljarder parametrar per token.[1][2] Ett viktigt kännetecken för serien är inriktningen på agentbeteende (flerstegplanering med anrop av externa verktyg) och stöd för lång kontext upp till 256 000 token i versionerna Kimi K2 och Kimi K2.5.[1][2]
Modellerna i Kimi-serien distribueras både med öppna vikter (open-weight) på plattformen Hugging Face under en modifierad MIT-licens, och via det proprietära API:et på Moonshot AI Open Platform.[3][4]
Historia och förutsättningar
Grundandet av Moonshot AI
Moonshot AI grundades i mars 2023 i Peking av Yang Zhilin (CEO), Zhou Xinyu och Wu Yuxin — alumner från Tsinghua University. Yang Zhilin hade tidigare arbetat på Google Brain och Meta och deltagit i forskning inom datorseende och resonemang. Företaget erhöll finansiering från Alibaba (investeringsrunda på 1 miljard dollar, februari 2024), Tencent och andra investerare.[5][6]
Tidslinje över viktiga releaser
- Oktober–november 2023 — lansering av chatboten Kimi med stöd för kontext upp till 128 000 token (upp till 200 000 kinesiska tecken). De första versionerna använde proprietära modeller med begränsad teknisk transparens.[6][7]
- Mars 2024 — utökning av kontexten till 2 miljoner tecken i betaversion.[6]
- Januari 2025 — lansering av Kimi k1.5 — en multimodal modell med skalad Reinforcement Learning (RL), presenterad som jämförbar i prestanda med OpenAI o1 inom matematik, programmering och multimodalt resonemang. Kontext upp till 128 000 token.[8]
- April 2025 — presentation av Kimi-VL — en öppen multimodal MoE-modell (vision-language model, VLM) med den visuella encodern MoonViT (~400 miljoner parametrar) och ~2,8 miljarder aktiva parametrar i dekodern. Teknisk rapport publicerades på arXiv.[9]
- Juli 2025 — lansering av Kimi K2 — den primära öppna MoE-modellen med 1 biljon parametrar och 32 miljarder aktiva parametrar. Teknisk rapport publicerades på arXiv.[1] Modellen innehade förstaplatsen bland öppna modeller på LMSYS Chatbot Arena vid lanseringstillfället (över 3 000 röster).[1]
- September 2025 — uppdatering Kimi-K2-Instruct-0905 med utökad kontext till 256 000 token och förbättrad agentbaserad kodning.[1]
- November 2025 — lansering av Kimi K2 Thinking — en version med förstärkt stegvist resonemang (chain-of-thought) och stöd för 200–300 på varandra följande verktygsanrop (tool calls).[10]
- Januari 2026 — presentation av Kimi K2.5 — en multimodal MoE-modell med nativ multimodalitet och mekanismen Agent Swarm (parallell orkestrering av sub-agenter).[2]
Parallellt med modellutvecklingen presenterades 2024 en egen inferenstjänst, Mooncake — en KVCache-centrisk disaggregerad arkitektur för hantering av LLM med lång kontext.[11]
Teoretiska grunder och arkitektur
Mixture-of-Experts-arkitekturen
Modellerna i serien Kimi K2 och K2.5 implementerar en Transformer-arkitektur med Mixture-of-Experts i separata lager. Ett standardblock i en transformer utgörs av en komposition av lager med multi-head self-attention (Multi-Head Attention, MHA) och positions-wise MLP (flerlagers perceptron) med residuala kopplingar:[1][12]
där — inmatade tokenrepresentationer, — sekvensens längd, — storleken på det dolda tillståndet.
I ett MoE-lager används i stället för ett enda MLP en uppsättning experter , där varje expert utgör ett separat MLP med parametrar . En router (gating network) väljer för varje token en delmängd av experter. Utdata från MoE-lagret för ett token med representationen definieras som:[1]
där — mängden valda experter för det aktuella token, — normerade routervikter, . Routningsfunktionen väljer experter via operationen TopK:[1]
där — en träningsbar routermatris. Detta schema möjliggör skalning av det totala antalet parametrar med ett begränsat antal parametrar som aktiveras per token.
Arkitekturhyperparametrar för Kimi K2 / K2.5
| Parameter | Värde |
|---|---|
| Arkitekturtyp | Transformer med Mixture-of-Experts |
| Totalt antal parametrar | 1,04 biljoner |
| Aktiverade parametrar per token | 32 miljarder |
| Antal lager | 61 (1 tätt + 60 MoE) |
| Storlek på dolt tillstånd | 7168 |
| Antal attention-huvuden | 64 |
| Antal experter | 384 (8 valda per token + 1 gemensam) |
| Storlek på expertens dolda tillstånd (MoE hidden size) | 2048 |
| Vokabulärstorlek | 160 000 token |
| Aktiveringsfunktion | SwiGLU |
| Attentionmekanism | Multi-head Latent Attention (MLA) |
| Maximal kontext | 256 000 token (utökning via YaRN) |
| Visuell encoder (K2.5) | MoonViT-3D, ~400 miljoner parametrar |
Gleshet (förhållandet mellan totalt antal experter och aktiverade) är 48:1 (384 experter, 8 aktiva), vilket ger en avsevärd minskning av beräkningskostnaden jämfört med en tät (dense) modell i samma skala.[1]
Mekanismen Multi-head Latent Attention (MLA)
Modellerna i serien Kimi K2/K2.5 använder mekanismen Multi-head Latent Attention (MLA) — en modifiering av standardmässig multi-head attention, syftande till ökad effektivitet och skalbarhet. Standardattention för ett lager beräknas som:[12]
där — matriserna för queries, keys och values. I MLA introduceras latenta representationer som queries och keys projiceras mot, vilket minskar dimensionaliteten hos mellanliggande operationer och möjliggör en reduktion av KV-cachens storlek. Metoden liknar den mekanism som användes i DeepSeek-V3.[1][13]
Optimeraren MuonClip och QK-clip
För träning av Kimi K2 föreslogs optimeraren MuonClip — en modifiering av optimeraren Muon (momentumoptimering med Newton-Schulz-normalisering) med tillägg av tekniken QK-clip för att stabilisera träningen av stora språkmodeller med MoE-arkitektur.[1]
QK-clip tillämpar begränsningar på attention-logiter via en klippningsoperation (clipping). För varje attention-huvud definieras den maximala logiten:
och en skalningsfaktor beräknas:
där — en tröskelparameter, — storleken på attention-huvudet. Koefficienten används för att skala vikterna om den maximala logiten överstiger tröskeln. Detta begränsar värdeområdet för logiter före softmax och minskar risken för plötsliga toppar i förlusterna (loss spikes) vid träning i stor skala.[1]
Enligt författarna genomfördes förträningen av Kimi K2 på 15,5 biljoner token med MuonClip utan en enda registrerad topp i förlustfunktionen (zero loss spikes).[1]
Multimodalitet och MoonViT
Modellerna Kimi K2.5 och Kimi-VL använder den visuella encodern MoonViT (i version K2.5 — MoonViT-3D) med ungefär 400 miljoner parametrar, byggd på basis av SigLIP-SO-400M med NaViT-packing (stöd för variabel upplösning på inmatningsbilder) och 3D-utökning för videobearbetning (gruppering per 4 bildrutor).[2][9]
Den visuella encodern omvandlar inmatade bilder och video till en sekvens av visuella token. Låt — inmatad bild, — visuell encoder:
sedan via linjär projektion (tvålagers MLP) :
där — storleken på det dolda utrymmet i modellens språkdel. I multimodalt läge konkateneras med texttoken och matas in i transformern.[9][2]
Till skillnad från tvåstegsscheman (tillägg av en visuell adapter ovanpå en textmodell) tränas K2.5 på blandade visuell-text-data från början av förträningen (joint text-vision pre-training), med en låg andel visuella token (~10 %) i de tidiga faserna och en gradvis ökning. Den totala volymen är ungefär 15 biljoner blandade visuell-text-token.[2]
Förträning och efterträning
Förträning
Kimi K2 förtränas på 15,5 biljoner token (webbtexter, kod, matematik, encyklopedisk kunskap) med optimeraren MuonClip. Inte en enda topp i förlustfunktionen (loss spike) registrerades under hela förträningsperioden.[1]
Kimi K2.5 genomgick kontinuerlig förträning (continual pre-training) från en kontrollpunkt för K2 på ytterligare ~15 biljoner blandade visuell-text-token med gemensam modalitetsoptimering (joint pre-training). Separat genomfördes 1 biljon token av standalone-träning av den visuella encodern och en ytterligare fas med long-context mid-training för utökning av kontexten.[2]
Efterträning
Efterträningen av modellerna i K2-serien innefattar flera steg:[1][2]
Supervised Fine-Tuning (SFT, övervakad finjustering):
- Syntetiska agentbanor (agentic data synthesis) — generering av verktygsspecifikationer, simulering av interaktioner med miljön, verifiering av resultat.
- För K2.5 tillämpas dessutom zero-vision SFT — text-SFT som aktiverar visuella förmågor utan direkt användning av bilder i finjusteringsfasen.
Reinforcement Learning (RL, förstärkningsinlärning):
- Kombination av verifierbara belöningar (Reinforcement Learning with Verifiable Rewards, RLVR) för uppgifter inom matematik, kod och säkerhet.
- Självbedömning via rubriker (self-critique rubric rewards) — användning av LLM-bedömare för automatisk kvalitetsutvärdering av agentscenarier.
- För K2.5 — gemensam multimodal RL (joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking och K2.5 stöder nativ INT4-kvantisering av vikter (weight-only quantization, grupp 32, komprimerade tensorer), optimerad för NVIDIA Hopper-arkitekturen, vilket minskar minneskraven vid inferens.[10][2]
Agent Swarm (K2.5)
För modellen K2.5 utvecklades mekanismen Agent Swarm — ett ramverk för självorganiserad parallell orkestrering av agenter. Orkestratormodellen skapar dynamiskt sub-agenter (via operationerna create_subagent, assign_task), fördelar deluppgifter och samlar in resultat. Varje sub-agent kan självständigt anropa verktyg och arbeta parallellt med andra sub-agenter.[2]
Träningen av Agent Swarm-mekanismen implementeras via Parallel-Agent Reinforcement Learning (PARL) med åtskillnad mellan exekvering och optimering (decoupling execution/optimization). Enligt författarna ger Agent Swarm en minskning av latensen med upp till 4,5× jämfört med enkeltrådat agentläge (single-agent).[2]
Huvudmodellerna i serien
| Modell | Typ | Parametrar (totalt / aktiva) | Kontext, token | Multimodalitet | Lanseringsdatum |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-skalning | ej offentliggjort | 128 000 | Ja (begränsad) | Januari 2025 |
| Kimi-VL | VLM, MoE | kompakt / ~2,8 miljarder aktiva + 400 miljoner ViT | lång kontext | Ja (bilder) | April 2025 |
| Kimi K2 | LLM, MoE | 1,04 biljoner / 32 miljarder | 256 000 | Nej (text) | Juli 2025 |
| Kimi K2 Thinking | LLM, MoE | 1,04 biljoner / 32 miljarder | 256 000 | Nej (text) | November 2025 |
| Kimi K2.5 | VLM-LLM, MoE | 1,04 biljoner / 32 miljarder | 256 000 | Ja (bilder, video, PDF) | Januari 2026 |
Kimi K2
Kimi K2 är en Mixture-of-Experts LLM med 1,04 biljoner totala parametrar och 32 miljarder aktiverade parametrar per token. Förtränad på 15,5 biljoner token med optimeraren MuonClip. Arkitekturen inkluderar 384 experter och en MLA-mekanism kompatibel med lång kontext. Modellen är inriktad på uppgifter inom programmering, matematiskt resonemang och agentscenarier med sekventiella verktygsanrop.[1]
Den tekniska rapporten beskriver en flerstegig pipeline för efterträning: storskalig syntes av agentdata genom simulering av verktygsinteraktioner; förstärkningsinlärning i en blandad miljö av verkliga och syntetiska uppgifter; användning av LLM-bedömare för automatisk kvalitetsutvärdering.[1][14]
Kimi K2 Thinking
Varianten Kimi K2 Thinking är optimerad för flerstegigt resonemang (chain-of-thought) med möjlighet till dynamiska verktygsanrop och stöd för kontext upp till 256 000 token. Modellen implementerar ett separat "Thinking"-läge med ett explicit returnerat fält reasoning_content som innehåller det interna resonemanget. K2 Thinking stöder 200–300 sekventiella verktygsanrop i ett och samma agentavsnitt utan väsentlig beteendedegradation, samt nativ INT4-kvantisering med QAT.[10]
Kimi-VL
Kimi-VL är en öppen multimodal MoE-VLM (vision-language model), inriktad på uppgifter inom visuell förståelse, visuell-textbaserat resonemang och verkliga scener. Modellen beskrivs som en kompakt MoE-arkitektur med den visuella encodern MoonViT. Den tekniska rapporten publicerades på arXiv i april 2025.[9]
Kimi K2.5
Kimi K2.5 är en multimodal MoE-modell i skalan 1,04 biljoner parametrar med 32 miljarder aktiva, baserad på kontrollpunkten Kimi-K2-Base med fortsatt förträning på ~15 biljoner blandade visuell-text-token. Modellen stöder inmatning av bilder, video, PDF och text med kontext upp till 256 000 token.[2]
K2.5 stöder två primära inferenslägen:
- Thinking mode — med explicit
reasoning_contentoch flerstegsgenerering; - Instant mode — utan resonemangsutsignal, med lägre latens.[2][13]
Modellen implementerar nativ INT4-kvantisering av vikter (weight-only, grupp 32), optimerad för NVIDIA Hopper-arkitekturen.[2]
Viktigaste resultat och benchmark
Text- och agentbenchmark för Kimi K2
Resultaten gäller Kimi-K2-Instruct i non-thinking-läge (utan utökad chain-of-thought) enligt den tekniska rapporten.[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | Källa |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65,8 % | 38,8 % | 72,5 % / 72,7 % | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47,3 % | 20,9 % | 51,0 % | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53,7 % | 44,7 % | 46,9 % | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66,1 % | 48,8 % | 66,1 % | arXiv:2507.20534 |
| ACEBench (En) | 76,5 % | 75,6 % | 80,1 % | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49,5 % | 33,9 % | 46,7 % | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75,1 % | 68,2 % | 74,9 % | arXiv:2507.20534 |
Enligt författarnas påstående placerar dessa resultat K2 bland ledarna bland öppna modeller i läge utan thinking-utveckling, särskilt på ingenjörsmässiga och agentbaserade uppgifter (vid tidpunkten för rapportpublikationen).[1]
Benchmark för Kimi-VL
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | Källa |
|---|---|---|---|---|
| MMVet (noggrannhet) | 66,7 % | 67,1 % | 66,9 % | arXiv:2504.07491 |
| RealWorldQA | 68,1 % | 68,5 % | — | arXiv:2504.07491 |
Resultaten visar att en kompakt multimodal MoE-arkitektur uppnår en nivå som är jämförbar med större modeller med färre aktiva parametrar.[9]
Benchmark för Kimi K2.5
Resultaten anges i Thinking-läge (temperature = 1,0; top-p = 0,95; kontext 256 000 token; motor vLLM; hårdvaruplattform NVIDIA H200) enligt modellkortet på plattformen NVIDIA NIM och den tekniska rapporten.[2][13]
| Kategori | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (utan verktyg) | 30,1 |
| HLE-Full (med verktyg) | 50,2 | |
| AIME 2025 | 96,1 | |
| HMMT 2025 (Feb) | 95,4 | |
| GPQA-Diamond | 87,6 | |
| MMLU-Pro | 87,1 | |
| Vision & Video | MMMU-Pro | 78,5 |
| MathVision | 84,2 | |
| MathVista (mini) | 90,1 | |
| OCRBench | 92,3 | |
| OmniDocBench 1.5 | 88,8 | |
| VideoMMMU | 86,6 | |
| LongVideoBench | 79,8 | |
| Coding | SWE-Bench Verified | 76,8 |
| SWE-Bench Pro | 50,7 | |
| SWE-Bench Multilingual | 73,0 | |
| Terminal Bench 2.0 | 50,8 | |
| PaperBench | 63,5 | |
| LiveCodeBench v6 | 85,0 | |
| OJBench (C++) | 57,4 | |
| Long Context | Longbench v2 | 61,0 |
| AA-LCR | 70,0 | |
| Agentic Search | BrowseComp | 60,6 |
| BrowseComp (Agent Swarm) | 78,4 | |
| WideSearch (iter-F1) | 72,7 | |
| DeepSearchQA | 77,1 |
Dessutom uppvisar K2.5 en positiv överföring av visuell träning till textbaserade uppgifter: +1,7 % på MMLU-Pro och +2,1 % på GPQA-Diamond jämfört med den textbaserade grundmodellen K2.[2]
Den slutliga jämförande utvärderingen beror på valet av mätvärden och scenarier; resultaten anges enligt författarnas data. Oberoende validering av en del av benchmarken är begränsad vid tidpunkten för publikation.[2][15]
Tillämpningar
Textassistent och sökning
Plattformen Kimi används som assistent med stöd för bearbetning av långa dokument (forskningsrapporter, finansiella data), automatiserad analys och onlinesökning med aggregering av information. Moonshot AI anger att Kimi stöder mer än 300 verktygsanrop (tool calls) inom ett och samma agentscenario.[7][4]
Programmering och ingenjörsmässiga uppgifter
Kimi K2 och K2.5 uppvisar höga resultat på SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench och andra programmeringsbenchmark. Modellerna används för automatisering av felrättning i kodförråd, generering och refaktorering av kod, samt lösning av uppgifter i onlinejudge-system (OJBench, LiveCodeBench). Den tekniska rapporten för K2 anger att modellen tränades på ett storskaligt syntetiskt agentkorpus som inkluderar interaktioner med versionskontrollsystem, pakethanterare och körmiljöer.[1][2][14]
Multimodala tillämpningar
Kimi-VL och K2.5 är avsedda för visuell fråga-och-svar (VQA) på bilder och dokument; dokumentförståelse (OCRBench, OmniDocBench); videoanalys (VideoMMMU, LongVideoBench); kombinerade programmeringsuppgifter baserade på visuella specifikationer (t.ex. generering av gränssnitt från en bildlayout). För K2.5 beskrivs scenarier för "vision-grounded coding" och "autonomous visual debugging", där modellen genererar kod utifrån en visuell beskrivning och iterativt analyserar det visuella resultatet.[2][9][15]
API och driftsättning
Modellerna är tillgängliga via API:et på Moonshot AI Open Platform med stöd för tool calling, thinking-läge, JSON-läge och kontextcachning. Öppna vikter används för lokal driftsättning via vLLM, SGLang och TensorRT-LLM. Tjänsten Mooncake möjliggör skalning av inferens för lång kontext.[4][11][16]
Begränsningar och öppna problem
Resurskrav
MoE-modeller i skalan 1 biljon parametrar, även med 32 miljarder aktiva parametrar och INT4-kvantisering, kräver betydande minnesutrymme och bandbredd. I tekniska diskussioner om driftsättning av Kimi K2.5 nämns uppskattningar i storleksordningen hundratals gigabyte GPU-minne för fullständig inläsning av modellen; de exakta siffrorna beror på kvantiseringsformat och ramverk (vLLM, SGLang m.fl.).[2][17]
Hallucinationer och genereringskvalitet
Precis som andra LLM är modellerna i Kimi-serien benägna att hallucination. I rapporter från testerna FACTS Grounding och FaithJudge registrerades hallucination rates på 1,1–7,4 % i RAG-scenarier. I non-thinking-läge kan modellen generera överflödiga token vid otydliga verktygsspecifikationer; vid tvingad aktivering av tool-use sjunker prestandan på vissa uppgifter.[1]
Beroende av syntetiska data och RL-pipeline
Pipelinen för syntes av agentdata och förstärkningsinlärning bygger på en stor samling syntetiska verktyg och scener, samt LLM-bedömare för automatisk utvärdering (self-judging). Denna uppläggning väcker öppna frågor: robusthet mot snedvridning (bias) i självbedömningen; potentiell degradation vid upprepade iterationer (bootstrap); överförbarheten av agentfärdigheter till verkliga miljöer som skiljer sig från de simulerade; inverkan av distributionen av syntetiska uppgifter på generaliseringsförmågan.[1][14]
Transparens och reproducerbarhet
En del information om sammansättningen av träningsdata, filtreringsprocessen, språk- och domänfördelningen offentliggörs inte eller offentliggörs endast begränsat. Detta försvårar en precis bedömning av snedvridningskällor, reproducerbarheten av träningen och oberoende validering av inverkan av enskilda komponenter (MuonClip, QK-clip) på stabiliteten. Per februari 2026 har ingen fullständig reproduktion av träningen av Kimi K2 och K2.5 av tredje part dokumenterats i öppen litteratur.[1][2]
Etiska och regulatoriska aspekter
I modellkort och tekniska rapporter betonas att utvecklarna bär ansvar för modellens indata och utdata; att skyddsmekanismer (guardrails) måste läggas till och att testning på data för det specifika fallet krävs innan implementering; att modellen kan bearbeta bilder och video som potentiellt innehåller personuppgifter, och att integratorn är skyldig att följa tillämplig lagstiftning.[2][16]
De tekniska rapporterna beskriver säkerhetsutvärderingar (biologiska, kemiska, cyberrisker) med verktyg av typen Promptfoo. Modellerna genomgår RL-anpassning (alignment) med verifierbara belöningar och självbedömning.[1]
Som produkter från ett kinesiskt företag lyder modellerna under Kinas nationella AI-reglering. Vid tidpunkten för skrivandet har inga separata offentliga regulatoriska dokument som uteslutande rör Kimi-modellerna påträffats; regleringen sker inom ramen för allmänna tillvägagångssätt för generativa modeller och AI i respektive jurisdiktioner.[18]
I februari 2026 hävdade företaget Anthropic att Moonshot AI (tillsammans med andra kinesiska utvecklare) hade använt falska konton för att generera interaktioner med Claude i syfte att destillera data för träning av modeller. Uppgiften är av karaktären ett ensidigt påstående och har inte bekräftats av oberoende utredningar vid tidpunkten för publikation; Moonshot AI har inte publicerat något officiellt svar.[5]
Framtidsperspektiv och forskningsinriktningar
Utifrån publicerat material kan ett antal riktningar för fortsatt forskning urskiljas:
- Skalbara agentsystem. Utveckling av metoder för att träna LLM som agentsystem med hjälp av syntetisk verktygsamling, RL och self-judging. Utvidgning av Agent Swarm till fler sub-agenter och nya typer av uppgifter.[2][1]
- Effektiva MoE-arkitekturer. Användningen av 1 biljon parametrar med 32 miljarder aktiva och 384 experter representerar en möjlig avvägning mellan skala och effektivitet; alternativ med olika routingscheman undersöks.[1]
- Nativ multimodalitet. Träningen av K2.5 på blandade visuell-text-data från förträningens start representerar ett tillvägagångssätt för "nativ" multimodalitet, vilket jämförs med tvåstegsscheman.[2][9]
- Effektiv inferens och lång kontext. INT4-kvantisering och stöd för kontext med 256 000 token stimulerar fortsatt forskning inom gles attention, latenta representationer och externt minne. Separat beskrivs projektet Kimi Linear — en hybrid med linjär attention, 75 % reduktion av KV-cachen och 6 gånger snabbare dekodning vid kontext med 1 miljon token.[2][19]
I officiella material från Moonshot AI publiceras inga detaljerade färdplaner för kommande versioner av Kimi; de listade riktningarna är baserade på publicerade forskningsresultat.
Se även
- Transformer-arkitekturen
- DeepSeek
- Qwen
Externa länkar
- https://www.moonshot.ai/ — officiell webbplats för Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — GitHub-förråd för Kimi K2.5
- https://huggingface.co/moonshotai — Moonshot AIs profil på Hugging Face
Litteratur
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Noter
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692