Kimi (Moonshot AI) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (modellserien Moonshot AI) — en serie stora språkmodeller (Large Language Model, LLM), utvecklade av det kinesiska företaget Moonshot AI (Peking, Kina) för uppgifter inom textgenerering och multimodal generering, programmering samt agentbaserade system (agentic systems — system med förmåga till autonom planering, resonemang och handling med hjälp av externa verktyg). Familjen inkluderar text- och multimodala modeller med Mixture-of-Experts-arkitektur (MoE) i storleksordningen 1 biljon parametrar och ett aktiverat delmängd i storleksordningen 32 miljarder parametrar per token.[1][2] Ett viktigt kännetecken för serien är inriktningen på agentbeteende (flerstegplanering med anrop av externa verktyg) och stöd för lång kontext upp till 256 000 token i versionerna Kimi K2 och Kimi K2.5.[1][2]

Modellerna i Kimi-serien distribueras både med öppna vikter (open-weight) på plattformen Hugging Face under en modifierad MIT-licens, och via det proprietära API:et på Moonshot AI Open Platform.[3][4]

Historia och förutsättningar

Grundandet av Moonshot AI

Moonshot AI grundades i mars 2023 i Peking av Yang Zhilin (CEO), Zhou Xinyu och Wu Yuxin — alumner från Tsinghua University. Yang Zhilin hade tidigare arbetat på Google Brain och Meta och deltagit i forskning inom datorseende och resonemang. Företaget erhöll finansiering från Alibaba (investeringsrunda på 1 miljard dollar, februari 2024), Tencent och andra investerare.[5][6]

Tidslinje över viktiga releaser

  • Oktober–november 2023 — lansering av chatboten Kimi med stöd för kontext upp till 128 000 token (upp till 200 000 kinesiska tecken). De första versionerna använde proprietära modeller med begränsad teknisk transparens.[6][7]
  • Mars 2024 — utökning av kontexten till 2 miljoner tecken i betaversion.[6]
  • Januari 2025 — lansering av Kimi k1.5 — en multimodal modell med skalad Reinforcement Learning (RL), presenterad som jämförbar i prestanda med OpenAI o1 inom matematik, programmering och multimodalt resonemang. Kontext upp till 128 000 token.[8]
  • April 2025 — presentation av Kimi-VL — en öppen multimodal MoE-modell (vision-language model, VLM) med den visuella encodern MoonViT (~400 miljoner parametrar) och ~2,8 miljarder aktiva parametrar i dekodern. Teknisk rapport publicerades på arXiv.[9]
  • Juli 2025 — lansering av Kimi K2 — den primära öppna MoE-modellen med 1 biljon parametrar och 32 miljarder aktiva parametrar. Teknisk rapport publicerades på arXiv.[1] Modellen innehade förstaplatsen bland öppna modeller på LMSYS Chatbot Arena vid lanserings­tillfället (över 3 000 röster).[1]
  • September 2025 — uppdatering Kimi-K2-Instruct-0905 med utökad kontext till 256 000 token och förbättrad agentbaserad kodning.[1]
  • November 2025 — lansering av Kimi K2 Thinking — en version med förstärkt stegvist resonemang (chain-of-thought) och stöd för 200–300 på varandra följande verktygsan­rop (tool calls).[10]
  • Januari 2026 — presentation av Kimi K2.5 — en multimodal MoE-modell med nativ multimodalitet och mekanismen Agent Swarm (parallell orkestrering av sub-agenter).[2]

Parallellt med modellutvecklingen presenterades 2024 en egen inferenstjänst, Mooncake — en KVCache-centrisk disaggregerad arkitektur för hantering av LLM med lång kontext.[11]

Teoretiska grunder och arkitektur

Mixture-of-Experts-arkitekturen

Modellerna i serien Kimi K2 och K2.5 implementerar en Transformer-arkitektur med Mixture-of-Experts i separata lager. Ett standardblock i en transformer utgörs av en komposition av lager med multi-head self-attention (Multi-Head Attention, MHA) och positions-wise MLP (flerlagers perceptron) med residuala kopplingar:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

där 𝐇L×d — inmatade tokenrepresentationer, L — sekvensens längd, d — storleken på det dolda tillståndet.

I ett MoE-lager används i stället för ett enda MLP en uppsättning experter {Ei}i=1N, där varje expert utgör ett separat MLP med parametrar θi. En router (gating network) väljer för varje token en delmängd av experter. Utdata från MoE-lagret för ett token med representationen 𝐡 definieras som:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

där 𝒮(𝐡){1,,N} — mängden valda experter för det aktuella token, gi(𝐡) — normerade routervikter, i𝒮gi=1. Routningsfunktionen väljer experter via operationen TopK:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

där Wg — en träningsbar routermatris. Detta schema möjliggör skalning av det totala antalet parametrar med ett begränsat antal parametrar som aktiveras per token.

Arkitekturhyperparametrar för Kimi K2 / K2.5

Parameter Värde
Arkitekturtyp Transformer med Mixture-of-Experts
Totalt antal parametrar 1,04 biljoner
Aktiverade parametrar per token 32 miljarder
Antal lager 61 (1 tätt + 60 MoE)
Storlek på dolt tillstånd 7168
Antal attention-huvuden 64
Antal experter 384 (8 valda per token + 1 gemensam)
Storlek på expertens dolda tillstånd (MoE hidden size) 2048
Vokabulärstorlek 160 000 token
Aktiveringsfunktion SwiGLU
Attentionmekanism Multi-head Latent Attention (MLA)
Maximal kontext 256 000 token (utökning via YaRN)
Visuell encoder (K2.5) MoonViT-3D, ~400 miljoner parametrar

[1][2][13]

Gleshet (förhållandet mellan totalt antal experter och aktiverade) är 48:1 (384 experter, 8 aktiva), vilket ger en avsevärd minskning av beräkningskostnaden jämfört med en tät (dense) modell i samma skala.[1]

Mekanismen Multi-head Latent Attention (MLA)

Modellerna i serien Kimi K2/K2.5 använder mekanismen Multi-head Latent Attention (MLA) — en modifiering av standardmässig multi-head attention, syftande till ökad effektivitet och skalbarhet. Standardattention för ett lager beräknas som:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

där 𝐐,𝐊,𝐕L×dk — matriserna för queries, keys och values. I MLA introduceras latenta representationer som queries och keys projiceras mot, vilket minskar dimensionaliteten hos mellanliggande operationer och möjliggör en reduktion av KV-cachens storlek. Metoden liknar den mekanism som användes i DeepSeek-V3.[1][13]

Optimeraren MuonClip och QK-clip

För träning av Kimi K2 föreslogs optimeraren MuonClip — en modifiering av optimeraren Muon (momentumoptimering med Newton-Schulz-normalisering) med tillägg av tekniken QK-clip för att stabilisera träningen av stora språkmodeller med MoE-arkitektur.[1]

QK-clip tillämpar begränsningar på attention-logiter 𝐐𝐊 via en klippningsoperation (clipping). För varje attention-huvud h definieras den maximala logiten:

Shmax=1dmaxi,j(Qhi(Khj)),

och en skalningsfaktor beräknas:

γh=min(1,τShmax),

där τ=100 — en tröskelparameter, d — storleken på attention-huvudet. Koefficienten γh används för att skala vikterna Wq,Wk om den maximala logiten överstiger tröskeln. Detta begränsar värdeområdet för logiter före softmax och minskar risken för plötsliga toppar i förlusterna (loss spikes) vid träning i stor skala.[1]

Enligt författarna genomfördes förträningen av Kimi K2 på 15,5 biljoner token med MuonClip utan en enda registrerad topp i förlustfunktionen (zero loss spikes).[1]

Multimodalitet och MoonViT

Modellerna Kimi K2.5 och Kimi-VL använder den visuella encodern MoonViT (i version K2.5 — MoonViT-3D) med ungefär 400 miljoner parametrar, byggd på basis av SigLIP-SO-400M med NaViT-packing (stöd för variabel upplösning på inmatningsbilder) och 3D-utökning för videobearbetning (gruppering per 4 bildrutor).[2][9]

Den visuella encodern omvandlar inmatade bilder och video till en sekvens av visuella token. Låt 𝐗H×W×3 — inmatad bild, Φvis — visuell encoder:

𝐙vis=Φvis(𝐗)Lv×dv,

sedan via linjär projektion (tvålagers MLP) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

där d — storleken på det dolda utrymmet i modellens språkdel. I multimodalt läge 𝐇vis konkateneras med texttoken och matas in i transformern.[9][2]

Till skillnad från tvåstegsscheman (tillägg av en visuell adapter ovanpå en textmodell) tränas K2.5 på blandade visuell-text-data från början av förträningen (joint text-vision pre-training), med en låg andel visuella token (~10 %) i de tidiga faserna och en gradvis ökning. Den totala volymen är ungefär 15 biljoner blandade visuell-text-token.[2]

Förträning och efterträning

Förträning

Kimi K2 förtränas på 15,5 biljoner token (webbtexter, kod, matematik, encyklopedisk kunskap) med optimeraren MuonClip. Inte en enda topp i förlustfunktionen (loss spike) registrerades under hela förträningsperioden.[1]

Kimi K2.5 genomgick kontinuerlig förträning (continual pre-training) från en kontrollpunkt för K2 på ytterligare ~15 biljoner blandade visuell-text-token med gemensam modalitetsoptimering (joint pre-training). Separat genomfördes 1 biljon token av standalone-träning av den visuella encodern och en ytterligare fas med long-context mid-training för utökning av kontexten.[2]

Efterträning

Efterträningen av modellerna i K2-serien innefattar flera steg:[1][2]

Supervised Fine-Tuning (SFT, övervakad finjustering):

  • Syntetiska agentbanor (agentic data synthesis) — generering av verktygsspecifikationer, simulering av interaktioner med miljön, verifiering av resultat.
  • För K2.5 tillämpas dessutom zero-vision SFT — text-SFT som aktiverar visuella förmågor utan direkt användning av bilder i finjusteringsfasen.

Reinforcement Learning (RL, förstärkningsinlärning):

  • Kombination av verifierbara belöningar (Reinforcement Learning with Verifiable Rewards, RLVR) för uppgifter inom matematik, kod och säkerhet.
  • Självbedömning via rubriker (self-critique rubric rewards) — användning av LLM-bedömare för automatisk kvalitetsutvärdering av agentscenarier.
  • För K2.5 — gemensam multimodal RL (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking och K2.5 stöder nativ INT4-kvantisering av vikter (weight-only quantization, grupp 32, komprimerade tensorer), optimerad för NVIDIA Hopper-arkitekturen, vilket minskar minneskraven vid inferens.[10][2]

Agent Swarm (K2.5)

För modellen K2.5 utvecklades mekanismen Agent Swarm — ett ramverk för självorganiserad parallell orkestrering av agenter. Orkestratormodellen skapar dynamiskt sub-agenter (via operationerna create_subagent, assign_task), fördelar deluppgifter och samlar in resultat. Varje sub-agent kan självständigt anropa verktyg och arbeta parallellt med andra sub-agenter.[2]

Träningen av Agent Swarm-mekanismen implementeras via Parallel-Agent Reinforcement Learning (PARL) med åtskillnad mellan exekvering och optimering (decoupling execution/optimization). Enligt författarna ger Agent Swarm en minskning av latensen med upp till 4,5× jämfört med enkeltrådat agentläge (single-agent).[2]

Huvudmodellerna i serien

Modell Typ Parametrar (totalt / aktiva) Kontext, token Multimodalitet Lanseringsdatum
Kimi k1.5 LLM, RL-skalning ej offentliggjort 128 000 Ja (begränsad) Januari 2025
Kimi-VL VLM, MoE kompakt / ~2,8 miljarder aktiva + 400 miljoner ViT lång kontext Ja (bilder) April 2025
Kimi K2 LLM, MoE 1,04 biljoner / 32 miljarder 256 000 Nej (text) Juli 2025
Kimi K2 Thinking LLM, MoE 1,04 biljoner / 32 miljarder 256 000 Nej (text) November 2025
Kimi K2.5 VLM-LLM, MoE 1,04 biljoner / 32 miljarder 256 000 Ja (bilder, video, PDF) Januari 2026

[8][9][1][10][2]

Kimi K2

Kimi K2 är en Mixture-of-Experts LLM med 1,04 biljoner totala parametrar och 32 miljarder aktiverade parametrar per token. Förtränad på 15,5 biljoner token med optimeraren MuonClip. Arkitekturen inkluderar 384 experter och en MLA-mekanism kompatibel med lång kontext. Modellen är inriktad på uppgifter inom programmering, matematiskt resonemang och agentscenarier med sekventiella verktygsan­rop.[1]

Den tekniska rapporten beskriver en flerstegig pipeline för efterträning: storskalig syntes av agentdata genom simulering av verktygsinteraktioner; förstärkningsinlärning i en blandad miljö av verkliga och syntetiska uppgifter; användning av LLM-bedömare för automatisk kvalitetsutvärdering.[1][14]

Kimi K2 Thinking

Varianten Kimi K2 Thinking är optimerad för flerstegigt resonemang (chain-of-thought) med möjlighet till dynamiska verktygsan­rop och stöd för kontext upp till 256 000 token. Modellen implementerar ett separat "Thinking"-läge med ett explicit returnerat fält reasoning_content som innehåller det interna resonemanget. K2 Thinking stöder 200–300 sekventiella verktygsan­rop i ett och samma agentavsnitt utan väsentlig beteendedegradation, samt nativ INT4-kvantisering med QAT.[10]

Kimi-VL

Kimi-VL är en öppen multimodal MoE-VLM (vision-language model), inriktad på uppgifter inom visuell förståelse, visuell-textbaserat resonemang och verkliga scener. Modellen beskrivs som en kompakt MoE-arkitektur med den visuella encodern MoonViT. Den tekniska rapporten publicerades på arXiv i april 2025.[9]

Kimi K2.5

Kimi K2.5 är en multimodal MoE-modell i skalan 1,04 biljoner parametrar med 32 miljarder aktiva, baserad på kontrollpunkten Kimi-K2-Base med fortsatt förträning på ~15 biljoner blandade visuell-text-token. Modellen stöder inmatning av bilder, video, PDF och text med kontext upp till 256 000 token.[2]

K2.5 stöder två primära inferenslägen:

  • Thinking mode — med explicit reasoning_content och flerstegsgenerering;
  • Instant mode — utan resonemangsutsignal, med lägre latens.[2][13]

Modellen implementerar nativ INT4-kvantisering av vikter (weight-only, grupp 32), optimerad för NVIDIA Hopper-arkitekturen.[2]

Viktigaste resultat och benchmark

Text- och agentbenchmark för Kimi K2

Resultaten gäller Kimi-K2-Instruct i non-thinking-läge (utan utökad chain-of-thought) enligt den tekniska rapporten.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Källa
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

Enligt författarnas påstående placerar dessa resultat K2 bland ledarna bland öppna modeller i läge utan thinking-utveckling, särskilt på ingenjörsmässiga och agentbaserade uppgifter (vid tidpunkten för rapportpublikationen).[1]

Benchmark för Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Källa
MMVet (noggrannhet) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

Resultaten visar att en kompakt multimodal MoE-arkitektur uppnår en nivå som är jämförbar med större modeller med färre aktiva parametrar.[9]

Benchmark för Kimi K2.5

Resultaten anges i Thinking-läge (temperature = 1,0; top-p = 0,95; kontext 256 000 token; motor vLLM; hårdvaruplattform NVIDIA H200) enligt modellkortet på plattformen NVIDIA NIM och den tekniska rapporten.[2][13]

Kategori Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (utan verktyg) 30,1
HLE-Full (med verktyg) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

Dessutom uppvisar K2.5 en positiv överföring av visuell träning till textbaserade uppgifter: +1,7 % på MMLU-Pro och +2,1 % på GPQA-Diamond jämfört med den textbaserade grundmodellen K2.[2]

Den slutliga jämförande utvärderingen beror på valet av mätvärden och scenarier; resultaten anges enligt författarnas data. Oberoende validering av en del av benchmarken är begränsad vid tidpunkten för publikation.[2][15]

Tillämpningar

Textassistent och sökning

Plattformen Kimi används som assistent med stöd för bearbetning av långa dokument (forskningsrapporter, finansiella data), automatiserad analys och onlinesökning med aggregering av information. Moonshot AI anger att Kimi stöder mer än 300 verktygsan­rop (tool calls) inom ett och samma agentscenario.[7][4]

Programmering och ingenjörsmässiga uppgifter

Kimi K2 och K2.5 uppvisar höga resultat på SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench och andra programmeringsbenchmark. Modellerna används för automatisering av felrättning i kodförråd, generering och refaktorering av kod, samt lösning av uppgifter i onlinejudge-system (OJBench, LiveCodeBench). Den tekniska rapporten för K2 anger att modellen tränades på ett storskaligt syntetiskt agentkorpus som inkluderar interaktioner med versionskontrollsystem, pakethanterare och körmiljöer.[1][2][14]

Multimodala tillämpningar

Kimi-VL och K2.5 är avsedda för visuell fråga-och-svar (VQA) på bilder och dokument; dokumentförståelse (OCRBench, OmniDocBench); videoanalys (VideoMMMU, LongVideoBench); kombinerade programmeringsuppgifter baserade på visuella specifikationer (t.ex. generering av gränssnitt från en bildlayout). För K2.5 beskrivs scenarier för "vision-grounded coding" och "autonomous visual debugging", där modellen genererar kod utifrån en visuell beskrivning och iterativt analyserar det visuella resultatet.[2][9][15]

API och driftsättning

Modellerna är tillgängliga via API:et på Moonshot AI Open Platform med stöd för tool calling, thinking-läge, JSON-läge och kontextcachning. Öppna vikter används för lokal driftsättning via vLLM, SGLang och TensorRT-LLM. Tjänsten Mooncake möjliggör skalning av inferens för lång kontext.[4][11][16]

Begränsningar och öppna problem

Resurskrav

MoE-modeller i skalan 1 biljon parametrar, även med 32 miljarder aktiva parametrar och INT4-kvantisering, kräver betydande minnesutrymme och bandbredd. I tekniska diskussioner om driftsättning av Kimi K2.5 nämns uppskattningar i storleksordningen hundratals gigabyte GPU-minne för fullständig inläsning av modellen; de exakta siffrorna beror på kvantiseringsformat och ramverk (vLLM, SGLang m.fl.).[2][17]

Hallucinationer och genereringskvalitet

Precis som andra LLM är modellerna i Kimi-serien benägna att hallucination. I rapporter från testerna FACTS Grounding och FaithJudge registrerades hallucination rates på 1,1–7,4 % i RAG-scenarier. I non-thinking-läge kan modellen generera överflödiga token vid otydliga verktygsspecifikationer; vid tvingad aktivering av tool-use sjunker prestandan på vissa uppgifter.[1]

Beroende av syntetiska data och RL-pipeline

Pipelinen för syntes av agentdata och förstärkningsinlärning bygger på en stor samling syntetiska verktyg och scener, samt LLM-bedömare för automatisk utvärdering (self-judging). Denna uppläggning väcker öppna frågor: robusthet mot snedvridning (bias) i självbedömningen; potentiell degradation vid upprepade iterationer (bootstrap); överförbarheten av agentfärdigheter till verkliga miljöer som skiljer sig från de simulerade; inverkan av distributionen av syntetiska uppgifter på generaliseringsförmågan.[1][14]

Transparens och reproducerbarhet

En del information om sammansättningen av träningsdata, filtreringsprocessen, språk- och domänfördelningen offentliggörs inte eller offentliggörs endast begränsat. Detta försvårar en precis bedömning av snedvridningskällor, reproducerbarheten av träningen och oberoende validering av inverkan av enskilda komponenter (MuonClip, QK-clip) på stabiliteten. Per februari 2026 har ingen fullständig reproduktion av träningen av Kimi K2 och K2.5 av tredje part dokumenterats i öppen litteratur.[1][2]

Etiska och regulatoriska aspekter

I modellkort och tekniska rapporter betonas att utvecklarna bär ansvar för modellens indata och utdata; att skyddsmekanismer (guardrails) måste läggas till och att testning på data för det specifika fallet krävs innan implementering; att modellen kan bearbeta bilder och video som potentiellt innehåller personuppgifter, och att integratorn är skyldig att följa tillämplig lagstiftning.[2][16]

De tekniska rapporterna beskriver säkerhetsutvärderingar (biologiska, kemiska, cyberrisker) med verktyg av typen Promptfoo. Modellerna genomgår RL-anpassning (alignment) med verifierbara belöningar och självbedömning.[1]

Som produkter från ett kinesiskt företag lyder modellerna under Kinas nationella AI-reglering. Vid tidpunkten för skrivandet har inga separata offentliga regulatoriska dokument som uteslutande rör Kimi-modellerna påträffats; regleringen sker inom ramen för allmänna tillvägagångssätt för generativa modeller och AI i respektive jurisdiktioner.[18]

I februari 2026 hävdade företaget Anthropic att Moonshot AI (tillsammans med andra kinesiska utvecklare) hade använt falska konton för att generera interaktioner med Claude i syfte att destillera data för träning av modeller. Uppgiften är av karaktären ett ensidigt påstående och har inte bekräftats av oberoende utredningar vid tidpunkten för publikation; Moonshot AI har inte publicerat något officiellt svar.[5]

Framtidsperspektiv och forskningsinriktningar

Utifrån publicerat material kan ett antal riktningar för fortsatt forskning urskiljas:

  • Skalbara agentsystem. Utveckling av metoder för att träna LLM som agentsystem med hjälp av syntetisk verktygsamling, RL och self-judging. Utvidgning av Agent Swarm till fler sub-agenter och nya typer av uppgifter.[2][1]
  • Effektiva MoE-arkitekturer. Användningen av 1 biljon parametrar med 32 miljarder aktiva och 384 experter representerar en möjlig avvägning mellan skala och effektivitet; alternativ med olika routingscheman undersöks.[1]
  • Nativ multimodalitet. Träningen av K2.5 på blandade visuell-text-data från förträningens start representerar ett tillvägagångssätt för "nativ" multimodalitet, vilket jämförs med tvåstegsscheman.[2][9]
  • Effektiv inferens och lång kontext. INT4-kvantisering och stöd för kontext med 256 000 token stimulerar fortsatt forskning inom gles attention, latenta representationer och externt minne. Separat beskrivs projektet Kimi Linear — en hybrid med linjär attention, 75 % reduktion av KV-cachen och 6 gånger snabbare dekodning vid kontext med 1 miljon token.[2][19]

I officiella material från Moonshot AI publiceras inga detaljerade färdplaner för kommande versioner av Kimi; de listade riktningarna är baserade på publicerade forskningsresultat.

Se även

  • Transformer-arkitekturen
  • DeepSeek
  • Qwen

Externa länkar

Litteratur

Noter

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692