Kimi (Moonshot AI) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (serie modellen van Moonshot AI) — een serie grote taalmodellen (Large Language Model, LLM), ontwikkeld door het Chinese bedrijf Moonshot AI (Peking, China) voor taken op het gebied van tekstuele en multimodale generatie, programmeren en agentische systemen (agentic systems — systemen die in staat zijn tot autonoom plannen, redeneren en handelen met behulp van externe hulpmiddelen). De familie omvat tekst- en multimodale modellen met een Mixture-of-Experts-architectuur (MoE) van circa 1 biljoen parameters en een geactiveerde subset van circa 32 miljard parameters per token.[1][2] Een belangrijk kenmerk van de serie is de oriëntatie op agentisch gedrag (meerstaps-planning met aanroepen van externe hulpmiddelen) en ondersteuning van lange context tot 256.000 tokens in de versies Kimi K2 en Kimi K2.5.[1][2]

De modellen van de Kimi-serie worden zowel verspreid met open gewichten (open-weight) op het platform Hugging Face onder een gewijzigde MIT-licentie, als via de propriëtaire API van het platform Moonshot AI Open Platform.[3][4]

Geschiedenis en achtergrond

Oprichting van Moonshot AI

Moonshot AI werd opgericht in maart 2023 in Peking door Yang Zhilin (CEO), Zhou Xinyu en Wu Yuxin — afgestudeerden van de Tsinghua University. Yang Zhilin werkte eerder bij Google Brain en Meta en was betrokken bij onderzoek op het gebied van computer vision en redeneren. Het bedrijf ontving financiering van Alibaba (een ronde van $1 miljard, februari 2024), Tencent en andere investeerders.[5][6]

Tijdlijn van belangrijke releases

  • Oktober–november 2023 — lancering van de chatbot Kimi met ondersteuning voor context tot 128.000 tokens (tot 200.000 Chinese tekens). De eerste versies maakten gebruik van propriëtaire modellen met beperkt openbaar gemaakte technische details.[6][7]
  • Maart 2024 — uitbreiding van de context tot 2 miljoen tekens in de bètaversie.[6]
  • Januari 2025 — uitgifte van Kimi k1.5 — een multimodaal model met opgeschaald Reinforcement Learning (RL), beschreven als vergelijkbaar in prestaties met OpenAI o1 op het gebied van wiskunde, programmeren en multimodaal redeneren. Context tot 128.000 tokens.[8]
  • April 2025 — introductie van Kimi-VL — een open multimodaal MoE-model (vision-language model, VLM) met visuele encoder MoonViT (~400 miljoen parameters) en ~2,8 miljard actieve parameters in de decoder. Het technische rapport werd gepubliceerd op arXiv.[9]
  • Juli 2025 — uitgifte van Kimi K2 — het belangrijkste open MoE-model met 1 biljoen parameters en 32 miljard actieve parameters. Het technische rapport werd gepubliceerd op arXiv.[1] Het model bezette de eerste plaats onder open modellen op de LMSYS Chatbot Arena op het moment van uitgifte (meer dan 3000 stemmen).[1]
  • September 2025 — update Kimi-K2-Instruct-0905 met uitgebreide context tot 256.000 tokens en verbeterde agentische codering.[1]
  • November 2025 — uitgifte van Kimi K2 Thinking — een versie met versterkt stapsgewijs redeneren (chain-of-thought) en ondersteuning voor 200–300 opeenvolgende tool calls.[10]
  • Januari 2026 — introductie van Kimi K2.5 — een multimodaal MoE-model met native multimodaliteit en het Agent Swarm-mechanisme (parallelle orkestratie van sub-agenten).[2]

Parallel aan de modelontwikkeling werd in 2024 de eigen inferentiedienst Mooncake geïntroduceerd — een KVCache-gerichte gedisaggregeerde architectuur voor het bedienen van LLM's met lange context.[11]

Theoretische grondslagen en architectuur

Mixture-of-Experts-architectuur

De modellen van de Kimi K2- en K2.5-serie implementeren de Transformer-architectuur met Mixture-of-Experts in afzonderlijke lagen. Een standaard transformerblok bestaat uit een samenstelling van Multi-Head Attention (MHA)-lagen en positionsgewijze MLP's (meerlagige perceptrons) met residuele verbindingen:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

waar 𝐇L×d de invoer-token-representaties zijn, L de lengte van de reeks en d de grootte van de verborgen toestand.

In een MoE-laag wordt in plaats van één MLP een verzameling experts {Ei}i=1N gebruikt, waarbij elke expert een afzonderlijke MLP is met parameters θi. Een router (gating network) selecteert voor elk token een subset van experts. De uitvoer van de MoE-laag voor een token met representatie 𝐡 wordt als volgt gedefinieerd:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

waar 𝒮(𝐡){1,,N} de verzameling geselecteerde experts is voor het betreffende token, gi(𝐡) de genormaliseerde routergewichten zijn en i𝒮gi=1. De routerfunctie selecteert experts via een TopK-operatie:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

waar Wg een trainbare routermatrix is. Dit schema maakt het mogelijk om het totale aantal parameters op te schalen bij een beperkt aantal parameters dat per token wordt geactiveerd.

Architecturale hyperparameters van Kimi K2 / K2.5

Parameter Waarde
Type architectuur Transformer met Mixture-of-Experts
Totaal aantal parameters 1,04 biljoen
Geactiveerde parameters per token 32 miljard
Aantal lagen 61 (1 dense + 60 MoE)
Grootte verborgen toestand 7168
Aantal attention-heads 64
Aantal experts 384 (8 geselecteerd per token + 1 gedeelde)
Grootte verborgen toestand expert (MoE hidden size) 2048
Woordenschatgrootte 160.000 tokens
Activatiefunctie SwiGLU
Attention-mechanisme Multi-head Latent Attention (MLA)
Maximale context 256.000 tokens (uitbreiding via YaRN)
Visuele encoder (K2.5) MoonViT-3D, ~400 miljoen parameters

[1][2][13]

De sparsiteitsverhouding (verhouding van het totale aantal experts tot het geactiveerde aantal) bedraagt 48:1 (384 experts, 8 actief), wat zorgt voor een aanzienlijke verlaging van de rekenkosten ten opzichte van een dense model van dezelfde omvang.[1]

Multi-head Latent Attention (MLA) - Meerhoofdige Latente Aandacht

In de modellen van de Kimi K2/K2.5-serie wordt het mechanisme Multi-head Latent Attention (MLA) gebruikt — een modificatie van de standaard meerhoofdige aandacht, gericht op hogere efficiëntie en schaalbaarheid. De standaard aandacht voor één laag wordt berekend als:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

waar 𝐐,𝐊,𝐕L×dk de matrices van queries, sleutels en waarden zijn. In MLA worden latente representaties geïntroduceerd waarop queries en sleutels worden geprojecteerd, waardoor de dimensionaliteit van tussenliggende bewerkingen afneemt en het volume van de KV-cache kan worden gereduceerd. De aanpak is vergelijkbaar met het mechanisme dat is gebruikt in DeepSeek-V3.[1][13]

Optimizer MuonClip en QK-clip

Voor het trainen van het model Kimi K2 werd de optimizer MuonClip voorgesteld — een modificatie van de Muon-optimizer (een momentumoptimizer met Newton-Schulz-normalisatie) met toevoeging van de techniek QK-clip voor het stabiliseren van de training van grote taalmodellen met MoE-architectuur.[1]

QK-clip past beperkingen toe op de attention-logits 𝐐𝐊 via een clipping-operatie. Voor elke attention-head h wordt de maximale logit bepaald:

Shmax=1dmaxi,j(Qhi(Khj)),

en een schaalfactor berekend:

γh=min(1,τShmax),

waar τ=100 een drempelwaarde-hyperparameter is en d de grootte van de attention-head. De factor γh wordt gebruikt voor het schalen van de gewichten Wq,Wk als de maximale logit de drempelwaarde overschrijdt. Dit beperkt het waardenbereik van de logits vóór softmax en vermindert het risico op plotselinge pieken in de verliesfunctie (loss spikes) bij training op grote schaal.[1]

Volgens de auteurs verliep het voortrainen van Kimi K2 op 15,5 biljoen tokens met MuonClip zonder ook maar één geregistreerde piek in de verliesfunctie (zero loss spikes).[1]

Multimodaliteit en MoonViT

De modellen Kimi K2.5 en Kimi-VL gebruiken de visuele encoder MoonViT (in versie K2.5: MoonViT-3D) met circa 400 miljoen parameters, gebouwd op basis van SigLIP-SO-400M met NaViT-packing (ondersteuning voor variabele invoerresolutie van afbeeldingen) en een 3D-uitbreiding voor videoverwerking (groepering per 4 frames).[2][9]

De visuele encoder zet invoerbeelden en video's om in een reeks visuele tokens. Laat 𝐗H×W×3 een invoerafbeelding zijn en Φvis de visuele encoder:

𝐙vis=Φvis(𝐗)Lv×dv,

vervolgens via lineaire projectie (twee-laags MLP) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

waar d de grootte van de verborgen ruimte van het taalgedeelte van het model is. In multimodale modus wordt 𝐇vis geconcateneerd met teksttokens en in de transformer ingevoerd.[9][2]

Anders dan bij tweefasige schema's (toevoegen van een visuele adapter bovenop een tekstmodel) is K2.5 getraind op gemengde visueel-tekstuele data vanaf het begin van de voortrainingsfase (joint text-vision pre-training), met een laag aandeel visuele tokens (~10%) in de vroege fasen en geleidelijke toename. Het totale volume bedraagt circa 15 biljoen gemengde visueel-tekstuele tokens.[2]

Voortraining en natraining

Voortraining

Kimi K2 is voorgetraind op 15,5 biljoen tokens (webteksten, code, wiskunde, encyclopedische kennis) met gebruik van de MuonClip-optimizer. Gedurende de gehele voortrainingsfase werd geen enkele piek in de verliesfunctie (loss spike) geregistreerd.[1]

Kimi K2.5 onderging een continue voortraining (continual pre-training) vanuit het controlepunt van K2 op aanvullende ~15 biljoen gemengde visueel-tekstuele tokens met gezamenlijke optimalisatie van modaliteiten (joint pre-training). Afzonderlijk werd 1 biljoen tokens standalone-training van de visuele encoder uitgevoerd, alsmede een aanvullende fase van long-context mid-training voor contextuitbreiding.[2]

Natraining

De natraining van de K2-serie modellen omvat meerdere fasen:[1][2]

Supervised Fine-Tuning (SFT, begeleide verfijning):

  • Synthetische agentische trajecten (agentic data synthesis) — het genereren van hulpmiddelspecificaties, het simuleren van interacties met de omgeving en de verificatie van resultaten.
  • Voor K2.5 wordt aanvullend zero-vision SFT toegepast — tekstuele SFT die visuele vermogens activeert zonder direct gebruik van afbeeldingen tijdens de fine-tuning-fase.

Reinforcement Learning (RL, bekrachtigend leren):

  • Combinatie van verifieerbare beloningen (Reinforcement Learning with Verifiable Rewards, RLVR) voor taken op het gebied van wiskunde, code en veiligheid.
  • Zelfevaluatie op basis van rubrieken (self-critique rubric rewards) — het gebruik van LLM-beoordelaars voor automatische kwaliteitsbeoordeling van agentische scenario's.
  • Voor K2.5 — gezamenlijk multimodaal RL (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking en K2.5 ondersteunen native INT4-gewichtskwantisering (weight-only quantization, groep 32, gecomprimeerde tensoren), geoptimaliseerd voor de NVIDIA Hopper-architectuur, wat de geheugenvereisten bij inferentie vermindert.[10][2]

Agent Swarm (K2.5)

Voor het model K2.5 is het mechanisme Agent Swarm ontwikkeld — een framework voor zelfgestuurde parallelle agentorkestratie. Het orchestratormodel maakt dynamisch sub-agenten aan (via bewerkingen create_subagent en assign_task), verdeelt deeltaken en verzamelt de resultaten. Elke sub-agent kan zelfstandig hulpmiddelen aanroepen en parallel werken met andere sub-agenten.[2]

Het trainen van het Agent Swarm-mechanisme is gerealiseerd via Parallel-Agent Reinforcement Learning (PARL) met ontkoppeling van uitvoering en optimalisatie (decoupling execution/optimization). Volgens de auteurs zorgt Agent Swarm voor een verlaging van de latentie tot 4,5× ten opzichte van de enkelvoudige agentmodus (single-agent).[2]

Belangrijkste modellen van de serie

Model Type Parameters (totaal / actief) Context, tokens Multimodaliteit Releasedatum
Kimi k1.5 LLM, RL-scaling niet openbaar gemaakt 128.000 Ja (beperkt) Januari 2025
Kimi-VL VLM, MoE compact / ~2,8 miljard actief + 400 miljoen ViT lange context Ja (afbeeldingen) April 2025
Kimi K2 LLM, MoE 1,04 biljoen / 32 miljard 256.000 Nee (tekst) Juli 2025
Kimi K2 Thinking LLM, MoE 1,04 biljoen / 32 miljard 256.000 Nee (tekst) November 2025
Kimi K2.5 VLM-LLM, MoE 1,04 biljoen / 32 miljard 256.000 Ja (afbeeldingen, video, PDF) Januari 2026

[8][9][1][10][2]

Kimi K2

Kimi K2 is een Mixture-of-Experts LLM met 1,04 biljoen totale parameters en 32 miljard geactiveerde parameters per token. Het model is voorgetraind op 15,5 biljoen tokens met de MuonClip-optimizer. De architectuur omvat 384 experts en een voor lange context geschikt MLA-mechanisme. Het model is gericht op taken op het gebied van programmeren, wiskundig redeneren en agentische scenario's met opeenvolgende aanroepen van hulpmiddelen.[1]

Het technische rapport beschrijft een meertraps natrainings-pipeline: grootschalige synthese van agentische data door het simuleren van interacties met hulpmiddelen; Reinforcement Learning in een gemengde omgeving van echte en synthetische taken; gebruik van LLM-beoordelaars voor automatische kwaliteitsbeoordeling.[1][14]

Kimi K2 Thinking

De variant Kimi K2 Thinking is geoptimaliseerd voor meerstaps-redeneren (chain-of-thought) met de mogelijkheid van dynamische aanroepen van hulpmiddelen en ondersteuning van context tot 256.000 tokens. Het model implementeert een afzonderlijke "Thinking"-modus met een expliciet teruggegeven veld reasoning_content dat interne redeneringen bevat. K2 Thinking ondersteunt 200–300 opeenvolgende tool calls in één agentische episode zonder significante degradatie van het gedrag, evenals native INT4-kwantisering met gebruikmaking van QAT.[10]

Kimi-VL

Kimi-VL is een open multimodaal MoE-VLM (vision-language model), gericht op taken van visueel begrip, visueel-tekstueel redeneren en herkenning van echte scènes. Het model wordt beschreven als een compacte MoE-architectuur met de visuele encoder MoonViT. Het technische rapport werd gepubliceerd op arXiv in april 2025.[9]

Kimi K2.5

Kimi K2.5 is een multimodaal MoE-model van de omvang van 1,04 biljoen parameters met 32 miljard geactiveerde parameters, gebaseerd op het controlepunt Kimi-K2-Base met voortgezette voortraining op ~15 biljoen gemengde visueel-tekstuele tokens. Het model ondersteunt invoer van afbeeldingen, video's, PDF's en tekst met context tot 256.000 tokens.[2]

K2.5 ondersteunt twee hoofdmodi voor inferentie:

  • Thinking mode — met expliciet reasoning_content en meerstaps-generatie;
  • Instant mode — zonder het weergeven van redeneringen, met lagere latentie.[2][13]

Het model implementeert native INT4-gewichtskwantisering (weight-only, groep 32), geoptimaliseerd voor de NVIDIA Hopper-architectuur.[2]

Belangrijkste resultaten en benchmarks

Tekst- en agentische benchmarks van Kimi K2

De resultaten zijn vermeld voor Kimi-K2-Instruct in de non-thinking modus (zonder uitgebreide chain-of-thought) op basis van het technische rapport.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Bron
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

Volgens de auteurs positioneren deze resultaten K2 onder de koplopers van open modellen in de non-thinking modus, met name op ingenieurs- en agentische taken (op het moment van publicatie van het rapport).[1]

Benchmarks van Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Bron
MMVet (nauwkeurigheid) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

De resultaten tonen aan dat een compacte multimodale MoE-architectuur een niveau bereikt dat vergelijkbaar is met grotere modellen bij een kleiner aantal actieve parameters.[9]

Benchmarks van Kimi K2.5

De resultaten zijn vermeld in de Thinking-modus (temperature = 1,0; top-p = 0,95; context 256.000 tokens; engine vLLM; hardwareplatform NVIDIA H200) op basis van de modelkaart op het NVIDIA NIM-platform en het technische rapport.[2][13]

Categorie Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (zonder hulpmiddelen) 30,1
HLE-Full (met hulpmiddelen) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

Daarnaast vertoont K2.5 een positieve overdracht van visueel leren naar tekstuele taken: +1,7% op MMLU-Pro en +2,1% op GPQA-Diamond ten opzichte van het tekstuele basismodel K2.[2]

De definitieve vergelijkende beoordeling hangt af van de keuze van meetwaarden en scenario's; de resultaten zijn vermeld op basis van de gegevens van de auteurs. Onafhankelijke validatie van een deel van de benchmarks was op het moment van publicatie beperkt.[2][15]

Toepassingen

Tekstassistent en zoeken

Het platform Kimi wordt gebruikt als assistent met ondersteuning voor de verwerking van lange documenten (onderzoeksrapporten, financiële gegevens), geautomatiseerde analyse en online zoeken met informatie-aggregatie. Moonshot AI geeft aan dat Kimi meer dan 300 tool calls ondersteunt binnen één agentisch scenario.[7][4]

Programmeren en ingenieerstaken

Kimi K2 en K2.5 behalen hoge scores op SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench en andere programmeerbenchmarks. De modellen worden ingezet voor het automatiseren van foutherstel in repositories, het genereren en refactoren van code en het oplossen van online-judge-taken (OJBench, LiveCodeBench). Het technische rapport van K2 geeft aan dat het model is getraind op een grootschalig synthetisch agentisch corpus, inclusief interacties met versiebeheersystemen, pakketbeheerders en uitvoeringsomgevingen.[1][2][14]

Multimodale toepassingen

Kimi-VL en K2.5 zijn bedoeld voor visuele vraag-en-antwoord (VQA) op afbeeldingen en documenten; documentbegrip (OCRBench, OmniDocBench); video-analyse (VideoMMMU, LongVideoBench); gecombineerde programmeertaken op basis van visuele specificaties (zoals het genereren van een interface op basis van een afbeeldingsopmaak). Voor K2.5 worden scenario's voor "vision-grounded coding" en "autonomous visual debugging" beschreven, waarbij het model code genereert op basis van een visuele beschrijving en het visuele resultaat iteratief analyseert.[2][9][15]

API en inzet

De modellen zijn beschikbaar via de API van het platform Moonshot AI Open Platform met ondersteuning voor tool calling, thinking-modus, JSON-modus en context-caching. Open gewichten worden gebruikt voor lokale inzet via vLLM, SGLang en TensorRT-LLM. De dienst Mooncake zorgt voor het schalen van inferentie bij lange context.[4][11][16]

Beperkingen en openstaande problemen

Resourcevereisten

MoE-modellen van de omvang van 1 biljoen parameters, zelfs met 32 miljard geactiveerde parameters en INT4-kwantisering, vereisen aanzienlijke geheugen- en bandbreedtebronnen. In technische discussies over de inzet van Kimi K2.5 worden schattingen van honderden gigabytes videogeheugen voor volledig laden van het model genoemd; de concrete getallen hangen af van de kwantiseringsvorm en het framework (vLLM, SGLang, enz.).[2][17]

Hallucinaties en kwaliteit van generatie

Net als andere LLM's zijn de modellen van de Kimi-serie vatbaar voor hallucinaties. In rapporten over de tests FACTS Grounding en FaithJudge zijn hallucination rates van 1,1–7,4% geregistreerd in RAG-scenario's. In de non-thinking modus kan het model overtollige tokens genereren bij onduidelijke hulpmiddelspecificaties; bij geforceerd inschakelen van tool-use daalt de prestatie op bepaalde taken.[1]

Afhankelijkheid van synthetische data en de RL-pipeline

De pipeline voor de synthese van agentische data en Reinforcement Learning is afhankelijk van een grote verzameling synthetische hulpmiddelen en scenario's, evenals LLM-beoordelaars voor automatische beoordeling (self-judging). Een dergelijk schema roept openstaande vragen op: de robuustheid ten opzichte van vooringenomenheid (bias) bij zelfevaluatie; mogelijke degradatie bij herhaalde iteratie (bootstrap); de overdraagbaarheid van agentische vaardigheden naar reële omgevingen die afwijken van gesimuleerde omgevingen; de invloed van de verdeling van synthetische taken op het generaliserend vermogen.[1][14]

Transparantie en reproduceerbaarheid

Een deel van de informatie over de samenstelling van de trainingsdata, het filterproces, de verdeling van talen en domeinen wordt niet of slechts beperkt openbaar gemaakt. Dit bemoeilijkt een nauwkeurige beoordeling van de bronnen van vooringenomenheid, de reproduceerbaarheid van de training en de onafhankelijke validatie van de invloed van afzonderlijke componenten (MuonClip, QK-clip) op de stabiliteit. Per februari 2026 is een volledige reproductie van de training van Kimi K2 en K2.5 door derden niet gedocumenteerd in de openbare literatuur.[1][2]

Ethische en regulatoire aspecten

In de modelkaarten en technische rapporten wordt benadrukt dat ontwikkelaars verantwoordelijk zijn voor de invoer en uitvoer van het model; dat beschermende mechanismen (guardrails) moeten worden toegevoegd en dat er getest dient te worden op geval-specifieke data vóór implementatie; dat het model afbeeldingen en video's kan verwerken die mogelijk persoonsgegevens bevatten, en dat de integrator verplicht is de toepasselijke wetgeving na te leven.[2][16]

In de technische rapporten worden veiligheidsevaluaties beschreven (biologische, chemische en cyberrisico's) met gebruik van hulpmiddelen zoals Promptfoo. De modellen ondergaan RL-uitlijning (alignment) met verifieerbare beloningen en zelfevaluatie.[1]

Als product van een Chinees bedrijf zijn de modellen onderworpen aan de nationale regelgeving van China op het gebied van AI. Op het moment van schrijven zijn er geen afzonderlijke publieke regelgevingsdocumenten gevonden die uitsluitend gewijd zijn aan de Kimi-modellen; de regulering vindt plaats in het kader van algemene benaderingen voor generatieve modellen en AI in de betreffende rechtsgebieden.[18]

In februari 2026 verklaarde het bedrijf Anthropic dat Moonshot AI (samen met andere Chinese ontwikkelaars) valse accounts had gebruikt om interacties met Claude te genereren met als doel data te destilleren voor het trainen van modellen. De informatie heeft het karakter van een bewering van één partij en is niet bevestigd door onafhankelijk onderzoek op het moment van publicatie; Moonshot AI heeft geen officieel antwoord gepubliceerd.[5]

Vooruitzichten en onderzoeksrichtingen

Op basis van gepubliceerde materialen kunnen verschillende richtingen voor verder onderzoek worden onderscheiden:

  • Schaalbare agentische systemen. Ontwikkeling van benaderingen voor het trainen van LLM's als agentische systemen met gebruik van synthetische hulpmiddelen, RL en self-judging. Uitbreiding van Agent Swarm naar een groter aantal sub-agenten en nieuwe typen taken.[2][1]
  • Efficiënte MoE-architecturen. Het gebruik van 1 biljoen parameters met 32 miljard geactiveerde parameters en 384 experts vertegenwoordigt één variant van het compromis tussen omvang en efficiëntie; alternatieven met verschillende routeringsschema's worden onderzocht.[1]
  • Native multimodaliteit. Het trainen van K2.5 op gemengde visueel-tekstuele data vanaf het begin van de voortrainingsfase vertegenwoordigt een benadering van "native" multimodaliteit, die wordt vergeleken met tweefasige schema's.[2][9]
  • Efficiënte inferentie en lange context. INT4-kwantisering en ondersteuning van context van 256.000 tokens stimuleren verder onderzoek op het gebied van sparse attention, latente representaties en extern geheugen. Afzonderlijk wordt het project Kimi Linear beschreven — een hybride lineaire aandacht met 75% reductie van de KV-cache en 6× versnelling van decodering bij een context van 1 miljoen tokens.[2][19]

In de officiële materialen van Moonshot AI worden geen gedetailleerde routekaarten voor toekomstige versies van Kimi gepubliceerd; de genoemde richtingen zijn gebaseerd op gepubliceerde onderzoeken.

Zie ook

  • Transformer-architectuur
  • DeepSeek
  • Qwen

Verwijzingen

Literatuur

Noten

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692