Kimi (Moonshot AI) (IT)
Kimi (serie di modelli Moonshot AI) — serie di grandi modelli linguistici (Large Language Model, LLM), sviluppati dalla società cinese Moonshot AI (Pechino, Repubblica Popolare Cinese) per compiti di generazione testuale e multimodale, programmazione e sistemi agentici (agentic systems — sistemi capaci di pianificazione autonoma, ragionamento e azione mediante strumenti esterni). La famiglia comprende modelli testuali e multimodali con architettura Mixture-of-Experts (MoE, miscela di esperti) su scala di circa 1 trilione di parametri e un sottoinsieme attivato di circa 32 miliardi di parametri per token.[1][2] Una caratteristica importante della serie è l'orientamento al comportamento agentico (pianificazione a più passi con invocazione di strumenti esterni) e il supporto di un contesto lungo fino a 256 000 token nelle versioni Kimi K2 e Kimi K2.5.[1][2]
I modelli della serie Kimi sono distribuiti sia con pesi aperti (open-weight) sulla piattaforma Hugging Face sotto una licenza MIT modificata, sia tramite API proprietaria della piattaforma Moonshot AI Open Platform.[3][4]
Storia e presupposti
Fondazione di Moonshot AI
Moonshot AI è stata fondata nel marzo 2023 a Pechino da Yang Zhilin (CEO), Zhou Xinyu e Wu Yuxin — laureati dell'Università di Tsinghua (Tsinghua University). Yang Zhilin aveva precedentemente lavorato presso Google Brain e Meta, partecipando a ricerche nel campo della visione artificiale e del ragionamento. La società ha ricevuto finanziamenti da Alibaba (round da 1 miliardo di dollari, febbraio 2024), Tencent e altri investitori.[5][6]
Cronologia delle principali versioni
- Ottobre–novembre 2023 — lancio del chatbot Kimi con supporto di un contesto fino a 128 mila token (fino a 200 mila caratteri cinesi). Le prime versioni utilizzavano modelli proprietari con dettagli tecnici parzialmente divulgati.[6][7]
- Marzo 2024 — estensione del contesto fino a 2 milioni di caratteri nella versione beta.[6]
- Gennaio 2025 — rilascio di Kimi k1.5 — un modello multimodale con addestramento tramite Reinforcement Learning (RL) scalato, dichiarato comparabile in termini di prestazioni a OpenAI o1 nei compiti di matematica, programmazione e ragionamento multimodale. Contesto fino a 128 000 token.[8]
- Aprile 2025 — presentazione di Kimi-VL — un modello MoE multimodale aperto (vision-language model, VLM) con encoder visivo MoonViT (~400 milioni di parametri) e ~2,8 miliardi di parametri attivi nel decoder. Il rapporto tecnico è stato pubblicato su arXiv.[9]
- Luglio 2025 — rilascio di Kimi K2 — il principale modello MoE aperto con 1 trilione di parametri e 32 miliardi di parametri attivi. Il rapporto tecnico è stato pubblicato su arXiv.[1] Al momento del rilascio il modello occupava il primo posto tra i modelli aperti su LMSYS Chatbot Arena (oltre 3000 voti).[1]
- Settembre 2025 — aggiornamento Kimi-K2-Instruct-0905 con contesto esteso fino a 256 000 token e codifica agentica migliorata.[1]
- Novembre 2025 — rilascio di Kimi K2 Thinking — versione con ragionamento passo-passo potenziato (chain-of-thought) e supporto di 200–300 invocazioni sequenziali di strumenti (tool calls).[10]
- Gennaio 2026 — presentazione di Kimi K2.5 — un modello MoE multimodale con multimodalità nativa e meccanismo Agent Swarm (orchestrazione parallela di sotto-agenti).[2]
Parallelamente allo sviluppo dei modelli, nel 2024 è stato presentato il servizio di inferenza proprietario Mooncake — un'architettura disaggregata incentrata sul KVCache per la gestione di LLM con contesto lungo.[11]
Fondamenti teorici e architettura
Architettura Mixture-of-Experts
I modelli della serie Kimi K2 e K2.5 implementano un'architettura Transformer con Mixture-of-Experts in determinati livelli. Il blocco standard del transformer è una composizione di livelli di Multi-Head Attention (MHA) e MLP (percettrone multistrato) position-wise con connessioni residuali:[1][12]
dove sono le rappresentazioni dei token in ingresso, è la lunghezza della sequenza, è la dimensione dello stato nascosto.
Nel livello MoE, al posto di un singolo MLP viene utilizzato un insieme di esperti , ognuno dei quali rappresenta un MLP separato con parametri . Il router (gating network) seleziona per ciascun token un sottoinsieme di esperti. L'uscita del livello MoE per un token con rappresentazione è definita come:[1]
dove è l'insieme degli esperti selezionati per il dato token, sono i pesi normalizzati del router, . La funzione di routing seleziona gli esperti tramite l'operazione TopK:[1]
dove è la matrice del router apprendibile. Tale schema consente di scalare il numero totale di parametri mantenendo limitato il numero di parametri attivati per ciascun token.
Iperparametri architetturali di Kimi K2 / K2.5
| Parametro | Valore |
|---|---|
| Tipo di architettura | Transformer con Mixture-of-Experts |
| Numero totale di parametri | 1,04 trilioni |
| Parametri attivati per token | 32 miliardi |
| Numero di livelli | 61 (1 denso + 60 MoE) |
| Dimensione dello stato nascosto | 7168 |
| Numero di teste di attenzione | 64 |
| Numero di esperti | 384 (8 selezionati per token + 1 condiviso) |
| Dimensione dello stato nascosto dell'esperto (MoE hidden size) | 2048 |
| Dimensione del vocabolario | 160 000 token |
| Funzione di attivazione | SwiGLU |
| Meccanismo di attenzione | Multi-head Latent Attention (MLA) |
| Contesto massimo | 256 000 token (estensione tramite YaRN) |
| Encoder visivo (K2.5) | MoonViT-3D, ~400 milioni di parametri |
La sparsità (rapporto tra il numero totale di esperti e quello degli esperti attivati) è pari a 48:1 (384 esperti, 8 attivi), il che garantisce una significativa riduzione dei costi computazionali rispetto a un modello denso (dense) della stessa scala.[1]
Meccanismo Multi-head Latent Attention (MLA)
Nei modelli della serie Kimi K2/K2.5 viene utilizzato il meccanismo Multi-head Latent Attention (MLA) — una modifica dell'attenzione multi-testa standard, orientata ad aumentare l'efficienza e la scalabilità. L'attenzione standard per un singolo livello è calcolata come:[12]
dove sono le matrici di query, chiavi e valori. In MLA vengono introdotte rappresentazioni latenti su cui vengono proiettate le query e le chiavi, il che riduce la dimensionalità delle operazioni intermedie e consente di ridurre la dimensione del KV-cache. L'approccio è analogo al meccanismo utilizzato in DeepSeek-V3.[1][13]
Ottimizzatore MuonClip e QK-clip
Per l'addestramento del modello Kimi K2 è stato proposto l'ottimizzatore MuonClip — una modifica dell'ottimizzatore Muon (ottimizzatore a momento con normalizzazione Newton-Schulz) con l'aggiunta della tecnica QK-clip per stabilizzare l'addestramento di grandi modelli linguistici con architettura MoE.[1]
QK-clip applica vincoli ai logit di attenzione tramite un'operazione di clipping. Per ciascuna testa di attenzione viene determinato il logit massimo:
e viene calcolato il coefficiente di scala:
dove è l'iperparametro soglia, è la dimensione della testa di attenzione. Il coefficiente viene applicato per scalare i pesi se il logit massimo supera la soglia. Ciò limita l'intervallo dei valori dei logit prima della softmax e riduce il rischio di picchi improvvisi della perdita (loss spikes) durante l'addestramento su larga scala.[1]
Secondo gli autori, il pre-addestramento di Kimi K2 su 15,5 trilioni di token con MuonClip si è svolto senza alcun picco della funzione di perdita registrato (zero loss spikes).[1]
Multimodalità e MoonViT
I modelli Kimi K2.5 e Kimi-VL utilizzano l'encoder visivo MoonViT (nella versione K2.5 — MoonViT-3D) con circa 400 milioni di parametri, costruito sulla base di SigLIP-SO-400M con NaViT-packing (supporto di risoluzione variabile delle immagini in ingresso) e un'estensione 3D per l'elaborazione video (raggruppamento per 4 fotogrammi).[2][9]
L'encoder visivo trasforma le immagini e i video in ingresso in una sequenza di token visivi. Sia l'immagine in ingresso, l'encoder visivo:
poi tramite proiezione lineare (MLP a due livelli) :
dove è la dimensione dello spazio nascosto della parte linguistica del modello. In modalità multimodale viene concatenato con i token testuali e fornito in ingresso al transformer.[9][2]
A differenza degli schemi a due fasi (aggiunta di un adattatore visivo sopra il modello testuale), K2.5 è stato addestrato su dati visivo-testuali misti fin dall'inizio del pre-addestramento (joint text-vision pre-training), con una bassa quota di token visivi (~10%) nelle fasi iniziali e un aumento progressivo. Il volume totale è di circa 15 trilioni di token visivo-testuali misti.[2]
Pre-addestramento e post-addestramento
Pre-addestramento
Kimi K2 è stato pre-addestrato su 15,5 trilioni di token (testi web, codice, matematica, conoscenze enciclopediche) utilizzando l'ottimizzatore MuonClip. Nessun picco della perdita (loss spike) è stato registrato per l'intero periodo di pre-addestramento.[1]
Kimi K2.5 ha subito un pre-addestramento continuo (continual pre-training) a partire dal checkpoint K2 su ulteriori ~15 trilioni di token visivo-testuali misti con ottimizzazione congiunta delle modalità (joint pre-training). Separatamente è stato effettuato un addestramento standalone dell'encoder visivo su 1 trilione di token e una fase aggiuntiva di long-context mid-training per l'estensione del contesto.[2]
Post-addestramento
Il post-addestramento dei modelli della serie K2 comprende diverse fasi:[1][2]
Supervised Fine-Tuning (SFT, messa a punto supervisionata):
- Traiettorie agentiche sintetiche (agentic data synthesis) — generazione di specifiche degli strumenti, simulazione delle interazioni con l'ambiente, verifica dei risultati.
- Per K2.5 viene applicato in aggiunta zero-vision SFT — SFT testuale che attiva le capacità visive senza l'utilizzo diretto di immagini nella fase di fine-tuning.
Reinforcement Learning (RL, apprendimento per rinforzo):
- Combinazione di ricompense verificabili (Reinforcement Learning with Verifiable Rewards, RLVR) per compiti di matematica, codice e sicurezza.
- Auto-valutazione tramite rubriche (self-critique rubric rewards) — utilizzo di LLM valutatori per la valutazione automatica della qualità degli scenari agentici.
- Per K2.5 — RL multimodale congiunto (joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking e K2.5 supportano la quantizzazione nativa INT4 dei pesi (weight-only quantization, gruppo 32, tensori compressi), ottimizzata per l'architettura NVIDIA Hopper, il che riduce i requisiti di memoria durante l'inferenza.[10][2]
Agent Swarm (K2.5)
Per il modello K2.5 è stato sviluppato il meccanismo Agent Swarm — un framework per l'orchestrazione parallela auto-gestita degli agenti. Il modello orchestratore crea dinamicamente sotto-agenti (tramite le operazioni create_subagent, assign_task), distribuisce i sotto-compiti e raccoglie i risultati. Ogni sotto-agente può invocare autonomamente gli strumenti e lavorare in parallelo con gli altri sotto-agenti.[2]
L'addestramento del meccanismo Agent Swarm è realizzato tramite Parallel-Agent Reinforcement Learning (PARL) con separazione dell'esecuzione e dell'ottimizzazione (decoupling execution/optimization). Secondo gli autori, Agent Swarm garantisce una riduzione della latenza fino a 4,5× rispetto alla modalità agentica a singolo thread (single-agent).[2]
Principali modelli della serie
| Modello | Tipo | Parametri (totali / attivi) | Contesto, token | Multimodalità | Data di rilascio |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | non divulgato | 128 000 | Sì (limitata) | Gennaio 2025 |
| Kimi-VL | VLM, MoE | compatto / ~2,8 miliardi attivi + 400 milioni ViT | contesto lungo | Sì (immagini) | Aprile 2025 |
| Kimi K2 | LLM, MoE | 1,04 trilioni / 32 miliardi | 256 000 | No (testo) | Luglio 2025 |
| Kimi K2 Thinking | LLM, MoE | 1,04 trilioni / 32 miliardi | 256 000 | No (testo) | Novembre 2025 |
| Kimi K2.5 | VLM-LLM, MoE | 1,04 trilioni / 32 miliardi | 256 000 | Sì (immagini, video, PDF) | Gennaio 2026 |
Kimi K2
Kimi K2 è un LLM Mixture-of-Experts con 1,04 trilioni di parametri totali e 32 miliardi di parametri attivati per token. Pre-addestrato su 15,5 trilioni di token con l'ottimizzatore MuonClip. L'architettura include 384 esperti e un meccanismo MLA compatibile con contesti lunghi. Il modello è orientato ai compiti di programmazione, ragionamento matematico e scenari agentici con invocazioni sequenziali di strumenti.[1]
Il rapporto tecnico descrive una pipeline di post-addestramento a più fasi: sintesi su larga scala di dati agentici tramite simulazione delle interazioni con gli strumenti; addestramento per rinforzo in un ambiente misto di compiti reali e sintetici; utilizzo di LLM valutatori per la valutazione automatica della qualità.[1][14]
Kimi K2 Thinking
La variante Kimi K2 Thinking è ottimizzata per il ragionamento a più passi (chain-of-thought) con la possibilità di invocare dinamicamente strumenti e con supporto di un contesto fino a 256 000 token. Il modello implementa una modalità «Thinking» separata con un campo reasoning_content esplicitamente restituito, contenente i ragionamenti interni. K2 Thinking supporta 200–300 invocazioni sequenziali di strumenti in un singolo episodio agentico senza significativa degradazione del comportamento, nonché la quantizzazione nativa INT4 tramite QAT.[10]
Kimi-VL
Kimi-VL è un VLM (vision-language model) MoE multimodale aperto, orientato ai compiti di comprensione visiva, ragionamento visivo-testuale e scene del mondo reale. Il modello è descritto come un'architettura MoE compatta con encoder visivo MoonViT. Il rapporto tecnico è stato pubblicato su arXiv nell'aprile 2025.[9]
Kimi K2.5
Kimi K2.5 è un modello MoE multimodale su scala di 1,04 trilioni di parametri con 32 miliardi di parametri attivati, basato sul checkpoint Kimi-K2-Base con pre-addestramento continuato su ~15 trilioni di token visivo-testuali misti. Il modello supporta input di immagini, video, PDF e testo con un contesto fino a 256 000 token.[2]
K2.5 supporta due modalità principali di inferenza:
- Modalità Thinking — con
reasoning_contentesplicito e generazione a più passi; - Modalità Instant — senza output dei ragionamenti, con latenza inferiore.[2][13]
Il modello implementa la quantizzazione nativa INT4 dei pesi (weight-only, gruppo 32), ottimizzata per l'architettura NVIDIA Hopper.[2]
Principali risultati e benchmark
Benchmark testuali e agentici di Kimi K2
I risultati sono riportati per Kimi-K2-Instruct in modalità non-thinking (senza chain-of-thought esteso) secondo i dati del rapporto tecnico.[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | Fonte |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65,8 % | 38,8 % | 72,5 % / 72,7 % | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47,3 % | 20,9 % | 51,0 % | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53,7 % | 44,7 % | 46,9 % | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66,1 % | 48,8 % | 66,1 % | arXiv:2507.20534 |
| ACEBench (En) | 76,5 % | 75,6 % | 80,1 % | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49,5 % | 33,9 % | 46,7 % | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75,1 % | 68,2 % | 74,9 % | arXiv:2507.20534 |
Secondo gli autori, tali risultati posizionano K2 tra i leader dei modelli aperti in modalità senza thinking-expansion, specialmente nei compiti ingegneristici e agentici (al momento della pubblicazione del rapporto).[1]
Benchmark di Kimi-VL
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | Fonte |
|---|---|---|---|---|
| MMVet (accuratezza) | 66,7 % | 67,1 % | 66,9 % | arXiv:2504.07491 |
| RealWorldQA | 68,1 % | 68,5 % | — | arXiv:2504.07491 |
I risultati dimostrano che un'architettura MoE multimodale compatta raggiunge un livello paragonabile a modelli più grandi con un numero inferiore di parametri attivi.[9]
Benchmark di Kimi K2.5
I risultati sono riportati in modalità Thinking (temperature = 1,0; top-p = 0,95; contesto 256 000 token; motore vLLM; piattaforma hardware NVIDIA H200) secondo i dati della scheda modello sulla piattaforma NVIDIA NIM e del rapporto tecnico.[2][13]
| Categoria | Benchmark | Kimi K2.5 |
|---|---|---|
| Ragionamento e Conoscenza | HLE-Full (senza strumenti) | 30,1 |
| HLE-Full (con strumenti) | 50,2 | |
| AIME 2025 | 96,1 | |
| HMMT 2025 (Feb) | 95,4 | |
| GPQA-Diamond | 87,6 | |
| MMLU-Pro | 87,1 | |
| Visione e Video | MMMU-Pro | 78,5 |
| MathVision | 84,2 | |
| MathVista (mini) | 90,1 | |
| OCRBench | 92,3 | |
| OmniDocBench 1.5 | 88,8 | |
| VideoMMMU | 86,6 | |
| LongVideoBench | 79,8 | |
| Programmazione | SWE-Bench Verified | 76,8 |
| SWE-Bench Pro | 50,7 | |
| SWE-Bench Multilingual | 73,0 | |
| Terminal Bench 2.0 | 50,8 | |
| PaperBench | 63,5 | |
| LiveCodeBench v6 | 85,0 | |
| OJBench (C++) | 57,4 | |
| Contesto Lungo | Longbench v2 | 61,0 |
| AA-LCR | 70,0 | |
| Ricerca Agentica | BrowseComp | 60,6 |
| BrowseComp (Agent Swarm) | 78,4 | |
| WideSearch (iter-F1) | 72,7 | |
| DeepSearchQA | 77,1 |
Inoltre K2.5 mostra un trasferimento positivo dell'apprendimento visivo ai compiti testuali: +1,7% su MMLU-Pro e +2,1% su GPQA-Diamond rispetto al modello base testuale K2.[2]
La valutazione comparativa definitiva dipende dalla scelta delle metriche e degli scenari; i risultati sono riportati secondo i dati degli autori. La validazione indipendente di parte dei benchmark al momento della pubblicazione è limitata.[2][15]
Applicazioni
Assistente testuale e ricerca
La piattaforma Kimi viene utilizzata come assistente con supporto per l'elaborazione di documenti lunghi (report di ricerca, dati finanziari), analisi automatizzata e ricerca online con aggregazione delle informazioni. Moonshot AI indica che Kimi supporta oltre 300 invocazioni di strumenti (tool calls) nell'ambito di un singolo scenario agentico.[7][4]
Programmazione e compiti ingegneristici
Kimi K2 e K2.5 mostrano risultati elevati su SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench e altri benchmark di programmazione. I modelli vengono applicati per l'automazione della correzione di bug nei repository, la generazione e il refactoring del codice, la risoluzione di problemi di giudici online (OJBench, LiveCodeBench). Il rapporto tecnico di K2 indica che il modello è stato addestrato su un corpus agentico sintetico su larga scala, comprendente interazioni con sistemi di controllo versione, gestori di pacchetti e ambienti di esecuzione.[1][2][14]
Applicazioni multimodali
Kimi-VL e K2.5 sono destinati al question answering visivo (VQA) su immagini e documenti; alla comprensione dei documenti (OCRBench, OmniDocBench); all'analisi video (VideoMMMU, LongVideoBench); ai compiti combinati di programmazione su specifiche visive (ad esempio, generazione di interfacce da un layout di immagine). Per K2.5 sono descritti scenari di «vision-grounded coding» e «autonomous visual debugging», in cui il modello genera codice sulla base di una descrizione visiva e analizza iterativamente il risultato visivo.[2][9][15]
API e distribuzione
I modelli sono disponibili tramite API della piattaforma Moonshot AI Open Platform con supporto di tool calling, modalità thinking, modalità JSON e caching del contesto. I pesi aperti vengono utilizzati per la distribuzione locale tramite vLLM, SGLang e TensorRT-LLM. Il servizio Mooncake garantisce la scalabilità dell'inferenza per contesti lunghi.[4][11][16]
Limitazioni e problemi aperti
Requisiti di risorse
I modelli MoE su scala di 1 trilione di parametri, anche con 32 miliardi di parametri attivati e quantizzazione INT4, richiedono risorse di memoria e larghezza di banda significative. Nelle discussioni tecniche sulla distribuzione di Kimi K2.5 vengono menzionate stime dell'ordine di centinaia di gigabyte di memoria GPU per il caricamento completo del modello; i numeri specifici dipendono dalla modalità di quantizzazione e dal framework (vLLM, SGLang, ecc.).[2][17]
Allucinazioni e qualità della generazione
Come altri LLM, i modelli della serie Kimi sono soggetti ad allucinazioni. Nei report sui test FACTS Grounding e FaithJudge sono stati registrati tassi di allucinazione (hallucination rate) compresi tra 1,1% e 7,4% negli scenari RAG. In modalità non-thinking il modello può generare token ridondanti con specifiche di strumenti poco chiare; con l'attivazione forzata del tool-use le prestazioni diminuiscono su alcuni compiti.[1]
Dipendenza dai dati sintetici e dalla pipeline RL
La pipeline di sintesi dei dati agentici e di addestramento per rinforzo si basa su una vasta raccolta di strumenti e scenari sintetici, nonché su LLM valutatori per la valutazione automatica (self-judging). Tale schema pone domande aperte: robustezza rispetto alla distorsione (bias) dell'auto-valutazione; potenziale degrado in caso di iterazione multipla (bootstrap); trasferibilità delle competenze agentiche ad ambienti reali diversi da quelli simulati; influenza della distribuzione dei compiti sintetici sulla capacità di generalizzazione.[1][14]
Trasparenza e riproducibilità
Parte delle informazioni sulla composizione dei dati di addestramento, il processo di filtraggio, la distribuzione delle lingue e dei domini non viene divulgata o viene divulgata in modo limitato. Ciò rende difficile una valutazione accurata delle fonti di distorsione, la riproducibilità dell'addestramento e la validazione indipendente dell'impatto dei singoli componenti (MuonClip, QK-clip) sulla stabilità. Al momento di febbraio 2026, la piena riproduzione dell'addestramento di Kimi K2 e K2.5 da parte di terzi non è stata documentata nella letteratura aperta.[1][2]
Aspetti etici e normativi
Nelle schede modello e nei rapporti tecnici si sottolinea che gli sviluppatori sono responsabili degli input e degli output del modello; è richiesta l'aggiunta di meccanismi di protezione (guardrails) e il test su dati specifici del caso prima dell'implementazione; il modello può elaborare immagini e video potenzialmente contenenti dati personali, e l'integratore è tenuto a rispettare la normativa applicabile.[2][16]
Nei rapporti tecnici sono descritte valutazioni di sicurezza (rischi biologici, chimici, informatici) con l'utilizzo di strumenti come Promptfoo. I modelli subiscono un allineamento (alignment) tramite RL con ricompense verificabili e auto-valutazione.[1]
In quanto prodotto di una società cinese, i modelli sono soggetti alla normativa nazionale della Repubblica Popolare Cinese in materia di IA. Al momento della redazione non sono stati individuati documenti normativi pubblici separati dedicati esclusivamente ai modelli Kimi; la regolamentazione avviene nell'ambito degli approcci generali ai modelli generativi e all'IA nelle giurisdizioni competenti.[18]
Nel febbraio 2026, la società Anthropic ha dichiarato che Moonshot AI (insieme ad altri sviluppatori cinesi) avrebbe utilizzato account falsi per generare interazioni con Claude al fine di distillare dati per l'addestramento dei modelli. L'informazione ha il carattere di un'affermazione unilaterale e non è stata confermata da indagini indipendenti al momento della pubblicazione; Moonshot AI non ha pubblicato una risposta ufficiale.[5]
Prospettive e direzioni di ricerca
Sulla base dei materiali pubblicati è possibile individuare diverse direzioni di ricerca futura:
- Sistemi agentici scalabili. Sviluppo di approcci per l'addestramento di LLM come sistemi agentici tramite strumentazione sintetica, RL e self-judging. Espansione di Agent Swarm a un maggior numero di sotto-agenti e a nuove tipologie di compiti.[2][1]
- Architetture MoE efficienti. L'utilizzo di 1 trilione di parametri con 32 miliardi di parametri attivati e 384 esperti rappresenta una delle possibili soluzioni di compromesso tra scala ed efficienza; vengono studiate alternative con diversi schemi di routing.[1]
- Multimodalità nativa. L'addestramento di K2.5 su dati visivo-testuali misti fin dall'inizio del pre-addestramento rappresenta un approccio alla multimodalità «nativa», che viene confrontato con gli schemi a due fasi.[2][9]
- Inferenza efficiente e contesto lungo. La quantizzazione INT4 e il supporto di un contesto di 256 000 token stimolano ulteriori ricerche nel campo dell'attenzione sparsa, delle rappresentazioni latenti e della memoria esterna. È descritto separatamente il progetto Kimi Linear — attenzione lineare ibrida con riduzione del KV-cache del 75% e accelerazione della decodifica di 6 volte con un contesto di 1 milione di token.[2][19]
Nei materiali ufficiali di Moonshot AI non vengono pubblicati roadmap dettagliati per le versioni future di Kimi; le direzioni elencate si basano sulle ricerche pubblicate.
Vedi anche
- Architettura Transformer
- DeepSeek
- Qwen
Riferimenti
- https://www.moonshot.ai/ — sito ufficiale di Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — repository GitHub di Kimi K2.5
- https://huggingface.co/moonshotai — profilo di Moonshot AI su Hugging Face
Bibliografia
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692