Kimi (Moonshot AI) (RO)
Kimi (seria de modele Moonshot AI) — serie de modele lingvistice de mari dimensiuni (Large Language Model, LLM), dezvoltate de compania chineză Moonshot AI (Beijing, China) pentru sarcini de generare textuală și multimodală, programare și sisteme agentice (agentic systems — sisteme capabile de planificare autonomă, raționament și acțiune cu utilizarea unor instrumente externe). Familia include modele textuale și multimodale cu arhitectură Mixture-of-Experts (MoE, amestec de experți) la scara de aproximativ 1 trilion de parametri și un subset activat de aproximativ 32 de miliarde de parametri pe token.[1][2] O caracteristică importantă a seriei este orientarea spre comportamentul agentic (planificare în mai mulți pași cu apelarea instrumentelor externe) și suportul unui context lung de până la 256 000 de tokenuri în versiunile Kimi K2 și Kimi K2.5.[1][2]\n\nModelele seriei Kimi sunt distribuite atât cu ponderi deschise (open-weight) pe platforma Hugging Face sub o licență MIT modificată, cât și prin API-ul proprietar al platformei Moonshot AI Open Platform.[3][4]\n\n== Istoric și context ==\n\n=== Fondarea Moonshot AI ===\n\nMoonshot AI a fost fondată în martie 2023 la Beijing de Yang Zhilin (CEO), Zhou Xinyu și Wu Yuxin — absolvenți ai Universității Tsinghua (Tsinghua University). Yang Zhilin a lucrat anterior la Google Brain și Meta, participând la cercetări în domeniul vederii artificiale și al raționamentului. Compania a primit finanțare de la Alibaba (rundă de 1 miliard de dolari, februarie 2024), Tencent și alți investitori.[5][6]\n\n=== Cronologia principalelor lansări ===\n\n* Octombrie–noiembrie 2023 — lansarea chatbot-ului Kimi cu suport de context de până la 128 de mii de tokenuri (până la 200 de mii de caractere chineze). Primele versiuni utilizau modele proprietare cu detalii tehnice divulgate parțial.[6][7]\n* Martie 2024 — extinderea contextului la 2 milioane de caractere chineze în versiunea beta.[6]\n* Ianuarie 2025 — lansarea Kimi k1.5 — un model multimodal cu antrenament prin reinforcement learning la scară (Reinforcement Learning, RL), declarat ca fiind comparabil ca performanță cu OpenAI o1 la sarcini de matematică, programare și raționament multimodal. Context de până la 128 000 de tokenuri.[8]\n* Aprilie 2025 — prezentarea Kimi-VL — un model MoE multimodal deschis (vision-language model, VLM) cu encoder vizual MoonViT (~400 de milioane de parametri) și ~2,8 miliarde de parametri activi în decoder. Raportul tehnic a fost publicat pe arXiv.[9]\n* Iulie 2025 — lansarea Kimi K2 — modelul principal MoE deschis cu 1 trilion de parametri și 32 de miliarde de parametri activi. Raportul tehnic a fost publicat pe arXiv.[1] Modelul a ocupat primul loc printre modelele deschise pe LMSYS Chatbot Arena la momentul lansării (peste 3000 de voturi).[1]\n* Septembrie 2025 — actualizarea Kimi-K2-Instruct-0905 cu context extins la 256 000 de tokenuri și codare agentică îmbunătățită.[1]\n* Noiembrie 2025 — lansarea Kimi K2 Thinking — o versiune cu raționament pas cu pas (chain-of-thought) consolidat și suport pentru 200–300 de apeluri succesive de instrumente (tool calls).[10]\n* Ianuarie 2026 — prezentarea Kimi K2.5 — un model MoE multimodal cu multimodalitate nativă și mecanismul Agent Swarm (orchestrare paralelă a sub-agenților).[2]\n\nÎn paralel cu dezvoltarea modelelor, în 2024 a fost prezentat propriul serviciu de inferență Mooncake — o arhitectură dezagregată centrată pe KVCache pentru servirea LLM cu context lung.[11]\n\n== Fundamente teoretice și arhitectură ==\n\n=== Arhitectura Mixture-of-Experts ===\n\nModelele seriei Kimi K2 și K2.5 implementează arhitectura Transformer cu Mixture-of-Experts în straturi separate. Blocul standard al transformerului reprezintă o compoziție de straturi de atenție multi-cap (Multi-Head Attention, MHA) și MLP (perceptron multistrat) position-wise cu conexiuni reziduale:[1][12]\n\n\n\nunde — reprezentările tokenurilor de intrare, — lungimea secvenței, — dimensiunea stării ascunse.\n\nÎn stratul MoE, în loc de un singur MLP se folosește un set de experți , fiecare reprezentând un MLP separat cu parametrii . Ruter-ul (rețeaua de gating) selectează pentru fiecare token un subset de experți. Ieșirea stratului MoE pentru un token cu reprezentarea este definită ca:[1]\n\n\n\nunde — mulțimea experților selectați pentru tokenul dat, — ponderile normalizate ale ruterului, . Funcția de rutare selectează experții printr-o operație TopK:[1]\n\n\n\nunde — matricea antrenabilă a ruterului. Această schemă permite scalarea numărului total de parametri cu un număr limitat de parametri activați per token.\n\n=== Hiperparametrii arhitecturali Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Parametru !! Valoare\n|-\n| Tipul arhitecturii || Transformer cu Mixture-of-Experts\n|-\n| Numărul total de parametri || 1,04 trilioane\n|-\n| Parametri activați per token || 32 miliarde\n|-\n| Numărul de straturi || 61 (1 dens + 60 MoE)\n|-\n| Dimensiunea stării ascunse || 7168\n|-\n| Numărul de capete de atenție || 64\n|-\n| Numărul de experți || 384 (8 selectați per token + 1 comun)\n|-\n| Dimensiunea stării ascunse a expertului (MoE hidden size) || 2048\n|-\n| Dimensiunea vocabularului || 160 000 de tokenuri\n|-\n| Funcția de activare || SwiGLU\n|-\n| Mecanismul de atenție || Multi-head Latent Attention (MLA)\n|-\n| Contextul maxim || 256 000 de tokenuri (extindere prin YaRN)\n|-\n| Encoder vizual (K2.5) || MoonViT-3D, ~400 de milioane de parametri\n|}\n[1][2][13]\n\nSparsitatea (raportul dintre numărul total de experți și cel activat) este de 48:1 (384 de experți, 8 activi), ceea ce asigură o reducere semnificativă a costurilor de calcul față de un model dens (dense) de aceeași scară.[1]\n\n=== Mecanismul Multi-head Latent Attention (MLA) ===\n\nModelele seriei Kimi K2/K2.5 utilizează mecanismul Multi-head Latent Attention (MLA) — o modificare a atenției multi-cap standard, orientată spre creșterea eficienței și scalabilității. Atenția standard pentru un singur strat se calculează astfel:[12]\n\n\n\nunde — matricele de interogări, chei și valori. În MLA se introduc reprezentări latente pe care sunt proiectate interogările și cheile, reducând dimensionalitatea operațiunilor intermediare și permițând micșorarea volumului cache-ului KV. Abordarea este analogă mecanismului utilizat în DeepSeek-V3.[1][13]\n\n=== Optimizatorul MuonClip și QK-clip ===\n\nPentru antrenarea modelului Kimi K2 a fost propus optimizatorul MuonClip — o modificare a optimizatorului Muon (optimizator de impuls cu normalizare Newton-Schulz) cu adăugarea tehnicii QK-clip pentru stabilizarea antrenării modelelor lingvistice de mari dimensiuni cu arhitectură MoE.[1]\n\nQK-clip aplică restricții asupra logit-urilor de atenție prin operația de trunchiere (clipping). Pentru fiecare cap de atenție se determină logit-ul maxim:\n\n\n\nși se calculează coeficientul de scalare:\n\n\n\nunde — hiperparametrul-prag, — dimensiunea capului de atenție. Coeficientul este aplicat pentru scalarea ponderilor dacă logit-ul maxim depășește pragul. Aceasta limitează intervalul valorilor logit-urilor înainte de softmax și reduce riscul de salturi bruște ale pierderii (loss spikes) la antrenarea la scări mari.[1]\n\nConform datelor autorilor, pre-antrenarea Kimi K2 pe 15,5 trilioane de tokenuri cu MuonClip s-a desfășurat fără niciun salt al funcției de pierdere înregistrat (zero loss spikes).[1]\n\n=== Multimodalitate și MoonViT ===\n\nModelele Kimi K2.5 și Kimi-VL utilizează encoderul vizual MoonViT (în versiunea K2.5 — MoonViT-3D) cu aproximativ 400 de milioane de parametri, construit pe baza SigLIP-SO-400M cu ambalare NaViT (suport pentru rezoluție variabilă a imaginilor de intrare) și o extensie 3D pentru procesarea video (grupare câte 4 cadre).[2][9]\n\nEncoderul vizual transformă imaginile și videoclipurile de intrare într-o secvență de tokenuri vizuale. Fie — imaginea de intrare, — encoderul vizual:\n\n\n\nulterior printr-o proiecție liniară (MLP cu două straturi) :\n\n\n\nunde — dimensiunea spațiului ascuns al componentei lingvistice a modelului. În modul multimodal este concatenat cu tokenurile textuale și transmis transformerului.[9][2]\n\nSpre deosebire de schemele în două etape (adăugarea unui adaptor vizual peste modelul textual), K2.5 a fost antrenat pe date mixte vizual-textuale de la începutul pre-antrenării (joint text-vision pre-training), cu o pondere scăzută a tokenurilor vizuale (~10%) în etapele timpurii și o creștere treptată. Volumul total — aproximativ 15 trilioane de tokenuri vizual-textuale mixte.[2]\n\n== Pre-antrenare și post-antrenare ==\n\n=== Pre-antrenare ===\n\nKimi K2 a fost pre-antrenat pe 15,5 trilioane de tokenuri (texte web, cod, matematică, cunoștințe enciclopedice) folosind optimizatorul MuonClip. Niciun salt al pierderii (loss spike) nu a fost înregistrat pe întreaga perioadă de pre-antrenare.[1]\n\nKimi K2.5 a trecut printr-un pre-antrenament continuu (continual pre-training) pornind de la punctul de control K2 pe ~15 trilioane suplimentare de tokenuri vizual-textuale mixte cu optimizare comună a modalităților (joint pre-training). Separat s-a efectuat antrenamentul standalone al encoderului vizual pe 1 trilion de tokenuri și o etapă suplimentară de long-context mid-training pentru extinderea contextului.[2]\n\n=== Post-antrenare ===\n\nPost-antrenarea modelelor seriei K2 include mai multe etape:[1][2]\n\nSupervised Fine-Tuning (SFT, ajustare fină supervizată):\n* Traiectorii agentice sintetice (agentic data synthesis) — generarea specificațiilor instrumentelor, simularea interacțiunilor cu mediul, verificarea rezultatelor.\n* Pentru K2.5 se aplică suplimentar zero-vision SFT — SFT textual care activează capacitățile vizuale fără utilizarea directă a imaginilor în etapa de fine-tuning.\n\nReinforcement Learning (RL, antrenare prin reinforcement learning):\n* Combinarea recompenselor verificabile (Reinforcement Learning with Verifiable Rewards, RLVR) pentru sarcini de matematică, cod și siguranță.\n* Autoevaluare pe rubrici (self-critique rubric rewards) — utilizarea evaluatorilor LLM pentru evaluarea automată a calității scenariilor agentice.\n* Pentru K2.5 — RL multimodal comun (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking și K2.5 suportă cuantizare nativă INT4 a ponderilor (weight-only quantization, grup 32, tensori comprimați), optimizată pentru arhitectura NVIDIA Hopper, ceea ce reduce cerințele de memorie la inferență.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nPentru modelul K2.5 a fost dezvoltat mecanismul Agent Swarm — un framework de orchestrare paralelă auto-gestionată a agenților. Modelul-orchestrator creează dinamic sub-agenți (prin operațiile create_subagent, assign_task), distribuie sub-sarcinile și colectează rezultatele. Fiecare sub-agent poate apela independent instrumente și poate lucra în paralel cu ceilalți sub-agenți.[2]\n\nAntrenarea mecanismului Agent Swarm este implementată prin Parallel-Agent Reinforcement Learning (PARL) cu decuplarea execuției și optimizării (decoupling execution/optimization). Conform datelor autorilor, Agent Swarm asigură o reducere a latenței de până la 4,5× față de modul agentic cu un singur fir de execuție (single-agent).[2]\n\n== Principalele modele ale seriei ==\n\n{| class=\"wikitable\"\n! Model !! Tip !! Parametri (totali / activi) !! Context, tokenuri !! Multimodalitate !! Data lansării\n|-\n| Kimi k1.5 || LLM, RL-scaling || nedivulgat || 128 000 || Da (limitată) || Ianuarie 2025\n|-\n| Kimi-VL || VLM, MoE || compact / ~2,8 miliarde active + 400 milioane ViT || context lung || Da (imagini) || Aprilie 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 trilioane / 32 miliarde || 256 000 || Nu (text) || Iulie 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 trilioane / 32 miliarde || 256 000 || Nu (text) || Noiembrie 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 trilioane / 32 miliarde || 256 000 || Da (imagini, video, PDF) || Ianuarie 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 este un LLM Mixture-of-Experts cu 1,04 trilioane de parametri totali și 32 de miliarde de parametri activați per token. A fost pre-antrenat pe 15,5 trilioane de tokenuri cu optimizatorul MuonClip. Arhitectura include 384 de experți și un mecanism MLA compatibil cu contextul lung. Modelul este orientat spre sarcini de programare, raționament matematic și scenarii agentice cu apeluri succesive de instrumente.[1]\n\nRaportul tehnic descrie un pipeline de post-antrenare în mai multe etape: sinteză la scară largă a datelor agentice prin simularea interacțiunilor cu instrumentele; antrenare prin reinforcement learning într-un mediu mixt de sarcini reale și sintetice; utilizarea evaluatorilor LLM pentru evaluarea automată a calității.[1][14]\n\n=== Kimi K2 Thinking ===\n\nVarianta Kimi K2 Thinking este optimizată pentru raționament în mai mulți pași (chain-of-thought) cu posibilitatea apelării dinamice a instrumentelor și suport de context până la 256 000 de tokenuri. Modelul implementează un mod separat „Thinking" cu un câmp reasoning_content returnat explicit, conținând raționamentele interne. K2 Thinking suportă 200–300 de apeluri succesive de instrumente într-un singur episod agentic fără degradare semnificativă a comportamentului, precum și cuantizare nativă INT4 cu utilizarea QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL este un VLM (vision-language model) MoE multimodal deschis, orientat spre sarcini de înțelegere vizuală, raționament vizual-textual și scene din lumea reală. Modelul este descris ca o arhitectură MoE compactă cu encoderul vizual MoonViT. Raportul tehnic a fost publicat pe arXiv în aprilie 2025.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 este un model MoE multimodal la scara de 1,04 trilioane de parametri cu 32 de miliarde activați, bazat pe punctul de control Kimi-K2-Base cu pre-antrenament continuat pe ~15 trilioane de tokenuri vizual-textuale mixte. Modelul suportă intrări de imagini, video, PDF și text cu un context de până la 256 000 de tokenuri.[2]\n\nK2.5 suportă două moduri principale de inferență:\n* Modul Thinking — cu reasoning_content explicit și generare în mai mulți pași;\n* Modul Instant — fără afișarea raționamentelor, cu latență mai mică.[2][13]\n\nModelul implementează cuantizare nativă INT4 a ponderilor (weight-only, grup 32), optimizată pentru arhitectura NVIDIA Hopper.[2]\n\n== Rezultate cheie și benchmark-uri ==\n\n=== Benchmark-uri textuale și agentice Kimi K2 ===\n\nRezultatele sunt prezentate pentru Kimi-K2-Instruct în modul non-thinking (fără chain-of-thought extins) conform datelor raportului tehnic.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Sursă\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nConform declarației autorilor, aceste rezultate poziționează K2 printre liderii modelelor deschise în modul fără thinking-desfășurare, în special la sarcini inginerești și agentice (conform situației la momentul publicării raportului).[1]\n\n=== Benchmark-uri Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Sursă\n|-\n| MMVet (acuratețe) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nRezultatele demonstrează că arhitectura MoE multimodală compactă atinge un nivel comparabil cu modele mai mari la un număr mai mic de parametri activi.[9]\n\n=== Benchmark-uri Kimi K2.5 ===\n\nRezultatele sunt prezentate în modul Thinking (temperature = 1,0; top-p = 0,95; context 256 000 de tokenuri; motor vLLM; platformă hardware NVIDIA H200) conform datelor fișei modelului pe platforma NVIDIA NIM și raportului tehnic.[2][13]\n\n{| class=\"wikitable\"\n! Categorie !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (fără instrumente) || 30,1\n|-\n| HLE-Full (cu instrumente) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nSuplimentar, K2.5 demonstrează un transfer pozitiv al antrenamentului vizual asupra sarcinilor textuale: +1,7% pe MMLU-Pro și +2,1% pe GPQA-Diamond față de modelul de bază textual K2.[2]\n\nEvaluarea comparativă finală depinde de alegerea metricilor și scenariilor; rezultatele sunt prezentate conform datelor autorilor. Validarea independentă a unor benchmark-uri este limitată la momentul publicării.[2][15]\n\n== Aplicații ==\n\n=== Asistent textual și căutare ===\n\nPlatforma Kimi este utilizată ca asistent cu suport pentru procesarea documentelor lungi (rapoarte de cercetare, date financiare), analiză automatizată și căutare online cu agregarea informațiilor. Moonshot AI indică faptul că Kimi suportă peste 300 de apeluri de instrumente (tool calls) în cadrul unui singur scenariu agentic.[7][4]\n\n=== Programare și sarcini inginerești ===\n\nKimi K2 și K2.5 demonstrează rezultate ridicate pe SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench și alte benchmark-uri de programare. Modelele sunt utilizate pentru automatizarea corectării erorilor în repository-uri, generarea și refactorizarea codului, rezolvarea sarcinilor de judecată online (OJBench, LiveCodeBench). Raportul tehnic K2 indică faptul că modelul a fost antrenat pe un corpus agentic sintetic la scară largă, inclusiv interacțiuni cu sisteme de gestionare a versiunilor, manageri de pachete și medii de execuție.[1][2][14]\n\n=== Aplicații multimodale ===\n\nKimi-VL și K2.5 sunt destinate întrebărilor și răspunsurilor vizuale (VQA) pe imagini și documente; înțelegerii documentelor (OCRBench, OmniDocBench); analizei video (VideoMMMU, LongVideoBench); sarcinilor combinate de programare după specificații vizuale (de exemplu, generarea unei interfețe după un machet de imagine). Pentru K2.5 sunt descrise scenarii de „vision-grounded coding" și „autonomous visual debugging", în care modelul generează cod după o descriere vizuală și analizează iterativ rezultatul vizual.[2][9][15]\n\n=== API și implementare ===\n\nModelele sunt disponibile prin API-ul platformei Moonshot AI Open Platform cu suport pentru tool calling, modul thinking, modul JSON și caching-ul contextului. Ponderile deschise sunt utilizate pentru implementare locală prin vLLM, SGLang și TensorRT-LLM. Serviciul Mooncake asigură scalarea inferenței pentru contextul lung.[4][11][16]\n\n== Limitări și probleme deschise ==\n\n=== Cerințe de resurse ===\n\nModelele MoE la scara de 1 trilion de parametri, chiar și cu 32 de miliarde de parametri activați și cuantizare INT4, necesită resurse semnificative de memorie și lățime de bandă. În discuțiile inginerești privind implementarea Kimi K2.5 sunt menționate estimări de ordinul sutelor de gigabytes de memorie video pentru încărcarea completă a modelului; cifrele concrete depind de schema de cuantizare și framework (vLLM, SGLang etc.).[2][17]\n\n=== Halucinații și calitatea generării ===\n\nCa și alte LLM, modelele seriei Kimi sunt susceptibile la halucinații. În rapoartele privind testele FACTS Grounding și FaithJudge au fost înregistrate rate de halucinare în intervalul 1,1–7,4% în scenariile RAG. În modul non-thinking, modelul poate genera tokenuri redundante la specificații ambigue ale instrumentelor; la activarea forțată a tool-use, performanța scade pe unele sarcini.[1]\n\n=== Dependența de datele sintetice și pipeline-ul RL ===\n\nPipeline-ul de sinteză a datelor agentice și de antrenare prin reinforcement learning se bazează pe o colecție mare de instrumente și scenarii sintetice, precum și pe evaluatori LLM pentru evaluarea automată (self-judging). O astfel de schemă generează întrebări deschise: stabilitatea la tendința (bias) de autoevaluare; degradarea potențială la iterații multiple (bootstrap); transferabilitatea abilităților agentice în medii reale, diferite de cele simulate; influența distribuției sarcinilor sintetice asupra capacității de generalizare.[1][14]\n\n=== Transparență și reproductibilitate ===\n\nO parte din informațiile privind compoziția datelor de antrenare, procesul de filtrare, distribuția limbilor și domeniilor nu este divulgată sau este divulgată parțial. Aceasta îngreunează evaluarea precisă a surselor de distorsiune, reproductibilitatea antrenării și validarea independentă a influenței componentelor individuale (MuonClip, QK-clip) asupra stabilității. Conform situației din februarie 2026, reproducerea completă a antrenamentului Kimi K2 și K2.5 de către terți nu a fost înregistrată în literatura deschisă.[1][2]\n\n== Aspecte etice și de reglementare ==\n\nFișele de model și rapoartele tehnice subliniază că dezvoltatorii poartă responsabilitatea pentru intrările și ieșirile modelului; este necesară adăugarea mecanismelor de protecție (guardrails) și testarea pe datele cazului specific înainte de implementare; modelul poate procesa imagini și videoclipuri care conțin potențial date cu caracter personal, iar integratorul este obligat să respecte legislația relevantă.[2][16]\n\nRapoartele tehnice descriu evaluări de securitate (riscuri biologice, chimice, cibernetice) cu utilizarea unor instrumente de tip Promptfoo. Modelele sunt supuse alinierii prin RL (alignment) cu recompense verificabile și autoevaluare.[1]\n\nCa produs al unei companii chineze, modelele se supun reglementărilor naționale ale Chinei în domeniul inteligenței artificiale. La momentul redactării nu au fost identificate documente de reglementare publice separate dedicate exclusiv modelelor Kimi; reglementarea se realizează în cadrul abordărilor generale privind modelele generative și inteligența artificială în jurisdicțiile relevante.[18]\n\nÎn februarie 2026, compania Anthropic a declarat că Moonshot AI (împreună cu alți dezvoltatori chinezi) a utilizat conturi false pentru a genera interacțiuni cu Claude în scopul distilării datelor pentru antrenarea modelelor. Informația are caracterul unei afirmații a unei singure părți și nu a fost confirmată de investigații independente la momentul publicării; Moonshot AI nu a publicat un răspuns oficial.[5]\n\n== Perspective și direcții de cercetare ==\n\nDin materialele publicate pot fi identificate mai multe direcții de cercetare ulterioară:\n\n* Sisteme agentice scalabile. Dezvoltarea abordărilor de antrenare a LLM ca sisteme agentice cu utilizarea unui set de instrumente sintetice, RL și self-judging. Extinderea Agent Swarm la un număr mai mare de sub-agenți și noi tipuri de sarcini.[2][1]\n* Arhitecturi MoE eficiente. Utilizarea a 1 trilion de parametri cu 32 de miliarde activați și 384 de experți reprezintă una dintre variantele de compromis între scară și eficiență; sunt cercetate alternative cu diverse scheme de rutare.[1]\n* Multimodalitate nativă. Antrenarea K2.5 pe date vizual-textuale mixte de la începutul pre-antrenării reprezintă o abordare a multimodalității „native", care este comparată cu schemele în două etape.[2][9]\n* Inferență eficientă și context lung. Cuantizarea INT4 și suportul unui context de 256 000 de tokenuri stimulează cercetări ulterioare în domeniul atenției sparse, reprezentărilor latente și memoriei externe. Separat este descris proiectul Kimi Linear — atenție liniară hibridă cu reducerea KV-cache cu 75% și accelerarea decodificării de 6 ori la un context de 1 milion de tokenuri.[2][19]\n\nÎn materialele oficiale ale Moonshot AI nu sunt publicate foi de parcurs detaliate privind versiunile viitoare ale Kimi; direcțiile enumerate se bazează pe cercetările publicate.\n\n== Vezi și ==\n* Arhitectura Transformer\n* DeepSeek\n* Qwen\n\n== Referințe ==\n* https://www.moonshot.ai/ — site-ul oficial Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — repository-ul GitHub Kimi K2.5\n* https://huggingface.co/moonshotai — profilul Moonshot AI pe Hugging Face\n\n== Bibliografie ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Note ==\n\n\n\nTemplate:SEOMeta\n
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692