Kimi (Moonshot AI) (HU)
Kimi (a Moonshot AI modellsorozat) — nagyméretű nyelvi modellek (Large Language Model, LLM) sorozata, amelyet a kínai Moonshot AI vállalat (Peking, KNR) fejleszt szöveges és multimodális generálási, programozási, valamint agentrendszeri (agentic systems — autonóm tervezésre, következtetésre és külső eszközök használatával végzett cselekvésre képes rendszerek) feladatokhoz. A modellcsalád szöveges és multimodális, Mixture-of-Experts (MoE, szakértők keveréke) architektúrájú modelleket tartalmaz, amelyek nagyságrendileg 1 billió paramétert ölelnek fel, tokenenkénti aktivált részhalmazuk nagyságrendileg 32 milliárd paraméter.[1][2] A sorozat fontos jellemzője az agentikus viselkedésre való orientáció (többlépéses tervezés külső eszközök hívásával) és a Kimi K2, valamint Kimi K2.5 verzióiban legfeljebb 256 000 tokenes hosszú kontextus támogatása.[1][2]\n\nA Kimi sorozat modelljeit nyílt súlyokkal (open-weight) is terjesztik a Hugging Face platformon módosított MIT-licenc alatt, valamint a Moonshot AI Open Platform saját API-ján keresztül.[3][4]\n\n== Történet és előzmények ==\n\n=== A Moonshot AI megalapítása ===\n\nA Moonshot AI-t 2023 márciusában alapította Pekingben Yang Zhilin (Yang Zhilin, CEO), Zhou Xinyu (Zhou Xinyu) és Wu Yuxin (Wu Yuxin) — a Tsinghua University (Tsingsua Egyetem) végzettjei. Yang Zhilin korábban a Google Brain-nél és a Meta-nál dolgozott, részt vett számítógépes látás és következtetés terén folytatott kutatásokban. A vállalat finanszírozást kapott az Alibabától (1 milliárd dolláros finanszírozási kör, 2024 februárjában), a Tencenttől és más befektetőktől.[5][6]\n\n=== A főbb kiadások időrendje ===\n\n* 2023 október–november — a Kimi chatbot elindítása, legfeljebb 128 ezer tokenes kontextustámogatással (legfeljebb 200 ezer kínai írásjeggyel). A korai verziók saját fejlesztésű modelleket használtak, korlátozott mértékben nyilvánosságra hozott technikai részletekkel.[6][7]\n* 2024 március — a kontextus kiterjesztése legfeljebb 2 millió írásjegyre a bétaverzióban.[6]\n* 2025 január — megjelent a Kimi k1.5 — multimodális modell skálázott megerősítéses tanulással (Reinforcement Learning, RL), amelynek teljesítménye a fejlesztők szerint összemérhető az OpenAI o1-jével matematikai, programozási és multimodális következtetési feladatokban. Kontextus legfeljebb 128 ezer token.[8]\n* 2025 április — bemutatták a Kimi-VL-t — nyílt multimodális MoE-modell (vision-language model, VLM) MoonViT vizuális enkóderrel (~400 millió paraméter) és ~2,8 milliárd aktív paraméterrel a dekóderben. A technikai jelentést közzétették az arXiv-on.[9]\n* 2025 július — megjelent a Kimi K2 — az alap nyílt MoE-modell 1 billió paramétert és 32 milliárd aktív paramétert. A technikai jelentést közzétették az arXiv-on.[1] A modell a kiadás idején az első helyen állt a nyílt modellek között az LMSYS Chatbot Arénán (több mint 3000 szavazat alapján).[1]\n* 2025 szeptember — Kimi-K2-Instruct-0905 frissítés, kiterjesztett, legfeljebb 256 ezer tokenes kontextussal és fejlettebb agentikus kódolással.[1]\n* 2025 november — megjelent a Kimi K2 Thinking — a fejlettebb lépésről lépésre haladó következtetéssel (chain-of-thought) és 200–300 egymást követő eszközhívás (tool calls) támogatásával rendelkező verzió.[10]\n* 2026 január — bemutatták a Kimi K2.5-öt — multimodális MoE-modell natív multimodalitással és Agent Swarm mechanizmussal (részügynökök párhuzamos vezénylése).[2]\n\nA modellfejlesztéssel párhuzamosan 2024-ben bemutatták a saját fejlesztésű Mooncake inferencia-szolgáltatást — egy KVCache-központú diszaggregált architektúrát, amely hosszú kontextusú LLM-ek kiszolgálására szolgál.[11]\n\n== Elméleti alapok és architektúra ==\n\n=== A Mixture-of-Experts architektúra ===\n\nA Kimi K2 és K2.5 sorozat modelljei Mixture-of-Experts architektúrájú Transformert valósítanak meg egyes rétegekben. A transzformer standard blokkja többfejű önfigyelmi rétegek (Multi-Head Attention, MHA) és pozíciófüggő MLP (többrétegű perceptron) reziduális kapcsolatokkal alkotott kompozíciója:[1][12]\n\n\n\nitt — a bemeneti tokenreprezentációk, — a szekvencia hossza, — a rejtett állapot mérete.\n\nAz MoE-rétegben egyetlen MLP helyett szakértők halmaza szerepel, amelyek mindegyike önálló MLP paraméterekkel. Az útválasztó (gating network) minden tokenhez kiválaszt egy szakértő-részhalmazt. Az MoE-réteg kimenete a reprezentációjú tokenhez a következőképpen adható meg:[1]\n\n\n\nitt — az adott tokenhez kiválasztott szakértők halmaza, — az útválasztó normalizált súlyai, . Az útválasztási függvény TopK-művelettel választja ki a szakértőket:[1]\n\n\n\nitt — az útválasztó tanítható mátrixa. Ez a séma lehetővé teszi a paraméterek összesített számának skálázását, miközben a tokenenkénti aktivált paraméterek száma korlátozott marad.\n\n=== A Kimi K2 / K2.5 architektúrális hiperparaméterei ===\n\n{| class=\"wikitable\"\n! Paraméter !! Érték\n|-\n| Architektúra típusa || Transformer Mixture-of-Experts megközelítéssel\n|-\n| Paraméterek teljes száma || 1,04 billió\n|-\n| Tokenenkénti aktivált paraméterek || 32 milliárd\n|-\n| Rétegek száma || 61 (1 sűrű + 60 MoE)\n|-\n| Rejtett állapot mérete || 7168\n|-\n| Figyelmi fejek száma || 64\n|-\n| Szakértők száma || 384 (tokenenkénti 8 kiválasztott + 1 közös)\n|-\n| Szakértő rejtett állapotának mérete (MoE hidden size) || 2048\n|-\n| Szótár mérete || 160 000 token\n|-\n| Aktivációs függvény || SwiGLU\n|-\n| Figyelmi mechanizmus || Multi-head Latent Attention (MLA)\n|-\n| Maximális kontextus || 256 000 token (kiterjesztés YaRN-nel)\n|-\n| Vizuális enkóder (K2.5) || MoonViT-3D, ~400 millió paraméter\n|}\n[1][2][13]\n\nA ritkasági arány (a szakértők összesített és aktivált száma) 48:1 (384 szakértő, 8 aktív), ami jelentős számítási megtakarítást biztosít az azonos méretű sűrű (dense) modellhez képest.[1]\n\n=== A Multi-head Latent Attention (MLA) mechanizmusa ===\n\nA Kimi K2/K2.5 sorozat modelljei Multi-head Latent Attention (MLA) mechanizmust alkalmaznak — a standard többfejű figyelem olyan módosítását, amely a hatékonyság és a skálázhatóság növelésére irányul. Az egyetlen rétegre vonatkozó standard figyelem kiszámítása:[12]\n\n\n\nitt — a lekérdezések, kulcsok és értékek mátrixai. Az MLA-ban látens reprezentációkat vezet be, amelyekre a lekérdezések és kulcsok vetülnek, csökkentve a közbülső műveletek dimenzióit és lehetővé téve a KV-gyorsítótár méretének csökkentését. A megközelítés hasonló a DeepSeek-V3-ban alkalmazott mechanizmushoz.[1][13]\n\n=== A MuonClip optimalizáló és a QK-clip ===\n\nA Kimi K2 modell tanításához a MuonClip optimalizálót javasolták — a Muon optimalizáló (Newton-Schulz-normalizálással rendelkező impulzusos optimalizáló) módosítását, amelyhez QK-clip technikát adtak hozzá a nagy MoE-architektúrájú nagyméretű nyelvi modellek tanításának stabilizálása érdekében.[1]\n\nA QK-clip korlátozásokat alkalmaz a figyelmi logitokra csonkítási (clipping) művelet révén. Minden figyelmi fejre meghatározható a maximális logit:\n\n\n\nés kiszámítható a skálázási együttható:\n\n\n\nitt — a küszöb hiperparaméter, — a figyelmi fej mérete. A együtthatót a súlyok skálázásához alkalmazzák, ha a maximális logit meghaladja a küszöböt. Ez korlátozza a logitértékek tartományát a softmax előtt, és csökkenti a nagy méretarányú tanítás során fellépő éles veszteségugrások (loss spikes) kockázatát.[1]\n\nA szerzők adatai szerint a Kimi K2 15,5 billió tokenre való előtanítása MuonClip-pel egyetlen rögzített veszteségugrás nélkül zajlott le (zero loss spikes).[1]\n\n=== Multimodalitás és MoonViT ===\n\nA Kimi K2.5 és Kimi-VL modellek MoonViT vizuális enkódert (a K2.5 verzióban MoonViT-3D) alkalmaznak, körülbelül 400 millió paraméterrel, amely SigLIP-SO-400M alapon épül NaViT-packing (változó felbontású bemeneti képek támogatása) és 3D-kiterjesztéssel a videófeldolgozáshoz (4 képkockánként csoportosítás).[2][9]\n\nA vizuális enkóder a bemeneti képeket és videókat vizuális tokenek sorozatává alakítja. Legyen a bemeneti kép, a vizuális enkóder:\n\n\n\nmajd lineáris vetítésen (kétrétegű MLP) keresztül:\n\n\n\nitt — a modell nyelvi részének rejtett terének mérete. Multimodális módban összekapcsolódik a szöveges tokenekkel, és a transzformerbe kerül.[9][2]\n\nAz kéttételes sémákkal (vizuális adapter hozzáadása a szöveges modell tetejére) ellentétben a K2.5-öt az előtanítás elejétől vegyes vizuális-szöveges adatokon tanították (joint text-vision pre-training), a vizuális tokenek alacsony arányával (~10%) a korai szakaszban, majd fokozatos növeléssel. A teljes mennyiség körülbelül 15 billió vegyes vizuális-szöveges token.[2]\n\n== Előtanítás és utótanítás ==\n\n=== Előtanítás ===\n\nA Kimi K2 modellt 15,5 billió tokenen tanították elő (webes szövegek, kód, matematika, enciklopédikus ismeretek) MuonClip optimalizálóval. Az előtanítás teljes időtartama alatt egyetlen veszteségugrást (loss spike) sem rögzítettek.[1]\n\nA Kimi K2.5 modell folyamatos előtanításon (continual pre-training) esett át a K2 ellenőrzőpontjától kezdve további ~15 billió vegyes vizuális-szöveges tokenre, a modalitások együttes optimalizálásával (joint pre-training). Külön elvégeztek 1 billió tokenes önálló vizuális enkódertanítást és egy további long-context mid-training szakaszt a kontextus kiterjesztéséhez.[2]\n\n=== Utótanítás ===\n\nA K2 sorozat modelljeinek utótanítása több szakaszból áll:[1][2]\n\nSupervised Fine-Tuning (SFT, felügyelt finomhangolás):\n* Szintetikus agentikus trajektóriák (agentic data synthesis) — eszközspecifikációk generálása, környezettel való interakciók szimulálása, eredmények ellenőrzése.\n* A K2.5 esetén további zero-vision SFT is alkalmazásra kerül — szöveges SFT, amely képek közvetlen felhasználása nélkül aktiválja a vizuális képességeket a fine-tuning szakaszban.\n\nReinforcement Learning (RL, megerősítéses tanulás):\n* Ellenőrizhető jutalmakkal végzett megerősítéses tanulás (Reinforcement Learning with Verifiable Rewards, RLVR) kombinációja matematikai, kód- és biztonsági feladatokhoz.\n* Rubrikák alapján végzett önértékelés (self-critique rubric rewards) — LLM-értékelők alkalmazása agentikus forgatókönyvek minőségének automatikus értékelésére.\n* A K2.5 esetén — közös multimodális RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* A Kimi K2 Thinking és K2.5 natív INT4 súlykvantálást (weight-only quantization, 32-es csoport, tömörített tenzorok) támogat, amelyet NVIDIA Hopper architektúrára optimalizáltak, ezzel csökkentve a következtetés memóriaigényét.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nA K2.5 modellhez kifejlesztettek egy Agent Swarm mechanizmust — önirányított párhuzamos ügynökvezénylési keretrendszert. A vezénylőmodell dinamikusan hoz létre részügynököket (create_subagent, assign_task műveletek révén), elosztja a részfeladatokat és összegyűjti az eredményeket. Minden részügynök önállóan hívhat eszközöket és párhuzamosan dolgozhat a többi részügynökkel.[2]\n\nAz Agent Swarm mechanizmus tanítása Parallel-Agent Reinforcement Learning (PARL) révén valósul meg, végrehajtás és optimalizálás szétválasztásával (decoupling execution/optimization). A szerzők adatai szerint az Agent Swarm akár 4,5-szeres késleltetéscsökkentést (latency) biztosít az egyszálú agentikus módhoz (single-agent) képest.[2]\n\n== A sorozat főbb modelljei ==\n\n{| class=\"wikitable\"\n! Modell !! Típus !! Paraméterek (összesen / aktív) !! Kontextus, token !! Multimodalitás !! Kiadás dátuma\n|-\n| Kimi k1.5 || LLM, RL-scaling || nem nyilvánosan közzétett || 128 000 || Igen (korlátozott) || 2025 január\n|-\n| Kimi-VL || VLM, MoE || kompakt / ~2,8 milliárd aktív + 400 millió ViT || hosszú kontextus || Igen (képek) || 2025 április\n|-\n| Kimi K2 || LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Nem (szöveg) || 2025 július\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Nem (szöveg) || 2025 november\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Igen (képek, videó, PDF) || 2026 január\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nA Kimi K2 egy Mixture-of-Experts LLM 1,04 billió teljes paraméterrel és 32 milliárd tokenenkénti aktivált paraméterrel. 15,5 billió tokenen tanították elő MuonClip optimalizálóval. Az architektúra 384 szakértőt és hosszú kontextussal kompatibilis MLA mechanizmust tartalmaz. A modell programozási, matematikai következtetési és agentikus forgatókönyvekre, szekvenciális eszközhívásokkal, összpontosít.[1]\n\nA technikai jelentés többlépéses utótanítási pipeline-t ír le: agentikus adatok nagyméretű szintézise eszközökkel való interakciók szimulálásával; megerősítéses tanulás valós és szintetikus feladatok vegyes környezetében; LLM-értékelők alkalmazása a minőség automatikus értékelésére.[1][14]\n\n=== Kimi K2 Thinking ===\n\nA Kimi K2 Thinking változat többlépéses következtetésre (chain-of-thought) van optimalizálva, dinamikus eszközhívás lehetőségével és legfeljebb 256 000 tokenes kontextustámogatással. A modell külön „Thinking" módot valósít meg, amelynek keretében egy reasoning_content mezőt ad vissza explicit módon, amely tartalmazza a belső következtetéseket. A K2 Thinking egyetlen agentikus epizódban 200–300 egymást követő eszközhívást támogat anélkül, hogy a viselkedés lényegesen degradálódna, és QAT-tal végzett natív INT4-kvantálást is támogat.[10]\n\n=== Kimi-VL ===\n\nA Kimi-VL egy nyílt multimodális MoE-VLM (vision-language model), amely vizuális megértési, vizuális-szöveges következtetési és valós jelenetekkel kapcsolatos feladatokra összpontosít. A modell kompakt MoE-architektúraként van leírva MoonViT vizuális enkóderrel. A technikai jelentést 2025 áprilisában tették közzé az arXiv-on.[9]\n\n=== Kimi K2.5 ===\n\nA Kimi K2.5 egy multimodális MoE-modell, 1,04 billió paraméterrel és 32 milliárd aktiválttal, amely a Kimi-K2-Base ellenőrzőpontján alapul, és ~15 billió vegyes vizuális-szöveges tokenen folytatott előtanítással egészül ki. A modell képek, videók, PDF-ek és szövegek bemenetét legfeljebb 256 000 tokenes kontextussal támogatja.[2]\n\nA K2.5 két fő következtetési módot támogat:\n* Thinking mode — explicit reasoning_content kimenettel és többlépéses generálással;\n* Instant mode — következtetési kimenet nélkül, alacsonyabb késleltetéssel.[2][13]\n\nA modell natív INT4 súlykvantálást (weight-only, 32-es csoport) valósít meg, amelyet NVIDIA Hopper architektúrára optimalizáltak.[2]\n\n== Főbb eredmények és benchmarkok ==\n\n=== A Kimi K2 szöveges és agentikus benchmarkjai ===\n\nAz eredmények a Kimi-K2-Instruct non-thinking módra (kiterjesztett chain-of-thought nélkül) vonatkoznak a technikai jelentés adatai alapján.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Forrás\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nA szerzők állítása szerint ezek az eredmények a K2-t a thinking-kifejtés nélküli módban a nyílt modellek élvonalába helyezik, különösen mérnöki és agentikus feladatokon (a jelentés közzétételének időpontjában).[1]\n\n=== A Kimi-VL benchmarkjai ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Forrás\n|-\n| MMVet (pontosság) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nAz eredmények azt mutatják, hogy a kompakt multimodális MoE-architektúra kevesebb aktív paraméterrel is a nagyobb modellek szintjével összehasonlítható teljesítményt ér el.[9]\n\n=== A Kimi K2.5 benchmarkjai ===\n\nAz eredmények Thinking módban kerültek rögzítésre (temperature = 1,0; top-p = 0,95; 256 000 tokenes kontextus; vLLM motor; NVIDIA H200 hardverplatform) az NVIDIA NIM platformon közzétett modelltérkép és a technikai jelentés adatai alapján.[2][13]\n\n{| class=\"wikitable\"\n! Kategória !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Következtetés és tudás\n| HLE-Full (eszközök nélkül) || 30,1\n|-\n| HLE-Full (eszközökkel) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vizuális és videó\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Programozás\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Hosszú kontextus\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentikus keresés\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nEzen felül a K2.5 pozitív transzfert mutat a vizuális tanulásból a szöveges feladatokra: +1,7% az MMLU-Pro-n és +2,1% a GPQA-Diamond-on a K2 szöveges alapmodellhez képest.[2]\n\nA végső összehasonlító értékelés a mutatók és forgatókönyvek megválasztásától függ; az eredmények a szerzők adatain alapulnak. A benchmarkok egy részének független validálása a közzététel időpontjában korlátozott.[2][15]\n\n== Alkalmazás ==\n\n=== Szöveges asszisztens és keresés ===\n\nA Kimi platform asszisztensként szolgál hosszú dokumentumok (kutatási jelentések, pénzügyi adatok) feldolgozásának, automatizált elemzésnek és online keresésnek, információ-aggregálással. A Moonshot AI jelzi, hogy a Kimi legfeljebb 300 eszközhívást (tool calls) támogat egyetlen agentikus forgatókönyvön belül.[7][4]\n\n=== Programozás és mérnöki feladatok ===\n\nA Kimi K2 és K2.5 magas eredményeket mutat az SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench és más programozási benchmarkokon. A modelleket repozitóriumokban lévő hibák automatikus javítására, kódgenerálásra és refaktorálásra, illetve online bíráló feladatok megoldására (OJBench, LiveCodeBench) alkalmazzák. A K2 technikai jelentése megjegyzi, hogy a modellt nagy méretarányú szintetikus agentikus korpuszon tanították, beleértve verziókezelő rendszerekkel, csomagkezelőkkel és végrehajtási környezetekkel való interakciókat.[1][2][14]\n\n=== Multimodális alkalmazások ===\n\nA Kimi-VL és K2.5 vizuális kérdés-válasz (VQA) feladatokra készült képeken és dokumentumokon; dokumentummegértésre (OCRBench, OmniDocBench); videóelemzésre (VideoMMMU, LongVideoBench); valamint vizuális specifikációkon alapuló programozási kombinált feladatokra (például felhasználói felület generálása képtervből). A K2.5-höz leírtak szerint „vision-grounded coding" és „autonomous visual debugging" forgatókönyvek is léteznek, ahol a modell vizuális leírás alapján generál kódot és iteratívan elemzi a vizuális eredményt.[2][9][15]\n\n=== API és telepítés ===\n\nA modellek elérhetők a Moonshot AI Open Platform API-ján keresztül, tool calling, thinking mód, JSON mód és kontextus-gyorsítótárazás támogatásával. A nyílt súlyokat helyi telepítéshez vLLM, SGLang és TensorRT-LLM keretrendszereken keresztül használják. A Mooncake szolgáltatás skálázható inferenciát biztosít hosszú kontextus esetén.[4][11][16]\n\n== Korlátok és nyitott problémák ==\n\n=== Erőforrásigény ===\n\nAz 1 billió paraméteres MoE-modellek, még 32 milliárd aktivált paraméterrel és INT4-kvantálással is, jelentős memória- és sávszélességi erőforrásokat igényelnek. A Kimi K2.5 telepítésének mérnöki megvitatásaiban a modell teljes betöltéséhez szükséges grafikus memória becslése száz gigabájtos nagyságrendben szerepel; a konkrét számok a kvantálási módtól és a keretrendszertől (vLLM, SGLang stb.) függenek.[2][17]\n\n=== Hallucinációk és a generálás minősége ===\n\nMint minden más LLM, a Kimi sorozat modelljei is hajlamosak hallucinációkra. A FACTS Grounding és FaithJudge tesztek jelentéseiben a hallucination rate mutatói 1,1–7,4% között vannak rögzítve RAG-forgatókönyvekben. Non-thinking módban a modell felesleges tokeneket generálhat homályos eszközspecifikációk esetén; az eszközhasználat kényszeres bekapcsolásakor a teljesítmény egyes feladatokon csökken.[1]\n\n=== Szintetikus adatoktól és RL-pipeline-tól való függőség ===\n\nAz agentikus adatszintézis és megerősítéses tanulás pipeline-ja nagyszámú szintetikus eszközre és jelenetre, valamint LLM-értékelőkre támaszkodik az automatikus értékeléshez (self-judging). Ez a séma nyitott kérdéseket vet fel: az önértékelés elfogultságával (bias) szembeni ellenálló képesség; a többszöri iteráció során potenciálisan fellépő degradáció (bootstrap); az agentikus készségek átvihetősége valós, a szimulálttól eltérő környezetekre; a szintetikus feladatok eloszlásának hatása az általánosítási képességre.[1][14]\n\n=== Átláthatóság és reprodukálhatóság ===\n\nA tanítási adatok összetételéről, a szűrési folyamatról, a nyelvek és tartományok eloszlásáról szóló információk egy része nem kerül nyilvánosságra, vagy csak korlátozott mértékben. Ez megnehezíti az elfogultsági forrásokra vonatkozó pontos értékelést, a tanítás reprodukálhatóságát és az egyes összetevők (MuonClip, QK-clip) stabilitásra gyakorolt hatásának független validálását. 2026 februárjáig a Kimi K2 és K2.5 tanításának harmadik felek általi teljes reprodukálása nem szerepel a nyílt irodalomban.[1][2]\n\n== Etikai és szabályozási szempontok ==\n\nA modelltérképek és technikai jelentések hangsúlyozzák, hogy a fejlesztők felelősséget viselnek a modell bemeneteiért és kimeneteiért; a bevezetés előtt szükséges védőmechanizmusok (guardrails) hozzáadása és az adott esetre vonatkozó adatokon való tesztelés; a modell képeket és videókat dolgozhat fel, amelyek személyes adatokat is tartalmazhatnak, és az integrátor köteles betartani a vonatkozó jogszabályokat.[2][16]\n\nA technikai jelentések biztonsági értékeléseket írnak le (biológiai, kémiai, kiberkockázatok) Promptfoo-hoz hasonló eszközök segítségével. A modellek RL-igazításon (alignment) esnek át ellenőrizhető jutalmakkal és önértékeléssel.[1]\n\nMint kínai vállalat termékei, a modellek a KNR nemzeti mesterséges intelligencia szabályozásának hatálya alá tartoznak. Az írás időpontjában nem találhatók külön nyilvános szabályozási dokumentumok, amelyek kizárólag a Kimi modellekre vonatkoznak; a szabályozás a generatív modellekre és a mesterséges intelligenciára vonatkozó általános megközelítések keretein belül valósul meg az érintett joghatóságokban.[18]\n\n2026 februárjában az Anthropic vállalat bejelentette, hogy a Moonshot AI (más kínai fejlesztőkkel együtt) hamis fiókokat használt a Claude-dal való interakciók generálásához a modellek tanításához szükséges adatok desztillálása céljából. Az információ egy fél állításának jellegével bír, és a közzétételkor nem erősítik meg független vizsgálatok; a Moonshot AI nem tett közzé hivatalos választ.[5]\n\n== Perspektívák és kutatási irányok ==\n\nA közzétett anyagok alapján több további kutatási irány is azonosítható:\n\n* Skálázható agentikus rendszerek. LLM-ek agentikus rendszerekként való tanítási megközelítéseinek fejlesztése szintetikus eszközkészlet, RL és self-judging alkalmazásával. Az Agent Swarm kiterjesztése nagyobb számú részügynökre és új típusú feladatokra.[2][1]\n* Hatékony MoE-architektúrák. 1 billió paraméter 32 milliárd aktiválttal és 384 szakértővel a méret és a hatékonyság közötti kompromisszum egyik változatát képviseli; különböző útválasztási sémákat alkalmazó alternatívák is vizsgálat alatt állnak.[1]\n* Natív multimodalitás. A K2.5 modellek az előtanítás elejétől vegyes vizuális-szöveges adatokon való tanítása a „natív" multimodalitás megközelítése, amelyet a kétlépéses sémákkal hasonlítanak össze.[2][9]\n* Hatékony inferencia és hosszú kontextus. Az INT4-kvantálás és a 256 000 tokenes kontextustámogatás ösztönzi a ritka figyelmi mechanizmusok, látens reprezentációk és külső memória területén folytatott további kutatásokat. Külön leírásra kerül a Kimi Linear projekt — hibrid lineáris figyelem 75%-os KV-gyorsítótár csökkentéssel és 6-szoros dekódolási gyorsítással 1 millió tokenes kontextus esetén.[2][19]\n\nA Moonshot AI hivatalos anyagaiban nem tesznek közzé részletes ütemtervet a Kimi jövőbeli verzióihoz; a felsorolt irányok a közzétett kutatásokon alapulnak.\n\n== Lásd még ==\n* Transformer architektúra\n* DeepSeek\n* Qwen\n\n== Hivatkozások ==\n* https://www.moonshot.ai/ — a Moonshot AI hivatalos weboldala\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — a Kimi K2.5 GitHub-tárolója\n* https://huggingface.co/moonshotai — a Moonshot AI profilja a Hugging Face platformon\n\n== Irodalom ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Megjegyzések ==\n\n\n\nTemplate:SEOMeta\n
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692