Kimi (Moonshot AI) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (a Moonshot AI modellsorozat) — nagyméretű nyelvi modellek (Large Language Model, LLM) sorozata, amelyet a kínai Moonshot AI vállalat (Peking, KNR) fejleszt szöveges és multimodális generálási, programozási, valamint agentrendszeri (agentic systems — autonóm tervezésre, következtetésre és külső eszközök használatával végzett cselekvésre képes rendszerek) feladatokhoz. A modellcsalád szöveges és multimodális, Mixture-of-Experts (MoE, szakértők keveréke) architektúrájú modelleket tartalmaz, amelyek nagyságrendileg 1 billió paramétert ölelnek fel, tokenenkénti aktivált részhalmazuk nagyságrendileg 32 milliárd paraméter.[1][2] A sorozat fontos jellemzője az agentikus viselkedésre való orientáció (többlépéses tervezés külső eszközök hívásával) és a Kimi K2, valamint Kimi K2.5 verzióiban legfeljebb 256 000 tokenes hosszú kontextus támogatása.[1][2]\n\nA Kimi sorozat modelljeit nyílt súlyokkal (open-weight) is terjesztik a Hugging Face platformon módosított MIT-licenc alatt, valamint a Moonshot AI Open Platform saját API-ján keresztül.[3][4]\n\n== Történet és előzmények ==\n\n=== A Moonshot AI megalapítása ===\n\nA Moonshot AI-t 2023 márciusában alapította Pekingben Yang Zhilin (Yang Zhilin, CEO), Zhou Xinyu (Zhou Xinyu) és Wu Yuxin (Wu Yuxin) — a Tsinghua University (Tsingsua Egyetem) végzettjei. Yang Zhilin korábban a Google Brain-nél és a Meta-nál dolgozott, részt vett számítógépes látás és következtetés terén folytatott kutatásokban. A vállalat finanszírozást kapott az Alibabától (1 milliárd dolláros finanszírozási kör, 2024 februárjában), a Tencenttől és más befektetőktől.[5][6]\n\n=== A főbb kiadások időrendje ===\n\n* 2023 október–november — a Kimi chatbot elindítása, legfeljebb 128 ezer tokenes kontextustámogatással (legfeljebb 200 ezer kínai írásjeggyel). A korai verziók saját fejlesztésű modelleket használtak, korlátozott mértékben nyilvánosságra hozott technikai részletekkel.[6][7]\n* 2024 március — a kontextus kiterjesztése legfeljebb 2 millió írásjegyre a bétaverzióban.[6]\n* 2025 január — megjelent a Kimi k1.5 — multimodális modell skálázott megerősítéses tanulással (Reinforcement Learning, RL), amelynek teljesítménye a fejlesztők szerint összemérhető az OpenAI o1-jével matematikai, programozási és multimodális következtetési feladatokban. Kontextus legfeljebb 128 ezer token.[8]\n* 2025 április — bemutatták a Kimi-VL-t — nyílt multimodális MoE-modell (vision-language model, VLM) MoonViT vizuális enkóderrel (~400 millió paraméter) és ~2,8 milliárd aktív paraméterrel a dekóderben. A technikai jelentést közzétették az arXiv-on.[9]\n* 2025 július — megjelent a Kimi K2 — az alap nyílt MoE-modell 1 billió paramétert és 32 milliárd aktív paramétert. A technikai jelentést közzétették az arXiv-on.[1] A modell a kiadás idején az első helyen állt a nyílt modellek között az LMSYS Chatbot Arénán (több mint 3000 szavazat alapján).[1]\n* 2025 szeptemberKimi-K2-Instruct-0905 frissítés, kiterjesztett, legfeljebb 256 ezer tokenes kontextussal és fejlettebb agentikus kódolással.[1]\n* 2025 november — megjelent a Kimi K2 Thinking — a fejlettebb lépésről lépésre haladó következtetéssel (chain-of-thought) és 200–300 egymást követő eszközhívás (tool calls) támogatásával rendelkező verzió.[10]\n* 2026 január — bemutatták a Kimi K2.5-öt — multimodális MoE-modell natív multimodalitással és Agent Swarm mechanizmussal (részügynökök párhuzamos vezénylése).[2]\n\nA modellfejlesztéssel párhuzamosan 2024-ben bemutatták a saját fejlesztésű Mooncake inferencia-szolgáltatást — egy KVCache-központú diszaggregált architektúrát, amely hosszú kontextusú LLM-ek kiszolgálására szolgál.[11]\n\n== Elméleti alapok és architektúra ==\n\n=== A Mixture-of-Experts architektúra ===\n\nA Kimi K2 és K2.5 sorozat modelljei Mixture-of-Experts architektúrájú Transformert valósítanak meg egyes rétegekben. A transzformer standard blokkja többfejű önfigyelmi rétegek (Multi-Head Attention, MHA) és pozíciófüggő MLP (többrétegű perceptron) reziduális kapcsolatokkal alkotott kompozíciója:[1][12]\n\n𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,\n\nitt 𝐇L×d — a bemeneti tokenreprezentációk, L — a szekvencia hossza, d — a rejtett állapot mérete.\n\nAz MoE-rétegben egyetlen MLP helyett szakértők {Ei}i=1N halmaza szerepel, amelyek mindegyike önálló MLP θi paraméterekkel. Az útválasztó (gating network) minden tokenhez kiválaszt egy szakértő-részhalmazt. Az MoE-réteg kimenete a 𝐡 reprezentációjú tokenhez a következőképpen adható meg:[1]\n\nMoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),\n\nitt 𝒮(𝐡){1,,N} — az adott tokenhez kiválasztott szakértők halmaza, gi(𝐡) — az útválasztó normalizált súlyai, i𝒮gi=1. Az útválasztási függvény TopK-művelettel választja ki a szakértőket:[1]\n\ng(𝐡)=TopK(Softmax(𝐡Wg)),\n\nitt Wg — az útválasztó tanítható mátrixa. Ez a séma lehetővé teszi a paraméterek összesített számának skálázását, miközben a tokenenkénti aktivált paraméterek száma korlátozott marad.\n\n=== A Kimi K2 / K2.5 architektúrális hiperparaméterei ===\n\n{| class=\"wikitable\"\n! Paraméter !! Érték\n|-\n| Architektúra típusa || Transformer Mixture-of-Experts megközelítéssel\n|-\n| Paraméterek teljes száma || 1,04 billió\n|-\n| Tokenenkénti aktivált paraméterek || 32 milliárd\n|-\n| Rétegek száma || 61 (1 sűrű + 60 MoE)\n|-\n| Rejtett állapot mérete || 7168\n|-\n| Figyelmi fejek száma || 64\n|-\n| Szakértők száma || 384 (tokenenkénti 8 kiválasztott + 1 közös)\n|-\n| Szakértő rejtett állapotának mérete (MoE hidden size) || 2048\n|-\n| Szótár mérete || 160 000 token\n|-\n| Aktivációs függvény || SwiGLU\n|-\n| Figyelmi mechanizmus || Multi-head Latent Attention (MLA)\n|-\n| Maximális kontextus || 256 000 token (kiterjesztés YaRN-nel)\n|-\n| Vizuális enkóder (K2.5) || MoonViT-3D, ~400 millió paraméter\n|}\n[1][2][13]\n\nA ritkasági arány (a szakértők összesített és aktivált száma) 48:1 (384 szakértő, 8 aktív), ami jelentős számítási megtakarítást biztosít az azonos méretű sűrű (dense) modellhez képest.[1]\n\n=== A Multi-head Latent Attention (MLA) mechanizmusa ===\n\nA Kimi K2/K2.5 sorozat modelljei Multi-head Latent Attention (MLA) mechanizmust alkalmaznak — a standard többfejű figyelem olyan módosítását, amely a hatékonyság és a skálázhatóság növelésére irányul. Az egyetlen rétegre vonatkozó standard figyelem kiszámítása:[12]\n\nAttention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,\n\nitt 𝐐,𝐊,𝐕L×dk — a lekérdezések, kulcsok és értékek mátrixai. Az MLA-ban látens reprezentációkat vezet be, amelyekre a lekérdezések és kulcsok vetülnek, csökkentve a közbülső műveletek dimenzióit és lehetővé téve a KV-gyorsítótár méretének csökkentését. A megközelítés hasonló a DeepSeek-V3-ban alkalmazott mechanizmushoz.[1][13]\n\n=== A MuonClip optimalizáló és a QK-clip ===\n\nA Kimi K2 modell tanításához a MuonClip optimalizálót javasolták — a Muon optimalizáló (Newton-Schulz-normalizálással rendelkező impulzusos optimalizáló) módosítását, amelyhez QK-clip technikát adtak hozzá a nagy MoE-architektúrájú nagyméretű nyelvi modellek tanításának stabilizálása érdekében.[1]\n\nA QK-clip korlátozásokat alkalmaz a 𝐐𝐊 figyelmi logitokra csonkítási (clipping) művelet révén. Minden h figyelmi fejre meghatározható a maximális logit:\n\nShmax=1dmaxi,j(Qhi(Khj)),\n\nés kiszámítható a skálázási együttható:\n\nγh=min(1,τShmax),\n\nitt τ=100 — a küszöb hiperparaméter, d — a figyelmi fej mérete. A γh együtthatót a Wq,Wk súlyok skálázásához alkalmazzák, ha a maximális logit meghaladja a küszöböt. Ez korlátozza a logitértékek tartományát a softmax előtt, és csökkenti a nagy méretarányú tanítás során fellépő éles veszteségugrások (loss spikes) kockázatát.[1]\n\nA szerzők adatai szerint a Kimi K2 15,5 billió tokenre való előtanítása MuonClip-pel egyetlen rögzített veszteségugrás nélkül zajlott le (zero loss spikes).[1]\n\n=== Multimodalitás és MoonViT ===\n\nA Kimi K2.5 és Kimi-VL modellek MoonViT vizuális enkódert (a K2.5 verzióban MoonViT-3D) alkalmaznak, körülbelül 400 millió paraméterrel, amely SigLIP-SO-400M alapon épül NaViT-packing (változó felbontású bemeneti képek támogatása) és 3D-kiterjesztéssel a videófeldolgozáshoz (4 képkockánként csoportosítás).[2][9]\n\nA vizuális enkóder a bemeneti képeket és videókat vizuális tokenek sorozatává alakítja. Legyen 𝐗H×W×3 a bemeneti kép, Φvis a vizuális enkóder:\n\n𝐙vis=Φvis(𝐗)Lv×dv,\n\nmajd lineáris vetítésen (kétrétegű MLP) 𝐏dv×d keresztül:\n\n𝐇vis=𝐙vis𝐏,\n\nitt d — a modell nyelvi részének rejtett terének mérete. Multimodális módban 𝐇vis összekapcsolódik a szöveges tokenekkel, és a transzformerbe kerül.[9][2]\n\nAz kéttételes sémákkal (vizuális adapter hozzáadása a szöveges modell tetejére) ellentétben a K2.5-öt az előtanítás elejétől vegyes vizuális-szöveges adatokon tanították (joint text-vision pre-training), a vizuális tokenek alacsony arányával (~10%) a korai szakaszban, majd fokozatos növeléssel. A teljes mennyiség körülbelül 15 billió vegyes vizuális-szöveges token.[2]\n\n== Előtanítás és utótanítás ==\n\n=== Előtanítás ===\n\nA Kimi K2 modellt 15,5 billió tokenen tanították elő (webes szövegek, kód, matematika, enciklopédikus ismeretek) MuonClip optimalizálóval. Az előtanítás teljes időtartama alatt egyetlen veszteségugrást (loss spike) sem rögzítettek.[1]\n\nA Kimi K2.5 modell folyamatos előtanításon (continual pre-training) esett át a K2 ellenőrzőpontjától kezdve további ~15 billió vegyes vizuális-szöveges tokenre, a modalitások együttes optimalizálásával (joint pre-training). Külön elvégeztek 1 billió tokenes önálló vizuális enkódertanítást és egy további long-context mid-training szakaszt a kontextus kiterjesztéséhez.[2]\n\n=== Utótanítás ===\n\nA K2 sorozat modelljeinek utótanítása több szakaszból áll:[1][2]\n\nSupervised Fine-Tuning (SFT, felügyelt finomhangolás):\n* Szintetikus agentikus trajektóriák (agentic data synthesis) — eszközspecifikációk generálása, környezettel való interakciók szimulálása, eredmények ellenőrzése.\n* A K2.5 esetén további zero-vision SFT is alkalmazásra kerül — szöveges SFT, amely képek közvetlen felhasználása nélkül aktiválja a vizuális képességeket a fine-tuning szakaszban.\n\nReinforcement Learning (RL, megerősítéses tanulás):\n* Ellenőrizhető jutalmakkal végzett megerősítéses tanulás (Reinforcement Learning with Verifiable Rewards, RLVR) kombinációja matematikai, kód- és biztonsági feladatokhoz.\n* Rubrikák alapján végzett önértékelés (self-critique rubric rewards) — LLM-értékelők alkalmazása agentikus forgatókönyvek minőségének automatikus értékelésére.\n* A K2.5 esetén — közös multimodális RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* A Kimi K2 Thinking és K2.5 natív INT4 súlykvantálást (weight-only quantization, 32-es csoport, tömörített tenzorok) támogat, amelyet NVIDIA Hopper architektúrára optimalizáltak, ezzel csökkentve a következtetés memóriaigényét.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nA K2.5 modellhez kifejlesztettek egy Agent Swarm mechanizmust — önirányított párhuzamos ügynökvezénylési keretrendszert. A vezénylőmodell dinamikusan hoz létre részügynököket (create_subagent, assign_task műveletek révén), elosztja a részfeladatokat és összegyűjti az eredményeket. Minden részügynök önállóan hívhat eszközöket és párhuzamosan dolgozhat a többi részügynökkel.[2]\n\nAz Agent Swarm mechanizmus tanítása Parallel-Agent Reinforcement Learning (PARL) révén valósul meg, végrehajtás és optimalizálás szétválasztásával (decoupling execution/optimization). A szerzők adatai szerint az Agent Swarm akár 4,5-szeres késleltetéscsökkentést (latency) biztosít az egyszálú agentikus módhoz (single-agent) képest.[2]\n\n== A sorozat főbb modelljei ==\n\n{| class=\"wikitable\"\n! Modell !! Típus !! Paraméterek (összesen / aktív) !! Kontextus, token !! Multimodalitás !! Kiadás dátuma\n|-\n| Kimi k1.5 || LLM, RL-scaling || nem nyilvánosan közzétett || 128 000 || Igen (korlátozott) || 2025 január\n|-\n| Kimi-VL || VLM, MoE || kompakt / ~2,8 milliárd aktív + 400 millió ViT || hosszú kontextus || Igen (képek) || 2025 április\n|-\n| Kimi K2 || LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Nem (szöveg) || 2025 július\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Nem (szöveg) || 2025 november\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 billió / 32 milliárd || 256 000 || Igen (képek, videó, PDF) || 2026 január\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nA Kimi K2 egy Mixture-of-Experts LLM 1,04 billió teljes paraméterrel és 32 milliárd tokenenkénti aktivált paraméterrel. 15,5 billió tokenen tanították elő MuonClip optimalizálóval. Az architektúra 384 szakértőt és hosszú kontextussal kompatibilis MLA mechanizmust tartalmaz. A modell programozási, matematikai következtetési és agentikus forgatókönyvekre, szekvenciális eszközhívásokkal, összpontosít.[1]\n\nA technikai jelentés többlépéses utótanítási pipeline-t ír le: agentikus adatok nagyméretű szintézise eszközökkel való interakciók szimulálásával; megerősítéses tanulás valós és szintetikus feladatok vegyes környezetében; LLM-értékelők alkalmazása a minőség automatikus értékelésére.[1][14]\n\n=== Kimi K2 Thinking ===\n\nA Kimi K2 Thinking változat többlépéses következtetésre (chain-of-thought) van optimalizálva, dinamikus eszközhívás lehetőségével és legfeljebb 256 000 tokenes kontextustámogatással. A modell külön „Thinking" módot valósít meg, amelynek keretében egy reasoning_content mezőt ad vissza explicit módon, amely tartalmazza a belső következtetéseket. A K2 Thinking egyetlen agentikus epizódban 200–300 egymást követő eszközhívást támogat anélkül, hogy a viselkedés lényegesen degradálódna, és QAT-tal végzett natív INT4-kvantálást is támogat.[10]\n\n=== Kimi-VL ===\n\nA Kimi-VL egy nyílt multimodális MoE-VLM (vision-language model), amely vizuális megértési, vizuális-szöveges következtetési és valós jelenetekkel kapcsolatos feladatokra összpontosít. A modell kompakt MoE-architektúraként van leírva MoonViT vizuális enkóderrel. A technikai jelentést 2025 áprilisában tették közzé az arXiv-on.[9]\n\n=== Kimi K2.5 ===\n\nA Kimi K2.5 egy multimodális MoE-modell, 1,04 billió paraméterrel és 32 milliárd aktiválttal, amely a Kimi-K2-Base ellenőrzőpontján alapul, és ~15 billió vegyes vizuális-szöveges tokenen folytatott előtanítással egészül ki. A modell képek, videók, PDF-ek és szövegek bemenetét legfeljebb 256 000 tokenes kontextussal támogatja.[2]\n\nA K2.5 két fő következtetési módot támogat:\n* Thinking mode — explicit reasoning_content kimenettel és többlépéses generálással;\n* Instant mode — következtetési kimenet nélkül, alacsonyabb késleltetéssel.[2][13]\n\nA modell natív INT4 súlykvantálást (weight-only, 32-es csoport) valósít meg, amelyet NVIDIA Hopper architektúrára optimalizáltak.[2]\n\n== Főbb eredmények és benchmarkok ==\n\n=== A Kimi K2 szöveges és agentikus benchmarkjai ===\n\nAz eredmények a Kimi-K2-Instruct non-thinking módra (kiterjesztett chain-of-thought nélkül) vonatkoznak a technikai jelentés adatai alapján.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Forrás\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nA szerzők állítása szerint ezek az eredmények a K2-t a thinking-kifejtés nélküli módban a nyílt modellek élvonalába helyezik, különösen mérnöki és agentikus feladatokon (a jelentés közzétételének időpontjában).[1]\n\n=== A Kimi-VL benchmarkjai ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Forrás\n|-\n| MMVet (pontosság) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nAz eredmények azt mutatják, hogy a kompakt multimodális MoE-architektúra kevesebb aktív paraméterrel is a nagyobb modellek szintjével összehasonlítható teljesítményt ér el.[9]\n\n=== A Kimi K2.5 benchmarkjai ===\n\nAz eredmények Thinking módban kerültek rögzítésre (temperature = 1,0; top-p = 0,95; 256 000 tokenes kontextus; vLLM motor; NVIDIA H200 hardverplatform) az NVIDIA NIM platformon közzétett modelltérkép és a technikai jelentés adatai alapján.[2][13]\n\n{| class=\"wikitable\"\n! Kategória !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Következtetés és tudás\n| HLE-Full (eszközök nélkül) || 30,1\n|-\n| HLE-Full (eszközökkel) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vizuális és videó\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Programozás\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Hosszú kontextus\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentikus keresés\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nEzen felül a K2.5 pozitív transzfert mutat a vizuális tanulásból a szöveges feladatokra: +1,7% az MMLU-Pro-n és +2,1% a GPQA-Diamond-on a K2 szöveges alapmodellhez képest.[2]\n\nA végső összehasonlító értékelés a mutatók és forgatókönyvek megválasztásától függ; az eredmények a szerzők adatain alapulnak. A benchmarkok egy részének független validálása a közzététel időpontjában korlátozott.[2][15]\n\n== Alkalmazás ==\n\n=== Szöveges asszisztens és keresés ===\n\nA Kimi platform asszisztensként szolgál hosszú dokumentumok (kutatási jelentések, pénzügyi adatok) feldolgozásának, automatizált elemzésnek és online keresésnek, információ-aggregálással. A Moonshot AI jelzi, hogy a Kimi legfeljebb 300 eszközhívást (tool calls) támogat egyetlen agentikus forgatókönyvön belül.[7][4]\n\n=== Programozás és mérnöki feladatok ===\n\nA Kimi K2 és K2.5 magas eredményeket mutat az SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench és más programozási benchmarkokon. A modelleket repozitóriumokban lévő hibák automatikus javítására, kódgenerálásra és refaktorálásra, illetve online bíráló feladatok megoldására (OJBench, LiveCodeBench) alkalmazzák. A K2 technikai jelentése megjegyzi, hogy a modellt nagy méretarányú szintetikus agentikus korpuszon tanították, beleértve verziókezelő rendszerekkel, csomagkezelőkkel és végrehajtási környezetekkel való interakciókat.[1][2][14]\n\n=== Multimodális alkalmazások ===\n\nA Kimi-VL és K2.5 vizuális kérdés-válasz (VQA) feladatokra készült képeken és dokumentumokon; dokumentummegértésre (OCRBench, OmniDocBench); videóelemzésre (VideoMMMU, LongVideoBench); valamint vizuális specifikációkon alapuló programozási kombinált feladatokra (például felhasználói felület generálása képtervből). A K2.5-höz leírtak szerint „vision-grounded coding" és „autonomous visual debugging" forgatókönyvek is léteznek, ahol a modell vizuális leírás alapján generál kódot és iteratívan elemzi a vizuális eredményt.[2][9][15]\n\n=== API és telepítés ===\n\nA modellek elérhetők a Moonshot AI Open Platform API-ján keresztül, tool calling, thinking mód, JSON mód és kontextus-gyorsítótárazás támogatásával. A nyílt súlyokat helyi telepítéshez vLLM, SGLang és TensorRT-LLM keretrendszereken keresztül használják. A Mooncake szolgáltatás skálázható inferenciát biztosít hosszú kontextus esetén.[4][11][16]\n\n== Korlátok és nyitott problémák ==\n\n=== Erőforrásigény ===\n\nAz 1 billió paraméteres MoE-modellek, még 32 milliárd aktivált paraméterrel és INT4-kvantálással is, jelentős memória- és sávszélességi erőforrásokat igényelnek. A Kimi K2.5 telepítésének mérnöki megvitatásaiban a modell teljes betöltéséhez szükséges grafikus memória becslése száz gigabájtos nagyságrendben szerepel; a konkrét számok a kvantálási módtól és a keretrendszertől (vLLM, SGLang stb.) függenek.[2][17]\n\n=== Hallucinációk és a generálás minősége ===\n\nMint minden más LLM, a Kimi sorozat modelljei is hajlamosak hallucinációkra. A FACTS Grounding és FaithJudge tesztek jelentéseiben a hallucination rate mutatói 1,1–7,4% között vannak rögzítve RAG-forgatókönyvekben. Non-thinking módban a modell felesleges tokeneket generálhat homályos eszközspecifikációk esetén; az eszközhasználat kényszeres bekapcsolásakor a teljesítmény egyes feladatokon csökken.[1]\n\n=== Szintetikus adatoktól és RL-pipeline-tól való függőség ===\n\nAz agentikus adatszintézis és megerősítéses tanulás pipeline-ja nagyszámú szintetikus eszközre és jelenetre, valamint LLM-értékelőkre támaszkodik az automatikus értékeléshez (self-judging). Ez a séma nyitott kérdéseket vet fel: az önértékelés elfogultságával (bias) szembeni ellenálló képesség; a többszöri iteráció során potenciálisan fellépő degradáció (bootstrap); az agentikus készségek átvihetősége valós, a szimulálttól eltérő környezetekre; a szintetikus feladatok eloszlásának hatása az általánosítási képességre.[1][14]\n\n=== Átláthatóság és reprodukálhatóság ===\n\nA tanítási adatok összetételéről, a szűrési folyamatról, a nyelvek és tartományok eloszlásáról szóló információk egy része nem kerül nyilvánosságra, vagy csak korlátozott mértékben. Ez megnehezíti az elfogultsági forrásokra vonatkozó pontos értékelést, a tanítás reprodukálhatóságát és az egyes összetevők (MuonClip, QK-clip) stabilitásra gyakorolt hatásának független validálását. 2026 februárjáig a Kimi K2 és K2.5 tanításának harmadik felek általi teljes reprodukálása nem szerepel a nyílt irodalomban.[1][2]\n\n== Etikai és szabályozási szempontok ==\n\nA modelltérképek és technikai jelentések hangsúlyozzák, hogy a fejlesztők felelősséget viselnek a modell bemeneteiért és kimeneteiért; a bevezetés előtt szükséges védőmechanizmusok (guardrails) hozzáadása és az adott esetre vonatkozó adatokon való tesztelés; a modell képeket és videókat dolgozhat fel, amelyek személyes adatokat is tartalmazhatnak, és az integrátor köteles betartani a vonatkozó jogszabályokat.[2][16]\n\nA technikai jelentések biztonsági értékeléseket írnak le (biológiai, kémiai, kiberkockázatok) Promptfoo-hoz hasonló eszközök segítségével. A modellek RL-igazításon (alignment) esnek át ellenőrizhető jutalmakkal és önértékeléssel.[1]\n\nMint kínai vállalat termékei, a modellek a KNR nemzeti mesterséges intelligencia szabályozásának hatálya alá tartoznak. Az írás időpontjában nem találhatók külön nyilvános szabályozási dokumentumok, amelyek kizárólag a Kimi modellekre vonatkoznak; a szabályozás a generatív modellekre és a mesterséges intelligenciára vonatkozó általános megközelítések keretein belül valósul meg az érintett joghatóságokban.[18]\n\n2026 februárjában az Anthropic vállalat bejelentette, hogy a Moonshot AI (más kínai fejlesztőkkel együtt) hamis fiókokat használt a Claude-dal való interakciók generálásához a modellek tanításához szükséges adatok desztillálása céljából. Az információ egy fél állításának jellegével bír, és a közzétételkor nem erősítik meg független vizsgálatok; a Moonshot AI nem tett közzé hivatalos választ.[5]\n\n== Perspektívák és kutatási irányok ==\n\nA közzétett anyagok alapján több további kutatási irány is azonosítható:\n\n* Skálázható agentikus rendszerek. LLM-ek agentikus rendszerekként való tanítási megközelítéseinek fejlesztése szintetikus eszközkészlet, RL és self-judging alkalmazásával. Az Agent Swarm kiterjesztése nagyobb számú részügynökre és új típusú feladatokra.[2][1]\n* Hatékony MoE-architektúrák. 1 billió paraméter 32 milliárd aktiválttal és 384 szakértővel a méret és a hatékonyság közötti kompromisszum egyik változatát képviseli; különböző útválasztási sémákat alkalmazó alternatívák is vizsgálat alatt állnak.[1]\n* Natív multimodalitás. A K2.5 modellek az előtanítás elejétől vegyes vizuális-szöveges adatokon való tanítása a „natív" multimodalitás megközelítése, amelyet a kétlépéses sémákkal hasonlítanak össze.[2][9]\n* Hatékony inferencia és hosszú kontextus. Az INT4-kvantálás és a 256 000 tokenes kontextustámogatás ösztönzi a ritka figyelmi mechanizmusok, látens reprezentációk és külső memória területén folytatott további kutatásokat. Külön leírásra kerül a Kimi Linear projekt — hibrid lineáris figyelem 75%-os KV-gyorsítótár csökkentéssel és 6-szoros dekódolási gyorsítással 1 millió tokenes kontextus esetén.[2][19]\n\nA Moonshot AI hivatalos anyagaiban nem tesznek közzé részletes ütemtervet a Kimi jövőbeli verzióihoz; a felsorolt irányok a közzétett kutatásokon alapulnak.\n\n== Lásd még ==\n* Transformer architektúra\n* DeepSeek\n* Qwen\n\n== Hivatkozások ==\n* https://www.moonshot.ai/ — a Moonshot AI hivatalos weboldala\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — a Kimi K2.5 GitHub-tárolója\n* https://huggingface.co/moonshotai — a Moonshot AI profilja a Hugging Face platformon\n\n== Irodalom ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Megjegyzések ==\n\n\n\nTemplate:SEOMeta\n

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692