Kimi (Moonshot AI) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (seria modeli Moonshot AI) — seria dużych modeli językowych (Large Language Model, LLM), opracowywanych przez chińską firmę Moonshot AI (Pekin, ChRL) do zadań generowania tekstu i treści multimodalnych, programowania oraz systemów agentowych (agentic systems — systemów zdolnych do autonomicznego planowania, wnioskowania i działania z wykorzystaniem zewnętrznych narzędzi). Rodzina obejmuje modele tekstowe i multimodalne z architekturą Mixture-of-Experts (MoE, mieszanina ekspertów) w skali rzędu 1 biliona parametrów i aktywowanym podzbiorem rzędu 32 miliardów parametrów na token.[1][2] Istotną cechą serii jest orientacja na zachowanie agentowe (wieloetapowe planowanie z wywoływaniem zewnętrznych narzędzi) oraz obsługa długiego kontekstu do 256 000 tokenów w wersjach Kimi K2 i Kimi K2.5.[1][2]\n\nModele serii Kimi są dystrybuowane zarówno z otwartymi wagami (open-weight) na platformie Hugging Face na zmodyfikowanej licencji MIT, jak i przez własnościowe API platformy Moonshot AI Open Platform.[3][4]\n\n== Historia i przesłanki ==\n\n=== Założenie Moonshot AI ===\n\nMoonshot AI zostało założone w marcu 2023 roku w Pekinie przez Yang Zhilina (Yang Zhilin, CEO), Zhou Xinyua (Zhou Xinyu) i Wu Yuxina (Wu Yuxin) — absolwentów Uniwersytetu Tsinghua (Tsinghua University). Yang Zhilin wcześniej pracował w Google Brain i Meta, uczestniczył w badaniach z zakresu widzenia komputerowego i wnioskowania. Firma pozyskała finansowanie od Alibaba (runda o wartości 1 mld USD, luty 2024), Tencent i innych inwestorów.[5][6]\n\n=== Chronologia kluczowych wydań ===\n\n* Październik–listopad 2023 — uruchomienie chatbota Kimi z obsługą kontekstu do 128 tys. tokenów (do 200 tys. chińskich znaków). Pierwsze wersje korzystały z modeli własnościowych z ograniczonymi ujawnionymi szczegółami technicznymi.[6][7]\n* Marzec 2024 — rozszerzenie kontekstu do 2 milionów znaków w wersji beta.[6]\n* Styczeń 2025 — wydanie Kimi k1.5 — multimodalnego modelu z skalowanym uczeniem ze wzmocnieniem (Reinforcement Learning, RL), deklarowanego jako porównywalnego pod względem wydajności z OpenAI o1 w zadaniach matematyki, programowania i multimodalnego wnioskowania. Kontekst do 128 tys. tokenów.[8]\n* Kwiecień 2025 — przedstawiono Kimi-VL — otwarty multimodalny model MoE (vision-language model, VLM) z enkoderem wizualnym MoonViT (~400 mln parametrów) i ~2,8 mld aktywnych parametrów w dekoderze. Raport techniczny opublikowano na arXiv.[9]\n* Lipiec 2025 — wydanie Kimi K2 — głównego otwartego modelu MoE z 1 bilionem parametrów i 32 miliardami aktywnych parametrów. Raport techniczny opublikowano na arXiv.[1] Model zajmował pierwsze miejsce wśród otwartych modeli na LMSYS Chatbot Arena w momencie wydania (ponad 3000 głosów).[1]\n* Wrzesień 2025 — aktualizacja Kimi-K2-Instruct-0905 z rozszerzonym kontekstem do 256 tys. tokenów i ulepszonym agentowym kodowaniem.[1]\n* Listopad 2025 — wydanie Kimi K2 Thinking — wersji z wzmocnionym rozumowaniem krok po kroku (chain-of-thought) i obsługą 200–300 sekwencyjnych wywołań narzędzi (tool calls).[10]\n* Styczeń 2026 — przedstawiono Kimi K2.5 — multimodalny model MoE z natywną multimodalnością i mechanizmem Agent Swarm (równoległa orkiestracja sub-agentów).[2]\n\nRównolegle z rozwojem modeli w 2024 roku przedstawiono własną usługę inferencji Mooncake — zdezagregowaną architekturę zorientowaną na KVCache do obsługi LLM z długim kontekstem.[11]\n\n== Podstawy teoretyczne i architektura ==\n\n=== Architektura Mixture-of-Experts ===\n\nModele serii Kimi K2 i K2.5 implementują architekturę Transformer z Mixture-of-Experts w poszczególnych warstwach. Standardowy blok transformera stanowi kompozycję warstw wielogłowej samouwagi (Multi-Head Attention, MHA) i pozycyjnie-wise MLP (wielowarstwowego perceptronu) z połączeniami resztkowymi:[1][12]\n\n𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,\n\ngdzie 𝐇L×d — wejściowe reprezentacje tokenów, L — długość sekwencji, d — rozmiar stanu ukrytego.\n\nW warstwie MoE zamiast jednego MLP używany jest zestaw ekspertów {Ei}i=1N, z których każdy stanowi oddzielny MLP z parametrami θi. Router (gating network) dla każdego tokenu wybiera podzbiór ekspertów. Wyjście warstwy MoE dla tokenu z reprezentacją 𝐡 definiowane jest jako:[1]\n\nMoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),\n\ngdzie 𝒮(𝐡){1,,N} — zbiór wybranych ekspertów dla danego tokenu, gi(𝐡) — znormalizowane wagi routera, i𝒮gi=1. Funkcja routingu wybiera ekspertów poprzez operację TopK:[1]\n\ng(𝐡)=TopK(Softmax(𝐡Wg)),\n\ngdzie Wg — uczalna macierz routera. Taki schemat pozwala skalować całkowitą liczbę parametrów przy ograniczonej liczbie parametrów aktywowanych na każdy token.\n\n=== Hiperparametry architektoniczne Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Parametr !! Wartość\n|-\n| Typ architektury || Transformer z Mixture-of-Experts\n|-\n| Całkowita liczba parametrów || 1,04 biliona\n|-\n| Aktywowane parametry na token || 32 miliardy\n|-\n| Liczba warstw || 61 (1 gęsta + 60 MoE)\n|-\n| Rozmiar stanu ukrytego || 7168\n|-\n| Liczba głów uwagi || 64\n|-\n| Liczba ekspertów || 384 (8 wybieranych na token + 1 wspólny)\n|-\n| Rozmiar stanu ukrytego eksperta (MoE hidden size) || 2048\n|-\n| Rozmiar słownika || 160 000 tokenów\n|-\n| Funkcja aktywacji || SwiGLU\n|-\n| Mechanizm uwagi || Multi-head Latent Attention (MLA)\n|-\n| Maksymalny kontekst || 256 000 tokenów (rozszerzenie przez YaRN)\n|-\n| Enkoder wizualny (K2.5) || MoonViT-3D, ~400 mln parametrów\n|}\n[1][2][13]\n\nRzadkość (stosunek całkowitej liczby ekspertów do aktywowanych) wynosi 48:1 (384 ekspertów, 8 aktywnych), co zapewnia znaczące zmniejszenie nakładów obliczeniowych w porównaniu do modelu gęstego (dense) tej samej skali.[1]\n\n=== Mechanizm Multi-head Latent Attention (MLA) ===\n\nW modelach serii Kimi K2/K2.5 stosowany jest mechanizm Multi-head Latent Attention (MLA) — modyfikacja standardowej wielogłowej uwagi, ukierunkowana na zwiększenie wydajności i skalowalności. Standardowa uwaga dla jednej warstwy obliczana jest jako:[12]\n\nAttention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,\n\ngdzie 𝐐,𝐊,𝐕L×dk — macierze zapytań, kluczy i wartości. W MLA wprowadzane są reprezentacje ukryte, na które projektowane są zapytania i klucze, co zmniejsza wymiarowość operacji pośrednich i pozwala zredukować rozmiar pamięci podręcznej KV. Podejście jest analogiczne do mechanizmu zastosowanego w DeepSeek-V3.[1][13]\n\n=== Optymalizator MuonClip i QK-clip ===\n\nDo trenowania modelu Kimi K2 zaproponowano optymalizator MuonClip — modyfikację optymalizatora Muon (momentowy optymalizator z normalizacją Newton-Schulz) z dodaniem techniki QK-clip w celu stabilizacji trenowania dużych modeli językowych z architekturą MoE.[1]\n\nQK-clip stosuje ograniczenia na logity uwagi 𝐐𝐊 poprzez operację obcinania (clipping). Dla każdej głowy uwagi h wyznaczany jest maksymalny logit:\n\nShmax=1dmaxi,j(Qhi(Khj)),\n\ni obliczany jest współczynnik skalowania:\n\nγh=min(1,τShmax),\n\ngdzie τ=100 — hiperparametr-próg, d — rozmiar głowy uwagi. Współczynnik γh stosowany jest do skalowania wag Wq,Wk, jeśli maksymalny logit przekracza próg. Ogranicza to zakres wartości logitów przed softmax i zmniejsza ryzyko gwałtownych skoków straty (loss spikes) podczas trenowania na dużych skalach.[1]\n\nWedług autorów, wstępne trenowanie Kimi K2 na 15,5 bilionach tokenów z MuonClip przebiegło bez ani jednego zarejestrowanego skoku funkcji straty (zero loss spikes).[1]\n\n=== Multimodalność i MoonViT ===\n\nModele Kimi K2.5 i Kimi-VL wykorzystują enkoder wizualny MoonViT (w wersji K2.5 — MoonViT-3D) z około 400 milionami parametrów, zbudowany na bazie SigLIP-SO-400M z pakowaniem NaViT (obsługa zmiennej rozdzielczości obrazów wejściowych) i rozszerzeniem 3D do przetwarzania wideo (grupowanie co 4 klatki).[2][9]\n\nEnkoder wizualny przekształca wejściowe obrazy i wideo w sekwencję tokenów wizualnych. Niech 𝐗H×W×3 — obraz wejściowy, Φvis — enkoder wizualny:\n\n𝐙vis=Φvis(𝐗)Lv×dv,\n\nnastępnie przez projekcję liniową (dwuwarstwowy MLP) 𝐏dv×d:\n\n𝐇vis=𝐙vis𝐏,\n\ngdzie d — rozmiar przestrzeni ukrytej części językowej modelu. W trybie multimodalnym 𝐇vis jest konkatenowany z tokenami tekstowymi i przekazywany do transformera.[9][2]\n\nW odróżnieniu od schematów dwuetapowych (dodanie adaptera wizualnego na szczyt modelu tekstowego), K2.5 jest trenowana na mieszanych danych wizualno-tekstowych od początku wstępnego trenowania (joint text-vision pre-training), z niskim udziałem tokenów wizualnych (~10%) na wczesnych etapach i stopniowym jego zwiększaniem. Całkowity wolumen — około 15 bilionów mieszanych tokenów wizualno-tekstowych.[2]\n\n== Wstępne trenowanie i dostrajanie ==\n\n=== Wstępne trenowanie ===\n\nKimi K2 była wstępnie trenowana na 15,5 bilionach tokenów (teksty webowe, kod, matematyka, wiedza encyklopedyczna) z użyciem optymalizatora MuonClip. Przez cały okres wstępnego trenowania nie zarejestrowano ani jednego skoku straty (loss spike).[1]\n\nKimi K2.5 przeszła ciągłe wstępne trenowanie (continual pre-training) od punktu kontrolnego K2 na dodatkowych ~15 bilionach mieszanych tokenów wizualno-tekstowych z jednoczesną optymalizacją modalności (joint pre-training). Odrębnie przeprowadzono samodzielne trenowanie enkodera wizualnego na 1 bilion tokenów oraz dodatkowy etap long-context mid-training w celu rozszerzenia kontekstu.[2]\n\n=== Dostrajanie ===\n\nDostrajanie modeli serii K2 obejmuje kilka etapów:[1][2]\n\nSupervised Fine-Tuning (SFT, nadzorowane dostrajanie):\n* Syntetyczne trajektorie agentowe (agentic data synthesis) — generowanie specyfikacji narzędzi, modelowanie interakcji ze środowiskiem, weryfikacja wyników.\n* Dla K2.5 dodatkowo stosowany jest zero-vision SFT — tekstowy SFT aktywujący zdolności wizualne bez bezpośredniego użycia obrazów na etapie fine-tuning.\n\nReinforcement Learning (RL, uczenie ze wzmocnieniem):\n* Kombinacja weryfikowalnych nagród (Reinforcement Learning with Verifiable Rewards, RLVR) dla zadań matematyki, kodu i bezpieczeństwa.\n* Samoocena według rubryk (self-critique rubric rewards) — używanie oceniających LLM do automatycznej oceny jakości scenariuszy agentowych.\n* Dla K2.5 — wspólne multimodalne RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking i K2.5 obsługują natywną kwantyzację wag INT4 (weight-only quantization, grupa 32, skompresowane tensory), zoptymalizowaną pod architekturę NVIDIA Hopper, co zmniejsza wymagania pamięciowe podczas inferencji.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nDla modelu K2.5 opracowano mechanizm Agent Swarm — framework samozarządzającej się równoległej orkiestracji agentów. Model-orkiestrator dynamicznie tworzy sub-agentów (poprzez operacje create_subagent, assign_task), rozdziela podzadania i zbiera wyniki. Każdy sub-agent może samodzielnie wywoływać narzędzia i pracować równolegle z innymi sub-agentami.[2]\n\nTrenowanie mechanizmu Agent Swarm realizowane jest poprzez Parallel-Agent Reinforcement Learning (PARL) z oddzieleniem wykonania od optymalizacji (decoupling execution/optimization). Według autorów, Agent Swarm zapewnia zmniejszenie opóźnienia (latency) do 4,5× w porównaniu z jednowątkowym trybem agentowym (single-agent).[2]\n\n== Główne modele serii ==\n\n{| class=\"wikitable\"\n! Model !! Typ !! Parametry (całkowite / aktywne) !! Kontekst, tokenów !! Multimodalność !! Data wydania\n|-\n| Kimi k1.5 || LLM, RL-scaling || nieujawnione || 128 000 || Tak (ograniczona) || Styczeń 2025\n|-\n| Kimi-VL || VLM, MoE || kompaktowa / ~2,8 mld aktywnych + 400 mln ViT || długi kontekst || Tak (obrazy) || Kwiecień 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Nie (tekst) || Lipiec 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Nie (tekst) || Listopad 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Tak (obrazy, wideo, PDF) || Styczeń 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — LLM Mixture-of-Experts z 1,04 biliona całkowitych parametrów i 32 miliardami aktywowanych parametrów na token. Wstępnie trenowany na 15,5 bilionach tokenów z optymalizatorem MuonClip. Architektura obejmuje 384 ekspertów i kompatybilny z długim kontekstem mechanizm MLA. Model jest ukierunkowany na zadania programowania, wnioskowania matematycznego i scenariuszy agentowych z sekwencyjnymi wywołaniami narzędzi.[1]\n\nW raporcie technicznym opisano wieloetapowy potok dostrajania: masową syntezę danych agentowych poprzez modelowanie interakcji z narzędziami; uczenie ze wzmocnieniem w mieszanym środowisku rzeczywistych i syntetycznych zadań; użycie oceniających LLM do automatycznej oceny jakości.[1][14]\n\n=== Kimi K2 Thinking ===\n\nWariant Kimi K2 Thinking zoptymalizowany jest do wieloetapowego wnioskowania (chain-of-thought) z możliwością dynamicznego wywoływania narzędzi i obsługą kontekstu do 256 000 tokenów. Model implementuje odrębny tryb „Thinking" z jawnie zwracanym polem reasoning_content, zawierającym wewnętrzne rozumowania. K2 Thinking obsługuje 200–300 sekwencyjnych wywołań narzędzi w jednym epizodzie agentowym bez istotnej degradacji zachowania, a także natywną kwantyzację INT4 z użyciem QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — otwarty multimodalny MoE-VLM (vision-language model), ukierunkowany na zadania rozumienia wizualnego, wizualno-tekstowego wnioskowania i rzeczywistych scen. Model opisywany jest jako kompaktowa architektura MoE z enkoderem wizualnym MoonViT. Raport techniczny opublikowano na arXiv w kwietniu 2025 roku.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — multimodalny model MoE w skali 1,04 biliona parametrów z 32 miliardami aktywowanych, oparty na punkcie kontrolnym Kimi-K2-Base z kontynuowanym wstępnym trenowaniem na ~15 bilionach mieszanych tokenów wizualno-tekstowych. Model obsługuje wejścia w postaci obrazów, wideo, PDF i tekstu z kontekstem do 256 000 tokenów.[2]\n\nK2.5 obsługuje dwa główne tryby wyjścia:\n* Tryb Thinking — z jawnym reasoning_content i wieloetapową generacją;\n* Tryb Instant — bez wyświetlania rozumowań, z niższym opóźnieniem.[2][13]\n\nModel implementuje natywną kwantyzację wag INT4 (weight-only, grupa 32), zoptymalizowaną pod architekturę NVIDIA Hopper.[2]\n\n== Kluczowe wyniki i benchmarki ==\n\n=== Benchmarki tekstowe i agentowe Kimi K2 ===\n\nWyniki podane są dla Kimi-K2-Instruct w trybie non-thinking (bez rozszerzonego chain-of-thought) według danych z raportu technicznego.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Źródło\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nWedług deklaracji autorów, wyniki te pozycjonują K2 wśród liderów otwartych modeli w trybie bez rozwinięcia thinking, szczególnie w zadaniach inżynierskich i agentowych (według stanu na moment publikacji raportu).[1]\n\n=== Benchmarki Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Źródło\n|-\n| MMVet (dokładność) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nWyniki pokazują, że kompaktowa multimodalna architektura MoE osiąga poziom porównywalny z większymi modelami przy mniejszej liczbie aktywnych parametrów.[9]\n\n=== Benchmarki Kimi K2.5 ===\n\nWyniki podane są w trybie Thinking (temperature = 1,0; top-p = 0,95; kontekst 256 000 tokenów; silnik vLLM; platforma sprzętowa NVIDIA H200) według danych z karty modelu na platformie NVIDIA NIM i raportu technicznego.[2][13]\n\n{| class=\"wikitable\"\n! Kategoria !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (bez narzędzi) || 30,1\n|-\n| HLE-Full (z narzędziami) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nDodatkowo K2.5 demonstruje pozytywny transfer uczenia wizualnego na zadania tekstowe: +1,7% na MMLU-Pro i +2,1% na GPQA-Diamond w porównaniu z tekstowym modelem bazowym K2.[2]\n\nOstateczna ocena porównawcza zależy od wyboru metryk i scenariuszy; wyniki podane są według danych autorów. Niezależna walidacja części benchmarków w momencie publikacji jest ograniczona.[2][15]\n\n== Zastosowania ==\n\n=== Asystent tekstowy i wyszukiwanie ===\n\nPlatforma Kimi używana jest jako asystent z obsługą przetwarzania długich dokumentów (raporty badawcze, dane finansowe), automatycznej analizy i wyszukiwania online z agregowaniem informacji. Moonshot AI podaje, że Kimi obsługuje ponad 300 wywołań narzędzi (tool calls) w ramach jednego scenariusza agentowego.[7][4]\n\n=== Programowanie i zadania inżynierskie ===\n\nKimi K2 i K2.5 demonstrują wysokie wyniki na SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench i innych benchmarkach programowania. Modele stosowane są do automatyzacji naprawy błędów w repozytoriach, generowania i refaktoryzacji kodu, rozwiązywania zadań w systemach oceny online (OJBench, LiveCodeBench). Raport techniczny K2 wskazuje, że model był trenowany na masowym syntetycznym korpusie agentowym, obejmującym interakcje z systemami kontroli wersji, menedżerami pakietów i środowiskami wykonawczymi.[1][2][14]\n\n=== Zastosowania multimodalne ===\n\nKimi-VL i K2.5 przeznaczone są do wizualnego pytania i odpowiedzi (VQA) na obrazach i dokumentach; rozumienia dokumentów (OCRBench, OmniDocBench); analizy wideo (VideoMMMU, LongVideoBench); złożonych zadań programowania według specyfikacji wizualnych (np. generowanie interfejsu na podstawie makiety graficznej). Dla K2.5 opisano scenariusze „vision-grounded coding" i „autonomous visual debugging", w których model generuje kod na podstawie opisu wizualnego i iteracyjnie analizuje wizualny wynik.[2][9][15]\n\n=== API i wdrożenie ===\n\nModele dostępne są przez API platformy Moonshot AI Open Platform z obsługą tool calling, trybu thinking, trybu JSON i buforowania kontekstu. Otwarte wagi wykorzystywane są do lokalnego wdrażania przez vLLM, SGLang i TensorRT-LLM. Usługa Mooncake zapewnia skalowanie inferencji dla długiego kontekstu.[4][11][16]\n\n== Ograniczenia i otwarte problemy ==\n\n=== Wymagania zasobowe ===\n\nModele MoE w skali 1 biliona parametrów, nawet przy aktywowanych 32 miliardach parametrów i kwantyzacji INT4, wymagają znacznych zasobów pamięciowych i przepustowości. W dyskusjach inżynierskich dotyczących wdrożenia Kimi K2.5 wspominane są szacunki rzędu setek gigabajtów pamięci karty graficznej dla pełnego załadowania modelu; konkretne liczby zależą od schematu kwantyzacji i frameworka (vLLM, SGLang itp.).[2][17]\n\n=== Halucynacje i jakość generacji ===\n\nPodobnie jak inne LLM, modele serii Kimi podatne są na halucynacje. W raportach z testów FACTS Grounding i FaithJudge odnotowano wskaźniki hallucination rate w przedziale 1,1–7,4% w scenariuszach RAG. W trybie non-thinking model może generować nadmiarowe tokeny przy nieprecyzyjnych specyfikacjach narzędzi; przy wymuszonym użyciu narzędzi (tool-use) wydajność spada w niektórych zadaniach.[1]\n\n=== Zależność od danych syntetycznych i potoku RL ===\n\nPotok syntezy danych agentowych i uczenia ze wzmocnieniem opiera się na dużej kolekcji syntetycznych narzędzi i scen oraz oceniających LLM do automatycznej oceny (self-judging). Taki schemat rodzi otwarte pytania: odporność na odchylenie (bias) samooceny; potencjalna degradacja przy wielokrotnej iteracji (bootstrap); przenoszalność umiejętności agentowych na rzeczywiste środowiska różniące się od symulowanych; wpływ rozkładu zadań syntetycznych na zdolność uogólniania.[1][14]\n\n=== Przejrzystość i odtwarzalność ===\n\nCzęść informacji o składzie danych treningowych, procesie filtrowania, rozkładzie języków i dziedzin nie jest ujawniana lub ujawniana jest w ograniczonym zakresie. Utrudnia to dokładną ocenę źródeł odchylenia, odtwarzalność trenowania i niezależną walidację wpływu poszczególnych komponentów (MuonClip, QK-clip) na stabilność. Według stanu na luty 2026 roku pełne odtworzenie trenowania Kimi K2 i K2.5 przez strony trzecie nie zostało odnotowane w otwartej literaturze.[1][2]\n\n== Aspekty etyczne i regulacyjne ==\n\nW kartach modeli i raportach technicznych podkreśla się, że deweloperzy ponoszą odpowiedzialność za dane wejściowe i wyjściowe modelu; wymagane jest dodanie mechanizmów ochronnych (guardrails) i testowanie na danych konkretnego przypadku przed wdrożeniem; model może przetwarzać obrazy i wideo potencjalnie zawierające dane osobowe, a integrator zobowiązany jest przestrzegać odpowiednich przepisów prawa.[2][16]\n\nW raportach technicznych opisano oceny bezpieczeństwa (zagrożenia biologiczne, chemiczne, cybernetyczne) z użyciem narzędzi takich jak Promptfoo. Modele przechodzą wyrównanie RL (alignment) z weryfikowalnymi nagrodami i samooceną.[1]\n\nJako produkt chińskiej firmy, modele podlegają krajowemu regulowaniu ChRL w zakresie AI. Na moment pisania niniejszego artykułu nie odnaleziono odrębnych publicznych dokumentów regulacyjnych poświęconych wyłącznie modelom Kimi; regulacja odbywa się w ramach ogólnych podejść do modeli generatywnych i AI w odpowiednich jurysdykcjach.[18]\n\nW lutym 2026 roku firma Anthropic oświadczyła, że Moonshot AI (obok innych chińskich deweloperów) używała fałszywych kont do generowania interakcji z Claude w celu destylacji danych do trenowania modeli. Informacja ma charakter twierdzenia jednej strony i nie jest potwierdzona niezależnymi dochodzeniami na moment publikacji; Moonshot AI nie opublikowała oficjalnej odpowiedzi.[5]\n\n== Perspektywy i kierunki badań ==\n\nNa podstawie opublikowanych materiałów można wyróżnić kilka kierunków dalszych badań:\n\n* Skalowalne systemy agentowe. Rozwój podejść do trenowania LLM jako systemów agentowych z użyciem syntetycznego zestawu narzędzi, RL i self-judging. Rozszerzenie Agent Swarm na większą liczbę sub-agentów i nowe typy zadań.[2][1]\n* Wydajne architektury MoE. Użycie 1 biliona parametrów z 32 miliardami aktywowanych i 384 ekspertów stanowi jeden z wariantów kompromisu między skalą a wydajnością; badane są alternatywy z różnymi schematami routingu.[1]\n* Natywna multimodalność. Trenowanie K2.5 na mieszanych danych wizualno-tekstowych od początku wstępnego trenowania stanowi podejście do „natywnej" multimodalności, które porównywane jest z schematami dwuetapowymi.[2][9]\n* Wydajna inferencja i długi kontekst. Kwantyzacja INT4 i obsługa kontekstu 256 000 tokenów stymulują dalsze badania w dziedzinie rzadkiej uwagi (sparse attention), reprezentacji ukrytych i pamięci zewnętrznej. Osobno opisano projekt Kimi Linear — hybrydową liniową uwagę ze zmniejszeniem KV-cache o 75% i 6-krotnym przyspieszeniem dekodowania przy kontekście 1 miliona tokenów.[2][19]\n\nW oficjalnych materiałach Moonshot AI nie są publikowane szczegółowe mapy drogowe dotyczące przyszłych wersji Kimi; wymienione kierunki oparte są na opublikowanych badaniach.\n\n== Zobacz też ==\n* Architektura Transformer\n* DeepSeek\n* Qwen\n\n== Odnośniki ==\n* https://www.moonshot.ai/ — oficjalna strona Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — repozytorium GitHub Kimi K2.5\n* https://huggingface.co/moonshotai — profil Moonshot AI na Hugging Face\n\n== Literatura ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Przypisy ==\n\n\n\nTemplate:SEOMeta\n

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692