Kimi (Moonshot AI) (PL)
Kimi (seria modeli Moonshot AI) — seria dużych modeli językowych (Large Language Model, LLM), opracowywanych przez chińską firmę Moonshot AI (Pekin, ChRL) do zadań generowania tekstu i treści multimodalnych, programowania oraz systemów agentowych (agentic systems — systemów zdolnych do autonomicznego planowania, wnioskowania i działania z wykorzystaniem zewnętrznych narzędzi). Rodzina obejmuje modele tekstowe i multimodalne z architekturą Mixture-of-Experts (MoE, mieszanina ekspertów) w skali rzędu 1 biliona parametrów i aktywowanym podzbiorem rzędu 32 miliardów parametrów na token.[1][2] Istotną cechą serii jest orientacja na zachowanie agentowe (wieloetapowe planowanie z wywoływaniem zewnętrznych narzędzi) oraz obsługa długiego kontekstu do 256 000 tokenów w wersjach Kimi K2 i Kimi K2.5.[1][2]\n\nModele serii Kimi są dystrybuowane zarówno z otwartymi wagami (open-weight) na platformie Hugging Face na zmodyfikowanej licencji MIT, jak i przez własnościowe API platformy Moonshot AI Open Platform.[3][4]\n\n== Historia i przesłanki ==\n\n=== Założenie Moonshot AI ===\n\nMoonshot AI zostało założone w marcu 2023 roku w Pekinie przez Yang Zhilina (Yang Zhilin, CEO), Zhou Xinyua (Zhou Xinyu) i Wu Yuxina (Wu Yuxin) — absolwentów Uniwersytetu Tsinghua (Tsinghua University). Yang Zhilin wcześniej pracował w Google Brain i Meta, uczestniczył w badaniach z zakresu widzenia komputerowego i wnioskowania. Firma pozyskała finansowanie od Alibaba (runda o wartości 1 mld USD, luty 2024), Tencent i innych inwestorów.[5][6]\n\n=== Chronologia kluczowych wydań ===\n\n* Październik–listopad 2023 — uruchomienie chatbota Kimi z obsługą kontekstu do 128 tys. tokenów (do 200 tys. chińskich znaków). Pierwsze wersje korzystały z modeli własnościowych z ograniczonymi ujawnionymi szczegółami technicznymi.[6][7]\n* Marzec 2024 — rozszerzenie kontekstu do 2 milionów znaków w wersji beta.[6]\n* Styczeń 2025 — wydanie Kimi k1.5 — multimodalnego modelu z skalowanym uczeniem ze wzmocnieniem (Reinforcement Learning, RL), deklarowanego jako porównywalnego pod względem wydajności z OpenAI o1 w zadaniach matematyki, programowania i multimodalnego wnioskowania. Kontekst do 128 tys. tokenów.[8]\n* Kwiecień 2025 — przedstawiono Kimi-VL — otwarty multimodalny model MoE (vision-language model, VLM) z enkoderem wizualnym MoonViT (~400 mln parametrów) i ~2,8 mld aktywnych parametrów w dekoderze. Raport techniczny opublikowano na arXiv.[9]\n* Lipiec 2025 — wydanie Kimi K2 — głównego otwartego modelu MoE z 1 bilionem parametrów i 32 miliardami aktywnych parametrów. Raport techniczny opublikowano na arXiv.[1] Model zajmował pierwsze miejsce wśród otwartych modeli na LMSYS Chatbot Arena w momencie wydania (ponad 3000 głosów).[1]\n* Wrzesień 2025 — aktualizacja Kimi-K2-Instruct-0905 z rozszerzonym kontekstem do 256 tys. tokenów i ulepszonym agentowym kodowaniem.[1]\n* Listopad 2025 — wydanie Kimi K2 Thinking — wersji z wzmocnionym rozumowaniem krok po kroku (chain-of-thought) i obsługą 200–300 sekwencyjnych wywołań narzędzi (tool calls).[10]\n* Styczeń 2026 — przedstawiono Kimi K2.5 — multimodalny model MoE z natywną multimodalnością i mechanizmem Agent Swarm (równoległa orkiestracja sub-agentów).[2]\n\nRównolegle z rozwojem modeli w 2024 roku przedstawiono własną usługę inferencji Mooncake — zdezagregowaną architekturę zorientowaną na KVCache do obsługi LLM z długim kontekstem.[11]\n\n== Podstawy teoretyczne i architektura ==\n\n=== Architektura Mixture-of-Experts ===\n\nModele serii Kimi K2 i K2.5 implementują architekturę Transformer z Mixture-of-Experts w poszczególnych warstwach. Standardowy blok transformera stanowi kompozycję warstw wielogłowej samouwagi (Multi-Head Attention, MHA) i pozycyjnie-wise MLP (wielowarstwowego perceptronu) z połączeniami resztkowymi:[1][12]\n\n\n\ngdzie — wejściowe reprezentacje tokenów, — długość sekwencji, — rozmiar stanu ukrytego.\n\nW warstwie MoE zamiast jednego MLP używany jest zestaw ekspertów , z których każdy stanowi oddzielny MLP z parametrami . Router (gating network) dla każdego tokenu wybiera podzbiór ekspertów. Wyjście warstwy MoE dla tokenu z reprezentacją definiowane jest jako:[1]\n\n\n\ngdzie — zbiór wybranych ekspertów dla danego tokenu, — znormalizowane wagi routera, . Funkcja routingu wybiera ekspertów poprzez operację TopK:[1]\n\n\n\ngdzie — uczalna macierz routera. Taki schemat pozwala skalować całkowitą liczbę parametrów przy ograniczonej liczbie parametrów aktywowanych na każdy token.\n\n=== Hiperparametry architektoniczne Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Parametr !! Wartość\n|-\n| Typ architektury || Transformer z Mixture-of-Experts\n|-\n| Całkowita liczba parametrów || 1,04 biliona\n|-\n| Aktywowane parametry na token || 32 miliardy\n|-\n| Liczba warstw || 61 (1 gęsta + 60 MoE)\n|-\n| Rozmiar stanu ukrytego || 7168\n|-\n| Liczba głów uwagi || 64\n|-\n| Liczba ekspertów || 384 (8 wybieranych na token + 1 wspólny)\n|-\n| Rozmiar stanu ukrytego eksperta (MoE hidden size) || 2048\n|-\n| Rozmiar słownika || 160 000 tokenów\n|-\n| Funkcja aktywacji || SwiGLU\n|-\n| Mechanizm uwagi || Multi-head Latent Attention (MLA)\n|-\n| Maksymalny kontekst || 256 000 tokenów (rozszerzenie przez YaRN)\n|-\n| Enkoder wizualny (K2.5) || MoonViT-3D, ~400 mln parametrów\n|}\n[1][2][13]\n\nRzadkość (stosunek całkowitej liczby ekspertów do aktywowanych) wynosi 48:1 (384 ekspertów, 8 aktywnych), co zapewnia znaczące zmniejszenie nakładów obliczeniowych w porównaniu do modelu gęstego (dense) tej samej skali.[1]\n\n=== Mechanizm Multi-head Latent Attention (MLA) ===\n\nW modelach serii Kimi K2/K2.5 stosowany jest mechanizm Multi-head Latent Attention (MLA) — modyfikacja standardowej wielogłowej uwagi, ukierunkowana na zwiększenie wydajności i skalowalności. Standardowa uwaga dla jednej warstwy obliczana jest jako:[12]\n\n\n\ngdzie — macierze zapytań, kluczy i wartości. W MLA wprowadzane są reprezentacje ukryte, na które projektowane są zapytania i klucze, co zmniejsza wymiarowość operacji pośrednich i pozwala zredukować rozmiar pamięci podręcznej KV. Podejście jest analogiczne do mechanizmu zastosowanego w DeepSeek-V3.[1][13]\n\n=== Optymalizator MuonClip i QK-clip ===\n\nDo trenowania modelu Kimi K2 zaproponowano optymalizator MuonClip — modyfikację optymalizatora Muon (momentowy optymalizator z normalizacją Newton-Schulz) z dodaniem techniki QK-clip w celu stabilizacji trenowania dużych modeli językowych z architekturą MoE.[1]\n\nQK-clip stosuje ograniczenia na logity uwagi poprzez operację obcinania (clipping). Dla każdej głowy uwagi wyznaczany jest maksymalny logit:\n\n\n\ni obliczany jest współczynnik skalowania:\n\n\n\ngdzie — hiperparametr-próg, — rozmiar głowy uwagi. Współczynnik stosowany jest do skalowania wag , jeśli maksymalny logit przekracza próg. Ogranicza to zakres wartości logitów przed softmax i zmniejsza ryzyko gwałtownych skoków straty (loss spikes) podczas trenowania na dużych skalach.[1]\n\nWedług autorów, wstępne trenowanie Kimi K2 na 15,5 bilionach tokenów z MuonClip przebiegło bez ani jednego zarejestrowanego skoku funkcji straty (zero loss spikes).[1]\n\n=== Multimodalność i MoonViT ===\n\nModele Kimi K2.5 i Kimi-VL wykorzystują enkoder wizualny MoonViT (w wersji K2.5 — MoonViT-3D) z około 400 milionami parametrów, zbudowany na bazie SigLIP-SO-400M z pakowaniem NaViT (obsługa zmiennej rozdzielczości obrazów wejściowych) i rozszerzeniem 3D do przetwarzania wideo (grupowanie co 4 klatki).[2][9]\n\nEnkoder wizualny przekształca wejściowe obrazy i wideo w sekwencję tokenów wizualnych. Niech — obraz wejściowy, — enkoder wizualny:\n\n\n\nnastępnie przez projekcję liniową (dwuwarstwowy MLP) :\n\n\n\ngdzie — rozmiar przestrzeni ukrytej części językowej modelu. W trybie multimodalnym jest konkatenowany z tokenami tekstowymi i przekazywany do transformera.[9][2]\n\nW odróżnieniu od schematów dwuetapowych (dodanie adaptera wizualnego na szczyt modelu tekstowego), K2.5 jest trenowana na mieszanych danych wizualno-tekstowych od początku wstępnego trenowania (joint text-vision pre-training), z niskim udziałem tokenów wizualnych (~10%) na wczesnych etapach i stopniowym jego zwiększaniem. Całkowity wolumen — około 15 bilionów mieszanych tokenów wizualno-tekstowych.[2]\n\n== Wstępne trenowanie i dostrajanie ==\n\n=== Wstępne trenowanie ===\n\nKimi K2 była wstępnie trenowana na 15,5 bilionach tokenów (teksty webowe, kod, matematyka, wiedza encyklopedyczna) z użyciem optymalizatora MuonClip. Przez cały okres wstępnego trenowania nie zarejestrowano ani jednego skoku straty (loss spike).[1]\n\nKimi K2.5 przeszła ciągłe wstępne trenowanie (continual pre-training) od punktu kontrolnego K2 na dodatkowych ~15 bilionach mieszanych tokenów wizualno-tekstowych z jednoczesną optymalizacją modalności (joint pre-training). Odrębnie przeprowadzono samodzielne trenowanie enkodera wizualnego na 1 bilion tokenów oraz dodatkowy etap long-context mid-training w celu rozszerzenia kontekstu.[2]\n\n=== Dostrajanie ===\n\nDostrajanie modeli serii K2 obejmuje kilka etapów:[1][2]\n\nSupervised Fine-Tuning (SFT, nadzorowane dostrajanie):\n* Syntetyczne trajektorie agentowe (agentic data synthesis) — generowanie specyfikacji narzędzi, modelowanie interakcji ze środowiskiem, weryfikacja wyników.\n* Dla K2.5 dodatkowo stosowany jest zero-vision SFT — tekstowy SFT aktywujący zdolności wizualne bez bezpośredniego użycia obrazów na etapie fine-tuning.\n\nReinforcement Learning (RL, uczenie ze wzmocnieniem):\n* Kombinacja weryfikowalnych nagród (Reinforcement Learning with Verifiable Rewards, RLVR) dla zadań matematyki, kodu i bezpieczeństwa.\n* Samoocena według rubryk (self-critique rubric rewards) — używanie oceniających LLM do automatycznej oceny jakości scenariuszy agentowych.\n* Dla K2.5 — wspólne multimodalne RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking i K2.5 obsługują natywną kwantyzację wag INT4 (weight-only quantization, grupa 32, skompresowane tensory), zoptymalizowaną pod architekturę NVIDIA Hopper, co zmniejsza wymagania pamięciowe podczas inferencji.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nDla modelu K2.5 opracowano mechanizm Agent Swarm — framework samozarządzającej się równoległej orkiestracji agentów. Model-orkiestrator dynamicznie tworzy sub-agentów (poprzez operacje create_subagent, assign_task), rozdziela podzadania i zbiera wyniki. Każdy sub-agent może samodzielnie wywoływać narzędzia i pracować równolegle z innymi sub-agentami.[2]\n\nTrenowanie mechanizmu Agent Swarm realizowane jest poprzez Parallel-Agent Reinforcement Learning (PARL) z oddzieleniem wykonania od optymalizacji (decoupling execution/optimization). Według autorów, Agent Swarm zapewnia zmniejszenie opóźnienia (latency) do 4,5× w porównaniu z jednowątkowym trybem agentowym (single-agent).[2]\n\n== Główne modele serii ==\n\n{| class=\"wikitable\"\n! Model !! Typ !! Parametry (całkowite / aktywne) !! Kontekst, tokenów !! Multimodalność !! Data wydania\n|-\n| Kimi k1.5 || LLM, RL-scaling || nieujawnione || 128 000 || Tak (ograniczona) || Styczeń 2025\n|-\n| Kimi-VL || VLM, MoE || kompaktowa / ~2,8 mld aktywnych + 400 mln ViT || długi kontekst || Tak (obrazy) || Kwiecień 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Nie (tekst) || Lipiec 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Nie (tekst) || Listopad 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 biliona / 32 miliardy || 256 000 || Tak (obrazy, wideo, PDF) || Styczeń 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — LLM Mixture-of-Experts z 1,04 biliona całkowitych parametrów i 32 miliardami aktywowanych parametrów na token. Wstępnie trenowany na 15,5 bilionach tokenów z optymalizatorem MuonClip. Architektura obejmuje 384 ekspertów i kompatybilny z długim kontekstem mechanizm MLA. Model jest ukierunkowany na zadania programowania, wnioskowania matematycznego i scenariuszy agentowych z sekwencyjnymi wywołaniami narzędzi.[1]\n\nW raporcie technicznym opisano wieloetapowy potok dostrajania: masową syntezę danych agentowych poprzez modelowanie interakcji z narzędziami; uczenie ze wzmocnieniem w mieszanym środowisku rzeczywistych i syntetycznych zadań; użycie oceniających LLM do automatycznej oceny jakości.[1][14]\n\n=== Kimi K2 Thinking ===\n\nWariant Kimi K2 Thinking zoptymalizowany jest do wieloetapowego wnioskowania (chain-of-thought) z możliwością dynamicznego wywoływania narzędzi i obsługą kontekstu do 256 000 tokenów. Model implementuje odrębny tryb „Thinking" z jawnie zwracanym polem reasoning_content, zawierającym wewnętrzne rozumowania. K2 Thinking obsługuje 200–300 sekwencyjnych wywołań narzędzi w jednym epizodzie agentowym bez istotnej degradacji zachowania, a także natywną kwantyzację INT4 z użyciem QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — otwarty multimodalny MoE-VLM (vision-language model), ukierunkowany na zadania rozumienia wizualnego, wizualno-tekstowego wnioskowania i rzeczywistych scen. Model opisywany jest jako kompaktowa architektura MoE z enkoderem wizualnym MoonViT. Raport techniczny opublikowano na arXiv w kwietniu 2025 roku.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — multimodalny model MoE w skali 1,04 biliona parametrów z 32 miliardami aktywowanych, oparty na punkcie kontrolnym Kimi-K2-Base z kontynuowanym wstępnym trenowaniem na ~15 bilionach mieszanych tokenów wizualno-tekstowych. Model obsługuje wejścia w postaci obrazów, wideo, PDF i tekstu z kontekstem do 256 000 tokenów.[2]\n\nK2.5 obsługuje dwa główne tryby wyjścia:\n* Tryb Thinking — z jawnym reasoning_content i wieloetapową generacją;\n* Tryb Instant — bez wyświetlania rozumowań, z niższym opóźnieniem.[2][13]\n\nModel implementuje natywną kwantyzację wag INT4 (weight-only, grupa 32), zoptymalizowaną pod architekturę NVIDIA Hopper.[2]\n\n== Kluczowe wyniki i benchmarki ==\n\n=== Benchmarki tekstowe i agentowe Kimi K2 ===\n\nWyniki podane są dla Kimi-K2-Instruct w trybie non-thinking (bez rozszerzonego chain-of-thought) według danych z raportu technicznego.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Źródło\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nWedług deklaracji autorów, wyniki te pozycjonują K2 wśród liderów otwartych modeli w trybie bez rozwinięcia thinking, szczególnie w zadaniach inżynierskich i agentowych (według stanu na moment publikacji raportu).[1]\n\n=== Benchmarki Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Źródło\n|-\n| MMVet (dokładność) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nWyniki pokazują, że kompaktowa multimodalna architektura MoE osiąga poziom porównywalny z większymi modelami przy mniejszej liczbie aktywnych parametrów.[9]\n\n=== Benchmarki Kimi K2.5 ===\n\nWyniki podane są w trybie Thinking (temperature = 1,0; top-p = 0,95; kontekst 256 000 tokenów; silnik vLLM; platforma sprzętowa NVIDIA H200) według danych z karty modelu na platformie NVIDIA NIM i raportu technicznego.[2][13]\n\n{| class=\"wikitable\"\n! Kategoria !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (bez narzędzi) || 30,1\n|-\n| HLE-Full (z narzędziami) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nDodatkowo K2.5 demonstruje pozytywny transfer uczenia wizualnego na zadania tekstowe: +1,7% na MMLU-Pro i +2,1% na GPQA-Diamond w porównaniu z tekstowym modelem bazowym K2.[2]\n\nOstateczna ocena porównawcza zależy od wyboru metryk i scenariuszy; wyniki podane są według danych autorów. Niezależna walidacja części benchmarków w momencie publikacji jest ograniczona.[2][15]\n\n== Zastosowania ==\n\n=== Asystent tekstowy i wyszukiwanie ===\n\nPlatforma Kimi używana jest jako asystent z obsługą przetwarzania długich dokumentów (raporty badawcze, dane finansowe), automatycznej analizy i wyszukiwania online z agregowaniem informacji. Moonshot AI podaje, że Kimi obsługuje ponad 300 wywołań narzędzi (tool calls) w ramach jednego scenariusza agentowego.[7][4]\n\n=== Programowanie i zadania inżynierskie ===\n\nKimi K2 i K2.5 demonstrują wysokie wyniki na SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench i innych benchmarkach programowania. Modele stosowane są do automatyzacji naprawy błędów w repozytoriach, generowania i refaktoryzacji kodu, rozwiązywania zadań w systemach oceny online (OJBench, LiveCodeBench). Raport techniczny K2 wskazuje, że model był trenowany na masowym syntetycznym korpusie agentowym, obejmującym interakcje z systemami kontroli wersji, menedżerami pakietów i środowiskami wykonawczymi.[1][2][14]\n\n=== Zastosowania multimodalne ===\n\nKimi-VL i K2.5 przeznaczone są do wizualnego pytania i odpowiedzi (VQA) na obrazach i dokumentach; rozumienia dokumentów (OCRBench, OmniDocBench); analizy wideo (VideoMMMU, LongVideoBench); złożonych zadań programowania według specyfikacji wizualnych (np. generowanie interfejsu na podstawie makiety graficznej). Dla K2.5 opisano scenariusze „vision-grounded coding" i „autonomous visual debugging", w których model generuje kod na podstawie opisu wizualnego i iteracyjnie analizuje wizualny wynik.[2][9][15]\n\n=== API i wdrożenie ===\n\nModele dostępne są przez API platformy Moonshot AI Open Platform z obsługą tool calling, trybu thinking, trybu JSON i buforowania kontekstu. Otwarte wagi wykorzystywane są do lokalnego wdrażania przez vLLM, SGLang i TensorRT-LLM. Usługa Mooncake zapewnia skalowanie inferencji dla długiego kontekstu.[4][11][16]\n\n== Ograniczenia i otwarte problemy ==\n\n=== Wymagania zasobowe ===\n\nModele MoE w skali 1 biliona parametrów, nawet przy aktywowanych 32 miliardach parametrów i kwantyzacji INT4, wymagają znacznych zasobów pamięciowych i przepustowości. W dyskusjach inżynierskich dotyczących wdrożenia Kimi K2.5 wspominane są szacunki rzędu setek gigabajtów pamięci karty graficznej dla pełnego załadowania modelu; konkretne liczby zależą od schematu kwantyzacji i frameworka (vLLM, SGLang itp.).[2][17]\n\n=== Halucynacje i jakość generacji ===\n\nPodobnie jak inne LLM, modele serii Kimi podatne są na halucynacje. W raportach z testów FACTS Grounding i FaithJudge odnotowano wskaźniki hallucination rate w przedziale 1,1–7,4% w scenariuszach RAG. W trybie non-thinking model może generować nadmiarowe tokeny przy nieprecyzyjnych specyfikacjach narzędzi; przy wymuszonym użyciu narzędzi (tool-use) wydajność spada w niektórych zadaniach.[1]\n\n=== Zależność od danych syntetycznych i potoku RL ===\n\nPotok syntezy danych agentowych i uczenia ze wzmocnieniem opiera się na dużej kolekcji syntetycznych narzędzi i scen oraz oceniających LLM do automatycznej oceny (self-judging). Taki schemat rodzi otwarte pytania: odporność na odchylenie (bias) samooceny; potencjalna degradacja przy wielokrotnej iteracji (bootstrap); przenoszalność umiejętności agentowych na rzeczywiste środowiska różniące się od symulowanych; wpływ rozkładu zadań syntetycznych na zdolność uogólniania.[1][14]\n\n=== Przejrzystość i odtwarzalność ===\n\nCzęść informacji o składzie danych treningowych, procesie filtrowania, rozkładzie języków i dziedzin nie jest ujawniana lub ujawniana jest w ograniczonym zakresie. Utrudnia to dokładną ocenę źródeł odchylenia, odtwarzalność trenowania i niezależną walidację wpływu poszczególnych komponentów (MuonClip, QK-clip) na stabilność. Według stanu na luty 2026 roku pełne odtworzenie trenowania Kimi K2 i K2.5 przez strony trzecie nie zostało odnotowane w otwartej literaturze.[1][2]\n\n== Aspekty etyczne i regulacyjne ==\n\nW kartach modeli i raportach technicznych podkreśla się, że deweloperzy ponoszą odpowiedzialność za dane wejściowe i wyjściowe modelu; wymagane jest dodanie mechanizmów ochronnych (guardrails) i testowanie na danych konkretnego przypadku przed wdrożeniem; model może przetwarzać obrazy i wideo potencjalnie zawierające dane osobowe, a integrator zobowiązany jest przestrzegać odpowiednich przepisów prawa.[2][16]\n\nW raportach technicznych opisano oceny bezpieczeństwa (zagrożenia biologiczne, chemiczne, cybernetyczne) z użyciem narzędzi takich jak Promptfoo. Modele przechodzą wyrównanie RL (alignment) z weryfikowalnymi nagrodami i samooceną.[1]\n\nJako produkt chińskiej firmy, modele podlegają krajowemu regulowaniu ChRL w zakresie AI. Na moment pisania niniejszego artykułu nie odnaleziono odrębnych publicznych dokumentów regulacyjnych poświęconych wyłącznie modelom Kimi; regulacja odbywa się w ramach ogólnych podejść do modeli generatywnych i AI w odpowiednich jurysdykcjach.[18]\n\nW lutym 2026 roku firma Anthropic oświadczyła, że Moonshot AI (obok innych chińskich deweloperów) używała fałszywych kont do generowania interakcji z Claude w celu destylacji danych do trenowania modeli. Informacja ma charakter twierdzenia jednej strony i nie jest potwierdzona niezależnymi dochodzeniami na moment publikacji; Moonshot AI nie opublikowała oficjalnej odpowiedzi.[5]\n\n== Perspektywy i kierunki badań ==\n\nNa podstawie opublikowanych materiałów można wyróżnić kilka kierunków dalszych badań:\n\n* Skalowalne systemy agentowe. Rozwój podejść do trenowania LLM jako systemów agentowych z użyciem syntetycznego zestawu narzędzi, RL i self-judging. Rozszerzenie Agent Swarm na większą liczbę sub-agentów i nowe typy zadań.[2][1]\n* Wydajne architektury MoE. Użycie 1 biliona parametrów z 32 miliardami aktywowanych i 384 ekspertów stanowi jeden z wariantów kompromisu między skalą a wydajnością; badane są alternatywy z różnymi schematami routingu.[1]\n* Natywna multimodalność. Trenowanie K2.5 na mieszanych danych wizualno-tekstowych od początku wstępnego trenowania stanowi podejście do „natywnej" multimodalności, które porównywane jest z schematami dwuetapowymi.[2][9]\n* Wydajna inferencja i długi kontekst. Kwantyzacja INT4 i obsługa kontekstu 256 000 tokenów stymulują dalsze badania w dziedzinie rzadkiej uwagi (sparse attention), reprezentacji ukrytych i pamięci zewnętrznej. Osobno opisano projekt Kimi Linear — hybrydową liniową uwagę ze zmniejszeniem KV-cache o 75% i 6-krotnym przyspieszeniem dekodowania przy kontekście 1 miliona tokenów.[2][19]\n\nW oficjalnych materiałach Moonshot AI nie są publikowane szczegółowe mapy drogowe dotyczące przyszłych wersji Kimi; wymienione kierunki oparte są na opublikowanych badaniach.\n\n== Zobacz też ==\n* Architektura Transformer\n* DeepSeek\n* Qwen\n\n== Odnośniki ==\n* https://www.moonshot.ai/ — oficjalna strona Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — repozytorium GitHub Kimi K2.5\n* https://huggingface.co/moonshotai — profil Moonshot AI na Hugging Face\n\n== Literatura ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Przypisy ==\n\n\n\nTemplate:SEOMeta\n
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692