Kimi (Moonshot AI) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (серия от модели на Moonshot AI) — серия от големи езикови модели (Large Language Model, LLM), разработвани от китайската компания Moonshot AI (Пекин, КНР) за задачи по текстова и мултимодална генерация, програмиране и агентни системи (agentic systems — системи, способни на автономно планиране, разсъждение и действие с използване на външни инструменти). Семейството включва текстови и мултимодални модели с архитектура Mixture-of-Experts (MoE, смес от експерти) от мащаб от порядъка на 1 трлн параметри и активиран поднабор от порядъка на 32 млрд параметри на token.[1][2] Важна особеност на серията е ориентацията към агентно поведение (многостъпково планиране с извикване на външни инструменти) и поддръжка на дълъг контекст до 256 000 токена във версиите Kimi K2 и Kimi K2.5.[1][2]\n\nМоделите от серията Kimi се разпространяват както с отворени тегла (open-weight) на платформата Hugging Face под модифициран MIT лиценз, така и чрез проприетарен API на платформата Moonshot AI Open Platform.[3][4]\n\n== История и предпоставки ==\n\n=== Основаване на Moonshot AI ===\n\nMoonshot AI е основана през март 2023 година в Пекин от Ян Джилин (Yang Zhilin, CEO), Джоу Синюй (Zhou Xinyu) и У Юйсин (Wu Yuxin) — възпитаници на Университета Цинхуа (Tsinghua University). Ян Джилин преди това е работил в Google Brain и Meta, участвал е в изследвания в областта на компютърното зрение и разсъждението. Компанията получи финансиране от Alibaba (рунд в обем от $1 млрд, февруари 2024), Tencent и други инвеститори.[5][6]\n\n=== Хронология на ключовите издания ===\n\n* Октомври–ноември 2023 — стартиране на чатбота Kimi с поддръжка на контекст до 128 хил. токена (до 200 хил. китайски йероглифа). Първите версии използваха проприетарни модели с ограничено разкрити технически детайли.[6][7]\n* Март 2024 — разширяване на контекста до 2 млн йероглифа в бета версията.[6]\n* Януари 2025 — издаване на Kimi k1.5 — мултимодален модел с мащабирано обучение с подкрепление (Reinforcement Learning, RL), обявен като сравним по производителност с OpenAI o1 в задачи по математика, програмиране и мултимодално разсъждение. Контекст до 128 хил. токена.[8]\n* Април 2025 — представен Kimi-VL — отворен мултимодален MoE модел (vision-language model, VLM) с визуален енкодер MoonViT (~400 млн параметри) и ~2,8 млрд активни параметри в декодера. Техническият доклад е публикуван на arXiv.[9]\n* Юли 2025 — издаване на Kimi K2 — основния отворен MoE модел с 1 трлн параметри и 32 млрд активни параметри. Техническият доклад е публикуван на arXiv.[1] Моделът заемаше първо място сред отворените модели на LMSYS Chatbot Arena към момента на издаването (над 3000 гласа).[1]\n* Септември 2025 — актуализация Kimi-K2-Instruct-0905 с разширен контекст до 256 хил. токена и подобрено агентно кодиране.[1]\n* Ноември 2025 — издаване на Kimi K2 Thinking — версия с усилено стъпково разсъждение (chain-of-thought) и поддръжка на 200–300 последователни извиквания на инструменти (tool calls).[10]\n* Януари 2026 — представен Kimi K2.5 — мултимодален MoE модел с нативна мултимодалност и механизъм Agent Swarm (паралелна оркестрация на суб-агенти).[2]\n\nПаралелно с разработката на моделите през 2024 година беше представена собствена услуга за инференс Mooncake — KVCache-центрична дезагрегирана архитектура за обслужване на LLM с дълъг контекст.[11]\n\n== Теоретични основи и архитектура ==\n\n=== Архитектура Mixture-of-Experts ===\n\nМоделите от серията Kimi K2 и K2.5 реализират архитектура Transformer с Mixture-of-Experts в отделни слоеве. Стандартният блок на трансформера представлява композиция от слоеве на многоглаво самовнимание (Multi-Head Attention, MHA) и позиционно-wise MLP (многослоен персептрон) с резидуални връзки:[1][12]\n\n𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,\n\nкъдето 𝐇L×d — входните токенови представяния, L — дължина на последователността, d — размер на скритото състояние.\n\nВ MoE слоя вместо един MLP се използва набор от експерти {Ei}i=1N, всеки от които представлява отделен MLP с параметри θi. Маршрутизаторът (gating network) за всеки токен избира подмножество от експерти. Изходът на MoE слоя за токен с представяне 𝐡 се задава като:[1]\n\nMoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),\n\nкъдето 𝒮(𝐡){1,,N} — множеството от избраните експерти за дадения токен, gi(𝐡) — нормализираните тегла на маршрутизатора, i𝒮gi=1. Функцията на маршрутизация избира експертите чрез операция TopK:[1]\n\ng(𝐡)=TopK(Softmax(𝐡Wg)),\n\nкъдето Wg — обучаема матрица на маршрутизатора. Такава схема позволява мащабиране на общия брой параметри при ограничен брой параметри, активирани за всеки токен.\n\n=== Архитектурни хиперпараметри на Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Параметър !! Стойност\n|-\n| Тип архитектура || Transformer с Mixture-of-Experts\n|-\n| Общ брой параметри || 1,04 трлн\n|-\n| Активирани параметри на токен || 32 млрд\n|-\n| Брой слоеве || 61 (1 плътен + 60 MoE)\n|-\n| Размер на скритото състояние || 7168\n|-\n| Брой глави на вниманието || 64\n|-\n| Брой експерти || 384 (8 избирани на токен + 1 общ)\n|-\n| Размер на скритото състояние на експерта (MoE hidden size) || 2048\n|-\n| Размер на речника || 160 000 токена\n|-\n| Активационна функция || SwiGLU\n|-\n| Механизъм на внимание || Multi-head Latent Attention (MLA)\n|-\n| Максимален контекст || 256 000 токена (разширение чрез YaRN)\n|-\n| Визуален енкодер (K2.5) || MoonViT-3D, ~400 млн параметри\n|}\n[1][2][13]\n\nСпарсността (отношението на общия брой експерти към активирания) е 48:1 (384 експерти, 8 активни), което осигурява значително намаляване на изчислителните разходи спрямо плътен (dense) модел от същия мащаб.[1]\n\n=== Механизъм Multi-head Latent Attention (MLA) ===\n\nВ моделите от серията Kimi K2/K2.5 се използва механизъм Multi-head Latent Attention (MLA) — модификация на стандартното многоглаво внимание, насочена към повишаване на ефективността и мащабируемостта. Стандартното внимание за един слой се изчислява като:[12]\n\nAttention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,\n\nкъдето 𝐐,𝐊,𝐕L×dk — матриците на заявките, ключовете и стойностите. В MLA се въвеждат латентни представяния, върху които се проектират заявките и ключовете, което намалява размерността на междинните операции и позволява да се намали обемът на KV кеша. Подходът е аналогичен на механизма, използван в DeepSeek-V3.[1][13]\n\n=== Оптимизатор MuonClip и QK-clip ===\n\nЗа обучението на модела Kimi K2 е предложен оптимизатор MuonClip — модификация на оптимизатора Muon (моментен оптимизатор с нормализация Newton-Schulz) с добавяне на техниката QK-clip за стабилизиране на обучението на големи езикови модели с MoE архитектура.[1]\n\nQK-clip прилага ограничения върху логитите на вниманието 𝐐𝐊 чрез операция на изрязване (clipping). За всяка глава на вниманието h се определя максималният логит:\n\nShmax=1dmaxi,j(Qhi(Khj)),\n\nи се изчислява коефициент на мащабиране:\n\nγh=min(1,τShmax),\n\nкъдето τ=100 — хиперпараметър-праг, d — размер на главата на вниманието. Коефициентът γh се прилага за мащабиране на теглата Wq,Wk, ако максималният логит надвишава прага. Това ограничава диапазона на стойностите на логитите преди softmax и намалява риска от резки скокове на загубата (loss spikes) при обучение в голям мащаб.[1]\n\nСпоред данните на авторите, предобучението на Kimi K2 върху 15,5 трлн токена с MuonClip е преминало без нито един регистриран скок на функцията на загубата (zero loss spikes).[1]\n\n=== Мултимодалност и MoonViT ===\n\nМоделите Kimi K2.5 и Kimi-VL използват визуален енкодер MoonViT (във версията K2.5 — MoonViT-3D) с приблизително 400 млн параметри, изграден на базата на SigLIP-SO-400M с NaViT-пакинг (поддръжка на променлива разделителна способност на входните изображения) и 3D разширение за обработка на видео (групиране по 4 кадъра).[2][9]\n\nВизуалният енкодер преобразува входните изображения и видеа в последователност от визуални токени. Нека 𝐗H×W×3 — входното изображение, Φvis — визуалният енкодер:\n\n𝐙vis=Φvis(𝐗)Lv×dv,\n\nпо-нататък чрез линейна проекция (двуслоен MLP) 𝐏dv×d:\n\n𝐇vis=𝐙vis𝐏,\n\nкъдето d — размер на скритото пространство на езиковата част на модела. В мултимодален режим 𝐇vis се конкатенира с текстовите токени и се подава в трансформера.[9][2]\n\nЗа разлика от двуетапните схеми (добавяне на визуален адаптер върху текстовия модел), K2.5 е обучен върху смесени визуално-текстови данни от началото на предобучението (joint text-vision pre-training), с ниска дялова тежест на визуалните токени (~10 %) в ранните етапи и постепенното ѝ увеличаване. Общият обем е приблизително 15 трлн смесени визуално-текстови токени.[2]\n\n== Предобучение и постобучение ==\n\n=== Предобучение ===\n\nKimi K2 е предобучен върху 15,5 трлн токена (уеб текстове, код, математика, енциклопедични знания) с използване на оптимизатора MuonClip. Нито един скок на загубата (loss spike) не е регистриран за целия период на предобучението.[1]\n\nKimi K2.5 е преминал непрекъснато предобучение (continual pre-training) от контролната точка на K2 върху допълнителни ~15 трлн смесени визуално-текстови токени със съвместна оптимизация на модалностите (joint pre-training). Отделно е проведено 1 трлн токена standalone обучение на визуалния енкодер и допълнителен етап long-context mid-training за разширяване на контекста.[2]\n\n=== Постобучение ===\n\nПостобучението на моделите от серията K2 включва няколко стадия:[1][2]\n\nSupervised Fine-Tuning (SFT, контролирано фино настройване):\n* Синтетични агентни траектории (agentic data synthesis) — генериране на спецификации на инструменти, моделиране на взаимодействия с обкръжението, верификация на резултатите.\n* За K2.5 допълнително се прилага zero-vision SFT — текстов SFT, активиращ визуалните способности без непосредствено използване на изображения на етапа на fine-tuning.\n\nReinforcement Learning (RL, обучение с подкрепление):\n* Комбинация от верифицируеми награди (Reinforcement Learning with Verifiable Rewards, RLVR) за задачи по математика, код и безопасност.\n* Самооценка по рубрики (self-critique rubric rewards) — използване на LLM оценители за автоматична оценка на качеството на агентните сценарии.\n* За K2.5 — съвместно мултимодално RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking и K2.5 поддържат нативна INT4 квантовка на теглата (weight-only quantization, група 32, компресирани тензори), оптимизирана за архитектурата NVIDIA Hopper, което намалява изискванията към паметта при извод.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nЗа модела K2.5 е разработен механизъм Agent Swarm — фреймуърк за самоуправлявана паралелна оркестрация на агенти. Моделът-оркестратор динамично създава суб-агенти (чрез операции create_subagent, assign_task), разпределя подзадачи и събира резултатите. Всеки суб-агент може самостоятелно да извиква инструменти и да работи паралелно с другите суб-агенти.[2]\n\nОбучението на механизма Agent Swarm е реализирано чрез Parallel-Agent Reinforcement Learning (PARL) с разделяне на изпълнението и оптимизацията (decoupling execution/optimization). Според данните на авторите, Agent Swarm осигурява намаляване на закъснението (latency) до 4,5 пъти в сравнение с еднопоточния агентен режим (single-agent).[2]\n\n== Основни модели от серията ==\n\n{| class=\"wikitable\"\n! Модел !! Тип !! Параметри (общи / активни) !! Контекст, токени !! Мултимодалност !! Дата на издаване\n|-\n| Kimi k1.5 || LLM, RL-scaling || не е разкрито || 128 000 || Да (ограничена) || Януари 2025\n|-\n| Kimi-VL || VLM, MoE || компактна / ~2,8 млрд активни + 400 млн ViT || дълъг контекст || Да (изображения) || Април 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Не (текст) || Юли 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Не (текст) || Ноември 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Да (изображения, видео, PDF) || Януари 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — Mixture-of-Experts LLM с 1,04 трлн общи параметри и 32 млрд активирани параметри на токен. Предобучен върху 15,5 трлн токена с оптимизатора MuonClip. Архитектурата включва 384 експерта и съвместим с дълъг контекст механизъм MLA. Моделът е ориентиран към задачи по програмиране, математическо разсъждение и агентни сценарии с последователни извиквания на инструменти.[1]\n\nВ техническия доклад е описан многостадиен pipeline на постобучение: мащабен синтез на агентни данни чрез моделиране на взаимодействия с инструменти; обучение с подкрепление в смесена среда от реални и синтетични задачи; използване на LLM оценители за автоматична оценка на качеството.[1][14]\n\n=== Kimi K2 Thinking ===\n\nВариантът Kimi K2 Thinking е оптимизиран за многостъпково разсъждение (chain-of-thought) с възможност за динамично извикване на инструменти и поддръжка на контекст до 256 000 токена. Моделът реализира отделен режим „Thinking" с явно връщано поле reasoning_content, съдържащо вътрешните разсъждения. K2 Thinking поддържа 200–300 последователни извиквания на инструменти в един агентен епизод без съществена деградация на поведението, както и нативна INT4 квантовка с използване на QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — отворен мултимодален MoE VLM (vision-language model), ориентиран към задачи по визуално разбиране, визуално-текстово разсъждение и реални сцени. Моделът е описан като компактна MoE архитектура с визуален енкодер MoonViT. Техническият доклад е публикуван на arXiv през април 2025 година.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — мултимодален MoE модел от мащаб 1,04 трлн параметри с 32 млрд активирани, основан на контролната точка Kimi-K2-Base с продължено предобучение върху ~15 трлн смесени визуално-текстови токени. Моделът поддържа входове от изображения, видео, PDF и текст с контекст до 256 000 токена.[2]\n\nK2.5 поддържа два основни режима на извод:\n* Thinking mode — с явен reasoning_content и многостъпкова генерация;\n* Instant mode — без извод на разсъждения, с по-ниско закъснение.[2][13]\n\nМоделът реализира нативна INT4 квантовка на теглата (weight-only, група 32), оптимизирана за архитектурата NVIDIA Hopper.[2]\n\n== Ключови резултати и benchmark-ове ==\n\n=== Текстови и агентни benchmark-ове на Kimi K2 ===\n\nРезултатите са посочени за Kimi-K2-Instruct в режим non-thinking (без разширен chain-of-thought) според данните на техническия доклад.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Източник\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nСпоред заявлението на авторите, тези резултати позиционират K2 сред лидерите на отворените модели в режим без thinking разгъване, особено при инженерни и агентни задачи (към момента на публикуване на доклада).[1]\n\n=== Benchmark-ове на Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Източник\n|-\n| MMVet (точност) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nРезултатите демонстрират, че компактната мултимодална MoE архитектура достига ниво, сравнимо с по-големи модели при по-малък брой активни параметри.[9]\n\n=== Benchmark-ове на Kimi K2.5 ===\n\nРезултатите са посочени в режим Thinking (temperature = 1,0; top-p = 0,95; контекст 256 000 токена; движок vLLM; хардуерна платформа NVIDIA H200) според данните на модалната карта на платформата NVIDIA NIM и техническия доклад.[2][13]\n\n{| class=\"wikitable\"\n! Категория !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (без инструменти) || 30,1\n|-\n| HLE-Full (с инструменти) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nДопълнително K2.5 демонстрира положителен трансфер на визуалното обучение върху текстови задачи: +1,7 % на MMLU-Pro и +2,1 % на GPQA-Diamond в сравнение с текстовия базов модел K2.[2]\n\nОкончателната сравнителна оценка зависи от избора на метрики и сценарии; резултатите са посочени по данни на авторите. Независимата валидация на част от benchmark-овете към момента на публикуване е ограничена.[2][15]\n\n== Приложение ==\n\n=== Текстов асистент и търсене ===\n\nПлатформата Kimi се използва като асистент с поддръжка на обработка на дълги документи (изследователски доклади, финансови данни), автоматизиран анализ и онлайн търсене с агрегиране на информация. Moonshot AI посочва, че Kimi поддържа над 300 извиквания на инструменти (tool calls) в рамките на един агентен сценарий.[7][4]\n\n=== Програмиране и инженерни задачи ===\n\nKimi K2 и K2.5 демонстрират високи резултати на SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench и други benchmark-ове по програмиране. Моделите се прилагат за автоматизиране на поправяне на грешки в хранилища, генериране и рефакторинг на код, решаване на задачи на онлайн съдии (OJBench, LiveCodeBench). Техническият доклад на K2 посочва, че моделът е обучен върху мащабен синтетичен агентен корпус, включително взаимодействия със системи за управление на версии, пакетни мениджъри и среди за изпълнение.[1][2][14]\n\n=== Мултимодални приложения ===\n\nKimi-VL и K2.5 са предназначени за визуален въпрос-отговор (VQA) върху изображения и документи; разбиране на документи (OCRBench, OmniDocBench); анализ на видео (VideoMMMU, LongVideoBench); комбинирани задачи по програмиране по визуални спецификации (например генериране на интерфейс по макет на изображение). За K2.5 са описани сценарии „vision-grounded coding" и „autonomous visual debugging", при които моделът генерира код по визуално описание и итеративно анализира визуалния резултат.[2][9][15]\n\n=== API и разгръщане ===\n\nМоделите са достъпни чрез API на платформата Moonshot AI Open Platform с поддръжка на tool calling, thinking режим, JSON режим и кеширане на контекста. Отворените тегла се използват за локално разгръщане чрез vLLM, SGLang и TensorRT-LLM. Услугата Mooncake осигурява мащабиране на инференса за дълъг контекст.[4][11][16]\n\n== Ограничения и открити проблеми ==\n\n=== Изисквания към ресурсите ===\n\nMoE модели от мащаб 1 трлн параметри, дори при активирани 32 млрд параметри и INT4 квантовка, изискват значителни ресурси на паметта и пропускателна способност. В инженерните дискусии за разгръщането на Kimi K2.5 се споменават оценки от порядъка на стотици гигабайта видеопамет за пълно зареждане на модела; конкретните числа зависят от схемата на квантовка и фреймуърка (vLLM, SGLang и др.).[2][17]\n\n=== Халюцинации и качество на генерацията ===\n\nКакто и другите LLM, моделите от серията Kimi са податливи на халюцинации. В докладите по тестовете FACTS Grounding и FaithJudge са регистрирани показатели hallucination rate в рамките на 1,1–7,4 % в RAG сценарии. В non-thinking режим моделът може да генерира излишни токени при неясни спецификации на инструментите; при принудително активиране на tool-use производителността спада при някои задачи.[1]\n\n=== Зависимост от синтетични данни и RL pipeline ===\n\nPipeline-ът за синтез на агентни данни и обучение с подкрепление разчита на голяма колекция от синтетични инструменти и сцени, както и на LLM оценители за автоматична оценка (self-judging). Такава схема поражда открити въпроси: устойчивост към отклонение (bias) при самооценката; потенциална деградация при многократна итерация (bootstrap); преносимост на агентните умения към реални среди, различаващи се от симулираните; влияние на разпределението на синтетичните задачи върху обобщаващата способност.[1][14]\n\n=== Прозрачност и възпроизводимост ===\n\nЧаст от информацията за състава на обучаващите данни, процеса на филтриране, разпределението на езиците и домейните не се разкрива или се разкрива ограничено. Това затруднява точната оценка на източниците на отклонение, възпроизводимостта на обучението и независимата валидация на влиянието на отделните компоненти (MuonClip, QK-clip) върху стабилността. Към февруари 2026 година пълното възпроизвеждане на обучението на Kimi K2 и K2.5 от трети страни не е регистрирано в открытата литература.[1][2]\n\n== Етични и регулаторни аспекти ==\n\nВ модалните карти и техническите доклади се подчертава, че разработчиците носят отговорност за входовете и изходите на модела; изисква се добавяне на защитни механизми (guardrails) и тестване върху данни от конкретния случай преди внедряване; моделът може да обработва изображения и видео, потенциално съдържащи лични данни, и интеграторът е длъжен да спазва съответното законодателство.[2][16]\n\nВ техническите доклади са описани оценки на безопасността (биологични, химични, киберрискове) с използване на инструменти от типа Promptfoo. Моделите преминават RL изравняване (alignment) с верифицируеми награди и самооценка.[1]\n\nКато продукт на китайска компания, моделите са подчинени на националното регулиране на КНР в областта на ИИ. Към момента на написването не са открити отделни публични регулаторни документи, посветени изключително на моделите Kimi; регулирането се осъществява в рамките на общите подходи към генеративните модели и ИИ в съответните юрисдикции.[18]\n\nПрез февруари 2026 година компанията Anthropic заяви, че Moonshot AI (заедно с други китайски разработчици) е използвала фалшиви акаунти за генериране на взаимодействия с Claude с цел дистилация на данни за обучение на модели. Информацията е от характер на твърдение на една страна и не е потвърдена от независими разследвания към момента на публикуването; Moonshot AI не е публикувала официален отговор.[5]\n\n== Перспективи и направления на изследванията ==\n\nВъз основа на публикуваните материали могат да се откроят няколко направления за по-нататъшни изследвания:\n\n* Мащабируеми агентни системи. Развитие на подходите за обучение на LLM като агентни системи с използване на синтетичен инструментариум, RL и self-judging. Разширяване на Agent Swarm към по-голям брой суб-агенти и нови типове задачи.[2][1]\n* Ефективни MoE архитектури. Използването на 1 трлн параметри с 32 млрд активирани и 384 експерта представлява един от вариантите на компромис между мащаб и ефективност; изследват се алтернативи с различни схеми на маршрутизация.[1]\n* Нативна мултимодалност. Обучението на K2.5 върху смесени визуално-текстови данни от началото на предобучението представлява подход към „нативна" мултимодалност, който се сравнява с двуетапните схеми.[2][9]\n* Ефективен инференс и дълъг контекст. INT4 квантовката и поддръжката на контекст от 256 000 токена стимулират по-нататъшни изследвания в областта на разредено внимание, латентни представяния и външна памет. Отделно е описан проектът Kimi Linear — хибридно линейно внимание с намаляване на KV кеша с 75 % и ускоряване на декодирането 6 пъти при контекст от 1 млн токена.[2][19]\n\nВ официалните материали на Moonshot AI не се публикуват детайлни пътни карти за бъдещите версии на Kimi; изброените направления се основават на публикуваните изследвания.\n\n== Вж. също ==\n* Архитектура Transformer\n* DeepSeek\n* Qwen\n\n== Препратки ==\n* https://www.moonshot.ai/ — официален сайт на Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — GitHub хранилище на Kimi K2.5\n* https://huggingface.co/moonshotai — профил на Moonshot AI в Hugging Face\n\n== Литература ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Бележки ==\n\n\n\nTemplate:SEOMeta\n

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692