Kimi (Moonshot AI) (BG)
Kimi (серия от модели на Moonshot AI) — серия от големи езикови модели (Large Language Model, LLM), разработвани от китайската компания Moonshot AI (Пекин, КНР) за задачи по текстова и мултимодална генерация, програмиране и агентни системи (agentic systems — системи, способни на автономно планиране, разсъждение и действие с използване на външни инструменти). Семейството включва текстови и мултимодални модели с архитектура Mixture-of-Experts (MoE, смес от експерти) от мащаб от порядъка на 1 трлн параметри и активиран поднабор от порядъка на 32 млрд параметри на token.[1][2] Важна особеност на серията е ориентацията към агентно поведение (многостъпково планиране с извикване на външни инструменти) и поддръжка на дълъг контекст до 256 000 токена във версиите Kimi K2 и Kimi K2.5.[1][2]\n\nМоделите от серията Kimi се разпространяват както с отворени тегла (open-weight) на платформата Hugging Face под модифициран MIT лиценз, така и чрез проприетарен API на платформата Moonshot AI Open Platform.[3][4]\n\n== История и предпоставки ==\n\n=== Основаване на Moonshot AI ===\n\nMoonshot AI е основана през март 2023 година в Пекин от Ян Джилин (Yang Zhilin, CEO), Джоу Синюй (Zhou Xinyu) и У Юйсин (Wu Yuxin) — възпитаници на Университета Цинхуа (Tsinghua University). Ян Джилин преди това е работил в Google Brain и Meta, участвал е в изследвания в областта на компютърното зрение и разсъждението. Компанията получи финансиране от Alibaba (рунд в обем от $1 млрд, февруари 2024), Tencent и други инвеститори.[5][6]\n\n=== Хронология на ключовите издания ===\n\n* Октомври–ноември 2023 — стартиране на чатбота Kimi с поддръжка на контекст до 128 хил. токена (до 200 хил. китайски йероглифа). Първите версии използваха проприетарни модели с ограничено разкрити технически детайли.[6][7]\n* Март 2024 — разширяване на контекста до 2 млн йероглифа в бета версията.[6]\n* Януари 2025 — издаване на Kimi k1.5 — мултимодален модел с мащабирано обучение с подкрепление (Reinforcement Learning, RL), обявен като сравним по производителност с OpenAI o1 в задачи по математика, програмиране и мултимодално разсъждение. Контекст до 128 хил. токена.[8]\n* Април 2025 — представен Kimi-VL — отворен мултимодален MoE модел (vision-language model, VLM) с визуален енкодер MoonViT (~400 млн параметри) и ~2,8 млрд активни параметри в декодера. Техническият доклад е публикуван на arXiv.[9]\n* Юли 2025 — издаване на Kimi K2 — основния отворен MoE модел с 1 трлн параметри и 32 млрд активни параметри. Техническият доклад е публикуван на arXiv.[1] Моделът заемаше първо място сред отворените модели на LMSYS Chatbot Arena към момента на издаването (над 3000 гласа).[1]\n* Септември 2025 — актуализация Kimi-K2-Instruct-0905 с разширен контекст до 256 хил. токена и подобрено агентно кодиране.[1]\n* Ноември 2025 — издаване на Kimi K2 Thinking — версия с усилено стъпково разсъждение (chain-of-thought) и поддръжка на 200–300 последователни извиквания на инструменти (tool calls).[10]\n* Януари 2026 — представен Kimi K2.5 — мултимодален MoE модел с нативна мултимодалност и механизъм Agent Swarm (паралелна оркестрация на суб-агенти).[2]\n\nПаралелно с разработката на моделите през 2024 година беше представена собствена услуга за инференс Mooncake — KVCache-центрична дезагрегирана архитектура за обслужване на LLM с дълъг контекст.[11]\n\n== Теоретични основи и архитектура ==\n\n=== Архитектура Mixture-of-Experts ===\n\nМоделите от серията Kimi K2 и K2.5 реализират архитектура Transformer с Mixture-of-Experts в отделни слоеве. Стандартният блок на трансформера представлява композиция от слоеве на многоглаво самовнимание (Multi-Head Attention, MHA) и позиционно-wise MLP (многослоен персептрон) с резидуални връзки:[1][12]\n\n\n\nкъдето — входните токенови представяния, — дължина на последователността, — размер на скритото състояние.\n\nВ MoE слоя вместо един MLP се използва набор от експерти , всеки от които представлява отделен MLP с параметри . Маршрутизаторът (gating network) за всеки токен избира подмножество от експерти. Изходът на MoE слоя за токен с представяне се задава като:[1]\n\n\n\nкъдето — множеството от избраните експерти за дадения токен, — нормализираните тегла на маршрутизатора, . Функцията на маршрутизация избира експертите чрез операция TopK:[1]\n\n\n\nкъдето — обучаема матрица на маршрутизатора. Такава схема позволява мащабиране на общия брой параметри при ограничен брой параметри, активирани за всеки токен.\n\n=== Архитектурни хиперпараметри на Kimi K2 / K2.5 ===\n\n{| class=\"wikitable\"\n! Параметър !! Стойност\n|-\n| Тип архитектура || Transformer с Mixture-of-Experts\n|-\n| Общ брой параметри || 1,04 трлн\n|-\n| Активирани параметри на токен || 32 млрд\n|-\n| Брой слоеве || 61 (1 плътен + 60 MoE)\n|-\n| Размер на скритото състояние || 7168\n|-\n| Брой глави на вниманието || 64\n|-\n| Брой експерти || 384 (8 избирани на токен + 1 общ)\n|-\n| Размер на скритото състояние на експерта (MoE hidden size) || 2048\n|-\n| Размер на речника || 160 000 токена\n|-\n| Активационна функция || SwiGLU\n|-\n| Механизъм на внимание || Multi-head Latent Attention (MLA)\n|-\n| Максимален контекст || 256 000 токена (разширение чрез YaRN)\n|-\n| Визуален енкодер (K2.5) || MoonViT-3D, ~400 млн параметри\n|}\n[1][2][13]\n\nСпарсността (отношението на общия брой експерти към активирания) е 48:1 (384 експерти, 8 активни), което осигурява значително намаляване на изчислителните разходи спрямо плътен (dense) модел от същия мащаб.[1]\n\n=== Механизъм Multi-head Latent Attention (MLA) ===\n\nВ моделите от серията Kimi K2/K2.5 се използва механизъм Multi-head Latent Attention (MLA) — модификация на стандартното многоглаво внимание, насочена към повишаване на ефективността и мащабируемостта. Стандартното внимание за един слой се изчислява като:[12]\n\n\n\nкъдето — матриците на заявките, ключовете и стойностите. В MLA се въвеждат латентни представяния, върху които се проектират заявките и ключовете, което намалява размерността на междинните операции и позволява да се намали обемът на KV кеша. Подходът е аналогичен на механизма, използван в DeepSeek-V3.[1][13]\n\n=== Оптимизатор MuonClip и QK-clip ===\n\nЗа обучението на модела Kimi K2 е предложен оптимизатор MuonClip — модификация на оптимизатора Muon (моментен оптимизатор с нормализация Newton-Schulz) с добавяне на техниката QK-clip за стабилизиране на обучението на големи езикови модели с MoE архитектура.[1]\n\nQK-clip прилага ограничения върху логитите на вниманието чрез операция на изрязване (clipping). За всяка глава на вниманието се определя максималният логит:\n\n\n\nи се изчислява коефициент на мащабиране:\n\n\n\nкъдето — хиперпараметър-праг, — размер на главата на вниманието. Коефициентът се прилага за мащабиране на теглата , ако максималният логит надвишава прага. Това ограничава диапазона на стойностите на логитите преди softmax и намалява риска от резки скокове на загубата (loss spikes) при обучение в голям мащаб.[1]\n\nСпоред данните на авторите, предобучението на Kimi K2 върху 15,5 трлн токена с MuonClip е преминало без нито един регистриран скок на функцията на загубата (zero loss spikes).[1]\n\n=== Мултимодалност и MoonViT ===\n\nМоделите Kimi K2.5 и Kimi-VL използват визуален енкодер MoonViT (във версията K2.5 — MoonViT-3D) с приблизително 400 млн параметри, изграден на базата на SigLIP-SO-400M с NaViT-пакинг (поддръжка на променлива разделителна способност на входните изображения) и 3D разширение за обработка на видео (групиране по 4 кадъра).[2][9]\n\nВизуалният енкодер преобразува входните изображения и видеа в последователност от визуални токени. Нека — входното изображение, — визуалният енкодер:\n\n\n\nпо-нататък чрез линейна проекция (двуслоен MLP) :\n\n\n\nкъдето — размер на скритото пространство на езиковата част на модела. В мултимодален режим се конкатенира с текстовите токени и се подава в трансформера.[9][2]\n\nЗа разлика от двуетапните схеми (добавяне на визуален адаптер върху текстовия модел), K2.5 е обучен върху смесени визуално-текстови данни от началото на предобучението (joint text-vision pre-training), с ниска дялова тежест на визуалните токени (~10 %) в ранните етапи и постепенното ѝ увеличаване. Общият обем е приблизително 15 трлн смесени визуално-текстови токени.[2]\n\n== Предобучение и постобучение ==\n\n=== Предобучение ===\n\nKimi K2 е предобучен върху 15,5 трлн токена (уеб текстове, код, математика, енциклопедични знания) с използване на оптимизатора MuonClip. Нито един скок на загубата (loss spike) не е регистриран за целия период на предобучението.[1]\n\nKimi K2.5 е преминал непрекъснато предобучение (continual pre-training) от контролната точка на K2 върху допълнителни ~15 трлн смесени визуално-текстови токени със съвместна оптимизация на модалностите (joint pre-training). Отделно е проведено 1 трлн токена standalone обучение на визуалния енкодер и допълнителен етап long-context mid-training за разширяване на контекста.[2]\n\n=== Постобучение ===\n\nПостобучението на моделите от серията K2 включва няколко стадия:[1][2]\n\nSupervised Fine-Tuning (SFT, контролирано фино настройване):\n* Синтетични агентни траектории (agentic data synthesis) — генериране на спецификации на инструменти, моделиране на взаимодействия с обкръжението, верификация на резултатите.\n* За K2.5 допълнително се прилага zero-vision SFT — текстов SFT, активиращ визуалните способности без непосредствено използване на изображения на етапа на fine-tuning.\n\nReinforcement Learning (RL, обучение с подкрепление):\n* Комбинация от верифицируеми награди (Reinforcement Learning with Verifiable Rewards, RLVR) за задачи по математика, код и безопасност.\n* Самооценка по рубрики (self-critique rubric rewards) — използване на LLM оценители за автоматична оценка на качеството на агентните сценарии.\n* За K2.5 — съвместно мултимодално RL (joint multimodal RL).\n\nQuantization-Aware Training (QAT):\n* Kimi K2 Thinking и K2.5 поддържат нативна INT4 квантовка на теглата (weight-only quantization, група 32, компресирани тензори), оптимизирана за архитектурата NVIDIA Hopper, което намалява изискванията към паметта при извод.[10][2]\n\n=== Agent Swarm (K2.5) ===\n\nЗа модела K2.5 е разработен механизъм Agent Swarm — фреймуърк за самоуправлявана паралелна оркестрация на агенти. Моделът-оркестратор динамично създава суб-агенти (чрез операции create_subagent, assign_task), разпределя подзадачи и събира резултатите. Всеки суб-агент може самостоятелно да извиква инструменти и да работи паралелно с другите суб-агенти.[2]\n\nОбучението на механизма Agent Swarm е реализирано чрез Parallel-Agent Reinforcement Learning (PARL) с разделяне на изпълнението и оптимизацията (decoupling execution/optimization). Според данните на авторите, Agent Swarm осигурява намаляване на закъснението (latency) до 4,5 пъти в сравнение с еднопоточния агентен режим (single-agent).[2]\n\n== Основни модели от серията ==\n\n{| class=\"wikitable\"\n! Модел !! Тип !! Параметри (общи / активни) !! Контекст, токени !! Мултимодалност !! Дата на издаване\n|-\n| Kimi k1.5 || LLM, RL-scaling || не е разкрито || 128 000 || Да (ограничена) || Януари 2025\n|-\n| Kimi-VL || VLM, MoE || компактна / ~2,8 млрд активни + 400 млн ViT || дълъг контекст || Да (изображения) || Април 2025\n|-\n| Kimi K2 || LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Не (текст) || Юли 2025\n|-\n| Kimi K2 Thinking || LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Не (текст) || Ноември 2025\n|-\n| Kimi K2.5 || VLM-LLM, MoE || 1,04 трлн / 32 млрд || 256 000 || Да (изображения, видео, PDF) || Януари 2026\n|}\n[8][9][1][10][2]\n\n=== Kimi K2 ===\n\nKimi K2 — Mixture-of-Experts LLM с 1,04 трлн общи параметри и 32 млрд активирани параметри на токен. Предобучен върху 15,5 трлн токена с оптимизатора MuonClip. Архитектурата включва 384 експерта и съвместим с дълъг контекст механизъм MLA. Моделът е ориентиран към задачи по програмиране, математическо разсъждение и агентни сценарии с последователни извиквания на инструменти.[1]\n\nВ техническия доклад е описан многостадиен pipeline на постобучение: мащабен синтез на агентни данни чрез моделиране на взаимодействия с инструменти; обучение с подкрепление в смесена среда от реални и синтетични задачи; използване на LLM оценители за автоматична оценка на качеството.[1][14]\n\n=== Kimi K2 Thinking ===\n\nВариантът Kimi K2 Thinking е оптимизиран за многостъпково разсъждение (chain-of-thought) с възможност за динамично извикване на инструменти и поддръжка на контекст до 256 000 токена. Моделът реализира отделен режим „Thinking" с явно връщано поле reasoning_content, съдържащо вътрешните разсъждения. K2 Thinking поддържа 200–300 последователни извиквания на инструменти в един агентен епизод без съществена деградация на поведението, както и нативна INT4 квантовка с използване на QAT.[10]\n\n=== Kimi-VL ===\n\nKimi-VL — отворен мултимодален MoE VLM (vision-language model), ориентиран към задачи по визуално разбиране, визуално-текстово разсъждение и реални сцени. Моделът е описан като компактна MoE архитектура с визуален енкодер MoonViT. Техническият доклад е публикуван на arXiv през април 2025 година.[9]\n\n=== Kimi K2.5 ===\n\nKimi K2.5 — мултимодален MoE модел от мащаб 1,04 трлн параметри с 32 млрд активирани, основан на контролната точка Kimi-K2-Base с продължено предобучение върху ~15 трлн смесени визуално-текстови токени. Моделът поддържа входове от изображения, видео, PDF и текст с контекст до 256 000 токена.[2]\n\nK2.5 поддържа два основни режима на извод:\n* Thinking mode — с явен reasoning_content и многостъпкова генерация;\n* Instant mode — без извод на разсъждения, с по-ниско закъснение.[2][13]\n\nМоделът реализира нативна INT4 квантовка на теглата (weight-only, група 32), оптимизирана за архитектурата NVIDIA Hopper.[2]\n\n== Ключови резултати и benchmark-ове ==\n\n=== Текстови и агентни benchmark-ове на Kimi K2 ===\n\nРезултатите са посочени за Kimi-K2-Instruct в режим non-thinking (без разширен chain-of-thought) според данните на техническия доклад.[1]\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi K2-Instruct !! DeepSeek-V3-0324 !! Claude 4 Opus / Sonnet !! Източник\n|-\n| SWE-Bench Verified (Pass@1) || 65,8 % || 38,8 % || 72,5 % / 72,7 % || arXiv:2507.20534\n|-\n| SWE-Bench Multilingual || 47,3 % || 20,9 % || 51,0 % || arXiv:2507.20534\n|-\n| LiveCodeBench v6 (Pass@1) || 53,7 % || 44,7 % || 46,9 % || arXiv:2507.20534\n|-\n| Tau2-Bench (micro-avg) || 66,1 % || 48,8 % || 66,1 % || arXiv:2507.20534\n|-\n| ACEBench (En) || 76,5 % || 75,6 % || 80,1 % || arXiv:2507.20534\n|-\n| AIME 2025 (Avg@64) || 49,5 % || 33,9 % || 46,7 % || arXiv:2507.20534\n|-\n| GPQA-Diamond (Avg@8) || 75,1 % || 68,2 % || 74,9 % || arXiv:2507.20534\n|}\n\nСпоред заявлението на авторите, тези резултати позиционират K2 сред лидерите на отворените модели в режим без thinking разгъване, особено при инженерни и агентни задачи (към момента на публикуване на доклада).[1]\n\n=== Benchmark-ове на Kimi-VL ===\n\n{| class=\"wikitable\"\n! Benchmark !! Kimi-VL !! Qwen2.5-VL-7B !! GPT-4o-mini !! Източник\n|-\n| MMVet (точност) || 66,7 % || 67,1 % || 66,9 % || arXiv:2504.07491\n|-\n| RealWorldQA || 68,1 % || 68,5 % || — || arXiv:2504.07491\n|}\n\nРезултатите демонстрират, че компактната мултимодална MoE архитектура достига ниво, сравнимо с по-големи модели при по-малък брой активни параметри.[9]\n\n=== Benchmark-ове на Kimi K2.5 ===\n\nРезултатите са посочени в режим Thinking (temperature = 1,0; top-p = 0,95; контекст 256 000 токена; движок vLLM; хардуерна платформа NVIDIA H200) според данните на модалната карта на платформата NVIDIA NIM и техническия доклад.[2][13]\n\n{| class=\"wikitable\"\n! Категория !! Benchmark !! Kimi K2.5\n|-\n| rowspan=\"6\" | Reasoning & Knowledge\n| HLE-Full (без инструменти) || 30,1\n|-\n| HLE-Full (с инструменти) || 50,2\n|-\n| AIME 2025 || 96,1\n|-\n| HMMT 2025 (Feb) || 95,4\n|-\n| GPQA-Diamond || 87,6\n|-\n| MMLU-Pro || 87,1\n|-\n| rowspan=\"7\" | Vision & Video\n| MMMU-Pro || 78,5\n|-\n| MathVision || 84,2\n|-\n| MathVista (mini) || 90,1\n|-\n| OCRBench || 92,3\n|-\n| OmniDocBench 1.5 || 88,8\n|-\n| VideoMMMU || 86,6\n|-\n| LongVideoBench || 79,8\n|-\n| rowspan=\"7\" | Coding\n| SWE-Bench Verified || 76,8\n|-\n| SWE-Bench Pro || 50,7\n|-\n| SWE-Bench Multilingual || 73,0\n|-\n| Terminal Bench 2.0 || 50,8\n|-\n| PaperBench || 63,5\n|-\n| LiveCodeBench v6 || 85,0\n|-\n| OJBench (C++) || 57,4\n|-\n| rowspan=\"2\" | Long Context\n| Longbench v2 || 61,0\n|-\n| AA-LCR || 70,0\n|-\n| rowspan=\"4\" | Agentic Search\n| BrowseComp || 60,6\n|-\n| BrowseComp (Agent Swarm) || 78,4\n|-\n| WideSearch (iter-F1) || 72,7\n|-\n| DeepSearchQA || 77,1\n|}\n\nДопълнително K2.5 демонстрира положителен трансфер на визуалното обучение върху текстови задачи: +1,7 % на MMLU-Pro и +2,1 % на GPQA-Diamond в сравнение с текстовия базов модел K2.[2]\n\nОкончателната сравнителна оценка зависи от избора на метрики и сценарии; резултатите са посочени по данни на авторите. Независимата валидация на част от benchmark-овете към момента на публикуване е ограничена.[2][15]\n\n== Приложение ==\n\n=== Текстов асистент и търсене ===\n\nПлатформата Kimi се използва като асистент с поддръжка на обработка на дълги документи (изследователски доклади, финансови данни), автоматизиран анализ и онлайн търсене с агрегиране на информация. Moonshot AI посочва, че Kimi поддържа над 300 извиквания на инструменти (tool calls) в рамките на един агентен сценарий.[7][4]\n\n=== Програмиране и инженерни задачи ===\n\nKimi K2 и K2.5 демонстрират високи резултати на SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench и други benchmark-ове по програмиране. Моделите се прилагат за автоматизиране на поправяне на грешки в хранилища, генериране и рефакторинг на код, решаване на задачи на онлайн съдии (OJBench, LiveCodeBench). Техническият доклад на K2 посочва, че моделът е обучен върху мащабен синтетичен агентен корпус, включително взаимодействия със системи за управление на версии, пакетни мениджъри и среди за изпълнение.[1][2][14]\n\n=== Мултимодални приложения ===\n\nKimi-VL и K2.5 са предназначени за визуален въпрос-отговор (VQA) върху изображения и документи; разбиране на документи (OCRBench, OmniDocBench); анализ на видео (VideoMMMU, LongVideoBench); комбинирани задачи по програмиране по визуални спецификации (например генериране на интерфейс по макет на изображение). За K2.5 са описани сценарии „vision-grounded coding" и „autonomous visual debugging", при които моделът генерира код по визуално описание и итеративно анализира визуалния резултат.[2][9][15]\n\n=== API и разгръщане ===\n\nМоделите са достъпни чрез API на платформата Moonshot AI Open Platform с поддръжка на tool calling, thinking режим, JSON режим и кеширане на контекста. Отворените тегла се използват за локално разгръщане чрез vLLM, SGLang и TensorRT-LLM. Услугата Mooncake осигурява мащабиране на инференса за дълъг контекст.[4][11][16]\n\n== Ограничения и открити проблеми ==\n\n=== Изисквания към ресурсите ===\n\nMoE модели от мащаб 1 трлн параметри, дори при активирани 32 млрд параметри и INT4 квантовка, изискват значителни ресурси на паметта и пропускателна способност. В инженерните дискусии за разгръщането на Kimi K2.5 се споменават оценки от порядъка на стотици гигабайта видеопамет за пълно зареждане на модела; конкретните числа зависят от схемата на квантовка и фреймуърка (vLLM, SGLang и др.).[2][17]\n\n=== Халюцинации и качество на генерацията ===\n\nКакто и другите LLM, моделите от серията Kimi са податливи на халюцинации. В докладите по тестовете FACTS Grounding и FaithJudge са регистрирани показатели hallucination rate в рамките на 1,1–7,4 % в RAG сценарии. В non-thinking режим моделът може да генерира излишни токени при неясни спецификации на инструментите; при принудително активиране на tool-use производителността спада при някои задачи.[1]\n\n=== Зависимост от синтетични данни и RL pipeline ===\n\nPipeline-ът за синтез на агентни данни и обучение с подкрепление разчита на голяма колекция от синтетични инструменти и сцени, както и на LLM оценители за автоматична оценка (self-judging). Такава схема поражда открити въпроси: устойчивост към отклонение (bias) при самооценката; потенциална деградация при многократна итерация (bootstrap); преносимост на агентните умения към реални среди, различаващи се от симулираните; влияние на разпределението на синтетичните задачи върху обобщаващата способност.[1][14]\n\n=== Прозрачност и възпроизводимост ===\n\nЧаст от информацията за състава на обучаващите данни, процеса на филтриране, разпределението на езиците и домейните не се разкрива или се разкрива ограничено. Това затруднява точната оценка на източниците на отклонение, възпроизводимостта на обучението и независимата валидация на влиянието на отделните компоненти (MuonClip, QK-clip) върху стабилността. Към февруари 2026 година пълното възпроизвеждане на обучението на Kimi K2 и K2.5 от трети страни не е регистрирано в открытата литература.[1][2]\n\n== Етични и регулаторни аспекти ==\n\nВ модалните карти и техническите доклади се подчертава, че разработчиците носят отговорност за входовете и изходите на модела; изисква се добавяне на защитни механизми (guardrails) и тестване върху данни от конкретния случай преди внедряване; моделът може да обработва изображения и видео, потенциално съдържащи лични данни, и интеграторът е длъжен да спазва съответното законодателство.[2][16]\n\nВ техническите доклади са описани оценки на безопасността (биологични, химични, киберрискове) с използване на инструменти от типа Promptfoo. Моделите преминават RL изравняване (alignment) с верифицируеми награди и самооценка.[1]\n\nКато продукт на китайска компания, моделите са подчинени на националното регулиране на КНР в областта на ИИ. Към момента на написването не са открити отделни публични регулаторни документи, посветени изключително на моделите Kimi; регулирането се осъществява в рамките на общите подходи към генеративните модели и ИИ в съответните юрисдикции.[18]\n\nПрез февруари 2026 година компанията Anthropic заяви, че Moonshot AI (заедно с други китайски разработчици) е използвала фалшиви акаунти за генериране на взаимодействия с Claude с цел дистилация на данни за обучение на модели. Информацията е от характер на твърдение на една страна и не е потвърдена от независими разследвания към момента на публикуването; Moonshot AI не е публикувала официален отговор.[5]\n\n== Перспективи и направления на изследванията ==\n\nВъз основа на публикуваните материали могат да се откроят няколко направления за по-нататъшни изследвания:\n\n* Мащабируеми агентни системи. Развитие на подходите за обучение на LLM като агентни системи с използване на синтетичен инструментариум, RL и self-judging. Разширяване на Agent Swarm към по-голям брой суб-агенти и нови типове задачи.[2][1]\n* Ефективни MoE архитектури. Използването на 1 трлн параметри с 32 млрд активирани и 384 експерта представлява един от вариантите на компромис между мащаб и ефективност; изследват се алтернативи с различни схеми на маршрутизация.[1]\n* Нативна мултимодалност. Обучението на K2.5 върху смесени визуално-текстови данни от началото на предобучението представлява подход към „нативна" мултимодалност, който се сравнява с двуетапните схеми.[2][9]\n* Ефективен инференс и дълъг контекст. INT4 квантовката и поддръжката на контекст от 256 000 токена стимулират по-нататъшни изследвания в областта на разредено внимание, латентни представяния и външна памет. Отделно е описан проектът Kimi Linear — хибридно линейно внимание с намаляване на KV кеша с 75 % и ускоряване на декодирането 6 пъти при контекст от 1 млн токена.[2][19]\n\nВ официалните материали на Moonshot AI не се публикуват детайлни пътни карти за бъдещите версии на Kimi; изброените направления се основават на публикуваните изследвания.\n\n== Вж. също ==\n* Архитектура Transformer\n* DeepSeek\n* Qwen\n\n== Препратки ==\n* https://www.moonshot.ai/ — официален сайт на Moonshot AI\n* https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)\n* https://github.com/MoonshotAI/Kimi-K2.5 — GitHub хранилище на Kimi K2.5\n* https://huggingface.co/moonshotai — профил на Moonshot AI в Hugging Face\n\n== Литература ==\n* Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534\n* Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276\n* Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599\n* Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491\n* Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692\n* Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079\n* Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762\n\n== Бележки ==\n\n\n\nTemplate:SEOMeta\n
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692