---
title: "Kimi (Moonshot AI)"
source: "https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)"
wiki: "systems-analysis.info/wiki"
article: "Kimi_(Moonshot_AI)"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 132
wiki_created_at: 2026-09-06T21:55:31Z
wiki_modified_at: 2026-09-06T21:55:31Z
downloaded_at: 2026-09-07T22:17:41Z
---

# Kimi (Moonshot AI)

**Kimi (серия моделей Moonshot AI)** — серия [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (Large Language Model, LLM), разрабатываемых китайской компанией Moonshot AI (Пекин, КНР) для задач текстовой и мультимодальной генерации, программирования и агентных систем (agentic systems — систем, способных к автономному планированию, рассуждению и действию с использованием внешних инструментов). Семейство включает текстовые и мультимодальные модели с архитектурой Mixture-of-Experts (MoE, смесь экспертов) масштаба порядка 1 трлн параметров и активируемым поднабором порядка 32 млрд параметров на [токен](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен").<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup> Важной особенностью серии является ориентация на агентное поведение (многошаговое планирование с вызовом внешних инструментов) и поддержка длинного контекста до 256 000 токенов в версиях Kimi K2 и Kimi K2.5.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

Модели серии Kimi распространяются как с открытыми весами (open-weight) на платформе Hugging Face под модифицированной MIT-лицензией, так и через проприетарный API платформы Moonshot AI Open Platform.<sup>[\[3\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-HF_K25-3)[\[4\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-platform-4)</sup>

## История и предпосылки

### Основание Moonshot AI

Moonshot AI основана в марте 2023 года в Пекине Ян Чжилином (Yang Zhilin, CEO), Чжоу Синьюем (Zhou Xinyu) и У Юйсинем (Wu Yuxin) — выпускниками Университета Цинхуа (Tsinghua University). Ян Чжилин ранее работал в Google Brain и Meta, участвовал в исследованиях в области компьютерного зрения и рассуждения. Компания получила финансирование от Alibaba (раунд объёмом \$1 млрд, февраль 2024), Tencent и других инвесторов.<sup>[\[5\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-wiki_moonshot-5)[\[6\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-wiki_kimi_chatbot-6)</sup>

### Хронология ключевых релизов

- **Октябрь–ноябрь 2023** — запуск чатбота Kimi с поддержкой контекста до 128 тыс. токенов (до 200 тыс. китайских иероглифов). Первые версии использовали проприетарные модели с ограниченно раскрытыми техническими деталями.<sup>[\[6\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-wiki_kimi_chatbot-6)[\[7\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-moonshot_site-7)</sup>
- **Март 2024** — расширение контекста до 2 млн иероглифов в бета-версии.<sup>[\[6\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-wiki_kimi_chatbot-6)</sup>
- **Январь 2025** — выпуск **Kimi k1.5** — мультимодальной модели с масштабированным обучением с подкреплением (Reinforcement Learning, RL), заявленной как сопоставимая по производительности с OpenAI o1 в задачах математики, программирования и мультимодального рассуждения. Контекст до 128 тыс. токенов.<sup>[\[8\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-k15paper-8)</sup>
- **Апрель 2025** — представлена **Kimi-VL** — открытая мультимодальная MoE-модель (vision-language model, VLM) с визуальным энкодером MoonViT (~400 млн параметров) и ~2,8 млрд активных параметров в декодере. Технический отчёт опубликован на arXiv.<sup>[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)</sup>
- **Июль 2025** — выпуск **Kimi K2** — основной открытой MoE-модели с 1 трлн параметров и 32 млрд активных параметров. Технический отчёт опубликован на arXiv.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup> Модель занимала первое место среди открытых моделей на LMSYS Chatbot Arena на момент выпуска (более 3000 голосов).<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>
- **Сентябрь 2025** — обновление **Kimi-K2-Instruct-0905** с расширенным контекстом до 256 тыс. токенов и улучшенным агентным кодированием.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>
- **Ноябрь 2025** — выпуск **Kimi K2 Thinking** — версии с усиленным пошаговым рассуждением (chain-of-thought) и поддержкой 200–300 последовательных вызовов инструментов (tool calls).<sup>[\[10\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-HF_K2Thinking-10)</sup>
- **Январь 2026** — представлена **Kimi K2.5** — мультимодальная MoE-модель с нативной мультимодальностью и механизмом Agent Swarm (параллельная оркестрация суб-агентов).<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

Параллельно с разработкой моделей в 2024 году был представлен собственный сервис инференса **Mooncake** — KVCache-центричная дезагрегированная архитектура для обслуживания LLM с длинным контекстом.<sup>[\[11\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-mooncake-11)</sup>

## Теоретические основы и архитектура

### Архитектура Mixture-of-Experts

Модели серии Kimi K2 и K2.5 реализуют архитектуру [Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer") с Mixture-of-Experts в отдельных слоях. Стандартный блок трансформера представляет собой композицию слоёв многоголового самовнимания (Multi-Head Attention, MHA) и позиционно-wise MLP (многослойного перцептрона) с резидуальными соединениями:<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[12\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-Vaswani2017-12)</sup>

$$
\mathbf{H}^{\prime} = {MHA}(\mathbf{H}) + \mathbf{H},\quad\mathbf{H}^{\ast} = {MLP}(\mathbf{H}^{\prime}) + \mathbf{H}^{\prime},
$$

где $\mathbf{H} \in {\mathbb{R}}^{L \times d}$ — входные токеновые представления, $L$ — длина последовательности, $d$ — размер скрытого состояния.

В MoE-слое вместо одного MLP используется набор экспертов $\{ E_{i}\}_{i = 1}^{N}$, каждый из которых представляет отдельный MLP с параметрами $\theta_{i}$. Маршрутизатор (gating network) для каждого токена выбирает подмножество экспертов. Выход MoE-слоя для токена с представлением $\mathbf{h}$ задаётся как:<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

$$
{MoE}(\mathbf{h}) = \sum\limits_{i \in \mathcal{S}(\mathbf{h})}g_{i}(\mathbf{h})\, E_{i}(\mathbf{h}),
$$

где $\mathcal{S}(\mathbf{h}) \subset \{ 1,\ldots,N\}$ — множество выбранных экспертов для данного токена, $g_{i}(\mathbf{h})$ — нормированные веса маршрутизатора, $\sum\limits_{i \in \mathcal{S}}g_{i} = 1$. Функция маршрутизации выбирает экспертов через операцию TopK:<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

$$
g(\mathbf{h}) = {TopK}\left( {Softmax}(\mathbf{h} \cdot W_{g}) \right),
$$

где $W_{g}$ — обучаемая матрица маршрутизатора. Такая схема позволяет масштабировать общее число параметров при ограниченном числе параметров, активируемых на каждый токен.

### Архитектурные гиперпараметры Kimi K2 / K2.5

| Параметр                                             | Значение                                |
|------------------------------------------------------|-----------------------------------------|
| Тип архитектуры                                      | Transformer с Mixture-of-Experts        |
| Общее число параметров                               | 1,04 трлн                               |
| Активируемые параметры на токен                      | 32 млрд                                 |
| Число слоёв                                          | 61 (1 плотный + 60 MoE)                 |
| Размер скрытого состояния                            | 7168                                    |
| Число голов внимания                                 | 64                                      |
| Число экспертов                                      | 384 (8 выбираемых на токен + 1 общий)   |
| Размер скрытого состояния эксперта (MoE hidden size) | 2048                                    |
| Размер словаря                                       | 160 000 токенов                         |
| Функция активации                                    | SwiGLU                                  |
| Механизм внимания                                    | Multi-head Latent Attention (MLA)       |
| Максимальный контекст                                | 256 000 токенов (расширение через YaRN) |
| Визуальный энкодер (K2.5)                            | MoonViT-3D, ~400 млн параметров         |

<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[13\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-nvidia_nim-13)</sup>

Спарсити (отношение общего числа экспертов к активируемому) составляет 48:1 (384 экспертов, 8 активных), что обеспечивает значительное снижение вычислительных затрат относительно плотной (dense) модели того же масштаба.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

### Механизм Multi-head Latent Attention (MLA)

В моделях серии Kimi K2/K2.5 используется механизм Multi-head Latent Attention (MLA) — модификация стандартного многоголового внимания, направленная на повышение эффективности и масштабируемости. Стандартное внимание для одного слоя вычисляется как:<sup>[\[12\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-Vaswani2017-12)</sup>

$$
{Attention}(\mathbf{Q},\mathbf{K},\mathbf{V}) = {softmax}\!\left( \frac{\mathbf{Q}\mathbf{K}^{\top}}{\sqrt{d_{k}}} \right)\mathbf{V},
$$

где $\mathbf{Q},\mathbf{K},\mathbf{V} \in {\mathbb{R}}^{L \times d_{k}}$ — матрицы запросов, ключей и значений. В MLA вводятся латентные представления, на которые проектируются запросы и ключи, что уменьшает размерность промежуточных операций и позволяет сократить объём KV-кэша. Подход аналогичен механизму, использованному в DeepSeek-V3.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[13\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-nvidia_nim-13)</sup>

### Оптимизатор MuonClip и QK-clip

Для обучения модели Kimi K2 предложен оптимизатор **MuonClip** — модификация оптимизатора Muon (моментный оптимизатор с нормализацией Newton-Schulz) с добавлением техники **QK-clip** для стабилизации обучения больших языковых моделей с MoE-архитектурой.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

QK-clip применяет ограничения на логиты внимания $\mathbf{Q}\mathbf{K}^{\top}$ через операцию обрезки (clipping). Для каждой головы внимания $h$ определяется максимальный логит:

$$
S_{h}^{\max} = \frac{1}{\sqrt{d}}\max\limits_{i,j}\left( Q_{h}^{i}(K_{h}^{j})^{\top} \right),
$$

и вычисляется коэффициент масштабирования:

$$
\gamma_{h} = \min\!\left( 1,\;\frac{\tau}{S_{h}^{\max}} \right),
$$

где $\tau = 100$ — гиперпараметр-порог, $d$ — размер головы внимания. Коэффициент $\gamma_{h}$ применяется для масштабирования весов $W_{q},W_{k}$, если максимальный логит превышает порог. Это ограничивает диапазон значений логитов перед softmax и уменьшает риск резких скачков потерь (loss spikes) при обучении на больших масштабах.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

По данным авторов, предобучение Kimi K2 на 15,5 трлн токенов с MuonClip прошло без единого зафиксированного всплеска функции потерь (*zero loss spikes*).<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

### Мультимодальность и MoonViT

Модели Kimi K2.5 и Kimi-VL используют визуальный энкодер **MoonViT** (в версии K2.5 — MoonViT-3D) с приблизительно 400 млн параметров, построенный на основе SigLIP-SO-400M с NaViT-пакингом (поддержка переменного разрешения входных изображений) и 3D-расширением для обработки видео (группировка по 4 кадра).<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)</sup>

Визуальный энкодер преобразует входные изображения и видео в последовательность визуальных токенов. Пусть $\mathbf{X} \in {\mathbb{R}}^{H \times W \times 3}$ — входное изображение, $\Phi_{\text{vis}}$ — визуальный энкодер:

$$
\mathbf{Z}_{\text{vis}} = \Phi_{\text{vis}}(\mathbf{X}) \in {\mathbb{R}}^{L_{v} \times d_{v}},
$$

далее через линейную проекцию (двухслойный MLP) $\mathbf{P} \in {\mathbb{R}}^{d_{v} \times d}$:

$$
\mathbf{H}_{\text{vis}} = \mathbf{Z}_{\text{vis}}\,\mathbf{P},
$$

где $d$ — размер скрытого пространства языковой части модели. В мультимодальном режиме $\mathbf{H}_{\text{vis}}$ конкатенируется с текстовыми токенами и подаётся в трансформер.<sup>[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

В отличие от двухэтапных схем (добавление визуального адаптера поверх текстовой модели), K2.5 обучена на смешанных визуально-текстовых данных с начала предобучения (joint text-vision pre-training), с низкой долей визуальных токенов (~10 %) на ранних этапах и постепенным увеличением. Общий объём — приблизительно 15 трлн смешанных визуально-текстовых токенов.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

## Предобучение и постобучение

### Предобучение

**Kimi K2** предобучена на 15,5 трлн токенов (веб-тексты, код, математика, энциклопедические знания) с использованием оптимизатора MuonClip. Ни одного всплеска потерь (loss spike) не зафиксировано за весь период предобучения.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

**Kimi K2.5** прошла непрерывное предобучение (continual pre-training) от контрольной точки K2 на дополнительных ~15 трлн смешанных визуально-текстовых токенов с совместной оптимизацией модальностей (joint pre-training). Отдельно проведено 1 трлн токенов standalone-обучения визуального энкодера и дополнительный этап long-context mid-training для расширения контекста.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

### Постобучение

Постобучение моделей серии K2 включает несколько стадий:<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

**Supervised Fine-Tuning (SFT, контролируемая тонкая настройка):**

- Синтетические агентные траектории (agentic data synthesis) — генерация спецификаций инструментов, моделирование взаимодействий с окружением, верификация результатов.
- Для K2.5 дополнительно применяется zero-vision SFT — текстовый SFT, активирующий визуальные способности без непосредственного использования изображений на этапе fine-tuning.

**Reinforcement Learning (RL, обучение с подкреплением):**

- Комбинация верифицируемых наград (Reinforcement Learning with Verifiable Rewards, RLVR) для задач математики, кода и безопасности.
- Самооценка по рубрикам (self-critique rubric rewards) — использование LLM-оценщиков для автоматической оценки качества агентных сценариев.
- Для K2.5 — совместное мультимодальное RL (joint multimodal RL).

**Quantization-Aware Training (QAT):**

- Kimi K2 Thinking и K2.5 поддерживают нативную INT4-квантовку весов (weight-only quantization, группа 32, сжатые тензоры), оптимизированную под архитектуру NVIDIA Hopper, что снижает требования к памяти при выводе.<sup>[\[10\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-HF_K2Thinking-10)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

### Agent Swarm (K2.5)

Для модели K2.5 разработан механизм **Agent Swarm** — фреймворк самоуправляемой параллельной оркестрации агентов. Модель-оркестратор динамически создаёт суб-агентов (через операции `create_subagent`, `assign_task`), распределяет подзадачи и собирает результаты. Каждый суб-агент может самостоятельно вызывать инструменты и работать параллельно с другими суб-агентами.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

Обучение механизма Agent Swarm реализовано через **Parallel-Agent Reinforcement Learning (PARL)** с разделением исполнения и оптимизации (decoupling execution/optimization). По данным авторов, Agent Swarm обеспечивает снижение задержки (latency) до 4,5× по сравнению с однопоточным агентным режимом (single-agent).<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

## Основные модели серии

| Модель               | Тип             | Параметры (общие / активные)                  | Контекст, токенов | Мультимодальность            | Дата выпуска |
|----------------------|-----------------|-----------------------------------------------|-------------------|------------------------------|--------------|
| **Kimi k1.5**        | LLM, RL-scaling | не раскрыто                                   | 128 000           | Да (ограниченная)            | Январь 2025  |
| **Kimi-VL**          | VLM, MoE        | компактная / ~2,8 млрд активных + 400 млн ViT | длинный контекст  | Да (изображения)             | Апрель 2025  |
| **Kimi K2**          | LLM, MoE        | 1,04 трлн / 32 млрд                           | 256 000           | Нет (текст)                  | Июль 2025    |
| **Kimi K2 Thinking** | LLM, MoE        | 1,04 трлн / 32 млрд                           | 256 000           | Нет (текст)                  | Ноябрь 2025  |
| **Kimi K2.5**        | VLM-LLM, MoE    | 1,04 трлн / 32 млрд                           | 256 000           | Да (изображения, видео, PDF) | Январь 2026  |

<sup>[\[8\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-k15paper-8)[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[10\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-HF_K2Thinking-10)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

### Kimi K2

Kimi K2 — Mixture-of-Experts LLM с 1,04 трлн общих параметров и 32 млрд активируемых параметров на токен. Предобучена на 15,5 трлн токенов с оптимизатором MuonClip. Архитектура включает 384 эксперта и совместимый с длительным контекстом механизм MLA. Модель ориентирована на задачи программирования, математического рассуждения и агентных сценариев с последовательными вызовами инструментов.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

В техническом отчёте описан многостадийный пайплайн постобучения: масштабный синтез агентных данных путём моделирования взаимодействий с инструментами; обучение с подкреплением в смешанной среде реальных и синтетических задач; использование LLM-оценщиков для автоматической оценки качества.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[14\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-importai-14)</sup>

### Kimi K2 Thinking

Вариант Kimi K2 Thinking оптимизирован для многошагового рассуждения (chain-of-thought) с возможностью динамического вызова инструментов и поддержкой контекста до 256 000 токенов. Модель реализует отдельный режим «Thinking» с явно возвращаемым полем `reasoning_content`, содержащим внутренние рассуждения. K2 Thinking поддерживает 200–300 последовательных вызовов инструментов в одном агентном эпизоде без существенной деградации поведения, а также нативную INT4-квантовку с использованием QAT.<sup>[\[10\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-HF_K2Thinking-10)</sup>

### Kimi-VL

Kimi-VL — открытая мультимодальная MoE-VLM (vision-language model), ориентированная на задачи визуального понимания, визуально-текстового рассуждения и реальных сцен. Модель описывается как компактная MoE-архитектура с визуальным энкодером MoonViT. Технический отчёт опубликован на arXiv в апреле 2025 года.<sup>[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)</sup>

### Kimi K2.5

Kimi K2.5 — мультимодальная MoE-модель масштаба 1,04 трлн параметров с 32 млрд активируемых, основанная на контрольной точке Kimi-K2-Base с продолженным предобучением на ~15 трлн смешанных визуально-текстовых токенов. Модель поддерживает входы изображений, видео, PDF и текста с контекстом до 256 000 токенов.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

K2.5 поддерживает два основных режима вывода:

- **Thinking mode** — с явным `reasoning_content` и многошаговой генерацией;
- **Instant mode** — без вывода рассуждений, с более низкой задержкой.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[13\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-nvidia_nim-13)</sup>

Модель реализует нативную INT4-квантовку весов (weight-only, группа 32), оптимизированную под архитектуру NVIDIA Hopper.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

## Ключевые результаты и бенчмарки

### Текстовые и агентные бенчмарки Kimi K2

Результаты приведены для Kimi-K2-Instruct в режиме non-thinking (без расширенного chain-of-thought) по данным технического отчёта.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

| Бенчмарк                    | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | Источник         |
|-----------------------------|------------------|------------------|------------------------|------------------|
| SWE-Bench Verified (Pass@1) | 65,8 %           | 38,8 %           | 72,5 % / 72,7 %        | arXiv:2507.20534 |
| SWE-Bench Multilingual      | 47,3 %           | 20,9 %           | 51,0 %                 | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1)   | 53,7 %           | 44,7 %           | 46,9 %                 | arXiv:2507.20534 |
| Tau2-Bench (micro-avg)      | 66,1 %           | 48,8 %           | 66,1 %                 | arXiv:2507.20534 |
| ACEBench (En)               | 76,5 %           | 75,6 %           | 80,1 %                 | arXiv:2507.20534 |
| AIME 2025 (Avg@64)          | 49,5 %           | 33,9 %           | 46,7 %                 | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8)        | 75,1 %           | 68,2 %           | 74,9 %                 | arXiv:2507.20534 |

По заявлению авторов, данные результаты позиционируют K2 среди лидеров открытых моделей в режиме без thinking-развёртки, особенно на инженерных и агентных задачах (по состоянию на момент публикации отчёта).<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

### Бенчмарки Kimi-VL

| Бенчмарк         | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | Источник         |
|------------------|---------|---------------|-------------|------------------|
| MMVet (точность) | 66,7 %  | 67,1 %        | 66,9 %      | arXiv:2504.07491 |
| RealWorldQA      | 68,1 %  | 68,5 %        | —           | arXiv:2504.07491 |

Результаты демонстрируют, что компактная мультимодальная MoE-архитектура достигает уровня, сопоставимого с более крупными моделями при меньшем числе активных параметров.<sup>[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)</sup>

### Бенчмарки Kimi K2.5

Результаты приведены в режиме Thinking (temperature = 1,0; top-p = 0,95; контекст 256 000 токенов; движок vLLM; аппаратная платформа NVIDIA H200) по данным модельной карты на платформе NVIDIA NIM и технического отчёта.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[13\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-nvidia_nim-13)</sup>

| Категория             | Бенчмарк                    | Kimi K2.5 |
|-----------------------|-----------------------------|-----------|
| Reasoning & Knowledge | HLE-Full (без инструментов) | 30,1      |
|                       | HLE-Full (с инструментами)  | 50,2      |
|                       | AIME 2025                   | 96,1      |
|                       | HMMT 2025 (Feb)             | 95,4      |
|                       | GPQA-Diamond                | 87,6      |
|                       | MMLU-Pro                    | 87,1      |
| Vision & Video        | MMMU-Pro                    | 78,5      |
|                       | MathVision                  | 84,2      |
|                       | MathVista (mini)            | 90,1      |
|                       | OCRBench                    | 92,3      |
|                       | OmniDocBench 1.5            | 88,8      |
|                       | VideoMMMU                   | 86,6      |
|                       | LongVideoBench              | 79,8      |
| Coding                | SWE-Bench Verified          | 76,8      |
|                       | SWE-Bench Pro               | 50,7      |
|                       | SWE-Bench Multilingual      | 73,0      |
|                       | Terminal Bench 2.0          | 50,8      |
|                       | PaperBench                  | 63,5      |
|                       | LiveCodeBench v6            | 85,0      |
|                       | OJBench (C++)               | 57,4      |
| Long Context          | Longbench v2                | 61,0      |
|                       | AA-LCR                      | 70,0      |
| Agentic Search        | BrowseComp                  | 60,6      |
|                       | BrowseComp (Agent Swarm)    | 78,4      |
|                       | WideSearch (iter-F1)        | 72,7      |
|                       | DeepSearchQA                | 77,1      |

Дополнительно K2.5 демонстрирует положительный трансфер визуального обучения на текстовые задачи: +1,7 % на MMLU-Pro и +2,1 % на GPQA-Diamond по сравнению с текстовой базовой моделью K2.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

Окончательная сравнительная оценка зависит от выбора метрик и сценариев; результаты приведены по данным авторов. Независимая валидация части бенчмарков на момент публикации ограничена.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[15\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-deeplearning_batch-15)</sup>

## Применение

### Текстовый ассистент и поиск

Платформа Kimi используется как ассистент с поддержкой обработки длинных документов (исследовательские отчёты, финансовые данные), автоматизированного анализа и онлайн-поиска с агрегированием информации. Moonshot AI указывает, что Kimi поддерживает более 300 вызовов инструментов (tool calls) в рамках одного агентного сценария.<sup>[\[7\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-moonshot_site-7)[\[4\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-platform-4)</sup>

### Программирование и инженерные задачи

Kimi K2 и K2.5 демонстрируют высокие результаты на SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench и других бенчмарках программирования. Модели применяются для автоматизации исправления ошибок в репозиториях, генерации и рефакторинга кода, решения задач онлайн-судей (OJBench, LiveCodeBench). Технический отчёт K2 указывает, что модель обучалась на масштабном синтетическом агентном корпусе, включая взаимодействия с системами управления версиями, пакетными менеджерами и средами исполнения.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[14\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-importai-14)</sup>

### Мультимодальные приложения

Kimi-VL и K2.5 предназначены для визуального вопрос-ответа (VQA) на изображениях и документах; понимания документов (OCRBench, OmniDocBench); анализа видео (VideoMMMU, LongVideoBench); комбинированных задач программирования по визуальным спецификациям (например, генерация интерфейса по макету изображения). Для K2.5 описаны сценарии «vision-grounded coding» и «autonomous visual debugging», где модель генерирует код по визуальному описанию и итеративно анализирует визуальный результат.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)[\[15\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-deeplearning_batch-15)</sup>

### API и развёртывание

Модели доступны через API платформы Moonshot AI Open Platform с поддержкой tool calling, thinking-режима, JSON-режима и кэширования контекста. Открытые веса используются для локального развёртывания через vLLM, SGLang и TensorRT-LLM. Сервис Mooncake обеспечивает масштабирование инференса для длинного контекста.<sup>[\[4\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-platform-4)[\[11\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-mooncake-11)[\[16\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-github_k25-16)</sup>

## Ограничения и открытые проблемы

### Требования к ресурсам

MoE-модели масштаба 1 трлн параметров, даже при активируемых 32 млрд параметров и INT4-квантовке, требуют значительных ресурсов памяти и пропускной способности. В инженерных обсуждениях развёртывания Kimi K2.5 упоминаются оценки порядка сотен гигабайт видеопамяти для полной загрузки модели; конкретные числа зависят от формы квантовки и фреймворка (vLLM, SGLang и т. п.).<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[17\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-baseten-17)</sup>

### Галлюцинации и качество генерации

Как и другие LLM, модели серии Kimi подвержены галлюцинациям. В отчётах по тестам FACTS Grounding и FaithJudge зафиксированы показатели hallucination rate в пределах 1,1–7,4 % в RAG-сценариях. В non-thinking режиме модель может генерировать избыточные токены при нечётких спецификациях инструментов; при принудительном включении tool-use производительность падает на некоторых задачах.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

### Зависимость от синтетических данных и RL-пайплайна

Пайплайн синтеза агентных данных и обучения с подкреплением опирается на большую коллекцию синтетических инструментов и сцен, а также LLM-оценщики для автоматической оценки (self-judging). Такая схема порождает открытые вопросы: устойчивость к смещению (bias) самооценки; потенциальная деградация при многократной итерации (bootstrap); переносимость агентных навыков на реальные среды, отличающиеся от симулированных; влияние распределения синтетических задач на обобщающую способность.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[14\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-importai-14)</sup>

### Прозрачность и воспроизводимость

Часть информации о составе обучающих данных, процессе фильтрации, распределении языков и доменов не раскрывается или раскрывается ограниченно. Это затрудняет точную оценку источников смещения, воспроизводимость обучения и независимую валидацию влияния отдельных компонентов (MuonClip, QK-clip) на стабильность. По состоянию на февраль 2026 года полное воспроизведение обучения Kimi K2 и K2.5 третьими сторонами не зафиксировано в открытой литературе.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)</sup>

## Этические и регуляторные аспекты

В модельных картах и технических отчётах подчёркивается, что разработчики несут ответственность за входы и выходы модели; требуется добавление защитных механизмов (guardrails) и тестирование на данных конкретного случая перед внедрением; модель может обрабатывать изображения и видео, потенциально содержащие персональные данные, и интегратор обязан соблюдать соответствующее законодательство.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[16\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-github_k25-16)</sup>

В технических отчётах описаны оценки безопасности (биологические, химические, киберриски) с использованием инструментов типа Promptfoo. Модели проходят RL-выравнивание (alignment) с верифицируемыми наградами и самооценкой.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>

Как продукт китайской компании, модели подчиняются национальному регулированию КНР в области ИИ. На момент написания не обнаружено отдельных публичных регуляторных документов, посвящённых исключительно моделям Kimi; регулирование осуществляется в рамках общих подходов к генеративным моделям и ИИ в соответствующих юрисдикциях.<sup>[\[18\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-bismarck-18)</sup>

В феврале 2026 года компания Anthropic заявила, что Moonshot AI (наряду с другими китайскими разработчиками) использовала поддельные аккаунты для генерации взаимодействий с [Claude](https://systems-analysis.info/wiki/Claude "Claude") с целью дистилляции данных для обучения моделей. Информация носит характер утверждения одной стороны и не подтверждена независимыми расследованиями на момент публикации; Moonshot AI не публиковала официального ответа.<sup>[\[5\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-wiki_moonshot-5)</sup>

## Перспективы и направления исследований

По опубликованным материалам можно выделить несколько направлений дальнейших исследований:

- **Масштабируемые агентные системы.** Развитие подходов к тренировке LLM как агентных систем с использованием синтетического инструментария, RL и self-judging. Расширение Agent Swarm на большее число суб-агентов и новые типы задач.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>
- **Эффективные MoE-архитектуры.** Использование 1 трлн параметров с 32 млрд активируемых и 384 экспертов представляет один из вариантов компромисса между масштабом и эффективностью; исследуются альтернативы с различными схемами маршрутизации.<sup>[\[1\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K2paper-1)</sup>
- **Нативная мультимодальность.** Обучение K2.5 на смешанных визуально-текстовых данных с начала предобучения представляет подход к «нативной» мультимодальности, который сравнивается с двухэтапными схемами.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[9\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimivl-9)</sup>
- **Эффективный инференс и длинный контекст.** INT4-квантовка и поддержка контекста 256 000 токенов стимулируют дальнейшие исследования в области спарс-внимания, латентных представлений и внешней памяти. Отдельно описан проект **Kimi Linear** — гибридное линейное внимание с сокращением KV-кэша на 75 % и ускорением декодирования в 6 раз при контексте 1 млн токенов.<sup>[\[2\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-K25paper-2)[\[19\]](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_note-kimilinear-19)</sup>

В официальных материалах Moonshot AI не публикуются детальные дорожные карты по будущим версиям Kimi; перечисленные направления основаны на опубликованных исследованиях.

## См. также

- [Архитектура Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")
- [DeepSeek](https://systems-analysis.info/wiki/DeepSeek "DeepSeek")
- [Qwen](https://systems-analysis.info/wiki/Qwen "Qwen")

## Ссылки

- <a href="https://www.moonshot.ai/" class="external free" rel="nofollow">https://www.moonshot.ai/</a> — официальный сайт Moonshot AI
- <a href="https://platform.moonshot.ai/" class="external free" rel="nofollow">https://platform.moonshot.ai/</a> — Moonshot AI Open Platform (API)
- <a href="https://github.com/MoonshotAI/Kimi-K2.5" class="external free" rel="nofollow">https://github.com/MoonshotAI/Kimi-K2.5</a> — GitHub-репозиторий Kimi K2.5
- <a href="https://huggingface.co/moonshotai" class="external free" rel="nofollow">https://huggingface.co/moonshotai</a> — профиль Moonshot AI на Hugging Face

## Литература

- Kimi Team (2025). *Kimi K2: Open Agentic Intelligence*. arXiv:2507.20534. <a href="https://arxiv.org/abs/2507.20534" class="external free" rel="nofollow">https://arxiv.org/abs/2507.20534</a>
- Kimi Team (2026). *Kimi K2.5: Visual Agentic Intelligence*. arXiv:2602.02276. <a href="https://arxiv.org/abs/2602.02276" class="external free" rel="nofollow">https://arxiv.org/abs/2602.02276</a>
- Kimi Team (2025). *Kimi k1.5: Scaling Reinforcement Learning with LLMs*. arXiv:2501.12599. <a href="https://arxiv.org/abs/2501.12599" class="external free" rel="nofollow">https://arxiv.org/abs/2501.12599</a>
- Moonshot AI (2025). *Kimi-VL Technical Report*. arXiv:2504.07491. <a href="https://arxiv.org/abs/2504.07491" class="external free" rel="nofollow">https://arxiv.org/abs/2504.07491</a>
- Kimi Team (2025). *Kimi Linear: An Expressive, Efficient Attention Architecture*. arXiv:2510.26692. <a href="https://arxiv.org/abs/2510.26692" class="external free" rel="nofollow">https://arxiv.org/abs/2510.26692</a>
- Qin, R. et al. (2024). *Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving*. arXiv:2407.00079. <a href="https://arxiv.org/abs/2407.00079" class="external free" rel="nofollow">https://arxiv.org/abs/2407.00079</a>
- Vaswani, A. et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>

## Примечания

1.  <span id="cite_note-K2paper-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K2paper_1-27)</sup> Kimi Team (2025). *Kimi K2: Open Agentic Intelligence*. arXiv:2507.20534 \[cs.LG\], 28 июля 2025 (v2: 3 февраля 2026). <a href="https://arxiv.org/abs/2507.20534" class="external free" rel="nofollow">https://arxiv.org/abs/2507.20534</a></span>
2.  <span id="cite_note-K25paper-2">↑ <sup>[2,00](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-0)</sup> <sup>[2,01](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-1)</sup> <sup>[2,02](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-2)</sup> <sup>[2,03](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-3)</sup> <sup>[2,04](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-4)</sup> <sup>[2,05](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-5)</sup> <sup>[2,06](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-6)</sup> <sup>[2,07](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-7)</sup> <sup>[2,08](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-8)</sup> <sup>[2,09](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-9)</sup> <sup>[2,10](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-10)</sup> <sup>[2,11](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-11)</sup> <sup>[2,12](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-12)</sup> <sup>[2,13](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-13)</sup> <sup>[2,14](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-14)</sup> <sup>[2,15](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-15)</sup> <sup>[2,16](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-16)</sup> <sup>[2,17](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-17)</sup> <sup>[2,18](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-18)</sup> <sup>[2,19](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-19)</sup> <sup>[2,20](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-20)</sup> <sup>[2,21](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-21)</sup> <sup>[2,22](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-22)</sup> <sup>[2,23](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-23)</sup> <sup>[2,24](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-24)</sup> <sup>[2,25](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-25)</sup> <sup>[2,26](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-K25paper_2-26)</sup> Kimi Team (2026). *Kimi K2.5: Visual Agentic Intelligence*. arXiv:2602.02276 \[cs.CL\], 2 февраля 2026. <a href="https://arxiv.org/abs/2602.02276" class="external free" rel="nofollow">https://arxiv.org/abs/2602.02276</a></span>
3.  <span id="cite_note-HF_K25-3">[↑](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-HF_K25_3-0) Moonshot AI. *moonshotai/Kimi-K2.5*. Hugging Face. <a href="https://huggingface.co/moonshotai/Kimi-K2.5" class="external free" rel="nofollow">https://huggingface.co/moonshotai/Kimi-K2.5</a></span>
4.  <span id="cite_note-platform-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-platform_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-platform_4-1)</sup> <sup>[4,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-platform_4-2)</sup> Moonshot AI Open Platform. <a href="https://platform.moonshot.ai/" class="external free" rel="nofollow">https://platform.moonshot.ai/</a></span>
5.  <span id="cite_note-wiki_moonshot-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-wiki_moonshot_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-wiki_moonshot_5-1)</sup> *Moonshot AI*. Wikipedia (англ.). <a href="https://en.wikipedia.org/wiki/Moonshot_AI" class="external free" rel="nofollow">https://en.wikipedia.org/wiki/Moonshot_AI</a></span>
6.  <span id="cite_note-wiki_kimi_chatbot-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-wiki_kimi_chatbot_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-wiki_kimi_chatbot_6-1)</sup> <sup>[6,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-wiki_kimi_chatbot_6-2)</sup> *Kimi (chatbot)*. Wikipedia (англ.). <a href="https://en.wikipedia.org/wiki/Kimi_(chatbot)" class="external free" rel="nofollow">https://en.wikipedia.org/wiki/Kimi_(chatbot)</a></span>
7.  <span id="cite_note-moonshot_site-7">↑ <sup>[7,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-moonshot_site_7-0)</sup> <sup>[7,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-moonshot_site_7-1)</sup> Moonshot AI. Официальный сайт. <a href="https://www.moonshot.ai/" class="external free" rel="nofollow">https://www.moonshot.ai/</a></span>
8.  <span id="cite_note-k15paper-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-k15paper_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-k15paper_8-1)</sup> Kimi Team (2025). *Kimi k1.5: Scaling Reinforcement Learning with LLMs*. arXiv:2501.12599 \[cs.AI\], 22 января 2025. <a href="https://arxiv.org/abs/2501.12599" class="external free" rel="nofollow">https://arxiv.org/abs/2501.12599</a></span>
9.  <span id="cite_note-kimivl-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-1)</sup> <sup>[9,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-2)</sup> <sup>[9,3](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-3)</sup> <sup>[9,4](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-4)</sup> <sup>[9,5](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-5)</sup> <sup>[9,6](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-6)</sup> <sup>[9,7](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimivl_9-7)</sup> Moonshot AI (2025). *Kimi-VL Technical Report*. arXiv:2504.07491 \[cs.CV\], 10 апреля 2025. <a href="https://arxiv.org/abs/2504.07491" class="external free" rel="nofollow">https://arxiv.org/abs/2504.07491</a></span>
10. <span id="cite_note-HF_K2Thinking-10">↑ <sup>[10,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-HF_K2Thinking_10-0)</sup> <sup>[10,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-HF_K2Thinking_10-1)</sup> <sup>[10,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-HF_K2Thinking_10-2)</sup> <sup>[10,3](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-HF_K2Thinking_10-3)</sup> Moonshot AI. *moonshotai/Kimi-K2-Thinking*. Hugging Face Model Card, 26 января 2026. <a href="https://huggingface.co/moonshotai/Kimi-K2-Thinking" class="external free" rel="nofollow">https://huggingface.co/moonshotai/Kimi-K2-Thinking</a></span>
11. <span id="cite_note-mooncake-11">↑ <sup>[11,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-mooncake_11-0)</sup> <sup>[11,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-mooncake_11-1)</sup> Qin, R. et al. (2024). *Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving*. arXiv:2407.00079 \[cs.DC\]. <a href="https://arxiv.org/abs/2407.00079" class="external free" rel="nofollow">https://arxiv.org/abs/2407.00079</a></span>
12. <span id="cite_note-Vaswani2017-12">↑ <sup>[12,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-Vaswani2017_12-0)</sup> <sup>[12,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-Vaswani2017_12-1)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
13. <span id="cite_note-nvidia_nim-13">↑ <sup>[13,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-nvidia_nim_13-0)</sup> <sup>[13,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-nvidia_nim_13-1)</sup> <sup>[13,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-nvidia_nim_13-2)</sup> <sup>[13,3](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-nvidia_nim_13-3)</sup> NVIDIA. *kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card)*. 26 января 2026. <a href="https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard" class="external free" rel="nofollow">https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard</a></span>
14. <span id="cite_note-importai-14">↑ <sup>[14,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-importai_14-0)</sup> <sup>[14,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-importai_14-1)</sup> <sup>[14,2](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-importai_14-2)</sup> Import AI (Jack Clark). *Import AI 421: Kimi 2 — a great Chinese open weight model*. 20 июля 2025. <a href="https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese" class="external free" rel="nofollow">https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese</a></span>
15. <span id="cite_note-deeplearning_batch-15">↑ <sup>[15,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-deeplearning_batch_15-0)</sup> <sup>[15,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-deeplearning_batch_15-1)</sup> DeepLearning.ai. *Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents*. The Batch, 9 февраля 2026. <a href="https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/" class="external free" rel="nofollow">https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/</a></span>
16. <span id="cite_note-github_k25-16">↑ <sup>[16,0](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-github_k25_16-0)</sup> <sup>[16,1](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-github_k25_16-1)</sup> MoonshotAI. *MoonshotAI/Kimi-K2.5*. GitHub. <a href="https://github.com/MoonshotAI/Kimi-K2.5" class="external free" rel="nofollow">https://github.com/MoonshotAI/Kimi-K2.5</a></span>
17. <span id="cite_note-baseten-17">[↑](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-baseten_17-0) Baseten. *Kimi K2 Explained: The 1 Trillion Parameter Model*. 17 июля 2025. <a href="https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/" class="external free" rel="nofollow">https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/</a></span>
18. <span id="cite_note-bismarck-18">[↑](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-bismarck_18-0) Bismarck Analysis. *AI 2026: China's Moonshot AI Contends For Technical…*. 23 сентября 2025. <a href="https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends" class="external free" rel="nofollow">https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends</a></span>
19. <span id="cite_note-kimilinear-19">[↑](https://systems-analysis.info/wiki/Kimi_(Moonshot_AI)#cite_ref-kimilinear_19-0) Kimi Team (2025). *Kimi Linear: An Expressive, Efficient Attention Architecture*. arXiv:2510.26692. <a href="https://arxiv.org/abs/2510.26692" class="external free" rel="nofollow">https://arxiv.org/abs/2510.26692</a></span>
