Kimi (Moonshot AI) (KO)
Kimi (Moonshot AI 모델 시리즈) — 중국 기업 Moonshot AI(베이징, 중화인민공화국)가 텍스트 및 멀티모달 생성, 프로그래밍, 에이전트 시스템(agentic systems — 외부 도구를 사용하여 자율적 계획, 추론 및 행동이 가능한 시스템)을 위해 개발하는 대형 언어 모델(Large Language Model, LLM) 시리즈입니다. 이 시리즈는 약 1조 개의 파라미터 규모와 토큰당 약 320억 개의 활성화 파라미터를 가진 Mixture-of-Experts(MoE, 혼합 전문가) 아키텍처의 텍스트 및 멀티모달 모델을 포함합니다.[1][2] 시리즈의 중요한 특징은 에이전트 행동(외부 도구 호출을 포함한 다단계 계획)에 대한 지향성과 Kimi K2 및 Kimi K2.5 버전에서 최대 256,000 토큰의 긴 컨텍스트 지원입니다.[1][2]
Kimi 시리즈 모델은 수정된 MIT 라이선스 하에 Hugging Face 플랫폼에서 개방형 가중치(open-weight) 방식으로 배포되기도 하고, Moonshot AI Open Platform의 독점 API를 통해서도 제공됩니다.[3][4]
역사와 배경
Moonshot AI 설립
Moonshot AI는 2023년 3월 베이징에서 양즈린(Yang Zhilin, CEO), 저우신위(Zhou Xinyu), 우위신(Wu Yuxin) — 칭화대학교(Tsinghua University) 졸업생들 — 에 의해 설립되었습니다. 양즈린은 이전에 Google Brain과 Meta에서 근무하며 컴퓨터 비전 및 추론 연구에 참여했습니다. 회사는 Alibaba(2024년 2월 10억 달러 규모 라운드), Tencent 및 기타 투자자들로부터 자금을 조달했습니다.[5][6]
주요 릴리스 연혁
- 2023년 10–11월 — 최대 128,000 토큰(중국어 한자 최대 200,000자) 컨텍스트를 지원하는 챗봇 Kimi 출시. 초기 버전은 기술적 세부 사항이 제한적으로 공개된 독점 모델을 사용했습니다.[6][7]
- 2024년 3월 — 베타 버전에서 컨텍스트를 200만 한자로 확장.[6]
- 2025년 1월 — 수학, 프로그래밍, 멀티모달 추론 과제에서 OpenAI o1과 유사한 성능을 갖는다고 발표된 스케일된 강화 학습(Reinforcement Learning, RL)을 적용한 멀티모달 모델 Kimi k1.5 출시. 컨텍스트 최대 128,000 토큰.[8]
- 2025년 4월 — MoonViT 시각 인코더(~4억 파라미터)와 디코더의 ~28억 활성 파라미터를 갖춘 개방형 멀티모달 MoE 모델(vision-language model, VLM) Kimi-VL 발표. 기술 보고서가 arXiv에 게재됨.[9]
- 2025년 7월 — 1조 개의 총 파라미터와 320억 개의 활성 파라미터를 갖는 주요 개방형 MoE 모델 Kimi K2 출시. 기술 보고서가 arXiv에 게재됨.[1] 출시 당시 LMSYS Chatbot Arena에서 개방형 모델 중 1위를 차지했습니다(3,000표 이상).[1]
- 2025년 9월 — 컨텍스트가 256,000 토큰으로 확장되고 에이전트 코딩이 개선된 Kimi-K2-Instruct-0905 업데이트.[1]
- 2025년 11월 — 강화된 단계별 추론(chain-of-thought)과 최대 200–300회의 연속적인 도구 호출(tool calls) 지원을 갖춘 Kimi K2 Thinking 출시.[10]
- 2026년 1월 — 네이티브 멀티모달리티와 Agent Swarm 메커니즘(서브 에이전트의 병렬 오케스트레이션)을 갖춘 멀티모달 MoE 모델 Kimi K2.5 발표.[2]
모델 개발과 병행하여 2024년에는 긴 컨텍스트를 가진 LLM 서빙을 위한 KVCache 중심의 분리형 아키텍처인 독자적 인퍼런스 서비스 Mooncake가 발표되었습니다.[11]
이론적 기반 및 아키텍처
Mixture-of-Experts 아키텍처
Kimi K2 및 K2.5 시리즈 모델은 개별 레이어에 Mixture-of-Experts를 적용한 Transformer 아키텍처를 구현합니다. 표준 트랜스포머 블록은 잔차 연결을 갖춘 다중 헤드 자기 주의(Multi-Head Attention, MHA) 레이어와 위치별 MLP(다층 퍼셉트론)의 합성으로 구성됩니다:[1][12]
여기서 는 입력 토큰 표현, 은 시퀀스 길이, 는 은닉 상태 크기입니다.
MoE 레이어에서는 단일 MLP 대신 각각이 파라미터 를 가진 별도의 MLP를 구성하는 전문가 집합 가 사용됩니다. 라우터(gating network)는 각 토큰에 대해 전문가 부분 집합을 선택합니다. 표현 을 가진 토큰에 대한 MoE 레이어의 출력은 다음과 같이 정의됩니다:[1]
여기서 는 해당 토큰에 선택된 전문가 집합, 은 정규화된 라우터 가중치, 입니다. 라우팅 함수는 TopK 연산을 통해 전문가를 선택합니다:[1]
여기서 은 학습 가능한 라우터 행렬입니다. 이 방식은 각 토큰에서 활성화되는 파라미터 수를 제한하면서 총 파라미터 수를 확장할 수 있게 합니다.
Kimi K2 / K2.5 아키텍처 하이퍼파라미터
| 파라미터 | 값 |
|---|---|
| 아키텍처 유형 | Mixture-of-Experts를 적용한 Transformer |
| 총 파라미터 수 | 1.04조 |
| 토큰당 활성화 파라미터 | 320억 |
| 레이어 수 | 61 (1개 밀집 + 60개 MoE) |
| 은닉 상태 크기 | 7168 |
| 어텐션 헤드 수 | 64 |
| 전문가 수 | 384 (토큰당 8개 선택 + 1개 공유) |
| 전문가 은닉 상태 크기 (MoE hidden size) | 2048 |
| 어휘 크기 | 160,000 토큰 |
| 활성화 함수 | SwiGLU |
| 어텐션 메커니즘 | Multi-head Latent Attention (MLA) |
| 최대 컨텍스트 | 256,000 토큰 (YaRN을 통한 확장) |
| 시각 인코더 (K2.5) | MoonViT-3D, ~4억 파라미터 |
희소성(총 전문가 수 대 활성화 수의 비율)은 48:1(전문가 384개, 활성 8개)로, 동일한 규모의 밀집(dense) 모델 대비 계산 비용을 크게 줄여줍니다.[1]
Multi-head Latent Attention (MLA) 메커니즘
Kimi K2/K2.5 시리즈 모델에는 효율성과 확장성 향상을 목표로 한 표준 다중 헤드 어텐션의 변형인 Multi-head Latent Attention(MLA) 메커니즘이 사용됩니다. 단일 레이어에 대한 표준 어텐션은 다음과 같이 계산됩니다:[12]
여기서 는 쿼리, 키, 값 행렬입니다. MLA에서는 쿼리와 키가 투영되는 잠재 표현이 도입되어 중간 연산의 차원을 줄이고 KV 캐시 크기를 감소시킵니다. 이 접근 방식은 DeepSeek-V3에서 사용된 메커니즘과 유사합니다.[1][13]
MuonClip 옵티마이저 및 QK-clip
Kimi K2 모델 학습을 위해 MoE 아키텍처를 가진 대형 언어 모델의 학습 안정화를 위해 QK-clip 기법을 추가한 Muon 옵티마이저(Newton-Schulz 정규화를 갖춘 모멘텀 옵티마이저)의 변형인 MuonClip 옵티마이저가 제안되었습니다.[1]
QK-clip은 클리핑(clipping) 연산을 통해 어텐션 로짓 에 제한을 적용합니다. 각 어텐션 헤드 에 대해 최대 로짓이 정의됩니다:
그리고 스케일링 계수가 계산됩니다:
여기서 은 임계값 하이퍼파라미터, 은 어텐션 헤드 크기입니다. 최대 로짓이 임계값을 초과하는 경우 계수 가 가중치 스케일링에 적용됩니다. 이는 softmax 이전 로짓 값의 범위를 제한하고 대규모 학습 시 급격한 손실 급등(loss spikes) 위험을 줄입니다.[1]
저자들에 따르면 MuonClip을 사용한 Kimi K2의 15.5조 토큰 사전 학습 동안 단 한 건의 손실 함수 급등도 기록되지 않았습니다(zero loss spikes).[1]
멀티모달리티 및 MoonViT
Kimi K2.5 및 Kimi-VL 모델은 NaViT 패킹(가변 해상도 입력 이미지 지원)과 비디오 처리를 위한 3D 확장(4프레임 그룹화)을 갖춘 SigLIP-SO-400M 기반으로 구축된 약 4억 개의 파라미터를 가진 시각 인코더 MoonViT(K2.5 버전에서는 MoonViT-3D)를 사용합니다.[2][9]
시각 인코더는 입력 이미지와 비디오를 시각 토큰 시퀀스로 변환합니다. 를 입력 이미지, 를 시각 인코더라 하면:
이후 선형 투영(2층 MLP) 을 통해:
여기서 는 모델의 언어 부분 은닉 공간 크기입니다. 멀티모달 모드에서 은 텍스트 토큰과 연결(concatenate)되어 트랜스포머에 입력됩니다.[9][2]
텍스트 모델 위에 시각 어댑터를 추가하는 2단계 방식과 달리, K2.5는 사전 학습 초기부터 혼합 시각-텍스트 데이터(joint text-vision pre-training)로 학습되었으며, 초기 단계에서는 시각 토큰 비율이 낮고(~10%) 점차 증가합니다. 총 규모는 약 15조 개의 혼합 시각-텍스트 토큰입니다.[2]
사전 학습 및 사후 학습
사전 학습
Kimi K2는 MuonClip 옵티마이저를 사용하여 15.5조 토큰(웹 텍스트, 코드, 수학, 백과사전적 지식)으로 사전 학습되었습니다. 전체 사전 학습 기간 동안 단 한 건의 손실 급등(loss spike)도 기록되지 않았습니다.[1]
Kimi K2.5는 K2 체크포인트에서 모달리티 공동 최적화(joint pre-training)를 통해 추가적인 ~15조 개의 혼합 시각-텍스트 토큰으로 지속적 사전 학습(continual pre-training)을 거쳤습니다. 별도로 1조 토큰의 시각 인코더 독립 학습과 컨텍스트 확장을 위한 추가적인 long-context mid-training 단계가 수행되었습니다.[2]
사후 학습
K2 시리즈 모델의 사후 학습은 여러 단계로 구성됩니다:[1][2]
Supervised Fine-Tuning (SFT, 지도 미세 조정):
- 합성 에이전트 궤적(agentic data synthesis) — 도구 사양 생성, 환경과의 상호 작용 시뮬레이션, 결과 검증.
- K2.5의 경우 추가로 zero-vision SFT가 적용됨 — 미세 조정 단계에서 이미지를 직접 사용하지 않고 시각적 능력을 활성화하는 텍스트 SFT.
Reinforcement Learning (RL, 강화 학습):
- 수학, 코드, 안전성 과제를 위한 검증 가능한 보상(Reinforcement Learning with Verifiable Rewards, RLVR)의 조합.
- 루브릭 기반 자기 평가(self-critique rubric rewards) — 에이전트 시나리오 품질 자동 평가를 위한 LLM 평가자 활용.
- K2.5의 경우 — 공동 멀티모달 RL(joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking 및 K2.5는 NVIDIA Hopper 아키텍처에 최적화된 네이티브 INT4 가중치 양자화(weight-only quantization, 그룹 32, 압축 텐서)를 지원하여 추론 시 메모리 요구 사항을 줄입니다.[10][2]
Agent Swarm (K2.5)
K2.5 모델을 위해 자기 주도적 병렬 에이전트 오케스트레이션 프레임워크인 Agent Swarm 메커니즘이 개발되었습니다. 오케스트레이터 모델은 동적으로 서브 에이전트를 생성하고(create_subagent, assign_task 연산을 통해), 하위 과제를 분배하고 결과를 수집합니다. 각 서브 에이전트는 독립적으로 도구를 호출하고 다른 서브 에이전트와 병렬로 작업할 수 있습니다.[2]
Agent Swarm 메커니즘의 학습은 실행/최적화 분리(decoupling execution/optimization)를 통한 Parallel-Agent Reinforcement Learning (PARL)로 구현됩니다. 저자들에 따르면 Agent Swarm은 단일 에이전트 모드(single-agent) 대비 최대 4.5배의 지연(latency) 감소를 제공합니다.[2]
주요 모델 시리즈
| 모델 | 유형 | 파라미터 수 (총계 / 활성) | 컨텍스트, 토큰 | 멀티모달리티 | 출시일 |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | 미공개 | 128,000 | 예 (제한적) | 2025년 1월 |
| Kimi-VL | VLM, MoE | 컴팩트 / ~28억 활성 + 4억 ViT | 긴 컨텍스트 | 예 (이미지) | 2025년 4월 |
| Kimi K2 | LLM, MoE | 1.04조 / 320억 | 256,000 | 아니요 (텍스트) | 2025년 7월 |
| Kimi K2 Thinking | LLM, MoE | 1.04조 / 320억 | 256,000 | 아니요 (텍스트) | 2025년 11월 |
| Kimi K2.5 | VLM-LLM, MoE | 1.04조 / 320억 | 256,000 | 예 (이미지, 비디오, PDF) | 2026년 1월 |
Kimi K2
Kimi K2는 총 1.04조 개의 파라미터와 토큰당 320억 개의 활성화 파라미터를 가진 Mixture-of-Experts LLM입니다. MuonClip 옵티마이저를 사용하여 15.5조 토큰으로 사전 학습되었습니다. 아키텍처에는 384개의 전문가와 긴 컨텍스트와 호환되는 MLA 메커니즘이 포함됩니다. 모델은 프로그래밍, 수학적 추론, 연속적인 도구 호출을 포함한 에이전트 시나리오 과제에 특화되어 있습니다.[1]
기술 보고서에는 다단계 사후 학습 파이프라인이 설명되어 있습니다: 도구와의 상호 작용 시뮬레이션을 통한 대규모 에이전트 데이터 합성, 실제 및 합성 과제의 혼합 환경에서의 강화 학습, 품질 자동 평가를 위한 LLM 평가자 활용.[1][14]
Kimi K2 Thinking
Kimi K2 Thinking 변형은 동적 도구 호출 기능과 최대 256,000 토큰의 컨텍스트 지원을 갖춘 다단계 추론(chain-of-thought)에 최적화되어 있습니다. 모델은 내부 추론을 포함하는 reasoning_content 필드가 명시적으로 반환되는 별도의 'Thinking' 모드를 구현합니다. K2 Thinking은 행동 저하 없이 단일 에이전트 에피소드 내에서 200–300회의 연속적인 도구 호출을 지원하며, QAT를 사용한 네이티브 INT4 양자화도 지원합니다.[10]
Kimi-VL
Kimi-VL은 시각적 이해, 시각-텍스트 추론, 실제 장면 과제를 위한 개방형 멀티모달 MoE VLM(vision-language model)입니다. 모델은 MoonViT 시각 인코더를 갖춘 컴팩트한 MoE 아키텍처로 설명됩니다. 기술 보고서는 2025년 4월 arXiv에 게재되었습니다.[9]
Kimi K2.5
Kimi K2.5는 1.04조 개의 파라미터와 320억 개의 활성화 파라미터를 가진 멀티모달 MoE 모델로, ~15조 개의 혼합 시각-텍스트 토큰으로 지속적 사전 학습된 Kimi-K2-Base 체크포인트를 기반으로 합니다. 모델은 최대 256,000 토큰의 컨텍스트로 이미지, 비디오, PDF, 텍스트 입력을 지원합니다.[2]
K2.5는 두 가지 주요 추론 모드를 지원합니다:
- Thinking mode — 명시적인
reasoning_content와 다단계 생성을 포함; - Instant mode — 추론 출력 없이 더 낮은 지연(latency)으로 실행.[2][13]
모델은 NVIDIA Hopper 아키텍처에 최적화된 네이티브 INT4 가중치 양자화(weight-only, 그룹 32)를 구현합니다.[2]
주요 결과 및 벤치마크
Kimi K2의 텍스트 및 에이전트 벤치마크
결과는 기술 보고서의 데이터를 기준으로 non-thinking 모드(확장된 chain-of-thought 없음)에서 Kimi-K2-Instruct에 대해 제공됩니다.[1]
| 벤치마크 | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | 출처 |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65.8% | 38.8% | 72.5% / 72.7% | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47.3% | 20.9% | 51.0% | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53.7% | 44.7% | 46.9% | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66.1% | 48.8% | 66.1% | arXiv:2507.20534 |
| ACEBench (En) | 76.5% | 75.6% | 80.1% | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49.5% | 33.9% | 46.7% | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75.1% | 68.2% | 74.9% | arXiv:2507.20534 |
저자들에 따르면 이러한 결과는 K2를 특히 엔지니어링 및 에이전트 과제에서 thinking 전개 없는 모드의 개방형 모델 선두 그룹에 위치시킵니다(보고서 게재 시점 기준).[1]
Kimi-VL 벤치마크
| 벤치마크 | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | 출처 |
|---|---|---|---|---|
| MMVet (정확도) | 66.7% | 67.1% | 66.9% | arXiv:2504.07491 |
| RealWorldQA | 68.1% | 68.5% | — | arXiv:2504.07491 |
결과는 컴팩트한 멀티모달 MoE 아키텍처가 더 적은 활성 파라미터로 더 큰 모델과 비슷한 수준을 달성함을 보여줍니다.[9]
Kimi K2.5 벤치마크
결과는 NVIDIA NIM 플랫폼의 모델 카드 및 기술 보고서의 데이터를 기준으로 Thinking 모드(temperature = 1.0; top-p = 0.95; 컨텍스트 256,000 토큰; vLLM 엔진; 하드웨어 플랫폼 NVIDIA H200)에서 제공됩니다.[2][13]
| 카테고리 | 벤치마크 | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (도구 없이) | 30.1 |
| HLE-Full (도구 포함) | 50.2 | |
| AIME 2025 | 96.1 | |
| HMMT 2025 (Feb) | 95.4 | |
| GPQA-Diamond | 87.6 | |
| MMLU-Pro | 87.1 | |
| Vision & Video | MMMU-Pro | 78.5 |
| MathVision | 84.2 | |
| MathVista (mini) | 90.1 | |
| OCRBench | 92.3 | |
| OmniDocBench 1.5 | 88.8 | |
| VideoMMMU | 86.6 | |
| LongVideoBench | 79.8 | |
| Coding | SWE-Bench Verified | 76.8 |
| SWE-Bench Pro | 50.7 | |
| SWE-Bench Multilingual | 73.0 | |
| Terminal Bench 2.0 | 50.8 | |
| PaperBench | 63.5 | |
| LiveCodeBench v6 | 85.0 | |
| OJBench (C++) | 57.4 | |
| Long Context | Longbench v2 | 61.0 |
| AA-LCR | 70.0 | |
| Agentic Search | BrowseComp | 60.6 |
| BrowseComp (Agent Swarm) | 78.4 | |
| WideSearch (iter-F1) | 72.7 | |
| DeepSearchQA | 77.1 |
추가로 K2.5는 시각 학습의 텍스트 과제로의 긍정적 전이를 보여줍니다: 텍스트 기반 모델 K2 대비 MMLU-Pro에서 +1.7%, GPQA-Diamond에서 +2.1%.[2]
최종 비교 평가는 지표 및 시나리오 선택에 따라 달라집니다; 결과는 저자들의 데이터에 기반합니다. 게재 시점에서 일부 벤치마크의 독립적 검증은 제한적입니다.[2][15]
활용
텍스트 어시스턴트 및 검색
Kimi 플랫폼은 긴 문서(연구 보고서, 재무 데이터) 처리, 자동화된 분석, 정보 집계를 통한 온라인 검색을 지원하는 어시스턴트로 사용됩니다. Moonshot AI는 Kimi가 단일 에이전트 시나리오 내에서 300회 이상의 도구 호출(tool calls)을 지원한다고 밝히고 있습니다.[7][4]
프로그래밍 및 엔지니어링 과제
Kimi K2 및 K2.5는 SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench 및 기타 프로그래밍 벤치마크에서 높은 결과를 보여줍니다. 모델은 저장소의 버그 수정 자동화, 코드 생성 및 리팩토링, 온라인 저지 과제 해결(OJBench, LiveCodeBench)에 활용됩니다. K2 기술 보고서는 모델이 버전 관리 시스템, 패키지 매니저, 실행 환경과의 상호 작용을 포함한 대규모 합성 에이전트 코퍼스로 학습되었다고 명시합니다.[1][2][14]
멀티모달 응용
Kimi-VL 및 K2.5는 이미지 및 문서의 시각적 질의응답(VQA), 문서 이해(OCRBench, OmniDocBench), 비디오 분석(VideoMMMU, LongVideoBench), 시각적 사양에 기반한 프로그래밍 복합 과제(예: 이미지 레이아웃에 따른 인터페이스 생성)를 위해 설계되었습니다. K2.5에 대해서는 'vision-grounded coding' 및 'autonomous visual debugging' 시나리오가 설명되어 있으며, 모델이 시각적 설명을 바탕으로 코드를 생성하고 시각적 결과를 반복적으로 분석합니다.[2][9][15]
API 및 배포
모델은 도구 호출(tool calling), thinking 모드, JSON 모드, 컨텍스트 캐싱을 지원하는 Moonshot AI Open Platform API를 통해 이용할 수 있습니다. 개방형 가중치는 vLLM, SGLang, TensorRT-LLM을 통한 로컬 배포에 사용됩니다. Mooncake 서비스는 긴 컨텍스트의 인퍼런스 확장을 지원합니다.[4][11][16]
한계 및 미해결 문제
리소스 요구 사항
320억 개의 활성 파라미터와 INT4 양자화를 적용하더라도, 1조 파라미터 규모의 MoE 모델은 상당한 메모리와 대역폭을 필요로 합니다. Kimi K2.5 배포에 관한 엔지니어링 논의에서는 모델 전체 로드를 위해 수백 기가바이트의 비디오 메모리가 필요하다는 추정이 언급됩니다; 구체적인 수치는 양자화 방식과 프레임워크(vLLM, SGLang 등)에 따라 달라집니다.[2][17]
환각 및 생성 품질
다른 LLM과 마찬가지로 Kimi 시리즈 모델도 환각(hallucination)에 취약합니다. FACTS Grounding 및 FaithJudge 테스트 보고서에서 RAG 시나리오의 환각률은 1.1–7.4% 범위로 기록되었습니다. non-thinking 모드에서 모델은 도구 사양이 불명확할 경우 불필요한 토큰을 생성할 수 있으며, 강제적인 tool-use 활성화 시 일부 과제에서 성능이 저하됩니다.[1]
합성 데이터 및 RL 파이프라인 의존성
에이전트 데이터 합성 및 강화 학습 파이프라인은 대규모 합성 도구 및 장면 컬렉션과 자동 평가(self-judging)를 위한 LLM 평가자에 의존합니다. 이러한 방식은 다음과 같은 열린 질문을 제기합니다: 자기 평가의 편향(bias) 안정성; 다중 반복(bootstrap) 시 잠재적 성능 저하; 시뮬레이션된 환경과 다른 실제 환경으로의 에이전트 기술 전이; 합성 과제 분포가 일반화 능력에 미치는 영향.[1][14]
투명성 및 재현성
학습 데이터 구성, 필터링 프로세스, 언어 및 도메인 분포에 관한 일부 정보는 공개되지 않거나 제한적으로만 공개됩니다. 이는 편향의 원인에 대한 정확한 평가, 학습의 재현성, 개별 구성 요소(MuonClip, QK-clip)가 안정성에 미치는 영향의 독립적 검증을 어렵게 합니다. 2026년 2월 기준으로 제3자에 의한 Kimi K2 및 K2.5 학습의 완전한 재현은 공개 문헌에 기록되지 않았습니다.[1][2]
윤리적 및 규제적 측면
모델 카드 및 기술 보고서에서는 개발자가 모델의 입출력에 대한 책임을 진다고 강조합니다; 구현 전에 안전 메커니즘(guardrails)을 추가하고 특정 사례의 데이터로 테스트해야 합니다; 모델은 개인 데이터를 잠재적으로 포함할 수 있는 이미지와 비디오를 처리할 수 있으며, 통합자는 관련 법률을 준수할 의무가 있습니다.[2][16]
기술 보고서에서는 Promptfoo와 같은 도구를 사용한 안전성 평가(생물학적, 화학적, 사이버 위험)가 설명되어 있습니다. 모델은 검증 가능한 보상과 자기 평가를 통한 RL 정렬(alignment)을 거칩니다.[1]
중국 기업의 제품으로서 모델은 AI 분야에서 중화인민공화국의 국가 규정을 따릅니다. 작성 시점에서 Kimi 모델만을 전적으로 다루는 별도의 공개 규제 문서는 발견되지 않았으며; 규제는 관련 관할권의 생성 모델 및 AI에 대한 일반적인 접근 방식 내에서 이루어집니다.[18]
2026년 2월 Anthropic社는 Moonshot AI가(다른 중국 개발자들과 함께) 모델 학습을 위한 데이터 증류 목적으로 Claude와의 상호 작용을 생성하기 위해 가짜 계정을 사용했다고 주장했습니다. 이 정보는 일방적인 주장의 성격을 띠며, 게재 시점에서 독립적인 조사로 확인되지 않았습니다; Moonshot AI는 공식 답변을 게재하지 않았습니다.[5]
전망 및 연구 방향
공개된 자료를 바탕으로 몇 가지 추가 연구 방향을 식별할 수 있습니다:
- 확장 가능한 에이전트 시스템. 합성 도구, RL, self-judging을 활용한 에이전트 시스템으로서 LLM 학습 접근 방식의 발전. 더 많은 서브 에이전트와 새로운 유형의 과제로 Agent Swarm 확장.[2][1]
- 효율적인 MoE 아키텍처. 320억 활성 파라미터와 384개 전문가를 가진 1조 파라미터 사용은 규모와 효율성 사이의 균형의 한 가지 옵션을 나타냅니다; 다양한 라우팅 방식의 대안이 연구되고 있습니다.[1]
- 네이티브 멀티모달리티. 사전 학습 초기부터 혼합 시각-텍스트 데이터로 K2.5를 학습하는 것은 2단계 방식과 비교되는 '네이티브' 멀티모달리티 접근 방식을 나타냅니다.[2][9]
- 효율적인 인퍼런스 및 긴 컨텍스트. INT4 양자화와 256,000 토큰 컨텍스트 지원은 희소 어텐션, 잠재 표현, 외부 메모리 분야의 추가 연구를 자극합니다. 별도로 KV 캐시를 75% 줄이고 100만 토큰 컨텍스트에서 디코딩을 6배 가속하는 하이브리드 선형 어텐션 프로젝트 Kimi Linear가 설명되어 있습니다.[2][19]
Moonshot AI의 공식 자료에서는 Kimi의 향후 버전에 대한 상세한 로드맵이 공개되지 않습니다; 나열된 방향들은 게재된 연구를 기반으로 합니다.
같이 보기
- Transformer 아키텍처
- DeepSeek
- Qwen
외부 링크
- https://www.moonshot.ai/ — Moonshot AI 공식 웹사이트
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — Kimi K2.5 GitHub 저장소
- https://huggingface.co/moonshotai — Hugging Face의 Moonshot AI 프로필
참고 문헌
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
각주
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692