Kimi (Moonshot AI) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (seri model Moonshot AI) — seri Large Language Model (LLM) yang dikembangkan oleh perusahaan Tiongkok Moonshot AI (Beijing, RRT) untuk tugas-tugas generasi teks dan multimodal, pemrograman, serta sistem agentik (agentic systems — sistem yang mampu melakukan perencanaan otonom, penalaran, dan tindakan menggunakan alat eksternal). Keluarga ini mencakup model teks dan multimodal dengan arsitektur Mixture-of-Experts (MoE) berskala sekitar 1 triliun parameter dan subset yang diaktifkan sekitar 32 miliar parameter per token.[1][2] Fitur penting dari seri ini adalah orientasi pada perilaku agentik (perencanaan multi-langkah dengan pemanggilan alat eksternal) dan dukungan konteks panjang hingga 256.000 token pada versi Kimi K2 dan Kimi K2.5.[1][2]

Model seri Kimi didistribusikan baik dengan bobot terbuka (open-weight) di platform Hugging Face di bawah lisensi MIT yang dimodifikasi, maupun melalui API proprietari platform Moonshot AI Open Platform.[3][4]

Sejarah dan Latar Belakang

Pendirian Moonshot AI

Moonshot AI didirikan pada Maret 2023 di Beijing oleh Yang Zhilin (CEO), Zhou Xinyu, dan Wu Yuxin — lulusan Universitas Tsinghua (Tsinghua University). Yang Zhilin sebelumnya bekerja di Google Brain dan Meta, berpartisipasi dalam penelitian di bidang computer vision dan penalaran. Perusahaan ini menerima pendanaan dari Alibaba (putaran senilai $1 miliar, Februari 2024), Tencent, dan investor lainnya.[5][6]

Kronologi Rilis Utama

  • Oktober–November 2023 — peluncuran chatbot Kimi dengan dukungan konteks hingga 128 ribu token (hingga 200 ribu karakter Tionghoa). Versi pertama menggunakan model proprietari dengan detail teknis yang terbatas.[6][7]
  • Maret 2024 — perluasan konteks hingga 2 juta karakter Tionghoa dalam versi beta.[6]
  • Januari 2025 — rilis Kimi k1.5 — model multimodal dengan pelatihan Reinforcement Learning (RL) yang diskalakan, diklaim setara dengan OpenAI o1 dalam tugas matematika, pemrograman, dan penalaran multimodal. Konteks hingga 128 ribu token.[8]
  • April 2025 — diperkenalkan Kimi-VL — model MoE multimodal terbuka (vision-language model, VLM) dengan encoder visual MoonViT (~400 juta parameter) dan ~2,8 miliar parameter aktif di decoder. Laporan teknis diterbitkan di arXiv.[9]
  • Juli 2025 — rilis Kimi K2 — model MoE terbuka utama dengan 1 triliun parameter dan 32 miliar parameter aktif. Laporan teknis diterbitkan di arXiv.[1] Model ini menduduki peringkat pertama di antara model terbuka pada LMSYS Chatbot Arena pada saat rilis (lebih dari 3000 suara).[1]
  • September 2025 — pembaruan Kimi-K2-Instruct-0905 dengan konteks yang diperluas hingga 256 ribu token dan peningkatan pengkodean agentik.[1]
  • November 2025 — rilis Kimi K2 Thinking — versi dengan penalaran langkah-demi-langkah yang diperkuat (chain-of-thought) dan dukungan 200–300 pemanggilan alat (tool calls) secara berurutan.[10]
  • Januari 2026 — diperkenalkan Kimi K2.5 — model MoE multimodal dengan multimodalitas native dan mekanisme Agent Swarm (orkestrasi paralel sub-agen).[2]

Bersamaan dengan pengembangan model, pada tahun 2024 diperkenalkan layanan inferens sendiri Mooncake — arsitektur disagregasi berbasis KVCache untuk melayani LLM dengan konteks panjang.[11]

Landasan Teori dan Arsitektur

Arsitektur Mixture-of-Experts

Model seri Kimi K2 dan K2.5 mengimplementasikan arsitektur Transformer dengan Mixture-of-Experts pada lapisan tertentu. Blok transformer standar merupakan komposisi lapisan Multi-Head Attention (MHA) dan MLP (multilayer perceptron) posisi-wise dengan koneksi residual:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

di mana 𝐇L×d — representasi token masukan, L — panjang urutan, d — ukuran hidden state.

Pada lapisan MoE, alih-alih satu MLP digunakan sekumpulan pakar {Ei}i=1N, masing-masing merupakan MLP terpisah dengan parameter θi. Router (gating network) untuk setiap token memilih subset pakar. Output lapisan MoE untuk token dengan representasi 𝐡 didefinisikan sebagai:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

di mana 𝒮(𝐡){1,,N} — himpunan pakar yang dipilih untuk token tersebut, gi(𝐡) — bobot router yang dinormalisasi, i𝒮gi=1. Fungsi routing memilih pakar melalui operasi TopK:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

di mana Wg — matriks router yang dapat dilatih. Skema ini memungkinkan penskalaan jumlah parameter total dengan jumlah parameter yang diaktifkan per token yang terbatas.

Hiperparameter Arsitektur Kimi K2 / K2.5

Parameter Nilai
Jenis arsitektur Transformer dengan Mixture-of-Experts
Jumlah total parameter 1,04 triliun
Parameter yang diaktifkan per token 32 miliar
Jumlah lapisan 61 (1 lapisan padat + 60 MoE)
Ukuran hidden state 7168
Jumlah head attention 64
Jumlah pakar 384 (8 dipilih per token + 1 bersama)
Ukuran hidden state pakar (MoE hidden size) 2048
Ukuran kosakata 160.000 token
Fungsi aktivasi SwiGLU
Mekanisme attention Multi-head Latent Attention (MLA)
Konteks maksimum 256.000 token (perluasan melalui YaRN)
Encoder visual (K2.5) MoonViT-3D, ~400 juta parameter

[1][2][13]

Sparsity (rasio jumlah pakar total terhadap yang diaktifkan) adalah 48:1 (384 pakar, 8 aktif), yang memberikan pengurangan signifikan dalam biaya komputasi dibandingkan model padat (dense) dengan skala yang sama.[1]

Mekanisme Multi-head Latent Attention (MLA)

Model seri Kimi K2/K2.5 menggunakan mekanisme Multi-head Latent Attention (MLA) — modifikasi dari attention multi-head standar yang bertujuan meningkatkan efisiensi dan skalabilitas. Attention standar untuk satu lapisan dihitung sebagai:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

di mana 𝐐,𝐊,𝐕L×dk — matriks query, key, dan value. Pada MLA diperkenalkan representasi laten tempat query dan key diproyeksikan, yang mengurangi dimensi operasi antara dan memungkinkan pengurangan ukuran KV-cache. Pendekatan ini serupa dengan mekanisme yang digunakan pada DeepSeek-V3.[1][13]

Optimizer MuonClip dan QK-clip

Untuk pelatihan model Kimi K2, diusulkan optimizer MuonClip — modifikasi optimizer Muon (optimizer momentum dengan normalisasi Newton-Schulz) dengan penambahan teknik QK-clip untuk menstabilkan pelatihan LLM berskala besar dengan arsitektur MoE.[1]

QK-clip menerapkan pembatasan pada logit attention 𝐐𝐊 melalui operasi pemotongan (clipping). Untuk setiap head attention h ditentukan logit maksimum:

Shmax=1dmaxi,j(Qhi(Khj)),

dan dihitung koefisien penskalaan:

γh=min(1,τShmax),

di mana τ=100 — hiperparameter ambang batas, d — ukuran head attention. Koefisien γh diterapkan untuk menskalakan bobot Wq,Wk jika logit maksimum melebihi ambang batas. Hal ini membatasi rentang nilai logit sebelum softmax dan mengurangi risiko lonjakan tajam pada fungsi kerugian (loss spikes) saat pelatihan pada skala besar.[1]

Menurut para penulis, pra-pelatihan Kimi K2 pada 15,5 triliun token dengan MuonClip berlangsung tanpa satu pun lonjakan fungsi kerugian yang tercatat (zero loss spikes).[1]

Multimodalitas dan MoonViT

Model Kimi K2.5 dan Kimi-VL menggunakan encoder visual MoonViT (pada versi K2.5 — MoonViT-3D) dengan sekitar 400 juta parameter, dibangun berdasarkan SigLIP-SO-400M dengan NaViT packing (dukungan resolusi variabel gambar masukan) dan perluasan 3D untuk pemrosesan video (pengelompokan per 4 frame).[2][9]

Encoder visual mengubah gambar dan video masukan menjadi urutan token visual. Misalkan 𝐗H×W×3 — gambar masukan, Φvis — encoder visual:

𝐙vis=Φvis(𝐗)Lv×dv,

selanjutnya melalui proyeksi linear (MLP dua lapisan) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

di mana d — ukuran ruang laten bagian bahasa model. Dalam mode multimodal, 𝐇vis digabungkan (concatenate) dengan token teks dan dimasukkan ke transformer.[9][2]

Berbeda dengan skema dua tahap (penambahan adapter visual di atas model teks), K2.5 dilatih pada data teks-visual campuran sejak awal pra-pelatihan (joint text-vision pre-training), dengan proporsi token visual yang rendah (~10%) pada tahap awal dan peningkatan bertahap. Volume total — sekitar 15 triliun token teks-visual campuran.[2]

Pra-pelatihan dan Pasca-pelatihan

Pra-pelatihan

Kimi K2 dilatih sebelumnya pada 15,5 triliun token (teks web, kode, matematika, pengetahuan ensiklopedis) menggunakan optimizer MuonClip. Tidak ada satu pun lonjakan fungsi kerugian (loss spike) yang tercatat sepanjang periode pra-pelatihan.[1]

Kimi K2.5 menjalani pra-pelatihan berkelanjutan (continual pre-training) dari checkpoint K2 pada tambahan ~15 triliun token teks-visual campuran dengan optimasi modalitas bersama (joint pre-training). Secara terpisah dilakukan pelatihan standalone encoder visual sebesar 1 triliun token dan tahap long-context mid-training tambahan untuk perluasan konteks.[2]

Pasca-pelatihan

Pasca-pelatihan model seri K2 mencakup beberapa tahap:[1][2]

Supervised Fine-Tuning (SFT, fine-tuning terpandu):

  • Trajektori agentik sintetis (agentic data synthesis) — generasi spesifikasi alat, simulasi interaksi dengan lingkungan, verifikasi hasil.
  • Untuk K2.5, diterapkan tambahan zero-vision SFT — SFT berbasis teks yang mengaktifkan kemampuan visual tanpa penggunaan gambar secara langsung pada tahap fine-tuning.

Reinforcement Learning (RL, pembelajaran penguatan):

  • Kombinasi reward yang dapat diverifikasi (Reinforcement Learning with Verifiable Rewards, RLVR) untuk tugas matematika, kode, dan keamanan.
  • Evaluasi mandiri berdasarkan rubrik (self-critique rubric rewards) — penggunaan evaluator LLM untuk penilaian otomatis kualitas skenario agentik.
  • Untuk K2.5 — RL multimodal bersama (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking dan K2.5 mendukung kuantisasi bobot INT4 native (weight-only quantization, kelompok 32, tensor terkompresi), dioptimalkan untuk arsitektur NVIDIA Hopper, yang mengurangi kebutuhan memori saat inferens.[10][2]

Agent Swarm (K2.5)

Untuk model K2.5 dikembangkan mekanisme Agent Swarm — kerangka orkestrasi agen paralel yang dikelola sendiri. Model orkestrator secara dinamis membuat sub-agen (melalui operasi create_subagent, assign_task), mendistribusikan sub-tugas, dan mengumpulkan hasil. Setiap sub-agen dapat memanggil alat secara mandiri dan bekerja secara paralel dengan sub-agen lainnya.[2]

Pelatihan mekanisme Agent Swarm diimplementasikan melalui Parallel-Agent Reinforcement Learning (PARL) dengan pemisahan eksekusi dan optimasi (decoupling execution/optimization). Menurut para penulis, Agent Swarm memberikan pengurangan latensi (latency) hingga 4,5× dibandingkan mode agentik single-thread (single-agent).[2]

Model Utama Seri

Model Jenis Parameter (total / aktif) Konteks, token Multimodalitas Tanggal Rilis
Kimi k1.5 LLM, RL-scaling tidak diungkapkan 128.000 Ya (terbatas) Januari 2025
Kimi-VL VLM, MoE kompak / ~2,8 miliar aktif + 400 juta ViT konteks panjang Ya (gambar) April 2025
Kimi K2 LLM, MoE 1,04 triliun / 32 miliar 256.000 Tidak (teks) Juli 2025
Kimi K2 Thinking LLM, MoE 1,04 triliun / 32 miliar 256.000 Tidak (teks) November 2025
Kimi K2.5 VLM-LLM, MoE 1,04 triliun / 32 miliar 256.000 Ya (gambar, video, PDF) Januari 2026

[8][9][1][10][2]

Kimi K2

Kimi K2 adalah LLM Mixture-of-Experts dengan 1,04 triliun parameter total dan 32 miliar parameter yang diaktifkan per token. Dilatih sebelumnya pada 15,5 triliun token dengan optimizer MuonClip. Arsitektur mencakup 384 pakar dan mekanisme MLA yang kompatibel dengan konteks panjang. Model ini berorientasi pada tugas pemrograman, penalaran matematis, dan skenario agentik dengan pemanggilan alat secara berurutan.[1]

Laporan teknis mendeskripsikan pipeline pasca-pelatihan multi-tahap: sintesis data agentik berskala besar dengan memodelkan interaksi dengan alat; pelatihan penguatan dalam lingkungan campuran tugas nyata dan sintetis; penggunaan evaluator LLM untuk penilaian kualitas otomatis.[1][14]

Kimi K2 Thinking

Varian Kimi K2 Thinking dioptimalkan untuk penalaran multi-langkah (chain-of-thought) dengan kemampuan pemanggilan alat secara dinamis dan dukungan konteks hingga 256.000 token. Model ini mengimplementasikan mode "Thinking" terpisah dengan field reasoning_content yang dikembalikan secara eksplisit, berisi penalaran internal. K2 Thinking mendukung 200–300 pemanggilan alat berurutan dalam satu episode agentik tanpa degradasi perilaku yang signifikan, serta kuantisasi INT4 native menggunakan QAT.[10]

Kimi-VL

Kimi-VL adalah VLM MoE multimodal terbuka (vision-language model), berorientasi pada tugas pemahaman visual, penalaran teks-visual, dan skenario dunia nyata. Model ini digambarkan sebagai arsitektur MoE kompak dengan encoder visual MoonViT. Laporan teknis diterbitkan di arXiv pada April 2025.[9]

Kimi K2.5

Kimi K2.5 adalah model MoE multimodal berskala 1,04 triliun parameter dengan 32 miliar parameter yang diaktifkan, berbasis checkpoint Kimi-K2-Base dengan pra-pelatihan lanjutan pada ~15 triliun token teks-visual campuran. Model mendukung masukan gambar, video, PDF, dan teks dengan konteks hingga 256.000 token.[2]

K2.5 mendukung dua mode inferens utama:

  • Thinking mode — dengan reasoning_content eksplisit dan generasi multi-langkah;
  • Instant mode — tanpa output penalaran, dengan latensi lebih rendah.[2][13]

Model mengimplementasikan kuantisasi bobot INT4 native (weight-only, kelompok 32), dioptimalkan untuk arsitektur NVIDIA Hopper.[2]

Hasil dan Benchmark Utama

Benchmark Teks dan Agentik Kimi K2

Hasil disajikan untuk Kimi-K2-Instruct dalam mode non-thinking (tanpa chain-of-thought yang diperluas) berdasarkan data laporan teknis.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Sumber
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

Menurut pernyataan para penulis, hasil ini menempatkan K2 di antara model terbuka terdepan dalam mode tanpa thinking, khususnya pada tugas rekayasa dan agentik (pada saat laporan diterbitkan).[1]

Benchmark Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Sumber
MMVet (akurasi) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

Hasil menunjukkan bahwa arsitektur MoE multimodal kompak mencapai tingkat yang sebanding dengan model yang lebih besar dengan jumlah parameter aktif yang lebih sedikit.[9]

Benchmark Kimi K2.5

Hasil disajikan dalam mode Thinking (temperature = 1,0; top-p = 0,95; konteks 256.000 token; engine vLLM; platform perangkat keras NVIDIA H200) berdasarkan data kartu model di platform NVIDIA NIM dan laporan teknis.[2][13]

Kategori Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (tanpa alat) 30,1
HLE-Full (dengan alat) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

Selain itu, K2.5 menunjukkan transfer positif dari pelatihan visual ke tugas teks: +1,7% pada MMLU-Pro dan +2,1% pada GPQA-Diamond dibandingkan model teks dasar K2.[2]

Evaluasi perbandingan akhir bergantung pada pilihan metrik dan skenario; hasil disajikan berdasarkan data para penulis. Validasi independen sebagian benchmark pada saat publikasi masih terbatas.[2][15]

Penerapan

Asisten Teks dan Pencarian

Platform Kimi digunakan sebagai asisten dengan dukungan pemrosesan dokumen panjang (laporan penelitian, data keuangan), analisis otomatis, dan pencarian online dengan agregasi informasi. Moonshot AI menyatakan bahwa Kimi mendukung lebih dari 300 pemanggilan alat (tool calls) dalam satu skenario agentik.[7][4]

Pemrograman dan Tugas Rekayasa

Kimi K2 dan K2.5 menunjukkan hasil tinggi pada SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench, dan benchmark pemrograman lainnya. Model-model ini digunakan untuk otomatisasi perbaikan bug dalam repositori, generasi dan refactoring kode, serta penyelesaian tugas online judge (OJBench, LiveCodeBench). Laporan teknis K2 menyatakan bahwa model dilatih pada korpus agentik sintetis berskala besar, termasuk interaksi dengan sistem kontrol versi, manajer paket, dan lingkungan eksekusi.[1][2][14]

Aplikasi Multimodal

Kimi-VL dan K2.5 dirancang untuk visual question answering (VQA) pada gambar dan dokumen; pemahaman dokumen (OCRBench, OmniDocBench); analisis video (VideoMMMU, LongVideoBench); serta tugas pemrograman gabungan berdasarkan spesifikasi visual (misalnya, generasi antarmuka dari mockup gambar). Untuk K2.5, skenario "vision-grounded coding" dan "autonomous visual debugging" dideskripsikan, di mana model menghasilkan kode berdasarkan deskripsi visual dan menganalisis hasil visual secara iteratif.[2][9][15]

API dan Deployment

Model tersedia melalui API platform Moonshot AI Open Platform dengan dukungan tool calling, mode thinking, mode JSON, dan caching konteks. Bobot terbuka digunakan untuk deployment lokal melalui vLLM, SGLang, dan TensorRT-LLM. Layanan Mooncake memastikan skalabilitas inferens untuk konteks panjang.[4][11][16]

Keterbatasan dan Masalah Terbuka

Kebutuhan Sumber Daya

Model MoE berskala 1 triliun parameter, bahkan dengan 32 miliar parameter aktif dan kuantisasi INT4, memerlukan sumber daya memori dan bandwidth yang signifikan. Dalam diskusi rekayasa deployment Kimi K2.5, disebutkan estimasi ratusan gigabyte memori video untuk memuat model secara penuh; angka spesifik bergantung pada bentuk kuantisasi dan framework (vLLM, SGLang, dll.).[2][17]

Halusinasi dan Kualitas Generasi

Seperti LLM lainnya, model seri Kimi rentan terhadap halusinasi. Dalam laporan pengujian FACTS Grounding dan FaithJudge, tingkat halusinasi (hallucination rate) tercatat dalam rentang 1,1–7,4% pada skenario RAG. Dalam mode non-thinking, model dapat menghasilkan token berlebih pada spesifikasi alat yang tidak jelas; ketika penggunaan alat dipaksakan, performa menurun pada beberapa tugas.[1]

Ketergantungan pada Data Sintetis dan Pipeline RL

Pipeline sintesis data agentik dan pelatihan penguatan bergantung pada koleksi besar alat dan skenario sintetis, serta evaluator LLM untuk penilaian otomatis (self-judging). Skema semacam ini menimbulkan pertanyaan terbuka: ketahanan terhadap bias evaluasi mandiri; potensi degradasi pada iterasi berulang (bootstrap); kemampuan transfer keterampilan agentik ke lingkungan nyata yang berbeda dari yang disimulasikan; pengaruh distribusi tugas sintetis terhadap kemampuan generalisasi.[1][14]

Transparansi dan Reprodusibilitas

Sebagian informasi mengenai komposisi data pelatihan, proses penyaringan, distribusi bahasa, dan domain tidak diungkapkan atau diungkapkan secara terbatas. Hal ini mempersulit evaluasi akurat sumber bias, reprodusibilitas pelatihan, dan validasi independen pengaruh komponen individual (MuonClip, QK-clip) terhadap stabilitas. Per Februari 2026, reproduksi penuh pelatihan Kimi K2 dan K2.5 oleh pihak ketiga belum terdokumentasi dalam literatur terbuka.[1][2]

Aspek Etika dan Regulasi

Dalam kartu model dan laporan teknis ditekankan bahwa pengembang bertanggung jawab atas masukan dan keluaran model; diperlukan penambahan mekanisme perlindungan (guardrails) dan pengujian pada data kasus spesifik sebelum implementasi; model dapat memproses gambar dan video yang berpotensi mengandung data pribadi, dan integrator wajib mematuhi peraturan perundang-undangan yang berlaku.[2][16]

Laporan teknis mendeskripsikan evaluasi keamanan (risiko biologis, kimia, siber) menggunakan alat seperti Promptfoo. Model menjalani penyelarasan (alignment) RL dengan reward yang dapat diverifikasi dan evaluasi mandiri.[1]

Sebagai produk perusahaan Tiongkok, model-model ini tunduk pada regulasi nasional RRT di bidang AI. Pada saat penulisan, tidak ditemukan dokumen regulasi publik terpisah yang secara eksklusif membahas model Kimi; regulasi dilaksanakan dalam kerangka pendekatan umum terhadap model generatif dan AI di yurisdiksi terkait.[18]

Pada Februari 2026, perusahaan Anthropic menyatakan bahwa Moonshot AI (bersama pengembang Tiongkok lainnya) menggunakan akun palsu untuk menghasilkan interaksi dengan Claude dengan tujuan distilasi data untuk pelatihan model. Informasi ini bersifat klaim dari satu pihak dan belum dikonfirmasi oleh investigasi independen pada saat publikasi; Moonshot AI tidak menerbitkan tanggapan resmi.[5]

Prospek dan Arah Penelitian

Berdasarkan materi yang diterbitkan, dapat diidentifikasi beberapa arah penelitian lebih lanjut:

  • Sistem agentik yang dapat diskalakan. Pengembangan pendekatan pelatihan LLM sebagai sistem agentik menggunakan perangkat sintetis, RL, dan self-judging. Perluasan Agent Swarm ke jumlah sub-agen yang lebih banyak dan jenis tugas baru.[2][1]
  • Arsitektur MoE yang efisien. Penggunaan 1 triliun parameter dengan 32 miliar yang diaktifkan dan 384 pakar merupakan salah satu kompromi antara skala dan efisiensi; alternatif dengan berbagai skema routing sedang diteliti.[1]
  • Multimodalitas native. Pelatihan K2.5 pada data teks-visual campuran sejak awal pra-pelatihan mewakili pendekatan multimodalitas "native", yang dibandingkan dengan skema dua tahap.[2][9]
  • Inferens efisien dan konteks panjang. Kuantisasi INT4 dan dukungan konteks 256.000 token mendorong penelitian lebih lanjut di bidang sparse attention, representasi laten, dan memori eksternal. Secara terpisah dideskripsikan proyek Kimi Linear — attention linear hibrida dengan pengurangan KV-cache sebesar 75% dan percepatan dekoding 6× pada konteks 1 juta token.[2][19]

Dalam materi resmi Moonshot AI tidak diterbitkan peta jalan terperinci untuk versi Kimi mendatang; arah yang disebutkan didasarkan pada penelitian yang telah diterbitkan.

Lihat Juga

  • Arsitektur Transformer
  • DeepSeek
  • Qwen

Referensi

Daftar Pustaka

Catatan

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692