Kimi (Moonshot AI) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (Moonshot AI model serisi) — Çin'in Moonshot AI şirketi (Pekin, ÇHC) tarafından metin ve multimodal üretim, programlama ve ajan sistemleri (agentic systems — otonom planlama, akıl yürütme ve harici araçları kullanarak eylem gerçekleştirebilen sistemler) görevleri için geliştirilen büyük dil modelleri (Large Language Model, LLM) serisidir. Aile; yaklaşık 1 trilyon parametre ölçeğinde Mixture-of-Experts (MoE, uzman karışımı) mimarisiyle tasarlanmış ve her token için yaklaşık 32 milyar parametrenin etkinleştirildiği metin ve multimodal modeller içermektedir.[1][2] Serinin önemli bir özelliği, ajan davranışına (harici araç çağrılarıyla çok adımlı planlama) yönelik tasarımı ve Kimi K2 ile Kimi K2.5 sürümlerinde 256.000 tokena kadar uzun bağlam desteğidir.[1][2]

Kimi serisi modelleri, hem Hugging Face platformunda değiştirilmiş MIT lisansı altında açık ağırlıklar (open-weight) olarak hem de Moonshot AI Open Platform'un özel API'si aracılığıyla dağıtılmaktadır.[3][4]

Tarihçe ve Arka Plan

Moonshot AI'ın Kuruluşu

Moonshot AI, Mart 2023'te Pekin'de Tsinghua University (Tsinghua Üniversitesi) mezunları olan Yang Zhilin (CEO), Zhou Xinyu ve Wu Yuxin tarafından kurulmuştur. Yang Zhilin daha önce Google Brain ve Meta'da çalışmış; bilgisayarlı görü ve akıl yürütme alanlarındaki araştırmalara katkıda bulunmuştur. Şirket, Alibaba'dan (Şubat 2024, 1 milyar dolarlık tur), Tencent'ten ve diğer yatırımcılardan finansman almıştır.[5][6]

Önemli Sürümlerin Zaman Çizelgesi

  • Ekim–Kasım 2023 — 128 bin tokena kadar (200 bine kadar Çince karakter) bağlam desteğiyle Kimi sohbet botunun başlatılması. İlk sürümler, teknik ayrıntıları sınırlı düzeyde açıklanan özel modeller kullandı.[6][7]
  • Mart 2024 — Beta sürümünde bağlamın 2 milyon karaktere genişletilmesi.[6]
  • Ocak 2025 — Matematik, programlama ve multimodal akıl yürütme görevlerinde OpenAI o1 ile karşılaştırılabilir performans iddiasıyla ölçeklendirilmiş pekiştirmeli öğrenme (Reinforcement Learning, RL) kullanan multimodal model Kimi k1.5in yayımlanması. 128 bin tokena kadar bağlam desteği.[8]
  • Nisan 2025 — MoonViT görsel kodlayıcıya (~400 milyon parametre) ve kod çözücüde ~2,8 milyar etkin parametreye sahip açık multimodal MoE modeli (vision-language model, VLM) Kimi-VLnin tanıtılması. Teknik rapor arXiv'de yayımlandı.[9]
  • Temmuz 2025 — 1 trilyon genel parametre ve 32 milyar etkin parametreye sahip temel açık MoE modeli Kimi K2nin yayımlanması. Teknik rapor arXiv'de yayımlandı.[1] Model, yayım anında LMSYS Chatbot Arena'da açık modeller arasında birinci sırada yer aldı (3.000'den fazla oy).[1]
  • Eylül 2025 — 256 bin tokena genişletilmiş bağlam ve geliştirilmiş ajan kodlamasıyla Kimi-K2-Instruct-0905 güncellemesi.[1]
  • Kasım 2025 — Geliştirilmiş adım adım akıl yürütme (chain-of-thought) ve 200–300 ardışık araç çağrısı (tool calls) desteğiyle Kimi K2 Thinking sürümünün yayımlanması.[10]
  • Ocak 2026 — Yerel multimodality ve Agent Swarm mekanizmasıyla (alt-ajanların paralel orkestrasyonu) multimodal MoE modeli Kimi K2.5in tanıtılması.[2]

Model geliştirmeyle eş zamanlı olarak 2024 yılında, uzun bağlamlı LLM sunumu için KVCache merkezli ayrıştırılmış mimari olan özel çıkarım hizmeti Mooncake tanıtıldı.[11]

Teorik Temeller ve Mimari

Mixture-of-Experts Mimarisi

Kimi K2 ve K2.5 serisi modeller, belirli katmanlarda Mixture-of-Experts içeren Transformer mimarisini uygulamaktadır. Standart transformer bloğu; artık bağlantılarla çok başlı öz-dikkat (Multi-Head Attention, MHA) ve konum bazlı MLP (çok katmanlı algılayıcı) katmanlarının bileşimini temsil eder:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

burada 𝐇L×d — giriş token temsilleri, L — dizi uzunluğu, d — gizli durum boyutu.

MoE katmanında tek bir MLP yerine, her biri θi parametrelerine sahip ayrı bir MLP olan {Ei}i=1N uzman kümesi kullanılmaktadır. Yönlendirici (gating network), her token için bir uzman alt kümesi seçer. 𝐡 temsiline sahip bir token için MoE katmanının çıkışı şu şekilde tanımlanır:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

burada 𝒮(𝐡){1,,N} — söz konusu token için seçilen uzmanlar kümesi, gi(𝐡) — normalleştirilmiş yönlendirici ağırlıkları, i𝒮gi=1. Yönlendirme fonksiyonu, uzmanları TopK işlemi aracılığıyla seçer:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

burada Wg — öğrenilebilir yönlendirici matrisi. Bu düzenleme, her token için etkinleştirilen parametre sayısı sınırlı tutulurken toplam parametre sayısının ölçeklenmesine olanak tanır.

Kimi K2 / K2.5 Mimari Hiperparametreleri

Parametre Değer
Mimari türü Mixture-of-Experts içeren Transformer
Toplam parametre sayısı 1,04 trilyon
Token başına etkinleştirilen parametre sayısı 32 milyar
Katman sayısı 61 (1 yoğun + 60 MoE)
Gizli durum boyutu 7168
Dikkat başı sayısı 64
Uzman sayısı 384 (token başına 8 seçilir + 1 ortak)
Uzman gizli durum boyutu (MoE hidden size) 2048
Sözlük boyutu 160.000 token
Aktivasyon fonksiyonu SwiGLU
Dikkat mekanizması Multi-head Latent Attention (MLA)
Maksimum bağlam 256.000 token (YaRN ile genişletme)
Görsel kodlayıcı (K2.5) MoonViT-3D, ~400 milyon parametre

[1][2][13]

Seyreklik oranı (toplam uzman sayısının etkin uzman sayısına oranı) 48:1'dir (384 uzman, 8 etkin); bu durum, aynı ölçekteki yoğun (dense) bir modele kıyasla hesaplama maliyetlerinde önemli bir azalma sağlar.[1]

Multi-head Latent Attention (MLA) Mekanizması

Kimi K2/K2.5 serisi modellerde, verimlilik ve ölçeklenebilirliği artırmaya yönelik standart çok başlı dikkatin bir değişkeni olan Multi-head Latent Attention (MLA) mekanizması kullanılmaktadır. Tek bir katman için standart dikkat şu şekilde hesaplanır:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

burada 𝐐,𝐊,𝐕L×dk — sorgu, anahtar ve değer matrisleri. MLA'da gizil temsiller tanıtılmakta; sorgular ve anahtarlar bu temsillere yansıtılarak ara işlemlerin boyutsallığı azaltılmakta ve KV önbelleğinin boyutu küçültülmektedir. Bu yaklaşım, DeepSeek-V3'te kullanılan mekanizmaya benzemektedir.[1][13]

MuonClip Optimizatörü ve QK-clip

Kimi K2 modelinin eğitimi için, MoE mimarili büyük dil modellerinin eğitimini kararlı kılmaya yönelik QK-clip tekniğinin eklendiği Muon optimizatörünün (Newton-Schulz normalleştirmeli momentum optimizatörü) bir değişkeni olan MuonClip optimizatörü önerilmiştir.[1]

QK-clip, kırpma (clipping) işlemi aracılığıyla dikkat logitleri 𝐐𝐊 üzerinde kısıtlamalar uygular. Her dikkat başı h için maksimum logit şu şekilde tanımlanır:

Shmax=1dmaxi,j(Qhi(Khj)),

ve ölçekleme katsayısı şu şekilde hesaplanır:

γh=min(1,τShmax),

burada τ=100 — eşik hiperparametresi, d — dikkat başının boyutu. Maksimum logit eşiği aştığında γh katsayısı, Wq,Wk ağırlıklarını ölçeklendirmek için uygulanır. Bu işlem, softmax öncesinde logit değerlerinin aralığını sınırlandırır ve büyük ölçekli eğitimde ani kayıp artışlarının (loss spikes) riskini azaltır.[1]

Yazarların verilerine göre, Kimi K2'nin MuonClip ile 15,5 trilyon token üzerinde ön eğitimi, tek bir kayıp fonksiyonu artışı (zero loss spikes) kaydedilmeksizin tamamlanmıştır.[1]

Multimodality ve MoonViT

Kimi K2.5 ve Kimi-VL modelleri, yaklaşık 400 milyon parametreli MoonViT görsel kodlayıcısını (K2.5 sürümünde — MoonViT-3D) kullanmaktadır. Bu kodlayıcı; NaViT paketlemesiyle (değişken girdi görüntüsü çözünürlüğü desteği) SigLIP-SO-400M temelinde oluşturulmuş ve video işleme için 3D uzantısıyla (4 kare gruplama) genişletilmiştir.[2][9]

Görsel kodlayıcı, girdi görüntülerini ve videoları görsel token dizisine dönüştürür. 𝐗H×W×3 — girdi görüntüsü, Φvis — görsel kodlayıcı olmak üzere:

𝐙vis=Φvis(𝐗)Lv×dv,

ardından doğrusal projeksiyon (iki katmanlı MLP) 𝐏dv×d aracılığıyla:

𝐇vis=𝐙vis𝐏,

burada d — modelin dil bölümünün gizil uzay boyutu. Multimodal modda 𝐇vis, metin tokenleriyle birleştirilerek transformer'a beslenir.[9][2]

İki aşamalı şemalardan (metin modelinin üzerine görsel adaptör ekleme) farklı olarak K2.5, ön eğitimin başından itibaren karışık görsel-metin verileri üzerinde (joint text-vision pre-training) eğitilmiştir; erken aşamalarda görsel token oranı düşük (~%10) tutulmuş ve kademeli olarak artırılmıştır. Toplam hacim yaklaşık 15 trilyon karışık görsel-metin tokendir.[2]

Ön Eğitim ve Son Eğitim

Ön Eğitim

Kimi K2, MuonClip optimizatörü kullanılarak 15,5 trilyon token (web metinleri, kod, matematik, ansiklopedik bilgi) üzerinde ön eğitimden geçirilmiştir. Ön eğitim süresince hiçbir kayıp artışı (loss spike) kaydedilmemiştir.[1]

Kimi K2.5, K2 kontrol noktasından başlayarak modalitelerin birlikte optimizasyonuyla (joint pre-training) ek ~15 trilyon karışık görsel-metin token üzerinde sürekli ön eğitim (continual pre-training) sürecinden geçirilmiştir. Görsel kodlayıcının 1 trilyon token üzerinde bağımsız eğitimi ve bağlamı genişletmek için ek bir long-context mid-training aşaması ayrıca gerçekleştirilmiştir.[2]

Son Eğitim

K2 serisi modellerin son eğitimi birkaç aşamayı kapsamaktadır:[1][2]

Supervised Fine-Tuning (SFT, denetimli ince ayar):

  • Sentetik ajan yörüngeleri (agentic data synthesis) — araç spesifikasyonlarının oluşturulması, ortam etkileşimlerinin modellenmesi, sonuçların doğrulanması.
  • K2.5 için ek olarak zero-vision SFT uygulanmıştır — ince ayar aşamasında görüntü kullanılmaksızın görsel yetenekleri etkinleştiren metin tabanlı SFT.

Reinforcement Learning (RL, pekiştirmeli öğrenme):

  • Matematik, kod ve güvenlik görevleri için doğrulanabilir ödüllerle pekiştirmeli öğrenmenin (Reinforcement Learning with Verifiable Rewards, RLVR) birleşimi.
  • Rubrik bazlı öz-değerlendirme (self-critique rubric rewards) — ajan senaryolarının kalitesini otomatik olarak değerlendirmek için LLM değerlendiricilerinin kullanımı.
  • K2.5 için — ortak multimodal RL (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking ve K2.5, NVIDIA Hopper mimarisi için optimize edilmiş yerel INT4 ağırlık kuantizasyonunu (weight-only quantization, grup 32, sıkıştırılmış tensörler) desteklemekte; bu durum çıkarım sırasında bellek gereksinimlerini azaltmaktadır.[10][2]

Agent Swarm (K2.5)

K2.5 modeli için, ajanların kendi kendini yöneten paralel orkestrasyonuna yönelik bir çerçeve olan Agent Swarm mekanizması geliştirilmiştir. Orkestratör model, dinamik olarak alt-ajanlar oluşturur (create_subagent, assign_task işlemleri aracılığıyla), alt görevleri dağıtır ve sonuçları toplar. Her alt-ajan bağımsız olarak araçları çağırabilir ve diğer alt-ajanlarla paralel çalışabilir.[2]

Agent Swarm mekanizmasının eğitimi; yürütme ve optimizasyonun ayrıştırıldığı (decoupling execution/optimization) Parallel-Agent Reinforcement Learning (PARL) aracılığıyla gerçekleştirilmiştir. Yazarların verilerine göre Agent Swarm, tek ajanlı moda (single-agent) kıyasla gecikmeyi (latency) 4,5 kata kadar azaltmaktadır.[2]

Serinin Temel Modelleri

Model Tür Parametreler (toplam / etkin) Bağlam, token Multimodality Yayım tarihi
Kimi k1.5 LLM, RL-scaling açıklanmadı 128.000 Evet (sınırlı) Ocak 2025
Kimi-VL VLM, MoE kompakt / ~2,8 milyar etkin + 400 milyon ViT uzun bağlam Evet (görüntüler) Nisan 2025
Kimi K2 LLM, MoE 1,04 trilyon / 32 milyar 256.000 Hayır (metin) Temmuz 2025
Kimi K2 Thinking LLM, MoE 1,04 trilyon / 32 milyar 256.000 Hayır (metin) Kasım 2025
Kimi K2.5 VLM-LLM, MoE 1,04 trilyon / 32 milyar 256.000 Evet (görüntüler, video, PDF) Ocak 2026

[8][9][1][10][2]

Kimi K2

Kimi K2, 1,04 trilyon genel parametre ve token başına 32 milyar etkinleştirilen parametreye sahip Mixture-of-Experts LLM'dir. MuonClip optimizatörü ile 15,5 trilyon token üzerinde ön eğitimden geçirilmiştir. Mimari; 384 uzman ve uzun bağlamla uyumlu MLA mekanizması içermektedir. Model, programlama, matematiksel akıl yürütme ve ardışık araç çağrılarıyla ajan senaryoları görevlerine yönelik tasarlanmıştır.[1]

Teknik raporda çok aşamalı bir son eğitim işlem hattı açıklanmıştır: araç etkileşimlerinin modellenmesiyle büyük ölçekli ajan verisi sentezi; gerçek ve sentetik görevlerin karma ortamında pekiştirmeli öğrenme; kalite değerlendirmesinin otomatikleştirilmesi için LLM değerlendiricilerinin kullanımı.[1][14]

Kimi K2 Thinking

Kimi K2 Thinking varyantı, dinamik araç çağırma özelliği ve 256.000 tokena kadar bağlam desteğiyle çok adımlı akıl yürütme (chain-of-thought) için optimize edilmiştir. Model, iç akıl yürütmeyi içeren açık reasoning_content alanıyla ayrı bir "Thinking" modu uygulamaktadır. K2 Thinking, tek bir ajan bölümünde davranışta belirgin bir bozulma olmaksızın 200–300 ardışık araç çağrısını ve QAT kullanarak yerel INT4 kuantizasyonunu desteklemektedir.[10]

Kimi-VL

Kimi-VL; görsel anlama, görsel-metin akıl yürütme ve gerçek dünya sahneleri görevlerine yönelik açık multimodal MoE-VLM (vision-language model) modelidir. Model, MoonViT görsel kodlayıcıya sahip kompakt MoE mimarisi olarak tanımlanmaktadır. Teknik rapor Nisan 2025'te arXiv'de yayımlandı.[9]

Kimi K2.5

Kimi K2.5; ~15 trilyon karışık görsel-metin token üzerinde sürekli ön eğitimle Kimi-K2-Base kontrol noktasına dayanan, 1,04 trilyon parametre ölçeğinde ve 32 milyar etkin parametreli multimodal MoE modelidir. Model, 256.000 tokena kadar bağlamla görüntü, video, PDF ve metin girişlerini desteklemektedir.[2]

K2.5 iki temel çıkarım modunu desteklemektedir:

  • Thinking modu — açık reasoning_content ve çok adımlı üretimle;
  • Instant modu — akıl yürütme çıkışı olmaksızın, daha düşük gecikmeyle.[2][13]

Model, NVIDIA Hopper mimarisi için optimize edilmiş yerel INT4 ağırlık kuantizasyonunu (weight-only, grup 32) uygulamaktadır.[2]

Temel Sonuçlar ve Benchmark'lar

Kimi K2'nin Metin ve Ajan Benchmark'ları

Sonuçlar, teknik rapora göre non-thinking modunda (genişletilmiş chain-of-thought olmaksızın) Kimi-K2-Instruct için verilmektedir.[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Kaynak
SWE-Bench Verified (Pass@1) %65,8 %38,8 %72,5 / %72,7 arXiv:2507.20534
SWE-Bench Multilingual %47,3 %20,9 %51,0 arXiv:2507.20534
LiveCodeBench v6 (Pass@1) %53,7 %44,7 %46,9 arXiv:2507.20534
Tau2-Bench (micro-avg) %66,1 %48,8 %66,1 arXiv:2507.20534
ACEBench (En) %76,5 %75,6 %80,1 arXiv:2507.20534
AIME 2025 (Avg@64) %49,5 %33,9 %46,7 arXiv:2507.20534
GPQA-Diamond (Avg@8) %75,1 %68,2 %74,9 arXiv:2507.20534

Yazarların açıklamasına göre bu sonuçlar, K2'yi özellikle mühendislik ve ajan görevlerinde thinking modu açılmaksızın açık modeller arasındaki liderler arasında konumlandırmaktadır (raporun yayım anı itibarıyla).[1]

Kimi-VL Benchmark'ları

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Kaynak
MMVet (doğruluk) %66,7 %67,1 %66,9 arXiv:2504.07491
RealWorldQA %68,1 %68,5 arXiv:2504.07491

Sonuçlar, kompakt multimodal MoE mimarisinin daha az etkin parametreyle daha büyük modellere kıyasla benzer bir düzeye ulaştığını göstermektedir.[9]

Kimi K2.5 Benchmark'ları

Sonuçlar, NVIDIA NIM platformundaki model kartı ve teknik rapora göre Thinking modunda (sıcaklık = 1,0; top-p = 0,95; 256.000 token bağlam; vLLM motoru; NVIDIA H200 donanım platformu) verilmektedir.[2][13]

Kategori Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (araçsız) 30,1
HLE-Full (araçlı) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

Bunlara ek olarak K2.5, metin görevlerine görsel öğrenmenin olumlu transferini sergilemektedir: metin tabanlı temel model K2 ile karşılaştırıldığında MMLU-Pro'da +%1,7 ve GPQA-Diamond'da +%2,1.[2]

Nihai karşılaştırmalı değerlendirme, seçilen metriklere ve senaryolara bağlıdır; sonuçlar yazarların verilerine göre aktarılmaktadır. Yayım anı itibarıyla benchmark'ların bir bölümünün bağımsız doğrulaması sınırlı düzeydedir.[2][15]

Kullanım Alanları

Metin Asistanı ve Arama

Kimi platformu; uzun belge işleme (araştırma raporları, finansal veriler), otomatikleştirilmiş analiz ve bilgi toplama içeren çevrimiçi arama desteğiyle asistan olarak kullanılmaktadır. Moonshot AI, Kimi'nin tek bir ajan senaryosu kapsamında 300'den fazla araç çağrısını (tool calls) desteklediğini belirtmektedir.[7][4]

Programlama ve Mühendislik Görevleri

Kimi K2 ve K2.5, SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench ve diğer programlama benchmark'larında yüksek sonuçlar sergilemektedir. Modeller; depolarda hata düzeltmenin otomatikleştirilmesi, kod üretimi ve yeniden düzenlenmesi, çevrimiçi yargıç görevlerinin (OJBench, LiveCodeBench) çözümü için kullanılmaktadır. K2'nin teknik raporu, modelin; sürüm kontrol sistemleri, paket yöneticileri ve çalışma ortamlarıyla etkileşimler dahil büyük ölçekli sentetik ajan korpusu üzerinde eğitildiğini belirtmektedir.[1][2][14]

Multimodal Uygulamalar

Kimi-VL ve K2.5; görüntüler ve belgelerde görsel soru-cevap (VQA); belge anlama (OCRBench, OmniDocBench); video analizi (VideoMMMU, LongVideoBench); görsel spesifikasyonlara dayalı kombine programlama görevleri (örneğin, görüntü düzeninden arayüz üretimi) için tasarlanmıştır. K2.5 için, modelin görsel tanımlamaya göre kod ürettiği ve görsel sonucu yinelemeli olarak analiz ettiği "vision-grounded coding" ve "autonomous visual debugging" senaryoları açıklanmıştır.[2][9][15]

API ve Dağıtım

Modeller, araç çağırma, thinking modu, JSON modu ve bağlam önbellekleme desteğiyle Moonshot AI Open Platform'un API'si aracılığıyla erişilebilir durumdadır. Açık ağırlıklar, vLLM, SGLang ve TensorRT-LLM aracılığıyla yerel dağıtım için kullanılmaktadır. Mooncake hizmeti, uzun bağlam için çıkarım ölçeklendirmesini sağlamaktadır.[4][11][16]

Sınırlılıklar ve Açık Sorunlar

Kaynak Gereksinimleri

INT4 kuantizasyonu ve token başına 32 milyar etkin parametre ile bile, 1 trilyon parametre ölçeğindeki MoE modelleri önemli miktarda bellek ve bant genişliği gerektirmektedir. Kimi K2.5 dağıtımına ilişkin mühendislik tartışmalarında, modelin tam olarak yüklenmesi için yüzlerce gigabayt video belleği mertebesinde tahminlerden söz edilmektedir; somut rakamlar kuantizasyon biçimine ve çerçeveye (vLLM, SGLang vb.) bağlıdır.[2][17]

Halüsinasyonlar ve Üretim Kalitesi

Diğer LLM'ler gibi Kimi serisi modeller de halüsinasyona eğilimlidir. FACTS Grounding ve FaithJudge testlerine ilişkin raporlarda, RAG senaryolarında halüsinasyon oranının %1,1–7,4 aralığında olduğu kayıt altına alınmıştır. Non-thinking modunda model, belirsiz araç spesifikasyonlarında gereksiz tokenler üretebilmektedir; bazı görevlerde araç kullanımının zorla etkinleştirilmesi performansı düşürmektedir.[1]

Sentetik Verilere ve RL İşlem Hattına Bağımlılık

Ajan verisi sentezi ve pekiştirmeli öğrenme işlem hattı, büyük bir sentetik araç ve senaryo koleksiyonuna ve otomatik değerlendirme için LLM değerlendiricilerine (self-judging) dayanmaktadır. Bu düzenleme çeşitli açık sorular doğurmaktadır: öz-değerlendirmedeki önyargıya (bias) karşı dayanıklılık; çok sayıda yinelemede olası bozulma (bootstrap); ajan becerilerinin simüle edilenlerden farklı gerçek ortamlara aktarılabilirliği; sentetik görev dağılımının genelleştirme yeteneğine etkisi.[1][14]

Şeffaflık ve Yeniden Üretilebilirlik

Eğitim verilerinin bileşimi, filtreleme süreci, dil ve alan dağılımına ilişkin bilgilerin bir kısmı açıklanmamakta ya da sınırlı düzeyde açıklanmaktadır. Bu durum, önyargı kaynaklarının doğru değerlendirilmesini, eğitimin yeniden üretilmesini ve ayrı bileşenlerin (MuonClip, QK-clip) kararlılık üzerindeki etkisinin bağımsız olarak doğrulanmasını güçleştirmektedir. Şubat 2026 itibarıyla Kimi K2 ve K2.5 eğitiminin üçüncü taraflarca tam olarak yeniden üretilmesi açık literatürde kayıt altına alınmamıştır.[1][2]

Etik ve Düzenleyici Boyutlar

Model kartlarında ve teknik raporlarda, geliştiricilerin modelin girdi ve çıktılarından sorumlu olduğu; uygulamaya geçmeden önce koruyucu mekanizmaların (guardrails) eklenmesi ve somut vaka verisi üzerinde test yapılması gerektiği; modelin kişisel veri içerebilecek görüntü ve video işleyebildiği ve entegratörün ilgili mevzuata uymakla yükümlü olduğu vurgulanmaktadır.[2][16]

Teknik raporlarda Promptfoo gibi araçlar kullanılarak gerçekleştirilen güvenlik değerlendirmeleri (biyolojik, kimyasal, siber riskler) açıklanmaktadır. Modeller, doğrulanabilir ödüller ve öz-değerlendirme ile RL hizalamasından (alignment) geçirilmektedir.[1]

Bir Çin şirketinin ürünü olarak modeller, ÇHC'nin ulusal yapay zeka düzenlemelerine tabidir. Yazım anı itibarıyla yalnızca Kimi modellerine özgü ayrı bir kamuya açık düzenleyici belge bulunmamaktadır; düzenleme, ilgili yetki alanlarında üretici modeller ve yapay zekaya yönelik genel yaklaşımlar çerçevesinde yürütülmektedir.[18]

Şubat 2026'da Anthropic şirketi, Moonshot AI'ın (diğer Çinli geliştiricilerle birlikte) model eğitimi için veri damıtmak amacıyla sahte hesaplar kullanarak Claude ile etkileşimler ürettiğini öne sürdü. Bu bilgi, tek taraflı bir iddia niteliği taşımakta olup yayım anı itibarıyla bağımsız soruşturmalarla doğrulanmamıştır; Moonshot AI resmi bir yanıt yayımlamamıştır.[5]

Gelecek Perspektifleri ve Araştırma Yönleri

Yayımlanan materyallere dayanarak çeşitli araştırma yönleri belirlenebilmektedir:

  • Ölçeklenebilir ajan sistemleri. Sentetik araç seti, RL ve self-judging kullanarak LLM'lerin ajan sistemi olarak eğitilmesine yönelik yaklaşımların geliştirilmesi. Agent Swarm'ın daha fazla sayıda alt-ajana ve yeni görev türlerine genişletilmesi.[2][1]
  • Verimli MoE mimarileri. 32 milyar etkin ve 384 uzmanla birlikte 1 trilyon parametre kullanımı, ölçek ve verimlilik arasındaki bir uzlaşım seçeneğini temsil etmektedir; farklı yönlendirme düzenlemeleriyle alternatifler araştırılmaktadır.[1]
  • Yerel multimodality. K2.5'in ön eğitimin başından itibaren karışık görsel-metin verileri üzerinde eğitilmesi, iki aşamalı düzenlemelerle karşılaştırılan "yerel" multimodality yaklaşımını temsil etmektedir.[2][9]
  • Verimli çıkarım ve uzun bağlam. INT4 kuantizasyonu ve 256.000 token bağlam desteği; seyrek dikkat, gizil temsiller ve dış bellek alanlarında araştırmaları teşvik etmektedir. Ayrıca, 1 milyon token bağlamda KV önbelleğini %75 azaltan ve kod çözmeyi 6 kat hızlandıran hibrit doğrusal dikkat projesi Kimi Linear ayrıca açıklanmıştır.[2][19]

Moonshot AI'ın resmi materyallerinde Kimi'nin gelecek sürümlerine ilişkin ayrıntılı yol haritaları yayımlanmamaktadır; listelenen yönler yayımlanan araştırmalara dayanmaktadır.

Ayrıca bakınız

  • Transformer mimarisi
  • DeepSeek
  • Qwen

Literatür

Kaynakça

Notlar

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692