Kimi (Moonshot AI) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Kimi (ซีรีส์โมเดล Moonshot AI) — ซีรีส์ของ Large Language Model (LLM) ที่พัฒนาโดยบริษัทจีน Moonshot AI (ปักกิ่ง สาธารณรัฐประชาชนจีน) สำหรับงานการสร้างข้อความและมัลติโมดัล การเขียนโปรแกรม และระบบ agentic (agentic systems — ระบบที่สามารถวางแผน ใช้เหตุผล และดำเนินการโดยอัตโนมัติโดยใช้เครื่องมือภายนอก) ตระกูลนี้ประกอบด้วยโมเดลข้อความและมัลติโมดัลที่มีสถาปัตยกรรม Mixture-of-Experts (MoE) ในระดับประมาณ 1 ล้านล้านพารามิเตอร์ และชุดย่อยที่เปิดใช้งานประมาณ 32 พันล้านพารามิเตอร์ต่อ token[1][2] คุณสมบัติสำคัญของซีรีส์นี้คือการมุ่งเน้นไปที่พฤติกรรม agentic (การวางแผนหลายขั้นตอนพร้อมการเรียกใช้เครื่องมือภายนอก) และรองรับ context ยาวถึง 256,000 token ในเวอร์ชัน Kimi K2 และ Kimi K2.5[1][2]

โมเดลในซีรีส์ Kimi เผยแพร่ทั้งแบบ open-weight บนแพลตฟอร์ม Hugging Face ภายใต้สัญญาอนุญาต MIT ที่ดัดแปลง และผ่าน API แบบ proprietary ของแพลตฟอร์ม Moonshot AI Open Platform[3][4]

ประวัติและภูมิหลัง

การก่อตั้ง Moonshot AI

Moonshot AI ก่อตั้งขึ้นในเดือนมีนาคม 2023 ที่ปักกิ่งโดย Yang Zhilin (CEO), Zhou Xinyu และ Wu Yuxin — บัณฑิตจาก Tsinghua University (มหาวิทยาลัยชิงหัว) Yang Zhilin เคยทำงานที่ Google Brain และ Meta และมีส่วนร่วมในงานวิจัยด้าน computer vision และการใช้เหตุผล บริษัทได้รับเงินทุนจาก Alibaba (รอบมูลค่า 1 พันล้านดอลลาร์ กุมภาพันธ์ 2024), Tencent และนักลงทุนรายอื่น[5][6]

ลำดับเวลาของการเปิดตัวที่สำคัญ

  • ตุลาคม–พฤศจิกายน 2023 — เปิดตัว chatbot Kimi ที่รองรับ context ถึง 128,000 token (ถึง 200,000 อักขระจีน) เวอร์ชันแรกใช้โมเดล proprietary ที่มีการเปิดเผยรายละเอียดทางเทคนิคอย่างจำกัด[6][7]
  • มีนาคม 2024 — ขยาย context เป็น 2 ล้านอักขระในเวอร์ชันเบต้า[6]
  • มกราคม 2025 — เปิดตัว Kimi k1.5 — โมเดลมัลติโมดัลที่มีการปรับขนาด Reinforcement Learning (RL) ซึ่งอ้างว่ามีประสิทธิภาพเทียบเคียงกับ OpenAI o1 ในงานคณิตศาสตร์ การเขียนโปรแกรม และการใช้เหตุผลแบบมัลติโมดัล Context ถึง 128,000 token[8]
  • เมษายน 2025 — แนะนำ Kimi-VL — โมเดล MoE มัลติโมดัลแบบเปิด (vision-language model, VLM) ที่มี visual encoder MoonViT (~400 ล้านพารามิเตอร์) และ ~2.8 พันล้านพารามิเตอร์ที่ใช้งานอยู่ใน decoder รายงานทางเทคนิคเผยแพร่บน arXiv[9]
  • กรกฎาคม 2025 — เปิดตัว Kimi K2 — โมเดล MoE แบบเปิดหลักที่มี 1 ล้านล้านพารามิเตอร์และพารามิเตอร์ที่ใช้งานอยู่ 32 พันล้าน รายงานทางเทคนิคเผยแพร่บน arXiv[1] โมเดลครองอันดับหนึ่งในบรรดาโมเดลแบบเปิดบน LMSYS Chatbot Arena ณ เวลาที่เปิดตัว (มากกว่า 3,000 คะแนนโหวต)[1]
  • กันยายน 2025 — อัปเดต Kimi-K2-Instruct-0905 พร้อม context ที่ขยายเป็น 256,000 token และการเขียนโปรแกรม agentic ที่ปรับปรุงแล้ว[1]
  • พฤศจิกายน 2025 — เปิดตัว Kimi K2 Thinking — เวอร์ชันที่มีการใช้เหตุผลแบบทีละขั้นตอน (chain-of-thought) ที่เสริมความแข็งแกร่งและรองรับการเรียกใช้เครื่องมือ (tool calls) แบบต่อเนื่อง 200–300 ครั้ง[10]
  • มกราคม 2026 — แนะนำ Kimi K2.5 — โมเดล MoE มัลติโมดัลที่มีความสามารถมัลติโมดัลแบบ native และกลไก Agent Swarm (การจัดการ sub-agent แบบขนาน)[2]

ควบคู่ไปกับการพัฒนาโมเดลในปี 2024 มีการแนะนำบริการ inference ของตนเองชื่อ Mooncake — สถาปัตยกรรมแบบ disaggregated ที่เน้น KVCache สำหรับการให้บริการ LLM ที่มี context ยาว[11]

พื้นฐานทางทฤษฎีและสถาปัตยกรรม

สถาปัตยกรรม Mixture-of-Experts

โมเดลในซีรีส์ Kimi K2 และ K2.5 ใช้สถาปัตยกรรม Transformer ที่มี Mixture-of-Experts ในชั้นแยกต่างหาก บล็อก transformer มาตรฐานเป็นองค์ประกอบของชั้น Multi-Head Attention (MHA) และ MLP แบบ position-wise (multilayer perceptron) พร้อม residual connection:[1][12]

𝐇=MHA(𝐇)+𝐇,𝐇=MLP(𝐇)+𝐇,

โดยที่ 𝐇L×d — การแสดงแทน token อินพุต, L — ความยาวลำดับ, d — ขนาด hidden state

ในชั้น MoE แทนที่จะใช้ MLP เดียว จะใช้ชุดของผู้เชี่ยวชาญ {Ei}i=1N โดยแต่ละตัวแทน MLP แยกต่างหากพร้อมพารามิเตอร์ θi router (gating network) สำหรับแต่ละ token จะเลือกชุดย่อยของผู้เชี่ยวชาญ เอาต์พุตของชั้น MoE สำหรับ token ที่มีการแสดงแทน 𝐡 กำหนดเป็น:[1]

MoE(𝐡)=i𝒮(𝐡)gi(𝐡)Ei(𝐡),

โดยที่ 𝒮(𝐡){1,,N} — ชุดผู้เชี่ยวชาญที่เลือกสำหรับ token นี้, gi(𝐡) — น้ำหนัก router ที่ปรับมาตรฐานแล้ว, i𝒮gi=1 ฟังก์ชัน routing เลือกผู้เชี่ยวชาญผ่านการดำเนินการ TopK:[1]

g(𝐡)=TopK(Softmax(𝐡Wg)),

โดยที่ Wg — เมทริกซ์ router ที่เรียนรู้ได้ รูปแบบดังกล่าวช่วยให้สามารถปรับขนาดจำนวนพารามิเตอร์ทั้งหมดได้โดยมีจำนวนพารามิเตอร์ที่เปิดใช้งานต่อ token อย่างจำกัด

Hyperparameter สถาปัตยกรรมของ Kimi K2 / K2.5

พารามิเตอร์ ค่า
ประเภทสถาปัตยกรรม Transformer ที่มี Mixture-of-Experts
จำนวนพารามิเตอร์ทั้งหมด 1.04 ล้านล้าน
พารามิเตอร์ที่เปิดใช้งานต่อ token 32 พันล้าน
จำนวนชั้น 61 (1 แบบ dense + 60 แบบ MoE)
ขนาด hidden state 7168
จำนวน attention head 64
จำนวนผู้เชี่ยวชาญ 384 (8 ตัวที่เลือกต่อ token + 1 ตัวร่วม)
ขนาด hidden state ของผู้เชี่ยวชาญ (MoE hidden size) 2048
ขนาด vocabulary 160,000 token
ฟังก์ชัน activation SwiGLU
กลไก attention Multi-head Latent Attention (MLA)
Context สูงสุด 256,000 token (ขยายผ่าน YaRN)
Visual encoder (K2.5) MoonViT-3D, ~400 ล้านพารามิเตอร์

[1][2][13]

อัตรา sparsity (อัตราส่วนของจำนวนผู้เชี่ยวชาญทั้งหมดต่อที่เปิดใช้งาน) คือ 48:1 (384 ผู้เชี่ยวชาญ, 8 ที่ใช้งานอยู่) ซึ่งช่วยลดต้นทุนการคำนวณได้อย่างมีนัยสำคัญเมื่อเทียบกับโมเดลแบบ dense ในระดับเดียวกัน[1]

กลไก Multi-head Latent Attention (MLA)

โมเดลในซีรีส์ Kimi K2/K2.5 ใช้กลไก Multi-head Latent Attention (MLA) — การดัดแปลง attention แบบ multi-head มาตรฐาน ที่มุ่งเพิ่มประสิทธิภาพและความสามารถในการปรับขนาด การคำนวณ attention มาตรฐานสำหรับชั้นเดียวเป็น:[12]

Attention(𝐐,𝐊,𝐕)=softmax(𝐐𝐊dk)𝐕,

โดยที่ 𝐐,𝐊,𝐕L×dk — เมทริกซ์ query, key และ value ใน MLA มีการนำเสนอ latent representation ที่ query และ key ฉายลงบน ซึ่งช่วยลดมิติของการดำเนินการระดับกลางและช่วยลดขนาด KV cache แนวทางนี้คล้ายกับกลไกที่ใช้ใน DeepSeek-V3[1][13]

Optimizer MuonClip และ QK-clip

สำหรับการฝึกโมเดล Kimi K2 มีการเสนอ optimizer MuonClip — การดัดแปลง Muon optimizer (momentum optimizer พร้อม normalization แบบ Newton-Schulz) โดยเพิ่มเทคนิค QK-clip เพื่อทำให้การฝึก Large Language Model ที่มีสถาปัตยกรรม MoE มีเสถียรภาพ[1]

QK-clip ใช้ข้อจำกัดกับ attention logit 𝐐𝐊 ผ่านการดำเนินการ clipping สำหรับแต่ละ attention head h จะกำหนด logit สูงสุด:

Shmax=1dmaxi,j(Qhi(Khj)),

และคำนวณสัมประสิทธิ์การปรับขนาด:

γh=min(1,τShmax),

โดยที่ τ=100 — hyperparameter เกณฑ์, d — ขนาดของ attention head สัมประสิทธิ์ γh ใช้สำหรับการปรับขนาดน้ำหนัก Wq,Wk หาก logit สูงสุดเกินเกณฑ์ วิธีนี้จำกัดช่วงของค่า logit ก่อน softmax และลดความเสี่ยงของการกระโดดอย่างรวดเร็วของ loss (loss spikes) ในระหว่างการฝึกในระดับขนาดใหญ่[1]

ตามข้อมูลของผู้เขียน การ pre-train Kimi K2 บน token จำนวน 15.5 ล้านล้านด้วย MuonClip ผ่านไปโดยไม่มีการบันทึก loss spike แม้แต่ครั้งเดียว (zero loss spikes)[1]

ความสามารถมัลติโมดัลและ MoonViT

โมเดล Kimi K2.5 และ Kimi-VL ใช้ visual encoder MoonViT (ในเวอร์ชัน K2.5 — MoonViT-3D) ที่มีประมาณ 400 ล้านพารามิเตอร์ สร้างบน SigLIP-SO-400M ที่มีการ packing แบบ NaViT (รองรับความละเอียดอินพุตที่แปรผัน) และการขยาย 3D สำหรับการประมวลผลวิดีโอ (จัดกลุ่มตาม 4 เฟรม)[2][9]

Visual encoder แปลงรูปภาพและวิดีโออินพุตเป็นลำดับของ visual token ให้ 𝐗H×W×3 — รูปภาพอินพุต, Φvis — visual encoder:

𝐙vis=Φvis(𝐗)Lv×dv,

จากนั้นผ่านการฉายแบบเชิงเส้น (MLP สองชั้น) 𝐏dv×d:

𝐇vis=𝐙vis𝐏,

โดยที่ d — ขนาด hidden space ของส่วนภาษาของโมเดล ในโหมดมัลติโมดัล 𝐇vis จะถูก concatenate กับ text token และป้อนเข้า transformer[9][2]

ต่างจากรูปแบบสองขั้นตอน (การเพิ่ม visual adapter บนโมเดลข้อความ) K2.5 ได้รับการฝึกบนข้อมูลผสมระหว่างภาพและข้อความตั้งแต่เริ่ม pre-training (joint text-vision pre-training) โดยมีสัดส่วน visual token ต่ำ (~10%) ในระยะแรกและค่อยๆ เพิ่มขึ้น ปริมาณรวมทั้งหมดประมาณ 15 ล้านล้าน token ที่ผสมระหว่างภาพและข้อความ[2]

การ Pre-training และ Post-training

การ Pre-training

Kimi K2 ได้รับการ pre-train บน 15.5 ล้านล้าน token (ข้อความเว็บ, โค้ด, คณิตศาสตร์, ความรู้สารานุกรม) โดยใช้ MuonClip optimizer ไม่มีการบันทึก loss spike แม้แต่ครั้งเดียวตลอดช่วง pre-training[1]

Kimi K2.5 ผ่าน continual pre-training ต่อเนื่องจาก checkpoint ของ K2 บน ~15 ล้านล้าน token ผสมระหว่างภาพและข้อความเพิ่มเติม พร้อมการปรับแต่ง modality ร่วม (joint pre-training) มีการดำเนินการฝึก standalone ของ visual encoder จำนวน 1 ล้านล้าน token และขั้นตอน long-context mid-training เพิ่มเติมเพื่อขยาย context[2]

การ Post-training

การ post-training ของโมเดลซีรีส์ K2 ประกอบด้วยหลายขั้นตอน:[1][2]

Supervised Fine-Tuning (SFT, การปรับแต่งแบบควบคุม):

  • ข้อมูลการสังเคราะห์ agentic trajectory (agentic data synthesis) — การสร้างข้อกำหนดเครื่องมือ การจำลองการโต้ตอบกับสภาพแวดล้อม การตรวจสอบผลลัพธ์
  • สำหรับ K2.5 มีการใช้ zero-vision SFT เพิ่มเติม — SFT แบบข้อความที่เปิดใช้งานความสามารถด้านภาพโดยไม่ต้องใช้รูปภาพโดยตรงในขั้นตอน fine-tuning

Reinforcement Learning (RL, การเรียนรู้เสริมแรง):

  • การรวมกันของรางวัลที่ตรวจสอบได้ (Reinforcement Learning with Verifiable Rewards, RLVR) สำหรับงานคณิตศาสตร์ โค้ด และความปลอดภัย
  • การประเมินตัวเองตามเกณฑ์ (self-critique rubric rewards) — การใช้ LLM ประเมินผลสำหรับการประเมินคุณภาพของสถานการณ์ agentic โดยอัตโนมัติ
  • สำหรับ K2.5 — multimodal RL ร่วม (joint multimodal RL)

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking และ K2.5 รองรับ INT4 quantization แบบ native ของน้ำหนัก (weight-only quantization, กลุ่ม 32, tensor บีบอัด) ที่ปรับให้เหมาะกับสถาปัตยกรรม NVIDIA Hopper ซึ่งช่วยลดความต้องการหน่วยความจำในระหว่างการ inference[10][2]

Agent Swarm (K2.5)

สำหรับโมเดล K2.5 มีการพัฒนากลไก Agent Swarm — framework การจัดการ agent แบบขนานที่จัดการตัวเอง โมเดล orchestrator จะสร้าง sub-agent แบบไดนามิก (ผ่านการดำเนินการ create_subagent, assign_task) กระจายงานย่อย และรวบรวมผลลัพธ์ แต่ละ sub-agent สามารถเรียกใช้เครื่องมือได้อย่างอิสระและทำงานแบบขนานกับ sub-agent อื่นๆ[2]

การฝึกกลไก Agent Swarm ดำเนินการผ่าน Parallel-Agent Reinforcement Learning (PARL) พร้อมการแยกการดำเนินการและการปรับแต่ง (decoupling execution/optimization) ตามข้อมูลของผู้เขียน Agent Swarm ช่วยลด latency ได้ถึง 4.5 เท่าเมื่อเทียบกับโหมด agent แบบ single-thread (single-agent)[2]

โมเดลหลักในซีรีส์

โมเดล ประเภท พารามิเตอร์ (รวม / ที่ใช้งานอยู่) Context (token) มัลติโมดัล วันที่เปิดตัว
Kimi k1.5 LLM, RL-scaling ไม่เปิดเผย 128,000 ใช่ (จำกัด) มกราคม 2025
Kimi-VL VLM, MoE compact / ~2.8 พันล้านที่ใช้งานอยู่ + 400 ล้าน ViT context ยาว ใช่ (รูปภาพ) เมษายน 2025
Kimi K2 LLM, MoE 1.04 ล้านล้าน / 32 พันล้าน 256,000 ไม่ (ข้อความ) กรกฎาคม 2025
Kimi K2 Thinking LLM, MoE 1.04 ล้านล้าน / 32 พันล้าน 256,000 ไม่ (ข้อความ) พฤศจิกายน 2025
Kimi K2.5 VLM-LLM, MoE 1.04 ล้านล้าน / 32 พันล้าน 256,000 ใช่ (รูปภาพ, วิดีโอ, PDF) มกราคม 2026

[8][9][1][10][2]

Kimi K2

Kimi K2 — LLM แบบ Mixture-of-Experts ที่มีพารามิเตอร์รวม 1.04 ล้านล้านและพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านต่อ token ได้รับการ pre-train บน 15.5 ล้านล้าน token ด้วย MuonClip optimizer สถาปัตยกรรมประกอบด้วยผู้เชี่ยวชาญ 384 คนและกลไก MLA ที่เข้ากันได้กับ context ยาว โมเดลมุ่งเน้นงานการเขียนโปรแกรม การใช้เหตุผลทางคณิตศาสตร์ และสถานการณ์ agentic พร้อมการเรียกใช้เครื่องมือแบบต่อเนื่อง[1]

รายงานทางเทคนิคอธิบาย pipeline การ post-training แบบหลายขั้นตอน: การสังเคราะห์ข้อมูล agentic ในวงกว้างโดยการจำลองการโต้ตอบกับเครื่องมือ; การฝึกด้วย reinforcement learning ในสภาพแวดล้อมผสมของงานจริงและงานสังเคราะห์; การใช้ LLM ประเมินผลสำหรับการประเมินคุณภาพโดยอัตโนมัติ[1][14]

Kimi K2 Thinking

ตัวแปร Kimi K2 Thinking ได้รับการปรับแต่งสำหรับการใช้เหตุผลแบบหลายขั้นตอน (chain-of-thought) พร้อมความสามารถในการเรียกใช้เครื่องมือแบบไดนามิกและรองรับ context ถึง 256,000 token โมเดลนำเสนอโหมด "Thinking" แยกต่างหากพร้อมฟิลด์ reasoning_content ที่ส่งคืนอย่างชัดเจนซึ่งมีการใช้เหตุผลภายใน K2 Thinking รองรับการเรียกใช้เครื่องมือแบบต่อเนื่อง 200–300 ครั้งในหนึ่ง agentic episode โดยไม่มีการเสื่อมสภาพของพฤติกรรมอย่างมีนัยสำคัญ และยังรองรับ INT4 quantization แบบ native ด้วย QAT[10]

Kimi-VL

Kimi-VL — MoE-VLM (vision-language model) มัลติโมดัลแบบเปิดที่มุ่งเน้นงานการเข้าใจภาพ การใช้เหตุผลระหว่างภาพและข้อความ และฉากในชีวิตจริง โมเดลถูกอธิบายว่าเป็นสถาปัตยกรรม MoE แบบ compact พร้อม visual encoder MoonViT รายงานทางเทคนิคเผยแพร่บน arXiv ในเดือนเมษายน 2025[9]

Kimi K2.5

Kimi K2.5 — โมเดล MoE มัลติโมดัลในระดับ 1.04 ล้านล้านพารามิเตอร์ที่มีพารามิเตอร์ที่เปิดใช้งาน 32 พันล้าน โดยอิงจาก checkpoint ของ Kimi-K2-Base พร้อม continual pre-training บน ~15 ล้านล้าน token ผสมระหว่างภาพและข้อความเพิ่มเติม โมเดลรองรับอินพุตรูปภาพ วิดีโอ PDF และข้อความพร้อม context ถึง 256,000 token[2]

K2.5 รองรับโหมดการ inference หลักสองโหมด:

  • Thinking mode — พร้อม reasoning_content ที่ชัดเจนและการสร้างแบบหลายขั้นตอน
  • Instant mode — โดยไม่มีการแสดงการใช้เหตุผล ด้วย latency ที่ต่ำกว่า[2][13]

โมเดลนำเสนอ INT4 quantization แบบ native ของน้ำหนัก (weight-only, กลุ่ม 32) ที่ปรับให้เหมาะกับสถาปัตยกรรม NVIDIA Hopper[2]

ผลลัพธ์หลักและ benchmark

Benchmark ข้อความและ agentic ของ Kimi K2

ผลลัพธ์แสดงสำหรับ Kimi-K2-Instruct ในโหมด non-thinking (โดยไม่มี chain-of-thought ขยาย) ตามข้อมูลของรายงานทางเทคนิค[1]

Benchmark Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet แหล่งที่มา
SWE-Bench Verified (Pass@1) 65.8% 38.8% 72.5% / 72.7% arXiv:2507.20534
SWE-Bench Multilingual 47.3% 20.9% 51.0% arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53.7% 44.7% 46.9% arXiv:2507.20534
Tau2-Bench (micro-avg) 66.1% 48.8% 66.1% arXiv:2507.20534
ACEBench (En) 76.5% 75.6% 80.1% arXiv:2507.20534
AIME 2025 (Avg@64) 49.5% 33.9% 46.7% arXiv:2507.20534
GPQA-Diamond (Avg@8) 75.1% 68.2% 74.9% arXiv:2507.20534

ตามคำกล่าวอ้างของผู้เขียน ผลลัพธ์เหล่านี้วาง K2 ไว้ในกลุ่มผู้นำของโมเดลแบบเปิดในโหมดที่ไม่มีการขยาย thinking โดยเฉพาะอย่างยิ่งในงานวิศวกรรมและ agentic (ณ เวลาที่เผยแพร่รายงาน)[1]

Benchmark ของ Kimi-VL

Benchmark Kimi-VL Qwen2.5-VL-7B GPT-4o-mini แหล่งที่มา
MMVet (ความแม่นยำ) 66.7% 67.1% 66.9% arXiv:2504.07491
RealWorldQA 68.1% 68.5% arXiv:2504.07491

ผลลัพธ์แสดงให้เห็นว่าสถาปัตยกรรม MoE มัลติโมดัลแบบ compact สามารถบรรลุระดับที่เทียบเคียงได้กับโมเดลขนาดใหญ่กว่าโดยมีพารามิเตอร์ที่ใช้งานอยู่น้อยกว่า[9]

Benchmark ของ Kimi K2.5

ผลลัพธ์แสดงในโหมด Thinking (temperature = 1.0; top-p = 0.95; context 256,000 token; engine vLLM; แพลตฟอร์มฮาร์ดแวร์ NVIDIA H200) ตามข้อมูลของ model card บนแพลตฟอร์ม NVIDIA NIM และรายงานทางเทคนิค[2][13]

หมวดหมู่ Benchmark Kimi K2.5
Reasoning & Knowledge HLE-Full (โดยไม่มีเครื่องมือ) 30.1
HLE-Full (พร้อมเครื่องมือ) 50.2
AIME 2025 96.1
HMMT 2025 (Feb) 95.4
GPQA-Diamond 87.6
MMLU-Pro 87.1
Vision & Video MMMU-Pro 78.5
MathVision 84.2
MathVista (mini) 90.1
OCRBench 92.3
OmniDocBench 1.5 88.8
VideoMMMU 86.6
LongVideoBench 79.8
Coding SWE-Bench Verified 76.8
SWE-Bench Pro 50.7
SWE-Bench Multilingual 73.0
Terminal Bench 2.0 50.8
PaperBench 63.5
LiveCodeBench v6 85.0
OJBench (C++) 57.4
Long Context Longbench v2 61.0
AA-LCR 70.0
Agentic Search BrowseComp 60.6
BrowseComp (Agent Swarm) 78.4
WideSearch (iter-F1) 72.7
DeepSearchQA 77.1

นอกจากนี้ K2.5 ยังแสดงให้เห็นการถ่ายโอนเชิงบวกของการฝึกด้านภาพไปยังงานข้อความ: +1.7% บน MMLU-Pro และ +2.1% บน GPQA-Diamond เมื่อเทียบกับโมเดลพื้นฐานข้อความ K2[2]

การประเมินเปรียบเทียบขั้นสุดท้ายขึ้นอยู่กับการเลือก metric และสถานการณ์ ผลลัพธ์ที่แสดงมาจากข้อมูลของผู้เขียน การตรวจสอบอิสระของ benchmark บางส่วน ณ เวลาที่เผยแพร่ยังมีจำกัด[2][15]

การประยุกต์ใช้งาน

ผู้ช่วยข้อความและการค้นหา

แพลตฟอร์ม Kimi ถูกใช้เป็นผู้ช่วยที่รองรับการประมวลผลเอกสารยาว (รายงานการวิจัย ข้อมูลทางการเงิน) การวิเคราะห์อัตโนมัติ และการค้นหาออนไลน์พร้อมการรวบรวมข้อมูล Moonshot AI ระบุว่า Kimi รองรับการเรียกใช้เครื่องมือ (tool calls) มากกว่า 300 ครั้งในสถานการณ์ agentic เดียว[7][4]

การเขียนโปรแกรมและงานวิศวกรรม

Kimi K2 และ K2.5 แสดงผลลัพธ์สูงบน SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench และ benchmark การเขียนโปรแกรมอื่นๆ โมเดลถูกใช้สำหรับการแก้ไขข้อผิดพลาดอัตโนมัติใน repository การสร้างและ refactoring โค้ด การแก้ปัญหาของ online judge (OJBench, LiveCodeBench) รายงานทางเทคนิค K2 ระบุว่าโมเดลได้รับการฝึกบน corpus agentic สังเคราะห์ขนาดใหญ่ รวมถึงการโต้ตอบกับระบบจัดการเวอร์ชัน package manager และสภาพแวดล้อมการดำเนินการ[1][2][14]

แอปพลิเคชันมัลติโมดัล

Kimi-VL และ K2.5 ออกแบบมาสำหรับการตอบคำถามด้านภาพ (VQA) บนรูปภาพและเอกสาร การเข้าใจเอกสาร (OCRBench, OmniDocBench) การวิเคราะห์วิดีโอ (VideoMMMU, LongVideoBench) งานการเขียนโปรแกรมแบบผสมตามข้อกำหนดภาพ (เช่น การสร้าง interface จาก mockup รูปภาพ) สำหรับ K2.5 มีการอธิบายสถานการณ์ "vision-grounded coding" และ "autonomous visual debugging" ที่โมเดลสร้างโค้ดตามคำอธิบายภาพและวิเคราะห์ผลลัพธ์ภาพแบบ iterative[2][9][15]

API และการ deploy

โมเดลพร้อมใช้งานผ่าน API ของแพลตฟอร์ม Moonshot AI Open Platform พร้อมรองรับ tool calling, thinking mode, JSON mode และการ cache context น้ำหนักแบบเปิดใช้สำหรับการ deploy ในเครื่องผ่าน vLLM, SGLang และ TensorRT-LLM บริการ Mooncake ช่วยให้สามารถปรับขนาด inference สำหรับ context ยาว[4][11][16]

ข้อจำกัดและปัญหาเปิด

ความต้องการด้านทรัพยากร

โมเดล MoE ในระดับ 1 ล้านล้านพารามิเตอร์ แม้จะมีพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านและ INT4 quantization ก็ยังต้องการหน่วยความจำและแบนด์วิดท์ที่มีนัยสำคัญ ในการอภิปรายด้านวิศวกรรมเกี่ยวกับการ deploy Kimi K2.5 มีการกล่าวถึงประมาณการในระดับหลายร้อยกิกะไบต์ของ VRAM สำหรับการโหลดโมเดลเต็ม ตัวเลขที่แน่นอนขึ้นอยู่กับรูปแบบ quantization และ framework (vLLM, SGLang เป็นต้น)[2][17]

Hallucination และคุณภาพการสร้าง

เช่นเดียวกับ LLM อื่นๆ โมเดลในซีรีส์ Kimi มีแนวโน้มเกิด hallucination ในรายงานการทดสอบ FACTS Grounding และ FaithJudge มีการบันทึก hallucination rate ในช่วง 1.1–7.4% ในสถานการณ์ RAG ในโหมด non-thinking โมเดลอาจสร้าง token ส่วนเกินเมื่อมีข้อกำหนดเครื่องมือที่ไม่ชัดเจน เมื่อบังคับเปิดใช้งาน tool-use ประสิทธิภาพจะลดลงในบางงาน[1]

การพึ่งพาข้อมูลสังเคราะห์และ pipeline RL

Pipeline การสังเคราะห์ข้อมูล agentic และการฝึกด้วย reinforcement learning อาศัยคอลเลกชันขนาดใหญ่ของเครื่องมือและฉากสังเคราะห์ รวมถึง LLM ประเมินผลสำหรับการประเมินอัตโนมัติ (self-judging) รูปแบบดังกล่าวก่อให้เกิดคำถามเปิด: ความทนทานต่อความลำเอียง (bias) ของการประเมินตัวเอง การเสื่อมสภาพที่อาจเกิดขึ้นเมื่อทำ iteration ซ้ำหลายครั้ง (bootstrap) การถ่ายโอนทักษะ agentic ไปยังสภาพแวดล้อมจริงที่แตกต่างจากการจำลอง อิทธิพลของการกระจายงานสังเคราะห์ต่อความสามารถในการ generalize[1][14]

ความโปร่งใสและการทำซ้ำ

ข้อมูลบางส่วนเกี่ยวกับองค์ประกอบของข้อมูลการฝึก กระบวนการกรอง การกระจายภาษาและโดเมนไม่ได้เปิดเผยหรือเปิดเผยอย่างจำกัด ซึ่งทำให้การประเมินแหล่งที่มาของความลำเอียงอย่างแม่นยำ การทำซ้ำการฝึก และการตรวจสอบอิสระของผลกระทบของส่วนประกอบแต่ละชิ้น (MuonClip, QK-clip) ต่อเสถียรภาพทำได้ยาก ณ เดือนกุมภาพันธ์ 2026 ไม่มีการบันทึกการทำซ้ำการฝึก Kimi K2 และ K2.5 อย่างสมบูรณ์โดยบุคคลที่สามในวรรณกรรมเปิด[1][2]

แง่มุมด้านจริยธรรมและกฎระเบียบ

ใน model card และรายงานทางเทคนิคมีการเน้นย้ำว่านักพัฒนามีความรับผิดชอบต่ออินพุตและเอาต์พุตของโมเดล จำเป็นต้องเพิ่มกลไกป้องกัน (guardrails) และทดสอบกับข้อมูลของกรณีเฉพาะก่อนนำไปใช้งาน โมเดลสามารถประมวลผลรูปภาพและวิดีโอที่อาจมีข้อมูลส่วนบุคคล และผู้รวมระบบมีหน้าที่ต้องปฏิบัติตามกฎหมายที่เกี่ยวข้อง[2][16]

รายงานทางเทคนิคอธิบายการประเมินด้านความปลอดภัย (ความเสี่ยงทางชีวภาพ เคมี และไซเบอร์) โดยใช้เครื่องมือประเภท Promptfoo โมเดลผ่านการ alignment ด้วย RL พร้อมรางวัลที่ตรวจสอบได้และการประเมินตัวเอง[1]

ในฐานะผลิตภัณฑ์ของบริษัทจีน โมเดลต้องปฏิบัติตามกฎระเบียบแห่งชาติของสาธารณรัฐประชาชนจีนในด้าน AI ณ เวลาที่เขียน ยังไม่พบเอกสารกฎระเบียบสาธารณะแยกต่างหากที่อุทิศให้กับโมเดล Kimi โดยเฉพาะ การกำกับดูแลดำเนินการภายในกรอบแนวทางทั่วไปสำหรับโมเดล generative และ AI ในเขตอำนาจศาลที่เกี่ยวข้อง[18]

ในเดือนกุมภาพันธ์ 2026 บริษัท Anthropic อ้างว่า Moonshot AI (พร้อมกับนักพัฒนาจีนรายอื่น) ใช้บัญชีปลอมเพื่อสร้างการโต้ตอบกับ Claude เพื่อดึงข้อมูล (distillation) สำหรับการฝึกโมเดล ข้อมูลนี้มีลักษณะเป็นการยืนยันของฝ่ายเดียวและยังไม่ได้รับการยืนยันโดยการสืบสวนอิสระ ณ เวลาที่เผยแพร่ Moonshot AI ยังไม่ได้เผยแพร่คำตอบอย่างเป็นทางการ[5]

แนวโน้มและทิศทางการวิจัย

จากเอกสารที่เผยแพร่ สามารถระบุทิศทางการวิจัยในอนาคตได้หลายทิศทาง:

  • ระบบ agentic ที่ปรับขนาดได้ การพัฒนาแนวทางการฝึก LLM ในฐานะระบบ agentic โดยใช้ชุดเครื่องมือสังเคราะห์ RL และ self-judging การขยาย Agent Swarm ให้ครอบคลุม sub-agent จำนวนมากขึ้นและงานประเภทใหม่[2][1]
  • สถาปัตยกรรม MoE ที่มีประสิทธิภาพ การใช้พารามิเตอร์ 1 ล้านล้านกับพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านและผู้เชี่ยวชาญ 384 คนแสดงถึงหนึ่งในทางเลือกของการประนีประนอมระหว่างขนาดและประสิทธิภาพ กำลังมีการศึกษาทางเลือกอื่นๆ ที่มีรูปแบบ routing ที่แตกต่างกัน[1]
  • ความสามารถมัลติโมดัลแบบ native การฝึก K2.5 บนข้อมูลผสมระหว่างภาพและข้อความตั้งแต่เริ่ม pre-training แสดงถึงแนวทางสู่ความสามารถมัลติโมดัลแบบ "native" ซึ่งเปรียบเทียบกับรูปแบบสองขั้นตอน[2][9]
  • Inference ที่มีประสิทธิภาพและ context ยาว INT4 quantization และการรองรับ context 256,000 token กระตุ้นการวิจัยเพิ่มเติมในด้าน sparse attention, latent representation และหน่วยความจำภายนอก มีการอธิบายโครงการ Kimi Linear แยกต่างหาก — hybrid linear attention พร้อมการลด KV cache 75% และการเร่งความเร็ว decoding 6 เท่าที่ context 1 ล้าน token[2][19]

ในเอกสารอย่างเป็นทางการของ Moonshot AI ไม่มีการเผยแพร่ roadmap โดยละเอียดสำหรับเวอร์ชัน Kimi ในอนาคต ทิศทางที่ระบุไว้อิงตามงานวิจัยที่เผยแพร่

ดูเพิ่มเติม

  • สถาปัตยกรรม Transformer
  • DeepSeek
  • Qwen

อ้างอิง

บรรณานุกรม

หมายเหตุ

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692