Kimi (Moonshot AI) (TH)
Kimi (ซีรีส์โมเดล Moonshot AI) — ซีรีส์ของ Large Language Model (LLM) ที่พัฒนาโดยบริษัทจีน Moonshot AI (ปักกิ่ง สาธารณรัฐประชาชนจีน) สำหรับงานการสร้างข้อความและมัลติโมดัล การเขียนโปรแกรม และระบบ agentic (agentic systems — ระบบที่สามารถวางแผน ใช้เหตุผล และดำเนินการโดยอัตโนมัติโดยใช้เครื่องมือภายนอก) ตระกูลนี้ประกอบด้วยโมเดลข้อความและมัลติโมดัลที่มีสถาปัตยกรรม Mixture-of-Experts (MoE) ในระดับประมาณ 1 ล้านล้านพารามิเตอร์ และชุดย่อยที่เปิดใช้งานประมาณ 32 พันล้านพารามิเตอร์ต่อ token[1][2] คุณสมบัติสำคัญของซีรีส์นี้คือการมุ่งเน้นไปที่พฤติกรรม agentic (การวางแผนหลายขั้นตอนพร้อมการเรียกใช้เครื่องมือภายนอก) และรองรับ context ยาวถึง 256,000 token ในเวอร์ชัน Kimi K2 และ Kimi K2.5[1][2]
โมเดลในซีรีส์ Kimi เผยแพร่ทั้งแบบ open-weight บนแพลตฟอร์ม Hugging Face ภายใต้สัญญาอนุญาต MIT ที่ดัดแปลง และผ่าน API แบบ proprietary ของแพลตฟอร์ม Moonshot AI Open Platform[3][4]
ประวัติและภูมิหลัง
การก่อตั้ง Moonshot AI
Moonshot AI ก่อตั้งขึ้นในเดือนมีนาคม 2023 ที่ปักกิ่งโดย Yang Zhilin (CEO), Zhou Xinyu และ Wu Yuxin — บัณฑิตจาก Tsinghua University (มหาวิทยาลัยชิงหัว) Yang Zhilin เคยทำงานที่ Google Brain และ Meta และมีส่วนร่วมในงานวิจัยด้าน computer vision และการใช้เหตุผล บริษัทได้รับเงินทุนจาก Alibaba (รอบมูลค่า 1 พันล้านดอลลาร์ กุมภาพันธ์ 2024), Tencent และนักลงทุนรายอื่น[5][6]
ลำดับเวลาของการเปิดตัวที่สำคัญ
- ตุลาคม–พฤศจิกายน 2023 — เปิดตัว chatbot Kimi ที่รองรับ context ถึง 128,000 token (ถึง 200,000 อักขระจีน) เวอร์ชันแรกใช้โมเดล proprietary ที่มีการเปิดเผยรายละเอียดทางเทคนิคอย่างจำกัด[6][7]
- มีนาคม 2024 — ขยาย context เป็น 2 ล้านอักขระในเวอร์ชันเบต้า[6]
- มกราคม 2025 — เปิดตัว Kimi k1.5 — โมเดลมัลติโมดัลที่มีการปรับขนาด Reinforcement Learning (RL) ซึ่งอ้างว่ามีประสิทธิภาพเทียบเคียงกับ OpenAI o1 ในงานคณิตศาสตร์ การเขียนโปรแกรม และการใช้เหตุผลแบบมัลติโมดัล Context ถึง 128,000 token[8]
- เมษายน 2025 — แนะนำ Kimi-VL — โมเดล MoE มัลติโมดัลแบบเปิด (vision-language model, VLM) ที่มี visual encoder MoonViT (~400 ล้านพารามิเตอร์) และ ~2.8 พันล้านพารามิเตอร์ที่ใช้งานอยู่ใน decoder รายงานทางเทคนิคเผยแพร่บน arXiv[9]
- กรกฎาคม 2025 — เปิดตัว Kimi K2 — โมเดล MoE แบบเปิดหลักที่มี 1 ล้านล้านพารามิเตอร์และพารามิเตอร์ที่ใช้งานอยู่ 32 พันล้าน รายงานทางเทคนิคเผยแพร่บน arXiv[1] โมเดลครองอันดับหนึ่งในบรรดาโมเดลแบบเปิดบน LMSYS Chatbot Arena ณ เวลาที่เปิดตัว (มากกว่า 3,000 คะแนนโหวต)[1]
- กันยายน 2025 — อัปเดต Kimi-K2-Instruct-0905 พร้อม context ที่ขยายเป็น 256,000 token และการเขียนโปรแกรม agentic ที่ปรับปรุงแล้ว[1]
- พฤศจิกายน 2025 — เปิดตัว Kimi K2 Thinking — เวอร์ชันที่มีการใช้เหตุผลแบบทีละขั้นตอน (chain-of-thought) ที่เสริมความแข็งแกร่งและรองรับการเรียกใช้เครื่องมือ (tool calls) แบบต่อเนื่อง 200–300 ครั้ง[10]
- มกราคม 2026 — แนะนำ Kimi K2.5 — โมเดล MoE มัลติโมดัลที่มีความสามารถมัลติโมดัลแบบ native และกลไก Agent Swarm (การจัดการ sub-agent แบบขนาน)[2]
ควบคู่ไปกับการพัฒนาโมเดลในปี 2024 มีการแนะนำบริการ inference ของตนเองชื่อ Mooncake — สถาปัตยกรรมแบบ disaggregated ที่เน้น KVCache สำหรับการให้บริการ LLM ที่มี context ยาว[11]
พื้นฐานทางทฤษฎีและสถาปัตยกรรม
สถาปัตยกรรม Mixture-of-Experts
โมเดลในซีรีส์ Kimi K2 และ K2.5 ใช้สถาปัตยกรรม Transformer ที่มี Mixture-of-Experts ในชั้นแยกต่างหาก บล็อก transformer มาตรฐานเป็นองค์ประกอบของชั้น Multi-Head Attention (MHA) และ MLP แบบ position-wise (multilayer perceptron) พร้อม residual connection:[1][12]
โดยที่ — การแสดงแทน token อินพุต, — ความยาวลำดับ, — ขนาด hidden state
ในชั้น MoE แทนที่จะใช้ MLP เดียว จะใช้ชุดของผู้เชี่ยวชาญ โดยแต่ละตัวแทน MLP แยกต่างหากพร้อมพารามิเตอร์ router (gating network) สำหรับแต่ละ token จะเลือกชุดย่อยของผู้เชี่ยวชาญ เอาต์พุตของชั้น MoE สำหรับ token ที่มีการแสดงแทน กำหนดเป็น:[1]
โดยที่ — ชุดผู้เชี่ยวชาญที่เลือกสำหรับ token นี้, — น้ำหนัก router ที่ปรับมาตรฐานแล้ว, ฟังก์ชัน routing เลือกผู้เชี่ยวชาญผ่านการดำเนินการ TopK:[1]
โดยที่ — เมทริกซ์ router ที่เรียนรู้ได้ รูปแบบดังกล่าวช่วยให้สามารถปรับขนาดจำนวนพารามิเตอร์ทั้งหมดได้โดยมีจำนวนพารามิเตอร์ที่เปิดใช้งานต่อ token อย่างจำกัด
Hyperparameter สถาปัตยกรรมของ Kimi K2 / K2.5
| พารามิเตอร์ | ค่า |
|---|---|
| ประเภทสถาปัตยกรรม | Transformer ที่มี Mixture-of-Experts |
| จำนวนพารามิเตอร์ทั้งหมด | 1.04 ล้านล้าน |
| พารามิเตอร์ที่เปิดใช้งานต่อ token | 32 พันล้าน |
| จำนวนชั้น | 61 (1 แบบ dense + 60 แบบ MoE) |
| ขนาด hidden state | 7168 |
| จำนวน attention head | 64 |
| จำนวนผู้เชี่ยวชาญ | 384 (8 ตัวที่เลือกต่อ token + 1 ตัวร่วม) |
| ขนาด hidden state ของผู้เชี่ยวชาญ (MoE hidden size) | 2048 |
| ขนาด vocabulary | 160,000 token |
| ฟังก์ชัน activation | SwiGLU |
| กลไก attention | Multi-head Latent Attention (MLA) |
| Context สูงสุด | 256,000 token (ขยายผ่าน YaRN) |
| Visual encoder (K2.5) | MoonViT-3D, ~400 ล้านพารามิเตอร์ |
อัตรา sparsity (อัตราส่วนของจำนวนผู้เชี่ยวชาญทั้งหมดต่อที่เปิดใช้งาน) คือ 48:1 (384 ผู้เชี่ยวชาญ, 8 ที่ใช้งานอยู่) ซึ่งช่วยลดต้นทุนการคำนวณได้อย่างมีนัยสำคัญเมื่อเทียบกับโมเดลแบบ dense ในระดับเดียวกัน[1]
กลไก Multi-head Latent Attention (MLA)
โมเดลในซีรีส์ Kimi K2/K2.5 ใช้กลไก Multi-head Latent Attention (MLA) — การดัดแปลง attention แบบ multi-head มาตรฐาน ที่มุ่งเพิ่มประสิทธิภาพและความสามารถในการปรับขนาด การคำนวณ attention มาตรฐานสำหรับชั้นเดียวเป็น:[12]
โดยที่ — เมทริกซ์ query, key และ value ใน MLA มีการนำเสนอ latent representation ที่ query และ key ฉายลงบน ซึ่งช่วยลดมิติของการดำเนินการระดับกลางและช่วยลดขนาด KV cache แนวทางนี้คล้ายกับกลไกที่ใช้ใน DeepSeek-V3[1][13]
Optimizer MuonClip และ QK-clip
สำหรับการฝึกโมเดล Kimi K2 มีการเสนอ optimizer MuonClip — การดัดแปลง Muon optimizer (momentum optimizer พร้อม normalization แบบ Newton-Schulz) โดยเพิ่มเทคนิค QK-clip เพื่อทำให้การฝึก Large Language Model ที่มีสถาปัตยกรรม MoE มีเสถียรภาพ[1]
QK-clip ใช้ข้อจำกัดกับ attention logit ผ่านการดำเนินการ clipping สำหรับแต่ละ attention head จะกำหนด logit สูงสุด:
และคำนวณสัมประสิทธิ์การปรับขนาด:
โดยที่ — hyperparameter เกณฑ์, — ขนาดของ attention head สัมประสิทธิ์ ใช้สำหรับการปรับขนาดน้ำหนัก หาก logit สูงสุดเกินเกณฑ์ วิธีนี้จำกัดช่วงของค่า logit ก่อน softmax และลดความเสี่ยงของการกระโดดอย่างรวดเร็วของ loss (loss spikes) ในระหว่างการฝึกในระดับขนาดใหญ่[1]
ตามข้อมูลของผู้เขียน การ pre-train Kimi K2 บน token จำนวน 15.5 ล้านล้านด้วย MuonClip ผ่านไปโดยไม่มีการบันทึก loss spike แม้แต่ครั้งเดียว (zero loss spikes)[1]
ความสามารถมัลติโมดัลและ MoonViT
โมเดล Kimi K2.5 และ Kimi-VL ใช้ visual encoder MoonViT (ในเวอร์ชัน K2.5 — MoonViT-3D) ที่มีประมาณ 400 ล้านพารามิเตอร์ สร้างบน SigLIP-SO-400M ที่มีการ packing แบบ NaViT (รองรับความละเอียดอินพุตที่แปรผัน) และการขยาย 3D สำหรับการประมวลผลวิดีโอ (จัดกลุ่มตาม 4 เฟรม)[2][9]
Visual encoder แปลงรูปภาพและวิดีโออินพุตเป็นลำดับของ visual token ให้ — รูปภาพอินพุต, — visual encoder:
จากนั้นผ่านการฉายแบบเชิงเส้น (MLP สองชั้น) :
โดยที่ — ขนาด hidden space ของส่วนภาษาของโมเดล ในโหมดมัลติโมดัล จะถูก concatenate กับ text token และป้อนเข้า transformer[9][2]
ต่างจากรูปแบบสองขั้นตอน (การเพิ่ม visual adapter บนโมเดลข้อความ) K2.5 ได้รับการฝึกบนข้อมูลผสมระหว่างภาพและข้อความตั้งแต่เริ่ม pre-training (joint text-vision pre-training) โดยมีสัดส่วน visual token ต่ำ (~10%) ในระยะแรกและค่อยๆ เพิ่มขึ้น ปริมาณรวมทั้งหมดประมาณ 15 ล้านล้าน token ที่ผสมระหว่างภาพและข้อความ[2]
การ Pre-training และ Post-training
การ Pre-training
Kimi K2 ได้รับการ pre-train บน 15.5 ล้านล้าน token (ข้อความเว็บ, โค้ด, คณิตศาสตร์, ความรู้สารานุกรม) โดยใช้ MuonClip optimizer ไม่มีการบันทึก loss spike แม้แต่ครั้งเดียวตลอดช่วง pre-training[1]
Kimi K2.5 ผ่าน continual pre-training ต่อเนื่องจาก checkpoint ของ K2 บน ~15 ล้านล้าน token ผสมระหว่างภาพและข้อความเพิ่มเติม พร้อมการปรับแต่ง modality ร่วม (joint pre-training) มีการดำเนินการฝึก standalone ของ visual encoder จำนวน 1 ล้านล้าน token และขั้นตอน long-context mid-training เพิ่มเติมเพื่อขยาย context[2]
การ Post-training
การ post-training ของโมเดลซีรีส์ K2 ประกอบด้วยหลายขั้นตอน:[1][2]
Supervised Fine-Tuning (SFT, การปรับแต่งแบบควบคุม):
- ข้อมูลการสังเคราะห์ agentic trajectory (agentic data synthesis) — การสร้างข้อกำหนดเครื่องมือ การจำลองการโต้ตอบกับสภาพแวดล้อม การตรวจสอบผลลัพธ์
- สำหรับ K2.5 มีการใช้ zero-vision SFT เพิ่มเติม — SFT แบบข้อความที่เปิดใช้งานความสามารถด้านภาพโดยไม่ต้องใช้รูปภาพโดยตรงในขั้นตอน fine-tuning
Reinforcement Learning (RL, การเรียนรู้เสริมแรง):
- การรวมกันของรางวัลที่ตรวจสอบได้ (Reinforcement Learning with Verifiable Rewards, RLVR) สำหรับงานคณิตศาสตร์ โค้ด และความปลอดภัย
- การประเมินตัวเองตามเกณฑ์ (self-critique rubric rewards) — การใช้ LLM ประเมินผลสำหรับการประเมินคุณภาพของสถานการณ์ agentic โดยอัตโนมัติ
- สำหรับ K2.5 — multimodal RL ร่วม (joint multimodal RL)
Quantization-Aware Training (QAT):
- Kimi K2 Thinking และ K2.5 รองรับ INT4 quantization แบบ native ของน้ำหนัก (weight-only quantization, กลุ่ม 32, tensor บีบอัด) ที่ปรับให้เหมาะกับสถาปัตยกรรม NVIDIA Hopper ซึ่งช่วยลดความต้องการหน่วยความจำในระหว่างการ inference[10][2]
Agent Swarm (K2.5)
สำหรับโมเดล K2.5 มีการพัฒนากลไก Agent Swarm — framework การจัดการ agent แบบขนานที่จัดการตัวเอง โมเดล orchestrator จะสร้าง sub-agent แบบไดนามิก (ผ่านการดำเนินการ create_subagent, assign_task) กระจายงานย่อย และรวบรวมผลลัพธ์ แต่ละ sub-agent สามารถเรียกใช้เครื่องมือได้อย่างอิสระและทำงานแบบขนานกับ sub-agent อื่นๆ[2]
การฝึกกลไก Agent Swarm ดำเนินการผ่าน Parallel-Agent Reinforcement Learning (PARL) พร้อมการแยกการดำเนินการและการปรับแต่ง (decoupling execution/optimization) ตามข้อมูลของผู้เขียน Agent Swarm ช่วยลด latency ได้ถึง 4.5 เท่าเมื่อเทียบกับโหมด agent แบบ single-thread (single-agent)[2]
โมเดลหลักในซีรีส์
| โมเดล | ประเภท | พารามิเตอร์ (รวม / ที่ใช้งานอยู่) | Context (token) | มัลติโมดัล | วันที่เปิดตัว |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | ไม่เปิดเผย | 128,000 | ใช่ (จำกัด) | มกราคม 2025 |
| Kimi-VL | VLM, MoE | compact / ~2.8 พันล้านที่ใช้งานอยู่ + 400 ล้าน ViT | context ยาว | ใช่ (รูปภาพ) | เมษายน 2025 |
| Kimi K2 | LLM, MoE | 1.04 ล้านล้าน / 32 พันล้าน | 256,000 | ไม่ (ข้อความ) | กรกฎาคม 2025 |
| Kimi K2 Thinking | LLM, MoE | 1.04 ล้านล้าน / 32 พันล้าน | 256,000 | ไม่ (ข้อความ) | พฤศจิกายน 2025 |
| Kimi K2.5 | VLM-LLM, MoE | 1.04 ล้านล้าน / 32 พันล้าน | 256,000 | ใช่ (รูปภาพ, วิดีโอ, PDF) | มกราคม 2026 |
Kimi K2
Kimi K2 — LLM แบบ Mixture-of-Experts ที่มีพารามิเตอร์รวม 1.04 ล้านล้านและพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านต่อ token ได้รับการ pre-train บน 15.5 ล้านล้าน token ด้วย MuonClip optimizer สถาปัตยกรรมประกอบด้วยผู้เชี่ยวชาญ 384 คนและกลไก MLA ที่เข้ากันได้กับ context ยาว โมเดลมุ่งเน้นงานการเขียนโปรแกรม การใช้เหตุผลทางคณิตศาสตร์ และสถานการณ์ agentic พร้อมการเรียกใช้เครื่องมือแบบต่อเนื่อง[1]
รายงานทางเทคนิคอธิบาย pipeline การ post-training แบบหลายขั้นตอน: การสังเคราะห์ข้อมูล agentic ในวงกว้างโดยการจำลองการโต้ตอบกับเครื่องมือ; การฝึกด้วย reinforcement learning ในสภาพแวดล้อมผสมของงานจริงและงานสังเคราะห์; การใช้ LLM ประเมินผลสำหรับการประเมินคุณภาพโดยอัตโนมัติ[1][14]
Kimi K2 Thinking
ตัวแปร Kimi K2 Thinking ได้รับการปรับแต่งสำหรับการใช้เหตุผลแบบหลายขั้นตอน (chain-of-thought) พร้อมความสามารถในการเรียกใช้เครื่องมือแบบไดนามิกและรองรับ context ถึง 256,000 token โมเดลนำเสนอโหมด "Thinking" แยกต่างหากพร้อมฟิลด์ reasoning_content ที่ส่งคืนอย่างชัดเจนซึ่งมีการใช้เหตุผลภายใน K2 Thinking รองรับการเรียกใช้เครื่องมือแบบต่อเนื่อง 200–300 ครั้งในหนึ่ง agentic episode โดยไม่มีการเสื่อมสภาพของพฤติกรรมอย่างมีนัยสำคัญ และยังรองรับ INT4 quantization แบบ native ด้วย QAT[10]
Kimi-VL
Kimi-VL — MoE-VLM (vision-language model) มัลติโมดัลแบบเปิดที่มุ่งเน้นงานการเข้าใจภาพ การใช้เหตุผลระหว่างภาพและข้อความ และฉากในชีวิตจริง โมเดลถูกอธิบายว่าเป็นสถาปัตยกรรม MoE แบบ compact พร้อม visual encoder MoonViT รายงานทางเทคนิคเผยแพร่บน arXiv ในเดือนเมษายน 2025[9]
Kimi K2.5
Kimi K2.5 — โมเดล MoE มัลติโมดัลในระดับ 1.04 ล้านล้านพารามิเตอร์ที่มีพารามิเตอร์ที่เปิดใช้งาน 32 พันล้าน โดยอิงจาก checkpoint ของ Kimi-K2-Base พร้อม continual pre-training บน ~15 ล้านล้าน token ผสมระหว่างภาพและข้อความเพิ่มเติม โมเดลรองรับอินพุตรูปภาพ วิดีโอ PDF และข้อความพร้อม context ถึง 256,000 token[2]
K2.5 รองรับโหมดการ inference หลักสองโหมด:
- Thinking mode — พร้อม
reasoning_contentที่ชัดเจนและการสร้างแบบหลายขั้นตอน - Instant mode — โดยไม่มีการแสดงการใช้เหตุผล ด้วย latency ที่ต่ำกว่า[2][13]
โมเดลนำเสนอ INT4 quantization แบบ native ของน้ำหนัก (weight-only, กลุ่ม 32) ที่ปรับให้เหมาะกับสถาปัตยกรรม NVIDIA Hopper[2]
ผลลัพธ์หลักและ benchmark
Benchmark ข้อความและ agentic ของ Kimi K2
ผลลัพธ์แสดงสำหรับ Kimi-K2-Instruct ในโหมด non-thinking (โดยไม่มี chain-of-thought ขยาย) ตามข้อมูลของรายงานทางเทคนิค[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | แหล่งที่มา |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65.8% | 38.8% | 72.5% / 72.7% | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47.3% | 20.9% | 51.0% | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53.7% | 44.7% | 46.9% | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66.1% | 48.8% | 66.1% | arXiv:2507.20534 |
| ACEBench (En) | 76.5% | 75.6% | 80.1% | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49.5% | 33.9% | 46.7% | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75.1% | 68.2% | 74.9% | arXiv:2507.20534 |
ตามคำกล่าวอ้างของผู้เขียน ผลลัพธ์เหล่านี้วาง K2 ไว้ในกลุ่มผู้นำของโมเดลแบบเปิดในโหมดที่ไม่มีการขยาย thinking โดยเฉพาะอย่างยิ่งในงานวิศวกรรมและ agentic (ณ เวลาที่เผยแพร่รายงาน)[1]
Benchmark ของ Kimi-VL
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | แหล่งที่มา |
|---|---|---|---|---|
| MMVet (ความแม่นยำ) | 66.7% | 67.1% | 66.9% | arXiv:2504.07491 |
| RealWorldQA | 68.1% | 68.5% | — | arXiv:2504.07491 |
ผลลัพธ์แสดงให้เห็นว่าสถาปัตยกรรม MoE มัลติโมดัลแบบ compact สามารถบรรลุระดับที่เทียบเคียงได้กับโมเดลขนาดใหญ่กว่าโดยมีพารามิเตอร์ที่ใช้งานอยู่น้อยกว่า[9]
Benchmark ของ Kimi K2.5
ผลลัพธ์แสดงในโหมด Thinking (temperature = 1.0; top-p = 0.95; context 256,000 token; engine vLLM; แพลตฟอร์มฮาร์ดแวร์ NVIDIA H200) ตามข้อมูลของ model card บนแพลตฟอร์ม NVIDIA NIM และรายงานทางเทคนิค[2][13]
| หมวดหมู่ | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (โดยไม่มีเครื่องมือ) | 30.1 |
| HLE-Full (พร้อมเครื่องมือ) | 50.2 | |
| AIME 2025 | 96.1 | |
| HMMT 2025 (Feb) | 95.4 | |
| GPQA-Diamond | 87.6 | |
| MMLU-Pro | 87.1 | |
| Vision & Video | MMMU-Pro | 78.5 |
| MathVision | 84.2 | |
| MathVista (mini) | 90.1 | |
| OCRBench | 92.3 | |
| OmniDocBench 1.5 | 88.8 | |
| VideoMMMU | 86.6 | |
| LongVideoBench | 79.8 | |
| Coding | SWE-Bench Verified | 76.8 |
| SWE-Bench Pro | 50.7 | |
| SWE-Bench Multilingual | 73.0 | |
| Terminal Bench 2.0 | 50.8 | |
| PaperBench | 63.5 | |
| LiveCodeBench v6 | 85.0 | |
| OJBench (C++) | 57.4 | |
| Long Context | Longbench v2 | 61.0 |
| AA-LCR | 70.0 | |
| Agentic Search | BrowseComp | 60.6 |
| BrowseComp (Agent Swarm) | 78.4 | |
| WideSearch (iter-F1) | 72.7 | |
| DeepSearchQA | 77.1 |
นอกจากนี้ K2.5 ยังแสดงให้เห็นการถ่ายโอนเชิงบวกของการฝึกด้านภาพไปยังงานข้อความ: +1.7% บน MMLU-Pro และ +2.1% บน GPQA-Diamond เมื่อเทียบกับโมเดลพื้นฐานข้อความ K2[2]
การประเมินเปรียบเทียบขั้นสุดท้ายขึ้นอยู่กับการเลือก metric และสถานการณ์ ผลลัพธ์ที่แสดงมาจากข้อมูลของผู้เขียน การตรวจสอบอิสระของ benchmark บางส่วน ณ เวลาที่เผยแพร่ยังมีจำกัด[2][15]
การประยุกต์ใช้งาน
ผู้ช่วยข้อความและการค้นหา
แพลตฟอร์ม Kimi ถูกใช้เป็นผู้ช่วยที่รองรับการประมวลผลเอกสารยาว (รายงานการวิจัย ข้อมูลทางการเงิน) การวิเคราะห์อัตโนมัติ และการค้นหาออนไลน์พร้อมการรวบรวมข้อมูล Moonshot AI ระบุว่า Kimi รองรับการเรียกใช้เครื่องมือ (tool calls) มากกว่า 300 ครั้งในสถานการณ์ agentic เดียว[7][4]
การเขียนโปรแกรมและงานวิศวกรรม
Kimi K2 และ K2.5 แสดงผลลัพธ์สูงบน SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench และ benchmark การเขียนโปรแกรมอื่นๆ โมเดลถูกใช้สำหรับการแก้ไขข้อผิดพลาดอัตโนมัติใน repository การสร้างและ refactoring โค้ด การแก้ปัญหาของ online judge (OJBench, LiveCodeBench) รายงานทางเทคนิค K2 ระบุว่าโมเดลได้รับการฝึกบน corpus agentic สังเคราะห์ขนาดใหญ่ รวมถึงการโต้ตอบกับระบบจัดการเวอร์ชัน package manager และสภาพแวดล้อมการดำเนินการ[1][2][14]
แอปพลิเคชันมัลติโมดัล
Kimi-VL และ K2.5 ออกแบบมาสำหรับการตอบคำถามด้านภาพ (VQA) บนรูปภาพและเอกสาร การเข้าใจเอกสาร (OCRBench, OmniDocBench) การวิเคราะห์วิดีโอ (VideoMMMU, LongVideoBench) งานการเขียนโปรแกรมแบบผสมตามข้อกำหนดภาพ (เช่น การสร้าง interface จาก mockup รูปภาพ) สำหรับ K2.5 มีการอธิบายสถานการณ์ "vision-grounded coding" และ "autonomous visual debugging" ที่โมเดลสร้างโค้ดตามคำอธิบายภาพและวิเคราะห์ผลลัพธ์ภาพแบบ iterative[2][9][15]
API และการ deploy
โมเดลพร้อมใช้งานผ่าน API ของแพลตฟอร์ม Moonshot AI Open Platform พร้อมรองรับ tool calling, thinking mode, JSON mode และการ cache context น้ำหนักแบบเปิดใช้สำหรับการ deploy ในเครื่องผ่าน vLLM, SGLang และ TensorRT-LLM บริการ Mooncake ช่วยให้สามารถปรับขนาด inference สำหรับ context ยาว[4][11][16]
ข้อจำกัดและปัญหาเปิด
ความต้องการด้านทรัพยากร
โมเดล MoE ในระดับ 1 ล้านล้านพารามิเตอร์ แม้จะมีพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านและ INT4 quantization ก็ยังต้องการหน่วยความจำและแบนด์วิดท์ที่มีนัยสำคัญ ในการอภิปรายด้านวิศวกรรมเกี่ยวกับการ deploy Kimi K2.5 มีการกล่าวถึงประมาณการในระดับหลายร้อยกิกะไบต์ของ VRAM สำหรับการโหลดโมเดลเต็ม ตัวเลขที่แน่นอนขึ้นอยู่กับรูปแบบ quantization และ framework (vLLM, SGLang เป็นต้น)[2][17]
Hallucination และคุณภาพการสร้าง
เช่นเดียวกับ LLM อื่นๆ โมเดลในซีรีส์ Kimi มีแนวโน้มเกิด hallucination ในรายงานการทดสอบ FACTS Grounding และ FaithJudge มีการบันทึก hallucination rate ในช่วง 1.1–7.4% ในสถานการณ์ RAG ในโหมด non-thinking โมเดลอาจสร้าง token ส่วนเกินเมื่อมีข้อกำหนดเครื่องมือที่ไม่ชัดเจน เมื่อบังคับเปิดใช้งาน tool-use ประสิทธิภาพจะลดลงในบางงาน[1]
การพึ่งพาข้อมูลสังเคราะห์และ pipeline RL
Pipeline การสังเคราะห์ข้อมูล agentic และการฝึกด้วย reinforcement learning อาศัยคอลเลกชันขนาดใหญ่ของเครื่องมือและฉากสังเคราะห์ รวมถึง LLM ประเมินผลสำหรับการประเมินอัตโนมัติ (self-judging) รูปแบบดังกล่าวก่อให้เกิดคำถามเปิด: ความทนทานต่อความลำเอียง (bias) ของการประเมินตัวเอง การเสื่อมสภาพที่อาจเกิดขึ้นเมื่อทำ iteration ซ้ำหลายครั้ง (bootstrap) การถ่ายโอนทักษะ agentic ไปยังสภาพแวดล้อมจริงที่แตกต่างจากการจำลอง อิทธิพลของการกระจายงานสังเคราะห์ต่อความสามารถในการ generalize[1][14]
ความโปร่งใสและการทำซ้ำ
ข้อมูลบางส่วนเกี่ยวกับองค์ประกอบของข้อมูลการฝึก กระบวนการกรอง การกระจายภาษาและโดเมนไม่ได้เปิดเผยหรือเปิดเผยอย่างจำกัด ซึ่งทำให้การประเมินแหล่งที่มาของความลำเอียงอย่างแม่นยำ การทำซ้ำการฝึก และการตรวจสอบอิสระของผลกระทบของส่วนประกอบแต่ละชิ้น (MuonClip, QK-clip) ต่อเสถียรภาพทำได้ยาก ณ เดือนกุมภาพันธ์ 2026 ไม่มีการบันทึกการทำซ้ำการฝึก Kimi K2 และ K2.5 อย่างสมบูรณ์โดยบุคคลที่สามในวรรณกรรมเปิด[1][2]
แง่มุมด้านจริยธรรมและกฎระเบียบ
ใน model card และรายงานทางเทคนิคมีการเน้นย้ำว่านักพัฒนามีความรับผิดชอบต่ออินพุตและเอาต์พุตของโมเดล จำเป็นต้องเพิ่มกลไกป้องกัน (guardrails) และทดสอบกับข้อมูลของกรณีเฉพาะก่อนนำไปใช้งาน โมเดลสามารถประมวลผลรูปภาพและวิดีโอที่อาจมีข้อมูลส่วนบุคคล และผู้รวมระบบมีหน้าที่ต้องปฏิบัติตามกฎหมายที่เกี่ยวข้อง[2][16]
รายงานทางเทคนิคอธิบายการประเมินด้านความปลอดภัย (ความเสี่ยงทางชีวภาพ เคมี และไซเบอร์) โดยใช้เครื่องมือประเภท Promptfoo โมเดลผ่านการ alignment ด้วย RL พร้อมรางวัลที่ตรวจสอบได้และการประเมินตัวเอง[1]
ในฐานะผลิตภัณฑ์ของบริษัทจีน โมเดลต้องปฏิบัติตามกฎระเบียบแห่งชาติของสาธารณรัฐประชาชนจีนในด้าน AI ณ เวลาที่เขียน ยังไม่พบเอกสารกฎระเบียบสาธารณะแยกต่างหากที่อุทิศให้กับโมเดล Kimi โดยเฉพาะ การกำกับดูแลดำเนินการภายในกรอบแนวทางทั่วไปสำหรับโมเดล generative และ AI ในเขตอำนาจศาลที่เกี่ยวข้อง[18]
ในเดือนกุมภาพันธ์ 2026 บริษัท Anthropic อ้างว่า Moonshot AI (พร้อมกับนักพัฒนาจีนรายอื่น) ใช้บัญชีปลอมเพื่อสร้างการโต้ตอบกับ Claude เพื่อดึงข้อมูล (distillation) สำหรับการฝึกโมเดล ข้อมูลนี้มีลักษณะเป็นการยืนยันของฝ่ายเดียวและยังไม่ได้รับการยืนยันโดยการสืบสวนอิสระ ณ เวลาที่เผยแพร่ Moonshot AI ยังไม่ได้เผยแพร่คำตอบอย่างเป็นทางการ[5]
แนวโน้มและทิศทางการวิจัย
จากเอกสารที่เผยแพร่ สามารถระบุทิศทางการวิจัยในอนาคตได้หลายทิศทาง:
- ระบบ agentic ที่ปรับขนาดได้ การพัฒนาแนวทางการฝึก LLM ในฐานะระบบ agentic โดยใช้ชุดเครื่องมือสังเคราะห์ RL และ self-judging การขยาย Agent Swarm ให้ครอบคลุม sub-agent จำนวนมากขึ้นและงานประเภทใหม่[2][1]
- สถาปัตยกรรม MoE ที่มีประสิทธิภาพ การใช้พารามิเตอร์ 1 ล้านล้านกับพารามิเตอร์ที่เปิดใช้งาน 32 พันล้านและผู้เชี่ยวชาญ 384 คนแสดงถึงหนึ่งในทางเลือกของการประนีประนอมระหว่างขนาดและประสิทธิภาพ กำลังมีการศึกษาทางเลือกอื่นๆ ที่มีรูปแบบ routing ที่แตกต่างกัน[1]
- ความสามารถมัลติโมดัลแบบ native การฝึก K2.5 บนข้อมูลผสมระหว่างภาพและข้อความตั้งแต่เริ่ม pre-training แสดงถึงแนวทางสู่ความสามารถมัลติโมดัลแบบ "native" ซึ่งเปรียบเทียบกับรูปแบบสองขั้นตอน[2][9]
- Inference ที่มีประสิทธิภาพและ context ยาว INT4 quantization และการรองรับ context 256,000 token กระตุ้นการวิจัยเพิ่มเติมในด้าน sparse attention, latent representation และหน่วยความจำภายนอก มีการอธิบายโครงการ Kimi Linear แยกต่างหาก — hybrid linear attention พร้อมการลด KV cache 75% และการเร่งความเร็ว decoding 6 เท่าที่ context 1 ล้าน token[2][19]
ในเอกสารอย่างเป็นทางการของ Moonshot AI ไม่มีการเผยแพร่ roadmap โดยละเอียดสำหรับเวอร์ชัน Kimi ในอนาคต ทิศทางที่ระบุไว้อิงตามงานวิจัยที่เผยแพร่
ดูเพิ่มเติม
- สถาปัตยกรรม Transformer
- DeepSeek
- Qwen
อ้างอิง
- https://www.moonshot.ai/ — เว็บไซต์อย่างเป็นทางการของ Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — GitHub repository ของ Kimi K2.5
- https://huggingface.co/moonshotai — โปรไฟล์ Moonshot AI บน Hugging Face
บรรณานุกรม
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
หมายเหตุ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692