Kimi (Moonshot AI) (HE)
Kimi (סדרת המודלים של Moonshot AI) — סדרה של מודלי שפה גדולים (Large Language Model, LLM), המפותחים על ידי החברה הסינית Moonshot AI (בייג'ינג, סין) למשימות של יצירת טקסט ומולטימודאליות, תכנות ומערכות סוכניות (agentic systems — מערכות המסוגלות לתכנון אוטונומי, הסקת מסקנות ופעולה תוך שימוש בכלים חיצוניים). המשפחה כוללת מודלים טקסטואליים ומולטימודאליים עם ארכיטקטורת Mixture-of-Experts (MoE, תערובת מומחים) בסדר גודל של כ-1 טריליון פרמטרים ועם תת-קבוצה מופעלת של כ-32 מיליארד פרמטרים לכל token.[1][2] מאפיין חשוב של הסדרה הוא ההתמקדות בהתנהגות סוכנית (תכנון רב-שלבי עם הפעלת כלים חיצוניים) ותמיכה ב-context ארוך של עד 256,000 tokens בגרסאות Kimi K2 ו-Kimi K2.5.[1][2]
מודלי סדרת Kimi מופצים הן עם משקלים פתוחים (open-weight) בפלטפורמת Hugging Face תחת רישיון MIT מותאם, והן דרך API קנייני של פלטפורמת Moonshot AI Open Platform.[3][4]
היסטוריה ורקע
ייסוד Moonshot AI
Moonshot AI נוסדה במרץ 2023 בבייג'ינג על ידי Yang Zhilin (CEO), Zhou Xinyu ו-Wu Yuxin — בוגרי אוניברסיטת Tsinghua. Yang Zhilin עבד בעבר ב-Google Brain וב-Meta, והשתתף במחקרים בתחום ראיית מחשב והסקת מסקנות. החברה קיבלה מימון מ-Alibaba (סבב בהיקף של מיליארד דולר, פברואר 2024), Tencent ומשקיעים נוספים.[5][6]
ציר הזמן של שחרורים מרכזיים
- אוקטובר–נובמבר 2023 — השקת chatbot Kimi עם תמיכה ב-context של עד 128 אלף tokens (עד 200 אלף תווים סיניים). הגרסאות הראשונות השתמשו במודלים קנייניים עם פרטים טכניים שנחשפו באופן חלקי.[6][7]
- מרץ 2024 — הרחבת ה-context לכ-2 מיליון תווים בגרסת בטא.[6]
- ינואר 2025 — שחרור Kimi k1.5 — מודל מולטימודאלי עם Reinforcement Learning (RL) מוגדל, שהוצהר כמשווה בביצועיו ל-OpenAI o1 במשימות מתמטיקה, תכנות והסקה מולטימודאלית. Context של עד 128 אלף tokens.[8]
- אפריל 2025 — הוצגה Kimi-VL — מודל MoE מולטימודאלי פתוח (vision-language model, VLM) עם encoder חזותי MoonViT (כ-400 מיליון פרמטרים) וכ-2.8 מיליארד פרמטרים פעילים ב-decoder. דוח טכני פורסם ב-arXiv.[9]
- יולי 2025 — שחרור Kimi K2 — מודל MoE פתוח עיקרי עם טריליון פרמטרים ו-32 מיליארד פרמטרים פעילים. דוח טכני פורסם ב-arXiv.[1] המודל תפס את המקום הראשון בין המודלים הפתוחים ב-LMSYS Chatbot Arena בעת השחרור (יותר מ-3,000 קולות).[1]
- ספטמבר 2025 — עדכון Kimi-K2-Instruct-0905 עם הרחבת context לעד 256 אלף tokens ושיפור בכתיבת קוד סוכנית.[1]
- נובמבר 2025 — שחרור Kimi K2 Thinking — גרסה עם הסקת מסקנות שלב-אחר-שלב (chain-of-thought) מוגברת ותמיכה ב-200–300 קריאות כלים עוקבות (tool calls).[10]
- ינואר 2026 — הוצגה Kimi K2.5 — מודל MoE מולטימודאלי עם מולטימודאליות נאטיבית ומנגנון Agent Swarm (תזמור מקבילי של תת-סוכנים).[2]
במקביל לפיתוח המודלים, הוצג בשנת 2024 שירות inference קנייני בשם Mooncake — ארכיטקטורה מבוזרת ממוקדת-KVCache להגשת LLM עם context ארוך.[11]
יסודות תיאורטיים וארכיטקטורה
ארכיטקטורת Mixture-of-Experts
מודלי סדרת Kimi K2 ו-K2.5 מממשים ארכיטקטורת Transformer עם Mixture-of-Experts בשכבות נפרדות. בלוק ה-transformer הסטנדרטי הוא קומפוזיציה של שכבות multi-head self-attention (Multi-Head Attention, MHA) ו-MLP (רשת רב-שכבתית) positional-wise עם חיבורים שיוריים:[1][12]
כאשר — ייצוגי ה-tokens הקלט, — אורך הסדרה, — גודל המצב הנסתר.
בשכבת MoE, במקום MLP בודד, נעשה שימוש בקבוצת מומחים , שכל אחד מהם הוא MLP נפרד עם פרמטרים . ה-router (gating network) בוחר עבור כל token תת-קבוצה של מומחים. פלט שכבת ה-MoE עבור token עם ייצוג מוגדר כ:[1]
כאשר — קבוצת המומחים הנבחרים עבור ה-token הנתון, — משקלי ה-router המנורמלים, . פונקציית הניתוב בוחרת מומחים דרך פעולת TopK:[1]
כאשר — מטריצת ה-router הניתנת לאימון. סכמה זו מאפשרת להגדיל את מספר הפרמטרים הכולל תוך הגבלת מספר הפרמטרים המופעלים עבור כל token.
היפר-פרמטרים ארכיטקטוניים של Kimi K2 / K2.5
| פרמטר | ערך |
|---|---|
| סוג ארכיטקטורה | Transformer עם Mixture-of-Experts |
| מספר פרמטרים כולל | 1.04 טריליון |
| פרמטרים פעילים לכל token | 32 מיליארד |
| מספר שכבות | 61 (1 צפוף + 60 MoE) |
| גודל המצב הנסתר | 7168 |
| מספר ראשי attention | 64 |
| מספר מומחים | 384 (8 נבחרים לכל token + 1 משותף) |
| גודל המצב הנסתר של המומחה (MoE hidden size) | 2048 |
| גודל אוצר המילים | 160,000 tokens |
| פונקציית הפעלה | SwiGLU |
| מנגנון attention | Multi-head Latent Attention (MLA) |
| context מקסימלי | 256,000 tokens (הרחבה דרך YaRN) |
| encoder חזותי (K2.5) | MoonViT-3D, כ-400 מיליון פרמטרים |
ה-sparsity (יחס מספר המומחים הכולל לפעיל) הוא 48:1 (384 מומחים, 8 פעילים), מה שמבטיח הפחתה משמעותית של עלויות חישוביות ביחס למודל צפוף (dense) באותו הסדר גודל.[1]
מנגנון Multi-head Latent Attention (MLA)
במודלי סדרת Kimi K2/K2.5 נעשה שימוש במנגנון Multi-head Latent Attention (MLA) — שינוי של ה-multi-head attention הסטנדרטי, שמטרתו לשפר יעילות ומדרגיות. ה-attention הסטנדרטי עבור שכבה אחת מחושב כ:[12]
כאשר — מטריצות השאילתות, המפתחות והערכים. ב-MLA מוכנסים ייצוגים לטנטיים שאליהם מוקרנות השאילתות והמפתחות, מה שמקטין את הממד של הפעולות הביניים ומאפשר הפחתת נפח ה-KV-cache. הגישה דומה למנגנון שנעשה בו שימוש ב-DeepSeek-V3.[1][13]
האופטימייזר MuonClip ו-QK-clip
לצורך אימון המודל Kimi K2 הוצע האופטימייזר MuonClip — שינוי של האופטימייזר Muon (אופטימייזר מומנטום עם נרמול Newton-Schulz) עם הוספת טכניקת QK-clip לייצוב אימון מודלי שפה גדולים עם ארכיטקטורת MoE.[1]
QK-clip מיישם הגבלות על ה-logits של ה-attention דרך פעולת clipping. עבור כל ראש attention מוגדר ה-logit המקסימלי:
ומחושב מקדם הסיכלה:
כאשר — היפר-פרמטר סף, — גודל ראש ה-attention. המקדם משמש לסיכלת המשקלות אם ה-logit המקסימלי עולה על הסף. זה מגביל את טווח ערכי ה-logits לפני softmax ומפחית את הסיכון לזינוקים חדים בפונקציית ההפסד (loss spikes) בעת אימון בקנה מידה גדול.[1]
לפי נתוני המחברים, האימון המקדים של Kimi K2 על 15.5 טריליון tokens עם MuonClip עבר ללא אף זינוק אחד מתועד בפונקציית ההפסד (zero loss spikes).[1]
מולטימודאליות ו-MoonViT
מודלי Kimi K2.5 ו-Kimi-VL משתמשים ב-encoder החזותי MoonViT (בגרסת K2.5 — MoonViT-3D) עם כ-400 מיליון פרמטרים, הבנוי על בסיס SigLIP-SO-400M עם NaViT-packing (תמיכה ברזולוציה משתנה של תמונות קלט) והרחבה תלת-ממדית לעיבוד וידאו (קיבוץ כל 4 פריימים).[2][9]
ה-encoder החזותי ממיר תמונות וידאו קלט לרצף של tokens חזותיים. יהי — תמונת הקלט, — ה-encoder החזותי:
לאחר מכן דרך הקרנה לינארית (MLP דו-שכבתי) :
כאשר — גודל המרחב הנסתר של חלק השפה של המודל. במצב מולטימודאלי, מקושר לרצף ה-tokens הטקסטואליים ומוזן ל-transformer.[9][2]
בניגוד לסכמות דו-שלביות (הוספת adapter חזותי מעל מודל טקסט), K2.5 אומנה על נתונים חזותיים-טקסטואליים מעורבים מתחילת האימון המקדים (joint text-vision pre-training), עם שיעור נמוך של tokens חזותיים (~10%) בשלבים המוקדמים, ועם הגדלה הדרגתית. הנפח הכולל — כ-15 טריליון tokens חזותיים-טקסטואליים מעורבים.[2]
אימון מקדים ואימון לאחר-מקדים
אימון מקדים
Kimi K2 אומנה מראש על 15.5 טריליון tokens (טקסטי אינטרנט, קוד, מתמטיקה, ידע אנציקלופדי) תוך שימוש באופטימייזר MuonClip. לא נרשם אף זינוק בפונקציית ההפסד (loss spike) לאורך כל תקופת האימון המקדים.[1]
Kimi K2.5 עברה אימון מקדים רציף (continual pre-training) מנקודת הביקורת של K2 על כ-15 טריליון tokens חזותיים-טקסטואליים מעורבים נוספים עם אופטימיזציה משותפת של הוֹדָלִיּוֹת (joint pre-training). בנפרד בוצעו אימון standalone של 1 טריליון tokens עבור ה-encoder החזותי ושלב mid-training נוסף לhttps long-context להרחבת ה-context.[2]
אימון לאחר-מקדים
אימון לאחר-מקדים של מודלי סדרת K2 כולל מספר שלבים:[1][2]
Supervised Fine-Tuning (SFT, כוונון עדין מבוקר):
- מסלולי סוכן סינתטיים (agentic data synthesis) — יצירת מפרטי כלים, סימולציה של אינטראקציות עם הסביבה, אימות תוצאות.
- עבור K2.5 מיושם בנוסף zero-vision SFT — SFT טקסטואלי המפעיל יכולות חזותיות ללא שימוש ישיר בתמונות בשלב ה-fine-tuning.
Reinforcement Learning (RL, למידה מחיזוקים):
- שילוב של תגמולים בני-אימות (Reinforcement Learning with Verifiable Rewards, RLVR) למשימות מתמטיקה, קוד ובטיחות.
- הערכה עצמית לפי מדדי ניקוד (self-critique rubric rewards) — שימוש ב-LLM שופטים להערכה אוטומטית של איכות תרחישי סוכנים.
- עבור K2.5 — RL מולטימודאלי משותף (joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking ו-K2.5 תומכות בכימות משקלים נאטיבי INT4 (weight-only quantization, קבוצה 32, tensors דחוסים), המותאם לארכיטקטורת NVIDIA Hopper, מה שמפחית את דרישות הזיכרון בזמן הסקה.[10][2]
Agent Swarm (K2.5)
עבור המודל K2.5 פותח מנגנון Agent Swarm — מסגרת לתזמור מקבילי עצמי-מנוהל של סוכנים. מודל ה-orchestrator יוצר תת-סוכנים באופן דינמי (דרך פעולות create_subagent, assign_task), מחלק תת-משימות ואוסף תוצאות. כל תת-סוכן יכול להפעיל כלים באופן עצמאי ולפעול במקביל לתת-סוכנים אחרים.[2]
אימון מנגנון Agent Swarm מומש דרך Parallel-Agent Reinforcement Learning (PARL) עם הפרדה בין ביצוע לאופטימיזציה (decoupling execution/optimization). לפי נתוני המחברים, Agent Swarm מספק הפחתת זמן תגובה (latency) של עד פי 4.5 בהשוואה למצב סוכן חד-תהליכי (single-agent).[2]
מודלים עיקריים בסדרה
| מודל | סוג | פרמטרים (כולל / פעילים) | Context, tokens | מולטימודאליות | תאריך שחרור |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | לא נחשף | 128,000 | כן (מוגבלת) | ינואר 2025 |
| Kimi-VL | VLM, MoE | קומפקטי / ~2.8 מיליארד פעילים + 400 מיליון ViT | context ארוך | כן (תמונות) | אפריל 2025 |
| Kimi K2 | LLM, MoE | 1.04 טריליון / 32 מיליארד | 256,000 | לא (טקסט) | יולי 2025 |
| Kimi K2 Thinking | LLM, MoE | 1.04 טריליון / 32 מיליארד | 256,000 | לא (טקסט) | נובמבר 2025 |
| Kimi K2.5 | VLM-LLM, MoE | 1.04 טריליון / 32 מיליארד | 256,000 | כן (תמונות, וידאו, PDF) | ינואר 2026 |
Kimi K2
Kimi K2 — LLM מסוג Mixture-of-Experts עם 1.04 טריליון פרמטרים כוללים ו-32 מיליארד פרמטרים מופעלים לכל token. אומנה מראש על 15.5 טריליון tokens עם האופטימייזר MuonClip. הארכיטקטורה כוללת 384 מומחים ומנגנון MLA התואם context ארוך. המודל מכוון למשימות תכנות, הסקה מתמטית ותרחישי סוכנים עם קריאות כלים עוקבות.[1]
הדוח הטכני מתאר pipeline רב-שלבי של אימון לאחר-מקדים: סינתזה רחבת-היקף של נתוני סוכן על ידי סימולציה של אינטראקציות עם כלים; למידה מחיזוקים בסביבה מעורבת של משימות אמיתיות וסינתטיות; שימוש ב-LLM שופטים להערכה אוטומטית של איכות.[1][14]
Kimi K2 Thinking
הגרסה Kimi K2 Thinking מותאמת להסקה רב-שלבית (chain-of-thought) עם יכולת הפעלה דינמית של כלים ותמיכה ב-context של עד 256,000 tokens. המודל מממש מצב "Thinking" נפרד עם שדה reasoning_content המוחזר במפורש, המכיל הסקות פנימיות. K2 Thinking תומך ב-200–300 קריאות כלים עוקבות בפרק סוכן אחד ללא דגרדציה משמעותית בהתנהגות, כמו גם בכימות INT4 נאטיבי תוך שימוש ב-QAT.[10]
Kimi-VL
Kimi-VL — מודל MoE-VLM (vision-language model) מולטימודאלי פתוח, המכוון למשימות של הבנה חזותית, הסקה חזותית-טקסטואלית וסצנות מהעולם האמיתי. המודל מתואר כארכיטקטורת MoE קומפקטית עם encoder חזותי MoonViT. הדוח הטכני פורסם ב-arXiv באפריל 2025.[9]
Kimi K2.5
Kimi K2.5 — מודל MoE מולטימודאלי בסדר גודל של 1.04 טריליון פרמטרים עם 32 מיליארד פעילים, המבוסס על נקודת הביקורת Kimi-K2-Base עם אימון מקדים ממושך על כ-15 טריליון tokens חזותיים-טקסטואליים מעורבים. המודל תומך בקלטי תמונות, וידאו, PDF וטקסט עם context של עד 256,000 tokens.[2]
K2.5 תומכת בשני מצבי הסקה עיקריים:
- מצב Thinking — עם
reasoning_contentמפורש ויצירה רב-שלבית; - מצב Instant — ללא פלט הסקות, עם זמן תגובה נמוך יותר.[2][13]
המודל מממש כימות משקלים נאטיבי INT4 (weight-only, קבוצה 32), המותאם לארכיטקטורת NVIDIA Hopper.[2]
תוצאות מרכזיות ו-benchmarks
Benchmarks טקסטואליים וסוכניים של Kimi K2
התוצאות מובאות עבור Kimi-K2-Instruct במצב non-thinking (ללא chain-of-thought מורחב) לפי נתוני הדוח הטכני.[1]
| Benchmark | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | מקור |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65.8% | 38.8% | 72.5% / 72.7% | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47.3% | 20.9% | 51.0% | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53.7% | 44.7% | 46.9% | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66.1% | 48.8% | 66.1% | arXiv:2507.20534 |
| ACEBench (En) | 76.5% | 75.6% | 80.1% | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49.5% | 33.9% | 46.7% | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75.1% | 68.2% | 74.9% | arXiv:2507.20534 |
לפי הצהרת המחברים, תוצאות אלה ממצבות את K2 בין מובילי המודלים הפתוחים במצב ללא thinking-deployment, במיוחד במשימות הנדסה וסוכניות (נכון למועד פרסום הדוח).[1]
Benchmarks של Kimi-VL
| Benchmark | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | מקור |
|---|---|---|---|---|
| MMVet (דיוק) | 66.7% | 67.1% | 66.9% | arXiv:2504.07491 |
| RealWorldQA | 68.1% | 68.5% | — | arXiv:2504.07491 |
התוצאות מדגימות שארכיטקטורת MoE מולטימודאלית קומפקטית מגיעה לרמה הדומה למודלים גדולים יותר עם פחות פרמטרים פעילים.[9]
Benchmarks של Kimi K2.5
התוצאות מובאות במצב Thinking (temperature = 1.0; top-p = 0.95; context 256,000 tokens; מנוע vLLM; פלטפורמת חומרה NVIDIA H200) לפי נתוני כרטיס המודל בפלטפורמת NVIDIA NIM ומהדוח הטכני.[2][13]
| קטגוריה | Benchmark | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (ללא כלים) | 30.1 |
| HLE-Full (עם כלים) | 50.2 | |
| AIME 2025 | 96.1 | |
| HMMT 2025 (Feb) | 95.4 | |
| GPQA-Diamond | 87.6 | |
| MMLU-Pro | 87.1 | |
| Vision & Video | MMMU-Pro | 78.5 |
| MathVision | 84.2 | |
| MathVista (mini) | 90.1 | |
| OCRBench | 92.3 | |
| OmniDocBench 1.5 | 88.8 | |
| VideoMMMU | 86.6 | |
| LongVideoBench | 79.8 | |
| Coding | SWE-Bench Verified | 76.8 |
| SWE-Bench Pro | 50.7 | |
| SWE-Bench Multilingual | 73.0 | |
| Terminal Bench 2.0 | 50.8 | |
| PaperBench | 63.5 | |
| LiveCodeBench v6 | 85.0 | |
| OJBench (C++) | 57.4 | |
| Long Context | Longbench v2 | 61.0 |
| AA-LCR | 70.0 | |
| Agentic Search | BrowseComp | 60.6 |
| BrowseComp (Agent Swarm) | 78.4 | |
| WideSearch (iter-F1) | 72.7 | |
| DeepSearchQA | 77.1 |
בנוסף, K2.5 מדגים העברה חיובית של למידה חזותית למשימות טקסט: +1.7% ב-MMLU-Pro ו-+2.1% ב-GPQA-Diamond בהשוואה למודל הבסיסי הטקסטואלי K2.[2]
הערכה השוואתית סופית תלויה בבחירת מדדים ותרחישים; התוצאות מובאות לפי נתוני המחברים. אימות עצמאי של חלק מה-benchmarks מוגבל נכון למועד הפרסום.[2][15]
יישומים
עוזר טקסטואלי וחיפוש
פלטפורמת Kimi משמשת כעוזר עם תמיכה בעיבוד מסמכים ארוכים (דוחות מחקר, נתונים פיננסיים), ניתוח אוטומטי וחיפוש מקוון עם איגוד מידע. Moonshot AI מציינת כי Kimi תומך ביותר מ-300 קריאות כלים (tool calls) במסגרת תרחיש סוכן אחד.[7][4]
תכנות ומשימות הנדסיות
Kimi K2 ו-K2.5 מדגימים תוצאות גבוהות ב-SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench ו-benchmarks תכנות אחרים. המודלים משמשים לאוטומציה של תיקון שגיאות ב-repositories, יצירת קוד ו-refactoring, פתרון משימות של שופטים מקוונים (OJBench, LiveCodeBench). הדוח הטכני של K2 מציין שהמודל אומן על corpus סינתטי סוכני רחב-היקף, הכולל אינטראקציות עם מערכות ניהול גרסאות, מנהלי חבילות וסביבות ריצה.[1][2][14]
יישומים מולטימודאליים
Kimi-VL ו-K2.5 מיועדים לשאלות-תשובות חזותיות (VQA) על תמונות ומסמכים; הבנת מסמכים (OCRBench, OmniDocBench); ניתוח וידאו (VideoMMMU, LongVideoBench); משימות משולבות של תכנות לפי מפרטים חזותיים (לדוגמה, יצירת ממשק לפי פריסת תמונה). עבור K2.5 מתוארים תרחישי "vision-grounded coding" ו-"autonomous visual debugging", שבהם המודל מייצר קוד לפי תיאור חזותי ומנתח באופן איטרטיבי את התוצאה החזותית.[2][9][15]
API ופריסה
המודלים זמינים דרך ה-API של פלטפורמת Moonshot AI Open Platform עם תמיכה ב-tool calling, מצב thinking, מצב JSON וב-caching של context. המשקלים הפתוחים משמשים לפריסה מקומית דרך vLLM, SGLang ו-TensorRT-LLM. שירות Mooncake מספק מדרגיות inference עבור context ארוך.[4][11][16]
מגבלות ובעיות פתוחות
דרישות משאבים
מודלי MoE בסדר גודל של טריליון פרמטרים, אפילו עם 32 מיליארד פרמטרים פעילים וכימות INT4, דורשים משאבי זיכרון ורוחב פס משמעותיים. בדיונים הנדסיים על פריסת Kimi K2.5 מוזכרות הערכות של מאות ג'יגה-בייט זיכרון וידאו לטעינת המודל המלא; המספרים המדויקים תלויים בצורת הכימות ובמסגרת (vLLM, SGLang וכדומה).[2][17]
הזיות ואיכות יצירה
כמו LLM אחרים, מודלי סדרת Kimi חשופים להזיות. בדוחות על מבחני FACTS Grounding ו-FaithJudge נרשמו מדדי hallucination rate בטווח של 1.1–7.4% בתרחישי RAG. במצב non-thinking המודל עשוי לייצר tokens עודפים עם מפרטי כלים לא ברורים; בעת כפיית שימוש בכלים, הביצועים יורדים בחלק מהמשימות.[1]
תלות בנתונים סינתטיים ו-RL pipeline
ה-pipeline של סינתזת נתוני סוכן ולמידה מחיזוקים נשען על אוסף גדול של כלים וסצנות סינתטיות, וכן על LLM שופטים להערכה אוטומטית (self-judging). סכמה זו מעלה שאלות פתוחות: עמידות בפני הטיה (bias) של הערכה עצמית; דגרדציה פוטנציאלית בחזרתיות (bootstrap); יכולת העברת מיומנויות סוכן לסביבות אמיתיות השונות מהסימולציות; השפעת התפלגות המשימות הסינתטיות על כוח ההכללה.[1][14]
שקיפות ורבייה
חלק מהמידע על הרכב נתוני האימון, תהליך הסינון, התפלגות השפות והתחומים אינו נחשף או נחשף באופן חלקי בלבד. הדבר מקשה על הערכה מדויקת של מקורות ההטיה, רבייה של האימון ואימות עצמאי של השפעת רכיבים בודדים (MuonClip, QK-clip) על יציבות. נכון לפברואר 2026, שחזור מלא של אימון Kimi K2 ו-K2.5 על ידי צדדים שלישיים לא תועד בספרות הפתוחה.[1][2]
היבטים אתיים ורגולטוריים
בכרטיסי המודל ובדוחות הטכניים מודגש כי המפתחים נושאים באחריות לקלטים ולפלטים של המודל; נדרשת הוספת מנגנוני הגנה (guardrails) ובדיקה על נתונים של המקרה הספציפי לפני הטמעה; המודל עשוי לעבד תמונות ווידאו שעלולים להכיל נתונים אישיים, והמשלב חייב לעמוד בחקיקה הרלוונטית.[2][16]
הדוחות הטכניים מתארים הערכות בטיחות (סיכוני ביולוגיה, כימיה, סייבר) תוך שימוש בכלים כגון Promptfoo. המודלים עוברים alignment מחיזוקים עם תגמולים בני-אימות והערכה עצמית.[1]
כמוצר של חברה סינית, המודלים כפופים לרגולציה הלאומית של סין בתחום ה-AI. נכון למועד הכתיבה, לא נמצאו מסמכים רגולטוריים ציבוריים נפרדים המוקדשים אך ורק למודלי Kimi; הרגולציה מבוצעת במסגרת הגישות הכלליות למודלים גנרטיביים ולבינה מלאכותית בתחומי השיפוט הרלוונטיים.[18]
בפברואר 2026 הצהירה חברת Anthropic שש-Moonshot AI (יחד עם מפתחים סינים אחרים) השתמשה בחשבונות מזויפים כדי לייצר אינטראקציות עם Claude לצורך distillation של נתונים לאימון מודלים. המידע הוא בגדר טענה של צד אחד ואינו מאושר על ידי חקירות עצמאיות נכון למועד הפרסום; Moonshot AI לא פרסמה תגובה רשמית.[5]
פרספקטיבות וכיוונים מחקריים
לפי החומרים שפורסמו, ניתן לזהות מספר כיוונים למחקר עתידי:
- מערכות סוכניות מדרגיות. פיתוח גישות לאימון LLM כמערכות סוכניות תוך שימוש בכלים סינתטיים, RL ו-self-judging. הרחבת Agent Swarm למספר רב יותר של תת-סוכנים וסוגים חדשים של משימות.[2][1]
- ארכיטקטורות MoE יעילות. שימוש בטריליון פרמטרים עם 32 מיליארד פעילים ו-384 מומחים מייצג אחד מה-trade-offs האפשריים בין קנה מידה ליעילות; נחקרות חלופות עם סכמות ניתוב שונות.[1]
- מולטימודאליות נאטיבית. אימון K2.5 על נתונים חזותיים-טקסטואליים מעורבים מתחילת האימון המקדים מייצג גישה ל"מולטימודאליות נאטיבית", הנשווית לסכמות דו-שלביות.[2][9]
- Inference יעיל ו-context ארוך. כימות INT4 ותמיכה ב-context של 256,000 tokens מעוררים מחקר נוסף בתחום sparse-attention, ייצוגים לטנטיים וזיכרון חיצוני. מתואר בנפרד פרויקט Kimi Linear — attention לינארי היברידי עם הפחתת KV-cache ב-75% והאצת decoding פי 6 עבור context של מיליון tokens.[2][19]
בחומרים הרשמיים של Moonshot AI אינן פורסמות מפות דרכים מפורטות לגרסאות עתידיות של Kimi; הכיוונים המפורטים מבוססים על מחקרים שפורסמו.
ראו גם
- ארכיטקטורת Transformer
- DeepSeek
- Qwen
קישורים חיצוניים
- https://www.moonshot.ai/ — אתר הרשמי של Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — מאגר GitHub של Kimi K2.5
- https://huggingface.co/moonshotai — פרופיל Moonshot AI ב-Hugging Face
ספרות
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
הערות
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4.0 4.1 4.2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5.0 5.1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6.0 6.1 6.2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7.0 7.1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8.0 8.1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9.0 9.1 9.2 9.3 9.4 9.5 9.6 9.7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10.0 10.1 10.2 10.3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11.0 11.1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14.0 14.1 14.2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15.0 15.1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16.0 16.1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692