Yi (01.AI) (HE)
Yi — משפחה של מודלים לשוניים גדולים (Large Language Model, LLM) ומודלים חזותיים-לשוניים (Vision-Language Model, VLM), שפותחה על ידי חברת 01.AI (零一万物) בהנהגת קאי-פו לי (Kai-Fu Lee). המודלים אומנו מאפס על גוף נתונים דו-לשוני באיכות גבוהה (אנגלית וסינית) בהיקף של 3.1 טריליון token, וכוללים גרסאות לייצור טקסט, עיבוד הקשר ארוך (עד 200 אלף token), קלט מולטי-מודאלי (טקסט + תמונות), יצירת קוד וייצור (inference) יעיל המבוסס על ארכיטקטורת Mixture-of-Experts (MoE). הגרסאות הפתוחות מופצות תחת רישיון Apache 2.0 המאפשר שימוש מסחרי; מודלים קנייניים סגורים (Yi-Large, Yi-Lightning) זמינים דרך API.[1][2][3]
היסטוריה וציר הזמן של הפיתוח
חברת 01.AI נוסדה במרץ 2023 על ידי קאי-פו לי, לשעבר ראש Microsoft Research Asia ו-Google China, ומשרדיה הראשיים נמצאים בבייג'ינג. מיקוד החברה הוא פיתוח LLM יעילים תוך דגש על איכות נתונים ואופטימיזציה הנדסית של תשתית. עד נובמבר 2023 השיגה 01.AI מעמד של "חד-קרן" (שווי העולה על מיליארד דולר) לאחר סבב מימון בהשתתפות Alibaba.[4][5]
הדור הראשון (2023–2024)
מודלי Yi-6B ו-Yi-34B הפתוחים הראשונים הוצגו ב-2 בנובמבר 2023. במהלך השבועות שלאחר מכן הורחבה הסדרה בגרסאות עם הקשר של 200 אלף token (5 בנובמבר 2023), גרסאות צ'אט ומודלים כמותיים (23 בנובמבר 2023). בינואר 2024 יצאו Yi-VL-6B ו-Yi-VL-34B המולטי-מודאליים. במרץ 2024 הוצג מודל Yi-9B שהתקבל בשיטת depth upscaling מתוך Yi-6B, ופורסם דוח טכני arXiv:2403.04652.[1][2]
Yi-1.5 ומודלים מיוחדים (2024)
ב-13 במאי 2024 יצאה סדרת Yi-1.5 (6B/9B/34B) — תוצר של המשך אימון מוקדם על 500 מיליארד token נוספים ו-fine-tuning על 3 מיליון דוגמאות הוראות. במאי–יוני 2024 הוצג מודל קנייני סגור Yi-Large עם גישת API, המוצג כ-SOTA. בספטמבר 2024 יצאה סדרת Yi-Coder המיוחדת (1.5B/9B) ליצירת קוד עם הקשר של 128 אלף token ותמיכה ב-52 שפות תכנות.[1][6][7]
Yi-Lightning (2024)
באוקטובר 2024 הוצג המודל הדגל Yi-Lightning המבוסס על ארכיטקטורת Mixture-of-Experts (MoE), המותאם למהירות וליעילות inference. Yi-Lightning תפס את המקום ה-6 בדירוג הכולל של LMSYS Chatbot Arena (Elo 1287), המקום ה-2 בסינית והמקומות 3–4 במתמטיקה ובתכנות. הדוח הטכני פורסם בדצמבר 2024 (arXiv:2412.01253).[8]
שינוי אסטרטגיה (2025)
במרץ 2025 הודיעה חברת 01.AI על הפסקת אימון מוקדם של מודלים לשוניים גדולים חדשים, והתמקדה ביישומים ארגוניים, מערכות רב-סוכניות ופלטפורמת WorldWise LLM Platform 2.5 המבוססת על מודלים צד שלישי (כולל DeepSeek).[4]
ציר זמן מסכם
| תאריך | אירוע |
|---|---|
| נובמבר 2023 | שחרור Yi-6B ו-Yi-34B (base, chat, גרסאות 200K) |
| ינואר 2024 | Yi-VL-6B ו-Yi-VL-34B מולטי-מודאליים |
| מרץ 2024 | Yi-9B (depth-upscaled); פרסום דוח טכני arXiv:2403.04652 |
| מאי 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (סגור, API) |
| ספטמבר 2024 | Yi-Coder-1.5B/9B (התמחות בקוד, הקשר 128K) |
| אוקטובר 2024 | Yi-Lightning (ארכיטקטורת MoE, מודל דגל) |
| דצמבר 2024 | פרסום דוח טכני Yi-Lightning (arXiv:2412.01253) |
| מרץ 2025 | הפסקת אימון מוקדם של LLM חדשים; מיקוד בפתרונות ארגוניים |
יסודות תיאורטיים וארכיטקטורה
ארכיטקטורה בסיסית
כל המודלים במשפחת Yi מבוססים על ארכיטקטורת transformer לפענוח בלבד (decoder-only Transformer), המתוארת במאמרו של Vaswani et al.[9] המודלים אומנו מאפס ואינם נגזרים של LLaMA, למרות דמיון במימוש.[1]
מנגנון ה-Multi-Head Self-Attention הבסיסי מתואר על ידי הנוסחה:
כאשר , , — מטריצות שאילתות (queries), מפתחות (keys) וערכים (values) בהתאמה, — מימד המפתחות.[9]
שינויים ארכיטקטוניים מרכזיים ב-Yi:[1]
- Grouped-Query Attention (GQA) — חלוקת ראשי query לקבוצות עם ראשי key/value משותפים, המפחיתה את צריכת הזיכרון תוך שמירה על האיכות.
- הפעלת SwiGLU — החלפת ReLU/GELU הסטנדרטית; מקטינה את גודל ההפעלות ל-8/3 מגודל השכבה הנסתרת (hidden size).
- Rotary Position Embedding (RoPE) עם תדר בסיס מותאם (adjusted base frequency, ABF), המאפשר הרחבת הקשר ללא שינויים ארכיטקטוניים.
- מילון (vocabulary): 64,000 token המבוסס על BPE (SentencePiece) עם פיצול מספרים לספרות ו-unicode-byte fallback לסמלים נדירים.
תצורות המודלים הבסיסיים
פרמטרי ארכיטקטורה מתוך הדוח הטכני arXiv:2403.04652:[1]
| פרמטר | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| מספר שכבות | 32 | 60 |
| אורך אימון מוקדם (Pretrain Seq. Len) | 4096 | 4096 |
| קצב למידה מקסימלי (Max LR) | 3×10⁻⁴ | 1.5×10⁻⁴ |
מקור: arXiv:2403.04652, טבלת פרמטרים.[1]
ארכיטקטורת Yi-Lightning (MoE)
Yi-Lightning (2024) משתמש בארכיטקטורת Mixture-of-Experts (MoE) משופרת עם המאפיינים הבאים:[8]
- Fine-grained expert segmentation — פילוח עדין-גרגיר של בלוקי FFN למומחים לשיפור ההתמחות.
- איזון עומסים רב-שלבי — שילוב של Switch-Transformer (ST), Expert Parallel (EP) ו-Partitioned EP (PEP) losses לחלוקה אחידה של token בין המומחים.
- תשומת לב היברידית — חלופה של 3 שכבות עם חלון הזזה (sliding window) ושכבה אחת עם תשומת לב מלאה (full attention), עם שימוש חוזר ב-KV-cache בין שכבות.
- הפחתת זיכרון KV-cache ב-82.8% בהשוואה לגישה הסטנדרטית בעיבוד רצפים ארוכים.
- חלון הקשר מורחב ל-64 אלף token.
מספר המומחים המדויק והמספר הכולל של פרמטרי Yi-Lightning אינם מוצהרים במקורות ציבוריים.[8]
גרסאות מולטי-מודאליות (Yi-VL)
במודלים המולטי-מודאליים Yi-VL המודל הלשוני מחובר לאנקודר חזותי CLIP ViT-H/14 דרך הטלת MLP. תמונה מומרת על ידי האנקודר החזותי לרצף של embedding , אשר מוזנים למודל הלשוני יחד עם token הטקסט. האימון מתבצע בשלושה שלבים עם הגדלת רזולוציה: 224×224 → 448×448 פיקסלים.[1]
pipeline האימון והיישור
אימון מוקדם (Pre-training)
מודלי הבסיס Yi-6B ו-Yi-34B אומנו מראש על גוף נתונים דו-לשוני בהיקף של 3.1 טריליון token. הנתונים עוברים pipeline מדורג של סינון וכפילות: מסנני היוריסטיקה, מדרגים מאומנים (perplexity, quality, coherence, safety), קיבוץ ו-MinHash deduplication. המקורות — Common Crawl, ספרים ומאמרים מדעיים.[1]
עבור Yi-1.5 בוצע המשך אימון מוקדם (continued pre-training) על 500 מיליארד token נוספים של גוף נתונים באיכות גבוהה.[7]
כוונון עדין מפוקח (Supervised Fine-Tuning, SFT)
גרסאות הצ'אט של הדור הראשון עברו fine-tuning על מערך קטן אך מדויק — פחות מ-10,000 דוגמאות רב-תורניות (multi-turn), שכל אחת מהן נבדקה ונערכה ידנית על ידי מהנדסי Machine Learning. עבור Yi-1.5 הוגדל היקף נתוני ה-SFT ל-3 מיליון דוגמאות.[1][7]
יישור באמצעות Reinforcement Learning
עבור Yi-Lightning מיושם תהליך יישור רב-שלבי: SFT ולאחריו RLHF/DPO. נתונים סינתטיים נוצרים באמצעות Monte Carlo Tree Search (MCTS). מסגרת הבטיחות RAISE מיישמת הגנה בארבעה רמות: סינון נתוני אימון מוקדם, safety fine-tuning, בקרת קלט של prompt ובקרת פלט של תשובות.[8]
הרחבת הקשר
הרחבת חלון ההקשר ל-200 אלף token מומשת דרך המשך אימון מוקדם קל על 5 מיליארד token (ספרים + שאלות-תשובות סינתטיות) תוך שימוש בטכניקת RoPE ABF. לאחר הכוונון מגיעה הדיוק במשימת Needle-in-a-Haystack (מציאת קטע יעד בטקסט ארוך) ל-99.8%.[1][2]
שינוי קנה מידה בעומק (Depth Upscaling)
Yi-9B התקבל על ידי שכפול שכבות 12–28 של מודל הבסיס Yi-6B ולאחר מכן אימון מוקדם על 800 מיליארד token. השיטה מאפשרת הגדלת קיבולת המודל ללא אימון מאפס.[1]
הרכב משפחת המודלים
מודלים לשוניים עיקריים
| מודל | פרמטרים | סוג | הקשר | תאריך שחרור | רישיון | הערה |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 מיליארד / 34 מיליארד | Base / Chat | 4K (מורחב ל-32K) | נובמבר 2023 | Apache 2.0 | מודלי בסיס מאומנים מאפס |
| Yi-6B-200K / Yi-34B-200K | 6 מיליארד / 34 מיליארד | Base | 200K | נובמבר 2023 | Apache 2.0 | המשך אימון מוקדם על רצפים ארוכים |
| Yi-9B | 9 מיליארד | Base | 4K (מורחב ל-200K) | מרץ 2024 | Apache 2.0 | Depth-upscale מתוך Yi-6B + 800 מיליארד token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 מיליארד | Base / Chat | 4K / 16K / 32K | מאי 2024 | Apache 2.0 | +500 מיליארד token + 3 מיליון דוגמאות SFT |
| Yi-Large | ~1 טריליון (MoE, פעילים לא מוצהרים) | LLM | לא מוצהר | מאי 2024 | סגור (API) | מוצג כ-SOTA |
| Yi-Lightning | MoE (מספר מומחים לא מוצהר) | LLM | 64K | אוקטובר 2024 | API | מקום 6 ב-LMSYS Chatbot Arena |
מקורות: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
מודלים מיוחדים
| מודל | פרמטרים | מודאליות | הקשר | תאריך שחרור | הערה |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 מיליארד | טקסט + תמונות (448×448) | סטנדרטי של המודל הבסיסי | ינואר 2024 | אנקודר ViT (CLIP ViT-H/14), אימון תלת-שלבי |
| Yi-Coder-1.5B / Yi-Coder-9B | 1.5 / 9 מיליארד | טקסט (קוד) | 128K | ספטמבר 2024 | 52 שפות תכנות |
מקורות: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
מזהי API
דוגמאות בפלטפורמת 01.AI וספקים צד שלישי: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
הערכה ו-benchmark
תוצאות מודלי הבסיס
נתונים מהדוח הטכני arXiv:2403.04652 (תנאים: 0-shot / 5-shot, בהתאם ל-benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63.2 | 76.3 | 62.6 | 69.7 | 66.7 | — |
| BBH | 42.8 | 54.3 | 44.1 | — | 53.4 | — |
| C-Eval | 72.0 | 81.4 | — | 50.1 | 72.1 | 70.1 |
| CMMLU | 75.5 | 83.7 | — | 53.3 | 71.0 | 52.5 |
| GSM8K | 32.5 | 67.2 | 42.2 | 56.8 | 61.3 | 57.1 |
| HumanEval | 15.9 | 23.2 | 22.6 | 31.7 | 32.3 | 48.1 |
מקור: arXiv:2403.04652, טבלאות תוצאות.[1]
Yi-34B הציג תוצאות העולות על Llama 2-70B (בגודל קטן פי שניים) ברוב ה-benchmark והוביל בין המודלים הפתוחים ב-C-Eval וב-CMMLU בעת השחרור.[1][12]
תוצאות Yi-Lightning
נתונים מהדוח הטכני arXiv:2412.01253 (תנאים: 0-shot, אלא אם צוין אחרת):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50.9 | 49.1 | 45.1 |
| MATH | 76.4 | 82.7 | 67.1 |
| HumanEval | 83.5 | 86.0 | 76.2 |
| WildBench | 65.1 | 59.9 | 49.0 |
| Arena-Hard | 91.8 | 90.5 | 74.0 |
מקור: arXiv:2412.01253.[8]
דירוגי משתמשים
Yi-34B-Chat תפס את המקום ה-2 ב-AlpacaEval (94.08%, אחרי GPT-4 Turbo) בדצמבר 2023 – ינואר 2024, עם דירוג Elo ~1110 ב-LMSYS Chatbot Arena. Yi-34B הוביל בין המודלים הפתוחים ב-Hugging Face Open LLM Leaderboard וב-C-Eval בעת השחרור.[2][1]
Yi-Lightning תפס את המקום הכולל ה-6 ב-LMSYS Chatbot Arena (ציון 1287), המקום ה-2 בסינית והמקומות 3–4 בקטגוריות המשנה "מתמטיקה", "תכנות", "hard prompts" ו-"multi-turn" בעת פרסום הדוח.[8]
הערה. השוואה ישירה בין מודלים משחרורים ותצורות שונות דורשת תנאי בדיקה אחידים (אותן גרסאות benchmark, אותם פרמטרי יצירה). הערכות סובייקטיביות בפלטפורמות crowdsourcing תלויות בהרכב המשתתפים ובמערך המודלים הנוכחי במערכת.[12]
שימושים
משפחת Yi משמשת במגוון רחב של משימות עיבוד שפה טבעית וניתוח מולטי-מודאלי:[3][13]
- עוזרי צ'אט ומערכות דיאלוג — על בסיס גרסאות הצ'אט Yi-34B-Chat ו-Yi-1.5.
- יצירה וניתוח קוד — Yi-Coder תומך ב-52 שפות תכנות.
- ניתוח מסמכים ארוכים — גרסאות עם הקשר 200K למשימות משפטיות, טכניות ואנליטיות.
- ניתוח מולטי-מודאלי — תיאור תמונות ושאלות-תשובות חזותיות דרך Yi-VL.
- סוכנים ארגוניים — מערכות RAG, חיפוש ידע וסיווג נתונים דרך פלטפורמת 01.AI.
- פריסה מקומית — דרך vLLM, llama.cpp, Hugging Face Transformers; גרסאות כמותיות (AWQ/GPTQ 4/8-bit) זמינות לפריסה על GPU צרכני (למשל RTX 4090 עבור Yi-34B-4bit).
גרסאות API (Yi-Large, Yi-Lightning) משמשות לצ'אט-בוטים, שירותים רב-לשוניים ו-inference בעלות נמוכה. עלות ה-inference של Yi-Lightning עמדה על 14 סנט למיליון token נכון לשנת 2024.[8]
מגבלות ובעיות פתוחות
- הזיות. המודלים נוטים לשגיאות עובדתיות האופייניות ל-LLM בתשובות המיוצרות, בעיקר בהיגיון מורכב ובשרשראות הסקה ארוכות.[1]
- מתמטיקה וקוד בגרסאות מוקדמות. מודלי הבסיס Yi-34B מציגים תוצאות חלשות יותר בתכנות מורכב ובמתמטיקה בהשוואה למודלי frontier מיוחדים (למשל MATH Yi-34B ב-4-shot — 14.4). בעיה זו נפתרה חלקית ב-Yi-1.5 וב-Yi-Lightning.[1][8]
- הקשר ארוך. הרחבה ל-200K דורשת המשך אימון מוקדם ומשאבי חישוב; ייתכן ירידה קלה בביצועים על הקשר קצר.[1]
- מודלים סגורים. Yi-Large ו-Yi-Lightning אינם מספקים משקולות להורדה, מה שמגביל אימות עצמאי של הארכיטקטורה והנתונים.[8]
- פער בין Arena ל-benchmark. Yi-Lightning מציג תוצאות חזקות בהערכות משתמשים (Chatbot Arena), אך מפגר אחרי מתחרים מסוימים ב-benchmark אקדמיים סטטיים — השתקפות של בעיית אי-התאמת מדדים הכללית.[8]
- יכולת שחזור. לא כל פרטי האימון (הרכב dataset המדויק, חלוקת תחומים, היפר-פרמטרים) מוצהרים במלואם.[13]
- רגישות ל-prompt. כמו LLM אחרים, מודלי Yi רגישים לניסוח ה-prompt, מה שמשפיע על יציבות ההסקות.[1]
לא תועדו רגרסיות חמורות ידועות לאחר שחרורים; הקהילה מציינת יציבות של הגרסאות הכמותיות.[2]
היבטים אתיים ורגולטוריים
ב-Yi-Lightning מוטמעת מסגרת הבטיחות RAISE, המיישמת הגנה בארבעה רמות:[8]
- סינון תוכן רעיל, PII וחומרים מזיקים בשלב האימון המוקדם.
- Safety fine-tuning עם דוגמאות לטיפול תקין בבקשות רגישות.
- בקרת קלט (סיווג prompt).
- בקרת פלט (סינון תשובות).
רישיון Apache 2.0 עבור המודלים הפתוחים מאפשר שימוש מסחרי; אחסונים ספציפיים עשויים לדרוש דרישות נוספות. המודלים עומדים בתקנות הרגולטוריות הסיניות בתחום ה-AI (הסמכת CAICT לפתרונות ארגוניים).[1][3]
פרספקטיבות וכיווני מחקר
סדרת Yi מדגימה את יעילות הגישה הנותנת עדיפות לאיכות נתונים על פני היקף פרמטרים, וכן לשינוי קנה מידה קל (continual pretraining, depth upscaling, אופטימיזציות MoE).[1]
לאחר 2025 הועבר הדגש של 01.AI לפתרונות יישומיים:[4]
- מערכות רב-סוכניות ופלטפורמה ארגונית WorldWise LLM Platform 2.5.
- שילוב מודלים צד שלישי (כולל DeepSeek) ב-workflow ארגוניים.
- אופטימיזציית inference (כימות, FP8) להפחתת עלות הפריסה.
מודלים פתוחים ממשיכים לשמש את הקהילה למחקר, fine-tuning ודיסטילציה.[6]
ספרות
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
קישורים
- https://github.com/01-ai/Yi — מאגר GitHub רשמי של Yi
- https://github.com/01-ai/Yi-1.5 — מאגר Yi-1.5
- https://www.01.ai/yi-models — דף המודלים הרשמי של Yi
- https://huggingface.co/01-ai — ארגון 01-ai ב-Hugging Face
- https://en.wikipedia.org/wiki/01.AI — ערך Wikipedia על חברת 01.AI
הערות
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms