Yi (01.AI) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — משפחה של מודלים לשוניים גדולים (Large Language Model, LLM) ומודלים חזותיים-לשוניים (Vision-Language Model, VLM), שפותחה על ידי חברת 01.AI (零一万物) בהנהגת קאי-פו לי (Kai-Fu Lee). המודלים אומנו מאפס על גוף נתונים דו-לשוני באיכות גבוהה (אנגלית וסינית) בהיקף של 3.1 טריליון token, וכוללים גרסאות לייצור טקסט, עיבוד הקשר ארוך (עד 200 אלף token), קלט מולטי-מודאלי (טקסט + תמונות), יצירת קוד וייצור (inference) יעיל המבוסס על ארכיטקטורת Mixture-of-Experts (MoE). הגרסאות הפתוחות מופצות תחת רישיון Apache 2.0 המאפשר שימוש מסחרי; מודלים קנייניים סגורים (Yi-Large, Yi-Lightning) זמינים דרך API.[1][2][3]

היסטוריה וציר הזמן של הפיתוח

חברת 01.AI נוסדה במרץ 2023 על ידי קאי-פו לי, לשעבר ראש Microsoft Research Asia ו-Google China, ומשרדיה הראשיים נמצאים בבייג'ינג. מיקוד החברה הוא פיתוח LLM יעילים תוך דגש על איכות נתונים ואופטימיזציה הנדסית של תשתית. עד נובמבר 2023 השיגה 01.AI מעמד של "חד-קרן" (שווי העולה על מיליארד דולר) לאחר סבב מימון בהשתתפות Alibaba.[4][5]

הדור הראשון (2023–2024)

מודלי Yi-6B ו-Yi-34B הפתוחים הראשונים הוצגו ב-2 בנובמבר 2023. במהלך השבועות שלאחר מכן הורחבה הסדרה בגרסאות עם הקשר של 200 אלף token (5 בנובמבר 2023), גרסאות צ'אט ומודלים כמותיים (23 בנובמבר 2023). בינואר 2024 יצאו Yi-VL-6B ו-Yi-VL-34B המולטי-מודאליים. במרץ 2024 הוצג מודל Yi-9B שהתקבל בשיטת depth upscaling מתוך Yi-6B, ופורסם דוח טכני arXiv:2403.04652.[1][2]

Yi-1.5 ומודלים מיוחדים (2024)

ב-13 במאי 2024 יצאה סדרת Yi-1.5 (6B/9B/34B) — תוצר של המשך אימון מוקדם על 500 מיליארד token נוספים ו-fine-tuning על 3 מיליון דוגמאות הוראות. במאי–יוני 2024 הוצג מודל קנייני סגור Yi-Large עם גישת API, המוצג כ-SOTA. בספטמבר 2024 יצאה סדרת Yi-Coder המיוחדת (1.5B/9B) ליצירת קוד עם הקשר של 128 אלף token ותמיכה ב-52 שפות תכנות.[1][6][7]

Yi-Lightning (2024)

באוקטובר 2024 הוצג המודל הדגל Yi-Lightning המבוסס על ארכיטקטורת Mixture-of-Experts (MoE), המותאם למהירות וליעילות inference. Yi-Lightning תפס את המקום ה-6 בדירוג הכולל של LMSYS Chatbot Arena (Elo 1287), המקום ה-2 בסינית והמקומות 3–4 במתמטיקה ובתכנות. הדוח הטכני פורסם בדצמבר 2024 (arXiv:2412.01253).[8]

שינוי אסטרטגיה (2025)

במרץ 2025 הודיעה חברת 01.AI על הפסקת אימון מוקדם של מודלים לשוניים גדולים חדשים, והתמקדה ביישומים ארגוניים, מערכות רב-סוכניות ופלטפורמת WorldWise LLM Platform 2.5 המבוססת על מודלים צד שלישי (כולל DeepSeek).[4]

ציר זמן מסכם

תאריך אירוע
נובמבר 2023 שחרור Yi-6B ו-Yi-34B (base, chat, גרסאות 200K)
ינואר 2024 Yi-VL-6B ו-Yi-VL-34B מולטי-מודאליים
מרץ 2024 Yi-9B (depth-upscaled); פרסום דוח טכני arXiv:2403.04652
מאי 2024 Yi-1.5 (6B/9B/34B); Yi-Large (סגור, API)
ספטמבר 2024 Yi-Coder-1.5B/9B (התמחות בקוד, הקשר 128K)
אוקטובר 2024 Yi-Lightning (ארכיטקטורת MoE, מודל דגל)
דצמבר 2024 פרסום דוח טכני Yi-Lightning (arXiv:2412.01253)
מרץ 2025 הפסקת אימון מוקדם של LLM חדשים; מיקוד בפתרונות ארגוניים

יסודות תיאורטיים וארכיטקטורה

ארכיטקטורה בסיסית

כל המודלים במשפחת Yi מבוססים על ארכיטקטורת transformer לפענוח בלבד (decoder-only Transformer), המתוארת במאמרו של Vaswani et al.[9] המודלים אומנו מאפס ואינם נגזרים של LLaMA, למרות דמיון במימוש.[1]

מנגנון ה-Multi-Head Self-Attention הבסיסי מתואר על ידי הנוסחה:

Attention(Q,K,V)=softmax(QKdk)V

כאשר Q, K, V — מטריצות שאילתות (queries), מפתחות (keys) וערכים (values) בהתאמה, dk — מימד המפתחות.[9]

שינויים ארכיטקטוניים מרכזיים ב-Yi:[1]

  • Grouped-Query Attention (GQA) — חלוקת ראשי query לקבוצות עם ראשי key/value משותפים, המפחיתה את צריכת הזיכרון תוך שמירה על האיכות.
  • הפעלת SwiGLU — החלפת ReLU/GELU הסטנדרטית; מקטינה את גודל ההפעלות ל-8/3 מגודל השכבה הנסתרת (hidden size).
  • Rotary Position Embedding (RoPE) עם תדר בסיס מותאם (adjusted base frequency, ABF), המאפשר הרחבת הקשר ללא שינויים ארכיטקטוניים.
  • מילון (vocabulary): 64,000 token המבוסס על BPE (SentencePiece) עם פיצול מספרים לספרות ו-unicode-byte fallback לסמלים נדירים.

תצורות המודלים הבסיסיים

פרמטרי ארכיטקטורה מתוך הדוח הטכני arXiv:2403.04652:[1]

פרמטר Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
מספר שכבות 32 60
אורך אימון מוקדם (Pretrain Seq. Len) 4096 4096
קצב למידה מקסימלי (Max LR) 3×10⁻⁴ 1.5×10⁻⁴

מקור: arXiv:2403.04652, טבלת פרמטרים.[1]

ארכיטקטורת Yi-Lightning (MoE)

Yi-Lightning (2024) משתמש בארכיטקטורת Mixture-of-Experts (MoE) משופרת עם המאפיינים הבאים:[8]

  • Fine-grained expert segmentation — פילוח עדין-גרגיר של בלוקי FFN למומחים לשיפור ההתמחות.
  • איזון עומסים רב-שלבי — שילוב של Switch-Transformer (ST), Expert Parallel (EP) ו-Partitioned EP (PEP) losses לחלוקה אחידה של token בין המומחים.
  • תשומת לב היברידית — חלופה של 3 שכבות עם חלון הזזה (sliding window) ושכבה אחת עם תשומת לב מלאה (full attention), עם שימוש חוזר ב-KV-cache בין שכבות.
  • הפחתת זיכרון KV-cache ב-82.8% בהשוואה לגישה הסטנדרטית בעיבוד רצפים ארוכים.
  • חלון הקשר מורחב ל-64 אלף token.

מספר המומחים המדויק והמספר הכולל של פרמטרי Yi-Lightning אינם מוצהרים במקורות ציבוריים.[8]

גרסאות מולטי-מודאליות (Yi-VL)

במודלים המולטי-מודאליים Yi-VL המודל הלשוני מחובר לאנקודר חזותי CLIP ViT-H/14 דרך הטלת MLP. תמונה I מומרת על ידי האנקודר החזותי לרצף של embedding {v1,,vK}, אשר מוזנים למודל הלשוני יחד עם token הטקסט. האימון מתבצע בשלושה שלבים עם הגדלת רזולוציה: 224×224 → 448×448 פיקסלים.[1]

pipeline האימון והיישור

אימון מוקדם (Pre-training)

מודלי הבסיס Yi-6B ו-Yi-34B אומנו מראש על גוף נתונים דו-לשוני בהיקף של 3.1 טריליון token. הנתונים עוברים pipeline מדורג של סינון וכפילות: מסנני היוריסטיקה, מדרגים מאומנים (perplexity, quality, coherence, safety), קיבוץ ו-MinHash deduplication. המקורות — Common Crawl, ספרים ומאמרים מדעיים.[1]

עבור Yi-1.5 בוצע המשך אימון מוקדם (continued pre-training) על 500 מיליארד token נוספים של גוף נתונים באיכות גבוהה.[7]

כוונון עדין מפוקח (Supervised Fine-Tuning, SFT)

גרסאות הצ'אט של הדור הראשון עברו fine-tuning על מערך קטן אך מדויק — פחות מ-10,000 דוגמאות רב-תורניות (multi-turn), שכל אחת מהן נבדקה ונערכה ידנית על ידי מהנדסי Machine Learning. עבור Yi-1.5 הוגדל היקף נתוני ה-SFT ל-3 מיליון דוגמאות.[1][7]

יישור באמצעות Reinforcement Learning

עבור Yi-Lightning מיושם תהליך יישור רב-שלבי: SFT ולאחריו RLHF/DPO. נתונים סינתטיים נוצרים באמצעות Monte Carlo Tree Search (MCTS). מסגרת הבטיחות RAISE מיישמת הגנה בארבעה רמות: סינון נתוני אימון מוקדם, safety fine-tuning, בקרת קלט של prompt ובקרת פלט של תשובות.[8]

הרחבת הקשר

הרחבת חלון ההקשר ל-200 אלף token מומשת דרך המשך אימון מוקדם קל על 5 מיליארד token (ספרים + שאלות-תשובות סינתטיות) תוך שימוש בטכניקת RoPE ABF. לאחר הכוונון מגיעה הדיוק במשימת Needle-in-a-Haystack (מציאת קטע יעד בטקסט ארוך) ל-99.8%.[1][2]

שינוי קנה מידה בעומק (Depth Upscaling)

Yi-9B התקבל על ידי שכפול שכבות 12–28 של מודל הבסיס Yi-6B ולאחר מכן אימון מוקדם על 800 מיליארד token. השיטה מאפשרת הגדלת קיבולת המודל ללא אימון מאפס.[1]

הרכב משפחת המודלים

מודלים לשוניים עיקריים

מודל פרמטרים סוג הקשר תאריך שחרור רישיון הערה
Yi-6B / Yi-34B 6 מיליארד / 34 מיליארד Base / Chat 4K (מורחב ל-32K) נובמבר 2023 Apache 2.0 מודלי בסיס מאומנים מאפס
Yi-6B-200K / Yi-34B-200K 6 מיליארד / 34 מיליארד Base 200K נובמבר 2023 Apache 2.0 המשך אימון מוקדם על רצפים ארוכים
Yi-9B 9 מיליארד Base 4K (מורחב ל-200K) מרץ 2024 Apache 2.0 Depth-upscale מתוך Yi-6B + 800 מיליארד token
Yi-1.5-6B/9B/34B 6 / 9 / 34 מיליארד Base / Chat 4K / 16K / 32K מאי 2024 Apache 2.0 +500 מיליארד token + 3 מיליון דוגמאות SFT
Yi-Large ~1 טריליון (MoE, פעילים לא מוצהרים) LLM לא מוצהר מאי 2024 סגור (API) מוצג כ-SOTA
Yi-Lightning MoE (מספר מומחים לא מוצהר) LLM 64K אוקטובר 2024 API מקום 6 ב-LMSYS Chatbot Arena

מקורות: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

מודלים מיוחדים

מודל פרמטרים מודאליות הקשר תאריך שחרור הערה
Yi-VL-6B / Yi-VL-34B 6 / 34 מיליארד טקסט + תמונות (448×448) סטנדרטי של המודל הבסיסי ינואר 2024 אנקודר ViT (CLIP ViT-H/14), אימון תלת-שלבי
Yi-Coder-1.5B / Yi-Coder-9B 1.5 / 9 מיליארד טקסט (קוד) 128K ספטמבר 2024 52 שפות תכנות

מקורות: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

מזהי API

דוגמאות בפלטפורמת 01.AI וספקים צד שלישי: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

הערכה ו-benchmark

תוצאות מודלי הבסיס

נתונים מהדוח הטכני arXiv:2403.04652 (תנאים: 0-shot / 5-shot, בהתאם ל-benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63.2 76.3 62.6 69.7 66.7
BBH 42.8 54.3 44.1 53.4
C-Eval 72.0 81.4 50.1 72.1 70.1
CMMLU 75.5 83.7 53.3 71.0 52.5
GSM8K 32.5 67.2 42.2 56.8 61.3 57.1
HumanEval 15.9 23.2 22.6 31.7 32.3 48.1

מקור: arXiv:2403.04652, טבלאות תוצאות.[1]

Yi-34B הציג תוצאות העולות על Llama 2-70B (בגודל קטן פי שניים) ברוב ה-benchmark והוביל בין המודלים הפתוחים ב-C-Eval וב-CMMLU בעת השחרור.[1][12]

תוצאות Yi-Lightning

נתונים מהדוח הטכני arXiv:2412.01253 (תנאים: 0-shot, אלא אם צוין אחרת):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50.9 49.1 45.1
MATH 76.4 82.7 67.1
HumanEval 83.5 86.0 76.2
WildBench 65.1 59.9 49.0
Arena-Hard 91.8 90.5 74.0

מקור: arXiv:2412.01253.[8]

דירוגי משתמשים

Yi-34B-Chat תפס את המקום ה-2 ב-AlpacaEval (94.08%, אחרי GPT-4 Turbo) בדצמבר 2023 – ינואר 2024, עם דירוג Elo ~1110 ב-LMSYS Chatbot Arena. Yi-34B הוביל בין המודלים הפתוחים ב-Hugging Face Open LLM Leaderboard וב-C-Eval בעת השחרור.[2][1]

Yi-Lightning תפס את המקום הכולל ה-6 ב-LMSYS Chatbot Arena (ציון 1287), המקום ה-2 בסינית והמקומות 3–4 בקטגוריות המשנה "מתמטיקה", "תכנות", "hard prompts" ו-"multi-turn" בעת פרסום הדוח.[8]

הערה. השוואה ישירה בין מודלים משחרורים ותצורות שונות דורשת תנאי בדיקה אחידים (אותן גרסאות benchmark, אותם פרמטרי יצירה). הערכות סובייקטיביות בפלטפורמות crowdsourcing תלויות בהרכב המשתתפים ובמערך המודלים הנוכחי במערכת.[12]

שימושים

משפחת Yi משמשת במגוון רחב של משימות עיבוד שפה טבעית וניתוח מולטי-מודאלי:[3][13]

  • עוזרי צ'אט ומערכות דיאלוג — על בסיס גרסאות הצ'אט Yi-34B-Chat ו-Yi-1.5.
  • יצירה וניתוח קוד — Yi-Coder תומך ב-52 שפות תכנות.
  • ניתוח מסמכים ארוכים — גרסאות עם הקשר 200K למשימות משפטיות, טכניות ואנליטיות.
  • ניתוח מולטי-מודאלי — תיאור תמונות ושאלות-תשובות חזותיות דרך Yi-VL.
  • סוכנים ארגוניים — מערכות RAG, חיפוש ידע וסיווג נתונים דרך פלטפורמת 01.AI.
  • פריסה מקומית — דרך vLLM, llama.cpp, Hugging Face Transformers; גרסאות כמותיות (AWQ/GPTQ 4/8-bit) זמינות לפריסה על GPU צרכני (למשל RTX 4090 עבור Yi-34B-4bit).

גרסאות API (Yi-Large, Yi-Lightning) משמשות לצ'אט-בוטים, שירותים רב-לשוניים ו-inference בעלות נמוכה. עלות ה-inference של Yi-Lightning עמדה על 14 סנט למיליון token נכון לשנת 2024.[8]

מגבלות ובעיות פתוחות

  • הזיות. המודלים נוטים לשגיאות עובדתיות האופייניות ל-LLM בתשובות המיוצרות, בעיקר בהיגיון מורכב ובשרשראות הסקה ארוכות.[1]
  • מתמטיקה וקוד בגרסאות מוקדמות. מודלי הבסיס Yi-34B מציגים תוצאות חלשות יותר בתכנות מורכב ובמתמטיקה בהשוואה למודלי frontier מיוחדים (למשל MATH Yi-34B ב-4-shot — 14.4). בעיה זו נפתרה חלקית ב-Yi-1.5 וב-Yi-Lightning.[1][8]
  • הקשר ארוך. הרחבה ל-200K דורשת המשך אימון מוקדם ומשאבי חישוב; ייתכן ירידה קלה בביצועים על הקשר קצר.[1]
  • מודלים סגורים. Yi-Large ו-Yi-Lightning אינם מספקים משקולות להורדה, מה שמגביל אימות עצמאי של הארכיטקטורה והנתונים.[8]
  • פער בין Arena ל-benchmark. Yi-Lightning מציג תוצאות חזקות בהערכות משתמשים (Chatbot Arena), אך מפגר אחרי מתחרים מסוימים ב-benchmark אקדמיים סטטיים — השתקפות של בעיית אי-התאמת מדדים הכללית.[8]
  • יכולת שחזור. לא כל פרטי האימון (הרכב dataset המדויק, חלוקת תחומים, היפר-פרמטרים) מוצהרים במלואם.[13]
  • רגישות ל-prompt. כמו LLM אחרים, מודלי Yi רגישים לניסוח ה-prompt, מה שמשפיע על יציבות ההסקות.[1]

לא תועדו רגרסיות חמורות ידועות לאחר שחרורים; הקהילה מציינת יציבות של הגרסאות הכמותיות.[2]

היבטים אתיים ורגולטוריים

ב-Yi-Lightning מוטמעת מסגרת הבטיחות RAISE, המיישמת הגנה בארבעה רמות:[8]

  • סינון תוכן רעיל, PII וחומרים מזיקים בשלב האימון המוקדם.
  • Safety fine-tuning עם דוגמאות לטיפול תקין בבקשות רגישות.
  • בקרת קלט (סיווג prompt).
  • בקרת פלט (סינון תשובות).

רישיון Apache 2.0 עבור המודלים הפתוחים מאפשר שימוש מסחרי; אחסונים ספציפיים עשויים לדרוש דרישות נוספות. המודלים עומדים בתקנות הרגולטוריות הסיניות בתחום ה-AI (הסמכת CAICT לפתרונות ארגוניים).[1][3]

פרספקטיבות וכיווני מחקר

סדרת Yi מדגימה את יעילות הגישה הנותנת עדיפות לאיכות נתונים על פני היקף פרמטרים, וכן לשינוי קנה מידה קל (continual pretraining, depth upscaling, אופטימיזציות MoE).[1]

לאחר 2025 הועבר הדגש של 01.AI לפתרונות יישומיים:[4]

  • מערכות רב-סוכניות ופלטפורמה ארגונית WorldWise LLM Platform 2.5.
  • שילוב מודלים צד שלישי (כולל DeepSeek) ב-workflow ארגוניים.
  • אופטימיזציית inference (כימות, FP8) להפחתת עלות הפריסה.

מודלים פתוחים ממשיכים לשמש את הקהילה למחקר, fine-tuning ודיסטילציה.[6]

ספרות

קישורים

הערות

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms