DBRX (language model) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — מודל שפה גדול (LLM) בקוד פתוח, שפותח על ידי צוות המחקר Mosaic AI בתוך חברת Databricks. המודל שוחרר רשמית ב-27 במרץ 2024 ומוצב כפתרון בעל ביצועים גבוהים לשימוש ארגוני[1].

DBRX בנוי על ארכיטקטורת תערובת מומחים (MoE) גרגירית דקה, ומשלב ביצועים גבוהים עם יעילות בלמידה ובהסקה. במועד השחרור הפגין DBRX את התוצאות הטובות ביותר מבין כל המודלים הפתוחים על benchmark-ים מרכזיים, עלה על מודלים כגון LLaMA 2, Mixtral ו-Grok-1, והציג תחרותיות עם מודלים סגורים ברמת GPT-3.5 Turbo[2].

היסטוריית הפיתוח

הופעת DBRX הייתה המשך לאסטרטגיית Databricks לפיתוח מודלים גנרטיביים פתוחים. ביוני 2023 רכשה Databricks את הסטארטאפ MosaicML, שהתמחה בלמידת מודלים גדולים, ועל בסיסו הוקמה חטיבת Mosaic AI[3].

צוות Mosaic AI, בראשות האדריכל הראשי של רשתות נוירונים ג'ונתן פרנקל, החל בפיתוח LLM גדול חדש במטרה להגיע לאיכות הדומה למערכות הקנייניות הטובות ביותר, אך בפורמט פתוח. הפרויקט קיבל את השם DBRX. הפיתוח והלמידה המקדימה של המודל ארכו כשני וחצי חודשים ועלו, על פי הערכות, כ-10 מיליון דולר[3].

ארכיטקטורה

DBRX הוא מודל transformer מסוג decoder-only ומממש ארכיטקטורת תערובת מומחים (MoE) גרגירית דקה (fine-grained).

מאפייני הארכיטקטורה העיקריים:

  • מספר הפרמטרים הכולל: 132 מיליארד.
  • מומחים: המודל מורכב מ-16 תת-מודלים קטנים ומתמחים ("מומחים").
  • מנגנון ההפעלה: עבור כל token נכנס, מופעלים רק 4 מתוך 16 המומחים. משמעות הדבר היא שבעת ההסקה פעילים רק 36 מיליארד פרמטרים, מה שמבטיח מהירות ויעילות גבוהות. תכנית זו מעניקה פי 65 יותר צירופים אפשריים של מומחים בהשוואה למודל Mixtral (8 מומחים עם הפעלה של 2)[1].
  • רכיבים: נעשה שימוש בפתרונות ארכיטקטוניים מודרניים כגון embeddings מיקומיים סיבוביים (RoPE), gated linear units (GLU) ו-grouped query attention (GQA).
  • אורך ההקשר: 32,768 token-ים.

ארכיטקטורה זו מאפשרת למודל לשלב את יתרונות מספר הפרמטרים העצום (לאחסון ידע) עם יעילות המודלים הקטנים יותר (למהירות הסקה).

למידה

הלמידה המקדימה של DBRX בוצעה על dataset מוכן בקפידה בנפח של 12 טריליון token-ים, המורכב מטקסטים וקוד. איכות הנתונים הייתה עדיפות מרכזית: המפתחים השתמשו בפלטפורמת הענן של Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) לניקוי, הכנה וביקורת הנתונים[1].

במהלך הלמידה יושמה שיטת למידת תכנית לימודים (curriculum learning), שבה השתנה בשלבים שונים היחס בין סוגי הנתונים. לדוגמה, החלק הסופי של האימון הוקדש להכנסה מדודה של משימות מורכבות, שהניבה, לדברי המפתחים, שיפור משמעותי באיכות. הלמידה בוצעה על אשכול של 3,072 כרטיסי Nvidia H100 GPU.

לאחר הלמידה המקדימה עבר המודל הבסיסי כוונון עדין נוסף (instruction tuning) ליצירת גרסת האינטראקציה DBRX Instruct, המותאמת לביצוע הוראות המשתמש.

ביצועים

במועד השחרור קבע DBRX סטנדרט חדש לאיכות LLM פתוח על מגוון רחב של benchmark-ים.

השוואה עם מודלים פתוחים

תוצאות DBRX Instruct על benchmark-ים מרכזיים[1]
Benchmark משימה DBRX Instruct הבא הטוב ביותר (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) ידע כללי 74.5% 72.7% (Mixtral Instruct)
HumanEval תכנות 70.1% 63.2% (Grok-1)
GSM8K הנמקה מתמטית 66.9% 62.9% (Grok-1)
MMLU ידע כללי 73.7% 71.5% (Mixtral Instruct)

DBRX תפס את המקום הראשון הן בדירוג הכללי של Hugging Face Open LLM Leaderboard והן במבחן המקיף Databricks LLM Gauntlet, והפגין פער משמעותי מקודמיו[1].

השוואה עם מודלים סגורים

DBRX Instruct עולה על GPT-3.5 Turbo במספר מדדים מרכזיים, כולל MMLU (73.7% לעומת 70.0%) ו-HumanEval (70.1% לעומת 48.1%). מבחינת איכות התשובות בחלק מה-benchmark-ים (לדוגמה MTBench), המודל מתקרב לרמת Gemini 1.0 Pro ולגרסאות המוקדמות של GPT-4[1].

יעילות למידה והסקה

  • יעילות למידה: השימוש בארכיטקטורת MoE אפשר לצמצם את עלויות ה-FLOPS פי 2–4 בהשוואה למודלים צפופים בעלי איכות דומה.
  • יעילות הסקה: בזכות הפעלת 36 מיליארד פרמטרים בלבד, DBRX מספק תפוקה (מהירות הסקה) גבוהה פי 2–3 בהשוואה למודלים צפופים בגודל שווה ערך (לדוגמה, LLaMA2-70B)[1].

רישוי וזמינות

DBRX מופץ תחת הרישיון שפותח במיוחד Databricks Open Model License. הוא מתיר שימוש חופשי ושינוי, לרבות שימוש מסחרי, אך מכיל מספר הגבלות. בפרט, בדומה לרישיון LLaMA 2, הוא מחייב קבלת אישור נפרד מ-Databricks אם שירותים המבוססים על DBRX ישמשו קהל של יותר מ-700 מיליון משתמשים פעילים בחודש.

משקלות המודל המאומן מראש (הגרסה הבסיסית וגרסת Instruct) זמינים להורדה דרך המאגר ב-Hugging Face[4].

ספרות

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

הערות

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
  4. «databricks/dbrx-base». Hugging Face. [4]