Jamba (language model) (HE)
Jamba — היא משפחה של מודלי שפה גדולים (LLM), שפותחה על ידי חברת המחקר הישראלית AI21 Labs. Jamba מייצגת ארכיטקטורה היברידית ראשונה מסוגה, המשלבת אלמנטים מרכזיים משני הגישות הדומיננטיות בפיתוח AI: transformers ומודלי מרחב מצב (State Space Models, SSM), ובפרט ארכיטקטורת Mamba[1].
המטרה העיקרית של Jamba היא לפתור את הפשרה הבסיסית של LLM מודרניים: איכות וביצועים גבוהים (האופייניים ל-transformers) מול יעילות ויכולת לעבד הקשרים ארוכים במיוחד (האופייניים ל-SSM). על ידי שילוב גישות אלו והוספת דילול (sparsity) באמצעות Mixture-of-Experts (MoE), Jamba מציעה מודל שהוא בו-זמנית עוצמתי, יעיל ומסוגל לעבוד עם כמויות טקסט עצומות בשאילתה אחת.
ארכיטקטורת Jamba בפירוט
Jamba אינה רק מחלידה שכבות transformer ו-Mamba. היא משתמשת במבנה בלוקים מתוכנן בקפידה, שבו כל בלוק מורכב משמונה שכבות.
מבנה בלוק יחיד של Jamba:
- שכבת Transformer אחת: שכבה זו אחראית על הבנה "עמוקה" ועל הסקת מסקנות מורכבות. בשכבה זו מוטמעת ארכיטקטורת Mixture-of-Experts (MoE).
- שבע שכבות Mamba: שכבות אלו עוקבות אחרי שכבת ה-transformer ואחראיות על עיבוד יעיל של הרצף ו"גרירת" מידע דרך הקשר ארוך[2].
מבנה א-סימטרי זה מאפשר למודל לנהל בצורה יעילה משאבי מחשוב: פעולות ה-transformer הכבדות אך העוצמתיות מבוצעות בתדירות נמוכה יותר, בעוד שפעולות ה-Mamba הקלות והמהירות מבוצעות בתדירות גבוהה יותר.
שילוב Mixture-of-Experts (MoE)
ב-Jamba נעשה שימוש בארכיטקטורת MoE לשיפור נוסף של היעילות.
- MoE מיושם רק על בלוקי Feed-Forward Network (FFN) בתוך שכבות ה-transformer[3]. שכבות ה-Mamba נשארות צפופות (dense).
- במודל Jamba הראשון היו 16 מומחים.
- עבור כל token, רשת הניתוב בוחרת את 2 המומחים הטובים ביותר (Top-2 gating).
משמעות הדבר היא שלמרות שמספר הפרמטרים הכולל של המודל גדול (52 מיליארד), בכל שלב של עיבוד token בשכבת ה-transformer פעילים רק 2 מתוך 16 המומחים, מה שהופך את החישובים למהירים מאוד.
אבולוציית מודלי Jamba
Jamba-v0.1 (מרץ 2024)
המודל הראשון שהוצג במסגרת משפחה זו, בעל המאפיינים הבאים:
| מאפיין | ערך |
|---|---|
| מספר פרמטרים כולל | 52 מיליארד |
| פרמטרים פעילים | ~12 מיליארד |
| מספר מומחים (MoE) | 16 (2 פעילים) |
| חלון הקשר | 256,000 tokens |
| רישיון | Apache 2.0[4] |
בזכות ארכיטקטורתה ההיברידית, Jamba-1 מסוגלת לעבד הקשר באורך 256,000 tokens, השווה לכ-400 עמודי רומן, וניתן לפרוס אותה על GPU צרכנית בודדת עם 80 GB זיכרון[5].
Jamba-1.5 (2024)
בשנת 2024 הציגה AI21 Labs את משפחת מודלי Jamba 1.5 המעודכנת, הכוללת שתי גרסאות: Jamba 1.5 Mini (12B פרמטרים פעילים מתוך 52B כולל) ו-Jamba 1.5 Large (94B פרמטרים פעילים מתוך 398B כולל)[6]. מודלים אלו מפגינים שיפורים משמעותיים בביצועים:
- עד פי 2.5 מהירות inference גבוהה יותר בהקשרים ארוכים בהשוואה למתחרים.
- תמיכה בתשע שפות, כולל אנגלית, ספרדית, צרפתית וערבית[7].
יתרונות מרכזיים וביצועים
- חלון הקשר עצום: 256,000 tokens — אחד מחלונות ההקשר הגדולים ביותר בקרב כל המודלים הזמינים (כולל קנייניים) בעת שחרורה. זה הופך את Jamba לאידיאלית למשימות הדורשות ניתוח מסמכים גדולים: חוזים משפטיים, עבודות מחקר, בסיסי קוד שלמים או דיאלוגים ארוכים.
- ביצועים ויעילות גבוהים: בבדיקות, Jamba מפגינה ביצועים דומים או עולים על המודלים הפתוחים המובילים בגודל דומה, כגון Llama ו-Mixtral, תוך הצגת תפוקה גבוהה פי 3 בהקשרים ארוכים[8].
- פתיחות ונגישות: Jamba מופצת תחת רישיון Apache 2.0 המתירני, המאפשר שימוש חופשי בה למטרות מסחריות ומחקריות. משקלות המודל זמינות בפלטפורמת Hugging Face.
תוצאות על benchmarks
Jamba 1.5 מציגה תוצאות תחרותיות על benchmarks שונים[9]:
- Jamba 1.5 Mini קיבלה ציון 46.1 ב-Arena Hard, מה שהופך אותה למודל הציבורי המוביל בקטגוריה שלה[10].
- Jamba 1.5 Large קיבלה ציון 65.4 ב-Arena Hard, ועולה על Llama 3.1 70B ו-405B.
שימושים ונגישות
Jamba מותאמת ליישומים עסקיים ותומכת ביכולות כגון קריאת פונקציות (function calling), פלט מובנה ב-JSON ועיבוד מסמכים. המודל זמין על פלטפורמות רבות, כולל:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
לתמיכה ב-inference חסכוני, AI21 Labs הציגה את ExpertsInt8 — טכניקת quantization חדשה המאפשרת לפרוס את Jamba 1.5 Large על מחשב עם 8 GPU של 80GB ללא אובדן איכות בעת עיבוד הקשר של 256K tokens[11].
ספרות
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
הערות
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]