Jamba (language model) (UR)
Jamba — یہ بڑے لسانی ماڈلز (LLM) کا ایک خاندان ہے جسے اسرائیلی تحقیقی کمپنی AI21 Labs نے تیار کیا ہے۔ Jamba اپنی نوعیت کی پہلی ہائبرڈ آرکیٹیکچر پیش کرتا ہے، جو مصنوعی ذہانت کی ترقی میں دو غالب طریقوں کے بنیادی عناصر کو یکجا کرتی ہے: transformers اور State Space Models (SSM)، خاص طور پر Mamba آرکیٹیکچر[1]۔
Jamba کا بنیادی مقصد جدید LLM کے ایک بنیادی تضاد کو حل کرنا ہے: اعلیٰ معیار اور کارکردگی (جو transformers کی خصوصیت ہے) بمقابلہ کفایت اور انتہائی طویل سیاق و سباق کو پروسیس کرنے کی صلاحیت (جو SSM کی خصوصیت ہے)۔ ان طریقوں کو یکجا کرکے اور Mixture-of-Experts (MoE) کے ذریعے ان میں تخفیف (sparsity) شامل کرکے، Jamba ایک ایسا ماڈل پیش کرتا ہے جو بیک وقت طاقتور، کفایتی اور ایک ہی درخواست میں متن کی بہت بڑی مقدار پر کام کرنے کے قابل ہے۔
Jamba کی آرکیٹیکچر تفصیل میں
Jamba محض transformer اور Mamba کی تہوں کو یکے بعد دیگرے نہیں رکھتا۔ یہ ایک باریک بینی سے ڈیزائن کی گئی بلاک ساختار استعمال کرتا ہے، جہاں ہر بلاک آٹھ تہوں پر مشتمل ہوتا ہے۔
Jamba کے ایک بلاک کی ساختار:
- ایک Transformer تہہ: یہ تہہ "گہری" سمجھ بوجھ اور پیچیدہ استدلال کی ذمہ دار ہے۔ اس تہہ میں Mixture-of-Experts (MoE) آرکیٹیکچر شامل ہے۔
- سات Mamba تہیں: یہ تہیں transformer تہہ کے بعد آتی ہیں اور ترتیب کی مؤثر پروسیسنگ اور طویل سیاق و سباق میں معلومات کو "آگے لے جانے" کی ذمہ دار ہیں[2]۔
یہ غیرمتناسب ساختار ماڈل کو کمپیوٹیشنل وسائل کا مؤثر انتظام کرنے دیتی ہے: transformer کے بھاری لیکن طاقتور آپریشن کم بار انجام دیے جاتے ہیں، جبکہ Mamba کے ہلکے اور تیز آپریشن زیادہ بار انجام دیے جاتے ہیں۔
Mixture-of-Experts (MoE) کا انضمام
Jamba میں مزید کفایت بڑھانے کے لیے MoE آرکیٹیکچر استعمال کی جاتی ہے۔
- MoE کا اطلاق صرف transformer تہوں کے اندر موجود fully-connected بلاکس (FFN) پر ہوتا ہے[3]۔ Mamba کی تہیں گھنی (dense) رہتی ہیں۔
- Jamba کے پہلے ماڈل میں 16 ماہرین (experts) تھے۔
- ہر token کے لیے routing network 2 بہترین ماہرین (Top-2 gating) منتخب کرتا ہے۔
اس کا مطلب یہ ہے کہ اگرچہ ماڈل کے پیرامیٹرز کی کل تعداد زیادہ ہے (52 ارب)، لیکن transformer تہہ میں ہر token کی پروسیسنگ کے قدم پر 16 میں سے صرف 2 ماہرین متحرک ہوتے ہیں، جس سے حسابات بہت تیز ہو جاتے ہیں۔
Jamba ماڈلز کا ارتقاء
Jamba-v0.1 (مارچ 2024)
اس خاندان میں پیش کیا گیا پہلا ماڈل درج ذیل خصوصیات رکھتا ہے:
| خصوصیت | قدر |
|---|---|
| پیرامیٹرز کی کل تعداد | 52 ارب |
| فعال پیرامیٹرز | ~12 ارب |
| ماہرین کی تعداد (MoE) | 16 (2 فعال) |
| سیاق و سباق کی ونڈو | 256,000 tokens |
| لائسنس | Apache 2.0[4] |
اپنی ہائبرڈ آرکیٹیکچر کی بدولت، Jamba-1 ایک 400 صفحات کے ناول کے برابر 256,000 tokens کی لمبائی کا سیاق و سباق پروسیس کر سکتا ہے، اور اسے 80 GB میموری والے ایک صارف GPU پر چلایا جا سکتا ہے[5]۔
Jamba-1.5 (2024)
2024 میں AI21 Labs نے Jamba 1.5 ماڈلز کا اپ ڈیٹ شدہ خاندان پیش کیا، جس میں دو ورژن شامل ہیں: Jamba 1.5 Mini (52 ارب کل پیرامیٹرز میں سے 12 ارب فعال) اور Jamba 1.5 Large (398 ارب کل پیرامیٹرز میں سے 94 ارب فعال)[6]۔ یہ ماڈلز کارکردگی میں نمایاں بہتری ظاہر کرتے ہیں:
- مدمقابل ماڈلز کے مقابلے میں طویل سیاق و سباق پر 2.5 گنا تیز inference۔
- انگریزی، ہسپانوی، فرانسیسی اور عربی سمیت نو زبانوں کی حمایت[7]۔
کلیدی فوائد اور کارکردگی
- وسیع سیاق و سباق کی ونڈو: 256,000 tokens — اپنے اجراء کے وقت تمام دستیاب (بشمول proprietary) ماڈلز میں سب سے بڑی ونڈوز میں سے ایک۔ یہ Jamba کو ان کاموں کے لیے مثالی بناتا ہے جن میں بڑی دستاویزات کا تجزیہ درکار ہو: قانونی معاہدے، علمی مقالات، مکمل کوڈ بیسز یا طویل مکالمے۔
- اعلیٰ کارکردگی اور کفایت: ٹیسٹ میں Jamba اسی سائز کے سرکردہ open ماڈلز جیسے Llama اور Mixtral کے برابر یا ان سے بہتر کارکردگی ظاہر کرتا ہے، جبکہ طویل سیاق و سباق پر 3 گنا زیادہ تھروپٹ بھی دکھاتا ہے[8]۔
- کھلا پن اور دستیابی: Jamba کو اجازت دینے والے Apache 2.0 لائسنس کے تحت تقسیم کیا جاتا ہے، جو تجارتی اور تحقیقی مقاصد کے لیے اس کے آزادانہ استعمال کی اجازت دیتا ہے۔ ماڈل کے weights پلیٹ فارم Hugging Face پر دستیاب ہیں۔
benchmarks پر نتائج
Jamba 1.5 مختلف benchmarks پر مسابقتی نتائج ظاہر کرتا ہے[9]:
- Jamba 1.5 Mini نے Arena Hard میں 46.1 اسکور حاصل کیا، جو اسے اپنی کیٹیگری میں سرکردہ public ماڈل بناتا ہے[10]۔
- Jamba 1.5 Large نے Arena Hard میں 65.4 اسکور حاصل کیا، جو Llama 3.1 70B اور 405B سے بہتر ہے۔
استعمال اور دستیابی
Jamba کو کاروباری استعمال کے لیے بہتر بنایا گیا ہے اور یہ فنکشن کالنگ، JSON میں ساختہ آؤٹ پٹ اور دستاویزات کی پروسیسنگ جیسی صلاحیتوں کی حمایت کرتا ہے۔ ماڈل متعدد پلیٹ فارمز پر دستیاب ہے، جن میں شامل ہیں:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
اقتصادی طور پر مؤثر inference کی حمایت کے لیے AI21 Labs نے ExpertsInt8 پیش کیا — یہ quantization کی ایک نئی تکنیک ہے جو 256K tokens کے سیاق و سباق کی پروسیسنگ میں معیار کھوئے بغیر Jamba 1.5 Large کو 80GB والے 8 GPU کی مشین پر چلانے کی اجازت دیتی ہے[11]۔
کتابیات
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
حواشی
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]