Jamba (language model) (FA)
Jamba — خانوادهای از مدلهای زبانی بزرگ (LLM) است که توسط شرکت پژوهشی اسرائیلی AI21 Labs توسعه یافته است. Jamba نخستین نمونه از نوع خود با معماری هیبریدی است که عناصر کلیدی دو رویکرد غالب در توسعه هوش مصنوعی را ترکیب میکند: transformer و مدلهای فضای حالت (State Space Models, SSM)، بهویژه معماری Mamba[1].
هدف اصلی Jamba حل یک مبادله بنیادین در LLMهای مدرن است: کیفیت و عملکرد بالا (ویژگی transformerها) در برابر کارایی و توانایی پردازش زمینههای بسیار طولانی (ویژگی SSMها). با ترکیب این رویکردها و افزودن تُنُکی از طریق Mixture-of-Experts (MoE)، Jamba مدلی ارائه میدهد که همزمان قدرتمند، کارآمد و قادر به پردازش حجم عظیمی از متن در یک درخواست است.
معماری Jamba به تفصیل
Jamba صرفاً لایههای transformer و Mamba را بهنوبت قرار نمیدهد. این مدل از یک ساختار بلوکی دقیقاً طراحیشده استفاده میکند که در آن هر بلوک از هشت لایه تشکیل شده است.
ساختار یک بلوک Jamba:
- یک لایه Transformer: این لایه مسئول درک «عمیق» و استدلالهای پیچیده است. معماری Mixture-of-Experts (MoE) در این لایه تعبیه شده است.
- هفت لایه Mamba: این لایهها پس از لایه transformer قرار میگیرند و مسئول پردازش کارآمد دنباله و «انتقال» اطلاعات در طول زمینه طولانی هستند[2].
این ساختار نامتقارن به مدل امکان میدهد منابع محاسباتی را بهصورت کارآمد مدیریت کند: عملیات سنگین اما قدرتمند transformer کمتر اجرا میشود، در حالی که عملیات سبک و سریع Mamba بیشتر اجرا میشود.
یکپارچهسازی Mixture-of-Experts (MoE)
در Jamba از معماری MoE برای افزایش بیشتر کارایی استفاده میشود.
- MoE تنها به بلوکهای fully-connected (FFN) درون لایههای transformer اعمال میشود[3]. لایههای Mamba متراکم باقی میمانند.
- در اولین مدل Jamba ۱۶ متخصص وجود داشت.
- برای هر token، شبکه مسیریاب ۲ متخصص برتر را انتخاب میکند (Top-2 gating).
این بدان معناست که اگرچه تعداد کل پارامترهای مدل زیاد است (۵۲ میلیارد)، در هر مرحله پردازش token در لایه transformer تنها ۲ متخصص از ۱۶ متخصص فعال هستند که محاسبات را بسیار سریع میکند.
تکامل مدلهای Jamba
Jamba-v0.1 (مارس ۲۰۲۴)
اولین مدل معرفیشده در این خانواده دارای مشخصات زیر است:
| مشخصه | مقدار |
|---|---|
| تعداد کل پارامترها | ۵۲ میلیارد |
| پارامترهای فعال | ~۱۲ میلیارد |
| تعداد متخصصان (MoE) | ۱۶ (۲ فعال) |
| پنجره زمینه | ۲۵۶٬۰۰۰ token |
| مجوز | Apache 2.0[4] |
به لطف معماری هیبریدی خود، Jamba-1 قادر است زمینهای با طول ۲۵۶٬۰۰۰ token را پردازش کند که معادل رمانی با حدود ۴۰۰ صفحه است، و میتوان آن را روی یک GPU مصرفی با ۸۰ گیگابایت حافظه مستقر کرد[5].
Jamba-1.5 (2024)
در سال ۲۰۲۴، AI21 Labs خانواده مدلهای بهروزشده Jamba 1.5 را معرفی کرد که شامل دو نسخه است: Jamba 1.5 Mini (۱۲ میلیارد پارامتر فعال از ۵۲ میلیارد کل) و Jamba 1.5 Large (۹۴ میلیارد پارامتر فعال از ۳۹۸ میلیارد کل)[6]. این مدلها بهبودهای قابل توجهی در عملکرد نشان میدهند:
- استنتاج تا ۲.۵ برابر سریعتر روی زمینههای طولانی در مقایسه با رقبا.
- پشتیبانی از نه زبان، از جمله انگلیسی، اسپانیایی، فرانسوی و عربی[7].
مزایای کلیدی و عملکرد
- پنجره زمینه بسیار بزرگ: ۲۵۶٬۰۰۰ token — یکی از بزرگترین پنجرهها در میان تمام مدلهای موجود (از جمله مدلهای اختصاصی) در زمان انتشار. این ویژگی Jamba را برای وظایفی که نیاز به تحلیل اسناد بزرگ دارند ایدهآل میکند: قراردادهای حقوقی، مقالات علمی، پایگاههای کد کامل یا مکالمات طولانی.
- عملکرد و کارایی بالا: در آزمونها، Jamba عملکردی مشابه یا برتر از مدلهای متنباز پیشرو با اندازه مشابه مانند Llama و Mixtral نشان میدهد، و در عین حال توان عملیاتی ۳ برابر بیشتری روی زمینههای طولانی دارد[8].
- باز بودن و دسترسپذیری: Jamba تحت مجوز مجاز Apache 2.0 توزیع میشود که استفاده آزادانه از آن را برای اهداف تجاری و پژوهشی امکانپذیر میکند. وزنهای مدل روی پلتفرم Hugging Face در دسترس است.
نتایج در benchmarkها
Jamba 1.5 نتایج رقابتی در benchmarkهای مختلف نشان میدهد[9]:
- Jamba 1.5 Mini امتیاز ۴۶.۱ را در Arena Hard کسب کرد که آن را به مدل عمومی پیشرو در دسته خود تبدیل میکند[10].
- Jamba 1.5 Large امتیاز ۶۵.۴ را در Arena Hard کسب کرد و از Llama 3.1 70B و 405B پیشی گرفت.
کاربرد و دسترسپذیری
Jamba برای کاربردهای تجاری بهینهسازی شده و از قابلیتهایی مانند فراخوانی توابع، خروجی ساختاریافته JSON و پردازش اسناد پشتیبانی میکند. مدل روی پلتفرمهای متعددی در دسترس است، از جمله:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
برای پشتیبانی از استنتاج مقرونبهصرفه، AI21 Labs تکنیک کوانتیزاسیون جدیدی به نام ExpertsInt8 معرفی کرد که امکان استقرار Jamba 1.5 Large را روی یک دستگاه با ۸ GPU با حافظه ۸۰ گیگابایت، بدون افت کیفیت در پردازش زمینه ۲۵۶K token، فراهم میکند[11].
منابع
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
یادداشتها
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [۱]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [۲]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [۳]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [۴]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [۵]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [۶]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [۷]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [۸]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [۹]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [۱۰]