Jamba (language model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — خانواده‌ای از مدل‌های زبانی بزرگ (LLM) است که توسط شرکت پژوهشی اسرائیلی AI21 Labs توسعه یافته است. Jamba نخستین نمونه از نوع خود با معماری هیبریدی است که عناصر کلیدی دو رویکرد غالب در توسعه هوش مصنوعی را ترکیب می‌کند: transformer و مدل‌های فضای حالت (State Space Models, SSM)، به‌ویژه معماری Mamba[1].

هدف اصلی Jamba حل یک مبادله بنیادین در LLM‌های مدرن است: کیفیت و عملکرد بالا (ویژگی transformerها) در برابر کارایی و توانایی پردازش زمینه‌های بسیار طولانی (ویژگی SSMها). با ترکیب این رویکردها و افزودن تُنُکی از طریق Mixture-of-Experts (MoE)، Jamba مدلی ارائه می‌دهد که هم‌زمان قدرتمند، کارآمد و قادر به پردازش حجم عظیمی از متن در یک درخواست است.

معماری Jamba به تفصیل

Jamba صرفاً لایه‌های transformer و Mamba را به‌نوبت قرار نمی‌دهد. این مدل از یک ساختار بلوکی دقیقاً طراحی‌شده استفاده می‌کند که در آن هر بلوک از هشت لایه تشکیل شده است.

ساختار یک بلوک Jamba:

  • یک لایه Transformer: این لایه مسئول درک «عمیق» و استدلال‌های پیچیده است. معماری Mixture-of-Experts (MoE) در این لایه تعبیه شده است.
  • هفت لایه Mamba: این لایه‌ها پس از لایه transformer قرار می‌گیرند و مسئول پردازش کارآمد دنباله و «انتقال» اطلاعات در طول زمینه طولانی هستند[2].

این ساختار نامتقارن به مدل امکان می‌دهد منابع محاسباتی را به‌صورت کارآمد مدیریت کند: عملیات سنگین اما قدرتمند transformer کمتر اجرا می‌شود، در حالی که عملیات سبک و سریع Mamba بیشتر اجرا می‌شود.

یکپارچه‌سازی Mixture-of-Experts (MoE)

در Jamba از معماری MoE برای افزایش بیشتر کارایی استفاده می‌شود.

  • MoE تنها به بلوک‌های fully-connected (FFN) درون لایه‌های transformer اعمال می‌شود[3]. لایه‌های Mamba متراکم باقی می‌مانند.
  • در اولین مدل Jamba ۱۶ متخصص وجود داشت.
  • برای هر token، شبکه مسیریاب ۲ متخصص برتر را انتخاب می‌کند (Top-2 gating).

این بدان معناست که اگرچه تعداد کل پارامترهای مدل زیاد است (۵۲ میلیارد)، در هر مرحله پردازش token در لایه transformer تنها ۲ متخصص از ۱۶ متخصص فعال هستند که محاسبات را بسیار سریع می‌کند.

تکامل مدل‌های Jamba

Jamba-v0.1 (مارس ۲۰۲۴)

اولین مدل معرفی‌شده در این خانواده دارای مشخصات زیر است:

مشخصات فنی Jamba-v0.1
مشخصه مقدار
تعداد کل پارامترها ۵۲ میلیارد
پارامترهای فعال ~۱۲ میلیارد
تعداد متخصصان (MoE) ۱۶ (۲ فعال)
پنجره زمینه ۲۵۶٬۰۰۰ token
مجوز Apache 2.0[4]

به لطف معماری هیبریدی خود، Jamba-1 قادر است زمینه‌ای با طول ۲۵۶٬۰۰۰ token را پردازش کند که معادل رمانی با حدود ۴۰۰ صفحه است، و می‌توان آن را روی یک GPU مصرفی با ۸۰ گیگابایت حافظه مستقر کرد[5].

Jamba-1.5 (2024)

در سال ۲۰۲۴، AI21 Labs خانواده مدل‌های به‌روزشده Jamba 1.5 را معرفی کرد که شامل دو نسخه است: Jamba 1.5 Mini (۱۲ میلیارد پارامتر فعال از ۵۲ میلیارد کل) و Jamba 1.5 Large (۹۴ میلیارد پارامتر فعال از ۳۹۸ میلیارد کل)[6]. این مدل‌ها بهبودهای قابل توجهی در عملکرد نشان می‌دهند:

  • استنتاج تا ۲.۵ برابر سریع‌تر روی زمینه‌های طولانی در مقایسه با رقبا.
  • پشتیبانی از نه زبان، از جمله انگلیسی، اسپانیایی، فرانسوی و عربی[7].

مزایای کلیدی و عملکرد

  • پنجره زمینه بسیار بزرگ: ۲۵۶٬۰۰۰ token — یکی از بزرگ‌ترین پنجره‌ها در میان تمام مدل‌های موجود (از جمله مدل‌های اختصاصی) در زمان انتشار. این ویژگی Jamba را برای وظایفی که نیاز به تحلیل اسناد بزرگ دارند ایده‌آل می‌کند: قراردادهای حقوقی، مقالات علمی، پایگاه‌های کد کامل یا مکالمات طولانی.
  • عملکرد و کارایی بالا: در آزمون‌ها، Jamba عملکردی مشابه یا برتر از مدل‌های متن‌باز پیشرو با اندازه مشابه مانند Llama و Mixtral نشان می‌دهد، و در عین حال توان عملیاتی ۳ برابر بیشتری روی زمینه‌های طولانی دارد[8].
  • باز بودن و دسترس‌پذیری: Jamba تحت مجوز مجاز Apache 2.0 توزیع می‌شود که استفاده آزادانه از آن را برای اهداف تجاری و پژوهشی امکان‌پذیر می‌کند. وزن‌های مدل روی پلتفرم Hugging Face در دسترس است.

نتایج در benchmark‌ها

Jamba 1.5 نتایج رقابتی در benchmark‌های مختلف نشان می‌دهد[9]:

  • Jamba 1.5 Mini امتیاز ۴۶.۱ را در Arena Hard کسب کرد که آن را به مدل عمومی پیشرو در دسته خود تبدیل می‌کند[10].
  • Jamba 1.5 Large امتیاز ۶۵.۴ را در Arena Hard کسب کرد و از Llama 3.1 70B و 405B پیشی گرفت.

کاربرد و دسترس‌پذیری

Jamba برای کاربردهای تجاری بهینه‌سازی شده و از قابلیت‌هایی مانند فراخوانی توابع، خروجی ساختاریافته JSON و پردازش اسناد پشتیبانی می‌کند. مدل روی پلتفرم‌های متعددی در دسترس است، از جمله:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

برای پشتیبانی از استنتاج مقرون‌به‌صرفه، AI21 Labs تکنیک کوانتیزاسیون جدیدی به نام ExpertsInt8 معرفی کرد که امکان استقرار Jamba 1.5 Large را روی یک دستگاه با ۸ GPU با حافظه ۸۰ گیگابایت، بدون افت کیفیت در پردازش زمینه ۲۵۶K token، فراهم می‌کند[11].

منابع

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

یادداشت‌ها

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [۱]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [۲]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [۳]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [۴]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [۵]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [۶]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [۷]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [۸]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [۹]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [۱۰]