Jamba (language model) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — এটি একটি বৃহৎ ভাষা মডেলের (LLM) পরিবার, যা ইসরায়েলি গবেষণা প্রতিষ্ঠান AI21 Labs কর্তৃক তৈরি। Jamba হলো তার ধরনের প্রথম হাইব্রিড আর্কিটেকচার, যা AI উন্নয়নের দুটি প্রভাবশালী পদ্ধতির মূল উপাদানগুলিকে একত্রিত করে: transformer এবং State Space Models (SSM), বিশেষত Mamba আর্কিটেকচার[1]

Jamba-র মূল লক্ষ্য হলো আধুনিক LLM-এর মৌলিক আপোষের সমাধান করা: উচ্চ গুণমান ও কার্যক্ষমতা (transformer-এর বৈশিষ্ট্য) বনাম দক্ষতা ও অতিদীর্ঘ context প্রক্রিয়াকরণের সক্ষমতা (SSM-এর বৈশিষ্ট্য)। এই পদ্ধতিগুলি একত্রিত করে এবং Mixture-of-Experts (MoE)-এর মাধ্যমে বিরলতা (sparsity) যোগ করে, Jamba এমন একটি মডেল উপস্থাপন করে যা একই সাথে শক্তিশালী, দক্ষ এবং একটি অনুরোধে বিশাল পরিমাণ পাঠ্য পরিচালনায় সক্ষম।

Jamba আর্কিটেকচারের বিস্তারিত

Jamba কেবল transformer এবং Mamba স্তর পর্যায়ক্রমে সাজায় না। এটি একটি সুচিন্তিত ব্লক কাঠামো ব্যবহার করে, যেখানে প্রতিটি ব্লক আটটি স্তর নিয়ে গঠিত।

Jamba-র একটি ব্লকের কাঠামো:

  • একটি Transformer স্তর: এই স্তরটি "গভীর" উপলব্ধি এবং জটিল যুক্তির জন্য দায়ী। এই স্তরে Mixture-of-Experts (MoE) আর্কিটেকচার অন্তর্ভুক্ত।
  • সাতটি Mamba স্তর: এই স্তরগুলি transformer স্তরের পরে আসে এবং ক্রম প্রক্রিয়াকরণ ও দীর্ঘ context-এর মধ্য দিয়ে তথ্য "টেনে নিয়ে যাওয়ার" জন্য দায়ী[2]

এই অসমমিতিক কাঠামো মডেলটিকে কম্পিউটেশনাল সম্পদ কার্যকরভাবে পরিচালনা করতে দেয়: ভারী কিন্তু শক্তিশালী transformer অপারেশন কম ঘন ঘন সম্পন্ন হয়, যখন হালকা ও দ্রুত Mamba অপারেশন বেশি ঘন ঘন সম্পন্ন হয়।

Mixture-of-Experts (MoE) - ইন্টিগ্রেশন

Jamba-তে দক্ষতা আরও বাড়াতে MoE আর্কিটেকচার ব্যবহার করা হয়।

  • MoE শুধুমাত্র transformer স্তরের ভেতরে ফুলি-কানেক্টেড ব্লকে (FFN) প্রয়োগ করা হয়[3]। Mamba স্তরগুলি ঘন (dense) থাকে।
  • প্রথম Jamba মডেলে ১৬টি expert ছিল।
  • প্রতিটি token-এর জন্য router নেটওয়ার্ক সেরা ২টি expert বেছে নেয় (Top-2 gating)।

এর অর্থ হলো যদিও মডেলের মোট parameter সংখ্যা বিশাল (৫২ বিলিয়ন), প্রতিটি token প্রক্রিয়াকরণ ধাপে transformer স্তরে ১৬টির মধ্যে মাত্র ২টি expert সক্রিয় থাকে, যা কম্পিউটেশনকে অত্যন্ত দ্রুত করে তোলে।

Jamba মডেলের বিবর্তন

Jamba-v0.1 (মার্চ ২০২৪)

এই পরিবারের প্রথম মডেলটির নিম্নলিখিত বৈশিষ্ট্য রয়েছে:

Jamba-v0.1-এর প্রযুক্তিগত বৈশিষ্ট্য
বৈশিষ্ট্য মান
মোট parameter সংখ্যা ৫২ বিলিয়ন
সক্রিয় parameter ~১২ বিলিয়ন
Expert সংখ্যা (MoE) ১৬ (২টি সক্রিয়)
Context উইন্ডো ২৫৬,০০০ token
লাইসেন্স Apache 2.0[4]

তার হাইব্রিড আর্কিটেকচারের কারণে, Jamba-1 ২৫৬,০০০ token দৈর্ঘ্যের context প্রক্রিয়া করতে সক্ষম, যা প্রায় ৪০০ পৃষ্ঠার একটি উপন্যাসের সমতুল্য, এবং ৮০ জিবি মেমোরি সহ একটি কনজিউমার GPU-তে চালু করা যায়[5]

Jamba-1.5 (২০২৪)

২০২৪ সালে AI21 Labs আপডেট করা Jamba 1.5 মডেল পরিবার উপস্থাপন করে, যাতে দুটি সংস্করণ রয়েছে: Jamba 1.5 Mini (৫২B মোটের মধ্যে ১২B সক্রিয় parameter) এবং Jamba 1.5 Large (৩৯৮B মোটের মধ্যে ৯৪B সক্রিয় parameter)[6]। এই মডেলগুলি কার্যক্ষমতায় উল্লেখযোগ্য উন্নতি প্রদর্শন করে:

  • প্রতিযোগীদের তুলনায় দীর্ঘ context-এ ২.৫ গুণ পর্যন্ত দ্রুত inference।
  • ইংরেজি, স্প্যানিশ, ফরাসি এবং আরবি সহ নয়টি ভাষার সমর্থন[7]

মূল সুবিধা এবং কার্যক্ষমতা

  • বিশাল context উইন্ডো: ২৫৬,০০০ token — এটি প্রকাশের সময় সমস্ত উপলব্ধ (মালিকানাধীন সহ) মডেলের মধ্যে সবচেয়ে বড় উইন্ডোগুলির একটি। এটি Jamba-কে বড় ডকুমেন্ট বিশ্লেষণের জন্য আদর্শ করে তোলে: আইনি চুক্তি, বৈজ্ঞানিক রচনা, সম্পূর্ণ কোডবেস বা দীর্ঘ কথোপকথন।
  • উচ্চ কার্যক্ষমতা ও দক্ষতা: পরীক্ষায় Jamba একই আকারের শীর্ষ ওপেন মডেলগুলি যেমন Llama এবং Mixtral-এর সমকক্ষ বা উন্নত কার্যক্ষমতা প্রদর্শন করে, একই সাথে দীর্ঘ context-এ ৩ গুণ বেশি throughput দেখায়[8]
  • উন্মুক্ততা ও প্রাপ্যতা: Jamba অনুমতিমূলক Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়, যা বাণিজ্যিক ও গবেষণামূলক উদ্দেশ্যে এর মুক্ত ব্যবহারের অনুমতি দেয়। মডেলের weight Hugging Face প্ল্যাটফর্মে উপলব্ধ।

benchmark-এ ফলাফল

Jamba 1.5 বিভিন্ন benchmark-এ প্রতিযোগিতামূলক ফলাফল দেখায়[9]:

  • Jamba 1.5 Mini Arena Hard-এ ৪৬.১ পয়েন্ট অর্জন করেছে, যা তাকে তার বিভাগে শীর্ষস্থানীয় পাবলিক মডেল করে তোলে[10]
  • Jamba 1.5 Large Arena Hard-এ ৬৫.৪ পয়েন্ট অর্জন করেছে, Llama 3.1 70B এবং 405B-কে ছাড়িয়ে গেছে।

ব্যবহার ও প্রাপ্যতা

Jamba ব্যবসায়িক প্রয়োগের জন্য অপ্টিমাইজ করা হয়েছে এবং ফাংশন কলিং, JSON-এ কাঠামোগত আউটপুট এবং ডকুমেন্ট প্রক্রিয়াকরণের মতো সুবিধাগুলি সমর্থন করে। মডেলটি বহু প্ল্যাটফর্মে উপলব্ধ, যার মধ্যে রয়েছে:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

সাশ্রয়ী inference সমর্থনের জন্য AI21 Labs ExpertsInt8 উপস্থাপন করেছে — একটি নতুন quantization কৌশল যা ২৫৬K token context প্রক্রিয়াকরণে গুণমান না হারিয়ে Jamba 1.5 Large-কে ৮০GB-র ৮টি GPU সহ একটি মেশিনে স্থাপনের সুযোগ দেয়[11]

সাহিত্য

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

টীকা

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [১]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [২]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [৩]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [৪]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [৫]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [৬]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [৭]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [৮]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [৯]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [১০]