Jamba (language model) (TR)
Jamba — büyük dil modellerinin (LLM) bir ailesidir; İsrailli araştırma şirketi AI21 Labs tarafından geliştirilmiştir. Jamba, türünün ilk örneği olan hibrit bir mimariyi temsil eder: yapay zeka geliştirmedeki iki baskın yaklaşımın temel unsurlarını —transformer'lar ve Durum Uzayı Modelleri (State Space Models, SSM), özellikle Mamba mimarisini— bir araya getirir[1].
Jamba'nın temel amacı, modern LLM'lerin temel ödünleşimini çözmektir: yüksek kalite ve performans (transformer'lara özgü) ile verimlilik ve son derece uzun bağlamları işleyebilme kapasitesi (SSM'lere özgü). Bu yaklaşımları birleştirip Mixture-of-Experts (MoE) aracılığıyla seyreklik ekleyerek Jamba, aynı anda güçlü, verimli ve tek bir sorguda büyük hacimli metinlerle çalışabilen bir model sunar.
Jamba Mimarisi - Jamba Mimarisinin Ayrıntıları
Jamba, yalnızca transformer ve Mamba katmanlarını sırayla dizmez. Her bloğun sekiz katmandan oluştuğu, dikkatle tasarlanmış bir blok yapısı kullanır.
Bir Jamba bloğunun yapısı:
- Bir Transformer Katmanı: Bu katman, "derin" anlama ve karmaşık akıl yürütmeden sorumludur. Bu katmana Mixture-of-Experts (MoE) mimarisi entegre edilmiştir.
- Yedi Mamba Katmanı: Bu katmanlar transformer katmanının ardından gelir; sıralı veriyi verimli biçimde işlemekten ve bilgiyi uzun bağlam boyunca "taşımaktan" sorumludur[2].
Bu asimetrik yapı, modelin hesaplama kaynaklarını verimli yönetmesine olanak tanır: ağır ama güçlü transformer işlemleri daha seyrek, hafif ve hızlı Mamba işlemleri ise daha sık yürütülür.
Mixture-of-Experts (MoE) Entegrasyonu
Jamba, verimliliği daha da artırmak için MoE mimarisini kullanır.
- MoE yalnızca transformer katmanlarının içindeki tam bağlantılı bloklara (FFN) uygulanır[3]. Mamba katmanları yoğun kalmaya devam eder.
- İlk Jamba modelinde 16 uzman bulunmaktadır.
- Her token için yönlendirici ağ, en iyi 2 uzmanı seçer (Top-2 gating).
Bu, modelin toplam parametre sayısı büyük olsa da (52 milyar), transformer katmanındaki her token işleme adımında 16 uzmanın yalnızca 2'sinin etkin olduğu anlamına gelir; bu da hesaplamaları son derece hızlı kılar.
Jamba Modellerinin Evrimi
Jamba-v0.1 (Mart 2024)
Bu ailenin kapsamında sunulan ilk model aşağıdaki özelliklere sahiptir:
| Özellik | Değer |
|---|---|
| Toplam parametre sayısı | 52 milyar |
| Aktif parametreler | ~12 milyar |
| Uzman sayısı (MoE) | 16 (2 aktif) |
| Bağlam penceresi | 256.000 token |
| Lisans | Apache 2.0[4] |
Hibrit mimarisi sayesinde Jamba-1, yaklaşık 400 sayfalık bir romana eşdeğer olan 256.000 token uzunluğundaki bağlamı işleyebilir ve 80 GB belleğe sahip tek bir tüketici GPU'suna dağıtılabilir[5].
Jamba-1.5 (2024)
2024 yılında AI21 Labs, iki sürüm içeren güncellenmiş Jamba 1.5 model ailesini tanıttı: Jamba 1.5 Mini (52 milyar toplam parametreden 12 milyar aktif) ve Jamba 1.5 Large (398 milyar toplam parametreden 94 milyar aktif)[6]. Bu modeller performansta önemli gelişmeler sergilemektedir:
- Uzun bağlamlarda rakiplerine kıyasla 2,5 kata kadar daha hızlı çıkarım.
- İngilizce, İspanyolca, Fransızca ve Arapça dahil dokuz dil desteği[7].
Temel Avantajlar ve Performans
- Devasa bağlam penceresi: 256.000 token, yayımlandığı dönemde mevcut tüm (tescilli dahil) modeller arasındaki en büyük pencerelerden biridir. Bu durum Jamba'yı, hukuki sözleşmeler, bilimsel makaleler, bütün kod tabanları veya uzun diyaloglar gibi büyük belge analizi gerektiren görevler için ideal kılar.
- Yüksek performans ve verimlilik: Testlerde Jamba, Llama ve Mixtral gibi benzer boyuttaki önde gelen açık modellerle kıyaslanabilir veya onları aşan bir performans sergilerken uzun bağlamlarda 3 kat daha yüksek verim göstermektedir[8].
- Açıklık ve erişilebilirlik: Jamba, ticari ve araştırma amaçlı ücretsiz kullanıma izin veren izin verici Apache 2.0 lisansı altında dağıtılmaktadır. Model ağırlıkları Hugging Face platformunda mevcuttur.
Benchmark Sonuçları
Jamba 1.5, çeşitli benchmark'larda rekabetçi sonuçlar göstermektedir[9]:
- Jamba 1.5 Mini, Arena Hard'da 46,1 puan alarak kendi kategorisindeki lider açık model konumuna gelmiştir[10].
- Jamba 1.5 Large, Arena Hard'da 65,4 puan alarak Llama 3.1 70B ve 405B'yi geride bırakmıştır.
Kullanım Alanları ve Erişilebilirlik
Jamba, iş uygulamaları için optimize edilmiştir ve fonksiyon çağırma, JSON formatında yapılandırılmış çıktı ve belge işleme gibi özellikleri desteklemektedir. Model aşağıdakiler dahil pek çok platformda mevcuttur:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
Ekonomik açıdan verimli çıkarımı desteklemek amacıyla AI21 Labs, Jamba 1.5 Large'ı 256K token bağlamında kalite kaybı yaşanmadan 80 GB'lık 8 GPU'ya sahip bir makinede çalıştırmaya olanak tanıyan yeni bir nicemleme tekniği olan ExpertsInt8'i tanıttı[11].
Kaynakça
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Notlar
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]