Jamba (language model) (NL)
Jamba — een familie van grote taalmodellen (LLM), ontwikkeld door het Israëlische onderzoeksbedrijf AI21 Labs. Jamba vertegenwoordigt de allereerste hybride architectuur die de kernelementen van twee dominante benaderingen in AI-ontwikkeling combineert: transformers en State Space Models (SSM), in het bijzonder de Mamba-architectuur[1].
Het voornaamste doel van Jamba is het oplossen van het fundamentele compromis van moderne LLM's: hoge kwaliteit en prestaties (kenmerkend voor transformers) versus efficiëntie en het vermogen om extreem lange contexten te verwerken (kenmerkend voor SSM's). Door deze benaderingen te combineren en schaarsheid toe te voegen via Mixture-of-Experts (MoE), biedt Jamba een model dat tegelijkertijd krachtig, efficiënt en in staat is om enorme hoeveelheden tekst in één verzoek te verwerken.
Architectuur van Jamba in detail
Jamba wisselt niet simpelweg transformer- en Mamba-lagen af. Het maakt gebruik van een zorgvuldig ontworpen blokstructuur, waarbij elk blok uit acht lagen bestaat.
Structuur van één Jamba-blok:
- Één transformer-laag: Deze laag is verantwoordelijk voor "diep" begrip en complexe redenering. In deze laag is de Mixture-of-Experts (MoE)-architectuur ingebouwd.
- Zeven Mamba-lagen: Deze lagen volgen op de transformer-laag en zijn verantwoordelijk voor efficiënte sequentieverwerking en het "doortrekken" van informatie door een lange context[2].
Deze asymmetrische structuur stelt het model in staat om rekenbronnen efficiënt te beheren: de zware maar krachtige transformer-bewerkingen worden minder frequent uitgevoerd, terwijl de lichte en snelle Mamba-bewerkingen vaker worden uitgevoerd.
Integratie van Mixture-of-Experts (MoE)
Jamba maakt gebruik van de MoE-architectuur voor verdere efficiëntieverbetering.
- MoE wordt alleen toegepast op de volledig verbonden blokken (FFN) binnen de transformer-lagen[3]. De Mamba-lagen blijven dense.
- Het eerste Jamba-model had 16 experts.
- Voor elk token selecteert het routeringsnetwerk de 2 beste experts (Top-2 gating).
Dit betekent dat hoewel het totale aantal parameters van het model groot is (52 miljard), bij elke stap van tokenverwerking in de transformer-laag slechts 2 van de 16 experts actief zijn, waardoor de berekeningen zeer snel verlopen.
Evolutie van de Jamba-modellen
Jamba-v0.1 (maart 2024)
Het eerste model dat binnen deze familie werd gepresenteerd, heeft de volgende kenmerken:
| Kenmerk | Waarde |
|---|---|
| Totaal aantal parameters | 52 miljard |
| Actieve parameters | ~12 miljard |
| Aantal experts (MoE) | 16 (2 actief) |
| Contextvenster | 256 000 tokens |
| Licentie | Apache 2.0[4] |
Dankzij zijn hybride architectuur kan Jamba-1 een context van 256 000 tokens verwerken, wat overeenkomt met een roman van ongeveer 400 pagina's, en kan het worden ingezet op één consumenten-GPU met 80 GB geheugen[5].
Jamba-1.5 (2024)
In 2024 presenteerde AI21 Labs de vernieuwde Jamba 1.5-modelfamilie, bestaande uit twee versies: Jamba 1.5 Mini (12B actieve parameters van 52B totaal) en Jamba 1.5 Large (94B actieve parameters van 398B totaal)[6]. Deze modellen tonen aanzienlijke prestatieverbeteringen:
- Tot 2,5 keer snellere inferentie op lange contexten in vergelijking met concurrenten.
- Ondersteuning voor negen talen, waaronder Engels, Spaans, Frans en Arabisch[7].
Belangrijkste voordelen en prestaties
- Enorm contextvenster: 256 000 tokens — een van de grootste vensters onder alle beschikbare (inclusief propriëtaire) modellen op het moment van uitgifte. Dit maakt Jamba ideaal voor taken die de analyse van grote documenten vereisen: juridische contracten, wetenschappelijke werken, volledige codebases of lange dialogen.
- Hoge prestaties en efficiëntie: In tests toont Jamba prestaties die vergelijkbaar zijn met of beter zijn dan toonaangevende open modellen van vergelijkbare omvang, zoals Llama en Mixtral, met daarbij een 3 keer hogere doorvoer op lange contexten[8].
- Openheid en toegankelijkheid: Jamba wordt verspreid onder de permissieve Apache 2.0-licentie, waardoor vrij gebruik voor commerciële en onderzoeksdoeleinden mogelijk is. De modelgewichten zijn beschikbaar op het Hugging Face-platform.
Resultaten op benchmarks
Jamba 1.5 behaalt concurrerende resultaten op verschillende benchmarks[9]:
- Jamba 1.5 Mini behaalde 46,1 punten in Arena Hard, waarmee het het toonaangevende publieke model in zijn categorie is[10].
- Jamba 1.5 Large behaalde 65,4 punten in Arena Hard, waarmee het Llama 3.1 70B en 405B overtreft.
Toepassingen en beschikbaarheid
Jamba is geoptimaliseerd voor zakelijke toepassingen en ondersteunt mogelijkheden zoals het aanroepen van functies, gestructureerde uitvoer in JSON en documentverwerking. Het model is beschikbaar op talrijke platforms, waaronder:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
Om kosteneffectieve inferentie te ondersteunen, heeft AI21 Labs ExpertsInt8 geïntroduceerd — een nieuwe kwantisatietechniek die het mogelijk maakt Jamba 1.5 Large te draaien op een machine met 8 GPU's van 80 GB zonder kwaliteitsverlies bij het verwerken van een context van 256K tokens[11].
Literatuur
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Noten
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]