Jamba (Sprachmodell)
Jamba ist eine Familie von großen Sprachmodellen (LLMs), die vom israelischen Forschungsunternehmen AI21 Labs entwickelt wurde. Jamba stellt die erste hybride Architektur ihrer Art dar, die Schlüsselelemente zweier dominierender Ansätze in der KI-Entwicklung kombiniert: Transformer und Zustandsraummodelle (State Space Models, SSM), insbesondere die Mamba-Architektur[1].
Das Hauptziel von Jamba ist es, einen fundamentalen Kompromiss moderner LLMs zu überwinden: hohe Qualität und Leistungsfähigkeit (typisch für Transformer) gegenüber Effizienz und der Fähigkeit, extrem lange Kontexte zu verarbeiten (typisch für SSMs). Durch die Kombination dieser Ansätze und die Ergänzung durch Dünnbesetztheit (Sparsity) mittels Mixture-of-Experts (MoE) bietet Jamba ein Modell, das gleichzeitig leistungsstark, effizient und in der Lage ist, riesige Textmengen in einer einzigen Anfrage zu verarbeiten.
Die Architektur von Jamba im Detail
Jamba wechselt nicht einfach nur Transformer- und Mamba-Schichten ab. Es verwendet eine sorgfältig entworfene Blockstruktur, bei der jeder Block aus acht Schichten besteht.
Struktur eines Jamba-Blocks:
- Eine Transformer-Schicht: Diese Schicht ist für das „tiefe“ Verständnis und komplexe Schlussfolgerungen verantwortlich. In diese Schicht ist die Mixture-of-Experts (MoE)-Architektur integriert.
- Sieben Mamba-Schichten: Diese Schichten folgen auf die Transformer-Schicht und sind für die effiziente Verarbeitung der Sequenz und die Weitergabe von Informationen über einen langen Kontext verantwortlich[2].
Diese asymmetrische Struktur ermöglicht es dem Modell, Rechenressourcen effizient zu verwalten: Die rechenintensiven, aber leistungsstarken Transformer-Operationen werden seltener ausgeführt, während die leichten und schnellen Mamba-Operationen häufiger durchgeführt werden.
Integration von Mixture-of-Experts (MoE)
In Jamba wird die MoE-Architektur zur weiteren Effizienzsteigerung eingesetzt.
- MoE wird nur auf die Feedforward-Netzwerk-Blöcke (FFN) innerhalb der Transformer-Schichten angewendet[3]. Die Mamba-Schichten bleiben dicht (dense).
- Im ersten Jamba-Modell gab es 16 Experten.
- Für jedes Token wählt das Router-Netzwerk die 2 besten Experten aus (Top-2-Gating).
Das bedeutet, dass, obwohl die Gesamtzahl der Modellparameter groß ist (52 Milliarden), bei jedem Verarbeitungsschritt eines Tokens in der Transformer-Schicht nur 2 der 16 Experten aktiv sind, was die Berechnungen sehr schnell macht.
Entwicklung der Jamba-Modelle
Jamba-v0.1 (März 2024)
Das erste Modell, das im Rahmen dieser Familie vorgestellt wurde, hat die folgenden Eigenschaften:
| Merkmal | Wert |
|---|---|
| Gesamtanzahl der Parameter | 52 Milliarden |
| Aktive Parameter | ~12 Milliarden |
| Anzahl der Experten (MoE) | 16 (2 aktiv) |
| Kontextfenster | 256.000 Token |
| Lizenz | Apache 2.0[4] |
Dank seiner hybriden Architektur kann Jamba-1 einen Kontext von 256.000 Token verarbeiten, was etwa einem 400-seitigen Roman entspricht, und kann auf einer einzigen Consumer-GPU mit 80 GB Speicher bereitgestellt werden[5].
Jamba-1.5 (2024)
Im Jahr 2024 stellte AI21 Labs eine aktualisierte Modellfamilie Jamba 1.5 vor, die zwei Versionen umfasst: Jamba 1.5 Mini (12 Mrd. aktive Parameter von 52 Mrd. insgesamt) und Jamba 1.5 Large (94 Mrd. aktive Parameter von 398 Mrd. insgesamt)[6]. Diese Modelle zeigen signifikante Leistungsverbesserungen:
- Bis zu 2,5-mal schnellere Inferenz bei langen Kontexten im Vergleich zu Konkurrenzmodellen.
- Unterstützung für neun Sprachen, darunter Englisch, Spanisch, Französisch und Arabisch[7].
Hauptvorteile und Leistung
- Enormes Kontextfenster: 256.000 Token – eines der größten Fenster unter allen zum Zeitpunkt der Veröffentlichung verfügbaren Modellen (einschließlich proprietärer Modelle). Dies macht Jamba ideal für Aufgaben, die die Analyse großer Dokumente erfordern: Rechtsverträge, wissenschaftliche Arbeiten, ganze Codebasen oder lange Dialoge.
- Hohe Leistung und Effizienz: In Tests zeigt Jamba eine Leistung, die mit führenden offenen Modellen ähnlicher Größe wie Llama und Mixtral vergleichbar ist oder diese übertrifft, und das bei einem dreimal höheren Durchsatz bei langen Kontexten[8].
- Offenheit und Verfügbarkeit: Jamba wird unter der freizügigen Apache-2.0-Lizenz vertrieben, was die freie Nutzung für kommerzielle und Forschungszwecke ermöglicht. Die Modellgewichte sind auf der Hugging-Face-Plattform verfügbar.
Benchmark-Ergebnisse
Jamba 1.5 zeigt wettbewerbsfähige Ergebnisse in verschiedenen Benchmarks[9]:
- Jamba 1.5 Mini erreichte 46,1 Punkte in der Arena Hard, was es zum führenden öffentlichen Modell in seiner Kategorie macht[10].
- Jamba 1.5 Large erreichte 65,4 Punkte in der Arena Hard und übertrifft damit Llama 3.1 70B und 405B.
Anwendung und Verfügbarkeit
Jamba ist für Geschäftsanwendungen optimiert und unterstützt Funktionen wie Function Calling, strukturierte JSON-Ausgabe und Dokumentenverarbeitung. Das Modell ist auf zahlreichen Plattformen verfügbar, darunter:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
Um eine kosteneffiziente Inferenz zu unterstützen, hat AI21 Labs ExpertsInt8 vorgestellt – eine neue Quantisierungstechnik, die es ermöglicht, Jamba 1.5 Large auf einer Maschine mit 8 GPUs à 80 GB zu betreiben, ohne Qualitätsverlust bei der Verarbeitung eines Kontexts von 256K Token[11].
Literatur
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (203). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Einzelnachweise
- ↑ „Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model“. AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ „Jamba Documentation“. Hugging Face Transformers. [2]
- ↑ „ai21labs/Jamba-v0.1“. Hugging Face. [3]
- ↑ „AI21 Labs' Jamba: A New Hybrid LLM Architecture“. Gradient Flow. [4]
- ↑ „Announcing the Jamba-1.5 model family“. AI21 Labs Blog. [5]
- ↑ „ai21labs/AI21-Jamba-Large-1.5“. Hugging Face. [6]
- ↑ „AI21 Labs durchbricht mit Jamba neue Barrieren“. ITinAI. [7]
- ↑ 9.0 9.1 „Jamba 1.5 ist erschienen: ein hybrides Modell von AI21 Labs“. Dzen. [8]
- ↑ „Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock“. AWS What's New. [9]
- ↑ „ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs“. OpenReview. [10]