Jamba (language model) (SV)
Jamba — är en familj av stora språkmodeller (LLM), utvecklad av det israeliska forskningsföretaget AI21 Labs. Jamba representerar den första i sitt slag hybrida arkitekturen, som kombinerar nyckelelement från två dominerande ansatser inom AI-utveckling: transformers och State Space Models (SSM), i synnerhet arkitekturen Mamba[1].
Huvudmålet med Jamba är att lösa den grundläggande avvägningen hos moderna LLM: hög kvalitet och prestanda (karaktäristisk för transformers) kontra effektivitet och förmåga att hantera extremt långa kontexter (karaktäristisk för SSM). Genom att kombinera dessa ansatser och tillägga gleshet via Mixture-of-Experts (MoE), erbjuder Jamba en modell som samtidigt är kraftfull, effektiv och kapabel att hantera enorma mängder text i en enda förfrågan.
Jambas arkitektur i detalj
Jamba varvar inte bara transformer- och Mamba-lager. Den använder en noggrant utformad blockstruktur, där varje block består av åtta lager.
Struktur för ett Jamba-block:
- Ett transformer-lager: Detta lager ansvarar för "djup" förståelse och komplexa resonemang. I detta lager är arkitekturen Mixture-of-Experts (MoE) inbyggd.
- Sju Mamba-lager: Dessa lager följer efter transformer-lagret och ansvarar för effektiv sekvensbehandling och "genomdragning" av information genom lång kontext[2].
Den asymmetriska strukturen gör att modellen effektivt kan hantera beräkningsresurser: de tunga men kraftfulla transformer-operationerna utförs mer sällan, medan de lätta och snabba Mamba-operationerna utförs oftare.
Integrering av Mixture-of-Experts (MoE)
I Jamba används MoE-arkitektur för att ytterligare öka effektiviteten.
- MoE tillämpas endast på de fullständigt anslutna blocken (FFN) inuti transformer-lagren[3]. Mamba-lagren förblir täta.
- I den första Jamba-modellen fanns det 16 experter.
- För varje token väljer routernätverket de 2 bästa experterna (Top-2 gating).
Detta innebär att även om det totala antalet parametrar i modellen är stort (52 miljarder), är vid varje steg i bearbetningen av en token i transformer-lagret endast 2 av 16 experter aktiva, vilket gör beräkningarna mycket snabba.
Jamba-modellernas evolution
Jamba-v0.1 (mars 2024)
Den första modellen som presenterades inom denna familj har följande egenskaper:
| Egenskap | Värde |
|---|---|
| Totalt antal parametrar | 52 miljarder |
| Aktiva parametrar | ~12 miljarder |
| Antal experter (MoE) | 16 (2 aktiva) |
| Kontextfönster | 256 000 token |
| Licens | Apache 2.0[4] |
Tack vare sin hybrida arkitektur kan Jamba-1 behandla en kontext med en längd på 256 000 token, vilket motsvarar ungefär en 400-sidig roman, och kan driftsättas på ett enda konsument-GPU med 80 GB minne[5].
Jamba-1.5 (2024)
Under 2024 presenterade AI21 Labs den uppdaterade modellfamiljen Jamba 1.5, som inkluderar två versioner: Jamba 1.5 Mini (12B aktiva parametrar av 52B totalt) och Jamba 1.5 Large (94B aktiva parametrar av 398B totalt)[6]. Dessa modeller uppvisar väsentliga förbättringar i prestanda:
- Upp till 2,5 gånger snabbare inferens på långa kontexter jämfört med konkurrenter.
- Stöd för nio språk, inklusive engelska, spanska, franska och arabiska[7].
Viktiga fördelar och prestanda
- Enormt kontextfönster: 256 000 token — ett av de största fönstren bland alla tillgängliga (inklusive proprietära) modeller vid tidpunkten för dess lansering. Detta gör Jamba idealisk för uppgifter som kräver analys av stora dokument: juridiska kontrakt, vetenskapliga arbeten, hela kodbaser eller långa dialoger.
- Hög prestanda och effektivitet: I tester uppvisar Jamba prestanda som är jämförbar med eller överträffar ledande öppna modeller av liknande storlek, såsom Llama och Mixtral, och visar samtidigt 3 gånger högre genomströmning på långa kontexter[8].
- Öppenhet och tillgänglighet: Jamba distribueras under den tillåtande licensen Apache 2.0, vilket möjliggör fri användning för kommersiella och forskningsmässiga ändamål. Modellvikterna finns tillgängliga på plattformen Hugging Face.
Resultat på benchmark
Jamba 1.5 uppvisar konkurrenskraftiga resultat på olika benchmark[9]:
- Jamba 1.5 Mini fick 46,1 poäng i Arena Hard, vilket gör den till den ledande publika modellen i sin kategori[10].
- Jamba 1.5 Large fick 65,4 poäng i Arena Hard, och överträffar Llama 3.1 70B och 405B.
Användning och tillgänglighet
Jamba är optimerad för affärstillämpningar och stödjer funktioner som funktionsanrop, strukturerad JSON-utdata och dokumenthantering. Modellen är tillgänglig på ett flertal plattformar, inklusive:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
För att stödja kostnadseffektiv inferens presenterade AI21 Labs ExpertsInt8 — en ny kvantiseringsteknik som gör det möjligt att köra Jamba 1.5 Large på en maskin med 8 GPU à 80 GB utan kvalitetsförlust vid hantering av kontext med 256K token[11].
Litteratur
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Noter
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]