Jamba (language model) (IT)
Jamba — è una famiglia di grandi modelli linguistici (LLM), sviluppata dalla società di ricerca israeliana AI21 Labs. Jamba rappresenta la prima architettura ibrida nel suo genere, che unisce gli elementi chiave di due approcci dominanti nello sviluppo dell'IA: i transformer e i modelli a spazio degli stati (State Space Models, SSM), in particolare l'architettura Mamba[1].
L'obiettivo principale di Jamba è risolvere il compromesso fondamentale degli LLM moderni: alta qualità e prestazioni (tipiche dei transformer) rispetto all'efficienza e alla capacità di elaborare contesti estremamente lunghi (tipiche degli SSM). Combinando questi approcci e aggiungendo la sparsità tramite Mixture-of-Experts (MoE), Jamba propone un modello che è al tempo stesso potente, efficiente e in grado di lavorare con enormi quantità di testo in un'unica richiesta.
Architettura di Jamba in dettaglio
Jamba non si limita ad alternare livelli transformer e Mamba. Utilizza una struttura a blocchi accuratamente progettata, in cui ogni blocco è composto da otto livelli.
Struttura di un singolo blocco Jamba:
- Un livello Transformer: Questo livello è responsabile della comprensione "profonda" e del ragionamento complesso. In questo livello è integrata l'architettura Mixture-of-Experts (MoE).
- Sette livelli Mamba: Questi livelli seguono il livello transformer e sono responsabili dell'elaborazione efficiente della sequenza e del "trasporto" delle informazioni attraverso il contesto lungo[2].
Questa struttura asimmetrica consente al modello di gestire in modo efficiente le risorse computazionali: le operazioni transformer, pesanti ma potenti, vengono eseguite meno frequentemente, mentre le operazioni Mamba, leggere e veloci, vengono eseguite più spesso.
Integrazione Mixture-of-Experts (MoE)
In Jamba viene utilizzata l'architettura MoE per aumentare ulteriormente l'efficienza.
- Il MoE viene applicato solo ai blocchi fully-connected (FFN) all'interno dei livelli transformer[3]. I livelli Mamba rimangono densi.
- Nel primo modello Jamba erano presenti 16 esperti.
- Per ogni token, la rete di routing seleziona i 2 migliori esperti (Top-2 gating).
Ciò significa che, sebbene il numero totale di parametri del modello sia elevato (52 miliardi), ad ogni passo di elaborazione del token nel livello transformer sono attivi solo 2 dei 16 esperti, rendendo i calcoli molto rapidi.
Evoluzione dei modelli Jamba
Jamba-v0.1 (marzo 2024)
Il primo modello presentato nell'ambito di questa famiglia presenta le seguenti caratteristiche:
| Caratteristica | Valore |
|---|---|
| Numero totale di parametri | 52 miliardi |
| Parametri attivi | ~12 miliardi |
| Numero di esperti (MoE) | 16 (2 attivi) |
| Finestra di contesto | 256 000 token |
| Licenza | Apache 2.0[4] |
Grazie alla sua architettura ibrida, Jamba-1 è in grado di elaborare un contesto di 256 000 token, equivalente a circa un romanzo di 400 pagine, e può essere distribuita su una singola GPU consumer con 80 GB di memoria[5].
Jamba-1.5 (2024)
Nel 2024 AI21 Labs ha presentato la famiglia di modelli aggiornata Jamba 1.5, che include due versioni: Jamba 1.5 Mini (12 miliardi di parametri attivi su 52 miliardi totali) e Jamba 1.5 Large (94 miliardi di parametri attivi su 398 miliardi totali)[6]. Questi modelli mostrano miglioramenti sostanziali nelle prestazioni:
- Inferenza fino a 2,5 volte più veloce su contesti lunghi rispetto ai concorrenti.
- Supporto per nove lingue, tra cui inglese, spagnolo, francese e arabo[7].
Principali vantaggi e prestazioni
- Finestra di contesto enorme: 256 000 token — una delle finestre più grandi tra tutti i modelli disponibili (inclusi quelli proprietari) al momento del suo rilascio. Questo rende Jamba ideale per attività che richiedono l'analisi di grandi documenti: contratti legali, lavori scientifici, intere basi di codice o dialoghi lunghi.
- Alte prestazioni ed efficienza: Nei test, Jamba dimostra prestazioni paragonabili o superiori ai principali modelli aperti di dimensioni simili, come Llama e Mixtral, mostrando al contempo una velocità di elaborazione 3 volte superiore su contesti lunghi[8].
- Apertura e accessibilità: Jamba è distribuita sotto la licenza permissiva Apache 2.0, che ne consente il libero utilizzo per scopi commerciali e di ricerca. I pesi del modello sono disponibili sulla piattaforma Hugging Face.
Risultati sui benchmark
Jamba 1.5 ottiene risultati competitivi su vari benchmark[9]:
- Jamba 1.5 Mini ha ottenuto 46,1 punti in Arena Hard, rendendola il modello pubblico leader nella sua categoria[10].
- Jamba 1.5 Large ha ottenuto 65,4 punti in Arena Hard, superando Llama 3.1 70B e 405B.
Utilizzo e disponibilità
Jamba è ottimizzata per applicazioni aziendali e supporta funzionalità come la chiamata di funzioni, l'output strutturato in JSON e l'elaborazione di documenti. Il modello è disponibile su numerose piattaforme, tra cui:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
Per supportare un'inferenza economicamente efficiente, AI21 Labs ha presentato ExpertsInt8 — una nuova tecnica di quantizzazione che consente di distribuire Jamba 1.5 Large su una macchina con 8 GPU da 80 GB senza perdita di qualità nell'elaborazione di un contesto di 256K token[11].
Bibliografia
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Note
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]