Jamba (language model) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — egy nagy nyelvi modellek (LLM) családja, amelyet az AI21 Labs izraeli kutatócég fejlesztett ki. A Jamba az első maga nemében való hibrid architektúra, amely két, a mesterségesintelligencia-fejlesztésben meghatározó megközelítés kulcselemeit ötvözi: a transformer-alapú modellekét és az állapottér-modellekét (State Space Models, SSM), különösen a Mamba architektúráét[1].

A Jamba fő célja a modern LLM-ek alapvető kompromisszumának feloldása: a magas minőség és teljesítmény (a transformerekre jellemző) kontra hatékonyság és a rendkívül hosszú kontextusok kezelésének képessége (az SSM-ekre jellemző). E megközelítések kombinálásával és a Mixture-of-Experts (MoE) segítségével megvalósított ritkaság hozzáadásával a Jamba egy olyan modellt kínál, amely egyszerre nagy teljesítményű, hatékony, és képes hatalmas mennyiségű szöveget egyetlen lekérdezésben kezelni.

A Jamba architektúrája részletesen

A Jamba nem csupán felváltva alkalmaz transformer és Mamba rétegeket. Gondosan megtervezett blokkstruktúrát használ, ahol minden blokk nyolc rétegből áll.

Egy Jamba-blokk felépítése:

  • Egy transformer-réteg: Ez a réteg felelős a „mélyreható" megértésért és az összetett következtetésekért. Ebbe a rétegbe van beépítve a Mixture-of-Experts (MoE) architektúra.
  • Hét Mamba-réteg: Ezek a rétegek a transformer-réteg után következnek, és a sorozat hatékony feldolgozásáért, valamint az információ „átviteléért" felelnek a hosszú kontextuson keresztül[2].

Ez az aszimmetrikus struktúra lehetővé teszi a modell számára a számítási erőforrások hatékony kezelését: a nehéz, de nagy teljesítményű transformer-műveletek ritkábban, míg a könnyű és gyors Mamba-műveletek gyakrabban hajtódnak végre.

Mixture-of-Experts (MoE) integráció

A Jamba MoE architektúrát alkalmaz a hatékonyság további növelése érdekében.

  • A MoE kizárólag a transformer-rétegeken belüli teljesen összekötött blokkokra (FFN) vonatkozik[3]. A Mamba-rétegek sűrűk maradnak.
  • Az első Jamba-modellben 16 szakértő volt.
  • Minden token esetén a routing-hálózat a 2 legjobb szakértőt választja ki (Top-2 gating).

Ez azt jelenti, hogy bár a modell paramétereinek teljes száma nagy (52 milliárd), a transformer-rétegben minden egyes token feldolgozási lépésekor a 16 szakértőből csupán 2 aktív, ami rendkívül gyorssá teszi a számítást.

A Jamba-modellek fejlődése

Jamba-v0.1 (2024. március)

A család keretében bemutatott első modell a következő jellemzőkkel rendelkezik:

A Jamba-v0.1 műszaki jellemzői
Jellemző Érték
Paraméterek teljes száma 52 milliárd
Aktív paraméterek ~12 milliárd
Szakértők száma (MoE) 16 (2 aktív)
Kontextusablak 256 000 token
Licenc Apache 2.0[4]

Hibrid architektúrájának köszönhetően a Jamba-1 képes 256 000 tokennyi kontextust feldolgozni, ami körülbelül egy 400 oldalas regénynek felel meg, és egyetlen, 80 GB memóriával rendelkező fogyasztói GPU-n is üzembe helyezhető[5].

Jamba-1.5 (2024)

2024-ben az AI21 Labs bemutatta a Jamba 1.5 frissített modellcsaládot, amely két változatot tartalmaz: Jamba 1.5 Mini (52 milliárd összes paraméterből 12 milliárd aktív) és Jamba 1.5 Large (398 milliárd összes paraméterből 94 milliárd aktív)[6]. Ezek a modellek jelentős teljesítménybeli javulást mutatnak:

  • Hosszú kontextusokon akár 2,5-szer gyorsabb következtetés a versenytársakhoz képest.
  • Kilenc nyelv támogatása, köztük az angol, a spanyol, a francia és az arab[7].

Legfontosabb előnyök és teljesítmény

  • Hatalmas kontextusablak: 256 000 token — a megjelenésekor az összes elérhető (köztük a zárt forráskódú) modell között az egyik legnagyobb ablak. Ez a Jambát ideálissá teszi nagy dokumentumok elemzését igénylő feladatokhoz: jogi szerződések, tudományos munkák, teljes kódbázisok vagy hosszú párbeszédek esetén.
  • Magas teljesítmény és hatékonyság: A tesztek során a Jamba az azonos méretű vezető nyílt modellekkel, például a Llamával és a Mixtral-lal összevethető vagy azokat meghaladó teljesítményt nyújt, miközben hosszú kontextusokon háromszor nagyobb átviteli sebességet mutat[8].
  • Nyíltság és elérhetőség: A Jamba a megengedő Apache 2.0 licenc alatt terjesztik, ami lehetővé teszi szabad kereskedelmi és kutatási célú felhasználását. A modell súlyai elérhetők a Hugging Face platformon.

Benchmark-eredmények

A Jamba 1.5 versenyképes eredményeket ér el különböző benchmarkokon[9]:

  • A Jamba 1.5 Mini 46,1 pontot szerzett az Arena Hard benchmarkon, ezzel a kategóriájában vezető nyilvános modellé vált[10].
  • A Jamba 1.5 Large 65,4 pontot szerzett az Arena Hard benchmarkon, felülmúlva a Llama 3.1 70B és 405B modelleket.

Alkalmazás és elérhetőség

A Jamba üzleti alkalmazásokra van optimalizálva, és olyan képességeket támogat, mint a függvényhívás, strukturált JSON-kimenet és dokumentumfeldolgozás. A modell számos platformon elérhető, köztük:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

A gazdaságos következtetés támogatása érdekében az AI21 Labs bemutatta az ExpertsInt8 nevű új kvantizációs technikát, amely lehetővé teszi a Jamba 1.5 Large elhelyezését egy 8 darab 80 GB-os GPU-val rendelkező gépen, minőségveszteség nélkül, 256K tokenes kontextus feldolgozásakor[11].

Irodalom

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

Megjegyzések

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]