Jamba (language model) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — este o familie de modele lingvistice de mari dimensiuni (LLM), dezvoltată de compania israeliană de cercetare AI21 Labs. Jamba reprezintă prima arhitectură hibridă de acest fel, care combină elementele cheie ale două abordări dominante în dezvoltarea AI: transformerele și modelele spațiului de stări (State Space Models, SSM), în particular arhitectura Mamba[1].

Scopul principal al Jamba este de a rezolva compromisul fundamental al LLM-urilor moderne: calitate și performanță ridicate (caracteristice transformerelor) versus eficiență și capacitatea de a procesa contexte extrem de lungi (caracteristice SSM). Combinând aceste abordări și adăugând raritate prin Mixture-of-Experts (MoE), Jamba propune un model care este simultan puternic, eficient și capabil să lucreze cu volume enorme de text într-o singură interogare.

Arhitectura Jamba în detaliu

Jamba nu alternează pur și simplu straturi de transformer și Mamba. Ea utilizează o structură pe blocuri proiectată cu atenție, în care fiecare bloc este compus din opt straturi.

Structura unui bloc Jamba:

  • Un strat Transformer: Acest strat este responsabil pentru înțelegerea „profundă" și raționamentul complex. În acest strat este integrată arhitectura Mixture-of-Experts (MoE).
  • Șapte straturi Mamba: Aceste straturi urmează stratului transformer și sunt responsabile pentru procesarea eficientă a secvenței și „transportul" informației prin contextul lung[2].

Această structură asimetrică permite modelului să gestioneze eficient resursele de calcul: operațiile costisitoare, dar puternice ale transformerului sunt executate mai rar, în timp ce operațiile ușoare și rapide Mamba sunt executate mai frecvent.

Integrarea Mixture-of-Experts (MoE)

În Jamba este utilizată arhitectura MoE pentru creșterea suplimentară a eficienței.

  • MoE se aplică doar blocurilor complet conectate (FFN) din interiorul straturilor transformer[3]. Straturile Mamba rămân dense.
  • În primul model Jamba au existat 16 experți.
  • Pentru fiecare token, rețeaua de rutare selectează cei mai buni 2 experți (Top-2 gating).

Aceasta înseamnă că, deși numărul total de parametri ai modelului este mare (52 miliarde), la fiecare pas de procesare a unui token în stratul transformer sunt activi doar 2 din cei 16 experți, ceea ce face calculele foarte rapide.

Evoluția modelelor Jamba

Jamba-v0.1 (martie 2024)

Primul model prezentat în cadrul acestei familii are următoarele caracteristici:

Caracteristici tehnice Jamba-v0.1
Caracteristică Valoare
Număr total de parametri 52 miliarde
Parametri activi ~12 miliarde
Număr de experți (MoE) 16 (2 activi)
Fereastra de context 256 000 token-uri
Licență Apache 2.0[4]

Datorită arhitecturii sale hibride, Jamba-1 este capabilă să proceseze un context de 256 000 de token-uri, echivalent cu un roman de aproximativ 400 de pagini, și poate fi implementată pe o singură GPU de consum cu 80 GB memorie[5].

Jamba-1.5 (2024)

În 2024, AI21 Labs a prezentat familia actualizată de modele Jamba 1.5, care include două versiuni: Jamba 1.5 Mini (12B parametri activi din 52B total) și Jamba 1.5 Large (94B parametri activi din 398B total)[6]. Aceste modele demonstrează îmbunătățiri semnificative ale performanței:

  • Inferență de până la 2,5 ori mai rapidă pe contexte lungi față de modele concurente.
  • Suport pentru nouă limbi, inclusiv engleză, spaniolă, franceză și arabă[7].

Avantaje cheie și performanță

  • Fereastră de context extinsă: 256 000 de token-uri — una dintre cele mai mari ferestre dintre toate modelele disponibile (inclusiv cele proprietare) la momentul lansării. Aceasta face Jamba ideală pentru sarcini care necesită analiza documentelor mari: contracte juridice, lucrări științifice, baze de cod întregi sau dialoguri lungi.
  • Performanță și eficiență ridicate: În teste, Jamba demonstrează o performanță comparabilă sau superioară față de modelele deschise de top de dimensiuni similare, precum Llama și Mixtral, înregistrând în același timp un debit de 3 ori mai mare pe contexte lungi[8].
  • Deschidere și accesibilitate: Jamba este distribuită sub licența permisivă Apache 2.0, ceea ce permite utilizarea sa liberă în scopuri comerciale și de cercetare. Ponderile modelului sunt disponibile pe platforma Hugging Face.

Rezultate pe benchmark-uri

Jamba 1.5 obține rezultate competitive pe diverse benchmark-uri[9]:

  • Jamba 1.5 Mini a obținut 46,1 puncte în Arena Hard, devenind modelul public de top din categoria sa[10].
  • Jamba 1.5 Large a obținut 65,4 puncte în Arena Hard, depășind Llama 3.1 70B și 405B.

Utilizare și disponibilitate

Jamba este optimizată pentru aplicații de afaceri și suportă capabilități precum apelarea funcțiilor, ieșire structurată în JSON și procesarea documentelor. Modelul este disponibil pe numeroase platforme, inclusiv:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

Pentru a susține inferența eficientă din punct de vedere economic, AI21 Labs a prezentat ExpertsInt8 — o nouă tehnică de cuantizare care permite implementarea Jamba 1.5 Large pe o mașină cu 8 GPU-uri de 80GB fără pierderi de calitate la procesarea unui context de 256K token-uri[11].

Bibliografie

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

Note

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]