Jamba (language model) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — ito ay isang pamilya ng malalaking language model (LLM), na binuo ng Israeli na kumpanya ng pananaliksik na AI21 Labs. Ang Jamba ay kumakatawan sa unang uri ng hybrid na arkitektura, na pinagsama ang mga pangunahing elemento ng dalawang nangunguna na pamamaraan sa pagbuo ng AI: ang mga transformer at ang mga State Space Model (SSM), partikular na ang arkitektura ng Mamba[1].

Ang pangunahing layunin ng Jamba ay resolbahin ang pundamental na kompromiso ng mga modernong LLM: mataas na kalidad at pagganap (katangian ng mga transformer) laban sa kahusayan at kakayahang magproseso ng napakahabang mga konteksto (katangian ng SSM). Sa pamamagitan ng pagsasama ng mga pamamaraang ito at pagdaragdag ng kabanalan gamit ang Mixture-of-Experts (MoE), nag-aalok ang Jamba ng modelong sabay na makapangyarihan, mahusay, at kayang humawak ng napakalaking dami ng teksto sa iisang kahilingan.

Arkitektura ng Jamba sa Detalye

Ang Jamba ay hindi lamang naghahalili ng mga layer ng transformer at Mamba. Gumagamit ito ng maingat na dinisenong block na istruktura, kung saan ang bawat block ay binubuo ng walong layer.

Istruktura ng isang block ng Jamba:

  • Isang layer ng Transformer: Ang layer na ito ay responsable para sa "malalim" na pag-unawa at kumplikadong pangangatwiran. Naka-embed sa layer na ito ang arkitektura ng Mixture-of-Experts (MoE).
  • Pitong layer ng Mamba: Ang mga layer na ito ay sumusunod sa layer ng transformer at responsable para sa mahusay na pagpoproseso ng pagkakasunud-sunod at "pagdadala" ng impormasyon sa mahabang konteksto[2].

Ang asymmetric na istrakturang ito ay nagbibigay-daan sa modelong epektibong pamahalaan ang mga mapagkukunang pangkompyutasyon: ang mabibigat ngunit makapangyarihang mga operasyon ng transformer ay isinasagawa nang mas madalas, habang ang magaaan at mabilis na mga operasyon ng Mamba ay isinasagawa nang mas madalas.

Integrasyon ng Mixture-of-Experts (MoE)

Sa Jamba ay ginagamit ang arkitektura ng MoE para sa karagdagang pagpapabuti ng kahusayan.

  • Ang MoE ay inilalapat lamang sa mga fully-connected block (FFN) sa loob ng mga layer ng transformer[3]. Ang mga layer ng Mamba ay nananatiling makapal.
  • Sa unang modelo ng Jamba ay mayroong 16 na eksperto.
  • Para sa bawat token, pinipili ng routing network ang 2 pinakamahusay na eksperto (Top-2 gating).

Ito ay nangangahulugang bagaman ang kabuuang bilang ng mga parameter ng modelo ay malaki (52 bilyon), sa bawat hakbang ng pagpoproseso ng token sa layer ng transformer ay aktibo lamang ang 2 sa 16 na eksperto, na ginagawang napakabilis ng mga kalkulasyon.

Ebolusyon ng mga Modelo ng Jamba

Jamba-v0.1 (Marso 2024)

Ang unang modelo na ipinakita sa loob ng pamilyang ito ay may mga sumusunod na katangian:

Mga Teknikal na Katangian ng Jamba-v0.1
Katangian Halaga
Kabuuang bilang ng mga parameter 52 bilyon
Mga aktibong parameter ~12 bilyon
Bilang ng mga eksperto (MoE) 16 (2 aktibo)
Context window 256,000 token
Lisensya Apache 2.0[4]

Salamat sa hybrid na arkitektura nito, ang Jamba-1 ay kayang magproseso ng kontektong 256,000 token ang haba, na katumbas ng humigit-kumulang 400-pahinang nobela, at maaaring i-deploy sa isang consumer GPU na may 80 GB na memorya[5].

Jamba-1.5 (2024)

Noong 2024, ipinakita ng AI21 Labs ang na-update na pamilya ng mga modelo ng Jamba 1.5, na naglalaman ng dalawang bersyon: Jamba 1.5 Mini (12B aktibong parameter mula sa 52B kabuuan) at Jamba 1.5 Large (94B aktibong parameter mula sa 398B kabuuan)[6]. Ang mga modelong ito ay nagpapakita ng makabuluhang mga pagpapabuti sa pagganap:

  • Hanggang 2.5 beses na mas mabilis na inference sa mahahabang konteksto kumpara sa mga kakumpitensya.
  • Suporta para sa siyam na wika, kabilang ang Ingles, Espanyol, Pranses, at Arabe[7].

Mga Pangunahing Kalamangan at Pagganap

  • Napakalaking context window: 256,000 token — isa sa pinakamalaking window sa lahat ng available (kabilang ang proprietary) na mga modelo sa oras ng paglabas nito. Ginagawa nitong perpekto ang Jamba para sa mga gawaing nangangailangan ng pagsusuri ng malalaking dokumento: mga legal na kontrata, mga siyentipikong gawa, buong mga codebase, o mahahabang mga diyalogo.
  • Mataas na pagganap at kahusayan: Sa mga pagsubok, ipinapakita ng Jamba ang pagganap na maihahambing o mas mahusay kaysa sa mga nangungunang bukas na modelo ng katulad na sukat, gaya ng Llama at Mixtral, habang nagpapakita ng 3 beses na mas mataas na throughput sa mahahabang konteksto[8].
  • Pagiging bukas at accessibility: Ang Jamba ay ipinamamahagi sa ilalim ng permissive na lisensyang Apache 2.0, na nagpapahintulot ng libreng paggamit nito para sa mga komersyal at pananaliksik na layunin. Ang mga timbang ng modelo ay makukuha sa platform ng Hugging Face.

Mga Resulta sa mga Benchmark

Ipinapakita ng Jamba 1.5 ang mga mapagkumpitensyang resulta sa iba't ibang benchmark[9]:

  • Jamba 1.5 Mini ay nakakuha ng 46.1 puntos sa Arena Hard, na ginagawa itong nangunguna sa mga pampublikong modelo sa kategorya nito[10].
  • Jamba 1.5 Large ay nakakuha ng 65.4 puntos sa Arena Hard, na nakahihigit sa Llama 3.1 70B at 405B.

Paggamit at Accessibility

Ang Jamba ay na-optimize para sa mga aplikasyon sa negosyo at sinusuportahan ang mga kakayahan gaya ng function calling, structured na output sa JSON, at pagpoproseso ng mga dokumento. Ang modelo ay makukuha sa maraming platform, kabilang ang:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

Para suportahan ang matipid na inference, ipinakita ng AI21 Labs ang ExpertsInt8 — isang bagong teknik ng quantization na nagpapahintulot na mailagay ang Jamba 1.5 Large sa isang makina na may 8 GPU na 80GB bawat isa nang walang pagkawala ng kalidad sa pagpoproseso ng konteksto na 256K token[11].

Mga Sanggunian

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

Mga Tala

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]