Jamba (language model) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — това е семейство от големи езикови модели (LLM), разработено от израелската изследователска компания AI21 Labs. Jamba представлява първата по рода си хибридна архитектура, която обединява ключовите елементи на два доминиращи подхода в разработката на ИИ: трансформери и модели на пространството на състоянията (State Space Models, SSM), по-конкретно архитектурата Mamba[1].

Основната цел на Jamba е да реши фундаменталния компромис при съвременните LLM: високото качество и производителност (присъщи на трансформерите) срещу ефективността и способността за обработка на свръхдълги контексти (присъщи на SSM). Като обединява тези подходи и добавя разреденост чрез Mixture-of-Experts (MoE), Jamba предлага модел, който едновременно е мощен, ефективен и способен да работи с огромни обеми текст в една заявка.

Архитектура на Jamba в детайли

Jamba не просто редува слоеве на трансформер и Mamba. Тя използва внимателно проектирана блокова структура, при която всеки блок се състои от осем слоя.

Структура на един блок Jamba:

  • Един слой Трансформер: Този слой отговаря за „дълбокото" разбиране и сложните разсъждения. В него е вградена архитектурата Mixture-of-Experts (MoE).
  • Седем слоя Mamba: Тези слоеве следват слоя на трансформера и отговарят за ефективната обработка на последователността и „провличането" на информацията през дълъг контекст[2].

Тази асиметрична структура позволява на модела ефективно да управлява изчислителните ресурси: тежките, но мощни операции на трансформера се изпълняват по-рядко, докато леките и бързи операции на Mamba се изпълняват по-често.

Интеграция на Mixture-of-Experts (MoE)

В Jamba се използва архитектурата MoE за допълнително повишаване на ефективността.

  • MoE се прилага само към напълно свързаните блокове (FFN) вътре в слоевете-трансформери[3]. Слоевете Mamba остават плътни.
  • В първия модел Jamba имаше 16 експерта.
  • За всеки token мрежата-маршрутизатор избира 2-та най-добри експерта (Top-2 gating).

Това означава, че въпреки че общият брой параметри на модела е голям (52 млрд.), на всяка стъпка от обработката на token в слоя-трансформер са активни само 2 от 16-те експерта, което прави изчисленията много бързи.

Еволюция на моделите Jamba

Jamba-v0.1 (март 2024)

Първият модел, представен в рамките на това семейство, притежава следните характеристики:

Технически характеристики на Jamba-v0.1
Характеристика Стойност
Общ брой параметри 52 милиарда
Активни параметри ~12 милиарда
Брой експерти (MoE) 16 (2 активни)
Контекстен прозорец 256 000 токена
Лиценз Apache 2.0[4]

Благодарение на хибридната си архитектура, Jamba-1 е способна да обработва контекст с дължина 256 000 токена, което е еквивалентно на приблизително 400-странична книга, и може да бъде разгърната на един потребителски GPU с 80 ГБ памет[5].

Jamba-1.5 (2024)

През 2024 г. AI21 Labs представи обновеното семейство модели Jamba 1.5, включващо две версии: Jamba 1.5 Mini (12B активни параметри от общо 52B) и Jamba 1.5 Large (94B активни параметри от общо 398B)[6]. Тези модели демонстрират съществени подобрения в производителността:

  • До 2.5 пъти по-бързо извеждане при дълги контексти в сравнение с конкурентите.
  • Поддръжка на девет езика, включително английски, испански, френски и арабски[7].

Ключови предимства и производителност

  • Огромен контекстен прозорец: 256 000 токена — един от най-големите прозорци сред всички налични (включително и проприетарни) модели към момента на пускането й. Това прави Jamba идеална за задачи, изискващи анализ на големи документи: юридически договори, научни трудове, цели кодови бази или дълги диалози.
  • Висока производителност и ефективност: При тестове Jamba демонстрира производителност, съпоставима или превъзхождаща водещите отворени модели с аналогичен размер, като Llama и Mixtral, като същевременно показва 3 пъти по-висока пропускателна способност при дълги контексти[8].
  • Откритост и достъпност: Jamba се разпространява под разрешителния лиценз Apache 2.0, което позволява свободното й използване за търговски и изследователски цели. Теглата на модела са достъпни на платформата Hugging Face.

Резултати на benchmark-ове

Jamba 1.5 показва конкурентоспособни резултати на различни benchmark-ове[9]:

  • Jamba 1.5 Mini получи 46.1 точки в Arena Hard, което я прави водещ публичен модел в своята категория[10].
  • Jamba 1.5 Large получи 65.4 точки в Arena Hard, превъзхождайки Llama 3.1 70B и 405B.

Приложение и достъпност

Jamba е оптимизирана за бизнес приложения и поддържа възможности като извикване на функции, структурирано извеждане в JSON и обработка на документи. Моделът е достъпен на множество платформи, включително:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

За поддръжка на икономически ефективно извеждане AI21 Labs представи ExpertsInt8 — нова техника за квантизация, позволяваща разполагането на Jamba 1.5 Large на машина с 8 GPU по 80GB без загуба на качество при обработка на контекст от 256K токена[11].

Литература

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

Бележки

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]