---
title: "Jamba (modelo de linguagem)"
source: "https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)"
wiki: "systems-analysis.info/int"
article: "Jamba_(modelo_de_linguagem)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 3364
wiki_created_at: 2026-09-06T23:19:34Z
wiki_modified_at: 2026-09-06T23:19:34Z
downloaded_at: 2026-09-07T22:56:34Z
---

# Jamba (modelo de linguagem)

**Jamba** é uma família de grandes modelos de linguagem (LLM) desenvolvida pela empresa de pesquisa israelense AI21 Labs. Jamba apresenta a primeira **arquitetura híbrida** do seu tipo, que combina elementos-chave de duas abordagens dominantes no desenvolvimento de IA: Transformers e Modelos de Espaço de Estados (State Space Models, SSM), em particular, a arquitetura Mamba<sup>[\[1\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-ai21-announcement-1)</sup>.

O principal objetivo do Jamba é resolver o compromisso fundamental dos LLMs modernos: alta qualidade e desempenho (característicos dos Transformers) versus eficiência e a capacidade de processar contextos ultralongos (característicos dos SSMs). Ao combinar essas abordagens e adicionar esparsidade por meio de Mixture-of-Experts (MoE), o Jamba oferece um modelo que é simultaneamente poderoso, eficiente e capaz de trabalhar com enormes volumes de texto em uma única requisição.

## Arquitetura do Jamba em detalhes

O Jamba não apenas alterna camadas de Transformer e Mamba. Ele utiliza uma **estrutura em blocos** cuidadosamente projetada, onde cada bloco consiste em oito camadas.

Estrutura de um bloco do Jamba:

- **Uma camada de Transformer:** Esta camada é responsável pela compreensão "profunda" e raciocínios complexos. A arquitetura **Mixture-of-Experts (MoE)** está embutida nesta camada.
- **Sete camadas de Mamba:** Essas camadas seguem a camada de Transformer e são responsáveis pelo processamento eficiente da sequência e pela "propagação" da informação através de um longo contexto<sup>[\[2\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-arxiv-jamba-2)</sup>.

Essa estrutura assimétrica permite que o modelo gerencie eficientemente os recursos computacionais: as operações pesadas, mas poderosas, do Transformer são executadas com menos frequência, enquanto as operações leves e rápidas do Mamba são executadas com mais frequência.

### Integração de Mixture-of-Experts (MoE)

No Jamba, a arquitetura MoE é utilizada para aumentar ainda mais a eficiência.

- O MoE é aplicado **apenas aos blocos totalmente conectados (FFN) dentro das camadas de Transformer**<sup>[\[3\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-transformers-doc-jamba-3)</sup>. As camadas Mamba permanecem densas.
- No primeiro modelo Jamba, havia **16 especialistas** (experts).
- Para cada token, uma rede de roteamento seleciona os **2 melhores especialistas** (gating Top-2).

Isso significa que, embora o número total de parâmetros do modelo seja grande (52 bilhões), em cada etapa do processamento de um token na camada de Transformer, apenas 2 dos 16 especialistas estão ativos, o que torna os cálculos muito rápidos.

## Evolução dos modelos Jamba

### Jamba-v0.1 (março de 2024)

O primeiro modelo apresentado nesta família tem as seguintes características:

| Característica                    | Valor                                                                                                                 |
|-----------------------------------|-----------------------------------------------------------------------------------------------------------------------|
| **Número total de parâmetros**    | 52 bilhões                                                                                                            |
| **Parâmetros ativos**             | ~12 bilhões                                                                                                           |
| **Número de especialistas (MoE)** | 16 (2 ativos)                                                                                                         |
| **Janela de contexto**            | 256.000 tokens                                                                                                        |
| **Licença**                       | Apache 2.0<sup>[\[4\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-hf-jamba-v0.1-4)</sup> |

Especificações técnicas do Jamba-v0.1

Graças à sua arquitetura híbrida, o Jamba-1 é capaz de processar um contexto de 256.000 tokens, o que equivale a um romance de aproximadamente 400 páginas, e pode ser implantado em uma única GPU de consumo com 80 GB de memória<sup>[\[5\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-gradientflow-jamba-5)</sup>.

### Jamba-1.5 (2024)

Em 2024, a AI21 Labs apresentou a família de modelos Jamba 1.5 atualizada, incluindo duas versões: **Jamba 1.5 Mini** (12B de parâmetros ativos de um total de 52B) e **Jamba 1.5 Large** (94B de parâmetros ativos de um total de 398B)<sup>[\[6\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-jamba-1.5-family-6)</sup>. Esses modelos demonstram melhorias significativas de desempenho:

- Inferência até 2,5 vezes mais rápida em contextos longos em comparação com os concorrentes.
- Suporte para nove idiomas, incluindo inglês, espanhol, francês e árabe<sup>[\[7\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-hf-jamba-large-1.5-7)</sup>.

## Principais vantagens e desempenho

- **Janela de contexto enorme:** 256.000 tokens — uma das maiores janelas entre todos os modelos disponíveis (incluindo proprietários) no momento de seu lançamento. Isso torna o Jamba ideal para tarefas que exigem a análise de grandes documentos, como contratos jurídicos, artigos científicos, bases de código inteiras ou longos diálogos.
- **Alto desempenho e eficiência:** Nos testes, o Jamba demonstra um desempenho comparável ou superior aos principais modelos de código aberto de tamanho semelhante, como Llama e Mixtral, ao mesmo tempo em que apresenta uma **taxa de transferência 3 vezes maior** em contextos longos<sup>[\[8\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-itinai-jamba-8)</sup>.
- **Abertura e acessibilidade:** O Jamba é distribuído sob a licença permissiva Apache 2.0, o que permite seu uso livre para fins comerciais e de pesquisa. Os pesos do modelo estão disponíveis na plataforma Hugging Face.

### Resultados em benchmarks

O Jamba 1.5 apresenta resultados competitivos em vários benchmarks<sup>[\[9\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-dzen-jamba-9)</sup>:

- O **Jamba 1.5 Mini** alcançou 46.1 pontos no Arena Hard, tornando-se o modelo público líder em sua categoria<sup>[\[10\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-aws-jamba-1.5-bedrock-10)</sup>.
- O **Jamba 1.5 Large** alcançou 65.4 pontos no Arena Hard, superando o Llama 3.1 70B e 405B.

## Aplicação e disponibilidade

O Jamba é otimizado para aplicações de negócios e suporta recursos como chamada de função, saída estruturada em JSON e processamento de documentos. O modelo está disponível em várias plataformas, incluindo:

- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock<sup>[\[9\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-dzen-jamba-9)</sup>
- AI21 Studio

Para suportar uma inferência economicamente eficiente, a AI21 Labs introduziu o **ExpertsInt8** — uma nova técnica de quantização que permite hospedar o Jamba 1.5 Large em uma máquina com 8 GPUs de 80GB cada, sem perda de qualidade ao processar um contexto de 256K tokens<sup>[\[11\]](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_note-openreview-expertsint8-11)</sup>.

## Literatura

- Lieber, O.; et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Lieber, O.; et al. (2024). *Jamba‑1.5 Models and ExpertsInt8 Quantization*. <a href="https://openreview.net/pdf?id=JFPaD7lpBD" class="external text" rel="nofollow">OpenReview JFPaD7lpBD</a>.
- Gu, A.; Dao, T. (203). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Gu, A.; et al. (2021). *S4: Efficiently Modeling Long Sequences with Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external text" rel="nofollow">arXiv:2111.00396</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. <a href="https://arxiv.org/abs/2404.02852" class="external text" rel="nofollow">arXiv:2404.02852</a>.
- Liu, J.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Gupta, V.; et al. (2024). *Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection*. <a href="https://arxiv.org/abs/2411.08982" class="external text" rel="nofollow">arXiv:2411.08982</a>.
- Liu, J.; et al. (2024). *A Survey on Inference Optimization Techniques for Mixture of Experts Models*. <a href="https://arxiv.org/abs/2412.14219" class="external text" rel="nofollow">arXiv:2412.14219</a>.
- Hsieh, C.‑P.; et al. (2024). *RULER: What's the Real Context Size of Your Long‑Context Language Models?*. <a href="https://arxiv.org/abs/2404.06654" class="external text" rel="nofollow">arXiv:2404.06654</a>.

## Notas

1.  <span id="cite_note-ai21-announcement-1">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-ai21-announcement_1-0) “Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model”. *AI21 Labs Blog*. <a href="https://www.ai21.com/blog/announcing-jamba/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-jamba-2">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-arxiv-jamba_2-0) Lieber, O., et al. (2024). *Jamba: A Hybrid Transformer-Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.</span>
3.  <span id="cite_note-transformers-doc-jamba-3">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-transformers-doc-jamba_3-0) “Jamba Documentation”. *Hugging Face Transformers*. <a href="https://huggingface.co/docs/transformers/model_doc/jamba" class="external autonumber" rel="nofollow">[2]</a></span>
4.  <span id="cite_note-hf-jamba-v0.1-4">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-hf-jamba-v0.1_4-0) “ai21labs/Jamba-v0.1”. *Hugging Face*. <a href="https://huggingface.co/ai21labs/Jamba-v0.1" class="external autonumber" rel="nofollow">[3]</a></span>
5.  <span id="cite_note-gradientflow-jamba-5">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-gradientflow-jamba_5-0) “AI21 Labs' Jamba: A New Hybrid LLM Architecture”. *Gradient Flow*. <a href="https://gradientflow.com/ai21labs-jamba/" class="external autonumber" rel="nofollow">[4]</a></span>
6.  <span id="cite_note-jamba-1.5-family-6">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-jamba-1.5-family_6-0) “Announcing the Jamba-1.5 model family”. *AI21 Labs Blog*. <a href="https://www.ai21.com/blog/announcing-jamba-model-family/" class="external autonumber" rel="nofollow">[5]</a></span>
7.  <span id="cite_note-hf-jamba-large-1.5-7">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-hf-jamba-large-1.5_7-0) “ai21labs/AI21-Jamba-Large-1.5”. *Hugging Face*. <a href="https://huggingface.co/ai21labs/AI21-Jamba-Large-1.5" class="external autonumber" rel="nofollow">[6]</a></span>
8.  <span id="cite_note-itinai-jamba-8">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-itinai-jamba_8-0) “AI21 Labs quebra novas barreiras com o Jamba”. *ITinAI*. <a href="https://itinai.ru/ai21-labs-разбивает-новые-барьеры-с-помощью-jamba/" class="external autonumber" rel="nofollow">[7]</a></span>
9.  <span id="cite_note-dzen-jamba-9">↑ <sup>[9.0](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-dzen-jamba_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-dzen-jamba_9-1)</sup> “Lançamento do Jamba 1.5: modelo híbrido da AI21 Labs”. *Dzen*. <a href="https://dzen.ru/b/ZshehqcyHXQEtm7n" class="external autonumber" rel="nofollow">[8]</a></span>
10. <span id="cite_note-aws-jamba-1.5-bedrock-10">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-aws-jamba-1.5-bedrock_10-0) “Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock”. *AWS What's New*. <a href="https://aws.amazon.com/about-aws/whats-new/2024/09/jamba-1-5-family-models-amazon-bedrock/?nc1=h_ls" class="external autonumber" rel="nofollow">[9]</a></span>
11. <span id="cite_note-openreview-expertsint8-11">[↑](https://systems-analysis.info/int/Jamba_(modelo_de_linguagem)#cite_ref-openreview-expertsint8_11-0) “ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs”. *OpenReview*. <a href="https://openreview.net/forum?id=JFPaD7lpBD" class="external autonumber" rel="nofollow">[10]</a></span>
