---
title: "DBRX (modelo de linguagem)"
source: "https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)"
wiki: "systems-analysis.info/int"
article: "DBRX_(modelo_de_linguagem)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 1414
wiki_created_at: 2026-09-06T22:48:23Z
wiki_modified_at: 2026-09-06T22:48:23Z
downloaded_at: 2026-09-07T22:45:58Z
---

# DBRX (modelo de linguagem)

**DBRX** é um grande modelo de linguagem (LLM) aberto, desenvolvido pela equipe de pesquisa Mosaic AI da empresa Databricks. O modelo foi lançado oficialmente em 27 de março de 2024 e é posicionado como uma solução de alto desempenho para uso corporativo<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.

O DBRX é construído sobre uma arquitetura de **mistura de especialistas (MoE)** de granularidade fina e combina alto desempenho com eficiência de treinamento e inferência. No momento de seu lançamento, o DBRX demonstrou os melhores resultados entre todos os modelos abertos nos principais benchmarks, superando modelos como LLaMA 2, Mixtral e Grok-1, e mostrando-se competitivo com modelos fechados do nível do GPT-3.5 Turbo<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-infoworld_dbrx-2)</sup>.

## Histórico de Desenvolvimento

O surgimento do DBRX foi uma continuação da estratégia da Databricks de desenvolver modelos generativos abertos. Em junho de 2023, a Databricks adquiriu a startup **MosaicML**, especializada no treinamento de grandes modelos, e, com base nela, foi criada a divisão **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-techcrunch_dbrx_10m-3)</sup>.

A equipe da Mosaic AI, liderada pelo arquiteto-chefe de redes neurais Jonathan Frankle, iniciou o desenvolvimento de um novo grande LLM com o objetivo de alcançar uma qualidade comparável aos melhores sistemas proprietários, mas em formato aberto. O projeto foi nomeado DBRX. O desenvolvimento e o pré-treinamento do modelo levaram cerca de 2,5 meses e, segundo estimativas, custaram aproximadamente **\$10 milhões**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Arquitetura

O DBRX é um modelo transformer do tipo **somente decodificador** (*decoder-only*) e implementa uma arquitetura de mistura de especialistas (MoE) de granularidade fina (*fine-grained*).

Principais características da arquitetura:

- **Número total de parâmetros**: 132 bilhões.
- **Especialistas**: O modelo é composto por **16** pequenos submodelos especializados ("especialistas").
- **Mecanismo de ativação**: Para cada token de entrada, apenas **4** dos 16 especialistas são ativados. Isso significa que, durante a inferência, apenas **36 bilhões** de parâmetros estão ativos, o que garante alta velocidade e eficiência. Esse esquema oferece 65 vezes mais combinações possíveis de especialistas em comparação com o modelo Mixtral (8 especialistas com ativação de 2)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.
- **Componentes**: São utilizadas soluções arquitetônicas modernas, como embeddings de posição rotacional (**RoPE**), *gated linear units* (**GLU**) e *grouped query attention* (**GQA**).
- **Comprimento do contexto**: 32.768 tokens.

Essa arquitetura permite que o modelo combine as vantagens de um número enorme de parâmetros (para armazenamento de conhecimento) com a eficiência de modelos menores (para velocidade de inferência).

## Treinamento

O pré-treinamento do DBRX foi realizado em um conjunto de dados cuidadosamente curado de **12 trilhões** de tokens, composto por textos e código. A qualidade dos dados foi uma prioridade fundamental: os desenvolvedores utilizaram a plataforma em nuvem da Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) para limpar, preparar e auditar os dados<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.

Durante o treinamento, foi aplicado o método de **aprendizagem curricular** (*curriculum learning*), no qual a proporção dos tipos de dados foi alterada em diferentes estágios. Por exemplo, a parte final do treinamento foi dedicada à introdução gradual de tarefas complexas, o que, segundo os desenvolvedores, resultou em um aumento significativo na qualidade. O treinamento foi realizado em um cluster de **3.072** GPUs Nvidia H100.

Após o pré-treinamento, o modelo base passou por um ajuste fino adicional (*instruction tuning*) para criar a versão interativa **DBRX Instruct**, otimizada para seguir as instruções do usuário.

## Desempenho

No momento de seu lançamento, o DBRX estabeleceu um novo padrão de qualidade para LLMs abertos em uma ampla gama de benchmarks.

### Comparação com modelos abertos

| Benchmark                                   | Tarefa                | DBRX Instruct | Próximo melhor (Mixtral/Grok-1) |
|---------------------------------------------|-----------------------|---------------|---------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Conhecimento geral    | 74,5%         | 72,7% (Mixtral Instruct)        |
| **HumanEval**                               | Programação           | 70,1%         | 63,2% (Grok-1)                  |
| **GSM8K**                                   | Raciocínio matemático | 66,9%         | 62,9% (Grok-1)                  |
| **MMLU**                                    | Conhecimento geral    | 73,7%         | 71,5% (Mixtral Instruct)        |

Resultados do DBRX Instruct nos principais benchmarks<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>

O DBRX conquistou o primeiro lugar tanto no ranking geral do **Hugging Face Open LLM Leaderboard** quanto no teste abrangente **Databricks LLM Gauntlet**, demonstrando uma vantagem significativa sobre seus predecessores<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.

### Comparação com modelos fechados

O DBRX Instruct supera o **GPT-3.5 Turbo** em vários indicadores-chave, incluindo MMLU (73,7% contra 70,0%) e HumanEval (70,1% contra 48,1%). Em termos de qualidade de resposta em alguns benchmarks (por exemplo, MTBench), o modelo se aproxima do nível do **Gemini 1.0 Pro** e das primeiras versões do **GPT-4**<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.

## Eficiência de Treinamento e Inferência

- **Eficiência de treinamento**: O uso da arquitetura MoE permitiu reduzir os custos em FLOPS de 2 a 4 vezes em comparação com modelos densos de qualidade similar.
- **Eficiência de inferência**: Ao ativar apenas 36 bilhões de parâmetros, o DBRX oferece uma taxa de transferência (velocidade de inferência) **2 a 3 vezes** maior em comparação com modelos densos de tamanho equivalente (por exemplo, LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-dbrx_blog-1)</sup>.

## Licenciamento e Disponibilidade

O DBRX é distribuído sob uma licença especialmente desenvolvida, a **Databricks Open Model License**. Ela permite o uso e a modificação livres, incluindo para fins comerciais, mas contém algumas restrições. Em particular, assim como a licença do LLaMA 2, ela exige uma permissão separada da Databricks se os serviços baseados no DBRX forem utilizados por uma audiência superior a **700 milhões** de usuários ativos mensais.

Os pesos pré-treinados do modelo (versões base e Instruct) estão disponíveis para download no repositório do Hugging Face<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_note-huggingface_dbrx-4)</sup>.

## Literatura

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external text" rel="nofollow">Databricks Blog</a>.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. <a href="https://www.databricks.com/legal/open-model-license" class="external text" rel="nofollow">Online specification</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. <a href="https://arxiv.org/abs/2307.08691" class="external text" rel="nofollow">arXiv:2307.08691</a>.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. <a href="https://arxiv.org/abs/2402.07871" class="external text" rel="nofollow">arXiv:2402.07871</a>.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. <a href="https://arxiv.org/abs/2405.07490" class="external text" rel="nofollow">arXiv:2405.07490</a>.

## Notas

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-dbrx_blog_1-6)</sup> “Introducing DBRX: A New State-of-the-Art Open LLM”. *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-infoworld_dbrx_2-0) “Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok”. *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> “Databricks spent \$10M on new DBRX generative AI model”. *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(modelo_de_linguagem)#cite_ref-huggingface_dbrx_4-0) “databricks/dbrx-base”. *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
