---
title: "DBRX (modèle de langage)"
source: "https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)"
wiki: "systems-analysis.info/int"
article: "DBRX_(modèle_de_langage)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1415
wiki_created_at: 2026-09-06T22:48:24Z
wiki_modified_at: 2026-09-06T22:48:24Z
downloaded_at: 2026-09-07T22:45:58Z
---

# DBRX (modèle de langage)

**DBRX** est un grand modèle de langage (LLM) open source développé par l'équipe de recherche Mosaic AI de l'entreprise Databricks. Le modèle a été officiellement publié le 27 mars 2024 et est présenté comme une solution de haute performance pour un usage en entreprise<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.

DBRX est basé sur une architecture à granularité fine de **mélange d'experts (MoE)** et combine haute performance avec efficacité lors de l'entraînement et de l'inférence. Au moment de sa sortie, DBRX a montré des résultats supérieurs à tous les autres modèles ouverts sur les principaux benchmarks, dépassant des modèles tels que LLaMA 2, Mixtral et Grok-1, et se montrant compétitif face à des modèles fermés du niveau de GPT-3.5 Turbo<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-infoworld_dbrx-2)</sup>.

## Historique du développement

L'arrivée de DBRX s'inscrit dans la continuité de la stratégie de Databricks visant à développer des modèles génératifs ouverts. En juin 2023, Databricks a acquis la startup **MosaicML**, spécialisée dans l'entraînement de grands modèles, et a créé sur cette base la division **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-techcrunch_dbrx_10m-3)</sup>.

L'équipe de Mosaic AI, dirigée par l'architecte en chef des réseaux neuronaux Jonathan Frankle, a entrepris le développement d'un nouveau grand LLM dans le but d'atteindre une qualité comparable aux meilleurs systèmes propriétaires, mais dans un format ouvert. Le projet a été baptisé DBRX. Le développement et le pré-entraînement du modèle ont duré environ 2,5 mois et ont coûté, selon les estimations, environ **10 millions de dollars**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Architecture

DBRX est un modèle de type transformeur **décodeur-seul** (*decoder-only*) et met en œuvre une architecture à granularité fine (*fine-grained*) de mélange d'experts (MoE).

Principales caractéristiques de l'architecture :

- **Nombre total de paramètres** : 132 milliards.
- **Experts** : Le modèle se compose de **16** sous-modèles spécialisés plus petits (les « experts »).
- **Mécanisme d'activation** : Pour chaque token d'entrée, seuls **4** des 16 experts sont activés. Cela signifie que lors de l'inférence, seuls **36 milliards** de paramètres sont actifs, ce qui garantit une vitesse et une efficacité élevées. Ce schéma offre 65 fois plus de combinaisons d'experts possibles par rapport au modèle Mixtral (8 experts avec 2 activés)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.
- **Composants** : Des solutions architecturales modernes sont utilisées, telles que les encastrements de position rotatifs (**RoPE**), les *gated linear units* (**GLU**) et l'attention à requêtes groupées (*grouped query attention* ou **GQA**).
- **Longueur du contexte** : 32 768 tokens.

Cette architecture permet au modèle de combiner les avantages d'un très grand nombre de paramètres (pour le stockage des connaissances) avec l'efficacité de modèles plus petits (pour la vitesse d'inférence).

## Entraînement

Le pré-entraînement de DBRX a été réalisé sur un jeu de données (dataset) soigneusement sélectionné de **12 billions** de tokens, composé de textes et de code. La qualité des données était une priorité essentielle : les développeurs ont utilisé la plateforme cloud de Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) pour le nettoyage, la préparation et l'audit des données<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.

Lors de l'entraînement, la méthode d'**apprentissage curriculaire** (*curriculum learning*) a été utilisée, où la proportion des types de données a été modifiée à différentes étapes. Par exemple, la partie finale de l'entraînement a été consacrée à l'introduction progressive de tâches complexes, ce qui, selon les développeurs, a permis une amélioration notable de la qualité. L'entraînement a été mené sur un cluster de **3072** GPU Nvidia H100.

Après le pré-entraînement, le modèle de base a subi un ajustement fin supplémentaire (*instruction tuning*) pour créer la version interactive **DBRX Instruct**, optimisée pour l'exécution des instructions de l'utilisateur.

## Performance

Au moment de sa sortie, DBRX a établi un nouveau standard de qualité pour les LLM ouverts sur un large éventail de benchmarks.

### Comparaison avec les modèles ouverts

| Benchmark                                   | Tâche                     | DBRX Instruct | Meilleur suivant (Mixtral/Grok-1) |
|---------------------------------------------|---------------------------|---------------|-----------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Connaissances générales   | 74,5 %        | 72,7 % (Mixtral Instruct)         |
| **HumanEval**                               | Programmation             | 70,1 %        | 63,2 % (Grok-1)                   |
| **GSM8K**                                   | Raisonnement mathématique | 66,9 %        | 62,9 % (Grok-1)                   |
| **MMLU**                                    | Connaissances générales   | 73,7 %        | 71,5 % (Mixtral Instruct)         |

Résultats de DBRX Instruct sur les principaux benchmarks<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>

DBRX a pris la première place tant dans le classement général du **Hugging Face Open LLM Leaderboard** que dans le test complet **Databricks LLM Gauntlet**, montrant une avance significative sur ses prédécesseurs<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.

### Comparaison avec les modèles fermés

DBRX Instruct surpasse **GPT-3.5 Turbo** sur plusieurs indicateurs clés, notamment MMLU (73,7 % contre 70,0 %) et HumanEval (70,1 % contre 48,1 %). En termes de qualité des réponses sur certains benchmarks (par exemple, MTBench), le modèle se rapproche du niveau de **Gemini 1.0 Pro** et des premières versions de **GPT-4**<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.

## Efficacité de l'entraînement et de l'inférence

- **Efficacité de l'entraînement** : L'utilisation de l'architecture MoE a permis de réduire les coûts en FLOPS de 2 à 4 fois par rapport à des modèles denses de qualité comparable.
- **Efficacité de l'inférence** : Grâce à l'activation de seulement 36 milliards de paramètres, DBRX offre un débit (vitesse d'inférence) **2 à 3 fois** supérieur à celui de modèles denses de taille équivalente (par exemple, LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-dbrx_blog-1)</sup>.

## Licence et disponibilité

DBRX est distribué sous une licence spécialement conçue, la **Databricks Open Model License**. Elle autorise l'utilisation et la modification libres, y compris à des fins commerciales, mais comporte certaines restrictions. Notamment, comme la licence de LLaMA 2, elle exige l'obtention d'une autorisation distincte de Databricks si les services basés sur DBRX sont utilisés par une audience de plus de **700 millions** d'utilisateurs actifs par mois.

Les poids pré-entraînés du modèle (versions de base et Instruct) sont disponibles au téléchargement via le dépôt sur Hugging Face<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_note-huggingface_dbrx-4)</sup>.

## Bibliographie

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external text" rel="nofollow">Databricks Blog</a>.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. <a href="https://www.databricks.com/legal/open-model-license" class="external text" rel="nofollow">Online specification</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. <a href="https://arxiv.org/abs/2307.08691" class="external text" rel="nofollow">arXiv:2307.08691</a>.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. <a href="https://arxiv.org/abs/2402.07871" class="external text" rel="nofollow">arXiv:2402.07871</a>.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. <a href="https://arxiv.org/abs/2405.07490" class="external text" rel="nofollow">arXiv:2405.07490</a>.

## Références

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(mod%C3%A8le_de_langage)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
