DBRX (modèle de langage)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX est un grand modèle de langage (LLM) open source développé par l'équipe de recherche Mosaic AI de l'entreprise Databricks. Le modèle a été officiellement publié le 27 mars 2024 et est présenté comme une solution de haute performance pour un usage en entreprise[1].

DBRX est basé sur une architecture à granularité fine de mélange d'experts (MoE) et combine haute performance avec efficacité lors de l'entraînement et de l'inférence. Au moment de sa sortie, DBRX a montré des résultats supérieurs à tous les autres modèles ouverts sur les principaux benchmarks, dépassant des modèles tels que LLaMA 2, Mixtral et Grok-1, et se montrant compétitif face à des modèles fermés du niveau de GPT-3.5 Turbo[2].

Historique du développement

L'arrivée de DBRX s'inscrit dans la continuité de la stratégie de Databricks visant à développer des modèles génératifs ouverts. En juin 2023, Databricks a acquis la startup MosaicML, spécialisée dans l'entraînement de grands modèles, et a créé sur cette base la division Mosaic AI[3].

L'équipe de Mosaic AI, dirigée par l'architecte en chef des réseaux neuronaux Jonathan Frankle, a entrepris le développement d'un nouveau grand LLM dans le but d'atteindre une qualité comparable aux meilleurs systèmes propriétaires, mais dans un format ouvert. Le projet a été baptisé DBRX. Le développement et le pré-entraînement du modèle ont duré environ 2,5 mois et ont coûté, selon les estimations, environ 10 millions de dollars[3].

Architecture

DBRX est un modèle de type transformeur décodeur-seul (decoder-only) et met en œuvre une architecture à granularité fine (fine-grained) de mélange d'experts (MoE).

Principales caractéristiques de l'architecture :

  • Nombre total de paramètres : 132 milliards.
  • Experts : Le modèle se compose de 16 sous-modèles spécialisés plus petits (les « experts »).
  • Mécanisme d'activation : Pour chaque token d'entrée, seuls 4 des 16 experts sont activés. Cela signifie que lors de l'inférence, seuls 36 milliards de paramètres sont actifs, ce qui garantit une vitesse et une efficacité élevées. Ce schéma offre 65 fois plus de combinaisons d'experts possibles par rapport au modèle Mixtral (8 experts avec 2 activés)[1].
  • Composants : Des solutions architecturales modernes sont utilisées, telles que les encastrements de position rotatifs (RoPE), les gated linear units (GLU) et l'attention à requêtes groupées (grouped query attention ou GQA).
  • Longueur du contexte : 32 768 tokens.

Cette architecture permet au modèle de combiner les avantages d'un très grand nombre de paramètres (pour le stockage des connaissances) avec l'efficacité de modèles plus petits (pour la vitesse d'inférence).

Entraînement

Le pré-entraînement de DBRX a été réalisé sur un jeu de données (dataset) soigneusement sélectionné de 12 billions de tokens, composé de textes et de code. La qualité des données était une priorité essentielle : les développeurs ont utilisé la plateforme cloud de Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) pour le nettoyage, la préparation et l'audit des données[1].

Lors de l'entraînement, la méthode d'apprentissage curriculaire (curriculum learning) a été utilisée, où la proportion des types de données a été modifiée à différentes étapes. Par exemple, la partie finale de l'entraînement a été consacrée à l'introduction progressive de tâches complexes, ce qui, selon les développeurs, a permis une amélioration notable de la qualité. L'entraînement a été mené sur un cluster de 3072 GPU Nvidia H100.

Après le pré-entraînement, le modèle de base a subi un ajustement fin supplémentaire (instruction tuning) pour créer la version interactive DBRX Instruct, optimisée pour l'exécution des instructions de l'utilisateur.

Performance

Au moment de sa sortie, DBRX a établi un nouveau standard de qualité pour les LLM ouverts sur un large éventail de benchmarks.

Comparaison avec les modèles ouverts

Résultats de DBRX Instruct sur les principaux benchmarks[1]
Benchmark Tâche DBRX Instruct Meilleur suivant (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) Connaissances générales 74,5 % 72,7 % (Mixtral Instruct)
HumanEval Programmation 70,1 % 63,2 % (Grok-1)
GSM8K Raisonnement mathématique 66,9 % 62,9 % (Grok-1)
MMLU Connaissances générales 73,7 % 71,5 % (Mixtral Instruct)

DBRX a pris la première place tant dans le classement général du Hugging Face Open LLM Leaderboard que dans le test complet Databricks LLM Gauntlet, montrant une avance significative sur ses prédécesseurs[1].

Comparaison avec les modèles fermés

DBRX Instruct surpasse GPT-3.5 Turbo sur plusieurs indicateurs clés, notamment MMLU (73,7 % contre 70,0 %) et HumanEval (70,1 % contre 48,1 %). En termes de qualité des réponses sur certains benchmarks (par exemple, MTBench), le modèle se rapproche du niveau de Gemini 1.0 Pro et des premières versions de GPT-4[1].

Efficacité de l'entraînement et de l'inférence

  • Efficacité de l'entraînement : L'utilisation de l'architecture MoE a permis de réduire les coûts en FLOPS de 2 à 4 fois par rapport à des modèles denses de qualité comparable.
  • Efficacité de l'inférence : Grâce à l'activation de seulement 36 milliards de paramètres, DBRX offre un débit (vitesse d'inférence) 2 à 3 fois supérieur à celui de modèles denses de taille équivalente (par exemple, LLaMA2-70B)[1].

Licence et disponibilité

DBRX est distribué sous une licence spécialement conçue, la Databricks Open Model License. Elle autorise l'utilisation et la modification libres, y compris à des fins commerciales, mais comporte certaines restrictions. Notamment, comme la licence de LLaMA 2, elle exige l'obtention d'une autorisation distincte de Databricks si les services basés sur DBRX sont utilisés par une audience de plus de 700 millions d'utilisateurs actifs par mois.

Les poids pré-entraînés du modèle (versions de base et Instruct) sont disponibles au téléchargement via le dépôt sur Hugging Face[4].

Bibliographie

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

Références

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
  4. «databricks/dbrx-base». Hugging Face. [4]