DBRX (language model) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — is een open groot taalmodel (LLM), ontwikkeld door het onderzoeksteam Mosaic AI binnen het bedrijf Databricks. Het model werd officieel uitgebracht op 27 maart 2024 en wordt gepositioneerd als een hoogwaardige oplossing voor zakelijk gebruik[1].

DBRX is gebouwd op een fijnkorrelige Mixture of Experts (MoE)-architectuur en combineert hoge prestaties met efficiëntie bij training en inferentie. Op het moment van uitbrengen behaalde DBRX de beste resultaten onder alle open modellen op de belangrijkste benchmarks, waarbij het modellen als LLaMA 2, Mixtral en Grok-1 overtrof en concurrerend bleek met gesloten modellen op het niveau van GPT-3.5 Turbo[2].

Geschiedenis van de ontwikkeling

Het verschijnen van DBRX was een voortzetting van de strategie van Databricks om open generatieve modellen te ontwikkelen. In juni 2023 nam Databricks de startup MosaicML over, gespecialiseerd in het trainen van grote modellen, en op basis daarvan werd de divisie Mosaic AI opgericht[3].

Het team van Mosaic AI, geleid door hoofdarchitect voor neurale netwerken Jonathan Frankle, begon met de ontwikkeling van een nieuw groot LLM met als doel kwaliteit te bereiken die vergelijkbaar is met de beste propriëtaire systemen, maar dan in open formaat. Het project kreeg de naam DBRX. De ontwikkeling en voorafgaande training van het model duurden ongeveer 2,5 maanden en kostten naar schatting circa $10 miljoen[3].

Architectuur

DBRX is een transformer-model van het type decoder-only (decoder-only) en implementeert een fijnkorrelige (fine-grained) Mixture of Experts (MoE)-architectuur.

Belangrijkste kenmerken van de architectuur:

  • Totaal aantal parameters: 132 miljard.
  • Experts: Het model bestaat uit 16 kleine gespecialiseerde submodellen ("experts").
  • Activatiemechanisme: Voor elke inkomende token worden slechts 4 van de 16 experts geactiveerd. Dit betekent dat tijdens inferentie slechts 36 miljard parameters actief zijn, wat zorgt voor hoge snelheid en efficiëntie. Dit schema biedt 65 keer meer mogelijke combinaties van experts vergeleken met het model Mixtral (8 experts met activatie van 2)[1].
  • Componenten: Er worden moderne architectuuroplossingen gebruikt, zoals roterende positionele embeddings (RoPE), gated linear units (GLU) en grouped query attention (GQA).
  • Contextlengte: 32.768 tokens.

Deze architectuur stelt het model in staat de voordelen van een enorm aantal parameters (voor kennisopslag) te combineren met de efficiëntie van kleinere modellen (voor inferentiesnelheid).

Training

De voorafgaande training van DBRX werd uitgevoerd op een zorgvuldig samengestelde dataset van 12 biljoen tokens, bestaande uit teksten en code. De kwaliteit van de data was de belangrijkste prioriteit: de ontwikkelaars gebruikten het cloudplatform van Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) voor het opschonen, voorbereiden en auditeren van de data[1].

Tijdens de training werd de methode van curriculum learning toegepast, waarbij in verschillende fasen de verhouding van datatypes werd aangepast. Zo was het laatste deel van de training gewijd aan het gedoseerd introduceren van complexe taken, wat volgens de ontwikkelaars een merkbare kwaliteitsverbetering opleverde. De training werd uitgevoerd op een cluster van 3072 Nvidia H100 GPU's.

Na de voorafgaande training onderging het basismodel aanvullende fine-tuning (instruction tuning) voor het creëren van de interactieve versie DBRX Instruct, geoptimaliseerd voor het uitvoeren van gebruikersinstructies.

Prestaties

Op het moment van uitbrengen stelde DBRX een nieuwe kwaliteitsstandaard voor open LLM's op een breed scala aan benchmarks.

Vergelijking met open modellen

Resultaten van DBRX Instruct op de belangrijkste benchmarks[1]
Benchmark Taak DBRX Instruct Eerstvolgende beste (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) Algemene kennis 74,5% 72,7% (Mixtral Instruct)
HumanEval Programmeren 70,1% 63,2% (Grok-1)
GSM8K Wiskundig redeneren 66,9% 62,9% (Grok-1)
MMLU Algemene kennis 73,7% 71,5% (Mixtral Instruct)

DBRX behaalde de eerste plaats zowel in de algemene ranglijst van de Hugging Face Open LLM Leaderboard als in de uitgebreide test Databricks LLM Gauntlet, waarbij het een aanzienlijke voorsprong op de voorgangers liet zien[1].

Vergelijking met gesloten modellen

DBRX Instruct overtreft GPT-3.5 Turbo op een aantal belangrijke indicatoren, waaronder MMLU (73,7% versus 70,0%) en HumanEval (70,1% versus 48,1%). Wat betreft de kwaliteit van antwoorden op bepaalde benchmarks (bijvoorbeeld MTBench) benadert het model het niveau van Gemini 1.0 Pro en vroege versies van GPT-4[1].

Efficiëntie van training en inferentie

  • Trainingsefficiëntie: Het gebruik van de MoE-architectuur maakte het mogelijk de kosten in FLOPS met een factor 2 tot 4 te verlagen in vergelijking met dense modellen van vergelijkbare kwaliteit.
  • Inferentie-efficiëntie: Dankzij de activatie van slechts 36 miljard parameters biedt DBRX een 2 tot 3 keer hogere doorvoer (inferentiesnelheid) vergeleken met dense modellen van een equivalente omvang (bijvoorbeeld LLaMA2-70B)[1].

Licentie en beschikbaarheid

DBRX wordt verspreid onder de speciaal ontwikkelde licentie Databricks Open Model License. Deze staat vrij gebruik en aanpassing toe, inclusief commerciële toepassingen, maar bevat een aantal beperkingen. In het bijzonder vereist deze licentie, net als de LLaMA 2-licentie, het verkrijgen van een aparte toestemming van Databricks als diensten op basis van DBRX worden gebruikt door een publiek van meer dan 700 miljoen actieve gebruikers per maand.

De voorgetrainde gewichten van het model (zowel de basisversie als de Instruct-versie) zijn beschikbaar voor download via de repository op Hugging Face[4].

Literatuur

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
  4. «databricks/dbrx-base». Hugging Face. [4]