---
title: "DBRX (language model) (SV)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(SV)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 1404
wiki_created_at: 2026-09-06T22:48:11Z
wiki_modified_at: 2026-09-06T22:48:11Z
downloaded_at: 2026-09-07T22:45:53Z
---

# DBRX (language model) (SV)

**DBRX** — är en öppen stor språkmodell (LLM), utvecklad av forskningsteamet Mosaic AI inom företaget Databricks. Modellen lanserades officiellt den 27 mars 2024 och positioneras som en högpresterande lösning för företagsanvändning<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.

DBRX är byggd på en finkorning arkitektur med **Mixture of Experts (MoE)** och kombinerar hög prestanda med effektivitet i träning och inferens. Vid lanseringen uppvisade DBRX de bästa resultaten bland alla öppna modeller på viktiga benchmark, och överträffade modeller som LLaMA 2, Mixtral och Grok-1, samt visade konkurrenskraft med slutna modeller på GPT-3.5 Turbo-nivå<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-infoworld_dbrx-2)</sup>.

## Utvecklingshistoria

Tillkomsten av DBRX var en fortsättning på Databricks strategi för att utveckla öppna generativa modeller. I juni 2023 förvärvade Databricks startupföretaget **MosaicML**, som specialiserade sig på träning av stora modeller, och på dess grund skapades divisionen **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-techcrunch_dbrx_10m-3)</sup>.

Teamet Mosaic AI, lett av den ledande nätverksarkitekten Jonathan Frankle, inledde utvecklingen av en ny stor LLM med målet att uppnå kvalitet i nivå med de bästa proprietära systemen, men i ett öppet format. Projektet fick namnet DBRX. Utveckling och förträning av modellen tog ungefär 2,5 månader och beräknades kosta omkring **10 miljoner USD**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Arkitektur

DBRX är en transformer-modell av typen **decoder-only** (*decoder-only*) och implementerar en finkorning (*fine-grained*) Mixture of Experts-arkitektur (MoE).

Viktigaste arkitekturella egenskaper:

- **Totalt antal parametrar**: 132 miljarder.
- **Experter**: Modellen består av **16** små specialiserade delmodeller ("experter").
- **Aktiveringsmekanism**: För varje inmatat token aktiveras endast **4** av de 16 experterna. Det innebär att vid inferens är endast **36 miljarder** parametrar aktiva, vilket ger hög hastighet och effektivitet. Detta schema ger 65 gånger fler möjliga expertkombinationer jämfört med Mixtral-modellen (8 experter med aktivering av 2)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.
- **Komponenter**: Moderna arkitekturlösningar används, såsom roterande positionella embedding (**RoPE**), *gated linear units* (**GLU**) och *grouped query attention* (**GQA**).
- **Kontextlängd**: 32 768 token.

Denna arkitektur gör det möjligt för modellen att kombinera fördelarna med ett enormt antal parametrar (för kunskapslagring) med effektiviteten hos mindre modeller (för inferenshastighet).

## Träning

Förträningen av DBRX genomfördes på ett noggrant kurerat dataset med en volym av **12 biljoner** token, bestående av texter och kod. Datakvaliteten var en central prioritet: utvecklarna använde Databricks molnplattform (Apache Spark, Databricks Notebooks, Unity Catalog) för rensning, förberedelse och granskning av data<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.

Vid träningen tillämpades metoden **curriculum learning** (*curriculum learning*), där proportionen av datatyper varierades i olika faser. Exempelvis ägnades den avslutande delen av träningen åt gradvis introduktion av svåra uppgifter, vilket enligt utvecklarna gav en märkbar kvalitetsförbättring. Träningen genomfördes på ett kluster med **3 072** Nvidia H100 GPU.

Efter förträningen genomgick basmodellen ytterligare finjustering (*instruction tuning*) för att skapa den interaktiva versionen **DBRX Instruct**, optimerad för att följa användarinstruktioner.

## Prestanda

Vid lanseringen satte DBRX en ny kvalitetsstandard för öppna LLM på ett brett spektrum av benchmark.

### Jämförelse med öppna modeller

| Benchmark                                   | Uppgift                | DBRX Instruct | Näst bäst (Mixtral/Grok-1) |
|---------------------------------------------|------------------------|---------------|----------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Allmänna kunskaper     | 74,5%         | 72,7% (Mixtral Instruct)   |
| **HumanEval**                               | Programmering          | 70,1%         | 63,2% (Grok-1)             |
| **GSM8K**                                   | Matematiskt resonemang | 66,9%         | 62,9% (Grok-1)             |
| **MMLU**                                    | Allmänna kunskaper     | 73,7%         | 71,5% (Mixtral Instruct)   |

Resultat för DBRX Instruct på viktiga benchmark<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>

DBRX intog förstaplatsen både i den övergripande rankningen på **Hugging Face Open LLM Leaderboard** och i det sammansatta testet **Databricks LLM Gauntlet**, och visade ett betydande försprång gentemot föregångarna<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.

### Jämförelse med slutna modeller

DBRX Instruct överträffar **GPT-3.5 Turbo** på ett antal viktiga mätvärden, inklusive MMLU (73,7% mot 70,0%) och HumanEval (70,1% mot 48,1%). Vad gäller svarskvalitet på vissa benchmark (exempelvis MTBench) närmar sig modellen nivån för **Gemini 1.0 Pro** och tidiga versioner av **GPT-4**<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.

## Tränings- och inferenseffektivitet

- **Träningseffektivitet**: Användningen av MoE-arkitekturen möjliggjorde en minskning av FLOPS-kostnader med 2–4 gånger jämfört med täta modeller av motsvarande kvalitet.
- **Inferenseffektivitet**: Tack vare att endast 36 miljarder parametrar aktiveras ger DBRX **2–3 gånger** högre genomströmning (inferenshastighet) jämfört med täta modeller av motsvarande storlek (exempelvis LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-dbrx_blog-1)</sup>.

## Licensiering och tillgänglighet

DBRX distribueras under den särskilt framtagna licensen **Databricks Open Model License**. Den tillåter fri användning och modifiering, inklusive kommersiell tillämpning, men innehåller ett antal begränsningar. I synnerhet kräver den, liksom LLaMA 2-licensen, att ett separat tillstånd inhämtas från Databricks om tjänster baserade på DBRX används av en publik som överstiger **700 miljoner** aktiva användare per månad.

Förtränade modellvikter (för basversionen och Instruct-versionen) är tillgängliga för nedladdning via ett arkiv på Hugging Face<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_note-huggingface_dbrx-4)</sup>.

## Litteratur

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## Noter

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(SV)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
