---
title: "DBRX (language model) (PL)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(PL)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 1402
wiki_created_at: 2026-09-06T22:48:09Z
wiki_modified_at: 2026-09-06T22:48:09Z
downloaded_at: 2026-09-07T22:45:53Z
---

# DBRX (language model) (PL)

**DBRX** — to otwarty duży model językowy (LLM) opracowany przez zespół badawczy Mosaic AI wchodzący w skład firmy Databricks. Model został oficjalnie wydany 27 marca 2024 roku i jest pozycjonowany jako wysokowydajne rozwiązanie do zastosowań korporacyjnych<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.

DBRX zbudowany jest na drobnoziarniowej architekturze **mieszaniny ekspertów (MoE)** i łączy wysoką wydajność z efektywnością uczenia i inferencji. W momencie wydania DBRX osiągnął najlepsze wyniki spośród wszystkich otwartych modeli na kluczowych benchmarkach, przewyższając takie modele jak LLaMA 2, Mixtral i Grok-1, oraz wykazując konkurencyjność z zamkniętymi modelami na poziomie GPT-3.5 Turbo<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-infoworld_dbrx-2)</sup>.

## Historia rozwoju

Pojawienie się DBRX stanowiło kontynuację strategii Databricks w zakresie rozwijania otwartych modeli generatywnych. W czerwcu 2023 roku Databricks przejął startup **MosaicML**, specjalizujący się w uczeniu dużych modeli, i na jego bazie utworzono oddział **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-techcrunch_dbrx_10m-3)</sup>.

Zespół Mosaic AI, kierowany przez czołowego architekta sieci neuronowych Jonathana Frankle'a, przystąpił do opracowania nowego, dużego LLM w celu osiągnięcia jakości porównywalnej z najlepszymi systemami własnościowymi, lecz w otwartym formacie. Projekt otrzymał nazwę DBRX. Opracowanie i wstępne uczenie modelu zajęło około 2,5 miesiąca i według szacunków kosztowało około **10 mln USD**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Architektura

DBRX jest modelem transformerowym typu **tylko-dekoder** (*decoder-only*) i implementuje drobnoziarniową (*fine-grained*) architekturę mieszaniny ekspertów (MoE).

Kluczowe cechy architektury:

- **Łączna liczba parametrów**: 132 miliardy.
- **Eksperci**: Model składa się z **16** małych, wyspecjalizowanych podmodeli („ekspertów").
- **Mechanizm aktywacji**: Dla każdego wejściowego tokenu aktywowane są tylko **4** z 16 ekspertów. Oznacza to, że podczas inferencji aktywnych jest jedynie **36 mld** parametrów, co zapewnia wysoką prędkość i efektywność. Taki schemat daje 65 razy więcej możliwych kombinacji ekspertów w porównaniu z modelem Mixtral (8 ekspertów z aktywacją 2)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.
- **Komponenty**: Stosowane są nowoczesne rozwiązania architektoniczne, takie jak obrotowe osadzenia pozycyjne (**RoPE**), *gated linear units* (**GLU**) oraz *grouped query attention* (**GQA**).
- **Długość kontekstu**: 32 768 tokenów.

Taka architektura pozwala modelowi łączyć zalety ogromnej liczby parametrów (do przechowywania wiedzy) z efektywnością mniejszych modeli (pod względem szybkości wnioskowania).

## Uczenie

Wstępne uczenie DBRX przeprowadzono na starannie wyselekcjonowanym zbiorze danych (dataset) o objętości **12 bilionów** tokenów, złożonym z tekstów i kodu. Jakość danych była kluczowym priorytetem: twórcy wykorzystali platformę chmurową Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) do czyszczenia, przygotowania i audytu danych<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.

Podczas uczenia zastosowano metodę **uczenia według programu nauczania** (*curriculum learning*), w której na różnych etapach zmieniano proporcje typów danych. Na przykład końcowa faza treningu polegała na stopniowym wprowadzaniu trudnych zadań, co według twórców przyniosło odczuwalny wzrost jakości. Uczenie prowadzono na klastrze złożonym z **3072** procesorów graficznych Nvidia H100 GPU.

Po wstępnym uczeniu bazowy model przeszedł dodatkowe dostrajanie (*instruction tuning*) w celu stworzenia interaktywnej wersji **DBRX Instruct**, zoptymalizowanej pod kątem wykonywania instrukcji użytkownika.

## Wydajność

W momencie wydania DBRX ustanowił nowy standard jakości dla otwartych LLM na szerokim spektrum benchmarków.

### Porównanie z otwartymi modelami

| Benchmark                                   | Zadanie                  | DBRX Instruct | Kolejny najlepszy (Mixtral/Grok-1) |
|---------------------------------------------|--------------------------|---------------|------------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Wiedza ogólna            | 74,5%         | 72,7% (Mixtral Instruct)           |
| **HumanEval**                               | Programowanie            | 70,1%         | 63,2% (Grok-1)                     |
| **GSM8K**                                   | Rozumowanie matematyczne | 66,9%         | 62,9% (Grok-1)                     |
| **MMLU**                                    | Wiedza ogólna            | 73,7%         | 71,5% (Mixtral Instruct)           |

Wyniki DBRX Instruct na kluczowych benchmarkach<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>

DBRX zajął pierwsze miejsce zarówno w ogólnym rankingu **Hugging Face Open LLM Leaderboard**, jak i w kompleksowym teście **Databricks LLM Gauntlet**, wykazując znaczącą przewagę nad poprzednikami<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.

### Porównanie z zamkniętymi modelami

DBRX Instruct przewyższa **GPT-3.5 Turbo** pod względem szeregu kluczowych wskaźników, w tym MMLU (73,7% wobec 70,0%) i HumanEval (70,1% wobec 48,1%). Pod względem jakości odpowiedzi na niektórych benchmarkach (np. MTBench) model zbliża się do poziomu **Gemini 1.0 Pro** oraz wczesnych wersji **GPT-4**<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.

## Efektywność uczenia i inferencji

- **Efektywność uczenia**: Zastosowanie architektury MoE pozwoliło zmniejszyć koszty w FLOPS 2–4-krotnie w porównaniu z gęstymi modelami o porównywalnej jakości.
- **Efektywność inferencji**: Dzięki aktywacji jedynie 36 mld parametrów DBRX zapewnia **2–3-krotnie** większą przepustowość (prędkość wnioskowania) w porównaniu z gęstymi modelami o ekwiwalentnym rozmiarze (np. LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-dbrx_blog-1)</sup>.

## Licencjonowanie i dostępność

DBRX jest dystrybuowany na podstawie specjalnie opracowanej licencji **Databricks Open Model License**. Dopuszcza ona swobodne używanie i modyfikowanie, w tym zastosowanie komercyjne, lecz zawiera szereg ograniczeń. W szczególności, podobnie jak licencja LLaMA 2, wymaga uzyskania odrębnego zezwolenia od Databricks, jeśli usługi oparte na DBRX będą wykorzystywane przez odbiorców przekraczających **700 milionów** aktywnych użytkowników miesięcznie.

Wstępnie nauczone wagi modelu (wersji bazowej i Instruct) są dostępne do pobrania za pośrednictwem repozytorium na Hugging Face<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_note-huggingface_dbrx-4)</sup>.

## Literatura

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## Przypisy

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(PL)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
