---
title: "DBRX (language model) (HU)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(HU)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1397
wiki_created_at: 2026-09-06T22:48:05Z
wiki_modified_at: 2026-09-06T22:48:05Z
downloaded_at: 2026-09-07T22:45:51Z
---

# DBRX (language model) (HU)

**DBRX** — egy nyílt nagy nyelvi modell (LLM), amelyet a Databricks vállalat keretein belül működő Mosaic AI kutatócsapat fejlesztett ki. A modellt hivatalosan 2024. március 27-én adták ki, és nagy teljesítményű vállalati megoldásként pozícionálják<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.

A DBRX finomszerkezetű **szakértők keveréke (MoE)** architektúrára épül, és ötvözi a magas teljesítményt a tanítás és az inferencia hatékonyságával. A megjelenéskor a DBRX a legjobb eredményeket érte el az összes nyílt modell közül a legfontosabb benchmarkokon, megelőzve olyan modelleket, mint a LLaMA 2, a Mixtral és a Grok-1, valamint versenyképességet mutatott a GPT-3.5 Turbo szintű zárt modellekkel szemben<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-infoworld_dbrx-2)</sup>.

## Fejlesztés története

A DBRX megjelenése a Databricks azon stratégiájának folytatása volt, amelynek célja nyílt generatív modellek fejlesztése. 2023 júniusában a Databricks felvásárolta a **MosaicML** startupot, amely nagy modellek tanítására specializálódott, és ennek bázisán jött létre a **Mosaic AI** részleg<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-techcrunch_dbrx_10m-3)</sup>.

A Mosaic AI csapata, amelyet Jonathan Frankle vezető neurálishálózat-építész irányított, hozzálátott egy új, nagyméretű LLM fejlesztéséhez azzal a céllal, hogy a legjobb tulajdonosi rendszerekkel összehasonlítható minőséget érjen el, de nyílt formátumban. A projekt a DBRX nevet kapta. A modell fejlesztése és előtanítása körülbelül 2,5 hónapig tartott, és a becslések szerint mintegy **10 millió dollárba** került<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Architektúra

A DBRX egy **csak dekódert** (*decoder-only*) alkalmazó transformer modell, amely finomszerkezetű (*fine-grained*) szakértők keveréke (MoE) architektúrát valósít meg.

Az architektúra főbb jellemzői:

- **Paraméterek teljes száma**: 132 milliárd.
- **Szakértők**: A modell **16** kis, specializált részmodellből („szakértőből") áll.
- **Aktiválási mechanizmus**: Minden bemeneti tokenhez csak **4** szakértő aktiválódik a 16-ból. Ez azt jelenti, hogy az inferencia során csupán **36 milliárd** paraméter aktív, ami nagy sebességet és hatékonyságot biztosít. Ez a séma 65-ször több lehetséges szakértőkombinációt eredményez a Mixtral modellhez képest (8 szakértő, 2 aktív)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.
- **Komponensek**: Modern architekturális megoldásokat alkalmaznak, mint például a forgó pozicionális embedding (**RoPE**), *gated linear units* (**GLU**) és *grouped query attention* (**GQA**).
- **Kontextushossz**: 32 768 token.

Ez az architektúra lehetővé teszi, hogy a modell ötvözze a hatalmas paraméterkészlet előnyeit (tudás tárolásához) a kisebb modellek hatékonyságával (a következtetési sebességhez).

## Tanítás

A DBRX előtanítása gondosan összeválogatott, **12 billió** tokenből álló dataseten zajlott, amely szövegekből és kódból állt. Az adatok minősége kiemelt prioritás volt: a fejlesztők a Databricks felhőplatformját (Apache Spark, Databricks Notebooks, Unity Catalog) használták az adatok tisztítására, előkészítésére és auditálására<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.

A tanítás során **curriculum learning** módszert alkalmaztak, amelynek keretében a különböző szakaszokban változott az adattípusok aránya. Például a tanítás utolsó részét összetett feladatok adagolt bevezetésének szentelték, ami a fejlesztők szerint érzékelhető minőségjavulást hozott. A tanítás **3072** Nvidia H100 GPU-ból álló klaszteren zajlott.

Az előtanítást követően az alap modell további fine-tuningon (*instruction tuning*) esett át, hogy létrehozzák az interaktív **DBRX Instruct** verziót, amelyet a felhasználói utasítások végrehajtására optimalizáltak.

## Teljesítmény

A megjelenéskor a DBRX új minőségi standardot állított fel a nyílt LLM-ek számára a benchmarkok széles spektrumán.

### Összehasonlítás nyílt modellekkel

| Benchmark                                   | Feladat             | DBRX Instruct | Következő legjobb (Mixtral/Grok-1) |
|---------------------------------------------|---------------------|---------------|------------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Általános ismeretek | 74,5%         | 72,7% (Mixtral Instruct)           |
| **HumanEval**                               | Programozás         | 70,1%         | 63,2% (Grok-1)                     |
| **GSM8K**                                   | Matematikai érvelés | 66,9%         | 62,9% (Grok-1)                     |
| **MMLU**                                    | Általános ismeretek | 73,7%         | 71,5% (Mixtral Instruct)           |

A DBRX Instruct eredményei a legfontosabb benchmarkokon<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>

A DBRX az első helyet szerezte meg mind a **Hugging Face Open LLM Leaderboard** általános rangsorában, mind a **Databricks LLM Gauntlet** átfogó tesztjén, jelentős előnyt mutatva elődeihez képest<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.

### Összehasonlítás zárt modellekkel

A DBRX Instruct felülmúlja a **GPT-3.5 Turbo**-t számos kulcsmutatón, köztük az MMLU-n (73,7% szemben 70,0%-kal) és a HumanEvalon (70,1% szemben 48,1%-kal). Egyes benchmarkokon (például MTBench) a válaszok minőségét tekintve a modell közelít a **Gemini 1.0 Pro** szintjéhez és a **GPT-4** korai verzióihoz<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.

## A tanítás és az inferencia hatékonysága

- **Tanítási hatékonyság**: A MoE architektúra alkalmazása lehetővé tette a FLOPS-ban mért költségek 2-4-szeres csökkentését a hasonló minőségű sűrű modellekhez képest.
- **Inferencia-hatékonyság**: Azáltal, hogy csak 36 milliárd paraméter aktiválódik, a DBRX **2-3-szor** nagyobb áteresztőképességet (következtetési sebességet) biztosít az egyenértékű méretű sűrű modellekhez képest (például LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-dbrx_blog-1)</sup>.

## Licencelés és elérhetőség

A DBRX terjesztése a kifejezetten erre a célra kidolgozott **Databricks Open Model License** licenc alatt történik. Ez lehetővé teszi a szabad felhasználást és módosítást, beleértve a kereskedelmi alkalmazást is, de tartalmaz bizonyos korlátozásokat. Különösen a LLaMA 2 licenchez hasonlóan előírja, hogy külön engedélyt kell kérni a Databrickstől, ha a DBRX-alapú szolgáltatásokat havonta több mint **700 millió** aktív felhasználó veszi igénybe.

A modell (alap és Instruct verzió) előtanított súlyai letölthetők a Hugging Face tárolóján keresztül<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_note-huggingface_dbrx-4)</sup>.

## Irodalom

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## Jegyzetek

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(HU)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
