---
title: "DBRX (language model) (IT)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(IT)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1399
wiki_created_at: 2026-09-06T22:48:06Z
wiki_modified_at: 2026-09-06T22:48:06Z
downloaded_at: 2026-09-07T22:45:52Z
---

# DBRX (language model) (IT)

**DBRX** — è un grande modello linguistico (LLM) open source sviluppato dal team di ricerca Mosaic AI all'interno dell'azienda Databricks. Il modello è stato ufficialmente rilasciato il 27 marzo 2024 e si propone come soluzione ad alte prestazioni per l'utilizzo aziendale<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.

DBRX è costruito su un'architettura a grana fine di **Mixture of Experts (MoE)** e combina elevate prestazioni con l'efficienza nell'addestramento e nell'inferenza. Al momento del rilascio, DBRX ha ottenuto i migliori risultati tra tutti i modelli open source sui principali benchmark, superando modelli come LLaMA 2, Mixtral e Grok-1, e dimostrando competitività con modelli chiusi del livello di GPT-3.5 Turbo<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-infoworld_dbrx-2)</sup>.

## Storia dello sviluppo

La comparsa di DBRX è stata la continuazione della strategia di Databricks nello sviluppo di modelli generativi open source. Nel giugno 2023, Databricks ha acquisito la startup **MosaicML**, specializzata nell'addestramento di grandi modelli, e su questa base è stata creata la divisione **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-techcrunch_dbrx_10m-3)</sup>.

Il team Mosaic AI, guidato dall'architetto capo di reti neurali Jonathan Frankle, ha avviato lo sviluppo di un nuovo LLM di grandi dimensioni con l'obiettivo di raggiungere una qualità paragonabile ai migliori sistemi proprietari, ma in formato aperto. Il progetto è stato denominato DBRX. Lo sviluppo e il pre-addestramento del modello hanno richiesto circa 2,5 mesi e, secondo le stime, sono costati circa **10 milioni di dollari**<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Architettura

DBRX è un modello transformer di tipo **decoder-only** e implementa un'architettura a grana fine (*fine-grained*) di Mixture of Experts (MoE).

Caratteristiche principali dell'architettura:

- **Numero totale di parametri**: 132 miliardi.
- **Esperti**: Il modello è composto da **16** piccoli sotto-modelli specializzati («esperti»).
- **Meccanismo di attivazione**: Per ogni token in ingresso vengono attivati solo **4** dei 16 esperti. Ciò significa che durante l'inferenza sono attivi soltanto **36 miliardi** di parametri, garantendo alta velocità ed efficienza. Questo schema offre 65 volte più combinazioni possibili di esperti rispetto al modello Mixtral (8 esperti con attivazione di 2)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.
- **Componenti**: Vengono utilizzate soluzioni architetturali moderne, come gli embedding posizionali rotazionali (**RoPE**), le *gated linear units* (**GLU**) e la *grouped query attention* (**GQA**).
- **Lunghezza del contesto**: 32 768 token.

Questa architettura consente al modello di combinare i vantaggi di un numero enorme di parametri (per la memorizzazione della conoscenza) con l'efficienza dei modelli più piccoli (per la velocità di inferenza).

## Addestramento

Il pre-addestramento di DBRX è stato condotto su un dataset accuratamente curato di **12 trilioni** di token, composto da testi e codice. La qualità dei dati era la priorità principale: gli sviluppatori hanno utilizzato la piattaforma cloud Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) per la pulizia, la preparazione e l'audit dei dati<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.

Durante l'addestramento è stato applicato il metodo del **curriculum learning**, in cui la proporzione dei tipi di dati variava nelle diverse fasi. Ad esempio, la parte finale dell'addestramento era dedicata all'introduzione graduale di compiti complessi, il che, secondo gli sviluppatori, ha prodotto un miglioramento tangibile della qualità. L'addestramento è stato condotto su un cluster di **3072** GPU Nvidia H100.

Dopo il pre-addestramento, il modello base ha subito un ulteriore fine-tuning (*instruction tuning*) per creare la versione interattiva **DBRX Instruct**, ottimizzata per l'esecuzione delle istruzioni dell'utente.

## Prestazioni

Al momento del rilascio, DBRX ha stabilito un nuovo standard di qualità per gli LLM open source su un ampio spettro di benchmark.

### Confronto con i modelli open source

| Benchmark                                   | Compito                 | DBRX Instruct | Prossimo migliore (Mixtral/Grok-1) |
|---------------------------------------------|-------------------------|---------------|------------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Conoscenza generale     | 74,5%         | 72,7% (Mixtral Instruct)           |
| **HumanEval**                               | Programmazione          | 70,1%         | 63,2% (Grok-1)                     |
| **GSM8K**                                   | Ragionamento matematico | 66,9%         | 62,9% (Grok-1)                     |
| **MMLU**                                    | Conoscenza generale     | 73,7%         | 71,5% (Mixtral Instruct)           |

Risultati di DBRX Instruct sui principali benchmark<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>

DBRX si è classificato al primo posto sia nella classifica generale **Hugging Face Open LLM Leaderboard** che nel test completo **Databricks LLM Gauntlet**, dimostrando un distacco significativo rispetto ai predecessori<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.

### Confronto con i modelli a sorgente chiusa

DBRX Instruct supera **GPT-3.5 Turbo** su una serie di indicatori chiave, tra cui MMLU (73,7% contro 70,0%) e HumanEval (70,1% contro 48,1%). Per la qualità delle risposte su alcuni benchmark (ad esempio MTBench), il modello si avvicina al livello di **Gemini 1.0 Pro** e alle versioni iniziali di **GPT-4**<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.

## Efficienza nell'addestramento e nell'inferenza

- **Efficienza nell'addestramento**: L'utilizzo dell'architettura MoE ha consentito di ridurre i costi in FLOPS di 2-4 volte rispetto ai modelli densi di qualità equivalente.
- **Efficienza nell'inferenza**: Grazie all'attivazione di soli 36 miliardi di parametri, DBRX garantisce una throughput (velocità di inferenza) **2-3 volte** superiore rispetto ai modelli densi di dimensioni equivalenti (ad esempio, LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-dbrx_blog-1)</sup>.

## Licenza e disponibilità

DBRX è distribuito sotto la licenza appositamente sviluppata **Databricks Open Model License**. Essa consente il libero utilizzo e la modifica, incluso l'uso commerciale, ma contiene alcune restrizioni. In particolare, come la licenza di LLaMA 2, richiede l'ottenimento di un'autorizzazione separata da parte di Databricks se i servizi basati su DBRX vengono utilizzati da un pubblico superiore a **700 milioni** di utenti attivi al mese.

I pesi pre-addestrati del modello (versione base e Instruct) sono disponibili per il download tramite il repository su Hugging Face<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_note-huggingface_dbrx-4)</sup>.

## Bibliografia

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## Note

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(IT)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
