DBRX (language model) (IT)
DBRX — è un grande modello linguistico (LLM) open source sviluppato dal team di ricerca Mosaic AI all'interno dell'azienda Databricks. Il modello è stato ufficialmente rilasciato il 27 marzo 2024 e si propone come soluzione ad alte prestazioni per l'utilizzo aziendale[1].
DBRX è costruito su un'architettura a grana fine di Mixture of Experts (MoE) e combina elevate prestazioni con l'efficienza nell'addestramento e nell'inferenza. Al momento del rilascio, DBRX ha ottenuto i migliori risultati tra tutti i modelli open source sui principali benchmark, superando modelli come LLaMA 2, Mixtral e Grok-1, e dimostrando competitività con modelli chiusi del livello di GPT-3.5 Turbo[2].
Storia dello sviluppo
La comparsa di DBRX è stata la continuazione della strategia di Databricks nello sviluppo di modelli generativi open source. Nel giugno 2023, Databricks ha acquisito la startup MosaicML, specializzata nell'addestramento di grandi modelli, e su questa base è stata creata la divisione Mosaic AI[3].
Il team Mosaic AI, guidato dall'architetto capo di reti neurali Jonathan Frankle, ha avviato lo sviluppo di un nuovo LLM di grandi dimensioni con l'obiettivo di raggiungere una qualità paragonabile ai migliori sistemi proprietari, ma in formato aperto. Il progetto è stato denominato DBRX. Lo sviluppo e il pre-addestramento del modello hanno richiesto circa 2,5 mesi e, secondo le stime, sono costati circa 10 milioni di dollari[3].
Architettura
DBRX è un modello transformer di tipo decoder-only e implementa un'architettura a grana fine (fine-grained) di Mixture of Experts (MoE).
Caratteristiche principali dell'architettura:
- Numero totale di parametri: 132 miliardi.
- Esperti: Il modello è composto da 16 piccoli sotto-modelli specializzati («esperti»).
- Meccanismo di attivazione: Per ogni token in ingresso vengono attivati solo 4 dei 16 esperti. Ciò significa che durante l'inferenza sono attivi soltanto 36 miliardi di parametri, garantendo alta velocità ed efficienza. Questo schema offre 65 volte più combinazioni possibili di esperti rispetto al modello Mixtral (8 esperti con attivazione di 2)[1].
- Componenti: Vengono utilizzate soluzioni architetturali moderne, come gli embedding posizionali rotazionali (RoPE), le gated linear units (GLU) e la grouped query attention (GQA).
- Lunghezza del contesto: 32 768 token.
Questa architettura consente al modello di combinare i vantaggi di un numero enorme di parametri (per la memorizzazione della conoscenza) con l'efficienza dei modelli più piccoli (per la velocità di inferenza).
Addestramento
Il pre-addestramento di DBRX è stato condotto su un dataset accuratamente curato di 12 trilioni di token, composto da testi e codice. La qualità dei dati era la priorità principale: gli sviluppatori hanno utilizzato la piattaforma cloud Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) per la pulizia, la preparazione e l'audit dei dati[1].
Durante l'addestramento è stato applicato il metodo del curriculum learning, in cui la proporzione dei tipi di dati variava nelle diverse fasi. Ad esempio, la parte finale dell'addestramento era dedicata all'introduzione graduale di compiti complessi, il che, secondo gli sviluppatori, ha prodotto un miglioramento tangibile della qualità. L'addestramento è stato condotto su un cluster di 3072 GPU Nvidia H100.
Dopo il pre-addestramento, il modello base ha subito un ulteriore fine-tuning (instruction tuning) per creare la versione interattiva DBRX Instruct, ottimizzata per l'esecuzione delle istruzioni dell'utente.
Prestazioni
Al momento del rilascio, DBRX ha stabilito un nuovo standard di qualità per gli LLM open source su un ampio spettro di benchmark.
Confronto con i modelli open source
| Benchmark | Compito | DBRX Instruct | Prossimo migliore (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Conoscenza generale | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programmazione | 70,1% | 63,2% (Grok-1) |
| GSM8K | Ragionamento matematico | 66,9% | 62,9% (Grok-1) |
| MMLU | Conoscenza generale | 73,7% | 71,5% (Mixtral Instruct) |
DBRX si è classificato al primo posto sia nella classifica generale Hugging Face Open LLM Leaderboard che nel test completo Databricks LLM Gauntlet, dimostrando un distacco significativo rispetto ai predecessori[1].
Confronto con i modelli a sorgente chiusa
DBRX Instruct supera GPT-3.5 Turbo su una serie di indicatori chiave, tra cui MMLU (73,7% contro 70,0%) e HumanEval (70,1% contro 48,1%). Per la qualità delle risposte su alcuni benchmark (ad esempio MTBench), il modello si avvicina al livello di Gemini 1.0 Pro e alle versioni iniziali di GPT-4[1].
Efficienza nell'addestramento e nell'inferenza
- Efficienza nell'addestramento: L'utilizzo dell'architettura MoE ha consentito di ridurre i costi in FLOPS di 2-4 volte rispetto ai modelli densi di qualità equivalente.
- Efficienza nell'inferenza: Grazie all'attivazione di soli 36 miliardi di parametri, DBRX garantisce una throughput (velocità di inferenza) 2-3 volte superiore rispetto ai modelli densi di dimensioni equivalenti (ad esempio, LLaMA2-70B)[1].
Licenza e disponibilità
DBRX è distribuito sotto la licenza appositamente sviluppata Databricks Open Model License. Essa consente il libero utilizzo e la modifica, incluso l'uso commerciale, ma contiene alcune restrizioni. In particolare, come la licenza di LLaMA 2, richiede l'ottenimento di un'autorizzazione separata da parte di Databricks se i servizi basati su DBRX vengono utilizzati da un pubblico superiore a 700 milioni di utenti attivi al mese.
I pesi pre-addestrati del modello (versione base e Instruct) sono disponibili per il download tramite il repository su Hugging Face[4].
Bibliografia
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]