DBRX (language model) (RO)
DBRX — este un model lingvistic mare (LLM) cu sursă deschisă, dezvoltat de echipa de cercetare Mosaic AI din cadrul companiei Databricks. Modelul a fost lansat oficial pe 27 martie 2024 și este poziționat ca o soluție de înaltă performanță pentru utilizare corporativă[1].
DBRX este construit pe o arhitectură Mixture of Experts (MoE) cu granularitate fină și combină performanța ridicată cu eficiența antrenării și a inferenței. La momentul lansării, DBRX a demonstrat cele mai bune rezultate dintre toate modelele cu sursă deschisă pe benchmark-urile cheie, depășind modele precum LLaMA 2, Mixtral și Grok-1, și dovedind competitivitate cu modelele închise de nivelul GPT-3.5 Turbo[2].
Istoricul dezvoltării
Apariția DBRX a reprezentat o continuare a strategiei Databricks de dezvoltare a modelelor generative cu sursă deschisă. În iunie 2023, Databricks a achiziționat startup-ul MosaicML, specializat în antrenarea modelelor mari, iar pe baza acestuia a fost creat departamentul Mosaic AI[3].
Echipa Mosaic AI, condusă de arhitectul principal de rețele neuronale Jonathan Frankle, a demarat dezvoltarea unui nou LLM major cu scopul de a atinge o calitate comparabilă cu cele mai bune sisteme proprietare, dar într-un format deschis. Proiectul a primit numele DBRX. Dezvoltarea și preantrenarea modelului au durat aproximativ 2,5 luni și, conform estimărilor, au costat aproximativ 10 milioane de dolari[3].
Arhitectură
DBRX este un model de tip transformer decoder-only (decoder-only) și implementează o arhitectură Mixture of Experts (MoE) cu granularitate fină (fine-grained).
Caracteristicile cheie ale arhitecturii:
- Numărul total de parametri: 132 de miliarde.
- Experți: Modelul este compus din 16 submodele mici specializate („experți").
- Mecanismul de activare: Pentru fiecare token de intrare sunt activați doar 4 din cei 16 experți. Aceasta înseamnă că la inferență sunt activi doar 36 de miliarde de parametri, ceea ce asigură viteză și eficiență ridicate. Această schemă oferă de 65 de ori mai multe combinații posibile de experți față de modelul Mixtral (8 experți cu activarea a 2)[1].
- Componente: Sunt utilizate soluții arhitecturale moderne, precum embedding-uri poziționale rotaționale (RoPE), gated linear units (GLU) și grouped query attention (GQA).
- Lungimea contextului: 32.768 de token-uri.
O astfel de arhitectură permite modelului să combine avantajele unui număr imens de parametri (pentru stocarea cunoștințelor) cu eficiența modelelor mai mici (pentru viteza de inferență).
Antrenare
Preantrenarea DBRX a fost efectuată pe un dataset atent curatizat de 12 trilioane de token-uri, compus din texte și cod. Calitatea datelor a reprezentat o prioritate esențială: dezvoltatorii au utilizat platforma cloud Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) pentru curățarea, pregătirea și auditarea datelor[1].
În procesul de antrenare a fost aplicată metoda curriculum learning, prin care proporția tipurilor de date se modifica în diferite etape. De exemplu, etapa finală a antrenării a fost dedicată introducerii dozate a sarcinilor complexe, ceea ce, potrivit dezvoltatorilor, a adus un câștig semnificativ de calitate. Antrenarea a fost realizată pe un cluster de 3072 GPU-uri Nvidia H100.
După preantrenare, modelul de bază a trecut printr-un fine-tuning suplimentar (instruction tuning) pentru crearea versiunii interactive DBRX Instruct, optimizată pentru executarea instrucțiunilor utilizatorului.
Performanță
La momentul lansării, DBRX a stabilit un nou standard de calitate pentru LLM-urile cu sursă deschisă pe o gamă largă de benchmark-uri.
Comparație cu modele cu sursă deschisă
| Benchmark | Sarcină | DBRX Instruct | Următorul mai bun (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Cunoștințe generale | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programare | 70,1% | 63,2% (Grok-1) |
| GSM8K | Raționament matematic | 66,9% | 62,9% (Grok-1) |
| MMLU | Cunoștințe generale | 73,7% | 71,5% (Mixtral Instruct) |
DBRX a ocupat primul loc atât în clasamentul general Hugging Face Open LLM Leaderboard, cât și în testul complex Databricks LLM Gauntlet, demonstrând un avans semnificativ față de predecesori[1].
Comparație cu modele închise
DBRX Instruct depășește GPT-3.5 Turbo la o serie de indicatori cheie, inclusiv MMLU (73,7% față de 70,0%) și HumanEval (70,1% față de 48,1%). Ca nivel al calității răspunsurilor pe unele benchmark-uri (de exemplu, MTBench), modelul se apropie de nivelul Gemini 1.0 Pro și al versiunilor timpurii ale GPT-4[1].
Eficiența antrenării și a inferenței
- Eficiența antrenării: Utilizarea arhitecturii MoE a permis reducerea costurilor în FLOPS de 2-4 ori față de modelele dense cu calitate echivalentă.
- Eficiența inferenței: Prin activarea a doar 36 de miliarde de parametri, DBRX oferă un throughput (viteză de inferență) de 2-3 ori mai mare față de modelele dense de dimensiune echivalentă (de exemplu, LLaMA2-70B)[1].
Licențiere și disponibilitate
DBRX este distribuit sub licența special elaborată Databricks Open Model License. Aceasta permite utilizarea și modificarea liberă, inclusiv în scopuri comerciale, însă conține o serie de restricții. În special, similar licenței LLaMA 2, aceasta impune obținerea unei permisiuni separate din partea Databricks dacă serviciile bazate pe DBRX vor fi utilizate de o audiență de peste 700 de milioane de utilizatori activi pe lună.
Ponderile preantrenate ale modelului (versiunea de bază și versiunea Instruct) sunt disponibile pentru descărcare prin intermediul depozitului de pe Hugging Face[4].
Bibliografie
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]