DBRX (language model) (TL)
DBRX — ito ay isang bukas na malaking modelo ng wika (LLM) na binuo ng pangkat ng pananaliksik ng Mosaic AI sa loob ng kumpanyang Databricks. Ang modelo ay opisyal na inilabas noong ika-27 ng Marso, 2024 at inilalagay bilang isang mataas na pagganap na solusyon para sa paggamit sa negosyo[1].
Ang DBRX ay itinayo sa pinong arkitektura ng mixture of experts (MoE) at pinagsama ang mataas na pagganap sa kahusayan ng pagsasanay at inference. Sa oras ng paglabas, ipinakita ng DBRX ang pinakamahusay na mga resulta sa lahat ng bukas na modelo sa mga pangunahing benchmark, nalampasan ang mga modelo tulad ng LLaMA 2, Mixtral at Grok-1, at nagpakita ng kakumpitensya sa mga saradong modelo sa antas ng GPT-3.5 Turbo[2].
Kasaysayan ng pagbuo
Ang paglitaw ng DBRX ay naging pagpapatuloy ng estratehiya ng Databricks sa pagpapaunlad ng mga bukas na generative na modelo. Noong Hunyo 2023, binili ng Databricks ang startup na MosaicML, na dalubhasa sa pagsasanay ng malalaking modelo, at batay dito ay nilikha ang dibisyon ng Mosaic AI[3].
Ang koponan ng Mosaic AI, na pinamumunuan ng nangungunang arkitekto ng neural network na si Jonathan Frankle, ay nagsimulang bumuo ng isang bagong malaking LLM na may layuning makamit ang kalidad na maihahambing sa pinakamahusay na proprietary na mga sistema, ngunit sa bukas na format. Ang proyekto ay pinangalanang DBRX. Ang pagbuo at pre-training ng modelo ay tumagal ng humigit-kumulang 2.5 buwan at, ayon sa mga pagtatantya, nagkahalaga ng humigit-kumulang $10 milyon[3].
Arkitektura
Ang DBRX ay isang transformer na modelo ng uri na decoder lamang (decoder-only) at nagpapatupad ng pinong (fine-grained) arkitektura ng mixture of experts (MoE).
Mga pangunahing katangian ng arkitektura:
- Kabuuang bilang ng mga parameter: 132 bilyon.
- Mga eksperto: Ang modelo ay binubuo ng 16 maliliit na espesyalisadong sub-modelo («mga eksperto»).
- Mekanismo ng pag-activate: Para sa bawat input token, 4 lamang sa 16 na eksperto ang ina-activate. Nangangahulugan ito na sa panahon ng inference, 36 bilyon lamang na parameter ang aktibo, na nagbibigay ng mataas na bilis at kahusayan. Ang ganitong scheme ay nagbibigay ng 65 beses na mas maraming posibleng kombinasyon ng mga eksperto kumpara sa modelo ng Mixtral (8 eksperto na may pag-activate na 2)[1].
- Mga bahagi: Ginagamit ang mga modernong arkitekturang solusyon, tulad ng rotary positional embedding (RoPE), gated linear units (GLU) at grouped query attention (GQA).
- Haba ng konteksto: 32 768 token.
Ang ganitong arkitektura ay nagbibigay-daan sa modelo na pagsamahin ang mga pakinabang ng napakalaking bilang ng mga parameter (para sa pag-iimbak ng kaalaman) sa kahusayan ng mga mas maliliit na modelo (para sa bilis ng pagpapalabas).
Pagsasanay
Ang pre-training ng DBRX ay isinagawa sa maingat na curated na dataset na may dami na 12 trilyon token, na binubuo ng mga teksto at code. Ang kalidad ng data ay naging pangunahing priyoridad: gumamit ang mga developer ng cloud platform ng Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) para sa paglilinis, paghahanda at pag-audit ng data[1].
Sa panahon ng pagsasanay, ginamit ang paraan ng curriculum learning, kung saan sa iba't ibang yugto ay nagbabago ang proporsyon ng mga uri ng data. Halimbawa, ang huling bahagi ng pagsasanay ay nakatuon sa dosed na pagpapakilala ng mga kumplikadong gawain, na, ayon sa mga developer, ay nagbigay ng kapansin-pansing pagtaas ng kalidad. Ang pagsasanay ay isinagawa sa cluster ng 3072 Nvidia H100 GPU.
Pagkatapos ng pre-training, ang base na modelo ay dumaan sa karagdagang fine-tuning (instruction tuning) para sa paglikha ng interactive na bersyon ng DBRX Instruct, na na-optimize para sa pagtupad ng mga instruksyon ng gumagamit.
Pagganap
Sa oras ng paglabas, nagtakda ang DBRX ng bagong pamantayan ng kalidad para sa mga bukas na LLM sa malawak na hanay ng mga benchmark.
Paghahambing sa mga bukas na modelo
| Benchmark | Gawain | DBRX Instruct | Susunod na pinakamahusay (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Pangkalahatang kaalaman | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Pagpoprograma | 70,1% | 63,2% (Grok-1) |
| GSM8K | Matematikong pag-iisip | 66,9% | 62,9% (Grok-1) |
| MMLU | Pangkalahatang kaalaman | 73,7% | 71,5% (Mixtral Instruct) |
Nagwagi ang DBRX sa unang lugar kapwa sa pangkalahatang ranggo ng Hugging Face Open LLM Leaderboard at sa komprehensibong pagsubok na Databricks LLM Gauntlet, na nagpakita ng makabuluhang pagitan mula sa mga nauna[1].
Paghahambing sa mga saradong modelo
Ang DBRX Instruct ay higit sa GPT-3.5 Turbo sa ilang pangunahing tagapagpahiwatig, kabilang ang MMLU (73,7% kumpara sa 70,0%) at HumanEval (70,1% kumpara sa 48,1%). Sa kalidad ng mga sagot sa ilang benchmark (halimbawa, MTBench), ang modelo ay nalalapit sa antas ng Gemini 1.0 Pro at maagang mga bersyon ng GPT-4[1].
Kahusayan ng pagsasanay at inference
- Kahusayan ng pagsasanay: Ang paggamit ng arkitektura ng MoE ay nagpahintulot na bawasan ang mga gastos sa FLOPS ng 2-4 beses kumpara sa mga siksik na modelo na may katulad na kalidad.
- Kahusayan ng inference: Sa pamamagitan ng pag-activate ng 36 bilyon na parameter lamang, ang DBRX ay nagbibigay ng 2-3 beses na mas mataas na throughput (bilis ng pagpapalabas) kumpara sa mga siksik na modelo ng katumbas na laki (halimbawa, LLaMA2-70B)[1].
Paglilisensya at pagkakaroon
Ang DBRX ay ipinamamahagi sa ilalim ng espesyal na binuong lisensya na Databricks Open Model License. Pinapayagan nito ang libreng paggamit at pagbabago, kabilang ang komersyal na paggamit, ngunit naglalaman ng ilang mga paghihigpit. Sa partikular, tulad ng lisensya ng LLaMA 2, nangangailangan ito ng pagtanggap ng hiwalay na pahintulot mula sa Databricks kung ang mga serbisyo batay sa DBRX ay gagamitin ng madla na higit sa 700 milyon aktibong gumagamit bawat buwan.
Ang mga pre-trained na timbang ng modelo (base at Instruct na bersyon) ay available para sa pag-download sa pamamagitan ng repository sa Hugging Face[4].
Talasanggunian
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Mga tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]