DBRX (language model) (SV)
DBRX — är en öppen stor språkmodell (LLM), utvecklad av forskningsteamet Mosaic AI inom företaget Databricks. Modellen lanserades officiellt den 27 mars 2024 och positioneras som en högpresterande lösning för företagsanvändning[1].
DBRX är byggd på en finkorning arkitektur med Mixture of Experts (MoE) och kombinerar hög prestanda med effektivitet i träning och inferens. Vid lanseringen uppvisade DBRX de bästa resultaten bland alla öppna modeller på viktiga benchmark, och överträffade modeller som LLaMA 2, Mixtral och Grok-1, samt visade konkurrenskraft med slutna modeller på GPT-3.5 Turbo-nivå[2].
Utvecklingshistoria
Tillkomsten av DBRX var en fortsättning på Databricks strategi för att utveckla öppna generativa modeller. I juni 2023 förvärvade Databricks startupföretaget MosaicML, som specialiserade sig på träning av stora modeller, och på dess grund skapades divisionen Mosaic AI[3].
Teamet Mosaic AI, lett av den ledande nätverksarkitekten Jonathan Frankle, inledde utvecklingen av en ny stor LLM med målet att uppnå kvalitet i nivå med de bästa proprietära systemen, men i ett öppet format. Projektet fick namnet DBRX. Utveckling och förträning av modellen tog ungefär 2,5 månader och beräknades kosta omkring 10 miljoner USD[3].
Arkitektur
DBRX är en transformer-modell av typen decoder-only (decoder-only) och implementerar en finkorning (fine-grained) Mixture of Experts-arkitektur (MoE).
Viktigaste arkitekturella egenskaper:
- Totalt antal parametrar: 132 miljarder.
- Experter: Modellen består av 16 små specialiserade delmodeller ("experter").
- Aktiveringsmekanism: För varje inmatat token aktiveras endast 4 av de 16 experterna. Det innebär att vid inferens är endast 36 miljarder parametrar aktiva, vilket ger hög hastighet och effektivitet. Detta schema ger 65 gånger fler möjliga expertkombinationer jämfört med Mixtral-modellen (8 experter med aktivering av 2)[1].
- Komponenter: Moderna arkitekturlösningar används, såsom roterande positionella embedding (RoPE), gated linear units (GLU) och grouped query attention (GQA).
- Kontextlängd: 32 768 token.
Denna arkitektur gör det möjligt för modellen att kombinera fördelarna med ett enormt antal parametrar (för kunskapslagring) med effektiviteten hos mindre modeller (för inferenshastighet).
Träning
Förträningen av DBRX genomfördes på ett noggrant kurerat dataset med en volym av 12 biljoner token, bestående av texter och kod. Datakvaliteten var en central prioritet: utvecklarna använde Databricks molnplattform (Apache Spark, Databricks Notebooks, Unity Catalog) för rensning, förberedelse och granskning av data[1].
Vid träningen tillämpades metoden curriculum learning (curriculum learning), där proportionen av datatyper varierades i olika faser. Exempelvis ägnades den avslutande delen av träningen åt gradvis introduktion av svåra uppgifter, vilket enligt utvecklarna gav en märkbar kvalitetsförbättring. Träningen genomfördes på ett kluster med 3 072 Nvidia H100 GPU.
Efter förträningen genomgick basmodellen ytterligare finjustering (instruction tuning) för att skapa den interaktiva versionen DBRX Instruct, optimerad för att följa användarinstruktioner.
Prestanda
Vid lanseringen satte DBRX en ny kvalitetsstandard för öppna LLM på ett brett spektrum av benchmark.
Jämförelse med öppna modeller
| Benchmark | Uppgift | DBRX Instruct | Näst bäst (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Allmänna kunskaper | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programmering | 70,1% | 63,2% (Grok-1) |
| GSM8K | Matematiskt resonemang | 66,9% | 62,9% (Grok-1) |
| MMLU | Allmänna kunskaper | 73,7% | 71,5% (Mixtral Instruct) |
DBRX intog förstaplatsen både i den övergripande rankningen på Hugging Face Open LLM Leaderboard och i det sammansatta testet Databricks LLM Gauntlet, och visade ett betydande försprång gentemot föregångarna[1].
Jämförelse med slutna modeller
DBRX Instruct överträffar GPT-3.5 Turbo på ett antal viktiga mätvärden, inklusive MMLU (73,7% mot 70,0%) och HumanEval (70,1% mot 48,1%). Vad gäller svarskvalitet på vissa benchmark (exempelvis MTBench) närmar sig modellen nivån för Gemini 1.0 Pro och tidiga versioner av GPT-4[1].
Tränings- och inferenseffektivitet
- Träningseffektivitet: Användningen av MoE-arkitekturen möjliggjorde en minskning av FLOPS-kostnader med 2–4 gånger jämfört med täta modeller av motsvarande kvalitet.
- Inferenseffektivitet: Tack vare att endast 36 miljarder parametrar aktiveras ger DBRX 2–3 gånger högre genomströmning (inferenshastighet) jämfört med täta modeller av motsvarande storlek (exempelvis LLaMA2-70B)[1].
Licensiering och tillgänglighet
DBRX distribueras under den särskilt framtagna licensen Databricks Open Model License. Den tillåter fri användning och modifiering, inklusive kommersiell tillämpning, men innehåller ett antal begränsningar. I synnerhet kräver den, liksom LLaMA 2-licensen, att ett separat tillstånd inhämtas från Databricks om tjänster baserade på DBRX används av en publik som överstiger 700 miljoner aktiva användare per månad.
Förtränade modellvikter (för basversionen och Instruct-versionen) är tillgängliga för nedladdning via ett arkiv på Hugging Face[4].
Litteratur
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Noter
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]