DBRX (language model) (TR)
DBRX — Databricks bünyesindeki Mosaic AI araştırma ekibi tarafından geliştirilen açık kaynaklı bir büyük dil modelidir (LLM). Model, 27 Mart 2024 tarihinde resmi olarak yayımlanmış olup kurumsal kullanım için yüksek performanslı bir çözüm olarak konumlandırılmaktadır[1].
DBRX, ince taneli uzman karışımı (MoE) mimarisi üzerine inşa edilmiş olup yüksek performansı, eğitim ve çıkarım verimliliğiyle bir arada sunmaktadır. Yayımlandığı tarihte DBRX, temel benchmark'larda tüm açık modeller arasında en iyi sonuçları elde etmiş; LLaMA 2, Mixtral ve Grok-1 gibi modelleri geride bırakarak GPT-3.5 Turbo düzeyindeki kapalı modellerle rekabet edebilir olduğunu kanıtlamıştır[2].
Geliştirme Tarihi
DBRX'in ortaya çıkışı, Databricks'in açık üretken modeller alanındaki stratejisinin bir devamı niteliğindedir. Haziran 2023'te Databricks, büyük modellerin eğitimi konusunda uzmanlaşmış MosaicML adlı girişimi satın almış ve bu yapı üzerinde Mosaic AI birimi kurulmuştur[3].
Baş sinir ağı mimarı Jonathan Frankle liderliğindeki Mosaic AI ekibi, açık formatta en iyi tescilli sistemlerle kıyaslanabilir bir kaliteye ulaşmayı hedefleyerek yeni ve büyük bir LLM geliştirmeye başlamıştır. Proje DBRX adını almıştır. Modelin geliştirilmesi ve ön eğitimi yaklaşık 2,5 ay sürmüş olup tahminen 10 milyon dolar maliyete ulaşmıştır[3].
Mimari
DBRX, yalnızca kod çözücü (decoder-only) türünde bir transformer modeli olup ince taneli (fine-grained) uzman karışımı (MoE) mimarisini uygulamaktadır.
Mimarinin temel özellikleri:
- Toplam parametre sayısı: 132 milyar.
- Uzmanlar: Model, 16 küçük özelleşmiş alt modelden ("uzman") oluşmaktadır.
- Etkinleştirme mekanizması: Her giriş token'ı için 16 uzmanın yalnızca 4 tanesi etkinleştirilir. Bu, çıkarım sırasında yalnızca 36 milyar parametrenin aktif olduğu anlamına gelir ve bu sayede yüksek hız ile verimlilik sağlanır. Bu düzenleme, Mixtral'a (8 uzman, 2 aktif) kıyasla 65 kat daha fazla olası uzman kombinasyonuna olanak tanır[1].
- Bileşenler: Döndürmeli konum embedding'leri (RoPE), gated linear units (GLU) ve grouped query attention (GQA) gibi modern mimari çözümler kullanılmaktadır.
- Bağlam uzunluğu: 32.768 token.
Bu mimari, modelin çok büyük sayıda parametrenin avantajlarını (bilgi depolama) daha küçük modellerin verimliliğiyle (çıkarım hızı) birleştirmesine olanak tanır.
Eğitim
DBRX'in ön eğitimi, metin ve koddan oluşan özenle hazırlanmış 12 trilyon token'lık bir dataset üzerinde gerçekleştirilmiştir. Veri kalitesi temel öncelik olarak belirlenmiş; geliştiriciler, verilerin temizlenmesi, hazırlanması ve denetlenmesi için Databricks'in bulut platformunu (Apache Spark, Databricks Notebooks, Unity Catalog) kullanmıştır[1].
Eğitimde müfredat öğrenimi (curriculum learning) yöntemi uygulanmış; bu yöntemde farklı aşamalarda veri türlerinin oranı değiştirilmiştir. Örneğin, eğitimin son aşaması, geliştiricilerin ifadesine göre kalitede belirgin bir artış sağlayan karmaşık görevlerin kademeli olarak dahil edilmesine ayrılmıştır. Eğitim, 3072 adet Nvidia H100 GPU'dan oluşan bir kümede gerçekleştirilmiştir.
Ön eğitimin ardından temel model, kullanıcı talimatlarını yerine getirmek üzere optimize edilmiş etkileşimli DBRX Instruct sürümünü oluşturmak amacıyla ek ince ayardan (instruction tuning) geçirilmiştir.
Performans
Yayımlandığı tarihte DBRX, açık LLM'ler için geniş bir benchmark yelpazesinde yeni bir kalite standardı belirlemiştir.
Açık Modellerle Karşılaştırma
| Benchmark | Görev | DBRX Instruct | Sıradaki en iyi (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Genel bilgi | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programlama | 70,1% | 63,2% (Grok-1) |
| GSM8K | Matematiksel muhakeme | 66,9% | 62,9% (Grok-1) |
| MMLU | Genel bilgi | 73,7% | 71,5% (Mixtral Instruct) |
DBRX, hem genel Hugging Face Open LLM Leaderboard sıralamasında hem de kapsamlı Databricks LLM Gauntlet testinde birinci sıraya yerleşerek önceki modellerden belirgin biçimde ayrışmıştır[1].
Kapalı Modellerle Karşılaştırma
DBRX Instruct, MMLU (%73,7'ye karşı %70,0) ve HumanEval (%70,1'e karşı %48,1) dahil olmak üzere çeşitli temel göstergelerde GPT-3.5 Turboyu geride bırakmaktadır. Bazı benchmark'larda (örneğin MTBench) yanıt kalitesi açısından model, Gemini 1.0 Pro ve GPT-4ün erken sürümleri düzeyine yaklaşmaktadır[1].
Eğitim ve Çıkarım Verimliliği
- Eğitim verimliliği: MoE mimarisinin kullanımı, benzer kalitedeki yoğun modellerle karşılaştırıldığında FLOPS maliyetini 2-4 kat azaltmıştır.
- Çıkarım verimliliği: Yalnızca 36 milyar parametrenin etkinleştirilmesi sayesinde DBRX, eşdeğer boyuttaki yoğun modellerle (örneğin LLaMA2-70B) karşılaştırıldığında 2-3 kat daha yüksek verimlilik (çıkarım hızı) sağlamaktadır[1].
Lisanslama ve Erişilebilirlik
DBRX, özel olarak tasarlanmış Databricks Open Model License lisansı kapsamında dağıtılmaktadır. Bu lisans, ticari kullanım dahil olmak üzere özgürce kullanım ve değişiklik yapılmasına izin vermekle birlikte bazı kısıtlamalar içermektedir. Özellikle LLaMA 2 lisansına benzer şekilde, DBRX tabanlı hizmetlerin aylık 700 milyonun üzerinde aktif kullanıcıya ulaşması durumunda Databricks'ten ayrıca izin alınması gerekmektedir.
Modelin ön eğitilmiş ağırlıkları (temel ve Instruct sürümleri) Hugging Face üzerindeki depo aracılığıyla indirilebilir durumdadır[4].
Kaynakça
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]