DBRX (language model) (FA)
DBRX — یک مدل زبانی بزرگ (LLM) متنباز است که توسط تیم پژوهشی Mosaic AI در شرکت Databricks توسعه یافته است. این مدل بهطور رسمی در ۲۷ مارس ۲۰۲۴ منتشر شد و بهعنوان یک راهحل پرکارایی برای استفاده سازمانی معرفی میشود[1].
DBRX بر پایه معماری دانهریز ترکیب متخصصان (MoE) ساخته شده و کارایی بالا را با بهرهوری در آموزش و استنتاج ترکیب میکند. در زمان انتشار، DBRX بهترین نتایج را در میان تمام مدلهای متنباز در benchmarkهای کلیدی به دست آورد و مدلهایی نظیر LLaMA 2، Mixtral و Grok-1 را پشت سر گذاشت و رقابتپذیری خود را با مدلهای بسته در سطح GPT-3.5 Turbo نشان داد[2].
تاریخچه توسعه
ظهور DBRX ادامه استراتژی Databricks در توسعه مدلهای مولد متنباز بود. در ژوئن ۲۰۲۳، Databricks استارتاپ MosaicML را که در آموزش مدلهای بزرگ تخصص داشت، خریداری کرد و بر پایه آن بخش Mosaic AI را تأسیس نمود[3].
تیم Mosaic AI به رهبری معمار ارشد شبکههای عصبی، جاناتان فرانکل، توسعه یک LLM بزرگ جدید را با هدف دستیابی به کیفیتی قابل مقایسه با بهترین سیستمهای اختصاصی اما در قالب متنباز آغاز کرد. این پروژه نام DBRX گرفت. توسعه و پیشآموزش مدل حدود ۲.۵ ماه طول کشید و هزینه آن بهطور تقریبی ۱۰ میلیون دلار برآورد شده است[3].
معماری
DBRX یک مدل transformer از نوع فقط-رمزگشا (decoder-only) است و معماری دانهریز (fine-grained) ترکیب متخصصان (MoE) را پیادهسازی میکند.
ویژگیهای کلیدی معماری:
- تعداد کل پارامترها: ۱۳۲ میلیارد.
- متخصصان: مدل از ۱۶ زیرمدل تخصصی کوچک («متخصص») تشکیل شده است.
- مکانیزم فعالسازی: برای هر token ورودی تنها ۴ متخصص از ۱۶ متخصص فعال میشوند. این بدان معناست که در زمان استنتاج تنها ۳۶ میلیارد پارامتر فعال هستند که سرعت و بهرهوری بالایی را تضمین میکند. این طرح ۶۵ برابر بیشتر از مدل Mixtral (۸ متخصص با فعالسازی ۲) ترکیبهای ممکن متخصصان را فراهم میآورد[1].
- اجزاء: از راهحلهای معماری مدرن نظیر embeddingهای موقعیتی چرخشی (RoPE)، gated linear units (GLU) و grouped query attention (GQA) استفاده میشود.
- طول زمینه: ۳۲٬۷۶۸ token.
چنین معماریای به مدل امکان میدهد مزایای تعداد عظیم پارامترها (برای ذخیره دانش) را با بهرهوری مدلهای کوچکتر (برای سرعت استنتاج) ترکیب کند.
آموزش
پیشآموزش DBRX روی یک dataset با کیفیت بالا به حجم ۱۲ تریلیون token شامل متون و کد انجام شد. کیفیت دادهها اولویت اصلی بود: توسعهدهندگان از پلتفرم ابری Databricks (Apache Spark، Databricks Notebooks، Unity Catalog) برای پاکسازی، آمادهسازی و ممیزی دادهها استفاده کردند[1].
در آموزش از روش یادگیری برنامهدرسی (curriculum learning) استفاده شد که در آن نسبت انواع دادهها در مراحل مختلف تغییر میکرد. بهعنوان مثال، بخش پایانی آموزش به معرفی تدریجی وظایف پیچیده اختصاص یافت که به گفته توسعهدهندگان بهبود محسوسی در کیفیت ایجاد کرد. آموزش روی خوشهای متشکل از ۳۰۷۲ GPU از نوع Nvidia H100 انجام شد.
پس از پیشآموزش، مدل پایه fine-tuning تکمیلی (instruction tuning) را برای ایجاد نسخه تعاملی DBRX Instruct که برای اجرای دستورالعملهای کاربر بهینهسازی شده، گذراند.
کارایی
در زمان انتشار، DBRX استانداردی جدید برای کیفیت LLMهای متنباز در طیف گستردهای از benchmarkها تعیین کرد.
مقایسه با مدلهای متنباز
| Benchmark | وظیفه | DBRX Instruct | بهترین بعدی (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | دانش عمومی | 74.5% | 72.7% (Mixtral Instruct) |
| HumanEval | برنامهنویسی | 70.1% | 63.2% (Grok-1) |
| GSM8K | استدلال ریاضی | 66.9% | 62.9% (Grok-1) |
| MMLU | دانش عمومی | 73.7% | 71.5% (Mixtral Instruct) |
DBRX هم در رتبهبندی کلی Hugging Face Open LLM Leaderboard و هم در آزمون جامع Databricks LLM Gauntlet مقام اول را به دست آورد و فاصله قابل توجهی از پیشینیان خود نشان داد[1].
مقایسه با مدلهای بسته
DBRX Instruct در تعدادی از شاخصهای کلیدی از جمله MMLU (73.7% در برابر 70.0%) و HumanEval (70.1% در برابر 48.1%) از GPT-3.5 Turbo پیشی میگیرد. از نظر کیفیت پاسخها در برخی benchmarkها (مثلاً MTBench) این مدل به سطح Gemini 1.0 Pro و نسخههای اولیه GPT-4 نزدیک میشود[1].
بهرهوری آموزش و استنتاج
- بهرهوری آموزش: استفاده از معماری MoE امکان کاهش هزینهها از نظر FLOPS را به میزان ۲ تا ۴ برابر در مقایسه با مدلهای متراکم با کیفیت مشابه فراهم ساخت.
- بهرهوری استنتاج: با فعالسازی تنها ۳۶ میلیارد پارامتر، DBRX ۲ تا ۳ برابر توان عملیاتی (سرعت استنتاج) بیشتری نسبت به مدلهای متراکم با اندازه معادل (مانند LLaMA2-70B) ارائه میدهد[1].
مجوز و دسترسی
DBRX تحت مجوز ویژهای به نام Databricks Open Model License توزیع میشود. این مجوز استفاده و تغییر آزاد از جمله کاربرد تجاری را مجاز میداند، اما دارای برخی محدودیتها است. بهویژه، مانند مجوز LLaMA 2، در صورتی که سرویسهای مبتنی بر DBRX توسط بیش از ۷۰۰ میلیون کاربر فعال ماهانه استفاده شوند، دریافت مجوز جداگانه از Databricks الزامی است.
وزنهای پیشآموزشدیده مدل (نسخه پایه و Instruct) از طریق مخزن Hugging Face برای دانلود در دسترس هستند[4].
منابع
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [۱]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [۲]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [۳]
- ↑ «databricks/dbrx-base». Hugging Face. [۴]