DBRX (language model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — یک مدل زبانی بزرگ (LLM) متن‌باز است که توسط تیم پژوهشی Mosaic AI در شرکت Databricks توسعه یافته است. این مدل به‌طور رسمی در ۲۷ مارس ۲۰۲۴ منتشر شد و به‌عنوان یک راه‌حل پرکارایی برای استفاده سازمانی معرفی می‌شود[1].

DBRX بر پایه معماری دانه‌ریز ترکیب متخصصان (MoE) ساخته شده و کارایی بالا را با بهره‌وری در آموزش و استنتاج ترکیب می‌کند. در زمان انتشار، DBRX بهترین نتایج را در میان تمام مدل‌های متن‌باز در benchmark‌های کلیدی به دست آورد و مدل‌هایی نظیر LLaMA 2، Mixtral و Grok-1 را پشت سر گذاشت و رقابت‌پذیری خود را با مدل‌های بسته در سطح GPT-3.5 Turbo نشان داد[2].

تاریخچه توسعه

ظهور DBRX ادامه استراتژی Databricks در توسعه مدل‌های مولد متن‌باز بود. در ژوئن ۲۰۲۳، Databricks استارتاپ MosaicML را که در آموزش مدل‌های بزرگ تخصص داشت، خریداری کرد و بر پایه آن بخش Mosaic AI را تأسیس نمود[3].

تیم Mosaic AI به رهبری معمار ارشد شبکه‌های عصبی، جاناتان فرانکل، توسعه یک LLM بزرگ جدید را با هدف دستیابی به کیفیتی قابل مقایسه با بهترین سیستم‌های اختصاصی اما در قالب متن‌باز آغاز کرد. این پروژه نام DBRX گرفت. توسعه و پیش‌آموزش مدل حدود ۲.۵ ماه طول کشید و هزینه آن به‌طور تقریبی ۱۰ میلیون دلار برآورد شده است[3].

معماری

DBRX یک مدل transformer از نوع فقط-رمزگشا (decoder-only) است و معماری دانه‌ریز (fine-grained) ترکیب متخصصان (MoE) را پیاده‌سازی می‌کند.

ویژگی‌های کلیدی معماری:

  • تعداد کل پارامترها: ۱۳۲ میلیارد.
  • متخصصان: مدل از ۱۶ زیرمدل تخصصی کوچک («متخصص») تشکیل شده است.
  • مکانیزم فعال‌سازی: برای هر token ورودی تنها ۴ متخصص از ۱۶ متخصص فعال می‌شوند. این بدان معناست که در زمان استنتاج تنها ۳۶ میلیارد پارامتر فعال هستند که سرعت و بهره‌وری بالایی را تضمین می‌کند. این طرح ۶۵ برابر بیشتر از مدل Mixtral (۸ متخصص با فعال‌سازی ۲) ترکیب‌های ممکن متخصصان را فراهم می‌آورد[1].
  • اجزاء: از راه‌حل‌های معماری مدرن نظیر embedding‌های موقعیتی چرخشی (RoPEgated linear units (GLU) و grouped query attention (GQA) استفاده می‌شود.
  • طول زمینه: ۳۲٬۷۶۸ token.

چنین معماری‌ای به مدل امکان می‌دهد مزایای تعداد عظیم پارامترها (برای ذخیره دانش) را با بهره‌وری مدل‌های کوچک‌تر (برای سرعت استنتاج) ترکیب کند.

آموزش

پیش‌آموزش DBRX روی یک dataset با کیفیت بالا به حجم ۱۲ تریلیون token شامل متون و کد انجام شد. کیفیت داده‌ها اولویت اصلی بود: توسعه‌دهندگان از پلتفرم ابری Databricks (Apache Spark، Databricks Notebooks، Unity Catalog) برای پاک‌سازی، آماده‌سازی و ممیزی داده‌ها استفاده کردند[1].

در آموزش از روش یادگیری برنامه‌درسی (curriculum learning) استفاده شد که در آن نسبت انواع داده‌ها در مراحل مختلف تغییر می‌کرد. به‌عنوان مثال، بخش پایانی آموزش به معرفی تدریجی وظایف پیچیده اختصاص یافت که به گفته توسعه‌دهندگان بهبود محسوسی در کیفیت ایجاد کرد. آموزش روی خوشه‌ای متشکل از ۳۰۷۲ GPU از نوع Nvidia H100 انجام شد.

پس از پیش‌آموزش، مدل پایه fine-tuning تکمیلی (instruction tuning) را برای ایجاد نسخه تعاملی DBRX Instruct که برای اجرای دستورالعمل‌های کاربر بهینه‌سازی شده، گذراند.

کارایی

در زمان انتشار، DBRX استانداردی جدید برای کیفیت LLM‌های متن‌باز در طیف گسترده‌ای از benchmark‌ها تعیین کرد.

مقایسه با مدل‌های متن‌باز

نتایج DBRX Instruct در benchmark‌های کلیدی[1]
Benchmark وظیفه DBRX Instruct بهترین بعدی (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) دانش عمومی 74.5% 72.7% (Mixtral Instruct)
HumanEval برنامه‌نویسی 70.1% 63.2% (Grok-1)
GSM8K استدلال ریاضی 66.9% 62.9% (Grok-1)
MMLU دانش عمومی 73.7% 71.5% (Mixtral Instruct)

DBRX هم در رتبه‌بندی کلی Hugging Face Open LLM Leaderboard و هم در آزمون جامع Databricks LLM Gauntlet مقام اول را به دست آورد و فاصله قابل توجهی از پیشینیان خود نشان داد[1].

مقایسه با مدل‌های بسته

DBRX Instruct در تعدادی از شاخص‌های کلیدی از جمله MMLU (73.7% در برابر 70.0%) و HumanEval (70.1% در برابر 48.1%) از GPT-3.5 Turbo پیشی می‌گیرد. از نظر کیفیت پاسخ‌ها در برخی benchmark‌ها (مثلاً MTBench) این مدل به سطح Gemini 1.0 Pro و نسخه‌های اولیه GPT-4 نزدیک می‌شود[1].

بهره‌وری آموزش و استنتاج

  • بهره‌وری آموزش: استفاده از معماری MoE امکان کاهش هزینه‌ها از نظر FLOPS را به میزان ۲ تا ۴ برابر در مقایسه با مدل‌های متراکم با کیفیت مشابه فراهم ساخت.
  • بهره‌وری استنتاج: با فعال‌سازی تنها ۳۶ میلیارد پارامتر، DBRX ۲ تا ۳ برابر توان عملیاتی (سرعت استنتاج) بیشتری نسبت به مدل‌های متراکم با اندازه معادل (مانند LLaMA2-70B) ارائه می‌دهد[1].

مجوز و دسترسی

DBRX تحت مجوز ویژه‌ای به نام Databricks Open Model License توزیع می‌شود. این مجوز استفاده و تغییر آزاد از جمله کاربرد تجاری را مجاز می‌داند، اما دارای برخی محدودیت‌ها است. به‌ویژه، مانند مجوز LLaMA 2، در صورتی که سرویس‌های مبتنی بر DBRX توسط بیش از ۷۰۰ میلیون کاربر فعال ماهانه استفاده شوند، دریافت مجوز جداگانه از Databricks الزامی است.

وزن‌های پیش‌آموزش‌دیده مدل (نسخه پایه و Instruct) از طریق مخزن Hugging Face برای دانلود در دسترس هستند[4].

منابع

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [۱]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [۲]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [۳]
  4. «databricks/dbrx-base». Hugging Face. [۴]