DBRX (language model) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — یہ ایک اوپن سورس بڑا لسانی ماڈل (LLM) ہے، جسے Databricks کمپنی کے تحقیقاتی ادارے Mosaic AI نے تیار کیا ہے۔ یہ ماڈل باضابطہ طور پر 27 مارچ 2024 کو جاری کیا گیا اور اسے کاروباری استعمال کے لیے ایک اعلیٰ کارکردگی والے حل کے طور پر پیش کیا گیا ہے[1]۔

DBRX باریک دانے دار مرکبِ ماہرین (MoE) آرکیٹیکچر پر تعمیر کی گئی ہے اور اعلیٰ کارکردگی کو تربیت اور inference کی کارآمدی کے ساتھ یکجا کرتی ہے۔ اپنے اجراء کے وقت DBRX نے تمام اوپن ماڈلز میں اہم benchmarks پر بہترین نتائج دکھائے، جیسے کہ LLaMA 2، Mixtral اور Grok-1 کو پیچھے چھوڑتے ہوئے، اور GPT-3.5 Turbo جیسے بند ماڈلز سے مسابقت کی صلاحیت ظاہر کی[2]۔

تاریخِ ترقی

DBRX کا ظہور Databricks کی اوپن سورس جنریٹو ماڈلز کی ترقی کی حکمتِ عملی کا تسلسل ہے۔ جون 2023 میں Databricks نے بڑے ماڈلز کی تربیت میں مہارت رکھنے والے اسٹارٹ اپ MosaicML کو حاصل کیا، اور اس کی بنیاد پر Mosaic AI ڈویژن تشکیل دیا گیا[3]۔

Mosaic AI کی ٹیم، جس کی قیادت نیورل نیٹ ورک کے سرکردہ معمار جوناتھن فرینکل نے کی، نے ایک نئے بڑے LLM کی تیاری شروع کی جس کا مقصد بہترین proprietary نظاموں کے ہم پلہ معیار حاصل کرنا تھا، لیکن اوپن سورس شکل میں۔ اس منصوبے کو DBRX کا نام دیا گیا۔ ماڈل کی تیاری اور pre-training میں تقریباً ڈھائی مہینے لگے اور اندازاً $10 ملین لاگت آئی[3]۔

آرکیٹیکچر

DBRX ایک decoder-only transformer ماڈل ہے اور باریک دانے دار (fine-grained) مرکبِ ماہرین (MoE) آرکیٹیکچر کو نافذ کرتی ہے۔

آرکیٹیکچر کی اہم خصوصیات:

  • پیرامیٹرز کی کل تعداد: 132 ارب۔
  • ماہرین: ماڈل 16 چھوٹے مخصوص ذیلی ماڈلز («ماہرین») پر مشتمل ہے۔
  • فعال سازی کا طریقہ کار: ہر input token کے لیے 16 میں سے صرف 4 ماہرین فعال ہوتے ہیں۔ اس کا مطلب یہ ہے کہ inference کے دوران صرف 36 ارب پیرامیٹرز فعال رہتے ہیں، جو اعلیٰ رفتار اور کارآمدی یقینی بناتے ہیں۔ یہ اسکیم Mixtral ماڈل (8 ماہرین، 2 فعال) کے مقابلے میں ماہرین کے 65 گنا زیادہ ممکنہ امتزاجات فراہم کرتی ہے[1]۔
  • اجزاء: جدید آرکیٹیکچرل حل استعمال کیے گئے ہیں، جیسے کہ گردشی پوزیشنل embeddings (RoPEgated linear units (GLU) اور grouped query attention (GQA
  • سیاق کی لمبائی: 32,768 tokens۔

یہ آرکیٹیکچر ماڈل کو پیرامیٹرز کی بے حد تعداد (علم کے ذخیرے کے لیے) اور چھوٹے ماڈلز کی کارآمدی (آؤٹ پٹ کی رفتار کے لیے) کے فوائد کو یکجا کرنے کی صلاحیت دیتی ہے۔

تربیت

DBRX کی pre-training متون اور کوڈ پر مشتمل 12 ٹریلین tokens کے احتیاط سے منتخب کردہ dataset پر کی گئی۔ ڈیٹا کا معیار ایک اہم ترجیح تھی: ڈویلپرز نے ڈیٹا کی صفائی، تیاری اور آڈٹ کے لیے Databricks کا کلاؤڈ پلیٹ فارم (Apache Spark، Databricks Notebooks، Unity Catalog) استعمال کیا[1]۔

تربیت کے دوران curriculum learning کا طریقہ استعمال کیا گیا، جس میں مختلف مراحل پر ڈیٹا کی اقسام کا تناسب تبدیل کیا گیا۔ مثلاً، تربیت کا آخری حصہ مشکل مسائل کے تدریجی تعارف کے لیے مختص تھا، جس سے ڈویلپرز کے بقول معیار میں قابلِ ذکر بہتری آئی۔ تربیت 3072 Nvidia H100 GPU کے کلسٹر پر کی گئی۔

پری ٹریننگ کے بعد بنیادی ماڈل کو صارف کی ہدایات پر عمل کرنے کے لیے بہتر بنائے گئے انٹرایکٹو ورژن DBRX Instruct بنانے کے لیے اضافی fine-tuning (instruction tuning) سے گزارا گیا۔

کارکردگی

اپنے اجراء کے وقت DBRX نے benchmarks کی ایک وسیع رینج پر اوپن LLMs کے لیے ایک نیا معیار قائم کیا۔

اوپن ماڈلز سے موازنہ

اہم benchmarks پر DBRX Instruct کے نتائج[1]
Benchmark مسئلے کی نوعیت DBRX Instruct اگلا بہترین (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) عمومی علم 74.5% 72.7% (Mixtral Instruct)
HumanEval پروگرامنگ 70.1% 63.2% (Grok-1)
GSM8K ریاضیاتی استدلال 66.9% 62.9% (Grok-1)
MMLU عمومی علم 73.7% 71.5% (Mixtral Instruct)

DBRX نے Hugging Face Open LLM Leaderboard کی مجموعی درجہ بندی اور Databricks LLM Gauntlet کے جامع ٹیسٹ دونوں میں پہلا مقام حاصل کیا، اور اپنے پیش روؤں پر نمایاں برتری دکھائی[1]۔

بند ماڈلز سے موازنہ

DBRX Instruct متعدد اہم اشاریوں پر GPT-3.5 Turbo سے بہتر کارکردگی دکھاتی ہے، جن میں MMLU (73.7% بمقابلہ 70.0%) اور HumanEval (70.1% بمقابلہ 48.1%) شامل ہیں۔ بعض benchmarks (مثلاً MTBench) پر جوابات کے معیار کے اعتبار سے ماڈل Gemini 1.0 Pro اور GPT-4 کے ابتدائی ورژنز کے قریب پہنچتی ہے[1]۔

تربیت اور inference کی کارآمدی

  • تربیت کی کارآمدی: MoE آرکیٹیکچر کے استعمال سے ہم معیار کثیف ماڈلز کے مقابلے میں FLOPS لاگت 2 سے 4 گنا کم ہوئی۔
  • Inference کی کارآمدی: صرف 36 ارب پیرامیٹرز فعال ہونے کی وجہ سے DBRX یکساں سائز کے کثیف ماڈلز (مثلاً LLaMA2-70B) کے مقابلے میں 2 سے 3 گنا زیادہ throughput (آؤٹ پٹ رفتار) فراہم کرتی ہے[1]۔

لائسنسنگ اور دستیابی

DBRX خصوصی طور پر تیار کردہ Databricks Open Model License کے تحت تقسیم کی جاتی ہے۔ یہ لائسنس تجارتی استعمال سمیت آزادانہ استعمال اور ترمیم کی اجازت دیتا ہے، لیکن اس میں کچھ پابندیاں بھی شامل ہیں۔ خاص طور پر، LLaMA 2 کے لائسنس کی طرح، اس میں یہ شرط ہے کہ اگر DBRX پر مبنی سروسز ماہانہ 70 کروڑ سے زیادہ فعال صارفین استعمال کریں تو Databricks سے علیحدہ اجازت لینا ضروری ہے۔

ماڈل کے pre-trained وزن (بنیادی اور Instruct ورژن دونوں) Hugging Face پر موجود ریپوزٹری سے ڈاؤن لوڈ کے لیے دستیاب ہیں[4]۔

حوالہ جات

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

حواشی

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
  4. «databricks/dbrx-base». Hugging Face. [4]