---
title: "DBRX (language model) (UR)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(UR)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 1408
wiki_created_at: 2026-09-06T22:48:15Z
wiki_modified_at: 2026-09-06T22:48:15Z
downloaded_at: 2026-09-07T22:45:55Z
---

# DBRX (language model) (UR)

**DBRX** — یہ ایک اوپن سورس بڑا لسانی ماڈل (LLM) ہے، جسے Databricks کمپنی کے تحقیقاتی ادارے Mosaic AI نے تیار کیا ہے۔ یہ ماڈل باضابطہ طور پر 27 مارچ 2024 کو جاری کیا گیا اور اسے کاروباری استعمال کے لیے ایک اعلیٰ کارکردگی والے حل کے طور پر پیش کیا گیا ہے<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔

DBRX باریک دانے دار **مرکبِ ماہرین (MoE)** آرکیٹیکچر پر تعمیر کی گئی ہے اور اعلیٰ کارکردگی کو تربیت اور inference کی کارآمدی کے ساتھ یکجا کرتی ہے۔ اپنے اجراء کے وقت DBRX نے تمام اوپن ماڈلز میں اہم benchmarks پر بہترین نتائج دکھائے، جیسے کہ LLaMA 2، Mixtral اور Grok-1 کو پیچھے چھوڑتے ہوئے، اور GPT-3.5 Turbo جیسے بند ماڈلز سے مسابقت کی صلاحیت ظاہر کی<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-infoworld_dbrx-2)</sup>۔

## تاریخِ ترقی

DBRX کا ظہور Databricks کی اوپن سورس جنریٹو ماڈلز کی ترقی کی حکمتِ عملی کا تسلسل ہے۔ جون 2023 میں Databricks نے بڑے ماڈلز کی تربیت میں مہارت رکھنے والے اسٹارٹ اپ **MosaicML** کو حاصل کیا، اور اس کی بنیاد پر **Mosaic AI** ڈویژن تشکیل دیا گیا<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-techcrunch_dbrx_10m-3)</sup>۔

Mosaic AI کی ٹیم، جس کی قیادت نیورل نیٹ ورک کے سرکردہ معمار جوناتھن فرینکل نے کی، نے ایک نئے بڑے LLM کی تیاری شروع کی جس کا مقصد بہترین proprietary نظاموں کے ہم پلہ معیار حاصل کرنا تھا، لیکن اوپن سورس شکل میں۔ اس منصوبے کو DBRX کا نام دیا گیا۔ ماڈل کی تیاری اور pre-training میں تقریباً ڈھائی مہینے لگے اور اندازاً **\$10 ملین** لاگت آئی<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-techcrunch_dbrx_10m-3)</sup>۔

## آرکیٹیکچر

DBRX ایک **decoder-only** transformer ماڈل ہے اور باریک دانے دار (*fine-grained*) مرکبِ ماہرین (MoE) آرکیٹیکچر کو نافذ کرتی ہے۔

آرکیٹیکچر کی اہم خصوصیات:

- **پیرامیٹرز کی کل تعداد**: 132 ارب۔
- **ماہرین**: ماڈل **16** چھوٹے مخصوص ذیلی ماڈلز («ماہرین») پر مشتمل ہے۔
- **فعال سازی کا طریقہ کار**: ہر input token کے لیے 16 میں سے صرف **4** ماہرین فعال ہوتے ہیں۔ اس کا مطلب یہ ہے کہ inference کے دوران صرف **36 ارب** پیرامیٹرز فعال رہتے ہیں، جو اعلیٰ رفتار اور کارآمدی یقینی بناتے ہیں۔ یہ اسکیم Mixtral ماڈل (8 ماہرین، 2 فعال) کے مقابلے میں ماہرین کے 65 گنا زیادہ ممکنہ امتزاجات فراہم کرتی ہے<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔
- **اجزاء**: جدید آرکیٹیکچرل حل استعمال کیے گئے ہیں، جیسے کہ گردشی پوزیشنل embeddings (**RoPE**)، *gated linear units* (**GLU**) اور *grouped query attention* (**GQA**)۔
- **سیاق کی لمبائی**: 32,768 tokens۔

یہ آرکیٹیکچر ماڈل کو پیرامیٹرز کی بے حد تعداد (علم کے ذخیرے کے لیے) اور چھوٹے ماڈلز کی کارآمدی (آؤٹ پٹ کی رفتار کے لیے) کے فوائد کو یکجا کرنے کی صلاحیت دیتی ہے۔

## تربیت

DBRX کی pre-training متون اور کوڈ پر مشتمل **12 ٹریلین** tokens کے احتیاط سے منتخب کردہ dataset پر کی گئی۔ ڈیٹا کا معیار ایک اہم ترجیح تھی: ڈویلپرز نے ڈیٹا کی صفائی، تیاری اور آڈٹ کے لیے Databricks کا کلاؤڈ پلیٹ فارم (Apache Spark، Databricks Notebooks، Unity Catalog) استعمال کیا<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔

تربیت کے دوران **curriculum learning** کا طریقہ استعمال کیا گیا، جس میں مختلف مراحل پر ڈیٹا کی اقسام کا تناسب تبدیل کیا گیا۔ مثلاً، تربیت کا آخری حصہ مشکل مسائل کے تدریجی تعارف کے لیے مختص تھا، جس سے ڈویلپرز کے بقول معیار میں قابلِ ذکر بہتری آئی۔ تربیت **3072** Nvidia H100 GPU کے کلسٹر پر کی گئی۔

پری ٹریننگ کے بعد بنیادی ماڈل کو صارف کی ہدایات پر عمل کرنے کے لیے بہتر بنائے گئے انٹرایکٹو ورژن **DBRX Instruct** بنانے کے لیے اضافی fine-tuning (*instruction tuning*) سے گزارا گیا۔

## کارکردگی

اپنے اجراء کے وقت DBRX نے benchmarks کی ایک وسیع رینج پر اوپن LLMs کے لیے ایک نیا معیار قائم کیا۔

### اوپن ماڈلز سے موازنہ

| Benchmark                                   | مسئلے کی نوعیت   | DBRX Instruct | اگلا بہترین (Mixtral/Grok-1) |
|---------------------------------------------|------------------|---------------|------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | عمومی علم        | 74.5%         | 72.7% (Mixtral Instruct)     |
| **HumanEval**                               | پروگرامنگ        | 70.1%         | 63.2% (Grok-1)               |
| **GSM8K**                                   | ریاضیاتی استدلال | 66.9%         | 62.9% (Grok-1)               |
| **MMLU**                                    | عمومی علم        | 73.7%         | 71.5% (Mixtral Instruct)     |

اہم benchmarks پر DBRX Instruct کے نتائج<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>

DBRX نے **Hugging Face Open LLM Leaderboard** کی مجموعی درجہ بندی اور **Databricks LLM Gauntlet** کے جامع ٹیسٹ دونوں میں پہلا مقام حاصل کیا، اور اپنے پیش روؤں پر نمایاں برتری دکھائی<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔

### بند ماڈلز سے موازنہ

DBRX Instruct متعدد اہم اشاریوں پر **GPT-3.5 Turbo** سے بہتر کارکردگی دکھاتی ہے، جن میں MMLU (73.7% بمقابلہ 70.0%) اور HumanEval (70.1% بمقابلہ 48.1%) شامل ہیں۔ بعض benchmarks (مثلاً MTBench) پر جوابات کے معیار کے اعتبار سے ماڈل **Gemini 1.0 Pro** اور **GPT-4** کے ابتدائی ورژنز کے قریب پہنچتی ہے<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔

## تربیت اور inference کی کارآمدی

- **تربیت کی کارآمدی**: MoE آرکیٹیکچر کے استعمال سے ہم معیار کثیف ماڈلز کے مقابلے میں FLOPS لاگت 2 سے 4 گنا کم ہوئی۔
- **Inference کی کارآمدی**: صرف 36 ارب پیرامیٹرز فعال ہونے کی وجہ سے DBRX یکساں سائز کے کثیف ماڈلز (مثلاً LLaMA2-70B) کے مقابلے میں **2 سے 3 گنا** زیادہ throughput (آؤٹ پٹ رفتار) فراہم کرتی ہے<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-dbrx_blog-1)</sup>۔

## لائسنسنگ اور دستیابی

DBRX خصوصی طور پر تیار کردہ **Databricks Open Model License** کے تحت تقسیم کی جاتی ہے۔ یہ لائسنس تجارتی استعمال سمیت آزادانہ استعمال اور ترمیم کی اجازت دیتا ہے، لیکن اس میں کچھ پابندیاں بھی شامل ہیں۔ خاص طور پر، LLaMA 2 کے لائسنس کی طرح، اس میں یہ شرط ہے کہ اگر DBRX پر مبنی سروسز ماہانہ **70 کروڑ** سے زیادہ فعال صارفین استعمال کریں تو Databricks سے علیحدہ اجازت لینا ضروری ہے۔

ماڈل کے pre-trained وزن (بنیادی اور Instruct ورژن دونوں) Hugging Face پر موجود ریپوزٹری سے ڈاؤن لوڈ کے لیے دستیاب ہیں<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_note-huggingface_dbrx-4)</sup>۔

## حوالہ جات

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## حواشی

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(UR)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
