---
title: "DBRX"
source: "https://systems-analysis.info/wiki/DBRX"
wiki: "systems-analysis.info/wiki"
article: "DBRX"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 83
wiki_created_at: 2026-09-06T21:54:45Z
wiki_modified_at: 2026-09-06T21:54:45Z
downloaded_at: 2026-09-07T22:17:18Z
---

# DBRX

**DBRX** — это открытая [большая языковая модель](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM), разработанная исследовательской командой Mosaic AI в составе компании Databricks. Модель была официально выпущена 27 марта 2024 года и позиционируется как высокопроизводительное решение для корпоративного использования<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.

DBRX построена на тонкозернистой архитектуре **смеси экспертов (MoE)** и сочетает высокую производительность с эффективностью обучения и инференса. На момент выпуска DBRX продемонстрировала лучшие результаты среди всех открытых моделей на ключевых бенчмарках, превзойдя такие модели, как [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 2, [Mixtral](https://systems-analysis.info/wiki/Mixtral "Mixtral") и Grok-1, и показав конкурентоспособность с закрытыми моделями уровня GPT-3.5 Turbo<sup>[\[2\]](https://systems-analysis.info/wiki/DBRX#cite_note-infoworld_dbrx-2)</sup>.

## История разработки

Появление DBRX стало продолжением стратегии Databricks по развитию открытых генеративных моделей. В июне 2023 года Databricks приобрела стартап **MosaicML**, специализировавшийся на обучении больших моделей, и на его базе было создано подразделение **Mosaic AI**<sup>[\[3\]](https://systems-analysis.info/wiki/DBRX#cite_note-techcrunch_dbrx_10m-3)</sup>.

Команда Mosaic AI, возглавляемая ведущим архитектором нейросетей Джонатаном Франклом, приступила к разработке нового крупного LLM с целью достичь качества, сопоставимого с лучшими проприетарными системами, но в открытом формате. Проект получил название DBRX. Разработка и [предобучение](https://systems-analysis.info/wiki/%D0%9F%D1%80%D0%B5%D0%B4%D0%BE%D0%B1%D1%83%D1%87%D0%B5%D0%BD%D0%B8%D0%B5 "Предобучение") модели заняли около 2,5 месяцев и, по оценкам, стоили около **\$10 млн**<sup>[\[3\]](https://systems-analysis.info/wiki/DBRX#cite_note-techcrunch_dbrx_10m-3)</sup>.

## Архитектура

DBRX является трансформерной моделью типа **декодер-только** (*decoder-only*) и реализует тонкозернистую (*fine-grained*) архитектуру смеси экспертов (MoE).

Ключевые особенности архитектуры:

- **Общее число параметров**: 132 миллиарда.
- **Эксперты**: Модель состоит из **16** небольших специализированных подмоделей («экспертов»).
- **Механизм активации**: Для каждого входного токена активируются только **4** из 16 экспертов. Это означает, что при инференсе активны лишь **36 млрд** параметров, что обеспечивает высокую скорость и эффективность. Такая схема дает в 65 раз больше возможных комбинаций экспертов по сравнению с моделью Mixtral (8 экспертов с активацией 2)<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.
- **Компоненты**: Используются современные архитектурные решения, такие как вращательные позиционные эмбеддинги (**RoPE**), *gated linear units* (**GLU**) и *grouped query attention* (**GQA**).
- **Длина контекста**: 32 768 токенов.

Такая архитектура позволяет модели сочетать преимущества огромного числа параметров (для хранения знаний) с эффективностью меньших моделей (для скорости вывода).

## Обучение

Предобучение DBRX проводилось на тщательно курируемом датасете объемом **12 триллионов** токенов, состоящем из текстов и кода. Качество данных было ключевым приоритетом: разработчики использовали облачную платформу Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) для очистки, подготовки и аудита данных<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.

При обучении применялся метод **курсового обучения** (*curriculum learning*), при котором на разных стадиях менялась пропорция типов данных. Например, финальная часть тренировки была посвящена дозированному введению сложных задач, что, по словам разработчиков, дало ощутимый прирост качества. Обучение проводилось на кластере из **3072** Nvidia H100 GPU.

После предобучения базовая модель прошла дополнительную тонкую настройку (*instruction tuning*) для создания интерактивной версии **DBRX Instruct**, оптимизированной для выполнения инструкций пользователя.

## Производительность

На момент выпуска DBRX установила новый стандарт качества для открытых LLM на широком спектре бенчмарков.

### Сравнение с открытыми моделями

| Бенчмарк                                    | Задача                     | DBRX Instruct | Следующий лучший (Mixtral/Grok-1) |
|---------------------------------------------|----------------------------|---------------|-----------------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | Общие знания               | 74,5%         | 72,7% (Mixtral Instruct)          |
| **HumanEval**                               | Программирование           | 70,1%         | 63,2% (Grok-1)                    |
| **GSM8K**                                   | Математические рассуждения | 66,9%         | 62,9% (Grok-1)                    |
| **MMLU**                                    | Общие знания               | 73,7%         | 71,5% (Mixtral Instruct)          |

Результаты DBRX Instruct на ключевых бенчмарках<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>

DBRX заняла первое место как в общем рейтинге **Hugging Face Open LLM Leaderboard**, так и в комплексном тесте **Databricks LLM Gauntlet**, продемонстрировав значительный отрыв от предшественников<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.

### Сравнение с закрытыми моделями

DBRX Instruct превосходит **GPT-3.5 Turbo** по ряду ключевых показателей, включая MMLU (73,7% против 70,0%) и HumanEval (70,1% против 48,1%). По качеству ответов на некоторых бенчмарках (например, MTBench) модель приближается к уровню **Gemini 1.0 Pro** и ранним версиям **GPT-4**<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.

## Эффективность обучения и инференса

- **Эффективность обучения**: Использование архитектуры MoE позволило сократить затраты в FLOPS в 2-4 раза по сравнению с аналогичными по качеству плотными моделями.
- **Эффективность инференса**: За счет активации только 36 млрд параметров DBRX обеспечивает в **2-3 раза** большую пропускную способность (скорость вывода) по сравнению с плотными моделями эквивалентного размера (например, LLaMA2-70B)<sup>[\[1\]](https://systems-analysis.info/wiki/DBRX#cite_note-dbrx_blog-1)</sup>.

## Лицензирование и доступность

DBRX распространяется под специально разработанной лицензией **Databricks Open Model License**. Она допускает свободное использование и модификацию, включая коммерческое применение, но содержит ряд ограничений. В частности, как и лицензия LLaMA 2, она требует получения отдельного разрешения от Databricks, если сервисы на базе DBRX будут использоваться аудиторией свыше **700 миллионов** активных пользователей в месяц.

Предобученные веса модели (базовой и Instruct-версии) доступны для скачивания через репозиторий на Hugging Face<sup>[\[4\]](https://systems-analysis.info/wiki/DBRX#cite_note-huggingface_dbrx-4)</sup>.

## См. также

- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [BLOOM](https://systems-analysis.info/wiki/BLOOM "BLOOM")
- [Chinchilla](https://systems-analysis.info/wiki/Chinchilla "Chinchilla")
- [Claude](https://systems-analysis.info/wiki/Claude "Claude")

## Литература

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external text" rel="nofollow">Databricks Blog</a>.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. <a href="https://www.databricks.com/legal/open-model-license" class="external text" rel="nofollow">Online specification</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. <a href="https://arxiv.org/abs/2307.08691" class="external text" rel="nofollow">arXiv:2307.08691</a>.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. <a href="https://arxiv.org/abs/2402.07871" class="external text" rel="nofollow">arXiv:2402.07871</a>.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. <a href="https://arxiv.org/abs/2405.07490" class="external text" rel="nofollow">arXiv:2405.07490</a>.

## Примечания

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-3)</sup> <sup>[1,4](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-4)</sup> <sup>[1,5](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-5)</sup> <sup>[1,6](https://systems-analysis.info/wiki/DBRX#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/wiki/DBRX#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/DBRX#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/DBRX#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/wiki/DBRX#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
