DBRX
DBRX — это открытая большая языковая модель (LLM), разработанная исследовательской командой Mosaic AI в составе компании Databricks. Модель была официально выпущена 27 марта 2024 года и позиционируется как высокопроизводительное решение для корпоративного использования[1].
DBRX построена на тонкозернистой архитектуре смеси экспертов (MoE) и сочетает высокую производительность с эффективностью обучения и инференса. На момент выпуска DBRX продемонстрировала лучшие результаты среди всех открытых моделей на ключевых бенчмарках, превзойдя такие модели, как LLaMA 2, Mixtral и Grok-1, и показав конкурентоспособность с закрытыми моделями уровня GPT-3.5 Turbo[2].
История разработки
Появление DBRX стало продолжением стратегии Databricks по развитию открытых генеративных моделей. В июне 2023 года Databricks приобрела стартап MosaicML, специализировавшийся на обучении больших моделей, и на его базе было создано подразделение Mosaic AI[3].
Команда Mosaic AI, возглавляемая ведущим архитектором нейросетей Джонатаном Франклом, приступила к разработке нового крупного LLM с целью достичь качества, сопоставимого с лучшими проприетарными системами, но в открытом формате. Проект получил название DBRX. Разработка и предобучение модели заняли около 2,5 месяцев и, по оценкам, стоили около $10 млн[3].
Архитектура
DBRX является трансформерной моделью типа декодер-только (decoder-only) и реализует тонкозернистую (fine-grained) архитектуру смеси экспертов (MoE).
Ключевые особенности архитектуры:
- Общее число параметров: 132 миллиарда.
- Эксперты: Модель состоит из 16 небольших специализированных подмоделей («экспертов»).
- Механизм активации: Для каждого входного токена активируются только 4 из 16 экспертов. Это означает, что при инференсе активны лишь 36 млрд параметров, что обеспечивает высокую скорость и эффективность. Такая схема дает в 65 раз больше возможных комбинаций экспертов по сравнению с моделью Mixtral (8 экспертов с активацией 2)[1].
- Компоненты: Используются современные архитектурные решения, такие как вращательные позиционные эмбеддинги (RoPE), gated linear units (GLU) и grouped query attention (GQA).
- Длина контекста: 32 768 токенов.
Такая архитектура позволяет модели сочетать преимущества огромного числа параметров (для хранения знаний) с эффективностью меньших моделей (для скорости вывода).
Обучение
Предобучение DBRX проводилось на тщательно курируемом датасете объемом 12 триллионов токенов, состоящем из текстов и кода. Качество данных было ключевым приоритетом: разработчики использовали облачную платформу Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) для очистки, подготовки и аудита данных[1].
При обучении применялся метод курсового обучения (curriculum learning), при котором на разных стадиях менялась пропорция типов данных. Например, финальная часть тренировки была посвящена дозированному введению сложных задач, что, по словам разработчиков, дало ощутимый прирост качества. Обучение проводилось на кластере из 3072 Nvidia H100 GPU.
После предобучения базовая модель прошла дополнительную тонкую настройку (instruction tuning) для создания интерактивной версии DBRX Instruct, оптимизированной для выполнения инструкций пользователя.
Производительность
На момент выпуска DBRX установила новый стандарт качества для открытых LLM на широком спектре бенчмарков.
Сравнение с открытыми моделями
| Бенчмарк | Задача | DBRX Instruct | Следующий лучший (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Общие знания | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Программирование | 70,1% | 63,2% (Grok-1) |
| GSM8K | Математические рассуждения | 66,9% | 62,9% (Grok-1) |
| MMLU | Общие знания | 73,7% | 71,5% (Mixtral Instruct) |
DBRX заняла первое место как в общем рейтинге Hugging Face Open LLM Leaderboard, так и в комплексном тесте Databricks LLM Gauntlet, продемонстрировав значительный отрыв от предшественников[1].
Сравнение с закрытыми моделями
DBRX Instruct превосходит GPT-3.5 Turbo по ряду ключевых показателей, включая MMLU (73,7% против 70,0%) и HumanEval (70,1% против 48,1%). По качеству ответов на некоторых бенчмарках (например, MTBench) модель приближается к уровню Gemini 1.0 Pro и ранним версиям GPT-4[1].
Эффективность обучения и инференса
- Эффективность обучения: Использование архитектуры MoE позволило сократить затраты в FLOPS в 2-4 раза по сравнению с аналогичными по качеству плотными моделями.
- Эффективность инференса: За счет активации только 36 млрд параметров DBRX обеспечивает в 2-3 раза большую пропускную способность (скорость вывода) по сравнению с плотными моделями эквивалентного размера (например, LLaMA2-70B)[1].
Лицензирование и доступность
DBRX распространяется под специально разработанной лицензией Databricks Open Model License. Она допускает свободное использование и модификацию, включая коммерческое применение, но содержит ряд ограничений. В частности, как и лицензия LLaMA 2, она требует получения отдельного разрешения от Databricks, если сервисы на базе DBRX будут использоваться аудиторией свыше 700 миллионов активных пользователей в месяц.
Предобученные веса модели (базовой и Instruct-версии) доступны для скачивания через репозиторий на Hugging Face[4].
См. также
Литература
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Примечания
- ↑ 1,0 1,1 1,2 1,3 1,4 1,5 1,6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3,0 3,1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]