DBRX (language model) (BG)
DBRX — това е отворен голям езиков модел (LLM), разработен от изследователския екип Mosaic AI в рамките на компанията Databricks. Моделът беше официално пуснат на 27 март 2024 г. и се позиционира като високопроизводително решение за корпоративна употреба[1].
DBRX е изграден върху финозърнеста архитектура смес от експерти (MoE) и съчетава висока производителност с ефективност на обучението и инференса. Към момента на пускане DBRX демонстрира най-добри резултати сред всички отворени модели на ключови benchmark-ове, надминавайки модели като LLaMA 2, Mixtral и Grok-1, и показвайки конкурентоспособност със затворени модели от нивото на GPT-3.5 Turbo[2].
История на разработката
Появата на DBRX е продължение на стратегията на Databricks за развитие на отворени генеративни модели. През юни 2023 г. Databricks придоби стартъпа MosaicML, специализиран в обучението на големи модели, и на негова основа беше създадено подразделението Mosaic AI[3].
Екипът на Mosaic AI, ръководен от водещия архитект на невронни мрежи Джонатан Франкъл, пристъпи към разработката на нов голям LLM с цел да постигне качество, съпоставимо с най-добрите проприетарни системи, но в отворен формат. Проектът получи наименованието DBRX. Разработката и предобучението на модела отнеха около 2,5 месеца и, по оценки, струваха около $10 млн[3].
Архитектура
DBRX е transformer модел от тип само-декодер (decoder-only) и реализира финозърнеста (fine-grained) архитектура смес от експерти (MoE).
Ключови особености на архитектурата:
- Общ брой параметри: 132 милиарда.
- Експерти: Моделът се състои от 16 малки специализирани подмодела („експерти").
- Механизъм на активиране: За всеки входен token се активират само 4 от 16-те експерта. Това означава, че при инференс са активни само 36 млрд параметъра, което осигурява висока скорост и ефективност. Тази схема дава 65 пъти повече възможни комбинации от експерти в сравнение с модела Mixtral (8 експерта с активиране на 2)[1].
- Компоненти: Използват се съвременни архитектурни решения като ротационни позиционни embedding-и (RoPE), gated linear units (GLU) и grouped query attention (GQA).
- Дължина на контекста: 32 768 token-а.
Тази архитектура позволява на модела да съчетава предимствата на огромния брой параметри (за съхранение на знания) с ефективността на по-малките модели (за скорост на извод).
Обучение
Предобучението на DBRX беше проведено върху внимателно курирана dataset с обем 12 трилиона token-а, съставена от текстове и код. Качеството на данните беше ключов приоритет: разработчиците използваха облачната платформа Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) за почистване, подготовка и одит на данните[1].
При обучението беше приложен методът учебна програма (curriculum learning), при който на различни етапи се променяше пропорцията на типовете данни. Например финалната част на тренировката беше посветена на дозирано въвеждане на сложни задачи, което, по думите на разработчиците, донесе осезаемо подобрение на качеството. Обучението беше проведено на клъстер от 3072 Nvidia H100 GPU.
След предобучението базовият модел премина допълнително фино настройване (instruction tuning) за създаване на интерактивна версия DBRX Instruct, оптимизирана за изпълнение на инструкции от потребителя.
Производителност
Към момента на пускане DBRX установи нов стандарт за качество сред отворените LLM на широк спектър от benchmark-ове.
Сравнение с отворени модели
| Benchmark | Задача | DBRX Instruct | Следващ най-добър (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Общи знания | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Програмиране | 70,1% | 63,2% (Grok-1) |
| GSM8K | Математически разсъждения | 66,9% | 62,9% (Grok-1) |
| MMLU | Общи знания | 73,7% | 71,5% (Mixtral Instruct) |
DBRX заема първо място както в общата класация Hugging Face Open LLM Leaderboard, така и в комплексния тест Databricks LLM Gauntlet, демонстрирайки значително изпреварване пред предшествениците си[1].
Сравнение със затворени модели
DBRX Instruct превъзхожда GPT-3.5 Turbo по редица ключови показатели, включително MMLU (73,7% срещу 70,0%) и HumanEval (70,1% срещу 48,1%). По качество на отговорите на някои benchmark-ове (например MTBench) моделът се доближава до нивото на Gemini 1.0 Pro и ранните версии на GPT-4[1].
Ефективност на обучението и инференса
- Ефективност на обучението: Използването на архитектурата MoE позволи да се намалят разходите в FLOPS 2–4 пъти в сравнение с плътни модели с аналогично качество.
- Ефективност на инференса: Благодарение на активирането само на 36 млрд параметъра DBRX осигурява 2–3 пъти по-голяма пропускателна способност (скорост на извод) в сравнение с плътни модели с еквивалентен размер (например LLaMA2-70B)[1].
Лицензиране и достъпност
DBRX се разпространява под специално разработения лиценз Databricks Open Model License. Той допуска свободно използване и модификация, включително търговско приложение, но съдържа редица ограничения. По-конкретно, подобно на лиценза LLaMA 2, той изисква получаването на отделно разрешение от Databricks, ако услугите, базирани на DBRX, ще се използват от аудитория над 700 милиона активни потребители на месец.
Предобучените тегла на модела (базовата и Instruct-версията) са достъпни за изтегляне чрез хранилището на Hugging Face[4].
Литература
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Бележки
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]