---
title: "DBRX (language model) (KO)"
source: "https://systems-analysis.info/int/DBRX_(language_model)_(KO)"
wiki: "systems-analysis.info/int"
article: "DBRX_(language_model)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1400
wiki_created_at: 2026-09-06T22:48:07Z
wiki_modified_at: 2026-09-06T22:48:07Z
downloaded_at: 2026-09-07T22:45:52Z
---

# DBRX (language model) (KO)

**DBRX** — 는 Databricks 산하 Mosaic AI 연구팀이 개발한 오픈 대형 언어 모델(LLM)입니다. 이 모델은 2024년 3월 27일에 공식 출시되었으며, 기업용 고성능 솔루션으로 포지셔닝되어 있습니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.

DBRX는 세밀한(fine-grained) **혼합 전문가(MoE)** 아키텍처를 기반으로 구축되었으며, 높은 성능과 학습 및 추론의 효율성을 결합하고 있습니다. 출시 당시 DBRX는 주요 benchmark에서 모든 오픈 모델 중 최고의 결과를 기록하였으며, LLaMA 2, Mixtral, Grok-1 등의 모델을 능가하고 GPT-3.5 Turbo 수준의 클로즈드 모델과 경쟁력 있는 성능을 보여주었습니다<sup>[\[2\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-infoworld_dbrx-2)</sup>.

## 개발 역사

DBRX의 등장은 오픈 생성형 모델 발전을 위한 Databricks의 전략적 방향의 연장선상에 있습니다. 2023년 6월, Databricks는 대형 모델 학습을 전문으로 하는 스타트업 **MosaicML**을 인수하였고, 이를 기반으로 **Mosaic AI** 부문이 창설되었습니다<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-techcrunch_dbrx_10m-3)</sup>.

신경망 수석 아키텍트 Jonathan Frankle이 이끄는 Mosaic AI 팀은 오픈 형식으로 최고의 독점 시스템에 필적하는 품질을 달성하는 것을 목표로 새로운 대규모 LLM 개발에 착수하였습니다. 이 프로젝트는 DBRX라는 이름을 갖게 되었습니다. 모델의 개발 및 사전 학습에는 약 2.5개월이 소요되었으며, 비용은 약 **1,000만 달러**로 추산됩니다<sup>[\[3\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-techcrunch_dbrx_10m-3)</sup>.

## 아키텍처

DBRX는 **디코더 전용**(*decoder-only*) 트랜스포머 모델로, 세밀한(*fine-grained*) 혼합 전문가(MoE) 아키텍처를 구현하고 있습니다.

아키텍처의 주요 특징:

- **총 파라미터 수**: 1,320억 개.
- **전문가**: 모델은 **16**개의 소형 특화 서브모델(「전문가」)로 구성됩니다.
- **활성화 메커니즘**: 각 입력 token에 대해 16개의 전문가 중 **4**개만 활성화됩니다. 이는 추론 시 **360억** 개의 파라미터만 활성 상태임을 의미하며, 높은 속도와 효율성을 보장합니다. 이 방식은 Mixtral(전문가 8개, 활성화 2개)과 비교하여 가능한 전문가 조합의 수가 65배 더 많습니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.
- **구성 요소**: 회전 위치 embedding(**RoPE**), *gated linear units*(**GLU**), *grouped query attention*(**GQA**) 등 최신 아키텍처 기법이 사용됩니다.
- **컨텍스트 길이**: 32,768 token.

이러한 아키텍처를 통해 모델은 방대한 파라미터 수(지식 저장 목적)의 장점과 소형 모델의 효율성(추론 속도 목적)을 결합할 수 있습니다.

## 학습

DBRX의 사전 학습은 텍스트와 코드로 구성된 **12조** 개 token 규모의 정밀하게 큐레이션된 dataset에서 수행되었습니다. 데이터 품질이 핵심 우선순위였으며, 개발팀은 Databricks 클라우드 플랫폼(Apache Spark, Databricks Notebooks, Unity Catalog)을 활용하여 데이터 정제, 준비 및 감사를 수행하였습니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.

학습 과정에서는 **커리큘럼 학습**(*curriculum learning*) 방법이 적용되었으며, 단계마다 데이터 유형의 비율이 변화하였습니다. 예를 들어, 학습의 마지막 단계에서는 난이도 높은 과제를 점진적으로 도입하는 방식이 활용되었으며, 개발자들에 따르면 이를 통해 품질이 눈에 띄게 향상되었습니다. 학습은 **3,072**개의 Nvidia H100 GPU 클러스터에서 진행되었습니다.

사전 학습 이후, 기본 모델은 사용자 지시 수행에 최적화된 대화형 버전인 **DBRX Instruct** 생성을 위해 추가적인 fine-tuning(instruction tuning)을 거쳤습니다.

## 성능

출시 당시 DBRX는 광범위한 benchmark에서 오픈 LLM의 새로운 품질 기준을 수립하였습니다.

### 오픈 모델과의 비교

| Benchmark                                   | 과제        | DBRX Instruct | 차순위 (Mixtral/Grok-1)  |
|---------------------------------------------|-------------|---------------|--------------------------|
| **Hugging Face Open LLM Leaderboard (AVG)** | 일반 지식   | 74.5%         | 72.7% (Mixtral Instruct) |
| **HumanEval**                               | 프로그래밍  | 70.1%         | 63.2% (Grok-1)           |
| **GSM8K**                                   | 수학적 추론 | 66.9%         | 62.9% (Grok-1)           |
| **MMLU**                                    | 일반 지식   | 73.7%         | 71.5% (Mixtral Instruct) |

주요 benchmark에서의 DBRX Instruct 결과<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>

DBRX는 **Hugging Face Open LLM Leaderboard** 종합 순위와 **Databricks LLM Gauntlet** 종합 테스트 모두에서 1위를 차지하며 이전 모델들과의 큰 격차를 입증하였습니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.

### 클로즈드 모델과의 비교

DBRX Instruct는 MMLU(73.7% 대 70.0%) 및 HumanEval(70.1% 대 48.1%)을 포함한 일부 주요 지표에서 **GPT-3.5 Turbo**를 능가합니다. 일부 benchmark(예: MTBench)에서는 **Gemini 1.0 Pro** 및 초기 버전의 **GPT-4** 수준에 근접하고 있습니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.

## 학습 및 추론 효율성

- **학습 효율성**: MoE 아키텍처의 활용으로 동등한 품질의 밀집(dense) 모델 대비 FLOPS 비용을 2~4배 절감할 수 있었습니다.
- **추론 효율성**: 360억 개의 파라미터만 활성화됨으로써 DBRX는 동일 규모의 밀집 모델(예: LLaMA2-70B) 대비 **2~3배** 더 높은 처리량(추론 속도)을 제공합니다<sup>[\[1\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-dbrx_blog-1)</sup>.

## 라이선싱 및 접근성

DBRX는 특별히 개발된 **Databricks Open Model License** 라이선스 하에 배포됩니다. 이 라이선스는 상업적 활용을 포함한 자유로운 사용 및 수정을 허용하지만 일부 제한 사항을 포함하고 있습니다. 특히 LLaMA 2 라이선스와 마찬가지로, DBRX 기반 서비스의 월간 활성 사용자가 **7억 명**을 초과할 경우 Databricks로부터 별도의 허가를 받아야 합니다.

기본 모델 및 Instruct 버전의 사전 학습된 가중치는 Hugging Face 저장소를 통해 다운로드 가능합니다<sup>[\[4\]](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_note-huggingface_dbrx-4)</sup>.

## 참고 문헌

- Mosaic Research Team. (2024). *Introducing DBRX: A New State‑of‑the‑Art Open LLM*. Databricks Blog.
- Databricks. (2024). *Databricks Open Model License (DBRX)*. Online specification.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). *Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers*. arXiv:2305.13245.
- Su, J.; et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Dao, T. (2023). *FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning*. arXiv:2307.08691.
- Cai, W.; et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Chen, Y.; et al. (2024). *Scaling Laws for Fine‑Grained Mixture of Experts*. arXiv:2402.07871.
- Kundu, A.; et al. (2024). *Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning*. arXiv:2405.07490.

## 각주

1.  <span id="cite_note-dbrx_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-dbrx_blog_1-6)</sup> «Introducing DBRX: A New State-of-the-Art Open LLM». *Databricks Blog*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-infoworld_dbrx-2">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-infoworld_dbrx_2-0) «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». *InfoWorld*. <a href="https://www.infoworld.com/article/3714625/databricks-open-source-dbrx-llm-beats-llama-2-mixtral-and-grok.html" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-techcrunch_dbrx_10m-3">↑ <sup>[3.0](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-techcrunch_dbrx_10m_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-techcrunch_dbrx_10m_3-1)</sup> «Databricks spent \$10M on new DBRX generative AI model». *TechCrunch*. <a href="https://techcrunch.com/2024/03/27/databricks-spent-10m-on-a-generative-ai-model-that-still-cant-beat-gpt-4/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_dbrx-4">[↑](https://systems-analysis.info/int/DBRX_(language_model)_(KO)#cite_ref-huggingface_dbrx_4-0) «databricks/dbrx-base». *Hugging Face*. <a href="https://huggingface.co/databricks/dbrx-base" class="external autonumber" rel="nofollow">[4]</a></span>
