DBRX (language model) (KO)
DBRX — 는 Databricks 산하 Mosaic AI 연구팀이 개발한 오픈 대형 언어 모델(LLM)입니다. 이 모델은 2024년 3월 27일에 공식 출시되었으며, 기업용 고성능 솔루션으로 포지셔닝되어 있습니다[1].
DBRX는 세밀한(fine-grained) 혼합 전문가(MoE) 아키텍처를 기반으로 구축되었으며, 높은 성능과 학습 및 추론의 효율성을 결합하고 있습니다. 출시 당시 DBRX는 주요 benchmark에서 모든 오픈 모델 중 최고의 결과를 기록하였으며, LLaMA 2, Mixtral, Grok-1 등의 모델을 능가하고 GPT-3.5 Turbo 수준의 클로즈드 모델과 경쟁력 있는 성능을 보여주었습니다[2].
개발 역사
DBRX의 등장은 오픈 생성형 모델 발전을 위한 Databricks의 전략적 방향의 연장선상에 있습니다. 2023년 6월, Databricks는 대형 모델 학습을 전문으로 하는 스타트업 MosaicML을 인수하였고, 이를 기반으로 Mosaic AI 부문이 창설되었습니다[3].
신경망 수석 아키텍트 Jonathan Frankle이 이끄는 Mosaic AI 팀은 오픈 형식으로 최고의 독점 시스템에 필적하는 품질을 달성하는 것을 목표로 새로운 대규모 LLM 개발에 착수하였습니다. 이 프로젝트는 DBRX라는 이름을 갖게 되었습니다. 모델의 개발 및 사전 학습에는 약 2.5개월이 소요되었으며, 비용은 약 1,000만 달러로 추산됩니다[3].
아키텍처
DBRX는 디코더 전용(decoder-only) 트랜스포머 모델로, 세밀한(fine-grained) 혼합 전문가(MoE) 아키텍처를 구현하고 있습니다.
아키텍처의 주요 특징:
- 총 파라미터 수: 1,320억 개.
- 전문가: 모델은 16개의 소형 특화 서브모델(「전문가」)로 구성됩니다.
- 활성화 메커니즘: 각 입력 token에 대해 16개의 전문가 중 4개만 활성화됩니다. 이는 추론 시 360억 개의 파라미터만 활성 상태임을 의미하며, 높은 속도와 효율성을 보장합니다. 이 방식은 Mixtral(전문가 8개, 활성화 2개)과 비교하여 가능한 전문가 조합의 수가 65배 더 많습니다[1].
- 구성 요소: 회전 위치 embedding(RoPE), gated linear units(GLU), grouped query attention(GQA) 등 최신 아키텍처 기법이 사용됩니다.
- 컨텍스트 길이: 32,768 token.
이러한 아키텍처를 통해 모델은 방대한 파라미터 수(지식 저장 목적)의 장점과 소형 모델의 효율성(추론 속도 목적)을 결합할 수 있습니다.
학습
DBRX의 사전 학습은 텍스트와 코드로 구성된 12조 개 token 규모의 정밀하게 큐레이션된 dataset에서 수행되었습니다. 데이터 품질이 핵심 우선순위였으며, 개발팀은 Databricks 클라우드 플랫폼(Apache Spark, Databricks Notebooks, Unity Catalog)을 활용하여 데이터 정제, 준비 및 감사를 수행하였습니다[1].
학습 과정에서는 커리큘럼 학습(curriculum learning) 방법이 적용되었으며, 단계마다 데이터 유형의 비율이 변화하였습니다. 예를 들어, 학습의 마지막 단계에서는 난이도 높은 과제를 점진적으로 도입하는 방식이 활용되었으며, 개발자들에 따르면 이를 통해 품질이 눈에 띄게 향상되었습니다. 학습은 3,072개의 Nvidia H100 GPU 클러스터에서 진행되었습니다.
사전 학습 이후, 기본 모델은 사용자 지시 수행에 최적화된 대화형 버전인 DBRX Instruct 생성을 위해 추가적인 fine-tuning(instruction tuning)을 거쳤습니다.
성능
출시 당시 DBRX는 광범위한 benchmark에서 오픈 LLM의 새로운 품질 기준을 수립하였습니다.
오픈 모델과의 비교
| Benchmark | 과제 | DBRX Instruct | 차순위 (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | 일반 지식 | 74.5% | 72.7% (Mixtral Instruct) |
| HumanEval | 프로그래밍 | 70.1% | 63.2% (Grok-1) |
| GSM8K | 수학적 추론 | 66.9% | 62.9% (Grok-1) |
| MMLU | 일반 지식 | 73.7% | 71.5% (Mixtral Instruct) |
DBRX는 Hugging Face Open LLM Leaderboard 종합 순위와 Databricks LLM Gauntlet 종합 테스트 모두에서 1위를 차지하며 이전 모델들과의 큰 격차를 입증하였습니다[1].
클로즈드 모델과의 비교
DBRX Instruct는 MMLU(73.7% 대 70.0%) 및 HumanEval(70.1% 대 48.1%)을 포함한 일부 주요 지표에서 GPT-3.5 Turbo를 능가합니다. 일부 benchmark(예: MTBench)에서는 Gemini 1.0 Pro 및 초기 버전의 GPT-4 수준에 근접하고 있습니다[1].
학습 및 추론 효율성
- 학습 효율성: MoE 아키텍처의 활용으로 동등한 품질의 밀집(dense) 모델 대비 FLOPS 비용을 2~4배 절감할 수 있었습니다.
- 추론 효율성: 360억 개의 파라미터만 활성화됨으로써 DBRX는 동일 규모의 밀집 모델(예: LLaMA2-70B) 대비 2~3배 더 높은 처리량(추론 속도)을 제공합니다[1].
라이선싱 및 접근성
DBRX는 특별히 개발된 Databricks Open Model License 라이선스 하에 배포됩니다. 이 라이선스는 상업적 활용을 포함한 자유로운 사용 및 수정을 허용하지만 일부 제한 사항을 포함하고 있습니다. 특히 LLaMA 2 라이선스와 마찬가지로, DBRX 기반 서비스의 월간 활성 사용자가 7억 명을 초과할 경우 Databricks로부터 별도의 허가를 받아야 합니다.
기본 모델 및 Instruct 버전의 사전 학습된 가중치는 Hugging Face 저장소를 통해 다운로드 가능합니다[4].
참고 문헌
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
각주
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]