DBRX (language model) (VI)
DBRX — là một mô hình ngôn ngữ lớn (LLM) mã nguồn mở được phát triển bởi nhóm nghiên cứu Mosaic AI thuộc công ty Databricks. Mô hình được ra mắt chính thức vào ngày 27 tháng 3 năm 2024 và được định vị là giải pháp hiệu năng cao dành cho môi trường doanh nghiệp[1].
DBRX được xây dựng trên kiến trúc Mixture of Experts (MoE) dạng hạt mịn và kết hợp hiệu suất cao với hiệu quả trong quá trình huấn luyện và inference. Tại thời điểm ra mắt, DBRX đã đạt kết quả tốt nhất trong số tất cả các mô hình mã nguồn mở trên các benchmark quan trọng, vượt qua các mô hình như LLaMA 2, Mixtral và Grok-1, đồng thời cho thấy khả năng cạnh tranh với các mô hình nguồn đóng ở mức GPT-3.5 Turbo[2].
Lịch sử phát triển
Sự xuất hiện của DBRX là sự tiếp nối chiến lược của Databricks trong việc phát triển các mô hình sinh tạo mã nguồn mở. Vào tháng 6 năm 2023, Databricks đã mua lại startup MosaicML, chuyên về huấn luyện các mô hình lớn, và trên cơ sở đó thành lập bộ phận Mosaic AI[3].
Nhóm Mosaic AI, do kiến trúc sư mạng nơ-ron hàng đầu Jonathan Frankle lãnh đạo, đã bắt tay vào phát triển một LLM lớn mới với mục tiêu đạt chất lượng tương đương với các hệ thống độc quyền tốt nhất nhưng ở định dạng mã nguồn mở. Dự án được đặt tên là DBRX. Quá trình phát triển và tiền huấn luyện mô hình kéo dài khoảng 2,5 tháng và theo ước tính, chi phí vào khoảng 10 triệu USD[3].
Kiến trúc
DBRX là mô hình transformer kiểu chỉ giải mã (decoder-only) và triển khai kiến trúc Mixture of Experts (MoE) dạng hạt mịn (fine-grained).
Các đặc điểm kiến trúc chính:
- Tổng số tham số: 132 tỷ.
- Các chuyên gia: Mô hình bao gồm 16 mô hình con chuyên biệt nhỏ («chuyên gia»).
- Cơ chế kích hoạt: Đối với mỗi token đầu vào, chỉ 4 trong số 16 chuyên gia được kích hoạt. Điều này có nghĩa là trong quá trình inference chỉ có 36 tỷ tham số hoạt động, đảm bảo tốc độ và hiệu quả cao. Sơ đồ này tạo ra nhiều hơn 65 lần các tổ hợp chuyên gia có thể có so với mô hình Mixtral (8 chuyên gia với kích hoạt 2)[1].
- Các thành phần: Sử dụng các giải pháp kiến trúc hiện đại như embedding vị trí xoay (RoPE), gated linear units (GLU) và grouped query attention (GQA).
- Độ dài ngữ cảnh: 32 768 token.
Kiến trúc như vậy cho phép mô hình kết hợp lợi thế của số lượng tham số khổng lồ (để lưu trữ kiến thức) với hiệu quả của các mô hình nhỏ hơn (cho tốc độ suy luận).
Huấn luyện
Việc tiền huấn luyện DBRX được thực hiện trên một dataset được tuyển chọn kỹ lưỡng với khối lượng 12 nghìn tỷ token, bao gồm văn bản và mã nguồn. Chất lượng dữ liệu là ưu tiên hàng đầu: các nhà phát triển đã sử dụng nền tảng đám mây Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) để làm sạch, chuẩn bị và kiểm toán dữ liệu[1].
Trong quá trình huấn luyện, phương pháp curriculum learning được áp dụng, trong đó tỷ lệ các loại dữ liệu thay đổi ở các giai đoạn khác nhau. Ví dụ, phần cuối của quá trình huấn luyện được dành cho việc đưa vào có liều lượng các bài toán phức tạp, điều mà theo lời các nhà phát triển đã mang lại mức tăng chất lượng đáng kể. Huấn luyện được tiến hành trên cụm gồm 3072 GPU Nvidia H100.
Sau tiền huấn luyện, mô hình cơ sở đã trải qua quá trình fine-tuning bổ sung (instruction tuning) để tạo ra phiên bản tương tác DBRX Instruct, được tối ưu hóa để thực hiện các hướng dẫn của người dùng.
Hiệu suất
Tại thời điểm ra mắt, DBRX đã thiết lập tiêu chuẩn chất lượng mới cho các LLM mã nguồn mở trên nhiều benchmark.
So sánh với các mô hình mã nguồn mở
| Benchmark | Nhiệm vụ | DBRX Instruct | Tốt nhất tiếp theo (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Kiến thức tổng quát | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Lập trình | 70,1% | 63,2% (Grok-1) |
| GSM8K | Suy luận toán học | 66,9% | 62,9% (Grok-1) |
| MMLU | Kiến thức tổng quát | 73,7% | 71,5% (Mixtral Instruct) |
DBRX đứng đầu cả trong bảng xếp hạng tổng thể Hugging Face Open LLM Leaderboard lẫn trong bài kiểm tra tổng hợp Databricks LLM Gauntlet, cho thấy khoảng cách đáng kể so với các mô hình tiền nhiệm[1].
So sánh với các mô hình nguồn đóng
DBRX Instruct vượt trội hơn GPT-3.5 Turbo trên một số chỉ số quan trọng, bao gồm MMLU (73,7% so với 70,0%) và HumanEval (70,1% so với 48,1%). Về chất lượng câu trả lời trên một số benchmark (ví dụ MTBench), mô hình tiệm cận mức độ của Gemini 1.0 Pro và các phiên bản đầu của GPT-4[1].
Hiệu quả huấn luyện và inference
- Hiệu quả huấn luyện: Việc sử dụng kiến trúc MoE đã cho phép giảm chi phí FLOPS từ 2 đến 4 lần so với các mô hình dày đặc có chất lượng tương đương.
- Hiệu quả inference: Nhờ chỉ kích hoạt 36 tỷ tham số, DBRX cung cấp thông lượng (tốc độ suy luận) cao hơn 2-3 lần so với các mô hình dày đặc có kích thước tương đương (ví dụ LLaMA2-70B)[1].
Cấp phép và khả năng truy cập
DBRX được phân phối theo giấy phép được thiết kế đặc biệt Databricks Open Model License. Giấy phép này cho phép sử dụng và chỉnh sửa tự do, bao gồm cả ứng dụng thương mại, nhưng có một số hạn chế. Cụ thể, cũng giống như giấy phép LLaMA 2, nó yêu cầu phải có sự cho phép riêng từ Databricks nếu các dịch vụ dựa trên DBRX phục vụ hơn 700 triệu người dùng tích cực mỗi tháng.
Các trọng số tiền huấn luyện của mô hình (phiên bản cơ sở và Instruct) có sẵn để tải xuống qua kho lưu trữ trên Hugging Face[4].
Tài liệu tham khảo
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Ghi chú
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]