DBRX (modelo de lenguaje)
DBRX es un gran modelo de lenguaje (LLM) de código abierto, desarrollado por el equipo de investigación Mosaic AI de Databricks. El modelo fue lanzado oficialmente el 27 de marzo de 2024 y se posiciona como una solución de alto rendimiento para uso corporativo[1].
DBRX se basa en una arquitectura de grano fino de mezcla de expertos (MoE) y combina un alto rendimiento con eficiencia en el entrenamiento y la inferencia. En el momento de su lanzamiento, DBRX demostró los mejores resultados entre todos los modelos abiertos en los principales benchmarks, superando a modelos como LLaMA 2, Mixtral y Grok-1, y mostrando competitividad con modelos cerrados del nivel de GPT-3.5 Turbo[2].
Historia del desarrollo
La aparición de DBRX fue una continuación de la estrategia de Databricks para desarrollar modelos generativos abiertos. En junio de 2023, Databricks adquirió la startup MosaicML, especializada en el entrenamiento de grandes modelos, y sobre esta base se creó la división Mosaic AI[3].
El equipo de Mosaic AI, liderado por el arquitecto jefe de redes neuronales Jonathan Frankle, comenzó a desarrollar un nuevo gran LLM con el objetivo de alcanzar una calidad comparable a la de los mejores sistemas propietarios, pero en un formato abierto. El proyecto fue nombrado DBRX. El desarrollo y preentrenamiento del modelo tomaron aproximadamente 2.5 meses y, según las estimaciones, costaron alrededor de $10 millones[3].
Arquitectura
DBRX es un modelo de tipo transformador solo decodificador (decoder-only) e implementa una arquitectura de mezcla de expertos (MoE) de grano fino (fine-grained).
Características clave de la arquitectura:
- Número total de parámetros: 132 mil millones.
- Expertos: El modelo consta de 16 submodelos especializados más pequeños («expertos»).
- Mecanismo de activación: Para cada token de entrada, solo se activan 4 de los 16 expertos. Esto significa que durante la inferencia, solo están activos 36 mil millones de parámetros, lo que garantiza una alta velocidad y eficiencia. Este esquema ofrece 65 veces más combinaciones posibles de expertos en comparación con el modelo Mixtral (8 expertos con 2 activados)[1].
- Componentes: Se utilizan soluciones arquitectónicas modernas como los embeddings posicionales rotatorios (RoPE), unidades lineales cerradas (gated linear units o GLU) y atención de consulta agrupada (grouped query attention o GQA).
- Longitud de contexto: 32,768 tokens.
Esta arquitectura permite al modelo combinar las ventajas de un gran número de parámetros (para almacenar conocimiento) con la eficiencia de modelos más pequeños (para la velocidad de inferencia).
Entrenamiento
El preentrenamiento de DBRX se realizó en un conjunto de datos cuidadosamente seleccionado de 12 billones de tokens, compuesto por textos y código. La calidad de los datos fue una prioridad clave: los desarrolladores utilizaron la plataforma en la nube de Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) para la limpieza, preparación y auditoría de los datos[1].
Durante el entrenamiento se utilizó el método de aprendizaje curricular (curriculum learning), en el cual la proporción de los tipos de datos se cambiaba en diferentes etapas. Por ejemplo, la parte final del entrenamiento se dedicó a la introducción dosificada de tareas complejas, lo que, según los desarrolladores, proporcionó una mejora notable en la calidad. El entrenamiento se llevó a cabo en un clúster de 3072 GPUs Nvidia H100.
Después del preentrenamiento, el modelo base pasó por un ajuste fino adicional (instruction tuning) para crear la versión interactiva DBRX Instruct, optimizada para seguir las instrucciones del usuario.
Rendimiento
En el momento de su lanzamiento, DBRX estableció un nuevo estándar de calidad para los LLM abiertos en una amplia gama de benchmarks.
Comparación con modelos abiertos
| Benchmark | Tarea | DBRX Instruct | Siguiente mejor (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Conocimiento general | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programación | 70,1% | 63,2% (Grok-1) |
| GSM8K | Razonamiento matemático | 66,9% | 62,9% (Grok-1) |
| MMLU | Conocimiento general | 73,7% | 71,5% (Mixtral Instruct) |
DBRX ocupó el primer lugar tanto en la clasificación general del Hugging Face Open LLM Leaderboard como en la prueba integral Databricks LLM Gauntlet, demostrando una ventaja significativa sobre sus predecesores[1].
Comparación con modelos cerrados
DBRX Instruct supera a GPT-3.5 Turbo en varios indicadores clave, incluidos MMLU (73,7% frente a 70,0%) y HumanEval (70,1% frente a 48,1%). En cuanto a la calidad de las respuestas en algunos benchmarks (por ejemplo, MTBench), el modelo se acerca al nivel de Gemini 1.0 Pro y a las primeras versiones de GPT-4[1].
Eficiencia de entrenamiento e inferencia
- Eficiencia de entrenamiento: El uso de la arquitectura MoE permitió reducir los costos en FLOPS entre 2 y 4 veces en comparación con modelos densos de calidad similar.
- Eficiencia de inferencia: Gracias a la activación de solo 36 mil millones de parámetros, DBRX ofrece un rendimiento (velocidad de inferencia) de 2 a 3 veces mayor en comparación con modelos densos de tamaño equivalente (por ejemplo, LLaMA2-70B)[1].
Licencia y disponibilidad
DBRX se distribuye bajo una licencia especialmente desarrollada, la Databricks Open Model License. Permite el uso y la modificación libres, incluido el uso comercial, pero contiene una serie de restricciones. En particular, al igual que la licencia LLaMA 2, requiere obtener un permiso por separado de Databricks si los servicios basados en DBRX son utilizados por una audiencia de más de 700 millones de usuarios activos mensuales.
Los pesos preentrenados del modelo (versiones base e Instruct) están disponibles para su descarga a través del repositorio en Hugging Face[4].
Literatura
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Referencias
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]