Mixtral (Mistral AI) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B es un gran modelo de lenguaje (LLM) de código abierto, desarrollado por la empresa francesa Mistral AI y lanzado en diciembre de 2023. El modelo se basa en la arquitectura de mezcla dispersa de expertos (Sparse Mixture of Experts, SMoE), lo que le permite combinar un rendimiento comparable al de modelos mucho más grandes (por ejemplo, Llama 2 70B y GPT-3.5) con una alta velocidad y eficiencia de inferencia[1].

El modelo se distribuye bajo la licencia libre Apache 2.0, lo que lo hace accesible para uso académico y comercial. Mixtral 8x7B demuestra sólidas capacidades en tareas multilingües, generación de código y seguimiento de instrucciones, lo que lo convirtió en uno de los modelos abiertos más populares en el momento de su lanzamiento[2].

Historia del desarrollo

La empresa Mistral AI fue fundada en abril de 2023 por ex-investigadores de Meta y Google. En septiembre de 2023, la empresa lanzó su primer modelo, Mistral 7B, que fue aclamado por su alta eficiencia a pesar de su pequeño tamaño.

El 11 de diciembre de 2023, Mistral AI anunció el lanzamiento de Mixtral 8x7B, su primer modelo basado en la arquitectura de mezcla de expertos. El modelo atrajo inmediatamente la atención de la comunidad como el LLM abierto más potente en ese momento, demostrando una calidad a la par de GPT-3.5 con una velocidad de inferencia significativamente mayor. En enero de 2024, se publicó una descripción técnica detallada del modelo en forma de artículo científico en arXiv, lo que permitió a investigadores independientes conocer los detalles de la arquitectura y los resultados de las pruebas[2].

Arquitectura: Mezcla dispersa de expertos (SMoE)

La principal innovación de Mixtral 8x7B es la implementación de la arquitectura Sparse Mixture of Experts. A diferencia de los transformadores estándar («densos»), donde cada capa realiza el mismo cálculo para todos los tokens, en Mixtral cada capa contiene varios bloques paralelos de «expertos».

Características clave de la arquitectura:

  • Estructura MoE: Cada capa de transformador contiene 8 bloques feed-forward («expertos»). Para procesar cada token, una red de enrutamiento especial selecciona los 2 expertos más adecuados (enrutamiento Top-2).
  • Parámetros: El número total de parámetros del modelo es de 46,7 mil millones, pero gracias a la activación dispersa, para cada token durante la inferencia solo se utilizan 12,9 mil millones de parámetros activos. Esto proporciona una velocidad de inferencia comparable a la de modelos con ~13 mil millones de parámetros.
  • Optimización de la atención: El modelo utiliza técnicas modernas para el procesamiento eficiente de secuencias largas, incluyendo Sliding Window Attention (SWA) y Grouped Query Attention (GQA).
  • Longitud del contexto: El modelo admite una ventana de contexto de hasta 32 768 tokens.

Entrenamiento

La familia Mixtral 8x7B incluye dos versiones principales: 1. Mixtral-8x7B-v0.1 (modelo base): Un modelo preentrenado, entrenado en un gran corpus de datos web en varios idiomas europeos (inglés, francés, alemán, español, italiano). Su tarea principal es la predicción del siguiente token. 2. Mixtral-8x7B-Instruct-v0.1 (modelo de instrucciones): Una versión ajustada mediante ajuste fino supervisado (SFT) y Optimización Directa de Preferencias (DPO). Este modelo sigue mejor las instrucciones del usuario y está diseñado para su uso en formato de diálogo.

Rendimiento

Mixtral 8x7B supera o iguala en calidad al modelo Llama 2 70B en la mayoría de los benchmarks estándar, teniendo 5 veces menos parámetros activos y, como resultado, una velocidad de inferencia significativamente mayor (hasta 6 veces más rápido)[2].

Comparación del rendimiento de Mixtral 8x7B con Llama 2 70B y GPT-3.5[2]
Métrica Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (conocimiento general) 69,9% 70,0% 70,6%
GSM-8K (matemáticas) 53,6% 57,1% 58,4%
MBPP (generación de código) 49,8% 52,2% 60,7%
MT-Bench (evaluación de diálogo, versiones Instruct) 6,86 8,32 8,30
  • Multilingüismo: Gracias a una mayor proporción de datos multilingües en el corpus de entrenamiento, Mixtral supera significativamente a Llama 2 70B en tareas en francés, alemán, español e italiano.
  • Sesgos y alucinaciones: En comparación con Llama 2 70B, el modelo demuestra una mayor precisión en el benchmark BBQ (evaluación de sesgos sociales) y un perfil de sentimiento más positivo en el benchmark BOLD.

Licenciamiento y disponibilidad

Ambas versiones de Mixtral 8x7B (base e Instruct) se publican bajo la licencia Apache 2.0, que permite el uso libre académico y comercial. El código fuente y los pesos de los modelos están disponibles en GitHub y Hugging Face.

Enlaces externos

Bibliografía

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Referencias

  1. «Mixtral of Experts». Mistral AI Blog. 11 de diciembre de 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]