Mixtral (Mistral AI) (FR)
Mixtral 8x7B est un grand modèle de langue (LLM) open source, développé par l'entreprise française Mistral AI et publié en décembre 2023. Le modèle est basé sur une architecture de mélange épars d'experts (Sparse Mixture of Experts, SMoE), ce qui lui permet d'allier des performances comparables à celles de modèles beaucoup plus grands (comme Llama 2 70B et GPT-3.5) à une vitesse et une efficacité d'inférence élevées[1].
Le modèle est distribué sous la licence libre Apache 2.0, ce qui le rend accessible pour un usage académique et commercial. Mixtral 8x7B démontre de solides capacités dans les tâches multilingues, la génération de code et le suivi d'instructions, ce qui en a fait l'un des modèles ouverts les plus populaires au moment de sa sortie[2].
Historique du développement
L'entreprise Mistral AI a été fondée en avril 2023 par d'anciens chercheurs de Meta et Google. En septembre 2023, l'entreprise a publié son premier modèle, Mistral 7B, qui a été salué pour sa grande efficacité malgré sa taille réduite.
Le 11 décembre 2023, Mistral AI a annoncé la sortie de Mixtral 8x7B, son premier modèle basé sur l'architecture de mélange d'experts. Le modèle a immédiatement attiré l'attention de la communauté en tant que LLM open source le plus puissant de l'époque, démontrant une qualité comparable à celle de GPT-3.5 avec une vitesse d'inférence significativement plus élevée. En janvier 2024, une description technique détaillée du modèle a été publiée sous la forme d'un article scientifique sur arXiv, permettant aux chercheurs indépendants d'examiner les détails de l'architecture et les résultats des tests[2].
Architecture : Mélange épars d'experts (SMoE)
La principale innovation de Mixtral 8x7B est l'introduction de l'architecture Sparse Mixture of Experts. Contrairement aux transformeurs standards (« denses »), où chaque couche effectue le même calcul pour tous les tokens, dans Mixtral, chaque couche contient plusieurs blocs parallèles appelés « experts ».
Caractéristiques clés de l'architecture :
- Structure MoE : Chaque couche du transformeur contient 8 blocs feed-forward (« experts »). Pour traiter chaque token, un réseau routeur spécial sélectionne les 2 experts les plus pertinents (routage Top-2).
- Paramètres : Le nombre total de paramètres du modèle est de 46,7 milliards, mais grâce à l'activation éparse, seuls 12,9 milliards de paramètres actifs sont utilisés pour chaque token lors de l'inférence. Cela permet d'atteindre une vitesse d'inférence comparable à celle de modèles d'environ 13 milliards de paramètres.
- Optimisation de l'attention : Le modèle utilise des techniques modernes pour le traitement efficace des longues séquences, notamment la Sliding Window Attention (SWA) et la Grouped Query Attention (GQA).
- Longueur de contexte : Le modèle prend en charge une fenêtre de contexte allant jusqu'à 32 768 tokens.
Entraînement
La famille Mixtral 8x7B comprend deux versions principales : 1. Mixtral-8x7B-v0.1 (modèle de base) : Un modèle pré-entraîné sur un vaste corpus de données web en plusieurs langues européennes (anglais, français, allemand, espagnol, italien). Sa tâche principale est la prédiction du token suivant. 2. Mixtral-8x7B-Instruct-v0.1 (modèle d'instruction) : Une version affinée (fine-tuned) à l'aide du supervised fine-tuning (SFT) et de la Direct Preference Optimization (DPO). Ce modèle est conçu pour mieux suivre les instructions de l'utilisateur et est destiné à une utilisation en format conversationnel.
Performances
Mixtral 8x7B surpasse ou égale en qualité le modèle Llama 2 70B sur la plupart des benchmarks standards, tout en ayant 5 fois moins de paramètres actifs et, par conséquent, une vitesse d'inférence nettement supérieure (jusqu'à 6 fois plus rapide)[2].
| Métrique | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (connaissances générales) | 69,9% | 70,0% | 70,6% |
| GSM-8K (mathématiques) | 53,6% | 57,1% | 58,4% |
| MBPP (génération de code) | 49,8% | 52,2% | 60,7% |
| MT-Bench (évaluation de dialogue, versions Instruct) | 6,86 | 8,32 | 8,30 |
- Multilinguisme : Grâce à une proportion accrue de données multilingues dans son corpus d'entraînement, Mixtral surpasse de manière significative Llama 2 70B dans les tâches en français, allemand, espagnol et italien.
- Biais et hallucinations : En comparaison avec Llama 2 70B, le modèle montre une plus grande exactitude sur le benchmark BBQ (évaluation des biais sociaux) et un profil de sentiment plus positif sur le benchmark BOLD.
Licence et disponibilité
Les deux versions de Mixtral 8x7B (de base et Instruct) sont publiées sous la licence Apache 2.0, qui autorise une utilisation libre, académique et commerciale. Les codes sources et les poids des modèles sont disponibles sur GitHub et Hugging Face.
Liens externes
- Mixtral of Experts — annonce officielle sur le blog de Mistral AI
- Modèle Mixtral 8x7B sur Hugging Face
Bibliographie
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.