Mixtral (Mistral AI) (DE)
Mixtral 8x7B ist ein Large Language Model (LLM) mit offenem Quellcode, das von dem französischen Unternehmen Mistral AI entwickelt und im Dezember 2023 veröffentlicht wurde. Das Modell basiert auf der Architektur einer Sparse Mixture of Experts (SMoE), was ihm ermöglicht, eine Leistung zu erzielen, die mit der von wesentlich größeren Modellen (z. B. Llama 2 70B und GPT-3.5) vergleichbar ist, und diese mit einer hohen Geschwindigkeit und Effizienz bei der Inferenz zu kombinieren[1].
Das Modell wird unter der freien Apache-2.0-Lizenz vertrieben, was es für akademische und kommerzielle Zwecke zugänglich macht. Mixtral 8x7B zeigt starke Fähigkeiten bei mehrsprachigen Aufgaben, der Codegenerierung und dem Befolgen von Anweisungen, was es zum Zeitpunkt seiner Veröffentlichung zu einem der beliebtesten offenen Modelle machte[2].
Entwicklungsgeschichte
Das Unternehmen Mistral AI wurde im April 2023 von ehemaligen Forschern von Meta und Google gegründet. Im September 2023 veröffentlichte das Unternehmen sein erstes Modell, Mistral 7B, das für seine hohe Effizienz bei geringer Größe Anerkennung fand.
Am 11. Dezember 2023 kündigte Mistral AI die Veröffentlichung von Mixtral 8x7B an, seinem ersten Modell, das auf der Mixture-of-Experts-Architektur basiert. Das Modell zog sofort die Aufmerksamkeit der Community als das zu diesem Zeitpunkt leistungsstärkste Open-Source-LLM auf sich, indem es eine Qualität auf dem Niveau von GPT-3.5 bei deutlich höherer Inferenzgeschwindigkeit demonstrierte. Im Januar 2024 wurde eine detaillierte technische Beschreibung des Modells in Form eines wissenschaftlichen Artikels auf arXiv veröffentlicht, was es unabhängigen Forschern ermöglichte, sich mit den Details der Architektur und den Testergebnissen vertraut zu machen[2].
Architektur: Sparse Mixture of Experts (SMoE)
Die wichtigste Neuerung von Mixtral 8x7B ist die Implementierung der Sparse Mixture of Experts-Architektur. Im Gegensatz zu standardmäßigen („dichten“) Transformern, bei denen jede Schicht dieselbe Berechnung für alle Token durchführt, enthält bei Mixtral jede Schicht mehrere parallele Blöcke, sogenannte „Experten“.
Wesentliche Merkmale der Architektur:
- MoE-Struktur: Jede Transformer-Schicht enthält 8 Feed-Forward-Blöcke („Experten“). Zur Verarbeitung jedes Tokens wählt ein spezielles Router-Netzwerk die 2 am besten geeigneten Experten aus (Top-2-Routing).
- Parameter: Die Gesamtzahl der Modellparameter beträgt 46,7 Milliarden. Dank der sparse Aktivierung werden jedoch für jeden Token während der Inferenz nur 12,9 Milliarden aktive Parameter verwendet. Dies ermöglicht eine Inferenzgeschwindigkeit, die mit Modellen mit ca. 13 Milliarden Parametern vergleichbar ist.
- Attention-Optimierung: Das Modell verwendet moderne Techniken zur effizienten Verarbeitung langer Sequenzen, darunter Sliding Window Attention (SWA) und Grouped Query Attention (GQA).
- Kontextlänge: Das Modell unterstützt ein Kontextfenster von bis zu 32.768 Tokens.
Training
Die Mixtral-8x7B-Familie umfasst zwei Hauptversionen: 1. Mixtral-8x7B-v0.1 (Basismodell): Ein vortrainiertes Modell, das auf einem großen Korpus von Webdaten in mehreren europäischen Sprachen (Englisch, Französisch, Deutsch, Spanisch, Italienisch) trainiert wurde. Die Hauptaufgabe ist die Vorhersage des nächsten Tokens. 2. Mixtral-8x7B-Instruct-v0.1 (anweisungsorientiertes Modell): Eine Version, die mittels Supervised Fine-Tuning (SFT) und Direct Preference Optimization (DPO) nachgeschult wurde. Dieses Modell folgt den Anweisungen des Benutzers besser und ist für den Einsatz im Dialogformat konzipiert.
Leistung
Mixtral 8x7B übertrifft das Modell Llama 2 70B in den meisten Standard-Benchmarks oder ist qualitativ mit ihm vergleichbar, während es 5-mal weniger aktive Parameter und folglich eine deutlich höhere Inferenzgeschwindigkeit (bis zu 6-mal schneller) aufweist[2].
| Metrik | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (Allgemeinwissen) | 69,9% | 70,0% | 70,6% |
| GSM-8K (Mathematik) | 53,6% | 57,1% | 58,4% |
| MBPP (Codegenerierung) | 49,8% | 52,2% | 60,7% |
| MT-Bench (Dialogbewertung, Instruct-Versionen) | 6,86 | 8,32 | 8,30 |
- Mehrsprachigkeit: Aufgrund des erhöhten Anteils mehrsprachiger Daten im Trainingskorpus übertrifft Mixtral Llama 2 70B bei Aufgaben auf Französisch, Deutsch, Spanisch und Italienisch deutlich.
- Bias und Halluzinationen: Im Vergleich zu Llama 2 70B zeigt das Modell eine höhere Genauigkeit im BBQ-Benchmark (Bewertung sozialer Vorurteile) und ein positiveres Stimmungsprofil im BOLD-Benchmark.
Lizenzierung und Verfügbarkeit
Beide Versionen von Mixtral 8x7B (Basis und Instruct) werden unter der Apache-2.0-Lizenz veröffentlicht, die eine freie akademische und kommerzielle Nutzung erlaubt. Die Quellcodes und Modellgewichte sind auf GitHub und Hugging Face verfügbar.
Weblinks
- Mixtral of Experts – Offizielle Ankündigung im Blog von Mistral AI
- Das Modell Mixtral 8x7B auf Hugging Face
Literatur
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.