---
title: "Mixtral (Mistral AI) (DE)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4422
wiki_created_at: 2026-09-06T23:34:56Z
wiki_modified_at: 2026-09-06T23:34:56Z
downloaded_at: 2026-09-07T23:02:34Z
---

# Mixtral (Mistral AI) (DE)

**Mixtral 8x7B** ist ein Large Language Model (LLM) mit offenem Quellcode, das von dem französischen Unternehmen Mistral AI entwickelt und im Dezember 2023 veröffentlicht wurde. Das Modell basiert auf der Architektur einer **Sparse Mixture of Experts (SMoE)**, was ihm ermöglicht, eine Leistung zu erzielen, die mit der von wesentlich größeren Modellen (z. B. Llama 2 70B und GPT-3.5) vergleichbar ist, und diese mit einer hohen Geschwindigkeit und Effizienz bei der Inferenz zu kombinieren<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_note-mistral_blog-1)</sup>.

Das Modell wird unter der freien Apache-2.0-Lizenz vertrieben, was es für akademische und kommerzielle Zwecke zugänglich macht. Mixtral 8x7B zeigt starke Fähigkeiten bei mehrsprachigen Aufgaben, der Codegenerierung und dem Befolgen von Anweisungen, was es zum Zeitpunkt seiner Veröffentlichung zu einem der beliebtesten offenen Modelle machte<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_note-arxiv_paper-2)</sup>.

## Entwicklungsgeschichte

Das Unternehmen Mistral AI wurde im April 2023 von ehemaligen Forschern von Meta und Google gegründet. Im September 2023 veröffentlichte das Unternehmen sein erstes Modell, **Mistral 7B**, das für seine hohe Effizienz bei geringer Größe Anerkennung fand.

Am **11. Dezember 2023** kündigte Mistral AI die Veröffentlichung von **Mixtral 8x7B** an, seinem ersten Modell, das auf der Mixture-of-Experts-Architektur basiert. Das Modell zog sofort die Aufmerksamkeit der Community als das zu diesem Zeitpunkt leistungsstärkste Open-Source-LLM auf sich, indem es eine Qualität auf dem Niveau von GPT-3.5 bei deutlich höherer Inferenzgeschwindigkeit demonstrierte. Im Januar 2024 wurde eine detaillierte technische Beschreibung des Modells in Form eines wissenschaftlichen Artikels auf arXiv veröffentlicht, was es unabhängigen Forschern ermöglichte, sich mit den Details der Architektur und den Testergebnissen vertraut zu machen<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_note-arxiv_paper-2)</sup>.

## Architektur: Sparse Mixture of Experts (SMoE)

Die wichtigste Neuerung von Mixtral 8x7B ist die Implementierung der **Sparse Mixture of Experts**-Architektur. Im Gegensatz zu standardmäßigen („dichten“) Transformern, bei denen jede Schicht dieselbe Berechnung für alle Token durchführt, enthält bei Mixtral jede Schicht mehrere parallele Blöcke, sogenannte „Experten“.

Wesentliche Merkmale der Architektur:

- **MoE-Struktur**: Jede Transformer-Schicht enthält **8** Feed-Forward-Blöcke („Experten“). Zur Verarbeitung jedes Tokens wählt ein spezielles *Router-Netzwerk* die **2** am besten geeigneten Experten aus (*Top-2-Routing*).
- **Parameter**: Die Gesamtzahl der Modellparameter beträgt **46,7 Milliarden**. Dank der sparse Aktivierung werden jedoch für jeden Token während der Inferenz nur **12,9 Milliarden** aktive Parameter verwendet. Dies ermöglicht eine Inferenzgeschwindigkeit, die mit Modellen mit ca. 13 Milliarden Parametern vergleichbar ist.
- **Attention-Optimierung**: Das Modell verwendet moderne Techniken zur effizienten Verarbeitung langer Sequenzen, darunter **Sliding Window Attention (SWA)** und **Grouped Query Attention (GQA)**.
- **Kontextlänge**: Das Modell unterstützt ein Kontextfenster von bis zu **32.768 Tokens**.

## Training

Die Mixtral-8x7B-Familie umfasst zwei Hauptversionen: 1. **Mixtral-8x7B-v0.1** (Basismodell): Ein vortrainiertes Modell, das auf einem großen Korpus von Webdaten in mehreren europäischen Sprachen (Englisch, Französisch, Deutsch, Spanisch, Italienisch) trainiert wurde. Die Hauptaufgabe ist die Vorhersage des nächsten Tokens. 2. **Mixtral-8x7B-Instruct-v0.1** (anweisungsorientiertes Modell): Eine Version, die mittels *Supervised Fine-Tuning (SFT)* und *Direct Preference Optimization (DPO)* nachgeschult wurde. Dieses Modell folgt den Anweisungen des Benutzers besser und ist für den Einsatz im Dialogformat konzipiert.

## Leistung

Mixtral 8x7B übertrifft das Modell Llama 2 70B in den meisten Standard-Benchmarks oder ist qualitativ mit ihm vergleichbar, während es 5-mal weniger aktive Parameter und folglich eine deutlich höhere Inferenzgeschwindigkeit (bis zu 6-mal schneller) aufweist<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_note-arxiv_paper-2)</sup>.

| Metrik                                             | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|----------------------------------------------------|-------------|---------|--------------|
| **MMLU** (Allgemeinwissen)                         | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (Mathematik)                            | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (Codegenerierung)                         | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (Dialogbewertung, Instruct-Versionen) | 6,86        | 8,32    | **8,30**     |

Leistungsvergleich von Mixtral 8x7B mit Llama 2 70B und GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_note-arxiv_paper-2)</sup>

- **Mehrsprachigkeit**: Aufgrund des erhöhten Anteils mehrsprachiger Daten im Trainingskorpus übertrifft Mixtral Llama 2 70B bei Aufgaben auf Französisch, Deutsch, Spanisch und Italienisch deutlich.
- **Bias und Halluzinationen**: Im Vergleich zu Llama 2 70B zeigt das Modell eine höhere Genauigkeit im BBQ-Benchmark (Bewertung sozialer Vorurteile) und ein positiveres Stimmungsprofil im BOLD-Benchmark.

## Lizenzierung und Verfügbarkeit

Beide Versionen von Mixtral 8x7B (Basis und Instruct) werden unter der Apache-2.0-Lizenz veröffentlicht, die eine freie akademische und kommerzielle Nutzung erlaubt. Die Quellcodes und Modellgewichte sind auf GitHub und Hugging Face verfügbar.

## Weblinks

- <a href="https://mistral.ai/news/mixtral-of-experts/" class="external text" rel="nofollow">Mixtral of Experts</a> – Offizielle Ankündigung im Blog von Mistral AI
- <a href="https://huggingface.co/mistralai/Mixtral-8x7B-v0.1" class="external text" rel="nofollow">Das Modell Mixtral 8x7B auf Hugging Face</a>

## Literatur

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external text" rel="nofollow">arXiv:2401.04088</a>.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. <a href="https://arxiv.org/abs/1701.06538" class="external text" rel="nofollow">arXiv:1701.06538</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external text" rel="nofollow">arXiv:2004.05150</a>.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. <a href="https://arxiv.org/abs/2404.02852" class="external text" rel="nofollow">arXiv:2404.02852</a>.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. <a href="https://openreview.net/forum?id=stXtBqyTWX" class="external text" rel="nofollow">OpenReview: stXtBqyTWX</a>.

## Einzelnachweise

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_ref-mistral_blog_1-0) „Mixtral of Experts“. *Mistral AI Blog*. 11. Dezember 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(DE)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). „Mixtral of Experts“. *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
