Mistral AI (DE)
Mistral AI ist ein französisches Unternehmen im Bereich der künstlichen Intelligenz, das sich auf die Entwicklung von großen Sprachmodellen (LLMs) spezialisiert hat. Das im April 2023 gegründete Unternehmen hat sich schnell zu einem der wichtigsten Akteure auf dem europäischen und globalen Markt entwickelt und positioniert sich als Alternative zu den proprietären Modellen amerikanischer Technologiegiganten.
Ein wesentliches Merkmal des Ansatzes von Mistral AI ist der Fokus auf die Entwicklung hochleistungsfähiger Modelle mit offenen Gewichten (überwiegend unter der Apache 2.0-Lizenz), was den Zugang zu fortschrittlichen KI-Technologien demokratisiert. Das Unternehmen ist bekannt für seine architektonischen Innovationen wie Grouped-Query Attention (GQA), Sliding Window Attention (SWA) und Sparse Mixture-of-Experts (MoE), die es ihren Modellen ermöglichen, bei relativ geringer Größe und niedrigem Rechenaufwand eine hohe Effizienz zu erreichen.
Geschichte
Mistral AI wurde im April 2023 in Paris von drei französischen Forschern gegründet: Arthur Mensch (Arthur Mensch), Guillaume Lample und Timothée Lacroix. Alle drei Gründer hatten zuvor bei weltweit führenden Unternehmen an großen Sprachmodellen gearbeitet: Mensch war Forscher bei Google DeepMind, während Lample und Lacroix bei Meta AI für LLMs zuständig waren.
Die Mission des Unternehmens ist es, die neuesten Fortschritte der KI für alle zugänglich zu machen, indem es Offenheit, Zusammenarbeit und Transparenz fördert. Dieser Ansatz ermöglichte es Mistral AI, schnell erhebliche Investitionen anzuziehen:
- Juni 2023: 105 Mio. € in einer Seed-Runde, was einen europäischen Rekord darstellte.
- Dezember 2023: 385 Mio. € in einer Series-A-Runde, nach der die Bewertung des Unternehmens 2 Mrd. US-Dollar überstieg und es den „Einhorn“-Status erhielt.
- Februar 2024: Ankündigung einer strategischen Partnerschaft mit Microsoft, die eine Investition von 16 Mio. US-Dollar und die Bereitstellung von Mistral-Modellen in der Azure-Cloud umfasste.
- Juni 2024: Eine neue Finanzierungsrunde über 600 Mio. €, die die Bewertung des Unternehmens auf ~5,8 Mrd. € steigerte und es zu einem der teuersten KI-Start-ups der Welt machte.
Technische Merkmale der Architektur
Die Modelle von Mistral AI basieren auf der Transformer-Architektur, beinhalten jedoch eine Reihe wichtiger Innovationen, die auf die Steigerung der Effizienz und die Senkung des Rechenaufwands abzielen.
Transformer mit Verbesserungen (Mistral 7B)
Das erste Modell des Unternehmens, Mistral 7B, führte zwei wichtige architektonische Verbesserungen ein:
- Sliding Window Attention (SWA) (Aufmerksamkeit mit gleitendem Fenster): Anstatt dass jedes Token mit allen vorhergehenden Tokens interagiert (was eine quadratische Komplexität aufweist), begrenzt SWA die Aufmerksamkeit auf ein festes Fenster (z. B. 4096 Tokens). Dies ermöglicht die Verarbeitung sehr langer Sequenzen (bis zu 32.000 Tokens und mehr) mit linearer Rechenkomplexität, was die Verarbeitung erheblich beschleunigt.
- Grouped-Query Attention (GQA) (Gruppierte Abfrage-Aufmerksamkeit): Eine Optimierung des Standardmechanismus der Multi-Head-Attention. GQA verwendet eine geringere Anzahl von „Köpfen“ für die Schlüssel (Keys) und Werte (Values) als für die Abfragen (Queries) (z. B. im Verhältnis 8:1), was den Speicherbedarf erheblich reduziert und den Generierungsprozess (Inferenz) ohne signifikanten Qualitätsverlust beschleunigt.
Sparse Mixture-of-Experts (MoE)
In den Modellen der Mixtral-Serie (z. B. Mixtral 8x7B, Mixtral 8x22B) wird die Architektur Sparse Mixture-of-Experts (dünnbesetzte Mischung von Experten) eingesetzt. Anstelle einer einzigen dichten Schicht des neuronalen Netzes werden mehrere parallele „Experten“-Subnetze verwendet. Für jedes Eingangstoken wählt eine spezielle Gating-Schicht (Router) dynamisch eine kleine Teilmenge von Experten zur Aktivierung aus (üblicherweise 2 von 8).
Dies ermöglicht die Erstellung von Modellen mit einer riesigen Gesamtzahl an Parametern (Mixtral 8x22B hat 141 Mrd.), aber bei der Verarbeitung jedes Tokens wird nur ein kleiner Teil davon genutzt (~39 Mrd.). Dadurch erreicht das Modell eine Qualität, die mit der von viel größeren „dichten“ Modellen vergleichbar ist, jedoch bei der Geschwindigkeit und den Kosten der Inferenz, die denen von deutlich kleineren Modellen entsprechen.
Mamba-Architektur (SSM)
Im Jahr 2024 stellte Mistral AI das experimentelle Modell Codestral Mamba vor, das auf der Mamba-Architektur (Selective State-Space Model) basiert. Im Gegensatz zu Transformern verwendet Mamba einen rekurrenten Mechanismus, der auf Zustandsraummodellen beruht. Die wesentlichen Vorteile sind:
- Lineare Komplexität in Bezug auf die Sequenzlänge, was es bei langen Kontexten extrem schnell macht.
- Theoretisch „unendlicher“ Kontext, der nur durch den verfügbaren Speicher begrenzt ist.
- Hohe Inferenzgeschwindigkeit im Vergleich zu äquivalenten Transformern.
Chronologie und Modelle
| Monat / Jahr | Modell | Parameter (Mrd.) | Wesentliche Merkmale | Lizenz |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7,3 | GQA + SWA-Architektur; 32k-Kontext; übertrifft Llama 2 13B in allen Benchmarks. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46,7 (12,9 aktiv) | Erstes offenes MoE-Modell; Qualität auf dem Niveau von GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | „Junior“- und Flaggschiff-Modelle, verfügbar über API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 aktiv) | 64k-Kontext; SOTA-Qualität unter den Open-Source-Modellen zum Zeitpunkt der Veröffentlichung. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Spezialisiertes Modell für die Codegenerierung (80+ Sprachen). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Spezialisierte Modelle für Mathematik und Mehrsprachigkeit. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7,3 | Experimentelles Modell für Code auf Mamba-Architektur; 256k+ Kontext. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | Erstes offenes multimodales Modell (Text + Bilder). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (Schätzung) | Aktualisiertes Flaggschiff-Modell mit verbessertem Reasoning. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Optimiert für geringe Latenz (bis zu 150 Tokens/s); Qualität auf dem Niveau von 70B-Modellen. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | Frontier-multimodales Modell (Text, Bilder) mit 128k-Kontext. | Proprietär |
| 05 / 2025 | Devstral 24B | 24 | „Agenten“-Modell für autonome Softwareentwicklung; 46,8 % auf SWE-Bench. | Apache 2.0 |
Vergleich mit Wettbewerbern
- vs. Llama (Meta): Mistral-Modelle übertreffen durchweg Llama-Modelle ähnlicher oder sogar größerer Größe. Mistral 7B übertraf Llama 2 13B, und Mixtral 8x7B übertraf Llama 2 70B. Der Hauptunterschied liegt in der Lizenz: Mistral verwendet die vollständig permissive Apache 2.0-Lizenz, während die Llama-Lizenz Einschränkungen aufweist.
- vs. GPT (OpenAI): Die Flaggschiff-Modelle von OpenAI (GPT-4) bleiben führend bei den komplexesten Aufgaben, jedoch zeigen die offenen Modelle von Mistral (z. B. Mixtral 8x7B) eine Qualität, die mit der von GPT-3.5 vergleichbar ist. Mistral bietet eine offene Alternative, die es ermöglicht, Modelle lokal bereitzustellen und vollständig zu kontrollieren.
- vs. Claude (Anthropic): Die Claude-Modelle sind für ihr großes Kontextfenster und ihren Fokus auf Sicherheit bekannt. Mistral hat offene Modelle mit vergleichbarem oder größerem Kontext angeboten. In Bezug auf die Leistung in Standard-Benchmarks (LMSys Arena) übertraf das Modell Medium 3 Claude 3 Opus.
Anwendung und Ökosystem
Produkte
- Le Chat: Ein öffentlicher Chat-Assistent (Web, iOS/Android), der die Fähigkeiten der Mistral-Modelle demonstriert, einschließlich Websuche und Bilderzeugung.
- La Plateforme: Eine Unternehmensplattform mit API-Zugang zu allen Mistral-Modellen, die es Unternehmen ermöglicht, LLMs in ihre Produkte zu integrieren.
Unternehmenskunden
Die Technologien von Mistral werden von großen Unternehmen wie BNP Paribas (Finanzen), CMA CGM (Logistik), Zalando (E-Commerce) und der staatlichen Agentur France Travail genutzt. Für europäische Kunden ist die Möglichkeit der lokalen Bereitstellung der Modelle zur Einhaltung der DSGVO (GDPR) von großer Bedeutung.
Open-Source-Community
Dank der offenen Lizenz sind die Mistral-Modelle zur Grundlage für Tausende von Projekten auf Plattformen wie Hugging Face geworden. Die Community trainiert die Modelle aktiv für spezialisierte Aufgaben nach und erstellt Versionen für Biologie (BioMistral), Rechtswissenschaften (SaulLM-7B) und die Lokalisierung in verschiedene Sprachen (z. B. Polish Bielik 7B).
Lizenzierung
| Modellreihe | Lizenz | Einschränkungen |
|---|---|---|
| Basis, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Freie kommerzielle Nutzung. |
| Codestral 22B | Non-Production License | Kommerzielle Nutzung ohne gesonderte Vereinbarung verboten. |
| Large-Serie, Medium-Serie | Mistral Research / Proprietär | Zugang nur über Cloud-API. |
Weblinks
Literatur
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.