Mistral AI (DE)

From Systems analysis Wiki
Jump to navigation Jump to search

Mistral AI ist ein französisches Unternehmen im Bereich der künstlichen Intelligenz, das sich auf die Entwicklung von großen Sprachmodellen (LLMs) spezialisiert hat. Das im April 2023 gegründete Unternehmen hat sich schnell zu einem der wichtigsten Akteure auf dem europäischen und globalen Markt entwickelt und positioniert sich als Alternative zu den proprietären Modellen amerikanischer Technologiegiganten.

Ein wesentliches Merkmal des Ansatzes von Mistral AI ist der Fokus auf die Entwicklung hochleistungsfähiger Modelle mit offenen Gewichten (überwiegend unter der Apache 2.0-Lizenz), was den Zugang zu fortschrittlichen KI-Technologien demokratisiert. Das Unternehmen ist bekannt für seine architektonischen Innovationen wie Grouped-Query Attention (GQA), Sliding Window Attention (SWA) und Sparse Mixture-of-Experts (MoE), die es ihren Modellen ermöglichen, bei relativ geringer Größe und niedrigem Rechenaufwand eine hohe Effizienz zu erreichen.

Geschichte

Mistral AI wurde im April 2023 in Paris von drei französischen Forschern gegründet: Arthur Mensch (Arthur Mensch), Guillaume Lample und Timothée Lacroix. Alle drei Gründer hatten zuvor bei weltweit führenden Unternehmen an großen Sprachmodellen gearbeitet: Mensch war Forscher bei Google DeepMind, während Lample und Lacroix bei Meta AI für LLMs zuständig waren.

Die Mission des Unternehmens ist es, die neuesten Fortschritte der KI für alle zugänglich zu machen, indem es Offenheit, Zusammenarbeit und Transparenz fördert. Dieser Ansatz ermöglichte es Mistral AI, schnell erhebliche Investitionen anzuziehen:

  • Juni 2023: 105 Mio. € in einer Seed-Runde, was einen europäischen Rekord darstellte.
  • Dezember 2023: 385 Mio. € in einer Series-A-Runde, nach der die Bewertung des Unternehmens 2 Mrd. US-Dollar überstieg und es den „Einhorn“-Status erhielt.
  • Februar 2024: Ankündigung einer strategischen Partnerschaft mit Microsoft, die eine Investition von 16 Mio. US-Dollar und die Bereitstellung von Mistral-Modellen in der Azure-Cloud umfasste.
  • Juni 2024: Eine neue Finanzierungsrunde über 600 Mio. €, die die Bewertung des Unternehmens auf ~5,8 Mrd. € steigerte und es zu einem der teuersten KI-Start-ups der Welt machte.

Technische Merkmale der Architektur

Die Modelle von Mistral AI basieren auf der Transformer-Architektur, beinhalten jedoch eine Reihe wichtiger Innovationen, die auf die Steigerung der Effizienz und die Senkung des Rechenaufwands abzielen.

Transformer mit Verbesserungen (Mistral 7B)

Das erste Modell des Unternehmens, Mistral 7B, führte zwei wichtige architektonische Verbesserungen ein:

  • Sliding Window Attention (SWA) (Aufmerksamkeit mit gleitendem Fenster): Anstatt dass jedes Token mit allen vorhergehenden Tokens interagiert (was eine quadratische Komplexität aufweist), begrenzt SWA die Aufmerksamkeit auf ein festes Fenster (z. B. 4096 Tokens). Dies ermöglicht die Verarbeitung sehr langer Sequenzen (bis zu 32.000 Tokens und mehr) mit linearer Rechenkomplexität, was die Verarbeitung erheblich beschleunigt.
  • Grouped-Query Attention (GQA) (Gruppierte Abfrage-Aufmerksamkeit): Eine Optimierung des Standardmechanismus der Multi-Head-Attention. GQA verwendet eine geringere Anzahl von „Köpfen“ für die Schlüssel (Keys) und Werte (Values) als für die Abfragen (Queries) (z. B. im Verhältnis 8:1), was den Speicherbedarf erheblich reduziert und den Generierungsprozess (Inferenz) ohne signifikanten Qualitätsverlust beschleunigt.

Sparse Mixture-of-Experts (MoE)

In den Modellen der Mixtral-Serie (z. B. Mixtral 8x7B, Mixtral 8x22B) wird die Architektur Sparse Mixture-of-Experts (dünnbesetzte Mischung von Experten) eingesetzt. Anstelle einer einzigen dichten Schicht des neuronalen Netzes werden mehrere parallele „Experten“-Subnetze verwendet. Für jedes Eingangstoken wählt eine spezielle Gating-Schicht (Router) dynamisch eine kleine Teilmenge von Experten zur Aktivierung aus (üblicherweise 2 von 8).

Dies ermöglicht die Erstellung von Modellen mit einer riesigen Gesamtzahl an Parametern (Mixtral 8x22B hat 141 Mrd.), aber bei der Verarbeitung jedes Tokens wird nur ein kleiner Teil davon genutzt (~39 Mrd.). Dadurch erreicht das Modell eine Qualität, die mit der von viel größeren „dichten“ Modellen vergleichbar ist, jedoch bei der Geschwindigkeit und den Kosten der Inferenz, die denen von deutlich kleineren Modellen entsprechen.

Mamba-Architektur (SSM)

Im Jahr 2024 stellte Mistral AI das experimentelle Modell Codestral Mamba vor, das auf der Mamba-Architektur (Selective State-Space Model) basiert. Im Gegensatz zu Transformern verwendet Mamba einen rekurrenten Mechanismus, der auf Zustandsraummodellen beruht. Die wesentlichen Vorteile sind:

  • Lineare Komplexität in Bezug auf die Sequenzlänge, was es bei langen Kontexten extrem schnell macht.
  • Theoretisch „unendlicher“ Kontext, der nur durch den verfügbaren Speicher begrenzt ist.
  • Hohe Inferenzgeschwindigkeit im Vergleich zu äquivalenten Transformern.

Chronologie und Modelle

Wichtige Veröffentlichungen von Mistral AI-Modellen
Monat / Jahr Modell Parameter (Mrd.) Wesentliche Merkmale Lizenz
09 / 2023 Mistral 7B 7,3 GQA + SWA-Architektur; 32k-Kontext; übertrifft Llama 2 13B in allen Benchmarks. Apache 2.0
12 / 2023 Mixtral 8x7B 46,7 (12,9 aktiv) Erstes offenes MoE-Modell; Qualität auf dem Niveau von GPT-3.5. Apache 2.0
02 / 2024 Mistral Small / Large ? „Junior“- und Flaggschiff-Modelle, verfügbar über API. Small: Apache 2.0,
Large: Research
04 / 2024 Mixtral 8x22B 141 (39 aktiv) 64k-Kontext; SOTA-Qualität unter den Open-Source-Modellen zum Zeitpunkt der Veröffentlichung. Apache 2.0
05 / 2024 Codestral 22B 22 Spezialisiertes Modell für die Codegenerierung (80+ Sprachen). Non-Production
07 / 2024 Mathstral 7B / Nemo 12B 7 / 12 Spezialisierte Modelle für Mathematik und Mehrsprachigkeit. Apache 2.0
07 / 2024 Codestral Mamba 7.3B 7,3 Experimentelles Modell für Code auf Mamba-Architektur; 256k+ Kontext. Apache 2.0
09 / 2024 Pixtral 12B 12 Erstes offenes multimodales Modell (Text + Bilder). Apache 2.0
11 / 2024 Mistral Large 24.11 ~100+ (Schätzung) Aktualisiertes Flaggschiff-Modell mit verbessertem Reasoning. Research
01 / 2025 Mistral Small 3 24 Optimiert für geringe Latenz (bis zu 150 Tokens/s); Qualität auf dem Niveau von 70B-Modellen. Apache 2.0
05 / 2025 Mistral Medium 3 ? Frontier-multimodales Modell (Text, Bilder) mit 128k-Kontext. Proprietär
05 / 2025 Devstral 24B 24 „Agenten“-Modell für autonome Softwareentwicklung; 46,8 % auf SWE-Bench. Apache 2.0

Vergleich mit Wettbewerbern

  • vs. Llama (Meta): Mistral-Modelle übertreffen durchweg Llama-Modelle ähnlicher oder sogar größerer Größe. Mistral 7B übertraf Llama 2 13B, und Mixtral 8x7B übertraf Llama 2 70B. Der Hauptunterschied liegt in der Lizenz: Mistral verwendet die vollständig permissive Apache 2.0-Lizenz, während die Llama-Lizenz Einschränkungen aufweist.
  • vs. GPT (OpenAI): Die Flaggschiff-Modelle von OpenAI (GPT-4) bleiben führend bei den komplexesten Aufgaben, jedoch zeigen die offenen Modelle von Mistral (z. B. Mixtral 8x7B) eine Qualität, die mit der von GPT-3.5 vergleichbar ist. Mistral bietet eine offene Alternative, die es ermöglicht, Modelle lokal bereitzustellen und vollständig zu kontrollieren.
  • vs. Claude (Anthropic): Die Claude-Modelle sind für ihr großes Kontextfenster und ihren Fokus auf Sicherheit bekannt. Mistral hat offene Modelle mit vergleichbarem oder größerem Kontext angeboten. In Bezug auf die Leistung in Standard-Benchmarks (LMSys Arena) übertraf das Modell Medium 3 Claude 3 Opus.

Anwendung und Ökosystem

Produkte

  • Le Chat: Ein öffentlicher Chat-Assistent (Web, iOS/Android), der die Fähigkeiten der Mistral-Modelle demonstriert, einschließlich Websuche und Bilderzeugung.
  • La Plateforme: Eine Unternehmensplattform mit API-Zugang zu allen Mistral-Modellen, die es Unternehmen ermöglicht, LLMs in ihre Produkte zu integrieren.

Unternehmenskunden

Die Technologien von Mistral werden von großen Unternehmen wie BNP Paribas (Finanzen), CMA CGM (Logistik), Zalando (E-Commerce) und der staatlichen Agentur France Travail genutzt. Für europäische Kunden ist die Möglichkeit der lokalen Bereitstellung der Modelle zur Einhaltung der DSGVO (GDPR) von großer Bedeutung.

Open-Source-Community

Dank der offenen Lizenz sind die Mistral-Modelle zur Grundlage für Tausende von Projekten auf Plattformen wie Hugging Face geworden. Die Community trainiert die Modelle aktiv für spezialisierte Aufgaben nach und erstellt Versionen für Biologie (BioMistral), Rechtswissenschaften (SaulLM-7B) und die Lokalisierung in verschiedene Sprachen (z. B. Polish Bielik 7B).

Lizenzierung

Modellreihe Lizenz Einschränkungen
Basis, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral Apache 2.0 Freie kommerzielle Nutzung.
Codestral 22B Non-Production License Kommerzielle Nutzung ohne gesonderte Vereinbarung verboten.
Large-Serie, Medium-Serie Mistral Research / Proprietär Zugang nur über Cloud-API.

Literatur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
  • Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.