Mistral AI (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mistral AI — een Frans bedrijf op het gebied van kunstmatige intelligentie, gespecialiseerd in de ontwikkeling van grote taalmodellen (LLM). Opgericht in april 2023, groeide het bedrijf snel uit tot een van de belangrijkste spelers op de Europese en wereldwijde markten, waarbij het zichzelf positioneert als alternatief voor propriëtaire modellen van Amerikaanse technologiebedrijven.

Het kenmerkende aspect van de aanpak van Mistral AI is de focus op het ontwikkelen van hoogwaardige modellen met open gewichten (voornamelijk onder de Apache 2.0-licentie), wat bijdraagt aan de democratisering van toegang tot geavanceerde AI-technologieën. Het bedrijf staat bekend om zijn architectuurinnovaties, zoals Grouped-Query Attention (GQA), Sliding Window Attention (SWA) en Sparse Mixture-of-Experts (MoE), die hun modellen in staat stellen hoge efficiëntie te bereiken bij een relatief kleine omvang en lage rekenkosten.

Geschiedenis

Het bedrijf Mistral AI werd in april 2023 in Parijs opgericht door drie Franse onderzoekers: Arthur Mensch, Guillaume Lample en Timothée Lacroix. Alle drie oprichters hadden eerder gewerkt aan grote taalmodellen bij toonaangevende wereldwijde bedrijven: Mensch was onderzoeker bij Google DeepMind, terwijl Lample en Lacroix werkten aan LLM's bij Meta AI.

De missie van het bedrijf is om geavanceerde AI-prestaties toegankelijk te maken voor iedereen, door openheid, samenwerking en transparantie te bevorderen. Deze aanpak stelde Mistral AI in staat snel aanzienlijke investeringen aan te trekken:

  • Juni 2023: €105 miljoen in een seed-ronde, een record voor Europa.
  • December 2023: €385 miljoen in een Series A-ronde, waarna de waardering van het bedrijf de $2 miljard overschreed en het de status van 'eenhoorn' verwierf.
  • Februari 2024: Een strategisch partnerschap met Microsoft werd aangekondigd, dat een investering van $16 miljoen omvatte en de plaatsing van Mistral-modellen in de Azure-cloud.
  • Juni 2024: Een nieuwe financieringsronde van €600 miljoen, waardoor de waardering van het bedrijf ~€5,8 miljard bereikte en het een van de duurste AI-startups ter wereld werd.

Technische kenmerken van de architectuur

De modellen van Mistral AI zijn gebaseerd op de transformer-architectuur, maar bevatten een aantal belangrijke innovaties gericht op het verbeteren van de efficiëntie en het verlagen van de rekenkosten.

Transformer met verbeteringen (Mistral 7B)

Het eerste model van het bedrijf, Mistral 7B, introduceerde twee belangrijke architectuurverbeteringen:

  • Sliding Window Attention (SWA) (Aandacht met schuifvenster): In plaats van dat elk token interacteert met alle voorgaande tokens (wat kwadratische complexiteit heeft), beperkt SWA de aandacht tot een vast venster (bijvoorbeeld 4096 tokens). Dit maakt het mogelijk zeer lange reeksen (tot 32.000 tokens en meer) te verwerken met lineaire rekencomplexiteit, waardoor de verwerking aanzienlijk wordt versneld.
  • Grouped-Query Attention (GQA) (Gegroepeerde query-aandacht): Een optimalisatie van het standaard multi-head attention-mechanisme. GQA gebruikt een kleiner aantal 'hoofden' voor sleutels (keys) en waarden (values) dan voor zoekopdrachten (queries) (bijvoorbeeld in een verhouding van 8:1), wat de geheugenbehoeften aanzienlijk vermindert en het generatieproces (inference) versnelt zonder noemenswaardig kwaliteitsverlies.

Sparse Mixture-of-Experts (MoE)

In de modellen van de Mixtral-serie (bijvoorbeeld Mixtral 8x7B, Mixtral 8x22B) wordt de architectuur Sparse Mixture-of-Experts (schaarse mengeling van experts) toegepast. In plaats van één dense laag van een neuraal netwerk worden meerdere parallelle 'expertsubnetwerken' gebruikt. Voor elk invoertoken selecteert een speciale gating-laag (router) dynamisch een kleine deelverzameling van experts voor activering (doorgaans 2 van de 8).

Dit maakt het mogelijk modellen te bouwen met een enorm totaal aantal parameters (Mixtral 8x22B heeft 141 miljard), maar bij het verwerken van elk token wordt slechts een klein deel hiervan gebruikt (~39 miljard). Als resultaat bereikt het model kwaliteit die vergelijkbaar is met veel grotere 'dense' modellen, maar met de inference-snelheid en -kosten van aanzienlijk kleinere modellen.

Mamba-architectuur (SSM)

In 2024 presenteerde Mistral AI het experimentele model Codestral Mamba, gebaseerd op de architectuur Mamba (Selective State-Space Model). In tegenstelling tot transformers maakt Mamba gebruik van een recurrent mechanisme gebaseerd op toestandsruimtemodellen. Belangrijkste voordelen:

  • Lineaire complexiteit ten opzichte van de reekslengte, waardoor het extreem snel is bij lange contexten.
  • Theoretisch 'oneindige' context, uitsluitend beperkt door het beschikbare geheugen.
  • Hoge inference-snelheid in vergelijking met equivalente transformers.

Tijdlijn en modellen

Belangrijkste releases van Mistral AI-modellen
Maand / Jaar Model Parameters (miljard) Belangrijkste kenmerken Licentie
09 / 2023 Mistral 7B 7,3 GQA + SWA-architectuur; context 32k; overtreft Llama 2 13B op alle benchmarks. Apache 2.0
12 / 2023 Mixtral 8x7B 46,7 (12,9 actief) Eerste open MoE-model; kwaliteit op niveau van GPT-3.5. Apache 2.0
02 / 2024 Mistral Small / Large ? 'Kleinere' en flagship-modellen, beschikbaar via API. Small: Apache 2.0,
Large: Research
04 / 2024 Mixtral 8x22B 141 (39 actief) Context 64k; SOTA-kwaliteit onder open-source modellen ten tijde van uitgifte. Apache 2.0
05 / 2024 Codestral 22B 22 Gespecialiseerd model voor codegeneratie (80+ talen). Non-Production
07 / 2024 Mathstral 7B / Nemo 12B 7 / 12 Gespecialiseerde modellen voor wiskunde en meertaligheid. Apache 2.0
07 / 2024 Codestral Mamba 7.3B 7,3 Experimenteel model voor code op Mamba-architectuur; context 256k+. Apache 2.0
09 / 2024 Pixtral 12B 12 Eerste open multimodaal model (tekst + afbeeldingen). Apache 2.0
11 / 2024 Mistral Large 24.11 ~100+ (schatting) Bijgewerkt flagship-model met verbeterde redeneervaardigheden. Research
01 / 2025 Mistral Small 3 24 Geoptimaliseerd voor lage latentie (tot 150 tokens/s); kwaliteit op niveau van 70B-modellen. Apache 2.0
05 / 2025 Mistral Medium 3 ? Frontier multimodaal model (tekst, afbeeldingen) met een context van 128k. Propriëtair
05 / 2025 Devstral 24B 24 'Agentisch' model voor autonome softwareontwikkeling; 46,8% op SWE-Bench. Apache 2.0

Vergelijking met concurrenten

  • vs. Llama (Meta): Mistral-modellen overtreffen consequent Llama-modellen van vergelijkbare of zelfs grotere omvang. Mistral 7B overtrof Llama 2 13B, en Mixtral 8x7B overtrof Llama 2 70B. Het voornaamste verschil is de licentie: Mistral gebruikt de volledig permissieve Apache 2.0, terwijl de Llama-licentie beperkingen kent.
  • vs. GPT (OpenAI): De flagship-modellen van OpenAI (GPT-4) blijven de koplopers bij de meest complexe taken, maar de open modellen van Mistral (zoals Mixtral 8x7B) tonen kwaliteit die vergelijkbaar is met GPT-3.5. Mistral biedt een open alternatief waarmee modellen lokaal kunnen worden ingezet en volledig kunnen worden beheerd.
  • vs. Claude (Anthropic): Claude-modellen staan bekend om hun groot contextvenster en hun gerichtheid op veiligheid. Mistral bood open modellen aan met een vergelijkbaar of groter contextvenster. Qua prestaties op standaard benchmarks (LMSys Arena) overtrof het Medium 3-model Claude 3 Opus.

Toepassingen en ecosysteem

Producten

  • Le Chat: Een publieke chatassistent (web, iOS/Android) die de mogelijkheden van Mistral-modellen demonstreert, inclusief webzoeken en beeldgeneratie.
  • La Plateforme: Een zakelijk platform met API-toegang tot alle Mistral-modellen, waarmee bedrijven LLM's in hun producten kunnen integreren.

Zakelijke klanten

Mistral-technologieën worden gebruikt door grote bedrijven zoals BNP Paribas (financiën), CMA CGM (logistiek), Zalando (e-commerce) en het overheidsagentschap France Travail. Voor Europese klanten is de mogelijkheid tot lokale implementatie van modellen van belang voor naleving van de AVG (GDPR).

Open-source gemeenschap

Dankzij de open licentie zijn Mistral-modellen de basis geworden voor duizenden projecten op platforms zoals Hugging Face. De gemeenschap fine-tunet modellen actief voor gespecialiseerde taken en maakt versies voor biologie (BioMistral), rechtsgeleerdheid (SaulLM-7B) en lokalisatie naar verschillende talen (zoals Polish Bielik 7B).

Licenties

Modelreeks Licentie Beperkingen
Basis, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral Apache 2.0 Vrij commercieel gebruik.
Codestral 22B Non-Production License Commercieel gebruik verboden zonder afzonderlijke overeenkomst.
Large-reeks, Medium-reeks Mistral Research / Propriëtair Toegang uitsluitend via cloud-API.

Verwijzingen

  • Officiële documentatie van Mistral AI
  • Profiel van Mistral AI op Hugging Face

Literatuur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
  • Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.