Mixtral (Mistral AI) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — een groot taalmodel (LLM) met open broncode, ontwikkeld door het Franse bedrijf Mistral AI en uitgebracht in december 2023. Het model is gebaseerd op de architectuur van een schaarse mengsel van experts (Sparse Mixture of Experts, SMoE), waardoor het prestaties kan combineren die vergelijkbaar zijn met veel grotere modellen (zoals Llama 2 70B en GPT-3.5) met een hoge snelheid en efficiëntie van inferentie[1].

Het model wordt verspreid onder de vrije licentie Apache 2.0, wat het toegankelijk maakt voor academisch en commercieel gebruik. Mixtral 8x7B toont sterke capaciteiten bij meertalige taken, het genereren van code en het opvolgen van instructies, waardoor het een van de populairste open modellen was op het moment van uitbrengen[2].

Geschiedenis van de ontwikkeling

Het bedrijf Mistral AI werd opgericht in april 2023 door voormalige onderzoekers van Meta en Google. In september 2023 bracht het bedrijf zijn eerste model uit, Mistral 7B, dat erkenning kreeg vanwege zijn hoge efficiëntie bij een klein formaat.

11 december 2023 kondigde Mistral AI de uitbrenging aan van Mixtral 8x7B, het eerste model op basis van de mixture-of-experts-architectuur. Het model trok onmiddellijk de aandacht van de gemeenschap als de krachtigste open LLM op dat moment, waarbij het kwaliteit op het niveau van GPT-3.5 demonstreerde bij een aanzienlijk hogere inferentiesnelheid. In januari 2024 werd een gedetailleerde technische beschrijving van het model gepubliceerd als wetenschappelijk artikel op arXiv, waardoor onafhankelijke onderzoekers kennis konden nemen van de architectuurdetails en testresultaten[2].

Architectuur: Schaarse mengsel van experts (SMoE)

De belangrijkste vernieuwing van Mixtral 8x7B is de invoering van de Sparse Mixture of Experts-architectuur. In tegenstelling tot standaard ('dichte') transformers, waarbij elke laag dezelfde berekening uitvoert voor alle tokens, bevat elke laag in Mixtral meerdere parallelle blokken — 'experts'.

Belangrijkste kenmerken van de architectuur:

  • MoE-structuur: Elke transformer-laag bevat 8 feed-forward blokken ('experts'). Voor de verwerking van elk token selecteert een speciaal router-netwerk de 2 meest geschikte experts (Top-2 routing).
  • Parameters: Het totale aantal parameters van het model bedraagt 46,7 miljard, maar dankzij schaarse activering worden voor elk token tijdens het uitvoeren slechts 12,9 miljard actieve parameters gebruikt. Dit zorgt voor een inferentiesnelheid die vergelijkbaar is met modellen van ~13 miljard parameters.
  • Optimalisatie van aandacht: Het model maakt gebruik van moderne technieken voor de efficiënte verwerking van lange reeksen, waaronder Sliding Window Attention (SWA) en Grouped Query Attention (GQA).
  • Contextlengte: Het model ondersteunt een contextvenster van maximaal 32 768 tokens.

Training

De Mixtral 8x7B-familie omvat twee hoofdversies:

  1. Mixtral-8x7B-v0.1 (basismodel): Een voorgetraind model, getraind op een groot corpus van webgegevens in meerdere Europese talen (Engels, Frans, Duits, Spaans, Italiaans). De primaire taak is het voorspellen van het volgende token.
  2. Mixtral-8x7B-Instruct-v0.1 (instructiemodel): Een versie die verder is verfijnd met behulp van supervised fine-tuning (SFT) en Direct Preference Optimization (DPO). Dit model volgt gebruikersinstructies beter en is bedoeld voor gebruik in dialoogformaat.

Prestaties

Mixtral 8x7B overtreft of is vergelijkbaar in kwaliteit met het model Llama 2 70B op de meeste standaard benchmarks, terwijl het 5 keer minder actieve parameters heeft en daardoor een aanzienlijk hogere uitvoersnelheid (tot 6 keer sneller)[2].

Vergelijking van de prestaties van Mixtral 8x7B met Llama 2 70B en GPT-3.5[2]
Metriek Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (algemene kennis) 69,9% 70,0% 70,6%
GSM-8K (wiskunde) 53,6% 57,1% 58,4%
MBPP (codegeneratie) 49,8% 52,2% 60,7%
MT-Bench (beoordeling van dialoog, Instruct-versies) 6,86 8,32 8,30
  • Meertaligheid: Dankzij het verhoogde aandeel meertalige gegevens in het trainingskorpus overtreft Mixtral Llama 2 70B aanzienlijk bij taken in het Frans, Duits, Spaans en Italiaans.
  • Vooroordelen en hallucinaties: In vergelijking met Llama 2 70B toont het model een hogere nauwkeurigheid op de BBQ-benchmark (beoordeling van sociale vooroordelen) en een positiever sentimentprofiel op de BOLD-benchmark.

Licentie en beschikbaarheid

Beide versies van Mixtral 8x7B (basis en Instruct) zijn uitgebracht onder de Apache 2.0-licentie, die vrij academisch en commercieel gebruik toestaat. De broncode en modelgewichten zijn beschikbaar op GitHub en Hugging Face.

Verwijzingen

  • Mixtral of Experts — officiële aankondiging op de blog van Mistral AI
  • Het model Mixtral 8x7B op Hugging Face

Literatuur

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Noten

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]