Mixtral (Mistral AI) (SV)
Mixtral 8x7B — är en stor språkmodell (LLM) med öppen källkod, utvecklad av det franska företaget Mistral AI och släppt i december 2023. Modellen baseras på arkitekturen gles blandning av experter (Sparse Mixture of Experts, SMoE), vilket gör att den kan kombinera prestanda jämförbar med betydligt större modeller (exempelvis Llama 2 70B och GPT-3.5) med hög hastighet och effektivt inferens[1].
Modellen distribueras under den fria licensen Apache 2.0, vilket gör den tillgänglig för akademiskt och kommersiellt bruk. Mixtral 8x7B uppvisar starka förmågor i flerspråkiga uppgifter, kodgenerering och instruktionsföljning, vilket har gjort den till en av de mest populära öppna modellerna vid tidpunkten för lanseringen[2].
Utvecklingshistoria
Företaget Mistral AI grundades i april 2023 av tidigare forskare från Meta och Google. I september 2023 släppte företaget sin första modell, Mistral 7B, som fick erkännande för sin höga effektivitet trots liten storlek.
Den 11 december 2023 presenterade Mistral AI lanseringen av Mixtral 8x7B, sin första modell baserad på arkitekturen för blandning av experter. Modellen väckte omedelbart gemenskapens uppmärksamhet som den kraftfullaste öppna LLM vid den tidpunkten och visade prestanda på GPT-3.5-nivå med avsevärt högre inferenshastighet. I januari 2024 publicerades en detaljerad teknisk beskrivning av modellen i form av en vetenskaplig artikel på arXiv, vilket gav oberoende forskare möjlighet att bekanta sig med arkitekturdetaljer och testresultat[2].
Arkitektur: Sparse Mixture of Experts - Gles blandning av experter (SMoE)
Den viktigaste nyheten i Mixtral 8x7B är införandet av arkitekturen Sparse Mixture of Experts. Till skillnad från vanliga ("täta") transformers, där varje lager utför samma beräkning för alla tokens, innehåller varje lager i Mixtral flera parallella block — så kallade "experter".
Viktigaste egenskaper hos arkitekturen:
- MoE-struktur: Varje transformerlager innehåller 8 feed-forward-block ("experter"). För att bearbeta varje token väljer ett speciellt router-nätverk de 2 mest lämpliga experterna (Top-2 routing).
- Parametrar: Det totala antalet modellparametrar uppgår till 46,7 miljarder, men tack vare gles aktivering används bara 12,9 miljarder aktiva parametrar per token under inferens. Detta ger en inferenshastighet jämförbar med modeller på ~13 miljarder parametrar.
- Uppmärksamhetsoptimering: Modellen använder moderna tekniker för effektiv bearbetning av långa sekvenser, inklusive Sliding Window Attention (SWA) och Grouped Query Attention (GQA).
- Kontextlängd: Modellen stöder ett kontextfönster på upp till 32 768 tokens.
Träning
Familjen Mixtral 8x7B inkluderar två huvudversioner: 1. Mixtral-8x7B-v0.1 (basmodell): En förtränad modell, tränad på ett stort korpus av webbdata på flera europeiska språk (engelska, franska, tyska, spanska, italienska). Huvuduppgiften är att förutsäga nästa token. 2. Mixtral-8x7B-Instruct-v0.1 (instruktionsmodell): En version finjusterad med hjälp av supervised fine-tuning (SFT) och Direct Preference Optimization (DPO). Denna modell följer användarinstruktioner bättre och är avsedd för användning i dialogformat.
Prestanda
Mixtral 8x7B överträffar eller är jämförbar i kvalitet med modellen Llama 2 70B på de flesta standardbenchmark, med samtidigt 5 gånger färre aktiva parametrar och följaktligen avsevärt högre inferenshastighet (upp till 6 gånger snabbare)[2].
| Mätvärde | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (allmänna kunskaper) | 69,9% | 70,0% | 70,6% |
| GSM-8K (matematik) | 53,6% | 57,1% | 58,4% |
| MBPP (kodgenerering) | 49,8% | 52,2% | 60,7% |
| MT-Bench (dialogutvärdering, Instruct-versioner) | 6,86 | 8,32 | 8,30 |
- Flerspråkighet: Tack vare en ökad andel flerspråkiga data i träningskorpuset överträffar Mixtral avsevärt Llama 2 70B i uppgifter på franska, tyska, spanska och italienska.
- Snedvridning och hallucinationer: Jämfört med Llama 2 70B uppvisar modellen högre noggrannhet på benchmark BBQ (utvärdering av sociala fördomar) och en mer positiv sentimentprofil på benchmark BOLD.
Licensiering och tillgänglighet
Båda versionerna av Mixtral 8x7B (bas och Instruct) är utgivna under licensen Apache 2.0, som tillåter fri akademisk och kommersiell användning. Källkoder och modellvikter finns tillgängliga på GitHub och Hugging Face.
Länkar
- Mixtral of Experts — officiellt tillkännagivande på Mistral AI:s blogg
- Modellen Mixtral 8x7B på Hugging Face
Litteratur
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.