Mixtral (Mistral AI) (HU)
Mixtral 8x7B — egy nyílt forráskódú nagy nyelvi modell (LLM), amelyet a francia Mistral AI vállalat fejlesztett ki, és 2023 decemberében adott ki. A modell ritka szakértő-keverék (Sparse Mixture of Experts, SMoE) architektúrán alapul, amely lehetővé teszi, hogy teljesítménye összemérhető legyen jóval nagyobb modellekével (pl. Llama 2 70B és GPT-3.5), miközben nagy sebességet és hatékony inferenciát biztosít[1].
A modell az Apache 2.0 szabad licenc alatt terjesztik, ami elérhetővé teszi akadémiai és kereskedelmi felhasználás céljára is. A Mixtral 8x7B erős képességeket mutat többnyelvű feladatokban, kódgenerálásban és utasításkövetésben, ami a megjelenésekor az egyik legnépszerűbb nyílt modellé tette[2].
Fejlesztéstörténet
A Mistral AI vállalatot 2023 áprilisában alapították a Meta és a Google korábbi kutatói. 2023 szeptemberében a vállalat kiadta első modelljét, a Mistral 7B-t, amelyet kis mérete ellenére magas hatékonysága miatt ismertek el.
2023. december 11-én a Mistral AI bejelentette a Mixtral 8x7B kiadását, amely a vállalat első, szakértő-keverék architektúrán alapuló modellje. A modell azonnal felkeltette a közösség figyelmét, mint addig a legerősebb nyílt LLM, amely GPT-3.5 szintű minőséget mutatott, miközben jelentősen gyorsabb volt az inferencia során. 2024 januárjában részletes technikai leírás jelent meg a modellről az arXiv-on tudományos cikk formájában, amely lehetővé tette a független kutatóknak az architektúra részleteinek és a teszteredmények megismerését[2].
Architektúra: Ritka szakértő-keverék (SMoE)
A Mixtral 8x7B legfontosabb újítása a Sparse Mixture of Experts architektúra bevezetése. A szokásos („sűrű") transformerekkel ellentétben, ahol minden réteg ugyanazt a számítást végzi el az összes tokenre, a Mixtral minden rétege több párhuzamos „szakértő"-blokkot tartalmaz.
Az architektúra főbb jellemzői:
- MoE-struktúra: Minden transformer-réteg 8 feed-forward blokkot („szakértőt") tartalmaz. Az egyes tokenek feldolgozásához egy speciális router-hálózat választja ki a 2 legalkalmasabb szakértőt (Top-2 routing).
- Paraméterek: A modell paramétereinek teljes száma 46,7 milliárd, azonban a ritka aktiváció révén az inferencia során tokenenként csupán 12,9 milliárd aktív paramétert használ. Ez ~13 milliárd paraméterű modellekével összehasonlítható inferencia-sebességet biztosít.
- Figyelem-optimalizálás: A modell modern technikákat alkalmaz a hosszú szekvenciák hatékony feldolgozásához, beleértve a Sliding Window Attention (SWA) és a Grouped Query Attention (GQA) eljárásokat.
- Kontexthossz: A modell legfeljebb 32 768 tokenes kontextablakot támogat.
Tanítás
A Mixtral 8x7B modellácsalád két fő változatot tartalmaz: 1. Mixtral-8x7B-v0.1 (alap modell): Előre betanított modell, amelyet több európai nyelvű (angol, francia, német, spanyol, olasz) webes adatkorpuszon tanítottak. Fő feladata a következő token előrejelzése. 2. Mixtral-8x7B-Instruct-v0.1 (utasításkövető modell): supervised fine-tuning (SFT) és Direct Preference Optimization (DPO) segítségével finomhangolt változat. Ez a modell jobban követi a felhasználói utasításokat, és párbeszédes formátumú használatra készült.
Teljesítmény
A Mixtral 8x7B a legtöbb szabványos benchmarkon felülmúlja vagy egyenrangú a Llama 2 70B modellel, miközben ötször kevesebb aktív paramétert használ, és ennek következtében jelentősen gyorsabb következtetési sebességet kínál (akár hatszor gyorsabb)[2].
| Mérőszám | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (általános tudás) | 69,9% | 70,0% | 70,6% |
| GSM-8K (matematika) | 53,6% | 57,1% | 58,4% |
| MBPP (kódgenerálás) | 49,8% | 52,2% | 60,7% |
| MT-Bench (párbeszéd értékelés, Instruct-változatok) | 6,86 | 8,32 | 8,30 |
- Többnyelvűség: A tanítókorpuszban szereplő többnyelvű adatok megnövelt arányának köszönhetően a Mixtral jelentősen felülmúlja a Llama 2 70B-t francia, német, spanyol és olasz nyelvű feladatokban.
- Torzítás és hallucinációk: A Llama 2 70B-vel összehasonlítva a modell magasabb pontosságot mutat a BBQ benchmarkon (társadalmi előítéletek értékelése), és pozitívabb hangulati profilt a BOLD benchmarkon.
Licencelés és elérhetőség
A Mixtral 8x7B mindkét változata (alap és Instruct) az Apache 2.0 licenc alatt jelent meg, amely szabad akadémiai és kereskedelmi felhasználást engedélyez. A modellek forráskódjai és súlyai elérhetők a GitHubon és a Hugging Face-en.
Hivatkozások
- Mixtral of Experts — a Mistral AI blogjának hivatalos bejelentése
- A Mixtral 8x7B modell a Hugging Face-en
Irodalom
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.