Mixtral (Mistral AI) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — je velký jazykový model (LLM) s otevřeným zdrojovým kódem, vyvinutý francouzskou společností Mistral AI a vydaný v prosinci 2023. Model je založen na architektuře řídké směsi expertů (Sparse Mixture of Experts, SMoE), která mu umožňuje kombinovat výkon srovnatelný s mnohem většími modely (například Llama 2 70B a GPT-3.5) s vysokou rychlostí a efektivitou inference[1].

Model je šířen pod svobodnou licencí Apache 2.0, což jej zpřístupňuje pro akademické i komerční využití. Mixtral 8x7B prokazuje silné schopnosti v mnohojazyčných úlohách, generování kódu a plnění instrukcí, což z něj udělalo jeden z nejpopulárnějších otevřených modelů v době vydání[2].

Historie vývoje

Společnost Mistral AI byla založena v dubnu 2023 bývalými výzkumníky z Meta a Google. V září 2023 společnost vydala svůj první model, Mistral 7B, který si získal uznání pro vysokou efektivitu při malé velikosti.

11. prosince 2023 Mistral AI oznámila vydání Mixtral 8x7B, svého prvního modelu založeného na architektuře směsi expertů. Model okamžitě přitáhl pozornost komunity jako tehdy nejvýkonnější otevřený LLM, přičemž demonstroval kvalitu na úrovni GPT-3.5 při výrazně vyšší rychlosti inference. V lednu 2024 byl publikován podrobný technický popis modelu ve formě vědeckého článku na arXiv, což nezávislým výzkumníkům umožnilo seznámit se s detaily architektury a výsledky testů[2].

Architektura: Řídká směs expertů (SMoE)

Hlavní novinkou Mixtral 8x7B je zavedení architektury Sparse Mixture of Experts. Na rozdíl od standardních („hustých") transformerů, kde každá vrstva provádí stejný výpočet pro všechny tokeny, obsahuje každá vrstva Mixtralu několik paralelních bloků-„expertů".

Klíčové vlastnosti architektury:

  • Struktura MoE: Každá transformerová vrstva obsahuje 8 feed-forward bloků („expertů"). Pro zpracování každého tokenu speciální router-síť vybírá 2 nejvhodnější experty (Top-2 routing).
  • Parametry: Celkový počet parametrů modelu je 46,7 mld, avšak díky řídké aktivaci se při zpracování každého tokenu využívá pouze 12,9 mld aktivních parametrů. To zajišťuje rychlost inference srovnatelnou s modely o ~13 mld parametrech.
  • Optimalizace attention: Model využívá moderní techniky pro efektivní zpracování dlouhých sekvencí, včetně Sliding Window Attention (SWA) a Grouped Query Attention (GQA).
  • Délka kontextu: Model podporuje kontextové okno o délce až 32 768 tokenů.

Trénování

Rodina Mixtral 8x7B zahrnuje dvě základní verze: 1. Mixtral-8x7B-v0.1 (základní model): Předtrénovaný model, natrénovaný na velkém korpusu webových dat v několika evropských jazycích (angličtina, francouzština, němčina, španělština, italština). Hlavním úkolem je predikce dalšího tokenu. 2. Mixtral-8x7B-Instruct-v0.1 (instrukční model): Verze doladěná pomocí supervised fine-tuning (SFT) a Direct Preference Optimization (DPO). Tento model lépe plní instrukce uživatele a je určen pro použití v dialogovém formátu.

Výkon

Mixtral 8x7B překonává nebo se kvalitou vyrovná modelu Llama 2 70B na většině standardních benchmarků, přičemž má 5× méně aktivních parametrů a v důsledku toho výrazně vyšší rychlost inference (až 6× rychlejší)[2].

Srovnání výkonu Mixtral 8x7B s Llama 2 70B a GPT-3.5[2]
Metrika Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (obecné znalosti) 69,9% 70,0% 70,6%
GSM-8K (matematika) 53,6% 57,1% 58,4%
MBPP (generování kódu) 49,8% 52,2% 60,7%
MT-Bench (hodnocení dialogu, Instruct-verze) 6,86 8,32 8,30
  • Mnohojazyčnost: Díky zvýšenému podílu mnohojazyčných dat v trénovacím korpusu Mixtral výrazně překonává Llama 2 70B v úlohách ve francouzštině, němčině, španělštině a italštině.
  • Zkreslení a halucinace: Ve srovnání s Llama 2 70B model vykazuje vyšší přesnost na benchmarku BBQ (hodnocení sociálních předsudků) a pozitivnější profil nálady na benchmarku BOLD.

Licencování a dostupnost

Obě verze Mixtral 8x7B (základní i Instruct) jsou vydány pod licencí Apache 2.0, která umožňuje svobodné akademické i komerční využití. Zdrojové kódy a váhy modelů jsou dostupné na GitHubu a Hugging Face.

Odkazy

  • Mixtral of Experts — oficiální oznámení na blogu Mistral AI
  • Model Mixtral 8x7B na Hugging Face

Literatura

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Poznámky

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]