---
title: "Mixtral (Mistral AI) (CS)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4421
wiki_created_at: 2026-09-06T23:34:55Z
wiki_modified_at: 2026-09-06T23:34:55Z
downloaded_at: 2026-09-07T23:02:34Z
---

# Mixtral (Mistral AI) (CS)

**Mixtral 8x7B** — je velký jazykový model (LLM) s otevřeným zdrojovým kódem, vyvinutý francouzskou společností Mistral AI a vydaný v prosinci 2023. Model je založen na architektuře **řídké směsi expertů (Sparse Mixture of Experts, SMoE)**, která mu umožňuje kombinovat výkon srovnatelný s mnohem většími modely (například Llama 2 70B a GPT-3.5) s vysokou rychlostí a efektivitou inference<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_note-mistral_blog-1)</sup>.

Model je šířen pod svobodnou licencí Apache 2.0, což jej zpřístupňuje pro akademické i komerční využití. Mixtral 8x7B prokazuje silné schopnosti v mnohojazyčných úlohách, generování kódu a plnění instrukcí, což z něj udělalo jeden z nejpopulárnějších otevřených modelů v době vydání<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_note-arxiv_paper-2)</sup>.

## Historie vývoje

Společnost Mistral AI byla založena v dubnu 2023 bývalými výzkumníky z Meta a Google. V září 2023 společnost vydala svůj první model, **Mistral 7B**, který si získal uznání pro vysokou efektivitu při malé velikosti.

**11. prosince 2023** Mistral AI oznámila vydání **Mixtral 8x7B**, svého prvního modelu založeného na architektuře směsi expertů. Model okamžitě přitáhl pozornost komunity jako tehdy nejvýkonnější otevřený LLM, přičemž demonstroval kvalitu na úrovni GPT-3.5 při výrazně vyšší rychlosti inference. V lednu 2024 byl publikován podrobný technický popis modelu ve formě vědeckého článku na arXiv, což nezávislým výzkumníkům umožnilo seznámit se s detaily architektury a výsledky testů<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_note-arxiv_paper-2)</sup>.

## Architektura: Řídká směs expertů (SMoE)

Hlavní novinkou Mixtral 8x7B je zavedení architektury **Sparse Mixture of Experts**. Na rozdíl od standardních („hustých") transformerů, kde každá vrstva provádí stejný výpočet pro všechny tokeny, obsahuje každá vrstva Mixtralu několik paralelních bloků-„expertů".

Klíčové vlastnosti architektury:

- **Struktura MoE**: Každá transformerová vrstva obsahuje **8** feed-forward bloků („expertů"). Pro zpracování každého tokenu speciální *router-síť* vybírá **2** nejvhodnější experty (*Top-2 routing*).
- **Parametry**: Celkový počet parametrů modelu je **46,7 mld**, avšak díky řídké aktivaci se při zpracování každého tokenu využívá pouze **12,9 mld** aktivních parametrů. To zajišťuje rychlost inference srovnatelnou s modely o ~13 mld parametrech.
- **Optimalizace attention**: Model využívá moderní techniky pro efektivní zpracování dlouhých sekvencí, včetně **Sliding Window Attention (SWA)** a **Grouped Query Attention (GQA)**.
- **Délka kontextu**: Model podporuje kontextové okno o délce až **32 768 tokenů**.

## Trénování

Rodina Mixtral 8x7B zahrnuje dvě základní verze: 1. **Mixtral-8x7B-v0.1** (základní model): Předtrénovaný model, natrénovaný na velkém korpusu webových dat v několika evropských jazycích (angličtina, francouzština, němčina, španělština, italština). Hlavním úkolem je predikce dalšího tokenu. 2. **Mixtral-8x7B-Instruct-v0.1** (instrukční model): Verze doladěná pomocí *supervised fine-tuning (SFT)* a *Direct Preference Optimization (DPO)*. Tento model lépe plní instrukce uživatele a je určen pro použití v dialogovém formátu.

## Výkon

Mixtral 8x7B překonává nebo se kvalitou vyrovná modelu Llama 2 70B na většině standardních benchmarků, přičemž má 5× méně aktivních parametrů a v důsledku toho výrazně vyšší rychlost inference (až 6× rychlejší)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_note-arxiv_paper-2)</sup>.

| Metrika                                          | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|--------------------------------------------------|-------------|---------|--------------|
| **MMLU** (obecné znalosti)                       | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (matematika)                          | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (generování kódu)                       | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (hodnocení dialogu, Instruct-verze) | 6,86        | 8,32    | **8,30**     |

Srovnání výkonu Mixtral 8x7B s Llama 2 70B a GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_note-arxiv_paper-2)</sup>

- **Mnohojazyčnost**: Díky zvýšenému podílu mnohojazyčných dat v trénovacím korpusu Mixtral výrazně překonává Llama 2 70B v úlohách ve francouzštině, němčině, španělštině a italštině.
- **Zkreslení a halucinace**: Ve srovnání s Llama 2 70B model vykazuje vyšší přesnost na benchmarku BBQ (hodnocení sociálních předsudků) a pozitivnější profil nálady na benchmarku BOLD.

## Licencování a dostupnost

Obě verze Mixtral 8x7B (základní i Instruct) jsou vydány pod licencí Apache 2.0, která umožňuje svobodné akademické i komerční využití. Zdrojové kódy a váhy modelů jsou dostupné na GitHubu a Hugging Face.

## Odkazy

- Mixtral of Experts — oficiální oznámení na blogu Mistral AI
- Model Mixtral 8x7B na Hugging Face

## Literatura

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Poznámky

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(CS)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
