---
title: "Mistral AI (CS)"
source: "https://systems-analysis.info/int/Mistral_AI_(CS)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4394
wiki_created_at: 2026-09-06T23:34:34Z
wiki_modified_at: 2026-09-06T23:34:34Z
downloaded_at: 2026-09-07T23:02:25Z
---

# Mistral AI (CS)

**Mistral AI** — francouzská společnost v oblasti umělé inteligence, specializující se na vývoj velkých jazykových modelů (LLM). Společnost, založená v dubnu 2023, se rychle stala jedním z klíčových hráčů na evropském a světovém trhu a prezentuje se jako alternativa k proprietárním modelům amerických technologických gigantů.

Klíčovým rysem přístupu Mistral AI je zaměření na tvorbu vysoce výkonných modelů s otevřenými váhami (převážně pod licencí Apache 2.0), což přispívá k demokratizaci přístupu k pokročilým technologiím AI. Společnost je známá svými architektonickými inovacemi, jako jsou **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** a **Sparse Mixture-of-Experts (MoE)**, které umožňují jejich modelům dosahovat vysoké efektivity při relativně malé velikosti a nízkých výpočetních nákladech.

## Historie

Společnost Mistral AI byla založena v Paříži v dubnu 2023 třemi francouzskými výzkumníky: **Arthurem Menschem** (Arthur Mensch), **Guillaumem Lampleem** (Guillaume Lample) a **Timothéem Lacroixem** (Timothée Lacroix). Všichni tři zakladatelé dříve pracovali na velkých jazykových modelech ve předních světových společnostech: Mensch byl výzkumníkem v Google DeepMind, zatímco Lample a Lacroix se věnovali LLM v Meta AI.

Posláním společnosti je zpřístupnit přední výsledky AI všem, prosazovat otevřenost, spolupráci a transparentnost. Tento přístup umožnil Mistral AI rychle získat značné investice:

- **Červen 2023:** €105 milionů v seed-kole, což byl rekord pro Evropu.
- **Prosinec 2023:** €385 milionů v kole Series A, po němž ocenění společnosti překročilo \$2 miliardy a získala status „jednorožce".
- **Únor 2024:** Oznámeno strategické partnerství s Microsoftem zahrnující investici ve výši \$16 milionů a nasazení modelů Mistral v cloudu Azure.
- **Červen 2024:** Nové kolo financování ve výši €600 milionů, v jehož důsledku ocenění společnosti dosáhlo přibližně €5,8 miliardy, čímž se zařadila mezi nejhodnotnější AI startupy na světě.

## Technické vlastnosti architektury

Modely Mistral AI jsou založeny na architektuře transformerů, ale zahrnují řadu klíčových inovací zaměřených na zvýšení efektivity a snížení výpočetních nákladů.

### Transformer s vylepšeními (Mistral 7B)

První model společnosti, **Mistral 7B**, představil dvě důležitá architektonická vylepšení:

- **Sliding Window Attention (SWA)** (Pozornost s klouzavým oknem): Namísto toho, aby každý token interagoval se všemi předchozími tokeny (což má kvadratickou složitost), SWA omezuje pozornost na pevné okno (například 4 096 tokenů). To umožňuje zpracovávat velmi dlouhé sekvence (až 32 000 tokenů a více) s lineární výpočetní složitostí, což výrazně urychluje zpracování.
- **Grouped-Query Attention (GQA)** (Seskupená pozornost dotazů): Optimalizace standardního mechanismu multi-head attention. GQA používá menší počet „hlav" pro klíče (keys) a hodnoty (values) než pro dotazy (queries) (například v poměru 8:1), což výrazně snižuje nároky na paměť a urychluje proces generování (inference) bez výrazné ztráty kvality.

### Sparse Mixture-of-Experts (MoE)

V modelech řady **Mixtral** (například *Mixtral 8x7B*, *Mixtral 8x22B*) je použita architektura **Sparse Mixture-of-Experts** (řídká směs expertů). Namísto jedné husté vrstvy neuronové sítě se používá několik paralelních „expertních" podsítí. Pro každý vstupní token speciální *gating* vrstva (směrovač) dynamicky vybírá malou podmnožinu expertů k aktivaci (obvykle 2 z 8).

To umožňuje vytvářet modely s obrovským celkovým počtem parametrů (Mixtral 8x22B má 141 miliard), ale při zpracování každého tokenu je využita jen malá jejich část (~39 miliard). Výsledkem je, že model dosahuje kvality srovnatelné s mnohem většími „hustými" modely, avšak s rychlostí a náklady inference jako u modelů výrazně menší velikosti.

### Architektura Mamba (SSM)

V roce 2024 Mistral AI představila experimentální model **Codestral Mamba** založený na architektuře **Mamba (Selective State-Space Model)**. Na rozdíl od transformerů využívá Mamba rekurentní mechanismus založený na modelech stavového prostoru. Klíčové výhody:

- **Lineární složitost** v závislosti na délce sekvence, což ji činí mimořádně rychlou na dlouhých kontextech.
- **Teoreticky „nekonečný" kontext**, omezený pouze dostupnou pamětí.
- **Vysoká rychlost inference** v porovnání s ekvivalentními transformery.

## Chronologie a modely

<table class="\&quot;wikitable">
<caption>Hlavní vydání modelů Mistral AI</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>Měsíc / Rok</th>
<th>Model</th>
<th>Parametry (mld)</th>
<th>Klíčové vlastnosti</th>
<th>Licence</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7,3</td>
<td>Architektura GQA + SWA; kontext 32k; překonává Llama 2 13B ve všech benchmarcích.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46,7 (12,9 aktivních)</td>
<td>První otevřený MoE model; kvalita na úrovni GPT-3.5.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>„Menší" a vlajkový model, dostupné přes API.</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 aktivních)</td>
<td>Kontext 64k; SOTA kvalita mezi open-source modely v době vydání.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>Specializovaný model pro generování kódu (80+ jazyků).</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>Specializované modely pro matematiku a vícejazyčnost.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7,3</td>
<td>Experimentální model pro kód na architektuře Mamba; kontext 256k+.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>První otevřený multimodální model (text + obrázky).</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (odhad)</td>
<td>Aktualizovaný vlajkový model s vylepšeným reasoning.</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>Optimalizován pro nízkou latenci (až 150 tokenů/s); kvalita na úrovni 70B modelů.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>Přední multimodální model (text, obrázky) s kontextem 128k.</td>
<td>Proprietární</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>„Agentní" model pro autonomní vývoj softwaru; 46,8 % na SWE-Bench.</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

Hlavní vydání modelů Mistral AI

## Srovnání s konkurencí

- **vs. Llama (Meta):** Modely Mistral stabilně překonávají modely Llama podobné nebo i větší velikosti. Mistral 7B překonal Llama 2 13B a Mixtral 8x7B překonal Llama 2 70B. Hlavní rozdíl spočívá v licenci: Mistral používá plně permisivní Apache 2.0, zatímco licence Llama obsahuje omezení.
- **vs. GPT (OpenAI):** Vlajkové modely OpenAI (GPT-4) zůstávají lídry v nejnáročnějších úlohách, avšak otevřené modely Mistral (například Mixtral 8x7B) vykazují kvalitu srovnatelnou s GPT-3.5. Mistral nabízí otevřenou alternativu umožňující nasadit modely lokálně a plně je kontrolovat.
- **vs. Claude (Anthropic):** Modely Claude jsou známé velkým kontextovým oknem a zaměřením na bezpečnost. Mistral nabídla otevřené modely se srovnatelným nebo větším kontextem. Z hlediska výkonu na standardních benchmarcích (LMSys Arena) model Medium 3 překonal Claude 3 Opus.

## Využití a ekosystém

### Produkty

- **Le Chat:** Veřejný chatovací asistent (web, iOS/Android) demonstrující možnosti modelů Mistral, včetně webového vyhledávání a generování obrázků.
- **La Plateforme:** Podniková platforma s přístupem přes API ke všem modelům Mistral, umožňující společnostem integrovat LLM do svých produktů.

### Podnikoví zákazníci

Technologie Mistral využívají velké společnosti jako **BNP Paribas** (finance), **CMA CGM** (logistika), **Zalando** (e-commerce) a státní agentura **France Travail**. Pro evropské zákazníky je důležitá možnost lokálního nasazení modelů za účelem souladu s GDPR.

### Komunita Open-Source

Díky otevřené licenci se modely Mistral staly základem pro tisíce projektů na platformách jako Hugging Face. Komunita aktivně dolaďuje modely pro řešení specializovaných úloh a vytváří verze pro biologii (BioMistral), právnictví (SaulLM-7B) a lokalizaci do různých jazyků (například Polish Bielik 7B).

## Licencování

| Řada modelů                                                  | Licence                         | Omezení                                           |
|--------------------------------------------------------------|---------------------------------|---------------------------------------------------|
| Základní, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                      | Volné komerční využití.                           |
| Codestral 22B                                                | Non-Production License          | Komerční využití zakázáno bez samostatné smlouvy. |
| Řada Large, řada Medium                                      | Mistral Research / Proprietární | Přístup pouze přes cloudové API.                  |

## Odkazy

- Oficiální dokumentace Mistral AI
- Profil Mistral AI na Hugging Face

## Literatura

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
