---
title: "Mistral AI (HU)"
source: "https://systems-analysis.info/int/Mistral_AI_(HU)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4402
wiki_created_at: 2026-09-06T23:34:40Z
wiki_modified_at: 2026-09-06T23:34:40Z
downloaded_at: 2026-09-07T23:02:28Z
---

# Mistral AI (HU)

**Mistral AI** — francia mesterséges intelligencia vállalat, amely nagy nyelvi modellek (LLM) fejlesztésére specializálódott. A 2023 áprilisában alapított vállalat gyorsan az európai és globális piac egyik kulcsszereplőjévé vált, az amerikai technológiai óriások tulajdonosi modelljei alternatívájaként pozicionálva magát.

A Mistral AI megközelítésének legfőbb jellemzője a nyílt súlyú, nagy teljesítményű modellek fejlesztésére való összpontosítás (elsősorban Apache 2.0 licenc alatt), ami hozzájárul a csúcstechnológiás mesterséges intelligencia demokratizálásához. A vállalat architektúrális innovációiról ismert, mint például a **Grouped-Query Attention (GQA)**, a **Sliding Window Attention (SWA)** és a **Sparse Mixture-of-Experts (MoE)**, amelyek lehetővé teszik modelljeik számára, hogy viszonylag kis méretük és alacsony számítási költségeik mellett is magas hatékonyságot érjenek el.

## Történet

A Mistral AI vállalatot 2023 áprilisában alapította Párizsban három francia kutató: **Arthur Mensch**, **Guillaume Lample** és **Timothée Lacroix**. Mindhárom alapító korábban nagy nyelvi modelleken dolgozott vezető globális vállalatoknál: Mensch a Google DeepMindnál volt kutató, míg Lample és Lacroix a Meta AI-nál foglalkoztak LLM-ekkel.

A vállalat küldetése az, hogy a mesterséges intelligencia legkorszerűbb eredményeit mindenki számára elérhetővé tegye, az nyitottságot, az együttműködést és az átláthatóságot szorgalmazva. Ez a megközelítés lehetővé tette a Mistral AI számára, hogy gyorsan jelentős befektetéseket vonzzon:

- **2023. június:** 105 millió euró seed-körben, ami európai rekordot jelentett.
- **2023. december:** 385 millió euró az A sorozatú körben, amelyet követően a vállalat értékelése meghaladta a 2 milliárd dollárt, és elnyerte az „egyszarvú" státuszt.
- **2024. február:** Bejelentették a Microsofttal kötött stratégiai partnerséget, amely 16 millió dolláros befektetést és a Mistral modellek Azure felhőben való elhelyezését foglalta magában.
- **2024. június:** Új, 600 millió eurós finanszírozási kör, amelynek eredményeként a vállalat értékelése elérte a ~5,8 milliárd eurót, ezzel a világ egyik legértékesebb mesterséges intelligencia startupjává téve.

## Az architektúra technikai jellemzői

A Mistral AI modelljei transformer architektúrán alapulnak, de számos kulcsfontosságú innovációt tartalmaznak a hatékonyság növelése és a számítási költségek csökkentése érdekében.

### Továbbfejlesztett transformer (Mistral 7B)

A vállalat első modellje, a **Mistral 7B**, két fontos architektúrális fejlesztést mutatott be:

- **Sliding Window Attention (SWA)** (Csúszóablakos figyelem): Ahelyett, hogy minden token az összes korábbi tokennel kölcsönhatásba lépne (ami négyzetes bonyolultságot jelent), az SWA rögzített ablakra korlátozza a figyelmet (például 4096 token). Ez lehetővé teszi nagyon hosszú szekvenciák feldolgozását (akár 32 000 tokentől is több) lineáris számítási bonyolultsággal, jelentősen felgyorsítva a feldolgozást.
- **Grouped-Query Attention (GQA)** (Csoportosított lekérdezéses figyelem): A szabványos multi-head attention mechanizmus optimalizálása. A GQA kevesebb „fejet" használ a kulcsokhoz (keys) és értékekhez (values), mint a lekérdezésekhez (queries) (például 8:1 arányban), ami lényegesen csökkenti a memóriaigényt és felgyorsítja a generálási folyamatot (inferencia) jelentős minőségromlás nélkül.

### Sparse Mixture-of-Experts (MoE)

A **Mixtral** sorozat modelljeiben (például *Mixtral 8x7B*, *Mixtral 8x22B*) a **Sparse Mixture-of-Experts** (ritka szakértőkeverék) architektúrát alkalmazzák. Egyetlen sűrű neurális hálózati réteg helyett több párhuzamos „szakértő" részháló kerül felhasználásra. Minden bemeneti tokenhez egy speciális *gating*-réteg (útválasztó) dinamikusan választja ki az aktiválandó szakértők kis részhalmazát (általában 2-t a 8-ból).

Ez lehetővé teszi hatalmas összes paraméterszámú modellek létrehozását (a Mixtral 8x22B-nek 141 milliárd paramétere van), de az egyes tokenek feldolgozásakor ezeknek csak egy kis töredékét (~39 milliárd) használják. Ennek eredményeként a modell sokkal nagyobb „sűrű" modellekhez hasonló minőséget ér el, de az inferencia sebessége és költsége a jóval kisebb méretű modellekéhez hasonló.

### Mamba architektúra (SSM)

2024-ben a Mistral AI bemutatta a **Codestral Mamba** kísérleti modellt, amely a **Mamba (Selective State-Space Model)** architektúrán alapul. A transformerektől eltérően a Mamba állapottér-modelleken alapuló rekurrens mechanizmust alkalmaz. Legfőbb előnyei:

- **Lineáris bonyolultság** a szekvencia hossza szerint, ami rendkívül gyorssá teszi hosszú kontextusokon.
- **Elméletileg „végtelen" kontextus**, amelyet csak a rendelkezésre álló memória korlátoz.
- **Magas inferenciasebesség** az egyenértékű transformerekhez képest.

## Időrend és modellek

<table class="\&quot;wikitable">
<caption>A Mistral AI főbb modellkiadásai</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>Hónap / Év</th>
<th>Modell</th>
<th>Paraméterek (milliárd)</th>
<th>Legfőbb jellemzők</th>
<th>Licenc</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7,3</td>
<td>GQA + SWA architektúra; 32k kontextus; minden benchmarkon felülmúlja a Llama 2 13B-t.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46,7 (12,9 aktív)</td>
<td>Az első nyílt MoE-modell; GPT-3.5 szintű minőség.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>„Kisebb" és zászlóshajó modellek, API-n keresztül elérhetők.</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (39 aktív)</td>
<td>64k kontextus; SOTA-minőség az open-source modellek körében a megjelenés idején.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>Kódgenerálásra specializált modell (80+ nyelv).</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>Matematikára és többnyelvűségre specializált modellek.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7,3</td>
<td>Kísérleti kódmodell Mamba architektúrán; 256k+ kontextus.</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>Az első nyílt multimodális modell (szöveg + képek).</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (becslés)</td>
<td>Fejlett reasoning képességekkel rendelkező frissített zászlóshajó modell.</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>Alacsony késleltetésre optimalizált (akár 150 token/s); 70B modellek szintű minőség.</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>Határterületi multimodális modell (szöveg, képek) 128k kontextussal.</td>
<td>Tulajdonosi</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>„Ügynöki" modell autonóm szoftverfejlesztéshez; 46,8% a SWE-Bench-en.</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

A Mistral AI főbb modellkiadásai

## Összehasonlítás a versenytársakkal

- **vs. Llama (Meta):** A Mistral modelljei következetesen felülmúlják a hasonló vagy akár nagyobb méretű Llama modelleket. A Mistral 7B felülmúlta a Llama 2 13B-t, a Mixtral 8x7B pedig a Llama 2 70B-t. A fő különbség a licencben rejlik: a Mistral teljesen megengedő Apache 2.0 licencet használ, míg a Llama licencének korlátozásai vannak.
- **vs. GPT (OpenAI):** Az OpenAI zászlóshajó modelljei (GPT-4) a legösszetettebb feladatokban továbbra is élenjárnak, azonban a Mistral nyílt modelljei (például a Mixtral 8x7B) a GPT-3.5-tel összehasonlítható minőséget mutatnak. A Mistral nyílt alternatívát kínál, lehetővé téve a modellek helyi telepítését és teljes körű vezérlését.
- **vs. Claude (Anthropic):** A Claude modellek nagy kontextusablakukról és biztonságközpontú megközelítésükről ismertek. A Mistral hasonló vagy nagyobb kontextusú nyílt modelleket kínált. A szabványos benchmarkokon (LMSys Arena) nyújtott teljesítmény alapján a Medium 3 modell felülmúlta a Claude 3 Opust.

## Alkalmazás és ökoszisztéma

### Termékek

- **Le Chat:** Nyilvános csevegőasszisztens (web, iOS/Android), amely bemutatja a Mistral modellek képességeit, beleértve a webkeresést és képgenerálást.
- **La Plateforme:** Vállalati platform, amely API-n keresztül hozzáférést biztosít az összes Mistral modellhez, lehetővé téve a vállalatok számára az LLM-ek integrálását saját termékeikbe.

### Vállalati ügyfelek

A Mistral technológiáit nagyvállalatok használják, mint például a **BNP Paribas** (pénzügy), a **CMA CGM** (logisztika), a **Zalando** (e-kereskedelem) és a **France Travail** kormányzati ügynökség. Az európai ügyfelek számára különösen fontos a modellek helyi telepítésének lehetősége a GDPR-megfelelőség érdekében.

### Open-Source közösség

A nyílt licencnek köszönhetően a Mistral modelljei ezrek projektjeinek alapjává váltak a Hugging Face-hez hasonló platformokon. A közösség aktívan finomhangolja a modelleket speciális feladatokra, változatokat hozva létre a biológia (BioMistral), a jogtudomány (SaulLM-7B) és különböző nyelvekre való lokalizáció területén (például a lengyel Polish Bielik 7B).

## Licencelés

| Modellsorozat                                                    | Licenc                         | Korlátozások                                                 |
|------------------------------------------------------------------|--------------------------------|--------------------------------------------------------------|
| Alapmodellek, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                     | Szabad kereskedelmi felhasználás.                            |
| Codestral 22B                                                    | Non-Production License         | A kereskedelmi felhasználás külön megállapodás nélkül tilos. |
| Large-sorozat, Medium-sorozat                                    | Mistral Research / Tulajdonosi | Csak felhőalapú API-n keresztül érhető el.                   |

## Hivatkozások

- A Mistral AI hivatalos dokumentációja
- A Mistral AI profilja a Hugging Face-en

## Irodalom

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
