---
title: "Mixtral (Mistral AI) (HU)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4429
wiki_created_at: 2026-09-06T23:35:02Z
wiki_modified_at: 2026-09-06T23:35:02Z
downloaded_at: 2026-09-07T23:02:36Z
---

# Mixtral (Mistral AI) (HU)

**Mixtral 8x7B** — egy nyílt forráskódú nagy nyelvi modell (LLM), amelyet a francia Mistral AI vállalat fejlesztett ki, és 2023 decemberében adott ki. A modell **ritka szakértő-keverék (Sparse Mixture of Experts, SMoE)** architektúrán alapul, amely lehetővé teszi, hogy teljesítménye összemérhető legyen jóval nagyobb modellekével (pl. Llama 2 70B és GPT-3.5), miközben nagy sebességet és hatékony inferenciát biztosít<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_note-mistral_blog-1)</sup>.

A modell az Apache 2.0 szabad licenc alatt terjesztik, ami elérhetővé teszi akadémiai és kereskedelmi felhasználás céljára is. A Mixtral 8x7B erős képességeket mutat többnyelvű feladatokban, kódgenerálásban és utasításkövetésben, ami a megjelenésekor az egyik legnépszerűbb nyílt modellé tette<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_note-arxiv_paper-2)</sup>.

## Fejlesztéstörténet

A Mistral AI vállalatot 2023 áprilisában alapították a Meta és a Google korábbi kutatói. 2023 szeptemberében a vállalat kiadta első modelljét, a **Mistral 7B**-t, amelyet kis mérete ellenére magas hatékonysága miatt ismertek el.

**2023. december 11-én** a Mistral AI bejelentette a **Mixtral 8x7B** kiadását, amely a vállalat első, szakértő-keverék architektúrán alapuló modellje. A modell azonnal felkeltette a közösség figyelmét, mint addig a legerősebb nyílt LLM, amely GPT-3.5 szintű minőséget mutatott, miközben jelentősen gyorsabb volt az inferencia során. 2024 januárjában részletes technikai leírás jelent meg a modellről az arXiv-on tudományos cikk formájában, amely lehetővé tette a független kutatóknak az architektúra részleteinek és a teszteredmények megismerését<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_note-arxiv_paper-2)</sup>.

## Architektúra: Ritka szakértő-keverék (SMoE)

A Mixtral 8x7B legfontosabb újítása a **Sparse Mixture of Experts** architektúra bevezetése. A szokásos („sűrű") transformerekkel ellentétben, ahol minden réteg ugyanazt a számítást végzi el az összes tokenre, a Mixtral minden rétege több párhuzamos „szakértő"-blokkot tartalmaz.

Az architektúra főbb jellemzői:

- **MoE-struktúra**: Minden transformer-réteg **8** feed-forward blokkot („szakértőt") tartalmaz. Az egyes tokenek feldolgozásához egy speciális *router-hálózat* választja ki a **2** legalkalmasabb szakértőt (*Top-2 routing*).
- **Paraméterek**: A modell paramétereinek teljes száma **46,7 milliárd**, azonban a ritka aktiváció révén az inferencia során tokenenként csupán **12,9 milliárd** aktív paramétert használ. Ez ~13 milliárd paraméterű modellekével összehasonlítható inferencia-sebességet biztosít.
- **Figyelem-optimalizálás**: A modell modern technikákat alkalmaz a hosszú szekvenciák hatékony feldolgozásához, beleértve a **Sliding Window Attention (SWA)** és a **Grouped Query Attention (GQA)** eljárásokat.
- **Kontexthossz**: A modell legfeljebb **32 768 tokenes** kontextablakot támogat.

## Tanítás

A Mixtral 8x7B modellácsalád két fő változatot tartalmaz: 1. **Mixtral-8x7B-v0.1** (alap modell): Előre betanított modell, amelyet több európai nyelvű (angol, francia, német, spanyol, olasz) webes adatkorpuszon tanítottak. Fő feladata a következő token előrejelzése. 2. **Mixtral-8x7B-Instruct-v0.1** (utasításkövető modell): *supervised fine-tuning (SFT)* és *Direct Preference Optimization (DPO)* segítségével finomhangolt változat. Ez a modell jobban követi a felhasználói utasításokat, és párbeszédes formátumú használatra készült.

## Teljesítmény

A Mixtral 8x7B a legtöbb szabványos benchmarkon felülmúlja vagy egyenrangú a Llama 2 70B modellel, miközben ötször kevesebb aktív paramétert használ, és ennek következtében jelentősen gyorsabb következtetési sebességet kínál (akár hatszor gyorsabb)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_note-arxiv_paper-2)</sup>.

| Mérőszám                                                | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---------------------------------------------------------|-------------|---------|--------------|
| **MMLU** (általános tudás)                              | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (matematika)                                 | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (kódgenerálás)                                 | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (párbeszéd értékelés, Instruct-változatok) | 6,86        | 8,32    | **8,30**     |

A Mixtral 8x7B teljesítményének összehasonlítása a Llama 2 70B és GPT-3.5 modellekkel<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_note-arxiv_paper-2)</sup>

- **Többnyelvűség**: A tanítókorpuszban szereplő többnyelvű adatok megnövelt arányának köszönhetően a Mixtral jelentősen felülmúlja a Llama 2 70B-t francia, német, spanyol és olasz nyelvű feladatokban.
- **Torzítás és hallucinációk**: A Llama 2 70B-vel összehasonlítva a modell magasabb pontosságot mutat a BBQ benchmarkon (társadalmi előítéletek értékelése), és pozitívabb hangulati profilt a BOLD benchmarkon.

## Licencelés és elérhetőség

A Mixtral 8x7B mindkét változata (alap és Instruct) az Apache 2.0 licenc alatt jelent meg, amely szabad akadémiai és kereskedelmi felhasználást engedélyez. A modellek forráskódjai és súlyai elérhetők a GitHubon és a Hugging Face-en.

## Hivatkozások

- Mixtral of Experts — a Mistral AI blogjának hivatalos bejelentése
- A Mixtral 8x7B modell a Hugging Face-en

## Irodalom

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Megjegyzések

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(HU)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
