---
title: "Mixtral (Mistral AI) (PL)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 4434
wiki_created_at: 2026-09-06T23:35:07Z
wiki_modified_at: 2026-09-06T23:35:07Z
downloaded_at: 2026-09-07T23:02:38Z
---

# Mixtral (Mistral AI) (PL)

**Mixtral 8x7B** — to duży model językowy (LLM) o otwartym kodzie źródłowym, opracowany przez francuską firmę Mistral AI i wydany w grudniu 2023 roku. Model oparty jest na architekturze **rzadkiej mieszaniny ekspertów (Sparse Mixture of Experts, SMoE)**, co pozwala mu łączyć wydajność porównywalną z znacznie większymi modelami (np. Llama 2 70B i GPT-3.5) z wysoką szybkością i efektywnością inferencji<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_note-mistral_blog-1)</sup>.

Model jest dystrybuowany na wolnej licencji Apache 2.0, co czyni go dostępnym do użytku akademickiego i komercyjnego. Mixtral 8x7B wykazuje silne zdolności w zadaniach wielojęzycznych, generowaniu kodu oraz wykonywaniu instrukcji, co uczyniło go jednym z najpopularniejszych otwartych modeli w momencie wydania<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_note-arxiv_paper-2)</sup>.

## Historia rozwoju

Firma Mistral AI została założona w kwietniu 2023 roku przez byłych badaczy z Meta i Google. We wrześniu 2023 roku firma wydała swój pierwszy model, **Mistral 7B**, który zyskał uznanie za wysoką efektywność przy niewielkich rozmiarach.

**11 grudnia 2023 roku** Mistral AI ogłosiła wydanie **Mixtral 8x7B**, swojego pierwszego modelu opartego na architekturze mieszaniny ekspertów. Model natychmiast przyciągnął uwagę społeczności jako najpotężniejszy ówczesny otwarty LLM, demonstrując jakość na poziomie GPT-3.5 przy znacznie wyższej szybkości inferencji. W styczniu 2024 roku opublikowano szczegółowy opis techniczny modelu w formie artykułu naukowego na arXiv, co pozwoliło niezależnym badaczom zapoznać się ze szczegółami architektury i wynikami testów<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_note-arxiv_paper-2)</sup>.

## Architektura: Rzadka mieszanina ekspertów (SMoE)

Główną innowacją Mixtral 8x7B jest wdrożenie architektury **Sparse Mixture of Experts**. W przeciwieństwie do standardowych („gęstych") transformerów, gdzie każda warstwa wykonuje te same obliczenia dla wszystkich tokenów, w Mixtral każda warstwa zawiera kilka równoległych bloków-„ekspertów".

Kluczowe cechy architektury:

- **Struktura MoE**: Każda warstwa transformera zawiera **8** bloków feed-forward („ekspertów"). Do przetwarzania każdego tokenu specjalna *sieć router* wybiera **2** najbardziej odpowiednich ekspertów (*Top-2 routing*).
- **Parametry**: Łączna liczba parametrów modelu wynosi **46,7 mld**, jednak dzięki rzadkiej aktywacji dla każdego tokenu w procesie wnioskowania wykorzystywanych jest jedynie **12,9 mld** aktywnych parametrów. Zapewnia to szybkość inferencji porównywalną z modelami o ~13 mld parametrów.
- **Optymalizacja uwagi**: Model wykorzystuje nowoczesne techniki efektywnego przetwarzania długich sekwencji, w tym **Sliding Window Attention (SWA)** i **Grouped Query Attention (GQA)**.
- **Długość kontekstu**: Model obsługuje okno kontekstowe o długości do **32 768 tokenów**.

## Uczenie

Rodzina Mixtral 8x7B obejmuje dwie główne wersje:

1.  **Mixtral-8x7B-v0.1** (model bazowy): Model wstępnie wytrenowany na dużym korpusie danych internetowych w kilku językach europejskich (angielski, francuski, niemiecki, hiszpański, włoski). Głównym zadaniem jest przewidywanie następnego tokenu.
2.  **Mixtral-8x7B-Instruct-v0.1** (model instrukcyjny): Wersja dostrojona przy użyciu *supervised fine-tuning (SFT)* oraz *Direct Preference Optimization (DPO)*. Ten model lepiej wykonuje instrukcje użytkownika i jest przeznaczony do użytku w formacie dialogowym.

## Wydajność

Mixtral 8x7B przewyższa lub jest porównywalny pod względem jakości z modelem Llama 2 70B na większości standardowych benchmarków, mając przy tym 5 razy mniej aktywnych parametrów i w konsekwencji znacznie wyższą szybkość wnioskowania (do 6 razy szybciej)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_note-arxiv_paper-2)</sup>.

| Metryka                                       | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|-----------------------------------------------|-------------|---------|--------------|
| **MMLU** (wiedza ogólna)                      | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (matematyka)                       | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (generowanie kodu)                   | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (ocena dialogu, wersje Instruct) | 6,86        | 8,32    | **8,30**     |

Porównanie wydajności Mixtral 8x7B z Llama 2 70B i GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_note-arxiv_paper-2)</sup>

- **Wielojęzyczność**: Dzięki zwiększonemu udziałowi danych wielojęzycznych w korpusie treningowym, Mixtral znacznie przewyższa Llama 2 70B w zadaniach w języku francuskim, niemieckim, hiszpańskim i włoskim.
- **Stronniczość i halucynacje**: W porównaniu z Llama 2 70B model wykazuje wyższą dokładność na benchmarku BBQ (ocena uprzedzeń społecznych) oraz bardziej pozytywny profil nastrojów na benchmarku BOLD.

## Licencjonowanie i dostępność

Obie wersje Mixtral 8x7B (bazowa i Instruct) zostały wydane na licencji Apache 2.0, która zezwala na swobodne użytkowanie akademiczne i komercyjne. Kody źródłowe i wagi modeli są dostępne na GitHub i Hugging Face.

## Linki

- Mixtral of Experts — oficjalny anons na blogu Mistral AI
- Model Mixtral 8x7B na Hugging Face

## Literatura

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Przypisy

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(PL)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
