---
title: "Mixtral"
source: "https://systems-analysis.info/wiki/Mixtral"
wiki: "systems-analysis.info/wiki"
article: "Mixtral"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 145
wiki_created_at: 2026-09-06T21:55:42Z
wiki_modified_at: 2026-09-06T21:55:42Z
downloaded_at: 2026-09-07T22:17:48Z
---

# Mixtral

**Mixtral 8x7B** — это [большая языковая модель](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) с открытым исходным кодом, разработанная французской компанией [Mistral](https://systems-analysis.info/wiki/Mistral "Mistral") AI и выпущенная в декабре 2023 года. Модель основана на архитектуре **разреженной смеси экспертов (Sparse Mixture of Experts, SMoE)**, что позволяет ей сочетать производительность, сопоставимую с гораздо более крупными моделями (например, [Llama](https://systems-analysis.info/wiki/LLaMA "LLaMA") 2 70B и GPT-3.5), с высокой скоростью и эффективностью инференса<sup>[\[1\]](https://systems-analysis.info/wiki/Mixtral#cite_note-mistral_blog-1)</sup>.

Модель распространяется под свободной лицензией Apache 2.0, что делает её доступной для академического и коммерческого использования. Mixtral 8x7B демонстрирует сильные способности в многоязычных задачах, генерации кода и следовании инструкциям, что сделало её одной из самых популярных открытых моделей на момент выпуска<sup>[\[2\]](https://systems-analysis.info/wiki/Mixtral#cite_note-arxiv_paper-2)</sup>.

## История разработки

Компания Mistral AI была основана в апреле 2023 года бывшими исследователями из Meta и Google. В сентябре 2023 года компания выпустила свою первую модель, **Mistral 7B**, которая получила признание за высокую эффективность при небольшом размере.

**11 декабря 2023 года** Mistral AI анонсировала выпуск **Mixtral 8x7B**, своей первой модели на основе архитектуры смеси экспертов. Модель сразу привлекла внимание сообщества как самая мощная на тот момент открытая LLM, продемонстрировав качество на уровне GPT-3.5 при значительно более высокой скорости инференса. В январе 2024 года было опубликовано подробное техническое описание модели в виде научной статьи на arXiv, что позволило независимым исследователям ознакомиться с деталями архитектуры и результатами тестов<sup>[\[2\]](https://systems-analysis.info/wiki/Mixtral#cite_note-arxiv_paper-2)</sup>.

## Архитектура: Разреженная смесь экспертов (SMoE)

Главным новшеством Mixtral 8x7B является внедрение архитектуры **Sparse Mixture of Experts**. В отличие от стандартных («плотных») трансформеров, где каждый слой выполняет одно и то же вычисление для всех [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен"), в Mixtral каждый слой содержит несколько параллельных блоков-«экспертов».

Ключевые особенности архитектуры:

- **Структура MoE**: Каждый трансформерный слой содержит **8** feed-forward блоков («экспертов»). Для обработки каждого токена специальная *router-сеть* выбирает **2** наиболее подходящих эксперта (*Top-2 routing*).
- **Параметры**: Общее число параметров модели составляет **46,7 млрд**, однако благодаря разреженной активации для каждого токена в процессе вывода используется только **12,9 млрд** активных параметров. Это обеспечивает скорость инференса, сопоставимую с моделями на ~13 млрд параметров.
- **Оптимизация внимания**: Модель использует современные техники для эффективной обработки длинных последовательностей, включая **Sliding Window Attention (SWA)** и **Grouped Query Attention (GQA)**.
- **Длина контекста**: Модель поддерживает [контекстное окно](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно") длиной до **32 768 токенов**.

## Обучение

Семейство Mixtral 8x7B включает две основные версии: 1. **Mixtral-8x7B-v0.1** (базовая модель): Предобученная модель, натренированная на большом корпусе веб-данных на нескольких европейских языках (английский, французский, немецкий, испанский, итальянский). Основная задача — предсказание следующего токена. 2. **Mixtral-8x7B-Instruct-v0.1** (инструктивная модель): Версия, дообученная с помощью *supervised [fine-tuning](https://systems-analysis.info/wiki/Fine-tuning "Fine-tuning") (SFT)* и *[Direct Preference Optimization](https://systems-analysis.info/wiki/Direct_Preference_Optimization "Direct Preference Optimization") (DPO)*. Эта модель лучше следует инструкциям пользователя и предназначена для использования в диалоговом формате.

## Производительность

Mixtral 8x7B превосходит или сравним по качеству с моделью Llama 2 70B на большинстве стандартных бенчмарков, имея при этом в 5 раз меньше активных параметров и, как следствие, значительно более высокую скорость вывода (до 6 раз быстрее)<sup>[\[2\]](https://systems-analysis.info/wiki/Mixtral#cite_note-arxiv_paper-2)</sup>.

| Метрика                                        | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|------------------------------------------------|-------------|---------|--------------|
| **MMLU** (общие знания)                        | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (математика)                        | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (генерация кода)                      | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (оценка диалога, Instruct-версии) | 6,86        | 8,32    | **8,30**     |

Сравнение производительности Mixtral 8x7B с Llama 2 70B и GPT-3.5<sup>[\[2\]](https://systems-analysis.info/wiki/Mixtral#cite_note-arxiv_paper-2)</sup>

- **Многоязычность**: Благодаря увеличенной доле многоязычных данных в обучающем корпусе, Mixtral значительно превосходит Llama 2 70B в задачах на французском, немецком, испанском и итальянском языках.
- **Смещение и галлюцинации**: В сравнении с Llama 2 70B модель демонстрирует более высокую точность на бенчмарке [BBQ](https://systems-analysis.info/wiki/BBQ "BBQ") (оценка социальных предубеждений) и более позитивный профиль настроений на бенчмарке [BOLD](https://systems-analysis.info/wiki/BOLD "BOLD").

## Лицензирование и доступность

Обе версии Mixtral 8x7B (базовая и Instruct) выпущены под лицензией Apache 2.0, которая разрешает свободное академическое и коммерческое использование. Исходные коды и веса моделей доступны на GitHub и Hugging Face.

## См. также

- [Mixture-of-Experts (MoE)](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE) "Mixture-of-Experts (MoE)")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [BLOOM](https://systems-analysis.info/wiki/BLOOM "BLOOM")
- [Chinchilla](https://systems-analysis.info/wiki/Chinchilla "Chinchilla")

## Ссылки

- <a href="https://mistral.ai/news/mixtral-of-experts/" class="external text" rel="nofollow">Mixtral of Experts</a> — официальный анонс в блоге Mistral AI
- <a href="https://huggingface.co/mistralai/Mixtral-8x7B-v0.1" class="external text" rel="nofollow">Модель Mixtral 8x7B на Hugging Face</a>

## Литература

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external text" rel="nofollow">arXiv:2401.04088</a>.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. <a href="https://arxiv.org/abs/1701.06538" class="external text" rel="nofollow">arXiv:1701.06538</a>.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external text" rel="nofollow">arXiv:2004.05150</a>.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. <a href="https://arxiv.org/abs/2205.14135" class="external text" rel="nofollow">arXiv:2205.14135</a>.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. <a href="https://arxiv.org/abs/2407.06204" class="external text" rel="nofollow">arXiv:2407.06204</a>.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. <a href="https://arxiv.org/abs/2404.02852" class="external text" rel="nofollow">arXiv:2404.02852</a>.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. <a href="https://openreview.net/forum?id=stXtBqyTWX" class="external text" rel="nofollow">OpenReview: stXtBqyTWX</a>.

## Примечания

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/wiki/Mixtral#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Mixtral#cite_ref-arxiv_paper_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Mixtral#cite_ref-arxiv_paper_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/Mixtral#cite_ref-arxiv_paper_2-2)</sup> <sup>[2,3](https://systems-analysis.info/wiki/Mixtral#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
