---
title: "Mixtral (Mistral AI) (BG)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4419
wiki_created_at: 2026-09-06T23:34:53Z
wiki_modified_at: 2026-09-06T23:34:53Z
downloaded_at: 2026-09-07T23:02:33Z
---

# Mixtral (Mistral AI) (BG)

**Mixtral 8x7B** — това е голям езиков модел (LLM) с отворен изходен код, разработен от френската компания Mistral AI и публикуван през декември 2023 година. Моделът се основава на архитектурата **разредена смес от експерти (Sparse Mixture of Experts, SMoE)**, която му позволява да съчетава производителност, сравнима с много по-големи модели (например Llama 2 70B и GPT-3.5), с висока скорост и ефективност на инференса<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_note-mistral_blog-1)</sup>.

Моделът се разпространява под свободния лиценз Apache 2.0, което го прави достъпен за академично и търговско използване. Mixtral 8x7B демонстрира силни способности в многоезични задачи, генериране на код и следване на инструкции, което го направи един от най-популярните отворени модели към момента на публикуването му<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_note-arxiv_paper-2)</sup>.

## История на разработката

Компанията Mistral AI е основана през април 2023 година от бивши изследователи от Meta и Google. През септември 2023 година компанията публикува своя първи модел, **Mistral 7B**, който получи признание за висока ефективност при малък размер.

**На 11 декември 2023 година** Mistral AI обяви публикуването на **Mixtral 8x7B** — своя първи модел, базиран на архитектурата смес от експерти. Моделът веднага привлече вниманието на общността като най-мощния по това време отворен LLM, демонстрирайки качество на ниво GPT-3.5 при значително по-висока скорост на инференса. През януари 2024 година беше публикувано подробно техническо описание на модела под формата на научна статия в arXiv, което позволи на независими изследователи да се запознаят с детайлите на архитектурата и резултатите от тестовете<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_note-arxiv_paper-2)</sup>.

## Архитектура: Разредена смес от експерти (SMoE)

Главното нововъведение на Mixtral 8x7B е внедряването на архитектурата **Sparse Mixture of Experts**. За разлика от стандартните („плътни") transformer-и, при които всеки слой извършва едно и също изчисление за всички token-и, в Mixtral всеки слой съдържа няколко паралелни блока-„експерти".

Ключови особености на архитектурата:

- **Структура MoE**: Всеки transformer слой съдържа **8** feed-forward блока („експерти"). За обработката на всеки token специална *router-мрежа* избира **2** най-подходящи експерта (*Top-2 routing*).
- **Параметри**: Общият брой параметри на модела е **46,7 млрд**, но благодарение на разредената активация за всеки token по време на извода се използват само **12,9 млрд** активни параметъра. Това осигурява скорост на инференса, сравнима с модели с ~13 млрд параметъра.
- **Оптимизация на вниманието**: Моделът използва съвременни техники за ефективна обработка на дълги последователности, включително **Sliding Window Attention (SWA)** и **Grouped Query Attention (GQA)**.
- **Дължина на контекста**: Моделът поддържа контекстен прозорец с дължина до **32 768 token-а**.

## Обучение

Семейството Mixtral 8x7B включва две основни версии:

1.  **Mixtral-8x7B-v0.1** (базов модел): Предварително обучен модел, натрениран върху голям корпус от уеб данни на няколко европейски езика (английски, френски, немски, испански, италиански). Основната задача е предсказване на следващия token.
2.  **Mixtral-8x7B-Instruct-v0.1** (инструктивен модел): Версия, дообучена с помощта на *supervised fine-tuning (SFT)* и *Direct Preference Optimization (DPO)*. Този модел по-добре следва инструкциите на потребителя и е предназначен за използване в диалогов формат.

## Производителност

Mixtral 8x7B превъзхожда или е сравним по качество с модела Llama 2 70B на повечето стандартни benchmark-и, като същевременно има 5 пъти по-малко активни параметри и, като следствие, значително по-висока скорост на извода (до 6 пъти по-бърза)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_note-arxiv_paper-2)</sup>.

| Метрика                                          | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|--------------------------------------------------|-------------|---------|--------------|
| **MMLU** (общи знания)                           | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (математика)                          | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (генериране на код)                     | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (оценка на диалог, Instruct-версии) | 6,86        | 8,32    | **8,30**     |

Сравнение на производителността на Mixtral 8x7B с Llama 2 70B и GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_note-arxiv_paper-2)</sup>

- **Многоезичност**: Благодарение на увеличения дял на многоезични данни в обучаващия корпус, Mixtral значително превъзхожда Llama 2 70B в задачи на френски, немски, испански и италиански език.
- **Отклонения и халюцинации**: В сравнение с Llama 2 70B моделът демонстрира по-висока точност на benchmark-а BBQ (оценка на социални предубеждения) и по-позитивен профил на настроенията на benchmark-а BOLD.

## Лицензиране и достъпност

Двете версии на Mixtral 8x7B (базова и Instruct) са публикувани под лиценза Apache 2.0, който разрешава свободно академично и търговско използване. Изходните кодове и теглата на моделите са достъпни в GitHub и Hugging Face.

## Връзки

- Mixtral of Experts — официално обявление в блога на Mistral AI
- Модел Mixtral 8x7B в Hugging Face

## Литература

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Бележки

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(BG)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
