---
title: "Mixture-of-Experts (MoE) (BG)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4446
wiki_created_at: 2026-09-06T23:35:16Z
wiki_modified_at: 2026-09-06T23:35:16Z
downloaded_at: 2026-09-07T23:02:41Z
---

# Mixture-of-Experts (MoE) (BG)

**Mixture-of-Experts (MoE)** (от англ. — „Смес от експерти") — това е архитектура на невронни мрежи, основана на принципа на условните изчисления и парадигмата *„Разделяй и владей"*. Вместо да се използва единен монолитен („плътен") модел, при който всички параметри се задействат за обработка на всеки входен сигнал, MoE-архитектурата декомпозира задачата, делегирайки я на подмножество от специализирани подмрежи, наречени „експерти". Специален компонент, мрежата-маршрутизатор (gating network или рутер), динамично определя кои експерти ще обработват всеки конкретен входен token<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-arxiv-bigdata-moe-2)</sup>.

Този подход позволява да се създават модели с огромен брой параметри (стотици милиарди или дори трилиони), като същевременно вычислителните разходи (FLOPs) на етапа на inference се запазват на нивото на значително по-малки плътни модели<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-llmstudio-moe-3)</sup>. Благодарение на това MoE се превърна в ключова технология за мащабиране на съвременните големи езикови модели (LLM) и се използва в такива напреднали системи като Mixtral 8x7B, Grok-1 и, според широко разпространеното мнение, GPT-4<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)</sup>.

## Ключов принцип: условни изчисления и разреденост

Фундаменталният механизъм на MoE е **условните изчисления** (conditional computation). За разлика от плътните модели, при които всички параметри са активни при обработката на всеки token, MoE-моделите активират само малка част от своите параметри в зависимост от входните данни. Този процес води до **разреденост на активациите** (sparsity in activation), което е главното отличие от традиционните архитектури<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-friendli-serving-moe-4)</sup>.

Такъв подход позволява:

- **Мащабиране на капацитета на модела:** Общият брой параметри (и следователно „знанията" на модела) може да бъде значително увеличен без пропорционален ръст на изчислителното натоварване.
- **Повишаване на ефективността:** Моделът извършва по-малко изчисления за всеки token, което води до по-бърз inference и намаляване на разходите за обучение при фиксиран изчислителен бюджет<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-zilliz-moe-5)</sup>.

По този начин MoE измества тесното място от изчислителната мощност към **изискванията за памет (VRAM)**, тъй като всички параметри на всички експерти трябва да бъдат заредени в паметта, дори ако в даден момент се използва само малка тяхна част<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-moe-vs-dense-llms-6)</sup>.

## Компоненти на архитектурата MoE

### 1. Експертни подмрежи (Experts)

Експертите са, като правило, независими невронни мрежи. В контекста на архитектурата transformer слоевете MoE обикновено заместват плътните напълно свързани блокове (Feed-Forward Networks, FFN), като всеки експерт сам по себе си е FFN<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)</sup>. В процеса на обучение всеки експерт може да развива „компетентност" в определени области — например, един може да се специализира в синтаксис, друг в факти от конкретна предметна област, а трети в определен език или стил<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Управляваща мрежа (Gating Network / Router)

Мрежата-маршрутизатор е малък, но критично важен компонент, който извършва интелигентното разпределение на задачите. За всеки входен token маршрутизаторът изчислява оценки (тегла), определяйки кои експерти са най-релевантни за неговата обработка. Решението за маршрутизация е динамично и контекстно-зависимо<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-huggingface-moe-8)</sup>.

Най-разпространената стратегия е **маршрутизацията Top-K**, при която за обработка на token се избират **K** експерти с най-високи оценки. Стойността на K обикновено е малка (например 1 или 2), което и осигурява разредеността.

### 3. Обединяване на изходните данни

След като избраните K експерти са обработили token, техните индивидуални изходи се обединяват за формиране на окончателния резултат на MoE-слоя. Като правило това се прави чрез претеглено сумиране, при което теглата са нормализираните оценки, генерирани от маршрутизатора<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)</sup>.

## Еволюция на MoE

Концепцията за MoE е предложена за първи път през 1991 година в труда на Робърт Джейкъбс, Джефри Хинтън и Майкъл Джордан, озаглавен „Адаптивна смес от локални експерти"<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-llmstudio-moe-3)</sup>. Въпреки това, поради изчислителните ограничения и сложността на обучението, идеята не получи широко разпространение до епохата на дълбокото обучение.

Пробивът настъпи с появата на архитектурата Transformer. Изследванията от 2010–2015 г., посветени на условните изчисления (Йошуа Бенжио и др.), поставиха теоретичната основа, а работата на Шазир и др. (2017) демонстрира възможността за мащабиране на MoE до LSTM-модел с 137 милиарда параметра<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-huggingface-moe-8)</sup>.

Съвременното възраждане на MoE е свързано с модела **Switch Transformer** от Google (2021), който се мащабира до 1,6 трлн параметра, използвайки проста, но ефективна маршрутизация Top-1<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-9)</sup>. Успехът на отворения модел **Mixtral 8x7B** от Mistral AI през 2023 година окончателно утвърди MoE като една от водещите архитектури за създаване на високопроизводителни LLM<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)</sup>.

## Проблеми и методи за оптимизация

### Балансиране на натоварването

Един от ключовите проблеми на MoE е **дисбалансът на натоварването**, при който маршрутизаторът постоянно избира едни и същи „популярни" експерти, докато другите остават недостатъчно използвани. Това води до неефективно обучение и „колапс на експертите".

- **Спомагателни функции за загуба (Auxiliary Loss):** Традиционен метод, който добавя „наказание" към основната функция за загуба за неравномерното разпределение на token-ите. Въпреки че това помага с балансирането, подходът може да внася „градиенти на смущения", влошавайки общата производителност<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-loss-free-balancing-10)</sup>.
- **Балансиране без загуба (Loss-Free Balancing):** По-нов подход, който динамично прилага отместване (bias) към оценките на маршрутизатора, насочвайки го към по-балансирани решения без намеса в основната задача на обучението<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Маршрутизация по избор на експерт (Expert Choice Routing):** Алтернативен подход, при който не token-ите избират експертите, а всеки експерт избира своите \`top-k\` token-а от пакета. Това гарантира идеално балансиране, но може да бъде по-сложно за реализация<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-nvidia-moe-1)</sup>.

### Тонко настройване и квантизация

- **Тонко настройване (Fine-tuning):** Исторически MoE-моделите са склонни към преобучаване поради големия брой параметри. За смекчаване на този проблем се използват методи като „експертен dropout"<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-switch-transformers-paper-12)</sup>.
- **Квантизация (Quantization):** Намаляване на числовата точност на теглата за намаляване размера на модела и ускоряване на inference. За MoE това е сложна задача поради междуекспертния дисбаланс. Методи като **MoEQuant** предлагат решения, основани на балансирана калибровка за всеки експерт<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-13)</sup>.

### Системна оптимизация

Ефективното разгръщане на MoE изисква цялостен системен подход, включващ:

- **Стратегии за паралелизъм:** **Експертен паралелизъм** (разпределение на експертите по различни GPU), модельен паралелизъм и паралелизъм на данните<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-14)</sup>.
- **Специализирани ядра (Kernels):** Например **Megablocks** за Mixtral, които оптимизират матричните умножения за разредени операции<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-15)</sup>.
- **Съвместно проектиране на хардуера (Hardware Co-design):** Разработване на хардуерни решения, специално оптимизирани за работните натоварвания на MoE.

## Забележителни модели MoE

<table class="\&quot;wikitable\&quot;" style="width:100%;">
<caption>Сравнение на изтъкнати архитектури MoE</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Модел</th>
<th>Разработчик</th>
<th>Общ брой<br />
параметри</th>
<th>Активни<br />
параметри</th>
<th>Брой<br />
експерти</th>
<th>Избирани<br />
експерти (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1,6 трлн</td>
<td>Зависи от размера на експерта</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 млрд</td>
<td>~13 млрд</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 млрд</td>
<td>86 млрд</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (предположително)</td>
<td>OpenAI</td>
<td>&gt;1 трлн</td>
<td>-</td>
<td>16 (предп.)</td>
<td>2 (предп.)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57–90 млрд</td>
<td>14 млрд</td>
<td>64</td>
<td>4 или 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16,4 млрд</td>
<td>~2,8 млрд</td>
<td>64 (2 активни)</td>
<td>2 (от 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Сравнение на изтъкнати архитектури MoE

## Приложение в различни области

Въпреки че MoE е най-известна в контекста на LLM, нейното приложение не се ограничава само до обработката на естествен език:

- Прогнозиране на времеви редове: Моделът Time-MoE представя мащабируема архитектура за предварително обучение на прогнозни модели<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-17)</sup>.
- Откриване на уязвимости: MoEVD използва MoE за разлагане на задачата за откриване на уязвимости на класификация по типове CWE, при което всеки експерт се специализира в своя тип<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-18)</sup>.
- Интеграция с blockchain-технологии: MoE намира приложение в оптимизацията на смарт контракти и откриването на измами, при което експертите анализират различни шаблони на транзакции<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-19)</sup>.
- Мултимодални модели: MoE се използва за обединяване на експерти, специализирани в различни модалности (текст, изображение, аудио), създавайки по-универсални системи<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_note-arxiv-llama-moe-20)</sup>.

## Бележки

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(BG)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
