---
title: "Mixture-of-Experts (MoE)"
source: "https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)"
wiki: "systems-analysis.info/wiki"
article: "Mixture-of-Experts_(MoE)"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 146
wiki_created_at: 2026-09-06T21:55:43Z
wiki_modified_at: 2026-09-06T21:55:43Z
downloaded_at: 2026-09-07T22:17:49Z
---

# Mixture-of-Experts (MoE)

**Mixture-of-Experts (MoE)** (с англ. — «Смесь экспертов») — это архитектура нейронных сетей, основанная на принципе условных вычислений и парадигме *«Разделяй и властвуй»*. Вместо использования единой монолитной («плотной») модели, в которой все параметры задействуются для обработки каждого входного сигнала, MoE-архитектура декомпозирует задачу, делегируя её подмножеству специализированных подсетей, называемых «экспертами». Специальный компонент, сеть-маршрутизатор (gating network или роутер), динамически определяет, какие эксперты будут обрабатывать каждый конкретный входной [токен](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-arxiv-bigdata-moe-2)</sup>.

Этот подход позволяет создавать модели с огромным числом параметров (сотни миллиардов или даже триллионы), сохраняя при этом вычислительные затраты (FLOPs) на этапе инференса на уровне значительно меньших плотных моделей<sup>[\[3\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-llmstudio-moe-3)</sup>. Благодаря этому MoE стала ключевой технологией для масштабирования современных [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) и используется в таких передовых системах, как [Mixtral 8x7B](https://systems-analysis.info/wiki/Mixtral "Mixtral"), [Grok-1](https://systems-analysis.info/wiki/Grok "Grok") и, по широко распространенному мнению, GPT-4<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)</sup>.

## Ключевой принцип: условные вычисления и разреженность

Фундаментальный механизм MoE — это **условные вычисления** (conditional computation). В отличие от плотных моделей, где все параметры активны при обработке любого токена, MoE-модели активируют лишь небольшую долю своих параметров в зависимости от входных данных. Этот процесс приводит к **разреженности активаций** (sparsity in activation), что является главным отличием от традиционных архитектур<sup>[\[4\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-friendli-serving-moe-4)</sup>.

Такой подход позволяет:

- **Масштабировать ёмкость модели:** Общее количество параметров (и, следовательно, «знаний» модели) может быть значительно увеличено без пропорционального роста вычислительной нагрузки.
- **Повысить эффективность:** Модель выполняет меньше вычислений на каждый токен, что приводит к более быстрому инференсу и снижению затрат на обучение при фиксированном вычислительном бюджете<sup>[\[5\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-zilliz-moe-5)</sup>.

Таким образом, MoE смещает узкое место с вычислительной мощности в сторону **требований к памяти (VRAM)**, поскольку все параметры всех экспертов должны быть загружены в память, даже если в каждый момент времени используется лишь их малая часть<sup>[\[6\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-moe-vs-dense-llms-6)</sup>.

## Компоненты архитектуры MoE

### 1. Экспертные подсети (Experts)

Эксперты — это, как правило, независимые нейронные сети. В контексте архитектуры трансформера слои MoE обычно заменяют собой плотные полносвязные блоки (Feed-Forward Networks, FFN), и каждый эксперт сам по себе является FFN<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)</sup>. В процессе обучения каждый эксперт может развивать «компетентность» в определённых областях — например, один может специализироваться на синтаксисе, другой на фактах из конкретной области знаний, а третий на определённом языке или стиле<sup>[\[7\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Управляющая сеть (Gating Network / Router)

Сеть-маршрутизатор — это небольшой, но критически важный компонент, который выполняет интеллектуальное распределение задач. Для каждого входного токена маршрутизатор вычисляет оценки (веса), определяя, какие эксперты наиболее релевантны для его обработки. Решение о маршрутизации является динамическим и контекстно-зависимым<sup>[\[8\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-huggingface-moe-8)</sup>.

Наиболее распространённой стратегией является **маршрутизация [Top-K](https://systems-analysis.info/wiki/Top-k "Top-k")**, при которой для обработки токена выбираются **K** экспертов с наивысшими оценками. Значение K обычно невелико (например, 1 или 2), что и обеспечивает разреженность.

### 3. Объединение выходных данных

После того как выбранные K экспертов обработали токен, их индивидуальные выходы объединяются для формирования окончательного результата MoE-слоя. Как правило, это делается путём взвешенного суммирования, где веса — это нормализованные оценки, сгенерированные маршрутизатором<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)</sup>.

## Эволюция MoE

Концепция MoE была впервые предложена в 1991 году в работе Роберта Якобса, Джеффри Хинтона и Майкла Джордана под названием «Адаптивная смесь локальных экспертов»<sup>[\[3\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-llmstudio-moe-3)</sup>. Однако из-за вычислительных ограничений и сложности обучения идея не получала широкого распространения до эпохи глубокого обучения.

Прорыв произошёл с появлением архитектуры Трансформера. Исследования в 2010-2015 годах, посвящённые условным вычислениям (Йошуа Бенжио и др.), заложили теоретическую основу, а работа Шазира и др. (2017) продемонстрировала возможность масштабирования MoE до 137-миллиардной LSTM-модели<sup>[\[8\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-huggingface-moe-8)</sup>.

Современное возрождение MoE связано с моделью **Switch Transformer** от Google (2021), которая масштабировалась до 1.6 трлн параметров, используя простую, но эффективную маршрутизацию Top-1<sup>[\[9\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-9)</sup>. Успех открытой модели **Mixtral 8x7B** от [Mistral](https://systems-analysis.info/wiki/Mistral "Mistral") AI в 2023 году окончательно утвердил MoE как одну из ведущих архитектур для создания высокопроизводительных LLM<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)</sup>.

## Проблемы и методы оптимизации

### Балансировка нагрузки

Одна из ключевых проблем MoE — **дисбаланс нагрузки**, когда маршрутизатор постоянно выбирает одних и тех же «популярных» экспертов, в то время как другие остаются недоиспользованными. Это приводит к неэффективному обучению и «коллапсу экспертов».

- **Вспомогательные функции потерь (Auxiliary Loss):** Традиционный метод, который добавляет в основную функцию потерь «штраф» за неравномерное распределение токенов. Хотя это помогает с балансировкой, такой подход может вносить «градиенты помех», ухудшая общую производительность<sup>[\[10\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-loss-free-balancing-10)</sup>.
- **Балансировка без потерь (Loss-Free Balancing):** Более новый подход, который динамически применяет смещение (bias) к оценкам маршрутизатора, подталкивая его к более сбалансированным решениям без вмешательства в основную задачу обучения<sup>[\[11\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Маршрутизация по выбору эксперта (Expert Choice Routing):** Альтернативный подход, где не токены выбирают экспертов, а каждый эксперт выбирает себе \`top-k\` токенов из пакета. Это гарантирует идеальную балансировку, но может быть сложнее в реализации<sup>[\[1\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-nvidia-moe-1)</sup>.

### Тонкая настройка и квантование

- **Тонкая настройка (Fine-tuning):** Исторически MoE-модели были склонны к переобучению из-за большого числа параметров. Для смягчения этой проблемы используются такие методы, как «экспертный dropout»<sup>[\[12\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-switch-transformers-paper-12)</sup>.
- **Квантование (Quantization):** Снижение числовой точности весов для уменьшения размера модели и ускорения инференса. Для MoE это сложная задача из-за межэкспертного дисбаланса. Методы, такие как **MoEQuant**, предлагают решения, основанные на сбалансированной калибровке для каждого эксперта<sup>[\[13\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-13)</sup>.

### Системная оптимизация

Эффективное развертывание MoE требует целостного системного подхода, включающего:

- **Стратегии параллелизма:** **Экспертный параллелизм** (распределение экспертов по разным GPU), модельный и параллелизм данных<sup>[\[14\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-14)</sup>.
- **Специализированные ядра (Kernels):** Например, **Megablocks** для Mixtral, которые оптимизируют матричные умножения для разреженных операций<sup>[\[15\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-15)</sup>.
- **Совместное проектирование аппаратного обеспечения (Hardware Co-design):** Разработка аппаратных решений, специально оптимизированных для рабочих нагрузок MoE.

## Знаковые модели MoE

<table class="wikitable" style="width:100%;">
<caption>Сравнение выдающихся архитектур MoE</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Модель</th>
<th>Разработчик</th>
<th>Общее кол-во<br />
параметров</th>
<th>Активные<br />
параметры</th>
<th>Кол-во<br />
экспертов</th>
<th>Выбираемые<br />
эксперты (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1.6 трлн</td>
<td>Зависит от размера эксперта</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 млрд</td>
<td>~13 млрд</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 млрд</td>
<td>86 млрд</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (предположительно)</td>
<td>OpenAI</td>
<td>&gt;1 трлн</td>
<td>-</td>
<td>16 (предп.)</td>
<td>2 (предп.)</td>
</tr>
<tr class="odd">
<td><a href="https://systems-analysis.info/wiki/Qwen" title="Qwen">Qwen</a> 2 MoE</td>
<td>Alibaba</td>
<td>57-90 млрд</td>
<td>14 млрд</td>
<td>64</td>
<td>4 или 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16.4 млрд</td>
<td>~2.8 млрд</td>
<td>64 (2 активных)</td>
<td>2 (из 6)<sup><a href="https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Сравнение выдающихся архитектур MoE

## Применение в различных областях

Хотя MoE наиболее известны в контексте LLM, их применение не ограничивается обработкой естественного языка:

- Прогнозирование временных рядов: Модель Time-MoE представляет масштабируемую архитектуру для [предобучения](https://systems-analysis.info/wiki/%D0%9F%D1%80%D0%B5%D0%B4%D0%BE%D0%B1%D1%83%D1%87%D0%B5%D0%BD%D0%B8%D0%B5 "Предобучение") моделей прогнозирования<sup>[\[17\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-17)</sup>.
- Обнаружение уязвимостей: MoEVD использует MoE для разложения задачи обнаружения уязвимостей на классификацию по типам CWE, где каждый эксперт специализируется на своем типе<sup>[\[18\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-18)</sup>.
- Интеграция с блокчейн-технологиями: MoE находит применение в оптимизации смарт-контрактов и обнаружении мошенничества, где эксперты анализируют различные шаблоны транзакций<sup>[\[19\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-19)</sup>.
- Мультимодальные модели: MoE используется для объединения экспертов, специализированных на разных модальностях (текст, изображение, аудио), создавая более универсальные системы<sup>[\[20\]](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_note-arxiv-llama-moe-20)</sup>.

## См. также

- [DeepSeek](https://systems-analysis.info/wiki/DeepSeek "DeepSeek")
- [Grok](https://systems-analysis.info/wiki/Grok "Grok")
- [Jamba](https://systems-analysis.info/wiki/Jamba "Jamba")
- [Mixtral](https://systems-analysis.info/wiki/Mixtral "Mixtral")
- [ERNIE (Baidu)](https://systems-analysis.info/wiki/ERNIE_(Baidu) "ERNIE (Baidu)")

## Примечания

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1,4](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1,5](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/wiki/Mixture-of-Experts_(MoE)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
