---
title: "Mixture-of-Experts (MoE) (ES)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 4451
wiki_created_at: 2026-09-06T23:35:21Z
wiki_modified_at: 2026-09-06T23:35:21Z
downloaded_at: 2026-09-07T23:02:43Z
---

# Mixture-of-Experts (MoE) (ES)

**Mixture-of-Experts (MoE)** (del inglés, «Mezcla de Expertos») es una arquitectura de redes neuronales basada en el principio de cómputo condicional y el paradigma *«divide y vencerás»*. En lugar de utilizar un único modelo monolítico («denso»), en el que todos los parámetros se emplean para procesar cada señal de entrada, la arquitectura MoE descompone la tarea delegándola a un subconjunto de subredes especializadas, denominadas «expertos». Un componente especial, la red de enrutamiento (gating network o router), determina dinámicamente qué expertos procesarán cada token de entrada específico<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-arxiv-bigdata-moe-2)</sup>.

Este enfoque permite crear modelos con un número masivo de parámetros (cientos de miles de millones o incluso billones), manteniendo al mismo tiempo los costos computacionales (FLOPs) durante la inferencia a un nivel comparable al de modelos densos mucho más pequeños<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-llmstudio-moe-3)</sup>. Gracias a esto, MoE se ha convertido en una tecnología clave para escalar los grandes modelos de lenguaje (LLM) modernos y se utiliza en sistemas de vanguardia como Mixtral 8x7B, Grok-1 y, según la creencia generalizada, GPT-4<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)</sup>.

## Principio clave: cómputo condicional y esparsidad

El mecanismo fundamental de MoE es el **cómputo condicional** (conditional computation). A diferencia de los modelos densos, donde todos los parámetros están activos al procesar cualquier token, los modelos MoE activan solo una pequeña fracción de sus parámetros en función de los datos de entrada. Este proceso conduce a la **esparsidad en la activación** (sparsity in activation), que es la principal diferencia con las arquitecturas tradicionales<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-friendli-serving-moe-4)</sup>.

Este enfoque permite:

- **Escalar la capacidad del modelo:** El número total de parámetros (y, por lo tanto, el «conocimiento» del modelo) puede aumentarse significativamente sin un crecimiento proporcional en la carga computacional.
- **Aumentar la eficiencia:** El modelo realiza menos cálculos por cada token, lo que resulta en una inferencia más rápida y menores costos de entrenamiento con un presupuesto computacional fijo<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-zilliz-moe-5)</sup>.

Así, MoE traslada el cuello de botella del poder de cómputo a los **requisitos de memoria (VRAM)**, ya que todos los parámetros de todos los expertos deben cargarse en la memoria, aunque solo se utilice una pequeña parte de ellos en un momento dado<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-moe-vs-dense-llms-6)</sup>.

## Componentes de la arquitectura MoE

### 1. Subredes expertas (Experts)

Los expertos son, por lo general, redes neuronales independientes. En el contexto de la arquitectura Transformer, las capas MoE suelen reemplazar los bloques densos de redes de avance (Feed-Forward Networks, FFN), y cada experto es en sí mismo una FFN<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)</sup>. Durante el entrenamiento, cada experto puede desarrollar «competencia» en áreas específicas; por ejemplo, uno puede especializarse en sintaxis, otro en hechos de un dominio de conocimiento particular, y un tercero en un idioma o estilo determinado<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Red de compuerta (Gating Network / Router)

La red de enrutamiento (o de compuerta) es un componente pequeño pero crítico que realiza una distribución inteligente de las tareas. Para cada token de entrada, el router calcula puntuaciones (pesos) que determinan qué expertos son los más relevantes para procesarlo. La decisión de enrutamiento es dinámica y depende del contexto<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-huggingface-moe-8)</sup>.

La estrategia más común es el **enrutamiento Top-K**, en el que se seleccionan los **K** expertos con las puntuaciones más altas para procesar un token. El valor de K suele ser pequeño (por ejemplo, 1 o 2), lo que garantiza la esparsidad.

### 3. Combinación de las salidas

Una vez que los K expertos seleccionados han procesado el token, sus salidas individuales se combinan para formar el resultado final de la capa MoE. Generalmente, esto se hace mediante una suma ponderada, donde los pesos son las puntuaciones normalizadas generadas por el router<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)</sup>.

## Evolución de MoE

El concepto de MoE fue propuesto por primera vez en 1991 en un trabajo de Robert Jacobs, Geoffrey Hinton y Michael Jordan titulado «Adaptive Mixture of Local Experts»<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-llmstudio-moe-3)</sup>. Sin embargo, debido a las limitaciones computacionales y la complejidad del entrenamiento, la idea no se popularizó hasta la era del aprendizaje profundo.

El gran avance se produjo con la llegada de la arquitectura Transformer. Investigaciones entre 2010 y 2015 dedicadas al cómputo condicional (Yoshua Bengio et al.) sentaron las bases teóricas, y el trabajo de Shazeer et al. (2017) demostró la viabilidad de escalar MoE a un modelo LSTM de 137 mil millones de parámetros<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-huggingface-moe-8)</sup>.

El resurgimiento moderno de MoE está vinculado al modelo **Switch Transformer** de Google (2021), que escaló hasta 1.6 billones de parámetros utilizando un enrutamiento Top-1 simple pero eficaz<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-9)</sup>. El éxito del modelo de código abierto **Mixtral 8x7B** de Mistral AI en 2023 consolidó definitivamente a MoE como una de las arquitecturas líderes para la creación de LLMs de alto rendimiento<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)</sup>.

## Desafíos y métodos de optimización

### Equilibrio de carga

Uno de los desafíos clave de MoE es el **desequilibrio de carga**, que ocurre cuando el router selecciona consistentemente a los mismos expertos «populares», mientras que otros permanecen subutilizados. Esto conduce a un entrenamiento ineficiente y al «colapso de expertos».

- **Funciones de pérdida auxiliares (Auxiliary Loss):** Es el método tradicional, que añade una «penalización» a la función de pérdida principal por la distribución desigual de tokens. Aunque ayuda con el equilibrio, este enfoque puede introducir «gradientes de ruido», perjudicando el rendimiento general<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-loss-free-balancing-10)</sup>.
- **Equilibrio sin pérdida (Loss-Free Balancing):** Un enfoque más reciente que aplica dinámicamente un sesgo (bias) a las puntuaciones del router, incentivando decisiones más equilibradas sin interferir con la tarea principal de entrenamiento<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Enrutamiento por elección del experto (Expert Choice Routing):** Un enfoque alternativo donde no son los tokens los que eligen a los expertos, sino que cada experto selecciona los \`top-k\` tokens de un lote. Esto garantiza un equilibrio perfecto, pero puede ser más complejo de implementar<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-nvidia-moe-1)</sup>.

### Ajuste fino y cuantización

- **Ajuste fino (Fine-tuning):** Históricamente, los modelos MoE han sido propensos al sobreajuste debido a su gran número de parámetros. Para mitigar este problema, se utilizan técnicas como el «dropout de expertos»<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-switch-transformers-paper-12)</sup>.
- **Cuantización (Quantization):** Reducción de la precisión numérica de los pesos para disminuir el tamaño del modelo y acelerar la inferencia. Para MoE, esta es una tarea compleja debido al desequilibrio entre expertos. Métodos como **MoEQuant** proponen soluciones basadas en una calibración equilibrada para cada experto<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-13)</sup>.

### Optimización del sistema

El despliegue eficiente de MoE requiere un enfoque de sistema holístico, que incluye:

- **Estrategias de paralelismo:** **Paralelismo de expertos** (distribución de expertos en diferentes GPUs), paralelismo de modelo y de datos<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-14)</sup>.
- **Kernels especializados:** Por ejemplo, **Megablocks** para Mixtral, que optimizan las multiplicaciones de matrices para operaciones dispersas<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-15)</sup>.
- **Codiseño de hardware (Hardware Co-design):** El desarrollo de soluciones de hardware específicamente optimizadas para las cargas de trabajo de MoE.

## Modelos MoE destacados

<table class="wikitable" style="width:100%;">
<caption>Comparación de arquitecturas MoE destacadas</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Modelo</th>
<th>Desarrollador</th>
<th>Parámetros<br />
totales</th>
<th>Parámetros<br />
activos</th>
<th>N.º de<br />
expertos</th>
<th>Expertos<br />
seleccionados (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1.6 billones</td>
<td>Depende del tamaño del experto</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 mil millones</td>
<td>~13 mil millones</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 mil millones</td>
<td>86 mil millones</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (supuestamente)</td>
<td>OpenAI</td>
<td>&gt;1 billón</td>
<td>-</td>
<td>16 (est.)</td>
<td>2 (est.)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57-90 mil millones</td>
<td>14 mil millones</td>
<td>64</td>
<td>4 o 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16.4 mil millones</td>
<td>~2.8 mil millones</td>
<td>64 (2 activos)</td>
<td>2 (de 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Comparación de arquitecturas MoE destacadas

## Aplicaciones en diversas áreas

Aunque los MoE son más conocidos en el contexto de los LLM, su aplicación no se limita al procesamiento del lenguaje natural:

- Pronóstico de series temporales: El modelo Time-MoE presenta una arquitectura escalable para el preentrenamiento de modelos de pronóstico<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-17)</sup>.
- Detección de vulnerabilidades: MoEVD utiliza MoE para descomponer la tarea de detección de vulnerabilidades en una clasificación por tipos de CWE, donde cada experto se especializa en su propio tipo<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-18)</sup>.
- Integración con tecnologías blockchain: MoE encuentra aplicación en la optimización de contratos inteligentes y la detección de fraudes, donde los expertos analizan diferentes patrones de transacciones<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-19)</sup>.
- Modelos multimodales: MoE se utiliza para combinar expertos especializados en diferentes modalidades (texto, imagen, audio), creando sistemas más versátiles<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_note-arxiv-llama-moe-20)</sup>.

## Referencias

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
