---
title: "Mixture-of-Experts (MoE) (IT)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4458
wiki_created_at: 2026-09-06T23:35:26Z
wiki_modified_at: 2026-09-06T23:35:26Z
downloaded_at: 2026-09-07T23:02:46Z
---

# Mixture-of-Experts (MoE) (IT)

**Mixture-of-Experts (MoE)** (dall'inglese — «Miscela di esperti») — è un'architettura di reti neurali basata sul principio del calcolo condizionale e sul paradigma *«Dividi et impera»*. Invece di utilizzare un unico modello monolitico («denso»), in cui tutti i parametri vengono coinvolti nell'elaborazione di ogni segnale in ingresso, l'architettura MoE scompone il compito delegandolo a un sottoinsieme di sottoreti specializzate, chiamate «esperti». Un componente apposito, la rete di instradamento (gating network o router), determina dinamicamente quali esperti elaboreranno ogni specifico token in ingresso<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-arxiv-bigdata-moe-2)</sup>.

Questo approccio consente di creare modelli con un numero enorme di parametri (centinaia di miliardi o addirittura trilioni), mantenendo al contempo i costi computazionali (FLOPs) nella fase di inferenza a livelli paragonabili a quelli di modelli densi significativamente più piccoli<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-llmstudio-moe-3)</sup>. Grazie a ciò, MoE è diventata una tecnologia chiave per la scalabilità dei moderni Large Language Model (LLM) ed è utilizzata in sistemi all'avanguardia come Mixtral 8x7B, Grok-1 e, secondo opinione ampiamente diffusa, GPT-4<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)</sup>.

## Principio fondamentale: calcolo condizionale e sparsità

Il meccanismo fondamentale di MoE è il **calcolo condizionale** (conditional computation). A differenza dei modelli densi, dove tutti i parametri sono attivi durante l'elaborazione di qualsiasi token, i modelli MoE attivano solo una piccola frazione dei propri parametri in base ai dati in ingresso. Questo processo dà luogo alla **sparsità delle attivazioni** (sparsity in activation), che rappresenta la principale differenza rispetto alle architetture tradizionali<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-friendli-serving-moe-4)</sup>.

Tale approccio consente di:

- **Scalare la capacità del modello:** Il numero totale di parametri (e, di conseguenza, le «conoscenze» del modello) può essere aumentato in modo significativo senza una crescita proporzionale del carico computazionale.
- **Aumentare l'efficienza:** Il modello esegue meno calcoli per ogni token, il che porta a un'inferenza più rapida e a una riduzione dei costi di addestramento a parità di budget computazionale<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-zilliz-moe-5)</sup>.

In questo modo, MoE sposta il collo di bottiglia dalla potenza di calcolo verso i **requisiti di memoria (VRAM)**, poiché tutti i parametri di tutti gli esperti devono essere caricati in memoria, anche se in ogni momento ne viene utilizzata solo una piccola parte<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-moe-vs-dense-llms-6)</sup>.

## Componenti dell'architettura MoE

### 1. Sottoreti esperte (Experts)

Gli esperti sono, in genere, reti neurali indipendenti. Nel contesto dell'architettura transformer, i livelli MoE sostituiscono di norma i blocchi completamente connessi densi (Feed-Forward Networks, FFN), e ciascun esperto è a sua volta una FFN<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)</sup>. Durante l'addestramento, ogni esperto può sviluppare una «competenza» in determinati ambiti — ad esempio, uno può specializzarsi nella sintassi, un altro in nozioni relative a uno specifico dominio di conoscenza, e un terzo in una determinata lingua o stile<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Rete di controllo (Gating Network / Router)

La rete di instradamento è un componente piccolo ma di importanza critica, che esegue la distribuzione intelligente dei compiti. Per ogni token in ingresso, il router calcola dei punteggi (pesi), determinando quali esperti siano più rilevanti per la sua elaborazione. La decisione di instradamento è dinamica e dipendente dal contesto<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-huggingface-moe-8)</sup>.

La strategia più comune è l'**instradamento Top-K**, in cui vengono selezionati **K** esperti con i punteggi più alti per elaborare il token. Il valore di K è generalmente piccolo (ad esempio, 1 o 2), ed è proprio questo a garantire la sparsità.

### 3. Aggregazione degli output

Dopo che i K esperti selezionati hanno elaborato il token, i loro output individuali vengono combinati per formare il risultato finale del livello MoE. In genere ciò avviene tramite una somma pesata, in cui i pesi sono i punteggi normalizzati generati dal router<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)</sup>.

## Evoluzione di MoE

Il concetto di MoE fu proposto per la prima volta nel 1991 nel lavoro di Robert Jacobs, Geoffrey Hinton e Michael Jordan, intitolato «Adaptive Mixtures of Local Experts»<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-llmstudio-moe-3)</sup>. Tuttavia, a causa delle limitazioni computazionali e della complessità dell'addestramento, l'idea non ottenne ampia diffusione fino all'era del deep learning.

La svolta avvenne con l'avvento dell'architettura Transformer. Le ricerche del periodo 2010-2015 sul calcolo condizionale (Yoshua Bengio e altri) posero le basi teoriche, mentre il lavoro di Shazeer et al. (2017) dimostrò la possibilità di scalare MoE fino a un modello LSTM da 137 miliardi di parametri<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-huggingface-moe-8)</sup>.

Il rinascimento moderno di MoE è legato al modello **Switch Transformer** di Google (2021), che ha scalato fino a 1,6 trilioni di parametri utilizzando un instradamento Top-1 semplice ma efficace<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-9)</sup>. Il successo del modello open source **Mixtral 8x7B** di Mistral AI nel 2023 ha definitivamente affermato MoE come una delle architetture di punta per la creazione di LLM ad alte prestazioni<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)</sup>.

## Problematiche e metodi di ottimizzazione

### Bilanciamento del carico

Uno dei problemi chiave di MoE è lo **squilibrio del carico**, in cui il router seleziona continuamente gli stessi esperti «popolari», mentre altri rimangono sottoutilizzati. Ciò porta a un addestramento inefficiente e al «collasso degli esperti».

- **Funzioni di perdita ausiliarie (Auxiliary Loss):** Metodo tradizionale che aggiunge alla funzione di perdita principale una «penalità» per la distribuzione non uniforme dei token. Sebbene aiuti nel bilanciamento, questo approccio può introdurre «gradienti di disturbo», peggiorando le prestazioni complessive<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-loss-free-balancing-10)</sup>.
- **Bilanciamento senza perdita (Loss-Free Balancing):** Un approccio più recente che applica dinamicamente uno spostamento (bias) ai punteggi del router, spingendolo verso decisioni più bilanciate senza interferire con il compito di addestramento principale<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Instradamento per scelta dell'esperto (Expert Choice Routing):** Un approccio alternativo in cui non sono i token a scegliere gli esperti, ma ciascun esperto seleziona i propri \`top-k\` token dal batch. Ciò garantisce un bilanciamento perfetto, ma può essere più complesso da implementare<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-nvidia-moe-1)</sup>.

### Fine-tuning e quantizzazione

- **Fine-tuning:** Storicamente i modelli MoE erano inclini all'overfitting a causa dell'elevato numero di parametri. Per attenuare questo problema si ricorre a tecniche come il «dropout degli esperti»<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-switch-transformers-paper-12)</sup>.
- **Quantizzazione (Quantization):** Riduzione della precisione numerica dei pesi per diminuire le dimensioni del modello e accelerare l'inferenza. Per MoE si tratta di un compito complesso a causa dello squilibrio tra esperti. Metodi come **MoEQuant** propongono soluzioni basate su una calibrazione bilanciata per ciascun esperto<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-13)</sup>.

### Ottimizzazione sistemica

Un deployment efficiente di MoE richiede un approccio sistemico olistico, che comprende:

- **Strategie di parallelismo:** **Parallelismo degli esperti** (distribuzione degli esperti su diverse GPU), parallelismo del modello e parallelismo dei dati<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-14)</sup>.
- **Kernel specializzati:** Ad esempio, **Megablocks** per Mixtral, che ottimizzano le moltiplicazioni matriciali per le operazioni sparse<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-15)</sup>.
- **Co-progettazione hardware (Hardware Co-design):** Sviluppo di soluzioni hardware specificamente ottimizzate per i carichi di lavoro MoE.

## Modelli MoE di riferimento

<table class="wikitable" style="width:100%;">
<caption>Confronto tra architetture MoE di rilievo</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Modello</th>
<th>Sviluppatore</th>
<th>Parametri totali</th>
<th>Parametri<br />
attivi</th>
<th>Numero di<br />
esperti</th>
<th>Esperti<br />
selezionati (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1,6 trilioni</td>
<td>Dipende dalla dimensione dell'esperto</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 mld</td>
<td>~13 mld</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 mld</td>
<td>86 mld</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (presunto)</td>
<td>OpenAI</td>
<td>&gt;1 trilione</td>
<td>-</td>
<td>16 (presunto)</td>
<td>2 (presunto)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57-90 mld</td>
<td>14 mld</td>
<td>64</td>
<td>4 o 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16,4 mld</td>
<td>~2,8 mld</td>
<td>64 (2 attivi)</td>
<td>2 (su 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Confronto tra architetture MoE di rilievo

## Applicazioni in diversi ambiti

Sebbene MoE sia maggiormente nota nel contesto degli LLM, la sua applicazione non si limita all'elaborazione del linguaggio naturale:

- Previsione di serie temporali: Il modello Time-MoE presenta un'architettura scalabile per il pre-addestramento di modelli di previsione<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-17)</sup>.
- Rilevamento di vulnerabilità: MoEVD utilizza MoE per scomporre il compito di rilevamento delle vulnerabilità in una classificazione per tipologie CWE, dove ciascun esperto è specializzato nella propria tipologia<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-18)</sup>.
- Integrazione con tecnologie blockchain: MoE trova applicazione nell'ottimizzazione degli smart contract e nel rilevamento delle frodi, dove gli esperti analizzano diversi pattern di transazione<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-19)</sup>.
- Modelli multimodali: MoE viene utilizzata per combinare esperti specializzati in diverse modalità (testo, immagine, audio), creando sistemi più versatili<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_note-arxiv-llama-moe-20)</sup>.

## Note

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(IT)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
