---
title: "Mixture-of-Experts (MoE) (EL)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(EL)"
language: "el"
categories:
  - "Category:Greek"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4450
wiki_created_at: 2026-09-06T23:35:20Z
wiki_modified_at: 2026-09-06T23:35:20Z
downloaded_at: 2026-09-07T23:02:43Z
---

# Mixture-of-Experts (MoE) (EL)

**Mixture-of-Experts (MoE)** (από τα αγγλικά — «Μείγμα Εμπειρογνωμόνων») — είναι μια αρχιτεκτονική νευρωνικών δικτύων, βασισμένη στην αρχή των υπό συνθήκη υπολογισμών και στο παράδειγμα *«Διαίρει και Βασίλευε»*. Αντί για τη χρήση ενός ενιαίου μονολιθικού («πυκνού») μοντέλου, στο οποίο όλες οι παράμετροι εμπλέκονται στην επεξεργασία κάθε εισερχόμενου σήματος, η αρχιτεκτονική MoE αποσυνθέτει την εργασία, αναθέτοντάς την σε ένα υποσύνολο εξειδικευμένων υποδικτύων, που ονομάζονται «εμπειρογνώμονες». Ένα ειδικό στοιχείο, το δίκτυο-δρομολογητής (gating network ή router), καθορίζει δυναμικά ποιοι εμπειρογνώμονες θα επεξεργαστούν κάθε συγκεκριμένο εισερχόμενο token<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-arxiv-bigdata-moe-2)</sup>.

Αυτή η προσέγγιση επιτρέπει τη δημιουργία μοντέλων με τεράστιο αριθμό παραμέτρων (εκατοντάδες δισεκατομμύρια ή ακόμα και τρισεκατομμύρια), διατηρώντας παράλληλα το υπολογιστικό κόστος (FLOPs) κατά το στάδιο της εξαγωγής συμπερασμάτων (inference) στο επίπεδο σημαντικά μικρότερων πυκνών μοντέλων<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-llmstudio-moe-3)</sup>. Χάρη σε αυτό, το MoE έχει καταστεί βασική τεχνολογία για την κλιμάκωση σύγχρονων μεγάλων γλωσσικών μοντέλων (LLM) και χρησιμοποιείται σε προηγμένα συστήματα όπως το Mixtral 8x7B, το Grok-1 και, κατά γενική εκτίμηση, το GPT-4<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)</sup>.

## Βασική Αρχή: Υπό Συνθήκη Υπολογισμοί και Αραιότητα

Ο θεμελιώδης μηχανισμός του MoE είναι οι **υπό συνθήκη υπολογισμοί** (conditional computation). Σε αντίθεση με τα πυκνά μοντέλα, όπου όλες οι παράμετροι είναι ενεργές κατά την επεξεργασία οποιουδήποτε token, τα μοντέλα MoE ενεργοποιούν μόνο ένα μικρό κλάσμα των παραμέτρων τους ανάλογα με τα εισερχόμενα δεδομένα. Αυτή η διαδικασία οδηγεί σε **αραιότητα ενεργοποιήσεων** (sparsity in activation), που αποτελεί το κύριο διαχωριστικό στοιχείο από τις παραδοσιακές αρχιτεκτονικές<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-friendli-serving-moe-4)</sup>.

Αυτή η προσέγγιση επιτρέπει:

- **Κλιμάκωση της χωρητικότητας του μοντέλου:** Ο συνολικός αριθμός παραμέτρων (και, κατά συνέπεια, η «γνώση» του μοντέλου) μπορεί να αυξηθεί σημαντικά χωρίς ανάλογη αύξηση του υπολογιστικού φόρτου.
- **Βελτίωση αποδοτικότητας:** Το μοντέλο εκτελεί λιγότερους υπολογισμούς ανά token, γεγονός που οδηγεί σε ταχύτερο inference και μειωμένο κόστος εκπαίδευσης για δεδομένο υπολογιστικό προϋπολογισμό<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-zilliz-moe-5)</sup>.

Έτσι, το MoE μεταθέτει το σημείο συμφόρησης από την υπολογιστική ισχύ προς τις **απαιτήσεις μνήμης (VRAM)**, καθώς όλες οι παράμετροι όλων των εμπειρογνωμόνων πρέπει να φορτωθούν στη μνήμη, ακόμα και αν ανά πάσα στιγμή χρησιμοποιείται μόνο ένα μικρό τμήμα τους<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-moe-vs-dense-llms-6)</sup>.

## Στοιχεία της Αρχιτεκτονικής MoE

### 1. Υποδίκτυα Εμπειρογνωμόνων (Experts)

Οι εμπειρογνώμονες είναι, κατά κανόνα, ανεξάρτητα νευρωνικά δίκτυα. Στο πλαίσιο της αρχιτεκτονικής transformer, τα επίπεδα MoE συνήθως αντικαθιστούν τα πυκνά πλήρως συνδεδεμένα μπλοκ (Feed-Forward Networks, FFN), και κάθε εμπειρογνώμονας είναι από μόνος του ένα FFN<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)</sup>. Κατά τη διαδικασία εκπαίδευσης, κάθε εμπειρογνώμονας μπορεί να αναπτύξει «ικανότητα» σε συγκεκριμένους τομείς — για παράδειγμα, ένας μπορεί να εξειδικευτεί στη σύνταξη, άλλος σε γεγονότα από ένα συγκεκριμένο γνωστικό πεδίο, και τρίτος σε μια συγκεκριμένη γλώσσα ή ύφος<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Δίκτυο Ελέγχου (Gating Network / Router)

Το δίκτυο-δρομολογητής είναι ένα μικρό, αλλά κρίσιμης σημασίας στοιχείο, που πραγματοποιεί την έξυπνη κατανομή εργασιών. Για κάθε εισερχόμενο token, ο δρομολογητής υπολογίζει βαθμολογίες (βάρη), καθορίζοντας ποιοι εμπειρογνώμονες είναι πιο σχετικοί για την επεξεργασία του. Η απόφαση δρομολόγησης είναι δυναμική και εξαρτάται από το πλαίσιο<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-huggingface-moe-8)</sup>.

Η πιο διαδεδομένη στρατηγική είναι η **δρομολόγηση Top-K**, κατά την οποία για την επεξεργασία ενός token επιλέγονται οι **K** εμπειρογνώμονες με τις υψηλότερες βαθμολογίες. Η τιμή του K είναι συνήθως μικρή (π.χ. 1 ή 2), γεγονός που εξασφαλίζει την αραιότητα.

### 3. Συνδυασμός Εξερχόμενων Δεδομένων

Αφού οι επιλεγμένοι K εμπειρογνώμονες επεξεργαστούν το token, τα επιμέρους αποτελέσματά τους συνδυάζονται για τη διαμόρφωση του τελικού αποτελέσματος του επιπέδου MoE. Κατά κανόνα, αυτό γίνεται με σταθμισμένη άθροιση, όπου τα βάρη είναι οι κανονικοποιημένες βαθμολογίες που παράγει ο δρομολογητής<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)</sup>.

## Εξέλιξη του MoE

Η έννοια του MoE προτάθηκε για πρώτη φορά το 1991 σε εργασία των Robert Jacobs, Geoffrey Hinton και Michael Jordan με τίτλο «Adaptive Mixtures of Local Experts»<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-llmstudio-moe-3)</sup>. Ωστόσο, λόγω υπολογιστικών περιορισμών και δυσκολιών εκπαίδευσης, η ιδέα δεν γνώρισε ευρεία διάδοση μέχρι την εποχή της βαθιάς μάθησης.

Η돌τομή ήρθε με την εμφάνιση της αρχιτεκτονικής Transformer. Έρευνες την περίοδο 2010-2015, αφιερωμένες στους υπό συνθήκη υπολογισμούς (Yoshua Bengio και άλλοι), έθεσαν τα θεωρητικά θεμέλια, ενώ η εργασία των Shazeer et al. (2017) απέδειξε τη δυνατότητα κλιμάκωσης του MoE σε ένα μοντέλο LSTM 137 δισεκατομμυρίων παραμέτρων<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-huggingface-moe-8)</sup>.

Η σύγχρονη αναγέννηση του MoE συνδέεται με το μοντέλο **Switch Transformer** της Google (2021), το οποίο κλιμακώθηκε έως 1,6 τρισεκατομμύρια παραμέτρους, χρησιμοποιώντας απλή αλλά αποτελεσματική δρομολόγηση Top-1<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-9)</sup>. Η επιτυχία του ανοιχτού μοντέλου **Mixtral 8x7B** της Mistral AI το 2023 καθιέρωσε οριστικά το MoE ως μία από τις κορυφαίες αρχιτεκτονικές για τη δημιουργία υψηλής απόδοσης LLM<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)</sup>.

## Προκλήσεις και Μέθοδοι Βελτιστοποίησης

### Εξισορρόπηση Φόρτου

Μία από τις βασικές προκλήσεις του MoE είναι η **ανισορροπία φόρτου**, όταν ο δρομολογητής επιλέγει συνεχώς τους ίδιους «δημοφιλείς» εμπειρογνώμονες, ενώ άλλοι παραμένουν υποαξιοποιημένοι. Αυτό οδηγεί σε αναποτελεσματική εκπαίδευση και «κατάρρευση εμπειρογνωμόνων».

- **Βοηθητικές Συναρτήσεις Απωλειών (Auxiliary Loss):** Παραδοσιακή μέθοδος που προσθέτει στην κύρια συνάρτηση απωλειών μια «ποινή» για την άνιση κατανομή των tokens. Αν και βοηθά στην εξισορρόπηση, αυτή η προσέγγιση μπορεί να εισάγει «παρεμβαλλόμενες κλίσεις», υποβαθμίζοντας τη συνολική απόδοση<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-loss-free-balancing-10)</sup>.
- **Εξισορρόπηση χωρίς Απώλεια (Loss-Free Balancing):** Μια νεότερη προσέγγιση που εφαρμόζει δυναμικά μια μετατόπιση (bias) στις βαθμολογίες του δρομολογητή, ωθώντας τον σε πιο ισορροπημένες αποφάσεις χωρίς παρεμβολή στην κύρια εργασία εκπαίδευσης<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Δρομολόγηση με Επιλογή από τον Εμπειρογνώμονα (Expert Choice Routing):** Εναλλακτική προσέγγιση, όπου δεν είναι τα tokens που επιλέγουν εμπειρογνώμονες, αλλά κάθε εμπειρογνώμονας επιλέγει τα \`top-k\` tokens από την παρτίδα. Αυτό εγγυάται τέλεια εξισορρόπηση, αλλά μπορεί να είναι πιο σύνθετο στην υλοποίηση<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-nvidia-moe-1)</sup>.

### Fine-tuning και Quantization

- **Fine-tuning (Λεπτή Ρύθμιση):** Ιστορικά, τα μοντέλα MoE ήταν επιρρεπή σε υπερπροσαρμογή λόγω του μεγάλου αριθμού παραμέτρων. Για την αντιμετώπιση αυτού του προβλήματος χρησιμοποιούνται τεχνικές όπως το «expert dropout»<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-switch-transformers-paper-12)</sup>.
- **Quantization (Κβαντισμός):** Μείωση της αριθμητικής ακρίβειας των βαρών για τη μείωση του μεγέθους του μοντέλου και την επιτάχυνση του inference. Για το MoE πρόκειται για σύνθετη εργασία λόγω της ανισορροπίας μεταξύ εμπειρογνωμόνων. Μέθοδοι όπως το **MoEQuant** προτείνουν λύσεις βασισμένες σε ισορροπημένη βαθμονόμηση ανά εμπειρογνώμονα<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-13)</sup>.

### Συστημική Βελτιστοποίηση

Η αποτελεσματική ανάπτυξη MoE απαιτεί μια ολιστική συστημική προσέγγιση που περιλαμβάνει:

- **Στρατηγικές παραλληλισμού:** **Παραλληλισμός εμπειρογνωμόνων** (κατανομή εμπειρογνωμόνων σε διαφορετικές GPU), παραλληλισμός μοντέλου και παραλληλισμός δεδομένων<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-14)</sup>.
- **Εξειδικευμένοι πυρήνες (Kernels):** Για παράδειγμα, το **Megablocks** για το Mixtral, που βελτιστοποιεί τους πολλαπλασιασμούς πινάκων για αραιές λειτουργίες<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-15)</sup>.
- **Συνεργατικός Σχεδιασμός Υλικού (Hardware Co-design):** Ανάπτυξη λύσεων υλικού ειδικά βελτιστοποιημένων για τα φορτία εργασίας MoE.

## Αξιόλογα Μοντέλα MoE

<table class="wikitable" style="width:100%;">
<caption>Σύγκριση εξεχουσών αρχιτεκτονικών MoE</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Μοντέλο</th>
<th>Προγραμματιστής</th>
<th>Συνολικός αριθμός<br />
παραμέτρων</th>
<th>Ενεργές<br />
παράμετροι</th>
<th>Αριθμός<br />
εμπειρογνωμόνων</th>
<th>Επιλεγόμενοι<br />
εμπειρογνώμονες (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1,6 τρισ.</td>
<td>Εξαρτάται από το μέγεθος εμπειρογνώμονα</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 δισ.</td>
<td>~13 δισ.</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 δισ.</td>
<td>86 δισ.</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (υποθετικά)</td>
<td>OpenAI</td>
<td>&gt;1 τρισ.</td>
<td>-</td>
<td>16 (υποθ.)</td>
<td>2 (υποθ.)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57-90 δισ.</td>
<td>14 δισ.</td>
<td>64</td>
<td>4 ή 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16,4 δισ.</td>
<td>~2,8 δισ.</td>
<td>64 (2 ενεργοί)</td>
<td>2 (από 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Σύγκριση εξεχουσών αρχιτεκτονικών MoE

## Εφαρμογές σε Διάφορους Τομείς

Αν και τα MoE είναι πιο γνωστά στο πλαίσιο των LLM, η εφαρμογή τους δεν περιορίζεται στην επεξεργασία φυσικής γλώσσας:

- Πρόβλεψη χρονοσειρών: Το μοντέλο Time-MoE παρουσιάζει μια κλιμακώσιμη αρχιτεκτονική για την προεκπαίδευση μοντέλων πρόβλεψης<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-17)</sup>.
- Ανίχνευση ευπαθειών: Το MoEVD χρησιμοποιεί MoE για την αποσύνθεση της εργασίας ανίχνευσης ευπαθειών σε ταξινόμηση βάσει τύπων CWE, όπου κάθε εμπειρογνώμονας εξειδικεύεται στον τύπο του<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-18)</sup>.
- Ενσωμάτωση με τεχνολογίες blockchain: Το MoE βρίσκει εφαρμογή στη βελτιστοποίηση έξυπνων συμβολαίων και στην ανίχνευση απάτης, όπου οι εμπειρογνώμονες αναλύουν διαφορετικά πρότυπα συναλλαγών<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-19)</sup>.
- Πολυτροπικά μοντέλα: Το MoE χρησιμοποιείται για τον συνδυασμό εμπειρογνωμόνων εξειδικευμένων σε διαφορετικές τροπικότητες (κείμενο, εικόνα, ήχος), δημιουργώντας πιο ευέλικτα συστήματα<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_note-arxiv-llama-moe-20)</sup>.

## Παραπομπές

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(EL)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
