---
title: "Mixture-of-Experts (MoE) (FA)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 4452
wiki_created_at: 2026-09-06T23:35:21Z
wiki_modified_at: 2026-09-06T23:35:21Z
downloaded_at: 2026-09-07T23:02:44Z
---

# Mixture-of-Experts (MoE) (FA)

**Mixture-of-Experts (MoE)** (به انگلیسی — «ترکیب متخصصان») — معماری‌ای از شبکه‌های عصبی است که بر اساس اصل محاسبات شرطی و پارادایم *«تقسیم کن و حکومت کن»* بنا شده است. به جای استفاده از یک مدل یکپارچه («متراکم») که در آن تمام پارامترها برای پردازش هر سیگنال ورودی به کار می‌روند، معماری MoE وظیفه را تجزیه کرده و آن را به زیرشبکه‌های تخصصی‌ای به نام «متخصصان» واگذار می‌کند. یک مؤلفه ویژه، شبکه‌ی مسیریاب (gating network یا روتر)، به صورت پویا تعیین می‌کند که کدام متخصصان هر token ورودی خاص را پردازش خواهند کرد<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-arxiv-bigdata-moe-2)</sup>.

این رویکرد امکان ایجاد مدل‌هایی با تعداد پارامتر بسیار زیاد (صدها میلیارد یا حتی تریلیون‌ها) را فراهم می‌کند، در حالی که هزینه‌های محاسباتی (FLOPs) در مرحله‌ی inference را در سطح مدل‌های متراکم بسیار کوچک‌تر نگه می‌دارد<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-llmstudio-moe-3)</sup>. به همین دلیل، MoE به فناوری کلیدی برای مقیاس‌بندی مدل‌های زبانی بزرگ (LLM) مدرن تبدیل شده و در سیستم‌های پیشرفته‌ای مانند Mixtral 8x7B، Grok-1 و — بر اساس باور گسترده — GPT-4 به کار می‌رود<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)</sup>.

## اصل کلیدی: محاسبات شرطی و پراکندگی

مکانیزم بنیادین MoE، **محاسبات شرطی** (conditional computation) است. برخلاف مدل‌های متراکم که در آن‌ها همه پارامترها هنگام پردازش هر token فعال هستند، مدل‌های MoE تنها بخش کوچکی از پارامترهای خود را بسته به داده‌های ورودی فعال می‌کنند. این فرآیند به **پراکندگی در فعال‌سازی‌ها** (sparsity in activation) منجر می‌شود که مهم‌ترین تمایز از معماری‌های سنتی است<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-friendli-serving-moe-4)</sup>.

این رویکرد امکان می‌دهد:

- **مقیاس‌بندی ظرفیت مدل:** تعداد کل پارامترها (و در نتیجه «دانش» مدل) می‌تواند بدون افزایش متناسب بار محاسباتی به میزان قابل توجهی افزایش یابد.
- **افزایش کارایی:** مدل محاسبات کمتری برای هر token انجام می‌دهد که منجر به inference سریع‌تر و کاهش هزینه‌های آموزش در بودجه محاسباتی ثابت می‌شود<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-zilliz-moe-5)</sup>.

بنابراین، MoE گلوگاه را از توان محاسباتی به سمت **نیازهای حافظه (VRAM)** جابجا می‌کند، زیرا تمام پارامترهای تمام متخصصان باید در حافظه بارگذاری شوند، حتی اگر در هر لحظه تنها بخش کوچکی از آن‌ها استفاده شود<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-moe-vs-dense-llms-6)</sup>.

## اجزای معماری MoE

### ۱. زیرشبکه‌های متخصص (Experts)

متخصصان معمولاً شبکه‌های عصبی مستقل هستند. در بافت معماری transformer، لایه‌های MoE معمولاً جایگزین بلوک‌های متراکم کاملاً متصل (Feed-Forward Networks, FFN) می‌شوند و هر متخصص خود یک FFN است<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)</sup>. در طول آموزش، هر متخصص می‌تواند «تخصص» در حوزه‌های خاصی را توسعه دهد — برای مثال، یکی ممکن است در نحو تخصص داشته باشد، دیگری در حقایق یک حوزه دانشی خاص، و سومی در یک زبان یا سبک معین<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-ve3-understanding-moe-7)</sup>.

### ۲. شبکه کنترل‌کننده (Gating Network / Router)

شبکه‌ی مسیریاب مؤلفه‌ای کوچک اما حیاتی است که توزیع هوشمند وظایف را انجام می‌دهد. برای هر token ورودی، مسیریاب امتیازاتی (وزن‌هایی) محاسبه می‌کند که تعیین می‌کند کدام متخصصان برای پردازش آن مرتبط‌ترند. تصمیم مسیریابی پویا و وابسته به زمینه است<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-huggingface-moe-8)</sup>.

متداول‌ترین استراتژی، **مسیریابی Top-K** است که در آن **K** متخصص با بالاترین امتیاز برای پردازش token انتخاب می‌شوند. مقدار K معمولاً کم است (مثلاً ۱ یا ۲) که همین پراکندگی را تضمین می‌کند.

### ۳. ترکیب داده‌های خروجی

پس از اینکه K متخصص انتخاب‌شده token را پردازش کردند، خروجی‌های فردی آن‌ها برای تشکیل نتیجه نهایی لایه MoE با هم ترکیب می‌شوند. معمولاً این کار از طریق جمع وزنی انجام می‌شود، جایی که وزن‌ها امتیازات نرمال‌شده‌ای هستند که توسط مسیریاب تولید شده‌اند<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)</sup>.

## تکامل MoE

مفهوم MoE برای اولین بار در سال ۱۹۹۱ در مقاله‌ای از رابرت جاکوبز، جفری هینتون و مایکل جردن با عنوان «ترکیب انطباقی متخصصان محلی» پیشنهاد شد<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-llmstudio-moe-3)</sup>. با این حال، به دلیل محدودیت‌های محاسباتی و پیچیدگی آموزش، این ایده تا دوران یادگیری عمیق گسترش گسترده‌ای نیافت.

شکست بزرگ با ظهور معماری Transformer رخ داد. تحقیقات سال‌های ۲۰۱۰ تا ۲۰۱۵ درباره محاسبات شرطی (یوشوا بنژیو و دیگران) پایه نظری را گذاشتند و کار شازیر و دیگران (۲۰۱۷) امکان مقیاس‌بندی MoE به یک مدل LSTM با ۱۳۷ میلیارد پارامتر را نشان داد<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-huggingface-moe-8)</sup>.

احیای مدرن MoE با مدل **Switch Transformer** گوگل (۲۰۲۱) مرتبط است که تا ۱.۶ تریلیون پارامتر با استفاده از مسیریابی ساده اما مؤثر Top-1 مقیاس‌بندی شد<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-9)</sup>. موفقیت مدل متن‌باز **Mixtral 8x7B** از Mistral AI در سال ۲۰۲۳ به طور قطعی MoE را به عنوان یکی از معماری‌های پیشرو برای ایجاد LLM با کارایی بالا تثبیت کرد<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)</sup>.

## چالش‌ها و روش‌های بهینه‌سازی

### تعادل بار

یکی از مشکلات اصلی MoE، **عدم تعادل بار** است، زمانی که مسیریاب به طور مداوم همان متخصصان «محبوب» را انتخاب می‌کند در حالی که دیگران کم‌استفاده می‌مانند. این امر به آموزش ناکارآمد و «فروپاشی متخصصان» منجر می‌شود.

- **توابع زیان کمکی (Auxiliary Loss):** روش سنتی که «جریمه‌ای» برای توزیع نامتوازن token‌ها به تابع زیان اصلی اضافه می‌کند. اگرچه این کار به تعادل کمک می‌کند، اما این رویکرد می‌تواند «گرادیان‌های مزاحم» ایجاد کند که عملکرد کلی را کاهش می‌دهند<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-loss-free-balancing-10)</sup>.
- **تعادل بدون زیان (Loss-Free Balancing):** رویکرد جدیدتری که به صورت پویا انحراف (bias) را به امتیازات مسیریاب اعمال می‌کند و آن را به سمت تصمیمات متعادل‌تر سوق می‌دهد بدون اینکه در وظیفه اصلی آموزش دخالت کند<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **مسیریابی با انتخاب متخصص (Expert Choice Routing):** رویکرد جایگزینی که در آن نه token‌ها متخصصان را انتخاب می‌کنند، بلکه هر متخصص \`top-k\` token را از دسته انتخاب می‌کند. این تعادل کامل را تضمین می‌کند اما ممکن است در پیاده‌سازی پیچیده‌تر باشد<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-nvidia-moe-1)</sup>.

### تنظیم دقیق و کوانتیزاسیون

- **تنظیم دقیق (Fine-tuning):** از نظر تاریخی، مدل‌های MoE به دلیل تعداد زیاد پارامترها مستعد بیش‌برازش بودند. برای کاهش این مشکل از روش‌هایی مانند «dropout متخصص» استفاده می‌شود<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-switch-transformers-paper-12)</sup>.
- **کوانتیزاسیون (Quantization):** کاهش دقت عددی وزن‌ها برای کاهش حجم مدل و سرعت‌بخشی به inference. برای MoE این کار به دلیل عدم تعادل بین متخصصان چالش‌برانگیز است. روش‌هایی مانند **MoEQuant** راه‌حل‌هایی مبتنی بر کالیبراسیون متعادل برای هر متخصص پیشنهاد می‌دهند<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-13)</sup>.

### بهینه‌سازی سیستمی

استقرار مؤثر MoE نیازمند رویکرد سیستمی جامع است که شامل موارد زیر می‌شود:

- **استراتژی‌های موازی‌سازی:** **موازی‌سازی متخصص** (توزیع متخصصان روی GPU‌های مختلف)، موازی‌سازی مدل و موازی‌سازی داده<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-14)</sup>.
- **هسته‌های تخصصی (Kernels):** برای مثال، **Megablocks** برای Mixtral که ضرب‌های ماتریسی را برای عملیات پراکنده بهینه می‌کند<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-15)</sup>.
- **طراحی مشترک سخت‌افزار (Hardware Co-design):** توسعه راه‌حل‌های سخت‌افزاری که به طور خاص برای بارهای کاری MoE بهینه شده‌اند.

## مدل‌های شاخص MoE

<table class="wikitable" style="width:100%;">
<caption>مقایسه معماری‌های برجسته MoE</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>مدل</th>
<th>توسعه‌دهنده</th>
<th>تعداد کل<br />
پارامترها</th>
<th>پارامترهای<br />
فعال</th>
<th>تعداد<br />
متخصصان</th>
<th>متخصصان انتخاب‌شده (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>۱.۶ تریلیون</td>
<td>وابسته به اندازه متخصص</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~۴۷ میلیارد</td>
<td>~۱۳ میلیارد</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>۳۱۴ میلیارد</td>
<td>۸۶ میلیارد</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (احتمالی)</td>
<td>OpenAI</td>
<td>&gt;۱ تریلیون</td>
<td>-</td>
<td>16 (احتمالی)</td>
<td>2 (احتمالی)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>۵۷-۹۰ میلیارد</td>
<td>۱۴ میلیارد</td>
<td>64</td>
<td>4 یا 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>۱۶.۴ میلیارد</td>
<td>~۲.۸ میلیارد</td>
<td>64 (2 فعال)</td>
<td>2 (از 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

مقایسه معماری‌های برجسته MoE

## کاربرد در حوزه‌های مختلف

اگرچه MoE بیشتر در بافت LLM شناخته شده است، کاربرد آن به پردازش زبان طبیعی محدود نمی‌شود:

- پیش‌بینی سری‌های زمانی: مدل Time-MoE معماری مقیاس‌پذیری برای پیش‌آموزش مدل‌های پیش‌بینی ارائه می‌دهد<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-17)</sup>.
- شناسایی آسیب‌پذیری‌ها: MoEVD از MoE برای تجزیه وظیفه شناسایی آسیب‌پذیری به طبقه‌بندی بر اساس انواع CWE استفاده می‌کند، جایی که هر متخصص در نوع خود تخصص دارد<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-18)</sup>.
- ادغام با فناوری‌های بلاک‌چین: MoE در بهینه‌سازی قراردادهای هوشمند و شناسایی تقلب کاربرد می‌یابد، جایی که متخصصان الگوهای مختلف تراکنش را تحلیل می‌کنند<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-19)</sup>.
- مدل‌های چندوجهی: MoE برای ترکیب متخصصانی که در روش‌های مختلف (متن، تصویر، صدا) تخصص دارند استفاده می‌شود و سیستم‌های همه‌منظوره‌تری ایجاد می‌کند<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_note-arxiv-llama-moe-20)</sup>.

## یادداشت‌ها

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[۶]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[۷]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[۸]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[۹]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[۱۰]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[۱۱]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[۱۲]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[۱۳]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[۱۴]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[۱۵]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[۱۶]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[۱۷]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[۱۸]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[۱۹]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(FA)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[۲۰]</a></span>
