---
title: "Mixture-of-Experts (MoE) (HE)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4454
wiki_created_at: 2026-09-06T23:35:23Z
wiki_modified_at: 2026-09-06T23:35:23Z
downloaded_at: 2026-09-07T23:02:44Z
---

# Mixture-of-Experts (MoE) (HE)

**Mixture-of-Experts (MoE)** (מאנגלית — «תערובת מומחים») — זוהי ארכיטקטורה של רשתות נוירונים, המבוססת על עיקרון החישוב המותנה ועל הפרדיגמה *«הפרד ומשול»*. במקום שימוש במודל מונוליתי אחיד («צפוף»), שבו כל הפרמטרים מופעלים לעיבוד כל אות קלט, ארכיטקטורת MoE מפרקת את המשימה ומאצילה אותה לתת-קבוצה של תת-רשתות מתמחות, הנקראות «מומחים». רכיב ייעודי, רשת הניתוב (gating network או router), קובע באופן דינמי אילו מומחים יעבדו כל token קלט ספציפי<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-arxiv-bigdata-moe-2)</sup>.

גישה זו מאפשרת ליצור מודלים עם מספר עצום של פרמטרים (מאות מיליארדים ואף טריליונים), תוך שמירה על עלויות החישוב (FLOPs) בשלב ה-inference ברמה של מודלים צפופים קטנים בהרבה<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-llmstudio-moe-3)</sup>. בזכות כך, MoE הפכה לטכנולוגיית מפתח לסקיילינג של מודלי שפה גדולים (LLM) עכשוויים, ומשמשת במערכות מתקדמות כגון Mixtral 8x7B,‏ Grok-1, ולפי דעה רווחת גם GPT-4<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)</sup>.

## עיקרון המפתח: חישוב מותנה ודלילות

המנגנון הבסיסי של MoE הוא **חישוב מותנה** (conditional computation). בניגוד למודלים צפופים, שבהם כל הפרמטרים פעילים בעת עיבוד כל token, מודלי MoE מפעילים רק חלק קטן מהפרמטרים שלהם בהתאם לנתוני הקלט. תהליך זה מוביל ל**דלילות בהפעלות** (sparsity in activation), שהיא ההבדל המרכזי מארכיטקטורות מסורתיות<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-friendli-serving-moe-4)</sup>.

גישה זו מאפשרת:

- **סקיילינג של קיבולת המודל:** מספר הפרמטרים הכולל (וכפועל יוצא, ה«ידע» של המודל) יכול לגדול משמעותית ללא גידול פרופורציונלי בעומס החישובי.
- **שיפור היעילות:** המודל מבצע פחות חישובים עבור כל token, מה שמוביל ל-inference מהיר יותר ולהפחתת עלויות האימון בתקציב חישובי קבוע<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-zilliz-moe-5)</sup>.

כך, MoE מעביר את צוואר הבקבוק מכוח חישובי לכיוון **דרישות הזיכרון (VRAM)**, שכן כל הפרמטרים של כל המומחים חייבים להיות טעונים בזיכרון, אפילו אם בכל רגע נתון רק חלק קטן מהם בשימוש<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-moe-vs-dense-llms-6)</sup>.

## רכיבי ארכיטקטורת MoE

### 1. תת-רשתות מומחים (Experts)

מומחים הם בדרך כלל רשתות נוירונים עצמאיות. בהקשר של ארכיטקטורת transformer, שכבות MoE מחליפות בדרך כלל בלוקים צפופים מחוברים במלואם (Feed-Forward Networks, FFN), וכל מומחה הוא כשלעצמו FFN<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)</sup>. במהלך האימון, כל מומחה עשוי לפתח «כשירות» בתחומים מסוימים — למשל, אחד עשוי להתמחות בתחביר, אחר בעובדות מתחום ידע ספציפי, ושלישי בשפה או סגנון מסוים<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. רשת הניהול (Gating Network / Router)

רשת הניתוב היא רכיב קטן אך קריטי המבצע חלוקת משימות אינטליגנטית. עבור כל token קלט, הנתב מחשב ציונים (משקלות), הקובעים אילו מומחים הרלוונטיים ביותר לעיבודו. החלטת הניתוב היא דינמית ותלוית הקשר<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-huggingface-moe-8)</sup>.

האסטרטגיה הנפוצה ביותר היא **ניתוב Top-K**, שבה נבחרים **K** מומחים בעלי הציונים הגבוהים ביותר לעיבוד ה-token. ערך K הוא בדרך כלל קטן (למשל, 1 או 2), וזה שמבטיח את הדלילות.

### 3. איחוד נתוני הפלט

לאחר שה-K מומחים הנבחרים עיבדו את ה-token, הפלטים הבודדים שלהם מאוחדים ליצירת תוצאה סופית של שכבת MoE. בדרך כלל נעשה זאת באמצעות סכימה משוקללת, שבה המשקלות הם הציונים המנורמלים שהופקו על ידי הנתב<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)</sup>.

## אבולוציית MoE

המושג MoE הוצע לראשונה בשנת 1991 בעבודה של רוברט ג'ייקובס, ג'פרי הינטון ומייקל ג'ורדן בשם «תערובת אדפטיבית של מומחים מקומיים»<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-llmstudio-moe-3)</sup>. אולם בשל מגבלות חישוביות ומורכבות האימון, הרעיון לא זכה להתפשטות רחבה עד לעידן הלמידה העמוקה.

הפריצה התרחשה עם הופעת ארכיטקטורת Transformer. מחקרים בין השנים 2010–2015 שעסקו בחישוב מותנה (יושוע בנג'יו ואחרים) הניחו את הבסיס התיאורטי, ועבודת שאזיר ואחרים (2017) הדגימה את האפשרות לסקיילינג של MoE עד למודל LSTM של 137 מיליארד פרמטרים<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-huggingface-moe-8)</sup>.

התחייה המודרנית של MoE קשורה למודל **Switch Transformer** של Google (2021), שהתרחב עד 1.6 טריליון פרמטרים תוך שימוש בניתוב Top-1 פשוט אך יעיל<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-9)</sup>. הצלחת המודל הפתוח **Mixtral 8x7B** של Mistral AI בשנת 2023 ביססה סופית את MoE כאחת הארכיטקטורות המובילות ליצירת LLM בעלי ביצועים גבוהים<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)</sup>.

## אתגרים ושיטות אופטימיזציה

### איזון עומסים

אחד האתגרים המרכזיים של MoE הוא **חוסר איזון בעומסים**, כאשר הנתב בוחר ללא הרף באותם מומחים «פופולריים», בעוד שאחרים נשארים תת-מנוצלים. הדבר מוביל לאימון לא יעיל ול«קריסת מומחים».

- **פונקציות הפסד עזר (Auxiliary Loss):** שיטה מסורתית המוסיפה לפונקציית ההפסד הראשית «עונש» על חלוקה לא אחידה של tokens. אמנם זה מסייע לאיזון, אך גישה זו עלולה להכניס «גרדיאנטים מפריעים» ולפגוע בביצועים הכוללים<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-loss-free-balancing-10)</sup>.
- **איזון ללא הפסד (Loss-Free Balancing):** גישה חדשה יותר, המיישמת באופן דינמי הסטה (bias) לציוני הנתב, ומדרבנת אותו להחלטות מאוזנות יותר ללא התערבות במשימת האימון הראשית<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **ניתוב לפי בחירת מומחה (Expert Choice Routing):** גישה חלופית שבה לא ה-tokens בוחרים את המומחים, אלא כל מומחה בוחר לעצמו את \`top-k\` ה-tokens מהאצווה. זה מבטיח איזון מושלם, אך עשוי להיות מורכב יותר ליישום<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-nvidia-moe-1)</sup>.

### Fine-tuning וקוונטיזציה

- **Fine-tuning:** היסטורית, מודלי MoE היו נוטים להתאמת יתר בשל מספר הפרמטרים הגדול. לצמצום בעיה זו משמשות שיטות כמו «expert dropout»<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-switch-transformers-paper-12)</sup>.
- **Quantization:** הפחתת דיוק מספרי של משקלות לצמצום גודל המודל והאצת ה-inference. עבור MoE זוהי משימה מורכבת בשל חוסר האיזון בין-מומחי. שיטות כגון **MoEQuant** מציעות פתרונות המבוססים על כיול מאוזן לכל מומחה<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-13)</sup>.

### אופטימיזציה מערכתית

פריסה יעילה של MoE מחייבת גישה מערכתית כוללת, הכוללת:

- **אסטרטגיות מקביליות:** **מקביליות מומחים** (פיזור מומחים על פני GPU שונים), מקביליות מודל ומקביליות נתונים<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-14)</sup>.
- **ליבות מיוחדות (Kernels):** למשל, **Megablocks** עבור Mixtral, המייעלות כפל מטריצות לפעולות דלילות<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-15)</sup>.
- **תכנון משותף של חומרה (Hardware Co-design):** פיתוח פתרונות חומרה המותאמים במיוחד לעומסי עבודה של MoE.

## מודלי MoE ציוניים

<table class="wikitable" style="width:100%;">
<caption>השוואת ארכיטקטורות MoE בולטות</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>מודל</th>
<th>מפתח</th>
<th>סה"כ<br />
פרמטרים</th>
<th>פרמטרים<br />
פעילים</th>
<th>מספר<br />
מומחים</th>
<th>מומחים נבחרים (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1.6 טריליון</td>
<td>תלוי בגודל המומחה</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 מיליארד</td>
<td>~13 מיליארד</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 מיליארד</td>
<td>86 מיליארד</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (לכאורה)</td>
<td>OpenAI</td>
<td>&gt;1 טריליון</td>
<td>-</td>
<td>16 (משוער)</td>
<td>2 (משוער)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57–90 מיליארד</td>
<td>14 מיליארד</td>
<td>64</td>
<td>4 או 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16.4 מיליארד</td>
<td>~2.8 מיליארד</td>
<td>64 (2 פעילים)</td>
<td>2 (מתוך 6)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

השוואת ארכיטקטורות MoE בולטות

## יישום בתחומים שונים

אמנם MoE ידועות בעיקר בהקשר של LLM, אך יישומן אינו מוגבל לעיבוד שפה טבעית:

- חיזוי טורי זמן: המודל Time-MoE מציג ארכיטקטורה ניתנת לסקיילינג לאימון מקדים של מודלי חיזוי<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-17)</sup>.
- גילוי פגיעויות: MoEVD משתמש ב-MoE לפירוק משימת גילוי פגיעויות לסיווג לפי סוגי CWE, כאשר כל מומחה מתמחה בסוג שלו<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-18)</sup>.
- שילוב עם טכנולוגיית בלוקצ'יין: MoE מוצא שימוש באופטימיזציה של חוזים חכמים ובגילוי הונאות, שבהם המומחים מנתחים דפוסי עסקאות שונים<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-19)</sup>.
- מודלים מולטי-מודליים: MoE משמש לשילוב מומחים המתמחים במודאליות שונות (טקסט, תמונה, שמע), ויוצר מערכות רב-תכליתיות יותר<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_note-arxiv-llama-moe-20)</sup>.

## הערות

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(HE)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
