---
title: "Mixture-of-Experts (MoE) (TR)"
source: "https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)"
wiki: "systems-analysis.info/int"
article: "Mixture-of-Experts_(MoE)_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 4467
wiki_created_at: 2026-09-06T23:35:34Z
wiki_modified_at: 2026-09-06T23:35:34Z
downloaded_at: 2026-09-07T23:02:49Z
---

# Mixture-of-Experts (MoE) (TR)

**Mixture-of-Experts (MoE)** (İng. — "Uzman Karışımı") — koşullu hesaplama ilkesine ve *«Böl ve Yönet»* paradigmasına dayanan bir sinir ağı mimarisidir. Her girdi sinyalinin işlenmesinde tüm parametrelerin devreye girdiği tek ve yekpare ("yoğun") bir model kullanmak yerine, MoE mimarisi görevi parçalara ayırarak "uzman" adı verilen özelleşmiş alt ağların bir alt kümesine devreder. Özel bir bileşen olan yönlendirici ağ (gating network veya router), hangi uzmanların her bir girdi token'ını işleyeceğini dinamik olarak belirler<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)[\[2\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-arxiv-bigdata-moe-2)</sup>.

Bu yaklaşım, çıkarım (inference) aşamasındaki hesaplama maliyetlerini (FLOPs) çok daha küçük yoğun modellerin düzeyinde tutarken, muazzam sayıda parametreye (yüzlerce milyar hatta trilyonlar) sahip modeller oluşturmaya olanak tanır<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-llmstudio-moe-3)</sup>. Bu sayede MoE, modern büyük dil modellerinin (LLM) ölçeklendirilmesinde kilit bir teknoloji haline gelmiş ve Mixtral 8x7B, Grok-1 ile yaygın kanıya göre GPT-4 gibi öncü sistemlerde kullanılmaktadır<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)</sup>.

## Temel İlke: Koşullu Hesaplama ve Seyreklik

MoE'nin temel mekanizması **koşullu hesaplamadır** (conditional computation). Her token işlenirken tüm parametrelerin aktif olduğu yoğun modellerin aksine, MoE modelleri girdiye bağlı olarak parametrelerinin yalnızca küçük bir bölümünü etkinleştirir. Bu süreç, geleneksel mimarilerden temel farkı oluşturan **aktivasyon seyrekliğine** (sparsity in activation) yol açar<sup>[\[4\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-friendli-serving-moe-4)</sup>.

Bu yaklaşım şunları mümkün kılar:

- **Model kapasitesini ölçeklendirme:** Toplam parametre sayısı (dolayısıyla modelin "bilgisi") hesaplama yükünde orantılı bir artış olmaksızın önemli ölçüde artırılabilir.
- **Verimliliği artırma:** Model her token için daha az hesaplama yapar; bu da sabit bir hesaplama bütçesinde daha hızlı çıkarım ve daha düşük eğitim maliyetlerine yol açar<sup>[\[5\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-zilliz-moe-5)</sup>.

Böylece MoE, darboğazı hesaplama gücünden **bellek gereksinimlerine (VRAM)** kaydırır; zira her an yalnızca küçük bir kısmı kullanılsa bile tüm uzmanların tüm parametrelerinin belleğe yüklenmesi gerekir<sup>[\[6\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-moe-vs-dense-llms-6)</sup>.

## MoE Mimarisinin Bileşenleri

### 1. Uzman Alt Ağları (Experts)

Uzmanlar genellikle bağımsız sinir ağlarıdır. Transformer mimarisi bağlamında MoE katmanları tipik olarak yoğun tam bağlantılı blokların (Feed-Forward Networks, FFN) yerini alır ve her uzman kendi başına bir FFN'dir<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)</sup>. Eğitim sürecinde her uzman belirli alanlarda "yetkinlik" geliştirebilir — örneğin biri sözdizimi, diğeri belirli bir bilgi alanındaki olgular, bir diğeri ise belirli bir dil veya üslup üzerinde uzmanlaşabilir<sup>[\[7\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-ve3-understanding-moe-7)</sup>.

### 2. Yönlendirici Ağ (Gating Network / Router)

Yönlendirici ağ, görevlerin akıllı dağıtımını gerçekleştiren küçük ancak kritik öneme sahip bir bileşendir. Her girdi token'ı için yönlendirici, hangi uzmanların işleme için en uygun olduğunu belirleyen puanlar (ağırlıklar) hesaplar. Yönlendirme kararı dinamik ve bağlama bağımlıdır<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-huggingface-moe-8)</sup>.

En yaygın strateji, token'ı işlemek üzere en yüksek puana sahip **K** uzmanın seçildiği **Top-K yönlendirmesidir**. K değeri genellikle küçüktür (örneğin 1 veya 2), bu da seyrekliği sağlar.

### 3. Çıktıların Birleştirilmesi

Seçilen K uzman token'ı işledikten sonra, bireysel çıktıları MoE katmanının nihai sonucunu oluşturmak üzere birleştirilir. Bu işlem genellikle yönlendirici tarafından üretilen normalleştirilmiş puanların ağırlık olarak kullanıldığı ağırlıklı toplama yöntemiyle yapılır<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)</sup>.

## MoE'nin Evrimi

MoE kavramı ilk olarak 1991 yılında Robert Jacobs, Geoffrey Hinton ve Michael Jordan tarafından "Yerel Uzmanların Uyarlanabilir Karışımı" başlıklı çalışmada önerilmiştir<sup>[\[3\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-llmstudio-moe-3)</sup>. Ancak hesaplama kısıtlamaları ve eğitim zorluğu nedeniyle bu fikir, derin öğrenme çağına kadar geniş çapta benimsenmedi.

Büyük atılım, Transformer mimarisinin ortaya çıkmasıyla gerçekleşti. 2010-2015 yılları arasında koşullu hesaplamaya (Yoshua Bengio ve diğerleri) adanmış araştırmalar teorik temeli attı; Shazir ve diğerlerinin (2017) çalışması ise MoE'nin 137 milyar parametreli bir LSTM modeline kadar ölçeklendirilebileceğini gösterdi<sup>[\[8\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-huggingface-moe-8)</sup>.

MoE'nin modern yeniden doğuşu, Google'ın 2021 yılında Top-1 yönlendirmesini kullanan ve 1,6 trilyon parametreye kadar ölçeklenen **Switch Transformer** modeliyle ilişkilidir<sup>[\[9\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-9)</sup>. Mistral AI'ın 2023 yılında yayımladığı açık model **Mixtral 8x7B'**nin başarısı, MoE'yi yüksek performanslı LLM oluşturmak için önde gelen mimarilerden biri olarak kesin biçimde yerleştirdi<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)</sup>.

## Sorunlar ve Optimizasyon Yöntemleri

### Yük Dengeleme

MoE'nin temel sorunlarından biri, yönlendiricinin sürekli olarak aynı "popüler" uzmanları seçerken diğerlerinin yetersiz kullanılmasına yol açan **yük dengesizliğidir**. Bu durum, verimsiz eğitime ve "uzman çöküşüne" neden olur.

- **Yardımcı Kayıp Fonksiyonları (Auxiliary Loss):** Token dağılımındaki eşitsizliğe "ceza" ekleyen geleneksel bir yöntemdir. Dengelemeye yardımcı olsa da bu yaklaşım, genel performansı düşürebilecek "gürültü gradyanları" oluşturabilir<sup>[\[10\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-loss-free-balancing-10)</sup>.
- **Kayıpsız Dengeleme (Loss-Free Balancing):** Yönlendiricinin puanlarına dinamik olarak sapma (bias) uygulayarak temel eğitim görevine müdahale etmeden daha dengeli kararlar almasını sağlayan daha yeni bir yaklaşımdır<sup>[\[11\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-loss-free-balancing-gopubby-11)</sup>.
- **Uzman Seçimi ile Yönlendirme (Expert Choice Routing):** Token'ların uzman seçmediği, aksine her uzmanın gruptaki \`top-k\` token'ı kendisi seçtiği alternatif bir yaklaşımdır. Bu yöntem mükemmel dengelemeyi garanti eder, ancak uygulaması daha karmaşık olabilir<sup>[\[1\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-nvidia-moe-1)</sup>.

### İnce Ayar ve Nicemleme

- **İnce Ayar (Fine-tuning):** Tarihsel olarak MoE modelleri, büyük parametre sayısı nedeniyle aşırı öğrenmeye eğilimlidir. Bu sorunu azaltmak için "uzman dropout" gibi yöntemler kullanılmaktadır<sup>[\[12\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-switch-transformers-paper-12)</sup>.
- **Nicemleme (Quantization):** Model boyutunu küçültmek ve çıkarımı hızlandırmak için ağırlıkların sayısal hassasiyetinin düşürülmesidir. MoE için bu, uzmanlar arası dengesizlik nedeniyle zorlu bir görevdir. **MoEQuant** gibi yöntemler, her uzman için dengeli kalibrasyon temelli çözümler önerir<sup>[\[13\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-13)</sup>.

### Sistem Optimizasyonu

MoE'nin verimli dağıtımı, aşağıdakileri kapsayan bütünsel bir sistem yaklaşımı gerektirir:

- **Paralellik Stratejileri:** **Uzman paralelliği** (uzmanların farklı GPU'lara dağıtılması), model paralelliği ve veri paralelliği<sup>[\[14\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-14)</sup>.
- **Özelleştirilmiş Çekirdekler (Kernels):** Seyrek işlemler için matris çarpmalarını optimize eden Mixtral'ın **Megablocks** örneği<sup>[\[15\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-15)</sup>.
- **Donanım Ortak Tasarımı (Hardware Co-design):** MoE iş yükleri için özel olarak optimize edilmiş donanım çözümlerinin geliştirilmesi.

## Öne Çıkan MoE Modelleri

<table class="wikitable" style="width:100%;">
<caption>Öne çıkan MoE mimarilerinin karşılaştırması</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>Model</th>
<th>Geliştirici</th>
<th>Toplam<br />
parametre sayısı</th>
<th>Aktif<br />
parametreler</th>
<th>Uzman<br />
sayısı</th>
<th>Seçilen<br />
uzmanlar (k)</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>Switch Transformer C-2048</td>
<td>Google</td>
<td>1,6 trilyon</td>
<td>Uzman boyutuna bağlı</td>
<td>2048</td>
<td>1</td>
</tr>
<tr class="even">
<td>Mixtral 8x7B</td>
<td>Mistral AI</td>
<td>~47 milyar</td>
<td>~13 milyar</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="odd">
<td>Grok-1</td>
<td>xAI</td>
<td>314 milyar</td>
<td>86 milyar</td>
<td>8</td>
<td>2</td>
</tr>
<tr class="even">
<td>GPT-4 (varsayılan)</td>
<td>OpenAI</td>
<td>&gt;1 trilyon</td>
<td>-</td>
<td>16 (tahmini)</td>
<td>2 (tahmini)</td>
</tr>
<tr class="odd">
<td>Qwen 2 MoE</td>
<td>Alibaba</td>
<td>57-90 milyar</td>
<td>14 milyar</td>
<td>64</td>
<td>4 veya 8</td>
</tr>
<tr class="even">
<td>DeepSeekMoE 16B</td>
<td>DeepSeek-AI</td>
<td>16,4 milyar</td>
<td>~2,8 milyar</td>
<td>64 (2 aktif)</td>
<td>2 (6'dan)<sup><a href="https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-16">[16]</a></sup></td>
</tr>
</tbody>
</table>

Öne çıkan MoE mimarilerinin karşılaştırması

## Farklı Alanlarda Uygulamalar

MoE en çok LLM bağlamında bilinse de kullanımı doğal dil işlemeyle sınırlı değildir:

- Zaman serisi tahmini: Time-MoE modeli, tahmin modellerinin ön eğitimi için ölçeklenebilir bir mimari sunar<sup>[\[17\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-17)</sup>.
- Güvenlik açığı tespiti: MoEVD, güvenlik açığı tespiti görevini CWE türlerine göre sınıflandırmaya ayrıştırmak için MoE'yi kullanır; her uzman kendi türünde uzmanlaşır<sup>[\[18\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-18)</sup>.
- Blok zinciri teknolojileriyle entegrasyon: MoE, akıllı sözleşme optimizasyonu ve dolandırıcılık tespitinde uygulama alanı bulur; uzmanlar farklı işlem örüntülerini analiz eder<sup>[\[19\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-19)</sup>.
- Çok modlu modeller: MoE, farklı modalitelerde (metin, görüntü, ses) uzmanlaşmış uzmanları birleştirmek ve daha çok yönlü sistemler oluşturmak için kullanılır<sup>[\[20\]](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_note-arxiv-llama-moe-20)</sup>.

## Notlar

1.  <span id="cite_note-nvidia-moe-1">↑ <sup>[1.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-nvidia-moe_1-5)</sup> «Applying Mixture of Experts in LLM Architectures». *NVIDIA Technical Blog*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-bigdata-moe-2">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-arxiv-bigdata-moe_2-0) «Mixture of Experts (MoE): A Big Data Perspective». *arXiv*. <a href="https://arxiv.org/html/2501.16352v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-llmstudio-moe-3">↑ <sup>[3.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-llmstudio-moe_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-llmstudio-moe_3-1)</sup> «Mixture-of-Experts (MoE): что это такое и как работает». *LLM Studio*. <a href="https://llmstudio.ru/blog/mixture-of-experts-moe" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-friendli-serving-moe-4">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-friendli-serving-moe_4-0) «Serving Mixtral MoE Model». *Friendli.ai Blog*. <a href="https://friendli.ai/blog/serving-mixtral-moe-model" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zilliz-moe-5">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-zilliz-moe_5-0) «What is Mixture of Experts (MoE)? How it Works and Use Cases». *Zilliz Learn*. <a href="https://zilliz.com/learn/what-is-mixture-of-experts" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-moe-vs-dense-llms-6">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-moe-vs-dense-llms_6-0) «Mixture of Experts (MoE) vs Dense LLMs». *Maximilian Schwarzmüller's Blog*. <a href="https://maximilian-schwarzmueller.com/articles/understanding-mixture-of-experts-moe-llms/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ve3-understanding-moe-7">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-ve3-understanding-moe_7-0) «Understanding Mixture of Experts in Deep Learning». *VE3*. <a href="https://www.ve3.global/understanding-mixture-of-experts-in-deep-learning/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-huggingface-moe-8">↑ <sup>[8.0](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-huggingface-moe_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-huggingface-moe_8-1)</sup> «Mixture of Experts Explained». *Hugging Face Blog*. <a href="https://huggingface.co/blog/moe" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-9) «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-loss-free-balancing-10">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-loss-free-balancing_10-0) «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». *OpenReview*. <a href="https://openreview.net/forum?id=y1iU5czYpE" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-loss-free-balancing-gopubby-11">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-loss-free-balancing-gopubby_11-0) «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». *gopubby.com*. <a href="https://ai.gopubby.com/deepseek-v3-explained-3-auxiliary-loss-free-load-balancing-4beeb734ab1f" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-switch-transformers-paper-12">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-switch-transformers-paper_12-0) «Switch Transformers: Scaling to Trillion Parameter Models with...». *cse.ust.hk*. <a href="https://home.cse.ust.hk/~cktang/csit6000s/Password_Only/lec16-csit.pdf" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-13) «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». *arXiv*. <a href="https://arxiv.org/abs/2505.03804" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-14) «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». *Preprints.org*. <a href="https://www.preprints.org/manuscript/202505.1603/v1" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-15) «Mixtral of Experts». *arXiv*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-16) «A Survey on Inference Optimization Techniques for Mixture of Experts Models». *arXiv*. <a href="https://arxiv.org/html/2412.14219v2" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-17) «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». *arXiv*. <a href="https://arxiv.org/abs/2409.16040" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-18) «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». *Semantic Scholar*. <a href="https://www.semanticscholar.org/paper/3ad556dece0c1dd075004c4b45beeb7142a045c2" class="external autonumber" rel="nofollow">[18]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-19) «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». *Gate.io Learn*. <a href="https://www.gate.com/ru/learn/articles/what-a-decentralized-mixture-of-experts-mo-e-is-and-how-it-works/5073" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-arxiv-llama-moe-20">[↑](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(TR)#cite_ref-arxiv-llama-moe_20-0) «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». *arXiv*. <a href="https://arxiv.org/abs/2406.16554" class="external autonumber" rel="nofollow">[20]</a></span>
