Mixture-of-Experts (MoE) (TL)
Mixture-of-Experts (MoE) (mula sa Ingles — «Halo ng mga Eksperto») — ito ay isang arkitektura ng mga neural network na nakabatay sa prinsipyo ng conditional computation at sa paradigma ng «Hatiin at Pamahalaan». Sa halip na gumamit ng isang monolitikong («masinsinang») modelo kung saan ginagamit ang lahat ng parameter para sa pagproseso ng bawat input signal, binubuwag ng MoE-arkitektura ang gawain sa pamamagitan ng pagtatalaga nito sa isang subset ng mga espesyalisadong subnetwork na tinatawag na «mga eksperto». Isang espesyal na bahagi, ang network-router (gating network o router), ay dinamikong tumutukoy kung aling mga eksperto ang magpoproseso sa bawat partikular na input token[1][2].
Ang diskarteng ito ay nagbibigay-daan sa paglikha ng mga modelo na may napakaraming parameter (daan-daang bilyon o maging trilyon), habang pinapanatili ang mga gastos sa pagkalkula (FLOPs) sa panahon ng inference sa antas ng mas maliliit na masinsinang modelo[3]. Salamat dito, ang MoE ay naging isang pangunahing teknolohiya para sa pag-scale ng mga modernong malalaking language model (LLM) at ginagamit sa mga makabagong sistema tulad ng Mixtral 8x7B, Grok-1, at ayon sa malawakang opinyon, GPT-4[1].
Pangunahing Prinsipyo: Conditional Computation at Sparsity
Ang pundamental na mekanismo ng MoE ay ang conditional computation (kondisyonal na pagkalkula). Hindi tulad ng mga masinsinang modelo kung saan aktibo ang lahat ng parameter sa pagproseso ng anumang token, ang mga MoE-modelo ay nagpapaaktibo lamang ng isang maliit na bahagi ng kanilang mga parameter batay sa input data. Ang prosesong ito ay humahantong sa sparsity in activation (pagkakalat ng mga aktibasyoon), na siyang pangunahing pagkakaiba mula sa mga tradisyonal na arkitektura[4].
Ang ganitong diskarte ay nagbibigay-daan sa:
- Pag-scale ng kapasidad ng modelo: Ang kabuuang bilang ng mga parameter (at, samakatuwid, ang «kaalaman» ng modelo) ay maaaring makabuluhang dagdagan nang hindi proporsyonal na tumataas ang computational load.
- Pagpapataas ng kahusayan: Ang modelo ay gumaganap ng mas kaunting pagkalkula sa bawat token, na humahantong sa mas mabilis na inference at pagbabawas ng gastos sa pagsasanay sa isang nakapirming computational budget[5].
Kaya naman, inililipat ng MoE ang bottleneck mula sa computational power patungo sa mga kinakailangan sa memorya (VRAM), dahil ang lahat ng parameter ng lahat ng eksperto ay dapat na mai-load sa memorya, kahit na sa bawat sandali ay ginagamit lamang ang isang maliit na bahagi ng mga ito[6].
Mga Bahagi ng Arkitektura ng MoE
1. Mga Ekspertong Subnetwork (Experts)
Ang mga eksperto ay, sa karaniwang kaso, mga independyenteng neural network. Sa konteksto ng arkitektura ng transformer, ang mga MoE layer ay karaniwang pinapalitan ang mga masinsinang fully-connected block (Feed-Forward Networks, FFN), at ang bawat eksperto mismo ay isang FFN[1]. Sa proseso ng pagsasanay, ang bawat eksperto ay maaaring magpaunlad ng «kahusayan» sa ilang partikular na larangan — halimbawa, ang isa ay maaaring mag-espesyalisa sa syntax, ang isa pa sa mga katotohanan mula sa isang partikular na larangan ng kaalaman, at ang isa pa sa isang partikular na wika o istilo[7].
2. Gating Network / Router
Ang network-router ay isang maliit ngunit kritikal na bahagi na gumaganap ng matalinong pamamahagi ng mga gawain. Para sa bawat input token, kinakalkula ng router ang mga marka (timbang), na tinutukoy kung aling mga eksperto ang pinaka-angkop para sa pagproseso nito. Ang desisyon sa routing ay dinamiko at nakadepende sa konteksto[8].
Ang pinaka-karaniwang estratehiya ay ang Top-K routing, kung saan ang K na mga eksperto na may pinakamataas na marka ay pinipili para sa pagproseso ng token. Ang halaga ng K ay karaniwang maliit (halimbawa, 1 o 2), na siyang nagbibigay ng sparsity.
3. Pagsasama ng mga Output
Pagkatapos maproseso ng mga napiling K na eksperto ang token, ang kanilang mga indibidwal na output ay pinagsama upang mabuo ang panghuling resulta ng MoE layer. Karaniwan itong ginagawa sa pamamagitan ng weighted summation, kung saan ang mga timbang ay ang mga normalized na marka na nabuo ng router[1].
Ebolusyon ng MoE
Ang konsepto ng MoE ay unang iminungkahi noong 1991 sa papel nina Robert Jacobs, Geoffrey Hinton, at Michael Jordan na pinamagatang «Adaptive Mixtures of Local Experts»[3]. Gayunpaman, dahil sa mga limitasyon sa pagkalkula at kahirapan sa pagsasanay, ang ideya ay hindi kumalat nang malawak hanggang sa panahon ng deep learning.
Ang breakthrough ay naganap nang lumabas ang arkitektura ng Transformer. Ang mga pananaliksik noong 2010-2015 tungkol sa conditional computation (ni Yoshua Bengio at iba pa) ay naglatag ng theoretical na pundasyon, at ang papel ni Shazeer at iba pa (2017) ay nagpakita ng posibilidad ng pag-scale ng MoE hanggang sa 137-bilyong LSTM-modelo[8].
Ang modernong muling pagbabago ng MoE ay nauugnay sa modelong Switch Transformer mula sa Google (2021), na nag-scale hanggang sa 1.6 trilyong parameter, gamit ang simple ngunit epektibong Top-1 routing[9]. Ang tagumpay ng open-source na modelong Mixtral 8x7B mula sa Mistral AI noong 2023 ay tuluyang nagtatag ng MoE bilang isa sa mga nangungunang arkitektura para sa paglikha ng mga high-performance na LLM[1].
Mga Hamon at Paraan ng Optimisasyon
Pagbabalanse ng Load
Isa sa mga pangunahing hamon ng MoE ay ang load imbalance, kapag ang router ay patuloy na pumipili ng parehong «sikat» na mga eksperto, habang ang iba ay nananatiling hindi nagagamit nang husto. Ito ay humahantong sa hindi epektibong pagsasanay at «pagguho ng mga eksperto».
- Auxiliary Loss (Pantulong na Loss Function): Ang tradisyonal na paraan na nagdaragdag ng «parusa» sa pangunahing loss function para sa hindi pantay na pamamahagi ng mga token. Bagama't nakakatulong ito sa pagbabalanse, ang diskarteng ito ay maaaring magdulot ng «interference gradients», na nagpapababa ng pangkalahatang performance[10].
- Loss-Free Balancing (Pagbabalanse nang walang Loss): Isang mas bagong diskarte na dinamikong naglalapat ng bias sa mga marka ng router, na nagtutulak dito tungo sa mas balanseng mga desisyon nang hindi nakikialam sa pangunahing gawain ng pagsasanay[11].
- Expert Choice Routing (Routing ayon sa Pagpili ng Eksperto): Isang alternatibong diskarte, kung saan hindi ang mga token ang pumipili ng mga eksperto, kundi ang bawat eksperto ay pumipili ng sarili nitong `top-k` na mga token mula sa batch. Ginagarantiyahan nito ang perpektong pagbabalanse, ngunit maaaring mas mahirap ipatupad[1].
Fine-tuning at Quantization
- Fine-tuning (Pinong Pag-aayos): Kasaysayang ang mga MoE-modelo ay madaling mag-overfit dahil sa malaking bilang ng mga parameter. Upang mapigilan ang problemang ito, ginagamit ang mga pamamaraan tulad ng «expert dropout»[12].
- Quantization (Quantisasyon): Pagbababa ng numerical precision ng mga timbang upang mabawasan ang laki ng modelo at mapabilis ang inference. Para sa MoE, ito ay isang kumplikadong gawain dahil sa inter-expert imbalance. Ang mga pamamaraan tulad ng MoEQuant ay nag-aalok ng mga solusyon batay sa balanseng calibration para sa bawat eksperto[13].
Sistemang Optimisasyon
Ang epektibong deployment ng MoE ay nangangailangan ng holistic na sistematikong diskarte, kabilang ang:
- Mga Estratehiya sa Parallelism: Expert parallelism (pamamahagi ng mga eksperto sa iba't ibang GPU), model parallelism, at data parallelism[14].
- Mga Espesyalisadong Kernel: Halimbawa, Megablocks para sa Mixtral, na nag-o-optimize ng matrix multiplication para sa mga sparse na operasyon[15].
- Hardware Co-design: Pagbuo ng mga hardware solution na espesyal na na-optimize para sa mga workload ng MoE.
Mga Makabuluhang MoE Model
| Modelo | Developer | Kabuuang bilang ng parameter |
Aktibong parameter |
Bilang ng eksperto |
Mga piniling eksperto (k) |
|---|---|---|---|---|---|
| Switch Transformer C-2048 | 1.6 trilyon | Nakasalalay sa laki ng eksperto | 2048 | 1 | |
| Mixtral 8x7B | Mistral AI | ~47 bilyon | ~13 bilyon | 8 | 2 |
| Grok-1 | xAI | 314 bilyon | 86 bilyon | 8 | 2 |
| GPT-4 (pinaghihinalaang) | OpenAI | >1 trilyon | - | 16 (pinaghihinalaan) | 2 (pinaghihinalaan) |
| Qwen 2 MoE | Alibaba | 57-90 bilyon | 14 bilyon | 64 | 4 o 8 |
| DeepSeekMoE 16B | DeepSeek-AI | 16.4 bilyon | ~2.8 bilyon | 64 (2 aktibo) | 2 (mula sa 6)[16] |
Paggamit sa Iba't Ibang Larangan
Bagama't ang MoE ay pinakakilala sa konteksto ng LLM, ang kanilang aplikasyon ay hindi limitado sa natural language processing:
- Pagtataya ng time series: Ang Time-MoE na modelo ay kumakatawan sa isang scalable na arkitektura para sa pre-training ng mga forecasting model[17].
- Pagtuklas ng mga kahinaan: Ang MoEVD ay gumagamit ng MoE para sa pagbabago ng gawain ng pagtuklas ng kahinaan sa pag-uuri ayon sa mga uri ng CWE, kung saan ang bawat eksperto ay nag-espesyalisa sa sarili nitong uri[18].
- Integrasyon sa mga teknolohiya ng blockchain: Ang MoE ay ginagamit sa optimisasyon ng mga smart contract at pagtuklas ng pandaraya, kung saan sinusuri ng mga eksperto ang iba't ibang pattern ng transaksyon[19].
- Mga multimodal na modelo: Ginagamit ang MoE upang pagsaluhin ang mga eksperto na espesyalista sa iba't ibang modality (teksto, larawan, audio), na lumilikha ng mas maraming nalalaman na mga sistema[20].
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 «Applying Mixture of Experts in LLM Architectures». NVIDIA Technical Blog. [1]
- ↑ «Mixture of Experts (MoE): A Big Data Perspective». arXiv. [2]
- ↑ 3.0 3.1 «Mixture-of-Experts (MoE): что это такое и как работает». LLM Studio. [3]
- ↑ «Serving Mixtral MoE Model». Friendli.ai Blog. [4]
- ↑ «What is Mixture of Experts (MoE)? How it Works and Use Cases». Zilliz Learn. [5]
- ↑ «Mixture of Experts (MoE) vs Dense LLMs». Maximilian Schwarzmüller's Blog. [6]
- ↑ «Understanding Mixture of Experts in Deep Learning». VE3. [7]
- ↑ 8.0 8.1 «Mixture of Experts Explained». Hugging Face Blog. [8]
- ↑ «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [9]
- ↑ «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». OpenReview. [10]
- ↑ «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». gopubby.com. [11]
- ↑ «Switch Transformers: Scaling to Trillion Parameter Models with...». cse.ust.hk. [12]
- ↑ «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». arXiv. [13]
- ↑ «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». Preprints.org. [14]
- ↑ «Mixtral of Experts». arXiv. [15]
- ↑ «A Survey on Inference Optimization Techniques for Mixture of Experts Models». arXiv. [16]
- ↑ «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». arXiv. [17]
- ↑ «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». Semantic Scholar. [18]
- ↑ «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». Gate.io Learn. [19]
- ↑ «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». arXiv. [20]