Mixture-of-Experts (MoE) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixture-of-Experts (MoE) (Engels voor «Mengsel van experts») — dit is een architectuur van neurale netwerken, gebaseerd op het principe van voorwaardelijke berekeningen en het paradigma «Verdeel en heers». In plaats van één monolithisch («dicht») model te gebruiken, waarbij alle parameters worden ingezet voor de verwerking van elk ingangssignaal, decomponseert de MoE-architectuur de taak door deze te delegeren aan een deelverzameling van gespecialiseerde subnetwerken, die «experts» worden genoemd. Een speciaal onderdeel, het routeringsnetwerk (gating network of router), bepaalt dynamisch welke experts elk afzonderlijk ingangstoken verwerken[1][2].

Deze aanpak maakt het mogelijk modellen te bouwen met een enorm aantal parameters (honderden miljarden of zelfs biljoenen), terwijl de rekenkosten (FLOPs) tijdens de inferentiefase op het niveau van aanzienlijk kleinere dichte modellen blijven[3]. Dankzij dit is MoE een sleuteltechnologie geworden voor de schaalvergroting van moderne grote taalmodellen (LLM) en wordt het gebruikt in geavanceerde systemen als Mixtral 8x7B, Grok-1 en, volgens algemeen verbreide opvattingen, GPT-4[1].

Ключевой принцип: условные вычисления и разреженность - Kernprincipe: voorwaardelijke berekeningen en ijlheid

Het fundamentele mechanisme van MoE is voorwaardelijke berekening (conditional computation). In tegenstelling tot dichte modellen, waarbij alle parameters actief zijn bij de verwerking van elk token, activeren MoE-modellen slechts een klein deel van hun parameters afhankelijk van de invoergegevens. Dit proces leidt tot ijlheid in activaties (sparsity in activation), wat het voornaamste verschil is met traditionele architecturen[4].

Deze aanpak maakt het mogelijk:

  • De capaciteit van het model te schalen: Het totale aantal parameters (en daarmee de «kennis» van het model) kan aanzienlijk worden vergroot zonder een evenredige toename van de rekenbelasting.
  • De efficiëntie te verhogen: Het model voert minder berekeningen uit per token, wat leidt tot snellere inferentie en lagere trainingskosten bij een vast rekenbudget[5].

Zo verschuift MoE het knelpunt van rekenkracht naar geheugenvereisten (VRAM), omdat alle parameters van alle experts in het geheugen moeten worden geladen, ook al wordt op elk moment slechts een klein deel ervan gebruikt[6].

Componenten van de MoE-architectuur

1. Expertsubnetwerken (Experts)

Experts zijn doorgaans onafhankelijke neurale netwerken. In de context van de transformer-architectuur vervangen MoE-lagen gewoonlijk de dichte volledig verbonden blokken (Feed-Forward Networks, FFN), en elke expert is op zichzelf een FFN[1]. Tijdens het trainen kan elke expert «competentie» ontwikkelen op bepaalde gebieden — zo kan de ene zich specialiseren in syntaxis, de andere in feiten uit een bepaald kennisdomein, en een derde in een specifieke taal of stijl[7].

2. Sturingsnetwerk (Gating Network / Router)

Het routeringsnetwerk is een klein maar cruciaal onderdeel dat de intelligente taakverdeling uitvoert. Voor elk ingangstoken berekent de router scores (gewichten) om te bepalen welke experts het meest relevant zijn voor de verwerking ervan. De routeringsbeslissing is dynamisch en contextafhankelijk[8].

De meest gangbare strategie is Top-K-routering, waarbij voor de verwerking van een token de K experts met de hoogste scores worden geselecteerd. De waarde van K is doorgaans klein (bijvoorbeeld 1 of 2), wat de ijlheid garandeert.

3. Samenvoeging van uitvoergegevens

Nadat de geselecteerde K experts het token hebben verwerkt, worden hun afzonderlijke uitvoers samengevoegd om het eindresultaat van de MoE-laag te vormen. Dit gebeurt doorgaans door gewogen sommering, waarbij de gewichten de genormaliseerde scores zijn die door de router zijn gegenereerd[1].

Evolutie van MoE

Het concept MoE werd voor het eerst voorgesteld in 1991 in een artikel van Robert Jacobs, Geoffrey Hinton en Michael Jordan, getiteld «Adaptive Mixtures of Local Experts»[3]. Vanwege rekenbeperkingen en de complexiteit van het trainen verspreidde het idee zich echter niet breed totdat het tijdperk van deep learning aanbrak.

De doorbraak vond plaats met de komst van de Transformer-architectuur. Onderzoek in de periode 2010–2015 naar voorwaardelijke berekeningen (Yoshua Bengio e.a.) legde de theoretische basis, en het werk van Shazeer e.a. (2017) toonde aan dat MoE opgeschaald kon worden tot een LSTM-model met 137 miljard parameters[8].

De hedendaagse heropleving van MoE is verbonden met het Switch Transformer-model van Google (2021), dat opschaalde tot 1,6 biljoen parameters met behulp van eenvoudige maar effectieve Top-1-routering[9]. Het succes van het open model Mixtral 8x7B van Mistral AI in 2023 bevestigde MoE definitief als een van de toonaangevende architecturen voor het bouwen van krachtige LLM's[1].

Uitdagingen en optimalisatiemethoden

Taakverdeling

Een van de belangrijkste uitdagingen van MoE is onevenwichtige taakverdeling, waarbij de router consequent dezelfde «populaire» experts selecteert, terwijl andere onderbenut blijven. Dit leidt tot inefficiënt trainen en «expertinstorting».

  • Hulpverliesfuncties (Auxiliary Loss): Een traditionele methode die een «straf» voor ongelijkmatige tokenverdeling toevoegt aan de hoofdverliesfunctie. Hoewel dit de balancering verbetert, kan deze aanpak «storingsgradiënten» introduceren die de algehele prestaties verslechteren[10].
  • Verliesvrije balancering (Loss-Free Balancing): Een nieuwere aanpak die dynamisch een verschuiving (bias) toepast op de routeringsscores, waardoor de router naar evenwichtigere beslissingen wordt gestuurd zonder in te grijpen in de hoofdtrainstaak[11].
  • Routering op basis van expertkeuze (Expert Choice Routing): Een alternatieve aanpak waarbij niet de tokens de experts kiezen, maar elke expert zelf de `top-k` tokens uit een batch selecteert. Dit garandeert een perfecte balancering, maar kan moeilijker te implementeren zijn[1].

Fine-tuning en kwantisatie

  • Fine-tuning: Historisch gezien waren MoE-modellen gevoelig voor overfitting vanwege het grote aantal parameters. Om dit te verminderen worden methoden zoals «expert dropout» toegepast[12].
  • Kwantisatie (Quantization): Het verlagen van de numerieke precisie van gewichten om de modelgrootte te verkleinen en inferentie te versnellen. Voor MoE is dit een complexe taak vanwege de onevenwichtigheid tussen experts. Methoden als MoEQuant bieden oplossingen op basis van gebalanceerde kalibratie per expert[13].

Systeemoptimalisatie

Effectieve inzet van MoE vereist een integrale systeemaanpak, waaronder:

  • Parallelisatiestrategieën: Expertparallelisme (verdeling van experts over verschillende GPU's), modelparallelisme en dataparallelisme[14].
  • Gespecialiseerde kernels (Kernels): Bijvoorbeeld Megablocks voor Mixtral, die matrixvermenigvuldigingen optimaliseren voor ijle bewerkingen[15].
  • Gezamenlijk hardwareontwerp (Hardware Co-design): De ontwikkeling van hardwareoplossingen die specifiek zijn geoptimaliseerd voor MoE-werkbelastingen.

Toonaangevende MoE-modellen

Vergelijking van opvallende MoE-architecturen
Model Ontwikkelaar Totaal aantal
parameters
Actieve
parameters
Aantal
experts
Geselecteerde
experts (k)
Switch Transformer C-2048 Google 1,6 biljoen Afhankelijk van expertgrootte 2048 1
Mixtral 8x7B Mistral AI ~47 mrd ~13 mrd 8 2
Grok-1 xAI 314 mrd 86 mrd 8 2
GPT-4 (vermoedelijk) OpenAI >1 biljoen - 16 (verm.) 2 (verm.)
Qwen 2 MoE Alibaba 57–90 mrd 14 mrd 64 4 of 8
DeepSeekMoE 16B DeepSeek-AI 16,4 mrd ~2,8 mrd 64 (2 actief) 2 (van 6)[16]

Toepassingen in verschillende domeinen

Hoewel MoE het meest bekend is in de context van LLM's, beperkt de toepassing zich niet tot de verwerking van natuurlijke taal:

  • Tijdreeksvoorspelling: Het Time-MoE-model biedt een schaalbare architectuur voor het vooraf trainen van voorspellingsmodellen[17].
  • Detectie van kwetsbaarheden: MoEVD gebruikt MoE voor het opsplitsen van de taak van kwetsbaarheidsdetectie in classificatie op basis van CWE-typen, waarbij elke expert gespecialiseerd is in een eigen type[18].
  • Integratie met blockchaintechnologie: MoE wordt ingezet bij de optimalisatie van smart contracts en fraudedetectie, waarbij experts verschillende transactiepatronen analyseren[19].
  • Multimodale modellen: MoE wordt gebruikt om experts te combineren die gespecialiseerd zijn in verschillende modaliteiten (tekst, afbeelding, audio), waardoor meer veelzijdige systemen ontstaan[20].

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 «Applying Mixture of Experts in LLM Architectures». NVIDIA Technical Blog. [1]
  2. «Mixture of Experts (MoE): A Big Data Perspective». arXiv. [2]
  3. 3.0 3.1 «Mixture-of-Experts (MoE): что это такое и как работает». LLM Studio. [3]
  4. «Serving Mixtral MoE Model». Friendli.ai Blog. [4]
  5. «What is Mixture of Experts (MoE)? How it Works and Use Cases». Zilliz Learn. [5]
  6. «Mixture of Experts (MoE) vs Dense LLMs». Maximilian Schwarzmüller's Blog. [6]
  7. «Understanding Mixture of Experts in Deep Learning». VE3. [7]
  8. 8.0 8.1 «Mixture of Experts Explained». Hugging Face Blog. [8]
  9. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [9]
  10. «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». OpenReview. [10]
  11. «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». gopubby.com. [11]
  12. «Switch Transformers: Scaling to Trillion Parameter Models with...». cse.ust.hk. [12]
  13. «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». arXiv. [13]
  14. «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». Preprints.org. [14]
  15. «Mixtral of Experts». arXiv. [15]
  16. «A Survey on Inference Optimization Techniques for Mixture of Experts Models». arXiv. [16]
  17. «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». arXiv. [17]
  18. «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». Semantic Scholar. [18]
  19. «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». Gate.io Learn. [19]
  20. «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». arXiv. [20]