Mixture-of-Experts (MoE) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixture-of-Experts (MoE) (انگریزی سے — «ماہرین کا امتزاج») — یہ neural networks کا ایک architecture ہے، جو مشروط حسابات کے اصول اور «تقسیم کرو اور حکومت کرو» کی paradigm پر مبنی ہے۔ ایک واحد یکجا («گھنی») model کے استعمال کے بجائے، جس میں تمام parameters ہر input signal کی پروسیسنگ کے لیے استعمال ہوتے ہیں، MoE architecture کام کو ٹکڑوں میں تقسیم کرتی ہے اور اسے خصوصی sub-networks کے ایک ذیلی مجموعے کو سونپ دیتی ہے، جنہیں «ماہرین» کہا جاتا ہے۔ ایک خاص component، routing network (gating network یا router)، متحرک طور پر یہ طے کرتا ہے کہ کون سے ماہرین ہر مخصوص input token کی پروسیسنگ کریں گے[1][2]۔

یہ طریقہ کار انتہائی بڑی تعداد میں parameters (سینکڑوں ارب یا حتیٰ کہ کھرب) والے models بنانے کی اجازت دیتا ہے، جبکہ inference کے مرحلے پر حسابی لاگت (FLOPs) کو نمایاں طور پر چھوٹے گھنے models کی سطح پر برقرار رکھتا ہے[3]۔ اس کی بدولت MoE جدید بڑے لسانی models (LLM) کو scale کرنے کے لیے ایک کلیدی ٹیکنالوجی بن گئی ہے اور Mixtral 8x7B، Grok-1 اور، وسیع پیمانے پر مشہور خیال کے مطابق، GPT-4 جیسے جدید ترین نظاموں میں استعمال ہوتی ہے[1]۔

کلیدی اصول: مشروط حسابات اور Sparsity

MoE کا بنیادی طریقہ کار مشروط حسابات (conditional computation) ہے۔ گھنے models کے برعکس، جہاں تمام parameters کسی بھی token کی پروسیسنگ میں فعال ہوتے ہیں، MoE models input data کے مطابق اپنے parameters کا صرف ایک چھوٹا حصہ فعال کرتے ہیں۔ یہ عمل activations میں sparsity (sparsity in activation) پیدا کرتا ہے، جو روایتی architectures سے بنیادی فرق ہے[4]۔

یہ طریقہ کار مندرجہ ذیل کی اجازت دیتا ہے:

  • Model کی گنجائش کو scale کرنا: Parameters کی کل تعداد (اور اس لیے model کے «علم») کو حسابی بوجھ میں متناسب اضافے کے بغیر نمایاں طور پر بڑھایا جا سکتا ہے۔
  • کارکردگی بہتر بنانا: Model ہر token پر کم حسابات انجام دیتا ہے، جس سے inference تیز ہوتی ہے اور ایک مقررہ حسابی بجٹ میں تربیت کی لاگت کم ہوتی ہے[5]۔

یوں، MoE رکاوٹ کو حسابی قوت سے ہٹا کر میموری کی ضروریات (VRAM) کی طرف منتقل کر دیتی ہے، کیونکہ تمام ماہرین کے تمام parameters کو میموری میں لوڈ کرنا ضروری ہوتا ہے، چاہے ہر لمحے ان کا صرف ایک چھوٹا حصہ ہی استعمال ہو[6]۔

MoE Architecture کے اجزاء

1. ماہر Sub-networks (Experts)

ماہرین عام طور پر آزاد neural networks ہوتے ہیں۔ transformer architecture کے تناظر میں، MoE layers عموماً گھنے Fully-Connected blocks (Feed-Forward Networks, FFN) کی جگہ لے لیتے ہیں، اور ہر ماہر بذات خود ایک FFN ہوتا ہے[1]۔ تربیت کے دوران ہر ماہر مخصوص شعبوں میں «مہارت» پیدا کر سکتا ہے — مثلاً، ایک syntax میں مہارت رکھ سکتا ہے، دوسرا کسی خاص علمی شعبے کے حقائق میں، اور تیسرا کسی خاص زبان یا اسلوب میں[7]۔

2. کنٹرول کرنے والا نیٹ ورک (Gating Network / Router)

روٹر نیٹ ورک ایک چھوٹا لیکن انتہائی اہم component ہے، جو ذہانت سے کام تقسیم کرتا ہے۔ ہر input token کے لیے router اسکور (وزن) کا حساب لگاتا ہے، یہ طے کرتے ہوئے کہ کون سے ماہرین اس کی پروسیسنگ کے لیے سب سے زیادہ موزوں ہیں۔ routing کا فیصلہ متحرک اور سیاق و سباق پر منحصر ہوتا ہے[8]۔

سب سے عام حکمت عملی Top-K routing ہے، جس میں token کی پروسیسنگ کے لیے سب سے زیادہ اسکور والے K ماہرین کا انتخاب کیا جاتا ہے۔ K کی قدر عام طور پر کم ہوتی ہے (مثلاً 1 یا 2)، جو ہی sparsity کو یقینی بناتی ہے۔

3. آؤٹ پٹ ڈیٹا کو یکجا کرنا

جب منتخب K ماہرین token کو پروسیس کر لیتے ہیں، تو ان کے انفرادی آؤٹ پٹس کو MoE layer کا حتمی نتیجہ بنانے کے لیے یکجا کیا جاتا ہے۔ یہ عام طور پر وزن دار جمع کے ذریعے کیا جاتا ہے، جہاں اوزان router کے تیار کردہ normalized اسکور ہوتے ہیں[1]۔

MoE کا ارتقاء

MoE کا تصور پہلی بار 1991 میں Robert Jacobs، Geoffrey Hinton اور Michael Jordan کے مقالے «مقامی ماہرین کا موافق امتزاج» میں پیش کیا گیا تھا[3]۔ تاہم، حسابی حدود اور تربیت کی پیچیدگی کی وجہ سے یہ خیال deep learning کے دور تک وسیع پیمانے پر مقبول نہ ہو سکا۔

Transformer architecture کی آمد سے ایک بڑی پیش رفت ہوئی۔ 2010-2015 کے دوران مشروط حسابات پر تحقیق (Yoshua Bengio اور دیگر) نے نظریاتی بنیاد فراہم کی، اور Shazeer وغیرہ (2017) کے کام نے MoE کو 137 ارب پیرامیٹر والے LSTM model تک scale کرنے کا امکان ظاہر کیا[8]۔

MoE کی جدید بحالی Google کے Switch Transformer (2021) سے جڑی ہے، جو سادہ لیکن مؤثر Top-1 routing استعمال کرتے ہوئے 1.6 کھرب parameters تک scale ہوا[9]۔ 2023 میں Mistral AI کے اوپن سورس ماڈل Mixtral 8x7B کی کامیابی نے MoE کو اعلیٰ کارکردگی والے LLM بنانے کے لیے ایک سرکردہ architecture کے طور پر حتمی طور پر ثابت کر دیا[1]۔

چیلنجز اور اصلاح کے طریقے

بوجھ کی برابری

MoE کا ایک اہم چیلنج بوجھ کا عدم توازن ہے، جب router مسلسل انہی «مقبول» ماہرین کا انتخاب کرتا ہے جبکہ دوسرے کم استعمال ہوتے رہتے ہیں۔ یہ غیر مؤثر تربیت اور «ماہرین کے انہدام» کا باعث بنتا ہے۔

  • معاون نقصان کے فنکشن (Auxiliary Loss): روایتی طریقہ، جو tokens کی غیر مساوی تقسیم کے لیے بنیادی نقصان کے فنکشن میں «جرمانہ» شامل کرتا ہے۔ اگرچہ یہ توازن میں مدد کرتا ہے، لیکن یہ طریقہ «مداخلتی gradients» پیدا کر سکتا ہے، جس سے مجموعی کارکردگی متاثر ہوتی ہے[10]۔
  • بغیر نقصان کے برابری (Loss-Free Balancing): ایک نیا طریقہ، جو router کے اسکور میں bias متحرک طور پر لاگو کرتا ہے، اسے بنیادی تربیت کے کام میں مداخلت کیے بغیر زیادہ متوازن فیصلوں کی طرف دھکیلتا ہے[11]۔
  • ماہر کے انتخاب پر مبنی routing (Expert Choice Routing): ایک متبادل طریقہ، جس میں tokens ماہرین کا انتخاب نہیں کرتے بلکہ ہر ماہر batch سے اپنے `top-k` tokens خود منتخب کرتا ہے۔ یہ کامل توازن کی ضمانت دیتا ہے، لیکن نفاذ میں زیادہ پیچیدہ ہو سکتا ہے[1]۔

Fine-tuning اور Quantization

  • Fine-tuning: تاریخی طور پر MoE models بڑی تعداد میں parameters کی وجہ سے overfitting کا شکار تھے۔ اس مسئلے کو کم کرنے کے لیے «expert dropout» جیسے طریقے استعمال کیے جاتے ہیں[12]۔
  • Quantization: Model کا سائز کم کرنے اور inference تیز کرنے کے لیے weights کی عددی درستگی کو کم کرنا۔ MoE کے لیے یہ ماہرین کے درمیان عدم توازن کی وجہ سے ایک پیچیدہ کام ہے۔ MoEQuant جیسے طریقے ہر ماہر کے لیے متوازن calibration پر مبنی حل پیش کرتے ہیں[13]۔

نظامی اصلاح

MoE کی مؤثر تعیناتی کے لیے ایک جامع نظامی نقطہ نظر درکار ہے، جس میں شامل ہیں:

  • Parallelism کی حکمت عملیاں: Expert parallelism (ماہرین کو مختلف GPUs میں تقسیم کرنا)، model parallelism اور data parallelism[14]۔
  • خصوصی Kernels: مثلاً Mixtral کے لیے Megablocks، جو sparse آپریشنز کے لیے matrix multiplications کو optimize کرتے ہیں[15]۔
  • Hardware Co-design: ایسے hardware حل کی ترقی جو خصوصی طور پر MoE workloads کے لیے optimize ہوں۔

نمایاں MoE Models

نمایاں MoE Architectures کا موازنہ
Model تیار کنندہ Parameters کی کل تعداد فعال
Parameters
ماہرین کی
تعداد
منتخب ماہرین (k)
Switch Transformer C-2048 Google 1.6 کھرب ماہر کے سائز پر منحصر 2048 1
Mixtral 8x7B Mistral AI ~47 ارب ~13 ارب 8 2
Grok-1 xAI 314 ارب 86 ارب 8 2
GPT-4 (قیاساً) OpenAI >1 کھرب - 16 (قیاساً) 2 (قیاساً)
Qwen 2 MoE Alibaba 57-90 ارب 14 ارب 64 4 یا 8
DeepSeekMoE 16B DeepSeek-AI 16.4 ارب ~2.8 ارب 64 (2 فعال) 2 (6 میں سے)[16]

مختلف شعبوں میں اطلاق

اگرچہ MoE سب سے زیادہ LLM کے تناظر میں مشہور ہے، لیکن اس کا اطلاق قدرتی زبان کی پروسیسنگ تک محدود نہیں:

  • وقتی سلسلوں کی پیش گوئی: Time-MoE model پیش گوئی کے models کی pre-training کے لیے ایک scalable architecture پیش کرتا ہے[17]۔
  • کمزوریوں کا پتہ لگانا: MoEVD، MoE کو کمزوری کا پتہ لگانے کے کام کو CWE کی اقسام کے مطابق درجہ بندی میں تقسیم کرنے کے لیے استعمال کرتا ہے، جہاں ہر ماہر اپنی قسم میں مہارت رکھتا ہے[18]۔
  • Blockchain ٹیکنالوجیز کے ساتھ انضمام: MoE کو smart contracts کی اصلاح اور دھوکہ دہی کا پتہ لگانے میں استعمال کیا جاتا ہے، جہاں ماہرین مختلف transaction patterns کا تجزیہ کرتے ہیں[19]۔
  • Multimodal models: MoE کو مختلف modalities (متن، تصویر، آڈیو) میں مہارت رکھنے والے ماہرین کو یکجا کرنے کے لیے استعمال کیا جاتا ہے، جس سے زیادہ ہمہ جہت نظام تخلیق ہوتے ہیں[20]۔

حواشی

  1. 1.0 1.1 1.2 1.3 1.4 1.5 «Applying Mixture of Experts in LLM Architectures». NVIDIA Technical Blog. [1]
  2. «Mixture of Experts (MoE): A Big Data Perspective». arXiv. [2]
  3. 3.0 3.1 «Mixture-of-Experts (MoE): что это такое и как работает». LLM Studio. [3]
  4. «Serving Mixtral MoE Model». Friendli.ai Blog. [4]
  5. «What is Mixture of Experts (MoE)? How it Works and Use Cases». Zilliz Learn. [5]
  6. «Mixture of Experts (MoE) vs Dense LLMs». Maximilian Schwarzmüller's Blog. [6]
  7. «Understanding Mixture of Experts in Deep Learning». VE3. [7]
  8. 8.0 8.1 «Mixture of Experts Explained». Hugging Face Blog. [8]
  9. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [9]
  10. «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts». OpenReview. [10]
  11. «DeepSeek-V3 Explained: 3. Auxiliary-Loss-Free Load-Balancing». gopubby.com. [11]
  12. «Switch Transformers: Scaling to Trillion Parameter Models with...». cse.ust.hk. [12]
  13. «MoEQuant: Enhancing Quantization for Mixture-of-Experts...». arXiv. [13]
  14. «A Survey of Mixture of Experts Models: Architectures and Applications in Business and Finance». Preprints.org. [14]
  15. «Mixtral of Experts». arXiv. [15]
  16. «A Survey on Inference Optimization Techniques for Mixture of Experts Models». arXiv. [16]
  17. «Time-MoE: A Scalable and Unified Framework for Pre-training Time Series Foundation Models». arXiv. [17]
  18. «MoEVD: A Mixture of Experts-based Framework for Vulnerability Detection». Semantic Scholar. [18]
  19. «What a Decentralized Mixture-of-Experts (MoE) Is and How It Works». Gate.io Learn. [19]
  20. «LLaMA-MoE: Building Mixture-of-Experts from Open-source LLMs». arXiv. [20]