DeepSeek (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — مصنوعی ذہانت کے شعبے میں ایک چینی تحقیقاتی کمپنی ہے جو بڑے لسانی ماڈلز (LLM) اور ملٹی موڈل سسٹمز تیار کرتی ہے۔ کمپنی کو اپنے ماڈلز کے weights کی کھلی تقسیم اور ان کی اعلیٰ معاشی کفاءت کی وجہ سے وسیع شہرت ملی، جس نے 2024 کے آخر اور 2025 کے اوائل میں AI مارکیٹ میں قیمتوں کی تجدید کو جنم دیا۔[1]

تاریخ

DeepSeek کے بانی کاروباری شخصیت اور ہیج فنڈ High‑Flyer کے شریک بانی لیانگ وین فینگ ہیں۔ 2023 کے موسمِ بہار میں High‑Flyer نے اپنے AI تحقیقاتی شعبے کو الگ کیا، جو اسی سال مئی میں DeepSeek AI کمپنی بن گیا۔ 2025 تک عملے کی تعداد تقریباً 160 افراد تک پہنچ گئی۔[2] کمپنی نے ابتدا سے ہی کھلے پن کی پالیسی اختیار کی — permissive لائسنسوں کے تحت weights («open‑weight») شائع کرنا اور AGI کی بنیادی تحقیق پر توجہ مرکوز کرنا۔

زیادہ تر اسٹارٹ اَپس کے برعکس، DeepSeek کی مالی کفالت High-Flyer کے R&D بجٹ سے ہوتی ہے، جو بانی کے بقول فوری منافع کے بجائے طویل مدتی اہداف پر توجہ دینے کا موقع فراہم کرتی ہے۔[3]

جنوری 2025 میں ماڈل DeepSeek-R1 کے اجراء کے بعد کمپنی نے ٹیکنالوجی اور مالیاتی برادری میں نمایاں ہلچل مچا دی۔ یہ دعویٰ کہ GPT-4 کے ہم پلہ ماڈل کی تربیت $6 ملین سے کم میں ہوئی (جبکہ GPT-4 کے لیے $100 ملین سے زیادہ کا اندازہ ہے) نے ٹیکنالوجی کمپنیوں کے حصص میں بڑی گراوٹ پیدا کی اور صنعت کو «زیادہ کمپیوٹیشن = بہتر ماڈل» کے تصور پر نظرثانی پر مجبور کیا۔[4]

آرکیٹیکچرل خصوصیات

Mixture‑of‑Experts (DeepSeekMoE)
DeepSeek کے زیادہ تر فلیگ شپ ماڈلز Mixture of Experts (MoE) آرکیٹیکچر استعمال کرتے ہیں۔ «گھنے» ماڈلز کے برعکس جہاں سوال کی پروسیسنگ کے دوران تمام پیرامیٹرز فعال ہو جاتے ہیں، MoE ماڈلز میں ہر token کے لیے صرف چند مخصوص ذیلی نیٹ ورکس («ماہرین») کام کرتے ہیں۔ DeepSeek نے MoE کا اپنا نفاذ تیار کیا جس میں «مشترک» ماہرین، باریک بینی سے تقسیم، اور معاون نقصانات کے بغیر بوجھ کا توازن شامل ہے — اس سے سینکڑوں ارب پیرامیٹرز میں سے صرف ایک حصے کو فعال کرنا اور کمپیوٹیشنل اخراجات کو نمایاں طور پر کم کرنا ممکن ہوتا ہے۔[5]
Multi‑Head Latent Attention (MLA)
KV cache کو latent vector تک سکیڑنے کا طریقہ جو 93 فیصد تک میموری بچاتا ہے اور 128,000 tokens تک کی context windows استعمال کرنے کی اجازت دیتا ہے۔ یہ ٹیکنالوجی طویل متون کے ساتھ مؤثر کام کے لیے کلیدی اہمیت رکھتی ہے۔[6]
FP8 training اور Multi‑Token Prediction
V3 فیملی کے ماڈلز میں ملا جلا درستگی FP8 (8-bit floating point numbers) اور بیک وقت کئی tokens کی پیش گوئی استعمال کی جاتی ہے، جو training اور inference کے عمل کو تیز کرتی ہے۔[7]

ماڈلز کا خاندان

  • DeepSeek LLM — 7 اور 67 ارب پیرامیٹرز کے بنیادی ماڈلز (2023)، پہلی دو لسانی (EN/ZH) ریلیز جس نے کئی کاموں میں LLaMA‑2 70B کو پیچھے چھوڑا۔[8]
  • DeepSeek‑Coder (2023) — پروگرامنگ کے لیے ماڈلز کی قطار (1.3 – 33 ارب) اور اس کی توسیع Coder‑V2 (16 ارب / 236 ارب MoE، 128K context، 338 کوڈنگ زبانیں)۔[9]
  • DeepSeek‑V2 (مئی 2024) — 236 ارب (21 ارب فعال) MoE‑LLM با MLA؛ 8.1 ٹریلین tokens پر تربیت یافتہ۔[10]
  • DeepSeek‑V3 (دسمبر 2024) — 671 ارب (37 ارب فعال)؛ تربیت ≈28 لاکھ GPU گھنٹے Nvidia H800 پر تقریباً $5.5 ملین لاگت سے۔[11]
  • DeepSeek‑R1 (جنوری 2025) — منطقی استدلال (reasoning) کے ماڈلز کی قطار؛ R1‑0528 ورژن AIME 2025 اور LiveCodeBench پر OpenAI o3 کے قریب پہنچ گیا۔[12]
  • DeepSeek‑VL / VL2 — ملٹی موڈل VL ماڈلز (4.5 ارب تک فعال) بمعہ 1024×1024 تصاویر کی متحرک موزیک پروسیسنگ۔[13]
  • DeepSeek‑Math 7B — خصوصی ماڈل، benchmark MATH پر 51.7 فیصد درستگی؛ GPT‑4 کے قریب۔[14]
  • DeepSeek‑Prover‑V2 — Lean 4 میں نظریات کے اثبات کے لیے 671 ارب MoE؛ miniF2F پر 63.5 فیصد۔
  • Distilled R1 ماڈلز — Llama اور Qwen بیسز پر 1.5 سے 70 ارب پیرامیٹرز کے کھلے ورژنز۔[15]

اہم ریلیزوں کی تاریخی ترتیب

تاریخ ریلیز اور اہم خصوصیات
2 نومبر 2023 DeepSeek‑Coder v1: کوڈ کے لیے پہلے open‑weight ماڈلز۔
29 نومبر 2023 DeepSeek LLM 7B/67B: دو لسانی ماڈل، 2 ٹریلین tokens پر تربیت یافتہ۔
11 جنوری 2024 DeepSeek‑MoE 16B: MoE آرکیٹیکچر کا آغاز۔
6 فروری 2024 DeepSeek‑Math 7B: ریاضی کے لیے خصوصی ماڈل (MATH پر 51.7 فیصد)۔
6 مئی 2024 DeepSeek‑V2 236B: MLA اور MoE آرکیٹیکچرز کا نفاذ۔
17 جون 2024 DeepSeek‑Coder‑V2: 128K context، 338 پروگرامنگ زبانوں کی معاونت۔
13 دسمبر 2024 DeepSeek‑VL2: MoE پر مبنی ملٹی موڈل ماڈل۔
27 دسمبر 2024 DeepSeek‑V3 671B: فلیگ شپ ماڈل، $6 ملین سے کم میں تربیت یافتہ۔
20 جنوری 2025 DeepSeek‑R1 / R1‑Zero: Reinforcement Learning سے تربیت یافتہ استدلالی ماڈلز۔
27 جنوری 2025 Janus‑Pro: تصویر سازی کا ماڈل جو DALL‑E 3 سے بہتر ہے۔

کارکردگی اور benchmarks

  • DeepSeek‑V3 نے Llama 3.1 اور Qwen 2.5 کو پیچھے چھوڑا اور MMLU اور GPQA‑Diamond پر GPT‑4 کے قریب پہنچ گیا۔[16]
  • DeepSeek‑Coder‑V2 نے Arena‑Hard پر 72.9 فیصد حاصل کیا — GPT‑4o کے برابر اور Claude‑3.5‑Sonnet کے سوا تمام کھلے ماڈلز سے بہتر۔[17]
  • DeepSeek‑Math 7B — MATH پر 51.7 فیصد، جو دس گنا چھوٹے سائز کے باوجود Gemini‑Ultra کے قریب ہے۔[18]
  • R1‑Zero نے صرف Reinforcement Learning تربیت کے ذریعے AIME 2024 pass@1 کا نتیجہ 15.6 فیصد سے 71 فیصد تک بڑھا دیا۔[19]

لائسنسنگ اور open‑source

زیادہ تر ماڈلز MIT یا Apache 2.0 لائسنس کے تحت تقسیم کیے جاتے ہیں جو تجارتی استعمال کی اجازت دیتے ہیں۔ کمپنی Hugging Face اور GitHub پر weights شائع کرتی ہے، تاہم مکمل datasets اور training pipelines بند رکھتی ہے («open weight, but not full open source»)۔

صنعت پر اثرات

  • R1 کے اجراء نے «$6 ملین میں GPT‑4 کلاس ماڈل» کی خبروں کے پس منظر میں ایک ہی دن میں NVIDIA، Microsoft اور دیگر کمپنیوں کے حصص میں بڑی گراوٹ پیدا کی۔[20]
  • برآمدی پابندیوں کے باوجود Nvidia H800 چپس پر کامیاب تربیت کے مظاہرے نے امریکی پابندیوں کی افادیت پر بحث کو تیز کیا اور چینی AI accelerators (مثلاً Huawei Ascend 910B) کی ترقی کو تقویت دی۔

تنقید اور حدود

  • سلامتی: HarmBench ٹیسٹ میں R1 ماڈل نے 100 فیصد ناپسندیدہ سوالات («jailbreak») کو گزرنے دیا۔
  • سیاسی سنسرشپ: chat ورژنز چینی حکومت کے لیے «حساس» موضوعات کو فلٹر کرتے ہیں (1989 کے تیانان مین چوک کے واقعات، تائیوان کی حیثیت وغیرہ)۔
  • ڈیٹا ذخیرہ: چین میں سرورز پر صارفین کا ڈیٹا محفوظ کرنا GDPR اور اسی طرح کے قانونی نظاموں کے پابند مغربی اداروں کے لیے API کے استعمال کو محدود کرتا ہے۔[21]

مآخذ

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

حواشی

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

یہ بھی دیکھیں

  • OpenAI کے بڑے لسانی ماڈلز
  • Mixture-of-Experts