DeepSeek (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — یک شرکت پژوهشی چینی در حوزه هوش مصنوعی است که مدل‌های زبانی بزرگ (LLM) و سیستم‌های چندوجهی توسعه می‌دهد. این شرکت به لطف انتشار آزاد وزن‌های مدل‌هایش و کارایی اقتصادی بالای آن‌ها شهرت گسترده‌ای یافت، که در اواخر ۲۰۲۴ و ابتدای ۲۰۲۵ منجر به تعدیل قیمت‌ها در بازار AI شد.[1]

تاریخچه

بنیان‌گذار DeepSeek کارآفرین و هم‌مؤسس صندوق پوشش ریسک High‑Flyer، لیانگ وِن‌فِنگ است. در بهار ۲۰۲۳، High‑Flyer بخش پژوهشی AI خود را جدا کرد که در می همان سال به شرکت DeepSeek AI تبدیل شد. تا سال ۲۰۲۵ تعداد کارکنان به حدود ۱۶۰ نفر رسید.[2] از همان روزهای ابتدایی، شرکت رویکرد شفافیت را اعلام کرد — انتشار وزن‌ها («open‑weight») تحت مجوزهای آزاد و تمرکز بر پژوهش‌های بنیادی AGI.

برخلاف اکثر استارتاپ‌ها، DeepSeek از بودجه R&D صندوق High-Flyer تأمین مالی می‌شود که به گفته بنیان‌گذار، این امر اجازه می‌دهد بر اهداف بلندمدت تمرکز شود، نه بر کسب درآمد آنی.[3]

این شرکت در ژانویه ۲۰۲۵ با انتشار مدل DeepSeek-R1 سروصدای زیادی در جامعه فناوری و مالی به پا کرد. اعلام اینکه آموزش مدلی هم‌تراز با GPT-4 کمتر از ۶ میلیون دلار هزینه داشته (در مقایسه با برآوردهای بیش از ۱۰۰ میلیون دلار برای GPT-4)، سبب سقوط سهام غول‌های فناوری شد و صنعت را مجبور کرد پارادایم «محاسبات بیشتر = مدل بهتر» را بازنگری کند.[4]

ویژگی‌های معماری

Mixture‑of‑Experts (DeepSeekMoE)
اکثر مدل‌های پرچم‌دار DeepSeek از معماری ترکیب متخصصان (MoE) استفاده می‌کنند. برخلاف مدل‌های «متراکم» که در پردازش هر درخواست تمام پارامترها فعال می‌شوند، در مدل‌های MoE برای هر token تنها بخش کوچکی از زیرشبکه‌های تخصصی («متخصصان») فعال می‌شوند. DeepSeek پیاده‌سازی اختصاصی MoE با متخصصان «مشترک»، تقسیم‌بندی ریزدانه و توازن بار بدون اتلاف کمکی توسعه داده که امکان فعال‌سازی تنها بخشی از صدها میلیارد پارامتر را فراهم کرده و هزینه‌های محاسباتی را به شدت کاهش می‌دهد.[5]
Multi‑Head Latent Attention (MLA)
روشی برای فشرده‌سازی KV‑cache به یک بردار پنهان که تا ۹۳٪ حافظه صرفه‌جویی می‌کند و استفاده از پنجره‌های زمینه تا ۱۲۸٬۰۰۰ token را ممکن می‌سازد. این فناوری برای کار کارآمد با متون طولانی کلیدی است.[6]
FP8 training و Multi‑Token Prediction
در مدل‌های خانواده V3 از دقت مختلط FP8 (اعداد ممیز شناور ۸ بیتی) و پیش‌بینی همزمان چندین token استفاده می‌شود که فرآیندهای آموزش و استنتاج را تسریع می‌کند.[7]

خانواده مدل‌ها

  • DeepSeek LLM — مدل‌های پایه با ۷ و ۶۷ میلیارد پارامتر (۲۰۲۳)، اولین نسخه دوزبانه (EN/ZH) که در برخی وظایف از LLaMA‑2 70B پیشی گرفت.[8]
  • DeepSeek‑Coder (۲۰۲۳) — مجموعه مدل‌های برنامه‌نویسی (۱.۳ تا ۳۳ میلیارد) و توسعه آن Coder‑V2 (۱۶ میلیارد / ۲۳۶ میلیارد MoE، زمینه ۱۲۸K، ۳۳۸ زبان برنامه‌نویسی).[9]
  • DeepSeek‑V2 (می ۲۰۲۴) — MoE‑LLM با ۲۳۶ میلیارد (۲۱ میلیارد فعال) با MLA؛ روی ۸.۱ تریلیون token آموزش دیده.[10]
  • DeepSeek‑V3 (دسامبر ۲۰۲۴) — ۶۷۱ میلیارد (۳۷ میلیارد فعال)؛ آموزش ≈۲.۸ میلیون ساعت GPU روی Nvidia H800 با هزینه ≈۵.۵ میلیون دلار.[11]
  • DeepSeek‑R1 (ژانویه ۲۰۲۵) — خط مدل‌های استدلال منطقی (reasoning)؛ نسخه R1‑0528 در AIME 2025 و LiveCodeBench به OpenAI o3 نزدیک شد.[12]
  • DeepSeek‑VL / VL2 — مدل‌های چندوجهی VL (تا ۴.۵ میلیارد فعال) با پردازش موزاییکی پویای تصاویر ۱۰۲۴×۱۰۲۴.[13]
  • DeepSeek‑Math 7B — مدل تخصصی با دقت ۵۱.۷٪ در benchmark ریاضی MATH؛ نزدیک به GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — MoE با ۶۷۱ میلیارد پارامتر برای اثبات قضایا در Lean 4؛ ۶۳.۵٪ در miniF2F.
  • مدل‌های تقطیر‌شده R1 — نسخه‌های آزاد با ۱.۵ تا ۷۰ میلیارد پارامتر بر پایه Llama و Qwen.[15]

جدول زمانی انتشارهای کلیدی

تاریخ انتشار و ویژگی‌های کلیدی
2 ноя 2023 DeepSeek‑Coder v1: اولین مدل‌های open‑weight برای کدنویسی.
29 ноя 2023 DeepSeek LLM 7B/67B: مدل دوزبانه آموزش‌دیده روی ۲ تریلیون token.
11 янв 2024 DeepSeek‑MoE 16B: رونمایی از معماری MoE.
6 фев 2024 DeepSeek‑Math 7B: مدل تخصصی ریاضی (۵۱.۷٪ در MATH).
6 мая 2024 DeepSeek‑V2 236B: معرفی معماری‌های MLA و MoE.
17 июн 2024 DeepSeek‑Coder‑V2: زمینه ۱۲۸K، پشتیبانی از ۳۳۸ زبان برنامه‌نویسی.
13 дек 2024 DeepSeek‑VL2: مدل چندوجهی مبتنی بر MoE.
27 дек 2024 DeepSeek‑V3 671B: مدل پرچم‌دار آموزش‌دیده با کمتر از ۶ میلیون دلار.
20 янв 2025 DeepSeek‑R1 / R1‑Zero: مدل‌های استدلال آموزش‌دیده با Reinforcement Learning.
27 янв 2025 Janus‑Pro: مدل تولید تصویر که از DALL‑E 3 پیشی می‌گیرد.

عملکرد و benchmark‌ها

  • DeepSeek‑V3 از Llama 3.1 و Qwen 2.5 پیشی گرفت و در MMLU و GPQA‑Diamond به سطح GPT‑4 نزدیک شد.[16]
  • DeepSeek‑Coder‑V2 در Arena‑Hard امتیاز ۷۲.۹٪ کسب کرد — هم‌تراز با GPT‑4o و برتر از تمام مدل‌های آزاد به جز Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — ۵۱.۷٪ در MATH، که با اندازه‌ای ۱۰ برابر کوچک‌تر به Gemini‑Ultra نزدیک است.[18]
  • R1‑Zero نتیجه AIME 2024 pass@1 را تنها از طریق آموزش RL از ۱۵.۶٪ به ۷۱٪ افزایش داد.[19]

مجوزدهی و open‑source

اکثر مدل‌ها تحت مجوز MIT یا Apache 2.0 توزیع می‌شوند که استفاده تجاری را مجاز می‌دانند. شرکت وزن‌ها را در Hugging Face و GitHub منتشر می‌کند، اما مجموعه داده‌های کامل و pipeline‌های آموزشی را همچنان بسته نگه می‌دارد («open weight, but not full open source»).

تأثیر بر صنعت

  • راه‌اندازی R1 سبب افت یک‌روزه ارزش سهام NVIDIA، Microsoft و سایر شرکت‌ها در پی اخبار مربوط به «مدلی هم‌کلاس GPT‑4 با ۶ میلیون دلار» شد.[20]
  • نمایش موفق آموزش روی تراشه‌های Nvidia H800 تحت محدودیت‌های صادراتی، بحث درباره اثربخشی تحریم‌های آمریکا را تحریک کرد و توسعه شتاب‌دهنده‌های AI چینی (مانند Huawei Ascend 910B) را سرعت بخشید.

انتقادات و محدودیت‌ها

  • امنیت: در آزمون HarmBench، مدل R1 به ۱۰۰٪ درخواست‌های نامطلوب («jailbreak») پاسخ داد.
  • سانسور سیاسی: نسخه‌های چت موضوعات «حساس» برای دولت چین را فیلتر می‌کنند (رویدادهای میدان تیان‌آن‌مِن در ۱۹۸۹، وضعیت تایوان و غیره).
  • ذخیره‌سازی داده: نگهداری داده‌های کاربران در سرورهای چین، استفاده از API را برای شرکت‌های غربی که مشمول GDPR و رژیم‌های حقوقی مشابه هستند، محدود می‌کند.[21]

همچنین ببینید

  • مدل‌های زبانی بزرگ OpenAI
  • Mixture-of-Experts

منابع

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

یادداشت‌ها

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.