DeepSeek (FA)
DeepSeek — یک شرکت پژوهشی چینی در حوزه هوش مصنوعی است که مدلهای زبانی بزرگ (LLM) و سیستمهای چندوجهی توسعه میدهد. این شرکت به لطف انتشار آزاد وزنهای مدلهایش و کارایی اقتصادی بالای آنها شهرت گستردهای یافت، که در اواخر ۲۰۲۴ و ابتدای ۲۰۲۵ منجر به تعدیل قیمتها در بازار AI شد.[1]
تاریخچه
بنیانگذار DeepSeek کارآفرین و هممؤسس صندوق پوشش ریسک High‑Flyer، لیانگ وِنفِنگ است. در بهار ۲۰۲۳، High‑Flyer بخش پژوهشی AI خود را جدا کرد که در می همان سال به شرکت DeepSeek AI تبدیل شد. تا سال ۲۰۲۵ تعداد کارکنان به حدود ۱۶۰ نفر رسید.[2] از همان روزهای ابتدایی، شرکت رویکرد شفافیت را اعلام کرد — انتشار وزنها («open‑weight») تحت مجوزهای آزاد و تمرکز بر پژوهشهای بنیادی AGI.
برخلاف اکثر استارتاپها، DeepSeek از بودجه R&D صندوق High-Flyer تأمین مالی میشود که به گفته بنیانگذار، این امر اجازه میدهد بر اهداف بلندمدت تمرکز شود، نه بر کسب درآمد آنی.[3]
این شرکت در ژانویه ۲۰۲۵ با انتشار مدل DeepSeek-R1 سروصدای زیادی در جامعه فناوری و مالی به پا کرد. اعلام اینکه آموزش مدلی همتراز با GPT-4 کمتر از ۶ میلیون دلار هزینه داشته (در مقایسه با برآوردهای بیش از ۱۰۰ میلیون دلار برای GPT-4)، سبب سقوط سهام غولهای فناوری شد و صنعت را مجبور کرد پارادایم «محاسبات بیشتر = مدل بهتر» را بازنگری کند.[4]
ویژگیهای معماری
- Mixture‑of‑Experts (DeepSeekMoE)
- اکثر مدلهای پرچمدار DeepSeek از معماری ترکیب متخصصان (MoE) استفاده میکنند. برخلاف مدلهای «متراکم» که در پردازش هر درخواست تمام پارامترها فعال میشوند، در مدلهای MoE برای هر token تنها بخش کوچکی از زیرشبکههای تخصصی («متخصصان») فعال میشوند. DeepSeek پیادهسازی اختصاصی MoE با متخصصان «مشترک»، تقسیمبندی ریزدانه و توازن بار بدون اتلاف کمکی توسعه داده که امکان فعالسازی تنها بخشی از صدها میلیارد پارامتر را فراهم کرده و هزینههای محاسباتی را به شدت کاهش میدهد.[5]
- Multi‑Head Latent Attention (MLA)
- روشی برای فشردهسازی KV‑cache به یک بردار پنهان که تا ۹۳٪ حافظه صرفهجویی میکند و استفاده از پنجرههای زمینه تا ۱۲۸٬۰۰۰ token را ممکن میسازد. این فناوری برای کار کارآمد با متون طولانی کلیدی است.[6]
- FP8 training و Multi‑Token Prediction
- در مدلهای خانواده V3 از دقت مختلط FP8 (اعداد ممیز شناور ۸ بیتی) و پیشبینی همزمان چندین token استفاده میشود که فرآیندهای آموزش و استنتاج را تسریع میکند.[7]
خانواده مدلها
- DeepSeek LLM — مدلهای پایه با ۷ و ۶۷ میلیارد پارامتر (۲۰۲۳)، اولین نسخه دوزبانه (EN/ZH) که در برخی وظایف از LLaMA‑2 70B پیشی گرفت.[8]
- DeepSeek‑Coder (۲۰۲۳) — مجموعه مدلهای برنامهنویسی (۱.۳ تا ۳۳ میلیارد) و توسعه آن Coder‑V2 (۱۶ میلیارد / ۲۳۶ میلیارد MoE، زمینه ۱۲۸K، ۳۳۸ زبان برنامهنویسی).[9]
- DeepSeek‑V2 (می ۲۰۲۴) — MoE‑LLM با ۲۳۶ میلیارد (۲۱ میلیارد فعال) با MLA؛ روی ۸.۱ تریلیون token آموزش دیده.[10]
- DeepSeek‑V3 (دسامبر ۲۰۲۴) — ۶۷۱ میلیارد (۳۷ میلیارد فعال)؛ آموزش ≈۲.۸ میلیون ساعت GPU روی Nvidia H800 با هزینه ≈۵.۵ میلیون دلار.[11]
- DeepSeek‑R1 (ژانویه ۲۰۲۵) — خط مدلهای استدلال منطقی (reasoning)؛ نسخه R1‑0528 در AIME 2025 و LiveCodeBench به OpenAI o3 نزدیک شد.[12]
- DeepSeek‑VL / VL2 — مدلهای چندوجهی VL (تا ۴.۵ میلیارد فعال) با پردازش موزاییکی پویای تصاویر ۱۰۲۴×۱۰۲۴.[13]
- DeepSeek‑Math 7B — مدل تخصصی با دقت ۵۱.۷٪ در benchmark ریاضی MATH؛ نزدیک به GPT‑4.[14]
- DeepSeek‑Prover‑V2 — MoE با ۶۷۱ میلیارد پارامتر برای اثبات قضایا در Lean 4؛ ۶۳.۵٪ در miniF2F.
- مدلهای تقطیرشده R1 — نسخههای آزاد با ۱.۵ تا ۷۰ میلیارد پارامتر بر پایه Llama و Qwen.[15]
جدول زمانی انتشارهای کلیدی
| تاریخ | انتشار و ویژگیهای کلیدی |
|---|---|
| 2 ноя 2023 | DeepSeek‑Coder v1: اولین مدلهای open‑weight برای کدنویسی. |
| 29 ноя 2023 | DeepSeek LLM 7B/67B: مدل دوزبانه آموزشدیده روی ۲ تریلیون token. |
| 11 янв 2024 | DeepSeek‑MoE 16B: رونمایی از معماری MoE. |
| 6 фев 2024 | DeepSeek‑Math 7B: مدل تخصصی ریاضی (۵۱.۷٪ در MATH). |
| 6 мая 2024 | DeepSeek‑V2 236B: معرفی معماریهای MLA و MoE. |
| 17 июн 2024 | DeepSeek‑Coder‑V2: زمینه ۱۲۸K، پشتیبانی از ۳۳۸ زبان برنامهنویسی. |
| 13 дек 2024 | DeepSeek‑VL2: مدل چندوجهی مبتنی بر MoE. |
| 27 дек 2024 | DeepSeek‑V3 671B: مدل پرچمدار آموزشدیده با کمتر از ۶ میلیون دلار. |
| 20 янв 2025 | DeepSeek‑R1 / R1‑Zero: مدلهای استدلال آموزشدیده با Reinforcement Learning. |
| 27 янв 2025 | Janus‑Pro: مدل تولید تصویر که از DALL‑E 3 پیشی میگیرد. |
عملکرد و benchmarkها
- DeepSeek‑V3 از Llama 3.1 و Qwen 2.5 پیشی گرفت و در MMLU و GPQA‑Diamond به سطح GPT‑4 نزدیک شد.[16]
- DeepSeek‑Coder‑V2 در Arena‑Hard امتیاز ۷۲.۹٪ کسب کرد — همتراز با GPT‑4o و برتر از تمام مدلهای آزاد به جز Claude‑3.5‑Sonnet.[17]
- DeepSeek‑Math 7B — ۵۱.۷٪ در MATH، که با اندازهای ۱۰ برابر کوچکتر به Gemini‑Ultra نزدیک است.[18]
- R1‑Zero نتیجه AIME 2024 pass@1 را تنها از طریق آموزش RL از ۱۵.۶٪ به ۷۱٪ افزایش داد.[19]
مجوزدهی و open‑source
اکثر مدلها تحت مجوز MIT یا Apache 2.0 توزیع میشوند که استفاده تجاری را مجاز میدانند. شرکت وزنها را در Hugging Face و GitHub منتشر میکند، اما مجموعه دادههای کامل و pipelineهای آموزشی را همچنان بسته نگه میدارد («open weight, but not full open source»).
تأثیر بر صنعت
- راهاندازی R1 سبب افت یکروزه ارزش سهام NVIDIA، Microsoft و سایر شرکتها در پی اخبار مربوط به «مدلی همکلاس GPT‑4 با ۶ میلیون دلار» شد.[20]
- نمایش موفق آموزش روی تراشههای Nvidia H800 تحت محدودیتهای صادراتی، بحث درباره اثربخشی تحریمهای آمریکا را تحریک کرد و توسعه شتابدهندههای AI چینی (مانند Huawei Ascend 910B) را سرعت بخشید.
انتقادات و محدودیتها
- امنیت: در آزمون HarmBench، مدل R1 به ۱۰۰٪ درخواستهای نامطلوب («jailbreak») پاسخ داد.
- سانسور سیاسی: نسخههای چت موضوعات «حساس» برای دولت چین را فیلتر میکنند (رویدادهای میدان تیانآنمِن در ۱۹۸۹، وضعیت تایوان و غیره).
- ذخیرهسازی داده: نگهداری دادههای کاربران در سرورهای چین، استفاده از API را برای شرکتهای غربی که مشمول GDPR و رژیمهای حقوقی مشابه هستند، محدود میکند.[21]
همچنین ببینید
- مدلهای زبانی بزرگ OpenAI
- Mixture-of-Experts
منابع
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
یادداشتها
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.