DeepSeek (BG)
DeepSeek — китайска изследователска компания в областта на изкуствения интелект, разработваща големи езикови модели (LLM) и мултимодални системи. Широка известност фирмата придоби благодарение на открытото разпространение на теглата на своите модели и тяхната висока икономическа ефективност, което предизвика корекция на цените на пазара на ИИ в края на 2024 — началото на 2025 година.[1]
История
Основателят на DeepSeek — предприемач и съосновател на хедж фонда High‑Flyer Лян Уънфън. През пролетта на 2023 година High‑Flyer отделя изследователското си ИИ-подразделение, което през май същата година се превръща в компанията DeepSeek AI. До 2025 година персоналът нараства до ~160 служители.[2] От самото начало компанията декларира курс към откритост — публикуване на тегла („open‑weight") под разрешителни лицензи и ориентация към фундаментални изследвания в областта на AGI.
За разлика от повечето стартъпи, DeepSeek се финансира от R&D-бюджета на High-Flyer, което, по думите на основателя, позволява съсредоточаване върху дългосрочни цели, а не върху краткосрочна монетизация.[3]
Значителен отзвук в технологичната и финансовата общност компанията предизвика през януари 2025 година след пускането на модела DeepSeek-R1. Твърдението, че обучението на модел, сравним с GPT-4, е струвало по-малко от $6 млн (в сравнение с оценки от $100+ млн за GPT-4), предизвика срив на акциите на технологичните гиганти и накара индустрията да преосмисли парадигмата „повече изчисления = по-добър модел".[4]
Архитектурни особености
- Mixture‑of‑Experts (DeepSeekMoE)
- Повечето флагмански модели на DeepSeek използват архитектурата смес от експерти (MoE). За разлика от „плътните" модели, при които при обработката на заявка се активират всички параметри, при MoE-моделите за всеки token се задействат само малка част от специализираните подмрежи („експерти"). DeepSeek разработи собствена реализация на MoE с „общи" експерти, финозърнеста сегментация и балансиране на натоварването без спомагателни загуби, което позволява активиране само на част от стотиците милиарди параметри и значително намалява изчислителните разходи.[5]
- Multi‑Head Latent Attention (MLA)
- Метод за компресиране на KV‑кеша до латентен вектор, спестяващ до 93 % памет и позволяващ използването на контекстни прозорци с размер до 128 000 token. Тази технология е ключова за ефективна работа с дълги текстове.[6]
- FP8 training и Multi‑Token Prediction
- При моделите от семейство V3 се прилагат смесена точност FP8 (8-битни числа с плаваща запетая) и едновременно предсказване на няколко token, което ускорява процесите на обучение и инференс (извеждане).[7]
Семейство модели
- DeepSeek LLM — базови модели с 7 и 67 млрд параметра (2023), първи двуезичен (EN/ZH) релийз, превъзхождащ LLaMA‑2 70B при редица задачи.[8]
- DeepSeek‑Coder (2023) — линия от модели за програмиране (1,3 – 33 млрд) и нейното развитие Coder‑V2 (16 млрд / 236 млрд MoE, контекст 128K, 338 езика за програмиране).[9]
- DeepSeek‑V2 (май 2024) — 236 млрд (21 млрд активни) MoE‑LLM с MLA; обучен на 8,1 трлн token.[10]
- DeepSeek‑V3 (декември 2024) — 671 млрд (37 млрд активни); обучение ≈2,8 млн GPU‑часа на Nvidia H800 на стойност ≈$5,5 млн.[11]
- DeepSeek‑R1 (януари 2025) — линия от модели за логически разсъждения (reasoning); версията R1‑0528 се приближи до OpenAI o3 на AIME 2025 и LiveCodeBench.[12]
- DeepSeek‑VL / VL2 — мултимодални VL-модели (до 4,5 млрд активни) с динамична мозаечна обработка на изображения 1024×1024.[13]
- DeepSeek‑Math 7B — специализиран модел, 51,7 % точност на benchmark MATH; близо до GPT‑4.[14]
- DeepSeek‑Prover‑V2 — 671 млрд MoE за доказателство на теореми в Lean 4; 63,5 % на miniF2F.
- Дистилирани R1‑модели — отворени версии от 1,5 до 70 млрд параметра на базата на Llama и Qwen.[15]
Хронология на ключовите релийзи
| Дата | Релийз и ключови особености |
|---|---|
| 2 ноем 2023 | DeepSeek‑Coder v1: първите open‑weight модели за код. |
| 29 ноем 2023 | DeepSeek LLM 7B/67B: двуезичен модел, обучен на 2 трлн token. |
| 11 ян 2024 | DeepSeek‑MoE 16B: дебют на MoE-архитектурата. |
| 6 фев 2024 | DeepSeek‑Math 7B: специализиран модел за математика (51,7 % на MATH). |
| 6 май 2024 | DeepSeek‑V2 236B: въвеждане на архитектурите MLA и MoE. |
| 17 юни 2024 | DeepSeek‑Coder‑V2: контекст 128K, поддръжка на 338 езика за програмиране. |
| 13 дек 2024 | DeepSeek‑VL2: мултимодален модел на базата на MoE. |
| 27 дек 2024 | DeepSeek‑V3 671B: флагмански модел, обучен за по-малко от $6 млн. |
| 20 ян 2025 | DeepSeek‑R1 / R1‑Zero: модели за разсъждения, обучени с помощта на RL. |
| 27 ян 2025 | Janus‑Pro: модел за генериране на изображения, превъзхождащ DALL‑E 3. |
Производителност и benchmark-ове
- DeepSeek‑V3 превъзхожда Llama 3.1 и Qwen 2.5 и се приближава до нивото на GPT‑4 по MMLU и GPQA‑Diamond.[16]
- DeepSeek‑Coder‑V2 постига 72,9 % на Arena‑Hard — паритет с GPT‑4o и по-висок резултат от всички отворени модели, с изключение на Claude‑3.5‑Sonnet.[17]
- DeepSeek‑Math 7B — 51,7 % на MATH, което е близо до Gemini‑Ultra при 10 пъти по-малък размер.[18]
- R1‑Zero повиши резултата AIME 2024 pass@1 от 15,6 % до 71 % единствено чрез RL-обучение.[19]
Лицензиране и open‑source
Повечето модели се разпространяват под лиценз MIT или Apache 2.0, допускащ търговско използване. Компанията публикува теглата в Hugging Face и GitHub, но запазва в закрит вид пълните dataset-и и тренировъчните pipeline-и („open weight, but not full open source").
Влияние върху индустрията
- Пускането на R1 предизвика еднодневен спад в котировките на NVIDIA, Microsoft и други компании на фона на новините за „модел от класа на GPT‑4 за $6 млн".[20]
- Демонстрацията на успешно обучение върху чипове Nvidia H800 в условията на експортни ограничения стимулира дискусията относно ефективността на американските санкции и ускори разработването на китайски ИИ-ускорители (например Huawei Ascend 910B).
Критика и ограничения
- Безопасност: при теста HarmBench моделът R1 пропуска 100 % от нежеланите заявки („джейлбрейк").
- Политическа цензура: чат-версиите филтрират теми, „чувствителни" за китайското правителство (събитията на площад Тянанмън от 1989 година, статутът на Тайван и др.).
- Съхранение на данни: съхранението на потребителски данни на сървъри в Китай ограничава използването на API от западни корпорации, подчиняващи се на GDPR и аналогични правни режими.[21]
Литература
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
Бележки
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
Вижте също
- Големи езикови модели на OpenAI
- Mixture-of-Experts