DeepSeek (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — китайска изследователска компания в областта на изкуствения интелект, разработваща големи езикови модели (LLM) и мултимодални системи. Широка известност фирмата придоби благодарение на открытото разпространение на теглата на своите модели и тяхната висока икономическа ефективност, което предизвика корекция на цените на пазара на ИИ в края на 2024 — началото на 2025 година.[1]

История

Основателят на DeepSeek — предприемач и съосновател на хедж фонда High‑Flyer Лян Уънфън. През пролетта на 2023 година High‑Flyer отделя изследователското си ИИ-подразделение, което през май същата година се превръща в компанията DeepSeek AI. До 2025 година персоналът нараства до ~160 служители.[2] От самото начало компанията декларира курс към откритост — публикуване на тегла („open‑weight") под разрешителни лицензи и ориентация към фундаментални изследвания в областта на AGI.

За разлика от повечето стартъпи, DeepSeek се финансира от R&D-бюджета на High-Flyer, което, по думите на основателя, позволява съсредоточаване върху дългосрочни цели, а не върху краткосрочна монетизация.[3]

Значителен отзвук в технологичната и финансовата общност компанията предизвика през януари 2025 година след пускането на модела DeepSeek-R1. Твърдението, че обучението на модел, сравним с GPT-4, е струвало по-малко от $6 млн (в сравнение с оценки от $100+ млн за GPT-4), предизвика срив на акциите на технологичните гиганти и накара индустрията да преосмисли парадигмата „повече изчисления = по-добър модел".[4]

Архитектурни особености

Mixture‑of‑Experts (DeepSeekMoE)
Повечето флагмански модели на DeepSeek използват архитектурата смес от експерти (MoE). За разлика от „плътните" модели, при които при обработката на заявка се активират всички параметри, при MoE-моделите за всеки token се задействат само малка част от специализираните подмрежи („експерти"). DeepSeek разработи собствена реализация на MoE с „общи" експерти, финозърнеста сегментация и балансиране на натоварването без спомагателни загуби, което позволява активиране само на част от стотиците милиарди параметри и значително намалява изчислителните разходи.[5]
Multi‑Head Latent Attention (MLA)
Метод за компресиране на KV‑кеша до латентен вектор, спестяващ до 93 % памет и позволяващ използването на контекстни прозорци с размер до 128 000 token. Тази технология е ключова за ефективна работа с дълги текстове.[6]
FP8 training и Multi‑Token Prediction
При моделите от семейство V3 се прилагат смесена точност FP8 (8-битни числа с плаваща запетая) и едновременно предсказване на няколко token, което ускорява процесите на обучение и инференс (извеждане).[7]

Семейство модели

  • DeepSeek LLM — базови модели с 7 и 67 млрд параметра (2023), първи двуезичен (EN/ZH) релийз, превъзхождащ LLaMA‑2 70B при редица задачи.[8]
  • DeepSeek‑Coder (2023) — линия от модели за програмиране (1,3 – 33 млрд) и нейното развитие Coder‑V2 (16 млрд / 236 млрд MoE, контекст 128K, 338 езика за програмиране).[9]
  • DeepSeek‑V2 (май 2024) — 236 млрд (21 млрд активни) MoE‑LLM с MLA; обучен на 8,1 трлн token.[10]
  • DeepSeek‑V3 (декември 2024) — 671 млрд (37 млрд активни); обучение ≈2,8 млн GPU‑часа на Nvidia H800 на стойност ≈$5,5 млн.[11]
  • DeepSeek‑R1 (януари 2025) — линия от модели за логически разсъждения (reasoning); версията R1‑0528 се приближи до OpenAI o3 на AIME 2025 и LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — мултимодални VL-модели (до 4,5 млрд активни) с динамична мозаечна обработка на изображения 1024×1024.[13]
  • DeepSeek‑Math 7B — специализиран модел, 51,7 % точност на benchmark MATH; близо до GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 млрд MoE за доказателство на теореми в Lean 4; 63,5 % на miniF2F.
  • Дистилирани R1‑модели — отворени версии от 1,5 до 70 млрд параметра на базата на Llama и Qwen.[15]

Хронология на ключовите релийзи

Дата Релийз и ключови особености
2 ноем 2023 DeepSeek‑Coder v1: първите open‑weight модели за код.
29 ноем 2023 DeepSeek LLM 7B/67B: двуезичен модел, обучен на 2 трлн token.
11 ян 2024 DeepSeek‑MoE 16B: дебют на MoE-архитектурата.
6 фев 2024 DeepSeek‑Math 7B: специализиран модел за математика (51,7 % на MATH).
6 май 2024 DeepSeek‑V2 236B: въвеждане на архитектурите MLA и MoE.
17 юни 2024 DeepSeek‑Coder‑V2: контекст 128K, поддръжка на 338 езика за програмиране.
13 дек 2024 DeepSeek‑VL2: мултимодален модел на базата на MoE.
27 дек 2024 DeepSeek‑V3 671B: флагмански модел, обучен за по-малко от $6 млн.
20 ян 2025 DeepSeek‑R1 / R1‑Zero: модели за разсъждения, обучени с помощта на RL.
27 ян 2025 Janus‑Pro: модел за генериране на изображения, превъзхождащ DALL‑E 3.

Производителност и benchmark-ове

  • DeepSeek‑V3 превъзхожда Llama 3.1 и Qwen 2.5 и се приближава до нивото на GPT‑4 по MMLU и GPQA‑Diamond.[16]
  • DeepSeek‑Coder‑V2 постига 72,9 % на Arena‑Hard — паритет с GPT‑4o и по-висок резултат от всички отворени модели, с изключение на Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — 51,7 % на MATH, което е близо до Gemini‑Ultra при 10 пъти по-малък размер.[18]
  • R1‑Zero повиши резултата AIME 2024 pass@1 от 15,6 % до 71 % единствено чрез RL-обучение.[19]

Лицензиране и open‑source

Повечето модели се разпространяват под лиценз MIT или Apache 2.0, допускащ търговско използване. Компанията публикува теглата в Hugging Face и GitHub, но запазва в закрит вид пълните dataset-и и тренировъчните pipeline-и („open weight, but not full open source").

Влияние върху индустрията

  • Пускането на R1 предизвика еднодневен спад в котировките на NVIDIA, Microsoft и други компании на фона на новините за „модел от класа на GPT‑4 за $6 млн".[20]
  • Демонстрацията на успешно обучение върху чипове Nvidia H800 в условията на експортни ограничения стимулира дискусията относно ефективността на американските санкции и ускори разработването на китайски ИИ-ускорители (например Huawei Ascend 910B).

Критика и ограничения

  • Безопасност: при теста HarmBench моделът R1 пропуска 100 % от нежеланите заявки („джейлбрейк").
  • Политическа цензура: чат-версиите филтрират теми, „чувствителни" за китайското правителство (събитията на площад Тянанмън от 1989 година, статутът на Тайван и др.).
  • Съхранение на данни: съхранението на потребителски данни на сървъри в Китай ограничава използването на API от западни корпорации, подчиняващи се на GDPR и аналогични правни режими.[21]

Литература

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Бележки

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Вижте също

  • Големи езикови модели на OpenAI
  • Mixture-of-Experts