DeepSeek (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — een Chinees onderzoeksbedrijf op het gebied van kunstmatige intelligentie dat grote taalmodellen (LLM) en multimodale systemen ontwikkelt. Het bedrijf verwierf brede bekendheid dankzij de open verspreiding van de gewichten van zijn modellen en hun hoge kostenefficiëntie, wat aan het einde van 2024 en het begin van 2025 leidde tot een prijscorrectie op de AI-markt.[1]

Geschiedenis

De oprichter van DeepSeek is ondernemer en medeoprichter van hedgefonds High‑Flyer, Liang Wenfeng. In het voorjaar van 2023 splitste High‑Flyer zijn AI-onderzoeksafdeling af, die in mei van datzelfde jaar het bedrijf DeepSeek AI werd. Al in 2025 was het personeelsbestand gegroeid tot ~160 medewerkers.[2] Vanaf het begin verklaarde het bedrijf openheid als koers — het publiceren van gewichten («open‑weight») onder permissieve licenties en een focus op fundamenteel AGI-onderzoek.

Anders dan de meeste startups wordt DeepSeek gefinancierd uit het R&D-budget van High-Flyer, wat de oprichter naar eigen zeggen in staat stelt zich te concentreren op langetermijndoelen in plaats van op onmiddellijke monetisering.[3]

In januari 2025 veroorzaakte het bedrijf grote opschudding in de technologie- en financiële wereld na de release van het model DeepSeek-R1. De bewering dat het trainen van een model vergelijkbaar met GPT-4 minder dan $6 miljoen kostte (vergeleken met schattingen van $100+ miljoen voor GPT-4), leidde tot een koersval van technologiereuzen en dwong de industrie het paradigma «meer rekenkracht = beter model» te heroverwegen.[4]

Architecturale kenmerken

Mixture‑of‑Experts (DeepSeekMoE)
De meeste vlaggenschipmodellen van DeepSeek maken gebruik van de Mixture-of-Experts (MoE)-architectuur. In tegenstelling tot «dichte» modellen waarbij bij de verwerking van een verzoek alle parameters worden geactiveerd, wordt bij MoE-modellen voor elk token slechts een klein deel van gespecialiseerde subnetwerken («experts») gebruikt. DeepSeek heeft een eigen MoE-implementatie ontwikkeld met «gedeelde» experts, fijnmazige segmentatie en lastbalancering zonder hulpverliezen, waardoor slechts een deel van de honderden miljarden parameters wordt geactiveerd en de rekenkosten sterk worden verlaagd.[5]
Multi‑Head Latent Attention (MLA)
Een methode voor het comprimeren van de KV-cache tot een latente vector, die tot 93% geheugen bespaart en contextvensters van maximaal 128.000 tokens mogelijk maakt. Deze technologie is essentieel voor het efficiënt werken met lange teksten.[6]
FP8 training en Multi‑Token Prediction
In de modellen van de V3-familie wordt gemengde precisie FP8 (8-bit drijvende-kommagetallen) toegepast en worden meerdere tokens tegelijk voorspeld, wat de trainings- en inferentieprocessen versnelt.[7]

Modelfamilie

  • DeepSeek LLM — basismodellen met 7 en 67 miljard parameters (2023), de eerste tweetalige (EN/ZH) release, die LLaMA‑2 70B overtrof bij een aantal taken.[8]
  • DeepSeek‑Coder (2023) — een reeks modellen voor programmeren (1,3 – 33 miljard) en de verdere ontwikkeling ervan Coder‑V2 (16 miljard / 236 miljard MoE, context 128K, 338 programmeertalen).[9]
  • DeepSeek‑V2 (mei 2024) — 236 miljard (21 miljard actief) MoE‑LLM met MLA; getraind op 8,1 biljoen tokens.[10]
  • DeepSeek‑V3 (december 2024) — 671 miljard (37 miljard actief); training ≈2,8 miljoen GPU-uren op Nvidia H800 voor ≈$5,5 miljoen.[11]
  • DeepSeek‑R1 (januari 2025) — een reeks modellen voor logisch redeneren (reasoning); versie R1‑0528 benaderde OpenAI o3 op AIME 2025 en LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — multimodale VL-modellen (tot 4,5 miljard actief) met dynamische mozaïekverwerking van afbeeldingen van 1024×1024.[13]
  • DeepSeek‑Math 7B — een gespecialiseerd model, 51,7% nauwkeurigheid op de MATH-benchmark; vergelijkbaar met GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 miljard MoE voor het bewijzen van stellingen in Lean 4; 63,5% op miniF2F.
  • Gedestilleerde R1-modellen — open versies van 1,5 tot 70 miljard parameters op basis van Llama en Qwen.[15]

Tijdlijn van belangrijke releases

Datum Release en belangrijkste kenmerken
2 nov 2023 DeepSeek‑Coder v1: eerste open‑weight modellen voor code.
29 nov 2023 DeepSeek LLM 7B/67B: tweetalig model, getraind op 2 biljoen tokens.
11 jan 2024 DeepSeek‑MoE 16B: debuut van de MoE-architectuur.
6 feb 2024 DeepSeek‑Math 7B: gespecialiseerd model voor wiskunde (51,7% op MATH).
6 mei 2024 DeepSeek‑V2 236B: introductie van de MLA- en MoE-architecturen.
17 jun 2024 DeepSeek‑Coder‑V2: 128K context, ondersteuning voor 338 programmeertalen.
13 dec 2024 DeepSeek‑VL2: multimodaal model op basis van MoE.
27 dec 2024 DeepSeek‑V3 671B: vlaggenschipmodel, getraind voor minder dan $6 miljoen.
20 jan 2025 DeepSeek‑R1 / R1‑Zero: redeneermodellen, getraind met behulp van Reinforcement Learning.
27 jan 2025 Janus‑Pro: model voor het genereren van afbeeldingen, dat DALL‑E 3 overtreft.

Prestaties en benchmarks

  • DeepSeek‑V3 overtrof Llama 3.1 en Qwen 2.5 en benaderde het niveau van GPT‑4 op MMLU en GPQA‑Diamond.[16]
  • DeepSeek‑Coder‑V2 behaalde 72,9% op Arena‑Hard — gelijkwaardig aan GPT‑4o en hoger dan alle open modellen, behalve Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — 51,7% op MATH, vergelijkbaar met Gemini‑Ultra bij een 10 keer kleinere omvang.[18]
  • R1‑Zero verhoogde het AIME 2024 pass@1-resultaat van 15,6% naar 71% uitsluitend door middel van Reinforcement Learning-training.[19]

Licentieverlening en open‑source

De meeste modellen worden verspreid onder de MIT- of Apache 2.0-licentie, die commercieel gebruik toestaat. Het bedrijf publiceert gewichten op Hugging Face en GitHub, maar houdt de volledige datasets en trainingsprocessen gesloten («open weight, but not full open source»).

Invloed op de industrie

  • De lancering van R1 veroorzaakte een eendaagse koersdaling van NVIDIA, Microsoft en andere bedrijven als gevolg van het nieuws over een «GPT-4-klasse model voor $6 miljoen».[20]
  • De succesvolle training op Nvidia H800-chips onder exportbeperkingen stimuleerde een discussie over de doeltreffendheid van Amerikaanse sancties en versnelde de ontwikkeling van Chinese AI-accelerators (zoals de Huawei Ascend 910B).

Kritiek en beperkingen

  • Veiligheid: in de HarmBench-test liet het R1-model 100% van de ongewenste verzoeken door («jailbreak»).
  • Politieke censuur: de chatversies filteren onderwerpen die «gevoelig» zijn voor de Chinese overheid (de gebeurtenissen op het Tiananmenplein in 1989, de status van Taiwan, enzovoort).
  • Gegevensopslag: het opslaan van gebruikersgegevens op servers in China beperkt het gebruik van de API door westerse bedrijven die onderworpen zijn aan de AVG en vergelijkbare rechtsstelsels.[21]

Literatuur

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Noten

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Zie ook

  • Grote taalmodellen van OpenAI
  • Mixture-of-Experts