DeepSeek (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — ett kinesiskt forskningsföretag inom artificiell intelligens som utvecklar stora språkmodeller (LLM) och multimodala system. Företaget fick bred kännedom tack vare öppen distribution av sina modellers vikter och deras höga kostnadseffektivitet, vilket utlöste en prisjustering på AI-marknaden i slutet av 2024 och början av 2025.[1]

Historia

Grundaren av DeepSeek är entreprenören och medgrundaren av hedgefonden High-Flyer, Liang Wenfeng. Våren 2023 bröt High-Flyer ut sin AI-forskningsenhet, som i maj samma år blev företaget DeepSeek AI. Redan år 2025 hade personalstyrkan vuxit till ~160 anställda.[2] Från de första dagarna deklarerade företaget en inriktning mot öppenhet — publicering av vikter ("open-weight") under tillåtande licenser och fokus på grundläggande AGI-forskning.

Till skillnad från de flesta startups finansieras DeepSeek ur High-Flyers R&D-budget, vilket enligt grundaren gör det möjligt att koncentrera sig på långsiktiga mål snarare än omedelbar monetisering.[3]

Företaget skapade stort genomslag i teknik- och finansvärlden i januari 2025 efter lanseringen av modellen DeepSeek-R1. Påståendet att träningen av en modell i klass med GPT-4 kostade mindre än 6 miljoner dollar (jämfört med uppskattningar på 100+ miljoner dollar för GPT-4) orsakade ett ras i teknikjättarnas aktiekurser och fick industrin att ompröva paradigmet "mer beräkningskraft = bättre modell".[4]

Arkitektoniska särdrag

Mixture-of-Experts (DeepSeekMoE)
De flesta av DeepSeeks flaggskeppsmodeller använder en Mixture of Experts-arkitektur (MoE). Till skillnad från "täta" modeller, där alla parametrar aktiveras vid bearbetning av en förfrågan, aktiveras i MoE-modeller endast en liten del av specialiserade delnätverk ("experter") för varje token. DeepSeek har utvecklat en egen MoE-implementering med "delade" experter, finkornad segmentering och lastbalansering utan hjälpförluster, vilket gör det möjligt att aktivera endast en del av hundratals miljarder parametrar och kraftigt reducera beräkningskostnaderna.[5]
Multi-Head Latent Attention (MLA)
En metod för att komprimera KV-cachen till en latent vektor, vilket sparar upp till 93 % av minnet och möjliggör kontextfönster på upp till 128 000 tokens. Denna teknik är avgörande för effektiv hantering av långa texter.[6]
FP8 training och Multi-Token Prediction
I modeller ur V3-familjen används blandad precision FP8 (8-bitars flyttal) och samtidig prediktion av flera tokens, vilket påskyndar tränings- och inferensprocesserna.[7]

Modellfamiljer

  • DeepSeek LLM — basmodeller med 7 och 67 miljarder parametrar (2023), den första tvåspråkiga (EN/ZH) versionen, som överträffade LLaMA-2 70B i ett antal uppgifter.[8]
  • DeepSeek-Coder (2023) — en serie modeller för programmering (1,3–33 miljarder) och dess vidareutveckling Coder-V2 (16 miljarder / 236 miljarder MoE, kontext 128K, 338 programmeringsspråk).[9]
  • DeepSeek-V2 (maj 2024) — 236 miljarder (21 miljarder aktiva) MoE-LLM med MLA; tränad på 8,1 biljoner tokens.[10]
  • DeepSeek-V3 (december 2024) — 671 miljarder (37 miljarder aktiva); träning ≈2,8 miljoner GPU-timmar på Nvidia H800 till en kostnad av ≈5,5 miljoner dollar.[11]
  • DeepSeek-R1 (januari 2025) — en serie modeller för logiskt resonemang (reasoning); versionen R1-0528 närmade sig OpenAI o3 på AIME 2025 och LiveCodeBench.[12]
  • DeepSeek-VL / VL2 — multimodala VL-modeller (upp till 4,5 miljarder aktiva) med dynamisk mosaikbearbetning av bilder i 1024×1024.[13]
  • DeepSeek-Math 7B — en specialiserad modell med 51,7 % precision på benchmark MATH; nära GPT-4.[14]
  • DeepSeek-Prover-V2 — 671 miljarder MoE för bevisföring av teorem i Lean 4; 63,5 % på miniF2F.
  • Destillerade R1-modeller — öppna versioner från 1,5 till 70 miljarder parametrar baserade på Llama och Qwen.[15]

Tidslinje över viktiga lanseringar

Datum Lansering och viktigaste egenskaper
2 nov 2023 DeepSeek-Coder v1: de första open-weight-modellerna för kod.
29 nov 2023 DeepSeek LLM 7B/67B: tvåspråkig modell tränad på 2 biljoner tokens.
11 jan 2024 DeepSeek-MoE 16B: debut för MoE-arkitekturen.
6 feb 2024 DeepSeek-Math 7B: specialiserad modell för matematik (51,7 % på MATH).
6 maj 2024 DeepSeek-V2 236B: införande av MLA- och MoE-arkitekturerna.
17 jun 2024 DeepSeek-Coder-V2: 128K kontext, stöd för 338 programmeringsspråk.
13 dec 2024 DeepSeek-VL2: multimodal modell baserad på MoE.
27 dec 2024 DeepSeek-V3 671B: flaggskeppsmodell tränad för mindre än 6 miljoner dollar.
20 jan 2025 DeepSeek-R1 / R1-Zero: resonemangsmodeller tränade med hjälp av Reinforcement Learning.
27 jan 2025 Janus-Pro: modell för bildgenerering som överträffar DALL-E 3.

Prestanda och benchmark

  • DeepSeek-V3 överträffade Llama 3.1 och Qwen 2.5 och närmade sig GPT-4-nivån på MMLU och GPQA-Diamond.[16]
  • DeepSeek-Coder-V2 uppnådde 72,9 % på Arena-Hard — i paritet med GPT-4o och över alla öppna modeller utom Claude-3.5-Sonnet.[17]
  • DeepSeek-Math 7B — 51,7 % på MATH, vilket är nära Gemini-Ultra med tio gånger mindre modellstorlek.[18]
  • R1-Zero höjde AIME 2024 pass@1-resultatet från 15,6 % till 71 % enbart genom Reinforcement Learning-träning.[19]

Licensiering och open-source

De flesta modeller distribueras under MIT- eller Apache 2.0-licensen, vilket tillåter kommersiell användning. Företaget publicerar vikter på Hugging Face och GitHub, men behåller fullständiga dataset och träningspipelines som slutna ("open weight, but not full open source").

Påverkan på industrin

  • Lanseringen av R1 orsakade ett endagstapp i aktiekurserna för NVIDIA, Microsoft och andra företag till följd av nyheterna om "en GPT-4-klasmodell för 6 miljoner dollar".[20]
  • Demonstrationen av framgångsrik träning på Nvidia H800-chips under exportrestriktioner stimulerade diskussionen om effektiviteten av amerikanska sanktioner och påskyndade utvecklingen av kinesiska AI-acceleratorer (exempelvis Huawei Ascend 910B).

Kritik och begränsningar

  • Säkerhet: i testet HarmBench släppte modellen R1 igenom 100 % av oönskade förfrågningar ("jailbreak").
  • Politisk censur: chattversioner filtrerar bort ämnen som är "känsliga" för den kinesiska regeringen (händelserna på Himmelska fridens torg 1989, Taiwans status m.m.).
  • Datalagring: lagring av användardata på servrar i Kina begränsar användningen av API:et för västliga företag som lyder under GDPR och liknande rättsliga regelverk.[21]

Litteratur

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective. arXiv:2406.13282.

Noter

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Se även

  • Stora språkmodeller från OpenAI
  • Mixture-of-Experts