---
title: "DeepSeek (SV)"
source: "https://systems-analysis.info/int/DeepSeek_(SV)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 1611
wiki_created_at: 2026-09-06T22:51:18Z
wiki_modified_at: 2026-09-06T22:51:18Z
downloaded_at: 2026-09-07T22:46:50Z
---

# DeepSeek (SV)

**DeepSeek** — ett kinesiskt forskningsföretag inom artificiell intelligens som utvecklar stora språkmodeller (LLM) och multimodala system. Företaget fick bred kännedom tack vare öppen distribution av sina modellers vikter och deras höga kostnadseffektivitet, vilket utlöste en prisjustering på AI-marknaden i slutet av 2024 och början av 2025.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-1)</sup>

## Historia

Grundaren av DeepSeek är entreprenören och medgrundaren av hedgefonden *High-Flyer*, Liang Wenfeng. Våren 2023 bröt High-Flyer ut sin AI-forskningsenhet, som i maj samma år blev företaget *DeepSeek AI*. Redan år 2025 hade personalstyrkan vuxit till ~160 anställda.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-2)</sup> Från de första dagarna deklarerade företaget en inriktning mot öppenhet — publicering av vikter ("open-weight") under tillåtande licenser och fokus på grundläggande AGI-forskning.

Till skillnad från de flesta startups finansieras DeepSeek ur High-Flyers R&D-budget, vilket enligt grundaren gör det möjligt att koncentrera sig på långsiktiga mål snarare än omedelbar monetisering.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-3)</sup>

Företaget skapade stort genomslag i teknik- och finansvärlden i januari 2025 efter lanseringen av modellen **DeepSeek-R1**. Påståendet att träningen av en modell i klass med GPT-4 kostade mindre än 6 miljoner dollar (jämfört med uppskattningar på 100+ miljoner dollar för GPT-4) orsakade ett ras i teknikjättarnas aktiekurser och fick industrin att ompröva paradigmet "mer beräkningskraft = bättre modell".<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-4)</sup>

## Arkitektoniska särdrag

Mixture-of-Experts (DeepSeekMoE)  
De flesta av DeepSeeks flaggskeppsmodeller använder en Mixture of Experts-arkitektur (MoE). Till skillnad från "täta" modeller, där alla parametrar aktiveras vid bearbetning av en förfrågan, aktiveras i MoE-modeller endast en liten del av specialiserade delnätverk ("experter") för varje token. DeepSeek har utvecklat en egen MoE-implementering med "delade" experter, finkornad segmentering och lastbalansering utan hjälpförluster, vilket gör det möjligt att aktivera endast en del av hundratals miljarder parametrar och kraftigt reducera beräkningskostnaderna.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-5)</sup>

Multi-Head Latent Attention (MLA)  
En metod för att komprimera KV-cachen till en latent vektor, vilket sparar upp till 93 % av minnet och möjliggör kontextfönster på upp till 128 000 tokens. Denna teknik är avgörande för effektiv hantering av långa texter.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-6)</sup>

FP8 training och Multi-Token Prediction  
I modeller ur V3-familjen används blandad precision FP8 (8-bitars flyttal) och samtidig prediktion av flera tokens, vilket påskyndar tränings- och inferensprocesserna.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-7)</sup>

## Modellfamiljer

- **DeepSeek LLM** — basmodeller med 7 och 67 miljarder parametrar (2023), den första tvåspråkiga (EN/ZH) versionen, som överträffade *LLaMA-2 70B* i ett antal uppgifter.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-8)</sup>
- **DeepSeek-Coder** (2023) — en serie modeller för programmering (1,3–33 miljarder) och dess vidareutveckling *Coder-V2* (16 miljarder / 236 miljarder MoE, kontext 128K, 338 programmeringsspråk).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-9)</sup>
- **DeepSeek-V2** (maj 2024) — 236 miljarder (21 miljarder aktiva) MoE-LLM med MLA; tränad på 8,1 biljoner tokens.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-10)</sup>
- **DeepSeek-V3** (december 2024) — 671 miljarder (37 miljarder aktiva); träning ≈2,8 miljoner GPU-timmar på Nvidia H800 till en kostnad av ≈5,5 miljoner dollar.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-11)</sup>
- **DeepSeek-R1** (januari 2025) — en serie modeller för logiskt resonemang (reasoning); versionen R1-0528 närmade sig *OpenAI o3* på AIME 2025 och LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-12)</sup>
- **DeepSeek-VL / VL2** — multimodala VL-modeller (upp till 4,5 miljarder aktiva) med dynamisk mosaikbearbetning av bilder i 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-13)</sup>
- **DeepSeek-Math** 7B — en specialiserad modell med 51,7 % precision på benchmark MATH; nära GPT-4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-14)</sup>
- **DeepSeek-Prover-V2** — 671 miljarder MoE för bevisföring av teorem i Lean 4; 63,5 % på miniF2F.
- **Destillerade R1-modeller** — öppna versioner från 1,5 till 70 miljarder parametrar baserade på Llama och Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-15)</sup>

## Tidslinje över viktiga lanseringar

| Datum       | Lansering och viktigaste egenskaper                                                         |
|-------------|---------------------------------------------------------------------------------------------|
| 2 nov 2023  | **DeepSeek-Coder v1:** de första open-weight-modellerna för kod.                            |
| 29 nov 2023 | **DeepSeek LLM 7B/67B:** tvåspråkig modell tränad på 2 biljoner tokens.                     |
| 11 jan 2024 | **DeepSeek-MoE 16B:** debut för MoE-arkitekturen.                                           |
| 6 feb 2024  | **DeepSeek-Math 7B:** specialiserad modell för matematik (51,7 % på MATH).                  |
| 6 maj 2024  | **DeepSeek-V2 236B:** införande av MLA- och MoE-arkitekturerna.                             |
| 17 jun 2024 | **DeepSeek-Coder-V2:** 128K kontext, stöd för 338 programmeringsspråk.                      |
| 13 dec 2024 | **DeepSeek-VL2:** multimodal modell baserad på MoE.                                         |
| 27 dec 2024 | **DeepSeek-V3 671B:** flaggskeppsmodell tränad för mindre än 6 miljoner dollar.             |
| 20 jan 2025 | **DeepSeek-R1 / R1-Zero:** resonemangsmodeller tränade med hjälp av Reinforcement Learning. |
| 27 jan 2025 | **Janus-Pro:** modell för bildgenerering som överträffar DALL-E 3.                          |

## Prestanda och benchmark

- *DeepSeek-V3* överträffade *Llama 3.1* och *Qwen 2.5* och närmade sig GPT-4-nivån på MMLU och GPQA-Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-16)</sup>
- *DeepSeek-Coder-V2* uppnådde 72,9 % på Arena-Hard — i paritet med GPT-4o och över alla öppna modeller utom Claude-3.5-Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-17)</sup>
- *DeepSeek-Math 7B* — 51,7 % på MATH, vilket är nära Gemini-Ultra med tio gånger mindre modellstorlek.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-18)</sup>
- *R1-Zero* höjde AIME 2024 pass@1-resultatet från 15,6 % till 71 % enbart genom Reinforcement Learning-träning.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-19)</sup>

## Licensiering och open-source

De flesta modeller distribueras under MIT- eller Apache 2.0-licensen, vilket tillåter kommersiell användning. Företaget publicerar vikter på Hugging Face och GitHub, men behåller fullständiga dataset och träningspipelines som slutna ("open weight, but not full open source").

## Påverkan på industrin

- Lanseringen av R1 orsakade ett endagstapp i aktiekurserna för NVIDIA, Microsoft och andra företag till följd av nyheterna om "en GPT-4-klasmodell för 6 miljoner dollar".<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-20)</sup>
- Demonstrationen av framgångsrik träning på Nvidia H800-chips under exportrestriktioner stimulerade diskussionen om effektiviteten av amerikanska sanktioner och påskyndade utvecklingen av kinesiska AI-acceleratorer (exempelvis Huawei Ascend 910B).

## Kritik och begränsningar

- Säkerhet: i testet HarmBench släppte modellen R1 igenom 100 % av oönskade förfrågningar ("jailbreak").
- Politisk censur: chattversioner filtrerar bort ämnen som är "känsliga" för den kinesiska regeringen (händelserna på Himmelska fridens torg 1989, Taiwans status m.m.).
- Datalagring: lagring av användardata på servrar i Kina begränsar användningen av API:et för västliga företag som lyder under GDPR och liknande rättsliga regelverk.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(SV)#cite_note-21)</sup>

## Litteratur

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Noter

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(SV)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>

## Se även

- Stora språkmodeller från OpenAI
- Mixture-of-Experts
