DeepSeek (CS)
DeepSeek — čínská výzkumná společnost v oblasti umělé inteligence, která vyvíjí velké jazykové modely (LLM) a multimodální systémy. Firma získala širokou proslulost díky otevřenému šíření vah svých modelů a jejich vysoké ekonomické efektivitě, což na přelomu roku 2024 a 2025 vyvolalo korekci cen na trhu s AI.[1]
Historie
Zakladatelem DeepSeeku je podnikatel a spoluzakladatel hedgeového fondu High‑Flyer Liang Wenfeng. Na jaře roku 2023 oddělil High‑Flyer výzkumnou divizi zaměřenou na AI, která v květnu téhož roku vznikla jako samostatná společnost DeepSeek AI. Již do roku 2025 vzrostl počet zaměstnanců na přibližně 160.[2] Od prvních dnů společnost deklarovala orientaci na otevřenost — publikaci vah („open‑weight") pod permisivními licencemi a zaměření na základní výzkum v oblasti AGI.
Na rozdíl od většiny startupů je DeepSeek financován z R&D-rozpočtu fondu High-Flyer, což podle zakladatele umožňuje soustředit se na dlouhodobé cíle, a nikoli na okamžitou monetizaci.[3]
Výrazný ohlas v technologické i finanční komunitě společnost vyvolala v lednu 2025 po vydání modelu DeepSeek-R1. Prohlášení, že trénink modelu srovnatelného s GPT-4 vyšel na méně než 6 milionů dolarů (v porovnání s odhadovanými 100+ miliony dolarů pro GPT-4), způsobilo propad akcií technologických gigantů a přinutilo průmysl přehodnotit paradigma „více výpočetního výkonu = lepší model".[4]
Architektonické vlastnosti
- Mixture‑of‑Experts (DeepSeekMoE)
- Většina vlajkových modelů DeepSeek využívá architekturu směsi expertů (MoE). Na rozdíl od „hustých" modelů, kde jsou při zpracování dotazu aktivovány všechny parametry, aktivují MoE modely pro každý token pouze malou část specializovaných podsítí („expertů"). DeepSeek vyvinul vlastní implementaci MoE se „sdílenými" experty, jemnozrnnou segmentací a vyvažováním zátěže bez pomocných ztrát, což umožňuje aktivovat jen část ze stovek miliard parametrů a výrazně snižovat výpočetní náklady.[5]
- Multi‑Head Latent Attention (MLA)
- Metoda komprese KV‑cache do latentního vektoru, která šetří až 93 % paměti a umožňuje používat kontextová okna o velikosti až 128 000 tokenů. Tato technologie je klíčová pro efektivní práci s dlouhými texty.[6]
- FP8 training a Multi‑Token Prediction
- V modelech řady V3 se používá smíšená přesnost FP8 (8bitová čísla s plovoucí desetinnou čárkou) a současná predikce více tokenů, což urychluje procesy trénování i inference (odvozování).[7]
Rodina modelů
- DeepSeek LLM — základní modely o 7 a 67 miliardách parametrů (2023), první dvojjazyčný (EN/ZH) release, který v řadě úloh překonal LLaMA‑2 70B.[8]
- DeepSeek‑Coder (2023) — řada modelů pro programování (1,3 – 33 miliard) a její rozvoj Coder‑V2 (16 miliard / 236 miliard MoE, kontext 128K, 338 programovacích jazyků).[9]
- DeepSeek‑V2 (květen 2024) — 236 miliard (21 miliard aktivních) MoE‑LLM s MLA; trénován na 8,1 bilionu tokenů.[10]
- DeepSeek‑V3 (prosinec 2024) — 671 miliard (37 miliard aktivních); trénink ≈ 2,8 milionu GPU‑hodin na Nvidia H800 za přibližně 5,5 milionu dolarů.[11]
- DeepSeek‑R1 (leden 2025) — řada modelů pro logické uvažování (reasoning); verze R1‑0528 se přiblížila OpenAI o3 na AIME 2025 a LiveCodeBench.[12]
- DeepSeek‑VL / VL2 — multimodální VL modely (až 4,5 miliardy aktivních) s dynamickým mozaikovým zpracováním obrázků 1024×1024.[13]
- DeepSeek‑Math 7B — specializovaný model, 51,7 % přesnosti na benchmarku MATH; blízko GPT‑4.[14]
- DeepSeek‑Prover‑V2 — 671 miliard MoE pro dokazování teorémů v Lean 4; 63,5 % na miniF2F.
- Destilované R1 modely — otevřené verze od 1,5 do 70 miliard parametrů postavené na základech Llama a Qwen.[15]
Chronologie klíčových vydání
| Datum | Vydání a klíčové vlastnosti |
|---|---|
| 2. 11. 2023 | DeepSeek‑Coder v1: první open‑weight modely pro kód. |
| 29. 11. 2023 | DeepSeek LLM 7B/67B: dvojjazyčný model trénovaný na 2 bilionech tokenů. |
| 11. 1. 2024 | DeepSeek‑MoE 16B: debut architektury MoE. |
| 6. 2. 2024 | DeepSeek‑Math 7B: specializovaný model pro matematiku (51,7 % na MATH). |
| 6. 5. 2024 | DeepSeek‑V2 236B: zavedení architektur MLA a MoE. |
| 17. 6. 2024 | DeepSeek‑Coder‑V2: kontext 128K, podpora 338 programovacích jazyků. |
| 13. 12. 2024 | DeepSeek‑VL2: multimodální model postavený na MoE. |
| 27. 12. 2024 | DeepSeek‑V3 671B: vlajkový model trénovaný za méně než 6 milionů dolarů. |
| 20. 1. 2025 | DeepSeek‑R1 / R1‑Zero: modely pro uvažování trénované pomocí RL. |
| 27. 1. 2025 | Janus‑Pro: model pro generování obrázků překonávající DALL‑E 3. |
Výkonnost a benchmarky
- DeepSeek‑V3 překonala Llama 3.1 a Qwen 2.5 a přiblížila se úrovni GPT‑4 v testech MMLU a GPQA‑Diamond.[16]
- DeepSeek‑Coder‑V2 dosáhla 72,9 % na Arena‑Hard — parita s GPT‑4o a nejvyšší výsledek ze všech otevřených modelů s výjimkou Claude‑3.5‑Sonnet.[17]
- DeepSeek‑Math 7B — 51,7 % na MATH, což se blíží Gemini‑Ultra při desetkrát menší velikosti modelu.[18]
- R1‑Zero zvýšila výsledek AIME 2024 pass@1 z 15,6 % na 71 % pouze díky RL trénování.[19]
Licencování a open‑source
Většina modelů je šířena pod licencí MIT nebo Apache 2.0, která umožňuje komerční využití. Společnost zveřejňuje váhy na Hugging Face a GitHubu, avšak úplné datasety a trénovací pipeline zůstávají uzavřeny („open weight, but not full open source").
Vliv na průmysl
- Spuštění R1 způsobilo jednodenní propad kotací společností NVIDIA, Microsoft a dalších v reakci na zprávy o „modelu třídy GPT‑4 za 6 milionů dolarů".[20]
- Demonstrace úspěšného trénování na čipech Nvidia H800 v podmínkách exportních omezení podnítila diskusi o účinnosti amerických sankcí a urychlila vývoj čínských AI akcelerátorů (například Huawei Ascend 910B).
Kritika a omezení
- Bezpečnost: v testu HarmBench model R1 propustil 100 % nežádoucích požadavků („jailbreak").
- Politická cenzura: chatovací verze filtrují témata „citlivá" pro čínskou vládu (události na náměstí Tiananmen v roce 1989, status Tchaj-wanu apod.).
- Ukládání dat: ukládání uživatelských dat na serverech v Číně omezuje využití API západními korporacemi podléhajícími GDPR a podobným právním režimům.[21]
Literatura
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
Poznámky
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
Viz také
- Velké jazykové modely OpenAI
- Mixture-of-Experts