DeepSeek (HU)
DeepSeek — kínai mesterséges intelligencia kutatócég, amely nagy nyelvi modelleket (LLM) és multimodális rendszereket fejleszt. A vállalat széles körű ismertségre tett szert modelljeinek nyílt súlyelosztása és magas gazdasági hatékonysága révén, ami az AI-piac árkorrekciójához vezetett 2024 végén és 2025 elején.[1]
Történet
A DeepSeek alapítója Liang Wenfeng, a High‑Flyer fedezeti alap vállalkozója és társalapítója. 2023 tavaszán a High‑Flyer leválasztotta mesterséges intelligencia kutatási részlegét, amely ugyanazon év májusában DeepSeek AI névvel önálló vállalattá alakult. 2025-re a létszám ~160 főre nőtt.[2] A cég kezdettől fogva a nyitottság elvét hirdette — a súlyok engedélyköteles licencek alatti közzétételét („open‑weight") és az AGI-kutatás alapjaira való összpontosítást.
A legtöbb startuptól eltérően a DeepSeek a High-Flyer K+F-költségvetéséből finanszírozódik, ami az alapító szerint lehetővé teszi a hosszú távú célokra való koncentrálást a gyors monetizáció helyett.[3]
A vállalat 2025 januárjában jelentős visszhangot keltett a technológiai és pénzügyi közösségben, amikor kiadta a DeepSeek-R1 modellt. Az a bejelentés, hogy egy GPT-4-gyel összehasonlítható modell betanítása kevesebb mint 6 millió dollárba került (szemben a GPT-4-re becsült 100+ millió dollárral), a technológiai óriások részvényeinek zuhanását okozta, és az iparágat arra kényszerítette, hogy újragondolja a „több számítás = jobb modell" paradigmát.[4]
Архитектурные особенности - Архitekturális jellemzők
- Mixture‑of‑Experts (DeepSeekMoE)
- A DeepSeek legtöbb zászlóshajó modellje a szakértők keveréke (MoE) architektúrát alkalmazza. A „sűrű" modellektől eltérően, ahol a lekérdezések feldolgozása során az összes paraméter aktiválódik, a MoE-modellekben minden token esetén csak a speciális részháló-k („szakértők") kis hányada kerül bevonásra. A DeepSeek saját MoE-implementációt fejlesztett ki „megosztott" szakértőkkel, finomszemes szegmentálással és segédveszteség nélküli terheléselosztással, ami lehetővé teszi, hogy a több száz milliárd paraméterből csak egy töredék aktiválódjon, és drasztikusan csökkenti a számítási költségeket.[5]
- Multi‑Head Latent Attention (MLA)
- A KV-gyorsítótár látens vektorrá való tömörítésének módszere, amely akár 93%-ot takarít meg a memóriából, és lehetővé teszi akár 128 000 token méretű kontextuális ablakok használatát. Ez a technológia kulcsfontosságú a hosszú szövegekkel való hatékony munkához.[6]
- FP8 training és Multi‑Token Prediction
- A V3 modellcsalád vegyes FP8 pontosságot (8-bites lebegőpontos számok) és több token egyidejű előrejelzését alkalmazza, ami felgyorsítja a betanítási és inferencia-folyamatokat.[7]
Modellcsalád
- DeepSeek LLM — 7 és 67 milliárd paraméteres alapmodellek (2023), az első kétnyelvű (EN/ZH) kiadás, amely számos feladatban felülmúlta a LLaMA‑2 70B-t.[8]
- DeepSeek‑Coder (2023) — programozási modellcsalád (1,3–33 milliárd) és fejlesztése, a Coder‑V2 (16 milliárd / 236 milliárd MoE, 128K kontextus, 338 programozási nyelv).[9]
- DeepSeek‑V2 (2024. május) — 236 milliárd (21 milliárd aktív) MoE‑LLM MLA-val; 8,1 billió tokenen betanítva.[10]
- DeepSeek‑V3 (2024. december) — 671 milliárd (37 milliárd aktív); betanítás ≈2,8 millió GPU-órán Nvidia H800-on, ≈5,5 millió dollár értékben.[11]
- DeepSeek‑R1 (2025. január) — logikai következtetésre (reasoning) szánt modellcsalád; az R1‑0528 verzió megközelítette az OpenAI o3 szintjét az AIME 2025 és LiveCodeBench benchmarkokon.[12]
- DeepSeek‑VL / VL2 — multimodális VL-modellek (legfeljebb 4,5 milliárd aktív paraméterrel) 1024×1024-es képek dinamikus mozaikos feldolgozásával.[13]
- DeepSeek‑Math 7B — speciális modell, 51,7%-os pontossággal a MATH benchmarkon; közel a GPT‑4-hez.[14]
- DeepSeek‑Prover‑V2 — 671 milliárd MoE tételbizonyításhoz Lean 4-ben; 63,5% miniF2F-en.
- Desztillált R1-modellek — nyílt verziók 1,5 és 70 milliárd paraméter között, Llama és Qwen alapokon.[15]
Főbb kiadások időrendje
| Dátum | Kiadás és főbb jellemzők |
|---|---|
| 2023. nov. 2. | DeepSeek‑Coder v1: az első nyílt súlyú kódmodellek. |
| 2023. nov. 29. | DeepSeek LLM 7B/67B: kétnyelvű modell, 2 billió tokenen betanítva. |
| 2024. jan. 11. | DeepSeek‑MoE 16B: az MoE-architektúra debütálása. |
| 2024. feb. 6. | DeepSeek‑Math 7B: speciális matematikai modell (51,7% a MATH benchmarkon). |
| 2024. máj. 6. | DeepSeek‑V2 236B: az MLA és MoE architektúrák bevezetése. |
| 2024. jún. 17. | DeepSeek‑Coder‑V2: 128K kontextus, 338 programozási nyelv támogatása. |
| 2024. dec. 13. | DeepSeek‑VL2: MoE-alapú multimodális modell. |
| 2024. dec. 27. | DeepSeek‑V3 671B: zászlóshajó modell, kevesebb mint 6 millió dollárért betanítva. |
| 2025. jan. 20. | DeepSeek‑R1 / R1‑Zero: RL segítségével betanított következtetési modellek. |
| 2025. jan. 27. | Janus‑Pro: képgenerálási modell, amely felülmúlja a DALL‑E 3-at. |
Teljesítmény és benchmarkok
- A DeepSeek‑V3 megelőzte a Llama 3.1-et és a Qwen 2.5-öt, és megközelítette a GPT‑4 szintjét MMLU és GPQA‑Diamond benchmarkokon.[16]
- A DeepSeek‑Coder‑V2 72,9%-ot ért el az Arena‑Hard benchmarkon — paritásban a GPT‑4o-val, és minden nyílt modell közül a legjobb, a Claude‑3.5‑Sonnet kivételével.[17]
- A DeepSeek‑Math 7B — 51,7% a MATH benchmarkon, ami a Gemini‑Ultra szintjéhez közelít, tizedakkora méret mellett.[18]
- Az R1‑Zero az AIME 2024 pass@1 eredményt 15,6%-ról 71%-ra emelte, kizárólag RL-betanítással.[19]
Licencelés és open‑source
A legtöbb modell MIT vagy Apache 2.0 licenc alatt terjed, amely kereskedelmi felhasználást is lehetővé tesz. A vállalat közzéteszi a súlyokat a Hugging Face-en és a GitHubon, azonban a teljes adatkészleteket és a betanítási folyamatokat zárva tartja („open weight, but not full open source").
Az iparágra gyakorolt hatás
- Az R1 bevezetése egynapos árfolyamesést okozott az NVIDIA, a Microsoft és más vállalatok részvényeinél, a „GPT‑4 szintű modell 6 millió dollárért" hírek nyomán.[20]
- Az Nvidia H800 chipeknél — amelyek exportkorlátozás alá esnek — való sikeres betanítás bemutatása vitát váltott ki az amerikai szankciók hatékonyságáról, és felgyorsította a kínai AI-gyorsítók fejlesztését (pl. Huawei Ascend 910B).
Kritika és korlátok
- Biztonság: a HarmBench teszten az R1 modell a nem kívánt lekérdezések 100%-át átengedte („jailbreak").
- Politikai cenzúra: a chat-verziók szűrik a kínai kormány számára „érzékeny" témákat (az 1989-es Tienanmen téri események, Tajvan státusza stb.).
- Adattárolás: a felhasználói adatok kínai szervereken való tárolása korlátozza az API használatát a GDPR és hasonló jogi rendszereknek megfelelő nyugati vállalatoknál.[21]
Irodalom
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
Jegyzetek
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
Lásd még
- Az OpenAI nagy nyelvi modelljei
- Mixture-of-Experts