DeepSeek (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — kínai mesterséges intelligencia kutatócég, amely nagy nyelvi modelleket (LLM) és multimodális rendszereket fejleszt. A vállalat széles körű ismertségre tett szert modelljeinek nyílt súlyelosztása és magas gazdasági hatékonysága révén, ami az AI-piac árkorrekciójához vezetett 2024 végén és 2025 elején.[1]

Történet

A DeepSeek alapítója Liang Wenfeng, a High‑Flyer fedezeti alap vállalkozója és társalapítója. 2023 tavaszán a High‑Flyer leválasztotta mesterséges intelligencia kutatási részlegét, amely ugyanazon év májusában DeepSeek AI névvel önálló vállalattá alakult. 2025-re a létszám ~160 főre nőtt.[2] A cég kezdettől fogva a nyitottság elvét hirdette — a súlyok engedélyköteles licencek alatti közzétételét („open‑weight") és az AGI-kutatás alapjaira való összpontosítást.

A legtöbb startuptól eltérően a DeepSeek a High-Flyer K+F-költségvetéséből finanszírozódik, ami az alapító szerint lehetővé teszi a hosszú távú célokra való koncentrálást a gyors monetizáció helyett.[3]

A vállalat 2025 januárjában jelentős visszhangot keltett a technológiai és pénzügyi közösségben, amikor kiadta a DeepSeek-R1 modellt. Az a bejelentés, hogy egy GPT-4-gyel összehasonlítható modell betanítása kevesebb mint 6 millió dollárba került (szemben a GPT-4-re becsült 100+ millió dollárral), a technológiai óriások részvényeinek zuhanását okozta, és az iparágat arra kényszerítette, hogy újragondolja a „több számítás = jobb modell" paradigmát.[4]

Архитектурные особенности - Архitekturális jellemzők

Mixture‑of‑Experts (DeepSeekMoE)
A DeepSeek legtöbb zászlóshajó modellje a szakértők keveréke (MoE) architektúrát alkalmazza. A „sűrű" modellektől eltérően, ahol a lekérdezések feldolgozása során az összes paraméter aktiválódik, a MoE-modellekben minden token esetén csak a speciális részháló-k („szakértők") kis hányada kerül bevonásra. A DeepSeek saját MoE-implementációt fejlesztett ki „megosztott" szakértőkkel, finomszemes szegmentálással és segédveszteség nélküli terheléselosztással, ami lehetővé teszi, hogy a több száz milliárd paraméterből csak egy töredék aktiválódjon, és drasztikusan csökkenti a számítási költségeket.[5]
Multi‑Head Latent Attention (MLA)
A KV-gyorsítótár látens vektorrá való tömörítésének módszere, amely akár 93%-ot takarít meg a memóriából, és lehetővé teszi akár 128 000 token méretű kontextuális ablakok használatát. Ez a technológia kulcsfontosságú a hosszú szövegekkel való hatékony munkához.[6]
FP8 training és Multi‑Token Prediction
A V3 modellcsalád vegyes FP8 pontosságot (8-bites lebegőpontos számok) és több token egyidejű előrejelzését alkalmazza, ami felgyorsítja a betanítási és inferencia-folyamatokat.[7]

Modellcsalád

  • DeepSeek LLM — 7 és 67 milliárd paraméteres alapmodellek (2023), az első kétnyelvű (EN/ZH) kiadás, amely számos feladatban felülmúlta a LLaMA‑2 70B-t.[8]
  • DeepSeek‑Coder (2023) — programozási modellcsalád (1,3–33 milliárd) és fejlesztése, a Coder‑V2 (16 milliárd / 236 milliárd MoE, 128K kontextus, 338 programozási nyelv).[9]
  • DeepSeek‑V2 (2024. május) — 236 milliárd (21 milliárd aktív) MoE‑LLM MLA-val; 8,1 billió tokenen betanítva.[10]
  • DeepSeek‑V3 (2024. december) — 671 milliárd (37 milliárd aktív); betanítás ≈2,8 millió GPU-órán Nvidia H800-on, ≈5,5 millió dollár értékben.[11]
  • DeepSeek‑R1 (2025. január) — logikai következtetésre (reasoning) szánt modellcsalád; az R1‑0528 verzió megközelítette az OpenAI o3 szintjét az AIME 2025 és LiveCodeBench benchmarkokon.[12]
  • DeepSeek‑VL / VL2 — multimodális VL-modellek (legfeljebb 4,5 milliárd aktív paraméterrel) 1024×1024-es képek dinamikus mozaikos feldolgozásával.[13]
  • DeepSeek‑Math 7B — speciális modell, 51,7%-os pontossággal a MATH benchmarkon; közel a GPT‑4-hez.[14]
  • DeepSeek‑Prover‑V2 — 671 milliárd MoE tételbizonyításhoz Lean 4-ben; 63,5% miniF2F-en.
  • Desztillált R1-modellek — nyílt verziók 1,5 és 70 milliárd paraméter között, Llama és Qwen alapokon.[15]

Főbb kiadások időrendje

Dátum Kiadás és főbb jellemzők
2023. nov. 2. DeepSeek‑Coder v1: az első nyílt súlyú kódmodellek.
2023. nov. 29. DeepSeek LLM 7B/67B: kétnyelvű modell, 2 billió tokenen betanítva.
2024. jan. 11. DeepSeek‑MoE 16B: az MoE-architektúra debütálása.
2024. feb. 6. DeepSeek‑Math 7B: speciális matematikai modell (51,7% a MATH benchmarkon).
2024. máj. 6. DeepSeek‑V2 236B: az MLA és MoE architektúrák bevezetése.
2024. jún. 17. DeepSeek‑Coder‑V2: 128K kontextus, 338 programozási nyelv támogatása.
2024. dec. 13. DeepSeek‑VL2: MoE-alapú multimodális modell.
2024. dec. 27. DeepSeek‑V3 671B: zászlóshajó modell, kevesebb mint 6 millió dollárért betanítva.
2025. jan. 20. DeepSeek‑R1 / R1‑Zero: RL segítségével betanított következtetési modellek.
2025. jan. 27. Janus‑Pro: képgenerálási modell, amely felülmúlja a DALL‑E 3-at.

Teljesítmény és benchmarkok

  • A DeepSeek‑V3 megelőzte a Llama 3.1-et és a Qwen 2.5-öt, és megközelítette a GPT‑4 szintjét MMLU és GPQA‑Diamond benchmarkokon.[16]
  • A DeepSeek‑Coder‑V2 72,9%-ot ért el az Arena‑Hard benchmarkon — paritásban a GPT‑4o-val, és minden nyílt modell közül a legjobb, a Claude‑3.5‑Sonnet kivételével.[17]
  • A DeepSeek‑Math 7B — 51,7% a MATH benchmarkon, ami a Gemini‑Ultra szintjéhez közelít, tizedakkora méret mellett.[18]
  • Az R1‑Zero az AIME 2024 pass@1 eredményt 15,6%-ról 71%-ra emelte, kizárólag RL-betanítással.[19]

Licencelés és open‑source

A legtöbb modell MIT vagy Apache 2.0 licenc alatt terjed, amely kereskedelmi felhasználást is lehetővé tesz. A vállalat közzéteszi a súlyokat a Hugging Face-en és a GitHubon, azonban a teljes adatkészleteket és a betanítási folyamatokat zárva tartja („open weight, but not full open source").

Az iparágra gyakorolt hatás

  • Az R1 bevezetése egynapos árfolyamesést okozott az NVIDIA, a Microsoft és más vállalatok részvényeinél, a „GPT‑4 szintű modell 6 millió dollárért" hírek nyomán.[20]
  • Az Nvidia H800 chipeknél — amelyek exportkorlátozás alá esnek — való sikeres betanítás bemutatása vitát váltott ki az amerikai szankciók hatékonyságáról, és felgyorsította a kínai AI-gyorsítók fejlesztését (pl. Huawei Ascend 910B).

Kritika és korlátok

  • Biztonság: a HarmBench teszten az R1 modell a nem kívánt lekérdezések 100%-át átengedte („jailbreak").
  • Politikai cenzúra: a chat-verziók szűrik a kínai kormány számára „érzékeny" témákat (az 1989-es Tienanmen téri események, Tajvan státusza stb.).
  • Adattárolás: a felhasználói adatok kínai szervereken való tárolása korlátozza az API használatát a GDPR és hasonló jogi rendszereknek megfelelő nyugati vállalatoknál.[21]

Irodalom

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Jegyzetek

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Lásd még

  • Az OpenAI nagy nyelvi modelljei
  • Mixture-of-Experts