---
title: "DeepSeek (HU)"
source: "https://systems-analysis.info/int/DeepSeek_(HU)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1604
wiki_created_at: 2026-09-06T22:51:12Z
wiki_modified_at: 2026-09-06T22:51:12Z
downloaded_at: 2026-09-07T22:46:48Z
---

# DeepSeek (HU)

**DeepSeek** — kínai mesterséges intelligencia kutatócég, amely nagy nyelvi modelleket (LLM) és multimodális rendszereket fejleszt. A vállalat széles körű ismertségre tett szert modelljeinek nyílt súlyelosztása és magas gazdasági hatékonysága révén, ami az AI-piac árkorrekciójához vezetett 2024 végén és 2025 elején.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-1)</sup>

## Történet

A DeepSeek alapítója Liang Wenfeng, a *High‑Flyer* fedezeti alap vállalkozója és társalapítója. 2023 tavaszán a High‑Flyer leválasztotta mesterséges intelligencia kutatási részlegét, amely ugyanazon év májusában *DeepSeek AI* névvel önálló vállalattá alakult. 2025-re a létszám ~160 főre nőtt.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-2)</sup> A cég kezdettől fogva a nyitottság elvét hirdette — a súlyok engedélyköteles licencek alatti közzétételét („open‑weight") és az AGI-kutatás alapjaira való összpontosítást.

A legtöbb startuptól eltérően a DeepSeek a High-Flyer K+F-költségvetéséből finanszírozódik, ami az alapító szerint lehetővé teszi a hosszú távú célokra való koncentrálást a gyors monetizáció helyett.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-3)</sup>

A vállalat 2025 januárjában jelentős visszhangot keltett a technológiai és pénzügyi közösségben, amikor kiadta a **DeepSeek-R1** modellt. Az a bejelentés, hogy egy GPT-4-gyel összehasonlítható modell betanítása kevesebb mint 6 millió dollárba került (szemben a GPT-4-re becsült 100+ millió dollárral), a technológiai óriások részvényeinek zuhanását okozta, és az iparágat arra kényszerítette, hogy újragondolja a „több számítás = jobb modell" paradigmát.<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-4)</sup>

## Архитектурные особенности - Архitekturális jellemzők

Mixture‑of‑Experts (DeepSeekMoE)  
A DeepSeek legtöbb zászlóshajó modellje a szakértők keveréke (MoE) architektúrát alkalmazza. A „sűrű" modellektől eltérően, ahol a lekérdezések feldolgozása során az összes paraméter aktiválódik, a MoE-modellekben minden token esetén csak a speciális részháló-k („szakértők") kis hányada kerül bevonásra. A DeepSeek saját MoE-implementációt fejlesztett ki „megosztott" szakértőkkel, finomszemes szegmentálással és segédveszteség nélküli terheléselosztással, ami lehetővé teszi, hogy a több száz milliárd paraméterből csak egy töredék aktiválódjon, és drasztikusan csökkenti a számítási költségeket.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
A KV-gyorsítótár látens vektorrá való tömörítésének módszere, amely akár 93%-ot takarít meg a memóriából, és lehetővé teszi akár 128 000 token méretű kontextuális ablakok használatát. Ez a technológia kulcsfontosságú a hosszú szövegekkel való hatékony munkához.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-6)</sup>

FP8 training és Multi‑Token Prediction  
A V3 modellcsalád vegyes FP8 pontosságot (8-bites lebegőpontos számok) és több token egyidejű előrejelzését alkalmazza, ami felgyorsítja a betanítási és inferencia-folyamatokat.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-7)</sup>

## Modellcsalád

- **DeepSeek LLM** — 7 és 67 milliárd paraméteres alapmodellek (2023), az első kétnyelvű (EN/ZH) kiadás, amely számos feladatban felülmúlta a *LLaMA‑2 70B*-t.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — programozási modellcsalád (1,3–33 milliárd) és fejlesztése, a *Coder‑V2* (16 milliárd / 236 milliárd MoE, 128K kontextus, 338 programozási nyelv).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-9)</sup>
- **DeepSeek‑V2** (2024. május) — 236 milliárd (21 milliárd aktív) MoE‑LLM MLA-val; 8,1 billió tokenen betanítva.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-10)</sup>
- **DeepSeek‑V3** (2024. december) — 671 milliárd (37 milliárd aktív); betanítás ≈2,8 millió GPU-órán Nvidia H800-on, ≈5,5 millió dollár értékben.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-11)</sup>
- **DeepSeek‑R1** (2025. január) — logikai következtetésre (reasoning) szánt modellcsalád; az R1‑0528 verzió megközelítette az *OpenAI o3* szintjét az AIME 2025 és LiveCodeBench benchmarkokon.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — multimodális VL-modellek (legfeljebb 4,5 milliárd aktív paraméterrel) 1024×1024-es képek dinamikus mozaikos feldolgozásával.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — speciális modell, 51,7%-os pontossággal a MATH benchmarkon; közel a GPT‑4-hez.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — 671 milliárd MoE tételbizonyításhoz Lean 4-ben; 63,5% miniF2F-en.
- **Desztillált R1-modellek** — nyílt verziók 1,5 és 70 milliárd paraméter között, Llama és Qwen alapokon.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-15)</sup>

## Főbb kiadások időrendje

| Dátum           | Kiadás és főbb jellemzők                                                              |
|-----------------|---------------------------------------------------------------------------------------|
| 2023\. nov. 2.  | **DeepSeek‑Coder v1:** az első nyílt súlyú kódmodellek.                               |
| 2023\. nov. 29. | **DeepSeek LLM 7B/67B:** kétnyelvű modell, 2 billió tokenen betanítva.                |
| 2024\. jan. 11. | **DeepSeek‑MoE 16B:** az MoE-architektúra debütálása.                                 |
| 2024\. feb. 6.  | **DeepSeek‑Math 7B:** speciális matematikai modell (51,7% a MATH benchmarkon).        |
| 2024\. máj. 6.  | **DeepSeek‑V2 236B:** az MLA és MoE architektúrák bevezetése.                         |
| 2024\. jún. 17. | **DeepSeek‑Coder‑V2:** 128K kontextus, 338 programozási nyelv támogatása.             |
| 2024\. dec. 13. | **DeepSeek‑VL2:** MoE-alapú multimodális modell.                                      |
| 2024\. dec. 27. | **DeepSeek‑V3 671B:** zászlóshajó modell, kevesebb mint 6 millió dollárért betanítva. |
| 2025\. jan. 20. | **DeepSeek‑R1 / R1‑Zero:** RL segítségével betanított következtetési modellek.        |
| 2025\. jan. 27. | **Janus‑Pro:** képgenerálási modell, amely felülmúlja a DALL‑E 3-at.                  |

## Teljesítmény és benchmarkok

- A *DeepSeek‑V3* megelőzte a *Llama 3.1*-et és a *Qwen 2.5*-öt, és megközelítette a GPT‑4 szintjét MMLU és GPQA‑Diamond benchmarkokon.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-16)</sup>
- A *DeepSeek‑Coder‑V2* 72,9%-ot ért el az Arena‑Hard benchmarkon — paritásban a GPT‑4o-val, és minden nyílt modell közül a legjobb, a Claude‑3.5‑Sonnet kivételével.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-17)</sup>
- A *DeepSeek‑Math 7B* — 51,7% a MATH benchmarkon, ami a Gemini‑Ultra szintjéhez közelít, tizedakkora méret mellett.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-18)</sup>
- Az *R1‑Zero* az AIME 2024 pass@1 eredményt 15,6%-ról 71%-ra emelte, kizárólag RL-betanítással.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-19)</sup>

## Licencelés és open‑source

A legtöbb modell MIT vagy Apache 2.0 licenc alatt terjed, amely kereskedelmi felhasználást is lehetővé tesz. A vállalat közzéteszi a súlyokat a Hugging Face-en és a GitHubon, azonban a teljes adatkészleteket és a betanítási folyamatokat zárva tartja („open weight, but not full open source").

## Az iparágra gyakorolt hatás

- Az R1 bevezetése egynapos árfolyamesést okozott az NVIDIA, a Microsoft és más vállalatok részvényeinél, a „GPT‑4 szintű modell 6 millió dollárért" hírek nyomán.<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-20)</sup>
- Az Nvidia H800 chipeknél — amelyek exportkorlátozás alá esnek — való sikeres betanítás bemutatása vitát váltott ki az amerikai szankciók hatékonyságáról, és felgyorsította a kínai AI-gyorsítók fejlesztését (pl. Huawei Ascend 910B).

## Kritika és korlátok

- Biztonság: a HarmBench teszten az R1 modell a nem kívánt lekérdezések 100%-át átengedte („jailbreak").
- Politikai cenzúra: a chat-verziók szűrik a kínai kormány számára „érzékeny" témákat (az 1989-es Tienanmen téri események, Tajvan státusza stb.).
- Adattárolás: a felhasználói adatok kínai szervereken való tárolása korlátozza az API használatát a GDPR és hasonló jogi rendszereknek megfelelő nyugati vállalatoknál.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(HU)#cite_note-21)</sup>

## Irodalom

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Jegyzetek

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(HU)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>

## Lásd még

- Az OpenAI nagy nyelvi modelljei
- Mixture-of-Experts
