---
title: "DeepSeek (PL)"
source: "https://systems-analysis.info/int/DeepSeek_(PL)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 1609
wiki_created_at: 2026-09-06T22:51:17Z
wiki_modified_at: 2026-09-06T22:51:17Z
downloaded_at: 2026-09-07T22:46:49Z
---

# DeepSeek (PL)

**DeepSeek** — chińska firma badawcza z dziedziny sztucznej inteligencji, opracowująca duże modele językowe (LLM) oraz systemy multimodalne. Firma zyskała szeroką rozpoznawalność dzięki otwartemu udostępnianiu wag swoich modeli oraz ich wysokiej efektywności kosztowej, co wywołało korektę cen na rynku AI pod koniec 2024 i na początku 2025 roku.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-1)</sup>

## Historia

Założycielem DeepSeek jest przedsiębiorca i współzałożyciel funduszu hedgingowego *High‑Flyer* Liang Wenfeng. Wiosną 2023 roku High‑Flyer wyodrębnił dział badań nad AI, który w maju tego samego roku przekształcił się w firmę *DeepSeek AI*. Już do 2025 roku liczba pracowników wzrosła do ~160 osób.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-2)</sup> Od pierwszych dni firma deklarowała kurs na otwartość — publikację wag („open‑weight") na licencjach zezwalających oraz nastawienie na fundamentalne badania nad AGI.

W odróżnieniu od większości startupów, DeepSeek jest finansowany z budżetu R&D High-Flyer, co według założyciela pozwala skupić się na celach długoterminowych, a nie na natychmiastowej monetyzacji.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-3)</sup>

Znaczący rozgłos w środowisku technologicznym i finansowym firma wywołała w styczniu 2025 roku po wydaniu modelu **DeepSeek-R1**. Informacja o tym, że koszt trenowania modelu porównywalnego z GPT-4 wyniósł mniej niż 6 mln USD (w porównaniu z szacunkami przekraczającymi 100 mln USD dla GPT-4), spowodowała spadek notowań giełdowych technologicznych gigantów i zmusiła branżę do przewartościowania paradygmatu „więcej obliczeń = lepszy model".<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-4)</sup>

## Cechy architektoniczne

Mixture‑of‑Experts (DeepSeekMoE)  
Większość flagowych modeli DeepSeek wykorzystuje architekturę mieszaniny ekspertów (MoE). W odróżnieniu od modeli „gęstych", w których podczas przetwarzania zapytania aktywowane są wszystkie parametry, w modelach MoE dla każdego tokenu uruchamiana jest jedynie niewielka część wyspecjalizowanych podsieci („ekspertów"). DeepSeek opracował własną implementację MoE ze „wspólnymi" ekspertami, drobnoziarnistą segmentacją i równoważeniem obciążenia bez pomocniczych strat, co pozwala aktywować jedynie część spośród setek miliardów parametrów i znacznie redukować koszty obliczeniowe.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
Metoda kompresji pamięci podręcznej KV do wektora latentnego, oszczędzająca do 93 % pamięci i umożliwiająca korzystanie z okien kontekstowych o rozmiarze do 128 000 tokenów. Technologia ta jest kluczowa dla efektywnej pracy z długimi tekstami.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-6)</sup>

FP8 training i Multi‑Token Prediction  
W modelach rodziny V3 stosowana jest mieszana precyzja FP8 (8-bitowe liczby zmiennoprzecinkowe) oraz jednoczesne przewidywanie wielu tokenów, co przyspiesza procesy trenowania i inferencji.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-7)</sup>

## Rodzina modeli

- **DeepSeek LLM** — modele bazowe o 7 i 67 mld parametrów (2023), pierwsze dwujęzyczne (EN/ZH) wydanie, które przewyższyło *LLaMA‑2 70B* w szeregu zadań.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — seria modeli do programowania (1,3–33 mld) i jej rozwinięcie *Coder‑V2* (16 mld / 236 mld MoE, kontekst 128K, 338 języków programowania).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-9)</sup>
- **DeepSeek‑V2** (maj 2024) — 236 mld (21 mld aktywnych) MoE‑LLM z MLA; wytrenowany na 8,1 bln tokenów.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-10)</sup>
- **DeepSeek‑V3** (grudzień 2024) — 671 mld (37 mld aktywnych); trenowanie ≈2,8 mln godzin GPU na Nvidia H800, koszt ≈5,5 mln USD.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-11)</sup>
- **DeepSeek‑R1** (styczeń 2025) — seria modeli do logicznego rozumowania (reasoning); wersja R1‑0528 zbliżyła się do *OpenAI o3* na AIME 2025 i LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — multimodalne modele VL (do 4,5 mld aktywnych) z dynamicznym mozaikowym przetwarzaniem obrazów 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — wyspecjalizowany model, 51,7 % dokładności na benchmarku MATH; zbliżony do GPT‑4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — 671 mld MoE do dowodzenia twierdzeń w Lean 4; 63,5 % na miniF2F.
- **Dystylowane modele R1** — otwarte wersje od 1,5 do 70 mld parametrów na bazach Llama i Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-15)</sup>

## Harmonogram kluczowych wydań

| Data        | Wydanie i kluczowe cechy                                                     |
|-------------|------------------------------------------------------------------------------|
| 2 lis 2023  | **DeepSeek‑Coder v1:** pierwsze modele open‑weight dla kodu.                 |
| 29 lis 2023 | **DeepSeek LLM 7B/67B:** dwujęzyczny model wytrenowany na 2 bln tokenów.     |
| 11 sty 2024 | **DeepSeek‑MoE 16B:** debiut architektury MoE.                               |
| 6 lut 2024  | **DeepSeek‑Math 7B:** wyspecjalizowany model do matematyki (51,7 % na MATH). |
| 6 maj 2024  | **DeepSeek‑V2 236B:** wprowadzenie architektur MLA i MoE.                    |
| 17 cze 2024 | **DeepSeek‑Coder‑V2:** kontekst 128K, obsługa 338 języków programowania.     |
| 13 gru 2024 | **DeepSeek‑VL2:** multimodalny model oparty na MoE.                          |
| 27 gru 2024 | **DeepSeek‑V3 671B:** flagowy model wytrenowany za mniej niż 6 mln USD.      |
| 20 sty 2025 | **DeepSeek‑R1 / R1‑Zero:** modele do rozumowania wytrenowane z użyciem RL.   |
| 27 sty 2025 | **Janus‑Pro:** model do generowania obrazów przewyższający DALL‑E 3.         |

## Wydajność i benchmarki

- *DeepSeek‑V3* prześcignęła *Llama 3.1* i *Qwen 2.5* oraz zbliżyła się do poziomu GPT‑4 w testach MMLU i GPQA‑Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-16)</sup>
- *DeepSeek‑Coder‑V2* uzyskała 72,9 % na Arena‑Hard — wynik równy GPT‑4o i lepszy od wszystkich otwartych modeli z wyjątkiem Claude‑3.5‑Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-17)</sup>
- *DeepSeek‑Math 7B* — 51,7 % na MATH, co jest zbliżone do Gemini‑Ultra przy dziesięciokrotnie mniejszym rozmiarze.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-18)</sup>
- *R1‑Zero* podniosła wynik AIME 2024 pass@1 z 15,6 % do 71 % wyłącznie dzięki trenowaniu RL.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-19)</sup>

## Licencjonowanie i open‑source

Większość modeli jest dystrybuowana na licencji MIT lub Apache 2.0, dopuszczającej użycie komercyjne. Firma publikuje wagi na Hugging Face i GitHub, jednak zachowuje w postaci zamkniętej pełne datasety oraz potoki treningowe („open weight, but not full open source").

## Wpływ na branżę

- Premiera R1 wywołała jednodzienny spadek notowań NVIDIA, Microsoft i innych spółek na fali doniesień o „modelu klasy GPT‑4 za 6 mln USD".<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-20)</sup>
- Demonstracja skutecznego trenowania na układach Nvidia H800 objętych ograniczeniami eksportowymi pobudziła dyskusję o skuteczności sankcji USA i przyspieszyła rozwój chińskich akceleratorów AI (np. Huawei Ascend 910B).

## Krytyka i ograniczenia

- Bezpieczeństwo: w teście HarmBench model R1 przepuścił 100 % niepożądanych zapytań („jailbreak").
- Cenzura polityczna: wersje czatowe filtrują tematy „wrażliwe" dla chińskiego rządu (wydarzenia na placu Tiananmen w 1989 roku, status Tajwanu itp.).
- Przechowywanie danych: przechowywanie danych użytkowników na serwerach w Chinach ogranicza korzystanie z API przez zachodnie korporacje podlegające GDPR i podobnym reżimom prawnym.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(PL)#cite_note-21)</sup>

## Literatura

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Przypisy

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(PL)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>

## Zobacz też

- Duże modele językowe OpenAI
- Mixture-of-Experts
