DeepSeek (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — chińska firma badawcza z dziedziny sztucznej inteligencji, opracowująca duże modele językowe (LLM) oraz systemy multimodalne. Firma zyskała szeroką rozpoznawalność dzięki otwartemu udostępnianiu wag swoich modeli oraz ich wysokiej efektywności kosztowej, co wywołało korektę cen na rynku AI pod koniec 2024 i na początku 2025 roku.[1]

Historia

Założycielem DeepSeek jest przedsiębiorca i współzałożyciel funduszu hedgingowego High‑Flyer Liang Wenfeng. Wiosną 2023 roku High‑Flyer wyodrębnił dział badań nad AI, który w maju tego samego roku przekształcił się w firmę DeepSeek AI. Już do 2025 roku liczba pracowników wzrosła do ~160 osób.[2] Od pierwszych dni firma deklarowała kurs na otwartość — publikację wag („open‑weight") na licencjach zezwalających oraz nastawienie na fundamentalne badania nad AGI.

W odróżnieniu od większości startupów, DeepSeek jest finansowany z budżetu R&D High-Flyer, co według założyciela pozwala skupić się na celach długoterminowych, a nie na natychmiastowej monetyzacji.[3]

Znaczący rozgłos w środowisku technologicznym i finansowym firma wywołała w styczniu 2025 roku po wydaniu modelu DeepSeek-R1. Informacja o tym, że koszt trenowania modelu porównywalnego z GPT-4 wyniósł mniej niż 6 mln USD (w porównaniu z szacunkami przekraczającymi 100 mln USD dla GPT-4), spowodowała spadek notowań giełdowych technologicznych gigantów i zmusiła branżę do przewartościowania paradygmatu „więcej obliczeń = lepszy model".[4]

Cechy architektoniczne

Mixture‑of‑Experts (DeepSeekMoE)
Większość flagowych modeli DeepSeek wykorzystuje architekturę mieszaniny ekspertów (MoE). W odróżnieniu od modeli „gęstych", w których podczas przetwarzania zapytania aktywowane są wszystkie parametry, w modelach MoE dla każdego tokenu uruchamiana jest jedynie niewielka część wyspecjalizowanych podsieci („ekspertów"). DeepSeek opracował własną implementację MoE ze „wspólnymi" ekspertami, drobnoziarnistą segmentacją i równoważeniem obciążenia bez pomocniczych strat, co pozwala aktywować jedynie część spośród setek miliardów parametrów i znacznie redukować koszty obliczeniowe.[5]
Multi‑Head Latent Attention (MLA)
Metoda kompresji pamięci podręcznej KV do wektora latentnego, oszczędzająca do 93 % pamięci i umożliwiająca korzystanie z okien kontekstowych o rozmiarze do 128 000 tokenów. Technologia ta jest kluczowa dla efektywnej pracy z długimi tekstami.[6]
FP8 training i Multi‑Token Prediction
W modelach rodziny V3 stosowana jest mieszana precyzja FP8 (8-bitowe liczby zmiennoprzecinkowe) oraz jednoczesne przewidywanie wielu tokenów, co przyspiesza procesy trenowania i inferencji.[7]

Rodzina modeli

  • DeepSeek LLM — modele bazowe o 7 i 67 mld parametrów (2023), pierwsze dwujęzyczne (EN/ZH) wydanie, które przewyższyło LLaMA‑2 70B w szeregu zadań.[8]
  • DeepSeek‑Coder (2023) — seria modeli do programowania (1,3–33 mld) i jej rozwinięcie Coder‑V2 (16 mld / 236 mld MoE, kontekst 128K, 338 języków programowania).[9]
  • DeepSeek‑V2 (maj 2024) — 236 mld (21 mld aktywnych) MoE‑LLM z MLA; wytrenowany na 8,1 bln tokenów.[10]
  • DeepSeek‑V3 (grudzień 2024) — 671 mld (37 mld aktywnych); trenowanie ≈2,8 mln godzin GPU na Nvidia H800, koszt ≈5,5 mln USD.[11]
  • DeepSeek‑R1 (styczeń 2025) — seria modeli do logicznego rozumowania (reasoning); wersja R1‑0528 zbliżyła się do OpenAI o3 na AIME 2025 i LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — multimodalne modele VL (do 4,5 mld aktywnych) z dynamicznym mozaikowym przetwarzaniem obrazów 1024×1024.[13]
  • DeepSeek‑Math 7B — wyspecjalizowany model, 51,7 % dokładności na benchmarku MATH; zbliżony do GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 mld MoE do dowodzenia twierdzeń w Lean 4; 63,5 % na miniF2F.
  • Dystylowane modele R1 — otwarte wersje od 1,5 do 70 mld parametrów na bazach Llama i Qwen.[15]

Harmonogram kluczowych wydań

Data Wydanie i kluczowe cechy
2 lis 2023 DeepSeek‑Coder v1: pierwsze modele open‑weight dla kodu.
29 lis 2023 DeepSeek LLM 7B/67B: dwujęzyczny model wytrenowany na 2 bln tokenów.
11 sty 2024 DeepSeek‑MoE 16B: debiut architektury MoE.
6 lut 2024 DeepSeek‑Math 7B: wyspecjalizowany model do matematyki (51,7 % na MATH).
6 maj 2024 DeepSeek‑V2 236B: wprowadzenie architektur MLA i MoE.
17 cze 2024 DeepSeek‑Coder‑V2: kontekst 128K, obsługa 338 języków programowania.
13 gru 2024 DeepSeek‑VL2: multimodalny model oparty na MoE.
27 gru 2024 DeepSeek‑V3 671B: flagowy model wytrenowany za mniej niż 6 mln USD.
20 sty 2025 DeepSeek‑R1 / R1‑Zero: modele do rozumowania wytrenowane z użyciem RL.
27 sty 2025 Janus‑Pro: model do generowania obrazów przewyższający DALL‑E 3.

Wydajność i benchmarki

  • DeepSeek‑V3 prześcignęła Llama 3.1 i Qwen 2.5 oraz zbliżyła się do poziomu GPT‑4 w testach MMLU i GPQA‑Diamond.[16]
  • DeepSeek‑Coder‑V2 uzyskała 72,9 % na Arena‑Hard — wynik równy GPT‑4o i lepszy od wszystkich otwartych modeli z wyjątkiem Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — 51,7 % na MATH, co jest zbliżone do Gemini‑Ultra przy dziesięciokrotnie mniejszym rozmiarze.[18]
  • R1‑Zero podniosła wynik AIME 2024 pass@1 z 15,6 % do 71 % wyłącznie dzięki trenowaniu RL.[19]

Licencjonowanie i open‑source

Większość modeli jest dystrybuowana na licencji MIT lub Apache 2.0, dopuszczającej użycie komercyjne. Firma publikuje wagi na Hugging Face i GitHub, jednak zachowuje w postaci zamkniętej pełne datasety oraz potoki treningowe („open weight, but not full open source").

Wpływ na branżę

  • Premiera R1 wywołała jednodzienny spadek notowań NVIDIA, Microsoft i innych spółek na fali doniesień o „modelu klasy GPT‑4 za 6 mln USD".[20]
  • Demonstracja skutecznego trenowania na układach Nvidia H800 objętych ograniczeniami eksportowymi pobudziła dyskusję o skuteczności sankcji USA i przyspieszyła rozwój chińskich akceleratorów AI (np. Huawei Ascend 910B).

Krytyka i ograniczenia

  • Bezpieczeństwo: w teście HarmBench model R1 przepuścił 100 % niepożądanych zapytań („jailbreak").
  • Cenzura polityczna: wersje czatowe filtrują tematy „wrażliwe" dla chińskiego rządu (wydarzenia na placu Tiananmen w 1989 roku, status Tajwanu itp.).
  • Przechowywanie danych: przechowywanie danych użytkowników na serwerach w Chinach ogranicza korzystanie z API przez zachodnie korporacje podlegające GDPR i podobnym reżimom prawnym.[21]

Literatura

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Przypisy

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Zobacz też

  • Duże modele językowe OpenAI
  • Mixture-of-Experts