DeepSeek (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — companie chineză de cercetare în domeniul inteligenței artificiale, care dezvoltă modele lingvistice de mari dimensiuni (LLM) și sisteme multimodale. Compania a dobândit notorietate largă datorită distribuției deschise a ponderilor modelelor sale și eficienței lor economice ridicate, ceea ce a provocat o ajustare a prețurilor pe piața AI la sfârșitul anului 2024 și începutul anului 2025.[1]

Istoric

Fondatorul DeepSeek este antreprenorul și co-fondatorul fondului de hedging High‑Flyer, Liang Wenfeng. În primăvara anului 2023, High‑Flyer a separat divizia de cercetare în domeniul AI, care în mai același an a devenit compania DeepSeek AI. Până în 2025, personalul a crescut la aproximativ 160 de angajați.[2] Încă din primele zile, compania a declarat un curs orientat spre deschidere — publicarea ponderilor („open‑weight") sub licențe permisive și orientarea spre cercetare fundamentală în domeniul AGI.

Spre deosebire de majoritatea startup-urilor, DeepSeek este finanțat din bugetul de R&D al High-Flyer, ceea ce, potrivit fondatorului, permite concentrarea pe obiective pe termen lung, nu pe monetizarea imediată.[3]

Compania a generat un ecou semnificativ în comunitatea tehnologică și financiară în ianuarie 2025, după lansarea modelului DeepSeek-R1. Declarația conform căreia antrenarea unui model comparabil cu GPT-4 a costat mai puțin de 6 milioane de dolari (față de estimările de 100+ milioane de dolari pentru GPT-4) a provocat prăbușirea acțiunilor giganților tehnologici și a determinat industria să reconsidere paradigma „mai multe calcule = model mai bun".[4]

Particularități arhitecturale

Mixture‑of‑Experts (DeepSeekMoE)
Majoritatea modelelor emblematice DeepSeek utilizează arhitectura Mixture of Experts (MoE). Spre deosebire de modelele „dense", unde toți parametrii sunt activați la procesarea unei cereri, în modelele MoE pentru fiecare token este activată doar o mică parte din subrețelele specializate („experți"). DeepSeek a dezvoltat o implementare proprie a MoE cu experți „comuni", segmentare cu granularitate fină și echilibrare a sarcinii fără pierderi auxiliare, ceea ce permite activarea doar a unei părți din sutele de miliarde de parametri și reduce semnificativ costurile de calcul.[5]
Multi‑Head Latent Attention (MLA)
Metodă de comprimare a cache-ului KV într-un vector latent, economisind până la 93 % din memorie și permițând utilizarea ferestrelor de context de până la 128 000 de tokeni. Această tehnologie este esențială pentru lucrul eficient cu texte lungi.[6]
FP8 training și Multi‑Token Prediction
În modelele din familia V3 se aplică precizia mixtă FP8 (numere în virgulă mobilă pe 8 biți) și predicția simultană a mai multor tokeni, ceea ce accelerează procesele de antrenare și inferență.[7]

Familia de modele

  • DeepSeek LLM — modele de bază cu 7 și 67 miliarde de parametri (2023), primul release bilingv (EN/ZH), care a depășit LLaMA‑2 70B la o serie de sarcini.[8]
  • DeepSeek‑Coder (2023) — o linie de modele pentru programare (1,3 – 33 miliarde) și evoluția sa Coder‑V2 (16 miliarde / 236 miliarde MoE, context 128K, 338 limbaje de programare).[9]
  • DeepSeek‑V2 (mai 2024) — 236 miliarde (21 miliarde active) MoE‑LLM cu MLA; antrenat pe 8,1 trilioane de tokeni.[10]
  • DeepSeek‑V3 (decembrie 2024) — 671 miliarde (37 miliarde active); antrenare ≈2,8 milioane GPU‑ore pe Nvidia H800, cu un cost de ≈5,5 milioane de dolari.[11]
  • DeepSeek‑R1 (ianuarie 2025) — linie de modele pentru raționament logic (reasoning); versiunea R1‑0528 s-a apropiat de OpenAI o3 pe AIME 2025 și LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — modele VL multimodale (până la 4,5 miliarde active) cu procesare dinamică mozaicată a imaginilor 1024×1024.[13]
  • DeepSeek‑Math 7B — model specializat, 51,7 % acuratețe pe benchmark-ul MATH; aproape de GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 miliarde MoE pentru demonstrarea teoremelor în Lean 4; 63,5 % pe miniF2F.
  • Modele R1 distilate — versiuni deschise de la 1,5 până la 70 miliarde de parametri, bazate pe Llama și Qwen.[15]

Cronologia principalelor lansări

Dată Lansare și caracteristici principale
2 nov 2023 DeepSeek‑Coder v1: primele modele open‑weight pentru cod.
29 nov 2023 DeepSeek LLM 7B/67B: model bilingv, antrenat pe 2 trilioane de tokeni.
11 ian 2024 DeepSeek‑MoE 16B: debutul arhitecturii MoE.
6 feb 2024 DeepSeek‑Math 7B: model specializat pentru matematică (51,7 % pe MATH).
6 mai 2024 DeepSeek‑V2 236B: introducerea arhitecturilor MLA și MoE.
17 iun 2024 DeepSeek‑Coder‑V2: context 128K, suport pentru 338 limbaje de programare.
13 dec 2024 DeepSeek‑VL2: model multimodal bazat pe MoE.
27 dec 2024 DeepSeek‑V3 671B: model emblematic, antrenat cu mai puțin de 6 milioane de dolari.
20 ian 2025 DeepSeek‑R1 / R1‑Zero: modele de raționament, antrenate cu ajutorul Reinforcement Learning.
27 ian 2025 Janus‑Pro: model pentru generarea imaginilor, care depășește DALL‑E 3.

Performanță și benchmark-uri

  • DeepSeek‑V3 a depășit Llama 3.1 și Qwen 2.5 și s-a apropiat de nivelul GPT‑4 pe MMLU și GPQA‑Diamond.[16]
  • DeepSeek‑Coder‑V2 a obținut 72,9 % pe Arena‑Hard — paritate cu GPT‑4o și mai mult decât toate modelele deschise, cu excepția Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — 51,7 % pe MATH, aproape de Gemini‑Ultra, la o dimensiune de 10 ori mai mică.[18]
  • R1‑Zero a crescut rezultatul AIME 2024 pass@1 de la 15,6 % la 71 % exclusiv prin antrenare cu Reinforcement Learning.[19]

Licențiere și open‑source

Majoritatea modelelor sunt distribuite sub licența MIT sau Apache 2.0, care permit utilizarea comercială. Compania publică ponderile pe Hugging Face și GitHub, însă păstrează confidențiale seturile complete de date și pipeline-urile de antrenare („open weight, but not full open source").

Influența asupra industriei

  • Lansarea R1 a provocat o scădere de o zi a cotațiilor NVIDIA, Microsoft și altor companii pe fondul știrilor despre „un model de clasă GPT‑4 pentru 6 milioane de dolari".[20]
  • Demonstrarea antrenării cu succes pe cipuri Nvidia H800 în condițiile restricțiilor la export a stimulat dezbaterea privind eficacitatea sancțiunilor SUA și a accelerat dezvoltarea acceleratoarelor AI chinezești (de exemplu, Huawei Ascend 910B).

Critici și limitări

  • Siguranță: în testul HarmBench, modelul R1 a trecut 100 % dintre solicitările nedorite („jailbreak").
  • Cenzură politică: versiunile chat filtrează subiectele „sensibile" pentru guvernul chinez (evenimentele din Piața Tiananmen din 1989, statutul Taiwanului etc.).
  • Stocarea datelor: stocarea datelor utilizatorilor pe servere din China limitează utilizarea API de către corporațiile occidentale supuse GDPR și regimurilor juridice similare.[21]

Bibliografie

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Note

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Vezi și

  • Modele lingvistice mari OpenAI
  • Mixture-of-Experts