DeepSeek (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — isang kumpanyang Tsino sa larangan ng artificial intelligence na nagtatayo ng malalaking language model (LLM) at multimodal na sistema. Ang kumpanya ay nakilala nang malawak dahil sa bukas na pamamahagi ng mga timbang ng kanyang mga modelo at ang kanilang mataas na kahusayan sa gastos, na nagdulot ng pagbabago ng mga presyo sa merkado ng AI sa huling bahagi ng 2024 hanggang simula ng 2025.[1]

Kasaysayan

Ang tagapagtatag ng DeepSeek — ang negosyante at co-founder ng hedge fund na High‑Flyer na si Liang Wenfeng. Noong tagsibol ng 2023, inihiwalay ng High‑Flyer ang kanyang sangay na pananaliksik sa AI, na naging kumpanyang DeepSeek AI noong Mayo ng parehong taon. Sa loob ng ilang taon, lumago ang kawani sa humigit-kumulang ~160 empleyado.[2] Mula sa simula, idineklara ng kumpanya ang patakaran ng pagiging bukas — ang paglalathala ng mga timbang («open‑weight») sa ilalim ng mga permisibong lisensya at pagtuon sa pangunahing pananaliksik sa AGI.

Sa kaibahan ng karamihan sa mga startup, ang DeepSeek ay pinondohan mula sa R&D-badyet ng High-Flyer, na ayon sa tagapagtatag ay nagbibigay-daan sa pagtuon sa mga pangmatagalang layunin, at hindi sa agarang monetisasyon.[3]

Naging sanhi ng malaking kaguluhan sa teknolohikal at pinansyal na komunidad ang kumpanya noong Enero 2025 pagkatapos ng paglabas ng modelong DeepSeek-R1. Ang pahayag na ang pagsasanay ng modelong maihahambing sa GPT-4 ay nagkahalaga ng wala pang $6 milyon (kumpara sa tinatayang $100+ milyon para sa GPT-4), ay nagdulot ng pagbagsak ng mga aksyon ng mga teknolohikal na higante at pinilit ang industriya na muling pag-aralan ang paradigm na «mas maraming pagkalkula = mas magandang modelo».[4]

Mga Katangian ng Arkitektura

Mixture‑of‑Experts (DeepSeekMoE)
Karamihan ng mga pangunahing modelo ng DeepSeek ay gumagamit ng arkitektura ng Mixture of Experts (MoE). Sa kaibahan ng mga «siksik» na modelo, kung saan naa-aktibo ang lahat ng parameter sa pagpoproseso ng kahilingan, sa mga MoE-modelo ay isang maliit na bahagi lamang ng mga espesyalisadong subnetwork («mga eksperto») ang ginagamit para sa bawat token. Nagbuo ang DeepSeek ng sariling implementasyon ng MoE na may «mga karaniwang» eksperto, pinong segmentasyon at load balancing nang walang pantulong na pagkalugi, na nagbibigay-daan sa pag-aktibo ng isang bahagi lamang sa daan-daang bilyun-bilyong parameter at lubhang nagpapababa ng gastos sa pagkalkula.[5]
Multi‑Head Latent Attention (MLA)
Isang paraan ng pag-compress ng KV‑cache sa isang latent na vector, na nakatitipid ng hanggang 93% ng memorya at nagbibigay-daan sa paggamit ng mga context window na may sukat na hanggang 128,000 token. Ang teknolohiyang ito ay susi sa mahusay na pagtratrabaho sa mahabang mga teksto.[6]
FP8 training at Multi‑Token Prediction
Sa mga modelo ng pamilyang V3, ginagamit ang halo-halong katumpakan na FP8 (8-bit na mga floating-point na numero) at sabay-sabay na hula ng maraming token, na nagpapabilis sa mga proseso ng pagsasanay at inference.[7]

Pamilya ng mga Modelo

  • DeepSeek LLM — mga base na modelo na may 7 at 67 bilyong parameter (2023), ang unang bilingual (EN/ZH) na release, na nalampasan ang LLaMA‑2 70B sa ilang mga gawain.[8]
  • DeepSeek‑Coder (2023) — linya ng mga modelo para sa pagpoprogramo (1.3 – 33 bilyon) at ang pagpapaunlad nito na Coder‑V2 (16 bilyon / 236 bilyong MoE, konteksto ng 128K, 338 na wika ng pag-coding).[9]
  • DeepSeek‑V2 (Mayo 2024) — 236 bilyon (21 bilyong aktibo) MoE‑LLM na may MLA; sinanay sa 8.1 trilyong token.[10]
  • DeepSeek‑V3 (Disyembre 2024) — 671 bilyon (37 bilyong aktibo); pagsasanay ≈2.8 milyong GPU-oras sa Nvidia H800 na may halagang ≈$5.5 milyon.[11]
  • DeepSeek‑R1 (Enero 2025) — linya ng mga modelo para sa lohikal na pangangatuwiran (reasoning); ang bersyon na R1‑0528 ay nalalapit sa OpenAI o3 sa AIME 2025 at LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — mga multimodal na VL-modelo (hanggang 4.5 bilyong aktibo) na may dinamikong mosaic na pagpoproseso ng mga larawan na 1024×1024.[13]
  • DeepSeek‑Math 7B — espesyalisadong modelo, 51.7% na katumpakan sa benchmark na MATH; malapit sa GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 bilyong MoE para sa pagpapatunay ng mga teorema sa Lean 4; 63.5% sa miniF2F.
  • Mga Distilled na Modelo ng R1 — mga bukas na bersyon mula 1.5 hanggang 70 bilyong parameter batay sa Llama at Qwen.[15]

Kronolohiya ng mga Pangunahing Release

Petsa Release at mga Pangunahing Katangian
2 Nob 2023 DeepSeek‑Coder v1: unang mga open‑weight na modelo para sa code.
29 Nob 2023 DeepSeek LLM 7B/67B: bilingual na modelo, sinanay sa 2 trilyong token.
11 Ene 2024 DeepSeek‑MoE 16B: debut ng MoE-arkitektura.
6 Peb 2024 DeepSeek‑Math 7B: espesyalisadong modelo para sa matematika (51.7% sa MATH).
6 Mayo 2024 DeepSeek‑V2 236B: pagpapakilala ng mga arkitektura ng MLA at MoE.
17 Hun 2024 DeepSeek‑Coder‑V2: konteksto ng 128K, suporta para sa 338 na wika ng pagpoprogramo.
13 Dis 2024 DeepSeek‑VL2: multimodal na modelo batay sa MoE.
27 Dis 2024 DeepSeek‑V3 671B: pangunahing modelo, sinanay sa halagang wala pang $6 milyon.
20 Ene 2025 DeepSeek‑R1 / R1‑Zero: mga modelo para sa pangangatuwiran, sinanay gamit ang Reinforcement Learning.
27 Ene 2025 Janus‑Pro: modelo para sa pagbuo ng mga larawan, na higit sa DALL‑E 3.

Pagganap at mga Benchmark

  • Ang DeepSeek‑V3 ay nalampasan ang Llama 3.1 at Qwen 2.5 at nalalapit sa antas ng GPT‑4 sa MMLU at GPQA‑Diamond.[16]
  • Ang DeepSeek‑Coder‑V2 ay nakakuha ng 72.9% sa Arena‑Hard — kapantay ng GPT‑4o at mas mataas kaysa sa lahat ng bukas na modelo maliban sa Claude‑3.5‑Sonnet.[17]
  • Ang DeepSeek‑Math 7B — 51.7% sa MATH, na malapit sa Gemini‑Ultra ngunit may 10 beses na mas maliit na sukat.[18]
  • Ang R1‑Zero ay nagpataas ng resulta ng AIME 2024 pass@1 mula 15.6% hanggang 71% sa pamamagitan lamang ng Reinforcement Learning na pagsasanay.[19]

Lisensya at Open‑Source

Karamihan ng mga modelo ay ibinahagi sa ilalim ng lisensyang MIT o Apache 2.0, na nagpapahintulot ng komersyal na paggamit. Inilalathala ng kumpanya ang mga timbang sa Hugging Face at GitHub, ngunit pinanatili nitong sarado ang mga kumpletong dataset at mga pipeline ng pagsasanay («open weight, but not full open source»).

Epekto sa Industriya

  • Ang paglulunsad ng R1 ay nagdulot ng isang araw na pagbaba ng mga presyo ng aksyon ng NVIDIA, Microsoft, at iba pang mga kumpanya dahil sa balita tungkol sa «modelo ng klase ng GPT‑4 para sa $6 milyon».[20]
  • Ang pagpapakita ng matagumpay na pagsasanay sa mga chip na Nvidia H800 sa ilalim ng mga paghihigpit sa pag-export ay nagpalakas ng talakayan tungkol sa bisa ng mga parusa ng Estados Unidos at nagpabilis ng pagbuo ng mga Tsino na AI-accelerator (halimbawa, Huawei Ascend 910B).

Kritisismo at mga Limitasyon

  • Kaligtasan: sa pagsubok ng HarmBench, ang modelong R1 ay pumasa ng 100% ng mga hindi nais na kahilingan («jailbreak»).
  • Pulitikal na censura: ang mga chat-bersyon ay nino-filter ang mga paksang «sensitibo» para sa pamahalaan ng Tsina (mga pangyayari sa Tiananmen Square noong 1989, katayuan ng Taiwan, at iba pa).
  • Pag-iimbak ng datos: ang pag-iimbak ng datos ng mga gumagamit sa mga server sa Tsina ay nagpapahigpit sa paggamit ng API ng mga korporasyong Kanluranin na sumusunod sa GDPR at katulad na mga legal na rehimen.[21]

Mga Sanggunian

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Mga Tala

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Tingnan Din

  • Malalaking Language Model ng OpenAI
  • Mixture-of-Experts