DeepSeek (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — công ty nghiên cứu trí tuệ nhân tạo của Trung Quốc, chuyên phát triển các mô hình ngôn ngữ lớn (LLM) và các hệ thống đa phương thức. Công ty được biết đến rộng rãi nhờ việc phân phối mở trọng số các mô hình của mình cùng hiệu quả kinh tế cao, điều này đã kéo theo sự điều chỉnh giá cả trên thị trường AI vào cuối năm 2024 — đầu năm 2025.[1]

Lịch sử

Người sáng lập DeepSeek là doanh nhân và đồng sáng lập quỹ phòng hộ High‑Flyer, Lương Văn Phong. Vào mùa xuân năm 2023, High‑Flyer tách riêng bộ phận nghiên cứu AI, và vào tháng 5 cùng năm bộ phận này trở thành công ty DeepSeek AI. Đến năm 2025, đội ngũ nhân sự đã tăng lên khoảng 160 nhân viên.[2] Ngay từ những ngày đầu, công ty tuyên bố theo đuổi tính minh bạch — công bố trọng số («open‑weight») theo các giấy phép cho phép và định hướng vào nghiên cứu cơ bản về AGI.

Khác với hầu hết các startup, DeepSeek được tài trợ từ ngân sách R&D của High‑Flyer, điều này, theo lời người sáng lập, cho phép tập trung vào các mục tiêu dài hạn thay vì kiếm tiền ngay lập tức.[3]

Công ty tạo ra tiếng vang lớn trong cộng đồng công nghệ và tài chính vào tháng 1 năm 2025 sau khi ra mắt mô hình DeepSeek-R1. Tuyên bố rằng chi phí huấn luyện một mô hình có khả năng tương đương GPT-4 chỉ tốn chưa đến 6 triệu USD (so với ước tính hơn 100 triệu USD cho GPT-4) đã khiến cổ phiếu của các tập đoàn công nghệ lớn lao dốc và buộc ngành công nghiệp phải xem xét lại mô thức «nhiều tính toán hơn = mô hình tốt hơn».[4]

Đặc điểm kiến trúc

Mixture‑of‑Experts (DeepSeekMoE)
Hầu hết các mô hình hàng đầu của DeepSeek sử dụng kiến trúc hỗn hợp chuyên gia (MoE). Khác với các mô hình «dày đặc», nơi tất cả các tham số được kích hoạt khi xử lý yêu cầu, trong các mô hình MoE chỉ một phần nhỏ các mạng con chuyên biệt («chuyên gia») được kích hoạt cho mỗi token. DeepSeek đã phát triển cách triển khai MoE riêng với các chuyên gia «chung», phân đoạn mịn và cân bằng tải không cần tổn thất phụ trợ, cho phép chỉ kích hoạt một phần trong hàng trăm tỷ tham số và giảm mạnh chi phí tính toán.[5]
Multi‑Head Latent Attention (MLA)
Phương pháp nén KV‑cache thành vector tiềm ẩn, tiết kiệm tới 93% bộ nhớ và cho phép sử dụng cửa sổ ngữ cảnh lên đến 128.000 token. Công nghệ này là chìa khóa để xử lý hiệu quả các văn bản dài.[6]
FP8 training và Multi‑Token Prediction
Trong các mô hình thuộc dòng V3, độ chính xác hỗn hợp FP8 (số dấu phẩy động 8-bit) và dự đoán đồng thời nhiều token được áp dụng, giúp tăng tốc quá trình huấn luyện và suy luận (inference).[7]

Các dòng mô hình

  • DeepSeek LLM — các mô hình cơ sở với 7 và 67 tỷ tham số (2023), bản phát hành song ngữ (EN/ZH) đầu tiên, vượt trội hơn LLaMA‑2 70B trong một số tác vụ.[8]
  • DeepSeek‑Coder (2023) — dòng mô hình lập trình (1,3 – 33 tỷ) và phiên bản nâng cấp Coder‑V2 (16 tỷ / 236 tỷ MoE, ngữ cảnh 128K, 338 ngôn ngữ lập trình).[9]
  • DeepSeek‑V2 (tháng 5 năm 2024) — MoE‑LLM 236 tỷ (21 tỷ tích cực) với MLA; được huấn luyện trên 8,1 nghìn tỷ token.[10]
  • DeepSeek‑V3 (tháng 12 năm 2024) — 671 tỷ (37 tỷ tích cực); huấn luyện ≈2,8 triệu giờ GPU trên Nvidia H800 với chi phí ≈5,5 triệu USD.[11]
  • DeepSeek‑R1 (tháng 1 năm 2025) — dòng mô hình suy luận (reasoning); phiên bản R1‑0528 đã tiệm cận OpenAI o3 trên AIME 2025 và LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — các mô hình đa phương thức VL (lên đến 4,5 tỷ tích cực) với xử lý hình ảnh ghép động 1024×1024.[13]
  • DeepSeek‑Math 7B — mô hình chuyên biệt, độ chính xác 51,7% trên benchmark MATH; gần với GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — MoE 671 tỷ dùng để chứng minh định lý trong Lean 4; đạt 63,5% trên miniF2F.
  • Các mô hình R1 chưng cất — các phiên bản mở từ 1,5 đến 70 tỷ tham số dựa trên Llama và Qwen.[15]

Lịch sử các bản phát hành chính

Ngày Bản phát hành và đặc điểm chính
2 tháng 11 năm 2023 DeepSeek‑Coder v1: các mô hình open‑weight đầu tiên dành cho lập trình.
29 tháng 11 năm 2023 DeepSeek LLM 7B/67B: mô hình song ngữ, được huấn luyện trên 2 nghìn tỷ token.
11 tháng 1 năm 2024 DeepSeek‑MoE 16B: lần ra mắt kiến trúc MoE đầu tiên.
6 tháng 2 năm 2024 DeepSeek‑Math 7B: mô hình chuyên biệt cho toán học (51,7% trên MATH).
6 tháng 5 năm 2024 DeepSeek‑V2 236B: triển khai kiến trúc MLA và MoE.
17 tháng 6 năm 2024 DeepSeek‑Coder‑V2: ngữ cảnh 128K, hỗ trợ 338 ngôn ngữ lập trình.
13 tháng 12 năm 2024 DeepSeek‑VL2: mô hình đa phương thức dựa trên MoE.
27 tháng 12 năm 2024 DeepSeek‑V3 671B: mô hình hàng đầu, được huấn luyện với chi phí chưa đến 6 triệu USD.
20 tháng 1 năm 2025 DeepSeek‑R1 / R1‑Zero: các mô hình suy luận, được huấn luyện bằng Reinforcement Learning.
27 tháng 1 năm 2025 Janus‑Pro: mô hình tạo sinh hình ảnh, vượt trội hơn DALL‑E 3.

Hiệu năng và benchmark

  • DeepSeek‑V3 vượt qua Llama 3.1Qwen 2.5 và tiệm cận mức GPT‑4 trên MMLU và GPQA‑Diamond.[16]
  • DeepSeek‑Coder‑V2 đạt 72,9% trên Arena‑Hard — ngang bằng GPT‑4o và cao hơn tất cả các mô hình mở, ngoại trừ Claude‑3.5‑Sonnet.[17]
  • DeepSeek‑Math 7B — 51,7% trên MATH, gần với Gemini‑Ultra nhưng kích thước nhỏ hơn 10 lần.[18]
  • R1‑Zero nâng kết quả AIME 2024 pass@1 từ 15,6% lên 71% chỉ nhờ huấn luyện Reinforcement Learning.[19]

Cấp phép và open‑source

Hầu hết các mô hình được phân phối theo giấy phép MIT hoặc Apache 2.0, cho phép sử dụng thương mại. Công ty công bố trọng số trên Hugging Face và GitHub, tuy nhiên vẫn giữ bí mật các dataset đầy đủ và pipeline huấn luyện («open weight, but not full open source»).

Ảnh hưởng đến ngành

  • Việc ra mắt R1 đã khiến cổ phiếu của NVIDIA, Microsoft và các công ty khác giảm trong một ngày trước những tin tức về «mô hình hạng GPT‑4 với chi phí 6 triệu USD».[20]
  • Việc chứng minh khả năng huấn luyện thành công trên chip Nvidia H800 dưới các hạn chế xuất khẩu đã thúc đẩy cuộc thảo luận về hiệu quả của các lệnh trừng phạt của Mỹ và đẩy nhanh quá trình phát triển các bộ tăng tốc AI của Trung Quốc (ví dụ: Huawei Ascend 910B).

Phê bình và hạn chế

  • Bảo mật: trong bài kiểm tra HarmBench, mô hình R1 đã cho qua 100% các yêu cầu không mong muốn («jailbreak»).
  • Kiểm duyệt chính trị: các phiên bản chat lọc các chủ đề «nhạy cảm» đối với chính phủ Trung Quốc (sự kiện tại Quảng trường Thiên An Môn năm 1989, tình trạng của Đài Loan, v.v.).
  • Lưu trữ dữ liệu: việc lưu trữ dữ liệu người dùng trên các máy chủ tại Trung Quốc hạn chế việc sử dụng API bởi các tập đoàn phương Tây phải tuân thủ GDPR và các chế độ pháp lý tương tự.[21]

Tài liệu tham khảo

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Chú thích

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Xem thêm

  • Các mô hình ngôn ngữ lớn của OpenAI
  • Mixture-of-Experts