DeepSeek (Sprachmodell)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek ist ein chinesisches Forschungsunternehmen im Bereich der künstlichen Intelligenz, das große Sprachmodelle (LLM) und multimodale Systeme entwickelt. Das Unternehmen erlangte große Bekanntheit durch die offene Veröffentlichung der Gewichte seiner Modelle (Open-Weight) und deren hohe Kosteneffizienz, was Ende 2024 bis Anfang 2025 zu einer Preiskorrektur auf dem KI-Markt führte.[1]

Geschichte

Der Gründer von DeepSeek ist der Unternehmer und Mitbegründer des Hedgefonds High-Flyer, Liang Wenfeng. Im Frühjahr 2023 gliederte High-Flyer seine KI-Forschungsabteilung aus, die im Mai desselben Jahres zur Firma DeepSeek AI wurde. Bis 2025 wuchs die Belegschaft auf etwa 160 Mitarbeiter an.[2] Von Anfang an verfolgte das Unternehmen einen Kurs der Offenheit – die Veröffentlichung von Gewichten („Open-Weight“) unter freizügigen Lizenzen und eine Ausrichtung auf die Grundlagenforschung zu AGI.

Im Gegensatz zu den meisten Start-ups wird DeepSeek aus dem F&E-Budget von High-Flyer finanziert, was es dem Gründer zufolge ermöglicht, sich auf langfristige Ziele statt auf kurzfristige Monetarisierung zu konzentrieren.[3]

Große Aufmerksamkeit in der Technologie- und Finanzwelt erregte das Unternehmen im Januar 2025 nach der Veröffentlichung des Modells DeepSeek-R1. Die Ankündigung, dass das Training eines mit GPT-4 vergleichbaren Modells weniger als 6 Millionen US-Dollar kostete (im Vergleich zu Schätzungen von über 100 Millionen US-Dollar für GPT-4), löste einen Kurseinbruch bei den Aktien von Technologiegiganten aus und zwang die Branche, das Paradigma „mehr Rechenleistung = besseres Modell“ zu überdenken.[4]

Architektonische Merkmale

Mixture-of-Experts (DeepSeekMoE)
Die meisten Flaggschiff-Modelle von DeepSeek verwenden eine Mixture-of-Experts (MoE)-Architektur. Im Gegensatz zu „dichten“ Modellen, bei denen bei der Verarbeitung einer Anfrage alle Parameter aktiviert werden, wird bei MoE-Modellen für jedes Token nur ein kleiner Teil spezialisierter Subnetzwerke („Experten“) eingesetzt. DeepSeek hat eine eigene MoE-Implementierung mit „gemeinsamen“ Experten, feinkörniger Segmentierung und Lastausgleich ohne Hilfsverluste entwickelt, was es ermöglicht, nur einen Teil der Hunderte von Milliarden Parametern zu aktivieren und die Rechenkosten drastisch zu senken.[5]
Multi-Head Latent Attention (MLA)
Eine Methode zur Komprimierung des KV-Cache in einen latenten Vektor, die bis zu 93 % des Speichers einspart und die Verwendung von Kontextfenstern von bis zu 128.000 Token ermöglicht. Diese Technologie ist entscheidend für die effiziente Verarbeitung langer Texte.[6]
FP8-Training und Multi-Token Prediction
In den Modellen der V3-Familie werden gemischte FP8-Genauigkeit (8-Bit-Gleitkommazahlen) und die gleichzeitige Vorhersage mehrerer Token verwendet, was die Trainings- und Inferenzprozesse beschleunigt.[7]

Modellfamilie

  • DeepSeek LLM — Basismodelle mit 7 und 67 Mrd. Parametern (2023), die erste zweisprachige (EN/ZH) Veröffentlichung, die LLaMA-2 70B in mehreren Aufgaben übertraf.[8]
  • DeepSeek-Coder (2023) — eine Reihe von Modellen für die Programmierung (1,3–33 Mrd.) und deren Weiterentwicklung Coder-V2 (16 Mrd. / 236 Mrd. MoE, 128K Kontext, 338 Programmiersprachen).[9]
  • DeepSeek-V2 (Mai 2024) — 236 Mrd. (21 Mrd. aktive) MoE-LLM mit MLA; trainiert auf 8,1 Billionen Token.[10]
  • DeepSeek-V3 (Dezember 2024) — 671 Mrd. (37 Mrd. aktive); Training ≈2,8 Mio. GPU-Stunden auf Nvidia H800 im Wert von ≈5,5 Mio. US-Dollar.[11]
  • DeepSeek-R1 (Januar 2025) — eine Modellreihe für logisches Schlussfolgern (Reasoning); die Version R1-0528 näherte sich OpenAI o3 bei AIME 2025 und LiveCodeBench an.[12]
  • DeepSeek-VL / VL2 — multimodale VL-Modelle (bis zu 4,5 Mrd. aktive) mit dynamischer Mosaikverarbeitung von Bildern der Größe 1024×1024.[13]
  • DeepSeek-Math 7B — ein spezialisiertes Modell mit 51,7 % Genauigkeit auf dem MATH-Benchmark; nahe an GPT-4.[14]
  • DeepSeek-Prover-V2 — 671 Mrd. MoE für den Beweis von Theoremen in Lean 4; 63,5 % auf miniF2F.
  • Destillierte R1-Modelle — offene Versionen von 1,5 bis 70 Mrd. Parametern, basierend auf Llama und Qwen.[15]

Chronologie der wichtigsten Veröffentlichungen

Datum Veröffentlichung und Hauptmerkmale
2. Nov. 2023 DeepSeek-Coder v1: erste Open-Weight-Modelle für Code.
29. Nov. 2023 DeepSeek LLM 7B/67B: zweisprachiges Modell, trainiert auf 2 Billionen Token.
11. Jan. 2024 DeepSeek-MoE 16B: Debüt der MoE-Architektur.
6. Feb. 2024 DeepSeek-Math 7B: spezialisiertes Modell für Mathematik (51,7 % auf MATH).
6. Mai 2024 DeepSeek-V2 236B: Einführung der Architekturen MLA und MoE.
17. Jun. 2024 DeepSeek-Coder-V2: 128K Kontext, Unterstützung für 338 Programmiersprachen.
13. Dez. 2024 DeepSeek-VL2: multimodales Modell auf MoE-Basis.
27. Dez. 2024 DeepSeek-V3 671B: Flaggschiff-Modell, trainiert für weniger als 6 Mio. US-Dollar.
20. Jan. 2025 DeepSeek-R1 / R1-Zero: Modelle für Schlussfolgern, trainiert mit RL.
27. Jan. 2025 Janus-Pro: Modell zur Bilderzeugung, das DALL-E 3 übertrifft.

Leistung und Benchmarks

  • DeepSeek-V3 übertraf Llama 3.1 und Qwen 2.5 und näherte sich dem Niveau von GPT-4 bei MMLU und GPQA-Diamond.[16]
  • DeepSeek-Coder-V2 erreichte 72,9 % auf Arena-Hard – auf Augenhöhe mit GPT-4o und besser als alle offenen Modelle außer Claude-3.5-Sonnet.[17]
  • DeepSeek-Math 7B — 51,7 % auf MATH, was bei 10-mal geringerer Größe nahe an Gemini-Ultra liegt.[18]
  • R1-Zero steigerte das Ergebnis von AIME 2024 pass@1 von 15,6 % auf 71 % allein durch RL-Training.[19]

Ökonomie und API

DeepSeek bietet eine öffentliche API für die Modelle V3 und R1 zu Preisen von 0,07 bis 0,14 US-Dollar pro Million Eingabe-Token bei einem Cache-Hit und von 1,10 bis 2,19 US-Dollar pro Million Ausgabe-Token an – bis zu dutzende Male günstiger als die Tarife für GPT-4o.[20]

Lizenzierung und Open Source

Die meisten Modelle werden unter der MIT- oder Apache-2.0-Lizenz vertrieben, die eine kommerzielle Nutzung erlaubt. Das Unternehmen veröffentlicht die Gewichte auf Hugging Face und GitHub, hält jedoch die vollständigen Datensätze und Trainingspipelines geheim („Open-Weight, aber nicht vollständiger Open-Source“).

Einfluss auf die Industrie

  • Die Einführung von R1 verursachte einen eintägigen Kursrückgang der Aktien von NVIDIA, Microsoft und anderen Unternehmen aufgrund der Nachricht von einem „Modell der GPT-4-Klasse für 6 Mio. US-Dollar“.[21]
  • Die Demonstration eines erfolgreichen Trainings auf Nvidia H800-Chips unter Exportbeschränkungen regte eine Diskussion über die Wirksamkeit der US-Sanktionen an und beschleunigte die Entwicklung chinesischer KI-Beschleuniger (z. B. Huawei Ascend 910B).

Kritik und Einschränkungen

  • Sicherheit: Im HarmBench-Test ließ das R1-Modell 100 % der unerwünschten Anfragen durch („Jailbreak“).
  • Politische Zensur: Die Chat-Versionen filtern für die chinesische Regierung „sensible“ Themen (z. B. die Ereignisse auf dem Platz des Himmlischen Friedens 1989, der Status Taiwans).
  • Datenspeicherung: Die Speicherung von Nutzerdaten auf Servern in China schränkt die Nutzung der API durch westliche Unternehmen ein, die der DSGVO und ähnlichen rechtlichen Regelungen unterliegen.[22]

Literatur

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Einzelnachweise

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek Explained: Why This AI Model Is Gaining Popularity // DigitalOcean.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  22. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.