DeepSeek (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — κινεζική ερευνητική εταιρεία στον τομέα της τεχνητής νοημοσύνης, που αναπτύσσει μεγάλα γλωσσικά μοντέλα (LLM) και πολυτροπικά συστήματα. Η εταιρεία απέκτησε ευρεία αναγνώριση χάρη στη δωρεάν διάθεση των βαρών των μοντέλων της και στην υψηλή οικονομική τους αποδοτικότητα, γεγονός που προκάλεσε αναθεώρηση των τιμών στην αγορά AI στα τέλη του 2024 — αρχές του 2025.[1]

Ιστορία

Ιδρυτής της DeepSeek είναι ο επιχειρηματίας και συνιδρυτής του hedge fund High‑Flyer Λιάνγκ Γουενφένγκ. Την άνοιξη του 2023, η High‑Flyer απέσπασε το ερευνητικό τμήμα AI, το οποίο τον Μάιο του ίδιου έτους έγινε η εταιρεία DeepSeek AI. Ήδη έως το 2025 το προσωπικό αυξήθηκε σε ~160 εργαζόμενους.[2] Από τις πρώτες μέρες η εταιρεία διακήρυξε την προσήλωσή της στην ανοιχτότητα — τη δημοσίευση βαρών («open‑weight») υπό επιτρεπτικές άδειες και τον προσανατολισμό σε θεμελιώδη έρευνα AGI.

Σε αντίθεση με τις περισσότερες νεοφυείς εταιρείες, η DeepSeek χρηματοδοτείται από τον R&D-προϋπολογισμό της High-Flyer, γεγονός που, σύμφωνα με τον ιδρυτή, επιτρέπει την εστίαση σε μακροπρόθεσμους στόχους και όχι στην άμεση αποκόμιση κέρδους.[3]

Η εταιρεία προκάλεσε σημαντική απήχηση στην τεχνολογική και χρηματοοικονομική κοινότητα τον Ιανουάριο του 2025 μετά την κυκλοφορία του μοντέλου DeepSeek-R1. Η ανακοίνωση ότι η εκπαίδευση ενός μοντέλου συγκρίσιμου με το GPT-4 κόστισε λιγότερο από $6 εκατ. (σε σύγκριση με εκτιμήσεις άνω των $100 εκατ. για το GPT-4) προκάλεσε κατάρρευση των μετοχών τεχνολογικών κολοσσών και ανάγκασε τον κλάδο να επανεξετάσει το παράδειγμα «περισσότεροι υπολογισμοί = καλύτερο μοντέλο».[4]

Αρχιτεκτονικά χαρακτηριστικά

Mixture‑of‑Experts (DeepSeekMoE)
Τα περισσότερα από τα κορυφαία μοντέλα της DeepSeek χρησιμοποιούν αρχιτεκτονική Mixture of Experts (MoE). Σε αντίθεση με τα «πυκνά» μοντέλα, στα οποία κατά την επεξεργασία ενός ερωτήματος ενεργοποιούνται όλες οι παράμετροι, στα μοντέλα MoE για κάθε token ενεργοποιείται μόνο ένα μικρό μέρος εξειδικευμένων υποδικτύων («εμπειρογνωμόνων»). Η DeepSeek ανέπτυξε τη δική της υλοποίηση MoE με «κοινούς» εμπειρογνώμονες, λεπτόκοκκη κατανομή και εξισορρόπηση φορτίου χωρίς βοηθητικές απώλειες, γεγονός που επιτρέπει την ενεργοποίηση μόνο μέρους από εκατοντάδες δισεκατομμύρια παραμέτρους, μειώνοντας δραστικά το υπολογιστικό κόστος.[5]
Multi‑Head Latent Attention (MLA)
Μέθοδος συμπίεσης της KV‑cache σε ένα latent διάνυσμα, εξοικονομώντας έως και 93% μνήμης και επιτρέποντας χρήση παραθύρων περιβάλλοντος έως 128.000 token. Αυτή η τεχνολογία είναι κλειδί για την αποτελεσματική επεξεργασία μεγάλων κειμένων.[6]
FP8 training και Multi‑Token Prediction
Στα μοντέλα της οικογένειας V3 χρησιμοποιείται μικτή ακρίβεια FP8 (αριθμοί κινητής υποδιαστολής 8 bit) και ταυτόχρονη πρόβλεψη πολλαπλών token, γεγονός που επιταχύνει τις διαδικασίες εκπαίδευσης και inference.[7]

Οικογένεια μοντέλων

  • DeepSeek LLM — βασικά μοντέλα 7 και 67 δισ. παραμέτρων (2023), η πρώτη δίγλωσση (EN/ZH) κυκλοφορία, η οποία υπερέβη το LLaMA‑2 70B σε ορισμένες εργασίες.[8]
  • DeepSeek‑Coder (2023) — σειρά μοντέλων για προγραμματισμό (1,3 – 33 δισ.) και η εξέλιξή της Coder‑V2 (16 δισ. / 236 δισ. MoE, περιβάλλον 128K, 338 γλώσσες προγραμματισμού).[9]
  • DeepSeek‑V2 (Μάιος 2024) — 236 δισ. (21 δισ. ενεργά) MoE‑LLM με MLA· εκπαιδευμένο σε 8,1 τρισ. token.[10]
  • DeepSeek‑V3 (Δεκέμβριος 2024) — 671 δισ. (37 δισ. ενεργά)· εκπαίδευση ≈2,8 εκατ. ωρών GPU σε Nvidia H800 με κόστος ≈$5,5 εκατ.[11]
  • DeepSeek‑R1 (Ιανουάριος 2025) — σειρά μοντέλων για λογική συλλογιστική (reasoning)· η έκδοση R1‑0528 πλησίασε το OpenAI o3 στο AIME 2025 και στο LiveCodeBench.[12]
  • DeepSeek‑VL / VL2 — πολυτροπικά VL‑μοντέλα (έως 4,5 δισ. ενεργά) με δυναμική επεξεργασία εικόνων σε μορφή μωσαϊκού 1024×1024.[13]
  • DeepSeek‑Math 7B — εξειδικευμένο μοντέλο, 51,7% ακρίβεια στο benchmark MATH· κοντά στο GPT‑4.[14]
  • DeepSeek‑Prover‑V2 — 671 δισ. MoE για απόδειξη θεωρημάτων σε Lean 4· 63,5% στο miniF2F.
  • Αποστασιοποιημένα R1‑μοντέλα — ανοιχτές εκδόσεις από 1,5 έως 70 δισ. παραμέτρων βασισμένες σε Llama και Qwen.[15]

Χρονολόγιο βασικών κυκλοφοριών

Ημερομηνία Κυκλοφορία και βασικά χαρακτηριστικά
2 Νοε 2023 DeepSeek‑Coder v1: πρώτα open‑weight μοντέλα για κώδικα.
29 Νοε 2023 DeepSeek LLM 7B/67B: δίγλωσσο μοντέλο, εκπαιδευμένο σε 2 τρισ. token.
11 Ιαν 2024 DeepSeek‑MoE 16B: πρεμιέρα αρχιτεκτονικής MoE.
6 Φεβ 2024 DeepSeek‑Math 7B: εξειδικευμένο μοντέλο για μαθηματικά (51,7% στο MATH).
6 Μαΐ 2024 DeepSeek‑V2 236B: εισαγωγή αρχιτεκτονικών MLA και MoE.
17 Ιουν 2024 DeepSeek‑Coder‑V2: περιβάλλον 128K, υποστήριξη 338 γλωσσών προγραμματισμού.
13 Δεκ 2024 DeepSeek‑VL2: πολυτροπικό μοντέλο βασισμένο σε MoE.
27 Δεκ 2024 DeepSeek‑V3 671B: κορυφαίο μοντέλο, εκπαιδευμένο με κόστος κάτω των $6 εκατ.
20 Ιαν 2025 DeepSeek‑R1 / R1‑Zero: μοντέλα συλλογιστικής, εκπαιδευμένα με Reinforcement Learning.
27 Ιαν 2025 Janus‑Pro: μοντέλο για δημιουργία εικόνων, που υπερβαίνει το DALL‑E 3.

Απόδοση και benchmarks

  • Το DeepSeek‑V3 ξεπέρασε το Llama 3.1 και το Qwen 2.5 και πλησίασε το επίπεδο του GPT‑4 στα MMLU και GPQA‑Diamond.[16]
  • Το DeepSeek‑Coder‑V2 σημείωσε 72,9% στο Arena‑Hard — ισοδύναμο με το GPT‑4o και υψηλότερο από όλα τα ανοιχτά μοντέλα εκτός του Claude‑3.5‑Sonnet.[17]
  • Το DeepSeek‑Math 7B — 51,7% στο MATH, κοντά στο Gemini‑Ultra με 10 φορές μικρότερο μέγεθος.[18]
  • Το R1‑Zero ανέβασε το αποτέλεσμα AIME 2024 pass@1 από 15,6% σε 71% αποκλειστικά μέσω Reinforcement Learning.[19]

Αδειοδότηση και open‑source

Τα περισσότερα μοντέλα διανέμονται υπό άδεια MIT ή Apache 2.0, που επιτρέπει εμπορική χρήση. Η εταιρεία δημοσιεύει τα βάρη στο Hugging Face και στο GitHub, ωστόσο διατηρεί κλειστά τα πλήρη datasets και τα pipeline εκπαίδευσης («open weight, but not full open source»).

Επίδραση στον κλάδο

  • Η κυκλοφορία του R1 προκάλεσε μονοήμερη πτώση της χρηματιστηριακής αξίας της NVIDIA, της Microsoft και άλλων εταιρειών στο πλαίσιο των ειδήσεων για «μοντέλο κλάσης GPT‑4 με $6 εκατ.».[20]
  • Η επίδειξη επιτυχούς εκπαίδευσης σε chips Nvidia H800 υπό εξαγωγικούς περιορισμούς τόνωσε τη συζήτηση σχετικά με την αποτελεσματικότητα των αμερικανικών κυρώσεων και επιτάχυνε την ανάπτυξη κινεζικών επιταχυντών AI (π.χ. Huawei Ascend 910B).

Κριτική και περιορισμοί

  • Ασφάλεια: στη δοκιμή HarmBench το μοντέλο R1 επέτρεψε το 100% των ανεπιθύμητων αιτημάτων («jailbreak»).
  • Πολιτική λογοκρισία: οι εκδόσεις chat φιλτράρουν θέματα «ευαίσθητα» για την κινεζική κυβέρνηση (τα γεγονότα στην πλατεία Τιενανμέν το 1989, το καθεστώς της Ταϊβάν κ.λπ.).
  • Αποθήκευση δεδομένων: η αποθήκευση δεδομένων χρηστών σε διακομιστές στην Κίνα περιορίζει τη χρήση του API από δυτικές εταιρείες που υπόκεινται σε GDPR και παρόμοια νομικά πλαίσια.[21]

Βιβλιογραφία

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

Παραπομπές

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

Δείτε επίσης

  • Μεγάλα γλωσσικά μοντέλα OpenAI
  • Mixture-of-Experts