---
title: "DeepSeek (TR)"
source: "https://systems-analysis.info/int/DeepSeek_(TR)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 1615
wiki_created_at: 2026-09-06T22:51:22Z
wiki_modified_at: 2026-09-06T22:51:22Z
downloaded_at: 2026-09-07T22:46:51Z
---

# DeepSeek (TR)

**DeepSeek** — yapay zeka alanında faaliyet gösteren bir Çin araştırma şirketidir; büyük dil modelleri (LLM) ve multimodal sistemler geliştirmektedir. Şirket, model ağırlıklarını açık biçimde yayımlaması ve yüksek maliyet etkinliğiyle geniş bir tanınırlık kazanmış; bu durum 2024 sonu ile 2025 başında yapay zeka pazarında fiyat düzeltmelerine yol açmıştır.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-1)</sup>

## Tarihçe

DeepSeek'in kurucusu, girişimci ve *High‑Flyer* hedge fonunun kurucu ortağı Liang Wenfeng'dir. 2023 yılının baharında High‑Flyer, yapay zeka araştırma birimini ana bünyeden ayırdı; bu birim aynı yılın mayıs ayında *DeepSeek AI* adıyla bağımsız bir şirkete dönüştü. 2025 yılına gelindiğinde çalışan sayısı yaklaşık 160 kişiye ulaşmıştı.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-2)</sup> Şirket, ilk günden itibaren açıklık ilkesini benimsedi: model ağırlıklarını ("open‑weight") izin verici lisanslar kapsamında yayımlamayı ve AGI alanında temel araştırmalara odaklanmayı hedefledi.

Çoğu girişimin aksine DeepSeek, High‑Flyer'ın Ar-Ge bütçesiyle finanse edilmektedir; kurucuya göre bu yapı, anlık para kazanma baskısı yerine uzun vadeli hedeflere odaklanmayı mümkün kılmaktadır.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-3)</sup>

Şirket, teknoloji ve finans dünyasında büyük yankı uyandıran **DeepSeek-R1** modelini Ocak 2025'te piyasaya sürdü. GPT-4 ile kıyaslanabilir bir modelin eğitiminin 6 milyon dolardan az maliyetle tamamlandığına dair açıklama (GPT-4 için öngörülen 100 milyon dolar ve üzerindeki tahminlerle kıyaslandığında), büyük teknoloji şirketlerinin hisse senetlerinde sert düşüşlere neden oldu ve sektörün "daha fazla hesaplama = daha iyi model" paradigmasını sorgulamasına yol açtı.<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-4)</sup>

## Mimari Özellikler

Mixture‑of‑Experts (DeepSeekMoE)  
DeepSeek'in amiral gemisi modellerinin büyük çoğunluğu, uzman karışımı (MoE) mimarisini kullanmaktadır. Bir sorgu işlenirken tüm parametrelerin etkinleştirildiği "yoğun" modellerin aksine, MoE modellerinde her token için yalnızca küçük bir uzmanlaşmış alt ağ grubu ("uzmanlar") devreye girmektedir. DeepSeek, "ortak" uzmanlara, ince taneli segmentasyona ve yardımcı kayıp fonksiyonu kullanmaksızın yük dengelemeye dayanan kendine özgü bir MoE uygulaması geliştirmiştir; bu sayede yüz milyarlarca parametrenin yalnızca bir kısmı etkinleştirilerek hesaplama maliyetleri önemli ölçüde düşürülmektedir.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
KV‑önbelleğini gizil bir vektöre sıkıştıran bu yöntem, bellek kullanımını %93'e kadar azaltmakta ve 128.000 tokena kadar uzanan bağlam pencereleriyle çalışmayı mümkün kılmaktadır. Bu teknoloji, uzun metinlerle verimli biçimde çalışmak açısından kritik bir öneme sahiptir.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-6)</sup>

FP8 Eğitimi ve Multi‑Token Prediction  
V3 ailesi modellerinde karma hassasiyetli FP8 (8 bitlik kayan noktalı sayılar) ve aynı anda birden fazla token tahmini uygulanmaktadır; bu durum eğitim ve çıkarım (inference) süreçlerini hızlandırmaktadır.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-7)</sup>

## Model Ailesi

- **DeepSeek LLM** — 7 milyar ve 67 milyar parametreli temel modeller (2023); *LLaMA‑2 70B*yi çeşitli görevlerde geride bırakan ilk iki dilli (EN/ZH) sürüm.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — programlama odaklı model serisi (1,3 – 33 milyar parametre) ve onun gelişimi olan *Coder‑V2* (16 milyar / 236 milyar MoE, 128K bağlam, 338 programlama dili).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-9)</sup>
- **DeepSeek‑V2** (Mayıs 2024) — MLA mimarisine sahip 236 milyar (21 milyar aktif) parametreli MoE‑LLM; 8,1 trilyon token üzerinde eğitilmiştir.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-10)</sup>
- **DeepSeek‑V3** (Aralık 2024) — 671 milyar (37 milyar aktif) parametre; Nvidia H800 üzerinde yaklaşık 2,8 milyon GPU saati ve yaklaşık 5,5 milyon dolarlık maliyetle eğitilmiştir.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-11)</sup>
- **DeepSeek‑R1** (Ocak 2025) — mantıksal çıkarım (reasoning) odaklı model serisi; R1‑0528 sürümü, AIME 2025 ve LiveCodeBench'te *OpenAI o3*e yaklaşmıştır.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — dinamik mozaik 1024×1024 görüntü işlemeye sahip multimodal VL modelleri (4,5 milyara kadar aktif parametre).<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — MATH benchmark'ında %51,7 doğruluk oranına ulaşan özelleşmiş model; GPT‑4'e yakın performans.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — Lean 4'te teorem ispatı için tasarlanmış 671 milyar parametreli MoE modeli; miniF2F'de %63,5 başarı oranı.
- **Damıtılmış R1 Modelleri** — Llama ve Qwen tabanında 1,5 ila 70 milyar parametre arasında değişen açık sürümler.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-15)</sup>

## Önemli Sürümlerin Kronolojisi

| Tarih       | Sürüm ve Temel Özellikler                                                          |
|-------------|------------------------------------------------------------------------------------|
| 2 Kas 2023  | **DeepSeek‑Coder v1:** Kod için ilk open‑weight modeller.                          |
| 29 Kas 2023 | **DeepSeek LLM 7B/67B:** 2 trilyon token üzerinde eğitilmiş iki dilli model.       |
| 11 Oca 2024 | **DeepSeek‑MoE 16B:** MoE mimarisinin ilk tanıtımı.                                |
| 6 Şub 2024  | **DeepSeek‑Math 7B:** Matematik için özelleşmiş model (MATH'ta %51,7).             |
| 6 May 2024  | **DeepSeek‑V2 236B:** MLA ve MoE mimarilerinin hayata geçirilmesi.                 |
| 17 Haz 2024 | **DeepSeek‑Coder‑V2:** 128K bağlam, 338 programlama dili desteği.                  |
| 13 Ara 2024 | **DeepSeek‑VL2:** MoE tabanlı multimodal model.                                    |
| 27 Ara 2024 | **DeepSeek‑V3 671B:** 6 milyon dolardan az maliyetle eğitilen amiral gemisi model. |
| 20 Oca 2025 | **DeepSeek‑R1 / R1‑Zero:** Reinforcement Learning ile eğitilmiş çıkarım modelleri. |
| 27 Oca 2025 | **Janus‑Pro:** DALL‑E 3'ü geride bırakan görüntü üretim modeli.                    |

## Performans ve Benchmark'lar

- *DeepSeek‑V3*, MMLU ve GPQA‑Diamond'da *Llama 3.1* ve *Qwen 2.5*i geride bırakmış, GPT‑4 seviyesine yaklaşmıştır.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-16)</sup>
- *DeepSeek‑Coder‑V2*, Arena‑Hard'da %72,9 puan alarak GPT‑4o ile aynı düzeye ulaşmış ve Claude‑3.5‑Sonnet dışındaki tüm açık modellerin önüne geçmiştir.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-17)</sup>
- *DeepSeek‑Math 7B*, MATH'ta %51,7 oranına ulaşarak 10 kat daha büyük olan Gemini‑Ultra'ya yakın bir performans sergilemiştir.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-18)</sup>
- *R1‑Zero*, yalnızca Reinforcement Learning eğitimiyle AIME 2024 pass@1 sonucunu %15,6'dan %71'e yükseltmiştir.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-19)</sup>

## Lisanslama ve Açık Kaynak

Modellerin büyük çoğunluğu, ticari kullanıma izin veren MIT veya Apache 2.0 lisansları kapsamında dağıtılmaktadır. Şirket ağırlıkları Hugging Face ve GitHub üzerinde yayımlamakla birlikte, tam veri setlerini ve eğitim süreçlerini (pipeline) kapalı tutmaktadır ("open weight, but not full open source").

## Sektöre Etkisi

- R1'in piyasaya sürülmesi, "6 milyon dolarlık GPT‑4 sınıfı model" haberlerinin gündeme gelmesiyle NVIDIA, Microsoft ve diğer büyük şirketlerin hisse senetlerinde tek günde ciddi düşüşlere neden oldu.<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-20)</sup>
- İhracat kısıtlamaları kapsamındaki Nvidia H800 çipleriyle başarılı eğitimin sergilenmesi, ABD yaptırımlarının etkinliğine ilişkin tartışmaları alevlendirdi ve Çinli yapay zeka hızlandırıcılarının (örneğin Huawei Ascend 910B) geliştirilmesini hızlandırdı.

## Eleştiriler ve Sınırlılıklar

- Güvenlik: HarmBench testinde R1 modeli, istenmeyen isteklerin ("jailbreak") %100'ünü filtrelemeden geçirdi.
- Siyasi sansür: Sohbet bot sürümleri, Çin hükümeti açısından "hassas" sayılan konuları (1989 Tiananmen Meydanı olayları, Tayvan'ın statüsü vb.) filtrelemektedir.
- Veri depolama: Kullanıcı verilerinin Çin'deki sunucularda saklanması, GDPR ve benzeri hukuki düzenlemelere tabi olan Batılı şirketlerin API kullanımını kısıtlamaktadır.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(TR)#cite_note-21)</sup>

## Ayrıca bakınız

- OpenAI Büyük Dil Modelleri
- Mixture-of-Experts

## Kaynakça

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Notlar

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(TR)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
