---
title: "DeepSeek (BG)"
source: "https://systems-analysis.info/int/DeepSeek_(BG)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1597
wiki_created_at: 2026-09-06T22:51:07Z
wiki_modified_at: 2026-09-06T22:51:07Z
downloaded_at: 2026-09-07T22:46:45Z
---

# DeepSeek (BG)

**DeepSeek** — китайска изследователска компания в областта на изкуствения интелект, разработваща големи езикови модели (LLM) и мултимодални системи. Широка известност фирмата придоби благодарение на открытото разпространение на теглата на своите модели и тяхната висока икономическа ефективност, което предизвика корекция на цените на пазара на ИИ в края на 2024 — началото на 2025 година.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-1)</sup>

## История

Основателят на DeepSeek — предприемач и съосновател на хедж фонда *High‑Flyer* Лян Уънфън. През пролетта на 2023 година High‑Flyer отделя изследователското си ИИ-подразделение, което през май същата година се превръща в компанията *DeepSeek AI*. До 2025 година персоналът нараства до ~160 служители.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-2)</sup> От самото начало компанията декларира курс към откритост — публикуване на тегла („open‑weight") под разрешителни лицензи и ориентация към фундаментални изследвания в областта на AGI.

За разлика от повечето стартъпи, DeepSeek се финансира от R&D-бюджета на High-Flyer, което, по думите на основателя, позволява съсредоточаване върху дългосрочни цели, а не върху краткосрочна монетизация.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-3)</sup>

Значителен отзвук в технологичната и финансовата общност компанията предизвика през януари 2025 година след пускането на модела **DeepSeek-R1**. Твърдението, че обучението на модел, сравним с GPT-4, е струвало по-малко от \$6 млн (в сравнение с оценки от \$100+ млн за GPT-4), предизвика срив на акциите на технологичните гиганти и накара индустрията да преосмисли парадигмата „повече изчисления = по-добър модел".<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-4)</sup>

## Архитектурни особености

Mixture‑of‑Experts (DeepSeekMoE)  
Повечето флагмански модели на DeepSeek използват архитектурата смес от експерти (MoE). За разлика от „плътните" модели, при които при обработката на заявка се активират всички параметри, при MoE-моделите за всеки token се задействат само малка част от специализираните подмрежи („експерти"). DeepSeek разработи собствена реализация на MoE с „общи" експерти, финозърнеста сегментация и балансиране на натоварването без спомагателни загуби, което позволява активиране само на част от стотиците милиарди параметри и значително намалява изчислителните разходи.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
Метод за компресиране на KV‑кеша до латентен вектор, спестяващ до 93 % памет и позволяващ използването на контекстни прозорци с размер до 128 000 token. Тази технология е ключова за ефективна работа с дълги текстове.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-6)</sup>

FP8 training и Multi‑Token Prediction  
При моделите от семейство V3 се прилагат смесена точност FP8 (8-битни числа с плаваща запетая) и едновременно предсказване на няколко token, което ускорява процесите на обучение и инференс (извеждане).<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-7)</sup>

## Семейство модели

- **DeepSeek LLM** — базови модели с 7 и 67 млрд параметра (2023), първи двуезичен (EN/ZH) релийз, превъзхождащ *LLaMA‑2 70B* при редица задачи.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — линия от модели за програмиране (1,3 – 33 млрд) и нейното развитие *Coder‑V2* (16 млрд / 236 млрд MoE, контекст 128K, 338 езика за програмиране).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-9)</sup>
- **DeepSeek‑V2** (май 2024) — 236 млрд (21 млрд активни) MoE‑LLM с MLA; обучен на 8,1 трлн token.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-10)</sup>
- **DeepSeek‑V3** (декември 2024) — 671 млрд (37 млрд активни); обучение ≈2,8 млн GPU‑часа на Nvidia H800 на стойност ≈\$5,5 млн.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-11)</sup>
- **DeepSeek‑R1** (януари 2025) — линия от модели за логически разсъждения (reasoning); версията R1‑0528 се приближи до *OpenAI o3* на AIME 2025 и LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — мултимодални VL-модели (до 4,5 млрд активни) с динамична мозаечна обработка на изображения 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — специализиран модел, 51,7 % точност на benchmark MATH; близо до GPT‑4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — 671 млрд MoE за доказателство на теореми в Lean 4; 63,5 % на miniF2F.
- **Дистилирани R1‑модели** — отворени версии от 1,5 до 70 млрд параметра на базата на Llama и Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-15)</sup>

## Хронология на ключовите релийзи

| Дата         | Релийз и ключови особености                                                   |
|--------------|-------------------------------------------------------------------------------|
| 2 ноем 2023  | **DeepSeek‑Coder v1:** първите open‑weight модели за код.                     |
| 29 ноем 2023 | **DeepSeek LLM 7B/67B:** двуезичен модел, обучен на 2 трлн token.             |
| 11 ян 2024   | **DeepSeek‑MoE 16B:** дебют на MoE-архитектурата.                             |
| 6 фев 2024   | **DeepSeek‑Math 7B:** специализиран модел за математика (51,7 % на MATH).     |
| 6 май 2024   | **DeepSeek‑V2 236B:** въвеждане на архитектурите MLA и MoE.                   |
| 17 юни 2024  | **DeepSeek‑Coder‑V2:** контекст 128K, поддръжка на 338 езика за програмиране. |
| 13 дек 2024  | **DeepSeek‑VL2:** мултимодален модел на базата на MoE.                        |
| 27 дек 2024  | **DeepSeek‑V3 671B:** флагмански модел, обучен за по-малко от \$6 млн.        |
| 20 ян 2025   | **DeepSeek‑R1 / R1‑Zero:** модели за разсъждения, обучени с помощта на RL.    |
| 27 ян 2025   | **Janus‑Pro:** модел за генериране на изображения, превъзхождащ DALL‑E 3.     |

## Производителност и benchmark-ове

- *DeepSeek‑V3* превъзхожда *Llama 3.1* и *Qwen 2.5* и се приближава до нивото на GPT‑4 по MMLU и GPQA‑Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-16)</sup>
- *DeepSeek‑Coder‑V2* постига 72,9 % на Arena‑Hard — паритет с GPT‑4o и по-висок резултат от всички отворени модели, с изключение на Claude‑3.5‑Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-17)</sup>
- *DeepSeek‑Math 7B* — 51,7 % на MATH, което е близо до Gemini‑Ultra при 10 пъти по-малък размер.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-18)</sup>
- *R1‑Zero* повиши резултата AIME 2024 pass@1 от 15,6 % до 71 % единствено чрез RL-обучение.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-19)</sup>

## Лицензиране и open‑source

Повечето модели се разпространяват под лиценз MIT или Apache 2.0, допускащ търговско използване. Компанията публикува теглата в Hugging Face и GitHub, но запазва в закрит вид пълните dataset-и и тренировъчните pipeline-и („open weight, but not full open source").

## Влияние върху индустрията

- Пускането на R1 предизвика еднодневен спад в котировките на NVIDIA, Microsoft и други компании на фона на новините за „модел от класа на GPT‑4 за \$6 млн".<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-20)</sup>
- Демонстрацията на успешно обучение върху чипове Nvidia H800 в условията на експортни ограничения стимулира дискусията относно ефективността на американските санкции и ускори разработването на китайски ИИ-ускорители (например Huawei Ascend 910B).

## Критика и ограничения

- Безопасност: при теста HarmBench моделът R1 пропуска 100 % от нежеланите заявки („джейлбрейк").
- Политическа цензура: чат-версиите филтрират теми, „чувствителни" за китайското правителство (събитията на площад Тянанмън от 1989 година, статутът на Тайван и др.).
- Съхранение на данни: съхранението на потребителски данни на сървъри в Китай ограничава използването на API от западни корпорации, подчиняващи се на GDPR и аналогични правни режими.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(BG)#cite_note-21)</sup>

## Литература

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Бележки

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(BG)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>

## Вижте също

- Големи езикови модели на OpenAI
- Mixture-of-Experts
