---
title: "DeepSeek (modelo de lenguaje)"
source: "https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(modelo_de_lenguaje)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 1618
wiki_created_at: 2026-09-06T22:51:25Z
wiki_modified_at: 2026-09-06T22:51:25Z
downloaded_at: 2026-09-07T22:46:52Z
---

# DeepSeek (modelo de lenguaje)

**DeepSeek** es una empresa china de investigación en inteligencia artificial que desarrolla grandes modelos lingüísticos (LLM) y sistemas multimodales. La firma ganó gran notoriedad gracias a la distribución abierta de los pesos de sus modelos y su alta eficiencia económica, lo que provocó un ajuste de precios en el mercado de la IA a finales de 2024 y principios de 2025.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-1)</sup>

## Historia

El fundador de DeepSeek es el empresario y cofundador del fondo de cobertura *High‑Flyer*, Liang Wenfeng. En la primavera de 2023, High‑Flyer separó su división de investigación de IA, que en mayo de ese mismo año se convirtió en la empresa *DeepSeek AI*. Para 2025, la plantilla había crecido hasta alcanzar aproximadamente 160 empleados.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-2)</sup> Desde sus inicios, la empresa declaró un rumbo hacia la apertura: la publicación de los pesos («open‑weight») bajo licencias permisivas y una orientación hacia la investigación fundamental de la AGI.

A diferencia de la mayoría de las startups, DeepSeek se financia con el presupuesto de I+D de High-Flyer, lo que, según su fundador, le permite centrarse en objetivos a largo plazo en lugar de en la monetización inmediata.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-3)</sup>

La empresa generó una resonancia significativa en la comunidad tecnológica y financiera en enero de 2025 tras el lanzamiento del modelo **DeepSeek-R1**. La afirmación de que el entrenamiento de un modelo comparable a GPT-4 costó menos de 6 millones de dólares (en comparación con las estimaciones de más de 100 millones de dólares para GPT-4) provocó el desplome de las acciones de los gigantes tecnológicos y obligó a la industria a reconsiderar el paradigma de «más computación = mejor modelo».<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-4)</sup>

## Características arquitectónicas

Mixture‑of‑Experts (DeepSeekMoE)  
La mayoría de los modelos insignia de DeepSeek utilizan la arquitectura de mezcla de expertos (MoE). A diferencia de los modelos «densos», donde todos los parámetros se activan al procesar una solicitud, en los modelos MoE solo se utiliza una pequeña parte de las subredes especializadas («expertos») para cada token. DeepSeek desarrolló su propia implementación de MoE con expertos «compartidos», segmentación de grano fino y equilibrio de carga sin pérdidas auxiliares, lo que permite activar solo una parte de los cientos de miles de millones de parámetros y reducir drásticamente los costos computacionales.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
Un método para comprimir la caché KV en un vector latente, que ahorra hasta un 93 % de memoria y permite utilizar ventanas de contexto de hasta 128 000 tokens. Esta tecnología es clave para trabajar eficientemente con textos largos.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-6)</sup>

FP8 training y Multi‑Token Prediction  
En los modelos de la familia V3, se utiliza precisión mixta FP8 (números de punto flotante de 8 bits) y la predicción simultánea de múltiples tokens, lo que acelera los procesos de entrenamiento e inferencia.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-7)</sup>

## Familia de modelos

- **DeepSeek LLM** — modelos base de 7 y 67 mil millones de parámetros (2023), el primer lanzamiento bilingüe (EN/ZH) que superó a *LLaMA‑2 70B* en varias tareas.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — una línea de modelos para programación (1.3 – 33 mil millones) y su evolución *Coder‑V2* (16 mil millones / 236 mil millones MoE, contexto de 128K, 338 lenguajes de codificación).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-9)</sup>
- **DeepSeek‑V2** (mayo de 2024) — 236 mil millones (21 mil millones activos) MoE‑LLM con MLA; entrenado con 8.1 billones de tokens.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-10)</sup>
- **DeepSeek‑V3** (diciembre de 2024) — 671 mil millones (37 mil millones activos); entrenamiento de ≈2.8 millones de horas de GPU en Nvidia H800 con un costo de ≈\$5.5 millones.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-11)</sup>
- **DeepSeek‑R1** (enero de 2025) — línea de modelos para el razonamiento lógico (reasoning); la versión R1‑0528 se acercó a *OpenAI o3* en AIME 2025 y LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — modelos multimodales VL (hasta 4.5 mil millones activos) con procesamiento dinámico de imágenes en mosaico de 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — modelo especializado, 51.7 % de precisión en el benchmark MATH; cercano a GPT‑4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — 671 mil millones MoE para la demostración de teoremas en Lean 4; 63.5 % en miniF2F.
- **Modelos R1 destilados** — versiones abiertas de 1.5 a 70 mil millones de parámetros basadas en Llama y Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-15)</sup>

## Cronología de lanzamientos clave

| Fecha       | Lanzamiento y características clave                                                  |
|-------------|--------------------------------------------------------------------------------------|
| 2 nov 2023  | **DeepSeek‑Coder v1:** primeros modelos open‑weight para código.                     |
| 29 nov 2023 | **DeepSeek LLM 7B/67B:** modelo bilingüe entrenado con 2 billones de tokens.         |
| 11 ene 2024 | **DeepSeek‑MoE 16B:** debut de la arquitectura MoE.                                  |
| 6 feb 2024  | **DeepSeek‑Math 7B:** modelo especializado para matemáticas (51.7 % en MATH).        |
| 6 may 2024  | **DeepSeek‑V2 236B:** implementación de las arquitecturas MLA y MoE.                 |
| 17 jun 2024 | **DeepSeek‑Coder‑V2:** contexto de 128K, soporte para 338 lenguajes de programación. |
| 13 dic 2024 | **DeepSeek‑VL2:** modelo multimodal basado en MoE.                                   |
| 27 dic 2024 | **DeepSeek‑V3 671B:** modelo insignia entrenado por menos de \$6 millones.           |
| 20 ene 2025 | **DeepSeek‑R1 / R1‑Zero:** modelos para razonamiento, entrenados con RL.             |
| 27 ene 2025 | **Janus‑Pro:** modelo para generación de imágenes que supera a DALL‑E 3.             |

## Rendimiento y benchmarks

- *DeepSeek‑V3* superó a *Llama 3.1* y *Qwen 2.5* y se acercó al nivel de GPT‑4 en MMLU y GPQA‑Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-16)</sup>
- *DeepSeek‑Coder‑V2* obtuvo un 72.9 % en Arena‑Hard, alcanzando la paridad con GPT‑4o y superando a todos los modelos abiertos excepto a Claude‑3.5‑Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-17)</sup>
- *DeepSeek‑Math 7B* — 51.7 % en MATH, un resultado cercano a Gemini‑Ultra con un tamaño 10 veces menor.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-18)</sup>
- *R1‑Zero* elevó el resultado de AIME 2024 pass@1 del 15.6 % al 71 % únicamente mediante el entrenamiento por RL.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-19)</sup>

## Economía y API

DeepSeek ofrece una API pública para los modelos V3 y R1 con precios que van de \$0.07 a \$0.14 por millón de tokens de entrada con cache‑hit y de \$1.10 a \$2.19 por millón de tokens de salida, siendo hasta decenas de veces más económico que las tarifas de GPT‑4o.<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-20)</sup>

## Licenciamiento y open‑source

La mayoría de los modelos se distribuyen bajo la licencia MIT o Apache 2.0, que permite el uso comercial. La empresa publica los pesos en Hugging Face y GitHub, pero mantiene cerrados los datasets completos y los pipelines de entrenamiento («open weight, but not full open source»).

## Impacto en la industria

- El lanzamiento de R1 provocó una caída de un día en las cotizaciones de NVIDIA, Microsoft y otras empresas ante la noticia de un «modelo de clase GPT‑4 por \$6 millones».<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-21)</sup>
- La demostración de un entrenamiento exitoso en chips Nvidia H800 bajo restricciones de exportación estimuló el debate sobre la efectividad de las sanciones de EE. UU. y aceleró el desarrollo de aceleradores de IA chinos (por ejemplo, Huawei Ascend 910B).

## Críticas y limitaciones

- Seguridad: en la prueba HarmBench, el modelo R1 omitió el 100 % de las solicitudes no deseadas («jailbreak»).
- Censura política: las versiones de chat filtran temas «sensibles» para el gobierno chino (eventos en la Plaza de Tiananmén en 1989, el estatus de Taiwán, etc.).
- Almacenamiento de datos: el almacenamiento de datos de usuario en servidores en China limita el uso de la API por parte de corporaciones occidentales sujetas al GDPR y regímenes legales similares.<sup>[\[22\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_note-22)</sup>

## Véase también

- [Mixture-of-Experts](https://systems-analysis.info/int/Mixture-of-Experts_(MoE)_(ES) "Mixture-of-Experts (MoE) (ES)")

## Literatura

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. <a href="https://arxiv.org/abs/2401.06066" class="external text" rel="nofollow">arXiv:2401.06066</a>.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. <a href="https://arxiv.org/abs/2402.13753" class="external text" rel="nofollow">arXiv:2402.13753</a>.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. <a href="https://arxiv.org/abs/2504.12637" class="external text" rel="nofollow">arXiv:2504.12637</a>.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. <a href="https://arxiv.org/abs/2502.16428" class="external text" rel="nofollow">arXiv:2502.16428</a>.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. <a href="https://arxiv.org/abs/2309.00071" class="external text" rel="nofollow">arXiv:2309.00071</a>.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. <a href="https://arxiv.org/abs/2502.05177" class="external text" rel="nofollow">arXiv:2502.05177</a>.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. <a href="https://arxiv.org/abs/2406.13282" class="external text" rel="nofollow">arXiv:2406.13282</a>.

## Referencias

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-20) DeepSeek Explained: Why This AI Model Is Gaining Popularity // DigitalOcean.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_lenguaje)#cite_ref-22) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
