---
title: "DeepSeek (modelo de linguagem)"
source: "https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(modelo_de_linguagem)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 1619
wiki_created_at: 2026-09-06T22:51:26Z
wiki_modified_at: 2026-09-06T22:51:26Z
downloaded_at: 2026-09-07T22:46:53Z
---

# DeepSeek (modelo de linguagem)

**DeepSeek** é uma empresa chinesa de pesquisa em inteligência artificial que desenvolve modelos de linguagem grandes (LLMs) e sistemas multimodais. A empresa ganhou notoriedade pela distribuição aberta dos pesos de seus modelos e por sua alta eficiência econômica, o que provocou um ajuste de preços no mercado de IA no final de 2024 e início de 2025.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-1)</sup>

## História

O fundador da DeepSeek é o empreendedor e cofundador do fundo de hedge *High-Flyer*, Liang Wenfeng. Na primavera de 2023, a High-Flyer desmembrou sua divisão de pesquisa em IA, que em maio do mesmo ano se tornou a empresa *DeepSeek AI*. Em 2025, o quadro de funcionários já havia crescido para aproximadamente 160 pessoas.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-2)</sup> Desde o início, a empresa declarou um compromisso com a abertura — publicando pesos ("open-weight") sob licenças permissivas e focando em pesquisas fundamentais sobre AGI.

Diferentemente da maioria das startups, a DeepSeek é financiada pelo orçamento de P&D da High-Flyer, o que, segundo seu fundador, permite que a empresa se concentre em metas de longo prazo em vez da monetização imediata.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-3)</sup>

A empresa gerou um impacto significativo nas comunidades de tecnologia e finanças em janeiro de 2025, após o lançamento do modelo **DeepSeek-R1**. A afirmação de que o treinamento de um modelo comparável ao GPT-4 custou menos de US\$ 6 milhões (em comparação com estimativas de mais de US\$ 100 milhões para o GPT-4) provocou uma queda acentuada nas ações de gigantes da tecnologia e forçou a indústria a repensar o paradigma de que "mais computação = melhor modelo".<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-4)</sup>

## Características da Arquitetura

Mixture‑of‑Experts (DeepSeekMoE)  
A maioria dos modelos principais da DeepSeek utiliza a arquitetura de mistura de especialistas (MoE). Diferentemente dos modelos "densos", onde todos os parâmetros são ativados para processar uma solicitação, nos modelos MoE, apenas uma pequena parte de sub-redes especializadas ("experts") é utilizada para cada token. A DeepSeek desenvolveu sua própria implementação de MoE com experts "compartilhados", segmentação de granularidade fina e balanceamento de carga sem perdas auxiliares, o que permite ativar apenas uma fração das centenas de bilhões de parâmetros e reduzir drasticamente os custos computacionais.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
Um método para comprimir o cache KV em um vetor latente, economizando até 93% da memória e permitindo o uso de janelas de contexto de até 128.000 tokens. Essa tecnologia é fundamental para o trabalho eficiente com textos longos.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-6)</sup>

FP8 training e Multi‑Token Prediction  
Nos modelos da família V3, é utilizada a precisão mista FP8 (números de ponto flutuante de 8 bits) e a previsão simultânea de múltiplos tokens, o que acelera os processos de treinamento e inferência.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-7)</sup>

## Família de Modelos

- **DeepSeek LLM** — modelos base de 7 e 67 bilhões de parâmetros (2023), o primeiro lançamento bilíngue (EN/ZH), que superou o *LLaMA‑2 70B* em diversas tarefas.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-8)</sup>
- **DeepSeek‑Coder** (2023) — uma linha de modelos para programação (1,3 – 33 bilhões) e sua evolução, o *Coder‑V2* (16 bilhões / 236 bilhões MoE, contexto de 128K, 338 linguagens de programação).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-9)</sup>
- **DeepSeek‑V2** (maio de 2024) — LLM MoE de 236 bilhões de parâmetros (21 bilhões ativos) com MLA; treinado com 8,1 trilhões de tokens.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-10)</sup>
- **DeepSeek‑V3** (dezembro de 2024) — 671 bilhões (37 bilhões ativos); treinamento de ≈2,8 milhões de horas-GPU em GPUs Nvidia H800, com custo aproximado de US\$ 5,5 milhões.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-11)</sup>
- **DeepSeek‑R1** (janeiro de 2025) — linha de modelos para raciocínio lógico (reasoning); a versão R1-0528 se aproximou do *OpenAI o3* nos benchmarks AIME 2025 e LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — modelos multimodais VL (até 4,5 bilhões de parâmetros ativos) com processamento dinâmico de imagens em mosaico de 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — modelo especializado, com 51,7% de precisão no benchmark MATH; próximo ao GPT-4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — MoE de 671 bilhões para prova de teoremas em Lean 4; 63,5% no miniF2F.
- **Modelos R1 destilados** — versões abertas de 1,5 a 70 bilhões de parâmetros baseadas em Llama e Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-15)</sup>

## Cronologia dos Principais Lançamentos

| Data        | Lançamento e Principais Características                                              |
|-------------|--------------------------------------------------------------------------------------|
| 2 nov 2023  | **DeepSeek‑Coder v1:** primeiros modelos open-weight para código.                    |
| 29 nov 2023 | **DeepSeek LLM 7B/67B:** modelo bilíngue treinado com 2 trilhões de tokens.          |
| 11 jan 2024 | **DeepSeek‑MoE 16B:** estreia da arquitetura MoE.                                    |
| 6 fev 2024  | **DeepSeek‑Math 7B:** modelo especializado para matemática (51,7% no MATH).          |
| 6 mai 2024  | **DeepSeek‑V2 236B:** implementação das arquiteturas MLA e MoE.                      |
| 17 jun 2024 | **DeepSeek‑Coder‑V2:** contexto de 128K, suporte para 338 linguagens de programação. |
| 13 dez 2024 | **DeepSeek‑VL2:** modelo multimodal baseado em MoE.                                  |
| 27 dez 2024 | **DeepSeek‑V3 671B:** modelo principal, treinado por menos de US\$ 6 milhões.        |
| 20 jan 2025 | **DeepSeek‑R1 / R1‑Zero:** modelos para raciocínio, treinados com RL.                |
| 27 jan 2025 | **Janus‑Pro:** modelo para geração de imagens que supera o DALL-E 3.                 |

## Desempenho e Benchmarks

- O *DeepSeek‑V3* superou o *Llama 3.1* e o *Qwen 2.5* e se aproximou do nível do GPT-4 nos benchmarks MMLU e GPQA-Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-16)</sup>
- O *DeepSeek‑Coder‑V2* alcançou 72,9% no Arena-Hard — em paridade com o GPT-4o e acima de todos os modelos abertos, exceto o Claude-3.5-Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-17)</sup>
- O *DeepSeek‑Math 7B* atingiu 51,7% no MATH, um resultado próximo ao do Gemini-Ultra, mas com um tamanho 10 vezes menor.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-18)</sup>
- O *R1-Zero* melhorou o resultado no AIME 2024 pass@1 de 15,6% para 71% apenas através do treinamento com RL.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-19)</sup>

## Economia e API

A DeepSeek oferece uma API pública para os modelos V3 e R1 com preços que variam de US\$ 0,07 a US\$ 0,14 por milhão de tokens de entrada em caso de acerto de cache (cache-hit) e de US\$ 1,10 a US\$ 2,19 por milhão de tokens de saída — valores até dezenas de vezes mais baratos que as tarifas do GPT-4o.<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-20)</sup>

## Licenciamento e Open Source

A maioria dos modelos é distribuída sob a licença MIT ou Apache 2.0, que permitem o uso comercial. A empresa publica os pesos no Hugging Face e no GitHub, mas mantém os datasets completos e os pipelines de treinamento fechados ("open weight, but not full open source").

## Impacto na Indústria

- O lançamento do R1 causou uma queda de um dia nas cotações da NVIDIA, Microsoft e outras empresas, em meio às notícias sobre um "modelo da classe do GPT-4 por US\$ 6 milhões".<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-21)</sup>
- A demonstração de um treinamento bem-sucedido em chips Nvidia H800 sob restrições de exportação estimulou o debate sobre a eficácia das sanções dos EUA e acelerou o desenvolvimento de aceleradores de IA chineses (por exemplo, o Huawei Ascend 910B).

## Críticas e Limitações

- Segurança: no teste HarmBench, o modelo R1 permitiu 100% das solicitações indesejadas ("jailbreak").
- Censura política: as versões de chat filtram tópicos "sensíveis" para o governo chinês (como os eventos na Praça da Paz Celestial em 1989, o status de Taiwan, etc.).
- Armazenamento de dados: o armazenamento de dados de usuários em servidores na China limita o uso da API por corporações ocidentais sujeitas ao GDPR e a regimes legais semelhantes.<sup>[\[22\]](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_note-22)</sup>

## Ver também

- Modelos de Linguagem Grandes da OpenAI
- Mixture-of-Experts

## Literatura

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. <a href="https://arxiv.org/abs/2401.06066" class="external text" rel="nofollow">arXiv:2401.06066</a>.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. <a href="https://arxiv.org/abs/2402.13753" class="external text" rel="nofollow">arXiv:2402.13753</a>.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. <a href="https://arxiv.org/abs/2504.12637" class="external text" rel="nofollow">arXiv:2504.12637</a>.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. <a href="https://arxiv.org/abs/2502.16428" class="external text" rel="nofollow">arXiv:2502.16428</a>.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. <a href="https://arxiv.org/abs/2006.16668" class="external text" rel="nofollow">arXiv:2006.16668</a>.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. <a href="https://arxiv.org/abs/2309.00071" class="external text" rel="nofollow">arXiv:2309.00071</a>.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. <a href="https://arxiv.org/abs/2502.05177" class="external text" rel="nofollow">arXiv:2502.05177</a>.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. <a href="https://arxiv.org/abs/2406.13282" class="external text" rel="nofollow">arXiv:2406.13282</a>.

## Notas

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-20) DeepSeek Explained: Why This AI Model Is Gaining Popularity // DigitalOcean.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/DeepSeek_(modelo_de_linguagem)#cite_ref-22) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
