DeepSeek (modelo de linguagem)
DeepSeek é uma empresa chinesa de pesquisa em inteligência artificial que desenvolve modelos de linguagem grandes (LLMs) e sistemas multimodais. A empresa ganhou notoriedade pela distribuição aberta dos pesos de seus modelos e por sua alta eficiência econômica, o que provocou um ajuste de preços no mercado de IA no final de 2024 e início de 2025.[1]
História
O fundador da DeepSeek é o empreendedor e cofundador do fundo de hedge High-Flyer, Liang Wenfeng. Na primavera de 2023, a High-Flyer desmembrou sua divisão de pesquisa em IA, que em maio do mesmo ano se tornou a empresa DeepSeek AI. Em 2025, o quadro de funcionários já havia crescido para aproximadamente 160 pessoas.[2] Desde o início, a empresa declarou um compromisso com a abertura — publicando pesos ("open-weight") sob licenças permissivas e focando em pesquisas fundamentais sobre AGI.
Diferentemente da maioria das startups, a DeepSeek é financiada pelo orçamento de P&D da High-Flyer, o que, segundo seu fundador, permite que a empresa se concentre em metas de longo prazo em vez da monetização imediata.[3]
A empresa gerou um impacto significativo nas comunidades de tecnologia e finanças em janeiro de 2025, após o lançamento do modelo DeepSeek-R1. A afirmação de que o treinamento de um modelo comparável ao GPT-4 custou menos de US$ 6 milhões (em comparação com estimativas de mais de US$ 100 milhões para o GPT-4) provocou uma queda acentuada nas ações de gigantes da tecnologia e forçou a indústria a repensar o paradigma de que "mais computação = melhor modelo".[4]
Características da Arquitetura
- Mixture‑of‑Experts (DeepSeekMoE)
- A maioria dos modelos principais da DeepSeek utiliza a arquitetura de mistura de especialistas (MoE). Diferentemente dos modelos "densos", onde todos os parâmetros são ativados para processar uma solicitação, nos modelos MoE, apenas uma pequena parte de sub-redes especializadas ("experts") é utilizada para cada token. A DeepSeek desenvolveu sua própria implementação de MoE com experts "compartilhados", segmentação de granularidade fina e balanceamento de carga sem perdas auxiliares, o que permite ativar apenas uma fração das centenas de bilhões de parâmetros e reduzir drasticamente os custos computacionais.[5]
- Multi‑Head Latent Attention (MLA)
- Um método para comprimir o cache KV em um vetor latente, economizando até 93% da memória e permitindo o uso de janelas de contexto de até 128.000 tokens. Essa tecnologia é fundamental para o trabalho eficiente com textos longos.[6]
- FP8 training e Multi‑Token Prediction
- Nos modelos da família V3, é utilizada a precisão mista FP8 (números de ponto flutuante de 8 bits) e a previsão simultânea de múltiplos tokens, o que acelera os processos de treinamento e inferência.[7]
Família de Modelos
- DeepSeek LLM — modelos base de 7 e 67 bilhões de parâmetros (2023), o primeiro lançamento bilíngue (EN/ZH), que superou o LLaMA‑2 70B em diversas tarefas.[8]
- DeepSeek‑Coder (2023) — uma linha de modelos para programação (1,3 – 33 bilhões) e sua evolução, o Coder‑V2 (16 bilhões / 236 bilhões MoE, contexto de 128K, 338 linguagens de programação).[9]
- DeepSeek‑V2 (maio de 2024) — LLM MoE de 236 bilhões de parâmetros (21 bilhões ativos) com MLA; treinado com 8,1 trilhões de tokens.[10]
- DeepSeek‑V3 (dezembro de 2024) — 671 bilhões (37 bilhões ativos); treinamento de ≈2,8 milhões de horas-GPU em GPUs Nvidia H800, com custo aproximado de US$ 5,5 milhões.[11]
- DeepSeek‑R1 (janeiro de 2025) — linha de modelos para raciocínio lógico (reasoning); a versão R1-0528 se aproximou do OpenAI o3 nos benchmarks AIME 2025 e LiveCodeBench.[12]
- DeepSeek‑VL / VL2 — modelos multimodais VL (até 4,5 bilhões de parâmetros ativos) com processamento dinâmico de imagens em mosaico de 1024×1024.[13]
- DeepSeek‑Math 7B — modelo especializado, com 51,7% de precisão no benchmark MATH; próximo ao GPT-4.[14]
- DeepSeek‑Prover‑V2 — MoE de 671 bilhões para prova de teoremas em Lean 4; 63,5% no miniF2F.
- Modelos R1 destilados — versões abertas de 1,5 a 70 bilhões de parâmetros baseadas em Llama e Qwen.[15]
Cronologia dos Principais Lançamentos
| Data | Lançamento e Principais Características |
|---|---|
| 2 nov 2023 | DeepSeek‑Coder v1: primeiros modelos open-weight para código. |
| 29 nov 2023 | DeepSeek LLM 7B/67B: modelo bilíngue treinado com 2 trilhões de tokens. |
| 11 jan 2024 | DeepSeek‑MoE 16B: estreia da arquitetura MoE. |
| 6 fev 2024 | DeepSeek‑Math 7B: modelo especializado para matemática (51,7% no MATH). |
| 6 mai 2024 | DeepSeek‑V2 236B: implementação das arquiteturas MLA e MoE. |
| 17 jun 2024 | DeepSeek‑Coder‑V2: contexto de 128K, suporte para 338 linguagens de programação. |
| 13 dez 2024 | DeepSeek‑VL2: modelo multimodal baseado em MoE. |
| 27 dez 2024 | DeepSeek‑V3 671B: modelo principal, treinado por menos de US$ 6 milhões. |
| 20 jan 2025 | DeepSeek‑R1 / R1‑Zero: modelos para raciocínio, treinados com RL. |
| 27 jan 2025 | Janus‑Pro: modelo para geração de imagens que supera o DALL-E 3. |
Desempenho e Benchmarks
- O DeepSeek‑V3 superou o Llama 3.1 e o Qwen 2.5 e se aproximou do nível do GPT-4 nos benchmarks MMLU e GPQA-Diamond.[16]
- O DeepSeek‑Coder‑V2 alcançou 72,9% no Arena-Hard — em paridade com o GPT-4o e acima de todos os modelos abertos, exceto o Claude-3.5-Sonnet.[17]
- O DeepSeek‑Math 7B atingiu 51,7% no MATH, um resultado próximo ao do Gemini-Ultra, mas com um tamanho 10 vezes menor.[18]
- O R1-Zero melhorou o resultado no AIME 2024 pass@1 de 15,6% para 71% apenas através do treinamento com RL.[19]
Economia e API
A DeepSeek oferece uma API pública para os modelos V3 e R1 com preços que variam de US$ 0,07 a US$ 0,14 por milhão de tokens de entrada em caso de acerto de cache (cache-hit) e de US$ 1,10 a US$ 2,19 por milhão de tokens de saída — valores até dezenas de vezes mais baratos que as tarifas do GPT-4o.[20]
Licenciamento e Open Source
A maioria dos modelos é distribuída sob a licença MIT ou Apache 2.0, que permitem o uso comercial. A empresa publica os pesos no Hugging Face e no GitHub, mas mantém os datasets completos e os pipelines de treinamento fechados ("open weight, but not full open source").
Impacto na Indústria
- O lançamento do R1 causou uma queda de um dia nas cotações da NVIDIA, Microsoft e outras empresas, em meio às notícias sobre um "modelo da classe do GPT-4 por US$ 6 milhões".[21]
- A demonstração de um treinamento bem-sucedido em chips Nvidia H800 sob restrições de exportação estimulou o debate sobre a eficácia das sanções dos EUA e acelerou o desenvolvimento de aceleradores de IA chineses (por exemplo, o Huawei Ascend 910B).
Críticas e Limitações
- Segurança: no teste HarmBench, o modelo R1 permitiu 100% das solicitações indesejadas ("jailbreak").
- Censura política: as versões de chat filtram tópicos "sensíveis" para o governo chinês (como os eventos na Praça da Paz Celestial em 1989, o status de Taiwan, etc.).
- Armazenamento de dados: o armazenamento de dados de usuários em servidores na China limita o uso da API por corporações ocidentais sujeitas ao GDPR e a regimes legais semelhantes.[22]
Ver também
- Modelos de Linguagem Grandes da OpenAI
- Mixture-of-Experts
Literatura
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
Notas
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek Explained: Why This AI Model Is Gaining Popularity // DigitalOcean.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.