---
title: "DeepSeek (IT)"
source: "https://systems-analysis.info/int/DeepSeek_(IT)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1606
wiki_created_at: 2026-09-06T22:51:14Z
wiki_modified_at: 2026-09-06T22:51:14Z
downloaded_at: 2026-09-07T22:46:48Z
---

# DeepSeek (IT)

**DeepSeek** — azienda cinese di ricerca nel campo dell'intelligenza artificiale che sviluppa Large Language Model (LLM) e sistemi multimodali. L'azienda ha acquisito ampia notorietà grazie alla distribuzione open-weight dei pesi dei propri modelli e alla loro elevata efficienza economica, il che ha provocato una revisione dei prezzi nel mercato dell'IA tra la fine del 2024 e l'inizio del 2025.<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-1)</sup>

## Storia

Il fondatore di DeepSeek è l'imprenditore e co-fondatore dell'hedge fund *High-Flyer* Liang Wenfeng. Nella primavera del 2023, High-Flyer ha separato la divisione di ricerca sull'IA, che nel maggio dello stesso anno è diventata la società *DeepSeek AI*. Già entro il 2025 il personale era cresciuto fino a circa 160 dipendenti.<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-2)</sup> Fin dai primi giorni l'azienda ha dichiarato un orientamento verso l'apertura — la pubblicazione dei pesi («open-weight») con licenze permissive e una focalizzazione sulla ricerca fondamentale in ambito AGI.

A differenza della maggior parte delle startup, DeepSeek è finanziata dal budget R&D di High-Flyer, il che, secondo il fondatore, consente di concentrarsi su obiettivi a lungo termine piuttosto che sulla monetizzazione immediata.<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-3)</sup>

L'azienda ha suscitato una notevole risonanza nella comunità tecnologica e finanziaria nel gennaio 2025, in seguito al rilascio del modello **DeepSeek-R1**. L'annuncio che l'addestramento di un modello paragonabile a GPT-4 era costato meno di 6 milioni di dollari (rispetto alle stime di oltre 100 milioni di dollari per GPT-4) ha provocato un crollo delle azioni dei giganti tecnologici e ha spinto il settore a riconsiderare il paradigma «più calcolo = modello migliore».<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-4)</sup>

## Caratteristiche architetturali

Mixture-of-Experts (DeepSeekMoE)  
La maggior parte dei modelli di punta di DeepSeek utilizza l'architettura Mixture of Experts (MoE). A differenza dei modelli «densi», in cui tutti i parametri vengono attivati durante l'elaborazione di una richiesta, nei modelli MoE viene coinvolta solo una piccola parte di sottoreti specializzate («esperti») per ogni token. DeepSeek ha sviluppato una propria implementazione di MoE con esperti «condivisi», segmentazione a grana fine e bilanciamento del carico senza perdite ausiliarie, il che consente di attivare solo una frazione delle centinaia di miliardi di parametri e di ridurre drasticamente i costi computazionali.<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-5)</sup>

Multi-Head Latent Attention (MLA)  
Metodo di compressione della cache KV in un vettore latente, che consente un risparmio fino al 93% di memoria e permette di utilizzare finestre contestuali fino a 128.000 token. Questa tecnologia è fondamentale per un'elaborazione efficiente di testi lunghi.<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-6)</sup>

FP8 training e Multi-Token Prediction  
Nei modelli della famiglia V3 vengono impiegati la precisione mista FP8 (numeri in virgola mobile a 8 bit) e la predizione simultanea di più token, il che accelera i processi di addestramento e di inferenza.<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-7)</sup>

## Famiglia di modelli

- **DeepSeek LLM** — modelli base da 7 e 67 miliardi di parametri (2023), primo rilascio bilingue (EN/ZH) che ha superato *LLaMA-2 70B* in diversi task.<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-8)</sup>
- **DeepSeek-Coder** (2023) — linea di modelli per la programmazione (da 1,3 a 33 miliardi) e il suo sviluppo *Coder-V2* (16 miliardi / 236 miliardi MoE, contesto 128K, 338 linguaggi di programmazione).<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-9)</sup>
- **DeepSeek-V2** (maggio 2024) — 236 miliardi (21 miliardi attivi) MoE-LLM con MLA; addestrato su 8,1 trilioni di token.<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-10)</sup>
- **DeepSeek-V3** (dicembre 2024) — 671 miliardi (37 miliardi attivi); addestramento ≈2,8 milioni di GPU-ore su Nvidia H800 per un costo di ≈5,5 milioni di dollari.<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-11)</sup>
- **DeepSeek-R1** (gennaio 2025) — linea di modelli per il ragionamento logico (reasoning); la versione R1-0528 si è avvicinata a *OpenAI o3* su AIME 2025 e LiveCodeBench.<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-12)</sup>
- **DeepSeek-VL / VL2** — modelli multimodali VL (fino a 4,5 miliardi di parametri attivi) con elaborazione a mosaico dinamico di immagini 1024×1024.<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-13)</sup>
- **DeepSeek-Math** 7B — modello specializzato, 51,7% di accuratezza sul benchmark MATH; vicino a GPT-4.<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-14)</sup>
- **DeepSeek-Prover-V2** — 671 miliardi MoE per la dimostrazione di teoremi in Lean 4; 63,5% su miniF2F.
- **Modelli R1 distillati** — versioni open-weight da 1,5 a 70 miliardi di parametri basate su Llama e Qwen.<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-15)</sup>

## Cronologia dei rilasci principali

| Data        | Rilascio e caratteristiche principali                                                             |
|-------------|---------------------------------------------------------------------------------------------------|
| 2 nov 2023  | **DeepSeek-Coder v1:** primi modelli open-weight per il codice.                                   |
| 29 nov 2023 | **DeepSeek LLM 7B/67B:** modello bilingue, addestrato su 2 trilioni di token.                     |
| 11 gen 2024 | **DeepSeek-MoE 16B:** debutto dell'architettura MoE.                                              |
| 6 feb 2024  | **DeepSeek-Math 7B:** modello specializzato per la matematica (51,7% su MATH).                    |
| 6 mag 2024  | **DeepSeek-V2 236B:** introduzione delle architetture MLA e MoE.                                  |
| 17 giu 2024 | **DeepSeek-Coder-V2:** contesto 128K, supporto di 338 linguaggi di programmazione.                |
| 13 dic 2024 | **DeepSeek-VL2:** modello multimodale basato su MoE.                                              |
| 27 dic 2024 | **DeepSeek-V3 671B:** modello di punta, addestrato con un costo inferiore a 6 milioni di dollari. |
| 20 gen 2025 | **DeepSeek-R1 / R1-Zero:** modelli per il ragionamento, addestrati con Reinforcement Learning.    |
| 27 gen 2025 | **Janus-Pro:** modello per la generazione di immagini, che supera DALL-E 3.                       |

## Prestazioni e benchmark

- *DeepSeek-V3* ha superato *Llama 3.1* e *Qwen 2.5* e si è avvicinata al livello di GPT-4 su MMLU e GPQA-Diamond.<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-16)</sup>
- *DeepSeek-Coder-V2* ha ottenuto il 72,9% su Arena-Hard — alla pari con GPT-4o e superiore a tutti i modelli open-weight ad eccezione di Claude-3.5-Sonnet.<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-17)</sup>
- *DeepSeek-Math 7B* — 51,7% su MATH, risultato vicino a Gemini-Ultra con dimensioni 10 volte inferiori.<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-18)</sup>
- *R1-Zero* ha migliorato il risultato AIME 2024 pass@1 dal 15,6% al 71% esclusivamente attraverso l'addestramento con Reinforcement Learning.<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-19)</sup>

## Licenze e open-source

La maggior parte dei modelli è distribuita con licenza MIT o Apache 2.0, che consente l'uso commerciale. L'azienda pubblica i pesi su Hugging Face e GitHub, ma mantiene riservati i dataset completi e le pipeline di addestramento («open weight, but not full open source»).

## Impatto sul settore

- Il lancio di R1 ha causato un calo giornaliero delle quotazioni di NVIDIA, Microsoft e di altre società, in seguito alle notizie di «un modello di classe GPT-4 per 6 milioni di dollari».<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-20)</sup>
- La dimostrazione del riuscito addestramento su chip Nvidia H800 soggetti a restrizioni all'esportazione ha stimolato il dibattito sull'efficacia delle sanzioni statunitensi e ha accelerato lo sviluppo di acceleratori IA cinesi (ad esempio, Huawei Ascend 910B).

## Critiche e limitazioni

- Sicurezza: nel test HarmBench il modello R1 ha consentito il 100% delle richieste indesiderate («jailbreak»).
- Censura politica: le versioni chat filtrano gli argomenti «sensibili» per il governo cinese (gli eventi di Piazza Tiananmen del 1989, lo status di Taiwan, ecc.).
- Conservazione dei dati: l'archiviazione dei dati degli utenti su server in Cina limita l'utilizzo dell'API da parte delle aziende occidentali soggette al GDPR e a regimi giuridici analoghi.<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(IT)#cite_note-21)</sup>

## Vedi anche

- Grandi modelli linguistici di OpenAI
- Mixture-of-Experts

## Bibliografia

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## Note

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(IT)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
