Nemotron (NVIDIA) (IT)
Nemotron — famiglia di grandi modelli linguistici (Large Language Model, LLM) con pesi aperti, sviluppata dalla divisione Applied Deep Learning Research (ADLR) di NVIDIA. I modelli appartengono al campo del Machine Learning e del Natural Language Processing (NLP) e sono destinati a un'ampia gamma di compiti: generazione sintetica di dati, ragionamento (reasoning), applicazioni agentiche (agentic AI) e distribuzione su hardware industriale NVIDIA. La famiglia comprende modelli di diverse architetture e scale: da 4 miliardi a circa 500 miliardi di parametri, inclusi modelli decoder-only Transformer densi (dense) della serie Nemotron-4 (2024), modelli ibridi Mamba-Transformer (Nemotron-H, 2025) e modelli ibridi Mamba-Transformer con Mixture-of-Experts (MoE) nella serie Nemotron 3 (2025). A partire da marzo 2026, la famiglia conta più di 20 modelli, che coprono compiti di generazione di testo, ragionamento, comprensione visiva di documenti, estrazione di informazioni e valutazione della qualità delle risposte. I modelli vengono distribuiti prevalentemente con pesi aperti sotto le licenze NVIDIA Open Model License e Llama Community License.[1][2][3]
Storia e presupposti
Lo sviluppo della famiglia Nemotron si inserisce nella strategia di NVIDIA per la creazione di uno stack completo di strumenti per l'IA generativa: dall'infrastruttura di addestramento (DGX, supercomputer basati su GPU H100/B200) alle piattaforme di addestramento (NeMo Framework), allineamento (NeMo-Aligner), distribuzione (NIM — NVIDIA Inference Microservices) e sicurezza (NeMo Guardrails).[4][5]
Nemotron-3 8B (2023)
Il primo modello pubblicamente disponibile della serie — un Transformer decoder con 8 miliardi di parametri e un contesto di 4096 token, addestrato su 3,8 trilioni di token in 53 lingue naturali e 37 linguaggi di programmazione. L'addestramento è stato condotto su 1024 GPU A100 in 19 giorni. Non è stato pubblicato alcun report tecnico formale su arXiv. Il modello veniva distribuito tramite NeMo Framework e Hugging Face; esistevano varianti Chat (SFT e SteerLM). La licenza era NVIDIA AI Foundation Models Community License.[6][7]
Nota sui nomi: «Nemotron-3» del 2023 e «Nemotron 3» del dicembre 2025 sono modelli diversi. Il primo era un prototipo iniziale, il secondo è la generazione attuale con architettura MoE.
Nemotron-4 15B (febbraio 2024)
Il primo rilascio pubblicamente documentato della serie Nemotron-4 — un modello con 15 miliardi di parametri, addestrato su 8 trilioni di token in circa 13 giorni di calendario su 384 nodi DGX H100 (fino a 3072 GPU). È stato utilizzato un parallelismo tensoriale 8x e un parallelismo dei dati da 96 a 288. Il picco di MFU (Model FLOPs Utilization) è stato del 34,3% con batch size 384. L'architettura è un Transformer decoder-only con Grouped-Query Attention (GQA) e Rotary Position Embeddings (RoPE). In base ai risultati dei benchmark al momento della pubblicazione, il modello superava tutti i modelli aperti di dimensioni comparabili nei compiti multilingue, inclusi alcuni modelli quattro volte più grandi.[8]
Nemotron-4 340B (giugno 2024)
Nel giugno 2024 è stato rilasciato il modello più grande della serie Nemotron-4 — 340 miliardi di parametri (331,6 miliardi non-embedding), pre-addestrato su 9 trilioni di token (8 trilioni di pre-addestramento + 1 trilione di addestramento continuo con ri-ponderazione delle fonti di alta qualità). L'addestramento è stato condotto su 768 nodi DGX H100 (fino a 6144 GPU) con un picco di MFU del 42,4%, da dicembre 2023 a maggio 2024. La famiglia include tre varianti: Base, Instruct e Reward. La dimensione del modello è stata scelta in modo che potesse stare su un singolo nodo DGX H100 (8 GPU) quando distribuito in formato di precisione FP8. Più del 98% dei dati utilizzati nell'allineamento (alignment) è stato generato sinteticamente dai modelli della serie stessa in un processo iterativo; la pipeline di generazione sintetica dei dati è aperta per la riproducibilità.[3]
Llama-3.1-Nemotron-70B (ottobre 2024)
Nell'ottobre 2024 sono stati rilasciati modelli messi a punto a partire da Meta Llama-3.1-70B-Instruct: Llama-3.1-Nemotron-70B-Instruct e Llama-3.1-Nemotron-70B-Reward. Al 1° ottobre 2024, il modello Instruct occupava il 1° posto contemporaneamente su tre benchmark automatici: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6%, MT-Bench (GPT-4-Turbo) — 8,98. Il modello Reward ha raggiunto il 94,1% su RewardBench.[9][10]
Transizione alle architetture ibride (2025)
Nel 2025, la serie si è espansa con architetture ibride che combinano strati Mamba-2 (State Space Model, SSM — modello a spazio degli stati) e Transformer. Tra marzo e maggio 2025 è stata rilasciata la famiglia di modelli di ragionamento Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) con modalità di ragionamento commutabile.[11] Nell'aprile 2025 è stato pubblicato Nemotron-H (arXiv:2504.03624) — una famiglia di modelli ibridi Mamba-Transformer di dimensioni 8B, 56B e 47B parametri.[12] Nell'agosto 2025 è stato presentato Nemotron Nano 2 (9B-v2, arXiv:2508.14444).[13]
Nemotron 3 (dicembre 2025)
Il 15 dicembre 2025 è stata annunciata la terza generazione — la famiglia Nemotron 3 con modelli Nano, Super e Ultra, che unisce le architetture Mamba-2, Transformer e MoE con una finestra contestuale fino a 1 milione di token. Nano è stata rilasciata con un report tecnico; Super e Ultra sono previsti per la prima metà del 2026.[1][2][14][15]
Fondamenti teorici
Architettura Transformer in Nemotron-4
I modelli della serie Nemotron-4 sono costruiti sulla classica architettura Transformer decoder con attenzione causale. La probabilità di una sequenza di token è fattorizzata come:
dove sono i parametri del modello.[8]
Il meccanismo di attenzione è implementato nella variante Grouped-Query Attention (GQA)[16]:
dove sono le matrici di query, chiavi e valori; è la dimensione della testa di attenzione.
Per la codifica delle posizioni vengono utilizzati Rotary Position Embeddings (RoPE)[17]:
dove è il vettore nella posizione , , è la dimensione del vettore.
Negli strati MLP viene utilizzata l'attivazione Squared ReLU: , che garantisce la sparsità delle attivazioni. I modelli non contengono bias, non utilizzano dropout, e le matrici di embedding di ingresso e uscita non sono collegate tra loro (untied embeddings). Il tokenizer è SentencePiece BPE con conservazione degli spazi, suddivisione carattere per carattere delle cifre e fallback byte per byte; la dimensione del vocabolario è 256 000.[8][3]
Parametri architetturali di Nemotron-4
| Parametro | Nemotron-4 15B | Nemotron-4 340B |
|---|---|---|
| Numero di parametri | 15 mld (3,2 mld embed.) | 340 mld (9,4 mld embed.) |
| Numero di strati | 32 | 96 |
| Dimensione nascosta | 6144 | 18 432 |
| Teste di attenzione | 48 | 96 |
| Teste KV (GQA) | 8 | 8 |
| Lunghezza del contesto | 4096 | 4096 |
| Dimensione del vocabolario | 256 000 | 256 000 |
Fonti: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Architettura ibrida Mamba-Transformer (Nemotron-H)
Nei modelli Nemotron-H, i blocchi standard di auto-attenzione sono parzialmente sostituiti da blocchi Mamba-2 — modelli a spazio degli stati (State Space Models, SSM). Nella generazione autoregressiva, ogni strato di auto-attenzione richiede operazioni e memoria per passo (a causa della cache KV), mentre gli strati Mamba garantiscono costi di memoria e calcolo costanti per ogni token generato.[12]
Mamba-2 è descritto dalla relazione ricorrente[18]:
dove è lo stato nascosto, è la matrice diagonale di transizione degli stati, e sono le matrici di proiezione, è il token in ingresso, è il segnale in uscita. In Mamba-2, le matrici , , dipendono dall'ingresso (input-dependent), il che distingue il modello dagli SSM lineari classici.
In Nemotron-H-56B vengono utilizzati 54 strati Mamba-2 + 54 strati MLP + 10 strati di auto-attenzione, dove gli strati di attenzione sono distribuiti uniformemente tra gli strati Mamba. Il modello è addestrato su 20 trilioni di token in formato FP8 (per-tensor scaling) su 6144 GPU H100. La versione Nemotron-H-8B contiene 24 strati Mamba-2, 24 strati MLP e 4 strati di auto-attenzione; l'addestramento è stato condotto su 15 trilioni di token.[12]
Architettura MoE di Nemotron 3
I modelli Nemotron 3 (dicembre 2025) combinano tre componenti architetturali: Mamba-2, Transformer e Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) contiene 52 strati: 23 strati Mamba-2 + MoE, 23 strati MoE e 6 strati di attenzione GQA. Ogni strato MoE include 128 esperti instradati (routed) + 1 esperto condiviso (shared), di cui 6 esperti vengono attivati per ogni token. L'instradamento viene eseguito da un router MLP addestrato con sigmoid gating. Il bilanciamento del carico è implementato senza funzione di perdita ausiliaria (aux-loss-free). Il numero totale di parametri è 31,6 miliardi, ma quelli attivi per ogni token sono solo 3,2 miliardi.[2]
La normalizzazione utilizza RMSNorm[19]. Gli embedding posizionali nelle parti Mamba sono assenti (le informazioni posizionali sono implicite nello stato SSM). Vengono utilizzati embedding non collegati, assenza di dropout e bias nei livelli lineari.[2]
Estensioni in Super/Ultra: LatentMoE e Multi-Token Prediction
I modelli Super e Ultra della famiglia Nemotron 3 applicano due innovazioni architetturali aggiuntive:
- Latent MoE (LatentMoE) — proiezione della rappresentazione in ingresso in uno spazio latente di dimensione inferiore prima dell'instradamento, il che consente di aumentare il numero di esperti a costi computazionali comparabili e migliorare la precisione senza ridurre il throughput.[1]
- Multi-Token Prediction (MTP) — predizione di più token successivi simultaneamente, utilizzata per migliorare la qualità dei testi lunghi e la decodifica speculativa durante l'inferenza.[1]
L'addestramento di Super e Ultra avviene nel formato NVFP4 — un formato numerico a 4 bit di NVIDIA sull'architettura Blackwell.[1]
Metodi di compressione dei modelli: Minitron, Puzzle, MiniPuzzle
Per creare modelli compatti, NVIDIA applica diversi approcci:
- Minitron — metodo di potatura strutturata (pruning) e distillazione della conoscenza (knowledge distillation). Vengono studiati due tipi di pruning: per profondità (rimozione di strati) e per larghezza (riduzione congiunta delle dimensioni degli strati nascosti, delle teste di attenzione e delle proiezioni MLP). L'applicazione di Minitron a Nemotron-4 15B consente di ottenere modelli 8B e 4B riducendo i costi di addestramento fino a 40 volte rispetto all'addestramento da zero.[20]
- Puzzle — algoritmo di Neural Architecture Search (NAS) che seleziona la configurazione ottimale di ogni blocco (numero di teste KV, dimensione FFN, presenza/assenza di attenzione) con distillazione blocco per blocco. È in questo modo che Llama 3.1 405B è stato compresso a 253B (Llama-Nemotron Ultra), e Llama 3.3 70B a 49B (Llama-Nemotron Super).[21]
- MiniPuzzle — estensione di Puzzle per architetture ibride, che ha compresso Nemotron-H-56B a 47B con soli 63 miliardi di token di distillazione. A parità di precisione, il modello compresso genera il 20% più velocemente.[12]
Metodi di allineamento
HelpSteer e HelpSteer2
HelpSteer — un insieme di 37 120 esempi (licenza CC-BY-4.0), creato in collaborazione con Scale AI, in cui ogni risposta è annotata secondo cinque attributi: utilità (helpfulness), correttezza (correctness), coerenza (coherence), complessità (complexity) e prolissità (verbosity) su scala Likert 0–4.[22]
HelpSteer2 — un insieme aggiornato di 21 362 esempi (10 681 prompt × 2 risposte), dove più del 95% dei prompt proviene da ShareGPT (richieste reali degli utenti). Circa il 50% delle annotazioni è stato filtrato come insufficientemente qualitativo. L'estensione HelpSteer2-Preference aggiunge le preferenze accoppiate degli annotatori, consentendo di addestrare sia modelli di ricompensa regressivi che modelli a coppie sugli stessi dati.[23][24]
SteerLM
SteerLM — metodo SFT (Supervised Fine-Tuning — addestramento supervisionato) con condizionamento sugli attributi (helpfulness, correctness, coherence, complexity, verbosity), che consente all'utente di controllare lo stile della risposta durante l'inferenza. La pipeline include: (1) addestramento del modello di predizione degli attributi (APM) su HelpSteer, (2) annotazione dei dati tramite APM, (3) SFT con condizionamento sui valori target degli attributi, (4) bootstrapping.[25]
DPO e RPO
DPO (Direct Preference Optimization) — metodo di ottimizzazione diretta delle preferenze senza un modello di ricompensa esplicito, utilizzato nelle pipeline di Nemotron-4 340B Instruct e Nemotron Nano 2.[26]
RPO (Reward-aware Preference Optimization) — framework matematico unificato di NVIDIA che generalizza DPO, IPO, SimPO, REINFORCE e SteerLM 2.0 come casi particolari. RPO minimizza la distanza tra le previsioni del modello di ricompensa implicito e il modello esplicito target[27]:
dove è il modello di ricompensa esplicito, è la policy addestrabile, è la policy di riferimento, è la funzione di distanza, / è la risposta preferita/rifiutata. RPO viene applicato nell'addestramento di Nemotron-4 340B Instruct e dei modelli Llama-Nemotron.[27][3][11]
Apprendimento per rinforzo multi-ambiente (RLVR)
In Nemotron 3 viene applicato il Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — addestramento simultaneo su più ambienti nell'ambito di NeMo Gym: matematica competitiva, programmazione, QA, tool-use, instruction-following, long-context. L'algoritmo è GRPO (Group Relative Policy Optimization) con masked importance sampling.[2][14]
Nemotron 3 supporta il controllo granulare del budget di ragionamento (reasoning budget control): l'utente può impostare un limite di token per la traccia di pensiero tramite un flag nel template di chat (commutazione «detailed thinking on/off» o limitazione della lunghezza).[2]
Gamma di modelli
Tabella riepilogativa
| Modello | Anno | Parametri totali / attivi | Contesto | Architettura | Caratteristiche principali |
|---|---|---|---|---|---|
| Nemotron-3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 giorni |
| Nemotron-4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34,3% |
| Nemotron-4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98% dati sintetici per l'allineamento |
| Llama-3.1-Nemotron-70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1% |
| Llama-Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama-Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Compressione NAS da Llama 3.1 8B |
| Llama-Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Da Llama 3.3 70B |
| Llama-Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Da Llama 3.1 405B; GPQA 76,0% |
| Nemotron-H 8B | 2025 | 8B / 8B | — | Ibrido Mamba-Transformer | 15T token; 24 Mamba-2 + 24 MLP + 4 Attn |
| Nemotron-H 56B | 2025 | 56B / 56B | — | Ibrido Mamba-Transformer | 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn |
| Nemotron-H 47B | 2025 | 47B / 47B | ~1M (FP4) | Ibrido Mamba-Transformer | MiniPuzzle da 56B; +20% velocità |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Ibrido Mamba-Transformer | 20T token; distillazione Minitron |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Ibrido Mamba-Transformer MoE | 25T token; 128 esperti, 6 attivi |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Ibrido LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Ibrido LatentMoE | MTP; NVFP4 |
Nemotron-4 15B
Architettura: 32 strati, dimensione nascosta 6144, 48 teste di attenzione, 8 teste KV (GQA). Il numero totale di parametri è 15 miliardi (3,2 miliardi embedding + 12,5 miliardi non-embedding). Risultati: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Sui benchmark multilingue (XCOPA, TyDiQA-GoldP, MGSM), il modello superava modelli quattro volte più grandi.[8]
Nemotron-4 340B
Architettura: 96 strati, dimensione nascosta 18 432, 96 teste di attenzione, 8 teste KV.
Nemotron-4 340B Base ha ottenuto: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC-Challenge — 94,3% (25-shot).[3]
Nemotron-4 340B Instruct ha subito un allineamento multi-fase: Code SFT → General SFT → DPO → RPO (3 round). Risultati: MT-Bench — 8,22 (giudice GPT-4-Turbo), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]
Nemotron-4 340B Reward sostituisce lo strato finale softmax con una proiezione lineare dello stato nascosto dell'ultimo strato in un vettore di 5 attributi HelpSteer2. La ricompensa finale è la somma pesata dei cinque attributi. L'addestramento è stato condotto per 2 epoche sui dati HelpSteer2 (batch size 128). Su RewardBench il modello ha raggiunto il 92,0%, superando GPT-4o (84,7%), Gemini 1.5 Pro (88,1%) e Claude-3-Opus (80,7%) al momento della pubblicazione.[3]
| Modello | Arena Hard | AlpacaEval 2.0 LC | MT-Bench |
|---|---|---|---|
| Nemotron-4-340B-Instruct | 54,2 | 41,5% | 8,22 |
| Llama-3-70B-Instruct | 41,1 | 34,4% | 8,16 |
| Mixtral-8x22B-Instruct | 36,4 | 30,9% | 7,63 |
| Qwen-2-72B-Instruct | 48,1 | 38,8% | 8,26 |
Fonte: arXiv:2406.11704, tabella 5.[3]
Llama-3.1-Nemotron-70B
Llama-3.1-Nemotron-70B-Reward è stato addestrato con un metodo ibrido che combina Bradley-Terry (preferenze a coppie) e regressione SteerLM (valutazione multi-attributo su scala Likert). L'addestramento è stato condotto esclusivamente sui dati HelpSteer2 (CC-BY-4.0). Su RewardBench il modello ha raggiunto il 94,1%, occupando il 1° posto al momento della pubblicazione.[10]
Llama-3.1-Nemotron-70B-Instruct è stato allineato con il metodo RLHF tramite l'algoritmo REINFORCE (non PPO) e il modello di ricompensa Nemotron-70B-Reward. L'infrastruttura è NeMo-Aligner con accelerazione TRT-LLM.[9]
Llama-Nemotron: Nano, Super, Ultra (2025)
Famiglia di modelli di ragionamento ottenuti da Llama 3.x tramite NAS, distillazione e post-addestramento avanzato.[11]
| Modello | Parametri | Modello base | Contesto |
|---|---|---|---|
| Llama-Nemotron-Nano 8B | 8 mld | Llama-3.1-8B-Instruct | 128K |
| Llama-Nemotron-Nano 4B | 4 mld | Minitron 4B (da Llama 3.1 8B) | 128K |
| Llama-Nemotron-Super 49B | 49 mld | Llama-3.3-70B → NAS (Puzzle) | 128K |
| Llama-Nemotron-Ultra 253B | 253 mld | Llama-3.1-405B → NAS (Puzzle) | 128K |
Pipeline di addestramento in cinque fasi: (1) NAS + FFN Fusion, (2) distillazione + pre-addestramento continuo, (3) SFT (incluse le tracce di ragionamento DeepSeek-R1), (4) RL su larga scala (GRPO per Ultra, REINFORCE/RLOO + Online RPO per Nano), (5) allineamento per il dialogo.[11]
I modelli sono stati i primi tra gli LLM aperti a supportare la modalità di ragionamento commutabile (reasoning toggle): quando attivata («detailed thinking on» nel prompt di sistema), il modello genera una catena di ragionamento nei tag <think>...</think> prima della risposta; quando disattivata, risponde direttamente.[11]
Risultati di Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Per confronto: DeepSeek-R1 (671B totale / 37B attivi) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Ultra si colloca su un singolo nodo 8×H100.[11]
Nemotron-H (aprile 2025)
Famiglia di modelli ibridi densi, addestrati da zero e progettati per compiti con generazioni lunghe. Nemotron-H-56B è stato addestrato su 20 trilioni di token in FP8 — uno dei più grandi esperimenti pubblici di pre-addestramento in FP8. Nemotron-H-47B è stato ottenuto dalla compressione di 56B tramite MiniPuzzle (63 miliardi di token di distillazione) e rientra nella memoria di una singola RTX 5090 (FP4) con un contesto di ~1M token.[12]
| Benchmark | Nemotron-H-56B | Nemotron-H-47B | Qwen-2.5-72B | Llama-3.1-70B |
|---|---|---|---|---|
| MMLU-Pro (5-shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5-shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8-shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0-shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Fonte: arXiv:2504.03624.[12]
Nella generazione con 65 536 token in ingresso e 1024 token in uscita su H100, il modello Nemotron-H-47B operava 2,9 volte più velocemente di Qwen-2.5-72B e Llama-3.1-70B.[12]
Nemotron Nano 2 (agosto 2025)
Modello ibrido Mamba-Transformer per il ragionamento. Nemotron-Nano-12B-v2-Base — il modello padre con 62 strati (prevalentemente Mamba-2 + MLP + 4 strati di attenzione), addestrato su 20 trilioni di token in FP8 da zero. Da esso, tramite Minitron avanzato, è stato ottenuto Nemotron-Nano-9B-v2, in grado di operare in un contesto di 128K token su una singola GPU NVIDIA A10G (22 GB, BF16). Post-addestramento: SFT (80 miliardi di token, incluse le tracce DeepSeek-R1-0528) → GRPO → DPO → RLHF. Sui benchmark di ragionamento, il modello è paragonabile a Qwen3-8B in termini di precisione, ma raggiunge un'accelerazione della generazione da 3 a 6 volte per sequenze di output lunghe.[13]
Nemotron 3 Nano 30B-A3B
Rilasciato nel dicembre 2025. Parametri: 31,6 miliardi in totale, 3,2 miliardi attivi. Architettura: 52 strati, dimensione nascosta 2688, dimensione degli esperti 1856, dimensione dello stato Mamba 128. MoE: 128 esperti instradati + 1 condiviso, 6 attivi per token. Contesto — fino a 1 048 576 token. Addestramento su 25 trilioni di token (schedule WSD, batch size 3072, cutoff dei dati — giugno 2025) in due fasi: Fase 1 — 23,5 trilioni (dati vari), Fase 2 — 1,5 trilioni (dati di alta qualità) + 121 miliardi di token CPT per contesto lungo.[2]
| Benchmark | Nemotron 3 Nano 30B-A3B | Qwen3-30B-A3B-Thinking | GPT-OSS-20B |
|---|---|---|---|
| MMLU-Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE-Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena-Hard-V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER-100 @ 1M | 86,34 | 77,5 | — |
* — valori da fonti secondarie; condizioni di riproduzione — NeMo Evaluator SDK. Fonte: arXiv:2512.20848.[2][28]
Throughput (ingresso 8K / uscita 16K, single H200): 3,3 volte superiore a Qwen3-30B-A3B-Thinking e 2,2 volte superiore a GPT-OSS-20B.[2]
Modelli aggiuntivi e direzioni di sviluppo
- OpenReasoning-Nemotron (luglio 2025) — serie di modelli da 1,5B a 32B parametri, basati su Qwen 2.5 e messi a punto sui dati DeepSeek-R1-0528. La variante 32B con GenSelect@64 supera o3 (high) su diversi benchmark matematici.[29]
- Nemotron Elastic (arXiv:2511.16664) — framework di sottomodelli annidati (6B, 9B, 12B) all'interno di un unico modello padre, che riduce il costo di addestramento di 360 volte rispetto all'addestramento da zero.[30]
- Nemotron-CrossThink — framework di apprendimento per rinforzo multi-dominio al di là dei compiti matematici, che ha garantito +30,1% su MATH-500 e +12,8% su MMLU-PRO.[31]
- Nemotron-UltraLong — estensione del contesto fino a 4 milioni di token.[32]
- Jet-Nemotron — NAS per post-addestramento di modelli ibridi compatti 2B/4B.[33]
Modelli specializzati
Nell'ecosistema Nemotron sono presenti anche modelli per compiti specializzati:
- Nemotron Nano V2 VL — modello vision-language per OCR, elaborazione di tabelle e video.[34]
- Nemotron Parse 1.1 — modello per OCR ed estrazione della struttura di documenti.[35]
- Nemotron ColEmbed V2 — modello di embedding per la ricerca visiva di documenti (late interaction).[36]
- Nemotron Speech — modelli per il riconoscimento automatico del parlato (ASR), la sintesi vocale (TTS) e la traduzione automatica (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — modello di classificazione di contenuti non sicuri in 23 categorie in 9 lingue con una precisione dell'84,2%.[37]
Dati per il pre-addestramento
Composizione dei dati di Nemotron-4
Il corpus di pre-addestramento di Nemotron-4 15B e 340B è composto da tre categorie principali: testi in inglese (70%), testi multilingue in 53 lingue (15%) e codice sorgente in 43 linguaggi di programmazione (15%). È stata applicata la deduplicazione a livello di documento (esatta e quasi-duplicata), nonché il filtraggio tramite modelli linguistici ed euristiche. Il modello 15B è stato addestrato su 8 trilioni di token, il modello 340B su 9 trilioni (8 trilioni di pre-addestramento + 1 trilione di addestramento continuo con ri-ponderazione delle fonti di alta qualità).[8][3]
Nemotron-CC
Il dataset Nemotron-CC è stato formato a partire da Common Crawl utilizzando un insieme di classificatori di qualità e riformulazioni sintetiche dei testi. Il volume totale è di 6,3 trilioni di token (4,4 trilioni deduplicati + 1,9 trilioni di riformulazioni sintetiche). La pipeline è integrata nello strumento NeMo Curator. Il lavoro è stato accettato come Long Paper alla conferenza ACL 2025.[38]
Nemotron-CC-Math
Sottoinsieme orientato alla matematica di 133 miliardi di token, estratto da Common Crawl tramite la pipeline Lynx + LLM con conservazione della struttura delle formule matematiche e del codice in LaTeX.[39]
Dati di Nemotron 3 Nano
Il pre-addestramento di Nemotron 3 Nano è stato eseguito su 25 trilioni di token. L'insieme include: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1 e dataset STEM specializzati. Per l'addestramento su contesto lungo sono stati utilizzati ulteriori 121 miliardi di token CPT.[2]
Nemotron Pretraining Dataset v1
Dataset generato sinteticamente, che comprende STEM, testi accademici, compiti di ragionamento e domini multilingue; contiene più di 10 trilioni di token linguistici e 18 milioni di campioni per SFT. Tutti i dataset vengono distribuiti sotto licenze aperte permissive.[40]
Pipeline di generazione sintetica dei dati (SDG)
La pipeline descritta nel report su Nemotron-4 340B comprende le seguenti fasi[3]:
- Generazione di prompt: richieste sintetiche a uno e due turni, generate tramite Mixtral-8x7B-Instruct-v0.1 (licenza Apache 2.0) secondo i template Open QA, Writing, Closed QA, Math & Coding.
- Generazione di risposte: risposte multiple da versioni intermedie dei modelli per garantire la diversità.
- Valutazione della qualità: tre approcci — Ground-Truth-as-a-Judge (per compiti con risposta verificabile), LLM-as-Judge (confronto tra coppie di risposte tramite un modello linguistico), Reward-Model-as-Judge (utilizzo di Nemotron-4-340B-Reward).
- Allineamento iterativo dai modelli deboli a quelli forti (weak-to-strong).
Da circa 20 000 esempi annotati da esseri umani (10 000 per SFT, 10 000 HelpSteer2 per il modello di ricompensa) è stato sintetizzato l'intero volume restante dei dati di allineamento.[3]
Quantizzazione e ottimizzazione dell'inferenza
I modelli Nemotron 3 Nano supportano la Post-Training Quantization (PTQ) in FP8 tramite ModelOpt e Megatron-LM. Viene applicata la quantizzazione selettiva — gli strati di attenzione e parte di Mamba vengono mantenuti in BF16 per preservare la qualità; gli altri vengono quantizzati in FP8. Secondo il report tecnico, ciò garantisce ~99% di retention della precisione.[2] Nano supporta anche l'inferenza nel formato NVFP4.[1]
Tabella riepilogativa dei benchmark per generazione
| Modello | MMLU | GSM8K | HumanEval | Arena Hard | MT-Bench | Condizioni |
|---|---|---|---|---|---|---|
| Nemotron-4 15B | 64,2% | 46,0% | 31,6% | — | — | base; 5-/8-/0-shot |
| Nemotron-4 340B Base | 81,1% | — | 57,3% | — | — | 5-/—/0-shot |
| Nemotron-4 340B Instruct | 78,7% | 92,3% | 73,2% | 54,2 | 8,22 | 0-shot |
| Llama-3.1-Nemotron-70B-Instruct | — | — | — | 85,0 | 8,98 | ott. 2024 |
| LN-Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0%, AIME 80,8% |
| Nemotron-H-47B | 83,6% | 93,3% | 61,0% | — | — | 5-/8-CoT/0-shot |
| Nemotron 3 Nano (30B-A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1%, LCB 68,3% |
Il confronto va interpretato con cautela: le condizioni di valutazione, le versioni dei benchmark e le date delle prove differiscono tra le generazioni. I risultati sono tratti dai report tecnici NVIDIA; le valutazioni indipendenti possono differire (si veda la sezione «Limitazioni»).[8][3][9][11][12][2]
Applicazioni
Distribuzione tramite NVIDIA NIM
NVIDIA NIM è un insieme di microservizi containerizzati ottimizzati per l'inferenza con API compatibile con OpenAI. I modelli Nemotron sono disponibili come microservizi NIM sulla piattaforma build.nvidia.com. NIM supporta i formati FP8, BF16, NVFP4 e la distribuzione tramite chart Helm su Kubernetes. I modelli sono anche compatibili con framework indipendenti: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]
Generazione sintetica dei dati
Nemotron-4 340B è progettato per essere utilizzato come generatore di dati sintetici: il modello Instruct genera risposte, il modello Reward le valuta e le filtra. La licenza NVIDIA Open Model License consente esplicitamente l'utilizzo degli output del modello per addestrare altri modelli. Secondo ServiceNow, il 15% dei dati di pre-addestramento del loro modello Apriel 1.6 è stato ottenuto dai dataset Nemotron.[3][15][41]
Sistemi agentici
I modelli della famiglia Nemotron 3 (Nano, Super, Ultra) sono destinati ai carichi di lavoro multi-agente: pianificazione, retrieval, chiamata di strumenti (tool use). Nemotron 3 Nano ottiene il 38,76% su SWE-Bench (con OpenHands) e il 49,04% (media) su TauBench V2.[2]
Implementazioni aziendali
Tra i partner dichiarati: ServiceNow (modello congiunto Apriel Nemotron 15B per l'automazione dei flussi di lavoro), CrowdStrike (piattaforma Charlotte AI), Perplexity (instradamento delle richieste), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. I modelli sono disponibili su AWS Amazon Bedrock; è previsto il supporto per Google Cloud, CoreWeave, Nebius.[15]
Limitazioni e problemi aperti
Valutazioni indipendenti e discrepanze con i dati NVIDIA
Le valutazioni indipendenti rivelano discrepanze rispetto ai risultati riportati da NVIDIA. Secondo Artificial Analysis (febbraio 2026), Llama-Nemotron-Ultra 253B (reasoning) ha ottenuto un Intelligence Index di 15 a fronte di una mediana di 26 per i modelli di dimensione comparabile. Sulla piattaforma Chatbot Arena (LMArena), i modelli Nemotron occupano posizioni intermedie nella classifica: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147° posizione), Nemotron 3 Nano — 1317 ±6 (~164° posizione).[42][43]
Prolissità
I modelli Nemotron mostrano una prolissità elevata: nella valutazione di Artificial Analysis, il modello Nemotron 3 Nano ha generato 140 milioni di token (a fronte di una mediana di 12 milioni per altri modelli), il che aumenta il costo dell'inferenza. Un'analisi di DEV Community ha rilevato che Llama-3.1-Nemotron-70B-Instruct, pur risultando formalmente in testa ai benchmark automatici, mostrava una precisione insufficiente in alcuni compiti pratici, e gli alti punteggi sui benchmark simili ad Arena potevano essere spiegati dalla preferenza per risposte prolisse e sicure, ma non necessariamente accurate.[42][44]
Allucinazioni e bias
NVIDIA nelle schede dei modelli indica che i modelli possono «amplificare i pregiudizi e generare risposte tossiche, specialmente in risposta a prompt tossici», nonché «produrre informazioni imprecise, omettendo dettagli chiave». L'apertura dei pesi e dei dati consente un audit esterno.[11][13]
Requisiti computazionali
I modelli densi (Nemotron-4 340B) richiedono un cluster di 768 nodi DGX H100 per l'addestramento completo, il che limita la riproducibilità per i gruppi accademici privi di accesso a un'infrastruttura analoga. Il contesto lungo (1M) durante l'inferenza richiede una quantità significativa di VRAM.[3][2]
Degrado con l'estensione del contesto
Con l'estensione del contesto a sequenze estremamente lunghe, è stato osservato un degrado dei risultati sui benchmark con contesto breve.[32]
Quantizzazione delle architetture ibride
L'utilizzo di precisione ultra-bassa (FP8/NVFP4) nelle architetture Mamba-Transformer porta a una piccola perdita di precisione (~1% su alcuni benchmark). Questo problema viene risolto tramite la quantizzazione selettiva, il che complica l'architettura dei compilatori e dei server di inferenza.[2][1]
Altri problemi aperti
- Dipendenza dai benchmark con possibile contaminazione dei dati di addestramento.
- Assenza di protocolli standardizzati per il confronto delle architetture ibride SSM-Transformer con i modelli Transformer puri.
- Questione della scalabilità dell'approccio MoE nei compiti che richiedono un ragionamento profondo con un numero ridotto di esperti per token.
- I dati su Super/Ultra al dicembre 2025 sono preliminari; i benchmark completi sono attesi dopo il rilascio.[1]
Aspetti etici e regolatori
Sicurezza nella fase di sviluppo
Nella fase di sviluppo vengono applicati: valutazione secondo il framework AEGIS (13 categorie di sicurezza dei contenuti), scanner di vulnerabilità garak, red-teaming manuale.[37]
Sicurezza nella fase di inferenza
NeMo Guardrails — strumentazione open source (licenza Apache 2.0) che aggiunge barriere programmabili ai sistemi LLM. Il microservizio intercetta input e output, applicando controlli configurabili: controllo dell'argomento, rilevamento di PII, verifica del «grounding» RAG, rilevamento di attacchi jailbreak (inclusa la protezione contro iniezioni di codice basata su YARA), classificazione di sicurezza multilingue e multimodale.[45]
Per Nemotron 3 è stato pubblicato un insieme di circa 11 000 tracce OpenTelemetry annotate provenienti da scenari realistici con uso di strumenti, destinate alla valutazione della sicurezza agentica.[1]
Licenze
| Modelli | Licenza |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron-4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama-Nemotron (Nano/Super/Ultra) | Llama Community License (ereditata da Meta) |
| Nemotron-3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License consente l'uso commerciale, la creazione e la distribuzione di opere derivate, non richiede attribuzione (con conservazione del file NOTICE), non impone restrizioni sul numero di utenti e consente esplicitamente l'utilizzo degli output del modello per addestrare altri modelli.[46] I modelli basati su Llama ereditano le restrizioni di Meta, inclusa la soglia di 700 milioni di utenti attivi mensili.[11]
Per Nemotron 3 Nano, NVIDIA ha pubblicato: i pesi del modello, più di 10 trilioni di token di dati di addestramento, ricette di addestramento, codebase (NeMo, Megatron-LM, NeMo-Aligner), più di 10 ambienti di apprendimento per rinforzo con oltre 900 000 compiti.[1][2]
Prospettive e direzioni di ricerca
I prossimi rilascio includono Nemotron 3 Super (~100 miliardi di parametri, ~10 miliardi attivi) e Nemotron 3 Ultra (~500 miliardi, ~50 miliardi attivi), attesi nella prima metà del 2026. Entrambi i modelli utilizzeranno LatentMoE, MTP e addestramento nel formato NVFP4 sull'architettura Blackwell.[1]
La direzione strategica di NVIDIA è il posizionamento di Nemotron non come singolo modello, ma come livello infrastrutturale per sistemi multi-agente, dove diversi modelli della famiglia vengono utilizzati per compiti diversi con instradamento in base alla complessità.[1][15]
Principali direzioni di ricerca:
- Sviluppo delle architetture ibride — ulteriore integrazione degli strati SSM con il meccanismo di attenzione per un contesto lungo scalabile.[12]
- Metodi di compressione multi-livello — sviluppo di Minitron, Puzzle, MiniPuzzle e Nemotron Elastic.[20][21][30]
- Apprendimento per rinforzo multi-dominio — Nemotron-CrossThink per estendere il RL al di là dei compiti matematici.[31]
- Estensione del contesto — Nemotron-UltraLong fino a 4 milioni di token.[32]
- Multimodalità — espansione nel campo vision-language (Nemotron VL), parlato (Nemotron Speech), ricerca visiva di documenti (Nemotron ColEmbed V2).[34][35][36]
- Modelli ibridi compatti — Jet-Nemotron (NAS per modelli 2B/4B).[33]
- Ricette aperte — pubblicazione di ricette di addestramento complete e dati per la riproducibilità e la personalizzazione da parte della comunità.[14]
Vedi anche
- Architettura Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (famiglia di modelli Meta)
Riferimenti
- NVIDIA Research — pagina Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — documentazione Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Bibliografia
- NVIDIA. Nemotron-3-8B-Base-4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron-4 15B Technical Report. arXiv:2402.16819, febbraio 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron-4 340B Technical Report. arXiv:2406.11704, giugno 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open-source Dataset for Training Top-Performing Reward Models. arXiv:2406.08673, giugno 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, luglio 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation-Based NAS for Inference-Optimized LLMs. arXiv:2411.19146, novembre 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward-aware Preference Optimization. arXiv:2502.00203, gennaio 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models. arXiv:2504.03624, aprile 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama-Nemotron: Efficient Reasoning Models. arXiv:2505.00949, maggio 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, agosto 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron-CC-Math. arXiv:2508.15096, agosto 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, novembre 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, dicembre 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, dicembre 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/