Nemotron (NVIDIA) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — famiglia di grandi modelli linguistici (Large Language Model, LLM) con pesi aperti, sviluppata dalla divisione Applied Deep Learning Research (ADLR) di NVIDIA. I modelli appartengono al campo del Machine Learning e del Natural Language Processing (NLP) e sono destinati a un'ampia gamma di compiti: generazione sintetica di dati, ragionamento (reasoning), applicazioni agentiche (agentic AI) e distribuzione su hardware industriale NVIDIA. La famiglia comprende modelli di diverse architetture e scale: da 4 miliardi a circa 500 miliardi di parametri, inclusi modelli decoder-only Transformer densi (dense) della serie Nemotron-4 (2024), modelli ibridi Mamba-Transformer (Nemotron-H, 2025) e modelli ibridi Mamba-Transformer con Mixture-of-Experts (MoE) nella serie Nemotron 3 (2025). A partire da marzo 2026, la famiglia conta più di 20 modelli, che coprono compiti di generazione di testo, ragionamento, comprensione visiva di documenti, estrazione di informazioni e valutazione della qualità delle risposte. I modelli vengono distribuiti prevalentemente con pesi aperti sotto le licenze NVIDIA Open Model License e Llama Community License.[1][2][3]

Storia e presupposti

Lo sviluppo della famiglia Nemotron si inserisce nella strategia di NVIDIA per la creazione di uno stack completo di strumenti per l'IA generativa: dall'infrastruttura di addestramento (DGX, supercomputer basati su GPU H100/B200) alle piattaforme di addestramento (NeMo Framework), allineamento (NeMo-Aligner), distribuzione (NIM — NVIDIA Inference Microservices) e sicurezza (NeMo Guardrails).[4][5]

Nemotron-3 8B (2023)

Il primo modello pubblicamente disponibile della serie — un Transformer decoder con 8 miliardi di parametri e un contesto di 4096 token, addestrato su 3,8 trilioni di token in 53 lingue naturali e 37 linguaggi di programmazione. L'addestramento è stato condotto su 1024 GPU A100 in 19 giorni. Non è stato pubblicato alcun report tecnico formale su arXiv. Il modello veniva distribuito tramite NeMo Framework e Hugging Face; esistevano varianti Chat (SFT e SteerLM). La licenza era NVIDIA AI Foundation Models Community License.[6][7]

Nota sui nomi: «Nemotron-3» del 2023 e «Nemotron 3» del dicembre 2025 sono modelli diversi. Il primo era un prototipo iniziale, il secondo è la generazione attuale con architettura MoE.

Nemotron-4 15B (febbraio 2024)

Il primo rilascio pubblicamente documentato della serie Nemotron-4 — un modello con 15 miliardi di parametri, addestrato su 8 trilioni di token in circa 13 giorni di calendario su 384 nodi DGX H100 (fino a 3072 GPU). È stato utilizzato un parallelismo tensoriale 8x e un parallelismo dei dati da 96 a 288. Il picco di MFU (Model FLOPs Utilization) è stato del 34,3% con batch size 384. L'architettura è un Transformer decoder-only con Grouped-Query Attention (GQA) e Rotary Position Embeddings (RoPE). In base ai risultati dei benchmark al momento della pubblicazione, il modello superava tutti i modelli aperti di dimensioni comparabili nei compiti multilingue, inclusi alcuni modelli quattro volte più grandi.[8]

Nemotron-4 340B (giugno 2024)

Nel giugno 2024 è stato rilasciato il modello più grande della serie Nemotron-4 — 340 miliardi di parametri (331,6 miliardi non-embedding), pre-addestrato su 9 trilioni di token (8 trilioni di pre-addestramento + 1 trilione di addestramento continuo con ri-ponderazione delle fonti di alta qualità). L'addestramento è stato condotto su 768 nodi DGX H100 (fino a 6144 GPU) con un picco di MFU del 42,4%, da dicembre 2023 a maggio 2024. La famiglia include tre varianti: Base, Instruct e Reward. La dimensione del modello è stata scelta in modo che potesse stare su un singolo nodo DGX H100 (8 GPU) quando distribuito in formato di precisione FP8. Più del 98% dei dati utilizzati nell'allineamento (alignment) è stato generato sinteticamente dai modelli della serie stessa in un processo iterativo; la pipeline di generazione sintetica dei dati è aperta per la riproducibilità.[3]

Llama-3.1-Nemotron-70B (ottobre 2024)

Nell'ottobre 2024 sono stati rilasciati modelli messi a punto a partire da Meta Llama-3.1-70B-Instruct: Llama-3.1-Nemotron-70B-Instruct e Llama-3.1-Nemotron-70B-Reward. Al 1° ottobre 2024, il modello Instruct occupava il 1° posto contemporaneamente su tre benchmark automatici: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6%, MT-Bench (GPT-4-Turbo) — 8,98. Il modello Reward ha raggiunto il 94,1% su RewardBench.[9][10]

Transizione alle architetture ibride (2025)

Nel 2025, la serie si è espansa con architetture ibride che combinano strati Mamba-2 (State Space Model, SSM — modello a spazio degli stati) e Transformer. Tra marzo e maggio 2025 è stata rilasciata la famiglia di modelli di ragionamento Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) con modalità di ragionamento commutabile.[11] Nell'aprile 2025 è stato pubblicato Nemotron-H (arXiv:2504.03624) — una famiglia di modelli ibridi Mamba-Transformer di dimensioni 8B, 56B e 47B parametri.[12] Nell'agosto 2025 è stato presentato Nemotron Nano 2 (9B-v2, arXiv:2508.14444).[13]

Nemotron 3 (dicembre 2025)

Il 15 dicembre 2025 è stata annunciata la terza generazione — la famiglia Nemotron 3 con modelli Nano, Super e Ultra, che unisce le architetture Mamba-2, Transformer e MoE con una finestra contestuale fino a 1 milione di token. Nano è stata rilasciata con un report tecnico; Super e Ultra sono previsti per la prima metà del 2026.[1][2][14][15]

Fondamenti teorici

Architettura Transformer in Nemotron-4

I modelli della serie Nemotron-4 sono costruiti sulla classica architettura Transformer decoder con attenzione causale. La probabilità di una sequenza di token x1,x2,,xT è fattorizzata come:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

dove θ sono i parametri del modello.[8]

Il meccanismo di attenzione è implementato nella variante Grouped-Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKdk)V,

dove Q,K,V sono le matrici di query, chiavi e valori; dk è la dimensione della testa di attenzione.

Per la codifica delle posizioni vengono utilizzati Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

dove xm è il vettore nella posizione m, θi=100002i/d, d è la dimensione del vettore.

Negli strati MLP viene utilizzata l'attivazione Squared ReLU: f(x)=(max(0,x))2, che garantisce la sparsità delle attivazioni. I modelli non contengono bias, non utilizzano dropout, e le matrici di embedding di ingresso e uscita non sono collegate tra loro (untied embeddings). Il tokenizer è SentencePiece BPE con conservazione degli spazi, suddivisione carattere per carattere delle cifre e fallback byte per byte; la dimensione del vocabolario è 256 000.[8][3]

Parametri architetturali di Nemotron-4
Parametro Nemotron-4 15B Nemotron-4 340B
Numero di parametri 15 mld (3,2 mld embed.) 340 mld (9,4 mld embed.)
Numero di strati 32 96
Dimensione nascosta 6144 18 432
Teste di attenzione 48 96
Teste KV (GQA) 8 8
Lunghezza del contesto 4096 4096
Dimensione del vocabolario 256 000 256 000

Fonti: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Architettura ibrida Mamba-Transformer (Nemotron-H)

Nei modelli Nemotron-H, i blocchi standard di auto-attenzione sono parzialmente sostituiti da blocchi Mamba-2 — modelli a spazio degli stati (State Space Models, SSM). Nella generazione autoregressiva, ogni strato di auto-attenzione richiede O(n) operazioni e memoria per passo (a causa della cache KV), mentre gli strati Mamba garantiscono costi di memoria e calcolo costanti per ogni token generato.[12]

Mamba-2 è descritto dalla relazione ricorrente[18]:

ht=Aht1+Bxt,yt=Cht,

dove htN è lo stato nascosto, AN×N è la matrice diagonale di transizione degli stati, BN×1 e C1×N sono le matrici di proiezione, xt è il token in ingresso, yt è il segnale in uscita. In Mamba-2, le matrici A, B, C dipendono dall'ingresso (input-dependent), il che distingue il modello dagli SSM lineari classici.

In Nemotron-H-56B vengono utilizzati 54 strati Mamba-2 + 54 strati MLP + 10 strati di auto-attenzione, dove gli strati di attenzione sono distribuiti uniformemente tra gli strati Mamba. Il modello è addestrato su 20 trilioni di token in formato FP8 (per-tensor scaling) su 6144 GPU H100. La versione Nemotron-H-8B contiene 24 strati Mamba-2, 24 strati MLP e 4 strati di auto-attenzione; l'addestramento è stato condotto su 15 trilioni di token.[12]

Architettura MoE di Nemotron 3

I modelli Nemotron 3 (dicembre 2025) combinano tre componenti architetturali: Mamba-2, Transformer e Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) contiene 52 strati: 23 strati Mamba-2 + MoE, 23 strati MoE e 6 strati di attenzione GQA. Ogni strato MoE include 128 esperti instradati (routed) + 1 esperto condiviso (shared), di cui 6 esperti vengono attivati per ogni token. L'instradamento viene eseguito da un router MLP addestrato con sigmoid gating. Il bilanciamento del carico è implementato senza funzione di perdita ausiliaria (aux-loss-free). Il numero totale di parametri è 31,6 miliardi, ma quelli attivi per ogni token sono solo 3,2 miliardi.[2]

La normalizzazione utilizza RMSNorm[19]. Gli embedding posizionali nelle parti Mamba sono assenti (le informazioni posizionali sono implicite nello stato SSM). Vengono utilizzati embedding non collegati, assenza di dropout e bias nei livelli lineari.[2]

Estensioni in Super/Ultra: LatentMoE e Multi-Token Prediction

I modelli Super e Ultra della famiglia Nemotron 3 applicano due innovazioni architetturali aggiuntive:

  • Latent MoE (LatentMoE) — proiezione della rappresentazione in ingresso in uno spazio latente di dimensione inferiore prima dell'instradamento, il che consente di aumentare il numero di esperti a costi computazionali comparabili e migliorare la precisione senza ridurre il throughput.[1]
  • Multi-Token Prediction (MTP) — predizione di più token successivi simultaneamente, utilizzata per migliorare la qualità dei testi lunghi e la decodifica speculativa durante l'inferenza.[1]

L'addestramento di Super e Ultra avviene nel formato NVFP4 — un formato numerico a 4 bit di NVIDIA sull'architettura Blackwell.[1]

Metodi di compressione dei modelli: Minitron, Puzzle, MiniPuzzle

Per creare modelli compatti, NVIDIA applica diversi approcci:

  • Minitron — metodo di potatura strutturata (pruning) e distillazione della conoscenza (knowledge distillation). Vengono studiati due tipi di pruning: per profondità (rimozione di strati) e per larghezza (riduzione congiunta delle dimensioni degli strati nascosti, delle teste di attenzione e delle proiezioni MLP). L'applicazione di Minitron a Nemotron-4 15B consente di ottenere modelli 8B e 4B riducendo i costi di addestramento fino a 40 volte rispetto all'addestramento da zero.[20]
  • Puzzle — algoritmo di Neural Architecture Search (NAS) che seleziona la configurazione ottimale di ogni blocco (numero di teste KV, dimensione FFN, presenza/assenza di attenzione) con distillazione blocco per blocco. È in questo modo che Llama 3.1 405B è stato compresso a 253B (Llama-Nemotron Ultra), e Llama 3.3 70B a 49B (Llama-Nemotron Super).[21]
  • MiniPuzzle — estensione di Puzzle per architetture ibride, che ha compresso Nemotron-H-56B a 47B con soli 63 miliardi di token di distillazione. A parità di precisione, il modello compresso genera il 20% più velocemente.[12]

Metodi di allineamento

HelpSteer e HelpSteer2

HelpSteer — un insieme di 37 120 esempi (licenza CC-BY-4.0), creato in collaborazione con Scale AI, in cui ogni risposta è annotata secondo cinque attributi: utilità (helpfulness), correttezza (correctness), coerenza (coherence), complessità (complexity) e prolissità (verbosity) su scala Likert 0–4.[22]

HelpSteer2 — un insieme aggiornato di 21 362 esempi (10 681 prompt × 2 risposte), dove più del 95% dei prompt proviene da ShareGPT (richieste reali degli utenti). Circa il 50% delle annotazioni è stato filtrato come insufficientemente qualitativo. L'estensione HelpSteer2-Preference aggiunge le preferenze accoppiate degli annotatori, consentendo di addestrare sia modelli di ricompensa regressivi che modelli a coppie sugli stessi dati.[23][24]

SteerLM

SteerLM — metodo SFT (Supervised Fine-Tuning — addestramento supervisionato) con condizionamento sugli attributi (helpfulness, correctness, coherence, complexity, verbosity), che consente all'utente di controllare lo stile della risposta durante l'inferenza. La pipeline include: (1) addestramento del modello di predizione degli attributi (APM) su HelpSteer, (2) annotazione dei dati tramite APM, (3) SFT con condizionamento sui valori target degli attributi, (4) bootstrapping.[25]

DPO e RPO

DPO (Direct Preference Optimization) — metodo di ottimizzazione diretta delle preferenze senza un modello di ricompensa esplicito, utilizzato nelle pipeline di Nemotron-4 340B Instruct e Nemotron Nano 2.[26]

RPO (Reward-aware Preference Optimization) — framework matematico unificato di NVIDIA che generalizza DPO, IPO, SimPO, REINFORCE e SteerLM 2.0 come casi particolari. RPO minimizza la distanza tra le previsioni del modello di ricompensa implicito e il modello esplicito target[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

dove rϕ è il modello di ricompensa esplicito, πθ è la policy addestrabile, πref è la policy di riferimento, d(,) è la funzione di distanza, yw/yl è la risposta preferita/rifiutata. RPO viene applicato nell'addestramento di Nemotron-4 340B Instruct e dei modelli Llama-Nemotron.[27][3][11]

Apprendimento per rinforzo multi-ambiente (RLVR)

In Nemotron 3 viene applicato il Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — addestramento simultaneo su più ambienti nell'ambito di NeMo Gym: matematica competitiva, programmazione, QA, tool-use, instruction-following, long-context. L'algoritmo è GRPO (Group Relative Policy Optimization) con masked importance sampling.[2][14]

Nemotron 3 supporta il controllo granulare del budget di ragionamento (reasoning budget control): l'utente può impostare un limite di token per la traccia di pensiero tramite un flag nel template di chat (commutazione «detailed thinking on/off» o limitazione della lunghezza).[2]

Gamma di modelli

Tabella riepilogativa

Modello Anno Parametri totali / attivi Contesto Architettura Caratteristiche principali
Nemotron-3 8B 2023 8B / 8B 4K Dense Transformer 3,8T token; 1024 GPU A100; 19 giorni
Nemotron-4 15B 2024 15B / 15B 4K Dense Transformer 8T token; MFU 34,3%
Nemotron-4 340B 2024 340B / 340B 4K Dense Transformer 9T token; Base/Instruct/Reward; >98% dati sintetici per l'allineamento
Llama-3.1-Nemotron-70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1%
Llama-Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama-Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) Compressione NAS da Llama 3.1 8B
Llama-Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Da Llama 3.3 70B
Llama-Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Da Llama 3.1 405B; GPQA 76,0%
Nemotron-H 8B 2025 8B / 8B Ibrido Mamba-Transformer 15T token; 24 Mamba-2 + 24 MLP + 4 Attn
Nemotron-H 56B 2025 56B / 56B Ibrido Mamba-Transformer 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn
Nemotron-H 47B 2025 47B / 47B ~1M (FP4) Ibrido Mamba-Transformer MiniPuzzle da 56B; +20% velocità
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Ibrido Mamba-Transformer 20T token; distillazione Minitron
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Ibrido Mamba-Transformer MoE 25T token; 128 esperti, 6 attivi
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Ibrido LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Ibrido LatentMoE MTP; NVFP4

Nemotron-4 15B

Architettura: 32 strati, dimensione nascosta 6144, 48 teste di attenzione, 8 teste KV (GQA). Il numero totale di parametri è 15 miliardi (3,2 miliardi embedding + 12,5 miliardi non-embedding). Risultati: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Sui benchmark multilingue (XCOPA, TyDiQA-GoldP, MGSM), il modello superava modelli quattro volte più grandi.[8]

Nemotron-4 340B

Architettura: 96 strati, dimensione nascosta 18 432, 96 teste di attenzione, 8 teste KV.

Nemotron-4 340B Base ha ottenuto: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC-Challenge — 94,3% (25-shot).[3]

Nemotron-4 340B Instruct ha subito un allineamento multi-fase: Code SFT → General SFT → DPO → RPO (3 round). Risultati: MT-Bench — 8,22 (giudice GPT-4-Turbo), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]

Nemotron-4 340B Reward sostituisce lo strato finale softmax con una proiezione lineare dello stato nascosto dell'ultimo strato in un vettore di 5 attributi HelpSteer2. La ricompensa finale è la somma pesata dei cinque attributi. L'addestramento è stato condotto per 2 epoche sui dati HelpSteer2 (batch size 128). Su RewardBench il modello ha raggiunto il 92,0%, superando GPT-4o (84,7%), Gemini 1.5 Pro (88,1%) e Claude-3-Opus (80,7%) al momento della pubblicazione.[3]

Modello Arena Hard AlpacaEval 2.0 LC MT-Bench
Nemotron-4-340B-Instruct 54,2 41,5% 8,22
Llama-3-70B-Instruct 41,1 34,4% 8,16
Mixtral-8x22B-Instruct 36,4 30,9% 7,63
Qwen-2-72B-Instruct 48,1 38,8% 8,26

Fonte: arXiv:2406.11704, tabella 5.[3]

Llama-3.1-Nemotron-70B

Llama-3.1-Nemotron-70B-Reward è stato addestrato con un metodo ibrido che combina Bradley-Terry (preferenze a coppie) e regressione SteerLM (valutazione multi-attributo su scala Likert). L'addestramento è stato condotto esclusivamente sui dati HelpSteer2 (CC-BY-4.0). Su RewardBench il modello ha raggiunto il 94,1%, occupando il 1° posto al momento della pubblicazione.[10]

Llama-3.1-Nemotron-70B-Instruct è stato allineato con il metodo RLHF tramite l'algoritmo REINFORCE (non PPO) e il modello di ricompensa Nemotron-70B-Reward. L'infrastruttura è NeMo-Aligner con accelerazione TRT-LLM.[9]

Llama-Nemotron: Nano, Super, Ultra (2025)

Famiglia di modelli di ragionamento ottenuti da Llama 3.x tramite NAS, distillazione e post-addestramento avanzato.[11]

Modello Parametri Modello base Contesto
Llama-Nemotron-Nano 8B 8 mld Llama-3.1-8B-Instruct 128K
Llama-Nemotron-Nano 4B 4 mld Minitron 4B (da Llama 3.1 8B) 128K
Llama-Nemotron-Super 49B 49 mld Llama-3.3-70B → NAS (Puzzle) 128K
Llama-Nemotron-Ultra 253B 253 mld Llama-3.1-405B → NAS (Puzzle) 128K

Pipeline di addestramento in cinque fasi: (1) NAS + FFN Fusion, (2) distillazione + pre-addestramento continuo, (3) SFT (incluse le tracce di ragionamento DeepSeek-R1), (4) RL su larga scala (GRPO per Ultra, REINFORCE/RLOO + Online RPO per Nano), (5) allineamento per il dialogo.[11]

I modelli sono stati i primi tra gli LLM aperti a supportare la modalità di ragionamento commutabile (reasoning toggle): quando attivata («detailed thinking on» nel prompt di sistema), il modello genera una catena di ragionamento nei tag <think>...</think> prima della risposta; quando disattivata, risponde direttamente.[11]

Risultati di Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Per confronto: DeepSeek-R1 (671B totale / 37B attivi) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Ultra si colloca su un singolo nodo 8×H100.[11]

Nemotron-H (aprile 2025)

Famiglia di modelli ibridi densi, addestrati da zero e progettati per compiti con generazioni lunghe. Nemotron-H-56B è stato addestrato su 20 trilioni di token in FP8 — uno dei più grandi esperimenti pubblici di pre-addestramento in FP8. Nemotron-H-47B è stato ottenuto dalla compressione di 56B tramite MiniPuzzle (63 miliardi di token di distillazione) e rientra nella memoria di una singola RTX 5090 (FP4) con un contesto di ~1M token.[12]

Benchmark Nemotron-H-56B Nemotron-H-47B Qwen-2.5-72B Llama-3.1-70B
MMLU-Pro (5-shot CoT) 60,5 61,8 58,8 51,3
MMLU (5-shot) 84,2 83,6 86,1 78,8
GSM8K (8-shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0-shot) 60,4 61,0 56,7 57,3

Fonte: arXiv:2504.03624.[12]

Nella generazione con 65 536 token in ingresso e 1024 token in uscita su H100, il modello Nemotron-H-47B operava 2,9 volte più velocemente di Qwen-2.5-72B e Llama-3.1-70B.[12]

Nemotron Nano 2 (agosto 2025)

Modello ibrido Mamba-Transformer per il ragionamento. Nemotron-Nano-12B-v2-Base — il modello padre con 62 strati (prevalentemente Mamba-2 + MLP + 4 strati di attenzione), addestrato su 20 trilioni di token in FP8 da zero. Da esso, tramite Minitron avanzato, è stato ottenuto Nemotron-Nano-9B-v2, in grado di operare in un contesto di 128K token su una singola GPU NVIDIA A10G (22 GB, BF16). Post-addestramento: SFT (80 miliardi di token, incluse le tracce DeepSeek-R1-0528) → GRPO → DPO → RLHF. Sui benchmark di ragionamento, il modello è paragonabile a Qwen3-8B in termini di precisione, ma raggiunge un'accelerazione della generazione da 3 a 6 volte per sequenze di output lunghe.[13]

Nemotron 3 Nano 30B-A3B

Rilasciato nel dicembre 2025. Parametri: 31,6 miliardi in totale, 3,2 miliardi attivi. Architettura: 52 strati, dimensione nascosta 2688, dimensione degli esperti 1856, dimensione dello stato Mamba 128. MoE: 128 esperti instradati + 1 condiviso, 6 attivi per token. Contesto — fino a 1 048 576 token. Addestramento su 25 trilioni di token (schedule WSD, batch size 3072, cutoff dei dati — giugno 2025) in due fasi: Fase 1 — 23,5 trilioni (dati vari), Fase 2 — 1,5 trilioni (dati di alta qualità) + 121 miliardi di token CPT per contesto lungo.[2]

Benchmark Nemotron 3 Nano 30B-A3B Qwen3-30B-A3B-Thinking GPT-OSS-20B
MMLU-Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE-Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena-Hard-V2 Avg 67,65 57,8 48,55
RULER-100 @ 1M 86,34 77,5

* — valori da fonti secondarie; condizioni di riproduzione — NeMo Evaluator SDK. Fonte: arXiv:2512.20848.[2][28]

Throughput (ingresso 8K / uscita 16K, single H200): 3,3 volte superiore a Qwen3-30B-A3B-Thinking e 2,2 volte superiore a GPT-OSS-20B.[2]

Modelli aggiuntivi e direzioni di sviluppo

  • OpenReasoning-Nemotron (luglio 2025) — serie di modelli da 1,5B a 32B parametri, basati su Qwen 2.5 e messi a punto sui dati DeepSeek-R1-0528. La variante 32B con GenSelect@64 supera o3 (high) su diversi benchmark matematici.[29]
  • Nemotron Elastic (arXiv:2511.16664) — framework di sottomodelli annidati (6B, 9B, 12B) all'interno di un unico modello padre, che riduce il costo di addestramento di 360 volte rispetto all'addestramento da zero.[30]
  • Nemotron-CrossThink — framework di apprendimento per rinforzo multi-dominio al di là dei compiti matematici, che ha garantito +30,1% su MATH-500 e +12,8% su MMLU-PRO.[31]
  • Nemotron-UltraLong — estensione del contesto fino a 4 milioni di token.[32]
  • Jet-Nemotron — NAS per post-addestramento di modelli ibridi compatti 2B/4B.[33]

Modelli specializzati

Nell'ecosistema Nemotron sono presenti anche modelli per compiti specializzati:

  • Nemotron Nano V2 VL — modello vision-language per OCR, elaborazione di tabelle e video.[34]
  • Nemotron Parse 1.1 — modello per OCR ed estrazione della struttura di documenti.[35]
  • Nemotron ColEmbed V2 — modello di embedding per la ricerca visiva di documenti (late interaction).[36]
  • Nemotron Speech — modelli per il riconoscimento automatico del parlato (ASR), la sintesi vocale (TTS) e la traduzione automatica (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — modello di classificazione di contenuti non sicuri in 23 categorie in 9 lingue con una precisione dell'84,2%.[37]

Dati per il pre-addestramento

Composizione dei dati di Nemotron-4

Il corpus di pre-addestramento di Nemotron-4 15B e 340B è composto da tre categorie principali: testi in inglese (70%), testi multilingue in 53 lingue (15%) e codice sorgente in 43 linguaggi di programmazione (15%). È stata applicata la deduplicazione a livello di documento (esatta e quasi-duplicata), nonché il filtraggio tramite modelli linguistici ed euristiche. Il modello 15B è stato addestrato su 8 trilioni di token, il modello 340B su 9 trilioni (8 trilioni di pre-addestramento + 1 trilione di addestramento continuo con ri-ponderazione delle fonti di alta qualità).[8][3]

Nemotron-CC

Il dataset Nemotron-CC è stato formato a partire da Common Crawl utilizzando un insieme di classificatori di qualità e riformulazioni sintetiche dei testi. Il volume totale è di 6,3 trilioni di token (4,4 trilioni deduplicati + 1,9 trilioni di riformulazioni sintetiche). La pipeline è integrata nello strumento NeMo Curator. Il lavoro è stato accettato come Long Paper alla conferenza ACL 2025.[38]

Nemotron-CC-Math

Sottoinsieme orientato alla matematica di 133 miliardi di token, estratto da Common Crawl tramite la pipeline Lynx + LLM con conservazione della struttura delle formule matematiche e del codice in LaTeX.[39]

Dati di Nemotron 3 Nano

Il pre-addestramento di Nemotron 3 Nano è stato eseguito su 25 trilioni di token. L'insieme include: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1 e dataset STEM specializzati. Per l'addestramento su contesto lungo sono stati utilizzati ulteriori 121 miliardi di token CPT.[2]

Nemotron Pretraining Dataset v1

Dataset generato sinteticamente, che comprende STEM, testi accademici, compiti di ragionamento e domini multilingue; contiene più di 10 trilioni di token linguistici e 18 milioni di campioni per SFT. Tutti i dataset vengono distribuiti sotto licenze aperte permissive.[40]

Pipeline di generazione sintetica dei dati (SDG)

La pipeline descritta nel report su Nemotron-4 340B comprende le seguenti fasi[3]:

  • Generazione di prompt: richieste sintetiche a uno e due turni, generate tramite Mixtral-8x7B-Instruct-v0.1 (licenza Apache 2.0) secondo i template Open QA, Writing, Closed QA, Math & Coding.
  • Generazione di risposte: risposte multiple da versioni intermedie dei modelli per garantire la diversità.
  • Valutazione della qualità: tre approcci — Ground-Truth-as-a-Judge (per compiti con risposta verificabile), LLM-as-Judge (confronto tra coppie di risposte tramite un modello linguistico), Reward-Model-as-Judge (utilizzo di Nemotron-4-340B-Reward).
  • Allineamento iterativo dai modelli deboli a quelli forti (weak-to-strong).

Da circa 20 000 esempi annotati da esseri umani (10 000 per SFT, 10 000 HelpSteer2 per il modello di ricompensa) è stato sintetizzato l'intero volume restante dei dati di allineamento.[3]

Quantizzazione e ottimizzazione dell'inferenza

I modelli Nemotron 3 Nano supportano la Post-Training Quantization (PTQ) in FP8 tramite ModelOpt e Megatron-LM. Viene applicata la quantizzazione selettiva — gli strati di attenzione e parte di Mamba vengono mantenuti in BF16 per preservare la qualità; gli altri vengono quantizzati in FP8. Secondo il report tecnico, ciò garantisce ~99% di retention della precisione.[2] Nano supporta anche l'inferenza nel formato NVFP4.[1]

Tabella riepilogativa dei benchmark per generazione

Modello MMLU GSM8K HumanEval Arena Hard MT-Bench Condizioni
Nemotron-4 15B 64,2% 46,0% 31,6% base; 5-/8-/0-shot
Nemotron-4 340B Base 81,1% 57,3% 5-/—/0-shot
Nemotron-4 340B Instruct 78,7% 92,3% 73,2% 54,2 8,22 0-shot
Llama-3.1-Nemotron-70B-Instruct 85,0 8,98 ott. 2024
LN-Ultra 253B (reasoning ON) GPQA 76,0%, AIME 80,8%
Nemotron-H-47B 83,6% 93,3% 61,0% 5-/8-CoT/0-shot
Nemotron 3 Nano (30B-A3B) 67,7 (v2) AIME25 89,1%, LCB 68,3%

Il confronto va interpretato con cautela: le condizioni di valutazione, le versioni dei benchmark e le date delle prove differiscono tra le generazioni. I risultati sono tratti dai report tecnici NVIDIA; le valutazioni indipendenti possono differire (si veda la sezione «Limitazioni»).[8][3][9][11][12][2]

Applicazioni

Distribuzione tramite NVIDIA NIM

NVIDIA NIM è un insieme di microservizi containerizzati ottimizzati per l'inferenza con API compatibile con OpenAI. I modelli Nemotron sono disponibili come microservizi NIM sulla piattaforma build.nvidia.com. NIM supporta i formati FP8, BF16, NVFP4 e la distribuzione tramite chart Helm su Kubernetes. I modelli sono anche compatibili con framework indipendenti: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]

Generazione sintetica dei dati

Nemotron-4 340B è progettato per essere utilizzato come generatore di dati sintetici: il modello Instruct genera risposte, il modello Reward le valuta e le filtra. La licenza NVIDIA Open Model License consente esplicitamente l'utilizzo degli output del modello per addestrare altri modelli. Secondo ServiceNow, il 15% dei dati di pre-addestramento del loro modello Apriel 1.6 è stato ottenuto dai dataset Nemotron.[3][15][41]

Sistemi agentici

I modelli della famiglia Nemotron 3 (Nano, Super, Ultra) sono destinati ai carichi di lavoro multi-agente: pianificazione, retrieval, chiamata di strumenti (tool use). Nemotron 3 Nano ottiene il 38,76% su SWE-Bench (con OpenHands) e il 49,04% (media) su TauBench V2.[2]

Implementazioni aziendali

Tra i partner dichiarati: ServiceNow (modello congiunto Apriel Nemotron 15B per l'automazione dei flussi di lavoro), CrowdStrike (piattaforma Charlotte AI), Perplexity (instradamento delle richieste), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. I modelli sono disponibili su AWS Amazon Bedrock; è previsto il supporto per Google Cloud, CoreWeave, Nebius.[15]

Limitazioni e problemi aperti

Valutazioni indipendenti e discrepanze con i dati NVIDIA

Le valutazioni indipendenti rivelano discrepanze rispetto ai risultati riportati da NVIDIA. Secondo Artificial Analysis (febbraio 2026), Llama-Nemotron-Ultra 253B (reasoning) ha ottenuto un Intelligence Index di 15 a fronte di una mediana di 26 per i modelli di dimensione comparabile. Sulla piattaforma Chatbot Arena (LMArena), i modelli Nemotron occupano posizioni intermedie nella classifica: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147° posizione), Nemotron 3 Nano — 1317 ±6 (~164° posizione).[42][43]

Prolissità

I modelli Nemotron mostrano una prolissità elevata: nella valutazione di Artificial Analysis, il modello Nemotron 3 Nano ha generato 140 milioni di token (a fronte di una mediana di 12 milioni per altri modelli), il che aumenta il costo dell'inferenza. Un'analisi di DEV Community ha rilevato che Llama-3.1-Nemotron-70B-Instruct, pur risultando formalmente in testa ai benchmark automatici, mostrava una precisione insufficiente in alcuni compiti pratici, e gli alti punteggi sui benchmark simili ad Arena potevano essere spiegati dalla preferenza per risposte prolisse e sicure, ma non necessariamente accurate.[42][44]

Allucinazioni e bias

NVIDIA nelle schede dei modelli indica che i modelli possono «amplificare i pregiudizi e generare risposte tossiche, specialmente in risposta a prompt tossici», nonché «produrre informazioni imprecise, omettendo dettagli chiave». L'apertura dei pesi e dei dati consente un audit esterno.[11][13]

Requisiti computazionali

I modelli densi (Nemotron-4 340B) richiedono un cluster di 768 nodi DGX H100 per l'addestramento completo, il che limita la riproducibilità per i gruppi accademici privi di accesso a un'infrastruttura analoga. Il contesto lungo (1M) durante l'inferenza richiede una quantità significativa di VRAM.[3][2]

Degrado con l'estensione del contesto

Con l'estensione del contesto a sequenze estremamente lunghe, è stato osservato un degrado dei risultati sui benchmark con contesto breve.[32]

Quantizzazione delle architetture ibride

L'utilizzo di precisione ultra-bassa (FP8/NVFP4) nelle architetture Mamba-Transformer porta a una piccola perdita di precisione (~1% su alcuni benchmark). Questo problema viene risolto tramite la quantizzazione selettiva, il che complica l'architettura dei compilatori e dei server di inferenza.[2][1]

Altri problemi aperti

  • Dipendenza dai benchmark con possibile contaminazione dei dati di addestramento.
  • Assenza di protocolli standardizzati per il confronto delle architetture ibride SSM-Transformer con i modelli Transformer puri.
  • Questione della scalabilità dell'approccio MoE nei compiti che richiedono un ragionamento profondo con un numero ridotto di esperti per token.
  • I dati su Super/Ultra al dicembre 2025 sono preliminari; i benchmark completi sono attesi dopo il rilascio.[1]

Aspetti etici e regolatori

Sicurezza nella fase di sviluppo

Nella fase di sviluppo vengono applicati: valutazione secondo il framework AEGIS (13 categorie di sicurezza dei contenuti), scanner di vulnerabilità garak, red-teaming manuale.[37]

Sicurezza nella fase di inferenza

NeMo Guardrails — strumentazione open source (licenza Apache 2.0) che aggiunge barriere programmabili ai sistemi LLM. Il microservizio intercetta input e output, applicando controlli configurabili: controllo dell'argomento, rilevamento di PII, verifica del «grounding» RAG, rilevamento di attacchi jailbreak (inclusa la protezione contro iniezioni di codice basata su YARA), classificazione di sicurezza multilingue e multimodale.[45]

Per Nemotron 3 è stato pubblicato un insieme di circa 11 000 tracce OpenTelemetry annotate provenienti da scenari realistici con uso di strumenti, destinate alla valutazione della sicurezza agentica.[1]

Licenze

Modelli Licenza
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron-4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama-Nemotron (Nano/Super/Ultra) Llama Community License (ereditata da Meta)
Nemotron-3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License consente l'uso commerciale, la creazione e la distribuzione di opere derivate, non richiede attribuzione (con conservazione del file NOTICE), non impone restrizioni sul numero di utenti e consente esplicitamente l'utilizzo degli output del modello per addestrare altri modelli.[46] I modelli basati su Llama ereditano le restrizioni di Meta, inclusa la soglia di 700 milioni di utenti attivi mensili.[11]

Per Nemotron 3 Nano, NVIDIA ha pubblicato: i pesi del modello, più di 10 trilioni di token di dati di addestramento, ricette di addestramento, codebase (NeMo, Megatron-LM, NeMo-Aligner), più di 10 ambienti di apprendimento per rinforzo con oltre 900 000 compiti.[1][2]

Prospettive e direzioni di ricerca

I prossimi rilascio includono Nemotron 3 Super (~100 miliardi di parametri, ~10 miliardi attivi) e Nemotron 3 Ultra (~500 miliardi, ~50 miliardi attivi), attesi nella prima metà del 2026. Entrambi i modelli utilizzeranno LatentMoE, MTP e addestramento nel formato NVFP4 sull'architettura Blackwell.[1]

La direzione strategica di NVIDIA è il posizionamento di Nemotron non come singolo modello, ma come livello infrastrutturale per sistemi multi-agente, dove diversi modelli della famiglia vengono utilizzati per compiti diversi con instradamento in base alla complessità.[1][15]

Principali direzioni di ricerca:

  • Sviluppo delle architetture ibride — ulteriore integrazione degli strati SSM con il meccanismo di attenzione per un contesto lungo scalabile.[12]
  • Metodi di compressione multi-livello — sviluppo di Minitron, Puzzle, MiniPuzzle e Nemotron Elastic.[20][21][30]
  • Apprendimento per rinforzo multi-dominio — Nemotron-CrossThink per estendere il RL al di là dei compiti matematici.[31]
  • Estensione del contesto — Nemotron-UltraLong fino a 4 milioni di token.[32]
  • Multimodalità — espansione nel campo vision-language (Nemotron VL), parlato (Nemotron Speech), ricerca visiva di documenti (Nemotron ColEmbed V2).[34][35][36]
  • Modelli ibridi compatti — Jet-Nemotron (NAS per modelli 2B/4B).[33]
  • Ricette aperte — pubblicazione di ricette di addestramento complete e dati per la riproducibilità e la personalizzazione da parte della comunità.[14]

Vedi anche

  • Architettura Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (famiglia di modelli Meta)

Riferimenti

Bibliografia

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/