Nemotron (NVIDIA) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — en familj av stora språkmodeller (Large Language Model, LLM) med öppna vikter, utvecklad av avdelningen Applied Deep Learning Research (ADLR) vid NVIDIA. Modellerna tillhör området Machine Learning och Natural Language Processing (NLP) och är avsedda för ett brett spektrum av uppgifter: syntetisk datagenerering, logisk slutledning (reasoning), agentbaserade tillämpningar (agentic AI) och driftsättning på NVIDIAs industriella hårdvara. Familjen samlar modeller med olika arkitekturer och skalor: från 4 miljarder till ~500 miljarder parametrar, inklusive täta (dense) decoder-only Transformer-modeller i Nemotron-4-serien (2024), hybrida Mamba-Transformer-modeller (Nemotron-H, 2025) och hybrida Mamba-Transformer-modeller med Mixture-of-Experts (MoE) i Nemotron 3-serien (2025). Per mars 2026 omfattar familjen mer än 20 modeller som täcker uppgifter inom textgenerering, resonemang, visuell dokumentförståelse, informationsutvinning och svarskvalitetsbedömning. Modellerna släpps huvudsakligen med öppna vikter under licenserna NVIDIA Open Model License och Llama Community License.[1][2][3]

Historia och bakgrund

Utvecklingen av Nemotron-familjen sker inom ramen för NVIDIAs strategi att bygga en komplett verktygsstack för generativ AI: från träningsinfrastruktur (DGX, superdatorer baserade på GPU H100/B200) till träningsplattformar (NeMo Framework), anpassning (NeMo-Aligner), driftsättning (NIM — NVIDIA Inference Microservices) och säkerhet (NeMo Guardrails).[4][5]

Nemotron-3 8B (2023)

Den första offentligt tillgängliga modellen i serien — en decoder-baserad Transformer med 8 miljarder parametrar och ett kontextfönster på 4096 token, tränad på 3,8 biljoner token på 53 naturliga språk och 37 programmeringsspråk. Träningen genomfördes på 1024 GPU A100 under 19 dagar. Ingen formell teknisk rapport publicerades på arXiv. Modellen distribuerades via NeMo Framework och Hugging Face; varianter för Chat (SFT och SteerLM) fanns tillgängliga. Licens — NVIDIA AI Foundation Models Community License.[6][7]

Anmärkning om namngivning: «Nemotron-3» från 2023 och «Nemotron 3» från december 2025 är olika modeller. Den förstnämnda var en tidig prototyp, den sistnämnda är den aktuella generationen med MoE-arkitektur.

Nemotron-4 15B (februari 2024)

Den första offentligt dokumenterade utgåvan i Nemotron-4-serien — en modell med 15 miljarder parametrar, tränad på 8 biljoner token under ~13 kalenderdagar på 384 DGX H100-noder (upp till 3072 GPU). En 8-faldig tensorparallelism och dataparallelism från 96 till 288 användes. Den maximala MFU (Model FLOPs Utilization) uppnådde 34,3 % vid batch size 384. Arkitekturen är en decoder-only Transformer med Grouped-Query Attention (GQA) och Rotary Position Embeddings (RoPE). Enligt benchmark-resultat vid publiceringstillfället överträffade modellen alla jämförbara öppna modeller av liknande storlek inom flerspråkiga uppgifter, inklusive ett antal modeller som är fyra gånger större.[8]

Nemotron-4 340B (juni 2024)

I juni 2024 släpptes den största modellen i Nemotron-4-serien — 340 miljarder parametrar (331,6 miljarder icke-embedding-parametrar), förtränad på 9 biljoner token (8 biljoner förträning + 1 biljon fortsatt träning med omviktning av högkvalitativa källor). Träningen genomfördes på 768 DGX H100-noder (upp till 6144 GPU) med en maximal MFU på 42,4 %, från december 2023 till maj 2024. Familjen omfattar tre varianter: Base, Instruct och Reward. Modellstorleken valdes så att den ryms på en enda DGX H100-nod (8 GPU) vid driftsättning i FP8-precisionsformat. Mer än 98 % av de data som användes vid anpassning (alignment) genererades syntetiskt av modellerna i serien i en iterativ process; pipelinen för syntetisk datagenerering är öppen för reproduktion.[3]

Llama-3.1-Nemotron-70B (oktober 2024)

I oktober 2024 släpptes modeller finjusterade från Meta Llama-3.1-70B-Instruct: Llama-3.1-Nemotron-70B-Instruct och Llama-3.1-Nemotron-70B-Reward. Per den 1 oktober 2024 innehade Instruct-modellen 1:a plats samtidigt på tre automatiska benchmark: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT-Bench (GPT-4-Turbo) — 8,98. Reward-modellen uppnådde 94,1 % på RewardBench.[9][10]

Övergång till hybrida arkitekturer (2025)

Under 2025 utvidgades serien med hybrida arkitekturer som kombinerar Mamba-2-lager (State Space Model, SSM — tillståndsrymdsmodell) och Transformer. Under mars–maj 2025 släpptes familjen av resonerande modeller Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) med ett omkopplingsbart resonemangssätt.[11] I april 2025 publicerades Nemotron-H (arXiv:2504.03624) — en familj av hybrida Mamba-Transformer-modeller med storlekarna 8B, 56B och 47B parametrar.[12] I augusti 2025 presenterades Nemotron Nano 2 (9B-v2, arXiv:2508.14444).[13]

Nemotron 3 (december 2025)

Den 15 december 2025 tillkännagavs den tredje generationen — Nemotron 3-familjen med modellerna Nano, Super och Ultra, som förenar arkitekturerna Mamba-2, Transformer och MoE med ett kontextfönster på upp till 1 miljon token. Nano släpptes med en teknisk rapport; Super och Ultra planeras till första halvåret 2026.[1][2][14][15]

Teoretiska grunder

Transformer-arkitekturen i Nemotron-4

Modellerna i Nemotron-4-serien bygger på standardarkitekturen för decoder-baserad Transformer med kausal uppmärksamhet. Sannolikheten för en tokensekvens x1,x2,,xT faktoriseras som:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

där θ är modellens parametrar.[8]

Uppmärksamhetsmekanismen implementeras i varianten Grouped-Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKdk)V,

där Q,K,V är matriser för frågor, nycklar och värden; dk är dimensionen för uppmärksamhetshuvudet.

För positionskodning används Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

där xm är vektorn i position m, θi=100002i/d, d är vektordimensionen.

I MLP-lager används aktiveringsfunktionen Squared ReLU: f(x)=(max(0,x))2, vilket ger gles aktivering. Modellerna innehåller inga bias-termer, använder inte dropout, och indata- och utdata-inbäddningsmatriserna är inte kopplade till varandra (untied embeddings). Tokenizern är SentencePiece BPE med bevarade blanksteg, teckenvis uppdelning av siffror och byte-fallback; ordförrådets storlek är 256 000.[8][3]

Arkitekturparametrar för Nemotron-4
Parameter Nemotron-4 15B Nemotron-4 340B
Antal parametrar 15 miljarder (3,2 miljarder embed.) 340 miljarder (9,4 miljarder embed.)
Antal lager 32 96
Dold dimension 6144 18 432
Uppmärksamhetshuvuden 48 96
KV-huvuden (GQA) 8 8
Kontextlängd 4096 4096
Ordförrådssstorlek 256 000 256 000

Källor: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Hybrid Mamba-Transformer-arkitektur (Nemotron-H)

I Nemotron-H-modellerna ersätts de vanliga självuppmärksamhetsblock delvis av Mamba-2-block — tillståndsrymdsmodeller (State Space Models, SSM). Vid autoregressiv generering kräver varje självuppmärksamhetslager O(n) operationer och minne per steg (på grund av KV-cachen), medan Mamba-lager erbjuder konstanta minneskostnader och beräkningskostnader per genererad token.[12]

Mamba-2 beskrivs av den rekurrenta relationen[18]:

ht=Aht1+Bxt,yt=Cht,

där htN är det dolda tillståndet, AN×N är den diagonala tillståndsövergångsmatrisen, BN×1 och C1×N är projektionsmatriser, xt är indata-token, yt är utsignalen. I Mamba-2 beror matriserna A, B, C på indata (input-dependent), vilket skiljer modellen från klassiska linjära SSM.

I Nemotron-H-56B används 54 Mamba-2-lager + 54 MLP-lager + 10 självuppmärksamhetslager, varvid uppmärksamhetslagren placeras jämnt bland Mamba-lagren. Modellen tränas på 20 biljoner token i FP8-format (per-tensor scaling) på 6144 GPU H100. Versionen Nemotron-H-8B innehåller 24 Mamba-2-lager, 24 MLP-lager och 4 självuppmärksamhetslager; träningen genomfördes på 15 biljoner token.[12]

MoE-arkitekturen i Nemotron 3

Modellerna i Nemotron 3 (december 2025) kombinerar tre arkitekturkomponenter: Mamba-2, Transformer och Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) innehåller 52 lager: 23 Mamba-2 + MoE-lager, 23 MoE-lager och 6 GQA-uppmärksamhetslager. Varje MoE-lager omfattar 128 dirigerade (routed) experter + 1 gemensam (shared) expert, varav 6 experter aktiveras per token. Dirigeringen utförs av ett träningsbart MLP-router med sigmoid gating. Lastbalansering implementeras utan hjälpförlusttillägg (aux-loss-free). Det totala antalet parametrar är 31,6 miljarder, men aktiva per token — endast 3,2 miljarder.[2]

Normalisering — RMSNorm[19]. Positionsinbäddningar saknas i Mamba-delarna (positionsinformation är implicit i SSM-tillståndet). Frikopplade inbäddningar används, utan dropout och bias i linjära lager.[2]

Utvidgningar i Super/Ultra: LatentMoE och Multi-Token Prediction

Super- och Ultra-modellerna i Nemotron 3-familjen tillämpar två ytterligare arkitektoniska innovationer:

  • Latent MoE (LatentMoE) — projektion av inrepresentationen till ett latent rum med lägre dimension innan dirigering, vilket gör det möjligt att öka antalet experter vid jämförbara beräkningskostnader och förbättra noggrannheten utan att minska genomströmningen.[1]
  • Multi-Token Prediction (MTP) — förutsägelse av flera nästkommande token samtidigt, vilket används för att förbättra kvaliteten på långa texter och spekulativ avkodning vid inferens.[1]

Träning av Super och Ultra sker i formatet NVFP4 — NVIDIAs 4-bitars numeriska format på Blackwell-arkitekturen.[1]

Metoder för modellkomprimering: Minitron, Puzzle, MiniPuzzle

För att skapa kompakta modeller tillämpar NVIDIA flera metoder:

  • Minitron — en metod för strukturerad beskärning (pruning) och kunskapsdestillation (knowledge distillation). Två typer av beskärning undersöks: efter djup (borttagning av lager) och efter bredd (gemensam minskning av dimensioner för dolda lager, uppmärksamhetshuvuden och MLP-projektioner). Tillämpning av Minitron på Nemotron-4 15B möjliggör framtagning av modeller på 8B och 4B med upp till 40 gånger lägre träningskostnad jämfört med träning från grunden.[20]
  • Puzzle — en Neural Architecture Search (NAS)-algoritm som väljer den optimala konfigurationen för varje block (antal KV-huvuden, FFN-storlek, förekomst/frånvaro av uppmärksamhet) med blockvis destillation. På detta sätt komprimerades Llama 3.1 405B till 253B (Llama-Nemotron Ultra) och Llama 3.3 70B till 49B (Llama-Nemotron Super).[21]
  • MiniPuzzle — en utvidgning av Puzzle för hybrida arkitekturer, som komprimerade Nemotron-H-56B till 47B med endast 63 miljarder destillationstoken. Med liknande noggrannhet är den komprimerade modellen 20 % snabbare vid inferens.[12]

Anpassningsmetoder

HelpSteer och HelpSteer2

HelpSteer — en datamängd med 37 120 exempel (licens CC-BY-4.0), skapad i samarbete med Scale AI, där varje svar är annoterat efter fem attribut: hjälpsamhet (helpfulness), korrekthet (correctness), sammanhang (coherence), komplexitet (complexity) och ordrikedom (verbosity) på en Likert-skala 0–4.[22]

HelpSteer2 — en uppdaterad datamängd med 21 362 exempel (10 681 prompt × 2 svar), där mer än 95 % av promptarna är hämtade från ShareGPT (verkliga användarförfrågningar). Ungefär 50 % av annoteringarna filtrerades bort som otillräckligt kvalitativa. Utvidgningen HelpSteer2-Preference lägger till parvis annotatorpreferenser, vilket möjliggör träning av såväl regressiva som parvisa belöningsmodeller på samma data.[23][24]

SteerLM

SteerLM — en metod för Supervised Fine-Tuning (SFT) med betingning på attribut (helpfulness, correctness, coherence, complexity, verbosity), som låter användaren styra svarsformatet vid inferens. Pipelinen inkluderar: (1) träning av en attributförutsägelsemodell (APM) på HelpSteer, (2) datamärkning med APM, (3) SFT med betingning på målattributvärden, (4) bootstrapping.[25]

DPO och RPO

DPO (Direct Preference Optimization) — en metod för direkt preferensoptimering utan en explicit belöningsmodell, som används i pipelines för Nemotron-4 340B Instruct och Nemotron Nano 2.[26]

RPO (Reward-aware Preference Optimization) — ett enhetligt matematiskt ramverk från NVIDIA som generaliserar DPO, IPO, SimPO, REINFORCE och SteerLM 2.0 som specialfall. RPO minimerar avståndet mellan förutsägelserna från den implicita belöningsmodellen och den explicita målmodellen[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

där rϕ är den explicita belöningsmodellen, πθ är den träningsbara policyn, πref är referenspolicyn, d(,) är avståndsfunktionen, yw/yl är föredraget/avvisat svar. RPO tillämpas vid träning av Nemotron-4 340B Instruct och Llama-Nemotron-modellerna.[27][3][11]

Förstärkningsinlärning med verifierbara belöningar i flera miljöer (RLVR)

I Nemotron 3 tillämpas Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — samtidig träning i flera miljöer inom NeMo Gym: tävlingsmatematik, programmering, QA, tool-use, instruction-following, long-context. Algoritmen är GRPO (Group Relative Policy Optimization) med masked importance sampling.[2][14]

Nemotron 3 stöder granulär styrning av resonemangsbudget (reasoning budget control): användaren kan ange en tokengräns för thinking trace via en flagga i chat-mallen (växling «detailed thinking on/off» eller begränsning av längd).[2]

Modellsortiment

Sammanfattande tabell

Modell År Totalt / Aktiva parametrar Kontext Arkitektur Viktigaste egenskaper
Nemotron-3 8B 2023 8B / 8B 4K Dense Transformer 3,8T token; 1024 GPU A100; 19 dagar
Nemotron-4 15B 2024 15B / 15B 4K Dense Transformer 8T token; MFU 34,3 %
Nemotron-4 340B 2024 340B / 340B 4K Dense Transformer 9T token; Base/Instruct/Reward; >98 % syntetiska alignment-data
Llama-3.1-Nemotron-70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1 %
Llama-Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama-Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) NAS-komprimering från Llama 3.1 8B
Llama-Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Från Llama 3.3 70B
Llama-Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Från Llama 3.1 405B; GPQA 76,0 %
Nemotron-H 8B 2025 8B / 8B Hybrid Mamba-Transformer 15T token; 24 Mamba-2 + 24 MLP + 4 Attn
Nemotron-H 56B 2025 56B / 56B Hybrid Mamba-Transformer 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn
Nemotron-H 47B 2025 47B / 47B ~1M (FP4) Hybrid Mamba-Transformer MiniPuzzle från 56B; +20 % hastighet
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Hybrid Mamba-Transformer 20T token; Minitron-destillation
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Hybrid Mamba-Transformer MoE 25T token; 128 experter, 6 aktiva
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Hybrid LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Hybrid LatentMoE MTP; NVFP4

Nemotron-4 15B

Arkitektur: 32 lager, hidden dimension 6144, 48 uppmärksamhetshuvuden, 8 KV-huvuden (GQA). Totalt antal parametrar — 15 miljarder (3,2 miljarder embedding + 12,5 miljarder non-embedding). Resultat: MMLU — 64,2 % (5-shot), BBH — 58,7 % (3-shot), GSM8K — 46,0 % (8-shot, maj@1), HumanEval — 31,6 % (0-shot, pass@1). På flerspråkiga benchmark (XCOPA, TyDiQA-GoldP, MGSM) överträffade modellen modeller som är fyra gånger större.[8]

Nemotron-4 340B

Arkitektur: 96 lager, hidden dimension 18 432, 96 uppmärksamhetshuvuden, 8 KV-huvuden.

Nemotron-4 340B Base visade: MMLU — 81,1 % (5-shot), BBH — 85,4 % (3-shot), HumanEval — 57,3 % (0-shot), ARC-Challenge — 94,3 % (25-shot).[3]

Nemotron-4 340B Instruct genomgick flerstegsanpassning: Code SFT → General SFT → DPO → RPO (3 omgångar). Resultat: MT-Bench — 8,22 (GPT-4-Turbo judge), MMLU — 78,7 % (0-shot), GSM8K — 92,3 % (0-shot), HumanEval — 73,2 % (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]

Nemotron-4 340B Reward ersätter det slutliga softmax-lagret med en linjär projektion av det dolda tillståndet i det sista lagret till en vektor med 5 HelpSteer2-attribut. Den slutliga belöningen är en viktad summa av fem attribut. Träningen genomfördes under 2 epoker på HelpSteer2-data (batch size 128). På RewardBench uppnådde modellen 92,0 %, vilket överträffade GPT-4o (84,7 %), Gemini 1.5 Pro (88,1 %) och Claude-3-Opus (80,7 %) vid publiceringstillfället.[3]

Modell Arena Hard AlpacaEval 2.0 LC MT-Bench
Nemotron-4-340B-Instruct 54,2 41,5 % 8,22
Llama-3-70B-Instruct 41,1 34,4 % 8,16
Mixtral-8x22B-Instruct 36,4 30,9 % 7,63
Qwen-2-72B-Instruct 48,1 38,8 % 8,26

Källa: arXiv:2406.11704, tabell 5.[3]

Llama-3.1-Nemotron-70B

Llama-3.1-Nemotron-70B-Reward tränas med en hybridmetod som kombinerar Bradley-Terry (parvis preferens) och SteerLM-regression (flerattributbedömning på Likert-skala). Träningen genomfördes uteslutande på HelpSteer2-data (CC-BY-4.0). På RewardBench uppnådde modellen 94,1 % och intog 1:a plats vid publiceringstillfället.[10]

Llama-3.1-Nemotron-70B-Instruct anpassas med RLHF-metoden och algoritmen REINFORCE (inte PPO) samt belöningsmodellen Nemotron-70B-Reward. Infrastrukturen är NeMo-Aligner med TRT-LLM-acceleration.[9]

Llama-Nemotron: Nano, Super, Ultra (2025)

En familj av resonerande modeller, härledda från Llama 3.x med hjälp av NAS, destillation och utökad efterträning.[11]

Modell Parametrar Basmodell Kontext
Llama-Nemotron-Nano 8B 8 miljarder Llama-3.1-8B-Instruct 128K
Llama-Nemotron-Nano 4B 4 miljarder Minitron 4B (från Llama 3.1 8B) 128K
Llama-Nemotron-Super 49B 49 miljarder Llama-3.3-70B → NAS (Puzzle) 128K
Llama-Nemotron-Ultra 253B 253 miljarder Llama-3.1-405B → NAS (Puzzle) 128K

Femstegs träningspipeline: (1) NAS + FFN Fusion, (2) destillation + fortsatt förträning, (3) SFT (inklusive resonemangsspår från DeepSeek-R1), (4) storskalig RL (GRPO för Ultra, REINFORCE/RLOO + Online RPO för Nano), (5) dialoganpassning.[11]

Modellerna var de första bland öppna LLM att stödja omkopplingsbart resonemangssätt (reasoning toggle): när det är aktiverat («detailed thinking on» i systemprompt) genererar modellen en resoneringskedja i taggarna <think>...</think> före svaret; när det är inaktiverat svarar modellen direkt.[11]

Resultat för Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Till jämförelse: DeepSeek-R1 (671B totalt / 37B aktiva) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra ryms på en enda nod med 8×H100.[11]

Nemotron-H (april 2025)

En familj av täta hybrida modeller, tränade från grunden och utformade för uppgifter med långa genereringar. Nemotron-H-56B tränas på 20 biljoner token i FP8 — ett av de största offentliga experimenten med FP8-förträning. Nemotron-H-47B erhålls genom komprimering av 56B med metoden MiniPuzzle (63 miljarder destillationstoken) och ryms i minnet på ett enda RTX 5090 (FP4) med ett kontextfönster på ~1M token.[12]

Benchmark Nemotron-H-56B Nemotron-H-47B Qwen-2.5-72B Llama-3.1-70B
MMLU-Pro (5-shot CoT) 60,5 61,8 58,8 51,3
MMLU (5-shot) 84,2 83,6 86,1 78,8
GSM8K (8-shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0-shot) 60,4 61,0 56,7 57,3

Källa: arXiv:2504.03624.[12]

Vid generering med 65 536 indata- och 1024 utdatatoken på H100 var Nemotron-H-47B 2,9 gånger snabbare än Qwen-2.5-72B och Llama-3.1-70B.[12]

Nemotron Nano 2 (augusti 2025)

En hybrid Mamba-Transformer-modell för resonemang. Nemotron-Nano-12B-v2-Base — föräldramodellen med 62 lager (huvudsakligen Mamba-2 + MLP + 4 uppmärksamhetslager), tränad på 20 biljoner token i FP8 från grunden. Från denna modell erhålls Nemotron-Nano-9B-v2 med den utökade Minitron-metoden; den kan köras med ett kontextfönster på 128K token på en enda GPU NVIDIA A10G (22 GB, BF16). Efterträning: SFT (80 miljarder token, inklusive spår från DeepSeek-R1-0528) → GRPO → DPO → RLHF. På resonemangsbenchmark är modellen jämförbar med Qwen3-8B i noggrannhet, men uppnår 3–6 gånger snabbare generering vid långa utdatasekvenser.[13]

Nemotron 3 Nano 30B-A3B

Släpptes i december 2025. Parametrar: 31,6 miljarder totalt, 3,2 miljarder aktiva. Arkitektur: 52 lager, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 dirigerade experter + 1 gemensam, 6 aktiva per token. Kontext — upp till 1 048 576 token. Träning på 25 biljoner token (WSD-schema, batch size 3072, datautsnitt — juni 2025) i två faser: Fas 1 — 23,5 biljoner (varierade data), Fas 2 — 1,5 biljoner (högkvalitativa data) + 121 miljarder token long-context CPT.[2]

Benchmark Nemotron 3 Nano 30B-A3B Qwen3-30B-A3B-Thinking GPT-OSS-20B
MMLU-Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE-Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena-Hard-V2 Avg 67,65 57,8 48,55
RULER-100 @ 1M 86,34 77,5

* — värden från sekundära källor; reproduktionsvillkor — NeMo Evaluator SDK. Källa: arXiv:2512.20848.[2][28]

Genomströmning (8K indata / 16K utdata, single H200): 3,3 gånger högre än Qwen3-30B-A3B-Thinking och 2,2 gånger högre än GPT-OSS-20B.[2]

Ytterligare modeller och inriktningar

  • OpenReasoning-Nemotron (juli 2025) — en serie modeller med 1,5B–32B parametrar, baserade på Qwen 2.5 och finjusterade på data från DeepSeek-R1-0528. Varianten 32B med GenSelect@64 överträffar o3 (high) på ett antal matematiska benchmark.[29]
  • Nemotron Elastic (arXiv:2511.16664) — ett ramverk för inbäddade delmodeller (6B, 9B, 12B) inom en enda föräldramodell, vilket sänker träningskostnaden 360 gånger jämfört med träning från grunden.[30]
  • Nemotron-CrossThink — ett ramverk för multidomain förstärkningsinlärning utanför matematiska uppgifter, vilket gav +30,1 % på MATH-500 och +12,8 % på MMLU-PRO.[31]
  • Nemotron-UltraLong — kontextutvidgning upp till 4 miljoner token.[32]
  • Jet-Nemotron — eftertränings-NAS för kompakta hybrida modeller 2B/4B.[33]

Specialiserade modeller

I Nemotron-ekosystemet finns även modeller för specialiserade uppgifter:

  • Nemotron Nano V2 VL — en vision-language-modell för OCR, tabellbehandling och video.[34]
  • Nemotron Parse 1.1 — en modell för OCR och extraktion av dokumentstruktur.[35]
  • Nemotron ColEmbed V2 — en embedding-modell för visuell dokumentsökning (late interaction).[36]
  • Nemotron Speech — modeller för automatisk taligenkänning (ASR), talsyntes (TTS) och maskinöversättning (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — en klassificeringsmodell för osäkert innehåll i 23 kategorier på 9 språk med en noggrannhet på 84,2 %.[37]

Data för förträning

Sammansättning av data i Nemotron-4

Förträningskorpusen för Nemotron-4 15B och 340B består av tre huvudkategorier: engelska texter (70 %), flerspråkiga texter på 53 språk (15 %) och källkod på 43 programmeringsspråk (15 %). Deduplicering på dokumentnivå (exakt och nära-duplikat) tillämpades, liksom filtrering med hjälp av språkmodeller och heuristiker. Modellen 15B tränas på 8 biljoner token, modellen 340B på 9 biljoner (8 biljoner förträning + 1 biljon fortsatt träning med omviktning av högkvalitativa källor).[8][3]

Nemotron-CC

Datamängden Nemotron-CC skapas från Common Crawl med hjälp av ett ensemble av kvalitetsklassificerare och syntetisk omformulering av texter. Den totala volymen är 6,3 biljoner token (4,4 biljoner deduplicerade + 1,9 biljoner syntetiska omformuleringar). Pipelinen är integrerad i verktyget NeMo Curator. Arbetet antogs som Long Paper på konferensen ACL 2025.[38]

Nemotron-CC-Math

En matematikfokuserad delmängd på 133 miljarder token, extraherad från Common Crawl med hjälp av Lynx + LLM-pipeline med bevarad struktur för matematiska formler och kod i LaTeX.[39]

Data för Nemotron 3 Nano

Förträning av Nemotron 3 Nano genomfördes på 25 biljoner token. Datamängden inkluderar: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1 och specialiserade STEM-datamängder. För long-context-träning användes ytterligare 121 miljarder token CPT.[2]

Nemotron Pretraining Dataset v1

En syntetiskt genererad datamängd som täcker STEM, akademiska texter, resoneringsuppgifter och flerspråkiga domäner; den innehåller mer än 10 biljoner språktoken och 18 miljoner SFT-exempel. Alla datamängder distribueras under öppna tillåtande licenser.[40]

Pipeline för syntetisk datagenerering (SDG)

Pipelinen som beskrivs i den tekniska rapporten om Nemotron-4 340B inkluderar följande steg[3]:

  • Promptgenerering: syntetiska en- och tvåvändiga förfrågningar, genererade med hjälp av Mixtral-8x7B-Instruct-v0.1 (licens Apache 2.0) enligt mallarna Open QA, Writing, Closed QA, Math & Coding.
  • Svarsgenerering: flera svar från mellanversioner av modellerna för att säkerställa mångfald.
  • Kvalitetsbedömning: tre metoder — Ground-Truth-as-a-Judge (för uppgifter med verifierbart svar), LLM-as-Judge (parvis svarsjämförelse med hjälp av en språkmodell), Reward-Model-as-Judge (användning av Nemotron-4-340B-Reward).
  • Iterativ anpassning från svaga till starka modeller (weak-to-strong).

Från ~20 000 mänskligt annoterade exempel (10 000 för SFT, 10 000 HelpSteer2 för belöningsmodellen) syntetiserades hela den återstående volymen av anpassningsdata.[3]

Kvantisering och inferensoptimering

Nemotron 3 Nano-modellerna stöder Post-Training Quantization (PTQ) i FP8 med hjälp av ModelOpt och Megatron-LM. Selektiv kvantisering tillämpas — uppmärksamhetslager och delar av Mamba behålls i BF16 för att bevara kvaliteten; övriga kvantiseras till FP8. Enligt den tekniska rapporten ger detta ~99 % noggrannhetsbevarandegrad.[2] Nano stöder också inferens i NVFP4-formatet.[1]

Sammanfattande benchmark-tabell per generation

Modell MMLU GSM8K HumanEval Arena Hard MT-Bench Villkor
Nemotron-4 15B 64,2 % 46,0 % 31,6 % base; 5-/8-/0-shot
Nemotron-4 340B Base 81,1 % 57,3 % 5-/—/0-shot
Nemotron-4 340B Instruct 78,7 % 92,3 % 73,2 % 54,2 8,22 0-shot
Llama-3.1-Nemotron-70B-Instruct 85,0 8,98 okt. 2024
LN-Ultra 253B (reasoning ON) GPQA 76,0 %, AIME 80,8 %
Nemotron-H-47B 83,6 % 93,3 % 61,0 % 5-/8-CoT/0-shot
Nemotron 3 Nano (30B-A3B) 67,7 (v2) AIME25 89,1 %, LCB 68,3 %

Jämförelsen bör tolkas med försiktighet: utvärderingsvillkor, benchmark-versioner och testdatum skiljer sig åt mellan generationerna. Resultaten är hämtade från NVIDIAs tekniska rapporter; oberoende utvärderingar kan avvika (se avsnittet «Begränsningar»).[8][3][9][11][12][2]

Tillämpningar

Driftsättning via NVIDIA NIM

NVIDIA NIM — en uppsättning optimerade containerbaserade mikrotjänster för inferens med ett OpenAI-kompatibelt API. Nemotron-modellerna finns tillgängliga som NIM-mikrotjänster på plattformen build.nvidia.com. NIM stöder formaten FP8, BF16, NVFP4 och driftsättning via Helm-diagram på Kubernetes. Modellerna är även kompatibla med oberoende ramverk: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]

Syntetisk datagenerering

Nemotron-4 340B är utformad för användning som generator av syntetiska data: Instruct-modellen genererar svar, Reward-modellen utvärderar och filtrerar dem. NVIDIA Open Model License tillåter uttryckligen användning av modellens utdata för träning av andra modeller. Enligt ServiceNow härstammar 15 % av förträningsdata för deras modell Apriel 1.6 från Nemotron-datamängder.[3][15][41]

Agentbaserade system

Modellerna i Nemotron 3-familjen (Nano, Super, Ultra) är utformade för multiagentarbetsbelastningar: planering, retrieval, verktygsanrop (tool use). Nemotron 3 Nano uppnår 38,76 % på SWE-Bench (med OpenHands) och 49,04 % (avg) på TauBench V2.[2]

Företagsimplementeringar

Bland de uttalade partnerna finns: ServiceNow (gemensam modell Apriel Nemotron 15B för automatisering av arbetsflöden), CrowdStrike (plattformen Charlotte AI), Perplexity (förfrågningsrouting), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modellerna finns tillgängliga på AWS Amazon Bedrock; stöd för Google Cloud, CoreWeave och Nebius planeras.[15]

Begränsningar och öppna problem

Oberoende utvärderingar och avvikelser från NVIDIAs uppgifter

Oberoende utvärderingar avslöjar avvikelser från de resultat som NVIDIA redovisar. Enligt Artificial Analysis (februari 2026) fick Llama-Nemotron-Ultra 253B (reasoning) ett Intelligence Index-värde på 15, mot ett median på 26 för modeller av jämförbar storlek. På plattformen Chatbot Arena (LMArena) intog Nemotron-modellerna mellanplaceringar: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147:e plats), Nemotron 3 Nano — 1317 ±6 (~164:e plats).[42][43]

Ordrikedom

Nemotron-modellerna uppvisar förhöjd ordrikedom: vid utvärdering av Artificial Analysis genererade Nemotron 3 Nano 140 miljoner token (mot ett median på 12 miljoner för andra modeller), vilket ökar inferenskostnaden. En analys från DEV Community visade att Llama-3.1-Nemotron-70B-Instruct, trots formellt ledarskap på automatiska benchmark, uppvisade otillräcklig noggrannhet i ett antal praktiska uppgifter, och att höga poäng på Arena-liknande benchmark kan ha berott på preferensen för ordrika och självsäkra, men inte nödvändigtvis exakta svar.[42][44]

Hallucineringar och bias

NVIDIA anger i modellkorten att modellerna kan «förstärka fördomar och generera toxiska svar, särskilt vid toxiska promptar», samt «producera felaktig information och utelämna viktiga detaljer». Öppenhet avseende vikter och data möjliggör extern revision.[11][13]

Beräkningskrav

Täta modeller (Nemotron-4 340B) kräver ett kluster med 768 DGX H100-noder för fullständig träning, vilket begränsar reproducerbarheten för akademiska grupper utan tillgång till likvärdig infrastruktur. Lång kontext (1M) vid inferens kräver avsevärd VRAM-kapacitet.[3][2]

Degradering vid kontextutvidgning

Vid utvidgning av kontexten till mycket långa sekvenser observerades en försämring av resultaten på benchmark med kort kontext.[32]

Kvantisering av hybrida arkitekturer

Användning av extremt låg bitbredd (FP8/NVFP4) i Mamba-Transformer-arkitekturer leder till en liten försämring av noggrannheten (~1 % på ett antal benchmark). Detta problem löses med selektiv kvantisering, vilket komplicerar kompilatorarkitektur och inferensservrar.[2][1]

Övriga öppna problem

  • Beroende av benchmark med möjlig kontaminering av träningsdata.
  • Avsaknad av standardiserade protokoll för jämförelse av hybrida SSM-Transformer-arkitekturer med rena Transformer-modeller.
  • Frågan om skalbarhet hos MoE-metoden för uppgifter som kräver djupt resonemang med ett litet antal aktiva experter per token.
  • Data om Super/Ultra per december 2025 är preliminära; fullständiga benchmark väntas efter release.[1]

Etiska och regulatoriska aspekter

Säkerhet i utvecklingsfasen

Under utvecklingsfasen tillämpas: utvärdering enligt AEGIS-ramverket (13 kategorier för innehållssäkerhet), sårbarhetsskannern garak, manuell «röd-teamning» (red-teaming).[37]

Säkerhet vid inferens

NeMo Guardrails — ett öppet verktygsset (licens Apache 2.0) som lägger till programmerbara barriärer till LLM-system. Mikrotjänsten fångar upp indata och utdata och tillämpar konfigurerbara kontroller: ämneskontroll, PII-detektering, verifiering av RAG-förankring, detektering av jailbreak-attacker (inklusive skydd mot kodinjektioner baserat på YARA), flerspråkig multimodal säkerhetsklassificering.[45]

För Nemotron 3 har en datamängd med ~11 000 märkta OpenTelemetry-spår från realistiska scenarier med verktygsanvändning publicerats, avsedd för utvärdering av agentsäkerhet.[1]

Licensiering

Modeller Licens
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron-4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama-Nemotron (Nano/Super/Ultra) Llama Community License (ärvd från Meta)
Nemotron-3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License tillåter kommersiell användning, skapande och distribution av derivatverk, kräver ingen attribution (vid bevarande av NOTICE-filen), ställer inga begränsningar på antalet användare och tillåter uttryckligen användning av modellens utdata för träning av andra modeller.[46] Modeller baserade på Llama ärver Metas begränsningar, inklusive tröskeln på 700 miljoner månatliga aktiva användare.[11]

För Nemotron 3 Nano har NVIDIA publicerat: modellvikter, mer än 10 biljoner token träningsdata, träningsrecept, kodbaser (NeMo, Megatron-LM, NeMo-Aligner) och mer än 10 miljöer för förstärkningsinlärning med 900 000+ uppgifter.[1][2]

Framtidsperspektiv och forskningsinriktningar

Kommande releaser inkluderar Nemotron 3 Super (~100 miljarder parametrar, ~10 miljarder aktiva) och Nemotron 3 Ultra (~500 miljarder, ~50 miljarder aktiva), förväntade under första halvåret 2026. Båda modellerna kommer att använda LatentMoE, MTP och träning i NVFP4-format på Blackwell-arkitekturen.[1]

NVIDIAs strategiska inriktning är att positionera Nemotron inte som en enstaka modell, utan som ett infrastrukturlager för multiagentsystem, där olika modeller i familjen används för olika uppgifter med routing baserat på komplexitet.[1][15]

Huvudsakliga forskningsinriktningar:

  • Utveckling av hybrida arkitekturer — vidare integration av SSM-lager med uppmärksamhetsmekanismen för skalbar lång kontext.[12]
  • Flernivåmetoder för komprimering — vidareutveckling av Minitron, Puzzle, MiniPuzzle och Nemotron Elastic.[20][21][30]
  • Multidomain förstärkningsinlärning — Nemotron-CrossThink för utvidgning av RL utanför matematiska uppgifter.[31]
  • Kontextutvidgning — Nemotron-UltraLong upp till 4 miljoner token.[32]
  • Multimodalitet — utvidgning till vision-language (Nemotron VL), tal (Nemotron Speech), visuell dokumentsökning (Nemotron ColEmbed V2).[34][35][36]
  • Kompakta hybrida modeller — Jet-Nemotron (NAS för modeller 2B/4B).[33]
  • Öppna recept — publicering av fullständiga träningsrecept och data för reproduktion och anpassning av gemenskapen.[14]

Se även

  • Transformer-arkitekturen
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (Meta:s modellfamilj)

Referenser

Litteratur

Noter

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/