Nemotron (NVIDIA) (SV)
Nemotron — en familj av stora språkmodeller (Large Language Model, LLM) med öppna vikter, utvecklad av avdelningen Applied Deep Learning Research (ADLR) vid NVIDIA. Modellerna tillhör området Machine Learning och Natural Language Processing (NLP) och är avsedda för ett brett spektrum av uppgifter: syntetisk datagenerering, logisk slutledning (reasoning), agentbaserade tillämpningar (agentic AI) och driftsättning på NVIDIAs industriella hårdvara. Familjen samlar modeller med olika arkitekturer och skalor: från 4 miljarder till ~500 miljarder parametrar, inklusive täta (dense) decoder-only Transformer-modeller i Nemotron-4-serien (2024), hybrida Mamba-Transformer-modeller (Nemotron-H, 2025) och hybrida Mamba-Transformer-modeller med Mixture-of-Experts (MoE) i Nemotron 3-serien (2025). Per mars 2026 omfattar familjen mer än 20 modeller som täcker uppgifter inom textgenerering, resonemang, visuell dokumentförståelse, informationsutvinning och svarskvalitetsbedömning. Modellerna släpps huvudsakligen med öppna vikter under licenserna NVIDIA Open Model License och Llama Community License.[1][2][3]
Historia och bakgrund
Utvecklingen av Nemotron-familjen sker inom ramen för NVIDIAs strategi att bygga en komplett verktygsstack för generativ AI: från träningsinfrastruktur (DGX, superdatorer baserade på GPU H100/B200) till träningsplattformar (NeMo Framework), anpassning (NeMo-Aligner), driftsättning (NIM — NVIDIA Inference Microservices) och säkerhet (NeMo Guardrails).[4][5]
Nemotron-3 8B (2023)
Den första offentligt tillgängliga modellen i serien — en decoder-baserad Transformer med 8 miljarder parametrar och ett kontextfönster på 4096 token, tränad på 3,8 biljoner token på 53 naturliga språk och 37 programmeringsspråk. Träningen genomfördes på 1024 GPU A100 under 19 dagar. Ingen formell teknisk rapport publicerades på arXiv. Modellen distribuerades via NeMo Framework och Hugging Face; varianter för Chat (SFT och SteerLM) fanns tillgängliga. Licens — NVIDIA AI Foundation Models Community License.[6][7]
Anmärkning om namngivning: «Nemotron-3» från 2023 och «Nemotron 3» från december 2025 är olika modeller. Den förstnämnda var en tidig prototyp, den sistnämnda är den aktuella generationen med MoE-arkitektur.
Nemotron-4 15B (februari 2024)
Den första offentligt dokumenterade utgåvan i Nemotron-4-serien — en modell med 15 miljarder parametrar, tränad på 8 biljoner token under ~13 kalenderdagar på 384 DGX H100-noder (upp till 3072 GPU). En 8-faldig tensorparallelism och dataparallelism från 96 till 288 användes. Den maximala MFU (Model FLOPs Utilization) uppnådde 34,3 % vid batch size 384. Arkitekturen är en decoder-only Transformer med Grouped-Query Attention (GQA) och Rotary Position Embeddings (RoPE). Enligt benchmark-resultat vid publiceringstillfället överträffade modellen alla jämförbara öppna modeller av liknande storlek inom flerspråkiga uppgifter, inklusive ett antal modeller som är fyra gånger större.[8]
Nemotron-4 340B (juni 2024)
I juni 2024 släpptes den största modellen i Nemotron-4-serien — 340 miljarder parametrar (331,6 miljarder icke-embedding-parametrar), förtränad på 9 biljoner token (8 biljoner förträning + 1 biljon fortsatt träning med omviktning av högkvalitativa källor). Träningen genomfördes på 768 DGX H100-noder (upp till 6144 GPU) med en maximal MFU på 42,4 %, från december 2023 till maj 2024. Familjen omfattar tre varianter: Base, Instruct och Reward. Modellstorleken valdes så att den ryms på en enda DGX H100-nod (8 GPU) vid driftsättning i FP8-precisionsformat. Mer än 98 % av de data som användes vid anpassning (alignment) genererades syntetiskt av modellerna i serien i en iterativ process; pipelinen för syntetisk datagenerering är öppen för reproduktion.[3]
Llama-3.1-Nemotron-70B (oktober 2024)
I oktober 2024 släpptes modeller finjusterade från Meta Llama-3.1-70B-Instruct: Llama-3.1-Nemotron-70B-Instruct och Llama-3.1-Nemotron-70B-Reward. Per den 1 oktober 2024 innehade Instruct-modellen 1:a plats samtidigt på tre automatiska benchmark: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT-Bench (GPT-4-Turbo) — 8,98. Reward-modellen uppnådde 94,1 % på RewardBench.[9][10]
Övergång till hybrida arkitekturer (2025)
Under 2025 utvidgades serien med hybrida arkitekturer som kombinerar Mamba-2-lager (State Space Model, SSM — tillståndsrymdsmodell) och Transformer. Under mars–maj 2025 släpptes familjen av resonerande modeller Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) med ett omkopplingsbart resonemangssätt.[11] I april 2025 publicerades Nemotron-H (arXiv:2504.03624) — en familj av hybrida Mamba-Transformer-modeller med storlekarna 8B, 56B och 47B parametrar.[12] I augusti 2025 presenterades Nemotron Nano 2 (9B-v2, arXiv:2508.14444).[13]
Nemotron 3 (december 2025)
Den 15 december 2025 tillkännagavs den tredje generationen — Nemotron 3-familjen med modellerna Nano, Super och Ultra, som förenar arkitekturerna Mamba-2, Transformer och MoE med ett kontextfönster på upp till 1 miljon token. Nano släpptes med en teknisk rapport; Super och Ultra planeras till första halvåret 2026.[1][2][14][15]
Teoretiska grunder
Transformer-arkitekturen i Nemotron-4
Modellerna i Nemotron-4-serien bygger på standardarkitekturen för decoder-baserad Transformer med kausal uppmärksamhet. Sannolikheten för en tokensekvens faktoriseras som:
där är modellens parametrar.[8]
Uppmärksamhetsmekanismen implementeras i varianten Grouped-Query Attention (GQA)[16]:
där är matriser för frågor, nycklar och värden; är dimensionen för uppmärksamhetshuvudet.
För positionskodning används Rotary Position Embeddings (RoPE)[17]:
där är vektorn i position , , är vektordimensionen.
I MLP-lager används aktiveringsfunktionen Squared ReLU: , vilket ger gles aktivering. Modellerna innehåller inga bias-termer, använder inte dropout, och indata- och utdata-inbäddningsmatriserna är inte kopplade till varandra (untied embeddings). Tokenizern är SentencePiece BPE med bevarade blanksteg, teckenvis uppdelning av siffror och byte-fallback; ordförrådets storlek är 256 000.[8][3]
Arkitekturparametrar för Nemotron-4
| Parameter | Nemotron-4 15B | Nemotron-4 340B |
|---|---|---|
| Antal parametrar | 15 miljarder (3,2 miljarder embed.) | 340 miljarder (9,4 miljarder embed.) |
| Antal lager | 32 | 96 |
| Dold dimension | 6144 | 18 432 |
| Uppmärksamhetshuvuden | 48 | 96 |
| KV-huvuden (GQA) | 8 | 8 |
| Kontextlängd | 4096 | 4096 |
| Ordförrådssstorlek | 256 000 | 256 000 |
Källor: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Hybrid Mamba-Transformer-arkitektur (Nemotron-H)
I Nemotron-H-modellerna ersätts de vanliga självuppmärksamhetsblock delvis av Mamba-2-block — tillståndsrymdsmodeller (State Space Models, SSM). Vid autoregressiv generering kräver varje självuppmärksamhetslager operationer och minne per steg (på grund av KV-cachen), medan Mamba-lager erbjuder konstanta minneskostnader och beräkningskostnader per genererad token.[12]
Mamba-2 beskrivs av den rekurrenta relationen[18]:
där är det dolda tillståndet, är den diagonala tillståndsövergångsmatrisen, och är projektionsmatriser, är indata-token, är utsignalen. I Mamba-2 beror matriserna , , på indata (input-dependent), vilket skiljer modellen från klassiska linjära SSM.
I Nemotron-H-56B används 54 Mamba-2-lager + 54 MLP-lager + 10 självuppmärksamhetslager, varvid uppmärksamhetslagren placeras jämnt bland Mamba-lagren. Modellen tränas på 20 biljoner token i FP8-format (per-tensor scaling) på 6144 GPU H100. Versionen Nemotron-H-8B innehåller 24 Mamba-2-lager, 24 MLP-lager och 4 självuppmärksamhetslager; träningen genomfördes på 15 biljoner token.[12]
MoE-arkitekturen i Nemotron 3
Modellerna i Nemotron 3 (december 2025) kombinerar tre arkitekturkomponenter: Mamba-2, Transformer och Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) innehåller 52 lager: 23 Mamba-2 + MoE-lager, 23 MoE-lager och 6 GQA-uppmärksamhetslager. Varje MoE-lager omfattar 128 dirigerade (routed) experter + 1 gemensam (shared) expert, varav 6 experter aktiveras per token. Dirigeringen utförs av ett träningsbart MLP-router med sigmoid gating. Lastbalansering implementeras utan hjälpförlusttillägg (aux-loss-free). Det totala antalet parametrar är 31,6 miljarder, men aktiva per token — endast 3,2 miljarder.[2]
Normalisering — RMSNorm[19]. Positionsinbäddningar saknas i Mamba-delarna (positionsinformation är implicit i SSM-tillståndet). Frikopplade inbäddningar används, utan dropout och bias i linjära lager.[2]
Utvidgningar i Super/Ultra: LatentMoE och Multi-Token Prediction
Super- och Ultra-modellerna i Nemotron 3-familjen tillämpar två ytterligare arkitektoniska innovationer:
- Latent MoE (LatentMoE) — projektion av inrepresentationen till ett latent rum med lägre dimension innan dirigering, vilket gör det möjligt att öka antalet experter vid jämförbara beräkningskostnader och förbättra noggrannheten utan att minska genomströmningen.[1]
- Multi-Token Prediction (MTP) — förutsägelse av flera nästkommande token samtidigt, vilket används för att förbättra kvaliteten på långa texter och spekulativ avkodning vid inferens.[1]
Träning av Super och Ultra sker i formatet NVFP4 — NVIDIAs 4-bitars numeriska format på Blackwell-arkitekturen.[1]
Metoder för modellkomprimering: Minitron, Puzzle, MiniPuzzle
För att skapa kompakta modeller tillämpar NVIDIA flera metoder:
- Minitron — en metod för strukturerad beskärning (pruning) och kunskapsdestillation (knowledge distillation). Två typer av beskärning undersöks: efter djup (borttagning av lager) och efter bredd (gemensam minskning av dimensioner för dolda lager, uppmärksamhetshuvuden och MLP-projektioner). Tillämpning av Minitron på Nemotron-4 15B möjliggör framtagning av modeller på 8B och 4B med upp till 40 gånger lägre träningskostnad jämfört med träning från grunden.[20]
- Puzzle — en Neural Architecture Search (NAS)-algoritm som väljer den optimala konfigurationen för varje block (antal KV-huvuden, FFN-storlek, förekomst/frånvaro av uppmärksamhet) med blockvis destillation. På detta sätt komprimerades Llama 3.1 405B till 253B (Llama-Nemotron Ultra) och Llama 3.3 70B till 49B (Llama-Nemotron Super).[21]
- MiniPuzzle — en utvidgning av Puzzle för hybrida arkitekturer, som komprimerade Nemotron-H-56B till 47B med endast 63 miljarder destillationstoken. Med liknande noggrannhet är den komprimerade modellen 20 % snabbare vid inferens.[12]
Anpassningsmetoder
HelpSteer och HelpSteer2
HelpSteer — en datamängd med 37 120 exempel (licens CC-BY-4.0), skapad i samarbete med Scale AI, där varje svar är annoterat efter fem attribut: hjälpsamhet (helpfulness), korrekthet (correctness), sammanhang (coherence), komplexitet (complexity) och ordrikedom (verbosity) på en Likert-skala 0–4.[22]
HelpSteer2 — en uppdaterad datamängd med 21 362 exempel (10 681 prompt × 2 svar), där mer än 95 % av promptarna är hämtade från ShareGPT (verkliga användarförfrågningar). Ungefär 50 % av annoteringarna filtrerades bort som otillräckligt kvalitativa. Utvidgningen HelpSteer2-Preference lägger till parvis annotatorpreferenser, vilket möjliggör träning av såväl regressiva som parvisa belöningsmodeller på samma data.[23][24]
SteerLM
SteerLM — en metod för Supervised Fine-Tuning (SFT) med betingning på attribut (helpfulness, correctness, coherence, complexity, verbosity), som låter användaren styra svarsformatet vid inferens. Pipelinen inkluderar: (1) träning av en attributförutsägelsemodell (APM) på HelpSteer, (2) datamärkning med APM, (3) SFT med betingning på målattributvärden, (4) bootstrapping.[25]
DPO och RPO
DPO (Direct Preference Optimization) — en metod för direkt preferensoptimering utan en explicit belöningsmodell, som används i pipelines för Nemotron-4 340B Instruct och Nemotron Nano 2.[26]
RPO (Reward-aware Preference Optimization) — ett enhetligt matematiskt ramverk från NVIDIA som generaliserar DPO, IPO, SimPO, REINFORCE och SteerLM 2.0 som specialfall. RPO minimerar avståndet mellan förutsägelserna från den implicita belöningsmodellen och den explicita målmodellen[27]:
där är den explicita belöningsmodellen, är den träningsbara policyn, är referenspolicyn, är avståndsfunktionen, / är föredraget/avvisat svar. RPO tillämpas vid träning av Nemotron-4 340B Instruct och Llama-Nemotron-modellerna.[27][3][11]
Förstärkningsinlärning med verifierbara belöningar i flera miljöer (RLVR)
I Nemotron 3 tillämpas Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — samtidig träning i flera miljöer inom NeMo Gym: tävlingsmatematik, programmering, QA, tool-use, instruction-following, long-context. Algoritmen är GRPO (Group Relative Policy Optimization) med masked importance sampling.[2][14]
Nemotron 3 stöder granulär styrning av resonemangsbudget (reasoning budget control): användaren kan ange en tokengräns för thinking trace via en flagga i chat-mallen (växling «detailed thinking on/off» eller begränsning av längd).[2]
Modellsortiment
Sammanfattande tabell
| Modell | År | Totalt / Aktiva parametrar | Kontext | Arkitektur | Viktigaste egenskaper |
|---|---|---|---|---|---|
| Nemotron-3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 dagar |
| Nemotron-4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34,3 % |
| Nemotron-4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98 % syntetiska alignment-data |
| Llama-3.1-Nemotron-70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1 % |
| Llama-Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama-Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | NAS-komprimering från Llama 3.1 8B |
| Llama-Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Från Llama 3.3 70B |
| Llama-Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Från Llama 3.1 405B; GPQA 76,0 % |
| Nemotron-H 8B | 2025 | 8B / 8B | — | Hybrid Mamba-Transformer | 15T token; 24 Mamba-2 + 24 MLP + 4 Attn |
| Nemotron-H 56B | 2025 | 56B / 56B | — | Hybrid Mamba-Transformer | 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn |
| Nemotron-H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hybrid Mamba-Transformer | MiniPuzzle från 56B; +20 % hastighet |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hybrid Mamba-Transformer | 20T token; Minitron-destillation |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hybrid Mamba-Transformer MoE | 25T token; 128 experter, 6 aktiva |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hybrid LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hybrid LatentMoE | MTP; NVFP4 |
Nemotron-4 15B
Arkitektur: 32 lager, hidden dimension 6144, 48 uppmärksamhetshuvuden, 8 KV-huvuden (GQA). Totalt antal parametrar — 15 miljarder (3,2 miljarder embedding + 12,5 miljarder non-embedding). Resultat: MMLU — 64,2 % (5-shot), BBH — 58,7 % (3-shot), GSM8K — 46,0 % (8-shot, maj@1), HumanEval — 31,6 % (0-shot, pass@1). På flerspråkiga benchmark (XCOPA, TyDiQA-GoldP, MGSM) överträffade modellen modeller som är fyra gånger större.[8]
Nemotron-4 340B
Arkitektur: 96 lager, hidden dimension 18 432, 96 uppmärksamhetshuvuden, 8 KV-huvuden.
Nemotron-4 340B Base visade: MMLU — 81,1 % (5-shot), BBH — 85,4 % (3-shot), HumanEval — 57,3 % (0-shot), ARC-Challenge — 94,3 % (25-shot).[3]
Nemotron-4 340B Instruct genomgick flerstegsanpassning: Code SFT → General SFT → DPO → RPO (3 omgångar). Resultat: MT-Bench — 8,22 (GPT-4-Turbo judge), MMLU — 78,7 % (0-shot), GSM8K — 92,3 % (0-shot), HumanEval — 73,2 % (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]
Nemotron-4 340B Reward ersätter det slutliga softmax-lagret med en linjär projektion av det dolda tillståndet i det sista lagret till en vektor med 5 HelpSteer2-attribut. Den slutliga belöningen är en viktad summa av fem attribut. Träningen genomfördes under 2 epoker på HelpSteer2-data (batch size 128). På RewardBench uppnådde modellen 92,0 %, vilket överträffade GPT-4o (84,7 %), Gemini 1.5 Pro (88,1 %) och Claude-3-Opus (80,7 %) vid publiceringstillfället.[3]
| Modell | Arena Hard | AlpacaEval 2.0 LC | MT-Bench |
|---|---|---|---|
| Nemotron-4-340B-Instruct | 54,2 | 41,5 % | 8,22 |
| Llama-3-70B-Instruct | 41,1 | 34,4 % | 8,16 |
| Mixtral-8x22B-Instruct | 36,4 | 30,9 % | 7,63 |
| Qwen-2-72B-Instruct | 48,1 | 38,8 % | 8,26 |
Källa: arXiv:2406.11704, tabell 5.[3]
Llama-3.1-Nemotron-70B
Llama-3.1-Nemotron-70B-Reward tränas med en hybridmetod som kombinerar Bradley-Terry (parvis preferens) och SteerLM-regression (flerattributbedömning på Likert-skala). Träningen genomfördes uteslutande på HelpSteer2-data (CC-BY-4.0). På RewardBench uppnådde modellen 94,1 % och intog 1:a plats vid publiceringstillfället.[10]
Llama-3.1-Nemotron-70B-Instruct anpassas med RLHF-metoden och algoritmen REINFORCE (inte PPO) samt belöningsmodellen Nemotron-70B-Reward. Infrastrukturen är NeMo-Aligner med TRT-LLM-acceleration.[9]
Llama-Nemotron: Nano, Super, Ultra (2025)
En familj av resonerande modeller, härledda från Llama 3.x med hjälp av NAS, destillation och utökad efterträning.[11]
| Modell | Parametrar | Basmodell | Kontext |
|---|---|---|---|
| Llama-Nemotron-Nano 8B | 8 miljarder | Llama-3.1-8B-Instruct | 128K |
| Llama-Nemotron-Nano 4B | 4 miljarder | Minitron 4B (från Llama 3.1 8B) | 128K |
| Llama-Nemotron-Super 49B | 49 miljarder | Llama-3.3-70B → NAS (Puzzle) | 128K |
| Llama-Nemotron-Ultra 253B | 253 miljarder | Llama-3.1-405B → NAS (Puzzle) | 128K |
Femstegs träningspipeline: (1) NAS + FFN Fusion, (2) destillation + fortsatt förträning, (3) SFT (inklusive resonemangsspår från DeepSeek-R1), (4) storskalig RL (GRPO för Ultra, REINFORCE/RLOO + Online RPO för Nano), (5) dialoganpassning.[11]
Modellerna var de första bland öppna LLM att stödja omkopplingsbart resonemangssätt (reasoning toggle): när det är aktiverat («detailed thinking on» i systemprompt) genererar modellen en resoneringskedja i taggarna <think>...</think> före svaret; när det är inaktiverat svarar modellen direkt.[11]
Resultat för Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Till jämförelse: DeepSeek-R1 (671B totalt / 37B aktiva) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra ryms på en enda nod med 8×H100.[11]
Nemotron-H (april 2025)
En familj av täta hybrida modeller, tränade från grunden och utformade för uppgifter med långa genereringar. Nemotron-H-56B tränas på 20 biljoner token i FP8 — ett av de största offentliga experimenten med FP8-förträning. Nemotron-H-47B erhålls genom komprimering av 56B med metoden MiniPuzzle (63 miljarder destillationstoken) och ryms i minnet på ett enda RTX 5090 (FP4) med ett kontextfönster på ~1M token.[12]
| Benchmark | Nemotron-H-56B | Nemotron-H-47B | Qwen-2.5-72B | Llama-3.1-70B |
|---|---|---|---|---|
| MMLU-Pro (5-shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5-shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8-shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0-shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Källa: arXiv:2504.03624.[12]
Vid generering med 65 536 indata- och 1024 utdatatoken på H100 var Nemotron-H-47B 2,9 gånger snabbare än Qwen-2.5-72B och Llama-3.1-70B.[12]
Nemotron Nano 2 (augusti 2025)
En hybrid Mamba-Transformer-modell för resonemang. Nemotron-Nano-12B-v2-Base — föräldramodellen med 62 lager (huvudsakligen Mamba-2 + MLP + 4 uppmärksamhetslager), tränad på 20 biljoner token i FP8 från grunden. Från denna modell erhålls Nemotron-Nano-9B-v2 med den utökade Minitron-metoden; den kan köras med ett kontextfönster på 128K token på en enda GPU NVIDIA A10G (22 GB, BF16). Efterträning: SFT (80 miljarder token, inklusive spår från DeepSeek-R1-0528) → GRPO → DPO → RLHF. På resonemangsbenchmark är modellen jämförbar med Qwen3-8B i noggrannhet, men uppnår 3–6 gånger snabbare generering vid långa utdatasekvenser.[13]
Nemotron 3 Nano 30B-A3B
Släpptes i december 2025. Parametrar: 31,6 miljarder totalt, 3,2 miljarder aktiva. Arkitektur: 52 lager, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 dirigerade experter + 1 gemensam, 6 aktiva per token. Kontext — upp till 1 048 576 token. Träning på 25 biljoner token (WSD-schema, batch size 3072, datautsnitt — juni 2025) i två faser: Fas 1 — 23,5 biljoner (varierade data), Fas 2 — 1,5 biljoner (högkvalitativa data) + 121 miljarder token long-context CPT.[2]
| Benchmark | Nemotron 3 Nano 30B-A3B | Qwen3-30B-A3B-Thinking | GPT-OSS-20B |
|---|---|---|---|
| MMLU-Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE-Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena-Hard-V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER-100 @ 1M | 86,34 | 77,5 | — |
* — värden från sekundära källor; reproduktionsvillkor — NeMo Evaluator SDK. Källa: arXiv:2512.20848.[2][28]
Genomströmning (8K indata / 16K utdata, single H200): 3,3 gånger högre än Qwen3-30B-A3B-Thinking och 2,2 gånger högre än GPT-OSS-20B.[2]
Ytterligare modeller och inriktningar
- OpenReasoning-Nemotron (juli 2025) — en serie modeller med 1,5B–32B parametrar, baserade på Qwen 2.5 och finjusterade på data från DeepSeek-R1-0528. Varianten 32B med GenSelect@64 överträffar o3 (high) på ett antal matematiska benchmark.[29]
- Nemotron Elastic (arXiv:2511.16664) — ett ramverk för inbäddade delmodeller (6B, 9B, 12B) inom en enda föräldramodell, vilket sänker träningskostnaden 360 gånger jämfört med träning från grunden.[30]
- Nemotron-CrossThink — ett ramverk för multidomain förstärkningsinlärning utanför matematiska uppgifter, vilket gav +30,1 % på MATH-500 och +12,8 % på MMLU-PRO.[31]
- Nemotron-UltraLong — kontextutvidgning upp till 4 miljoner token.[32]
- Jet-Nemotron — eftertränings-NAS för kompakta hybrida modeller 2B/4B.[33]
Specialiserade modeller
I Nemotron-ekosystemet finns även modeller för specialiserade uppgifter:
- Nemotron Nano V2 VL — en vision-language-modell för OCR, tabellbehandling och video.[34]
- Nemotron Parse 1.1 — en modell för OCR och extraktion av dokumentstruktur.[35]
- Nemotron ColEmbed V2 — en embedding-modell för visuell dokumentsökning (late interaction).[36]
- Nemotron Speech — modeller för automatisk taligenkänning (ASR), talsyntes (TTS) och maskinöversättning (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — en klassificeringsmodell för osäkert innehåll i 23 kategorier på 9 språk med en noggrannhet på 84,2 %.[37]
Data för förträning
Sammansättning av data i Nemotron-4
Förträningskorpusen för Nemotron-4 15B och 340B består av tre huvudkategorier: engelska texter (70 %), flerspråkiga texter på 53 språk (15 %) och källkod på 43 programmeringsspråk (15 %). Deduplicering på dokumentnivå (exakt och nära-duplikat) tillämpades, liksom filtrering med hjälp av språkmodeller och heuristiker. Modellen 15B tränas på 8 biljoner token, modellen 340B på 9 biljoner (8 biljoner förträning + 1 biljon fortsatt träning med omviktning av högkvalitativa källor).[8][3]
Nemotron-CC
Datamängden Nemotron-CC skapas från Common Crawl med hjälp av ett ensemble av kvalitetsklassificerare och syntetisk omformulering av texter. Den totala volymen är 6,3 biljoner token (4,4 biljoner deduplicerade + 1,9 biljoner syntetiska omformuleringar). Pipelinen är integrerad i verktyget NeMo Curator. Arbetet antogs som Long Paper på konferensen ACL 2025.[38]
Nemotron-CC-Math
En matematikfokuserad delmängd på 133 miljarder token, extraherad från Common Crawl med hjälp av Lynx + LLM-pipeline med bevarad struktur för matematiska formler och kod i LaTeX.[39]
Data för Nemotron 3 Nano
Förträning av Nemotron 3 Nano genomfördes på 25 biljoner token. Datamängden inkluderar: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1 och specialiserade STEM-datamängder. För long-context-träning användes ytterligare 121 miljarder token CPT.[2]
Nemotron Pretraining Dataset v1
En syntetiskt genererad datamängd som täcker STEM, akademiska texter, resoneringsuppgifter och flerspråkiga domäner; den innehåller mer än 10 biljoner språktoken och 18 miljoner SFT-exempel. Alla datamängder distribueras under öppna tillåtande licenser.[40]
Pipeline för syntetisk datagenerering (SDG)
Pipelinen som beskrivs i den tekniska rapporten om Nemotron-4 340B inkluderar följande steg[3]:
- Promptgenerering: syntetiska en- och tvåvändiga förfrågningar, genererade med hjälp av Mixtral-8x7B-Instruct-v0.1 (licens Apache 2.0) enligt mallarna Open QA, Writing, Closed QA, Math & Coding.
- Svarsgenerering: flera svar från mellanversioner av modellerna för att säkerställa mångfald.
- Kvalitetsbedömning: tre metoder — Ground-Truth-as-a-Judge (för uppgifter med verifierbart svar), LLM-as-Judge (parvis svarsjämförelse med hjälp av en språkmodell), Reward-Model-as-Judge (användning av Nemotron-4-340B-Reward).
- Iterativ anpassning från svaga till starka modeller (weak-to-strong).
Från ~20 000 mänskligt annoterade exempel (10 000 för SFT, 10 000 HelpSteer2 för belöningsmodellen) syntetiserades hela den återstående volymen av anpassningsdata.[3]
Kvantisering och inferensoptimering
Nemotron 3 Nano-modellerna stöder Post-Training Quantization (PTQ) i FP8 med hjälp av ModelOpt och Megatron-LM. Selektiv kvantisering tillämpas — uppmärksamhetslager och delar av Mamba behålls i BF16 för att bevara kvaliteten; övriga kvantiseras till FP8. Enligt den tekniska rapporten ger detta ~99 % noggrannhetsbevarandegrad.[2] Nano stöder också inferens i NVFP4-formatet.[1]
Sammanfattande benchmark-tabell per generation
| Modell | MMLU | GSM8K | HumanEval | Arena Hard | MT-Bench | Villkor |
|---|---|---|---|---|---|---|
| Nemotron-4 15B | 64,2 % | 46,0 % | 31,6 % | — | — | base; 5-/8-/0-shot |
| Nemotron-4 340B Base | 81,1 % | — | 57,3 % | — | — | 5-/—/0-shot |
| Nemotron-4 340B Instruct | 78,7 % | 92,3 % | 73,2 % | 54,2 | 8,22 | 0-shot |
| Llama-3.1-Nemotron-70B-Instruct | — | — | — | 85,0 | 8,98 | okt. 2024 |
| LN-Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0 %, AIME 80,8 % |
| Nemotron-H-47B | 83,6 % | 93,3 % | 61,0 % | — | — | 5-/8-CoT/0-shot |
| Nemotron 3 Nano (30B-A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1 %, LCB 68,3 % |
Jämförelsen bör tolkas med försiktighet: utvärderingsvillkor, benchmark-versioner och testdatum skiljer sig åt mellan generationerna. Resultaten är hämtade från NVIDIAs tekniska rapporter; oberoende utvärderingar kan avvika (se avsnittet «Begränsningar»).[8][3][9][11][12][2]
Tillämpningar
Driftsättning via NVIDIA NIM
NVIDIA NIM — en uppsättning optimerade containerbaserade mikrotjänster för inferens med ett OpenAI-kompatibelt API. Nemotron-modellerna finns tillgängliga som NIM-mikrotjänster på plattformen build.nvidia.com. NIM stöder formaten FP8, BF16, NVFP4 och driftsättning via Helm-diagram på Kubernetes. Modellerna är även kompatibla med oberoende ramverk: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]
Syntetisk datagenerering
Nemotron-4 340B är utformad för användning som generator av syntetiska data: Instruct-modellen genererar svar, Reward-modellen utvärderar och filtrerar dem. NVIDIA Open Model License tillåter uttryckligen användning av modellens utdata för träning av andra modeller. Enligt ServiceNow härstammar 15 % av förträningsdata för deras modell Apriel 1.6 från Nemotron-datamängder.[3][15][41]
Agentbaserade system
Modellerna i Nemotron 3-familjen (Nano, Super, Ultra) är utformade för multiagentarbetsbelastningar: planering, retrieval, verktygsanrop (tool use). Nemotron 3 Nano uppnår 38,76 % på SWE-Bench (med OpenHands) och 49,04 % (avg) på TauBench V2.[2]
Företagsimplementeringar
Bland de uttalade partnerna finns: ServiceNow (gemensam modell Apriel Nemotron 15B för automatisering av arbetsflöden), CrowdStrike (plattformen Charlotte AI), Perplexity (förfrågningsrouting), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modellerna finns tillgängliga på AWS Amazon Bedrock; stöd för Google Cloud, CoreWeave och Nebius planeras.[15]
Begränsningar och öppna problem
Oberoende utvärderingar och avvikelser från NVIDIAs uppgifter
Oberoende utvärderingar avslöjar avvikelser från de resultat som NVIDIA redovisar. Enligt Artificial Analysis (februari 2026) fick Llama-Nemotron-Ultra 253B (reasoning) ett Intelligence Index-värde på 15, mot ett median på 26 för modeller av jämförbar storlek. På plattformen Chatbot Arena (LMArena) intog Nemotron-modellerna mellanplaceringar: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147:e plats), Nemotron 3 Nano — 1317 ±6 (~164:e plats).[42][43]
Ordrikedom
Nemotron-modellerna uppvisar förhöjd ordrikedom: vid utvärdering av Artificial Analysis genererade Nemotron 3 Nano 140 miljoner token (mot ett median på 12 miljoner för andra modeller), vilket ökar inferenskostnaden. En analys från DEV Community visade att Llama-3.1-Nemotron-70B-Instruct, trots formellt ledarskap på automatiska benchmark, uppvisade otillräcklig noggrannhet i ett antal praktiska uppgifter, och att höga poäng på Arena-liknande benchmark kan ha berott på preferensen för ordrika och självsäkra, men inte nödvändigtvis exakta svar.[42][44]
Hallucineringar och bias
NVIDIA anger i modellkorten att modellerna kan «förstärka fördomar och generera toxiska svar, särskilt vid toxiska promptar», samt «producera felaktig information och utelämna viktiga detaljer». Öppenhet avseende vikter och data möjliggör extern revision.[11][13]
Beräkningskrav
Täta modeller (Nemotron-4 340B) kräver ett kluster med 768 DGX H100-noder för fullständig träning, vilket begränsar reproducerbarheten för akademiska grupper utan tillgång till likvärdig infrastruktur. Lång kontext (1M) vid inferens kräver avsevärd VRAM-kapacitet.[3][2]
Degradering vid kontextutvidgning
Vid utvidgning av kontexten till mycket långa sekvenser observerades en försämring av resultaten på benchmark med kort kontext.[32]
Kvantisering av hybrida arkitekturer
Användning av extremt låg bitbredd (FP8/NVFP4) i Mamba-Transformer-arkitekturer leder till en liten försämring av noggrannheten (~1 % på ett antal benchmark). Detta problem löses med selektiv kvantisering, vilket komplicerar kompilatorarkitektur och inferensservrar.[2][1]
Övriga öppna problem
- Beroende av benchmark med möjlig kontaminering av träningsdata.
- Avsaknad av standardiserade protokoll för jämförelse av hybrida SSM-Transformer-arkitekturer med rena Transformer-modeller.
- Frågan om skalbarhet hos MoE-metoden för uppgifter som kräver djupt resonemang med ett litet antal aktiva experter per token.
- Data om Super/Ultra per december 2025 är preliminära; fullständiga benchmark väntas efter release.[1]
Etiska och regulatoriska aspekter
Säkerhet i utvecklingsfasen
Under utvecklingsfasen tillämpas: utvärdering enligt AEGIS-ramverket (13 kategorier för innehållssäkerhet), sårbarhetsskannern garak, manuell «röd-teamning» (red-teaming).[37]
Säkerhet vid inferens
NeMo Guardrails — ett öppet verktygsset (licens Apache 2.0) som lägger till programmerbara barriärer till LLM-system. Mikrotjänsten fångar upp indata och utdata och tillämpar konfigurerbara kontroller: ämneskontroll, PII-detektering, verifiering av RAG-förankring, detektering av jailbreak-attacker (inklusive skydd mot kodinjektioner baserat på YARA), flerspråkig multimodal säkerhetsklassificering.[45]
För Nemotron 3 har en datamängd med ~11 000 märkta OpenTelemetry-spår från realistiska scenarier med verktygsanvändning publicerats, avsedd för utvärdering av agentsäkerhet.[1]
Licensiering
| Modeller | Licens |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron-4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama-Nemotron (Nano/Super/Ultra) | Llama Community License (ärvd från Meta) |
| Nemotron-3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License tillåter kommersiell användning, skapande och distribution av derivatverk, kräver ingen attribution (vid bevarande av NOTICE-filen), ställer inga begränsningar på antalet användare och tillåter uttryckligen användning av modellens utdata för träning av andra modeller.[46] Modeller baserade på Llama ärver Metas begränsningar, inklusive tröskeln på 700 miljoner månatliga aktiva användare.[11]
För Nemotron 3 Nano har NVIDIA publicerat: modellvikter, mer än 10 biljoner token träningsdata, träningsrecept, kodbaser (NeMo, Megatron-LM, NeMo-Aligner) och mer än 10 miljöer för förstärkningsinlärning med 900 000+ uppgifter.[1][2]
Framtidsperspektiv och forskningsinriktningar
Kommande releaser inkluderar Nemotron 3 Super (~100 miljarder parametrar, ~10 miljarder aktiva) och Nemotron 3 Ultra (~500 miljarder, ~50 miljarder aktiva), förväntade under första halvåret 2026. Båda modellerna kommer att använda LatentMoE, MTP och träning i NVFP4-format på Blackwell-arkitekturen.[1]
NVIDIAs strategiska inriktning är att positionera Nemotron inte som en enstaka modell, utan som ett infrastrukturlager för multiagentsystem, där olika modeller i familjen används för olika uppgifter med routing baserat på komplexitet.[1][15]
Huvudsakliga forskningsinriktningar:
- Utveckling av hybrida arkitekturer — vidare integration av SSM-lager med uppmärksamhetsmekanismen för skalbar lång kontext.[12]
- Flernivåmetoder för komprimering — vidareutveckling av Minitron, Puzzle, MiniPuzzle och Nemotron Elastic.[20][21][30]
- Multidomain förstärkningsinlärning — Nemotron-CrossThink för utvidgning av RL utanför matematiska uppgifter.[31]
- Kontextutvidgning — Nemotron-UltraLong upp till 4 miljoner token.[32]
- Multimodalitet — utvidgning till vision-language (Nemotron VL), tal (Nemotron Speech), visuell dokumentsökning (Nemotron ColEmbed V2).[34][35][36]
- Kompakta hybrida modeller — Jet-Nemotron (NAS för modeller 2B/4B).[33]
- Öppna recept — publicering av fullständiga träningsrecept och data för reproduktion och anpassning av gemenskapen.[14]
Se även
- Transformer-arkitekturen
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta:s modellfamilj)
Referenser
- NVIDIA Research — Nemotron 3-sida: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — Nemotron-dokumentation: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Litteratur
- NVIDIA. Nemotron-3-8B-Base-4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron-4 15B Technical Report. arXiv:2402.16819, februari 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron-4 340B Technical Report. arXiv:2406.11704, juni 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open-source Dataset for Training Top-Performing Reward Models. arXiv:2406.08673, juni 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, juli 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation-Based NAS for Inference-Optimized LLMs. arXiv:2411.19146, november 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward-aware Preference Optimization. arXiv:2502.00203, januari 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models. arXiv:2504.03624, april 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama-Nemotron: Efficient Reasoning Models. arXiv:2505.00949, maj 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, augusti 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron-CC-Math. arXiv:2508.15096, augusti 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, november 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, december 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, december 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Noter
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/