Nemotron (NVIDIA) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — rodina velkých jazykových modelů (Large Language Model, LLM) s otevřenými váhami, vyvinutá oddělením Applied Deep Learning Research (ADLR) korporace NVIDIA. Modely patří do oblasti strojového učení a zpracování přirozeného jazyka (Natural Language Processing, NLP) a jsou určeny pro široké spektrum úloh: syntetickou generaci dat, logické odvozování (reasoning), agentní aplikace (agentic AI) a nasazení na průmyslovém hardwaru NVIDIA. Rodina sdružuje modely různých architektur a měřítek: od 4 miliard do ~500 miliard parametrů, včetně hustých (dense) decoder‑only Transformer‑modelů série Nemotron‑4 (2024), hybridních Mamba‑Transformer (Nemotron‑H, 2025) a hybridních Mamba‑Transformer s Mixture-of-Experts (MoE) v sérii Nemotron 3 (2025). K březnu 2026 rodina čítá více než 20 modelů pokrývajících úlohy generování textu, usuzování, vizuálního porozumění dokumentům, extrakce informací a hodnocení kvality odpovědí. Modely jsou vydávány převážně s otevřenými váhami pod licencemi NVIDIA Open Model License a Llama Community License.[1][2][3]

Historie a předpoklady

Vývoj rodiny Nemotron probíhá v kontextu strategie NVIDIA zaměřené na vytvoření kompletního zásobníku nástrojů pro generativní umělou inteligenci: od tréninkové infrastruktury (DGX, superpočítače na bázi GPU H100/B200) přes platformy pro trénování (NeMo Framework), zarovnání (NeMo‑Aligner), nasazení (NIM — NVIDIA Inference Microservices) až po zajištění bezpečnosti (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

První veřejně dostupný model série — dekodérový Transformer s 8 miliardami parametrů a kontextem 4096 tokenů, trénovaný na 3,8 bilionu tokenů na 53 přirozených a 37 programovacích jazycích. Trénování proběhlo na 1024 GPU A100 po dobu 19 dní. Formální technická zpráva na arXiv nebyla zveřejněna. Model byl distribuován prostřednictvím NeMo Framework a Hugging Face, existovaly varianty Chat (SFT a SteerLM). Licence — NVIDIA AI Foundation Models Community License.[6][7]

Poznámka k názvům: „Nemotron‑3" z roku 2023 a „Nemotron 3" z prosince 2025 jsou odlišné modely. První byl raným prototypem, druhý je aktuální generací s architekturou MoE.

Nemotron‑4 15B (únor 2024)

První veřejně zdokumentované vydání série Nemotron‑4 — model s 15 miliardami parametrů, trénovaný na 8 bilionech tokenů po dobu ~13 kalendářních dní na 384 uzlech DGX H100 (až 3072 GPU). Byl použit 8‑násobný tenzorový paralelismus a datový paralelismus od 96 do 288. Vrcholová MFU (Model FLOPs Utilization) dosáhla 34,3 % při batch size 384. Architektura — decoder‑only Transformer s Grouped‑Query Attention (GQA) a Rotary Position Embeddings (RoPE). Podle výsledků benchmarků v době publikace model překonával všechny srovnatelně velké otevřené modely ve vícejazyčných úlohách, včetně řady modelů čtyřikrát větších.[8]

Nemotron‑4 340B (červen 2024)

V červnu 2024 byl vydán největší model série Nemotron‑4 — 340 miliard parametrů (331,6 mld. ne‑embeddingových), předtrénovaný na 9 bilionech tokenů (8 bld. předtrénování + 1 bld. pokračující trénování s převzorkováním vysoce kvalitních zdrojů). Trénování probíhalo na 768 uzlech DGX H100 (až 6144 GPU) s vrcholovou MFU 42,4 %, od prosince 2023 do května 2024. Rodina zahrnuje tři varianty: Base, Instruct a Reward. Velikost modelu byla zvolena tak, aby se vešel na jeden uzel DGX H100 (8 GPU) při nasazení ve formátu přesnosti FP8. Více než 98 % dat použitých při zarovnání (alignment) bylo synteticky vygenerováno samotnými modely série v iterativním procesu; pipeline syntetické generace dat je otevřena k reprodukci.[3]

Llama‑3.1‑Nemotron‑70B (říjen 2024)

V říjnu 2024 byly vydány modely doladěné z Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct a Llama‑3.1‑Nemotron‑70B‑Reward. K 1. říjnu 2024 model Instruct obsadil 1. místo současně na třech automatických benchmarcích: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Model Reward dosáhl 94,1 % na RewardBench.[9][10]

Přechod na hybridní architektury (2025)

V roce 2025 se série rozšířila o hybridní architektury kombinující vrstvy Mamba‑2 (State Space Model, SSM — model prostoru stavů) a Transformer. V březnu–květnu 2025 byla vydána rodina uvažovacích modelů Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) s přepínatelným režimem uvažování.[11] V dubnu 2025 byl zveřejněn Nemotron‑H (arXiv:2504.03624) — rodina hybridních Mamba‑Transformer modelů o velikostech 8B, 56B a 47B parametrů.[12] V srpnu 2025 byl představen Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]

Nemotron 3 (prosinec 2025)

15. prosince 2025 bylo oznámeno třetí pokolení — rodina Nemotron 3 s modely Nano, Super a Ultra, kombinující architektury Mamba‑2, Transformer a MoE s kontextovým oknem až 1 milion tokenů. Nano byla vydána s technickou zprávou; Super a Ultra jsou naplánovány na první polovinu roku 2026.[1][2][14][15]

Teoretické základy

Architektura Transformer v Nemotron‑4

Modely série Nemotron‑4 jsou postaveny na standardní architektuře dekodérového Transformer s kauzální pozorností. Pravděpodobnost sekvence tokenů x1,x2,,xT se faktorizuje jako:

p(x1,,xT)=t=1Tp(xtx1,,xt1;heta),

kde heta jsou parametry modelu.[8]

Mechanismus pozornosti je implementován ve variantě Grouped‑Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKopdk)V,

kde Q,K,V jsou matice dotazů, klíčů a hodnot; dk je dimenze hlavy pozornosti.

Pro kódování pozic jsou použity Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmheta1xm(2)sinmheta1xm(1)sinmheta1+xm(2)cosmheta1),

kde xm je vektor v pozici m, hetai=100002i/d, d je dimenze vektoru.

V MLP‑vrstvách se používá aktivace Squared ReLU: f(x)=(max(0,x))2, zajišťující řídkost aktivací. Modely neobsahují posuvy (bias), nepoužívají dropout a matice vstupních a výstupních vložení nejsou vzájemně svázány (untied embeddings). Tokenizátor — SentencePiece BPE se zachováním mezer, znakovou segmentací číslic a bajtovým fallback, velikost slovníku — 256 000.[8][3]

Architekturní parametry Nemotron‑4
Parametr Nemotron‑4 15B Nemotron‑4 340B
Počet parametrů 15 mld (3,2 mld embed.) 340 mld (9,4 mld embed.)
Počet vrstev 32 96
Skrytá dimenze 6144 18 432
Hlavy pozornosti 48 96
KV‑hlavy (GQA) 8 8
Délka kontextu 4096 4096
Velikost slovníku 256 000 256 000

Zdroje: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Hybridní architektura Mamba‑Transformer (Nemotron‑H)

V modelech Nemotron‑H jsou standardní bloky vlastní pozornosti částečně nahrazeny bloky Mamba‑2 — modely prostoru stavů (State Space Models, SSM). Při autoregresivní generaci každá vrstva vlastní pozornosti vyžaduje O(n) operací a paměti na krok (kvůli KV‑cache), zatímco vrstvy Mamba zajišťují konstantní paměťové a výpočetní náklady na každý generovaný token.[12]

Mamba‑2 je popsána rekurentním vztahem[18]:

ht=Aht1+Bxt,yt=Cht,

kde htN je skrytý stav, ANimesN je diagonální matice přechodu stavů, BNimes1 a C1imesN jsou projekční matice, xt je vstupní token, yt je výstupní signál. V Mamba‑2 matice A, B, C závisí na vstupu (input‑dependent), což odlišuje model od klasických lineárních SSM.

V Nemotron‑H‑56B se používá 54 vrstev Mamba‑2 + 54 MLP‑vrstev + 10 vrstev vlastní pozornosti, přičemž vrstvy pozornosti jsou rovnoměrně rozmístěny mezi Mamba‑vrstvami. Model byl trénován na 20 bilionech tokenů ve formátu FP8 (per‑tensor scaling) na 6144 GPU H100. Verze Nemotron‑H‑8B obsahuje 24 vrstev Mamba‑2, 24 MLP‑vrstev a 4 vrstvy vlastní pozornosti; trénování proběhlo na 15 bilionech tokenů.[12]

Architektura MoE v Nemotron 3

Modely Nemotron 3 (prosinec 2025) kombinují tři architekturní komponenty: Mamba‑2, Transformer a Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) obsahuje 52 vrstev: 23 vrstev Mamba‑2 + MoE, 23 vrstev MoE a 6 vrstev GQA‑pozornosti. Každá MoE‑vrstva zahrnuje 128 směrovaných (routed) expertů + 1 sdílený (shared) expert, z nichž 6 expertů je aktivováno na každý token. Směrování provádí trénovatelný MLP‑router se sigmoid gating. Vyvažování zátěže je realizováno bez pomocné ztrátové funkce (aux‑loss‑free). Celkový počet parametrů je 31,6 miliardy, ale aktivních na každý token je pouze 3,2 miliardy.[2]

Normalizace — RMSNorm[19]. Poziční embeddingy v částech Mamba nejsou přítomny (poziční informace je implicitní ve stavu SSM). Používají se nespojené embeddingy, absence dropout a bias v lineárních vrstvách.[2]

Rozšíření v Super/Ultra: LatentMoE a Multi‑Token Prediction

Modely Super a Ultra z rodiny Nemotron 3 využívají dvě dodatečné architekturní inovace:

  • Latent MoE (LatentMoE) — projekce vstupní reprezentace do latentního prostoru menší dimenze před směrováním, což umožňuje zvýšit počet expertů při srovnatelných výpočetních nákladech a zvýšit přesnost bez snížení propustnosti.[1]
  • Multi‑Token Prediction (MTP) — předpovídání více následujících tokenů najednou, používané ke zlepšení kvality dlouhých textů a spekulativního dekódování při inferenci.[1]

Trénování modelů Super a Ultra probíhá ve formátu NVFP4 — 4bitovém číselném formátu NVIDIA na architektuře Blackwell.[1]

Metody komprese modelů: Minitron, Puzzle, MiniPuzzle

Pro tvorbu kompaktních modelů NVIDIA využívá několik přístupů:

  • Minitron — metoda strukturovaného prořezávání (pruning) a destilace znalostí (knowledge distillation). Zkoumají se dva druhy prořezávání: po hloubce (odstraňování vrstev) a po šířce (společné zmenšení dimenzí skrytých vrstev, hlav pozornosti a MLP‑projekcí). Použití Minitron na Nemotron‑4 15B umožňuje získat modely 8B a 4B se snížením nákladů na trénování až 40krát v porovnání s trénováním od nuly.[20]
  • Puzzle — algoritmus Neural Architecture Search (NAS), který vybírá optimální konfiguraci každého bloku (počet KV‑hlav, velikost FFN, přítomnost/absence pozornosti) s blokovitou destilací. Právě tak byl Llama 3.1 405B komprimován na 253B (Llama‑Nemotron Ultra) a Llama 3.3 70B na 49B (Llama‑Nemotron Super).[21]
  • MiniPuzzle — rozšíření Puzzle pro hybridní architektury, které zkomprimovalo Nemotron‑H‑56B na 47B s nákladem pouhých 63 miliard tokenů destilace. Při srovnatelné přesnosti komprimovaný model generuje o 20 % rychleji.[12]

Metody zarovnání

HelpSteer a HelpSteer2

HelpSteer — sada 37 120 příkladů (licence CC‑BY‑4.0), vytvořená ve spolupráci se Scale AI, kde je každá odpověď anotována podle pěti atributů: užitečnost (helpfulness), správnost (correctness), soudržnost (coherence), složitost (complexity) a mnohomluvnost (verbosity) na Likertově škále 0–4.[22]

HelpSteer2 — aktualizovaná sada 21 362 příkladů (10 681 promptů × 2 odpovědi), kde více než 95 % promptů pochází ze ShareGPT (skutečné uživatelské dotazy). Přibližně 50 % anotací bylo odfiltrováno jako nedostatečně kvalitní. Rozšíření HelpSteer2‑Preference přidává párové preference anotátorů, což umožňuje trénovat jak regresní, tak párové modely odměny na stejných datech.[23][24]

SteerLM

SteerLM — metoda SFT (Supervised Fine‑Tuning — doučování s učitelem) s podmíněním na atributy (helpfulness, correctness, coherence, complexity, verbosity), umožňující uživateli řídit styl odpovědi při inferenci. Pipeline zahrnuje: (1) trénování modelu predikce atributů (APM) na HelpSteer, (2) anotování dat pomocí APM, (3) SFT s podmíněním na cílové hodnoty atributů, (4) bootstrapping.[25]

DPO a RPO

DPO (Direct Preference Optimization) — metoda přímé optimalizace preferencí bez explicitního modelu odměny, používaná v pipeline Nemotron‑4 340B Instruct a Nemotron Nano 2.[26]

RPO (Reward‑aware Preference Optimization) — unifikovaný matematický framework NVIDIA, zobecňující DPO, IPO, SimPO, REINFORCE a SteerLM 2.0 jako speciální případy. RPO minimalizuje vzdálenost mezi předpověďmi implicitního modelu odměny a cílovým explicitním modelem[27]:

extRPO(heta)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπheta(yw|x)πextref(yw|x)βlogπheta(yl|x)πextref(yl|x))],

kde rϕ je explicitní model odměny, πheta je trénovaná politika, πextref je referenční politika, d(,) je funkce vzdálenosti, yw/yl je preferovaná/odmítnutá odpověď. RPO je použito při trénování Nemotron‑4 340B Instruct a modelů Llama‑Nemotron.[27][3][11]

Víceenvironmentní učení zpětnou vazbou (RLVR)

V Nemotron 3 je použit Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — simultánní trénování v několika prostředích v rámci NeMo Gym: soutěžní matematika, programování, QA, tool‑use, instruction‑following, long‑context. Algoritmus — GRPO (Group Relative Policy Optimization) s masked importance sampling.[2][14]

Nemotron 3 podporuje granulární řízení rozpočtu uvažování (reasoning budget control): uživatel může nastavit limit tokenů pro thinking trace prostřednictvím příznaku v chat template (přepínání „detailed thinking on/off" nebo omezení délky).[2]

Řada modelů

Přehledná tabulka

Model Rok Celkový / Aktivní počet parametrů Kontext Architektura Klíčové vlastnosti
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3,8T tokenů; 1024 GPU A100; 19 dní
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8T tokenů; MFU 34,3 %
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9T tokenů; Base/Instruct/Reward; >98 % syntet. dat alignment
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1 %
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) NAS‑komprese z Llama 3.1 8B
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Z Llama 3.3 70B
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Z Llama 3.1 405B; GPQA 76,0 %
Nemotron‑H 8B 2025 8B / 8B Hybridní Mamba‑Transformer 15T tokenů; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B Hybridní Mamba‑Transformer 20T tokenů FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) Hybridní Mamba‑Transformer MiniPuzzle z 56B; +20 % rychlost
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Hybridní Mamba‑Transformer 20T tokenů; Minitron‑destilace
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Hybridní Mamba‑Transformer MoE 25T tokenů; 128 expertů, 6 aktivních
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Hybridní LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Hybridní LatentMoE MTP; NVFP4

Nemotron‑4 15B

Architektura: 32 vrstev, hidden dimension 6144, 48 hlav pozornosti, 8 KV‑hlav (GQA). Celkový počet parametrů — 15 miliard (3,2 mld. embedding + 12,5 mld. non‑embedding). Výsledky: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). Na vícejazyčných benchmarcích (XCOPA, TyDiQA‑GoldP, MGSM) model překonával modely čtyřikrát větší.[8]

Nemotron‑4 340B

Architektura: 96 vrstev, hidden dimension 18 432, 96 hlav pozornosti, 8 KV‑hlav.

Nemotron‑4 340B Base dosáhl: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]

Nemotron‑4 340B Instruct prošel vícestupňovým zarovnáním: Code SFT → General SFT → DPO → RPO (3 kola). Výsledky: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]

Nemotron‑4 340B Reward nahrazuje finální vrstvu softmax lineární projekcí skrytého stavu poslední vrstvy do vektoru 5 atributů HelpSteer2. Výsledná odměna je váženým součtem pěti atributů. Trénování proběhlo po dobu 2 epoch na datech HelpSteer2 (batch size 128). Na RewardBench model dosáhl 92,0 %, čímž překonal GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) a Claude‑3‑Opus (80,7 %) v době publikace.[3]

Model Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54,2 41,5 % 8,22
Llama‑3‑70B‑Instruct 41,1 34,4 % 8,16
Mixtral‑8x22B‑Instruct 36,4 30,9 % 7,63
Qwen‑2‑72B‑Instruct 48,1 38,8 % 8,26

Zdroj: arXiv:2406.11704, tabulka 5.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward byl trénován hybridní metodou kombinující Bradley‑Terry (párové preference) a SteerLM‑regresi (víceatributové hodnocení na Likertově škále). Trénování proběhlo výhradně na datech HelpSteer2 (CC‑BY‑4.0). Na RewardBench model dosáhl 94,1 %, čímž obsadil 1. místo v době publikace.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct byl zarovnán metodou RLHF s algoritmem REINFORCE (ne PPO) a modelem odměny Nemotron‑70B‑Reward. Infrastruktura — NeMo‑Aligner s akcelerací TRT‑LLM.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

Rodina uvažovacích modelů získaných z Llama 3.x metodami NAS, destilace a rozšířeného dotrénování.[11]

Model Parametry Základní model Kontext
Llama‑Nemotron‑Nano 8B 8 mld Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 mld Minitron 4B (z Llama 3.1 8B) 128K
Llama‑Nemotron‑Super 49B 49 mld Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 mld Llama‑3.1‑405B → NAS (Puzzle) 128K

Pětistupňový tréninkový pipeline: (1) NAS + FFN Fusion, (2) destilace + pokračující předtrénování, (3) SFT (včetně uvažovacích tras DeepSeek‑R1), (4) rozsáhlé RL (GRPO pro Ultra, REINFORCE/RLOO + Online RPO pro Nano), (5) zarovnání pro dialog.[11]

Modely jako první z otevřených LLM podporují přepínatelný režim uvažování (reasoning toggle): při zapnutí („detailed thinking on" v systémovém promptu) model generuje řetěz úvah v tazích <think>...</think> před odpovědí; při vypnutí odpovídá přímo.[11]

Výsledky Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Pro srovnání: DeepSeek‑R1 (671B celkem / 37B aktivních) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra se vejde na jeden uzel 8×H100.[11]

Nemotron‑H (duben 2025)

Rodina hustých hybridních modelů trénovaných od nuly a navržených pro úlohy s dlouhými generacemi. Nemotron‑H‑56B byl trénován na 20 bilionech tokenů ve formátu FP8 — jeden z největších veřejných experimentů s FP8‑předtrénováním. Nemotron‑H‑47B byl získán kompresí 56B metodou MiniPuzzle (63 miliard tokenů destilace) a vejde se do paměti jedné RTX 5090 (FP4) při kontextu ~1M tokenů.[12]

Benchmark Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60,5 61,8 58,8 51,3
MMLU (5‑shot) 84,2 83,6 86,1 78,8
GSM8K (8‑shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0‑shot) 60,4 61,0 56,7 57,3

Zdroj: arXiv:2504.03624.[12]

Při generování s 65 536 vstupními a 1024 výstupními tokeny na H100 model Nemotron‑H‑47B pracoval 2,9krát rychleji než Qwen‑2.5‑72B a Llama‑3.1‑70B.[12]

Nemotron Nano 2 (srpen 2025)

Hybridní Mamba‑Transformer model pro uvažování. Nemotron‑Nano‑12B‑v2‑Base — rodičovský model s 62 vrstvami (převážně Mamba‑2 + MLP + 4 vrstvy pozornosti), trénovaný na 20 bilionech tokenů ve formátu FP8 od nuly. Z něj metodou rozšířeného Minitron byl získán Nemotron‑Nano‑9B‑v2, schopný pracovat v kontextu 128K tokenů na jednom GPU NVIDIA A10G (22 GB, BF16). Dotrénování: SFT (80 miliard tokenů, včetně tras DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Na uvažovacích benchmarcích je model srovnatelný s Qwen3‑8B z hlediska přesnosti, ale dosahuje 3–6násobného zrychlení generace při dlouhých výstupních sekvencích.[13]

Nemotron 3 Nano 30B‑A3B

Vydán v prosinci 2025. Parametry: 31,6 miliard celkem, 3,2 miliardy aktivních. Architektura: 52 vrstev, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 směrovaných expertů + 1 sdílený, 6 aktivních na token. Kontext — až 1 048 576 tokenů. Trénování na 25 bilionech tokenů (WSD‑rozvrh, batch size 3072, cutoff dat — červen 2025) ve dvou fázích: Phase 1 — 23,5 bilionu (různorodá data), Phase 2 — 1,5 bilionu (vysoce kvalitní data) + 121 miliard tokenů long‑context CPT.[2]

Benchmark Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE‑Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena‑Hard‑V2 Avg 67,65 57,8 48,55
RULER‑100 @ 1M 86,34 77,5

* — hodnoty z vedlejších zdrojů; podmínky reprodukce — NeMo Evaluator SDK. Zdroj: arXiv:2512.20848.[2][28]

Propustnost (8K vstup / 16K výstup, single H200): 3,3krát vyšší než Qwen3‑30B‑A3B‑Thinking a 2,2krát vyšší než GPT‑OSS‑20B.[2]

Doplňkové modely a směry

  • OpenReasoning‑Nemotron (červenec 2025) — série modelů s 1,5B–32B parametry, založených na Qwen 2.5 a doladěných na datech DeepSeek‑R1‑0528. Varianta 32B s GenSelect@64 překonává o3 (high) na řadě matematických benchmarků.[29]
  • Nemotron Elastic (arXiv:2511.16664) — framework vnořených podmodelů (6B, 9B, 12B) v rámci jednoho rodičovského modelu, snižující náklady na trénování 360krát v porovnání s trénováním od nuly.[30]
  • Nemotron‑CrossThink — framework vícedoménového učení s podkреплением nad rámec matematických úloh, který zajistil +30,1 % na MATH‑500 a +12,8 % na MMLU‑PRO.[31]
  • Nemotron‑UltraLong — rozšíření kontextu až na 4 miliony tokenů.[32]
  • Jet‑Nemotron — post‑tréninkový NAS pro kompaktní hybridní modely 2B/4B.[33]

Specializované modely

V ekosystému Nemotron jsou také přítomny modely pro specializované úlohy:

  • Nemotron Nano V2 VL — vision‑language model pro OCR, zpracování tabulek a videa.[34]
  • Nemotron Parse 1.1 — model pro OCR a extrakci struktury dokumentů.[35]
  • Nemotron ColEmbed V2 — model embeddingů pro vizuální vyhledávání dokumentů (late interaction).[36]
  • Nemotron Speech — modely pro automatické rozpoznávání řeči (ASR), syntézu řeči (TTS) a strojový překlad (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — model klasifikace nebezpečného obsahu ve 23 kategoriích v 9 jazycích s přesností 84,2 %.[37]

Data pro předtrénování

Složení dat Nemotron‑4

Předtréninkový korpus Nemotron‑4 15B a 340B se skládá ze tří hlavních kategorií: anglické texty (70 %), vícejazyčné texty v 53 jazycích (15 %) a zdrojový kód ve 43 programovacích jazycích (15 %). Byla použita deduplikace na úrovni dokumentů (přesná i přibližná), dále filtrování pomocí jazykových modelů a heuristik. Model 15B byl trénován na 8 bilionech tokenů, model 340B na 9 bilionech (8 bld. předtrénování + 1 bld. pokračující trénování s převzorkováním vysoce kvalitních zdrojů).[8][3]

Nemotron‑CC

Datová sada Nemotron‑CC byla sestavena z Common Crawl pomocí souboru klasifikátorů kvality a syntetického parafrázování textů. Celkový objem — 6,3 bilionu tokenů (4,4 bld. deduplikovaných + 1,9 bld. syntetických přeformulování). Pipeline je integrována do nástroje NeMo Curator. Práce byla přijata jako Long Paper na konferenci ACL 2025.[38]

Nemotron‑CC‑Math

Matematicky orientovaná podmnožina o objemu 133 miliard tokenů, extrahovaná z Common Crawl pomocí pipeline Lynx + LLM se zachováním struktury matematických vzorců a kódu v LaTeX.[39]

Data Nemotron 3 Nano

Předtrénování Nemotron 3 Nano bylo provedeno na 25 bilionech tokenů. Sada zahrnuje: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 a specializované STEM datasety. Pro long‑context trénování bylo použito dalších 121 miliard tokenů CPT.[2]

Nemotron Pretraining Dataset v1

Synteticky vygenerovaná sada pokrývající STEM, akademické texty, úlohy uvažování a vícejazyčné domény; obsahuje více než 10 bilionů jazykových tokenů a 18 milionů vzorků pro SFT. Všechny datové sady jsou distribuovány pod otevřenými permisivními licencemi.[40]

Pipeline syntetické generace dat (SDG)

Pipeline popsaná ve zprávě o Nemotron‑4 340B zahrnuje následující kroky[3]:

  • Generování promptů: syntetické jedno‑ a dvouobratkové dotazy generované pomocí Mixtral‑8x7B‑Instruct‑v0.1 (licence Apache 2.0) podle šablon Open QA, Writing, Closed QA, Math & Coding.
  • Generování odpovědí: více odpovědí od průběžných verzí modelů pro zajištění rozmanitosti.
  • Hodnocení kvality: tři přístupy — Ground‑Truth‑as‑a‑Judge (pro úlohy s ověřitelnou odpovědí), LLM‑as‑Judge (porovnání párů odpovědí jazykovým modelem), Reward‑Model‑as‑Judge (použití Nemotron‑4‑340B‑Reward).
  • Iterativní zarovnání od slabých k silným modelům (weak‑to‑strong).

Z ~20 000 příkladů anotovaných lidmi (10 000 pro SFT, 10 000 HelpSteer2 pro model odměny) byl syntetizován veškerý zbývající objem zarovnávacích dat.[3]

Kvantizace a optimalizace inference

Modely Nemotron 3 Nano podporují Post‑Training Quantization (PTQ) v FP8 s využitím ModelOpt a Megatron‑LM. Používá se selective quantization — vrstvy attention a část Mamba jsou ponechány v BF16 pro zachování kvality; ostatní jsou kvantizovány do FP8. Podle technické zprávy to zajišťuje ~99% zachování přesnosti.[2] Nano také podporuje inferenci ve formátu NVFP4.[1]

Souhrnná tabulka benchmarků podle generací

Model MMLU GSM8K HumanEval Arena Hard MT‑Bench Podmínky
Nemotron‑4 15B 64,2 % 46,0 % 31,6 % base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81,1 % 57,3 % 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78,7 % 92,3 % 73,2 % 54,2 8,22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85,0 8,98 říjen 2024
LN‑Ultra 253B (reasoning ON) GPQA 76,0 %, AIME 80,8 %
Nemotron‑H‑47B 83,6 % 93,3 % 61,0 % 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67,7 (v2) AIME25 89,1 %, LCB 68,3 %

Srovnání je třeba interpretovat s opatrností: podmínky hodnocení, verze benchmarků a data testování se mezi generacemi liší. Výsledky jsou převzaty z technických zpráv NVIDIA; nezávislá hodnocení se mohou lišit (viz sekce „Omezení").[8][3][9][11][12][2]

Využití

Nasazení prostřednictvím NVIDIA NIM

NVIDIA NIM — sada optimalizovaných kontejnerových mikroservisů pro inferenci s OpenAI‑kompatibilním API. Modely Nemotron jsou dostupné jako NIM‑mikroservisy na platformě build.nvidia.com. NIM podporuje formáty FP8, BF16, NVFP4 a nasazení prostřednictvím Helm‑chartů na Kubernetes. Modely jsou také kompatibilní s nezávislými frameworky: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

Syntetická generace dat

Nemotron‑4 340B je navržen pro použití jako generátor syntetických dat: model Instruct generuje odpovědi, model Reward je hodnotí a filtruje. Licence NVIDIA Open Model License výslovně povoluje použití výstupů modelu pro trénování jiných modelů. Podle ServiceNow pochází 15 % předtréninkových dat jejich modelu Apriel 1.6 z datových sad Nemotron.[3][15][41]

Agentní systémy

Modely rodiny Nemotron 3 (Nano, Super, Ultra) jsou určeny pro víceagentní pracovní zátěže: plánování, retrieval, volání nástrojů (tool use). Nemotron 3 Nano dosahuje výsledku 38,76 % na SWE‑Bench (s OpenHands) a 49,04 % (průměr) na TauBench V2.[2]

Podniková nasazení

Mezi deklarovanými partnery: ServiceNow (společný model Apriel Nemotron 15B pro automatizaci pracovních postupů), CrowdStrike (platforma Charlotte AI), Perplexity (směrování dotazů), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modely jsou dostupné na AWS Amazon Bedrock; plánuje se podpora Google Cloud, CoreWeave, Nebius.[15]

Omezení a otevřené problémy

Nezávislá hodnocení a rozpory s daty NVIDIA

Nezávislá hodnocení odhalují rozpory s výsledky uváděnými NVIDIA. Podle Artificial Analysis (únor 2026) obdržel Llama‑Nemotron‑Ultra 253B (reasoning) hodnocení Intelligence Index 15 při mediánu 26 pro modely srovnatelné velikosti. Na platformě Chatbot Arena (LMArena) obsazují modely Nemotron pozice v středu žebříčku: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. pozice), Nemotron 3 Nano — 1317 ±6 (~164. pozice).[42][43]

Mnohomluvnost

Modely Nemotron vykazují zvýšenou mnohomluvnost: při hodnocení Artificial Analysis model Nemotron 3 Nano vygeneroval 140 milionů tokenů (při mediánu 12 milionů pro ostatní modely), což zvyšuje náklady na inferenci. Analýza DEV Community odhalila, že Llama‑3.1‑Nemotron‑70B‑Instruct při formálním vedení na automatických benchmarcích vykazoval nedostatečnou přesnost v řadě praktických úloh a vysoké hodnocení na Arena‑podobných benchmarcích mohlo být způsobeno preferencí mnohomluvných a sebevědomých, ale ne nutně přesných odpovědí.[42][44]

Halucinace a bias

NVIDIA v kartách modelů uvádí, že modely mohou „zesilovat předsudky a generovat toxické odpovědi, zejména při toxických promptech" a „produkovat nepřesné informace, vynechávat klíčové detaily". Otevřenost vah a dat umožňuje externí audit.[11][13]

Výpočetní požadavky

Husté modely (Nemotron‑4 340B) vyžadují cluster 768 uzlů DGX H100 pro úplné trénování, což omezuje reprodukovatelnost pro akademické skupiny bez přístupu ke srovnatelné infrastruktuře. Dlouhý kontext (1M) při inferenci vyžaduje značné množství VRAM.[3][2]

Degradace při rozšiřování kontextu

Při rozšiřování kontextu na mimořádně dlouhé sekvence byla pozorována degradace výsledků na benchmarcích s krátkým kontextem.[32]

Kvantizace hybridních architektur

Použití extrémně nízké bitové šířky (FP8/NVFP4) v architekturách Mamba‑Transformer vede k mírnému poklesu přesnosti (~1 % na řadě benchmarků). Tento problém je řešen použitím selective quantization, což komplikuje architekturu kompilátorů a inferenčních serverů.[2][1]

Ostatní otevřené problémy

  • Závislost na benchmarcích s možnou kontaminací tréninkových dat.
  • Absence standardizovaných protokolů pro porovnávání hybridních SSM‑Transformer architektur s čistými Transformer‑modely.
  • Otázka škálovatelnosti přístupu MoE u úloh vyžadujících hluboké uvažování s malým počtem aktivních expertů na token.
  • Data o Super/Ultra k prosinci 2025 jsou předběžná; úplné benchmarky se očekávají po vydání.[1]

Etické a regulatorní aspekty

Bezpečnost ve fázi vývoje

Ve fázi vývoje jsou používány: hodnocení pomocí frameworku AEGIS (13 kategorií obsahové bezpečnosti), skener zranitelností garak, ruční „červené testování" (red‑teaming).[37]

Bezpečnost ve fázi inference

NeMo Guardrails — otevřený soubor nástrojů (licence Apache 2.0) přidávající programovatelné zábrany k LLM‑systémům. Mikroservis zachytává vstupy a výstupy, přičemž uplatňuje konfigurovatelné kontroly: kontrola tématu, detekce PII, ověření „uzemnění" RAG, detekce jailbreak‑útoků (včetně ochrany před injekcemi kódu na bázi YARA), vícejazyčná multimodální klasifikace bezpečnosti.[45]

Pro Nemotron 3 byl zveřejněn soubor ~11 000 označených tras OpenTelemetry z realistických scénářů s využitím nástrojů, určených pro hodnocení agentní bezpečnosti.[1]

Licencování

Modely Licence
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (dědí se od Meta)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License povoluje komerční využití, tvorbu a distribuci odvozených děl, nevyžaduje atribuci (při zachování souboru NOTICE), nestanoví omezení počtu uživatelů a výslovně povoluje použití výstupů modelu pro trénování jiných modelů.[46] Modely založené na Llama dědí omezení Meta, včetně prahu 700 milionů měsíčně aktivních uživatelů.[11]

Pro Nemotron 3 Nano NVIDIA zveřejnila: váhy modelu, více než 10 bilionů tokenů tréninkových dat, recepty trénování, kódové základny (NeMo, Megatron‑LM, NeMo‑Aligner), více než 10 prostředí pro učení s podkреплением s 900 000+ úlohami.[1][2]

Perspektivy a výzkumné směry

Budoucí vydání zahrnují Nemotron 3 Super (~100 miliard parametrů, ~10 miliard aktivních) a Nemotron 3 Ultra (~500 miliard, ~50 miliard aktivních), očekávané v první polovině roku 2026. Oba modely budou využívat LatentMoE, MTP a trénování ve formátu NVFP4 na architektuře Blackwell.[1]

Strategickým směrem NVIDIA je pozicování Nemotron nikoli jako izolovaného modelu, ale jako infrastrukturní vrstvy pro víceagentní systémy, kde různé modely rodiny jsou využívány pro různé úlohy se směrováním podle složitosti.[1][15]

Hlavní výzkumné směry:

  • Rozvoj hybridních architektur — další integrace SSM‑vrstev s mechanismem pozornosti pro škálovatelný dlouhý kontext.[12]
  • Víceúrovňové metody komprese — rozvoj Minitron, Puzzle, MiniPuzzle a Nemotron Elastic.[20][21][30]
  • Vícedoménové učení s podkреплением — Nemotron‑CrossThink pro rozšíření RL nad rámec matematických úloh.[31]
  • Rozšiřování kontextu — Nemotron‑UltraLong až na 4 miliony tokenů.[32]
  • Multimodalita — rozšíření do oblasti vision‑language (Nemotron VL), řeči (Nemotron Speech), vizuálního vyhledávání dokumentů (Nemotron ColEmbed V2).[34][35][36]
  • Kompaktní hybridní modely — Jet‑Nemotron (NAS pro modely 2B/4B).[33]
  • Otevřené recepty — zveřejnění úplných receptů trénování a dat pro reprodukci a přizpůsobení komunitou.[14]

Viz také

  • Architektura Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (rodina modelů Meta)

Zdroje

Literatura

Poznámky

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/