Nemotron (NVIDIA) (CS)
Nemotron — rodina velkých jazykových modelů (Large Language Model, LLM) s otevřenými váhami, vyvinutá oddělením Applied Deep Learning Research (ADLR) korporace NVIDIA. Modely patří do oblasti strojového učení a zpracování přirozeného jazyka (Natural Language Processing, NLP) a jsou určeny pro široké spektrum úloh: syntetickou generaci dat, logické odvozování (reasoning), agentní aplikace (agentic AI) a nasazení na průmyslovém hardwaru NVIDIA. Rodina sdružuje modely různých architektur a měřítek: od 4 miliard do ~500 miliard parametrů, včetně hustých (dense) decoder‑only Transformer‑modelů série Nemotron‑4 (2024), hybridních Mamba‑Transformer (Nemotron‑H, 2025) a hybridních Mamba‑Transformer s Mixture-of-Experts (MoE) v sérii Nemotron 3 (2025). K březnu 2026 rodina čítá více než 20 modelů pokrývajících úlohy generování textu, usuzování, vizuálního porozumění dokumentům, extrakce informací a hodnocení kvality odpovědí. Modely jsou vydávány převážně s otevřenými váhami pod licencemi NVIDIA Open Model License a Llama Community License.[1][2][3]
Historie a předpoklady
Vývoj rodiny Nemotron probíhá v kontextu strategie NVIDIA zaměřené na vytvoření kompletního zásobníku nástrojů pro generativní umělou inteligenci: od tréninkové infrastruktury (DGX, superpočítače na bázi GPU H100/B200) přes platformy pro trénování (NeMo Framework), zarovnání (NeMo‑Aligner), nasazení (NIM — NVIDIA Inference Microservices) až po zajištění bezpečnosti (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
První veřejně dostupný model série — dekodérový Transformer s 8 miliardami parametrů a kontextem 4096 tokenů, trénovaný na 3,8 bilionu tokenů na 53 přirozených a 37 programovacích jazycích. Trénování proběhlo na 1024 GPU A100 po dobu 19 dní. Formální technická zpráva na arXiv nebyla zveřejněna. Model byl distribuován prostřednictvím NeMo Framework a Hugging Face, existovaly varianty Chat (SFT a SteerLM). Licence — NVIDIA AI Foundation Models Community License.[6][7]
Poznámka k názvům: „Nemotron‑3" z roku 2023 a „Nemotron 3" z prosince 2025 jsou odlišné modely. První byl raným prototypem, druhý je aktuální generací s architekturou MoE.
Nemotron‑4 15B (únor 2024)
První veřejně zdokumentované vydání série Nemotron‑4 — model s 15 miliardami parametrů, trénovaný na 8 bilionech tokenů po dobu ~13 kalendářních dní na 384 uzlech DGX H100 (až 3072 GPU). Byl použit 8‑násobný tenzorový paralelismus a datový paralelismus od 96 do 288. Vrcholová MFU (Model FLOPs Utilization) dosáhla 34,3 % při batch size 384. Architektura — decoder‑only Transformer s Grouped‑Query Attention (GQA) a Rotary Position Embeddings (RoPE). Podle výsledků benchmarků v době publikace model překonával všechny srovnatelně velké otevřené modely ve vícejazyčných úlohách, včetně řady modelů čtyřikrát větších.[8]
Nemotron‑4 340B (červen 2024)
V červnu 2024 byl vydán největší model série Nemotron‑4 — 340 miliard parametrů (331,6 mld. ne‑embeddingových), předtrénovaný na 9 bilionech tokenů (8 bld. předtrénování + 1 bld. pokračující trénování s převzorkováním vysoce kvalitních zdrojů). Trénování probíhalo na 768 uzlech DGX H100 (až 6144 GPU) s vrcholovou MFU 42,4 %, od prosince 2023 do května 2024. Rodina zahrnuje tři varianty: Base, Instruct a Reward. Velikost modelu byla zvolena tak, aby se vešel na jeden uzel DGX H100 (8 GPU) při nasazení ve formátu přesnosti FP8. Více než 98 % dat použitých při zarovnání (alignment) bylo synteticky vygenerováno samotnými modely série v iterativním procesu; pipeline syntetické generace dat je otevřena k reprodukci.[3]
Llama‑3.1‑Nemotron‑70B (říjen 2024)
V říjnu 2024 byly vydány modely doladěné z Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct a Llama‑3.1‑Nemotron‑70B‑Reward. K 1. říjnu 2024 model Instruct obsadil 1. místo současně na třech automatických benchmarcích: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Model Reward dosáhl 94,1 % na RewardBench.[9][10]
Přechod na hybridní architektury (2025)
V roce 2025 se série rozšířila o hybridní architektury kombinující vrstvy Mamba‑2 (State Space Model, SSM — model prostoru stavů) a Transformer. V březnu–květnu 2025 byla vydána rodina uvažovacích modelů Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) s přepínatelným režimem uvažování.[11] V dubnu 2025 byl zveřejněn Nemotron‑H (arXiv:2504.03624) — rodina hybridních Mamba‑Transformer modelů o velikostech 8B, 56B a 47B parametrů.[12] V srpnu 2025 byl představen Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (prosinec 2025)
15. prosince 2025 bylo oznámeno třetí pokolení — rodina Nemotron 3 s modely Nano, Super a Ultra, kombinující architektury Mamba‑2, Transformer a MoE s kontextovým oknem až 1 milion tokenů. Nano byla vydána s technickou zprávou; Super a Ultra jsou naplánovány na první polovinu roku 2026.[1][2][14][15]
Teoretické základy
Architektura Transformer v Nemotron‑4
Modely série Nemotron‑4 jsou postaveny na standardní architektuře dekodérového Transformer s kauzální pozorností. Pravděpodobnost sekvence tokenů se faktorizuje jako:
kde jsou parametry modelu.[8]
Mechanismus pozornosti je implementován ve variantě Grouped‑Query Attention (GQA)[16]:
kde jsou matice dotazů, klíčů a hodnot; je dimenze hlavy pozornosti.
Pro kódování pozic jsou použity Rotary Position Embeddings (RoPE)[17]:
kde je vektor v pozici , , je dimenze vektoru.
V MLP‑vrstvách se používá aktivace Squared ReLU: , zajišťující řídkost aktivací. Modely neobsahují posuvy (bias), nepoužívají dropout a matice vstupních a výstupních vložení nejsou vzájemně svázány (untied embeddings). Tokenizátor — SentencePiece BPE se zachováním mezer, znakovou segmentací číslic a bajtovým fallback, velikost slovníku — 256 000.[8][3]
Architekturní parametry Nemotron‑4
| Parametr | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Počet parametrů | 15 mld (3,2 mld embed.) | 340 mld (9,4 mld embed.) |
| Počet vrstev | 32 | 96 |
| Skrytá dimenze | 6144 | 18 432 |
| Hlavy pozornosti | 48 | 96 |
| KV‑hlavy (GQA) | 8 | 8 |
| Délka kontextu | 4096 | 4096 |
| Velikost slovníku | 256 000 | 256 000 |
Zdroje: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Hybridní architektura Mamba‑Transformer (Nemotron‑H)
V modelech Nemotron‑H jsou standardní bloky vlastní pozornosti částečně nahrazeny bloky Mamba‑2 — modely prostoru stavů (State Space Models, SSM). Při autoregresivní generaci každá vrstva vlastní pozornosti vyžaduje operací a paměti na krok (kvůli KV‑cache), zatímco vrstvy Mamba zajišťují konstantní paměťové a výpočetní náklady na každý generovaný token.[12]
Mamba‑2 je popsána rekurentním vztahem[18]:
kde je skrytý stav, je diagonální matice přechodu stavů, a jsou projekční matice, je vstupní token, je výstupní signál. V Mamba‑2 matice , , závisí na vstupu (input‑dependent), což odlišuje model od klasických lineárních SSM.
V Nemotron‑H‑56B se používá 54 vrstev Mamba‑2 + 54 MLP‑vrstev + 10 vrstev vlastní pozornosti, přičemž vrstvy pozornosti jsou rovnoměrně rozmístěny mezi Mamba‑vrstvami. Model byl trénován na 20 bilionech tokenů ve formátu FP8 (per‑tensor scaling) na 6144 GPU H100. Verze Nemotron‑H‑8B obsahuje 24 vrstev Mamba‑2, 24 MLP‑vrstev a 4 vrstvy vlastní pozornosti; trénování proběhlo na 15 bilionech tokenů.[12]
Architektura MoE v Nemotron 3
Modely Nemotron 3 (prosinec 2025) kombinují tři architekturní komponenty: Mamba‑2, Transformer a Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) obsahuje 52 vrstev: 23 vrstev Mamba‑2 + MoE, 23 vrstev MoE a 6 vrstev GQA‑pozornosti. Každá MoE‑vrstva zahrnuje 128 směrovaných (routed) expertů + 1 sdílený (shared) expert, z nichž 6 expertů je aktivováno na každý token. Směrování provádí trénovatelný MLP‑router se sigmoid gating. Vyvažování zátěže je realizováno bez pomocné ztrátové funkce (aux‑loss‑free). Celkový počet parametrů je 31,6 miliardy, ale aktivních na každý token je pouze 3,2 miliardy.[2]
Normalizace — RMSNorm[19]. Poziční embeddingy v částech Mamba nejsou přítomny (poziční informace je implicitní ve stavu SSM). Používají se nespojené embeddingy, absence dropout a bias v lineárních vrstvách.[2]
Rozšíření v Super/Ultra: LatentMoE a Multi‑Token Prediction
Modely Super a Ultra z rodiny Nemotron 3 využívají dvě dodatečné architekturní inovace:
- Latent MoE (LatentMoE) — projekce vstupní reprezentace do latentního prostoru menší dimenze před směrováním, což umožňuje zvýšit počet expertů při srovnatelných výpočetních nákladech a zvýšit přesnost bez snížení propustnosti.[1]
- Multi‑Token Prediction (MTP) — předpovídání více následujících tokenů najednou, používané ke zlepšení kvality dlouhých textů a spekulativního dekódování při inferenci.[1]
Trénování modelů Super a Ultra probíhá ve formátu NVFP4 — 4bitovém číselném formátu NVIDIA na architektuře Blackwell.[1]
Metody komprese modelů: Minitron, Puzzle, MiniPuzzle
Pro tvorbu kompaktních modelů NVIDIA využívá několik přístupů:
- Minitron — metoda strukturovaného prořezávání (pruning) a destilace znalostí (knowledge distillation). Zkoumají se dva druhy prořezávání: po hloubce (odstraňování vrstev) a po šířce (společné zmenšení dimenzí skrytých vrstev, hlav pozornosti a MLP‑projekcí). Použití Minitron na Nemotron‑4 15B umožňuje získat modely 8B a 4B se snížením nákladů na trénování až 40krát v porovnání s trénováním od nuly.[20]
- Puzzle — algoritmus Neural Architecture Search (NAS), který vybírá optimální konfiguraci každého bloku (počet KV‑hlav, velikost FFN, přítomnost/absence pozornosti) s blokovitou destilací. Právě tak byl Llama 3.1 405B komprimován na 253B (Llama‑Nemotron Ultra) a Llama 3.3 70B na 49B (Llama‑Nemotron Super).[21]
- MiniPuzzle — rozšíření Puzzle pro hybridní architektury, které zkomprimovalo Nemotron‑H‑56B na 47B s nákladem pouhých 63 miliard tokenů destilace. Při srovnatelné přesnosti komprimovaný model generuje o 20 % rychleji.[12]
Metody zarovnání
HelpSteer a HelpSteer2
HelpSteer — sada 37 120 příkladů (licence CC‑BY‑4.0), vytvořená ve spolupráci se Scale AI, kde je každá odpověď anotována podle pěti atributů: užitečnost (helpfulness), správnost (correctness), soudržnost (coherence), složitost (complexity) a mnohomluvnost (verbosity) na Likertově škále 0–4.[22]
HelpSteer2 — aktualizovaná sada 21 362 příkladů (10 681 promptů × 2 odpovědi), kde více než 95 % promptů pochází ze ShareGPT (skutečné uživatelské dotazy). Přibližně 50 % anotací bylo odfiltrováno jako nedostatečně kvalitní. Rozšíření HelpSteer2‑Preference přidává párové preference anotátorů, což umožňuje trénovat jak regresní, tak párové modely odměny na stejných datech.[23][24]
SteerLM
SteerLM — metoda SFT (Supervised Fine‑Tuning — doučování s učitelem) s podmíněním na atributy (helpfulness, correctness, coherence, complexity, verbosity), umožňující uživateli řídit styl odpovědi při inferenci. Pipeline zahrnuje: (1) trénování modelu predikce atributů (APM) na HelpSteer, (2) anotování dat pomocí APM, (3) SFT s podmíněním na cílové hodnoty atributů, (4) bootstrapping.[25]
DPO a RPO
DPO (Direct Preference Optimization) — metoda přímé optimalizace preferencí bez explicitního modelu odměny, používaná v pipeline Nemotron‑4 340B Instruct a Nemotron Nano 2.[26]
RPO (Reward‑aware Preference Optimization) — unifikovaný matematický framework NVIDIA, zobecňující DPO, IPO, SimPO, REINFORCE a SteerLM 2.0 jako speciální případy. RPO minimalizuje vzdálenost mezi předpověďmi implicitního modelu odměny a cílovým explicitním modelem[27]:
kde je explicitní model odměny, je trénovaná politika, je referenční politika, je funkce vzdálenosti, / je preferovaná/odmítnutá odpověď. RPO je použito při trénování Nemotron‑4 340B Instruct a modelů Llama‑Nemotron.[27][3][11]
Víceenvironmentní učení zpětnou vazbou (RLVR)
V Nemotron 3 je použit Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — simultánní trénování v několika prostředích v rámci NeMo Gym: soutěžní matematika, programování, QA, tool‑use, instruction‑following, long‑context. Algoritmus — GRPO (Group Relative Policy Optimization) s masked importance sampling.[2][14]
Nemotron 3 podporuje granulární řízení rozpočtu uvažování (reasoning budget control): uživatel může nastavit limit tokenů pro thinking trace prostřednictvím příznaku v chat template (přepínání „detailed thinking on/off" nebo omezení délky).[2]
Řada modelů
Přehledná tabulka
| Model | Rok | Celkový / Aktivní počet parametrů | Kontext | Architektura | Klíčové vlastnosti |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T tokenů; 1024 GPU A100; 19 dní |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T tokenů; MFU 34,3 % |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T tokenů; Base/Instruct/Reward; >98 % syntet. dat alignment |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1 % |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | NAS‑komprese z Llama 3.1 8B |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Z Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Z Llama 3.1 405B; GPQA 76,0 % |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hybridní Mamba‑Transformer | 15T tokenů; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hybridní Mamba‑Transformer | 20T tokenů FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hybridní Mamba‑Transformer | MiniPuzzle z 56B; +20 % rychlost |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hybridní Mamba‑Transformer | 20T tokenů; Minitron‑destilace |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hybridní Mamba‑Transformer MoE | 25T tokenů; 128 expertů, 6 aktivních |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hybridní LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hybridní LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Architektura: 32 vrstev, hidden dimension 6144, 48 hlav pozornosti, 8 KV‑hlav (GQA). Celkový počet parametrů — 15 miliard (3,2 mld. embedding + 12,5 mld. non‑embedding). Výsledky: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). Na vícejazyčných benchmarcích (XCOPA, TyDiQA‑GoldP, MGSM) model překonával modely čtyřikrát větší.[8]
Nemotron‑4 340B
Architektura: 96 vrstev, hidden dimension 18 432, 96 hlav pozornosti, 8 KV‑hlav.
Nemotron‑4 340B Base dosáhl: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]
Nemotron‑4 340B Instruct prošel vícestupňovým zarovnáním: Code SFT → General SFT → DPO → RPO (3 kola). Výsledky: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]
Nemotron‑4 340B Reward nahrazuje finální vrstvu softmax lineární projekcí skrytého stavu poslední vrstvy do vektoru 5 atributů HelpSteer2. Výsledná odměna je váženým součtem pěti atributů. Trénování proběhlo po dobu 2 epoch na datech HelpSteer2 (batch size 128). Na RewardBench model dosáhl 92,0 %, čímž překonal GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) a Claude‑3‑Opus (80,7 %) v době publikace.[3]
| Model | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | 41,5 % | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | 34,4 % | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | 30,9 % | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | 38,8 % | 8,26 |
Zdroj: arXiv:2406.11704, tabulka 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward byl trénován hybridní metodou kombinující Bradley‑Terry (párové preference) a SteerLM‑regresi (víceatributové hodnocení na Likertově škále). Trénování proběhlo výhradně na datech HelpSteer2 (CC‑BY‑4.0). Na RewardBench model dosáhl 94,1 %, čímž obsadil 1. místo v době publikace.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct byl zarovnán metodou RLHF s algoritmem REINFORCE (ne PPO) a modelem odměny Nemotron‑70B‑Reward. Infrastruktura — NeMo‑Aligner s akcelerací TRT‑LLM.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
Rodina uvažovacích modelů získaných z Llama 3.x metodami NAS, destilace a rozšířeného dotrénování.[11]
| Model | Parametry | Základní model | Kontext |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 mld | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 mld | Minitron 4B (z Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | 49 mld | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 mld | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Pětistupňový tréninkový pipeline: (1) NAS + FFN Fusion, (2) destilace + pokračující předtrénování, (3) SFT (včetně uvažovacích tras DeepSeek‑R1), (4) rozsáhlé RL (GRPO pro Ultra, REINFORCE/RLOO + Online RPO pro Nano), (5) zarovnání pro dialog.[11]
Modely jako první z otevřených LLM podporují přepínatelný režim uvažování (reasoning toggle): při zapnutí („detailed thinking on" v systémovém promptu) model generuje řetěz úvah v tazích <think>...</think> před odpovědí; při vypnutí odpovídá přímo.[11]
Výsledky Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Pro srovnání: DeepSeek‑R1 (671B celkem / 37B aktivních) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra se vejde na jeden uzel 8×H100.[11]
Nemotron‑H (duben 2025)
Rodina hustých hybridních modelů trénovaných od nuly a navržených pro úlohy s dlouhými generacemi. Nemotron‑H‑56B byl trénován na 20 bilionech tokenů ve formátu FP8 — jeden z největších veřejných experimentů s FP8‑předtrénováním. Nemotron‑H‑47B byl získán kompresí 56B metodou MiniPuzzle (63 miliard tokenů destilace) a vejde se do paměti jedné RTX 5090 (FP4) při kontextu ~1M tokenů.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Zdroj: arXiv:2504.03624.[12]
Při generování s 65 536 vstupními a 1024 výstupními tokeny na H100 model Nemotron‑H‑47B pracoval 2,9krát rychleji než Qwen‑2.5‑72B a Llama‑3.1‑70B.[12]
Nemotron Nano 2 (srpen 2025)
Hybridní Mamba‑Transformer model pro uvažování. Nemotron‑Nano‑12B‑v2‑Base — rodičovský model s 62 vrstvami (převážně Mamba‑2 + MLP + 4 vrstvy pozornosti), trénovaný na 20 bilionech tokenů ve formátu FP8 od nuly. Z něj metodou rozšířeného Minitron byl získán Nemotron‑Nano‑9B‑v2, schopný pracovat v kontextu 128K tokenů na jednom GPU NVIDIA A10G (22 GB, BF16). Dotrénování: SFT (80 miliard tokenů, včetně tras DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Na uvažovacích benchmarcích je model srovnatelný s Qwen3‑8B z hlediska přesnosti, ale dosahuje 3–6násobného zrychlení generace při dlouhých výstupních sekvencích.[13]
Nemotron 3 Nano 30B‑A3B
Vydán v prosinci 2025. Parametry: 31,6 miliard celkem, 3,2 miliardy aktivních. Architektura: 52 vrstev, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 směrovaných expertů + 1 sdílený, 6 aktivních na token. Kontext — až 1 048 576 tokenů. Trénování na 25 bilionech tokenů (WSD‑rozvrh, batch size 3072, cutoff dat — červen 2025) ve dvou fázích: Phase 1 — 23,5 bilionu (různorodá data), Phase 2 — 1,5 bilionu (vysoce kvalitní data) + 121 miliard tokenů long‑context CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — hodnoty z vedlejších zdrojů; podmínky reprodukce — NeMo Evaluator SDK. Zdroj: arXiv:2512.20848.[2][28]
Propustnost (8K vstup / 16K výstup, single H200): 3,3krát vyšší než Qwen3‑30B‑A3B‑Thinking a 2,2krát vyšší než GPT‑OSS‑20B.[2]
Doplňkové modely a směry
- OpenReasoning‑Nemotron (červenec 2025) — série modelů s 1,5B–32B parametry, založených na Qwen 2.5 a doladěných na datech DeepSeek‑R1‑0528. Varianta 32B s GenSelect@64 překonává o3 (high) na řadě matematických benchmarků.[29]
- Nemotron Elastic (arXiv:2511.16664) — framework vnořených podmodelů (6B, 9B, 12B) v rámci jednoho rodičovského modelu, snižující náklady na trénování 360krát v porovnání s trénováním od nuly.[30]
- Nemotron‑CrossThink — framework vícedoménového učení s podkреплением nad rámec matematických úloh, který zajistil +30,1 % na MATH‑500 a +12,8 % na MMLU‑PRO.[31]
- Nemotron‑UltraLong — rozšíření kontextu až na 4 miliony tokenů.[32]
- Jet‑Nemotron — post‑tréninkový NAS pro kompaktní hybridní modely 2B/4B.[33]
Specializované modely
V ekosystému Nemotron jsou také přítomny modely pro specializované úlohy:
- Nemotron Nano V2 VL — vision‑language model pro OCR, zpracování tabulek a videa.[34]
- Nemotron Parse 1.1 — model pro OCR a extrakci struktury dokumentů.[35]
- Nemotron ColEmbed V2 — model embeddingů pro vizuální vyhledávání dokumentů (late interaction).[36]
- Nemotron Speech — modely pro automatické rozpoznávání řeči (ASR), syntézu řeči (TTS) a strojový překlad (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — model klasifikace nebezpečného obsahu ve 23 kategoriích v 9 jazycích s přesností 84,2 %.[37]
Data pro předtrénování
Složení dat Nemotron‑4
Předtréninkový korpus Nemotron‑4 15B a 340B se skládá ze tří hlavních kategorií: anglické texty (70 %), vícejazyčné texty v 53 jazycích (15 %) a zdrojový kód ve 43 programovacích jazycích (15 %). Byla použita deduplikace na úrovni dokumentů (přesná i přibližná), dále filtrování pomocí jazykových modelů a heuristik. Model 15B byl trénován na 8 bilionech tokenů, model 340B na 9 bilionech (8 bld. předtrénování + 1 bld. pokračující trénování s převzorkováním vysoce kvalitních zdrojů).[8][3]
Nemotron‑CC
Datová sada Nemotron‑CC byla sestavena z Common Crawl pomocí souboru klasifikátorů kvality a syntetického parafrázování textů. Celkový objem — 6,3 bilionu tokenů (4,4 bld. deduplikovaných + 1,9 bld. syntetických přeformulování). Pipeline je integrována do nástroje NeMo Curator. Práce byla přijata jako Long Paper na konferenci ACL 2025.[38]
Nemotron‑CC‑Math
Matematicky orientovaná podmnožina o objemu 133 miliard tokenů, extrahovaná z Common Crawl pomocí pipeline Lynx + LLM se zachováním struktury matematických vzorců a kódu v LaTeX.[39]
Data Nemotron 3 Nano
Předtrénování Nemotron 3 Nano bylo provedeno na 25 bilionech tokenů. Sada zahrnuje: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 a specializované STEM datasety. Pro long‑context trénování bylo použito dalších 121 miliard tokenů CPT.[2]
Nemotron Pretraining Dataset v1
Synteticky vygenerovaná sada pokrývající STEM, akademické texty, úlohy uvažování a vícejazyčné domény; obsahuje více než 10 bilionů jazykových tokenů a 18 milionů vzorků pro SFT. Všechny datové sady jsou distribuovány pod otevřenými permisivními licencemi.[40]
Pipeline syntetické generace dat (SDG)
Pipeline popsaná ve zprávě o Nemotron‑4 340B zahrnuje následující kroky[3]:
- Generování promptů: syntetické jedno‑ a dvouobratkové dotazy generované pomocí Mixtral‑8x7B‑Instruct‑v0.1 (licence Apache 2.0) podle šablon Open QA, Writing, Closed QA, Math & Coding.
- Generování odpovědí: více odpovědí od průběžných verzí modelů pro zajištění rozmanitosti.
- Hodnocení kvality: tři přístupy — Ground‑Truth‑as‑a‑Judge (pro úlohy s ověřitelnou odpovědí), LLM‑as‑Judge (porovnání párů odpovědí jazykovým modelem), Reward‑Model‑as‑Judge (použití Nemotron‑4‑340B‑Reward).
- Iterativní zarovnání od slabých k silným modelům (weak‑to‑strong).
Z ~20 000 příkladů anotovaných lidmi (10 000 pro SFT, 10 000 HelpSteer2 pro model odměny) byl syntetizován veškerý zbývající objem zarovnávacích dat.[3]
Kvantizace a optimalizace inference
Modely Nemotron 3 Nano podporují Post‑Training Quantization (PTQ) v FP8 s využitím ModelOpt a Megatron‑LM. Používá se selective quantization — vrstvy attention a část Mamba jsou ponechány v BF16 pro zachování kvality; ostatní jsou kvantizovány do FP8. Podle technické zprávy to zajišťuje ~99% zachování přesnosti.[2] Nano také podporuje inferenci ve formátu NVFP4.[1]
Souhrnná tabulka benchmarků podle generací
| Model | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Podmínky |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64,2 % | 46,0 % | 31,6 % | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81,1 % | — | 57,3 % | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78,7 % | 92,3 % | 73,2 % | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | říjen 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0 %, AIME 80,8 % |
| Nemotron‑H‑47B | 83,6 % | 93,3 % | 61,0 % | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1 %, LCB 68,3 % |
Srovnání je třeba interpretovat s opatrností: podmínky hodnocení, verze benchmarků a data testování se mezi generacemi liší. Výsledky jsou převzaty z technických zpráv NVIDIA; nezávislá hodnocení se mohou lišit (viz sekce „Omezení").[8][3][9][11][12][2]
Využití
Nasazení prostřednictvím NVIDIA NIM
NVIDIA NIM — sada optimalizovaných kontejnerových mikroservisů pro inferenci s OpenAI‑kompatibilním API. Modely Nemotron jsou dostupné jako NIM‑mikroservisy na platformě build.nvidia.com. NIM podporuje formáty FP8, BF16, NVFP4 a nasazení prostřednictvím Helm‑chartů na Kubernetes. Modely jsou také kompatibilní s nezávislými frameworky: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Syntetická generace dat
Nemotron‑4 340B je navržen pro použití jako generátor syntetických dat: model Instruct generuje odpovědi, model Reward je hodnotí a filtruje. Licence NVIDIA Open Model License výslovně povoluje použití výstupů modelu pro trénování jiných modelů. Podle ServiceNow pochází 15 % předtréninkových dat jejich modelu Apriel 1.6 z datových sad Nemotron.[3][15][41]
Agentní systémy
Modely rodiny Nemotron 3 (Nano, Super, Ultra) jsou určeny pro víceagentní pracovní zátěže: plánování, retrieval, volání nástrojů (tool use). Nemotron 3 Nano dosahuje výsledku 38,76 % na SWE‑Bench (s OpenHands) a 49,04 % (průměr) na TauBench V2.[2]
Podniková nasazení
Mezi deklarovanými partnery: ServiceNow (společný model Apriel Nemotron 15B pro automatizaci pracovních postupů), CrowdStrike (platforma Charlotte AI), Perplexity (směrování dotazů), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modely jsou dostupné na AWS Amazon Bedrock; plánuje se podpora Google Cloud, CoreWeave, Nebius.[15]
Omezení a otevřené problémy
Nezávislá hodnocení a rozpory s daty NVIDIA
Nezávislá hodnocení odhalují rozpory s výsledky uváděnými NVIDIA. Podle Artificial Analysis (únor 2026) obdržel Llama‑Nemotron‑Ultra 253B (reasoning) hodnocení Intelligence Index 15 při mediánu 26 pro modely srovnatelné velikosti. Na platformě Chatbot Arena (LMArena) obsazují modely Nemotron pozice v středu žebříčku: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. pozice), Nemotron 3 Nano — 1317 ±6 (~164. pozice).[42][43]
Mnohomluvnost
Modely Nemotron vykazují zvýšenou mnohomluvnost: při hodnocení Artificial Analysis model Nemotron 3 Nano vygeneroval 140 milionů tokenů (při mediánu 12 milionů pro ostatní modely), což zvyšuje náklady na inferenci. Analýza DEV Community odhalila, že Llama‑3.1‑Nemotron‑70B‑Instruct při formálním vedení na automatických benchmarcích vykazoval nedostatečnou přesnost v řadě praktických úloh a vysoké hodnocení na Arena‑podobných benchmarcích mohlo být způsobeno preferencí mnohomluvných a sebevědomých, ale ne nutně přesných odpovědí.[42][44]
Halucinace a bias
NVIDIA v kartách modelů uvádí, že modely mohou „zesilovat předsudky a generovat toxické odpovědi, zejména při toxických promptech" a „produkovat nepřesné informace, vynechávat klíčové detaily". Otevřenost vah a dat umožňuje externí audit.[11][13]
Výpočetní požadavky
Husté modely (Nemotron‑4 340B) vyžadují cluster 768 uzlů DGX H100 pro úplné trénování, což omezuje reprodukovatelnost pro akademické skupiny bez přístupu ke srovnatelné infrastruktuře. Dlouhý kontext (1M) při inferenci vyžaduje značné množství VRAM.[3][2]
Degradace při rozšiřování kontextu
Při rozšiřování kontextu na mimořádně dlouhé sekvence byla pozorována degradace výsledků na benchmarcích s krátkým kontextem.[32]
Kvantizace hybridních architektur
Použití extrémně nízké bitové šířky (FP8/NVFP4) v architekturách Mamba‑Transformer vede k mírnému poklesu přesnosti (~1 % na řadě benchmarků). Tento problém je řešen použitím selective quantization, což komplikuje architekturu kompilátorů a inferenčních serverů.[2][1]
Ostatní otevřené problémy
- Závislost na benchmarcích s možnou kontaminací tréninkových dat.
- Absence standardizovaných protokolů pro porovnávání hybridních SSM‑Transformer architektur s čistými Transformer‑modely.
- Otázka škálovatelnosti přístupu MoE u úloh vyžadujících hluboké uvažování s malým počtem aktivních expertů na token.
- Data o Super/Ultra k prosinci 2025 jsou předběžná; úplné benchmarky se očekávají po vydání.[1]
Etické a regulatorní aspekty
Bezpečnost ve fázi vývoje
Ve fázi vývoje jsou používány: hodnocení pomocí frameworku AEGIS (13 kategorií obsahové bezpečnosti), skener zranitelností garak, ruční „červené testování" (red‑teaming).[37]
Bezpečnost ve fázi inference
NeMo Guardrails — otevřený soubor nástrojů (licence Apache 2.0) přidávající programovatelné zábrany k LLM‑systémům. Mikroservis zachytává vstupy a výstupy, přičemž uplatňuje konfigurovatelné kontroly: kontrola tématu, detekce PII, ověření „uzemnění" RAG, detekce jailbreak‑útoků (včetně ochrany před injekcemi kódu na bázi YARA), vícejazyčná multimodální klasifikace bezpečnosti.[45]
Pro Nemotron 3 byl zveřejněn soubor ~11 000 označených tras OpenTelemetry z realistických scénářů s využitím nástrojů, určených pro hodnocení agentní bezpečnosti.[1]
Licencování
| Modely | Licence |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (dědí se od Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License povoluje komerční využití, tvorbu a distribuci odvozených děl, nevyžaduje atribuci (při zachování souboru NOTICE), nestanoví omezení počtu uživatelů a výslovně povoluje použití výstupů modelu pro trénování jiných modelů.[46] Modely založené na Llama dědí omezení Meta, včetně prahu 700 milionů měsíčně aktivních uživatelů.[11]
Pro Nemotron 3 Nano NVIDIA zveřejnila: váhy modelu, více než 10 bilionů tokenů tréninkových dat, recepty trénování, kódové základny (NeMo, Megatron‑LM, NeMo‑Aligner), více než 10 prostředí pro učení s podkреплением s 900 000+ úlohami.[1][2]
Perspektivy a výzkumné směry
Budoucí vydání zahrnují Nemotron 3 Super (~100 miliard parametrů, ~10 miliard aktivních) a Nemotron 3 Ultra (~500 miliard, ~50 miliard aktivních), očekávané v první polovině roku 2026. Oba modely budou využívat LatentMoE, MTP a trénování ve formátu NVFP4 na architektuře Blackwell.[1]
Strategickým směrem NVIDIA je pozicování Nemotron nikoli jako izolovaného modelu, ale jako infrastrukturní vrstvy pro víceagentní systémy, kde různé modely rodiny jsou využívány pro různé úlohy se směrováním podle složitosti.[1][15]
Hlavní výzkumné směry:
- Rozvoj hybridních architektur — další integrace SSM‑vrstev s mechanismem pozornosti pro škálovatelný dlouhý kontext.[12]
- Víceúrovňové metody komprese — rozvoj Minitron, Puzzle, MiniPuzzle a Nemotron Elastic.[20][21][30]
- Vícedoménové učení s podkреплением — Nemotron‑CrossThink pro rozšíření RL nad rámec matematických úloh.[31]
- Rozšiřování kontextu — Nemotron‑UltraLong až na 4 miliony tokenů.[32]
- Multimodalita — rozšíření do oblasti vision‑language (Nemotron VL), řeči (Nemotron Speech), vizuálního vyhledávání dokumentů (Nemotron ColEmbed V2).[34][35][36]
- Kompaktní hybridní modely — Jet‑Nemotron (NAS pro modely 2B/4B).[33]
- Otevřené recepty — zveřejnění úplných receptů trénování a dat pro reprodukci a přizpůsobení komunitou.[14]
Viz také
- Architektura Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (rodina modelů Meta)
Zdroje
- NVIDIA Research — stránka Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — dokumentace Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Literatura
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, únor 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, červen 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, červen 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, červenec 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, listopad 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, leden 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, duben 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, květen 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, srpen 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, srpen 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, listopad 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, prosinec 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, prosinec 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Poznámky
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/