Nemotron (NVIDIA) (TL)
Nemotron — isang pamilya ng malalaking modelo ng wika (Large Language Model, LLM) na may bukas na mga timbang (open weights), na binuo ng subdibisyon ng Applied Deep Learning Research (ADLR) ng korporasyong NVIDIA. Ang mga modelo ay nauukol sa larangan ng Machine Learning at Natural Language Processing (NLP) at inilaan para sa malawak na hanay ng mga gawain: synthetic na pagbuo ng datos, lohikal na paghinuha (reasoning), mga ahenteng aplikasyon (agentic AI) at pag-deploy sa pang-industriyang kagamitan ng NVIDIA. Pinagsasama ng pamilya ang mga modelo ng iba't ibang arkitektura at sukat: mula sa 4 bilyon hanggang ~500 bilyong parameter, kabilang ang siksik (dense) na decoder‑only Transformer na mga modelo ng serye ng Nemotron‑4 (2024), hybrid na Mamba‑Transformer (Nemotron‑H, 2025) at hybrid na Mamba‑Transformer na may Mixture-of-Experts (MoE) sa serye ng Nemotron 3 (2025). Sa katayuan noong Marso 2026, ang pamilya ay binubuo ng mahigit 20 modelo, sumasaklaw sa mga gawaing pagbuo ng teksto, pangangatwiran, visual na pag-unawa sa mga dokumento, pagkuha ng impormasyon at pagtatasa ng kalidad ng mga sagot. Ang mga modelo ay inilalabas pangunahin na may bukas na mga timbang sa ilalim ng mga lisensyang NVIDIA Open Model License at Llama Community License.[1][2][3]
Kasaysayan at Mga Paunang Kondisyon
Ang pagbuo ng pamilyang Nemotron ay isinasagawa sa konteksto ng estratehiya ng NVIDIA na lumikha ng kumpletong stack ng mga kasangkapan para sa generative AI: mula sa imprastraktura ng pagsasanay (DGX, mga supercomputer batay sa GPU H100/B200) hanggang sa mga platform ng pagsasanay (NeMo Framework), pagkakatugma (NeMo‑Aligner), pag-deploy (NIM — NVIDIA Inference Microservices) at seguridad (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
Ang unang pampublikong magagamit na modelo ng serye — isang decoder Transformer na may 8 bilyong parameter at konteksto na 4096 token, na sinanay sa 3,8 trilyon na token sa 53 natural at 37 wika ng programming. Ang pagsasanay ay isinagawa sa 1024 GPU A100 sa loob ng 19 araw. Walang pormal na teknikal na ulat na nailathala sa arXiv. Ang modelo ay ipinamamahagi sa pamamagitan ng NeMo Framework at Hugging Face; mayroon ding mga variant na Chat (SFT at SteerLM). Lisensya — NVIDIA AI Foundation Models Community License.[6][7]
Tala ukol sa mga pangalan: Ang «Nemotron‑3» noong 2023 at ang «Nemotron 3» noong Disyembre 2025 ay magkaibang mga modelo. Ang una ay isang maagang prototype, ang ikalawa ay ang kasalukuyang henerasyon na may arkitekturang MoE.
Nemotron‑4 15B (Pebrero 2024)
Ang unang pampublikong dokumentadong inilabas ng serye ng Nemotron‑4 — isang modelo na may 15 bilyong parameter, na sinanay sa 8 trilyong token sa loob ng ~13 araw ng kalendaryo sa 384 node ng DGX H100 (hanggang 3072 GPU). Ginamit ang 8-fold na tensor parallelism at data parallelism mula 96 hanggang 288. Ang pinakamataas na MFU (Model FLOPs Utilization) ay umabot sa 34,3% sa batch size na 384. Arkitektura — decoder‑only Transformer na may Grouped‑Query Attention (GQA) at Rotary Position Embeddings (RoPE). Batay sa mga resulta ng benchmark sa oras ng publikasyon, nalampasan ng modelo ang lahat ng katulad na laki na bukas na modelo sa mga multilingual na gawain, kabilang ang ilang modelo na apat na beses na mas malaki kaysa rito.[8]
Nemotron‑4 340B (Hunyo 2024)
Noong Hunyo 2024, inilabas ang pinakamalaking modelo ng serye ng Nemotron‑4 — 340 bilyong parameter (331,6 bilyon na hindi embedding), na paunang sinanay sa 9 trilyong token (8 trilyon na paunang pagsasanay + 1 trilyon na patuloy na pagsasanay na may muling pagtitimbang ng mga mataas na kalidad na pinagkukunan). Ang pagsasanay ay isinagawa sa 768 node ng DGX H100 (hanggang 6144 GPU) na may pinakamataas na MFU na 42,4%, mula Disyembre 2023 hanggang Mayo 2024. Ang pamilya ay kinabibilangan ng tatlong variant: Base, Instruct at Reward. Ang laki ng modelo ay pinili upang magkasya ito sa isang node ng DGX H100 (8 GPU) kapag naka-deploy sa format ng katumpakan na FP8. Mahigit 98% ng datos na ginamit sa pagkakatugma (alignment) ay synthetic na nilikha ng mismong mga modelo ng serye sa isang iterative na proseso; ang pipeline ng synthetic na pagbuo ng datos ay bukas para sa pagpaparami.[3]
Llama‑3.1‑Nemotron‑70B (Oktubre 2024)
Noong Oktubre 2024, inilabas ang mga modelo na na-fine-tune mula sa Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct at Llama‑3.1‑Nemotron‑70B‑Reward. Sa katayuan noong Oktubre 1, 2024, ang modelo ng Instruct ay nanguna sa unang lugar nang sabay-sabay sa tatlong awtomatikong benchmark: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6%, MT‑Bench (GPT‑4‑Turbo) — 8,98. Ang Reward na modelo ay umabot sa 94,1% sa RewardBench.[9][10]
Paglipat sa mga Hybrid na Arkitektura (2025)
Noong 2025, pinalawak ang serye ng mga hybrid na arkitektura na pinagsama ang mga layer ng Mamba‑2 (State Space Model, SSM — modelo ng estado ng espasyo) at Transformer. Noong Marso–Mayo 2025, inilabas ang pamilya ng mga modelo ng pangangatwiran na Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) na may naka-toggle na mode ng pangangatwiran.[11] Noong Abril 2025, inilathala ang Nemotron‑H (arXiv:2504.03624) — isang pamilya ng mga hybrid na modelo ng Mamba‑Transformer na may sukat na 8B, 56B at 47B na parameter.[12] Noong Agosto 2025, ipinakita ang Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (Disyembre 2025)
Noong Disyembre 15, 2025, inanunsyo ang ikatlong henerasyon — ang pamilyang Nemotron 3 na may mga modelo ng Nano, Super at Ultra, na pinagsasama ang mga arkitektura ng Mamba‑2, Transformer at MoE na may kontekstwal na window na hanggang 1 milyong token. Ang Nano ay inilabas kasama ang teknikal na ulat; ang Super at Ultra ay nakatakda para sa unang kalahati ng 2026.[1][2][14][15]
Mga Teoretikal na Batayan
Arkitektura ng Transformer sa Nemotron‑4
Ang mga modelo ng serye ng Nemotron‑4 ay itinayo sa karaniwang arkitektura ng decoder Transformer na may causal na atensyon. Ang posibilidad ng pagkakasunod-sunod ng mga token ay nafa-factorize bilang:
kung saan ang — mga parameter ng modelo.[8]
Ang mekanismo ng atensyon ay isinagawa sa variant ng Grouped‑Query Attention (GQA)[16]:
kung saan ang — mga matris ng mga query, key at value; — dimensyon ng ulo ng atensyon.
Para sa pag-encode ng mga posisyon, ginagamit ang Rotary Position Embeddings (RoPE)[17]:
kung saan ang — vector sa posisyon na , , — dimensyon ng vector.
Sa mga MLP‑layer, ginagamit ang aktibasyong Squared ReLU: , na nagbibigay ng kapanganiban ng mga aktibasyong mababa ang densidad. Ang mga modelo ay walang mga bias, hindi gumagamit ng dropout, at ang mga matris ng embedding ng input at output ay hindi naka-ugnay sa isa't isa (untied embeddings). Ang tokenizer — SentencePiece BPE na may pangangalaga ng mga espasyo, simbolo-bawat-simbolo na pagbubukod ng mga digit at byte-level na fallback, ang laki ng bokabularyo — 256,000.[8][3]
Mga Arkitektural na Parameter ng Nemotron‑4
| Parameter | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Bilang ng mga parameter | 15 bilyon (3,2 bilyon embed.) | 340 bilyon (9,4 bilyon embed.) |
| Bilang ng mga layer | 32 | 96 |
| Nakatagong dimensyon | 6144 | 18 432 |
| Mga ulo ng atensyon | 48 | 96 |
| Mga KV‑ulo (GQA) | 8 | 8 |
| Haba ng konteksto | 4096 | 4096 |
| Laki ng bokabularyo | 256 000 | 256 000 |
Mga pinagkukunan: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Hybrid na Arkitektura ng Mamba‑Transformer (Nemotron‑H)
Sa mga modelo ng Nemotron‑H, ang mga karaniwang bloke ng self-attention ay bahagyang pinalitan ng mga bloke ng Mamba‑2 — mga modelo ng estado ng espasyo (State Space Models, SSM). Sa autoregressive na pagbuo, ang bawat layer ng self-attention ay nangangailangan ng na mga operasyon at memorya bawat hakbang (dahil sa KV‑cache), habang ang mga layer ng Mamba ay nagbibigay ng pare-parehong gastos sa memorya at pagkalkula para sa bawat token na nabuo.[12]
Ang Mamba‑2 ay inilarawan ng recurse na relasyon[18]:
kung saan ang — nakatagong estado, — diagonal na matris ng paglipat ng estado, at — mga matris ng proyeksyon, — input na token, — output na signal. Sa Mamba‑2, ang mga matris na , , ay nakasalalay sa input (input‑dependent), na nagpapaiba sa modelo mula sa mga klasikal na linear SSM.
Sa Nemotron‑H‑56B, ginagamit ang 54 layer ng Mamba‑2 + 54 layer ng MLP + 10 layer ng self-attention, at ang mga layer ng atensyon ay pantay na inilalagay sa pagitan ng mga layer ng Mamba. Ang modelo ay sinanay sa 20 trilyong token sa format na FP8 (per‑tensor scaling) sa 6144 GPU H100. Ang bersyon ng Nemotron‑H‑8B ay naglalaman ng 24 layer ng Mamba‑2, 24 layer ng MLP at 4 layer ng self-attention; ang pagsasanay ay isinagawa sa 15 trilyong token.[12]
Arkitektura ng MoE ng Nemotron 3
Ang mga modelo ng Nemotron 3 (Disyembre 2025) ay pinagsasama ang tatlong arkitektural na bahagi: Mamba‑2, Transformer at Mixture‑of‑Experts.[1][2] Ang Nemotron 3 Nano (30B‑A3B) ay naglalaman ng 52 layer: 23 layer ng Mamba‑2 + MoE, 23 layer ng MoE at 6 layer ng GQA‑attention. Ang bawat layer ng MoE ay kinabibilangan ng 128 na na-route (routed) na eksperto + 1 karaniwang (shared) eksperto, kung saan 6 na eksperto ang naa-activate para sa bawat token. Ang pagruruta ay isinasagawa ng nao-train na MLP‑router na may sigmoid gating. Ang pagbabalanse ng load ay isinasagawa nang walang auxiliary na function ng pagkawala (aux‑loss‑free). Ang kabuuang bilang ng mga parameter ay 31,6 bilyon, ngunit ang mga aktibo para sa bawat token ay 3,2 bilyon lamang.[2]
Ang normalization — RMSNorm[19]. Walang mga positional embedding sa mga bahagi ng Mamba (ang impormasyon ng posisyon ay implicit sa estado ng SSM). Ginagamit ang mga di-nakataling embedding, walang dropout at bias sa mga linear na layer.[2]
Mga Pagpapalawak sa Super/Ultra: LatentMoE at Multi‑Token Prediction
Ang mga modelo ng Super at Ultra mula sa pamilyang Nemotron 3 ay gumagamit ng dalawang karagdagang arkitektural na inobasyon:
- Latent MoE (LatentMoE) — proyeksyon ng input na representasyon sa latent na espasyo ng mas maliit na dimensyon bago ang pagruruta, na nagbibigay-daan sa pagdaragdag ng bilang ng mga eksperto nang may katulad na gastos sa pagkalkula at pagpapataas ng katumpakan nang walang pagbaba ng throughput.[1]
- Multi‑Token Prediction (MTP) — sabay-sabay na hula ng ilang susunod na token, na ginagamit upang mapabuti ang kalidad ng mahahabang teksto at speculative decoding sa panahon ng inference.[1]
Ang pagsasanay ng Super at Ultra ay isinasagawa sa format na NVFP4 — isang 4-bit na numerical na format ng NVIDIA sa arkitektura ng Blackwell.[1]
Mga Paraan ng Pag-compress ng Modelo: Minitron, Puzzle, MiniPuzzle
Para sa paglikha ng mga compact na modelo, gumagamit ang NVIDIA ng ilang mga diskarte:
- Minitron — isang paraan ng structured pruning at knowledge distillation. Sinisiyasat ang dalawang uri ng pruning: sa lalim (pag-aalis ng mga layer) at sa lapad (sabay-sabay na pagbabawas ng mga dimensyon ng mga nakatagong layer, mga ulo ng atensyon at mga MLP projection). Ang paglalapat ng Minitron sa Nemotron‑4 15B ay nagbibigay ng mga modelo na 8B at 4B na may pagbabawas ng gastos sa pagsasanay ng hanggang 40 beses kumpara sa pagsasanay mula sa simula.[20]
- Puzzle — isang algorithm ng Neural Architecture Search (NAS), na pumipili ng pinakamainam na configuration ng bawat bloke (bilang ng mga KV‑ulo, laki ng FFN, pagkakaroon/kawalan ng atensyon) na may block-wise distillation. Ganito ang pagsasagawa ng pag-compress ng Llama 3.1 405B sa 253B (Llama‑Nemotron Ultra), at ng Llama 3.3 70B — sa 49B (Llama‑Nemotron Super).[21]
- MiniPuzzle — isang pagpapalawak ng Puzzle para sa mga hybrid na arkitektura, na nag-compress ng Nemotron‑H‑56B sa 47B na may paggastos ng 63 bilyong token lamang ng distillation. Sa katulad na katumpakan, ang na-compress na modelo ay 20% na mas mabilis na gumagawa ng output.[12]
Mga Paraan ng Pagkakatugma
HelpSteer at HelpSteer2
HelpSteer — isang koleksyon ng 37,120 halimbawa (lisensya CC‑BY‑4.0), na nilikha kasama ang Scale AI, kung saan ang bawat sagot ay na-annotate ayon sa limang katangian: kapaki-pakinabagan (helpfulness), kawastuan (correctness), pagkakaugnay-ugnay (coherence), kumplikado (complexity) at maraming salita (verbosity) sa sukat ng Likert na 0–4.[22]
HelpSteer2 — isang na-update na koleksyon ng 21,362 halimbawa (10,681 prompt × 2 sagot), kung saan mahigit 95% ng mga prompt ay kinuha mula sa ShareGPT (tunay na mga kahilingan ng gumagamit). Humigit-kumulang 50% ng mga anotasyon ay na-filter bilang hindi sapat ang kalidad. Ang extension na HelpSteer2‑Preference ay nagdaragdag ng mga pares na kagustuhan ng mga annotator, na nagbibigay-daan sa pagsasanay ng parehong regression at pairwise na mga modelo ng gantimpala sa parehong datos.[23][24]
SteerLM
SteerLM — isang paraan ng SFT (Supervised Fine‑Tuning) na may kondisyunal na pagbabatay sa mga katangian (helpfulness, correctness, coherence, complexity, verbosity), na nagbibigay-daan sa gumagamit na kontrolin ang istilo ng sagot sa panahon ng inference. Ang pipeline ay kinabibilangan ng: (1) pagsasanay ng modelo ng paghula ng katangian (APM) sa HelpSteer, (2) paglalagay ng label sa datos gamit ang APM, (3) SFT na may kondisyunal na pagbabatay sa mga target na halaga ng katangian, (4) bootstrapping.[25]
DPO at RPO
DPO (Direct Preference Optimization) — isang paraan ng direktang pag-optimize ng mga kagustuhan nang walang tahasang modelo ng gantimpala, na ginagamit sa mga pipeline ng Nemotron‑4 340B Instruct at Nemotron Nano 2.[26]
RPO (Reward‑aware Preference Optimization) — isang pinag-isang mathematical framework ng NVIDIA, na nagpapangalap ng DPO, IPO, SimPO, REINFORCE at SteerLM 2.0 bilang mga espesyal na kaso. Binabawasan ng RPO ang distansya sa pagitan ng mga hula ng implicit na modelo ng gantimpala at ng target na tahasang modelo[27]:
kung saan ang — tahasang modelo ng gantimpala, — nao-train na patakaran, — sangguniang patakaran, — function ng distansya, / — pinaboran/tinanggihang sagot. Ang RPO ay ginagamit sa pagsasanay ng Nemotron‑4 340B Instruct at mga modelo ng Llama‑Nemotron.[27][3][11]
Multi-environment na Reinforcement Learning (RLVR)
Sa Nemotron 3, ginagamit ang Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — sabay-sabay na pagsasanay sa maraming kapaligiran sa loob ng NeMo Gym: kompetitibong matematika, programming, QA, tool‑use, instruction‑following, long‑context. Ang algorithm — GRPO (Group Relative Policy Optimization) na may masked importance sampling.[2][14]
Sinusuportahan ng Nemotron 3 ang granular na kontrol ng badyet ng pangangatwiran (reasoning budget control): maaaring magtakda ang gumagamit ng limitasyon ng token para sa thinking trace sa pamamagitan ng flag sa chat template (pagsalit ng «detailed thinking on/off» o paglilimitasyon ng haba).[2]
Linya ng mga Modelo
Buod na Talahanayan
| Modelo | Taon | Kabuuan / Mga Aktibong Parameter | Konteksto | Arkitektura | Mga Pangunahing Katangian |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 araw |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34,3% |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98% synthetic na datos ng alignment |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1% |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | NAS‑compression mula sa Llama 3.1 8B |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Mula sa Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Mula sa Llama 3.1 405B; GPQA 76,0% |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hybrid na Mamba‑Transformer | 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hybrid na Mamba‑Transformer | 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hybrid na Mamba‑Transformer | MiniPuzzle mula sa 56B; +20% bilis |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hybrid na Mamba‑Transformer | 20T token; Minitron‑distillation |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hybrid na Mamba‑Transformer MoE | 25T token; 128 eksperto, 6 aktibo |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hybrid na LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hybrid na LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Arkitektura: 32 layer, hidden dimension 6144, 48 ulo ng atensyon, 8 KV‑ulo (GQA). Ang kabuuang bilang ng mga parameter — 15 bilyon (3,2 bilyon embedding + 12,5 bilyon non‑embedding). Mga resulta: MMLU — 64,2% (5‑shot), BBH — 58,7% (3‑shot), GSM8K — 46,0% (8‑shot, maj@1), HumanEval — 31,6% (0‑shot, pass@1). Sa mga multilingual na benchmark (XCOPA, TyDiQA‑GoldP, MGSM) nalampasan ng modelo ang mga modelo na apat na beses na mas malaki.[8]
Nemotron‑4 340B
Arkitektura: 96 layer, hidden dimension 18 432, 96 ulo ng atensyon, 8 KV‑ulo.
Nemotron‑4 340B Base ay nagpakita ng: MMLU — 81,1% (5‑shot), BBH — 85,4% (3‑shot), HumanEval — 57,3% (0‑shot), ARC‑Challenge — 94,3% (25‑shot).[3]
Nemotron‑4 340B Instruct ay dumaan sa multi-stage na pagkakatugma: Code SFT → General SFT → DPO → RPO (3 rounds). Mga resulta: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7% (0‑shot), GSM8K — 92,3% (0‑shot), HumanEval — 73,2% (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]
Nemotron‑4 340B Reward ay pinapalitan ang huling layer ng softmax ng isang linear na proyeksyon ng nakatagong estado ng huling layer sa isang vector ng 5 katangian ng HelpSteer2. Ang panghuling gantimpala ay isang weighted na kabuuan ng limang katangian. Ang pagsasanay ay isinagawa sa loob ng 2 epoch sa datos ng HelpSteer2 (batch size 128). Sa RewardBench, umabot ang modelo sa 92,0%, na nalampasan ang GPT‑4o (84,7%), Gemini 1.5 Pro (88,1%) at Claude‑3‑Opus (80,7%) sa oras ng publikasyon.[3]
| Modelo | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | 41,5% | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | 34,4% | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | 30,9% | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | 38,8% | 8,26 |
Pinagkukunan: arXiv:2406.11704, talahanayan 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward ay sinanay gamit ang hybrid na paraan na pinagsasama ang Bradley‑Terry (mga pares na kagustuhan) at SteerLM‑regression (multi-attribute na pagtatasa sa sukat ng Likert). Ang pagsasanay ay isinagawa nang eksklusibo sa datos ng HelpSteer2 (CC‑BY‑4.0). Sa RewardBench, umabot ang modelo sa 94,1%, na nanguna sa unang lugar sa oras ng publikasyon.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct ay nakahanay gamit ang RLHF na may algorithm na REINFORCE (hindi PPO) at modelo ng gantimpala na Nemotron‑70B‑Reward. Imprastraktura — NeMo‑Aligner na may acceleration ng TRT‑LLM.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
Isang pamilya ng mga modelo ng pangangatwiran na nakuha mula sa Llama 3.x gamit ang mga paraan ng NAS, distillation at pinahabang post-training.[11]
| Modelo | Mga Parameter | Base na Modelo | Konteksto |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 bilyon | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 bilyon | Minitron 4B (mula sa Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | 49 bilyon | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 bilyon | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Isang limang-hakbang na pipeline ng pagsasanay: (1) NAS + FFN Fusion, (2) distillation + patuloy na pre-training, (3) SFT (kabilang ang mga trace ng pangangatwiran ng DeepSeek‑R1), (4) malawakang RL (GRPO para sa Ultra, REINFORCE/RLOO + Online RPO para sa Nano), (5) pagkakatugma para sa diyalogo.[11]
Ang mga modelo ay nanguna sa pagitan ng mga bukas na LLM sa pagsuporta ng naka-toggle na mode ng pangangatwiran (reasoning toggle): kapag pinagana («detailed thinking on» sa system prompt), ang modelo ay bumubuo ng chain-of-thought sa mga tag na <think>...</think> bago ang sagot; kapag naka-off — sumasagot nang direkta.[11]
Mga resulta ng Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Para sa paghahambing: DeepSeek‑R1 (671B total / 37B aktibo) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Ang Ultra ay ina-host sa isang node na 8×H100.[11]
Nemotron‑H (Abril 2025)
Isang pamilya ng siksik na hybrid na modelo, na sinanay mula sa simula at idinisenyo para sa mga gawaing may mahabang pagbuo. Ang Nemotron‑H‑56B ay sinanay sa 20 trilyong token sa FP8 — isa sa pinakamalaking pampublikong eksperimento sa FP8 pre-training. Ang Nemotron‑H‑47B ay nakuha sa pamamagitan ng pag-compress ng 56B gamit ang paraan ng MiniPuzzle (63 bilyong token ng distillation) at nagkakasya sa memorya ng isang RTX 5090 (FP4) na may konteksto na ~1M token.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Pinagkukunan: arXiv:2504.03624.[12]
Sa pagbuo na may 65,536 input at 1024 output na token sa H100, ang modelo ng Nemotron‑H‑47B ay 2,9 beses na mas mabilis kaysa sa Qwen‑2.5‑72B at Llama‑3.1‑70B.[12]
Nemotron Nano 2 (Agosto 2025)
Isang hybrid na modelo ng Mamba‑Transformer para sa pangangatwiran. Nemotron‑Nano‑12B‑v2‑Base — ang magulang na modelo na may 62 layer (pangunahin Mamba‑2 + MLP + 4 layer ng atensyon), na sinanay sa 20 trilyong token sa FP8 mula sa simula. Mula rito, gamit ang pinahabang Minitron, nakuha ang Nemotron‑Nano‑9B‑v2, na may kakayahang gumana sa konteksto ng 128K token sa isang GPU na NVIDIA A10G (22 GB, BF16). Post-training: SFT (80 bilyong token, kabilang ang mga trace ng DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Sa mga benchmark ng pangangatwiran, ang modelo ay maihahambing sa Qwen3‑8B sa katumpakan, ngunit nagkakamit ng 3–6 beses na mas mabilis na pagbuo sa mga mahabang output na pagkakasunod-sunod.[13]
Nemotron 3 Nano 30B‑A3B
Inilabas noong Disyembre 2025. Mga parameter: 31,6 bilyon kabuuan, 3,2 bilyon aktibo. Arkitektura: 52 layer, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 na na-route na eksperto + 1 karaniwang eksperto, 6 aktibo bawat token. Konteksto — hanggang 1,048,576 token. Pagsasanay sa 25 trilyong token (WSD‑iskedyul, batch size 3072, cutoff ng datos — Hunyo 2025) sa dalawang yugto: Phase 1 — 23,5 trilyon (magkakaibang datos), Phase 2 — 1,5 trilyon (mataas na kalidad na datos) + 121 bilyong token ng long‑context CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — mga halaga mula sa mga pangalawang pinagkukunan; mga kondisyon ng pagpaparami — NeMo Evaluator SDK. Pinagkukunan: arXiv:2512.20848.[2][28]
Throughput (8K input / 16K output, single H200): 3,3 beses na mas mataas kaysa sa Qwen3‑30B‑A3B‑Thinking at 2,2 beses na mas mataas kaysa sa GPT‑OSS‑20B.[2]
Mga Karagdagang Modelo at Direksyon
- OpenReasoning‑Nemotron (Hulyo 2025) — isang serye ng mga modelo na may 1,5B–32B na parameter, batay sa Qwen 2.5 at na-fine-tune sa datos ng DeepSeek‑R1‑0528. Ang variant na 32B na may GenSelect@64 ay nalampasan ang o3 (high) sa ilang mga benchmark ng matematika.[29]
- Nemotron Elastic (arXiv:2511.16664) — isang framework ng mga nested na submodel (6B, 9B, 12B) sa loob ng isang magulang na modelo, na nagbabawas ng gastos ng pagsasanay ng 360 beses kumpara sa pagsasanay mula sa simula.[30]
- Nemotron‑CrossThink — isang framework ng multi-domain na reinforcement learning na higit sa mga gawaing matematika, na nagbigay ng +30,1% sa MATH‑500 at +12,8% sa MMLU‑PRO.[31]
- Nemotron‑UltraLong — pagpapalawak ng konteksto hanggang 4 milyong token.[32]
- Jet‑Nemotron — post-training NAS para sa mga compact na hybrid na modelo na 2B/4B.[33]
Mga Espesyalisadong Modelo
Sa ecosystem ng Nemotron ay mayroon ding mga modelo para sa mga espesyalisadong gawain:
- Nemotron Nano V2 VL — isang vision‑language na modelo para sa OCR, pagproseso ng mga talahanayan at video.[34]
- Nemotron Parse 1.1 — isang modelo para sa OCR at pagkuha ng istruktura ng mga dokumento.[35]
- Nemotron ColEmbed V2 — isang modelo ng embedding para sa visual na paghahanap ng dokumento (late interaction).[36]
- Nemotron Speech — mga modelo para sa awtomatikong pagkilala ng pananalita (ASR), synthesis ng pananalita (TTS) at machine translation (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — isang modelo ng pag-uuri ng hindi ligtas na nilalaman sa 23 kategorya sa 9 wika na may katumpakan na 84,2%.[37]
Datos para sa Pre-training
Komposisyon ng Datos ng Nemotron‑4
Ang pre-training corpus ng Nemotron‑4 15B at 340B ay binubuo ng tatlong pangunahing kategorya: mga tekstong Ingles (70%), mga multilingual na teksto sa 53 wika (15%) at source code sa 43 na wika ng programming (15%). Inilapat ang deduplication sa antas ng dokumento (exact at near-duplicate), pati na rin ang pag-filter gamit ang mga modelo ng wika at mga heuristic. Ang modelo na 15B ay sinanay sa 8 trilyong token, ang modelo na 340B — sa 9 trilyon (8 trilyon ng pre-training + 1 trilyon ng patuloy na pagsasanay na may muling pagtitimbang ng mga mataas na kalidad na pinagkukunan).[8][3]
Nemotron‑CC
Ang dataset na Nemotron‑CC ay nabuo mula sa Common Crawl gamit ang ensemble ng mga classifier ng kalidad at synthetic na pagsasalita muli ng mga teksto. Ang kabuuang dami — 6,3 trilyong token (4,4 trilyon na deduplicated + 1,9 trilyon na synthetic na muling pagsasalita). Ang pipeline ay isinama sa kasangkapan ng NeMo Curator. Ang gawain ay tinanggap bilang Long Paper sa kumperensyang ACL 2025.[38]
Nemotron‑CC‑Math
Isang matematika-oriented na subset na may dami na 133 bilyong token, na kinuha mula sa Common Crawl gamit ang pipeline na Lynx + LLM na may pangangalaga ng istruktura ng mga mathematical na formula at code sa LaTeX.[39]
Datos ng Nemotron 3 Nano
Ang pre-training ng Nemotron 3 Nano ay isinagawa sa 25 trilyong token. Ang koleksyon ay kinabibilangan ng: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 at mga espesyalisadong STEM‑dataset. Para sa long‑context na pagsasanay, ginamit ang karagdagang 121 bilyong token ng CPT.[2]
Nemotron Pretraining Dataset v1
Isang synthetic na nabuong koleksyon, sumasaklaw sa STEM, mga akademikong teksto, mga gawaing pangangatwiran at mga multilingual na domain; naglalaman ng mahigit 10 trilyon na token ng wika at 18 milyong sample para sa SFT. Ang lahat ng dataset ay ipinamamahagi sa ilalim ng mga bukas na permissive na lisensya.[40]
Pipeline ng Synthetic na Pagbuo ng Datos (SDG)
Ang pipeline, na inilarawan sa ulat tungkol sa Nemotron‑4 340B, ay kinabibilangan ng mga sumusunod na hakbang[3]:
- Pagbuo ng mga prompt: synthetic na isa at dalawang-bahagi na mga kahilingan, na nabuo gamit ang Mixtral‑8x7B‑Instruct‑v0.1 (lisensya Apache 2.0) ayon sa mga template ng Open QA, Writing, Closed QA, Math & Coding.
- Pagbuo ng mga sagot: maraming sagot mula sa mga intermediate na bersyon ng mga modelo upang matiyak ang pagkakaiba-iba.
- Pagtatasa ng kalidad: tatlong diskarte — Ground‑Truth‑as‑a‑Judge (para sa mga gawain na may nabe-verify na sagot), LLM‑as‑Judge (paghahambing ng mga pares ng sagot ng modelo ng wika), Reward‑Model‑as‑Judge (paggamit ng Nemotron‑4‑340B‑Reward).
- Iteratibong pagkakatugma mula sa mahina hanggang sa malakas na mga modelo (weak‑to‑strong).
Mula sa ~20,000 na mga halimbawa na na-annotate ng tao (10,000 para sa SFT, 10,000 HelpSteer2 para sa modelo ng gantimpala), na-synthesize ang lahat ng natitirang dami ng datos ng pagkakatugma.[3]
Quantization at Pag-optimize ng Inference
Sinusuportahan ng mga modelo ng Nemotron 3 Nano ang Post‑Training Quantization (PTQ) sa FP8 gamit ang ModelOpt at Megatron‑LM. Inilalapat ang selective quantization — ang mga layer ng attention at bahagi ng Mamba ay pinanatili sa BF16 upang mapanatili ang kalidad; ang iba ay na-quantize sa FP8. Ayon sa teknikal na ulat, nagbibigay ito ng ~99% na retention ng katumpakan.[2] Sinusuportahan din ng Nano ang inference sa format na NVFP4.[1]
Buod na Talahanayan ng mga Benchmark sa Bawat Henerasyon
| Modelo | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Mga Kondisyon |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64,2% | 46,0% | 31,6% | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81,1% | — | 57,3% | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78,7% | 92,3% | 73,2% | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | Okt. 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0%, AIME 80,8% |
| Nemotron‑H‑47B | 83,6% | 93,3% | 61,0% | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1%, LCB 68,3% |
Ang paghahambing ay dapat bigyang-kahulugan nang may pag-iingat: ang mga kondisyon ng pagtatasa, mga bersyon ng benchmark at mga petsa ng mga pagsubok ay nag-iiba-iba sa pagitan ng mga henerasyon. Ang mga resulta ay kinuha mula sa mga teknikal na ulat ng NVIDIA; ang mga independyenteng pagtatasa ay maaaring mag-iba (tingnan ang seksyon na «Mga Limitasyon»).[8][3][9][11][12][2]
Paglalapat
Pag-deploy sa pamamagitan ng NVIDIA NIM
Ang NVIDIA NIM — isang set ng mga na-optimize na containerized na microservice para sa inference na may OpenAI‑compatible na API. Ang mga modelo ng Nemotron ay available bilang mga NIM‑microservice sa platform na build.nvidia.com. Sinusuportahan ng NIM ang mga format na FP8, BF16, NVFP4 at pag-deploy sa pamamagitan ng mga Helm chart sa Kubernetes. Ang mga modelo ay compatible rin sa mga independyenteng framework: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Synthetic na Pagbuo ng Datos
Ang Nemotron‑4 340B ay idinisenyo para magamit bilang generator ng synthetic na datos: ang modelo ng Instruct ay bumubuo ng mga sagot, ang modelo ng Reward ay nagtatasa at nagfi-filter sa kanila. Ang lisensya ng NVIDIA Open Model License ay tahasan na nagpapahintulot ng paggamit ng mga output ng modelo para sa pagsasanay ng ibang mga modelo. Ayon sa datos ng ServiceNow, 15% ng pre-training data ng kanilang modelo na Apriel 1.6 ay nakuha mula sa mga dataset ng Nemotron.[3][15][41]
Mga Ahenteng Sistema
Ang mga modelo ng pamilyang Nemotron 3 (Nano, Super, Ultra) ay inilaan para sa mga multi-agent na workload: pagpaplano, retrieval, pagtawag ng mga kasangkapan (tool use). Ipinapakita ng Nemotron 3 Nano ang resulta na 38,76% sa SWE‑Bench (kasama ang OpenHands) at 49,04% (avg) sa TauBench V2.[2]
Mga Corporate na Implementasyon
Sa mga ipinahayag na kasosyo: ServiceNow (pinagsamang modelo na Apriel Nemotron 15B para sa automation ng mga proseso ng trabaho), CrowdStrike (platform na Charlotte AI), Perplexity (pagruruta ng mga kahilingan), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Ang mga modelo ay available sa AWS Amazon Bedrock; nakatakdang suportahan ang Google Cloud, CoreWeave, Nebius.[15]
Mga Limitasyon at Mga Bukas na Isyu
Mga Independyenteng Pagtatasa at Mga Pagkakaiba mula sa Datos ng NVIDIA
Ang mga independyenteng pagtatasa ay nagpapakita ng mga pagkakaiba mula sa mga resulta na ibinibigay ng NVIDIA. Ayon sa datos ng Artificial Analysis (Pebrero 2026), ang Llama‑Nemotron‑Ultra 253B (reasoning) ay nakatanggap ng Intelligence Index na 15 na may median na 26 para sa mga modelo ng katulad na laki. Sa platform ng Chatbot Arena (LMArena), ang mga modelo ng Nemotron ay nasa gitna ng ranggo: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147 na posisyon), Nemotron 3 Nano — 1317 ±6 (~164 na posisyon).[42][43]
Maraming Salita
Ipinapakita ng mga modelo ng Nemotron ang nadagdagang pagiging maraming salita: sa pagtatasa ng Artificial Analysis, ang modelo ng Nemotron 3 Nano ay nakabuo ng 140 milyong token (na may median na 12 milyon para sa ibang mga modelo), na nagpapataas ng gastos ng inference. Ang pagsusuri ng DEV Community ay nagpakita na ang Llama‑3.1‑Nemotron‑70B‑Instruct, habang pormal na nangunguna sa mga awtomatikong benchmark, ay nagpakita ng hindi sapat na katumpakan sa ilang mga praktikal na gawain, at ang mataas na marka sa mga benchmark na katulad ng Arena ay maaaring ipinaliwanag sa pamamagitan ng kagustuhan para sa mahabang at kumpiyansang, ngunit hindi palaging tumpak na mga sagot.[42][44]
Mga Hallucination at Bias
Tinutukoy ng NVIDIA sa mga card ng modelo na ang mga modelo ay maaaring «nagpapatibay ng mga pagkiling at bumubuo ng mga nakakalason na sagot, lalo na sa mga nakakalason na prompt», pati na rin «gumagawa ng hindi tumpak na impormasyon, nag-aaalis ng mga pangunahing detalye». Ang pagiging bukas ng mga timbang at datos ay nagbibigay-daan sa panlabas na pag-audit.[11][13]
Mga Kinakailangan sa Pagkalkula
Ang mga siksik na modelo (Nemotron‑4 340B) ay nangangailangan ng cluster ng 768 node ng DGX H100 para sa kumpletong pagsasanay, na naglilikha ng limitasyon sa pagpaparami para sa mga akademikong pangkat na walang access sa katulad na imprastraktura. Ang mahabang konteksto (1M) sa inference ay nangangailangan ng malaking dami ng VRAM.[3][2]
Degradasyon sa Pagpapalawak ng Konteksto
Sa pagpapalawak ng konteksto sa sobrang mahabang pagkakasunod-sunod, sinusunod ang degradasyon ng mga resulta sa mga benchmark na may maikling konteksto.[32]
Quantization ng mga Hybrid na Arkitektura
Ang paggamit ng napakababang bitness (FP8/NVFP4) sa mga arkitektura ng Mamba‑Transformer ay nagdudulot ng maliit na pagbaba ng katumpakan (~1% sa ilang mga benchmark). Ang problemang ito ay nalulutas sa pamamagitan ng paglalapat ng selective quantization, na nagpapalubha sa arkitektura ng mga compiler at mga server ng inference.[2][1]
Iba pang Mga Bukas na Isyu
- Pag-asa sa mga benchmark na may posibleng kontaminasyon ng datos ng pagsasanay.
- Kawalan ng mga standardisadong protocol ng paghahambing ng mga hybrid na SSM‑Transformer na arkitektura sa mga purong modelo ng Transformer.
- Tanong ng scalability ng diskarteng MoE sa mga gawaing nangangailangan ng malalim na pangangatwiran na may maliit na bilang ng mga eksperto bawat token.
- Ang datos tungkol sa Super/Ultra sa oras ng Disyembre 2025 ay panimula; ang mga kumpletong benchmark ay inaasahang darating pagkatapos ng paglabas.[1]
Mga Etikal at Regulasyong Aspeto
Kaligtasan sa Yugto ng Pagbuo
Sa yugto ng pagbuo, inilalapat ang: pagtatasa ayon sa framework ng AEGIS (13 kategorya ng kaligtasan ng nilalaman), vulnerability scanner na garak, manu-manong «red‑teaming».[37]
Kaligtasan sa Yugto ng Inference
NeMo Guardrails — isang bukas na toolkit (lisensya Apache 2.0), na nagdaragdag ng mga naa-program na hadlang sa mga LLM‑sistema. Ang microservice ay humaharang sa mga input at output, inilalapat ang mga nako-configure na tseke: kontrol ng paksa, pagtuklas ng PII, beripikasyon ng «grounding» ng RAG, pagtuklas ng mga atakeng jailbreak (kabilang ang proteksyon mula sa mga iniksyon ng code batay sa YARA), multilingual na multimodal na pag-uuri ng kaligtasan.[45]
Para sa Nemotron 3, inilathala ang isang set ng ~11,000 na na-label na trace ng OpenTelemetry mula sa mga makatotohanang senaryo na may paggamit ng mga kasangkapan, na inilaan para sa pagtatasa ng kaligtasan ng mga ahente.[1]
Pagpapaliwanag ng Lisensya
| Mga Modelo | Lisensya |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (minana mula sa Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
Ang NVIDIA Nemotron Open Model License ay nagpapahintulot ng komersyal na paggamit, paglikha at pamamahagi ng mga derivative na gawa, hindi nangangailangan ng attribution (sa pangangalaga ng file na NOTICE), hindi nagtatakda ng mga limitasyon sa bilang ng mga gumagamit at tahasan na nagpapahintulot ng paggamit ng mga output ng modelo para sa pagsasanay ng ibang mga modelo.[46] Ang mga modelo batay sa Llama ay nagmamana ng mga limitasyon ng Meta, kabilang ang threshold na 700 milyong buwanang aktibong gumagamit.[11]
Para sa Nemotron 3 Nano, inilathala ng NVIDIA: mga timbang ng modelo, mahigit 10 trilyong token ng datos ng pagsasanay, mga recipe ng pagsasanay, mga codebase (NeMo, Megatron‑LM, NeMo‑Aligner), mahigit 10 kapaligiran ng reinforcement learning na may 900,000+ na gawain.[1][2]
Mga Pananaw at Direksyon ng Pananaliksik
Ang mga pinakamalapit na inilabas ay kinabibilangan ng Nemotron 3 Super (~100 bilyong parameter, ~10 bilyon aktibo) at Nemotron 3 Ultra (~500 bilyon, ~50 bilyon aktibo), na inaasahan sa unang kalahati ng 2026. Ang parehong mga modelo ay gagamit ng LatentMoE, MTP at pagsasanay sa format na NVFP4 sa arkitektura ng Blackwell.[1]
Ang estratehikong direksyon ng NVIDIA — pagpoposisyon ng Nemotron hindi bilang isang solong modelo, kundi bilang isang imprastraktural na layer para sa mga multi-agent na sistema, kung saan ang iba't ibang modelo ng pamilya ay ginagamit para sa iba't ibang gawain na may pagruruta ayon sa kumplikado.[1][15]
Mga pangunahing direksyon ng pananaliksik:
- Pagpapaunlad ng mga hybrid na arkitektura — karagdagang integrasyon ng mga layer ng SSM sa mekanismo ng atensyon para sa scalable na mahabang konteksto.[12]
- Mga multi-level na paraan ng pag-compress — pagpapaunlad ng Minitron, Puzzle, MiniPuzzle at Nemotron Elastic.[20][21][30]
- Multi-domain na reinforcement learning — Nemotron‑CrossThink para sa pagpapalawak ng RL higit sa mga gawaing matematika.[31]
- Pagpapalawak ng konteksto — Nemotron‑UltraLong hanggang 4 milyong token.[32]
- Multimodality — pagpapalawak sa larangan ng vision‑language (Nemotron VL), pananalita (Nemotron Speech), visual na paghahanap ng dokumento (Nemotron ColEmbed V2).[34][35][36]
- Mga compact na hybrid na modelo — Jet‑Nemotron (NAS para sa mga modelo na 2B/4B).[33]
- Mga bukas na recipe — paglalathala ng mga kumpletong recipe ng pagsasanay at datos para sa pagpaparami at pag-customize ng komunidad.[14]
Tingnan Din
- Arkitektura ng Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (pamilya ng mga modelo ng Meta)
Mga Sanggunian
- NVIDIA Research — pahina ng Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — dokumentasyon ng Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Panitikan
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, Pebrero 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, Hunyo 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, Hunyo 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, Hulyo 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, Nobyembre 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, Enero 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, Abril 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, Mayo 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, Agosto 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, Agosto 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, Nobyembre 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, Disyembre 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, Disyembre 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Mga Tala
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/