Nemotron (NVIDIA) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — खुले भार (open weights) वाले बड़े भाषा मॉडलों (Large Language Model, LLM) का एक परिवार है, जिसे NVIDIA निगम के Applied Deep Learning Research (ADLR) प्रभाग द्वारा विकसित किया गया है। ये मॉडल Machine Learning और Natural Language Processing (NLP) के क्षेत्र से संबंधित हैं तथा कार्यों की एक विस्तृत श्रृंखला के लिए अभिप्रेत हैं: सिंथेटिक डेटा जनरेशन, तार्किक अनुमान (reasoning), एजेंटिक अनुप्रयोग (agentic AI) और NVIDIA के औद्योगिक हार्डवेयर पर तैनाती। यह परिवार विभिन्न आर्किटेक्चर और पैमानों के मॉडलों को एकजुट करता है: 4 अरब से लेकर ~500 अरब पैरामीटर तक, जिसमें Nemotron‑4 श्रृंखला (2024) के सघन (dense) decoder‑only Transformer मॉडल, हाइब्रिड Mamba‑Transformer (Nemotron‑H, 2025) और Nemotron 3 श्रृंखला (2025) में Mixture-of-Experts (MoE) सहित हाइब्रिड Mamba‑Transformer शामिल हैं। मार्च 2026 तक इस परिवार में 20 से अधिक मॉडल हैं, जो पाठ जनरेशन, तर्कशास्त्र, दस्तावेज़ों की दृश्य समझ, सूचना निष्कर्षण और उत्तर गुणवत्ता मूल्यांकन के कार्यों को कवर करते हैं। मॉडल मुख्यतः NVIDIA Open Model License और Llama Community License के अंतर्गत खुले भार के साथ जारी किए जाते हैं।[1][2][3]

इतिहास और पृष्ठभूमि

Nemotron परिवार का विकास जनरेटिव AI के लिए पूर्ण उपकरण स्टैक बनाने की NVIDIA की रणनीति के संदर्भ में किया जा रहा है: प्रशिक्षण अवसंरचना (DGX, GPU H100/B200 पर आधारित सुपरकंप्यूटर) से लेकर प्रशिक्षण प्लेटफॉर्म (NeMo Framework), संरेखण (NeMo‑Aligner), तैनाती (NIM — NVIDIA Inference Microservices) और सुरक्षा (NeMo Guardrails) तक।[4][5]

Nemotron‑3 8B (2023)

श्रृंखला का पहला सार्वजनिक रूप से उपलब्ध मॉडल — 8 अरब पैरामीटर और 4096 टोकन संदर्भ के साथ एक decoder Transformer, जिसे 53 प्राकृतिक और 37 प्रोग्रामिंग भाषाओं में 3.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया था। प्रशिक्षण 1024 GPU A100 पर 19 दिनों में किया गया। arXiv पर कोई औपचारिक तकनीकी रिपोर्ट प्रकाशित नहीं हुई। मॉडल NeMo Framework और Hugging Face के माध्यम से वितरित किया गया था, Chat (SFT और SteerLM) के संस्करण मौजूद थे। लाइसेंस — NVIDIA AI Foundation Models Community License।[6][7]

नामों के बारे में नोट: 2023 का «Nemotron‑3» और दिसंबर 2025 का «Nemotron 3» — अलग-अलग मॉडल हैं। पहला एक प्रारंभिक प्रोटोटाइप था, दूसरा MoE आर्किटेक्चर के साथ वर्तमान पीढ़ी है।

Nemotron‑4 15B (फरवरी 2024)

Nemotron‑4 श्रृंखला का पहला सार्वजनिक रूप से प्रलेखित संस्करण — 15 अरब पैरामीटर वाला मॉडल, जिसे 384 DGX H100 नोड्स (3072 GPU तक) पर ~13 कैलेंडर दिनों में 8 ट्रिलियन टोकन पर प्रशिक्षित किया गया। 8‑गुना tensor parallelism और 96 से 288 तक data parallelism का उपयोग किया गया। batch size 384 पर पीक MFU (Model FLOPs Utilization) 34.3% रही। आर्किटेक्चर — Grouped‑Query Attention (GQA) और Rotary Position Embeddings (RoPE) के साथ decoder‑only Transformer। प्रकाशन के समय बेंचमार्क परिणामों के अनुसार, मॉडल ने बहुभाषी कार्यों में अपने आकार के सभी तुलनीय खुले मॉडलों को पीछे छोड़ दिया, जिसमें कुछ ऐसे मॉडल भी शामिल थे जो आकार में चार गुना बड़े थे।[8]

Nemotron‑4 340B (जून 2024)

जून 2024 में Nemotron‑4 श्रृंखला का सबसे बड़ा मॉडल जारी किया गया — 340 अरब पैरामीटर (331.6 अरब गैर-एम्बेडिंग), जिसे 9 ट्रिलियन टोकन (8 ट्रिलियन प्री-ट्रेनिंग + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर पूर्व-प्रशिक्षित किया गया। प्रशिक्षण 768 DGX H100 नोड्स (6144 GPU तक) पर दिसंबर 2023 से मई 2024 तक 42.4% पीक MFU के साथ किया गया। परिवार में तीन संस्करण शामिल हैं: Base, Instruct और Reward। मॉडल का आकार इस प्रकार चुना गया कि यह FP8 परिशुद्धता प्रारूप में तैनाती के दौरान एक DGX H100 नोड (8 GPU) पर फिट हो सके। संरेखण (alignment) में उपयोग किए गए 98% से अधिक डेटा को एक पुनरावृत्त प्रक्रिया में श्रृंखला के मॉडलों द्वारा स्वयं सिंथेटिक रूप से उत्पन्न किया गया; सिंथेटिक डेटा जनरेशन पाइपलाइन पुनरुत्पादन के लिए खुली है।[3]

Llama‑3.1‑Nemotron‑70B (अक्टूबर 2024)

अक्टूबर 2024 में Meta Llama‑3.1‑70B‑Instruct से fine-tuned मॉडल जारी किए गए: Llama‑3.1‑Nemotron‑70B‑Instruct और Llama‑3.1‑Nemotron‑70B‑Reward। 1 अक्टूबर 2024 तक Instruct मॉडल तीन स्वचालित बेंचमार्क पर एक साथ पहले स्थान पर था: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench (GPT‑4‑Turbo) — 8.98। Reward मॉडल ने RewardBench पर 94.1% हासिल किया।[9][10]

हाइब्रिड आर्किटेक्चर की ओर संक्रमण (2025)

2025 में, श्रृंखला का विस्तार हाइब्रिड आर्किटेक्चर के साथ हुआ जो Mamba‑2 (State Space Model, SSM — अवस्था स्थान मॉडल) और Transformer परतों को संयोजित करते हैं। मार्च–मई 2025 में स्विचेबल reasoning मोड के साथ Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) reasoning मॉडलों का परिवार जारी किया गया।[11] अप्रैल 2025 में Nemotron‑H (arXiv:2504.03624) प्रकाशित हुआ — 8B, 56B और 47B पैरामीटर आकार के हाइब्रिड Mamba‑Transformer मॉडलों का परिवार।[12] अगस्त 2025 में Nemotron Nano 2 (9B‑v2, arXiv:2508.14444) प्रस्तुत किया गया।[13]

Nemotron 3 (दिसंबर 2025)

15 दिसंबर 2025 को तीसरी पीढ़ी की घोषणा की गई — Nano, Super और Ultra मॉडलों के साथ Nemotron 3 परिवार, जो 1 मिलियन टोकन तक की संदर्भ विंडो के साथ Mamba‑2, Transformer और MoE आर्किटेक्चर को एकजुट करता है। Nano तकनीकी रिपोर्ट के साथ जारी की गई; Super और Ultra 2026 की पहली छमाही के लिए निर्धारित हैं।[1][2][14][15]

सैद्धांतिक आधार

Nemotron‑4 में Transformer आर्किटेक्चर

Nemotron‑4 श्रृंखला के मॉडल causal attention के साथ मानक decoder Transformer आर्किटेक्चर पर बनाए गए हैं। टोकन अनुक्रम x1,x2,,xT की प्रायिकता को इस प्रकार factorize किया जाता है:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

जहाँ θ — मॉडल के पैरामीटर हैं।[8]

Attention mechanism को Grouped‑Query Attention (GQA) संस्करण में लागू किया गया है[16]:

Attention(Q,K,V)=softmax(QKdk)V,

जहाँ Q,K,V — queries, keys और values के मैट्रिक्स हैं; dk — attention head का आयाम है।

स्थिति एन्कोडिंग के लिए Rotary Position Embeddings (RoPE) का उपयोग किया जाता है[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

जहाँ xm — स्थिति m पर वेक्टर है, θi=100002i/d, d — वेक्टर का आयाम है।

MLP परतों में Squared ReLU activation का उपयोग किया जाता है: f(x)=(max(0,x))2, जो activation की विरलता (sparsity) सुनिश्चित करता है। मॉडलों में bias नहीं है, dropout का उपयोग नहीं किया जाता, और input तथा output embedding मैट्रिक्स एक-दूसरे से जुड़े नहीं हैं (untied embeddings)। Tokenizer — रिक्त स्थान संरक्षण, अंकों के वर्ण-दर-वर्ण विभाजन और byte-level fallback के साथ SentencePiece BPE है, शब्द कोश का आकार — 256,000।[8][3]

Nemotron‑4 के आर्किटेक्चरल पैरामीटर
पैरामीटर Nemotron‑4 15B Nemotron‑4 340B
पैरामीटरों की संख्या 15 अरब (3.2 अरब embed.) 340 अरब (9.4 अरब embed.)
परतों की संख्या 32 96
Hidden dimension 6144 18,432
Attention heads 48 96
KV‑heads (GQA) 8 8
संदर्भ लंबाई 4096 4096
शब्द कोश आकार 256,000 256,000

स्रोत: arXiv:2402.16819, arXiv:2406.11704।[8][3]

हाइब्रिड Mamba‑Transformer आर्किटेक्चर (Nemotron‑H)

Nemotron‑H मॉडलों में मानक self-attention ब्लॉक को आंशिक रूप से Mamba‑2 ब्लॉक — State Space Models (SSM) से प्रतिस्थापित किया गया है। Autoregressive जनरेशन के दौरान, प्रत्येक self-attention परत को प्रति चरण O(n) ऑपरेशन और मेमोरी की आवश्यकता होती है (KV‑cache के कारण), जबकि Mamba परतें प्रत्येक जनरेट किए गए टोकन के लिए स्थिर मेमोरी और कंप्यूटेशन लागत प्रदान करती हैं।[12]

Mamba‑2 को पुनरावृत्त संबंध द्वारा वर्णित किया जाता है[18]:

ht=Aht1+Bxt,yt=Cht,

जहाँ htN — छिपी हुई अवस्था (hidden state), AN×N — विकर्ण अवस्था संक्रमण मैट्रिक्स (diagonal state transition matrix), BN×1 और C1×N — projection matrices, xt — input token, yt — output signal है। Mamba‑2 में मैट्रिक्स A, B, C input पर निर्भर (input‑dependent) हैं, जो इस मॉडल को शास्त्रीय linear SSM से अलग करता है।

Nemotron‑H‑56B में 54 Mamba‑2 परतें + 54 MLP परतें + 10 self-attention परतें उपयोग की जाती हैं, जिसमें attention परतें Mamba परतों के बीच समान रूप से वितरित हैं। मॉडल को 6144 GPU H100 पर FP8 (per‑tensor scaling) प्रारूप में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। Nemotron‑H‑8B संस्करण में 24 Mamba‑2 परतें, 24 MLP परतें और 4 self-attention परतें हैं; प्रशिक्षण 15 ट्रिलियन टोकन पर किया गया।[12]

Nemotron 3 का MoE आर्किटेक्चर

Nemotron 3 (दिसंबर 2025) के मॉडल तीन आर्किटेक्चरल घटकों को एकजुट करते हैं: Mamba‑2, Transformer और Mixture‑of‑Experts।[1][2] Nemotron 3 Nano (30B‑A3B) में 52 परतें हैं: 23 Mamba‑2 + MoE परतें, 23 MoE परतें और 6 GQA‑attention परतें। प्रत्येक MoE परत में 128 routed experts + 1 shared expert शामिल हैं, जिनमें से प्रत्येक टोकन के लिए 6 experts सक्रिय होते हैं। रूटिंग sigmoid gating के साथ trainable MLP router द्वारा की जाती है। Load balancing बिना सहायक loss function (aux‑loss‑free) के लागू की जाती है। पैरामीटरों की कुल संख्या 31.6 अरब है, लेकिन प्रत्येक टोकन के लिए केवल 3.2 अरब active हैं।[2]

Normalization — RMSNorm[19]। Mamba भागों में positional embeddings अनुपस्थित हैं (स्थितीय जानकारी SSM अवस्था में अंतर्निहित है)। Untied embeddings का उपयोग किया जाता है, linear परतों में dropout और bias अनुपस्थित हैं।[2]

Super/Ultra में विस्तार: LatentMoE और Multi‑Token Prediction

Nemotron 3 परिवार के Super और Ultra मॉडल दो अतिरिक्त आर्किटेक्चरल नवाचार लागू करते हैं:

  • Latent MoE (LatentMoE) — रूटिंग से पहले input representation को छोटे आयाम के latent space में प्रक्षेपित करना, जो तुलनीय कंप्यूटेशनल लागत पर experts की संख्या बढ़ाने और throughput कम किए बिना सटीकता में सुधार करने की अनुमति देता है।[1]
  • Multi‑Token Prediction (MTP) — एक साथ कई अगले टोकनों की भविष्यवाणी करना, जिसका उपयोग लंबे पाठों की गुणवत्ता में सुधार और inference के दौरान speculative decoding के लिए किया जाता है।[1]

Super और Ultra का प्रशिक्षण NVFP4 प्रारूप में किया जाता है — Blackwell आर्किटेक्चर पर NVIDIA का 4‑बिट संख्यात्मक प्रारूप।[1]

मॉडल संपीड़न के तरीके: Minitron, Puzzle, MiniPuzzle

कॉम्पैक्ट मॉडल बनाने के लिए NVIDIA कई दृष्टिकोण लागू करता है:

  • Minitron — structured pruning और knowledge distillation की विधि। दो प्रकार के pruning का अध्ययन किया जाता है: depth-wise (परतों को हटाना) और width-wise (hidden layers, attention heads और MLP projections के आयामों को संयुक्त रूप से कम करना)। Nemotron‑4 15B पर Minitron लागू करने से 8B और 4B मॉडल प्राप्त होते हैं, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 40 गुना तक कम करते हैं।[20]
  • Puzzle — Neural Architecture Search (NAS) एल्गोरिदम जो block-wise distillation के साथ प्रत्येक ब्लॉक की इष्टतम कॉन्फ़िगरेशन (KV‑heads की संख्या, FFN आकार, attention की उपस्थिति/अनुपस्थिति) का चयन करता है। इसी तरह Llama 3.1 405B को 253B (Llama‑Nemotron Ultra) और Llama 3.3 70B को 49B (Llama‑Nemotron Super) में संपीड़ित किया गया।[21]
  • MiniPuzzle — हाइब्रिड आर्किटेक्चर के लिए Puzzle का विस्तार, जिसने केवल 63 अरब distillation टोकन की लागत पर Nemotron‑H‑56B को 47B में संपीड़ित किया। समान सटीकता पर, संपीड़ित मॉडल 20% तेज़ inference प्रदान करता है।[12]

संरेखण (Alignment) के तरीके

HelpSteer और HelpSteer2

HelpSteer — Scale AI के साथ मिलकर बनाया गया 37,120 उदाहरणों का एक सेट (CC‑BY‑4.0 लाइसेंस), जिसमें प्रत्येक उत्तर को पाँच विशेषताओं के अनुसार Likert scale 0–4 पर annotate किया गया है: उपयोगिता (helpfulness), शुद्धता (correctness), सुसंगति (coherence), जटिलता (complexity) और शब्दाडंबर (verbosity)।[22]

HelpSteer2 — 21,362 उदाहरणों (10,681 prompts × 2 उत्तर) का एक अद्यतन सेट, जहाँ 95% से अधिक prompts ShareGPT (वास्तविक उपयोगकर्ता प्रश्न) से लिए गए हैं। लगभग 50% annotations को अपर्याप्त गुणवत्ता के कारण फ़िल्टर किया गया। HelpSteer2‑Preference विस्तार annotators की युग्मित प्राथमिकताएँ जोड़ता है, जो एक ही डेटा पर regression और pairwise reward मॉडल दोनों को प्रशिक्षित करने की अनुमति देता है।[23][24]

SteerLM

SteerLM — विशेषताओं (helpfulness, correctness, coherence, complexity, verbosity) पर conditioning के साथ SFT (Supervised Fine‑Tuning) की एक विधि है, जो उपयोगकर्ता को inference के दौरान उत्तर की शैली नियंत्रित करने की सुविधा देती है। Pipeline में शामिल हैं: (1) HelpSteer पर attribute prediction model (APM) का प्रशिक्षण, (2) APM का उपयोग करके डेटा annotate करना, (3) target attribute values पर conditioning के साथ SFT, (4) bootstrapping।[25]

DPO और RPO

DPO (Direct Preference Optimization) — स्पष्ट reward मॉडल के बिना प्रत्यक्ष preference अनुकूलन की विधि, जिसका उपयोग Nemotron‑4 340B Instruct और Nemotron Nano 2 पाइपलाइन में किया जाता है।[26]

RPO (Reward‑aware Preference Optimization) — NVIDIA का एकीकृत गणितीय framework, जो DPO, IPO, SimPO, REINFORCE और SteerLM 2.0 को विशेष मामलों के रूप में सामान्यीकृत करता है। RPO अंतर्निहित reward मॉडल की भविष्यवाणियों और लक्षित स्पष्ट मॉडल के बीच की दूरी को न्यूनतम करता है[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

जहाँ rϕ — स्पष्ट reward मॉडल, πθ — trainable policy, πref — reference policy, d(,) — दूरी फ़ंक्शन, yw/yl — पसंदीदा/अस्वीकृत उत्तर हैं। RPO का उपयोग Nemotron‑4 340B Instruct और Llama‑Nemotron मॉडलों के प्रशिक्षण में किया जाता है।[27][3][11]

बहु-पर्यावरण Reinforcement Learning (RLVR)

Nemotron 3 में Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) लागू किया जाता है — NeMo Gym के ढांचे में कई पर्यावरणों पर एक साथ प्रशिक्षण: प्रतिस्पर्धी गणित, प्रोग्रामिंग, QA, tool‑use, instruction‑following, long‑context। एल्गोरिदम — masked importance sampling के साथ GRPO (Group Relative Policy Optimization)।[2][14]

Nemotron 3 विस्तृत reasoning budget control (reasoning बजट नियंत्रण) का समर्थन करता है: उपयोगकर्ता chat template में एक flag के माध्यम से thinking trace के लिए टोकन सीमा निर्धारित कर सकता है ("detailed thinking on/off" स्विचिंग या लंबाई सीमा)।[2]

मॉडलों की श्रृंखला

सारांश तालिका

मॉडल वर्ष कुल / सक्रिय पैरामीटर संदर्भ आर्किटेक्चर मुख्य विशेषताएँ
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3.8T टोकन; 1024 GPU A100; 19 दिन
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8T टोकन; MFU 34.3%
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9T टोकन; Base/Instruct/Reward; >98% सिंथेटिक alignment डेटा
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94.1%
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) Llama 3.1 8B से NAS संपीड़न
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Llama 3.3 70B से
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Llama 3.1 405B से; GPQA 76.0%
Nemotron‑H 8B 2025 8B / 8B हाइब्रिड Mamba‑Transformer 15T टोकन; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B हाइब्रिड Mamba‑Transformer 20T टोकन FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) हाइब्रिड Mamba‑Transformer MiniPuzzle from 56B; +20% गति
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K हाइब्रिड Mamba‑Transformer 20T टोकन; Minitron distillation
Nemotron 3 Nano 2025 31.6B / 3.2B 1M हाइब्रिड Mamba‑Transformer MoE 25T टोकन; 128 experts, 6 सक्रिय
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M हाइब्रिड LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M हाइब्रिड LatentMoE MTP; NVFP4

Nemotron‑4 15B

आर्किटेक्चर: 32 परतें, hidden dimension 6144, 48 attention heads, 8 KV‑heads (GQA)। पैरामीटरों की कुल संख्या — 15 अरब (3.2 अरब embedding + 12.5 अरब non‑embedding)। परिणाम: MMLU — 64.2% (5‑shot), BBH — 58.7% (3‑shot), GSM8K — 46.0% (8‑shot, maj@1), HumanEval — 31.6% (0‑shot, pass@1)। बहुभाषी बेंचमार्क (XCOPA, TyDiQA‑GoldP, MGSM) पर मॉडल 4 गुना बड़े मॉडलों से बेहतर रहा।[8]

Nemotron‑4 340B

आर्किटेक्चर: 96 परतें, hidden dimension 18,432, 96 attention heads, 8 KV‑heads।

Nemotron‑4 340B Base ने दिखाया: MMLU — 81.1% (5‑shot), BBH — 85.4% (3‑shot), HumanEval — 57.3% (0‑shot), ARC‑Challenge — 94.3% (25‑shot)।[3]

Nemotron‑4 340B Instruct बहु-चरणीय संरेखण से गुज़री: Code SFT → General SFT → DPO → RPO (3 राउंड)। परिणाम: MT‑Bench — 8.22 (GPT‑4‑Turbo judge), MMLU — 78.7% (0‑shot), GSM8K — 92.3% (0‑shot), HumanEval — 73.2% (0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%।[3]

Nemotron‑4 340B Reward अंतिम softmax परत को अंतिम परत की hidden state के 5 HelpSteer2 विशेषताओं के वेक्टर में linear projection से प्रतिस्थापित करती है। अंतिम reward — पाँच विशेषताओं का भारित योग है। प्रशिक्षण HelpSteer2 डेटा पर 2 epochs में किया गया (batch size 128)। RewardBench पर मॉडल ने 92.0% हासिल किया, प्रकाशन के समय GPT‑4o (84.7%), Gemini 1.5 Pro (88.1%) और Claude‑3‑Opus (80.7%) को पीछे छोड़ा।[3]

मॉडल Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54.2 41.5% 8.22
Llama‑3‑70B‑Instruct 41.1 34.4% 8.16
Mixtral‑8x22B‑Instruct 36.4 30.9% 7.63
Qwen‑2‑72B‑Instruct 48.1 38.8% 8.26

स्रोत: arXiv:2406.11704, तालिका 5।[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward को एक हाइब्रिड विधि से प्रशिक्षित किया गया जो Bradley‑Terry (युग्मित preferences) और SteerLM regression (Likert scale पर बहु-विशेषता मूल्यांकन) को जोड़ती है। प्रशिक्षण केवल HelpSteer2 (CC‑BY‑4.0) डेटा पर किया गया। RewardBench पर मॉडल ने 94.1% हासिल किया, प्रकाशन के समय पहले स्थान पर रहा।[10]

Llama‑3.1‑Nemotron‑70B‑Instruct को REINFORCE एल्गोरिदम (PPO नहीं) और Nemotron‑70B‑Reward reward मॉडल के साथ RLHF विधि से संरेखित किया गया। अवसंरचना — TRT‑LLM acceleration के साथ NeMo‑Aligner।[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

NAS, distillation और विस्तारित post-training विधियों से Llama 3.x से प्राप्त reasoning मॉडलों का परिवार।[11]

मॉडल पैरामीटर आधार मॉडल संदर्भ
Llama‑Nemotron‑Nano 8B 8 अरब Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 अरब Minitron 4B (Llama 3.1 8B से) 128K
Llama‑Nemotron‑Super 49B 49 अरब Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 अरब Llama‑3.1‑405B → NAS (Puzzle) 128K

पाँच-चरणीय प्रशिक्षण pipeline: (1) NAS + FFN Fusion, (2) distillation + निरंतर pre-training, (3) SFT (DeepSeek‑R1 reasoning traces सहित), (4) बड़े पैमाने पर RL (Ultra के लिए GRPO, Nano के लिए REINFORCE/RLOO + Online RPO), (5) dialogue के लिए संरेखण।[11]

ये मॉडल खुले LLM में पहली बार स्विचेबल reasoning mode (reasoning toggle) का समर्थन करते हैं: सक्रियण पर (सिस्टम prompt में «detailed thinking on»), मॉडल उत्तर से पहले <think>...</think> tags में reasoning chain उत्पन्न करता है; बंद होने पर — सीधे उत्तर देता है।[11]

Llama‑Nemotron‑Ultra 253B (reasoning ON) के परिणाम: GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%। तुलना के लिए: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5%, AIME 2024 ~79.8%। Ultra एक 8×H100 नोड पर तैनात होता है।[11]

Nemotron‑H (अप्रैल 2025)

घने हाइब्रिड मॉडलों का परिवार, जो शून्य से प्रशिक्षित और लंबी generation वाले कार्यों के लिए डिज़ाइन किया गया है। Nemotron‑H‑56B को FP8 में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया — FP8 pre-training के सबसे बड़े सार्वजनिक प्रयोगों में से एक। Nemotron‑H‑47B को MiniPuzzle विधि (63 अरब distillation टोकन) द्वारा 56B के संपीड़न से प्राप्त किया गया और ~1M टोकन के संदर्भ के साथ एक RTX 5090 (FP4) की मेमोरी में फिट होता है।[12]

बेंचमार्क Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60.5 61.8 58.8 51.3
MMLU (5‑shot) 84.2 83.6 86.1 78.8
GSM8K (8‑shot CoT) 93.7 93.3 90.9 83.9
HumanEval (0‑shot) 60.4 61.0 56.7 57.3

स्रोत: arXiv:2504.03624।[12]

H100 पर 65,536 input और 1024 output टोकन के साथ generation पर Nemotron‑H‑47B मॉडल Qwen‑2.5‑72B और Llama‑3.1‑70B की तुलना में 2.9 गुना तेज़ काम करता है।[12]

Nemotron Nano 2 (अगस्त 2025)

Reasoning के लिए हाइब्रिड Mamba‑Transformer मॉडल। Nemotron‑Nano‑12B‑v2‑Base — 62 परतों (मुख्यतः Mamba‑2 + MLP + 4 attention परतें) के साथ मूल मॉडल, जिसे FP8 में शून्य से 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। इससे विस्तारित Minitron विधि द्वारा Nemotron‑Nano‑9B‑v2 प्राप्त की गई, जो एक NVIDIA A10G GPU (22 GB, BF16) पर 128K टोकन संदर्भ में काम करने में सक्षम है। Post-training: SFT (80 अरब टोकन, DeepSeek‑R1‑0528 traces सहित) → GRPO → DPO → RLHF। Reasoning बेंचमार्क पर मॉडल सटीकता में Qwen3‑8B के बराबर है, लेकिन लंबी output sequences पर 3–6 गुना तेज़ generation प्राप्त करता है।[13]

Nemotron 3 Nano 30B‑A3B

दिसंबर 2025 में जारी किया गया। पैरामीटर: 31.6 अरब कुल, 3.2 अरब सक्रिय। आर्किटेक्चर: 52 परतें, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128। MoE: 128 routed experts + 1 shared, प्रति टोकन 6 सक्रिय। संदर्भ — 1,048,576 टोकन तक। 25 ट्रिलियन टोकन पर प्रशिक्षण (WSD schedule, batch size 3072, डेटा cutoff — जून 2025) दो चरणों में: Phase 1 — 23.5 ट्रिलियन (विविध डेटा), Phase 2 — 1.5 ट्रिलियन (उच्च-गुणवत्ता डेटा) + 121 अरब टोकन long‑context CPT।[2]

बेंचमार्क Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78.30 80.9 75.0
AIME25 (no tools) 89.06 85.0 91.7
AIME25 (with tools) 99.17 98.7
GPQA (no tools) 73.04 73.4 71.5
LiveCodeBench v6 68.25 66.0 61.0
SWE‑Bench (OpenHands) 38.76 22.0* 34.0
TauBench V2 Avg 49.04 47.7 47.5
Arena‑Hard‑V2 Avg 67.65 57.8 48.55
RULER‑100 @ 1M 86.34 77.5

* — द्वितीयक स्रोतों से मूल्य; पुनरुत्पादन की शर्तें — NeMo Evaluator SDK। स्रोत: arXiv:2512.20848।[2][28]

Throughput (8K input / 16K output, single H200): Qwen3‑30B‑A3B‑Thinking से 3.3 गुना और GPT‑OSS‑20B से 2.2 गुना अधिक।[2]

अतिरिक्त मॉडल और दिशाएँ

  • OpenReasoning‑Nemotron (जुलाई 2025) — Qwen 2.5 पर आधारित और DeepSeek‑R1‑0528 डेटा पर fine-tuned 1.5B–32B पैरामीटर मॉडलों की श्रृंखला। GenSelect@64 के साथ 32B संस्करण कुछ गणितीय बेंचमार्क पर o3 (high) से बेहतर प्रदर्शन करता है।[29]
  • Nemotron Elastic (arXiv:2511.16664) — एक मूल मॉडल के भीतर nested sub-models (6B, 9B, 12B) का framework, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 360 गुना कम करता है।[30]
  • Nemotron‑CrossThink — गणितीय कार्यों से परे बहु-डोमेन Reinforcement Learning प्रशिक्षण का framework, जिसने MATH‑500 पर +30.1% और MMLU‑PRO पर +12.8% सुधार प्रदान किया।[31]
  • Nemotron‑UltraLong — संदर्भ का 4 मिलियन टोकन तक विस्तार।[32]
  • Jet‑Nemotron — कॉम्पैक्ट हाइब्रिड मॉडलों 2B/4B के लिए post-training NAS।[33]

विशेषीकृत मॉडल

Nemotron इकोसिस्टम में विशेषीकृत कार्यों के लिए मॉडल भी मौजूद हैं:

  • Nemotron Nano V2 VL — OCR, तालिका प्रसंस्करण और वीडियो के लिए vision‑language मॉडल।[34]
  • Nemotron Parse 1.1 — OCR और दस्तावेज़ संरचना निष्कर्षण के लिए मॉडल।[35]
  • Nemotron ColEmbed V2 — दृश्य दस्तावेज़ खोज (late interaction) के लिए embedding मॉडल।[36]
  • Nemotron Speech — स्वचालित वाक् पहचान (ASR), वाक् संश्लेषण (TTS) और मशीन अनुवाद (NMT) के लिए मॉडल।[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — 9 भाषाओं में 23 श्रेणियों में असुरक्षित सामग्री वर्गीकरण का मॉडल, 84.2% सटीकता के साथ।[37]

पूर्व-प्रशिक्षण डेटा

Nemotron‑4 का डेटा संरचना

Nemotron‑4 15B और 340B का pre-training corpus तीन मुख्य श्रेणियों से बना है: अंग्रेज़ी पाठ (70%), 53 भाषाओं में बहुभाषी पाठ (15%) और 43 प्रोग्रामिंग भाषाओं में स्रोत कोड (15%)। दस्तावेज़ स्तर पर deduplication (exact और near‑duplicate) के साथ-साथ भाषा मॉडलों और heuristics का उपयोग करके फ़िल्टरिंग की गई। 15B मॉडल को 8 ट्रिलियन टोकन पर और 340B मॉडल को 9 ट्रिलियन टोकन (8 ट्रिलियन pre-training + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर प्रशिक्षित किया गया।[8][3]

Nemotron‑CC

Nemotron‑CC dataset Common Crawl से quality classifiers के ensemble और पाठों के सिंथेटिक paraphrasing का उपयोग करके बनाया गया है। कुल मात्रा — 6.3 ट्रिलियन टोकन (4.4 ट्रिलियन deduplicated + 1.9 ट्रिलियन सिंथेटिक reformulations)। Pipeline NeMo Curator टूल में एकीकृत है। यह कार्य ACL 2025 में Long Paper के रूप में स्वीकार किया गया।[38]

Nemotron‑CC‑Math

LaTeX में गणितीय सूत्रों और कोड की संरचना को संरक्षित करते हुए Lynx + LLM pipeline का उपयोग करके Common Crawl से निकाला गया 133 अरब टोकन का गणित-उन्मुख उप-समुच्चय।[39]

Nemotron 3 Nano का डेटा

Nemotron 3 Nano का pre-training 25 ट्रिलियन टोकन पर किया गया। समुच्चय में शामिल हैं: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 और विशेष STEM datasets। Long‑context प्रशिक्षण के लिए अतिरिक्त 121 अरब टोकन CPT का उपयोग किया गया।[2]

Nemotron Pretraining Dataset v1

सिंथेटिक रूप से उत्पन्न समुच्चय जो STEM, शैक्षणिक पाठ, reasoning कार्य और बहुभाषी क्षेत्रों को कवर करता है; इसमें 10 ट्रिलियन से अधिक भाषा टोकन और SFT के लिए 18 मिलियन नमूने शामिल हैं। सभी dataset खुले अनुमेय लाइसेंस के अंतर्गत वितरित हैं।[40]

सिंथेटिक डेटा जनरेशन (SDG) पाइपलाइन

Nemotron‑4 340B रिपोर्ट में वर्णित pipeline में निम्नलिखित चरण शामिल हैं[3]:

  • Prompt जनरेशन: Open QA, Writing, Closed QA, Math & Coding टेम्पलेट्स के अनुसार Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 लाइसेंस) की सहायता से उत्पन्न सिंथेटिक एकल और दो-टर्न प्रश्न।
  • उत्तर जनरेशन: विविधता सुनिश्चित करने के लिए मॉडलों के मध्यवर्ती संस्करणों से कई उत्तर।
  • गुणवत्ता मूल्यांकन: तीन दृष्टिकोण — Ground‑Truth‑as‑a‑Judge (सत्यापन योग्य उत्तर वाले कार्यों के लिए), LLM‑as‑Judge (भाषा मॉडल द्वारा उत्तर युग्मों की तुलना), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward का उपयोग)।
  • कमज़ोर से मज़बूत मॉडलों तक (weak‑to‑strong) पुनरावृत्त संरेखण

~20,000 मानव-annotated उदाहरणों (10,000 SFT के लिए, 10,000 HelpSteer2 reward मॉडल के लिए) से संपूर्ण शेष alignment डेटा सिंथेटिक रूप से उत्पन्न किया गया।[3]

Quantization और Inference अनुकूलन

Nemotron 3 Nano मॉडल ModelOpt और Megatron‑LM का उपयोग करके FP8 में Post‑Training Quantization (PTQ) का समर्थन करते हैं। Selective quantization लागू की जाती है — attention परतें और Mamba का एक भाग गुणवत्ता बनाए रखने के लिए BF16 में रखे जाते हैं; बाकी को FP8 में quantize किया जाता है। तकनीकी रिपोर्ट के अनुसार, यह ~99% सटीकता retention सुनिश्चित करता है।[2] Nano NVFP4 प्रारूप में inference का भी समर्थन करता है।[1]

पीढ़ियों के अनुसार बेंचमार्क सारांश तालिका

मॉडल MMLU GSM8K HumanEval Arena Hard MT‑Bench शर्तें
Nemotron‑4 15B 64.2% 46.0% 31.6% base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81.1% 57.3% 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78.7% 92.3% 73.2% 54.2 8.22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85.0 8.98 अक्टूबर 2024
LN‑Ultra 253B (reasoning ON) GPQA 76.0%, AIME 80.8%
Nemotron‑H‑47B 83.6% 93.3% 61.0% 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67.7 (v2) AIME25 89.1%, LCB 68.3%

तुलना को सावधानी से व्याख्यायित किया जाना चाहिए: मूल्यांकन की शर्तें, बेंचमार्क के संस्करण और परीक्षण की तारीखें पीढ़ियों के बीच भिन्न हैं। परिणाम NVIDIA के तकनीकी रिपोर्टों से लिए गए हैं; स्वतंत्र मूल्यांकन भिन्न हो सकते हैं (देखें «सीमाएँ» अनुभाग)।[8][3][9][11][12][2]

अनुप्रयोग

NVIDIA NIM के माध्यम से तैनाती

NVIDIA NIM — OpenAI‑संगत API के साथ inference के लिए अनुकूलित containerized microservices का एक सेट। Nemotron मॉडल build.nvidia.com प्लेटफॉर्म पर NIM‑microservices के रूप में उपलब्ध हैं। NIM FP8, BF16, NVFP4 प्रारूपों और Kubernetes पर Helm charts के माध्यम से तैनाती का समर्थन करता है। मॉडल स्वतंत्र frameworks के साथ भी संगत हैं: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM।[4][1]

सिंथेटिक डेटा जनरेशन

Nemotron‑4 340B को सिंथेटिक डेटा जनरेटर के रूप में उपयोग के लिए डिज़ाइन किया गया है: Instruct मॉडल उत्तर उत्पन्न करता है, Reward मॉडल उनका मूल्यांकन और फ़िल्टरिंग करता है। NVIDIA Open Model License स्पष्ट रूप से अन्य मॉडलों के प्रशिक्षण के लिए मॉडल के outputs का उपयोग करने की अनुमति देता है। ServiceNow के अनुसार, उनके Apriel 1.6 मॉडल के 15% pre-training डेटा Nemotron datasets से प्राप्त किए गए हैं।[3][15][41]

एजेंटिक प्रणालियाँ

Nemotron 3 परिवार के मॉडल (Nano, Super, Ultra) बहु-एजेंट कार्यभार के लिए अभिप्रेत हैं: योजना बनाना, retrieval, tool use। Nemotron 3 Nano SWE‑Bench पर 38.76% (OpenHands के साथ) और TauBench V2 पर 49.04% (औसत) परिणाम प्रदर्शित करता है।[2]

कॉर्पोरेट कार्यान्वयन

घोषित भागीदारों में शामिल हैं: ServiceNow (कार्यप्रवाह स्वचालन के लिए संयुक्त Apriel Nemotron 15B मॉडल), CrowdStrike (Charlotte AI प्लेटफॉर्म), Perplexity (अनुरोध रूटिंग), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom। मॉडल AWS Amazon Bedrock पर उपलब्ध हैं; Google Cloud, CoreWeave, Nebius के लिए समर्थन की योजना है।[15]

सीमाएँ और खुली समस्याएँ

स्वतंत्र मूल्यांकन और NVIDIA डेटा से विसंगतियाँ

स्वतंत्र मूल्यांकन NVIDIA द्वारा प्रस्तुत परिणामों से विसंगतियाँ प्रकट करते हैं। Artificial Analysis (फरवरी 2026) के अनुसार, Llama‑Nemotron‑Ultra 253B (reasoning) को तुलनीय आकार के मॉडलों के लिए 26 के औसत की तुलना में 15 का Intelligence Index प्राप्त हुआ। Chatbot Arena (LMArena) प्लेटफॉर्म पर Nemotron मॉडल मध्य रैंकिंग में हैं: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147वीं स्थान), Nemotron 3 Nano — 1317 ±6 (~164वीं स्थान)।[42][43]

शब्दाडंबर

Nemotron मॉडल बढ़ी हुई शब्दाडंबरता प्रदर्शित करते हैं: Artificial Analysis के मूल्यांकन में Nemotron 3 Nano ने 140 मिलियन टोकन उत्पन्न किए (अन्य मॉडलों के लिए 12 मिलियन के औसत की तुलना में), जिससे inference लागत बढ़ती है। DEV Community के विश्लेषण ने पाया कि Llama‑3.1‑Nemotron‑70B‑Instruct स्वचालित बेंचमार्क पर औपचारिक नेतृत्व के बावजूद कुछ व्यावहारिक कार्यों में अपर्याप्त सटीकता प्रदर्शित करता था, और Arena जैसे बेंचमार्क पर उच्च स्कोर विस्तृत और आत्मविश्वासी, लेकिन ज़रूरी नहीं कि सटीक उत्तरों की प्राथमिकता से समझाया जा सकता था।[42][44]

Hallucination और Bias

NVIDIA मॉडल कार्डों में इंगित करता है कि मॉडल «पूर्वाग्रहों को बढ़ा सकते हैं और विषाक्त prompts के साथ विशेष रूप से विषाक्त उत्तर उत्पन्न कर सकते हैं», साथ ही «गलत जानकारी उत्पन्न कर सकते हैं और मुख्य विवरण छोड़ सकते हैं»। भार और डेटा की खुलापन बाहरी ऑडिट की अनुमति देता है।[11][13]

कंप्यूटेशनल आवश्यकताएँ

सघन मॉडल (Nemotron‑4 340B) को पूर्ण प्रशिक्षण के लिए 768 DGX H100 नोड्स के cluster की आवश्यकता है, जो समकक्ष अवसंरचना तक पहुँच के बिना शैक्षणिक समूहों के लिए पुनरुत्पादनीयता को सीमित करता है। inference के दौरान लंबा संदर्भ (1M) महत्वपूर्ण VRAM की आवश्यकता है।[3][2]

संदर्भ विस्तार पर गिरावट

अत्यधिक लंबी sequences तक संदर्भ का विस्तार करने पर छोटे संदर्भ वाले बेंचमार्क पर परिणामों में गिरावट देखी गई।[32]

हाइब्रिड आर्किटेक्चर की Quantization

Mamba‑Transformer आर्किटेक्चर में अत्यंत कम बिट-चौड़ाई (FP8/NVFP4) के उपयोग से कुछ बेंचमार्क पर सटीकता में मामूली गिरावट (~1%) होती है। यह समस्या selective quantization के उपयोग से हल की जाती है, जो compiler और inference server आर्किटेक्चर को जटिल बनाती है।[2][1]

अन्य खुली समस्याएँ

  • प्रशिक्षण डेटा की संभावित contamination के साथ बेंचमार्क पर निर्भरता।
  • शुद्ध Transformer मॉडलों के साथ हाइब्रिड SSM‑Transformer आर्किटेक्चर की तुलना के लिए मानकीकृत प्रोटोकॉल का अभाव।
  • प्रति टोकन कम experts के साथ गहन reasoning की आवश्यकता वाले कार्यों पर MoE दृष्टिकोण की मापनीयता का प्रश्न।
  • दिसंबर 2025 तक Super/Ultra पर डेटा प्रारंभिक है; रिलीज़ के बाद पूर्ण बेंचमार्क की प्रतीक्षा है।[1]

नैतिक और नियामक पहलू

विकास चरण में सुरक्षा

विकास चरण में लागू होते हैं: AEGIS framework (सामग्री सुरक्षा की 13 श्रेणियाँ) के अनुसार मूल्यांकन, garak vulnerability scanner, मैनुअल red‑teaming।[37]

Inference चरण में सुरक्षा

NeMo Guardrails — एक खुला टूलकिट (Apache 2.0 लाइसेंस), जो LLM प्रणालियों में programmable barriers जोड़ता है। Microservice inputs और outputs को intercept करता है, configurable checks लागू करते हुए: विषय नियंत्रण, PII पहचान, RAG «grounding» सत्यापन, jailbreak-attack पहचान (YARA-based code injection protection सहित), बहुभाषी बहुमोडल सुरक्षा वर्गीकरण।[45]

Nemotron 3 के लिए, tool use के साथ यथार्थवादी परिदृश्यों से ~11,000 labeled OpenTelemetry traces का एक सेट प्रकाशित किया गया, जो एजेंटिक सुरक्षा मूल्यांकन के लिए अभिप्रेत है।[1]

लाइसेंसिंग

मॉडल लाइसेंस
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (Meta से विरासत)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License वाणिज्यिक उपयोग, व्युत्पन्न कार्यों के निर्माण और वितरण की अनुमति देता है, attribution की आवश्यकता नहीं है (NOTICE फ़ाइल को बनाए रखते हुए), उपयोगकर्ताओं की संख्या पर कोई प्रतिबंध नहीं लगाता और अन्य मॉडलों के प्रशिक्षण के लिए मॉडल outputs के उपयोग की स्पष्ट अनुमति देता है।[46] Llama पर आधारित मॉडल 700 मिलियन मासिक सक्रिय उपयोगकर्ताओं की सीमा सहित Meta की प्रतिबंधों को विरासत में लेते हैं।[11]

Nemotron 3 Nano के लिए NVIDIA ने प्रकाशित किया: मॉडल भार, 10 ट्रिलियन से अधिक training data टोकन, प्रशिक्षण नुस्खे, codebase (NeMo, Megatron‑LM, NeMo‑Aligner), 900,000+ कार्यों के साथ 10 से अधिक Reinforcement Learning प्रशिक्षण वातावरण।[1][2]

भविष्य की संभावनाएँ और शोध दिशाएँ

निकट भविष्य के releases में Nemotron 3 Super (~100 अरब पैरामीटर, ~10 अरब सक्रिय) और Nemotron 3 Ultra (~500 अरब, ~50 अरब सक्रिय) शामिल हैं, जो 2026 की पहली छमाही में अपेक्षित हैं। दोनों मॉडल Blackwell आर्किटेक्चर पर LatentMoE, MTP और NVFP4 प्रारूप में प्रशिक्षण का उपयोग करेंगे।[1]

NVIDIA की रणनीतिक दिशा — Nemotron को एक अकेले मॉडल के रूप में नहीं बल्कि बहु-एजेंट प्रणालियों के लिए एक अवसंरचना परत के रूप में स्थापित करना, जहाँ परिवार के विभिन्न मॉडल जटिलता के अनुसार रूटिंग के साथ विभिन्न कार्यों के लिए उपयोग किए जाते हैं।[1][15]

मुख्य शोध दिशाएँ:

  • हाइब्रिड आर्किटेक्चर का विकास — मापनीय लंबे संदर्भ के लिए attention mechanism के साथ SSM‑layers का और एकीकरण।[12]
  • बहु-स्तरीय संपीड़न विधियाँ — Minitron, Puzzle, MiniPuzzle और Nemotron Elastic का विकास।[20][21][30]
  • बहु-डोमेन Reinforcement Learning — गणितीय कार्यों से परे RL के विस्तार के लिए Nemotron‑CrossThink।[31]
  • संदर्भ विस्तार — Nemotron‑UltraLong को 4 मिलियन टोकन तक।[32]
  • बहुमोडलता — vision‑language (Nemotron VL), वाक् (Nemotron Speech), दृश्य दस्तावेज़ खोज (Nemotron ColEmbed V2) के क्षेत्र में विस्तार।[34][35][36]
  • कॉम्पैक्ट हाइब्रिड मॉडल — Jet‑Nemotron (2B/4B मॉडलों के लिए NAS)।[33]
  • खुले नुस्खे — समुदाय द्वारा पुनरुत्पादन और अनुकूलन के लिए पूर्ण प्रशिक्षण नुस्खों और डेटा का प्रकाशन।[14]

यह भी देखें

  • Transformer आर्किटेक्चर
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (Meta के मॉडलों का परिवार)

संदर्भ

साहित्य

टिप्पणियाँ

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/