Nemotron (NVIDIA) (HI)
Nemotron — खुले भार (open weights) वाले बड़े भाषा मॉडलों (Large Language Model, LLM) का एक परिवार है, जिसे NVIDIA निगम के Applied Deep Learning Research (ADLR) प्रभाग द्वारा विकसित किया गया है। ये मॉडल Machine Learning और Natural Language Processing (NLP) के क्षेत्र से संबंधित हैं तथा कार्यों की एक विस्तृत श्रृंखला के लिए अभिप्रेत हैं: सिंथेटिक डेटा जनरेशन, तार्किक अनुमान (reasoning), एजेंटिक अनुप्रयोग (agentic AI) और NVIDIA के औद्योगिक हार्डवेयर पर तैनाती। यह परिवार विभिन्न आर्किटेक्चर और पैमानों के मॉडलों को एकजुट करता है: 4 अरब से लेकर ~500 अरब पैरामीटर तक, जिसमें Nemotron‑4 श्रृंखला (2024) के सघन (dense) decoder‑only Transformer मॉडल, हाइब्रिड Mamba‑Transformer (Nemotron‑H, 2025) और Nemotron 3 श्रृंखला (2025) में Mixture-of-Experts (MoE) सहित हाइब्रिड Mamba‑Transformer शामिल हैं। मार्च 2026 तक इस परिवार में 20 से अधिक मॉडल हैं, जो पाठ जनरेशन, तर्कशास्त्र, दस्तावेज़ों की दृश्य समझ, सूचना निष्कर्षण और उत्तर गुणवत्ता मूल्यांकन के कार्यों को कवर करते हैं। मॉडल मुख्यतः NVIDIA Open Model License और Llama Community License के अंतर्गत खुले भार के साथ जारी किए जाते हैं।[1][2][3]
इतिहास और पृष्ठभूमि
Nemotron परिवार का विकास जनरेटिव AI के लिए पूर्ण उपकरण स्टैक बनाने की NVIDIA की रणनीति के संदर्भ में किया जा रहा है: प्रशिक्षण अवसंरचना (DGX, GPU H100/B200 पर आधारित सुपरकंप्यूटर) से लेकर प्रशिक्षण प्लेटफॉर्म (NeMo Framework), संरेखण (NeMo‑Aligner), तैनाती (NIM — NVIDIA Inference Microservices) और सुरक्षा (NeMo Guardrails) तक।[4][5]
Nemotron‑3 8B (2023)
श्रृंखला का पहला सार्वजनिक रूप से उपलब्ध मॉडल — 8 अरब पैरामीटर और 4096 टोकन संदर्भ के साथ एक decoder Transformer, जिसे 53 प्राकृतिक और 37 प्रोग्रामिंग भाषाओं में 3.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया था। प्रशिक्षण 1024 GPU A100 पर 19 दिनों में किया गया। arXiv पर कोई औपचारिक तकनीकी रिपोर्ट प्रकाशित नहीं हुई। मॉडल NeMo Framework और Hugging Face के माध्यम से वितरित किया गया था, Chat (SFT और SteerLM) के संस्करण मौजूद थे। लाइसेंस — NVIDIA AI Foundation Models Community License।[6][7]
नामों के बारे में नोट: 2023 का «Nemotron‑3» और दिसंबर 2025 का «Nemotron 3» — अलग-अलग मॉडल हैं। पहला एक प्रारंभिक प्रोटोटाइप था, दूसरा MoE आर्किटेक्चर के साथ वर्तमान पीढ़ी है।
Nemotron‑4 15B (फरवरी 2024)
Nemotron‑4 श्रृंखला का पहला सार्वजनिक रूप से प्रलेखित संस्करण — 15 अरब पैरामीटर वाला मॉडल, जिसे 384 DGX H100 नोड्स (3072 GPU तक) पर ~13 कैलेंडर दिनों में 8 ट्रिलियन टोकन पर प्रशिक्षित किया गया। 8‑गुना tensor parallelism और 96 से 288 तक data parallelism का उपयोग किया गया। batch size 384 पर पीक MFU (Model FLOPs Utilization) 34.3% रही। आर्किटेक्चर — Grouped‑Query Attention (GQA) और Rotary Position Embeddings (RoPE) के साथ decoder‑only Transformer। प्रकाशन के समय बेंचमार्क परिणामों के अनुसार, मॉडल ने बहुभाषी कार्यों में अपने आकार के सभी तुलनीय खुले मॉडलों को पीछे छोड़ दिया, जिसमें कुछ ऐसे मॉडल भी शामिल थे जो आकार में चार गुना बड़े थे।[8]
Nemotron‑4 340B (जून 2024)
जून 2024 में Nemotron‑4 श्रृंखला का सबसे बड़ा मॉडल जारी किया गया — 340 अरब पैरामीटर (331.6 अरब गैर-एम्बेडिंग), जिसे 9 ट्रिलियन टोकन (8 ट्रिलियन प्री-ट्रेनिंग + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर पूर्व-प्रशिक्षित किया गया। प्रशिक्षण 768 DGX H100 नोड्स (6144 GPU तक) पर दिसंबर 2023 से मई 2024 तक 42.4% पीक MFU के साथ किया गया। परिवार में तीन संस्करण शामिल हैं: Base, Instruct और Reward। मॉडल का आकार इस प्रकार चुना गया कि यह FP8 परिशुद्धता प्रारूप में तैनाती के दौरान एक DGX H100 नोड (8 GPU) पर फिट हो सके। संरेखण (alignment) में उपयोग किए गए 98% से अधिक डेटा को एक पुनरावृत्त प्रक्रिया में श्रृंखला के मॉडलों द्वारा स्वयं सिंथेटिक रूप से उत्पन्न किया गया; सिंथेटिक डेटा जनरेशन पाइपलाइन पुनरुत्पादन के लिए खुली है।[3]
Llama‑3.1‑Nemotron‑70B (अक्टूबर 2024)
अक्टूबर 2024 में Meta Llama‑3.1‑70B‑Instruct से fine-tuned मॉडल जारी किए गए: Llama‑3.1‑Nemotron‑70B‑Instruct और Llama‑3.1‑Nemotron‑70B‑Reward। 1 अक्टूबर 2024 तक Instruct मॉडल तीन स्वचालित बेंचमार्क पर एक साथ पहले स्थान पर था: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench (GPT‑4‑Turbo) — 8.98। Reward मॉडल ने RewardBench पर 94.1% हासिल किया।[9][10]
हाइब्रिड आर्किटेक्चर की ओर संक्रमण (2025)
2025 में, श्रृंखला का विस्तार हाइब्रिड आर्किटेक्चर के साथ हुआ जो Mamba‑2 (State Space Model, SSM — अवस्था स्थान मॉडल) और Transformer परतों को संयोजित करते हैं। मार्च–मई 2025 में स्विचेबल reasoning मोड के साथ Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) reasoning मॉडलों का परिवार जारी किया गया।[11] अप्रैल 2025 में Nemotron‑H (arXiv:2504.03624) प्रकाशित हुआ — 8B, 56B और 47B पैरामीटर आकार के हाइब्रिड Mamba‑Transformer मॉडलों का परिवार।[12] अगस्त 2025 में Nemotron Nano 2 (9B‑v2, arXiv:2508.14444) प्रस्तुत किया गया।[13]
Nemotron 3 (दिसंबर 2025)
15 दिसंबर 2025 को तीसरी पीढ़ी की घोषणा की गई — Nano, Super और Ultra मॉडलों के साथ Nemotron 3 परिवार, जो 1 मिलियन टोकन तक की संदर्भ विंडो के साथ Mamba‑2, Transformer और MoE आर्किटेक्चर को एकजुट करता है। Nano तकनीकी रिपोर्ट के साथ जारी की गई; Super और Ultra 2026 की पहली छमाही के लिए निर्धारित हैं।[1][2][14][15]
सैद्धांतिक आधार
Nemotron‑4 में Transformer आर्किटेक्चर
Nemotron‑4 श्रृंखला के मॉडल causal attention के साथ मानक decoder Transformer आर्किटेक्चर पर बनाए गए हैं। टोकन अनुक्रम की प्रायिकता को इस प्रकार factorize किया जाता है:
जहाँ — मॉडल के पैरामीटर हैं।[8]
Attention mechanism को Grouped‑Query Attention (GQA) संस्करण में लागू किया गया है[16]:
जहाँ — queries, keys और values के मैट्रिक्स हैं; — attention head का आयाम है।
स्थिति एन्कोडिंग के लिए Rotary Position Embeddings (RoPE) का उपयोग किया जाता है[17]:
जहाँ — स्थिति पर वेक्टर है, , — वेक्टर का आयाम है।
MLP परतों में Squared ReLU activation का उपयोग किया जाता है: , जो activation की विरलता (sparsity) सुनिश्चित करता है। मॉडलों में bias नहीं है, dropout का उपयोग नहीं किया जाता, और input तथा output embedding मैट्रिक्स एक-दूसरे से जुड़े नहीं हैं (untied embeddings)। Tokenizer — रिक्त स्थान संरक्षण, अंकों के वर्ण-दर-वर्ण विभाजन और byte-level fallback के साथ SentencePiece BPE है, शब्द कोश का आकार — 256,000।[8][3]
Nemotron‑4 के आर्किटेक्चरल पैरामीटर
| पैरामीटर | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| पैरामीटरों की संख्या | 15 अरब (3.2 अरब embed.) | 340 अरब (9.4 अरब embed.) |
| परतों की संख्या | 32 | 96 |
| Hidden dimension | 6144 | 18,432 |
| Attention heads | 48 | 96 |
| KV‑heads (GQA) | 8 | 8 |
| संदर्भ लंबाई | 4096 | 4096 |
| शब्द कोश आकार | 256,000 | 256,000 |
स्रोत: arXiv:2402.16819, arXiv:2406.11704।[8][3]
हाइब्रिड Mamba‑Transformer आर्किटेक्चर (Nemotron‑H)
Nemotron‑H मॉडलों में मानक self-attention ब्लॉक को आंशिक रूप से Mamba‑2 ब्लॉक — State Space Models (SSM) से प्रतिस्थापित किया गया है। Autoregressive जनरेशन के दौरान, प्रत्येक self-attention परत को प्रति चरण ऑपरेशन और मेमोरी की आवश्यकता होती है (KV‑cache के कारण), जबकि Mamba परतें प्रत्येक जनरेट किए गए टोकन के लिए स्थिर मेमोरी और कंप्यूटेशन लागत प्रदान करती हैं।[12]
Mamba‑2 को पुनरावृत्त संबंध द्वारा वर्णित किया जाता है[18]:
जहाँ — छिपी हुई अवस्था (hidden state), — विकर्ण अवस्था संक्रमण मैट्रिक्स (diagonal state transition matrix), और — projection matrices, — input token, — output signal है। Mamba‑2 में मैट्रिक्स , , input पर निर्भर (input‑dependent) हैं, जो इस मॉडल को शास्त्रीय linear SSM से अलग करता है।
Nemotron‑H‑56B में 54 Mamba‑2 परतें + 54 MLP परतें + 10 self-attention परतें उपयोग की जाती हैं, जिसमें attention परतें Mamba परतों के बीच समान रूप से वितरित हैं। मॉडल को 6144 GPU H100 पर FP8 (per‑tensor scaling) प्रारूप में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। Nemotron‑H‑8B संस्करण में 24 Mamba‑2 परतें, 24 MLP परतें और 4 self-attention परतें हैं; प्रशिक्षण 15 ट्रिलियन टोकन पर किया गया।[12]
Nemotron 3 का MoE आर्किटेक्चर
Nemotron 3 (दिसंबर 2025) के मॉडल तीन आर्किटेक्चरल घटकों को एकजुट करते हैं: Mamba‑2, Transformer और Mixture‑of‑Experts।[1][2] Nemotron 3 Nano (30B‑A3B) में 52 परतें हैं: 23 Mamba‑2 + MoE परतें, 23 MoE परतें और 6 GQA‑attention परतें। प्रत्येक MoE परत में 128 routed experts + 1 shared expert शामिल हैं, जिनमें से प्रत्येक टोकन के लिए 6 experts सक्रिय होते हैं। रूटिंग sigmoid gating के साथ trainable MLP router द्वारा की जाती है। Load balancing बिना सहायक loss function (aux‑loss‑free) के लागू की जाती है। पैरामीटरों की कुल संख्या 31.6 अरब है, लेकिन प्रत्येक टोकन के लिए केवल 3.2 अरब active हैं।[2]
Normalization — RMSNorm[19]। Mamba भागों में positional embeddings अनुपस्थित हैं (स्थितीय जानकारी SSM अवस्था में अंतर्निहित है)। Untied embeddings का उपयोग किया जाता है, linear परतों में dropout और bias अनुपस्थित हैं।[2]
Super/Ultra में विस्तार: LatentMoE और Multi‑Token Prediction
Nemotron 3 परिवार के Super और Ultra मॉडल दो अतिरिक्त आर्किटेक्चरल नवाचार लागू करते हैं:
- Latent MoE (LatentMoE) — रूटिंग से पहले input representation को छोटे आयाम के latent space में प्रक्षेपित करना, जो तुलनीय कंप्यूटेशनल लागत पर experts की संख्या बढ़ाने और throughput कम किए बिना सटीकता में सुधार करने की अनुमति देता है।[1]
- Multi‑Token Prediction (MTP) — एक साथ कई अगले टोकनों की भविष्यवाणी करना, जिसका उपयोग लंबे पाठों की गुणवत्ता में सुधार और inference के दौरान speculative decoding के लिए किया जाता है।[1]
Super और Ultra का प्रशिक्षण NVFP4 प्रारूप में किया जाता है — Blackwell आर्किटेक्चर पर NVIDIA का 4‑बिट संख्यात्मक प्रारूप।[1]
मॉडल संपीड़न के तरीके: Minitron, Puzzle, MiniPuzzle
कॉम्पैक्ट मॉडल बनाने के लिए NVIDIA कई दृष्टिकोण लागू करता है:
- Minitron — structured pruning और knowledge distillation की विधि। दो प्रकार के pruning का अध्ययन किया जाता है: depth-wise (परतों को हटाना) और width-wise (hidden layers, attention heads और MLP projections के आयामों को संयुक्त रूप से कम करना)। Nemotron‑4 15B पर Minitron लागू करने से 8B और 4B मॉडल प्राप्त होते हैं, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 40 गुना तक कम करते हैं।[20]
- Puzzle — Neural Architecture Search (NAS) एल्गोरिदम जो block-wise distillation के साथ प्रत्येक ब्लॉक की इष्टतम कॉन्फ़िगरेशन (KV‑heads की संख्या, FFN आकार, attention की उपस्थिति/अनुपस्थिति) का चयन करता है। इसी तरह Llama 3.1 405B को 253B (Llama‑Nemotron Ultra) और Llama 3.3 70B को 49B (Llama‑Nemotron Super) में संपीड़ित किया गया।[21]
- MiniPuzzle — हाइब्रिड आर्किटेक्चर के लिए Puzzle का विस्तार, जिसने केवल 63 अरब distillation टोकन की लागत पर Nemotron‑H‑56B को 47B में संपीड़ित किया। समान सटीकता पर, संपीड़ित मॉडल 20% तेज़ inference प्रदान करता है।[12]
संरेखण (Alignment) के तरीके
HelpSteer और HelpSteer2
HelpSteer — Scale AI के साथ मिलकर बनाया गया 37,120 उदाहरणों का एक सेट (CC‑BY‑4.0 लाइसेंस), जिसमें प्रत्येक उत्तर को पाँच विशेषताओं के अनुसार Likert scale 0–4 पर annotate किया गया है: उपयोगिता (helpfulness), शुद्धता (correctness), सुसंगति (coherence), जटिलता (complexity) और शब्दाडंबर (verbosity)।[22]
HelpSteer2 — 21,362 उदाहरणों (10,681 prompts × 2 उत्तर) का एक अद्यतन सेट, जहाँ 95% से अधिक prompts ShareGPT (वास्तविक उपयोगकर्ता प्रश्न) से लिए गए हैं। लगभग 50% annotations को अपर्याप्त गुणवत्ता के कारण फ़िल्टर किया गया। HelpSteer2‑Preference विस्तार annotators की युग्मित प्राथमिकताएँ जोड़ता है, जो एक ही डेटा पर regression और pairwise reward मॉडल दोनों को प्रशिक्षित करने की अनुमति देता है।[23][24]
SteerLM
SteerLM — विशेषताओं (helpfulness, correctness, coherence, complexity, verbosity) पर conditioning के साथ SFT (Supervised Fine‑Tuning) की एक विधि है, जो उपयोगकर्ता को inference के दौरान उत्तर की शैली नियंत्रित करने की सुविधा देती है। Pipeline में शामिल हैं: (1) HelpSteer पर attribute prediction model (APM) का प्रशिक्षण, (2) APM का उपयोग करके डेटा annotate करना, (3) target attribute values पर conditioning के साथ SFT, (4) bootstrapping।[25]
DPO और RPO
DPO (Direct Preference Optimization) — स्पष्ट reward मॉडल के बिना प्रत्यक्ष preference अनुकूलन की विधि, जिसका उपयोग Nemotron‑4 340B Instruct और Nemotron Nano 2 पाइपलाइन में किया जाता है।[26]
RPO (Reward‑aware Preference Optimization) — NVIDIA का एकीकृत गणितीय framework, जो DPO, IPO, SimPO, REINFORCE और SteerLM 2.0 को विशेष मामलों के रूप में सामान्यीकृत करता है। RPO अंतर्निहित reward मॉडल की भविष्यवाणियों और लक्षित स्पष्ट मॉडल के बीच की दूरी को न्यूनतम करता है[27]:
जहाँ — स्पष्ट reward मॉडल, — trainable policy, — reference policy, — दूरी फ़ंक्शन, / — पसंदीदा/अस्वीकृत उत्तर हैं। RPO का उपयोग Nemotron‑4 340B Instruct और Llama‑Nemotron मॉडलों के प्रशिक्षण में किया जाता है।[27][3][11]
बहु-पर्यावरण Reinforcement Learning (RLVR)
Nemotron 3 में Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) लागू किया जाता है — NeMo Gym के ढांचे में कई पर्यावरणों पर एक साथ प्रशिक्षण: प्रतिस्पर्धी गणित, प्रोग्रामिंग, QA, tool‑use, instruction‑following, long‑context। एल्गोरिदम — masked importance sampling के साथ GRPO (Group Relative Policy Optimization)।[2][14]
Nemotron 3 विस्तृत reasoning budget control (reasoning बजट नियंत्रण) का समर्थन करता है: उपयोगकर्ता chat template में एक flag के माध्यम से thinking trace के लिए टोकन सीमा निर्धारित कर सकता है ("detailed thinking on/off" स्विचिंग या लंबाई सीमा)।[2]
मॉडलों की श्रृंखला
सारांश तालिका
| मॉडल | वर्ष | कुल / सक्रिय पैरामीटर | संदर्भ | आर्किटेक्चर | मुख्य विशेषताएँ |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3.8T टोकन; 1024 GPU A100; 19 दिन |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T टोकन; MFU 34.3% |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T टोकन; Base/Instruct/Reward; >98% सिंथेटिक alignment डेटा |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94.1% |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Llama 3.1 8B से NAS संपीड़न |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.3 70B से |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.1 405B से; GPQA 76.0% |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | हाइब्रिड Mamba‑Transformer | 15T टोकन; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | हाइब्रिड Mamba‑Transformer | 20T टोकन FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | हाइब्रिड Mamba‑Transformer | MiniPuzzle from 56B; +20% गति |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | हाइब्रिड Mamba‑Transformer | 20T टोकन; Minitron distillation |
| Nemotron 3 Nano | 2025 | 31.6B / 3.2B | 1M | हाइब्रिड Mamba‑Transformer MoE | 25T टोकन; 128 experts, 6 सक्रिय |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | हाइब्रिड LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | हाइब्रिड LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
आर्किटेक्चर: 32 परतें, hidden dimension 6144, 48 attention heads, 8 KV‑heads (GQA)। पैरामीटरों की कुल संख्या — 15 अरब (3.2 अरब embedding + 12.5 अरब non‑embedding)। परिणाम: MMLU — 64.2% (5‑shot), BBH — 58.7% (3‑shot), GSM8K — 46.0% (8‑shot, maj@1), HumanEval — 31.6% (0‑shot, pass@1)। बहुभाषी बेंचमार्क (XCOPA, TyDiQA‑GoldP, MGSM) पर मॉडल 4 गुना बड़े मॉडलों से बेहतर रहा।[8]
Nemotron‑4 340B
आर्किटेक्चर: 96 परतें, hidden dimension 18,432, 96 attention heads, 8 KV‑heads।
Nemotron‑4 340B Base ने दिखाया: MMLU — 81.1% (5‑shot), BBH — 85.4% (3‑shot), HumanEval — 57.3% (0‑shot), ARC‑Challenge — 94.3% (25‑shot)।[3]
Nemotron‑4 340B Instruct बहु-चरणीय संरेखण से गुज़री: Code SFT → General SFT → DPO → RPO (3 राउंड)। परिणाम: MT‑Bench — 8.22 (GPT‑4‑Turbo judge), MMLU — 78.7% (0‑shot), GSM8K — 92.3% (0‑shot), HumanEval — 73.2% (0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%।[3]
Nemotron‑4 340B Reward अंतिम softmax परत को अंतिम परत की hidden state के 5 HelpSteer2 विशेषताओं के वेक्टर में linear projection से प्रतिस्थापित करती है। अंतिम reward — पाँच विशेषताओं का भारित योग है। प्रशिक्षण HelpSteer2 डेटा पर 2 epochs में किया गया (batch size 128)। RewardBench पर मॉडल ने 92.0% हासिल किया, प्रकाशन के समय GPT‑4o (84.7%), Gemini 1.5 Pro (88.1%) और Claude‑3‑Opus (80.7%) को पीछे छोड़ा।[3]
| मॉडल | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54.2 | 41.5% | 8.22 |
| Llama‑3‑70B‑Instruct | 41.1 | 34.4% | 8.16 |
| Mixtral‑8x22B‑Instruct | 36.4 | 30.9% | 7.63 |
| Qwen‑2‑72B‑Instruct | 48.1 | 38.8% | 8.26 |
स्रोत: arXiv:2406.11704, तालिका 5।[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward को एक हाइब्रिड विधि से प्रशिक्षित किया गया जो Bradley‑Terry (युग्मित preferences) और SteerLM regression (Likert scale पर बहु-विशेषता मूल्यांकन) को जोड़ती है। प्रशिक्षण केवल HelpSteer2 (CC‑BY‑4.0) डेटा पर किया गया। RewardBench पर मॉडल ने 94.1% हासिल किया, प्रकाशन के समय पहले स्थान पर रहा।[10]
Llama‑3.1‑Nemotron‑70B‑Instruct को REINFORCE एल्गोरिदम (PPO नहीं) और Nemotron‑70B‑Reward reward मॉडल के साथ RLHF विधि से संरेखित किया गया। अवसंरचना — TRT‑LLM acceleration के साथ NeMo‑Aligner।[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
NAS, distillation और विस्तारित post-training विधियों से Llama 3.x से प्राप्त reasoning मॉडलों का परिवार।[11]
| मॉडल | पैरामीटर | आधार मॉडल | संदर्भ |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 अरब | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 अरब | Minitron 4B (Llama 3.1 8B से) | 128K |
| Llama‑Nemotron‑Super 49B | 49 अरब | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 अरब | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
पाँच-चरणीय प्रशिक्षण pipeline: (1) NAS + FFN Fusion, (2) distillation + निरंतर pre-training, (3) SFT (DeepSeek‑R1 reasoning traces सहित), (4) बड़े पैमाने पर RL (Ultra के लिए GRPO, Nano के लिए REINFORCE/RLOO + Online RPO), (5) dialogue के लिए संरेखण।[11]
ये मॉडल खुले LLM में पहली बार स्विचेबल reasoning mode (reasoning toggle) का समर्थन करते हैं: सक्रियण पर (सिस्टम prompt में «detailed thinking on»), मॉडल उत्तर से पहले <think>...</think> tags में reasoning chain उत्पन्न करता है; बंद होने पर — सीधे उत्तर देता है।[11]
Llama‑Nemotron‑Ultra 253B (reasoning ON) के परिणाम: GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%। तुलना के लिए: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5%, AIME 2024 ~79.8%। Ultra एक 8×H100 नोड पर तैनात होता है।[11]
Nemotron‑H (अप्रैल 2025)
घने हाइब्रिड मॉडलों का परिवार, जो शून्य से प्रशिक्षित और लंबी generation वाले कार्यों के लिए डिज़ाइन किया गया है। Nemotron‑H‑56B को FP8 में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया — FP8 pre-training के सबसे बड़े सार्वजनिक प्रयोगों में से एक। Nemotron‑H‑47B को MiniPuzzle विधि (63 अरब distillation टोकन) द्वारा 56B के संपीड़न से प्राप्त किया गया और ~1M टोकन के संदर्भ के साथ एक RTX 5090 (FP4) की मेमोरी में फिट होता है।[12]
| बेंचमार्क | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60.5 | 61.8 | 58.8 | 51.3 |
| MMLU (5‑shot) | 84.2 | 83.6 | 86.1 | 78.8 |
| GSM8K (8‑shot CoT) | 93.7 | 93.3 | 90.9 | 83.9 |
| HumanEval (0‑shot) | 60.4 | 61.0 | 56.7 | 57.3 |
स्रोत: arXiv:2504.03624।[12]
H100 पर 65,536 input और 1024 output टोकन के साथ generation पर Nemotron‑H‑47B मॉडल Qwen‑2.5‑72B और Llama‑3.1‑70B की तुलना में 2.9 गुना तेज़ काम करता है।[12]
Nemotron Nano 2 (अगस्त 2025)
Reasoning के लिए हाइब्रिड Mamba‑Transformer मॉडल। Nemotron‑Nano‑12B‑v2‑Base — 62 परतों (मुख्यतः Mamba‑2 + MLP + 4 attention परतें) के साथ मूल मॉडल, जिसे FP8 में शून्य से 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। इससे विस्तारित Minitron विधि द्वारा Nemotron‑Nano‑9B‑v2 प्राप्त की गई, जो एक NVIDIA A10G GPU (22 GB, BF16) पर 128K टोकन संदर्भ में काम करने में सक्षम है। Post-training: SFT (80 अरब टोकन, DeepSeek‑R1‑0528 traces सहित) → GRPO → DPO → RLHF। Reasoning बेंचमार्क पर मॉडल सटीकता में Qwen3‑8B के बराबर है, लेकिन लंबी output sequences पर 3–6 गुना तेज़ generation प्राप्त करता है।[13]
Nemotron 3 Nano 30B‑A3B
दिसंबर 2025 में जारी किया गया। पैरामीटर: 31.6 अरब कुल, 3.2 अरब सक्रिय। आर्किटेक्चर: 52 परतें, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128। MoE: 128 routed experts + 1 shared, प्रति टोकन 6 सक्रिय। संदर्भ — 1,048,576 टोकन तक। 25 ट्रिलियन टोकन पर प्रशिक्षण (WSD schedule, batch size 3072, डेटा cutoff — जून 2025) दो चरणों में: Phase 1 — 23.5 ट्रिलियन (विविध डेटा), Phase 2 — 1.5 ट्रिलियन (उच्च-गुणवत्ता डेटा) + 121 अरब टोकन long‑context CPT।[2]
| बेंचमार्क | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78.30 | 80.9 | 75.0 |
| AIME25 (no tools) | 89.06 | 85.0 | 91.7 |
| AIME25 (with tools) | 99.17 | — | 98.7 |
| GPQA (no tools) | 73.04 | 73.4 | 71.5 |
| LiveCodeBench v6 | 68.25 | 66.0 | 61.0 |
| SWE‑Bench (OpenHands) | 38.76 | 22.0* | 34.0 |
| TauBench V2 Avg | 49.04 | 47.7 | 47.5 |
| Arena‑Hard‑V2 Avg | 67.65 | 57.8 | 48.55 |
| RULER‑100 @ 1M | 86.34 | 77.5 | — |
* — द्वितीयक स्रोतों से मूल्य; पुनरुत्पादन की शर्तें — NeMo Evaluator SDK। स्रोत: arXiv:2512.20848।[2][28]
Throughput (8K input / 16K output, single H200): Qwen3‑30B‑A3B‑Thinking से 3.3 गुना और GPT‑OSS‑20B से 2.2 गुना अधिक।[2]
अतिरिक्त मॉडल और दिशाएँ
- OpenReasoning‑Nemotron (जुलाई 2025) — Qwen 2.5 पर आधारित और DeepSeek‑R1‑0528 डेटा पर fine-tuned 1.5B–32B पैरामीटर मॉडलों की श्रृंखला। GenSelect@64 के साथ 32B संस्करण कुछ गणितीय बेंचमार्क पर o3 (high) से बेहतर प्रदर्शन करता है।[29]
- Nemotron Elastic (arXiv:2511.16664) — एक मूल मॉडल के भीतर nested sub-models (6B, 9B, 12B) का framework, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 360 गुना कम करता है।[30]
- Nemotron‑CrossThink — गणितीय कार्यों से परे बहु-डोमेन Reinforcement Learning प्रशिक्षण का framework, जिसने MATH‑500 पर +30.1% और MMLU‑PRO पर +12.8% सुधार प्रदान किया।[31]
- Nemotron‑UltraLong — संदर्भ का 4 मिलियन टोकन तक विस्तार।[32]
- Jet‑Nemotron — कॉम्पैक्ट हाइब्रिड मॉडलों 2B/4B के लिए post-training NAS।[33]
विशेषीकृत मॉडल
Nemotron इकोसिस्टम में विशेषीकृत कार्यों के लिए मॉडल भी मौजूद हैं:
- Nemotron Nano V2 VL — OCR, तालिका प्रसंस्करण और वीडियो के लिए vision‑language मॉडल।[34]
- Nemotron Parse 1.1 — OCR और दस्तावेज़ संरचना निष्कर्षण के लिए मॉडल।[35]
- Nemotron ColEmbed V2 — दृश्य दस्तावेज़ खोज (late interaction) के लिए embedding मॉडल।[36]
- Nemotron Speech — स्वचालित वाक् पहचान (ASR), वाक् संश्लेषण (TTS) और मशीन अनुवाद (NMT) के लिए मॉडल।[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — 9 भाषाओं में 23 श्रेणियों में असुरक्षित सामग्री वर्गीकरण का मॉडल, 84.2% सटीकता के साथ।[37]
पूर्व-प्रशिक्षण डेटा
Nemotron‑4 का डेटा संरचना
Nemotron‑4 15B और 340B का pre-training corpus तीन मुख्य श्रेणियों से बना है: अंग्रेज़ी पाठ (70%), 53 भाषाओं में बहुभाषी पाठ (15%) और 43 प्रोग्रामिंग भाषाओं में स्रोत कोड (15%)। दस्तावेज़ स्तर पर deduplication (exact और near‑duplicate) के साथ-साथ भाषा मॉडलों और heuristics का उपयोग करके फ़िल्टरिंग की गई। 15B मॉडल को 8 ट्रिलियन टोकन पर और 340B मॉडल को 9 ट्रिलियन टोकन (8 ट्रिलियन pre-training + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर प्रशिक्षित किया गया।[8][3]
Nemotron‑CC
Nemotron‑CC dataset Common Crawl से quality classifiers के ensemble और पाठों के सिंथेटिक paraphrasing का उपयोग करके बनाया गया है। कुल मात्रा — 6.3 ट्रिलियन टोकन (4.4 ट्रिलियन deduplicated + 1.9 ट्रिलियन सिंथेटिक reformulations)। Pipeline NeMo Curator टूल में एकीकृत है। यह कार्य ACL 2025 में Long Paper के रूप में स्वीकार किया गया।[38]
Nemotron‑CC‑Math
LaTeX में गणितीय सूत्रों और कोड की संरचना को संरक्षित करते हुए Lynx + LLM pipeline का उपयोग करके Common Crawl से निकाला गया 133 अरब टोकन का गणित-उन्मुख उप-समुच्चय।[39]
Nemotron 3 Nano का डेटा
Nemotron 3 Nano का pre-training 25 ट्रिलियन टोकन पर किया गया। समुच्चय में शामिल हैं: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 और विशेष STEM datasets। Long‑context प्रशिक्षण के लिए अतिरिक्त 121 अरब टोकन CPT का उपयोग किया गया।[2]
Nemotron Pretraining Dataset v1
सिंथेटिक रूप से उत्पन्न समुच्चय जो STEM, शैक्षणिक पाठ, reasoning कार्य और बहुभाषी क्षेत्रों को कवर करता है; इसमें 10 ट्रिलियन से अधिक भाषा टोकन और SFT के लिए 18 मिलियन नमूने शामिल हैं। सभी dataset खुले अनुमेय लाइसेंस के अंतर्गत वितरित हैं।[40]
सिंथेटिक डेटा जनरेशन (SDG) पाइपलाइन
Nemotron‑4 340B रिपोर्ट में वर्णित pipeline में निम्नलिखित चरण शामिल हैं[3]:
- Prompt जनरेशन: Open QA, Writing, Closed QA, Math & Coding टेम्पलेट्स के अनुसार Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 लाइसेंस) की सहायता से उत्पन्न सिंथेटिक एकल और दो-टर्न प्रश्न।
- उत्तर जनरेशन: विविधता सुनिश्चित करने के लिए मॉडलों के मध्यवर्ती संस्करणों से कई उत्तर।
- गुणवत्ता मूल्यांकन: तीन दृष्टिकोण — Ground‑Truth‑as‑a‑Judge (सत्यापन योग्य उत्तर वाले कार्यों के लिए), LLM‑as‑Judge (भाषा मॉडल द्वारा उत्तर युग्मों की तुलना), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward का उपयोग)।
- कमज़ोर से मज़बूत मॉडलों तक (weak‑to‑strong) पुनरावृत्त संरेखण।
~20,000 मानव-annotated उदाहरणों (10,000 SFT के लिए, 10,000 HelpSteer2 reward मॉडल के लिए) से संपूर्ण शेष alignment डेटा सिंथेटिक रूप से उत्पन्न किया गया।[3]
Quantization और Inference अनुकूलन
Nemotron 3 Nano मॉडल ModelOpt और Megatron‑LM का उपयोग करके FP8 में Post‑Training Quantization (PTQ) का समर्थन करते हैं। Selective quantization लागू की जाती है — attention परतें और Mamba का एक भाग गुणवत्ता बनाए रखने के लिए BF16 में रखे जाते हैं; बाकी को FP8 में quantize किया जाता है। तकनीकी रिपोर्ट के अनुसार, यह ~99% सटीकता retention सुनिश्चित करता है।[2] Nano NVFP4 प्रारूप में inference का भी समर्थन करता है।[1]
पीढ़ियों के अनुसार बेंचमार्क सारांश तालिका
| मॉडल | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | शर्तें |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64.2% | 46.0% | 31.6% | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81.1% | — | 57.3% | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78.7% | 92.3% | 73.2% | 54.2 | 8.22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85.0 | 8.98 | अक्टूबर 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76.0%, AIME 80.8% |
| Nemotron‑H‑47B | 83.6% | 93.3% | 61.0% | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67.7 (v2) | — | AIME25 89.1%, LCB 68.3% |
तुलना को सावधानी से व्याख्यायित किया जाना चाहिए: मूल्यांकन की शर्तें, बेंचमार्क के संस्करण और परीक्षण की तारीखें पीढ़ियों के बीच भिन्न हैं। परिणाम NVIDIA के तकनीकी रिपोर्टों से लिए गए हैं; स्वतंत्र मूल्यांकन भिन्न हो सकते हैं (देखें «सीमाएँ» अनुभाग)।[8][3][9][11][12][2]
अनुप्रयोग
NVIDIA NIM के माध्यम से तैनाती
NVIDIA NIM — OpenAI‑संगत API के साथ inference के लिए अनुकूलित containerized microservices का एक सेट। Nemotron मॉडल build.nvidia.com प्लेटफॉर्म पर NIM‑microservices के रूप में उपलब्ध हैं। NIM FP8, BF16, NVFP4 प्रारूपों और Kubernetes पर Helm charts के माध्यम से तैनाती का समर्थन करता है। मॉडल स्वतंत्र frameworks के साथ भी संगत हैं: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM।[4][1]
सिंथेटिक डेटा जनरेशन
Nemotron‑4 340B को सिंथेटिक डेटा जनरेटर के रूप में उपयोग के लिए डिज़ाइन किया गया है: Instruct मॉडल उत्तर उत्पन्न करता है, Reward मॉडल उनका मूल्यांकन और फ़िल्टरिंग करता है। NVIDIA Open Model License स्पष्ट रूप से अन्य मॉडलों के प्रशिक्षण के लिए मॉडल के outputs का उपयोग करने की अनुमति देता है। ServiceNow के अनुसार, उनके Apriel 1.6 मॉडल के 15% pre-training डेटा Nemotron datasets से प्राप्त किए गए हैं।[3][15][41]
एजेंटिक प्रणालियाँ
Nemotron 3 परिवार के मॉडल (Nano, Super, Ultra) बहु-एजेंट कार्यभार के लिए अभिप्रेत हैं: योजना बनाना, retrieval, tool use। Nemotron 3 Nano SWE‑Bench पर 38.76% (OpenHands के साथ) और TauBench V2 पर 49.04% (औसत) परिणाम प्रदर्शित करता है।[2]
कॉर्पोरेट कार्यान्वयन
घोषित भागीदारों में शामिल हैं: ServiceNow (कार्यप्रवाह स्वचालन के लिए संयुक्त Apriel Nemotron 15B मॉडल), CrowdStrike (Charlotte AI प्लेटफॉर्म), Perplexity (अनुरोध रूटिंग), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom। मॉडल AWS Amazon Bedrock पर उपलब्ध हैं; Google Cloud, CoreWeave, Nebius के लिए समर्थन की योजना है।[15]
सीमाएँ और खुली समस्याएँ
स्वतंत्र मूल्यांकन और NVIDIA डेटा से विसंगतियाँ
स्वतंत्र मूल्यांकन NVIDIA द्वारा प्रस्तुत परिणामों से विसंगतियाँ प्रकट करते हैं। Artificial Analysis (फरवरी 2026) के अनुसार, Llama‑Nemotron‑Ultra 253B (reasoning) को तुलनीय आकार के मॉडलों के लिए 26 के औसत की तुलना में 15 का Intelligence Index प्राप्त हुआ। Chatbot Arena (LMArena) प्लेटफॉर्म पर Nemotron मॉडल मध्य रैंकिंग में हैं: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147वीं स्थान), Nemotron 3 Nano — 1317 ±6 (~164वीं स्थान)।[42][43]
शब्दाडंबर
Nemotron मॉडल बढ़ी हुई शब्दाडंबरता प्रदर्शित करते हैं: Artificial Analysis के मूल्यांकन में Nemotron 3 Nano ने 140 मिलियन टोकन उत्पन्न किए (अन्य मॉडलों के लिए 12 मिलियन के औसत की तुलना में), जिससे inference लागत बढ़ती है। DEV Community के विश्लेषण ने पाया कि Llama‑3.1‑Nemotron‑70B‑Instruct स्वचालित बेंचमार्क पर औपचारिक नेतृत्व के बावजूद कुछ व्यावहारिक कार्यों में अपर्याप्त सटीकता प्रदर्शित करता था, और Arena जैसे बेंचमार्क पर उच्च स्कोर विस्तृत और आत्मविश्वासी, लेकिन ज़रूरी नहीं कि सटीक उत्तरों की प्राथमिकता से समझाया जा सकता था।[42][44]
Hallucination और Bias
NVIDIA मॉडल कार्डों में इंगित करता है कि मॉडल «पूर्वाग्रहों को बढ़ा सकते हैं और विषाक्त prompts के साथ विशेष रूप से विषाक्त उत्तर उत्पन्न कर सकते हैं», साथ ही «गलत जानकारी उत्पन्न कर सकते हैं और मुख्य विवरण छोड़ सकते हैं»। भार और डेटा की खुलापन बाहरी ऑडिट की अनुमति देता है।[11][13]
कंप्यूटेशनल आवश्यकताएँ
सघन मॉडल (Nemotron‑4 340B) को पूर्ण प्रशिक्षण के लिए 768 DGX H100 नोड्स के cluster की आवश्यकता है, जो समकक्ष अवसंरचना तक पहुँच के बिना शैक्षणिक समूहों के लिए पुनरुत्पादनीयता को सीमित करता है। inference के दौरान लंबा संदर्भ (1M) महत्वपूर्ण VRAM की आवश्यकता है।[3][2]
संदर्भ विस्तार पर गिरावट
अत्यधिक लंबी sequences तक संदर्भ का विस्तार करने पर छोटे संदर्भ वाले बेंचमार्क पर परिणामों में गिरावट देखी गई।[32]
हाइब्रिड आर्किटेक्चर की Quantization
Mamba‑Transformer आर्किटेक्चर में अत्यंत कम बिट-चौड़ाई (FP8/NVFP4) के उपयोग से कुछ बेंचमार्क पर सटीकता में मामूली गिरावट (~1%) होती है। यह समस्या selective quantization के उपयोग से हल की जाती है, जो compiler और inference server आर्किटेक्चर को जटिल बनाती है।[2][1]
अन्य खुली समस्याएँ
- प्रशिक्षण डेटा की संभावित contamination के साथ बेंचमार्क पर निर्भरता।
- शुद्ध Transformer मॉडलों के साथ हाइब्रिड SSM‑Transformer आर्किटेक्चर की तुलना के लिए मानकीकृत प्रोटोकॉल का अभाव।
- प्रति टोकन कम experts के साथ गहन reasoning की आवश्यकता वाले कार्यों पर MoE दृष्टिकोण की मापनीयता का प्रश्न।
- दिसंबर 2025 तक Super/Ultra पर डेटा प्रारंभिक है; रिलीज़ के बाद पूर्ण बेंचमार्क की प्रतीक्षा है।[1]
नैतिक और नियामक पहलू
विकास चरण में सुरक्षा
विकास चरण में लागू होते हैं: AEGIS framework (सामग्री सुरक्षा की 13 श्रेणियाँ) के अनुसार मूल्यांकन, garak vulnerability scanner, मैनुअल red‑teaming।[37]
Inference चरण में सुरक्षा
NeMo Guardrails — एक खुला टूलकिट (Apache 2.0 लाइसेंस), जो LLM प्रणालियों में programmable barriers जोड़ता है। Microservice inputs और outputs को intercept करता है, configurable checks लागू करते हुए: विषय नियंत्रण, PII पहचान, RAG «grounding» सत्यापन, jailbreak-attack पहचान (YARA-based code injection protection सहित), बहुभाषी बहुमोडल सुरक्षा वर्गीकरण।[45]
Nemotron 3 के लिए, tool use के साथ यथार्थवादी परिदृश्यों से ~11,000 labeled OpenTelemetry traces का एक सेट प्रकाशित किया गया, जो एजेंटिक सुरक्षा मूल्यांकन के लिए अभिप्रेत है।[1]
लाइसेंसिंग
| मॉडल | लाइसेंस |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (Meta से विरासत) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License वाणिज्यिक उपयोग, व्युत्पन्न कार्यों के निर्माण और वितरण की अनुमति देता है, attribution की आवश्यकता नहीं है (NOTICE फ़ाइल को बनाए रखते हुए), उपयोगकर्ताओं की संख्या पर कोई प्रतिबंध नहीं लगाता और अन्य मॉडलों के प्रशिक्षण के लिए मॉडल outputs के उपयोग की स्पष्ट अनुमति देता है।[46] Llama पर आधारित मॉडल 700 मिलियन मासिक सक्रिय उपयोगकर्ताओं की सीमा सहित Meta की प्रतिबंधों को विरासत में लेते हैं।[11]
Nemotron 3 Nano के लिए NVIDIA ने प्रकाशित किया: मॉडल भार, 10 ट्रिलियन से अधिक training data टोकन, प्रशिक्षण नुस्खे, codebase (NeMo, Megatron‑LM, NeMo‑Aligner), 900,000+ कार्यों के साथ 10 से अधिक Reinforcement Learning प्रशिक्षण वातावरण।[1][2]
भविष्य की संभावनाएँ और शोध दिशाएँ
निकट भविष्य के releases में Nemotron 3 Super (~100 अरब पैरामीटर, ~10 अरब सक्रिय) और Nemotron 3 Ultra (~500 अरब, ~50 अरब सक्रिय) शामिल हैं, जो 2026 की पहली छमाही में अपेक्षित हैं। दोनों मॉडल Blackwell आर्किटेक्चर पर LatentMoE, MTP और NVFP4 प्रारूप में प्रशिक्षण का उपयोग करेंगे।[1]
NVIDIA की रणनीतिक दिशा — Nemotron को एक अकेले मॉडल के रूप में नहीं बल्कि बहु-एजेंट प्रणालियों के लिए एक अवसंरचना परत के रूप में स्थापित करना, जहाँ परिवार के विभिन्न मॉडल जटिलता के अनुसार रूटिंग के साथ विभिन्न कार्यों के लिए उपयोग किए जाते हैं।[1][15]
मुख्य शोध दिशाएँ:
- हाइब्रिड आर्किटेक्चर का विकास — मापनीय लंबे संदर्भ के लिए attention mechanism के साथ SSM‑layers का और एकीकरण।[12]
- बहु-स्तरीय संपीड़न विधियाँ — Minitron, Puzzle, MiniPuzzle और Nemotron Elastic का विकास।[20][21][30]
- बहु-डोमेन Reinforcement Learning — गणितीय कार्यों से परे RL के विस्तार के लिए Nemotron‑CrossThink।[31]
- संदर्भ विस्तार — Nemotron‑UltraLong को 4 मिलियन टोकन तक।[32]
- बहुमोडलता — vision‑language (Nemotron VL), वाक् (Nemotron Speech), दृश्य दस्तावेज़ खोज (Nemotron ColEmbed V2) के क्षेत्र में विस्तार।[34][35][36]
- कॉम्पैक्ट हाइब्रिड मॉडल — Jet‑Nemotron (2B/4B मॉडलों के लिए NAS)।[33]
- खुले नुस्खे — समुदाय द्वारा पुनरुत्पादन और अनुकूलन के लिए पूर्ण प्रशिक्षण नुस्खों और डेटा का प्रकाशन।[14]
यह भी देखें
- Transformer आर्किटेक्चर
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta के मॉडलों का परिवार)
संदर्भ
- NVIDIA Research — Nemotron 3 पृष्ठ: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — Nemotron दस्तावेज़ीकरण: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
साहित्य
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, फरवरी 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, जून 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, जून 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, जुलाई 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, नवंबर 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, जनवरी 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, अप्रैल 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, मई 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, अगस्त 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, अगस्त 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, नवंबर 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, दिसंबर 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, दिसंबर 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
टिप्पणियाँ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/