---
title: "Nemotron (NVIDIA) (HI)"
source: "https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)"
wiki: "systems-analysis.info/int"
article: "Nemotron_(NVIDIA)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4848
wiki_created_at: 2026-09-06T23:40:48Z
wiki_modified_at: 2026-09-06T23:40:48Z
downloaded_at: 2026-09-07T23:05:07Z
---

# Nemotron (NVIDIA) (HI)

**Nemotron** — खुले भार (open weights) वाले बड़े भाषा मॉडलों (Large Language Model, LLM) का एक परिवार है, जिसे NVIDIA निगम के Applied Deep Learning Research (ADLR) प्रभाग द्वारा विकसित किया गया है। ये मॉडल Machine Learning और Natural Language Processing (NLP) के क्षेत्र से संबंधित हैं तथा कार्यों की एक विस्तृत श्रृंखला के लिए अभिप्रेत हैं: सिंथेटिक डेटा जनरेशन, तार्किक अनुमान (reasoning), एजेंटिक अनुप्रयोग (agentic AI) और NVIDIA के औद्योगिक हार्डवेयर पर तैनाती। यह परिवार विभिन्न आर्किटेक्चर और पैमानों के मॉडलों को एकजुट करता है: 4 अरब से लेकर ~500 अरब पैरामीटर तक, जिसमें Nemotron‑4 श्रृंखला (2024) के सघन (dense) decoder‑only Transformer मॉडल, हाइब्रिड Mamba‑Transformer (Nemotron‑H, 2025) और Nemotron 3 श्रृंखला (2025) में Mixture-of-Experts (MoE) सहित हाइब्रिड Mamba‑Transformer शामिल हैं। मार्च 2026 तक इस परिवार में 20 से अधिक मॉडल हैं, जो पाठ जनरेशन, तर्कशास्त्र, दस्तावेज़ों की दृश्य समझ, सूचना निष्कर्षण और उत्तर गुणवत्ता मूल्यांकन के कार्यों को कवर करते हैं। मॉडल मुख्यतः NVIDIA Open Model License और Llama Community License के अंतर्गत खुले भार के साथ जारी किए जाते हैं।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

## इतिहास और पृष्ठभूमि

Nemotron परिवार का विकास जनरेटिव AI के लिए पूर्ण उपकरण स्टैक बनाने की NVIDIA की रणनीति के संदर्भ में किया जा रहा है: प्रशिक्षण अवसंरचना (DGX, GPU H100/B200 पर आधारित सुपरकंप्यूटर) से लेकर प्रशिक्षण प्लेटफॉर्म (NeMo Framework), संरेखण (NeMo‑Aligner), तैनाती (NIM — NVIDIA Inference Microservices) और सुरक्षा (NeMo Guardrails) तक।<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

श्रृंखला का पहला सार्वजनिक रूप से उपलब्ध मॉडल — 8 अरब पैरामीटर और 4096 टोकन संदर्भ के साथ एक decoder Transformer, जिसे 53 प्राकृतिक और 37 प्रोग्रामिंग भाषाओं में **3.8 ट्रिलियन टोकन** पर प्रशिक्षित किया गया था। प्रशिक्षण 1024 GPU A100 पर 19 दिनों में किया गया। arXiv पर कोई औपचारिक तकनीकी रिपोर्ट प्रकाशित नहीं हुई। मॉडल NeMo Framework और Hugging Face के माध्यम से वितरित किया गया था, Chat (SFT और SteerLM) के संस्करण मौजूद थे। लाइसेंस — NVIDIA AI Foundation Models Community License।<sup>[\[6\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-MS_nemotron3-7)</sup>

*नामों के बारे में नोट*: 2023 का «Nemotron‑3» और दिसंबर 2025 का «Nemotron 3» — अलग-अलग मॉडल हैं। पहला एक प्रारंभिक प्रोटोटाइप था, दूसरा MoE आर्किटेक्चर के साथ वर्तमान पीढ़ी है।

### Nemotron‑4 15B (फरवरी 2024)

Nemotron‑4 श्रृंखला का पहला सार्वजनिक रूप से प्रलेखित संस्करण — 15 अरब पैरामीटर वाला मॉडल, जिसे 384 DGX H100 नोड्स (3072 GPU तक) पर ~13 कैलेंडर दिनों में 8 ट्रिलियन टोकन पर प्रशिक्षित किया गया। 8‑गुना tensor parallelism और 96 से 288 तक data parallelism का उपयोग किया गया। batch size 384 पर पीक MFU (Model FLOPs Utilization) 34.3% रही। आर्किटेक्चर — Grouped‑Query Attention (GQA) और Rotary Position Embeddings (RoPE) के साथ decoder‑only Transformer। प्रकाशन के समय बेंचमार्क परिणामों के अनुसार, मॉडल ने बहुभाषी कार्यों में अपने आकार के सभी तुलनीय खुले मॉडलों को पीछे छोड़ दिया, जिसमें कुछ ऐसे मॉडल भी शामिल थे जो आकार में चार गुना बड़े थे।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (जून 2024)

जून 2024 में Nemotron‑4 श्रृंखला का सबसे बड़ा मॉडल जारी किया गया — 340 अरब पैरामीटर (331.6 अरब गैर-एम्बेडिंग), जिसे 9 ट्रिलियन टोकन (8 ट्रिलियन प्री-ट्रेनिंग + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर पूर्व-प्रशिक्षित किया गया। प्रशिक्षण 768 DGX H100 नोड्स (6144 GPU तक) पर दिसंबर 2023 से मई 2024 तक 42.4% पीक MFU के साथ किया गया। परिवार में तीन संस्करण शामिल हैं: Base, Instruct और Reward। मॉडल का आकार इस प्रकार चुना गया कि यह FP8 परिशुद्धता प्रारूप में तैनाती के दौरान एक DGX H100 नोड (8 GPU) पर फिट हो सके। संरेखण (alignment) में उपयोग किए गए 98% से अधिक डेटा को एक पुनरावृत्त प्रक्रिया में श्रृंखला के मॉडलों द्वारा स्वयं सिंथेटिक रूप से उत्पन्न किया गया; सिंथेटिक डेटा जनरेशन पाइपलाइन पुनरुत्पादन के लिए खुली है।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (अक्टूबर 2024)

अक्टूबर 2024 में Meta Llama‑3.1‑70B‑Instruct से fine-tuned मॉडल जारी किए गए: Llama‑3.1‑Nemotron‑70B‑Instruct और Llama‑3.1‑Nemotron‑70B‑Reward। 1 अक्टूबर 2024 तक Instruct मॉडल तीन स्वचालित बेंचमार्क पर एक साथ पहले स्थान पर था: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench (GPT‑4‑Turbo) — 8.98। Reward मॉडल ने RewardBench पर 94.1% हासिल किया।<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LN70B_Reward-10)</sup>

### हाइब्रिड आर्किटेक्चर की ओर संक्रमण (2025)

2025 में, श्रृंखला का विस्तार हाइब्रिड आर्किटेक्चर के साथ हुआ जो Mamba‑2 (State Space Model, SSM — अवस्था स्थान मॉडल) और Transformer परतों को संयोजित करते हैं। मार्च–मई 2025 में स्विचेबल reasoning मोड के साथ **Llama‑Nemotron** (Nano 8B, Super 49B, Ultra 253B) reasoning मॉडलों का परिवार जारी किया गया।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup> अप्रैल 2025 में **Nemotron‑H** (arXiv:2504.03624) प्रकाशित हुआ — 8B, 56B और 47B पैरामीटर आकार के हाइब्रिड Mamba‑Transformer मॉडलों का परिवार।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup> अगस्त 2025 में **Nemotron Nano 2** (9B‑v2, arXiv:2508.14444) प्रस्तुत किया गया।<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nano2-13)</sup>

### Nemotron 3 (दिसंबर 2025)

15 दिसंबर 2025 को तीसरी पीढ़ी की घोषणा की गई — Nano, Super और Ultra मॉडलों के साथ Nemotron 3 परिवार, जो 1 मिलियन टोकन तक की संदर्भ विंडो के साथ Mamba‑2, Transformer और MoE आर्किटेक्चर को एकजुट करता है। Nano तकनीकी रिपोर्ट के साथ जारी की गई; Super और Ultra 2026 की पहली छमाही के लिए निर्धारित हैं।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NVIDIA_news-15)</sup>

## सैद्धांतिक आधार

### Nemotron‑4 में Transformer आर्किटेक्चर

Nemotron‑4 श्रृंखला के मॉडल causal attention के साथ मानक decoder Transformer आर्किटेक्चर पर बनाए गए हैं। टोकन अनुक्रम $x_{1},x_{2},\ldots,x_{T}$ की प्रायिकता को इस प्रकार factorize किया जाता है:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};\theta),
$$

जहाँ $\theta$ — मॉडल के पैरामीटर हैं।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)</sup>

Attention mechanism को Grouped‑Query Attention (GQA) संस्करण में लागू किया गया है<sup>[\[16\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-GQA-16)</sup>:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V,
$$

जहाँ $Q,K,V$ — queries, keys और values के मैट्रिक्स हैं; $d_{k}$ — attention head का आयाम है।

स्थिति एन्कोडिंग के लिए Rotary Position Embeddings (RoPE) का उपयोग किया जाता है<sup>[\[17\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-RoPE-17)</sup>:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos m\theta_{1} - x_{m}^{(2)}\sin m\theta_{1}} \\
{x_{m}^{(1)}\sin m\theta_{1} + x_{m}^{(2)}\cos m\theta_{1}} \\
 \vdots 
\end{pmatrix},
$$

जहाँ $x_{m}$ — स्थिति $m$ पर वेक्टर है, $\theta_{i} = 10000^{- 2i/d}$, $d$ — वेक्टर का आयाम है।

MLP परतों में Squared ReLU activation का उपयोग किया जाता है: $f(x) = (\max(0,x))^{2}$, जो activation की विरलता (sparsity) सुनिश्चित करता है। मॉडलों में bias नहीं है, dropout का उपयोग नहीं किया जाता, और input तथा output embedding मैट्रिक्स एक-दूसरे से जुड़े नहीं हैं (untied embeddings)। Tokenizer — रिक्त स्थान संरक्षण, अंकों के वर्ण-दर-वर्ण विभाजन और byte-level fallback के साथ SentencePiece BPE है, शब्द कोश का आकार — 256,000।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

##### Nemotron‑4 के आर्किटेक्चरल पैरामीटर

| पैरामीटर          | Nemotron‑4 15B          | Nemotron‑4 340B          |
|------------------|-------------------------|--------------------------|
| पैरामीटरों की संख्या | 15 अरब (3.2 अरब embed.) | 340 अरब (9.4 अरब embed.) |
| परतों की संख्या     | 32                      | 96                       |
| Hidden dimension | 6144                    | 18,432                   |
| Attention heads  | 48                      | 96                       |
| KV‑heads (GQA)   | 8                       | 8                        |
| संदर्भ लंबाई        | 4096                    | 4096                     |
| शब्द कोश आकार     | 256,000                 | 256,000                  |

स्रोत: arXiv:2402.16819, arXiv:2406.11704।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

### हाइब्रिड Mamba‑Transformer आर्किटेक्चर (Nemotron‑H)

Nemotron‑H मॉडलों में मानक self-attention ब्लॉक को आंशिक रूप से Mamba‑2 ब्लॉक — State Space Models (SSM) से प्रतिस्थापित किया गया है। Autoregressive जनरेशन के दौरान, प्रत्येक self-attention परत को प्रति चरण $O(n)$ ऑपरेशन और मेमोरी की आवश्यकता होती है (KV‑cache के कारण), जबकि Mamba परतें प्रत्येक जनरेट किए गए टोकन के लिए स्थिर मेमोरी और कंप्यूटेशन लागत प्रदान करती हैं।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 को पुनरावृत्त संबंध द्वारा वर्णित किया जाता है<sup>[\[18\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Mamba2-18)</sup>:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

जहाँ $h_{t} \in {\mathbb{R}}^{N}$ — छिपी हुई अवस्था (hidden state), $A \in {\mathbb{R}}^{N \times N}$ — विकर्ण अवस्था संक्रमण मैट्रिक्स (diagonal state transition matrix), $B \in {\mathbb{R}}^{N \times 1}$ और $C \in {\mathbb{R}}^{1 \times N}$ — projection matrices, $x_{t}$ — input token, $y_{t}$ — output signal है। Mamba‑2 में मैट्रिक्स $A$, $B$, $C$ input पर निर्भर (input‑dependent) हैं, जो इस मॉडल को शास्त्रीय linear SSM से अलग करता है।

Nemotron‑H‑56B में **54 Mamba‑2 परतें + 54 MLP परतें + 10 self-attention परतें** उपयोग की जाती हैं, जिसमें attention परतें Mamba परतों के बीच समान रूप से वितरित हैं। मॉडल को 6144 GPU H100 पर FP8 (per‑tensor scaling) प्रारूप में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। Nemotron‑H‑8B संस्करण में 24 Mamba‑2 परतें, 24 MLP परतें और 4 self-attention परतें हैं; प्रशिक्षण 15 ट्रिलियन टोकन पर किया गया।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

### Nemotron 3 का MoE आर्किटेक्चर

Nemotron 3 (दिसंबर 2025) के मॉडल तीन आर्किटेक्चरल घटकों को एकजुट करते हैं: Mamba‑2, Transformer और Mixture‑of‑Experts।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) में 52 परतें हैं: **23 Mamba‑2 + MoE परतें, 23 MoE परतें और 6 GQA‑attention परतें**। प्रत्येक MoE परत में 128 routed experts + 1 shared expert शामिल हैं, जिनमें से प्रत्येक टोकन के लिए 6 experts सक्रिय होते हैं। रूटिंग sigmoid gating के साथ trainable MLP router द्वारा की जाती है। Load balancing बिना सहायक loss function (aux‑loss‑free) के लागू की जाती है। पैरामीटरों की कुल संख्या 31.6 अरब है, लेकिन प्रत्येक टोकन के लिए केवल 3.2 अरब active हैं।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

Normalization — RMSNorm<sup>[\[19\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-RMSNorm-19)</sup>। Mamba भागों में positional embeddings अनुपस्थित हैं (स्थितीय जानकारी SSM अवस्था में अंतर्निहित है)। Untied embeddings का उपयोग किया जाता है, linear परतों में dropout और bias अनुपस्थित हैं।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

### Super/Ultra में विस्तार: LatentMoE और Multi‑Token Prediction

Nemotron 3 परिवार के Super और Ultra मॉडल दो अतिरिक्त आर्किटेक्चरल नवाचार लागू करते हैं:

- **Latent MoE (LatentMoE)** — रूटिंग से पहले input representation को छोटे आयाम के latent space में प्रक्षेपित करना, जो तुलनीय कंप्यूटेशनल लागत पर experts की संख्या बढ़ाने और throughput कम किए बिना सटीकता में सुधार करने की अनुमति देता है।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — एक साथ कई अगले टोकनों की भविष्यवाणी करना, जिसका उपयोग लंबे पाठों की गुणवत्ता में सुधार और inference के दौरान speculative decoding के लिए किया जाता है।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

Super और Ultra का प्रशिक्षण NVFP4 प्रारूप में किया जाता है — Blackwell आर्किटेक्चर पर NVIDIA का 4‑बिट संख्यात्मक प्रारूप।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

### मॉडल संपीड़न के तरीके: Minitron, Puzzle, MiniPuzzle

कॉम्पैक्ट मॉडल बनाने के लिए NVIDIA कई दृष्टिकोण लागू करता है:

- **Minitron** — structured pruning और knowledge distillation की विधि। दो प्रकार के pruning का अध्ययन किया जाता है: depth-wise (परतों को हटाना) और width-wise (hidden layers, attention heads और MLP projections के आयामों को संयुक्त रूप से कम करना)। Nemotron‑4 15B पर Minitron लागू करने से 8B और 4B मॉडल प्राप्त होते हैं, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 40 गुना तक कम करते हैं।<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Minitron-20)</sup>
- **Puzzle** — Neural Architecture Search (NAS) एल्गोरिदम जो block-wise distillation के साथ प्रत्येक ब्लॉक की इष्टतम कॉन्फ़िगरेशन (KV‑heads की संख्या, FFN आकार, attention की उपस्थिति/अनुपस्थिति) का चयन करता है। इसी तरह Llama 3.1 405B को 253B (Llama‑Nemotron Ultra) और Llama 3.3 70B को 49B (Llama‑Nemotron Super) में संपीड़ित किया गया।<sup>[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — हाइब्रिड आर्किटेक्चर के लिए Puzzle का विस्तार, जिसने केवल 63 अरब distillation टोकन की लागत पर Nemotron‑H‑56B को 47B में संपीड़ित किया। समान सटीकता पर, संपीड़ित मॉडल 20% तेज़ inference प्रदान करता है।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

## संरेखण (Alignment) के तरीके

### HelpSteer और HelpSteer2

**HelpSteer** — Scale AI के साथ मिलकर बनाया गया 37,120 उदाहरणों का एक सेट (CC‑BY‑4.0 लाइसेंस), जिसमें प्रत्येक उत्तर को पाँच विशेषताओं के अनुसार Likert scale 0–4 पर annotate किया गया है: उपयोगिता (helpfulness), शुद्धता (correctness), सुसंगति (coherence), जटिलता (complexity) और शब्दाडंबर (verbosity)।<sup>[\[22\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — 21,362 उदाहरणों (10,681 prompts × 2 उत्तर) का एक अद्यतन सेट, जहाँ 95% से अधिक prompts ShareGPT (वास्तविक उपयोगकर्ता प्रश्न) से लिए गए हैं। लगभग 50% annotations को अपर्याप्त गुणवत्ता के कारण फ़िल्टर किया गया। **HelpSteer2‑Preference** विस्तार annotators की युग्मित प्राथमिकताएँ जोड़ता है, जो एक ही डेटा पर regression और pairwise reward मॉडल दोनों को प्रशिक्षित करने की अनुमति देता है।<sup>[\[23\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — विशेषताओं (helpfulness, correctness, coherence, complexity, verbosity) पर conditioning के साथ SFT (Supervised Fine‑Tuning) की एक विधि है, जो उपयोगकर्ता को inference के दौरान उत्तर की शैली नियंत्रित करने की सुविधा देती है। Pipeline में शामिल हैं: (1) HelpSteer पर attribute prediction model (APM) का प्रशिक्षण, (2) APM का उपयोग करके डेटा annotate करना, (3) target attribute values पर conditioning के साथ SFT, (4) bootstrapping।<sup>[\[25\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-SteerLM-25)</sup>

### DPO और RPO

**DPO (Direct Preference Optimization)** — स्पष्ट reward मॉडल के बिना प्रत्यक्ष preference अनुकूलन की विधि, जिसका उपयोग Nemotron‑4 340B Instruct और Nemotron Nano 2 पाइपलाइन में किया जाता है।<sup>[\[26\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — NVIDIA का एकीकृत गणितीय framework, जो DPO, IPO, SimPO, REINFORCE और SteerLM 2.0 को विशेष मामलों के रूप में सामान्यीकृत करता है। RPO अंतर्निहित reward मॉडल की भविष्यवाणियों और लक्षित स्पष्ट मॉडल के बीच की दूरी को न्यूनतम करता है<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{\text{RPO}}(\theta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{\theta}(y_{w}|x)}{\pi_{\text{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\text{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

जहाँ $r_{\phi}$ — स्पष्ट reward मॉडल, $\pi_{\theta}$ — trainable policy, $\pi_{\text{ref}}$ — reference policy, $d( \cdot , \cdot )$ — दूरी फ़ंक्शन, $y_{w}$/$y_{l}$ — पसंदीदा/अस्वीकृत उत्तर हैं। RPO का उपयोग Nemotron‑4 340B Instruct और Llama‑Nemotron मॉडलों के प्रशिक्षण में किया जाता है।<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

### बहु-पर्यावरण Reinforcement Learning (RLVR)

Nemotron 3 में Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) लागू किया जाता है — NeMo Gym के ढांचे में कई पर्यावरणों पर एक साथ प्रशिक्षण: प्रतिस्पर्धी गणित, प्रोग्रामिंग, QA, tool‑use, instruction‑following, long‑context। एल्गोरिदम — masked importance sampling के साथ GRPO (Group Relative Policy Optimization)।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_blog-14)</sup>

Nemotron 3 विस्तृत **reasoning budget control** (reasoning बजट नियंत्रण) का समर्थन करता है: उपयोगकर्ता chat template में एक flag के माध्यम से thinking trace के लिए टोकन सीमा निर्धारित कर सकता है ("detailed thinking on/off" स्विचिंग या लंबाई सीमा)।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

## मॉडलों की श्रृंखला

### सारांश तालिका

| मॉडल                          | वर्ष       | कुल / सक्रिय पैरामीटर | संदर्भ      | आर्किटेक्चर                       | मुख्य विशेषताएँ                                               |
|-------------------------------|-----------|--------------------|-----------|--------------------------------|-----------------------------------------------------------|
| **Nemotron‑3 8B**             | 2023      | 8B / 8B            | 4K        | Dense Transformer              | 3.8T टोकन; 1024 GPU A100; 19 दिन                          |
| **Nemotron‑4 15B**            | 2024      | 15B / 15B          | 4K        | Dense Transformer              | 8T टोकन; MFU 34.3%                                        |
| **Nemotron‑4 340B**           | 2024      | 340B / 340B        | 4K        | Dense Transformer              | 9T टोकन; Base/Instruct/Reward; \>98% सिंथेटिक alignment डेटा |
| **Llama‑3.1‑Nemotron‑70B**    | 2024      | 70B / 70B          | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE); RewardBench 94.1%                       |
| **Llama‑Nemotron Nano 8B**    | 2025      | 8B / 8B            | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                          |
| **Llama‑Nemotron Nano 4B**    | 2025      | 4B / 4B            | 128K      | Dense Transformer (Minitron)   | Llama 3.1 8B से NAS संपीड़न                                  |
| **Llama‑Nemotron Super 49B**  | 2025      | 49B / 49B          | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.3 70B से                                           |
| **Llama‑Nemotron Ultra 253B** | 2025      | 253B / 253B        | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.1 405B से; GPQA 76.0%                              |
| **Nemotron‑H 8B**             | 2025      | 8B / 8B            | —         | हाइब्रिड Mamba‑Transformer      | 15T टोकन; 24 Mamba‑2 + 24 MLP + 4 Attn                    |
| **Nemotron‑H 56B**            | 2025      | 56B / 56B          | —         | हाइब्रिड Mamba‑Transformer      | 20T टोकन FP8; 54 Mamba‑2 + 54 MLP + 10 Attn               |
| **Nemotron‑H 47B**            | 2025      | 47B / 47B          | ~1M (FP4) | हाइब्रिड Mamba‑Transformer      | MiniPuzzle from 56B; +20% गति                             |
| **Nemotron Nano 2 (9B)**      | 2025      | 12B → 9B / 9B      | 128K      | हाइब्रिड Mamba‑Transformer      | 20T टोकन; Minitron distillation                           |
| **Nemotron 3 Nano**           | 2025      | 31.6B / 3.2B       | 1M        | हाइब्रिड Mamba‑Transformer MoE  | 25T टोकन; 128 experts, 6 सक्रिय                            |
| **Nemotron 3 Super**          | 2025–2026 | ~100B / ~10B       | 1M        | हाइब्रिड LatentMoE              | MTP; NVFP4                                                |
| **Nemotron 3 Ultra**          | 2025–2026 | ~500B / ~50B       | 1M        | हाइब्रिड LatentMoE              | MTP; NVFP4                                                |

### Nemotron‑4 15B

आर्किटेक्चर: 32 परतें, hidden dimension 6144, 48 attention heads, 8 KV‑heads (GQA)। पैरामीटरों की कुल संख्या — 15 अरब (3.2 अरब embedding + 12.5 अरब non‑embedding)। परिणाम: MMLU — 64.2% (5‑shot), BBH — 58.7% (3‑shot), GSM8K — 46.0% (8‑shot, maj@1), HumanEval — 31.6% (0‑shot, pass@1)। बहुभाषी बेंचमार्क (XCOPA, TyDiQA‑GoldP, MGSM) पर मॉडल 4 गुना बड़े मॉडलों से बेहतर रहा।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

आर्किटेक्चर: 96 परतें, hidden dimension 18,432, 96 attention heads, 8 KV‑heads।

**Nemotron‑4 340B Base** ने दिखाया: MMLU — 81.1% (5‑shot), BBH — 85.4% (3‑shot), HumanEval — 57.3% (0‑shot), ARC‑Challenge — 94.3% (25‑shot)।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** बहु-चरणीय संरेखण से गुज़री: Code SFT → General SFT → DPO → RPO (3 राउंड)। परिणाम: MT‑Bench — 8.22 (GPT‑4‑Turbo judge), MMLU — 78.7% (0‑shot), GSM8K — 92.3% (0‑shot), HumanEval — 73.2% (0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward** अंतिम softmax परत को अंतिम परत की hidden state के 5 HelpSteer2 विशेषताओं के वेक्टर में linear projection से प्रतिस्थापित करती है। अंतिम reward — पाँच विशेषताओं का भारित योग है। प्रशिक्षण HelpSteer2 डेटा पर 2 epochs में किया गया (batch size 128)। RewardBench पर मॉडल ने 92.0% हासिल किया, प्रकाशन के समय GPT‑4o (84.7%), Gemini 1.5 Pro (88.1%) और Claude‑3‑Opus (80.7%) को पीछे छोड़ा।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

| मॉडल                     | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54.2       | 41.5%             | 8.22     |
| Llama‑3‑70B‑Instruct     | 41.1       | 34.4%             | 8.16     |
| Mixtral‑8x22B‑Instruct   | 36.4       | 30.9%             | 7.63     |
| Qwen‑2‑72B‑Instruct      | 48.1       | 38.8%             | 8.26     |

स्रोत: arXiv:2406.11704, तालिका 5।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward** को एक हाइब्रिड विधि से प्रशिक्षित किया गया जो Bradley‑Terry (युग्मित preferences) और SteerLM regression (Likert scale पर बहु-विशेषता मूल्यांकन) को जोड़ती है। प्रशिक्षण केवल HelpSteer2 (CC‑BY‑4.0) डेटा पर किया गया। RewardBench पर मॉडल ने 94.1% हासिल किया, प्रकाशन के समय पहले स्थान पर रहा।<sup>[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct** को REINFORCE एल्गोरिदम (PPO नहीं) और Nemotron‑70B‑Reward reward मॉडल के साथ RLHF विधि से संरेखित किया गया। अवसंरचना — TRT‑LLM acceleration के साथ NeMo‑Aligner।<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano, Super, Ultra (2025)

NAS, distillation और विस्तारित post-training विधियों से Llama 3.x से प्राप्त reasoning मॉडलों का परिवार।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

| मॉडल                      | पैरामीटर | आधार मॉडल                     | संदर्भ |
|---------------------------|---------|-------------------------------|------|
| Llama‑Nemotron‑Nano 8B    | 8 अरब   | Llama‑3.1‑8B‑Instruct         | 128K |
| Llama‑Nemotron‑Nano 4B    | 4 अरब   | Minitron 4B (Llama 3.1 8B से)  | 128K |
| Llama‑Nemotron‑Super 49B  | 49 अरब  | Llama‑3.3‑70B → NAS (Puzzle)  | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 अरब | Llama‑3.1‑405B → NAS (Puzzle) | 128K |

पाँच-चरणीय प्रशिक्षण pipeline: (1) NAS + FFN Fusion, (2) distillation + निरंतर pre-training, (3) SFT (DeepSeek‑R1 reasoning traces सहित), (4) बड़े पैमाने पर RL (Ultra के लिए GRPO, Nano के लिए REINFORCE/RLOO + Online RPO), (5) dialogue के लिए संरेखण।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

ये मॉडल खुले LLM में पहली बार **स्विचेबल reasoning mode** (reasoning toggle) का समर्थन करते हैं: सक्रियण पर (सिस्टम prompt में «detailed thinking on»), मॉडल उत्तर से पहले `<think>...</think>` tags में reasoning chain उत्पन्न करता है; बंद होने पर — सीधे उत्तर देता है।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

Llama‑Nemotron‑Ultra 253B (reasoning ON) के परिणाम: GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%। तुलना के लिए: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5%, AIME 2024 ~79.8%। Ultra एक 8×H100 नोड पर तैनात होता है।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (अप्रैल 2025)

घने हाइब्रिड मॉडलों का परिवार, जो शून्य से प्रशिक्षित और लंबी generation वाले कार्यों के लिए डिज़ाइन किया गया है। Nemotron‑H‑56B को FP8 में 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया — FP8 pre-training के सबसे बड़े सार्वजनिक प्रयोगों में से एक। Nemotron‑H‑47B को MiniPuzzle विधि (63 अरब distillation टोकन) द्वारा 56B के संपीड़न से प्राप्त किया गया और ~1M टोकन के संदर्भ के साथ एक RTX 5090 (FP4) की मेमोरी में फिट होता है।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

| बेंचमार्क                | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60.5           | 61.8           | 58.8         | 51.3          |
| MMLU (5‑shot)         | 84.2           | 83.6           | 86.1         | 78.8          |
| GSM8K (8‑shot CoT)    | 93.7           | 93.3           | 90.9         | 83.9          |
| HumanEval (0‑shot)    | 60.4           | 61.0           | 56.7         | 57.3          |

स्रोत: arXiv:2504.03624।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

H100 पर 65,536 input और 1024 output टोकन के साथ generation पर Nemotron‑H‑47B मॉडल Qwen‑2.5‑72B और Llama‑3.1‑70B की तुलना में 2.9 गुना तेज़ काम करता है।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (अगस्त 2025)

Reasoning के लिए हाइब्रिड Mamba‑Transformer मॉडल। **Nemotron‑Nano‑12B‑v2‑Base** — 62 परतों (मुख्यतः Mamba‑2 + MLP + 4 attention परतें) के साथ मूल मॉडल, जिसे FP8 में शून्य से 20 ट्रिलियन टोकन पर प्रशिक्षित किया गया। इससे विस्तारित Minitron विधि द्वारा **Nemotron‑Nano‑9B‑v2** प्राप्त की गई, जो एक NVIDIA A10G GPU (22 GB, BF16) पर 128K टोकन संदर्भ में काम करने में सक्षम है। Post-training: SFT (80 अरब टोकन, DeepSeek‑R1‑0528 traces सहित) → GRPO → DPO → RLHF। Reasoning बेंचमार्क पर मॉडल सटीकता में Qwen3‑8B के बराबर है, लेकिन लंबी output sequences पर 3–6 गुना तेज़ generation प्राप्त करता है।<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

दिसंबर 2025 में जारी किया गया। पैरामीटर: 31.6 अरब कुल, 3.2 अरब सक्रिय। आर्किटेक्चर: 52 परतें, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128। MoE: 128 routed experts + 1 shared, प्रति टोकन 6 सक्रिय। संदर्भ — 1,048,576 टोकन तक। 25 ट्रिलियन टोकन पर प्रशिक्षण (WSD schedule, batch size 3072, डेटा cutoff — जून 2025) दो चरणों में: Phase 1 — 23.5 ट्रिलियन (विविध डेटा), Phase 2 — 1.5 ट्रिलियन (उच्च-गुणवत्ता डेटा) + 121 अरब टोकन long‑context CPT।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

| बेंचमार्क                | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78.30                   | 80.9                   | 75.0        |
| AIME25 (no tools)     | 89.06                   | 85.0                   | 91.7        |
| AIME25 (with tools)   | 99.17                   | —                      | 98.7        |
| GPQA (no tools)       | 73.04                   | 73.4                   | 71.5        |
| LiveCodeBench v6      | 68.25                   | 66.0                   | 61.0        |
| SWE‑Bench (OpenHands) | 38.76                   | 22.0\*                 | 34.0        |
| TauBench V2 Avg       | 49.04                   | 47.7                   | 47.5        |
| Arena‑Hard‑V2 Avg     | 67.65                   | 57.8                   | 48.55       |
| RULER‑100 @ 1M        | 86.34                   | 77.5                   | —           |

\* — द्वितीयक स्रोतों से मूल्य; पुनरुत्पादन की शर्तें — NeMo Evaluator SDK। स्रोत: arXiv:2512.20848।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NeMo_eval-28)</sup>

Throughput (8K input / 16K output, single H200): Qwen3‑30B‑A3B‑Thinking से 3.3 गुना और GPT‑OSS‑20B से 2.2 गुना अधिक।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

### अतिरिक्त मॉडल और दिशाएँ

- **OpenReasoning‑Nemotron** (जुलाई 2025) — Qwen 2.5 पर आधारित और DeepSeek‑R1‑0528 डेटा पर fine-tuned 1.5B–32B पैरामीटर मॉडलों की श्रृंखला। GenSelect@64 के साथ 32B संस्करण कुछ गणितीय बेंचमार्क पर o3 (high) से बेहतर प्रदर्शन करता है।<sup>[\[29\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — एक मूल मॉडल के भीतर nested sub-models (6B, 9B, 12B) का framework, जो शून्य से प्रशिक्षण की तुलना में प्रशिक्षण लागत को 360 गुना कम करता है।<sup>[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — गणितीय कार्यों से परे बहु-डोमेन Reinforcement Learning प्रशिक्षण का framework, जिसने MATH‑500 पर +30.1% और MMLU‑PRO पर +12.8% सुधार प्रदान किया।<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — संदर्भ का 4 मिलियन टोकन तक विस्तार।<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — कॉम्पैक्ट हाइब्रिड मॉडलों 2B/4B के लिए post-training NAS।<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-JetNemotron-33)</sup>

### विशेषीकृत मॉडल

Nemotron इकोसिस्टम में विशेषीकृत कार्यों के लिए मॉडल भी मौजूद हैं:

- **Nemotron Nano V2 VL** — OCR, तालिका प्रसंस्करण और वीडियो के लिए vision‑language मॉडल।<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — OCR और दस्तावेज़ संरचना निष्कर्षण के लिए मॉडल।<sup>[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — दृश्य दस्तावेज़ खोज (late interaction) के लिए embedding मॉडल।<sup>[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — स्वचालित वाक् पहचान (ASR), वाक् संश्लेषण (TTS) और मशीन अनुवाद (NMT) के लिए मॉडल।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — 9 भाषाओं में 23 श्रेणियों में असुरक्षित सामग्री वर्गीकरण का मॉडल, 84.2% सटीकता के साथ।<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Safety-37)</sup>

## पूर्व-प्रशिक्षण डेटा

### Nemotron‑4 का डेटा संरचना

Nemotron‑4 15B और 340B का pre-training corpus तीन मुख्य श्रेणियों से बना है: अंग्रेज़ी पाठ (70%), 53 भाषाओं में बहुभाषी पाठ (15%) और 43 प्रोग्रामिंग भाषाओं में स्रोत कोड (15%)। दस्तावेज़ स्तर पर deduplication (exact और near‑duplicate) के साथ-साथ भाषा मॉडलों और heuristics का उपयोग करके फ़िल्टरिंग की गई। 15B मॉडल को 8 ट्रिलियन टोकन पर और 340B मॉडल को 9 ट्रिलियन टोकन (8 ट्रिलियन pre-training + 1 ट्रिलियन उच्च-गुणवत्ता स्रोतों के पुनर्भार के साथ निरंतर प्रशिक्षण) पर प्रशिक्षित किया गया।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

**Nemotron‑CC** dataset Common Crawl से quality classifiers के ensemble और पाठों के सिंथेटिक paraphrasing का उपयोग करके बनाया गया है। कुल मात्रा — **6.3 ट्रिलियन टोकन** (4.4 ट्रिलियन deduplicated + 1.9 ट्रिलियन सिंथेटिक reformulations)। Pipeline NeMo Curator टूल में एकीकृत है। यह कार्य ACL 2025 में Long Paper के रूप में स्वीकार किया गया।<sup>[\[38\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

LaTeX में गणितीय सूत्रों और कोड की संरचना को संरक्षित करते हुए Lynx + LLM pipeline का उपयोग करके Common Crawl से निकाला गया **133 अरब टोकन** का गणित-उन्मुख उप-समुच्चय।<sup>[\[39\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NemotronCC_Math-39)</sup>

### Nemotron 3 Nano का डेटा

Nemotron 3 Nano का pre-training 25 ट्रिलियन टोकन पर किया गया। समुच्चय में शामिल हैं: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 और विशेष STEM datasets। Long‑context प्रशिक्षण के लिए अतिरिक्त 121 अरब टोकन CPT का उपयोग किया गया।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

सिंथेटिक रूप से उत्पन्न समुच्चय जो STEM, शैक्षणिक पाठ, reasoning कार्य और बहुभाषी क्षेत्रों को कवर करता है; इसमें 10 ट्रिलियन से अधिक भाषा टोकन और SFT के लिए 18 मिलियन नमूने शामिल हैं। सभी dataset खुले अनुमेय लाइसेंस के अंतर्गत वितरित हैं।<sup>[\[40\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NemotronNano2_page-40)</sup>

### सिंथेटिक डेटा जनरेशन (SDG) पाइपलाइन

Nemotron‑4 340B रिपोर्ट में वर्णित pipeline में निम्नलिखित चरण शामिल हैं<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>:

- **Prompt जनरेशन**: Open QA, Writing, Closed QA, Math & Coding टेम्पलेट्स के अनुसार Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 लाइसेंस) की सहायता से उत्पन्न सिंथेटिक एकल और दो-टर्न प्रश्न।
- **उत्तर जनरेशन**: विविधता सुनिश्चित करने के लिए मॉडलों के मध्यवर्ती संस्करणों से कई उत्तर।
- **गुणवत्ता मूल्यांकन**: तीन दृष्टिकोण — Ground‑Truth‑as‑a‑Judge (सत्यापन योग्य उत्तर वाले कार्यों के लिए), LLM‑as‑Judge (भाषा मॉडल द्वारा उत्तर युग्मों की तुलना), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward का उपयोग)।
- **कमज़ोर से मज़बूत मॉडलों तक (weak‑to‑strong) पुनरावृत्त संरेखण**।

~20,000 मानव-annotated उदाहरणों (10,000 SFT के लिए, 10,000 HelpSteer2 reward मॉडल के लिए) से संपूर्ण शेष alignment डेटा सिंथेटिक रूप से उत्पन्न किया गया।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)</sup>

## Quantization और Inference अनुकूलन

Nemotron 3 Nano मॉडल ModelOpt और Megatron‑LM का उपयोग करके FP8 में Post‑Training Quantization (PTQ) का समर्थन करते हैं। Selective quantization लागू की जाती है — attention परतें और Mamba का एक भाग गुणवत्ता बनाए रखने के लिए BF16 में रखे जाते हैं; बाकी को FP8 में quantize किया जाता है। तकनीकी रिपोर्ट के अनुसार, यह ~99% सटीकता retention सुनिश्चित करता है।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup> Nano NVFP4 प्रारूप में inference का भी समर्थन करता है।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

## पीढ़ियों के अनुसार बेंचमार्क सारांश तालिका

| मॉडल                            | MMLU  | GSM8K | HumanEval | Arena Hard | MT‑Bench | शर्तें                     |
|---------------------------------|-------|-------|-----------|------------|----------|-------------------------|
| Nemotron‑4 15B                  | 64.2% | 46.0% | 31.6%     | —          | —        | base; 5‑/8‑/0‑shot      |
| Nemotron‑4 340B Base            | 81.1% | —     | 57.3%     | —          | —        | 5‑/—/0‑shot             |
| Nemotron‑4 340B Instruct        | 78.7% | 92.3% | 73.2%     | 54.2       | 8.22     | 0‑shot                  |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —     | —     | —         | 85.0       | 8.98     | अक्टूबर 2024              |
| LN‑Ultra 253B (reasoning ON)    | —     | —     | —         | —          | —        | GPQA 76.0%, AIME 80.8%  |
| Nemotron‑H‑47B                  | 83.6% | 93.3% | 61.0%     | —          | —        | 5‑/8‑CoT/0‑shot         |
| Nemotron 3 Nano (30B‑A3B)       | —     | —     | —         | 67.7 (v2)  | —        | AIME25 89.1%, LCB 68.3% |

तुलना को सावधानी से व्याख्यायित किया जाना चाहिए: मूल्यांकन की शर्तें, बेंचमार्क के संस्करण और परीक्षण की तारीखें पीढ़ियों के बीच भिन्न हैं। परिणाम NVIDIA के तकनीकी रिपोर्टों से लिए गए हैं; स्वतंत्र मूल्यांकन भिन्न हो सकते हैं (देखें «सीमाएँ» अनुभाग)।<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

## अनुप्रयोग

### NVIDIA NIM के माध्यम से तैनाती

NVIDIA NIM — OpenAI‑संगत API के साथ inference के लिए अनुकूलित containerized microservices का एक सेट। Nemotron मॉडल build.nvidia.com प्लेटफॉर्म पर NIM‑microservices के रूप में उपलब्ध हैं। NIM FP8, BF16, NVFP4 प्रारूपों और Kubernetes पर Helm charts के माध्यम से तैनाती का समर्थन करता है। मॉडल स्वतंत्र frameworks के साथ भी संगत हैं: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM।<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

### सिंथेटिक डेटा जनरेशन

Nemotron‑4 340B को सिंथेटिक डेटा जनरेटर के रूप में उपयोग के लिए डिज़ाइन किया गया है: Instruct मॉडल उत्तर उत्पन्न करता है, Reward मॉडल उनका मूल्यांकन और फ़िल्टरिंग करता है। NVIDIA Open Model License स्पष्ट रूप से अन्य मॉडलों के प्रशिक्षण के लिए मॉडल के outputs का उपयोग करने की अनुमति देता है। ServiceNow के अनुसार, उनके Apriel 1.6 मॉडल के 15% pre-training डेटा Nemotron datasets से प्राप्त किए गए हैं।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NeMo_synth-41)</sup>

### एजेंटिक प्रणालियाँ

Nemotron 3 परिवार के मॉडल (Nano, Super, Ultra) बहु-एजेंट कार्यभार के लिए अभिप्रेत हैं: योजना बनाना, retrieval, tool use। Nemotron 3 Nano SWE‑Bench पर 38.76% (OpenHands के साथ) और TauBench V2 पर 49.04% (औसत) परिणाम प्रदर्शित करता है।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

### कॉर्पोरेट कार्यान्वयन

घोषित भागीदारों में शामिल हैं: ServiceNow (कार्यप्रवाह स्वचालन के लिए संयुक्त Apriel Nemotron 15B मॉडल), CrowdStrike (Charlotte AI प्लेटफॉर्म), Perplexity (अनुरोध रूटिंग), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom। मॉडल AWS Amazon Bedrock पर उपलब्ध हैं; Google Cloud, CoreWeave, Nebius के लिए समर्थन की योजना है।<sup>[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NVIDIA_news-15)</sup>

## सीमाएँ और खुली समस्याएँ

### स्वतंत्र मूल्यांकन और NVIDIA डेटा से विसंगतियाँ

स्वतंत्र मूल्यांकन NVIDIA द्वारा प्रस्तुत परिणामों से विसंगतियाँ प्रकट करते हैं। Artificial Analysis (फरवरी 2026) के अनुसार, Llama‑Nemotron‑Ultra 253B (reasoning) को तुलनीय आकार के मॉडलों के लिए 26 के औसत की तुलना में 15 का Intelligence Index प्राप्त हुआ। Chatbot Arena (LMArena) प्लेटफॉर्म पर Nemotron मॉडल मध्य रैंकिंग में हैं: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147वीं स्थान), Nemotron 3 Nano — 1317 ±6 (~164वीं स्थान)।<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-LMArena-43)</sup>

### शब्दाडंबर

Nemotron मॉडल बढ़ी हुई शब्दाडंबरता प्रदर्शित करते हैं: Artificial Analysis के मूल्यांकन में Nemotron 3 Nano ने 140 मिलियन टोकन उत्पन्न किए (अन्य मॉडलों के लिए 12 मिलियन के औसत की तुलना में), जिससे inference लागत बढ़ती है। DEV Community के विश्लेषण ने पाया कि Llama‑3.1‑Nemotron‑70B‑Instruct स्वचालित बेंचमार्क पर औपचारिक नेतृत्व के बावजूद कुछ व्यावहारिक कार्यों में अपर्याप्त सटीकता प्रदर्शित करता था, और Arena जैसे बेंचमार्क पर उच्च स्कोर विस्तृत और आत्मविश्वासी, लेकिन ज़रूरी नहीं कि सटीक उत्तरों की प्राथमिकता से समझाया जा सकता था।<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Saplin-44)</sup>

### Hallucination और Bias

NVIDIA मॉडल कार्डों में इंगित करता है कि मॉडल «पूर्वाग्रहों को बढ़ा सकते हैं और विषाक्त prompts के साथ विशेष रूप से विषाक्त उत्तर उत्पन्न कर सकते हैं», साथ ही «गलत जानकारी उत्पन्न कर सकते हैं और मुख्य विवरण छोड़ सकते हैं»। भार और डेटा की खुलापन बाहरी ऑडिट की अनुमति देता है।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nano2-13)</sup>

### कंप्यूटेशनल आवश्यकताएँ

सघन मॉडल (Nemotron‑4 340B) को पूर्ण प्रशिक्षण के लिए 768 DGX H100 नोड्स के cluster की आवश्यकता है, जो समकक्ष अवसंरचना तक पहुँच के बिना शैक्षणिक समूहों के लिए पुनरुत्पादनीयता को सीमित करता है। inference के दौरान लंबा संदर्भ (1M) महत्वपूर्ण VRAM की आवश्यकता है।<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

### संदर्भ विस्तार पर गिरावट

अत्यधिक लंबी sequences तक संदर्भ का विस्तार करने पर छोटे संदर्भ वाले बेंचमार्क पर परिणामों में गिरावट देखी गई।<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-UltraLong-32)</sup>

### हाइब्रिड आर्किटेक्चर की Quantization

Mamba‑Transformer आर्किटेक्चर में अत्यंत कम बिट-चौड़ाई (FP8/NVFP4) के उपयोग से कुछ बेंचमार्क पर सटीकता में मामूली गिरावट (~1%) होती है। यह समस्या selective quantization के उपयोग से हल की जाती है, जो compiler और inference server आर्किटेक्चर को जटिल बनाती है।<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

### अन्य खुली समस्याएँ

- प्रशिक्षण डेटा की संभावित contamination के साथ बेंचमार्क पर निर्भरता।
- शुद्ध Transformer मॉडलों के साथ हाइब्रिड SSM‑Transformer आर्किटेक्चर की तुलना के लिए मानकीकृत प्रोटोकॉल का अभाव।
- प्रति टोकन कम experts के साथ गहन reasoning की आवश्यकता वाले कार्यों पर MoE दृष्टिकोण की मापनीयता का प्रश्न।
- दिसंबर 2025 तक Super/Ultra पर डेटा प्रारंभिक है; रिलीज़ के बाद पूर्ण बेंचमार्क की प्रतीक्षा है।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

## नैतिक और नियामक पहलू

### विकास चरण में सुरक्षा

विकास चरण में लागू होते हैं: AEGIS framework (सामग्री सुरक्षा की 13 श्रेणियाँ) के अनुसार मूल्यांकन, garak vulnerability scanner, मैनुअल red‑teaming।<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Safety-37)</sup>

### Inference चरण में सुरक्षा

**NeMo Guardrails** — एक खुला टूलकिट (Apache 2.0 लाइसेंस), जो LLM प्रणालियों में programmable barriers जोड़ता है। Microservice inputs और outputs को intercept करता है, configurable checks लागू करते हुए: विषय नियंत्रण, PII पहचान, RAG «grounding» सत्यापन, jailbreak-attack पहचान (YARA-based code injection protection सहित), बहुभाषी बहुमोडल सुरक्षा वर्गीकरण।<sup>[\[45\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Guardrails-45)</sup>

Nemotron 3 के लिए, tool use के साथ यथार्थवादी परिदृश्यों से ~11,000 labeled OpenTelemetry traces का एक सेट प्रकाशित किया गया, जो एजेंटिक सुरक्षा मूल्यांकन के लिए अभिप्रेत है।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

### लाइसेंसिंग

| मॉडल                                   | लाइसेंस                                         |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano, Super, Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (Meta से विरासत)       |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License** वाणिज्यिक उपयोग, व्युत्पन्न कार्यों के निर्माण और वितरण की अनुमति देता है, attribution की आवश्यकता नहीं है (NOTICE फ़ाइल को बनाए रखते हुए), उपयोगकर्ताओं की संख्या पर कोई प्रतिबंध नहीं लगाता और अन्य मॉडलों के प्रशिक्षण के लिए मॉडल outputs के उपयोग की स्पष्ट अनुमति देता है।<sup>[\[46\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-License-46)</sup> Llama पर आधारित मॉडल 700 मिलियन मासिक सक्रिय उपयोगकर्ताओं की सीमा सहित Meta की प्रतिबंधों को विरासत में लेते हैं।<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Llama_Nemotron-11)</sup>

Nemotron 3 Nano के लिए NVIDIA ने प्रकाशित किया: मॉडल भार, 10 ट्रिलियन से अधिक training data टोकन, प्रशिक्षण नुस्खे, codebase (NeMo, Megatron‑LM, NeMo‑Aligner), 900,000+ कार्यों के साथ 10 से अधिक Reinforcement Learning प्रशिक्षण वातावरण।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_nano_report-2)</sup>

## भविष्य की संभावनाएँ और शोध दिशाएँ

निकट भविष्य के releases में **Nemotron 3 Super** (~100 अरब पैरामीटर, ~10 अरब सक्रिय) और **Nemotron 3 Ultra** (~500 अरब, ~50 अरब सक्रिय) शामिल हैं, जो 2026 की पहली छमाही में अपेक्षित हैं। दोनों मॉडल Blackwell आर्किटेक्चर पर LatentMoE, MTP और NVFP4 प्रारूप में प्रशिक्षण का उपयोग करेंगे।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)</sup>

NVIDIA की रणनीतिक दिशा — Nemotron को एक अकेले मॉडल के रूप में नहीं बल्कि बहु-एजेंट प्रणालियों के लिए एक अवसंरचना परत के रूप में स्थापित करना, जहाँ परिवार के विभिन्न मॉडल जटिलता के अनुसार रूटिंग के साथ विभिन्न कार्यों के लिए उपयोग किए जाते हैं।<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NVIDIA_news-15)</sup>

मुख्य शोध दिशाएँ:

- हाइब्रिड आर्किटेक्चर का विकास — मापनीय लंबे संदर्भ के लिए attention mechanism के साथ SSM‑layers का और एकीकरण।<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Nemotron_H-12)</sup>
- बहु-स्तरीय संपीड़न विधियाँ — Minitron, Puzzle, MiniPuzzle और Nemotron Elastic का विकास।<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Elastic-30)</sup>
- बहु-डोमेन Reinforcement Learning — गणितीय कार्यों से परे RL के विस्तार के लिए Nemotron‑CrossThink।<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-CrossThink-31)</sup>
- संदर्भ विस्तार — Nemotron‑UltraLong को 4 मिलियन टोकन तक।<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-UltraLong-32)</sup>
- बहुमोडलता — vision‑language (Nemotron VL), वाक् (Nemotron Speech), दृश्य दस्तावेज़ खोज (Nemotron ColEmbed V2) के क्षेत्र में विस्तार।<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-ColEmbed-36)</sup>
- कॉम्पैक्ट हाइब्रिड मॉडल — Jet‑Nemotron (2B/4B मॉडलों के लिए NAS)।<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-JetNemotron-33)</sup>
- खुले नुस्खे — समुदाय द्वारा पुनरुत्पादन और अनुकूलन के लिए पूर्ण प्रशिक्षण नुस्खों और डेटा का प्रकाशन।<sup>[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_note-N3_blog-14)</sup>

## यह भी देखें

- Transformer आर्किटेक्चर
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta के मॉडलों का परिवार)

## संदर्भ

- NVIDIA Research — Nemotron 3 पृष्ठ: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — Nemotron दस्तावेज़ीकरण: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- NeMo Framework Documentation: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## साहित्य

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, फरवरी 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, जून 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, जून 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, जुलाई 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, नवंबर 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203, जनवरी 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, अप्रैल 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, मई 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444, अगस्त 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096, अगस्त 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664, नवंबर 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, दिसंबर 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848, दिसंबर 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. et al. *GQA*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. et al. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. et al. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## टिप्पणियाँ

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NV_developer_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nano2_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nano2_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_blog_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_blog_14-1)</sup> <sup>[14.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Minitron_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Puzzle_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-RPO_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Elastic_30-0)</sup> <sup>[30.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-CrossThink_31-0)</sup> <sup>[31.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-UltraLong_32-0)</sup> <sup>[32.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-UltraLong_32-1)</sup> <sup>[32.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-JetNemotron_33-0)</sup> <sup>[33.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Parse_35-0)</sup> <sup>[35.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-ColEmbed_36-0)</sup> <sup>[36.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Safety_37-0)</sup> <sup>[37.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-AA_42-0)</sup> <sup>[42.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(HI)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
