---
title: "Nemotron (NVIDIA) (UR)"
source: "https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)"
wiki: "systems-analysis.info/int"
article: "Nemotron_(NVIDIA)_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 4860
wiki_created_at: 2026-09-06T23:41:04Z
wiki_modified_at: 2026-09-06T23:41:04Z
downloaded_at: 2026-09-07T23:05:18Z
---

# Nemotron (NVIDIA) (UR)

**Nemotron** — کھلے وزن (open weights) والے بڑے لسانی ماڈلوں (Large Language Model, LLM) کا ایک خاندان ہے جسے NVIDIA کارپوریشن کے Applied Deep Learning Research (ADLR) ڈویژن نے تیار کیا ہے۔ یہ ماڈل Machine Learning اور قدرتی زبان کی پروسیسنگ (Natural Language Processing, NLP) کے شعبے سے تعلق رکھتے ہیں اور وسیع پیمانے پر کاموں کے لیے مناسب ہیں: مصنوعی ڈیٹا کی تخلیق، منطقی استنتاج (reasoning)، ایجنٹ پر مبنی ایپلیکیشنز (agentic AI) اور NVIDIA کے صنعتی ہارڈ ویئر پر تعیناتی۔ اس خاندان میں مختلف آرکیٹیکچر اور پیمانے کے ماڈل شامل ہیں: 4 ارب سے لے کر تقریباً 500 ارب پیرامیٹرز تک، جن میں Nemotron‑4 سیریز (2024) کے گھنے (dense) decoder‑only Transformer ماڈل، ہائبرڈ Mamba‑Transformer (Nemotron‑H، 2025) اور Nemotron 3 سیریز (2025) کے Mixture-of-Experts (MoE) کے ساتھ ہائبرڈ Mamba‑Transformer ماڈل شامل ہیں۔ مارچ 2026 تک اس خاندان میں 20 سے زائد ماڈل شامل ہو چکے ہیں جو متن کی تخلیق، استدلال، دستاویزات کی بصری فہم، معلومات کے استخراج اور جوابات کے معیار کی تشخیص کے کاموں کا احاطہ کرتے ہیں۔ ماڈل بنیادی طور پر NVIDIA Open Model License اور Llama Community License کے تحت کھلے وزن کے ساتھ جاری کیے جاتے ہیں۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

## تاریخ اور پس منظر

Nemotron خاندان کی ترقی NVIDIA کی اس حکمت عملی کے تناظر میں جاری ہے جس کا مقصد تخلیقی AI کے لیے ٹولز کا مکمل اسٹیک بنانا ہے: تربیتی بنیادی ڈھانچے (DGX، GPU H100/B200 پر مبنی سپر کمپیوٹرز) سے لے کر تربیتی پلیٹ فارمز (NeMo Framework)، صف بندی (NeMo‑Aligner)، تعیناتی (NIM — NVIDIA Inference Microservices) اور حفاظت (NeMo Guardrails) تک۔<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

سیریز کا پہلا عوامی طور پر دستیاب ماڈل — 8 ارب پیرامیٹرز اور 4096 ٹوکنز کے context کے ساتھ ایک decoder Transformer ہے جسے 53 قدرتی اور 37 پروگرامنگ زبانوں میں **3.8 ٹریلین ٹوکنز** پر تربیت دی گئی۔ تربیت 1024 GPU A100 پر 19 دنوں میں مکمل کی گئی۔ arXiv پر کوئی باقاعدہ تکنیکی رپورٹ شائع نہیں کی گئی۔ ماڈل NeMo Framework اور Hugging Face کے ذریعے تقسیم کیا گیا تھا، Chat (SFT اور SteerLM) کے ورژن موجود تھے۔ لائسنس — NVIDIA AI Foundation Models Community License۔<sup>[\[6\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-MS_nemotron3-7)</sup>

*ناموں کے بارے میں نوٹ*: 2023 کا «Nemotron‑3» اور دسمبر 2025 کا «Nemotron 3» — دو مختلف ماڈل ہیں۔ پہلا ابتدائی پروٹو ٹائپ تھا، دوسرا MoE آرکیٹیکچر کے ساتھ موجودہ نسل ہے۔

### Nemotron‑4 15B (فروری 2024)

Nemotron‑4 سیریز کا پہلا عوامی طور پر دستاویزی اجراء — 15 ارب پیرامیٹرز کا ماڈل جسے 384 DGX H100 نوڈز (3072 GPU تک) پر ~13 کیلنڈر دنوں میں 8 ٹریلین ٹوکنز پر تربیت دی گئی۔ 8 گنا tensor parallelism اور 96 سے 288 تک data parallelism استعمال کیا گیا۔ batch size 384 پر زیادہ سے زیادہ MFU (Model FLOPs Utilization) 34.3% رہی۔ آرکیٹیکچر — Grouped‑Query Attention (GQA) اور Rotary Position Embeddings (RoPE) کے ساتھ decoder‑only Transformer۔ اشاعت کے وقت بینچ مارک نتائج کے مطابق ماڈل نے کثیر لسانی کاموں میں اپنے ہم پیمانہ تمام کھلے ماڈلوں کو پیچھے چھوڑ دیا، جن میں ایسے کچھ ماڈل بھی شامل تھے جو اس سے چار گنا بڑے تھے۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (جون 2024)

جون 2024 میں Nemotron‑4 سیریز کا سب سے بڑا ماڈل جاری کیا گیا — 340 ارب پیرامیٹرز (331.6 ارب non‑embedding)، جسے 9 ٹریلین ٹوکنز پر پری ٹرین کیا گیا (8 ٹریلین pre-training + 1 ٹریلین اعلیٰ معیاری ذرائع کو دوبارہ وزن دے کر جاری تربیت)۔ تربیت دسمبر 2023 سے مئی 2024 تک 768 DGX H100 نوڈز (6144 GPU تک) پر 42.4% کی زیادہ سے زیادہ MFU کے ساتھ کی گئی۔ خاندان میں تین ورژن شامل ہیں: Base، Instruct اور Reward۔ ماڈل کا سائز اس طرح منتخب کیا گیا کہ یہ FP8 درستگی کی شکل میں تعیناتی کے وقت ایک DGX H100 نوڈ (8 GPU) میں سما سکے۔ صف بندی (alignment) میں استعمال کیے گئے 98% سے زیادہ ڈیٹا کو سیریز کے ماڈلوں نے خود ایک تکراری عمل میں مصنوعی طور پر تیار کیا؛ مصنوعی ڈیٹا تخلیق کا پائپ لائن دوبارہ پیداوار کے لیے کھلا ہے۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (اکتوبر 2024)

اکتوبر 2024 میں Meta Llama‑3.1‑70B‑Instruct سے fine-tune کیے گئے ماڈل جاری کیے گئے: Llama‑3.1‑Nemotron‑70B‑Instruct اور Llama‑3.1‑Nemotron‑70B‑Reward۔ 1 اکتوبر 2024 تک Instruct ماڈل تین خودکار بینچ مارکس پر بیک وقت پہلے مقام پر تھا: Arena Hard — 85.0، AlpacaEval 2 LC — 57.6%، MT‑Bench (GPT‑4‑Turbo) — 8.98۔ Reward ماڈل نے RewardBench پر 94.1% حاصل کیا۔<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LN70B_Reward-10)</sup>

### ہائبرڈ آرکیٹیکچرز کی طرف منتقلی (2025)

2025 میں سیریز میں ہائبرڈ آرکیٹیکچرز شامل ہوئے جو Mamba‑2 (State Space Model, SSM — حالتِ فضا کا ماڈل) اور Transformer پرتوں کو یکجا کرتے ہیں۔ مارچ تا مئی 2025 میں قابلِ تبادل reasoning موڈ کے ساتھ استدلال کرنے والے ماڈلوں کا خاندان **Llama‑Nemotron** (Nano 8B، Super 49B، Ultra 253B) جاری کیا گیا۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup> اپریل 2025 میں **Nemotron‑H** (arXiv:2504.03624) شائع کیا گیا — 8B، 56B اور 47B پیرامیٹرز کے سائز کے ہائبرڈ Mamba‑Transformer ماڈلوں کا خاندان۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup> اگست 2025 میں **Nemotron Nano 2** (9B‑v2، arXiv:2508.14444) پیش کیا گیا۔<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nano2-13)</sup>

### Nemotron 3 (دسمبر 2025)

15 دسمبر 2025 کو تیسری نسل کا اعلان کیا گیا — Nano، Super اور Ultra ماڈلوں کے ساتھ Nemotron 3 خاندان جو Mamba‑2، Transformer اور MoE آرکیٹیکچرز کو 1 ملین ٹوکنز تک کی context window کے ساتھ یکجا کرتا ہے۔ Nano تکنیکی رپورٹ کے ساتھ جاری کیا گیا؛ Super اور Ultra 2026 کی پہلی ششماہی کے لیے منصوبہ بند ہیں۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NVIDIA_news-15)</sup>

## نظری بنیادیں

### Nemotron‑4 میں Transformer آرکیٹیکچر

Nemotron‑4 سیریز کے ماڈل causال attention کے ساتھ معیاری decoder Transformer آرکیٹیکچر پر بنائے گئے ہیں۔ ٹوکنز کی ترتیب کا امکان $x_{1},x_{2},\ldots,x_{T}$ اس طرح factorize کیا جاتا ہے:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};\theta),
$$

جہاں $\theta$ — ماڈل کے پیرامیٹرز ہیں۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)</sup>

attention کا طریقہ کار Grouped‑Query Attention (GQA)<sup>[\[16\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-GQA-16)</sup> کی شکل میں نافذ کیا گیا ہے:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V,
$$

جہاں $Q,K,V$ — queries، keys اور values کی میٹرکسز ہیں؛ $d_{k}$ — attention head کی جہت ہے۔

پوزیشنز کو encode کرنے کے لیے Rotary Position Embeddings (RoPE)<sup>[\[17\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-RoPE-17)</sup> استعمال کیے جاتے ہیں:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos m\theta_{1} - x_{m}^{(2)}\sin m\theta_{1}} \\
{x_{m}^{(1)}\sin m\theta_{1} + x_{m}^{(2)}\cos m\theta_{1}} \\
 \vdots 
\end{pmatrix},
$$

جہاں $x_{m}$ — پوزیشن $m$ پر ویکٹر ہے، $\theta_{i} = 10000^{- 2i/d}$، $d$ — ویکٹر کی جہت ہے۔

MLP پرتوں میں Squared ReLU activation استعمال ہوتی ہے: $f(x) = (\max(0,x))^{2}$، جو activations میں بکھراؤ (sparsity) فراہم کرتی ہے۔ ماڈلوں میں biases نہیں ہیں، dropout استعمال نہیں کیا جاتا، اور input و output embedding میٹرکسز ایک دوسرے سے منسلک نہیں ہیں (untied embeddings)۔ Tokenizer — SentencePiece BPE ہے جس میں spaces محفوظ رہتے ہیں، اعداد حرف بہ حرف تقسیم ہوتے ہیں اور byte-level fallback ہے، vocabulary کا سائز — 256,000 ہے۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

##### Nemotron‑4 کے آرکیٹیکچرل پیرامیٹرز

| پیرامیٹر           | Nemotron‑4 15B          | Nemotron‑4 340B          |
|--------------------|-------------------------|--------------------------|
| پیرامیٹرز کی تعداد | 15 ارب (3.2 ارب embed.) | 340 ارب (9.4 ارب embed.) |
| پرتوں کی تعداد     | 32                      | 96                       |
| پوشیدہ جہت         | 6144                    | 18,432                   |
| attention heads    | 48                      | 96                       |
| KV‑heads (GQA)     | 8                       | 8                        |
| context کی لمبائی  | 4096                    | 4096                     |
| vocabulary کا سائز | 256,000                 | 256,000                  |

ماخذ: arXiv:2402.16819, arXiv:2406.11704۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

### ہائبرڈ Mamba‑Transformer آرکیٹیکچر (Nemotron‑H)

Nemotron‑H ماڈلوں میں معیاری self-attention بلاکس کو جزوی طور پر Mamba‑2 بلاکس — State Space Models (SSM) سے تبدیل کر دیا گیا ہے۔ خودکار ترتیب (autoregressive) کے ساتھ تخلیق میں، ہر self-attention پرت کو فی قدم $O(n)$ آپریشنز اور میموری درکار ہوتی ہے (KV‑cache کی وجہ سے)، جبکہ Mamba پرتیں ہر تیار کیے جانے والے ٹوکن پر مستقل میموری اور حسابی اخراجات فراہم کرتی ہیں۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 کو اس تکراری تعلق سے بیان کیا جاتا ہے<sup>[\[18\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Mamba2-18)</sup>:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

جہاں $h_{t} \in {\mathbb{R}}^{N}$ — پوشیدہ حالت ہے، $A \in {\mathbb{R}}^{N \times N}$ — حالت کی منتقلی کی قطری میٹرکس ہے، $B \in {\mathbb{R}}^{N \times 1}$ اور $C \in {\mathbb{R}}^{1 \times N}$ — projection میٹرکسز ہیں، $x_{t}$ — input ٹوکن ہے، $y_{t}$ — output سگنل ہے۔ Mamba‑2 میں میٹرکسز $A$، $B$، $C$ input پر منحصر (input‑dependent) ہیں، جو اس ماڈل کو کلاسیکی linear SSM سے ممتاز کرتا ہے۔

Nemotron‑H‑56B میں **54 Mamba‑2 پرتیں + 54 MLP پرتیں + 10 self-attention پرتیں** استعمال ہوتی ہیں، جہاں attention پرتیں Mamba پرتوں کے درمیان یکساں طور پر رکھی گئی ہیں۔ ماڈل کو 6144 GPU H100 پر FP8 (per‑tensor scaling) شکل میں 20 ٹریلین ٹوکنز پر تربیت دی گئی۔ Nemotron‑H‑8B ورژن میں 24 Mamba‑2 پرتیں، 24 MLP پرتیں اور 4 self-attention پرتیں ہیں؛ تربیت 15 ٹریلین ٹوکنز پر کی گئی۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

### Nemotron 3 کا MoE آرکیٹیکچر

Nemotron 3 ماڈل (دسمبر 2025) تین آرکیٹیکچرل اجزاء کو یکجا کرتے ہیں: Mamba‑2، Transformer اور Mixture‑of‑Experts۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) میں 52 پرتیں ہیں: **23 Mamba‑2 + MoE پرتیں، 23 MoE پرتیں اور 6 GQA‑attention پرتیں**۔ ہر MoE پرت میں 128 routed ماہرین + 1 مشترک (shared) ماہر شامل ہیں، جن میں سے 6 ماہرین فی ٹوکن فعال ہوتے ہیں۔ routing ایک قابلِ تربیت MLP router کے ذریعے sigmoid gating کے ساتھ انجام دی جاتی ہے۔ بوجھ کا توازن بغیر معاون loss function (aux‑loss‑free) کے نافذ کیا گیا ہے۔ پیرامیٹرز کی کل تعداد 31.6 ارب ہے، لیکن ہر ٹوکن پر صرف 3.2 ارب فعال ہوتے ہیں۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

نارمل سازی — RMSNorm<sup>[\[19\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-RMSNorm-19)</sup>۔ Mamba حصوں میں positional embeddings موجود نہیں ہیں (پوزیشن کی معلومات SSM حالت میں ضمنی طور پر موجود ہے)۔ untied embeddings استعمال کی جاتی ہیں، linear پرتوں میں dropout اور bias موجود نہیں ہیں۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

### Super/Ultra میں توسیعات: LatentMoE اور Multi‑Token Prediction

Nemotron 3 خاندان کے Super اور Ultra ماڈل دو اضافی آرکیٹیکچرل اختراعات استعمال کرتے ہیں:

- **Latent MoE (LatentMoE)** — routing سے پہلے input representation کو چھوٹی جہت کے latent space میں project کرنا، جس سے موازنہ حسابی اخراجات پر ماہرین کی تعداد بڑھانے اور throughput کو کم کیے بغیر درستگی میں اضافے کا موقع ملتا ہے۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — ایک ساتھ متعدد اگلے ٹوکنز کی پیشین گوئی، جو لمبے متون کے معیار کو بہتر بنانے اور inference کے دوران speculative decoding کے لیے استعمال ہوتی ہے۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

Super اور Ultra کی تربیت NVFP4 شکل میں کی جاتی ہے — Blackwell آرکیٹیکچر پر NVIDIA کا 4-bit عددی فارمیٹ۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

### ماڈلوں کو مختصر کرنے کے طریقے: Minitron، Puzzle، MiniPuzzle

مختصر ماڈل بنانے کے لیے NVIDIA کئی طریقے استعمال کرتا ہے:

- **Minitron** — ساختی pruning اور knowledge distillation کا طریقہ۔ pruning کی دو اقسام زیر تحقیق ہیں: گہرائی سے (پرتوں کو ہٹانا) اور چوڑائی سے (پوشیدہ پرتوں کی جہتوں، attention heads اور MLP projections کا مشترک کم کرنا)۔ Nemotron‑4 15B پر Minitron کا اطلاق 8B اور 4B ماڈل حاصل کرنے کی اجازت دیتا ہے جس میں از سرِ نو تربیت کے مقابلے میں تربیتی اخراجات 40 گنا تک کم ہوتے ہیں۔<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Minitron-20)</sup>
- **Puzzle** — Neural Architecture Search (NAS) الگورتھم جو ہر بلاک کی بہترین configuration (KV‑heads کی تعداد، FFN کا سائز، attention کی موجودگی یا غیر موجودگی) بلاک وار distillation کے ساتھ منتخب کرتا ہے۔ اسی طرح Llama 3.1 405B کو 253B (Llama‑Nemotron Ultra) تک اور Llama 3.3 70B کو 49B (Llama‑Nemotron Super) تک مختصر کیا گیا۔<sup>[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — ہائبرڈ آرکیٹیکچرز کے لیے Puzzle کی توسیع جس نے صرف 63 ارب distillation ٹوکنز کی لاگت پر Nemotron‑H‑56B کو 47B تک مختصر کر دیا۔ ملتی جلتی درستگی کے ساتھ مختصر کردہ ماڈل 20% تیز چلتا ہے۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

## صف بندی کے طریقے

### HelpSteer اور HelpSteer2

**HelpSteer** — 37,120 مثالوں کا ایک مجموعہ (لائسنس CC‑BY‑4.0) جو Scale AI کے تعاون سے بنایا گیا، جس میں ہر جواب کو پانچ خصوصیات کے مطابق annotate کیا گیا ہے: مفیدیت (helpfulness)، درستگی (correctness)، ربط (coherence)، پیچیدگی (complexity) اور بیان کی طوالت (verbosity) لیکرٹ اسکیل 0–4 پر۔<sup>[\[22\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — 21,362 مثالوں کا اپ ڈیٹ شدہ مجموعہ (10,681 prompts × 2 جوابات)، جہاں 95% سے زیادہ prompts ShareGPT (حقیقی صارف کی درخواستیں) سے لیے گئے ہیں۔ تقریباً 50% annotations کو ناکافی معیار کی وجہ سے فلٹر کیا گیا۔ **HelpSteer2‑Preference** توسیع annotators کی جوڑا ترجیحات شامل کرتی ہے، جو ایک ہی ڈیٹا پر regression اور pairwise reward ماڈلوں دونوں کو تربیت دینے کی اجازت دیتی ہے۔<sup>[\[23\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — خصوصیات (helpfulness، correctness، coherence، complexity، verbosity) پر conditioning کے ساتھ SFT (Supervised Fine‑Tuning) کا طریقہ، جو صارف کو inference کے دوران جواب کے انداز کو کنٹرول کرنے دیتا ہے۔ pipeline میں شامل ہیں: (1) HelpSteer پر attribute prediction model (APM) کی تربیت، (2) APM کے ذریعے ڈیٹا کا annotation، (3) مطلوبہ attribute اقدار پر conditioning کے ساتھ SFT، (4) bootstrapping۔<sup>[\[25\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-SteerLM-25)</sup>

### DPO اور RPO

**DPO (Direct Preference Optimization)** — بغیر کسی صریح reward ماڈل کے ترجیحات کی براہِ راست optimization کا طریقہ، جو Nemotron‑4 340B Instruct اور Nemotron Nano 2 کے pipelines میں استعمال ہوتا ہے۔<sup>[\[26\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — NVIDIA کا ایک یکجا ریاضیاتی framework جو DPO، IPO، SimPO، REINFORCE اور SteerLM 2.0 کو خاص صورتوں کے طور پر عام کرتا ہے۔ RPO implicit reward ماڈل کی پیشین گوئیوں اور مطلوبہ صریح ماڈل کے درمیان فاصلے کو کم کرتا ہے<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{\text{RPO}}(\theta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{\theta}(y_{w}|x)}{\pi_{\text{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\text{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

جہاں $r_{\phi}$ — صریح reward ماڈل ہے، $\pi_{\theta}$ — قابلِ تربیت policy ہے، $\pi_{\text{ref}}$ — reference policy ہے، $d( \cdot , \cdot )$ — فاصلے کا function ہے، $y_{w}$/$y_{l}$ — ترجیحی/مسترد جواب ہے۔ RPO کو Nemotron‑4 340B Instruct اور Llama‑Nemotron ماڈلوں کی تربیت میں استعمال کیا جاتا ہے۔<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

### کثیر ماحولی تقویتی سیکھنا (RLVR)

Nemotron 3 میں Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) استعمال ہوتا ہے — NeMo Gym کے اندر متعدد ماحولوں پر بیک وقت تربیت: مسابقتی ریاضی، پروگرامنگ، QA، tool‑use، instruction‑following، long‑context۔ الگورتھم — masked importance sampling کے ساتھ GRPO (Group Relative Policy Optimization)۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_blog-14)</sup>

Nemotron 3 دانے دار **استدلال کے بجٹ کا کنٹرول** (reasoning budget control) کو سپورٹ کرتا ہے: صارف chat template میں ایک flag کے ذریعے thinking trace کے لیے ٹوکن کی حد مقرر کر سکتا ہے («detailed thinking on/off» سوئچ یا لمبائی کی حد)۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

## ماڈلوں کی فہرست

### خلاصہ جدول

| ماڈل                          | سال       | کل / فعال پیرامیٹرز | Context   | آرکیٹیکچر                      | اہم خصوصیات                                                 |
|-------------------------------|-----------|---------------------|-----------|--------------------------------|-------------------------------------------------------------|
| **Nemotron‑3 8B**             | 2023      | 8B / 8B             | 4K        | Dense Transformer              | 3.8T ٹوکنز؛ 1024 GPU A100؛ 19 دن                            |
| **Nemotron‑4 15B**            | 2024      | 15B / 15B           | 4K        | Dense Transformer              | 8T ٹوکنز؛ MFU 34.3%                                         |
| **Nemotron‑4 340B**           | 2024      | 340B / 340B         | 4K        | Dense Transformer              | 9T ٹوکنز؛ Base/Instruct/Reward؛ \>98% مصنوعی alignment ڈیٹا |
| **Llama‑3.1‑Nemotron‑70B**    | 2024      | 70B / 70B           | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE)؛ RewardBench 94.1%                         |
| **Llama‑Nemotron Nano 8B**    | 2025      | 8B / 8B             | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                            |
| **Llama‑Nemotron Nano 4B**    | 2025      | 4B / 4B             | 128K      | Dense Transformer (Minitron)   | Llama 3.1 8B سے NAS سمپریشن                                 |
| **Llama‑Nemotron Super 49B**  | 2025      | 49B / 49B           | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.3 70B سے                                            |
| **Llama‑Nemotron Ultra 253B** | 2025      | 253B / 253B         | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.1 405B سے؛ GPQA 76.0%                               |
| **Nemotron‑H 8B**             | 2025      | 8B / 8B             | —         | ہائبرڈ Mamba‑Transformer       | 15T ٹوکنز؛ 24 Mamba‑2 + 24 MLP + 4 Attn                     |
| **Nemotron‑H 56B**            | 2025      | 56B / 56B           | —         | ہائبرڈ Mamba‑Transformer       | 20T ٹوکنز FP8؛ 54 Mamba‑2 + 54 MLP + 10 Attn                |
| **Nemotron‑H 47B**            | 2025      | 47B / 47B           | ~1M (FP4) | ہائبرڈ Mamba‑Transformer       | 56B سے MiniPuzzle؛ +20% رفتار                               |
| **Nemotron Nano 2 (9B)**      | 2025      | 12B → 9B / 9B       | 128K      | ہائبرڈ Mamba‑Transformer       | 20T ٹوکنز؛ Minitron distillation                            |
| **Nemotron 3 Nano**           | 2025      | 31.6B / 3.2B        | 1M        | ہائبرڈ Mamba‑Transformer MoE   | 25T ٹوکنز؛ 128 ماہرین، 6 فعال                               |
| **Nemotron 3 Super**          | 2025–2026 | ~100B / ~10B        | 1M        | ہائبرڈ LatentMoE               | MTP؛ NVFP4                                                  |
| **Nemotron 3 Ultra**          | 2025–2026 | ~500B / ~50B        | 1M        | ہائبرڈ LatentMoE               | MTP؛ NVFP4                                                  |

### Nemotron‑4 15B

آرکیٹیکچر: 32 پرتیں، hidden dimension 6144، 48 attention heads، 8 KV‑heads (GQA)۔ پیرامیٹرز کی کل تعداد — 15 ارب (3.2 ارب embedding + 12.5 ارب non‑embedding)۔ نتائج: MMLU — 64.2% (5‑shot)، BBH — 58.7% (3‑shot)، GSM8K — 46.0% (8‑shot، maj@1)، HumanEval — 31.6% (0‑shot، pass@1)۔ کثیر لسانی بینچ مارکس (XCOPA، TyDiQA‑GoldP، MGSM) پر ماڈل نے چار گنا بڑے ماڈلوں کو پیچھے چھوڑا۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

آرکیٹیکچر: 96 پرتیں، hidden dimension 18,432، 96 attention heads، 8 KV‑heads۔

**Nemotron‑4 340B Base** نے دکھایا: MMLU — 81.1% (5‑shot)، BBH — 85.4% (3‑shot)، HumanEval — 57.3% (0‑shot)، ARC‑Challenge — 94.3% (25‑shot)۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** نے کثیر مرحلی صف بندی سے گزرا: Code SFT → General SFT → DPO → RPO (3 دور)۔ نتائج: MT‑Bench — 8.22 (GPT‑4‑Turbo judge)، MMLU — 78.7% (0‑shot)، GSM8K — 92.3% (0‑shot)، HumanEval — 73.2% (0‑shot)، Arena Hard — 54.2، AlpacaEval 2.0 LC — 41.5%۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward** نے آخری softmax پرت کو آخری پرت کی پوشیدہ حالت کو HelpSteer2 کے 5 attributes کے ویکٹر میں linear projection سے تبدیل کر دیا۔ حتمی reward — پانچ attributes کا وزنی مجموع ہے۔ تربیت HelpSteer2 ڈیٹا پر 2 epochs میں (batch size 128) کی گئی۔ RewardBench پر ماڈل نے 92.0% حاصل کیا، اشاعت کے وقت GPT‑4o (84.7%)، Gemini 1.5 Pro (88.1%) اور Claude‑3‑Opus (80.7%) سے آگے رہا۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

| ماڈل                     | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54.2       | 41.5%             | 8.22     |
| Llama‑3‑70B‑Instruct     | 41.1       | 34.4%             | 8.16     |
| Mixtral‑8x22B‑Instruct   | 36.4       | 30.9%             | 7.63     |
| Qwen‑2‑72B‑Instruct      | 48.1       | 38.8%             | 8.26     |

ماخذ: arXiv:2406.11704، جدول 5۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward** کو ایک ہائبرڈ طریقے سے تربیت دی گئی جو Bradley‑Terry (جوڑا ترجیحات) اور SteerLM regression (لیکرٹ اسکیل پر کثیر خصوصیت تشخیص) کو یکجا کرتا ہے۔ تربیت خصوصی طور پر HelpSteer2 ڈیٹا (CC‑BY‑4.0) پر کی گئی۔ RewardBench پر ماڈل نے 94.1% حاصل کیا، اشاعت کے وقت پہلا مقام حاصل کیا۔<sup>[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct** کو REINFORCE الگورتھم (PPO نہیں) اور Nemotron‑70B‑Reward ماڈل کے ساتھ RLHF طریقے سے صف بند کیا گیا۔ بنیادی ڈھانچہ — TRT‑LLM ایکسلریشن کے ساتھ NeMo‑Aligner۔<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano، Super، Ultra (2025)

NAS، distillation اور جامع post-training طریقوں سے Llama 3.x سے حاصل کیے گئے استدلال کرنے والے ماڈلوں کا خاندان۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

| ماڈل                      | پیرامیٹرز | بنیادی ماڈل                   | Context |
|---------------------------|-----------|-------------------------------|---------|
| Llama‑Nemotron‑Nano 8B    | 8 ارب     | Llama‑3.1‑8B‑Instruct         | 128K    |
| Llama‑Nemotron‑Nano 4B    | 4 ارب     | Minitron 4B (Llama 3.1 8B سے) | 128K    |
| Llama‑Nemotron‑Super 49B  | 49 ارب    | Llama‑3.3‑70B → NAS (Puzzle)  | 128K    |
| Llama‑Nemotron‑Ultra 253B | 253 ارب   | Llama‑3.1‑405B → NAS (Puzzle) | 128K    |

پانچ مرحلی تربیتی pipeline: (1) NAS + FFN Fusion، (2) distillation + جاری pre-training، (3) SFT (DeepSeek‑R1 کی reasoning traces سمیت)، (4) بڑے پیمانے پر RL (Ultra کے لیے GRPO، Nano کے لیے REINFORCE/RLOO + Online RPO)، (5) مکالمے کے لیے صف بندی۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

یہ ماڈل کھلے LLMs میں پہلی بار **قابلِ تبادل reasoning موڈ** (reasoning toggle) کو سپورٹ کرتے ہیں: فعال ہونے پر («detailed thinking on» system prompt میں) ماڈل جواب سے پہلے `<think>...</think>` tags میں استدلال کی زنجیر تیار کرتا ہے؛ بند ہونے پر — براہ راست جواب دیتا ہے۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

Llama‑Nemotron‑Ultra 253B کے نتائج (reasoning ON): GPQA Diamond — 76.0%، AIME 2024 — 80.8%، MATH 500 — ~97%۔ موازنے کے لیے: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5%، AIME 2024 ~79.8%۔ Ultra ایک واحد 8×H100 نوڈ پر چلتا ہے۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (اپریل 2025)

طویل تخلیقات والے کاموں کے لیے ڈیزائن کیے گئے گھنے ہائبرڈ ماڈلوں کا خاندان جنہیں از سرِ نو تربیت دی گئی۔ Nemotron‑H‑56B کو FP8 میں 20 ٹریلین ٹوکنز پر تربیت دی گئی — یہ FP8 pre-training کے سب سے بڑے عوامی تجربات میں سے ایک ہے۔ Nemotron‑H‑47B کو MiniPuzzle طریقے سے 56B کو مختصر کر کے حاصل کیا گیا (63 ارب distillation ٹوکنز) اور ~1M ٹوکنز کے context پر ایک RTX 5090 (FP4) کی میموری میں سما جاتا ہے۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

| بینچ مارک             | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60.5           | 61.8           | 58.8         | 51.3          |
| MMLU (5‑shot)         | 84.2           | 83.6           | 86.1         | 78.8          |
| GSM8K (8‑shot CoT)    | 93.7           | 93.3           | 90.9         | 83.9          |
| HumanEval (0‑shot)    | 60.4           | 61.0           | 56.7         | 57.3          |

ماخذ: arXiv:2504.03624۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

H100 پر 65,536 input اور 1024 output ٹوکنز کے ساتھ تخلیق میں Nemotron‑H‑47B ماڈل Qwen‑2.5‑72B اور Llama‑3.1‑70B سے 2.9 گنا تیز کام کرتا تھا۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (اگست 2025)

استدلال کے لیے ہائبرڈ Mamba‑Transformer ماڈل۔ **Nemotron‑Nano‑12B‑v2‑Base** — 62 پرتوں (بنیادی طور پر Mamba‑2 + MLP + 4 attention پرتیں) کا parent ماڈل ہے جسے FP8 میں 20 ٹریلین ٹوکنز پر از سرِ نو تربیت دی گئی۔ اس سے توسیع شدہ Minitron طریقے سے **Nemotron‑Nano‑9B‑v2** حاصل کی گئی جو ایک GPU NVIDIA A10G (22 GB، BF16) پر 128K ٹوکنز کے context میں کام کر سکتا ہے۔ Post-training: SFT (80 ارب ٹوکنز، DeepSeek‑R1‑0528 traces سمیت) → GRPO → DPO → RLHF۔ استدلال کے بینچ مارکس پر ماڈل Qwen3‑8B سے درستگی میں موازنہ رکھتا ہے، لیکن طویل output sequences میں تخلیق کی رفتار 3–6 گنا زیادہ حاصل کرتا ہے۔<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

دسمبر 2025 میں جاری کیا گیا۔ پیرامیٹرز: 31.6 ارب کل، 3.2 ارب فعال۔ آرکیٹیکچر: 52 پرتیں، hidden dimension 2688، expert dimension 1856، Mamba state dimension 128۔ MoE: 128 routed ماہرین + 1 مشترک، فی ٹوکن 6 فعال۔ Context — 1,048,576 ٹوکنز تک۔ 25 ٹریلین ٹوکنز پر تربیت (WSD شیڈول، batch size 3072، ڈیٹا کا cutoff — جون 2025) دو مراحل میں: Phase 1 — 23.5 ٹریلین (متنوع ڈیٹا)، Phase 2 — 1.5 ٹریلین (اعلیٰ معیاری ڈیٹا) + 121 ارب long‑context CPT ٹوکنز۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

| بینچ مارک             | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78.30                   | 80.9                   | 75.0        |
| AIME25 (no tools)     | 89.06                   | 85.0                   | 91.7        |
| AIME25 (with tools)   | 99.17                   | —                      | 98.7        |
| GPQA (no tools)       | 73.04                   | 73.4                   | 71.5        |
| LiveCodeBench v6      | 68.25                   | 66.0                   | 61.0        |
| SWE‑Bench (OpenHands) | 38.76                   | 22.0\*                 | 34.0        |
| TauBench V2 Avg       | 49.04                   | 47.7                   | 47.5        |
| Arena‑Hard‑V2 Avg     | 67.65                   | 57.8                   | 48.55       |
| RULER‑100 @ 1M        | 86.34                   | 77.5                   | —           |

\* — ثانوی ذرائع کی قدریں؛ دوبارہ پیداوار کے حالات — NeMo Evaluator SDK۔ ماخذ: arXiv:2512.20848۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NeMo_eval-28)</sup>

تھروپٹ (8K input / 16K output، single H200): Qwen3‑30B‑A3B‑Thinking سے 3.3 گنا اور GPT‑OSS‑20B سے 2.2 گنا زیادہ۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

### اضافی ماڈل اور سمتیں

- **OpenReasoning‑Nemotron** (جولائی 2025) — Qwen 2.5 پر مبنی اور DeepSeek‑R1‑0528 ڈیٹا پر fine-tune کیے گئے 1.5B–32B پیرامیٹرز کے ماڈلوں کی سیریز۔ GenSelect@64 کے ساتھ 32B ورژن کچھ ریاضی بینچ مارکس پر o3 (high) سے آگے ہے۔<sup>[\[29\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — ایک parent ماڈل کے اندر nested sub-ماڈلوں (6B، 9B، 12B) کا framework جو از سرِ نو تربیت کے مقابلے میں تربیتی لاگت 360 گنا کم کرتا ہے۔<sup>[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — ریاضی کے مسائل سے آگے کثیر شعبہ جاتی تقویتی سیکھنے کا framework جس نے MATH‑500 پر +30.1% اور MMLU‑PRO پر +12.8% کا اضافہ کیا۔<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — 4 ملین ٹوکنز تک context کی توسیع۔<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — مختصر ہائبرڈ 2B/4B ماڈلوں کے لیے post-training NAS۔<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-JetNemotron-33)</sup>

### خصوصی ماڈل

Nemotron ماحولیاتی نظام میں خصوصی کاموں کے ماڈل بھی موجود ہیں:

- **Nemotron Nano V2 VL** — OCR، ٹیبلز کی پروسیسنگ اور ویڈیو کے لیے vision‑language ماڈل۔<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — OCR اور دستاویزات کی ساخت نکالنے کا ماڈل۔<sup>[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — بصری دستاویز تلاش کے لیے embedding ماڈل (late interaction)۔<sup>[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — خودکار تقریر کی شناخت (ASR)، تقریر کی ترکیب (TTS) اور مشینی ترجمے (NMT) کے ماڈل۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — 9 زبانوں میں 23 اقسام پر 84.2% درستگی کے ساتھ غیر محفوظ مواد کی درجہ بندی کا ماڈل۔<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Safety-37)</sup>

## پری ٹریننگ کا ڈیٹا

### Nemotron‑4 کے ڈیٹا کی ساخت

Nemotron‑4 15B اور 340B کا pre-training corpus تین بنیادی اقسام پر مشتمل ہے: انگریزی متون (70%)، 53 زبانوں میں کثیر لسانی متون (15%) اور 43 پروگرامنگ زبانوں میں سورس کوڈ (15%)۔ دستاویز سطح پر deduplication (exact اور near‑duplicate) اور language models اور heuristics کے ساتھ فلٹرنگ استعمال کی گئی۔ 15B ماڈل کو 8 ٹریلین ٹوکنز پر، 340B ماڈل کو 9 ٹریلین ٹوکنز پر (8 ٹریلین pre-training + 1 ٹریلین اعلیٰ معیاری ذرائع کو دوبارہ وزن دے کر جاری تربیت) تربیت دی گئی۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

**Nemotron‑CC** ڈیٹاسیٹ Common Crawl سے معیاری classifiers کے ensemble اور متون کی مصنوعی paraphrasing کے ذریعے بنایا گیا۔ کل حجم — **6.3 ٹریلین ٹوکنز** (4.4 ٹریلین deduplicated + 1.9 ٹریلین مصنوعی reformulations)۔ pipeline NeMo Curator ٹول میں ضم ہے۔ یہ کام ACL 2025 کانفرنس میں Long Paper کے طور پر قبول کیا گیا۔<sup>[\[38\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

ریاضی پر مرکوز ذیلی مجموعہ جس کا حجم **133 ارب ٹوکنز** ہے، Common Crawl سے Lynx + LLM pipeline کے ذریعے LaTeX میں ریاضی فارمولوں اور کوڈ کی ساخت کو محفوظ رکھتے ہوئے نکالا گیا۔<sup>[\[39\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NemotronCC_Math-39)</sup>

### Nemotron 3 Nano کا ڈیٹا

Nemotron 3 Nano کی pre-training 25 ٹریلین ٹوکنز پر کی گئی۔ مجموعے میں شامل ہیں: Nemotron‑CC‑v2.1، Nemotron‑CC‑Code‑v1، Nemotron‑CC‑Math‑v1 اور خصوصی STEM datasets۔ long‑context تربیت کے لیے اضافی 121 ارب CPT ٹوکنز استعمال کیے گئے۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

مصنوعی طور پر تیار کردہ مجموعہ جو STEM، علمی متون، استدلال کے کاموں اور کثیر لسانی شعبوں کا احاطہ کرتا ہے؛ اس میں 10 ٹریلین سے زیادہ لسانی ٹوکنز اور SFT کے لیے 18 ملین نمونے شامل ہیں۔ تمام datasets کھلے اجازت ناموں کے تحت تقسیم کیے جاتے ہیں۔<sup>[\[40\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NemotronNano2_page-40)</sup>

### مصنوعی ڈیٹا تخلیق کا pipeline (SDG)

Nemotron‑4 340B کی رپورٹ میں بیان کردہ pipeline میں مندرجہ ذیل مراحل شامل ہیں<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>:

- **Prompts کی تخلیق**: Open QA، Writing، Closed QA، Math & Coding کے templates پر Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 لائسنس) کے ذریعے تیار کردہ مصنوعی ایک اور دو چکری سوالات۔
- **جوابات کی تخلیق**: تنوع کو یقینی بنانے کے لیے ماڈلوں کے درمیانی ورژنز سے متعدد جوابات۔
- **معیار کی تشخیص**: تین طریقے — Ground‑Truth‑as‑a‑Judge (قابلِ تصدیق جواب والے کاموں کے لیے)، LLM‑as‑Judge (زبانی ماڈل کے ذریعے جواب جوڑوں کا موازنہ)، Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward کا استعمال)۔
- **کمزور سے مضبوط** (weak‑to‑strong) ماڈلوں تک تکراری صف بندی۔

انسانی طور پر annotate کیے گئے ~20,000 نمونوں (SFT کے لیے 10,000، reward ماڈل کے لیے 10,000 HelpSteer2) سے صف بندی کے ڈیٹا کا باقی تمام حجم مصنوعی طور پر تیار کیا گیا۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)</sup>

## مقداری کمی اور inference کی اصلاح

Nemotron 3 Nano ماڈل ModelOpt اور Megatron‑LM استعمال کرتے ہوئے FP8 میں Post‑Training Quantization (PTQ) کو سپورٹ کرتے ہیں۔ selective quantization استعمال کیا جاتا ہے — attention پرتیں اور Mamba کا کچھ حصہ معیار برقرار رکھنے کے لیے BF16 میں رکھے جاتے ہیں؛ باقی FP8 میں quantize کیے جاتے ہیں۔ تکنیکی رپورٹ کے مطابق یہ درستگی کا ~99% برقرار رکھتا ہے۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup> Nano NVFP4 فارمیٹ میں inference کو بھی سپورٹ کرتا ہے۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

## نسلوں کے مطابق بینچ مارکس کا خلاصہ جدول

| ماڈل                            | MMLU  | GSM8K | HumanEval | Arena Hard | MT‑Bench | حالات                   |
|---------------------------------|-------|-------|-----------|------------|----------|-------------------------|
| Nemotron‑4 15B                  | 64.2% | 46.0% | 31.6%     | —          | —        | base؛ 5‑/8‑/0‑shot      |
| Nemotron‑4 340B Base            | 81.1% | —     | 57.3%     | —          | —        | 5‑/—/0‑shot             |
| Nemotron‑4 340B Instruct        | 78.7% | 92.3% | 73.2%     | 54.2       | 8.22     | 0‑shot                  |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —     | —     | —         | 85.0       | 8.98     | اکتوبر 2024             |
| LN‑Ultra 253B (reasoning ON)    | —     | —     | —         | —          | —        | GPQA 76.0%، AIME 80.8%  |
| Nemotron‑H‑47B                  | 83.6% | 93.3% | 61.0%     | —          | —        | 5‑/8‑CoT/0‑shot         |
| Nemotron 3 Nano (30B‑A3B)       | —     | —     | —         | 67.7 (v2)  | —        | AIME25 89.1%، LCB 68.3% |

موازنے کی تشریح احتیاط سے کی جانی چاہیے: تشخیص کے حالات، بینچ مارکس کے ورژن اور ٹیسٹنگ کی تاریخیں نسلوں کے درمیان مختلف ہیں۔ نتائج NVIDIA کی تکنیکی رپورٹس سے لیے گئے ہیں؛ آزاد تشخیص مختلف ہو سکتی ہے (دیکھیں «محدودیات» سیکشن)۔<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

## استعمال

### NVIDIA NIM کے ذریعے تعیناتی

NVIDIA NIM — OpenAI سے مطابقت رکھنے والے API کے ساتھ inference کے لیے optimized containerized microservices کا مجموعہ۔ Nemotron ماڈل build.nvidia.com پلیٹ فارم پر NIM microservices کے طور پر دستیاب ہیں۔ NIM FP8، BF16، NVFP4 فارمیٹس اور Kubernetes پر Helm charts کے ذریعے تعیناتی کو سپورٹ کرتا ہے۔ ماڈل آزاد frameworks کے ساتھ بھی مطابقت رکھتے ہیں: vLLM، SGLang، Ollama، llama.cpp، TensorRT‑LLM۔<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

### مصنوعی ڈیٹا تخلیق

Nemotron‑4 340B کو مصنوعی ڈیٹا generator کے طور پر استعمال کے لیے ڈیزائن کیا گیا ہے: Instruct ماڈل جوابات تیار کرتا ہے، Reward ماڈل انہیں جانچتا اور فلٹر کرتا ہے۔ NVIDIA Open Model License واضح طور پر ماڈل کی outputs کو دیگر ماڈلوں کی تربیت کے لیے استعمال کرنے کی اجازت دیتا ہے۔ ServiceNow کے مطابق ان کے Apriel 1.6 ماڈل کے 15% pre-training ڈیٹا Nemotron datasets سے حاصل کیے گئے۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NeMo_synth-41)</sup>

### ایجنٹ سسٹمز

Nemotron 3 خاندان کے ماڈل (Nano، Super، Ultra) کثیر ایجنٹ workloads کے لیے بنائے گئے ہیں: منصوبہ بندی، retrieval، ٹول کا استعمال (tool use)۔ Nemotron 3 Nano SWE‑Bench (OpenHands کے ساتھ) پر 38.76% اور TauBench V2 پر 49.04% (avg) کا نتیجہ دکھاتا ہے۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

### کارپوریٹ نفاذ

اعلان کردہ شراکت داروں میں: ServiceNow (کام کی خودکاری کے لیے مشترکہ Apriel Nemotron 15B ماڈل)، CrowdStrike (Charlotte AI پلیٹ فارم)، Perplexity (درخواستوں کی routing)، Accenture، Cadence، Deloitte، Oracle، Palantir، Siemens، Synopsys، Zoom شامل ہیں۔ ماڈل AWS Amazon Bedrock پر دستیاب ہیں؛ Google Cloud، CoreWeave، Nebius کے لیے سپورٹ کا منصوبہ ہے۔<sup>[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NVIDIA_news-15)</sup>

## محدودیات اور کھلے مسائل

### آزاد تشخیص اور NVIDIA کے ڈیٹا سے اختلاف

آزاد تشخیصات NVIDIA کی پیش کردہ نتائج سے اختلاف ظاہر کرتی ہیں۔ Artificial Analysis (فروری 2026) کے مطابق Llama‑Nemotron‑Ultra 253B (reasoning) کو Intelligence Index 15 ملا جبکہ ہم پیمانہ سائز کے ماڈلوں کی اوسط 26 ہے۔ Chatbot Arena (LMArena) پلیٹ فارم پر Nemotron ماڈل درمیانی رینکنگ میں ہیں: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147واں مقام)، Nemotron 3 Nano — 1317 ±6 (~164واں مقام)۔<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-LMArena-43)</sup>

### بیان کی طوالت

Nemotron ماڈل بڑھی ہوئی verbosity ظاہر کرتے ہیں: Artificial Analysis کی تشخیص میں Nemotron 3 Nano نے 140 ملین ٹوکنز تیار کیے (دیگر ماڈلوں کے لیے اوسط 12 ملین)، جو inference کی لاگت بڑھاتا ہے۔ DEV Community کے تجزیے سے پتہ چلا کہ Llama‑3.1‑Nemotron‑70B‑Instruct خودکار بینچ مارکس پر باضابطہ برتری کے باوجود کچھ عملی کاموں میں ناکافی درستگی دکھاتا تھا، اور Arena جیسے بینچ مارکس پر اعلیٰ اسکور لمبے اور پراعتماد، لیکن ضروری نہیں کہ درست جوابات کی ترجیح سے تعبیر ہو سکتے تھے۔<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Saplin-44)</sup>

### فریب اور تعصب

NVIDIA ماڈل کارڈز میں بتاتا ہے کہ ماڈل «تعصبات کو تقویت دے سکتے ہیں اور زہریلے جوابات تیار کر سکتے ہیں، خاص طور پر زہریلے prompts پر»، اور «غلط معلومات تیار کر سکتے ہیں، اہم تفصیلات چھوڑ سکتے ہیں»۔ وزن اور ڈیٹا کا کھلا پن بیرونی آڈٹ کی اجازت دیتا ہے۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nano2-13)</sup>

### حسابی تقاضے

گھنے ماڈل (Nemotron‑4 340B) مکمل تربیت کے لیے 768 DGX H100 نوڈز کے cluster کی ضرورت رکھتے ہیں، جو اسی طرح کی بنیادی ڈھانچے تک رسائی کے بغیر تعلیمی گروپوں کے لیے دوبارہ پیداوار کو محدود کرتا ہے۔ inference کے دوران لمبا context (1M) کافی VRAM درکار کرتا ہے۔<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

### context کی توسیع پر کمزوری

سپر لمبی sequences تک context کی توسیع میں مختصر context بینچ مارکس پر نتائج کی کمزوری دیکھی گئی۔<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-UltraLong-32)</sup>

### ہائبرڈ آرکیٹیکچرز میں quantization

Mamba‑Transformer آرکیٹیکچرز میں انتہائی کم bit depth (FP8/NVFP4) کا استعمال کچھ بینچ مارکس پر درستگی میں معمولی کمی (~1%) کا باعث بنتا ہے۔ یہ مسئلہ selective quantization کے استعمال سے حل کیا جاتا ہے، جو compiler اور inference server کی آرکیٹیکچر کو پیچیدہ بناتا ہے۔<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

### دیگر کھلے مسائل

- بینچ مارکس پر انحصار جہاں training ڈیٹا آلودگی ممکن ہے۔
- 순pure Transformer ماڈلوں کے ساتھ ہائبرڈ SSM‑Transformer آرکیٹیکچرز کے موازنے کے لیے معیاری پروٹوکول کا فقدان۔
- ایسے کاموں میں MoE طریقے کی scalability کا سوال جن میں فی ٹوکن ماہرین کی کم تعداد کے ساتھ گہرے استدلال کی ضرورت ہے۔
- دسمبر 2025 تک Super/Ultra کا ڈیٹا ابتدائی ہے؛ مکمل بینچ مارکس ریلیز کے بعد متوقع ہیں۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

## اخلاقی اور ریگولیٹری پہلو

### ترقی کے مرحلے پر حفاظت

ترقی کے مرحلے پر درج ذیل استعمال کیے جاتے ہیں: AEGIS framework (13 مواد حفاظت اقسام) کے مطابق تشخیص، garak کمزوریوں کا اسکینر، دستی «red‑teaming»۔<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Safety-37)</sup>

### inference کے مرحلے پر حفاظت

**NeMo Guardrails** — ایک کھلا ٹول (Apache 2.0 لائسنس) جو LLM سسٹمز میں قابلِ پروگرام رکاوٹیں شامل کرتا ہے۔ microservice inputs اور outputs کو روکتا ہے، قابلِ ترتیب جانچیں لاگو کرتا ہے: موضوع کا کنٹرول، PII کی شناخت، RAG «grounding» کی تصدیق، jailbreak حملوں کا پتہ لگانا (YARA پر مبنی code injection سے تحفظ سمیت)، کثیر لسانی کثیر modal حفاظتی درجہ بندی۔<sup>[\[45\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Guardrails-45)</sup>

Nemotron 3 کے لیے ٹول استعمال کے حقیقت پسندانہ منظرناموں سے ~11,000 labeled OpenTelemetry traces کا مجموعہ شائع کیا گیا جو agent حفاظت کی تشخیص کے لیے بنایا گیا ہے۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

### لائسنسنگ

| ماڈل                                   | لائسنس                                        |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano، Super، Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (Meta سے منتقل)       |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License** تجارتی استعمال، مشتق کاموں کی تخلیق اور تقسیم کی اجازت دیتا ہے، attribution درکار نہیں (NOTICE فائل کو برقرار رکھنے کے ساتھ)، صارفین کی تعداد پر کوئی پابندی نہیں اور صراحت کے ساتھ دیگر ماڈلوں کی تربیت کے لیے ماڈل کی outputs کے استعمال کی اجازت دیتا ہے۔<sup>[\[46\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-License-46)</sup> Llama پر مبنی ماڈل Meta کی پابندیاں وراثت میں لیتے ہیں، جن میں 700 ملین ماہانہ فعال صارفین کی حد شامل ہے۔<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Llama_Nemotron-11)</sup>

Nemotron 3 Nano کے لیے NVIDIA نے شائع کیا: ماڈل کے وزن، 10 ٹریلین سے زیادہ training ڈیٹا ٹوکنز، training کی ترکیبیں، code bases (NeMo، Megatron‑LM، NeMo‑Aligner)، 900,000+ tasks کے ساتھ 10 سے زیادہ تقویتی سیکھنے کے ماحول۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_nano_report-2)</sup>

## امکانات اور تحقیقی سمتیں

قریبی ریلیزز میں **Nemotron 3 Super** (~100 ارب پیرامیٹرز، ~10 ارب فعال) اور **Nemotron 3 Ultra** (~500 ارب، ~50 ارب فعال) شامل ہیں جو 2026 کی پہلی ششماہی میں متوقع ہیں۔ دونوں ماڈل Blackwell آرکیٹیکچر پر LatentMoE، MTP اور NVFP4 فارمیٹ میں تربیت استعمال کریں گے۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)</sup>

NVIDIA کی اسٹریٹجک سمت — Nemotron کو ایک واحد ماڈل کے طور پر نہیں بلکہ کثیر ایجنٹ سسٹمز کے لیے ایک infrastructure پرت کے طور پر پیش کرنا ہے، جہاں خاندان کے مختلف ماڈل پیچیدگی کے مطابق routing کے ساتھ مختلف کاموں کے لیے استعمال ہوتے ہیں۔<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NVIDIA_news-15)</sup>

بنیادی تحقیقی سمتیں:

- ہائبرڈ آرکیٹیکچرز کی ترقی — قابلِ توسیع لمبے context کے لیے attention طریقہ کار کے ساتھ SSM پرتوں کا مزید انضمام۔<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Nemotron_H-12)</sup>
- کثیر سطحی compression طریقے — Minitron، Puzzle، MiniPuzzle اور Nemotron Elastic کی ترقی۔<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Elastic-30)</sup>
- کثیر شعبہ جاتی تقویتی سیکھنا — ریاضی کے مسائل سے آگے RL کو وسعت دینے کے لیے Nemotron‑CrossThink۔<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-CrossThink-31)</sup>
- Context کی توسیع — Nemotron‑UltraLong 4 ملین ٹوکنز تک۔<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-UltraLong-32)</sup>
- کثیر modal — vision‑language (Nemotron VL)، تقریر (Nemotron Speech)، بصری دستاویز تلاش (Nemotron ColEmbed V2) کے شعبوں میں توسیع۔<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-ColEmbed-36)</sup>
- مختصر ہائبرڈ ماڈل — Jet‑Nemotron (2B/4B ماڈلوں کے لیے NAS)۔<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-JetNemotron-33)</sup>
- کھلی ترکیبیں — برادری کی طرف سے دوبارہ پیداوار اور تخصیص کے لیے مکمل training ترکیبوں اور ڈیٹا کی اشاعت۔<sup>[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_note-N3_blog-14)</sup>

## یہ بھی دیکھیں

- Transformer آرکیٹیکچر
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta کے ماڈلوں کا خاندان)

## حوالہ جات

- NVIDIA Research — Nemotron 3 صفحہ: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — Nemotron دستاویزات: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- NeMo Framework Documentation: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## کتابیات

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, فروری 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, جون 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, جون 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, جولائی 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, نومبر 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203, جنوری 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, اپریل 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, مئی 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444, اگست 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096, اگست 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664, نومبر 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, دسمبر 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848, دسمبر 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. et al. *GQA*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. et al. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. et al. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## حواشی

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NV_developer_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nano2_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nano2_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_blog_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_blog_14-1)</sup> <sup>[14.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Minitron_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Puzzle_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-RPO_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Elastic_30-0)</sup> <sup>[30.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-CrossThink_31-0)</sup> <sup>[31.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-UltraLong_32-0)</sup> <sup>[32.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-UltraLong_32-1)</sup> <sup>[32.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-JetNemotron_33-0)</sup> <sup>[33.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Parse_35-0)</sup> <sup>[35.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-ColEmbed_36-0)</sup> <sup>[36.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Safety_37-0)</sup> <sup>[37.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-AA_42-0)</sup> <sup>[42.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(UR)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
