---
title: "Nemotron (NVIDIA) (FA)"
source: "https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)"
wiki: "systems-analysis.info/int"
article: "Nemotron_(NVIDIA)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 4846
wiki_created_at: 2026-09-06T23:40:46Z
wiki_modified_at: 2026-09-06T23:40:46Z
downloaded_at: 2026-09-07T23:05:04Z
---

# Nemotron (NVIDIA) (FA)

**Nemotron** — خانواده‌ای از مدل‌های زبانی بزرگ (Large Language Model, LLM) با وزن‌های باز، توسعه‌یافته توسط بخش Applied Deep Learning Research (ADLR) شرکت NVIDIA. این مدل‌ها در حوزه Machine Learning و پردازش زبان طبیعی (Natural Language Processing, NLP) قرار دارند و برای طیف گسترده‌ای از وظایف طراحی شده‌اند: تولید داده‌های مصنوعی، استنتاج منطقی (reasoning)، برنامه‌های عاملی (agentic AI) و استقرار بر روی سخت‌افزار صنعتی NVIDIA. این خانواده، مدل‌هایی با معماری‌ها و مقیاس‌های مختلف را در بر می‌گیرد: از ۴ میلیارد تا ~۵۰۰ میلیارد پارامتر، شامل مدل‌های Transformer از نوع decoder-only متراکم (dense) سری Nemotron‑4 (2024)، مدل‌های هیبریدی Mamba‑Transformer (Nemotron‑H، 2025) و مدل‌های هیبریدی Mamba‑Transformer با Mixture-of-Experts (MoE) در سری Nemotron 3 (2025). تا مارس ۲۰۲۶، این خانواده بیش از ۲۰ مدل را شامل می‌شود که وظایف تولید متن، استدلال، درک بصری اسناد، استخراج اطلاعات و ارزیابی کیفیت پاسخ‌ها را پوشش می‌دهند. مدل‌ها عمدتاً با وزن‌های باز تحت مجوزهای NVIDIA Open Model License و Llama Community License منتشر می‌شوند.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

## تاریخچه و پیش‌زمینه

توسعه خانواده Nemotron در چارچوب استراتژی NVIDIA برای ایجاد یک پشته کامل ابزار هوش مصنوعی مولد انجام می‌شود: از زیرساخت آموزش (DGX، ابررایانه‌های مبتنی بر GPU H100/B200) تا پلتفرم‌های آموزش (NeMo Framework)، هم‌ترازسازی (NeMo‑Aligner)، استقرار (NIM — NVIDIA Inference Microservices) و تضمین ایمنی (NeMo Guardrails).<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

اولین مدل عمومی این سری — یک Transformer از نوع decoder با ۸ میلیارد پارامتر و پنجره زمینه ۴۰۹۶ token، که بر روی **۳.۸ تریلیون token** در ۵۳ زبان طبیعی و ۳۷ زبان برنامه‌نویسی آموزش دیده است. آموزش در طول ۱۹ روز بر روی ۱۰۲۴ GPU A100 انجام شد. گزارش فنی رسمی در arXiv منتشر نشد. مدل از طریق NeMo Framework و Hugging Face توزیع شد و نسخه‌های Chat (SFT و SteerLM) نیز وجود داشتند. مجوز: NVIDIA AI Foundation Models Community License.<sup>[\[6\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-MS_nemotron3-7)</sup>

*نکته درباره نام‌گذاری*: «Nemotron‑3» سال ۲۰۲۳ و «Nemotron 3» دسامبر ۲۰۲۵ مدل‌های متفاوتی هستند. اولی یک نمونه اولیه اولیه بود، دومی نسل فعلی با معماری MoE است.

### Nemotron‑4 15B (فوریه ۲۰۲۴)

اولین انتشار مستند عمومی سری Nemotron‑4 — مدلی با ۱۵ میلیارد پارامتر، آموزش‌دیده بر روی ۸ تریلیون token در ~۱۳ روز تقویمی بر روی ۳۸۴ گره DGX H100 (تا ۳۰۷۲ GPU). از موازی‌سازی تنسوری ۸ برابری و موازی‌سازی داده از ۹۶ تا ۲۸۸ استفاده شد. اوج MFU (Model FLOPs Utilization) به ۳۴.۳٪ رسید با batch size برابر ۳۸۴. معماری: Transformer از نوع decoder-only با Grouped‑Query Attention (GQA) و Rotary Position Embeddings (RoPE). بر اساس نتایج benchmark‌ها در زمان انتشار، مدل از تمام مدل‌های باز با اندازه مشابه در وظایف چندزبانه پیشی گرفت، از جمله برخی مدل‌هایی که چهار برابر بزرگتر بودند.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (ژوئن ۲۰۲۴)

در ژوئن ۲۰۲۴، بزرگ‌ترین مدل سری Nemotron‑4 منتشر شد — ۳۴۰ میلیارد پارامتر (۳۳۱.۶ میلیارد پارامتر غیر embedding)، از پیش آموزش‌دیده بر روی ۹ تریلیون token (۸ تریلیون پیش‌آموزش + ۱ تریلیون آموزش ادامه‌دار با وزن‌دهی مجدد به منابع با کیفیت بالا). آموزش بر روی ۷۶۸ گره DGX H100 (تا ۶۱۴۴ GPU) با اوج MFU برابر ۴۲.۴٪، از دسامبر ۲۰۲۳ تا مه ۲۰۲۴ انجام شد. خانواده شامل سه نسخه است: Base، Instruct و Reward. اندازه مدل به گونه‌ای انتخاب شده که در یک گره DGX H100 (8 GPU) با فرمت دقت FP8 جای بگیرد. بیش از ۹۸٪ داده‌های استفاده‌شده در هم‌ترازسازی (alignment) به صورت مصنوعی توسط خود مدل‌های سری در یک فرآیند تکراری تولید شدند؛ pipeline تولید داده مصنوعی برای بازتولید در دسترس عموم قرار گرفته است.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (اکتبر ۲۰۲۴)

در اکتبر ۲۰۲۴، مدل‌هایی که از Meta Llama‑3.1‑70B‑Instruct fine-tuning شده بودند منتشر شدند: Llama‑3.1‑Nemotron‑70B‑Instruct و Llama‑3.1‑Nemotron‑70B‑Reward. تا ۱ اکتبر ۲۰۲۴، مدل Instruct به طور همزمان رتبه اول را در سه benchmark خودکار کسب کرد: Arena Hard — 85.0، AlpacaEval 2 LC — 57.6٪، MT‑Bench (GPT‑4‑Turbo) — 8.98. مدل Reward به ۹۴.۱٪ در RewardBench دست یافت.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LN70B_Reward-10)</sup>

### گذار به معماری‌های هیبریدی (2025)

در سال ۲۰۲۵، این سری با معماری‌های هیبریدی که لایه‌های Mamba‑2 (State Space Model, SSM — مدل فضای حالت) و Transformer را ترکیب می‌کنند، گسترش یافت. در مارس تا مه ۲۰۲۵، خانواده مدل‌های استدلالی **Llama‑Nemotron** (Nano 8B، Super 49B، Ultra 253B) با حالت استدلال قابل تغییر منتشر شد.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup> در آوریل ۲۰۲۵، **Nemotron‑H** (arXiv:2504.03624) — خانواده‌ای از مدل‌های هیبریدی Mamba‑Transformer با اندازه‌های ۸B، ۵۶B و ۴۷B پارامتر منتشر شد.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup> در اوت ۲۰۲۵، **Nemotron Nano 2** (9B‑v2، arXiv:2508.14444) معرفی شد.<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nano2-13)</sup>

### Nemotron 3 (دسامبر ۲۰۲۵)

در ۱۵ دسامبر ۲۰۲۵، نسل سوم — خانواده Nemotron 3 با مدل‌های Nano، Super و Ultra اعلام شد که معماری‌های Mamba‑2، Transformer و MoE را با پنجره زمینه تا ۱ میلیون token ترکیب می‌کند. Nano همراه با گزارش فنی منتشر شد؛ Super و Ultra برای نیمه اول ۲۰۲۶ برنامه‌ریزی شده‌اند.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NVIDIA_news-15)</sup>

## مبانی نظری

### معماری Transformer در Nemotron‑4

مدل‌های سری Nemotron‑4 بر پایه معماری استاندارد Transformer از نوع decoder با توجه علّی (causal attention) ساخته شده‌اند. احتمال دنباله‌ای از token‌ها $x_{1},x_{2},\ldots,x_{T}$ به صورت زیر تجزیه می‌شود:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};\theta),
$$

که در آن $\theta$ پارامترهای مدل هستند.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)</sup>

مکانیزم توجه در نسخه Grouped‑Query Attention (GQA)<sup>[\[16\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-GQA-16)</sup> پیاده‌سازی شده است:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V,
$$

که در آن $Q,K,V$ ماتریس‌های query، key و value هستند؛ $d_{k}$ بُعد سر توجه است.

برای رمزگذاری موقعیت، از Rotary Position Embeddings (RoPE)<sup>[\[17\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-RoPE-17)</sup> استفاده می‌شود:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos m\theta_{1} - x_{m}^{(2)}\sin m\theta_{1}} \\
{x_{m}^{(1)}\sin m\theta_{1} + x_{m}^{(2)}\cos m\theta_{1}} \\
 \vdots 
\end{pmatrix},
$$

که در آن $x_{m}$ بردار در موقعیت $m$، $\theta_{i} = 10000^{- 2i/d}$، $d$ بُعد بردار است.

در لایه‌های MLP از فعال‌سازی Squared ReLU استفاده می‌شود: $f(x) = (\max(0,x))^{2}$، که تُنُکی (sparsity) فعال‌سازی‌ها را تضمین می‌کند. مدل‌ها فاقد bias هستند، از dropout استفاده نمی‌کنند و ماتریس‌های embedding ورودی و خروجی به هم متصل نیستند (untied embeddings). توکن‌ساز — SentencePiece BPE با حفظ فاصله‌ها، تجزیه کاراکتر به کاراکتر ارقام و fallback بایت به بایت، با اندازه واژگان ۲۵۶ ۰۰۰.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

##### پارامترهای معماری Nemotron‑4

| پارامتر         | Nemotron‑4 15B                  | Nemotron‑4 340B                  |
|-----------------|---------------------------------|----------------------------------|
| تعداد پارامترها | ۱۵ میلیارد (۳.۲ میلیارد embed.) | ۳۴۰ میلیارد (۹.۴ میلیارد embed.) |
| تعداد لایه‌ها    | ۳۲                              | ۹۶                               |
| بُعد پنهان       | ۶۱۴۴                            | ۱۸ ۴۳۲                           |
| سرهای توجه      | ۴۸                              | ۹۶                               |
| سرهای KV (GQA)  | ۸                               | ۸                                |
| طول زمینه       | ۴۰۹۶                            | ۴۰۹۶                             |
| اندازه واژگان   | ۲۵۶ ۰۰۰                         | ۲۵۶ ۰۰۰                          |

منابع: arXiv:2402.16819، arXiv:2406.11704.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

### معماری هیبریدی Mamba‑Transformer (Nemotron‑H)

در مدل‌های Nemotron‑H، بلوک‌های استاندارد self-attention تا حدی با بلوک‌های Mamba‑2 — مدل‌های فضای حالت (State Space Models, SSM) — جایگزین شده‌اند. در هنگام تولید خودبازگشتی، هر لایه self-attention به $O(n)$ عملیات و حافظه در هر گام نیاز دارد (به دلیل KV cache)، در حالی که لایه‌های Mamba هزینه حافظه و محاسبات ثابتی برای هر token تولیدشده دارند.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 با رابطه بازگشتی<sup>[\[18\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Mamba2-18)</sup> توصیف می‌شود:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

که در آن $h_{t} \in {\mathbb{R}}^{N}$ حالت پنهان، $A \in {\mathbb{R}}^{N \times N}$ ماتریس انتقال حالت قطری، $B \in {\mathbb{R}}^{N \times 1}$ و $C \in {\mathbb{R}}^{1 \times N}$ ماتریس‌های تصویر، $x_{t}$ token ورودی، $y_{t}$ سیگنال خروجی هستند. در Mamba‑2 ماتریس‌های $A$، $B$، $C$ وابسته به ورودی (input‑dependent) هستند، که مدل را از SSM خطی کلاسیک متمایز می‌کند.

در Nemotron‑H‑56B از **۵۴ لایه Mamba‑2 + ۵۴ لایه MLP + ۱۰ لایه self-attention** استفاده می‌شود، و لایه‌های توجه به صورت یکنواخت در میان لایه‌های Mamba قرار گرفته‌اند. مدل بر روی ۲۰ تریلیون token در قالب FP8 (per‑tensor scaling) روی ۶۱۴۴ GPU H100 آموزش دیده است. نسخه Nemotron‑H‑8B شامل ۲۴ لایه Mamba‑2، ۲۴ لایه MLP و ۴ لایه self-attention است؛ آموزش روی ۱۵ تریلیون token انجام شده است.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

### معماری MoE در Nemotron 3

مدل‌های Nemotron 3 (دسامبر ۲۰۲۵) سه مؤلفه معماری را ترکیب می‌کنند: Mamba‑2، Transformer و Mixture‑of‑Experts.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) شامل ۵۲ لایه است: **۲۳ لایه Mamba‑2 + MoE، ۲۳ لایه MoE و ۶ لایه توجه GQA**. هر لایه MoE شامل ۱۲۸ کارشناس مسیریابی‌شده (routed) + ۱ کارشناس مشترک (shared) است که از آن‌ها ۶ کارشناس برای هر token فعال می‌شوند. مسیریابی توسط یک MLP router قابل آموزش با sigmoid gating انجام می‌شود. متوازن‌سازی بار بدون تابع زیان کمکی (aux‑loss‑free) پیاده‌سازی شده است. تعداد کل پارامترها ۳۱.۶ میلیارد است، اما تعداد فعال برای هر token تنها ۳.۲ میلیارد است.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

نرمال‌سازی — RMSNorm<sup>[\[19\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-RMSNorm-19)</sup>. embedding موقعیتی در بخش‌های Mamba وجود ندارد (اطلاعات موقعیتی به صورت ضمنی در حالت SSM نهفته است). از embedding‌های جدا از هم (untied)، بدون dropout و بدون bias در لایه‌های خطی استفاده می‌شود.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

### توسعه‌ها در Super/Ultra: LatentMoE و Multi‑Token Prediction

مدل‌های Super و Ultra از خانواده Nemotron 3 از دو نوآوری معماری اضافی استفاده می‌کنند:

- **Latent MoE (LatentMoE)** — تصویر نمایش ورودی به یک فضای نهفته با ابعاد کمتر قبل از مسیریابی، که امکان افزایش تعداد کارشناسان را با هزینه محاسباتی مشابه فراهم می‌کند و دقت را بدون کاهش توان عملیاتی بهبود می‌بخشد.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — پیش‌بینی چند token بعدی به طور همزمان، که برای بهبود کیفیت متن‌های طولانی و decoding حدسی (speculative decoding) در زمان inference استفاده می‌شود.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

آموزش Super و Ultra در قالب NVFP4 انجام می‌شود — فرمت عددی ۴ بیتی NVIDIA بر روی معماری Blackwell.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

### روش‌های فشرده‌سازی مدل: Minitron، Puzzle، MiniPuzzle

برای ایجاد مدل‌های فشرده، NVIDIA از چندین رویکرد استفاده می‌کند:

- **Minitron** — روشی برای هرس ساختاریافته (pruning) و تقطیر دانش (knowledge distillation). دو نوع pruning بررسی می‌شود: عمقی (حذف لایه‌ها) و عرضی (کاهش همزمان ابعاد لایه‌های پنهان، سرهای توجه و تصویرهای MLP). اعمال Minitron بر Nemotron‑4 15B امکان دستیابی به مدل‌های ۸B و ۴B را با کاهش تا ۴۰ برابری هزینه آموزش در مقایسه با آموزش از صفر فراهم می‌کند.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Minitron-20)</sup>
- **Puzzle** — الگوریتم Neural Architecture Search (NAS) که پیکربندی بهینه هر بلوک را (تعداد سرهای KV، اندازه FFN، حضور/غیاب توجه) با تقطیر بلوک به بلوک تعیین می‌کند. به همین روش، Llama 3.1 405B به ۲۵۳B (Llama‑Nemotron Ultra) و Llama 3.3 70B به ۴۹B (Llama‑Nemotron Super) فشرده شد.<sup>[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — توسعه Puzzle برای معماری‌های هیبریدی که Nemotron‑H‑56B را به ۴۷B با صرف تنها ۶۳ میلیارد token تقطیر فشرده کرد. با دقت مشابه، مدل فشرده ۲۰٪ سریع‌تر استنتاج می‌کند.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

## روش‌های هم‌ترازسازی

### HelpSteer و HelpSteer2

**HelpSteer** — مجموعه‌ای از ۳۷ ۱۲۰ نمونه (مجوز CC‑BY‑4.0)، ایجادشده با همکاری Scale AI، که در آن هر پاسخ بر اساس پنج ویژگی حاشیه‌نویسی شده است: مفید بودن (helpfulness)، صحت (correctness)، انسجام (coherence)، پیچیدگی (complexity) و پرحرفی (verbosity) در مقیاس Likert صفر تا چهار.<sup>[\[22\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — مجموعه به‌روزشده‌ای از ۲۱ ۳۶۲ نمونه (۱۰ ۶۸۱ prompt × ۲ پاسخ)، که بیش از ۹۵٪ promptها از ShareGPT (درخواست‌های واقعی کاربران) گرفته شده‌اند. حدود ۵۰٪ حاشیه‌نویسی‌ها به عنوان ناکافی در کیفیت فیلتر شدند. توسعه **HelpSteer2‑Preference** ترجیحات جفتی حاشیه‌نویسان را اضافه می‌کند و امکان آموزش هم مدل‌های رگرسیونی و هم مدل‌های پاداش جفتی را با استفاده از یک مجموعه داده فراهم می‌آورد.<sup>[\[23\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — روش SFT (Supervised Fine‑Tuning — آموزش با ناظر) با شرط‌گذاری بر ویژگی‌ها (helpfulness، correctness، coherence، complexity، verbosity)، که به کاربر امکان کنترل سبک پاسخ را در زمان inference می‌دهد. pipeline شامل این مراحل است: (1) آموزش مدل پیش‌بینی ویژگی (APM) بر HelpSteer، (2) برچسب‌زنی داده‌ها با APM، (3) SFT با شرط‌گذاری بر مقادیر هدف ویژگی‌ها، (4) bootstrapping.<sup>[\[25\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-SteerLM-25)</sup>

### DPO و RPO

**DPO (Direct Preference Optimization)** — روش بهینه‌سازی مستقیم ترجیحات بدون مدل پاداش صریح، که در pipeline‌های Nemotron‑4 340B Instruct و Nemotron Nano 2 استفاده می‌شود.<sup>[\[26\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — یک چارچوب ریاضی یکپارچه از NVIDIA که DPO، IPO، SimPO، REINFORCE و SteerLM 2.0 را به عنوان حالت‌های خاص تعمیم می‌دهد. RPO فاصله بین پیش‌بینی‌های مدل پاداش ضمنی و مدل پاداش صریح هدف را به حداقل می‌رساند<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{\text{RPO}}(\theta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{\theta}(y_{w}|x)}{\pi_{\text{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\text{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

که در آن $r_{\phi}$ مدل پاداش صریح، $\pi_{\theta}$ سیاست قابل آموزش، $\pi_{\text{ref}}$ سیاست مرجع، $d( \cdot , \cdot )$ تابع فاصله، $y_{w}$/$y_{l}$ پاسخ ترجیحی/رد شده هستند. RPO در آموزش Nemotron‑4 340B Instruct و مدل‌های Llama‑Nemotron استفاده می‌شود.<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

### یادگیری تقویتی چندمحیطی (RLVR)

در Nemotron 3 از Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) استفاده می‌شود — آموزش همزمان در چندین محیط در چارچوب NeMo Gym: ریاضیات مسابقه‌ای، برنامه‌نویسی، QA، tool‑use، instruction‑following، زمینه طولانی. الگوریتم — GRPO (Group Relative Policy Optimization) با masked importance sampling.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_blog-14)</sup>

Nemotron 3 از **کنترل دقیق بودجه استدلال** (reasoning budget control) پشتیبانی می‌کند: کاربر می‌تواند از طریق یک flag در chat template محدودیت token برای thinking trace تعیین کند (تغییر «detailed thinking on/off» یا محدود کردن طول).<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

## ردیف مدل‌ها

### جدول خلاصه

| مدل                           | سال       | کل / پارامترهای فعال | زمینه     | معماری                         | ویژگی‌های کلیدی                                                     |
|-------------------------------|-----------|----------------------|-----------|--------------------------------|--------------------------------------------------------------------|
| **Nemotron‑3 8B**             | ۲۰۲۳      | 8B / 8B              | 4K        | Dense Transformer              | ۳.۸ تریلیون token؛ ۱۰۲۴ GPU A100؛ ۱۹ روز                           |
| **Nemotron‑4 15B**            | ۲۰۲۴      | 15B / 15B            | 4K        | Dense Transformer              | ۸ تریلیون token؛ MFU 34.3٪                                         |
| **Nemotron‑4 340B**           | ۲۰۲۴      | 340B / 340B          | 4K        | Dense Transformer              | ۹ تریلیون token؛ Base/Instruct/Reward؛ \>۹۸٪ داده alignment مصنوعی |
| **Llama‑3.1‑Nemotron‑70B**    | ۲۰۲۴      | 70B / 70B            | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE)؛ RewardBench 94.1٪                                |
| **Llama‑Nemotron Nano 8B**    | ۲۰۲۵      | 8B / 8B              | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                                   |
| **Llama‑Nemotron Nano 4B**    | ۲۰۲۵      | 4B / 4B              | 128K      | Dense Transformer (Minitron)   | فشرده‌سازی NAS از Llama 3.1 8B                                      |
| **Llama‑Nemotron Super 49B**  | ۲۰۲۵      | 49B / 49B            | 128K      | Dense Transformer (Puzzle NAS) | از Llama 3.3 70B                                                   |
| **Llama‑Nemotron Ultra 253B** | ۲۰۲۵      | 253B / 253B          | 128K      | Dense Transformer (Puzzle NAS) | از Llama 3.1 405B؛ GPQA 76.0٪                                      |
| **Nemotron‑H 8B**             | ۲۰۲۵      | 8B / 8B              | —         | هیبرید Mamba‑Transformer       | ۱۵ تریلیون token؛ 24 Mamba‑2 + 24 MLP + 4 Attn                     |
| **Nemotron‑H 56B**            | ۲۰۲۵      | 56B / 56B            | —         | هیبرید Mamba‑Transformer       | ۲۰ تریلیون token FP8؛ 54 Mamba‑2 + 54 MLP + 10 Attn                |
| **Nemotron‑H 47B**            | ۲۰۲۵      | 47B / 47B            | ~1M (FP4) | هیبرید Mamba‑Transformer       | MiniPuzzle از 56B؛ +20٪ سرعت                                       |
| **Nemotron Nano 2 (9B)**      | ۲۰۲۵      | 12B → 9B / 9B        | 128K      | هیبرید Mamba‑Transformer       | ۲۰ تریلیون token؛ Minitron-distillation                            |
| **Nemotron 3 Nano**           | ۲۰۲۵      | 31.6B / 3.2B         | 1M        | هیبرید Mamba‑Transformer MoE   | ۲۵ تریلیون token؛ ۱۲۸ کارشناس، ۶ فعال                              |
| **Nemotron 3 Super**          | ۲۰۲۵–۲۰۲۶ | ~100B / ~10B         | 1M        | هیبرید LatentMoE               | MTP؛ NVFP4                                                         |
| **Nemotron 3 Ultra**          | ۲۰۲۵–۲۰۲۶ | ~500B / ~50B         | 1M        | هیبرید LatentMoE               | MTP؛ NVFP4                                                         |

### Nemotron‑4 15B

معماری: ۳۲ لایه، بُعد پنهان ۶۱۴۴، ۴۸ سر توجه، ۸ سر KV (GQA). تعداد کل پارامترها — ۱۵ میلیارد (۳.۲ میلیارد embedding + ۱۲.۵ میلیارد non‑embedding). نتایج: MMLU — 64.2٪ (5‑shot)، BBH — 58.7٪ (3‑shot)، GSM8K — 46.0٪ (8‑shot، maj@1)، HumanEval — 31.6٪ (0‑shot، pass@1). در benchmark‌های چندزبانه (XCOPA، TyDiQA‑GoldP، MGSM) مدل از مدل‌های ۴ برابر بزرگتر پیشی گرفت.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

معماری: ۹۶ لایه، بُعد پنهان ۱۸ ۴۳۲، ۹۶ سر توجه، ۸ سر KV.

**Nemotron‑4 340B Base** نشان داد: MMLU — 81.1٪ (5‑shot)، BBH — 85.4٪ (3‑shot)، HumanEval — 57.3٪ (0‑shot)، ARC‑Challenge — 94.3٪ (25‑shot).<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** از هم‌ترازسازی چندمرحله‌ای گذشت: Code SFT → General SFT → DPO → RPO (3 دور). نتایج: MT‑Bench — 8.22 (قاضی GPT‑4‑Turbo)، MMLU — 78.7٪ (0‑shot)، GSM8K — 92.3٪ (0‑shot)، HumanEval — 73.2٪ (0‑shot)، Arena Hard — 54.2، AlpacaEval 2.0 LC — 41.5٪.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward** لایه نهایی softmax را با یک تصویر خطی از حالت پنهان آخرین لایه به بردار ۵ ویژگی HelpSteer2 جایگزین می‌کند. پاداش نهایی — مجموع وزن‌دار پنج ویژگی است. آموزش در ۲ دور بر روی داده‌های HelpSteer2 (batch size 128) انجام شد. در RewardBench مدل به ۹۲.۰٪ رسید و در زمان انتشار از GPT‑4o (84.7٪)، Gemini 1.5 Pro (88.1٪) و Claude‑3‑Opus (80.7٪) پیشی گرفت.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

| مدل                      | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54.2       | 41.5٪             | 8.22     |
| Llama‑3‑70B‑Instruct     | 41.1       | 34.4٪             | 8.16     |
| Mixtral‑8x22B‑Instruct   | 36.4       | 30.9٪             | 7.63     |
| Qwen‑2‑72B‑Instruct      | 48.1       | 38.8٪             | 8.26     |

منبع: arXiv:2406.11704، جدول ۵.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward** با روش ترکیبی آموزش دیده که Bradley‑Terry (ترجیحات جفتی) و رگرسیون SteerLM (ارزیابی چندویژگی بر اساس مقیاس Likert) را یکجا می‌کند. آموزش تنها بر روی داده‌های HelpSteer2 (CC‑BY‑4.0) انجام شد. در RewardBench مدل به ۹۴.۱٪ رسید و در زمان انتشار رتبه اول را کسب کرد.<sup>[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct** با روش RLHF با الگوریتم REINFORCE (نه PPO) و مدل پاداش Nemotron‑70B‑Reward هم‌تراز شده است. زیرساخت — NeMo‑Aligner با شتاب‌دهی TRT‑LLM.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano، Super، Ultra (2025)

خانواده‌ای از مدل‌های استدلالی که از Llama 3.x با روش‌های NAS، تقطیر و پس‌آموزش گسترده مشتق شده‌اند.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

| مدل                       | پارامترها   | مدل پایه                      | زمینه |
|---------------------------|-------------|-------------------------------|-------|
| Llama‑Nemotron‑Nano 8B    | ۸ میلیارد   | Llama‑3.1‑8B‑Instruct         | 128K  |
| Llama‑Nemotron‑Nano 4B    | ۴ میلیارد   | Minitron 4B (از Llama 3.1 8B) | 128K  |
| Llama‑Nemotron‑Super 49B  | ۴۹ میلیارد  | Llama‑3.3‑70B → NAS (Puzzle)  | 128K  |
| Llama‑Nemotron‑Ultra 253B | ۲۵۳ میلیارد | Llama‑3.1‑405B → NAS (Puzzle) | 128K  |

پنج مرحله pipeline آموزش: (1) NAS + FFN Fusion، (2) تقطیر + پیش‌آموزش ادامه‌دار، (3) SFT (شامل ردپای استدلال DeepSeek‑R1)، (4) RL گسترده (GRPO برای Ultra، REINFORCE/RLOO + Online RPO برای Nano)، (5) هم‌ترازسازی برای گفتگو.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

این مدل‌ها اولین LLMهای باز بودند که از **حالت استدلال قابل تغییر** (reasoning toggle) پشتیبانی کردند: هنگام فعال بودن («detailed thinking on» در system prompt) مدل زنجیره استدلال را در تگ‌های `<think>...</think>` قبل از پاسخ تولید می‌کند؛ هنگام خاموش بودن — مستقیماً پاسخ می‌دهد.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

نتایج Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76.0٪، AIME 2024 — 80.8٪، MATH 500 — ~97٪. برای مقایسه: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5٪، AIME 2024 ~79.8٪. Ultra بر روی یک گره ۸×H100 مستقر می‌شود.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (آوریل ۲۰۲۵)

خانواده‌ای از مدل‌های هیبریدی متراکم که از صفر آموزش دیده و برای وظایف با تولیدهای طولانی طراحی شده‌اند. Nemotron‑H‑56B بر روی ۲۰ تریلیون token در قالب FP8 آموزش دیده — یکی از بزرگ‌ترین آزمایش‌های عمومی پیش‌آموزش FP8. Nemotron‑H‑47B با فشرده‌سازی 56B به روش MiniPuzzle (63 میلیارد token تقطیر) به دست آمده و در حافظه یک RTX 5090 (FP4) با زمینه ~1M token جای می‌گیرد.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

| Benchmark             | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60.5           | 61.8           | 58.8         | 51.3          |
| MMLU (5‑shot)         | 84.2           | 83.6           | 86.1         | 78.8          |
| GSM8K (8‑shot CoT)    | 93.7           | 93.3           | 90.9         | 83.9          |
| HumanEval (0‑shot)    | 60.4           | 61.0           | 56.7         | 57.3          |

منبع: arXiv:2504.03624.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

در تولید با ۶۵ ۵۳۶ token ورودی و ۱۰۲۴ token خروجی بر روی H100، مدل Nemotron‑H‑47B ۲.۹ برابر سریع‌تر از Qwen‑2.5‑72B و Llama‑3.1‑70B عمل کرد.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (اوت ۲۰۲۵)

مدل هیبریدی Mamba‑Transformer برای استدلال. **Nemotron‑Nano‑12B‑v2‑Base** — مدل والد با ۶۲ لایه (عمدتاً Mamba‑2 + MLP + ۴ لایه توجه)، آموزش‌دیده بر روی ۲۰ تریلیون token در قالب FP8 از صفر. از آن با روش Minitron گسترده‌یافته، **Nemotron‑Nano‑9B‑v2** مشتق شده که می‌تواند با زمینه ۱۲۸K token روی یک GPU NVIDIA A10G (22 گیگابایت، BF16) کار کند. پس‌آموزش: SFT (80 میلیارد token، شامل ردپای DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. در benchmark‌های استدلال، مدل از نظر دقت با Qwen3‑8B قابل مقایسه است، اما در دنباله‌های خروجی طولانی به ۳ تا ۶ برابر شتاب‌دهی تولید دست می‌یابد.<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

در دسامبر ۲۰۲۵ منتشر شد. پارامترها: ۳۱.۶ میلیارد کل، ۳.۲ میلیارد فعال. معماری: ۵۲ لایه، بُعد پنهان ۲۶۸۸، بُعد کارشناس ۱۸۵۶، بُعد حالت Mamba 128. MoE: ۱۲۸ کارشناس مسیریابی‌شده + ۱ مشترک، ۶ فعال در هر token. زمینه — تا ۱ ۰۴۸ ۵۷۶ token. آموزش بر روی ۲۵ تریلیون token (برنامه‌ریزی WSD، batch size 3072، برش داده — ژوئن ۲۰۲۵) در دو مرحله: مرحله ۱ — ۲۳.۵ تریلیون (داده‌های متنوع)، مرحله ۲ — ۱.۵ تریلیون (داده‌های باکیفیت) + ۱۲۱ میلیارد token آموزش زمینه طولانی CPT.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

| Benchmark             | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78.30                   | 80.9                   | 75.0        |
| AIME25 (no tools)     | 89.06                   | 85.0                   | 91.7        |
| AIME25 (with tools)   | 99.17                   | —                      | 98.7        |
| GPQA (no tools)       | 73.04                   | 73.4                   | 71.5        |
| LiveCodeBench v6      | 68.25                   | 66.0                   | 61.0        |
| SWE‑Bench (OpenHands) | 38.76                   | 22.0\*                 | 34.0        |
| TauBench V2 Avg       | 49.04                   | 47.7                   | 47.5        |
| Arena‑Hard‑V2 Avg     | 67.65                   | 57.8                   | 48.55       |
| RULER‑100 @ 1M        | 86.34                   | 77.5                   | —           |

\* — مقادیر از منابع ثانویه؛ شرایط بازتولید — NeMo Evaluator SDK. منبع: arXiv:2512.20848.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NeMo_eval-28)</sup>

توان عملیاتی (ورودی 8K / خروجی 16K، تک H200): ۳.۳ برابر بالاتر از Qwen3‑30B‑A3B‑Thinking و ۲.۲ برابر بالاتر از GPT‑OSS‑20B.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

### مدل‌ها و جهت‌گیری‌های اضافی

- **OpenReasoning‑Nemotron** (ژوئیه ۲۰۲۵) — سری مدل‌هایی با ۱.۵B تا ۳۲B پارامتر، مبتنی بر Qwen 2.5 و fine-tuning‌شده بر روی داده‌های DeepSeek‑R1‑0528. نسخه ۳۲B با GenSelect@64 از o3 (high) در برخی benchmark‌های ریاضی پیشی می‌گیرد.<sup>[\[29\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — چارچوب زیرمدل‌های تودرتو (6B، 9B، 12B) در قالب یک مدل والد، که هزینه آموزش را ۳۶۰ برابر در مقایسه با آموزش از صفر کاهش می‌دهد.<sup>[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — چارچوب یادگیری تقویتی چنددامنه‌ای فراتر از وظایف ریاضی که +30.1٪ در MATH‑500 و +12.8٪ در MMLU‑PRO را به ارمغان آورد.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — گسترش زمینه تا ۴ میلیون token.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — NAS پس‌آموزشی برای مدل‌های هیبریدی فشرده 2B/4B.<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-JetNemotron-33)</sup>

### مدل‌های تخصصی

در اکوسیستم Nemotron مدل‌هایی برای وظایف تخصصی نیز وجود دارند:

- **Nemotron Nano V2 VL** — مدل vision‑language برای OCR، پردازش جدول و ویدیو.<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — مدلی برای OCR و استخراج ساختار اسناد.<sup>[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — مدل embedding برای جستجوی بصری اسناد (late interaction).<sup>[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — مدل‌هایی برای تشخیص خودکار گفتار (ASR)، سنتز گفتار (TTS) و ترجمه ماشینی (NMT).<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — مدل طبقه‌بندی محتوای ناامن در ۲۳ دسته به ۹ زبان با دقت ۸۴.۲٪.<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Safety-37)</sup>

## داده‌های پیش‌آموزش

### ترکیب داده‌های Nemotron‑4

پیکره پیش‌آموزش Nemotron‑4 15B و 340B از سه دسته اصلی تشکیل شده است: متون انگلیسی (70٪)، متون چندزبانه به ۵۳ زبان (15٪) و کد منبع به ۴۳ زبان برنامه‌نویسی (15٪). از حذف تکرار در سطح سند (exact و near‑duplicate) و همچنین فیلترسازی با مدل‌های زبانی و اکتشافی استفاده شد. مدل 15B بر روی ۸ تریلیون token و مدل 340B بر روی ۹ تریلیون (8 تریلیون پیش‌آموزش + ۱ تریلیون آموزش ادامه‌دار با وزن‌دهی مجدد به منابع باکیفیت) آموزش دید.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

مجموعه داده **Nemotron‑CC** از Common Crawl با استفاده از مجموعه‌ای از طبقه‌بندی‌کننده‌های کیفیت و بازنویسی مصنوعی متون تشکیل شده است. حجم کل — **۶.۳ تریلیون token** (۴.۴ تریلیون بدون تکرار + ۱.۹ تریلیون بازنویسی مصنوعی). pipeline در ابزار NeMo Curator ادغام شده است. این اثر به عنوان Long Paper در کنفرانس ACL 2025 پذیرفته شد.<sup>[\[38\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

زیرمجموعه محور ریاضی با حجم **۱۳۳ میلیارد token**، استخراج‌شده از Common Crawl با pipeline Lynx + LLM با حفظ ساختار فرمول‌های ریاضی و کد در LaTeX.<sup>[\[39\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NemotronCC_Math-39)</sup>

### داده‌های Nemotron 3 Nano

پیش‌آموزش Nemotron 3 Nano بر روی ۲۵ تریلیون token انجام شده است. مجموعه شامل: Nemotron‑CC‑v2.1، Nemotron‑CC‑Code‑v1، Nemotron‑CC‑Math‑v1 و dataset‌های تخصصی STEM است. برای آموزش زمینه طولانی از ۱۲۱ میلیارد token اضافی CPT استفاده شده است.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

مجموعه‌ای که به صورت مصنوعی تولید شده و حوزه‌های STEM، متون دانشگاهی، وظایف استدلال و دامنه‌های چندزبانه را پوشش می‌دهد؛ شامل بیش از ۱۰ تریلیون token زبانی و ۱۸ میلیون نمونه برای SFT است. تمام مجموعه داده‌ها تحت مجوزهای آزاد و مجاز توزیع می‌شوند.<sup>[\[40\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NemotronNano2_page-40)</sup>

### Pipeline تولید داده مصنوعی (SDG)

Pipeline توصیف‌شده در گزارش Nemotron‑4 340B شامل مراحل زیر است<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>:

- **تولید prompt**: درخواست‌های مصنوعی تک‌گام و دوگامه، تولیدشده با Mixtral‑8x7B‑Instruct‑v0.1 (مجوز Apache 2.0) بر اساس قالب‌های Open QA، Writing، Closed QA، Math & Coding.
- **تولید پاسخ**: پاسخ‌های متعدد از نسخه‌های میانی مدل‌ها برای تضمین تنوع.
- **ارزیابی کیفیت**: سه رویکرد — Ground‑Truth‑as‑a‑Judge (برای وظایف با پاسخ قابل تأیید)، LLM‑as‑Judge (مقایسه جفت‌های پاسخ توسط مدل زبانی)، Reward‑Model‑as‑Judge (استفاده از Nemotron‑4‑340B‑Reward).
- **هم‌ترازسازی تکراری** از مدل‌های ضعیف به قوی (weak‑to‑strong).

از ~۲۰ ۰۰۰ نمونه حاشیه‌نویسی‌شده توسط انسان (۱۰ ۰۰۰ برای SFT، ۱۰ ۰۰۰ HelpSteer2 برای مدل پاداش)، کل حجم باقی‌مانده داده‌های هم‌ترازسازی به صورت مصنوعی تولید شد.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)</sup>

## کوانتیزاسیون و بهینه‌سازی inference

مدل‌های Nemotron 3 Nano از Post‑Training Quantization (PTQ) در FP8 با استفاده از ModelOpt و Megatron‑LM پشتیبانی می‌کنند. از selective quantization استفاده می‌شود — لایه‌های attention و بخشی از Mamba در BF16 نگه داشته می‌شوند تا کیفیت حفظ شود؛ بقیه در FP8 کوانتیزه می‌شوند. طبق گزارش فنی، این رویکرد ~99٪ حفظ دقت را تضمین می‌کند.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup> Nano همچنین از inference در قالب NVFP4 پشتیبانی می‌کند.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

## جدول خلاصه benchmark‌ها بر اساس نسل‌ها

| مدل                             | MMLU  | GSM8K | HumanEval | Arena Hard | MT‑Bench | شرایط                   |
|---------------------------------|-------|-------|-----------|------------|----------|-------------------------|
| Nemotron‑4 15B                  | 64.2٪ | 46.0٪ | 31.6٪     | —          | —        | base؛ 5‑/8‑/0‑shot      |
| Nemotron‑4 340B Base            | 81.1٪ | —     | 57.3٪     | —          | —        | 5‑/—/0‑shot             |
| Nemotron‑4 340B Instruct        | 78.7٪ | 92.3٪ | 73.2٪     | 54.2       | 8.22     | 0‑shot                  |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —     | —     | —         | 85.0       | 8.98     | اکتبر ۲۰۲۴              |
| LN‑Ultra 253B (reasoning ON)    | —     | —     | —         | —          | —        | GPQA 76.0٪، AIME 80.8٪  |
| Nemotron‑H‑47B                  | 83.6٪ | 93.3٪ | 61.0٪     | —          | —        | 5‑/8‑CoT/0‑shot         |
| Nemotron 3 Nano (30B‑A3B)       | —     | —     | —         | 67.7 (v2)  | —        | AIME25 89.1٪، LCB 68.3٪ |

مقایسه باید با احتیاط تفسیر شود: شرایط ارزیابی، نسخه‌های benchmark و تاریخ‌های آزمون در میان نسل‌ها متفاوت است. نتایج از گزارش‌های فنی NVIDIA گرفته شده‌اند؛ ارزیابی‌های مستقل ممکن است متفاوت باشند (بخش «محدودیت‌ها» را ببینید).<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

## کاربردها

### استقرار از طریق NVIDIA NIM

NVIDIA NIM — مجموعه‌ای از میکروسرویس‌های کانتینری بهینه‌شده برای inference با API سازگار با OpenAI. مدل‌های Nemotron به عنوان میکروسرویس‌های NIM در پلتفرم build.nvidia.com در دسترس هستند. NIM از فرمت‌های FP8، BF16، NVFP4 و استقرار از طریق Helm chart روی Kubernetes پشتیبانی می‌کند. مدل‌ها همچنین با فریم‌ورک‌های مستقل سازگار هستند: vLLM، SGLang، Ollama، llama.cpp، TensorRT‑LLM.<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

### تولید داده مصنوعی

Nemotron‑4 340B برای استفاده به عنوان تولیدکننده داده مصنوعی طراحی شده است: مدل Instruct پاسخ‌ها را تولید می‌کند، مدل Reward آن‌ها را ارزیابی و فیلتر می‌کند. مجوز NVIDIA Open Model License صریحاً استفاده از خروجی مدل برای آموزش مدل‌های دیگر را مجاز می‌شمارد. طبق داده‌های ServiceNow، ۱۵٪ از داده‌های پیش‌آموزش مدل Apriel 1.6 آن‌ها از مجموعه داده‌های Nemotron به دست آمده است.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NeMo_synth-41)</sup>

### سیستم‌های عاملی

مدل‌های خانواده Nemotron 3 (Nano، Super، Ultra) برای بارکاری‌های چندعاملی طراحی شده‌اند: برنامه‌ریزی، بازیابی (retrieval)، فراخوانی ابزار (tool use). Nemotron 3 Nano نتیجه ۳۸.۷۶٪ را در SWE‑Bench (با OpenHands) و ۴۹.۰۴٪ (متوسط) را در TauBench V2 نشان می‌دهد.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

### پیاده‌سازی‌های سازمانی

در میان شرکای اعلام‌شده: ServiceNow (مدل مشترک Apriel Nemotron 15B برای اتوماسیون فرآیندهای کاری)، CrowdStrike (پلتفرم Charlotte AI)، Perplexity (مسیریابی درخواست‌ها)، Accenture، Cadence، Deloitte، Oracle، Palantir، Siemens، Synopsys، Zoom. مدل‌ها در AWS Amazon Bedrock در دسترس هستند؛ پشتیبانی از Google Cloud، CoreWeave، Nebius برنامه‌ریزی شده است.<sup>[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NVIDIA_news-15)</sup>

## محدودیت‌ها و مسائل باز

### ارزیابی‌های مستقل و تفاوت‌ها با داده‌های NVIDIA

ارزیابی‌های مستقل تفاوت‌هایی با نتایج ارائه‌شده توسط NVIDIA نشان می‌دهند. طبق داده‌های Artificial Analysis (فوریه ۲۰۲۶)، Llama‑Nemotron‑Ultra 253B (reasoning) نمره Intelligence Index برابر ۱۵ دریافت کرد در حالی که میانه برای مدل‌های با اندازه مشابه ۲۶ است. در پلتفرم Chatbot Arena (LMArena) مدل‌های Nemotron موقعیت میانی در رتبه‌بندی دارند: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~رتبه ۱۴۷)، Nemotron 3 Nano — 1317 ±6 (~رتبه ۱۶۴).<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-LMArena-43)</sup>

### پرحرفی

مدل‌های Nemotron پرحرفی بالایی از خود نشان می‌دهند: در ارزیابی Artificial Analysis، مدل Nemotron 3 Nano ۱۴۰ میلیون token تولید کرد (در حالی که میانه برای سایر مدل‌ها ۱۲ میلیون بود)، که هزینه inference را افزایش می‌دهد. تحلیل DEV Community نشان داد که Llama‑3.1‑Nemotron‑70B‑Instruct با وجود رهبری رسمی در benchmark‌های خودکار، در برخی وظایف عملی دقت کافی نداشت، و نمرات بالا در benchmark‌های Arena-like ممکن است با ترجیح پاسخ‌های پرحرف و اطمینان‌بخش اما نه لزوماً دقیق توضیح داده شوند.<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Saplin-44)</sup>

### توهم‌زایی و bias

NVIDIA در کارت‌های مدل اشاره می‌کند که مدل‌ها ممکن است «پیش‌داوری‌ها را تقویت کنند و پاسخ‌های سمی تولید کنند، به ویژه در برابر prompt‌های سمی»، و همچنین «اطلاعات نادرست تولید کنند، جزئیات کلیدی را حذف کنند». باز بودن وزن‌ها و داده‌ها امکان ممیزی خارجی را فراهم می‌کند.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nano2-13)</sup>

### الزامات محاسباتی

مدل‌های متراکم (Nemotron‑4 340B) برای آموزش کامل به خوشه‌ای از ۷۶۸ گره DGX H100 نیاز دارند، که بازتولیدپذیری را برای گروه‌های آکادمیک بدون دسترسی به زیرساخت مشابه محدود می‌کند. زمینه طولانی (1M) در inference به حجم قابل توجهی از VRAM نیاز دارد.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

### افت عملکرد در گسترش زمینه

در گسترش زمینه به دنباله‌های بسیار طولانی، افت عملکرد در benchmark‌هایی با زمینه کوتاه مشاهده شد.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-UltraLong-32)</sup>

### کوانتیزاسیون معماری‌های هیبریدی

استفاده از دقت بسیار پایین (FP8/NVFP4) در معماری‌های Mamba‑Transformer منجر به افت جزئی دقت (~1٪ در برخی benchmark‌ها) می‌شود. این مشکل با اعمال selective quantization حل می‌شود که معماری کامپایلرها و سرورهای inference را پیچیده‌تر می‌کند.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

### سایر مسائل باز

- وابستگی به benchmark‌ها با آلودگی احتمالی داده‌های آموزشی.
- فقدان پروتکل‌های استانداردشده برای مقایسه معماری‌های هیبریدی SSM‑Transformer با مدل‌های خالص Transformer.
- سؤال مقیاس‌پذیری رویکرد MoE در وظایفی که نیاز به استدلال عمیق با تعداد کم کارشناس در هر token دارند.
- داده‌های Super/Ultra تا دسامبر ۲۰۲۵ اولیه هستند؛ benchmark‌های کامل پس از انتشار انتظار می‌رود.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

## جنبه‌های اخلاقی و نظارتی

### ایمنی در مرحله توسعه

در مرحله توسعه از: ارزیابی بر اساس چارچوب AEGIS (۱۳ دسته ایمنی محتوا)، اسکنر آسیب‌پذیری garak، و آزمون قرمز (red‑teaming) دستی استفاده می‌شود.<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Safety-37)</sup>

### ایمنی در مرحله استنتاج

**NeMo Guardrails** — جعبه‌ابزار متن‌باز (مجوز Apache 2.0) که مانع‌های قابل برنامه‌ریزی را به سیستم‌های LLM اضافه می‌کند. میکروسرویس ورودی‌ها و خروجی‌ها را رهگیری می‌کند و بررسی‌های قابل پیکربندی را اعمال می‌کند: کنترل موضوع، تشخیص PII، تأیید «پایه‌گذاری» RAG، تشخیص حمله‌های jailbreak (شامل محافظت در برابر تزریق کد مبتنی بر YARA)، طبقه‌بندی ایمنی چندزبانه و چندوجهی.<sup>[\[45\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Guardrails-45)</sup>

برای Nemotron 3 مجموعه‌ای از ~۱۱ ۰۰۰ ردپای برچسب‌گذاری‌شده OpenTelemetry از سناریوهای واقع‌گرایانه با استفاده از ابزارها، برای ارزیابی ایمنی عاملی منتشر شده است.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

### مجوزدهی

| مدل‌ها                                  | مجوز                                          |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano، Super، Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (ارث‌برده از Meta)     |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License** استفاده تجاری، ایجاد و توزیع آثار مشتق را مجاز می‌شمارد، نیازی به انتساب ندارد (با حفظ فایل NOTICE)، محدودیتی بر تعداد کاربران اعمال نمی‌کند و صریحاً استفاده از خروجی مدل برای آموزش مدل‌های دیگر را مجاز می‌شمارد.<sup>[\[46\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-License-46)</sup> مدل‌های مبتنی بر Llama محدودیت‌های Meta را به ارث می‌برند، از جمله آستانه ۷۰۰ میلیون کاربر فعال ماهانه.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Llama_Nemotron-11)</sup>

برای Nemotron 3 Nano، NVIDIA منتشر کرده است: وزن‌های مدل، بیش از ۱۰ تریلیون token داده آموزشی، دستورالعمل‌های آموزش، پایگاه‌های کد (NeMo، Megatron‑LM، NeMo‑Aligner)، بیش از ۱۰ محیط یادگیری تقویتی با بیش از ۹۰۰ ۰۰۰ وظیفه.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_nano_report-2)</sup>

## چشم‌اندازها و جهت‌گیری‌های پژوهشی

انتشارات آتی شامل **Nemotron 3 Super** (~۱۰۰ میلیارد پارامتر، ~۱۰ میلیارد فعال) و **Nemotron 3 Ultra** (~۵۰۰ میلیارد، ~۵۰ میلیارد فعال)، که در نیمه اول ۲۰۲۶ انتظار می‌رود. هر دو مدل از LatentMoE، MTP و آموزش در قالب NVFP4 روی معماری Blackwell استفاده خواهند کرد.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)</sup>

جهت‌گیری استراتژیک NVIDIA — موقعیت‌یابی Nemotron نه به عنوان یک مدل منفرد، بلکه به عنوان یک لایه زیرساختی برای سیستم‌های چندعاملی، که در آن مدل‌های مختلف خانواده برای وظایف مختلف با مسیریابی بر اساس پیچیدگی استفاده می‌شوند.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NVIDIA_news-15)</sup>

جهت‌گیری‌های اصلی پژوهشی:

- توسعه معماری‌های هیبریدی — ادغام بیشتر لایه‌های SSM با مکانیزم توجه برای زمینه طولانی مقیاس‌پذیر.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Nemotron_H-12)</sup>
- روش‌های چندسطحی فشرده‌سازی — توسعه Minitron، Puzzle، MiniPuzzle و Nemotron Elastic.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Elastic-30)</sup>
- یادگیری تقویتی چنددامنه‌ای — Nemotron‑CrossThink برای گسترش RL فراتر از وظایف ریاضی.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-CrossThink-31)</sup>
- گسترش زمینه — Nemotron‑UltraLong تا ۴ میلیون token.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-UltraLong-32)</sup>
- چندوجهی بودن — گسترش به حوزه vision‑language (Nemotron VL)، گفتار (Nemotron Speech)، جستجوی بصری اسناد (Nemotron ColEmbed V2).<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-ColEmbed-36)</sup>
- مدل‌های هیبریدی فشرده — Jet‑Nemotron (NAS برای مدل‌های 2B/4B).<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-JetNemotron-33)</sup>
- دستورالعمل‌های باز — انتشار دستورالعمل‌های کامل آموزش و داده‌ها برای بازتولید و سفارشی‌سازی توسط جامعه.<sup>[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_note-N3_blog-14)</sup>

## همچنین ببینید

- معماری Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (خانواده مدل‌های Meta)

## پیوندها

- NVIDIA Research — صفحه Nemotron 3: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — مستندات Nemotron: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- مستندات NeMo Framework: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## منابع

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819، فوریه ۲۰۲۴. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704، ژوئن ۲۰۲۴. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673، ژوئن ۲۰۲۴. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679، ژوئیه ۲۰۲۴. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146، نوامبر ۲۰۲۴. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203، ژانویه ۲۰۲۵. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624، آوریل ۲۰۲۵. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949، مه ۲۰۲۵. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444، اوت ۲۰۲۵. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096، اوت ۲۰۲۵. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664، نوامبر ۲۰۲۵. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856، دسامبر ۲۰۲۵. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848، دسامبر ۲۰۲۵. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. et al. *GQA*. arXiv:2305.13245، 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. et al. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467، 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. et al. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## یادداشت‌ها

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NV_developer_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nano2_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nano2_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_blog_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_blog_14-1)</sup> <sup>[14.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Minitron_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Puzzle_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-RPO_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Elastic_30-0)</sup> <sup>[30.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-CrossThink_31-0)</sup> <sup>[31.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-UltraLong_32-0)</sup> <sup>[32.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-UltraLong_32-1)</sup> <sup>[32.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-JetNemotron_33-0)</sup> <sup>[33.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Parse_35-0)</sup> <sup>[35.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-ColEmbed_36-0)</sup> <sup>[36.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Safety_37-0)</sup> <sup>[37.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-AA_42-0)</sup> <sup>[42.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(FA)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
