---
title: "Nemotron (NVIDIA)"
source: "https://systems-analysis.info/wiki/Nemotron_(NVIDIA)"
wiki: "systems-analysis.info/wiki"
article: "Nemotron_(NVIDIA)"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 154
wiki_created_at: 2026-09-06T21:55:50Z
wiki_modified_at: 2026-09-06T21:55:50Z
downloaded_at: 2026-09-07T22:17:51Z
---

# Nemotron (NVIDIA)

**Nemotron** — семейство [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (Large Language Model, LLM) с открытыми весами, разработанное подразделением Applied Deep Learning Research (ADLR) корпорации NVIDIA. Модели относятся к области машинного обучения и обработки естественного языка (Natural Language Processing, NLP) и предназначены для широкого круга задач: синтетической генерации данных, логического вывода (reasoning), агентных приложений (agentic AI) и развёртывания на промышленном оборудовании NVIDIA. Семейство объединяет модели различных архитектур и масштабов: от 4 млрд до ~500 млрд параметров, включая плотные (dense) [decoder‑only](https://systems-analysis.info/wiki/Decoder-only "Decoder-only") [Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")‑модели серии Nemotron‑4 (2024), гибридные Mamba‑Transformer (Nemotron‑H, 2025) и гибридные Mamba‑Transformer с Mixture-of-Experts (MoE) в серии Nemotron 3 (2025). По состоянию на март 2026 года семейство насчитывает более 20 моделей, охватывающих задачи генерации текста, рассуждений, визуального понимания документов, извлечения информации и оценки качества ответов. Модели выпускаются преимущественно с открытыми весами под лицензиями NVIDIA Open Model License и [Llama](https://systems-analysis.info/wiki/LLaMA "LLaMA") Community License.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

## История и предпосылки

Разработка семейства Nemotron ведётся в контексте стратегии NVIDIA по созданию полного стека инструментов для генеративного ИИ: от обучающей инфраструктуры (DGX, суперкомпьютеры на базе GPU H100/B200) до платформ обучения (NeMo Framework), выравнивания (NeMo‑Aligner), развёртывания (NIM — NVIDIA Inference Microservices) и обеспечения безопасности (NeMo Guardrails).<sup>[\[4\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

Первая публично доступная модель серии — декодерный Transformer с 8 млрд параметров и контекстом 4096 [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен"), обученная на **3,8 трлн токенов** на 53 естественных и 37 языках программирования. Обучение проведено на 1024 GPU A100 за 19 дней. Формального технического отчёта на arXiv опубликовано не было. Модель распространялась через NeMo Framework и Hugging Face, существовали варианты Chat (SFT и SteerLM). Лицензия — NVIDIA AI Foundation Models Community License.<sup>[\[6\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-MS_nemotron3-7)</sup>

*Примечание о названиях*: «Nemotron‑3» 2023 года и «Nemotron 3» декабря 2025 года — разные модели. Первая была ранним прототипом, вторая — актуальное поколение с архитектурой MoE.

### Nemotron‑4 15B (февраль 2024)

Первый публично задокументированный выпуск серии Nemotron‑4 — модель с 15 миллиардами параметров, обученная на 8 триллионах токенов за ~13 календарных дней на 384 узлах DGX H100 (до 3072 GPU). Использовался 8‑кратный тензорный параллелизм и параллелизм по данным от 96 до 288. Пиковая MFU (Model FLOPs Utilization) составила 34,3 % при batch size 384. Архитектура — [decoder](https://systems-analysis.info/wiki/Decoder "Decoder")‑only Transformer с Grouped‑Query Attention (GQA) и Rotary Position Embeddings (RoPE). По результатам бенчмарков на момент публикации модель превосходила все сопоставимые по размеру открытые модели в многоязычных задачах, включая ряд моделей, превышающих её по размеру в четыре раза.<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (июнь 2024)

В июне 2024 года выпущена наиболее крупная модель серии Nemotron‑4 — 340 миллиардов параметров (331,6 млрд не‑эмбеддинговых), предобученная на 9 триллионах токенов (8 трлн [предобучение](https://systems-analysis.info/wiki/%D0%9F%D1%80%D0%B5%D0%B4%D0%BE%D0%B1%D1%83%D1%87%D0%B5%D0%BD%D0%B8%D0%B5 "Предобучение") + 1 трлн продолженное обучение с перевзвешиванием высококачественных источников). Обучение проводилось на 768 узлах DGX H100 (до 6144 GPU) с пиковой MFU 42,4 %, с декабря 2023 по май 2024 года. Семейство включает три варианта: Base, Instruct и Reward. Размер модели выбран таким образом, чтобы она помещалась на одном узле DGX H100 (8 GPU) при развёртывании в формате точности FP8. Более 98 % данных, использованных при выравнивании (alignment), сгенерированы синтетически самими моделями серии в итеративном процессе; пайплайн синтетической генерации данных открыт для воспроизведения.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (октябрь 2024)

В октябре 2024 года выпущены модели, дообученные из Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct и Llama‑3.1‑Nemotron‑70B‑Reward. По состоянию на 1 октября 2024 года модель Instruct занимала 1‑е место одновременно на трёх автоматических бенчмарках: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Reward‑модель достигла 94,1 % на RewardBench.<sup>[\[9\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LN70B_Reward-10)</sup>

### Переход к гибридным архитектурам (2025)

В 2025 году серия расширилась гибридными архитектурами, сочетающими слои [Mamba](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D1%8B_LLM "Архитектуры LLM")‑2 (State Space Model, SSM — модель пространства состояний) и Transformer. В марте–мае 2025 года выпущено семейство рассуждающих моделей **Llama‑Nemotron** (Nano 8B, Super 49B, Ultra 253B) с переключаемым режимом рассуждений.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup> В апреле 2025 года опубликован **Nemotron‑H** (arXiv:2504.03624) — семейство гибридных Mamba‑Transformer моделей размером 8B, 56B и 47B параметров.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup> В августе 2025 года представлен **Nemotron Nano 2** (9B‑v2, arXiv:2508.14444).<sup>[\[13\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nano2-13)</sup>

### Nemotron 3 (декабрь 2025)

15 декабря 2025 года анонсировано третье поколение — семейство Nemotron 3 с моделями Nano, Super и Ultra, объединяющее архитектуры Mamba‑2, Transformer и MoE с [контекстным окном](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно") до 1 млн токенов. Nano выпущена с техническим отчётом; Super и Ultra запланированы на первую половину 2026 года.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NVIDIA_news-15)</sup>

## Теоретические основы

### Архитектура Transformer в Nemotron‑4

Модели серии Nemotron‑4 построены на стандартной архитектуре декодерного Transformer с каузальным вниманием. Вероятность последовательности токенов $x_{1},x_{2},\ldots,x_{T}$ факторизуется как:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};\theta),
$$

где $\theta$ — параметры модели.<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)</sup>

Механизм внимания реализован в варианте Grouped‑Query Attention (GQA)<sup>[\[16\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-GQA-16)</sup>:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V,
$$

где $Q,K,V$ — матрицы запросов, ключей и значений; $d_{k}$ — размерность головы внимания.

Для кодирования позиций применяются Rotary Position Embeddings (RoPE)<sup>[\[17\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-RoPE-17)</sup>:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos m\theta_{1} - x_{m}^{(2)}\sin m\theta_{1}} \\
{x_{m}^{(1)}\sin m\theta_{1} + x_{m}^{(2)}\cos m\theta_{1}} \\
 \vdots 
\end{pmatrix},
$$

где $x_{m}$ — вектор в позиции $m$, $\theta_{i} = 10000^{- 2i/d}$, $d$ — размерность вектора.

В MLP‑слоях используется активация Squared ReLU: $f(x) = (\max(0,x))^{2}$, обеспечивающая разреженность активаций. Модели не содержат смещений (bias), не используют dropout, а матрицы вложений входа и выхода не связаны между собой (untied embeddings). Токенизатор — SentencePiece BPE с сохранением пробелов, посимвольной разбивкой цифр и побайтовым fallback, размер словаря — 256 000.<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

##### Архитектурные параметры Nemotron‑4

| Параметр            | Nemotron‑4 15B            | Nemotron‑4 340B            |
|---------------------|---------------------------|----------------------------|
| Число параметров    | 15 млрд (3,2 млрд embed.) | 340 млрд (9,4 млрд embed.) |
| Число слоёв         | 32                        | 96                         |
| Скрытая размерность | 6144                      | 18 432                     |
| Головы внимания     | 48                        | 96                         |
| KV‑головы (GQA)     | 8                         | 8                          |
| Длина контекста     | 4096                      | 4096                       |
| Размер словаря      | 256 000                   | 256 000                    |

Источники: arXiv:2402.16819, arXiv:2406.11704.<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

### Гибридная архитектура Mamba‑Transformer (Nemotron‑H)

В моделях Nemotron‑H стандартные блоки самовнимания частично заменены блоками Mamba‑2 — моделями пространства состояний (State Space Models, SSM). При авторегрессивной генерации каждый слой самовнимания требует $O(n)$ операций и памяти на шаг (из‑за KV‑кэша), тогда как Mamba‑слои обеспечивают постоянные затраты памяти и вычислений на каждый генерируемый токен.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 описывается рекуррентным соотношением<sup>[\[18\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Mamba2-18)</sup>:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

где $h_{t} \in {\mathbb{R}}^{N}$ — скрытое состояние, $A \in {\mathbb{R}}^{N \times N}$ — диагональная матрица перехода состояний, $B \in {\mathbb{R}}^{N \times 1}$ и $C \in {\mathbb{R}}^{1 \times N}$ — матрицы проекции, $x_{t}$ — входной токен, $y_{t}$ — выходной сигнал. В Mamba‑2 матрицы $A$, $B$, $C$ зависят от входа (input‑dependent), что отличает модель от классических линейных SSM.

В Nemotron‑H‑56B используются **54 слоя Mamba‑2 + 54 MLP‑слоя + 10 слоёв самовнимания**, причём слои внимания размещены равномерно среди Mamba‑слоёв. Модель обучена на 20 трлн токенов в формате FP8 (per‑tensor scaling) на 6144 GPU H100. Версия Nemotron‑H‑8B содержит 24 слоя Mamba‑2, 24 MLP‑слоя и 4 слоя самовнимания; обучение проведено на 15 трлн токенов.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

### MoE‑архитектура Nemotron 3

Модели Nemotron 3 (декабрь 2025) объединяют три архитектурных компонента: Mamba‑2, Transformer и Mixture‑of‑Experts.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) содержит 52 слоя: **23 слоя Mamba‑2 + MoE, 23 слоя MoE и 6 слоёв GQA‑внимания**. Каждый MoE‑слой включает 128 маршрутизируемых (routed) экспертов + 1 общий (shared) эксперт, из которых 6 экспертов активируются на каждый токен. Маршрутизация выполняется обучаемым MLP‑роутером с sigmoid gating. Балансировка нагрузки реализована без вспомогательной функции потерь (aux‑loss‑free). Общее число параметров составляет 31,6 млрд, но активных на каждый токен — лишь 3,2 млрд.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

Нормализация — RMSNorm<sup>[\[19\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-RMSNorm-19)</sup>. Позиционные эмбеддинги в Mamba‑частях отсутствуют (позиционная информация имплицитна в состоянии SSM). Используются несвязанные эмбеддинги, отсутствие dropout и bias в линейных слоях.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

### Расширения в Super/Ultra: LatentMoE и Multi‑Token Prediction

Модели Super и Ultra из семейства Nemotron 3 применяют две дополнительные архитектурные инновации:

- **Latent MoE (LatentMoE)** — проекция входного представления в латентное пространство меньшей размерности перед маршрутизацией, что позволяет увеличить число экспертов при сопоставимых вычислительных затратах и повысить точность без снижения пропускной способности.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — предсказание нескольких следующих токенов одновременно, используемое для улучшения качества длинных текстов и спекулятивного декодирования при инференсе.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

Обучение Super и Ultra ведётся в формате NVFP4 — 4‑битном числовом формате NVIDIA на архитектуре Blackwell.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

### Методы сжатия моделей: Minitron, Puzzle, MiniPuzzle

Для создания компактных моделей NVIDIA применяет несколько подходов:

- **Minitron** — метод структурированного прореживания (pruning) и дистилляции знаний (knowledge distillation). Исследуются два вида прунинга: по глубине (удаление слоёв) и по ширине (совместное уменьшение размерностей скрытых слоёв, голов внимания и MLP‑проекций). Применение Minitron к Nemotron‑4 15B позволяет получить модели 8B и 4B с сокращением затрат на обучение до 40 раз по сравнению с обучением с нуля.<sup>[\[20\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Minitron-20)</sup>
- **Puzzle** — алгоритм Neural Architecture Search (NAS), который подбирает оптимальную конфигурацию каждого блока (число KV‑голов, размер FFN, наличие/отсутствие внимания) с поблочной дистилляцией. Именно так Llama 3.1 405B был сжат до 253B (Llama‑Nemotron Ultra), а Llama 3.3 70B — до 49B (Llama‑Nemotron Super).<sup>[\[21\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — расширение Puzzle для гибридных архитектур, сжавшее Nemotron‑H‑56B до 47B с затратой лишь 63 млрд токенов дистилляции. При схожей точности сжатая модель выводит на 20 % быстрее.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

## Методы выравнивания

### HelpSteer и HelpSteer2

**HelpSteer** — набор из 37 120 примеров (лицензия CC‑BY‑4.0), созданный совместно со Scale AI, в котором каждый ответ аннотирован по пяти атрибутам: полезность (helpfulness), корректность (correctness), связность (coherence), сложность (complexity) и многословность (verbosity) по шкале Ликерта 0–4.<sup>[\[22\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — обновлённый набор из 21 362 примеров (10 681 промпт × 2 ответа), где более 95 % промптов взяты из ShareGPT (реальные пользовательские запросы). Около 50 % аннотаций были отфильтрованы как недостаточно качественные. Расширение **HelpSteer2‑Preference** добавляет парные предпочтения аннотаторов, позволяя обучать как регрессионные, так и попарные модели вознаграждения на одних и тех же данных.<sup>[\[23\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — метод SFT (Supervised Fine‑Tuning — обучение с учителем) с обусловливанием на атрибуты (helpfulness, correctness, coherence, complexity, verbosity), позволяющий пользователю управлять стилем ответа при инференсе. Конвейер включает: (1) обучение модели предсказания атрибутов (APM) на HelpSteer, (2) разметку данных с помощью APM, (3) SFT с обусловливанием на целевые значения атрибутов, (4) бутстрэппинг.<sup>[\[25\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-SteerLM-25)</sup>

### DPO и RPO

**DPO ([Direct Preference Optimization](https://systems-analysis.info/wiki/Direct_Preference_Optimization "Direct Preference Optimization"))** — метод прямой оптимизации предпочтений без явной модели вознаграждения, используемый в конвейерах Nemotron‑4 340B Instruct и Nemotron Nano 2.<sup>[\[26\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — унифицированный математический фреймворк NVIDIA, обобщающий DPO, IPO, SimPO, REINFORCE и SteerLM 2.0 как частные случаи. RPO минимизирует расстояние между предсказаниями неявной модели вознаграждения и целевой явной модели<sup>[\[27\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{\text{RPO}}(\theta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{\theta}(y_{w}|x)}{\pi_{\text{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\text{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

где $r_{\phi}$ — явная модель вознаграждения, $\pi_{\theta}$ — обучаемая политика, $\pi_{\text{ref}}$ — референсная политика, $d( \cdot , \cdot )$ — функция расстояния, $y_{w}$/$y_{l}$ — предпочтённый/отвергнутый ответ. RPO применяется при обучении Nemotron‑4 340B Instruct и моделей Llama‑Nemotron.<sup>[\[27\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

### Мультисредовое обучение с подкреплением (RLVR)

В Nemotron 3 применяется Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — одновременное обучение на нескольких средах в рамках NeMo Gym: соревновательная математика, программирование, QA, tool‑use, instruction‑following, long‑context. Алгоритм — GRPO (Group Relative Policy Optimization) с masked importance sampling.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_blog-14)</sup>

Nemotron 3 поддерживает гранулярное **управление бюджетом рассуждения** (reasoning budget control): пользователь может задать лимит токенов для thinking trace через флаг в chat template (переключение «detailed thinking on/off» или ограничение длины).<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

## Линейка моделей

### Сводная таблица

| Модель                        | Год       | Всего / Активных параметров | Контекст  | Архитектура                    | Ключевые особенности                                            |
|-------------------------------|-----------|-----------------------------|-----------|--------------------------------|-----------------------------------------------------------------|
| **Nemotron‑3 8B**             | 2023      | 8B / 8B                     | 4K        | Dense Transformer              | 3,8T токенов; 1024 GPU A100; 19 дней                            |
| **Nemotron‑4 15B**            | 2024      | 15B / 15B                   | 4K        | Dense Transformer              | 8T токенов; MFU 34,3 %                                          |
| **Nemotron‑4 340B**           | 2024      | 340B / 340B                 | 4K        | Dense Transformer              | 9T токенов; Base/Instruct/Reward; \>98 % синт. данных alignment |
| **Llama‑3.1‑Nemotron‑70B**    | 2024      | 70B / 70B                   | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE); RewardBench 94,1 %                            |
| **Llama‑Nemotron Nano 8B**    | 2025      | 8B / 8B                     | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                                |
| **Llama‑Nemotron Nano 4B**    | 2025      | 4B / 4B                     | 128K      | Dense Transformer (Minitron)   | NAS‑сжатие из Llama 3.1 8B                                      |
| **Llama‑Nemotron Super 49B**  | 2025      | 49B / 49B                   | 128K      | Dense Transformer (Puzzle NAS) | Из Llama 3.3 70B                                                |
| **Llama‑Nemotron Ultra 253B** | 2025      | 253B / 253B                 | 128K      | Dense Transformer (Puzzle NAS) | Из Llama 3.1 405B; GPQA 76,0 %                                  |
| **Nemotron‑H 8B**             | 2025      | 8B / 8B                     | —         | Гибрид Mamba‑Transformer       | 15T токенов; 24 Mamba‑2 + 24 MLP + 4 Attn                       |
| **Nemotron‑H 56B**            | 2025      | 56B / 56B                   | —         | Гибрид Mamba‑Transformer       | 20T токенов FP8; 54 Mamba‑2 + 54 MLP + 10 Attn                  |
| **Nemotron‑H 47B**            | 2025      | 47B / 47B                   | ~1M (FP4) | Гибрид Mamba‑Transformer       | MiniPuzzle из 56B; +20 % скорость                               |
| **Nemotron Nano 2 (9B)**      | 2025      | 12B → 9B / 9B               | 128K      | Гибрид Mamba‑Transformer       | 20T токенов; Minitron‑дистилляция                               |
| **Nemotron 3 Nano**           | 2025      | 31,6B / 3,2B                | 1M        | Гибрид Mamba‑Transformer MoE   | 25T токенов; 128 экспертов, 6 активных                          |
| **Nemotron 3 Super**          | 2025–2026 | ~100B / ~10B                | 1M        | Гибрид LatentMoE               | MTP; NVFP4                                                      |
| **Nemotron 3 Ultra**          | 2025–2026 | ~500B / ~50B                | 1M        | Гибрид LatentMoE               | MTP; NVFP4                                                      |

### Nemotron‑4 15B

Архитектура: 32 слоя, hidden dimension 6144, 48 голов внимания, 8 KV‑голов (GQA). Общее число параметров — 15 млрд (3,2 млрд embedding + 12,5 млрд non‑embedding). Результаты: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). На мультиязычных бенчмарках (XCOPA, TyDiQA‑GoldP, MGSM) модель превосходила модели в 4 раза крупнее.<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

Архитектура: 96 слоёв, hidden dimension 18 432, 96 голов внимания, 8 KV‑голов.

**Nemotron‑4 340B Base** показала: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** прошла многоэтапное выравнивание: Code SFT → General SFT → DPO → RPO (3 раунда). Результаты: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward** заменяет финальный слой softmax на линейную проекцию скрытого состояния последнего слоя в вектор из 5 атрибутов HelpSteer2. Итоговое вознаграждение — взвешенная сумма пяти атрибутов. Обучение проведено за 2 эпохи на данных HelpSteer2 (batch size 128). На RewardBench модель достигла 92,0 %, превзойдя GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) и Claude‑3‑Opus (80,7 %) на момент публикации.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

| Модель                   | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54,2       | 41,5 %            | 8,22     |
| Llama‑3‑70B‑Instruct     | 41,1       | 34,4 %            | 8,16     |
| Mixtral‑8x22B‑Instruct   | 36,4       | 30,9 %            | 7,63     |
| Qwen‑2‑72B‑Instruct      | 48,1       | 38,8 %            | 8,26     |

Источник: arXiv:2406.11704, таблица 5.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward** обучена гибридным методом, объединяющим Bradley‑Terry (попарные предпочтения) и SteerLM‑регрессию (многоатрибутная оценка по шкале Ликерта). Обучение проведено исключительно на данных HelpSteer2 (CC‑BY‑4.0). На RewardBench модель достигла 94,1 %, заняв 1‑е место на момент публикации.<sup>[\[10\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct** выравнена методом RLHF с алгоритмом REINFORCE (не PPO) и моделью вознаграждения Nemotron‑70B‑Reward. Инфраструктура — NeMo‑Aligner с ускорением TRT‑LLM.<sup>[\[9\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano, Super, Ultra (2025)

Семейство рассуждающих моделей, полученных из Llama 3.x методами NAS, дистилляции и расширенного постобучения.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

| Модель                    | Параметры | Базовая модель                | Контекст |
|---------------------------|-----------|-------------------------------|----------|
| Llama‑Nemotron‑Nano 8B    | 8 млрд    | Llama‑3.1‑8B‑Instruct         | 128K     |
| Llama‑Nemotron‑Nano 4B    | 4 млрд    | Minitron 4B (из Llama 3.1 8B) | 128K     |
| Llama‑Nemotron‑Super 49B  | 49 млрд   | Llama‑3.3‑70B → NAS (Puzzle)  | 128K     |
| Llama‑Nemotron‑Ultra 253B | 253 млрд  | Llama‑3.1‑405B → NAS (Puzzle) | 128K     |

Пятиэтапный конвейер обучения: (1) NAS + FFN Fusion, (2) дистилляция + продолженное предобучение, (3) SFT (включая трассы рассуждений DeepSeek‑R1), (4) масштабное RL (GRPO для Ultra, REINFORCE/RLOO + Online RPO для Nano), (5) выравнивание для диалога.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

Модели первыми среди открытых LLM поддерживают **переключаемый режим рассуждений** (reasoning toggle): при включении («detailed thinking on» в системном промпте) модель генерирует цепочку рассуждений в тегах `<think>...</think>` перед ответом; при выключении — отвечает напрямую.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

Результаты Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Для сравнения: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra размещается на одном узле 8×H100.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (апрель 2025)

Семейство плотных гибридных моделей, обученных с нуля и спроектированных для задач с длинными генерациями. Nemotron‑H‑56B обучен на 20 трлн токенов в FP8 — один из крупнейших публичных экспериментов по FP8‑предобучению. Nemotron‑H‑47B получен сжатием 56B методом MiniPuzzle (63 млрд токенов дистилляции) и помещается в память одной RTX 5090 (FP4) при контексте ~1M токенов.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

| Бенчмарк              | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60,5           | 61,8           | 58,8         | 51,3          |
| MMLU (5‑shot)         | 84,2           | 83,6           | 86,1         | 78,8          |
| GSM8K (8‑shot CoT)    | 93,7           | 93,3           | 90,9         | 83,9          |
| HumanEval (0‑shot)    | 60,4           | 61,0           | 56,7         | 57,3          |

Источник: arXiv:2504.03624.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

При генерации с 65 536 входными и 1024 выходными токенами на H100 модель Nemotron‑H‑47B работала в 2,9 раза быстрее, чем Qwen‑2.5‑72B и Llama‑3.1‑70B.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (август 2025)

Гибридная Mamba‑Transformer модель для рассуждений. **Nemotron‑Nano‑12B‑v2‑Base** — родительская модель с 62 слоями (преимущественно Mamba‑2 + MLP + 4 слоя внимания), обученная на 20 трлн токенов в FP8 с нуля. Из неё методом расширенного Minitron получена **Nemotron‑Nano‑9B‑v2**, способная работать в контексте 128K токенов на одном GPU NVIDIA A10G (22 ГБ, BF16). Постобучение: SFT (80 млрд токенов, включая трассы DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. На бенчмарках рассуждений модель сопоставима с Qwen3‑8B по точности, но достигает 3–6‑кратного ускорения генерации при длинных выходных последовательностях.<sup>[\[13\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

Выпущена в декабре 2025 года. Параметры: 31,6 млрд всего, 3,2 млрд активных. Архитектура: 52 слоя, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 маршрутизируемых экспертов + 1 общий, 6 активных на токен. Контекст — до 1 048 576 токенов. Обучение на 25 трлн токенов (WSD‑расписание, batch size 3072, cutoff данных — июнь 2025) в две фазы: Phase 1 — 23,5 трлн (разнообразные данные), Phase 2 — 1,5 трлн (высококачественные данные) + 121 млрд токенов long‑context CPT.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

| Бенчмарк              | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78,30                   | 80,9                   | 75,0        |
| AIME25 (no tools)     | 89,06                   | 85,0                   | 91,7        |
| AIME25 (with tools)   | 99,17                   | —                      | 98,7        |
| GPQA (no tools)       | 73,04                   | 73,4                   | 71,5        |
| LiveCodeBench v6      | 68,25                   | 66,0                   | 61,0        |
| SWE‑Bench (OpenHands) | 38,76                   | 22,0\*                 | 34,0        |
| TauBench V2 Avg       | 49,04                   | 47,7                   | 47,5        |
| Arena‑Hard‑V2 Avg     | 67,65                   | 57,8                   | 48,55       |
| RULER‑100 @ 1M        | 86,34                   | 77,5                   | —           |

\* — значения из вторичных источников; условия воспроизведения — NeMo Evaluator SDK. Источник: arXiv:2512.20848.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NeMo_eval-28)</sup>

Пропускная способность (8K вход / 16K выход, single H200): в 3,3 раза выше Qwen3‑30B‑A3B‑Thinking и в 2,2 раза выше GPT‑OSS‑20B.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

### Дополнительные модели и направления

- **OpenReasoning‑Nemotron** (июль 2025) — серия моделей 1,5B–32B параметров, основанных на Qwen 2.5 и дообученных на данных DeepSeek‑R1‑0528. Вариант 32B с GenSelect@64 превосходит o3 (high) на ряде математических бенчмарков.<sup>[\[29\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — фреймворк вложенных подмоделей (6B, 9B, 12B) в рамках одной родительской модели, снижающий стоимость обучения в 360 раз по сравнению с обучением с нуля.<sup>[\[30\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — фреймворк мультидоменного обучения с подкреплением за пределами математических задач, обеспечивший +30,1 % на MATH‑500 и +12,8 % на MMLU‑PRO.<sup>[\[31\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — расширение контекста до 4 млн токенов.<sup>[\[32\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — постобучающий NAS для компактных гибридных моделей 2B/4B.<sup>[\[33\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-JetNemotron-33)</sup>

### Специализированные модели

В экосистеме Nemotron также присутствуют модели для специализированных задач:

- **Nemotron Nano V2 VL** — vision‑language модель для OCR, обработки таблиц и видео.<sup>[\[34\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — модель для OCR и извлечения структуры документов.<sup>[\[35\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — модель эмбеддингов для визуального поиска документов (late interaction).<sup>[\[36\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — модели для автоматического распознавания речи (ASR), синтеза речи (TTS) и машинного перевода (NMT).<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — модель классификации небезопасного контента по 23 категориям на 9 языках с точностью 84,2 %.<sup>[\[37\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Safety-37)</sup>

## Данные для предобучения

### Состав данных Nemotron‑4

Предобучающий корпус Nemotron‑4 15B и 340B состоит из трёх основных категорий: английские тексты (70 %), многоязычные тексты на 53 языках (15 %) и исходный код на 43 языках программирования (15 %). Применялась дедупликация на уровне документов (exact и near‑duplicate), а также фильтрация с помощью языковых моделей и эвристик. Модель 15B обучена на 8 трлн токенов, модель 340B — на 9 трлн (8 трлн предобучение + 1 трлн продолженное обучение с перевзвешиванием высококачественных источников).<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

Набор данных **Nemotron‑CC** сформирован из Common Crawl с использованием ансамбля классификаторов качества и синтетического перефразирования текстов. Общий объём — **6,3 трлн токенов** (4,4 трлн дедуплицированных + 1,9 трлн синтетических переформулировок). Пайплайн интегрирован в инструмент NeMo Curator. Работа принята как Long Paper на конференции ACL 2025.<sup>[\[38\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

Математически‑ориентированный поднабор объёмом **133 млрд токенов**, извлечённый из Common Crawl с помощью пайплайна Lynx + LLM с сохранением структуры математических формул и кода в LaTeX.<sup>[\[39\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NemotronCC_Math-39)</sup>

### Данные Nemotron 3 Nano

Предобучение Nemotron 3 Nano выполнено на 25 трлн токенов. Набор включает: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 и специализированные STEM‑датасеты. Для long‑context обучения использованы дополнительные 121 млрд токенов CPT.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

Синтетически сгенерированный набор, охватывающий STEM, академические тексты, задачи рассуждения и многоязычные домены; содержит более 10 трлн языковых токенов и 18 млн образцов для SFT. Все наборы данных распространяются по открытым разрешительным лицензиям.<sup>[\[40\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NemotronNano2_page-40)</sup>

### Конвейер синтетической генерации данных (SDG)

Конвейер, описанный в отчёте о Nemotron‑4 340B, включает следующие этапы<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>:

- **Генерация промптов**: синтетические одно‑ и двухоборотные запросы, сгенерированные при помощи Mixtral‑8x7B‑Instruct‑v0.1 (лицензия Apache 2.0) по шаблонам Open QA, Writing, Closed QA, Math & Coding.
- **Генерация ответов**: множественные ответы от промежуточных версий моделей для обеспечения разнообразия.
- **Оценка качества**: три подхода — Ground‑Truth‑as‑a‑Judge (для задач с проверяемым ответом), LLM‑as‑Judge (сравнение пар ответов языковой моделью), Reward‑Model‑as‑Judge (использование Nemotron‑4‑340B‑Reward).
- **Итеративное выравнивание** от слабых к сильным моделям (weak‑to‑strong).

Из ~20 000 аннотированных человеком примеров (10 000 для SFT, 10 000 HelpSteer2 для модели вознаграждения) был синтезирован весь остальной объём данных выравнивания.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)</sup>

## Квантизация и оптимизация инференса

Модели Nemotron 3 Nano поддерживают Post‑Training Quantization (PTQ) в FP8 с использованием ModelOpt и Megatron‑LM. Применяется selective quantization — слои attention и часть Mamba сохраняются в BF16 для сохранения качества; остальные квантизуются в FP8. Согласно техническому отчёту, это обеспечивает ~99 % retention точности.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup> Nano также поддерживает инференс в формате NVFP4.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

## Сводная таблица бенчмарков по поколениям

| Модель                          | MMLU   | GSM8K  | HumanEval | Arena Hard | MT‑Bench | Условия                   |
|---------------------------------|--------|--------|-----------|------------|----------|---------------------------|
| Nemotron‑4 15B                  | 64,2 % | 46,0 % | 31,6 %    | —          | —        | base; 5‑/8‑/0‑shot        |
| Nemotron‑4 340B Base            | 81,1 % | —      | 57,3 %    | —          | —        | 5‑/—/0‑shot               |
| Nemotron‑4 340B Instruct        | 78,7 % | 92,3 % | 73,2 %    | 54,2       | 8,22     | 0‑shot                    |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —      | —      | —         | 85,0       | 8,98     | окт. 2024                 |
| LN‑Ultra 253B (reasoning ON)    | —      | —      | —         | —          | —        | GPQA 76,0 %, AIME 80,8 %  |
| Nemotron‑H‑47B                  | 83,6 % | 93,3 % | 61,0 %    | —          | —        | 5‑/8‑CoT/0‑shot           |
| Nemotron 3 Nano (30B‑A3B)       | —      | —      | —         | 67,7 (v2)  | —        | AIME25 89,1 %, LCB 68,3 % |

Сравнение следует интерпретировать с осторожностью: условия оценки, версии бенчмарков и даты проведения тестов различаются между поколениями. Результаты взяты из технических отчётов NVIDIA; независимые оценки могут отличаться (см. раздел «Ограничения»).<sup>[\[8\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

## Применение

### Развёртывание через NVIDIA NIM

NVIDIA NIM — набор оптимизированных контейнерных микросервисов для инференса с OpenAI‑совместимым API. Модели Nemotron доступны как NIM‑микросервисы на платформе build.nvidia.com. NIM поддерживает форматы FP8, BF16, NVFP4 и развёртывание через Helm‑чарты на Kubernetes. Модели также совместимы с независимыми фреймворками: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.<sup>[\[4\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

### Синтетическая генерация данных

Nemotron‑4 340B спроектирован для использования в качестве генератора синтетических данных: модель Instruct генерирует ответы, модель Reward оценивает и фильтрует их. Лицензия NVIDIA Open Model License явно разрешает использование выходов модели для обучения других моделей. По данным ServiceNow, 15 % предобучающих данных их модели Apriel 1.6 получены из наборов данных Nemotron.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NeMo_synth-41)</sup>

### Агентные системы

Модели семейства Nemotron 3 (Nano, Super, Ultra) предназначены для многоагентных рабочих нагрузок: планирование, retrieval, вызов инструментов (tool use). Nemotron 3 Nano демонстрирует результат 38,76 % на SWE‑Bench (с OpenHands) и 49,04 % (avg) на TauBench V2.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

### Корпоративные внедрения

Среди заявленных партнёров: ServiceNow (совместная модель Apriel Nemotron 15B для автоматизации рабочих процессов), CrowdStrike (платформа Charlotte AI), Perplexity (маршрутизация запросов), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Модели доступны на AWS Amazon Bedrock; планируется поддержка Google Cloud, CoreWeave, Nebius.<sup>[\[15\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NVIDIA_news-15)</sup>

## Ограничения и открытые проблемы

### Независимые оценки и расхождения с данными NVIDIA

Независимые оценки выявляют расхождения с результатами, приводимыми NVIDIA. По данным Artificial Analysis (февраль 2026), Llama‑Nemotron‑Ultra 253B (reasoning) получила оценку Intelligence Index 15 при медиане 26 для моделей сопоставимого размера. На платформе Chatbot Arena (LMArena) модели Nemotron занимают позиции в середине рейтинга: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147‑я позиция), Nemotron 3 Nano — 1317 ±6 (~164‑я позиция).<sup>[\[42\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-LMArena-43)</sup>

### Многословность

Модели Nemotron демонстрируют повышенную многословность: при оценке Artificial Analysis модель Nemotron 3 Nano сгенерировала 140 млн токенов (при медиане 12 млн для других моделей), что увеличивает стоимость инференса. Анализ DEV Community выявил, что Llama‑3.1‑Nemotron‑70B‑Instruct при формальном лидерстве на автоматических бенчмарках демонстрировала недостаточную точность в ряде практических задач, а высокие оценки на Arena‑подобных бенчмарках могли объясняться предпочтением многословных и уверенных, но не обязательно точных ответов.<sup>[\[42\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Saplin-44)</sup>

### Галлюцинации и bias

NVIDIA в модельных карточках указывает, что модели могут «усиливать предвзятости и генерировать токсичные ответы, особенно при токсичных промптах», а также «производить неточную информацию, опускать ключевые детали». Открытость весов и данных позволяет внешний аудит.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nano2-13)</sup>

### Вычислительные требования

Плотные модели (Nemotron‑4 340B) требуют кластера из 768 узлов DGX H100 для полного обучения, что ограничивает воспроизводимость для академических групп без доступа к аналогичной инфраструктуре. Длинный контекст (1M) при инференсе требует значительного объёма VRAM.<sup>[\[3\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

### Деградация при расширении контекста

При расширении контекста до сверхдлинных последовательностей наблюдалась деградация результатов на бенчмарках с коротким контекстом.<sup>[\[32\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-UltraLong-32)</sup>

### Квантизация гибридных архитектур

Использование сверхнизкой разрядности (FP8/NVFP4) в архитектурах Mamba‑Transformer приводит к небольшому падению точности (~1 % на ряде бенчмарков). Данная проблема решается применением selective quantization, что усложняет архитектуру компиляторов и инференс‑серверов.<sup>[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

### Прочие открытые проблемы

- Зависимость от бенчмарков с возможной контаминацией обучающих данных.
- Отсутствие стандартизированных протоколов сравнения гибридных SSM‑Transformer архитектур с чистыми Transformer‑моделями.
- Вопрос масштабируемости MoE‑подхода на задачах, требующих глубокого рассуждения с малым числом экспертов на токен.
- Данные о Super/Ultra на момент декабря 2025 года предварительны; полные бенчмарки ожидаются после релиза.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

## Этические и регуляторные аспекты

### Безопасность на этапе разработки

На этапе разработки применяются: оценка по фреймворку AEGIS (13 категорий контентной безопасности), сканер уязвимостей garak, ручное «красное тестирование» (red‑teaming).<sup>[\[37\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Safety-37)</sup>

### Безопасность на этапе вывода

**NeMo Guardrails** — открытый инструментарий (лицензия Apache 2.0), добавляющий программируемые барьеры к LLM‑системам. Микросервис перехватывает входы и выходы, применяя конфигурируемые проверки: контроль темы, обнаружение PII, верификация «заземления» RAG, обнаружение jailbreak‑атак (включая защиту от инъекций кода на основе YARA), мультиязычную мультимодальную классификацию безопасности.<sup>[\[45\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Guardrails-45)</sup>

Для Nemotron 3 опубликован набор из ~11 000 размеченных трасс OpenTelemetry из реалистичных сценариев с использованием инструментов, предназначенных для оценки агентной безопасности.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

### Лицензирование

| Модели                                 | Лицензия                                      |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano, Super, Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (наследуется от Meta) |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License** разрешает коммерческое использование, создание и распространение производных работ, не требует атрибуции (при сохранении файла NOTICE), не предъявляет ограничений на число пользователей и явно разрешает использование выходов модели для обучения других моделей.<sup>[\[46\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-License-46)</sup> Модели на базе Llama наследуют ограничения Meta, включая порог в 700 млн ежемесячных активных пользователей.<sup>[\[11\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Llama_Nemotron-11)</sup>

Для Nemotron 3 Nano NVIDIA опубликовала: веса модели, более 10 трлн токенов обучающих данных, рецепты обучения, кодовые базы (NeMo, Megatron‑LM, NeMo‑Aligner), более 10 сред обучения с подкреплением с 900 000+ задач.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_nano_report-2)</sup>

## Перспективы и направления исследований

Ближайшие релизы включают **Nemotron 3 Super** (~100 млрд параметров, ~10 млрд активных) и **Nemotron 3 Ultra** (~500 млрд, ~50 млрд активных), ожидаемые в первой половине 2026 года. Обе модели будут использовать LatentMoE, MTP и обучение в формате NVFP4 на архитектуре Blackwell.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)</sup>

Стратегическое направление NVIDIA — позиционирование Nemotron не как единичной модели, а как инфраструктурного слоя для мультиагентных систем, где различные модели семейства используются для разных задач с маршрутизацией по сложности.<sup>[\[1\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NVIDIA_news-15)</sup>

Основные исследовательские направления:

- Развитие гибридных архитектур — дальнейшая интеграция SSM‑слоёв с механизмом внимания для масштабируемого длинного контекста.<sup>[\[12\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Nemotron_H-12)</sup>
- Многоуровневые методы сжатия — развитие Minitron, Puzzle, MiniPuzzle и Nemotron Elastic.<sup>[\[20\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Elastic-30)</sup>
- Мультидоменное обучение с подкреплением — Nemotron‑CrossThink для расширения RL за пределы математических задач.<sup>[\[31\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-CrossThink-31)</sup>
- Расширение контекста — Nemotron‑UltraLong до 4 млн токенов.<sup>[\[32\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-UltraLong-32)</sup>
- Мультимодальность — расширение в область vision‑language (Nemotron VL), речи (Nemotron Speech), визуального поиска документов (Nemotron ColEmbed V2).<sup>[\[34\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-ColEmbed-36)</sup>
- Компактные гибридные модели — Jet‑Nemotron (NAS для моделей 2B/4B).<sup>[\[33\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-JetNemotron-33)</sup>
- Открытые рецепты — публикация полных рецептов обучения и данных для воспроизведения и кастомизации сообществом.<sup>[\[14\]](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_note-N3_blog-14)</sup>

## См. также

- [Архитектура Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")
- [Reinforcement Learning from Human Feedback (RLHF)](https://systems-analysis.info/wiki/RLHF "RLHF")
- [Llama (семейство моделей Meta)](https://systems-analysis.info/wiki/LLaMA "LLaMA")

## Ссылки

- NVIDIA Research — страница Nemotron 3: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — документация Nemotron: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- NeMo Framework Documentation: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## Литература

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. et al. *GQA*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. et al. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. et al. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## Примечания

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2,00](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2,01](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2,02](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2,03](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2,04](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2,05](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2,06](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2,07](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2,08](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2,09](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2,10](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2,11](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2,12](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2,13](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2,14](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2,15](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2,16](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3,00](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-0)</sup> <sup>[3,01](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-1)</sup> <sup>[3,02](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-2)</sup> <sup>[3,03](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-3)</sup> <sup>[3,04](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-4)</sup> <sup>[3,05](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-5)</sup> <sup>[3,06](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-6)</sup> <sup>[3,07](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-7)</sup> <sup>[3,08](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-8)</sup> <sup>[3,09](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-9)</sup> <sup>[3,10](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-10)</sup> <sup>[3,11](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-11)</sup> <sup>[3,12](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-12)</sup> <sup>[3,13](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-13)</sup> <sup>[3,14](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NV_developer_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-1)</sup> <sup>[8,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-2)</sup> <sup>[8,3](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-3)</sup> <sup>[8,4](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-4)</sup> <sup>[8,5](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-5)</sup> <sup>[8,6](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11,3](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11,4](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11,5](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11,6](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11,7](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11,8](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12,3](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12,4](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12,5](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12,6](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12,7](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12,8](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nano2_13-0)</sup> <sup>[13,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nano2_13-1)</sup> <sup>[13,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_blog_14-0)</sup> <sup>[14,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_blog_14-1)</sup> <sup>[14,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15,3](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Minitron_20-0)</sup> <sup>[20,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Puzzle_21-0)</sup> <sup>[21,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-RPO_27-0)</sup> <sup>[27,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Elastic_30-0)</sup> <sup>[30,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-CrossThink_31-0)</sup> <sup>[31,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-UltraLong_32-0)</sup> <sup>[32,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-UltraLong_32-1)</sup> <sup>[32,2](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-JetNemotron_33-0)</sup> <sup>[33,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Parse_35-0)</sup> <sup>[35,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-ColEmbed_36-0)</sup> <sup>[36,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Safety_37-0)</sup> <sup>[37,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42,0](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-AA_42-0)</sup> <sup>[42,1](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/wiki/Nemotron_(NVIDIA)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
