---
title: "Nemotron (NVIDIA) (BG)"
source: "https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)"
wiki: "systems-analysis.info/int"
article: "Nemotron_(NVIDIA)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4842
wiki_created_at: 2026-09-06T23:40:41Z
wiki_modified_at: 2026-09-06T23:40:41Z
downloaded_at: 2026-09-07T23:04:59Z
---

# Nemotron (NVIDIA) (BG)

**Nemotron** — семейство от големи езикови модели (Large Language Model, LLM) с отворени тегла, разработено от подразделението Applied Deep Learning Research (ADLR) на корпорацията NVIDIA. Моделите принадлежат към областта на машинното обучение и обработката на естествен език (Natural Language Processing, NLP) и са предназначени за широк кръг задачи: синтетично генериране на данни, логически извод (reasoning), агентни приложения (agentic AI) и разгръщане на промишлено оборудване на NVIDIA. Семейството обединява модели с различни архитектури и мащаби: от 4 млрд до ~500 млрд параметъра, включително плътни (dense) decoder‑only Transformer‑модели от серията Nemotron‑4 (2024), хибридни Mamba‑Transformer (Nemotron‑H, 2025) и хибридни Mamba‑Transformer с Mixture-of-Experts (MoE) в серията Nemotron 3 (2025). Към март 2026 година семейството наброява над 20 модела, обхващащи задачи по генериране на текст, разсъждаване, визуално разбиране на документи, извличане на информация и оценка на качеството на отговорите. Моделите се публикуват предимно с отворени тегла под лицензите NVIDIA Open Model License и Llama Community License.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

## История и предпоставки

Разработката на семейството Nemotron се извършва в контекста на стратегията на NVIDIA за изграждане на пълен стек от инструменти за генеративен ИИ: от инфраструктурата за обучение (DGX, суперкомпютри на базата на GPU H100/B200) до платформите за обучение (NeMo Framework), изравняване (NeMo‑Aligner), разгръщане (NIM — NVIDIA Inference Microservices) и осигуряване на безопасност (NeMo Guardrails).<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

Първият публично достъпен модел от серията — декодерен Transformer с 8 млрд параметъра и контекст от 4096 токена, обучен на **3,8 трлн токена** на 53 естествени и 37 езика за програмиране. Обучението е проведено на 1024 GPU A100 за 19 дни. Формален технически доклад в arXiv не е публикуван. Моделът се разпространяваше чрез NeMo Framework и Hugging Face, съществуваха варианти Chat (SFT и SteerLM). Лицензът е NVIDIA AI Foundation Models Community License.<sup>[\[6\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-MS_nemotron3-7)</sup>

*Бележка за наименованията*: „Nemotron‑3" от 2023 г. и „Nemotron 3" от декември 2025 г. са различни модели. Първият беше ранен прототип, вторият — актуалното поколение с архитектура MoE.

### Nemotron‑4 15B (февруари 2024)

Първото публично документирано издание от серията Nemotron‑4 — модел с 15 милиарда параметъра, обучен на 8 трилиона токена за ~13 календарни дни на 384 възела DGX H100 (до 3072 GPU). Използван е 8‑кратен тензорен паралелизъм и паралелизъм по данни от 96 до 288. Пиковата MFU (Model FLOPs Utilization) е 34,3 % при batch size 384. Архитектурата е decoder‑only Transformer с Grouped‑Query Attention (GQA) и Rotary Position Embeddings (RoPE). Според резултатите от benchmark-овете към момента на публикуване моделът превъзхожда всички сравними по размер отворени модели в многоезични задачи, включително редица модели, надвишаващи го по размер четири пъти.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (юни 2024)

През юни 2024 г. е публикуван най-мащабният модел от серията Nemotron‑4 — 340 милиарда параметъра (331,6 млрд не‑embedding параметъра), предварително обучен на 9 трилиона токена (8 трлн предварително обучение + 1 трлн продължено обучение с претегляне на висококачествени източници). Обучението е проведено на 768 възела DGX H100 (до 6144 GPU) с пикова MFU 42,4 %, от декември 2023 до май 2024 г. Семейството включва три варианта: Base, Instruct и Reward. Размерът на модела е избран така, че да се побира на един възел DGX H100 (8 GPU) при разгръщане в точност FP8. Над 98 % от данните, използвани при изравняването (alignment), са генерирани синтетично от самите модели на серията в итеративен процес; конвейерът за синтетично генериране на данни е отворен за възпроизвеждане.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (октомври 2024)

През октомври 2024 г. са публикувани модели, дообучени от Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct и Llama‑3.1‑Nemotron‑70B‑Reward. Към 1 октомври 2024 г. моделът Instruct заемаше 1‑во място едновременно на три автоматични benchmark-а: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Reward‑моделът достигна 94,1 % на RewardBench.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LN70B_Reward-10)</sup>

### Преход към хибридни архитектури (2025)

През 2025 г. серията се разшири с хибридни архитектури, съчетаващи слоеве Mamba‑2 (State Space Model, SSM — модел на пространството на състоянията) и Transformer. През март–май 2025 г. е публикувано семейството от разсъждаващи модели **Llama‑Nemotron** (Nano 8B, Super 49B, Ultra 253B) с превключваем режим на разсъждения.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup> През април 2025 г. е публикуван **Nemotron‑H** (arXiv:2504.03624) — семейство от хибридни Mamba‑Transformer модели с размер 8B, 56B и 47B параметъра.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup> През август 2025 г. е представен **Nemotron Nano 2** (9B‑v2, arXiv:2508.14444).<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nano2-13)</sup>

### Nemotron 3 (декември 2025)

На 15 декември 2025 г. е анонсирано третото поколение — семейството Nemotron 3 с модели Nano, Super и Ultra, обединяващо архитектурите Mamba‑2, Transformer и MoE с контекстен прозорец до 1 млн токена. Nano е публикуван с технически доклад; Super и Ultra са планирани за първата половина на 2026 г.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NVIDIA_news-15)</sup>

## Теоретични основи

### Архитектура Transformer в Nemotron‑4

Моделите от серията Nemotron‑4 са изградени на стандартна архитектура на декодерен Transformer с каузално внимание. Вероятността на последователност от токени $x_{1},x_{2},\ldots,x_{T}$ се факторизира като:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};heta),
$$

където $heta$ са параметрите на модела.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)</sup>

Механизмът на внимание е реализиран като Grouped‑Query Attention (GQA)<sup>[\[16\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-GQA-16)</sup>:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{o}p}{\sqrt{d_{k}}} \right)V,
$$

където $Q,K,V$ са матриците на заявките, ключовете и стойностите; $d_{k}$ е размерността на главата на внимание.

За кодиране на позиции се прилагат Rotary Position Embeddings (RoPE)<sup>[\[17\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-RoPE-17)</sup>:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos mheta_{1} - x_{m}^{(2)}\sin mheta_{1}} \\
{x_{m}^{(1)}\sin mheta_{1} + x_{m}^{(2)}\cos mheta_{1}} \\
 \vdots 
\end{pmatrix},
$$

където $x_{m}$ е вектор на позиция $m$, $heta_{i} = 10000^{- 2i/d}$, $d$ е размерността на вектора.

В MLP‑слоевете се използва активация Squared ReLU: $f(x) = (\max(0,x))^{2}$, осигуряваща разреденост на активациите. Моделите не съдържат отместване (bias), не използват dropout, а матриците на входните и изходните embedding-и не са свързани помежду си (untied embeddings). Токенизаторът е SentencePiece BPE със запазване на интервалите, посимволно разделяне на цифрите и байтов fallback; размерът на речника е 256 000.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

##### Архитектурни параметри на Nemotron‑4

| Параметър            | Nemotron‑4 15B            | Nemotron‑4 340B            |
|----------------------|---------------------------|----------------------------|
| Брой параметри       | 15 млрд (3,2 млрд embed.) | 340 млрд (9,4 млрд embed.) |
| Брой слоеве          | 32                        | 96                         |
| Скрита размерност    | 6144                      | 18 432                     |
| Глави на внимание    | 48                        | 96                         |
| KV‑глави (GQA)       | 8                         | 8                          |
| Дължина на контекста | 4096                      | 4096                       |
| Размер на речника    | 256 000                   | 256 000                    |

Източници: arXiv:2402.16819, arXiv:2406.11704.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

### Хибридна архитектура Mamba‑Transformer (Nemotron‑H)

В моделите Nemotron‑H стандартните блокове за самовнимание са частично заменени с блокове Mamba‑2 — модели на пространството на състоянията (State Space Models, SSM). При авторегресивно генериране всеки слой на самовнимание изисква $O(n)$ операции и памет на стъпка (поради KV‑кеша), докато Mamba‑слоевете осигуряват постоянни разходи за памет и изчисления за всеки генериран токен.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 се описва с рекурентно съотношение<sup>[\[18\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Mamba2-18)</sup>:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

където $h_{t} \in {\mathbb{R}}^{N}$ е скритото състояние, $A \in {\mathbb{R}}^{NimesN}$ е диагоналната матрица на прехода на състоянията, $B \in {\mathbb{R}}^{Nimes1}$ и $C \in {\mathbb{R}}^{1imesN}$ са матриците на проекцията, $x_{t}$ е входният токен, $y_{t}$ е изходният сигнал. В Mamba‑2 матриците $A$, $B$, $C$ зависят от входа (input‑dependent), което отличава модела от класическите линейни SSM.

В Nemotron‑H‑56B се използват **54 слоя Mamba‑2 + 54 MLP‑слоя + 10 слоя на самовнимание**, като слоевете на внимание са наредени равномерно сред Mamba‑слоевете. Моделът е обучен на 20 трлн токена в FP8 (per‑tensor scaling) на 6144 GPU H100. Версията Nemotron‑H‑8B съдържа 24 слоя Mamba‑2, 24 MLP‑слоя и 4 слоя на самовнимание; обучението е проведено на 15 трлн токена.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

### MoE‑архитектура на Nemotron 3

Моделите Nemotron 3 (декември 2025) обединяват три архитектурни компонента: Mamba‑2, Transformer и Mixture‑of‑Experts.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) съдържа 52 слоя: **23 слоя Mamba‑2 + MoE, 23 слоя MoE и 6 слоя GQA‑внимание**. Всеки MoE‑слой включва 128 маршрутизирани (routed) експерта + 1 общ (shared) експерт, от които 6 експерта се активират за всеки токен. Маршрутизацията се извършва от обучаем MLP‑рутер с sigmoid gating. Балансирането на натоварването е реализирано без спомагателна функция на загубата (aux‑loss‑free). Общият брой параметри е 31,6 млрд, но активните за всеки токен са само 3,2 млрд.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

Нормализацията е RMSNorm<sup>[\[19\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-RMSNorm-19)</sup>. Позиционни embedding-и в частите Mamba липсват (позиционната информация е имплицитна в състоянието на SSM). Използват се несвързани embedding-и, без dropout и без отместване (bias) в линейните слоеве.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

### Разширения в Super/Ultra: LatentMoE и Multi‑Token Prediction

Моделите Super и Ultra от семейството Nemotron 3 прилагат две допълнителни архитектурни иновации:

- **Latent MoE (LatentMoE)** — проекция на входното представяне в латентно пространство с по-малка размерност преди маршрутизацията, което позволява увеличаване на броя на експертите при сравними изчислителни разходи и подобряване на точността без намаляване на пропускателната способност.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — предсказване на няколко следващи токена едновременно, използвано за подобряване на качеството на дългите текстове и спекулативно декодиране при инференс.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

Обучението на Super и Ultra се извършва в NVFP4 — 4‑битов числов формат на NVIDIA за архитектурата Blackwell.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

### Методи за компресиране на модели: Minitron, Puzzle, MiniPuzzle

За създаването на компактни модели NVIDIA прилага няколко подхода:

- **Minitron** — метод на структурирано изреждане (pruning) и дистилация на знания (knowledge distillation). Изследват се два вида pruning: по дълбочина (премахване на слоеве) и по ширина (съвместно намаляване на размерностите на скритите слоеве, главите на внимание и MLP‑проекциите). Прилагането на Minitron към Nemotron‑4 15B позволява получаването на модели 8B и 4B с намаляване на разходите за обучение до 40 пъти в сравнение с обучение от нулата.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Minitron-20)</sup>
- **Puzzle** — алгоритъм Neural Architecture Search (NAS), който подбира оптималната конфигурация на всеки блок (брой KV‑глави, размер на FFN, наличие/отсъствие на внимание) с поблочна дистилация. Именно по този начин Llama 3.1 405B е компресиран до 253B (Llama‑Nemotron Ultra), а Llama 3.3 70B — до 49B (Llama‑Nemotron Super).<sup>[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — разширение на Puzzle за хибридни архитектури, което е компресирало Nemotron‑H‑56B до 47B с изразходване на само 63 млрд токена за дистилация. При сходна точност компресираният модел извежда с 20 % по-бързо.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

## Методи за изравняване

### HelpSteer и HelpSteer2

**HelpSteer** — набор от 37 120 примера (лиценз CC‑BY‑4.0), създаден съвместно с Scale AI, в който всеки отговор е анотиран по пет атрибута: полезност (helpfulness), коректност (correctness), свързаност (coherence), сложност (complexity) и многословност (verbosity) по скалата на Ликерт 0–4.<sup>[\[22\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — актуализиран набор от 21 362 примера (10 681 prompt × 2 отговора), като над 95 % от prompt-овете са взети от ShareGPT (реални потребителски заявки). Около 50 % от анотациите са филтрирани като недостатъчно качествени. Разширението **HelpSteer2‑Preference** добавя двойни предпочитания на анотаторите, което позволява обучаването на регресионни и двойни модели на възнаграждение върху едни и същи данни.<sup>[\[23\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — метод SFT (Supervised Fine‑Tuning — обучение с учител) с обусловяване на атрибути (helpfulness, correctness, coherence, complexity, verbosity), позволяващ на потребителя да управлява стила на отговора при инференс. Конвейерът включва: (1) обучение на модел за предсказване на атрибути (APM) върху HelpSteer, (2) маркиране на данните с помощта на APM, (3) SFT с обусловяване на целевите стойности на атрибутите, (4) bootstrapping.<sup>[\[25\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-SteerLM-25)</sup>

### DPO и RPO

**DPO (Direct Preference Optimization)** — метод за пряка оптимизация на предпочитанията без явен модел на възнаграждение, използван в конвейерите на Nemotron‑4 340B Instruct и Nemotron Nano 2.<sup>[\[26\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — унифицирана математическа рамка на NVIDIA, обобщаваща DPO, IPO, SimPO, REINFORCE и SteerLM 2.0 като частни случаи. RPO минимизира разстоянието между предсказанията на неявния модел на възнаграждение и целевия явен модел<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{ext{RPO}}(heta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{h}eta(y_{w}|x)}{\pi_{ext{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{h}eta(y_{l}|x)}{\pi_{ext{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

където $r_{\phi}$ е явният модел на възнаграждение, $\pi_{h}eta$ е обучаваната политика, $\pi_{ext{ref}}$ е референтната политика, $d( \cdot , \cdot )$ е функцията на разстоянието, $y_{w}$/$y_{l}$ е предпочитаният/отхвърленият отговор. RPO се прилага при обучението на Nemotron‑4 340B Instruct и моделите Llama‑Nemotron.<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

### Многосредово обучение с подкрепление (RLVR)

В Nemotron 3 се прилага Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — едновременно обучение в няколко среди в рамките на NeMo Gym: съревнователна математика, програмиране, QA, tool‑use, instruction‑following, long‑context. Алгоритъмът е GRPO (Group Relative Policy Optimization) с masked importance sampling.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_blog-14)</sup>

Nemotron 3 поддържа гранулирано **управление на бюджета за разсъждения** (reasoning budget control): потребителят може да зададе лимит от токени за thinking trace чрез флаг в chat template (превключване „detailed thinking on/off" или ограничение на дължината).<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

## Линейка от модели

### Обобщаваща таблица

| Модел                         | Година    | Общо / Активни параметри | Контекст  | Архитектура                    | Ключови особености                                            |
|-------------------------------|-----------|--------------------------|-----------|--------------------------------|---------------------------------------------------------------|
| **Nemotron‑3 8B**             | 2023      | 8B / 8B                  | 4K        | Dense Transformer              | 3,8T токена; 1024 GPU A100; 19 дни                            |
| **Nemotron‑4 15B**            | 2024      | 15B / 15B                | 4K        | Dense Transformer              | 8T токена; MFU 34,3 %                                         |
| **Nemotron‑4 340B**           | 2024      | 340B / 340B              | 4K        | Dense Transformer              | 9T токена; Base/Instruct/Reward; \>98 % синт. данни alignment |
| **Llama‑3.1‑Nemotron‑70B**    | 2024      | 70B / 70B                | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE); RewardBench 94,1 %                          |
| **Llama‑Nemotron Nano 8B**    | 2025      | 8B / 8B                  | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                              |
| **Llama‑Nemotron Nano 4B**    | 2025      | 4B / 4B                  | 128K      | Dense Transformer (Minitron)   | NAS‑компресия от Llama 3.1 8B                                 |
| **Llama‑Nemotron Super 49B**  | 2025      | 49B / 49B                | 128K      | Dense Transformer (Puzzle NAS) | От Llama 3.3 70B                                              |
| **Llama‑Nemotron Ultra 253B** | 2025      | 253B / 253B              | 128K      | Dense Transformer (Puzzle NAS) | От Llama 3.1 405B; GPQA 76,0 %                                |
| **Nemotron‑H 8B**             | 2025      | 8B / 8B                  | —         | Хибрид Mamba‑Transformer       | 15T токена; 24 Mamba‑2 + 24 MLP + 4 Attn                      |
| **Nemotron‑H 56B**            | 2025      | 56B / 56B                | —         | Хибрид Mamba‑Transformer       | 20T токена FP8; 54 Mamba‑2 + 54 MLP + 10 Attn                 |
| **Nemotron‑H 47B**            | 2025      | 47B / 47B                | ~1M (FP4) | Хибрид Mamba‑Transformer       | MiniPuzzle от 56B; +20 % скорост                              |
| **Nemotron Nano 2 (9B)**      | 2025      | 12B → 9B / 9B            | 128K      | Хибрид Mamba‑Transformer       | 20T токена; Minitron‑дистилация                               |
| **Nemotron 3 Nano**           | 2025      | 31,6B / 3,2B             | 1M        | Хибрид Mamba‑Transformer MoE   | 25T токена; 128 експерта, 6 активни                           |
| **Nemotron 3 Super**          | 2025–2026 | ~100B / ~10B             | 1M        | Хибрид LatentMoE               | MTP; NVFP4                                                    |
| **Nemotron 3 Ultra**          | 2025–2026 | ~500B / ~50B             | 1M        | Хибрид LatentMoE               | MTP; NVFP4                                                    |

### Nemotron‑4 15B

Архитектура: 32 слоя, hidden dimension 6144, 48 глави на внимание, 8 KV‑глави (GQA). Общият брой параметри е 15 млрд (3,2 млрд embedding + 12,5 млрд non‑embedding). Резултати: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). На многоезичните benchmark-ове (XCOPA, TyDiQA‑GoldP, MGSM) моделът превъзхожда модели четири пъти по-големи от него.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

Архитектура: 96 слоя, hidden dimension 18 432, 96 глави на внимание, 8 KV‑глави.

**Nemotron‑4 340B Base** показа: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** премина многоетапно изравняване: Code SFT → General SFT → DPO → RPO (3 кръга). Резултати: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward** заменя финалния слой softmax с линейна проекция на скритото състояние на последния слой в вектор от 5 атрибута на HelpSteer2. Крайното възнаграждение е претеглена сума от петте атрибута. Обучението е проведено за 2 епохи върху данните HelpSteer2 (batch size 128). На RewardBench моделът достигна 92,0 %, надминавайки GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) и Claude‑3‑Opus (80,7 %) към момента на публикуване.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

| Модел                    | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54,2       | 41,5 %            | 8,22     |
| Llama‑3‑70B‑Instruct     | 41,1       | 34,4 %            | 8,16     |
| Mixtral‑8x22B‑Instruct   | 36,4       | 30,9 %            | 7,63     |
| Qwen‑2‑72B‑Instruct      | 48,1       | 38,8 %            | 8,26     |

Източник: arXiv:2406.11704, таблица 5.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward** е обучен с хибриден метод, обединяващ Bradley‑Terry (двойни предпочитания) и SteerLM‑регресия (многоатрибутна оценка по скалата на Ликерт). Обучението е проведено изключително върху данните HelpSteer2 (CC‑BY‑4.0). На RewardBench моделът достигна 94,1 %, заемайки 1‑во място към момента на публикуване.<sup>[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct** е изравнен с метода RLHF с алгоритъм REINFORCE (не PPO) и модел на възнаграждение Nemotron‑70B‑Reward. Инфраструктурата е NeMo‑Aligner с ускорение TRT‑LLM.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano, Super, Ultra (2025)

Семейство от разсъждаващи модели, получени от Llama 3.x чрез NAS, дистилация и разширено постобучение.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

| Модел                     | Параметри | Базов модел                   | Контекст |
|---------------------------|-----------|-------------------------------|----------|
| Llama‑Nemotron‑Nano 8B    | 8 млрд    | Llama‑3.1‑8B‑Instruct         | 128K     |
| Llama‑Nemotron‑Nano 4B    | 4 млрд    | Minitron 4B (от Llama 3.1 8B) | 128K     |
| Llama‑Nemotron‑Super 49B  | 49 млрд   | Llama‑3.3‑70B → NAS (Puzzle)  | 128K     |
| Llama‑Nemotron‑Ultra 253B | 253 млрд  | Llama‑3.1‑405B → NAS (Puzzle) | 128K     |

Петстъпален конвейер за обучение: (1) NAS + FFN Fusion, (2) дистилация + продължено предобучение, (3) SFT (включително трасировки на разсъждения DeepSeek‑R1), (4) мащабно RL (GRPO за Ultra, REINFORCE/RLOO + Online RPO за Nano), (5) изравняване за диалог.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

Моделите са сред първите отворени LLM, поддържащи **превключваем режим на разсъждения** (reasoning toggle): при включване („detailed thinking on" в системния prompt) моделът генерира верига от разсъждения в тагове `<think>...</think>` преди отговора; при изключване — отговаря директно.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

Резултати на Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. За сравнение: DeepSeek‑R1 (671B общо / 37B активни) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra се разполага на един възел 8×H100.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (април 2025)

Семейство от плътни хибридни модели, обучени от нулата и проектирани за задачи с дълги генерации. Nemotron‑H‑56B е обучен на 20 трлн токена в FP8 — един от най-мащабните публични експерименти с FP8‑предобучение. Nemotron‑H‑47B е получен чрез компресиране на 56B с метода MiniPuzzle (63 млрд токена дистилация) и се побира в паметта на единична RTX 5090 (FP4) при контекст ~1M токена.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

| Benchmark             | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60,5           | 61,8           | 58,8         | 51,3          |
| MMLU (5‑shot)         | 84,2           | 83,6           | 86,1         | 78,8          |
| GSM8K (8‑shot CoT)    | 93,7           | 93,3           | 90,9         | 83,9          |
| HumanEval (0‑shot)    | 60,4           | 61,0           | 56,7         | 57,3          |

Източник: arXiv:2504.03624.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

При генериране с 65 536 входни и 1024 изходни токена на H100 моделът Nemotron‑H‑47B работеше 2,9 пъти по-бързо от Qwen‑2.5‑72B и Llama‑3.1‑70B.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (август 2025)

Хибриден Mamba‑Transformer модел за разсъждения. **Nemotron‑Nano‑12B‑v2‑Base** — родителският модел с 62 слоя (предимно Mamba‑2 + MLP + 4 слоя на внимание), обучен на 20 трлн токена в FP8 от нулата. От него чрез разширен Minitron е получена **Nemotron‑Nano‑9B‑v2**, способна да работи в контекст от 128K токена на единичен GPU NVIDIA A10G (22 ГБ, BF16). Постобучение: SFT (80 млрд токена, включително трасировки DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. На benchmark-овете за разсъждения моделът е сравним с Qwen3‑8B по точност, но постига 3–6‑кратно ускорение на генерацията при дълги изходни последователности.<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

Публикуван през декември 2025 г. Параметри: 31,6 млрд общо, 3,2 млрд активни. Архитектура: 52 слоя, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 маршрутизирани експерта + 1 общ, 6 активни на токен. Контекст — до 1 048 576 токена. Обучение на 25 трлн токена (WSD‑разписание, batch size 3072, отсечване на данните — юни 2025) в две фази: Phase 1 — 23,5 трлн (разнообразни данни), Phase 2 — 1,5 трлн (висококачествени данни) + 121 млрд токена long‑context CPT.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

| Benchmark             | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78,30                   | 80,9                   | 75,0        |
| AIME25 (no tools)     | 89,06                   | 85,0                   | 91,7        |
| AIME25 (with tools)   | 99,17                   | —                      | 98,7        |
| GPQA (no tools)       | 73,04                   | 73,4                   | 71,5        |
| LiveCodeBench v6      | 68,25                   | 66,0                   | 61,0        |
| SWE‑Bench (OpenHands) | 38,76                   | 22,0\*                 | 34,0        |
| TauBench V2 Avg       | 49,04                   | 47,7                   | 47,5        |
| Arena‑Hard‑V2 Avg     | 67,65                   | 57,8                   | 48,55       |
| RULER‑100 @ 1M        | 86,34                   | 77,5                   | —           |

\* — стойности от вторични източници; условия за възпроизвеждане — NeMo Evaluator SDK. Източник: arXiv:2512.20848.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NeMo_eval-28)</sup>

Пропускателна способност (8K вход / 16K изход, единичен H200): 3,3 пъти по-висока от Qwen3‑30B‑A3B‑Thinking и 2,2 пъти по-висока от GPT‑OSS‑20B.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

### Допълнителни модели и направления

- **OpenReasoning‑Nemotron** (юли 2025) — серия от модели с 1,5B–32B параметъра, базирани на Qwen 2.5 и дообучени върху данни от DeepSeek‑R1‑0528. Вариантът 32B с GenSelect@64 превъзхожда o3 (high) на редица математически benchmark-ове.<sup>[\[29\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — рамка от вложени подмодели (6B, 9B, 12B) в рамките на един родителски модел, намаляваща разходите за обучение 360 пъти в сравнение с обучение от нулата.<sup>[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — рамка за многодоменно обучение с подкрепление извън математическите задачи, осигурила +30,1 % на MATH‑500 и +12,8 % на MMLU‑PRO.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — разширение на контекста до 4 млн токена.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — постобучителен NAS за компактни хибридни модели 2B/4B.<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-JetNemotron-33)</sup>

### Специализирани модели

В екосистемата на Nemotron присъстват и модели за специализирани задачи:

- **Nemotron Nano V2 VL** — vision‑language модел за OCR, обработка на таблици и видео.<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — модел за OCR и извличане на структурата на документи.<sup>[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — модел за embedding-и за визуално търсене в документи (late interaction).<sup>[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — модели за автоматично разпознаване на реч (ASR), синтез на реч (TTS) и машинен превод (NMT).<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — модел за класификация на небезопасно съдържание по 23 категории на 9 езика с точност 84,2 %.<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Safety-37)</sup>

## Данни за предварително обучение

### Състав на данните за Nemotron‑4

Предобучителният корпус на Nemotron‑4 15B и 340B се състои от три основни категории: английски текстове (70 %), многоезични текстове на 53 езика (15 %) и изходен код на 43 езика за програмиране (15 %). Приложена е дедупликация на ниво документ (exact и near‑duplicate), както и филтриране с помощта на езикови модели и евристики. Моделът 15B е обучен на 8 трлн токена, моделът 340B — на 9 трлн (8 трлн предварително обучение + 1 трлн продължено обучение с претегляне на висококачествени източници).<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

Наборът от данни **Nemotron‑CC** е формиран от Common Crawl с използване на ансамбъл от класификатори за качество и синтетично перефразиране на текстове. Общият обем е **6,3 трлн токена** (4,4 трлн дедупликирани + 1,9 трлн синтетични преформулировки). Конвейерът е интегриран в инструмента NeMo Curator. Трудът е приет като Long Paper на конференцията ACL 2025.<sup>[\[38\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

Математически ориентиран поднабор с обем **133 млрд токена**, извлечен от Common Crawl с помощта на конвейера Lynx + LLM със запазване на структурата на математическите формули и кода в LaTeX.<sup>[\[39\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NemotronCC_Math-39)</sup>

### Данни за Nemotron 3 Nano

Предобучението на Nemotron 3 Nano е извършено на 25 трлн токена. Наборът включва: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 и специализирани STEM‑набори от данни. За long‑context обучение са използвани допълнителни 121 млрд токена CPT.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

Синтетично генериран набор, обхващащ STEM, академични текстове, задачи за разсъждаване и многоезични домени; съдържа над 10 трлн езикови токена и 18 млн образеца за SFT. Всички набори от данни се разпространяват под отворени разрешителни лицензи.<sup>[\[40\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NemotronNano2_page-40)</sup>

### Конвейер за синтетично генериране на данни (SDG)

Конвейерът, описан в доклада за Nemotron‑4 340B, включва следните етапи<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>:

- **Генериране на prompt-ове**: синтетични едно‑ и двуоборотни заявки, генерирани с помощта на Mixtral‑8x7B‑Instruct‑v0.1 (лиценз Apache 2.0) по шаблони Open QA, Writing, Closed QA, Math & Coding.
- **Генериране на отговори**: множество отговори от междинни версии на моделите за осигуряване на разнообразие.
- **Оценка на качеството**: три подхода — Ground‑Truth‑as‑a‑Judge (за задачи с проверим отговор), LLM‑as‑Judge (сравнение на двойки отговори от езиков модел), Reward‑Model‑as‑Judge (използване на Nemotron‑4‑340B‑Reward).
- **Итеративно изравняване** от слаби към силни модели (weak‑to‑strong).

От ~20 000 анотирани от хора примера (10 000 за SFT, 10 000 HelpSteer2 за модела на възнаграждение) е синтезиран целият останал обем от данни за изравняване.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)</sup>

## Квантизация и оптимизация на инференса

Моделите Nemotron 3 Nano поддържат Post‑Training Quantization (PTQ) в FP8 с използване на ModelOpt и Megatron‑LM. Прилага се selective quantization — слоевете attention и част от Mamba се запазват в BF16 за поддържане на качеството; останалите се квантизират в FP8. Според техническия доклад, това осигурява ~99 % запазване на точността.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup> Nano поддържа и инференс в NVFP4.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

## Обобщаваща таблица с benchmark-ове по поколения

| Модел                           | MMLU   | GSM8K  | HumanEval | Arena Hard | MT‑Bench | Условия                   |
|---------------------------------|--------|--------|-----------|------------|----------|---------------------------|
| Nemotron‑4 15B                  | 64,2 % | 46,0 % | 31,6 %    | —          | —        | base; 5‑/8‑/0‑shot        |
| Nemotron‑4 340B Base            | 81,1 % | —      | 57,3 %    | —          | —        | 5‑/—/0‑shot               |
| Nemotron‑4 340B Instruct        | 78,7 % | 92,3 % | 73,2 %    | 54,2       | 8,22     | 0‑shot                    |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —      | —      | —         | 85,0       | 8,98     | окт. 2024                 |
| LN‑Ultra 253B (reasoning ON)    | —      | —      | —         | —          | —        | GPQA 76,0 %, AIME 80,8 %  |
| Nemotron‑H‑47B                  | 83,6 % | 93,3 % | 61,0 %    | —          | —        | 5‑/8‑CoT/0‑shot           |
| Nemotron 3 Nano (30B‑A3B)       | —      | —      | —         | 67,7 (v2)  | —        | AIME25 89,1 %, LCB 68,3 % |

Сравнението трябва да се интерпретира с внимание: условията за оценка, версиите на benchmark-овете и датите на провеждане на тестовете се различават между поколенията. Резултатите са взети от техническите доклади на NVIDIA; независимите оценки може да се различават (вж. раздел „Ограничения").<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

## Приложение

### Разгръщане чрез NVIDIA NIM

NVIDIA NIM — набор от оптимизирани контейнерни микросервиси за инференс с OpenAI‑съвместим API. Моделите Nemotron са достъпни като NIM‑микросервиси на платформата build.nvidia.com. NIM поддържа форматите FP8, BF16, NVFP4 и разгръщане чрез Helm‑чарти на Kubernetes. Моделите са съвместими и с независими рамки: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

### Синтетично генериране на данни

Nemotron‑4 340B е проектиран за използване като генератор на синтетични данни: моделът Instruct генерира отговори, а моделът Reward ги оценява и филтрира. Лицензът NVIDIA Open Model License изрично разрешава използването на изходните данни на модела за обучение на други модели. Според данни на ServiceNow, 15 % от предобучителните данни на техния модел Apriel 1.6 са получени от набори с данни на Nemotron.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NeMo_synth-41)</sup>

### Агентни системи

Моделите от семейството Nemotron 3 (Nano, Super, Ultra) са предназначени за многоагентни натоварвания: планиране, retrieval, извикване на инструменти (tool use). Nemotron 3 Nano демонстрира резултат от 38,76 % на SWE‑Bench (с OpenHands) и 49,04 % (avg) на TauBench V2.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

### Корпоративни внедрявания

Сред заявените партньори: ServiceNow (съвместен модел Apriel Nemotron 15B за автоматизация на работни процеси), CrowdStrike (платформа Charlotte AI), Perplexity (маршрутизиране на заявки), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Моделите са достъпни на AWS Amazon Bedrock; планирана е поддръжка за Google Cloud, CoreWeave, Nebius.<sup>[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NVIDIA_news-15)</sup>

## Ограничения и открити проблеми

### Независими оценки и разминавания с данните на NVIDIA

Независимите оценки разкриват разминавания с резултатите, посочвани от NVIDIA. Според данни на Artificial Analysis (февруари 2026), Llama‑Nemotron‑Ultra 253B (reasoning) е получил оценка Intelligence Index 15 при медиана 26 за модели от сравним размер. На платформата Chatbot Arena (LMArena) моделите Nemotron заемат позиции в средата на класирането: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147‑а позиция), Nemotron 3 Nano — 1317 ±6 (~164‑а позиция).<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-LMArena-43)</sup>

### Многословност

Моделите Nemotron демонстрират повишена многословност: при оценка от Artificial Analysis моделът Nemotron 3 Nano е генерирал 140 млн токена (при медиана 12 млн за другите модели), което увеличава разходите за инференс. Анализ на DEV Community установи, че Llama‑3.1‑Nemotron‑70B‑Instruct при формално лидерство на автоматичните benchmark-ове е демонстрирал недостатъчна точност в редица практически задачи, а високите оценки на Arena‑подобни benchmark-ове може да се обяснят с предпочитание към многословни и уверени, но не непременно точни отговори.<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Saplin-44)</sup>

### Халюцинации и пристрастия

NVIDIA в карточките на моделите посочва, че моделите могат „да усилват пристрастия и да генерират токсични отговори, особено при токсични prompt-ове", а също и „да произвеждат неточна информация, да пропускат ключови детайли". Откритостта на теглата и данните позволява външен одит.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nano2-13)</sup>

### Изчислителни изисквания

Плътните модели (Nemotron‑4 340B) изискват клъстер от 768 възела DGX H100 за пълно обучение, което ограничава възпроизводимостта за академични групи без достъп до подобна инфраструктура. Дългият контекст (1M) при инференс изисква значителен обем VRAM.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

### Деградация при разширяване на контекста

При разширяване на контекста до свръхдълги последователности е наблюдавана деградация на резултатите на benchmark-овете с кратък контекст.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-UltraLong-32)</sup>

### Квантизация на хибридни архитектури

Използването на свръхниска разрядност (FP8/NVFP4) в архитектурите Mamba‑Transformer води до незначително намаляване на точността (~1 % на редица benchmark-ове). Този проблем се решава чрез прилагане на selective quantization, което усложнява архитектурата на компилаторите и инференс‑сървърите.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

### Други открити проблеми

- Зависимост от benchmark-ове с възможна контаминация на обучителните данни.
- Липса на стандартизирани протоколи за сравнение на хибридни SSM‑Transformer архитектури с чисти Transformer‑модели.
- Въпросът за мащабируемостта на MoE‑подхода при задачи, изискващи дълбоко разсъждаване с малък брой активни експерта на токен.
- Данните за Super/Ultra към декември 2025 г. са предварителни; пълните benchmark-ове се очакват след публикуването им.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

## Етични и регулаторни аспекти

### Безопасност на етапа на разработка

На етапа на разработка се прилагат: оценка по рамката AEGIS (13 категории за безопасност на съдържанието), скенер за уязвимости garak, ръчно „червено тестване" (red‑teaming).<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Safety-37)</sup>

### Безопасност на етапа на извод

**NeMo Guardrails** — отворен набор от инструменти (лиценз Apache 2.0), добавящ програмируеми бариери към LLM‑системи. Микросервисът прехваща входовете и изходите, прилагайки конфигурируеми проверки: контрол на темата, разкриване на PII, верификация на „заземяването" на RAG, разкриване на jailbreak‑атаки (включително защита от инжектиране на код на базата на YARA), многоезична многомодална класификация на безопасността.<sup>[\[45\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Guardrails-45)</sup>

За Nemotron 3 е публикуван набор от ~11 000 маркирани трасировки OpenTelemetry от реалистични сценарии с използване на инструменти, предназначени за оценка на агентната безопасност.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

### Лицензиране

| Модели                                 | Лиценз                                        |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano, Super, Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (наследен от Meta)    |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License** разрешава търговско използване, създаване и разпространение на производни творби, не изисква атрибуция (при запазване на файла NOTICE), не налага ограничения върху броя на потребителите и изрично разрешава използването на изходните данни на модела за обучение на други модели.<sup>[\[46\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-License-46)</sup> Моделите на базата на Llama наследяват ограниченията на Meta, включително прага от 700 млн месечно активни потребители.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Llama_Nemotron-11)</sup>

За Nemotron 3 Nano NVIDIA е публикувала: теглата на модела, над 10 трлн токена от обучителни данни, рецепти за обучение, кодови бази (NeMo, Megatron‑LM, NeMo‑Aligner), над 10 среди за обучение с подкрепление с 900 000+ задачи.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_nano_report-2)</sup>

## Перспективи и изследователски направления

Най-близките релизи включват **Nemotron 3 Super** (~100 млрд параметъра, ~10 млрд активни) и **Nemotron 3 Ultra** (~500 млрд, ~50 млрд активни), очаквани в първата половина на 2026 г. И двата модела ще използват LatentMoE, MTP и обучение в NVFP4 на архитектурата Blackwell.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)</sup>

Стратегическото направление на NVIDIA е позиционирането на Nemotron не като единичен модел, а като инфраструктурен слой за многоагентни системи, в които различни модели от семейството се използват за различни задачи с маршрутизиране по сложност.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NVIDIA_news-15)</sup>

Основни изследователски направления:

- Развитие на хибридни архитектури — по-нататъшна интеграция на SSM‑слоеве с механизма на внимание за мащабируем дълъг контекст.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Nemotron_H-12)</sup>
- Многостепенни методи за компресиране — развитие на Minitron, Puzzle, MiniPuzzle и Nemotron Elastic.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Elastic-30)</sup>
- Многодоменно обучение с подкрепление — Nemotron‑CrossThink за разширяване на RL извън математическите задачи.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-CrossThink-31)</sup>
- Разширяване на контекста — Nemotron‑UltraLong до 4 млн токена.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-UltraLong-32)</sup>
- Многомодалност — разширяване в областта на vision‑language (Nemotron VL), реч (Nemotron Speech), визуално търсене в документи (Nemotron ColEmbed V2).<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-ColEmbed-36)</sup>
- Компактни хибридни модели — Jet‑Nemotron (NAS за модели 2B/4B).<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-JetNemotron-33)</sup>
- Отворени рецепти — публикуване на пълни рецепти за обучение и данни за възпроизвеждане и персонализиране от общността.<sup>[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_note-N3_blog-14)</sup>

## Вижте също

- Архитектура Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (семейство модели на Meta)

## Препратки

- NVIDIA Research — страница на Nemotron 3: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — документация на Nemotron: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- NeMo Framework Documentation: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## Литература

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февруари 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, юни 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, юни 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, юли 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноември 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203, януари 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, април 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664, ноември 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декември 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848, декември 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. et al. *GQA*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. et al. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. et al. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## Бележки

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NV_developer_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nano2_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nano2_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_blog_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_blog_14-1)</sup> <sup>[14.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Minitron_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Puzzle_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-RPO_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Elastic_30-0)</sup> <sup>[30.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-CrossThink_31-0)</sup> <sup>[31.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-UltraLong_32-0)</sup> <sup>[32.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-UltraLong_32-1)</sup> <sup>[32.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-JetNemotron_33-0)</sup> <sup>[33.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Parse_35-0)</sup> <sup>[35.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-ColEmbed_36-0)</sup> <sup>[36.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Safety_37-0)</sup> <sup>[37.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-AA_42-0)</sup> <sup>[42.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(BG)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
