Nemotron (NVIDIA)

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

Nemotron — семейство больших языковых моделей (Large Language Model, LLM) с открытыми весами, разработанное подразделением Applied Deep Learning Research (ADLR) корпорации NVIDIA. Модели относятся к области машинного обучения и обработки естественного языка (Natural Language Processing, NLP) и предназначены для широкого круга задач: синтетической генерации данных, логического вывода (reasoning), агентных приложений (agentic AI) и развёртывания на промышленном оборудовании NVIDIA. Семейство объединяет модели различных архитектур и масштабов: от 4 млрд до ~500 млрд параметров, включая плотные (dense) decoder‑only Transformer‑модели серии Nemotron‑4 (2024), гибридные Mamba‑Transformer (Nemotron‑H, 2025) и гибридные Mamba‑Transformer с Mixture-of-Experts (MoE) в серии Nemotron 3 (2025). По состоянию на март 2026 года семейство насчитывает более 20 моделей, охватывающих задачи генерации текста, рассуждений, визуального понимания документов, извлечения информации и оценки качества ответов. Модели выпускаются преимущественно с открытыми весами под лицензиями NVIDIA Open Model License и Llama Community License.[1][2][3]

История и предпосылки

Разработка семейства Nemotron ведётся в контексте стратегии NVIDIA по созданию полного стека инструментов для генеративного ИИ: от обучающей инфраструктуры (DGX, суперкомпьютеры на базе GPU H100/B200) до платформ обучения (NeMo Framework), выравнивания (NeMo‑Aligner), развёртывания (NIM — NVIDIA Inference Microservices) и обеспечения безопасности (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

Первая публично доступная модель серии — декодерный Transformer с 8 млрд параметров и контекстом 4096 токенов, обученная на 3,8 трлн токенов на 53 естественных и 37 языках программирования. Обучение проведено на 1024 GPU A100 за 19 дней. Формального технического отчёта на arXiv опубликовано не было. Модель распространялась через NeMo Framework и Hugging Face, существовали варианты Chat (SFT и SteerLM). Лицензия — NVIDIA AI Foundation Models Community License.[6][7]

Примечание о названиях: «Nemotron‑3» 2023 года и «Nemotron 3» декабря 2025 года — разные модели. Первая была ранним прототипом, вторая — актуальное поколение с архитектурой MoE.

Nemotron‑4 15B (февраль 2024)

Первый публично задокументированный выпуск серии Nemotron‑4 — модель с 15 миллиардами параметров, обученная на 8 триллионах токенов за ~13 календарных дней на 384 узлах DGX H100 (до 3072 GPU). Использовался 8‑кратный тензорный параллелизм и параллелизм по данным от 96 до 288. Пиковая MFU (Model FLOPs Utilization) составила 34,3 % при batch size 384. Архитектура — decoder‑only Transformer с Grouped‑Query Attention (GQA) и Rotary Position Embeddings (RoPE). По результатам бенчмарков на момент публикации модель превосходила все сопоставимые по размеру открытые модели в многоязычных задачах, включая ряд моделей, превышающих её по размеру в четыре раза.[8]

Nemotron‑4 340B (июнь 2024)

В июне 2024 года выпущена наиболее крупная модель серии Nemotron‑4 — 340 миллиардов параметров (331,6 млрд не‑эмбеддинговых), предобученная на 9 триллионах токенов (8 трлн предобучение + 1 трлн продолженное обучение с перевзвешиванием высококачественных источников). Обучение проводилось на 768 узлах DGX H100 (до 6144 GPU) с пиковой MFU 42,4 %, с декабря 2023 по май 2024 года. Семейство включает три варианта: Base, Instruct и Reward. Размер модели выбран таким образом, чтобы она помещалась на одном узле DGX H100 (8 GPU) при развёртывании в формате точности FP8. Более 98 % данных, использованных при выравнивании (alignment), сгенерированы синтетически самими моделями серии в итеративном процессе; пайплайн синтетической генерации данных открыт для воспроизведения.[3]

Llama‑3.1‑Nemotron‑70B (октябрь 2024)

В октябре 2024 года выпущены модели, дообученные из Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct и Llama‑3.1‑Nemotron‑70B‑Reward. По состоянию на 1 октября 2024 года модель Instruct занимала 1‑е место одновременно на трёх автоматических бенчмарках: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Reward‑модель достигла 94,1 % на RewardBench.[9][10]

Переход к гибридным архитектурам (2025)

В 2025 году серия расширилась гибридными архитектурами, сочетающими слои Mamba‑2 (State Space Model, SSM — модель пространства состояний) и Transformer. В марте–мае 2025 года выпущено семейство рассуждающих моделей Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) с переключаемым режимом рассуждений.[11] В апреле 2025 года опубликован Nemotron‑H (arXiv:2504.03624) — семейство гибридных Mamba‑Transformer моделей размером 8B, 56B и 47B параметров.[12] В августе 2025 года представлен Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]

Nemotron 3 (декабрь 2025)

15 декабря 2025 года анонсировано третье поколение — семейство Nemotron 3 с моделями Nano, Super и Ultra, объединяющее архитектуры Mamba‑2, Transformer и MoE с контекстным окном до 1 млн токенов. Nano выпущена с техническим отчётом; Super и Ultra запланированы на первую половину 2026 года.[1][2][14][15]

Теоретические основы

Архитектура Transformer в Nemotron‑4

Модели серии Nemotron‑4 построены на стандартной архитектуре декодерного Transformer с каузальным вниманием. Вероятность последовательности токенов x1,x2,,xT факторизуется как:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

где θ — параметры модели.[8]

Механизм внимания реализован в варианте Grouped‑Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKdk)V,

где Q,K,V — матрицы запросов, ключей и значений; dk — размерность головы внимания.

Для кодирования позиций применяются Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

где xm — вектор в позиции m, θi=100002i/d, d — размерность вектора.

В MLP‑слоях используется активация Squared ReLU: f(x)=(max(0,x))2, обеспечивающая разреженность активаций. Модели не содержат смещений (bias), не используют dropout, а матрицы вложений входа и выхода не связаны между собой (untied embeddings). Токенизатор — SentencePiece BPE с сохранением пробелов, посимвольной разбивкой цифр и побайтовым fallback, размер словаря — 256 000.[8][3]

Архитектурные параметры Nemotron‑4
Параметр Nemotron‑4 15B Nemotron‑4 340B
Число параметров 15 млрд (3,2 млрд embed.) 340 млрд (9,4 млрд embed.)
Число слоёв 32 96
Скрытая размерность 6144 18 432
Головы внимания 48 96
KV‑головы (GQA) 8 8
Длина контекста 4096 4096
Размер словаря 256 000 256 000

Источники: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Гибридная архитектура Mamba‑Transformer (Nemotron‑H)

В моделях Nemotron‑H стандартные блоки самовнимания частично заменены блоками Mamba‑2 — моделями пространства состояний (State Space Models, SSM). При авторегрессивной генерации каждый слой самовнимания требует O(n) операций и памяти на шаг (из‑за KV‑кэша), тогда как Mamba‑слои обеспечивают постоянные затраты памяти и вычислений на каждый генерируемый токен.[12]

Mamba‑2 описывается рекуррентным соотношением[18]:

ht=Aht1+Bxt,yt=Cht,

где htN — скрытое состояние, AN×N — диагональная матрица перехода состояний, BN×1 и C1×N — матрицы проекции, xt — входной токен, yt — выходной сигнал. В Mamba‑2 матрицы A, B, C зависят от входа (input‑dependent), что отличает модель от классических линейных SSM.

В Nemotron‑H‑56B используются 54 слоя Mamba‑2 + 54 MLP‑слоя + 10 слоёв самовнимания, причём слои внимания размещены равномерно среди Mamba‑слоёв. Модель обучена на 20 трлн токенов в формате FP8 (per‑tensor scaling) на 6144 GPU H100. Версия Nemotron‑H‑8B содержит 24 слоя Mamba‑2, 24 MLP‑слоя и 4 слоя самовнимания; обучение проведено на 15 трлн токенов.[12]

MoE‑архитектура Nemotron 3

Модели Nemotron 3 (декабрь 2025) объединяют три архитектурных компонента: Mamba‑2, Transformer и Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) содержит 52 слоя: 23 слоя Mamba‑2 + MoE, 23 слоя MoE и 6 слоёв GQA‑внимания. Каждый MoE‑слой включает 128 маршрутизируемых (routed) экспертов + 1 общий (shared) эксперт, из которых 6 экспертов активируются на каждый токен. Маршрутизация выполняется обучаемым MLP‑роутером с sigmoid gating. Балансировка нагрузки реализована без вспомогательной функции потерь (aux‑loss‑free). Общее число параметров составляет 31,6 млрд, но активных на каждый токен — лишь 3,2 млрд.[2]

Нормализация — RMSNorm[19]. Позиционные эмбеддинги в Mamba‑частях отсутствуют (позиционная информация имплицитна в состоянии SSM). Используются несвязанные эмбеддинги, отсутствие dropout и bias в линейных слоях.[2]

Расширения в Super/Ultra: LatentMoE и Multi‑Token Prediction

Модели Super и Ultra из семейства Nemotron 3 применяют две дополнительные архитектурные инновации:

  • Latent MoE (LatentMoE) — проекция входного представления в латентное пространство меньшей размерности перед маршрутизацией, что позволяет увеличить число экспертов при сопоставимых вычислительных затратах и повысить точность без снижения пропускной способности.[1]
  • Multi‑Token Prediction (MTP) — предсказание нескольких следующих токенов одновременно, используемое для улучшения качества длинных текстов и спекулятивного декодирования при инференсе.[1]

Обучение Super и Ultra ведётся в формате NVFP4 — 4‑битном числовом формате NVIDIA на архитектуре Blackwell.[1]

Методы сжатия моделей: Minitron, Puzzle, MiniPuzzle

Для создания компактных моделей NVIDIA применяет несколько подходов:

  • Minitron — метод структурированного прореживания (pruning) и дистилляции знаний (knowledge distillation). Исследуются два вида прунинга: по глубине (удаление слоёв) и по ширине (совместное уменьшение размерностей скрытых слоёв, голов внимания и MLP‑проекций). Применение Minitron к Nemotron‑4 15B позволяет получить модели 8B и 4B с сокращением затрат на обучение до 40 раз по сравнению с обучением с нуля.[20]
  • Puzzle — алгоритм Neural Architecture Search (NAS), который подбирает оптимальную конфигурацию каждого блока (число KV‑голов, размер FFN, наличие/отсутствие внимания) с поблочной дистилляцией. Именно так Llama 3.1 405B был сжат до 253B (Llama‑Nemotron Ultra), а Llama 3.3 70B — до 49B (Llama‑Nemotron Super).[21]
  • MiniPuzzle — расширение Puzzle для гибридных архитектур, сжавшее Nemotron‑H‑56B до 47B с затратой лишь 63 млрд токенов дистилляции. При схожей точности сжатая модель выводит на 20 % быстрее.[12]

Методы выравнивания

HelpSteer и HelpSteer2

HelpSteer — набор из 37 120 примеров (лицензия CC‑BY‑4.0), созданный совместно со Scale AI, в котором каждый ответ аннотирован по пяти атрибутам: полезность (helpfulness), корректность (correctness), связность (coherence), сложность (complexity) и многословность (verbosity) по шкале Ликерта 0–4.[22]

HelpSteer2 — обновлённый набор из 21 362 примеров (10 681 промпт × 2 ответа), где более 95 % промптов взяты из ShareGPT (реальные пользовательские запросы). Около 50 % аннотаций были отфильтрованы как недостаточно качественные. Расширение HelpSteer2‑Preference добавляет парные предпочтения аннотаторов, позволяя обучать как регрессионные, так и попарные модели вознаграждения на одних и тех же данных.[23][24]

SteerLM

SteerLM — метод SFT (Supervised Fine‑Tuning — обучение с учителем) с обусловливанием на атрибуты (helpfulness, correctness, coherence, complexity, verbosity), позволяющий пользователю управлять стилем ответа при инференсе. Конвейер включает: (1) обучение модели предсказания атрибутов (APM) на HelpSteer, (2) разметку данных с помощью APM, (3) SFT с обусловливанием на целевые значения атрибутов, (4) бутстрэппинг.[25]

DPO и RPO

DPO (Direct Preference Optimization) — метод прямой оптимизации предпочтений без явной модели вознаграждения, используемый в конвейерах Nemotron‑4 340B Instruct и Nemotron Nano 2.[26]

RPO (Reward‑aware Preference Optimization) — унифицированный математический фреймворк NVIDIA, обобщающий DPO, IPO, SimPO, REINFORCE и SteerLM 2.0 как частные случаи. RPO минимизирует расстояние между предсказаниями неявной модели вознаграждения и целевой явной модели[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

где rϕ — явная модель вознаграждения, πθ — обучаемая политика, πref — референсная политика, d(,) — функция расстояния, yw/yl — предпочтённый/отвергнутый ответ. RPO применяется при обучении Nemotron‑4 340B Instruct и моделей Llama‑Nemotron.[27][3][11]

Мультисредовое обучение с подкреплением (RLVR)

В Nemotron 3 применяется Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — одновременное обучение на нескольких средах в рамках NeMo Gym: соревновательная математика, программирование, QA, tool‑use, instruction‑following, long‑context. Алгоритм — GRPO (Group Relative Policy Optimization) с masked importance sampling.[2][14]

Nemotron 3 поддерживает гранулярное управление бюджетом рассуждения (reasoning budget control): пользователь может задать лимит токенов для thinking trace через флаг в chat template (переключение «detailed thinking on/off» или ограничение длины).[2]

Линейка моделей

Сводная таблица

Модель Год Всего / Активных параметров Контекст Архитектура Ключевые особенности
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3,8T токенов; 1024 GPU A100; 19 дней
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8T токенов; MFU 34,3 %
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9T токенов; Base/Instruct/Reward; >98 % синт. данных alignment
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1 %
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) NAS‑сжатие из Llama 3.1 8B
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Из Llama 3.3 70B
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Из Llama 3.1 405B; GPQA 76,0 %
Nemotron‑H 8B 2025 8B / 8B Гибрид Mamba‑Transformer 15T токенов; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B Гибрид Mamba‑Transformer 20T токенов FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) Гибрид Mamba‑Transformer MiniPuzzle из 56B; +20 % скорость
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Гибрид Mamba‑Transformer 20T токенов; Minitron‑дистилляция
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Гибрид Mamba‑Transformer MoE 25T токенов; 128 экспертов, 6 активных
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Гибрид LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Гибрид LatentMoE MTP; NVFP4

Nemotron‑4 15B

Архитектура: 32 слоя, hidden dimension 6144, 48 голов внимания, 8 KV‑голов (GQA). Общее число параметров — 15 млрд (3,2 млрд embedding + 12,5 млрд non‑embedding). Результаты: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). На мультиязычных бенчмарках (XCOPA, TyDiQA‑GoldP, MGSM) модель превосходила модели в 4 раза крупнее.[8]

Nemotron‑4 340B

Архитектура: 96 слоёв, hidden dimension 18 432, 96 голов внимания, 8 KV‑голов.

Nemotron‑4 340B Base показала: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]

Nemotron‑4 340B Instruct прошла многоэтапное выравнивание: Code SFT → General SFT → DPO → RPO (3 раунда). Результаты: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]

Nemotron‑4 340B Reward заменяет финальный слой softmax на линейную проекцию скрытого состояния последнего слоя в вектор из 5 атрибутов HelpSteer2. Итоговое вознаграждение — взвешенная сумма пяти атрибутов. Обучение проведено за 2 эпохи на данных HelpSteer2 (batch size 128). На RewardBench модель достигла 92,0 %, превзойдя GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) и Claude‑3‑Opus (80,7 %) на момент публикации.[3]

Модель Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54,2 41,5 % 8,22
Llama‑3‑70B‑Instruct 41,1 34,4 % 8,16
Mixtral‑8x22B‑Instruct 36,4 30,9 % 7,63
Qwen‑2‑72B‑Instruct 48,1 38,8 % 8,26

Источник: arXiv:2406.11704, таблица 5.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward обучена гибридным методом, объединяющим Bradley‑Terry (попарные предпочтения) и SteerLM‑регрессию (многоатрибутная оценка по шкале Ликерта). Обучение проведено исключительно на данных HelpSteer2 (CC‑BY‑4.0). На RewardBench модель достигла 94,1 %, заняв 1‑е место на момент публикации.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct выравнена методом RLHF с алгоритмом REINFORCE (не PPO) и моделью вознаграждения Nemotron‑70B‑Reward. Инфраструктура — NeMo‑Aligner с ускорением TRT‑LLM.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

Семейство рассуждающих моделей, полученных из Llama 3.x методами NAS, дистилляции и расширенного постобучения.[11]

Модель Параметры Базовая модель Контекст
Llama‑Nemotron‑Nano 8B 8 млрд Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 млрд Minitron 4B (из Llama 3.1 8B) 128K
Llama‑Nemotron‑Super 49B 49 млрд Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 млрд Llama‑3.1‑405B → NAS (Puzzle) 128K

Пятиэтапный конвейер обучения: (1) NAS + FFN Fusion, (2) дистилляция + продолженное предобучение, (3) SFT (включая трассы рассуждений DeepSeek‑R1), (4) масштабное RL (GRPO для Ultra, REINFORCE/RLOO + Online RPO для Nano), (5) выравнивание для диалога.[11]

Модели первыми среди открытых LLM поддерживают переключаемый режим рассуждений (reasoning toggle): при включении («detailed thinking on» в системном промпте) модель генерирует цепочку рассуждений в тегах <think>...</think> перед ответом; при выключении — отвечает напрямую.[11]

Результаты Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Для сравнения: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra размещается на одном узле 8×H100.[11]

Nemotron‑H (апрель 2025)

Семейство плотных гибридных моделей, обученных с нуля и спроектированных для задач с длинными генерациями. Nemotron‑H‑56B обучен на 20 трлн токенов в FP8 — один из крупнейших публичных экспериментов по FP8‑предобучению. Nemotron‑H‑47B получен сжатием 56B методом MiniPuzzle (63 млрд токенов дистилляции) и помещается в память одной RTX 5090 (FP4) при контексте ~1M токенов.[12]

Бенчмарк Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60,5 61,8 58,8 51,3
MMLU (5‑shot) 84,2 83,6 86,1 78,8
GSM8K (8‑shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0‑shot) 60,4 61,0 56,7 57,3

Источник: arXiv:2504.03624.[12]

При генерации с 65 536 входными и 1024 выходными токенами на H100 модель Nemotron‑H‑47B работала в 2,9 раза быстрее, чем Qwen‑2.5‑72B и Llama‑3.1‑70B.[12]

Nemotron Nano 2 (август 2025)

Гибридная Mamba‑Transformer модель для рассуждений. Nemotron‑Nano‑12B‑v2‑Base — родительская модель с 62 слоями (преимущественно Mamba‑2 + MLP + 4 слоя внимания), обученная на 20 трлн токенов в FP8 с нуля. Из неё методом расширенного Minitron получена Nemotron‑Nano‑9B‑v2, способная работать в контексте 128K токенов на одном GPU NVIDIA A10G (22 ГБ, BF16). Постобучение: SFT (80 млрд токенов, включая трассы DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. На бенчмарках рассуждений модель сопоставима с Qwen3‑8B по точности, но достигает 3–6‑кратного ускорения генерации при длинных выходных последовательностях.[13]

Nemotron 3 Nano 30B‑A3B

Выпущена в декабре 2025 года. Параметры: 31,6 млрд всего, 3,2 млрд активных. Архитектура: 52 слоя, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 маршрутизируемых экспертов + 1 общий, 6 активных на токен. Контекст — до 1 048 576 токенов. Обучение на 25 трлн токенов (WSD‑расписание, batch size 3072, cutoff данных — июнь 2025) в две фазы: Phase 1 — 23,5 трлн (разнообразные данные), Phase 2 — 1,5 трлн (высококачественные данные) + 121 млрд токенов long‑context CPT.[2]

Бенчмарк Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE‑Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena‑Hard‑V2 Avg 67,65 57,8 48,55
RULER‑100 @ 1M 86,34 77,5

* — значения из вторичных источников; условия воспроизведения — NeMo Evaluator SDK. Источник: arXiv:2512.20848.[2][28]

Пропускная способность (8K вход / 16K выход, single H200): в 3,3 раза выше Qwen3‑30B‑A3B‑Thinking и в 2,2 раза выше GPT‑OSS‑20B.[2]

Дополнительные модели и направления

  • OpenReasoning‑Nemotron (июль 2025) — серия моделей 1,5B–32B параметров, основанных на Qwen 2.5 и дообученных на данных DeepSeek‑R1‑0528. Вариант 32B с GenSelect@64 превосходит o3 (high) на ряде математических бенчмарков.[29]
  • Nemotron Elastic (arXiv:2511.16664) — фреймворк вложенных подмоделей (6B, 9B, 12B) в рамках одной родительской модели, снижающий стоимость обучения в 360 раз по сравнению с обучением с нуля.[30]
  • Nemotron‑CrossThink — фреймворк мультидоменного обучения с подкреплением за пределами математических задач, обеспечивший +30,1 % на MATH‑500 и +12,8 % на MMLU‑PRO.[31]
  • Nemotron‑UltraLong — расширение контекста до 4 млн токенов.[32]
  • Jet‑Nemotron — постобучающий NAS для компактных гибридных моделей 2B/4B.[33]

Специализированные модели

В экосистеме Nemotron также присутствуют модели для специализированных задач:

  • Nemotron Nano V2 VL — vision‑language модель для OCR, обработки таблиц и видео.[34]
  • Nemotron Parse 1.1 — модель для OCR и извлечения структуры документов.[35]
  • Nemotron ColEmbed V2 — модель эмбеддингов для визуального поиска документов (late interaction).[36]
  • Nemotron Speech — модели для автоматического распознавания речи (ASR), синтеза речи (TTS) и машинного перевода (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — модель классификации небезопасного контента по 23 категориям на 9 языках с точностью 84,2 %.[37]

Данные для предобучения

Состав данных Nemotron‑4

Предобучающий корпус Nemotron‑4 15B и 340B состоит из трёх основных категорий: английские тексты (70 %), многоязычные тексты на 53 языках (15 %) и исходный код на 43 языках программирования (15 %). Применялась дедупликация на уровне документов (exact и near‑duplicate), а также фильтрация с помощью языковых моделей и эвристик. Модель 15B обучена на 8 трлн токенов, модель 340B — на 9 трлн (8 трлн предобучение + 1 трлн продолженное обучение с перевзвешиванием высококачественных источников).[8][3]

Nemotron‑CC

Набор данных Nemotron‑CC сформирован из Common Crawl с использованием ансамбля классификаторов качества и синтетического перефразирования текстов. Общий объём — 6,3 трлн токенов (4,4 трлн дедуплицированных + 1,9 трлн синтетических переформулировок). Пайплайн интегрирован в инструмент NeMo Curator. Работа принята как Long Paper на конференции ACL 2025.[38]

Nemotron‑CC‑Math

Математически‑ориентированный поднабор объёмом 133 млрд токенов, извлечённый из Common Crawl с помощью пайплайна Lynx + LLM с сохранением структуры математических формул и кода в LaTeX.[39]

Данные Nemotron 3 Nano

Предобучение Nemotron 3 Nano выполнено на 25 трлн токенов. Набор включает: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 и специализированные STEM‑датасеты. Для long‑context обучения использованы дополнительные 121 млрд токенов CPT.[2]

Nemotron Pretraining Dataset v1

Синтетически сгенерированный набор, охватывающий STEM, академические тексты, задачи рассуждения и многоязычные домены; содержит более 10 трлн языковых токенов и 18 млн образцов для SFT. Все наборы данных распространяются по открытым разрешительным лицензиям.[40]

Конвейер синтетической генерации данных (SDG)

Конвейер, описанный в отчёте о Nemotron‑4 340B, включает следующие этапы[3]:

  • Генерация промптов: синтетические одно‑ и двухоборотные запросы, сгенерированные при помощи Mixtral‑8x7B‑Instruct‑v0.1 (лицензия Apache 2.0) по шаблонам Open QA, Writing, Closed QA, Math & Coding.
  • Генерация ответов: множественные ответы от промежуточных версий моделей для обеспечения разнообразия.
  • Оценка качества: три подхода — Ground‑Truth‑as‑a‑Judge (для задач с проверяемым ответом), LLM‑as‑Judge (сравнение пар ответов языковой моделью), Reward‑Model‑as‑Judge (использование Nemotron‑4‑340B‑Reward).
  • Итеративное выравнивание от слабых к сильным моделям (weak‑to‑strong).

Из ~20 000 аннотированных человеком примеров (10 000 для SFT, 10 000 HelpSteer2 для модели вознаграждения) был синтезирован весь остальной объём данных выравнивания.[3]

Квантизация и оптимизация инференса

Модели Nemotron 3 Nano поддерживают Post‑Training Quantization (PTQ) в FP8 с использованием ModelOpt и Megatron‑LM. Применяется selective quantization — слои attention и часть Mamba сохраняются в BF16 для сохранения качества; остальные квантизуются в FP8. Согласно техническому отчёту, это обеспечивает ~99 % retention точности.[2] Nano также поддерживает инференс в формате NVFP4.[1]

Сводная таблица бенчмарков по поколениям

Модель MMLU GSM8K HumanEval Arena Hard MT‑Bench Условия
Nemotron‑4 15B 64,2 % 46,0 % 31,6 % base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81,1 % 57,3 % 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78,7 % 92,3 % 73,2 % 54,2 8,22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85,0 8,98 окт. 2024
LN‑Ultra 253B (reasoning ON) GPQA 76,0 %, AIME 80,8 %
Nemotron‑H‑47B 83,6 % 93,3 % 61,0 % 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67,7 (v2) AIME25 89,1 %, LCB 68,3 %

Сравнение следует интерпретировать с осторожностью: условия оценки, версии бенчмарков и даты проведения тестов различаются между поколениями. Результаты взяты из технических отчётов NVIDIA; независимые оценки могут отличаться (см. раздел «Ограничения»).[8][3][9][11][12][2]

Применение

Развёртывание через NVIDIA NIM

NVIDIA NIM — набор оптимизированных контейнерных микросервисов для инференса с OpenAI‑совместимым API. Модели Nemotron доступны как NIM‑микросервисы на платформе build.nvidia.com. NIM поддерживает форматы FP8, BF16, NVFP4 и развёртывание через Helm‑чарты на Kubernetes. Модели также совместимы с независимыми фреймворками: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

Синтетическая генерация данных

Nemotron‑4 340B спроектирован для использования в качестве генератора синтетических данных: модель Instruct генерирует ответы, модель Reward оценивает и фильтрует их. Лицензия NVIDIA Open Model License явно разрешает использование выходов модели для обучения других моделей. По данным ServiceNow, 15 % предобучающих данных их модели Apriel 1.6 получены из наборов данных Nemotron.[3][15][41]

Агентные системы

Модели семейства Nemotron 3 (Nano, Super, Ultra) предназначены для многоагентных рабочих нагрузок: планирование, retrieval, вызов инструментов (tool use). Nemotron 3 Nano демонстрирует результат 38,76 % на SWE‑Bench (с OpenHands) и 49,04 % (avg) на TauBench V2.[2]

Корпоративные внедрения

Среди заявленных партнёров: ServiceNow (совместная модель Apriel Nemotron 15B для автоматизации рабочих процессов), CrowdStrike (платформа Charlotte AI), Perplexity (маршрутизация запросов), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Модели доступны на AWS Amazon Bedrock; планируется поддержка Google Cloud, CoreWeave, Nebius.[15]

Ограничения и открытые проблемы

Независимые оценки и расхождения с данными NVIDIA

Независимые оценки выявляют расхождения с результатами, приводимыми NVIDIA. По данным Artificial Analysis (февраль 2026), Llama‑Nemotron‑Ultra 253B (reasoning) получила оценку Intelligence Index 15 при медиане 26 для моделей сопоставимого размера. На платформе Chatbot Arena (LMArena) модели Nemotron занимают позиции в середине рейтинга: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147‑я позиция), Nemotron 3 Nano — 1317 ±6 (~164‑я позиция).[42][43]

Многословность

Модели Nemotron демонстрируют повышенную многословность: при оценке Artificial Analysis модель Nemotron 3 Nano сгенерировала 140 млн токенов (при медиане 12 млн для других моделей), что увеличивает стоимость инференса. Анализ DEV Community выявил, что Llama‑3.1‑Nemotron‑70B‑Instruct при формальном лидерстве на автоматических бенчмарках демонстрировала недостаточную точность в ряде практических задач, а высокие оценки на Arena‑подобных бенчмарках могли объясняться предпочтением многословных и уверенных, но не обязательно точных ответов.[42][44]

Галлюцинации и bias

NVIDIA в модельных карточках указывает, что модели могут «усиливать предвзятости и генерировать токсичные ответы, особенно при токсичных промптах», а также «производить неточную информацию, опускать ключевые детали». Открытость весов и данных позволяет внешний аудит.[11][13]

Вычислительные требования

Плотные модели (Nemotron‑4 340B) требуют кластера из 768 узлов DGX H100 для полного обучения, что ограничивает воспроизводимость для академических групп без доступа к аналогичной инфраструктуре. Длинный контекст (1M) при инференсе требует значительного объёма VRAM.[3][2]

Деградация при расширении контекста

При расширении контекста до сверхдлинных последовательностей наблюдалась деградация результатов на бенчмарках с коротким контекстом.[32]

Квантизация гибридных архитектур

Использование сверхнизкой разрядности (FP8/NVFP4) в архитектурах Mamba‑Transformer приводит к небольшому падению точности (~1 % на ряде бенчмарков). Данная проблема решается применением selective quantization, что усложняет архитектуру компиляторов и инференс‑серверов.[2][1]

Прочие открытые проблемы

  • Зависимость от бенчмарков с возможной контаминацией обучающих данных.
  • Отсутствие стандартизированных протоколов сравнения гибридных SSM‑Transformer архитектур с чистыми Transformer‑моделями.
  • Вопрос масштабируемости MoE‑подхода на задачах, требующих глубокого рассуждения с малым числом экспертов на токен.
  • Данные о Super/Ultra на момент декабря 2025 года предварительны; полные бенчмарки ожидаются после релиза.[1]

Этические и регуляторные аспекты

Безопасность на этапе разработки

На этапе разработки применяются: оценка по фреймворку AEGIS (13 категорий контентной безопасности), сканер уязвимостей garak, ручное «красное тестирование» (red‑teaming).[37]

Безопасность на этапе вывода

NeMo Guardrails — открытый инструментарий (лицензия Apache 2.0), добавляющий программируемые барьеры к LLM‑системам. Микросервис перехватывает входы и выходы, применяя конфигурируемые проверки: контроль темы, обнаружение PII, верификация «заземления» RAG, обнаружение jailbreak‑атак (включая защиту от инъекций кода на основе YARA), мультиязычную мультимодальную классификацию безопасности.[45]

Для Nemotron 3 опубликован набор из ~11 000 размеченных трасс OpenTelemetry из реалистичных сценариев с использованием инструментов, предназначенных для оценки агентной безопасности.[1]

Лицензирование

Модели Лицензия
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (наследуется от Meta)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License разрешает коммерческое использование, создание и распространение производных работ, не требует атрибуции (при сохранении файла NOTICE), не предъявляет ограничений на число пользователей и явно разрешает использование выходов модели для обучения других моделей.[46] Модели на базе Llama наследуют ограничения Meta, включая порог в 700 млн ежемесячных активных пользователей.[11]

Для Nemotron 3 Nano NVIDIA опубликовала: веса модели, более 10 трлн токенов обучающих данных, рецепты обучения, кодовые базы (NeMo, Megatron‑LM, NeMo‑Aligner), более 10 сред обучения с подкреплением с 900 000+ задач.[1][2]

Перспективы и направления исследований

Ближайшие релизы включают Nemotron 3 Super (~100 млрд параметров, ~10 млрд активных) и Nemotron 3 Ultra (~500 млрд, ~50 млрд активных), ожидаемые в первой половине 2026 года. Обе модели будут использовать LatentMoE, MTP и обучение в формате NVFP4 на архитектуре Blackwell.[1]

Стратегическое направление NVIDIA — позиционирование Nemotron не как единичной модели, а как инфраструктурного слоя для мультиагентных систем, где различные модели семейства используются для разных задач с маршрутизацией по сложности.[1][15]

Основные исследовательские направления:

  • Развитие гибридных архитектур — дальнейшая интеграция SSM‑слоёв с механизмом внимания для масштабируемого длинного контекста.[12]
  • Многоуровневые методы сжатия — развитие Minitron, Puzzle, MiniPuzzle и Nemotron Elastic.[20][21][30]
  • Мультидоменное обучение с подкреплением — Nemotron‑CrossThink для расширения RL за пределы математических задач.[31]
  • Расширение контекста — Nemotron‑UltraLong до 4 млн токенов.[32]
  • Мультимодальность — расширение в область vision‑language (Nemotron VL), речи (Nemotron Speech), визуального поиска документов (Nemotron ColEmbed V2).[34][35][36]
  • Компактные гибридные модели — Jet‑Nemotron (NAS для моделей 2B/4B).[33]
  • Открытые рецепты — публикация полных рецептов обучения и данных для воспроизведения и кастомизации сообществом.[14]

См. также

Ссылки

Литература

Примечания

  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2,00 2,01 2,02 2,03 2,04 2,05 2,06 2,07 2,08 2,09 2,10 2,11 2,12 2,13 2,14 2,15 2,16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3,00 3,01 3,02 3,03 3,04 3,05 3,06 3,07 3,08 3,09 3,10 3,11 3,12 3,13 3,14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4,0 4,1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8,0 8,1 8,2 8,3 8,4 8,5 8,6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9,0 9,1 9,2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10,0 10,1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11,0 11,1 11,2 11,3 11,4 11,5 11,6 11,7 11,8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12,0 12,1 12,2 12,3 12,4 12,5 12,6 12,7 12,8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13,0 13,1 13,2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14,0 14,1 14,2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15,0 15,1 15,2 15,3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20,0 20,1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21,0 21,1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27,0 27,1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30,0 30,1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31,0 31,1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32,0 32,1 32,2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33,0 33,1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34,0 34,1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35,0 35,1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36,0 36,1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37,0 37,1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42,0 42,1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/