Nemotron (NVIDIA) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — 개방형 가중치를 갖는 대형 언어 모델(Large Language Model, LLM) 패밀리로, NVIDIA 산하 Applied Deep Learning Research(ADLR) 부서에서 개발하였다. 이 모델들은 Machine Learning 및 자연어 처리(Natural Language Processing, NLP) 분야에 속하며, 합성 데이터 생성, 논리적 추론(reasoning), 에이전트 기반 응용(agentic AI), NVIDIA 산업용 하드웨어 배포 등 광범위한 과제를 위해 설계되었다. 이 패밀리는 다양한 아키텍처와 규모의 모델을 포함한다: 40억에서 약 5,000억 파라미터에 이르며, Nemotron‑4 시리즈(2024)의 밀집형(dense) decoder‑only Transformer 모델, 하이브리드 Mamba‑Transformer(Nemotron‑H, 2025), 그리고 Nemotron 3 시리즈(2025)의 Mixture-of-Experts(MoE)를 결합한 하이브리드 Mamba‑Transformer가 포함된다. 2026년 3월 기준으로 이 패밀리는 텍스트 생성, 추론, 문서 시각적 이해, 정보 추출, 응답 품질 평가 과제를 아우르는 20개 이상의 모델로 구성되어 있다. 모델들은 주로 NVIDIA Open Model License 및 Llama Community License에 따라 개방형 가중치로 공개된다.[1][2][3]

역사 및 배경

Nemotron 패밀리의 개발은 생성형 AI를 위한 완전한 도구 스택을 구축하려는 NVIDIA의 전략적 맥락에서 이루어지고 있다: 학습 인프라(DGX, GPU H100/B200 기반 슈퍼컴퓨터)부터 학습 플랫폼(NeMo Framework), 정렬 플랫폼(NeMo‑Aligner), 배포 플랫폼(NIM — NVIDIA Inference Microservices), 안전성 보장(NeMo Guardrails)까지 망라한다.[4][5]

Nemotron‑3 8B (2023)

시리즈의 첫 번째 공개 모델로, 80억 파라미터와 4096 토큰 컨텍스트를 가진 decoder Transformer로서 53개 자연어와 37개 프로그래밍 언어로 구성된 3조 8,000억 토큰으로 학습되었다. 학습은 1024개의 A100 GPU에서 19일간 진행되었다. arXiv에 공식 기술 보고서는 게재되지 않았다. 모델은 NeMo Framework와 Hugging Face를 통해 배포되었으며, Chat(SFT 및 SteerLM) 변형도 존재하였다. 라이선스 — NVIDIA AI Foundation Models Community License.[6][7]

명칭에 관한 주의: 2023년의 «Nemotron‑3»과 2025년 12월의 «Nemotron 3»은 서로 다른 모델이다. 전자는 초기 프로토타입이었으며, 후자는 MoE 아키텍처를 갖춘 현재 세대 모델이다.

Nemotron‑4 15B (2024년 2월)

Nemotron‑4 시리즈의 첫 번째 공식 문서화 릴리스로, 150억 파라미터를 가진 모델이며 384개의 DGX H100 노드(최대 3,072개의 GPU)에서 약 13 역일 동안 8조 토큰으로 학습되었다. 8배 텐서 병렬화와 96에서 288까지의 데이터 병렬화가 사용되었다. 배치 크기 384에서의 최대 MFU(Model FLOPs Utilization)는 34.3%였다. 아키텍처 — Grouped‑Query Attention(GQA)과 Rotary Position Embeddings(RoPE)를 갖춘 decoder‑only Transformer. 발표 당시 벤치마크 결과에서 이 모델은 동일 크기급의 모든 공개 모델을 다국어 과제에서 능가했으며, 크기가 4배 더 큰 일부 모델도 상회하였다.[8]

Nemotron‑4 340B (2024년 6월)

2024년 6월, Nemotron‑4 시리즈의 가장 대형 모델이 출시되었다 — 3,400억 파라미터(임베딩 제외 3,316억), 9조 토큰(사전학습 8조 + 고품질 소스 재가중치 적용 지속 학습 1조)으로 사전학습되었다. 학습은 768개의 DGX H100 노드(최대 6,144개의 GPU)에서 2023년 12월부터 2024년 5월까지 최대 MFU 42.4%로 진행되었다. 패밀리에는 세 가지 변형이 포함된다: Base, Instruct, Reward. 모델 크기는 FP8 정밀도 형식으로 배포 시 단일 DGX H100 노드(GPU 8개)에 탑재될 수 있도록 설계되었다. 정렬(alignment)에 사용된 데이터의 98% 이상이 반복적 프로세스를 통해 시리즈 모델 자체에 의해 합성으로 생성되었으며, 합성 데이터 생성 파이프라인은 재현 가능하도록 공개되었다.[3]

Llama‑3.1‑Nemotron‑70B (2024년 10월)

2024년 10월, Meta Llama‑3.1‑70B‑Instruct로부터 미세조정된 모델이 출시되었다: Llama‑3.1‑Nemotron‑70B‑Instruct와 Llama‑3.1‑Nemotron‑70B‑Reward. 2024년 10월 1일 기준으로 Instruct 모델은 세 가지 자동 벤치마크에서 동시에 1위를 차지하였다: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench(GPT‑4‑Turbo) — 8.98. Reward 모델은 RewardBench에서 94.1%를 달성하였다.[9][10]

하이브리드 아키텍처로의 전환 (2025)

2025년에는 Mamba‑2 레이어(State Space Model, SSM — 상태 공간 모델)와 Transformer를 결합한 하이브리드 아키텍처로 시리즈가 확장되었다. 2025년 3월~5월에는 전환 가능한 추론 모드를 갖춘 추론 모델 패밀리 Llama‑Nemotron(Nano 8B, Super 49B, Ultra 253B)이 출시되었다.[11] 2025년 4월에는 8B, 56B, 47B 파라미터 규모의 하이브리드 Mamba‑Transformer 모델 패밀리 Nemotron‑H(arXiv:2504.03624)가 발표되었다.[12] 2025년 8월에는 Nemotron Nano 2(9B‑v2, arXiv:2508.14444)가 공개되었다.[13]

Nemotron 3 (2025년 12월)

2025년 12월 15일, 세 번째 세대가 발표되었다 — Nano, Super, Ultra 모델을 포함하는 Nemotron 3 패밀리로, Mamba‑2, Transformer, MoE 아키텍처를 최대 100만 토큰의 컨텍스트 창과 결합하였다. Nano는 기술 보고서와 함께 출시되었으며, Super와 Ultra는 2026년 상반기 출시 예정이다.[1][2][14][15]

이론적 기초

Nemotron‑4의 Transformer 아키텍처

Nemotron‑4 시리즈 모델들은 인과적 어텐션을 갖춘 표준 decoder Transformer 아키텍처를 기반으로 한다. 토큰 시퀀스의 확률 x1,x2,,xT은 다음과 같이 인수분해된다:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

여기서 θ은 모델의 파라미터이다.[8]

어텐션 메커니즘은 Grouped‑Query Attention(GQA)[16] 방식으로 구현된다:

Attention(Q,K,V)=softmax(QKdk)V,

여기서 Q,K,V는 쿼리, 키, 값 행렬이며, dk은 어텐션 헤드의 차원이다.

위치 인코딩에는 Rotary Position Embeddings(RoPE)[17]가 사용된다:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

여기서 xm은 위치 m의 벡터이며, θi=100002i/d, d은 벡터의 차원이다.

MLP 레이어에는 Squared ReLU 활성화 함수가 사용된다: f(x)=(max(0,x))2, 이는 활성화의 희소성을 보장한다. 모델들은 편향(bias)을 포함하지 않으며, dropout을 사용하지 않고, 입출력 임베딩 행렬은 서로 연결되지 않는다(untied embeddings). 토크나이저 — 공백 보존, 숫자 문자 단위 분리, 바이트 단위 fallback을 갖춘 SentencePiece BPE이며, 어휘 크기는 256,000이다.[8][3]

Nemotron‑4 아키텍처 파라미터
파라미터 Nemotron‑4 15B Nemotron‑4 340B
파라미터 수 150억 (임베딩 32억) 3,400억 (임베딩 94억)
레이어 수 32 96
은닉 차원 6144 18 432
어텐션 헤드 48 96
KV‑헤드 (GQA) 8 8
컨텍스트 길이 4096 4096
어휘 크기 256 000 256 000

출처: arXiv:2402.16819, arXiv:2406.11704.[8][3]

하이브리드 Mamba‑Transformer 아키텍처 (Nemotron‑H)

Nemotron‑H 모델에서는 표준 자기 어텐션 블록이 부분적으로 Mamba‑2 블록 — 상태 공간 모델(State Space Models, SSM)로 대체되었다. 자기회귀 생성 시 각 자기 어텐션 레이어는 단계당 O(n)의 연산과 메모리를 필요로 하는 반면(KV 캐시로 인해), Mamba 레이어는 생성되는 각 토큰마다 일정한 메모리와 연산 비용을 보장한다.[12]

Mamba‑2는 다음과 같은 순환 관계식으로 기술된다[18]:

ht=Aht1+Bxt,yt=Cht,

여기서 htN는 은닉 상태, AN×N은 대각 상태 전이 행렬, BN×1C1×N은 투영 행렬, xt는 입력 토큰, yt은 출력 신호이다. Mamba‑2에서 행렬 A, B, C은 입력에 의존적(input‑dependent)이며, 이는 고전적인 선형 SSM과 구별된다.

Nemotron‑H‑56B에는 Mamba‑2 레이어 54개 + MLP 레이어 54개 + 자기 어텐션 레이어 10개가 사용되며, 어텐션 레이어는 Mamba 레이어 사이에 균등하게 배치된다. 이 모델은 6,144개의 H100 GPU에서 FP8(per‑tensor scaling) 형식으로 20조 토큰을 학습하였다. Nemotron‑H‑8B 버전은 Mamba‑2 레이어 24개, MLP 레이어 24개, 자기 어텐션 레이어 4개를 포함하며, 15조 토큰으로 학습되었다.[12]

Nemotron 3의 MoE 아키텍처

Nemotron 3(2025년 12월) 모델들은 Mamba‑2, Transformer, Mixture‑of‑Experts의 세 가지 아키텍처 구성요소를 결합한다.[1][2] Nemotron 3 Nano(30B‑A3B)는 52개 레이어로 구성된다: Mamba‑2 + MoE 레이어 23개, MoE 레이어 23개, GQA 어텐션 레이어 6개. 각 MoE 레이어에는 128개의 라우팅 가능(routed) 전문가 + 1개의 공유(shared) 전문가가 포함되며, 각 토큰마다 6개의 전문가가 활성화된다. 라우팅은 sigmoid gating을 갖춘 학습 가능한 MLP 라우터에 의해 수행된다. 부하 균형은 보조 손실 함수 없이(aux‑loss‑free) 구현된다. 전체 파라미터 수는 316억이지만, 각 토큰마다 활성화되는 파라미터는 32억에 불과하다.[2]

정규화 — RMSNorm[19]. Mamba 부분에서는 위치 임베딩이 없으며(위치 정보는 SSM 상태에 암묵적으로 포함됨). 비연결 임베딩(untied embeddings)이 사용되며, 선형 레이어에서 dropout과 bias가 없다.[2]

Super/Ultra의 확장: LatentMoE와 Multi‑Token Prediction

Nemotron 3 패밀리의 Super와 Ultra 모델은 두 가지 추가적인 아키텍처 혁신을 적용한다:

  • Latent MoE (LatentMoE) — 라우팅 전에 입력 표현을 더 낮은 차원의 잠재 공간으로 투영하여, 처리량 감소 없이 전문가 수를 늘리고 정확도를 향상시킨다.[1]
  • Multi‑Token Prediction (MTP) — 여러 다음 토큰을 동시에 예측하며, 긴 텍스트 품질 개선과 추론 시 투기적 디코딩(speculative decoding)에 활용된다.[1]

Super와 Ultra의 학습은 Blackwell 아키텍처에서 NVIDIA의 4비트 수치 형식인 NVFP4 형식으로 진행된다.[1]

모델 압축 방법: Minitron, Puzzle, MiniPuzzle

컴팩트한 모델 제작을 위해 NVIDIA는 여러 접근 방식을 적용한다:

  • Minitron — 구조적 가지치기(pruning)와 지식 증류(knowledge distillation) 방법. 두 종류의 프루닝이 연구된다: 깊이 기준(레이어 제거)과 너비 기준(은닉 레이어 차원, 어텐션 헤드, MLP 투영의 공동 축소). Nemotron‑4 15B에 Minitron을 적용하면 처음부터 학습하는 것과 비교해 최대 40배 학습 비용을 줄인 8B 및 4B 모델을 얻을 수 있다.[20]
  • Puzzle — 블록 단위 증류를 통해 각 블록의 최적 구성(KV 헤드 수, FFN 크기, 어텐션 유무)을 탐색하는 Neural Architecture Search(NAS) 알고리즘. 바로 이 방법을 통해 Llama 3.1 405B가 253B(Llama‑Nemotron Ultra)로, Llama 3.3 70B가 49B(Llama‑Nemotron Super)로 압축되었다.[21]
  • MiniPuzzle — 하이브리드 아키텍처를 위한 Puzzle의 확장으로, 단 630억 토큰의 증류로 Nemotron‑H‑56B를 47B로 압축하였다. 유사한 정확도에서 압축된 모델은 20% 더 빠르게 추론한다.[12]

정렬 방법

HelpSteer와 HelpSteer2

HelpSteer — Scale AI와 협력하여 제작된 37,120개 예시의 데이터셋(CC‑BY‑4.0 라이선스)으로, 각 응답이 리커트 척도 0~4로 다섯 가지 속성에 따라 주석 처리되어 있다: 유용성(helpfulness), 정확성(correctness), 일관성(coherence), 복잡성(complexity), 장황성(verbosity).[22]

HelpSteer2 — 21,362개 예시(10,681개 프롬프트 × 2개 응답)의 갱신된 데이터셋으로, 프롬프트의 95% 이상이 ShareGPT(실제 사용자 요청)에서 가져왔다. 주석의 약 50%는 품질이 충분하지 않다고 판단되어 필터링되었다. HelpSteer2‑Preference 확장은 주석자의 쌍별 선호도를 추가하여, 동일한 데이터로 회귀 및 쌍별 보상 모델을 모두 학습할 수 있게 한다.[23][24]

SteerLM

SteerLM — 속성(helpfulness, correctness, coherence, complexity, verbosity)에 조건부로 설정된 SFT(Supervised Fine‑Tuning — 지도 미세조정) 방법으로, 사용자가 추론 시 응답 스타일을 제어할 수 있게 한다. 파이프라인은 다음을 포함한다: (1) HelpSteer로 속성 예측 모델(APM) 학습, (2) APM을 이용한 데이터 레이블링, (3) 목표 속성 값에 조건부 SFT, (4) 부트스트래핑.[25]

DPO와 RPO

DPO (Direct Preference Optimization) — 명시적 보상 모델 없이 직접 선호도를 최적화하는 방법으로, Nemotron‑4 340B Instruct 및 Nemotron Nano 2 파이프라인에서 사용된다.[26]

RPO (Reward‑aware Preference Optimization) — DPO, IPO, SimPO, REINFORCE, SteerLM 2.0을 특수 사례로 일반화하는 NVIDIA의 통합 수학적 프레임워크이다. RPO는 암묵적 보상 모델의 예측과 명시적 목표 모델 사이의 거리를 최소화한다[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

여기서 rϕ는 명시적 보상 모델, πθ은 학습 가능한 정책, πref은 참조 정책, d(,)은 거리 함수, yw/yl은 선택된/거부된 응답이다. RPO는 Nemotron‑4 340B Instruct 및 Llama‑Nemotron 모델 학습에 적용된다.[27][3][11]

다중 환경 강화 학습 (RLVR)

Nemotron 3에서는 Multi‑environment RLVR(Reinforcement Learning from Verifiable Rewards)이 적용된다 — NeMo Gym 프레임워크 내 여러 환경에서의 동시 학습: 경쟁 수학, 프로그래밍, QA, tool‑use, instruction‑following, long‑context. 알고리즘 — masked importance sampling을 적용한 GRPO(Group Relative Policy Optimization).[2][14]

Nemotron 3는 세분화된 추론 예산 제어(reasoning budget control)를 지원한다: 사용자는 chat template의 플래그를 통해 thinking trace의 토큰 한도를 설정할 수 있다(«detailed thinking on/off» 전환 또는 길이 제한).[2]

모델 라인업

종합 표

모델 연도 전체 / 활성 파라미터 컨텍스트 아키텍처 주요 특징
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3.8조 토큰; GPU A100 1,024개; 19일
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8조 토큰; MFU 34.3%
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9조 토큰; Base/Instruct/Reward; 정렬 데이터 >98% 합성
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94.1%
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) Llama 3.1 8B에서 NAS 압축
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Llama 3.3 70B에서
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Llama 3.1 405B에서; GPQA 76.0%
Nemotron‑H 8B 2025 8B / 8B 하이브리드 Mamba‑Transformer 15조 토큰; Mamba‑2 24개 + MLP 24개 + Attn 4개
Nemotron‑H 56B 2025 56B / 56B 하이브리드 Mamba‑Transformer 20조 토큰 FP8; Mamba‑2 54개 + MLP 54개 + Attn 10개
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) 하이브리드 Mamba‑Transformer 56B에서 MiniPuzzle; +20% 속도
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K 하이브리드 Mamba‑Transformer 20조 토큰; Minitron 증류
Nemotron 3 Nano 2025 31.6B / 3.2B 1M 하이브리드 Mamba‑Transformer MoE 25조 토큰; 전문가 128개, 활성 6개
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M 하이브리드 LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M 하이브리드 LatentMoE MTP; NVFP4

Nemotron‑4 15B

아키텍처: 32개 레이어, hidden dimension 6144, 어텐션 헤드 48개, KV‑헤드 8개(GQA). 전체 파라미터 수 — 150억(임베딩 32억 + 비임베딩 125억). 결과: MMLU — 64.2%(5‑shot), BBH — 58.7%(3‑shot), GSM8K — 46.0%(8‑shot, maj@1), HumanEval — 31.6%(0‑shot, pass@1). 다국어 벤치마크(XCOPA, TyDiQA‑GoldP, MGSM)에서 4배 더 큰 모델들을 능가하였다.[8]

Nemotron‑4 340B

아키텍처: 96개 레이어, hidden dimension 18 432, 어텐션 헤드 96개, KV‑헤드 8개.

Nemotron‑4 340B Base의 결과: MMLU — 81.1%(5‑shot), BBH — 85.4%(3‑shot), HumanEval — 57.3%(0‑shot), ARC‑Challenge — 94.3%(25‑shot).[3]

Nemotron‑4 340B Instruct는 다단계 정렬을 거쳤다: Code SFT → General SFT → DPO → RPO(3라운드). 결과: MT‑Bench — 8.22(GPT‑4‑Turbo judge), MMLU — 78.7%(0‑shot), GSM8K — 92.3%(0‑shot), HumanEval — 73.2%(0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%.[3]

Nemotron‑4 340B Reward는 최종 softmax 레이어를 마지막 레이어의 은닉 상태를 HelpSteer2의 5가지 속성 벡터로 투영하는 선형 투영으로 대체한다. 최종 보상은 다섯 가지 속성의 가중 합이다. 학습은 HelpSteer2 데이터(배치 크기 128)에서 2 에포크 진행되었다. RewardBench에서 모델은 92.0%를 달성하여 발표 당시 GPT‑4o(84.7%), Gemini 1.5 Pro(88.1%), Claude‑3‑Opus(80.7%)를 능가하였다.[3]

모델 Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54.2 41.5% 8.22
Llama‑3‑70B‑Instruct 41.1 34.4% 8.16
Mixtral‑8x22B‑Instruct 36.4 30.9% 7.63
Qwen‑2‑72B‑Instruct 48.1 38.8% 8.26

출처: arXiv:2406.11704, 표 5.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward는 Bradley‑Terry(쌍별 선호도)와 SteerLM 회귀(리커트 척도 다중 속성 평가)를 결합한 하이브리드 방법으로 학습되었다. 학습은 HelpSteer2(CC‑BY‑4.0) 데이터만으로 진행되었다. RewardBench에서 모델은 94.1%를 달성하여 발표 당시 1위를 차지하였다.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct는 REINFORCE 알고리즘(PPO 아님)과 Nemotron‑70B‑Reward 보상 모델을 사용한 RLHF 방법으로 정렬되었다. 인프라 — TRT‑LLM 가속을 갖춘 NeMo‑Aligner.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

NAS, 증류, 확장된 후처리 학습 방법을 사용하여 Llama 3.x로부터 파생된 추론 모델 패밀리이다.[11]

모델 파라미터 기반 모델 컨텍스트
Llama‑Nemotron‑Nano 8B 80억 Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 40억 Minitron 4B (Llama 3.1 8B에서) 128K
Llama‑Nemotron‑Super 49B 490억 Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 2,530억 Llama‑3.1‑405B → NAS (Puzzle) 128K

5단계 학습 파이프라인: (1) NAS + FFN Fusion, (2) 증류 + 지속적 사전학습, (3) SFT(DeepSeek‑R1의 추론 트레이스 포함), (4) 대규모 RL(Ultra의 경우 GRPO, Nano의 경우 REINFORCE/RLOO + Online RPO), (5) 대화를 위한 정렬.[11]

이 모델들은 공개 LLM 중 최초로 전환 가능한 추론 모드(reasoning toggle)를 지원한다: 활성화 시(시스템 프롬프트에 «detailed thinking on»), 모델은 응답 전 <think>...</think> 태그 내에 추론 체인을 생성하며; 비활성화 시에는 직접 응답한다.[11]

Llama‑Nemotron‑Ultra 253B의 결과(reasoning ON): GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%. 비교를 위해: DeepSeek‑R1(전체 671B / 활성 37B) — GPQA Diamond 71.5%, AIME 2024 ~79.8%. Ultra는 단일 노드 8×H100에서 운영된다.[11]

Nemotron‑H (2025년 4월)

긴 생성 과제를 위해 설계된 처음부터 학습된 밀집 하이브리드 모델 패밀리이다. Nemotron‑H‑56B는 FP8 형식으로 20조 토큰을 학습하였으며 — 공개된 FP8 사전학습 실험 중 가장 큰 규모 중 하나이다. Nemotron‑H‑47B는 56B를 MiniPuzzle 방법(630억 토큰 증류)으로 압축하여 얻었으며, 컨텍스트 ~1M 토큰에서 단일 RTX 5090(FP4) 메모리에 탑재된다.[12]

벤치마크 Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60.5 61.8 58.8 51.3
MMLU (5‑shot) 84.2 83.6 86.1 78.8
GSM8K (8‑shot CoT) 93.7 93.3 90.9 83.9
HumanEval (0‑shot) 60.4 61.0 56.7 57.3

출처: arXiv:2504.03624.[12]

H100에서 65,536개 입력 토큰과 1,024개 출력 토큰으로 생성 시 Nemotron‑H‑47B 모델은 Qwen‑2.5‑72B 및 Llama‑3.1‑70B보다 2.9배 빠르게 작동하였다.[12]

Nemotron Nano 2 (2025년 8월)

추론을 위한 하이브리드 Mamba‑Transformer 모델이다. Nemotron‑Nano‑12B‑v2‑Base — 62개 레이어(주로 Mamba‑2 + MLP + 어텐션 레이어 4개)를 가진 부모 모델로, FP8 형식으로 처음부터 20조 토큰을 학습하였다. 이 모델에서 확장된 Minitron 방법으로 Nemotron‑Nano‑9B‑v2가 파생되었으며, 단일 NVIDIA A10G GPU(22GB, BF16)에서 128K 토큰 컨텍스트로 작동할 수 있다. 후처리 학습: SFT(DeepSeek‑R1‑0528 트레이스 포함 800억 토큰) → GRPO → DPO → RLHF. 추론 벤치마크에서 이 모델은 Qwen3‑8B와 정확도가 비슷하지만, 긴 출력 시퀀스에서 3~6배의 생성 속도 향상을 달성한다.[13]

Nemotron 3 Nano 30B‑A3B

2025년 12월에 출시되었다. 파라미터: 전체 316억, 활성 32억. 아키텍처: 52개 레이어, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 라우팅 가능 전문가 128개 + 공유 전문가 1개, 토큰당 6개 활성화. 컨텍스트 — 최대 1,048,576 토큰. 25조 토큰(WSD 스케줄, 배치 크기 3072, 데이터 컷오프 — 2025년 6월)으로 2단계 학습: Phase 1 — 23.5조(다양한 데이터), Phase 2 — 1.5조(고품질 데이터) + long‑context CPT 1,210억 토큰.[2]

벤치마크 Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78.30 80.9 75.0
AIME25 (no tools) 89.06 85.0 91.7
AIME25 (with tools) 99.17 98.7
GPQA (no tools) 73.04 73.4 71.5
LiveCodeBench v6 68.25 66.0 61.0
SWE‑Bench (OpenHands) 38.76 22.0* 34.0
TauBench V2 Avg 49.04 47.7 47.5
Arena‑Hard‑V2 Avg 67.65 57.8 48.55
RULER‑100 @ 1M 86.34 77.5

* — 2차 출처의 값; 재현 조건 — NeMo Evaluator SDK. 출처: arXiv:2512.20848.[2][28]

처리량(8K 입력 / 16K 출력, 단일 H200): Qwen3‑30B‑A3B‑Thinking보다 3.3배, GPT‑OSS‑20B보다 2.2배 높다.[2]

추가 모델 및 방향

  • OpenReasoning‑Nemotron (2025년 7월) — Qwen 2.5를 기반으로 DeepSeek‑R1‑0528 데이터로 미세조정된 1.5B~32B 파라미터 모델 시리즈. GenSelect@64를 적용한 32B 변형은 일부 수학 벤치마크에서 o3(high)를 능가한다.[29]
  • Nemotron Elastic (arXiv:2511.16664) — 하나의 부모 모델 내에 중첩된 하위 모델(6B, 9B, 12B) 프레임워크로, 처음부터 학습하는 것과 비교해 학습 비용을 360배 절감한다.[30]
  • Nemotron‑CrossThink — 수학 과제를 넘어선 다중 도메인 강화 학습 프레임워크로, MATH‑500에서 +30.1%, MMLU‑PRO에서 +12.8%를 달성하였다.[31]
  • Nemotron‑UltraLong — 컨텍스트를 400만 토큰까지 확장.[32]
  • Jet‑Nemotron — 컴팩트한 하이브리드 모델 2B/4B를 위한 후처리 NAS.[33]

특화 모델

Nemotron 생태계에는 특화된 과제를 위한 모델도 포함된다:

  • Nemotron Nano V2 VL — OCR, 표 처리, 비디오 처리를 위한 vision‑language 모델.[34]
  • Nemotron Parse 1.1 — OCR 및 문서 구조 추출을 위한 모델.[35]
  • Nemotron ColEmbed V2 — 시각적 문서 검색을 위한 임베딩 모델(late interaction).[36]
  • Nemotron Speech — 자동 음성 인식(ASR), 음성 합성(TTS), 기계 번역(NMT)을 위한 모델.[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — 9개 언어에서 23개 카테고리에 걸쳐 정확도 84.2%로 안전하지 않은 콘텐츠를 분류하는 모델.[37]

사전학습 데이터

Nemotron‑4 데이터 구성

Nemotron‑4 15B와 340B의 사전학습 코퍼스는 세 가지 주요 범주로 구성된다: 영어 텍스트(70%), 53개 언어의 다국어 텍스트(15%), 43개 프로그래밍 언어의 소스 코드(15%). 문서 수준의 중복 제거(exact 및 near‑duplicate)와 언어 모델 및 휴리스틱을 이용한 필터링이 적용되었다. 15B 모델은 8조 토큰으로, 340B 모델은 9조 토큰(사전학습 8조 + 고품질 소스 재가중치 적용 지속 학습 1조)으로 학습되었다.[8][3]

Nemotron‑CC

Nemotron‑CC 데이터셋은 품질 분류기 앙상블과 텍스트의 합성 재구성을 사용하여 Common Crawl에서 구성되었다. 총 규모 — 6조 3,000억 토큰(중복 제거 4조 4,000억 + 합성 재구성 1조 9,000억). 파이프라인은 NeMo Curator 도구에 통합되었다. 이 연구는 ACL 2025 컨퍼런스에 Long Paper로 채택되었다.[38]

Nemotron‑CC‑Math

수학 공식과 코드의 LaTeX 구조를 보존하는 Lynx + LLM 파이프라인을 사용하여 Common Crawl에서 추출된 1,330억 토큰 규모의 수학 중심 하위 집합이다.[39]

Nemotron 3 Nano 데이터

Nemotron 3 Nano의 사전학습은 25조 토큰으로 수행되었다. 데이터셋에는 Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 및 특화된 STEM 데이터셋이 포함된다. long‑context 학습을 위해 추가적인 1,210억 토큰의 CPT가 사용되었다.[2]

Nemotron Pretraining Dataset v1

STEM, 학술 텍스트, 추론 과제, 다국어 도메인을 아우르는 합성 생성 데이터셋으로, 10조 개 이상의 언어 토큰과 1,800만 개의 SFT 샘플을 포함한다. 모든 데이터셋은 개방형 허용 라이선스 하에 배포된다.[40]

합성 데이터 생성(SDG) 파이프라인

Nemotron‑4 340B 보고서에 기술된 파이프라인은 다음 단계를 포함한다[3]:

  • 프롬프트 생성: Open QA, Writing, Closed QA, Math & Coding 템플릿을 기반으로 Mixtral‑8x7B‑Instruct‑v0.1(Apache 2.0 라이선스)을 사용하여 생성된 합성 단일/이중 턴 요청.
  • 응답 생성: 다양성 확보를 위한 중간 모델 버전의 다중 응답.
  • 품질 평가: 세 가지 접근법 — Ground‑Truth‑as‑a‑Judge(검증 가능한 답이 있는 과제), LLM‑as‑Judge(언어 모델에 의한 응답 쌍 비교), Reward‑Model‑as‑Judge(Nemotron‑4‑340B‑Reward 사용).
  • 약한 모델에서 강한 모델로의(weak‑to‑strong) 반복적 정렬.

인간이 주석 처리한 ~20,000개 예시(SFT용 10,000개, 보상 모델용 HelpSteer2 10,000개)로부터 나머지 모든 정렬 데이터가 합성되었다.[3]

양자화 및 추론 최적화

Nemotron 3 Nano 모델들은 ModelOpt와 Megatron‑LM을 사용한 FP8 Post‑Training Quantization(PTQ)을 지원한다. selective quantization이 적용된다 — 어텐션 레이어와 일부 Mamba 레이어는 품질 유지를 위해 BF16으로 유지되며, 나머지는 FP8로 양자화된다. 기술 보고서에 따르면, 이를 통해 정확도의 ~99%가 유지된다.[2] Nano는 NVFP4 형식의 추론도 지원한다.[1]

세대별 벤치마크 종합 표

모델 MMLU GSM8K HumanEval Arena Hard MT‑Bench 조건
Nemotron‑4 15B 64.2% 46.0% 31.6% base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81.1% 57.3% 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78.7% 92.3% 73.2% 54.2 8.22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85.0 8.98 2024년 10월
LN‑Ultra 253B (reasoning ON) GPQA 76.0%, AIME 80.8%
Nemotron‑H‑47B 83.6% 93.3% 61.0% 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67.7 (v2) AIME25 89.1%, LCB 68.3%

비교는 주의하여 해석해야 한다: 평가 조건, 벤치마크 버전, 테스트 수행 날짜가 세대 간에 다르다. 결과는 NVIDIA 기술 보고서에서 가져왔으며, 독립적인 평가와 다를 수 있다(«제한 사항» 절 참조).[8][3][9][11][12][2]

활용

NVIDIA NIM을 통한 배포

NVIDIA NIM은 OpenAI 호환 API를 갖춘 최적화된 컨테이너형 추론 마이크로서비스 집합이다. Nemotron 모델들은 build.nvidia.com 플랫폼에서 NIM 마이크로서비스로 제공된다. NIM은 FP8, BF16, NVFP4 형식 및 Kubernetes의 Helm 차트를 통한 배포를 지원한다. 모델들은 또한 독립적인 프레임워크와도 호환된다: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

합성 데이터 생성

Nemotron‑4 340B는 합성 데이터 생성기로 활용되도록 설계되었다: Instruct 모델이 응답을 생성하고, Reward 모델이 이를 평가 및 필터링한다. NVIDIA Open Model License는 다른 모델 학습을 위한 모델 출력 활용을 명시적으로 허용한다. ServiceNow에 따르면, 그들의 Apriel 1.6 모델의 사전학습 데이터 중 15%가 Nemotron 데이터셋에서 가져왔다.[3][15][41]

에이전트 시스템

Nemotron 3 패밀리 모델(Nano, Super, Ultra)은 다중 에이전트 워크로드를 위해 설계되었다: 계획, retrieval, 도구 호출(tool use). Nemotron 3 Nano는 SWE‑Bench(OpenHands 기반)에서 38.76%, TauBench V2에서 49.04%(평균)의 결과를 보였다.[2]

기업 도입

발표된 파트너로는 ServiceNow(워크플로우 자동화를 위한 공동 모델 Apriel Nemotron 15B), CrowdStrike(Charlotte AI 플랫폼), Perplexity(요청 라우팅), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom이 포함된다. 모델들은 AWS Amazon Bedrock에서 이용 가능하며, Google Cloud, CoreWeave, Nebius에 대한 지원도 계획되어 있다.[15]

제한 사항 및 미해결 문제

독립적인 평가와 NVIDIA 데이터와의 차이

독립적인 평가에서 NVIDIA가 제시한 결과와의 차이가 드러난다. Artificial Analysis(2026년 2월) 데이터에 따르면, Llama‑Nemotron‑Ultra 253B(reasoning)는 Intelligence Index 15를 받았으며, 동일 규모 모델의 중앙값은 26이다. Chatbot Arena(LMArena) 플랫폼에서 Nemotron 모델들은 중간 순위에 위치한다: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12(약 147위), Nemotron 3 Nano — 1317 ±6(약 164위).[42][43]

장황성

Nemotron 모델들은 높은 장황성을 보인다: Artificial Analysis 평가에서 Nemotron 3 Nano 모델은 1억 4,000만 토큰을 생성하였으며(다른 모델의 중앙값은 1,200만 토큰), 이는 추론 비용을 증가시킨다. DEV Community의 분석에 따르면, Llama‑3.1‑Nemotron‑70B‑Instruct는 자동 벤치마크에서 공식적으로 선두를 차지했지만 일부 실용적인 과제에서 정확도가 부족했으며, Arena 유사 벤치마크에서의 높은 점수는 반드시 정확하지는 않더라도 장황하고 자신감 있는 응답에 대한 선호 때문일 수 있다.[42][44]

환각과 편향

NVIDIA는 모델 카드에서 모델들이 «특히 독성 프롬프트에서 편향을 증폭시키고 독성 응답을 생성할 수 있으며», «부정확한 정보를 생성하거나 핵심 세부 사항을 누락할 수 있다»고 명시한다. 가중치와 데이터의 개방성은 외부 감사를 가능하게 한다.[11][13]

컴퓨팅 요구 사항

밀집형 모델(Nemotron‑4 340B)은 전체 학습을 위해 768개의 DGX H100 노드 클러스터가 필요하며, 이는 유사한 인프라에 접근할 수 없는 학술 그룹에게 재현성을 제한한다. 추론 시 긴 컨텍스트(1M)는 상당한 양의 VRAM을 필요로 한다.[3][2]

컨텍스트 확장 시 성능 저하

컨텍스트를 매우 긴 시퀀스로 확장할 때 짧은 컨텍스트 벤치마크에서 결과 저하가 관찰되었다.[32]

하이브리드 아키텍처의 양자화

Mamba‑Transformer 아키텍처에서 초저정밀도(FP8/NVFP4) 사용은 일부 벤치마크에서 소폭의 정확도 저하(~1%)를 유발한다. 이 문제는 selective quantization 적용으로 해결되지만, 컴파일러와 추론 서버의 아키텍처를 복잡하게 만든다.[2][1]

기타 미해결 문제

  • 학습 데이터의 오염 가능성이 있는 벤치마크에 대한 의존성.
  • 하이브리드 SSM‑Transformer 아키텍처와 순수 Transformer 모델의 표준화된 비교 프로토콜 부재.
  • 토큰당 소수의 전문가를 사용하는 심층 추론이 필요한 과제에서 MoE 접근법의 확장성 문제.
  • 2025년 12월 기준 Super/Ultra 데이터는 예비적이며, 출시 후 전체 벤치마크가 예정되어 있다.[1]

윤리적 및 규제적 측면

개발 단계의 안전성

개발 단계에서 다음이 적용된다: AEGIS 프레임워크(13개 콘텐츠 안전 카테고리) 기반 평가, garak 취약점 스캐너, 수동 «레드 팀 테스트»(red‑teaming).[37]

추론 단계의 안전성

NeMo Guardrails — LLM 시스템에 프로그래밍 가능한 가드레일을 추가하는 오픈 소스 도구(Apache 2.0 라이선스). 마이크로서비스는 입출력을 가로채어 구성 가능한 검사를 적용한다: 주제 제어, PII 감지, RAG «접지» 검증, jailbreak 공격 감지(YARA 기반 코드 인젝션 방지 포함), 다국어 멀티모달 안전 분류.[45]

Nemotron 3를 위해 도구 사용을 포함하는 현실적인 시나리오에서 생성된 약 11,000개의 레이블된 OpenTelemetry 트레이스 데이터셋이 에이전트 안전성 평가를 위해 공개되었다.[1]

라이선싱

모델 라이선스
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (Meta로부터 상속)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License는 상업적 사용, 파생물 제작 및 배포를 허용하며, 귀속 표시를 요구하지 않고(NOTICE 파일 유지 시), 사용자 수 제한이 없으며, 다른 모델 학습을 위한 모델 출력 활용을 명시적으로 허용한다.[46] Llama 기반 모델들은 월간 활성 사용자 7억 명 임계값을 포함한 Meta의 제한을 상속한다.[11]

Nemotron 3 Nano를 위해 NVIDIA는 다음을 공개하였다: 모델 가중치, 10조 토큰 이상의 학습 데이터, 학습 레시피, 코드베이스(NeMo, Megatron‑LM, NeMo‑Aligner), 900,000개 이상의 과제를 포함하는 10개 이상의 강화 학습 환경.[1][2]

전망 및 연구 방향

가까운 릴리스로는 2026년 상반기에 예정된 Nemotron 3 Super(~1,000억 파라미터, 활성 ~100억)와 Nemotron 3 Ultra(~5,000억, 활성 ~500억)가 포함된다. 두 모델 모두 LatentMoE, MTP, Blackwell 아키텍처에서 NVFP4 형식의 학습을 활용할 예정이다.[1]

NVIDIA의 전략적 방향은 Nemotron을 단일 모델이 아닌 다중 에이전트 시스템을 위한 인프라 레이어로 포지셔닝하는 것으로, 패밀리의 다양한 모델들이 복잡도에 따른 라우팅을 통해 서로 다른 과제에 사용된다.[1][15]

주요 연구 방향:

  • 하이브리드 아키텍처 발전 — 확장 가능한 장거리 컨텍스트를 위한 어텐션 메커니즘과 SSM 레이어의 추가 통합.[12]
  • 다단계 압축 방법 — Minitron, Puzzle, MiniPuzzle, Nemotron Elastic의 발전.[20][21][30]
  • 다중 도메인 강화 학습 — 수학 과제를 넘어 RL을 확장하기 위한 Nemotron‑CrossThink.[31]
  • 컨텍스트 확장 — Nemotron‑UltraLong으로 400만 토큰까지.[32]
  • 멀티모달리티 — vision‑language(Nemotron VL), 음성(Nemotron Speech), 시각적 문서 검색(Nemotron ColEmbed V2) 영역으로 확장.[34][35][36]
  • 컴팩트 하이브리드 모델 — Jet‑Nemotron(2B/4B 모델을 위한 NAS).[33]
  • 개방형 레시피 — 커뮤니티의 재현 및 커스터마이징을 위한 전체 학습 레시피와 데이터 공개.[14]

참고 항목

  • Transformer 아키텍처
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (Meta 모델 패밀리)

외부 링크

참고 문헌

각주

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/