Nemotron (NVIDIA) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — keluarga model bahasa besar (Large Language Model, LLM) dengan bobot terbuka yang dikembangkan oleh divisi Applied Deep Learning Research (ADLR) dari korporasi NVIDIA. Model-model ini termasuk dalam bidang machine learning dan pemrosesan bahasa alami (Natural Language Processing, NLP) dan dirancang untuk berbagai tugas: pembuatan data sintetis, penalaran (reasoning), aplikasi agentik (agentic AI), dan penerapan pada perangkat keras industri NVIDIA. Keluarga ini mencakup model dengan berbagai arsitektur dan skala: dari 4 miliar hingga ~500 miliar parameter, termasuk model decoder-only Transformer padat (dense) seri Nemotron-4 (2024), model Mamba-Transformer hibrida (Nemotron-H, 2025), dan model Mamba-Transformer hibrida dengan Mixture-of-Experts (MoE) dalam seri Nemotron 3 (2025). Per Maret 2026, keluarga ini memiliki lebih dari 20 model, mencakup tugas pembuatan teks, penalaran, pemahaman visual dokumen, ekstraksi informasi, dan evaluasi kualitas jawaban. Model-model ini diterbitkan terutama dengan bobot terbuka di bawah lisensi NVIDIA Open Model License dan Llama Community License.[1][2][3]

Sejarah dan Latar Belakang

Pengembangan keluarga Nemotron dilakukan dalam konteks strategi NVIDIA untuk membangun tumpukan alat lengkap bagi AI generatif: mulai dari infrastruktur pelatihan (DGX, superkomputer berbasis GPU H100/B200) hingga platform pelatihan (NeMo Framework), penyelarasan (NeMo-Aligner), penerapan (NIM — NVIDIA Inference Microservices), dan keamanan (NeMo Guardrails).[4][5]

Nemotron-3 8B (2023)

Model pertama yang tersedia secara publik dari seri ini — Transformer decoder dengan 8 miliar parameter dan konteks 4096 token, dilatih pada 3,8 triliun token dalam 53 bahasa alami dan 37 bahasa pemrograman. Pelatihan dilakukan pada 1024 GPU A100 selama 19 hari. Tidak ada laporan teknis resmi yang diterbitkan di arXiv. Model ini didistribusikan melalui NeMo Framework dan Hugging Face, dengan varian Chat (SFT dan SteerLM). Lisensinya adalah NVIDIA AI Foundation Models Community License.[6][7]

Catatan tentang penamaan: "Nemotron-3" tahun 2023 dan "Nemotron 3" Desember 2025 adalah model yang berbeda. Yang pertama merupakan prototipe awal, yang kedua adalah generasi terkini dengan arsitektur MoE.

Nemotron-4 15B (Februari 2024)

Rilis pertama yang terdokumentasi secara publik dari seri Nemotron-4 — model dengan 15 miliar parameter, dilatih pada 8 triliun token selama ~13 hari kalender pada 384 node DGX H100 (hingga 3072 GPU). Digunakan paralelisme tensor 8-lipat dan paralelisme data dari 96 hingga 288. MFU (Model FLOPs Utilization) puncak mencapai 34,3% pada batch size 384. Arsitekturnya adalah decoder-only Transformer dengan Grouped-Query Attention (GQA) dan Rotary Position Embeddings (RoPE). Berdasarkan hasil benchmark saat publikasi, model ini mengungguli semua model terbuka berukuran setara dalam tugas multibahasa, termasuk sejumlah model yang empat kali lebih besar darinya.[8]

Nemotron-4 340B (Juni 2024)

Pada Juni 2024, model terbesar dari seri Nemotron-4 dirilis — 340 miliar parameter (331,6 miliar parameter non-embedding), yang dilatih terlebih dahulu pada 9 triliun token (8 triliun pra-pelatihan + 1 triliun pembelajaran lanjutan dengan pembobotan ulang sumber berkualitas tinggi). Pelatihan dilakukan pada 768 node DGX H100 (hingga 6144 GPU) dengan MFU puncak 42,4%, dari Desember 2023 hingga Mei 2024. Keluarga ini mencakup tiga varian: Base, Instruct, dan Reward. Ukuran model dipilih agar dapat dimuat dalam satu node DGX H100 (8 GPU) saat diterapkan dalam format presisi FP8. Lebih dari 98% data yang digunakan dalam penyelarasan (alignment) dihasilkan secara sintetis oleh model-model seri ini sendiri dalam proses iteratif; pipeline pembuatan data sintetis dibuka untuk reproduksi.[3]

Llama-3.1-Nemotron-70B (Oktober 2024)

Pada Oktober 2024, model yang di-fine-tuning dari Meta Llama-3.1-70B-Instruct dirilis: Llama-3.1-Nemotron-70B-Instruct dan Llama-3.1-Nemotron-70B-Reward. Per 1 Oktober 2024, model Instruct menempati peringkat ke-1 secara bersamaan pada tiga benchmark otomatis: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6%, MT-Bench (GPT-4-Turbo) — 8,98. Model Reward mencapai 94,1% pada RewardBench.[9][10]

Transisi ke Arsitektur Hibrida (2025)

Pada tahun 2025, seri ini diperluas dengan arsitektur hibrida yang menggabungkan lapisan Mamba-2 (State Space Model, SSM — model ruang keadaan) dan Transformer. Pada Maret–Mei 2025, keluarga model penalaran Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) dirilis dengan mode penalaran yang dapat diaktifkan atau dinonaktifkan.[11] Pada April 2025, Nemotron-H (arXiv:2504.03624) diterbitkan — keluarga model Mamba-Transformer hibrida berukuran 8B, 56B, dan 47B parameter.[12] Pada Agustus 2025, Nemotron Nano 2 (9B-v2, arXiv:2508.14444) diperkenalkan.[13]

Nemotron 3 (Desember 2025)

Pada 15 Desember 2025, generasi ketiga diumumkan — keluarga Nemotron 3 dengan model Nano, Super, dan Ultra, yang menggabungkan arsitektur Mamba-2, Transformer, dan MoE dengan jendela konteks hingga 1 juta token. Nano dirilis dengan laporan teknis; Super dan Ultra dijadwalkan untuk paruh pertama tahun 2026.[1][2][14][15]

Landasan Teori

Arsitektur Transformer dalam Nemotron-4

Model seri Nemotron-4 dibangun di atas arsitektur decoder Transformer standar dengan perhatian kausal. Probabilitas urutan token x1,x2,,xT difaktorkan sebagai:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

di mana θ adalah parameter model.[8]

Mekanisme perhatian diimplementasikan dalam varian Grouped-Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKdk)V,

di mana Q,K,V — matriks kueri, kunci, dan nilai; dk — dimensi kepala perhatian.

Untuk pengkodean posisi digunakan Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

di mana xm — vektor pada posisi m, θi=100002i/d, d — dimensi vektor.

Dalam lapisan MLP digunakan aktivasi Squared ReLU: f(x)=(max(0,x))2, yang memastikan jarangnya (sparsity) aktivasi. Model tidak mengandung bias, tidak menggunakan dropout, dan matriks embedding input dan output tidak diikat satu sama lain (untied embeddings). Tokenizer — SentencePiece BPE dengan pelestarian spasi, pemisahan digit per karakter, dan fallback per-byte, ukuran kosakata — 256.000.[8][3]

Parameter Arsitektur Nemotron-4
Parameter Nemotron-4 15B Nemotron-4 340B
Jumlah parameter 15 miliar (3,2 miliar embed.) 340 miliar (9,4 miliar embed.)
Jumlah lapisan 32 96
Dimensi tersembunyi 6144 18.432
Kepala perhatian 48 96
Kepala KV (GQA) 8 8
Panjang konteks 4096 4096
Ukuran kosakata 256.000 256.000

Sumber: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Arsitektur Hibrida Mamba-Transformer (Nemotron-H)

Dalam model Nemotron-H, blok perhatian-diri standar sebagian digantikan oleh blok Mamba-2 — model ruang keadaan (State Space Models, SSM). Selama pembuatan autoregresif, setiap lapisan perhatian-diri membutuhkan O(n) operasi dan memori per langkah (karena cache KV), sementara lapisan Mamba menyediakan konsumsi memori dan komputasi yang konstan untuk setiap token yang dihasilkan.[12]

Mamba-2 dideskripsikan oleh hubungan rekuren[18]:

ht=Aht1+Bxt,yt=Cht,

di mana htN — keadaan tersembunyi, AN×N — matriks transisi keadaan diagonal, BN×1 dan C1×N — matriks proyeksi, xt — token input, yt — sinyal output. Dalam Mamba-2, matriks A, B, C bergantung pada input (input-dependent), yang membedakan model dari SSM linier klasik.

Dalam Nemotron-H-56B digunakan 54 lapisan Mamba-2 + 54 lapisan MLP + 10 lapisan perhatian-diri, dengan lapisan perhatian ditempatkan secara merata di antara lapisan Mamba. Model dilatih pada 20 triliun token dalam format FP8 (per-tensor scaling) pada 6144 GPU H100. Versi Nemotron-H-8B berisi 24 lapisan Mamba-2, 24 lapisan MLP, dan 4 lapisan perhatian-diri; pelatihan dilakukan pada 15 triliun token.[12]

Arsitektur MoE Nemotron 3

Model Nemotron 3 (Desember 2025) menggabungkan tiga komponen arsitektur: Mamba-2, Transformer, dan Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) berisi 52 lapisan: 23 lapisan Mamba-2 + MoE, 23 lapisan MoE, dan 6 lapisan perhatian GQA. Setiap lapisan MoE mencakup 128 pakar yang dapat dirutekan (routed) + 1 pakar bersama (shared), di mana 6 pakar diaktifkan per token. Perutean dilakukan oleh router MLP yang dapat dilatih dengan sigmoid gating. Penyeimbangan beban diimplementasikan tanpa fungsi kerugian tambahan (aux-loss-free). Jumlah total parameter adalah 31,6 miliar, namun yang aktif per token hanya 3,2 miliar.[2]

Normalisasi — RMSNorm[19]. Embedding posisional pada bagian Mamba tidak ada (informasi posisi bersifat implisit dalam keadaan SSM). Digunakan embedding yang tidak diikat, tidak ada dropout, dan tidak ada bias pada lapisan linier.[2]

Ekstensi pada Super/Ultra: LatentMoE dan Multi-Token Prediction

Model Super dan Ultra dari keluarga Nemotron 3 menerapkan dua inovasi arsitektur tambahan:

  • Latent MoE (LatentMoE) — proyeksi representasi input ke ruang laten berdimensi lebih kecil sebelum perutean, yang memungkinkan peningkatan jumlah pakar dengan biaya komputasi yang sebanding dan meningkatkan akurasi tanpa mengurangi throughput.[1]
  • Multi-Token Prediction (MTP) — prediksi beberapa token berikutnya secara bersamaan, digunakan untuk meningkatkan kualitas teks panjang dan decoding spekulatif saat inferensi.[1]

Pelatihan Super dan Ultra dilakukan dalam format NVFP4 — format numerik 4-bit NVIDIA pada arsitektur Blackwell.[1]

Metode Kompresi Model: Minitron, Puzzle, MiniPuzzle

Untuk membuat model yang lebih ringkas, NVIDIA menggunakan beberapa pendekatan:

  • Minitron — metode pemangkasan terstruktur (pruning) dan distilasi pengetahuan (knowledge distillation). Dua jenis pemangkasan diteliti: berdasarkan kedalaman (penghapusan lapisan) dan berdasarkan lebar (pengurangan bersama dimensi lapisan tersembunyi, kepala perhatian, dan proyeksi MLP). Penerapan Minitron pada Nemotron-4 15B memungkinkan pembuatan model 8B dan 4B dengan pengurangan biaya pelatihan hingga 40 kali dibandingkan pelatihan dari awal.[20]
  • Puzzle — algoritma Neural Architecture Search (NAS) yang memilih konfigurasi optimal untuk setiap blok (jumlah kepala KV, ukuran FFN, ada/tidaknya perhatian) dengan distilasi per-blok. Dengan cara inilah Llama 3.1 405B dikompres menjadi 253B (Llama-Nemotron Ultra), dan Llama 3.3 70B menjadi 49B (Llama-Nemotron Super).[21]
  • MiniPuzzle — perluasan Puzzle untuk arsitektur hibrida, yang mengompres Nemotron-H-56B menjadi 47B dengan hanya menggunakan 63 miliar token distilasi. Dengan akurasi yang sebanding, model yang dikompres menghasilkan output 20% lebih cepat.[12]

Metode Penyelarasan

HelpSteer dan HelpSteer2

HelpSteer — kumpulan data berisi 37.120 contoh (lisensi CC-BY-4.0), dibuat bersama Scale AI, di mana setiap jawaban dianotasi berdasarkan lima atribut: kegunaan (helpfulness), ketepatan (correctness), koherensi (coherence), kompleksitas (complexity), dan verbositas (verbosity) pada skala Likert 0–4.[22]

HelpSteer2 — kumpulan data yang diperbarui berisi 21.362 contoh (10.681 prompt × 2 jawaban), di mana lebih dari 95% prompt diambil dari ShareGPT (permintaan pengguna nyata). Sekitar 50% anotasi disaring karena kualitasnya dianggap tidak memadai. Ekstensi HelpSteer2-Preference menambahkan preferensi berpasangan dari anotator, memungkinkan pelatihan model reward berbasis regresi maupun berpasangan pada data yang sama.[23][24]

SteerLM

SteerLM — metode SFT (Supervised Fine-Tuning — pelatihan dengan pengawas) dengan pengkondisian pada atribut (helpfulness, correctness, coherence, complexity, verbosity), yang memungkinkan pengguna mengendalikan gaya jawaban saat inferensi. Pipeline mencakup: (1) pelatihan model prediksi atribut (APM) pada HelpSteer, (2) pelabelan data menggunakan APM, (3) SFT dengan pengkondisian pada nilai atribut target, (4) bootstrapping.[25]

DPO dan RPO

DPO (Direct Preference Optimization) — metode optimasi preferensi langsung tanpa model reward eksplisit, digunakan dalam pipeline Nemotron-4 340B Instruct dan Nemotron Nano 2.[26]

RPO (Reward-aware Preference Optimization) — kerangka matematis terpadu NVIDIA, yang menggeneralisasi DPO, IPO, SimPO, REINFORCE, dan SteerLM 2.0 sebagai kasus khusus. RPO meminimalkan jarak antara prediksi model reward implisit dan model reward eksplisit target[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

di mana rϕ — model reward eksplisit, πθ — kebijakan yang dilatih, πref — kebijakan referensi, d(,) — fungsi jarak, yw/yl — jawaban yang dipilih/ditolak. RPO diterapkan dalam pelatihan Nemotron-4 340B Instruct dan model Llama-Nemotron.[27][3][11]

Pembelajaran Penguatan Multi-Lingkungan (RLVR)

Dalam Nemotron 3 diterapkan Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — pelatihan simultan pada beberapa lingkungan dalam kerangka NeMo Gym: matematika kompetitif, pemrograman, QA, penggunaan alat (tool-use), mengikuti instruksi (instruction-following), konteks panjang. Algoritmanya adalah GRPO (Group Relative Policy Optimization) dengan masked importance sampling.[2][14]

Nemotron 3 mendukung pengendalian anggaran penalaran (reasoning budget control) yang terperinci: pengguna dapat menetapkan batas token untuk jejak berpikir (thinking trace) melalui tanda dalam template obrolan (pengalihan "detailed thinking on/off" atau pembatasan panjang).[2]

Jajaran Model

Tabel Ringkasan

Model Tahun Total / Parameter Aktif Konteks Arsitektur Fitur Utama
Nemotron-3 8B 2023 8B / 8B 4K Dense Transformer 3,8T token; 1024 GPU A100; 19 hari
Nemotron-4 15B 2024 15B / 15B 4K Dense Transformer 8T token; MFU 34,3%
Nemotron-4 340B 2024 340B / 340B 4K Dense Transformer 9T token; Base/Instruct/Reward; >98% data sintetis alignment
Llama-3.1-Nemotron-70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1%
Llama-Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Pengalihan penalaran (Reasoning toggle)
Llama-Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) Kompresi NAS dari Llama 3.1 8B
Llama-Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Dari Llama 3.3 70B
Llama-Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Dari Llama 3.1 405B; GPQA 76,0%
Nemotron-H 8B 2025 8B / 8B Hibrida Mamba-Transformer 15T token; 24 Mamba-2 + 24 MLP + 4 Attn
Nemotron-H 56B 2025 56B / 56B Hibrida Mamba-Transformer 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn
Nemotron-H 47B 2025 47B / 47B ~1M (FP4) Hibrida Mamba-Transformer MiniPuzzle dari 56B; kecepatan +20%
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Hibrida Mamba-Transformer 20T token; distilasi Minitron
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Hibrida Mamba-Transformer MoE 25T token; 128 pakar, 6 aktif
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Hibrida LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Hibrida LatentMoE MTP; NVFP4

Nemotron-4 15B

Arsitektur: 32 lapisan, hidden dimension 6144, 48 kepala perhatian, 8 kepala KV (GQA). Jumlah total parameter — 15 miliar (3,2 miliar embedding + 12,5 miliar non-embedding). Hasil: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Pada benchmark multibahasa (XCOPA, TyDiQA-GoldP, MGSM), model ini mengungguli model yang empat kali lebih besar.[8]

Nemotron-4 340B

Arsitektur: 96 lapisan, hidden dimension 18.432, 96 kepala perhatian, 8 kepala KV.

Nemotron-4 340B Base menunjukkan: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC-Challenge — 94,3% (25-shot).[3]

Nemotron-4 340B Instruct melewati penyelarasan bertahap: Code SFT → General SFT → DPO → RPO (3 putaran). Hasil: MT-Bench — 8,22 (GPT-4-Turbo judge), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]

Nemotron-4 340B Reward menggantikan lapisan softmax akhir dengan proyeksi linier keadaan tersembunyi lapisan terakhir ke dalam vektor 5 atribut HelpSteer2. Reward akhir adalah jumlah berbobot dari lima atribut. Pelatihan dilakukan selama 2 epoch pada data HelpSteer2 (batch size 128). Pada RewardBench, model ini mencapai 92,0%, melampaui GPT-4o (84,7%), Gemini 1.5 Pro (88,1%), dan Claude-3-Opus (80,7%) pada saat publikasi.[3]

Model Arena Hard AlpacaEval 2.0 LC MT-Bench
Nemotron-4-340B-Instruct 54,2 41,5% 8,22
Llama-3-70B-Instruct 41,1 34,4% 8,16
Mixtral-8x22B-Instruct 36,4 30,9% 7,63
Qwen-2-72B-Instruct 48,1 38,8% 8,26

Sumber: arXiv:2406.11704, tabel 5.[3]

Llama-3.1-Nemotron-70B

Llama-3.1-Nemotron-70B-Reward dilatih menggunakan metode hibrida yang menggabungkan Bradley-Terry (preferensi berpasangan) dan regresi SteerLM (evaluasi multi-atribut pada skala Likert). Pelatihan dilakukan secara eksklusif pada data HelpSteer2 (CC-BY-4.0). Pada RewardBench, model ini mencapai 94,1%, menempati peringkat ke-1 pada saat publikasi.[10]

Llama-3.1-Nemotron-70B-Instruct diselaraskan menggunakan metode RLHF dengan algoritma REINFORCE (bukan PPO) dan model reward Nemotron-70B-Reward. Infrastrukturnya — NeMo-Aligner dengan akselerasi TRT-LLM.[9]

Llama-Nemotron: Nano, Super, Ultra (2025)

Keluarga model penalaran yang diperoleh dari Llama 3.x menggunakan metode NAS, distilasi, dan pasca-pelatihan yang diperluas.[11]

Model Parameter Model Dasar Konteks
Llama-Nemotron-Nano 8B 8 miliar Llama-3.1-8B-Instruct 128K
Llama-Nemotron-Nano 4B 4 miliar Minitron 4B (dari Llama 3.1 8B) 128K
Llama-Nemotron-Super 49B 49 miliar Llama-3.3-70B → NAS (Puzzle) 128K
Llama-Nemotron-Ultra 253B 253 miliar Llama-3.1-405B → NAS (Puzzle) 128K

Pipeline pelatihan lima tahap: (1) NAS + FFN Fusion, (2) distilasi + pra-pelatihan lanjutan, (3) SFT (termasuk jejak penalaran DeepSeek-R1), (4) RL berskala besar (GRPO untuk Ultra, REINFORCE/RLOO + Online RPO untuk Nano), (5) penyelarasan untuk dialog.[11]

Model-model ini menjadi yang pertama di antara LLM terbuka yang mendukung mode penalaran yang dapat diaktifkan/dinonaktifkan (reasoning toggle): ketika diaktifkan ("detailed thinking on" dalam prompt sistem), model menghasilkan rantai penalaran dalam tag <think>...</think> sebelum menjawab; ketika dinonaktifkan — menjawab secara langsung.[11]

Hasil Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Sebagai perbandingan: DeepSeek-R1 (671B total / 37B aktif) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Ultra dapat dimuat dalam satu node 8×H100.[11]

Nemotron-H (April 2025)

Keluarga model hibrida padat yang dilatih dari awal dan dirancang untuk tugas dengan generasi panjang. Nemotron-H-56B dilatih pada 20 triliun token dalam FP8 — salah satu eksperimen pra-pelatihan FP8 publik terbesar. Nemotron-H-47B diperoleh dengan mengompres 56B menggunakan metode MiniPuzzle (63 miliar token distilasi) dan dapat dimuat dalam memori satu RTX 5090 (FP4) dengan konteks ~1M token.[12]

Benchmark Nemotron-H-56B Nemotron-H-47B Qwen-2.5-72B Llama-3.1-70B
MMLU-Pro (5-shot CoT) 60,5 61,8 58,8 51,3
MMLU (5-shot) 84,2 83,6 86,1 78,8
GSM8K (8-shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0-shot) 60,4 61,0 56,7 57,3

Sumber: arXiv:2504.03624.[12]

Saat menghasilkan output dengan 65.536 token input dan 1024 token output pada H100, model Nemotron-H-47B bekerja 2,9 kali lebih cepat dari Qwen-2.5-72B dan Llama-3.1-70B.[12]

Nemotron Nano 2 (Agustus 2025)

Model Mamba-Transformer hibrida untuk penalaran. Nemotron-Nano-12B-v2-Base — model induk dengan 62 lapisan (terutama Mamba-2 + MLP + 4 lapisan perhatian), dilatih pada 20 triliun token dalam FP8 dari awal. Dari model ini, menggunakan Minitron yang diperluas, diperoleh Nemotron-Nano-9B-v2, yang mampu bekerja dalam konteks 128K token pada satu GPU NVIDIA A10G (22 GB, BF16). Pasca-pelatihan: SFT (80 miliar token, termasuk jejak DeepSeek-R1-0528) → GRPO → DPO → RLHF. Pada benchmark penalaran, model ini sebanding dengan Qwen3-8B dalam hal akurasi, namun mencapai percepatan generasi 3–6 kali lipat untuk urutan output yang panjang.[13]

Nemotron 3 Nano 30B-A3B

Dirilis pada Desember 2025. Parameter: 31,6 miliar total, 3,2 miliar aktif. Arsitektur: 52 lapisan, hidden dimension 2688, dimensi pakar 1856, dimensi keadaan Mamba 128. MoE: 128 pakar yang dapat dirutekan + 1 pakar bersama, 6 aktif per token. Konteks — hingga 1.048.576 token. Pelatihan pada 25 triliun token (jadwal WSD, batch size 3072, batas data — Juni 2025) dalam dua fase: Fase 1 — 23,5 triliun (data beragam), Fase 2 — 1,5 triliun (data berkualitas tinggi) + 121 miliar token CPT konteks panjang.[2]

Benchmark Nemotron 3 Nano 30B-A3B Qwen3-30B-A3B-Thinking GPT-OSS-20B
MMLU-Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE-Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena-Hard-V2 Avg 67,65 57,8 48,55
RULER-100 @ 1M 86,34 77,5

* — nilai dari sumber sekunder; kondisi reproduksi — NeMo Evaluator SDK. Sumber: arXiv:2512.20848.[2][28]

Throughput (input 8K / output 16K, single H200): 3,3 kali lebih tinggi dari Qwen3-30B-A3B-Thinking dan 2,2 kali lebih tinggi dari GPT-OSS-20B.[2]

Model dan Arah Tambahan

  • OpenReasoning-Nemotron (Juli 2025) — rangkaian model 1,5B–32B parameter, berbasis Qwen 2.5 dan di-fine-tuning pada data DeepSeek-R1-0528. Varian 32B dengan GenSelect@64 mengungguli o3 (high) pada sejumlah benchmark matematika.[29]
  • Nemotron Elastic (arXiv:2511.16664) — kerangka sub-model bersarang (6B, 9B, 12B) dalam satu model induk, yang mengurangi biaya pelatihan hingga 360 kali dibandingkan pelatihan dari awal.[30]
  • Nemotron-CrossThink — kerangka pelatihan penguatan multi-domain di luar tugas matematika, yang memberikan peningkatan +30,1% pada MATH-500 dan +12,8% pada MMLU-PRO.[31]
  • Nemotron-UltraLong — perluasan konteks hingga 4 juta token.[32]
  • Jet-Nemotron — NAS pasca-pelatihan untuk model hibrida ringkas 2B/4B.[33]

Model Khusus

Dalam ekosistem Nemotron juga terdapat model untuk tugas-tugas khusus:

  • Nemotron Nano V2 VL — model vision-language untuk OCR, pemrosesan tabel, dan video.[34]
  • Nemotron Parse 1.1 — model untuk OCR dan ekstraksi struktur dokumen.[35]
  • Nemotron ColEmbed V2 — model embedding untuk pencarian dokumen visual (late interaction).[36]
  • Nemotron Speech — model untuk pengenalan ucapan otomatis (ASR), sintesis ucapan (TTS), dan penerjemahan mesin (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — model klasifikasi konten tidak aman dalam 23 kategori pada 9 bahasa dengan akurasi 84,2%.[37]

Data Pra-Pelatihan

Komposisi Data Nemotron-4

Korpus pra-pelatihan Nemotron-4 15B dan 340B terdiri dari tiga kategori utama: teks bahasa Inggris (70%), teks multibahasa dalam 53 bahasa (15%), dan kode sumber dalam 43 bahasa pemrograman (15%). Deduplikasi pada tingkat dokumen diterapkan (exact dan near-duplicate), serta penyaringan menggunakan model bahasa dan heuristik. Model 15B dilatih pada 8 triliun token, model 340B — pada 9 triliun (8 triliun pra-pelatihan + 1 triliun pembelajaran lanjutan dengan pembobotan ulang sumber berkualitas tinggi).[8][3]

Nemotron-CC

Kumpulan data Nemotron-CC dibentuk dari Common Crawl menggunakan ensemble pengklasifikasi kualitas dan parafrase sintetis teks. Volume total — 6,3 triliun token (4,4 triliun yang dideduplikasi + 1,9 triliun parafrase sintetis). Pipeline terintegrasi ke dalam alat NeMo Curator. Karya ini diterima sebagai Long Paper di konferensi ACL 2025.[38]

Nemotron-CC-Math

Subhimpunan berorientasi matematika bervolume 133 miliar token, diekstraksi dari Common Crawl menggunakan pipeline Lynx + LLM dengan pelestarian struktur rumus matematika dan kode dalam LaTeX.[39]

Data Nemotron 3 Nano

Pra-pelatihan Nemotron 3 Nano dilakukan pada 25 triliun token. Kumpulan data mencakup: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1, dan dataset STEM khusus. Untuk pelatihan konteks panjang digunakan tambahan 121 miliar token CPT.[2]

Nemotron Pretraining Dataset v1

Kumpulan data yang dihasilkan secara sintetis, mencakup STEM, teks akademis, tugas penalaran, dan domain multibahasa; berisi lebih dari 10 triliun token bahasa dan 18 juta sampel untuk SFT. Semua kumpulan data didistribusikan di bawah lisensi terbuka yang permisif.[40]

Pipeline Pembuatan Data Sintetis (SDG)

Pipeline yang dijelaskan dalam laporan Nemotron-4 340B mencakup tahap-tahap berikut[3]:

  • Pembuatan prompt: permintaan satu dan dua giliran sintetis, dihasilkan menggunakan Mixtral-8x7B-Instruct-v0.1 (lisensi Apache 2.0) berdasarkan template Open QA, Writing, Closed QA, Math & Coding.
  • Pembuatan jawaban: beberapa jawaban dari versi model perantara untuk memastikan keberagaman.
  • Evaluasi kualitas: tiga pendekatan — Ground-Truth-as-a-Judge (untuk tugas dengan jawaban yang dapat diverifikasi), LLM-as-Judge (perbandingan pasangan jawaban oleh model bahasa), Reward-Model-as-Judge (menggunakan Nemotron-4-340B-Reward).
  • Penyelarasan iteratif dari model lemah ke model kuat (weak-to-strong).

Dari ~20.000 contoh yang dianotasi oleh manusia (10.000 untuk SFT, 10.000 HelpSteer2 untuk model reward), seluruh volume data penyelarasan lainnya disintesis.[3]

Kuantisasi dan Optimisasi Inferensi

Model Nemotron 3 Nano mendukung Post-Training Quantization (PTQ) dalam FP8 menggunakan ModelOpt dan Megatron-LM. Kuantisasi selektif diterapkan — lapisan attention dan sebagian Mamba dipertahankan dalam BF16 untuk menjaga kualitas; sisanya dikuantisasi dalam FP8. Menurut laporan teknis, hal ini memberikan ~99% retensi akurasi.[2] Nano juga mendukung inferensi dalam format NVFP4.[1]

Tabel Ringkasan Benchmark Antar Generasi

Model MMLU GSM8K HumanEval Arena Hard MT-Bench Kondisi
Nemotron-4 15B 64,2% 46,0% 31,6% base; 5-/8-/0-shot
Nemotron-4 340B Base 81,1% 57,3% 5-/—/0-shot
Nemotron-4 340B Instruct 78,7% 92,3% 73,2% 54,2 8,22 0-shot
Llama-3.1-Nemotron-70B-Instruct 85,0 8,98 Okt. 2024
LN-Ultra 253B (reasoning ON) GPQA 76,0%, AIME 80,8%
Nemotron-H-47B 83,6% 93,3% 61,0% 5-/8-CoT/0-shot
Nemotron 3 Nano (30B-A3B) 67,7 (v2) AIME25 89,1%, LCB 68,3%

Perbandingan ini harus ditafsirkan dengan hati-hati: kondisi evaluasi, versi benchmark, dan tanggal pengujian berbeda antar generasi. Hasil diambil dari laporan teknis NVIDIA; evaluasi independen mungkin berbeda (lihat bagian "Keterbatasan").[8][3][9][11][12][2]

Penerapan

Penerapan melalui NVIDIA NIM

NVIDIA NIM — kumpulan layanan mikro kontainer yang dioptimalkan untuk inferensi dengan API yang kompatibel dengan OpenAI. Model Nemotron tersedia sebagai layanan mikro NIM di platform build.nvidia.com. NIM mendukung format FP8, BF16, NVFP4, dan penerapan melalui Helm chart di Kubernetes. Model juga kompatibel dengan kerangka kerja independen: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]

Pembuatan Data Sintetis

Nemotron-4 340B dirancang untuk digunakan sebagai generator data sintetis: model Instruct menghasilkan jawaban, model Reward mengevaluasi dan menyaringnya. Lisensi NVIDIA Open Model License secara eksplisit mengizinkan penggunaan output model untuk melatih model lain. Menurut ServiceNow, 15% dari data pra-pelatihan model Apriel 1.6 mereka diperoleh dari kumpulan data Nemotron.[3][15][41]

Sistem Agentik

Model keluarga Nemotron 3 (Nano, Super, Ultra) dirancang untuk beban kerja multi-agen: perencanaan, retrieval, penggunaan alat (tool use). Nemotron 3 Nano menunjukkan hasil 38,76% pada SWE-Bench (dengan OpenHands) dan 49,04% (rata-rata) pada TauBench V2.[2]

Implementasi Korporat

Di antara mitra yang diumumkan: ServiceNow (model bersama Apriel Nemotron 15B untuk otomatisasi alur kerja), CrowdStrike (platform Charlotte AI), Perplexity (perutean permintaan), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Model tersedia di AWS Amazon Bedrock; dukungan Google Cloud, CoreWeave, Nebius direncanakan.[15]

Keterbatasan dan Masalah Terbuka

Evaluasi Independen dan Perbedaan dengan Data NVIDIA

Evaluasi independen mengungkapkan perbedaan dengan hasil yang dikutip NVIDIA. Menurut data Artificial Analysis (Februari 2026), Llama-Nemotron-Ultra 253B (reasoning) mendapatkan Intelligence Index 15 dengan median 26 untuk model berukuran sebanding. Di platform Chatbot Arena (LMArena), model Nemotron menempati posisi di tengah peringkat: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~posisi ke-147), Nemotron 3 Nano — 1317 ±6 (~posisi ke-164).[42][43]

Verbositas Berlebihan

Model Nemotron menunjukkan verbositas yang tinggi: dalam evaluasi Artificial Analysis, model Nemotron 3 Nano menghasilkan 140 juta token (dengan median 12 juta untuk model lain), yang meningkatkan biaya inferensi. Analisis DEV Community mengungkapkan bahwa Llama-3.1-Nemotron-70B-Instruct, meski secara formal memimpin pada benchmark otomatis, menunjukkan akurasi yang tidak memadai pada sejumlah tugas praktis, dan skor tinggi pada benchmark sejenis Arena mungkin disebabkan oleh preferensi terhadap jawaban yang panjang dan percaya diri, namun belum tentu akurat.[42][44]

Halusinasi dan Bias

NVIDIA dalam kartu model menyatakan bahwa model dapat "memperkuat bias dan menghasilkan respons yang bersifat toksik, terutama pada prompt yang bersifat toksik", serta "menghasilkan informasi yang tidak akurat, menghilangkan detail penting". Keterbukaan bobot dan data memungkinkan audit eksternal.[11][13]

Persyaratan Komputasi

Model padat (Nemotron-4 340B) membutuhkan kluster 768 node DGX H100 untuk pelatihan penuh, yang membatasi reproduksibilitas bagi kelompok akademis tanpa akses ke infrastruktur serupa. Konteks panjang (1M) saat inferensi membutuhkan kapasitas VRAM yang signifikan.[3][2]

Degradasi saat Perluasan Konteks

Ketika konteks diperluas ke urutan yang sangat panjang, terjadi degradasi hasil pada benchmark dengan konteks pendek.[32]

Kuantisasi Arsitektur Hibrida

Penggunaan presisi sangat rendah (FP8/NVFP4) dalam arsitektur Mamba-Transformer menyebabkan penurunan akurasi kecil (~1% pada sejumlah benchmark). Masalah ini diatasi dengan penerapan kuantisasi selektif, yang memperumit arsitektur kompiler dan server inferensi.[2][1]

Masalah Terbuka Lainnya

  • Ketergantungan pada benchmark dengan kemungkinan kontaminasi data pelatihan.
  • Tidak adanya protokol perbandingan yang terstandarisasi untuk arsitektur hibrida SSM-Transformer dengan model Transformer murni.
  • Pertanyaan tentang skalabilitas pendekatan MoE untuk tugas yang membutuhkan penalaran mendalam dengan sedikit pakar aktif per token.
  • Data tentang Super/Ultra per Desember 2025 bersifat sementara; benchmark lengkap diharapkan setelah rilis.[1]

Aspek Etika dan Regulasi

Keamanan dalam Tahap Pengembangan

Dalam tahap pengembangan diterapkan: evaluasi berdasarkan kerangka AEGIS (13 kategori keamanan konten), pemindai kerentanan garak, dan pengujian merah (red-teaming) secara manual.[37]

Keamanan dalam Tahap Inferensi

NeMo Guardrails — perangkat sumber terbuka (lisensi Apache 2.0) yang menambahkan penghalang terprogram pada sistem LLM. Layanan mikro ini mencegat input dan output, menerapkan pemeriksaan yang dapat dikonfigurasi: kontrol topik, deteksi PII, verifikasi "grounding" RAG, deteksi serangan jailbreak (termasuk perlindungan dari injeksi kode berbasis YARA), klasifikasi keamanan multibahasa dan multimodal.[45]

Untuk Nemotron 3, diterbitkan kumpulan berisi ~11.000 jejak OpenTelemetry berlabel dari skenario realistis penggunaan alat, yang dirancang untuk mengevaluasi keamanan agentik.[1]

Lisensi

Model Lisensi
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron-4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama-Nemotron (Nano/Super/Ultra) Llama Community License (diwarisi dari Meta)
Nemotron-3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License mengizinkan penggunaan komersial, pembuatan dan distribusi karya turunan, tidak memerlukan atribusi (dengan tetap menyimpan file NOTICE), tidak memberlakukan batasan pada jumlah pengguna, dan secara eksplisit mengizinkan penggunaan output model untuk melatih model lain.[46] Model berbasis Llama mewarisi pembatasan Meta, termasuk ambang batas 700 juta pengguna aktif bulanan.[11]

Untuk Nemotron 3 Nano, NVIDIA menerbitkan: bobot model, lebih dari 10 triliun token data pelatihan, resep pelatihan, basis kode (NeMo, Megatron-LM, NeMo-Aligner), lebih dari 10 lingkungan pelatihan penguatan dengan 900.000+ tugas.[1][2]

Prospek dan Arah Penelitian

Rilis terdekat mencakup Nemotron 3 Super (~100 miliar parameter, ~10 miliar aktif) dan Nemotron 3 Ultra (~500 miliar, ~50 miliar aktif), yang diharapkan pada paruh pertama tahun 2026. Kedua model akan menggunakan LatentMoE, MTP, dan pelatihan dalam format NVFP4 pada arsitektur Blackwell.[1]

Arah strategis NVIDIA adalah memposisikan Nemotron bukan sebagai model tunggal, melainkan sebagai lapisan infrastruktur untuk sistem multi-agen, di mana berbagai model dalam keluarga digunakan untuk tugas-tugas berbeda dengan perutean berdasarkan kompleksitas.[1][15]

Arah penelitian utama:

  • Pengembangan arsitektur hibrida — integrasi lebih lanjut lapisan SSM dengan mekanisme perhatian untuk konteks panjang yang dapat diskalakan.[12]
  • Metode kompresi bertingkat — pengembangan Minitron, Puzzle, MiniPuzzle, dan Nemotron Elastic.[20][21][30]
  • Pelatihan penguatan multi-domain — Nemotron-CrossThink untuk memperluas RL di luar tugas matematika.[31]
  • Perluasan konteks — Nemotron-UltraLong hingga 4 juta token.[32]
  • Multimodalitas — perluasan ke bidang vision-language (Nemotron VL), ucapan (Nemotron Speech), pencarian dokumen visual (Nemotron ColEmbed V2).[34][35][36]
  • Model hibrida ringkas — Jet-Nemotron (NAS untuk model 2B/4B).[33]
  • Resep terbuka — publikasi resep pelatihan lengkap dan data untuk reproduksi dan kustomisasi oleh komunitas.[14]

Lihat Juga

  • Arsitektur Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (keluarga model Meta)

Referensi

Literatur

Catatan

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/