Nemotron (NVIDIA) (ID)
Nemotron — keluarga model bahasa besar (Large Language Model, LLM) dengan bobot terbuka yang dikembangkan oleh divisi Applied Deep Learning Research (ADLR) dari korporasi NVIDIA. Model-model ini termasuk dalam bidang machine learning dan pemrosesan bahasa alami (Natural Language Processing, NLP) dan dirancang untuk berbagai tugas: pembuatan data sintetis, penalaran (reasoning), aplikasi agentik (agentic AI), dan penerapan pada perangkat keras industri NVIDIA. Keluarga ini mencakup model dengan berbagai arsitektur dan skala: dari 4 miliar hingga ~500 miliar parameter, termasuk model decoder-only Transformer padat (dense) seri Nemotron-4 (2024), model Mamba-Transformer hibrida (Nemotron-H, 2025), dan model Mamba-Transformer hibrida dengan Mixture-of-Experts (MoE) dalam seri Nemotron 3 (2025). Per Maret 2026, keluarga ini memiliki lebih dari 20 model, mencakup tugas pembuatan teks, penalaran, pemahaman visual dokumen, ekstraksi informasi, dan evaluasi kualitas jawaban. Model-model ini diterbitkan terutama dengan bobot terbuka di bawah lisensi NVIDIA Open Model License dan Llama Community License.[1][2][3]
Sejarah dan Latar Belakang
Pengembangan keluarga Nemotron dilakukan dalam konteks strategi NVIDIA untuk membangun tumpukan alat lengkap bagi AI generatif: mulai dari infrastruktur pelatihan (DGX, superkomputer berbasis GPU H100/B200) hingga platform pelatihan (NeMo Framework), penyelarasan (NeMo-Aligner), penerapan (NIM — NVIDIA Inference Microservices), dan keamanan (NeMo Guardrails).[4][5]
Nemotron-3 8B (2023)
Model pertama yang tersedia secara publik dari seri ini — Transformer decoder dengan 8 miliar parameter dan konteks 4096 token, dilatih pada 3,8 triliun token dalam 53 bahasa alami dan 37 bahasa pemrograman. Pelatihan dilakukan pada 1024 GPU A100 selama 19 hari. Tidak ada laporan teknis resmi yang diterbitkan di arXiv. Model ini didistribusikan melalui NeMo Framework dan Hugging Face, dengan varian Chat (SFT dan SteerLM). Lisensinya adalah NVIDIA AI Foundation Models Community License.[6][7]
Catatan tentang penamaan: "Nemotron-3" tahun 2023 dan "Nemotron 3" Desember 2025 adalah model yang berbeda. Yang pertama merupakan prototipe awal, yang kedua adalah generasi terkini dengan arsitektur MoE.
Nemotron-4 15B (Februari 2024)
Rilis pertama yang terdokumentasi secara publik dari seri Nemotron-4 — model dengan 15 miliar parameter, dilatih pada 8 triliun token selama ~13 hari kalender pada 384 node DGX H100 (hingga 3072 GPU). Digunakan paralelisme tensor 8-lipat dan paralelisme data dari 96 hingga 288. MFU (Model FLOPs Utilization) puncak mencapai 34,3% pada batch size 384. Arsitekturnya adalah decoder-only Transformer dengan Grouped-Query Attention (GQA) dan Rotary Position Embeddings (RoPE). Berdasarkan hasil benchmark saat publikasi, model ini mengungguli semua model terbuka berukuran setara dalam tugas multibahasa, termasuk sejumlah model yang empat kali lebih besar darinya.[8]
Nemotron-4 340B (Juni 2024)
Pada Juni 2024, model terbesar dari seri Nemotron-4 dirilis — 340 miliar parameter (331,6 miliar parameter non-embedding), yang dilatih terlebih dahulu pada 9 triliun token (8 triliun pra-pelatihan + 1 triliun pembelajaran lanjutan dengan pembobotan ulang sumber berkualitas tinggi). Pelatihan dilakukan pada 768 node DGX H100 (hingga 6144 GPU) dengan MFU puncak 42,4%, dari Desember 2023 hingga Mei 2024. Keluarga ini mencakup tiga varian: Base, Instruct, dan Reward. Ukuran model dipilih agar dapat dimuat dalam satu node DGX H100 (8 GPU) saat diterapkan dalam format presisi FP8. Lebih dari 98% data yang digunakan dalam penyelarasan (alignment) dihasilkan secara sintetis oleh model-model seri ini sendiri dalam proses iteratif; pipeline pembuatan data sintetis dibuka untuk reproduksi.[3]
Llama-3.1-Nemotron-70B (Oktober 2024)
Pada Oktober 2024, model yang di-fine-tuning dari Meta Llama-3.1-70B-Instruct dirilis: Llama-3.1-Nemotron-70B-Instruct dan Llama-3.1-Nemotron-70B-Reward. Per 1 Oktober 2024, model Instruct menempati peringkat ke-1 secara bersamaan pada tiga benchmark otomatis: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6%, MT-Bench (GPT-4-Turbo) — 8,98. Model Reward mencapai 94,1% pada RewardBench.[9][10]
Transisi ke Arsitektur Hibrida (2025)
Pada tahun 2025, seri ini diperluas dengan arsitektur hibrida yang menggabungkan lapisan Mamba-2 (State Space Model, SSM — model ruang keadaan) dan Transformer. Pada Maret–Mei 2025, keluarga model penalaran Llama-Nemotron (Nano 8B, Super 49B, Ultra 253B) dirilis dengan mode penalaran yang dapat diaktifkan atau dinonaktifkan.[11] Pada April 2025, Nemotron-H (arXiv:2504.03624) diterbitkan — keluarga model Mamba-Transformer hibrida berukuran 8B, 56B, dan 47B parameter.[12] Pada Agustus 2025, Nemotron Nano 2 (9B-v2, arXiv:2508.14444) diperkenalkan.[13]
Nemotron 3 (Desember 2025)
Pada 15 Desember 2025, generasi ketiga diumumkan — keluarga Nemotron 3 dengan model Nano, Super, dan Ultra, yang menggabungkan arsitektur Mamba-2, Transformer, dan MoE dengan jendela konteks hingga 1 juta token. Nano dirilis dengan laporan teknis; Super dan Ultra dijadwalkan untuk paruh pertama tahun 2026.[1][2][14][15]
Landasan Teori
Arsitektur Transformer dalam Nemotron-4
Model seri Nemotron-4 dibangun di atas arsitektur decoder Transformer standar dengan perhatian kausal. Probabilitas urutan token difaktorkan sebagai:
di mana adalah parameter model.[8]
Mekanisme perhatian diimplementasikan dalam varian Grouped-Query Attention (GQA)[16]:
di mana — matriks kueri, kunci, dan nilai; — dimensi kepala perhatian.
Untuk pengkodean posisi digunakan Rotary Position Embeddings (RoPE)[17]:
di mana — vektor pada posisi , , — dimensi vektor.
Dalam lapisan MLP digunakan aktivasi Squared ReLU: , yang memastikan jarangnya (sparsity) aktivasi. Model tidak mengandung bias, tidak menggunakan dropout, dan matriks embedding input dan output tidak diikat satu sama lain (untied embeddings). Tokenizer — SentencePiece BPE dengan pelestarian spasi, pemisahan digit per karakter, dan fallback per-byte, ukuran kosakata — 256.000.[8][3]
Parameter Arsitektur Nemotron-4
| Parameter | Nemotron-4 15B | Nemotron-4 340B |
|---|---|---|
| Jumlah parameter | 15 miliar (3,2 miliar embed.) | 340 miliar (9,4 miliar embed.) |
| Jumlah lapisan | 32 | 96 |
| Dimensi tersembunyi | 6144 | 18.432 |
| Kepala perhatian | 48 | 96 |
| Kepala KV (GQA) | 8 | 8 |
| Panjang konteks | 4096 | 4096 |
| Ukuran kosakata | 256.000 | 256.000 |
Sumber: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Arsitektur Hibrida Mamba-Transformer (Nemotron-H)
Dalam model Nemotron-H, blok perhatian-diri standar sebagian digantikan oleh blok Mamba-2 — model ruang keadaan (State Space Models, SSM). Selama pembuatan autoregresif, setiap lapisan perhatian-diri membutuhkan operasi dan memori per langkah (karena cache KV), sementara lapisan Mamba menyediakan konsumsi memori dan komputasi yang konstan untuk setiap token yang dihasilkan.[12]
Mamba-2 dideskripsikan oleh hubungan rekuren[18]:
di mana — keadaan tersembunyi, — matriks transisi keadaan diagonal, dan — matriks proyeksi, — token input, — sinyal output. Dalam Mamba-2, matriks , , bergantung pada input (input-dependent), yang membedakan model dari SSM linier klasik.
Dalam Nemotron-H-56B digunakan 54 lapisan Mamba-2 + 54 lapisan MLP + 10 lapisan perhatian-diri, dengan lapisan perhatian ditempatkan secara merata di antara lapisan Mamba. Model dilatih pada 20 triliun token dalam format FP8 (per-tensor scaling) pada 6144 GPU H100. Versi Nemotron-H-8B berisi 24 lapisan Mamba-2, 24 lapisan MLP, dan 4 lapisan perhatian-diri; pelatihan dilakukan pada 15 triliun token.[12]
Arsitektur MoE Nemotron 3
Model Nemotron 3 (Desember 2025) menggabungkan tiga komponen arsitektur: Mamba-2, Transformer, dan Mixture-of-Experts.[1][2] Nemotron 3 Nano (30B-A3B) berisi 52 lapisan: 23 lapisan Mamba-2 + MoE, 23 lapisan MoE, dan 6 lapisan perhatian GQA. Setiap lapisan MoE mencakup 128 pakar yang dapat dirutekan (routed) + 1 pakar bersama (shared), di mana 6 pakar diaktifkan per token. Perutean dilakukan oleh router MLP yang dapat dilatih dengan sigmoid gating. Penyeimbangan beban diimplementasikan tanpa fungsi kerugian tambahan (aux-loss-free). Jumlah total parameter adalah 31,6 miliar, namun yang aktif per token hanya 3,2 miliar.[2]
Normalisasi — RMSNorm[19]. Embedding posisional pada bagian Mamba tidak ada (informasi posisi bersifat implisit dalam keadaan SSM). Digunakan embedding yang tidak diikat, tidak ada dropout, dan tidak ada bias pada lapisan linier.[2]
Ekstensi pada Super/Ultra: LatentMoE dan Multi-Token Prediction
Model Super dan Ultra dari keluarga Nemotron 3 menerapkan dua inovasi arsitektur tambahan:
- Latent MoE (LatentMoE) — proyeksi representasi input ke ruang laten berdimensi lebih kecil sebelum perutean, yang memungkinkan peningkatan jumlah pakar dengan biaya komputasi yang sebanding dan meningkatkan akurasi tanpa mengurangi throughput.[1]
- Multi-Token Prediction (MTP) — prediksi beberapa token berikutnya secara bersamaan, digunakan untuk meningkatkan kualitas teks panjang dan decoding spekulatif saat inferensi.[1]
Pelatihan Super dan Ultra dilakukan dalam format NVFP4 — format numerik 4-bit NVIDIA pada arsitektur Blackwell.[1]
Metode Kompresi Model: Minitron, Puzzle, MiniPuzzle
Untuk membuat model yang lebih ringkas, NVIDIA menggunakan beberapa pendekatan:
- Minitron — metode pemangkasan terstruktur (pruning) dan distilasi pengetahuan (knowledge distillation). Dua jenis pemangkasan diteliti: berdasarkan kedalaman (penghapusan lapisan) dan berdasarkan lebar (pengurangan bersama dimensi lapisan tersembunyi, kepala perhatian, dan proyeksi MLP). Penerapan Minitron pada Nemotron-4 15B memungkinkan pembuatan model 8B dan 4B dengan pengurangan biaya pelatihan hingga 40 kali dibandingkan pelatihan dari awal.[20]
- Puzzle — algoritma Neural Architecture Search (NAS) yang memilih konfigurasi optimal untuk setiap blok (jumlah kepala KV, ukuran FFN, ada/tidaknya perhatian) dengan distilasi per-blok. Dengan cara inilah Llama 3.1 405B dikompres menjadi 253B (Llama-Nemotron Ultra), dan Llama 3.3 70B menjadi 49B (Llama-Nemotron Super).[21]
- MiniPuzzle — perluasan Puzzle untuk arsitektur hibrida, yang mengompres Nemotron-H-56B menjadi 47B dengan hanya menggunakan 63 miliar token distilasi. Dengan akurasi yang sebanding, model yang dikompres menghasilkan output 20% lebih cepat.[12]
Metode Penyelarasan
HelpSteer dan HelpSteer2
HelpSteer — kumpulan data berisi 37.120 contoh (lisensi CC-BY-4.0), dibuat bersama Scale AI, di mana setiap jawaban dianotasi berdasarkan lima atribut: kegunaan (helpfulness), ketepatan (correctness), koherensi (coherence), kompleksitas (complexity), dan verbositas (verbosity) pada skala Likert 0–4.[22]
HelpSteer2 — kumpulan data yang diperbarui berisi 21.362 contoh (10.681 prompt × 2 jawaban), di mana lebih dari 95% prompt diambil dari ShareGPT (permintaan pengguna nyata). Sekitar 50% anotasi disaring karena kualitasnya dianggap tidak memadai. Ekstensi HelpSteer2-Preference menambahkan preferensi berpasangan dari anotator, memungkinkan pelatihan model reward berbasis regresi maupun berpasangan pada data yang sama.[23][24]
SteerLM
SteerLM — metode SFT (Supervised Fine-Tuning — pelatihan dengan pengawas) dengan pengkondisian pada atribut (helpfulness, correctness, coherence, complexity, verbosity), yang memungkinkan pengguna mengendalikan gaya jawaban saat inferensi. Pipeline mencakup: (1) pelatihan model prediksi atribut (APM) pada HelpSteer, (2) pelabelan data menggunakan APM, (3) SFT dengan pengkondisian pada nilai atribut target, (4) bootstrapping.[25]
DPO dan RPO
DPO (Direct Preference Optimization) — metode optimasi preferensi langsung tanpa model reward eksplisit, digunakan dalam pipeline Nemotron-4 340B Instruct dan Nemotron Nano 2.[26]
RPO (Reward-aware Preference Optimization) — kerangka matematis terpadu NVIDIA, yang menggeneralisasi DPO, IPO, SimPO, REINFORCE, dan SteerLM 2.0 sebagai kasus khusus. RPO meminimalkan jarak antara prediksi model reward implisit dan model reward eksplisit target[27]:
di mana — model reward eksplisit, — kebijakan yang dilatih, — kebijakan referensi, — fungsi jarak, / — jawaban yang dipilih/ditolak. RPO diterapkan dalam pelatihan Nemotron-4 340B Instruct dan model Llama-Nemotron.[27][3][11]
Pembelajaran Penguatan Multi-Lingkungan (RLVR)
Dalam Nemotron 3 diterapkan Multi-environment RLVR (Reinforcement Learning from Verifiable Rewards) — pelatihan simultan pada beberapa lingkungan dalam kerangka NeMo Gym: matematika kompetitif, pemrograman, QA, penggunaan alat (tool-use), mengikuti instruksi (instruction-following), konteks panjang. Algoritmanya adalah GRPO (Group Relative Policy Optimization) dengan masked importance sampling.[2][14]
Nemotron 3 mendukung pengendalian anggaran penalaran (reasoning budget control) yang terperinci: pengguna dapat menetapkan batas token untuk jejak berpikir (thinking trace) melalui tanda dalam template obrolan (pengalihan "detailed thinking on/off" atau pembatasan panjang).[2]
Jajaran Model
Tabel Ringkasan
| Model | Tahun | Total / Parameter Aktif | Konteks | Arsitektur | Fitur Utama |
|---|---|---|---|---|---|
| Nemotron-3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 hari |
| Nemotron-4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34,3% |
| Nemotron-4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98% data sintetis alignment |
| Llama-3.1-Nemotron-70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1% |
| Llama-Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Pengalihan penalaran (Reasoning toggle) |
| Llama-Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Kompresi NAS dari Llama 3.1 8B |
| Llama-Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Dari Llama 3.3 70B |
| Llama-Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Dari Llama 3.1 405B; GPQA 76,0% |
| Nemotron-H 8B | 2025 | 8B / 8B | — | Hibrida Mamba-Transformer | 15T token; 24 Mamba-2 + 24 MLP + 4 Attn |
| Nemotron-H 56B | 2025 | 56B / 56B | — | Hibrida Mamba-Transformer | 20T token FP8; 54 Mamba-2 + 54 MLP + 10 Attn |
| Nemotron-H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hibrida Mamba-Transformer | MiniPuzzle dari 56B; kecepatan +20% |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hibrida Mamba-Transformer | 20T token; distilasi Minitron |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hibrida Mamba-Transformer MoE | 25T token; 128 pakar, 6 aktif |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hibrida LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hibrida LatentMoE | MTP; NVFP4 |
Nemotron-4 15B
Arsitektur: 32 lapisan, hidden dimension 6144, 48 kepala perhatian, 8 kepala KV (GQA). Jumlah total parameter — 15 miliar (3,2 miliar embedding + 12,5 miliar non-embedding). Hasil: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Pada benchmark multibahasa (XCOPA, TyDiQA-GoldP, MGSM), model ini mengungguli model yang empat kali lebih besar.[8]
Nemotron-4 340B
Arsitektur: 96 lapisan, hidden dimension 18.432, 96 kepala perhatian, 8 kepala KV.
Nemotron-4 340B Base menunjukkan: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC-Challenge — 94,3% (25-shot).[3]
Nemotron-4 340B Instruct melewati penyelarasan bertahap: Code SFT → General SFT → DPO → RPO (3 putaran). Hasil: MT-Bench — 8,22 (GPT-4-Turbo judge), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]
Nemotron-4 340B Reward menggantikan lapisan softmax akhir dengan proyeksi linier keadaan tersembunyi lapisan terakhir ke dalam vektor 5 atribut HelpSteer2. Reward akhir adalah jumlah berbobot dari lima atribut. Pelatihan dilakukan selama 2 epoch pada data HelpSteer2 (batch size 128). Pada RewardBench, model ini mencapai 92,0%, melampaui GPT-4o (84,7%), Gemini 1.5 Pro (88,1%), dan Claude-3-Opus (80,7%) pada saat publikasi.[3]
| Model | Arena Hard | AlpacaEval 2.0 LC | MT-Bench |
|---|---|---|---|
| Nemotron-4-340B-Instruct | 54,2 | 41,5% | 8,22 |
| Llama-3-70B-Instruct | 41,1 | 34,4% | 8,16 |
| Mixtral-8x22B-Instruct | 36,4 | 30,9% | 7,63 |
| Qwen-2-72B-Instruct | 48,1 | 38,8% | 8,26 |
Sumber: arXiv:2406.11704, tabel 5.[3]
Llama-3.1-Nemotron-70B
Llama-3.1-Nemotron-70B-Reward dilatih menggunakan metode hibrida yang menggabungkan Bradley-Terry (preferensi berpasangan) dan regresi SteerLM (evaluasi multi-atribut pada skala Likert). Pelatihan dilakukan secara eksklusif pada data HelpSteer2 (CC-BY-4.0). Pada RewardBench, model ini mencapai 94,1%, menempati peringkat ke-1 pada saat publikasi.[10]
Llama-3.1-Nemotron-70B-Instruct diselaraskan menggunakan metode RLHF dengan algoritma REINFORCE (bukan PPO) dan model reward Nemotron-70B-Reward. Infrastrukturnya — NeMo-Aligner dengan akselerasi TRT-LLM.[9]
Llama-Nemotron: Nano, Super, Ultra (2025)
Keluarga model penalaran yang diperoleh dari Llama 3.x menggunakan metode NAS, distilasi, dan pasca-pelatihan yang diperluas.[11]
| Model | Parameter | Model Dasar | Konteks |
|---|---|---|---|
| Llama-Nemotron-Nano 8B | 8 miliar | Llama-3.1-8B-Instruct | 128K |
| Llama-Nemotron-Nano 4B | 4 miliar | Minitron 4B (dari Llama 3.1 8B) | 128K |
| Llama-Nemotron-Super 49B | 49 miliar | Llama-3.3-70B → NAS (Puzzle) | 128K |
| Llama-Nemotron-Ultra 253B | 253 miliar | Llama-3.1-405B → NAS (Puzzle) | 128K |
Pipeline pelatihan lima tahap: (1) NAS + FFN Fusion, (2) distilasi + pra-pelatihan lanjutan, (3) SFT (termasuk jejak penalaran DeepSeek-R1), (4) RL berskala besar (GRPO untuk Ultra, REINFORCE/RLOO + Online RPO untuk Nano), (5) penyelarasan untuk dialog.[11]
Model-model ini menjadi yang pertama di antara LLM terbuka yang mendukung mode penalaran yang dapat diaktifkan/dinonaktifkan (reasoning toggle): ketika diaktifkan ("detailed thinking on" dalam prompt sistem), model menghasilkan rantai penalaran dalam tag <think>...</think> sebelum menjawab; ketika dinonaktifkan — menjawab secara langsung.[11]
Hasil Llama-Nemotron-Ultra 253B (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Sebagai perbandingan: DeepSeek-R1 (671B total / 37B aktif) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Ultra dapat dimuat dalam satu node 8×H100.[11]
Nemotron-H (April 2025)
Keluarga model hibrida padat yang dilatih dari awal dan dirancang untuk tugas dengan generasi panjang. Nemotron-H-56B dilatih pada 20 triliun token dalam FP8 — salah satu eksperimen pra-pelatihan FP8 publik terbesar. Nemotron-H-47B diperoleh dengan mengompres 56B menggunakan metode MiniPuzzle (63 miliar token distilasi) dan dapat dimuat dalam memori satu RTX 5090 (FP4) dengan konteks ~1M token.[12]
| Benchmark | Nemotron-H-56B | Nemotron-H-47B | Qwen-2.5-72B | Llama-3.1-70B |
|---|---|---|---|---|
| MMLU-Pro (5-shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5-shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8-shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0-shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Sumber: arXiv:2504.03624.[12]
Saat menghasilkan output dengan 65.536 token input dan 1024 token output pada H100, model Nemotron-H-47B bekerja 2,9 kali lebih cepat dari Qwen-2.5-72B dan Llama-3.1-70B.[12]
Nemotron Nano 2 (Agustus 2025)
Model Mamba-Transformer hibrida untuk penalaran. Nemotron-Nano-12B-v2-Base — model induk dengan 62 lapisan (terutama Mamba-2 + MLP + 4 lapisan perhatian), dilatih pada 20 triliun token dalam FP8 dari awal. Dari model ini, menggunakan Minitron yang diperluas, diperoleh Nemotron-Nano-9B-v2, yang mampu bekerja dalam konteks 128K token pada satu GPU NVIDIA A10G (22 GB, BF16). Pasca-pelatihan: SFT (80 miliar token, termasuk jejak DeepSeek-R1-0528) → GRPO → DPO → RLHF. Pada benchmark penalaran, model ini sebanding dengan Qwen3-8B dalam hal akurasi, namun mencapai percepatan generasi 3–6 kali lipat untuk urutan output yang panjang.[13]
Nemotron 3 Nano 30B-A3B
Dirilis pada Desember 2025. Parameter: 31,6 miliar total, 3,2 miliar aktif. Arsitektur: 52 lapisan, hidden dimension 2688, dimensi pakar 1856, dimensi keadaan Mamba 128. MoE: 128 pakar yang dapat dirutekan + 1 pakar bersama, 6 aktif per token. Konteks — hingga 1.048.576 token. Pelatihan pada 25 triliun token (jadwal WSD, batch size 3072, batas data — Juni 2025) dalam dua fase: Fase 1 — 23,5 triliun (data beragam), Fase 2 — 1,5 triliun (data berkualitas tinggi) + 121 miliar token CPT konteks panjang.[2]
| Benchmark | Nemotron 3 Nano 30B-A3B | Qwen3-30B-A3B-Thinking | GPT-OSS-20B |
|---|---|---|---|
| MMLU-Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE-Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena-Hard-V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER-100 @ 1M | 86,34 | 77,5 | — |
* — nilai dari sumber sekunder; kondisi reproduksi — NeMo Evaluator SDK. Sumber: arXiv:2512.20848.[2][28]
Throughput (input 8K / output 16K, single H200): 3,3 kali lebih tinggi dari Qwen3-30B-A3B-Thinking dan 2,2 kali lebih tinggi dari GPT-OSS-20B.[2]
Model dan Arah Tambahan
- OpenReasoning-Nemotron (Juli 2025) — rangkaian model 1,5B–32B parameter, berbasis Qwen 2.5 dan di-fine-tuning pada data DeepSeek-R1-0528. Varian 32B dengan GenSelect@64 mengungguli o3 (high) pada sejumlah benchmark matematika.[29]
- Nemotron Elastic (arXiv:2511.16664) — kerangka sub-model bersarang (6B, 9B, 12B) dalam satu model induk, yang mengurangi biaya pelatihan hingga 360 kali dibandingkan pelatihan dari awal.[30]
- Nemotron-CrossThink — kerangka pelatihan penguatan multi-domain di luar tugas matematika, yang memberikan peningkatan +30,1% pada MATH-500 dan +12,8% pada MMLU-PRO.[31]
- Nemotron-UltraLong — perluasan konteks hingga 4 juta token.[32]
- Jet-Nemotron — NAS pasca-pelatihan untuk model hibrida ringkas 2B/4B.[33]
Model Khusus
Dalam ekosistem Nemotron juga terdapat model untuk tugas-tugas khusus:
- Nemotron Nano V2 VL — model vision-language untuk OCR, pemrosesan tabel, dan video.[34]
- Nemotron Parse 1.1 — model untuk OCR dan ekstraksi struktur dokumen.[35]
- Nemotron ColEmbed V2 — model embedding untuk pencarian dokumen visual (late interaction).[36]
- Nemotron Speech — model untuk pengenalan ucapan otomatis (ASR), sintesis ucapan (TTS), dan penerjemahan mesin (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — model klasifikasi konten tidak aman dalam 23 kategori pada 9 bahasa dengan akurasi 84,2%.[37]
Data Pra-Pelatihan
Komposisi Data Nemotron-4
Korpus pra-pelatihan Nemotron-4 15B dan 340B terdiri dari tiga kategori utama: teks bahasa Inggris (70%), teks multibahasa dalam 53 bahasa (15%), dan kode sumber dalam 43 bahasa pemrograman (15%). Deduplikasi pada tingkat dokumen diterapkan (exact dan near-duplicate), serta penyaringan menggunakan model bahasa dan heuristik. Model 15B dilatih pada 8 triliun token, model 340B — pada 9 triliun (8 triliun pra-pelatihan + 1 triliun pembelajaran lanjutan dengan pembobotan ulang sumber berkualitas tinggi).[8][3]
Nemotron-CC
Kumpulan data Nemotron-CC dibentuk dari Common Crawl menggunakan ensemble pengklasifikasi kualitas dan parafrase sintetis teks. Volume total — 6,3 triliun token (4,4 triliun yang dideduplikasi + 1,9 triliun parafrase sintetis). Pipeline terintegrasi ke dalam alat NeMo Curator. Karya ini diterima sebagai Long Paper di konferensi ACL 2025.[38]
Nemotron-CC-Math
Subhimpunan berorientasi matematika bervolume 133 miliar token, diekstraksi dari Common Crawl menggunakan pipeline Lynx + LLM dengan pelestarian struktur rumus matematika dan kode dalam LaTeX.[39]
Data Nemotron 3 Nano
Pra-pelatihan Nemotron 3 Nano dilakukan pada 25 triliun token. Kumpulan data mencakup: Nemotron-CC-v2.1, Nemotron-CC-Code-v1, Nemotron-CC-Math-v1, dan dataset STEM khusus. Untuk pelatihan konteks panjang digunakan tambahan 121 miliar token CPT.[2]
Nemotron Pretraining Dataset v1
Kumpulan data yang dihasilkan secara sintetis, mencakup STEM, teks akademis, tugas penalaran, dan domain multibahasa; berisi lebih dari 10 triliun token bahasa dan 18 juta sampel untuk SFT. Semua kumpulan data didistribusikan di bawah lisensi terbuka yang permisif.[40]
Pipeline Pembuatan Data Sintetis (SDG)
Pipeline yang dijelaskan dalam laporan Nemotron-4 340B mencakup tahap-tahap berikut[3]:
- Pembuatan prompt: permintaan satu dan dua giliran sintetis, dihasilkan menggunakan Mixtral-8x7B-Instruct-v0.1 (lisensi Apache 2.0) berdasarkan template Open QA, Writing, Closed QA, Math & Coding.
- Pembuatan jawaban: beberapa jawaban dari versi model perantara untuk memastikan keberagaman.
- Evaluasi kualitas: tiga pendekatan — Ground-Truth-as-a-Judge (untuk tugas dengan jawaban yang dapat diverifikasi), LLM-as-Judge (perbandingan pasangan jawaban oleh model bahasa), Reward-Model-as-Judge (menggunakan Nemotron-4-340B-Reward).
- Penyelarasan iteratif dari model lemah ke model kuat (weak-to-strong).
Dari ~20.000 contoh yang dianotasi oleh manusia (10.000 untuk SFT, 10.000 HelpSteer2 untuk model reward), seluruh volume data penyelarasan lainnya disintesis.[3]
Kuantisasi dan Optimisasi Inferensi
Model Nemotron 3 Nano mendukung Post-Training Quantization (PTQ) dalam FP8 menggunakan ModelOpt dan Megatron-LM. Kuantisasi selektif diterapkan — lapisan attention dan sebagian Mamba dipertahankan dalam BF16 untuk menjaga kualitas; sisanya dikuantisasi dalam FP8. Menurut laporan teknis, hal ini memberikan ~99% retensi akurasi.[2] Nano juga mendukung inferensi dalam format NVFP4.[1]
Tabel Ringkasan Benchmark Antar Generasi
| Model | MMLU | GSM8K | HumanEval | Arena Hard | MT-Bench | Kondisi |
|---|---|---|---|---|---|---|
| Nemotron-4 15B | 64,2% | 46,0% | 31,6% | — | — | base; 5-/8-/0-shot |
| Nemotron-4 340B Base | 81,1% | — | 57,3% | — | — | 5-/—/0-shot |
| Nemotron-4 340B Instruct | 78,7% | 92,3% | 73,2% | 54,2 | 8,22 | 0-shot |
| Llama-3.1-Nemotron-70B-Instruct | — | — | — | 85,0 | 8,98 | Okt. 2024 |
| LN-Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0%, AIME 80,8% |
| Nemotron-H-47B | 83,6% | 93,3% | 61,0% | — | — | 5-/8-CoT/0-shot |
| Nemotron 3 Nano (30B-A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1%, LCB 68,3% |
Perbandingan ini harus ditafsirkan dengan hati-hati: kondisi evaluasi, versi benchmark, dan tanggal pengujian berbeda antar generasi. Hasil diambil dari laporan teknis NVIDIA; evaluasi independen mungkin berbeda (lihat bagian "Keterbatasan").[8][3][9][11][12][2]
Penerapan
Penerapan melalui NVIDIA NIM
NVIDIA NIM — kumpulan layanan mikro kontainer yang dioptimalkan untuk inferensi dengan API yang kompatibel dengan OpenAI. Model Nemotron tersedia sebagai layanan mikro NIM di platform build.nvidia.com. NIM mendukung format FP8, BF16, NVFP4, dan penerapan melalui Helm chart di Kubernetes. Model juga kompatibel dengan kerangka kerja independen: vLLM, SGLang, Ollama, llama.cpp, TensorRT-LLM.[4][1]
Pembuatan Data Sintetis
Nemotron-4 340B dirancang untuk digunakan sebagai generator data sintetis: model Instruct menghasilkan jawaban, model Reward mengevaluasi dan menyaringnya. Lisensi NVIDIA Open Model License secara eksplisit mengizinkan penggunaan output model untuk melatih model lain. Menurut ServiceNow, 15% dari data pra-pelatihan model Apriel 1.6 mereka diperoleh dari kumpulan data Nemotron.[3][15][41]
Sistem Agentik
Model keluarga Nemotron 3 (Nano, Super, Ultra) dirancang untuk beban kerja multi-agen: perencanaan, retrieval, penggunaan alat (tool use). Nemotron 3 Nano menunjukkan hasil 38,76% pada SWE-Bench (dengan OpenHands) dan 49,04% (rata-rata) pada TauBench V2.[2]
Implementasi Korporat
Di antara mitra yang diumumkan: ServiceNow (model bersama Apriel Nemotron 15B untuk otomatisasi alur kerja), CrowdStrike (platform Charlotte AI), Perplexity (perutean permintaan), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Model tersedia di AWS Amazon Bedrock; dukungan Google Cloud, CoreWeave, Nebius direncanakan.[15]
Keterbatasan dan Masalah Terbuka
Evaluasi Independen dan Perbedaan dengan Data NVIDIA
Evaluasi independen mengungkapkan perbedaan dengan hasil yang dikutip NVIDIA. Menurut data Artificial Analysis (Februari 2026), Llama-Nemotron-Ultra 253B (reasoning) mendapatkan Intelligence Index 15 dengan median 26 untuk model berukuran sebanding. Di platform Chatbot Arena (LMArena), model Nemotron menempati posisi di tengah peringkat: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~posisi ke-147), Nemotron 3 Nano — 1317 ±6 (~posisi ke-164).[42][43]
Verbositas Berlebihan
Model Nemotron menunjukkan verbositas yang tinggi: dalam evaluasi Artificial Analysis, model Nemotron 3 Nano menghasilkan 140 juta token (dengan median 12 juta untuk model lain), yang meningkatkan biaya inferensi. Analisis DEV Community mengungkapkan bahwa Llama-3.1-Nemotron-70B-Instruct, meski secara formal memimpin pada benchmark otomatis, menunjukkan akurasi yang tidak memadai pada sejumlah tugas praktis, dan skor tinggi pada benchmark sejenis Arena mungkin disebabkan oleh preferensi terhadap jawaban yang panjang dan percaya diri, namun belum tentu akurat.[42][44]
Halusinasi dan Bias
NVIDIA dalam kartu model menyatakan bahwa model dapat "memperkuat bias dan menghasilkan respons yang bersifat toksik, terutama pada prompt yang bersifat toksik", serta "menghasilkan informasi yang tidak akurat, menghilangkan detail penting". Keterbukaan bobot dan data memungkinkan audit eksternal.[11][13]
Persyaratan Komputasi
Model padat (Nemotron-4 340B) membutuhkan kluster 768 node DGX H100 untuk pelatihan penuh, yang membatasi reproduksibilitas bagi kelompok akademis tanpa akses ke infrastruktur serupa. Konteks panjang (1M) saat inferensi membutuhkan kapasitas VRAM yang signifikan.[3][2]
Degradasi saat Perluasan Konteks
Ketika konteks diperluas ke urutan yang sangat panjang, terjadi degradasi hasil pada benchmark dengan konteks pendek.[32]
Kuantisasi Arsitektur Hibrida
Penggunaan presisi sangat rendah (FP8/NVFP4) dalam arsitektur Mamba-Transformer menyebabkan penurunan akurasi kecil (~1% pada sejumlah benchmark). Masalah ini diatasi dengan penerapan kuantisasi selektif, yang memperumit arsitektur kompiler dan server inferensi.[2][1]
Masalah Terbuka Lainnya
- Ketergantungan pada benchmark dengan kemungkinan kontaminasi data pelatihan.
- Tidak adanya protokol perbandingan yang terstandarisasi untuk arsitektur hibrida SSM-Transformer dengan model Transformer murni.
- Pertanyaan tentang skalabilitas pendekatan MoE untuk tugas yang membutuhkan penalaran mendalam dengan sedikit pakar aktif per token.
- Data tentang Super/Ultra per Desember 2025 bersifat sementara; benchmark lengkap diharapkan setelah rilis.[1]
Aspek Etika dan Regulasi
Keamanan dalam Tahap Pengembangan
Dalam tahap pengembangan diterapkan: evaluasi berdasarkan kerangka AEGIS (13 kategori keamanan konten), pemindai kerentanan garak, dan pengujian merah (red-teaming) secara manual.[37]
Keamanan dalam Tahap Inferensi
NeMo Guardrails — perangkat sumber terbuka (lisensi Apache 2.0) yang menambahkan penghalang terprogram pada sistem LLM. Layanan mikro ini mencegat input dan output, menerapkan pemeriksaan yang dapat dikonfigurasi: kontrol topik, deteksi PII, verifikasi "grounding" RAG, deteksi serangan jailbreak (termasuk perlindungan dari injeksi kode berbasis YARA), klasifikasi keamanan multibahasa dan multimodal.[45]
Untuk Nemotron 3, diterbitkan kumpulan berisi ~11.000 jejak OpenTelemetry berlabel dari skenario realistis penggunaan alat, yang dirancang untuk mengevaluasi keamanan agentik.[1]
Lisensi
| Model | Lisensi |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron-4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama-Nemotron (Nano/Super/Ultra) | Llama Community License (diwarisi dari Meta) |
| Nemotron-3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License mengizinkan penggunaan komersial, pembuatan dan distribusi karya turunan, tidak memerlukan atribusi (dengan tetap menyimpan file NOTICE), tidak memberlakukan batasan pada jumlah pengguna, dan secara eksplisit mengizinkan penggunaan output model untuk melatih model lain.[46] Model berbasis Llama mewarisi pembatasan Meta, termasuk ambang batas 700 juta pengguna aktif bulanan.[11]
Untuk Nemotron 3 Nano, NVIDIA menerbitkan: bobot model, lebih dari 10 triliun token data pelatihan, resep pelatihan, basis kode (NeMo, Megatron-LM, NeMo-Aligner), lebih dari 10 lingkungan pelatihan penguatan dengan 900.000+ tugas.[1][2]
Prospek dan Arah Penelitian
Rilis terdekat mencakup Nemotron 3 Super (~100 miliar parameter, ~10 miliar aktif) dan Nemotron 3 Ultra (~500 miliar, ~50 miliar aktif), yang diharapkan pada paruh pertama tahun 2026. Kedua model akan menggunakan LatentMoE, MTP, dan pelatihan dalam format NVFP4 pada arsitektur Blackwell.[1]
Arah strategis NVIDIA adalah memposisikan Nemotron bukan sebagai model tunggal, melainkan sebagai lapisan infrastruktur untuk sistem multi-agen, di mana berbagai model dalam keluarga digunakan untuk tugas-tugas berbeda dengan perutean berdasarkan kompleksitas.[1][15]
Arah penelitian utama:
- Pengembangan arsitektur hibrida — integrasi lebih lanjut lapisan SSM dengan mekanisme perhatian untuk konteks panjang yang dapat diskalakan.[12]
- Metode kompresi bertingkat — pengembangan Minitron, Puzzle, MiniPuzzle, dan Nemotron Elastic.[20][21][30]
- Pelatihan penguatan multi-domain — Nemotron-CrossThink untuk memperluas RL di luar tugas matematika.[31]
- Perluasan konteks — Nemotron-UltraLong hingga 4 juta token.[32]
- Multimodalitas — perluasan ke bidang vision-language (Nemotron VL), ucapan (Nemotron Speech), pencarian dokumen visual (Nemotron ColEmbed V2).[34][35][36]
- Model hibrida ringkas — Jet-Nemotron (NAS untuk model 2B/4B).[33]
- Resep terbuka — publikasi resep pelatihan lengkap dan data untuk reproduksi dan kustomisasi oleh komunitas.[14]
Lihat Juga
- Arsitektur Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (keluarga model Meta)
Referensi
- NVIDIA Research — halaman Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — dokumentasi Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Literatur
- NVIDIA. Nemotron-3-8B-Base-4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron-4 15B Technical Report. arXiv:2402.16819, Februari 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron-4 340B Technical Report. arXiv:2406.11704, Juni 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open-source Dataset for Training Top-Performing Reward Models. arXiv:2406.08673, Juni 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, Juli 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation-Based NAS for Inference-Optimized LLMs. arXiv:2411.19146, November 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward-aware Preference Optimization. arXiv:2502.00203, Januari 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models. arXiv:2504.03624, April 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama-Nemotron: Efficient Reasoning Models. arXiv:2505.00949, Mei 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, Agustus 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron-CC-Math. arXiv:2508.15096, Agustus 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, November 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, Desember 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, Desember 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Catatan
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/