---
title: "Nemotron (NVIDIA) (TR)"
source: "https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)"
wiki: "systems-analysis.info/int"
article: "Nemotron_(NVIDIA)_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 4859
wiki_created_at: 2026-09-06T23:41:02Z
wiki_modified_at: 2026-09-06T23:41:02Z
downloaded_at: 2026-09-07T23:05:17Z
---

# Nemotron (NVIDIA) (TR)

**Nemotron** — açık ağırlıklı büyük dil modelleri (Large Language Model, LLM) ailesidir; NVIDIA bünyesindeki Applied Deep Learning Research (ADLR) birimi tarafından geliştirilmiştir. Modeller, makine öğrenmesi ve doğal dil işleme (Natural Language Processing, NLP) alanına aittir; sentetik veri üretimi, akıl yürütme (reasoning), ajan tabanlı uygulamalar (agentic AI) ve NVIDIA endüstriyel donanımına dağıtım gibi geniş bir görev yelpazesi için tasarlanmıştır. Aile, 4 milyardan yaklaşık 500 milyar parametreye kadar uzanan çeşitli mimari ve ölçeklerde modeller barındırmaktadır: Nemotron‑4 serisi yoğun (dense) decoder‑only Transformer modelleri (2024), hibrit Mamba‑Transformer modelleri (Nemotron‑H, 2025) ve Nemotron 3 serisinde Mixture-of-Experts (MoE) içeren hibrit Mamba‑Transformer modelleri (2025). Mart 2026 itibarıyla aile; metin üretimi, akıl yürütme, belge görsel anlama, bilgi çıkarma ve yanıt kalitesi değerlendirme görevlerini kapsayan 20'den fazla modeli bünyesinde barındırmaktadır. Modeller ağırlıklı olarak NVIDIA Open Model License ve Llama Community License lisansları altında açık ağırlıklarla yayımlanmaktadır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

## Tarihçe ve Arka Plan

Nemotron ailesinin geliştirilmesi, NVIDIA'nın üretici yapay zeka için eksiksiz bir araç yığını oluşturma stratejisi çerçevesinde sürdürülmektedir: eğitim altyapısından (DGX, H100/B200 GPU tabanlı süperbilgisayarlar) eğitim platformlarına (NeMo Framework), hizalama platformlarına (NeMo‑Aligner), dağıtım platformlarına (NIM — NVIDIA Inference Microservices) ve güvenlik araçlarına (NeMo Guardrails) kadar geniş bir yelpazede yer almaktadır.<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NV_developer-4)[\[5\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NeMo_docs-5)</sup>

### Nemotron‑3 8B (2023)

Serinin kamuya açık ilk modeli — 8 milyar parametreli, 4096 token bağlam uzunluğuna sahip decoder Transformer modelidir; 53 doğal dil ve 37 programlama dilinde **3,8 trilyon token** üzerinde eğitilmiştir. Eğitim, 1024 A100 GPU üzerinde 19 günde tamamlanmıştır. arXiv'de resmi bir teknik rapor yayımlanmamıştır. Model, NeMo Framework ve Hugging Face aracılığıyla dağıtılmış; Chat (SFT ve SteerLM) varyantları da bulunmaktaydı. Lisansı — NVIDIA AI Foundation Models Community License.<sup>[\[6\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_8B_card-6)[\[7\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-MS_nemotron3-7)</sup>

*İsimlendirme hakkında not*: 2023 yılının «Nemotron‑3» modeli ile Aralık 2025'in «Nemotron 3» modeli birbirinden farklıdır. İlki erken bir prototipken, ikincisi MoE mimarisine sahip güncel nesil modeldir.

### Nemotron‑4 15B (Şubat 2024)

Nemotron‑4 serisinin kamuoyuna belgelenmiş ilk sürümü — 15 milyar parametreli bir modeldir; 384 DGX H100 düğümünde (3072 GPU'ya kadar) yaklaşık 13 takvim günü içinde 8 trilyon token üzerinde eğitilmiştir. 8 katlı tensör paralelizmi ve 96'dan 288'e kadar veri paralelizmi kullanılmıştır. Batch size 384'te tepe MFU (Model FLOPs Utilization) değeri %34,3 olmuştur. Mimari — Grouped‑Query Attention (GQA) ve Rotary Position Embeddings (RoPE) içeren decoder‑only Transformer'dır. Yayın tarihi itibarıyla yapılan benchmark sonuçlarına göre model, çok dilli görevlerde boyutuna yakın tüm açık modelleri geride bırakmış; hatta kendisinden dört kat büyük bazı modelleri de geçmiştir.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B (Haziran 2024)

Haziran 2024'te Nemotron‑4 serisinin en büyük modeli yayımlandı — 340 milyar parametre (331,6 milyar gömülü olmayan parametre); yüksek kaliteli kaynaklara yeniden ağırlık verilerek gerçekleştirilen 9 trilyon token üzerinde ön eğitimle (8 trilyon ön eğitim + 1 trilyon sürdürülen eğitim) eğitilmiştir. Eğitim, Aralık 2023'ten Mayıs 2024'e kadar süren süreçte 768 DGX H100 düğümünde (6144 GPU'ya kadar) %42,4 tepe MFU ile gerçekleştirilmiştir. Aile üç varyant içermektedir: Base, Instruct ve Reward. Modelin boyutu, FP8 hassasiyet formatında dağıtım sırasında tek bir DGX H100 düğümüne (8 GPU) sığacak şekilde seçilmiştir. Hizalamada (alignment) kullanılan verilerin %98'inden fazlası, modeller tarafından yinelemeli bir süreçte sentetik olarak üretilmiştir; sentetik veri üretim hattı yeniden üretim için kamuya açıktır.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B (Ekim 2024)

Ekim 2024'te Meta Llama‑3.1‑70B‑Instruct modelinden ince ayar yapılarak elde edilen modeller yayımlandı: Llama‑3.1‑Nemotron‑70B‑Instruct ve Llama‑3.1‑Nemotron‑70B‑Reward. 1 Ekim 2024 itibarıyla Instruct modeli aynı anda üç otomatik benchmark'ta birinci sıraya yerleşti: Arena Hard — 85,0, AlpacaEval 2 LC — %57,6, MT‑Bench (GPT‑4‑Turbo) — 8,98. Reward modeli ise RewardBench'te %94,1 değerine ulaştı.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LN70B_Instruct-9)[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LN70B_Reward-10)</sup>

### Hibrit Mimarilere Geçiş (2025)

2025 yılında seri, Mamba‑2 (State Space Model, SSM — durum uzayı modeli) katmanlarını ve Transformer katmanlarını bir araya getiren hibrit mimarilerle genişledi. Mart–Mayıs 2025'te, değiştirilebilir akıl yürütme moduna sahip **Llama‑Nemotron** akıl yürütme modelleri ailesi (Nano 8B, Super 49B, Ultra 253B) yayımlandı.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup> Nisan 2025'te **Nemotron‑H** (arXiv:2504.03624) yayımlandı — 8B, 56B ve 47B parametreli hibrit Mamba‑Transformer modelleri ailesi.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup> Ağustos 2025'te **Nemotron Nano 2** (9B‑v2, arXiv:2508.14444) tanıtıldı.<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nano2-13)</sup>

### Nemotron 3 (Aralık 2025)

15 Aralık 2025'te üçüncü nesil duyuruldu — Nano, Super ve Ultra modellerini barındıran Nemotron 3 ailesi; 1 milyon tokena kadar bağlam penceresiyle Mamba‑2, Transformer ve MoE mimarilerini bir araya getirmektedir. Nano, teknik raporuyla birlikte yayımlandı; Super ve Ultra 2026'nın ilk yarısı için planlanmaktadır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_blog-14)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NVIDIA_news-15)</sup>

## Teorik Temeller

### Nemotron‑4'te Transformer Mimarisi

Nemotron‑4 serisinin modelleri, nedensel dikkat mekanizmasına sahip standart decoder Transformer mimarisi üzerine inşa edilmiştir. Token dizisinin olasılığı $x_{1},x_{2},\ldots,x_{T}$ şu şekilde çarpanlarına ayrılır:

$$
p(x_{1},\ldots,x_{T}) = \prod\limits_{t = 1}^{T}p(x_{t} \mid x_{1},\ldots,x_{t - 1};\theta),
$$

burada $\theta$ — model parametreleridir.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)</sup>

Dikkat mekanizması, Grouped‑Query Attention (GQA) varyantında uygulanmıştır<sup>[\[16\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-GQA-16)</sup>:

$$
\operatorname{Attention}(Q,K,V) = \operatorname{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V,
$$

burada $Q,K,V$ — sorgu, anahtar ve değer matrisleri; $d_{k}$ — dikkat kafası boyutudur.

Konum kodlaması için Rotary Position Embeddings (RoPE) kullanılmaktadır<sup>[\[17\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-RoPE-17)</sup>:

$$
\operatorname{RoPE}(x_{m},m) = \begin{pmatrix}
{x_{m}^{(1)}\cos m\theta_{1} - x_{m}^{(2)}\sin m\theta_{1}} \\
{x_{m}^{(1)}\sin m\theta_{1} + x_{m}^{(2)}\cos m\theta_{1}} \\
 \vdots 
\end{pmatrix},
$$

burada $x_{m}$ — $m$ konumundaki vektör, $\theta_{i} = 10000^{- 2i/d}$, $d$ — vektör boyutudur.

MLP katmanlarında Squared ReLU aktivasyonu kullanılmaktadır: $f(x) = (\max(0,x))^{2}$; bu, aktivasyon seyrekliği sağlamaktadır. Modellerde ek terim (bias) bulunmamakta, dropout kullanılmamakta ve giriş ile çıkış gömme matrisleri birbirine bağlı değildir (untied embeddings). Tokenizer — boşluk korumalı, rakam karaktere göre bölümlü ve bayt tabanlı geri dönüş mekanizmalı SentencePiece BPE; sözlük boyutu — 256 000.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

##### Nemotron‑4 Mimari Parametreleri

| Parametre         | Nemotron‑4 15B               | Nemotron‑4 340B               |
|-------------------|------------------------------|-------------------------------|
| Parametre sayısı  | 15 milyar (3,2 milyar gömme) | 340 milyar (9,4 milyar gömme) |
| Katman sayısı     | 32                           | 96                            |
| Gizli boyut       | 6144                         | 18 432                        |
| Dikkat kafaları   | 48                           | 96                            |
| KV‑kafaları (GQA) | 8                            | 8                             |
| Bağlam uzunluğu   | 4096                         | 4096                          |
| Sözlük boyutu     | 256 000                      | 256 000                       |

Kaynaklar: arXiv:2402.16819, arXiv:2406.11704.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

### Nemotron‑H'ın Hibrit Mamba‑Transformer Mimarisi

Nemotron‑H modellerinde standart öz-dikkat blokları kısmen Mamba‑2 blokları — durum uzayı modelleri (State Space Models, SSM) — ile değiştirilmiştir. Otoregresif üretim sırasında her öz-dikkat katmanı, adım başına $O(n)$ işlem ve bellek gerektirirken (KV önbelleği nedeniyle), Mamba katmanları üretilen her token için sabit bellek ve hesaplama maliyeti sağlamaktadır.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

Mamba‑2 şu tekrarlı bağıntıyla tanımlanmaktadır<sup>[\[18\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Mamba2-18)</sup>:

$$
h_{t} = Ah_{t - 1} + Bx_{t},\quad y_{t} = Ch_{t},
$$

burada $h_{t} \in {\mathbb{R}}^{N}$ — gizli durum, $A \in {\mathbb{R}}^{N \times N}$ — köşegen durum geçiş matrisi, $B \in {\mathbb{R}}^{N \times 1}$ ve $C \in {\mathbb{R}}^{1 \times N}$ — projeksiyon matrisleri, $x_{t}$ — giriş tokeni, $y_{t}$ — çıkış sinyalidir. Mamba‑2'de $A$, $B$, $C$ matrisleri giriş bağımlıdır (input‑dependent); bu özellik modeli klasik doğrusal SSM'lerden ayırmaktadır.

Nemotron‑H‑56B'de **54 Mamba‑2 katmanı + 54 MLP katmanı + 10 öz-dikkat katmanı** kullanılmaktadır; dikkat katmanları Mamba katmanları arasına eşit aralıklarla yerleştirilmiştir. Model, 6144 H100 GPU üzerinde FP8 (tensör başına ölçekleme) formatında 20 trilyon token üzerinde eğitilmiştir. Nemotron‑H‑8B versiyonu 24 Mamba‑2 katmanı, 24 MLP katmanı ve 4 öz-dikkat katmanı içermekte; eğitim 15 trilyon token üzerinde gerçekleştirilmiştir.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

### Nemotron 3'ün MoE Mimarisi

Nemotron 3 modelleri (Aralık 2025) üç mimari bileşeni bir araya getirmektedir: Mamba‑2, Transformer ve Mixture‑of‑Experts.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup> Nemotron 3 Nano (30B‑A3B) 52 katman içermektedir: **23 Mamba‑2 + MoE katmanı, 23 MoE katmanı ve 6 GQA dikkat katmanı**. Her MoE katmanı, token başına 6 uzman etkinleştirilen 128 yönlendirilebilir (routed) uzman + 1 ortak (shared) uzman barındırmaktadır. Yönlendirme, sigmoid gating'li eğitilebilir MLP yönlendiricisi tarafından gerçekleştirilmektedir. Yük dengeleme, yardımcı kayıp fonksiyonu olmadan (aux‑loss‑free) uygulanmaktadır. Toplam parametre sayısı 31,6 milyar olmakla birlikte, token başına yalnızca 3,2 milyar parametre etkindir.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

Normalizasyon — RMSNorm<sup>[\[19\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-RMSNorm-19)</sup>. Mamba bölümlerinde konum gömmeleri bulunmamaktadır (konum bilgisi SSM durumunda örtük olarak yer almaktadır). Bağlı olmayan gömmeler kullanılmakta; doğrusal katmanlarda dropout ve bias yer almamaktadır.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

### Super/Ultra'daki Uzantılar: LatentMoE ve Multi‑Token Prediction

Nemotron 3 ailesindeki Super ve Ultra modelleri iki ek mimari yenilik uygulamaktadır:

- **Latent MoE (LatentMoE)** — yönlendirmeden önce giriş temsilini daha küçük boyutlu bir gizli uzaya projekte etme; bu, benzer hesaplama maliyetiyle uzman sayısını artırmayı ve verim düşürmeden doğruluğu iyileştirmeyi sağlar.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>
- **Multi‑Token Prediction (MTP)** — aynı anda birden fazla sonraki tokenin tahmin edilmesi; uzun metinlerin kalitesini iyileştirmek ve çıkarım sırasında spekülatif kod çözme için kullanılır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

Super ve Ultra'nın eğitimi, Blackwell mimarisinde NVIDIA'nın 4 bitlik sayı formatı olan NVFP4 formatında gerçekleştirilmektedir.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

### Model Sıkıştırma Yöntemleri: Minitron, Puzzle, MiniPuzzle

NVIDIA, kompakt modeller oluşturmak için çeşitli yaklaşımlar kullanmaktadır:

- **Minitron** — yapısal budama (pruning) ve bilgi damıtma (knowledge distillation) yöntemi. İki tür budama araştırılmaktadır: derinlik bazlı (katman kaldırma) ve genişlik bazlı (gizli katman boyutlarının, dikkat kafalarının ve MLP projeksiyon boyutlarının birlikte küçültülmesi). Minitron'un Nemotron‑4 15B'ye uygulanması, sıfırdan eğitime kıyasla 40 kata kadar eğitim maliyeti azaltımıyla 8B ve 4B modeller elde edilmesini sağlamaktadır.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Minitron-20)</sup>
- **Puzzle** — her bloğun optimal yapılandırmasını (KV kafa sayısı, FFN boyutu, dikkat varlığı/yokluğu) blok bazında damıtmayla belirleyen bir Neural Architecture Search (NAS) algoritmasıdır. Llama 3.1 405B bu yöntemle 253B'ye (Llama‑Nemotron Ultra) ve Llama 3.3 70B 49B'ye (Llama‑Nemotron Super) sıkıştırılmıştır.<sup>[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Puzzle-21)</sup>
- **MiniPuzzle** — Nemotron‑H‑56B'yi yalnızca 63 milyar token damıtmayla 47B'ye sıkıştıran, hibrit mimariler için Puzzle'ın genişletilmiş versiyonudur. Benzer doğrulukta sıkıştırılmış model %20 daha hızlı çıkarım yapmaktadır.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

## Hizalama Yöntemleri

### HelpSteer ve HelpSteer2

**HelpSteer** — Scale AI ile ortaklaşa oluşturulan, her yanıtın beş özelliğe göre (0–4 Likert ölçeğiyle) etiketlendiği 37 120 örnekten oluşan bir veri kümesidir (CC‑BY‑4.0 lisansı): yararlılık (helpfulness), doğruluk (correctness), tutarlılık (coherence), karmaşıklık (complexity) ve ayrıntı düzeyi (verbosity).<sup>[\[22\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-HelpSteer-22)</sup>

**HelpSteer2** — örneklerin %95'inden fazlasının ShareGPT'den (gerçek kullanıcı sorguları) alındığı 21 362 örnekten (10 681 istem × 2 yanıt) oluşan güncellenmiş bir veri kümesidir. Etiketlerin yaklaşık %50'si yetersiz kalite gerekçesiyle filtrelenmiştir. **HelpSteer2‑Preference** uzantısı, aynı veriler üzerinde hem regresyon hem de ikili tercih ödül modellerinin eğitilmesine olanak tanıyan ikili açıklayıcı tercihleri eklemektedir.<sup>[\[23\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-HelpSteer2-23)[\[24\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-HelpSteer2_Pref-24)</sup>

### SteerLM

**SteerLM** — çıkarım sırasında kullanıcının yanıt stilini kontrol etmesine olanak tanıyan, özellikler (helpfulness, correctness, coherence, complexity, verbosity) üzerinde koşullanmayla gerçekleştirilen SFT (Supervised Fine‑Tuning — denetimli ince ayar) yöntemidir. Süreç şu adımları kapsamaktadır: (1) HelpSteer üzerinde özellik tahmin modeli (APM) eğitimi, (2) APM ile veri etiketleme, (3) hedef özellik değerlerine koşullu SFT, (4) önyükleme (bootstrapping).<sup>[\[25\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-SteerLM-25)</sup>

### DPO ve RPO

**DPO (Direct Preference Optimization)** — açık bir ödül modeli olmaksızın doğrudan tercih optimizasyonu yöntemidir; Nemotron‑4 340B Instruct ve Nemotron Nano 2 hatlarında kullanılmaktadır.<sup>[\[26\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-DPO-26)</sup>

**RPO (Reward‑aware Preference Optimization)** — DPO, IPO, SimPO, REINFORCE ve SteerLM 2.0'ı özel durumlar olarak genelleştiren, NVIDIA'nın birleşik matematiksel çerçevesidir. RPO, örtük ödül modelinin tahminleri ile hedef açık model arasındaki mesafeyi minimize eder<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-RPO-27)</sup>:

$$
\mathcal{L}_{\text{RPO}}(\theta) = {\mathbb{E}}_{(x,y_{w},y_{l}) \sim \mathcal{D}}\left\lbrack d\!\left( r_{\phi}(x,y_{w}) - r_{\phi}(x,y_{l}),\;\beta\log\frac{\pi_{\theta}(y_{w}|x)}{\pi_{\text{ref}}(y_{w}|x)} - \beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\text{ref}}(y_{l}|x)} \right) \right\rbrack,
$$

burada $r_{\phi}$ — açık ödül modeli, $\pi_{\theta}$ — eğitilen politika, $\pi_{\text{ref}}$ — referans politika, $d( \cdot , \cdot )$ — mesafe fonksiyonu, $y_{w}$/$y_{l}$ — tercih edilen/reddedilen yanıttır. RPO, Nemotron‑4 340B Instruct ve Llama‑Nemotron modellerinin eğitiminde kullanılmaktadır.<sup>[\[27\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-RPO-27)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

### Çok Ortamlı Pekiştirmeli Öğrenme (RLVR)

Nemotron 3'te Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) uygulanmaktadır — NeMo Gym çerçevesinde rekabetçi matematik, programlama, soru-cevap, araç kullanımı (tool‑use), talimat takibi ve uzun bağlam gibi birden fazla ortamda eş zamanlı eğitim. Algoritma — maskelenmiş önem örneklemeli GRPO (Group Relative Policy Optimization).<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_blog-14)</sup>

Nemotron 3, **akıl yürütme bütçesi kontrolü** (reasoning budget control) için ayrıntılı destek sunmaktadır: kullanıcı, sohbet şablonundaki bayrak aracılığıyla düşünce izlemine (thinking trace) token sınırı belirleyebilir («detailed thinking on/off» geçişi veya uzunluk sınırlaması).<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

## Model Ailesi

### Özet Tablo

| Model                         | Yıl       | Toplam / Aktif Parametre | Bağlam    | Mimari                         | Temel Özellikler                                                  |
|-------------------------------|-----------|--------------------------|-----------|--------------------------------|-------------------------------------------------------------------|
| **Nemotron‑3 8B**             | 2023      | 8B / 8B                  | 4K        | Dense Transformer              | 3,8T token; 1024 GPU A100; 19 gün                                 |
| **Nemotron‑4 15B**            | 2024      | 15B / 15B                | 4K        | Dense Transformer              | 8T token; MFU %34,3                                               |
| **Nemotron‑4 340B**           | 2024      | 340B / 340B              | 4K        | Dense Transformer              | 9T token; Base/Instruct/Reward; hizalama için \>%98 sentetik veri |
| **Llama‑3.1‑Nemotron‑70B**    | 2024      | 70B / 70B                | 128K      | Dense Transformer (Llama 3.1)  | RLHF (REINFORCE); RewardBench %94,1                               |
| **Llama‑Nemotron Nano 8B**    | 2025      | 8B / 8B                  | 128K      | Dense Transformer (Llama 3.1)  | Reasoning toggle                                                  |
| **Llama‑Nemotron Nano 4B**    | 2025      | 4B / 4B                  | 128K      | Dense Transformer (Minitron)   | Llama 3.1 8B'den NAS sıkıştırma                                   |
| **Llama‑Nemotron Super 49B**  | 2025      | 49B / 49B                | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.3 70B'den                                                 |
| **Llama‑Nemotron Ultra 253B** | 2025      | 253B / 253B              | 128K      | Dense Transformer (Puzzle NAS) | Llama 3.1 405B'den; GPQA %76,0                                    |
| **Nemotron‑H 8B**             | 2025      | 8B / 8B                  | —         | Hibrit Mamba‑Transformer       | 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn                           |
| **Nemotron‑H 56B**            | 2025      | 56B / 56B                | —         | Hibrit Mamba‑Transformer       | 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn                      |
| **Nemotron‑H 47B**            | 2025      | 47B / 47B                | ~1M (FP4) | Hibrit Mamba‑Transformer       | 56B'den MiniPuzzle; +%20 hız                                      |
| **Nemotron Nano 2 (9B)**      | 2025      | 12B → 9B / 9B            | 128K      | Hibrit Mamba‑Transformer       | 20T token; Minitron damıtma                                       |
| **Nemotron 3 Nano**           | 2025      | 31,6B / 3,2B             | 1M        | Hibrit Mamba‑Transformer MoE   | 25T token; 128 uzman, 6 aktif                                     |
| **Nemotron 3 Super**          | 2025–2026 | ~100B / ~10B             | 1M        | Hibrit LatentMoE               | MTP; NVFP4                                                        |
| **Nemotron 3 Ultra**          | 2025–2026 | ~500B / ~50B             | 1M        | Hibrit LatentMoE               | MTP; NVFP4                                                        |

### Nemotron‑4 15B

Mimari: 32 katman, hidden dimension 6144, 48 dikkat kafası, 8 KV kafası (GQA). Toplam parametre sayısı — 15 milyar (3,2 milyar gömme + 12,5 milyar gömme dışı). Sonuçlar: MMLU — %64,2 (5‑shot), BBH — %58,7 (3‑shot), GSM8K — %46,0 (8‑shot, maj@1), HumanEval — %31,6 (0‑shot, pass@1). Çok dilli benchmark'larda (XCOPA, TyDiQA‑GoldP, MGSM) model, kendisinden 4 kat büyük modelleri geride bırakmıştır.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)</sup>

### Nemotron‑4 340B

Mimari: 96 katman, hidden dimension 18 432, 96 dikkat kafası, 8 KV kafası.

**Nemotron‑4 340B Base** şu sonuçları gösterdi: MMLU — %81,1 (5‑shot), BBH — %85,4 (3‑shot), HumanEval — %57,3 (0‑shot), ARC‑Challenge — %94,3 (25‑shot).<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Instruct** çok aşamalı hizalamadan geçirildi: Code SFT → General SFT → DPO → RPO (3 tur). Sonuçlar: MT‑Bench — 8,22 (GPT‑4‑Turbo yargıcı), MMLU — %78,7 (0‑shot), GSM8K — %92,3 (0‑shot), HumanEval — %73,2 (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — %41,5.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

**Nemotron‑4 340B Reward**, son softmax katmanını son katmanın gizli durumunu 5 HelpSteer2 özelliğinden oluşan bir vektöre doğrusal olarak projekte eden bir katmanla değiştirir. Nihai ödül, beş özelliğin ağırlıklı toplamıdır. Eğitim, HelpSteer2 verileri üzerinde 2 epoch boyunca (batch size 128) gerçekleştirilmiştir. RewardBench'te model, yayın tarihi itibarıyla GPT‑4o (%84,7), Gemini 1.5 Pro (%88,1) ve Claude‑3‑Opus'u (%80,7) geçerek %92,0 değerine ulaşmıştır.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

| Model                    | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|--------------------------|------------|-------------------|----------|
| Nemotron‑4‑340B‑Instruct | 54,2       | %41,5             | 8,22     |
| Llama‑3‑70B‑Instruct     | 41,1       | %34,4             | 8,16     |
| Mixtral‑8x22B‑Instruct   | 36,4       | %30,9             | 7,63     |
| Qwen‑2‑72B‑Instruct      | 48,1       | %38,8             | 8,26     |

Kaynak: arXiv:2406.11704, Tablo 5.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

### Llama‑3.1‑Nemotron‑70B

**Llama‑3.1‑Nemotron‑70B‑Reward**, Bradley‑Terry (ikili tercihler) ve SteerLM regresyonunu (Likert ölçeğinde çok özellikli değerlendirme) bir araya getiren hibrit bir yöntemle eğitilmiştir. Eğitim yalnızca HelpSteer2 verileri (CC‑BY‑4.0) kullanılarak gerçekleştirilmiştir. RewardBench'te model, yayın tarihi itibarıyla birinci sıraya yerleşerek %94,1 değerine ulaşmıştır.<sup>[\[10\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LN70B_Reward-10)</sup>

**Llama‑3.1‑Nemotron‑70B‑Instruct**, PPO değil REINFORCE algoritması ve Nemotron‑70B‑Reward ödül modeliyle RLHF yöntemiyle hizalanmıştır. Altyapı — TRT‑LLM hızlandırmalı NeMo‑Aligner.<sup>[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LN70B_Instruct-9)</sup>

### Llama‑Nemotron: Nano, Super, Ultra (2025)

NAS, damıtma ve kapsamlı son eğitim yöntemleriyle Llama 3.x'ten elde edilen akıl yürütme modelleri ailesi.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

| Model                     | Parametre  | Temel Model                    | Bağlam |
|---------------------------|------------|--------------------------------|--------|
| Llama‑Nemotron‑Nano 8B    | 8 milyar   | Llama‑3.1‑8B‑Instruct          | 128K   |
| Llama‑Nemotron‑Nano 4B    | 4 milyar   | Minitron 4B (Llama 3.1 8B'den) | 128K   |
| Llama‑Nemotron‑Super 49B  | 49 milyar  | Llama‑3.3‑70B → NAS (Puzzle)   | 128K   |
| Llama‑Nemotron‑Ultra 253B | 253 milyar | Llama‑3.1‑405B → NAS (Puzzle)  | 128K   |

Beş aşamalı eğitim hattı: (1) NAS + FFN Fusion, (2) damıtma + sürdürülen ön eğitim, (3) SFT (DeepSeek‑R1 akıl yürütme izleri dahil), (4) ölçekli RL (Ultra için GRPO, Nano için REINFORCE/RLOO + Online RPO), (5) diyalog hizalaması.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

Modeller, açık LLM'ler arasında ilk kez **değiştirilebilir akıl yürütme modu** (reasoning toggle) desteği sunmaktadır: etkin olduğunda («detailed thinking on» sistem isteğinde) model, yanıttan önce `<think>...</think>` etiketleri içinde akıl yürütme zinciri üretir; devre dışı bırakıldığında doğrudan yanıt verir.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

Llama‑Nemotron‑Ultra 253B sonuçları (reasoning ON): GPQA Diamond — %76,0, AIME 2024 — %80,8, MATH 500 — ~%97. Karşılaştırma için: DeepSeek‑R1 (671B toplam / 37B aktif) — GPQA Diamond %71,5, AIME 2024 ~%79,8. Ultra, 8×H100'lü tek bir düğüme sığmaktadır.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

### Nemotron‑H (Nisan 2025)

Uzun üretim gerektiren görevler için tasarlanmış, sıfırdan eğitilmiş yoğun hibrit modeller ailesi. Nemotron‑H‑56B, FP8 formatında 20 trilyon token üzerinde eğitilmiştir — FP8 ön eğitimi alanında kamuoyuyla paylaşılmış en büyük deneylerden biridir. Nemotron‑H‑47B, 56B modelinden MiniPuzzle yöntemiyle (63 milyar token damıtma) sıkıştırılmıştır; 1M token bağlamda tek bir RTX 5090'ın belleğine (FP4) sığmaktadır.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

| Benchmark             | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|-----------------------|----------------|----------------|--------------|---------------|
| MMLU‑Pro (5‑shot CoT) | 60,5           | 61,8           | 58,8         | 51,3          |
| MMLU (5‑shot)         | 84,2           | 83,6           | 86,1         | 78,8          |
| GSM8K (8‑shot CoT)    | 93,7           | 93,3           | 90,9         | 83,9          |
| HumanEval (0‑shot)    | 60,4           | 61,0           | 56,7         | 57,3          |

Kaynak: arXiv:2504.03624.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

H100 üzerinde 65 536 giriş ve 1024 çıkış tokeniyle üretim yaparken Nemotron‑H‑47B, Qwen‑2.5‑72B ve Llama‑3.1‑70B'ye kıyasla 2,9 kat daha hızlı çalışmıştır.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>

### Nemotron Nano 2 (Ağustos 2025)

Akıl yürütme görevleri için hibrit Mamba‑Transformer modeli. **Nemotron‑Nano‑12B‑v2‑Base** — ağırlıklı olarak Mamba‑2 + MLP + 4 dikkat katmanından oluşan 62 katmanlı, sıfırdan FP8 formatında 20 trilyon token üzerinde eğitilmiş üst modeldir. Bu modelden genişletilmiş Minitron yöntemiyle elde edilen **Nemotron‑Nano‑9B‑v2**, tek bir NVIDIA A10G GPU'da (22 GB, BF16) 128K token bağlamıyla çalışabilmektedir. Son eğitim: SFT (80 milyar token; DeepSeek‑R1‑0528 izleri dahil) → GRPO → DPO → RLHF. Akıl yürütme benchmark'larında model, Qwen3‑8B ile benzer doğruluğa sahip olmakla birlikte, uzun çıkış dizilerinde 3–6 kat üretim hızlanması sağlamaktadır.<sup>[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nano2-13)</sup>

### Nemotron 3 Nano 30B‑A3B

Aralık 2025'te yayımlandı. Parametreler: toplam 31,6 milyar, aktif 3,2 milyar. Mimari: 52 katman, hidden dimension 2688, uzman boyutu 1856, Mamba durum boyutu 128. MoE: 128 yönlendirilebilir uzman + 1 ortak uzman, token başına 6 aktif uzman. Bağlam — 1 048 576 tokena kadar. 25 trilyon token üzerinde iki fazda eğitim (WSD çizelgesi, batch size 3072, veri kesim tarihi — Haziran 2025): 1. Faz — 23,5 trilyon (çeşitli veriler), 2. Faz — 1,5 trilyon (yüksek kaliteli veriler) + 121 milyar token uzun bağlam CPT.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

| Benchmark             | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|-----------------------|-------------------------|------------------------|-------------|
| MMLU‑Pro              | 78,30                   | 80,9                   | 75,0        |
| AIME25 (araçsız)      | 89,06                   | 85,0                   | 91,7        |
| AIME25 (araçlı)       | 99,17                   | —                      | 98,7        |
| GPQA (araçsız)        | 73,04                   | 73,4                   | 71,5        |
| LiveCodeBench v6      | 68,25                   | 66,0                   | 61,0        |
| SWE‑Bench (OpenHands) | 38,76                   | 22,0\*                 | 34,0        |
| TauBench V2 Ort.      | 49,04                   | 47,7                   | 47,5        |
| Arena‑Hard‑V2 Ort.    | 67,65                   | 57,8                   | 48,55       |
| RULER‑100 @ 1M        | 86,34                   | 77,5                   | —           |

\* — ikincil kaynaklardan alınan değerler; yeniden üretim koşulları — NeMo Evaluator SDK. Kaynak: arXiv:2512.20848.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)[\[28\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NeMo_eval-28)</sup>

Verim (8K giriş / 16K çıkış, tek H200): Qwen3‑30B‑A3B‑Thinking'e kıyasla 3,3 kat, GPT‑OSS‑20B'ye kıyasla 2,2 kat daha yüksek.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

### Ek Modeller ve Araştırma Yönleri

- **OpenReasoning‑Nemotron** (Temmuz 2025) — Qwen 2.5 tabanlı, DeepSeek‑R1‑0528 verileri üzerinde ince ayar yapılmış 1,5B–32B parametreli bir model serisi. GenSelect@64 kullanan 32B varyantı, belirli matematik benchmark'larında o3'ü (high) geride bırakmaktadır.<sup>[\[29\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-OpenReasoning-29)</sup>
- **Nemotron Elastic** (arXiv:2511.16664) — tek bir üst model içinde iç içe geçmiş alt modeller (6B, 9B, 12B) çerçevesi; sıfırdan eğitime kıyasla eğitim maliyetini 360 kat azaltmaktadır.<sup>[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Elastic-30)</sup>
- **Nemotron‑CrossThink** — matematik görevlerinin ötesine geçen çok alanlı pekiştirmeli öğrenme çerçevesi; MATH‑500'de +%30,1 ve MMLU‑PRO'da +%12,8 iyileşme sağlamıştır.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-CrossThink-31)</sup>
- **Nemotron‑UltraLong** — bağlamı 4 milyon tokena genişletme.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-UltraLong-32)</sup>
- **Jet‑Nemotron** — kompakt hibrit modeller (2B/4B) için son eğitim NAS.<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-JetNemotron-33)</sup>

### Uzmanlaşmış Modeller

Nemotron ekosistemi ayrıca uzmanlaşmış görevler için modeller barındırmaktadır:

- **Nemotron Nano V2 VL** — OCR, tablo işleme ve video için vision‑language modeli.<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NanoV2_VL-34)</sup>
- **Nemotron Parse 1.1** — OCR ve belge yapısı çıkarımı için model.<sup>[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Parse-35)</sup>
- **Nemotron ColEmbed V2** — görsel belge araması için gömme modeli (geç etkileşim).<sup>[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-ColEmbed-36)</sup>
- **Nemotron Speech** — otomatik konuşma tanıma (ASR), konuşma sentezi (TTS) ve makine çevirisi (NMT) için modeller.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>
- **Llama 3.1 Nemotron Safety Guard 8B V3** — 9 dilde 23 kategoride güvensiz içerik sınıflandırma modeli; %84,2 doğruluk.<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Safety-37)</sup>

## Ön Eğitim Verileri

### Nemotron‑4 Veri Bileşimi

Nemotron‑4 15B ve 340B'nin ön eğitim külliyatı üç temel kategoriden oluşmaktadır: İngilizce metinler (%70), 53 dilde çok dilli metinler (%15) ve 43 programlama dilinde kaynak kodu (%15). Belge düzeyinde yineleme giderme (tam ve yakın yineleme) ile dil modelleri ve sezgisel kurallar kullanılarak filtreleme uygulanmıştır. 15B modeli 8 trilyon token, 340B modeli ise 9 trilyon token (8 trilyon ön eğitim + yüksek kaliteli kaynaklara yeniden ağırlık verilen 1 trilyon sürdürülen eğitim) üzerinde eğitilmiştir.<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

### Nemotron‑CC

**Nemotron‑CC** veri kümesi, kalite sınıflandırıcıları topluluğu ve metinlerin sentetik yeniden ifadesi kullanılarak Common Crawl'dan oluşturulmuştur. Toplam hacim — **6,3 trilyon token** (4,4 trilyon yinelemesi giderilmiş + 1,9 trilyon sentetik yeniden formüle edilmiş). Hat, NeMo Curator aracına entegre edilmiştir. Çalışma, ACL 2025 konferansında Long Paper olarak kabul edilmiştir.<sup>[\[38\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NemotronCC-38)</sup>

### Nemotron‑CC‑Math

Common Crawl'dan Lynx + LLM hattı kullanılarak çıkarılan, matematiksel formüller ve kodun LaTeX yapısını koruyan **133 milyar token** hacminde matematik odaklı bir alt küme.<sup>[\[39\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NemotronCC_Math-39)</sup>

### Nemotron 3 Nano Verileri

Nemotron 3 Nano'nun ön eğitimi 25 trilyon token üzerinde gerçekleştirilmiştir. Küme şunları kapsamaktadır: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 ve uzmanlaşmış STEM veri kümeleri. Uzun bağlam eğitimi için ek 121 milyar token CPT kullanılmıştır.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

### Nemotron Pretraining Dataset v1

STEM, akademik metinler, akıl yürütme görevleri ve çok dilli alanları kapsayan sentetik olarak üretilmiş bir küme; 10 trilyon'dan fazla dil tokeni ve SFT için 18 milyon örnek içermektedir. Tüm veri kümeleri açık izin veren lisanslar altında dağıtılmaktadır.<sup>[\[40\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NemotronNano2_page-40)</sup>

### Sentetik Veri Üretim Hattı (SDG)

Nemotron‑4 340B raporunda açıklanan hat şu aşamaları kapsamaktadır<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>:

- **İstem üretimi**: Open QA, Writing, Closed QA, Math & Coding şablonlarına göre Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 lisansı) kullanılarak üretilen sentetik tek ve çift turlu istekler.
- **Yanıt üretimi**: çeşitlilik sağlamak amacıyla modellerin ara versiyonlarından birden fazla yanıt.
- **Kalite değerlendirmesi**: üç yaklaşım — Ground‑Truth‑as‑a‑Judge (doğrulanabilir yanıtlı görevler için), LLM‑as‑Judge (dil modeli tarafından yanıt çiftlerinin karşılaştırılması), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward kullanımı).
- **Zayıftan güçlüye (weak‑to‑strong) yinelemeli hizalama**.

İnsan tarafından etiketlenmiş yaklaşık 20 000 örnekten (SFT için 10 000, ödül modeli için 10 000 HelpSteer2) tüm hizalama verilerinin geri kalanı sentezlenmiştir.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)</sup>

## Kuantizasyon ve Çıkarım Optimizasyonu

Nemotron 3 Nano modelleri, ModelOpt ve Megatron‑LM kullanarak FP8'de Eğitim Sonrası Kuantizasyon (PTQ) desteği sunmaktadır. Seçici kuantizasyon (selective quantization) uygulanmaktadır — dikkat katmanları ve Mamba'nın bir kısmı kaliteyi korumak amacıyla BF16'da tutulurken, geri kalanlar FP8'e kuantize edilmektedir. Teknik rapora göre bu yaklaşım, doğruluğun ~%99'unu korumaktadır.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup> Nano ayrıca NVFP4 formatında çıkarımı desteklemektedir.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

## Nesiller Arası Benchmark Özet Tablosu

| Model                           | MMLU  | GSM8K | HumanEval | Arena Hard | MT‑Bench | Koşullar                |
|---------------------------------|-------|-------|-----------|------------|----------|-------------------------|
| Nemotron‑4 15B                  | %64,2 | %46,0 | %31,6     | —          | —        | base; 5‑/8‑/0‑shot      |
| Nemotron‑4 340B Base            | %81,1 | —     | %57,3     | —          | —        | 5‑/—/0‑shot             |
| Nemotron‑4 340B Instruct        | %78,7 | %92,3 | %73,2     | 54,2       | 8,22     | 0‑shot                  |
| Llama‑3.1‑Nemotron‑70B‑Instruct | —     | —     | —         | 85,0       | 8,98     | Eki. 2024               |
| LN‑Ultra 253B (reasoning ON)    | —     | —     | —         | —          | —        | GPQA %76,0, AIME %80,8  |
| Nemotron‑H‑47B                  | %83,6 | %93,3 | %61,0     | —          | —        | 5‑/8‑CoT/0‑shot         |
| Nemotron 3 Nano (30B‑A3B)       | —     | —     | —         | 67,7 (v2)  | —        | AIME25 %89,1, LCB %68,3 |

Karşılaştırma dikkatli yorumlanmalıdır: değerlendirme koşulları, benchmark sürümleri ve test tarihleri nesiller arasında farklılık göstermektedir. Sonuçlar NVIDIA teknik raporlarından alınmıştır; bağımsız değerlendirmeler farklılık gösterebilir (bkz. «Sınırlılıklar» bölümü).<sup>[\[8\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_15B-8)[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)[\[9\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LN70B_Instruct-9)[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

## Kullanım Alanları

### NVIDIA NIM Aracılığıyla Dağıtım

NVIDIA NIM — OpenAI uyumlu API ile çıkarım için optimize edilmiş konteyner tabanlı mikro hizmetler kümesidir. Nemotron modelleri, build.nvidia.com platformunda NIM mikro hizmetleri olarak sunulmaktadır. NIM; FP8, BF16, NVFP4 formatlarını ve Kubernetes üzerinde Helm grafikleri aracılığıyla dağıtımı desteklemektedir. Modeller ayrıca bağımsız çerçevelerle de uyumludur: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.<sup>[\[4\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NV_developer-4)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

### Sentetik Veri Üretimi

Nemotron‑4 340B, sentetik veri üreticisi olarak kullanılmak üzere tasarlanmıştır: Instruct modeli yanıtlar üretirken Reward modeli bunları değerlendirir ve filtreler. NVIDIA Open Model License, model çıktılarının diğer modellerin eğitimi için kullanılmasına açıkça izin vermektedir. ServiceNow'un verilerine göre, Apriel 1.6 modelinin ön eğitim verilerinin %15'i Nemotron veri kümelerinden elde edilmiştir.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NVIDIA_news-15)[\[41\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NeMo_synth-41)</sup>

### Ajan Sistemleri

Nemotron 3 ailesinin modelleri (Nano, Super, Ultra), planlama, geri çağırma (retrieval) ve araç çağırma (tool use) gibi çok ajan iş yükleri için tasarlanmıştır. Nemotron 3 Nano, SWE‑Bench'te (OpenHands ile) %38,76 ve TauBench V2'de %49,04 (ort.) sonuç sergilemektedir.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

### Kurumsal Uygulamalar

Açıklanan iş ortakları arasında şunlar yer almaktadır: ServiceNow (iş akışı otomasyonu için ortak Apriel Nemotron 15B modeli), CrowdStrike (Charlotte AI platformu), Perplexity (sorgu yönlendirme), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modeller AWS Amazon Bedrock'ta mevcuttur; Google Cloud, CoreWeave ve Nebius desteği planlanmaktadır.<sup>[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NVIDIA_news-15)</sup>

## Sınırlılıklar ve Açık Sorunlar

### Bağımsız Değerlendirmeler ve NVIDIA Verileriyle Farklılıklar

Bağımsız değerlendirmeler, NVIDIA tarafından sunulan sonuçlarla farklılıklar ortaya koymaktadır. Artificial Analysis'in Şubat 2026 verilerine göre Llama‑Nemotron‑Ultra 253B (akıl yürütme), benzer boyuttaki modellerin ortancası 26 iken 15 Intelligence Index puanı almıştır. Chatbot Arena (LMArena) platformunda Nemotron modelleri sıralamanın ortasında yer almaktadır: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. sıra), Nemotron 3 Nano — 1317 ±6 (~164. sıra).<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-AA-42)[\[43\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-LMArena-43)</sup>

### Aşırı Ayrıntılı Yanıt Üretimi

Nemotron modelleri yüksek düzeyde ayrıntılı yanıt üretme eğilimi göstermektedir: Artificial Analysis'in değerlendirmesinde Nemotron 3 Nano, diğer modellerin ortancası olan 12 milyona karşılık 140 milyon token üretmiş; bu durum çıkarım maliyetlerini artırmaktadır. DEV Community'nin analizi, Llama‑3.1‑Nemotron‑70B‑Instruct'ın otomatik benchmark'larda resmi olarak öne çıkmasına rağmen bazı pratik görevlerde yetersiz doğruluk sergilediğini ve Arena benzeri benchmark'lardaki yüksek puanların, her zaman doğru olmayan ancak ayrıntılı ve emin görünen yanıtlara verilen tercihi yansıtıyor olabileceğini ortaya koymuştur.<sup>[\[42\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-AA-42)[\[44\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Saplin-44)</sup>

### Halüsinasyonlar ve Önyargı

NVIDIA, model kartlarında modellerin «özellikle toksik istemlerde önyargıları güçlendirebileceğini ve toksik yanıtlar üretebileceğini», ayrıca «yanlış bilgi üretebileceğini ve önemli ayrıntıları atlayabileceğini» belirtmektedir. Açık ağırlıklar ve veriler harici denetime olanak tanımaktadır.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)[\[13\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nano2-13)</sup>

### Hesaplama Gereksinimleri

Yoğun modeller (Nemotron‑4 340B), tam eğitim için 768 DGX H100 düğümlü bir küme gerektirmekte; bu durum, benzer altyapıya erişimi olmayan akademik gruplar için yeniden üretimi kısıtlamaktadır. Çıkarım sırasında uzun bağlam (1M), önemli miktarda VRAM gerektirmektedir.<sup>[\[3\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N4_340B-3)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

### Bağlam Genişletmede Performans Düşüşü

Bağlamın aşırı uzun dizilere genişletilmesinde, kısa bağlamlı benchmark'larda sonuçların gerilediği gözlemlenmiştir.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-UltraLong-32)</sup>

### Hibrit Mimarilerin Kuantizasyonu

Mamba‑Transformer mimarilerinde aşırı düşük bit genişliğinin (FP8/NVFP4) kullanılması, bazı benchmark'larda küçük bir doğruluk düşüşüne (~%1) yol açmaktadır. Bu sorun, derleyici ve çıkarım sunucusu mimarisini karmaşıklaştıran seçici kuantizasyon uygulamasıyla ele alınmaktadır.<sup>[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

### Diğer Açık Sorunlar

- Eğitim verisi kontaminasyonu olasılığı olan benchmark'lara bağımlılık.
- Hibrit SSM‑Transformer mimarileri ile saf Transformer modellerinin karşılaştırılması için standart protokollerin eksikliği.
- Token başına az sayıda uzmanla derin akıl yürütme gerektiren görevlerde MoE yaklaşımının ölçeklenebilirlik sorunu.
- Aralık 2025 itibarıyla Super/Ultra verileri ön nitelik taşımaktadır; tam benchmark sonuçları sürümden sonra beklenmektedir.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

## Etik ve Düzenleyici Boyutlar

### Geliştirme Aşamasında Güvenlik

Geliştirme aşamasında şunlar uygulanmaktadır: AEGIS çerçevesiyle değerlendirme (13 içerik güvenliği kategorisi), garak güvenlik açığı tarayıcısı ve manuel kırmızı takım testi (red‑teaming).<sup>[\[37\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Safety-37)</sup>

### Çıkarım Aşamasında Güvenlik

**NeMo Guardrails** — LLM sistemlerine programlanabilir bariyerler ekleyen açık kaynaklı bir araç setidir (Apache 2.0 lisansı). Mikro hizmet, giriş ve çıkışları yakalayarak yapılandırılabilir denetimler uygular: konu kontrolü, kişisel tanımlayıcı bilgi (PII) tespiti, RAG doğrulama kontrolü, jailbreak saldırı tespiti (YARA tabanlı kod enjeksiyon koruması dahil), çok dilli ve çok modlu güvenlik sınıflandırması.<sup>[\[45\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Guardrails-45)</sup>

Nemotron 3 için, araç kullanan gerçekçi senaryolardan alınan yaklaşık 11 000 etiketlenmiş OpenTelemetry izinden oluşan ve ajan güvenliğini değerlendirmeye yönelik bir küme yayımlanmıştır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

### Lisanslama

| Modeller                               | Lisans                                        |
|----------------------------------------|-----------------------------------------------|
| Nemotron 3 (Nano, Super, Ultra)        | NVIDIA Nemotron Open Model License            |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement           |
| Llama‑Nemotron (Nano/Super/Ultra)      | Llama Community License (Meta'dan miras)      |
| Nemotron‑3 8B (2023)                   | NVIDIA AI Foundation Models Community License |

**NVIDIA Nemotron Open Model License**, ticari kullanıma, türev çalışmalar oluşturulmasına ve dağıtılmasına izin vermekte; atıf zorunluluğu getirmemekte (NOTICE dosyasının korunması kaydıyla), kullanıcı sayısına sınırlama getirmemekte ve model çıktılarının diğer modellerin eğitiminde kullanılmasına açıkça izin vermektedir.<sup>[\[46\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-License-46)</sup> Llama tabanlı modeller, aylık 700 milyon aktif kullanıcı eşiği de dahil olmak üzere Meta kısıtlamalarını miras almaktadır.<sup>[\[11\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Llama_Nemotron-11)</sup>

Nemotron 3 Nano için NVIDIA şunları yayımlamıştır: model ağırlıkları, 10 trilyon tokenden fazla eğitim verisi, eğitim tarifleri, kod tabanları (NeMo, Megatron‑LM, NeMo‑Aligner) ve 900 000'den fazla görev içeren 10'dan fazla pekiştirmeli öğrenme ortamı.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)[\[2\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_nano_report-2)</sup>

## Gelecek Perspektifler ve Araştırma Yönleri

Yaklaşan sürümler, 2026'nın ilk yarısında beklenen **Nemotron 3 Super** (~100 milyar parametre, ~10 milyar aktif) ve **Nemotron 3 Ultra** (~500 milyar, ~50 milyar aktif) modellerini kapsamaktadır. Her iki model de Blackwell mimarisinde LatentMoE, MTP ve NVFP4 formatında eğitim kullanacaktır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)</sup>

NVIDIA'nın stratejik yönelimi, Nemotron'u tekil bir model olarak değil; karmaşıklığa göre yönlendirme ile ailenin farklı modellerinin farklı görevler için kullanıldığı çok ajan sistemleri için bir altyapı katmanı olarak konumlandırmaktır.<sup>[\[1\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_whitepaper-1)[\[15\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NVIDIA_news-15)</sup>

Temel araştırma yönleri:

- Hibrit mimarilerin geliştirilmesi — ölçeklenebilir uzun bağlam için SSM katmanlarının dikkat mekanizmasıyla daha ileri entegrasyonu.<sup>[\[12\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Nemotron_H-12)</sup>
- Çok katmanlı sıkıştırma yöntemleri — Minitron, Puzzle, MiniPuzzle ve Nemotron Elastic'in geliştirilmesi.<sup>[\[20\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Minitron-20)[\[21\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Puzzle-21)[\[30\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Elastic-30)</sup>
- Çok alanlı pekiştirmeli öğrenme — matematik görevlerinin ötesinde RL'yi genişletmek için Nemotron‑CrossThink.<sup>[\[31\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-CrossThink-31)</sup>
- Bağlam genişletme — Nemotron‑UltraLong ile 4 milyon tokena uzatma.<sup>[\[32\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-UltraLong-32)</sup>
- Çok modalite — vision‑language (Nemotron VL), konuşma (Nemotron Speech) ve görsel belge araması (Nemotron ColEmbed V2) alanlarına genişleme.<sup>[\[34\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-NanoV2_VL-34)[\[35\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-Parse-35)[\[36\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-ColEmbed-36)</sup>
- Kompakt hibrit modeller — Jet‑Nemotron (2B/4B modeller için NAS).<sup>[\[33\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-JetNemotron-33)</sup>
- Açık tarifler — topluluk tarafından yeniden üretim ve özelleştirme için tam eğitim tariflerinin ve verilerinin yayımlanması.<sup>[\[14\]](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_note-N3_blog-14)</sup>

## Ayrıca bakınız

- Transformer Mimarisi
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta model ailesi)

## Literatür

- NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a>
- Parmar, J. ve diğ. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, Şubat 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a>
- Adler, B. ve diğ. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, Haziran 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a>
- Wang, Z. ve diğ. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, Haziran 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a>
- Muralidharan, S. ve diğ. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, Temmuz 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a>
- Bercovich, A. ve diğ. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, Kasım 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a>
- Su, D. ve diğ. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025. arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a>
- Sun, S. ve diğ. (NVIDIA). *Reward‑aware Preference Optimization*. arXiv:2502.00203, Ocak 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a>
- Blakeman, A. ve diğ. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, Nisan 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a>
- Bercovich, A. ve diğ. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, Mayıs 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a>
- Basant, A. ve diğ. (NVIDIA). *NVIDIA Nemotron Nano 2*. arXiv:2508.14444, Ağustos 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a>
- Karimi Mahabadi, R. ve diğ. (NVIDIA). *Nemotron‑CC‑Math*. arXiv:2508.15096, Ağustos 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a>
- Taghibakhshi, A. ve diğ. (NVIDIA). *Nemotron Elastic*. arXiv:2511.16664, Kasım 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a>
- Blakeman, A. ve diğ. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, Aralık 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a>
- Blakeman, A. ve diğ. (NVIDIA). *Nemotron 3 Nano*. arXiv:2512.20848, Aralık 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a>
- Dao, T.; Gu, A. *Transformers are SSMs*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a>
- Ainslie, J. ve diğ. *GQA*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Su, J. ve diğ. *RoFormer (RoPE)*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Zhang, B.; Sennrich, R. *RMSNorm*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Rafailov, R. ve diğ. *Direct Preference Optimization*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a>

## Kaynakça

- NVIDIA Research — Nemotron 3 sayfası: <a href="https://research.nvidia.com/labs/nemotron/Nemotron-3/" class="external free" rel="nofollow">https://research.nvidia.com/labs/nemotron/Nemotron-3/</a>
- NVIDIA Developer — Nemotron AI Models: <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a>
- Hugging Face — Nemotron belgeleri: <a href="https://huggingface.co/docs/transformers/main/en/model_doc/nemotron" class="external free" rel="nofollow">https://huggingface.co/docs/transformers/main/en/model_doc/nemotron</a>
- NeMo Framework Belgeleri: <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a>

## Notlar

1.  <span id="cite_note-N3_whitepaper-1">↑ <sup>[1.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_whitepaper_1-14)</sup> Blakeman, A. et al. (NVIDIA). *NVIDIA Nemotron 3: Efficient and Open Intelligence*. arXiv:2512.20856, декабрь 2025. <a href="https://arxiv.org/abs/2512.20856" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20856</a></span>
2.  <span id="cite_note-N3_nano_report-2">↑ <sup>[2.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_nano_report_2-16)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning*. arXiv:2512.20848, декабрь 2025. <a href="https://arxiv.org/abs/2512.20848" class="external free" rel="nofollow">https://arxiv.org/abs/2512.20848</a></span>
3.  <span id="cite_note-N4_340B-3">↑ <sup>[3.00](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_340B_3-14)</sup> Adler, B. et al. (NVIDIA). *Nemotron‑4 340B Technical Report*. arXiv:2406.11704, июнь 2024. <a href="https://arxiv.org/abs/2406.11704" class="external free" rel="nofollow">https://arxiv.org/abs/2406.11704</a></span>
4.  <span id="cite_note-NV_developer-4">↑ <sup>[4.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NV_developer_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NV_developer_4-1)</sup> NVIDIA Developer. *NVIDIA Nemotron AI Models*. <a href="https://developer.nvidia.com/nemotron" class="external free" rel="nofollow">https://developer.nvidia.com/nemotron</a></span>
5.  <span id="cite_note-NeMo_docs-5">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NeMo_docs_5-0) NVIDIA. *NeMo Framework Documentation*. <a href="https://docs.nvidia.com/nemo/" class="external free" rel="nofollow">https://docs.nvidia.com/nemo/</a></span>
6.  <span id="cite_note-N3_8B_card-6">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_8B_card_6-0) NVIDIA. *Nemotron‑3‑8B‑Base‑4k — Model Card*. Hugging Face, 2023. <a href="https://huggingface.co/nvidia/nemotron-3-8b-base-4k" class="external free" rel="nofollow">https://huggingface.co/nvidia/nemotron-3-8b-base-4k</a></span>
7.  <span id="cite_note-MS_nemotron3-7">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-MS_nemotron3_7-0) Microsoft. *Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog*. Microsoft Tech Community, 14 ноября 2023. <a href="https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569" class="external free" rel="nofollow">https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569</a></span>
8.  <span id="cite_note-N4_15B-8">↑ <sup>[8.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N4_15B_8-6)</sup> Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). *Nemotron‑4 15B Technical Report*. arXiv:2402.16819, февраль 2024. <a href="https://arxiv.org/abs/2402.16819" class="external free" rel="nofollow">https://arxiv.org/abs/2402.16819</a></span>
9.  <span id="cite_note-LN70B_Instruct-9">↑ <sup>[9.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LN70B_Instruct_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LN70B_Instruct_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LN70B_Instruct_9-2)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF</a></span>
10. <span id="cite_note-LN70B_Reward-10">↑ <sup>[10.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LN70B_Reward_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LN70B_Reward_10-1)</sup> NVIDIA. *Llama‑3.1‑Nemotron‑70B‑Reward — Model Card*. Hugging Face, октябрь 2024. <a href="https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward" class="external free" rel="nofollow">https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward</a></span>
11. <span id="cite_note-Llama_Nemotron-11">↑ <sup>[11.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-1)</sup> <sup>[11.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-2)</sup> <sup>[11.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-3)</sup> <sup>[11.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-4)</sup> <sup>[11.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-5)</sup> <sup>[11.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-6)</sup> <sup>[11.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-7)</sup> <sup>[11.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Llama_Nemotron_11-8)</sup> Bercovich, A. et al. (NVIDIA). *Llama‑Nemotron: Efficient Reasoning Models*. arXiv:2505.00949, май 2025. <a href="https://arxiv.org/abs/2505.00949" class="external free" rel="nofollow">https://arxiv.org/abs/2505.00949</a></span>
12. <span id="cite_note-Nemotron_H-12">↑ <sup>[12.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-1)</sup> <sup>[12.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-2)</sup> <sup>[12.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-3)</sup> <sup>[12.4](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-4)</sup> <sup>[12.5](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-5)</sup> <sup>[12.6](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-6)</sup> <sup>[12.7](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-7)</sup> <sup>[12.8](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nemotron_H_12-8)</sup> Blakeman, A. et al. (NVIDIA). *Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models*. arXiv:2504.03624, апрель 2025. <a href="https://arxiv.org/abs/2504.03624" class="external free" rel="nofollow">https://arxiv.org/abs/2504.03624</a></span>
13. <span id="cite_note-Nano2-13">↑ <sup>[13.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nano2_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nano2_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Nano2_13-2)</sup> Basant, A. et al. (NVIDIA). *NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model*. arXiv:2508.14444, август 2025. <a href="https://arxiv.org/abs/2508.14444" class="external free" rel="nofollow">https://arxiv.org/abs/2508.14444</a></span>
14. <span id="cite_note-N3_blog-14">↑ <sup>[14.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_blog_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_blog_14-1)</sup> <sup>[14.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-N3_blog_14-2)</sup> Blakeman, A. et al. (NVIDIA). *Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate*. NVIDIA Technical Blog, 15 декабря 2025. <a href="https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/</a></span>
15. <span id="cite_note-NVIDIA_news-15">↑ <sup>[15.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NVIDIA_news_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NVIDIA_news_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NVIDIA_news_15-2)</sup> <sup>[15.3](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NVIDIA_news_15-3)</sup> NVIDIA. *NVIDIA Debuts Nemotron 3 Family of Open Models*. NVIDIA Newsroom, 15 декабря 2025. <a href="https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models" class="external free" rel="nofollow">https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models</a></span>
16. <span id="cite_note-GQA-16">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-GQA_16-0) Ainslie, J. et al. *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
17. <span id="cite_note-RoPE-17">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-RoPE_17-0) Su, J. et al. *RoFormer: Enhanced Transformer with Rotary Position Embedding*. Neurocomputing, 2024. arXiv:2104.09864. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
18. <span id="cite_note-Mamba2-18">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Mamba2_18-0) Dao, T.; Gu, A. *Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality*. ICML 2024. arXiv:2405.21060. <a href="https://arxiv.org/abs/2405.21060" class="external free" rel="nofollow">https://arxiv.org/abs/2405.21060</a></span>
19. <span id="cite_note-RMSNorm-19">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-RMSNorm_19-0) Zhang, B.; Sennrich, R. *Root Mean Square Layer Normalization*. arXiv:1910.07467, 2019. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
20. <span id="cite_note-Minitron-20">↑ <sup>[20.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Minitron_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Minitron_20-1)</sup> Muralidharan, S. et al. (NVIDIA). *Compact Language Models via Pruning and Knowledge Distillation*. arXiv:2407.14679, июль 2024. <a href="https://arxiv.org/abs/2407.14679" class="external free" rel="nofollow">https://arxiv.org/abs/2407.14679</a></span>
21. <span id="cite_note-Puzzle-21">↑ <sup>[21.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Puzzle_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Puzzle_21-1)</sup> Bercovich, A. et al. (NVIDIA). *Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs*. arXiv:2411.19146, ноябрь 2024. <a href="https://arxiv.org/abs/2411.19146" class="external free" rel="nofollow">https://arxiv.org/abs/2411.19146</a></span>
22. <span id="cite_note-HelpSteer-22">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-HelpSteer_22-0) Wang, Z. et al. (NVIDIA). *HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM*. arXiv:2311.09528, ноябрь 2023. <a href="https://arxiv.org/abs/2311.09528" class="external free" rel="nofollow">https://arxiv.org/abs/2311.09528</a></span>
23. <span id="cite_note-HelpSteer2-23">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-HelpSteer2_23-0) Wang, Z. et al. (NVIDIA). *HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models*. arXiv:2406.08673, июнь 2024. <a href="https://arxiv.org/abs/2406.08673" class="external free" rel="nofollow">https://arxiv.org/abs/2406.08673</a></span>
24. <span id="cite_note-HelpSteer2_Pref-24">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-HelpSteer2_Pref_24-0) Wang, Z. et al. (NVIDIA). *HelpSteer2‑Preference: Complementing Ratings with Preferences*. arXiv:2410.01257, октябрь 2024. <a href="https://arxiv.org/abs/2410.01257" class="external free" rel="nofollow">https://arxiv.org/abs/2410.01257</a></span>
25. <span id="cite_note-SteerLM-25">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-SteerLM_25-0) Dong, Y. et al. (NVIDIA). *SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF*. arXiv:2310.05344, октябрь 2023. <a href="https://arxiv.org/abs/2310.05344" class="external free" rel="nofollow">https://arxiv.org/abs/2310.05344</a></span>
26. <span id="cite_note-DPO-26">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-DPO_26-0) Rafailov, R. et al. *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. NeurIPS 2023. arXiv:2305.18290. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
27. <span id="cite_note-RPO-27">↑ <sup>[27.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-RPO_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-RPO_27-1)</sup> Sun, S. et al. (NVIDIA). *Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment*. arXiv:2502.00203, январь 2025. <a href="https://arxiv.org/abs/2502.00203" class="external free" rel="nofollow">https://arxiv.org/abs/2502.00203</a></span>
28. <span id="cite_note-NeMo_eval-28">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NeMo_eval_28-0) NVIDIA. *NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano*. Hugging Face Blog, декабрь 2025. <a href="https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe" class="external free" rel="nofollow">https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe</a></span>
29. <span id="cite_note-OpenReasoning-29">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-OpenReasoning_29-0) NVIDIA. *OpenReasoning‑Nemotron*. Hugging Face Collection, июль 2025. <a href="https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39" class="external free" rel="nofollow">https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39</a></span>
30. <span id="cite_note-Elastic-30">↑ <sup>[30.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Elastic_30-0)</sup> <sup>[30.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Elastic_30-1)</sup> Taghibakhshi, A. et al. (NVIDIA). *Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs*. arXiv:2511.16664, ноябрь 2025. <a href="https://arxiv.org/abs/2511.16664" class="external free" rel="nofollow">https://arxiv.org/abs/2511.16664</a></span>
31. <span id="cite_note-CrossThink-31">↑ <sup>[31.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-CrossThink_31-0)</sup> <sup>[31.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-CrossThink_31-1)</sup> Akter, S. N. et al. (NVIDIA). *Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning*. arXiv:2504.13941, апрель 2025. <a href="https://arxiv.org/abs/2504.13941" class="external free" rel="nofollow">https://arxiv.org/abs/2504.13941</a></span>
32. <span id="cite_note-UltraLong-32">↑ <sup>[32.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-UltraLong_32-0)</sup> <sup>[32.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-UltraLong_32-1)</sup> <sup>[32.2](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-UltraLong_32-2)</sup> Xu, C. et al. (NVIDIA). *From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models*. arXiv:2504.06214, апрель 2025. <a href="https://arxiv.org/abs/2504.06214" class="external free" rel="nofollow">https://arxiv.org/abs/2504.06214</a></span>
33. <span id="cite_note-JetNemotron-33">↑ <sup>[33.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-JetNemotron_33-0)</sup> <sup>[33.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-JetNemotron_33-1)</sup> Gu, Y. et al. (NVIDIA). *Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search*. arXiv:2508.15884, август 2025. <a href="https://arxiv.org/abs/2508.15884" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15884</a></span>
34. <span id="cite_note-NanoV2_VL-34">↑ <sup>[34.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NanoV2_VL_34-0)</sup> <sup>[34.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NanoV2_VL_34-1)</sup> Deshmukh, A. S. et al. (NVIDIA). *NVIDIA Nemotron Nano V2 VL*. arXiv:2511.03929, ноябрь 2025. <a href="https://arxiv.org/abs/2511.03929" class="external free" rel="nofollow">https://arxiv.org/abs/2511.03929</a></span>
35. <span id="cite_note-Parse-35">↑ <sup>[35.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Parse_35-0)</sup> <sup>[35.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Parse_35-1)</sup> Chumachenko, K. et al. (NVIDIA). *NVIDIA Nemotron Parse 1.1*. arXiv:2511.20478, ноябрь 2025. <a href="https://arxiv.org/abs/2511.20478" class="external free" rel="nofollow">https://arxiv.org/abs/2511.20478</a></span>
36. <span id="cite_note-ColEmbed-36">↑ <sup>[36.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-ColEmbed_36-0)</sup> <sup>[36.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-ColEmbed_36-1)</sup> de Souza P. Moreira, G. et al. (NVIDIA). *Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval*. arXiv:2602.03992, февраль 2026. <a href="https://arxiv.org/abs/2602.03992" class="external free" rel="nofollow">https://arxiv.org/abs/2602.03992</a></span>
37. <span id="cite_note-Safety-37">↑ <sup>[37.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Safety_37-0)</sup> <sup>[37.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Safety_37-1)</sup> NVIDIA Developer Blog. *Safeguard Agentic AI Systems with the NVIDIA Safety Recipe*. 2025. <a href="https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/</a></span>
38. <span id="cite_note-NemotronCC-38">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NemotronCC_38-0) Su, D. et al. (NVIDIA). *Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset*. ACL 2025 (Long Paper). arXiv:2412.02595. <a href="https://arxiv.org/abs/2412.02595" class="external free" rel="nofollow">https://arxiv.org/abs/2412.02595</a></span>
39. <span id="cite_note-NemotronCC_Math-39">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NemotronCC_Math_39-0) Karimi Mahabadi, R. et al. (NVIDIA). *Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset*. arXiv:2508.15096, август 2025. <a href="https://arxiv.org/abs/2508.15096" class="external free" rel="nofollow">https://arxiv.org/abs/2508.15096</a></span>
40. <span id="cite_note-NemotronNano2_page-40">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NemotronNano2_page_40-0) NVIDIA Research. *NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1*. <a href="https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/" class="external free" rel="nofollow">https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/</a></span>
41. <span id="cite_note-NeMo_synth-41">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-NeMo_synth_41-0) NVIDIA. *Synthetic Data Generation — NVIDIA NeMo Framework User Guide*. <a href="https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html" class="external free" rel="nofollow">https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html</a></span>
42. <span id="cite_note-AA-42">↑ <sup>[42.0](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-AA_42-0)</sup> <sup>[42.1](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-AA_42-1)</sup> Artificial Analysis. *NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index*. Февраль 2026. <a href="https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning" class="external free" rel="nofollow">https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning</a></span>
43. <span id="cite_note-LMArena-43">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-LMArena_43-0) LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. <a href="https://lmarena.ai/" class="external free" rel="nofollow">https://lmarena.ai/</a></span>
44. <span id="cite_note-Saplin-44">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Saplin_44-0) Saplin, M. *Llama 3.1 Nemotron 70B: Quirks and Features*. DEV Community, 2024. <a href="https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg" class="external free" rel="nofollow">https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg</a></span>
45. <span id="cite_note-Guardrails-45">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-Guardrails_45-0) NVIDIA. *NeMo Guardrails*. GitHub, 2023–2025. <a href="https://github.com/NVIDIA/NeMo-Guardrails" class="external free" rel="nofollow">https://github.com/NVIDIA/NeMo-Guardrails</a> (arXiv:2310.10501).</span>
46. <span id="cite_note-License-46">[↑](https://systems-analysis.info/int/Nemotron_(NVIDIA)_(TR)#cite_ref-License_46-0) NVIDIA. *NVIDIA Nemotron Open Model License*. <a href="https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/" class="external free" rel="nofollow">https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/</a></span>
