Nemotron (NVIDIA) (TR)
Nemotron — açık ağırlıklı büyük dil modelleri (Large Language Model, LLM) ailesidir; NVIDIA bünyesindeki Applied Deep Learning Research (ADLR) birimi tarafından geliştirilmiştir. Modeller, makine öğrenmesi ve doğal dil işleme (Natural Language Processing, NLP) alanına aittir; sentetik veri üretimi, akıl yürütme (reasoning), ajan tabanlı uygulamalar (agentic AI) ve NVIDIA endüstriyel donanımına dağıtım gibi geniş bir görev yelpazesi için tasarlanmıştır. Aile, 4 milyardan yaklaşık 500 milyar parametreye kadar uzanan çeşitli mimari ve ölçeklerde modeller barındırmaktadır: Nemotron‑4 serisi yoğun (dense) decoder‑only Transformer modelleri (2024), hibrit Mamba‑Transformer modelleri (Nemotron‑H, 2025) ve Nemotron 3 serisinde Mixture-of-Experts (MoE) içeren hibrit Mamba‑Transformer modelleri (2025). Mart 2026 itibarıyla aile; metin üretimi, akıl yürütme, belge görsel anlama, bilgi çıkarma ve yanıt kalitesi değerlendirme görevlerini kapsayan 20'den fazla modeli bünyesinde barındırmaktadır. Modeller ağırlıklı olarak NVIDIA Open Model License ve Llama Community License lisansları altında açık ağırlıklarla yayımlanmaktadır.[1][2][3]
Tarihçe ve Arka Plan
Nemotron ailesinin geliştirilmesi, NVIDIA'nın üretici yapay zeka için eksiksiz bir araç yığını oluşturma stratejisi çerçevesinde sürdürülmektedir: eğitim altyapısından (DGX, H100/B200 GPU tabanlı süperbilgisayarlar) eğitim platformlarına (NeMo Framework), hizalama platformlarına (NeMo‑Aligner), dağıtım platformlarına (NIM — NVIDIA Inference Microservices) ve güvenlik araçlarına (NeMo Guardrails) kadar geniş bir yelpazede yer almaktadır.[4][5]
Nemotron‑3 8B (2023)
Serinin kamuya açık ilk modeli — 8 milyar parametreli, 4096 token bağlam uzunluğuna sahip decoder Transformer modelidir; 53 doğal dil ve 37 programlama dilinde 3,8 trilyon token üzerinde eğitilmiştir. Eğitim, 1024 A100 GPU üzerinde 19 günde tamamlanmıştır. arXiv'de resmi bir teknik rapor yayımlanmamıştır. Model, NeMo Framework ve Hugging Face aracılığıyla dağıtılmış; Chat (SFT ve SteerLM) varyantları da bulunmaktaydı. Lisansı — NVIDIA AI Foundation Models Community License.[6][7]
İsimlendirme hakkında not: 2023 yılının «Nemotron‑3» modeli ile Aralık 2025'in «Nemotron 3» modeli birbirinden farklıdır. İlki erken bir prototipken, ikincisi MoE mimarisine sahip güncel nesil modeldir.
Nemotron‑4 15B (Şubat 2024)
Nemotron‑4 serisinin kamuoyuna belgelenmiş ilk sürümü — 15 milyar parametreli bir modeldir; 384 DGX H100 düğümünde (3072 GPU'ya kadar) yaklaşık 13 takvim günü içinde 8 trilyon token üzerinde eğitilmiştir. 8 katlı tensör paralelizmi ve 96'dan 288'e kadar veri paralelizmi kullanılmıştır. Batch size 384'te tepe MFU (Model FLOPs Utilization) değeri %34,3 olmuştur. Mimari — Grouped‑Query Attention (GQA) ve Rotary Position Embeddings (RoPE) içeren decoder‑only Transformer'dır. Yayın tarihi itibarıyla yapılan benchmark sonuçlarına göre model, çok dilli görevlerde boyutuna yakın tüm açık modelleri geride bırakmış; hatta kendisinden dört kat büyük bazı modelleri de geçmiştir.[8]
Nemotron‑4 340B (Haziran 2024)
Haziran 2024'te Nemotron‑4 serisinin en büyük modeli yayımlandı — 340 milyar parametre (331,6 milyar gömülü olmayan parametre); yüksek kaliteli kaynaklara yeniden ağırlık verilerek gerçekleştirilen 9 trilyon token üzerinde ön eğitimle (8 trilyon ön eğitim + 1 trilyon sürdürülen eğitim) eğitilmiştir. Eğitim, Aralık 2023'ten Mayıs 2024'e kadar süren süreçte 768 DGX H100 düğümünde (6144 GPU'ya kadar) %42,4 tepe MFU ile gerçekleştirilmiştir. Aile üç varyant içermektedir: Base, Instruct ve Reward. Modelin boyutu, FP8 hassasiyet formatında dağıtım sırasında tek bir DGX H100 düğümüne (8 GPU) sığacak şekilde seçilmiştir. Hizalamada (alignment) kullanılan verilerin %98'inden fazlası, modeller tarafından yinelemeli bir süreçte sentetik olarak üretilmiştir; sentetik veri üretim hattı yeniden üretim için kamuya açıktır.[3]
Llama‑3.1‑Nemotron‑70B (Ekim 2024)
Ekim 2024'te Meta Llama‑3.1‑70B‑Instruct modelinden ince ayar yapılarak elde edilen modeller yayımlandı: Llama‑3.1‑Nemotron‑70B‑Instruct ve Llama‑3.1‑Nemotron‑70B‑Reward. 1 Ekim 2024 itibarıyla Instruct modeli aynı anda üç otomatik benchmark'ta birinci sıraya yerleşti: Arena Hard — 85,0, AlpacaEval 2 LC — %57,6, MT‑Bench (GPT‑4‑Turbo) — 8,98. Reward modeli ise RewardBench'te %94,1 değerine ulaştı.[9][10]
Hibrit Mimarilere Geçiş (2025)
2025 yılında seri, Mamba‑2 (State Space Model, SSM — durum uzayı modeli) katmanlarını ve Transformer katmanlarını bir araya getiren hibrit mimarilerle genişledi. Mart–Mayıs 2025'te, değiştirilebilir akıl yürütme moduna sahip Llama‑Nemotron akıl yürütme modelleri ailesi (Nano 8B, Super 49B, Ultra 253B) yayımlandı.[11] Nisan 2025'te Nemotron‑H (arXiv:2504.03624) yayımlandı — 8B, 56B ve 47B parametreli hibrit Mamba‑Transformer modelleri ailesi.[12] Ağustos 2025'te Nemotron Nano 2 (9B‑v2, arXiv:2508.14444) tanıtıldı.[13]
Nemotron 3 (Aralık 2025)
15 Aralık 2025'te üçüncü nesil duyuruldu — Nano, Super ve Ultra modellerini barındıran Nemotron 3 ailesi; 1 milyon tokena kadar bağlam penceresiyle Mamba‑2, Transformer ve MoE mimarilerini bir araya getirmektedir. Nano, teknik raporuyla birlikte yayımlandı; Super ve Ultra 2026'nın ilk yarısı için planlanmaktadır.[1][2][14][15]
Teorik Temeller
Nemotron‑4'te Transformer Mimarisi
Nemotron‑4 serisinin modelleri, nedensel dikkat mekanizmasına sahip standart decoder Transformer mimarisi üzerine inşa edilmiştir. Token dizisinin olasılığı şu şekilde çarpanlarına ayrılır:
burada — model parametreleridir.[8]
Dikkat mekanizması, Grouped‑Query Attention (GQA) varyantında uygulanmıştır[16]:
burada — sorgu, anahtar ve değer matrisleri; — dikkat kafası boyutudur.
Konum kodlaması için Rotary Position Embeddings (RoPE) kullanılmaktadır[17]:
burada — konumundaki vektör, , — vektör boyutudur.
MLP katmanlarında Squared ReLU aktivasyonu kullanılmaktadır: ; bu, aktivasyon seyrekliği sağlamaktadır. Modellerde ek terim (bias) bulunmamakta, dropout kullanılmamakta ve giriş ile çıkış gömme matrisleri birbirine bağlı değildir (untied embeddings). Tokenizer — boşluk korumalı, rakam karaktere göre bölümlü ve bayt tabanlı geri dönüş mekanizmalı SentencePiece BPE; sözlük boyutu — 256 000.[8][3]
Nemotron‑4 Mimari Parametreleri
| Parametre | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Parametre sayısı | 15 milyar (3,2 milyar gömme) | 340 milyar (9,4 milyar gömme) |
| Katman sayısı | 32 | 96 |
| Gizli boyut | 6144 | 18 432 |
| Dikkat kafaları | 48 | 96 |
| KV‑kafaları (GQA) | 8 | 8 |
| Bağlam uzunluğu | 4096 | 4096 |
| Sözlük boyutu | 256 000 | 256 000 |
Kaynaklar: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Nemotron‑H'ın Hibrit Mamba‑Transformer Mimarisi
Nemotron‑H modellerinde standart öz-dikkat blokları kısmen Mamba‑2 blokları — durum uzayı modelleri (State Space Models, SSM) — ile değiştirilmiştir. Otoregresif üretim sırasında her öz-dikkat katmanı, adım başına işlem ve bellek gerektirirken (KV önbelleği nedeniyle), Mamba katmanları üretilen her token için sabit bellek ve hesaplama maliyeti sağlamaktadır.[12]
Mamba‑2 şu tekrarlı bağıntıyla tanımlanmaktadır[18]:
burada — gizli durum, — köşegen durum geçiş matrisi, ve — projeksiyon matrisleri, — giriş tokeni, — çıkış sinyalidir. Mamba‑2'de , , matrisleri giriş bağımlıdır (input‑dependent); bu özellik modeli klasik doğrusal SSM'lerden ayırmaktadır.
Nemotron‑H‑56B'de 54 Mamba‑2 katmanı + 54 MLP katmanı + 10 öz-dikkat katmanı kullanılmaktadır; dikkat katmanları Mamba katmanları arasına eşit aralıklarla yerleştirilmiştir. Model, 6144 H100 GPU üzerinde FP8 (tensör başına ölçekleme) formatında 20 trilyon token üzerinde eğitilmiştir. Nemotron‑H‑8B versiyonu 24 Mamba‑2 katmanı, 24 MLP katmanı ve 4 öz-dikkat katmanı içermekte; eğitim 15 trilyon token üzerinde gerçekleştirilmiştir.[12]
Nemotron 3'ün MoE Mimarisi
Nemotron 3 modelleri (Aralık 2025) üç mimari bileşeni bir araya getirmektedir: Mamba‑2, Transformer ve Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) 52 katman içermektedir: 23 Mamba‑2 + MoE katmanı, 23 MoE katmanı ve 6 GQA dikkat katmanı. Her MoE katmanı, token başına 6 uzman etkinleştirilen 128 yönlendirilebilir (routed) uzman + 1 ortak (shared) uzman barındırmaktadır. Yönlendirme, sigmoid gating'li eğitilebilir MLP yönlendiricisi tarafından gerçekleştirilmektedir. Yük dengeleme, yardımcı kayıp fonksiyonu olmadan (aux‑loss‑free) uygulanmaktadır. Toplam parametre sayısı 31,6 milyar olmakla birlikte, token başına yalnızca 3,2 milyar parametre etkindir.[2]
Normalizasyon — RMSNorm[19]. Mamba bölümlerinde konum gömmeleri bulunmamaktadır (konum bilgisi SSM durumunda örtük olarak yer almaktadır). Bağlı olmayan gömmeler kullanılmakta; doğrusal katmanlarda dropout ve bias yer almamaktadır.[2]
Super/Ultra'daki Uzantılar: LatentMoE ve Multi‑Token Prediction
Nemotron 3 ailesindeki Super ve Ultra modelleri iki ek mimari yenilik uygulamaktadır:
- Latent MoE (LatentMoE) — yönlendirmeden önce giriş temsilini daha küçük boyutlu bir gizli uzaya projekte etme; bu, benzer hesaplama maliyetiyle uzman sayısını artırmayı ve verim düşürmeden doğruluğu iyileştirmeyi sağlar.[1]
- Multi‑Token Prediction (MTP) — aynı anda birden fazla sonraki tokenin tahmin edilmesi; uzun metinlerin kalitesini iyileştirmek ve çıkarım sırasında spekülatif kod çözme için kullanılır.[1]
Super ve Ultra'nın eğitimi, Blackwell mimarisinde NVIDIA'nın 4 bitlik sayı formatı olan NVFP4 formatında gerçekleştirilmektedir.[1]
Model Sıkıştırma Yöntemleri: Minitron, Puzzle, MiniPuzzle
NVIDIA, kompakt modeller oluşturmak için çeşitli yaklaşımlar kullanmaktadır:
- Minitron — yapısal budama (pruning) ve bilgi damıtma (knowledge distillation) yöntemi. İki tür budama araştırılmaktadır: derinlik bazlı (katman kaldırma) ve genişlik bazlı (gizli katman boyutlarının, dikkat kafalarının ve MLP projeksiyon boyutlarının birlikte küçültülmesi). Minitron'un Nemotron‑4 15B'ye uygulanması, sıfırdan eğitime kıyasla 40 kata kadar eğitim maliyeti azaltımıyla 8B ve 4B modeller elde edilmesini sağlamaktadır.[20]
- Puzzle — her bloğun optimal yapılandırmasını (KV kafa sayısı, FFN boyutu, dikkat varlığı/yokluğu) blok bazında damıtmayla belirleyen bir Neural Architecture Search (NAS) algoritmasıdır. Llama 3.1 405B bu yöntemle 253B'ye (Llama‑Nemotron Ultra) ve Llama 3.3 70B 49B'ye (Llama‑Nemotron Super) sıkıştırılmıştır.[21]
- MiniPuzzle — Nemotron‑H‑56B'yi yalnızca 63 milyar token damıtmayla 47B'ye sıkıştıran, hibrit mimariler için Puzzle'ın genişletilmiş versiyonudur. Benzer doğrulukta sıkıştırılmış model %20 daha hızlı çıkarım yapmaktadır.[12]
Hizalama Yöntemleri
HelpSteer ve HelpSteer2
HelpSteer — Scale AI ile ortaklaşa oluşturulan, her yanıtın beş özelliğe göre (0–4 Likert ölçeğiyle) etiketlendiği 37 120 örnekten oluşan bir veri kümesidir (CC‑BY‑4.0 lisansı): yararlılık (helpfulness), doğruluk (correctness), tutarlılık (coherence), karmaşıklık (complexity) ve ayrıntı düzeyi (verbosity).[22]
HelpSteer2 — örneklerin %95'inden fazlasının ShareGPT'den (gerçek kullanıcı sorguları) alındığı 21 362 örnekten (10 681 istem × 2 yanıt) oluşan güncellenmiş bir veri kümesidir. Etiketlerin yaklaşık %50'si yetersiz kalite gerekçesiyle filtrelenmiştir. HelpSteer2‑Preference uzantısı, aynı veriler üzerinde hem regresyon hem de ikili tercih ödül modellerinin eğitilmesine olanak tanıyan ikili açıklayıcı tercihleri eklemektedir.[23][24]
SteerLM
SteerLM — çıkarım sırasında kullanıcının yanıt stilini kontrol etmesine olanak tanıyan, özellikler (helpfulness, correctness, coherence, complexity, verbosity) üzerinde koşullanmayla gerçekleştirilen SFT (Supervised Fine‑Tuning — denetimli ince ayar) yöntemidir. Süreç şu adımları kapsamaktadır: (1) HelpSteer üzerinde özellik tahmin modeli (APM) eğitimi, (2) APM ile veri etiketleme, (3) hedef özellik değerlerine koşullu SFT, (4) önyükleme (bootstrapping).[25]
DPO ve RPO
DPO (Direct Preference Optimization) — açık bir ödül modeli olmaksızın doğrudan tercih optimizasyonu yöntemidir; Nemotron‑4 340B Instruct ve Nemotron Nano 2 hatlarında kullanılmaktadır.[26]
RPO (Reward‑aware Preference Optimization) — DPO, IPO, SimPO, REINFORCE ve SteerLM 2.0'ı özel durumlar olarak genelleştiren, NVIDIA'nın birleşik matematiksel çerçevesidir. RPO, örtük ödül modelinin tahminleri ile hedef açık model arasındaki mesafeyi minimize eder[27]:
burada — açık ödül modeli, — eğitilen politika, — referans politika, — mesafe fonksiyonu, / — tercih edilen/reddedilen yanıttır. RPO, Nemotron‑4 340B Instruct ve Llama‑Nemotron modellerinin eğitiminde kullanılmaktadır.[27][3][11]
Çok Ortamlı Pekiştirmeli Öğrenme (RLVR)
Nemotron 3'te Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) uygulanmaktadır — NeMo Gym çerçevesinde rekabetçi matematik, programlama, soru-cevap, araç kullanımı (tool‑use), talimat takibi ve uzun bağlam gibi birden fazla ortamda eş zamanlı eğitim. Algoritma — maskelenmiş önem örneklemeli GRPO (Group Relative Policy Optimization).[2][14]
Nemotron 3, akıl yürütme bütçesi kontrolü (reasoning budget control) için ayrıntılı destek sunmaktadır: kullanıcı, sohbet şablonundaki bayrak aracılığıyla düşünce izlemine (thinking trace) token sınırı belirleyebilir («detailed thinking on/off» geçişi veya uzunluk sınırlaması).[2]
Model Ailesi
Özet Tablo
| Model | Yıl | Toplam / Aktif Parametre | Bağlam | Mimari | Temel Özellikler |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 gün |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU %34,3 |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; hizalama için >%98 sentetik veri |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench %94,1 |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Llama 3.1 8B'den NAS sıkıştırma |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.3 70B'den |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.1 405B'den; GPQA %76,0 |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hibrit Mamba‑Transformer | 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hibrit Mamba‑Transformer | 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hibrit Mamba‑Transformer | 56B'den MiniPuzzle; +%20 hız |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hibrit Mamba‑Transformer | 20T token; Minitron damıtma |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hibrit Mamba‑Transformer MoE | 25T token; 128 uzman, 6 aktif |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hibrit LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hibrit LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Mimari: 32 katman, hidden dimension 6144, 48 dikkat kafası, 8 KV kafası (GQA). Toplam parametre sayısı — 15 milyar (3,2 milyar gömme + 12,5 milyar gömme dışı). Sonuçlar: MMLU — %64,2 (5‑shot), BBH — %58,7 (3‑shot), GSM8K — %46,0 (8‑shot, maj@1), HumanEval — %31,6 (0‑shot, pass@1). Çok dilli benchmark'larda (XCOPA, TyDiQA‑GoldP, MGSM) model, kendisinden 4 kat büyük modelleri geride bırakmıştır.[8]
Nemotron‑4 340B
Mimari: 96 katman, hidden dimension 18 432, 96 dikkat kafası, 8 KV kafası.
Nemotron‑4 340B Base şu sonuçları gösterdi: MMLU — %81,1 (5‑shot), BBH — %85,4 (3‑shot), HumanEval — %57,3 (0‑shot), ARC‑Challenge — %94,3 (25‑shot).[3]
Nemotron‑4 340B Instruct çok aşamalı hizalamadan geçirildi: Code SFT → General SFT → DPO → RPO (3 tur). Sonuçlar: MT‑Bench — 8,22 (GPT‑4‑Turbo yargıcı), MMLU — %78,7 (0‑shot), GSM8K — %92,3 (0‑shot), HumanEval — %73,2 (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — %41,5.[3]
Nemotron‑4 340B Reward, son softmax katmanını son katmanın gizli durumunu 5 HelpSteer2 özelliğinden oluşan bir vektöre doğrusal olarak projekte eden bir katmanla değiştirir. Nihai ödül, beş özelliğin ağırlıklı toplamıdır. Eğitim, HelpSteer2 verileri üzerinde 2 epoch boyunca (batch size 128) gerçekleştirilmiştir. RewardBench'te model, yayın tarihi itibarıyla GPT‑4o (%84,7), Gemini 1.5 Pro (%88,1) ve Claude‑3‑Opus'u (%80,7) geçerek %92,0 değerine ulaşmıştır.[3]
| Model | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | %41,5 | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | %34,4 | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | %30,9 | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | %38,8 | 8,26 |
Kaynak: arXiv:2406.11704, Tablo 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward, Bradley‑Terry (ikili tercihler) ve SteerLM regresyonunu (Likert ölçeğinde çok özellikli değerlendirme) bir araya getiren hibrit bir yöntemle eğitilmiştir. Eğitim yalnızca HelpSteer2 verileri (CC‑BY‑4.0) kullanılarak gerçekleştirilmiştir. RewardBench'te model, yayın tarihi itibarıyla birinci sıraya yerleşerek %94,1 değerine ulaşmıştır.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct, PPO değil REINFORCE algoritması ve Nemotron‑70B‑Reward ödül modeliyle RLHF yöntemiyle hizalanmıştır. Altyapı — TRT‑LLM hızlandırmalı NeMo‑Aligner.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
NAS, damıtma ve kapsamlı son eğitim yöntemleriyle Llama 3.x'ten elde edilen akıl yürütme modelleri ailesi.[11]
| Model | Parametre | Temel Model | Bağlam |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 milyar | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 milyar | Minitron 4B (Llama 3.1 8B'den) | 128K |
| Llama‑Nemotron‑Super 49B | 49 milyar | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 milyar | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Beş aşamalı eğitim hattı: (1) NAS + FFN Fusion, (2) damıtma + sürdürülen ön eğitim, (3) SFT (DeepSeek‑R1 akıl yürütme izleri dahil), (4) ölçekli RL (Ultra için GRPO, Nano için REINFORCE/RLOO + Online RPO), (5) diyalog hizalaması.[11]
Modeller, açık LLM'ler arasında ilk kez değiştirilebilir akıl yürütme modu (reasoning toggle) desteği sunmaktadır: etkin olduğunda («detailed thinking on» sistem isteğinde) model, yanıttan önce <think>...</think> etiketleri içinde akıl yürütme zinciri üretir; devre dışı bırakıldığında doğrudan yanıt verir.[11]
Llama‑Nemotron‑Ultra 253B sonuçları (reasoning ON): GPQA Diamond — %76,0, AIME 2024 — %80,8, MATH 500 — ~%97. Karşılaştırma için: DeepSeek‑R1 (671B toplam / 37B aktif) — GPQA Diamond %71,5, AIME 2024 ~%79,8. Ultra, 8×H100'lü tek bir düğüme sığmaktadır.[11]
Nemotron‑H (Nisan 2025)
Uzun üretim gerektiren görevler için tasarlanmış, sıfırdan eğitilmiş yoğun hibrit modeller ailesi. Nemotron‑H‑56B, FP8 formatında 20 trilyon token üzerinde eğitilmiştir — FP8 ön eğitimi alanında kamuoyuyla paylaşılmış en büyük deneylerden biridir. Nemotron‑H‑47B, 56B modelinden MiniPuzzle yöntemiyle (63 milyar token damıtma) sıkıştırılmıştır; 1M token bağlamda tek bir RTX 5090'ın belleğine (FP4) sığmaktadır.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Kaynak: arXiv:2504.03624.[12]
H100 üzerinde 65 536 giriş ve 1024 çıkış tokeniyle üretim yaparken Nemotron‑H‑47B, Qwen‑2.5‑72B ve Llama‑3.1‑70B'ye kıyasla 2,9 kat daha hızlı çalışmıştır.[12]
Nemotron Nano 2 (Ağustos 2025)
Akıl yürütme görevleri için hibrit Mamba‑Transformer modeli. Nemotron‑Nano‑12B‑v2‑Base — ağırlıklı olarak Mamba‑2 + MLP + 4 dikkat katmanından oluşan 62 katmanlı, sıfırdan FP8 formatında 20 trilyon token üzerinde eğitilmiş üst modeldir. Bu modelden genişletilmiş Minitron yöntemiyle elde edilen Nemotron‑Nano‑9B‑v2, tek bir NVIDIA A10G GPU'da (22 GB, BF16) 128K token bağlamıyla çalışabilmektedir. Son eğitim: SFT (80 milyar token; DeepSeek‑R1‑0528 izleri dahil) → GRPO → DPO → RLHF. Akıl yürütme benchmark'larında model, Qwen3‑8B ile benzer doğruluğa sahip olmakla birlikte, uzun çıkış dizilerinde 3–6 kat üretim hızlanması sağlamaktadır.[13]
Nemotron 3 Nano 30B‑A3B
Aralık 2025'te yayımlandı. Parametreler: toplam 31,6 milyar, aktif 3,2 milyar. Mimari: 52 katman, hidden dimension 2688, uzman boyutu 1856, Mamba durum boyutu 128. MoE: 128 yönlendirilebilir uzman + 1 ortak uzman, token başına 6 aktif uzman. Bağlam — 1 048 576 tokena kadar. 25 trilyon token üzerinde iki fazda eğitim (WSD çizelgesi, batch size 3072, veri kesim tarihi — Haziran 2025): 1. Faz — 23,5 trilyon (çeşitli veriler), 2. Faz — 1,5 trilyon (yüksek kaliteli veriler) + 121 milyar token uzun bağlam CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (araçsız) | 89,06 | 85,0 | 91,7 |
| AIME25 (araçlı) | 99,17 | — | 98,7 |
| GPQA (araçsız) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Ort. | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Ort. | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — ikincil kaynaklardan alınan değerler; yeniden üretim koşulları — NeMo Evaluator SDK. Kaynak: arXiv:2512.20848.[2][28]
Verim (8K giriş / 16K çıkış, tek H200): Qwen3‑30B‑A3B‑Thinking'e kıyasla 3,3 kat, GPT‑OSS‑20B'ye kıyasla 2,2 kat daha yüksek.[2]
Ek Modeller ve Araştırma Yönleri
- OpenReasoning‑Nemotron (Temmuz 2025) — Qwen 2.5 tabanlı, DeepSeek‑R1‑0528 verileri üzerinde ince ayar yapılmış 1,5B–32B parametreli bir model serisi. GenSelect@64 kullanan 32B varyantı, belirli matematik benchmark'larında o3'ü (high) geride bırakmaktadır.[29]
- Nemotron Elastic (arXiv:2511.16664) — tek bir üst model içinde iç içe geçmiş alt modeller (6B, 9B, 12B) çerçevesi; sıfırdan eğitime kıyasla eğitim maliyetini 360 kat azaltmaktadır.[30]
- Nemotron‑CrossThink — matematik görevlerinin ötesine geçen çok alanlı pekiştirmeli öğrenme çerçevesi; MATH‑500'de +%30,1 ve MMLU‑PRO'da +%12,8 iyileşme sağlamıştır.[31]
- Nemotron‑UltraLong — bağlamı 4 milyon tokena genişletme.[32]
- Jet‑Nemotron — kompakt hibrit modeller (2B/4B) için son eğitim NAS.[33]
Uzmanlaşmış Modeller
Nemotron ekosistemi ayrıca uzmanlaşmış görevler için modeller barındırmaktadır:
- Nemotron Nano V2 VL — OCR, tablo işleme ve video için vision‑language modeli.[34]
- Nemotron Parse 1.1 — OCR ve belge yapısı çıkarımı için model.[35]
- Nemotron ColEmbed V2 — görsel belge araması için gömme modeli (geç etkileşim).[36]
- Nemotron Speech — otomatik konuşma tanıma (ASR), konuşma sentezi (TTS) ve makine çevirisi (NMT) için modeller.[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — 9 dilde 23 kategoride güvensiz içerik sınıflandırma modeli; %84,2 doğruluk.[37]
Ön Eğitim Verileri
Nemotron‑4 Veri Bileşimi
Nemotron‑4 15B ve 340B'nin ön eğitim külliyatı üç temel kategoriden oluşmaktadır: İngilizce metinler (%70), 53 dilde çok dilli metinler (%15) ve 43 programlama dilinde kaynak kodu (%15). Belge düzeyinde yineleme giderme (tam ve yakın yineleme) ile dil modelleri ve sezgisel kurallar kullanılarak filtreleme uygulanmıştır. 15B modeli 8 trilyon token, 340B modeli ise 9 trilyon token (8 trilyon ön eğitim + yüksek kaliteli kaynaklara yeniden ağırlık verilen 1 trilyon sürdürülen eğitim) üzerinde eğitilmiştir.[8][3]
Nemotron‑CC
Nemotron‑CC veri kümesi, kalite sınıflandırıcıları topluluğu ve metinlerin sentetik yeniden ifadesi kullanılarak Common Crawl'dan oluşturulmuştur. Toplam hacim — 6,3 trilyon token (4,4 trilyon yinelemesi giderilmiş + 1,9 trilyon sentetik yeniden formüle edilmiş). Hat, NeMo Curator aracına entegre edilmiştir. Çalışma, ACL 2025 konferansında Long Paper olarak kabul edilmiştir.[38]
Nemotron‑CC‑Math
Common Crawl'dan Lynx + LLM hattı kullanılarak çıkarılan, matematiksel formüller ve kodun LaTeX yapısını koruyan 133 milyar token hacminde matematik odaklı bir alt küme.[39]
Nemotron 3 Nano Verileri
Nemotron 3 Nano'nun ön eğitimi 25 trilyon token üzerinde gerçekleştirilmiştir. Küme şunları kapsamaktadır: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 ve uzmanlaşmış STEM veri kümeleri. Uzun bağlam eğitimi için ek 121 milyar token CPT kullanılmıştır.[2]
Nemotron Pretraining Dataset v1
STEM, akademik metinler, akıl yürütme görevleri ve çok dilli alanları kapsayan sentetik olarak üretilmiş bir küme; 10 trilyon'dan fazla dil tokeni ve SFT için 18 milyon örnek içermektedir. Tüm veri kümeleri açık izin veren lisanslar altında dağıtılmaktadır.[40]
Sentetik Veri Üretim Hattı (SDG)
Nemotron‑4 340B raporunda açıklanan hat şu aşamaları kapsamaktadır[3]:
- İstem üretimi: Open QA, Writing, Closed QA, Math & Coding şablonlarına göre Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 lisansı) kullanılarak üretilen sentetik tek ve çift turlu istekler.
- Yanıt üretimi: çeşitlilik sağlamak amacıyla modellerin ara versiyonlarından birden fazla yanıt.
- Kalite değerlendirmesi: üç yaklaşım — Ground‑Truth‑as‑a‑Judge (doğrulanabilir yanıtlı görevler için), LLM‑as‑Judge (dil modeli tarafından yanıt çiftlerinin karşılaştırılması), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward kullanımı).
- Zayıftan güçlüye (weak‑to‑strong) yinelemeli hizalama.
İnsan tarafından etiketlenmiş yaklaşık 20 000 örnekten (SFT için 10 000, ödül modeli için 10 000 HelpSteer2) tüm hizalama verilerinin geri kalanı sentezlenmiştir.[3]
Kuantizasyon ve Çıkarım Optimizasyonu
Nemotron 3 Nano modelleri, ModelOpt ve Megatron‑LM kullanarak FP8'de Eğitim Sonrası Kuantizasyon (PTQ) desteği sunmaktadır. Seçici kuantizasyon (selective quantization) uygulanmaktadır — dikkat katmanları ve Mamba'nın bir kısmı kaliteyi korumak amacıyla BF16'da tutulurken, geri kalanlar FP8'e kuantize edilmektedir. Teknik rapora göre bu yaklaşım, doğruluğun ~%99'unu korumaktadır.[2] Nano ayrıca NVFP4 formatında çıkarımı desteklemektedir.[1]
Nesiller Arası Benchmark Özet Tablosu
| Model | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Koşullar |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | %64,2 | %46,0 | %31,6 | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | %81,1 | — | %57,3 | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | %78,7 | %92,3 | %73,2 | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | Eki. 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA %76,0, AIME %80,8 |
| Nemotron‑H‑47B | %83,6 | %93,3 | %61,0 | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 %89,1, LCB %68,3 |
Karşılaştırma dikkatli yorumlanmalıdır: değerlendirme koşulları, benchmark sürümleri ve test tarihleri nesiller arasında farklılık göstermektedir. Sonuçlar NVIDIA teknik raporlarından alınmıştır; bağımsız değerlendirmeler farklılık gösterebilir (bkz. «Sınırlılıklar» bölümü).[8][3][9][11][12][2]
Kullanım Alanları
NVIDIA NIM Aracılığıyla Dağıtım
NVIDIA NIM — OpenAI uyumlu API ile çıkarım için optimize edilmiş konteyner tabanlı mikro hizmetler kümesidir. Nemotron modelleri, build.nvidia.com platformunda NIM mikro hizmetleri olarak sunulmaktadır. NIM; FP8, BF16, NVFP4 formatlarını ve Kubernetes üzerinde Helm grafikleri aracılığıyla dağıtımı desteklemektedir. Modeller ayrıca bağımsız çerçevelerle de uyumludur: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Sentetik Veri Üretimi
Nemotron‑4 340B, sentetik veri üreticisi olarak kullanılmak üzere tasarlanmıştır: Instruct modeli yanıtlar üretirken Reward modeli bunları değerlendirir ve filtreler. NVIDIA Open Model License, model çıktılarının diğer modellerin eğitimi için kullanılmasına açıkça izin vermektedir. ServiceNow'un verilerine göre, Apriel 1.6 modelinin ön eğitim verilerinin %15'i Nemotron veri kümelerinden elde edilmiştir.[3][15][41]
Ajan Sistemleri
Nemotron 3 ailesinin modelleri (Nano, Super, Ultra), planlama, geri çağırma (retrieval) ve araç çağırma (tool use) gibi çok ajan iş yükleri için tasarlanmıştır. Nemotron 3 Nano, SWE‑Bench'te (OpenHands ile) %38,76 ve TauBench V2'de %49,04 (ort.) sonuç sergilemektedir.[2]
Kurumsal Uygulamalar
Açıklanan iş ortakları arasında şunlar yer almaktadır: ServiceNow (iş akışı otomasyonu için ortak Apriel Nemotron 15B modeli), CrowdStrike (Charlotte AI platformu), Perplexity (sorgu yönlendirme), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modeller AWS Amazon Bedrock'ta mevcuttur; Google Cloud, CoreWeave ve Nebius desteği planlanmaktadır.[15]
Sınırlılıklar ve Açık Sorunlar
Bağımsız Değerlendirmeler ve NVIDIA Verileriyle Farklılıklar
Bağımsız değerlendirmeler, NVIDIA tarafından sunulan sonuçlarla farklılıklar ortaya koymaktadır. Artificial Analysis'in Şubat 2026 verilerine göre Llama‑Nemotron‑Ultra 253B (akıl yürütme), benzer boyuttaki modellerin ortancası 26 iken 15 Intelligence Index puanı almıştır. Chatbot Arena (LMArena) platformunda Nemotron modelleri sıralamanın ortasında yer almaktadır: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. sıra), Nemotron 3 Nano — 1317 ±6 (~164. sıra).[42][43]
Aşırı Ayrıntılı Yanıt Üretimi
Nemotron modelleri yüksek düzeyde ayrıntılı yanıt üretme eğilimi göstermektedir: Artificial Analysis'in değerlendirmesinde Nemotron 3 Nano, diğer modellerin ortancası olan 12 milyona karşılık 140 milyon token üretmiş; bu durum çıkarım maliyetlerini artırmaktadır. DEV Community'nin analizi, Llama‑3.1‑Nemotron‑70B‑Instruct'ın otomatik benchmark'larda resmi olarak öne çıkmasına rağmen bazı pratik görevlerde yetersiz doğruluk sergilediğini ve Arena benzeri benchmark'lardaki yüksek puanların, her zaman doğru olmayan ancak ayrıntılı ve emin görünen yanıtlara verilen tercihi yansıtıyor olabileceğini ortaya koymuştur.[42][44]
Halüsinasyonlar ve Önyargı
NVIDIA, model kartlarında modellerin «özellikle toksik istemlerde önyargıları güçlendirebileceğini ve toksik yanıtlar üretebileceğini», ayrıca «yanlış bilgi üretebileceğini ve önemli ayrıntıları atlayabileceğini» belirtmektedir. Açık ağırlıklar ve veriler harici denetime olanak tanımaktadır.[11][13]
Hesaplama Gereksinimleri
Yoğun modeller (Nemotron‑4 340B), tam eğitim için 768 DGX H100 düğümlü bir küme gerektirmekte; bu durum, benzer altyapıya erişimi olmayan akademik gruplar için yeniden üretimi kısıtlamaktadır. Çıkarım sırasında uzun bağlam (1M), önemli miktarda VRAM gerektirmektedir.[3][2]
Bağlam Genişletmede Performans Düşüşü
Bağlamın aşırı uzun dizilere genişletilmesinde, kısa bağlamlı benchmark'larda sonuçların gerilediği gözlemlenmiştir.[32]
Hibrit Mimarilerin Kuantizasyonu
Mamba‑Transformer mimarilerinde aşırı düşük bit genişliğinin (FP8/NVFP4) kullanılması, bazı benchmark'larda küçük bir doğruluk düşüşüne (~%1) yol açmaktadır. Bu sorun, derleyici ve çıkarım sunucusu mimarisini karmaşıklaştıran seçici kuantizasyon uygulamasıyla ele alınmaktadır.[2][1]
Diğer Açık Sorunlar
- Eğitim verisi kontaminasyonu olasılığı olan benchmark'lara bağımlılık.
- Hibrit SSM‑Transformer mimarileri ile saf Transformer modellerinin karşılaştırılması için standart protokollerin eksikliği.
- Token başına az sayıda uzmanla derin akıl yürütme gerektiren görevlerde MoE yaklaşımının ölçeklenebilirlik sorunu.
- Aralık 2025 itibarıyla Super/Ultra verileri ön nitelik taşımaktadır; tam benchmark sonuçları sürümden sonra beklenmektedir.[1]
Etik ve Düzenleyici Boyutlar
Geliştirme Aşamasında Güvenlik
Geliştirme aşamasında şunlar uygulanmaktadır: AEGIS çerçevesiyle değerlendirme (13 içerik güvenliği kategorisi), garak güvenlik açığı tarayıcısı ve manuel kırmızı takım testi (red‑teaming).[37]
Çıkarım Aşamasında Güvenlik
NeMo Guardrails — LLM sistemlerine programlanabilir bariyerler ekleyen açık kaynaklı bir araç setidir (Apache 2.0 lisansı). Mikro hizmet, giriş ve çıkışları yakalayarak yapılandırılabilir denetimler uygular: konu kontrolü, kişisel tanımlayıcı bilgi (PII) tespiti, RAG doğrulama kontrolü, jailbreak saldırı tespiti (YARA tabanlı kod enjeksiyon koruması dahil), çok dilli ve çok modlu güvenlik sınıflandırması.[45]
Nemotron 3 için, araç kullanan gerçekçi senaryolardan alınan yaklaşık 11 000 etiketlenmiş OpenTelemetry izinden oluşan ve ajan güvenliğini değerlendirmeye yönelik bir küme yayımlanmıştır.[1]
Lisanslama
| Modeller | Lisans |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (Meta'dan miras) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License, ticari kullanıma, türev çalışmalar oluşturulmasına ve dağıtılmasına izin vermekte; atıf zorunluluğu getirmemekte (NOTICE dosyasının korunması kaydıyla), kullanıcı sayısına sınırlama getirmemekte ve model çıktılarının diğer modellerin eğitiminde kullanılmasına açıkça izin vermektedir.[46] Llama tabanlı modeller, aylık 700 milyon aktif kullanıcı eşiği de dahil olmak üzere Meta kısıtlamalarını miras almaktadır.[11]
Nemotron 3 Nano için NVIDIA şunları yayımlamıştır: model ağırlıkları, 10 trilyon tokenden fazla eğitim verisi, eğitim tarifleri, kod tabanları (NeMo, Megatron‑LM, NeMo‑Aligner) ve 900 000'den fazla görev içeren 10'dan fazla pekiştirmeli öğrenme ortamı.[1][2]
Gelecek Perspektifler ve Araştırma Yönleri
Yaklaşan sürümler, 2026'nın ilk yarısında beklenen Nemotron 3 Super (~100 milyar parametre, ~10 milyar aktif) ve Nemotron 3 Ultra (~500 milyar, ~50 milyar aktif) modellerini kapsamaktadır. Her iki model de Blackwell mimarisinde LatentMoE, MTP ve NVFP4 formatında eğitim kullanacaktır.[1]
NVIDIA'nın stratejik yönelimi, Nemotron'u tekil bir model olarak değil; karmaşıklığa göre yönlendirme ile ailenin farklı modellerinin farklı görevler için kullanıldığı çok ajan sistemleri için bir altyapı katmanı olarak konumlandırmaktır.[1][15]
Temel araştırma yönleri:
- Hibrit mimarilerin geliştirilmesi — ölçeklenebilir uzun bağlam için SSM katmanlarının dikkat mekanizmasıyla daha ileri entegrasyonu.[12]
- Çok katmanlı sıkıştırma yöntemleri — Minitron, Puzzle, MiniPuzzle ve Nemotron Elastic'in geliştirilmesi.[20][21][30]
- Çok alanlı pekiştirmeli öğrenme — matematik görevlerinin ötesinde RL'yi genişletmek için Nemotron‑CrossThink.[31]
- Bağlam genişletme — Nemotron‑UltraLong ile 4 milyon tokena uzatma.[32]
- Çok modalite — vision‑language (Nemotron VL), konuşma (Nemotron Speech) ve görsel belge araması (Nemotron ColEmbed V2) alanlarına genişleme.[34][35][36]
- Kompakt hibrit modeller — Jet‑Nemotron (2B/4B modeller için NAS).[33]
- Açık tarifler — topluluk tarafından yeniden üretim ve özelleştirme için tam eğitim tariflerinin ve verilerinin yayımlanması.[14]
Ayrıca bakınız
- Transformer Mimarisi
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta model ailesi)
Literatür
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. ve diğ. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, Şubat 2024. https://arxiv.org/abs/2402.16819
- Adler, B. ve diğ. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, Haziran 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. ve diğ. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, Haziran 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. ve diğ. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, Temmuz 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. ve diğ. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, Kasım 2024. https://arxiv.org/abs/2411.19146
- Su, D. ve diğ. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. ve diğ. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, Ocak 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. ve diğ. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, Nisan 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. ve diğ. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, Mayıs 2025. https://arxiv.org/abs/2505.00949
- Basant, A. ve diğ. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, Ağustos 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. ve diğ. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, Ağustos 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. ve diğ. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, Kasım 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. ve diğ. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, Aralık 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. ve diğ. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, Aralık 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. ve diğ. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. ve diğ. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. ve diğ. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Kaynakça
- NVIDIA Research — Nemotron 3 sayfası: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — Nemotron belgeleri: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Belgeleri: https://docs.nvidia.com/nemo/
Notlar
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/