Nemotron (NVIDIA) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — nyílt súlyú nagy nyelvi modellek (Large Language Model, LLM) családja, amelyet az NVIDIA Corporation Applied Deep Learning Research (ADLR) részlege fejlesztett ki. A modellek a gépi tanulás és a természetes nyelvfeldolgozás (Natural Language Processing, NLP) területéhez tartoznak, és széles feladatkörre készültek: szintetikus adatgenerálás, következtetés (reasoning), ügynökalapú alkalmazások (agentic AI) és ipari NVIDIA-hardveren való telepítés. A család különböző architektúrájú és méretű modelleket foglal magában: 4 milliárdtól ~500 milliárd paraméterig, beleértve a Nemotron‑4 sorozat sűrű (dense) decoder‑only Transformer-modelljeit (2024), a hibrid Mamba‑Transformer modelleket (Nemotron‑H, 2025), valamint a Mixture-of-Experts (MoE) architektúrájú hibrid Mamba‑Transformer modelleket a Nemotron 3 sorozatban (2025). 2026 márciusában a család több mint 20 modellt számlál, amelyek lefedik a szöveggenerálás, következtetés, dokumentumok vizuális megértése, információkinyerés és válaszminőség-értékelés feladatait. A modellek jellemzően nyílt súlyokkal jelennek meg, NVIDIA Open Model License és Llama Community License licencek alatt.[1][2][3]

Történet és előzmények

A Nemotron család fejlesztése az NVIDIA azon stratégiájának keretében zajlik, amelynek célja a generatív mesterséges intelligenciához szükséges teljes eszközstack kialakítása: a tanítási infrastruktúrától (DGX, GPU H100/B200 alapú szuperszámítógépek) a tanítási platformokig (NeMo Framework), a hangolásig (NeMo‑Aligner), a telepítésig (NIM — NVIDIA Inference Microservices) és a biztonsági eszközökig (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

A sorozat első nyilvánosan elérhető modellje — 8 milliárd paraméterű, 4096 tokenes kontextusú dekóderes Transformer, amelyet 3,8 billió tokenen tanítottak 53 természetes és 37 programozási nyelven. A tanítás 1024 A100 GPU-n zajlott 19 nap alatt. Nem jelent meg formális műszaki jelentés az arXiv-on. A modell a NeMo Framework-ön és a Hugging Face-en volt elérhető; létezett Chat (SFT és SteerLM) változat is. Licence: NVIDIA AI Foundation Models Community License.[6][7]

Megjegyzés az elnevezésekről: A 2023-as „Nemotron‑3" és a 2025 decemberi „Nemotron 3" különböző modellek. Az előbbi egy korai prototípus volt, az utóbbi egy aktuális, MoE architektúrájú generáció.

Nemotron‑4 15B (2024. február)

A Nemotron‑4 sorozat első nyilvánosan dokumentált kiadása — 15 milliárd paraméteres modell, amelyet 8 billió tokenen tanítottak kb. 13 naptári nap alatt 384 DGX H100 csomóponton (akár 3072 GPU). 8-szoros tenzorpárhuzamosságot és 96-tól 288-ig terjedő adatpárhuzamosságot alkalmaztak. A csúcs MFU (Model FLOPs Utilization) 34,3% volt, batch size 384 esetén. Az architektúra: decoder‑only Transformer, Grouped‑Query Attention (GQA) és Rotary Position Embeddings (RoPE) elemekkel. A publikáció idején a benchmarkok alapján a modell felülmúlta az összes hasonló méretű nyílt modellt többnyelvű feladatokban, köztük több olyan modellt is, amelyek mérete négyszerese volt.[8]

Nemotron‑4 340B (2024. június)

2024 júniusában megjelent a Nemotron‑4 sorozat legnagyobb modellje — 340 milliárd paraméter (331,6 milliárd nem‑embedding), amelyet 9 billió tokenen tanítottak (8 billió előtanítás + 1 billió folytatólagos tanítás, magas minőségű források újrasúlyozásával). A tanítás 768 DGX H100 csomóponton (akár 6144 GPU) zajlott, csúcs MFU 42,4%-kal, 2023 decembertől 2024 májusig. A família három változatot tartalmaz: Base, Instruct és Reward. A modell méretét úgy választották meg, hogy egy DGX H100 csomóponton (8 GPU) elférjen FP8 pontossági formátumban való telepítéskor. A hangoláshoz (alignment) felhasznált adatok több mint 98%-a szintetikusan, maguk a sorozat modellei által generált, iteratív folyamatban keletkezett; a szintetikus adatgenerálási pipeline nyilvánosan reprodukálható.[3]

Llama‑3.1‑Nemotron‑70B (2024. október)

2024 októberében megjelentek a Meta Llama‑3.1‑70B‑Instruct alapján finomhangolt modellek: Llama‑3.1‑Nemotron‑70B‑Instruct és Llama‑3.1‑Nemotron‑70B‑Reward. 2024. október 1-jén az Instruct modell egyszerre foglalta el az 1. helyet három automatikus benchmarkon: Arena Hard — 85,0; AlpacaEval 2 LC — 57,6%; MT‑Bench (GPT‑4‑Turbo) — 8,98. A Reward modell 94,1%-ot ért el a RewardBench-en.[9][10]

Átállás hibrid architektúrákra (2025)

2025-ben a sorozat hibrid architektúrákkal bővült, amelyek Mamba‑2 (State Space Model, SSM — állapottér-modell) és Transformer rétegeket kombinálnak. 2025 március–május folyamán megjelent a Llama‑Nemotron következtetési modellek (Nano 8B, Super 49B, Ultra 253B) sorozata, amely átkapcsolható következtetési módot támogat.[11] 2025 áprilisában publikálták a Nemotron‑H (arXiv:2504.03624) hibrid Mamba‑Transformer modellek családját, 8B, 56B és 47B paraméteres változatokban.[12] 2025 augusztusában bemutatkozott a Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]

Nemotron 3 (2025. december)

2025. december 15-én bejelentették a harmadik generációt — a Nemotron 3 családot Nano, Super és Ultra modellekkel, amely Mamba‑2, Transformer és MoE architektúrákat ötvöz, legfeljebb 1 millió tokenes kontextusablakkal. A Nano modellhez műszaki jelentés is megjelent; a Super és Ultra modelleket 2026 első felére tervezik.[1][2][14][15]

Elméleti alapok

A Transformer architektúra a Nemotron‑4-ben

A Nemotron‑4 sorozat modelljei a szabványos kauzális figyelemmel rendelkező dekóderes Transformer architektúrán alapulnak. A tokensorozat valószínűsége x1,x2,,xT a következőképpen faktorizálódik:

p(x1,,xT)=t=1Tp(xtx1,,xt1;heta),

ahol heta a modell paraméterei.[8]

A figyelemfigyelmi mechanizmus Grouped‑Query Attention (GQA) változatban valósul meg[16]:

Attention(Q,K,V)=softmax(QKopdk)V,

ahol Q,K,V a lekérdezések, kulcsok és értékek mátrixai; dk a figyelemfej dimenziója.

A pozíciókódoláshoz Rotary Position Embeddings (RoPE) módszert alkalmaznak[17]:

RoPE(xm,m)=(xm(1)cosmheta1xm(2)sinmheta1xm(1)sinmheta1+xm(2)cosmheta1),

ahol xm a m pozícióban lévő vektor, hetai=100002i/d, d a vektor dimenziója.

Az MLP-rétegekben Squared ReLU aktivációt alkalmaznak: f(x)=(max(0,x))2, amely aktivációk ritkaságát biztosítja. A modellek nem tartalmaznak eltolást (bias), nem alkalmaznak dropout-ot, és a bemeneti és kimeneti beágyazási mátrixok nincsenek összekapcsolva (untied embeddings). A tokenizáló: SentencePiece BPE szóközmegőrzéssel, számjegyek karakterenkénti bontásával és bájt alapú visszaesési megoldással; a szótár mérete 256 000.[8][3]

A Nemotron‑4 architektúrájának paraméterei
Paraméter Nemotron‑4 15B Nemotron‑4 340B
Paraméterek száma 15 milliárd (3,2 milliárd embed.) 340 milliárd (9,4 milliárd embed.)
Rétegek száma 32 96
Rejtett dimenzió 6144 18 432
Figyelemfejek 48 96
KV‑fejek (GQA) 8 8
Kontextus hossza 4096 4096
Szótár mérete 256 000 256 000

Források: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Hibrid Mamba‑Transformer architektúra (Nemotron‑H)

A Nemotron‑H modellekben a szabványos önfigyelem blokkokat részben Mamba‑2 blokkok váltják fel — ezek állapottér-modellek (State Space Models, SSM). Autoregresszív generáláskor minden önfigyelem réteg O(n) műveletet és memóriát igényel lépésenként (a KV‑cache miatt), míg a Mamba-rétegek állandó memória- és számítási költséget biztosítanak minden generált tokenre.[12]

A Mamba‑2 a következő rekurzív összefüggéssel írható le[18]:

ht=Aht1+Bxt,yt=Cht,

ahol htN a rejtett állapot, ANimesN az átmenet diagonális mátrixa, BNimes1 és C1imesN vetítési mátrixok, xt a bemeneti token, yt a kimeneti jel. A Mamba‑2-ben a A, B, C mátrixok bemenetfüggők (input‑dependent), ami megkülönbözteti a modellt a klasszikus lineáris SSM-ektől.

A Nemotron‑H‑56B 54 Mamba‑2 réteget + 54 MLP-réteget + 10 önfigyelem réteget alkalmaz, ahol a figyelemrétegek egyenletesen helyezkednek el a Mamba-rétegek között. A modellt 20 billió tokenen tanították FP8 formátumban (per‑tensor scaling) 6144 H100 GPU-n. A Nemotron‑H‑8B 24 Mamba‑2 réteget, 24 MLP-réteget és 4 önfigyelem réteget tartalmaz; tanítása 15 billió tokenen zajlott.[12]

A Nemotron 3 MoE architektúrája

A Nemotron 3 modellek (2025. december) három architektúrális komponenst ötvöznek: Mamba‑2, Transformer és Mixture‑of‑Experts.[1][2] A Nemotron 3 Nano (30B‑A3B) 52 réteget tartalmaz: 23 Mamba‑2 + MoE réteg, 23 MoE réteg és 6 GQA-figyelemréteg. Minden MoE-réteg 128 irányított (routed) szakértőt + 1 megosztott (shared) szakértőt tartalmaz, amelyből tokenenként 6 szakértő aktiválódik. Az irányítást tanítható MLP-router végzi sigmoid gating módszerrel. A terheléskiegyensúlyozás kiegészítő veszteségfüggvény nélkül (aux‑loss‑free) valósul meg. A paraméterek teljes száma 31,6 milliárd, de tokenenként csupán 3,2 milliárd aktív.[2]

A normalizálás RMSNorm[19] alapú. A Mamba-részekben nincsenek pozíciós embeddingek (a pozíciós információ az SSM állapotában implicit). Leválasztott embeddingeket alkalmaznak, a lineáris rétegekben nincs dropout és bias.[2]

A Super/Ultra kiterjesztései: LatentMoE és Multi‑Token Prediction

A Nemotron 3 Super és Ultra modelljei két további architektúrális újítást alkalmaznak:

  • Latent MoE (LatentMoE) — a bemeneti reprezentáció kisebb dimenziójú látens térbe vetítése az irányítás előtt, ami lehetővé teszi a szakértők számának növelését összehasonlítható számítási költség mellett, és javítja a pontosságot az áteresztőképesség csökkentése nélkül.[1]
  • Multi‑Token Prediction (MTP) — egyszerre több következő token előrejelzése, amelyet hosszabb szövegek minőségének javítására és spekulatív dekódolásra (speculative decoding) alkalmaznak az inferencia során.[1]

A Super és Ultra tanítása NVFP4 formátumban zajlik — ez az NVIDIA 4 bites numerikus formátuma Blackwell architektúrán.[1]

Modellkompressziós módszerek: Minitron, Puzzle, MiniPuzzle

Kompakt modellek létrehozásához az NVIDIA több megközelítést alkalmaz:

  • Minitron — strukturált metszési (pruning) és tudásdesztillációs (knowledge distillation) módszer. Kétféle metszési megközelítést vizsgálnak: mélység szerinti (rétegek eltávolítása) és szélesség szerinti (a rejtett rétegek, figyelemfejek és MLP-vetítések dimenzióinak együttes csökkentése). A Minitron alkalmazása a Nemotron‑4 15B-re lehetővé teszi 8B és 4B modellek előállítását, a tanítási költséget az alapokról való tanításhoz képest akár 40-szeres mértékben csökkentve.[20]
  • Puzzle — Neural Architecture Search (NAS) algoritmus, amely megkeresi az egyes blokkok optimális konfigurációját (KV-fejek száma, FFN mérete, figyelem jelenléte/hiánya) blokkszintű desztillációval. Ez az eljárás tömörítette a Llama 3.1 405B modellt 253B-re (Llama‑Nemotron Ultra), illetve a Llama 3.3 70B modellt 49B-re (Llama‑Nemotron Super).[21]
  • MiniPuzzle — a Puzzle kiterjesztése hibrid architektúrákra, amely a Nemotron‑H‑56B-t mindössze 63 milliárd desztillációs tokennel tömörítette 47B-re. Hasonló pontosság mellett a tömörített modell 20%-kal gyorsabban fut.[12]

Hangolási módszerek

HelpSteer és HelpSteer2

HelpSteer — 37 120 példából álló adatkészlet (CC‑BY‑4.0 licenc), amelyet a Scale AI-jal közösen hoztak létre, ahol minden választ öt attribútum szerint annotáltak: hasznosság (helpfulness), helyesség (correctness), koherencia (coherence), összetettség (complexity) és bőbeszédűség (verbosity), Likert-skálán 0–4.[22]

HelpSteer2 — 21 362 példát tartalmazó frissített adatkészlet (10 681 prompt × 2 válasz), ahol a promptok több mint 95%-a ShareGPT-ből (valós felhasználói kérések) származik. Az annotációk mintegy 50%-át elégtelen minőség miatt szűrték ki. A HelpSteer2‑Preference kiterjesztés páros annotátori preferenciákat ad hozzá, lehetővé téve regressziós és páronkénti jutalommodellek tanítását ugyanazon adatokon.[23][24]

SteerLM

SteerLM — attribútumokon alapuló feltételezéssel rendelkező SFT (Supervised Fine‑Tuning — felügyelt finomhangolás) módszer (helpfulness, correctness, coherence, complexity, verbosity), amely lehetővé teszi a felhasználó számára a válasz stílusának irányítását inferencia során. A folyamat a következő lépésekből áll: (1) attribútum-előrejelző modell (APM) tanítása a HelpSteer adatkészleten, (2) adatok annotálása az APM segítségével, (3) SFT célzott attribútumértékeken való feltételezéssel, (4) bootstrapping.[25]

DPO és RPO

DPO (Direct Preference Optimization) — közvetlen preferencia-optimalizálási módszer explicit jutalommodell nélkül, amelyet a Nemotron‑4 340B Instruct és a Nemotron Nano 2 folyamatokban alkalmaznak.[26]

RPO (Reward‑aware Preference Optimization) — az NVIDIA egyesített matematikai keretrendszere, amely a DPO-t, az IPO-t, a SimPO-t, a REINFORCE-t és a SteerLM 2.0-t speciális esetként általánosítja. Az RPO minimalizálja az implicit jutalommodell előrejelzései és a célul kitűzött explicit modell közötti eltérést[27]:

extRPO(heta)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπheta(yw|x)πextref(yw|x)βlogπheta(yl|x)πextref(yl|x))],

ahol rϕ az explicit jutalommodell, πheta a tanítandó irányelvmodell (policy), πextref a referencia-irányelvmodell, d(,) a távolságfüggvény, yw/yl a preferált/elutasított válasz. Az RPO-t a Nemotron‑4 340B Instruct és a Llama‑Nemotron modellek tanításakor alkalmazzák.[27][3][11]

Többkörnyezetes megerősítéses tanulás (RLVR)

A Nemotron 3-ban Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) módszert alkalmaznak — egyidejű tanítás több NeMo Gym-környezetben: versenyszerű matematika, programozás, QA, eszközhasználat (tool‑use), utasításkövetés (instruction‑following), hosszú kontextus. Az algoritmus GRPO (Group Relative Policy Optimization) masked importance sampling-gel.[2][14]

A Nemotron 3 támogatja a következtetési cost részletes kezelését (reasoning budget control): a felhasználó meghatározhatja a thinking trace tokenkorlátját a chat template-ben lévő jelzőn keresztül (\"detailed thinking on/off\" kapcsoló vagy hosszkorlátozás).[2]

A modellek sora

Összefoglaló táblázat

Modell Év Összes / Aktív paraméter Kontextus Architektúra Főbb jellemzők
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3,8T token; 1024 GPU A100; 19 nap
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8T token; MFU 34,3%
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9T token; Base/Instruct/Reward; >98% szintetikus alignment-adat
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1%
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) NAS-tömörítés Llama 3.1 8B-ből
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Llama 3.3 70B-ből
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Llama 3.1 405B-ből; GPQA 76,0%
Nemotron‑H 8B 2025 8B / 8B Hibrid Mamba‑Transformer 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B Hibrid Mamba‑Transformer 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) Hibrid Mamba‑Transformer MiniPuzzle 56B-ből; +20% sebesség
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Hibrid Mamba‑Transformer 20T token; Minitron-desztilláció
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Hibrid Mamba‑Transformer MoE 25T token; 128 szakértő, 6 aktív
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Hibrid LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Hibrid LatentMoE MTP; NVFP4

Nemotron‑4 15B

Architektúra: 32 réteg, rejtett dimenzió 6144, 48 figyelemfej, 8 KV-fej (GQA). A paraméterek teljes száma 15 milliárd (3,2 milliárd embedding + 12,5 milliárd nem-embedding). Eredmények: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Többnyelvű benchmarkokon (XCOPA, TyDiQA‑GoldP, MGSM) a modell felülmúlta a négyszer nagyobb modelleket.[8]

Nemotron‑4 340B

Architektúra: 96 réteg, rejtett dimenzió 18 432, 96 figyelemfej, 8 KV-fej.

A Nemotron‑4 340B Base eredményei: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC‑Challenge — 94,3% (25-shot).[3]

A Nemotron‑4 340B Instruct többlépéses hangolási folyamaton ment keresztül: Code SFT → General SFT → DPO → RPO (3 kör). Eredmények: MT‑Bench — 8,22 (GPT‑4‑Turbo bírálóval), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]

A Nemotron‑4 340B Reward az utolsó softmax réteget egy lineáris vetítéssel váltja fel, amely az utolsó réteg rejtett állapotát az 5 HelpSteer2-attribútum vektorára vetíti. A végső jutalom az öt attribútum súlyozott összege. A tanítás 2 epoch alatt zajlott a HelpSteer2 adatkészleten (batch size 128). A RewardBench-en a modell 92,0%-ot ért el, felülmúlva a GPT‑4o-t (84,7%), a Gemini 1.5 Pro-t (88,1%) és a Claude‑3‑Opus-t (80,7%) a publikáció idején.[3]

Modell Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54,2 41,5% 8,22
Llama‑3‑70B‑Instruct 41,1 34,4% 8,16
Mixtral‑8x22B‑Instruct 36,4 30,9% 7,63
Qwen‑2‑72B‑Instruct 48,1 38,8% 8,26

Forrás: arXiv:2406.11704, 5. táblázat.[3]

Llama‑3.1‑Nemotron‑70B

A Llama‑3.1‑Nemotron‑70B‑Reward modellt hibrid módszerrel tanították, amely ötvözi a Bradley‑Terry (páronkénti preferenciák) és a SteerLM-regresszió (többattribútumos Likert-skálás értékelés) megközelítéseket. A tanítás kizárólag HelpSteer2 adatokon (CC‑BY‑4.0) zajlott. A RewardBench-en a modell 94,1%-ot ért el, a publikáció idején az első helyen végzett.[10]

A Llama‑3.1‑Nemotron‑70B‑Instruct modellt RLHF módszerrel hangolták, REINFORCE algoritmussal (nem PPO), Nemotron‑70B‑Reward jutalommodell alkalmazásával. Az infrastruktúra NeMo‑Aligner TRT‑LLM gyorsítással.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

Következtetési modellek sorozata, amelyeket Llama 3.x alapján NAS, desztilláció és kiterjesztett utólagos tanítás módszereivel hoztak létre.[11]

Modell Paraméterek Alapmodell Kontextus
Llama‑Nemotron‑Nano 8B 8 milliárd Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 milliárd Minitron 4B (Llama 3.1 8B-ből) 128K
Llama‑Nemotron‑Super 49B 49 milliárd Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 milliárd Llama‑3.1‑405B → NAS (Puzzle) 128K

Ötlépéses tanítási folyamat: (1) NAS + FFN Fusion, (2) desztilláció + folytatólagos előtanítás, (3) SFT (beleértve DeepSeek‑R1 következtetési láncolatokat), (4) nagy léptékű RL (GRPO az Ultra esetén, REINFORCE/RLOO + Online RPO a Nano esetén), (5) párbeszédre való hangolás.[11]

A modellek elsőként a nyílt LLM-ek között támogatnak átkapcsolható következtetési módot (reasoning toggle): bekapcsolt állapotban (\"detailed thinking on\" a rendszer-promptban) a modell <think>...</think> tagek között következtetési láncot generál a válasz előtt; kikapcsolt állapotban közvetlenül válaszol.[11]

A Llama‑Nemotron‑Ultra 253B eredményei (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Összehasonlításképpen: DeepSeek‑R1 (671B összes / 37B aktív) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Az Ultra egyetlen 8×H100 csomóponton futtatható.[11]

Nemotron‑H (2025. április)

Sűrű hibrid modellek sorozata, amelyeket az alapoktól tanítottak és hosszú generálási feladatokra terveztek. A Nemotron‑H‑56B 20 billió tokenen lett tanítva FP8 formátumban — ez az egyik legnagyobb nyilvános FP8 előtanítási kísérlet. A Nemotron‑H‑47B a 56B MiniPuzzle módszerrel tömörített változata (63 milliárd desztillációs token), amely egyetlen RTX 5090 memóriájába elfér (FP4) ~1M tokenes kontextus mellett.[12]

Benchmark Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60,5 61,8 58,8 51,3
MMLU (5‑shot) 84,2 83,6 86,1 78,8
GSM8K (8‑shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0‑shot) 60,4 61,0 56,7 57,3

Forrás: arXiv:2504.03624.[12]

65 536 bemeneti és 1024 kimeneti tokennel generálva H100-on, a Nemotron‑H‑47B modell 2,9-szer gyorsabban működött, mint a Qwen‑2.5‑72B és a Llama‑3.1‑70B.[12]

Nemotron Nano 2 (2025. augusztus)

Hibrid Mamba‑Transformer modell következtetési feladatokra. A Nemotron‑Nano‑12B‑v2‑Base szülőmodell 62 réteggel (főként Mamba‑2 + MLP + 4 figyelemréteg), amelyet 20 billió tokenen tanítottak FP8 formátumban az alapoktól. Ebből kiterjesztett Minitron módszerrel készült a Nemotron‑Nano‑9B‑v2, amely 128K tokenes kontextusban képes futni egyetlen NVIDIA A10G GPU-n (22 GB, BF16). Utólagos tanítás: SFT (80 milliárd token, beleértve DeepSeek‑R1‑0528 láncolatokat) → GRPO → DPO → RLHF. A következtetési benchmarkokon a modell a Qwen3‑8B-hez hasonló pontosságot ér el, de hosszú kimeneti sorozatoknál 3–6-szoros generálási gyorsulást mutat.[13]

Nemotron 3 Nano 30B‑A3B

2025 decemberében jelent meg. Paraméterek: 31,6 milliárd összesen, 3,2 milliárd aktív. Architektúra: 52 réteg, rejtett dimenzió 2688, szakértő-dimenzió 1856, Mamba állapot-dimenzió 128. MoE: 128 irányított szakértő + 1 megosztott, tokenenként 6 aktív. Kontextus: legfeljebb 1 048 576 token. Tanítás 25 billió tokenen (WSD-ütemezés, batch size 3072, adatok határa 2025. június), két fázisban: 1. fázis — 23,5 billió (változatos adatok), 2. fázis — 1,5 billió (magas minőségű adatok) + 121 milliárd token hosszú kontextusú CPT.[2]

Benchmark Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE‑Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena‑Hard‑V2 Avg 67,65 57,8 48,55
RULER‑100 @ 1M 86,34 77,5

* — másodlagos forrásokból származó értékek; a reprodukció feltételei: NeMo Evaluator SDK. Forrás: arXiv:2512.20848.[2][28]

Áteresztőképesség (8K bemenet / 16K kimenet, egyetlen H200): 3,3-szor magasabb, mint a Qwen3‑30B‑A3B‑Thinking esetén, és 2,2-szer magasabb, mint a GPT‑OSS‑20B esetén.[2]

További modellek és irányok

  • OpenReasoning‑Nemotron (2025. július) — 1,5B–32B paraméteres modellek sorozata, Qwen 2.5 alapján, DeepSeek‑R1‑0528 adatokon finomhangolva. A 32B-es változat GenSelect@64 módszerrel egyes matematikai benchmarkokon felülmúlja az o3-at (high).[29]
  • Nemotron Elastic (arXiv:2511.16664) — beágyazott almodellek keretrendszere (6B, 9B, 12B) egyetlen szülőmodell keretein belül, amely az alapoktól való tanításhoz képest 360-szorosára csökkenti a tanítási költséget.[30]
  • Nemotron‑CrossThink — mértani feladatokon túli, többtartományú megerősítéses tanulási keretrendszer, amely +30,1%-os javulást ért el a MATH‑500-on és +12,8%-ot az MMLU‑PRO-n.[31]
  • Nemotron‑UltraLong — kontextus kiterjesztése 4 millió tokenig.[32]
  • Jet‑Nemotron — utólagos tanításra szolgáló NAS kompakt hibrid modellek számára (2B/4B).[33]

Speciális modellek

A Nemotron ökoszisztémában speciális feladatokra szánt modellek is jelen vannak:

  • Nemotron Nano V2 VL — vision‑language modell OCR, táblázatfeldolgozás és videó feladatokhoz.[34]
  • Nemotron Parse 1.1 — OCR és dokumentumstruktúra-kinyerési modell.[35]
  • Nemotron ColEmbed V2 — embedding modell vizuális dokumentumkereséshez (late interaction).[36]
  • Nemotron Speech — modellek automatikus beszédfelismeréshez (ASR), szövegfelolvasáshoz (TTS) és gépi fordításhoz (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — biztonságtalan tartalom osztályozási modellje 23 kategóriában, 9 nyelven, 84,2%-os pontossággal.[37]

Előtanítási adatok

A Nemotron‑4 adatösszetétele

A Nemotron‑4 15B és 340B előtanítási korpusza három fő kategóriából áll: angol szövegek (70%), 53 nyelvű többnyelvű szövegek (15%) és 43 programozási nyelven írt forráskód (15%). Dokumentumszintű deduplikálást alkalmaztak (pontos és közel-duplikált elemekre), valamint nyelvi modelleken és heurisztikákon alapuló szűrést. A 15B-es modellt 8 billió tokenen tanították, a 340B-est 9 billión (8 billió előtanítás + 1 billió folytatólagos tanítás, magas minőségű források újrasúlyozásával).[8][3]

Nemotron‑CC

A Nemotron‑CC adatkészlet a Common Crawl-ból készült minőségi osztályozók együtteseinek és szintetikus szöveg-átfogalmazásnak a segítségével. A teljes terjedelem 6,3 billió token (4,4 billió deduplikált + 1,9 billió szintetikus átfogalmazás). A folyamat integrálva van a NeMo Curator eszközbe. A munkát az ACL 2025 konferencián Long Paper-ként fogadták el.[38]

Nemotron‑CC‑Math

Matematikai orientációjú részhalmaz, 133 milliárd tokenes terjedelemmel, amelyet a Common Crawl-ból nyertek ki a Lynx + LLM-folyamat segítségével, matematikai képletek és kód LaTeX formátumban való megőrzésével.[39]

A Nemotron 3 Nano adatai

A Nemotron 3 Nano előtanítása 25 billió tokenen zajlott. A készlet tartalmazza: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 és speciális STEM-adatkészleteket. A hosszú kontextusú tanításhoz további 121 milliárd CPT-tokent alkalmaztak.[2]

Nemotron Pretraining Dataset v1

Szintetikusan generált adatkészlet, amely STEM, akadémiai szövegeket, következtetési feladatokat és többnyelvű tartományokat fed le; több mint 10 billió nyelvi tokent és 18 millió SFT-mintát tartalmaz. Minden adatkészlet nyílt, megengedő licencek alatt érhető el.[40]

Szintetikus adatgenerálási folyamat (SDG)

A Nemotron‑4 340B jelentésében leírt folyamat a következő lépéseket tartalmazza[3]:

  • Prompt-generálás: szintetikus egy- és kétkörös kérések, amelyeket Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 licenc) generált Open QA, Writing, Closed QA, Math & Coding sablonok alapján.
  • Válasz-generálás: a változatosság biztosítása érdekében a modellek közbenső verzióitól érkező többszörös válaszok.
  • Minőségértékelés: három megközelítés — Ground‑Truth‑as‑a‑Judge (ellenőrizhető válaszú feladatoknál), LLM‑as‑Judge (válaszpárok összehasonlítása nyelvi modellel), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward alkalmazása).
  • Iteratív hangolás a gyengébb modellektől az erősebbek felé (weak‑to‑strong).

Mintegy 20 000 emberek által annotált példából (10 000 SFT-hez, 10 000 HelpSteer2 a jutalommodellhez) szintetizálták az összes többi hangolási adatot.[3]

Kvantálás és inferencia-optimalizálás

A Nemotron 3 Nano modellek támogatják a Post‑Training Quantization (PTQ) FP8 formátumban, ModelOpt és Megatron‑LM segítségével. Szelektív kvantálást (selective quantization) alkalmaznak — a figyelemrétegek és a Mamba egy része BF16-ban marad a minőség megőrzése érdekében; a többit FP8-ra kvantálják. A műszaki jelentés szerint ez ~99%-os pontosságmegőrzést biztosít.[2] A Nano NVFP4 formátumú inferenciát is támogat.[1]

Generációk szerinti benchmark-összefoglaló

Modell MMLU GSM8K HumanEval Arena Hard MT‑Bench Feltételek
Nemotron‑4 15B 64,2% 46,0% 31,6% alap; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81,1% 57,3% 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78,7% 92,3% 73,2% 54,2 8,22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85,0 8,98 2024. okt.
LN‑Ultra 253B (reasoning ON) GPQA 76,0%, AIME 80,8%
Nemotron‑H‑47B 83,6% 93,3% 61,0% 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67,7 (v2) AIME25 89,1%, LCB 68,3%

Az összehasonlítást körültekintően kell értelmezni: az értékelési feltételek, a benchmark-verziók és a tesztelési dátumok eltérnek a generációk között. Az eredmények az NVIDIA műszaki jelentéseiből származnak; a független értékelések eltérhetnek (lásd a „Korlátok" részt).[8][3][9][11][12][2]

Alkalmazás

Telepítés NVIDIA NIM segítségével

Az NVIDIA NIM optimalizált konténeres mikro-szolgáltatások készlete inferenciához, OpenAI-kompatibilis API-val. A Nemotron modellek NIM-mikro-szolgáltatásként elérhetők a build.nvidia.com platformon. A NIM támogatja az FP8, BF16 és NVFP4 formátumokat, valamint Kubernetes-en való telepítést Helm-chart-ok segítségével. A modellek független keretrendszerekkel is kompatibilisek: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

Szintetikus adatgenerálás

A Nemotron‑4 340B-t szintetikus adatgenerátorként való felhasználásra tervezték: az Instruct modell válaszokat generál, a Reward modell értékeli és szűri azokat. Az NVIDIA Open Model License kifejezetten engedélyezi a modell kimenetének más modellek tanítására való felhasználását. A ServiceNow adatai szerint az Apriel 1.6 modelljük előtanítási adatainak 15%-a a Nemotron adatkészletekből származik.[3][15][41]

Ügynöki rendszerek

A Nemotron 3 család (Nano, Super, Ultra) modelljei többügynökes munkaterhelésekre készültek: tervezés, retrieval, eszközhívás (tool use). A Nemotron 3 Nano 38,76%-ot ér el a SWE-Bench-en (OpenHands-szel) és 49,04%-ot (átlag) a TauBench V2-n.[2]

Vállalati bevezetések

A bejelentett partnerek között szerepel: ServiceNow (közös Apriel Nemotron 15B modell munkafolyamatok automatizálásához), CrowdStrike (Charlotte AI platform), Perplexity (lekérdezés-irányítás), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. A modellek elérhetők az AWS Amazon Bedrockon; a Google Cloud, CoreWeave és Nebius támogatása is tervezett.[15]

Korlátok és nyitott kérdések

Független értékelések és eltérések az NVIDIA adataitól

A független értékelések eltéréseket mutatnak az NVIDIA által közölt eredményekhez képest. Az Artificial Analysis adatai szerint (2026. február) a Llama‑Nemotron‑Ultra 253B (reasoning) 15-ös Intelligence Index pontszámot kapott, miközben a hasonló méretű modellek mediánja 26. A Chatbot Arena (LMArena) platformon a Nemotron modellek a rangsor közepén helyezkednek: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. hely), Nemotron 3 Nano — 1317 ±6 (~164. hely).[42][43]

Bőbeszédűség

A Nemotron modellek fokozott bőbeszédűséget mutatnak: az Artificial Analysis értékelése során a Nemotron 3 Nano 140 millió tokent generált (a többi modell mediánja 12 millió), ami növeli az inferencia költségét. A DEV Community elemzése szerint a Llama‑3.1‑Nemotron‑70B‑Instruct, bár formálisan vezette az automatikus benchmarkokat, egyes gyakorlati feladatokban nem volt kellően pontos, és az Arena-jellegű benchmarkokon elért magas pontszámok magyarázhatók a bőbeszédű és magabiztos, de nem feltétlenül pontos válaszok preferálásával.[42][44]

Hallucinációk és torzítások

Az NVIDIA a modellkártyákon jelzi, hogy a modellek „erősíthetik az elfogultságokat és toxikus válaszokat generálhatnak, különösen toxikus promptok esetén", valamint „pontatlan információt adhatnak közre és kihagyhatnak kulcsfontosságú részleteket". A súlyok és adatok nyitottsága lehetővé teszi a külső auditot.[11][13]

Számítási követelmények

A sűrű modellek (Nemotron‑4 340B) teljes tanításához 768 DGX H100 csomópontból álló klaszter szükséges, ami korlátozza a reprodukálhatóságot az akadémiai csoportok számára, akiknek nincs hozzáférése hasonló infrastruktúrához. A hosszú kontextus (1M) inferencia során jelentős VRAM kapacitást igényel.[3][2]

Teljesítmény-romlás hosszú kontextus esetén

Az ultra-hosszú sorozatokra való kontextus-kiterjesztés során romlást észleltek a rövid kontextusú benchmarkokon.[32]

Hibrid architektúrák kvantálása

A szélsőségesen alacsony bithossz (FP8/NVFP4) alkalmazása Mamba‑Transformer architektúrákban enyhe pontosságromláshoz vezet (~1% egyes benchmarkokon). Ezt a problémát szelektív kvantálással orvosolják, ami bonyolítja a fordítók és inferencia-kiszolgálók architektúráját.[2][1]

Egyéb nyitott kérdések

  • Függőség az esetlegesen kontaminált tanítási adatokkal rendelkező benchmarkoktól.
  • A hibrid SSM‑Transformer és a tisztán Transformer architektúrák összehasonlítására vonatkozó szabványosított protokollok hiánya.
  • A MoE megközelítés skálázhatóságának kérdése tokenenkénti kevés szakértőt igénylő mély következtetési feladatoknál.
  • A Super/Ultra 2025 decemberi adatai előzetesek; a teljes benchmarkok a kiadás után várhatók.[1]

Etikai és szabályozási szempontok

Biztonság a fejlesztési szakaszban

A fejlesztési szakaszban a következő módszereket alkalmazzák: értékelés az AEGIS keretrendszer szerint (13 tartalombiztonsági kategória), garak sebezhetőség-szkenner, manuális red-teaming (vöröscsapatozás).[37]

Biztonság az inferencia szakaszában

A NeMo Guardrails nyílt eszközkészlet (Apache 2.0 licenc), amely programozható korlátokat ad az LLM-rendszerekhez. A mikroszolgáltatás elfogja a bemeneteket és kimeneteket, konfigurálható ellenőrzéseket alkalmazva: témafelügyelet, PII-észlelés, RAG „megalapozottság" ellenőrzése, jailbreak-támadások észlelése (beleértve a YARA-alapú kódinjekciós védelmet), többnyelvű multimodális biztonsági osztályozás.[45]

A Nemotron 3-hoz közzétettek egy ~11 000 annotált OpenTelemetry-láncolatból álló készletet, amelyek reális, eszközhasználatos forgatókönyvekből származnak, és az ügynöki biztonság értékelésére szolgálnak.[1]

Licencelés

Modellek Licenc
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (a Meta-tól öröklött)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

Az NVIDIA Nemotron Open Model License engedélyezi a kereskedelmi felhasználást, a származékos munkák létrehozását és terjesztését, nem követel meg attribúciót (a NOTICE fájl megőrzése mellett), nem szab korlátozást a felhasználók számára, és kifejezetten engedélyezi a modell kimenetének más modellek tanítására való felhasználását.[46] A Llama alapú modellek öröklik a Meta korlátozásait, beleértve a havi 700 millió aktív felhasználói küszöbértéket.[11]

A Nemotron 3 Nano esetén az NVIDIA közzétette: a modell súlyait, több mint 10 billió token tanítási adatot, tanítási recepteket, kódbázisokat (NeMo, Megatron‑LM, NeMo‑Aligner), valamint több mint 10 megerősítéses tanulási környezetet 900 000+ feladattal.[1][2]

Perspektívák és kutatási irányok

A közeljövőben várható kiadások közé tartozik a Nemotron 3 Super (~100 milliárd paraméter, ~10 milliárd aktív) és a Nemotron 3 Ultra (~500 milliárd, ~50 milliárd aktív), amelyeket 2026 első felére várnak. Mindkét modell LatentMoE-t, MTP-t és NVFP4 formátumú tanítást fog alkalmazni Blackwell architektúrán.[1]

Az NVIDIA stratégiai iránya a Nemotron pozicionálása nem egyedi modellként, hanem többügynökes rendszerek infrastrukturális rétegeként, ahol a család különböző modelljeit különböző feladatokhoz, komplexitás alapú irányítással alkalmazzák.[1][15]

Főbb kutatási irányok:

  • Hibrid architektúrák fejlesztése — SSM-rétegek és a figyelemmechanizmus további integrálása a skálázható hosszú kontextus érdekében.[12]
  • Többszintű tömörítési módszerek — Minitron, Puzzle, MiniPuzzle és Nemotron Elastic fejlesztése.[20][21][30]
  • Többtartományú megerősítéses tanulás — Nemotron‑CrossThink az RL matematikán túli kiterjesztéséhez.[31]
  • Kontextus-kiterjesztés — Nemotron‑UltraLong 4 millió tokenig.[32]
  • Multimodalitás — kiterjesztés a vision‑language (Nemotron VL), beszéd (Nemotron Speech) és vizuális dokumentumkeresés (Nemotron ColEmbed V2) területeire.[34][35][36]
  • Kompakt hibrid modellek — Jet‑Nemotron (NAS 2B/4B modellek számára).[33]
  • Nyílt receptek — teljes tanítási receptek és adatok közzététele a közösségi reprodukció és testreszabás érdekében.[14]

Lásd még

  • Transformer architektúra
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (Meta modellek sorozata)

Hivatkozások

Irodalom

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/