Nemotron (NVIDIA) (HU)
Nemotron — nyílt súlyú nagy nyelvi modellek (Large Language Model, LLM) családja, amelyet az NVIDIA Corporation Applied Deep Learning Research (ADLR) részlege fejlesztett ki. A modellek a gépi tanulás és a természetes nyelvfeldolgozás (Natural Language Processing, NLP) területéhez tartoznak, és széles feladatkörre készültek: szintetikus adatgenerálás, következtetés (reasoning), ügynökalapú alkalmazások (agentic AI) és ipari NVIDIA-hardveren való telepítés. A család különböző architektúrájú és méretű modelleket foglal magában: 4 milliárdtól ~500 milliárd paraméterig, beleértve a Nemotron‑4 sorozat sűrű (dense) decoder‑only Transformer-modelljeit (2024), a hibrid Mamba‑Transformer modelleket (Nemotron‑H, 2025), valamint a Mixture-of-Experts (MoE) architektúrájú hibrid Mamba‑Transformer modelleket a Nemotron 3 sorozatban (2025). 2026 márciusában a család több mint 20 modellt számlál, amelyek lefedik a szöveggenerálás, következtetés, dokumentumok vizuális megértése, információkinyerés és válaszminőség-értékelés feladatait. A modellek jellemzően nyílt súlyokkal jelennek meg, NVIDIA Open Model License és Llama Community License licencek alatt.[1][2][3]
Történet és előzmények
A Nemotron család fejlesztése az NVIDIA azon stratégiájának keretében zajlik, amelynek célja a generatív mesterséges intelligenciához szükséges teljes eszközstack kialakítása: a tanítási infrastruktúrától (DGX, GPU H100/B200 alapú szuperszámítógépek) a tanítási platformokig (NeMo Framework), a hangolásig (NeMo‑Aligner), a telepítésig (NIM — NVIDIA Inference Microservices) és a biztonsági eszközökig (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
A sorozat első nyilvánosan elérhető modellje — 8 milliárd paraméterű, 4096 tokenes kontextusú dekóderes Transformer, amelyet 3,8 billió tokenen tanítottak 53 természetes és 37 programozási nyelven. A tanítás 1024 A100 GPU-n zajlott 19 nap alatt. Nem jelent meg formális műszaki jelentés az arXiv-on. A modell a NeMo Framework-ön és a Hugging Face-en volt elérhető; létezett Chat (SFT és SteerLM) változat is. Licence: NVIDIA AI Foundation Models Community License.[6][7]
Megjegyzés az elnevezésekről: A 2023-as „Nemotron‑3" és a 2025 decemberi „Nemotron 3" különböző modellek. Az előbbi egy korai prototípus volt, az utóbbi egy aktuális, MoE architektúrájú generáció.
Nemotron‑4 15B (2024. február)
A Nemotron‑4 sorozat első nyilvánosan dokumentált kiadása — 15 milliárd paraméteres modell, amelyet 8 billió tokenen tanítottak kb. 13 naptári nap alatt 384 DGX H100 csomóponton (akár 3072 GPU). 8-szoros tenzorpárhuzamosságot és 96-tól 288-ig terjedő adatpárhuzamosságot alkalmaztak. A csúcs MFU (Model FLOPs Utilization) 34,3% volt, batch size 384 esetén. Az architektúra: decoder‑only Transformer, Grouped‑Query Attention (GQA) és Rotary Position Embeddings (RoPE) elemekkel. A publikáció idején a benchmarkok alapján a modell felülmúlta az összes hasonló méretű nyílt modellt többnyelvű feladatokban, köztük több olyan modellt is, amelyek mérete négyszerese volt.[8]
Nemotron‑4 340B (2024. június)
2024 júniusában megjelent a Nemotron‑4 sorozat legnagyobb modellje — 340 milliárd paraméter (331,6 milliárd nem‑embedding), amelyet 9 billió tokenen tanítottak (8 billió előtanítás + 1 billió folytatólagos tanítás, magas minőségű források újrasúlyozásával). A tanítás 768 DGX H100 csomóponton (akár 6144 GPU) zajlott, csúcs MFU 42,4%-kal, 2023 decembertől 2024 májusig. A família három változatot tartalmaz: Base, Instruct és Reward. A modell méretét úgy választották meg, hogy egy DGX H100 csomóponton (8 GPU) elférjen FP8 pontossági formátumban való telepítéskor. A hangoláshoz (alignment) felhasznált adatok több mint 98%-a szintetikusan, maguk a sorozat modellei által generált, iteratív folyamatban keletkezett; a szintetikus adatgenerálási pipeline nyilvánosan reprodukálható.[3]
Llama‑3.1‑Nemotron‑70B (2024. október)
2024 októberében megjelentek a Meta Llama‑3.1‑70B‑Instruct alapján finomhangolt modellek: Llama‑3.1‑Nemotron‑70B‑Instruct és Llama‑3.1‑Nemotron‑70B‑Reward. 2024. október 1-jén az Instruct modell egyszerre foglalta el az 1. helyet három automatikus benchmarkon: Arena Hard — 85,0; AlpacaEval 2 LC — 57,6%; MT‑Bench (GPT‑4‑Turbo) — 8,98. A Reward modell 94,1%-ot ért el a RewardBench-en.[9][10]
Átállás hibrid architektúrákra (2025)
2025-ben a sorozat hibrid architektúrákkal bővült, amelyek Mamba‑2 (State Space Model, SSM — állapottér-modell) és Transformer rétegeket kombinálnak. 2025 március–május folyamán megjelent a Llama‑Nemotron következtetési modellek (Nano 8B, Super 49B, Ultra 253B) sorozata, amely átkapcsolható következtetési módot támogat.[11] 2025 áprilisában publikálták a Nemotron‑H (arXiv:2504.03624) hibrid Mamba‑Transformer modellek családját, 8B, 56B és 47B paraméteres változatokban.[12] 2025 augusztusában bemutatkozott a Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (2025. december)
2025. december 15-én bejelentették a harmadik generációt — a Nemotron 3 családot Nano, Super és Ultra modellekkel, amely Mamba‑2, Transformer és MoE architektúrákat ötvöz, legfeljebb 1 millió tokenes kontextusablakkal. A Nano modellhez műszaki jelentés is megjelent; a Super és Ultra modelleket 2026 első felére tervezik.[1][2][14][15]
Elméleti alapok
A Transformer architektúra a Nemotron‑4-ben
A Nemotron‑4 sorozat modelljei a szabványos kauzális figyelemmel rendelkező dekóderes Transformer architektúrán alapulnak. A tokensorozat valószínűsége a következőképpen faktorizálódik:
ahol a modell paraméterei.[8]
A figyelemfigyelmi mechanizmus Grouped‑Query Attention (GQA) változatban valósul meg[16]:
ahol a lekérdezések, kulcsok és értékek mátrixai; a figyelemfej dimenziója.
A pozíciókódoláshoz Rotary Position Embeddings (RoPE) módszert alkalmaznak[17]:
ahol a pozícióban lévő vektor, , a vektor dimenziója.
Az MLP-rétegekben Squared ReLU aktivációt alkalmaznak: , amely aktivációk ritkaságát biztosítja. A modellek nem tartalmaznak eltolást (bias), nem alkalmaznak dropout-ot, és a bemeneti és kimeneti beágyazási mátrixok nincsenek összekapcsolva (untied embeddings). A tokenizáló: SentencePiece BPE szóközmegőrzéssel, számjegyek karakterenkénti bontásával és bájt alapú visszaesési megoldással; a szótár mérete 256 000.[8][3]
A Nemotron‑4 architektúrájának paraméterei
| Paraméter | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Paraméterek száma | 15 milliárd (3,2 milliárd embed.) | 340 milliárd (9,4 milliárd embed.) |
| Rétegek száma | 32 | 96 |
| Rejtett dimenzió | 6144 | 18 432 |
| Figyelemfejek | 48 | 96 |
| KV‑fejek (GQA) | 8 | 8 |
| Kontextus hossza | 4096 | 4096 |
| Szótár mérete | 256 000 | 256 000 |
Források: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Hibrid Mamba‑Transformer architektúra (Nemotron‑H)
A Nemotron‑H modellekben a szabványos önfigyelem blokkokat részben Mamba‑2 blokkok váltják fel — ezek állapottér-modellek (State Space Models, SSM). Autoregresszív generáláskor minden önfigyelem réteg műveletet és memóriát igényel lépésenként (a KV‑cache miatt), míg a Mamba-rétegek állandó memória- és számítási költséget biztosítanak minden generált tokenre.[12]
A Mamba‑2 a következő rekurzív összefüggéssel írható le[18]:
ahol a rejtett állapot, az átmenet diagonális mátrixa, és vetítési mátrixok, a bemeneti token, a kimeneti jel. A Mamba‑2-ben a , , mátrixok bemenetfüggők (input‑dependent), ami megkülönbözteti a modellt a klasszikus lineáris SSM-ektől.
A Nemotron‑H‑56B 54 Mamba‑2 réteget + 54 MLP-réteget + 10 önfigyelem réteget alkalmaz, ahol a figyelemrétegek egyenletesen helyezkednek el a Mamba-rétegek között. A modellt 20 billió tokenen tanították FP8 formátumban (per‑tensor scaling) 6144 H100 GPU-n. A Nemotron‑H‑8B 24 Mamba‑2 réteget, 24 MLP-réteget és 4 önfigyelem réteget tartalmaz; tanítása 15 billió tokenen zajlott.[12]
A Nemotron 3 MoE architektúrája
A Nemotron 3 modellek (2025. december) három architektúrális komponenst ötvöznek: Mamba‑2, Transformer és Mixture‑of‑Experts.[1][2] A Nemotron 3 Nano (30B‑A3B) 52 réteget tartalmaz: 23 Mamba‑2 + MoE réteg, 23 MoE réteg és 6 GQA-figyelemréteg. Minden MoE-réteg 128 irányított (routed) szakértőt + 1 megosztott (shared) szakértőt tartalmaz, amelyből tokenenként 6 szakértő aktiválódik. Az irányítást tanítható MLP-router végzi sigmoid gating módszerrel. A terheléskiegyensúlyozás kiegészítő veszteségfüggvény nélkül (aux‑loss‑free) valósul meg. A paraméterek teljes száma 31,6 milliárd, de tokenenként csupán 3,2 milliárd aktív.[2]
A normalizálás RMSNorm[19] alapú. A Mamba-részekben nincsenek pozíciós embeddingek (a pozíciós információ az SSM állapotában implicit). Leválasztott embeddingeket alkalmaznak, a lineáris rétegekben nincs dropout és bias.[2]
A Super/Ultra kiterjesztései: LatentMoE és Multi‑Token Prediction
A Nemotron 3 Super és Ultra modelljei két további architektúrális újítást alkalmaznak:
- Latent MoE (LatentMoE) — a bemeneti reprezentáció kisebb dimenziójú látens térbe vetítése az irányítás előtt, ami lehetővé teszi a szakértők számának növelését összehasonlítható számítási költség mellett, és javítja a pontosságot az áteresztőképesség csökkentése nélkül.[1]
- Multi‑Token Prediction (MTP) — egyszerre több következő token előrejelzése, amelyet hosszabb szövegek minőségének javítására és spekulatív dekódolásra (speculative decoding) alkalmaznak az inferencia során.[1]
A Super és Ultra tanítása NVFP4 formátumban zajlik — ez az NVIDIA 4 bites numerikus formátuma Blackwell architektúrán.[1]
Modellkompressziós módszerek: Minitron, Puzzle, MiniPuzzle
Kompakt modellek létrehozásához az NVIDIA több megközelítést alkalmaz:
- Minitron — strukturált metszési (pruning) és tudásdesztillációs (knowledge distillation) módszer. Kétféle metszési megközelítést vizsgálnak: mélység szerinti (rétegek eltávolítása) és szélesség szerinti (a rejtett rétegek, figyelemfejek és MLP-vetítések dimenzióinak együttes csökkentése). A Minitron alkalmazása a Nemotron‑4 15B-re lehetővé teszi 8B és 4B modellek előállítását, a tanítási költséget az alapokról való tanításhoz képest akár 40-szeres mértékben csökkentve.[20]
- Puzzle — Neural Architecture Search (NAS) algoritmus, amely megkeresi az egyes blokkok optimális konfigurációját (KV-fejek száma, FFN mérete, figyelem jelenléte/hiánya) blokkszintű desztillációval. Ez az eljárás tömörítette a Llama 3.1 405B modellt 253B-re (Llama‑Nemotron Ultra), illetve a Llama 3.3 70B modellt 49B-re (Llama‑Nemotron Super).[21]
- MiniPuzzle — a Puzzle kiterjesztése hibrid architektúrákra, amely a Nemotron‑H‑56B-t mindössze 63 milliárd desztillációs tokennel tömörítette 47B-re. Hasonló pontosság mellett a tömörített modell 20%-kal gyorsabban fut.[12]
Hangolási módszerek
HelpSteer és HelpSteer2
HelpSteer — 37 120 példából álló adatkészlet (CC‑BY‑4.0 licenc), amelyet a Scale AI-jal közösen hoztak létre, ahol minden választ öt attribútum szerint annotáltak: hasznosság (helpfulness), helyesség (correctness), koherencia (coherence), összetettség (complexity) és bőbeszédűség (verbosity), Likert-skálán 0–4.[22]
HelpSteer2 — 21 362 példát tartalmazó frissített adatkészlet (10 681 prompt × 2 válasz), ahol a promptok több mint 95%-a ShareGPT-ből (valós felhasználói kérések) származik. Az annotációk mintegy 50%-át elégtelen minőség miatt szűrték ki. A HelpSteer2‑Preference kiterjesztés páros annotátori preferenciákat ad hozzá, lehetővé téve regressziós és páronkénti jutalommodellek tanítását ugyanazon adatokon.[23][24]
SteerLM
SteerLM — attribútumokon alapuló feltételezéssel rendelkező SFT (Supervised Fine‑Tuning — felügyelt finomhangolás) módszer (helpfulness, correctness, coherence, complexity, verbosity), amely lehetővé teszi a felhasználó számára a válasz stílusának irányítását inferencia során. A folyamat a következő lépésekből áll: (1) attribútum-előrejelző modell (APM) tanítása a HelpSteer adatkészleten, (2) adatok annotálása az APM segítségével, (3) SFT célzott attribútumértékeken való feltételezéssel, (4) bootstrapping.[25]
DPO és RPO
DPO (Direct Preference Optimization) — közvetlen preferencia-optimalizálási módszer explicit jutalommodell nélkül, amelyet a Nemotron‑4 340B Instruct és a Nemotron Nano 2 folyamatokban alkalmaznak.[26]
RPO (Reward‑aware Preference Optimization) — az NVIDIA egyesített matematikai keretrendszere, amely a DPO-t, az IPO-t, a SimPO-t, a REINFORCE-t és a SteerLM 2.0-t speciális esetként általánosítja. Az RPO minimalizálja az implicit jutalommodell előrejelzései és a célul kitűzött explicit modell közötti eltérést[27]:
ahol az explicit jutalommodell, a tanítandó irányelvmodell (policy), a referencia-irányelvmodell, a távolságfüggvény, / a preferált/elutasított válasz. Az RPO-t a Nemotron‑4 340B Instruct és a Llama‑Nemotron modellek tanításakor alkalmazzák.[27][3][11]
Többkörnyezetes megerősítéses tanulás (RLVR)
A Nemotron 3-ban Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) módszert alkalmaznak — egyidejű tanítás több NeMo Gym-környezetben: versenyszerű matematika, programozás, QA, eszközhasználat (tool‑use), utasításkövetés (instruction‑following), hosszú kontextus. Az algoritmus GRPO (Group Relative Policy Optimization) masked importance sampling-gel.[2][14]
A Nemotron 3 támogatja a következtetési cost részletes kezelését (reasoning budget control): a felhasználó meghatározhatja a thinking trace tokenkorlátját a chat template-ben lévő jelzőn keresztül (\"detailed thinking on/off\" kapcsoló vagy hosszkorlátozás).[2]
A modellek sora
Összefoglaló táblázat
| Modell | Év | Összes / Aktív paraméter | Kontextus | Architektúra | Főbb jellemzők |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T token; 1024 GPU A100; 19 nap |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34,3% |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98% szintetikus alignment-adat |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1% |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | NAS-tömörítés Llama 3.1 8B-ből |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.3 70B-ből |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Llama 3.1 405B-ből; GPQA 76,0% |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hibrid Mamba‑Transformer | 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hibrid Mamba‑Transformer | 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hibrid Mamba‑Transformer | MiniPuzzle 56B-ből; +20% sebesség |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hibrid Mamba‑Transformer | 20T token; Minitron-desztilláció |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hibrid Mamba‑Transformer MoE | 25T token; 128 szakértő, 6 aktív |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hibrid LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hibrid LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Architektúra: 32 réteg, rejtett dimenzió 6144, 48 figyelemfej, 8 KV-fej (GQA). A paraméterek teljes száma 15 milliárd (3,2 milliárd embedding + 12,5 milliárd nem-embedding). Eredmények: MMLU — 64,2% (5-shot), BBH — 58,7% (3-shot), GSM8K — 46,0% (8-shot, maj@1), HumanEval — 31,6% (0-shot, pass@1). Többnyelvű benchmarkokon (XCOPA, TyDiQA‑GoldP, MGSM) a modell felülmúlta a négyszer nagyobb modelleket.[8]
Nemotron‑4 340B
Architektúra: 96 réteg, rejtett dimenzió 18 432, 96 figyelemfej, 8 KV-fej.
A Nemotron‑4 340B Base eredményei: MMLU — 81,1% (5-shot), BBH — 85,4% (3-shot), HumanEval — 57,3% (0-shot), ARC‑Challenge — 94,3% (25-shot).[3]
A Nemotron‑4 340B Instruct többlépéses hangolási folyamaton ment keresztül: Code SFT → General SFT → DPO → RPO (3 kör). Eredmények: MT‑Bench — 8,22 (GPT‑4‑Turbo bírálóval), MMLU — 78,7% (0-shot), GSM8K — 92,3% (0-shot), HumanEval — 73,2% (0-shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5%.[3]
A Nemotron‑4 340B Reward az utolsó softmax réteget egy lineáris vetítéssel váltja fel, amely az utolsó réteg rejtett állapotát az 5 HelpSteer2-attribútum vektorára vetíti. A végső jutalom az öt attribútum súlyozott összege. A tanítás 2 epoch alatt zajlott a HelpSteer2 adatkészleten (batch size 128). A RewardBench-en a modell 92,0%-ot ért el, felülmúlva a GPT‑4o-t (84,7%), a Gemini 1.5 Pro-t (88,1%) és a Claude‑3‑Opus-t (80,7%) a publikáció idején.[3]
| Modell | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | 41,5% | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | 34,4% | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | 30,9% | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | 38,8% | 8,26 |
Forrás: arXiv:2406.11704, 5. táblázat.[3]
Llama‑3.1‑Nemotron‑70B
A Llama‑3.1‑Nemotron‑70B‑Reward modellt hibrid módszerrel tanították, amely ötvözi a Bradley‑Terry (páronkénti preferenciák) és a SteerLM-regresszió (többattribútumos Likert-skálás értékelés) megközelítéseket. A tanítás kizárólag HelpSteer2 adatokon (CC‑BY‑4.0) zajlott. A RewardBench-en a modell 94,1%-ot ért el, a publikáció idején az első helyen végzett.[10]
A Llama‑3.1‑Nemotron‑70B‑Instruct modellt RLHF módszerrel hangolták, REINFORCE algoritmussal (nem PPO), Nemotron‑70B‑Reward jutalommodell alkalmazásával. Az infrastruktúra NeMo‑Aligner TRT‑LLM gyorsítással.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
Következtetési modellek sorozata, amelyeket Llama 3.x alapján NAS, desztilláció és kiterjesztett utólagos tanítás módszereivel hoztak létre.[11]
| Modell | Paraméterek | Alapmodell | Kontextus |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 milliárd | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 milliárd | Minitron 4B (Llama 3.1 8B-ből) | 128K |
| Llama‑Nemotron‑Super 49B | 49 milliárd | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 milliárd | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Ötlépéses tanítási folyamat: (1) NAS + FFN Fusion, (2) desztilláció + folytatólagos előtanítás, (3) SFT (beleértve DeepSeek‑R1 következtetési láncolatokat), (4) nagy léptékű RL (GRPO az Ultra esetén, REINFORCE/RLOO + Online RPO a Nano esetén), (5) párbeszédre való hangolás.[11]
A modellek elsőként a nyílt LLM-ek között támogatnak átkapcsolható következtetési módot (reasoning toggle): bekapcsolt állapotban (\"detailed thinking on\" a rendszer-promptban) a modell <think>...</think> tagek között következtetési láncot generál a válasz előtt; kikapcsolt állapotban közvetlenül válaszol.[11]
A Llama‑Nemotron‑Ultra 253B eredményei (reasoning ON): GPQA Diamond — 76,0%, AIME 2024 — 80,8%, MATH 500 — ~97%. Összehasonlításképpen: DeepSeek‑R1 (671B összes / 37B aktív) — GPQA Diamond 71,5%, AIME 2024 ~79,8%. Az Ultra egyetlen 8×H100 csomóponton futtatható.[11]
Nemotron‑H (2025. április)
Sűrű hibrid modellek sorozata, amelyeket az alapoktól tanítottak és hosszú generálási feladatokra terveztek. A Nemotron‑H‑56B 20 billió tokenen lett tanítva FP8 formátumban — ez az egyik legnagyobb nyilvános FP8 előtanítási kísérlet. A Nemotron‑H‑47B a 56B MiniPuzzle módszerrel tömörített változata (63 milliárd desztillációs token), amely egyetlen RTX 5090 memóriájába elfér (FP4) ~1M tokenes kontextus mellett.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Forrás: arXiv:2504.03624.[12]
65 536 bemeneti és 1024 kimeneti tokennel generálva H100-on, a Nemotron‑H‑47B modell 2,9-szer gyorsabban működött, mint a Qwen‑2.5‑72B és a Llama‑3.1‑70B.[12]
Nemotron Nano 2 (2025. augusztus)
Hibrid Mamba‑Transformer modell következtetési feladatokra. A Nemotron‑Nano‑12B‑v2‑Base szülőmodell 62 réteggel (főként Mamba‑2 + MLP + 4 figyelemréteg), amelyet 20 billió tokenen tanítottak FP8 formátumban az alapoktól. Ebből kiterjesztett Minitron módszerrel készült a Nemotron‑Nano‑9B‑v2, amely 128K tokenes kontextusban képes futni egyetlen NVIDIA A10G GPU-n (22 GB, BF16). Utólagos tanítás: SFT (80 milliárd token, beleértve DeepSeek‑R1‑0528 láncolatokat) → GRPO → DPO → RLHF. A következtetési benchmarkokon a modell a Qwen3‑8B-hez hasonló pontosságot ér el, de hosszú kimeneti sorozatoknál 3–6-szoros generálási gyorsulást mutat.[13]
Nemotron 3 Nano 30B‑A3B
2025 decemberében jelent meg. Paraméterek: 31,6 milliárd összesen, 3,2 milliárd aktív. Architektúra: 52 réteg, rejtett dimenzió 2688, szakértő-dimenzió 1856, Mamba állapot-dimenzió 128. MoE: 128 irányított szakértő + 1 megosztott, tokenenként 6 aktív. Kontextus: legfeljebb 1 048 576 token. Tanítás 25 billió tokenen (WSD-ütemezés, batch size 3072, adatok határa 2025. június), két fázisban: 1. fázis — 23,5 billió (változatos adatok), 2. fázis — 1,5 billió (magas minőségű adatok) + 121 milliárd token hosszú kontextusú CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — másodlagos forrásokból származó értékek; a reprodukció feltételei: NeMo Evaluator SDK. Forrás: arXiv:2512.20848.[2][28]
Áteresztőképesség (8K bemenet / 16K kimenet, egyetlen H200): 3,3-szor magasabb, mint a Qwen3‑30B‑A3B‑Thinking esetén, és 2,2-szer magasabb, mint a GPT‑OSS‑20B esetén.[2]
További modellek és irányok
- OpenReasoning‑Nemotron (2025. július) — 1,5B–32B paraméteres modellek sorozata, Qwen 2.5 alapján, DeepSeek‑R1‑0528 adatokon finomhangolva. A 32B-es változat GenSelect@64 módszerrel egyes matematikai benchmarkokon felülmúlja az o3-at (high).[29]
- Nemotron Elastic (arXiv:2511.16664) — beágyazott almodellek keretrendszere (6B, 9B, 12B) egyetlen szülőmodell keretein belül, amely az alapoktól való tanításhoz képest 360-szorosára csökkenti a tanítási költséget.[30]
- Nemotron‑CrossThink — mértani feladatokon túli, többtartományú megerősítéses tanulási keretrendszer, amely +30,1%-os javulást ért el a MATH‑500-on és +12,8%-ot az MMLU‑PRO-n.[31]
- Nemotron‑UltraLong — kontextus kiterjesztése 4 millió tokenig.[32]
- Jet‑Nemotron — utólagos tanításra szolgáló NAS kompakt hibrid modellek számára (2B/4B).[33]
Speciális modellek
A Nemotron ökoszisztémában speciális feladatokra szánt modellek is jelen vannak:
- Nemotron Nano V2 VL — vision‑language modell OCR, táblázatfeldolgozás és videó feladatokhoz.[34]
- Nemotron Parse 1.1 — OCR és dokumentumstruktúra-kinyerési modell.[35]
- Nemotron ColEmbed V2 — embedding modell vizuális dokumentumkereséshez (late interaction).[36]
- Nemotron Speech — modellek automatikus beszédfelismeréshez (ASR), szövegfelolvasáshoz (TTS) és gépi fordításhoz (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — biztonságtalan tartalom osztályozási modellje 23 kategóriában, 9 nyelven, 84,2%-os pontossággal.[37]
Előtanítási adatok
A Nemotron‑4 adatösszetétele
A Nemotron‑4 15B és 340B előtanítási korpusza három fő kategóriából áll: angol szövegek (70%), 53 nyelvű többnyelvű szövegek (15%) és 43 programozási nyelven írt forráskód (15%). Dokumentumszintű deduplikálást alkalmaztak (pontos és közel-duplikált elemekre), valamint nyelvi modelleken és heurisztikákon alapuló szűrést. A 15B-es modellt 8 billió tokenen tanították, a 340B-est 9 billión (8 billió előtanítás + 1 billió folytatólagos tanítás, magas minőségű források újrasúlyozásával).[8][3]
Nemotron‑CC
A Nemotron‑CC adatkészlet a Common Crawl-ból készült minőségi osztályozók együtteseinek és szintetikus szöveg-átfogalmazásnak a segítségével. A teljes terjedelem 6,3 billió token (4,4 billió deduplikált + 1,9 billió szintetikus átfogalmazás). A folyamat integrálva van a NeMo Curator eszközbe. A munkát az ACL 2025 konferencián Long Paper-ként fogadták el.[38]
Nemotron‑CC‑Math
Matematikai orientációjú részhalmaz, 133 milliárd tokenes terjedelemmel, amelyet a Common Crawl-ból nyertek ki a Lynx + LLM-folyamat segítségével, matematikai képletek és kód LaTeX formátumban való megőrzésével.[39]
A Nemotron 3 Nano adatai
A Nemotron 3 Nano előtanítása 25 billió tokenen zajlott. A készlet tartalmazza: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 és speciális STEM-adatkészleteket. A hosszú kontextusú tanításhoz további 121 milliárd CPT-tokent alkalmaztak.[2]
Nemotron Pretraining Dataset v1
Szintetikusan generált adatkészlet, amely STEM, akadémiai szövegeket, következtetési feladatokat és többnyelvű tartományokat fed le; több mint 10 billió nyelvi tokent és 18 millió SFT-mintát tartalmaz. Minden adatkészlet nyílt, megengedő licencek alatt érhető el.[40]
Szintetikus adatgenerálási folyamat (SDG)
A Nemotron‑4 340B jelentésében leírt folyamat a következő lépéseket tartalmazza[3]:
- Prompt-generálás: szintetikus egy- és kétkörös kérések, amelyeket Mixtral‑8x7B‑Instruct‑v0.1 (Apache 2.0 licenc) generált Open QA, Writing, Closed QA, Math & Coding sablonok alapján.
- Válasz-generálás: a változatosság biztosítása érdekében a modellek közbenső verzióitól érkező többszörös válaszok.
- Minőségértékelés: három megközelítés — Ground‑Truth‑as‑a‑Judge (ellenőrizhető válaszú feladatoknál), LLM‑as‑Judge (válaszpárok összehasonlítása nyelvi modellel), Reward‑Model‑as‑Judge (Nemotron‑4‑340B‑Reward alkalmazása).
- Iteratív hangolás a gyengébb modellektől az erősebbek felé (weak‑to‑strong).
Mintegy 20 000 emberek által annotált példából (10 000 SFT-hez, 10 000 HelpSteer2 a jutalommodellhez) szintetizálták az összes többi hangolási adatot.[3]
Kvantálás és inferencia-optimalizálás
A Nemotron 3 Nano modellek támogatják a Post‑Training Quantization (PTQ) FP8 formátumban, ModelOpt és Megatron‑LM segítségével. Szelektív kvantálást (selective quantization) alkalmaznak — a figyelemrétegek és a Mamba egy része BF16-ban marad a minőség megőrzése érdekében; a többit FP8-ra kvantálják. A műszaki jelentés szerint ez ~99%-os pontosságmegőrzést biztosít.[2] A Nano NVFP4 formátumú inferenciát is támogat.[1]
Generációk szerinti benchmark-összefoglaló
| Modell | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Feltételek |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64,2% | 46,0% | 31,6% | — | — | alap; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81,1% | — | 57,3% | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78,7% | 92,3% | 73,2% | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | 2024. okt. |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0%, AIME 80,8% |
| Nemotron‑H‑47B | 83,6% | 93,3% | 61,0% | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1%, LCB 68,3% |
Az összehasonlítást körültekintően kell értelmezni: az értékelési feltételek, a benchmark-verziók és a tesztelési dátumok eltérnek a generációk között. Az eredmények az NVIDIA műszaki jelentéseiből származnak; a független értékelések eltérhetnek (lásd a „Korlátok" részt).[8][3][9][11][12][2]
Alkalmazás
Telepítés NVIDIA NIM segítségével
Az NVIDIA NIM optimalizált konténeres mikro-szolgáltatások készlete inferenciához, OpenAI-kompatibilis API-val. A Nemotron modellek NIM-mikro-szolgáltatásként elérhetők a build.nvidia.com platformon. A NIM támogatja az FP8, BF16 és NVFP4 formátumokat, valamint Kubernetes-en való telepítést Helm-chart-ok segítségével. A modellek független keretrendszerekkel is kompatibilisek: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Szintetikus adatgenerálás
A Nemotron‑4 340B-t szintetikus adatgenerátorként való felhasználásra tervezték: az Instruct modell válaszokat generál, a Reward modell értékeli és szűri azokat. Az NVIDIA Open Model License kifejezetten engedélyezi a modell kimenetének más modellek tanítására való felhasználását. A ServiceNow adatai szerint az Apriel 1.6 modelljük előtanítási adatainak 15%-a a Nemotron adatkészletekből származik.[3][15][41]
Ügynöki rendszerek
A Nemotron 3 család (Nano, Super, Ultra) modelljei többügynökes munkaterhelésekre készültek: tervezés, retrieval, eszközhívás (tool use). A Nemotron 3 Nano 38,76%-ot ér el a SWE-Bench-en (OpenHands-szel) és 49,04%-ot (átlag) a TauBench V2-n.[2]
Vállalati bevezetések
A bejelentett partnerek között szerepel: ServiceNow (közös Apriel Nemotron 15B modell munkafolyamatok automatizálásához), CrowdStrike (Charlotte AI platform), Perplexity (lekérdezés-irányítás), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. A modellek elérhetők az AWS Amazon Bedrockon; a Google Cloud, CoreWeave és Nebius támogatása is tervezett.[15]
Korlátok és nyitott kérdések
Független értékelések és eltérések az NVIDIA adataitól
A független értékelések eltéréseket mutatnak az NVIDIA által közölt eredményekhez képest. Az Artificial Analysis adatai szerint (2026. február) a Llama‑Nemotron‑Ultra 253B (reasoning) 15-ös Intelligence Index pontszámot kapott, miközben a hasonló méretű modellek mediánja 26. A Chatbot Arena (LMArena) platformon a Nemotron modellek a rangsor közepén helyezkednek: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. hely), Nemotron 3 Nano — 1317 ±6 (~164. hely).[42][43]
Bőbeszédűség
A Nemotron modellek fokozott bőbeszédűséget mutatnak: az Artificial Analysis értékelése során a Nemotron 3 Nano 140 millió tokent generált (a többi modell mediánja 12 millió), ami növeli az inferencia költségét. A DEV Community elemzése szerint a Llama‑3.1‑Nemotron‑70B‑Instruct, bár formálisan vezette az automatikus benchmarkokat, egyes gyakorlati feladatokban nem volt kellően pontos, és az Arena-jellegű benchmarkokon elért magas pontszámok magyarázhatók a bőbeszédű és magabiztos, de nem feltétlenül pontos válaszok preferálásával.[42][44]
Hallucinációk és torzítások
Az NVIDIA a modellkártyákon jelzi, hogy a modellek „erősíthetik az elfogultságokat és toxikus válaszokat generálhatnak, különösen toxikus promptok esetén", valamint „pontatlan információt adhatnak közre és kihagyhatnak kulcsfontosságú részleteket". A súlyok és adatok nyitottsága lehetővé teszi a külső auditot.[11][13]
Számítási követelmények
A sűrű modellek (Nemotron‑4 340B) teljes tanításához 768 DGX H100 csomópontból álló klaszter szükséges, ami korlátozza a reprodukálhatóságot az akadémiai csoportok számára, akiknek nincs hozzáférése hasonló infrastruktúrához. A hosszú kontextus (1M) inferencia során jelentős VRAM kapacitást igényel.[3][2]
Teljesítmény-romlás hosszú kontextus esetén
Az ultra-hosszú sorozatokra való kontextus-kiterjesztés során romlást észleltek a rövid kontextusú benchmarkokon.[32]
Hibrid architektúrák kvantálása
A szélsőségesen alacsony bithossz (FP8/NVFP4) alkalmazása Mamba‑Transformer architektúrákban enyhe pontosságromláshoz vezet (~1% egyes benchmarkokon). Ezt a problémát szelektív kvantálással orvosolják, ami bonyolítja a fordítók és inferencia-kiszolgálók architektúráját.[2][1]
Egyéb nyitott kérdések
- Függőség az esetlegesen kontaminált tanítási adatokkal rendelkező benchmarkoktól.
- A hibrid SSM‑Transformer és a tisztán Transformer architektúrák összehasonlítására vonatkozó szabványosított protokollok hiánya.
- A MoE megközelítés skálázhatóságának kérdése tokenenkénti kevés szakértőt igénylő mély következtetési feladatoknál.
- A Super/Ultra 2025 decemberi adatai előzetesek; a teljes benchmarkok a kiadás után várhatók.[1]
Etikai és szabályozási szempontok
Biztonság a fejlesztési szakaszban
A fejlesztési szakaszban a következő módszereket alkalmazzák: értékelés az AEGIS keretrendszer szerint (13 tartalombiztonsági kategória), garak sebezhetőség-szkenner, manuális red-teaming (vöröscsapatozás).[37]
Biztonság az inferencia szakaszában
A NeMo Guardrails nyílt eszközkészlet (Apache 2.0 licenc), amely programozható korlátokat ad az LLM-rendszerekhez. A mikroszolgáltatás elfogja a bemeneteket és kimeneteket, konfigurálható ellenőrzéseket alkalmazva: témafelügyelet, PII-észlelés, RAG „megalapozottság" ellenőrzése, jailbreak-támadások észlelése (beleértve a YARA-alapú kódinjekciós védelmet), többnyelvű multimodális biztonsági osztályozás.[45]
A Nemotron 3-hoz közzétettek egy ~11 000 annotált OpenTelemetry-láncolatból álló készletet, amelyek reális, eszközhasználatos forgatókönyvekből származnak, és az ügynöki biztonság értékelésére szolgálnak.[1]
Licencelés
| Modellek | Licenc |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (a Meta-tól öröklött) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
Az NVIDIA Nemotron Open Model License engedélyezi a kereskedelmi felhasználást, a származékos munkák létrehozását és terjesztését, nem követel meg attribúciót (a NOTICE fájl megőrzése mellett), nem szab korlátozást a felhasználók számára, és kifejezetten engedélyezi a modell kimenetének más modellek tanítására való felhasználását.[46] A Llama alapú modellek öröklik a Meta korlátozásait, beleértve a havi 700 millió aktív felhasználói küszöbértéket.[11]
A Nemotron 3 Nano esetén az NVIDIA közzétette: a modell súlyait, több mint 10 billió token tanítási adatot, tanítási recepteket, kódbázisokat (NeMo, Megatron‑LM, NeMo‑Aligner), valamint több mint 10 megerősítéses tanulási környezetet 900 000+ feladattal.[1][2]
Perspektívák és kutatási irányok
A közeljövőben várható kiadások közé tartozik a Nemotron 3 Super (~100 milliárd paraméter, ~10 milliárd aktív) és a Nemotron 3 Ultra (~500 milliárd, ~50 milliárd aktív), amelyeket 2026 első felére várnak. Mindkét modell LatentMoE-t, MTP-t és NVFP4 formátumú tanítást fog alkalmazni Blackwell architektúrán.[1]
Az NVIDIA stratégiai iránya a Nemotron pozicionálása nem egyedi modellként, hanem többügynökes rendszerek infrastrukturális rétegeként, ahol a család különböző modelljeit különböző feladatokhoz, komplexitás alapú irányítással alkalmazzák.[1][15]
Főbb kutatási irányok:
- Hibrid architektúrák fejlesztése — SSM-rétegek és a figyelemmechanizmus további integrálása a skálázható hosszú kontextus érdekében.[12]
- Többszintű tömörítési módszerek — Minitron, Puzzle, MiniPuzzle és Nemotron Elastic fejlesztése.[20][21][30]
- Többtartományú megerősítéses tanulás — Nemotron‑CrossThink az RL matematikán túli kiterjesztéséhez.[31]
- Kontextus-kiterjesztés — Nemotron‑UltraLong 4 millió tokenig.[32]
- Multimodalitás — kiterjesztés a vision‑language (Nemotron VL), beszéd (Nemotron Speech) és vizuális dokumentumkeresés (Nemotron ColEmbed V2) területeire.[34][35][36]
- Kompakt hibrid modellek — Jet‑Nemotron (NAS 2B/4B modellek számára).[33]
- Nyílt receptek — teljes tanítási receptek és adatok közzététele a közösségi reprodukció és testreszabás érdekében.[14]
Lásd még
- Transformer architektúra
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (Meta modellek sorozata)
Hivatkozások
- NVIDIA Research — Nemotron 3 oldal: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — Nemotron dokumentáció: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework dokumentáció: https://docs.nvidia.com/nemo/
Irodalom
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, 2024. február. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, 2024. június. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, 2024. június. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, 2024. július. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, 2024. november. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, 2025. január. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, 2025. április. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, 2025. május. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, 2025. augusztus. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, 2025. augusztus. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, 2025. november. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, 2025. december. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, 2025. december. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Megjegyzések
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/