Nemotron (NVIDIA) (RO)
Nemotron — familie de modele lingvistice de mari dimensiuni (Large Language Model, LLM) cu ponderi deschise, dezvoltată de divizia Applied Deep Learning Research (ADLR) a corporației NVIDIA. Modelele aparțin domeniului Machine Learning și procesării limbajului natural (Natural Language Processing, NLP) și sunt destinate unei game largi de sarcini: generarea sintetică de date, raționament (reasoning), aplicații agentice (agentic AI) și implementare pe echipamente industriale NVIDIA. Familia reunește modele de diferite arhitecturi și scări: de la 4 miliarde la ~500 de miliarde de parametri, inclusiv modele dense (dense) decoder‑only Transformer din seria Nemotron‑4 (2024), modele hibride Mamba‑Transformer (Nemotron‑H, 2025) și modele hibride Mamba‑Transformer cu Mixture-of-Experts (MoE) din seria Nemotron 3 (2025). Începând cu martie 2026, familia numără peste 20 de modele, acoperind sarcini de generare de text, raționament, înțelegere vizuală a documentelor, extragere de informații și evaluarea calității răspunsurilor. Modelele sunt distribuite preponderent cu ponderi deschise sub licențele NVIDIA Open Model License și Llama Community License.[1][2][3]
Istoric și context
Dezvoltarea familiei Nemotron se desfășoară în contextul strategiei NVIDIA de creare a unui stec complet de instrumente pentru IA generativă: de la infrastructura de antrenament (DGX, supercalculatoare bazate pe GPU H100/B200) până la platforme de antrenament (NeMo Framework), aliniere (NeMo‑Aligner), implementare (NIM — NVIDIA Inference Microservices) și asigurarea securității (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
Primul model din serie disponibil public — un Transformer decodor cu 8 miliarde de parametri și un context de 4096 de tokenuri, antrenat pe 3,8 trilioane de tokenuri în 53 de limbi naturale și 37 de limbaje de programare. Antrenamentul a fost realizat pe 1024 GPU A100 în 19 zile. Nu a fost publicat niciun raport tehnic formal pe arXiv. Modelul era distribuit prin NeMo Framework și Hugging Face, existând variante Chat (SFT și SteerLM). Licența — NVIDIA AI Foundation Models Community License.[6][7]
Notă privind denumirile: „Nemotron‑3" din 2023 și „Nemotron 3" din decembrie 2025 sunt modele diferite. Prima a fost un prototip timpuriu, cea de-a doua — o generație actuală cu arhitectură MoE.
Nemotron‑4 15B (februarie 2024)
Primul lansare documentat public din seria Nemotron‑4 — un model cu 15 miliarde de parametri, antrenat pe 8 trilioane de tokenuri în ~13 zile calendaristice pe 384 de noduri DGX H100 (până la 3072 GPU). A fost utilizat paralelism tensorial de 8 ori și paralelism pe date de la 96 la 288. MFU (Model FLOPs Utilization) de vârf a fost de 34,3 % la batch size 384. Arhitectura — Transformer decoder‑only cu Grouped‑Query Attention (GQA) și Rotary Position Embeddings (RoPE). Conform benchmark-urilor la momentul publicării, modelul depășea toate modelele deschise comparabile ca dimensiune la sarcinile multilingve, inclusiv unele modele de patru ori mai mari.[8]
Nemotron‑4 340B (iunie 2024)
În iunie 2024 a fost lansat cel mai mare model din seria Nemotron‑4 — 340 de miliarde de parametri (331,6 mld. non‑embedding), pre-antrenat pe 9 trilioane de tokenuri (8 trilioane pre-antrenament + 1 trilion antrenament continuat cu reponderarea surselor de înaltă calitate). Antrenamentul a fost realizat pe 768 de noduri DGX H100 (până la 6144 GPU) cu MFU de vârf de 42,4 %, din decembrie 2023 până în mai 2024. Familia include trei variante: Base, Instruct și Reward. Dimensiunea modelului a fost aleasă astfel încât să încapă pe un singur nod DGX H100 (8 GPU) la implementarea în formatul de precizie FP8. Peste 98 % din datele utilizate la aliniere (alignment) au fost generate sintetic chiar de modelele seriei într-un proces iterativ; pipeline-ul de generare sintetică de date este deschis pentru reproducere.[3]
Llama‑3.1‑Nemotron‑70B (octombrie 2024)
În octombrie 2024 au fost lansate modele fine-tuned din Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct și Llama‑3.1‑Nemotron‑70B‑Reward. La data de 1 octombrie 2024, modelul Instruct ocupa locul 1 simultan pe trei benchmark-uri automate: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Modelul Reward a atins 94,1 % pe RewardBench.[9][10]
Tranziția spre arhitecturi hibride (2025)
În 2025, seria s-a extins cu arhitecturi hibride care combină straturi Mamba‑2 (State Space Model, SSM — model spațiu de stare) și Transformer. În perioada martie–mai 2025 a fost lansată familia de modele de raționament Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) cu mod de raționament comutabil.[11] În aprilie 2025 a fost publicat Nemotron‑H (arXiv:2504.03624) — o familie de modele hibride Mamba‑Transformer cu dimensiunile 8B, 56B și 47B parametri.[12] În august 2025 a fost prezentat Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (decembrie 2025)
În 15 decembrie 2025 a fost anunțată a treia generație — familia Nemotron 3 cu modelele Nano, Super și Ultra, care reunește arhitecturi Mamba‑2, Transformer și MoE cu o fereastră de context de până la 1 milion de tokenuri. Nano a fost lansată cu raport tehnic; Super și Ultra sunt planificate pentru prima jumătate a anului 2026.[1][2][14][15]
Fundamente teoretice
Arhitectura Transformer în Nemotron‑4
Modelele din seria Nemotron‑4 sunt construite pe arhitectura standard a Transformer-ului decodor cu atenție cauzală. Probabilitatea secvenței de tokenuri este factorizată astfel:
unde — parametrii modelului.[8]
Mecanismul de atenție este implementat în varianta Grouped‑Query Attention (GQA)[16]:
unde — matricele de interogări, chei și valori; — dimensiunea capului de atenție.
Pentru codificarea pozițiilor se utilizează Rotary Position Embeddings (RoPE)[17]:
unde — vectorul în poziția , , — dimensiunea vectorului.
În straturile MLP se utilizează activarea Squared ReLU: , asigurând raritatea activărilor. Modelele nu conțin bias-uri, nu folosesc dropout, iar matricele de embeddings de intrare și ieșire nu sunt legate între ele (untied embeddings). Tokenizatorul — SentencePiece BPE cu păstrarea spațiilor, segmentarea caracter cu caracter a cifrelor și fallback pe octeți, dimensiunea vocabularului — 256 000.[8][3]
Parametrii arhitecturali Nemotron‑4
| Parametru | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Număr de parametri | 15 mld. (3,2 mld. embed.) | 340 mld. (9,4 mld. embed.) |
| Număr de straturi | 32 | 96 |
| Dimensiune ascunsă | 6144 | 18 432 |
| Capete de atenție | 48 | 96 |
| Capete KV‑ (GQA) | 8 | 8 |
| Lungimea contextului | 4096 | 4096 |
| Dimensiunea vocabularului | 256 000 | 256 000 |
Surse: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Arhitectura hibridă Mamba‑Transformer (Nemotron‑H)
În modelele Nemotron‑H, blocurile standard de auto-atenție sunt parțial înlocuite cu blocuri Mamba‑2 — modele ale spațiului de stare (State Space Models, SSM). La generarea autoregresivă, fiecare strat de auto-atenție necesită operații și memorie pe pas (din cauza cache-ului KV), în timp ce straturile Mamba asigură costuri constante de memorie și calcul pentru fiecare token generat.[12]
Mamba‑2 este descris de relația recurentă[18]:
unde — starea ascunsă, — matricea diagonală de tranziție a stărilor, și — matricele de proiecție, — tokenul de intrare, — semnalul de ieșire. În Mamba‑2, matricele , , depind de intrare (input‑dependent), ceea ce diferențiază modelul de SSM-urile liniare clasice.
În Nemotron‑H‑56B sunt utilizate 54 straturi Mamba‑2 + 54 straturi MLP + 10 straturi de auto-atenție, straturile de atenție fiind distribuite uniform printre straturile Mamba. Modelul a fost antrenat pe 20 trilioane de tokenuri în format FP8 (per‑tensor scaling) pe 6144 GPU H100. Versiunea Nemotron‑H‑8B conține 24 de straturi Mamba‑2, 24 de straturi MLP și 4 straturi de auto-atenție; antrenamentul a fost realizat pe 15 trilioane de tokenuri.[12]
Arhitectura MoE Nemotron 3
Modelele Nemotron 3 (decembrie 2025) reunesc trei componente arhitecturale: Mamba‑2, Transformer și Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) conține 52 de straturi: 23 straturi Mamba‑2 + MoE, 23 straturi MoE și 6 straturi de atenție GQA. Fiecare strat MoE include 128 de experți rutați (routed) + 1 expert comun (shared), dintre care 6 experți sunt activați pentru fiecare token. Rutarea este efectuată de un router MLP antrenabil cu sigmoid gating. Echilibrarea încărcăturii este implementată fără funcție auxiliară de pierdere (aux‑loss‑free). Numărul total de parametri este de 31,6 miliarde, dar activi pentru fiecare token — doar 3,2 miliarde.[2]
Normalizarea — RMSNorm[19]. Embedding-urile poziționale în părțile Mamba lipsesc (informația pozițională este implicită în starea SSM). Se utilizează embedding-uri nelegate, absența dropout și a bias-urilor în straturile liniare.[2]
Extensii în Super/Ultra: LatentMoE și Multi‑Token Prediction
Modelele Super și Ultra din familia Nemotron 3 aplică două inovații arhitecturale suplimentare:
- Latent MoE (LatentMoE) — proiecția reprezentării de intrare într-un spațiu latent de dimensiune mai mică înainte de rutare, permițând creșterea numărului de experți la costuri computaționale comparabile și îmbunătățirea preciziei fără reducerea debitului.[1]
- Multi‑Token Prediction (MTP) — predicția mai multor tokenuri următoare simultan, utilizat pentru îmbunătățirea calității textelor lungi și decodarea speculativă la inferență.[1]
Antrenamentul Super și Ultra se realizează în format NVFP4 — formatul numeric pe 4 biți al NVIDIA pe arhitectura Blackwell.[1]
Metode de compresie a modelelor: Minitron, Puzzle, MiniPuzzle
Pentru crearea de modele compacte, NVIDIA aplică mai multe abordări:
- Minitron — metodă de tăiere structurată (pruning) și distilare a cunoștințelor (knowledge distillation). Sunt studiate două tipuri de pruning: după adâncime (eliminarea straturilor) și după lățime (reducerea simultană a dimensiunilor straturilor ascunse, capetelor de atenție și proiecțiilor MLP). Aplicarea Minitron la Nemotron‑4 15B permite obținerea modelelor 8B și 4B cu o reducere a costurilor de antrenament de până la 40 de ori față de antrenamentul de la zero.[20]
- Puzzle — algoritm de Neural Architecture Search (NAS), care selectează configurația optimă a fiecărui bloc (numărul de capete KV, dimensiunea FFN, prezența/absența atenției) cu distilare bloc cu bloc. Astfel a fost comprimat Llama 3.1 405B la 253B (Llama‑Nemotron Ultra), iar Llama 3.3 70B la 49B (Llama‑Nemotron Super).[21]
- MiniPuzzle — extensie a Puzzle pentru arhitecturi hibride, care a comprimat Nemotron‑H‑56B la 47B cu doar 63 de miliarde de tokenuri de distilare. La o precizie similară, modelul comprimat funcționează cu 20 % mai rapid.[12]
Metode de aliniere
HelpSteer și HelpSteer2
HelpSteer — set de 37 120 de exemple (licența CC‑BY‑4.0), creat în colaborare cu Scale AI, în care fiecare răspuns este adnotat pe cinci atribute: utilitate (helpfulness), corectitudine (correctness), coerență (coherence), complexitate (complexity) și verbozitate (verbosity) pe o scală Likert 0–4.[22]
HelpSteer2 — set actualizat de 21 362 de exemple (10 681 de prompturi × 2 răspunsuri), unde peste 95 % din prompturi sunt preluate din ShareGPT (cereri reale ale utilizatorilor). Aproximativ 50 % din adnotări au fost filtrate ca insuficient de calitative. Extensia HelpSteer2‑Preference adaugă preferințe perechi ale adnotatorilor, permițând antrenarea atât a modelelor de recompensă regresive, cât și a celor perechi pe aceleași date.[23][24]
SteerLM
SteerLM — metodă SFT (Supervised Fine‑Tuning — antrenament supervizat) cu condiționare pe atribute (helpfulness, correctness, coherence, complexity, verbosity), permițând utilizatorului să controleze stilul răspunsului la inferență. Pipeline-ul include: (1) antrenarea modelului de predicție a atributelor (APM) pe HelpSteer, (2) adnotarea datelor cu ajutorul APM, (3) SFT cu condiționare pe valorile țintă ale atributelor, (4) bootstrapping.[25]
DPO și RPO
DPO (Direct Preference Optimization) — metodă de optimizare directă a preferințelor fără un model explicit de recompensă, utilizată în pipeline-urile Nemotron‑4 340B Instruct și Nemotron Nano 2.[26]
RPO (Reward‑aware Preference Optimization) — cadru matematic unificat NVIDIA, care generalizează DPO, IPO, SimPO, REINFORCE și SteerLM 2.0 ca cazuri particulare. RPO minimizează distanța dintre predicțiile modelului implicit de recompensă și modelul explicit țintă[27]:
unde — modelul explicit de recompensă, — politica antrenată, — politica de referință, — funcția de distanță, / — răspunsul preferat/respins. RPO este aplicat la antrenamentul Nemotron‑4 340B Instruct și al modelelor Llama‑Nemotron.[27][3][11]
Reinforcement Learning multi-mediu (RLVR)
În Nemotron 3 se aplică Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — antrenament simultan în mai multe medii în cadrul NeMo Gym: matematică competitivă, programare, QA, tool‑use, instruction‑following, long‑context. Algoritmul — GRPO (Group Relative Policy Optimization) cu masked importance sampling.[2][14]
Nemotron 3 suportă controlul granular al bugetului de raționament (reasoning budget control): utilizatorul poate seta limita de tokenuri pentru traseul de gândire (thinking trace) printr-un flag în chat template (comutare „detailed thinking on/off" sau limitarea lungimii).[2]
Linia de modele
Tabel sumar
| Model | An | Total / Parametri activi | Context | Arhitectură | Caracteristici cheie |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8T tokenuri; 1024 GPU A100; 19 zile |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T tokenuri; MFU 34,3 % |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T tokenuri; Base/Instruct/Reward; >98 % date sintetice alignment |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1 % |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Compresie NAS din Llama 3.1 8B |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Din Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Din Llama 3.1 405B; GPQA 76,0 % |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hibrid Mamba‑Transformer | 15T tokenuri; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hibrid Mamba‑Transformer | 20T tokenuri FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hibrid Mamba‑Transformer | MiniPuzzle din 56B; +20 % viteză |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hibrid Mamba‑Transformer | 20T tokenuri; distilare Minitron |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hibrid Mamba‑Transformer MoE | 25T tokenuri; 128 experți, 6 activi |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hibrid LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hibrid LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Arhitectură: 32 de straturi, dimensiune ascunsă 6144, 48 de capete de atenție, 8 capete KV (GQA). Numărul total de parametri — 15 miliarde (3,2 mld. embedding + 12,5 mld. non‑embedding). Rezultate: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). Pe benchmark-urile multilingve (XCOPA, TyDiQA‑GoldP, MGSM), modelul depășea modele de patru ori mai mari.[8]
Nemotron‑4 340B
Arhitectură: 96 de straturi, dimensiune ascunsă 18 432, 96 de capete de atenție, 8 capete KV.
Nemotron‑4 340B Base a obținut: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]
Nemotron‑4 340B Instruct a parcurs o aliniere în mai multe etape: Code SFT → General SFT → DPO → RPO (3 runde). Rezultate: MT‑Bench — 8,22 (GPT‑4‑Turbo judge), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]
Nemotron‑4 340B Reward înlocuiește stratul final softmax cu o proiecție liniară a stării ascunse a ultimului strat într-un vector cu 5 atribute HelpSteer2. Recompensa finală — suma ponderată a celor cinci atribute. Antrenamentul a fost realizat în 2 epoci pe datele HelpSteer2 (batch size 128). Pe RewardBench, modelul a atins 92,0 %, depășind GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) și Claude‑3‑Opus (80,7 %) la momentul publicării.[3]
| Model | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | 41,5 % | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | 34,4 % | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | 30,9 % | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | 38,8 % | 8,26 |
Sursă: arXiv:2406.11704, tabelul 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward a fost antrenat printr-o metodă hibridă care combină Bradley‑Terry (preferințe perechi) și regresia SteerLM (evaluare multi-atribut pe scala Likert). Antrenamentul a fost realizat exclusiv pe datele HelpSteer2 (CC‑BY‑4.0). Pe RewardBench, modelul a atins 94,1 %, ocupând locul 1 la momentul publicării.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct a fost aliniat prin metoda RLHF cu algoritmul REINFORCE (nu PPO) și modelul de recompensă Nemotron‑70B‑Reward. Infrastructura — NeMo‑Aligner cu accelerare TRT‑LLM.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
Familie de modele de raționament obținute din Llama 3.x prin metode NAS, distilare și post-antrenament extins.[11]
| Model | Parametri | Model de bază | Context |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 miliarde | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 miliarde | Minitron 4B (din Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | 49 miliarde | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 miliarde | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Pipeline de antrenament în cinci etape: (1) NAS + FFN Fusion, (2) distilare + pre-antrenament continuat, (3) SFT (inclusiv trasee de raționament DeepSeek‑R1), (4) RL la scară largă (GRPO pentru Ultra, REINFORCE/RLOO + Online RPO pentru Nano), (5) aliniere pentru dialog.[11]
Modelele sunt primele dintre LLM-urile deschise care suportă mod de raționament comutabil (reasoning toggle): când este activat („detailed thinking on" în promptul de sistem), modelul generează un lanț de raționament în tag-urile <think>...</think> înaintea răspunsului; când este dezactivat — răspunde direct.[11]
Rezultatele Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Pentru comparație: DeepSeek‑R1 (671B total / 37B activi) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra este găzduit pe un singur nod 8×H100.[11]
Nemotron‑H (aprilie 2025)
Familie de modele hibride dense, antrenate de la zero și proiectate pentru sarcini cu generări lungi. Nemotron‑H‑56B a fost antrenat pe 20 de trilioane de tokenuri în FP8 — unul dintre cele mai mari experimente publice de pre-antrenament FP8. Nemotron‑H‑47B a fost obținut prin comprimarea modelului 56B prin metoda MiniPuzzle (63 de miliarde de tokenuri de distilare) și încape în memoria unui singur RTX 5090 (FP4) cu un context de ~1M tokenuri.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Sursă: arXiv:2504.03624.[12]
La generarea cu 65 536 tokenuri de intrare și 1024 tokenuri de ieșire pe H100, modelul Nemotron‑H‑47B funcționa de 2,9 ori mai rapid decât Qwen‑2.5‑72B și Llama‑3.1‑70B.[12]
Nemotron Nano 2 (august 2025)
Model hibrid Mamba‑Transformer pentru raționament. Nemotron‑Nano‑12B‑v2‑Base — modelul părinte cu 62 de straturi (preponderent Mamba‑2 + MLP + 4 straturi de atenție), antrenat pe 20 de trilioane de tokenuri în FP8 de la zero. Din acesta, prin metoda Minitron extinsă, a fost obținut Nemotron‑Nano‑9B‑v2, capabil să funcționeze în context de 128K tokenuri pe un singur GPU NVIDIA A10G (22 GB, BF16). Post-antrenament: SFT (80 de miliarde de tokenuri, inclusiv trasee DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Pe benchmark-urile de raționament, modelul este comparabil cu Qwen3‑8B ca precizie, dar atinge o accelerare de 3–6 ori la generarea de secvențe lungi de ieșire.[13]
Nemotron 3 Nano 30B‑A3B
Lansat în decembrie 2025. Parametri: 31,6 miliarde total, 3,2 miliarde activi. Arhitectură: 52 de straturi, dimensiune ascunsă 2688, dimensiune expert 1856, dimensiune stare Mamba 128. MoE: 128 experți rutați + 1 comun, 6 activi pe token. Context — până la 1 048 576 tokenuri. Antrenament pe 25 de trilioane de tokenuri (planificare WSD, batch size 3072, data de referință a datelor — iunie 2025) în două faze: Faza 1 — 23,5 trilioane (date diverse), Faza 2 — 1,5 trilioane (date de înaltă calitate) + 121 de miliarde de tokenuri long‑context CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — valori din surse secundare; condițiile de reproducere — NeMo Evaluator SDK. Sursă: arXiv:2512.20848.[2][28]
Debitul (intrare 8K / ieșire 16K, single H200): de 3,3 ori mai mare decât Qwen3‑30B‑A3B‑Thinking și de 2,2 ori mai mare decât GPT‑OSS‑20B.[2]
Modele și direcții suplimentare
- OpenReasoning‑Nemotron (iulie 2025) — serie de modele de la 1,5B la 32B parametri, bazate pe Qwen 2.5 și fine-tuned pe datele DeepSeek‑R1‑0528. Varianta 32B cu GenSelect@64 depășește o3 (high) pe o serie de benchmark-uri matematice.[29]
- Nemotron Elastic (arXiv:2511.16664) — cadru de submodele imbricate (6B, 9B, 12B) în cadrul unui singur model părinte, reducând costul antrenamentului de 360 de ori față de antrenamentul de la zero.[30]
- Nemotron‑CrossThink — cadru de antrenament cu reinforcement learning multi-domeniu dincolo de sarcinile matematice, asigurând +30,1 % pe MATH‑500 și +12,8 % pe MMLU‑PRO.[31]
- Nemotron‑UltraLong — extinderea contextului până la 4 milioane de tokenuri.[32]
- Jet‑Nemotron — NAS de post-antrenament pentru modele hibride compacte de 2B/4B.[33]
Modele specializate
În ecosistemul Nemotron sunt prezente și modele pentru sarcini specializate:
- Nemotron Nano V2 VL — model vision‑language pentru OCR, procesarea tabelelor și video.[34]
- Nemotron Parse 1.1 — model pentru OCR și extragerea structurii documentelor.[35]
- Nemotron ColEmbed V2 — model de embedding pentru căutare vizuală în documente (late interaction).[36]
- Nemotron Speech — modele pentru recunoașterea automată a vorbirii (ASR), sinteză vocală (TTS) și traducere automată (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — model de clasificare a conținutului nesigur pe 23 de categorii în 9 limbi, cu o precizie de 84,2 %.[37]
Date pentru pre-antrenament
Compoziția datelor Nemotron‑4
Corpusul de pre-antrenament al Nemotron‑4 15B și 340B este alcătuit din trei categorii principale: texte în engleză (70 %), texte multilingve în 53 de limbi (15 %) și cod sursă în 43 de limbaje de programare (15 %). S-a aplicat deduplicare la nivel de document (exact și near‑duplicate), precum și filtrare cu ajutorul modelelor lingvistice și euristicilor. Modelul 15B a fost antrenat pe 8 trilioane de tokenuri, modelul 340B — pe 9 trilioane (8 trilioane pre-antrenament + 1 trilion antrenament continuat cu reponderarea surselor de înaltă calitate).[8][3]
Nemotron‑CC
Setul de date Nemotron‑CC a fost format din Common Crawl folosind un ansamblu de clasificatoare de calitate și reformulare sintetică a textelor. Volumul total — 6,3 trilioane de tokenuri (4,4 trilioane deduplicate + 1,9 trilioane reformulări sintetice). Pipeline-ul este integrat în instrumentul NeMo Curator. Lucrarea a fost acceptată ca Long Paper la conferința ACL 2025.[38]
Nemotron‑CC‑Math
Subset orientat spre matematică cu un volum de 133 de miliarde de tokenuri, extras din Common Crawl cu ajutorul pipeline-ului Lynx + LLM, cu păstrarea structurii formulelor matematice și a codului în LaTeX.[39]
Datele Nemotron 3 Nano
Pre-antrenamentul Nemotron 3 Nano a fost realizat pe 25 de trilioane de tokenuri. Setul include: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 și dataset-uri specializate STEM. Pentru antrenamentul cu context lung au fost utilizate suplimentar 121 de miliarde de tokenuri CPT.[2]
Nemotron Pretraining Dataset v1
Set generat sintetic, acoperind STEM, texte academice, sarcini de raționament și domenii multilingve; conține peste 10 trilioane de tokenuri lingvistice și 18 milioane de exemple pentru SFT. Toate seturile de date sunt distribuite sub licențe deschise permisive.[40]
Pipeline de generare sintetică de date (SDG)
Pipeline-ul descris în raportul despre Nemotron‑4 340B include următoarele etape[3]:
- Generarea prompturilor: cereri sintetice cu unul sau două tururi, generate cu ajutorul Mixtral‑8x7B‑Instruct‑v0.1 (licența Apache 2.0) după șabloane Open QA, Writing, Closed QA, Math & Coding.
- Generarea răspunsurilor: răspunsuri multiple de la versiunile intermediare ale modelelor pentru asigurarea diversității.
- Evaluarea calității: trei abordări — Ground‑Truth‑as‑a‑Judge (pentru sarcini cu răspuns verificabil), LLM‑as‑Judge (compararea perechilor de răspunsuri de către modelul lingvistic), Reward‑Model‑as‑Judge (utilizarea Nemotron‑4‑340B‑Reward).
- Alinierea iterativă de la modele slabe la modele puternice (weak‑to‑strong).
Din ~20 000 de exemple adnotate de oameni (10 000 pentru SFT, 10 000 HelpSteer2 pentru modelul de recompensă) a fost sintetizat întregul volum restant de date de aliniere.[3]
Cuantizare și optimizarea inferenței
Modelele Nemotron 3 Nano suportă Post‑Training Quantization (PTQ) în FP8 folosind ModelOpt și Megatron‑LM. Se aplică cuantizare selectivă — straturile de atenție și o parte din Mamba sunt păstrate în BF16 pentru menținerea calității; restul sunt cuantizate în FP8. Conform raportului tehnic, aceasta asigură ~99 % din precizia originală.[2] Nano suportă de asemenea inferența în format NVFP4.[1]
Tabel sumar de benchmark-uri pe generații
| Model | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Condiții |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64,2 % | 46,0 % | 31,6 % | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81,1 % | — | 57,3 % | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78,7 % | 92,3 % | 73,2 % | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | oct. 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0 %, AIME 80,8 % |
| Nemotron‑H‑47B | 83,6 % | 93,3 % | 61,0 % | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1 %, LCB 68,3 % |
Comparația trebuie interpretată cu prudență: condițiile de evaluare, versiunile benchmark-urilor și datele testelor diferă între generații. Rezultatele sunt preluate din rapoartele tehnice NVIDIA; evaluările independente pot diferi (a se vedea secțiunea „Limitări").[8][3][9][11][12][2]
Aplicații
Implementare prin NVIDIA NIM
NVIDIA NIM — set de microservicii containerizate optimizate pentru inferență cu API compatibil OpenAI. Modelele Nemotron sunt disponibile ca microservicii NIM pe platforma build.nvidia.com. NIM suportă formatele FP8, BF16, NVFP4 și implementarea prin diagrame Helm pe Kubernetes. Modelele sunt compatibile și cu cadre independente: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Generarea sintetică de date
Nemotron‑4 340B este proiectat pentru utilizare ca generator de date sintetice: modelul Instruct generează răspunsuri, iar modelul Reward le evaluează și filtrează. Licența NVIDIA Open Model License permite explicit utilizarea ieșirilor modelului pentru antrenarea altor modele. Conform datelor ServiceNow, 15 % din datele de pre-antrenament ale modelului lor Apriel 1.6 provin din seturile de date Nemotron.[3][15][41]
Sisteme agentice
Modelele din familia Nemotron 3 (Nano, Super, Ultra) sunt destinate sarcinilor multi-agent: planificare, retrieval, apelarea instrumentelor (tool use). Nemotron 3 Nano demonstrează un rezultat de 38,76 % pe SWE‑Bench (cu OpenHands) și 49,04 % (medie) pe TauBench V2.[2]
Implementări corporative
Printre partenerii declarați: ServiceNow (modelul comun Apriel Nemotron 15B pentru automatizarea fluxurilor de lucru), CrowdStrike (platforma Charlotte AI), Perplexity (rutarea cererilor), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modelele sunt disponibile pe AWS Amazon Bedrock; este planificată compatibilitatea cu Google Cloud, CoreWeave, Nebius.[15]
Limitări și probleme deschise
Evaluări independente și discrepanțe față de datele NVIDIA
Evaluările independente evidențiază discrepanțe față de rezultatele prezentate de NVIDIA. Conform datelor Artificial Analysis (februarie 2026), Llama‑Nemotron‑Ultra 253B (reasoning) a primit un Intelligence Index de 15, față de mediana de 26 pentru modelele de dimensiuni comparabile. Pe platforma Chatbot Arena (LMArena), modelele Nemotron ocupă poziții în mijlocul clasamentului: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~poziția 147), Nemotron 3 Nano — 1317 ±6 (~poziția 164).[42][43]
Verbozitate
Modelele Nemotron demonstrează o verbozitate crescută: la evaluarea Artificial Analysis, modelul Nemotron 3 Nano a generat 140 de milioane de tokenuri (față de mediana de 12 milioane pentru alte modele), ceea ce crește costul inferenței. Analiza DEV Community a evidențiat că Llama‑3.1‑Nemotron‑70B‑Instruct, deși lider formal pe benchmark-urile automate, demonstra o precizie insuficientă în unele sarcini practice, iar scorurile ridicate pe benchmark-urile de tip Arena puteau fi explicate prin preferința pentru răspunsuri verbioase și sigure, dar nu neapărat precise.[42][44]
Halucinații și bias
NVIDIA precizează în fișele modelelor că acestea pot „amplifica prejudecățile și genera răspunsuri toxice, în special la prompturi toxice", precum și „produce informații inexacte, omițând detalii cheie". Deschiderea ponderilor și a datelor permite auditul extern.[11][13]
Cerințe computaționale
Modelele dense (Nemotron‑4 340B) necesită un cluster de 768 de noduri DGX H100 pentru antrenamentul complet, ceea ce limitează reproductibilitatea pentru grupurile academice fără acces la o infrastructură similară. Contextul lung (1M) la inferență necesită o cantitate semnificativă de VRAM.[3][2]
Degradarea la extinderea contextului
La extinderea contextului la secvențe extrem de lungi, s-a observat o degradare a rezultatelor pe benchmark-urile cu context scurt.[32]
Cuantizarea arhitecturilor hibride
Utilizarea preciziei ultra-reduse (FP8/NVFP4) în arhitecturile Mamba‑Transformer duce la o ușoară scădere a preciziei (~1 % pe unele benchmark-uri). Această problemă este rezolvată prin cuantizarea selectivă, ceea ce complică arhitectura compilatoarelor și a serverelor de inferență.[2][1]
Alte probleme deschise
- Dependența de benchmark-uri cu posibilă contaminare a datelor de antrenament.
- Absența protocoalelor standardizate de comparare a arhitecturilor hibride SSM‑Transformer cu modelele Transformer pure.
- Problema scalabilității abordării MoE pentru sarcini care necesită raționament profund cu un număr mic de experți activi pe token.
- Datele despre Super/Ultra la momentul decembrie 2025 sunt preliminare; benchmark-urile complete sunt așteptate după lansare.[1]
Aspecte etice și de reglementare
Securitate în etapa de dezvoltare
În etapa de dezvoltare se aplică: evaluarea conform cadrului AEGIS (13 categorii de securitate a conținutului), scanerul de vulnerabilități garak, testarea manuală „red‑teaming".[37]
Securitate în etapa de inferență
NeMo Guardrails — set de instrumente deschis (licența Apache 2.0), care adaugă bariere programabile la sistemele LLM. Microserviciul interceptează intrările și ieșirile, aplicând verificări configurabile: controlul subiectului, detectarea PII, verificarea „ancorării" RAG, detectarea atacurilor de tip jailbreak (inclusiv protecție împotriva injecțiilor de cod bazată pe YARA), clasificare multilingvă și multimodală de securitate.[45]
Pentru Nemotron 3 a fost publicat un set de ~11 000 de trasee OpenTelemetry adnotate din scenarii realiste cu utilizarea instrumentelor, destinate evaluării securității agentice.[1]
Licențiere
| Modele | Licență |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (moștenită de la Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License permite utilizarea comercială, crearea și distribuirea de lucrări derivate, nu impune cerința de atribuire (cu păstrarea fișierului NOTICE), nu impune restricții privind numărul de utilizatori și permite explicit utilizarea ieșirilor modelului pentru antrenarea altor modele.[46] Modelele bazate pe Llama moștenesc restricțiile Meta, inclusiv pragul de 700 de milioane de utilizatori activi lunar.[11]
Pentru Nemotron 3 Nano, NVIDIA a publicat: ponderile modelului, peste 10 trilioane de tokenuri de date de antrenament, rețete de antrenament, baze de cod (NeMo, Megatron‑LM, NeMo‑Aligner), peste 10 medii de antrenament cu reinforcement learning cu 900 000+ sarcini.[1][2]
Perspective și direcții de cercetare
Lansările apropiate includ Nemotron 3 Super (~100 de miliarde de parametri, ~10 miliarde activi) și Nemotron 3 Ultra (~500 de miliarde, ~50 de miliarde active), așteptate în prima jumătate a anului 2026. Ambele modele vor utiliza LatentMoE, MTP și antrenament în format NVFP4 pe arhitectura Blackwell.[1]
Direcția strategică a NVIDIA — poziționarea Nemotron nu ca un model singular, ci ca un strat de infrastructură pentru sistemele multi-agent, unde diferite modele din familie sunt utilizate pentru sarcini diferite cu rutare după complexitate.[1][15]
Principalele direcții de cercetare:
- Dezvoltarea arhitecturilor hibride — integrarea ulterioară a straturilor SSM cu mecanismul de atenție pentru context lung scalabil.[12]
- Metode multi-nivel de compresie — dezvoltarea Minitron, Puzzle, MiniPuzzle și Nemotron Elastic.[20][21][30]
- Antrenament cu reinforcement learning multi-domeniu — Nemotron‑CrossThink pentru extinderea RL dincolo de sarcinile matematice.[31]
- Extinderea contextului — Nemotron‑UltraLong până la 4 milioane de tokenuri.[32]
- Multimodalitate — extindere în domeniul vision‑language (Nemotron VL), voce (Nemotron Speech), căutare vizuală în documente (Nemotron ColEmbed V2).[34][35][36]
- Modele hibride compacte — Jet‑Nemotron (NAS pentru modele de 2B/4B).[33]
- Rețete deschise — publicarea rețetelor complete de antrenament și a datelor pentru reproducere și personalizare de către comunitate.[14]
Vezi și
- Arhitectura Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (familia de modele Meta)
Referințe
- NVIDIA Research — pagina Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — documentație Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Literatură
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, februarie 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, iunie 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, iunie 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, iulie 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, noiembrie 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, ianuarie 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, aprilie 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, mai 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, august 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, august 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, noiembrie 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, decembrie 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, decembrie 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/