Nemotron (NVIDIA) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — rodzina dużych modeli językowych (Large Language Model, LLM) z otwartymi wagami, opracowana przez oddział Applied Deep Learning Research (ADLR) korporacji NVIDIA. Modele należą do dziedziny uczenia maszynowego i przetwarzania języka naturalnego (Natural Language Processing, NLP) i przeznaczone są do szerokiego zakresu zadań: syntetycznego generowania danych, wnioskowania (reasoning), aplikacji agentowych (agentic AI) oraz wdrożeń na przemysłowym sprzęcie NVIDIA. Rodzina łączy modele różnych architektur i rozmiarów: od 4 mld do ~500 mld parametrów, w tym gęste (dense) decoder‑only modele Transformer serii Nemotron‑4 (2024), hybrydowe modele Mamba‑Transformer (Nemotron‑H, 2025) oraz hybrydowe modele Mamba‑Transformer z Mixture-of-Experts (MoE) w serii Nemotron 3 (2025). Na dzień marca 2026 roku rodzina liczy ponad 20 modeli, obejmujących zadania generowania tekstu, wnioskowania, wizualnego rozumienia dokumentów, ekstrakcji informacji oraz oceny jakości odpowiedzi. Modele udostępniane są przede wszystkim z otwartymi wagami na licencjach NVIDIA Open Model License i Llama Community License.[1][2][3]

Historia i geneza

Rozwój rodziny Nemotron prowadzony jest w ramach strategii NVIDIA dotyczącej tworzenia pełnego stosu narzędzi dla generatywnej sztucznej inteligencji: od infrastruktury treningowej (DGX, superkomputery oparte na GPU H100/B200) po platformy uczenia (NeMo Framework), wyrównywania (NeMo‑Aligner), wdrożeń (NIM — NVIDIA Inference Microservices) i bezpieczeństwa (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

Pierwszy publicznie dostępny model serii — dekodujący Transformer z 8 mld parametrów i kontekstem 4096 tokenów, wytrenowany na 3,8 bln tokenów w 53 językach naturalnych i 37 językach programowania. Trening przeprowadzono na 1024 GPU A100 przez 19 dni. Formalny raport techniczny na arXiv nie został opublikowany. Model był dystrybuowany przez NeMo Framework i Hugging Face; dostępne były warianty Chat (SFT i SteerLM). Licencja — NVIDIA AI Foundation Models Community License.[6][7]

Uwaga dotycząca nazw: „Nemotron‑3" z 2023 roku i „Nemotron 3" z grudnia 2025 roku to różne modele. Pierwszy był wczesnym prototypem, drugi stanowi aktualne pokolenie z architekturą MoE.

Nemotron‑4 15B (luty 2024)

Pierwsze publicznie udokumentowane wydanie serii Nemotron‑4 — model z 15 miliardami parametrów, wytrenowany na 8 bilionach tokenów przez ~13 dni kalendarzowych na 384 węzłach DGX H100 (do 3072 GPU). Zastosowano 8‑krotny paralelizm tensorowy i paralelizm danych od 96 do 288. Szczytowy MFU (Model FLOPs Utilization) wyniósł 34,3 % przy batch size 384. Architektura — decoder‑only Transformer z Grouped‑Query Attention (GQA) i Rotary Position Embeddings (RoPE). Według wyników benchmarków w momencie publikacji model przewyższał wszystkie porównywalne rozmiarowo modele otwarte w zadaniach wielojęzycznych, w tym szereg modeli czterokrotnie od niego większych.[8]

Nemotron‑4 340B (czerwiec 2024)

W czerwcu 2024 roku wydano największy model serii Nemotron‑4 — 340 miliardów parametrów (331,6 mld parametrów nie‑embeddingowych), wstępnie wytrenowany na 9 bilionach tokenów (8 bln pre-trening + 1 bln kontynuowane uczenie z przeważaniem wysokiej jakości źródeł). Trening odbywał się na 768 węzłach DGX H100 (do 6144 GPU) ze szczytowym MFU 42,4 %, od grudnia 2023 do maja 2024 roku. Rodzina obejmuje trzy warianty: Base, Instruct i Reward. Rozmiar modelu dobrano tak, aby mieścił się na jednym węźle DGX H100 (8 GPU) przy wdrożeniu w formacie precyzji FP8. Ponad 98 % danych użytych podczas wyrównywania (alignment) zostało wygenerowanych syntetycznie przez same modele serii w procesie iteracyjnym; pipeline syntetycznego generowania danych jest otwarty do odtworzenia.[3]

Llama‑3.1‑Nemotron‑70B (październik 2024)

W październiku 2024 roku wydano modele dostrojone z Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct i Llama‑3.1‑Nemotron‑70B‑Reward. Na dzień 1 października 2024 roku model Instruct zajmował 1. miejsce jednocześnie na trzech automatycznych benchmarkach: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Model Reward osiągnął 94,1 % na RewardBench.[9][10]

Przejście do architektur hybrydowych (2025)

W 2025 roku seria rozszerzyła się o architektury hybrydowe łączące warstwy Mamba‑2 (State Space Model, SSM — model przestrzeni stanów) i Transformer. W okresie marzec–maj 2025 roku wydano rodzinę modeli wnioskujących Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) z przełączalnym trybem wnioskowania.[11] W kwietniu 2025 roku opublikowano Nemotron‑H (arXiv:2504.03624) — rodzinę hybrydowych modeli Mamba‑Transformer o rozmiarach 8B, 56B i 47B parametrów.[12] W sierpniu 2025 roku przedstawiono Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]

Nemotron 3 (grudzień 2025)

15 grudnia 2025 roku ogłoszono trzecią generację — rodzinę Nemotron 3 z modelami Nano, Super i Ultra, łączącą architektury Mamba‑2, Transformer i MoE z oknem kontekstowym do 1 mln tokenów. Nano wydano wraz z raportem technicznym; Super i Ultra zaplanowano na pierwszą połowę 2026 roku.[1][2][14][15]

Podstawy teoretyczne

Architektura Transformer w Nemotron‑4

Modele serii Nemotron‑4 zbudowane są na standardowej architekturze dekodującego Transformera z kauzalną uwagą. Prawdopodobieństwo sekwencji tokenów x1,x2,,xT faktoryzuje się jako:

p(x1,,xT)=t=1Tp(xtx1,,xt1;heta),

gdzie heta — parametry modelu.[8]

Mechanizm uwagi zaimplementowany jest w wariancie Grouped‑Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKopdk)V,

gdzie Q,K,V — macierze zapytań, kluczy i wartości; dk — wymiarowość głowicy uwagi.

Do kodowania pozycji stosuje się Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmheta1xm(2)sinmheta1xm(1)sinmheta1+xm(2)cosmheta1),

gdzie xm — wektor na pozycji m, hetai=100002i/d, d — wymiarowość wektora.

W warstwach MLP używana jest aktywacja Squared ReLU: f(x)=(max(0,x))2, zapewniająca rzadkość aktywacji. Modele nie zawierają przesunięć (bias), nie stosują dropout, a macierze embeddingów wejścia i wyjścia nie są ze sobą powiązane (untied embeddings). Tokenizer — SentencePiece BPE z zachowaniem spacji, znakowym podziałem cyfr i bajt‑poziomowym fallback, rozmiar słownika — 256 000.[8][3]

Parametry architektoniczne Nemotron‑4
Parametr Nemotron‑4 15B Nemotron‑4 340B
Liczba parametrów 15 mld (3,2 mld embed.) 340 mld (9,4 mld embed.)
Liczba warstw 32 96
Ukryty wymiar 6144 18 432
Głowice uwagi 48 96
Głowice KV (GQA) 8 8
Długość kontekstu 4096 4096
Rozmiar słownika 256 000 256 000

Źródła: arXiv:2402.16819, arXiv:2406.11704.[8][3]

Hybrydowa architektura Mamba‑Transformer (Nemotron‑H)

W modelach Nemotron‑H standardowe bloki samouwagi częściowo zastąpiono blokami Mamba‑2 — modelami przestrzeni stanów (State Space Models, SSM). Podczas autoregresyjnej generacji każda warstwa samouwagi wymaga O(n) operacji i pamięci na krok (z powodu pamięci podręcznej KV), podczas gdy warstwy Mamba zapewniają stały koszt pamięci i obliczeń na każdy generowany token.[12]

Mamba‑2 opisywane jest rekurencyjną zależnością[18]:

ht=Aht1+Bxt,yt=Cht,

gdzie htN — stan ukryty, ANimesN — diagonalna macierz przejść stanów, BNimes1 i C1imesN — macierze projekcji, xt — wejściowy token, yt — sygnał wyjściowy. W Mamba‑2 macierze A, B, C zależą od wejścia (input‑dependent), co odróżnia model od klasycznych liniowych SSM.

W Nemotron‑H‑56B stosuje się 54 warstwy Mamba‑2 + 54 warstwy MLP + 10 warstw samouwagi, przy czym warstwy uwagi rozmieszczone są równomiernie wśród warstw Mamba. Model wytrenowano na 20 bln tokenów w formacie FP8 (skalowanie per‑tensor) na 6144 GPU H100. Wersja Nemotron‑H‑8B zawiera 24 warstwy Mamba‑2, 24 warstwy MLP i 4 warstwy samouwagi; trening przeprowadzono na 15 bln tokenów.[12]

Architektura MoE w Nemotron 3

Modele Nemotron 3 (grudzień 2025) łączą trzy komponenty architektoniczne: Mamba‑2, Transformer i Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) zawiera 52 warstwy: 23 warstwy Mamba‑2 + MoE, 23 warstwy MoE i 6 warstw uwagi GQA. Każda warstwa MoE obejmuje 128 routowanych (routed) ekspertów + 1 wspólny (shared) ekspert, z których 6 ekspertów aktywowanych jest na każdy token. Routing realizowany jest przez uczony router MLP z sigmoid gating. Równoważenie obciążenia zaimplementowano bez pomocniczej funkcji straty (aux‑loss‑free). Całkowita liczba parametrów wynosi 31,6 mld, lecz aktywnych na każdy token jest jedynie 3,2 mld.[2]

Normalizacja — RMSNorm[19]. Embeddingi pozycyjne w częściach Mamba są nieobecne (informacja pozycyjna jest implicite w stanie SSM). Stosuje się niezwiązane embeddingi, brak dropout i bias w warstwach liniowych.[2]

Rozszerzenia w Super/Ultra: LatentMoE i Multi‑Token Prediction

Modele Super i Ultra z rodziny Nemotron 3 stosują dwie dodatkowe innowacje architektoniczne:

  • Latent MoE (LatentMoE) — projekcja reprezentacji wejściowej do latentnej przestrzeni o mniejszym wymiarze przed routingiem, co pozwala zwiększyć liczbę ekspertów przy porównywalnych kosztach obliczeniowych i poprawić dokładność bez zmniejszania przepustowości.[1]
  • Multi‑Token Prediction (MTP) — jednoczesne przewidywanie kilku następnych tokenów, stosowane w celu poprawy jakości długich tekstów i spekulatywnego dekodowania podczas inferencji.[1]

Trening modeli Super i Ultra prowadzony jest w formacie NVFP4 — 4‑bitowym formacie liczbowym NVIDIA na architekturze Blackwell.[1]

Metody kompresji modeli: Minitron, Puzzle, MiniPuzzle

Do tworzenia kompaktowych modeli NVIDIA stosuje kilka podejść:

  • Minitron — metoda strukturalnego przycinania (pruning) i destylacji wiedzy (knowledge distillation). Badane są dwa rodzaje przycinania: według głębokości (usuwanie warstw) i według szerokości (jednoczesne zmniejszanie wymiarów ukrytych warstw, głowic uwagi i projekcji MLP). Zastosowanie Minitron do Nemotron‑4 15B pozwala uzyskać modele 8B i 4B z redukcją kosztów treningu do 40 razy w porównaniu z treningiem od zera.[20]
  • Puzzle — algorytm Neural Architecture Search (NAS), który dobiera optymalną konfigurację każdego bloku (liczba głowic KV, rozmiar FFN, obecność/brak uwagi) z warstwową destylacją. W ten właśnie sposób Llama 3.1 405B skompresowano do 253B (Llama‑Nemotron Ultra), a Llama 3.3 70B — do 49B (Llama‑Nemotron Super).[21]
  • MiniPuzzle — rozszerzenie Puzzle dla architektur hybrydowych, które skompresowało Nemotron‑H‑56B do 47B przy nakładzie jedynie 63 mld tokenów destylacji. Przy zbliżonej dokładności skompresowany model generuje o 20 % szybciej.[12]

Metody wyrównywania

HelpSteer i HelpSteer2

HelpSteer — zbiór 37 120 przykładów (licencja CC‑BY‑4.0), stworzony we współpracy ze Scale AI, w którym każda odpowiedź jest opatrzona adnotacją według pięciu atrybutów: użyteczności (helpfulness), poprawności (correctness), spójności (coherence), złożoności (complexity) i rozwlekłości (verbosity) w skali Likerta 0–4.[22]

HelpSteer2 — zaktualizowany zbiór 21 362 przykładów (10 681 promptów × 2 odpowiedzi), gdzie ponad 95 % promptów pochodzi z ShareGPT (rzeczywiste zapytania użytkowników). Około 50 % adnotacji zostało odfiltrowanych jako niewystarczająco wysokiej jakości. Rozszerzenie HelpSteer2‑Preference dodaje parowe preferencje adnotatorów, umożliwiając trenowanie zarówno regresyjnych, jak i parowych modeli nagród na tych samych danych.[23][24]

SteerLM

SteerLM — metoda SFT (Supervised Fine‑Tuning — uczenie nadzorowane) z warunkowaniem na atrybuty (helpfulness, correctness, coherence, complexity, verbosity), pozwalająca użytkownikowi sterować stylem odpowiedzi podczas inferencji. Potok obejmuje: (1) trening modelu predykcji atrybutów (APM) na HelpSteer, (2) adnotację danych za pomocą APM, (3) SFT z warunkowaniem na docelowe wartości atrybutów, (4) bootstrapping.[25]

DPO i RPO

DPO (Direct Preference Optimization) — metoda bezpośredniej optymalizacji preferencji bez jawnego modelu nagrody, stosowana w potokach Nemotron‑4 340B Instruct i Nemotron Nano 2.[26]

RPO (Reward‑aware Preference Optimization) — ujednolicony matematyczny framework NVIDIA uogólniający DPO, IPO, SimPO, REINFORCE i SteerLM 2.0 jako przypadki szczególne. RPO minimalizuje odległość między predykcjami niejawnego modelu nagrody a docelowym jawnym modelem[27]:

extRPO(heta)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπheta(yw|x)πextref(yw|x)βlogπheta(yl|x)πextref(yl|x))],

gdzie rϕ — jawny model nagrody, πheta — uczona polityka, πextref — polityka referencyjna, d(,) — funkcja odległości, yw/yl — odpowiedź preferowana/odrzucona. RPO stosowane jest podczas treningu Nemotron‑4 340B Instruct i modeli Llama‑Nemotron.[27][3][11]

Wielośrodowiskowe uczenie ze wzmocnieniem (RLVR)

W Nemotron 3 stosowane jest Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — jednoczesny trening w wielu środowiskach w ramach NeMo Gym: matematyka konkursowa, programowanie, QA, tool‑use, instruction‑following, long‑context. Algorytm — GRPO (Group Relative Policy Optimization) z masked importance sampling.[2][14]

Nemotron 3 wspiera granularne sterowanie budżetem wnioskowania (reasoning budget control): użytkownik może ustawić limit tokenów dla thinking trace poprzez flagę w szablonie chat (przełączenie „detailed thinking on/off" lub ograniczenie długości).[2]

Linia modeli

Tabela zbiorcza

Model Rok Łączna / Aktywna liczba parametrów Kontekst Architektura Kluczowe cechy
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3,8B tokenów; 1024 GPU A100; 19 dni
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8B tokenów; MFU 34,3 %
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9B tokenów; Base/Instruct/Reward; >98 % syntetycznych danych alignment
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94,1 %
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) Kompresja NAS z Llama 3.1 8B
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) Z Llama 3.3 70B
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) Z Llama 3.1 405B; GPQA 76,0 %
Nemotron‑H 8B 2025 8B / 8B Hybryda Mamba‑Transformer 15B tokenów; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B Hybryda Mamba‑Transformer 20B tokenów FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) Hybryda Mamba‑Transformer MiniPuzzle z 56B; +20 % prędkości
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K Hybryda Mamba‑Transformer 20B tokenów; destylacja Minitron
Nemotron 3 Nano 2025 31,6B / 3,2B 1M Hybryda Mamba‑Transformer MoE 25B tokenów; 128 ekspertów, 6 aktywnych
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M Hybryda LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M Hybryda LatentMoE MTP; NVFP4

Nemotron‑4 15B

Architektura: 32 warstwy, hidden dimension 6144, 48 głowic uwagi, 8 głowic KV (GQA). Łączna liczba parametrów — 15 mld (3,2 mld embedding + 12,5 mld non‑embedding). Wyniki: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). Na wielojęzycznych benchmarkach (XCOPA, TyDiQA‑GoldP, MGSM) model przewyższał modele czterokrotnie większe.[8]

Nemotron‑4 340B

Architektura: 96 warstw, hidden dimension 18 432, 96 głowic uwagi, 8 głowic KV.

Nemotron‑4 340B Base osiągnął: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]

Nemotron‑4 340B Instruct przeszedł wieloetapowe wyrównywanie: Code SFT → General SFT → DPO → RPO (3 rundy). Wyniki: MT‑Bench — 8,22 (sędzia GPT‑4‑Turbo), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]

Nemotron‑4 340B Reward zastępuje końcową warstwę softmax liniową projekcją stanu ukrytego ostatniej warstwy do wektora 5 atrybutów HelpSteer2. Końcowa nagroda to ważona suma pięciu atrybutów. Trening przeprowadzono przez 2 epoki na danych HelpSteer2 (batch size 128). Na RewardBench model osiągnął 92,0 %, przewyższając GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) i Claude‑3‑Opus (80,7 %) w momencie publikacji.[3]

Model Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54,2 41,5 % 8,22
Llama‑3‑70B‑Instruct 41,1 34,4 % 8,16
Mixtral‑8x22B‑Instruct 36,4 30,9 % 7,63
Qwen‑2‑72B‑Instruct 48,1 38,8 % 8,26

Źródło: arXiv:2406.11704, tabela 5.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward wytrenowany jest metodą hybrydową łączącą Bradley‑Terry (parowe preferencje) i regresję SteerLM (wieloatrybutowa ocena w skali Likerta). Trening przeprowadzono wyłącznie na danych HelpSteer2 (CC‑BY‑4.0). Na RewardBench model osiągnął 94,1 %, zajmując 1. miejsce w momencie publikacji.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct wyrównany jest metodą RLHF z algorytmem REINFORCE (nie PPO) i modelem nagrody Nemotron‑70B‑Reward. Infrastruktura — NeMo‑Aligner z akceleracją TRT‑LLM.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

Rodzina modeli wnioskujących, uzyskanych z Llama 3.x metodami NAS, destylacji i rozszerzonego post-treningu.[11]

Model Parametry Model bazowy Kontekst
Llama‑Nemotron‑Nano 8B 8 mld Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 mld Minitron 4B (z Llama 3.1 8B) 128K
Llama‑Nemotron‑Super 49B 49 mld Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 mld Llama‑3.1‑405B → NAS (Puzzle) 128K

Pięcioetapowy potok treningowy: (1) NAS + FFN Fusion, (2) destylacja + kontynuowane pre-trenowanie, (3) SFT (w tym ślady wnioskowania DeepSeek‑R1), (4) rozbudowane RL (GRPO dla Ultra, REINFORCE/RLOO + Online RPO dla Nano), (5) wyrównywanie do dialogu.[11]

Modele jako pierwsze spośród otwartych LLM wspierają przełączalny tryb wnioskowania (reasoning toggle): przy włączeniu („detailed thinking on" w systemowym promptcie) model generuje łańcuch rozumowania w tagach <think>...</think> przed odpowiedzią; przy wyłączeniu — odpowiada bezpośrednio.[11]

Wyniki Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Dla porównania: DeepSeek‑R1 (671B łącznie / 37B aktywnych) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra mieści się na jednym węźle 8×H100.[11]

Nemotron‑H (kwiecień 2025)

Rodzina gęstych modeli hybrydowych, trenowanych od zera i zaprojektowanych do zadań z długimi generacjami. Nemotron‑H‑56B wytrenowany na 20 bln tokenów w FP8 — jeden z największych publicznych eksperymentów pre-trenowania w FP8. Nemotron‑H‑47B uzyskano przez kompresję 56B metodą MiniPuzzle (63 mld tokenów destylacji) i mieści się w pamięci jednej RTX 5090 (FP4) przy kontekście ~1M tokenów.[12]

Benchmark Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60,5 61,8 58,8 51,3
MMLU (5‑shot) 84,2 83,6 86,1 78,8
GSM8K (8‑shot CoT) 93,7 93,3 90,9 83,9
HumanEval (0‑shot) 60,4 61,0 56,7 57,3

Źródło: arXiv:2504.03624.[12]

Przy generacji z 65 536 tokenami wejściowymi i 1024 tokenami wyjściowymi na H100 model Nemotron‑H‑47B działał 2,9 razy szybciej niż Qwen‑2.5‑72B i Llama‑3.1‑70B.[12]

Nemotron Nano 2 (sierpień 2025)

Hybrydowy model Mamba‑Transformer do wnioskowania. Nemotron‑Nano‑12B‑v2‑Base — model nadrzędny z 62 warstwami (przeważnie Mamba‑2 + MLP + 4 warstwy uwagi), wytrenowany na 20 bln tokenów w FP8 od zera. Z niego metodą rozszerzonego Minitron uzyskano Nemotron‑Nano‑9B‑v2, zdolny do pracy w kontekście 128K tokenów na jednym GPU NVIDIA A10G (22 GB, BF16). Post-trening: SFT (80 mld tokenów, w tym ślady DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Na benchmarkach wnioskowania model jest porównywalny z Qwen3‑8B pod względem dokładności, ale osiąga 3–6‑krotne przyspieszenie generacji przy długich sekwencjach wyjściowych.[13]

Nemotron 3 Nano 30B‑A3B

Wydany w grudniu 2025 roku. Parametry: 31,6 mld łącznie, 3,2 mld aktywnych. Architektura: 52 warstwy, hidden dimension 2688, wymiar eksperta 1856, wymiar stanu Mamba 128. MoE: 128 routowanych ekspertów + 1 wspólny, 6 aktywnych na token. Kontekst — do 1 048 576 tokenów. Trening na 25 bln tokenów (harmonogram WSD, batch size 3072, odcięcie danych — czerwiec 2025) w dwóch fazach: Faza 1 — 23,5 bln (zróżnicowane dane), Faza 2 — 1,5 bln (wysokiej jakości dane) + 121 mld tokenów long‑context CPT.[2]

Benchmark Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78,30 80,9 75,0
AIME25 (no tools) 89,06 85,0 91,7
AIME25 (with tools) 99,17 98,7
GPQA (no tools) 73,04 73,4 71,5
LiveCodeBench v6 68,25 66,0 61,0
SWE‑Bench (OpenHands) 38,76 22,0* 34,0
TauBench V2 Avg 49,04 47,7 47,5
Arena‑Hard‑V2 Avg 67,65 57,8 48,55
RULER‑100 @ 1M 86,34 77,5

* — wartości z wtórnych źródeł; warunki odtworzenia — NeMo Evaluator SDK. Źródło: arXiv:2512.20848.[2][28]

Przepustowość (wejście 8K / wyjście 16K, single H200): 3,3 razy wyższa niż Qwen3‑30B‑A3B‑Thinking i 2,2 razy wyższa niż GPT‑OSS‑20B.[2]

Dodatkowe modele i kierunki

  • OpenReasoning‑Nemotron (lipiec 2025) — seria modeli 1,5B–32B parametrów, opartych na Qwen 2.5 i dostrojonych na danych DeepSeek‑R1‑0528. Wariant 32B z GenSelect@64 przewyższa o3 (high) na szeregu matematycznych benchmarków.[29]
  • Nemotron Elastic (arXiv:2511.16664) — framework zagnieżdżonych podmodeli (6B, 9B, 12B) w ramach jednego modelu nadrzędnego, redukujący koszt treningu 360-krotnie w porównaniu z treningiem od zera.[30]
  • Nemotron‑CrossThink — framework wielodomenowego uczenia ze wzmocnieniem wykraczającego poza zadania matematyczne, zapewniający +30,1 % na MATH‑500 i +12,8 % na MMLU‑PRO.[31]
  • Nemotron‑UltraLong — rozszerzenie kontekstu do 4 mln tokenów.[32]
  • Jet‑Nemotron — post-treningowy NAS dla kompaktowych modeli hybrydowych 2B/4B.[33]

Modele specjalizowane

W ekosystemie Nemotron obecne są również modele do zadań specjalizowanych:

  • Nemotron Nano V2 VL — model vision‑language do OCR, przetwarzania tabel i wideo.[34]
  • Nemotron Parse 1.1 — model do OCR i ekstrakcji struktury dokumentów.[35]
  • Nemotron ColEmbed V2 — model embeddingów do wizualnego wyszukiwania dokumentów (late interaction).[36]
  • Nemotron Speech — modele do automatycznego rozpoznawania mowy (ASR), syntezy mowy (TTS) i maszynowego tłumaczenia (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — model klasyfikacji niebezpiecznych treści według 23 kategorii w 9 językach z dokładnością 84,2 %.[37]

Dane do pre-trenowania

Skład danych Nemotron‑4

Korpus pre-treningowy Nemotron‑4 15B i 340B składa się z trzech głównych kategorii: teksty angielskie (70 %), teksty wielojęzyczne w 53 językach (15 %) oraz kod źródłowy w 43 językach programowania (15 %). Stosowano deduplikację na poziomie dokumentów (exact i near‑duplicate) oraz filtrowanie za pomocą modeli językowych i heurystyk. Model 15B wytrenowano na 8 bln tokenów, model 340B — na 9 bln (8 bln pre-trening + 1 bln kontynuowane uczenie z przeważaniem wysokiej jakości źródeł).[8][3]

Nemotron‑CC

Zbiór danych Nemotron‑CC utworzony został z Common Crawl z wykorzystaniem zespołu klasyfikatorów jakości i syntetycznego parafrazowania tekstów. Łączna objętość — 6,3 bln tokenów (4,4 bln deduplikowanych + 1,9 bln syntetycznych przeformułowań). Pipeline zintegrowany jest z narzędziem NeMo Curator. Praca przyjęta jako Long Paper na konferencji ACL 2025.[38]

Nemotron‑CC‑Math

Zorientowany matematycznie podzbiór o objętości 133 mld tokenów, wyodrębniony z Common Crawl za pomocą pipeline Lynx + LLM z zachowaniem struktury formuł matematycznych i kodu w LaTeX.[39]

Dane Nemotron 3 Nano

Pre-trening Nemotron 3 Nano przeprowadzono na 25 bln tokenów. Zbiór zawiera: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 oraz specjalizowane datasety STEM. Do uczenia na długim kontekście wykorzystano dodatkowe 121 mld tokenów CPT.[2]

Nemotron Pretraining Dataset v1

Syntetycznie wygenerowany zbiór obejmujący STEM, teksty akademickie, zadania wnioskowania i domeny wielojęzyczne; zawiera ponad 10 bln tokenów językowych i 18 mln próbek do SFT. Wszystkie zbiory danych dystrybuowane są na otwartych licencjach pozwalających na szerokie wykorzystanie.[40]

Pipeline syntetycznego generowania danych (SDG)

Potok opisany w raporcie dotyczącym Nemotron‑4 340B obejmuje następujące etapy[3]:

  • Generowanie promptów: syntetyczne jedno‑ i dwuturowe zapytania, wygenerowane za pomocą Mixtral‑8x7B‑Instruct‑v0.1 (licencja Apache 2.0) według szablonów Open QA, Writing, Closed QA, Math & Coding.
  • Generowanie odpowiedzi: wielokrotne odpowiedzi z pośrednich wersji modeli w celu zapewnienia różnorodności.
  • Ocena jakości: trzy podejścia — Ground‑Truth‑as‑a‑Judge (dla zadań z weryfikowalną odpowiedzią), LLM‑as‑Judge (porównanie par odpowiedzi przez model językowy), Reward‑Model‑as‑Judge (wykorzystanie Nemotron‑4‑340B‑Reward).
  • Iteracyjne wyrównywanie od słabych do silnych modeli (weak‑to‑strong).

Z ~20 000 przykładów opatrzonych adnotacjami ludzkimi (10 000 dla SFT, 10 000 HelpSteer2 dla modelu nagrody) zsyntetyzowano całą pozostałą objętość danych wyrównywania.[3]

Kwantyzacja i optymalizacja inferencji

Modele Nemotron 3 Nano obsługują Post‑Training Quantization (PTQ) w FP8 z wykorzystaniem ModelOpt i Megatron‑LM. Stosuje się selective quantization — warstwy attention i część Mamba zachowywane są w BF16 dla zachowania jakości; pozostałe kwantyzowane są do FP8. Według raportu technicznego zapewnia to ~99 % zachowania dokładności.[2] Nano obsługuje również inferencję w formacie NVFP4.[1]

Zbiorcza tabela benchmarków według generacji

Model MMLU GSM8K HumanEval Arena Hard MT‑Bench Warunki
Nemotron‑4 15B 64,2 % 46,0 % 31,6 % base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81,1 % 57,3 % 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78,7 % 92,3 % 73,2 % 54,2 8,22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85,0 8,98 paź. 2024
LN‑Ultra 253B (reasoning ON) GPQA 76,0 %, AIME 80,8 %
Nemotron‑H‑47B 83,6 % 93,3 % 61,0 % 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67,7 (v2) AIME25 89,1 %, LCB 68,3 %

Porównanie należy interpretować z ostrożnością: warunki oceny, wersje benchmarków i daty przeprowadzenia testów różnią się między pokoleniami. Wyniki zaczerpnięto z raportów technicznych NVIDIA; niezależne oceny mogą się różnić (zob. rozdział „Ograniczenia").[8][3][9][11][12][2]

Zastosowania

Wdrożenie przez NVIDIA NIM

NVIDIA NIM — zestaw zoptymalizowanych kontenerowych mikroserwisów do inferencji z API kompatybilnym z OpenAI. Modele Nemotron dostępne są jako mikroserwisy NIM na platformie build.nvidia.com. NIM obsługuje formaty FP8, BF16, NVFP4 oraz wdrożenie przez wykresy Helm na Kubernetes. Modele są również kompatybilne z niezależnymi frameworkami: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

Syntetyczne generowanie danych

Nemotron‑4 340B zaprojektowany jest do wykorzystania jako generator syntetycznych danych: model Instruct generuje odpowiedzi, a model Reward ocenia je i filtruje. Licencja NVIDIA Open Model License wyraźnie zezwala na używanie wyników modelu do trenowania innych modeli. Według danych ServiceNow, 15 % danych pre-treningowych ich modelu Apriel 1.6 pochodzi ze zbiorów danych Nemotron.[3][15][41]

Systemy agentowe

Modele rodziny Nemotron 3 (Nano, Super, Ultra) przeznaczone są do wieloagentowych obciążeń: planowanie, retrieval, wywoływanie narzędzi (tool use). Nemotron 3 Nano osiąga wynik 38,76 % na SWE‑Bench (z OpenHands) i 49,04 % (avg) na TauBench V2.[2]

Wdrożenia korporacyjne

Wśród deklarowanych partnerów: ServiceNow (wspólny model Apriel Nemotron 15B do automatyzacji przepływów pracy), CrowdStrike (platforma Charlotte AI), Perplexity (routing zapytań), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modele dostępne są na AWS Amazon Bedrock; planowane jest wsparcie dla Google Cloud, CoreWeave, Nebius.[15]

Ograniczenia i otwarte problemy

Niezależne oceny i rozbieżności z danymi NVIDIA

Niezależne oceny ujawniają rozbieżności z wynikami podawanymi przez NVIDIA. Według danych Artificial Analysis (luty 2026), Llama‑Nemotron‑Ultra 253B (reasoning) uzyskała ocenę Intelligence Index 15 przy medianie 26 dla modeli porównywalnej wielkości. Na platformie Chatbot Arena (LMArena) modele Nemotron zajmują pozycje w środku rankingu: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. pozycja), Nemotron 3 Nano — 1317 ±6 (~164. pozycja).[42][43]

Rozwlekłość

Modele Nemotron wykazują podwyższoną rozwlekłość: w ocenie Artificial Analysis model Nemotron 3 Nano wygenerował 140 mln tokenów (przy medianie 12 mln dla innych modeli), co zwiększa koszt inferencji. Analiza DEV Community ujawniła, że Llama‑3.1‑Nemotron‑70B‑Instruct przy formalnym prowadzeniu na automatycznych benchmarkach wykazywała niedostateczną dokładność w szeregu praktycznych zadań, a wysokie oceny na benchmarkach podobnych do Arena mogły wynikać z preferencji dla rozwlekłych i pewnych siebie, lecz niekoniecznie dokładnych odpowiedzi.[42][44]

Halucynacje i bias

NVIDIA w kartach modeli wskazuje, że modele mogą „wzmacniać uprzedzenia i generować toksyczne odpowiedzi, szczególnie przy toksycznych promptach", a także „produkować niedokładne informacje, pomijając kluczowe szczegóły". Otwartość wag i danych umożliwia zewnętrzny audyt.[11][13]

Wymagania obliczeniowe

Gęste modele (Nemotron‑4 340B) wymagają klastra 768 węzłów DGX H100 do pełnego treningu, co ogranicza odtwarzalność dla grup akademickich bez dostępu do porównywalnej infrastruktury. Długi kontekst (1M) podczas inferencji wymaga znacznej ilości VRAM.[3][2]

Degradacja przy rozszerzeniu kontekstu

Przy rozszerzeniu kontekstu do bardzo długich sekwencji obserwowano degradację wyników na benchmarkach z krótkim kontekstem.[32]

Kwantyzacja architektur hybrydowych

Stosowanie bardzo niskiej rozdzielczości bitowej (FP8/NVFP4) w architekturach Mamba‑Transformer prowadzi do niewielkiego spadku dokładności (~1 % na szeregu benchmarków). Problem ten rozwiązuje się poprzez stosowanie selective quantization, co komplikuje architekturę kompilatorów i serwerów inferencji.[2][1]

Pozostałe otwarte problemy

  • Zależność od benchmarków z możliwą kontaminacją danych treningowych.
  • Brak standardowych protokołów porównywania hybrydowych architektur SSM‑Transformer z czystymi modelami Transformer.
  • Kwestia skalowalności podejścia MoE w zadaniach wymagających głębokiego wnioskowania przy małej liczbie ekspertów na token.
  • Dane dotyczące Super/Ultra na grudzień 2025 roku są wstępne; pełne benchmarki oczekiwane są po wydaniu.[1]

Aspekty etyczne i regulacyjne

Bezpieczeństwo na etapie opracowania

Na etapie opracowania stosuje się: ocenę według frameworku AEGIS (13 kategorii bezpieczeństwa treści), skaner podatności garak, ręczne „czerwone testowanie" (red‑teaming).[37]

Bezpieczeństwo na etapie inferencji

NeMo Guardrails — otwarte narzędzie (licencja Apache 2.0) dodające programowalne bariery do systemów LLM. Mikroserwis przechwytuje wejścia i wyjścia, stosując konfigurowalne sprawdzenia: kontrola tematu, wykrywanie PII, weryfikacja „ugruntowania" RAG, wykrywanie ataków jailbreak (w tym ochrona przed wstrzykiwaniem kodu opartym na YARA), wielojęzyczna multimodalna klasyfikacja bezpieczeństwa.[45]

Dla Nemotron 3 opublikowano zbiór ~11 000 zaetykietowanych śladów OpenTelemetry z realistycznych scenariuszy z użyciem narzędzi, przeznaczonych do oceny bezpieczeństwa agentowego.[1]

Licencjonowanie

Modele Licencja
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (dziedziczona po Meta)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License zezwala na komercyjne wykorzystanie, tworzenie i dystrybucję dzieł pochodnych, nie wymaga atrybucji (przy zachowaniu pliku NOTICE), nie nakłada ograniczeń co do liczby użytkowników i wyraźnie zezwala na używanie wyników modelu do trenowania innych modeli.[46] Modele oparte na Llama dziedziczą ograniczenia Meta, w tym próg 700 mln miesięcznie aktywnych użytkowników.[11]

Dla Nemotron 3 Nano NVIDIA opublikowała: wagi modelu, ponad 10 bln tokenów danych treningowych, przepisy treningowe, bazy kodu (NeMo, Megatron‑LM, NeMo‑Aligner), ponad 10 środowisk uczenia ze wzmocnieniem z 900 000+ zadań.[1][2]

Perspektywy i kierunki badań

Najbliższe wydania obejmują Nemotron 3 Super (~100 mld parametrów, ~10 mld aktywnych) i Nemotron 3 Ultra (~500 mld, ~50 mld aktywnych), oczekiwane w pierwszej połowie 2026 roku. Oba modele będą korzystać z LatentMoE, MTP i treningu w formacie NVFP4 na architekturze Blackwell.[1]

Strategiczny kierunek NVIDIA — pozycjonowanie Nemotron nie jako pojedynczego modelu, lecz jako warstwy infrastrukturalnej dla systemów wieloagentowych, gdzie różne modele rodziny używane są do różnych zadań z routingiem według złożoności.[1][15]

Główne kierunki badawcze:

  • Rozwój architektur hybrydowych — dalsza integracja warstw SSM z mechanizmem uwagi dla skalowalnego długiego kontekstu.[12]
  • Wielopoziomowe metody kompresji — rozwój Minitron, Puzzle, MiniPuzzle i Nemotron Elastic.[20][21][30]
  • Wielodomenowe uczenie ze wzmocnieniem — Nemotron‑CrossThink do rozszerzenia RL poza zadania matematyczne.[31]
  • Rozszerzenie kontekstu — Nemotron‑UltraLong do 4 mln tokenów.[32]
  • Multimodalność — rozszerzenie w kierunku vision‑language (Nemotron VL), mowy (Nemotron Speech), wizualnego wyszukiwania dokumentów (Nemotron ColEmbed V2).[34][35][36]
  • Kompaktowe modele hybrydowe — Jet‑Nemotron (NAS dla modeli 2B/4B).[33]
  • Otwarte przepisy — publikacja pełnych przepisów treningowych i danych do odtworzenia i dostosowywania przez społeczność.[14]

Zobacz też

  • Architektura Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (rodzina modeli Meta)

Odnośniki

Literatura

Przypisy

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/