Nemotron (NVIDIA) (PL)
Nemotron — rodzina dużych modeli językowych (Large Language Model, LLM) z otwartymi wagami, opracowana przez oddział Applied Deep Learning Research (ADLR) korporacji NVIDIA. Modele należą do dziedziny uczenia maszynowego i przetwarzania języka naturalnego (Natural Language Processing, NLP) i przeznaczone są do szerokiego zakresu zadań: syntetycznego generowania danych, wnioskowania (reasoning), aplikacji agentowych (agentic AI) oraz wdrożeń na przemysłowym sprzęcie NVIDIA. Rodzina łączy modele różnych architektur i rozmiarów: od 4 mld do ~500 mld parametrów, w tym gęste (dense) decoder‑only modele Transformer serii Nemotron‑4 (2024), hybrydowe modele Mamba‑Transformer (Nemotron‑H, 2025) oraz hybrydowe modele Mamba‑Transformer z Mixture-of-Experts (MoE) w serii Nemotron 3 (2025). Na dzień marca 2026 roku rodzina liczy ponad 20 modeli, obejmujących zadania generowania tekstu, wnioskowania, wizualnego rozumienia dokumentów, ekstrakcji informacji oraz oceny jakości odpowiedzi. Modele udostępniane są przede wszystkim z otwartymi wagami na licencjach NVIDIA Open Model License i Llama Community License.[1][2][3]
Historia i geneza
Rozwój rodziny Nemotron prowadzony jest w ramach strategii NVIDIA dotyczącej tworzenia pełnego stosu narzędzi dla generatywnej sztucznej inteligencji: od infrastruktury treningowej (DGX, superkomputery oparte na GPU H100/B200) po platformy uczenia (NeMo Framework), wyrównywania (NeMo‑Aligner), wdrożeń (NIM — NVIDIA Inference Microservices) i bezpieczeństwa (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
Pierwszy publicznie dostępny model serii — dekodujący Transformer z 8 mld parametrów i kontekstem 4096 tokenów, wytrenowany na 3,8 bln tokenów w 53 językach naturalnych i 37 językach programowania. Trening przeprowadzono na 1024 GPU A100 przez 19 dni. Formalny raport techniczny na arXiv nie został opublikowany. Model był dystrybuowany przez NeMo Framework i Hugging Face; dostępne były warianty Chat (SFT i SteerLM). Licencja — NVIDIA AI Foundation Models Community License.[6][7]
Uwaga dotycząca nazw: „Nemotron‑3" z 2023 roku i „Nemotron 3" z grudnia 2025 roku to różne modele. Pierwszy był wczesnym prototypem, drugi stanowi aktualne pokolenie z architekturą MoE.
Nemotron‑4 15B (luty 2024)
Pierwsze publicznie udokumentowane wydanie serii Nemotron‑4 — model z 15 miliardami parametrów, wytrenowany na 8 bilionach tokenów przez ~13 dni kalendarzowych na 384 węzłach DGX H100 (do 3072 GPU). Zastosowano 8‑krotny paralelizm tensorowy i paralelizm danych od 96 do 288. Szczytowy MFU (Model FLOPs Utilization) wyniósł 34,3 % przy batch size 384. Architektura — decoder‑only Transformer z Grouped‑Query Attention (GQA) i Rotary Position Embeddings (RoPE). Według wyników benchmarków w momencie publikacji model przewyższał wszystkie porównywalne rozmiarowo modele otwarte w zadaniach wielojęzycznych, w tym szereg modeli czterokrotnie od niego większych.[8]
Nemotron‑4 340B (czerwiec 2024)
W czerwcu 2024 roku wydano największy model serii Nemotron‑4 — 340 miliardów parametrów (331,6 mld parametrów nie‑embeddingowych), wstępnie wytrenowany na 9 bilionach tokenów (8 bln pre-trening + 1 bln kontynuowane uczenie z przeważaniem wysokiej jakości źródeł). Trening odbywał się na 768 węzłach DGX H100 (do 6144 GPU) ze szczytowym MFU 42,4 %, od grudnia 2023 do maja 2024 roku. Rodzina obejmuje trzy warianty: Base, Instruct i Reward. Rozmiar modelu dobrano tak, aby mieścił się na jednym węźle DGX H100 (8 GPU) przy wdrożeniu w formacie precyzji FP8. Ponad 98 % danych użytych podczas wyrównywania (alignment) zostało wygenerowanych syntetycznie przez same modele serii w procesie iteracyjnym; pipeline syntetycznego generowania danych jest otwarty do odtworzenia.[3]
Llama‑3.1‑Nemotron‑70B (październik 2024)
W październiku 2024 roku wydano modele dostrojone z Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct i Llama‑3.1‑Nemotron‑70B‑Reward. Na dzień 1 października 2024 roku model Instruct zajmował 1. miejsce jednocześnie na trzech automatycznych benchmarkach: Arena Hard — 85,0, AlpacaEval 2 LC — 57,6 %, MT‑Bench (GPT‑4‑Turbo) — 8,98. Model Reward osiągnął 94,1 % na RewardBench.[9][10]
Przejście do architektur hybrydowych (2025)
W 2025 roku seria rozszerzyła się o architektury hybrydowe łączące warstwy Mamba‑2 (State Space Model, SSM — model przestrzeni stanów) i Transformer. W okresie marzec–maj 2025 roku wydano rodzinę modeli wnioskujących Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) z przełączalnym trybem wnioskowania.[11] W kwietniu 2025 roku opublikowano Nemotron‑H (arXiv:2504.03624) — rodzinę hybrydowych modeli Mamba‑Transformer o rozmiarach 8B, 56B i 47B parametrów.[12] W sierpniu 2025 roku przedstawiono Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (grudzień 2025)
15 grudnia 2025 roku ogłoszono trzecią generację — rodzinę Nemotron 3 z modelami Nano, Super i Ultra, łączącą architektury Mamba‑2, Transformer i MoE z oknem kontekstowym do 1 mln tokenów. Nano wydano wraz z raportem technicznym; Super i Ultra zaplanowano na pierwszą połowę 2026 roku.[1][2][14][15]
Podstawy teoretyczne
Architektura Transformer w Nemotron‑4
Modele serii Nemotron‑4 zbudowane są na standardowej architekturze dekodującego Transformera z kauzalną uwagą. Prawdopodobieństwo sekwencji tokenów faktoryzuje się jako:
gdzie — parametry modelu.[8]
Mechanizm uwagi zaimplementowany jest w wariancie Grouped‑Query Attention (GQA)[16]:
gdzie — macierze zapytań, kluczy i wartości; — wymiarowość głowicy uwagi.
Do kodowania pozycji stosuje się Rotary Position Embeddings (RoPE)[17]:
gdzie — wektor na pozycji , , — wymiarowość wektora.
W warstwach MLP używana jest aktywacja Squared ReLU: , zapewniająca rzadkość aktywacji. Modele nie zawierają przesunięć (bias), nie stosują dropout, a macierze embeddingów wejścia i wyjścia nie są ze sobą powiązane (untied embeddings). Tokenizer — SentencePiece BPE z zachowaniem spacji, znakowym podziałem cyfr i bajt‑poziomowym fallback, rozmiar słownika — 256 000.[8][3]
Parametry architektoniczne Nemotron‑4
| Parametr | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| Liczba parametrów | 15 mld (3,2 mld embed.) | 340 mld (9,4 mld embed.) |
| Liczba warstw | 32 | 96 |
| Ukryty wymiar | 6144 | 18 432 |
| Głowice uwagi | 48 | 96 |
| Głowice KV (GQA) | 8 | 8 |
| Długość kontekstu | 4096 | 4096 |
| Rozmiar słownika | 256 000 | 256 000 |
Źródła: arXiv:2402.16819, arXiv:2406.11704.[8][3]
Hybrydowa architektura Mamba‑Transformer (Nemotron‑H)
W modelach Nemotron‑H standardowe bloki samouwagi częściowo zastąpiono blokami Mamba‑2 — modelami przestrzeni stanów (State Space Models, SSM). Podczas autoregresyjnej generacji każda warstwa samouwagi wymaga operacji i pamięci na krok (z powodu pamięci podręcznej KV), podczas gdy warstwy Mamba zapewniają stały koszt pamięci i obliczeń na każdy generowany token.[12]
Mamba‑2 opisywane jest rekurencyjną zależnością[18]:
gdzie — stan ukryty, — diagonalna macierz przejść stanów, i — macierze projekcji, — wejściowy token, — sygnał wyjściowy. W Mamba‑2 macierze , , zależą od wejścia (input‑dependent), co odróżnia model od klasycznych liniowych SSM.
W Nemotron‑H‑56B stosuje się 54 warstwy Mamba‑2 + 54 warstwy MLP + 10 warstw samouwagi, przy czym warstwy uwagi rozmieszczone są równomiernie wśród warstw Mamba. Model wytrenowano na 20 bln tokenów w formacie FP8 (skalowanie per‑tensor) na 6144 GPU H100. Wersja Nemotron‑H‑8B zawiera 24 warstwy Mamba‑2, 24 warstwy MLP i 4 warstwy samouwagi; trening przeprowadzono na 15 bln tokenów.[12]
Architektura MoE w Nemotron 3
Modele Nemotron 3 (grudzień 2025) łączą trzy komponenty architektoniczne: Mamba‑2, Transformer i Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) zawiera 52 warstwy: 23 warstwy Mamba‑2 + MoE, 23 warstwy MoE i 6 warstw uwagi GQA. Każda warstwa MoE obejmuje 128 routowanych (routed) ekspertów + 1 wspólny (shared) ekspert, z których 6 ekspertów aktywowanych jest na każdy token. Routing realizowany jest przez uczony router MLP z sigmoid gating. Równoważenie obciążenia zaimplementowano bez pomocniczej funkcji straty (aux‑loss‑free). Całkowita liczba parametrów wynosi 31,6 mld, lecz aktywnych na każdy token jest jedynie 3,2 mld.[2]
Normalizacja — RMSNorm[19]. Embeddingi pozycyjne w częściach Mamba są nieobecne (informacja pozycyjna jest implicite w stanie SSM). Stosuje się niezwiązane embeddingi, brak dropout i bias w warstwach liniowych.[2]
Rozszerzenia w Super/Ultra: LatentMoE i Multi‑Token Prediction
Modele Super i Ultra z rodziny Nemotron 3 stosują dwie dodatkowe innowacje architektoniczne:
- Latent MoE (LatentMoE) — projekcja reprezentacji wejściowej do latentnej przestrzeni o mniejszym wymiarze przed routingiem, co pozwala zwiększyć liczbę ekspertów przy porównywalnych kosztach obliczeniowych i poprawić dokładność bez zmniejszania przepustowości.[1]
- Multi‑Token Prediction (MTP) — jednoczesne przewidywanie kilku następnych tokenów, stosowane w celu poprawy jakości długich tekstów i spekulatywnego dekodowania podczas inferencji.[1]
Trening modeli Super i Ultra prowadzony jest w formacie NVFP4 — 4‑bitowym formacie liczbowym NVIDIA na architekturze Blackwell.[1]
Metody kompresji modeli: Minitron, Puzzle, MiniPuzzle
Do tworzenia kompaktowych modeli NVIDIA stosuje kilka podejść:
- Minitron — metoda strukturalnego przycinania (pruning) i destylacji wiedzy (knowledge distillation). Badane są dwa rodzaje przycinania: według głębokości (usuwanie warstw) i według szerokości (jednoczesne zmniejszanie wymiarów ukrytych warstw, głowic uwagi i projekcji MLP). Zastosowanie Minitron do Nemotron‑4 15B pozwala uzyskać modele 8B i 4B z redukcją kosztów treningu do 40 razy w porównaniu z treningiem od zera.[20]
- Puzzle — algorytm Neural Architecture Search (NAS), który dobiera optymalną konfigurację każdego bloku (liczba głowic KV, rozmiar FFN, obecność/brak uwagi) z warstwową destylacją. W ten właśnie sposób Llama 3.1 405B skompresowano do 253B (Llama‑Nemotron Ultra), a Llama 3.3 70B — do 49B (Llama‑Nemotron Super).[21]
- MiniPuzzle — rozszerzenie Puzzle dla architektur hybrydowych, które skompresowało Nemotron‑H‑56B do 47B przy nakładzie jedynie 63 mld tokenów destylacji. Przy zbliżonej dokładności skompresowany model generuje o 20 % szybciej.[12]
Metody wyrównywania
HelpSteer i HelpSteer2
HelpSteer — zbiór 37 120 przykładów (licencja CC‑BY‑4.0), stworzony we współpracy ze Scale AI, w którym każda odpowiedź jest opatrzona adnotacją według pięciu atrybutów: użyteczności (helpfulness), poprawności (correctness), spójności (coherence), złożoności (complexity) i rozwlekłości (verbosity) w skali Likerta 0–4.[22]
HelpSteer2 — zaktualizowany zbiór 21 362 przykładów (10 681 promptów × 2 odpowiedzi), gdzie ponad 95 % promptów pochodzi z ShareGPT (rzeczywiste zapytania użytkowników). Około 50 % adnotacji zostało odfiltrowanych jako niewystarczająco wysokiej jakości. Rozszerzenie HelpSteer2‑Preference dodaje parowe preferencje adnotatorów, umożliwiając trenowanie zarówno regresyjnych, jak i parowych modeli nagród na tych samych danych.[23][24]
SteerLM
SteerLM — metoda SFT (Supervised Fine‑Tuning — uczenie nadzorowane) z warunkowaniem na atrybuty (helpfulness, correctness, coherence, complexity, verbosity), pozwalająca użytkownikowi sterować stylem odpowiedzi podczas inferencji. Potok obejmuje: (1) trening modelu predykcji atrybutów (APM) na HelpSteer, (2) adnotację danych za pomocą APM, (3) SFT z warunkowaniem na docelowe wartości atrybutów, (4) bootstrapping.[25]
DPO i RPO
DPO (Direct Preference Optimization) — metoda bezpośredniej optymalizacji preferencji bez jawnego modelu nagrody, stosowana w potokach Nemotron‑4 340B Instruct i Nemotron Nano 2.[26]
RPO (Reward‑aware Preference Optimization) — ujednolicony matematyczny framework NVIDIA uogólniający DPO, IPO, SimPO, REINFORCE i SteerLM 2.0 jako przypadki szczególne. RPO minimalizuje odległość między predykcjami niejawnego modelu nagrody a docelowym jawnym modelem[27]:
gdzie — jawny model nagrody, — uczona polityka, — polityka referencyjna, — funkcja odległości, / — odpowiedź preferowana/odrzucona. RPO stosowane jest podczas treningu Nemotron‑4 340B Instruct i modeli Llama‑Nemotron.[27][3][11]
Wielośrodowiskowe uczenie ze wzmocnieniem (RLVR)
W Nemotron 3 stosowane jest Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — jednoczesny trening w wielu środowiskach w ramach NeMo Gym: matematyka konkursowa, programowanie, QA, tool‑use, instruction‑following, long‑context. Algorytm — GRPO (Group Relative Policy Optimization) z masked importance sampling.[2][14]
Nemotron 3 wspiera granularne sterowanie budżetem wnioskowania (reasoning budget control): użytkownik może ustawić limit tokenów dla thinking trace poprzez flagę w szablonie chat (przełączenie „detailed thinking on/off" lub ograniczenie długości).[2]
Linia modeli
Tabela zbiorcza
| Model | Rok | Łączna / Aktywna liczba parametrów | Kontekst | Architektura | Kluczowe cechy |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3,8B tokenów; 1024 GPU A100; 19 dni |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8B tokenów; MFU 34,3 % |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9B tokenów; Base/Instruct/Reward; >98 % syntetycznych danych alignment |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94,1 % |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | Kompresja NAS z Llama 3.1 8B |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | Z Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | Z Llama 3.1 405B; GPQA 76,0 % |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | Hybryda Mamba‑Transformer | 15B tokenów; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | Hybryda Mamba‑Transformer | 20B tokenów FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | Hybryda Mamba‑Transformer | MiniPuzzle z 56B; +20 % prędkości |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | Hybryda Mamba‑Transformer | 20B tokenów; destylacja Minitron |
| Nemotron 3 Nano | 2025 | 31,6B / 3,2B | 1M | Hybryda Mamba‑Transformer MoE | 25B tokenów; 128 ekspertów, 6 aktywnych |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | Hybryda LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | Hybryda LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
Architektura: 32 warstwy, hidden dimension 6144, 48 głowic uwagi, 8 głowic KV (GQA). Łączna liczba parametrów — 15 mld (3,2 mld embedding + 12,5 mld non‑embedding). Wyniki: MMLU — 64,2 % (5‑shot), BBH — 58,7 % (3‑shot), GSM8K — 46,0 % (8‑shot, maj@1), HumanEval — 31,6 % (0‑shot, pass@1). Na wielojęzycznych benchmarkach (XCOPA, TyDiQA‑GoldP, MGSM) model przewyższał modele czterokrotnie większe.[8]
Nemotron‑4 340B
Architektura: 96 warstw, hidden dimension 18 432, 96 głowic uwagi, 8 głowic KV.
Nemotron‑4 340B Base osiągnął: MMLU — 81,1 % (5‑shot), BBH — 85,4 % (3‑shot), HumanEval — 57,3 % (0‑shot), ARC‑Challenge — 94,3 % (25‑shot).[3]
Nemotron‑4 340B Instruct przeszedł wieloetapowe wyrównywanie: Code SFT → General SFT → DPO → RPO (3 rundy). Wyniki: MT‑Bench — 8,22 (sędzia GPT‑4‑Turbo), MMLU — 78,7 % (0‑shot), GSM8K — 92,3 % (0‑shot), HumanEval — 73,2 % (0‑shot), Arena Hard — 54,2, AlpacaEval 2.0 LC — 41,5 %.[3]
Nemotron‑4 340B Reward zastępuje końcową warstwę softmax liniową projekcją stanu ukrytego ostatniej warstwy do wektora 5 atrybutów HelpSteer2. Końcowa nagroda to ważona suma pięciu atrybutów. Trening przeprowadzono przez 2 epoki na danych HelpSteer2 (batch size 128). Na RewardBench model osiągnął 92,0 %, przewyższając GPT‑4o (84,7 %), Gemini 1.5 Pro (88,1 %) i Claude‑3‑Opus (80,7 %) w momencie publikacji.[3]
| Model | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54,2 | 41,5 % | 8,22 |
| Llama‑3‑70B‑Instruct | 41,1 | 34,4 % | 8,16 |
| Mixtral‑8x22B‑Instruct | 36,4 | 30,9 % | 7,63 |
| Qwen‑2‑72B‑Instruct | 48,1 | 38,8 % | 8,26 |
Źródło: arXiv:2406.11704, tabela 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward wytrenowany jest metodą hybrydową łączącą Bradley‑Terry (parowe preferencje) i regresję SteerLM (wieloatrybutowa ocena w skali Likerta). Trening przeprowadzono wyłącznie na danych HelpSteer2 (CC‑BY‑4.0). Na RewardBench model osiągnął 94,1 %, zajmując 1. miejsce w momencie publikacji.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct wyrównany jest metodą RLHF z algorytmem REINFORCE (nie PPO) i modelem nagrody Nemotron‑70B‑Reward. Infrastruktura — NeMo‑Aligner z akceleracją TRT‑LLM.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
Rodzina modeli wnioskujących, uzyskanych z Llama 3.x metodami NAS, destylacji i rozszerzonego post-treningu.[11]
| Model | Parametry | Model bazowy | Kontekst |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 mld | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 mld | Minitron 4B (z Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | 49 mld | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 mld | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
Pięcioetapowy potok treningowy: (1) NAS + FFN Fusion, (2) destylacja + kontynuowane pre-trenowanie, (3) SFT (w tym ślady wnioskowania DeepSeek‑R1), (4) rozbudowane RL (GRPO dla Ultra, REINFORCE/RLOO + Online RPO dla Nano), (5) wyrównywanie do dialogu.[11]
Modele jako pierwsze spośród otwartych LLM wspierają przełączalny tryb wnioskowania (reasoning toggle): przy włączeniu („detailed thinking on" w systemowym promptcie) model generuje łańcuch rozumowania w tagach <think>...</think> przed odpowiedzią; przy wyłączeniu — odpowiada bezpośrednio.[11]
Wyniki Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76,0 %, AIME 2024 — 80,8 %, MATH 500 — ~97 %. Dla porównania: DeepSeek‑R1 (671B łącznie / 37B aktywnych) — GPQA Diamond 71,5 %, AIME 2024 ~79,8 %. Ultra mieści się na jednym węźle 8×H100.[11]
Nemotron‑H (kwiecień 2025)
Rodzina gęstych modeli hybrydowych, trenowanych od zera i zaprojektowanych do zadań z długimi generacjami. Nemotron‑H‑56B wytrenowany na 20 bln tokenów w FP8 — jeden z największych publicznych eksperymentów pre-trenowania w FP8. Nemotron‑H‑47B uzyskano przez kompresję 56B metodą MiniPuzzle (63 mld tokenów destylacji) i mieści się w pamięci jednej RTX 5090 (FP4) przy kontekście ~1M tokenów.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60,5 | 61,8 | 58,8 | 51,3 |
| MMLU (5‑shot) | 84,2 | 83,6 | 86,1 | 78,8 |
| GSM8K (8‑shot CoT) | 93,7 | 93,3 | 90,9 | 83,9 |
| HumanEval (0‑shot) | 60,4 | 61,0 | 56,7 | 57,3 |
Źródło: arXiv:2504.03624.[12]
Przy generacji z 65 536 tokenami wejściowymi i 1024 tokenami wyjściowymi na H100 model Nemotron‑H‑47B działał 2,9 razy szybciej niż Qwen‑2.5‑72B i Llama‑3.1‑70B.[12]
Nemotron Nano 2 (sierpień 2025)
Hybrydowy model Mamba‑Transformer do wnioskowania. Nemotron‑Nano‑12B‑v2‑Base — model nadrzędny z 62 warstwami (przeważnie Mamba‑2 + MLP + 4 warstwy uwagi), wytrenowany na 20 bln tokenów w FP8 od zera. Z niego metodą rozszerzonego Minitron uzyskano Nemotron‑Nano‑9B‑v2, zdolny do pracy w kontekście 128K tokenów na jednym GPU NVIDIA A10G (22 GB, BF16). Post-trening: SFT (80 mld tokenów, w tym ślady DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. Na benchmarkach wnioskowania model jest porównywalny z Qwen3‑8B pod względem dokładności, ale osiąga 3–6‑krotne przyspieszenie generacji przy długich sekwencjach wyjściowych.[13]
Nemotron 3 Nano 30B‑A3B
Wydany w grudniu 2025 roku. Parametry: 31,6 mld łącznie, 3,2 mld aktywnych. Architektura: 52 warstwy, hidden dimension 2688, wymiar eksperta 1856, wymiar stanu Mamba 128. MoE: 128 routowanych ekspertów + 1 wspólny, 6 aktywnych na token. Kontekst — do 1 048 576 tokenów. Trening na 25 bln tokenów (harmonogram WSD, batch size 3072, odcięcie danych — czerwiec 2025) w dwóch fazach: Faza 1 — 23,5 bln (zróżnicowane dane), Faza 2 — 1,5 bln (wysokiej jakości dane) + 121 mld tokenów long‑context CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78,30 | 80,9 | 75,0 |
| AIME25 (no tools) | 89,06 | 85,0 | 91,7 |
| AIME25 (with tools) | 99,17 | — | 98,7 |
| GPQA (no tools) | 73,04 | 73,4 | 71,5 |
| LiveCodeBench v6 | 68,25 | 66,0 | 61,0 |
| SWE‑Bench (OpenHands) | 38,76 | 22,0* | 34,0 |
| TauBench V2 Avg | 49,04 | 47,7 | 47,5 |
| Arena‑Hard‑V2 Avg | 67,65 | 57,8 | 48,55 |
| RULER‑100 @ 1M | 86,34 | 77,5 | — |
* — wartości z wtórnych źródeł; warunki odtworzenia — NeMo Evaluator SDK. Źródło: arXiv:2512.20848.[2][28]
Przepustowość (wejście 8K / wyjście 16K, single H200): 3,3 razy wyższa niż Qwen3‑30B‑A3B‑Thinking i 2,2 razy wyższa niż GPT‑OSS‑20B.[2]
Dodatkowe modele i kierunki
- OpenReasoning‑Nemotron (lipiec 2025) — seria modeli 1,5B–32B parametrów, opartych na Qwen 2.5 i dostrojonych na danych DeepSeek‑R1‑0528. Wariant 32B z GenSelect@64 przewyższa o3 (high) na szeregu matematycznych benchmarków.[29]
- Nemotron Elastic (arXiv:2511.16664) — framework zagnieżdżonych podmodeli (6B, 9B, 12B) w ramach jednego modelu nadrzędnego, redukujący koszt treningu 360-krotnie w porównaniu z treningiem od zera.[30]
- Nemotron‑CrossThink — framework wielodomenowego uczenia ze wzmocnieniem wykraczającego poza zadania matematyczne, zapewniający +30,1 % na MATH‑500 i +12,8 % na MMLU‑PRO.[31]
- Nemotron‑UltraLong — rozszerzenie kontekstu do 4 mln tokenów.[32]
- Jet‑Nemotron — post-treningowy NAS dla kompaktowych modeli hybrydowych 2B/4B.[33]
Modele specjalizowane
W ekosystemie Nemotron obecne są również modele do zadań specjalizowanych:
- Nemotron Nano V2 VL — model vision‑language do OCR, przetwarzania tabel i wideo.[34]
- Nemotron Parse 1.1 — model do OCR i ekstrakcji struktury dokumentów.[35]
- Nemotron ColEmbed V2 — model embeddingów do wizualnego wyszukiwania dokumentów (late interaction).[36]
- Nemotron Speech — modele do automatycznego rozpoznawania mowy (ASR), syntezy mowy (TTS) i maszynowego tłumaczenia (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — model klasyfikacji niebezpiecznych treści według 23 kategorii w 9 językach z dokładnością 84,2 %.[37]
Dane do pre-trenowania
Skład danych Nemotron‑4
Korpus pre-treningowy Nemotron‑4 15B i 340B składa się z trzech głównych kategorii: teksty angielskie (70 %), teksty wielojęzyczne w 53 językach (15 %) oraz kod źródłowy w 43 językach programowania (15 %). Stosowano deduplikację na poziomie dokumentów (exact i near‑duplicate) oraz filtrowanie za pomocą modeli językowych i heurystyk. Model 15B wytrenowano na 8 bln tokenów, model 340B — na 9 bln (8 bln pre-trening + 1 bln kontynuowane uczenie z przeważaniem wysokiej jakości źródeł).[8][3]
Nemotron‑CC
Zbiór danych Nemotron‑CC utworzony został z Common Crawl z wykorzystaniem zespołu klasyfikatorów jakości i syntetycznego parafrazowania tekstów. Łączna objętość — 6,3 bln tokenów (4,4 bln deduplikowanych + 1,9 bln syntetycznych przeformułowań). Pipeline zintegrowany jest z narzędziem NeMo Curator. Praca przyjęta jako Long Paper na konferencji ACL 2025.[38]
Nemotron‑CC‑Math
Zorientowany matematycznie podzbiór o objętości 133 mld tokenów, wyodrębniony z Common Crawl za pomocą pipeline Lynx + LLM z zachowaniem struktury formuł matematycznych i kodu w LaTeX.[39]
Dane Nemotron 3 Nano
Pre-trening Nemotron 3 Nano przeprowadzono na 25 bln tokenów. Zbiór zawiera: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 oraz specjalizowane datasety STEM. Do uczenia na długim kontekście wykorzystano dodatkowe 121 mld tokenów CPT.[2]
Nemotron Pretraining Dataset v1
Syntetycznie wygenerowany zbiór obejmujący STEM, teksty akademickie, zadania wnioskowania i domeny wielojęzyczne; zawiera ponad 10 bln tokenów językowych i 18 mln próbek do SFT. Wszystkie zbiory danych dystrybuowane są na otwartych licencjach pozwalających na szerokie wykorzystanie.[40]
Pipeline syntetycznego generowania danych (SDG)
Potok opisany w raporcie dotyczącym Nemotron‑4 340B obejmuje następujące etapy[3]:
- Generowanie promptów: syntetyczne jedno‑ i dwuturowe zapytania, wygenerowane za pomocą Mixtral‑8x7B‑Instruct‑v0.1 (licencja Apache 2.0) według szablonów Open QA, Writing, Closed QA, Math & Coding.
- Generowanie odpowiedzi: wielokrotne odpowiedzi z pośrednich wersji modeli w celu zapewnienia różnorodności.
- Ocena jakości: trzy podejścia — Ground‑Truth‑as‑a‑Judge (dla zadań z weryfikowalną odpowiedzią), LLM‑as‑Judge (porównanie par odpowiedzi przez model językowy), Reward‑Model‑as‑Judge (wykorzystanie Nemotron‑4‑340B‑Reward).
- Iteracyjne wyrównywanie od słabych do silnych modeli (weak‑to‑strong).
Z ~20 000 przykładów opatrzonych adnotacjami ludzkimi (10 000 dla SFT, 10 000 HelpSteer2 dla modelu nagrody) zsyntetyzowano całą pozostałą objętość danych wyrównywania.[3]
Kwantyzacja i optymalizacja inferencji
Modele Nemotron 3 Nano obsługują Post‑Training Quantization (PTQ) w FP8 z wykorzystaniem ModelOpt i Megatron‑LM. Stosuje się selective quantization — warstwy attention i część Mamba zachowywane są w BF16 dla zachowania jakości; pozostałe kwantyzowane są do FP8. Według raportu technicznego zapewnia to ~99 % zachowania dokładności.[2] Nano obsługuje również inferencję w formacie NVFP4.[1]
Zbiorcza tabela benchmarków według generacji
| Model | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | Warunki |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64,2 % | 46,0 % | 31,6 % | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81,1 % | — | 57,3 % | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78,7 % | 92,3 % | 73,2 % | 54,2 | 8,22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85,0 | 8,98 | paź. 2024 |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76,0 %, AIME 80,8 % |
| Nemotron‑H‑47B | 83,6 % | 93,3 % | 61,0 % | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67,7 (v2) | — | AIME25 89,1 %, LCB 68,3 % |
Porównanie należy interpretować z ostrożnością: warunki oceny, wersje benchmarków i daty przeprowadzenia testów różnią się między pokoleniami. Wyniki zaczerpnięto z raportów technicznych NVIDIA; niezależne oceny mogą się różnić (zob. rozdział „Ograniczenia").[8][3][9][11][12][2]
Zastosowania
Wdrożenie przez NVIDIA NIM
NVIDIA NIM — zestaw zoptymalizowanych kontenerowych mikroserwisów do inferencji z API kompatybilnym z OpenAI. Modele Nemotron dostępne są jako mikroserwisy NIM na platformie build.nvidia.com. NIM obsługuje formaty FP8, BF16, NVFP4 oraz wdrożenie przez wykresy Helm na Kubernetes. Modele są również kompatybilne z niezależnymi frameworkami: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
Syntetyczne generowanie danych
Nemotron‑4 340B zaprojektowany jest do wykorzystania jako generator syntetycznych danych: model Instruct generuje odpowiedzi, a model Reward ocenia je i filtruje. Licencja NVIDIA Open Model License wyraźnie zezwala na używanie wyników modelu do trenowania innych modeli. Według danych ServiceNow, 15 % danych pre-treningowych ich modelu Apriel 1.6 pochodzi ze zbiorów danych Nemotron.[3][15][41]
Systemy agentowe
Modele rodziny Nemotron 3 (Nano, Super, Ultra) przeznaczone są do wieloagentowych obciążeń: planowanie, retrieval, wywoływanie narzędzi (tool use). Nemotron 3 Nano osiąga wynik 38,76 % na SWE‑Bench (z OpenHands) i 49,04 % (avg) na TauBench V2.[2]
Wdrożenia korporacyjne
Wśród deklarowanych partnerów: ServiceNow (wspólny model Apriel Nemotron 15B do automatyzacji przepływów pracy), CrowdStrike (platforma Charlotte AI), Perplexity (routing zapytań), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. Modele dostępne są na AWS Amazon Bedrock; planowane jest wsparcie dla Google Cloud, CoreWeave, Nebius.[15]
Ograniczenia i otwarte problemy
Niezależne oceny i rozbieżności z danymi NVIDIA
Niezależne oceny ujawniają rozbieżności z wynikami podawanymi przez NVIDIA. Według danych Artificial Analysis (luty 2026), Llama‑Nemotron‑Ultra 253B (reasoning) uzyskała ocenę Intelligence Index 15 przy medianie 26 dla modeli porównywalnej wielkości. Na platformie Chatbot Arena (LMArena) modele Nemotron zajmują pozycje w środku rankingu: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~147. pozycja), Nemotron 3 Nano — 1317 ±6 (~164. pozycja).[42][43]
Rozwlekłość
Modele Nemotron wykazują podwyższoną rozwlekłość: w ocenie Artificial Analysis model Nemotron 3 Nano wygenerował 140 mln tokenów (przy medianie 12 mln dla innych modeli), co zwiększa koszt inferencji. Analiza DEV Community ujawniła, że Llama‑3.1‑Nemotron‑70B‑Instruct przy formalnym prowadzeniu na automatycznych benchmarkach wykazywała niedostateczną dokładność w szeregu praktycznych zadań, a wysokie oceny na benchmarkach podobnych do Arena mogły wynikać z preferencji dla rozwlekłych i pewnych siebie, lecz niekoniecznie dokładnych odpowiedzi.[42][44]
Halucynacje i bias
NVIDIA w kartach modeli wskazuje, że modele mogą „wzmacniać uprzedzenia i generować toksyczne odpowiedzi, szczególnie przy toksycznych promptach", a także „produkować niedokładne informacje, pomijając kluczowe szczegóły". Otwartość wag i danych umożliwia zewnętrzny audyt.[11][13]
Wymagania obliczeniowe
Gęste modele (Nemotron‑4 340B) wymagają klastra 768 węzłów DGX H100 do pełnego treningu, co ogranicza odtwarzalność dla grup akademickich bez dostępu do porównywalnej infrastruktury. Długi kontekst (1M) podczas inferencji wymaga znacznej ilości VRAM.[3][2]
Degradacja przy rozszerzeniu kontekstu
Przy rozszerzeniu kontekstu do bardzo długich sekwencji obserwowano degradację wyników na benchmarkach z krótkim kontekstem.[32]
Kwantyzacja architektur hybrydowych
Stosowanie bardzo niskiej rozdzielczości bitowej (FP8/NVFP4) w architekturach Mamba‑Transformer prowadzi do niewielkiego spadku dokładności (~1 % na szeregu benchmarków). Problem ten rozwiązuje się poprzez stosowanie selective quantization, co komplikuje architekturę kompilatorów i serwerów inferencji.[2][1]
Pozostałe otwarte problemy
- Zależność od benchmarków z możliwą kontaminacją danych treningowych.
- Brak standardowych protokołów porównywania hybrydowych architektur SSM‑Transformer z czystymi modelami Transformer.
- Kwestia skalowalności podejścia MoE w zadaniach wymagających głębokiego wnioskowania przy małej liczbie ekspertów na token.
- Dane dotyczące Super/Ultra na grudzień 2025 roku są wstępne; pełne benchmarki oczekiwane są po wydaniu.[1]
Aspekty etyczne i regulacyjne
Bezpieczeństwo na etapie opracowania
Na etapie opracowania stosuje się: ocenę według frameworku AEGIS (13 kategorii bezpieczeństwa treści), skaner podatności garak, ręczne „czerwone testowanie" (red‑teaming).[37]
Bezpieczeństwo na etapie inferencji
NeMo Guardrails — otwarte narzędzie (licencja Apache 2.0) dodające programowalne bariery do systemów LLM. Mikroserwis przechwytuje wejścia i wyjścia, stosując konfigurowalne sprawdzenia: kontrola tematu, wykrywanie PII, weryfikacja „ugruntowania" RAG, wykrywanie ataków jailbreak (w tym ochrona przed wstrzykiwaniem kodu opartym na YARA), wielojęzyczna multimodalna klasyfikacja bezpieczeństwa.[45]
Dla Nemotron 3 opublikowano zbiór ~11 000 zaetykietowanych śladów OpenTelemetry z realistycznych scenariuszy z użyciem narzędzi, przeznaczonych do oceny bezpieczeństwa agentowego.[1]
Licencjonowanie
| Modele | Licencja |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (dziedziczona po Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License zezwala na komercyjne wykorzystanie, tworzenie i dystrybucję dzieł pochodnych, nie wymaga atrybucji (przy zachowaniu pliku NOTICE), nie nakłada ograniczeń co do liczby użytkowników i wyraźnie zezwala na używanie wyników modelu do trenowania innych modeli.[46] Modele oparte na Llama dziedziczą ograniczenia Meta, w tym próg 700 mln miesięcznie aktywnych użytkowników.[11]
Dla Nemotron 3 Nano NVIDIA opublikowała: wagi modelu, ponad 10 bln tokenów danych treningowych, przepisy treningowe, bazy kodu (NeMo, Megatron‑LM, NeMo‑Aligner), ponad 10 środowisk uczenia ze wzmocnieniem z 900 000+ zadań.[1][2]
Perspektywy i kierunki badań
Najbliższe wydania obejmują Nemotron 3 Super (~100 mld parametrów, ~10 mld aktywnych) i Nemotron 3 Ultra (~500 mld, ~50 mld aktywnych), oczekiwane w pierwszej połowie 2026 roku. Oba modele będą korzystać z LatentMoE, MTP i treningu w formacie NVFP4 na architekturze Blackwell.[1]
Strategiczny kierunek NVIDIA — pozycjonowanie Nemotron nie jako pojedynczego modelu, lecz jako warstwy infrastrukturalnej dla systemów wieloagentowych, gdzie różne modele rodziny używane są do różnych zadań z routingiem według złożoności.[1][15]
Główne kierunki badawcze:
- Rozwój architektur hybrydowych — dalsza integracja warstw SSM z mechanizmem uwagi dla skalowalnego długiego kontekstu.[12]
- Wielopoziomowe metody kompresji — rozwój Minitron, Puzzle, MiniPuzzle i Nemotron Elastic.[20][21][30]
- Wielodomenowe uczenie ze wzmocnieniem — Nemotron‑CrossThink do rozszerzenia RL poza zadania matematyczne.[31]
- Rozszerzenie kontekstu — Nemotron‑UltraLong do 4 mln tokenów.[32]
- Multimodalność — rozszerzenie w kierunku vision‑language (Nemotron VL), mowy (Nemotron Speech), wizualnego wyszukiwania dokumentów (Nemotron ColEmbed V2).[34][35][36]
- Kompaktowe modele hybrydowe — Jet‑Nemotron (NAS dla modeli 2B/4B).[33]
- Otwarte przepisy — publikacja pełnych przepisów treningowych i danych do odtworzenia i dostosowywania przez społeczność.[14]
Zobacz też
- Architektura Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (rodzina modeli Meta)
Odnośniki
- NVIDIA Research — strona Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — dokumentacja Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
Literatura
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, luty 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, czerwiec 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, czerwiec 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, lipiec 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, listopad 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, styczeń 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, kwiecień 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, maj 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, sierpień 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, sierpień 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, listopad 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, grudzień 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, grudzień 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
Przypisy
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/