Nemotron (NVIDIA) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — משפחת מודלים לשוניים גדולים (Large Language Model, LLM) עם משקלים פתוחים, שפותחה על ידי חטיבת Applied Deep Learning Research (ADLR) של תאגיד NVIDIA. המודלים שייכים לתחום Machine Learning ועיבוד שפה טבעית (Natural Language Processing, NLP) ומיועדים למגוון רחב של משימות: יצירת נתונים סינתטיים, הסקה לוגית (reasoning), יישומים אגנטיים (agentic AI) ופריסה על ציוד תעשייתי של NVIDIA. המשפחה כוללת מודלים בארכיטקטורות וסקאלות שונות: בין 4 מיליארד לכ-500 מיליארד פרמטרים, לרבות מודלי Transformer מסוג decoder‑only צפופים (dense) מסדרת Nemotron‑4 (2024), היברידיים Mamba‑Transformer (Nemotron‑H, 2025) והיברידיים Mamba‑Transformer עם Mixture-of-Experts (MoE) בסדרת Nemotron 3 (2025). נכון למרץ 2026, המשפחה כוללת יותר מ-20 מודלים המכסים משימות של יצירת טקסט, הסקה, הבנה חזותית של מסמכים, חילוץ מידע והערכת איכות תשובות. המודלים מופצים בעיקר עם משקלים פתוחים תחת רישיונות NVIDIA Open Model License ו-Llama Community License.[1][2][3]

היסטוריה ורקע

פיתוח משפחת Nemotron מתנהל בהקשר האסטרטגיה של NVIDIA ליצירת מחסנית כלים מלאה לבינה מלאכותית גנרטיבית: מתשתית אימון (DGX, מחשבי-על מבוססי GPU H100/B200) ועד פלטפורמות אימון (NeMo Framework), יישור (NeMo‑Aligner), פריסה (NIM — NVIDIA Inference Microservices) ואבטחה (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

המודל הראשון הזמין לציבור בסדרה — Transformer מסוג מפענח עם 8 מיליארד פרמטרים והקשר של 4096 token, שאומן על 3.8 טריליון token ב-53 שפות טבעיות ו-37 שפות תכנות. האימון בוצע על 1024 GPU מסוג A100 במשך 19 ימים. לא פורסם דוח טכני רשמי ב-arXiv. המודל הופץ דרך NeMo Framework ו-Hugging Face, וקיימו גרסאות Chat (SFT ו-SteerLM). הרישיון — NVIDIA AI Foundation Models Community License.[6][7]

הערה על שמות: "Nemotron‑3" משנת 2023 ו"Nemotron 3" מדצמבר 2025 הם מודלים שונים. הראשון היה אב-טיפוס מוקדם, השני — הדור העדכני עם ארכיטקטורת MoE.

Nemotron‑4 15B (פברואר 2024)

המהדורה המתועדת ציבורית הראשונה של סדרת Nemotron‑4 — מודל עם 15 מיליארד פרמטרים, שאומן על 8 טריליון token במשך כ-13 ימים קלנדריים על 384 צמתי DGX H100 (עד 3072 GPU). נעשה שימוש בפרלליזם טנסורי פי-8 ופרלליזם נתונים בין 96 ל-288. ה-MFU (Model FLOPs Utilization) השיאית הייתה 34.3% עם batch size של 384. הארכיטקטורה — Transformer מסוג decoder‑only עם Grouped‑Query Attention (GQA) ו-Rotary Position Embeddings (RoPE). על פי תוצאות ה-benchmark בעת הפרסום, המודל עלה על כל המודלים הפתוחים בגודל דומה במשימות רב-לשוניות, כולל מספר מודלים גדולים ממנו פי ארבעה.[8]

Nemotron‑4 340B (יוני 2024)

ביוני 2024 שוחרר המודל הגדול ביותר של סדרת Nemotron‑4 — 340 מיליארד פרמטרים (331.6 מיליארד שאינם embedding), שעבר אימון מקדים על 9 טריליון token (8 טריליון אימון מקדים + 1 טריליון אימון המשך עם שקלול-מחדש של מקורות באיכות גבוהה). האימון בוצע על 768 צמתי DGX H100 (עד 6144 GPU) עם MFU שיאית של 42.4%, בין דצמבר 2023 למאי 2024. המשפחה כוללת שלושה גרסאות: Base, Instruct ו-Reward. גודל המודל נבחר כך שייכנס לצומת DGX H100 בודד (8 GPU) בעת פריסה בפורמט דיוק FP8. יותר מ-98% מהנתונים שנעשה בהם שימוש ביישור (alignment) נוצרו סינתטית על ידי מודלי הסדרה עצמם בתהליך איטרטיבי; צינור יצירת הנתונים הסינתטיים פתוח לשחזור.[3]

Llama‑3.1‑Nemotron‑70B (אוקטובר 2024)

באוקטובר 2024 שוחררו מודלים שעברו כוונון עדין מתוך Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct ו-Llama‑3.1‑Nemotron‑70B‑Reward. נכון ל-1 באוקטובר 2024, מודל ה-Instruct תפס את המקום הראשון בו-זמנית בשלושה benchmark אוטומטיים: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench (GPT‑4‑Turbo) — 8.98. מודל ה-Reward השיג 94.1% על RewardBench.[9][10]

המעבר לארכיטקטורות היברידיות (2025)

ב-2025 הורחבה הסדרה בארכיטקטורות היברידיות המשלבות שכבות Mamba‑2 (State Space Model, SSM — מודל מרחב מצבים) ו-Transformer. בין מרץ למאי 2025 שוחררה משפחת מודלי ההסקה Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) עם מצב הסקה הניתן לשינוי.[11] באפריל 2025 פורסם Nemotron‑H (arXiv:2504.03624) — משפחת מודלים היברידיים Mamba‑Transformer בגדלים של 8B, 56B ו-47B פרמטרים.[12] באוגוסט 2025 הוצג Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]

Nemotron 3 (דצמבר 2025)

ב-15 בדצמבר 2025 הוכרז הדור השלישי — משפחת Nemotron 3 עם מודלי Nano, Super ו-Ultra, המאחדת ארכיטקטורות Mamba‑2, Transformer ו-MoE עם חלון הקשר של עד 1 מיליון token. Nano שוחרר עם דוח טכני; Super ו-Ultra מתוכננים לחצי הראשון של 2026.[1][2][14][15]

יסודות תיאורטיים

ארכיטקטורת Transformer ב-Nemotron‑4

מודלי סדרת Nemotron‑4 בנויים על ארכיטקטורת Transformer מפענח סטנדרטית עם attention סיבתי. ההסתברות של רצף ה-token x1,x2,,xT מתפרקת כ:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

כאשר θ — פרמטרי המודל.[8]

מנגנון ה-attention מממש בגרסת Grouped‑Query Attention (GQA)[16]:

Attention(Q,K,V)=softmax(QKdk)V,

כאשר Q,K,V — מטריצות השאילתות, המפתחות והערכים; dk — מימד ראש ה-attention.

לקידוד מיקומים נעשה שימוש ב-Rotary Position Embeddings (RoPE)[17]:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

כאשר xm — וקטור במיקום m, θi=100002i/d, d — מימד הוקטור.

בשכבות ה-MLP נעשה שימוש באקטיבציה Squared ReLU: f(x)=(max(0,x))2, המבטיחה דלילות אקטיבציות. המודלים אינם מכילים הטיות (bias), אינם משתמשים ב-dropout, ומטריצות ה-embedding של הכניסה והיציאה אינן קשורות זו לזו (untied embeddings). מנתח ה-token — SentencePiece BPE עם שמירת רווחים, פירוק ספרות לתווים ו-fallback בייתי, גודל אוצר המילים — 256,000.[8][3]

פרמטרים ארכיטקטוניים של Nemotron‑4
פרמטר Nemotron‑4 15B Nemotron‑4 340B
מספר פרמטרים 15 מיליארד (3.2 מיליארד embed.) 340 מיליארד (9.4 מיליארד embed.)
מספר שכבות 32 96
מימד נסתר 6144 18,432
ראשי attention 48 96
ראשי KV (GQA) 8 8
אורך הקשר 4096 4096
גודל אוצר מילים 256,000 256,000

מקורות: arXiv:2402.16819, arXiv:2406.11704.[8][3]

ארכיטקטורה היברידית Mamba‑Transformer (Nemotron‑H)

במודלי Nemotron‑H, בלוקי self-attention סטנדרטיים מוחלפים בחלקם בבלוקי Mamba‑2 — מודלי מרחב מצבים (State Space Models, SSM). ביצירת autoregressive, כל שכבת self-attention דורשת O(n) פעולות וזיכרון לכל צעד (בשל KV‑cache), בעוד שכבות Mamba מספקות עלויות זיכרון וחישוב קבועות לכל token שנוצר.[12]

Mamba‑2 מתואר ביחס רקורסיבי[18]:

ht=Aht1+Bxt,yt=Cht,

כאשר htN — המצב הנסתר, AN×N — מטריצת מעבר מצבים אלכסונית, BN×1 ו-C1×N — מטריצות הקרנה, xt — token הכניסה, yt — אות הפלט. ב-Mamba‑2, המטריצות A, B, C תלויות בכניסה (input‑dependent), מה שמבדיל את המודל מ-SSM לינאריים קלאסיים.

ב-Nemotron‑H‑56B נעשה שימוש ב-54 שכבות Mamba‑2 + 54 שכבות MLP + 10 שכבות self-attention, כאשר שכבות ה-attention פרוסות באופן שווה בין שכבות ה-Mamba. המודל אומן על 20 טריליון token בפורמט FP8 (per‑tensor scaling) על 6144 GPU מסוג H100. גרסת Nemotron‑H‑8B מכילה 24 שכבות Mamba‑2, 24 שכבות MLP ו-4 שכבות self-attention; האימון בוצע על 15 טריליון token.[12]

ארכיטקטורת MoE של Nemotron 3

מודלי Nemotron 3 (דצמבר 2025) משלבים שלושה רכיבים ארכיטקטוניים: Mamba‑2, Transformer ו-Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) מכיל 52 שכבות: 23 שכבות Mamba‑2 + MoE, 23 שכבות MoE ו-6 שכבות GQA‑attention. כל שכבת MoE כוללת 128 מומחים מנותבים (routed) + מומחה משותף (shared) אחד, מתוכם 6 מומחים מופעלים עבור כל token. הניתוב מבוצע על ידי MLP router מאומן עם sigmoid gating. איזון עומסים מיושם ללא פונקציית הפסד עזר (aux‑loss‑free). סך הפרמטרים הוא 31.6 מיליארד, אך הפעילים לכל token — רק 3.2 מיליארד.[2]

הנרמול — RMSNorm[19]. embedding מיקומיים בחלקי Mamba נעדרים (המידע המיקומי משתמע ממצב ה-SSM). נעשה שימוש ב-embedding בלתי-קשורים, ללא dropout וללא bias בשכבות הלינאריות.[2]

הרחבות ב-Super/Ultra: LatentMoE ו-Multi‑Token Prediction

מודלי Super ו-Ultra ממשפחת Nemotron 3 משתמשים בשתי חידושים ארכיטקטוניים נוספים:

  • Latent MoE (LatentMoE) — הקרנת ייצוג הכניסה למרחב סמוי בממד קטן יותר לפני הניתוב, מה שמאפשר הגדלת מספר המומחים בעלויות חישוביות דומות ושיפור הדיוק ללא ירידה בתפוקה.[1]
  • Multi‑Token Prediction (MTP) — חיזוי מספר token עתידיים בו-זמנית, המשמש לשיפור איכות טקסטים ארוכים ולפענוח ספקולטיבי (speculative decoding) בעת inference.[1]

אימון Super ו-Ultra מתבצע בפורמט NVFP4 — פורמט מספרי 4-סיביות של NVIDIA על ארכיטקטורת Blackwell.[1]

שיטות דחיסת מודלים: Minitron, Puzzle, MiniPuzzle

ליצירת מודלים קומפקטיים, NVIDIA מיישמת מספר גישות:

  • Minitron — שיטת גיזום מובנה (pruning) ודיסטילציית ידע (knowledge distillation). נחקרים שני סוגי גיזום: לפי עומק (הסרת שכבות) ולפי רוחב (הקטנה משותפת של מימדי שכבות נסתרות, ראשי attention ו-MLP). הפעלת Minitron על Nemotron‑4 15B מאפשרת קבלת מודלי 8B ו-4B עם הפחתת עלויות אימון עד פי 40 בהשוואה לאימון מאפס.[20]
  • Puzzle — אלגוריתם Neural Architecture Search (NAS) המוצא את התצורה האופטימלית של כל בלוק (מספר ראשי KV, גודל FFN, נוכחות/היעדר attention) עם דיסטילציה לפי בלוקים. כך דוחס Llama 3.1 405B ל-253B (Llama‑Nemotron Ultra), ו-Llama 3.3 70B ל-49B (Llama‑Nemotron Super).[21]
  • MiniPuzzle — הרחבה של Puzzle לארכיטקטורות היברידיות, שדחסה את Nemotron‑H‑56B ל-47B בעלות של 63 מיליארד token בלבד של דיסטילציה. בדיוק דומה, המודל הדחוס מהיר ב-20%.[12]

שיטות יישור

HelpSteer ו-HelpSteer2

HelpSteer — מאגר של 37,120 דוגמאות (רישיון CC‑BY‑4.0), שנוצר בשיתוף Scale AI, שבו כל תשובה מוערכת לפי חמישה תכונות: שימושיות (helpfulness), נכונות (correctness), קוהרנטיות (coherence), מורכבות (complexity) ורהיטות (verbosity) בסולם ליקרט 0–4.[22]

HelpSteer2 — מאגר מעודכן של 21,362 דוגמאות (10,681 prompt × 2 תשובות), שבו יותר מ-95% מה-prompt נלקחו מ-ShareGPT (בקשות משתמשים אמיתיות). כ-50% מהסיווגים סוננו כבלתי-איכותיים מספיק. ההרחבה HelpSteer2‑Preference מוסיפה העדפות זוגיות של מסווגים, המאפשרת אימון מודלי תגמול רגרסיוניים וזוגיים כאחד על אותם נתונים.[23][24]

SteerLM

SteerLM — שיטת SFT (Supervised Fine‑Tuning — אימון מפוקח) עם התניה על תכונות (helpfulness, correctness, coherence, complexity, verbosity), המאפשרת למשתמש לשלוט בסגנון התשובה בזמן inference. הצינור כולל: (1) אימון מודל חיזוי תכונות (APM) על HelpSteer, (2) תיוג נתונים בעזרת APM, (3) SFT עם התניה על ערכי תכונות יעד, (4) bootstrapping.[25]

DPO ו-RPO

DPO (Direct Preference Optimization) — שיטה לאופטימיזציה ישירה של העדפות ללא מודל תגמול מפורש, המשמשת בצינורי Nemotron‑4 340B Instruct ו-Nemotron Nano 2.[26]

RPO (Reward‑aware Preference Optimization) — מסגרת מתמטית מאוחדת של NVIDIA המכלילה DPO, IPO, SimPO, REINFORCE ו-SteerLM 2.0 כמקרים פרטיים. RPO ממזער את המרחק בין תחזיות מודל התגמול המשתמע למודל התגמול המפורש היעד[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

כאשר rϕ — מודל תגמול מפורש, πθ — מדיניות מאומנת, πref — מדיניות ייחוס, d(,) — פונקציית מרחק, yw/yl — תשובה מועדפת/דחויה. RPO מיושם באימון Nemotron‑4 340B Instruct ומודלי Llama‑Nemotron.[27][3][11]

למידה מחיזוקים רב-סביבתית (RLVR)

ב-Nemotron 3 מיושם Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — אימון בו-זמני במספר סביבות במסגרת NeMo Gym: מתמטיקה תחרותית, תכנות, QA, שימוש בכלים (tool‑use), instruction‑following, הקשר ארוך. האלגוריתם — GRPO (Group Relative Policy Optimization) עם masked importance sampling.[2][14]

Nemotron 3 תומך בשליטה גרנולרית בתקציב ההסקה (reasoning budget control): המשתמש יכול להגדיר מגבלת token לעקבת ה-thinking דרך דגל ב-chat template (החלפה בין "detailed thinking on/off" או הגבלת אורך).[2]

סדרת המודלים

טבלת סיכום

מודל שנה סה"כ / פרמטרים פעילים הקשר ארכיטקטורה תכונות מרכזיות
Nemotron‑3 8B 2023 8B / 8B 4K Dense Transformer 3.8T token; 1024 GPU A100; 19 ימים
Nemotron‑4 15B 2024 15B / 15B 4K Dense Transformer 8T token; MFU 34.3%
Nemotron‑4 340B 2024 340B / 340B 4K Dense Transformer 9T token; Base/Instruct/Reward; >98% נתונים סינתטיים ל-alignment
Llama‑3.1‑Nemotron‑70B 2024 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE); RewardBench 94.1%
Llama‑Nemotron Nano 8B 2025 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B 2025 4B / 4B 128K Dense Transformer (Minitron) דחיסת NAS מ-Llama 3.1 8B
Llama‑Nemotron Super 49B 2025 49B / 49B 128K Dense Transformer (Puzzle NAS) מ-Llama 3.3 70B
Llama‑Nemotron Ultra 253B 2025 253B / 253B 128K Dense Transformer (Puzzle NAS) מ-Llama 3.1 405B; GPQA 76.0%
Nemotron‑H 8B 2025 8B / 8B היברידי Mamba‑Transformer 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B 2025 56B / 56B היברידי Mamba‑Transformer 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B 2025 47B / 47B ~1M (FP4) היברידי Mamba‑Transformer MiniPuzzle מ-56B; +20% מהירות
Nemotron Nano 2 (9B) 2025 12B → 9B / 9B 128K היברידי Mamba‑Transformer 20T token; דיסטילציית Minitron
Nemotron 3 Nano 2025 31.6B / 3.2B 1M היברידי Mamba‑Transformer MoE 25T token; 128 מומחים, 6 פעילים
Nemotron 3 Super 2025–2026 ~100B / ~10B 1M היברידי LatentMoE MTP; NVFP4
Nemotron 3 Ultra 2025–2026 ~500B / ~50B 1M היברידי LatentMoE MTP; NVFP4

Nemotron‑4 15B

ארכיטקטורה: 32 שכבות, hidden dimension 6144, 48 ראשי attention, 8 ראשי KV (GQA). סך הפרמטרים — 15 מיליארד (3.2 מיליארד embedding + 12.5 מיליארד non‑embedding). תוצאות: MMLU — 64.2% (5‑shot), BBH — 58.7% (3‑shot), GSM8K — 46.0% (8‑shot, maj@1), HumanEval — 31.6% (0‑shot, pass@1). ב-benchmark רב-לשוניים (XCOPA, TyDiQA‑GoldP, MGSM) המודל עלה על מודלים גדולים ממנו פי ארבעה.[8]

Nemotron‑4 340B

ארכיטקטורה: 96 שכבות, hidden dimension 18,432, 96 ראשי attention, 8 ראשי KV.

Nemotron‑4 340B Base הציג: MMLU — 81.1% (5‑shot), BBH — 85.4% (3‑shot), HumanEval — 57.3% (0‑shot), ARC‑Challenge — 94.3% (25‑shot).[3]

Nemotron‑4 340B Instruct עבר יישור רב-שלבי: Code SFT → General SFT → DPO → RPO (3 סבבים). תוצאות: MT‑Bench — 8.22 (שופט GPT‑4‑Turbo), MMLU — 78.7% (0‑shot), GSM8K — 92.3% (0‑shot), HumanEval — 73.2% (0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%.[3]

Nemotron‑4 340B Reward מחליף את שכבת ה-softmax הסופית בהקרנה לינארית של המצב הנסתר של השכבה האחרונה לוקטור של 5 תכונות HelpSteer2. התגמול הסופי — סכום משוקלל של חמשת התכונות. האימון בוצע בשתי אפוכים על נתוני HelpSteer2 (batch size 128). על RewardBench המודל השיג 92.0%, עולה על GPT‑4o (84.7%), Gemini 1.5 Pro (88.1%) ו-Claude‑3‑Opus (80.7%) בעת הפרסום.[3]

מודל Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54.2 41.5% 8.22
Llama‑3‑70B‑Instruct 41.1 34.4% 8.16
Mixtral‑8x22B‑Instruct 36.4 30.9% 7.63
Qwen‑2‑72B‑Instruct 48.1 38.8% 8.26

מקור: arXiv:2406.11704, טבלה 5.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward אומן בשיטה היברידית המשלבת Bradley‑Terry (העדפות זוגיות) ורגרסיית SteerLM (הערכה רב-תכונתית בסולם ליקרט). האימון בוצע אך ורק על נתוני HelpSteer2 (CC‑BY‑4.0). על RewardBench המודל השיג 94.1%, ותפס את המקום הראשון בעת הפרסום.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct יושר בשיטת RLHF עם אלגוריתם REINFORCE (לא PPO) ומודל תגמול Nemotron‑70B‑Reward. התשתית — NeMo‑Aligner עם האצת TRT‑LLM.[9]

Llama‑Nemotron: Nano, Super, Ultra (2025)

משפחת מודלי הסקה שהתקבלה מ-Llama 3.x בשיטות NAS, דיסטילציה ואחר-אימון מורחב.[11]

מודל פרמטרים מודל בסיס הקשר
Llama‑Nemotron‑Nano 8B 8 מיליארד Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B 4 מיליארד Minitron 4B (מ-Llama 3.1 8B) 128K
Llama‑Nemotron‑Super 49B 49 מיליארד Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B 253 מיליארד Llama‑3.1‑405B → NAS (Puzzle) 128K

צינור אימון בחמישה שלבים: (1) NAS + FFN Fusion, (2) דיסטילציה + אימון מקדים המשכי, (3) SFT (כולל עקבות הסקה של DeepSeek‑R1), (4) RL בקנה-מידה גדול (GRPO עבור Ultra, REINFORCE/RLOO + Online RPO עבור Nano), (5) יישור לדיאלוג.[11]

המודלים הם ראשוני ה-LLM הפתוחים התומכים במצב הסקה הניתן לשינוי (reasoning toggle): כאשר מופעל ("detailed thinking on" בהנחיית המערכת), המודל מייצר שרשרת הסקה בתגיות <think>...</think> לפני התשובה; כאשר כבוי — עונה ישירות.[11]

תוצאות Llama‑Nemotron‑Ultra 253B (reasoning מופעל): GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%. לשם השוואה: DeepSeek‑R1 (671B סה"כ / 37B פעיל) — GPQA Diamond 71.5%, AIME 2024 ~79.8%. Ultra ממוקם בצומת בודד של 8×H100.[11]

Nemotron‑H (אפריל 2025)

משפחת מודלים היברידיים צפופים, שאומנו מאפס ותוכננו למשימות עם יצירות ארוכות. Nemotron‑H‑56B אומן על 20 טריליון token בפורמט FP8 — אחד הניסויים הציבוריים הגדולים ביותר של אימון מקדים FP8. Nemotron‑H‑47B התקבל בדחיסת 56B בשיטת MiniPuzzle (63 מיליארד token של דיסטילציה) ומתאים לזיכרון של RTX 5090 בודד (FP4) עם הקשר של ~1M token.[12]

Benchmark Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60.5 61.8 58.8 51.3
MMLU (5‑shot) 84.2 83.6 86.1 78.8
GSM8K (8‑shot CoT) 93.7 93.3 90.9 83.9
HumanEval (0‑shot) 60.4 61.0 56.7 57.3

מקור: arXiv:2504.03624.[12]

ביצירה עם 65,536 token קלט ו-1024 token פלט על H100, מודל Nemotron‑H‑47B עבד מהר פי 2.9 מ-Qwen‑2.5‑72B ו-Llama‑3.1‑70B.[12]

Nemotron Nano 2 (אוגוסט 2025)

מודל היברידי Mamba‑Transformer להסקה. Nemotron‑Nano‑12B‑v2‑Base — מודל האב עם 62 שכבות (בעיקר Mamba‑2 + MLP + 4 שכבות attention), שאומן על 20 טריליון token בפורמט FP8 מאפס. ממנו התקבל בשיטת Minitron מורחב Nemotron‑Nano‑9B‑v2, המסוגל לעבוד בהקשר של 128K token על GPU בודד NVIDIA A10G (22 ג"ב, BF16). אחר-אימון: SFT (80 מיליארד token, כולל עקבות DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. על benchmark של הסקה, המודל דומה ל-Qwen3‑8B בדיוק, אך מגיע לתאוצה פי 3–6 ביצירה ברצפי פלט ארוכים.[13]

Nemotron 3 Nano 30B‑A3B

שוחרר בדצמבר 2025. פרמטרים: 31.6 מיליארד סה"כ, 3.2 מיליארד פעילים. ארכיטקטורה: 52 שכבות, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 מומחים מנותבים + 1 משותף, 6 פעילים לכל token. הקשר — עד 1,048,576 token. אימון על 25 טריליון token (לוח זמנים WSD, batch size 3072, תאריך חיתוך נתונים — יוני 2025) בשתי פאזות: פאזה 1 — 23.5 טריליון (נתונים מגוונים), פאזה 2 — 1.5 טריליון (נתונים איכותיים) + 121 מיליארד token של CPT להקשר ארוך.[2]

Benchmark Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78.30 80.9 75.0
AIME25 (ללא כלים) 89.06 85.0 91.7
AIME25 (עם כלים) 99.17 98.7
GPQA (ללא כלים) 73.04 73.4 71.5
LiveCodeBench v6 68.25 66.0 61.0
SWE‑Bench (OpenHands) 38.76 22.0* 34.0
TauBench V2 Avg 49.04 47.7 47.5
Arena‑Hard‑V2 Avg 67.65 57.8 48.55
RULER‑100 @ 1M 86.34 77.5

* — ערכים ממקורות משניים; תנאי שחזור — NeMo Evaluator SDK. מקור: arXiv:2512.20848.[2][28]

תפוקה (8K קלט / 16K פלט, H200 בודד): גבוהה פי 3.3 מ-Qwen3‑30B‑A3B‑Thinking ופי 2.2 מ-GPT‑OSS‑20B.[2]

מודלים וכיוונים נוספים

  • OpenReasoning‑Nemotron (יולי 2025) — סדרת מודלים בגדלים 1.5B–32B פרמטרים, המבוססים על Qwen 2.5 וכוונונם העדין על נתוני DeepSeek‑R1‑0528. גרסת 32B עם GenSelect@64 עולה על o3 (high) במספר benchmark מתמטיים.[29]
  • Nemotron Elastic (arXiv:2511.16664) — מסגרת תת-מודלים מקוננים (6B, 9B, 12B) במסגרת מודל-אב אחד, המפחיתה עלות אימון פי 360 בהשוואה לאימון מאפס.[30]
  • Nemotron‑CrossThink — מסגרת למידה מחיזוקים רב-תחומית מעבר למשימות מתמטיות, שהניבה +30.1% על MATH‑500 ו-+12.8% על MMLU‑PRO.[31]
  • Nemotron‑UltraLong — הרחבת הקשר עד 4 מיליון token.[32]
  • Jet‑Nemotron — NAS לאחר-אימון למודלים היברידיים קומפקטיים 2B/4B.[33]

מודלים מתמחים

באקוסיסטם Nemotron קיימים גם מודלים למשימות מתמחות:

  • Nemotron Nano V2 VL — מודל vision‑language ל-OCR, עיבוד טבלאות ווידאו.[34]
  • Nemotron Parse 1.1 — מודל ל-OCR וחילוץ מבנה מסמכים.[35]
  • Nemotron ColEmbed V2 — מודל embedding לחיפוש חזותי של מסמכים (late interaction).[36]
  • Nemotron Speech — מודלים לזיהוי דיבור אוטומטי (ASR), סינתזת דיבור (TTS) ותרגום מכונה (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — מודל סיווג תוכן לא-בטוח ב-23 קטגוריות ב-9 שפות עם דיוק 84.2%.[37]

נתוני אימון מקדים

הרכב נתוני Nemotron‑4

אוסף האימון המקדים של Nemotron‑4 15B ו-340B מורכב משלוש קטגוריות עיקריות: טקסטים אנגליים (70%), טקסטים רב-לשוניים ב-53 שפות (15%) וקוד מקור ב-43 שפות תכנות (15%). הוחל כפילות-ביטול ברמת המסמך (exact ו-near‑duplicate), כמו גם סינון באמצעות מודלים לשוניים והיוריסטיקות. מודל 15B אומן על 8 טריליון token, מודל 340B — על 9 טריליון (8 טריליון אימון מקדים + 1 טריליון אימון המשכי עם שקלול-מחדש של מקורות איכותיים).[8][3]

Nemotron‑CC

מאגר הנתונים Nemotron‑CC נוצר מ-Common Crawl תוך שימוש במכלול מסווגי איכות וניסוח מחדש סינתטי של טקסטים. הנפח הכולל — 6.3 טריליון token (4.4 טריליון לאחר כפילות-ביטול + 1.9 טריליון ניסוחים מחדש סינתטיים). הצינור משולב בכלי NeMo Curator. העבודה התקבלה כ-Long Paper בכנס ACL 2025.[38]

Nemotron‑CC‑Math

תת-קבוצה מוטת-מתמטיקה בנפח של 133 מיליארד token, שחולצה מ-Common Crawl באמצעות צינור Lynx + LLM תוך שמירה על מבנה נוסחאות מתמטיות וקוד ב-LaTeX.[39]

נתוני Nemotron 3 Nano

האימון המקדים של Nemotron 3 Nano בוצע על 25 טריליון token. המאגר כולל: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 ו-dataset מתמחים בתחום STEM. לאימון הקשר ארוך נעשה שימוש בנוסף ב-121 מיליארד token של CPT.[2]

Nemotron Pretraining Dataset v1

מאגר שנוצר סינתטית המכסה STEM, טקסטים אקדמיים, משימות הסקה ותחומים רב-לשוניים; מכיל יותר מ-10 טריליון token לשוניים ו-18 מיליון דוגמאות ל-SFT. כל מאגרי הנתונים מופצים ברישיונות פתוחים ומתירניים.[40]

צינור יצירת נתונים סינתטיים (SDG)

הצינור המתואר בדוח על Nemotron‑4 340B כולל את השלבים הבאים[3]:

  • יצירת prompt: בקשות סינתטיות חד- ודו-סבביות שנוצרו באמצעות Mixtral‑8x7B‑Instruct‑v0.1 (רישיון Apache 2.0) לפי תבניות Open QA, Writing, Closed QA, Math & Coding.
  • יצירת תשובות: תשובות מרובות מגרסאות ביניים של מודלים להבטחת מגוון.
  • הערכת איכות: שלוש גישות — Ground‑Truth‑as‑a‑Judge (למשימות עם תשובה ניתנת לאימות), LLM‑as‑Judge (השוואת זוגות תשובות על ידי מודל לשוני), Reward‑Model‑as‑Judge (שימוש ב-Nemotron‑4‑340B‑Reward).
  • יישור איטרטיבי מהחלש לחזק (weak‑to‑strong).

מכ-~20,000 דוגמאות מוערכות על ידי בני-אדם (10,000 ל-SFT, 10,000 HelpSteer2 למודל התגמול) סוּנתז כל שאר נפח נתוני היישור.[3]

כימות ואופטימיזציית inference

מודלי Nemotron 3 Nano תומכים ב-Post‑Training Quantization (PTQ) בפורמט FP8 תוך שימוש ב-ModelOpt ו-Megatron‑LM. מיושם כימות סלקטיבי — שכבות attention וחלק משכבות Mamba נשמרות ב-BF16 לשמירת האיכות; השאר מכומתות ל-FP8. על פי הדוח הטכני, הדבר מבטיח ~99% שמירה על הדיוק.[2] Nano תומך גם ב-inference בפורמט NVFP4.[1]

טבלת benchmark מסכמת לפי דורות

מודל MMLU GSM8K HumanEval Arena Hard MT‑Bench תנאים
Nemotron‑4 15B 64.2% 46.0% 31.6% base; 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81.1% 57.3% 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78.7% 92.3% 73.2% 54.2 8.22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85.0 8.98 אוק' 2024
LN‑Ultra 253B (reasoning מופעל) GPQA 76.0%, AIME 80.8%
Nemotron‑H‑47B 83.6% 93.3% 61.0% 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67.7 (v2) AIME25 89.1%, LCB 68.3%

יש לפרש את ההשוואה בזהירות: תנאי ההערכה, גרסאות ה-benchmark ותאריכי הבדיקות שונים בין הדורות. התוצאות לקוחות מדוחות טכניים של NVIDIA; הערכות עצמאיות עשויות להיות שונות (ראו סעיף "מגבלות").[8][3][9][11][12][2]

יישומים

פריסה דרך NVIDIA NIM

NVIDIA NIM — אוסף מיקרו-שירותי קונטיינרים מאופטמיים ל-inference עם API תואם OpenAI. מודלי Nemotron זמינים כמיקרו-שירותי NIM בפלטפורמה build.nvidia.com. NIM תומך בפורמטים FP8, BF16, NVFP4 ובפריסה דרך Helm charts על Kubernetes. המודלים תואמים גם לפריימוורקים עצמאיים: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]

יצירת נתונים סינתטיים

Nemotron‑4 340B תוכנן לשימוש כמחולל נתונים סינתטיים: מודל ה-Instruct מייצר תשובות, ומודל ה-Reward מעריך ומסנן אותן. רישיון NVIDIA Open Model License מתיר במפורש שימוש בפלטי המודל לאימון מודלים אחרים. על פי נתוני ServiceNow, 15% מנתוני האימון המקדים של המודל שלהם Apriel 1.6 הגיעו ממאגרי נתונים של Nemotron.[3][15][41]

מערכות אגנטיות

מודלי משפחת Nemotron 3 (Nano, Super, Ultra) מיועדים לעומסי עבודה רב-אגנטיים: תכנון, retrieval, קריאה לכלים (tool use). Nemotron 3 Nano מציג תוצאה של 38.76% על SWE‑Bench (עם OpenHands) ו-49.04% (ממוצע) על TauBench V2.[2]

יישומים ארגוניים

בין השותפים המוצהרים: ServiceNow (מודל משותף Apriel Nemotron 15B לאוטומציה של תהליכי עבודה), CrowdStrike (פלטפורמת Charlotte AI), Perplexity (ניתוב בקשות), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. המודלים זמינים על AWS Amazon Bedrock; מתוכננת תמיכה ב-Google Cloud, CoreWeave, Nebius.[15]

מגבלות ובעיות פתוחות

הערכות עצמאיות וסתירות עם נתוני NVIDIA

הערכות עצמאיות מגלות פערים לעומת התוצאות שמציגה NVIDIA. על פי נתוני Artificial Analysis (פברואר 2026), Llama‑Nemotron‑Ultra 253B (עם הסקה) קיבל Intelligence Index של 15 בעוד החציון עמד על 26 למודלים בגודל דומה. בפלטפורמת Chatbot Arena (LMArena) מודלי Nemotron ממוקמים באמצע הדירוג: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (כ-מקום 147), Nemotron 3 Nano — 1317 ±6 (כ-מקום 164).[42][43]

רהיטות יתר

מודלי Nemotron מציגים רהיטות-יתר: בהערכת Artificial Analysis, מודל Nemotron 3 Nano ייצר 140 מיליון token (בעוד החציון עמד על 12 מיליון למודלים אחרים), מה שמגדיל את עלות ה-inference. ניתוח של קהילת DEV מצא כי Llama‑3.1‑Nemotron‑70B‑Instruct, בעוד שהוביל רשמית ב-benchmark אוטומטיים, הפגין דיוק לא מספק במספר משימות מעשיות, וציוני גבוה ב-benchmark מסוג Arena עשויים לשקף העדפה לתשובות רהוטות ובטוחות אך לא בהכרח מדויקות.[42][44]

הזיות ו-bias

NVIDIA מציינת בכרטיסי המודל כי המודלים עשויים "לחזק דעות קדומות וליצור תשובות רעילות, במיוחד בתגובה ל-prompt רעילים", וכן "לייצר מידע לא מדויק ולהשמיט פרטים מרכזיים". פתיחות המשקלים והנתונים מאפשרת ביקורת חיצונית.[11][13]

דרישות חישוביות

מודלים צפופים (Nemotron‑4 340B) דורשים אשכול של 768 צמתי DGX H100 לאימון מלא, מה שמגביל את יכולת השחזור עבור קבוצות אקדמיות ללא גישה לתשתית דומה. הקשר ארוך (1M) בזמן inference דורש נפח VRAM ניכר.[3][2]

דגרדציה בהרחבת הקשר

עם הרחבת ההקשר לרצפים ארוכים במיוחד, נצפתה דגרדציה בתוצאות ה-benchmark עם הקשר קצר.[32]

כימות ארכיטקטורות היברידיות

שימוש ברזולוציה נמוכה במיוחד (FP8/NVFP4) בארכיטקטורות Mamba‑Transformer גורם לירידה קטנה בדיוק (~1% במספר benchmark). בעיה זו נפתרת על ידי שימוש בכימות סלקטיבי, מה שמסבך את ארכיטקטורת המהדרים ושרתי ה-inference.[2][1]

בעיות פתוחות נוספות

  • תלות ב-benchmark עם זיהום אפשרי של נתוני אימון.
  • היעדר פרוטוקולים סטנדרטיים להשוואת ארכיטקטורות היברידיות SSM‑Transformer עם מודלי Transformer טהורים.
  • שאלת הסקלאביליות של גישת ה-MoE במשימות הדורשות הסקה עמוקה עם מספר מועט של מומחים לכל token.
  • הנתונים על Super/Ultra נכון לדצמבר 2025 הם ראשוניים; benchmark מלאים צפויים לאחר השחרור.[1]

היבטים אתיים ורגולטוריים

בטיחות בשלב הפיתוח

בשלב הפיתוח מיושמים: הערכה לפי מסגרת AEGIS (13 קטגוריות בטיחות תוכן), סורק פגיעויות garak, "בדיקת חדירה" ידנית (red‑teaming).[37]

בטיחות בשלב ה-inference

NeMo Guardrails — ערכת כלים פתוחה (רישיון Apache 2.0), המוסיפה מחסומים הניתנים לתכנות למערכות LLM. המיקרו-שירות מיירט כניסות ויציאות, ומחיל בדיקות הניתנות להגדרה: בקרת נושא, זיהוי PII, אימות "עיגון" RAG, זיהוי מתקפות jailbreak (כולל הגנה מפני הזרקות קוד מבוססות YARA), סיווג בטיחות רב-לשוני רב-מודאלי.[45]

עבור Nemotron 3 פורסמה אוסף של ~11,000 עקבות OpenTelemetry מסומנות מתרחישים ריאליסטיים עם שימוש בכלים, המיועדת להערכת בטיחות אגנטית.[1]

רישוי

מודלים רישיון
Nemotron 3 (Nano, Super, Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (בירושה מ-Meta)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License מתירה שימוש מסחרי, יצירה והפצה של יצירות נגזרות, אינה דורשת ייחוס (תוך שמירה על קובץ NOTICE), אינה מטילה מגבלות על מספר המשתמשים ומתירה במפורש שימוש בפלטי המודל לאימון מודלים אחרים.[46] מודלים מבוססי Llama יורשים את מגבלות Meta, כולל סף של 700 מיליון משתמשים פעילים חודשיים.[11]

עבור Nemotron 3 Nano, NVIDIA פרסמה: משקלי המודל, יותר מ-10 טריליון token של נתוני אימון, מתכוני אימון, בסיסי קוד (NeMo, Megatron‑LM, NeMo‑Aligner), יותר מ-10 סביבות למידה מחיזוקים עם 900,000+ משימות.[1][2]

פרספקטיבות וכיוונים למחקר

המהדורות הקרובות כוללות Nemotron 3 Super (כ-100 מיליארד פרמטרים, כ-10 מיליארד פעילים) ו-Nemotron 3 Ultra (כ-500 מיליארד, כ-50 מיליארד פעילים), הצפויים בחצי הראשון של 2026. שני המודלים ישתמשו ב-LatentMoE, MTP ואימון בפורמט NVFP4 על ארכיטקטורת Blackwell.[1]

הכיוון האסטרטגי של NVIDIA — מיצוב Nemotron לא כמודל בודד אלא כשכבת תשתית למערכות רב-אגנטיות, שבהן מודלים שונים מהמשפחה משמשים למשימות שונות עם ניתוב לפי מורכבות.[1][15]

כיווני המחקר העיקריים:

  • פיתוח ארכיטקטורות היברידיות — שילוב נוסף של שכבות SSM עם מנגנון attention להקשר ארוך ניתן לסקילה.[12]
  • שיטות דחיסה רב-שכבתיות — פיתוח Minitron, Puzzle, MiniPuzzle ו-Nemotron Elastic.[20][21][30]
  • למידה מחיזוקים רב-תחומית — Nemotron‑CrossThink להרחבת RL מעבר למשימות מתמטיות.[31]
  • הרחבת הקשר — Nemotron‑UltraLong עד 4 מיליון token.[32]
  • רב-מודאליות — הרחבה לתחום vision‑language (Nemotron VL), דיבור (Nemotron Speech), חיפוש חזותי של מסמכים (Nemotron ColEmbed V2).[34][35][36]
  • מודלים היברידיים קומפקטיים — Jet‑Nemotron (NAS למודלי 2B/4B).[33]
  • מתכוני קוד פתוח — פרסום מתכוני אימון ונתונים מלאים לשחזור והתאמה אישית על ידי הקהילה.[14]

ראו גם

  • ארכיטקטורת Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (משפחת מודלים של Meta)

קישורים חיצוניים

ספרות

הערות

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/