Nemotron (NVIDIA) (HE)
Nemotron — משפחת מודלים לשוניים גדולים (Large Language Model, LLM) עם משקלים פתוחים, שפותחה על ידי חטיבת Applied Deep Learning Research (ADLR) של תאגיד NVIDIA. המודלים שייכים לתחום Machine Learning ועיבוד שפה טבעית (Natural Language Processing, NLP) ומיועדים למגוון רחב של משימות: יצירת נתונים סינתטיים, הסקה לוגית (reasoning), יישומים אגנטיים (agentic AI) ופריסה על ציוד תעשייתי של NVIDIA. המשפחה כוללת מודלים בארכיטקטורות וסקאלות שונות: בין 4 מיליארד לכ-500 מיליארד פרמטרים, לרבות מודלי Transformer מסוג decoder‑only צפופים (dense) מסדרת Nemotron‑4 (2024), היברידיים Mamba‑Transformer (Nemotron‑H, 2025) והיברידיים Mamba‑Transformer עם Mixture-of-Experts (MoE) בסדרת Nemotron 3 (2025). נכון למרץ 2026, המשפחה כוללת יותר מ-20 מודלים המכסים משימות של יצירת טקסט, הסקה, הבנה חזותית של מסמכים, חילוץ מידע והערכת איכות תשובות. המודלים מופצים בעיקר עם משקלים פתוחים תחת רישיונות NVIDIA Open Model License ו-Llama Community License.[1][2][3]
היסטוריה ורקע
פיתוח משפחת Nemotron מתנהל בהקשר האסטרטגיה של NVIDIA ליצירת מחסנית כלים מלאה לבינה מלאכותית גנרטיבית: מתשתית אימון (DGX, מחשבי-על מבוססי GPU H100/B200) ועד פלטפורמות אימון (NeMo Framework), יישור (NeMo‑Aligner), פריסה (NIM — NVIDIA Inference Microservices) ואבטחה (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
המודל הראשון הזמין לציבור בסדרה — Transformer מסוג מפענח עם 8 מיליארד פרמטרים והקשר של 4096 token, שאומן על 3.8 טריליון token ב-53 שפות טבעיות ו-37 שפות תכנות. האימון בוצע על 1024 GPU מסוג A100 במשך 19 ימים. לא פורסם דוח טכני רשמי ב-arXiv. המודל הופץ דרך NeMo Framework ו-Hugging Face, וקיימו גרסאות Chat (SFT ו-SteerLM). הרישיון — NVIDIA AI Foundation Models Community License.[6][7]
הערה על שמות: "Nemotron‑3" משנת 2023 ו"Nemotron 3" מדצמבר 2025 הם מודלים שונים. הראשון היה אב-טיפוס מוקדם, השני — הדור העדכני עם ארכיטקטורת MoE.
Nemotron‑4 15B (פברואר 2024)
המהדורה המתועדת ציבורית הראשונה של סדרת Nemotron‑4 — מודל עם 15 מיליארד פרמטרים, שאומן על 8 טריליון token במשך כ-13 ימים קלנדריים על 384 צמתי DGX H100 (עד 3072 GPU). נעשה שימוש בפרלליזם טנסורי פי-8 ופרלליזם נתונים בין 96 ל-288. ה-MFU (Model FLOPs Utilization) השיאית הייתה 34.3% עם batch size של 384. הארכיטקטורה — Transformer מסוג decoder‑only עם Grouped‑Query Attention (GQA) ו-Rotary Position Embeddings (RoPE). על פי תוצאות ה-benchmark בעת הפרסום, המודל עלה על כל המודלים הפתוחים בגודל דומה במשימות רב-לשוניות, כולל מספר מודלים גדולים ממנו פי ארבעה.[8]
Nemotron‑4 340B (יוני 2024)
ביוני 2024 שוחרר המודל הגדול ביותר של סדרת Nemotron‑4 — 340 מיליארד פרמטרים (331.6 מיליארד שאינם embedding), שעבר אימון מקדים על 9 טריליון token (8 טריליון אימון מקדים + 1 טריליון אימון המשך עם שקלול-מחדש של מקורות באיכות גבוהה). האימון בוצע על 768 צמתי DGX H100 (עד 6144 GPU) עם MFU שיאית של 42.4%, בין דצמבר 2023 למאי 2024. המשפחה כוללת שלושה גרסאות: Base, Instruct ו-Reward. גודל המודל נבחר כך שייכנס לצומת DGX H100 בודד (8 GPU) בעת פריסה בפורמט דיוק FP8. יותר מ-98% מהנתונים שנעשה בהם שימוש ביישור (alignment) נוצרו סינתטית על ידי מודלי הסדרה עצמם בתהליך איטרטיבי; צינור יצירת הנתונים הסינתטיים פתוח לשחזור.[3]
Llama‑3.1‑Nemotron‑70B (אוקטובר 2024)
באוקטובר 2024 שוחררו מודלים שעברו כוונון עדין מתוך Meta Llama‑3.1‑70B‑Instruct: Llama‑3.1‑Nemotron‑70B‑Instruct ו-Llama‑3.1‑Nemotron‑70B‑Reward. נכון ל-1 באוקטובר 2024, מודל ה-Instruct תפס את המקום הראשון בו-זמנית בשלושה benchmark אוטומטיים: Arena Hard — 85.0, AlpacaEval 2 LC — 57.6%, MT‑Bench (GPT‑4‑Turbo) — 8.98. מודל ה-Reward השיג 94.1% על RewardBench.[9][10]
המעבר לארכיטקטורות היברידיות (2025)
ב-2025 הורחבה הסדרה בארכיטקטורות היברידיות המשלבות שכבות Mamba‑2 (State Space Model, SSM — מודל מרחב מצבים) ו-Transformer. בין מרץ למאי 2025 שוחררה משפחת מודלי ההסקה Llama‑Nemotron (Nano 8B, Super 49B, Ultra 253B) עם מצב הסקה הניתן לשינוי.[11] באפריל 2025 פורסם Nemotron‑H (arXiv:2504.03624) — משפחת מודלים היברידיים Mamba‑Transformer בגדלים של 8B, 56B ו-47B פרמטרים.[12] באוגוסט 2025 הוצג Nemotron Nano 2 (9B‑v2, arXiv:2508.14444).[13]
Nemotron 3 (דצמבר 2025)
ב-15 בדצמבר 2025 הוכרז הדור השלישי — משפחת Nemotron 3 עם מודלי Nano, Super ו-Ultra, המאחדת ארכיטקטורות Mamba‑2, Transformer ו-MoE עם חלון הקשר של עד 1 מיליון token. Nano שוחרר עם דוח טכני; Super ו-Ultra מתוכננים לחצי הראשון של 2026.[1][2][14][15]
יסודות תיאורטיים
ארכיטקטורת Transformer ב-Nemotron‑4
מודלי סדרת Nemotron‑4 בנויים על ארכיטקטורת Transformer מפענח סטנדרטית עם attention סיבתי. ההסתברות של רצף ה-token מתפרקת כ:
כאשר — פרמטרי המודל.[8]
מנגנון ה-attention מממש בגרסת Grouped‑Query Attention (GQA)[16]:
כאשר — מטריצות השאילתות, המפתחות והערכים; — מימד ראש ה-attention.
לקידוד מיקומים נעשה שימוש ב-Rotary Position Embeddings (RoPE)[17]:
כאשר — וקטור במיקום , , — מימד הוקטור.
בשכבות ה-MLP נעשה שימוש באקטיבציה Squared ReLU: , המבטיחה דלילות אקטיבציות. המודלים אינם מכילים הטיות (bias), אינם משתמשים ב-dropout, ומטריצות ה-embedding של הכניסה והיציאה אינן קשורות זו לזו (untied embeddings). מנתח ה-token — SentencePiece BPE עם שמירת רווחים, פירוק ספרות לתווים ו-fallback בייתי, גודל אוצר המילים — 256,000.[8][3]
פרמטרים ארכיטקטוניים של Nemotron‑4
| פרמטר | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| מספר פרמטרים | 15 מיליארד (3.2 מיליארד embed.) | 340 מיליארד (9.4 מיליארד embed.) |
| מספר שכבות | 32 | 96 |
| מימד נסתר | 6144 | 18,432 |
| ראשי attention | 48 | 96 |
| ראשי KV (GQA) | 8 | 8 |
| אורך הקשר | 4096 | 4096 |
| גודל אוצר מילים | 256,000 | 256,000 |
מקורות: arXiv:2402.16819, arXiv:2406.11704.[8][3]
ארכיטקטורה היברידית Mamba‑Transformer (Nemotron‑H)
במודלי Nemotron‑H, בלוקי self-attention סטנדרטיים מוחלפים בחלקם בבלוקי Mamba‑2 — מודלי מרחב מצבים (State Space Models, SSM). ביצירת autoregressive, כל שכבת self-attention דורשת פעולות וזיכרון לכל צעד (בשל KV‑cache), בעוד שכבות Mamba מספקות עלויות זיכרון וחישוב קבועות לכל token שנוצר.[12]
Mamba‑2 מתואר ביחס רקורסיבי[18]:
כאשר — המצב הנסתר, — מטריצת מעבר מצבים אלכסונית, ו- — מטריצות הקרנה, — token הכניסה, — אות הפלט. ב-Mamba‑2, המטריצות , , תלויות בכניסה (input‑dependent), מה שמבדיל את המודל מ-SSM לינאריים קלאסיים.
ב-Nemotron‑H‑56B נעשה שימוש ב-54 שכבות Mamba‑2 + 54 שכבות MLP + 10 שכבות self-attention, כאשר שכבות ה-attention פרוסות באופן שווה בין שכבות ה-Mamba. המודל אומן על 20 טריליון token בפורמט FP8 (per‑tensor scaling) על 6144 GPU מסוג H100. גרסת Nemotron‑H‑8B מכילה 24 שכבות Mamba‑2, 24 שכבות MLP ו-4 שכבות self-attention; האימון בוצע על 15 טריליון token.[12]
ארכיטקטורת MoE של Nemotron 3
מודלי Nemotron 3 (דצמבר 2025) משלבים שלושה רכיבים ארכיטקטוניים: Mamba‑2, Transformer ו-Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) מכיל 52 שכבות: 23 שכבות Mamba‑2 + MoE, 23 שכבות MoE ו-6 שכבות GQA‑attention. כל שכבת MoE כוללת 128 מומחים מנותבים (routed) + מומחה משותף (shared) אחד, מתוכם 6 מומחים מופעלים עבור כל token. הניתוב מבוצע על ידי MLP router מאומן עם sigmoid gating. איזון עומסים מיושם ללא פונקציית הפסד עזר (aux‑loss‑free). סך הפרמטרים הוא 31.6 מיליארד, אך הפעילים לכל token — רק 3.2 מיליארד.[2]
הנרמול — RMSNorm[19]. embedding מיקומיים בחלקי Mamba נעדרים (המידע המיקומי משתמע ממצב ה-SSM). נעשה שימוש ב-embedding בלתי-קשורים, ללא dropout וללא bias בשכבות הלינאריות.[2]
הרחבות ב-Super/Ultra: LatentMoE ו-Multi‑Token Prediction
מודלי Super ו-Ultra ממשפחת Nemotron 3 משתמשים בשתי חידושים ארכיטקטוניים נוספים:
- Latent MoE (LatentMoE) — הקרנת ייצוג הכניסה למרחב סמוי בממד קטן יותר לפני הניתוב, מה שמאפשר הגדלת מספר המומחים בעלויות חישוביות דומות ושיפור הדיוק ללא ירידה בתפוקה.[1]
- Multi‑Token Prediction (MTP) — חיזוי מספר token עתידיים בו-זמנית, המשמש לשיפור איכות טקסטים ארוכים ולפענוח ספקולטיבי (speculative decoding) בעת inference.[1]
אימון Super ו-Ultra מתבצע בפורמט NVFP4 — פורמט מספרי 4-סיביות של NVIDIA על ארכיטקטורת Blackwell.[1]
שיטות דחיסת מודלים: Minitron, Puzzle, MiniPuzzle
ליצירת מודלים קומפקטיים, NVIDIA מיישמת מספר גישות:
- Minitron — שיטת גיזום מובנה (pruning) ודיסטילציית ידע (knowledge distillation). נחקרים שני סוגי גיזום: לפי עומק (הסרת שכבות) ולפי רוחב (הקטנה משותפת של מימדי שכבות נסתרות, ראשי attention ו-MLP). הפעלת Minitron על Nemotron‑4 15B מאפשרת קבלת מודלי 8B ו-4B עם הפחתת עלויות אימון עד פי 40 בהשוואה לאימון מאפס.[20]
- Puzzle — אלגוריתם Neural Architecture Search (NAS) המוצא את התצורה האופטימלית של כל בלוק (מספר ראשי KV, גודל FFN, נוכחות/היעדר attention) עם דיסטילציה לפי בלוקים. כך דוחס Llama 3.1 405B ל-253B (Llama‑Nemotron Ultra), ו-Llama 3.3 70B ל-49B (Llama‑Nemotron Super).[21]
- MiniPuzzle — הרחבה של Puzzle לארכיטקטורות היברידיות, שדחסה את Nemotron‑H‑56B ל-47B בעלות של 63 מיליארד token בלבד של דיסטילציה. בדיוק דומה, המודל הדחוס מהיר ב-20%.[12]
שיטות יישור
HelpSteer ו-HelpSteer2
HelpSteer — מאגר של 37,120 דוגמאות (רישיון CC‑BY‑4.0), שנוצר בשיתוף Scale AI, שבו כל תשובה מוערכת לפי חמישה תכונות: שימושיות (helpfulness), נכונות (correctness), קוהרנטיות (coherence), מורכבות (complexity) ורהיטות (verbosity) בסולם ליקרט 0–4.[22]
HelpSteer2 — מאגר מעודכן של 21,362 דוגמאות (10,681 prompt × 2 תשובות), שבו יותר מ-95% מה-prompt נלקחו מ-ShareGPT (בקשות משתמשים אמיתיות). כ-50% מהסיווגים סוננו כבלתי-איכותיים מספיק. ההרחבה HelpSteer2‑Preference מוסיפה העדפות זוגיות של מסווגים, המאפשרת אימון מודלי תגמול רגרסיוניים וזוגיים כאחד על אותם נתונים.[23][24]
SteerLM
SteerLM — שיטת SFT (Supervised Fine‑Tuning — אימון מפוקח) עם התניה על תכונות (helpfulness, correctness, coherence, complexity, verbosity), המאפשרת למשתמש לשלוט בסגנון התשובה בזמן inference. הצינור כולל: (1) אימון מודל חיזוי תכונות (APM) על HelpSteer, (2) תיוג נתונים בעזרת APM, (3) SFT עם התניה על ערכי תכונות יעד, (4) bootstrapping.[25]
DPO ו-RPO
DPO (Direct Preference Optimization) — שיטה לאופטימיזציה ישירה של העדפות ללא מודל תגמול מפורש, המשמשת בצינורי Nemotron‑4 340B Instruct ו-Nemotron Nano 2.[26]
RPO (Reward‑aware Preference Optimization) — מסגרת מתמטית מאוחדת של NVIDIA המכלילה DPO, IPO, SimPO, REINFORCE ו-SteerLM 2.0 כמקרים פרטיים. RPO ממזער את המרחק בין תחזיות מודל התגמול המשתמע למודל התגמול המפורש היעד[27]:
כאשר — מודל תגמול מפורש, — מדיניות מאומנת, — מדיניות ייחוס, — פונקציית מרחק, / — תשובה מועדפת/דחויה. RPO מיושם באימון Nemotron‑4 340B Instruct ומודלי Llama‑Nemotron.[27][3][11]
למידה מחיזוקים רב-סביבתית (RLVR)
ב-Nemotron 3 מיושם Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) — אימון בו-זמני במספר סביבות במסגרת NeMo Gym: מתמטיקה תחרותית, תכנות, QA, שימוש בכלים (tool‑use), instruction‑following, הקשר ארוך. האלגוריתם — GRPO (Group Relative Policy Optimization) עם masked importance sampling.[2][14]
Nemotron 3 תומך בשליטה גרנולרית בתקציב ההסקה (reasoning budget control): המשתמש יכול להגדיר מגבלת token לעקבת ה-thinking דרך דגל ב-chat template (החלפה בין "detailed thinking on/off" או הגבלת אורך).[2]
סדרת המודלים
טבלת סיכום
| מודל | שנה | סה"כ / פרמטרים פעילים | הקשר | ארכיטקטורה | תכונות מרכזיות |
|---|---|---|---|---|---|
| Nemotron‑3 8B | 2023 | 8B / 8B | 4K | Dense Transformer | 3.8T token; 1024 GPU A100; 19 ימים |
| Nemotron‑4 15B | 2024 | 15B / 15B | 4K | Dense Transformer | 8T token; MFU 34.3% |
| Nemotron‑4 340B | 2024 | 340B / 340B | 4K | Dense Transformer | 9T token; Base/Instruct/Reward; >98% נתונים סינתטיים ל-alignment |
| Llama‑3.1‑Nemotron‑70B | 2024 | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE); RewardBench 94.1% |
| Llama‑Nemotron Nano 8B | 2025 | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | 2025 | 4B / 4B | 128K | Dense Transformer (Minitron) | דחיסת NAS מ-Llama 3.1 8B |
| Llama‑Nemotron Super 49B | 2025 | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | מ-Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | 2025 | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | מ-Llama 3.1 405B; GPQA 76.0% |
| Nemotron‑H 8B | 2025 | 8B / 8B | — | היברידי Mamba‑Transformer | 15T token; 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | 2025 | 56B / 56B | — | היברידי Mamba‑Transformer | 20T token FP8; 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | 2025 | 47B / 47B | ~1M (FP4) | היברידי Mamba‑Transformer | MiniPuzzle מ-56B; +20% מהירות |
| Nemotron Nano 2 (9B) | 2025 | 12B → 9B / 9B | 128K | היברידי Mamba‑Transformer | 20T token; דיסטילציית Minitron |
| Nemotron 3 Nano | 2025 | 31.6B / 3.2B | 1M | היברידי Mamba‑Transformer MoE | 25T token; 128 מומחים, 6 פעילים |
| Nemotron 3 Super | 2025–2026 | ~100B / ~10B | 1M | היברידי LatentMoE | MTP; NVFP4 |
| Nemotron 3 Ultra | 2025–2026 | ~500B / ~50B | 1M | היברידי LatentMoE | MTP; NVFP4 |
Nemotron‑4 15B
ארכיטקטורה: 32 שכבות, hidden dimension 6144, 48 ראשי attention, 8 ראשי KV (GQA). סך הפרמטרים — 15 מיליארד (3.2 מיליארד embedding + 12.5 מיליארד non‑embedding). תוצאות: MMLU — 64.2% (5‑shot), BBH — 58.7% (3‑shot), GSM8K — 46.0% (8‑shot, maj@1), HumanEval — 31.6% (0‑shot, pass@1). ב-benchmark רב-לשוניים (XCOPA, TyDiQA‑GoldP, MGSM) המודל עלה על מודלים גדולים ממנו פי ארבעה.[8]
Nemotron‑4 340B
ארכיטקטורה: 96 שכבות, hidden dimension 18,432, 96 ראשי attention, 8 ראשי KV.
Nemotron‑4 340B Base הציג: MMLU — 81.1% (5‑shot), BBH — 85.4% (3‑shot), HumanEval — 57.3% (0‑shot), ARC‑Challenge — 94.3% (25‑shot).[3]
Nemotron‑4 340B Instruct עבר יישור רב-שלבי: Code SFT → General SFT → DPO → RPO (3 סבבים). תוצאות: MT‑Bench — 8.22 (שופט GPT‑4‑Turbo), MMLU — 78.7% (0‑shot), GSM8K — 92.3% (0‑shot), HumanEval — 73.2% (0‑shot), Arena Hard — 54.2, AlpacaEval 2.0 LC — 41.5%.[3]
Nemotron‑4 340B Reward מחליף את שכבת ה-softmax הסופית בהקרנה לינארית של המצב הנסתר של השכבה האחרונה לוקטור של 5 תכונות HelpSteer2. התגמול הסופי — סכום משוקלל של חמשת התכונות. האימון בוצע בשתי אפוכים על נתוני HelpSteer2 (batch size 128). על RewardBench המודל השיג 92.0%, עולה על GPT‑4o (84.7%), Gemini 1.5 Pro (88.1%) ו-Claude‑3‑Opus (80.7%) בעת הפרסום.[3]
| מודל | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54.2 | 41.5% | 8.22 |
| Llama‑3‑70B‑Instruct | 41.1 | 34.4% | 8.16 |
| Mixtral‑8x22B‑Instruct | 36.4 | 30.9% | 7.63 |
| Qwen‑2‑72B‑Instruct | 48.1 | 38.8% | 8.26 |
מקור: arXiv:2406.11704, טבלה 5.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward אומן בשיטה היברידית המשלבת Bradley‑Terry (העדפות זוגיות) ורגרסיית SteerLM (הערכה רב-תכונתית בסולם ליקרט). האימון בוצע אך ורק על נתוני HelpSteer2 (CC‑BY‑4.0). על RewardBench המודל השיג 94.1%, ותפס את המקום הראשון בעת הפרסום.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct יושר בשיטת RLHF עם אלגוריתם REINFORCE (לא PPO) ומודל תגמול Nemotron‑70B‑Reward. התשתית — NeMo‑Aligner עם האצת TRT‑LLM.[9]
Llama‑Nemotron: Nano, Super, Ultra (2025)
משפחת מודלי הסקה שהתקבלה מ-Llama 3.x בשיטות NAS, דיסטילציה ואחר-אימון מורחב.[11]
| מודל | פרמטרים | מודל בסיס | הקשר |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | 8 מיליארד | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | 4 מיליארד | Minitron 4B (מ-Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | 49 מיליארד | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | 253 מיליארד | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
צינור אימון בחמישה שלבים: (1) NAS + FFN Fusion, (2) דיסטילציה + אימון מקדים המשכי, (3) SFT (כולל עקבות הסקה של DeepSeek‑R1), (4) RL בקנה-מידה גדול (GRPO עבור Ultra, REINFORCE/RLOO + Online RPO עבור Nano), (5) יישור לדיאלוג.[11]
המודלים הם ראשוני ה-LLM הפתוחים התומכים במצב הסקה הניתן לשינוי (reasoning toggle): כאשר מופעל ("detailed thinking on" בהנחיית המערכת), המודל מייצר שרשרת הסקה בתגיות <think>...</think> לפני התשובה; כאשר כבוי — עונה ישירות.[11]
תוצאות Llama‑Nemotron‑Ultra 253B (reasoning מופעל): GPQA Diamond — 76.0%, AIME 2024 — 80.8%, MATH 500 — ~97%. לשם השוואה: DeepSeek‑R1 (671B סה"כ / 37B פעיל) — GPQA Diamond 71.5%, AIME 2024 ~79.8%. Ultra ממוקם בצומת בודד של 8×H100.[11]
Nemotron‑H (אפריל 2025)
משפחת מודלים היברידיים צפופים, שאומנו מאפס ותוכננו למשימות עם יצירות ארוכות. Nemotron‑H‑56B אומן על 20 טריליון token בפורמט FP8 — אחד הניסויים הציבוריים הגדולים ביותר של אימון מקדים FP8. Nemotron‑H‑47B התקבל בדחיסת 56B בשיטת MiniPuzzle (63 מיליארד token של דיסטילציה) ומתאים לזיכרון של RTX 5090 בודד (FP4) עם הקשר של ~1M token.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60.5 | 61.8 | 58.8 | 51.3 |
| MMLU (5‑shot) | 84.2 | 83.6 | 86.1 | 78.8 |
| GSM8K (8‑shot CoT) | 93.7 | 93.3 | 90.9 | 83.9 |
| HumanEval (0‑shot) | 60.4 | 61.0 | 56.7 | 57.3 |
מקור: arXiv:2504.03624.[12]
ביצירה עם 65,536 token קלט ו-1024 token פלט על H100, מודל Nemotron‑H‑47B עבד מהר פי 2.9 מ-Qwen‑2.5‑72B ו-Llama‑3.1‑70B.[12]
Nemotron Nano 2 (אוגוסט 2025)
מודל היברידי Mamba‑Transformer להסקה. Nemotron‑Nano‑12B‑v2‑Base — מודל האב עם 62 שכבות (בעיקר Mamba‑2 + MLP + 4 שכבות attention), שאומן על 20 טריליון token בפורמט FP8 מאפס. ממנו התקבל בשיטת Minitron מורחב Nemotron‑Nano‑9B‑v2, המסוגל לעבוד בהקשר של 128K token על GPU בודד NVIDIA A10G (22 ג"ב, BF16). אחר-אימון: SFT (80 מיליארד token, כולל עקבות DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. על benchmark של הסקה, המודל דומה ל-Qwen3‑8B בדיוק, אך מגיע לתאוצה פי 3–6 ביצירה ברצפי פלט ארוכים.[13]
Nemotron 3 Nano 30B‑A3B
שוחרר בדצמבר 2025. פרמטרים: 31.6 מיליארד סה"כ, 3.2 מיליארד פעילים. ארכיטקטורה: 52 שכבות, hidden dimension 2688, expert dimension 1856, Mamba state dimension 128. MoE: 128 מומחים מנותבים + 1 משותף, 6 פעילים לכל token. הקשר — עד 1,048,576 token. אימון על 25 טריליון token (לוח זמנים WSD, batch size 3072, תאריך חיתוך נתונים — יוני 2025) בשתי פאזות: פאזה 1 — 23.5 טריליון (נתונים מגוונים), פאזה 2 — 1.5 טריליון (נתונים איכותיים) + 121 מיליארד token של CPT להקשר ארוך.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78.30 | 80.9 | 75.0 |
| AIME25 (ללא כלים) | 89.06 | 85.0 | 91.7 |
| AIME25 (עם כלים) | 99.17 | — | 98.7 |
| GPQA (ללא כלים) | 73.04 | 73.4 | 71.5 |
| LiveCodeBench v6 | 68.25 | 66.0 | 61.0 |
| SWE‑Bench (OpenHands) | 38.76 | 22.0* | 34.0 |
| TauBench V2 Avg | 49.04 | 47.7 | 47.5 |
| Arena‑Hard‑V2 Avg | 67.65 | 57.8 | 48.55 |
| RULER‑100 @ 1M | 86.34 | 77.5 | — |
* — ערכים ממקורות משניים; תנאי שחזור — NeMo Evaluator SDK. מקור: arXiv:2512.20848.[2][28]
תפוקה (8K קלט / 16K פלט, H200 בודד): גבוהה פי 3.3 מ-Qwen3‑30B‑A3B‑Thinking ופי 2.2 מ-GPT‑OSS‑20B.[2]
מודלים וכיוונים נוספים
- OpenReasoning‑Nemotron (יולי 2025) — סדרת מודלים בגדלים 1.5B–32B פרמטרים, המבוססים על Qwen 2.5 וכוונונם העדין על נתוני DeepSeek‑R1‑0528. גרסת 32B עם GenSelect@64 עולה על o3 (high) במספר benchmark מתמטיים.[29]
- Nemotron Elastic (arXiv:2511.16664) — מסגרת תת-מודלים מקוננים (6B, 9B, 12B) במסגרת מודל-אב אחד, המפחיתה עלות אימון פי 360 בהשוואה לאימון מאפס.[30]
- Nemotron‑CrossThink — מסגרת למידה מחיזוקים רב-תחומית מעבר למשימות מתמטיות, שהניבה +30.1% על MATH‑500 ו-+12.8% על MMLU‑PRO.[31]
- Nemotron‑UltraLong — הרחבת הקשר עד 4 מיליון token.[32]
- Jet‑Nemotron — NAS לאחר-אימון למודלים היברידיים קומפקטיים 2B/4B.[33]
מודלים מתמחים
באקוסיסטם Nemotron קיימים גם מודלים למשימות מתמחות:
- Nemotron Nano V2 VL — מודל vision‑language ל-OCR, עיבוד טבלאות ווידאו.[34]
- Nemotron Parse 1.1 — מודל ל-OCR וחילוץ מבנה מסמכים.[35]
- Nemotron ColEmbed V2 — מודל embedding לחיפוש חזותי של מסמכים (late interaction).[36]
- Nemotron Speech — מודלים לזיהוי דיבור אוטומטי (ASR), סינתזת דיבור (TTS) ותרגום מכונה (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — מודל סיווג תוכן לא-בטוח ב-23 קטגוריות ב-9 שפות עם דיוק 84.2%.[37]
נתוני אימון מקדים
הרכב נתוני Nemotron‑4
אוסף האימון המקדים של Nemotron‑4 15B ו-340B מורכב משלוש קטגוריות עיקריות: טקסטים אנגליים (70%), טקסטים רב-לשוניים ב-53 שפות (15%) וקוד מקור ב-43 שפות תכנות (15%). הוחל כפילות-ביטול ברמת המסמך (exact ו-near‑duplicate), כמו גם סינון באמצעות מודלים לשוניים והיוריסטיקות. מודל 15B אומן על 8 טריליון token, מודל 340B — על 9 טריליון (8 טריליון אימון מקדים + 1 טריליון אימון המשכי עם שקלול-מחדש של מקורות איכותיים).[8][3]
Nemotron‑CC
מאגר הנתונים Nemotron‑CC נוצר מ-Common Crawl תוך שימוש במכלול מסווגי איכות וניסוח מחדש סינתטי של טקסטים. הנפח הכולל — 6.3 טריליון token (4.4 טריליון לאחר כפילות-ביטול + 1.9 טריליון ניסוחים מחדש סינתטיים). הצינור משולב בכלי NeMo Curator. העבודה התקבלה כ-Long Paper בכנס ACL 2025.[38]
Nemotron‑CC‑Math
תת-קבוצה מוטת-מתמטיקה בנפח של 133 מיליארד token, שחולצה מ-Common Crawl באמצעות צינור Lynx + LLM תוך שמירה על מבנה נוסחאות מתמטיות וקוד ב-LaTeX.[39]
נתוני Nemotron 3 Nano
האימון המקדים של Nemotron 3 Nano בוצע על 25 טריליון token. המאגר כולל: Nemotron‑CC‑v2.1, Nemotron‑CC‑Code‑v1, Nemotron‑CC‑Math‑v1 ו-dataset מתמחים בתחום STEM. לאימון הקשר ארוך נעשה שימוש בנוסף ב-121 מיליארד token של CPT.[2]
Nemotron Pretraining Dataset v1
מאגר שנוצר סינתטית המכסה STEM, טקסטים אקדמיים, משימות הסקה ותחומים רב-לשוניים; מכיל יותר מ-10 טריליון token לשוניים ו-18 מיליון דוגמאות ל-SFT. כל מאגרי הנתונים מופצים ברישיונות פתוחים ומתירניים.[40]
צינור יצירת נתונים סינתטיים (SDG)
הצינור המתואר בדוח על Nemotron‑4 340B כולל את השלבים הבאים[3]:
- יצירת prompt: בקשות סינתטיות חד- ודו-סבביות שנוצרו באמצעות Mixtral‑8x7B‑Instruct‑v0.1 (רישיון Apache 2.0) לפי תבניות Open QA, Writing, Closed QA, Math & Coding.
- יצירת תשובות: תשובות מרובות מגרסאות ביניים של מודלים להבטחת מגוון.
- הערכת איכות: שלוש גישות — Ground‑Truth‑as‑a‑Judge (למשימות עם תשובה ניתנת לאימות), LLM‑as‑Judge (השוואת זוגות תשובות על ידי מודל לשוני), Reward‑Model‑as‑Judge (שימוש ב-Nemotron‑4‑340B‑Reward).
- יישור איטרטיבי מהחלש לחזק (weak‑to‑strong).
מכ-~20,000 דוגמאות מוערכות על ידי בני-אדם (10,000 ל-SFT, 10,000 HelpSteer2 למודל התגמול) סוּנתז כל שאר נפח נתוני היישור.[3]
כימות ואופטימיזציית inference
מודלי Nemotron 3 Nano תומכים ב-Post‑Training Quantization (PTQ) בפורמט FP8 תוך שימוש ב-ModelOpt ו-Megatron‑LM. מיושם כימות סלקטיבי — שכבות attention וחלק משכבות Mamba נשמרות ב-BF16 לשמירת האיכות; השאר מכומתות ל-FP8. על פי הדוח הטכני, הדבר מבטיח ~99% שמירה על הדיוק.[2] Nano תומך גם ב-inference בפורמט NVFP4.[1]
טבלת benchmark מסכמת לפי דורות
| מודל | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | תנאים |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64.2% | 46.0% | 31.6% | — | — | base; 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81.1% | — | 57.3% | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78.7% | 92.3% | 73.2% | 54.2 | 8.22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85.0 | 8.98 | אוק' 2024 |
| LN‑Ultra 253B (reasoning מופעל) | — | — | — | — | — | GPQA 76.0%, AIME 80.8% |
| Nemotron‑H‑47B | 83.6% | 93.3% | 61.0% | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67.7 (v2) | — | AIME25 89.1%, LCB 68.3% |
יש לפרש את ההשוואה בזהירות: תנאי ההערכה, גרסאות ה-benchmark ותאריכי הבדיקות שונים בין הדורות. התוצאות לקוחות מדוחות טכניים של NVIDIA; הערכות עצמאיות עשויות להיות שונות (ראו סעיף "מגבלות").[8][3][9][11][12][2]
יישומים
פריסה דרך NVIDIA NIM
NVIDIA NIM — אוסף מיקרו-שירותי קונטיינרים מאופטמיים ל-inference עם API תואם OpenAI. מודלי Nemotron זמינים כמיקרו-שירותי NIM בפלטפורמה build.nvidia.com. NIM תומך בפורמטים FP8, BF16, NVFP4 ובפריסה דרך Helm charts על Kubernetes. המודלים תואמים גם לפריימוורקים עצמאיים: vLLM, SGLang, Ollama, llama.cpp, TensorRT‑LLM.[4][1]
יצירת נתונים סינתטיים
Nemotron‑4 340B תוכנן לשימוש כמחולל נתונים סינתטיים: מודל ה-Instruct מייצר תשובות, ומודל ה-Reward מעריך ומסנן אותן. רישיון NVIDIA Open Model License מתיר במפורש שימוש בפלטי המודל לאימון מודלים אחרים. על פי נתוני ServiceNow, 15% מנתוני האימון המקדים של המודל שלהם Apriel 1.6 הגיעו ממאגרי נתונים של Nemotron.[3][15][41]
מערכות אגנטיות
מודלי משפחת Nemotron 3 (Nano, Super, Ultra) מיועדים לעומסי עבודה רב-אגנטיים: תכנון, retrieval, קריאה לכלים (tool use). Nemotron 3 Nano מציג תוצאה של 38.76% על SWE‑Bench (עם OpenHands) ו-49.04% (ממוצע) על TauBench V2.[2]
יישומים ארגוניים
בין השותפים המוצהרים: ServiceNow (מודל משותף Apriel Nemotron 15B לאוטומציה של תהליכי עבודה), CrowdStrike (פלטפורמת Charlotte AI), Perplexity (ניתוב בקשות), Accenture, Cadence, Deloitte, Oracle, Palantir, Siemens, Synopsys, Zoom. המודלים זמינים על AWS Amazon Bedrock; מתוכננת תמיכה ב-Google Cloud, CoreWeave, Nebius.[15]
מגבלות ובעיות פתוחות
הערכות עצמאיות וסתירות עם נתוני NVIDIA
הערכות עצמאיות מגלות פערים לעומת התוצאות שמציגה NVIDIA. על פי נתוני Artificial Analysis (פברואר 2026), Llama‑Nemotron‑Ultra 253B (עם הסקה) קיבל Intelligence Index של 15 בעוד החציון עמד על 26 למודלים בגודל דומה. בפלטפורמת Chatbot Arena (LMArena) מודלי Nemotron ממוקמים באמצע הדירוג: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (כ-מקום 147), Nemotron 3 Nano — 1317 ±6 (כ-מקום 164).[42][43]
רהיטות יתר
מודלי Nemotron מציגים רהיטות-יתר: בהערכת Artificial Analysis, מודל Nemotron 3 Nano ייצר 140 מיליון token (בעוד החציון עמד על 12 מיליון למודלים אחרים), מה שמגדיל את עלות ה-inference. ניתוח של קהילת DEV מצא כי Llama‑3.1‑Nemotron‑70B‑Instruct, בעוד שהוביל רשמית ב-benchmark אוטומטיים, הפגין דיוק לא מספק במספר משימות מעשיות, וציוני גבוה ב-benchmark מסוג Arena עשויים לשקף העדפה לתשובות רהוטות ובטוחות אך לא בהכרח מדויקות.[42][44]
הזיות ו-bias
NVIDIA מציינת בכרטיסי המודל כי המודלים עשויים "לחזק דעות קדומות וליצור תשובות רעילות, במיוחד בתגובה ל-prompt רעילים", וכן "לייצר מידע לא מדויק ולהשמיט פרטים מרכזיים". פתיחות המשקלים והנתונים מאפשרת ביקורת חיצונית.[11][13]
דרישות חישוביות
מודלים צפופים (Nemotron‑4 340B) דורשים אשכול של 768 צמתי DGX H100 לאימון מלא, מה שמגביל את יכולת השחזור עבור קבוצות אקדמיות ללא גישה לתשתית דומה. הקשר ארוך (1M) בזמן inference דורש נפח VRAM ניכר.[3][2]
דגרדציה בהרחבת הקשר
עם הרחבת ההקשר לרצפים ארוכים במיוחד, נצפתה דגרדציה בתוצאות ה-benchmark עם הקשר קצר.[32]
כימות ארכיטקטורות היברידיות
שימוש ברזולוציה נמוכה במיוחד (FP8/NVFP4) בארכיטקטורות Mamba‑Transformer גורם לירידה קטנה בדיוק (~1% במספר benchmark). בעיה זו נפתרת על ידי שימוש בכימות סלקטיבי, מה שמסבך את ארכיטקטורת המהדרים ושרתי ה-inference.[2][1]
בעיות פתוחות נוספות
- תלות ב-benchmark עם זיהום אפשרי של נתוני אימון.
- היעדר פרוטוקולים סטנדרטיים להשוואת ארכיטקטורות היברידיות SSM‑Transformer עם מודלי Transformer טהורים.
- שאלת הסקלאביליות של גישת ה-MoE במשימות הדורשות הסקה עמוקה עם מספר מועט של מומחים לכל token.
- הנתונים על Super/Ultra נכון לדצמבר 2025 הם ראשוניים; benchmark מלאים צפויים לאחר השחרור.[1]
היבטים אתיים ורגולטוריים
בטיחות בשלב הפיתוח
בשלב הפיתוח מיושמים: הערכה לפי מסגרת AEGIS (13 קטגוריות בטיחות תוכן), סורק פגיעויות garak, "בדיקת חדירה" ידנית (red‑teaming).[37]
בטיחות בשלב ה-inference
NeMo Guardrails — ערכת כלים פתוחה (רישיון Apache 2.0), המוסיפה מחסומים הניתנים לתכנות למערכות LLM. המיקרו-שירות מיירט כניסות ויציאות, ומחיל בדיקות הניתנות להגדרה: בקרת נושא, זיהוי PII, אימות "עיגון" RAG, זיהוי מתקפות jailbreak (כולל הגנה מפני הזרקות קוד מבוססות YARA), סיווג בטיחות רב-לשוני רב-מודאלי.[45]
עבור Nemotron 3 פורסמה אוסף של ~11,000 עקבות OpenTelemetry מסומנות מתרחישים ריאליסטיים עם שימוש בכלים, המיועדת להערכת בטיחות אגנטית.[1]
רישוי
| מודלים | רישיון |
|---|---|
| Nemotron 3 (Nano, Super, Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (בירושה מ-Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License מתירה שימוש מסחרי, יצירה והפצה של יצירות נגזרות, אינה דורשת ייחוס (תוך שמירה על קובץ NOTICE), אינה מטילה מגבלות על מספר המשתמשים ומתירה במפורש שימוש בפלטי המודל לאימון מודלים אחרים.[46] מודלים מבוססי Llama יורשים את מגבלות Meta, כולל סף של 700 מיליון משתמשים פעילים חודשיים.[11]
עבור Nemotron 3 Nano, NVIDIA פרסמה: משקלי המודל, יותר מ-10 טריליון token של נתוני אימון, מתכוני אימון, בסיסי קוד (NeMo, Megatron‑LM, NeMo‑Aligner), יותר מ-10 סביבות למידה מחיזוקים עם 900,000+ משימות.[1][2]
פרספקטיבות וכיוונים למחקר
המהדורות הקרובות כוללות Nemotron 3 Super (כ-100 מיליארד פרמטרים, כ-10 מיליארד פעילים) ו-Nemotron 3 Ultra (כ-500 מיליארד, כ-50 מיליארד פעילים), הצפויים בחצי הראשון של 2026. שני המודלים ישתמשו ב-LatentMoE, MTP ואימון בפורמט NVFP4 על ארכיטקטורת Blackwell.[1]
הכיוון האסטרטגי של NVIDIA — מיצוב Nemotron לא כמודל בודד אלא כשכבת תשתית למערכות רב-אגנטיות, שבהן מודלים שונים מהמשפחה משמשים למשימות שונות עם ניתוב לפי מורכבות.[1][15]
כיווני המחקר העיקריים:
- פיתוח ארכיטקטורות היברידיות — שילוב נוסף של שכבות SSM עם מנגנון attention להקשר ארוך ניתן לסקילה.[12]
- שיטות דחיסה רב-שכבתיות — פיתוח Minitron, Puzzle, MiniPuzzle ו-Nemotron Elastic.[20][21][30]
- למידה מחיזוקים רב-תחומית — Nemotron‑CrossThink להרחבת RL מעבר למשימות מתמטיות.[31]
- הרחבת הקשר — Nemotron‑UltraLong עד 4 מיליון token.[32]
- רב-מודאליות — הרחבה לתחום vision‑language (Nemotron VL), דיבור (Nemotron Speech), חיפוש חזותי של מסמכים (Nemotron ColEmbed V2).[34][35][36]
- מודלים היברידיים קומפקטיים — Jet‑Nemotron (NAS למודלי 2B/4B).[33]
- מתכוני קוד פתוח — פרסום מתכוני אימון ונתונים מלאים לשחזור והתאמה אישית על ידי הקהילה.[14]
ראו גם
- ארכיטקטורת Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (משפחת מודלים של Meta)
קישורים חיצוניים
- NVIDIA Research — דף Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — תיעוד Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- NeMo Framework Documentation: https://docs.nvidia.com/nemo/
ספרות
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, פברואר 2024. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, יוני 2024. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, יוני 2024. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, יולי 2024. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, נובמבר 2024. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203, ינואר 2025. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, אפריל 2025. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, מאי 2025. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444, אוגוסט 2025. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096, אוגוסט 2025. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664, נובמבר 2025. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, דצמבר 2025. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848, דצמבר 2025. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
הערות
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/