Nemotron (NVIDIA) (FA)
Nemotron — خانوادهای از مدلهای زبانی بزرگ (Large Language Model, LLM) با وزنهای باز، توسعهیافته توسط بخش Applied Deep Learning Research (ADLR) شرکت NVIDIA. این مدلها در حوزه Machine Learning و پردازش زبان طبیعی (Natural Language Processing, NLP) قرار دارند و برای طیف گستردهای از وظایف طراحی شدهاند: تولید دادههای مصنوعی، استنتاج منطقی (reasoning)، برنامههای عاملی (agentic AI) و استقرار بر روی سختافزار صنعتی NVIDIA. این خانواده، مدلهایی با معماریها و مقیاسهای مختلف را در بر میگیرد: از ۴ میلیارد تا ~۵۰۰ میلیارد پارامتر، شامل مدلهای Transformer از نوع decoder-only متراکم (dense) سری Nemotron‑4 (2024)، مدلهای هیبریدی Mamba‑Transformer (Nemotron‑H، 2025) و مدلهای هیبریدی Mamba‑Transformer با Mixture-of-Experts (MoE) در سری Nemotron 3 (2025). تا مارس ۲۰۲۶، این خانواده بیش از ۲۰ مدل را شامل میشود که وظایف تولید متن، استدلال، درک بصری اسناد، استخراج اطلاعات و ارزیابی کیفیت پاسخها را پوشش میدهند. مدلها عمدتاً با وزنهای باز تحت مجوزهای NVIDIA Open Model License و Llama Community License منتشر میشوند.[1][2][3]
تاریخچه و پیشزمینه
توسعه خانواده Nemotron در چارچوب استراتژی NVIDIA برای ایجاد یک پشته کامل ابزار هوش مصنوعی مولد انجام میشود: از زیرساخت آموزش (DGX، ابررایانههای مبتنی بر GPU H100/B200) تا پلتفرمهای آموزش (NeMo Framework)، همترازسازی (NeMo‑Aligner)، استقرار (NIM — NVIDIA Inference Microservices) و تضمین ایمنی (NeMo Guardrails).[4][5]
Nemotron‑3 8B (2023)
اولین مدل عمومی این سری — یک Transformer از نوع decoder با ۸ میلیارد پارامتر و پنجره زمینه ۴۰۹۶ token، که بر روی ۳.۸ تریلیون token در ۵۳ زبان طبیعی و ۳۷ زبان برنامهنویسی آموزش دیده است. آموزش در طول ۱۹ روز بر روی ۱۰۲۴ GPU A100 انجام شد. گزارش فنی رسمی در arXiv منتشر نشد. مدل از طریق NeMo Framework و Hugging Face توزیع شد و نسخههای Chat (SFT و SteerLM) نیز وجود داشتند. مجوز: NVIDIA AI Foundation Models Community License.[6][7]
نکته درباره نامگذاری: «Nemotron‑3» سال ۲۰۲۳ و «Nemotron 3» دسامبر ۲۰۲۵ مدلهای متفاوتی هستند. اولی یک نمونه اولیه اولیه بود، دومی نسل فعلی با معماری MoE است.
Nemotron‑4 15B (فوریه ۲۰۲۴)
اولین انتشار مستند عمومی سری Nemotron‑4 — مدلی با ۱۵ میلیارد پارامتر، آموزشدیده بر روی ۸ تریلیون token در ~۱۳ روز تقویمی بر روی ۳۸۴ گره DGX H100 (تا ۳۰۷۲ GPU). از موازیسازی تنسوری ۸ برابری و موازیسازی داده از ۹۶ تا ۲۸۸ استفاده شد. اوج MFU (Model FLOPs Utilization) به ۳۴.۳٪ رسید با batch size برابر ۳۸۴. معماری: Transformer از نوع decoder-only با Grouped‑Query Attention (GQA) و Rotary Position Embeddings (RoPE). بر اساس نتایج benchmarkها در زمان انتشار، مدل از تمام مدلهای باز با اندازه مشابه در وظایف چندزبانه پیشی گرفت، از جمله برخی مدلهایی که چهار برابر بزرگتر بودند.[8]
Nemotron‑4 340B (ژوئن ۲۰۲۴)
در ژوئن ۲۰۲۴، بزرگترین مدل سری Nemotron‑4 منتشر شد — ۳۴۰ میلیارد پارامتر (۳۳۱.۶ میلیارد پارامتر غیر embedding)، از پیش آموزشدیده بر روی ۹ تریلیون token (۸ تریلیون پیشآموزش + ۱ تریلیون آموزش ادامهدار با وزندهی مجدد به منابع با کیفیت بالا). آموزش بر روی ۷۶۸ گره DGX H100 (تا ۶۱۴۴ GPU) با اوج MFU برابر ۴۲.۴٪، از دسامبر ۲۰۲۳ تا مه ۲۰۲۴ انجام شد. خانواده شامل سه نسخه است: Base، Instruct و Reward. اندازه مدل به گونهای انتخاب شده که در یک گره DGX H100 (8 GPU) با فرمت دقت FP8 جای بگیرد. بیش از ۹۸٪ دادههای استفادهشده در همترازسازی (alignment) به صورت مصنوعی توسط خود مدلهای سری در یک فرآیند تکراری تولید شدند؛ pipeline تولید داده مصنوعی برای بازتولید در دسترس عموم قرار گرفته است.[3]
Llama‑3.1‑Nemotron‑70B (اکتبر ۲۰۲۴)
در اکتبر ۲۰۲۴، مدلهایی که از Meta Llama‑3.1‑70B‑Instruct fine-tuning شده بودند منتشر شدند: Llama‑3.1‑Nemotron‑70B‑Instruct و Llama‑3.1‑Nemotron‑70B‑Reward. تا ۱ اکتبر ۲۰۲۴، مدل Instruct به طور همزمان رتبه اول را در سه benchmark خودکار کسب کرد: Arena Hard — 85.0، AlpacaEval 2 LC — 57.6٪، MT‑Bench (GPT‑4‑Turbo) — 8.98. مدل Reward به ۹۴.۱٪ در RewardBench دست یافت.[9][10]
گذار به معماریهای هیبریدی (2025)
در سال ۲۰۲۵، این سری با معماریهای هیبریدی که لایههای Mamba‑2 (State Space Model, SSM — مدل فضای حالت) و Transformer را ترکیب میکنند، گسترش یافت. در مارس تا مه ۲۰۲۵، خانواده مدلهای استدلالی Llama‑Nemotron (Nano 8B، Super 49B، Ultra 253B) با حالت استدلال قابل تغییر منتشر شد.[11] در آوریل ۲۰۲۵، Nemotron‑H (arXiv:2504.03624) — خانوادهای از مدلهای هیبریدی Mamba‑Transformer با اندازههای ۸B، ۵۶B و ۴۷B پارامتر منتشر شد.[12] در اوت ۲۰۲۵، Nemotron Nano 2 (9B‑v2، arXiv:2508.14444) معرفی شد.[13]
Nemotron 3 (دسامبر ۲۰۲۵)
در ۱۵ دسامبر ۲۰۲۵، نسل سوم — خانواده Nemotron 3 با مدلهای Nano، Super و Ultra اعلام شد که معماریهای Mamba‑2، Transformer و MoE را با پنجره زمینه تا ۱ میلیون token ترکیب میکند. Nano همراه با گزارش فنی منتشر شد؛ Super و Ultra برای نیمه اول ۲۰۲۶ برنامهریزی شدهاند.[1][2][14][15]
مبانی نظری
معماری Transformer در Nemotron‑4
مدلهای سری Nemotron‑4 بر پایه معماری استاندارد Transformer از نوع decoder با توجه علّی (causal attention) ساخته شدهاند. احتمال دنبالهای از tokenها به صورت زیر تجزیه میشود:
که در آن پارامترهای مدل هستند.[8]
مکانیزم توجه در نسخه Grouped‑Query Attention (GQA)[16] پیادهسازی شده است:
که در آن ماتریسهای query، key و value هستند؛ بُعد سر توجه است.
برای رمزگذاری موقعیت، از Rotary Position Embeddings (RoPE)[17] استفاده میشود:
که در آن بردار در موقعیت ، ، بُعد بردار است.
در لایههای MLP از فعالسازی Squared ReLU استفاده میشود: ، که تُنُکی (sparsity) فعالسازیها را تضمین میکند. مدلها فاقد bias هستند، از dropout استفاده نمیکنند و ماتریسهای embedding ورودی و خروجی به هم متصل نیستند (untied embeddings). توکنساز — SentencePiece BPE با حفظ فاصلهها، تجزیه کاراکتر به کاراکتر ارقام و fallback بایت به بایت، با اندازه واژگان ۲۵۶ ۰۰۰.[8][3]
پارامترهای معماری Nemotron‑4
| پارامتر | Nemotron‑4 15B | Nemotron‑4 340B |
|---|---|---|
| تعداد پارامترها | ۱۵ میلیارد (۳.۲ میلیارد embed.) | ۳۴۰ میلیارد (۹.۴ میلیارد embed.) |
| تعداد لایهها | ۳۲ | ۹۶ |
| بُعد پنهان | ۶۱۴۴ | ۱۸ ۴۳۲ |
| سرهای توجه | ۴۸ | ۹۶ |
| سرهای KV (GQA) | ۸ | ۸ |
| طول زمینه | ۴۰۹۶ | ۴۰۹۶ |
| اندازه واژگان | ۲۵۶ ۰۰۰ | ۲۵۶ ۰۰۰ |
منابع: arXiv:2402.16819، arXiv:2406.11704.[8][3]
معماری هیبریدی Mamba‑Transformer (Nemotron‑H)
در مدلهای Nemotron‑H، بلوکهای استاندارد self-attention تا حدی با بلوکهای Mamba‑2 — مدلهای فضای حالت (State Space Models, SSM) — جایگزین شدهاند. در هنگام تولید خودبازگشتی، هر لایه self-attention به عملیات و حافظه در هر گام نیاز دارد (به دلیل KV cache)، در حالی که لایههای Mamba هزینه حافظه و محاسبات ثابتی برای هر token تولیدشده دارند.[12]
Mamba‑2 با رابطه بازگشتی[18] توصیف میشود:
که در آن حالت پنهان، ماتریس انتقال حالت قطری، و ماتریسهای تصویر، token ورودی، سیگنال خروجی هستند. در Mamba‑2 ماتریسهای ، ، وابسته به ورودی (input‑dependent) هستند، که مدل را از SSM خطی کلاسیک متمایز میکند.
در Nemotron‑H‑56B از ۵۴ لایه Mamba‑2 + ۵۴ لایه MLP + ۱۰ لایه self-attention استفاده میشود، و لایههای توجه به صورت یکنواخت در میان لایههای Mamba قرار گرفتهاند. مدل بر روی ۲۰ تریلیون token در قالب FP8 (per‑tensor scaling) روی ۶۱۴۴ GPU H100 آموزش دیده است. نسخه Nemotron‑H‑8B شامل ۲۴ لایه Mamba‑2، ۲۴ لایه MLP و ۴ لایه self-attention است؛ آموزش روی ۱۵ تریلیون token انجام شده است.[12]
معماری MoE در Nemotron 3
مدلهای Nemotron 3 (دسامبر ۲۰۲۵) سه مؤلفه معماری را ترکیب میکنند: Mamba‑2، Transformer و Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) شامل ۵۲ لایه است: ۲۳ لایه Mamba‑2 + MoE، ۲۳ لایه MoE و ۶ لایه توجه GQA. هر لایه MoE شامل ۱۲۸ کارشناس مسیریابیشده (routed) + ۱ کارشناس مشترک (shared) است که از آنها ۶ کارشناس برای هر token فعال میشوند. مسیریابی توسط یک MLP router قابل آموزش با sigmoid gating انجام میشود. متوازنسازی بار بدون تابع زیان کمکی (aux‑loss‑free) پیادهسازی شده است. تعداد کل پارامترها ۳۱.۶ میلیارد است، اما تعداد فعال برای هر token تنها ۳.۲ میلیارد است.[2]
نرمالسازی — RMSNorm[19]. embedding موقعیتی در بخشهای Mamba وجود ندارد (اطلاعات موقعیتی به صورت ضمنی در حالت SSM نهفته است). از embeddingهای جدا از هم (untied)، بدون dropout و بدون bias در لایههای خطی استفاده میشود.[2]
توسعهها در Super/Ultra: LatentMoE و Multi‑Token Prediction
مدلهای Super و Ultra از خانواده Nemotron 3 از دو نوآوری معماری اضافی استفاده میکنند:
- Latent MoE (LatentMoE) — تصویر نمایش ورودی به یک فضای نهفته با ابعاد کمتر قبل از مسیریابی، که امکان افزایش تعداد کارشناسان را با هزینه محاسباتی مشابه فراهم میکند و دقت را بدون کاهش توان عملیاتی بهبود میبخشد.[1]
- Multi‑Token Prediction (MTP) — پیشبینی چند token بعدی به طور همزمان، که برای بهبود کیفیت متنهای طولانی و decoding حدسی (speculative decoding) در زمان inference استفاده میشود.[1]
آموزش Super و Ultra در قالب NVFP4 انجام میشود — فرمت عددی ۴ بیتی NVIDIA بر روی معماری Blackwell.[1]
روشهای فشردهسازی مدل: Minitron، Puzzle، MiniPuzzle
برای ایجاد مدلهای فشرده، NVIDIA از چندین رویکرد استفاده میکند:
- Minitron — روشی برای هرس ساختاریافته (pruning) و تقطیر دانش (knowledge distillation). دو نوع pruning بررسی میشود: عمقی (حذف لایهها) و عرضی (کاهش همزمان ابعاد لایههای پنهان، سرهای توجه و تصویرهای MLP). اعمال Minitron بر Nemotron‑4 15B امکان دستیابی به مدلهای ۸B و ۴B را با کاهش تا ۴۰ برابری هزینه آموزش در مقایسه با آموزش از صفر فراهم میکند.[20]
- Puzzle — الگوریتم Neural Architecture Search (NAS) که پیکربندی بهینه هر بلوک را (تعداد سرهای KV، اندازه FFN، حضور/غیاب توجه) با تقطیر بلوک به بلوک تعیین میکند. به همین روش، Llama 3.1 405B به ۲۵۳B (Llama‑Nemotron Ultra) و Llama 3.3 70B به ۴۹B (Llama‑Nemotron Super) فشرده شد.[21]
- MiniPuzzle — توسعه Puzzle برای معماریهای هیبریدی که Nemotron‑H‑56B را به ۴۷B با صرف تنها ۶۳ میلیارد token تقطیر فشرده کرد. با دقت مشابه، مدل فشرده ۲۰٪ سریعتر استنتاج میکند.[12]
روشهای همترازسازی
HelpSteer و HelpSteer2
HelpSteer — مجموعهای از ۳۷ ۱۲۰ نمونه (مجوز CC‑BY‑4.0)، ایجادشده با همکاری Scale AI، که در آن هر پاسخ بر اساس پنج ویژگی حاشیهنویسی شده است: مفید بودن (helpfulness)، صحت (correctness)، انسجام (coherence)، پیچیدگی (complexity) و پرحرفی (verbosity) در مقیاس Likert صفر تا چهار.[22]
HelpSteer2 — مجموعه بهروزشدهای از ۲۱ ۳۶۲ نمونه (۱۰ ۶۸۱ prompt × ۲ پاسخ)، که بیش از ۹۵٪ promptها از ShareGPT (درخواستهای واقعی کاربران) گرفته شدهاند. حدود ۵۰٪ حاشیهنویسیها به عنوان ناکافی در کیفیت فیلتر شدند. توسعه HelpSteer2‑Preference ترجیحات جفتی حاشیهنویسان را اضافه میکند و امکان آموزش هم مدلهای رگرسیونی و هم مدلهای پاداش جفتی را با استفاده از یک مجموعه داده فراهم میآورد.[23][24]
SteerLM
SteerLM — روش SFT (Supervised Fine‑Tuning — آموزش با ناظر) با شرطگذاری بر ویژگیها (helpfulness، correctness، coherence، complexity، verbosity)، که به کاربر امکان کنترل سبک پاسخ را در زمان inference میدهد. pipeline شامل این مراحل است: (1) آموزش مدل پیشبینی ویژگی (APM) بر HelpSteer، (2) برچسبزنی دادهها با APM، (3) SFT با شرطگذاری بر مقادیر هدف ویژگیها، (4) bootstrapping.[25]
DPO و RPO
DPO (Direct Preference Optimization) — روش بهینهسازی مستقیم ترجیحات بدون مدل پاداش صریح، که در pipelineهای Nemotron‑4 340B Instruct و Nemotron Nano 2 استفاده میشود.[26]
RPO (Reward‑aware Preference Optimization) — یک چارچوب ریاضی یکپارچه از NVIDIA که DPO، IPO، SimPO، REINFORCE و SteerLM 2.0 را به عنوان حالتهای خاص تعمیم میدهد. RPO فاصله بین پیشبینیهای مدل پاداش ضمنی و مدل پاداش صریح هدف را به حداقل میرساند[27]:
که در آن مدل پاداش صریح، سیاست قابل آموزش، سیاست مرجع، تابع فاصله، / پاسخ ترجیحی/رد شده هستند. RPO در آموزش Nemotron‑4 340B Instruct و مدلهای Llama‑Nemotron استفاده میشود.[27][3][11]
یادگیری تقویتی چندمحیطی (RLVR)
در Nemotron 3 از Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) استفاده میشود — آموزش همزمان در چندین محیط در چارچوب NeMo Gym: ریاضیات مسابقهای، برنامهنویسی، QA، tool‑use، instruction‑following، زمینه طولانی. الگوریتم — GRPO (Group Relative Policy Optimization) با masked importance sampling.[2][14]
Nemotron 3 از کنترل دقیق بودجه استدلال (reasoning budget control) پشتیبانی میکند: کاربر میتواند از طریق یک flag در chat template محدودیت token برای thinking trace تعیین کند (تغییر «detailed thinking on/off» یا محدود کردن طول).[2]
ردیف مدلها
جدول خلاصه
| مدل | سال | کل / پارامترهای فعال | زمینه | معماری | ویژگیهای کلیدی |
|---|---|---|---|---|---|
| Nemotron‑3 8B | ۲۰۲۳ | 8B / 8B | 4K | Dense Transformer | ۳.۸ تریلیون token؛ ۱۰۲۴ GPU A100؛ ۱۹ روز |
| Nemotron‑4 15B | ۲۰۲۴ | 15B / 15B | 4K | Dense Transformer | ۸ تریلیون token؛ MFU 34.3٪ |
| Nemotron‑4 340B | ۲۰۲۴ | 340B / 340B | 4K | Dense Transformer | ۹ تریلیون token؛ Base/Instruct/Reward؛ >۹۸٪ داده alignment مصنوعی |
| Llama‑3.1‑Nemotron‑70B | ۲۰۲۴ | 70B / 70B | 128K | Dense Transformer (Llama 3.1) | RLHF (REINFORCE)؛ RewardBench 94.1٪ |
| Llama‑Nemotron Nano 8B | ۲۰۲۵ | 8B / 8B | 128K | Dense Transformer (Llama 3.1) | Reasoning toggle |
| Llama‑Nemotron Nano 4B | ۲۰۲۵ | 4B / 4B | 128K | Dense Transformer (Minitron) | فشردهسازی NAS از Llama 3.1 8B |
| Llama‑Nemotron Super 49B | ۲۰۲۵ | 49B / 49B | 128K | Dense Transformer (Puzzle NAS) | از Llama 3.3 70B |
| Llama‑Nemotron Ultra 253B | ۲۰۲۵ | 253B / 253B | 128K | Dense Transformer (Puzzle NAS) | از Llama 3.1 405B؛ GPQA 76.0٪ |
| Nemotron‑H 8B | ۲۰۲۵ | 8B / 8B | — | هیبرید Mamba‑Transformer | ۱۵ تریلیون token؛ 24 Mamba‑2 + 24 MLP + 4 Attn |
| Nemotron‑H 56B | ۲۰۲۵ | 56B / 56B | — | هیبرید Mamba‑Transformer | ۲۰ تریلیون token FP8؛ 54 Mamba‑2 + 54 MLP + 10 Attn |
| Nemotron‑H 47B | ۲۰۲۵ | 47B / 47B | ~1M (FP4) | هیبرید Mamba‑Transformer | MiniPuzzle از 56B؛ +20٪ سرعت |
| Nemotron Nano 2 (9B) | ۲۰۲۵ | 12B → 9B / 9B | 128K | هیبرید Mamba‑Transformer | ۲۰ تریلیون token؛ Minitron-distillation |
| Nemotron 3 Nano | ۲۰۲۵ | 31.6B / 3.2B | 1M | هیبرید Mamba‑Transformer MoE | ۲۵ تریلیون token؛ ۱۲۸ کارشناس، ۶ فعال |
| Nemotron 3 Super | ۲۰۲۵–۲۰۲۶ | ~100B / ~10B | 1M | هیبرید LatentMoE | MTP؛ NVFP4 |
| Nemotron 3 Ultra | ۲۰۲۵–۲۰۲۶ | ~500B / ~50B | 1M | هیبرید LatentMoE | MTP؛ NVFP4 |
Nemotron‑4 15B
معماری: ۳۲ لایه، بُعد پنهان ۶۱۴۴، ۴۸ سر توجه، ۸ سر KV (GQA). تعداد کل پارامترها — ۱۵ میلیارد (۳.۲ میلیارد embedding + ۱۲.۵ میلیارد non‑embedding). نتایج: MMLU — 64.2٪ (5‑shot)، BBH — 58.7٪ (3‑shot)، GSM8K — 46.0٪ (8‑shot، maj@1)، HumanEval — 31.6٪ (0‑shot، pass@1). در benchmarkهای چندزبانه (XCOPA، TyDiQA‑GoldP، MGSM) مدل از مدلهای ۴ برابر بزرگتر پیشی گرفت.[8]
Nemotron‑4 340B
معماری: ۹۶ لایه، بُعد پنهان ۱۸ ۴۳۲، ۹۶ سر توجه، ۸ سر KV.
Nemotron‑4 340B Base نشان داد: MMLU — 81.1٪ (5‑shot)، BBH — 85.4٪ (3‑shot)، HumanEval — 57.3٪ (0‑shot)، ARC‑Challenge — 94.3٪ (25‑shot).[3]
Nemotron‑4 340B Instruct از همترازسازی چندمرحلهای گذشت: Code SFT → General SFT → DPO → RPO (3 دور). نتایج: MT‑Bench — 8.22 (قاضی GPT‑4‑Turbo)، MMLU — 78.7٪ (0‑shot)، GSM8K — 92.3٪ (0‑shot)، HumanEval — 73.2٪ (0‑shot)، Arena Hard — 54.2، AlpacaEval 2.0 LC — 41.5٪.[3]
Nemotron‑4 340B Reward لایه نهایی softmax را با یک تصویر خطی از حالت پنهان آخرین لایه به بردار ۵ ویژگی HelpSteer2 جایگزین میکند. پاداش نهایی — مجموع وزندار پنج ویژگی است. آموزش در ۲ دور بر روی دادههای HelpSteer2 (batch size 128) انجام شد. در RewardBench مدل به ۹۲.۰٪ رسید و در زمان انتشار از GPT‑4o (84.7٪)، Gemini 1.5 Pro (88.1٪) و Claude‑3‑Opus (80.7٪) پیشی گرفت.[3]
| مدل | Arena Hard | AlpacaEval 2.0 LC | MT‑Bench |
|---|---|---|---|
| Nemotron‑4‑340B‑Instruct | 54.2 | 41.5٪ | 8.22 |
| Llama‑3‑70B‑Instruct | 41.1 | 34.4٪ | 8.16 |
| Mixtral‑8x22B‑Instruct | 36.4 | 30.9٪ | 7.63 |
| Qwen‑2‑72B‑Instruct | 48.1 | 38.8٪ | 8.26 |
منبع: arXiv:2406.11704، جدول ۵.[3]
Llama‑3.1‑Nemotron‑70B
Llama‑3.1‑Nemotron‑70B‑Reward با روش ترکیبی آموزش دیده که Bradley‑Terry (ترجیحات جفتی) و رگرسیون SteerLM (ارزیابی چندویژگی بر اساس مقیاس Likert) را یکجا میکند. آموزش تنها بر روی دادههای HelpSteer2 (CC‑BY‑4.0) انجام شد. در RewardBench مدل به ۹۴.۱٪ رسید و در زمان انتشار رتبه اول را کسب کرد.[10]
Llama‑3.1‑Nemotron‑70B‑Instruct با روش RLHF با الگوریتم REINFORCE (نه PPO) و مدل پاداش Nemotron‑70B‑Reward همتراز شده است. زیرساخت — NeMo‑Aligner با شتابدهی TRT‑LLM.[9]
Llama‑Nemotron: Nano، Super، Ultra (2025)
خانوادهای از مدلهای استدلالی که از Llama 3.x با روشهای NAS، تقطیر و پسآموزش گسترده مشتق شدهاند.[11]
| مدل | پارامترها | مدل پایه | زمینه |
|---|---|---|---|
| Llama‑Nemotron‑Nano 8B | ۸ میلیارد | Llama‑3.1‑8B‑Instruct | 128K |
| Llama‑Nemotron‑Nano 4B | ۴ میلیارد | Minitron 4B (از Llama 3.1 8B) | 128K |
| Llama‑Nemotron‑Super 49B | ۴۹ میلیارد | Llama‑3.3‑70B → NAS (Puzzle) | 128K |
| Llama‑Nemotron‑Ultra 253B | ۲۵۳ میلیارد | Llama‑3.1‑405B → NAS (Puzzle) | 128K |
پنج مرحله pipeline آموزش: (1) NAS + FFN Fusion، (2) تقطیر + پیشآموزش ادامهدار، (3) SFT (شامل ردپای استدلال DeepSeek‑R1)، (4) RL گسترده (GRPO برای Ultra، REINFORCE/RLOO + Online RPO برای Nano)، (5) همترازسازی برای گفتگو.[11]
این مدلها اولین LLMهای باز بودند که از حالت استدلال قابل تغییر (reasoning toggle) پشتیبانی کردند: هنگام فعال بودن («detailed thinking on» در system prompt) مدل زنجیره استدلال را در تگهای <think>...</think> قبل از پاسخ تولید میکند؛ هنگام خاموش بودن — مستقیماً پاسخ میدهد.[11]
نتایج Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76.0٪، AIME 2024 — 80.8٪، MATH 500 — ~97٪. برای مقایسه: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5٪، AIME 2024 ~79.8٪. Ultra بر روی یک گره ۸×H100 مستقر میشود.[11]
Nemotron‑H (آوریل ۲۰۲۵)
خانوادهای از مدلهای هیبریدی متراکم که از صفر آموزش دیده و برای وظایف با تولیدهای طولانی طراحی شدهاند. Nemotron‑H‑56B بر روی ۲۰ تریلیون token در قالب FP8 آموزش دیده — یکی از بزرگترین آزمایشهای عمومی پیشآموزش FP8. Nemotron‑H‑47B با فشردهسازی 56B به روش MiniPuzzle (63 میلیارد token تقطیر) به دست آمده و در حافظه یک RTX 5090 (FP4) با زمینه ~1M token جای میگیرد.[12]
| Benchmark | Nemotron‑H‑56B | Nemotron‑H‑47B | Qwen‑2.5‑72B | Llama‑3.1‑70B |
|---|---|---|---|---|
| MMLU‑Pro (5‑shot CoT) | 60.5 | 61.8 | 58.8 | 51.3 |
| MMLU (5‑shot) | 84.2 | 83.6 | 86.1 | 78.8 |
| GSM8K (8‑shot CoT) | 93.7 | 93.3 | 90.9 | 83.9 |
| HumanEval (0‑shot) | 60.4 | 61.0 | 56.7 | 57.3 |
منبع: arXiv:2504.03624.[12]
در تولید با ۶۵ ۵۳۶ token ورودی و ۱۰۲۴ token خروجی بر روی H100، مدل Nemotron‑H‑47B ۲.۹ برابر سریعتر از Qwen‑2.5‑72B و Llama‑3.1‑70B عمل کرد.[12]
Nemotron Nano 2 (اوت ۲۰۲۵)
مدل هیبریدی Mamba‑Transformer برای استدلال. Nemotron‑Nano‑12B‑v2‑Base — مدل والد با ۶۲ لایه (عمدتاً Mamba‑2 + MLP + ۴ لایه توجه)، آموزشدیده بر روی ۲۰ تریلیون token در قالب FP8 از صفر. از آن با روش Minitron گستردهیافته، Nemotron‑Nano‑9B‑v2 مشتق شده که میتواند با زمینه ۱۲۸K token روی یک GPU NVIDIA A10G (22 گیگابایت، BF16) کار کند. پسآموزش: SFT (80 میلیارد token، شامل ردپای DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. در benchmarkهای استدلال، مدل از نظر دقت با Qwen3‑8B قابل مقایسه است، اما در دنبالههای خروجی طولانی به ۳ تا ۶ برابر شتابدهی تولید دست مییابد.[13]
Nemotron 3 Nano 30B‑A3B
در دسامبر ۲۰۲۵ منتشر شد. پارامترها: ۳۱.۶ میلیارد کل، ۳.۲ میلیارد فعال. معماری: ۵۲ لایه، بُعد پنهان ۲۶۸۸، بُعد کارشناس ۱۸۵۶، بُعد حالت Mamba 128. MoE: ۱۲۸ کارشناس مسیریابیشده + ۱ مشترک، ۶ فعال در هر token. زمینه — تا ۱ ۰۴۸ ۵۷۶ token. آموزش بر روی ۲۵ تریلیون token (برنامهریزی WSD، batch size 3072، برش داده — ژوئن ۲۰۲۵) در دو مرحله: مرحله ۱ — ۲۳.۵ تریلیون (دادههای متنوع)، مرحله ۲ — ۱.۵ تریلیون (دادههای باکیفیت) + ۱۲۱ میلیارد token آموزش زمینه طولانی CPT.[2]
| Benchmark | Nemotron 3 Nano 30B‑A3B | Qwen3‑30B‑A3B‑Thinking | GPT‑OSS‑20B |
|---|---|---|---|
| MMLU‑Pro | 78.30 | 80.9 | 75.0 |
| AIME25 (no tools) | 89.06 | 85.0 | 91.7 |
| AIME25 (with tools) | 99.17 | — | 98.7 |
| GPQA (no tools) | 73.04 | 73.4 | 71.5 |
| LiveCodeBench v6 | 68.25 | 66.0 | 61.0 |
| SWE‑Bench (OpenHands) | 38.76 | 22.0* | 34.0 |
| TauBench V2 Avg | 49.04 | 47.7 | 47.5 |
| Arena‑Hard‑V2 Avg | 67.65 | 57.8 | 48.55 |
| RULER‑100 @ 1M | 86.34 | 77.5 | — |
* — مقادیر از منابع ثانویه؛ شرایط بازتولید — NeMo Evaluator SDK. منبع: arXiv:2512.20848.[2][28]
توان عملیاتی (ورودی 8K / خروجی 16K، تک H200): ۳.۳ برابر بالاتر از Qwen3‑30B‑A3B‑Thinking و ۲.۲ برابر بالاتر از GPT‑OSS‑20B.[2]
مدلها و جهتگیریهای اضافی
- OpenReasoning‑Nemotron (ژوئیه ۲۰۲۵) — سری مدلهایی با ۱.۵B تا ۳۲B پارامتر، مبتنی بر Qwen 2.5 و fine-tuningشده بر روی دادههای DeepSeek‑R1‑0528. نسخه ۳۲B با GenSelect@64 از o3 (high) در برخی benchmarkهای ریاضی پیشی میگیرد.[29]
- Nemotron Elastic (arXiv:2511.16664) — چارچوب زیرمدلهای تودرتو (6B، 9B، 12B) در قالب یک مدل والد، که هزینه آموزش را ۳۶۰ برابر در مقایسه با آموزش از صفر کاهش میدهد.[30]
- Nemotron‑CrossThink — چارچوب یادگیری تقویتی چنددامنهای فراتر از وظایف ریاضی که +30.1٪ در MATH‑500 و +12.8٪ در MMLU‑PRO را به ارمغان آورد.[31]
- Nemotron‑UltraLong — گسترش زمینه تا ۴ میلیون token.[32]
- Jet‑Nemotron — NAS پسآموزشی برای مدلهای هیبریدی فشرده 2B/4B.[33]
مدلهای تخصصی
در اکوسیستم Nemotron مدلهایی برای وظایف تخصصی نیز وجود دارند:
- Nemotron Nano V2 VL — مدل vision‑language برای OCR، پردازش جدول و ویدیو.[34]
- Nemotron Parse 1.1 — مدلی برای OCR و استخراج ساختار اسناد.[35]
- Nemotron ColEmbed V2 — مدل embedding برای جستجوی بصری اسناد (late interaction).[36]
- Nemotron Speech — مدلهایی برای تشخیص خودکار گفتار (ASR)، سنتز گفتار (TTS) و ترجمه ماشینی (NMT).[1]
- Llama 3.1 Nemotron Safety Guard 8B V3 — مدل طبقهبندی محتوای ناامن در ۲۳ دسته به ۹ زبان با دقت ۸۴.۲٪.[37]
دادههای پیشآموزش
ترکیب دادههای Nemotron‑4
پیکره پیشآموزش Nemotron‑4 15B و 340B از سه دسته اصلی تشکیل شده است: متون انگلیسی (70٪)، متون چندزبانه به ۵۳ زبان (15٪) و کد منبع به ۴۳ زبان برنامهنویسی (15٪). از حذف تکرار در سطح سند (exact و near‑duplicate) و همچنین فیلترسازی با مدلهای زبانی و اکتشافی استفاده شد. مدل 15B بر روی ۸ تریلیون token و مدل 340B بر روی ۹ تریلیون (8 تریلیون پیشآموزش + ۱ تریلیون آموزش ادامهدار با وزندهی مجدد به منابع باکیفیت) آموزش دید.[8][3]
Nemotron‑CC
مجموعه داده Nemotron‑CC از Common Crawl با استفاده از مجموعهای از طبقهبندیکنندههای کیفیت و بازنویسی مصنوعی متون تشکیل شده است. حجم کل — ۶.۳ تریلیون token (۴.۴ تریلیون بدون تکرار + ۱.۹ تریلیون بازنویسی مصنوعی). pipeline در ابزار NeMo Curator ادغام شده است. این اثر به عنوان Long Paper در کنفرانس ACL 2025 پذیرفته شد.[38]
Nemotron‑CC‑Math
زیرمجموعه محور ریاضی با حجم ۱۳۳ میلیارد token، استخراجشده از Common Crawl با pipeline Lynx + LLM با حفظ ساختار فرمولهای ریاضی و کد در LaTeX.[39]
دادههای Nemotron 3 Nano
پیشآموزش Nemotron 3 Nano بر روی ۲۵ تریلیون token انجام شده است. مجموعه شامل: Nemotron‑CC‑v2.1، Nemotron‑CC‑Code‑v1، Nemotron‑CC‑Math‑v1 و datasetهای تخصصی STEM است. برای آموزش زمینه طولانی از ۱۲۱ میلیارد token اضافی CPT استفاده شده است.[2]
Nemotron Pretraining Dataset v1
مجموعهای که به صورت مصنوعی تولید شده و حوزههای STEM، متون دانشگاهی، وظایف استدلال و دامنههای چندزبانه را پوشش میدهد؛ شامل بیش از ۱۰ تریلیون token زبانی و ۱۸ میلیون نمونه برای SFT است. تمام مجموعه دادهها تحت مجوزهای آزاد و مجاز توزیع میشوند.[40]
Pipeline تولید داده مصنوعی (SDG)
Pipeline توصیفشده در گزارش Nemotron‑4 340B شامل مراحل زیر است[3]:
- تولید prompt: درخواستهای مصنوعی تکگام و دوگامه، تولیدشده با Mixtral‑8x7B‑Instruct‑v0.1 (مجوز Apache 2.0) بر اساس قالبهای Open QA، Writing، Closed QA، Math & Coding.
- تولید پاسخ: پاسخهای متعدد از نسخههای میانی مدلها برای تضمین تنوع.
- ارزیابی کیفیت: سه رویکرد — Ground‑Truth‑as‑a‑Judge (برای وظایف با پاسخ قابل تأیید)، LLM‑as‑Judge (مقایسه جفتهای پاسخ توسط مدل زبانی)، Reward‑Model‑as‑Judge (استفاده از Nemotron‑4‑340B‑Reward).
- همترازسازی تکراری از مدلهای ضعیف به قوی (weak‑to‑strong).
از ~۲۰ ۰۰۰ نمونه حاشیهنویسیشده توسط انسان (۱۰ ۰۰۰ برای SFT، ۱۰ ۰۰۰ HelpSteer2 برای مدل پاداش)، کل حجم باقیمانده دادههای همترازسازی به صورت مصنوعی تولید شد.[3]
کوانتیزاسیون و بهینهسازی inference
مدلهای Nemotron 3 Nano از Post‑Training Quantization (PTQ) در FP8 با استفاده از ModelOpt و Megatron‑LM پشتیبانی میکنند. از selective quantization استفاده میشود — لایههای attention و بخشی از Mamba در BF16 نگه داشته میشوند تا کیفیت حفظ شود؛ بقیه در FP8 کوانتیزه میشوند. طبق گزارش فنی، این رویکرد ~99٪ حفظ دقت را تضمین میکند.[2] Nano همچنین از inference در قالب NVFP4 پشتیبانی میکند.[1]
جدول خلاصه benchmarkها بر اساس نسلها
| مدل | MMLU | GSM8K | HumanEval | Arena Hard | MT‑Bench | شرایط |
|---|---|---|---|---|---|---|
| Nemotron‑4 15B | 64.2٪ | 46.0٪ | 31.6٪ | — | — | base؛ 5‑/8‑/0‑shot |
| Nemotron‑4 340B Base | 81.1٪ | — | 57.3٪ | — | — | 5‑/—/0‑shot |
| Nemotron‑4 340B Instruct | 78.7٪ | 92.3٪ | 73.2٪ | 54.2 | 8.22 | 0‑shot |
| Llama‑3.1‑Nemotron‑70B‑Instruct | — | — | — | 85.0 | 8.98 | اکتبر ۲۰۲۴ |
| LN‑Ultra 253B (reasoning ON) | — | — | — | — | — | GPQA 76.0٪، AIME 80.8٪ |
| Nemotron‑H‑47B | 83.6٪ | 93.3٪ | 61.0٪ | — | — | 5‑/8‑CoT/0‑shot |
| Nemotron 3 Nano (30B‑A3B) | — | — | — | 67.7 (v2) | — | AIME25 89.1٪، LCB 68.3٪ |
مقایسه باید با احتیاط تفسیر شود: شرایط ارزیابی، نسخههای benchmark و تاریخهای آزمون در میان نسلها متفاوت است. نتایج از گزارشهای فنی NVIDIA گرفته شدهاند؛ ارزیابیهای مستقل ممکن است متفاوت باشند (بخش «محدودیتها» را ببینید).[8][3][9][11][12][2]
کاربردها
استقرار از طریق NVIDIA NIM
NVIDIA NIM — مجموعهای از میکروسرویسهای کانتینری بهینهشده برای inference با API سازگار با OpenAI. مدلهای Nemotron به عنوان میکروسرویسهای NIM در پلتفرم build.nvidia.com در دسترس هستند. NIM از فرمتهای FP8، BF16، NVFP4 و استقرار از طریق Helm chart روی Kubernetes پشتیبانی میکند. مدلها همچنین با فریمورکهای مستقل سازگار هستند: vLLM، SGLang، Ollama، llama.cpp، TensorRT‑LLM.[4][1]
تولید داده مصنوعی
Nemotron‑4 340B برای استفاده به عنوان تولیدکننده داده مصنوعی طراحی شده است: مدل Instruct پاسخها را تولید میکند، مدل Reward آنها را ارزیابی و فیلتر میکند. مجوز NVIDIA Open Model License صریحاً استفاده از خروجی مدل برای آموزش مدلهای دیگر را مجاز میشمارد. طبق دادههای ServiceNow، ۱۵٪ از دادههای پیشآموزش مدل Apriel 1.6 آنها از مجموعه دادههای Nemotron به دست آمده است.[3][15][41]
سیستمهای عاملی
مدلهای خانواده Nemotron 3 (Nano، Super، Ultra) برای بارکاریهای چندعاملی طراحی شدهاند: برنامهریزی، بازیابی (retrieval)، فراخوانی ابزار (tool use). Nemotron 3 Nano نتیجه ۳۸.۷۶٪ را در SWE‑Bench (با OpenHands) و ۴۹.۰۴٪ (متوسط) را در TauBench V2 نشان میدهد.[2]
پیادهسازیهای سازمانی
در میان شرکای اعلامشده: ServiceNow (مدل مشترک Apriel Nemotron 15B برای اتوماسیون فرآیندهای کاری)، CrowdStrike (پلتفرم Charlotte AI)، Perplexity (مسیریابی درخواستها)، Accenture، Cadence، Deloitte، Oracle، Palantir، Siemens، Synopsys، Zoom. مدلها در AWS Amazon Bedrock در دسترس هستند؛ پشتیبانی از Google Cloud، CoreWeave، Nebius برنامهریزی شده است.[15]
محدودیتها و مسائل باز
ارزیابیهای مستقل و تفاوتها با دادههای NVIDIA
ارزیابیهای مستقل تفاوتهایی با نتایج ارائهشده توسط NVIDIA نشان میدهند. طبق دادههای Artificial Analysis (فوریه ۲۰۲۶)، Llama‑Nemotron‑Ultra 253B (reasoning) نمره Intelligence Index برابر ۱۵ دریافت کرد در حالی که میانه برای مدلهای با اندازه مشابه ۲۶ است. در پلتفرم Chatbot Arena (LMArena) مدلهای Nemotron موقعیت میانی در رتبهبندی دارند: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~رتبه ۱۴۷)، Nemotron 3 Nano — 1317 ±6 (~رتبه ۱۶۴).[42][43]
پرحرفی
مدلهای Nemotron پرحرفی بالایی از خود نشان میدهند: در ارزیابی Artificial Analysis، مدل Nemotron 3 Nano ۱۴۰ میلیون token تولید کرد (در حالی که میانه برای سایر مدلها ۱۲ میلیون بود)، که هزینه inference را افزایش میدهد. تحلیل DEV Community نشان داد که Llama‑3.1‑Nemotron‑70B‑Instruct با وجود رهبری رسمی در benchmarkهای خودکار، در برخی وظایف عملی دقت کافی نداشت، و نمرات بالا در benchmarkهای Arena-like ممکن است با ترجیح پاسخهای پرحرف و اطمینانبخش اما نه لزوماً دقیق توضیح داده شوند.[42][44]
توهمزایی و bias
NVIDIA در کارتهای مدل اشاره میکند که مدلها ممکن است «پیشداوریها را تقویت کنند و پاسخهای سمی تولید کنند، به ویژه در برابر promptهای سمی»، و همچنین «اطلاعات نادرست تولید کنند، جزئیات کلیدی را حذف کنند». باز بودن وزنها و دادهها امکان ممیزی خارجی را فراهم میکند.[11][13]
الزامات محاسباتی
مدلهای متراکم (Nemotron‑4 340B) برای آموزش کامل به خوشهای از ۷۶۸ گره DGX H100 نیاز دارند، که بازتولیدپذیری را برای گروههای آکادمیک بدون دسترسی به زیرساخت مشابه محدود میکند. زمینه طولانی (1M) در inference به حجم قابل توجهی از VRAM نیاز دارد.[3][2]
افت عملکرد در گسترش زمینه
در گسترش زمینه به دنبالههای بسیار طولانی، افت عملکرد در benchmarkهایی با زمینه کوتاه مشاهده شد.[32]
کوانتیزاسیون معماریهای هیبریدی
استفاده از دقت بسیار پایین (FP8/NVFP4) در معماریهای Mamba‑Transformer منجر به افت جزئی دقت (~1٪ در برخی benchmarkها) میشود. این مشکل با اعمال selective quantization حل میشود که معماری کامپایلرها و سرورهای inference را پیچیدهتر میکند.[2][1]
سایر مسائل باز
- وابستگی به benchmarkها با آلودگی احتمالی دادههای آموزشی.
- فقدان پروتکلهای استانداردشده برای مقایسه معماریهای هیبریدی SSM‑Transformer با مدلهای خالص Transformer.
- سؤال مقیاسپذیری رویکرد MoE در وظایفی که نیاز به استدلال عمیق با تعداد کم کارشناس در هر token دارند.
- دادههای Super/Ultra تا دسامبر ۲۰۲۵ اولیه هستند؛ benchmarkهای کامل پس از انتشار انتظار میرود.[1]
جنبههای اخلاقی و نظارتی
ایمنی در مرحله توسعه
در مرحله توسعه از: ارزیابی بر اساس چارچوب AEGIS (۱۳ دسته ایمنی محتوا)، اسکنر آسیبپذیری garak، و آزمون قرمز (red‑teaming) دستی استفاده میشود.[37]
ایمنی در مرحله استنتاج
NeMo Guardrails — جعبهابزار متنباز (مجوز Apache 2.0) که مانعهای قابل برنامهریزی را به سیستمهای LLM اضافه میکند. میکروسرویس ورودیها و خروجیها را رهگیری میکند و بررسیهای قابل پیکربندی را اعمال میکند: کنترل موضوع، تشخیص PII، تأیید «پایهگذاری» RAG، تشخیص حملههای jailbreak (شامل محافظت در برابر تزریق کد مبتنی بر YARA)، طبقهبندی ایمنی چندزبانه و چندوجهی.[45]
برای Nemotron 3 مجموعهای از ~۱۱ ۰۰۰ ردپای برچسبگذاریشده OpenTelemetry از سناریوهای واقعگرایانه با استفاده از ابزارها، برای ارزیابی ایمنی عاملی منتشر شده است.[1]
مجوزدهی
| مدلها | مجوز |
|---|---|
| Nemotron 3 (Nano، Super، Ultra) | NVIDIA Nemotron Open Model License |
| Nemotron‑4 340B (Base/Instruct/Reward) | NVIDIA Open Model License Agreement |
| Llama‑Nemotron (Nano/Super/Ultra) | Llama Community License (ارثبرده از Meta) |
| Nemotron‑3 8B (2023) | NVIDIA AI Foundation Models Community License |
NVIDIA Nemotron Open Model License استفاده تجاری، ایجاد و توزیع آثار مشتق را مجاز میشمارد، نیازی به انتساب ندارد (با حفظ فایل NOTICE)، محدودیتی بر تعداد کاربران اعمال نمیکند و صریحاً استفاده از خروجی مدل برای آموزش مدلهای دیگر را مجاز میشمارد.[46] مدلهای مبتنی بر Llama محدودیتهای Meta را به ارث میبرند، از جمله آستانه ۷۰۰ میلیون کاربر فعال ماهانه.[11]
برای Nemotron 3 Nano، NVIDIA منتشر کرده است: وزنهای مدل، بیش از ۱۰ تریلیون token داده آموزشی، دستورالعملهای آموزش، پایگاههای کد (NeMo، Megatron‑LM، NeMo‑Aligner)، بیش از ۱۰ محیط یادگیری تقویتی با بیش از ۹۰۰ ۰۰۰ وظیفه.[1][2]
چشماندازها و جهتگیریهای پژوهشی
انتشارات آتی شامل Nemotron 3 Super (~۱۰۰ میلیارد پارامتر، ~۱۰ میلیارد فعال) و Nemotron 3 Ultra (~۵۰۰ میلیارد، ~۵۰ میلیارد فعال)، که در نیمه اول ۲۰۲۶ انتظار میرود. هر دو مدل از LatentMoE، MTP و آموزش در قالب NVFP4 روی معماری Blackwell استفاده خواهند کرد.[1]
جهتگیری استراتژیک NVIDIA — موقعیتیابی Nemotron نه به عنوان یک مدل منفرد، بلکه به عنوان یک لایه زیرساختی برای سیستمهای چندعاملی، که در آن مدلهای مختلف خانواده برای وظایف مختلف با مسیریابی بر اساس پیچیدگی استفاده میشوند.[1][15]
جهتگیریهای اصلی پژوهشی:
- توسعه معماریهای هیبریدی — ادغام بیشتر لایههای SSM با مکانیزم توجه برای زمینه طولانی مقیاسپذیر.[12]
- روشهای چندسطحی فشردهسازی — توسعه Minitron، Puzzle، MiniPuzzle و Nemotron Elastic.[20][21][30]
- یادگیری تقویتی چنددامنهای — Nemotron‑CrossThink برای گسترش RL فراتر از وظایف ریاضی.[31]
- گسترش زمینه — Nemotron‑UltraLong تا ۴ میلیون token.[32]
- چندوجهی بودن — گسترش به حوزه vision‑language (Nemotron VL)، گفتار (Nemotron Speech)، جستجوی بصری اسناد (Nemotron ColEmbed V2).[34][35][36]
- مدلهای هیبریدی فشرده — Jet‑Nemotron (NAS برای مدلهای 2B/4B).[33]
- دستورالعملهای باز — انتشار دستورالعملهای کامل آموزش و دادهها برای بازتولید و سفارشیسازی توسط جامعه.[14]
همچنین ببینید
- معماری Transformer
- Reinforcement Learning from Human Feedback (RLHF)
- Llama (خانواده مدلهای Meta)
پیوندها
- NVIDIA Research — صفحه Nemotron 3: https://research.nvidia.com/labs/nemotron/Nemotron-3/
- NVIDIA Developer — Nemotron AI Models: https://developer.nvidia.com/nemotron
- Hugging Face — مستندات Nemotron: https://huggingface.co/docs/transformers/main/en/model_doc/nemotron
- مستندات NeMo Framework: https://docs.nvidia.com/nemo/
منابع
- NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- Parmar, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819، فوریه ۲۰۲۴. https://arxiv.org/abs/2402.16819
- Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704، ژوئن ۲۰۲۴. https://arxiv.org/abs/2406.11704
- Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673، ژوئن ۲۰۲۴. https://arxiv.org/abs/2406.08673
- Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679، ژوئیه ۲۰۲۴. https://arxiv.org/abs/2407.14679
- Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146، نوامبر ۲۰۲۴. https://arxiv.org/abs/2411.19146
- Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025. arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization. arXiv:2502.00203، ژانویه ۲۰۲۵. https://arxiv.org/abs/2502.00203
- Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624، آوریل ۲۰۲۵. https://arxiv.org/abs/2504.03624
- Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949، مه ۲۰۲۵. https://arxiv.org/abs/2505.00949
- Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2. arXiv:2508.14444، اوت ۲۰۲۵. https://arxiv.org/abs/2508.14444
- Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math. arXiv:2508.15096، اوت ۲۰۲۵. https://arxiv.org/abs/2508.15096
- Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic. arXiv:2511.16664، نوامبر ۲۰۲۵. https://arxiv.org/abs/2511.16664
- Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856، دسامبر ۲۰۲۵. https://arxiv.org/abs/2512.20856
- Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano. arXiv:2512.20848، دسامبر ۲۰۲۵. https://arxiv.org/abs/2512.20848
- Dao, T.; Gu, A. Transformers are SSMs. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- Ainslie, J. et al. GQA. arXiv:2305.13245، 2023. https://arxiv.org/abs/2305.13245
- Su, J. et al. RoFormer (RoPE). Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- Zhang, B.; Sennrich, R. RMSNorm. arXiv:1910.07467، 2019. https://arxiv.org/abs/1910.07467
- Rafailov, R. et al. Direct Preference Optimization. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
- ↑ 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
- ↑ NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
- ↑ NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
- ↑ Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
- ↑ 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
- ↑ 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
- ↑ 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
- ↑ 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
- ↑ 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
- ↑ 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
- ↑ Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
- ↑ Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
- ↑ Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
- ↑ Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
- ↑ 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
- ↑ 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
- ↑ Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
- ↑ Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
- ↑ Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- ↑ 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
- ↑ NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
- ↑ NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
- ↑ 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
- ↑ 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
- ↑ 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
- ↑ 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
- ↑ 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
- ↑ 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
- ↑ 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
- ↑ 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
- ↑ Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
- ↑ Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
- ↑ NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
- ↑ NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
- ↑ 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
- ↑ LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
- ↑ Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
- ↑ NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
- ↑ NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/