Nemotron (NVIDIA) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Nemotron — خانواده‌ای از مدل‌های زبانی بزرگ (Large Language Model, LLM) با وزن‌های باز، توسعه‌یافته توسط بخش Applied Deep Learning Research (ADLR) شرکت NVIDIA. این مدل‌ها در حوزه Machine Learning و پردازش زبان طبیعی (Natural Language Processing, NLP) قرار دارند و برای طیف گسترده‌ای از وظایف طراحی شده‌اند: تولید داده‌های مصنوعی، استنتاج منطقی (reasoning)، برنامه‌های عاملی (agentic AI) و استقرار بر روی سخت‌افزار صنعتی NVIDIA. این خانواده، مدل‌هایی با معماری‌ها و مقیاس‌های مختلف را در بر می‌گیرد: از ۴ میلیارد تا ~۵۰۰ میلیارد پارامتر، شامل مدل‌های Transformer از نوع decoder-only متراکم (dense) سری Nemotron‑4 (2024)، مدل‌های هیبریدی Mamba‑Transformer (Nemotron‑H، 2025) و مدل‌های هیبریدی Mamba‑Transformer با Mixture-of-Experts (MoE) در سری Nemotron 3 (2025). تا مارس ۲۰۲۶، این خانواده بیش از ۲۰ مدل را شامل می‌شود که وظایف تولید متن، استدلال، درک بصری اسناد، استخراج اطلاعات و ارزیابی کیفیت پاسخ‌ها را پوشش می‌دهند. مدل‌ها عمدتاً با وزن‌های باز تحت مجوزهای NVIDIA Open Model License و Llama Community License منتشر می‌شوند.[1][2][3]

تاریخچه و پیش‌زمینه

توسعه خانواده Nemotron در چارچوب استراتژی NVIDIA برای ایجاد یک پشته کامل ابزار هوش مصنوعی مولد انجام می‌شود: از زیرساخت آموزش (DGX، ابررایانه‌های مبتنی بر GPU H100/B200) تا پلتفرم‌های آموزش (NeMo Framework)، هم‌ترازسازی (NeMo‑Aligner)، استقرار (NIM — NVIDIA Inference Microservices) و تضمین ایمنی (NeMo Guardrails).[4][5]

Nemotron‑3 8B (2023)

اولین مدل عمومی این سری — یک Transformer از نوع decoder با ۸ میلیارد پارامتر و پنجره زمینه ۴۰۹۶ token، که بر روی ۳.۸ تریلیون token در ۵۳ زبان طبیعی و ۳۷ زبان برنامه‌نویسی آموزش دیده است. آموزش در طول ۱۹ روز بر روی ۱۰۲۴ GPU A100 انجام شد. گزارش فنی رسمی در arXiv منتشر نشد. مدل از طریق NeMo Framework و Hugging Face توزیع شد و نسخه‌های Chat (SFT و SteerLM) نیز وجود داشتند. مجوز: NVIDIA AI Foundation Models Community License.[6][7]

نکته درباره نام‌گذاری: «Nemotron‑3» سال ۲۰۲۳ و «Nemotron 3» دسامبر ۲۰۲۵ مدل‌های متفاوتی هستند. اولی یک نمونه اولیه اولیه بود، دومی نسل فعلی با معماری MoE است.

Nemotron‑4 15B (فوریه ۲۰۲۴)

اولین انتشار مستند عمومی سری Nemotron‑4 — مدلی با ۱۵ میلیارد پارامتر، آموزش‌دیده بر روی ۸ تریلیون token در ~۱۳ روز تقویمی بر روی ۳۸۴ گره DGX H100 (تا ۳۰۷۲ GPU). از موازی‌سازی تنسوری ۸ برابری و موازی‌سازی داده از ۹۶ تا ۲۸۸ استفاده شد. اوج MFU (Model FLOPs Utilization) به ۳۴.۳٪ رسید با batch size برابر ۳۸۴. معماری: Transformer از نوع decoder-only با Grouped‑Query Attention (GQA) و Rotary Position Embeddings (RoPE). بر اساس نتایج benchmark‌ها در زمان انتشار، مدل از تمام مدل‌های باز با اندازه مشابه در وظایف چندزبانه پیشی گرفت، از جمله برخی مدل‌هایی که چهار برابر بزرگتر بودند.[8]

Nemotron‑4 340B (ژوئن ۲۰۲۴)

در ژوئن ۲۰۲۴، بزرگ‌ترین مدل سری Nemotron‑4 منتشر شد — ۳۴۰ میلیارد پارامتر (۳۳۱.۶ میلیارد پارامتر غیر embedding)، از پیش آموزش‌دیده بر روی ۹ تریلیون token (۸ تریلیون پیش‌آموزش + ۱ تریلیون آموزش ادامه‌دار با وزن‌دهی مجدد به منابع با کیفیت بالا). آموزش بر روی ۷۶۸ گره DGX H100 (تا ۶۱۴۴ GPU) با اوج MFU برابر ۴۲.۴٪، از دسامبر ۲۰۲۳ تا مه ۲۰۲۴ انجام شد. خانواده شامل سه نسخه است: Base، Instruct و Reward. اندازه مدل به گونه‌ای انتخاب شده که در یک گره DGX H100 (8 GPU) با فرمت دقت FP8 جای بگیرد. بیش از ۹۸٪ داده‌های استفاده‌شده در هم‌ترازسازی (alignment) به صورت مصنوعی توسط خود مدل‌های سری در یک فرآیند تکراری تولید شدند؛ pipeline تولید داده مصنوعی برای بازتولید در دسترس عموم قرار گرفته است.[3]

Llama‑3.1‑Nemotron‑70B (اکتبر ۲۰۲۴)

در اکتبر ۲۰۲۴، مدل‌هایی که از Meta Llama‑3.1‑70B‑Instruct fine-tuning شده بودند منتشر شدند: Llama‑3.1‑Nemotron‑70B‑Instruct و Llama‑3.1‑Nemotron‑70B‑Reward. تا ۱ اکتبر ۲۰۲۴، مدل Instruct به طور همزمان رتبه اول را در سه benchmark خودکار کسب کرد: Arena Hard — 85.0، AlpacaEval 2 LC — 57.6٪، MT‑Bench (GPT‑4‑Turbo) — 8.98. مدل Reward به ۹۴.۱٪ در RewardBench دست یافت.[9][10]

گذار به معماری‌های هیبریدی (2025)

در سال ۲۰۲۵، این سری با معماری‌های هیبریدی که لایه‌های Mamba‑2 (State Space Model, SSM — مدل فضای حالت) و Transformer را ترکیب می‌کنند، گسترش یافت. در مارس تا مه ۲۰۲۵، خانواده مدل‌های استدلالی Llama‑Nemotron (Nano 8B، Super 49B، Ultra 253B) با حالت استدلال قابل تغییر منتشر شد.[11] در آوریل ۲۰۲۵، Nemotron‑H (arXiv:2504.03624) — خانواده‌ای از مدل‌های هیبریدی Mamba‑Transformer با اندازه‌های ۸B، ۵۶B و ۴۷B پارامتر منتشر شد.[12] در اوت ۲۰۲۵، Nemotron Nano 2 (9B‑v2، arXiv:2508.14444) معرفی شد.[13]

Nemotron 3 (دسامبر ۲۰۲۵)

در ۱۵ دسامبر ۲۰۲۵، نسل سوم — خانواده Nemotron 3 با مدل‌های Nano، Super و Ultra اعلام شد که معماری‌های Mamba‑2، Transformer و MoE را با پنجره زمینه تا ۱ میلیون token ترکیب می‌کند. Nano همراه با گزارش فنی منتشر شد؛ Super و Ultra برای نیمه اول ۲۰۲۶ برنامه‌ریزی شده‌اند.[1][2][14][15]

مبانی نظری

معماری Transformer در Nemotron‑4

مدل‌های سری Nemotron‑4 بر پایه معماری استاندارد Transformer از نوع decoder با توجه علّی (causal attention) ساخته شده‌اند. احتمال دنباله‌ای از token‌ها x1,x2,,xT به صورت زیر تجزیه می‌شود:

p(x1,,xT)=t=1Tp(xtx1,,xt1;θ),

که در آن θ پارامترهای مدل هستند.[8]

مکانیزم توجه در نسخه Grouped‑Query Attention (GQA)[16] پیاده‌سازی شده است:

Attention(Q,K,V)=softmax(QKdk)V,

که در آن Q,K,V ماتریس‌های query، key و value هستند؛ dk بُعد سر توجه است.

برای رمزگذاری موقعیت، از Rotary Position Embeddings (RoPE)[17] استفاده می‌شود:

RoPE(xm,m)=(xm(1)cosmθ1xm(2)sinmθ1xm(1)sinmθ1+xm(2)cosmθ1),

که در آن xm بردار در موقعیت m، θi=100002i/d، d بُعد بردار است.

در لایه‌های MLP از فعال‌سازی Squared ReLU استفاده می‌شود: f(x)=(max(0,x))2، که تُنُکی (sparsity) فعال‌سازی‌ها را تضمین می‌کند. مدل‌ها فاقد bias هستند، از dropout استفاده نمی‌کنند و ماتریس‌های embedding ورودی و خروجی به هم متصل نیستند (untied embeddings). توکن‌ساز — SentencePiece BPE با حفظ فاصله‌ها، تجزیه کاراکتر به کاراکتر ارقام و fallback بایت به بایت، با اندازه واژگان ۲۵۶ ۰۰۰.[8][3]

پارامترهای معماری Nemotron‑4
پارامتر Nemotron‑4 15B Nemotron‑4 340B
تعداد پارامترها ۱۵ میلیارد (۳.۲ میلیارد embed.) ۳۴۰ میلیارد (۹.۴ میلیارد embed.)
تعداد لایه‌ها ۳۲ ۹۶
بُعد پنهان ۶۱۴۴ ۱۸ ۴۳۲
سرهای توجه ۴۸ ۹۶
سرهای KV (GQA) ۸ ۸
طول زمینه ۴۰۹۶ ۴۰۹۶
اندازه واژگان ۲۵۶ ۰۰۰ ۲۵۶ ۰۰۰

منابع: arXiv:2402.16819، arXiv:2406.11704.[8][3]

معماری هیبریدی Mamba‑Transformer (Nemotron‑H)

در مدل‌های Nemotron‑H، بلوک‌های استاندارد self-attention تا حدی با بلوک‌های Mamba‑2 — مدل‌های فضای حالت (State Space Models, SSM) — جایگزین شده‌اند. در هنگام تولید خودبازگشتی، هر لایه self-attention به O(n) عملیات و حافظه در هر گام نیاز دارد (به دلیل KV cache)، در حالی که لایه‌های Mamba هزینه حافظه و محاسبات ثابتی برای هر token تولیدشده دارند.[12]

Mamba‑2 با رابطه بازگشتی[18] توصیف می‌شود:

ht=Aht1+Bxt,yt=Cht,

که در آن htN حالت پنهان، AN×N ماتریس انتقال حالت قطری، BN×1 و C1×N ماتریس‌های تصویر، xt token ورودی، yt سیگنال خروجی هستند. در Mamba‑2 ماتریس‌های A، B، C وابسته به ورودی (input‑dependent) هستند، که مدل را از SSM خطی کلاسیک متمایز می‌کند.

در Nemotron‑H‑56B از ۵۴ لایه Mamba‑2 + ۵۴ لایه MLP + ۱۰ لایه self-attention استفاده می‌شود، و لایه‌های توجه به صورت یکنواخت در میان لایه‌های Mamba قرار گرفته‌اند. مدل بر روی ۲۰ تریلیون token در قالب FP8 (per‑tensor scaling) روی ۶۱۴۴ GPU H100 آموزش دیده است. نسخه Nemotron‑H‑8B شامل ۲۴ لایه Mamba‑2، ۲۴ لایه MLP و ۴ لایه self-attention است؛ آموزش روی ۱۵ تریلیون token انجام شده است.[12]

معماری MoE در Nemotron 3

مدل‌های Nemotron 3 (دسامبر ۲۰۲۵) سه مؤلفه معماری را ترکیب می‌کنند: Mamba‑2، Transformer و Mixture‑of‑Experts.[1][2] Nemotron 3 Nano (30B‑A3B) شامل ۵۲ لایه است: ۲۳ لایه Mamba‑2 + MoE، ۲۳ لایه MoE و ۶ لایه توجه GQA. هر لایه MoE شامل ۱۲۸ کارشناس مسیریابی‌شده (routed) + ۱ کارشناس مشترک (shared) است که از آن‌ها ۶ کارشناس برای هر token فعال می‌شوند. مسیریابی توسط یک MLP router قابل آموزش با sigmoid gating انجام می‌شود. متوازن‌سازی بار بدون تابع زیان کمکی (aux‑loss‑free) پیاده‌سازی شده است. تعداد کل پارامترها ۳۱.۶ میلیارد است، اما تعداد فعال برای هر token تنها ۳.۲ میلیارد است.[2]

نرمال‌سازی — RMSNorm[19]. embedding موقعیتی در بخش‌های Mamba وجود ندارد (اطلاعات موقعیتی به صورت ضمنی در حالت SSM نهفته است). از embedding‌های جدا از هم (untied)، بدون dropout و بدون bias در لایه‌های خطی استفاده می‌شود.[2]

توسعه‌ها در Super/Ultra: LatentMoE و Multi‑Token Prediction

مدل‌های Super و Ultra از خانواده Nemotron 3 از دو نوآوری معماری اضافی استفاده می‌کنند:

  • Latent MoE (LatentMoE) — تصویر نمایش ورودی به یک فضای نهفته با ابعاد کمتر قبل از مسیریابی، که امکان افزایش تعداد کارشناسان را با هزینه محاسباتی مشابه فراهم می‌کند و دقت را بدون کاهش توان عملیاتی بهبود می‌بخشد.[1]
  • Multi‑Token Prediction (MTP) — پیش‌بینی چند token بعدی به طور همزمان، که برای بهبود کیفیت متن‌های طولانی و decoding حدسی (speculative decoding) در زمان inference استفاده می‌شود.[1]

آموزش Super و Ultra در قالب NVFP4 انجام می‌شود — فرمت عددی ۴ بیتی NVIDIA بر روی معماری Blackwell.[1]

روش‌های فشرده‌سازی مدل: Minitron، Puzzle، MiniPuzzle

برای ایجاد مدل‌های فشرده، NVIDIA از چندین رویکرد استفاده می‌کند:

  • Minitron — روشی برای هرس ساختاریافته (pruning) و تقطیر دانش (knowledge distillation). دو نوع pruning بررسی می‌شود: عمقی (حذف لایه‌ها) و عرضی (کاهش همزمان ابعاد لایه‌های پنهان، سرهای توجه و تصویرهای MLP). اعمال Minitron بر Nemotron‑4 15B امکان دستیابی به مدل‌های ۸B و ۴B را با کاهش تا ۴۰ برابری هزینه آموزش در مقایسه با آموزش از صفر فراهم می‌کند.[20]
  • Puzzle — الگوریتم Neural Architecture Search (NAS) که پیکربندی بهینه هر بلوک را (تعداد سرهای KV، اندازه FFN، حضور/غیاب توجه) با تقطیر بلوک به بلوک تعیین می‌کند. به همین روش، Llama 3.1 405B به ۲۵۳B (Llama‑Nemotron Ultra) و Llama 3.3 70B به ۴۹B (Llama‑Nemotron Super) فشرده شد.[21]
  • MiniPuzzle — توسعه Puzzle برای معماری‌های هیبریدی که Nemotron‑H‑56B را به ۴۷B با صرف تنها ۶۳ میلیارد token تقطیر فشرده کرد. با دقت مشابه، مدل فشرده ۲۰٪ سریع‌تر استنتاج می‌کند.[12]

روش‌های هم‌ترازسازی

HelpSteer و HelpSteer2

HelpSteer — مجموعه‌ای از ۳۷ ۱۲۰ نمونه (مجوز CC‑BY‑4.0)، ایجادشده با همکاری Scale AI، که در آن هر پاسخ بر اساس پنج ویژگی حاشیه‌نویسی شده است: مفید بودن (helpfulness)، صحت (correctness)، انسجام (coherence)، پیچیدگی (complexity) و پرحرفی (verbosity) در مقیاس Likert صفر تا چهار.[22]

HelpSteer2 — مجموعه به‌روزشده‌ای از ۲۱ ۳۶۲ نمونه (۱۰ ۶۸۱ prompt × ۲ پاسخ)، که بیش از ۹۵٪ promptها از ShareGPT (درخواست‌های واقعی کاربران) گرفته شده‌اند. حدود ۵۰٪ حاشیه‌نویسی‌ها به عنوان ناکافی در کیفیت فیلتر شدند. توسعه HelpSteer2‑Preference ترجیحات جفتی حاشیه‌نویسان را اضافه می‌کند و امکان آموزش هم مدل‌های رگرسیونی و هم مدل‌های پاداش جفتی را با استفاده از یک مجموعه داده فراهم می‌آورد.[23][24]

SteerLM

SteerLM — روش SFT (Supervised Fine‑Tuning — آموزش با ناظر) با شرط‌گذاری بر ویژگی‌ها (helpfulness، correctness، coherence، complexity، verbosity)، که به کاربر امکان کنترل سبک پاسخ را در زمان inference می‌دهد. pipeline شامل این مراحل است: (1) آموزش مدل پیش‌بینی ویژگی (APM) بر HelpSteer، (2) برچسب‌زنی داده‌ها با APM، (3) SFT با شرط‌گذاری بر مقادیر هدف ویژگی‌ها، (4) bootstrapping.[25]

DPO و RPO

DPO (Direct Preference Optimization) — روش بهینه‌سازی مستقیم ترجیحات بدون مدل پاداش صریح، که در pipeline‌های Nemotron‑4 340B Instruct و Nemotron Nano 2 استفاده می‌شود.[26]

RPO (Reward‑aware Preference Optimization) — یک چارچوب ریاضی یکپارچه از NVIDIA که DPO، IPO، SimPO، REINFORCE و SteerLM 2.0 را به عنوان حالت‌های خاص تعمیم می‌دهد. RPO فاصله بین پیش‌بینی‌های مدل پاداش ضمنی و مدل پاداش صریح هدف را به حداقل می‌رساند[27]:

RPO(θ)=𝔼(x,yw,yl)𝒟[d(rϕ(x,yw)rϕ(x,yl),βlogπθ(yw|x)πref(yw|x)βlogπθ(yl|x)πref(yl|x))],

که در آن rϕ مدل پاداش صریح، πθ سیاست قابل آموزش، πref سیاست مرجع، d(,) تابع فاصله، yw/yl پاسخ ترجیحی/رد شده هستند. RPO در آموزش Nemotron‑4 340B Instruct و مدل‌های Llama‑Nemotron استفاده می‌شود.[27][3][11]

یادگیری تقویتی چندمحیطی (RLVR)

در Nemotron 3 از Multi‑environment RLVR (Reinforcement Learning from Verifiable Rewards) استفاده می‌شود — آموزش همزمان در چندین محیط در چارچوب NeMo Gym: ریاضیات مسابقه‌ای، برنامه‌نویسی، QA، tool‑use، instruction‑following، زمینه طولانی. الگوریتم — GRPO (Group Relative Policy Optimization) با masked importance sampling.[2][14]

Nemotron 3 از کنترل دقیق بودجه استدلال (reasoning budget control) پشتیبانی می‌کند: کاربر می‌تواند از طریق یک flag در chat template محدودیت token برای thinking trace تعیین کند (تغییر «detailed thinking on/off» یا محدود کردن طول).[2]

ردیف مدل‌ها

جدول خلاصه

مدل سال کل / پارامترهای فعال زمینه معماری ویژگی‌های کلیدی
Nemotron‑3 8B ۲۰۲۳ 8B / 8B 4K Dense Transformer ۳.۸ تریلیون token؛ ۱۰۲۴ GPU A100؛ ۱۹ روز
Nemotron‑4 15B ۲۰۲۴ 15B / 15B 4K Dense Transformer ۸ تریلیون token؛ MFU 34.3٪
Nemotron‑4 340B ۲۰۲۴ 340B / 340B 4K Dense Transformer ۹ تریلیون token؛ Base/Instruct/Reward؛ >۹۸٪ داده alignment مصنوعی
Llama‑3.1‑Nemotron‑70B ۲۰۲۴ 70B / 70B 128K Dense Transformer (Llama 3.1) RLHF (REINFORCE)؛ RewardBench 94.1٪
Llama‑Nemotron Nano 8B ۲۰۲۵ 8B / 8B 128K Dense Transformer (Llama 3.1) Reasoning toggle
Llama‑Nemotron Nano 4B ۲۰۲۵ 4B / 4B 128K Dense Transformer (Minitron) فشرده‌سازی NAS از Llama 3.1 8B
Llama‑Nemotron Super 49B ۲۰۲۵ 49B / 49B 128K Dense Transformer (Puzzle NAS) از Llama 3.3 70B
Llama‑Nemotron Ultra 253B ۲۰۲۵ 253B / 253B 128K Dense Transformer (Puzzle NAS) از Llama 3.1 405B؛ GPQA 76.0٪
Nemotron‑H 8B ۲۰۲۵ 8B / 8B هیبرید Mamba‑Transformer ۱۵ تریلیون token؛ 24 Mamba‑2 + 24 MLP + 4 Attn
Nemotron‑H 56B ۲۰۲۵ 56B / 56B هیبرید Mamba‑Transformer ۲۰ تریلیون token FP8؛ 54 Mamba‑2 + 54 MLP + 10 Attn
Nemotron‑H 47B ۲۰۲۵ 47B / 47B ~1M (FP4) هیبرید Mamba‑Transformer MiniPuzzle از 56B؛ +20٪ سرعت
Nemotron Nano 2 (9B) ۲۰۲۵ 12B → 9B / 9B 128K هیبرید Mamba‑Transformer ۲۰ تریلیون token؛ Minitron-distillation
Nemotron 3 Nano ۲۰۲۵ 31.6B / 3.2B 1M هیبرید Mamba‑Transformer MoE ۲۵ تریلیون token؛ ۱۲۸ کارشناس، ۶ فعال
Nemotron 3 Super ۲۰۲۵–۲۰۲۶ ~100B / ~10B 1M هیبرید LatentMoE MTP؛ NVFP4
Nemotron 3 Ultra ۲۰۲۵–۲۰۲۶ ~500B / ~50B 1M هیبرید LatentMoE MTP؛ NVFP4

Nemotron‑4 15B

معماری: ۳۲ لایه، بُعد پنهان ۶۱۴۴، ۴۸ سر توجه، ۸ سر KV (GQA). تعداد کل پارامترها — ۱۵ میلیارد (۳.۲ میلیارد embedding + ۱۲.۵ میلیارد non‑embedding). نتایج: MMLU — 64.2٪ (5‑shot)، BBH — 58.7٪ (3‑shot)، GSM8K — 46.0٪ (8‑shot، maj@1)، HumanEval — 31.6٪ (0‑shot، pass@1). در benchmark‌های چندزبانه (XCOPA، TyDiQA‑GoldP، MGSM) مدل از مدل‌های ۴ برابر بزرگتر پیشی گرفت.[8]

Nemotron‑4 340B

معماری: ۹۶ لایه، بُعد پنهان ۱۸ ۴۳۲، ۹۶ سر توجه، ۸ سر KV.

Nemotron‑4 340B Base نشان داد: MMLU — 81.1٪ (5‑shot)، BBH — 85.4٪ (3‑shot)، HumanEval — 57.3٪ (0‑shot)، ARC‑Challenge — 94.3٪ (25‑shot).[3]

Nemotron‑4 340B Instruct از هم‌ترازسازی چندمرحله‌ای گذشت: Code SFT → General SFT → DPO → RPO (3 دور). نتایج: MT‑Bench — 8.22 (قاضی GPT‑4‑Turbo)، MMLU — 78.7٪ (0‑shot)، GSM8K — 92.3٪ (0‑shot)، HumanEval — 73.2٪ (0‑shot)، Arena Hard — 54.2، AlpacaEval 2.0 LC — 41.5٪.[3]

Nemotron‑4 340B Reward لایه نهایی softmax را با یک تصویر خطی از حالت پنهان آخرین لایه به بردار ۵ ویژگی HelpSteer2 جایگزین می‌کند. پاداش نهایی — مجموع وزن‌دار پنج ویژگی است. آموزش در ۲ دور بر روی داده‌های HelpSteer2 (batch size 128) انجام شد. در RewardBench مدل به ۹۲.۰٪ رسید و در زمان انتشار از GPT‑4o (84.7٪)، Gemini 1.5 Pro (88.1٪) و Claude‑3‑Opus (80.7٪) پیشی گرفت.[3]

مدل Arena Hard AlpacaEval 2.0 LC MT‑Bench
Nemotron‑4‑340B‑Instruct 54.2 41.5٪ 8.22
Llama‑3‑70B‑Instruct 41.1 34.4٪ 8.16
Mixtral‑8x22B‑Instruct 36.4 30.9٪ 7.63
Qwen‑2‑72B‑Instruct 48.1 38.8٪ 8.26

منبع: arXiv:2406.11704، جدول ۵.[3]

Llama‑3.1‑Nemotron‑70B

Llama‑3.1‑Nemotron‑70B‑Reward با روش ترکیبی آموزش دیده که Bradley‑Terry (ترجیحات جفتی) و رگرسیون SteerLM (ارزیابی چندویژگی بر اساس مقیاس Likert) را یکجا می‌کند. آموزش تنها بر روی داده‌های HelpSteer2 (CC‑BY‑4.0) انجام شد. در RewardBench مدل به ۹۴.۱٪ رسید و در زمان انتشار رتبه اول را کسب کرد.[10]

Llama‑3.1‑Nemotron‑70B‑Instruct با روش RLHF با الگوریتم REINFORCE (نه PPO) و مدل پاداش Nemotron‑70B‑Reward هم‌تراز شده است. زیرساخت — NeMo‑Aligner با شتاب‌دهی TRT‑LLM.[9]

Llama‑Nemotron: Nano، Super، Ultra (2025)

خانواده‌ای از مدل‌های استدلالی که از Llama 3.x با روش‌های NAS، تقطیر و پس‌آموزش گسترده مشتق شده‌اند.[11]

مدل پارامترها مدل پایه زمینه
Llama‑Nemotron‑Nano 8B ۸ میلیارد Llama‑3.1‑8B‑Instruct 128K
Llama‑Nemotron‑Nano 4B ۴ میلیارد Minitron 4B (از Llama 3.1 8B) 128K
Llama‑Nemotron‑Super 49B ۴۹ میلیارد Llama‑3.3‑70B → NAS (Puzzle) 128K
Llama‑Nemotron‑Ultra 253B ۲۵۳ میلیارد Llama‑3.1‑405B → NAS (Puzzle) 128K

پنج مرحله pipeline آموزش: (1) NAS + FFN Fusion، (2) تقطیر + پیش‌آموزش ادامه‌دار، (3) SFT (شامل ردپای استدلال DeepSeek‑R1)، (4) RL گسترده (GRPO برای Ultra، REINFORCE/RLOO + Online RPO برای Nano)، (5) هم‌ترازسازی برای گفتگو.[11]

این مدل‌ها اولین LLMهای باز بودند که از حالت استدلال قابل تغییر (reasoning toggle) پشتیبانی کردند: هنگام فعال بودن («detailed thinking on» در system prompt) مدل زنجیره استدلال را در تگ‌های <think>...</think> قبل از پاسخ تولید می‌کند؛ هنگام خاموش بودن — مستقیماً پاسخ می‌دهد.[11]

نتایج Llama‑Nemotron‑Ultra 253B (reasoning ON): GPQA Diamond — 76.0٪، AIME 2024 — 80.8٪، MATH 500 — ~97٪. برای مقایسه: DeepSeek‑R1 (671B total / 37B active) — GPQA Diamond 71.5٪، AIME 2024 ~79.8٪. Ultra بر روی یک گره ۸×H100 مستقر می‌شود.[11]

Nemotron‑H (آوریل ۲۰۲۵)

خانواده‌ای از مدل‌های هیبریدی متراکم که از صفر آموزش دیده و برای وظایف با تولیدهای طولانی طراحی شده‌اند. Nemotron‑H‑56B بر روی ۲۰ تریلیون token در قالب FP8 آموزش دیده — یکی از بزرگ‌ترین آزمایش‌های عمومی پیش‌آموزش FP8. Nemotron‑H‑47B با فشرده‌سازی 56B به روش MiniPuzzle (63 میلیارد token تقطیر) به دست آمده و در حافظه یک RTX 5090 (FP4) با زمینه ~1M token جای می‌گیرد.[12]

Benchmark Nemotron‑H‑56B Nemotron‑H‑47B Qwen‑2.5‑72B Llama‑3.1‑70B
MMLU‑Pro (5‑shot CoT) 60.5 61.8 58.8 51.3
MMLU (5‑shot) 84.2 83.6 86.1 78.8
GSM8K (8‑shot CoT) 93.7 93.3 90.9 83.9
HumanEval (0‑shot) 60.4 61.0 56.7 57.3

منبع: arXiv:2504.03624.[12]

در تولید با ۶۵ ۵۳۶ token ورودی و ۱۰۲۴ token خروجی بر روی H100، مدل Nemotron‑H‑47B ۲.۹ برابر سریع‌تر از Qwen‑2.5‑72B و Llama‑3.1‑70B عمل کرد.[12]

Nemotron Nano 2 (اوت ۲۰۲۵)

مدل هیبریدی Mamba‑Transformer برای استدلال. Nemotron‑Nano‑12B‑v2‑Base — مدل والد با ۶۲ لایه (عمدتاً Mamba‑2 + MLP + ۴ لایه توجه)، آموزش‌دیده بر روی ۲۰ تریلیون token در قالب FP8 از صفر. از آن با روش Minitron گسترده‌یافته، Nemotron‑Nano‑9B‑v2 مشتق شده که می‌تواند با زمینه ۱۲۸K token روی یک GPU NVIDIA A10G (22 گیگابایت، BF16) کار کند. پس‌آموزش: SFT (80 میلیارد token، شامل ردپای DeepSeek‑R1‑0528) → GRPO → DPO → RLHF. در benchmark‌های استدلال، مدل از نظر دقت با Qwen3‑8B قابل مقایسه است، اما در دنباله‌های خروجی طولانی به ۳ تا ۶ برابر شتاب‌دهی تولید دست می‌یابد.[13]

Nemotron 3 Nano 30B‑A3B

در دسامبر ۲۰۲۵ منتشر شد. پارامترها: ۳۱.۶ میلیارد کل، ۳.۲ میلیارد فعال. معماری: ۵۲ لایه، بُعد پنهان ۲۶۸۸، بُعد کارشناس ۱۸۵۶، بُعد حالت Mamba 128. MoE: ۱۲۸ کارشناس مسیریابی‌شده + ۱ مشترک، ۶ فعال در هر token. زمینه — تا ۱ ۰۴۸ ۵۷۶ token. آموزش بر روی ۲۵ تریلیون token (برنامه‌ریزی WSD، batch size 3072، برش داده — ژوئن ۲۰۲۵) در دو مرحله: مرحله ۱ — ۲۳.۵ تریلیون (داده‌های متنوع)، مرحله ۲ — ۱.۵ تریلیون (داده‌های باکیفیت) + ۱۲۱ میلیارد token آموزش زمینه طولانی CPT.[2]

Benchmark Nemotron 3 Nano 30B‑A3B Qwen3‑30B‑A3B‑Thinking GPT‑OSS‑20B
MMLU‑Pro 78.30 80.9 75.0
AIME25 (no tools) 89.06 85.0 91.7
AIME25 (with tools) 99.17 98.7
GPQA (no tools) 73.04 73.4 71.5
LiveCodeBench v6 68.25 66.0 61.0
SWE‑Bench (OpenHands) 38.76 22.0* 34.0
TauBench V2 Avg 49.04 47.7 47.5
Arena‑Hard‑V2 Avg 67.65 57.8 48.55
RULER‑100 @ 1M 86.34 77.5

* — مقادیر از منابع ثانویه؛ شرایط بازتولید — NeMo Evaluator SDK. منبع: arXiv:2512.20848.[2][28]

توان عملیاتی (ورودی 8K / خروجی 16K، تک H200): ۳.۳ برابر بالاتر از Qwen3‑30B‑A3B‑Thinking و ۲.۲ برابر بالاتر از GPT‑OSS‑20B.[2]

مدل‌ها و جهت‌گیری‌های اضافی

  • OpenReasoning‑Nemotron (ژوئیه ۲۰۲۵) — سری مدل‌هایی با ۱.۵B تا ۳۲B پارامتر، مبتنی بر Qwen 2.5 و fine-tuning‌شده بر روی داده‌های DeepSeek‑R1‑0528. نسخه ۳۲B با GenSelect@64 از o3 (high) در برخی benchmark‌های ریاضی پیشی می‌گیرد.[29]
  • Nemotron Elastic (arXiv:2511.16664) — چارچوب زیرمدل‌های تودرتو (6B، 9B، 12B) در قالب یک مدل والد، که هزینه آموزش را ۳۶۰ برابر در مقایسه با آموزش از صفر کاهش می‌دهد.[30]
  • Nemotron‑CrossThink — چارچوب یادگیری تقویتی چنددامنه‌ای فراتر از وظایف ریاضی که +30.1٪ در MATH‑500 و +12.8٪ در MMLU‑PRO را به ارمغان آورد.[31]
  • Nemotron‑UltraLong — گسترش زمینه تا ۴ میلیون token.[32]
  • Jet‑Nemotron — NAS پس‌آموزشی برای مدل‌های هیبریدی فشرده 2B/4B.[33]

مدل‌های تخصصی

در اکوسیستم Nemotron مدل‌هایی برای وظایف تخصصی نیز وجود دارند:

  • Nemotron Nano V2 VL — مدل vision‑language برای OCR، پردازش جدول و ویدیو.[34]
  • Nemotron Parse 1.1 — مدلی برای OCR و استخراج ساختار اسناد.[35]
  • Nemotron ColEmbed V2 — مدل embedding برای جستجوی بصری اسناد (late interaction).[36]
  • Nemotron Speech — مدل‌هایی برای تشخیص خودکار گفتار (ASR)، سنتز گفتار (TTS) و ترجمه ماشینی (NMT).[1]
  • Llama 3.1 Nemotron Safety Guard 8B V3 — مدل طبقه‌بندی محتوای ناامن در ۲۳ دسته به ۹ زبان با دقت ۸۴.۲٪.[37]

داده‌های پیش‌آموزش

ترکیب داده‌های Nemotron‑4

پیکره پیش‌آموزش Nemotron‑4 15B و 340B از سه دسته اصلی تشکیل شده است: متون انگلیسی (70٪)، متون چندزبانه به ۵۳ زبان (15٪) و کد منبع به ۴۳ زبان برنامه‌نویسی (15٪). از حذف تکرار در سطح سند (exact و near‑duplicate) و همچنین فیلترسازی با مدل‌های زبانی و اکتشافی استفاده شد. مدل 15B بر روی ۸ تریلیون token و مدل 340B بر روی ۹ تریلیون (8 تریلیون پیش‌آموزش + ۱ تریلیون آموزش ادامه‌دار با وزن‌دهی مجدد به منابع باکیفیت) آموزش دید.[8][3]

Nemotron‑CC

مجموعه داده Nemotron‑CC از Common Crawl با استفاده از مجموعه‌ای از طبقه‌بندی‌کننده‌های کیفیت و بازنویسی مصنوعی متون تشکیل شده است. حجم کل — ۶.۳ تریلیون token (۴.۴ تریلیون بدون تکرار + ۱.۹ تریلیون بازنویسی مصنوعی). pipeline در ابزار NeMo Curator ادغام شده است. این اثر به عنوان Long Paper در کنفرانس ACL 2025 پذیرفته شد.[38]

Nemotron‑CC‑Math

زیرمجموعه محور ریاضی با حجم ۱۳۳ میلیارد token، استخراج‌شده از Common Crawl با pipeline Lynx + LLM با حفظ ساختار فرمول‌های ریاضی و کد در LaTeX.[39]

داده‌های Nemotron 3 Nano

پیش‌آموزش Nemotron 3 Nano بر روی ۲۵ تریلیون token انجام شده است. مجموعه شامل: Nemotron‑CC‑v2.1، Nemotron‑CC‑Code‑v1، Nemotron‑CC‑Math‑v1 و dataset‌های تخصصی STEM است. برای آموزش زمینه طولانی از ۱۲۱ میلیارد token اضافی CPT استفاده شده است.[2]

Nemotron Pretraining Dataset v1

مجموعه‌ای که به صورت مصنوعی تولید شده و حوزه‌های STEM، متون دانشگاهی، وظایف استدلال و دامنه‌های چندزبانه را پوشش می‌دهد؛ شامل بیش از ۱۰ تریلیون token زبانی و ۱۸ میلیون نمونه برای SFT است. تمام مجموعه داده‌ها تحت مجوزهای آزاد و مجاز توزیع می‌شوند.[40]

Pipeline تولید داده مصنوعی (SDG)

Pipeline توصیف‌شده در گزارش Nemotron‑4 340B شامل مراحل زیر است[3]:

  • تولید prompt: درخواست‌های مصنوعی تک‌گام و دوگامه، تولیدشده با Mixtral‑8x7B‑Instruct‑v0.1 (مجوز Apache 2.0) بر اساس قالب‌های Open QA، Writing، Closed QA، Math & Coding.
  • تولید پاسخ: پاسخ‌های متعدد از نسخه‌های میانی مدل‌ها برای تضمین تنوع.
  • ارزیابی کیفیت: سه رویکرد — Ground‑Truth‑as‑a‑Judge (برای وظایف با پاسخ قابل تأیید)، LLM‑as‑Judge (مقایسه جفت‌های پاسخ توسط مدل زبانی)، Reward‑Model‑as‑Judge (استفاده از Nemotron‑4‑340B‑Reward).
  • هم‌ترازسازی تکراری از مدل‌های ضعیف به قوی (weak‑to‑strong).

از ~۲۰ ۰۰۰ نمونه حاشیه‌نویسی‌شده توسط انسان (۱۰ ۰۰۰ برای SFT، ۱۰ ۰۰۰ HelpSteer2 برای مدل پاداش)، کل حجم باقی‌مانده داده‌های هم‌ترازسازی به صورت مصنوعی تولید شد.[3]

کوانتیزاسیون و بهینه‌سازی inference

مدل‌های Nemotron 3 Nano از Post‑Training Quantization (PTQ) در FP8 با استفاده از ModelOpt و Megatron‑LM پشتیبانی می‌کنند. از selective quantization استفاده می‌شود — لایه‌های attention و بخشی از Mamba در BF16 نگه داشته می‌شوند تا کیفیت حفظ شود؛ بقیه در FP8 کوانتیزه می‌شوند. طبق گزارش فنی، این رویکرد ~99٪ حفظ دقت را تضمین می‌کند.[2] Nano همچنین از inference در قالب NVFP4 پشتیبانی می‌کند.[1]

جدول خلاصه benchmark‌ها بر اساس نسل‌ها

مدل MMLU GSM8K HumanEval Arena Hard MT‑Bench شرایط
Nemotron‑4 15B 64.2٪ 46.0٪ 31.6٪ base؛ 5‑/8‑/0‑shot
Nemotron‑4 340B Base 81.1٪ 57.3٪ 5‑/—/0‑shot
Nemotron‑4 340B Instruct 78.7٪ 92.3٪ 73.2٪ 54.2 8.22 0‑shot
Llama‑3.1‑Nemotron‑70B‑Instruct 85.0 8.98 اکتبر ۲۰۲۴
LN‑Ultra 253B (reasoning ON) GPQA 76.0٪، AIME 80.8٪
Nemotron‑H‑47B 83.6٪ 93.3٪ 61.0٪ 5‑/8‑CoT/0‑shot
Nemotron 3 Nano (30B‑A3B) 67.7 (v2) AIME25 89.1٪، LCB 68.3٪

مقایسه باید با احتیاط تفسیر شود: شرایط ارزیابی، نسخه‌های benchmark و تاریخ‌های آزمون در میان نسل‌ها متفاوت است. نتایج از گزارش‌های فنی NVIDIA گرفته شده‌اند؛ ارزیابی‌های مستقل ممکن است متفاوت باشند (بخش «محدودیت‌ها» را ببینید).[8][3][9][11][12][2]

کاربردها

استقرار از طریق NVIDIA NIM

NVIDIA NIM — مجموعه‌ای از میکروسرویس‌های کانتینری بهینه‌شده برای inference با API سازگار با OpenAI. مدل‌های Nemotron به عنوان میکروسرویس‌های NIM در پلتفرم build.nvidia.com در دسترس هستند. NIM از فرمت‌های FP8، BF16، NVFP4 و استقرار از طریق Helm chart روی Kubernetes پشتیبانی می‌کند. مدل‌ها همچنین با فریم‌ورک‌های مستقل سازگار هستند: vLLM، SGLang، Ollama، llama.cpp، TensorRT‑LLM.[4][1]

تولید داده مصنوعی

Nemotron‑4 340B برای استفاده به عنوان تولیدکننده داده مصنوعی طراحی شده است: مدل Instruct پاسخ‌ها را تولید می‌کند، مدل Reward آن‌ها را ارزیابی و فیلتر می‌کند. مجوز NVIDIA Open Model License صریحاً استفاده از خروجی مدل برای آموزش مدل‌های دیگر را مجاز می‌شمارد. طبق داده‌های ServiceNow، ۱۵٪ از داده‌های پیش‌آموزش مدل Apriel 1.6 آن‌ها از مجموعه داده‌های Nemotron به دست آمده است.[3][15][41]

سیستم‌های عاملی

مدل‌های خانواده Nemotron 3 (Nano، Super، Ultra) برای بارکاری‌های چندعاملی طراحی شده‌اند: برنامه‌ریزی، بازیابی (retrieval)، فراخوانی ابزار (tool use). Nemotron 3 Nano نتیجه ۳۸.۷۶٪ را در SWE‑Bench (با OpenHands) و ۴۹.۰۴٪ (متوسط) را در TauBench V2 نشان می‌دهد.[2]

پیاده‌سازی‌های سازمانی

در میان شرکای اعلام‌شده: ServiceNow (مدل مشترک Apriel Nemotron 15B برای اتوماسیون فرآیندهای کاری)، CrowdStrike (پلتفرم Charlotte AI)، Perplexity (مسیریابی درخواست‌ها)، Accenture، Cadence، Deloitte، Oracle، Palantir، Siemens، Synopsys، Zoom. مدل‌ها در AWS Amazon Bedrock در دسترس هستند؛ پشتیبانی از Google Cloud، CoreWeave، Nebius برنامه‌ریزی شده است.[15]

محدودیت‌ها و مسائل باز

ارزیابی‌های مستقل و تفاوت‌ها با داده‌های NVIDIA

ارزیابی‌های مستقل تفاوت‌هایی با نتایج ارائه‌شده توسط NVIDIA نشان می‌دهند. طبق داده‌های Artificial Analysis (فوریه ۲۰۲۶)، Llama‑Nemotron‑Ultra 253B (reasoning) نمره Intelligence Index برابر ۱۵ دریافت کرد در حالی که میانه برای مدل‌های با اندازه مشابه ۲۶ است. در پلتفرم Chatbot Arena (LMArena) مدل‌های Nemotron موقعیت میانی در رتبه‌بندی دارند: Llama 3.3 Nemotron Super 49B — Elo 1327 ±12 (~رتبه ۱۴۷)، Nemotron 3 Nano — 1317 ±6 (~رتبه ۱۶۴).[42][43]

پرحرفی

مدل‌های Nemotron پرحرفی بالایی از خود نشان می‌دهند: در ارزیابی Artificial Analysis، مدل Nemotron 3 Nano ۱۴۰ میلیون token تولید کرد (در حالی که میانه برای سایر مدل‌ها ۱۲ میلیون بود)، که هزینه inference را افزایش می‌دهد. تحلیل DEV Community نشان داد که Llama‑3.1‑Nemotron‑70B‑Instruct با وجود رهبری رسمی در benchmark‌های خودکار، در برخی وظایف عملی دقت کافی نداشت، و نمرات بالا در benchmark‌های Arena-like ممکن است با ترجیح پاسخ‌های پرحرف و اطمینان‌بخش اما نه لزوماً دقیق توضیح داده شوند.[42][44]

توهم‌زایی و bias

NVIDIA در کارت‌های مدل اشاره می‌کند که مدل‌ها ممکن است «پیش‌داوری‌ها را تقویت کنند و پاسخ‌های سمی تولید کنند، به ویژه در برابر prompt‌های سمی»، و همچنین «اطلاعات نادرست تولید کنند، جزئیات کلیدی را حذف کنند». باز بودن وزن‌ها و داده‌ها امکان ممیزی خارجی را فراهم می‌کند.[11][13]

الزامات محاسباتی

مدل‌های متراکم (Nemotron‑4 340B) برای آموزش کامل به خوشه‌ای از ۷۶۸ گره DGX H100 نیاز دارند، که بازتولیدپذیری را برای گروه‌های آکادمیک بدون دسترسی به زیرساخت مشابه محدود می‌کند. زمینه طولانی (1M) در inference به حجم قابل توجهی از VRAM نیاز دارد.[3][2]

افت عملکرد در گسترش زمینه

در گسترش زمینه به دنباله‌های بسیار طولانی، افت عملکرد در benchmark‌هایی با زمینه کوتاه مشاهده شد.[32]

کوانتیزاسیون معماری‌های هیبریدی

استفاده از دقت بسیار پایین (FP8/NVFP4) در معماری‌های Mamba‑Transformer منجر به افت جزئی دقت (~1٪ در برخی benchmark‌ها) می‌شود. این مشکل با اعمال selective quantization حل می‌شود که معماری کامپایلرها و سرورهای inference را پیچیده‌تر می‌کند.[2][1]

سایر مسائل باز

  • وابستگی به benchmark‌ها با آلودگی احتمالی داده‌های آموزشی.
  • فقدان پروتکل‌های استانداردشده برای مقایسه معماری‌های هیبریدی SSM‑Transformer با مدل‌های خالص Transformer.
  • سؤال مقیاس‌پذیری رویکرد MoE در وظایفی که نیاز به استدلال عمیق با تعداد کم کارشناس در هر token دارند.
  • داده‌های Super/Ultra تا دسامبر ۲۰۲۵ اولیه هستند؛ benchmark‌های کامل پس از انتشار انتظار می‌رود.[1]

جنبه‌های اخلاقی و نظارتی

ایمنی در مرحله توسعه

در مرحله توسعه از: ارزیابی بر اساس چارچوب AEGIS (۱۳ دسته ایمنی محتوا)، اسکنر آسیب‌پذیری garak، و آزمون قرمز (red‑teaming) دستی استفاده می‌شود.[37]

ایمنی در مرحله استنتاج

NeMo Guardrails — جعبه‌ابزار متن‌باز (مجوز Apache 2.0) که مانع‌های قابل برنامه‌ریزی را به سیستم‌های LLM اضافه می‌کند. میکروسرویس ورودی‌ها و خروجی‌ها را رهگیری می‌کند و بررسی‌های قابل پیکربندی را اعمال می‌کند: کنترل موضوع، تشخیص PII، تأیید «پایه‌گذاری» RAG، تشخیص حمله‌های jailbreak (شامل محافظت در برابر تزریق کد مبتنی بر YARA)، طبقه‌بندی ایمنی چندزبانه و چندوجهی.[45]

برای Nemotron 3 مجموعه‌ای از ~۱۱ ۰۰۰ ردپای برچسب‌گذاری‌شده OpenTelemetry از سناریوهای واقع‌گرایانه با استفاده از ابزارها، برای ارزیابی ایمنی عاملی منتشر شده است.[1]

مجوزدهی

مدل‌ها مجوز
Nemotron 3 (Nano، Super، Ultra) NVIDIA Nemotron Open Model License
Nemotron‑4 340B (Base/Instruct/Reward) NVIDIA Open Model License Agreement
Llama‑Nemotron (Nano/Super/Ultra) Llama Community License (ارث‌برده از Meta)
Nemotron‑3 8B (2023) NVIDIA AI Foundation Models Community License

NVIDIA Nemotron Open Model License استفاده تجاری، ایجاد و توزیع آثار مشتق را مجاز می‌شمارد، نیازی به انتساب ندارد (با حفظ فایل NOTICE)، محدودیتی بر تعداد کاربران اعمال نمی‌کند و صریحاً استفاده از خروجی مدل برای آموزش مدل‌های دیگر را مجاز می‌شمارد.[46] مدل‌های مبتنی بر Llama محدودیت‌های Meta را به ارث می‌برند، از جمله آستانه ۷۰۰ میلیون کاربر فعال ماهانه.[11]

برای Nemotron 3 Nano، NVIDIA منتشر کرده است: وزن‌های مدل، بیش از ۱۰ تریلیون token داده آموزشی، دستورالعمل‌های آموزش، پایگاه‌های کد (NeMo، Megatron‑LM، NeMo‑Aligner)، بیش از ۱۰ محیط یادگیری تقویتی با بیش از ۹۰۰ ۰۰۰ وظیفه.[1][2]

چشم‌اندازها و جهت‌گیری‌های پژوهشی

انتشارات آتی شامل Nemotron 3 Super (~۱۰۰ میلیارد پارامتر، ~۱۰ میلیارد فعال) و Nemotron 3 Ultra (~۵۰۰ میلیارد، ~۵۰ میلیارد فعال)، که در نیمه اول ۲۰۲۶ انتظار می‌رود. هر دو مدل از LatentMoE، MTP و آموزش در قالب NVFP4 روی معماری Blackwell استفاده خواهند کرد.[1]

جهت‌گیری استراتژیک NVIDIA — موقعیت‌یابی Nemotron نه به عنوان یک مدل منفرد، بلکه به عنوان یک لایه زیرساختی برای سیستم‌های چندعاملی، که در آن مدل‌های مختلف خانواده برای وظایف مختلف با مسیریابی بر اساس پیچیدگی استفاده می‌شوند.[1][15]

جهت‌گیری‌های اصلی پژوهشی:

  • توسعه معماری‌های هیبریدی — ادغام بیشتر لایه‌های SSM با مکانیزم توجه برای زمینه طولانی مقیاس‌پذیر.[12]
  • روش‌های چندسطحی فشرده‌سازی — توسعه Minitron، Puzzle، MiniPuzzle و Nemotron Elastic.[20][21][30]
  • یادگیری تقویتی چنددامنه‌ای — Nemotron‑CrossThink برای گسترش RL فراتر از وظایف ریاضی.[31]
  • گسترش زمینه — Nemotron‑UltraLong تا ۴ میلیون token.[32]
  • چندوجهی بودن — گسترش به حوزه vision‑language (Nemotron VL)، گفتار (Nemotron Speech)، جستجوی بصری اسناد (Nemotron ColEmbed V2).[34][35][36]
  • مدل‌های هیبریدی فشرده — Jet‑Nemotron (NAS برای مدل‌های 2B/4B).[33]
  • دستورالعمل‌های باز — انتشار دستورالعمل‌های کامل آموزش و داده‌ها برای بازتولید و سفارشی‌سازی توسط جامعه.[14]

همچنین ببینید

  • معماری Transformer
  • Reinforcement Learning from Human Feedback (RLHF)
  • Llama (خانواده مدل‌های Meta)

پیوندها

منابع

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 Blakeman, A. et al. (NVIDIA). NVIDIA Nemotron 3: Efficient and Open Intelligence. arXiv:2512.20856, декабрь 2025. https://arxiv.org/abs/2512.20856
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 Blakeman, A. et al. (NVIDIA). Nemotron 3 Nano: Open, Efficient Mixture‑of‑Experts Hybrid Mamba‑Transformer Model for Agentic Reasoning. arXiv:2512.20848, декабрь 2025. https://arxiv.org/abs/2512.20848
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 Adler, B. et al. (NVIDIA). Nemotron‑4 340B Technical Report. arXiv:2406.11704, июнь 2024. https://arxiv.org/abs/2406.11704
  4. 4.0 4.1 NVIDIA Developer. NVIDIA Nemotron AI Models. https://developer.nvidia.com/nemotron
  5. NVIDIA. NeMo Framework Documentation. https://docs.nvidia.com/nemo/
  6. NVIDIA. Nemotron‑3‑8B‑Base‑4k — Model Card. Hugging Face, 2023. https://huggingface.co/nvidia/nemotron-3-8b-base-4k
  7. Microsoft. Introducing NVIDIA Nemotron‑3 8B LLMs on the Model Catalog. Microsoft Tech Community, 14 ноября 2023. https://techcommunity.microsoft.com/blog/machinelearningblog/introducing-nvidia-nemotron-3-8b-llms-on-the-model-catalog/3983569
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 Parmar, J., Prabhumoye, S., Jennings, J. et al. (NVIDIA). Nemotron‑4 15B Technical Report. arXiv:2402.16819, февраль 2024. https://arxiv.org/abs/2402.16819
  9. 9.0 9.1 9.2 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Instruct — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct-HF
  10. 10.0 10.1 NVIDIA. Llama‑3.1‑Nemotron‑70B‑Reward — Model Card. Hugging Face, октябрь 2024. https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Bercovich, A. et al. (NVIDIA). Llama‑Nemotron: Efficient Reasoning Models. arXiv:2505.00949, май 2025. https://arxiv.org/abs/2505.00949
  12. 12.0 12.1 12.2 12.3 12.4 12.5 12.6 12.7 12.8 Blakeman, A. et al. (NVIDIA). Nemotron‑H: A Family of Accurate and Efficient Hybrid Mamba‑Transformer Models. arXiv:2504.03624, апрель 2025. https://arxiv.org/abs/2504.03624
  13. 13.0 13.1 13.2 Basant, A. et al. (NVIDIA). NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba‑Transformer Reasoning Model. arXiv:2508.14444, август 2025. https://arxiv.org/abs/2508.14444
  14. 14.0 14.1 14.2 Blakeman, A. et al. (NVIDIA). Inside NVIDIA Nemotron 3: Techniques, Tools, and Data That Make It Efficient and Accurate. NVIDIA Technical Blog, 15 декабря 2025. https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
  15. 15.0 15.1 15.2 15.3 NVIDIA. NVIDIA Debuts Nemotron 3 Family of Open Models. NVIDIA Newsroom, 15 декабря 2025. https://nvidianews.nvidia.com/news/nvidia-debuts-nemotron-3-family-of-open-models
  16. Ainslie, J. et al. GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245, 2023. https://arxiv.org/abs/2305.13245
  17. Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. Neurocomputing, 2024. arXiv:2104.09864. https://arxiv.org/abs/2104.09864
  18. Dao, T.; Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024. arXiv:2405.21060. https://arxiv.org/abs/2405.21060
  19. Zhang, B.; Sennrich, R. Root Mean Square Layer Normalization. arXiv:1910.07467, 2019. https://arxiv.org/abs/1910.07467
  20. 20.0 20.1 Muralidharan, S. et al. (NVIDIA). Compact Language Models via Pruning and Knowledge Distillation. arXiv:2407.14679, июль 2024. https://arxiv.org/abs/2407.14679
  21. 21.0 21.1 Bercovich, A. et al. (NVIDIA). Puzzle: Distillation‑Based NAS for Inference‑Optimized LLMs. arXiv:2411.19146, ноябрь 2024. https://arxiv.org/abs/2411.19146
  22. Wang, Z. et al. (NVIDIA). HelpSteer: Multi‑attribute Helpfulness Dataset for SteerLM. arXiv:2311.09528, ноябрь 2023. https://arxiv.org/abs/2311.09528
  23. Wang, Z. et al. (NVIDIA). HelpSteer2: Open‑source Dataset for Training Top‑Performing Reward Models. arXiv:2406.08673, июнь 2024. https://arxiv.org/abs/2406.08673
  24. Wang, Z. et al. (NVIDIA). HelpSteer2‑Preference: Complementing Ratings with Preferences. arXiv:2410.01257, октябрь 2024. https://arxiv.org/abs/2410.01257
  25. Dong, Y. et al. (NVIDIA). SteerLM: Attribute Conditioned SFT as an (User‑Steerable) Alternative to RLHF. arXiv:2310.05344, октябрь 2023. https://arxiv.org/abs/2310.05344
  26. Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
  27. 27.0 27.1 Sun, S. et al. (NVIDIA). Reward‑aware Preference Optimization: A Unified Mathematical Framework for Model Alignment. arXiv:2502.00203, январь 2025. https://arxiv.org/abs/2502.00203
  28. NVIDIA. NeMo Evaluator SDK — Evaluation Recipe for Nemotron 3 Nano. Hugging Face Blog, декабрь 2025. https://huggingface.co/blog/nvidia/nemotron-3-nano-evaluation-recipe
  29. NVIDIA. OpenReasoning‑Nemotron. Hugging Face Collection, июль 2025. https://huggingface.co/collections/nvidia/openreasoning-nemotron-685824d42db3e24d8b8f5e39
  30. 30.0 30.1 Taghibakhshi, A. et al. (NVIDIA). Nemotron Elastic: Towards Efficient Many‑in‑One Reasoning LLMs. arXiv:2511.16664, ноябрь 2025. https://arxiv.org/abs/2511.16664
  31. 31.0 31.1 Akter, S. N. et al. (NVIDIA). Nemotron‑CrossThink: Scaling Self‑Learning beyond Math Reasoning. arXiv:2504.13941, апрель 2025. https://arxiv.org/abs/2504.13941
  32. 32.0 32.1 32.2 Xu, C. et al. (NVIDIA). From 128K to 4M: Efficient Training of Ultra‑Long Context Large Language Models. arXiv:2504.06214, апрель 2025. https://arxiv.org/abs/2504.06214
  33. 33.0 33.1 Gu, Y. et al. (NVIDIA). Jet‑Nemotron: Efficient Language Model with Post Neural Architecture Search. arXiv:2508.15884, август 2025. https://arxiv.org/abs/2508.15884
  34. 34.0 34.1 Deshmukh, A. S. et al. (NVIDIA). NVIDIA Nemotron Nano V2 VL. arXiv:2511.03929, ноябрь 2025. https://arxiv.org/abs/2511.03929
  35. 35.0 35.1 Chumachenko, K. et al. (NVIDIA). NVIDIA Nemotron Parse 1.1. arXiv:2511.20478, ноябрь 2025. https://arxiv.org/abs/2511.20478
  36. 36.0 36.1 de Souza P. Moreira, G. et al. (NVIDIA). Nemotron ColEmbed V2: Top‑Performing Late Interaction Embedding Models for Visual Document Retrieval. arXiv:2602.03992, февраль 2026. https://arxiv.org/abs/2602.03992
  37. 37.0 37.1 NVIDIA Developer Blog. Safeguard Agentic AI Systems with the NVIDIA Safety Recipe. 2025. https://developer.nvidia.com/blog/safeguard-agentic-ai-systems-with-the-nvidia-safety-recipe/
  38. Su, D. et al. (NVIDIA). Nemotron‑CC: Transforming Common Crawl into a Refined Long‑Horizon Pretraining Dataset. ACL 2025 (Long Paper). arXiv:2412.02595. https://arxiv.org/abs/2412.02595
  39. Karimi Mahabadi, R. et al. (NVIDIA). Nemotron‑CC‑Math: A 133 Billion‑Token‑Scale High Quality Math Pretraining Dataset. arXiv:2508.15096, август 2025. https://arxiv.org/abs/2508.15096
  40. NVIDIA Research. NVIDIA Nemotron Nano 2 and the Nemotron Pretraining Dataset v1. https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/
  41. NVIDIA. Synthetic Data Generation — NVIDIA NeMo Framework User Guide. https://docs.nvidia.com/nemo-framework/user-guide/24.12/datacuration/syntheticdata.html
  42. 42.0 42.1 Artificial Analysis. NVIDIA Nemotron 3 Nano 30B‑A3B — Intelligence Index. Февраль 2026. https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b-reasoning
  43. LMArena (Chatbot Arena). Рейтинги моделей, по состоянию на февраль 2026. https://lmarena.ai/
  44. Saplin, M. Llama 3.1 Nemotron 70B: Quirks and Features. DEV Community, 2024. https://dev.to/maximsaplin/llama-31-nemotron-70b-quirks-and-features-4nbg
  45. NVIDIA. NeMo Guardrails. GitHub, 2023–2025. https://github.com/NVIDIA/NeMo-Guardrails (arXiv:2310.10501).
  46. NVIDIA. NVIDIA Nemotron Open Model License. https://www.nvidia.com/en-us/agreements/enterprise-software/nvidia-nemotron-open-model-license/