Nova (Amazon) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — خانواده‌ای از مدل‌های بنیادی (Foundation Models, FM) و مدل‌های زبانی بزرگ (Large Language Model, LLM) است که توسط بخش Amazon Artificial General Intelligence (AAG Intelligence) توسعه یافته و از طریق سرویس کاملاً مدیریت‌شده Amazon Bedrock در دسترس است. این خانواده شامل مدل‌هایی برای درک و تولید متن، پردازش تصویر، ویدیو و اسناد، و همچنین سنتز و تشخیص گفتار می‌شود. Amazon Nova به عنوان جایگزین نسل قبلی مدل‌های Amazon Titan معرفی شده و در اکوسیستم ابری Amazon Web Services (AWS) یکپارچه شده است.[1][2][3]

تاریخچه و گاه‌شمار توسعه

پیش از راه‌اندازی Nova، پلتفرم Amazon Bedrock دسترسی به مدل‌های شخص ثالث از جمله Anthropic Claude، Meta Llama، Mistral و سایرین را فراهم می‌کرد. Amazon Nova نخستین خانواده از مدل‌های بنیادی ساخت AWS بود که به صورت تجاری در زیرساخت ابری ارائه شد.[3]

نسل اول (۲۰۲۴–۲۰۲۵)

نسل اول خانواده Amazon Nova در تاریخ ۳ دسامبر ۲۰۲۴ در کنفرانس AWS re:Invent 2024 به طور رسمی معرفی شد. نسخه اولیه شامل سه مدل درک (understanding models) — Nova Micro (تنها متن)، مولتی‌مودال Nova Lite و Nova Pro — و همچنین مدل‌های مولد Nova Canvas (تولید تصویر) و Nova Reel (تولید ویدیو) بود.[4][3][5]

در آوریل ۲۰۲۵، مدل پرچم‌دار Nova Premier — قدرتمندترین مدل خانواده با پنجره زمینه یک میلیون token — برای وظایف نیازمند استدلال پیچیده و distillation (انتقال دانش از مدل بزرگ به مدل کوچک‌تر) به خط تولید افزوده شد.[6] همچنین در آوریل ۲۰۲۵، مدل Nova Sonic — یک مدل گفتاری از نوع speech‑to‑speech با پشتیبانی از گفتگوهای بلادرنگ — معرفی شد.[7]

نسل دوم — Nova 2 (۲۰۲۵–۲۰۲۶)

در نوامبر–دسامبر ۲۰۲۵ در کنفرانس AWS re:Invent 2025، نسل دوم با نام Amazon Nova 2 معرفی شد. این خط شامل مدل‌های به‌روزشده Nova 2 Lite و Nova 2 Pro با پشتیبانی از استدلال پویا (dynamic reasoning) و پردازش زمینه گسترده‌تر، مدل مولتی‌مودال بومی Nova 2 Omni (پردازش و تولید همزمان متن، تصویر، ویدیو و صدا)، و همچنین Nova 2 Sonic — مدل گفتاری نسل بعدی — می‌شود. در همین زمان، سرویس‌های Nova Forge (محیط آموزش سفارشی مدل‌ها) و Nova Act (چارچوب workflow‌های عاملی) نیز معرفی شدند.[8][9][10]

در فوریه ۲۰۲۶، گزارش فنی رسمی Amazon Nova 2 منتشر شد.[11]

گاه‌شمار یکپارچه

تاریخ رویداد
دسامبر ۲۰۲۴ اعلام Amazon Nova در AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel
آوریل ۲۰۲۵ انتشار Nova Premier (زمینه ۱M token) و Nova Sonic (speech‑to‑speech)
ژوئن ۲۰۲۵ انتشار گزارش فنی نسل اول (arXiv:2506.12103)
نوامبر–دسامبر ۲۰۲۵ اعلام Nova 2 در AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
فوریه ۲۰۲۶ انتشار گزارش فنی Amazon Nova 2

مبانی نظری و معماری

معماری پایه مدل‌های درک (understanding)

بر اساس گزارش فنی arXiv:2506.12103، مدل‌های درک (Nova Micro, Lite, Pro, Premier) بر پایه معماری Transformer توصیف‌شده در اثر Vaswani et al. بنا شده‌اند.[12] مکانیزم پایه توجه چندسره (Multi‑Head Self‑Attention) با فرمول زیر توصیف می‌شود:

Attention(Q,K,V)=softmax(QKdk)V

که در آن Q، K، V به ترتیب ماتریس‌های queries، keys و values هستند و dk بُعد keys است.[12][1]

پارامترهای دقیق معماری (تعداد لایه‌ها، اندازه حالت پنهان، تعداد سرهای توجه، تعداد کل پارامترها) در منابع در دسترس عموم تا مارس ۲۰۲۶ فاش نشده‌اند. این رویکرد برای مدل‌های تجاری بسته رایج است.[1]

پردازش مولتی‌مودال در Nova Lite و Nova Pro از طریق ترکیب token‌های متنی، بصری و ویدیویی در یک دنباله واحد که به یک مدل زبانی یکپارچه داده می‌شود، پیاده‌سازی شده است. کدگذارهای بصری (vision encoders) تصاویر و فریم‌های ویدیو را به دنباله‌هایی از token‌ها تبدیل می‌کنند که با بازنمایی متنی سازگار هستند.[1][13]

معماری مدل‌های مولد

مدل‌های مولد Nova Canvas (تصویر) و Nova Reel (ویدیو) از معماری مدل‌های انتشار پنهان (Latent Diffusion Models, LDM)[14] در ترکیب با رمزگشاهای خودکار متغیر (Variational AutoEncoder, VAE) برای محاسبات در فضای پنهان استفاده می‌کنند. فرایند انتشار با معادله شاخه پیشرو نویز توصیف می‌شود:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

که در آن x0 تصویر اصلی در فضای پنهان، xt نسخه نویزدار آن در گام t، α¯t پارامتر تجمعی برنامه‌ریزی نویز و ϵ نویز گاوسی استاندارد است. کدگذار متنی (text encoder) شرطی‌سازی تولید بر اساس prompt متنی را فراهم می‌کند.[13][14]

معماری مدل‌های گفتاری

Nova Sonic از معماری‌ای متفاوت از مدل‌های متنی استفاده می‌کند: این مدل یک کدگذار گفتار تخصصی (speech encoder)، یک رمزگشای گفتار (speech renderer) و یک مدل زبانی مولتی‌مودال اصلی را در یک خط لوله سرتاسری (end‑to‑end pipeline) یکپارچه می‌کند. این امکان را می‌دهد که ورودی گفتاری پردازش شود و خروجی گفتاری بدون تبدیل میانی به متن تولید گردد (هرچند بازنمایی متنی برای تضمین کیفیت به صورت داخلی استفاده می‌شود).[15][1]

زیرساخت آموزش

آموزش مدل‌های Nova بر روی خوشه‌های توزیع‌شده AWS Elastic Kubernetes Service (EKS) با استفاده از شتاب‌دهنده‌های هوش مصنوعی اختصاصی Amazon Trainium (نمونه‌های TRN1) و همچنین پردازنده‌های گرافیکی NVIDIA A100 و H100 انجام شد.[13][1]

برای کاهش هزینه‌های محاسباتی آموزش، روش‌های بهینه‌سازی تخصصی زیر توسعه و به‌کار گرفته شدند:

  • Super‑Selective Activation Checkpointing (SSC) — روشی برای ذخیره فعال‌سازی‌ها که بر اساس گزارش فنی، مصرف حافظه پردازنده‌های گرافیکی را تقریباً ۵۰٪ کاهش می‌دهد و در عین حال سربار محاسبات مجدد (recomputation) را به حداقل می‌رساند.[13]
  • In‑CPU‑Memory Checkpointing — ذخیره‌سازی موقت وزن‌های میانی (checkpoints) در حافظه اصلی پردازنده‌های مرکزی (CPU) پیش از بارگذاری ناهمزمان آن‌ها در فضای ابری Amazon S3. بر اساس اعلام Amazon، این رویکرد زمان ذخیره وضعیت مدل را در نمونه‌های TRN1 به ۰٫۱ ثانیه کاهش داده است.[16][13]

خط لوله آموزش و همسویی

فرایند آموزش مدل‌های Nova از چندین مرحله مشخصه LLM‌های مدرن تشکیل شده است:[1][17]

پیش‌آموزش (Pre‑training)

آموزش مقیاس‌پذیر بر روی یک مجموعه داده بزرگ چندزبانه و مولتی‌مودال شامل بیش از ۲۰۰ زبان. ترکیب دقیق داده‌های آموزشی (حجم، نسبت زبان‌ها، منابع مشخص) در مواد عمومی ارائه نشده است.[1]

Fine-Tuning با نظارت (Supervised Fine‑Tuning, SFT)

بهینه‌سازی بیشتر بر روی نمونه‌های برچسب‌زده‌شده از جفت‌های «دستورالعمل — پاسخ» که مدل را به پیروی از دستورالعمل‌های کاربر سوق می‌دهد.[1]

همسویی با یادگیری تقویتی

برای همسو کردن رفتار مدل با ترجیحات انسانی، دو الگوریتم اصلی به‌کار گرفته می‌شوند:

Proximal Policy Optimization (PPO) — الگوریتم یادگیری تقویتی مبتنی بر بازخورد انسانی (Reinforcement Learning from Human Feedback, RLHF) که از یک مدل پاداش (Reward Model) جداگانه استفاده می‌کند.[18][1]

Direct Preference Optimization (DPO) — روش جایگزین همسویی که نیازی به مدل پاداش صریح ندارد. تابع هدف DPO به صورت زیر است:[19]

DPO(πθ;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]

که در آن:

  • πθ — سیاست پارامتری‌شده (مدل در حال آموزش)؛
  • πref — مدل مرجع پایه (ثابت‌شده)؛
  • x — prompt ورودی (زمینه)؛
  • yw و yl — پاسخ‌های ترجیحی (winner) و رد شده (loser) به ترتیب؛
  • σ — تابع لجستیک (سیگموئید)؛
  • β — ابرپارامتری که شدت جریمه انحراف از مدل پایه را کنترل می‌کند (معادل جریمه KL-divergence).[19][1]

ترکیب خانواده مدل‌ها

خانواده مدل‌ها بر اساس تعادل بین عملکرد، هزینه و تأخیر (latency) به سطوح (tiers) مختلف تقسیم شده است.[2][20]

مدل‌های درک نسل اول

پارامتر Nova Micro Nova Lite Nova Pro Nova Premier
موداریت‌های ورودی متن متن، تصویر، ویدیو متن، تصویر، ویدیو متن، تصویر، ویدیو
موداریت خروجی متن متن متن متن
پنجره زمینه ۱۲۸ هزار token ۳۰۰ هزار token ۳۰۰ هزار token ۱ میلیون token
حداکثر token‌های خروجی ۱۰ هزار ۱۰ هزار ۱۰ هزار ۱۰ هزار
پشتیبانی از زبان‌ها ۲۰۰+ ۲۰۰+ ۲۰۰+ ۲۰۰+
Fine-tuning بله بله بله خیر
تاریخ انتشار دسامبر ۲۰۲۴ دسامبر ۲۰۲۴ دسامبر ۲۰۲۴ آوریل ۲۰۲۵
کاربرد اصلی حداقل تأخیر و هزینه برای وظایف متنی تحلیل مولتی‌مودال پایه تعادل بهینه برای وظایف پیچیده منطقی و عاملی دقت حداکثری، مدل معلم برای distillation

منبع: AWS AI Service Cards؛ arXiv:2506.12103.[20][1]

زبان‌های بهینه‌سازی‌شده (۱۵): انگلیسی، آلمانی، اسپانیایی، فرانسوی، ایتالیایی، ژاپنی، کره‌ای، عربی، چینی (ساده‌شده)، روسی، هندی، پرتغالی، هلندی، ترکی، عبری.[2]

Nova Premier برای وظایفی طراحی شده که نیاز به درک عمیق زمینه، برنامه‌ریزی چندمرحله‌ای و کار با حجم‌های بزرگ داده دارند: پایگاه‌های کد، اسناد بیش از ۴۰۰ صفحه، ویدیوهای تا ۹۰ دقیقه.[6]

مدل‌های نسل دوم (Nova 2)

Nova 2 Lite و Nova 2 Pro در نوامبر–دسامبر ۲۰۲۵ منتشر شدند. هر دو از تفکر گسترش‌یافته (extended thinking) پشتیبانی می‌کنند — مکانیزمی که در آن مدل پیش از تولید پاسخ، استدلال‌های چندمرحله‌ای انجام می‌دهد. عمق استدلال با پارامتر reasoning_effort با سطوح low، medium و high قابل تنظیم است. پنجره زمینه به ۱ میلیون token گسترش یافته است. ابزارهای بومی شامل جستجوی وب با تأیید (web grounding) و مفسر کد (code interpreter) به صورت داخلی تعبیه شده‌اند.[9][8]

Nova 2 Omni — یک مدل مولتی‌مودال بومی است که می‌تواند به طور همزمان متن، تصویر، ویدیو و صدا را به عنوان ورودی دریافت کرده و متن و تصویر تولید کند. پنجره زمینه — ۱ میلیون token.[8][11]

Nova 2 Sonic — مدل گفتاری نسل بعدی. از ۶ زبان پشتیبانی می‌کند: انگلیسی (نسخه‌های آمریکایی و بریتانیایی)، اسپانیایی، آلمانی، فرانسوی، ایتالیایی. فراخوانی ناهمزمان ابزارها (asynchronous tool calling) را معرفی می‌کند — مدل هنگامی که ابزارهای خارجی در پس‌زمینه اجرا می‌شوند، به پردازش ورودی جدید ادامه می‌دهد.[10]

پارامتر Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
موداریت‌های ورودی متن، تصویر، ویدیو متن، تصویر، ویدیو متن، تصویر، ویدیو، صدا صدا (گفتار)
موداریت خروجی متن متن متن، تصویر صدا (گفتار)
پنجره زمینه ۱ میلیون token ۱ میلیون token ۱ میلیون token ۳۰۰ هزار token
Extended thinking بله بله بله
ابزارهای بومی Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
تاریخ انتشار نوامبر–دسامبر ۲۰۲۵ نوامبر–دسامبر ۲۰۲۵ دسامبر ۲۰۲۵ دسامبر ۲۰۲۵

منبع: AWS Blog؛ Amazon Science.[9][8][11]

مدل‌های مولد

Nova Canvas — مدل تولید تصویر. از ورودی متنی و گرافیکی (PNG, JPEG) پشتیبانی می‌کند. رزولوشن خروجی — تا ۴٫۱۹ میلیون پیکسل (مثلاً ۲۰۴۸×۲۰۴۸ یا ۲۸۱۶×۱۵۳۶ پیکسل). حداکثر طول prompt — ۱۰۲۴ کاراکتر. عملیات inpainting (جایگزینی ناحیه‌ای از تصویر) و outpainting (گسترش تصویر به فراتر از مرزهای آن) پشتیبانی می‌شوند.[2][4]

Nova Reel — مدل تولید ویدیو. رزولوشن خروجی: ۱۲۸۰×۷۲۰ با ۲۴ فریم در ثانیه. مدت زمان ویدیوی تولیدشده — تا ۶ ثانیه. کنترل حرکت دوربین (camera control) پشتیبانی می‌شود. دسترسی از طریق API ناهمزمان (Asynchronous Invoke Model API) انجام می‌شود.[2][4]

مدل‌های گفتاری

Nova Sonic (آوریل ۲۰۲۵) — مدل گفتاری با API جریان دوطرفه (bidirectional stream API). از فراخوانی توابع (function calling) و اتصال به داده‌های سازمانی از طریق Retrieval‑Augmented Generation (RAG) پشتیبانی می‌کند. قابلیت watermarking به صورت پیش‌فرض تعبیه شده است. حداکثر مدت اتصال — ۸ دقیقه با امکان از سرگیری؛ حداکثر ۲۰ اتصال همزمان به ازای هر مشتری (مقدار پیش‌فرض).[7][15][2]

Nova 2 Sonic (دسامبر ۲۰۲۵) — نسل بعدی مدل گفتاری با تشخیص بهبودیافته گفتارهای کوتاه، صدای تلفنی (۸ کیلوهرتز) و لهجه‌ها.[10]

ارزیابی و benchmark‌ها

ارزیابی مدل‌های Nova با استفاده از benchmark‌های خودکار، از جمله رویکرد «LLM‑as‑a‑judge» (استفاده از مدل زبانی به عنوان ارزیاب) انجام شد. بر اساس مطالعه HKU SPACE AI Hub، معیار Arena‑Hard‑Auto همبستگی ۹۸٫۶٪ با ارزیابی‌های کارشناسان نشان می‌دهد.[21][22]

benchmark‌های نسل اول

داده‌ها از گزارش فنی arXiv:2506.12103 (شرایط: نتایج توسعه‌دهندگان مدل‌های رقیب که در زمان تهیه گزارش منتشر شده بودند):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

منبع: arXiv:2506.12103، جدول 2.1.1.[1]

نتایج سلسله‌مراتب عملکرد درون خانواده را نشان می‌دهند (Premier > Pro > Lite > Micro). شکاف در دسته‌بندی‌های ریاضیات (Math) و استدلال (Reasoning) بیشتر است؛ در وظایف نقش‌آفرینی (Roleplay) و استخراج اطلاعات (Extraction)، مدل‌های کوچک‌تر نتایجی نزدیک به مدل‌های بزرگ‌تر ارائه می‌دهند.[22]

benchmark‌های نسل دوم (Nova 2)

داده‌ها از گزارش فنی Amazon Nova 2 (شرایط: اندازه‌گیری‌های داخلی، 0‑shot / CoT در موارد مشخص):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

منبع: Amazon Nova 2 Technical Report، جدول 1.[11]

benchmark‌های عاملی (Nova 2 Pro): SWE‑Bench Verified — 70,0٪؛ τ²‑bench Verified Telecom — 92,7٪.[11]

benchmark‌های مولتی‌مودال (Nova 2 Omni): VideoMME — 77,9٪؛ MMMU Pro — 61,4٪.[11]

در ارزیابی وظایف پشتیبانی فنی، Nova 2 Lite امتیاز ۹٫۶۳ ± ۰٫۲۷ را در مقیاس ده‌نمره‌ای برای معیار «شناسایی مشکل» (Problem Identification) کسب کرد که به طور قابل توجهی از Nova Lite نسل اول (۸٫۵۷ ± ۰٫۴۶) پیشی گرفت.[23]

توجه. هنگام مقایسه نتایج با مدل‌های رقیب باید در نظر داشت که شرایط prompting، نسخه‌های مدل‌ها و تاریخ اندازه‌گیری معیارها ممکن است متفاوت باشند. benchmark‌های نسل اول و دوم از گزارش‌های خود Amazon گرفته شده‌اند؛ تأیید مستقل (FloTorch، Artificial Analysis) به طور کلی نسبت قیمت به عملکرد اعلام‌شده را تأیید می‌کند، اما در برخی معیارهای دقت، تفاوتی نسبت به پیشروترین رقبا ثبت می‌کند.[22]

سرعت استنتاج

بر اساس اندازه‌گیری‌های داخلی Amazon (از طریق Bedrock API):[1][11]

مدل سرعت استنتاج (token/ثانیه)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

هزینه استفاده

همه مدل‌ها از طریق Amazon Bedrock با مدل پرداخت به ازای تعداد token‌های پردازش‌شده در دسترس هستند (داده‌ها تا مارس ۲۰۲۶):[2]

مدل Token‌های ورودی (USD / 1M) Token‌های خروجی (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

برای مقایسه: Anthropic Claude 3.5 Sonnet در زمان انتشار Nova به ترتیب با نرخ $6,00 / 1M token ورودی و $30,00 / 1M token خروجی قیمت‌گذاری شده بود.[22]

سفارشی‌سازی و fine-tuning

زیرساخت AWS چندین روش برای انطباق مدل‌های پایه Nova با حوزه‌های تخصصی ارائه می‌دهد. ابزار اصلی برای این کار در نسل دوم محیط Amazon Nova Forge است.[8][17]

Continued Pre‑Training (CPT) و Mid‑Training

Nova Forge دسترسی به checkpoint‌های میانی آموزش مدل‌ها (مثلاً pretraining‑text‑RD و pretraining‑text‑CE) را فراهم می‌کند. این امکان ادامه یادگیری خودنظارتی (self‑supervised learning) بر روی مجموعه داده‌های سازمانی را با تنظیم دقیق نرخ یادگیری (learning rate) برای جلوگیری از فراموشی فاجعه‌آمیز (catastrophic forgetting) می‌دهد.[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

به‌روزرسانی تنها یک زیرمجموعه کوچک از وزن‌های مدل از طریق آداپتورهای رتبه پایین — Low‑Rank Adaptation (LoRA)[26]. این رویکرد نیازهای محاسباتی را در مقایسه با fine-tuning کامل (full fine‑tuning) به طور قابل توجهی کاهش می‌دهد. fine-tuning مولتی‌مودال برای Nova Lite و Pro پشتیبانی می‌شود.[17]

Reinforcement Fine‑Tuning (RFT)

مدل‌های سفارشی می‌توانند با روش‌های یادگیری تقویتی بر اساس معیارهای پاداش خاص صنعت، از جمله با استفاده از LLM دیگری به عنوان مدل قاضی (LLM‑as‑a‑judge) دوباره fine-tune شوند.[27]

تقطیر مدل (Model Distillation)

قابلیت Model Distillation امکان استفاده از Nova Premier یا Nova Pro به عنوان مدل معلم (teacher model) برای آموزش مدل‌های دانش‌آموز کوچک‌تر (student models) — Nova Lite و Nova Micro — را فراهم می‌کند. این کار هزینه‌های محاسباتی استنتاج را کاهش می‌دهد و در عین حال بخش قابل توجهی از کیفیت مدل بزرگ را حفظ می‌کند.[2][6]

کاربردها و یکپارچه‌سازی

مدل‌های Nova در سرویس‌های محاسباتی Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer) یکپارچه شده‌اند. سناریوهای اصلی مستند شده کاربرد:[2][1]

Agentic Workflows - فرایندهای کاری عاملی

اجرای چندمرحله‌ای وظایف با استفاده از Bedrock Agents و فراخوانی ابزارهای خارجی (function calling). با استفاده از الگوی معماری ReAct (Reasoning and Acting) در ترکیب با چارچوب‌هایی مانند LangGraph، مدل‌های Nova تحلیل پایگاه داده را هماهنگ می‌کنند، کوئری‌های SQL را از زبان طبیعی تولید می‌کنند و فرایندهای چندبخشی را مدیریت می‌کنند. Nova Act اتوماسیون workflow‌های UI مرورگر را با قابلیت اطمینان اعلام‌شده ۹۰٪ در وظایف اولیه کاربران فراهم می‌کند.[28][8]

Retrieval‑Augmented Generation (RAG) - تولید با استفاده از دانش خارجی

یکپارچه‌سازی با Bedrock Knowledge Bases برای اتصال (grounding) پاسخ‌ها به داده‌های سازمانی. مدل‌های Nova 2 از جستجوی وب بومی با تأیید (web grounding) به عنوان ابزار داخلی پشتیبانی می‌کنند.[1][9]

پردازش اسناد

فرمت‌های پشتیبانی‌شده اسناد ورودی: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (به جز Nova Micro که تنها ورودی متنی دریافت می‌کند). Nova Premier می‌تواند ویدیوهایی با مدت زمان تا ۹۰ دقیقه را در قالب یک درخواست واحد پردازش کند.[2][6]

تولید و اشکال‌زدایی کد

زبان‌های برنامه‌نویسی پشتیبانی‌شده: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

رابط‌های گفتاری

Nova Sonic و Nova 2 Sonic برای ساخت عوامل صوتی با پشتیبانی بلادرنگ یکپارچه‌شده با Amazon Connect به‌کار می‌روند.[10][7]

ارزیابی مدل‌ها (LLM‑as‑a‑judge)

Nova به عنوان مدل قاضی در ارزیابی خروجی‌های سایر مدل‌های مولد در پلتفرم Amazon SageMaker استفاده می‌شود.[29]

محدودیت‌ها و مسائل باز

  • بسته بودن معماری. Amazon تعداد پارامترها، جزئیات معماری و ترکیب داده‌های آموزشی را فاش نمی‌کند، که این امر بازتولید مستقل نتایج را به طور قابل توجهی محدود می‌کند. وزن‌های مدل‌های Nova برای دانلود یا استقرار خارج از زیرساخت AWS در دسترس نیستند (استقرار on‑premise امکان‌پذیر نیست).[1][2]
  • محدودیت خروجی. حداکثر تعداد token‌های خروجی برای همه مدل‌های درک به ۱۰ هزار token محدود شده است که ممکن است برای وظایف تولید اسناد طولانی کافی نباشد.[2]
  • محدودیت‌های RFT. Reinforcement Fine‑Tuning از گفتگوهای چندنوبتی (multi‑turn) و داده‌های مولتی‌مودال پشتیبانی نمی‌کند؛ سهم توصیه‌شده نمونه‌های مثبت در مجموعه داده — حداقل ۵٪.[27]
  • محدودیت‌های Nova Sonic. حداکثر مدت اتصال — ۸ دقیقه؛ حداکثر ۲۰ اتصال همزمان به ازای هر مشتری به صورت پیش‌فرض.[2]
  • دسترسی منطقه‌ای. Nova Premier تنها در یک منطقه (US East N. Virginia) بدون پشتیبانی از استنتاج بین‌منطقه‌ای در دسترس است؛ مدل‌های Nova 2 فهرست محدودی از مناطق استقرار دارند.[2]
  • حساسیت معیارها. نمرات benchmark‌های مصنوعی همیشه با کیفیت عملکرد در شرایط تولید (production) همبستگی ندارند، جایی که پیروی دقیق از سیاست‌های سازمانی و نبود توهم در استنتاج‌های چندمرحله‌ای حیاتی است.[22][23]
  • توهم‌زایی. مدل‌ها محدودیت‌های معمول LLM‌ها را نشان می‌دهند: خطاهای واقعی در پاسخ‌های تولیدشده ممکن است رخ دهد. برای کاهش ریسک‌ها استفاده از Bedrock Guardrails و RAG توصیه می‌شود.[1]
  • عینیت نسبی benchmark‌ها. Amazon مقایسه‌هایی با مدل‌های رقیب بر اساس داده‌های منتشرشده توسط خود توسعه‌دهندگان ارائه می‌دهد که همیشه پایگاه آزمایشی یکنواخت و کنترل‌شده‌ای را تضمین نمی‌کند.[22]

جنبه‌های اخلاقی و قانونی

AWS اعلام می‌کند که در توسعه مدل‌های Nova از اصول هوش مصنوعی مسئولانه (Responsible AI) پیروی می‌کند. اقدامات ایمنی مشخص عبارتند از:[20][15]

  • مدیریت محتوا (content moderation) تعبیه‌شده.
  • نشانه‌گذاری آبی (watermarking) برای خروجی‌های صوتی Nova Sonic.
  • ارزیابی بر اساس دسته‌بندی‌های ریسک: ایمنی (safety)، حریم خصوصی (privacy)، صحت (veracity)، شفافیت (transparency)، و همچنین انتشار سلاح‌های شیمیایی، بیولوژیکی، رادیولوژیکی و هسته‌ای (CBRN) و عملیات سایبری تهاجمی.
  • یکپارچه‌سازی با Amazon Bedrock Guardrails برای فیلتر کردن داده‌های ورودی و خروجی.
  • ارزیابی مدل Nova Premier برای انطباق با Amazon Frontier Model Safety Framework.
  • Red teaming — آزمایش داخلی و خارجی برای سنجش مقاومت در برابر حملات (بر اساس گزارش فنی، ۳۰۷ تکنیک).
  • ارزیابی مدیریت محتوا بر اساس معیار F1: 85,84 در benchmark Aegis (بر اساس گزارش فنی).[1]

کارت‌های سرویس هوش مصنوعی (AI Service Cards) برای Nova Micro, Lite, Pro, Premier و Sonic در docs.aws.amazon.com به عنوان مستندات کاربرد مسئولانه منتشر شده‌اند.[20][15]

چشم‌اندازها و مسیرهای پژوهشی

خانواده Nova 2 نشانگر گذار به مدل‌هایی با قابلیت‌های استدلال گسترش‌یافته (extended thinking / reasoning) است که از نظر مفهومی با Chain‑of‑Thought (CoT) و مکانیزم‌های مشابه در سایر خانواده‌های مدل قابل مقایسه است. جستجوی وب داخلی و مفسر کد به عنوان ابزارهای بومی (نه افزونه‌های شخص ثالث) نشان‌دهنده تحول معماری به سمت سیستم‌های عاملی است.[9][8]

مسیرهای توسعه بیشتر که در مواد عمومی Amazon مشخص شده‌اند:

  • گسترش مولتی‌مودالیتی (مدل Omni به عنوان معماری یکپارچه «همه در همه»).
  • استدلال هیبریدی (hybrid reasoning) با عمق انطباقی بسته به پیچیدگی وظیفه.
  • آموزش باز بر روی داده‌های کاربر (Nova Forge) در تمام مراحل پیش‌آموزش.
  • تقطیر برای دستگاه‌های edge.
  • گسترش ابزارهای ایمنی (safety toolkit).[8][11]

موضوع Amazon Nova AI Challenge که AWS برای تیم‌های دانشگاهی برگزار می‌کند، شامل جهت‌های آزمون تقابلی خودکار، همسویی ایمنی (safety alignment) و حملات چندنوبتی (multi‑turn jailbreaks) می‌شود که نشان‌دهنده سرمایه‌گذاری در قابلیت اطمینان خانواده مدل است.[8]

همچنین ببینید

  • Transformer (معماری)
  • Reinforcement Learning from Human Feedback (RLHF)

پیوندها

منابع

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/