Nova (Amazon) (FA)
Amazon Nova — خانوادهای از مدلهای بنیادی (Foundation Models, FM) و مدلهای زبانی بزرگ (Large Language Model, LLM) است که توسط بخش Amazon Artificial General Intelligence (AAG Intelligence) توسعه یافته و از طریق سرویس کاملاً مدیریتشده Amazon Bedrock در دسترس است. این خانواده شامل مدلهایی برای درک و تولید متن، پردازش تصویر، ویدیو و اسناد، و همچنین سنتز و تشخیص گفتار میشود. Amazon Nova به عنوان جایگزین نسل قبلی مدلهای Amazon Titan معرفی شده و در اکوسیستم ابری Amazon Web Services (AWS) یکپارچه شده است.[1][2][3]
تاریخچه و گاهشمار توسعه
پیش از راهاندازی Nova، پلتفرم Amazon Bedrock دسترسی به مدلهای شخص ثالث از جمله Anthropic Claude، Meta Llama، Mistral و سایرین را فراهم میکرد. Amazon Nova نخستین خانواده از مدلهای بنیادی ساخت AWS بود که به صورت تجاری در زیرساخت ابری ارائه شد.[3]
نسل اول (۲۰۲۴–۲۰۲۵)
نسل اول خانواده Amazon Nova در تاریخ ۳ دسامبر ۲۰۲۴ در کنفرانس AWS re:Invent 2024 به طور رسمی معرفی شد. نسخه اولیه شامل سه مدل درک (understanding models) — Nova Micro (تنها متن)، مولتیمودال Nova Lite و Nova Pro — و همچنین مدلهای مولد Nova Canvas (تولید تصویر) و Nova Reel (تولید ویدیو) بود.[4][3][5]
در آوریل ۲۰۲۵، مدل پرچمدار Nova Premier — قدرتمندترین مدل خانواده با پنجره زمینه یک میلیون token — برای وظایف نیازمند استدلال پیچیده و distillation (انتقال دانش از مدل بزرگ به مدل کوچکتر) به خط تولید افزوده شد.[6] همچنین در آوریل ۲۰۲۵، مدل Nova Sonic — یک مدل گفتاری از نوع speech‑to‑speech با پشتیبانی از گفتگوهای بلادرنگ — معرفی شد.[7]
نسل دوم — Nova 2 (۲۰۲۵–۲۰۲۶)
در نوامبر–دسامبر ۲۰۲۵ در کنفرانس AWS re:Invent 2025، نسل دوم با نام Amazon Nova 2 معرفی شد. این خط شامل مدلهای بهروزشده Nova 2 Lite و Nova 2 Pro با پشتیبانی از استدلال پویا (dynamic reasoning) و پردازش زمینه گستردهتر، مدل مولتیمودال بومی Nova 2 Omni (پردازش و تولید همزمان متن، تصویر، ویدیو و صدا)، و همچنین Nova 2 Sonic — مدل گفتاری نسل بعدی — میشود. در همین زمان، سرویسهای Nova Forge (محیط آموزش سفارشی مدلها) و Nova Act (چارچوب workflowهای عاملی) نیز معرفی شدند.[8][9][10]
در فوریه ۲۰۲۶، گزارش فنی رسمی Amazon Nova 2 منتشر شد.[11]
گاهشمار یکپارچه
| تاریخ | رویداد |
|---|---|
| دسامبر ۲۰۲۴ | اعلام Amazon Nova در AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| آوریل ۲۰۲۵ | انتشار Nova Premier (زمینه ۱M token) و Nova Sonic (speech‑to‑speech) |
| ژوئن ۲۰۲۵ | انتشار گزارش فنی نسل اول (arXiv:2506.12103) |
| نوامبر–دسامبر ۲۰۲۵ | اعلام Nova 2 در AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| فوریه ۲۰۲۶ | انتشار گزارش فنی Amazon Nova 2 |
مبانی نظری و معماری
معماری پایه مدلهای درک (understanding)
بر اساس گزارش فنی arXiv:2506.12103، مدلهای درک (Nova Micro, Lite, Pro, Premier) بر پایه معماری Transformer توصیفشده در اثر Vaswani et al. بنا شدهاند.[12] مکانیزم پایه توجه چندسره (Multi‑Head Self‑Attention) با فرمول زیر توصیف میشود:
که در آن ، ، به ترتیب ماتریسهای queries، keys و values هستند و بُعد keys است.[12][1]
پارامترهای دقیق معماری (تعداد لایهها، اندازه حالت پنهان، تعداد سرهای توجه، تعداد کل پارامترها) در منابع در دسترس عموم تا مارس ۲۰۲۶ فاش نشدهاند. این رویکرد برای مدلهای تجاری بسته رایج است.[1]
پردازش مولتیمودال در Nova Lite و Nova Pro از طریق ترکیب tokenهای متنی، بصری و ویدیویی در یک دنباله واحد که به یک مدل زبانی یکپارچه داده میشود، پیادهسازی شده است. کدگذارهای بصری (vision encoders) تصاویر و فریمهای ویدیو را به دنبالههایی از tokenها تبدیل میکنند که با بازنمایی متنی سازگار هستند.[1][13]
معماری مدلهای مولد
مدلهای مولد Nova Canvas (تصویر) و Nova Reel (ویدیو) از معماری مدلهای انتشار پنهان (Latent Diffusion Models, LDM)[14] در ترکیب با رمزگشاهای خودکار متغیر (Variational AutoEncoder, VAE) برای محاسبات در فضای پنهان استفاده میکنند. فرایند انتشار با معادله شاخه پیشرو نویز توصیف میشود:
که در آن تصویر اصلی در فضای پنهان، نسخه نویزدار آن در گام ، پارامتر تجمعی برنامهریزی نویز و نویز گاوسی استاندارد است. کدگذار متنی (text encoder) شرطیسازی تولید بر اساس prompt متنی را فراهم میکند.[13][14]
معماری مدلهای گفتاری
Nova Sonic از معماریای متفاوت از مدلهای متنی استفاده میکند: این مدل یک کدگذار گفتار تخصصی (speech encoder)، یک رمزگشای گفتار (speech renderer) و یک مدل زبانی مولتیمودال اصلی را در یک خط لوله سرتاسری (end‑to‑end pipeline) یکپارچه میکند. این امکان را میدهد که ورودی گفتاری پردازش شود و خروجی گفتاری بدون تبدیل میانی به متن تولید گردد (هرچند بازنمایی متنی برای تضمین کیفیت به صورت داخلی استفاده میشود).[15][1]
زیرساخت آموزش
آموزش مدلهای Nova بر روی خوشههای توزیعشده AWS Elastic Kubernetes Service (EKS) با استفاده از شتابدهندههای هوش مصنوعی اختصاصی Amazon Trainium (نمونههای TRN1) و همچنین پردازندههای گرافیکی NVIDIA A100 و H100 انجام شد.[13][1]
برای کاهش هزینههای محاسباتی آموزش، روشهای بهینهسازی تخصصی زیر توسعه و بهکار گرفته شدند:
- Super‑Selective Activation Checkpointing (SSC) — روشی برای ذخیره فعالسازیها که بر اساس گزارش فنی، مصرف حافظه پردازندههای گرافیکی را تقریباً ۵۰٪ کاهش میدهد و در عین حال سربار محاسبات مجدد (recomputation) را به حداقل میرساند.[13]
- In‑CPU‑Memory Checkpointing — ذخیرهسازی موقت وزنهای میانی (checkpoints) در حافظه اصلی پردازندههای مرکزی (CPU) پیش از بارگذاری ناهمزمان آنها در فضای ابری Amazon S3. بر اساس اعلام Amazon، این رویکرد زمان ذخیره وضعیت مدل را در نمونههای TRN1 به ۰٫۱ ثانیه کاهش داده است.[16][13]
خط لوله آموزش و همسویی
فرایند آموزش مدلهای Nova از چندین مرحله مشخصه LLMهای مدرن تشکیل شده است:[1][17]
پیشآموزش (Pre‑training)
آموزش مقیاسپذیر بر روی یک مجموعه داده بزرگ چندزبانه و مولتیمودال شامل بیش از ۲۰۰ زبان. ترکیب دقیق دادههای آموزشی (حجم، نسبت زبانها، منابع مشخص) در مواد عمومی ارائه نشده است.[1]
Fine-Tuning با نظارت (Supervised Fine‑Tuning, SFT)
بهینهسازی بیشتر بر روی نمونههای برچسبزدهشده از جفتهای «دستورالعمل — پاسخ» که مدل را به پیروی از دستورالعملهای کاربر سوق میدهد.[1]
همسویی با یادگیری تقویتی
برای همسو کردن رفتار مدل با ترجیحات انسانی، دو الگوریتم اصلی بهکار گرفته میشوند:
Proximal Policy Optimization (PPO) — الگوریتم یادگیری تقویتی مبتنی بر بازخورد انسانی (Reinforcement Learning from Human Feedback, RLHF) که از یک مدل پاداش (Reward Model) جداگانه استفاده میکند.[18][1]
Direct Preference Optimization (DPO) — روش جایگزین همسویی که نیازی به مدل پاداش صریح ندارد. تابع هدف DPO به صورت زیر است:[19]
که در آن:
- — سیاست پارامتریشده (مدل در حال آموزش)؛
- — مدل مرجع پایه (ثابتشده)؛
- — prompt ورودی (زمینه)؛
- و — پاسخهای ترجیحی (winner) و رد شده (loser) به ترتیب؛
- — تابع لجستیک (سیگموئید)؛
- — ابرپارامتری که شدت جریمه انحراف از مدل پایه را کنترل میکند (معادل جریمه KL-divergence).[19][1]
ترکیب خانواده مدلها
خانواده مدلها بر اساس تعادل بین عملکرد، هزینه و تأخیر (latency) به سطوح (tiers) مختلف تقسیم شده است.[2][20]
مدلهای درک نسل اول
| پارامتر | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| موداریتهای ورودی | متن | متن، تصویر، ویدیو | متن، تصویر، ویدیو | متن، تصویر، ویدیو |
| موداریت خروجی | متن | متن | متن | متن |
| پنجره زمینه | ۱۲۸ هزار token | ۳۰۰ هزار token | ۳۰۰ هزار token | ۱ میلیون token |
| حداکثر tokenهای خروجی | ۱۰ هزار | ۱۰ هزار | ۱۰ هزار | ۱۰ هزار |
| پشتیبانی از زبانها | ۲۰۰+ | ۲۰۰+ | ۲۰۰+ | ۲۰۰+ |
| Fine-tuning | بله | بله | بله | خیر |
| تاریخ انتشار | دسامبر ۲۰۲۴ | دسامبر ۲۰۲۴ | دسامبر ۲۰۲۴ | آوریل ۲۰۲۵ |
| کاربرد اصلی | حداقل تأخیر و هزینه برای وظایف متنی | تحلیل مولتیمودال پایه | تعادل بهینه برای وظایف پیچیده منطقی و عاملی | دقت حداکثری، مدل معلم برای distillation |
منبع: AWS AI Service Cards؛ arXiv:2506.12103.[20][1]
زبانهای بهینهسازیشده (۱۵): انگلیسی، آلمانی، اسپانیایی، فرانسوی، ایتالیایی، ژاپنی، کرهای، عربی، چینی (سادهشده)، روسی، هندی، پرتغالی، هلندی، ترکی، عبری.[2]
Nova Premier برای وظایفی طراحی شده که نیاز به درک عمیق زمینه، برنامهریزی چندمرحلهای و کار با حجمهای بزرگ داده دارند: پایگاههای کد، اسناد بیش از ۴۰۰ صفحه، ویدیوهای تا ۹۰ دقیقه.[6]
مدلهای نسل دوم (Nova 2)
Nova 2 Lite و Nova 2 Pro در نوامبر–دسامبر ۲۰۲۵ منتشر شدند. هر دو از تفکر گسترشیافته (extended thinking) پشتیبانی میکنند — مکانیزمی که در آن مدل پیش از تولید پاسخ، استدلالهای چندمرحلهای انجام میدهد. عمق استدلال با پارامتر reasoning_effort با سطوح low، medium و high قابل تنظیم است. پنجره زمینه به ۱ میلیون token گسترش یافته است. ابزارهای بومی شامل جستجوی وب با تأیید (web grounding) و مفسر کد (code interpreter) به صورت داخلی تعبیه شدهاند.[9][8]
Nova 2 Omni — یک مدل مولتیمودال بومی است که میتواند به طور همزمان متن، تصویر، ویدیو و صدا را به عنوان ورودی دریافت کرده و متن و تصویر تولید کند. پنجره زمینه — ۱ میلیون token.[8][11]
Nova 2 Sonic — مدل گفتاری نسل بعدی. از ۶ زبان پشتیبانی میکند: انگلیسی (نسخههای آمریکایی و بریتانیایی)، اسپانیایی، آلمانی، فرانسوی، ایتالیایی. فراخوانی ناهمزمان ابزارها (asynchronous tool calling) را معرفی میکند — مدل هنگامی که ابزارهای خارجی در پسزمینه اجرا میشوند، به پردازش ورودی جدید ادامه میدهد.[10]
| پارامتر | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| موداریتهای ورودی | متن، تصویر، ویدیو | متن، تصویر، ویدیو | متن، تصویر، ویدیو، صدا | صدا (گفتار) |
| موداریت خروجی | متن | متن | متن، تصویر | صدا (گفتار) |
| پنجره زمینه | ۱ میلیون token | ۱ میلیون token | ۱ میلیون token | ۳۰۰ هزار token |
| Extended thinking | بله | بله | بله | — |
| ابزارهای بومی | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| تاریخ انتشار | نوامبر–دسامبر ۲۰۲۵ | نوامبر–دسامبر ۲۰۲۵ | دسامبر ۲۰۲۵ | دسامبر ۲۰۲۵ |
منبع: AWS Blog؛ Amazon Science.[9][8][11]
مدلهای مولد
Nova Canvas — مدل تولید تصویر. از ورودی متنی و گرافیکی (PNG, JPEG) پشتیبانی میکند. رزولوشن خروجی — تا ۴٫۱۹ میلیون پیکسل (مثلاً ۲۰۴۸×۲۰۴۸ یا ۲۸۱۶×۱۵۳۶ پیکسل). حداکثر طول prompt — ۱۰۲۴ کاراکتر. عملیات inpainting (جایگزینی ناحیهای از تصویر) و outpainting (گسترش تصویر به فراتر از مرزهای آن) پشتیبانی میشوند.[2][4]
Nova Reel — مدل تولید ویدیو. رزولوشن خروجی: ۱۲۸۰×۷۲۰ با ۲۴ فریم در ثانیه. مدت زمان ویدیوی تولیدشده — تا ۶ ثانیه. کنترل حرکت دوربین (camera control) پشتیبانی میشود. دسترسی از طریق API ناهمزمان (Asynchronous Invoke Model API) انجام میشود.[2][4]
مدلهای گفتاری
Nova Sonic (آوریل ۲۰۲۵) — مدل گفتاری با API جریان دوطرفه (bidirectional stream API). از فراخوانی توابع (function calling) و اتصال به دادههای سازمانی از طریق Retrieval‑Augmented Generation (RAG) پشتیبانی میکند. قابلیت watermarking به صورت پیشفرض تعبیه شده است. حداکثر مدت اتصال — ۸ دقیقه با امکان از سرگیری؛ حداکثر ۲۰ اتصال همزمان به ازای هر مشتری (مقدار پیشفرض).[7][15][2]
Nova 2 Sonic (دسامبر ۲۰۲۵) — نسل بعدی مدل گفتاری با تشخیص بهبودیافته گفتارهای کوتاه، صدای تلفنی (۸ کیلوهرتز) و لهجهها.[10]
ارزیابی و benchmarkها
ارزیابی مدلهای Nova با استفاده از benchmarkهای خودکار، از جمله رویکرد «LLM‑as‑a‑judge» (استفاده از مدل زبانی به عنوان ارزیاب) انجام شد. بر اساس مطالعه HKU SPACE AI Hub، معیار Arena‑Hard‑Auto همبستگی ۹۸٫۶٪ با ارزیابیهای کارشناسان نشان میدهد.[21][22]
benchmarkهای نسل اول
دادهها از گزارش فنی arXiv:2506.12103 (شرایط: نتایج توسعهدهندگان مدلهای رقیب که در زمان تهیه گزارش منتشر شده بودند):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
منبع: arXiv:2506.12103، جدول 2.1.1.[1]
نتایج سلسلهمراتب عملکرد درون خانواده را نشان میدهند (Premier > Pro > Lite > Micro). شکاف در دستهبندیهای ریاضیات (Math) و استدلال (Reasoning) بیشتر است؛ در وظایف نقشآفرینی (Roleplay) و استخراج اطلاعات (Extraction)، مدلهای کوچکتر نتایجی نزدیک به مدلهای بزرگتر ارائه میدهند.[22]
benchmarkهای نسل دوم (Nova 2)
دادهها از گزارش فنی Amazon Nova 2 (شرایط: اندازهگیریهای داخلی، 0‑shot / CoT در موارد مشخص):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
منبع: Amazon Nova 2 Technical Report، جدول 1.[11]
benchmarkهای عاملی (Nova 2 Pro): SWE‑Bench Verified — 70,0٪؛ τ²‑bench Verified Telecom — 92,7٪.[11]
benchmarkهای مولتیمودال (Nova 2 Omni): VideoMME — 77,9٪؛ MMMU Pro — 61,4٪.[11]
در ارزیابی وظایف پشتیبانی فنی، Nova 2 Lite امتیاز ۹٫۶۳ ± ۰٫۲۷ را در مقیاس دهنمرهای برای معیار «شناسایی مشکل» (Problem Identification) کسب کرد که به طور قابل توجهی از Nova Lite نسل اول (۸٫۵۷ ± ۰٫۴۶) پیشی گرفت.[23]
توجه. هنگام مقایسه نتایج با مدلهای رقیب باید در نظر داشت که شرایط prompting، نسخههای مدلها و تاریخ اندازهگیری معیارها ممکن است متفاوت باشند. benchmarkهای نسل اول و دوم از گزارشهای خود Amazon گرفته شدهاند؛ تأیید مستقل (FloTorch، Artificial Analysis) به طور کلی نسبت قیمت به عملکرد اعلامشده را تأیید میکند، اما در برخی معیارهای دقت، تفاوتی نسبت به پیشروترین رقبا ثبت میکند.[22]
سرعت استنتاج
بر اساس اندازهگیریهای داخلی Amazon (از طریق Bedrock API):[1][11]
| مدل | سرعت استنتاج (token/ثانیه) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
هزینه استفاده
همه مدلها از طریق Amazon Bedrock با مدل پرداخت به ازای تعداد tokenهای پردازششده در دسترس هستند (دادهها تا مارس ۲۰۲۶):[2]
| مدل | Tokenهای ورودی (USD / 1M) | Tokenهای خروجی (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
برای مقایسه: Anthropic Claude 3.5 Sonnet در زمان انتشار Nova به ترتیب با نرخ $6,00 / 1M token ورودی و $30,00 / 1M token خروجی قیمتگذاری شده بود.[22]
سفارشیسازی و fine-tuning
زیرساخت AWS چندین روش برای انطباق مدلهای پایه Nova با حوزههای تخصصی ارائه میدهد. ابزار اصلی برای این کار در نسل دوم محیط Amazon Nova Forge است.[8][17]
Continued Pre‑Training (CPT) و Mid‑Training
Nova Forge دسترسی به checkpointهای میانی آموزش مدلها (مثلاً pretraining‑text‑RD و pretraining‑text‑CE) را فراهم میکند. این امکان ادامه یادگیری خودنظارتی (self‑supervised learning) بر روی مجموعه دادههای سازمانی را با تنظیم دقیق نرخ یادگیری (learning rate) برای جلوگیری از فراموشی فاجعهآمیز (catastrophic forgetting) میدهد.[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
بهروزرسانی تنها یک زیرمجموعه کوچک از وزنهای مدل از طریق آداپتورهای رتبه پایین — Low‑Rank Adaptation (LoRA)[26]. این رویکرد نیازهای محاسباتی را در مقایسه با fine-tuning کامل (full fine‑tuning) به طور قابل توجهی کاهش میدهد. fine-tuning مولتیمودال برای Nova Lite و Pro پشتیبانی میشود.[17]
Reinforcement Fine‑Tuning (RFT)
مدلهای سفارشی میتوانند با روشهای یادگیری تقویتی بر اساس معیارهای پاداش خاص صنعت، از جمله با استفاده از LLM دیگری به عنوان مدل قاضی (LLM‑as‑a‑judge) دوباره fine-tune شوند.[27]
تقطیر مدل (Model Distillation)
قابلیت Model Distillation امکان استفاده از Nova Premier یا Nova Pro به عنوان مدل معلم (teacher model) برای آموزش مدلهای دانشآموز کوچکتر (student models) — Nova Lite و Nova Micro — را فراهم میکند. این کار هزینههای محاسباتی استنتاج را کاهش میدهد و در عین حال بخش قابل توجهی از کیفیت مدل بزرگ را حفظ میکند.[2][6]
کاربردها و یکپارچهسازی
مدلهای Nova در سرویسهای محاسباتی Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer) یکپارچه شدهاند. سناریوهای اصلی مستند شده کاربرد:[2][1]
Agentic Workflows - فرایندهای کاری عاملی
اجرای چندمرحلهای وظایف با استفاده از Bedrock Agents و فراخوانی ابزارهای خارجی (function calling). با استفاده از الگوی معماری ReAct (Reasoning and Acting) در ترکیب با چارچوبهایی مانند LangGraph، مدلهای Nova تحلیل پایگاه داده را هماهنگ میکنند، کوئریهای SQL را از زبان طبیعی تولید میکنند و فرایندهای چندبخشی را مدیریت میکنند. Nova Act اتوماسیون workflowهای UI مرورگر را با قابلیت اطمینان اعلامشده ۹۰٪ در وظایف اولیه کاربران فراهم میکند.[28][8]
Retrieval‑Augmented Generation (RAG) - تولید با استفاده از دانش خارجی
یکپارچهسازی با Bedrock Knowledge Bases برای اتصال (grounding) پاسخها به دادههای سازمانی. مدلهای Nova 2 از جستجوی وب بومی با تأیید (web grounding) به عنوان ابزار داخلی پشتیبانی میکنند.[1][9]
پردازش اسناد
فرمتهای پشتیبانیشده اسناد ورودی: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (به جز Nova Micro که تنها ورودی متنی دریافت میکند). Nova Premier میتواند ویدیوهایی با مدت زمان تا ۹۰ دقیقه را در قالب یک درخواست واحد پردازش کند.[2][6]
تولید و اشکالزدایی کد
زبانهای برنامهنویسی پشتیبانیشده: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
رابطهای گفتاری
Nova Sonic و Nova 2 Sonic برای ساخت عوامل صوتی با پشتیبانی بلادرنگ یکپارچهشده با Amazon Connect بهکار میروند.[10][7]
ارزیابی مدلها (LLM‑as‑a‑judge)
Nova به عنوان مدل قاضی در ارزیابی خروجیهای سایر مدلهای مولد در پلتفرم Amazon SageMaker استفاده میشود.[29]
محدودیتها و مسائل باز
- بسته بودن معماری. Amazon تعداد پارامترها، جزئیات معماری و ترکیب دادههای آموزشی را فاش نمیکند، که این امر بازتولید مستقل نتایج را به طور قابل توجهی محدود میکند. وزنهای مدلهای Nova برای دانلود یا استقرار خارج از زیرساخت AWS در دسترس نیستند (استقرار on‑premise امکانپذیر نیست).[1][2]
- محدودیت خروجی. حداکثر تعداد tokenهای خروجی برای همه مدلهای درک به ۱۰ هزار token محدود شده است که ممکن است برای وظایف تولید اسناد طولانی کافی نباشد.[2]
- محدودیتهای RFT. Reinforcement Fine‑Tuning از گفتگوهای چندنوبتی (multi‑turn) و دادههای مولتیمودال پشتیبانی نمیکند؛ سهم توصیهشده نمونههای مثبت در مجموعه داده — حداقل ۵٪.[27]
- محدودیتهای Nova Sonic. حداکثر مدت اتصال — ۸ دقیقه؛ حداکثر ۲۰ اتصال همزمان به ازای هر مشتری به صورت پیشفرض.[2]
- دسترسی منطقهای. Nova Premier تنها در یک منطقه (US East N. Virginia) بدون پشتیبانی از استنتاج بینمنطقهای در دسترس است؛ مدلهای Nova 2 فهرست محدودی از مناطق استقرار دارند.[2]
- حساسیت معیارها. نمرات benchmarkهای مصنوعی همیشه با کیفیت عملکرد در شرایط تولید (production) همبستگی ندارند، جایی که پیروی دقیق از سیاستهای سازمانی و نبود توهم در استنتاجهای چندمرحلهای حیاتی است.[22][23]
- توهمزایی. مدلها محدودیتهای معمول LLMها را نشان میدهند: خطاهای واقعی در پاسخهای تولیدشده ممکن است رخ دهد. برای کاهش ریسکها استفاده از Bedrock Guardrails و RAG توصیه میشود.[1]
- عینیت نسبی benchmarkها. Amazon مقایسههایی با مدلهای رقیب بر اساس دادههای منتشرشده توسط خود توسعهدهندگان ارائه میدهد که همیشه پایگاه آزمایشی یکنواخت و کنترلشدهای را تضمین نمیکند.[22]
جنبههای اخلاقی و قانونی
AWS اعلام میکند که در توسعه مدلهای Nova از اصول هوش مصنوعی مسئولانه (Responsible AI) پیروی میکند. اقدامات ایمنی مشخص عبارتند از:[20][15]
- مدیریت محتوا (content moderation) تعبیهشده.
- نشانهگذاری آبی (watermarking) برای خروجیهای صوتی Nova Sonic.
- ارزیابی بر اساس دستهبندیهای ریسک: ایمنی (safety)، حریم خصوصی (privacy)، صحت (veracity)، شفافیت (transparency)، و همچنین انتشار سلاحهای شیمیایی، بیولوژیکی، رادیولوژیکی و هستهای (CBRN) و عملیات سایبری تهاجمی.
- یکپارچهسازی با Amazon Bedrock Guardrails برای فیلتر کردن دادههای ورودی و خروجی.
- ارزیابی مدل Nova Premier برای انطباق با Amazon Frontier Model Safety Framework.
- Red teaming — آزمایش داخلی و خارجی برای سنجش مقاومت در برابر حملات (بر اساس گزارش فنی، ۳۰۷ تکنیک).
- ارزیابی مدیریت محتوا بر اساس معیار F1: 85,84 در benchmark Aegis (بر اساس گزارش فنی).[1]
کارتهای سرویس هوش مصنوعی (AI Service Cards) برای Nova Micro, Lite, Pro, Premier و Sonic در docs.aws.amazon.com به عنوان مستندات کاربرد مسئولانه منتشر شدهاند.[20][15]
چشماندازها و مسیرهای پژوهشی
خانواده Nova 2 نشانگر گذار به مدلهایی با قابلیتهای استدلال گسترشیافته (extended thinking / reasoning) است که از نظر مفهومی با Chain‑of‑Thought (CoT) و مکانیزمهای مشابه در سایر خانوادههای مدل قابل مقایسه است. جستجوی وب داخلی و مفسر کد به عنوان ابزارهای بومی (نه افزونههای شخص ثالث) نشاندهنده تحول معماری به سمت سیستمهای عاملی است.[9][8]
مسیرهای توسعه بیشتر که در مواد عمومی Amazon مشخص شدهاند:
- گسترش مولتیمودالیتی (مدل Omni به عنوان معماری یکپارچه «همه در همه»).
- استدلال هیبریدی (hybrid reasoning) با عمق انطباقی بسته به پیچیدگی وظیفه.
- آموزش باز بر روی دادههای کاربر (Nova Forge) در تمام مراحل پیشآموزش.
- تقطیر برای دستگاههای edge.
- گسترش ابزارهای ایمنی (safety toolkit).[8][11]
موضوع Amazon Nova AI Challenge که AWS برای تیمهای دانشگاهی برگزار میکند، شامل جهتهای آزمون تقابلی خودکار، همسویی ایمنی (safety alignment) و حملات چندنوبتی (multi‑turn jailbreaks) میشود که نشاندهنده سرمایهگذاری در قابلیت اطمینان خانواده مدل است.[8]
همچنین ببینید
- Transformer (معماری)
- Reinforcement Learning from Human Feedback (RLHF)
پیوندها
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — مستندات رسمی Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards برای Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card برای Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — اعلام Amazon Nova (دسامبر ۲۰۲۴)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — اعلام Amazon Nova 2 (دسامبر ۲۰۲۵)
منابع
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, فوریه ۲۰۲۶. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/