Nova (Amazon) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — بنیادی ماڈلز (Foundation Models, FM) اور بڑے لسانی ماڈلز (Large Language Model, LLM) کا ایک خاندان ہے جسے Amazon Artificial General Intelligence (AAG Intelligence) کے ذیلی ادارے نے تیار کیا ہے اور جو مکمل طور پر منظم سروس Amazon Bedrock کے ذریعے دستیاب ہے۔ یہ خاندان متن کی فہم و تخلیق، تصاویر، ویڈیو اور دستاویزات کی پروسیسنگ، نیز تقریر کی ترکیب اور شناخت کے لیے ماڈلز پر مشتمل ہے۔ Amazon Nova کو Amazon Titan ماڈلز کے سابقہ نسل کے متبادل کے طور پر پیش کیا جاتا ہے اور یہ Amazon Web Services (AWS) کے کلاؤڈ ماحولیاتی نظام میں ضم ہے۔[1][2][3]

تاریخ اور ترقی کا سلسلہ

Nova کے آغاز سے قبل Amazon Bedrock پلیٹ فارم فریق ثالث ماڈلز تک رسائی فراہم کرتا تھا: Anthropic Claude، Meta Llama، Mistral اور دیگر۔ Amazon Nova کلاؤڈ انفراسٹرکچر میں تجارتی استعمال کے لیے AWS کا اپنی تیاری کا پہلا بنیادی ماڈلز کا خاندان بنی۔[3]

پہلی نسل (2024–2025)

Amazon Nova کی پہلی نسل باضابطہ طور پر 3 دسمبر 2024 کو کانفرنس AWS re:Invent 2024 میں پیش کی گئی۔ ابتدائی اجراء میں تین understanding ماڈلز شامل تھے — Nova Micro (صرف متن)، کثیر طریقی (multimodal) Nova Lite اور Nova Pro — نیز تخلیقی ماڈلز Nova Canvas (تصاویر کی تخلیق) اور Nova Reel (ویڈیو کی تخلیق)۔[4][3][5]

اپریل 2025 میں اس سلسلے میں فلیگ شپ ماڈل Nova Premier شامل کیا گیا — یہ خاندان کا سب سے طاقتور ماڈل ہے جس میں 1 ملین tokens کا سیاقی دریچہ (context window) ہے اور یہ پیچیدہ استدلال اور distillation (بڑے ماڈل سے چھوٹے ماڈل کی جانب علم کی منتقلی) کے کاموں کے لیے بنایا گیا ہے۔[6] اسی اپریل 2025 میں Nova Sonic بھی پیش کیا گیا — یہ speech-to-speech قسم کا تقریری ماڈل ہے جو حقیقی وقت میں مکالموں کی معاونت کرتا ہے۔[7]

دوسری نسل — Nova 2 (2025–2026)

نومبر–دسمبر 2025 میں کانفرنس AWS re:Invent 2025 میں دوسری نسل — Amazon Nova 2 — کا اعلان کیا گیا۔ اس سلسلے میں dynamic reasoning اور بہتر سیاقی پروسیسنگ کے ساتھ اپ ڈیٹ شدہ ماڈلز Nova 2 Lite اور Nova 2 Pro، مقامی کثیر طریقی ماڈل Nova 2 Omni (متن، تصاویر، ویڈیو اور آڈیو کی بیک وقت پروسیسنگ اور تخلیق)، نیز Nova 2 Sonic — اگلی نسل کا تقریری ماڈل — شامل کیے گئے۔ اس کے ساتھ ہی سروسز Nova Forge (ماڈلز کی حسب ضرورت تربیت کا ماحول) اور Nova Act (ایجنٹی workflow کا فریم ورک) بھی متعارف کرائے گئے۔[8][9][10]

فروری 2026 میں Amazon Nova 2 کی سرکاری تکنیکی رپورٹ شائع کی گئی۔[11]

مجموعی تاریخی سلسلہ

تاریخ واقعہ
دسمبر 2024 AWS re:Invent 2024 میں Amazon Nova کا اعلان: Nova Micro, Lite, Pro, Canvas, Reel
اپریل 2025 Nova Premier (1M tokens کا سیاق) اور Nova Sonic (speech-to-speech) کا اجراء
جون 2025 پہلی نسل کی تکنیکی رپورٹ کی اشاعت (arXiv:2506.12103)
نومبر–دسمبر 2025 AWS re:Invent 2025 میں Nova 2 کا اعلان: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
فروری 2026 Amazon Nova 2 کی تکنیکی رپورٹ کی اشاعت

نظری بنیادیں اور فن تعمیر

Understanding ماڈلز کا بنیادی فن تعمیر

تکنیکی رپورٹ arXiv:2506.12103 کے مطابق، فہم کے ماڈلز (Nova Micro, Lite, Pro, Premier) Vaswani et al.[12] کی تحقیق میں بیان کردہ Transformer فن تعمیر پر مبنی ہیں۔ کثیر سر خود توجہ (Multi-Head Self-Attention) کا بنیادی طریقہ کار درج ذیل فارمولے سے بیان کیا جاتا ہے:

Attention(Q,K,V)=softmax(QKdk)V

جہاں Q، K، V بالترتیب سوالات (queries)، چابیاں (keys) اور اقدار (values) کی میٹرسز ہیں، اور dk — چابیوں کی جہت ہے۔[12][1]

فن تعمیر کے درست پیرامیٹرز (تہوں کی تعداد، پوشیدہ حالت کا حجم، توجہ کے سروں کی تعداد، پیرامیٹرز کی مجموعی تعداد) مارچ 2026 تک عوامی طور پر دستیاب ذرائع میں ظاہر نہیں کیے گئے۔ یہ طریقہ کار بند تجارتی ماڈلز کے لیے عام ہے۔[1]

Nova Lite اور Nova Pro میں کثیر طریقی پروسیسنگ متنی، بصری اور ویڈیو tokens کو ایک واحد ترتیب میں یکجا کرکے واحد لسانی ماڈل کے ان پٹ پر بھیج کر نافذ کی جاتی ہے۔ بصری انکوڈرز (vision encoders) تصاویر اور ویڈیو فریموں کو متنی نمائندگی کے ساتھ ہم آہنگ tokens کی ترتیبوں میں تبدیل کرتے ہیں۔[1][13]

تخلیقی ماڈلز کا فن تعمیر

تخلیقی ماڈلز Nova Canvas (تصاویر) اور Nova Reel (ویڈیو) Latent Diffusion Models (LDM)[14] کے فن تعمیر کو Variational AutoEncoder (VAE) کے ساتھ مل کر latent space میں حسابات کے لیے استعمال کرتے ہیں۔ diffusion کا عمل آگے کے شور کی مساوات سے بیان کیا جاتا ہے:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

جہاں x0 — latent space میں اصل تصویر، xt — مرحلہ t پر اس کا شور زدہ ورژن، α¯t — شور کے نظام الاوقات کا مجموعی پیرامیٹر، ϵ — معیاری گاؤسی شور ہے۔ متنی انکوڈر (text encoder) متنی prompt پر تخلیق کی conditioning فراہم کرتا ہے۔[13][14]

تقریری ماڈلز کا فن تعمیر

Nova Sonic متنی ماڈلز سے مختلف فن تعمیر استعمال کرتا ہے: یہ خصوصی تقریری انکوڈر (speech encoder)، تقریری ڈیکوڈر (speech renderer) اور مرکزی کثیر طریقی لسانی ماڈل کو ایک واحد end-to-end pipeline میں یکجا کرتا ہے۔ اس سے تقریری ان پٹ کو پروسیس کرنا اور متن میں درمیانی تبدیلی کے بغیر تقریری آؤٹ پٹ تیار کرنا ممکن ہوتا ہے (اگرچہ معیار یقینی بنانے کے لیے اندرونی طور پر متنی نمائندگی استعمال کی جاتی ہے)۔[15][1]

تربیت کا انفراسٹرکچر

Nova ماڈلز کی تربیت AWS Elastic Kubernetes Service (EKS) کے تقسیم شدہ کلسٹرز پر Amazon کے اپنے AI ایکسیلیریٹرز Amazon Trainium (TRN1 انسٹینسز) اور NVIDIA A100 اور H100 گرافکس پروسیسرز کے استعمال سے کی گئی۔[13][1]

تربیت کے دوران حسابی اخراجات کم کرنے کے لیے خصوصی اصلاحی طریقے تیار اور نافذ کیے گئے:

  • Super-Selective Activation Checkpointing (SSC) — activations محفوظ کرنے کا طریقہ جو تکنیکی رپورٹ کے مطابق دوبارہ حساب (recomputation) کے کم سے کم اضافی بوجھ کے ساتھ گرافکس پروسیسرز کی میموری کی کھپت کو تقریباً 50 فیصد کم کرتا ہے۔[13]
  • In-CPU-Memory Checkpointing — مرکزی پروسیسرز (CPU) کی رام میں درمیانی وزنوں (checkpoints) کی کیشنگ اور پھر ان کا Amazon S3 کلاؤڈ اسٹوریج میں غیر ہم وقتی (asynchronous) انخلاء۔ Amazon کے مطابق اس نقطہ نظر نے TRN1 انسٹینسز پر ماڈل کی حالت محفوظ کرنے کا وقت 0.1 سیکنڈ تک کم کر دیا۔[16][13]

تربیت کا پائپ لائن اور صف بندی

Nova ماڈلز کی تربیت کا عمل جدید LLM کے لیے مخصوص کئی مراحل پر مشتمل ہے:[1][17]

Pre-training - قبل از تربیت

ایک بڑے کثیر لسانی اور کثیر طریقی ڈیٹا کارپس پر بڑے پیمانے پر تربیت، جس میں 200 سے زیادہ زبانیں شامل ہیں۔ تربیتی ڈیٹا کی درست ترکیب (حجم، زبانوں کا تناسب، مخصوص ذرائع) عوامی مواد میں نہیں بتائی گئی۔[1]

Supervised Fine-Tuning (SFT) - زیرِ نگرانی باریک تربیت

"ہدایت — جواب" جوڑوں کی نشان زد مثالوں پر باریک تربیت، جو ماڈل کو صارف کی ہدایات پر عمل کرنے کا عادی بناتی ہے۔[1]

تقویتی سیکھنے کے ذریعے صف بندی

ماڈل کے رویے کو انسانی ترجیحات کے ساتھ ہم آہنگ کرنے کے لیے دو بنیادی الگورتھم استعمال کیے جاتے ہیں:

Proximal Policy Optimization (PPO) — انسانی فیڈ بیک پر مبنی Reinforcement Learning (Reinforcement Learning from Human Feedback, RLHF) کا الگورتھم جو ایک الگ Reward Model استعمال کرتا ہے۔[18][1]

Direct Preference Optimization (DPO) — صف بندی کا متبادل طریقہ جسے واضح Reward Model کی ضرورت نہیں ہوتی۔ DPO کا ہدف فنکشن یہ ہے:[19]

DPO(πθ;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]

جہاں:

  • πθ — پیرامیٹرائزڈ حکمت عملی (قابلِ تربیت ماڈل)؛
  • πref — بنیادی (منجمد) حوالہ جاتی ماڈل؛
  • x — ان پٹ prompt (سیاق)؛
  • yw اور yl — بالترتیب پسندیدہ (winner) اور مسترد (loser) جوابات؛
  • σ — logistic (sigmoid) فنکشن؛
  • β — ہائپر پیرامیٹر جو بنیادی ماڈل سے انحراف پر جرمانے کی طاقت کو کنٹرول کرتا ہے (KL-divergence penalty کا مشابہ)۔[19][1]

ماڈلز کے خاندان کی ترکیب

ماڈلز کے خاندان کو کارکردگی، قیمت اور تاخیر (latency) کے درمیان توازن کے مطابق درجوں (tiers) میں تقسیم کیا گیا ہے۔[2][20]

پہلی نسل کے Understanding ماڈلز

پیرامیٹر Nova Micro Nova Lite Nova Pro Nova Premier
ان پٹ طریقے متن متن، تصویر، ویڈیو متن، تصویر، ویڈیو متن، تصویر، ویڈیو
آؤٹ پٹ طریقہ متن متن متن متن
سیاقی دریچہ 128 ہزار tokens 300 ہزار tokens 300 ہزار tokens 1 ملین tokens
زیادہ سے زیادہ آؤٹ پٹ tokens 10 ہزار 10 ہزار 10 ہزار 10 ہزار
زبانوں کی معاونت 200+ 200+ 200+ 200+
Fine-tuning کی معاونت ہاں ہاں ہاں نہیں
اجراء کی تاریخ دسمبر 2024 دسمبر 2024 دسمبر 2024 اپریل 2025
بنیادی مقصد متنی کاموں کے لیے کم سے کم تاخیر اور قیمت بنیادی کثیر طریقی تجزیہ پیچیدہ منطقی اور ایجنٹی کاموں کے لیے بہترین توازن زیادہ سے زیادہ درستگی، distillation کے لیے استاد ماڈل

ماخذ: AWS AI Service Cards؛ arXiv:2506.12103.[20][1]

اصلاح شدہ زبانیں (15): انگریزی، جرمن، ہسپانوی، فرانسیسی، اطالوی، جاپانی، کورین، عربی، چینی (آسان)، روسی، ہندی، پرتگالی، ڈچ، ترکی، عبرانی۔[2]

Nova Premier ان کاموں کے لیے ہے جن میں گہری سیاقی فہم، کثیر مرحلہ منصوبہ بندی اور بڑی مقدار کے ڈیٹا کے ساتھ کام کی ضرورت ہوتی ہے: کوڈ کی بنیادیں، 400 صفحات سے زیادہ کی دستاویزات، 90 منٹ تک کی ویڈیو۔[6]

دوسری نسل کے ماڈلز (Nova 2)

Nova 2 Lite اور Nova 2 Pro نومبر–دسمبر 2025 میں جاری کیے گئے۔ دونوں extended thinking کی معاونت کرتے ہیں — یہ ایک ایسا طریقہ کار ہے جس میں ماڈل جواب تیار کرنے سے پہلے کثیر مرحلہ استدلال انجام دیتا ہے۔ استدلال کی گہرائی پیرامیٹر reasoning_effort کے ذریعے low، medium اور high سطحوں پر ترتیب دی جاتی ہے۔ سیاقی دریچہ 1 ملین tokens تک بڑھا دیا گیا ہے۔ مقامی آلات سرایت کیے گئے ہیں: تصدیق کے ساتھ ویب تلاش (web grounding) اور کوڈ interpreter۔[9][8]

Nova 2 Omni — ایک مقامی کثیر طریقی ماڈل جو بیک وقت متن، تصاویر، ویڈیو اور آڈیو ان پٹ قبول کر سکتا ہے اور متن اور تصاویر تیار کر سکتا ہے۔ سیاقی دریچہ — 1 ملین tokens۔[8][11]

Nova 2 Sonic — اگلی نسل کا تقریری ماڈل۔ 6 زبانوں کی معاونت کرتا ہے: انگریزی (امریکی اور برطانوی قسمیں)، ہسپانوی، جرمن، فرانسیسی، اطالوی۔ asynchronous tool calling متعارف کراتا ہے — ماڈل نئے ان پٹ کو پروسیس کرتا رہتا ہے جبکہ بیرونی آلات پس منظر میں چل رہے ہوتے ہیں۔[10]

پیرامیٹر Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
ان پٹ طریقے متن، تصویر، ویڈیو متن، تصویر، ویڈیو متن، تصویر، ویڈیو، آڈیو آڈیو (تقریر)
آؤٹ پٹ طریقہ متن متن متن، تصویر آڈیو (تقریر)
سیاقی دریچہ 1 ملین tokens 1 ملین tokens 1 ملین tokens 300 ہزار tokens
Extended thinking ہاں ہاں ہاں
مقامی آلات Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
اجراء کی تاریخ نومبر–دسمبر 2025 نومبر–دسمبر 2025 دسمبر 2025 دسمبر 2025

ماخذ: AWS Blog؛ Amazon Science.[9][8][11]

تخلیقی ماڈلز

Nova Canvas — تصاویر کی تخلیق کا ماڈل۔ متنی اور گرافیکی ان پٹ (PNG, JPEG) کی معاونت کرتا ہے۔ آؤٹ پٹ ریزولیوشن — 4.19 ملین پکسلز تک (مثلاً 2048×2048 یا 2816×1536 پکسلز)۔ prompt کی زیادہ سے زیادہ لمبائی — 1024 حروف۔ inpainting (تصویر کے کسی حصے کی تبدیلی) اور outpainting (تصویر کو اس کی حدود سے باہر بڑھانا) کی کارروائیاں معاون ہیں۔[2][4]

Nova Reel — ویڈیو تخلیق کا ماڈل۔ آؤٹ پٹ ریزولیوشن: 1280×720 بمعدل 24 فریم فی سیکنڈ۔ تیار کی گئی ویڈیو کی مدت — 6 سیکنڈ تک۔ کیمرے کی حرکت (camera control) کا کنٹرول معاون ہے۔ رسائی asynchronous API (Asynchronous Invoke Model API) کے ذریعے حاصل کی جاتی ہے۔[2][4]

تقریری ماڈلز

Nova Sonic (اپریل 2025) — دو طرفہ streaming API (bidirectional stream API) والا تقریری ماڈل۔ function calling اور Retrieval-Augmented Generation (RAG) کے ذریعے کارپوریٹ ڈیٹا پر grounding کی معاونت کرتا ہے۔ watermarking کا فنکشن بطور ڈیفالٹ شامل ہے۔ کنیکشن کی زیادہ سے زیادہ مدت — 8 منٹ، دوبارہ شروع کرنے کی صلاحیت کے ساتھ؛ فی کلائنٹ زیادہ سے زیادہ 20 بیک وقت کنیکشن (ڈیفالٹ قدر)۔[7][15][2]

Nova 2 Sonic (دسمبر 2025) — تقریری ماڈل کی اگلی نسل جس میں مختصر بیانات، ٹیلی فون آڈیو (8 kHz) اور لہجوں کی بہتر شناخت ہے۔[10]

تشخیص اور benchmark

Nova ماڈلز کی تشخیص خودکار benchmarks کے استعمال سے کی گئی جن میں "LLM-as-a-judge" طریقہ (لسانی ماڈل کو بحیثیت جائزہ نگار استعمال) بھی شامل ہے۔ HKU SPACE AI Hub کی تحقیق کے مطابق Arena-Hard-Auto میٹرک ماہرین کی تشخیصات کے ساتھ 98.6 فیصد تعلق ظاہر کرتی ہے۔[21][22]

پہلی نسل کے benchmarks

tکنیکی رپورٹ arXiv:2506.12103 کا ڈیٹا (شرائط: رپورٹ تیار کرنے کے وقت شائع کردہ حریف ماڈلز کے ڈویلپرز کے نتائج):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT-4o (Nov 2024)
MMLU (5-shot) 80.5 77.6
MATH (4-shot) 73.3 69.3
IFEval 87.5 87.2
MT-Bench (text) 79.7 77.7 76.7 77.5
MT-Bench (multimodal) 63.7 60.7 61.6 55.0

ماخذ: arXiv:2506.12103، جدول 2.1.1.[1]

نتائج خاندان کے اندر کارکردگی کا درجہ بندی ظاہر کرتے ہیں (Premier > Pro > Lite > Micro)۔ فرق ریاضی (Math) اور استدلال (Reasoning) کے زمروں میں سب سے زیادہ نمایاں ہے؛ کردار ادا کرنے کے تعامل (Roleplay) اور معلومات کے اخراج (Extraction) کے کاموں میں چھوٹے ماڈلز بڑے ماڈلز سے قریب نتائج دکھاتے ہیں۔[22]

دوسری نسل کے benchmarks (Nova 2)

Amazon Nova 2 تکنیکی رپورٹ کا ڈیٹا (شرائط: internal measurements، 0-shot / CoT جہاں اشارہ کیا گیا):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT-5 Mini Gemini 2.5 Flash
MMLU-Pro (acc) 80.9 81.6 80.0 83.7 83.2
GPQA-Diamond (acc) 79.6 81.4 73.0 82.3 82.8
AIME 2025 (acc) 91.0 92.3 80.7 91.1 72.0
LongCodeBench 1M (acc) 84.0 84.0 78.0

ماخذ: Amazon Nova 2 Technical Report، جدول 1.[11]

ایجنٹی benchmarks (Nova 2 Pro): SWE-Bench Verified — 70.0 %; τ²-bench Verified Telecom — 92.7 %۔[11]

کثیر طریقی benchmarks (Nova 2 Omni): VideoMME — 77.9 %; MMMU Pro — 61.4 %۔[11]

تکنیکی معاونت کے کاموں میں تشخیص پر Nova 2 Lite نے "مسئلے کی شناخت" (Problem Identification) میٹرک میں دس نکاتی پیمانے پر 9.63 ± 0.27 حاصل کیا اور پہلی نسل کے Nova Lite (8.57 ± 0.46) سے نمایاں طور پر آگے رہا۔[23]

نوٹ۔ حریف ماڈلز کے ساتھ نتائج کا موازنہ کرتے وقت یہ مدنظر رکھنا ضروری ہے کہ prompting کی شرائط، ماڈلز کے ورژن اور میٹرکس ریکارڈ کرنے کی تاریخیں مختلف ہو سکتی ہیں۔ پہلی اور دوسری نسل کے benchmarks Amazon کی خود ساختہ رپورٹوں سے لیے گئے ہیں؛ آزادانہ توثیقیں (FloTorch, Artificial Analysis) عمومی طور پر قیمت اور کارکردگی کے دعویٰ شدہ تناسب کی تصدیق کرتی ہیں لیکن بعض درستگی کی میٹرکس پر سرکردہ حریفوں سے پیچھے رہنے کی نشاندہی کرتی ہیں۔[22]

نتائج کی رفتار

Amazon کی اندرونی پیمائشوں کے مطابق (internal، Bedrock API کے ذریعے):[1][11]

ماڈل نتائج کی رفتار (tokens/سیکنڈ)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

استعمال کی قیمت

تمام ماڈلز Amazon Bedrock کے ذریعے پروسیس کیے گئے tokens کی تعداد کی ادائیگی کے ماڈل پر دستیاب ہیں (مارچ 2026 تک کا ڈیٹا):[2]

ماڈل ان پٹ tokens (USD / 1M) آؤٹ پٹ tokens (USD / 1M)
Nova Micro $0.035 $0.14
Nova Lite ≈$0.06 ≈$0.24
Nova Pro $0.80 $3.20
Nova Premier $2.50 $12.50

موازنے کے لیے: Nova کے اجراء کے وقت Anthropic Claude 3.5 Sonnet $6.00 / 1M ان پٹ اور $30.00 / 1M آؤٹ پٹ tokens پر قیمت لگایا گیا تھا۔[22]

حسب ضرورت بنانا اور باریک تربیت

AWS کا انفراسٹرکچر Nova کے بنیادی ماڈلز کو خصوصی شعبہ جات کے مطابق ڈھالنے کے کئی طریقے فراہم کرتا ہے۔ دوسری نسل میں اس کے لیے بنیادی آلہ Amazon Nova Forge ماحول ہے۔[8][17]

Continued Pre-Training (CPT) اور Mid-Training

Nova Forge ماڈلز کے تربیتی درمیانی checkpoints (مثلاً pretraining‑text‑RD اور pretraining‑text‑CE) تک رسائی فراہم کرتا ہے۔ اس سے کارپوریٹ ڈیٹا کے مجموعوں پر self-supervised learning جاری رکھنا ممکن ہوتا ہے جبکہ catastrophic forgetting روکنے کے لیے learning rate کا محتاط انتخاب کیا جاتا ہے۔[24][25]

Parameter-Efficient Fine-Tuning (PEFT)

Low-Rank Adaptation (LoRA)[26] کے ذریعے ماڈل کے وزنوں کے صرف ایک چھوٹے ذیلی مجموعے کو اپ ڈیٹ کرنا۔ یہ طریقہ مکمل fine-tuning کے مقابلے میں حسابی وسائل کی ضروریات کو نمایاں طور پر کم کرتا ہے۔ Nova Lite اور Pro کے لیے کثیر طریقی fine-tuning معاون ہے۔[17]

Reinforcement Fine-Tuning (RFT)

صارف کے حسب ضرورت ماڈلز کو صنعت کے لیے مخصوص انعام کی میٹرکس پر تقویتی طریقوں سے مزید باریک تربیت دی جا سکتی ہے، جن میں LLM-as-a-judge کے طور پر دوسرے LLM کا استعمال بھی شامل ہے۔[27]

ماڈل Distillation

Model Distillation فنکشن Nova Premier یا Nova Pro کو چھوٹے طالب علم ماڈلز (student models) — Nova Lite اور Nova Micro — کی تربیت کے لیے استاد ماڈل (teacher model) کے طور پر استعمال کرنے کی اجازت دیتا ہے۔ اس سے بڑے ماڈل کے معیار کا ایک اہم حصہ برقرار رکھتے ہوئے inference کے حسابی اخراجات کم ہوتے ہیں۔[2][6]

استعمال اور انضمام

Nova ماڈلز Amazon کی حسابی سروسز (AWS Step Functions, AWS Lambda, Amazon Q Developer) میں ضم ہیں۔ بنیادی دستاویزی استعمال کے منظرنامے:[2][1]

ایجنٹی کام کی ترتیبیں (Agentic Workflows)

Bedrock Agents اور بیرونی آلات کے function calling کے استعمال سے کاموں کی کثیر مرحلہ تکمیل۔ ReAct (Reasoning and Acting) آرکیٹیکچرل پیٹرن کو LangGraph جیسے فریم ورکس کے ساتھ استعمال کرتے ہوئے Nova ماڈلز ڈیٹا بیس کے تجزیے کو مربوط کرتے ہیں، قدرتی زبان سے SQL سوالات تیار کرتے ہیں اور کثیر جزئی عمل کو منظم کرتے ہیں۔ Nova Act ابتدائی صارف کے کاموں پر 90 فیصد کی دعویٰ شدہ قابلِ اعتماد ی کے ساتھ براؤزر UI-workflow کی خودکاری فراہم کرتا ہے۔[28][8]

بیرونی علم کی شمولیت سے تخلیق (RAG)

کارپوریٹ ڈیٹا پر جوابات کی grounding کے لیے Bedrock Knowledge Bases کے ساتھ انضمام۔ Nova 2 ماڈلز مقامی آلے کے طور پر تصدیق کے ساتھ مقامی ویب تلاش (web grounding) کی معاونت کرتے ہیں۔[1][9]

دستاویزات کی پروسیسنگ

ان پٹ دستاویزات کی معاون شکلیں: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (سوائے Nova Micro کے جو صرف متنی ان پٹ قبول کرتا ہے)۔ Nova Premier ایک واحد درخواست میں 90 منٹ تک کی ویڈیو پروسیس کر سکتا ہے۔[2][6]

کوڈ کی تخلیق اور ڈیبگنگ

معاون پروگرامنگ زبانیں: Python, Java, JavaScript, C#, TypeScript, SQL۔[20]

تقریری انٹرفیسز

Nova Sonic اور Nova 2 Sonic کو Amazon Connect کے ساتھ مربوط حقیقی وقت کی معاونت کے ساتھ آوازی ایجنٹوں کی تعمیر کے لیے استعمال کیا جاتا ہے۔[10][7]

ماڈلز کی تشخیص (LLM-as-a-judge)

Nova کو Amazon SageMaker پلیٹ فارم پر دیگر تخلیقی ماڈلز کے آؤٹ پٹ کی تشخیص میں جج ماڈل کے طور پر استعمال کیا جاتا ہے۔[29]

حدود اور کھلے مسائل

  • فن تعمیر کی بندش۔ Amazon پیرامیٹرز کی تعداد، تفصیلی آرکیٹیکچرل فیصلے اور تربیتی ڈیٹا کی ترکیب ظاہر نہیں کرتا، جو نتائج کی آزادانہ تولید کو نمایاں طور پر محدود کرتا ہے۔ Nova ماڈلز کے وزن ڈاؤن لوڈ کے لیے یا AWS انفراسٹرکچر سے باہر تعیناتی کے لیے فراہم نہیں کیے جاتے (on-premise تعیناتی ممکن نہیں)۔[1][2]
  • آؤٹ پٹ کی حد۔ تمام understanding ماڈلز کے لیے آؤٹ پٹ tokens کی زیادہ سے زیادہ تعداد 10 ہزار tokens تک محدود ہے جو طویل دستاویزات کی تخلیق کے کاموں کے لیے ناکافی ہو سکتی ہے۔[2]
  • RFT کی حدود۔ Reinforcement Fine-Tuning کثیر دور (multi-turn) مکالموں اور کثیر طریقی ڈیٹا کی معاونت نہیں کرتا؛ dataset میں مثبت مثالوں کا تجویز کردہ تناسب کم از کم 5 فیصد ہے۔[27]
  • Nova Sonic کی حدود۔ کنیکشن کی زیادہ سے زیادہ مدت — 8 منٹ؛ بطور ڈیفالٹ فی کلائنٹ زیادہ سے زیادہ 20 بیک وقت کنیکشن۔[2]
  • علاقائی دستیابی۔ Nova Premier صرف ایک خطے (US East N. Virginia) میں دستیاب ہے اور کراس ریجنل inference کی معاونت نہیں کرتا؛ Nova 2 ماڈلز کے تعیناتی کے خطوں کی فہرست محدود ہے۔[2]
  • میٹرکس کی حساسیت۔ مصنوعی benchmarks پر تشخیصات ہمیشہ پیداواری حالات (production) میں کام کے معیار سے مطابقت نہیں رکھتیں جہاں کارپوریٹ پالیسیوں پر سخت پیروی اور کثیر مرحلہ نتائج میں hallucinations کی غیر موجودگی اہم ہے۔[22][23]
  • Hallucinations۔ ماڈلز LLM کے لیے مخصوص حدود ظاہر کرتے ہیں: تیار کردہ جوابات میں حقیقی غلطیاں ممکن ہیں۔ خطرات کم کرنے کے لیے Bedrock Guardrails اور RAG کا استعمال تجویز کیا جاتا ہے۔[1]
  • Benchmarks کی تقابلی معروضیت۔ Amazon حریف ماڈلز کے ساتھ موازنے خود ان کے ڈویلپرز کی شائع کردہ تحقیقات کی بنیاد پر پیش کرتا ہے جو ہمیشہ یکساں کنٹرول شدہ تجرباتی بنیاد فراہم نہیں کرتا۔[22]

اخلاقی اور ضابطہ جاتی پہلو

AWS Nova ماڈلز کی تیاری میں ذمہ دار AI (Responsible AI) کے اصولوں پر عمل کا اعلان کرتا ہے۔ مخصوص حفاظتی اقدامات میں شامل ہیں:[20][15]

  • مواد کی مقامی اعتدال پسندی (content moderation)۔
  • Nova Sonic کے آڈیو آؤٹ پٹ کے لیے watermarks۔
  • خطرے کے زمروں کے مطابق تشخیص: حفاظت (safety)، رازداری (privacy)، قابلِ اعتماد ہونا (veracity)، شفافیت (transparency)، نیز کیمیائی، حیاتیاتی، تابکاری اور ایٹمی (CBRN) ہتھیاروں کے پھیلاؤ اور جارحانہ سائبر آپریشنز کا جائزہ۔
  • ان پٹ اور آؤٹ پٹ ڈیٹا کی فلٹرنگ کے لیے Amazon Bedrock Guardrails کے ساتھ انضمام۔
  • Amazon Frontier Model Safety Framework کے مطابق Nova Premier ماڈل کا جائزہ۔
  • Red teaming — حملوں کے خلاف استحکام کی اندرونی اور بیرونی جانچ (تکنیکی رپورٹ کے مطابق 307 تکنیکیں)۔
  • Aegis benchmark پر F1 میٹرک کے ذریعے مواد کی اعتدال پسندی کا جائزہ: 85.84 (تکنیکی رپورٹ کے مطابق)۔[1]

Nova Micro, Lite, Pro, Premier اور Sonic کے لیے AI سروس کارڈز (AI Service Cards) docs.aws.amazon.com پر ذمہ دارانہ استعمال کی دستاویز کے طور پر شائع کیے گئے ہیں۔[20][15]

امکانات اور تحقیق کی سمتیں

Nova 2 خاندان بڑھے ہوئے استدلالی صلاحیتوں (extended thinking / reasoning) کے ساتھ ماڈلز کی جانب منتقلی کا اشارہ دیتا ہے جو تصور میں chain-of-thought (Chain-of-Thought, CoT) اور دیگر ماڈل خاندانوں میں اسی طرح کے طریقہ کار سے موازنہ کرتے ہیں۔ مقامی آلات کے طور پر مقامی ویب تلاش اور کوڈ interpreter (نہ کہ فریق ثالث کے پلگ ان) ایجنٹی نظاموں کی سمت میں ایک آرکیٹیکچرل تبدیلی ہے۔[9][8]

Amazon کے عوامی مواد میں مزید ترقی کی سمتیں:

  • کثیر طریقیت کا توسیع (Omni ماڈل بطور یکجا "سب کچھ ایک میں" فن تعمیر)۔
  • ہائبرڈ استدلال (hybrid reasoning) جس میں کام کی پیچیدگی کے مطابق موافق گہرائی ہو۔
  • Nova Forge کے ذریعے پیش تربیت کے تمام مراحل پر صارف کے ڈیٹا پر کھلی تربیت۔
  • edge آلات کے لیے distillation۔
  • حفاظتی ٹول کٹ (safety toolkit) کا توسیع۔[8][11]

AWS کی جانب سے یونیورسٹی ٹیموں کے درمیان منعقد کیا جانے والا Amazon Nova AI Challenge کا موضوع خودکار مخالفانہ جانچ، حفاظت کی صف بندی (safety alignment) اور کثیر دور حملوں (multi-turn jailbreaks) کو شامل کرتا ہے جو ماڈل خاندان کی قابلِ اعتماد ی میں سرمایہ کاری کی نشاندہی کرتا ہے۔[8]

مزید دیکھیں

  • Transformer (فن تعمیر)
  • Reinforcement Learning from Human Feedback (RLHF)

ادبیات

روابط

حوالہ جات

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/