Nova (Amazon) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — फ़ंडामेंटल मॉडल्स (Foundation Models, FM) और बड़े भाषा मॉडल्स (Large Language Model, LLM) का एक परिवार है, जिसे Amazon Artificial General Intelligence (AAG Intelligence) प्रभाग द्वारा विकसित किया गया है और जो पूरी तरह से प्रबंधित सेवा Amazon Bedrock के माध्यम से उपलब्ध है। यह परिवार टेक्स्ट की समझ और उत्पादन, छवि, वीडियो और दस्तावेज़ प्रसंस्करण, तथा वाक् संश्लेषण और पहचान के लिए मॉडल्स को समाहित करता है। Amazon Nova को पिछली पीढ़ी के Amazon Titan मॉडल्स के प्रतिस्थापन के रूप में प्रस्तुत किया गया है और यह Amazon Web Services (AWS) की क्लाउड पारिस्थितिकी तंत्र में एकीकृत है।[1][2][3]

इतिहास और विकास की कालक्रम

Nova के लॉन्च से पहले, Amazon Bedrock प्लेटफ़ॉर्म तृतीय-पक्ष मॉडल्स तक पहुँच प्रदान करता था: Anthropic Claude, Meta Llama, Mistral और अन्य। Amazon Nova क्लाउड इंफ्रास्ट्रक्चर में व्यावसायिक उपयोग के लिए AWS द्वारा स्वयं विकसित फ़ंडामेंटल मॉडल्स का पहला परिवार बना।[3]

पहली पीढ़ी (2024–2025)

Amazon Nova परिवार की पहली पीढ़ी को आधिकारिक रूप से 3 दिसंबर 2024 को AWS re:Invent 2024 सम्मेलन में प्रस्तुत किया गया। प्रारंभिक रिलीज़ में तीन understanding models शामिल थे — Nova Micro (केवल टेक्स्ट), मल्टीमोडल Nova Lite और Nova Pro — साथ ही जनरेटिव मॉडल्स Nova Canvas (छवि उत्पादन) और Nova Reel (वीडियो उत्पादन)।[4][3][5]

अप्रैल 2025 में, श्रृंखला में flagship मॉडल Nova Premier जोड़ा गया — जो परिवार का सबसे शक्तिशाली मॉडल है, जिसमें 1 मिलियन token का contextual window है और जो जटिल तर्क-वितर्क कार्यों और distillation (एक बड़े मॉडल से छोटे मॉडल में ज्ञान स्थानांतरण) के लिए बनाया गया है।[6] उसी समय, अप्रैल 2025 में, Nova Sonic प्रस्तुत किया गया — speech-to-speech श्रेणी का एक वाक् मॉडल जो रियल-टाइम संवाद का समर्थन करता है।[7]

दूसरी पीढ़ी — Nova 2 (2025–2026)

नवंबर–दिसंबर 2025 में AWS re:Invent 2025 सम्मेलन में दूसरी पीढ़ी — Amazon Nova 2 — की घोषणा की गई। इस श्रृंखला में शामिल हैं: dynamic reasoning और विस्तारित संदर्भ प्रसंस्करण के समर्थन के साथ अद्यतन मॉडल Nova 2 Lite और Nova 2 Pro, नेटिव मल्टीमोडल मॉडल Nova 2 Omni (एक साथ टेक्स्ट, छवियों, वीडियो और ऑडियो का प्रसंस्करण और उत्पादन), तथा अगली पीढ़ी का वाक् मॉडल Nova 2 Sonic। साथ ही Nova Forge (कस्टम मॉडल प्रशिक्षण वातावरण) और Nova Act (एजेंटिक workflow के लिए फ्रेमवर्क) सेवाएँ प्रस्तुत की गईं।[8][9][10]

फरवरी 2026 में Amazon Nova 2 की आधिकारिक तकनीकी रिपोर्ट प्रकाशित हुई।[11]

संक्षिप्त कालक्रम

दिनांक घटना
दिसंबर 2024 AWS re:Invent 2024 पर Amazon Nova की घोषणा: Nova Micro, Lite, Pro, Canvas, Reel
अप्रैल 2025 Nova Premier (1M token संदर्भ) और Nova Sonic (speech-to-speech) का विमोचन
जून 2025 पहली पीढ़ी की तकनीकी रिपोर्ट का प्रकाशन (arXiv:2506.12103)
नवंबर–दिसंबर 2025 AWS re:Invent 2025 पर Nova 2 की घोषणा: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
फरवरी 2026 Amazon Nova 2 की तकनीकी रिपोर्ट का प्रकाशन

सैद्धांतिक आधार और आर्किटेक्चर

Understanding मॉडल्स का मूल आर्किटेक्चर

तकनीकी रिपोर्ट arXiv:2506.12103 के अनुसार, understanding models (Nova Micro, Lite, Pro, Premier) Vaswani et al. के कार्य में वर्णित Transformer आर्किटेक्चर पर आधारित हैं।[12] Multi-Head Self-Attention का मूल तंत्र निम्नलिखित सूत्र द्वारा वर्णित किया जाता है:

Attention(Q,K,V)=softmax(QKdk)V

जहाँ Q, K, V — क्रमशः queries (प्रश्न), keys (कुंजी) और values (मान) की मैट्रिसेज़ हैं, dk — keys की विमा है।[12][1]

आर्किटेक्चर के सटीक पैरामीटर (परतों की संख्या, hidden state का आकार, attention heads की संख्या, पैरामीटर्स की कुल संख्या) मार्च 2026 तक सार्वजनिक रूप से उपलब्ध स्रोतों में प्रकट नहीं किए गए हैं। यह दृष्टिकोण बंद वाणिज्यिक मॉडल्स के लिए विशिष्ट है।[1]

Nova Lite और Nova Pro में मल्टीमोडल प्रसंस्करण टेक्स्ट, विज़ुअल और वीडियो tokens को एकल अनुक्रम में संयुक्त करके लागू किया गया है, जिसे एकल भाषा मॉडल को इनपुट के रूप में दिया जाता है। Visual encoders छवियों और वीडियो फ्रेम को टेक्स्ट प्रतिनिधित्व के साथ संगत token अनुक्रमों में रूपांतरित करते हैं।[1][13]

जनरेटिव मॉडल्स का आर्किटेक्चर

जनरेटिव मॉडल्स Nova Canvas (छवियाँ) और Nova Reel (वीडियो) Latent Diffusion Models (LDM)[14] आर्किटेक्चर का उपयोग Variational AutoEncoder (VAE) के साथ संयोजन में करते हैं, जो latent space में गणनाओं के लिए उपयोग होते हैं। Diffusion प्रक्रिया को forward noise के समीकरण द्वारा वर्णित किया जाता है:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

जहाँ x0 — latent space में मूल छवि है, xt — चरण t पर उसका शोरग्रस्त संस्करण है, α¯t — noise schedule का संचयी पैरामीटर है, ϵ — मानक गाउसीय शोर है। Text encoder टेक्स्ट prompt पर उत्पादन को conditioning (अनुकूलन) प्रदान करता है।[13][14]

वाक् मॉडल्स का आर्किटेक्चर

Nova Sonic में टेक्स्ट मॉडल्स से भिन्न आर्किटेक्चर है: यह एक विशेष speech encoder, speech renderer (वाक् डिकोडर) और मुख्य मल्टीमोडल भाषा मॉडल को एकल end-to-end pipeline में जोड़ता है। यह टेक्स्ट में मध्यवर्ती रूपांतरण के बिना वाक् इनपुट को संसाधित करने और वाक् आउटपुट उत्पन्न करने की अनुमति देता है (हालाँकि गुणवत्ता सुनिश्चित करने के लिए टेक्स्ट प्रतिनिधित्व आंतरिक रूप से उपयोग किया जाता है)।[15][1]

प्रशिक्षण इंफ्रास्ट्रक्चर

Nova मॉडल्स का प्रशिक्षण AWS Elastic Kubernetes Service (EKS) के वितरित क्लस्टर्स पर Amazon के स्वयं के AI त्वरकों Amazon Trainium (TRN1 इंस्टेंसेज़) के साथ-साथ NVIDIA A100 और H100 ग्राफ़िक्स प्रोसेसर का उपयोग करके किया गया।[13][1]

प्रशिक्षण की गणनात्मक लागत को कम करने के लिए विशेष अनुकूलन विधियाँ विकसित और लागू की गईं:

  • Super-Selective Activation Checkpointing (SSC) — activations को सहेजने की विधि, जो तकनीकी रिपोर्ट के अनुसार, पुनर्गणना (recomputation) के न्यूनतम अतिरिक्त भार के साथ ग्राफ़िक्स प्रोसेसर की मेमोरी खपत को लगभग 50% तक कम करती है।[13]
  • In-CPU-Memory Checkpointing — Amazon S3 क्लाउड स्टोरेज में उनके असिंक्रोनस अपलोड से पहले केंद्रीय प्रोसेसर (CPU) की RAM में मध्यवर्ती weights (checkpoints) को कैश करना। Amazon के अनुसार, इस दृष्टिकोण ने TRN1 वाले इंस्टेंसेज़ पर मॉडल स्थिति को सहेजने का समय 0.1 सेकंड तक कम कर दिया।[16][13]

प्रशिक्षण पाइपलाइन और संरेखण

Nova मॉडल्स का प्रशिक्षण प्रक्रिया आधुनिक LLM के लिए विशिष्ट कई चरणों से मिलकर बनती है:[1][17]

Pre-training (पूर्व-प्रशिक्षण)

200 से अधिक भाषाओं को शामिल करने वाले एक बड़े बहुभाषी और मल्टीमोडल डेटा कॉर्पस पर बड़े पैमाने पर प्रशिक्षण। प्रशिक्षण डेटा की सटीक संरचना (मात्रा, भाषाओं का अनुपात, विशिष्ट स्रोत) सार्वजनिक सामग्री में नहीं दी गई है।[1]

Supervised Fine-Tuning (SFT) — पर्यवेक्षित fine-tuning

"निर्देश — उत्तर" जोड़ियों के लेबल किए गए उदाहरणों पर fine-tuning, जो मॉडल को उपयोगकर्ता के निर्देशों का पालन करने की ओर ले जाती है।[1]

Reinforcement Learning के माध्यम से संरेखण

मानव प्राथमिकताओं के साथ मॉडल व्यवहार को संरेखित करने के लिए दो मुख्य एल्गोरिदम का उपयोग किया जाता है:

Proximal Policy Optimization (PPO) — मानव प्रतिक्रिया से Reinforcement Learning (Reinforcement Learning from Human Feedback, RLHF) पर आधारित एल्गोरिदम, जो एक अलग Reward Model का उपयोग करता है।[18][1]

Direct Preference Optimization (DPO) — संरेखण की एक वैकल्पिक विधि जिसके लिए स्पष्ट Reward Model की आवश्यकता नहीं होती। DPO का लक्ष्य फ़ंक्शन निम्नानुसार है:[19]

DPO(πθ;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]

जहाँ:

  • πθ — पैरामीटरीकृत नीति (प्रशिक्षणीय मॉडल);
  • πref — आधार (frozen) संदर्भ मॉडल;
  • x — इनपुट prompt (संदर्भ);
  • yw और yl — क्रमशः पसंदीदा (winner) और अस्वीकृत (loser) उत्तर;
  • σ — लॉजिस्टिक (sigmoid) फ़ंक्शन;
  • β — हाइपरपैरामीटर जो आधार मॉडल से विचलन पर दंड की ताकत को नियंत्रित करता है (KL-divergence penalty के समकक्ष)।[19][1]

मॉडल परिवार की संरचना

मॉडल परिवार को प्रदर्शन, लागत और latency के बीच संतुलन के आधार पर tiers में विभाजित किया गया है।[2][20]

पहली पीढ़ी के understanding models

पैरामीटर Nova Micro Nova Lite Nova Pro Nova Premier
इनपुट modalities टेक्स्ट टेक्स्ट, छवि, वीडियो टेक्स्ट, छवि, वीडियो टेक्स्ट, छवि, वीडियो
आउटपुट modality टेक्स्ट टेक्स्ट टेक्स्ट टेक्स्ट
Context window 128 हज़ार tokens 300 हज़ार tokens 300 हज़ार tokens 1 मिलियन tokens
अधिकतम आउटपुट tokens 10 हज़ार 10 हज़ार 10 हज़ार 10 हज़ार
भाषा समर्थन 200+ 200+ 200+ 200+
Fine-tuning हाँ हाँ हाँ नहीं
रिलीज़ दिनांक दिसंबर 2024 दिसंबर 2024 दिसंबर 2024 अप्रैल 2025
मुख्य उद्देश्य टेक्स्ट कार्यों के लिए न्यूनतम latency और लागत बुनियादी मल्टीमोडल विश्लेषण जटिल तार्किक और एजेंटिक कार्यों के लिए इष्टतम संतुलन अधिकतम सटीकता, distillation के लिए teacher model

स्रोत: AWS AI Service Cards; arXiv:2506.12103.[20][1]

अनुकूलित भाषाएँ (15): अंग्रेजी, जर्मन, स्पेनिश, फ्रेंच, इतालवी, जापानी, कोरियाई, अरबी, चीनी (सरलीकृत), रूसी, हिंदी, पुर्तगाली, डच, तुर्की, हिब्रू।[2]

Nova Premier उन कार्यों के लिए है जिनके लिए गहरी संदर्भ समझ, बहु-चरणीय योजना और बड़े डेटा की मात्रा के साथ काम की आवश्यकता होती है: code bases, 400 से अधिक पृष्ठों के दस्तावेज़, 90 मिनट तक के वीडियो।[6]

दूसरी पीढ़ी के मॉडल (Nova 2)

Nova 2 Lite और Nova 2 Pro नवंबर–दिसंबर 2025 में रिलीज़ किए गए। दोनों extended thinking का समर्थन करते हैं — एक तंत्र जिसमें मॉडल उत्तर उत्पन्न करने से पहले बहु-चरणीय तर्क-वितर्क करता है। तर्क-वितर्क की गहराई पैरामीटर reasoning_effort द्वारा स्तरों low, medium और high के साथ नियंत्रित की जाती है। Context window को 1 मिलियन tokens तक विस्तारित किया गया है। नेटिव टूल्स एकीकृत हैं: web grounding (पुष्टि के साथ वेब खोज) और code interpreter (कोड इंटरप्रेटर)।[9][8]

Nova 2 Omni — एक नेटिव मल्टीमोडल मॉडल है जो एक साथ इनपुट के रूप में टेक्स्ट, छवियाँ, वीडियो और ऑडियो ले सकता है और टेक्स्ट तथा छवियाँ उत्पन्न कर सकता है। Context window — 1 मिलियन tokens।[8][11]

Nova 2 Sonic — अगली पीढ़ी का वाक् मॉडल है। 6 भाषाओं का समर्थन करता है: अंग्रेजी (अमेरिकी और ब्रिटिश संस्करण), स्पेनिश, जर्मन, फ्रेंच, इतालवी। Asynchronous tool calling प्रस्तुत करता है — मॉडल नए इनपुट को संसाधित करना जारी रखता है जबकि बाहरी टूल्स पृष्ठभूमि में निष्पादित होते हैं।[10]

पैरामीटर Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
इनपुट modalities टेक्स्ट, छवि, वीडियो टेक्स्ट, छवि, वीडियो टेक्स्ट, छवि, वीडियो, ऑडियो ऑडियो (वाक्)
आउटपुट modality टेक्स्ट टेक्स्ट टेक्स्ट, छवि ऑडियो (वाक्)
Context window 1 मिलियन tokens 1 मिलियन tokens 1 मिलियन tokens 300 हज़ार tokens
Extended thinking हाँ हाँ हाँ
नेटिव टूल्स Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
रिलीज़ दिनांक नवंबर–दिसंबर 2025 नवंबर–दिसंबर 2025 दिसंबर 2025 दिसंबर 2025

स्रोत: AWS Blog; Amazon Science.[9][8][11]

जनरेटिव मॉडल्स

Nova Canvas — छवि उत्पादन मॉडल। टेक्स्ट और ग्राफ़िक इनपुट (PNG, JPEG) का समर्थन करता है। आउटपुट रिज़ॉल्यूशन — 4.19 मिलियन पिक्सेल तक (उदाहरण के लिए, 2048×2048 या 2816×1536 पिक्सेल)। Prompt की अधिकतम लंबाई — 1024 वर्ण। Inpainting (छवि के एक क्षेत्र को बदलना) और outpainting (छवि को उसकी सीमाओं से परे विस्तारित करना) ऑपरेशन समर्थित हैं।[2][4]

Nova Reel — वीडियो उत्पादन मॉडल। आउटपुट रिज़ॉल्यूशन: 24 फ्रेम प्रति सेकंड पर 1280×720। उत्पन्न वीडियो की अवधि — 6 सेकंड तक। Camera control (कैमरा गति नियंत्रण) का समर्थन किया जाता है। पहुँच Asynchronous Invoke Model API के माध्यम से की जाती है।[2][4]

वाक् मॉडल्स

Nova Sonic (अप्रैल 2025) — bidirectional stream API वाला वाक् मॉडल। Function calling और Retrieval-Augmented Generation (RAG, बाहरी ज्ञान को आकर्षित करके उत्पादन) के माध्यम से कॉर्पोरेट डेटा पर grounding का समर्थन करता है। Watermarking फ़ंक्शन डिफ़ॉल्ट रूप से एकीकृत है। कनेक्शन की अधिकतम अवधि — नवीनीकरण की संभावना के साथ 8 मिनट; प्रति क्लाइंट अधिकतम 20 एक साथ कनेक्शन (डिफ़ॉल्ट मान)।[7][15][2]

Nova 2 Sonic (दिसंबर 2025) — बेहतर लघु वाक्यांश पहचान, टेलीफ़ोन ऑडियो (8 kHz) और उच्चारण के साथ अगली पीढ़ी का वाक् मॉडल।[10]

मूल्यांकन और बेंचमार्क

Nova मॉडल्स का मूल्यांकन स्वचालित benchmarks का उपयोग करके किया गया था, जिसमें "LLM-as-a-judge" दृष्टिकोण (मूल्यांकनकर्ता के रूप में भाषा मॉडल का उपयोग) शामिल है। HKU SPACE AI Hub के शोध के अनुसार, Arena-Hard-Auto मेट्रिक विशेषज्ञ मूल्यांकनों के साथ 98.6% सहसंबंध प्रदर्शित करती है।[21][22]

पहली पीढ़ी के बेंचमार्क

तकनीकी रिपोर्ट arXiv:2506.12103 से डेटा (शर्तें: रिपोर्ट तैयार करने के समय प्रकाशित प्रतिस्पर्धी मॉडल डेवलपर्स के परिणाम):[1]

बेंचमार्क Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT-4o (Nov 2024)
MMLU (5-shot) 80,5 77,6
MATH (4-shot) 73,3 69,3
IFEval 87,5 87,2
MT-Bench (text) 79,7 77,7 76,7 77,5
MT-Bench (multimodal) 63,7 60,7 61,6 55,0

स्रोत: arXiv:2506.12103, तालिका 2.1.1.[1]

परिणाम परिवार के भीतर प्रदर्शन की पदानुक्रम दर्शाते हैं (Premier > Pro > Lite > Micro)। अंतर गणित (Math) और तर्क-वितर्क (Reasoning) श्रेणियों में सबसे अधिक स्पष्ट है; भूमिका निभाने (Roleplay) और जानकारी निष्कर्षण (Extraction) के कार्यों में छोटे मॉडल बड़े मॉडल के करीब परिणाम दिखाते हैं।[22]

दूसरी पीढ़ी के बेंचमार्क (Nova 2)

Amazon Nova 2 की तकनीकी रिपोर्ट से डेटा (शर्तें: आंतरिक माप, 0-shot / CoT जहाँ संकेत दिया गया):[11]

बेंचमार्क Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT-5 Mini Gemini 2.5 Flash
MMLU-Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA-Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

स्रोत: Amazon Nova 2 Technical Report, तालिका 1.[11]

एजेंटिक बेंचमार्क (Nova 2 Pro): SWE-Bench Verified — 70,0%; τ²-bench Verified Telecom — 92,7%।[11]

मल्टीमोडल बेंचमार्क (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%।[11]

तकनीकी समर्थन कार्यों में मूल्यांकन पर Nova 2 Lite ने "समस्या पहचान" (Problem Identification) मेट्रिक में दस-अंक के पैमाने पर 9,63 ± 0,27 अंक प्राप्त किए, जो पहली पीढ़ी के Nova Lite (8,57 ± 0,46) से काफी आगे है।[23]

नोट। प्रतिस्पर्धी मॉडल्स के साथ परिणामों की तुलना करते समय, यह ध्यान में रखना आवश्यक है कि prompting की शर्तें, मॉडल संस्करण और मेट्रिक्स रिकॉर्ड करने की तिथियाँ भिन्न हो सकती हैं। पहली और दूसरी पीढ़ी के बेंचमार्क Amazon की स्व-रिपोर्ट से प्राप्त हैं; स्वतंत्र सत्यापन (FloTorch, Artificial Analysis) आम तौर पर घोषित मूल्य/प्रदर्शन अनुपात की पुष्टि करते हैं, लेकिन कुछ सटीकता मेट्रिक्स पर अग्रणी प्रतिस्पर्धियों से पिछड़ने को दर्ज करते हैं।[22]

आउटपुट गति

Amazon के आंतरिक माप के अनुसार (Bedrock API के माध्यम से):[1][11]

मॉडल आउटपुट गति (tokens/सेकंड)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

उपयोग की लागत

सभी मॉडल Amazon Bedrock के माध्यम से संसाधित tokens की संख्या के भुगतान मॉडल पर उपलब्ध हैं (मार्च 2026 तक का डेटा):[2]

मॉडल इनपुट tokens (USD / 1M) आउटपुट tokens (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

तुलना के लिए: Nova की रिलीज़ के समय Anthropic Claude 3.5 Sonnet $6,00 / 1M इनपुट और $30,00 / 1M आउटपुट tokens पर शुल्क लेता था।[22]

कस्टमाइज़ेशन और Fine-tuning

AWS इंफ्रास्ट्रक्चर संकीर्ण-विशेष डोमेन के लिए Nova के बेस मॉडल्स को अनुकूलित करने के कई तरीके प्रदान करता है। दूसरी पीढ़ी में इसके लिए मुख्य उपकरण Amazon Nova Forge वातावरण है।[8][17]

Continued Pre-Training (CPT) और Mid-Training

Nova Forge मॉडल प्रशिक्षण के मध्यवर्ती checkpoints (उदाहरण के लिए, pretraining‑text‑RD और pretraining‑text‑CE) तक पहुँच प्रदान करता है। यह विनाशकारी भूलने (catastrophic forgetting) को रोकने के लिए सावधानीपूर्वक learning rate के चयन के साथ कॉर्पोरेट डेटा के सरणियों पर self-supervised learning जारी रखने की अनुमति देता है।[24][25]

Parameter-Efficient Fine-Tuning (PEFT)

Low-Rank Adaptation (LoRA)[26] के माध्यम से मॉडल weights के केवल एक छोटे उपसमूह को अद्यतन करना। यह दृष्टिकोण पूर्ण fine-tuning की तुलना में गणनात्मक संसाधनों की आवश्यकता को काफी कम करता है। Nova Lite और Pro के लिए मल्टीमोडल fine-tuning का समर्थन किया जाता है।[17]

Reinforcement Fine-Tuning (RFT)

कस्टम मॉडल्स को उद्योग-विशिष्ट reward मेट्रिक्स के आधार पर Reinforcement Learning विधियों द्वारा अतिरिक्त रूप से fine-tune किया जा सकता है, जिसमें judge model के रूप में किसी अन्य LLM का उपयोग (LLM-as-a-judge) भी शामिल है।[27]

मॉडल Distillation

Model Distillation फ़ंक्शन Nova Premier या Nova Pro को teacher model के रूप में उपयोग करके छोटे student models — Nova Lite और Nova Micro — को प्रशिक्षित करने की अनुमति देता है। यह बड़े मॉडल की गुणवत्ता का महत्वपूर्ण हिस्सा बनाए रखते हुए inference की गणनात्मक लागत को कम करता है।[2][6]

अनुप्रयोग और एकीकरण

Nova मॉडल्स Amazon की कम्प्यूटिंग सेवाओं (AWS Step Functions, AWS Lambda, Amazon Q Developer) में एकीकृत हैं। मुख्य प्रलेखित अनुप्रयोग परिदृश्य:[2][1]

Agentic Workflows (एजेंटिक कार्य प्रक्रियाएँ)

Bedrock Agents और बाहरी टूल्स के function calling के उपयोग के साथ बहु-चरणीय कार्य निष्पादन। LangGraph जैसे फ्रेमवर्क के संयोजन में ReAct (Reasoning and Acting) आर्किटेक्चरल पैटर्न का उपयोग करते हुए, Nova मॉडल्स डेटाबेस विश्लेषण का समन्वय करते हैं, प्राकृतिक भाषा से SQL प्रश्न बनाते हैं और बहु-घटक प्रक्रियाओं का प्रबंधन करते हैं। Nova Act प्रारंभिक उपयोगकर्ता कार्यों पर 90% की घोषित विश्वसनीयता के साथ ब्राउज़र UI-workflow का स्वचालन प्रदान करता है।[28][8]

बाहरी ज्ञान को आकर्षित करके उत्पादन (RAG)

कॉर्पोरेट डेटा पर उत्तरों के grounding के लिए Bedrock Knowledge Bases के साथ एकीकरण। Nova 2 मॉडल्स नेटिव टूल के रूप में web grounding (पुष्टि के साथ वेब खोज) का समर्थन करते हैं।[1][9]

दस्तावेज़ प्रसंस्करण

समर्थित इनपुट दस्तावेज़ प्रारूप: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (Nova Micro को छोड़कर, जो केवल टेक्स्ट इनपुट स्वीकार करता है)। Nova Premier एकल अनुरोध के भीतर 90 मिनट तक के वीडियो को संसाधित करने में सक्षम है।[2][6]

कोड उत्पादन और डीबगिंग

समर्थित प्रोग्रामिंग भाषाएँ: Python, Java, JavaScript, C#, TypeScript, SQL।[20]

वाक् इंटरफ़ेस

Nova Sonic और Nova 2 Sonic का उपयोग Amazon Connect के साथ एकीकृत रियल-टाइम समर्थन वाले voice agents बनाने के लिए किया जाता है।[10][7]

मॉडल मूल्यांकन (LLM-as-a-judge)

Nova का उपयोग Amazon SageMaker प्लेटफ़ॉर्म पर अन्य जनरेटिव मॉडल्स के आउटपुट के मूल्यांकन में judge model के रूप में किया जाता है।[29]

सीमाएँ और खुली समस्याएँ

  • आर्किटेक्चर की बंद प्रकृति। Amazon parameters की संख्या, विस्तृत आर्किटेक्चरल निर्णय और प्रशिक्षण डेटा की संरचना का खुलासा नहीं करता, जो परिणामों की स्वतंत्र पुनरुत्पादकता को काफी सीमित करता है। Nova मॉडल्स के weights डाउनलोड या AWS इंफ्रास्ट्रक्चर के बाहर तैनाती (on-premise deployment) के लिए प्रदान नहीं किए जाते।[1][2]
  • आउटपुट सीमा। सभी understanding models के लिए अधिकतम आउटपुट tokens 10 हज़ार tokens तक सीमित है, जो लंबे दस्तावेज़ उत्पादन कार्यों के लिए अपर्याप्त हो सकता है।[2]
  • RFT की सीमाएँ। Reinforcement Fine-Tuning बहु-चरणीय (multi-turn) संवाद और मल्टीमोडल डेटा का समर्थन नहीं करता; dataset में सकारात्मक उदाहरणों का अनुशंसित अनुपात — कम से कम 5%।[27]
  • Nova Sonic की सीमाएँ। कनेक्शन की अधिकतम अवधि — 8 मिनट; डिफ़ॉल्ट रूप से प्रति क्लाइंट अधिकतम 20 एक साथ कनेक्शन।[2]
  • क्षेत्रीय उपलब्धता। Nova Premier केवल एक क्षेत्र (US East N. Virginia) में cross-regional inference के समर्थन के बिना उपलब्ध है; Nova 2 मॉडल्स में deployment क्षेत्रों की सीमित सूची है।[2]
  • मेट्रिक्स की संवेदनशीलता। सिंथेटिक benchmarks पर मूल्यांकन हमेशा उत्पादन (production) स्थितियों में काम की गुणवत्ता के साथ सहसंबद्ध नहीं होता, जहाँ कॉर्पोरेट नीतियों का कड़ा पालन और बहु-चरणीय निष्कर्षों में hallucinations की अनुपस्थिति महत्वपूर्ण होती है।[22][23]
  • Hallucinations। मॉडल LLM के लिए विशिष्ट सीमाएँ प्रदर्शित करते हैं: उत्पन्न उत्तरों में तथ्यात्मक त्रुटियाँ संभव हैं। जोखिम को कम करने के लिए Bedrock Guardrails और RAG के उपयोग की अनुशंसा की जाती है।[1]
  • बेंचमार्क की तुलनात्मक निष्पक्षता। Amazon प्रतिस्पर्धी मॉडल्स के साथ तुलना स्वयं डेवलपर्स द्वारा प्रकाशित डेटा के आधार पर प्रस्तुत करता है, जो हमेशा एकल नियंत्रित प्रयोगात्मक आधार प्रदान नहीं करता।[22]

नैतिक और नियामक पहलू

AWS Nova मॉडल्स के विकास में जिम्मेदार AI (Responsible AI) के सिद्धांतों का पालन घोषित करता है। विशिष्ट सुरक्षा उपायों में शामिल हैं:[20][15]

  • एकीकृत content moderation (सामग्री मध्यस्थता)।
  • Nova Sonic के ऑडियो आउटपुट के लिए watermarking (जल चिह्न)।
  • जोखिम श्रेणियों के अनुसार मूल्यांकन: safety (सुरक्षा), privacy (गोपनीयता), veracity (सत्यता), transparency (पारदर्शिता), तथा CBRN (रासायनिक, जैविक, रेडियोलॉजिकल और परमाणु) हथियारों का प्रसार और आक्रामक साइबर अभियान।
  • इनपुट और आउटपुट डेटा की फ़िल्टरिंग के लिए Amazon Bedrock Guardrails के साथ एकीकरण।
  • Amazon Frontier Model Safety Framework के अनुपालन के लिए Nova Premier मॉडल का मूल्यांकन।
  • Red teaming — हमलों के प्रति स्थिरता के लिए आंतरिक और बाहरी परीक्षण (तकनीकी रिपोर्ट के अनुसार, 307 तकनीकें)।
  • Aegis benchmark पर F1 मेट्रिक द्वारा content moderation मूल्यांकन: 85,84 (तकनीकी रिपोर्ट के अनुसार)।[1]

Nova Micro, Lite, Pro, Premier और Sonic के लिए AI Service Cards (AI सेवा कार्ड) docs.aws.amazon.com पर जिम्मेदार अनुप्रयोग प्रलेखन के रूप में प्रकाशित किए गए हैं।[20][15]

संभावनाएँ और शोध दिशाएँ

Nova 2 परिवार extended thinking/reasoning क्षमताओं वाले मॉडल्स की ओर संक्रमण को चिह्नित करता है, जो अन्य मॉडल परिवारों में Chain-of-Thought (CoT) और समान तंत्रों की अवधारणा के समान है। नेटिव टूल्स (बाहरी plugins नहीं) के रूप में एकीकृत वेब खोज और code interpreter एजेंटिक प्रणालियों की दिशा में एक आर्किटेक्चरल बदलाव का प्रतिनिधित्व करते हैं।[9][8]

Amazon की सार्वजनिक सामग्री में इंगित आगे के विकास की दिशाएँ:

  • मल्टीमोडैलिटी का विस्तार (Omni मॉडल एक एकीकृत "सब-कुछ-से-सब-कुछ" आर्किटेक्चर के रूप में)।
  • Hybrid reasoning (हाइब्रिड तर्क-वितर्क) कार्य की जटिलता के आधार पर अनुकूली गहराई के साथ।
  • Nova Forge के माध्यम से पूर्व-प्रशिक्षण के सभी चरणों पर उपयोगकर्ता डेटा पर खुला प्रशिक्षण।
  • Edge उपकरणों के लिए distillation।
  • Safety toolkit (सुरक्षा टूलकिट) का विस्तार।[8][11]

AWS द्वारा विश्वविद्यालय टीमों के बीच आयोजित Amazon Nova AI Challenge के विषयों में स्वचालित adversarial परीक्षण, safety alignment (सुरक्षा संरेखण) और multi-turn jailbreaks की दिशाएँ शामिल हैं, जो मॉडल परिवार की विश्वसनीयता में निवेश का संकेत देती हैं।[8]

यह भी देखें

  • Transformer (आर्किटेक्चर)
  • Reinforcement Learning from Human Feedback (RLHF)

साहित्य

लिंक

टिप्पणियाँ

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/