Nova (Amazon) (HI)
Amazon Nova — फ़ंडामेंटल मॉडल्स (Foundation Models, FM) और बड़े भाषा मॉडल्स (Large Language Model, LLM) का एक परिवार है, जिसे Amazon Artificial General Intelligence (AAG Intelligence) प्रभाग द्वारा विकसित किया गया है और जो पूरी तरह से प्रबंधित सेवा Amazon Bedrock के माध्यम से उपलब्ध है। यह परिवार टेक्स्ट की समझ और उत्पादन, छवि, वीडियो और दस्तावेज़ प्रसंस्करण, तथा वाक् संश्लेषण और पहचान के लिए मॉडल्स को समाहित करता है। Amazon Nova को पिछली पीढ़ी के Amazon Titan मॉडल्स के प्रतिस्थापन के रूप में प्रस्तुत किया गया है और यह Amazon Web Services (AWS) की क्लाउड पारिस्थितिकी तंत्र में एकीकृत है।[1][2][3]
इतिहास और विकास की कालक्रम
Nova के लॉन्च से पहले, Amazon Bedrock प्लेटफ़ॉर्म तृतीय-पक्ष मॉडल्स तक पहुँच प्रदान करता था: Anthropic Claude, Meta Llama, Mistral और अन्य। Amazon Nova क्लाउड इंफ्रास्ट्रक्चर में व्यावसायिक उपयोग के लिए AWS द्वारा स्वयं विकसित फ़ंडामेंटल मॉडल्स का पहला परिवार बना।[3]
पहली पीढ़ी (2024–2025)
Amazon Nova परिवार की पहली पीढ़ी को आधिकारिक रूप से 3 दिसंबर 2024 को AWS re:Invent 2024 सम्मेलन में प्रस्तुत किया गया। प्रारंभिक रिलीज़ में तीन understanding models शामिल थे — Nova Micro (केवल टेक्स्ट), मल्टीमोडल Nova Lite और Nova Pro — साथ ही जनरेटिव मॉडल्स Nova Canvas (छवि उत्पादन) और Nova Reel (वीडियो उत्पादन)।[4][3][5]
अप्रैल 2025 में, श्रृंखला में flagship मॉडल Nova Premier जोड़ा गया — जो परिवार का सबसे शक्तिशाली मॉडल है, जिसमें 1 मिलियन token का contextual window है और जो जटिल तर्क-वितर्क कार्यों और distillation (एक बड़े मॉडल से छोटे मॉडल में ज्ञान स्थानांतरण) के लिए बनाया गया है।[6] उसी समय, अप्रैल 2025 में, Nova Sonic प्रस्तुत किया गया — speech-to-speech श्रेणी का एक वाक् मॉडल जो रियल-टाइम संवाद का समर्थन करता है।[7]
दूसरी पीढ़ी — Nova 2 (2025–2026)
नवंबर–दिसंबर 2025 में AWS re:Invent 2025 सम्मेलन में दूसरी पीढ़ी — Amazon Nova 2 — की घोषणा की गई। इस श्रृंखला में शामिल हैं: dynamic reasoning और विस्तारित संदर्भ प्रसंस्करण के समर्थन के साथ अद्यतन मॉडल Nova 2 Lite और Nova 2 Pro, नेटिव मल्टीमोडल मॉडल Nova 2 Omni (एक साथ टेक्स्ट, छवियों, वीडियो और ऑडियो का प्रसंस्करण और उत्पादन), तथा अगली पीढ़ी का वाक् मॉडल Nova 2 Sonic। साथ ही Nova Forge (कस्टम मॉडल प्रशिक्षण वातावरण) और Nova Act (एजेंटिक workflow के लिए फ्रेमवर्क) सेवाएँ प्रस्तुत की गईं।[8][9][10]
फरवरी 2026 में Amazon Nova 2 की आधिकारिक तकनीकी रिपोर्ट प्रकाशित हुई।[11]
संक्षिप्त कालक्रम
| दिनांक | घटना |
|---|---|
| दिसंबर 2024 | AWS re:Invent 2024 पर Amazon Nova की घोषणा: Nova Micro, Lite, Pro, Canvas, Reel |
| अप्रैल 2025 | Nova Premier (1M token संदर्भ) और Nova Sonic (speech-to-speech) का विमोचन |
| जून 2025 | पहली पीढ़ी की तकनीकी रिपोर्ट का प्रकाशन (arXiv:2506.12103) |
| नवंबर–दिसंबर 2025 | AWS re:Invent 2025 पर Nova 2 की घोषणा: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| फरवरी 2026 | Amazon Nova 2 की तकनीकी रिपोर्ट का प्रकाशन |
सैद्धांतिक आधार और आर्किटेक्चर
Understanding मॉडल्स का मूल आर्किटेक्चर
तकनीकी रिपोर्ट arXiv:2506.12103 के अनुसार, understanding models (Nova Micro, Lite, Pro, Premier) Vaswani et al. के कार्य में वर्णित Transformer आर्किटेक्चर पर आधारित हैं।[12] Multi-Head Self-Attention का मूल तंत्र निम्नलिखित सूत्र द्वारा वर्णित किया जाता है:
जहाँ , , — क्रमशः queries (प्रश्न), keys (कुंजी) और values (मान) की मैट्रिसेज़ हैं, — keys की विमा है।[12][1]
आर्किटेक्चर के सटीक पैरामीटर (परतों की संख्या, hidden state का आकार, attention heads की संख्या, पैरामीटर्स की कुल संख्या) मार्च 2026 तक सार्वजनिक रूप से उपलब्ध स्रोतों में प्रकट नहीं किए गए हैं। यह दृष्टिकोण बंद वाणिज्यिक मॉडल्स के लिए विशिष्ट है।[1]
Nova Lite और Nova Pro में मल्टीमोडल प्रसंस्करण टेक्स्ट, विज़ुअल और वीडियो tokens को एकल अनुक्रम में संयुक्त करके लागू किया गया है, जिसे एकल भाषा मॉडल को इनपुट के रूप में दिया जाता है। Visual encoders छवियों और वीडियो फ्रेम को टेक्स्ट प्रतिनिधित्व के साथ संगत token अनुक्रमों में रूपांतरित करते हैं।[1][13]
जनरेटिव मॉडल्स का आर्किटेक्चर
जनरेटिव मॉडल्स Nova Canvas (छवियाँ) और Nova Reel (वीडियो) Latent Diffusion Models (LDM)[14] आर्किटेक्चर का उपयोग Variational AutoEncoder (VAE) के साथ संयोजन में करते हैं, जो latent space में गणनाओं के लिए उपयोग होते हैं। Diffusion प्रक्रिया को forward noise के समीकरण द्वारा वर्णित किया जाता है:
जहाँ — latent space में मूल छवि है, — चरण पर उसका शोरग्रस्त संस्करण है, — noise schedule का संचयी पैरामीटर है, — मानक गाउसीय शोर है। Text encoder टेक्स्ट prompt पर उत्पादन को conditioning (अनुकूलन) प्रदान करता है।[13][14]
वाक् मॉडल्स का आर्किटेक्चर
Nova Sonic में टेक्स्ट मॉडल्स से भिन्न आर्किटेक्चर है: यह एक विशेष speech encoder, speech renderer (वाक् डिकोडर) और मुख्य मल्टीमोडल भाषा मॉडल को एकल end-to-end pipeline में जोड़ता है। यह टेक्स्ट में मध्यवर्ती रूपांतरण के बिना वाक् इनपुट को संसाधित करने और वाक् आउटपुट उत्पन्न करने की अनुमति देता है (हालाँकि गुणवत्ता सुनिश्चित करने के लिए टेक्स्ट प्रतिनिधित्व आंतरिक रूप से उपयोग किया जाता है)।[15][1]
प्रशिक्षण इंफ्रास्ट्रक्चर
Nova मॉडल्स का प्रशिक्षण AWS Elastic Kubernetes Service (EKS) के वितरित क्लस्टर्स पर Amazon के स्वयं के AI त्वरकों Amazon Trainium (TRN1 इंस्टेंसेज़) के साथ-साथ NVIDIA A100 और H100 ग्राफ़िक्स प्रोसेसर का उपयोग करके किया गया।[13][1]
प्रशिक्षण की गणनात्मक लागत को कम करने के लिए विशेष अनुकूलन विधियाँ विकसित और लागू की गईं:
- Super-Selective Activation Checkpointing (SSC) — activations को सहेजने की विधि, जो तकनीकी रिपोर्ट के अनुसार, पुनर्गणना (recomputation) के न्यूनतम अतिरिक्त भार के साथ ग्राफ़िक्स प्रोसेसर की मेमोरी खपत को लगभग 50% तक कम करती है।[13]
- In-CPU-Memory Checkpointing — Amazon S3 क्लाउड स्टोरेज में उनके असिंक्रोनस अपलोड से पहले केंद्रीय प्रोसेसर (CPU) की RAM में मध्यवर्ती weights (checkpoints) को कैश करना। Amazon के अनुसार, इस दृष्टिकोण ने TRN1 वाले इंस्टेंसेज़ पर मॉडल स्थिति को सहेजने का समय 0.1 सेकंड तक कम कर दिया।[16][13]
प्रशिक्षण पाइपलाइन और संरेखण
Nova मॉडल्स का प्रशिक्षण प्रक्रिया आधुनिक LLM के लिए विशिष्ट कई चरणों से मिलकर बनती है:[1][17]
Pre-training (पूर्व-प्रशिक्षण)
200 से अधिक भाषाओं को शामिल करने वाले एक बड़े बहुभाषी और मल्टीमोडल डेटा कॉर्पस पर बड़े पैमाने पर प्रशिक्षण। प्रशिक्षण डेटा की सटीक संरचना (मात्रा, भाषाओं का अनुपात, विशिष्ट स्रोत) सार्वजनिक सामग्री में नहीं दी गई है।[1]
Supervised Fine-Tuning (SFT) — पर्यवेक्षित fine-tuning
"निर्देश — उत्तर" जोड़ियों के लेबल किए गए उदाहरणों पर fine-tuning, जो मॉडल को उपयोगकर्ता के निर्देशों का पालन करने की ओर ले जाती है।[1]
Reinforcement Learning के माध्यम से संरेखण
मानव प्राथमिकताओं के साथ मॉडल व्यवहार को संरेखित करने के लिए दो मुख्य एल्गोरिदम का उपयोग किया जाता है:
Proximal Policy Optimization (PPO) — मानव प्रतिक्रिया से Reinforcement Learning (Reinforcement Learning from Human Feedback, RLHF) पर आधारित एल्गोरिदम, जो एक अलग Reward Model का उपयोग करता है।[18][1]
Direct Preference Optimization (DPO) — संरेखण की एक वैकल्पिक विधि जिसके लिए स्पष्ट Reward Model की आवश्यकता नहीं होती। DPO का लक्ष्य फ़ंक्शन निम्नानुसार है:[19]
जहाँ:
- — पैरामीटरीकृत नीति (प्रशिक्षणीय मॉडल);
- — आधार (frozen) संदर्भ मॉडल;
- — इनपुट prompt (संदर्भ);
- और — क्रमशः पसंदीदा (winner) और अस्वीकृत (loser) उत्तर;
- — लॉजिस्टिक (sigmoid) फ़ंक्शन;
- — हाइपरपैरामीटर जो आधार मॉडल से विचलन पर दंड की ताकत को नियंत्रित करता है (KL-divergence penalty के समकक्ष)।[19][1]
मॉडल परिवार की संरचना
मॉडल परिवार को प्रदर्शन, लागत और latency के बीच संतुलन के आधार पर tiers में विभाजित किया गया है।[2][20]
पहली पीढ़ी के understanding models
| पैरामीटर | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| इनपुट modalities | टेक्स्ट | टेक्स्ट, छवि, वीडियो | टेक्स्ट, छवि, वीडियो | टेक्स्ट, छवि, वीडियो |
| आउटपुट modality | टेक्स्ट | टेक्स्ट | टेक्स्ट | टेक्स्ट |
| Context window | 128 हज़ार tokens | 300 हज़ार tokens | 300 हज़ार tokens | 1 मिलियन tokens |
| अधिकतम आउटपुट tokens | 10 हज़ार | 10 हज़ार | 10 हज़ार | 10 हज़ार |
| भाषा समर्थन | 200+ | 200+ | 200+ | 200+ |
| Fine-tuning | हाँ | हाँ | हाँ | नहीं |
| रिलीज़ दिनांक | दिसंबर 2024 | दिसंबर 2024 | दिसंबर 2024 | अप्रैल 2025 |
| मुख्य उद्देश्य | टेक्स्ट कार्यों के लिए न्यूनतम latency और लागत | बुनियादी मल्टीमोडल विश्लेषण | जटिल तार्किक और एजेंटिक कार्यों के लिए इष्टतम संतुलन | अधिकतम सटीकता, distillation के लिए teacher model |
स्रोत: AWS AI Service Cards; arXiv:2506.12103.[20][1]
अनुकूलित भाषाएँ (15): अंग्रेजी, जर्मन, स्पेनिश, फ्रेंच, इतालवी, जापानी, कोरियाई, अरबी, चीनी (सरलीकृत), रूसी, हिंदी, पुर्तगाली, डच, तुर्की, हिब्रू।[2]
Nova Premier उन कार्यों के लिए है जिनके लिए गहरी संदर्भ समझ, बहु-चरणीय योजना और बड़े डेटा की मात्रा के साथ काम की आवश्यकता होती है: code bases, 400 से अधिक पृष्ठों के दस्तावेज़, 90 मिनट तक के वीडियो।[6]
दूसरी पीढ़ी के मॉडल (Nova 2)
Nova 2 Lite और Nova 2 Pro नवंबर–दिसंबर 2025 में रिलीज़ किए गए। दोनों extended thinking का समर्थन करते हैं — एक तंत्र जिसमें मॉडल उत्तर उत्पन्न करने से पहले बहु-चरणीय तर्क-वितर्क करता है। तर्क-वितर्क की गहराई पैरामीटर reasoning_effort द्वारा स्तरों low, medium और high के साथ नियंत्रित की जाती है। Context window को 1 मिलियन tokens तक विस्तारित किया गया है। नेटिव टूल्स एकीकृत हैं: web grounding (पुष्टि के साथ वेब खोज) और code interpreter (कोड इंटरप्रेटर)।[9][8]
Nova 2 Omni — एक नेटिव मल्टीमोडल मॉडल है जो एक साथ इनपुट के रूप में टेक्स्ट, छवियाँ, वीडियो और ऑडियो ले सकता है और टेक्स्ट तथा छवियाँ उत्पन्न कर सकता है। Context window — 1 मिलियन tokens।[8][11]
Nova 2 Sonic — अगली पीढ़ी का वाक् मॉडल है। 6 भाषाओं का समर्थन करता है: अंग्रेजी (अमेरिकी और ब्रिटिश संस्करण), स्पेनिश, जर्मन, फ्रेंच, इतालवी। Asynchronous tool calling प्रस्तुत करता है — मॉडल नए इनपुट को संसाधित करना जारी रखता है जबकि बाहरी टूल्स पृष्ठभूमि में निष्पादित होते हैं।[10]
| पैरामीटर | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| इनपुट modalities | टेक्स्ट, छवि, वीडियो | टेक्स्ट, छवि, वीडियो | टेक्स्ट, छवि, वीडियो, ऑडियो | ऑडियो (वाक्) |
| आउटपुट modality | टेक्स्ट | टेक्स्ट | टेक्स्ट, छवि | ऑडियो (वाक्) |
| Context window | 1 मिलियन tokens | 1 मिलियन tokens | 1 मिलियन tokens | 300 हज़ार tokens |
| Extended thinking | हाँ | हाँ | हाँ | — |
| नेटिव टूल्स | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| रिलीज़ दिनांक | नवंबर–दिसंबर 2025 | नवंबर–दिसंबर 2025 | दिसंबर 2025 | दिसंबर 2025 |
स्रोत: AWS Blog; Amazon Science.[9][8][11]
जनरेटिव मॉडल्स
Nova Canvas — छवि उत्पादन मॉडल। टेक्स्ट और ग्राफ़िक इनपुट (PNG, JPEG) का समर्थन करता है। आउटपुट रिज़ॉल्यूशन — 4.19 मिलियन पिक्सेल तक (उदाहरण के लिए, 2048×2048 या 2816×1536 पिक्सेल)। Prompt की अधिकतम लंबाई — 1024 वर्ण। Inpainting (छवि के एक क्षेत्र को बदलना) और outpainting (छवि को उसकी सीमाओं से परे विस्तारित करना) ऑपरेशन समर्थित हैं।[2][4]
Nova Reel — वीडियो उत्पादन मॉडल। आउटपुट रिज़ॉल्यूशन: 24 फ्रेम प्रति सेकंड पर 1280×720। उत्पन्न वीडियो की अवधि — 6 सेकंड तक। Camera control (कैमरा गति नियंत्रण) का समर्थन किया जाता है। पहुँच Asynchronous Invoke Model API के माध्यम से की जाती है।[2][4]
वाक् मॉडल्स
Nova Sonic (अप्रैल 2025) — bidirectional stream API वाला वाक् मॉडल। Function calling और Retrieval-Augmented Generation (RAG, बाहरी ज्ञान को आकर्षित करके उत्पादन) के माध्यम से कॉर्पोरेट डेटा पर grounding का समर्थन करता है। Watermarking फ़ंक्शन डिफ़ॉल्ट रूप से एकीकृत है। कनेक्शन की अधिकतम अवधि — नवीनीकरण की संभावना के साथ 8 मिनट; प्रति क्लाइंट अधिकतम 20 एक साथ कनेक्शन (डिफ़ॉल्ट मान)।[7][15][2]
Nova 2 Sonic (दिसंबर 2025) — बेहतर लघु वाक्यांश पहचान, टेलीफ़ोन ऑडियो (8 kHz) और उच्चारण के साथ अगली पीढ़ी का वाक् मॉडल।[10]
मूल्यांकन और बेंचमार्क
Nova मॉडल्स का मूल्यांकन स्वचालित benchmarks का उपयोग करके किया गया था, जिसमें "LLM-as-a-judge" दृष्टिकोण (मूल्यांकनकर्ता के रूप में भाषा मॉडल का उपयोग) शामिल है। HKU SPACE AI Hub के शोध के अनुसार, Arena-Hard-Auto मेट्रिक विशेषज्ञ मूल्यांकनों के साथ 98.6% सहसंबंध प्रदर्शित करती है।[21][22]
पहली पीढ़ी के बेंचमार्क
तकनीकी रिपोर्ट arXiv:2506.12103 से डेटा (शर्तें: रिपोर्ट तैयार करने के समय प्रकाशित प्रतिस्पर्धी मॉडल डेवलपर्स के परिणाम):[1]
| बेंचमार्क | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT-4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5-shot) | — | 80,5 | 77,6 | — | — |
| MATH (4-shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT-Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT-Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
स्रोत: arXiv:2506.12103, तालिका 2.1.1.[1]
परिणाम परिवार के भीतर प्रदर्शन की पदानुक्रम दर्शाते हैं (Premier > Pro > Lite > Micro)। अंतर गणित (Math) और तर्क-वितर्क (Reasoning) श्रेणियों में सबसे अधिक स्पष्ट है; भूमिका निभाने (Roleplay) और जानकारी निष्कर्षण (Extraction) के कार्यों में छोटे मॉडल बड़े मॉडल के करीब परिणाम दिखाते हैं।[22]
दूसरी पीढ़ी के बेंचमार्क (Nova 2)
Amazon Nova 2 की तकनीकी रिपोर्ट से डेटा (शर्तें: आंतरिक माप, 0-shot / CoT जहाँ संकेत दिया गया):[11]
| बेंचमार्क | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT-5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU-Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA-Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
स्रोत: Amazon Nova 2 Technical Report, तालिका 1.[11]
एजेंटिक बेंचमार्क (Nova 2 Pro): SWE-Bench Verified — 70,0%; τ²-bench Verified Telecom — 92,7%।[11]
मल्टीमोडल बेंचमार्क (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%।[11]
तकनीकी समर्थन कार्यों में मूल्यांकन पर Nova 2 Lite ने "समस्या पहचान" (Problem Identification) मेट्रिक में दस-अंक के पैमाने पर 9,63 ± 0,27 अंक प्राप्त किए, जो पहली पीढ़ी के Nova Lite (8,57 ± 0,46) से काफी आगे है।[23]
नोट। प्रतिस्पर्धी मॉडल्स के साथ परिणामों की तुलना करते समय, यह ध्यान में रखना आवश्यक है कि prompting की शर्तें, मॉडल संस्करण और मेट्रिक्स रिकॉर्ड करने की तिथियाँ भिन्न हो सकती हैं। पहली और दूसरी पीढ़ी के बेंचमार्क Amazon की स्व-रिपोर्ट से प्राप्त हैं; स्वतंत्र सत्यापन (FloTorch, Artificial Analysis) आम तौर पर घोषित मूल्य/प्रदर्शन अनुपात की पुष्टि करते हैं, लेकिन कुछ सटीकता मेट्रिक्स पर अग्रणी प्रतिस्पर्धियों से पिछड़ने को दर्ज करते हैं।[22]
आउटपुट गति
Amazon के आंतरिक माप के अनुसार (Bedrock API के माध्यम से):[1][11]
| मॉडल | आउटपुट गति (tokens/सेकंड) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
उपयोग की लागत
सभी मॉडल Amazon Bedrock के माध्यम से संसाधित tokens की संख्या के भुगतान मॉडल पर उपलब्ध हैं (मार्च 2026 तक का डेटा):[2]
| मॉडल | इनपुट tokens (USD / 1M) | आउटपुट tokens (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
तुलना के लिए: Nova की रिलीज़ के समय Anthropic Claude 3.5 Sonnet $6,00 / 1M इनपुट और $30,00 / 1M आउटपुट tokens पर शुल्क लेता था।[22]
कस्टमाइज़ेशन और Fine-tuning
AWS इंफ्रास्ट्रक्चर संकीर्ण-विशेष डोमेन के लिए Nova के बेस मॉडल्स को अनुकूलित करने के कई तरीके प्रदान करता है। दूसरी पीढ़ी में इसके लिए मुख्य उपकरण Amazon Nova Forge वातावरण है।[8][17]
Continued Pre-Training (CPT) और Mid-Training
Nova Forge मॉडल प्रशिक्षण के मध्यवर्ती checkpoints (उदाहरण के लिए, pretraining‑text‑RD और pretraining‑text‑CE) तक पहुँच प्रदान करता है। यह विनाशकारी भूलने (catastrophic forgetting) को रोकने के लिए सावधानीपूर्वक learning rate के चयन के साथ कॉर्पोरेट डेटा के सरणियों पर self-supervised learning जारी रखने की अनुमति देता है।[24][25]
Parameter-Efficient Fine-Tuning (PEFT)
Low-Rank Adaptation (LoRA)[26] के माध्यम से मॉडल weights के केवल एक छोटे उपसमूह को अद्यतन करना। यह दृष्टिकोण पूर्ण fine-tuning की तुलना में गणनात्मक संसाधनों की आवश्यकता को काफी कम करता है। Nova Lite और Pro के लिए मल्टीमोडल fine-tuning का समर्थन किया जाता है।[17]
Reinforcement Fine-Tuning (RFT)
कस्टम मॉडल्स को उद्योग-विशिष्ट reward मेट्रिक्स के आधार पर Reinforcement Learning विधियों द्वारा अतिरिक्त रूप से fine-tune किया जा सकता है, जिसमें judge model के रूप में किसी अन्य LLM का उपयोग (LLM-as-a-judge) भी शामिल है।[27]
मॉडल Distillation
Model Distillation फ़ंक्शन Nova Premier या Nova Pro को teacher model के रूप में उपयोग करके छोटे student models — Nova Lite और Nova Micro — को प्रशिक्षित करने की अनुमति देता है। यह बड़े मॉडल की गुणवत्ता का महत्वपूर्ण हिस्सा बनाए रखते हुए inference की गणनात्मक लागत को कम करता है।[2][6]
अनुप्रयोग और एकीकरण
Nova मॉडल्स Amazon की कम्प्यूटिंग सेवाओं (AWS Step Functions, AWS Lambda, Amazon Q Developer) में एकीकृत हैं। मुख्य प्रलेखित अनुप्रयोग परिदृश्य:[2][1]
Agentic Workflows (एजेंटिक कार्य प्रक्रियाएँ)
Bedrock Agents और बाहरी टूल्स के function calling के उपयोग के साथ बहु-चरणीय कार्य निष्पादन। LangGraph जैसे फ्रेमवर्क के संयोजन में ReAct (Reasoning and Acting) आर्किटेक्चरल पैटर्न का उपयोग करते हुए, Nova मॉडल्स डेटाबेस विश्लेषण का समन्वय करते हैं, प्राकृतिक भाषा से SQL प्रश्न बनाते हैं और बहु-घटक प्रक्रियाओं का प्रबंधन करते हैं। Nova Act प्रारंभिक उपयोगकर्ता कार्यों पर 90% की घोषित विश्वसनीयता के साथ ब्राउज़र UI-workflow का स्वचालन प्रदान करता है।[28][8]
बाहरी ज्ञान को आकर्षित करके उत्पादन (RAG)
कॉर्पोरेट डेटा पर उत्तरों के grounding के लिए Bedrock Knowledge Bases के साथ एकीकरण। Nova 2 मॉडल्स नेटिव टूल के रूप में web grounding (पुष्टि के साथ वेब खोज) का समर्थन करते हैं।[1][9]
दस्तावेज़ प्रसंस्करण
समर्थित इनपुट दस्तावेज़ प्रारूप: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (Nova Micro को छोड़कर, जो केवल टेक्स्ट इनपुट स्वीकार करता है)। Nova Premier एकल अनुरोध के भीतर 90 मिनट तक के वीडियो को संसाधित करने में सक्षम है।[2][6]
कोड उत्पादन और डीबगिंग
समर्थित प्रोग्रामिंग भाषाएँ: Python, Java, JavaScript, C#, TypeScript, SQL।[20]
वाक् इंटरफ़ेस
Nova Sonic और Nova 2 Sonic का उपयोग Amazon Connect के साथ एकीकृत रियल-टाइम समर्थन वाले voice agents बनाने के लिए किया जाता है।[10][7]
मॉडल मूल्यांकन (LLM-as-a-judge)
Nova का उपयोग Amazon SageMaker प्लेटफ़ॉर्म पर अन्य जनरेटिव मॉडल्स के आउटपुट के मूल्यांकन में judge model के रूप में किया जाता है।[29]
सीमाएँ और खुली समस्याएँ
- आर्किटेक्चर की बंद प्रकृति। Amazon parameters की संख्या, विस्तृत आर्किटेक्चरल निर्णय और प्रशिक्षण डेटा की संरचना का खुलासा नहीं करता, जो परिणामों की स्वतंत्र पुनरुत्पादकता को काफी सीमित करता है। Nova मॉडल्स के weights डाउनलोड या AWS इंफ्रास्ट्रक्चर के बाहर तैनाती (on-premise deployment) के लिए प्रदान नहीं किए जाते।[1][2]
- आउटपुट सीमा। सभी understanding models के लिए अधिकतम आउटपुट tokens 10 हज़ार tokens तक सीमित है, जो लंबे दस्तावेज़ उत्पादन कार्यों के लिए अपर्याप्त हो सकता है।[2]
- RFT की सीमाएँ। Reinforcement Fine-Tuning बहु-चरणीय (multi-turn) संवाद और मल्टीमोडल डेटा का समर्थन नहीं करता; dataset में सकारात्मक उदाहरणों का अनुशंसित अनुपात — कम से कम 5%।[27]
- Nova Sonic की सीमाएँ। कनेक्शन की अधिकतम अवधि — 8 मिनट; डिफ़ॉल्ट रूप से प्रति क्लाइंट अधिकतम 20 एक साथ कनेक्शन।[2]
- क्षेत्रीय उपलब्धता। Nova Premier केवल एक क्षेत्र (US East N. Virginia) में cross-regional inference के समर्थन के बिना उपलब्ध है; Nova 2 मॉडल्स में deployment क्षेत्रों की सीमित सूची है।[2]
- मेट्रिक्स की संवेदनशीलता। सिंथेटिक benchmarks पर मूल्यांकन हमेशा उत्पादन (production) स्थितियों में काम की गुणवत्ता के साथ सहसंबद्ध नहीं होता, जहाँ कॉर्पोरेट नीतियों का कड़ा पालन और बहु-चरणीय निष्कर्षों में hallucinations की अनुपस्थिति महत्वपूर्ण होती है।[22][23]
- Hallucinations। मॉडल LLM के लिए विशिष्ट सीमाएँ प्रदर्शित करते हैं: उत्पन्न उत्तरों में तथ्यात्मक त्रुटियाँ संभव हैं। जोखिम को कम करने के लिए Bedrock Guardrails और RAG के उपयोग की अनुशंसा की जाती है।[1]
- बेंचमार्क की तुलनात्मक निष्पक्षता। Amazon प्रतिस्पर्धी मॉडल्स के साथ तुलना स्वयं डेवलपर्स द्वारा प्रकाशित डेटा के आधार पर प्रस्तुत करता है, जो हमेशा एकल नियंत्रित प्रयोगात्मक आधार प्रदान नहीं करता।[22]
नैतिक और नियामक पहलू
AWS Nova मॉडल्स के विकास में जिम्मेदार AI (Responsible AI) के सिद्धांतों का पालन घोषित करता है। विशिष्ट सुरक्षा उपायों में शामिल हैं:[20][15]
- एकीकृत content moderation (सामग्री मध्यस्थता)।
- Nova Sonic के ऑडियो आउटपुट के लिए watermarking (जल चिह्न)।
- जोखिम श्रेणियों के अनुसार मूल्यांकन: safety (सुरक्षा), privacy (गोपनीयता), veracity (सत्यता), transparency (पारदर्शिता), तथा CBRN (रासायनिक, जैविक, रेडियोलॉजिकल और परमाणु) हथियारों का प्रसार और आक्रामक साइबर अभियान।
- इनपुट और आउटपुट डेटा की फ़िल्टरिंग के लिए Amazon Bedrock Guardrails के साथ एकीकरण।
- Amazon Frontier Model Safety Framework के अनुपालन के लिए Nova Premier मॉडल का मूल्यांकन।
- Red teaming — हमलों के प्रति स्थिरता के लिए आंतरिक और बाहरी परीक्षण (तकनीकी रिपोर्ट के अनुसार, 307 तकनीकें)।
- Aegis benchmark पर F1 मेट्रिक द्वारा content moderation मूल्यांकन: 85,84 (तकनीकी रिपोर्ट के अनुसार)।[1]
Nova Micro, Lite, Pro, Premier और Sonic के लिए AI Service Cards (AI सेवा कार्ड) docs.aws.amazon.com पर जिम्मेदार अनुप्रयोग प्रलेखन के रूप में प्रकाशित किए गए हैं।[20][15]
संभावनाएँ और शोध दिशाएँ
Nova 2 परिवार extended thinking/reasoning क्षमताओं वाले मॉडल्स की ओर संक्रमण को चिह्नित करता है, जो अन्य मॉडल परिवारों में Chain-of-Thought (CoT) और समान तंत्रों की अवधारणा के समान है। नेटिव टूल्स (बाहरी plugins नहीं) के रूप में एकीकृत वेब खोज और code interpreter एजेंटिक प्रणालियों की दिशा में एक आर्किटेक्चरल बदलाव का प्रतिनिधित्व करते हैं।[9][8]
Amazon की सार्वजनिक सामग्री में इंगित आगे के विकास की दिशाएँ:
- मल्टीमोडैलिटी का विस्तार (Omni मॉडल एक एकीकृत "सब-कुछ-से-सब-कुछ" आर्किटेक्चर के रूप में)।
- Hybrid reasoning (हाइब्रिड तर्क-वितर्क) कार्य की जटिलता के आधार पर अनुकूली गहराई के साथ।
- Nova Forge के माध्यम से पूर्व-प्रशिक्षण के सभी चरणों पर उपयोगकर्ता डेटा पर खुला प्रशिक्षण।
- Edge उपकरणों के लिए distillation।
- Safety toolkit (सुरक्षा टूलकिट) का विस्तार।[8][11]
AWS द्वारा विश्वविद्यालय टीमों के बीच आयोजित Amazon Nova AI Challenge के विषयों में स्वचालित adversarial परीक्षण, safety alignment (सुरक्षा संरेखण) और multi-turn jailbreaks की दिशाएँ शामिल हैं, जो मॉडल परिवार की विश्वसनीयता में निवेश का संकेत देती हैं।[8]
यह भी देखें
- Transformer (आर्किटेक्चर)
- Reinforcement Learning from Human Feedback (RLHF)
साहित्य
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, फरवरी 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
लिंक
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Amazon Nova का आधिकारिक प्रलेखन
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — Nova Micro, Lite, Pro, Premier के लिए AI Service Cards
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — Nova Sonic के लिए AI Service Card
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Amazon Nova की घोषणा (दिसंबर 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Amazon Nova 2 की घोषणा (दिसंबर 2025)
टिप्पणियाँ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/