Nova (Amazon) (TL)
Amazon Nova — isang pamilya ng mga pundasyon na modelo (Foundation Models, FM) at malalaking modelo ng wika (Large Language Model, LLM), na binuo ng dibisyon ng Amazon Artificial General Intelligence (AAG Intelligence) at makukuha sa pamamagitan ng ganap na pinamamahalaang serbisyong Amazon Bedrock. Sinasaklaw ng pamilya ang mga modelo para sa pag-unawa at paglikha ng teksto, pagpoproseso ng mga larawan, video at dokumento, gayundin ang synthesis at pagkilala ng pagsasalita. Ang Amazon Nova ay inilalahad bilang kapalit ng nakaraang henerasyong mga modelo ng Amazon Titan at isinama sa ulap na ekosistema ng Amazon Web Services (AWS).[1][2][3]
Kasaysayan at kronolohiya ng pagpapaunlad
Bago ilunsad ang Nova, ang platform na Amazon Bedrock ay nagbibigay ng access sa mga third-party na modelo: Anthropic Claude, Meta Llama, Mistral at iba pa. Ang Amazon Nova ay naging unang pamilya ng mga pundasyon na modelo na sariling gawa ng AWS, na nakatuon sa komersyal na paggamit sa ulap na imprastraktura.[3]
Unang henerasyon (2024–2025)
Ang unang henerasyon ng pamilyang Amazon Nova ay opisyal na ipinakita noong ika-3 ng Disyembre 2024 sa kumperensyang AWS re:Invent 2024. Kasama sa unang release ang tatlong modelo ng pag-unawa (understanding models) — ang Nova Micro (teksto lamang), ang mga multimodal na Nova Lite at Nova Pro, — gayundin ang mga generative na modelo ng Nova Canvas (paglikha ng larawan) at Nova Reel (paglikha ng video).[4][3][5]
Noong Abril 2025, nadagdagan ang linya ng flagship na modelo na Nova Premier — ang pinaka-makapangyarihang modelo ng pamilya na may context window na 1 milyong token, na inilaan para sa mga gawaing may kumplikadong pangangatuwiran at distillation (distillation, paglipat ng kaalaman mula sa malaking modelo patungo sa mas maliit) ng mga modelo.[6] Nang panahon din, noong Abril 2025, ipinakita ang Nova Sonic — isang speech‑to‑speech na modelo ng klase na may suporta sa mga diyalogo sa real time.[7]
Ikalawang henerasyon — Nova 2 (2025–2026)
Noong Nobyembre–Disyembre 2025 sa kumperensyang AWS re:Invent 2025, inanunsyo ang ikalawang henerasyon — Amazon Nova 2. Kasama sa linya ang mga na-update na modelo ng Nova 2 Lite at Nova 2 Pro na may suporta sa dynamic reasoning at pinapalawak na pagpoproseso ng konteksto, ang native multimodal na modelo na Nova 2 Omni (sabay-sabay na pagpoproseso at paglikha ng teksto, larawan, video at audio), gayundin ang Nova 2 Sonic — isang speech na modelo ng susunod na henerasyon. Sabay na ipinakita ang mga serbisyong Nova Forge (kapaligiran para sa custom na pagsasanay ng mga modelo) at Nova Act (framework para sa mga agentic na workflow).[8][9][10]
Noong Pebrero 2026, nailathala ang opisyal na teknikal na ulat ng Amazon Nova 2.[11]
Pinagsama-samang kronolohiya
| Petsa | Kaganapan |
|---|---|
| Disyembre 2024 | Anunsyo ng Amazon Nova sa AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| Abril 2025 | Paglabas ng Nova Premier (konteksto 1M token) at Nova Sonic (speech‑to‑speech) |
| Hunyo 2025 | Publikasyon ng teknikal na ulat ng unang henerasyon (arXiv:2506.12103) |
| Nobyembre–Disyembre 2025 | Anunsyo ng Nova 2 sa AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| Pebrero 2026 | Publikasyon ng teknikal na ulat ng Amazon Nova 2 |
Teoretikal na pundasyon at arkitektura
Pangunahing arkitektura ng mga understanding‑modelo
Ayon sa teknikal na ulat na arXiv:2506.12103, ang mga modelo ng pag-unawa (Nova Micro, Lite, Pro, Premier) ay nakabatay sa arkitektura ng transformer (Transformer), na inilarawan sa gawa ni Vaswani et al.[12] Ang pangunahing mekanismo ng multi-head self-attention (Multi‑Head Self‑Attention) ay inilarawan ng formula:
kung saan ang , , — mga matris ng mga query (queries), susi (keys) at mga halaga (values) ayon sa pagkakasunod, — dimensyon ng mga susi.[12][1]
Ang eksaktong mga parameter ng arkitektura (bilang ng mga layer, laki ng nakatagong estado, bilang ng mga ulo ng atensyon, kabuuang bilang ng mga parameter) sa mga mapagkukunang available sa publiko sa petsa ng Marso 2026 ay hindi inihayag. Ang ganitong diskarte ay katangian ng mga saradong komersyal na modelo.[1]
Ang multimodal na pagpoproseso sa Nova Lite at Nova Pro ay isinasagawa sa pamamagitan ng pagsasama ng mga teksto, visual at video token sa isang solong pagkakasunod-sunod na ipinasok sa isang language model. Ang mga visual encoder (vision encoders) ay nagko-convert ng mga larawan at frame ng video sa mga pagkakasunod-sunod ng mga token na katugma sa representasyon ng teksto.[1][13]
Arkitektura ng mga generative na modelo
Ang mga generative na modelo ng Nova Canvas (larawan) at Nova Reel (video) ay gumagamit ng arkitektura ng mga Latent Diffusion Models (LDM)[14] kasama ang mga variational autoencoder (Variational AutoEncoder, VAE) para sa mga kalkulasyon sa latent space. Ang proseso ng diffusion ay inilarawan ng equation ng forward noise:
kung saan ang — ang orihinal na larawan sa latent space, — ang bersyong may ingay nito sa hakbang na , — ang kumulatibong parameter ng noise schedule, — karaniwang Gaussian noise. Ang text encoder ay nagbibigay ng conditioning — ang kondisyon ng paglikha sa text prompt.[13][14]
Arkitektura ng mga speech na modelo
Ang Nova Sonic ay gumagamit ng arkitekturang iba sa mga text na modelo: pinagsasama nito ang espesyal na speech encoder, speech decoder (speech renderer) at ang pangunahing multimodal na language model sa isang end‑to‑end pipeline. Nagpapahintulot ito na iproseso ang speech input at bumuo ng speech output nang walang intermediate na conversion sa teksto (bagama't ang representasyon ng teksto ay ginagamit nang panloob upang matiyak ang kalidad).[15][1]
Imprastraktura ng pagsasanay
Ang pagsasanay ng mga modelo ng Nova ay isinagawa sa mga distributed cluster ng AWS Elastic Kubernetes Service (EKS) gamit ang sariling AI accelerator ng Amazon na Trainium (mga instance ng TRN1), gayundin ang mga graphics processing unit ng NVIDIA A100 at H100.[13][1]
Para mabawasan ang mga gastos sa pagkalkula sa panahon ng pagsasanay, mga espesyal na paraan ng optimization ay binuo at inilapat:
- Super‑Selective Activation Checkpointing (SSC) — isang paraan ng pag-iimbak ng mga activation na, ayon sa teknikal na ulat, ay nagpapababa ng konsumo ng memorya ng mga graphics processor ng humigit-kumulang 50% na may kaunting overhead sa muling pagkalkula (recomputation).[13]
- In‑CPU‑Memory Checkpointing — pag-cache ng mga intermediate na timbang (checkpoints) sa RAM ng mga central processor (CPU) bago ang kanilang asynchronous na pag-upload sa ulap na imbakan ng Amazon S3. Ayon sa Amazon, ang diskarteng ito ay nagpapahintulot na bawasan ang oras ng pag-save ng estado ng modelo sa 0.1 segundo sa mga instance na may TRN1.[16][13]
Pipeline ng pagsasanay at alignment
Ang proseso ng pagsasanay ng mga modelo ng Nova ay binubuo ng ilang yugto na katangian ng mga modernong LLM:[1][17]
Paunang pagsasanay (Pre‑training)
Malawakang pagsasanay sa malaking multilinggwal at multimodal na korpus ng datos na sumasaklaw sa mahigit 200 wika. Ang eksaktong komposisyon ng datos sa pagsasanay (dami, ratio ng mga wika, mga tiyak na pinagkukunan) ay hindi ibinibigay sa mga pampublikong materyales.[1]
Supervised Fine‑Tuning (SFT)
Karagdagang pagsasanay sa mga may label na halimbawa ng mga pares na "instruksyon — tugon", na nagdadala sa modelo sa pagsunod sa mga instruksyon ng gumagamit.[1]
Alignment sa pamamagitan ng reinforcement learning
Para sa pag-align ng gawi ng modelo sa mga kagustuhan ng tao, dalawang pangunahing algorithm ang ginagamit:
Proximal Policy Optimization (PPO) — isang algorithm ng reinforcement learning batay sa feedback ng mga tao (Reinforcement Learning from Human Feedback, RLHF), na gumagamit ng hiwalay na Reward Model.[18][1]
Direct Preference Optimization (DPO) — isang alternatibong paraan ng alignment na hindi nangangailangan ng malinaw na reward model. Ang target na function ng DPO ay may form:[19]
kung saan:
- — ang parametrized na patakaran (modelong sinasamahan ng pagsasanay);
- — ang pangunahing (frozen) reference na modelo;
- — ang input na prompt (konteksto);
- at — ang mas gustong (winner) at tinanggihang (loser) mga tugon ayon sa pagkakasunod;
- — ang logistic (sigmoid) na function;
- — isang hyperparameter na kinokontrol ang lakas ng parusa para sa paglihis mula sa pangunahing modelo (katulad ng KL‑divergence penalty).[19][1]
Komposisyon ng pamilya ng mga modelo
Ang pamilya ng mga modelo ay nahahati sa mga tier ayon sa balanse sa pagitan ng pagganap, gastos at latency.[2][20]
Mga modelo ng pag-unawa ng unang henerasyon
| Parameter | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Mga input na modalidad | Teksto | Teksto, larawan, video | Teksto, larawan, video | Teksto, larawan, video |
| Output na modalidad | Teksto | Teksto | Teksto | Teksto |
| Context window | 128 libong token | 300 libong token | 300 libong token | 1 milyong token |
| Max na output na token | 10 libo | 10 libo | 10 libo | 10 libo |
| Suportadong mga wika | 200+ | 200+ | 200+ | 200+ |
| Fine‑tuning | Oo | Oo | Oo | Hindi |
| Petsa ng release | Disyembre 2024 | Disyembre 2024 | Disyembre 2024 | Abril 2025 |
| Pangunahing layunin | Pinakamababang latency at gastos para sa mga gawaing teksto | Pangunahing multimodal na pagsusuri | Pinakamainam na balanse para sa mga kumplikadong lohikal at agentic na gawain | Pinakamataas na katumpakan, modelo-guro para sa distillation |
Pinagkukunan: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Mga na-optimize na wika (15): Ingles, Aleman, Espanyol, Pranses, Italyano, Hapon, Koreano, Arabe, Intsik (simplified), Ruso, Hindi, Portuges, Olandes, Turko, Hebreo.[2]
Ang Nova Premier ay inilaan para sa mga gawaing nangangailangan ng malalim na pag-unawa sa konteksto, multi-step na pagpaplano at pagtatrabaho sa malalaking dami ng datos: mga code base, mga dokumento na may higit sa 400 pahina, mga video na may tagal na hanggang 90 minuto.[6]
Mga modelo ng ikalawang henerasyon (Nova 2)
Nova 2 Lite at Nova 2 Pro ay inilabas noong Nobyembre–Disyembre 2025. Parehong sumusuporta sa extended thinking — isang mekanismo kung saan ang modelo ay nagsasagawa ng multi-step na pangangatuwiran bago bumuo ng tugon. Ang lalim ng pangangatuwiran ay kinokontrol ng parameter na reasoning_effort na may mga antas na low, medium at high. Ang context window ay pinalawak sa 1 milyong token. Ang mga native na kasangkapan ay built-in: web grounding at code interpreter.[9][8]
Nova 2 Omni — isang native multimodal na modelo na kayang tumanggap ng teksto, larawan, video at audio sa parehong oras at makabuo ng teksto at mga larawan. Ang context window — 1 milyong token.[8][11]
Nova 2 Sonic — isang speech na modelo ng susunod na henerasyon. Sumusuporta sa 6 na wika: Ingles (amerikanong at britanikong baryante), Espanyol, Aleman, Pranses, Italyano. Nagpapakilala ng asynchronous tool calling — ang modelo ay nagpapatuloy ng pagpoproseso ng bagong input habang ang mga panlabas na kasangkapan ay naisasagawa sa background.[10]
| Parameter | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Mga input na modalidad | Teksto, larawan, video | Teksto, larawan, video | Teksto, larawan, video, audio | Audio (pagsasalita) |
| Output na modalidad | Teksto | Teksto | Teksto, larawan | Audio (pagsasalita) |
| Context window | 1 milyong token | 1 milyong token | 1 milyong token | 300 libong token |
| Extended thinking | Oo | Oo | Oo | — |
| Mga native na kasangkapan | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Petsa ng release | Nobyembre–Disyembre 2025 | Nobyembre–Disyembre 2025 | Disyembre 2025 | Disyembre 2025 |
Pinagkukunan: AWS Blog; Amazon Science.[9][8][11]
Mga generative na modelo
Nova Canvas — isang modelo ng paglikha ng larawan. Sumusuporta sa text at graphic na input (PNG, JPEG). Ang output na resolusyon — hanggang 4.19 milyong pixel (halimbawa, 2048×2048 o 2816×1536 pixel). Ang maximum na haba ng prompt — 1024 na karakter. Sinusuportahan ang mga operasyon ng inpainting (pagpapalit ng lugar ng larawan) at outpainting (pagpapalawak ng larawan lampas sa mga hangganan nito).[2][4]
Nova Reel — isang modelo ng paglikha ng video. Output na resolusyon: 1280×720 sa 24 frame bawat segundo. Ang tagal ng nabuong video — hanggang 6 na segundo. Sinusuportahan ang kontrol sa galaw ng camera (camera control). Ang access ay isinasagawa sa pamamagitan ng asynchronous API (Asynchronous Invoke Model API).[2][4]
Mga speech na modelo
Nova Sonic (Abril 2025) — isang speech na modelo na may bidirectional stream API. Sumusuporta sa function calling at grounding sa corporate na datos sa pamamagitan ng Retrieval‑Augmented Generation (RAG). Ang watermarking function ay built-in bilang default. Ang maximum na tagal ng koneksyon — 8 minuto na may kakayahang ipagpatuloy; maximum na 20 sabay-sabay na koneksyon bawat kliyente (default na halaga).[7][15][2]
Nova 2 Sonic (Disyembre 2025) — susunod na henerasyon ng speech na modelo na may pinahusay na pagkilala ng maikling pahayag, telepono na audio (8 kHz) at mga accent.[10]
Pagtatasa at mga benchmark
Ang pagtatasa ng mga modelo ng Nova ay isinagawa gamit ang mga automated na benchmark, kabilang ang diskarte na "LLM‑as‑a‑judge" (paggamit ng language model bilang tagapagsuri). Ayon sa pananaliksik ng HKU SPACE AI Hub, ang metric na Arena‑Hard‑Auto ay nagpapakita ng 98.6% na ugnayan sa mga marka ng mga eksperto.[21][22]
Mga benchmark ng unang henerasyon
Mga datos mula sa teknikal na ulat na arXiv:2506.12103 (mga kondisyon: mga resulta ng mga developer ng mga katunggaling modelo, na nailathala sa oras ng paghahanda ng ulat):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Pinagkukunan: arXiv:2506.12103, talahanayan 2.1.1.[1]
Ang mga resulta ay nagpapakita ng hierarchy ng pagganap sa loob ng pamilya (Premier > Pro > Lite > Micro). Ang agwat ay pinaka-kapansin-pansin sa mga kategorya ng matematika (Math) at pangangatuwiran (Reasoning); sa mga gawaing roleplay (Roleplay) at pagkuha ng impormasyon (Extraction), ang mga mas mababang modelo ay nagpapakita ng mga resulta na malapit sa mga mas mataas.[22]
Mga benchmark ng ikalawang henerasyon (Nova 2)
Mga datos mula sa teknikal na ulat ng Amazon Nova 2 (mga kondisyon: internal measurements, 0‑shot / CoT kung saan tinukoy):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Pinagkukunan: Amazon Nova 2 Technical Report, talahanayan 1.[11]
Mga agentic na benchmark (Nova 2 Pro): SWE‑Bench Verified — 70,0%; τ²‑bench Verified Telecom — 92,7%.[11]
Mga multimodal na benchmark (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]
Sa pagtatasa sa mga gawaing teknikal na suporta, ang Nova 2 Lite ay nakakuha ng 9.63 ± 0.27 sa sampung puntong sukat sa metric na "Problem Identification" (Pagkilala ng Problema), na malayo ang lamang sa Nova Lite ng unang henerasyon (8.57 ± 0.46).[23]
Paunawa. Sa paghahambing ng mga resulta sa mga katunggaling modelo, kinakailangang isaalang-alang na ang mga kondisyon ng prompting, mga bersyon ng modelo at mga petsa ng pagkuha ng metric ay maaaring magkaiba. Ang mga benchmark ng una at ikalawang henerasyon ay nakuha mula sa mga self-report ng Amazon; ang mga independent na pag-verify (FloTorch, Artificial Analysis) sa pangkalahatan ay nagpapatunay ng idineklara na ratio ng presyo/pagganap, ngunit sa ilang partikular na metric ng katumpakan ay nagtatala ng pagkaatras kumpara sa mga nangungunang katunggali.[22]
Bilis ng output
Ayon sa mga internal na sukat ng Amazon (internal, sa pamamagitan ng Bedrock API):[1][11]
| Modelo | Bilis ng output (token/segundo) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Gastos sa paggamit
Lahat ng modelo ay available sa pamamagitan ng Amazon Bedrock sa modelong bayad bawat bilang ng mga naprosesong token (datos para sa Marso 2026):[2]
| Modelo | Mga input na token (USD / 1M) | Mga output na token (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
Para sa paghahambing: ang Anthropic Claude 3.5 Sonnet sa oras ng release ng Nova ay sinisingil ng $6.00 / 1M input at $30.00 / 1M output na token.[22]
Customization at fine‑tuning
Ang imprastraktura ng AWS ay nagbibigay ng ilang paraan ng pag-angkop ng mga base na modelo ng Nova sa mga highly specialized na domain. Ang pangunahing kasangkapan para dito sa ikalawang henerasyon ay ang kapaligiran na Amazon Nova Forge.[8][17]
Continued Pre‑Training (CPT) at Mid‑Training
Ang Nova Forge ay nagbubukas ng access sa mga intermediate na checkpoint ng pagsasanay ng mga modelo (halimbawa, pretraining‑text‑RD at pretraining‑text‑CE). Nagpapahintulot ito na ipagpatuloy ang self-supervised learning sa mga massif ng corporate na datos na may maingat na pagpili ng learning rate upang maiwasan ang catastrophic forgetting.[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Pag-update lamang ng maliit na subset ng mga timbang ng modelo sa pamamagitan ng mga low-rank adapter — Low‑Rank Adaptation (LoRA)[26]. Ang diskarteng ito ay makabuluhang nagpapababa ng mga kinakailangan sa mga mapagkukunan ng pagkalkula kumpara sa buong fine-tuning. Sinusuportahan ang multimodal na fine-tuning para sa Nova Lite at Pro.[17]
Reinforcement Fine‑Tuning (RFT)
Ang mga custom na modelo ay maaaring karagdagang i-fine-tune sa pamamagitan ng mga paraan ng reinforcement batay sa mga industry-specific na reward metric, kabilang ang paggamit ng isa pang LLM bilang LLM‑as‑a‑judge.[27]
Distillation ng mga modelo (Model Distillation)
Ang function na Model Distillation ay nagpapahintulot na gamitin ang Nova Premier o Nova Pro bilang teacher model para sa pagsasanay ng mas maliliit na student model — Nova Lite at Nova Micro. Nagpapababa ito ng mga gastos sa pagkalkula sa inference habang pinapanatili ang malaking bahagi ng kalidad ng malaking modelo.[2][6]
Paggamit at integrasyon
Ang mga modelo ng Nova ay isinama sa mga serbisyo ng pagkompyut ng Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Mga pangunahing dokumentadong sitwasyon ng paggamit:[2][1]
Mga agentic na proseso ng trabaho (Agentic Workflows)
Multi-step na pagpapatupad ng mga gawain gamit ang Bedrock Agents at pagtawag sa mga panlabas na kasangkapan (function calling). Gamit ang arkitekturang pattern na ReAct (Reasoning and Acting) kasabay ng mga framework tulad ng LangGraph, ang mga modelo ng Nova ay nag-uugnay ng analytics ng mga database, bumubuo ng mga SQL query mula sa natural na wika at namamahala ng mga multi-component na proseso. Ang Nova Act ay nagbibigay ng automation ng mga browser UI workflow na may idineklara na reliability na 90% sa mga maagang gawain ng mga gumagamit.[28][8]
Retrieval‑Augmented Generation (RAG)
Integrasyon sa Bedrock Knowledge Bases para sa grounding ng mga sagot sa corporate na datos. Ang mga modelo ng Nova 2 ay sumusuporta sa native web grounding bilang built-in na kasangkapan.[1][9]
Pagpoproseso ng mga dokumento
Mga sinusuportahang format ng input na dokumento: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (maliban sa Nova Micro, na tumatanggap lamang ng text input). Ang Nova Premier ay kayang iproseso ang mga video na may tagal na hanggang 90 minuto sa loob ng isang kahilingan.[2][6]
Paglikha at pag-debug ng code
Mga sinusuportahang wika ng programa: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Mga speech na interface
Ang Nova Sonic at Nova 2 Sonic ay ginagamit para sa pagbuo ng mga voice agent na may suporta sa real time, na isinama sa Amazon Connect.[10][7]
Pagtatasa ng mga modelo (LLM‑as‑a‑judge)
Ang Nova ay ginagamit bilang judge na modelo sa pagtatasa ng mga output ng iba pang mga generative na modelo sa platform na Amazon SageMaker.[29]
Mga limitasyon at bukas na problema
- Pagiging sarado ng arkitektura. Hindi inihahayag ng Amazon ang bilang ng mga parameter, detalyadong mga desisyon sa arkitektura at komposisyon ng datos sa pagsasanay, na malaking limitasyon sa independyenteng reproducibility ng mga resulta. Ang mga timbang ng mga modelo ng Nova ay hindi ibinibigay para sa pag-download o deployment sa labas ng imprastraktura ng AWS (imposible ang on‑premise na deployment).[1][2]
- Limitasyon ng output. Ang maximum na bilang ng output na token para sa lahat ng modelo ng pag-unawa ay limitado sa 10 libong token, na maaaring hindi sapat para sa mga gawaing paglikha ng mahahabang dokumento.[2]
- Mga limitasyon ng RFT. Ang Reinforcement Fine‑Tuning ay hindi sumusuporta sa mga multi-turn na diyalogo at multimodal na datos; ang inirekomendang bahagi ng mga positibong halimbawa sa dataset — hindi bababa sa 5%.[27]
- Mga limitasyon ng Nova Sonic. Ang maximum na tagal ng koneksyon — 8 minuto; maximum na 20 sabay-sabay na koneksyon bawat kliyente bilang default.[2]
- Rehiyonal na availability. Ang Nova Premier ay available lamang sa isang rehiyon (US East N. Virginia) nang walang suporta sa cross-regional inference; ang mga modelo ng Nova 2 ay may limitadong listahan ng mga rehiyon ng deployment.[2]
- Sensitivity ng mga metric. Ang mga marka sa mga synthetic na benchmark ay hindi laging nakikipag-ugnayan sa kalidad ng trabaho sa mga kondisyon ng produksyon (production), kung saan kritikal ang mahigpit na pagsunod sa mga corporate na patakaran at ang kawalan ng mga hallucination sa mga multi-step na output.[22][23]
- Mga hallucination. Ang mga modelo ay nagpapakita ng mga limitasyon na katangian ng mga LLM: posible ang mga factual na pagkakamali sa mga nabuong tugon. Para mabawasan ang mga panganib, inirerekomendang gamitin ang Bedrock Guardrails at RAG.[1]
- Komparatibong objectivity ng mga benchmark. Naghahambing ang Amazon sa mga katunggaling modelo batay sa mga datos na nailathala ng mismong mga developer, na hindi laging nagbibigay ng iisang kontroladong experimental na batayan.[22]
Mga etikal at regulatoryo na aspeto
Ang AWS ay nagdedeklara ng pagsunod sa mga prinsipyo ng responsableng AI (Responsible AI) sa pagbuo ng mga modelo ng Nova. Ang mga tiyak na hakbang sa kaligtasan ay kinabibilangan ng:[20][15]
- Built-in na content moderation.
- Mga watermark (watermarking) para sa mga audio output ng Nova Sonic.
- Pagtatasa sa mga kategorya ng panganib: kaligtasan (safety), privacy (privacy), katotohanan (veracity), transparency (transparency), gayundin ang pagpapalaganap ng CBRN (kemikal, biolohikal, radiological at nuklear) na mga sandata at mga offensive na cyber operation.
- Integrasyon sa Amazon Bedrock Guardrails para sa pag-filter ng mga input at output na datos.
- Pagtatasa ng modelong Nova Premier sa pagsunod sa Amazon Frontier Model Safety Framework.
- Red teaming — internal at external na pagsubok sa katatagan laban sa mga atake (ayon sa teknikal na ulat, 307 na teknik).
- Pagtatasa ng content moderation sa metric na F1: 85.84 sa benchmark na Aegis (ayon sa teknikal na ulat).[1]
Ang mga AI Service Card para sa Nova Micro, Lite, Pro, Premier at Sonic ay nailathala sa docs.aws.amazon.com bilang dokumentasyon para sa responsableng paggamit.[20][15]
Mga pananaw at direksyon ng pananaliksik
Ang pamilyang Nova 2 ay nagtatanda ng paglipat patungo sa mga modelo na may pinapalawak na kakayahan ng pangangatuwiran (extended thinking / reasoning), na maihahambing sa konsepto sa chain-of-thought (Chain‑of‑Thought, CoT) at mga katulad na mekanismo sa iba pang pamilya ng modelo. Ang built-in na web search at code interpreter bilang mga native na kasangkapan (at hindi mga third-party na plugin) ay kumakatawan sa arkitekturang pagbabago patungo sa mga agentic na sistema.[9][8]
Mga direksyon ng karagdagang pagpapaunlad na tinukoy sa mga pampublikong materyales ng Amazon:
- Pagpapalawak ng multimodality (ang modelong Omni bilang unified na "lahat-sa-lahat" na arkitektura).
- Hybrid reasoning na may adaptive na lalim depende sa kumplikasyon ng gawain.
- Bukas na pagsasanay sa datos ng gumagamit (Nova Forge) sa lahat ng yugto ng pre-training.
- Distillation para sa mga edge na device.
- Pagpapalawak ng safety toolkit.[8][11]
Ang paksa ng Amazon Nova AI Challenge, na isinasagawa ng AWS sa mga koponan ng unibersidad, ay sumasaklaw sa mga direksyon ng automated na adversarial testing, safety alignment at mga multi-turn jailbreak, na nagpapakita ng mga pamumuhunan sa pagiging maaasahan ng pamilya ng modelo.[8]
Tingnan din
- Transformer (arkitektura)
- Reinforcement Learning from Human Feedback (RLHF)
Panitikan
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, Pebrero 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Mga sanggunian
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Opisyal na dokumentasyon ng Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards para sa Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card para sa Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Anunsyo ng Amazon Nova (Disyembre 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Anunsyo ng Amazon Nova 2 (Disyembre 2025)
Mga tala
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/