Nova (Amazon) (HU)
Amazon Nova — alapmodellek (Foundation Models, FM) és nagy nyelvi modellek (Large Language Model, LLM) családja, amelyet az Amazon Artificial General Intelligence (AAG Intelligence) részleg fejlesztett ki, és amely a teljesen felügyelt Amazon Bedrock szolgáltatáson keresztül érhető el. A család magában foglalja a szövegértési és szöveggenerálási, képfeldolgozási, videó- és dokumentumfeldolgozási, valamint beszédszintézis és -felismerési modelleket. Az Amazon Nova az előző generációs Amazon Titan modellek utódjának tekinthető, és integrálva van az Amazon Web Services (AWS) felhőalapú ökoszisztémájába.[1][2][3]
A fejlesztés története és kronológiája
A Nova bevezetése előtt az Amazon Bedrock platform harmadik féltől származó modellekhez biztosított hozzáférést: Anthropic Claude, Meta Llama, Mistral és más modellekhez. Az Amazon Nova lett az AWS első saját fejlesztésű alapmodelljének családja, amelyet felhőinfrastruktúrában való kereskedelmi alkalmazásra szántak.[3]
Első generáció (2024–2025)
Az Amazon Nova első generációját 2024. december 3-án mutatták be hivatalosan az AWS re:Invent 2024 konferencián. A kezdeti kiadás három értelmező modellt (understanding models) tartalmazott — a csak szöveges Nova Micro-t, valamint a multimodális Nova Lite-ot és Nova Pro-t —, továbbá a Nova Canvas generatív képgeneráló és a Nova Reel videógeneráló modelleket.[4][3][5]
2025 áprilisában a kínálat kiegészült a Nova Premier csúcsmodellel — a család legerősebb modelljével, 1 millió token kontextusablakkal, amelyet összetett következtetési feladatokra és modelldesztillációra (distillation, tudásátadás egy nagyobb modellből egy kisebb felé) szántak.[6] Szintén 2025 áprilisában mutatták be a Nova Sonic nevű speech-to-speech osztályú hangmodellt, amely támogatja a valós idejű párbeszédeket.[7]
Második generáció — Nova 2 (2025–2026)
2025 novemberében–decemberében az AWS re:Invent 2025 konferencián bejelentették a második generációt — az Amazon Nova 2-t. A kínálatba kerültek a dinamikus következtetést (dynamic reasoning) és bővített kontextusfeldolgozást támogató frissített Nova 2 Lite és Nova 2 Pro modellek, a natív multimodális Nova 2 Omni modell (szöveg, kép, videó és audió egyidejű feldolgozása és generálása), valamint a Nova 2 Sonic — a következő generációs hangmodell. Egyidejűleg bemutatásra került a Nova Forge (testreszabott modelledzési környezet) és a Nova Act (ügynökalapú workflow-keretrendszer) is.[8][9][10]
2026 februárjában megjelent az Amazon Nova 2 hivatalos műszaki jelentése.[11]
Összesített kronológia
| Dátum | Esemény |
|---|---|
| 2024. december | Amazon Nova bejelentése az AWS re:Invent 2024-en: Nova Micro, Lite, Pro, Canvas, Reel |
| 2025. április | Nova Premier (1M token kontextus) és Nova Sonic (speech-to-speech) megjelenése |
| 2025. június | Az első generációs műszaki jelentés közzététele (arXiv:2506.12103) |
| 2025. november–december | Nova 2 bejelentése az AWS re:Invent 2025-ön: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| 2026. február | Amazon Nova 2 műszaki jelentésének közzététele |
Elméleti alapok és architektúra
Az understanding-modellek alaparchitektúrája
Az arXiv:2506.12103 műszaki jelentés szerint az értelmező modellek (Nova Micro, Lite, Pro, Premier) a Vaswani et al. által leírt Transformer architektúrán alapulnak.[12] A többfejű önfigyelési mechanizmus (Multi-Head Self-Attention) alapképlete:
ahol , , rendre a lekérdezések (queries), kulcsok (keys) és értékek (values) mátrixai, pedig a kulcsok dimenziója.[12][1]
Az architektúra pontos paraméterei (rétegek száma, rejtett állapot mérete, figyelmifejek száma, paraméterek teljes száma) a nyilvánosan elérhető forrásokban 2026 márciusának állása szerint nem kerültek közzétételre. Ez a megközelítés jellemző a zárt kereskedelmi modellekre.[1]
A Nova Lite és Nova Pro multimodális feldolgozása szöveges, vizuális és videó-tokenek egyetlen sorozatba való összevonásával valósul meg, amelyet egy egységes nyelvi modell kap bemenetként. A vizuális enkóderek (vision encoders) a képeket és videókereteket szöveges reprezentációval kompatibilis tokensorozatokká alakítják.[1][13]
A generatív modellek architektúrája
A Nova Canvas (képek) és Nova Reel (videó) generatív modellek látens diffúziós modell (Latent Diffusion Models, LDM) architektúrát[14] alkalmaznak variációs automatikus enkóderekkel (Variational AutoEncoder, VAE) kombinálva a látens térben végzett számítások céljából. A diffúziós folyamatot a következő zajosítási egyenlet írja le:
ahol az eredeti kép a látens térben, annak zajosított változata a lépésben, a zajütemezés kumulatív paramétere, standard Gauss-zaj. A szöveges enkóder (text encoder) biztosítja a kondicionálást — a generálás feltételezését a szöveges prompton.[13][14]
A hangmodellek architektúrája
A Nova Sonic a szöveges modellektől eltérő architektúrát alkalmaz: egy speciális hangenkódert (speech encoder), hangdekódert (speech renderer) és az alap multimodális nyelvi modellt egyetlen végponttól végpontig tartó folyamatba (end-to-end pipeline) vonja össze. Ez lehetővé teszi a hangbemenet feldolgozását és hangkimenet generálását közbülső szöveggé alakítás nélkül (bár szöveges reprezentációt belső célokra minőségbiztosítás céljából alkalmaznak).[15][1]
Az edzési infrastruktúra
A Nova modellek edzése AWS Elastic Kubernetes Service (EKS) elosztott klaszterein zajlott, Amazon Trainium saját MI-gyorsítók (TRN1 példányok), valamint NVIDIA A100 és H100 grafikus processzorok alkalmazásával.[13][1]
Az edzési számítási költségek csökkentése érdekében speciális optimalizálási módszereket fejlesztettek ki és alkalmaztak:
- Super-Selective Activation Checkpointing (SSC) — aktiválás-mentési módszer, amely a műszaki jelentés adatai szerint a grafikus processzorok memóriafelhasználását körülbelül 50%-kal csökkenti minimális újraszámítási (recomputation) többletköltség mellett.[13]
- In-CPU-Memory Checkpointing — közbenső súlyok (checkpoints) gyorsítótárazása a központi processzorok (CPU) operatív memóriájában, mielőtt azokat aszinkron módon töltik fel az Amazon S3 felhőalapú tárolóba. Az Amazon adatai szerint ez a megközelítés a TRN1 példányokon 0,1 másodpercre csökkentette a modellállapot mentési idejét.[16][13]
Az edzési folyamat és az igazítás
A Nova modellek edzési folyamata több, a modern LLM-ekre jellemző lépésből áll:[1][17]
Előedzés (Pre-training)
Nagyméretű, több mint 200 nyelvet magában foglaló többnyelvű és multimodális adatkorpuszon végzett edzés. Az edzési adatok pontos összetétele (mennyiség, nyelvek aránya, konkrét források) a nyilvános anyagokban nem szerepel.[1]
Felügyelt finomhangolás (Supervised Fine-Tuning, SFT)
Finomhangolás jelölt „utasítás–válasz" párpéldákon, amely a modellt a felhasználói utasítások követésére vezeti.[1]
Igazítás megerősítéses tanulással
A modell viselkedésének az emberi preferenciákhoz való igazítására két fő algoritmust alkalmaznak:
Proximal Policy Optimization (PPO) — emberi visszajelzésen alapuló megerősítéses tanulási algoritmus (Reinforcement Learning from Human Feedback, RLHF), amely külön jutalommodellt (Reward Model) alkalmaz.[18][1]
Direct Preference Optimization (DPO) — alternatív igazítási módszer, amely nem igényel explicit jutalommodellt. A DPO célfüggvénye a következő:[19]
where:
- — a parametrizált stratégia (az edzendő modell);
- — az alap (befagyasztott) referencia modell;
- — a bemeneti prompt (kontextus);
- és — rendre a preferált (győztes) és az elutasított (vesztes) válaszok;
- — logisztikai (sigmoid) függvény;
- — hiperparaméter, amely az alap modelltől való eltérés büntetésének erősségét szabályozza (analóg a Kullback–Leibler-divergencia büntetéssel, KL-divergence penalty).[19][1]
A modellek családjának összetétele
A modellek családja szintekre (tiers) van osztva a teljesítmény, a költség és a késleltetés (latency) közötti egyensúly alapján.[2][20]
Az első generációs értelmező modellek
| Paraméter | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Bemeneti modalitások | Szöveg | Szöveg, kép, videó | Szöveg, kép, videó | Szöveg, kép, videó |
| Kimeneti modalitás | Szöveg | Szöveg | Szöveg | Szöveg |
| Kontextusablak | 128 ezer token | 300 ezer token | 300 ezer token | 1 millió token |
| Max. kimeneti tokenek | 10 ezer | 10 ezer | 10 ezer | 10 ezer |
| Támogatott nyelvek | 200+ | 200+ | 200+ | 200+ |
| Finomhangolás (fine-tuning) | Igen | Igen | Igen | Nem |
| Megjelenés dátuma | 2024. december | 2024. december | 2024. december | 2025. április |
| Fő rendeltetés | Minimális késleltetés és költség szöveges feladatokhoz | Alapszintű multimodális elemzés | Optimális egyensúly összetett logikai és ügynöki feladatokhoz | Maximális pontosság, tanármodell desztillációhoz |
Forrás: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Optimalizált nyelvek (15): angol, német, spanyol, francia, olasz, japán, koreai, arab, kínai (egyszerűsített), orosz, hindi, portugál, holland, török, héber.[2]
A Nova Premier olyan feladatokhoz készült, amelyek mély kontextusmegértést, többlépéses tervezést és nagy adatmennyiséggel való munkát igényelnek: kódbázisok, 400 oldalnál hosszabb dokumentumok, akár 90 perces videók feldolgozása egyetlen lekérdezés keretében.[6]
A második generációs modellek (Nova 2)
Nova 2 Lite és Nova 2 Pro 2025 novemberében–decemberében jelent meg. Mindkettő támogatja a kiterjesztett gondolkodást (extended thinking) — egy olyan mechanizmust, amelynek során a modell többlépéses következtetést végez a válasz generálása előtt. A következtetés mélységét a reasoning_effort paraméter szabályozza low, medium és high szintekkel. A kontextusablak 1 millió tokenre bővült. Beépített natív eszközök: webes keresés megerősítéssel (web grounding) és kódértelmező (code interpreter).[9][8]
Nova 2 Omni — natív multimodális modell, amely egyszerre képes szöveget, képeket, videót és audiót fogadni bemenetként, és szöveget és képeket generálni. Kontextusablak — 1 millió token.[8][11]
Nova 2 Sonic — következő generációs hangmodell. 6 nyelvet támogat: angol (amerikai és brit változat), spanyol, német, francia, olasz. Bevezeti az aszinkron eszközhívást (asynchronous tool calling) — a modell folytatja az új bemenet feldolgozását, miközben a külső eszközök a háttérben futnak.[10]
| Paraméter | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Bemeneti modalitások | Szöveg, kép, videó | Szöveg, kép, videó | Szöveg, kép, videó, audió | Audió (hang) |
| Kimeneti modalitás | Szöveg | Szöveg | Szöveg, kép | Audió (hang) |
| Kontextusablak | 1 millió token | 1 millió token | 1 millió token | 300 ezer token |
| Extended thinking | Igen | Igen | Igen | — |
| Natív eszközök | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Megjelenés dátuma | 2025. november–december | 2025. november–december | 2025. december | 2025. december |
Forrás: AWS Blog; Amazon Science.[9][8][11]
Generatív modellek
Nova Canvas — képgeneráló modell. Szöveges és grafikus bemenetet támogat (PNG, JPEG). Kimeneti felbontás — legfeljebb 4,19 millió pixel (például 2048×2048 vagy 2816×1536 pixel). A prompt maximális hossza — 1024 karakter. Támogatott műveletek: inpainting (képterület cseréje) és outpainting (kép kiterjesztése határain túl).[2][4]
Nova Reel — videógeneráló modell. Kimeneti felbontás: 1280×720, 24 képkocka/másodperc. A generált videó hossza — legfeljebb 6 másodperc. Támogatja a kameramozgás vezérlését (camera control). A hozzáférés aszinkron API-n (Asynchronous Invoke Model API) keresztül történik.[2][4]
Hangmodellek
Nova Sonic (2025. április) — hangmodell kétirányú folyamatos API-val (bidirectional stream API). Támogatja a funkciohívásokat (function calling) és a vállalati adatokon alapuló megalapozást (grounding) Retrieval-Augmented Generation (RAG, külső tudás bevonásával végzett generálás) révén. A vízjel (watermarking) funkció alapértelmezés szerint be van kapcsolva. A kapcsolat maximális időtartama — 8 perc, megújítási lehetőséggel; legfeljebb 20 egyidejű kapcsolat ügyfelenként (alapértelmezett érték).[7][15][2]
Nova 2 Sonic (2025. december) — a hangmodell következő generációja, javított rövid megnyilatkozások, telefonos audió (8 kHz) és akcentusok felismerésével.[10]
Értékelés és benchmarkok
A Nova modellek értékelése automatizált benchmarkok segítségével történt, beleértve az „LLM-as-a-judge" (nyelvi modell mint értékelő) megközelítést. A HKU SPACE AI Hub kutatása szerint az Arena-Hard-Auto metrika 98,6%-os korrelációt mutat a szakértői értékelésekkel.[21][22]
Az első generáció benchmarkjai
Adatok az arXiv:2506.12103 műszaki jelentésből (feltételek: a versengő modellek fejlesztői által a jelentés elkészítésének idején közzétett eredmények):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT-4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5-shot) | — | 80,5 | 77,6 | — | — |
| MATH (4-shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT-Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT-Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Forrás: arXiv:2506.12103, 2.1.1. táblázat.[1]
Az eredmények a teljesítményhierarchiát mutatják a családon belül (Premier > Pro > Lite > Micro). A különbség leginkább a matematika (Math) és a következtetés (Reasoning) kategóriákban szembetűnő; a szerepjátékos interakció (Roleplay) és az információkinyerés (Extraction) feladatokban a kisebb modellek az idősebb modellekhez közeli eredményeket produkálnak.[22]
A második generáció benchmarkjai (Nova 2)
Adatok az Amazon Nova 2 műszaki jelentéséből (feltételek: internal measurements, 0-shot / CoT ahol jelezve):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT-5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU-Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA-Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Forrás: Amazon Nova 2 Technical Report, 1. táblázat.[11]
Ügynöki benchmarkok (Nova 2 Pro): SWE-Bench Verified — 70,0%; τ²-bench Verified Telecom — 92,7%.[11]
Multimodális benchmarkok (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]
Műszaki támogatási feladatokban végzett értékelés során a Nova 2 Lite 9,63 ± 0,27 pontot ért el a tízes skálán a „Problémaazonosítás" (Problem Identification) metrikában, jelentősen megelőzve az első generációs Nova Lite-ot (8,57 ± 0,46).[23]
Megjegyzés. A versengő modellekkel való összehasonlítás során figyelembe kell venni, hogy a promptolási feltételek, a modellek verziói és a metrikák mérési dátuma eltérhet. Az első és második generáció benchmarkjai az Amazon önjelentéseiből származnak; a független ellenőrzések (FloTorch, Artificial Analysis) általánosságban megerősítik az ár-teljesítmény arányt, de egyes pontossági metrikákon lemaradást rögzítenek a vezető versenytársakhoz képest.[22]
Következtetési sebesség
Az Amazon belső mérései alapján (internal, Bedrock API-n keresztül):[1][11]
| Modell | Következtetési sebesség (token/s) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Használati költségek
Minden modell elérhető az Amazon Bedrockon keresztül, feldolgozott tokenek száma szerint fizetős modellben (adatok 2026 márciusának állása szerint):[2]
| Modell | Bemeneti tokenek (USD / 1M) | Kimeneti tokenek (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
Összehasonlításképpen: az Anthropic Claude 3.5 Sonnet a Nova megjelenésekor $6,00 / 1M bemeneti és $30,00 / 1M kimeneti token tarifával volt elérhető.[22]
Testreszabás és finomhangolás
Az AWS infrastruktúra számos módszert kínál az alap Nova modellek szűk szakterületekre való adaptálásához. Ennek fő eszköze a második generációban az Amazon Nova Forge környezet.[8][17]
Continued Pre-Training (CPT) és Mid-Training
A Nova Forge hozzáférést biztosít a modellek edzési közbenső ellenőrzési pontjaihoz (például pretraining‑text‑RD és pretraining‑text‑CE). Ez lehetővé teszi az önfelügyelt tanulás (self-supervised learning) folytatását vállalati adathalmazokon, a tanulási sebesség (learning rate) gondos hangolásával a katasztrofális felejtés (catastrophic forgetting) megelőzése érdekében.[24][25]
Parameter-Efficient Fine-Tuning (PEFT)
Csak a modell súlyainak kis részhalmazát frissíti alacsony rangú adaptereken (Low-Rank Adaptation, LoRA)[26] keresztül. Ez a megközelítés jelentősen csökkenti a számítási erőforrás-igényt a teljes finomhangoláshoz (full fine-tuning) képest. A Nova Lite és Pro esetén multimodális fine-tuning is támogatott.[17]
Reinforcement Fine-Tuning (RFT)
Az egyedi modellek tovább finomhangolhatók megerősítéses módszerekkel, iparág-specifikus jutalommetrikák alapján, beleértve egy másik LLM bírói modellként (LLM-as-a-judge) való alkalmazását.[27]
Modell desztilláció (Model Distillation)
A Model Distillation funkció lehetővé teszi a Nova Premier vagy Nova Pro tanármodellként (teacher model) való alkalmazását kisebb tanulómodellek (student models) — Nova Lite és Nova Micro — edzéséhez. Ez csökkenti a következtetés (inferencia) számítási költségeit, miközben megőrzi a nagyobb modell minőségének jelentős részét.[2][6]
Alkalmazási területek és integráció
A Nova modellek integrálva vannak az Amazon számítási szolgáltatásaiba (AWS Step Functions, AWS Lambda, Amazon Q Developer). A főbb dokumentált felhasználási forgatókönyvek:[2][1]
Ügynöki munkafolyamatok (Agentic Workflows)
Többlépéses feladatvégrehajtás Bedrock Agents és külső eszközhívás (function calling) alkalmazásával. A ReAct (Reasoning and Acting) architekturális mintát a LangGraph-hoz hasonló keretrendszerekkel kombinálva a Nova modellek koordinálják az adatbázis-analitikát, természetes nyelvből SQL-lekérdezéseket generálnak, és összetett folyamatokat irányítanak. A Nova Act böngészős UI-workflow automatizálást biztosít, a korai felhasználói feladatokon 90%-os megbízhatósággal.[28][8]
Külső tudás bevonásával végzett generálás (RAG)
Integráció a Bedrock Knowledge Bases-szel a válaszok vállalati adatokon alapuló megalapozásához (grounding). A Nova 2 modellek natív webes keresést támogatnak megerősítéssel (web grounding) beépített eszközként.[1][9]
Dokumentumfeldolgozás
Támogatott bemeneti dokumentumformátumok: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (kivéve a Nova Micro-t, amely csak szöveges bemenetet fogad). A Nova Premier egyetlen lekérdezés keretén belül képes akár 90 perces videók feldolgozására.[2][6]
Kódgenerálás és hibakeresés
Támogatott programozási nyelvek: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Hangalapú felületek
A Nova Sonic és Nova 2 Sonic valós idejű támogatással rendelkező hangügynökök kiépítésére alkalmazható, Amazon Connect integrációval.[10][7]
Modellértékelés (LLM-as-a-judge)
A Nova bírói modellként alkalmazható más generatív modellek kimenetének értékelésénél az Amazon SageMaker platformon.[29]
Korlátok és nyitott kérdések
- Zárt architektúra. Az Amazon nem hozza nyilvánosságra a paraméterek számát, a részletes architekturális megoldásokat és az edzési adatok összetételét, ami lényegesen korlátozza az eredmények független reprodukálhatóságát. A Nova modellek súlyai nem tölthetők le, és nem helyezhetők üzembe az AWS infrastruktúráján kívül (helyszíni telepítés nem lehetséges).[1][2]
- Kimeneti korlát. Az összes értelmező modell esetén a kimeneti tokenek maximális száma 10 ezer tokenre korlátozott, ami hosszú dokumentumok generálásához esetleg nem elegendő.[2]
- RFT korlátok. A Reinforcement Fine-Tuning nem támogatja a többkörös (multi-turn) párbeszédeket és a multimodális adatokat; az adathalmazban a pozitív példák ajánlott aránya legalább 5%.[27]
- Nova Sonic korlátok. A kapcsolat maximális időtartama — 8 perc; alapértelmezés szerint legfeljebb 20 egyidejű kapcsolat ügyfelenként.[2]
- Regionális elérhetőség. A Nova Premier csak egy régióban érhető el (US East N. Virginia), kereszt-regionális inferencia nélkül; a Nova 2 modellek korlátozott listán szereplő régiókban telepíthetők.[2]
- Metrikák érzékenysége. A szintetikus benchmarkon elért értékelések nem mindig korrelálnak a termelési (production) körülmények közötti teljesítménnyel, ahol a vállalati szabályzatok szigorú betartása és a hallucinációmentesség a többlépéses következtetésekben kritikus fontosságú.[22][23]
- Hallucinációk. A modellek az LLM-ekre jellemző korlátokat mutatják: a generált válaszokban előfordulhatnak ténybeli hibák. A kockázatok csökkentésére a Bedrock Guardrails és a RAG alkalmazása ajánlott.[1]
- A benchmarkok összehasonlíthatóságának objektivitása. Az Amazon a versengő modellekkel való összehasonlításokat a fejlesztők által publikált adatok alapján közli, ami nem minden esetben biztosít egységes, kontrollált kísérleti alapot.[22]
Etikai és szabályozási szempontok
Az AWS deklarálja a felelős MI (Responsible AI) elvek betartását a Nova modellek fejlesztése során. A konkrét biztonsági intézkedések a következők:[20][15]
- Beépített tartalommoderálás (content moderation).
- Vízjelek (watermarking) a Nova Sonic hangkimeneteihez.
- Értékelés kockázati kategóriák szerint: biztonság (safety), adatvédelem (privacy), hitelesség (veracity), átláthatóság (transparency), valamint vegyi, biológiai, radiológiai és nukleáris (CBRN) fegyverek terjesztése és offenzív kiberműveletek.
- Integráció az Amazon Bedrock Guardrails rendszerrel a bemeneti és kimeneti adatok szűréséhez.
- A Nova Premier modell értékelése az Amazon Frontier Model Safety Framework keretében.
- Red teaming — belső és külső tesztelés a támadásokkal szembeni ellenállóképesség felmérésére (a műszaki jelentés adatai szerint 307 technikával).
- Tartalommoderálás értékelése F1 metrikával: 85,84 az Aegis benchmarkon (a műszaki jelentés adatai szerint).[1]
A Nova Micro, Lite, Pro, Premier és Sonic MI-szolgáltatási kártyái (AI Service Cards) közzétételre kerültek a docs.aws.amazon.com oldalon a felelős alkalmazásra vonatkozó dokumentációként.[20][15]
Kilátások és kutatási irányok
A Nova 2 család jelzi az átmenetet a kiterjesztett következtetési képességekkel rendelkező modellek (extended thinking / reasoning) felé, amelyek konceptuálisan hasonlóak a gondolatlánc (Chain-of-Thought, CoT) és más modellek hasonló mechanizmusaihoz. A beépített webes keresés és kódértelmező natív eszközként (nem harmadik féltől származó bővítményként) architekturális elmozdulást jelent az ügynöki rendszerek irányába.[9][8]
Az Amazon nyilvános anyagaiban jelzett további fejlesztési irányok:
- A multimodalitás bővítése (az Omni modell mint egységes „minden-a-mindenhez" architektúra).
- Hibrid következtetés (hybrid reasoning) adaptív mélységgel a feladat bonyolultságától függően.
- Nyílt edzés felhasználói adatokon (Nova Forge) az előedzés minden szakaszában.
- Desztilláció peremeszközökhöz (edge devices).
- A biztonsági eszközkészlet (safety toolkit) bővítése.[8][11]
Az AWS által egyetemi csapatok számára szervezett Amazon Nova AI Challenge témái közé tartozik az automatizált ellenséges tesztelés, a biztonsági igazítás (safety alignment) és a többkörös feltörési kísérletek (multi-turn jailbreaks), ami a modellek megbízhatóságába való befektetést tanúsítja.[8]
Lásd még
- Transformer (architektúra)
- Reinforcement Learning from Human Feedback (RLHF)
Irodalom
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 2026. február. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Hivatkozások
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Amazon Nova hivatalos dokumentációja
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards a Nova Micro, Lite, Pro, Premier modellekhez
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card a Nova Sonichoz
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Amazon Nova bejelentése (2024. december)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Amazon Nova 2 bejelentése (2025. december)
Megjegyzések
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/