Nova (Amazon) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — alapmodellek (Foundation Models, FM) és nagy nyelvi modellek (Large Language Model, LLM) családja, amelyet az Amazon Artificial General Intelligence (AAG Intelligence) részleg fejlesztett ki, és amely a teljesen felügyelt Amazon Bedrock szolgáltatáson keresztül érhető el. A család magában foglalja a szövegértési és szöveggenerálási, képfeldolgozási, videó- és dokumentumfeldolgozási, valamint beszédszintézis és -felismerési modelleket. Az Amazon Nova az előző generációs Amazon Titan modellek utódjának tekinthető, és integrálva van az Amazon Web Services (AWS) felhőalapú ökoszisztémájába.[1][2][3]

A fejlesztés története és kronológiája

A Nova bevezetése előtt az Amazon Bedrock platform harmadik féltől származó modellekhez biztosított hozzáférést: Anthropic Claude, Meta Llama, Mistral és más modellekhez. Az Amazon Nova lett az AWS első saját fejlesztésű alapmodelljének családja, amelyet felhőinfrastruktúrában való kereskedelmi alkalmazásra szántak.[3]

Első generáció (2024–2025)

Az Amazon Nova első generációját 2024. december 3-án mutatták be hivatalosan az AWS re:Invent 2024 konferencián. A kezdeti kiadás három értelmező modellt (understanding models) tartalmazott — a csak szöveges Nova Micro-t, valamint a multimodális Nova Lite-ot és Nova Pro-t —, továbbá a Nova Canvas generatív képgeneráló és a Nova Reel videógeneráló modelleket.[4][3][5]

2025 áprilisában a kínálat kiegészült a Nova Premier csúcsmodellel — a család legerősebb modelljével, 1 millió token kontextusablakkal, amelyet összetett következtetési feladatokra és modelldesztillációra (distillation, tudásátadás egy nagyobb modellből egy kisebb felé) szántak.[6] Szintén 2025 áprilisában mutatták be a Nova Sonic nevű speech-to-speech osztályú hangmodellt, amely támogatja a valós idejű párbeszédeket.[7]

Második generáció — Nova 2 (2025–2026)

2025 novemberében–decemberében az AWS re:Invent 2025 konferencián bejelentették a második generációt — az Amazon Nova 2-t. A kínálatba kerültek a dinamikus következtetést (dynamic reasoning) és bővített kontextusfeldolgozást támogató frissített Nova 2 Lite és Nova 2 Pro modellek, a natív multimodális Nova 2 Omni modell (szöveg, kép, videó és audió egyidejű feldolgozása és generálása), valamint a Nova 2 Sonic — a következő generációs hangmodell. Egyidejűleg bemutatásra került a Nova Forge (testreszabott modelledzési környezet) és a Nova Act (ügynökalapú workflow-keretrendszer) is.[8][9][10]

2026 februárjában megjelent az Amazon Nova 2 hivatalos műszaki jelentése.[11]

Összesített kronológia

Dátum Esemény
2024. december Amazon Nova bejelentése az AWS re:Invent 2024-en: Nova Micro, Lite, Pro, Canvas, Reel
2025. április Nova Premier (1M token kontextus) és Nova Sonic (speech-to-speech) megjelenése
2025. június Az első generációs műszaki jelentés közzététele (arXiv:2506.12103)
2025. november–december Nova 2 bejelentése az AWS re:Invent 2025-ön: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
2026. február Amazon Nova 2 műszaki jelentésének közzététele

Elméleti alapok és architektúra

Az understanding-modellek alaparchitektúrája

Az arXiv:2506.12103 műszaki jelentés szerint az értelmező modellek (Nova Micro, Lite, Pro, Premier) a Vaswani et al. által leírt Transformer architektúrán alapulnak.[12] A többfejű önfigyelési mechanizmus (Multi-Head Self-Attention) alapképlete:

Attention(Q,K,V)=softmax(QKopdk)V

ahol Q, K, V rendre a lekérdezések (queries), kulcsok (keys) és értékek (values) mátrixai, dk pedig a kulcsok dimenziója.[12][1]

Az architektúra pontos paraméterei (rétegek száma, rejtett állapot mérete, figyelmifejek száma, paraméterek teljes száma) a nyilvánosan elérhető forrásokban 2026 márciusának állása szerint nem kerültek közzétételre. Ez a megközelítés jellemző a zárt kereskedelmi modellekre.[1]

A Nova Lite és Nova Pro multimodális feldolgozása szöveges, vizuális és videó-tokenek egyetlen sorozatba való összevonásával valósul meg, amelyet egy egységes nyelvi modell kap bemenetként. A vizuális enkóderek (vision encoders) a képeket és videókereteket szöveges reprezentációval kompatibilis tokensorozatokká alakítják.[1][13]

A generatív modellek architektúrája

A Nova Canvas (képek) és Nova Reel (videó) generatív modellek látens diffúziós modell (Latent Diffusion Models, LDM) architektúrát[14] alkalmaznak variációs automatikus enkóderekkel (Variational AutoEncoder, VAE) kombinálva a látens térben végzett számítások céljából. A diffúziós folyamatot a következő zajosítási egyenlet írja le:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

ahol x0 az eredeti kép a látens térben, xt annak zajosított változata a t lépésben, α¯t a zajütemezés kumulatív paramétere, ϵ standard Gauss-zaj. A szöveges enkóder (text encoder) biztosítja a kondicionálást — a generálás feltételezését a szöveges prompton.[13][14]

A hangmodellek architektúrája

A Nova Sonic a szöveges modellektől eltérő architektúrát alkalmaz: egy speciális hangenkódert (speech encoder), hangdekódert (speech renderer) és az alap multimodális nyelvi modellt egyetlen végponttól végpontig tartó folyamatba (end-to-end pipeline) vonja össze. Ez lehetővé teszi a hangbemenet feldolgozását és hangkimenet generálását közbülső szöveggé alakítás nélkül (bár szöveges reprezentációt belső célokra minőségbiztosítás céljából alkalmaznak).[15][1]

Az edzési infrastruktúra

A Nova modellek edzése AWS Elastic Kubernetes Service (EKS) elosztott klaszterein zajlott, Amazon Trainium saját MI-gyorsítók (TRN1 példányok), valamint NVIDIA A100 és H100 grafikus processzorok alkalmazásával.[13][1]

Az edzési számítási költségek csökkentése érdekében speciális optimalizálási módszereket fejlesztettek ki és alkalmaztak:

  • Super-Selective Activation Checkpointing (SSC) — aktiválás-mentési módszer, amely a műszaki jelentés adatai szerint a grafikus processzorok memóriafelhasználását körülbelül 50%-kal csökkenti minimális újraszámítási (recomputation) többletköltség mellett.[13]
  • In-CPU-Memory Checkpointing — közbenső súlyok (checkpoints) gyorsítótárazása a központi processzorok (CPU) operatív memóriájában, mielőtt azokat aszinkron módon töltik fel az Amazon S3 felhőalapú tárolóba. Az Amazon adatai szerint ez a megközelítés a TRN1 példányokon 0,1 másodpercre csökkentette a modellállapot mentési idejét.[16][13]

Az edzési folyamat és az igazítás

A Nova modellek edzési folyamata több, a modern LLM-ekre jellemző lépésből áll:[1][17]

Előedzés (Pre-training)

Nagyméretű, több mint 200 nyelvet magában foglaló többnyelvű és multimodális adatkorpuszon végzett edzés. Az edzési adatok pontos összetétele (mennyiség, nyelvek aránya, konkrét források) a nyilvános anyagokban nem szerepel.[1]

Felügyelt finomhangolás (Supervised Fine-Tuning, SFT)

Finomhangolás jelölt „utasítás–válasz" párpéldákon, amely a modellt a felhasználói utasítások követésére vezeti.[1]

Igazítás megerősítéses tanulással

A modell viselkedésének az emberi preferenciákhoz való igazítására két fő algoritmust alkalmaznak:

Proximal Policy Optimization (PPO) — emberi visszajelzésen alapuló megerősítéses tanulási algoritmus (Reinforcement Learning from Human Feedback, RLHF), amely külön jutalommodellt (Reward Model) alkalmaz.[18][1]

Direct Preference Optimization (DPO) — alternatív igazítási módszer, amely nem igényel explicit jutalommodellt. A DPO célfüggvénye a következő:[19]

DPO(πheta;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπheta(ywx)πref(ywx)βlogπheta(ylx)πref(ylx))]

where:

  • πheta — a parametrizált stratégia (az edzendő modell);
  • πref — az alap (befagyasztott) referencia modell;
  • x — a bemeneti prompt (kontextus);
  • yw és yl — rendre a preferált (győztes) és az elutasított (vesztes) válaszok;
  • σ — logisztikai (sigmoid) függvény;
  • β — hiperparaméter, amely az alap modelltől való eltérés büntetésének erősségét szabályozza (analóg a Kullback–Leibler-divergencia büntetéssel, KL-divergence penalty).[19][1]

A modellek családjának összetétele

A modellek családja szintekre (tiers) van osztva a teljesítmény, a költség és a késleltetés (latency) közötti egyensúly alapján.[2][20]

Az első generációs értelmező modellek

Paraméter Nova Micro Nova Lite Nova Pro Nova Premier
Bemeneti modalitások Szöveg Szöveg, kép, videó Szöveg, kép, videó Szöveg, kép, videó
Kimeneti modalitás Szöveg Szöveg Szöveg Szöveg
Kontextusablak 128 ezer token 300 ezer token 300 ezer token 1 millió token
Max. kimeneti tokenek 10 ezer 10 ezer 10 ezer 10 ezer
Támogatott nyelvek 200+ 200+ 200+ 200+
Finomhangolás (fine-tuning) Igen Igen Igen Nem
Megjelenés dátuma 2024. december 2024. december 2024. december 2025. április
Fő rendeltetés Minimális késleltetés és költség szöveges feladatokhoz Alapszintű multimodális elemzés Optimális egyensúly összetett logikai és ügynöki feladatokhoz Maximális pontosság, tanármodell desztillációhoz

Forrás: AWS AI Service Cards; arXiv:2506.12103.[20][1]

Optimalizált nyelvek (15): angol, német, spanyol, francia, olasz, japán, koreai, arab, kínai (egyszerűsített), orosz, hindi, portugál, holland, török, héber.[2]

A Nova Premier olyan feladatokhoz készült, amelyek mély kontextusmegértést, többlépéses tervezést és nagy adatmennyiséggel való munkát igényelnek: kódbázisok, 400 oldalnál hosszabb dokumentumok, akár 90 perces videók feldolgozása egyetlen lekérdezés keretében.[6]

A második generációs modellek (Nova 2)

Nova 2 Lite és Nova 2 Pro 2025 novemberében–decemberében jelent meg. Mindkettő támogatja a kiterjesztett gondolkodást (extended thinking) — egy olyan mechanizmust, amelynek során a modell többlépéses következtetést végez a válasz generálása előtt. A következtetés mélységét a reasoning_effort paraméter szabályozza low, medium és high szintekkel. A kontextusablak 1 millió tokenre bővült. Beépített natív eszközök: webes keresés megerősítéssel (web grounding) és kódértelmező (code interpreter).[9][8]

Nova 2 Omni — natív multimodális modell, amely egyszerre képes szöveget, képeket, videót és audiót fogadni bemenetként, és szöveget és képeket generálni. Kontextusablak — 1 millió token.[8][11]

Nova 2 Sonic — következő generációs hangmodell. 6 nyelvet támogat: angol (amerikai és brit változat), spanyol, német, francia, olasz. Bevezeti az aszinkron eszközhívást (asynchronous tool calling) — a modell folytatja az új bemenet feldolgozását, miközben a külső eszközök a háttérben futnak.[10]

Paraméter Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
Bemeneti modalitások Szöveg, kép, videó Szöveg, kép, videó Szöveg, kép, videó, audió Audió (hang)
Kimeneti modalitás Szöveg Szöveg Szöveg, kép Audió (hang)
Kontextusablak 1 millió token 1 millió token 1 millió token 300 ezer token
Extended thinking Igen Igen Igen
Natív eszközök Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
Megjelenés dátuma 2025. november–december 2025. november–december 2025. december 2025. december

Forrás: AWS Blog; Amazon Science.[9][8][11]

Generatív modellek

Nova Canvas — képgeneráló modell. Szöveges és grafikus bemenetet támogat (PNG, JPEG). Kimeneti felbontás — legfeljebb 4,19 millió pixel (például 2048×2048 vagy 2816×1536 pixel). A prompt maximális hossza — 1024 karakter. Támogatott műveletek: inpainting (képterület cseréje) és outpainting (kép kiterjesztése határain túl).[2][4]

Nova Reel — videógeneráló modell. Kimeneti felbontás: 1280×720, 24 képkocka/másodperc. A generált videó hossza — legfeljebb 6 másodperc. Támogatja a kameramozgás vezérlését (camera control). A hozzáférés aszinkron API-n (Asynchronous Invoke Model API) keresztül történik.[2][4]

Hangmodellek

Nova Sonic (2025. április) — hangmodell kétirányú folyamatos API-val (bidirectional stream API). Támogatja a funkciohívásokat (function calling) és a vállalati adatokon alapuló megalapozást (grounding) Retrieval-Augmented Generation (RAG, külső tudás bevonásával végzett generálás) révén. A vízjel (watermarking) funkció alapértelmezés szerint be van kapcsolva. A kapcsolat maximális időtartama — 8 perc, megújítási lehetőséggel; legfeljebb 20 egyidejű kapcsolat ügyfelenként (alapértelmezett érték).[7][15][2]

Nova 2 Sonic (2025. december) — a hangmodell következő generációja, javított rövid megnyilatkozások, telefonos audió (8 kHz) és akcentusok felismerésével.[10]

Értékelés és benchmarkok

A Nova modellek értékelése automatizált benchmarkok segítségével történt, beleértve az „LLM-as-a-judge" (nyelvi modell mint értékelő) megközelítést. A HKU SPACE AI Hub kutatása szerint az Arena-Hard-Auto metrika 98,6%-os korrelációt mutat a szakértői értékelésekkel.[21][22]

Az első generáció benchmarkjai

Adatok az arXiv:2506.12103 műszaki jelentésből (feltételek: a versengő modellek fejlesztői által a jelentés elkészítésének idején közzétett eredmények):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT-4o (Nov 2024)
MMLU (5-shot) 80,5 77,6
MATH (4-shot) 73,3 69,3
IFEval 87,5 87,2
MT-Bench (text) 79,7 77,7 76,7 77,5
MT-Bench (multimodal) 63,7 60,7 61,6 55,0

Forrás: arXiv:2506.12103, 2.1.1. táblázat.[1]

Az eredmények a teljesítményhierarchiát mutatják a családon belül (Premier > Pro > Lite > Micro). A különbség leginkább a matematika (Math) és a következtetés (Reasoning) kategóriákban szembetűnő; a szerepjátékos interakció (Roleplay) és az információkinyerés (Extraction) feladatokban a kisebb modellek az idősebb modellekhez közeli eredményeket produkálnak.[22]

A második generáció benchmarkjai (Nova 2)

Adatok az Amazon Nova 2 műszaki jelentéséből (feltételek: internal measurements, 0-shot / CoT ahol jelezve):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT-5 Mini Gemini 2.5 Flash
MMLU-Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA-Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

Forrás: Amazon Nova 2 Technical Report, 1. táblázat.[11]

Ügynöki benchmarkok (Nova 2 Pro): SWE-Bench Verified — 70,0%; τ²-bench Verified Telecom — 92,7%.[11]

Multimodális benchmarkok (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]

Műszaki támogatási feladatokban végzett értékelés során a Nova 2 Lite 9,63 ± 0,27 pontot ért el a tízes skálán a „Problémaazonosítás" (Problem Identification) metrikában, jelentősen megelőzve az első generációs Nova Lite-ot (8,57 ± 0,46).[23]

Megjegyzés. A versengő modellekkel való összehasonlítás során figyelembe kell venni, hogy a promptolási feltételek, a modellek verziói és a metrikák mérési dátuma eltérhet. Az első és második generáció benchmarkjai az Amazon önjelentéseiből származnak; a független ellenőrzések (FloTorch, Artificial Analysis) általánosságban megerősítik az ár-teljesítmény arányt, de egyes pontossági metrikákon lemaradást rögzítenek a vezető versenytársakhoz képest.[22]

Következtetési sebesség

Az Amazon belső mérései alapján (internal, Bedrock API-n keresztül):[1][11]

Modell Következtetési sebesség (token/s)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

Használati költségek

Minden modell elérhető az Amazon Bedrockon keresztül, feldolgozott tokenek száma szerint fizetős modellben (adatok 2026 márciusának állása szerint):[2]

Modell Bemeneti tokenek (USD / 1M) Kimeneti tokenek (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

Összehasonlításképpen: az Anthropic Claude 3.5 Sonnet a Nova megjelenésekor $6,00 / 1M bemeneti és $30,00 / 1M kimeneti token tarifával volt elérhető.[22]

Testreszabás és finomhangolás

Az AWS infrastruktúra számos módszert kínál az alap Nova modellek szűk szakterületekre való adaptálásához. Ennek fő eszköze a második generációban az Amazon Nova Forge környezet.[8][17]

Continued Pre-Training (CPT) és Mid-Training

A Nova Forge hozzáférést biztosít a modellek edzési közbenső ellenőrzési pontjaihoz (például pretraining‑text‑RD és pretraining‑text‑CE). Ez lehetővé teszi az önfelügyelt tanulás (self-supervised learning) folytatását vállalati adathalmazokon, a tanulási sebesség (learning rate) gondos hangolásával a katasztrofális felejtés (catastrophic forgetting) megelőzése érdekében.[24][25]

Parameter-Efficient Fine-Tuning (PEFT)

Csak a modell súlyainak kis részhalmazát frissíti alacsony rangú adaptereken (Low-Rank Adaptation, LoRA)[26] keresztül. Ez a megközelítés jelentősen csökkenti a számítási erőforrás-igényt a teljes finomhangoláshoz (full fine-tuning) képest. A Nova Lite és Pro esetén multimodális fine-tuning is támogatott.[17]

Reinforcement Fine-Tuning (RFT)

Az egyedi modellek tovább finomhangolhatók megerősítéses módszerekkel, iparág-specifikus jutalommetrikák alapján, beleértve egy másik LLM bírói modellként (LLM-as-a-judge) való alkalmazását.[27]

Modell desztilláció (Model Distillation)

A Model Distillation funkció lehetővé teszi a Nova Premier vagy Nova Pro tanármodellként (teacher model) való alkalmazását kisebb tanulómodellek (student models) — Nova Lite és Nova Micro — edzéséhez. Ez csökkenti a következtetés (inferencia) számítási költségeit, miközben megőrzi a nagyobb modell minőségének jelentős részét.[2][6]

Alkalmazási területek és integráció

A Nova modellek integrálva vannak az Amazon számítási szolgáltatásaiba (AWS Step Functions, AWS Lambda, Amazon Q Developer). A főbb dokumentált felhasználási forgatókönyvek:[2][1]

Ügynöki munkafolyamatok (Agentic Workflows)

Többlépéses feladatvégrehajtás Bedrock Agents és külső eszközhívás (function calling) alkalmazásával. A ReAct (Reasoning and Acting) architekturális mintát a LangGraph-hoz hasonló keretrendszerekkel kombinálva a Nova modellek koordinálják az adatbázis-analitikát, természetes nyelvből SQL-lekérdezéseket generálnak, és összetett folyamatokat irányítanak. A Nova Act böngészős UI-workflow automatizálást biztosít, a korai felhasználói feladatokon 90%-os megbízhatósággal.[28][8]

Külső tudás bevonásával végzett generálás (RAG)

Integráció a Bedrock Knowledge Bases-szel a válaszok vállalati adatokon alapuló megalapozásához (grounding). A Nova 2 modellek natív webes keresést támogatnak megerősítéssel (web grounding) beépített eszközként.[1][9]

Dokumentumfeldolgozás

Támogatott bemeneti dokumentumformátumok: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (kivéve a Nova Micro-t, amely csak szöveges bemenetet fogad). A Nova Premier egyetlen lekérdezés keretén belül képes akár 90 perces videók feldolgozására.[2][6]

Kódgenerálás és hibakeresés

Támogatott programozási nyelvek: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

Hangalapú felületek

A Nova Sonic és Nova 2 Sonic valós idejű támogatással rendelkező hangügynökök kiépítésére alkalmazható, Amazon Connect integrációval.[10][7]

Modellértékelés (LLM-as-a-judge)

A Nova bírói modellként alkalmazható más generatív modellek kimenetének értékelésénél az Amazon SageMaker platformon.[29]

Korlátok és nyitott kérdések

  • Zárt architektúra. Az Amazon nem hozza nyilvánosságra a paraméterek számát, a részletes architekturális megoldásokat és az edzési adatok összetételét, ami lényegesen korlátozza az eredmények független reprodukálhatóságát. A Nova modellek súlyai nem tölthetők le, és nem helyezhetők üzembe az AWS infrastruktúráján kívül (helyszíni telepítés nem lehetséges).[1][2]
  • Kimeneti korlát. Az összes értelmező modell esetén a kimeneti tokenek maximális száma 10 ezer tokenre korlátozott, ami hosszú dokumentumok generálásához esetleg nem elegendő.[2]
  • RFT korlátok. A Reinforcement Fine-Tuning nem támogatja a többkörös (multi-turn) párbeszédeket és a multimodális adatokat; az adathalmazban a pozitív példák ajánlott aránya legalább 5%.[27]
  • Nova Sonic korlátok. A kapcsolat maximális időtartama — 8 perc; alapértelmezés szerint legfeljebb 20 egyidejű kapcsolat ügyfelenként.[2]
  • Regionális elérhetőség. A Nova Premier csak egy régióban érhető el (US East N. Virginia), kereszt-regionális inferencia nélkül; a Nova 2 modellek korlátozott listán szereplő régiókban telepíthetők.[2]
  • Metrikák érzékenysége. A szintetikus benchmarkon elért értékelések nem mindig korrelálnak a termelési (production) körülmények közötti teljesítménnyel, ahol a vállalati szabályzatok szigorú betartása és a hallucinációmentesség a többlépéses következtetésekben kritikus fontosságú.[22][23]
  • Hallucinációk. A modellek az LLM-ekre jellemző korlátokat mutatják: a generált válaszokban előfordulhatnak ténybeli hibák. A kockázatok csökkentésére a Bedrock Guardrails és a RAG alkalmazása ajánlott.[1]
  • A benchmarkok összehasonlíthatóságának objektivitása. Az Amazon a versengő modellekkel való összehasonlításokat a fejlesztők által publikált adatok alapján közli, ami nem minden esetben biztosít egységes, kontrollált kísérleti alapot.[22]

Etikai és szabályozási szempontok

Az AWS deklarálja a felelős MI (Responsible AI) elvek betartását a Nova modellek fejlesztése során. A konkrét biztonsági intézkedések a következők:[20][15]

  • Beépített tartalommoderálás (content moderation).
  • Vízjelek (watermarking) a Nova Sonic hangkimeneteihez.
  • Értékelés kockázati kategóriák szerint: biztonság (safety), adatvédelem (privacy), hitelesség (veracity), átláthatóság (transparency), valamint vegyi, biológiai, radiológiai és nukleáris (CBRN) fegyverek terjesztése és offenzív kiberműveletek.
  • Integráció az Amazon Bedrock Guardrails rendszerrel a bemeneti és kimeneti adatok szűréséhez.
  • A Nova Premier modell értékelése az Amazon Frontier Model Safety Framework keretében.
  • Red teaming — belső és külső tesztelés a támadásokkal szembeni ellenállóképesség felmérésére (a műszaki jelentés adatai szerint 307 technikával).
  • Tartalommoderálás értékelése F1 metrikával: 85,84 az Aegis benchmarkon (a műszaki jelentés adatai szerint).[1]

A Nova Micro, Lite, Pro, Premier és Sonic MI-szolgáltatási kártyái (AI Service Cards) közzétételre kerültek a docs.aws.amazon.com oldalon a felelős alkalmazásra vonatkozó dokumentációként.[20][15]

Kilátások és kutatási irányok

A Nova 2 család jelzi az átmenetet a kiterjesztett következtetési képességekkel rendelkező modellek (extended thinking / reasoning) felé, amelyek konceptuálisan hasonlóak a gondolatlánc (Chain-of-Thought, CoT) és más modellek hasonló mechanizmusaihoz. A beépített webes keresés és kódértelmező natív eszközként (nem harmadik féltől származó bővítményként) architekturális elmozdulást jelent az ügynöki rendszerek irányába.[9][8]

Az Amazon nyilvános anyagaiban jelzett további fejlesztési irányok:

  • A multimodalitás bővítése (az Omni modell mint egységes „minden-a-mindenhez" architektúra).
  • Hibrid következtetés (hybrid reasoning) adaptív mélységgel a feladat bonyolultságától függően.
  • Nyílt edzés felhasználói adatokon (Nova Forge) az előedzés minden szakaszában.
  • Desztilláció peremeszközökhöz (edge devices).
  • A biztonsági eszközkészlet (safety toolkit) bővítése.[8][11]

Az AWS által egyetemi csapatok számára szervezett Amazon Nova AI Challenge témái közé tartozik az automatizált ellenséges tesztelés, a biztonsági igazítás (safety alignment) és a többkörös feltörési kísérletek (multi-turn jailbreaks), ami a modellek megbízhatóságába való befektetést tanúsítja.[8]

Lásd még

  • Transformer (architektúra)
  • Reinforcement Learning from Human Feedback (RLHF)

Irodalom

Hivatkozások

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/