Nova (Amazon) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — rodina základních modelů (Foundation Models, FM) a velkých jazykových modelů (Large Language Model, LLM), vyvinutá divizí Amazon Artificial General Intelligence (AAG Intelligence) a dostupná prostřednictvím plně spravované služby Amazon Bedrock. Rodina zahrnuje modely pro porozumění a generování textu, zpracování obrázků, videa a dokumentů, jakož i syntézu a rozpoznávání řeči. Amazon Nova je prezentována jako náhrada předchozí generace modelů Amazon Titan a je integrována do cloudového ekosystému Amazon Web Services (AWS).[1][2][3]

Historie a chronologie vývoje

Před spuštěním Nova poskytovala platforma Amazon Bedrock přístup k modelům třetích stran: Anthropic Claude, Meta Llama, Mistral a dalším. Amazon Nova se stala první rodinou základních modelů vlastního vývoje AWS zaměřenou na komerční využití v cloudové infrastruktuře.[3]

První generace (2024–2025)

První generace rodiny Amazon Nova byla oficiálně představena 3. prosince 2024 na konferenci AWS re:Invent 2024. Do prvotního vydání byly zahrnuty tři modely pro porozumění (understanding models) — Nova Micro (pouze text), multimodální Nova Lite a Nova Pro — a dále generativní modely Nova Canvas (generování obrázků) a Nova Reel (generování videa).[4][3][5]

V dubnu 2025 byla řada rozšířena o vlajkový model Nova Premier — nejvýkonnější model rodiny s kontextovým oknem 1 milionu tokenů, určený pro úlohy vyžadující složité uvažování a distilaci (distillation, přenos znalostí z velkého modelu do menšího) modelů.[6] Rovněž v dubnu 2025 byl představen Nova Sonic — řečový model třídy speech‑to‑speech s podporou dialogů v reálném čase.[7]

Druhá generace — Nova 2 (2025–2026)

V listopadu–prosinci 2025 na konferenci AWS re:Invent 2025 byla oznámena druhá generace — Amazon Nova 2. Do řady byly zařazeny aktualizované modely Nova 2 Lite a Nova 2 Pro s podporou dynamického uvažování (dynamic reasoning) a rozšířeného zpracování kontextu, nativní multimodální model Nova 2 Omni (simultánní zpracování a generování textu, obrázků, videa a audia) a Nova 2 Sonic — řečový model nové generace. Současně byly představeny služby Nova Forge (prostředí pro vlastní trénování modelů) a Nova Act (framework pro agentní workflow).[8][9][10]

V únoru 2026 byla zveřejněna oficiální technická zpráva Amazon Nova 2.[11]

Souhrnná chronologie

Datum Událost
Prosinec 2024 Oznámení Amazon Nova na AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel
Duben 2025 Vydání Nova Premier (kontext 1M tokenů) a Nova Sonic (speech‑to‑speech)
Červen 2025 Zveřejnění technické zprávy první generace (arXiv:2506.12103)
Listopad–Prosinec 2025 Oznámení Nova 2 na AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
Únor 2026 Zveřejnění technické zprávy Amazon Nova 2

Teoretické základy a architektura

Základní architektura understanding‑modelů

Podle technické zprávy arXiv:2506.12103 jsou modely pro porozumění (Nova Micro, Lite, Pro, Premier) založeny na architektuře transformeru (Transformer) popsané v práci Vaswani et al.[12] Základní mechanismus vícehlávkové vlastní pozornosti (Multi‑Head Self‑Attention) je popsán vzorcem:

Attention(Q,K,V)=softmax(QKopdk)V

kde Q, K, V jsou matice dotazů (queries), klíčů (keys) a hodnot (values) v uvedeném pořadí a dk je dimenzionalita klíčů.[12][1]

Přesné parametry architektury (počet vrstev, velikost skrytého stavu, počet hlav pozornosti, celkový počet parametrů) nejsou ve veřejně dostupných zdrojích k březnu 2026 zveřejněny. Tento přístup je charakteristický pro uzavřené komerční modely.[1]

Multimodální zpracování v Nova Lite a Nova Pro je realizováno spojením textových, vizuálních a video‑tokenů do jednotné sekvence přiváděné na vstup jednoho jazykového modelu. Vizuální enkodéry (vision encoders) převádějí obrázky a snímky videa na sekvence tokenů kompatibilní s textovou reprezentací.[1][13]

Architektura generativních modelů

Generativní modely Nova Canvas (obrázky) a Nova Reel (video) využívají architekturu latentních difuzních modelů (Latent Diffusion Models, LDM)[14] ve spojení s variačními autoenkodéry (Variational AutoEncoder, VAE) pro výpočty v latentním prostoru. Proces difuze je popsán rovnicí přímého šumu:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

kde x0 je původní obrázek v latentním prostoru, xt je jeho zašuměná verze v kroku t, α¯t je kumulativní parametr rozvrhu šumu a ϵ je standardní Gaussův šum. Textový enkodér (text encoder) zajišťuje conditioning — podmínění generování na textovém promptu.[13][14]

Architektura řečových modelů

Nova Sonic využívá architekturu odlišnou od textových modelů: spojuje specializovaný enkodér řeči (speech encoder), dekodér řeči (speech renderer) a hlavní multimodální jazykový model do jednotného end‑to‑end pipeline. To umožňuje zpracovávat řečový vstup a generovat řečový výstup bez mezipřevodů do textu (ačkoli textová reprezentace je interně využívána pro zajištění kvality).[15][1]

Infrastruktura trénování

Trénování modelů Nova probíhalo na distribuovaných clusterech AWS Elastic Kubernetes Service (EKS) s využitím vlastních AI akcelerátorů Amazon Trainium (instance TRN1) a grafických procesorů NVIDIA A100 a H100.[13][1]

Pro snížení výpočetních nákladů při trénování byly vyvinuty a nasazeny specializované optimalizační metody:

  • Super‑Selective Activation Checkpointing (SSC) — metoda ukládání aktivací, která podle technické zprávy snižuje spotřebu paměti grafických procesorů přibližně o 50 % při minimální režii na opakované výpočty (recomputation).[13]
  • In‑CPU‑Memory Checkpointing — ukládání mezilehlých vah (checkpoints) do operační paměti centrálních procesorů (CPU) před jejich asynchronním přesunem do cloudového úložiště Amazon S3. Podle údajů Amazon tento přístup umožnil zkrátit dobu ukládání stavu modelu na 0,1 sekundy na instancích s TRN1.[16][13]

Pipeline trénování a vyrovnání

Proces trénování modelů Nova se skládá z několika fází typických pro moderní LLM:[1][17]

Předběžné trénování (Pre‑training)

Rozsáhlé trénování na velkém vícejazyčném a multimodálním korpusu dat zahrnujícím více než 200 jazyků. Přesné složení trénovacích dat (objem, poměr jazyků, konkrétní zdroje) není ve veřejných materiálech uváděno.[1]

Řízené dolaďování (Supervised Fine‑Tuning, SFT)

Dolaďování na označených příkladech párů „instrukce — odpověď", které vede model k následování uživatelských instrukcí.[1]

Vyrovnání pomocí zpětnovazebního učení

Pro vyrovnání chování modelu s lidskými preferencemi jsou používány dva hlavní algoritmy:

Proximal Policy Optimization (PPO) — algoritmus zpětnovazebního učení na základě lidské zpětné vazby (Reinforcement Learning from Human Feedback, RLHF) využívající samostatný model odměny (Reward Model).[18][1]

Direct Preference Optimization (DPO) — alternativní metoda vyrovnání nevyžadující explicitní model odměny. Cílová funkce DPO má tvar:[19]

DPO(πheta;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπheta(ywx)πref(ywx)βlogπheta(ylx)πref(ylx))]

kde:

  • πheta — parametrizovaná strategie (trénovaný model);
  • πref — základní (zmrazený) referenční model;
  • x — vstupní prompt (kontext);
  • yw a yl — preferovaná (vítězná) a odmítnutá (poražená) odpověď v uvedeném pořadí;
  • σ — logistická (sigmoidní) funkce;
  • β — hyperparametr řídící sílu penalizace za odchylku od základního modelu (analogie penalizace Kullbacka–Leiblera, KL‑divergence penalty).[19][1]

Složení rodiny modelů

Rodina modelů je rozdělena do úrovní (tiers) podle rovnováhy mezi výkonem, cenou a latencí (latency).[2][20]

Modely pro porozumění první generace

Parametr Nova Micro Nova Lite Nova Pro Nova Premier
Vstupní modality Text Text, obrázek, video Text, obrázek, video Text, obrázek, video
Výstupní modalita Text Text Text Text
Kontextové okno 128 tis. tokenů 300 tis. tokenů 300 tis. tokenů 1 mil. tokenů
Max. výstupních tokenů 10 tis. 10 tis. 10 tis. 10 tis.
Podpora jazyků 200+ 200+ 200+ 200+
Dolaďování (fine‑tuning) Ano Ano Ano Ne
Datum vydání Prosinec 2024 Prosinec 2024 Prosinec 2024 Duben 2025
Hlavní určení Minimální latence a náklady pro textové úlohy Základní multimodální analýza Optimální rovnováha pro složité logické a agentní úlohy Maximální přesnost, model‑učitel pro distilaci

Zdroj: AWS AI Service Cards; arXiv:2506.12103.[20][1]

Optimalizované jazyky (15): angličtina, němčina, španělština, francouzština, italština, japonština, korejština, arabština, čínština (zjednodušená), ruština, hindština, portugalština, nizozemština, turečtina, hebrejština.[2]

Nova Premier je určena pro úlohy vyžadující hluboké porozumění kontextu, vícekrokové plánování a práci s velkými objemy dat: kódovými bázemi, dokumenty o rozsahu více než 400 stránek, videi délky až 90 minut.[6]

Modely druhé generace (Nova 2)

Nova 2 Lite a Nova 2 Pro byly vydány v listopadu–prosinci 2025. Oba podporují rozšířené myšlení (extended thinking) — mechanismus, při němž model provádí vícekrokové uvažování před generováním odpovědi. Hloubka uvažování je řízena parametrem reasoning_effort s úrovněmi low, medium a high. Kontextové okno bylo rozšířeno na 1 milion tokenů. Jsou integrovány nativní nástroje: webové vyhledávání s ověřením (web grounding) a interpret kódu (code interpreter).[9][8]

Nova 2 Omni — nativní multimodální model schopný přijímat na vstup zároveň text, obrázky, video a audio a generovat text a obrázky. Kontextové okno — 1 mil. tokenů.[8][11]

Nova 2 Sonic — řečový model nové generace. Podporuje 6 jazyků: angličtina (americká a britská varianta), španělština, němčina, francouzština, italština. Zavádí asynchronní volání nástrojů (asynchronous tool calling) — model pokračuje ve zpracování nového vstupu, zatímco externí nástroje běží na pozadí.[10]

Parametr Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
Vstupní modality Text, obrázek, video Text, obrázek, video Text, obrázek, video, audio Audio (řeč)
Výstupní modalita Text Text Text, obrázek Audio (řeč)
Kontextové okno 1 mil. tokenů 1 mil. tokenů 1 mil. tokenů 300 tis. tokenů
Extended thinking Ano Ano Ano
Nativní nástroje Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
Datum vydání Listopad–Prosinec 2025 Listopad–Prosinec 2025 Prosinec 2025 Prosinec 2025

Zdroj: AWS Blog; Amazon Science.[9][8][11]

Generativní modely

Nova Canvas — model generování obrázků. Podporuje textový a grafický vstup (PNG, JPEG). Výstupní rozlišení — až 4,19 mil. pixelů (např. 2048×2048 nebo 2816×1536 pixelů). Maximální délka promptu — 1024 znaků. Jsou podporovány operace inpainting (nahrazení oblasti obrázku) a outpainting (rozšíření obrázku za jeho hranice).[2][4]

Nova Reel — model generování videa. Výstupní rozlišení: 1280×720 při 24 snímcích za sekundu. Délka generovaného videa — až 6 sekund. Je podporováno řízení pohybu kamery (camera control). Přístup je realizován prostřednictvím asynchronního API (Asynchronous Invoke Model API).[2][4]

Řečové modely

Nova Sonic (duben 2025) — řečový model s obousměrným streamovacím API (bidirectional stream API). Podporuje volání funkcí (function calling) a ukotvení na firemních datech prostřednictvím Retrieval‑Augmented Generation (RAG, generování s využitím externích znalostí). Funkce vodoznaku (watermarking) je integrována ve výchozím nastavení. Maximální doba trvání spojení — 8 minut s možností obnovení; maximálně 20 současných spojení na klienta (výchozí hodnota).[7][15][2]

Nova 2 Sonic (prosinec 2025) — nová generace řečového modelu se zlepšeným rozpoznáváním krátkých výpovědí, telefonního audia (8 kHz) a přízvuků.[10]

Hodnocení a benchmarky

Hodnocení modelů Nova bylo prováděno pomocí automatizovaných benchmarků včetně přístupu „LLM‑as‑a‑judge" (použití jazykového modelu jako hodnotitele). Podle studie HKU SPACE AI Hub vykazuje metrika Arena‑Hard‑Auto 98,6% korelaci s hodnoceními odborníků.[21][22]

Benchmarky první generace

Data z technické zprávy arXiv:2506.12103 (podmínky: výsledky vývojářů konkurenčních modelů zveřejněné v době přípravy zprávy):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

Zdroj: arXiv:2506.12103, tabulka 2.1.1.[1]

Výsledky ukazují hierarchii výkonu uvnitř rodiny (Premier > Pro > Lite > Micro). Rozdíl je nejmarkantnější v kategoriích matematiky (Math) a uvažování (Reasoning); v úlohách hraní rolí (Roleplay) a extrakce informací (Extraction) dosahují nižší modely výsledků blízkých vyšším.[22]

Benchmarky druhé generace (Nova 2)

Data z technické zprávy Amazon Nova 2 (podmínky: internal measurements, 0‑shot / CoT kde je uvedeno):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

Zdroj: Amazon Nova 2 Technical Report, tabulka 1.[11]

Agentní benchmarky (Nova 2 Pro): SWE‑Bench Verified — 70,0 %; τ²‑bench Verified Telecom — 92,7 %.[11]

Multimodální benchmarky (Nova 2 Omni): VideoMME — 77,9 %; MMMU Pro — 61,4 %.[11]

Při hodnocení v úlohách technické podpory dosáhla Nova 2 Lite skóre 9,63 ± 0,27 v desetibodové škále metriky „Identifikace problému" (Problem Identification), čímž výrazně předstihla Nova Lite první generace (8,57 ± 0,46).[23]

Poznámka. Při porovnávání výsledků s konkurenčními modely je třeba zohlednit, že podmínky promptování, verze modelů a data měření metrik se mohou lišit. Benchmarky první a druhé generace vycházejí ze sebehodnocení Amazon; nezávislá ověření (FloTorch, Artificial Analysis) obecně potvrzují deklarovaný poměr ceny a výkonu, avšak u některých metrik přesnosti zaznamenávají zaostávání za předními konkurenty.[22]

Rychlost inference

Podle interních měření Amazon (internal, přes Bedrock API):[1][11]

Model Rychlost inference (tokenů/s)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

Náklady na používání

Všechny modely jsou dostupné přes Amazon Bedrock s modelem platby za počet zpracovaných tokenů (data k březnu 2026):[2]

Model Vstupní tokeny (USD / 1M) Výstupní tokeny (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

Pro srovnání: Anthropic Claude 3.5 Sonnet byl v době vydání Nova účtován $6,00 / 1M vstupních a $30,00 / 1M výstupních tokenů.[22]

Přizpůsobení a dolaďování

Infrastruktura AWS poskytuje několik metod adaptace základních modelů Nova pro úzce specializované domény. Hlavním nástrojem pro tuto činnost ve druhé generaci je prostředí Amazon Nova Forge.[8][17]

Continued Pre‑Training (CPT) a Mid‑Training

Nova Forge poskytuje přístup k mezilehlým kontrolním bodům trénování modelů (např. pretraining‑text‑RD a pretraining‑text‑CE). To umožňuje pokračovat v samoučení (self‑supervised learning) na objemných firemních datech s pečlivým nastavením rychlosti učení (learning rate) pro prevenci katastrofálního zapomínání (catastrophic forgetting).[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

Aktualizace pouze malé podmnožiny vah modelu prostřednictvím adaptérů nízkého ranku — Low‑Rank Adaptation (LoRA)[26]. Tento přístup výrazně snižuje nároky na výpočetní zdroje ve srovnání s úplným dolaďováním (full fine‑tuning). Je podporováno multimodální fine‑tuning pro Nova Lite a Pro.[17]

Reinforcement Fine‑Tuning (RFT)

Vlastní modely lze dodatečně doladit metodami zpětnovazebního učení na základě odvětvově specifických metrik odměny, včetně použití jiného LLM jako modelu‑soudce (LLM‑as‑a‑judge).[27]

Distilace modelů (Model Distillation)

Funkce Model Distillation umožňuje využívat Nova Premier nebo Nova Pro jako model‑učitele (teacher model) pro trénování menších modelů‑žáků (student models) — Nova Lite a Nova Micro. Tím se snižují výpočetní náklady na inferenci při zachování podstatné části kvality velkého modelu.[2][6]

Využití a integrace

Modely Nova jsou integrovány do výpočetních služeb Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Hlavní zdokumentované scénáře použití:[2][1]

Agentní pracovní postupy (Agentic Workflows)

Vícekrokové plnění úloh s využitím Bedrock Agents a voláním externích nástrojů (function calling). Prostřednictvím architektonického vzoru ReAct (Reasoning and Acting) ve spojení s frameworky jako LangGraph koordinují modely Nova analytiku databází, formulují SQL dotazy z přirozeného jazyka a řídí vícesložkové procesy. Nova Act zajišťuje automatizaci prohlížečových UI‑workflow s deklarovanou spolehlivostí 90 % na raných uživatelských úlohách.[28][8]

Generování s využitím externích znalostí (RAG)

Integrace s Bedrock Knowledge Bases pro ukotvení (grounding) odpovědí na firemních datech. Modely Nova 2 podporují nativní webové vyhledávání s ověřením (web grounding) jako vestavěný nástroj.[1][9]

Zpracování dokumentů

Podporované formáty vstupních dokumentů: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (kromě Nova Micro, který přijímá pouze textový vstup). Nova Premier je schopna zpracovávat video délky až 90 minut v rámci jediného dotazu.[2][6]

Generování a ladění kódu

Podporované programovací jazyky: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

Hlasová rozhraní

Nova Sonic a Nova 2 Sonic jsou využívány pro budování hlasových agentů s podporou reálného času integrovaných s Amazon Connect.[10][7]

Hodnocení modelů (LLM‑as‑a‑judge)

Nova je využívána jako model‑soudce při hodnocení výstupů jiných generativních modelů na platformě Amazon SageMaker.[29]

Omezení a otevřené problémy

  • Uzavřenost architektury. Amazon nezveřejňuje počet parametrů, podrobná architektonická řešení ani složení trénovacích dat, což výrazně omezuje nezávislou reprodukovatelnost výsledků. Váhy modelů Nova nejsou poskytovány ke stažení ani nasazení mimo infrastrukturu AWS (nasazení on‑premise není možné).[1][2]
  • Výstupní limit. Maximální počet výstupních tokenů pro všechny modely pro porozumění je omezen na 10 tis. tokenů, což může být nedostatečné pro úlohy generování dlouhých dokumentů.[2]
  • Omezení RFT. Reinforcement Fine‑Tuning nepodporuje vícekolové (multi‑turn) dialogy a multimodální data; doporučený podíl pozitivních příkladů v datové sadě je nejméně 5 %.[27]
  • Omezení Nova Sonic. Maximální doba trvání spojení — 8 minut; maximálně 20 současných spojení na klienta ve výchozím nastavení.[2]
  • Regionální dostupnost. Nova Premier je dostupná pouze v jednom regionu (US East N. Virginia) bez podpory meziregionální inference; modely Nova 2 mají omezený seznam regionů nasazení.[2]
  • Citlivost metrik. Hodnocení na syntetických benchmarcích ne vždy koreluje s kvalitou práce v produkčních podmínkách (production), kde je kritické přísné dodržování firemních politik a absence halucinací ve víceúrovňových výstupech.[22][23]
  • Halucinace. Modely vykazují omezení typická pro LLM: v generovaných odpovědích se mohou vyskytovat faktické chyby. Pro snížení rizik se doporučuje využívání Bedrock Guardrails a RAG.[1]
  • Srovnávací objektivita benchmarků. Amazon uvádí srovnání s konkurenčními modely na základě dat zveřejněných samotnými vývojáři, což ne vždy zajišťuje jednotnou kontrolovanou experimentální základnu.[22]

Etické a regulační aspekty

AWS deklaruje dodržování principů odpovědné AI (Responsible AI) při vývoji modelů Nova. Konkrétní bezpečnostní opatření zahrnují:[20][15]

  • Vestavěná moderace obsahu (content moderation).
  • Vodoznaky (watermarking) pro audio výstupy Nova Sonic.
  • Hodnocení podle kategorií rizika: bezpečnost (safety), ochrana soukromí (privacy), věrohodnost (veracity), transparentnost (transparency) a šíření CBRN (chemických, biologických, radiologických a jaderných) zbraní a ofenzivní kybernetické operace.
  • Integrace s Amazon Bedrock Guardrails pro filtrování vstupních a výstupních dat.
  • Hodnocení modelu Nova Premier na shodu s Amazon Frontier Model Safety Framework.
  • Red teaming — interní a externí testování odolnosti vůči útokům (podle technické zprávy 307 technik).
  • Hodnocení moderace obsahu podle metriky F1: 85,84 na benchmarku Aegis (podle technické zprávy).[1]

Karty AI služeb (AI Service Cards) pro Nova Micro, Lite, Pro, Premier a Sonic jsou zveřejněny na docs.aws.amazon.com jako dokumentace odpovědného použití.[20][15]

Výhledy a směry výzkumu

Rodina Nova 2 naznačuje přechod k modelům s rozšířenými schopnostmi uvažování (extended thinking / reasoning), srovnatelnými konceptuálně s řetězcem myšlenek (Chain‑of‑Thought, CoT) a obdobnými mechanismy v jiných rodinách modelů. Vestavěné webové vyhledávání a interpret kódu jako nativní nástroje (nikoliv zásuvné moduly třetích stran) představují architektonický posun směrem k agentním systémům.[9][8]

Směry dalšího rozvoje uvedené ve veřejných materiálech Amazon:

  • Rozšíření multimodality (model Omni jako unifikovaná architektura „vše‑do‑všeho").
  • Hybridní uvažování (hybrid reasoning) s adaptivní hloubkou v závislosti na složitosti úlohy.
  • Otevřené trénování na uživatelských datech (Nova Forge) ve všech fázích předtrénování.
  • Distilace pro edge zařízení.
  • Rozšíření sady bezpečnostních nástrojů (safety toolkit).[8][11]

Tematika Amazon Nova AI Challenge, pořádané AWS mezi univerzitními týmy, zahrnuje směry automatizovaného adversariálního testování, vyrovnání bezpečnosti (safety alignment) a vícekolových útoků (multi‑turn jailbreaks), což svědčí o investicích do spolehlivosti rodiny modelů.[8]

Viz také

  • Transformer (architektura)
  • Reinforcement Learning from Human Feedback (RLHF)

Literatura

Odkazy

Poznámky

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/