Nova (Amazon) (SV)
Amazon Nova — en familj av grundmodeller (Foundation Models, FM) och stora språkmodeller (Large Language Model, LLM), utvecklad av divisionen Amazon Artificial General Intelligence (AAG Intelligence) och tillgänglig via den helthanterade tjänsten Amazon Bedrock. Familjen omfattar modeller för förståelse och generering av text, bearbetning av bilder, video och dokument samt syntes och igenkänning av tal. Amazon Nova positioneras som en ersättare för föregående generations modeller Amazon Titan och är integrerat i molnekosystemet Amazon Web Services (AWS).[1][2][3]
Historia och utvecklingstidslinje
Innan Nova lanserades gav plattformen Amazon Bedrock tillgång till tredjepartsmodeller: Anthropic Claude, Meta Llama, Mistral med flera. Amazon Nova blev den första familjen av grundmodeller med eget AWS-ursprung, inriktad på kommersiell användning i molninfrastruktur.[3]
Första generationen (2024–2025)
Den första generationen av Amazon Nova-familjen presenterades officiellt den 3 december 2024 på konferensen AWS re:Invent 2024. Den initiala versionen innehöll tre förståelsemodeller (understanding models) — Nova Micro (enbart text), de multimodala Nova Lite och Nova Pro — samt de generativa modellerna Nova Canvas (bildgenerering) och Nova Reel (videogenerering).[4][3][5]
I april 2025 utökades sortimentet med flaggskeppsmodellen Nova Premier — den kraftfullaste modellen i familjen med ett kontextfönster på 1 miljon token, avsedd för uppgifter med komplexa resonemang och destillation (distillation, kunskapsöverföring från en stor modell till en mindre). Samtidigt, i april 2025, presenterades Nova Sonic — en talmodell av klassen speech‑to‑speech med stöd för dialoger i realtid.[6][7]
Andra generationen — Nova 2 (2025–2026)
I november–december 2025 på konferensen AWS re:Invent 2025 tillkännagavs den andra generationen — Amazon Nova 2. Sortimentet inkluderade de uppdaterade modellerna Nova 2 Lite och Nova 2 Pro med stöd för dynamiskt resonemang (dynamic reasoning) och utökad kontextbearbetning, den nativa multimodala modellen Nova 2 Omni (simultan bearbetning och generering av text, bilder, video och ljud) samt Nova 2 Sonic — nästa generations talmodell. Samtidigt presenterades tjänsterna Nova Forge (miljö för anpassad modellträning) och Nova Act (ramverk för agentbaserade workflow).[8][9][10]
I februari 2026 publicerades den officiella tekniska rapporten för Amazon Nova 2.[11]
Samlad tidslinje
| Datum | Händelse |
|---|---|
| December 2024 | Tillkännagivande av Amazon Nova vid AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| April 2025 | Lansering av Nova Premier (kontext 1M token) och Nova Sonic (speech‑to‑speech) |
| Juni 2025 | Publicering av teknisk rapport för första generationen (arXiv:2506.12103) |
| November–December 2025 | Tillkännagivande av Nova 2 vid AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| Februari 2026 | Publicering av teknisk rapport för Amazon Nova 2 |
Teoretiska grunder och arkitektur
Grundläggande arkitektur för understanding-modeller
Enligt den tekniska rapporten arXiv:2506.12103 är förståelsemodellerna (Nova Micro, Lite, Pro, Premier) baserade på transformer-arkitekturen (Transformer), beskriven i arbetet av Vaswani et al.[12] Grundmekanismen för flerhövdat självuppmärksamhet (Multi‑Head Self‑Attention) beskrivs av formeln:
där , , — matriserna för frågor (queries), nycklar (keys) och värden (values) respektive, — dimensionen för nycklarna.[12][1]
De exakta arkitekturparametrarna (antal lager, storleken på det dolda tillståndet, antal uppmärksamhetshuvuden, totalt antal parametrar) har inte offentliggjorts i publikt tillgängliga källor per mars 2026. Detta tillvägagångssätt är typiskt för slutna kommersiella modeller.[1]
Multimodal bearbetning i Nova Lite och Nova Pro är implementerad genom sammanslagning av text-, visuella och video-token i en enda sekvens som matas in i en enhetlig språkmodell. Visuella kodare (vision encoders) omvandlar bilder och videoramar till sekvenser av token som är kompatibla med textrepresentationen.[1][13]
Arkitektur för generativa modeller
De generativa modellerna Nova Canvas (bilder) och Nova Reel (video) använder arkitekturen för latenta diffusionsmodeller (Latent Diffusion Models, LDM)[14] i kombination med variationella autoenkodare (Variational AutoEncoder, VAE) för beräkningar i det latenta rummet. Diffusionsprocessen beskrivs av ekvationen för framåtbrus:
där — den ursprungliga bilden i det latenta rummet, — dess brusiga version vid steget , — den kumulativa parametern för brusschemaläggning, — standardgaussiskt brus. Textkodaren (text encoder) tillhandahåller conditioning — att betinga genereringen på en textprompt.[13][14]
Arkitektur för talmodeller
Nova Sonic använder en arkitektur som skiljer sig från textmodellerna: den förenar en specialiserad talkodare (speech encoder), en taldekoder (speech renderer) och den primära multimodala språkmodellen i en enhetlig genomgående pipeline (end‑to‑end pipeline). Detta gör det möjligt att bearbeta talinmatning och generera talutmatning utan mellanliggande konvertering till text (även om textrepresentation används internt för att säkerställa kvaliteten).[15][1]
Träningsinfrastruktur
Training av Nova-modellerna utfördes på distribuerade kluster med AWS Elastic Kubernetes Service (EKS) med användning av Amazons egna AI-acceleratorer Amazon Trainium (instanser TRN1) samt grafikkorten NVIDIA A100 och H100.[13][1]
För att minska beräkningskostnaderna vid träning utvecklades och tillämpades specialiserade optimeringsmetoder:
- Super‑Selective Activation Checkpointing (SSC) — en metod för att spara aktiveringar som enligt den tekniska rapporten minskar grafikkortens minnesförbrukning med ungefär 50 % med minimala omkostnader för omberäkning (recomputation).[13]
- In‑CPU‑Memory Checkpointing — cachelagring av mellanliggande vikter (checkpoints) i centralprocessorernas (CPU) arbetsminne innan de asynkront laddas upp till molnlagringen Amazon S3. Enligt Amazon möjliggjorde detta tillvägagångssätt att minska tiden för att spara modellens tillstånd till 0,1 sekunder på instanser med TRN1.[16][13]
Träningspipeline och anpassning
Träningsprocessen för Nova-modellerna består av flera steg som är typiska för moderna LLM:[1][17]
Förträning (Pre‑training)
Storskalig träning på ett stort flerspråkigt och multimodalt datakorpus som inkluderar mer än 200 språk. Den exakta sammansättningen av träningsdata (volym, språkfördelning, specifika källor) anges inte i offentliga material.[1]
Övervakat finjustering (Supervised Fine‑Tuning, SFT)
Finjustering på annoterade exempel med par av "instruktion – svar", vilket anpassar modellen till att följa användarinstruktioner.[1]
Anpassning med hjälp av förstärkningsinlärning
För att anpassa modellens beteende till mänskliga preferenser används två huvudsakliga algoritmer:
Proximal Policy Optimization (PPO) — en förstärkningsinlärningsalgoritm baserad på mänsklig återkoppling (Reinforcement Learning from Human Feedback, RLHF), som använder en separat belöningsmodell (Reward Model).[18][1]
Direct Preference Optimization (DPO) — en alternativ anpassningsmetod som inte kräver en explicit belöningsmodell. Målfunktionen för DPO har formen:[19]
där:
- — den parametriserade strategin (den träningsbara modellen);
- — den grundläggande (frysta) referensmodellen;
- — inmatningsprompten (kontexten);
- och — det föredragna (winner) och det avvisade (loser) svaret respektive;
- — den logistiska (sigmoid) funktionen;
- — en hyperparameter som styr styrkan på straffet för avvikelse från grundmodellen (analogt med Kullback–Leibler-straffet, KL‑divergence penalty).[19][1]
Sammansättning av modellfamiljen
Modellfamiljen är uppdelad i nivåer (tiers) beroende på balansen mellan prestanda, kostnad och svarstid (latency).[2][20]
Förståelsemodeller från första generationen
| Parameter | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Inmatningsmodaliteter | Text | Text, bild, video | Text, bild, video | Text, bild, video |
| Utmatningsmodalitet | Text | Text | Text | Text |
| Kontextfönster | 128 tus. token | 300 tus. token | 300 tus. token | 1 milj. token |
| Max. utmatningstoken | 10 tus. | 10 tus. | 10 tus. | 10 tus. |
| Språkstöd | 200+ | 200+ | 200+ | 200+ |
| Finjustering (fine‑tuning) | Ja | Ja | Ja | Nej |
| Lanseringsdatum | December 2024 | December 2024 | December 2024 | April 2025 |
| Huvudsakligt syfte | Minimal svarstid och kostnad för textuppgifter | Grundläggande multimodal analys | Optimal balans för komplexa logiska och agentbaserade uppgifter | Maximal noggrannhet, lärarmodell för destillation |
Källa: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Optimerade språk (15): engelska, tyska, spanska, franska, italienska, japanska, koreanska, arabiska, kinesiska (förenklad), ryska, hindi, portugisiska, nederländska, turkiska, hebreiska.[2]
Nova Premier är avsedd för uppgifter som kräver djup kontextförståelse, flerstegplanering och hantering av stora datamängder: kodbaser, dokument på mer än 400 sidor, video med en längd på upp till 90 minuter.[6]
Modeller från andra generationen (Nova 2)
Nova 2 Lite och Nova 2 Pro lanserades i november–december 2025. Båda stöder utökat tänkande (extended thinking) — en mekanism där modellen utför flerastegiga resonemang innan svaret genereras. Resonemansdjupet regleras av parametern reasoning_effort med nivåerna low, medium och high. Kontextfönstret har utökats till 1 miljon token. Inbyggda ursprungliga verktyg ingår: webbsökning med bekräftelse (web grounding) och kodtolk (code interpreter).[9][8]
Nova 2 Omni — en nativ multimodal modell som kan ta emot text, bilder, video och ljud simultant och generera text och bilder. Kontextfönster — 1 milj. token.[8][11]
Nova 2 Sonic — nästa generations talmodell. Stöder 6 språk: engelska (amerikanskt och brittiskt uttal), spanska, tyska, franska, italienska. Introducerar asynkront anrop av verktyg (asynchronous tool calling) — modellen fortsätter bearbeta ny inmatning medan externa verktyg körs i bakgrunden.[10]
| Parameter | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Inmatningsmodaliteter | Text, bild, video | Text, bild, video | Text, bild, video, ljud | Ljud (tal) |
| Utmatningsmodalitet | Text | Text | Text, bild | Ljud (tal) |
| Kontextfönster | 1 milj. token | 1 milj. token | 1 milj. token | 300 tus. token |
| Extended thinking | Ja | Ja | Ja | — |
| Ursprungliga verktyg | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Lanseringsdatum | November–December 2025 | November–December 2025 | December 2025 | December 2025 |
Källa: AWS Blog; Amazon Science.[9][8][11]
Generativa modeller
Nova Canvas — en modell för bildgenerering. Stöder text- och bildinmatning (PNG, JPEG). Utmatningsupplösning — upp till 4,19 miljoner pixlar (t.ex. 2048×2048 eller 2816×1536 pixlar). Maximal promptlängd — 1024 tecken. Operationerna inpainting (ersättning av ett område i bilden) och outpainting (utökning av bilden utanför dess gränser) stöds.[2][4]
Nova Reel — en modell för videogenerering. Utmatningsupplösning: 1280×720 vid 24 bilder per sekund. Längden på genererad video — upp till 6 sekunder. Styrning av kamerarörelse (camera control) stöds. Åtkomst sker via ett asynkront API (Asynchronous Invoke Model API).[2][4]
Talmodeller
Nova Sonic (april 2025) — en talmodell med ett dubbelriktat strömmande API (bidirectional stream API). Stöder funktionsanrop (function calling) och förankring på företagsdata via Retrieval‑Augmented Generation (RAG, generering med tillgång till extern kunskap). Vattenmärkning (watermarking) är inbyggd som standard. Maximal anslutningstid — 8 minuter med möjlighet till återupptagning; maximalt 20 simultana anslutningar per klient (standardvärde).[7][15][2]
Nova 2 Sonic (december 2025) — nästa generations talmodell med förbättrad igenkänning av korta yttranden, telefonljud (8 kHz) och accenter.[10]
Utvärdering och benchmark
Utvärdering av Nova-modellerna genomfördes med hjälp av automatiserade benchmark, inklusive tillvägagångssättet "LLM‑as‑a‑judge" (användning av en språkmodell som bedömare). Enligt en studie från HKU SPACE AI Hub visar måttet Arena‑Hard‑Auto en korrelation på 98,6 % med expertbedömningar.[21][22]
Benchmark för första generationen
Data från den tekniska rapporten arXiv:2506.12103 (villkor: resultat från konkurrentmodellernas utvecklare, publicerade vid tidpunkten för rapportens utarbetande):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Källa: arXiv:2506.12103, tabell 2.1.1.[1]
Resultaten visar en prestationshierarki inom familjen (Premier > Pro > Lite > Micro). Gapet är mest märkbart inom kategorierna matematik (Math) och resonemang (Reasoning); inom rollspelsinteraktion (Roleplay) och informationsutvinning (Extraction) uppvisar de mindre modellerna resultat nära de större.[22]
Benchmark för andra generationen (Nova 2)
Data från den tekniska rapporten Amazon Nova 2 (villkor: internal measurements, 0‑shot / CoT där angivet):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Källa: Amazon Nova 2 Technical Report, tabell 1.[11]
Agentbaserade benchmark (Nova 2 Pro): SWE‑Bench Verified — 70,0 %; τ²‑bench Verified Telecom — 92,7 %.[11]
Multimodala benchmark (Nova 2 Omni): VideoMME — 77,9 %; MMMU Pro — 61,4 %.[11]
Vid utvärdering i tekniska supportuppgifter fick Nova 2 Lite 9,63 ± 0,27 på en tiogradig skala i måttet "Problemidentifiering" (Problem Identification), vilket klart överstiger Nova Lite från första generationen (8,57 ± 0,46).[23]
Notering. Vid jämförelse av resultat med konkurrerande modeller bör man beakta att villkoren för promptning, modellversioner och datum för mätning av mätvärden kan skilja sig åt. Benchmark för första och andra generationen är hämtade från Amazons egna rapporter; oberoende verifieringar (FloTorch, Artificial Analysis) bekräftar i stort det deklarerade förhållandet pris/prestanda, men noterar för vissa noggrannhetsmätvärden en eftersläpning jämfört med ledande konkurrenter.[22]
Slutledningshastighet
Enligt Amazons interna mätningar (internal, via Bedrock API):[1][11]
| Modell | Slutledningshastighet (token/s) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Användningskostnad
Alla modeller är tillgängliga via Amazon Bedrock enligt en betalningsmodell baserad på antalet bearbetade token (uppgifter per mars 2026):[2]
| Modell | Inmatningstoken (USD / 1M) | Utmatningstoken (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
För jämförelse: Anthropic Claude 3.5 Sonnet debiterades vid tidpunkten för Nova-lanseringen med $6,00 / 1M inmatningstoken och $30,00 / 1M utmatningstoken.[22]
Anpassning och finjustering
AWS-infrastrukturen tillhandahåller flera metoder för att anpassa Nova-grundmodellerna till specialiserade domäner. Det viktigaste verktyget för detta i den andra generationen är miljön Amazon Nova Forge.[8][17]
Continued Pre‑Training (CPT) och Mid‑Training
Nova Forge ger tillgång till mellanliggande träningscheckpoints för modellerna (t.ex. pretraining‑text‑RD och pretraining‑text‑CE). Detta gör det möjligt att fortsätta självövervakad inlärning (self‑supervised learning) på volymer av företagsdata med noggrann justering av inlärningshastigheten (learning rate) för att förhindra katastrofalt glömande (catastrophic forgetting).[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Uppdatering av endast ett litet delmängd av modellens vikter via adaptrar med låg rang — Low‑Rank Adaptation (LoRA)[26]. Detta tillvägagångssätt minskar väsentligen kraven på beräkningsresurser jämfört med fullständig finjustering (full fine‑tuning). Multimodalt fine‑tuning stöds för Nova Lite och Pro.[17]
Reinforcement Fine‑Tuning (RFT)
Anpassade modeller kan ytterligare finjusteras med förstärkningsbaserade metoder utifrån branschspecifika belöningsmätvärden, inklusive användning av en annan LLM som domarmodell (LLM‑as‑a‑judge).[27]
Modelldestillation (Model Distillation)
Funktionen Model Distillation gör det möjligt att använda Nova Premier eller Nova Pro som lärarmodell (teacher model) för att träna mindre elevmodeller (student models) — Nova Lite och Nova Micro. Detta minskar beräkningskostnaderna för inferens samtidigt som en väsentlig del av den stora modellens kvalitet bibehålls.[2][6]
Tillämpning och integration
Nova-modellerna är integrerade i Amazons beräkningstjänster (AWS Step Functions, AWS Lambda, Amazon Q Developer). De viktigaste dokumenterade användningsscenarierna:[2][1]
Agentbaserade arbetsflöden (Agentic Workflows)
Flerstegig uppgiftsutförande med hjälp av Bedrock Agents och anrop av externa verktyg (function calling). Med hjälp av det arkitekturella mönstret ReAct (Reasoning and Acting) i kombination med ramverk som LangGraph koordinerar Nova-modellerna databasanalys, genererar SQL-frågor från naturligt språk och hanterar sammansatta processer. Nova Act möjliggör automatisering av webbläsarbaserade UI-workflow med en deklarerad tillförlitlighet på 90 % för tidiga användaruppgifter.[28][8]
Generering med tillgång till extern kunskap (RAG)
Integration med Bedrock Knowledge Bases för förankring (grounding) av svar i företagsdata. Nova 2-modellerna stöder nativ webbsökning med bekräftelse (web grounding) som ett inbyggt verktyg.[1][9]
Dokumentbearbetning
Stödda format för inmatningsdokument: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (utom Nova Micro, som enbart tar emot textinmatning). Nova Premier kan bearbeta video med en längd på upp till 90 minuter inom ramen för en enda förfrågan.[2][6]
Kodgenerering och felsökning
Stödda programmeringsspråk: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Taligränssnitt
Nova Sonic och Nova 2 Sonic används för att bygga röstbaserade agenter med stöd för realtidsanvändning, integrerade med Amazon Connect.[10][7]
Modellutvärdering (LLM‑as‑a‑judge)
Nova används som domarmodell vid utvärdering av utdata från andra generativa modeller på plattformen Amazon SageMaker.[29]
Begränsningar och öppna problem
- Sluten arkitektur. Amazon offentliggör inte antalet parametrar, detaljerade arkitekturlösningar och sammansättningen av träningsdata, vilket avsevärt begränsar oberoende reproduktionsbarhet av resultat. Vikterna för Nova-modellerna tillhandahålls inte för nedladdning eller driftsättning utanför AWS-infrastruktur (lokal driftsättning är inte möjlig).[1][2]
- Utmatningsgräns. Det maximala antalet utmatningstoken för alla förståelsemodeller är begränsat till 10 tus. token, vilket kan vara otillräckligt för uppgifter som kräver generering av långa dokument.[2]
- Begränsningar i RFT. Reinforcement Fine‑Tuning stöder inte flertursdialog (multi‑turn) och multimodala data; den rekommenderade andelen positiva exempel i datamängden är minst 5 %.[27]
- Begränsningar i Nova Sonic. Maximal anslutningstid — 8 minuter; maximalt 20 simultana anslutningar per klient som standardvärde.[2]
- Regional tillgänglighet. Nova Premier är enbart tillgänglig i en region (US East N. Virginia) utan stöd för korsregional inferens; Nova 2-modellerna har en begränsad lista över driftsättningsregioner.[2]
- Mätvärdens känslighet. Poäng på syntetiska benchmark korrelerar inte alltid med kvaliteten i produktionsmiljöer (production), där strikt följsamhet till företagspolicyer och frånvaro av hallucinationer i flerstegiga slutledningar är avgörande.[22][23]
- Hallucinationer. Modellerna uppvisar begränsningar typiska för LLM: faktafel i genererade svar är möjliga. För att minska riskerna rekommenderas användning av Bedrock Guardrails och RAG.[1]
- Benchmarkens jämförande objektivitet. Amazon presenterar jämförelser med konkurrerande modeller baserade på data publicerade av respektive modellutvecklare, vilket inte alltid säkerställer en enhetlig kontrollerad experimentell bas.[22]
Etiska och regulatoriska aspekter
AWS deklarerar att man följer principerna för ansvarsfull AI (Responsible AI) vid utvecklingen av Nova-modellerna. Konkreta säkerhetsåtgärder inkluderar:[20][15]
- Inbyggd innehållsmoderering (content moderation).
- Vattenmärkning (watermarking) för ljudutdata från Nova Sonic.
- Utvärdering enligt riskkategorier: säkerhet (safety), konfidentialitet (privacy), trovärdighet (veracity), transparens (transparency) samt spridning av CBRN-vapen (kemiska, biologiska, radiologiska och nukleära) och offensiva cyberoperationer.
- Integration med Amazon Bedrock Guardrails för filtrering av in- och utmatningsdata.
- Utvärdering av Nova Premier-modellen mot Amazon Frontier Model Safety Framework.
- Red teaming — intern och extern testning av motståndskraft mot angrepp (enligt den tekniska rapporten, 307 tekniker).
- Utvärdering av innehållsmoderering med F1-måttet: 85,84 på benchmark Aegis (enligt den tekniska rapporten).[1]
AI-servicekort (AI Service Cards) för Nova Micro, Lite, Pro, Premier och Sonic har publicerats på docs.aws.amazon.com som dokumentation för ansvarsfull användning.[20][15]
Framtidsutsikter och forskningsinriktningar
Nova 2-familjen markerar övergången till modeller med utökade resonemangsfunktioner (extended thinking / reasoning), jämförbart konceptuellt med tankekedjor (Chain‑of‑Thought, CoT) och liknande mekanismer i andra modellfamiljer. Inbyggd webbsökning och kodtolk som ursprungliga verktyg (och inte externa plugin) representerar ett arkitekturellt skifte i riktning mot agentbaserade system.[9][8]
Inriktningar för fortsatt utveckling som anges i Amazons offentliga material:
- Utökning av multimodalitet (Omni-modellen som en enhetlig "allt-till-allt"-arkitektur).
- Hybridresonemang (hybrid reasoning) med adaptivt djup beroende på uppgiftens komplexitet.
- Öppen träning på användardata (Nova Forge) i alla stadier av förträning.
- Destillation för edge-enheter.
- Utvidgning av säkerhetsverktygslådan (safety toolkit).[8][11]
Tematiken för Amazon Nova AI Challenge, som genomförs av AWS bland universitetsteam, inkluderar inriktningarna automatiserad adversariell testning, säkerhetsanpassning (safety alignment) och flertursangrepp (multi‑turn jailbreaks), vilket vittnar om investeringar i modellfamiljens robusthet.[8]
Se även
- Transformer (arkitektur)
- Reinforcement Learning from Human Feedback (RLHF)
Litteratur
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, februari 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Externa länkar
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Officiell dokumentation för Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards för Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card för Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Tillkännagivande av Amazon Nova (december 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Tillkännagivande av Amazon Nova 2 (december 2025)
Noter
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/