Nova (Amazon) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — famiglia di modelli fondamentali (Foundation Models, FM) e modelli linguistici di grandi dimensioni (Large Language Model, LLM), sviluppata dalla divisione Amazon Artificial General Intelligence (AAG Intelligence) e disponibile tramite il servizio completamente gestito Amazon Bedrock. La famiglia comprende modelli per la comprensione e la generazione di testo, l'elaborazione di immagini, video e documenti, nonché la sintesi e il riconoscimento vocale. Amazon Nova è posizionata come sostituto della precedente generazione di modelli Amazon Titan ed è integrata nell'ecosistema cloud Amazon Web Services (AWS).[1][2][3]

Storia e cronologia dello sviluppo

Prima del lancio di Nova, la piattaforma Amazon Bedrock forniva accesso a modelli di terze parti: Anthropic Claude, Meta Llama, Mistral e altri. Amazon Nova è diventata la prima famiglia di modelli fondamentali di sviluppo interno di AWS, orientata all'impiego commerciale nell'infrastruttura cloud.[3]

Prima generazione (2024–2025)

La prima generazione della famiglia Amazon Nova è stata ufficialmente presentata il 3 dicembre 2024 alla conferenza AWS re:Invent 2024. Nel rilascio iniziale sono stati inclusi tre modelli di comprensione (understanding models) — Nova Micro (solo testo), i multimodali Nova Lite e Nova Pro, — oltre ai modelli generativi Nova Canvas (generazione di immagini) e Nova Reel (generazione di video).[4][3][5]

Nell'aprile 2025 la gamma è stata ampliata con il modello di punta Nova Premier — il modello più potente della famiglia, con una finestra di contesto di 1 milione di token, destinato a compiti con ragionamenti complessi e alla distillazione (distillation, trasferimento di conoscenza da un modello grande a uno più piccolo) di modelli.[6] Sempre nell'aprile 2025 è stato presentato Nova Sonic — un modello vocale della classe speech‑to‑speech con supporto per i dialoghi in tempo reale.[7]

Seconda generazione — Nova 2 (2025–2026)

In novembre–dicembre 2025, alla conferenza AWS re:Invent 2025, è stata annunciata la seconda generazione — Amazon Nova 2. La gamma comprende i modelli aggiornati Nova 2 Lite e Nova 2 Pro con supporto per il ragionamento dinamico (dynamic reasoning) e un'elaborazione del contesto ampliata, il modello multimodale nativo Nova 2 Omni (elaborazione e generazione simultanea di testo, immagini, video e audio), nonché Nova 2 Sonic — un modello vocale di nuova generazione. Contestualmente sono stati presentati i servizi Nova Forge (ambiente per l'addestramento personalizzato dei modelli) e Nova Act (framework per i workflow agentici).[8][9][10]

Nel febbraio 2026 è stato pubblicato il rapporto tecnico ufficiale di Amazon Nova 2.[11]

Cronologia riassuntiva

Data Evento
Dicembre 2024 Annuncio di Amazon Nova ad AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel
Aprile 2025 Rilascio di Nova Premier (contesto 1M token) e Nova Sonic (speech‑to‑speech)
Giugno 2025 Pubblicazione del rapporto tecnico della prima generazione (arXiv:2506.12103)
Novembre–Dicembre 2025 Annuncio di Nova 2 ad AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
Febbraio 2026 Pubblicazione del rapporto tecnico di Amazon Nova 2

Fondamenti teorici e architettura

Architettura di base dei modelli di comprensione

Secondo il rapporto tecnico arXiv:2506.12103, i modelli di comprensione (Nova Micro, Lite, Pro, Premier) sono basati sull'architettura transformer (Transformer), descritta nel lavoro di Vaswani et al.[12] Il meccanismo base di self-attention multi-head (Multi‑Head Self‑Attention) è descritto dalla formula:

Attention(Q,K,V)=softmax(QKdk)V

dove Q, K, V sono rispettivamente le matrici di query (queries), chiavi (keys) e valori (values), e dk è la dimensione delle chiavi.[12][1]

I parametri esatti dell'architettura (numero di livelli, dimensione dello stato nascosto, numero di teste di attenzione, numero totale di parametri) non sono stati resi noti nelle fonti pubblicamente disponibili alla data di marzo 2026. Tale approccio è tipico dei modelli commerciali proprietari.[1]

L'elaborazione multimodale in Nova Lite e Nova Pro è realizzata attraverso la fusione di token testuali, visivi e video in un'unica sequenza fornita in input a un singolo modello linguistico. I codificatori visivi (vision encoders) trasformano immagini e fotogrammi video in sequenze di token compatibili con la rappresentazione testuale.[1][13]

Architettura dei modelli generativi

I modelli generativi Nova Canvas (immagini) e Nova Reel (video) utilizzano l'architettura dei modelli di diffusione latente (Latent Diffusion Models, LDM)[14] in combinazione con autoencoder variazionali (Variational AutoEncoder, VAE) per i calcoli nello spazio latente. Il processo di diffusione è descritto dall'equazione del rumore diretto:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

dove x0 è l'immagine originale nello spazio latente, xt è la sua versione rumorosa al passo t, α¯t è il parametro cumulativo del piano di rumore (noise schedule), ϵ è il rumore gaussiano standard. Il codificatore testuale (text encoder) garantisce il conditioning — il condizionamento della generazione sul prompt testuale.[13][14]

Architettura dei modelli vocali

Nova Sonic utilizza un'architettura diversa da quella dei modelli testuali: combina un codificatore vocale specializzato (speech encoder), un decodificatore vocale (speech renderer) e il principale modello linguistico multimodale in un'unica pipeline end‑to‑end. Ciò consente di elaborare l'input vocale e generare output vocale senza conversione intermedia in testo (sebbene la rappresentazione testuale venga utilizzata internamente per garantire la qualità).[15][1]

Infrastruttura di addestramento

L'addestramento dei modelli Nova è stato effettuato su cluster distribuiti AWS Elastic Kubernetes Service (EKS) utilizzando gli acceleratori AI proprietari Amazon Trainium (istanze TRN1), nonché le unità di elaborazione grafica NVIDIA A100 e H100.[13][1]

Per ridurre i costi computazionali durante l'addestramento sono stati sviluppati e applicati metodi di ottimizzazione specializzati:

  • Super‑Selective Activation Checkpointing (SSC) — metodo di salvataggio delle attivazioni che, secondo i dati del rapporto tecnico, riduce il consumo di memoria delle unità di elaborazione grafica di circa il 50% con un overhead minimo per il ricalcolo (recomputation).[13]
  • In‑CPU‑Memory Checkpointing — memorizzazione nella cache dei pesi intermedi (checkpoints) nella memoria ad accesso casuale delle unità di elaborazione centrale (CPU) prima del loro scaricamento asincrono nell'archiviazione cloud Amazon S3. Secondo i dati di Amazon, questo approccio ha consentito di ridurre il tempo di salvataggio dello stato del modello a 0,1 secondi sulle istanze con TRN1.[16][13]

Pipeline di addestramento e allineamento

Il processo di addestramento dei modelli Nova è composto da diverse fasi, tipiche dei moderni LLM:[1][17]

Pre‑training - Pre-addestramento

Addestramento su larga scala su un ampio corpus di dati multilingue e multimodale che comprende più di 200 lingue. La composizione esatta dei dati di addestramento (volume, proporzione delle lingue, fonti specifiche) non viene riportata nei materiali pubblici.[1]

Supervised Fine‑Tuning (SFT) - Messa a punto supervisionata

Messa a punto su esempi etichettati di coppie «istruzione — risposta», che porta il modello a seguire le istruzioni dell'utente.[1]

Allineamento mediante apprendimento per rinforzo

Per allineare il comportamento del modello alle preferenze umane vengono applicati due algoritmi principali:

Proximal Policy Optimization (PPO) — algoritmo di apprendimento per rinforzo basato sul feedback umano (Reinforcement Learning from Human Feedback, RLHF), che utilizza un modello di ricompensa separato (Reward Model).[18][1]

Direct Preference Optimization (DPO) — metodo alternativo di allineamento che non richiede un modello di ricompensa esplicito. La funzione obiettivo DPO ha la forma:[19]

DPO(πθ;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]

dove:

  • πθ — la strategia parametrizzata (modello addestrabile);
  • πref — il modello di riferimento base (congelato);
  • x — il prompt di input (contesto);
  • yw e yl — rispettivamente la risposta preferita (winner) e quella scartata (loser);
  • σ — la funzione logistica (sigmoide);
  • β — iperparametro che controlla l'intensità della penalità per la deviazione dal modello base (analogo della penalità di Kullback–Leibler, KL‑divergence penalty).[19][1]

Composizione della famiglia di modelli

La famiglia di modelli è suddivisa in livelli (tiers) in base al bilanciamento tra prestazioni, costo e latenza (latency).[2][20]

Modelli di comprensione della prima generazione

Parametro Nova Micro Nova Lite Nova Pro Nova Premier
Modalità di input Testo Testo, immagine, video Testo, immagine, video Testo, immagine, video
Modalità di output Testo Testo Testo Testo
Finestra di contesto 128 mila token 300 mila token 300 mila token 1 milione di token
Numero massimo di token in output 10 mila 10 mila 10 mila 10 mila
Lingue supportate 200+ 200+ 200+ 200+
Fine‑tuning No
Data di rilascio Dicembre 2024 Dicembre 2024 Dicembre 2024 Aprile 2025
Destinazione principale Latenza e costo minimi per compiti testuali Analisi multimodale di base Bilanciamento ottimale per compiti logici complessi e agentici Massima precisione, modello insegnante per la distillazione

Fonte: AWS AI Service Cards; arXiv:2506.12103.[20][1]

Lingue ottimizzate (15): inglese, tedesco, spagnolo, francese, italiano, giapponese, coreano, arabo, cinese (semplificato), russo, hindi, portoghese, olandese, turco, ebraico.[2]

Nova Premier è destinata a compiti che richiedono una comprensione approfondita del contesto, pianificazione in più fasi e gestione di grandi volumi di dati: basi di codice, documenti di oltre 400 pagine, video della durata fino a 90 minuti.[6]

Modelli della seconda generazione (Nova 2)

Nova 2 Lite e Nova 2 Pro sono stati rilasciati in novembre–dicembre 2025. Entrambi supportano il ragionamento esteso (extended thinking) — un meccanismo in cui il modello esegue ragionamenti in più fasi prima di generare una risposta. La profondità del ragionamento è regolata dal parametro reasoning_effort con i livelli low, medium e high. La finestra di contesto è stata estesa a 1 milione di token. Sono integrati strumenti nativi: ricerca web con verifica (web grounding) e interprete di codice (code interpreter).[9][8]

Nova 2 Omni — modello multimodale nativo, in grado di ricevere simultaneamente in input testo, immagini, video e audio e di generare testo e immagini. La finestra di contesto è di 1 milione di token.[8][11]

Nova 2 Sonic — modello vocale di nuova generazione. Supporta 6 lingue: inglese (variante americana e britannica), spagnolo, tedesco, francese, italiano. Introduce la chiamata asincrona di strumenti (asynchronous tool calling) — il modello continua a elaborare il nuovo input mentre gli strumenti esterni vengono eseguiti in background.[10]

Parametro Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
Modalità di input Testo, immagine, video Testo, immagine, video Testo, immagine, video, audio Audio (voce)
Modalità di output Testo Testo Testo, immagine Audio (voce)
Finestra di contesto 1 milione di token 1 milione di token 1 milione di token 300 mila token
Extended thinking
Strumenti nativi Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
Data di rilascio Novembre–Dicembre 2025 Novembre–Dicembre 2025 Dicembre 2025 Dicembre 2025

Fonte: AWS Blog; Amazon Science.[9][8][11]

Modelli generativi

Nova Canvas — modello di generazione di immagini. Supporta input testuale e grafico (PNG, JPEG). Risoluzione di output — fino a 4,19 milioni di pixel (ad esempio, 2048×2048 o 2816×1536 pixel). Lunghezza massima del prompt — 1024 caratteri. Sono supportate le operazioni di inpainting (sostituzione di un'area dell'immagine) e outpainting (espansione dell'immagine oltre i suoi bordi).[2][4]

Nova Reel — modello di generazione di video. Risoluzione di output: 1280×720 a 24 fotogrammi al secondo. Durata del video generato — fino a 6 secondi. È supportato il controllo del movimento della telecamera (camera control). L'accesso avviene tramite API asincrona (Asynchronous Invoke Model API).[2][4]

Modelli vocali

Nova Sonic (aprile 2025) — modello vocale con API di streaming bidirezionale (bidirectional stream API). Supporta le chiamate di funzione (function calling) e il radicamento su dati aziendali tramite Retrieval‑Augmented Generation (RAG, generazione con il supporto di conoscenze esterne). La funzione di filigrana digitale (watermarking) è integrata per impostazione predefinita. Durata massima della connessione — 8 minuti con possibilità di ripresa; massimo 20 connessioni simultanee per client (valore predefinito).[7][15][2]

Nova 2 Sonic (dicembre 2025) — generazione successiva del modello vocale con migliorato riconoscimento di enunciati brevi, audio telefonico (8 kHz) e accenti.[10]

Valutazione e benchmark

La valutazione dei modelli Nova è stata condotta utilizzando benchmark automatizzati, incluso l'approccio «LLM‑as‑a‑judge» (utilizzo di un modello linguistico come valutatore). Secondo i dati dello studio HKU SPACE AI Hub, la metrica Arena‑Hard‑Auto dimostra una correlazione del 98,6% con le valutazioni degli esperti.[21][22]

Benchmark della prima generazione

Dati dal rapporto tecnico arXiv:2506.12103 (condizioni: risultati degli sviluppatori dei modelli concorrenti, pubblicati al momento della preparazione del rapporto):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

Fonte: arXiv:2506.12103, tabella 2.1.1.[1]

I risultati mostrano la gerarchia delle prestazioni all'interno della famiglia (Premier > Pro > Lite > Micro). Il divario è più evidente nelle categorie matematica (Math) e ragionamento (Reasoning); nei compiti di interazione di ruolo (Roleplay) e di estrazione di informazioni (Extraction) i modelli di livello inferiore mostrano risultati vicini a quelli dei modelli superiori.[22]

Benchmark della seconda generazione (Nova 2)

Dati dal rapporto tecnico di Amazon Nova 2 (condizioni: misurazioni interne, 0‑shot / CoT dove indicato):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

Fonte: Amazon Nova 2 Technical Report, tabella 1.[11]

Benchmark agentici (Nova 2 Pro): SWE‑Bench Verified — 70,0%; τ²‑bench Verified Telecom — 92,7%.[11]

Benchmark multimodali (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]

Nella valutazione su compiti di supporto tecnico, Nova 2 Lite ha ottenuto 9,63 ± 0,27 su una scala di dieci punti nella metrica «Identificazione del problema» (Problem Identification), superando significativamente Nova Lite della prima generazione (8,57 ± 0,46).[23]

Nota. Nel confrontare i risultati con i modelli concorrenti è necessario tenere conto del fatto che le condizioni di prompting, le versioni dei modelli e le date di rilevamento delle metriche possono differire. I benchmark della prima e della seconda generazione provengono da auto-dichiarazioni di Amazon; le verifiche indipendenti (FloTorch, Artificial Analysis) confermano in linea generale il rapporto qualità/prezzo dichiarato, ma per alcune metriche di precisione registrano un ritardo rispetto ai principali concorrenti.[22]

Velocità di inferenza

Secondo le misurazioni interne di Amazon (internal, tramite Bedrock API):[1][11]

Modello Velocità di inferenza (token/s)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

Costo d'utilizzo

Tutti i modelli sono disponibili tramite Amazon Bedrock con un modello di pagamento per il numero di token elaborati (dati a marzo 2026):[2]

Modello Token di input (USD / 1M) Token di output (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

Per confronto: Anthropic Claude 3.5 Sonnet al momento del rilascio di Nova era tariffato a $6,00 / 1M token di input e $30,00 / 1M token di output.[22]

Personalizzazione e fine‑tuning

L'infrastruttura AWS offre diversi metodi per adattare i modelli base Nova a domini altamente specializzati. Lo strumento principale per questo nella seconda generazione è l'ambiente Amazon Nova Forge.[8][17]

Continued Pre‑Training (CPT) e Mid‑Training

Nova Forge fornisce l'accesso ai checkpoint intermedi di addestramento dei modelli (ad esempio, pretraining‑text‑RD e pretraining‑text‑CE). Ciò consente di continuare l'auto-apprendimento (self‑supervised learning) su grandi volumi di dati aziendali con un'attenta selezione del tasso di apprendimento (learning rate) per prevenire la dimenticanza catastrofica (catastrophic forgetting).[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

Aggiornamento di solo un piccolo sottoinsieme dei pesi del modello tramite adattatori a basso rango — Low‑Rank Adaptation (LoRA)[26]. Questo approccio riduce sostanzialmente i requisiti di risorse computazionali rispetto al fine‑tuning completo (full fine‑tuning). È supportato il fine‑tuning multimodale per Nova Lite e Pro.[17]

Reinforcement Fine‑Tuning (RFT)

I modelli personalizzati possono essere ulteriormente messi a punto con metodi di apprendimento per rinforzo sulla base di metriche di ricompensa specifiche del settore, anche utilizzando un altro LLM come modello giudice (LLM‑as‑a‑judge).[27]

Distillazione dei modelli (Model Distillation)

La funzione Model Distillation consente di utilizzare Nova Premier o Nova Pro come modello insegnante (teacher model) per addestrare modelli studente più piccoli (student models) — Nova Lite e Nova Micro. Ciò riduce i costi computazionali dell'inferenza mantenendo una quota significativa della qualità del modello grande.[2][6]

Applicazioni e integrazione

I modelli Nova sono integrati nei servizi di calcolo di Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Principali scenari d'uso documentati:[2][1]

Flussi di lavoro agentici (Agentic Workflows)

Esecuzione in più fasi di compiti utilizzando Bedrock Agents e la chiamata di strumenti esterni (function calling). Utilizzando il pattern architetturale ReAct (Reasoning and Acting) in combinazione con framework come LangGraph, i modelli Nova coordinano l'analisi di database, formulano query SQL dal linguaggio naturale e gestiscono processi composti da più elementi. Nova Act garantisce l'automazione dei workflow UI del browser con un'affidabilità dichiarata del 90% sui compiti iniziali degli utenti.[28][8]

Generazione con il supporto di conoscenze esterne (RAG)

Integrazione con Bedrock Knowledge Bases per il radicamento (grounding) delle risposte su dati aziendali. I modelli Nova 2 supportano la ricerca web nativa con verifica (web grounding) come strumento integrato.[1][9]

Elaborazione di documenti

Formati di documenti di input supportati: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (eccetto Nova Micro, che accetta solo input testuale). Nova Premier è in grado di elaborare video della durata fino a 90 minuti nell'ambito di un'unica richiesta.[2][6]

Generazione e debug del codice

Linguaggi di programmazione supportati: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

Interfacce vocali

Nova Sonic e Nova 2 Sonic vengono utilizzati per costruire agenti vocali con supporto in tempo reale, integrati con Amazon Connect.[10][7]

Valutazione dei modelli (LLM‑as‑a‑judge)

Nova viene utilizzato come modello giudice nella valutazione degli output di altri modelli generativi sulla piattaforma Amazon SageMaker.[29]

Limitazioni e problemi aperti

  • Architettura proprietaria. Amazon non divulga il numero di parametri, le soluzioni architetturali dettagliate e la composizione dei dati di addestramento, il che limita sostanzialmente la riproducibilità indipendente dei risultati. I pesi dei modelli Nova non vengono forniti per il download o per la distribuzione al di fuori dell'infrastruttura AWS (la distribuzione on‑premise non è possibile).[1][2]
  • Limite di output. Il numero massimo di token di output per tutti i modelli di comprensione è limitato a 10 mila token, il che potrebbe essere insufficiente per i compiti di generazione di documenti lunghi.[2]
  • Limitazioni dell'RFT. Il Reinforcement Fine‑Tuning non supporta dialoghi multi-turno (multi‑turn) e dati multimodali; la proporzione raccomandata di esempi positivi nel dataset è di almeno il 5%.[27]
  • Limitazioni di Nova Sonic. Durata massima della connessione — 8 minuti; massimo 20 connessioni simultanee per client per impostazione predefinita.[2]
  • Disponibilità regionale. Nova Premier è disponibile in un solo regione (US East N. Virginia) senza supporto per l'inferenza cross-regionale; i modelli Nova 2 hanno un elenco limitato di regioni di distribuzione.[2]
  • Sensibilità delle metriche. Le valutazioni sui benchmark sintetici non sempre correlano con la qualità del lavoro in condizioni di produzione (production), dove sono critici il rispetto rigoroso delle politiche aziendali e l'assenza di allucinazioni nelle inferenze a più fasi.[22][23]
  • Allucinazioni. I modelli mostrano limitazioni tipiche degli LLM: sono possibili errori fattuali nelle risposte generate. Per ridurre i rischi si raccomanda l'utilizzo di Bedrock Guardrails e RAG.[1]
  • Obiettività comparativa dei benchmark. Amazon fornisce confronti con modelli concorrenti sulla base di dati pubblicati dagli stessi sviluppatori, il che non garantisce sempre una base sperimentale controllata uniforme.[22]

Aspetti etici e normativi

AWS dichiara il rispetto dei principi dell'IA responsabile (Responsible AI) nello sviluppo dei modelli Nova. Le misure di sicurezza concrete comprendono:[20][15]

  • Moderazione integrata dei contenuti (content moderation).
  • Filigrane digitali (watermarking) per gli output audio di Nova Sonic.
  • Valutazione per categorie di rischio: sicurezza (safety), privacy (privacy), veridicità (veracity), trasparenza (transparency), nonché proliferazione di armi CBRN (chimiche, biologiche, radiologiche e nucleari) e operazioni informatiche offensive.
  • Integrazione con Amazon Bedrock Guardrails per il filtraggio dei dati di input e output.
  • Valutazione del modello Nova Premier in conformità con Amazon Frontier Model Safety Framework.
  • Red teaming — test interni ed esterni sulla resistenza agli attacchi (secondo i dati del rapporto tecnico, 307 tecniche).
  • Valutazione della moderazione dei contenuti con la metrica F1: 85,84 sul benchmark Aegis (secondo i dati del rapporto tecnico).[1]

Le schede del servizio AI (AI Service Cards) per Nova Micro, Lite, Pro, Premier e Sonic sono pubblicate su docs.aws.amazon.com come documentazione per un utilizzo responsabile.[20][15]

Prospettive e direzioni di ricerca

La famiglia Nova 2 segna il passaggio a modelli con capacità di ragionamento estese (extended thinking / reasoning), comparabili per concetto alla catena del pensiero (Chain‑of‑Thought, CoT) e a meccanismi analoghi in altre famiglie di modelli. La ricerca web integrata e l'interprete di codice come strumenti nativi (e non come plugin di terze parti) rappresentano uno spostamento architetturale nella direzione dei sistemi agentici.[9][8]

Direzioni di ulteriore sviluppo indicate nei materiali pubblici di Amazon:

  • Espansione della multimodalità (il modello Omni come architettura unificata «tutto-in-tutto»).
  • Ragionamento ibrido (hybrid reasoning) con profondità adattiva in base alla complessità del compito.
  • Addestramento aperto su dati degli utenti (Nova Forge) in tutte le fasi del pre-addestramento.
  • Distillazione per dispositivi edge.
  • Ampliamento del toolkit di sicurezza (safety toolkit).[8][11]

La tematica dell'Amazon Nova AI Challenge, condotto da AWS tra i team universitari, include le direzioni del test avversariale automatizzato, dell'allineamento della sicurezza (safety alignment) e degli attacchi multi-turno (multi‑turn jailbreaks), il che testimonia gli investimenti nell'affidabilità della famiglia di modelli.[8]

Vedi anche

  • Transformer (architettura)
  • Reinforcement Learning from Human Feedback (RLHF)

Collegamenti esterni

Letteratura

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/