Nova (Amazon) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — familie de modele fundamentale (Foundation Models, FM) și modele lingvistice de mari dimensiuni (Large Language Model, LLM), dezvoltată de divizia Amazon Artificial General Intelligence (AAG Intelligence) și disponibilă prin serviciul complet administrat Amazon Bedrock. Familia acoperă modele pentru înțelegerea și generarea de text, procesarea imaginilor, a videoclipurilor și a documentelor, precum și sinteza și recunoașterea vorbirii. Amazon Nova este poziționată ca înlocuitor al generației anterioare de modele Amazon Titan și este integrată în ecosistemul cloud Amazon Web Services (AWS).[1][2][3]

Istoric și cronologia dezvoltării

Înainte de lansarea Nova, platforma Amazon Bedrock oferea acces la modele terțe: Anthropic Claude, Meta Llama, Mistral și altele. Amazon Nova a devenit prima familie de modele fundamentale dezvoltate intern de AWS, orientată spre utilizarea comercială în infrastructura cloud.[3]

Prima generație (2024–2025)

Prima generație a familiei Amazon Nova a fost prezentată oficial pe 3 decembrie 2024, la conferința AWS re:Invent 2024. Versiunea inițială a inclus trei modele de înțelegere (understanding models) — Nova Micro (doar text), multimodalele Nova Lite și Nova Pro —, precum și modelele generative Nova Canvas (generare de imagini) și Nova Reel (generare de videoclipuri).[4][3][5]

În aprilie 2025, gama a fost completată cu modelul emblematic Nova Premier — cel mai puternic model al familiei, cu o fereastră contextuală de 1 milion de tokenuri, destinat sarcinilor cu raționamente complexe și distilării (distillation, transferul cunoștințelor de la un model mare la unul mai mic) modelelor.[6] Tot în aprilie 2025 a fost prezentat Nova Sonic — un model vocal din clasa speech‑to‑speech cu suport pentru dialoguri în timp real.[7]

A doua generație — Nova 2 (2025–2026)

În noiembrie–decembrie 2025, la conferința AWS re:Invent 2025, a fost anunțată a doua generație — Amazon Nova 2. Gama include modelele actualizate Nova 2 Lite și Nova 2 Pro cu suport pentru raționamente dinamice (dynamic reasoning) și procesare extinsă a contextului, modelul nativ multimodal Nova 2 Omni (procesare și generare simultană de text, imagini, videoclipuri și audio), precum și Nova 2 Sonic — modelul vocal de generație următoare. Totodată, au fost prezentate serviciile Nova Forge (mediu pentru antrenarea personalizată a modelelor) și Nova Act (framework pentru workflow-uri agentice).[8][9][10]

În februarie 2026, a fost publicat raportul tehnic oficial Amazon Nova 2.[11]

Cronologie sintetică

Dată Eveniment
Decembrie 2024 Anunțul Amazon Nova la AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel
Aprilie 2025 Lansarea Nova Premier (context 1M tokenuri) și Nova Sonic (speech‑to‑speech)
Iunie 2025 Publicarea raportului tehnic al primei generații (arXiv:2506.12103)
Noiembrie–Decembrie 2025 Anunțul Nova 2 la AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
Februarie 2026 Publicarea raportului tehnic Amazon Nova 2

Fundamente teoretice și arhitectură

Arhitectura de bază a modelelor de înțelegere (understanding models)

Conform raportului tehnic arXiv:2506.12103, modelele de înțelegere (Nova Micro, Lite, Pro, Premier) se bazează pe arhitectura transformer (Transformer), descrisă în lucrarea Vaswani et al.[12] Mecanismul de bază al atenției multi-cap cu auto-atenție (Multi‑Head Self‑Attention) este descris prin formula:

Attention(Q,K,V)=softmax(QKopdk)V

unde Q, K, V sunt matricele de interogări (queries), chei (keys) și valori (values), respectiv, iar dk reprezintă dimensiunea cheilor.[12][1]

Parametrii exacți ai arhitecturii (numărul de straturi, dimensiunea stării ascunse, numărul de capete de atenție, numărul total de parametri) nu sunt dezvăluiți în sursele disponibile public la data de martie 2026. Această abordare este caracteristică modelelor comerciale închise.[1]

Procesarea multimodală în Nova Lite și Nova Pro este realizată prin combinarea tokenurilor de text, vizuale și video într-o secvență unică, furnizată ca intrare unui singur model lingvistic. Encoderele vizuale (vision encoders) transformă imaginile și cadrele video în secvențe de tokenuri compatibile cu reprezentarea textuală.[1][13]

Arhitectura modelelor generative

Modelele generative Nova Canvas (imagini) și Nova Reel (videoclipuri) utilizează arhitectura modelelor de difuzie latentă (Latent Diffusion Models, LDM)[14] în combinație cu autoencoderul variațional (Variational AutoEncoder, VAE) pentru calculele în spațiul latent. Procesul de difuzie este descris prin ecuația zgomotului direct:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

unde x0 este imaginea originală în spațiul latent, xt — versiunea sa zgomotoasă la pasul t, α¯t — parametrul cumulativ al planificării zgomotului, ϵ — zgomot gaussian standard. Encoderul de text (text encoder) asigură conditioning — condiționarea generării pe baza promptului textual.[13][14]

Arhitectura modelelor vocale

Nova Sonic utilizează o arhitectură diferită față de modelele textuale: combină un encoder vocal specializat (speech encoder), un decoder vocal (speech renderer) și un model lingvistic multimodal principal într-un pipeline end-to-end unificat. Aceasta permite procesarea intrării vocale și generarea ieșirii vocale fără conversie intermediară în text (deși reprezentarea textuală este utilizată intern pentru asigurarea calității).[15][1]

Infrastructura de antrenare

Antrenarea modelelor Nova s-a realizat pe clustere distribuite AWS Elastic Kubernetes Service (EKS), folosind acceleratoarele AI proprii Amazon Trainium (instanțe TRN1), precum și procesoare grafice NVIDIA A100 și H100.[13][1]

Pentru reducerea costurilor computaționale de antrenare, au fost dezvoltate și aplicate metode specializate de optimizare:

  • Super‑Selective Activation Checkpointing (SSC) — metodă de salvare a activărilor care, conform raportului tehnic, reduce consumul de memorie al procesoarelor grafice cu aproximativ 50% la costuri minime de recalculare (recomputation).[13]
  • In‑CPU‑Memory Checkpointing — stocarea în cache a ponderilor intermediare (checkpoints) în memoria RAM a procesoarelor centrale (CPU) înainte de descărcarea lor asincronă în depozitul cloud Amazon S3. Conform Amazon, această abordare a redus timpul de salvare a stării modelului la 0,1 secunde pe instanțele cu TRN1.[16][13]

Pipeline-ul de antrenare și alinierea

Procesul de antrenare a modelelor Nova constă din mai multe etape, caracteristice LLM-urilor moderne:[1][17]

Pre-antrenare (Pre‑training)

Antrenare la scară largă pe un corpus de date multilingv și multimodal extins, cuprinzând peste 200 de limbi. Compoziția exactă a datelor de antrenare (volum, raportul limbilor, sursele concrete) nu este precizată în materialele publice.[1]

Ajustare fină supervizată (Supervised Fine‑Tuning, SFT)

Ajustare fină pe exemple adnotate de perechi „instrucțiune — răspuns", aducând modelul la respectarea instrucțiunilor utilizatorului.[1]

Aliniere prin învățare prin recompensă

Pentru alinierea comportamentului modelului cu preferințele umane se aplică doi algoritmi principali:

Proximal Policy Optimization (PPO) — algoritm de Reinforcement Learning from Human Feedback (RLHF) care utilizează un model de recompensă separat (Reward Model).[18][1]

Direct Preference Optimization (DPO) — metodă alternativă de aliniere care nu necesită un model de recompensă explicit. Funcția obiectiv DPO are forma:[19]

DPO(πheta;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπheta(ywx)πref(ywx)βlogπheta(ylx)πref(ylx))]

unde:

  • πheta — strategia parametrizată (modelul antrenat);
  • πref — modelul de referință de bază (înghețat);
  • x — promptul de intrare (contextul);
  • yw și yl — răspunsurile preferat (winner) și, respectiv, respins (loser);
  • σ — funcția logistică (sigmoidă);
  • β — hiperparametru care controlează intensitatea penalizării pentru abaterea de la modelul de bază (analog cu penalizarea Kullback–Leibler, KL‑divergence penalty).[19][1]

Componența familiei de modele

Familia de modele este împărțită în niveluri (tiers) în funcție de echilibrul dintre performanță, cost și latență (latency).[2][20]

Modelele de înțelegere din prima generație

Parametru Nova Micro Nova Lite Nova Pro Nova Premier
Modalități de intrare Text Text, imagine, video Text, imagine, video Text, imagine, video
Modalitate de ieșire Text Text Text Text
Fereastră contextuală 128 mii tokenuri 300 mii tokenuri 300 mii tokenuri 1 milion tokenuri
Tokenuri de ieșire max. 10 mii 10 mii 10 mii 10 mii
Suport limbi 200+ 200+ 200+ 200+
Ajustare fină (fine‑tuning) Da Da Da Nu
Data lansării Decembrie 2024 Decembrie 2024 Decembrie 2024 Aprilie 2025
Destinație principală Latență și cost minime pentru sarcini textuale Analiză multimodală de bază Echilibru optim pentru sarcini logice complexe și agentice Precizie maximă, model-profesor pentru distilare

Sursă: AWS AI Service Cards; arXiv:2506.12103.[20][1]

Limbi optimizate (15): engleză, germană, spaniolă, franceză, italiană, japoneză, coreeană, arabă, chineză (simplificată), rusă, hindi, portugheză, olandeză, turcă, ebraică.[2]

Nova Premier este destinată sarcinilor care necesită înțelegere profundă a contextului, planificare în mai mulți pași și lucrul cu volume mari de date: baze de cod, documente de peste 400 de pagini, videoclipuri de până la 90 de minute.[6]

Modelele din a doua generație (Nova 2)

Nova 2 Lite și Nova 2 Pro au fost lansate în noiembrie–decembrie 2025. Ambele suportă gândirea extinsă (extended thinking) — un mecanism prin care modelul efectuează raționamente în mai mulți pași înainte de a genera un răspuns. Adâncimea raționamentului este reglată prin parametrul reasoning_effort cu nivelurile low, medium și high. Fereastra contextuală a fost extinsă la 1 milion de tokenuri. Sunt integrate instrumente native: căutare web cu confirmare (web grounding) și interpret de cod (code interpreter).[9][8]

Nova 2 Omni — model nativ multimodal, capabil să primească simultan la intrare text, imagini, videoclipuri și audio și să genereze text și imagini. Fereastra contextuală — 1 milion de tokenuri.[8][11]

Nova 2 Sonic — model vocal de generație următoare. Suportă 6 limbi: engleză (variantele americană și britanică), spaniolă, germană, franceză, italiană. Introduce apelarea asincronă a instrumentelor (asynchronous tool calling) — modelul continuă să proceseze noile intrări în timp ce instrumentele externe se execută în fundal.[10]

Parametru Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
Modalități de intrare Text, imagine, video Text, imagine, video Text, imagine, video, audio Audio (voce)
Modalitate de ieșire Text Text Text, imagine Audio (voce)
Fereastră contextuală 1 milion tokenuri 1 milion tokenuri 1 milion tokenuri 300 mii tokenuri
Extended thinking Da Da Da
Instrumente native Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
Data lansării Noiembrie–Decembrie 2025 Noiembrie–Decembrie 2025 Decembrie 2025 Decembrie 2025

Sursă: AWS Blog; Amazon Science.[9][8][11]

Modelele generative

Nova Canvas — model de generare a imaginilor. Suportă intrare textuală și grafică (PNG, JPEG). Rezoluția de ieșire — până la 4,19 milioane de pixeli (de exemplu, 2048×2048 sau 2816×1536 pixeli). Lungimea maximă a promptului — 1024 de caractere. Sunt suportate operațiile inpainting (înlocuirea unei zone din imagine) și outpainting (extinderea imaginii dincolo de granițele sale).[2][4]

Nova Reel — model de generare a videoclipurilor. Rezoluția de ieșire: 1280×720 la 24 de cadre pe secundă. Durata videoclipului generat — până la 6 secunde. Este suportat controlul mișcării camerei (camera control). Accesul se realizează printr-un API asincron (Asynchronous Invoke Model API).[2][4]

Modelele vocale

Nova Sonic (aprilie 2025) — model vocal cu API de streaming bidirecțional (bidirectional stream API). Suportă apeluri funcționale (function calling) și ancorarea pe date corporative prin Retrieval‑Augmented Generation (RAG, generare cu accesarea cunoștințelor externe). Funcția de marcaj de apă (watermarking) este activată implicit. Durata maximă a conexiunii — 8 minute cu posibilitate de reluare; maximum 20 de conexiuni simultane per client (valoare implicită).[7][15][2]

Nova 2 Sonic (decembrie 2025) — generația următoare a modelului vocal, cu recunoaștere îmbunătățită a enunțurilor scurte, a audio-ului telefonic (8 kHz) și a accentelor.[10]

Evaluare și benchmark-uri

Evaluarea modelelor Nova s-a realizat folosind benchmark-uri automatizate, inclusiv abordarea „LLM‑as‑a‑judge" (utilizarea unui model lingvistic ca evaluator). Conform unui studiu al HKU SPACE AI Hub, metrica Arena‑Hard‑Auto demonstrează o corelație de 98,6% cu evaluările experților.[21][22]

Benchmark-urile primei generații

Date din raportul tehnic arXiv:2506.12103 (condiții: rezultatele dezvoltatorilor modelelor concurente, publicate la momentul elaborării raportului):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

Sursă: arXiv:2506.12103, tabelul 2.1.1.[1]

Rezultatele evidențiază ierarhia de performanță în cadrul familiei (Premier > Pro > Lite > Micro). Decalajul este cel mai pronunțat în categoriile matematică (Math) și raționament (Reasoning); la sarcinile de joc de rol (Roleplay) și extragere de informații (Extraction), modelele mai mici obțin rezultate apropiate de cele ale modelelor superioare.[22]

Benchmark-urile celei de-a doua generații (Nova 2)

Date din raportul tehnic Amazon Nova 2 (condiții: internal measurements, 0‑shot / CoT unde este indicat):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

Sursă: Amazon Nova 2 Technical Report, tabelul 1.[11]

Benchmark-uri agentice (Nova 2 Pro): SWE‑Bench Verified — 70,0%; τ²‑bench Verified Telecom — 92,7%.[11]

Benchmark-uri multimodale (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]

La evaluarea în sarcini de suport tehnic, Nova 2 Lite a obținut 9,63 ± 0,27 pe o scară de zece puncte la metrica „Identificarea problemei" (Problem Identification), depășind semnificativ Nova Lite din prima generație (8,57 ± 0,46).[23]

Notă. La compararea rezultatelor cu modele concurente, trebuie luat în considerare că condițiile de prompting, versiunile modelelor și datele de colectare a metricilor pot diferi. Benchmark-urile primei și celei de-a doua generații provin din rapoartele proprii ale Amazon; verificările independente (FloTorch, Artificial Analysis) confirmă în general raportul preț/performanță declarat, însă pentru anumite metrici de precizie înregistrează un decalaj față de principalii concurenți.[22]

Viteza de inferență

Conform măsurătorilor interne ale Amazon (internal, prin Bedrock API):[1][11]

Model Viteza de inferență (tokenuri/s)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

Costul utilizării

Toate modelele sunt disponibile prin Amazon Bedrock cu un model de plată per număr de tokenuri procesate (date la martie 2026):[2]

Model Tokenuri de intrare (USD / 1M) Tokenuri de ieșire (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

Pentru comparație: Anthropic Claude 3.5 Sonnet la momentul lansării Nova era tarifat la $6,00 / 1M tokenuri de intrare și $30,00 / 1M tokenuri de ieșire.[22]

Personalizare și ajustare fină

Infrastructura AWS oferă mai multe metode de adaptare a modelelor de bază Nova pentru domenii foarte specializate. Principalul instrument în acest scop în cadrul celei de-a doua generații este mediul Amazon Nova Forge.[8][17]

Continued Pre‑Training (CPT) și Mid‑Training

Nova Forge deschide accesul la punctele de control intermediare ale antrenării modelelor (de exemplu, pretraining‑text‑RD și pretraining‑text‑CE). Aceasta permite continuarea auto-antrenării (self‑supervised learning) pe corpusuri de date corporative, cu o selecție atentă a ratei de învățare (learning rate) pentru prevenirea uitării catastrofale (catastrophic forgetting).[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

Actualizarea doar a unui subset restrâns de ponderi ale modelului prin adaptoare de rang redus — Low‑Rank Adaptation (LoRA)[26]. Această abordare reduce semnificativ cerințele de resurse computaționale comparativ cu ajustarea fină completă (full fine‑tuning). Este suportat fine‑tuning-ul multimodal pentru Nova Lite și Pro.[17]

Reinforcement Fine‑Tuning (RFT)

Modelele personalizate pot fi ajustate suplimentar prin metode de recompensă bazate pe metrici specifice industriei, inclusiv cu utilizarea unui alt LLM ca model-judecător (LLM‑as‑a‑judge).[27]

Distilarea modelelor (Model Distillation)

Funcția Model Distillation permite utilizarea Nova Premier sau Nova Pro ca model-profesor (teacher model) pentru antrenarea unor modele-elev (student models) mai mici — Nova Lite și Nova Micro. Aceasta reduce costurile computaționale de inferență păstrând în același timp o parte semnificativă din calitatea modelului mai mare.[2][6]

Aplicare și integrare

Modelele Nova sunt integrate în serviciile de calcul Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Principalele scenarii de utilizare documentate:[2][1]

Fluxuri de lucru agentice (Agentic Workflows)

Executarea în mai mulți pași a sarcinilor folosind Bedrock Agents și apelarea de instrumente externe (function calling). Utilizând șablonul arhitectural ReAct (Reasoning and Acting) împreună cu framework-uri de tip LangGraph, modelele Nova coordonează analiza bazelor de date, generează interogări SQL din limbaj natural și gestionează procese cu mai multe componente. Nova Act asigură automatizarea workflow-urilor UI din browser cu o fiabilitate declarată de 90% pe sarcinile timpurii ale utilizatorilor.[28][8]

Generare cu accesarea cunoștințelor externe (RAG)

Integrare cu Bedrock Knowledge Bases pentru ancorarea (grounding) răspunsurilor pe date corporative. Modelele Nova 2 suportă căutarea web nativă cu confirmare (web grounding) ca instrument integrat.[1][9]

Procesarea documentelor

Formatele de documente de intrare suportate: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (cu excepția Nova Micro, care acceptă doar intrare textuală). Nova Premier poate procesa videoclipuri de până la 90 de minute în cadrul unei singure cereri.[2][6]

Generarea și depanarea codului

Limbaje de programare suportate: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

Interfețe vocale

Nova Sonic și Nova 2 Sonic sunt utilizate pentru construirea de agenți vocali cu suport în timp real, integrați cu Amazon Connect.[10][7]

Evaluarea modelelor (LLM‑as‑a‑judge)

Nova este utilizat ca model-judecător la evaluarea ieșirilor altor modele generative pe platforma Amazon SageMaker.[29]

Limitări și probleme deschise

  • Arhitectură închisă. Amazon nu dezvăluie numărul de parametri, deciziile arhitecturale detaliate și compoziția datelor de antrenare, ceea ce limitează semnificativ reproductibilitatea independentă a rezultatelor. Ponderile modelelor Nova nu sunt disponibile pentru descărcare sau implementare în afara infrastructurii AWS (implementarea on‑premise nu este posibilă).[1][2]
  • Limita de ieșire. Numărul maxim de tokenuri de ieșire pentru toate modelele de înțelegere este limitat la 10 mii de tokenuri, ceea ce poate fi insuficient pentru sarcinile de generare a documentelor lungi.[2]
  • Limitele RFT. Reinforcement Fine‑Tuning nu suportă dialoguri cu mai multe runde (multi‑turn) și date multimodale; proporția recomandată de exemple pozitive în setul de date este de cel puțin 5%.[27]
  • Limitele Nova Sonic. Durata maximă a conexiunii — 8 minute; maximum 20 de conexiuni simultane per client în mod implicit.[2]
  • Disponibilitate regională. Nova Premier este disponibilă doar într-o singură regiune (US East N. Virginia) fără suport pentru inferență cross-regională; modelele Nova 2 au o listă limitată de regiuni de implementare.[2]
  • Sensibilitatea metricilor. Scorurile pe benchmark-uri sintetice nu corelează întotdeauna cu calitatea funcționării în condiții de producție (production), unde urmărirea strictă a politicilor corporative și absența halucinațiilor în inferențele cu mai mulți pași sunt critice.[22][23]
  • Halucinații. Modelele prezintă limitările tipice LLM-urilor: pot apărea erori factuale în răspunsurile generate. Pentru reducerea riscurilor se recomandă utilizarea Bedrock Guardrails și RAG.[1]
  • Obiectivitatea comparativă a benchmark-urilor. Amazon prezintă comparații cu modelele concurente pe baza datelor publicate chiar de dezvoltatorii acestora, ceea ce nu asigură întotdeauna o bază experimentală unică și controlată.[22]

Aspecte etice și de reglementare

AWS declară respectarea principiilor IA responsabilă (Responsible AI) în dezvoltarea modelelor Nova. Măsurile concrete de siguranță includ:[20][15]

  • Moderare integrată a conținutului (content moderation).
  • Marcaje de apă (watermarking) pentru ieșirile audio ale Nova Sonic.
  • Evaluare pe categorii de risc: siguranță (safety), confidențialitate (privacy), veridicitate (veracity), transparență (transparency), precum și proliferarea armelor CBRN (chimice, biologice, radiologice și nucleare) și operațiunile cibernetice ofensive.
  • Integrare cu Amazon Bedrock Guardrails pentru filtrarea datelor de intrare și de ieșire.
  • Evaluarea modelului Nova Premier în conformitate cu Amazon Frontier Model Safety Framework.
  • Red teaming — testare internă și externă a rezistenței la atacuri (conform raportului tehnic, 307 de tehnici).
  • Evaluarea moderării conținutului după metrica F1: 85,84 pe benchmark-ul Aegis (conform raportului tehnic).[1]

Fișele de serviciu AI (AI Service Cards) pentru Nova Micro, Lite, Pro, Premier și Sonic sunt publicate pe docs.aws.amazon.com ca documentație pentru utilizare responsabilă.[20][15]

Perspective și direcții de cercetare

Familia Nova 2 marchează tranziția spre modele cu capabilități extinse de raționament (extended thinking / reasoning), comparabile ca și concept cu lanțul de gândire (Chain‑of‑Thought, CoT) și mecanisme similare din alte familii de modele. Căutarea web integrată și interpretorul de cod ca instrumente native (și nu pluginuri terțe) reprezintă o schimbare arhitecturală în direcția sistemelor agentice.[9][8]

Direcții de dezvoltare ulterioară, identificate în materialele publice ale Amazon:

  • Extinderea multimodalității (modelul Omni ca arhitectură unificată „totul-în-totul").
  • Raționamente hibride (hybrid reasoning) cu adâncime adaptivă în funcție de complexitatea sarcinii.
  • Antrenare deschisă pe date ale utilizatorilor (Nova Forge) la toate etapele pre-antrenării.
  • Distilare pentru dispozitive edge.
  • Extinderea setului de instrumente de siguranță (safety toolkit).[8][11]

Tematica Amazon Nova AI Challenge, organizat de AWS în rândul echipelor universitare, include direcții de testare adversarială automatizată, aliniere de siguranță (safety alignment) și atacuri cu mai multe runde (multi‑turn jailbreaks), ceea ce demonstrează investițiile în robustețea familiei de modele.[8]

Vezi și

  • Transformer (arhitectură)
  • Reinforcement Learning from Human Feedback (RLHF)

Bibliografie

Referințe

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/