Nova (Amazon) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — rodzina modeli fundamentalnych (Foundation Models, FM) i dużych modeli językowych (Large Language Model, LLM), opracowana przez dział Amazon Artificial General Intelligence (AAG Intelligence) i dostępna za pośrednictwem w pełni zarządzanej usługi Amazon Bedrock. Rodzina obejmuje modele do rozumienia i generowania tekstu, przetwarzania obrazów, wideo i dokumentów, a także syntezy i rozpoznawania mowy. Amazon Nova jest pozycjonowana jako następca poprzedniej generacji modeli Amazon Titan i jest zintegrowana z ekosystemem chmurowym Amazon Web Services (AWS).[1][2][3]

Historia i chronologia rozwoju

Przed uruchomieniem Nova platforma Amazon Bedrock zapewniała dostęp do modeli zewnętrznych: Anthropic Claude, Meta Llama, Mistral i innych. Amazon Nova stała się pierwszą rodziną modeli fundamentalnych własnego projektu AWS, ukierunkowaną na komercyjne zastosowanie w infrastrukturze chmurowej.[3]

Pierwsza generacja (2024–2025)

Pierwsza generacja rodziny Amazon Nova została oficjalnie zaprezentowana 3 grudnia 2024 roku na konferencji AWS re:Invent 2024. W pierwotnym wydaniu znalazły się trzy modele rozumienia (understanding models) — Nova Micro (wyłącznie tekst), multimodalne Nova Lite i Nova Pro — a także modele generatywne Nova Canvas (generowanie obrazów) i Nova Reel (generowanie wideo).[4][3][5]

W kwietniu 2025 roku linia została uzupełniona o flagowy model Nova Premier — najpotężniejszy model rodziny z oknem kontekstowym wynoszącym 1 milion tokenów, przeznaczony do zadań wymagających złożonego rozumowania oraz destylacji (distillation, przenoszenie wiedzy z dużego modelu do mniejszego).[6] Również w kwietniu 2025 roku zaprezentowano Nova Sonic — model mowy klasy speech‑to‑speech z obsługą dialogów w czasie rzeczywistym.[7]

Druga generacja — Nova 2 (2025–2026)

W listopadzie–grudniu 2025 roku na konferencji AWS re:Invent 2025 ogłoszono drugą generację — Amazon Nova 2. W linii znalazły się zaktualizowane modele Nova 2 Lite i Nova 2 Pro z obsługą dynamicznego rozumowania (dynamic reasoning) i rozszerzonego przetwarzania kontekstu, natywny multimodalny model Nova 2 Omni (jednoczesne przetwarzanie i generowanie tekstu, obrazów, wideo i audio), a także Nova 2 Sonic — model mowy nowej generacji. Jednocześnie zaprezentowano usługi Nova Forge (środowisko do niestandardowego uczenia modeli) i Nova Act (framework dla agentowych workflow).[8][9][10]

W lutym 2026 roku opublikowano oficjalny raport techniczny Amazon Nova 2.[11]

Zbiorcza chronologia

Data Wydarzenie
Grudzień 2024 Ogłoszenie Amazon Nova na AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel
Kwiecień 2025 Wydanie Nova Premier (kontekst 1M tokenów) i Nova Sonic (speech‑to‑speech)
Czerwiec 2025 Publikacja raportu technicznego pierwszej generacji (arXiv:2506.12103)
Listopad–Grudzień 2025 Ogłoszenie Nova 2 na AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
Luty 2026 Publikacja raportu technicznego Amazon Nova 2

Podstawy teoretyczne i architektura

Podstawowa architektura modeli rozumienia

Zgodnie z raportem technicznym arXiv:2506.12103, modele rozumienia (Nova Micro, Lite, Pro, Premier) oparte są na architekturze transformera (Transformer) opisanej w pracy Vaswani et al.[12] Podstawowy mechanizm wielogłowicowej samouwagi (Multi‑Head Self‑Attention) opisywany jest wzorem:

Attention(Q,K,V)=softmax(QKopdk)V

gdzie Q, K, V — macierze zapytań (queries), kluczy (keys) i wartości (values) odpowiednio, dk — wymiarowość kluczy.[12][1]

Dokładne parametry architektury (liczba warstw, rozmiar stanu ukrytego, liczba głowic uwagi, łączna liczba parametrów) nie zostały ujawnione w publicznie dostępnych źródłach według stanu na marzec 2026 roku. Takie podejście jest charakterystyczne dla zamkniętych modeli komercyjnych.[1]

Multimodalne przetwarzanie w Nova Lite i Nova Pro jest realizowane poprzez połączenie tokenów tekstowych, wizualnych i wideo w jedną sekwencję podawaną na wejście jednego modelu językowego. Wizualne kodery (vision encoders) przekształcają obrazy i klatki wideo w sekwencje tokenów kompatybilnych z reprezentacją tekstową.[1][13]

Architektura modeli generatywnych

Modele generatywne Nova Canvas (obrazy) i Nova Reel (wideo) wykorzystują architekturę latentnych modeli dyfuzji (Latent Diffusion Models, LDM)[14] w połączeniu z wariacyjnymi autoenkoderami (Variational AutoEncoder, VAE) do obliczeń w przestrzeni latentnej. Proces dyfuzji opisywany jest równaniem szumu kierunkowego:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

gdzie x0 — oryginalny obraz w przestrzeni latentnej, xt — jego zaszumiona wersja w kroku t, α¯t — skumulowany parametr harmonogramu szumu, ϵ — standardowy szum gaussowski. Koder tekstowy (text encoder) zapewnia conditioning — warunkowanie generacji na podstawie tekstowego promptu.[13][14]

Architektura modeli mowy

Nova Sonic wykorzystuje architekturę odmienną od modeli tekstowych: łączy wyspecjalizowany koder mowy (speech encoder), dekoder mowy (speech renderer) i główny multimodalny model językowy w jeden potok end‑to‑end (end‑to‑end pipeline). Pozwala to na przetwarzanie wejścia głosowego i generowanie wyjścia głosowego bez pośredniego przekształcenia na tekst (choć reprezentacja tekstowa jest stosowana wewnętrznie dla zapewnienia jakości).[15][1]

Infrastruktura uczenia

Uczenie modeli Nova odbywało się na rozproszonych klastrach AWS Elastic Kubernetes Service (EKS) z wykorzystaniem własnych akceleratorów AI Amazon Trainium (instancje TRN1), a także procesorów graficznych NVIDIA A100 i H100.[13][1]

W celu zmniejszenia kosztów obliczeniowych uczenia opracowano i zastosowano wyspecjalizowane metody optymalizacji:

  • Super‑Selective Activation Checkpointing (SSC) — metoda zapisywania aktywacji, która według raportu technicznego zmniejsza zużycie pamięci procesorów graficznych o około 50 % przy minimalnych narzutach na ponowne obliczenia (recomputation).[13]
  • In‑CPU‑Memory Checkpointing — buforowanie pośrednich wag (checkpoints) w pamięci operacyjnej procesorów centralnych (CPU) przed ich asynchronicznym przesłaniem do chmurowego magazynu Amazon S3. Według danych Amazon, podejście to pozwoliło skrócić czas zapisu stanu modelu do 0,1 sekundy na instancjach z TRN1.[16][13]

Potok uczenia i wyrównanie

Proces uczenia modeli Nova składa się z kilku etapów charakterystycznych dla współczesnych LLM:[1][17]

Wstępne uczenie (Pre‑training)

Na dużą skalę, na obszernym wielojęzycznym i multimodalnym korpusie danych obejmującym ponad 200 języków. Dokładny skład danych uczących (objętość, proporcja języków, konkretne źródła) nie jest podawany w materiałach publicznych.[1]

Nadzorowane dostrajanie (Supervised Fine‑Tuning, SFT)

Dostrajanie na oznaczonych przykładach par „instrukcja — odpowiedź", prowadzące model do przestrzegania instrukcji użytkownika.[1]

Wyrównanie za pomocą uczenia ze wzmocnieniem

Do wyrównywania zachowania modelu z preferencjami człowieka stosowane są dwa główne algorytmy:

Proximal Policy Optimization (PPO) — algorytm uczenia ze wzmocnieniem na podstawie opinii ludzi (Reinforcement Learning from Human Feedback, RLHF), wykorzystujący osobny model nagrody (Reward Model).[18][1]

Direct Preference Optimization (DPO) — alternatywna metoda wyrównania, niewymagająca jawnego modelu nagrody. Funkcja celu DPO ma postać:[19]

DPO(πheta;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπheta(ywx)πref(ywx)βlogπheta(ylx)πref(ylx))]

gdzie:

  • πheta — sparametryzowana strategia (uczony model);
  • πref — bazowy (zamrożony) model referencyjny;
  • x — wejściowy prompt (kontekst);
  • yw i yl — preferowana (winner) i odrzucona (loser) odpowiedź odpowiednio;
  • σ — funkcja logistyczna (sigmoidalna);
  • β — hiperparametr kontrolujący siłę kary za odchylenie od modelu bazowego (analogicznie do kary Kullbacka–Leiblera, KL‑divergence penalty).[19][1]

Skład rodziny modeli

Rodzina modeli podzielona jest na poziomy (tiers) w zależności od balansu między wydajnością, kosztem i opóźnieniem (latency).[2][20]

Modele rozumienia pierwszej generacji

Parametr Nova Micro Nova Lite Nova Pro Nova Premier
Modalności wejściowe Tekst Tekst, obraz, wideo Tekst, obraz, wideo Tekst, obraz, wideo
Modalność wyjściowa Tekst Tekst Tekst Tekst
Okno kontekstowe 128 tys. tokenów 300 tys. tokenów 300 tys. tokenów 1 mln tokenów
Maks. tokenów wyjściowych 10 tys. 10 tys. 10 tys. 10 tys.
Obsługa języków 200+ 200+ 200+ 200+
Dostrajanie (fine‑tuning) Tak Tak Tak Nie
Data wydania Grudzień 2024 Grudzień 2024 Grudzień 2024 Kwiecień 2025
Główne zastosowanie Minimalne opóźnienie i koszt dla zadań tekstowych Podstawowa analiza multimodalna Optymalny balans dla złożonych zadań logicznych i agentowych Maksymalna dokładność, model‑nauczyciel do destylacji

Źródło: AWS AI Service Cards; arXiv:2506.12103.[20][1]

Zoptymalizowane języki (15): angielski, niemiecki, hiszpański, francuski, włoski, japoński, koreański, arabski, chiński (uproszczony), rosyjski, hindi, portugalski, niderlandzki, turecki, hebrajski.[2]

Nova Premier przeznaczona jest do zadań wymagających głębokiego rozumienia kontekstu, wieloetapowego planowania i pracy z dużymi ilościami danych: bazami kodu, dokumentami liczącymi ponad 400 stron, wideo o długości do 90 minut.[6]

Modele drugiej generacji (Nova 2)

Nova 2 Lite i Nova 2 Pro zostały wydane w listopadzie–grudniu 2025 roku. Obydwa obsługują rozszerzone myślenie (extended thinking) — mechanizm, w którym model wykonuje wieloetapowe rozumowanie przed wygenerowaniem odpowiedzi. Głębokość rozumowania regulowana jest parametrem reasoning_effort z poziomami low, medium i high. Okno kontekstowe zostało rozszerzone do 1 miliona tokenów. Wbudowane są natywne narzędzia: wyszukiwanie w sieci z potwierdzeniem (web grounding) i interpreter kodu (code interpreter).[9][8]

Nova 2 Omni — natywny multimodalny model zdolny jednocześnie przyjmować na wejście tekst, obrazy, wideo i audio oraz generować tekst i obrazy. Okno kontekstowe — 1 mln tokenów.[8][11]

Nova 2 Sonic — model mowy nowej generacji. Obsługuje 6 języków: angielski (wariant amerykański i brytyjski), hiszpański, niemiecki, francuski, włoski. Wprowadza asynchroniczne wywoływanie narzędzi (asynchronous tool calling) — model kontynuuje przetwarzanie nowych danych wejściowych, podczas gdy zewnętrzne narzędzia wykonują się w tle.[10]

Parametr Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
Modalności wejściowe Tekst, obraz, wideo Tekst, obraz, wideo Tekst, obraz, wideo, audio Audio (mowa)
Modalność wyjściowa Tekst Tekst Tekst, obraz Audio (mowa)
Okno kontekstowe 1 mln tokenów 1 mln tokenów 1 mln tokenów 300 tys. tokenów
Extended thinking Tak Tak Tak
Natywne narzędzia Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
Data wydania Listopad–Grudzień 2025 Listopad–Grudzień 2025 Grudzień 2025 Grudzień 2025

Źródło: AWS Blog; Amazon Science.[9][8][11]

Modele generatywne

Nova Canvas — model generowania obrazów. Obsługuje wejście tekstowe i graficzne (PNG, JPEG). Rozdzielczość wyjściowa — do 4,19 mln pikseli (np. 2048×2048 lub 2816×1536 pikseli). Maksymalna długość promptu — 1024 znaki. Obsługiwane są operacje inpainting (zastępowanie obszaru obrazu) i outpainting (rozszerzanie obrazu poza jego granice).[2][4]

Nova Reel — model generowania wideo. Rozdzielczość wyjściowa: 1280×720 przy 24 klatkach na sekundę. Długość generowanego wideo — do 6 sekund. Obsługiwane jest sterowanie ruchem kamery (camera control). Dostęp odbywa się przez asynchroniczne API (Asynchronous Invoke Model API).[2][4]

Modele mowy

Nova Sonic (kwiecień 2025) — model mowy z dwukierunkowym strumieniowym API (bidirectional stream API). Obsługuje wywołania funkcji (function calling) i zakotwiczenie na danych korporacyjnych za pomocą Retrieval‑Augmented Generation (RAG, generowanie z wykorzystaniem zewnętrznej wiedzy). Funkcja znaku wodnego (watermarking) jest wbudowana domyślnie. Maksymalny czas trwania połączenia — 8 minut z możliwością wznowienia; maksymalnie 20 jednoczesnych połączeń na klienta (wartość domyślna).[7][15][2]

Nova 2 Sonic (grudzień 2025) — kolejna generacja modelu mowy z ulepszonym rozpoznawaniem krótkich wypowiedzi, audio telefonicznego (8 kHz) i akcentów.[10]

Ocena i benchmarki

Ocena modeli Nova była przeprowadzana z wykorzystaniem zautomatyzowanych benchmarków, w tym podejścia „LLM‑as‑a‑judge" (wykorzystanie modelu językowego jako oceniającego). Według badań HKU SPACE AI Hub, metryka Arena‑Hard‑Auto wykazuje 98,6 % korelację z ocenami ekspertów.[21][22]

Benchmarki pierwszej generacji

Dane z raportu technicznego arXiv:2506.12103 (warunki: wyniki opublikowane przez twórców modeli konkurencyjnych w momencie przygotowania raportu):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

Źródło: arXiv:2506.12103, tabela 2.1.1.[1]

Wyniki ukazują hierarchię wydajności wewnątrz rodziny (Premier > Pro > Lite > Micro). Różnica jest najbardziej widoczna w kategoriach matematyki (Math) i rozumowania (Reasoning); w zadaniach odgrywania ról (Roleplay) i wydobywania informacji (Extraction) młodsze modele uzyskują wyniki zbliżone do starszych.[22]

Benchmarki drugiej generacji (Nova 2)

Dane z raportu technicznego Amazon Nova 2 (warunki: internal measurements, 0‑shot / CoT gdzie wskazano):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

Źródło: Amazon Nova 2 Technical Report, tabela 1.[11]

Agentowe benchmarki (Nova 2 Pro): SWE‑Bench Verified — 70,0 %; τ²‑bench Verified Telecom — 92,7 %.[11]

Multimodalne benchmarki (Nova 2 Omni): VideoMME — 77,9 %; MMMU Pro — 61,4 %.[11]

Przy ocenie w zadaniach wsparcia technicznego Nova 2 Lite uzyskała 9,63 ± 0,27 w dziesięciopunktowej skali w metryce „Identyfikacja problemu" (Problem Identification), znacznie wyprzedzając Nova Lite pierwszej generacji (8,57 ± 0,46).[23]

Uwaga. Przy porównywaniu wyników z modelami konkurencyjnymi należy uwzględnić, że warunki promptingu, wersje modeli i daty pomiarów metryk mogą się różnić. Benchmarki pierwszej i drugiej generacji pochodzą z samoraportów Amazon; niezależne weryfikacje (FloTorch, Artificial Analysis) ogólnie potwierdzają deklarowany stosunek ceny do wydajności, jednak w przypadku niektórych metryk dokładności odnotowują odstępstwa od czołowych konkurentów.[22]

Szybkość wnioskowania

Według wewnętrznych pomiarów Amazon (internal, przez Bedrock API):[1][11]

Model Szybkość wnioskowania (tokenów/s)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

Koszt użytkowania

Wszystkie modele dostępne są przez Amazon Bedrock w modelu płatności za liczbę przetworzonych tokenów (dane na marzec 2026 roku):[2]

Model Tokeny wejściowe (USD / 1M) Tokeny wyjściowe (USD / 1M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

Dla porównania: Anthropic Claude 3.5 Sonnet w momencie wydania Nova był taryfikowany po $6,00 / 1M tokenów wejściowych i $30,00 / 1M tokenów wyjściowych.[22]

Kastomizacja i dostrajanie

Infrastruktura AWS udostępnia kilka metod adaptacji bazowych modeli Nova do wąsko wyspecjalizowanych dziedzin. Głównym narzędziem do tego w drugiej generacji jest środowisko Amazon Nova Forge.[8][17]

Continued Pre‑Training (CPT) i Mid‑Training

Nova Forge otwiera dostęp do pośrednich punktów kontrolnych uczenia modeli (np. pretraining‑text‑RD i pretraining‑text‑CE). Pozwala to kontynuować samouczenie (self‑supervised learning) na zbiorach danych korporacyjnych przy starannym doborze szybkości uczenia (learning rate) w celu zapobiegania katastrofalnemu zapominaniu (catastrophic forgetting).[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

Aktualizacja wyłącznie małego podzbioru wag modelu za pomocą adapterów niskiego rzędu — Low‑Rank Adaptation (LoRA)[26]. Podejście to znacznie zmniejsza wymagania obliczeniowe w porównaniu z pełnym dostrajaniem (full fine‑tuning). Obsługiwane jest multimodalne fine‑tuning dla Nova Lite i Pro.[17]

Reinforcement Fine‑Tuning (RFT)

Niestandardowe modele mogą być dodatkowo dostrajane metodami ze wzmocnieniem na podstawie specyficznych dla branży metryk nagrody, w tym z wykorzystaniem innego LLM jako modelu‑sędziego (LLM‑as‑a‑judge).[27]

Destylacja modeli (Model Distillation)

Funkcja Model Distillation pozwala używać Nova Premier lub Nova Pro jako modelu‑nauczyciela (teacher model) do uczenia mniejszych modeli‑uczniów (student models) — Nova Lite i Nova Micro. Zmniejsza to koszty obliczeniowe wnioskowania przy zachowaniu znacznej części jakości dużego modelu.[2][6]

Zastosowanie i integracja

Modele Nova są zintegrowane z usługami obliczeniowymi Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Główne udokumentowane scenariusze zastosowania:[2][1]

Agentowe przepływy pracy (Agentic Workflows)

Wieloetapowe wykonywanie zadań z wykorzystaniem Bedrock Agents i wywoływaniem zewnętrznych narzędzi (function calling). Korzystając z wzorca architektonicznego ReAct (Reasoning and Acting) w połączeniu z frameworkami takimi jak LangGraph, modele Nova koordynują analizę baz danych, tworzą zapytania SQL z języka naturalnego i zarządzają wieloelementowymi procesami. Nova Act zapewnia automatyzację przeglądarkowych przepływów UI z deklarowaną niezawodnością 90 % na wczesnych zadaniach użytkowników.[28][8]

Generowanie z wykorzystaniem zewnętrznej wiedzy (RAG)

Integracja z Bedrock Knowledge Bases w celu zakotwiczenia (grounding) odpowiedzi na danych korporacyjnych. Modele Nova 2 obsługują natywne wyszukiwanie w sieci z potwierdzeniem (web grounding) jako wbudowane narzędzie.[1][9]

Przetwarzanie dokumentów

Obsługiwane formaty dokumentów wejściowych: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (z wyjątkiem Nova Micro, który przyjmuje wyłącznie wejście tekstowe). Nova Premier jest w stanie przetwarzać wideo o długości do 90 minut w ramach jednego zapytania.[2][6]

Generowanie i debugowanie kodu

Obsługiwane języki programowania: Python, Java, JavaScript, C#, TypeScript, SQL.[20]

Interfejsy głosowe

Nova Sonic i Nova 2 Sonic stosowane są do budowy agentów głosowych z obsługą czasu rzeczywistego, zintegrowanych z Amazon Connect.[10][7]

Ocena modeli (LLM‑as‑a‑judge)

Nova jest stosowana jako model‑sędzia przy ocenie wyników innych modeli generatywnych na platformie Amazon SageMaker.[29]

Ograniczenia i otwarte problemy

  • Zamkniętość architektury. Amazon nie ujawnia liczby parametrów, szczegółowych rozwiązań architektonicznych ani składu danych uczących, co znacząco ogranicza niezależną odtwarzalność wyników. Wagi modeli Nova nie są udostępniane do pobrania ani wdrożenia poza infrastrukturą AWS (wdrożenie on‑premise jest niemożliwe).[1][2]
  • Limit wyjściowy. Maksymalna liczba tokenów wyjściowych dla wszystkich modeli rozumienia jest ograniczona do 10 tys. tokenów, co może być niewystarczające w zadaniach generowania długich dokumentów.[2]
  • Ograniczenia RFT. Reinforcement Fine‑Tuning nie obsługuje wieloturowych (multi‑turn) dialogów ani danych multimodalnych; zalecany udział pozytywnych przykładów w zbiorze danych wynosi co najmniej 5 %.[27]
  • Ograniczenia Nova Sonic. Maksymalny czas trwania połączenia — 8 minut; domyślnie maksymalnie 20 jednoczesnych połączeń na klienta.[2]
  • Dostępność regionalna. Nova Premier dostępna jest tylko w jednym regionie (US East N. Virginia) bez obsługi wnioskowania między regionami; modele Nova 2 mają ograniczoną listę regionów wdrożenia.[2]
  • Wrażliwość metryk. Oceny na syntetycznych benchmarkach nie zawsze korelują z jakością pracy w warunkach produkcyjnych (production), gdzie kluczowe jest ścisłe przestrzeganie polityk korporacyjnych i brak halucynacji w wieloetapowych wnioskach.[22][23]
  • Halucynacje. Modele wykazują typowe dla LLM ograniczenia: możliwe są błędy faktyczne w generowanych odpowiedziach. W celu ograniczenia ryzyka zaleca się stosowanie Bedrock Guardrails i RAG.[1]
  • Obiektywność porównawcza benchmarków. Amazon przedstawia porównania z modelami konkurencyjnymi na podstawie danych opublikowanych przez samych twórców, co nie zawsze zapewnia jednolitą kontrolowaną bazę eksperymentalną.[22]

Aspekty etyczne i regulacyjne

AWS deklaruje stosowanie zasad odpowiedzialnej AI (Responsible AI) przy tworzeniu modeli Nova. Konkretne środki bezpieczeństwa obejmują:[20][15]

  • Wbudowana moderacja treści (content moderation).
  • Znaki wodne (watermarking) dla wyjść audio Nova Sonic.
  • Ocena według kategorii ryzyka: bezpieczeństwo (safety), prywatność (privacy), wiarygodność (veracity), przejrzystość (transparency), a także proliferacja broni CBRN (chemicznej, biologicznej, radiologicznej i jądrowej) oraz ofensywne operacje cybernetyczne.
  • Integracja z Amazon Bedrock Guardrails do filtrowania danych wejściowych i wyjściowych.
  • Ocena modelu Nova Premier pod kątem zgodności z Amazon Frontier Model Safety Framework.
  • Red teaming — wewnętrzne i zewnętrzne testowanie odporności na ataki (według raportu technicznego — 307 technik).
  • Ocena moderacji treści według metryki F1: 85,84 na benchmarku Aegis (według raportu technicznego).[1]

Karty usług AI (AI Service Cards) dla Nova Micro, Lite, Pro, Premier i Sonic zostały opublikowane na docs.aws.amazon.com jako dokumentacja dotycząca odpowiedzialnego stosowania.[20][15]

Perspektywy i kierunki badań

Rodzina Nova 2 oznacza przejście do modeli o rozszerzonych możliwościach rozumowania (extended thinking / reasoning), zbliżonych koncepcyjnie do łańcucha myślenia (Chain‑of‑Thought, CoT) i analogicznych mechanizmów w innych rodzinach modeli. Wbudowane wyszukiwanie w sieci i interpreter kodu jako natywne narzędzia (a nie zewnętrzne wtyczki) stanowią architektoniczne przesunięcie w kierunku systemów agentowych.[9][8]

Kierunki dalszego rozwoju wskazane w publicznych materiałach Amazon:

  • Rozszerzenie multimodalności (model Omni jako zunifikowana architektura „wszystko do wszystkiego").
  • Hybrydowe rozumowanie (hybrid reasoning) z adaptacyjną głębokością w zależności od złożoności zadania.
  • Otwarte uczenie na danych użytkowników (Nova Forge) na wszystkich etapach wstępnego uczenia.
  • Destylacja dla urządzeń brzegowych (edge).
  • Rozszerzenie zestawu narzędzi bezpieczeństwa (safety toolkit).[8][11]

Tematyka Amazon Nova AI Challenge, organizowanego przez AWS wśród zespołów akademickich, obejmuje obszary zautomatyzowanego testowania adversarialnego, wyrównania bezpieczeństwa (safety alignment) i wieloturowych ataków (multi‑turn jailbreaks), co świadczy o inwestycjach w niezawodność rodziny modeli.[8]

Zobacz też

  • Transformer (architektura)
  • Reinforcement Learning from Human Feedback (RLHF)

Literatura

Odnośniki

Przypisy

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/