Nova (Amazon) (PL)
Amazon Nova — rodzina modeli fundamentalnych (Foundation Models, FM) i dużych modeli językowych (Large Language Model, LLM), opracowana przez dział Amazon Artificial General Intelligence (AAG Intelligence) i dostępna za pośrednictwem w pełni zarządzanej usługi Amazon Bedrock. Rodzina obejmuje modele do rozumienia i generowania tekstu, przetwarzania obrazów, wideo i dokumentów, a także syntezy i rozpoznawania mowy. Amazon Nova jest pozycjonowana jako następca poprzedniej generacji modeli Amazon Titan i jest zintegrowana z ekosystemem chmurowym Amazon Web Services (AWS).[1][2][3]
Historia i chronologia rozwoju
Przed uruchomieniem Nova platforma Amazon Bedrock zapewniała dostęp do modeli zewnętrznych: Anthropic Claude, Meta Llama, Mistral i innych. Amazon Nova stała się pierwszą rodziną modeli fundamentalnych własnego projektu AWS, ukierunkowaną na komercyjne zastosowanie w infrastrukturze chmurowej.[3]
Pierwsza generacja (2024–2025)
Pierwsza generacja rodziny Amazon Nova została oficjalnie zaprezentowana 3 grudnia 2024 roku na konferencji AWS re:Invent 2024. W pierwotnym wydaniu znalazły się trzy modele rozumienia (understanding models) — Nova Micro (wyłącznie tekst), multimodalne Nova Lite i Nova Pro — a także modele generatywne Nova Canvas (generowanie obrazów) i Nova Reel (generowanie wideo).[4][3][5]
W kwietniu 2025 roku linia została uzupełniona o flagowy model Nova Premier — najpotężniejszy model rodziny z oknem kontekstowym wynoszącym 1 milion tokenów, przeznaczony do zadań wymagających złożonego rozumowania oraz destylacji (distillation, przenoszenie wiedzy z dużego modelu do mniejszego).[6] Również w kwietniu 2025 roku zaprezentowano Nova Sonic — model mowy klasy speech‑to‑speech z obsługą dialogów w czasie rzeczywistym.[7]
Druga generacja — Nova 2 (2025–2026)
W listopadzie–grudniu 2025 roku na konferencji AWS re:Invent 2025 ogłoszono drugą generację — Amazon Nova 2. W linii znalazły się zaktualizowane modele Nova 2 Lite i Nova 2 Pro z obsługą dynamicznego rozumowania (dynamic reasoning) i rozszerzonego przetwarzania kontekstu, natywny multimodalny model Nova 2 Omni (jednoczesne przetwarzanie i generowanie tekstu, obrazów, wideo i audio), a także Nova 2 Sonic — model mowy nowej generacji. Jednocześnie zaprezentowano usługi Nova Forge (środowisko do niestandardowego uczenia modeli) i Nova Act (framework dla agentowych workflow).[8][9][10]
W lutym 2026 roku opublikowano oficjalny raport techniczny Amazon Nova 2.[11]
Zbiorcza chronologia
| Data | Wydarzenie |
|---|---|
| Grudzień 2024 | Ogłoszenie Amazon Nova na AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| Kwiecień 2025 | Wydanie Nova Premier (kontekst 1M tokenów) i Nova Sonic (speech‑to‑speech) |
| Czerwiec 2025 | Publikacja raportu technicznego pierwszej generacji (arXiv:2506.12103) |
| Listopad–Grudzień 2025 | Ogłoszenie Nova 2 na AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| Luty 2026 | Publikacja raportu technicznego Amazon Nova 2 |
Podstawy teoretyczne i architektura
Podstawowa architektura modeli rozumienia
Zgodnie z raportem technicznym arXiv:2506.12103, modele rozumienia (Nova Micro, Lite, Pro, Premier) oparte są na architekturze transformera (Transformer) opisanej w pracy Vaswani et al.[12] Podstawowy mechanizm wielogłowicowej samouwagi (Multi‑Head Self‑Attention) opisywany jest wzorem:
gdzie , , — macierze zapytań (queries), kluczy (keys) i wartości (values) odpowiednio, — wymiarowość kluczy.[12][1]
Dokładne parametry architektury (liczba warstw, rozmiar stanu ukrytego, liczba głowic uwagi, łączna liczba parametrów) nie zostały ujawnione w publicznie dostępnych źródłach według stanu na marzec 2026 roku. Takie podejście jest charakterystyczne dla zamkniętych modeli komercyjnych.[1]
Multimodalne przetwarzanie w Nova Lite i Nova Pro jest realizowane poprzez połączenie tokenów tekstowych, wizualnych i wideo w jedną sekwencję podawaną na wejście jednego modelu językowego. Wizualne kodery (vision encoders) przekształcają obrazy i klatki wideo w sekwencje tokenów kompatybilnych z reprezentacją tekstową.[1][13]
Architektura modeli generatywnych
Modele generatywne Nova Canvas (obrazy) i Nova Reel (wideo) wykorzystują architekturę latentnych modeli dyfuzji (Latent Diffusion Models, LDM)[14] w połączeniu z wariacyjnymi autoenkoderami (Variational AutoEncoder, VAE) do obliczeń w przestrzeni latentnej. Proces dyfuzji opisywany jest równaniem szumu kierunkowego:
gdzie — oryginalny obraz w przestrzeni latentnej, — jego zaszumiona wersja w kroku , — skumulowany parametr harmonogramu szumu, — standardowy szum gaussowski. Koder tekstowy (text encoder) zapewnia conditioning — warunkowanie generacji na podstawie tekstowego promptu.[13][14]
Architektura modeli mowy
Nova Sonic wykorzystuje architekturę odmienną od modeli tekstowych: łączy wyspecjalizowany koder mowy (speech encoder), dekoder mowy (speech renderer) i główny multimodalny model językowy w jeden potok end‑to‑end (end‑to‑end pipeline). Pozwala to na przetwarzanie wejścia głosowego i generowanie wyjścia głosowego bez pośredniego przekształcenia na tekst (choć reprezentacja tekstowa jest stosowana wewnętrznie dla zapewnienia jakości).[15][1]
Infrastruktura uczenia
Uczenie modeli Nova odbywało się na rozproszonych klastrach AWS Elastic Kubernetes Service (EKS) z wykorzystaniem własnych akceleratorów AI Amazon Trainium (instancje TRN1), a także procesorów graficznych NVIDIA A100 i H100.[13][1]
W celu zmniejszenia kosztów obliczeniowych uczenia opracowano i zastosowano wyspecjalizowane metody optymalizacji:
- Super‑Selective Activation Checkpointing (SSC) — metoda zapisywania aktywacji, która według raportu technicznego zmniejsza zużycie pamięci procesorów graficznych o około 50 % przy minimalnych narzutach na ponowne obliczenia (recomputation).[13]
- In‑CPU‑Memory Checkpointing — buforowanie pośrednich wag (checkpoints) w pamięci operacyjnej procesorów centralnych (CPU) przed ich asynchronicznym przesłaniem do chmurowego magazynu Amazon S3. Według danych Amazon, podejście to pozwoliło skrócić czas zapisu stanu modelu do 0,1 sekundy na instancjach z TRN1.[16][13]
Potok uczenia i wyrównanie
Proces uczenia modeli Nova składa się z kilku etapów charakterystycznych dla współczesnych LLM:[1][17]
Wstępne uczenie (Pre‑training)
Na dużą skalę, na obszernym wielojęzycznym i multimodalnym korpusie danych obejmującym ponad 200 języków. Dokładny skład danych uczących (objętość, proporcja języków, konkretne źródła) nie jest podawany w materiałach publicznych.[1]
Nadzorowane dostrajanie (Supervised Fine‑Tuning, SFT)
Dostrajanie na oznaczonych przykładach par „instrukcja — odpowiedź", prowadzące model do przestrzegania instrukcji użytkownika.[1]
Wyrównanie za pomocą uczenia ze wzmocnieniem
Do wyrównywania zachowania modelu z preferencjami człowieka stosowane są dwa główne algorytmy:
Proximal Policy Optimization (PPO) — algorytm uczenia ze wzmocnieniem na podstawie opinii ludzi (Reinforcement Learning from Human Feedback, RLHF), wykorzystujący osobny model nagrody (Reward Model).[18][1]
Direct Preference Optimization (DPO) — alternatywna metoda wyrównania, niewymagająca jawnego modelu nagrody. Funkcja celu DPO ma postać:[19]
gdzie:
- — sparametryzowana strategia (uczony model);
- — bazowy (zamrożony) model referencyjny;
- — wejściowy prompt (kontekst);
- i — preferowana (winner) i odrzucona (loser) odpowiedź odpowiednio;
- — funkcja logistyczna (sigmoidalna);
- — hiperparametr kontrolujący siłę kary za odchylenie od modelu bazowego (analogicznie do kary Kullbacka–Leiblera, KL‑divergence penalty).[19][1]
Skład rodziny modeli
Rodzina modeli podzielona jest na poziomy (tiers) w zależności od balansu między wydajnością, kosztem i opóźnieniem (latency).[2][20]
Modele rozumienia pierwszej generacji
| Parametr | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Modalności wejściowe | Tekst | Tekst, obraz, wideo | Tekst, obraz, wideo | Tekst, obraz, wideo |
| Modalność wyjściowa | Tekst | Tekst | Tekst | Tekst |
| Okno kontekstowe | 128 tys. tokenów | 300 tys. tokenów | 300 tys. tokenów | 1 mln tokenów |
| Maks. tokenów wyjściowych | 10 tys. | 10 tys. | 10 tys. | 10 tys. |
| Obsługa języków | 200+ | 200+ | 200+ | 200+ |
| Dostrajanie (fine‑tuning) | Tak | Tak | Tak | Nie |
| Data wydania | Grudzień 2024 | Grudzień 2024 | Grudzień 2024 | Kwiecień 2025 |
| Główne zastosowanie | Minimalne opóźnienie i koszt dla zadań tekstowych | Podstawowa analiza multimodalna | Optymalny balans dla złożonych zadań logicznych i agentowych | Maksymalna dokładność, model‑nauczyciel do destylacji |
Źródło: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Zoptymalizowane języki (15): angielski, niemiecki, hiszpański, francuski, włoski, japoński, koreański, arabski, chiński (uproszczony), rosyjski, hindi, portugalski, niderlandzki, turecki, hebrajski.[2]
Nova Premier przeznaczona jest do zadań wymagających głębokiego rozumienia kontekstu, wieloetapowego planowania i pracy z dużymi ilościami danych: bazami kodu, dokumentami liczącymi ponad 400 stron, wideo o długości do 90 minut.[6]
Modele drugiej generacji (Nova 2)
Nova 2 Lite i Nova 2 Pro zostały wydane w listopadzie–grudniu 2025 roku. Obydwa obsługują rozszerzone myślenie (extended thinking) — mechanizm, w którym model wykonuje wieloetapowe rozumowanie przed wygenerowaniem odpowiedzi. Głębokość rozumowania regulowana jest parametrem reasoning_effort z poziomami low, medium i high. Okno kontekstowe zostało rozszerzone do 1 miliona tokenów. Wbudowane są natywne narzędzia: wyszukiwanie w sieci z potwierdzeniem (web grounding) i interpreter kodu (code interpreter).[9][8]
Nova 2 Omni — natywny multimodalny model zdolny jednocześnie przyjmować na wejście tekst, obrazy, wideo i audio oraz generować tekst i obrazy. Okno kontekstowe — 1 mln tokenów.[8][11]
Nova 2 Sonic — model mowy nowej generacji. Obsługuje 6 języków: angielski (wariant amerykański i brytyjski), hiszpański, niemiecki, francuski, włoski. Wprowadza asynchroniczne wywoływanie narzędzi (asynchronous tool calling) — model kontynuuje przetwarzanie nowych danych wejściowych, podczas gdy zewnętrzne narzędzia wykonują się w tle.[10]
| Parametr | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Modalności wejściowe | Tekst, obraz, wideo | Tekst, obraz, wideo | Tekst, obraz, wideo, audio | Audio (mowa) |
| Modalność wyjściowa | Tekst | Tekst | Tekst, obraz | Audio (mowa) |
| Okno kontekstowe | 1 mln tokenów | 1 mln tokenów | 1 mln tokenów | 300 tys. tokenów |
| Extended thinking | Tak | Tak | Tak | — |
| Natywne narzędzia | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Data wydania | Listopad–Grudzień 2025 | Listopad–Grudzień 2025 | Grudzień 2025 | Grudzień 2025 |
Źródło: AWS Blog; Amazon Science.[9][8][11]
Modele generatywne
Nova Canvas — model generowania obrazów. Obsługuje wejście tekstowe i graficzne (PNG, JPEG). Rozdzielczość wyjściowa — do 4,19 mln pikseli (np. 2048×2048 lub 2816×1536 pikseli). Maksymalna długość promptu — 1024 znaki. Obsługiwane są operacje inpainting (zastępowanie obszaru obrazu) i outpainting (rozszerzanie obrazu poza jego granice).[2][4]
Nova Reel — model generowania wideo. Rozdzielczość wyjściowa: 1280×720 przy 24 klatkach na sekundę. Długość generowanego wideo — do 6 sekund. Obsługiwane jest sterowanie ruchem kamery (camera control). Dostęp odbywa się przez asynchroniczne API (Asynchronous Invoke Model API).[2][4]
Modele mowy
Nova Sonic (kwiecień 2025) — model mowy z dwukierunkowym strumieniowym API (bidirectional stream API). Obsługuje wywołania funkcji (function calling) i zakotwiczenie na danych korporacyjnych za pomocą Retrieval‑Augmented Generation (RAG, generowanie z wykorzystaniem zewnętrznej wiedzy). Funkcja znaku wodnego (watermarking) jest wbudowana domyślnie. Maksymalny czas trwania połączenia — 8 minut z możliwością wznowienia; maksymalnie 20 jednoczesnych połączeń na klienta (wartość domyślna).[7][15][2]
Nova 2 Sonic (grudzień 2025) — kolejna generacja modelu mowy z ulepszonym rozpoznawaniem krótkich wypowiedzi, audio telefonicznego (8 kHz) i akcentów.[10]
Ocena i benchmarki
Ocena modeli Nova była przeprowadzana z wykorzystaniem zautomatyzowanych benchmarków, w tym podejścia „LLM‑as‑a‑judge" (wykorzystanie modelu językowego jako oceniającego). Według badań HKU SPACE AI Hub, metryka Arena‑Hard‑Auto wykazuje 98,6 % korelację z ocenami ekspertów.[21][22]
Benchmarki pierwszej generacji
Dane z raportu technicznego arXiv:2506.12103 (warunki: wyniki opublikowane przez twórców modeli konkurencyjnych w momencie przygotowania raportu):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Źródło: arXiv:2506.12103, tabela 2.1.1.[1]
Wyniki ukazują hierarchię wydajności wewnątrz rodziny (Premier > Pro > Lite > Micro). Różnica jest najbardziej widoczna w kategoriach matematyki (Math) i rozumowania (Reasoning); w zadaniach odgrywania ról (Roleplay) i wydobywania informacji (Extraction) młodsze modele uzyskują wyniki zbliżone do starszych.[22]
Benchmarki drugiej generacji (Nova 2)
Dane z raportu technicznego Amazon Nova 2 (warunki: internal measurements, 0‑shot / CoT gdzie wskazano):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Źródło: Amazon Nova 2 Technical Report, tabela 1.[11]
Agentowe benchmarki (Nova 2 Pro): SWE‑Bench Verified — 70,0 %; τ²‑bench Verified Telecom — 92,7 %.[11]
Multimodalne benchmarki (Nova 2 Omni): VideoMME — 77,9 %; MMMU Pro — 61,4 %.[11]
Przy ocenie w zadaniach wsparcia technicznego Nova 2 Lite uzyskała 9,63 ± 0,27 w dziesięciopunktowej skali w metryce „Identyfikacja problemu" (Problem Identification), znacznie wyprzedzając Nova Lite pierwszej generacji (8,57 ± 0,46).[23]
Uwaga. Przy porównywaniu wyników z modelami konkurencyjnymi należy uwzględnić, że warunki promptingu, wersje modeli i daty pomiarów metryk mogą się różnić. Benchmarki pierwszej i drugiej generacji pochodzą z samoraportów Amazon; niezależne weryfikacje (FloTorch, Artificial Analysis) ogólnie potwierdzają deklarowany stosunek ceny do wydajności, jednak w przypadku niektórych metryk dokładności odnotowują odstępstwa od czołowych konkurentów.[22]
Szybkość wnioskowania
Według wewnętrznych pomiarów Amazon (internal, przez Bedrock API):[1][11]
| Model | Szybkość wnioskowania (tokenów/s) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Koszt użytkowania
Wszystkie modele dostępne są przez Amazon Bedrock w modelu płatności za liczbę przetworzonych tokenów (dane na marzec 2026 roku):[2]
| Model | Tokeny wejściowe (USD / 1M) | Tokeny wyjściowe (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
Dla porównania: Anthropic Claude 3.5 Sonnet w momencie wydania Nova był taryfikowany po $6,00 / 1M tokenów wejściowych i $30,00 / 1M tokenów wyjściowych.[22]
Kastomizacja i dostrajanie
Infrastruktura AWS udostępnia kilka metod adaptacji bazowych modeli Nova do wąsko wyspecjalizowanych dziedzin. Głównym narzędziem do tego w drugiej generacji jest środowisko Amazon Nova Forge.[8][17]
Continued Pre‑Training (CPT) i Mid‑Training
Nova Forge otwiera dostęp do pośrednich punktów kontrolnych uczenia modeli (np. pretraining‑text‑RD i pretraining‑text‑CE). Pozwala to kontynuować samouczenie (self‑supervised learning) na zbiorach danych korporacyjnych przy starannym doborze szybkości uczenia (learning rate) w celu zapobiegania katastrofalnemu zapominaniu (catastrophic forgetting).[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Aktualizacja wyłącznie małego podzbioru wag modelu za pomocą adapterów niskiego rzędu — Low‑Rank Adaptation (LoRA)[26]. Podejście to znacznie zmniejsza wymagania obliczeniowe w porównaniu z pełnym dostrajaniem (full fine‑tuning). Obsługiwane jest multimodalne fine‑tuning dla Nova Lite i Pro.[17]
Reinforcement Fine‑Tuning (RFT)
Niestandardowe modele mogą być dodatkowo dostrajane metodami ze wzmocnieniem na podstawie specyficznych dla branży metryk nagrody, w tym z wykorzystaniem innego LLM jako modelu‑sędziego (LLM‑as‑a‑judge).[27]
Destylacja modeli (Model Distillation)
Funkcja Model Distillation pozwala używać Nova Premier lub Nova Pro jako modelu‑nauczyciela (teacher model) do uczenia mniejszych modeli‑uczniów (student models) — Nova Lite i Nova Micro. Zmniejsza to koszty obliczeniowe wnioskowania przy zachowaniu znacznej części jakości dużego modelu.[2][6]
Zastosowanie i integracja
Modele Nova są zintegrowane z usługami obliczeniowymi Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Główne udokumentowane scenariusze zastosowania:[2][1]
Agentowe przepływy pracy (Agentic Workflows)
Wieloetapowe wykonywanie zadań z wykorzystaniem Bedrock Agents i wywoływaniem zewnętrznych narzędzi (function calling). Korzystając z wzorca architektonicznego ReAct (Reasoning and Acting) w połączeniu z frameworkami takimi jak LangGraph, modele Nova koordynują analizę baz danych, tworzą zapytania SQL z języka naturalnego i zarządzają wieloelementowymi procesami. Nova Act zapewnia automatyzację przeglądarkowych przepływów UI z deklarowaną niezawodnością 90 % na wczesnych zadaniach użytkowników.[28][8]
Generowanie z wykorzystaniem zewnętrznej wiedzy (RAG)
Integracja z Bedrock Knowledge Bases w celu zakotwiczenia (grounding) odpowiedzi na danych korporacyjnych. Modele Nova 2 obsługują natywne wyszukiwanie w sieci z potwierdzeniem (web grounding) jako wbudowane narzędzie.[1][9]
Przetwarzanie dokumentów
Obsługiwane formaty dokumentów wejściowych: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (z wyjątkiem Nova Micro, który przyjmuje wyłącznie wejście tekstowe). Nova Premier jest w stanie przetwarzać wideo o długości do 90 minut w ramach jednego zapytania.[2][6]
Generowanie i debugowanie kodu
Obsługiwane języki programowania: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Interfejsy głosowe
Nova Sonic i Nova 2 Sonic stosowane są do budowy agentów głosowych z obsługą czasu rzeczywistego, zintegrowanych z Amazon Connect.[10][7]
Ocena modeli (LLM‑as‑a‑judge)
Nova jest stosowana jako model‑sędzia przy ocenie wyników innych modeli generatywnych na platformie Amazon SageMaker.[29]
Ograniczenia i otwarte problemy
- Zamkniętość architektury. Amazon nie ujawnia liczby parametrów, szczegółowych rozwiązań architektonicznych ani składu danych uczących, co znacząco ogranicza niezależną odtwarzalność wyników. Wagi modeli Nova nie są udostępniane do pobrania ani wdrożenia poza infrastrukturą AWS (wdrożenie on‑premise jest niemożliwe).[1][2]
- Limit wyjściowy. Maksymalna liczba tokenów wyjściowych dla wszystkich modeli rozumienia jest ograniczona do 10 tys. tokenów, co może być niewystarczające w zadaniach generowania długich dokumentów.[2]
- Ograniczenia RFT. Reinforcement Fine‑Tuning nie obsługuje wieloturowych (multi‑turn) dialogów ani danych multimodalnych; zalecany udział pozytywnych przykładów w zbiorze danych wynosi co najmniej 5 %.[27]
- Ograniczenia Nova Sonic. Maksymalny czas trwania połączenia — 8 minut; domyślnie maksymalnie 20 jednoczesnych połączeń na klienta.[2]
- Dostępność regionalna. Nova Premier dostępna jest tylko w jednym regionie (US East N. Virginia) bez obsługi wnioskowania między regionami; modele Nova 2 mają ograniczoną listę regionów wdrożenia.[2]
- Wrażliwość metryk. Oceny na syntetycznych benchmarkach nie zawsze korelują z jakością pracy w warunkach produkcyjnych (production), gdzie kluczowe jest ścisłe przestrzeganie polityk korporacyjnych i brak halucynacji w wieloetapowych wnioskach.[22][23]
- Halucynacje. Modele wykazują typowe dla LLM ograniczenia: możliwe są błędy faktyczne w generowanych odpowiedziach. W celu ograniczenia ryzyka zaleca się stosowanie Bedrock Guardrails i RAG.[1]
- Obiektywność porównawcza benchmarków. Amazon przedstawia porównania z modelami konkurencyjnymi na podstawie danych opublikowanych przez samych twórców, co nie zawsze zapewnia jednolitą kontrolowaną bazę eksperymentalną.[22]
Aspekty etyczne i regulacyjne
AWS deklaruje stosowanie zasad odpowiedzialnej AI (Responsible AI) przy tworzeniu modeli Nova. Konkretne środki bezpieczeństwa obejmują:[20][15]
- Wbudowana moderacja treści (content moderation).
- Znaki wodne (watermarking) dla wyjść audio Nova Sonic.
- Ocena według kategorii ryzyka: bezpieczeństwo (safety), prywatność (privacy), wiarygodność (veracity), przejrzystość (transparency), a także proliferacja broni CBRN (chemicznej, biologicznej, radiologicznej i jądrowej) oraz ofensywne operacje cybernetyczne.
- Integracja z Amazon Bedrock Guardrails do filtrowania danych wejściowych i wyjściowych.
- Ocena modelu Nova Premier pod kątem zgodności z Amazon Frontier Model Safety Framework.
- Red teaming — wewnętrzne i zewnętrzne testowanie odporności na ataki (według raportu technicznego — 307 technik).
- Ocena moderacji treści według metryki F1: 85,84 na benchmarku Aegis (według raportu technicznego).[1]
Karty usług AI (AI Service Cards) dla Nova Micro, Lite, Pro, Premier i Sonic zostały opublikowane na docs.aws.amazon.com jako dokumentacja dotycząca odpowiedzialnego stosowania.[20][15]
Perspektywy i kierunki badań
Rodzina Nova 2 oznacza przejście do modeli o rozszerzonych możliwościach rozumowania (extended thinking / reasoning), zbliżonych koncepcyjnie do łańcucha myślenia (Chain‑of‑Thought, CoT) i analogicznych mechanizmów w innych rodzinach modeli. Wbudowane wyszukiwanie w sieci i interpreter kodu jako natywne narzędzia (a nie zewnętrzne wtyczki) stanowią architektoniczne przesunięcie w kierunku systemów agentowych.[9][8]
Kierunki dalszego rozwoju wskazane w publicznych materiałach Amazon:
- Rozszerzenie multimodalności (model Omni jako zunifikowana architektura „wszystko do wszystkiego").
- Hybrydowe rozumowanie (hybrid reasoning) z adaptacyjną głębokością w zależności od złożoności zadania.
- Otwarte uczenie na danych użytkowników (Nova Forge) na wszystkich etapach wstępnego uczenia.
- Destylacja dla urządzeń brzegowych (edge).
- Rozszerzenie zestawu narzędzi bezpieczeństwa (safety toolkit).[8][11]
Tematyka Amazon Nova AI Challenge, organizowanego przez AWS wśród zespołów akademickich, obejmuje obszary zautomatyzowanego testowania adversarialnego, wyrównania bezpieczeństwa (safety alignment) i wieloturowych ataków (multi‑turn jailbreaks), co świadczy o inwestycjach w niezawodność rodziny modeli.[8]
Zobacz też
- Transformer (architektura)
- Reinforcement Learning from Human Feedback (RLHF)
Literatura
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, luty 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Odnośniki
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Oficjalna dokumentacja Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards dla Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card dla Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Ogłoszenie Amazon Nova (grudzień 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Ogłoszenie Amazon Nova 2 (grudzień 2025)
Przypisy
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/