Nova (Amazon) (ID)
Amazon Nova — keluarga model fundamental (Foundation Models, FM) dan model bahasa besar (Large Language Model, LLM) yang dikembangkan oleh divisi Amazon Artificial General Intelligence (AAG Intelligence) dan tersedia melalui layanan terkelola penuh Amazon Bedrock. Keluarga ini mencakup model untuk pemahaman dan pembuatan teks, pemrosesan gambar, video, dan dokumen, serta sintesis dan pengenalan suara. Amazon Nova diposisikan sebagai pengganti generasi model Amazon Titan sebelumnya dan terintegrasi ke dalam ekosistem cloud Amazon Web Services (AWS).[1][2][3]
Sejarah dan Kronologi Pengembangan
Sebelum peluncuran Nova, platform Amazon Bedrock menyediakan akses ke model pihak ketiga: Anthropic Claude, Meta Llama, Mistral, dan lainnya. Amazon Nova menjadi keluarga model fundamental pertama yang dikembangkan sendiri oleh AWS, yang ditujukan untuk penggunaan komersial dalam infrastruktur cloud.[3]
Generasi Pertama (2024–2025)
Generasi pertama keluarga Amazon Nova secara resmi diperkenalkan pada 3 Desember 2024 di konferensi AWS re:Invent 2024. Rilis awal mencakup tiga model pemahaman (understanding models) — Nova Micro (hanya teks), Nova Lite dan Nova Pro yang bersifat multimodal — serta model generatif Nova Canvas (pembuatan gambar) dan Nova Reel (pembuatan video).[4][3][5]
Pada April 2025, jajaran ini dilengkapi dengan model unggulan Nova Premier — model paling kuat dalam keluarga ini dengan jendela konteks 1 juta token, yang dirancang untuk tugas-tugas dengan penalaran kompleks dan distilasi (distillation, transfer pengetahuan dari model besar ke model yang lebih kecil).[6] Pada bulan yang sama, April 2025, Nova Sonic diperkenalkan — model suara kelas speech‑to‑speech dengan dukungan dialog real-time.[7]
Generasi Kedua — Nova 2 (2025–2026)
Pada November–Desember 2025 di konferensi AWS re:Invent 2025, generasi kedua diumumkan — Amazon Nova 2. Jajaran ini mencakup model yang diperbarui Nova 2 Lite dan Nova 2 Pro dengan dukungan penalaran dinamis (dynamic reasoning) dan pemrosesan konteks yang diperluas, model multimodal native Nova 2 Omni (pemrosesan dan pembuatan teks, gambar, video, dan audio secara bersamaan), serta Nova 2 Sonic — model suara generasi berikutnya. Bersamaan dengan itu, diperkenalkan juga layanan Nova Forge (lingkungan untuk pelatihan model kustom) dan Nova Act (kerangka kerja untuk alur kerja agentik).[8][9][10]
Pada Februari 2026, laporan teknis resmi Amazon Nova 2 dipublikasikan.[11]
Kronologi Ringkasan
| Tanggal | Peristiwa |
|---|---|
| Desember 2024 | Pengumuman Amazon Nova di AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| April 2025 | Peluncuran Nova Premier (konteks 1M token) dan Nova Sonic (speech‑to‑speech) |
| Juni 2025 | Publikasi laporan teknis generasi pertama (arXiv:2506.12103) |
| November–Desember 2025 | Pengumuman Nova 2 di AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| Februari 2026 | Publikasi laporan teknis Amazon Nova 2 |
Landasan Teoretis dan Arsitektur
Arsitektur Dasar Model Understanding
Menurut laporan teknis arXiv:2506.12103, model pemahaman (Nova Micro, Lite, Pro, Premier) didasarkan pada arsitektur transformer (Transformer) yang dijelaskan dalam karya Vaswani et al.[12] Mekanisme dasar multi-head self-attention (Multi‑Head Self‑Attention) dijelaskan dengan rumus:
di mana , , — matriks kueri (queries), kunci (keys), dan nilai (values) secara berturut-turut, — dimensi kunci.[12][1]
Parameter arsitektur yang tepat (jumlah lapisan, ukuran hidden state, jumlah attention head, total jumlah parameter) tidak diungkapkan dalam sumber yang tersedia untuk umum per Maret 2026. Pendekatan ini khas untuk model komersial bersifat tertutup.[1]
Pemrosesan multimodal pada Nova Lite dan Nova Pro diimplementasikan melalui penggabungan token teks, visual, dan video ke dalam satu urutan yang diberikan sebagai input ke satu model bahasa. Encoder visual (vision encoders) mengubah gambar dan frame video menjadi urutan token yang kompatibel dengan representasi teks.[1][13]
Arsitektur Model Generatif
Model generatif Nova Canvas (gambar) dan Nova Reel (video) menggunakan arsitektur model difusi laten (Latent Diffusion Models, LDM)[14] yang dikombinasikan dengan autoencoder variasional (Variational AutoEncoder, VAE) untuk komputasi di ruang laten. Proses difusi dijelaskan dengan persamaan noise maju:
di mana — gambar asli di ruang laten, — versinya yang telah diberi noise pada langkah , — parameter kumulatif jadwal noise, — noise Gaussian standar. Encoder teks (text encoder) menyediakan conditioning — pengkondisian pembuatan pada prompt teks.[13][14]
Arsitektur Model Suara
Nova Sonic menggunakan arsitektur yang berbeda dari model teks: ia menggabungkan encoder suara khusus (speech encoder), dekoder suara (speech renderer), dan model bahasa multimodal utama ke dalam satu pipeline ujung-ke-ujung (end‑to‑end pipeline). Hal ini memungkinkan pemrosesan input suara dan pembuatan output suara tanpa konversi perantara ke teks (meskipun representasi teks digunakan secara internal untuk memastikan kualitas).[15][1]
Infrastruktur Pelatihan
Pelatihan model Nova dilakukan pada klaster terdistribusi AWS Elastic Kubernetes Service (EKS) menggunakan akselerator AI Amazon Trainium (instans TRN1) milik sendiri, serta unit pemrosesan grafis NVIDIA A100 dan H100.[13][1]
Untuk mengurangi biaya komputasi selama pelatihan, metode optimasi khusus dikembangkan dan diterapkan:
- Super‑Selective Activation Checkpointing (SSC) — metode penyimpanan aktivasi yang, menurut laporan teknis, mengurangi konsumsi memori unit pemrosesan grafis sekitar 50% dengan overhead rekomputasi (recomputation) yang minimal.[13]
- In‑CPU‑Memory Checkpointing — penyimpanan cache bobot antara (checkpoints) di memori utama prosesor pusat (CPU) sebelum pemuatannya secara asinkron ke penyimpanan cloud Amazon S3. Menurut Amazon, pendekatan ini memungkinkan pengurangan waktu penyimpanan status model hingga 0,1 detik pada instans dengan TRN1.[16][13]
Pipeline Pelatihan dan Penyelarasan
Proses pelatihan model Nova terdiri dari beberapa tahap yang khas untuk LLM modern:[1][17]
Pra-Pelatihan (Pre‑training)
Pelatihan skala besar pada korpus data multibahasa dan multimodal yang besar, mencakup lebih dari 200 bahasa. Komposisi tepat data pelatihan (volume, rasio bahasa, sumber spesifik) tidak dicantumkan dalam materi publik.[1]
Fine-Tuning Terawasi (Supervised Fine‑Tuning, SFT)
Fine-tuning pada contoh berlabel berupa pasangan "instruksi — jawaban", yang membawa model ke arah mengikuti instruksi pengguna.[1]
Penyelarasan dengan Reinforcement Learning
Untuk menyelaraskan perilaku model dengan preferensi manusia, dua algoritma utama digunakan:
Proximal Policy Optimization (PPO) — algoritma reinforcement learning berdasarkan umpan balik manusia (Reinforcement Learning from Human Feedback, RLHF), menggunakan model penghargaan (Reward Model) terpisah.[18][1]
Direct Preference Optimization (DPO) — metode penyelarasan alternatif yang tidak memerlukan model penghargaan eksplisit. Fungsi objektif DPO memiliki bentuk:[19]
di mana:
- — strategi terparametrisasi (model yang dapat dilatih);
- — model referensi dasar (yang dibekukan);
- — prompt input (konteks);
- dan — jawaban yang disukai (winner) dan yang ditolak (loser) secara berturut-turut;
- — fungsi logistik (sigmoid);
- — hiperparameter yang mengontrol kekuatan penalti atas penyimpangan dari model dasar (analog dengan penalti Kullback–Leibler, KL‑divergence penalty).[19][1]
Komposisi Keluarga Model
Keluarga model dibagi menjadi tingkatan (tiers) berdasarkan keseimbangan antara kinerja, biaya, dan latensi (latency).[2][20]
Model Pemahaman Generasi Pertama
| Parameter | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Modalitas input | Teks | Teks, gambar, video | Teks, gambar, video | Teks, gambar, video |
| Modalitas output | Teks | Teks | Teks | Teks |
| Jendela konteks | 128 ribu token | 300 ribu token | 300 ribu token | 1 juta token |
| Maks. token output | 10 ribu | 10 ribu | 10 ribu | 10 ribu |
| Dukungan bahasa | 200+ | 200+ | 200+ | 200+ |
| Fine-tuning | Ya | Ya | Ya | Tidak |
| Tanggal rilis | Desember 2024 | Desember 2024 | Desember 2024 | April 2025 |
| Tujuan utama | Latensi dan biaya minimal untuk tugas teks | Analisis multimodal dasar | Keseimbangan optimal untuk tugas logika dan agentik yang kompleks | Akurasi maksimal, model guru untuk distilasi |
Sumber: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Bahasa yang dioptimalkan (15): Inggris, Jerman, Spanyol, Prancis, Italia, Jepang, Korea, Arab, Tionghoa (disederhanakan), Rusia, Hindi, Portugis, Belanda, Turki, Ibrani.[2]
Nova Premier dirancang untuk tugas yang membutuhkan pemahaman konteks mendalam, perencanaan multi-langkah, dan bekerja dengan volume data besar: basis kode, dokumen dengan volume lebih dari 400 halaman, video berdurasi hingga 90 menit.[6]
Model Generasi Kedua (Nova 2)
Nova 2 Lite dan Nova 2 Pro dirilis pada November–Desember 2025. Keduanya mendukung pemikiran diperluas (extended thinking) — mekanisme di mana model melakukan penalaran multi-langkah sebelum menghasilkan jawaban. Kedalaman penalaran diatur oleh parameter reasoning_effort dengan tingkatan low, medium, dan high. Jendela konteks diperluas hingga 1 juta token. Alat native bawaan tersedia: pencarian web dengan konfirmasi (web grounding) dan interpreter kode (code interpreter).[9][8]
Nova 2 Omni — model multimodal native yang mampu menerima teks, gambar, video, dan audio secara bersamaan sebagai input dan menghasilkan teks serta gambar. Jendela konteks — 1 juta token.[8][11]
Nova 2 Sonic — model suara generasi berikutnya. Mendukung 6 bahasa: Inggris (varian Amerika dan Britania), Spanyol, Jerman, Prancis, Italia. Memperkenalkan pemanggilan alat asinkron (asynchronous tool calling) — model terus memproses input baru sementara alat eksternal dijalankan di latar belakang.[10]
| Parameter | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Modalitas input | Teks, gambar, video | Teks, gambar, video | Teks, gambar, video, audio | Audio (suara) |
| Modalitas output | Teks | Teks | Teks, gambar | Audio (suara) |
| Jendela konteks | 1 juta token | 1 juta token | 1 juta token | 300 ribu token |
| Extended thinking | Ya | Ya | Ya | — |
| Alat native | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Tanggal rilis | November–Desember 2025 | November–Desember 2025 | Desember 2025 | Desember 2025 |
Sumber: AWS Blog; Amazon Science.[9][8][11]
Model Generatif
Nova Canvas — model pembuatan gambar. Mendukung input teks dan grafis (PNG, JPEG). Resolusi output — hingga 4,19 juta piksel (misalnya, 2048×2048 atau 2816×1536 piksel). Panjang prompt maksimal — 1024 karakter. Operasi inpainting (penggantian area gambar) dan outpainting (perluasan gambar melampaui batasnya) didukung.[2][4]
Nova Reel — model pembuatan video. Resolusi output: 1280×720 pada 24 frame per detik. Durasi video yang dihasilkan — hingga 6 detik. Kontrol pergerakan kamera (camera control) didukung. Akses dilakukan melalui API asinkron (Asynchronous Invoke Model API).[2][4]
Model Suara
Nova Sonic (April 2025) — model suara dengan API streaming dua arah (bidirectional stream API). Mendukung pemanggilan fungsi (function calling) dan penyandingan pada data perusahaan melalui Retrieval‑Augmented Generation (RAG, pembuatan dengan penarikan pengetahuan eksternal). Fungsi tanda air (watermarking) tersedia secara bawaan. Durasi koneksi maksimal — 8 menit dengan kemungkinan pemulihan; maksimal 20 koneksi simultan per klien (nilai bawaan).[7][15][2]
Nova 2 Sonic (Desember 2025) — generasi berikutnya dari model suara dengan peningkatan pengenalan ucapan pendek, audio telepon (8 kHz), dan aksen.[10]
Evaluasi dan Benchmark
Evaluasi model Nova dilakukan menggunakan benchmark otomatis, termasuk pendekatan "LLM‑as‑a‑judge" (penggunaan model bahasa sebagai penilai). Menurut penelitian HKU SPACE AI Hub, metrik Arena‑Hard‑Auto menunjukkan korelasi 98,6% dengan penilaian para ahli.[21][22]
Benchmark Generasi Pertama
Data dari laporan teknis arXiv:2506.12103 (kondisi: hasil yang dipublikasikan oleh pengembang model pesaing pada saat laporan disiapkan):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Sumber: arXiv:2506.12103, tabel 2.1.1.[1]
Hasil menunjukkan hierarki kinerja dalam keluarga (Premier > Pro > Lite > Micro). Selisih paling terlihat dalam kategori matematika (Math) dan penalaran (Reasoning); dalam tugas interaksi peran (Roleplay) dan ekstraksi informasi (Extraction), model yang lebih kecil menunjukkan hasil yang mendekati model yang lebih besar.[22]
Benchmark Generasi Kedua (Nova 2)
Data dari laporan teknis Amazon Nova 2 (kondisi: internal measurements, 0‑shot / CoT bila disebutkan):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Sumber: Amazon Nova 2 Technical Report, tabel 1.[11]
Benchmark agentik (Nova 2 Pro): SWE‑Bench Verified — 70,0%; τ²‑bench Verified Telecom — 92,7%.[11]
Benchmark multimodal (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]
Dalam evaluasi pada tugas dukungan teknis, Nova 2 Lite memperoleh 9,63 ± 0,27 pada skala sepuluh poin dalam metrik "Identifikasi Masalah" (Problem Identification), jauh melampaui Nova Lite generasi pertama (8,57 ± 0,46).[23]
Catatan. Ketika membandingkan hasil dengan model pesaing, perlu diperhatikan bahwa kondisi prompting, versi model, dan tanggal pengambilan metrik dapat berbeda. Benchmark generasi pertama dan kedua diperoleh dari laporan mandiri Amazon; verifikasi independen (FloTorch, Artificial Analysis) secara umum mengonfirmasi rasio harga/kinerja yang diklaim, tetapi pada metrik akurasi tertentu mencatat ketertinggalan dari pesaing terdepan.[22]
Kecepatan Inferensi
Berdasarkan pengukuran internal Amazon (internal, melalui Bedrock API):[1][11]
| Model | Kecepatan inferensi (token/detik) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Biaya Penggunaan
Semua model tersedia melalui Amazon Bedrock dengan model pembayaran berdasarkan jumlah token yang diproses (data per Maret 2026):[2]
| Model | Token input (USD / 1M) | Token output (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
Sebagai perbandingan: Anthropic Claude 3.5 Sonnet pada saat rilis Nova dikenakan tarif $6,00 / 1M token input dan $30,00 / 1M token output.[22]
Kustomisasi dan Fine-Tuning
Infrastruktur AWS menyediakan beberapa metode untuk mengadaptasi model dasar Nova ke domain yang sangat terspesialisasi. Alat utama untuk ini dalam generasi kedua adalah lingkungan Amazon Nova Forge.[8][17]
Continued Pre‑Training (CPT) dan Mid‑Training
Nova Forge membuka akses ke checkpoint pelatihan antara model (misalnya, pretraining‑text‑RD dan pretraining‑text‑CE). Ini memungkinkan kelanjutan pelatihan mandiri (self‑supervised learning) pada kumpulan data perusahaan dengan pemilihan learning rate yang cermat untuk mencegah lupa katastrofik (catastrophic forgetting).[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Pembaruan hanya subset kecil bobot model melalui adaptor berperingkat rendah — Low‑Rank Adaptation (LoRA)[26]. Pendekatan ini secara substansial mengurangi kebutuhan sumber daya komputasi dibandingkan dengan fine-tuning penuh (full fine‑tuning). Fine-tuning multimodal didukung untuk Nova Lite dan Pro.[17]
Reinforcement Fine‑Tuning (RFT)
Model kustom dapat dilatih lebih lanjut menggunakan metode reinforcement berdasarkan metrik penghargaan yang spesifik industri, termasuk menggunakan LLM lain sebagai model juri (LLM‑as‑a‑judge).[27]
Distilasi Model (Model Distillation)
Fitur Model Distillation memungkinkan penggunaan Nova Premier atau Nova Pro sebagai model guru (teacher model) untuk melatih model murid yang lebih kecil (student models) — Nova Lite dan Nova Micro. Ini mengurangi biaya komputasi inferensi sambil mempertahankan sebagian besar kualitas model besar.[2][6]
Penerapan dan Integrasi
Model Nova terintegrasi ke dalam layanan komputasi Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Skenario penerapan utama yang terdokumentasi:[2][1]
Alur Kerja Agentik (Agentic Workflows)
Pelaksanaan tugas multi-langkah menggunakan Bedrock Agents dan pemanggilan alat eksternal (function calling). Menggunakan pola arsitektur ReAct (Reasoning and Acting) bersama kerangka kerja seperti LangGraph, model Nova mengoordinasikan analitik basis data, membentuk kueri SQL dari bahasa alami, dan mengelola proses multi-komponen. Nova Act menyediakan otomatisasi alur kerja UI browser dengan keandalan yang diklaim 90% pada tugas pengguna awal.[28][8]
Pembuatan dengan Penarikan Pengetahuan Eksternal (RAG)
Integrasi dengan Bedrock Knowledge Bases untuk penyandingan (grounding) jawaban pada data perusahaan. Model Nova 2 mendukung pencarian web native dengan konfirmasi (web grounding) sebagai alat bawaan.[1][9]
Pemrosesan Dokumen
Format dokumen input yang didukung: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (kecuali Nova Micro, yang hanya menerima input teks). Nova Premier mampu memproses video berdurasi hingga 90 menit dalam satu permintaan.[2][6]
Pembuatan dan Debugging Kode
Bahasa pemrograman yang didukung: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Antarmuka Suara
Nova Sonic dan Nova 2 Sonic digunakan untuk membangun agen suara dengan dukungan real-time yang terintegrasi dengan Amazon Connect.[10][7]
Evaluasi Model (LLM‑as‑a‑judge)
Nova digunakan sebagai model juri dalam mengevaluasi output model generatif lain di platform Amazon SageMaker.[29]
Keterbatasan dan Masalah Terbuka
- Ketertutupan arsitektur. Amazon tidak mengungkapkan jumlah parameter, keputusan arsitektur terperinci, dan komposisi data pelatihan, yang secara substansial membatasi reproduktibilitas hasil secara independen. Bobot model Nova tidak disediakan untuk diunduh atau digunakan di luar infrastruktur AWS (penerapan on‑premise tidak dimungkinkan).[1][2]
- Batas output. Jumlah token output maksimal untuk semua model pemahaman dibatasi pada 10 ribu token, yang mungkin tidak cukup untuk tugas pembuatan dokumen panjang.[2]
- Keterbatasan RFT. Reinforcement Fine‑Tuning tidak mendukung dialog multi-giliran (multi‑turn) dan data multimodal; proporsi contoh positif yang disarankan dalam dataset adalah minimal 5%.[27]
- Keterbatasan Nova Sonic. Durasi koneksi maksimal — 8 menit; maksimal 20 koneksi simultan per klien secara bawaan.[2]
- Ketersediaan regional. Nova Premier hanya tersedia di satu wilayah (US East N. Virginia) tanpa dukungan inferensi lintas wilayah; model Nova 2 memiliki daftar wilayah penerapan yang terbatas.[2]
- Sensitivitas metrik. Penilaian pada benchmark sintetis tidak selalu berkorelasi dengan kualitas kerja dalam kondisi produksi (production), di mana kepatuhan ketat terhadap kebijakan perusahaan dan tidak adanya halusinasi dalam inferensi bertahap sangat penting.[22][23]
- Halusinasi. Model menunjukkan keterbatasan yang khas untuk LLM: kesalahan faktual mungkin terjadi dalam jawaban yang dihasilkan. Untuk mengurangi risiko, penggunaan Bedrock Guardrails dan RAG direkomendasikan.[1]
- Objektivitas komparatif benchmark. Amazon menyajikan perbandingan dengan model pesaing berdasarkan data yang dipublikasikan oleh pengembang itu sendiri, yang tidak selalu memastikan satu basis eksperimental yang terkontrol.[22]
Aspek Etika dan Regulasi
AWS mendeklarasikan kepatuhan terhadap prinsip AI yang bertanggung jawab (Responsible AI) dalam pengembangan model Nova. Tindakan keamanan konkret mencakup:[20][15]
- Moderasi konten bawaan (content moderation).
- Tanda air (watermarking) untuk output audio Nova Sonic.
- Evaluasi berdasarkan kategori risiko: keamanan (safety), privasi (privacy), kebenaran (veracity), transparansi (transparency), serta penyebaran senjata KBRN (kimia, biologi, radiologi, dan nuklir) (CBRN) dan operasi siber ofensif.
- Integrasi dengan Amazon Bedrock Guardrails untuk penyaringan data input dan output.
- Evaluasi model Nova Premier terhadap kepatuhan Amazon Frontier Model Safety Framework.
- Red teaming — pengujian internal dan eksternal terhadap ketahanan terhadap serangan (menurut laporan teknis, 307 teknik).
- Evaluasi moderasi konten berdasarkan metrik F1: 85,84 pada benchmark Aegis (menurut laporan teknis).[1]
Kartu layanan AI (AI Service Cards) untuk Nova Micro, Lite, Pro, Premier, dan Sonic dipublikasikan di docs.aws.amazon.com sebagai dokumentasi penggunaan yang bertanggung jawab.[20][15]
Prospek dan Arah Penelitian
Keluarga Nova 2 menandai transisi ke model dengan kemampuan penalaran yang diperluas (extended thinking / reasoning), yang sebanding secara konsep dengan rantai pemikiran (Chain‑of‑Thought, CoT) dan mekanisme serupa dalam keluarga model lain. Pencarian web bawaan dan interpreter kode sebagai alat native (bukan plugin pihak ketiga) mewakili pergeseran arsitektur ke arah sistem agentik.[9][8]
Arah pengembangan lebih lanjut yang diidentifikasi dalam materi publik Amazon:
- Perluasan multimodalitas (model Omni sebagai arsitektur terpadu "segalanya‑ke‑segalanya").
- Penalaran hibrida (hybrid reasoning) dengan kedalaman adaptif bergantung pada kompleksitas tugas.
- Pelatihan terbuka pada data pengguna (Nova Forge) di semua tahap pra-pelatihan.
- Distilasi untuk perangkat edge.
- Perluasan perangkat keamanan (safety toolkit).[8][11]
Topik Amazon Nova AI Challenge yang diselenggarakan AWS di antara tim universitas mencakup arah pengujian adversarial otomatis, penyelarasan keamanan (safety alignment), dan serangan multi-giliran (multi‑turn jailbreaks), yang mencerminkan investasi dalam keandalan keluarga model.[8]
Lihat Juga
- Transformer (arsitektur)
- Reinforcement Learning from Human Feedback (RLHF)
Literatur
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, Februari 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Referensi
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Dokumentasi resmi Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards untuk Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card untuk Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Pengumuman Amazon Nova (Desember 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Pengumuman Amazon Nova 2 (Desember 2025)
Catatan
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/