Nova (Amazon) (EL)
Amazon Nova — μια οικογένεια θεμελιωδών μοντέλων (Foundation Models, FM) και μεγάλων γλωσσικών μοντέλων (Large Language Model, LLM), που αναπτύχθηκε από την υπηρεσία Amazon Artificial General Intelligence (AAG Intelligence) και είναι διαθέσιμη μέσω της πλήρως διαχειριζόμενης υπηρεσίας Amazon Bedrock. Η οικογένεια περιλαμβάνει μοντέλα για κατανόηση και παραγωγή κειμένου, επεξεργασία εικόνων, βίντεο και εγγράφων, καθώς και σύνθεση και αναγνώριση φωνής. Το Amazon Nova τοποθετείται ως αντικατάσταση της προηγούμενης γενιάς μοντέλων Amazon Titan και είναι ενσωματωμένο στο νεφοϋπολογιστικό οικοσύστημα Amazon Web Services (AWS).[1][2][3]
Ιστορία και χρονολόγιο ανάπτυξης
Πριν από την κυκλοφορία του Nova, η πλατφόρμα Amazon Bedrock παρείχε πρόσβαση σε μοντέλα τρίτων κατασκευαστών: Anthropic Claude, Meta Llama, Mistral και άλλα. Το Amazon Nova έγινε η πρώτη οικογένεια θεμελιωδών μοντέλων ιδίας κατασκευής της AWS, προσανατολισμένη στην εμπορική εφαρμογή σε νεφοϋπολογιστική υποδομή.[3]
Πρώτη γενιά (2024–2025)
Η πρώτη γενιά της οικογένειας Amazon Nova παρουσιάστηκε επίσημα στις 3 Δεκεμβρίου 2024 στο συνέδριο AWS re:Invent 2024. Στην αρχική έκδοση συμπεριλήφθηκαν τρία μοντέλα κατανόησης (understanding models) — Nova Micro (μόνο κείμενο), τα πολυτροπικά Nova Lite και Nova Pro — καθώς και τα γεννητικά μοντέλα Nova Canvas (δημιουργία εικόνων) και Nova Reel (δημιουργία βίντεο).[4][3][5]
Τον Απρίλιο του 2025 η σειρά εμπλουτίστηκε με το ναυαρχίδα μοντέλο Nova Premier — το πλέον ισχυρό μοντέλο της οικογένειας με παράθυρο πλαισίου 1 εκατομμυρίου token, σχεδιασμένο για εργασίες με σύνθετους συλλογισμούς και distillation (μεταφορά γνώσης από μεγάλο μοντέλο σε μικρότερο).[6] Τον ίδιο μήνα, τον Απρίλιο του 2025, παρουσιάστηκε το Nova Sonic — ένα φωνητικό μοντέλο κατηγορίας speech‑to‑speech με υποστήριξη διαλόγων σε πραγματικό χρόνο.[7]
Δεύτερη γενιά — Nova 2 (2025–2026)
Τον Νοέμβριο–Δεκέμβριο 2025 στο συνέδριο AWS re:Invent 2025 ανακοινώθηκε η δεύτερη γενιά — Amazon Nova 2. Η σειρά περιλάμβανε τα ενημερωμένα μοντέλα Nova 2 Lite και Nova 2 Pro με υποστήριξη dynamic reasoning και επεκτεταμένης επεξεργασίας πλαισίου, το εγγενώς πολυτροπικό μοντέλο Nova 2 Omni (ταυτόχρονη επεξεργασία και παραγωγή κειμένου, εικόνων, βίντεο και ήχου), καθώς και το Nova 2 Sonic — φωνητικό μοντέλο επόμενης γενιάς. Ταυτόχρονα παρουσιάστηκαν οι υπηρεσίες Nova Forge (περιβάλλον για προσαρμοσμένη εκπαίδευση μοντέλων) και Nova Act (framework για αγεντικά workflows).[8][9][10]
Τον Φεβρουάριο του 2026 δημοσιεύτηκε η επίσημη τεχνική αναφορά Amazon Nova 2.[11]
Συνολικό χρονολόγιο
| Ημερομηνία | Γεγονός |
|---|---|
| Δεκέμβριος 2024 | Ανακοίνωση του Amazon Nova στο AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| Απρίλιος 2025 | Κυκλοφορία του Nova Premier (πλαίσιο 1M token) και του Nova Sonic (speech‑to‑speech) |
| Ιούνιος 2025 | Δημοσίευση τεχνικής αναφοράς πρώτης γενιάς (arXiv:2506.12103) |
| Νοέμβριος–Δεκέμβριος 2025 | Ανακοίνωση Nova 2 στο AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| Φεβρουάριος 2026 | Δημοσίευση τεχνικής αναφοράς Amazon Nova 2 |
Θεωρητικές βάσεις και αρχιτεκτονική
Βασική αρχιτεκτονική μοντέλων κατανόησης (understanding‑models)
Σύμφωνα με την τεχνική αναφορά arXiv:2506.12103, τα μοντέλα κατανόησης (Nova Micro, Lite, Pro, Premier) βασίζονται στην αρχιτεκτονική transformer, όπως περιγράφεται στην εργασία Vaswani et al.[12] Ο βασικός μηχανισμός πολυκέφαλης αυτο-προσοχής (Multi‑Head Self‑Attention) περιγράφεται από τον τύπο:
όπου , , — οι μήτρες ερωτημάτων (queries), κλειδιών (keys) και τιμών (values) αντίστοιχα, — η διάσταση των κλειδιών.[12][1]
Οι ακριβείς παράμετροι αρχιτεκτονικής (αριθμός στρωμάτων, μέγεθος κρυφής κατάστασης, αριθμός κεφαλών προσοχής, συνολικός αριθμός παραμέτρων) δεν έχουν αποκαλυφθεί σε δημόσια διαθέσιμες πηγές έως τον Μάρτιο του 2026. Αυτή η προσέγγιση είναι χαρακτηριστική για κλειστά εμπορικά μοντέλα.[1]
Η πολυτροπική επεξεργασία στα Nova Lite και Nova Pro υλοποιείται μέσω ενοποίησης κειμενικών, οπτικών και βίντεο token σε μία ενιαία ακολουθία που τροφοδοτείται σε ένα ενιαίο γλωσσικό μοντέλο. Τα οπτικά κωδικοποιητικά στοιχεία (vision encoders) μετατρέπουν εικόνες και καρέ βίντεο σε ακολουθίες token συμβατές με την κειμενική αναπαράσταση.[1][13]
Αρχιτεκτονική γεννητικών μοντέλων
Τα γεννητικά μοντέλα Nova Canvas (εικόνες) και Nova Reel (βίντεο) χρησιμοποιούν την αρχιτεκτονική λανθάνοντων διαχυτικών μοντέλων (Latent Diffusion Models, LDM)[14] σε συνδυασμό με μεταβλητούς αυτοκωδικοποιητές (Variational AutoEncoder, VAE) για υπολογισμούς στον λανθάνοντα χώρο. Η διαδικασία διάχυσης περιγράφεται από την εξίσωση πρόσθιου θορύβου:
όπου — η αρχική εικόνα στον λανθάνοντα χώρο, — η θορυβισμένη έκδοσή της στο βήμα , — ο αθροιστικός παράμετρος του χρονοδιαγράμματος θορύβου, — τυπικός γκαουσιανός θόρυβος. Το κωδικοποιητικό στοιχείο κειμένου (text encoder) παρέχει conditioning — εξάρτηση της παραγωγής από το κειμενικό prompt.[13][14]
Αρχιτεκτονική φωνητικών μοντέλων
Το Nova Sonic χρησιμοποιεί αρχιτεκτονική διαφορετική από τα κειμενικά μοντέλα: ενοποιεί έναν εξειδικευμένο κωδικοποιητή φωνής (speech encoder), έναν αποκωδικοποιητή φωνής (speech renderer) και το κύριο πολυτροπικό γλωσσικό μοντέλο σε ένα ενιαίο end‑to‑end pipeline. Αυτό επιτρέπει την επεξεργασία φωνητικής εισόδου και την παραγωγή φωνητικής εξόδου χωρίς ενδιάμεση μετατροπή σε κείμενο (αν και η κειμενική αναπαράσταση χρησιμοποιείται εσωτερικά για τη διασφάλιση ποιότητας).[15][1]
Υποδομή εκπαίδευσης
Η εκπαίδευση των μοντέλων Nova πραγματοποιήθηκε σε κατανεμημένες συστοιχίες AWS Elastic Kubernetes Service (EKS) με χρήση ιδιόκτητων επιταχυντών ΤΝ της Amazon Trainium (instances TRN1), καθώς και γραφικών επεξεργαστών NVIDIA A100 και H100.[13][1]
Για τη μείωση του υπολογιστικού κόστους κατά την εκπαίδευση αναπτύχθηκαν και εφαρμόστηκαν εξειδικευμένες μέθοδοι βελτιστοποίησης:
- Super‑Selective Activation Checkpointing (SSC) — μέθοδος αποθήκευσης ενεργοποιήσεων που, σύμφωνα με την τεχνική αναφορά, μειώνει την κατανάλωση μνήμης γραφικών επεξεργαστών κατά περίπου 50% με ελάχιστο επιπλέον κόστος επανυπολογισμού (recomputation).[13]
- In‑CPU‑Memory Checkpointing — αποθήκευση ενδιάμεσων βαρών (checkpoints) στη μνήμη RAM κεντρικών επεξεργαστών (CPU) πριν από την ασύγχρονη εκφόρτωσή τους στον χώρο αποθήκευσης Amazon S3. Σύμφωνα με την Amazon, αυτή η προσέγγιση μείωσε τον χρόνο αποθήκευσης κατάστασης μοντέλου σε 0,1 δευτερόλεπτα σε instances με TRN1.[16][13]
Pipeline εκπαίδευσης και ευθυγράμμιση
Η διαδικασία εκπαίδευσης των μοντέλων Nova αποτελείται από αρκετά στάδια χαρακτηριστικά για σύγχρονα LLM:[1][17]
Προεκπαίδευση (Pre‑training)
Μεγαλόκλιμακη εκπαίδευση σε μεγάλο πολύγλωσσο και πολυτροπικό σώμα δεδομένων που περιλαμβάνει περισσότερες από 200 γλώσσες. Η ακριβής σύνθεση των δεδομένων εκπαίδευσης (όγκος, αναλογία γλωσσών, συγκεκριμένες πηγές) δεν παρέχεται σε δημόσια υλικά.[1]
Επιβλεπόμενη εκπαίδευση (Supervised Fine‑Tuning, SFT)
Επιπλέον εκπαίδευση σε επισημειωμένα παραδείγματα ζευγών «εντολή — απάντηση», που οδηγεί το μοντέλο στην εκτέλεση οδηγιών του χρήστη.[1]
Ευθυγράμμιση μέσω ενισχυτικής μάθησης
Για την ευθυγράμμιση της συμπεριφοράς του μοντέλου με τις προτιμήσεις του ανθρώπου εφαρμόζονται δύο βασικοί αλγόριθμοι:
Proximal Policy Optimization (PPO) — αλγόριθμος Reinforcement Learning from Human Feedback (RLHF) που χρησιμοποιεί ξεχωριστό μοντέλο ανταμοιβής (Reward Model).[18][1]
Direct Preference Optimization (DPO) — εναλλακτική μέθοδος ευθυγράμμισης που δεν απαιτεί ρητό μοντέλο ανταμοιβής. Η συνάρτηση στόχου DPO έχει τη μορφή:[19]
όπου:
- — η παραμετροποιημένη στρατηγική (το εκπαιδευόμενο μοντέλο);
- — το βασικό (παγωμένο) μοντέλο αναφοράς;
- — το prompt εισόδου (πλαίσιο);
- και — η προτιμώμενη (winner) και η απορριπτόμενη (loser) απάντηση αντίστοιχα;
- — η λογιστική (σιγμοειδής) συνάρτηση;
- — υπερπαράμετρος που ελέγχει την ισχύ της ποινής για απόκλιση από το βασικό μοντέλο (ανάλογο ποινής Kullback–Leibler, KL‑divergence penalty).[19][1]
Σύνθεση της οικογένειας μοντέλων
Η οικογένεια μοντέλων διαχωρίζεται σε βαθμίδες (tiers) ανάλογα με την ισορροπία μεταξύ απόδοσης, κόστους και καθυστέρησης (latency).[2][20]
Μοντέλα κατανόησης πρώτης γενιάς
| Παράμετρος | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Τροπικότητες εισόδου | Κείμενο | Κείμενο, εικόνα, βίντεο | Κείμενο, εικόνα, βίντεο | Κείμενο, εικόνα, βίντεο |
| Τροπικότητα εξόδου | Κείμενο | Κείμενο | Κείμενο | Κείμενο |
| Παράθυρο πλαισίου | 128 χιλ. token | 300 χιλ. token | 300 χιλ. token | 1 εκατ. token |
| Μέγ. token εξόδου | 10 χιλ. | 10 χιλ. | 10 χιλ. | 10 χιλ. |
| Υποστηριζόμενες γλώσσες | 200+ | 200+ | 200+ | 200+ |
| Fine‑tuning | Ναι | Ναι | Ναι | Όχι |
| Ημερομηνία κυκλοφορίας | Δεκέμβριος 2024 | Δεκέμβριος 2024 | Δεκέμβριος 2024 | Απρίλιος 2025 |
| Κύρια χρήση | Ελάχιστη καθυστέρηση και κόστος για κειμενικές εργασίες | Βασική πολυτροπική ανάλυση | Βέλτιστη ισορροπία για σύνθετες λογικές και αγεντικές εργασίες | Μέγιστη ακρίβεια, μοντέλο‑εκπαιδευτής για distillation |
Πηγή: AWS AI Service Cards; arXiv:2506.12103.[20][1]
Βελτιστοποιημένες γλώσσες (15): αγγλική, γερμανική, ισπανική, γαλλική, ιταλική, ιαπωνική, κορεατική, αραβική, κινεζική (απλοποιημένη), ρωσική, χίντι, πορτογαλική, ολλανδική, τουρκική, εβραϊκή.[2]
Το Nova Premier προορίζεται για εργασίες που απαιτούν βαθιά κατανόηση πλαισίου, πολυβήματο σχεδιασμό και επεξεργασία μεγάλων όγκων δεδομένων: βάσεις κώδικα, έγγραφα άνω των 400 σελίδων, βίντεο διάρκειας έως 90 λεπτών.[6]
Μοντέλα δεύτερης γενιάς (Nova 2)
Nova 2 Lite και Nova 2 Pro κυκλοφόρησαν τον Νοέμβριο–Δεκέμβριο 2025. Και τα δύο υποστηρίζουν extended thinking — έναν μηχανισμό κατά τον οποίο το μοντέλο εκτελεί πολυβήματους συλλογισμούς πριν από την παραγωγή απάντησης. Το βάθος συλλογισμού ρυθμίζεται από την παράμετρο reasoning_effort με επίπεδα low, medium και high. Το παράθυρο πλαισίου επεκτείνεται σε 1 εκατομμύριο token. Ενσωματωμένα εγγενή εργαλεία: αναζήτηση ιστού με επαλήθευση (web grounding) και διερμηνευτής κώδικα (code interpreter).[9][8]
Nova 2 Omni — εγγενώς πολυτροπικό μοντέλο, ικανό να δέχεται ταυτόχρονα ως είσοδο κείμενο, εικόνες, βίντεο και ήχο και να παράγει κείμενο και εικόνες. Παράθυρο πλαισίου — 1 εκατ. token.[8][11]
Nova 2 Sonic — φωνητικό μοντέλο επόμενης γενιάς. Υποστηρίζει 6 γλώσσες: αγγλική (αμερικανική και βρετανική εκδοχή), ισπανική, γερμανική, γαλλική, ιταλική. Εισάγει ασύγχρονη κλήση εργαλείων (asynchronous tool calling) — το μοντέλο συνεχίζει να επεξεργάζεται νέα είσοδο ενώ τα εξωτερικά εργαλεία εκτελούνται στο παρασκήνιο.[10]
| Παράμετρος | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Τροπικότητες εισόδου | Κείμενο, εικόνα, βίντεο | Κείμενο, εικόνα, βίντεο | Κείμενο, εικόνα, βίντεο, ήχος | Ήχος (φωνή) |
| Τροπικότητα εξόδου | Κείμενο | Κείμενο | Κείμενο, εικόνα | Ήχος (φωνή) |
| Παράθυρο πλαισίου | 1 εκατ. token | 1 εκατ. token | 1 εκατ. token | 300 χιλ. token |
| Extended thinking | Ναι | Ναι | Ναι | — |
| Εγγενή εργαλεία | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| Ημερομηνία κυκλοφορίας | Νοέμβριος–Δεκέμβριος 2025 | Νοέμβριος–Δεκέμβριος 2025 | Δεκέμβριος 2025 | Δεκέμβριος 2025 |
Πηγή: AWS Blog; Amazon Science.[9][8][11]
Γεννητικά μοντέλα
Nova Canvas — μοντέλο δημιουργίας εικόνων. Υποστηρίζει κειμενική και γραφική είσοδο (PNG, JPEG). Ανάλυση εξόδου — έως 4,19 εκατ. pixels (π.χ. 2048×2048 ή 2816×1536 pixels). Μέγιστο μήκος prompt — 1024 χαρακτήρες. Υποστηρίζονται λειτουργίες inpainting (αντικατάσταση περιοχής εικόνας) και outpainting (επέκταση εικόνας πέρα από τα όριά της).[2][4]
Nova Reel — μοντέλο δημιουργίας βίντεο. Ανάλυση εξόδου: 1280×720 στα 24 καρέ ανά δευτερόλεπτο. Διάρκεια παραγόμενου βίντεο — έως 6 δευτερόλεπτα. Υποστηρίζεται έλεγχος κίνησης κάμερας (camera control). Η πρόσβαση γίνεται μέσω ασύγχρονου API (Asynchronous Invoke Model API).[2][4]
Φωνητικά μοντέλα
Nova Sonic (Απρίλιος 2025) — φωνητικό μοντέλο με αμφίδρομο streaming API (bidirectional stream API). Υποστηρίζει κλήσεις συναρτήσεων (function calling) και εδραίωση σε εταιρικά δεδομένα μέσω Retrieval‑Augmented Generation (RAG). Η λειτουργία υδατογραφήματος (watermarking) είναι ενσωματωμένη εξ ορισμού. Μέγιστη διάρκεια σύνδεσης — 8 λεπτά με δυνατότητα επανάληψης· μέγιστο 20 ταυτόχρονες συνδέσεις ανά πελάτη (προεπιλεγμένη τιμή).[7][15][2]
Nova 2 Sonic (Δεκέμβριος 2025) — επόμενη γενιά φωνητικού μοντέλου με βελτιωμένη αναγνώριση σύντομων εκφωνήσεων, τηλεφωνικού ήχου (8 kHz) και προφορών.[10]
Αξιολόγηση και benchmarks
Η αξιολόγηση των μοντέλων Nova διενεργήθηκε με χρήση αυτοματοποιημένων benchmark, συμπεριλαμβανομένης της προσέγγισης «LLM‑as‑a‑judge» (χρήση γλωσσικού μοντέλου ως αξιολογητή). Σύμφωνα με έρευνα του HKU SPACE AI Hub, η μετρική Arena‑Hard‑Auto παρουσιάζει συσχέτιση 98,6% με τις αξιολογήσεις εμπειρογνωμόνων.[21][22]
Benchmarks πρώτης γενιάς
Δεδομένα από την τεχνική αναφορά arXiv:2506.12103 (συνθήκες: αποτελέσματα των ίδιων των προγραμματιστών ανταγωνιστικών μοντέλων, δημοσιευμένα κατά τη στιγμή σύνταξης της αναφοράς):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
Πηγή: arXiv:2506.12103, πίνακας 2.1.1.[1]
Τα αποτελέσματα αποδεικνύουν την ιεραρχία απόδοσης εντός της οικογένειας (Premier > Pro > Lite > Micro). Η διαφορά είναι πιο εμφανής στις κατηγορίες μαθηματικών (Math) και συλλογισμού (Reasoning)· σε εργασίες ρόλων (Roleplay) και εξαγωγής πληροφοριών (Extraction) τα μικρότερα μοντέλα παρουσιάζουν αποτελέσματα κοντά στα μεγαλύτερα.[22]
Benchmarks δεύτερης γενιάς (Nova 2)
Δεδομένα από την τεχνική αναφορά Amazon Nova 2 (συνθήκες: internal measurements, 0‑shot / CoT όπου αναφέρεται):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
Πηγή: Amazon Nova 2 Technical Report, πίνακας 1.[11]
Αγεντικά benchmarks (Nova 2 Pro): SWE‑Bench Verified — 70,0%; τ²‑bench Verified Telecom — 92,7%.[11]
Πολυτροπικά benchmarks (Nova 2 Omni): VideoMME — 77,9%; MMMU Pro — 61,4%.[11]
Κατά την αξιολόγηση σε εργασίες τεχνικής υποστήριξης, το Nova 2 Lite πέτυχε 9,63 ± 0,27 σε δεκάβαθμη κλίμακα στη μετρική «Αναγνώριση προβλήματος» (Problem Identification), ξεπερνώντας σημαντικά το Nova Lite πρώτης γενιάς (8,57 ± 0,46).[23]
Σημείωση. Κατά τη σύγκριση αποτελεσμάτων με ανταγωνιστικά μοντέλα, πρέπει να λαμβάνεται υπόψη ότι οι συνθήκες prompting, οι εκδόσεις μοντέλων και οι ημερομηνίες μέτρησης μπορεί να διαφέρουν. Τα benchmark πρώτης και δεύτερης γενιάς προέρχονται από αυτο-αναφορές της Amazon· ανεξάρτητες επαληθεύσεις (FloTorch, Artificial Analysis) επιβεβαιώνουν γενικά τη δηλωμένη σχέση τιμής/απόδοσης, αλλά σε ορισμένες μετρικές ακρίβειας καταγράφουν υστέρηση έναντι των κορυφαίων ανταγωνιστών.[22]
Ταχύτητα συμπερασμού
Σύμφωνα με εσωτερικές μετρήσεις Amazon (internal, μέσω Bedrock API):[1][11]
| Μοντέλο | Ταχύτητα συμπερασμού (token/δευτ.) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
Κόστος χρήσης
Όλα τα μοντέλα είναι διαθέσιμα μέσω Amazon Bedrock με μοντέλο χρέωσης ανά αριθμό επεξεργασμένων token (δεδομένα Μαρτίου 2026):[2]
| Μοντέλο | Token εισόδου (USD / 1M) | Token εξόδου (USD / 1M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
Για σύγκριση: το Anthropic Claude 3.5 Sonnet κατά την κυκλοφορία του Nova τιμολογούνταν στα $6,00 / 1M token εισόδου και $30,00 / 1M token εξόδου.[22]
Προσαρμογή και fine‑tuning
Η υποδομή AWS παρέχει αρκετές μεθόδους προσαρμογής των βασικών μοντέλων Nova σε εξειδικευμένους τομείς. Το κύριο εργαλείο για αυτό στη δεύτερη γενιά είναι το περιβάλλον Amazon Nova Forge.[8][17]
Continued Pre‑Training (CPT) και Mid‑Training
Το Nova Forge παρέχει πρόσβαση σε ενδιάμεσα σημεία ελέγχου (checkpoints) εκπαίδευσης μοντέλων (π.χ. pretraining‑text‑RD και pretraining‑text‑CE). Αυτό επιτρέπει τη συνέχιση της αυτο-εποπτευόμενης μάθησης (self‑supervised learning) σε μάζες εταιρικών δεδομένων με προσεκτική ρύθμιση του ρυθμού μάθησης (learning rate) για την αποφυγή καταστροφικής λήθης (catastrophic forgetting).[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Ενημέρωση μόνο ενός μικρού υποσυνόλου βαρών μοντέλου μέσω προσαρμογέων χαμηλής κατάταξης — Low‑Rank Adaptation (LoRA)[26]. Αυτή η προσέγγιση μειώνει σημαντικά τις υπολογιστικές απαιτήσεις σε σύγκριση με την πλήρη εκπαίδευση (full fine‑tuning). Υποστηρίζεται πολυτροπικό fine‑tuning για τα Nova Lite και Pro.[17]
Reinforcement Fine‑Tuning (RFT)
Τα προσαρμοσμένα μοντέλα μπορούν να εκπαιδευτούν επιπλέον με μεθόδους ενισχυτικής μάθησης βάσει κλαδικών μετρικών ανταμοιβής, συμπεριλαμβανομένης της χρήσης άλλου LLM ως μοντέλου‑κριτή (LLM‑as‑a‑judge).[27]
Απόσταξη μοντέλων (Model Distillation)
Η λειτουργία Model Distillation επιτρέπει τη χρήση του Nova Premier ή Nova Pro ως μοντέλου‑εκπαιδευτή (teacher model) για την εκπαίδευση μικρότερων μοντέλων‑μαθητών (student models) — Nova Lite και Nova Micro. Αυτό μειώνει το υπολογιστικό κόστος συμπερασμού διατηρώντας σημαντικό μέρος της ποιότητας του μεγαλύτερου μοντέλου.[2][6]
Εφαρμογές και ενσωμάτωση
Τα μοντέλα Nova είναι ενσωματωμένα στις υπολογιστικές υπηρεσίες Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer). Κύρια τεκμηριωμένα σενάρια εφαρμογής:[2][1]
Αγεντικές ροές εργασίας (Agentic Workflows)
Πολυβήματη εκτέλεση εργασιών με χρήση Bedrock Agents και κλήση εξωτερικών εργαλείων (function calling). Χρησιμοποιώντας το αρχιτεκτονικό μοτίβο ReAct (Reasoning and Acting) σε συνδυασμό με frameworks τύπου LangGraph, τα μοντέλα Nova συντονίζουν αναλυτική βάσεων δεδομένων, δημιουργούν ερωτήματα SQL από φυσική γλώσσα και διαχειρίζονται σύνθετες διαδικασίες. Το Nova Act παρέχει αυτοματοποίηση browser UI‑workflows με δηλωμένη αξιοπιστία 90% σε πρώιμες εργασίες χρηστών.[28][8]
Παραγωγή με ανάκτηση εξωτερικής γνώσης (RAG)
Ενσωμάτωση με Bedrock Knowledge Bases για εδραίωση (grounding) απαντήσεων σε εταιρικά δεδομένα. Τα μοντέλα Nova 2 υποστηρίζουν εγγενή αναζήτηση ιστού με επαλήθευση (web grounding) ως ενσωματωμένο εργαλείο.[1][9]
Επεξεργασία εγγράφων
Υποστηριζόμενες μορφές εγγράφων εισόδου: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (εκτός από το Nova Micro, που δέχεται μόνο κειμενική είσοδο). Το Nova Premier μπορεί να επεξεργαστεί βίντεο διάρκειας έως 90 λεπτών εντός ενός μόνο αιτήματος.[2][6]
Δημιουργία και αποσφαλμάτωση κώδικα
Υποστηριζόμενες γλώσσες προγραμματισμού: Python, Java, JavaScript, C#, TypeScript, SQL.[20]
Φωνητικές διεπαφές
Τα Nova Sonic και Nova 2 Sonic χρησιμοποιούνται για τη δημιουργία φωνητικών πρακτόρων με υποστήριξη πραγματικού χρόνου, ενσωματωμένων με το Amazon Connect.[10][7]
Αξιολόγηση μοντέλων (LLM‑as‑a‑judge)
Το Nova χρησιμοποιείται ως μοντέλο‑κριτής κατά την αξιολόγηση εξόδων άλλων γεννητικών μοντέλων στην πλατφόρμα Amazon SageMaker.[29]
Περιορισμοί και ανοιχτά ζητήματα
- Κλειστότητα αρχιτεκτονικής. Η Amazon δεν αποκαλύπτει τον αριθμό παραμέτρων, τις λεπτομερείς αρχιτεκτονικές αποφάσεις και τη σύνθεση των δεδομένων εκπαίδευσης, γεγονός που περιορίζει σημαντικά την ανεξάρτητη αναπαραγωγιμότητα των αποτελεσμάτων. Τα βάρη των μοντέλων Nova δεν διατίθενται για λήψη ή ανάπτυξη εκτός της υποδομής AWS (ανάπτυξη on‑premise δεν είναι δυνατή).[1][2]
- Όριο εξόδου. Ο μέγιστος αριθμός token εξόδου για όλα τα μοντέλα κατανόησης περιορίζεται σε 10 χιλιάδες token, κάτι που μπορεί να μην επαρκεί για εργασίες δημιουργίας μακρών εγγράφων.[2]
- Περιορισμοί RFT. Το Reinforcement Fine‑Tuning δεν υποστηρίζει πολυγύρους (multi‑turn) διαλόγους και πολυτροπικά δεδομένα· η συνιστώμενη αναλογία θετικών παραδειγμάτων στο σύνολο δεδομένων είναι τουλάχιστον 5%.[27]
- Περιορισμοί Nova Sonic. Μέγιστη διάρκεια σύνδεσης — 8 λεπτά· μέγιστο 20 ταυτόχρονες συνδέσεις ανά πελάτη εξ ορισμού.[2]
- Περιφερειακή διαθεσιμότητα. Το Nova Premier είναι διαθέσιμο μόνο σε μία περιοχή (US East N. Virginia) χωρίς υποστήριξη διαπεριφερειακού συμπερασμού· τα μοντέλα Nova 2 έχουν περιορισμένη λίστα περιοχών ανάπτυξης.[2]
- Ευαισθησία μετρικών. Οι βαθμολογίες σε συνθετικά benchmarks δεν συσχετίζονται πάντα με την ποιότητα λειτουργίας σε παραγωγικές συνθήκες (production), όπου κρίσιμη παράμετρος είναι η αυστηρή τήρηση εταιρικών πολιτικών και η απουσία παραισθήσεων (hallucinations) σε πολυβήματα συμπεράσματα.[22][23]
- Παραισθήσεις. Τα μοντέλα παρουσιάζουν τους χαρακτηριστικούς για τα LLM περιορισμούς: είναι δυνατά πραγματικά σφάλματα στις παραγόμενες απαντήσεις. Για τη μείωση κινδύνων συνιστάται η χρήση Bedrock Guardrails και RAG.[1]
- Συγκριτική αντικειμενικότητα benchmarks. Η Amazon παρουσιάζει συγκρίσεις με ανταγωνιστικά μοντέλα βάσει δεδομένων που δημοσίευσαν οι ίδιοι οι προγραμματιστές, κάτι που δεν εξασφαλίζει πάντα ενιαία ελεγχόμενη πειραματική βάση.[22]
Ηθικές και κανονιστικές πτυχές
Η AWS δηλώνει ότι ακολουθεί τις αρχές υπεύθυνης ΤΝ (Responsible AI) κατά την ανάπτυξη των μοντέλων Nova. Συγκεκριμένα μέτρα ασφάλειας περιλαμβάνουν:[20][15]
- Ενσωματωμένη μετριοπάθεια περιεχομένου (content moderation).
- Υδατογραφήματα (watermarking) για φωνητικές εξόδους του Nova Sonic.
- Αξιολόγηση ανά κατηγορία κινδύνου: ασφάλεια (safety), εμπιστευτικότητα (privacy), αξιοπιστία (veracity), διαφάνεια (transparency), καθώς και διάδοση χημικών, βιολογικών, ραδιολογικών και πυρηνικών (ΧΒΡΠ) όπλων (CBRN) και επιθετικές κυβερνο-επιχειρήσεις.
- Ενσωμάτωση με Amazon Bedrock Guardrails για φιλτράρισμα εισερχόμενων και εξερχόμενων δεδομένων.
- Αξιολόγηση του μοντέλου Nova Premier για συμμόρφωση με το Amazon Frontier Model Safety Framework.
- Red teaming — εσωτερικές και εξωτερικές δοκιμές ανθεκτικότητας σε επιθέσεις (σύμφωνα με την τεχνική αναφορά, 307 τεχνικές).
- Αξιολόγηση μετριοπάθειας περιεχομένου με μετρική F1: 85,84 στο benchmark Aegis (σύμφωνα με την τεχνική αναφορά).[1]
Οι κάρτες υπηρεσίας ΤΝ (AI Service Cards) για τα Nova Micro, Lite, Pro, Premier και Sonic έχουν δημοσιευτεί στο docs.aws.amazon.com ως τεκμηρίωση υπεύθυνης χρήσης.[20][15]
Προοπτικές και κατευθύνσεις έρευνας
Η οικογένεια Nova 2 σηματοδοτεί τη μετάβαση σε μοντέλα με εκτεταμένες δυνατότητες συλλογισμού (extended thinking / reasoning), συγκρίσιμες ως προς την ιδέα με την αλυσίδα σκέψης (Chain‑of‑Thought, CoT) και παρόμοιους μηχανισμούς σε άλλες οικογένειες μοντέλων. Η ενσωματωμένη αναζήτηση ιστού και ο διερμηνευτής κώδικα ως εγγενή εργαλεία (και όχι πρόσθετα τρίτων) αντιπροσωπεύουν αρχιτεκτονική στροφή προς αγεντικά συστήματα.[9][8]
Κατευθύνσεις περαιτέρω ανάπτυξης που αναφέρονται στα δημόσια υλικά της Amazon:
- Επέκταση πολυτροπικότητας (μοντέλο Omni ως ενοποιημένη αρχιτεκτονική «τα-πάντα-σε-όλα»).
- Υβριδικοί συλλογισμοί (hybrid reasoning) με προσαρμοστικό βάθος ανάλογα με την πολυπλοκότητα της εργασίας.
- Ανοιχτή εκπαίδευση σε δεδομένα χρηστών (Nova Forge) σε όλα τα στάδια προεκπαίδευσης.
- Απόσταξη για συσκευές edge.
- Επέκταση του εργαλείου ασφάλειας (safety toolkit).[8][11]
Η θεματολογία του Amazon Nova AI Challenge, που διοργανώνει η AWS για πανεπιστημιακές ομάδες, περιλαμβάνει κατευθύνσεις αυτοματοποιημένης ανταγωνιστικής δοκιμής, ευθυγράμμισης ασφάλειας (safety alignment) και πολυγύρων επιθέσεων (multi‑turn jailbreaks), γεγονός που αποδεικνύει τις επενδύσεις στην αξιοπιστία της οικογένειας μοντέλων.[8]
Δείτε επίσης
- Transformer (αρχιτεκτονική)
- Reinforcement Learning from Human Feedback (RLHF)
Βιβλιογραφία
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, Φεβρουάριος 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
Σύνδεσμοι
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Επίσημη τεκμηρίωση Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards για τα Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card για το Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Ανακοίνωση Amazon Nova (Δεκέμβριος 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Ανακοίνωση Amazon Nova 2 (Δεκέμβριος 2025)
Παραπομπές
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/