Nova (Amazon) (TH)
Amazon Nova — กลุ่มโมเดลพื้นฐาน (Foundation Models, FM) และโมเดลภาษาขนาดใหญ่ (Large Language Model, LLM) ที่พัฒนาโดยหน่วยงาน Amazon Artificial General Intelligence (AAG Intelligence) และเข้าถึงได้ผ่านบริการที่จัดการครบวงจรอย่าง Amazon Bedrock กลุ่มโมเดลนี้ครอบคลุมโมเดลสำหรับการทำความเข้าใจและสร้างข้อความ การประมวลผลรูปภาพ วิดีโอ และเอกสาร ตลอดจนการสังเคราะห์และจดจำเสียงพูด Amazon Nova ได้รับการวางตำแหน่งให้เป็นตัวแทนของโมเดลรุ่นก่อนหน้าอย่าง Amazon Titan และถูกผนวกรวมเข้ากับระบบนิเวศคลาวด์ Amazon Web Services (AWS)[1][2][3]
ประวัติและลำดับเวลาของการพัฒนา
ก่อนการเปิดตัว Nova แพลตฟอร์ม Amazon Bedrock ให้การเข้าถึงโมเดลของบุคคลที่สาม ได้แก่ Anthropic Claude, Meta Llama, Mistral และอื่นๆ Amazon Nova กลายเป็นกลุ่มโมเดลพื้นฐานที่พัฒนาโดย AWS เองกลุ่มแรก ซึ่งมุ่งเน้นการใช้งานเชิงพาณิชย์ภายในโครงสร้างพื้นฐานคลาวด์[3]
รุ่นที่หนึ่ง (2024–2025)
รุ่นแรกของกลุ่มโมเดล Amazon Nova ได้รับการเปิดตัวอย่างเป็นทางการเมื่อวันที่ 3 ธันวาคม 2024 ในงานประชุม AWS re:Invent 2024 การเปิดตัวครั้งแรกประกอบด้วยโมเดลทำความเข้าใจ (understanding models) สามรุ่น ได้แก่ Nova Micro (รองรับเฉพาะข้อความ) รวมถึง Nova Lite และ Nova Pro ที่เป็น multimodal นอกจากนี้ยังมีโมเดลสร้างสรรค์ Nova Canvas (สำหรับสร้างภาพ) และ Nova Reel (สำหรับสร้างวิดีโอ)[4][3][5]
ในเดือนเมษายน 2025 กลุ่มโมเดลได้รับการเสริมด้วยโมเดลเรือธงอย่าง Nova Premier ซึ่งเป็นโมเดลที่ทรงพลังที่สุดในกลุ่ม มี context window ขนาด 1 ล้าน token เหมาะสำหรับงานที่ต้องการการให้เหตุผลที่ซับซ้อนและการทำ distillation (การถ่ายโอนความรู้จากโมเดลขนาดใหญ่ไปยังโมเดลขนาดเล็ก)[6] ในช่วงเวลาเดียวกันในเดือนเมษายน 2025 ได้มีการเปิดตัว Nova Sonic ซึ่งเป็นโมเดลเสียงประเภท speech-to-speech ที่รองรับการโต้ตอบแบบเรียลไทม์[7]
รุ่นที่สอง — Nova 2 (2025–2026)
ในช่วงเดือนพฤศจิกายน–ธันวาคม 2025 ในงานประชุม AWS re:Invent 2025 ได้มีการประกาศรุ่นที่สอง — Amazon Nova 2 กลุ่มโมเดลนี้ประกอบด้วยโมเดล Nova 2 Lite และ Nova 2 Pro ที่อัปเดตแล้ว พร้อมรองรับ dynamic reasoning และการประมวลผล context ที่ขยายออกไป โมเดล multimodal แบบ native อย่าง Nova 2 Omni (รองรับการประมวลผลและสร้างข้อความ รูปภาพ วิดีโอ และเสียงพร้อมกัน) รวมถึง Nova 2 Sonic ซึ่งเป็นโมเดลเสียงรุ่นถัดไป ในเวลาเดียวกันได้มีการเปิดตัวบริการ Nova Forge (สภาพแวดล้อมสำหรับการฝึกอบรมโมเดลแบบกำหนดเอง) และ Nova Act (framework สำหรับ agentic workflow)[8][9][10]
ในเดือนกุมภาพันธ์ 2026 ได้มีการเผยแพร่รายงานทางเทคนิคอย่างเป็นทางการของ Amazon Nova 2[11]
ลำดับเวลาโดยสรุป
| วันที่ | เหตุการณ์ |
|---|---|
| ธันวาคม 2024 | ประกาศเปิดตัว Amazon Nova ที่งาน AWS re:Invent 2024: Nova Micro, Lite, Pro, Canvas, Reel |
| เมษายน 2025 | เปิดตัว Nova Premier (context 1M token) และ Nova Sonic (speech-to-speech) |
| มิถุนายน 2025 | เผยแพร่รายงานทางเทคนิครุ่นแรก (arXiv:2506.12103) |
| พฤศจิกายน–ธันวาคม 2025 | ประกาศเปิดตัว Nova 2 ที่งาน AWS re:Invent 2025: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| กุมภาพันธ์ 2026 | เผยแพร่รายงานทางเทคนิค Amazon Nova 2 |
รากฐานทางทฤษฎีและสถาปัตยกรรม
สถาปัตยกรรมพื้นฐานของโมเดล understanding
ตามรายงานทางเทคนิค arXiv:2506.12103 โมเดลทำความเข้าใจ (Nova Micro, Lite, Pro, Premier) ใช้สถาปัตยกรรม transformer ตามที่อธิบายในงานวิจัยของ Vaswani et al.[12] กลไกพื้นฐานของ Multi-Head Self-Attention อธิบายด้วยสูตร:
โดยที่ , , คือเมทริกซ์ queries, keys และ values ตามลำดับ และ คือมิติของ keys[12][1]
พารามิเตอร์สถาปัตยกรรมที่แน่นอน (จำนวนชั้น ขนาด hidden state จำนวน attention heads และจำนวนพารามิเตอร์ทั้งหมด) ยังไม่ได้เปิดเผยในแหล่งข้อมูลสาธารณะ ณ เดือนมีนาคม 2026 ซึ่งเป็นแนวทางที่พบได้ทั่วไปในโมเดลเชิงพาณิชย์แบบปิด[1]
การประมวลผล multimodal ใน Nova Lite และ Nova Pro ทำได้โดยการรวม token ของข้อความ รูปภาพ และวิดีโอเข้าเป็น sequence เดียวที่ป้อนเข้าสู่โมเดลภาษาเดียว vision encoders จะแปลงรูปภาพและเฟรมวิดีโอให้เป็น sequence ของ token ที่เข้ากันได้กับการแทนค่าข้อความ[1][13]
สถาปัตยกรรมของโมเดลสร้างสรรค์
โมเดลสร้างสรรค์ Nova Canvas (รูปภาพ) และ Nova Reel (วิดีโอ) ใช้สถาปัตยกรรม Latent Diffusion Models (LDM)[14] ร่วมกับ Variational AutoEncoder (VAE) สำหรับการคำนวณในปริภูมิ latent กระบวนการ diffusion อธิบายด้วยสมการการเติมสัญญาณรบกวนแบบก้าวหน้า:
โดยที่ คือภาพต้นฉบับใน latent space, คือเวอร์ชันที่เติมสัญญาณรบกวนแล้ว ณ ขั้นตอน , คือพารามิเตอร์สะสมของ noise schedule และ คือสัญญาณรบกวน Gaussian มาตรฐาน text encoder ทำหน้าที่ conditioning — การกำหนดเงื่อนไขของการสร้างบน text prompt[13][14]
สถาปัตยกรรมของโมเดลเสียง
Nova Sonic ใช้สถาปัตยกรรมที่แตกต่างจากโมเดลข้อความ โดยรวม speech encoder เฉพาะทาง, speech renderer (decoder) และโมเดลภาษา multimodal หลักเข้าเป็น end-to-end pipeline เดียว สิ่งนี้ช่วยให้สามารถประมวลผลเสียงพูดและสร้างเสียงพูดเป็นผลลัพธ์ได้โดยไม่ต้องแปลงเป็นข้อความในระหว่างกระบวนการ (แม้ว่าการแทนค่าข้อความจะถูกใช้ภายในเพื่อรับประกันคุณภาพ)[15][1]
โครงสร้างพื้นฐานการฝึกอบรม
การฝึกอบรมโมเดล Nova ดำเนินการบนคลัสเตอร์แบบกระจาย AWS Elastic Kubernetes Service (EKS) โดยใช้ตัวเร่งประมวลผล AI ของ Amazon เองอย่าง Amazon Trainium (instances TRN1) รวมถึง GPU อย่าง NVIDIA A100 และ H100[13][1]
เพื่อลดต้นทุนการคำนวณในระหว่างการฝึกอบรม ได้มีการพัฒนาและนำวิธีการเพิ่มประสิทธิภาพเฉพาะทางมาใช้:
- Super-Selective Activation Checkpointing (SSC) — วิธีการบันทึก activation ซึ่งตามรายงานทางเทคนิค สามารถลดการใช้หน่วยความจำ GPU ได้ประมาณ 50% โดยมีค่าใช้จ่ายในการคำนวณซ้ำ (recomputation) น้อยมาก[13]
- In-CPU-Memory Checkpointing — การแคช intermediate weights (checkpoints) ใน RAM ของ CPU ก่อนที่จะอัปโหลดแบบ asynchronous ไปยังพื้นที่จัดเก็บคลาวด์ Amazon S3 ตามข้อมูลของ Amazon แนวทางนี้ช่วยลดเวลาในการบันทึกสถานะโมเดลเหลือเพียง 0.1 วินาที บน instances ที่ใช้ TRN1[16][13]
Pipeline การฝึกอบรมและการปรับแนว
กระบวนการฝึกอบรมโมเดล Nova ประกอบด้วยหลายขั้นตอนที่เป็นลักษณะเฉพาะของ LLM สมัยใหม่:[1][17]
Pre-training - การฝึกอบรมเบื้องต้น
การฝึกอบรมขนาดใหญ่บน corpus ข้อมูลหลายภาษาและหลาย modality ที่ครอบคลุมมากกว่า 200 ภาษา ส่วนประกอบที่แน่นอนของข้อมูลฝึกอบรม (ปริมาณ สัดส่วนของภาษา แหล่งที่มาเฉพาะเจาะจง) ไม่ได้ระบุในเอกสารสาธารณะ[1]
Supervised Fine-Tuning (SFT) - การ fine-tuning แบบมีผู้ดูแล
การ fine-tuning บนตัวอย่างคู่ "คำสั่ง — คำตอบ" ที่มีการระบุป้ายกำกับ เพื่อให้โมเดลทำตามคำสั่งของผู้ใช้[1]
การปรับแนวด้วย Reinforcement Learning
สำหรับการปรับแนวพฤติกรรมของโมเดลให้สอดคล้องกับความต้องการของมนุษย์ ใช้อัลกอริธึมหลักสองแบบ:
Proximal Policy Optimization (PPO) — อัลกอริธึม Reinforcement Learning from Human Feedback (RLHF) ที่ใช้โมเดลรางวัล (Reward Model) แยกต่างหาก[18][1]
Direct Preference Optimization (DPO) — วิธีการปรับแนวทางเลือกที่ไม่ต้องการโมเดลรางวัลแบบชัดเจน ฟังก์ชันวัตถุประสงค์ของ DPO มีรูปแบบ:[19]
โดยที่:
- — นโยบายที่มีพารามิเตอร์ (โมเดลที่กำลังฝึก);
- — โมเดลอ้างอิงพื้นฐาน (แช่แข็ง);
- — prompt อินพุต (บริบท);
- และ — คำตอบที่ต้องการ (winner) และที่ถูกปฏิเสธ (loser) ตามลำดับ;
- — ฟังก์ชัน logistic (sigmoid);
- — hyperparameter ที่ควบคุมความแรงของบทลงโทษสำหรับการเบี่ยงเบนจากโมเดลพื้นฐาน (คล้ายกับ KL-divergence penalty)[19][1]
องค์ประกอบของกลุ่มโมเดล
กลุ่มโมเดลถูกแบ่งออกเป็น tiers ตามสมดุลระหว่างประสิทธิภาพ ต้นทุน และ latency[2][20]
โมเดล understanding รุ่นที่หนึ่ง
| พารามิเตอร์ | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| Modality อินพุต | ข้อความ | ข้อความ รูปภาพ วิดีโอ | ข้อความ รูปภาพ วิดีโอ | ข้อความ รูปภาพ วิดีโอ |
| Modality เอาต์พุต | ข้อความ | ข้อความ | ข้อความ | ข้อความ |
| Context window | 128K token | 300K token | 300K token | 1M token |
| จำนวน token เอาต์พุตสูงสุด | 10K | 10K | 10K | 10K |
| ภาษาที่รองรับ | 200+ | 200+ | 200+ | 200+ |
| รองรับ fine-tuning | ใช่ | ใช่ | ใช่ | ไม่ใช่ |
| วันที่เปิดตัว | ธันวาคม 2024 | ธันวาคม 2024 | ธันวาคม 2024 | เมษายน 2025 |
| วัตถุประสงค์หลัก | latency และต้นทุนต่ำสุดสำหรับงานข้อความ | การวิเคราะห์ multimodal ขั้นพื้นฐาน | สมดุลที่ดีที่สุดสำหรับงานตรรกะที่ซับซ้อนและงาน agentic | ความแม่นยำสูงสุด เป็นโมเดลครูสำหรับ distillation |
แหล่งที่มา: AWS AI Service Cards; arXiv:2506.12103.[20][1]
ภาษาที่ได้รับการปรับแต่ง (15 ภาษา): อังกฤษ เยอรมัน สเปน ฝรั่งเศส อิตาลี ญี่ปุ่น เกาหลี อาหรับ จีน (ตัวย่อ) รัสเซีย ฮินดี โปรตุเกส ดัตช์ ตุรกี และฮีบรู[2]
Nova Premier ถูกออกแบบมาสำหรับงานที่ต้องการความเข้าใจบริบทเชิงลึก การวางแผนหลายขั้นตอน และการทำงานกับข้อมูลปริมาณมาก เช่น codebase เอกสารที่มีความยาวมากกว่า 400 หน้า และวิดีโอที่มีความยาวนานถึง 90 นาที[6]
โมเดลรุ่นที่สอง (Nova 2)
Nova 2 Lite และ Nova 2 Pro เปิดตัวในเดือนพฤศจิกายน–ธันวาคม 2025 ทั้งสองรองรับ extended thinking — กลไกที่โมเดลดำเนินการให้เหตุผลหลายขั้นตอนก่อนสร้างคำตอบ ความลึกของการให้เหตุผลควบคุมได้ด้วยพารามิเตอร์ reasoning_effort ที่มีระดับ low, medium และ high context window ขยายเป็น 1 ล้าน token มีเครื่องมือแบบ native ในตัว ได้แก่ การค้นหาเว็บพร้อมการยืนยัน (web grounding) และ code interpreter[9][8]
Nova 2 Omni — โมเดล multimodal แบบ native ที่สามารถรับข้อความ รูปภาพ วิดีโอ และเสียงเป็นอินพุตพร้อมกัน และสร้างข้อความและรูปภาพเป็นเอาต์พุต context window ขนาด 1M token[8][11]
Nova 2 Sonic — โมเดลเสียงรุ่นถัดไป รองรับ 6 ภาษา ได้แก่ อังกฤษ (สำเนียงอเมริกันและอังกฤษ) สเปน เยอรมัน ฝรั่งเศส และอิตาลี นำเสนอ asynchronous tool calling — โมเดลยังคงประมวลผลอินพุตใหม่ในขณะที่เครื่องมือภายนอกทำงานอยู่เบื้องหลัง[10]
| พารามิเตอร์ | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| Modality อินพุต | ข้อความ รูปภาพ วิดีโอ | ข้อความ รูปภาพ วิดีโอ | ข้อความ รูปภาพ วิดีโอ เสียง | เสียง (คำพูด) |
| Modality เอาต์พุต | ข้อความ | ข้อความ | ข้อความ รูปภาพ | เสียง (คำพูด) |
| Context window | 1M token | 1M token | 1M token | 300K token |
| Extended thinking | ใช่ | ใช่ | ใช่ | — |
| เครื่องมือ native | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| วันที่เปิดตัว | พฤศจิกายน–ธันวาคม 2025 | พฤศจิกายน–ธันวาคม 2025 | ธันวาคม 2025 | ธันวาคม 2025 |
แหล่งที่มา: AWS Blog; Amazon Science.[9][8][11]
โมเดลสร้างสรรค์
Nova Canvas — โมเดลสร้างภาพ รองรับอินพุตแบบข้อความและกราฟิก (PNG, JPEG) ความละเอียดเอาต์พุตสูงสุด 4.19 ล้านพิกเซล (เช่น 2048×2048 หรือ 2816×1536 พิกเซล) ความยาว prompt สูงสุด 1,024 อักขระ รองรับการดำเนินการ inpainting (การแทนที่บริเวณในภาพ) และ outpainting (การขยายภาพออกไปนอกขอบเขต)[2][4]
Nova Reel — โมเดลสร้างวิดีโอ ความละเอียดเอาต์พุต: 1280×720 ที่ 24 เฟรมต่อวินาที ความยาวของวิดีโอที่สร้างได้สูงสุด 6 วินาที รองรับการควบคุมการเคลื่อนไหวของกล้อง (camera control) การเข้าถึงทำผ่าน asynchronous API (Asynchronous Invoke Model API)[2][4]
โมเดลเสียง
Nova Sonic (เมษายน 2025) — โมเดลเสียงที่มี bidirectional stream API รองรับ function calling และการยึดโยงกับข้อมูลองค์กรผ่าน Retrieval-Augmented Generation (RAG) ฟังก์ชัน watermarking ถูกเปิดใช้งานโดยค่าเริ่มต้น ระยะเวลาการเชื่อมต่อสูงสุด 8 นาที พร้อมความสามารถในการเชื่อมต่อใหม่ และสูงสุด 20 การเชื่อมต่อพร้อมกันต่อลูกค้า (ค่าเริ่มต้น)[7][15][2]
Nova 2 Sonic (ธันวาคม 2025) — โมเดลเสียงรุ่นถัดไป พร้อมการจดจำที่ดีขึ้นสำหรับคำพูดสั้น เสียงโทรศัพท์ (8 kHz) และสำเนียงต่างๆ[10]
การประเมินผลและ benchmark
การประเมินโมเดล Nova ดำเนินการโดยใช้ benchmark อัตโนมัติ รวมถึงแนวทาง "LLM-as-a-judge" (การใช้โมเดลภาษาเป็นผู้ประเมิน) ตามการศึกษาของ HKU SPACE AI Hub เมตริก Arena-Hard-Auto แสดงความสัมพันธ์ 98.6% กับการประเมินของผู้เชี่ยวชาญ[21][22]
Benchmark รุ่นที่หนึ่ง
ข้อมูลจากรายงานทางเทคนิค arXiv:2506.12103 (เงื่อนไข: ผลลัพธ์ของผู้พัฒนาโมเดลคู่แข่งที่เผยแพร่ในช่วงเวลาที่จัดทำรายงาน):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT-4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5-shot) | — | 80.5 | 77.6 | — | — |
| MATH (4-shot) | — | 73.3 | 69.3 | — | — |
| IFEval | — | 87.5 | 87.2 | — | — |
| MT-Bench (text) | 79.7 | 77.7 | — | 76.7 | 77.5 |
| MT-Bench (multimodal) | 63.7 | 60.7 | — | 61.6 | 55.0 |
แหล่งที่มา: arXiv:2506.12103, ตาราง 2.1.1.[1]
ผลลัพธ์แสดงให้เห็นลำดับชั้นของประสิทธิภาพภายในกลุ่มโมเดล (Premier > Pro > Lite > Micro) ช่องว่างที่เห็นได้ชัดที่สุดอยู่ในหมวดคณิตศาสตร์ (Math) และการให้เหตุผล (Reasoning) ในขณะที่งาน Roleplay และ Extraction โมเดลรุ่นเล็กให้ผลลัพธ์ใกล้เคียงกับรุ่นใหญ่[22]
Benchmark รุ่นที่สอง (Nova 2)
ข้อมูลจากรายงานทางเทคนิค Amazon Nova 2 (เงื่อนไข: internal measurements, 0-shot / CoT ตามที่ระบุ):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT-5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU-Pro (acc) | 80.9 | 81.6 | 80.0 | 83.7 | 83.2 |
| GPQA-Diamond (acc) | 79.6 | 81.4 | 73.0 | 82.3 | 82.8 |
| AIME 2025 (acc) | 91.0 | 92.3 | 80.7 | 91.1 | 72.0 |
| LongCodeBench 1M (acc) | 84.0 | 84.0 | — | — | 78.0 |
แหล่งที่มา: Amazon Nova 2 Technical Report, ตาราง 1.[11]
Benchmark เชิง agentic (Nova 2 Pro): SWE-Bench Verified — 70.0%; τ²-bench Verified Telecom — 92.7%[11]
Benchmark multimodal (Nova 2 Omni): VideoMME — 77.9%; MMMU Pro — 61.4%[11]
ในการประเมินงานสนับสนุนทางเทคนิค Nova 2 Lite ได้คะแนน 9.63 ± 0.27 จากสิบคะแนนในเมตริก "การระบุปัญหา" (Problem Identification) ซึ่งดีกว่า Nova Lite รุ่นแรกอย่างมีนัยสำคัญ (8.57 ± 0.46)[23]
หมายเหตุ: ในการเปรียบเทียบผลลัพธ์กับโมเดลคู่แข่ง จำเป็นต้องคำนึงว่าเงื่อนไขการ prompting เวอร์ชันของโมเดล และวันที่วัดค่าเมตริกอาจแตกต่างกัน benchmark ของรุ่นแรกและรุ่นสองได้มาจากรายงานของ Amazon เอง การตรวจสอบอิสระ (FloTorch, Artificial Analysis) โดยทั่วไปยืนยันอัตราส่วนราคาต่อประสิทธิภาพที่อ้างไว้ แต่บางเมตริกด้านความแม่นยำบันทึกการล้าหลังจากคู่แข่งชั้นนำ[22]
ความเร็วในการประมวลผล
ตามการวัดภายในของ Amazon (internal, ผ่าน Bedrock API):[1][11]
| โมเดล | ความเร็วในการประมวลผล (token/วินาที) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
ต้นทุนการใช้งาน
โมเดลทั้งหมดสามารถเข้าถึงได้ผ่าน Amazon Bedrock ในรูปแบบการชำระเงินตามจำนวน token ที่ประมวลผล (ข้อมูล ณ เดือนมีนาคม 2026):[2]
| โมเดล | Token อินพุต (USD / 1M) | Token เอาต์พุต (USD / 1M) |
|---|---|---|
| Nova Micro | $0.035 | $0.14 |
| Nova Lite | ≈$0.06 | ≈$0.24 |
| Nova Pro | $0.80 | $3.20 |
| Nova Premier | $2.50 | $12.50 |
เพื่อการเปรียบเทียบ: Anthropic Claude 3.5 Sonnet ในช่วงเวลาที่เปิดตัว Nova มีราคา $6.00 / 1M token อินพุต และ $30.00 / 1M token เอาต์พุต[22]
การกำหนดเองและ fine-tuning
โครงสร้างพื้นฐานของ AWS มีวิธีการหลายอย่างสำหรับการปรับโมเดลพื้นฐาน Nova ให้เหมาะกับโดเมนเฉพาะทาง เครื่องมือหลักสำหรับรุ่นที่สองคือสภาพแวดล้อม Amazon Nova Forge[8][17]
Continued Pre-Training (CPT) และ Mid-Training
Nova Forge เปิดให้เข้าถึง intermediate checkpoints ของการฝึกอบรมโมเดล (เช่น pretraining‑text‑RD และ pretraining‑text‑CE) ซึ่งช่วยให้สามารถดำเนินการ self-supervised learning ต่อได้บนชุดข้อมูลองค์กรด้วยการปรับ learning rate อย่างระมัดระวังเพื่อป้องกัน catastrophic forgetting[24][25]
Parameter-Efficient Fine-Tuning (PEFT)
การอัปเดตเฉพาะชุดน้ำหนักขนาดเล็กของโมเดลผ่าน adapter แบบ low-rank — Low-Rank Adaptation (LoRA)[26] แนวทางนี้ลดความต้องการทรัพยากรการคำนวณลงอย่างมากเมื่อเทียบกับ full fine-tuning รองรับ multimodal fine-tuning สำหรับ Nova Lite และ Pro[17]
Reinforcement Fine-Tuning (RFT)
โมเดลที่กำหนดเองสามารถ fine-tuning เพิ่มเติมด้วยวิธี Reinforcement Learning โดยอิงจากเมตริกรางวัลเฉพาะอุตสาหกรรม รวมถึงการใช้ LLM อีกตัวเป็นโมเดลตัดสิน (LLM-as-a-judge)[27]
การ distillation โมเดล (Model Distillation)
ฟังก์ชัน Model Distillation ช่วยให้ใช้ Nova Premier หรือ Nova Pro เป็นโมเดลครู (teacher model) เพื่อฝึกโมเดลนักเรียน (student models) ขนาดเล็กกว่า ได้แก่ Nova Lite และ Nova Micro ซึ่งช่วยลดต้นทุนการคำนวณในการ inference ขณะที่ยังคงรักษาคุณภาพส่วนใหญ่ของโมเดลขนาดใหญ่[2][6]
การประยุกต์ใช้และการผนวกรวม
โมเดล Nova ถูกผนวกรวมเข้ากับบริการคำนวณของ Amazon (AWS Step Functions, AWS Lambda, Amazon Q Developer) สถานการณ์การใช้งานหลักที่มีเอกสารประกอบ:[2][1]
Agentic Workflows - กระบวนการทำงานแบบ agentic
การดำเนินงานหลายขั้นตอนโดยใช้ Bedrock Agents และการเรียกใช้เครื่องมือภายนอก (function calling) โดยใช้รูปแบบสถาปัตยกรรม ReAct (Reasoning and Acting) ร่วมกับ framework อย่าง LangGraph โมเดล Nova ประสานงานการวิเคราะห์ฐานข้อมูล สร้าง SQL query จากภาษาธรรมชาติ และจัดการกระบวนการที่ซับซ้อน Nova Act รองรับการทำงานอัตโนมัติของ browser UI workflow พร้อมความน่าเชื่อถือที่อ้างไว้ที่ 90% สำหรับงานของผู้ใช้ในระยะเริ่มต้น[28][8]
Retrieval-Augmented Generation (RAG) - การสร้างเนื้อหาโดยใช้ข้อมูลภายนอก
การผนวกรวมกับ Bedrock Knowledge Bases สำหรับการ grounding คำตอบบนข้อมูลองค์กร โมเดล Nova 2 รองรับ web grounding แบบ native เป็นเครื่องมือในตัว[1][9]
การประมวลผลเอกสาร
รูปแบบเอกสารอินพุตที่รองรับ: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (ยกเว้น Nova Micro ที่รับเฉพาะข้อความ) Nova Premier สามารถประมวลผลวิดีโอที่มีความยาวสูงสุด 90 นาทีภายใน request เดียว[2][6]
การสร้างและดีบักโค้ด
ภาษาโปรแกรมที่รองรับ: Python, Java, JavaScript, C#, TypeScript, SQL[20]
อินเทอร์เฟซเสียง
Nova Sonic และ Nova 2 Sonic ใช้สร้าง voice agent ที่รองรับ real-time โดยผนวกรวมกับ Amazon Connect[10][7]
การประเมินโมเดล (LLM-as-a-judge)
Nova ถูกใช้เป็นโมเดลตัดสินในการประเมินผลลัพธ์ของโมเดล generative อื่นๆ บนแพลตฟอร์ม Amazon SageMaker[29]
ข้อจำกัดและปัญหาที่ยังเปิดอยู่
- สถาปัตยกรรมแบบปิด Amazon ไม่เปิดเผยจำนวนพารามิเตอร์ รายละเอียดสถาปัตยกรรม และองค์ประกอบของข้อมูลฝึกอบรม ซึ่งจำกัดการทดสอบซ้ำโดยอิสระอย่างมีนัยสำคัญ น้ำหนักของโมเดล Nova ไม่สามารถดาวน์โหลดหรือนำไปใช้นอกโครงสร้างพื้นฐาน AWS ได้ (ไม่รองรับการนำไปใช้แบบ on-premise)[1][2]
- ขีดจำกัดเอาต์พุต จำนวน token เอาต์พุตสูงสุดสำหรับโมเดล understanding ทั้งหมดจำกัดอยู่ที่ 10K token ซึ่งอาจไม่เพียงพอสำหรับงานสร้างเอกสารยาว[2]
- ข้อจำกัดของ RFT Reinforcement Fine-Tuning ไม่รองรับการโต้ตอบแบบ multi-turn และข้อมูล multimodal สัดส่วนของตัวอย่างเชิงบวกในชุดข้อมูลที่แนะนำคือไม่น้อยกว่า 5%[27]
- ข้อจำกัดของ Nova Sonic ระยะเวลาการเชื่อมต่อสูงสุด 8 นาที และสูงสุด 20 การเชื่อมต่อพร้อมกันต่อลูกค้าโดยค่าเริ่มต้น[2]
- ความพร้อมใช้งานตามภูมิภาค Nova Premier พร้อมใช้งานในเพียงหนึ่งภูมิภาค (US East N. Virginia) โดยไม่รองรับ cross-region inference ส่วนโมเดล Nova 2 มีรายการภูมิภาคที่รองรับการใช้งานจำกัด[2]
- ความอ่อนไหวของเมตริก คะแนนบน benchmark สังเคราะห์ไม่เสมอไปสอดคล้องกับคุณภาพในสภาพแวดล้อม production จริง ซึ่งสิ่งที่มีความสำคัญคือการปฏิบัติตามนโยบายองค์กรอย่างเคร่งครัดและการไม่มี hallucination ในการอนุมานหลายขั้นตอน[22][23]
- Hallucination โมเดลแสดงข้อจำกัดทั่วไปของ LLM ได้แก่ อาจเกิดข้อผิดพลาดด้านข้อเท็จจริงในคำตอบที่สร้างขึ้น เพื่อลดความเสี่ยง แนะนำให้ใช้ Bedrock Guardrails และ RAG[1]
- ความเป็นกลางเชิงเปรียบเทียบของ benchmark Amazon นำเสนอการเปรียบเทียบกับโมเดลคู่แข่งโดยอ้างอิงข้อมูลที่ผู้พัฒนาเผยแพร่เอง ซึ่งไม่ได้รับประกันฐานการทดลองที่ควบคุมและเป็นหนึ่งเดียวกันเสมอไป[22]
แง่มุมด้านจริยธรรมและการกำกับดูแล
AWS ประกาศว่าปฏิบัติตามหลักการ Responsible AI ในการพัฒนาโมเดล Nova มาตรการความปลอดภัยที่เป็นรูปธรรม ได้แก่:[20][15]
- การกลั่นกรองเนื้อหา (content moderation) ในตัว
- watermarking สำหรับเอาต์พุตเสียงของ Nova Sonic
- การประเมินตามหมวดความเสี่ยง ได้แก่ ความปลอดภัย (safety) ความเป็นส่วนตัว (privacy) ความน่าเชื่อถือ (veracity) ความโปร่งใส (transparency) รวมถึงการแพร่กระจายอาวุธ CBRN (เคมี ชีวภาพ รังสี และนิวเคลียร์) และปฏิบัติการไซเบอร์เชิงรุก
- การผนวกรวมกับ Amazon Bedrock Guardrails สำหรับการกรองข้อมูลอินพุตและเอาต์พุต
- การประเมินโมเดล Nova Premier ตาม Amazon Frontier Model Safety Framework
- Red teaming — การทดสอบภายในและภายนอกเพื่อตรวจสอบความทนทานต่อการโจมตี (ตามรายงานทางเทคนิค มี 307 เทคนิค)
- การประเมินการกลั่นกรองเนื้อหาตามเมตริก F1: 85.84 บน benchmark Aegis (ตามรายงานทางเทคนิค)[1]
AI Service Cards สำหรับ Nova Micro, Lite, Pro, Premier และ Sonic ได้รับการเผยแพร่บน docs.aws.amazon.com เป็นเอกสารประกอบการใช้งานอย่างมีความรับผิดชอบ[20][15]
แนวโน้มและทิศทางการวิจัย
กลุ่มโมเดล Nova 2 แสดงถึงการเปลี่ยนผ่านสู่โมเดลที่มีความสามารถ extended thinking / reasoning ซึ่งมีแนวคิดคล้ายคลึงกับ Chain-of-Thought (CoT) และกลไกที่คล้ายกันในกลุ่มโมเดลอื่นๆ การค้นหาเว็บในตัวและ code interpreter เป็นเครื่องมือ native (ไม่ใช่ plugin จากบุคคลที่สาม) แสดงถึงการเปลี่ยนแปลงสถาปัตยกรรมในทิศทางของระบบ agentic[9][8]
ทิศทางการพัฒนาในอนาคตที่ระบุในเอกสารสาธารณะของ Amazon:
- การขยาย multimodality (โมเดล Omni ในฐานะสถาปัตยกรรม "ทุกอย่างต่อทุกอย่าง" แบบ unified)
- hybrid reasoning พร้อมความลึกของการปรับตัวตามความซับซ้อนของงาน
- การฝึกอบรมแบบเปิดบนข้อมูลของผู้ใช้ (Nova Forge) ในทุกขั้นตอนของการ pre-training
- distillation สำหรับ edge devices
- การขยายชุดเครื่องมือความปลอดภัย (safety toolkit)[8][11]
หัวข้อของ Amazon Nova AI Challenge ที่ AWS จัดขึ้นสำหรับทีมจากมหาวิทยาลัย ครอบคลุมทิศทางการทดสอบเชิงต่อต้านอัตโนมัติ การปรับแนวความปลอดภัย (safety alignment) และ multi-turn jailbreaks ซึ่งแสดงให้เห็นถึงการลงทุนในความน่าเชื่อถือของกลุ่มโมเดล[8]
ดูเพิ่มเติม
- Transformer (สถาปัตยกรรม)
- Reinforcement Learning from Human Feedback (RLHF)
บรรณานุกรม
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, กุมภาพันธ์ 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
ลิงก์ภายนอก
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — เอกสารอย่างเป็นทางการของ Amazon Nova
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — AI Service Cards สำหรับ Nova Micro, Lite, Pro, Premier
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — AI Service Card สำหรับ Nova Sonic
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — ประกาศเปิดตัว Amazon Nova (ธันวาคม 2024)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — ประกาศเปิดตัว Amazon Nova 2 (ธันวาคม 2025)
หมายเหตุ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/