Nova (Amazon) (BN)
Amazon Nova — ফান্ডামেন্টাল মডেলের (Foundation Models, FM) এবং বৃহৎ ভাষা মডেলের (Large Language Model, LLM) একটি পরিবার, যা Amazon Artificial General Intelligence (AAG Intelligence) বিভাগ দ্বারা তৈরি এবং সম্পূর্ণ পরিচালিত সেবা Amazon Bedrock-এর মাধ্যমে পাওয়া যায়। এই পরিবারে টেক্সট বোঝা ও উৎপাদন, চিত্র, ভিডিও ও নথি প্রক্রিয়াকরণ এবং বাক সংশ্লেষণ ও স্বীকৃতির মডেল অন্তর্ভুক্ত রয়েছে। Amazon Nova-কে পূর্ববর্তী প্রজন্মের Amazon Titan মডেলের প্রতিস্থাপন হিসেবে উপস্থাপন করা হয় এবং এটি Amazon Web Services (AWS)-এর ক্লাউড ইকোসিস্টেমে একীভূত।[1][2][3]
ইতিহাস ও উন্নয়নের কালপঞ্জি
Nova চালু হওয়ার আগে Amazon Bedrock প্ল্যাটফর্ম তৃতীয় পক্ষের মডেলে অ্যাক্সেস প্রদান করত: Anthropic Claude, Meta Llama, Mistral এবং অন্যান্য। Amazon Nova হল AWS-এর নিজস্ব উন্নয়নে প্রথম ফান্ডামেন্টাল মডেল পরিবার, যা ক্লাউড অবকাঠামোতে বাণিজ্যিক ব্যবহারের জন্য নির্দেশিত।[3]
প্রথম প্রজন্ম (২০২৪–২০২৫)
Amazon Nova পরিবারের প্রথম প্রজন্ম আনুষ্ঠানিকভাবে ২০২৪ সালের ৩ ডিসেম্বর AWS re:Invent 2024 সম্মেলনে উপস্থাপিত হয়। প্রাথমিক রিলিজে তিনটি understanding model অন্তর্ভুক্ত ছিল — Nova Micro (শুধু টেক্সট), মাল্টিমোডাল Nova Lite এবং Nova Pro — এবং পাশাপাশি জেনারেটিভ মডেল Nova Canvas (চিত্র উৎপাদন) ও Nova Reel (ভিডিও উৎপাদন)।[4][3][5]
২০২৫ সালের এপ্রিলে পরিবারে ফ্ল্যাগশিপ মডেল Nova Premier যুক্ত হয় — এটি পরিবারের সবচেয়ে শক্তিশালী মডেল, যার কনটেক্সট উইন্ডো ১ মিলিয়ন token এবং এটি জটিল রিজনিং ও distillation (বড় মডেল থেকে ছোট মডেলে জ্ঞান স্থানান্তর) কাজের জন্য। একই সময়, ২০২৫ সালের এপ্রিলে Nova Sonic উপস্থাপিত হয় — এটি speech‑to‑speech শ্রেণির একটি বাক মডেল যা রিয়েল-টাইম কথোপকথন সমর্থন করে।[6][7]
দ্বিতীয় প্রজন্ম — Nova 2 (২০২৫–২০২৬)
২০২৫ সালের নভেম্বর–ডিসেম্বরে AWS re:Invent 2025 সম্মেলনে দ্বিতীয় প্রজন্ম — Amazon Nova 2 ঘোষণা করা হয়। এই পরিবারে dynamic reasoning এবং প্রসারিত কনটেক্সট প্রক্রিয়াকরণ সমর্থনসহ আপডেট করা মডেল Nova 2 Lite ও Nova 2 Pro, নেটিভ মাল্টিমোডাল মডেল Nova 2 Omni (একযোগে টেক্সট, চিত্র, ভিডিও ও অডিও প্রক্রিয়াকরণ ও উৎপাদন) এবং পরবর্তী প্রজন্মের বাক মডেল Nova 2 Sonic অন্তর্ভুক্ত রয়েছে। একইসাথে Nova Forge (কাস্টম মডেল প্রশিক্ষণের পরিবেশ) ও Nova Act (এজেন্টিক workflow-এর framework) সেবা উপস্থাপিত হয়।[8][9][10]
২০২৬ সালের ফেব্রুয়ারিতে Amazon Nova 2-এর আনুষ্ঠানিক প্রযুক্তিগত প্রতিবেদন প্রকাশিত হয়।[11]
সংক্ষিপ্ত কালপঞ্জি
| তারিখ | ঘটনা |
|---|---|
| ডিসেম্বর ২০২৪ | AWS re:Invent 2024-এ Amazon Nova ঘোষণা: Nova Micro, Lite, Pro, Canvas, Reel |
| এপ্রিল ২০২৫ | Nova Premier (১M token কনটেক্সট) ও Nova Sonic (speech‑to‑speech) প্রকাশ |
| জুন ২০২৫ | প্রথম প্রজন্মের প্রযুক্তিগত প্রতিবেদন প্রকাশ (arXiv:2506.12103) |
| নভেম্বর–ডিসেম্বর ২০২৫ | AWS re:Invent 2025-এ Nova 2 ঘোষণা: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act |
| ফেব্রুয়ারি ২০২৬ | Amazon Nova 2-এর প্রযুক্তিগত প্রতিবেদন প্রকাশ |
তাত্ত্বিক ভিত্তি ও আর্কিটেকচার
Understanding মডেলের মূল আর্কিটেকচার
arXiv:2506.12103 প্রযুক্তিগত প্রতিবেদন অনুযায়ী, understanding মডেলগুলো (Nova Micro, Lite, Pro, Premier) Vaswani et al.-এর কাজে বর্ণিত Transformer আর্কিটেকচারের উপর ভিত্তি করে নির্মিত।[12] Multi‑Head Self‑Attention-এর মূল প্রক্রিয়া নিম্নোক্ত সূত্র দ্বারা বর্ণনা করা হয়:
যেখানে , , যথাক্রমে queries, keys এবং values ম্যাট্রিক্স এবং হল keys-এর মাত্রা।[12][1]
আর্কিটেকচারের সুনির্দিষ্ট প্যারামিটার (স্তরের সংখ্যা, লুকানো অবস্থার আকার, attention head-এর সংখ্যা, মোট প্যারামিটার সংখ্যা) ২০২৬ সালের মার্চ পর্যন্ত সর্বজনীনভাবে উপলব্ধ উৎসে প্রকাশ করা হয়নি। এই পদ্ধতি বন্ধ বাণিজ্যিক মডেলের জন্য সাধারণ।[1]
Nova Lite ও Nova Pro-তে মাল্টিমোডাল প্রক্রিয়াকরণ টেক্সট, ভিজ্যুয়াল ও ভিডিও token-গুলোকে একটি একক ক্রমে একত্রিত করে একক ভাষা মডেলে ইনপুট হিসেবে প্রদান করে সম্পন্ন হয়। Vision encoder-গুলো চিত্র ও ভিডিও ফ্রেমকে টেক্সট উপস্থাপনার সাথে সামঞ্জস্যপূর্ণ token ক্রমে রূপান্তরিত করে।[1][13]
জেনারেটিভ মডেলের আর্কিটেকচার
জেনারেটিভ মডেল Nova Canvas (চিত্র) ও Nova Reel (ভিডিও) Latent Diffusion Models (LDM)[14] আর্কিটেকচার ব্যবহার করে, যা Variational AutoEncoder (VAE)-এর সাথে মিলিত হয়ে latent space-এ গণনা পরিচালনা করে। ডিফিউশন প্রক্রিয়া ফরওয়ার্ড নয়েজ সমীকরণ দ্বারা বর্ণনা করা হয়:
যেখানে হল latent space-এ মূল চিত্র, হল ধাপ -এ এর নয়েজযুক্ত সংস্করণ, হল নয়েজ শিডিউলের ক্রমবর্ধমান প্যারামিটার, হল স্ট্যান্ডার্ড গাউসীয় নয়েজ। টেক্সট encoder টেক্সট prompt-এর উপর conditioning — উৎপাদনকে শর্তযুক্ত করা — নিশ্চিত করে।[13][14]
বাক মডেলের আর্কিটেকচার
Nova Sonic টেক্সট মডেলের থেকে ভিন্ন আর্কিটেকচার ব্যবহার করে: এটি একটি বিশেষায়িত speech encoder, speech renderer এবং মূল মাল্টিমোডাল ভাষা মডেলকে একটি একক end‑to‑end pipeline-এ একত্রিত করে। এটি মধ্যবর্তী টেক্সটে রূপান্তর ছাড়াই বাক ইনপুট প্রক্রিয়াকরণ ও বাক আউটপুট উৎপাদন সম্ভব করে (যদিও মান নিশ্চিতির জন্য অভ্যন্তরীণভাবে টেক্সট উপস্থাপনা ব্যবহৃত হয়)।[15][1]
প্রশিক্ষণ অবকাঠামো
Nova মডেলের প্রশিক্ষণ AWS Elastic Kubernetes Service (EKS)-এর বিতরণকৃত ক্লাস্টারে Amazon-এর নিজস্ব AI accelerator Amazon Trainium (TRN1 ইন্সট্যান্স) এবং NVIDIA A100 ও H100 গ্রাফিক্স প্রসেসর ব্যবহার করে পরিচালিত হয়েছিল।[13][1]
প্রশিক্ষণে গণনামূলক ব্যয় কমাতে বিশেষায়িত অপ্টিমাইজেশন পদ্ধতি তৈরি ও প্রয়োগ করা হয়েছে:
- Super‑Selective Activation Checkpointing (SSC) — activation সংরক্ষণের একটি পদ্ধতি যা প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী, recomputation-এর ন্যূনতম ওভারহেডে গ্রাফিক্স প্রসেসরের মেমরি ব্যবহার প্রায় ৫০% হ্রাস করে।[13]
- In‑CPU‑Memory Checkpointing — Amazon S3 ক্লাউড স্টোরেজে অ্যাসিঙ্ক্রোনাস আপলোডের আগে কেন্দ্রীয় প্রসেসরের (CPU) র্যামে মধ্যবর্তী weights (checkpoints) ক্যাশ করা। Amazon-এর তথ্য অনুযায়ী, এই পদ্ধতি TRN1 ইন্সট্যান্সে মডেলের অবস্থা সংরক্ষণের সময় ০.১ সেকেন্ডে হ্রাস করা সম্ভব করেছে।[16][13]
প্রশিক্ষণ পাইপলাইন ও সারিবদ্ধকরণ
Nova মডেলের প্রশিক্ষণ প্রক্রিয়া আধুনিক LLM-এর জন্য সাধারণ বেশ কয়েকটি ধাপ নিয়ে গঠিত:[1][17]
Pre‑training (পূর্ব-প্রশিক্ষণ)
২০০টিরও বেশি ভাষা অন্তর্ভুক্ত একটি বৃহৎ বহুভাষিক ও মাল্টিমোডাল ডেটা কর্পাসে বৃহৎ মাপের প্রশিক্ষণ। প্রশিক্ষণ ডেটার সুনির্দিষ্ট গঠন (পরিমাণ, ভাষার অনুপাত, নির্দিষ্ট উৎস) সর্বজনীন উপকরণে প্রদান করা হয়নি।[1]
Supervised Fine‑Tuning (SFT) - তত্ত্বাবধায়িত সূক্ষ্ম-সমন্বয়
লেবেলযুক্ত «নির্দেশনা — উত্তর» জোড়ার উপর সূক্ষ্ম-সমন্বয়, যা মডেলকে ব্যবহারকারীর নির্দেশনা অনুসরণে প্রবৃত্ত করে।[1]
Reinforcement Learning দিয়ে সারিবদ্ধকরণ
মানুষের পছন্দের সাথে মডেলের আচরণ সারিবদ্ধ করতে দুটি মূল অ্যালগরিদম ব্যবহার করা হয়:
Proximal Policy Optimization (PPO) — Reinforcement Learning from Human Feedback (RLHF)-এর উপর ভিত্তি করে একটি পৃথক Reward Model ব্যবহারকারী Reinforcement Learning অ্যালগরিদম।[18][1]
Direct Preference Optimization (DPO) — সারিবদ্ধকরণের একটি বিকল্প পদ্ধতি যার জন্য স্পষ্ট Reward Model প্রয়োজন নেই। DPO-এর লক্ষ্য ফাংশন নিম্নরূপ:[19]
যেখানে:
- — প্যারামিটারাইজড কৌশল (প্রশিক্ষণযোগ্য মডেল);
- — মূল (স্থির) রেফারেন্স মডেল;
- — ইনপুট prompt (প্রসঙ্গ);
- এবং — যথাক্রমে পছন্দনীয় (winner) ও প্রত্যাখ্যাত (loser) উত্তর;
- — লজিস্টিক (সিগমোয়েড) ফাংশন;
- — মূল মডেল থেকে বিচ্যুতির দণ্ডের শক্তি নিয়ন্ত্রণকারী হাইপারপ্যারামিটার (KL‑divergence penalty-এর সমতুল্য)।[19][1]
মডেল পরিবারের গঠন
মডেল পরিবারটি কার্যক্ষমতা, ব্যয় ও latency-এর মধ্যে ভারসাম্যের উপর নির্ভর করে tier-এ বিভক্ত।[2][20]
প্রথম প্রজন্মের understanding মডেল
| প্যারামিটার | Nova Micro | Nova Lite | Nova Pro | Nova Premier |
|---|---|---|---|---|
| ইনপুট মোডালিটি | টেক্সট | টেক্সট, চিত্র, ভিডিও | টেক্সট, চিত্র, ভিডিও | টেক্সট, চিত্র, ভিডিও |
| আউটপুট মোডালিটি | টেক্সট | টেক্সট | টেক্সট | টেক্সট |
| কনটেক্সট উইন্ডো | ১২৮ হাজার token | ৩০০ হাজার token | ৩০০ হাজার token | ১ মিলিয়ন token |
| সর্বোচ্চ আউটপুট token | ১০ হাজার | ১০ হাজার | ১০ হাজার | ১০ হাজার |
| ভাষা সমর্থন | ২০০+ | ২০০+ | ২০০+ | ২০০+ |
| Fine‑tuning | হ্যাঁ | হ্যাঁ | হ্যাঁ | না |
| রিলিজের তারিখ | ডিসেম্বর ২০২৪ | ডিসেম্বর ২০২৪ | ডিসেম্বর ২০২৪ | এপ্রিল ২০২৫ |
| মূল উদ্দেশ্য | টেক্সট কাজের জন্য ন্যূনতম বিলম্ব ও ব্যয় | মূলভিত্তিক মাল্টিমোডাল বিশ্লেষণ | জটিল যুক্তি ও এজেন্টিক কাজের জন্য সর্বোত্তম ভারসাম্য | সর্বোচ্চ নির্ভুলতা, distillation-এর জন্য teacher মডেল |
উৎস: AWS AI Service Cards; arXiv:2506.12103।[20][1]
অপ্টিমাইজড ভাষা (১৫টি): ইংরেজি, জার্মান, স্পেনিশ, ফরাসি, ইতালিয়ান, জাপানি, কোরিয়ান, আরবি, চীনা (সরলীকৃত), রুশ, হিন্দি, পর্তুগিজ, ডাচ, তুর্কি, হিব্রু।[2]
Nova Premier গভীর প্রসঙ্গ বোঝার, বহু-ধাপ পরিকল্পনা এবং বড় পরিমাণ ডেটা প্রক্রিয়াকরণের প্রয়োজনীয় কাজের জন্য ডিজাইন করা হয়েছে: কোডবেস, ৪০০ পৃষ্ঠারও বেশি নথি, ৯০ মিনিট পর্যন্ত দীর্ঘ ভিডিও।[6]
দ্বিতীয় প্রজন্মের মডেল (Nova 2)
Nova 2 Lite ও Nova 2 Pro ২০২৫ সালের নভেম্বর–ডিসেম্বরে প্রকাশিত হয়। উভয়ই extended thinking সমর্থন করে — এমন একটি প্রক্রিয়া যেখানে মডেল উত্তর উৎপাদনের আগে বহু-ধাপ রিজনিং সম্পাদন করে। রিজনিংয়ের গভীরতা reasoning_effort প্যারামিটার দ্বারা low, medium ও high স্তরে নিয়ন্ত্রিত হয়। কনটেক্সট উইন্ডো ১ মিলিয়ন token পর্যন্ত বিস্তৃত। নেটিভ টুলস অন্তর্নির্মিত: নিশ্চিতকরণসহ ওয়েব অনুসন্ধান (web grounding) ও কোড ইন্টারপ্রিটার।[9][8]
Nova 2 Omni — একটি নেটিভ মাল্টিমোডাল মডেল যা একযোগে ইনপুট হিসেবে টেক্সট, চিত্র, ভিডিও ও অডিও গ্রহণ করতে এবং টেক্সট ও চিত্র উৎপাদন করতে সক্ষম। কনটেক্সট উইন্ডো — ১ মিলিয়ন token।[8][11]
Nova 2 Sonic — পরবর্তী প্রজন্মের বাক মডেল। ৬টি ভাষা সমর্থন করে: ইংরেজি (আমেরিকান ও ব্রিটিশ সংস্করণ), স্পেনিশ, জার্মান, ফরাসি, ইতালিয়ান। asynchronous tool calling প্রবর্তন করে — বাহ্যিক টুলগুলো পটভূমিতে চলার সময় মডেল নতুন ইনপুট প্রক্রিয়াকরণ চালিয়ে যায়।[10]
| প্যারামিটার | Nova 2 Lite | Nova 2 Pro | Nova 2 Omni | Nova 2 Sonic |
|---|---|---|---|---|
| ইনপুট মোডালিটি | টেক্সট, চিত্র, ভিডিও | টেক্সট, চিত্র, ভিডিও | টেক্সট, চিত্র, ভিডিও, অডিও | অডিও (বাক) |
| আউটপুট মোডালিটি | টেক্সট | টেক্সট | টেক্সট, চিত্র | অডিও (বাক) |
| কনটেক্সট উইন্ডো | ১ মিলিয়ন token | ১ মিলিয়ন token | ১ মিলিয়ন token | ৩০০ হাজার token |
| Extended thinking | হ্যাঁ | হ্যাঁ | হ্যাঁ | — |
| নেটিভ টুলস | Web grounding, Code interpreter | Web grounding, Code interpreter | — | Asynchronous tool calling |
| রিলিজের তারিখ | নভেম্বর–ডিসেম্বর ২০২৫ | নভেম্বর–ডিসেম্বর ২০২৫ | ডিসেম্বর ২০২৫ | ডিসেম্বর ২০২৫ |
উৎস: AWS Blog; Amazon Science।[9][8][11]
জেনারেটিভ মডেল
Nova Canvas — চিত্র উৎপাদনের মডেল। টেক্সট ও গ্রাফিক ইনপুট সমর্থন করে (PNG, JPEG)। আউটপুট রেজোলিউশন — ৪.১৯ মিলিয়ন পিক্সেল পর্যন্ত (যেমন ২০৪৮×২০৪৮ বা ২৮১৬×১৫৩৬ পিক্সেল)। prompt-এর সর্বোচ্চ দৈর্ঘ্য — ১০২৪ অক্ষর। inpainting (চিত্রের একটি অঞ্চল প্রতিস্থাপন) ও outpainting (চিত্রকে তার সীমানার বাইরে সম্প্রসারণ) অপারেশন সমর্থিত।[2][4]
Nova Reel — ভিডিও উৎপাদনের মডেল। আউটপুট রেজোলিউশন: প্রতি সেকেন্ডে ২৪ ফ্রেমে ১২৮০×৭২০। উৎপাদিত ভিডিওর দৈর্ঘ্য — ৬ সেকেন্ড পর্যন্ত। ক্যামেরা মুভমেন্ট নিয়ন্ত্রণ (camera control) সমর্থিত। অ্যাক্সেস অ্যাসিঙ্ক্রোনাস API (Asynchronous Invoke Model API)-এর মাধ্যমে করা হয়।[2][4]
বাক মডেল
Nova Sonic (এপ্রিল ২০২৫) — দ্বিমুখী স্ট্রিমিং API (bidirectional stream API)-সহ একটি বাক মডেল। function calling এবং Retrieval‑Augmented Generation (RAG, বাহ্যিক জ্ঞান আহরণসহ উৎপাদন)-এর মাধ্যমে কর্পোরেট ডেটায় grounding সমর্থন করে। watermarking ফিচার ডিফল্টরূপে অন্তর্নির্মিত। সংযোগের সর্বোচ্চ সময়কাল — পুনরারম্ভের সম্ভাবনাসহ ৮ মিনিট; প্রতি ক্লায়েন্টে ডিফল্ট মান হিসেবে সর্বোচ্চ ২০টি একযোগে সংযোগ।[7][15][2]
Nova 2 Sonic (ডিসেম্বর ২০২৫) — উন্নত সংক্ষিপ্ত উচ্চারণ, টেলিফোন অডিও (৮ kHz) ও উচ্চারণভঙ্গি স্বীকৃতিসহ পরবর্তী প্রজন্মের বাক মডেল।[10]
মূল্যায়ন ও benchmark
Nova মডেলের মূল্যায়ন স্বয়ংক্রিয় benchmark ব্যবহার করে পরিচালিত হয়েছিল, যার মধ্যে «LLM‑as‑a‑judge» পদ্ধতি (মূল্যায়নকারী হিসেবে ভাষা মডেলের ব্যবহার) অন্তর্ভুক্ত। HKU SPACE AI Hub গবেষণার তথ্য অনুযায়ী, Arena‑Hard‑Auto মেট্রিক বিশেষজ্ঞ মূল্যায়নের সাথে ৯৮.৬% সম্পর্ক প্রদর্শন করে।[21][22]
প্রথম প্রজন্মের benchmark
arXiv:2506.12103 প্রযুক্তিগত প্রতিবেদন থেকে তথ্য (শর্ত: প্রতিবেদন প্রস্তুতির সময় প্রকাশিত প্রতিযোগী মডেলের ডেভেলপারদের ফলাফল):[1]
| Benchmark | Nova Pro | Nova Lite | Nova Micro | Claude 3.5 Sonnet (Oct 2024) | GPT‑4o (Nov 2024) |
|---|---|---|---|---|---|
| MMLU (5‑shot) | — | 80,5 | 77,6 | — | — |
| MATH (4‑shot) | — | 73,3 | 69,3 | — | — |
| IFEval | — | 87,5 | 87,2 | — | — |
| MT‑Bench (text) | 79,7 | 77,7 | — | 76,7 | 77,5 |
| MT‑Bench (multimodal) | 63,7 | 60,7 | — | 61,6 | 55,0 |
উৎস: arXiv:2506.12103, সারণি 2.1.1।[1]
ফলাফলগুলো পরিবারের মধ্যে কার্যক্ষমতার শ্রেণিবিন্যাস প্রদর্শন করে (Premier > Pro > Lite > Micro)। পার্থক্য গণিত (Math) ও রিজনিং (Reasoning) বিভাগে সবচেয়ে লক্ষণীয়; ভূমিকা-পালন (Roleplay) ও তথ্য-নিষ্কাশন (Extraction) কাজে ছোট মডেলগুলো বড় মডেলের কাছাকাছি ফলাফল দেখায়।[22]
দ্বিতীয় প্রজন্মের benchmark (Nova 2)
Amazon Nova 2 প্রযুক্তিগত প্রতিবেদন থেকে তথ্য (শর্ত: internal measurements, ০‑shot / CoT যেখানে প্রযোজ্য):[11]
| Benchmark | Nova 2 Lite | Nova 2 Pro | Claude Haiku 4.5 | GPT‑5 Mini | Gemini 2.5 Flash |
|---|---|---|---|---|---|
| MMLU‑Pro (acc) | 80,9 | 81,6 | 80,0 | 83,7 | 83,2 |
| GPQA‑Diamond (acc) | 79,6 | 81,4 | 73,0 | 82,3 | 82,8 |
| AIME 2025 (acc) | 91,0 | 92,3 | 80,7 | 91,1 | 72,0 |
| LongCodeBench 1M (acc) | 84,0 | 84,0 | — | — | 78,0 |
উৎস: Amazon Nova 2 Technical Report, সারণি ১।[11]
এজেন্টিক benchmark (Nova 2 Pro): SWE‑Bench Verified — ৭০.০%; τ²‑bench Verified Telecom — ৯২.৭%।[11]
মাল্টিমোডাল benchmark (Nova 2 Omni): VideoMME — ৭৭.৯%; MMMU Pro — ৬১.৪%।[11]
টেকনিক্যাল সাপোর্ট কাজে মূল্যায়নে Nova 2 Lite «সমস্যা চিহ্নিতকরণ» (Problem Identification) মেট্রিকে দশ-পয়েন্ট স্কেলে ৯.৬৩ ± ০.২৭ অর্জন করেছে, যা প্রথম প্রজন্মের Nova Lite (৮.৫৭ ± ০.৪৬)-কে উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে।[23]
নোট। প্রতিযোগী মডেলের সাথে ফলাফল তুলনা করার সময় মনে রাখতে হবে যে prompt-এর শর্ত, মডেলের সংস্করণ ও মেট্রিক পরিমাপের তারিখ ভিন্ন হতে পারে। প্রথম ও দ্বিতীয় প্রজন্মের benchmark Amazon-এর স্ব-প্রতিবেদন থেকে প্রাপ্ত; স্বাধীন যাচাইকরণ (FloTorch, Artificial Analysis) সাধারণত ঘোষিত মূল্য-কার্যক্ষমতার অনুপাত নিশ্চিত করে, তবে কিছু নির্ভুলতার মেট্রিকে শীর্ষস্থানীয় প্রতিযোগীদের তুলনায় পিছিয়ে থাকার বিষয়টি লিপিবদ্ধ করে।[22]
আউটপুটের গতি
Amazon-এর অভ্যন্তরীণ পরিমাপ অনুযায়ী (internal, Bedrock API-এর মাধ্যমে):[1][11]
| মডেল | আউটপুটের গতি (token/সেকেন্ড) |
|---|---|
| Nova Micro | ≈210 |
| Nova Lite | ≈157 |
| Nova Pro | ≈100 |
| Nova 2 Omni | >200 |
ব্যবহারের ব্যয়
সমস্ত মডেল Amazon Bedrock-এর মাধ্যমে প্রক্রিয়াকৃত token-এর সংখ্যার উপর ভিত্তি করে অর্থপ্রদান মডেলে পাওয়া যায় (২০২৬ সালের মার্চের তথ্য):[2]
| মডেল | ইনপুট token (USD / ১M) | আউটপুট token (USD / ১M) |
|---|---|---|
| Nova Micro | $0,035 | $0,14 |
| Nova Lite | ≈$0,06 | ≈$0,24 |
| Nova Pro | $0,80 | $3,20 |
| Nova Premier | $2,50 | $12,50 |
তুলনার জন্য: Nova রিলিজের সময় Anthropic Claude 3.5 Sonnet ১M ইনপুট token-এ $৬.০০ এবং ১M আউটপুট token-এ $৩০.০০ হারে মূল্য নির্ধারণ করা হয়েছিল।[22]
কাস্টমাইজেশন ও fine‑tuning
AWS অবকাঠামো সংকীর্ণ বিশেষায়িত ডোমেনের জন্য Nova-এর মূল মডেল অভিযোজনের বেশ কয়েকটি পদ্ধতি প্রদান করে। দ্বিতীয় প্রজন্মে এর প্রধান হাতিয়ার হল Amazon Nova Forge পরিবেশ।[8][17]
Continued Pre‑Training (CPT) ও Mid‑Training
Nova Forge মডেলের মধ্যবর্তী প্রশিক্ষণ checkpoint-গুলোতে (যেমন pretraining‑text‑RD ও pretraining‑text‑CE) অ্যাক্সেস দেয়। এটি বিপর্যয়মূলক বিস্মৃতি (catastrophic forgetting) রোধে সাবধানতার সাথে learning rate নির্বাচন করে কর্পোরেট ডেটার বৃহৎ সংগ্রহে self‑supervised learning চালিয়ে যাওয়ার সুযোগ দেয়।[24][25]
Parameter‑Efficient Fine‑Tuning (PEFT)
Low‑Rank Adaptation (LoRA)[26]-এর মাধ্যমে কম-র্যাংক অ্যাডাপ্টার দিয়ে মডেলের weights-এর কেবল একটি ক্ষুদ্র উপসেট আপডেট করা। এই পদ্ধতি পূর্ণ fine‑tuning-এর তুলনায় গণনামূলক সম্পদের চাহিদা উল্লেখযোগ্যভাবে কমায়। Nova Lite ও Pro-এর জন্য মাল্টিমোডাল fine‑tuning সমর্থিত।[17]
Reinforcement Fine‑Tuning (RFT)
কাস্টম মডেলগুলো LLM‑as‑a‑judge হিসেবে অন্য একটি LLM ব্যবহারসহ শিল্প-নির্দিষ্ট reward মেট্রিকের উপর ভিত্তি করে Reinforcement Learning পদ্ধতি দিয়ে অতিরিক্ত fine‑tuning করা যেতে পারে।[27]
মডেল Distillation
Model Distillation ফিচার Nova Premier বা Nova Pro-কে ছোট student model — Nova Lite ও Nova Micro — প্রশিক্ষণের জন্য teacher model হিসেবে ব্যবহার করার সুযোগ দেয়। এটি বড় মডেলের মানের উল্লেখযোগ্য অংশ বজায় রেখে inference-এ গণনামূলক ব্যয় কমায়।[2][6]
প্রয়োগ ও একীকরণ
Nova মডেলগুলো Amazon-এর কম্পিউটিং সেবায় (AWS Step Functions, AWS Lambda, Amazon Q Developer) একীভূত। প্রলেখিত মূল ব্যবহারের পরিস্থিতি:[2][1]
Agentic Workflows (এজেন্টিক কর্মপ্রবাহ)
Bedrock Agents ও function calling ব্যবহার করে বহু-ধাপ কাজ সম্পাদন। LangGraph-এর মতো framework-এর সাথে ReAct (Reasoning and Acting) আর্কিটেকচারাল প্যাটার্ন ব্যবহার করে Nova মডেলগুলো ডেটাবেজ বিশ্লেষণ সমন্বয় করে, প্রাকৃতিক ভাষা থেকে SQL কোয়েরি তৈরি করে এবং বহু-উপাদান প্রক্রিয়া পরিচালনা করে। Nova Act প্রাথমিক ব্যবহারকারী কাজে ৯০% বলে দাবিকৃত নির্ভরযোগ্যতাসহ ব্রাউজার UI‑workflow স্বয়ংক্রিয়করণ নিশ্চিত করে।[28][8]
RAG (বাহ্যিক জ্ঞান আহরণসহ উৎপাদন)
কর্পোরেট ডেটায় উত্তরের grounding-এর জন্য Bedrock Knowledge Bases-এর সাথে একীকরণ। Nova 2 মডেলগুলো অন্তর্নির্মিত টুল হিসেবে নেটিভ web grounding সমর্থন করে।[1][9]
নথি প্রক্রিয়াকরণ
সমর্থিত ইনপুট নথির ফরম্যাট: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (Nova Micro ব্যতীত, যা কেবল টেক্সট ইনপুট গ্রহণ করে)। Nova Premier একক অনুরোধের মধ্যে ৯০ মিনিট পর্যন্ত দীর্ঘ ভিডিও প্রক্রিয়াকরণ করতে সক্ষম।[2][6]
কোড উৎপাদন ও ডিবাগিং
সমর্থিত প্রোগ্রামিং ভাষা: Python, Java, JavaScript, C#, TypeScript, SQL।[20]
বাক ইন্টারফেস
Nova Sonic ও Nova 2 Sonic Amazon Connect-এর সাথে একীভূত রিয়েল-টাইম সমর্থনসহ ভয়েস এজেন্ট নির্মাণে ব্যবহৃত হয়।[10][7]
মডেল মূল্যায়ন (LLM‑as‑a‑judge)
Amazon SageMaker প্ল্যাটফর্মে অন্যান্য জেনারেটিভ মডেলের আউটপুট মূল্যায়নে Nova judge মডেল হিসেবে ব্যবহৃত হয়।[29]
সীমাবদ্ধতা ও উন্মুক্ত সমস্যা
- আর্কিটেকচারের বদ্ধতা। Amazon parameter-এর সংখ্যা, বিস্তারিত আর্কিটেকচারাল সিদ্ধান্ত ও প্রশিক্ষণ ডেটার গঠন প্রকাশ করে না, যা ফলাফলের স্বাধীন পুনরাবৃত্তিযোগ্যতাকে উল্লেখযোগ্যভাবে সীমিত করে। Nova মডেলের weights ডাউনলোড বা AWS অবকাঠামোর বাইরে স্থাপনার (on‑premise স্থাপনা অসম্ভব) জন্য সরবরাহ করা হয় না।[1][2]
- আউটপুট সীমা। সমস্ত understanding মডেলের জন্য সর্বোচ্চ আউটপুট token সংখ্যা ১০ হাজার token-এ সীমাবদ্ধ, যা দীর্ঘ নথি উৎপাদনের কাজের জন্য অপর্যাপ্ত হতে পারে।[2]
- RFT-এর সীমাবদ্ধতা। Reinforcement Fine‑Tuning বহু-পর্যায়ের (multi‑turn) কথোপকথন ও মাল্টিমোডাল ডেটা সমর্থন করে না; ডেটাসেটে ইতিবাচক উদাহরণের প্রস্তাবিত অনুপাত — কমপক্ষে ৫%।[27]
- Nova Sonic-এর সীমাবদ্ধতা। সংযোগের সর্বোচ্চ সময়কাল — ৮ মিনিট; ডিফল্টরূপে প্রতি ক্লায়েন্টে সর্বোচ্চ ২০টি একযোগে সংযোগ।[2]
- আঞ্চলিক প্রাপ্যতা। Nova Premier কেবল একটি অঞ্চলে পাওয়া যায় (US East N. Virginia) ক্রস-রিজিওনাল inference সমর্থন ছাড়াই; Nova 2 মডেলের স্থাপনা অঞ্চলের সীমিত তালিকা রয়েছে।[2]
- মেট্রিকের সংবেদনশীলতা। সিন্থেটিক benchmark-এ মূল্যায়ন সবসময় উৎপাদন (production) পরিবেশে কার্যক্ষমতার গুণমানের সাথে সম্পর্কিত নয়, যেখানে কর্পোরেট নীতির কঠোর মেনে চলা ও বহু-ধাপ আউটপুটে hallucination অনুপস্থিতি গুরুত্বপূর্ণ।[22][23]
- Hallucination। মডেলগুলো LLM-এর জন্য সাধারণ সীমাবদ্ধতা প্রদর্শন করে: উৎপাদিত উত্তরে তথ্যগত ত্রুটি সম্ভব। ঝুঁকি কমাতে Bedrock Guardrails ও RAG ব্যবহার সুপারিশ করা হয়।[1]
- benchmark-এর তুলনামূলক নিরপেক্ষতা। Amazon ডেভেলপারদের নিজেদের প্রকাশিত তথ্যের ভিত্তিতে প্রতিযোগী মডেলের সাথে তুলনা প্রদান করে, যা সবসময় একীভূত নিয়ন্ত্রিত পরীক্ষামূলক ভিত্তি নিশ্চিত করে না।[22]
নৈতিক ও নিয়ন্ত্রক দিক
AWS Nova মডেল উন্নয়নে দায়িত্বশীল AI (Responsible AI) নীতি অনুসরণের ঘোষণা দেয়। নির্দিষ্ট নিরাপত্তা ব্যবস্থার মধ্যে রয়েছে:[20][15]
- অন্তর্নির্মিত content moderation।
- Nova Sonic-এর অডিও আউটপুটের জন্য watermarking।
- ঝুঁকি বিভাগ অনুযায়ী মূল্যায়ন: নিরাপত্তা (safety), গোপনীয়তা (privacy), নির্ভরযোগ্যতা (veracity), স্বচ্ছতা (transparency), এবং রাসায়নিক, জৈবিক, রেডিওলজিক্যাল ও পারমাণবিক (CBRN) অস্ত্রের বিস্তার ও আক্রমণাত্মক সাইবার অপারেশন।
- ইনপুট ও আউটপুট ডেটা ফিল্টারিংয়ের জন্য Amazon Bedrock Guardrails-এর সাথে একীকরণ।
- Amazon Frontier Model Safety Framework-এর সাথে সামঞ্জস্যের জন্য Nova Premier মডেলের মূল্যায়ন।
- Red teaming — আক্রমণ প্রতিরোধের জন্য অভ্যন্তরীণ ও বাহ্যিক পরীক্ষা (প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী, ৩০৭টি কৌশল)।
- Aegis benchmark-এ content moderation-এর F1 মেট্রিকে মূল্যায়ন: ৮৫.৮৪ (প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী)।[1]
Nova Micro, Lite, Pro, Premier ও Sonic-এর AI Service Cards docs.aws.amazon.com-এ দায়িত্বশীল প্রয়োগের ডকুমেন্টেশন হিসেবে প্রকাশিত হয়েছে।[20][15]
সম্ভাবনা ও গবেষণার দিকনির্দেশনা
Nova 2 পরিবার extended thinking / reasoning-সহ মডেলের দিকে রূপান্তর নির্দেশ করে, যা অন্যান্য মডেল পরিবারে Chain‑of‑Thought (CoT) ও অনুরূপ প্রক্রিয়ার ধারণার সাথে তুলনীয়। অন্তর্নির্মিত ওয়েব অনুসন্ধান ও কোড ইন্টারপ্রিটার নেটিভ টুল হিসেবে (তৃতীয় পক্ষের প্লাগইন নয়) এজেন্টিক সিস্টেমের দিকে আর্কিটেকচারাল পরিবর্তন উপস্থাপন করে।[9][8]
Amazon-এর সর্বজনীন উপকরণে উল্লিখিত আরও উন্নয়নের দিকনির্দেশনা:
- মাল্টিমোডালিটির সম্প্রসারণ (Omni মডেল একীভূত «সর্বকিছু-থেকে-সর্বকিছু» আর্কিটেকচার হিসেবে)।
- কাজের জটিলতার উপর নির্ভর করে অভিযোজিত গভীরতাসহ hybrid reasoning।
- সমস্ত pre‑training পর্যায়ে ব্যবহারকারীর ডেটায় উন্মুক্ত প্রশিক্ষণ (Nova Forge)।
- Edge ডিভাইসের জন্য distillation।
- safety toolkit সম্প্রসারণ।[8][11]
AWS-এর উদ্যোগে বিশ্ববিদ্যালয় দলের মধ্যে আয়োজিত Amazon Nova AI Challenge-এর বিষয়বস্তুতে স্বয়ংক্রিয় প্রতিপক্ষ পরীক্ষা, safety alignment ও multi‑turn jailbreaks-এর দিকনির্দেশনা অন্তর্ভুক্ত, যা মডেল পরিবারের নির্ভরযোগ্যতায় বিনিয়োগ নির্দেশ করে।[8]
আরও দেখুন
- Transformer (আর্কিটেকচার)
- Reinforcement Learning from Human Feedback (RLHF)
সাহিত্য
- Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, ফেব্রুয়ারি ২০২৬। https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
সূত্র
- https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html — Amazon Nova-র আনুষ্ঠানিক ডকুমেন্টেশন
- https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html — Nova Micro, Lite, Pro, Premier-এর AI Service Cards
- https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html — Nova Sonic-এর AI Service Card
- https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/ — Amazon Nova ঘোষণা (ডিসেম্বর ২০২৪)
- https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models — Amazon Nova 2 ঘোষণা (ডিসেম্বর ২০২৫)
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
- ↑ 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
- ↑ 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
- ↑ Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
- ↑ 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
- ↑ 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
- ↑ 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
- ↑ 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
- ↑ 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
- ↑ 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
- ↑ 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
- ↑ 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
- ↑ LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
- ↑ 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
- ↑ Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
- ↑ 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
- ↑ 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
- ↑ HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
- ↑ 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
- ↑ AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
- ↑ Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
- ↑ 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
- ↑ AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
- ↑ AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/