Nova (Amazon) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Amazon Nova — ফান্ডামেন্টাল মডেলের (Foundation Models, FM) এবং বৃহৎ ভাষা মডেলের (Large Language Model, LLM) একটি পরিবার, যা Amazon Artificial General Intelligence (AAG Intelligence) বিভাগ দ্বারা তৈরি এবং সম্পূর্ণ পরিচালিত সেবা Amazon Bedrock-এর মাধ্যমে পাওয়া যায়। এই পরিবারে টেক্সট বোঝা ও উৎপাদন, চিত্র, ভিডিও ও নথি প্রক্রিয়াকরণ এবং বাক সংশ্লেষণ ও স্বীকৃতির মডেল অন্তর্ভুক্ত রয়েছে। Amazon Nova-কে পূর্ববর্তী প্রজন্মের Amazon Titan মডেলের প্রতিস্থাপন হিসেবে উপস্থাপন করা হয় এবং এটি Amazon Web Services (AWS)-এর ক্লাউড ইকোসিস্টেমে একীভূত।[1][2][3]

ইতিহাস ও উন্নয়নের কালপঞ্জি

Nova চালু হওয়ার আগে Amazon Bedrock প্ল্যাটফর্ম তৃতীয় পক্ষের মডেলে অ্যাক্সেস প্রদান করত: Anthropic Claude, Meta Llama, Mistral এবং অন্যান্য। Amazon Nova হল AWS-এর নিজস্ব উন্নয়নে প্রথম ফান্ডামেন্টাল মডেল পরিবার, যা ক্লাউড অবকাঠামোতে বাণিজ্যিক ব্যবহারের জন্য নির্দেশিত।[3]

প্রথম প্রজন্ম (২০২৪–২০২৫)

Amazon Nova পরিবারের প্রথম প্রজন্ম আনুষ্ঠানিকভাবে ২০২৪ সালের ৩ ডিসেম্বর AWS re:Invent 2024 সম্মেলনে উপস্থাপিত হয়। প্রাথমিক রিলিজে তিনটি understanding model অন্তর্ভুক্ত ছিল — Nova Micro (শুধু টেক্সট), মাল্টিমোডাল Nova Lite এবং Nova Pro — এবং পাশাপাশি জেনারেটিভ মডেল Nova Canvas (চিত্র উৎপাদন) ও Nova Reel (ভিডিও উৎপাদন)।[4][3][5]

২০২৫ সালের এপ্রিলে পরিবারে ফ্ল্যাগশিপ মডেল Nova Premier যুক্ত হয় — এটি পরিবারের সবচেয়ে শক্তিশালী মডেল, যার কনটেক্সট উইন্ডো ১ মিলিয়ন token এবং এটি জটিল রিজনিং ও distillation (বড় মডেল থেকে ছোট মডেলে জ্ঞান স্থানান্তর) কাজের জন্য। একই সময়, ২০২৫ সালের এপ্রিলে Nova Sonic উপস্থাপিত হয় — এটি speech‑to‑speech শ্রেণির একটি বাক মডেল যা রিয়েল-টাইম কথোপকথন সমর্থন করে।[6][7]

দ্বিতীয় প্রজন্ম — Nova 2 (২০২৫–২০২৬)

২০২৫ সালের নভেম্বর–ডিসেম্বরে AWS re:Invent 2025 সম্মেলনে দ্বিতীয় প্রজন্ম — Amazon Nova 2 ঘোষণা করা হয়। এই পরিবারে dynamic reasoning এবং প্রসারিত কনটেক্সট প্রক্রিয়াকরণ সমর্থনসহ আপডেট করা মডেল Nova 2 Lite ও Nova 2 Pro, নেটিভ মাল্টিমোডাল মডেল Nova 2 Omni (একযোগে টেক্সট, চিত্র, ভিডিও ও অডিও প্রক্রিয়াকরণ ও উৎপাদন) এবং পরবর্তী প্রজন্মের বাক মডেল Nova 2 Sonic অন্তর্ভুক্ত রয়েছে। একইসাথে Nova Forge (কাস্টম মডেল প্রশিক্ষণের পরিবেশ) ও Nova Act (এজেন্টিক workflow-এর framework) সেবা উপস্থাপিত হয়।[8][9][10]

২০২৬ সালের ফেব্রুয়ারিতে Amazon Nova 2-এর আনুষ্ঠানিক প্রযুক্তিগত প্রতিবেদন প্রকাশিত হয়।[11]

সংক্ষিপ্ত কালপঞ্জি

তারিখ ঘটনা
ডিসেম্বর ২০২৪ AWS re:Invent 2024-এ Amazon Nova ঘোষণা: Nova Micro, Lite, Pro, Canvas, Reel
এপ্রিল ২০২৫ Nova Premier (১M token কনটেক্সট) ও Nova Sonic (speech‑to‑speech) প্রকাশ
জুন ২০২৫ প্রথম প্রজন্মের প্রযুক্তিগত প্রতিবেদন প্রকাশ (arXiv:2506.12103)
নভেম্বর–ডিসেম্বর ২০২৫ AWS re:Invent 2025-এ Nova 2 ঘোষণা: Nova 2 Lite, 2 Pro, 2 Omni, 2 Sonic, Nova Forge, Nova Act
ফেব্রুয়ারি ২০২৬ Amazon Nova 2-এর প্রযুক্তিগত প্রতিবেদন প্রকাশ

তাত্ত্বিক ভিত্তি ও আর্কিটেকচার

Understanding মডেলের মূল আর্কিটেকচার

arXiv:2506.12103 প্রযুক্তিগত প্রতিবেদন অনুযায়ী, understanding মডেলগুলো (Nova Micro, Lite, Pro, Premier) Vaswani et al.-এর কাজে বর্ণিত Transformer আর্কিটেকচারের উপর ভিত্তি করে নির্মিত।[12] Multi‑Head Self‑Attention-এর মূল প্রক্রিয়া নিম্নোক্ত সূত্র দ্বারা বর্ণনা করা হয়:

Attention(Q,K,V)=softmax(QKdk)V

যেখানে Q, K, V যথাক্রমে queries, keys এবং values ম্যাট্রিক্স এবং dk হল keys-এর মাত্রা।[12][1]

আর্কিটেকচারের সুনির্দিষ্ট প্যারামিটার (স্তরের সংখ্যা, লুকানো অবস্থার আকার, attention head-এর সংখ্যা, মোট প্যারামিটার সংখ্যা) ২০২৬ সালের মার্চ পর্যন্ত সর্বজনীনভাবে উপলব্ধ উৎসে প্রকাশ করা হয়নি। এই পদ্ধতি বন্ধ বাণিজ্যিক মডেলের জন্য সাধারণ।[1]

Nova Lite ও Nova Pro-তে মাল্টিমোডাল প্রক্রিয়াকরণ টেক্সট, ভিজ্যুয়াল ও ভিডিও token-গুলোকে একটি একক ক্রমে একত্রিত করে একক ভাষা মডেলে ইনপুট হিসেবে প্রদান করে সম্পন্ন হয়। Vision encoder-গুলো চিত্র ও ভিডিও ফ্রেমকে টেক্সট উপস্থাপনার সাথে সামঞ্জস্যপূর্ণ token ক্রমে রূপান্তরিত করে।[1][13]

জেনারেটিভ মডেলের আর্কিটেকচার

জেনারেটিভ মডেল Nova Canvas (চিত্র) ও Nova Reel (ভিডিও) Latent Diffusion Models (LDM)[14] আর্কিটেকচার ব্যবহার করে, যা Variational AutoEncoder (VAE)-এর সাথে মিলিত হয়ে latent space-এ গণনা পরিচালনা করে। ডিফিউশন প্রক্রিয়া ফরওয়ার্ড নয়েজ সমীকরণ দ্বারা বর্ণনা করা হয়:

xt=α¯tx0+1α¯tϵ,ϵ𝒩(0,I)

যেখানে x0 হল latent space-এ মূল চিত্র, xt হল ধাপ t-এ এর নয়েজযুক্ত সংস্করণ, α¯t হল নয়েজ শিডিউলের ক্রমবর্ধমান প্যারামিটার, ϵ হল স্ট্যান্ডার্ড গাউসীয় নয়েজ। টেক্সট encoder টেক্সট prompt-এর উপর conditioning — উৎপাদনকে শর্তযুক্ত করা — নিশ্চিত করে।[13][14]

বাক মডেলের আর্কিটেকচার

Nova Sonic টেক্সট মডেলের থেকে ভিন্ন আর্কিটেকচার ব্যবহার করে: এটি একটি বিশেষায়িত speech encoder, speech renderer এবং মূল মাল্টিমোডাল ভাষা মডেলকে একটি একক end‑to‑end pipeline-এ একত্রিত করে। এটি মধ্যবর্তী টেক্সটে রূপান্তর ছাড়াই বাক ইনপুট প্রক্রিয়াকরণ ও বাক আউটপুট উৎপাদন সম্ভব করে (যদিও মান নিশ্চিতির জন্য অভ্যন্তরীণভাবে টেক্সট উপস্থাপনা ব্যবহৃত হয়)।[15][1]

প্রশিক্ষণ অবকাঠামো

Nova মডেলের প্রশিক্ষণ AWS Elastic Kubernetes Service (EKS)-এর বিতরণকৃত ক্লাস্টারে Amazon-এর নিজস্ব AI accelerator Amazon Trainium (TRN1 ইন্সট্যান্স) এবং NVIDIA A100 ও H100 গ্রাফিক্স প্রসেসর ব্যবহার করে পরিচালিত হয়েছিল।[13][1]

প্রশিক্ষণে গণনামূলক ব্যয় কমাতে বিশেষায়িত অপ্টিমাইজেশন পদ্ধতি তৈরি ও প্রয়োগ করা হয়েছে:

  • Super‑Selective Activation Checkpointing (SSC) — activation সংরক্ষণের একটি পদ্ধতি যা প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী, recomputation-এর ন্যূনতম ওভারহেডে গ্রাফিক্স প্রসেসরের মেমরি ব্যবহার প্রায় ৫০% হ্রাস করে।[13]
  • In‑CPU‑Memory Checkpointing — Amazon S3 ক্লাউড স্টোরেজে অ্যাসিঙ্ক্রোনাস আপলোডের আগে কেন্দ্রীয় প্রসেসরের (CPU) র‍্যামে মধ্যবর্তী weights (checkpoints) ক্যাশ করা। Amazon-এর তথ্য অনুযায়ী, এই পদ্ধতি TRN1 ইন্সট্যান্সে মডেলের অবস্থা সংরক্ষণের সময় ০.১ সেকেন্ডে হ্রাস করা সম্ভব করেছে।[16][13]

প্রশিক্ষণ পাইপলাইন ও সারিবদ্ধকরণ

Nova মডেলের প্রশিক্ষণ প্রক্রিয়া আধুনিক LLM-এর জন্য সাধারণ বেশ কয়েকটি ধাপ নিয়ে গঠিত:[1][17]

Pre‑training (পূর্ব-প্রশিক্ষণ)

২০০টিরও বেশি ভাষা অন্তর্ভুক্ত একটি বৃহৎ বহুভাষিক ও মাল্টিমোডাল ডেটা কর্পাসে বৃহৎ মাপের প্রশিক্ষণ। প্রশিক্ষণ ডেটার সুনির্দিষ্ট গঠন (পরিমাণ, ভাষার অনুপাত, নির্দিষ্ট উৎস) সর্বজনীন উপকরণে প্রদান করা হয়নি।[1]

Supervised Fine‑Tuning (SFT) - তত্ত্বাবধায়িত সূক্ষ্ম-সমন্বয়

লেবেলযুক্ত «নির্দেশনা — উত্তর» জোড়ার উপর সূক্ষ্ম-সমন্বয়, যা মডেলকে ব্যবহারকারীর নির্দেশনা অনুসরণে প্রবৃত্ত করে।[1]

Reinforcement Learning দিয়ে সারিবদ্ধকরণ

মানুষের পছন্দের সাথে মডেলের আচরণ সারিবদ্ধ করতে দুটি মূল অ্যালগরিদম ব্যবহার করা হয়:

Proximal Policy Optimization (PPO) — Reinforcement Learning from Human Feedback (RLHF)-এর উপর ভিত্তি করে একটি পৃথক Reward Model ব্যবহারকারী Reinforcement Learning অ্যালগরিদম।[18][1]

Direct Preference Optimization (DPO) — সারিবদ্ধকরণের একটি বিকল্প পদ্ধতি যার জন্য স্পষ্ট Reward Model প্রয়োজন নেই। DPO-এর লক্ষ্য ফাংশন নিম্নরূপ:[19]

DPO(πθ;πref)=𝔼(x,yw,yl)𝒟[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]

যেখানে:

  • πθ — প্যারামিটারাইজড কৌশল (প্রশিক্ষণযোগ্য মডেল);
  • πref — মূল (স্থির) রেফারেন্স মডেল;
  • x — ইনপুট prompt (প্রসঙ্গ);
  • yw এবং yl — যথাক্রমে পছন্দনীয় (winner) ও প্রত্যাখ্যাত (loser) উত্তর;
  • σ — লজিস্টিক (সিগমোয়েড) ফাংশন;
  • β — মূল মডেল থেকে বিচ্যুতির দণ্ডের শক্তি নিয়ন্ত্রণকারী হাইপারপ্যারামিটার (KL‑divergence penalty-এর সমতুল্য)।[19][1]

মডেল পরিবারের গঠন

মডেল পরিবারটি কার্যক্ষমতা, ব্যয় ও latency-এর মধ্যে ভারসাম্যের উপর নির্ভর করে tier-এ বিভক্ত।[2][20]

প্রথম প্রজন্মের understanding মডেল

প্যারামিটার Nova Micro Nova Lite Nova Pro Nova Premier
ইনপুট মোডালিটি টেক্সট টেক্সট, চিত্র, ভিডিও টেক্সট, চিত্র, ভিডিও টেক্সট, চিত্র, ভিডিও
আউটপুট মোডালিটি টেক্সট টেক্সট টেক্সট টেক্সট
কনটেক্সট উইন্ডো ১২৮ হাজার token ৩০০ হাজার token ৩০০ হাজার token ১ মিলিয়ন token
সর্বোচ্চ আউটপুট token ১০ হাজার ১০ হাজার ১০ হাজার ১০ হাজার
ভাষা সমর্থন ২০০+ ২০০+ ২০০+ ২০০+
Fine‑tuning হ্যাঁ হ্যাঁ হ্যাঁ না
রিলিজের তারিখ ডিসেম্বর ২০২৪ ডিসেম্বর ২০২৪ ডিসেম্বর ২০২৪ এপ্রিল ২০২৫
মূল উদ্দেশ্য টেক্সট কাজের জন্য ন্যূনতম বিলম্ব ও ব্যয় মূলভিত্তিক মাল্টিমোডাল বিশ্লেষণ জটিল যুক্তি ও এজেন্টিক কাজের জন্য সর্বোত্তম ভারসাম্য সর্বোচ্চ নির্ভুলতা, distillation-এর জন্য teacher মডেল

উৎস: AWS AI Service Cards; arXiv:2506.12103।[20][1]

অপ্টিমাইজড ভাষা (১৫টি): ইংরেজি, জার্মান, স্পেনিশ, ফরাসি, ইতালিয়ান, জাপানি, কোরিয়ান, আরবি, চীনা (সরলীকৃত), রুশ, হিন্দি, পর্তুগিজ, ডাচ, তুর্কি, হিব্রু।[2]

Nova Premier গভীর প্রসঙ্গ বোঝার, বহু-ধাপ পরিকল্পনা এবং বড় পরিমাণ ডেটা প্রক্রিয়াকরণের প্রয়োজনীয় কাজের জন্য ডিজাইন করা হয়েছে: কোডবেস, ৪০০ পৃষ্ঠারও বেশি নথি, ৯০ মিনিট পর্যন্ত দীর্ঘ ভিডিও।[6]

দ্বিতীয় প্রজন্মের মডেল (Nova 2)

Nova 2 LiteNova 2 Pro ২০২৫ সালের নভেম্বর–ডিসেম্বরে প্রকাশিত হয়। উভয়ই extended thinking সমর্থন করে — এমন একটি প্রক্রিয়া যেখানে মডেল উত্তর উৎপাদনের আগে বহু-ধাপ রিজনিং সম্পাদন করে। রিজনিংয়ের গভীরতা reasoning_effort প্যারামিটার দ্বারা low, mediumhigh স্তরে নিয়ন্ত্রিত হয়। কনটেক্সট উইন্ডো ১ মিলিয়ন token পর্যন্ত বিস্তৃত। নেটিভ টুলস অন্তর্নির্মিত: নিশ্চিতকরণসহ ওয়েব অনুসন্ধান (web grounding) ও কোড ইন্টারপ্রিটার।[9][8]

Nova 2 Omni — একটি নেটিভ মাল্টিমোডাল মডেল যা একযোগে ইনপুট হিসেবে টেক্সট, চিত্র, ভিডিও ও অডিও গ্রহণ করতে এবং টেক্সট ও চিত্র উৎপাদন করতে সক্ষম। কনটেক্সট উইন্ডো — ১ মিলিয়ন token।[8][11]

Nova 2 Sonic — পরবর্তী প্রজন্মের বাক মডেল। ৬টি ভাষা সমর্থন করে: ইংরেজি (আমেরিকান ও ব্রিটিশ সংস্করণ), স্পেনিশ, জার্মান, ফরাসি, ইতালিয়ান। asynchronous tool calling প্রবর্তন করে — বাহ্যিক টুলগুলো পটভূমিতে চলার সময় মডেল নতুন ইনপুট প্রক্রিয়াকরণ চালিয়ে যায়।[10]

প্যারামিটার Nova 2 Lite Nova 2 Pro Nova 2 Omni Nova 2 Sonic
ইনপুট মোডালিটি টেক্সট, চিত্র, ভিডিও টেক্সট, চিত্র, ভিডিও টেক্সট, চিত্র, ভিডিও, অডিও অডিও (বাক)
আউটপুট মোডালিটি টেক্সট টেক্সট টেক্সট, চিত্র অডিও (বাক)
কনটেক্সট উইন্ডো ১ মিলিয়ন token ১ মিলিয়ন token ১ মিলিয়ন token ৩০০ হাজার token
Extended thinking হ্যাঁ হ্যাঁ হ্যাঁ
নেটিভ টুলস Web grounding, Code interpreter Web grounding, Code interpreter Asynchronous tool calling
রিলিজের তারিখ নভেম্বর–ডিসেম্বর ২০২৫ নভেম্বর–ডিসেম্বর ২০২৫ ডিসেম্বর ২০২৫ ডিসেম্বর ২০২৫

উৎস: AWS Blog; Amazon Science।[9][8][11]

জেনারেটিভ মডেল

Nova Canvas — চিত্র উৎপাদনের মডেল। টেক্সট ও গ্রাফিক ইনপুট সমর্থন করে (PNG, JPEG)। আউটপুট রেজোলিউশন — ৪.১৯ মিলিয়ন পিক্সেল পর্যন্ত (যেমন ২০৪৮×২০৪৮ বা ২৮১৬×১৫৩৬ পিক্সেল)। prompt-এর সর্বোচ্চ দৈর্ঘ্য — ১০২৪ অক্ষর। inpainting (চিত্রের একটি অঞ্চল প্রতিস্থাপন) ও outpainting (চিত্রকে তার সীমানার বাইরে সম্প্রসারণ) অপারেশন সমর্থিত।[2][4]

Nova Reel — ভিডিও উৎপাদনের মডেল। আউটপুট রেজোলিউশন: প্রতি সেকেন্ডে ২৪ ফ্রেমে ১২৮০×৭২০। উৎপাদিত ভিডিওর দৈর্ঘ্য — ৬ সেকেন্ড পর্যন্ত। ক্যামেরা মুভমেন্ট নিয়ন্ত্রণ (camera control) সমর্থিত। অ্যাক্সেস অ্যাসিঙ্ক্রোনাস API (Asynchronous Invoke Model API)-এর মাধ্যমে করা হয়।[2][4]

বাক মডেল

Nova Sonic (এপ্রিল ২০২৫) — দ্বিমুখী স্ট্রিমিং API (bidirectional stream API)-সহ একটি বাক মডেল। function calling এবং Retrieval‑Augmented Generation (RAG, বাহ্যিক জ্ঞান আহরণসহ উৎপাদন)-এর মাধ্যমে কর্পোরেট ডেটায় grounding সমর্থন করে। watermarking ফিচার ডিফল্টরূপে অন্তর্নির্মিত। সংযোগের সর্বোচ্চ সময়কাল — পুনরারম্ভের সম্ভাবনাসহ ৮ মিনিট; প্রতি ক্লায়েন্টে ডিফল্ট মান হিসেবে সর্বোচ্চ ২০টি একযোগে সংযোগ।[7][15][2]

Nova 2 Sonic (ডিসেম্বর ২০২৫) — উন্নত সংক্ষিপ্ত উচ্চারণ, টেলিফোন অডিও (৮ kHz) ও উচ্চারণভঙ্গি স্বীকৃতিসহ পরবর্তী প্রজন্মের বাক মডেল।[10]

মূল্যায়ন ও benchmark

Nova মডেলের মূল্যায়ন স্বয়ংক্রিয় benchmark ব্যবহার করে পরিচালিত হয়েছিল, যার মধ্যে «LLM‑as‑a‑judge» পদ্ধতি (মূল্যায়নকারী হিসেবে ভাষা মডেলের ব্যবহার) অন্তর্ভুক্ত। HKU SPACE AI Hub গবেষণার তথ্য অনুযায়ী, Arena‑Hard‑Auto মেট্রিক বিশেষজ্ঞ মূল্যায়নের সাথে ৯৮.৬% সম্পর্ক প্রদর্শন করে।[21][22]

প্রথম প্রজন্মের benchmark

arXiv:2506.12103 প্রযুক্তিগত প্রতিবেদন থেকে তথ্য (শর্ত: প্রতিবেদন প্রস্তুতির সময় প্রকাশিত প্রতিযোগী মডেলের ডেভেলপারদের ফলাফল):[1]

Benchmark Nova Pro Nova Lite Nova Micro Claude 3.5 Sonnet (Oct 2024) GPT‑4o (Nov 2024)
MMLU (5‑shot) 80,5 77,6
MATH (4‑shot) 73,3 69,3
IFEval 87,5 87,2
MT‑Bench (text) 79,7 77,7 76,7 77,5
MT‑Bench (multimodal) 63,7 60,7 61,6 55,0

উৎস: arXiv:2506.12103, সারণি 2.1.1।[1]

ফলাফলগুলো পরিবারের মধ্যে কার্যক্ষমতার শ্রেণিবিন্যাস প্রদর্শন করে (Premier > Pro > Lite > Micro)। পার্থক্য গণিত (Math) ও রিজনিং (Reasoning) বিভাগে সবচেয়ে লক্ষণীয়; ভূমিকা-পালন (Roleplay) ও তথ্য-নিষ্কাশন (Extraction) কাজে ছোট মডেলগুলো বড় মডেলের কাছাকাছি ফলাফল দেখায়।[22]

দ্বিতীয় প্রজন্মের benchmark (Nova 2)

Amazon Nova 2 প্রযুক্তিগত প্রতিবেদন থেকে তথ্য (শর্ত: internal measurements, ০‑shot / CoT যেখানে প্রযোজ্য):[11]

Benchmark Nova 2 Lite Nova 2 Pro Claude Haiku 4.5 GPT‑5 Mini Gemini 2.5 Flash
MMLU‑Pro (acc) 80,9 81,6 80,0 83,7 83,2
GPQA‑Diamond (acc) 79,6 81,4 73,0 82,3 82,8
AIME 2025 (acc) 91,0 92,3 80,7 91,1 72,0
LongCodeBench 1M (acc) 84,0 84,0 78,0

উৎস: Amazon Nova 2 Technical Report, সারণি ১।[11]

এজেন্টিক benchmark (Nova 2 Pro): SWE‑Bench Verified — ৭০.০%; τ²‑bench Verified Telecom — ৯২.৭%।[11]

মাল্টিমোডাল benchmark (Nova 2 Omni): VideoMME — ৭৭.৯%; MMMU Pro — ৬১.৪%।[11]

টেকনিক্যাল সাপোর্ট কাজে মূল্যায়নে Nova 2 Lite «সমস্যা চিহ্নিতকরণ» (Problem Identification) মেট্রিকে দশ-পয়েন্ট স্কেলে ৯.৬৩ ± ০.২৭ অর্জন করেছে, যা প্রথম প্রজন্মের Nova Lite (৮.৫৭ ± ০.৪৬)-কে উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে।[23]

নোট। প্রতিযোগী মডেলের সাথে ফলাফল তুলনা করার সময় মনে রাখতে হবে যে prompt-এর শর্ত, মডেলের সংস্করণ ও মেট্রিক পরিমাপের তারিখ ভিন্ন হতে পারে। প্রথম ও দ্বিতীয় প্রজন্মের benchmark Amazon-এর স্ব-প্রতিবেদন থেকে প্রাপ্ত; স্বাধীন যাচাইকরণ (FloTorch, Artificial Analysis) সাধারণত ঘোষিত মূল্য-কার্যক্ষমতার অনুপাত নিশ্চিত করে, তবে কিছু নির্ভুলতার মেট্রিকে শীর্ষস্থানীয় প্রতিযোগীদের তুলনায় পিছিয়ে থাকার বিষয়টি লিপিবদ্ধ করে।[22]

আউটপুটের গতি

Amazon-এর অভ্যন্তরীণ পরিমাপ অনুযায়ী (internal, Bedrock API-এর মাধ্যমে):[1][11]

মডেল আউটপুটের গতি (token/সেকেন্ড)
Nova Micro ≈210
Nova Lite ≈157
Nova Pro ≈100
Nova 2 Omni >200

ব্যবহারের ব্যয়

সমস্ত মডেল Amazon Bedrock-এর মাধ্যমে প্রক্রিয়াকৃত token-এর সংখ্যার উপর ভিত্তি করে অর্থপ্রদান মডেলে পাওয়া যায় (২০২৬ সালের মার্চের তথ্য):[2]

মডেল ইনপুট token (USD / ১M) আউটপুট token (USD / ১M)
Nova Micro $0,035 $0,14
Nova Lite ≈$0,06 ≈$0,24
Nova Pro $0,80 $3,20
Nova Premier $2,50 $12,50

তুলনার জন্য: Nova রিলিজের সময় Anthropic Claude 3.5 Sonnet ১M ইনপুট token-এ $৬.০০ এবং ১M আউটপুট token-এ $৩০.০০ হারে মূল্য নির্ধারণ করা হয়েছিল।[22]

কাস্টমাইজেশন ও fine‑tuning

AWS অবকাঠামো সংকীর্ণ বিশেষায়িত ডোমেনের জন্য Nova-এর মূল মডেল অভিযোজনের বেশ কয়েকটি পদ্ধতি প্রদান করে। দ্বিতীয় প্রজন্মে এর প্রধান হাতিয়ার হল Amazon Nova Forge পরিবেশ।[8][17]

Continued Pre‑Training (CPT) ও Mid‑Training

Nova Forge মডেলের মধ্যবর্তী প্রশিক্ষণ checkpoint-গুলোতে (যেমন pretraining‑text‑RDpretraining‑text‑CE) অ্যাক্সেস দেয়। এটি বিপর্যয়মূলক বিস্মৃতি (catastrophic forgetting) রোধে সাবধানতার সাথে learning rate নির্বাচন করে কর্পোরেট ডেটার বৃহৎ সংগ্রহে self‑supervised learning চালিয়ে যাওয়ার সুযোগ দেয়।[24][25]

Parameter‑Efficient Fine‑Tuning (PEFT)

Low‑Rank Adaptation (LoRA)[26]-এর মাধ্যমে কম-র‍্যাংক অ্যাডাপ্টার দিয়ে মডেলের weights-এর কেবল একটি ক্ষুদ্র উপসেট আপডেট করা। এই পদ্ধতি পূর্ণ fine‑tuning-এর তুলনায় গণনামূলক সম্পদের চাহিদা উল্লেখযোগ্যভাবে কমায়। Nova Lite ও Pro-এর জন্য মাল্টিমোডাল fine‑tuning সমর্থিত।[17]

Reinforcement Fine‑Tuning (RFT)

কাস্টম মডেলগুলো LLM‑as‑a‑judge হিসেবে অন্য একটি LLM ব্যবহারসহ শিল্প-নির্দিষ্ট reward মেট্রিকের উপর ভিত্তি করে Reinforcement Learning পদ্ধতি দিয়ে অতিরিক্ত fine‑tuning করা যেতে পারে।[27]

মডেল Distillation

Model Distillation ফিচার Nova Premier বা Nova Pro-কে ছোট student model — Nova Lite ও Nova Micro — প্রশিক্ষণের জন্য teacher model হিসেবে ব্যবহার করার সুযোগ দেয়। এটি বড় মডেলের মানের উল্লেখযোগ্য অংশ বজায় রেখে inference-এ গণনামূলক ব্যয় কমায়।[2][6]

প্রয়োগ ও একীকরণ

Nova মডেলগুলো Amazon-এর কম্পিউটিং সেবায় (AWS Step Functions, AWS Lambda, Amazon Q Developer) একীভূত। প্রলেখিত মূল ব্যবহারের পরিস্থিতি:[2][1]

Agentic Workflows (এজেন্টিক কর্মপ্রবাহ)

Bedrock Agents ও function calling ব্যবহার করে বহু-ধাপ কাজ সম্পাদন। LangGraph-এর মতো framework-এর সাথে ReAct (Reasoning and Acting) আর্কিটেকচারাল প্যাটার্ন ব্যবহার করে Nova মডেলগুলো ডেটাবেজ বিশ্লেষণ সমন্বয় করে, প্রাকৃতিক ভাষা থেকে SQL কোয়েরি তৈরি করে এবং বহু-উপাদান প্রক্রিয়া পরিচালনা করে। Nova Act প্রাথমিক ব্যবহারকারী কাজে ৯০% বলে দাবিকৃত নির্ভরযোগ্যতাসহ ব্রাউজার UI‑workflow স্বয়ংক্রিয়করণ নিশ্চিত করে।[28][8]

RAG (বাহ্যিক জ্ঞান আহরণসহ উৎপাদন)

কর্পোরেট ডেটায় উত্তরের grounding-এর জন্য Bedrock Knowledge Bases-এর সাথে একীকরণ। Nova 2 মডেলগুলো অন্তর্নির্মিত টুল হিসেবে নেটিভ web grounding সমর্থন করে।[1][9]

নথি প্রক্রিয়াকরণ

সমর্থিত ইনপুট নথির ফরম্যাট: PDF, CSV, DOC, DOCX, XLS, XLSX, HTML, TXT, MD (Nova Micro ব্যতীত, যা কেবল টেক্সট ইনপুট গ্রহণ করে)। Nova Premier একক অনুরোধের মধ্যে ৯০ মিনিট পর্যন্ত দীর্ঘ ভিডিও প্রক্রিয়াকরণ করতে সক্ষম।[2][6]

কোড উৎপাদন ও ডিবাগিং

সমর্থিত প্রোগ্রামিং ভাষা: Python, Java, JavaScript, C#, TypeScript, SQL।[20]

বাক ইন্টারফেস

Nova Sonic ও Nova 2 Sonic Amazon Connect-এর সাথে একীভূত রিয়েল-টাইম সমর্থনসহ ভয়েস এজেন্ট নির্মাণে ব্যবহৃত হয়।[10][7]

মডেল মূল্যায়ন (LLM‑as‑a‑judge)

Amazon SageMaker প্ল্যাটফর্মে অন্যান্য জেনারেটিভ মডেলের আউটপুট মূল্যায়নে Nova judge মডেল হিসেবে ব্যবহৃত হয়।[29]

সীমাবদ্ধতা ও উন্মুক্ত সমস্যা

  • আর্কিটেকচারের বদ্ধতা। Amazon parameter-এর সংখ্যা, বিস্তারিত আর্কিটেকচারাল সিদ্ধান্ত ও প্রশিক্ষণ ডেটার গঠন প্রকাশ করে না, যা ফলাফলের স্বাধীন পুনরাবৃত্তিযোগ্যতাকে উল্লেখযোগ্যভাবে সীমিত করে। Nova মডেলের weights ডাউনলোড বা AWS অবকাঠামোর বাইরে স্থাপনার (on‑premise স্থাপনা অসম্ভব) জন্য সরবরাহ করা হয় না।[1][2]
  • আউটপুট সীমা। সমস্ত understanding মডেলের জন্য সর্বোচ্চ আউটপুট token সংখ্যা ১০ হাজার token-এ সীমাবদ্ধ, যা দীর্ঘ নথি উৎপাদনের কাজের জন্য অপর্যাপ্ত হতে পারে।[2]
  • RFT-এর সীমাবদ্ধতা। Reinforcement Fine‑Tuning বহু-পর্যায়ের (multi‑turn) কথোপকথন ও মাল্টিমোডাল ডেটা সমর্থন করে না; ডেটাসেটে ইতিবাচক উদাহরণের প্রস্তাবিত অনুপাত — কমপক্ষে ৫%।[27]
  • Nova Sonic-এর সীমাবদ্ধতা। সংযোগের সর্বোচ্চ সময়কাল — ৮ মিনিট; ডিফল্টরূপে প্রতি ক্লায়েন্টে সর্বোচ্চ ২০টি একযোগে সংযোগ।[2]
  • আঞ্চলিক প্রাপ্যতা। Nova Premier কেবল একটি অঞ্চলে পাওয়া যায় (US East N. Virginia) ক্রস-রিজিওনাল inference সমর্থন ছাড়াই; Nova 2 মডেলের স্থাপনা অঞ্চলের সীমিত তালিকা রয়েছে।[2]
  • মেট্রিকের সংবেদনশীলতা। সিন্থেটিক benchmark-এ মূল্যায়ন সবসময় উৎপাদন (production) পরিবেশে কার্যক্ষমতার গুণমানের সাথে সম্পর্কিত নয়, যেখানে কর্পোরেট নীতির কঠোর মেনে চলা ও বহু-ধাপ আউটপুটে hallucination অনুপস্থিতি গুরুত্বপূর্ণ।[22][23]
  • Hallucination। মডেলগুলো LLM-এর জন্য সাধারণ সীমাবদ্ধতা প্রদর্শন করে: উৎপাদিত উত্তরে তথ্যগত ত্রুটি সম্ভব। ঝুঁকি কমাতে Bedrock Guardrails ও RAG ব্যবহার সুপারিশ করা হয়।[1]
  • benchmark-এর তুলনামূলক নিরপেক্ষতা। Amazon ডেভেলপারদের নিজেদের প্রকাশিত তথ্যের ভিত্তিতে প্রতিযোগী মডেলের সাথে তুলনা প্রদান করে, যা সবসময় একীভূত নিয়ন্ত্রিত পরীক্ষামূলক ভিত্তি নিশ্চিত করে না।[22]

নৈতিক ও নিয়ন্ত্রক দিক

AWS Nova মডেল উন্নয়নে দায়িত্বশীল AI (Responsible AI) নীতি অনুসরণের ঘোষণা দেয়। নির্দিষ্ট নিরাপত্তা ব্যবস্থার মধ্যে রয়েছে:[20][15]

  • অন্তর্নির্মিত content moderation।
  • Nova Sonic-এর অডিও আউটপুটের জন্য watermarking।
  • ঝুঁকি বিভাগ অনুযায়ী মূল্যায়ন: নিরাপত্তা (safety), গোপনীয়তা (privacy), নির্ভরযোগ্যতা (veracity), স্বচ্ছতা (transparency), এবং রাসায়নিক, জৈবিক, রেডিওলজিক্যাল ও পারমাণবিক (CBRN) অস্ত্রের বিস্তার ও আক্রমণাত্মক সাইবার অপারেশন।
  • ইনপুট ও আউটপুট ডেটা ফিল্টারিংয়ের জন্য Amazon Bedrock Guardrails-এর সাথে একীকরণ।
  • Amazon Frontier Model Safety Framework-এর সাথে সামঞ্জস্যের জন্য Nova Premier মডেলের মূল্যায়ন।
  • Red teaming — আক্রমণ প্রতিরোধের জন্য অভ্যন্তরীণ ও বাহ্যিক পরীক্ষা (প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী, ৩০৭টি কৌশল)।
  • Aegis benchmark-এ content moderation-এর F1 মেট্রিকে মূল্যায়ন: ৮৫.৮৪ (প্রযুক্তিগত প্রতিবেদনের তথ্য অনুযায়ী)।[1]

Nova Micro, Lite, Pro, Premier ও Sonic-এর AI Service Cards docs.aws.amazon.com-এ দায়িত্বশীল প্রয়োগের ডকুমেন্টেশন হিসেবে প্রকাশিত হয়েছে।[20][15]

সম্ভাবনা ও গবেষণার দিকনির্দেশনা

Nova 2 পরিবার extended thinking / reasoning-সহ মডেলের দিকে রূপান্তর নির্দেশ করে, যা অন্যান্য মডেল পরিবারে Chain‑of‑Thought (CoT) ও অনুরূপ প্রক্রিয়ার ধারণার সাথে তুলনীয়। অন্তর্নির্মিত ওয়েব অনুসন্ধান ও কোড ইন্টারপ্রিটার নেটিভ টুল হিসেবে (তৃতীয় পক্ষের প্লাগইন নয়) এজেন্টিক সিস্টেমের দিকে আর্কিটেকচারাল পরিবর্তন উপস্থাপন করে।[9][8]

Amazon-এর সর্বজনীন উপকরণে উল্লিখিত আরও উন্নয়নের দিকনির্দেশনা:

  • মাল্টিমোডালিটির সম্প্রসারণ (Omni মডেল একীভূত «সর্বকিছু-থেকে-সর্বকিছু» আর্কিটেকচার হিসেবে)।
  • কাজের জটিলতার উপর নির্ভর করে অভিযোজিত গভীরতাসহ hybrid reasoning।
  • সমস্ত pre‑training পর্যায়ে ব্যবহারকারীর ডেটায় উন্মুক্ত প্রশিক্ষণ (Nova Forge)।
  • Edge ডিভাইসের জন্য distillation।
  • safety toolkit সম্প্রসারণ।[8][11]

AWS-এর উদ্যোগে বিশ্ববিদ্যালয় দলের মধ্যে আয়োজিত Amazon Nova AI Challenge-এর বিষয়বস্তুতে স্বয়ংক্রিয় প্রতিপক্ষ পরীক্ষা, safety alignment ও multi‑turn jailbreaks-এর দিকনির্দেশনা অন্তর্ভুক্ত, যা মডেল পরিবারের নির্ভরযোগ্যতায় বিনিয়োগ নির্দেশ করে।[8]

আরও দেখুন

  • Transformer (আর্কিটেকচার)
  • Reinforcement Learning from Human Feedback (RLHF)

সাহিত্য

সূত্র

টীকা

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 Amazon Artificial General Intelligence. The Amazon Nova Family of Models: Technical Report and Model Card. arXiv:2506.12103v1, 2025. https://arxiv.org/abs/2506.12103
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 AWS Documentation. What is Amazon Nova?. Amazon Nova User Guide. https://docs.aws.amazon.com/nova/latest/userguide/what-is-nova.html
  3. 3.0 3.1 3.2 AWS. Introducing Amazon Nova foundation models. AWS News Blog, 3 декабря 2024. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-frontier-intelligence-and-industry-leading-price-performance/
  4. 4.0 4.1 4.2 About Amazon. 11 key announcements from AWS re:Invent 2024. aboutamazon.com, 2024. https://www.aboutamazon.com/news/aws/amazon-nova-ai-canvas-reel-aws-reinvent
  5. Futurum Research. Amazon unveils Nova models, chips, and tools at re:Invent. futurumgroup.com, 2025. https://futurumgroup.com/press-release/amazon-unveils-models-chips-and-tools-at-reinvent-boosting-its-ai-credentials/
  6. 6.0 6.1 6.2 6.3 AWS. Amazon Nova Premier — Our most capable model for complex tasks and teacher for model distillation. AWS Blog, 29 апреля 2025. https://aws.amazon.com/blogs/aws/amazon-nova-premier-our-most-capable-model-for-complex-tasks-and-teacher-for-model-distillation/
  7. 7.0 7.1 7.2 AWS. Announcing Amazon Nova Sonic. AWS What's New, 7 апреля 2025. https://aws.amazon.com/about-aws/whats-new/2025/04/amazon-nova-sonic-speech-to-speech-conversations-bedrock/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 Amazon. Amazon introduces new frontier Nova models. aboutamazon.com, 2 декабря 2025. https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models
  9. 9.0 9.1 9.2 9.3 9.4 AWS. Introducing Amazon Nova 2 Lite — a fast, cost‑effective reasoning model. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/
  10. 10.0 10.1 10.2 10.3 AWS. Introducing Amazon Nova 2 Sonic — next‑generation speech‑to‑speech model for conversational AI. AWS Blog, декабрь 2025. https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-sonic-next-generation-speech-to-speech-model-for-conversational-ai/
  11. 11.0 11.1 11.2 11.3 11.4 11.5 11.6 11.7 11.8 Amazon Artificial General Intelligence. Amazon Nova 2: Multimodal Reasoning and Generation Models — Technical Report and Model Card. Amazon Science, 16 февраля 2026. https://www.amazon.science/publications/amazon-nova-2-multimodal-reasoning-and-generation-models
  12. 12.0 12.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  13. 13.0 13.1 13.2 13.3 13.4 AlphaXiv / Amazon Science. The Amazon Nova Family of Models: Model Architecture and Training Methodology. alphaxiv.org, 2025. https://www.alphaxiv.org/overview/2506.12103v1
  14. 14.0 14.1 Rombach, R. et al. (2022). High‑Resolution Image Synthesis with Latent Diffusion Models. CVPR. https://arxiv.org/abs/2112.10752
  15. 15.0 15.1 15.2 15.3 AWS. Amazon Nova Sonic — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-sonic/overview.html
  16. LinkedIn (инженеры AWS). Announcing Managed Tiered Checkpointing. linkedin.com, декабрь 2025. https://www.linkedin.com/posts/hajamaideen_announcing-managed-tiered-checkpointing-for-activity-7402077620147798016-njZo
  17. 17.0 17.1 17.2 AWS. Announcing Amazon Nova customization in Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/aws/announcing-amazon-nova-customization-in-amazon-sagemaker-ai/
  18. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). NeurIPS. https://arxiv.org/abs/2203.02155
  19. 19.0 19.1 Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS. https://arxiv.org/abs/2305.18290
  20. 20.0 20.1 20.2 20.3 20.4 AWS. Amazon Nova Micro, Lite, Pro, and Premier — AWS AI Service Cards. docs.aws.amazon.com. https://docs.aws.amazon.com/ai/responsible-ai/nova-micro-lite-pro/overview.html
  21. HKU SPACE AI Hub. Benchmarking Amazon Nova: A comprehensive analysis through MT‑Bench and Arena‑Hard‑Auto. aihub.hkuspace.hku.hk, 2025. https://aihub.hkuspace.hku.hk/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  22. 22.0 22.1 22.2 22.3 22.4 22.5 AWS Machine Learning Blog. Benchmarking Amazon Nova: A Comprehensive Analysis Through MT‑Bench and Arena‑Hard. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/benchmarking-amazon-nova-a-comprehensive-analysis-through-mt-bench-and-arena-hard-auto/
  23. 23.0 23.1 AWS Machine Learning Blog. Real‑world reasoning: How Amazon Nova Lite 2.0 handles complex customer support scenarios. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/real-world-reasoning-how-amazon-nova-lite-2-0-handles-complex-customer-support-scenarios/
  24. AWS Documentation. Continued Pre‑Training and Mid‑Training — Amazon Nova. docs.aws.amazon.com. https://docs.aws.amazon.com/nova/latest/nova2-userguide/nova-forge-cpt.html
  25. AWS Documentation. Continued Pre‑Training and Mid‑Training. Amazon SageMaker Developer Guide. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-forge-cpt.html
  26. Hu, E.J. et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  27. 27.0 27.1 AWS Documentation. Reinforcement Fine‑Tuning (RFT) with Amazon Nova models. Amazon SageMaker Documentation. https://docs.aws.amazon.com/sagemaker/latest/dg/nova-reinforcement-fine-tuning.html
  28. AWS Machine Learning Blog. Natural language‑based database analytics with Amazon Nova. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/natural-language-based-database-analytics-with-amazon-nova/
  29. AWS Machine Learning Blog. Evaluating generative AI models with Amazon Nova LLM‑as‑a‑judge on Amazon SageMaker AI. aws.amazon.com, 2025. https://aws.amazon.com/blogs/machine-learning/evaluating-generative-ai-models-with-amazon-nova-llm-as-a-judge-on-amazon-sagemaker-ai/