GPT (OpenAI) (BN)
GPT (Generative Pre-trained Transformer) — এটি OpenAI কোম্পানির তৈরি বৃহৎ ভাষা মডেলের (LLM) একটি পরিবার। GPT মডেলগুলো transformer আর্কিটেকচারের উপর নির্মিত এবং জেনারেটিভ প্রি-ট্রেনিং প্যারাডাইম অনুসরণ করে: প্রথম ধাপে মডেলটি কোনো সুস্পষ্ট লেবেল ছাড়াই বিশাল টেক্সট কর্পাসে প্রশিক্ষিত হয়, এবং পরে নির্দিষ্ট কাজের জন্য fine-tuning করা যায়। পরবর্তী প্রজন্মের জন্য (GPT‑5 থেকে শুরু করে) OpenAI unified system (একীভূত সিস্টেম) শব্দবন্ধটিও ব্যবহার করে, কারণ পণ্যটি দ্রুত উত্তর মোড, গভীর reasoning মোড এবং একটি রাউটার একত্রিত করে[1]।
নামকরণ
GPT সংক্ষিপ্ত রূপটির পূর্ণ অর্থ হলো Generative Pre-trained Transformer (জেনারেটিভ প্রি-ট্রেইনড ট্রান্সফর্মার)।
- Generative (জেনারেটিভ): এর অর্থ হলো মডেলটি নতুন কনটেন্ট, যেমন টেক্সট, তৈরি (generate) করতে সক্ষম।
- Pre-trained (প্রি-ট্রেইনড): এটি নির্দেশ করে যে মডেলটি একটি বিশাল ডেটাসেটে (যেমন ইন্টারনেটের টেক্সট) প্রাথমিক প্রশিক্ষণের বিস্তৃত ধাপের মধ্য দিয়ে যায়। প্রি-ট্রেনিংয়ের পরে মডেলটিকে প্রায়ই আরও নির্দিষ্ট কাজ সম্পাদনের জন্য অতিরিক্তভাবে fine-tuned করা যায়।
- Transformer (ট্রান্সফর্মার): এটি একটি নির্দিষ্ট নিউরাল নেটওয়ার্ক আর্কিটেকচারের নাম, যা GPT এবং অন্যান্য অনেক আধুনিক AI মডেলের ভিত্তিতে থাকা মূল উদ্ভাবন।
GPT-এর মূল বৈশিষ্ট্য হলো প্রশিক্ষণ অটোরিগ্রেসিভ পদ্ধতিতে হয় — মডেলটি পূর্ববর্তী প্রসঙ্গের ভিত্তিতে পরবর্তী token পূর্বাভাস দেয়। অর্থাৎ মডেলটি পূর্ববর্তী token-এর ক্রম জেনে পরবর্তী token-এর সম্ভাবনা সর্বাধিক করতে শেখে। প্রশিক্ষণের সময় পরবর্তী উপাদানের পূর্বাভাসের ত্রুটি ন্যূনতম করা হয়, যা উচ্চ সংগতি ও সংযুক্তিসম্পন্ন টেক্সট তৈরি করতে সক্ষম করে।
GPT-তে টেক্সট জেনারেশন প্রক্রিয়া
GPT মডেল নিম্নলিখিত পুনরাবৃত্তিমূলক পদ্ধতিতে একটি করে token ক্রমানুসারে টেক্সট তৈরি করে:
- একটি প্রাথমিক টেক্সট ক্রম (prompt, seed text) ইনপুট হিসেবে গ্রহণ করে।
- টেক্সটের পরবর্তী উপাদানের জন্য শব্দভান্ডারের সমস্ত token-এর উপর সম্ভাবনামূলক বিতরণ গণনা করে।
- পরবর্তী token নির্বাচন করে:
- সর্বোচ্চ সম্ভাবনার ভিত্তিতে (greedy নির্বাচন), অথবা
- স্টোকাস্টিক sampling পদ্ধতিতে (sampling), অথবা
- বিশেষ ফিল্টারিং কৌশল ব্যবহার করে (top-k, top-p)।
- নির্বাচিত token বর্তমান ক্রমে যুক্ত করে।
- আপডেট করা ক্রম আবার পরবর্তী token পূর্বাভাসের জন্য মডেলে ইনপুট হিসেবে দেওয়া হয়।
Transformer আর্কিটেকচার: টেক্সট প্রক্রিয়াকরণ
পরবর্তী token পূর্বাভাসের জন্য transformer-এর মধ্যে ডেটা প্রক্রিয়াকরণে কয়েকটি মূল ধাপ রয়েছে:
- Tokenization (টোকেনাইজেশন)। ইনপুট টেক্সটকে token-এ বিভক্ত করা হয় — টেক্সটের ছোট একক যা শব্দ, শব্দের অংশ বা বিরাম চিহ্ন হতে পারে। উদাহরণস্বরূপ, GPT-3 মডেলে শব্দভান্ডারে প্রায় ৫০,২৫৭টি token রয়েছে।
- Token Embedding (এমবেডিং)। প্রতিটি token-কে embedding ম্যাট্রিক্স (W_E) ব্যবহার করে নির্দিষ্ট দৈর্ঘ্যের একটি ভেক্টরে রূপান্তরিত করা হয়। ভেক্টরগুলো token-এর অর্থ এনকোড করে: অর্থগতভাবে কাছাকাছি token-গুলো বহুমাত্রিক স্থানে পাশাপাশি অবস্থান করে। GPT-3 মডেলে embedding-এর মাত্রা হলো ১২,২৮৮।
- Transformer স্তরে প্রক্রিয়াকরণ।
- Attention Blocks (অ্যাটেনশন ব্লক): প্রতিটি token ক্রমের অন্য token-গুলোর সাথে মিথস্ক্রিয়া করে। attention মেকানিজম প্রসঙ্গ বিবেচনা করতে এবং শব্দের অর্থ সঠিকভাবে ব্যাখ্যা করতে সক্ষম করে।
- Feed-Forward Layers (ফিড-ফরওয়ার্ড স্তর): attention-এর পরে প্রতিটি token আলাদাভাবে নন-লিনিয়ার অ্যাক্টিভেশনসহ দ্বিস্তরীয় নিউরাল নেটওয়ার্কের মধ্য দিয়ে প্রক্রিয়াকৃত হয়।
- বিপরীত রূপান্তর এবং Softmax। সমস্ত স্তর প্রক্রিয়াকরণের পরে প্রক্রিয়াকৃত ভেক্টরটি ম্যাট্রিক্স (W_U) ব্যবহার করে token স্থানে ফিরিয়ে রূপান্তরিত করা হয়, যা প্রায়ই W_E-এর ট্রান্সপোজড সংস্করণ। ফলস্বরূপ লজিট ভেক্টরটি সমস্ত token-এর উপর সম্ভাবনামূলক বিতরণ পেতে Softmax ফাংশন দিয়ে স্বাভাবিক করা হয়।
- পরবর্তী Token নির্বাচন (Sampling)। সম্ভাবনার বিতরণের উপর ভিত্তি করে পরবর্তী token নির্বাচন করা হয়। temperature প্যারামিটার নির্বাচনের এলোমেলোতা নিয়ন্ত্রণ করে: temperature ০ হলে সবচেয়ে সম্ভাবনাময় token নির্বাচিত হয়, উচ্চ temperature-এ কম সম্ভাবনাময় বিকল্প নির্বাচনের সম্ভাবনা বৃদ্ধি পায়, যা টেক্সটে বেশি বৈচিত্র্য আনে।
GPT মডেলসমূহ
- GPT-1 (২০১৮): পরিবারের প্রথম মডেল; ১২-স্তরের decoder-only transformer; দুই ধাপে প্রশিক্ষণ (প্রি-ট্রেনিং + NLP কাজে fine-tuning)।
- GPT-2 (২০১৯): ১৫০ কোটি প্যারামিটার; WebText কর্পাসে প্রশিক্ষণ; প্রথমবার দীর্ঘ সংগত টেক্সট তৈরিতে সক্ষম; zero-shot জেনারেশনের মান উন্নত। ২০১৯ সালের ১৪ ফেব্রুয়ারি ঘোষণা করা হয়, নিরাপত্তাজনিত কারণে পূর্ণ সংস্করণ (১৫০ কোটি) ২০১৯ সালের ৫ নভেম্বর প্রকাশিত হয়।
- GPT-3 (২০২০): ১৭৫ বিলিয়ন প্যারামিটার; Common Crawl, Books, Wikipedia-এর সমন্বয়ে বৃহৎ পরিসরে প্রশিক্ষণ; few-shot ও zero-shot সক্ষমতার শক্তিশালী বিকাশ।
- GPT-3.5 (২০২২): GPT-3 ও GPT-4-এর মধ্যবর্তী সংস্করণ; text-davinci-003 ও gpt-3.5-turbo সংস্করণে মানব প্রতিক্রিয়াভিত্তিক শিক্ষণ (RLHF) প্রয়োগে উন্নত নির্দেশ অনুসরণ; প্রাথমিক সংস্করণে সর্বোচ্চ ৪,০৯৬ token এবং পরবর্তী সংস্করণে (gpt-3.5-turbo-16k ও আপডেটেড gpt-3.5-turbo) সর্বোচ্চ ১৬,৩৮৫ token-এর প্রসঙ্গ উইন্ডো।
- GPT-4 (২০২৩): টেক্সট ও গ্রাফিক্যাল ইনপুট সহ মাল্টিমোডাল মডেল (ছবি সমর্থন টেক্সট লঞ্চের পরে পরে চালু হয়েছিল); বেস সংস্করণে ৮,১৯২ token ও GPT-4-32k ভেরিয়েন্টে ৩২,৭৬৮ token-এর প্রসঙ্গ উইন্ডো; নির্ভুলতা, স্থিতিশীলতা ও যুক্তিতর্কের মান উল্লেখযোগ্যভাবে বৃদ্ধি।
- GPT-4 Turbo (২০২৩): GPT-4-এর অপ্টিমাইজড সংস্করণ; সর্বোচ্চ ১২৮,০০০ token-এর বর্ধিত প্রসঙ্গ উইন্ডো; কম বিলম্ব ও কম পরিচালন ব্যয়।
- GPT-4o (২০২৪): একীভূত নিউরাল নেটওয়ার্ক আর্কিটেকচারসহ পরবর্তী প্রজন্মের মাল্টিমোডাল মডেল (টেক্সট, ছবি, অডিও); অত্যন্ত উচ্চ গতি ও নির্ভুলতার সাড়া; ১২৮,০০০ token-এর প্রসঙ্গ উইন্ডো।
- GPT-4.5 (২০২৫): গবেষণামূলক প্রিভিউ (research preview); OpenAI-এর system card-এ উল্লেখ করা হয়েছে যে মডেলটি «builds on GPT-4o»[2][3]; উন্নত ব্যবহারকারীর অনুরোধ বোঝার ক্ষমতা, ত্রুটির সংখ্যা হ্রাস; ১২৮,০০০ token-এর প্রসঙ্গ উইন্ডো। API-তে
gpt-4.5-previewমডেলটি ২০২৫ সালের ১৪ এপ্রিল deprecated ঘোষণা করা হয় এবং ২০২৫ সালের ১৪ জুলাই বন্ধ করা হয়[4]। - GPT-4.1 (২০২৫): সর্বোচ্চ ১ মিলিয়ন token-এর প্রসঙ্গ উইন্ডোসহ GPT-4 পরিবারের উন্নত সংস্করণ; ইনপুট হিসেবে টেক্সট ও ছবি গ্রহণ করে, আউটপুট হিসেবে টেক্সট দেয়[5]। তিনটি ভেরিয়েন্টে একযোগে প্রকাশিত: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano।
- GPT-5 (২০২৫): দ্রুত উত্তর ও গভীর reasoning মোডসহ একীভূত সিস্টেম; প্রায় ৪০০,০০০ token-এর প্রসঙ্গ উইন্ডো; তথ্যনির্ভর কাজে hallucination উল্লেখযোগ্যভাবে হ্রাস।
- GPT-5.1 (২০২৫): অভিযোজনযোগ্য reasoning, coding ও long-context retention-এ উন্নতি।
- GPT-5.2 (২০২৫): পেশাদার কাজের উপর জোর; frontier কাজের জন্য Pro মোড; GPT-5.2-এর ভিত্তিতে এজেন্টিক GPT-5.2-Codex প্রকাশিত।
- GPT-5.3-Codex (২০২৬): coding সক্ষমতা ও reasoning একত্রিত করা এজেন্টিক coding মডেল; পূর্ববর্তীদের চেয়ে ২৫% দ্রুত।
- GPT-5.3 Instant (২০২৬): ChatGPT-এর সর্বাধিক ব্যবহৃত কথোপকথন মডেলের আপডেট; ২০২৬ সালের ৩ মার্চ প্রকাশিত। তথ্যগত নির্ভুলতা, ওয়েব অনুসন্ধানের মান, কথোপকথনের স্বাচ্ছন্দ্য উন্নত হয়েছে এবং অপ্রয়োজনীয় প্রত্যাখ্যান ও অতিরিক্ত সতর্কতার সংখ্যা হ্রাস পেয়েছে। API-তে
gpt-5.3-chat-latestহিসেবে পাওয়া যায়[6]। - GPT-5.4 (২০২৬): ২০২৬ সালের ৫ মার্চ উপস্থাপিত পেশাদার কাজের জন্য OpenAI-এর frontier মডেল; native computer-use capabilities সহ OpenAI-এর প্রথম general-purpose মডেল। API-তে
gpt-5.4general-purpose ও বেশিরভাগ coding কাজের জন্য ডিফল্ট মডেল হিসেবে সুপারিশ করা হয়েছে[7][8]।
GPT-1
প্রথম মডেল, GPT-1, OpenAI কোম্পানি ২০১৮ সালে \"Improving Language Understanding by Generative Pre-Training\" গবেষণাপত্রে উপস্থাপন করেছিল। মডেলটি একটি ১২-স্তরের decoder-only transformer[9] ছিল এবং transformer আর্কিটেকচারের উপর ভিত্তি করে নির্মিত হয়েছিল। GPT-1-এর প্রশিক্ষণ দুটি ধাপে হয়েছিল: অনিয়ন্ত্রিত জেনারেটিভ প্রি-ট্রেনিং (pre-training) ধাপ, এরপর নিয়ন্ত্রিত fine-tuning ধাপ।
প্রি-ট্রেনিং ধাপে মডেলটি বিভিন্ন ঘরানার ৭,০০০-এরও বেশি অপ্রকাশিত বই সম্বলিত BookCorpus কর্পাসে প্রশিক্ষিত হয়েছিল। এই কর্পাসের বৈশিষ্ট্য ছিল দীর্ঘ অবিচ্ছিন্ন টেক্সট অংশের উপস্থিতি, যা মডেলের জটিল ও দীর্ঘ টেক্সটগত নির্ভরতা প্রক্রিয়াকরণের সক্ষমতা গঠনের জন্য অত্যন্ত গুরুত্বপূর্ণ ছিল।
Fine-tuning ধাপে মডেলটি বিশেষায়িত প্রাকৃতিক ভাষা প্রক্রিয়াকরণ কাজ সমাধানে অভিযোজিত হয়েছিল, যার মধ্যে ছিল:
- প্রশ্নের উত্তর (Question Answering, QA) — দেওয়া টেক্সট প্রসঙ্গের ভিত্তিতে সঠিক উত্তর তৈরি;
- টেক্সটুয়াল ইমপ্লিকেশন শনাক্তকরণ (Natural Language Inference, NLI) — দুটি টেক্সটের মধ্যে যৌক্তিক সম্পর্ক নির্ধারণ: ইমপ্লিকেশন, বিরোধিতা বা নিরপেক্ষতা;
- অর্থগত সাদৃশ্য মূল্যায়ন (Semantic Textual Similarity) — দুটি টেক্সট ক্রমের মধ্যে অর্থগত নৈকট্যের মাত্রা পরিমাপ।
এই পদ্ধতির মাধ্যমে GPT-1 টেক্সট বোঝার জন্য বেশ কিছু আদর্শ benchmark-এ পূর্ববর্তী মডেলগুলোর তুলনায় উল্লেখযোগ্য শ্রেষ্ঠত্ব প্রদর্শন করেছিল।
GPT-1-এর বিকাশ প্রাকৃতিক ভাষা প্রক্রিয়াকরণে (NLP) বেশ কিছু মূল অর্জন ও আবিষ্কার প্রদর্শন করেছিল:
- জেনারেটিভ প্রি-ট্রেনিংয়ের কার্যকারিতা। পরীক্ষামূলকভাবে নিশ্চিত হয়েছিল যে বৃহৎ অচিহ্নিত টেক্সট কর্পাসে প্রি-ট্রেনিং মডেলকে সার্বজনীন ভাষাগত উপস্থাপনা অর্জন করতে সক্ষম করে, যা মৌলিক আর্কিটেকচারাল পরিবর্তন ছাড়াই বিভিন্ন ব্যবহারিক কাজে পরবর্তীতে প্রয়োগযোগ্য।
- Transformer আর্কিটেকচারের সর্বজনীনতা। বহুস্তরীয় decoder transformer ব্যবহার মডেলটিকে টেক্সটে দীর্ঘমেয়াদী নির্ভরতা সফলভাবে প্রক্রিয়া করতে সক্ষম করেছিল, যা আগে রিকারেন্ট নিউরাল নেটওয়ার্কভিত্তিক মডেলগুলোর জন্য কঠিন ছিল।
- ডেটা লেবেলিংয়ের উপর নির্ভরতা হ্রাস। গবেষণাটি নিশ্চিত করেছিল যে অচিহ্নিত ডেটায় বৃহৎ পরিসরে প্রি-ট্রেনিং লক্ষ্য কাজে উচ্চ মান অর্জনের জন্য প্রয়োজনীয় চিহ্নিত ডেটার পরিমাণ উল্লেখযোগ্যভাবে হ্রাস করতে পারে।
- পরবর্তী বিকাশের ভিত্তি। GPT-1-এর ফলাফল GPT মডেল পরিবারের পরবর্তী সংস্করণের (GPT-2, GPT-3 এবং তার পরেও) ধারণাগত ও প্রযুক্তিগত ভিত্তি স্থাপন করেছিল।
GPT-2
GPT-2 মডেলটি OpenAI কোম্পানি ২০১৯ সালের ১৪ ফেব্রুয়ারি ঘোষণা করেছিল। এটি আকারে তার পূর্বসূরিকে উল্লেখযোগ্যভাবে ছাড়িয়ে গিয়েছিল: মডেলের পূর্ণ সংস্করণে প্রায় ১৫০ কোটি প্যারামিটার ছিল। নিরাপত্তাজনিত কারণে OpenAI প্রথমে শুধুমাত্র হ্রাসকৃত ভেরিয়েন্টগুলো প্রকাশ করেছিল; পূর্ণ সংস্করণ (১৫০ কোটি প্যারামিটার) ২০১৯ সালের ৫ নভেম্বর প্রকাশিত হয়েছিল। BookCorpus (~৫ জিবি) কর্পাসে প্রশিক্ষিত GPT-1-এর বিপরীতে, GPT-2 উচ্চ মানের ইন্টারনেট উৎস থেকে টেক্সট ডেটা সম্বলিত বিশেষভাবে সংগৃহীত WebText কর্পাসে (প্রায় ৪০ জিবি) প্রশিক্ষিত হয়েছিল। মডেলের আকার ও প্রশিক্ষণ ডেটার পরিমাণ উভয়ই বৃদ্ধির ফলে GPT-2 টেক্সট জেনারেশনের মান উল্লেখযোগ্যভাবে বৃদ্ধি করেছিল: এটি অর্থবহ নিবন্ধ, গল্প এবং এমনকি সংগত কথাসাহিত্যের অংশ তৈরি করার সক্ষমতা প্রদর্শন করেছিল।
GPT-2-তে GPT-1-এর মতো অটোরিগ্রেসিভ decoder transformer আর্কিটেকচার ব্যবহার করা হয়েছিল, কোনো উল্লেখযোগ্য পরিবর্তন ছাড়াই। মডেলটিতে ৪৮টি self-attention স্তর ছিল, hidden state-এর আকার ছিল ১৬০০ এবং প্রায় ১৫০ কোটি প্যারামিটার অন্তর্ভুক্ত ছিল। attention head-এর সংখ্যা ছিল ২৫ (GPT-1 থেকে উত্তরাধিকারসূত্রে প্রাপ্ত প্রতি head-এ ৬৪ আকার বজায় রেখে: ১৬০০ ÷ ৬৪ = ২৫)। প্রশিক্ষণ masked attention মেকানিজম ব্যবহার করে পূর্ববর্তী প্রসঙ্গের ভিত্তিতে পরবর্তী token পূর্বাভাসের কাজে পরিচালিত হয়েছিল।
GPT-2-এর প্রধান পার্থক্যগুলোর একটি ছিল যে মডেলটি প্রথমবার zero-shot learning-এ উচ্চ কার্যকারিতা প্রদর্শন করেছিল — এই কাজগুলোর জন্য কোনো সুস্পষ্ট fine-tuning ছাড়াই নতুন সমস্যা সমাধানের সক্ষমতা। মডেলটি সাধারণ টেক্সটের বৃহৎ কর্পাসে প্রশিক্ষিত হয়েছিল এবং নির্দিষ্ট কাজের ডেটায় বিশেষায়িত প্রশিক্ষণের মধ্য দিয়ে যায়নি। মূল্যায়ন zero-shot মোডে পরিচালিত হয়েছিল, যেখানে মডেলটি শুধুমাত্র প্রি-ট্রেনিং প্রক্রিয়ায় অর্জিত জ্ঞানের ভিত্তিতে কাজ সম্পাদন করেছিল। বেশ কিছু ভাষা মডেলিং কাজে GPT-2 বিশেষায়িত dataset-এ (যেমন উইকিপিডিয়া, সংবাদ, বই) বিশেষভাবে প্রশিক্ষিত মডেলের ফলাফলের সমকক্ষ বা তার চেয়ে ভালো মান অর্জন করেছিল।
GPT-3
GPT-3 মডেলটি OpenAI কোম্পানি ২০২০ সালের জুন মাসে উপস্থাপন করেছিল (arXiv-এ নিবন্ধ ২০২০ সালের ২৮ মে প্রকাশিত হয়, API-তে বিটা অ্যাক্সেস ২০২০ সালের ১১ জুন খোলা হয়)। এটি GPT-2-এর পরে জেনারেটিভ transformer-এর বিকাশে পরবর্তী পদক্ষেপ হয়েছিল এবং আর্কিটেকচারকে ১৭৫ বিলিয়ন প্যারামিটারে স্কেল করার মাধ্যমে আলাদা হয়েছিল, যা তখনকার সময়ে সবচেয়ে বড় ভাষা মডেল করে তুলেছিল।
GPT-3-এর আর্কিটেকচার মূলত আগের মতোই ছিল — কোনো মৌলিক পরিবর্তন ছাড়া বহুস্তরীয় অটোরিগ্রেসিভ decoder transformer। পারফরম্যান্সের মূল উন্নতি স্তরের সংখ্যা, hidden স্তরের প্রস্থ ও প্রশিক্ষণের পরিধি বৃদ্ধির মাধ্যমে অর্জিত হয়েছিল। মডেলটি Common Crawl, WebText2, Books1, Books2 ও উইকিপিডিয়া সহ বেশ কিছু বড় টেক্সট কর্পাসের সমন্বয়ে প্রশিক্ষিত হয়েছিল। ডেটার মোট পরিমাণ ছিল প্রায় ৫৭০ জিবি বা তার বেশি (৫৭০ জিবি ফিল্টার করা Common Crawl-এর অংশে পড়ে, যা প্রশিক্ষণ মিশ্রণে প্রাধান্য পায়)।
GPT-3-এর অন্যতম প্রধান বৈশিষ্ট্য ছিল এর few-shot learning ও zero-shot learning সক্ষমতা: মডেলটি টেক্সট অনুরোধে মাত্র কয়েকটি উদাহরণের উপর ভিত্তি করে বা কোনো উদাহরণ ছাড়াই অনুবাদ, সারসংক্ষেপ, প্রশ্নের উত্তর, রচনা লেখা এমনকি প্রোগ্রামিং সহ প্রাকৃতিক ভাষা প্রক্রিয়াকরণের বিস্তৃত কাজ সম্পাদন করতে পারত।
GPT-3.5
GPT-3.5 মডেলটি OpenAI কোম্পানি ২০২২ সালের শেষ দিকে GPT পরিবারের বিবর্তনীয় বিকাশের ধারায় উপস্থাপন করেছিল। এটি GPT-3-এ ব্যবহৃত স্কেলড অটোরিগ্রেসিভ decoder transformer আর্কিটেকচারের উপর ভিত্তি করে নির্মিত হয়েছিল, টেক্সট জেনারেশনের মান, প্রসঙ্গ প্রক্রিয়াকরণ ও জটিল নির্দেশ অনুসরণের সক্ষমতায় উন্নতি সহ। GPT-3.5-এর প্যারামিটারের সঠিক সংখ্যা আনুষ্ঠানিকভাবে প্রকাশ করা হয়নি; অনুমান করা হয় যে davinci সংস্করণগুলো আকারে GPT-3-এর (১৭৫ বিলিয়ন) সমতুল্য, তবে gpt-3.5-turbo সংস্করণের সঠিক প্যারামিটার অজানা।
GPT-3.5-এর প্রশিক্ষণে text-davinci-003 ও gpt-3.5-turbo সংস্করণে মানব প্রতিক্রিয়াভিত্তিক শক্তিবর্ধন শিক্ষণ (Reinforcement Learning from Human Feedback, RLHF) পদ্ধতির বিস্তৃত ব্যবহার অন্তর্ভুক্ত ছিল। এক্ষেত্রে আগের সংস্করণ text-davinci-002 RLHF নয়, supervised fine-tuning (SFT) ব্যবহার করে প্রশিক্ষিত হয়েছিল। মডেলটি Common Crawl, Books, WebText ও অন্যান্য উচ্চমানের উৎস সহ বিস্তৃত টেক্সট কর্পাসে প্রশিক্ষিত হয়েছিল। প্রাথমিক জনপ্রিয় সংস্করণে (gpt-3.5-turbo) প্রসঙ্গ উইন্ডো ছিল ৪,০৯৬ token; পরবর্তীতে OpenAI সর্বোচ্চ ১৬,৩৮৫ token-এর প্রসঙ্গসহ আপডেটেড সংস্করণ প্রকাশ করেছিল[10]।
ব্যবহারিকভাবে GPT-3.5 প্রাকৃতিক ভাষা প্রক্রিয়াকরণের বিস্তৃত কাজ সমাধানে অভিযোজিত হয়েছিল, যেমন:
- সংগত ও যৌক্তিক টেক্সট জেনারেশন;
- প্রশ্নের উত্তর (QA) ও প্রসঙ্গ বোঝা;
- বহুধাপী নির্দেশ অনুসরণ;
- সংলাপে দীর্ঘমেয়াদী প্রসঙ্গ বজায় রাখার উন্নত ক্ষমতা।
GPT-3.5-এর উপর ভিত্তি করে বিভিন্ন উদ্দেশ্যে বেশ কিছু মূল সংস্করণ প্রকাশিত হয়েছিল:
- text-davinci-002 — GPT-3.5-এর উপর ভিত্তি করে প্রথম সর্বসাধারণের জন্য উপলব্ধ মডেল, জেনারেশন ও নির্দেশ অনুসরণের জন্য অপ্টিমাইজড (SFT দিয়ে প্রশিক্ষিত)।
- text-davinci-003 — আরও উন্নত যুক্তিতর্ক ও জটিল টেক্সট জেনারেশন সক্ষমতাসহ উন্নত সংস্করণ (RLHF প্রয়োগ করে প্রশিক্ষিত)।
- gpt-3.5-turbo — GPT-3.5-এর সবচেয়ে কার্যকর ও সাশ্রয়ী সংস্করণ, ২০২২ সালের শেষ থেকে ChatGPT সেবায় ব্যবহৃত।
GPT-4
GPT-4 মডেলটি OpenAI কোম্পানি ২০২৩ সালের ১৪ মার্চ "GPT-4 Technical Report\" গবেষণাপত্রে উপস্থাপন করেছিল। এটি ভাষা মডেল পরিবারের বিকাশের পরবর্তী ধাপ হয়েছিল, টেক্সট বোঝার ক্ষেত্রে, অর্থবহ ও সৃজনশীল উত্তর জেনারেশনে এবং মাল্টিমোডাল ডেটা প্রক্রিয়াকরণে উল্লেখযোগ্য উন্নতি নিয়ে। মডেলের প্যারামিটারের সঠিক সংখ্যা ও আর্কিটেকচারাল বিবরণ আনুষ্ঠানিকভাবে প্রকাশ করা হয়নি — GPT-4-এর টেকনিক্যাল রিপোর্ট সরাসরি নির্দেশ করে যে আর্কিটেকচার, মডেলের আকার, হার্ডওয়্যার, প্রশিক্ষণের গণনাগত ব্যয় ও dataset নির্মাণ সংক্রান্ত তথ্য প্রকাশ করা হচ্ছে না[11]। অনানুষ্ঠানিক বাহ্যিক মূল্যায়ন অনুযায়ী, GPT-4 Mixture of Experts (MoE) পদ্ধতি ব্যবহার করে প্রায় ~১.৮ ট্রিলিয়ন প্যারামিটারের মোট স্কেল থাকতে পারে, তবে OpenAI এই সংখ্যাগুলো আনুষ্ঠানিকভাবে নিশ্চিত বা অস্বীকার করেনি[12]।
GPT-4 একটি মাল্টিমোডাল মডেল যা ইনপুট হিসেবে টেক্সট ও ছবি উভয়ই গ্রহণ করতে সক্ষম। উল্লেখ্য, ২০২৩ সালের মার্চে প্রাথমিক লঞ্চের সময় শুধুমাত্র টেক্সট মোডালিটি উপলব্ধ ছিল; ছবি ইনপুটের সমর্থন পরবর্তীতে চালু করা হয়েছিল। বেস সংস্করণে প্রসঙ্গ উইন্ডো ছিল ৮,১৯২ token ও GPT-4-32k ভেরিয়েন্টে ৩২,৭৬৮ token। মডেলটি RLHF পদ্ধতি (মানব প্রতিক্রিয়াভিত্তিক শক্তিবর্ধন শিক্ষণ) ব্যবহার করেছিল।
GPT-4-এর প্রশিক্ষণ বৃহৎ পরিসরের টেক্সটুয়াল ও মাল্টিমোডাল কর্পাসের সমন্বয়ে পরিচালিত হয়েছিল। প্রশিক্ষণ ডেটা, হার্ডওয়্যার ও পদ্ধতির নির্দিষ্ট বিবরণ OpenAI-এর আনুষ্ঠানিক প্রকাশনায় উন্মুক্ত করা হয় না।
প্রশিক্ষণ বেশ কিছু ধাপে হয়েছিল:
- টেক্সট ও ছবিতে বৃহৎ পরিসরে অনিয়ন্ত্রিত প্রি-ট্রেনিং,
- বিশেষায়িত কাজে নিয়ন্ত্রিত fine-tuning (supervised fine-tuning),
- নির্ভরযোগ্যতা, নিরাপত্তা ও নির্দেশ ব্যাখ্যার মান উন্নয়নের জন্য মানব প্রতিক্রিয়াভিত্তিক শক্তিবর্ধন শিক্ষণের (RLHF) চূড়ান্ত ধাপ।
GPT-4-এর উপর ভিত্তি করে বেশ কিছু মূল সংস্করণ প্রকাশিত হয়েছিল:
- GPT-4 (মার্চ ২০২৩): টেক্সট ইনপুট সমর্থনসহ বেস সংস্করণ (ছবি সমর্থন পরবর্তীতে যোগ করা হয়েছিল); ৮,১৯২ token-এর প্রসঙ্গ উইন্ডো; ৩২,৭৬৮ token-এর প্রসঙ্গসহ GPT-4-32k ভেরিয়েন্টও প্রকাশিত হয়েছিল।
- GPT-4 Turbo (নভেম্বর ২০২৩): ১২৮,০০০ token পর্যন্ত বর্ধিত প্রসঙ্গ উইন্ডোসহ GPT-4-এর অপ্টিমাইজড সংস্করণ[13]; হ্রাসকৃত গণনাগত ব্যয় ও ত্বরান্বিত জেনারেশন; function calling ও JSON আউটপুট মোডের সমর্থন।
- GPT-4o (মে ২০২৪): পরবর্তী প্রজন্মের মাল্টিমোডাল সংস্করণ; লঞ্চ ঘোষণায় এটিকে omni মডেল হিসেবে উপস্থাপন করা হয়েছিল, যা রিয়েল টাইমে টেক্সট, ছবি ও অডিও নিয়ে কাজ করতে সক্ষম (GPT-4 Turbo-এর বিপরীতে যেখানে বিভিন্ন মোডালিটি আলাদা মডিউল দ্বারা পরিষেবা প্রদান করত); এক্ষেত্রে বেসিক API মডেল
gpt-4o-কে text+image input, text output হিসেবে বর্ণনা করা হয়েছে; ১২৮,০০০ token-এর প্রসঙ্গ উইন্ডো। - GPT-4.5 (ফেব্রুয়ারি ২০২৫): গবেষণামূলক প্রিভিউ (research preview); OpenAI-এর system card-এ সরাসরি উল্লেখ করা হয়েছে যে মডেলটি «builds on GPT-4o»[3]; উন্নত জটিল টেক্সট জেনারেশন, নির্দেশ পালনে বর্ধিত নির্ভুলতা ও হ্রাসকৃত hallucination মাত্রা; ১২৮,০০০ token-এর প্রসঙ্গ উইন্ডো। এটিকে «chain-of-thought ছাড়া OpenAI-এর সর্বশেষ মডেল» (কোড নাম — Orion) হিসেবে বর্ণনা করা হয়েছিল[14]। API-তে
gpt-4.5-previewমডেলটি ২০২৫ সালের ১৪ এপ্রিল deprecated ঘোষণা করা হয় এবং ২০২৫ সালের ১৪ জুলাই বন্ধ করা হয়[4]। - GPT-4.1 (এপ্রিল ২০২৫): ১,০৪৭,৫৭৬ token পর্যন্ত প্রসঙ্গের আমূল সম্প্রসারণসহ স্থিতিশীল সংস্করণ; ইনপুট হিসেবে টেক্সট ও ছবি গ্রহণ করে, আউটপুট হিসেবে টেক্সট দেয়[15]; তিনটি ভেরিয়েন্টে একযোগে প্রকাশিত (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); প্রাথমিকভাবে শুধুমাত্র API-এর মাধ্যমে পাওয়া যেত, পরে ChatGPT-এ চালু করা হয়।
GPT-5
২০২৫ সালের ৭ আগস্ট OpenAI GPT‑5-কে তৎকালীন «সবচেয়ে স্মার্ট, দ্রুত ও উপকারী» মডেল হিসেবে উপস্থাপন করেছিল, built-in গভীর চিন্তাভাবনার (thinking) মোড ও ব্যবহারিক পরিস্থিতিতে মনোযোগ দিয়ে — লেখা, প্রোগ্রামিং, স্বাস্থ্য নিয়ে কাজ ও মাল্টিমোডাল বোঝাপড়া। GPT‑5 ধীরে ধীরে বেশিরভাগ অনুমোদিত ChatGPT ব্যবহারকারীদের জন্য ডিফল্ট মডেল হয়ে উঠেছিল, আগে ব্যবহৃত GPT‑4/4o ও o-সিরিজের মডেলগুলোকে সরিয়ে দিয়ে।[16]
GPT‑5 দুটি মূল কার্যকরী মোডসহ unified system হিসেবে বাস্তবায়িত হয়েছে: দৈনন্দিন অনুরোধের জন্য দ্রুত, সাশ্রয়ী উত্তর (প্রচলিতভাবে gpt‑5 main) এবং জটিল কাজের জন্য গভীর reasoning (প্রচলিতভাবে gpt‑5 thinking)। মোড নির্বাচন স্বয়ংক্রিয়ভাবে একটি রাউটার দ্বারা হয়, যা সংলাপের ধরন, অনুরোধের জটিলতা, টুলের প্রয়োজনীয়তা এবং ব্যবহারকারীর সুস্পষ্ট ইঙ্গিত (যেমন «think step by step» বা «analyze in depth») বিবেচনা করে। ChatGPT-তে ব্যবহারকারীর কাছে Auto / Instant / Thinking / Pro মোড পাওয়া যায়; mini ও nano ভেরিয়েন্টগুলো মূলত API মডেল, এবং mini ব্যবহারকারী পণ্যে সীমা শেষ হওয়ার পরে fallback হিসেবে ব্যবহার হতে পারে[17]।
প্রোগ্রামিং ইন্টারফেসের মাধ্যমে GPT‑5-এর বেশ কিছু আকার ও কনফিগারেশন পাওয়া যায়; OpenAI-এর ডকুমেন্টেশনে মূল ভেরিয়েন্ট হিসেবে gpt‑5, gpt‑5‑mini ও gpt‑5‑nano উল্লেখ করা হয়েছে (সবগুলো টেক্সট ও ভিজ্যুয়াল ডেটা সমর্থন করে)। API-তে GPT‑5 পরিবারের জন্য সর্বোচ্চ মোট প্রসঙ্গ উইন্ডো প্রায় ৪০০,০০০ token (ইনপুট ও reasoning/আউটপুটের জন্য বাজেট বিভক্ত), এক্ষেত্রে নির্দিষ্ট সীমা নির্বাচিত মডেল ভেরিয়েন্ট ও পণ্যের উপর নির্ভর করে ভিন্ন হতে পারে[18]।
বেশ কিছু ওয়েব অনুসন্ধান ও তথ্যনির্ভর benchmark-এ GPT‑5 GPT‑4o ও OpenAI-এর আগের «thinking» মডেলগুলোর তুলনায় hallucination ও ত্রুটির হার উল্লেখযোগ্যভাবে কম প্রদর্শন করে। OpenAI-এর আনুষ্ঠানিক ঘোষণায় GPT-4o-এর তুলনায় প্রায় ৪৫% ও thinking মোডে o3-এর তুলনায় প্রায় ৮০% ত্রুটি হ্রাসের অনুমান উপস্থাপন করা হয়েছিল — এই ফলাফলগুলো নির্দিষ্ট পরিস্থিতিতে পাওয়া গিয়েছিল: ওয়েব অনুসন্ধান সক্রিয় থাকা অবস্থায় ChatGPT উৎপাদন ট্র্যাফিকের প্রতিনিধিত্বকারী বেনামী prompt-এ[19]।
GPT-5.1
GPT-5.1 মডেলটি OpenAI কোম্পানি ২০২৫ সালের ১২ নভেম্বর মূল GPT-5-এর পরে প্রথম উল্লেখযোগ্য পুনরাবৃত্তি হিসেবে উপস্থাপন করেছিল, যা দৈনন্দিন মিথস্ক্রিয়া, কথোপকথনের মান ও অভিযোজনযোগ্যতা উন্নয়নে কেন্দ্রীভূত। মডেলটি দ্রুত মোড (GPT-5.1 Instant) ও গভীর reasoning (GPT-5.1 Thinking) সহ unified system বজায় রাখে, কিন্তু অভিযোজনযোগ্য মনোনিবেশ (adaptive reasoning) প্রবর্তন করে: মডেলটি অনুরোধের জটিলতার উপর নির্ভর করে গতিশীলভাবে গণনার পরিমাণ নির্ধারণ করে, যা সরল কাজে গুণমান না হারিয়ে এটিকে উল্লেখযোগ্যভাবে দ্রুত করে।
GPT-5.1-এর প্রশিক্ষণ GPT-5-এর উপর ভিত্তি করে একটি অতিরিক্ত পোস্ট-ট্রেনিং ধাপ সহ পরিচালিত হয়েছিল, যার মধ্যে ছিল বর্ধিত RLHF, স্বাভাবিকতার উপর মনোযোগ ও উত্তরের «শীতলতা» হ্রাস। API-তে প্রসঙ্গ উইন্ডো ৪০০,০০০ token, সর্বোচ্চ আউটপুট — ১২৮,০০০ token[20]। prompt ক্যাশিং ২৪ ঘণ্টা পর্যন্ত সম্প্রসারণের সমর্থন যোগ করা হয়েছে, যা বহুধাপী সংলাপে ব্যয় ও বিলম্ব উল্লেখযোগ্যভাবে হ্রাস করে[21]।
মূল বৈশিষ্ট্যসমূহ:
- GPT-5.1 Instant — দৈনন্দিন কাজের জন্য মূল মোড; প্রথমবার adaptive reasoning ব্যবহার করে নির্ধারণ করতে পারে কখন আরও জটিল অনুরোধে উত্তর দেওয়ার আগে «চিন্তা করা» উচিত[21]।
- GPT-5.1 Thinking — reasoning-এর জন্য অভিযোজনযোগ্য সময় বরাদ্দ; OpenAI-এর তথ্য অনুযায়ী, ChatGPT কাজের প্রতিনিধিত্বমূলক বিতরণে মডেলটি GPT-5 Thinking-এর তুলনায় সবচেয়ে সহজ কাজে প্রায় দ্বিগুণ দ্রুত এবং সবচেয়ে কঠিন কাজে প্রায় দ্বিগুণ ধীর[21]।
- উন্নত মাল্টিমোডালিটি (টেক্সট + vision)।
- adaptive reasoning ও extended prompt caching-এর সুবাদে coding ও agentic পরিস্থিতি এবং সহজ কাজে দক্ষতা উন্নত হয়েছে[22]।
GPT-5.2
GPT-5.2 মডেলটি ২০২৫ সালের ১১ ডিসেম্বর «পেশাদার কাজ ও শিক্ষার জন্য সিরিজের সবচেয়ে সক্ষম মডেল» হিসেবে প্রকাশিত হয়েছিল। এটি অর্থনৈতিক মূল্যের উপর জোর দিয়ে GPT-5.1-এর বিবর্তন: টেবিল, উপস্থাপনা, জটিল কোড, end-to-end কাজের জেনারেশন। Instant, Thinking ও নতুন Pro মোড (সর্বোচ্চ compute ও reasoning সময় প্রয়োজন এমন কাজের জন্য) সহ unified আর্কিটেকচার বজায় রাখে।
প্রশিক্ষণে আগস্ট ২০২৫-এর knowledge cutoff সহ আপডেটেড কর্পাস, উন্নত instruction-tuning ও বহুধাপী পরিস্থিতিতে ত্রুটি হ্রাসের জন্য RLHF অন্তর্ভুক্ত ছিল। প্রসঙ্গ — ৪০০K token (১২৮K max output)। মডেলটি পেশাদার পরিস্থিতিতে আরও নির্ভরযোগ্য হয়েছে, উন্নত তথ্যগত নির্ভুলতা ও টুল ব্যবহার সহ।
GPT-5.2-এর উপর ভিত্তি করে ২০২৫ সালের ১৮ ডিসেম্বর বিশেষায়িত GPT-5.2-Codex প্রকাশিত হয়েছিল — উন্নত context compaction, Windows সমর্থন, শক্তিশালী সাইবার নিরাপত্তা ও long-horizon reasoning (কয়েক ঘণ্টা পর্যন্ত কাজ) সহ একটি এজেন্টিক coding মডেল।
২০২৬ সালের ১৩ ফেব্রুয়ারি পর্যন্ত, কিছু পুরোনো মডেল ব্যবহার থেকে তুলে নেওয়ার পরে, GPT-5.2 সাময়িকভাবে ChatGPT-এর ডিফল্ট মডেল হয়ে উঠেছিল। তবে ২০২৬ সালের মার্চের শুরুতেই এই ভূমিকা GPT‑5.3 Instant ও GPT‑5.4-এ চলে যায়[17]।
GPT-5.3-Codex
GPT-5.3-Codex ২০২৬ সালের ৫ ফেব্রুয়ারি «আজ পর্যন্ত সবচেয়ে শক্তিশালী এজেন্টিক coding মডেল» হিসেবে উপস্থাপিত হয়েছিল। এটি GPT-5.2-Codex-এর frontier coding সক্ষমতা ও GPT-5.2-এর পেশাদার reasoning একটি একক মডেলে একত্রিত করেছে, যা পূর্ববর্তীদের চেয়ে ২৫% দ্রুত।
মডেলটি প্রায় যেকোনো ডেভেলপার কাজ সম্পাদন করতে সক্ষম: long-running workflow, গবেষণা, tool use, কোড কার্যকরণ, interactive steering (ব্যবহারকারী প্রসঙ্গ না হারিয়ে রিয়েল টাইমে হস্তক্ষেপ করতে পারেন)। মডেলের প্রাথমিক সংস্করণগুলো OpenAI দলের নিজস্ব প্রশিক্ষণ, deployment ও মূল্যায়নের ডিবাগিংয়ে ব্যবহৃত হয়েছিল।
২০২৬ সালের ৫ ফেব্রুয়ারি ঘোষণার সময়ের মূল ফলাফল: Terminal-Bench ~৭৭.৩%, OSWorld-Verified ~৬৪.৭%, SWE-Bench Pro ~৫৬.৮%। ২০২৬ সালের ৫ মার্চের GPT-5.4-এর পরবর্তী রিলিজে OpenAI নতুন API প্যারামিটার ব্যবহার করে মূল ছবির রেজোলিউশন সংরক্ষণ করে GPT-5.3-Codex-এর জন্য আপডেটেড OSWorld-Verified ফলাফল ৭৪.০% উপস্থাপন করেছিল[23][7]।
২০২৬ সালের ১২ ফেব্রুয়ারি OpenAI Cerebras-এর সাথে অংশীদারিত্বে GPT-5.3-Codex-Spark প্রকাশ করেছিল — রিয়েল টাইমের জন্য অপ্টিমাইজড একটি কম্প্যাক্ট ultra-fast সংস্করণ: প্রতি সেকেন্ডে ১০০০-এরও বেশি token, text-only, ১২৮K প্রসঙ্গ। শুরুতে এটি Codex-এ ChatGPT Pro ব্যবহারকারীদের ও অল্প সংখ্যক API design partner-দের জন্য rollout ছিল, সর্বসাধারণের জন্য উপলব্ধ API মডেল নয়[24]।
GPT-5.4
২০২৬ সালের ৫ মার্চ OpenAI পেশাদার কাজের জন্য নতুন frontier মডেল হিসেবে GPT‑5.4 উপস্থাপন করেছিল। GPT‑5.4 reasoning, coding ও agentic workflow-এ OpenAI-এর সর্বশেষ রিলিজের শক্তিশালী দিকগুলো একত্রিত করেছে এবং মূল লাইনআপে প্রথমবারের মতো built-in computer use সক্ষমতা পেয়েছে। একইসাথে OpenAI GPT‑5.4 Pro প্রকাশ করেছিল — সবচেয়ে জটিল কাজের জন্য বেশি গণনা ও দীর্ঘ reasoning ব্যবহার করা ভেরিয়েন্ট[7]।
API-তে gpt-5.4 মডেলটিকে general-purpose ও coding কাজের বিস্তৃত পরিসরের জন্য ডিফল্ট হিসেবে সুপারিশকৃত হিসেবে বর্ণনা করা হয়েছে; প্রসঙ্গ উইন্ডো ১,০৫০,০০০ token, সর্বোচ্চ আউটপুট — ১২৮,০০০ token। মডেলটি ইনপুট হিসেবে টেক্সট ও ছবি গ্রহণ করে এবং আউটপুট হিসেবে টেক্সট দেয়[8][25]।
ChatGPT-তে Auto মোড ২০২৬ সালের ৭ মার্চ পর্যন্ত স্বয়ংক্রিয়ভাবে GPT‑5.3 Instant ও GPT‑5.4 Thinking-এর মধ্যে স্যুইচ করে, তখন GPT‑5.4 Pro একটি পৃথক high-capability মোড হিসেবে পাওয়া যায়। লগইন করা ChatGPT ব্যবহারকারীদের জন্য GPT‑5.3 হলো ডিফল্ট মডেল[17]।
GPT মডেলের বিকাশ
| প্রজন্ম | প্রকাশের বছর | প্যারামিটার সংখ্যা | টেক্সট কর্পাসের আকার | মূল বৈশিষ্ট্যসমূহ |
|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 মিলিয়ন[26] | ≈৫ জিবি (BooksCorpus) | বৃহৎ কর্পাসে জেনারেটিভ প্রি-ট্রেনিং; দ্বিধাপী প্রশিক্ষণ (pre-training + fine-tuning) |
| GPT-2 | 2019 | ১৫০ কোটি | ≈৪০ জিবি (WebText) | উল্লেখযোগ্যভাবে উন্নত টেক্সট জেনারেশন; শক্তিশালী zero-shot আচরণের প্রদর্শন; প্রাথমিকে আংশিক মডেল প্রকাশ |
| GPT-3 | 2020 | ১৭৫ বিলিয়ন | ≈৫৭০ জিবি (Common Crawl, WebText2 প্রভৃতি) | বৃহৎ পরিসরে in-context learning; fine-tuning ছাড়া few-shot ও zero-shot শিক্ষণের স্পষ্ট সক্ষমতা |
| GPT-3.5 | 2022 | প্রকাশ করা হয়নি (davinci সংস্করণ অনুমানতভাবে ~১৭৫ বিলিয়ন) | >৫৭০ জিবি + অতিরিক্ত কর্পাস ও instruction tuning | উন্নত স্থিতিশীলতা ও নির্দেশ অনুসরণ; ChatGPT-এর প্রাথমিক সংস্করণের ভিত্তি |
| GPT-4 | 2023 | প্রকাশ করা হয়নি[27] | প্রকাশ করা হয়নি | মাল্টিমোডালিটি (টেক্সট + ছবি); উন্নত নির্ভুলতা ও hallucination-এর বিরুদ্ধে স্থিতিশীলতা; ৮k/৩২k token প্রসঙ্গ |
| GPT-4 Turbo | 2023 | প্রকাশ করা হয়নি | GPT-4 প্রশিক্ষণের উপর ভিত্তি করে (বিবরণ প্রকাশ করা হয়নি) | ১২৮,০০০ token পর্যন্ত প্রসঙ্গ বৃদ্ধি; জেনারেশনের গতি ও ব্যয় অপ্টিমাইজেশন |
| GPT-4o | 2024 | প্রকাশ করা হয়নি | মাল্টিমোডাল ডেটা (টেক্সট, ছবি, অডিও) | একীভূত নিউরাল নেটওয়ার্ক মাল্টিমোডাল প্রক্রিয়াকরণ; উচ্চ প্রতিক্রিয়া গতি |
| GPT-4.5 | 2025 | প্রকাশ করা হয়নি | বিস্তৃত টেক্সটুয়াল ও মাল্টিমোডাল কর্পাস | GPT-4o-এর উপর ভিত্তিতে research preview; ত্রুটি হ্রাস; ২০২৬ সালের মধ্যে deprecated |
| GPT-4.1 | 2025 | প্রকাশ করা হয়নি | আপডেটেড কর্পাস | ১,০৪৭,৫৭৬ token পর্যন্ত প্রসঙ্গ; ইনপুটে টেক্সট + ছবি, আউটপুটে টেক্সট |
| GPT-5 | 2025 (আগস্ট) | প্রকাশ করা হয়নি | বৃহৎ পরিসরে মাল্টিমোডাল কর্পাস | দ্রুত উত্তর ও reasoning মোডসহ unified system; ~৪০০K token প্রসঙ্গ; hallucination হ্রাস |
| GPT-5.1 | 2025 (নভেম্বর) | প্রকাশ করা হয়নি | GPT-5-এর বিস্তৃত কর্পাস + RLHF | অভিযোজনযোগ্য reasoning; ২৪ ঘণ্টা prompt caching; coding-এ উন্নতি |
| GPT-5.2 | 2025 (ডিসেম্বর) | প্রকাশ করা হয়নি | আগস্ট ২০২৫-এর knowledge cutoff | Pro মোড; পেশাদার knowledge work; GPT-5.2-Codex (এজেন্টিক coding) |
| GPT-5.3-Codex | 2026 (ফেব্রুয়ারি) | প্রকাশ করা হয়নি | আপডেটেড + self-improvement ডেটা | ২৫% দ্রুত; full-spectrum agent; interactive steering |
| GPT-5.3-Codex-Spark | 2026 (ফেব্রুয়ারি) | প্রকাশ করা হয়নি | কম্প্যাক্ট | Cerebras-এ >১০০০ t/s; রিয়েল-টাইম coding; ১২৮K প্রসঙ্গ |
| GPT-5.3 Instant | 2026 (মার্চ) | প্রকাশ করা হয়নি | প্রকাশ করা হয়নি | ChatGPT-এর সর্বাধিক ব্যবহৃত কথোপকথন মডেলের আপডেট; factuality, web search ও conversational flow উন্নত |
| GPT-5.4 | 2026 (মার্চ) | প্রকাশ করা হয়নি | প্রকাশ করা হয়নি | পেশাদার কাজের জন্য নতুন frontier মডেল; native computer use; general-purpose ও বেশিরভাগ coding কাজে API-তে ডিফল্ট মডেল |
| GPT-5.4 Pro | 2026 (মার্চ) | প্রকাশ করা হয়নি | প্রকাশ করা হয়নি | সবচেয়ে জটিল কাজে বেশি compute সহ GPT-5.4-এর ভেরিয়েন্ট |
GPT মডেলের আর্কিটেকচারাল প্যারামিটার
| মডেল | প্রকাশের বছর | প্যারামিটার সংখ্যা | স্তর সংখ্যা | Hidden state-এর আকার | Attention head-এর সংখ্যা | প্রসঙ্গ উইন্ডো | প্রশিক্ষণ কর্পাসের আকার |
|---|---|---|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 মিলিয়ন | 12 | 768 | 12 | 512 token | ≈৫ জিবি (BooksCorpus) |
| GPT-2 | 2019 | ১৫০ কোটি | 48 | 1 600 | 25 | 1 024 token | ≈৪০ জিবি (WebText) |
| GPT-3 | 2020 | ১৭৫ বিলিয়ন | 96 | 12 288 | 96 | 2 048 token | ≈৫৭০ জিবি (Common Crawl + WebText2 + অন্যান্য) |
| GPT-3.5 | 2022 | প্রকাশ করা হয়নি (davinci সংস্করণ অনুমানতভাবে ~১৭৫ বিলিয়ন) | (অনুমানতভাবে GPT-3-এর কাছাকাছি) | (অনুমানতভাবে GPT-3-এর কাছাকাছি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ৪,০৯৬ token (প্রাথমিক); সর্বোচ্চ ১৬,৩৮৫ token (পরবর্তী) | বিস্তৃত Common Crawl + অতিরিক্ত dataset ও instruction tuning |
| GPT-4 | 2023 | প্রকাশ করা হয়নি | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | ৮,১৯২ token (বেসিক); ৩২,৭৬৮ (GPT-4-32k) | প্রকাশ করা হয়নি |
| GPT-4 Turbo | 2023 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ১২৮,০০০ token | GPT-4-এর অপ্টিমাইজড সংস্করণ (কর্পাসের বিবরণ প্রকাশ করা হয়নি) |
| GPT-4o | 2024 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ১২৮,০০০ token | মাল্টিমোডাল ডেটা: টেক্সট, ছবি, অডিও |
| GPT-4.5 | 2025 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ১২৮,০০০ token | আপডেটেড টেক্সটুয়াল ও মাল্টিমোডাল কর্পাস |
| GPT-4.1 | 2025 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ১,০৪৭,৫৭৬ token | মাল্টিমোডালিটি; দীর্ঘ প্রসঙ্গের উপর জোর দিয়ে স্কেলড প্রশিক্ষণ |
| GPT-5 | 2025 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | সর্বোচ্চ ≈৪০০,০০০ token (মোট প্রসঙ্গ) | বৃহৎ পরিসরে মাল্টিমোডাল কর্পাস (বিবরণ প্রকাশ করা হয়নি) |
| GPT-5.4 | 2026 | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | (প্রকাশ করা হয়নি) | ১,০৫০,০০০ token; ১২৮,০০০ max output | প্রকাশ করা হয়নি |
তথ্যসূত্র
- «Improving language understanding with unsupervised learning», OpenAI, ১১ জুন ২০১৮
- «Better language models and their implications», OpenAI, ১৪ ফেব্রুয়ারি ২০১৯
- «GPT-2: 6-month follow-up», OpenAI, ২০ আগস্ট ২০১৯
- «GPT-2: 1.5B release», OpenAI, ৫ নভেম্বর ২০১৯
- «Language models are few-shot learners», OpenAI, ২৮ মে ২০২০
- «OpenAI API», OpenAI, ১১ জুন ২০২০
- «Introducing ChatGPT», OpenAI, ৩০ নভেম্বর ২০২২
- «Function calling and other API updates», OpenAI, ১৩ জুন ২০২৩
- «GPT-4», OpenAI, ১৪ মার্চ ২০২৩
- «New models and developer products announced at DevDay», OpenAI, ৬ নভেম্বর ২০২৩
- «Hello GPT-4o», OpenAI, ১৩ মে ২০২৪
- «Introducing GPT-4.1 in the API», OpenAI, ১৪ এপ্রিল ২০২৫
- «Introducing GPT-4.5», OpenAI, ২৭ ফেব্রুয়ারি ২০২৫
- «Introducing GPT-5», OpenAI, ৭ আগস্ট ২০২৫
- «GPT-5.1: A smarter, more conversational ChatGPT», OpenAI, ১২ নভেম্বর ২০২৫
- «Introducing GPT-5.2», OpenAI, ১১ ডিসেম্বর ২০২৫
- «Introducing GPT-5.2-Codex», OpenAI, ১৮ ডিসেম্বর ২০২৫
- «Introducing GPT-5.3-Codex», OpenAI, ৫ ফেব্রুয়ারি ২০২৬
- «Introducing GPT-5.3-Codex-Spark», OpenAI, ১২ ফেব্রুয়ারি ২০২৬
- «GPT-5.3 Instant: Smoother, more useful everyday conversations», OpenAI, ৩ মার্চ ২০২৬
- «Introducing GPT-5.4», OpenAI, ৫ মার্চ ২০২৬
- «Using GPT-5.4», OpenAI Developers
- «Models», OpenAI API
- «Deprecations», OpenAI API
- «GPT-5.3 and GPT-5.4 in ChatGPT», OpenAI Help Center
- «Retiring GPT-4o and other ChatGPT models», OpenAI Help Center
টীকাসমূহ
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
- ↑ OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
- ↑ 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
- ↑ 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
- ↑ 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
- ↑ 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
- ↑ OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
- ↑ Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
- ↑ Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
- ↑ Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025).
- ↑ 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
- ↑ OpenAI API documentation. Models: GPT-5.
- ↑ OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
- ↑ OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
- ↑ 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
- ↑ OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
- ↑ OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
- ↑ OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
- ↑ OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
- ↑ Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
- ↑ По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.
সাহিত্য
- Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.