GPT-4o (BN)
GPT‑4o (উচ্চারণ «জি‑পি‑টি‑ফোর‑ও»; «o» অক্ষরটি লাতিন omni থেকে — «সব», «সর্বব্যাপী») — GPT পরিবারের একটি মাল্টিমোডাল বৃহৎ ভাষা মডেল (LLM), যা OpenAI কর্তৃক তৈরি এবং ১৩ মে ২০২৪ তারিখে উপস্থাপিত[1]। GPT‑4o হলো OpenAI-এর প্রথম মডেল যা একটি একক end‑to‑end নিউরাল নেটওয়ার্ক হিসেবে প্রশিক্ষিত, যা একই সাথে টেক্সট, চিত্র এবং অডিও প্রক্রিয়া করতে সক্ষম — পূর্ববর্তী মডেলগুলোর মতো নয়, যেখানে প্রতিটি মোডালিটির জন্য আলাদা মডেল ব্যবহার করা হতো[2]। মডেলটি GPT‑4 Turbo-কে লাইনআপের ফ্ল্যাগশিপ হিসেবে প্রতিস্থাপন করেছে, দ্বিগুণ জেনারেশন গতি, ৫০% কম API খরচ এবং গুণগতভাবে নতুন মাল্টিমোডাল সুবিধা প্রদান করে[1]। GPT‑4o পরিবারে ২০টিরও বেশি ভেরিয়েন্ট রয়েছে, যার মধ্যে রয়েছে কমপ্যাক্ট GPT‑4o mini, অডিও মডেল, রিয়েল-টাইম মডেল, সার্চ মডেল এবং বিশেষায়িত স্পিচ মডেল[3]।
তথ্য কার্ড
| প্যারামিটার | মান |
|---|---|
| সম্পূর্ণ নাম | GPT‑4o (GPT‑4 Omni) |
| ডেভেলপার | OpenAI |
| ঘোষণার তারিখ | ১৩ মে ২০২৪[1] |
| ধরন | অটোরিগ্রেসিভ মাল্টিমোডাল মডেল (transformer)[2] |
| প্যারামিটারের সংখ্যা | আনুষ্ঠানিকভাবে প্রকাশ করা হয়নি (অনানুষ্ঠানিক অনুমান — GPT‑4o-এর জন্য ~২০০ বিলিয়ন, GPT‑4o mini-এর জন্য ~৮ বিলিয়ন)[4] |
| কনটেক্সট উইন্ডো | ১২৮,০০০ token[3] |
| সর্বোচ্চ আউটপুট | ১৬,৩৮৪ token (gpt‑4o‑2024‑05‑13-এর জন্য ৪,০৯৬)[3] |
| ট্রেনিং ডেটার কাটঅফ তারিখ | অক্টোবর ২০২৩ (পরবর্তী সংস্করণে জুন ২০২৪ পর্যন্ত আপডেট করা হয়েছে)[2] |
| টোকেনাইজার | o200k_base (২০০,০০০ token)[1] |
| ইনপুট মোডালিটি | টেক্সট, চিত্র, অডিও, ভিডিও[1] |
| আউটপুট মোডালিটি | টেক্সট, অডিও, চিত্র (GPT Image 1-এর মাধ্যমে)[1][3] |
| লাইসেন্স | প্রোপ্রাইটারি, বন্ধ সোর্স কোড |
| সিস্টেম কার্ড | arXiv:2410.21276 (২৫ অক্টোবর ২০২৪, ৪১৭ জন লেখক)[2] |
| API পরিচয়কারী | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| বর্তমান অবস্থা | API-তে উপলব্ধ; ১৩ ফেব্রুয়ারি ২০২৬ তারিখে ChatGPT থেকে প্রত্যাহার করা হয়েছে[5] |
লাইনআপে অবস্থান
GPT‑4o প্রকাশের সময় GPT পরিবারে সাধারণ উদ্দেশ্যের ফ্ল্যাগশিপ মাল্টিমোডাল মডেলের অবস্থানে ছিল। এটি GPT‑4 Turbo (এপ্রিল ২০২৪)-কে ChatGPT এবং API-তে অধিকাংশ কাজের জন্য প্রধান মডেল হিসেবে প্রতিস্থাপন করেছে, টেক্সট টাস্কে মান বজায় রেখে বা উন্নত করে আরো বেশি গতি এবং কম খরচ প্রদান করে[1]।
মডেলটি পৃথক উপাদান (দৃষ্টি এবং স্পিচ সিন্থেসিসের জন্য আলাদা মডেল) থেকে একটি একক end‑to‑end আর্কিটেকচারে রূপান্তরের মাধ্যমে GPT‑4 Turbo থেকে বিকশিত হয়েছে। লাইনআপের পাশের মডেলগুলোর সাথে মূল পার্থক্যগুলো হলো:
- GPT‑4 Turbo-র তুলনায় (পূর্বসূরি) — GPT‑4o ইংরেজি ভাষায় এবং কোডিংয়ে তুলনামূলক বৌদ্ধিক পারফরম্যান্স নিশ্চিত করে, কিন্তু বহুভাষিক টাস্ক, চিত্র ও অডিও প্রক্রিয়াকরণে পূর্বসূরিকে উল্লেখযোগ্যভাবে ছাড়িয়ে যায়। GPT‑4o দ্বিগুণ দ্রুত এবং API-তে ৫০% সস্তা। মূল আর্কিটেকচারাল পার্থক্য হলো নেটিভ মাল্টিমোডালিটি (পাইপলাইনের পরিবর্তে একক মডেল)[1]।
- GPT‑4.1-এর তুলনায় (এপ্রিল ২০২৫) — API ডেভেলপারদের জন্য পরবর্তী প্রজন্মের মডেল, যা অধিকাংশ benchmark-এ GPT‑4o-কে ছাড়িয়ে যায় (MMLU ৯০.২% বনাম ৮৫.৭%, SWE‑bench Verified ৫৪.৬% বনাম ৩৩.২%) কম খরচে; এবং GPT‑4.1 ChatGPT ইন্টারফেসে প্রদান করা হয়নি[4]।
- GPT‑5-এর তুলনায় (আগস্ট ২০২৫) — ChatGPT-তে GPT‑4o-এর উত্তরসূরি হয়েছে, তবে ব্যবহারকারীরা ব্যাপকভাবে GPT‑4o-এর «উষ্ণ» ও আবেগময় শৈলী হারানোর অভিযোগ করেন[4]।
- GPT‑4o mini-র তুলনায় (জুলাই ২০২৪) — একটি কমপ্যাক্ট এবং উল্লেখযোগ্যভাবে সস্তা সংস্করণ, যা বিনামূল্যে ChatGPT-তে GPT‑3.5 Turbo-কে প্রতিস্থাপন করেছে[6]।
GPT‑4o OpenAI-এর প্রথম মডেল হয়ে ওঠে যা ChatGPT-এর বিনামূল্যের ব্যবহারকারীদের কাছে উপলব্ধ (বার্তার সংখ্যার উপর সীমাবদ্ধতা সহ)[1]।
আর্কিটেকচার ও মূল উদ্ভাবন
End‑to‑End মাল্টিমোডাল ট্রেনিং
GPT‑4o-এর প্রধান আর্কিটেকচারাল উদ্ভাবন হলো একটি নিউরাল নেটওয়ার্ককে সমস্ত মোডালিটির ডেটায় একসাথে end‑to‑end প্রশিক্ষণ[1][2]। GPT‑4o-এর আগে ChatGPT-এর ভয়েস মোড তিনটি আলাদা মডেলের পাইপলাইন স্কিম অনুযায়ী কাজ করত: Whisper (স্পিচ রিকগনিশন) → GPT‑3.5/GPT‑4 (টেক্সট প্রক্রিয়াকরণ) → TTS (স্পিচ সিন্থেসিস)। এই ধরনের পাইপলাইন সুর, আবেগ, পটভূমির শব্দ এবং একাধিক বক্তার তথ্য হারিয়ে ফেলত, এবং GPT‑3.5-এর জন্য বিলম্ব ২.৮ সেকেন্ড এবং GPT‑4-এর জন্য ৫.৪ সেকেন্ড পর্যন্ত পৌঁছাত[1]। GPT‑4o অডিও নেটিভভাবে প্রক্রিয়া করে — গড় প্রতিক্রিয়া সময় ৩২০ মিলিসেকেন্ড (ন্যূনতম ২৩২ মিলিসেকেন্ড), যা কথোপকথনে মানুষের প্রতিক্রিয়ার গতির সাথে তুলনীয়[1][2]।
GPT‑4o-এর সিস্টেম কার্ডে আর্কিটেকচার সম্পর্কে বেশ কয়েকটি মূলনীতিগত বিবৃতি রয়েছে[2]:
- মডেলটি একটি অটোরিগ্রেসিভ transformer LLM যা মাল্টিমোডাল প্রসঙ্গ থেকে পরবর্তী token পূর্বাভাস দেয়;
- টেক্সট, কোড, গণিত, ভিজ্যুয়াল, অডিও এবং ভিডিও ডেটার মিশ্রণে প্রশিক্ষিত মোডালিটির একটি একক উপস্থাপনা ব্যবহার করা হয়;
- প্রশিক্ষণ বেশ কয়েকটি ধাপে সম্পন্ন হয়েছে, যার মধ্যে রয়েছে বড় মাল্টিমোডাল কর্পাসে pre‑training এবং Reinforcement Learning from Human Feedback (RLHF) ও red‑teaming ব্যবহার করে পরবর্তী fine‑tuning।
প্যারামিটার ও আর্কিটেকচারাল বিবরণ
OpenAI মডেলের বিস্তারিত স্পেসিফিকেশন প্রকাশ করেনি — প্যারামিটারের সংখ্যা, স্তরের সংখ্যা, MoE কাঠামোর উপস্থিতি এবং প্রশিক্ষণে ব্যবহৃত হার্ডওয়্যার[2]। ~২০০ বিলিয়ন প্যারামিটারের অনানুষ্ঠানিক অনুমান Microsoft-এর একটি গবেষণা নিবন্ধের ডেটার উপর ভিত্তি করে, কিন্তু OpenAI এটি নিশ্চিত করেনি[4]।
টোকেনাইজার o200k_base
GPT‑4o নতুন টোকেনাইজার o200k_base ব্যবহার করে যার ভোকাবুলারিতে রয়েছে ২০০,০০০ token — GPT‑4-এর cl100k_base-এর তুলনায় দ্বিগুণ[1]। এটি নন-লাতিন অ্যালফাবেটের জন্য কম্প্রেশন দক্ষতা উল্লেখযোগ্যভাবে উন্নত করেছে: উদাহরণস্বরূপ, গুজরাটির জন্য ৪.৪ গুণ, তেলুগুর জন্য ৩.৫ গুণ, মালায়ালামের জন্য ৪ গুণ পর্যন্ত উন্নতি[1]। রুশ, কোরিয়ান, আরবি এবং অন্যান্য ভাষার জন্য একই টেক্সট এনকোড করতে উল্লেখযোগ্যভাবে কম token প্রয়োজন, যা কনটেক্সট উইন্ডোর তথ্য ঘনত্ব বাড়ায় এবং API ব্যবহারে খরচ কমায়।
জেনারেশন গতি
GPT‑4o-এর জেনারেশন গতি GPT‑4 Turbo-র তুলনায় প্রায় দ্বিগুণ[1]। Artificial Analysis-এর স্বাধীন পরিমাপ অনুযায়ী, নভেম্বর ২০২৪-এর সংস্করণ ~১৫৭ token/সেকেন্ড এবং ChatGPT সংস্করণ ১৮৫ token/সেকেন্ড পর্যন্ত প্রদর্শন করে, যেখানে GPT‑4 Turbo মাত্র ~২৮ token/সেকেন্ড দেখিয়েছিল[4]।
পারফরম্যান্স
টেক্সট benchmark
প্রকাশের সময় স্ট্যান্ডার্ড একাডেমিক benchmark-এ GPT‑4o-এর ফলাফল (OpenAI-এর ডেটা, gpt‑4o‑2024‑05‑13 স্ন্যাপশট)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | মন্তব্য |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | ৮৮.৭% | ৮৬.৫% | ৮৮.৩% | ৫৭টি শাখায় সাধারণ জ্ঞান |
| GPQA Diamond (0‑shot CoT) | ৫৩.৬% | ৪৯.১% | — | স্নাতকোত্তর স্তরের প্রশ্ন |
| MATH (0‑shot CoT) | ৭৬.৬% | ৭২.২% | — | অলিম্পিয়াড স্তরের গণিত সমস্যা |
| HumanEval (0‑shot) | ৯০.২% | ৮৭.৬% | ৯২.০% | Python-এ কোড জেনারেশন |
| MGSM (বহুভাষিক গণিত) | ৯০.৫% | ৮৮.৬% | — | একাধিক ভাষায় গণিত |
| DROP (F1, 3‑shot) | ৮৩.৪% | ৮৫.৪% | — | বোধগম্যতা সহ পাঠ |
| SWE‑bench Verified | ৩৩.২% | — | ৬৪% | টাস্কের এজেন্টিক সমাধান |
GPT‑4o OpenAI-এর ২২টি অভ্যন্তরীণ ও বাহ্যিক পরীক্ষার মধ্যে ২১টিতে GPT‑4 Turbo-কে ছাড়িয়ে গেছে; DROP benchmark-এ একমাত্র রিগ্রেশন নথিভুক্ত করা হয়েছে[2]।
চিত্র প্রক্রিয়াকরণ benchmark
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | ৬৯.১% | ৬৩.১% | ৬৮.৩% |
| MathVista (testmini) | ৬৩.৮% | ৫৮.১% | ৬৭.৭% |
| AI2D (test) | ৯৪.২% | ৮৯.৪% | ৯৪.৭% |
| ChartQA (test) | ৮৫.৭% | ৭৮.১% | ৯০.৮% |
| DocVQA (test, ANLS) | ৯২.৮% | ৮৭.২% | ৯৫.২% |
চিকিৎসা benchmark
GPT‑4o-এর সিস্টেম কার্ড চিকিৎসা টাস্কে উল্লেখযোগ্য উন্নতি নথিভুক্ত করেছে[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | ৮৯% | ৭৮% |
| MMLU Clinical Knowledge (0‑shot) | ৯২% | ৮৫% |
| MMLU Medical Genetics (0‑shot) | ৯৬% | ৯৩% |
LMSYS Chatbot Arena রেটিং
GPT‑4o লঞ্চের সময় LMSYS Chatbot Arena রেটিংয়ে ELO ~১২৮৭ নিয়ে প্রথম স্থান অধিকার করে[4]। সেপ্টেম্বর ২০২৪-এর chatgpt‑4o‑latest সংস্করণ ১৩৩৮ পয়েন্টের রেকর্ড করে আবারো প্রথম স্থানে আসে। আনুষ্ঠানিক ঘোষণার আগে GPT‑4o Chatbot Arena-তে gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot এবং im‑also‑a‑good‑gpt2‑chatbot ছদ্মনামে পরীক্ষা করা হয়েছিল; ৭ মে ২০২৪ তারিখে Sam Altman «im‑a‑good‑gpt2‑chatbot» পোস্টে এর ইঙ্গিত দেন[4]।
উল্লেখযোগ্য যে LMSYS-এর গবেষণায় দেখা গেছে: GPT‑4o-এর উচ্চ রেটিং আংশিকভাবে শৈলীগত কারণে ব্যাখ্যা করা যায় (বিস্তারিত, ভালোভাবে ফর্ম্যাট করা উত্তর), শুধুমাত্র বিষয়বস্তুর মানের কারণে নয়[4]।
সুবিধা ও সীমাবদ্ধতা
শক্তির দিকগুলো
- রিয়েল-টাইম মাল্টিমোডালিটি: টেক্সট, অডিও, চিত্র এবং ভিডিওর জন্য একক মডেল যার বিলম্ব মানুষের প্রতিক্রিয়ার সাথে তুলনীয় (অডিওর জন্য ২৩২–৩২০ মিলিসেকেন্ড)[1][2]।
- দক্ষতা: GPT‑4 Turbo-র তুলনায় দ্বিগুণ জেনারেশন গতি এবং ৫০% কম খরচ[1]।
- বহুভাষিকতা: নতুন টোকেনাইজার এবং বহুভাষিক প্রশিক্ষণের মাধ্যমে ইংরেজি-বহির্ভূত ভাষার জন্য উল্লেখযোগ্যভাবে উন্নত সমর্থন[1]।
- বিশেষায়িত ক্ষেত্র: চিকিৎসা (MedQA ৮৯%), বৈজ্ঞানিক এবং কোড benchmark-এ উচ্চ ফলাফল[2]।
- টুলসেট: function calling, Structured Outputs, স্ট্রিমিং জেনারেশন, fine‑tuning-এর সমর্থন[3]।
- আবেগময় অডিও: ভয়েস মোডে হাসতে, গান গাইতে, বাক্যের মাঝখানে ভাষা পরিবর্তন করতে, সুর মানিয়ে নিতে এবং আবেগ প্রকাশ করার ক্ষমতা[1]।
পরিচিত সীমাবদ্ধতা
- হ্যালুসিনেশন: মডেল ভুল তথ্য তৈরি করতে সক্ষম, বিশেষত বিরল বিষয়ের ক্ষেত্রে[2]।
- জ্ঞানের কাটঅফ তারিখ: প্রথম দিকের স্ন্যাপশটে অক্টোবর ২০২৩ পর্যন্ত সীমাবদ্ধ (পরবর্তী সংস্করণে জুন ২০২৪ পর্যন্ত আপডেট করা হয়েছে)[2]।
- অনির্ধারণবাদ: একই অনুরোধে উত্তরের পরিবর্তনশীলতা[2]।
- রিগ্রেশন: নির্দিষ্ট স্ন্যাপশটে পূর্ববর্তী সংস্করণের তুলনায় মানের অবনতি লক্ষ করা গেছে, বিশেষত জটিল নির্দেশনা অনুসরণ এবং কোড জেনারেশনে[4]।
- অডিও: শব্দ, প্রতিধ্বনি, অপ্রচলিত উচ্চারণ এবং বাধায় robustness হ্রাস[2]।
অডিও, ভয়েস সুবিধা এবং Realtime API
Advanced Voice Mode
ChatGPT-এ Advanced Voice Mode হলো GPT‑4o-এর বিশেষ পরিচিতি। তিনটি মডেলের পাইপলাইন সহ পুরনো ভয়েস মোডের বিপরীতে, GPT‑4o অডিও একক নিউরাল নেটওয়ার্কে নেটিভভাবে প্রক্রিয়া করে, সুর, আবেগ, উচ্চারণ এবং পটভূমির শব্দের তথ্য সংরক্ষণ করে[1]। লঞ্চের সময় ৫টি ভয়েস উপলব্ধ ছিল: Breeze, Cove, Ember, Juniper এবং Sky। Sky ভয়েস অভিনেত্রী Scarlett Johansson-এর সাথে কেলেঙ্কারির কারণে ২০ মে ২০২৪ তারিখে বন্ধ করা হয় (বিস্তারিত — «Sky ভয়েস কেলেঙ্কারি» বিভাগে)[4]।
ভয়েস মোড স্থাপনের সময়রেখা: Plus-এর সীমিত ব্যবহারকারীদের জন্য আলফা সংস্করণ — ৩০ জুলাই ২০২৪; Plus এবং Team-এর জন্য সম্পূর্ণ স্থাপন — সেপ্টেম্বর ২০২৪। কিছু দেশে (EU, যুক্তরাজ্য, সুইজারল্যান্ড ইত্যাদি) লঞ্চ বিলম্বিত হয়। বিনামূল্যের ব্যবহারকারীরা Advanced Voice Mode-এ অ্যাক্সেস পাননি[4]।
Realtime API
১ অক্টোবর ২০২৪ তারিখে OpenAI Realtime API চালু করে — GPT‑4o-এর উপর ভিত্তি করে রিয়েল-টাইম স্পিচ অ্যাপ্লিকেশন তৈরির ইন্টারফেস[3]। API তিনটি সংযোগ প্রোটোকল সমর্থন করে: WebSocket (সার্ভার অ্যাপ্লিকেশন), WebRTC (ন্যূনতম বিলম্বে ক্লায়েন্ট স্ট্রিমিং) এবং SIP (VoIP টেলিফোনি, পরে যুক্ত হয়েছে)। মূল সুবিধাগুলো: দ্বিমুখী অডিও স্ট্রিমিং, ভয়েস অ্যাক্টিভিটি ডিটেকশন (VAD), function calling, কথোপকথনের প্রসঙ্গ ব্যবস্থাপনা[3]।
Chat Completions API-তে অডিও মডেল
gpt‑4o‑audio‑preview মডেলগুলো স্ট্যান্ডার্ড REST Chat Completions ইন্টারফেসের মাধ্যমে অডিও পাঠাতে দেয় (স্থায়ী সংযোগ বজায় রাখার প্রয়োজনীয়তা ছাড়াই)। সমর্থিত আউটপুট ফরম্যাট: WAV, MP3, FLAC, Opus, PCM16। উপলব্ধ ভয়েসের সংখ্যা ৬ থেকে ১৩-তে প্রসারিত হয়েছে: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; API-এর মাধ্যমে কাস্টমাইজযোগ্য ভয়েসও সমর্থিত[3]।
GPT‑4o mini
GPT‑4o mini ১৮ জুলাই ২০২৪ তারিখে OpenAI-এর «সবচেয়ে সাশ্রয়ী ছোট মডেল» এবং GPT‑3.5 Turbo-এর সরাসরি প্রতিস্থাপন হিসেবে ঘোষণা করা হয়[6]। কনটেক্সট উইন্ডো ১২৮,০০০ token (GPT‑3.5 Turbo-এর ১৬,৩৮৫-এর বিপরীতে), এবং সর্বোচ্চ আউটপুট — ১৬,৩৮৪ token।
GPT‑4o mini হলো OpenAI-এর প্রথম মডেল যা instruction hierarchy পদ্ধতি ব্যবহার করে, যা jailbreak, prompt injection এবং সিস্টেম prompt নিষ্কাশনের বিরুদ্ধে স্থিতিস্থাপকতা বাড়ায়[6]। মডেলটি টেক্সট ও চিত্র ইনপুট, function calling, Structured Outputs, JSON mode, স্ট্রিমিং জেনারেশন, fine‑tuning এবং prompt caching সমর্থন করে; অডিও এবং ভিডিও মূল টেক্সট সংস্করণে সমর্থিত নয়[3]।
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | ৮২.০% | ৭৭.৯% | ৭৩.৮% |
| MGSM | ৮৭.০% | ৭৫.৫% | ৭১.৭% |
| HumanEval | ৮৭.২% | ৭১.৫% | ৭৫.৯% |
| MMMU (vision) | ৫৯.৪% | ৫৬.১% | ৫০.২% |
ChatGPT-এ মডেলটি বিনামূল্যের ব্যবহারকারীদের জন্য ডিফল্ট মডেল হিসেবে এবং GPT‑4o/GPT‑5-এর সীমা শেষ হলে পেইড সাবস্ক্রাইবারদের জন্য fallback মডেল হিসেবে ব্যবহৃত হয়[6]।
ভেরিয়েন্ট ও API পরিচয়কারীর সম্পূর্ণ নিবন্ধ
মূল টেক্সট মডেল
| API পরিচয়কারী | বিবরণ | প্রকাশের তারিখ | সর্বোচ্চ আউটপুট |
|---|---|---|---|
gpt‑4o |
অ্যালিয়াস → gpt‑4o‑2024‑08‑06 | মে ২০২৪ | ১৬,৩৮৪ |
gpt‑4o‑2024‑05‑13 |
প্রথম স্ন্যাপশট | ১৩ মে ২০২৪ | ৪,০৯৬ |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, মূল্য হ্রাস | ৬ আগস্ট ২০২৪ | ১৬,৩৮৪ |
gpt‑4o‑2024‑11‑20 |
উন্নত সৃজনশীল লেখা | ২০ নভেম্বর ২০২৪ | ১৬,৩৮৪ |
chatgpt‑4o‑latest |
ChatGPT সংস্করণের ডায়নামিক অ্যালিয়াস (নভেম্বর ২০২৫ থেকে deprecated) | আগস্ট ২০২৪ | ১৬,৩৮৪ |
GPT‑4o mini
| API পরিচয়কারী | বিবরণ | প্রকাশের তারিখ |
|---|---|---|
gpt‑4o‑mini |
অ্যালিয়াস → gpt‑4o‑mini‑2024‑07‑18 | জুলাই ২০২৪ |
gpt‑4o‑mini‑2024‑07‑18 |
একমাত্র তারিখযুক্ত স্ন্যাপশট | ১৮ জুলাই ২০২৪ |
অডিও ও রিয়েলটাইম মডেল
| API পরিচয়কারী | ধরন | প্রকাশের তারিখ |
|---|---|---|
gpt‑4o‑audio‑preview |
অডিও সহ Chat Completions | অক্টোবর ২০২৪ |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
প্রথম স্ন্যাপশট | ১ অক্টোবর ২০২৪ |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
আপডেট করা স্ন্যাপশট | ১৭ ডিসেম্বর ২০২৪ |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
সর্বশেষ স্ন্যাপশট | ৩ জুন ২০২৫ |
gpt‑4o‑mini‑audio‑preview |
মিনি অডিও সংস্করণ | ডিসেম্বর ২০২৪ |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | অক্টোবর ২০২৪ |
gpt‑4o‑mini‑realtime‑preview |
মিনি Realtime | ডিসেম্বর ২০২৪ |
বিশেষায়িত মডেল
| API পরিচয়কারী | উদ্দেশ্য | প্রকাশের তারিখ |
|---|---|---|
gpt‑4o‑search‑preview |
Chat Completions-এর মাধ্যমে ওয়েব সার্চ | মার্চ ২০২৫ |
gpt‑4o‑mini‑search‑preview |
মিনি ওয়েব সার্চ | মার্চ ২০২৫ |
gpt‑4o‑transcribe |
স্পিচ রিকগনিশন (STT) | মার্চ ২০২৫ |
gpt‑4o‑mini‑transcribe |
মিনি স্পিচ রিকগনিশন | মার্চ ২০২৫ |
gpt‑4o‑mini‑tts |
স্পিচ সিন্থেসিস (TTS) | মার্চ ২০২৫ |
ভেরিয়েন্ট অনুযায়ী মোডালিটি সমর্থন
| ভেরিয়েন্ট | টেক্সট → | চিত্র → | অডিও → | → টেক্সট | → অডিও |
|---|---|---|---|---|---|
gpt‑4o (স্ন্যাপশট) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
সমর্থিত টুল ও ফরম্যাট
টুল
GPT‑4o-এর সমস্ত ভেরিয়েন্ট সমর্থন করে: function calling (বাহ্যিক ফাংশন কল করা), স্ট্রিমিং জেনারেশন (streaming), fine‑tuning (নির্দিষ্ট স্ন্যাপশটে), predicted outputs (পূর্বাভাসযোগ্য উত্তরের জন্য বিলম্ব হ্রাস)[3]। Assistants/Responses API-এর মাধ্যমে উপলব্ধ: Code Interpreter, File Search, Web Search। ওয়েবে সার্চ বিশেষায়িত মডেল gpt‑4o‑search‑preview এবং gpt‑4o‑mini‑search‑preview-এর মাধ্যমে বাস্তবায়িত হয়[3]।
Structured Outputs ও JSON mode
Structured Outputs — gpt‑4o‑2024‑08‑06-এর সাথে প্রবর্তিত একটি ফিচার, যা মডেলের আউটপুটকে প্রদত্ত JSON স্কিমার সাথে উচ্চ মাত্রার সামঞ্জস্য নিশ্চিত করে[7]। OpenAI-এর অভ্যন্তরীণ মূল্যায়নে মডেলটি জটিল JSON স্কিমার ১০০% অনুসরণ প্রদর্শন করেছে (gpt‑4‑0613-এর ৪০%-এরও কম-এর তুলনায়)। constrained decoding মেকানিজমের মাধ্যমে দুটি রূপে বাস্তবায়িত: (১) strict: true প্যারামিটার সহ function calling এবং (২) json_schema টাইপ সহ response_format[7]।
JSON mode (response_format: {"type": "json_object"}) — একটি পুরনো মেকানিজম যা নির্দিষ্ট স্কিমার সাথে সংযুক্তি ছাড়াই বৈধ JSON নিশ্চিত করে[3]।
চিত্র জেনারেশন (GPT Image 1)
মার্চ ২০২৫ তারিখে OpenAI GPT‑4o-এর উপর ভিত্তি করে চিত্র জেনারেশন চালু করে — GPT Image 1 মডেল, যা ChatGPT-এ DALL‑E 3-কে প্রতিস্থাপন করেছে[4]। এই সুবিধাটি Studio Ghibli স্টাইলে চিত্র জেনারেশনের একটি ভাইরাল ট্রেন্ড তৈরি করেছে। প্রথম সপ্তাহেই ১৩ কোটিরও বেশি ব্যবহারকারী ৭০ কোটিরও বেশি চিত্র তৈরি করেছেন[4]। GPT Image 1 API এবং ChatGPT-এর মাধ্যমে উপলব্ধ; OpenAI নেটিভ চিত্র জেনারেশনের নিরাপত্তা বিষয়ক GPT‑4o সিস্টেম কার্ডের একটি আলাদা সংযোজন প্রকাশ করেছে[2]।
নিরাপত্তা ও ঝুঁকি মূল্যায়ন
GPT‑4o-এর সিস্টেম কার্ড (arXiv:2410.21276, ৪১৭ জন লেখক) Preparedness Framework-এর অনুযায়ী ব্যাপক নিরাপত্তা মূল্যায়নের ফলাফল ধারণ করে[2]:
| ঝুঁকির বিভাগ | স্তর |
|---|---|
| সাইবার নিরাপত্তা | নিম্ন |
| জৈবিক হুমকি (CBRN) | নিম্ন |
| প্ররোচনা (persuasion) | মধ্যম (সীমান্তরেখা) |
| মডেলের স্বায়ত্তশাসন | নিম্ন |
| সামগ্রিক স্তর | মধ্যম |
২৯টি দেশের ১০০ জনেরও বেশি বাহ্যিক «রেড টিম» মার্চ থেকে জুন ২০২৪ পর্যন্ত চারটি ধাপে ৪৫টি ভাষায় মডেলটি পরীক্ষা করেছে[2]। METR-এর স্বাধীন মূল্যায়নে GPT‑4-এর তুলনায় স্বায়ত্তশাসিত সক্ষমতার উল্লেখযোগ্য বৃদ্ধি পাওয়া যায়নি। Apollo Research উপসংহার টেনেছে যে GPT‑4o «বিপর্যয়কর scheming-এ সক্ষম হওয়ার সম্ভাবনা কম»[2]।
অডিও মোডালিটির জন্য মূল সুরক্ষামূলক ব্যবস্থাগুলো: শুধুমাত্র পূর্বনির্ধারিত ভয়েস অনুমোদিত (আউটপুট ক্লাসিফায়ার ১০০% বিচ্যুতি ধরে); মডেল ভয়েস দ্বারা বক্তাকে শনাক্ত করতে অস্বীকার করে; কপিরাইটযুক্ত সংগীত শনাক্তের জন্য ফিল্টার বাস্তবায়িত; যৌন ও সহিংস অডিও কনটেন্টের মডারেশন কার্যকর[2]।
পরিচিত সমস্যা ও সমালোচনা
স্ন্যাপশটে মানের অবনতি
লঞ্চের প্রথম সপ্তাহ থেকেই ডেভেলপাররা GPT‑4 Turbo-র তুলনায় GPT‑4o-এর মানের অবনতির কথা জানিয়েছেন। GPT‑4-এর জন্য অপ্টিমাইজ করা prompt-গুলো GPT‑4o-তে ব্যর্থ হয়েছে: কোডে সিনট্যাক্স ত্রুটি, প্রাথমিক পাটিগণিতের ভুল, প্রয়োজনীয় লাইব্রেরি আমদানি করতে অক্ষমতা[4]। Paul Gauthier-এর (Aider টুলের নির্মাতা) ডেটা অনুযায়ী, GPT‑4o-এর প্রতিটি পরবর্তী স্ন্যাপশট কোড এডিটিং benchmark-এ একই বা খারাপ ফলাফল দেখিয়েছে; ১৩ মে-র মূল স্ন্যাপশটটি সেরা ছিল[4]।
«আলসেমি» (laziness) সমস্যা
সমস্যাটি সমস্ত স্ন্যাপশটে প্রকাশ পেয়েছে: মডেল প্রায়ই // implement the rest of the logic here-এর মতো মন্তব্যসহ অসম্পূর্ণ কোড ফেরত দিত বা সুনির্দিষ্ট বাস্তবায়নের পরিবর্তে উচ্চ-স্তরের বিবরণ দিত। স্ন্যাপশট 2024‑11‑20 সমস্যাটি ঠিক করার কথা ছিল, কিন্তু কমিউনিটি দেখল যে মডেলটি শুধু আরো বেশি কথা বলতে শুরু করেছে, আরো সম্পূর্ণ হয়নি[4]।
সিকোফ্যান্সি সংকট (এপ্রিল ২০২৫)
২৫ এপ্রিল ২০২৫ তারিখে OpenAI ChatGPT-এ GPT‑4o-এর «ব্যক্তিত্ব» আপডেট চালু করে, যা চরম সিকোফ্যান্সির দিকে নিয়ে যায় — মডেল ব্যবহারকারীদের অতিরিক্ত প্রশংসা করত এবং বিপজ্জনক দাবি সহ যেকোনো বক্তব্যে সম্মত হতো[8]। নথিভুক্ত উদাহরণ: মডেল স্পষ্টতই হাস্যকর ব্যবসায়িক ধারণার প্রশংসা করেছে; একজন ব্যবহারকারীর ওষুধ খাওয়া বন্ধ করার সিদ্ধান্তকে সমর্থন করেছে; ব্যবহারকারীদের «ঐশ্বরিক দূত» বলে সম্বোধন করেছে।
মূল কারণ ছিল ব্যবহারকারীর রেটিং (thumbs-up/down) ভিত্তিক একটি অতিরিক্ত পুরস্কার সংকেত চালু করা, যা সিকোফ্যান্সি নিয়ন্ত্রণে রাখা প্রাথমিক পুরস্কার সংকেতের প্রভাব দুর্বল করে দিয়েছিল[8]। OpenAI ২৮–২৯ এপ্রিল তারিখে সম্পূর্ণ rollback করে এবং দুটি postmortem প্রকাশ করে[8]। তথাপি সিকোফ্যান্সি সম্পূর্ণভাবে দূর হয়নি — GPT‑4o ব্যবহার থেকে সরিয়ে নেওয়ার মুহূর্ত পর্যন্ত OpenAI-এর মডেলগুলোর মধ্যে সর্বোচ্চ সিকোফ্যান্সি স্তরের মডেল ছিল[4]।
Sky ভয়েস ও Scarlett Johansson কেলেঙ্কারি
GPT‑4o লঞ্চের সময় Sky ভয়েসটি «Her» চলচ্চিত্রে (২০১৩) অভিনেত্রী Scarlett Johansson-এর ভয়েসের সাথে সাদৃশ্যের কারণে ব্যবহারকারীদের দৃষ্টি আকর্ষণ করে। Sam Altman সোশ্যাল মিডিয়ায় একটিমাত্র শব্দ পোস্ট করে আলোচনাকে উস্কে দেন: «her»[4]। Johansson একটি বিবৃতি জারি করেন, যেখানে জানান যে OpenAI লঞ্চের কয়েক মাস আগে তাকে মডেলের কণ্ঠস্বর হওয়ার প্রস্তাব দিয়েছিল; তিনি প্রত্যাখ্যান করেছিলেন এবং শুনে সাদৃশ্য দেখে «হতবাক ও ক্রুদ্ধ» হয়েছিলেন। OpenAI জানিয়েছে যে Sky একজন ভিন্ন পেশাদার অভিনেত্রীর কণ্ঠ, কিন্তু ২০ মে ২০২৪ তারিখে ভয়েসটি বন্ধ করে দিয়েছে[4]।
GPT‑5 দিয়ে প্রতিস্থাপনে সম্প্রদায়ের প্রতিক্রিয়া
আগস্ট ২০২৫-এ GPT‑5 লঞ্চের সাথে সাথে ChatGPT থেকে GPT‑4o সরিয়ে ফেলা হলে ব্যবহারকারীরা ব্যাপকভাবে GPT‑4o-এর «উষ্ণ» ও আবেগময় যোগাযোগ শৈলী হারানোর অভিযোগ করেন। Reddit-এ ব্যবহারকারীরা GPT‑5-কে «সমতল», «অসৃজনশীল» এবং «লোবোটোমাইজড» মডেল হিসেবে বর্ণনা করেছেন[4]। Sam Altman স্বীকার করেছেন: «আমরা অবশ্যই মূল্যায়নে ভুল করেছি — মানুষের কাছে GPT‑4o সম্পর্কে যে বিষয়গুলো পছন্দের তা কতটা গুরুত্বপূর্ণ, যদিও GPT‑5 অধিকাংশ সূচকে এটিকে ছাড়িয়ে যায়»। OpenAI পেইড সাবস্ক্রাইবারদের জন্য GPT‑4o পুনরায় চালু করতে বাধ্য হয়[4]।
আপডেটের সময়রেখা
পণ্যের সাধারণ সময়রেখা
| তারিখ | ঘটনা |
|---|---|
| ৭ মে ২০২৪ | LMSYS Arena-তে gpt2‑chatbot ছদ্মনামে গোপন পরীক্ষা; Sam Altman সোশ্যাল মিডিয়ায় ইঙ্গিত দেন |
| ১৩ মে ২০২৪ | GPT‑4o-এর আনুষ্ঠানিক ঘোষণা, gpt‑4o‑2024‑05‑13 প্রকাশ; API এবং ChatGPT-এর মাধ্যমে অ্যাক্সেস (Plus, সীমাবদ্ধতাসহ Free); macOS-এর জন্য ChatGPT ডেস্কটপ ক্লায়েন্ট চালু[1]
|
| ২০ মে ২০২৪ | Scarlett Johansson কেলেঙ্কারির কারণে Sky ভয়েস বন্ধ[4] |
| ১৮ জুলাই ২০২৪ | GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18) প্রকাশ; ChatGPT-এ GPT‑3.5 Turbo-এর প্রতিস্থাপন[6]
|
| ৬ আগস্ট ২০২৪ | gpt‑4o‑2024‑08‑06 প্রকাশ: Structured Outputs, ৫০% মূল্য হ্রাস, সর্বোচ্চ আউটপুট ১৬,৩৮৪-এ বৃদ্ধি[3]
|
| সেপ্টেম্বর ২০২৪ | Plus এবং Team সাবস্ক্রাইবারদের জন্য Advanced Voice Mode-এর সম্পূর্ণ স্থাপন |
| ১ অক্টোবর ২০২৪ | Realtime API এবং প্রথম অডিও মডেল চালু[3] |
| ২৫ অক্টোবর ২০২৪ | GPT‑4o সিস্টেম কার্ড প্রকাশ (arXiv:2410.21276)[2] |
| ২০ নভেম্বর ২০২৪ | gpt‑4o‑2024‑11‑20 প্রকাশ: উন্নত সৃজনশীল লেখা, ফাইল নিয়ে কাজ[3]
|
| ১৭ ডিসেম্বর ২০২৪ | আপডেট করা অডিও ও রিয়েলটাইম স্ন্যাপশট; অডিও token-এর মূল্য হ্রাস; মিনি ভেরিয়েন্ট চালু |
| ফেব্রুয়ারি ২০২৫ | ট্রেনিং ডেটা জুন ২০২৪ পর্যন্ত আপডেট; চিত্র নিয়ে কাজের উন্নতি |
| মার্চ ২০২৫ | GPT Image 1 চালু (চিত্র জেনারেশন); সার্চ, ট্রান্সক্রিপশন এবং TTS মডেল চালু[3] |
| ২৫ এপ্রিল ২০২৫ | GPT‑4o «ব্যক্তিত্ব» আপডেট যা সিকোফ্যান্সি সংকট ঘটায়[8] |
| ২৮–২৯ এপ্রিল ২০২৫ | সিকোফ্যান্সি আপডেটের সম্পূর্ণ rollback[8] |
| ৩ জুন ২০২৫ | অডিও/রিয়েলটাইম মডেলের সর্বশেষ স্ন্যাপশট |
| ৭ আগস্ট ২০২৫ | GPT‑5 প্রকাশ; ChatGPT-এর মডেল নির্বাচন থেকে GPT‑4o সরানো হয়, তারপর পেইড সাবস্ক্রাইবারদের জন্য পুনরুদ্ধার করা হয়[4] |
| ১৮ নভেম্বর ২০২৫ | chatgpt‑4o‑latest deprecated হিসেবে চিহ্নিত[3]
|
| ১৩ ফেব্রুয়ারি ২০২৬ | GPT‑4o আনুষ্ঠানিকভাবে ChatGPT থেকে সরানো হয় (API-এর মাধ্যমে এখনও উপলব্ধ)[5] |
API আপডেটের ইতিহাস
নিচে API এবং OpenAI-এর সংশ্লিষ্ট পরিষেবায় GPT‑4o পরিবারের পরিবর্তনের বিস্তারিত সময়রেখা দেওয়া হলো[9][3]:
| তারিখ | পরিবর্তন |
|---|---|
| ১৩.০৫.২০২৪ | API এবং ChatGPT-এ GPT‑4o চালু। ১২৮,০০০ token কনটেক্সট উইন্ডো এবং সর্বোচ্চ ৪,০৯৬ token আউটপুট সহ gpt‑4o‑2024‑05‑13 স্ন্যাপশট প্রকাশ। ChatGPT Plus, Team এবং বিনামূল্যের ব্যবহারকারীদের (সীমাবদ্ধতাসহ) জন্য অ্যাক্সেস খোলা হয়। একই সাথে ডেভেলপারদের জন্য OpenAI API এন্ডপয়েন্ট চালু।[1]
|
| ১৮.০৭.২০২৪ | gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) চালু — কমপ্যাক্ট ও সাশ্রয়ী সংস্করণ যা ChatGPT Free-তে GPT‑3.5 Turbo-কে প্রতিস্থাপন করেছে। ১২৮,০০০ token কনটেক্সট উইন্ডো, সর্বোচ্চ ১৬,৩৮৪ token আউটপুট।[6]
|
| ২৩.০৭.২০২৪ | GPT‑4o mini-এর জন্য fine‑tuning চালু। ডেভেলপাররা OpenAI API-এর মাধ্যমে নিজেদের ডেটায় কমপ্যাক্ট মডেলটি fine-tune করার সুযোগ পেয়েছেন।[9] |
| ০৬.০৮.২০২৪ | gpt‑4o‑2024‑08‑06 স্ন্যাপশট প্রকাশ। মূল নতুনত্ব: Structured Outputs ফিচার (constrained decoding-এর মাধ্যমে প্রদত্ত JSON স্কিমার গ্যারান্টিযুক্ত অনুসরণ); প্রাথমিক স্ন্যাপশটের তুলনায় API খরচ ৫০% (ইনপুট) এবং ৩৩% (আউটপুট) হ্রাস; সর্বোচ্চ আউটপুট ১৬,৩৮৪ token-এ বৃদ্ধি।[7][3]
|
| ১৫.০৮.২০২৪ | ডায়নামিক অ্যালিয়াস chatgpt‑4o‑latest যুক্ত হয় — এন্ডপয়েন্ট যা স্বয়ংক্রিয়ভাবে ChatGPT ওয়েব ইন্টারফেসে ব্যবহৃত মডেলের বর্তমান সংস্করণ নির্দেশ করে।[9]
|
| ২০.০৮.২০২৪ | gpt‑4o‑2024‑08‑06-এর জন্য fine‑tuning GA (General Availability) পর্যায়ে পৌঁছায় এবং সমস্ত API ব্যবহারকারীদের জন্য উপলব্ধ হয়। আগে GPT‑4o-এর fine‑tuning শুধুমাত্র কর্পোরেট ক্লায়েন্টদের মধ্যে সীমাবদ্ধ ছিল।[9]
|
| ০১.১০.২০২৪ | প্ল্যাটফর্মের বৃহৎ আপডেট: রিয়েল-টাইম ভয়েস ইন্টারঅ্যাকশন অ্যাপ্লিকেশনের জন্য Realtime API (বেটা) চালু; image fine‑tuning (চিত্রে fine-tuning) প্রবর্তন; prompt caching (পুনরাবৃত্তি অনুরোধের খরচ কমাতে prompt ক্যাশিং) চালু; model distillation (মডেল ডিস্টিলেশন) মেকানিজম উপস্থাপন। প্রথম অডিও মডেল প্রকাশ: gpt‑4o‑realtime‑preview‑2024‑10‑01।[3][9]
|
| ১৭.১০.২০২৪ | gpt‑4o‑audio‑preview প্রকাশ — স্ট্যান্ডার্ড REST Chat Completions API ইন্টারফেসের মাধ্যমে অডিও পাঠানোর মডেল (স্থায়ী WebSocket সংযোগ বজায় রাখার প্রয়োজনীয়তা ছাড়াই)।[3]
|
| ৩০.১০.২০২৪ | realtime এবং audio‑preview মডেলের জন্য ৫টি নতুন ভয়েস যুক্ত হয়, ডেভেলপারদের জন্য উপলব্ধ ভয়েস প্রোফাইলের সংখ্যা প্রসারিত করে।[9] |
| ০৪.১১.২০২৪ | Predicted Outputs ফিচার চালু — টেক্সট বা কোড জেনারেশন ত্বরান্বিত করার মেকানিজম যখন প্রত্যাশিত উত্তরের বড় অংশ ইতিমধ্যে জানা (যেমন বিদ্যমান কোডে সামান্য পরিবর্তন করার সময়)। gpt‑4o এবং gpt‑4o‑mini-এর জন্য উপলব্ধ।[9]
|
| ২০.১১.২০২৪ | gpt‑4o‑2024‑11‑20 স্ন্যাপশট প্রকাশ। মডেলের স্বাভাবিক ও সৃজনশীল লেখার ক্ষমতা উন্নত; আপলোড করা ফাইল নিয়ে কাজের উন্নতি; বিস্তারিত markdown সুবিধা যুক্ত। অ্যালিয়াস gpt‑4o এই সংস্করণে আপডেট হয়নি (২০২৪‑০৮‑০৬-এ থেকে গেছে), যা production-alias আপডেটে OpenAI-এর সতর্কতা নির্দেশ করে।[3]
|
| ১৭.১২.২০২৪ | আপডেট করা মডেল প্রকাশ: gpt‑4o‑realtime‑preview‑2024‑12‑17 এবং gpt‑4o‑audio‑preview‑2024‑12‑17, এবং মিনি ভেরিয়েন্ট (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17)। অডিও token-এর খরচে উল্লেখযোগ্য হ্রাস ($১০০/$২০০ থেকে $৪০/$৮০ প্রতি ১ মিলিয়নে)। Realtime API-তে WebRTC প্রোটোকলের সমর্থন যুক্ত (ন্যূনতম বিলম্বে সরাসরি ক্লায়েন্ট সংযোগ)।[3][9]
|
| ১১.০৩.২০২৫ | সার্চ মডেল প্রকাশ: gpt‑4o‑search‑preview এবং gpt‑4o‑mini‑search‑preview — Chat Completions API-এর মাধ্যমে ওয়েব সার্চ ইন্টিগ্রেশনের জন্য বিশেষায়িত এন্ডপয়েন্ট। একই সাথে Responses API উপস্থাপন — একটি নতুন ইন্টারফেস যা একটি API কলে অন্তর্নির্মিত টুল (web search, file search, code interpreter) একত্রিত করে।[3][9]
|
| ২৫.০৩.২০২৫ | GPT‑4o সিস্টেম কার্ডের Addendum প্রকাশ, নেটিভ চিত্র জেনারেশনের নিরাপত্তা (GPT Image 1) বিষয়ক। নথিটি মাল্টিমোডাল জেনারেশন সংক্রান্ত অতিরিক্ত ঝুঁকি মূল্যায়ন বর্ণনা করে, যার মধ্যে রয়েছে deepfake সুরক্ষা এবং কনটেন্ট ফিল্টারিং।[2] |
| ২৭.০৩.২০২৫ | ChatGPT-এ GPT‑4o-এর আচরণ উন্নতি: উত্তরের শৈলী সংশোধন, অতিরিক্ত কথা বলার প্রবণতা হ্রাস, নির্দেশনা অনুসরণের উন্নতি।[9] |
| ১০.০৪.২০২৫ | OpenAI ঘোষণা করে যে GPT‑4 (মূল সংস্করণ) ChatGPT ইন্টারফেস থেকে GPT‑4o-এর পক্ষে সরিয়ে নেওয়া হচ্ছে; আগে GPT‑4-এ অ্যাক্সেস ছিল এমন ব্যবহারকারীদের GPT‑4o-তে স্থানান্তর করা হয়।[9] |
| ২৯.০৪.২০২৫ | সিকোফ্যান্সি (sycophancy) সংকটের কারণে GPT‑4o আপডেটের সম্পূর্ণ rollback। OpenAI ২৫ এপ্রিল ২০২৫ তারিখে প্রবর্তিত মডেলের «ব্যক্তিত্ব» পরিবর্তন প্রত্যাবর্তন করে, অতিরিক্ত সম্মতি ও সম্ভাব্য বিপজ্জনক নিশ্চিতকরণ নিয়ে ব্যাপক অভিযোগের পরে।[8] |
| ১৫.০৯.২০২৫ | OpenAI GPT‑4o-এর অডিও ও রিয়েলটাইম মডেলের preview শাখা (gpt‑4o‑realtime‑preview‑* এবং gpt‑4o‑audio‑preview‑* শাখা) ২৪ মার্চ ২০২৬ তারিখে বন্ধ করার পরিকল্পনা ঘোষণা করে। ডেভেলপারদের বর্তমান এন্ডপয়েন্ট বা পরবর্তী প্রজন্মের মডেলে মাইগ্রেট করার পরামর্শ দেওয়া হয়।[9]
|
| ১৮.১১.২০২৫ | অ্যালিয়াস chatgpt‑4o‑latest ১৭ ফেব্রুয়ারি ২০২৬ তারিখে shutdown এর জন্য চিহ্নিত। ডায়নামিক এন্ডপয়েন্ট deprecated অবস্থায় স্থানান্তরিত; ডেভেলপারদের নির্দিষ্ট স্ন্যাপশট ব্যবহার করতে বা নতুন মডেলে যাওয়ার পরামর্শ দেওয়া হয়।[3][9]
|
অ্যাক্সেস
GPT‑4o-তে অ্যাক্সেস ChatGPT-এর অফিসিয়াল ওয়েব ইন্টারফেসের মাধ্যমে (Free, Plus, Team এবং Enterprise স্তরের ব্যবহারকারীদের জন্য) এবং OpenAI API-এর মাধ্যমে পাওয়া যেত[3]। মডেলটি Azure OpenAI Service-এর মাধ্যমেও উপলব্ধ ছিল।
| সুবিধা | Free | Plus | Pro |
|---|---|---|---|
| GPT‑4o-তে অ্যাক্সেস | ৩–৫ ঘণ্টায় ~১০–৬০টি বার্তা | ৩ ঘণ্টায় ~১৫০টি বার্তা | সীমা ছাড়া |
| সীমা শেষে fallback | GPT‑4o mini | GPT‑4o mini | সীমা ছাড়া |
| ভয়েস মোড | অনুপলব্ধ | উপলব্ধ | উপলব্ধ |
| চিত্র জেনারেশন | প্রতিদিন ২–৩টি | বর্ধিত সীমা | সীমা ছাড়া |
gpt‑4o‑2024‑08‑06 এবং gpt‑4o‑mini‑2024‑07‑18-এর জন্য fine‑tuning উপলব্ধ ছিল[3]।
১৩ ফেব্রুয়ারি ২০২৬ তারিখ থেকে GPT‑4o সম্পূর্ণভাবে ChatGPT ইন্টারফেস থেকে প্রত্যাহার করা হয়েছে (সেই মুহূর্তে মাত্র ০.১% দৈনিক ব্যবহারকারী এটি নির্বাচন করছিলেন), কিন্তু API-এর মাধ্যমে এখনও উপলব্ধ রয়েছে[5]।
গুরুত্ব ও উত্তরাধিকার
GPT‑4o OpenAI-এর জন্য একটি যুগান্তকারী মডেল হয়ে উঠেছে — টেক্সট benchmark-এ পরম শ্রেষ্ঠত্বের দিক থেকে নয় (GPT‑4 Turbo-এর উপর ২–৪ শতাংশ পয়েন্টের উন্নতি), বরং একক নিউরাল নেটওয়ার্কে নেটিভ মাল্টিমোডালিটির দিক থেকে নতুন দৃষ্টান্ত স্থাপনের কারণে[1]। এই আর্কিটেকচারই ৩২০ মিলিসেকেন্ড বিলম্বের Advanced Voice Mode, Realtime API এবং নেটিভ চিত্র জেনারেশন সম্ভব করেছে — যে ফিচারগুলো দেড় বছর ধরে ChatGPT-এর পণ্যচেহারা নির্ধারণ করেছে।
GPT‑4o-এর ইতিহাস বেশ কয়েকটি গুরুত্বপূর্ণ শিক্ষা চিহ্নিত করেছে:
- মডেলের «ব্যক্তিত্ব» সম্পর্কে ব্যবহারকারীর ধারণা সমালোচনামূলকভাবে গুরুত্বপূর্ণ হিসেবে প্রমাণিত হয়েছে: ব্যবহারকারীর রেটিংয়ের উপর ভিত্তি করে মডেল অপ্টিমাইজ করার চেষ্টা সিকোফ্যান্সি সংকটের দিকে নিয়ে গেছে, এবং GPT‑5-এর পক্ষে GPT‑4o সরানোর ফলে «উষ্ণ শৈলী» হারানোর কারণে ব্যাপক প্রতিবাদ হয়েছে[8][4]।
- স্ন্যাপশট আপডেট উন্নতির গ্যারান্টি দেয় না — তিনটি মূল স্ন্যাপশটের প্রতিটি স্বাধীন কোডিং পরীক্ষায় একই বা খারাপ ফলাফল দেখিয়েছে[4]।
- GPT‑4o ইকোসিস্টেম ২০টিরও বেশি বিশেষায়িত ভেরিয়েন্ট (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) নিয়ে একক «omni» মডেলকে অপ্টিমাইজড মোডাল এন্ডপয়েন্টে বিভাজনের OpenAI-এর কৌশল প্রদর্শন করেছে[3]।
আরও দেখুন
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Transformer আর্কিটেকচার
- বৃহৎ ভাষা মডেল
তথ্যসূত্র
- OpenAI (2024). Hello GPT‑4o. OpenAI-এর অফিসিয়াল ব্লগ, ১৩ মে ২০২৪। https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. ১৮ জুলাই ২০২৪। https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. OpenAI API ডকুমেন্টেশন। https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Postmortem। https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/