GPT (OpenAI) (FA)
GPT (Generative Pre-trained Transformer) — خانوادهای از مدلهای زبانی بزرگ (LLM) است که توسط شرکت OpenAI توسعه یافته است. مدلهای GPT بر پایه معماری transformer ساخته شدهاند و پارادایم پیشآموزش مولد را پیادهسازی میکنند: در مرحله اول، مدل روی پیکرههای متنی گسترده بدون برچسبگذاری صریح آموزش میبیند، و سپس میتواند برای وظایف خاص fine-tuning شود. برای نسلهای جدیدتر (از GPT‑5 به بعد)، OpenAI همچنین از اصطلاح سیستم یکپارچه (unified system) استفاده میکند، زیرا محصول حالت پاسخ سریع، حالت استدلال عمیق (reasoning) و یک مسیریاب را در خود ادغام کرده است[1].
نامگذاری
مخفف GPT مخفف Generative Pre-trained Transformer (ترنسفورمر مولد پیشآموزشدیده) است.
- مولد (Generative): به این معناست که مدل قادر به ایجاد (تولید) محتوای جدید، مانند متن، است.
- پیشآموزشدیده (Pre-trained): نشان میدهد که مدل یک مرحله آموزش اولیه گسترده روی مجموعه داده بزرگی (مانند متون اینترنتی) را طی میکند. پس از پیشآموزش، مدل اغلب میتواند بهصورت اضافی «fine-tuned» شود تا وظایف تخصصیتری را انجام دهد.
- ترنسفورمر (Transformer): نام معماری خاصی از شبکه عصبی است که نوآوری اصلی زیربنای GPT و بسیاری از مدلهای هوش مصنوعی مدرن دیگر است.
ویژگی اصلی GPT این است که آموزش به شکل خودبازگشتی انجام میشود — مدل token بعدی را بر اساس زمینه قبلی پیشبینی میکند. یعنی مدل یاد میگیرد که احتمال token بعدی را با دانستن توالی tokenهای قبلی بیشینه کند. در طول آموزش، خطای پیشبینی عنصر بعدی کمینه میشود، که این امر امکان تولید متون با انسجام و پیوستگی بالا را فراهم میکند.
فرآیند تولید متن در GPT
مدل GPT متن را بهصورت متوالی، token به token، بر اساس طرح تکراری زیر تولید میکند:
- توالی متنی اولیه (prompt، seed text) را به عنوان ورودی دریافت میکند.
- توزیع احتمال روی تمام tokenهای واژگان برای عنصر بعدی متن را محاسبه میکند.
- token بعدی را انتخاب میکند:
- یا بر اساس بالاترین احتمال (انتخاب حریصانه)،
- یا با روش نمونهگیری تصادفی (sampling)،
- یا با استفاده از راهبردهای فیلترکننده ویژه (top-k، top-p).
- token انتخابشده را به توالی جاری اضافه میکند.
- توالی بهروزشده دوباره به عنوان ورودی مدل برای پیشبینی token بعدی ارائه میشود.
معماری transformer: پردازش متن
فرآیند پردازش داده درون transformer برای پیشبینی token بعدی شامل چند مرحله اصلی است:
- توکنسازی (Tokenization). متن ورودی به tokenها تقسیم میشود — واحدهای کوچک متنی که میتوانند کلمه، بخشی از کلمه یا علائم نگارشی باشند. در مدل GPT-3، برای مثال، واژگان حدود ۵۰ ۲۵۷ token دارد.
- embedding توکنها (Embeddings). هر token با استفاده از ماتریس embedding (W_E) به یک بردار با طول ثابت تبدیل میشود. بردارها معنای tokenها را رمزگذاری میکنند: tokenهای از نظر معنایی نزدیک در فضای چنددبعدی در کنار هم قرار میگیرند. در مدل GPT-3 ابعاد embedding برابر ۱۲ ۲۸۸ است.
- پردازش در لایههای transformer.
- بلوکهای توجه (Attention Blocks): هر token با دیگر tokenهای توالی تعامل دارد. مکانیزم توجه امکان در نظر گرفتن زمینه و تفسیر صحیح معنای کلمات را فراهم میکند.
- لایههای کاملاً متصل (Feed-Forward Layers): پس از توجه، هر token بهصورت جداگانه از طریق یک شبکه عصبی دو لایه با فعالسازی غیرخطی پردازش میشود.
- تبدیل معکوس و Softmax. پس از تمام لایهها، بردار پردازششده با استفاده از ماتریس (W_U) که اغلب نسخه ترانهاده W_E است، به فضای tokenها بازگردانده میشود. بردار logitهای حاصل با استفاده از تابع Softmax نرمالیزه میشود تا توزیع احتمال روی تمام tokenها به دست آید.
- انتخاب token بعدی (Sampling). token بعدی بر اساس توزیع احتمال انتخاب میشود. پارامتر دما (temperature) تصادفی بودن انتخاب را کنترل میکند: در دمای ۰ محتملترین token انتخاب میشود، در دماهای بالاتر احتمال انتخاب گزینههای کمتر محتمل افزایش مییابد که این امر به تنوع بیشتر متن کمک میکند.
مدلهای GPT
- GPT-1 (2018): اولین مدل خانواده؛ transformer با ۱۲ لایه decoder-only؛ آموزش در دو مرحله (پیشآموزش + fine-tuning روی وظایف NLP).
- GPT-2 (2019): ۱٫۵ میلیارد پارامتر؛ آموزش روی پیکره WebText؛ برای اولین بار قادر به تولید متون بلند و منسجم؛ بهبود کیفیت تولید zero-shot. در ۱۴ فوریه ۲۰۱۹ اعلام شد، نسخه کامل (۱٫۵ میلیارد) در ۵ نوامبر ۲۰۱۹ به دلایل امنیتی منتشر شد.
- GPT-3 (2020): ۱۷۵ میلیارد پارامتر؛ آموزش گسترده روی ترکیبی از Common Crawl، Books، Wikipedia؛ توسعه چشمگیر قابلیتهای few-shot و zero-shot.
- GPT-3.5 (2022): نسخه میانی بین GPT-3 و GPT-4؛ پیروی بهتر از دستورالعملها از طریق آموزش با بازخورد انسانی (RLHF) در نسخههای text-davinci-003 و gpt-3.5-turbo؛ پنجره زمینه تا ۴ ۰۹۶ token در نسخههای اولیه و تا ۱۶ ۳۸۵ token در نسخههای بعدی (gpt-3.5-turbo-16k و gpt-3.5-turbo بهروزشده).
- GPT-4 (2023): مدل چندوجهی با ورودی متن و تصویر (پشتیبانی از تصاویر پس از راهاندازی متنی، در مرحله بعدی اضافه شد)؛ پنجره زمینه ۸ ۱۹۲ token در نسخه پایه و ۳۲ ۷۶۸ token در نسخه GPT-4-32k؛ بهبود چشمگیر دقت، پایداری و منطق استدلال.
- GPT-4 Turbo (2023): نسخه بهینهشده GPT-4؛ پنجره زمینه افزایشیافته تا ۱۲۸ ۰۰۰ token؛ تأخیر و هزینه کمتر.
- GPT-4o (2024): مدل چندوجهی نسل جدید (متن، تصویر، صدا) با معماری یکپارچه شبکه عصبی؛ سرعت و دقت پاسخ بسیار بالا؛ پنجره زمینه ۱۲۸ ۰۰۰ token.
- GPT-4.5 (2025): پیشنمایش پژوهشی (research preview)؛ در system card، OpenAI بیان میکند که مدل «builds on GPT-4o»[2][3]؛ درک بهتر درخواستهای کاربر، کاهش تعداد خطاها؛ پنجره زمینه ۱۲۸ ۰۰۰ token. در API، مدل
gpt-4.5-previewدر ۱۴ آوریل ۲۰۲۵ deprecated اعلام شد و در ۱۴ ژوئیه ۲۰۲۵ غیرفعال شد[4]. - GPT-4.1 (2025): نسخه بهبودیافته خانواده GPT-4 با پنجره زمینه تا ۱ میلیون token؛ متن و تصویر را به عنوان ورودی میپذیرد، متن تولید میکند[5]. همزمان در سه نسخه عرضه شد: GPT-4.1، GPT-4.1 mini، GPT-4.1 nano.
- GPT-5 (2025): سیستم یکپارچه با حالتهای پاسخ سریع و استدلال عمیق؛ پنجره زمینه حدود ۴۰۰ ۰۰۰ token؛ کاهش قابل توجه توهمات در وظایف واقعی.
- GPT-5.1 (2025): استدلال تطبیقی (adaptive reasoning)، بهبود در coding و long-context retention.
- GPT-5.2 (2025): تمرکز بر کار حرفهای؛ حالت Pro برای وظایف frontier؛ بر پایه GPT-5.2 مدل عاملی GPT-5.2-Codex عرضه شد.
- GPT-5.3-Codex (2026): مدل عاملی coding که قابلیتهای coding و reasoning را ادغام میکند؛ ۲۵٪ سریعتر از نسلهای قبل.
- GPT-5.3 Instant (2026): بهروزرسانی پرکاربردترین مدل مکالمهای ChatGPT؛ در ۳ مارس ۲۰۲۶ عرضه شد. دقت واقعی، کیفیت جستجوی وب، روانی گفتگو بهبود یافته و تعداد ردکردنهای اضافی و احتیاطهای مفرط کاهش یافته است. در API به عنوان
gpt-5.3-chat-latestدر دسترس است[6]. - GPT-5.4 (2026): مدل frontier OpenAI برای کار حرفهای، معرفیشده در ۵ مارس ۲۰۲۶؛ اولین مدل general-purpose OpenAI با قابلیتهای بومی computer use. در API، مدل
gpt-5.4به عنوان مدل پیشفرض برای طیف گستردهای از وظایف general-purpose و coding توصیه میشود[7][8].
GPT-1
اولین مدل، GPT-1، در سال ۲۰۱۸ توسط OpenAI در مقاله «Improving Language Understanding by Generative Pre-Training» معرفی شد. مدل یک transformer با ۱۲ لایه decoder-only بود[9] و بر پایه معماری transformer ساخته شده بود. آموزش GPT-1 در دو مرحله انجام شد: مرحله پیشآموزش مولد نظارتنشده (pre-training) و به دنبال آن مرحله تنظیم دقیق نظارتشده (fine-tuning).
در مرحله پیشآموزش، مدل روی پیکره BookCorpus آموزش دید که شامل بیش از ۷ ۰۰۰ کتاب منتشرنشده از ژانرهای مختلف بود. ویژگی خاص این پیکره وجود متنهای پیوسته طولانی بود که برای توسعه توانایی مدل در پردازش وابستگیهای متنی پیچیده و کشیده حیاتی بود.
در مرحله fine-tuning، مدل برای حل وظایف تخصصی پردازش زبان طبیعی تطبیق یافت، از جمله:
- پاسخ به سؤالات (Question Answering, QA) — تولید پاسخ صحیح بر اساس زمینه متنی دادهشده;
- تشخیص استلزام متنی (Natural Language Inference, NLI) — تعیین رابطه منطقی بین دو متن: استلزام، تناقض یا خنثی بودن;
- ارزیابی شباهت معنایی (Semantic Textual Similarity) — اندازهگیری میزان نزدیکی معنایی بین دو توالی متنی.
با این رویکرد، GPT-1 برتری قابل توجهی نسبت به مدلهای قبلی در تعدادی از benchmarkهای استاندارد برای وظایف درک متن نشان داد.
توسعه GPT-1 تعدادی از دستاوردها و کشفیات کلیدی در حوزه پردازش زبان طبیعی (NLP) را به نمایش گذاشت:
- کارایی پیشآموزش مولد. بهصورت تجربی تأیید شد که پیشآموزش روی پیکرههای بزرگ متن برچسبنخورده به مدل این امکان را میدهد که بازنماییهای زبانی جهانی کسب کند که برای استفاده بعدی در وظایف کاربردی مختلف بدون نیاز به تغییرات معماری اساسی مناسب است.
- تطبیقپذیری معماری transformer. استفاده از transformer رمزگشای چندلایه به مدل امکان داد که وابستگیهای بلندمدت در متن را با موفقیت پردازش کند، که پیش از آن برای مدلهای مبتنی بر شبکههای عصبی بازگشتی دشوار بود.
- کاهش وابستگی به دادههای برچسبگذاریشده. پژوهش تأیید کرد که پیشآموزش در مقیاس بزرگ روی دادههای برچسبنخورده میتواند حجم دادههای برچسبگذاریشده مورد نیاز برای دستیابی به کیفیت بالا در وظایف هدف را به میزان قابل توجهی کاهش دهد.
- پایهای برای توسعههای بعدی. نتایج GPT-1 مبانی مفهومی و فنی را برای نسخههای بعدی خانواده مدلهای GPT (GPT-2، GPT-3 و بعد) پایهگذاری کرد.
GPT-2
مدل GPT-2 در ۱۴ فوریه ۲۰۱۹ توسط OpenAI اعلام شد. از نظر اندازه بهطور قابل توجهی از پیشین خود پیشی گرفت: نسخه کامل مدل حدود ۱٫۵ میلیارد پارامتر داشت. به دلایل امنیتی، OpenAI در ابتدا تنها نسخههای کوچکشده مدل را منتشر کرد؛ نسخه کامل (۱٫۵ میلیارد پارامتر) در ۵ نوامبر ۲۰۱۹ عرضه شد. برخلاف GPT-1 که روی پیکره BookCorpus (~۵ گیگابایت) آموزش دیده بود، GPT-2 روی پیکره ویژه WebText با حجم حدود ۴۰ گیگابایت آموزش دید که شامل دادههای متنی از منابع اینترنتی با درجه کیفیت بالا بود. افزایش هم اندازه مدل و هم حجم دادههای آموزشی به GPT-2 امکان داد که کیفیت تولید متن را بهطور قابل توجهی بهبود بخشد: مدل توانایی تولید مقالات، داستانها و حتی قطعات منسجم از نثر ادبی را نشان داد.
در GPT-2 از معماری transformer خودبازگشتی decoder استفاده شد، مشابه GPT-1، بدون تغییرات اساسی. مدل از ۴۸ لایه self-attention تشکیل شده بود، اندازه حالت پنهان ۱۶۰۰ بود و حدود ۱٫۵ میلیارد پارامتر داشت. تعداد headهای توجه ۲۵ بود (با حفظ اندازه ۶۴ به ازای هر head که از GPT-1 به ارث رسیده بود: ۱۶۰۰ ÷ ۶۴ = ۲۵). آموزش روی وظیفه پیشبینی token بعدی بر اساس زمینه قبلی با استفاده از مکانیزم توجه ماسکشده انجام شد.
یکی از تمایزات اصلی GPT-2 این بود که مدل برای اولین بار کارایی بالا در حالت zero-shot learning را نشان داد — توانایی حل وظایف جدید بدون انجام fine-tuning صریح روی نمونههای آن وظایف. مدل روی پیکرهای بزرگ از متون عمومی آموزش دید و آموزش تخصصی روی دادههای وظایف خاص را طی نکرد. ارزیابی در حالت zero-shot انجام شد، که در آن مدل وظایف را صرفاً بر اساس دانش کسبشده در فرآیند پیشآموزش انجام میداد. در برخی وظایف مدلسازی زبانی، GPT-2 به کیفیتی قابل مقایسه یا برتر از نتایج مدلهایی که بهطور ویژه روی مجموعه دادههای تخصصی آموزش دیده بودند (مثلاً ویکیپدیا، متون خبری، کتابها) دست یافت.
GPT-3
مدل GPT-3 در ژوئن ۲۰۲۰ توسط OpenAI معرفی شد (مقاله در arXiv در ۲۸ مه ۲۰۲۰ ظاهر شد، دسترسی بتا به API در ۱۱ ژوئن ۲۰۲۰ گشوده شد). این مدل گام بعدی در توسعه transformerهای مولد پس از GPT-2 بود و با مقیاسبندی معماری تا ۱۷۵ میلیارد پارامتر متمایز شد، که در آن زمان آن را به بزرگترین مدل زبانی تبدیل کرد.
معماری GPT-3 اساساً همان باقی ماند — transformer رمزگشای خودبازگشتی چندلایه بدون تغییرات اساسی. بهبودهای اصلی عملکرد از طریق افزایش تعداد لایهها، عرض لایههای پنهان و مقیاسهای آموزش حاصل شد. مدل روی ترکیبی از چندین پیکره بزرگ متن آموزش دید، از جمله Common Crawl، WebText2، Books1، Books2 و ویکیپدیا. حجم کل دادهها حدود ۵۷۰ گیگابایت و بیشتر بود (۵۷۰ گیگابایت مربوط به بخش فیلترشده Common Crawl است که در مخلوط آموزشی غالب است).
یکی از ویژگیهای اصلی GPT-3 توانایی آن در few-shot learning و zero-shot learning بود: مدل میتوانست طیف گستردهای از وظایف پردازش زبان طبیعی، از جمله ترجمه، خلاصهسازی، پاسخ به سؤالات، نوشتن مقاله و حتی برنامهنویسی را صرفاً بر اساس چند نمونه در درخواست متنی یا اصلاً بدون نمونه انجام دهد.
GPT-3.5
مدل GPT-3.5 در اواخر ۲۰۲۲ توسط OpenAI در چارچوب توسعه تکاملی خانواده GPT معرفی شد. این مدل بر پایه معماری transformer رمزگشای خودبازگشتی مقیاسشده استفادهشده در GPT-3 با بهبودهایی در کیفیت تولید متن، پردازش زمینه و توانایی پیروی از دستورالعملهای پیچیده ساخته شد. تعداد دقیق پارامترهای GPT-3.5 بهطور رسمی افشا نشده است؛ احتمالاً نسخههای davinci از نظر اندازه قابل مقایسه با GPT-3 (۱۷۵ میلیارد) هستند، اما پارامترهای دقیق نسخه gpt-3.5-turbo ناشناخته است.
آموزش GPT-3.5 شامل استفاده گستردهتر از روشهای یادگیری تقویتی بر اساس بازخورد انسانی (Reinforcement Learning from Human Feedback, RLHF) در نسخههای text-davinci-003 و gpt-3.5-turbo بود. در این میان، نسخه زودتر text-davinci-002 با استفاده از supervised fine-tuning (SFT) و نه RLHF آموزش دید. مدل روی پیکرههای متنی گسترده آموزش دید که شامل Common Crawl، Books، WebText و سایر منابع با کیفیت بالا بود. پنجره زمینه در نسخههای اولیه محبوب (gpt-3.5-turbo) برابر ۴ ۰۹۶ token بود؛ بعداً OpenAI نسخههای بهروزشده با زمینه تا ۱۶ ۳۸۵ token منتشر کرد[10].
در عمل، GPT-3.5 برای حل طیف گستردهای از وظایف پردازش زبان طبیعی تطبیق یافت، مانند:
- تولید متن منسجم و منطقی;
- پاسخ به سؤالات (QA) و درک زمینه;
- پیروی از دستورالعملهای چندمرحلهای;
- حفظ بهتر زمینه بلندمدت در گفتگوها.
بر اساس GPT-3.5 چندین نسخه کلیدی برای اهداف مختلف عرضه شد:
- text-davinci-002 — اولین مدل عمومی مبتنی بر GPT-3.5، بهینهشده برای تولید و پیروی از دستورالعملها (آموزشدیده با SFT).
- text-davinci-003 — نسخه بهبودیافته با توانایی بیشتر در استدلال و تولید متون پیچیده (آموزشدیده با RLHF).
- gpt-3.5-turbo — کارآمدترین و اقتصادیترین نسخه GPT-3.5 که از اواخر ۲۰۲۲ در سرویس ChatGPT استفاده میشد.
GPT-4
مدل GPT-4 در ۱۴ مارس ۲۰۲۳ توسط OpenAI در مقاله "GPT-4 Technical Report" معرفی شد. این مدل مرحله بعدی توسعه خانواده مدلهای زبانی بود که بهبودهای قابل توجهی در زمینه درک متن، تولید پاسخهای معنادار و خلاقانه، و همچنین پردازش دادههای چندوجهی ارائه داد. تعداد دقیق پارامترها و جزئیات معماری مدل بهطور رسمی افشا نشده است — گزارش فنی GPT-4 صراحتاً بیان میکند که اطلاعات مربوط به معماری، اندازه مدل، سختافزار، هزینههای محاسباتی آموزش و ساخت datasetها منتشر نمیشود[11]. بر اساس برآوردهای خارجی غیررسمی، GPT-4 ممکن است از رویکرد Mixture of Experts (MoE) استفاده کرده باشد و مقیاس کلی حدود ۱٫۸ تریلیون پارامتر داشته باشد، اما OpenAI این ارقام را رسماً نه تأیید کرده و نه رد کرده است[12].
GPT-4 یک مدل چندوجهی است که قادر به دریافت هم متن و هم تصویر به عنوان ورودی است. لازم به ذکر است که در زمان راهاندازی اولیه در مارس ۲۰۲۳ فقط وجه متنی در دسترس بود؛ پشتیبانی از ورودی تصویر بعداً اضافه شد. پنجره زمینه در نسخه پایه ۸ ۱۹۲ token و در نسخه GPT-4-32k برابر ۳۲ ۷۶۸ token بود. مدل از روشهای RLHF (یادگیری تقویتی بر اساس بازخورد انسانی) استفاده کرد.
آموزش GPT-4 روی ترکیبی از پیکرههای متنی و چندوجهی در مقیاس بزرگ انجام شد. جزئیات خاص دادههای آموزشی، سختافزار و روششناسی در انتشارات رسمی OpenAI افشا نشده است.
آموزش در چند مرحله انجام شد:
- پیشآموزش نظارتنشده گسترده روی متون و تصاویر،
- تنظیم دقیق نظارتشده (supervised fine-tuning) روی وظایف تخصصی،
- مرحله نهایی یادگیری تقویتی بر اساس بازخورد انسانی (RLHF) برای افزایش قابلیت اطمینان، ایمنی و کیفیت تفسیر دستورالعملها.
بر اساس GPT-4 چندین نسخه اصلی عرضه شد:
- GPT-4 (مارس 2023): نسخه پایه با پشتیبانی از ورودی متن (پشتیبانی از تصاویر بعداً اضافه شد)؛ پنجره زمینه ۸ ۱۹۲ token؛ همچنین نسخه GPT-4-32k با زمینه ۳۲ ۷۶۸ token عرضه شد.
- GPT-4 Turbo (نوامبر 2023): نسخه بهینهشده GPT-4 با پنجره زمینه افزایشیافته تا ۱۲۸ ۰۰۰ token[13]؛ هزینه محاسباتی کمتر و تولید سریعتر؛ پشتیبانی از حالتهای فراخوانی تابع (function calling) و خروجی JSON.
- GPT-4o (مه 2024): نسخه چندوجهی نسل جدید؛ در اعلامیه راهاندازی به عنوان مدل omni معرفی شد که قادر به کار با متن، تصویر و صدا در زمان واقعی است (برخلاف GPT-4 Turbo که وجههای مختلف توسط ماژولهای جداگانه پشتیبانی میشدند)؛ در عین حال مدل پایه API،
gpt-4o، به عنوان text+image input, text output توصیف میشود؛ پنجره زمینه ۱۲۸ ۰۰۰ token. - GPT-4.5 (فوریه 2025): پیشنمایش پژوهشی (research preview)؛ در system card، OpenAI صراحتاً بیان میکند که مدل «builds on GPT-4o»[3]؛ تولید بهتر متون پیچیده، دقت بالاتر در اجرای دستورالعملها و کاهش سطح توهمات؛ پنجره زمینه ۱۲۸ ۰۰۰ token. به عنوان «آخرین مدل OpenAI بدون chain-of-thought» توصیف شد (نام کدی — Orion)[14]. در API، مدل
gpt-4.5-previewدر ۱۴ آوریل ۲۰۲۵ deprecated اعلام شد و در ۱۴ ژوئیه ۲۰۲۵ غیرفعال شد[4]. - GPT-4.1 (آوریل 2025): نسخه پایدار با گسترش چشمگیر زمینه تا ۱ ۰۴۷ ۵۷۶ token؛ متن و تصویر را به عنوان ورودی میپذیرد، متن تولید میکند[15]؛ همزمان در سه نسخه عرضه شد (GPT-4.1، GPT-4.1 mini، GPT-4.1 nano)؛ ابتدا فقط از طریق API در دسترس بود، بعداً در ChatGPT نیز مستقر شد.
GPT-5
۷ اوت ۲۰۲۵ OpenAI مدل GPT‑5 را به عنوان «باهوشترین، سریعترین و مفیدترین» مدل خود در آن زمان معرفی کرد، با حالت استدلال عمیق (thinking) داخلی و تمرکز بر سناریوهای عملی — نوشتن، برنامهنویسی، کار با اطلاعات سلامت و درک چندوجهی. GPT‑5 به تدریج به مدل پیشفرض برای اکثر کاربران احراز هویتشده ChatGPT تبدیل شد و مدلهای قبلاً استفادهشده از خانواده GPT‑4/4o و سری o را جایگزین کرد.[16]
GPT‑5 به عنوان یک سیستم یکپارچه با دو حالت اصلی کار پیادهسازی شده است: پاسخهای سریع و اقتصادی برای درخواستهای روزانه (بهصورت مشروط gpt‑5 main) و استدلال عمیق برای وظایف پیچیده (بهصورت مشروط gpt‑5 thinking). انتخاب حالت بهطور خودکار توسط یک مسیریاب انجام میشود که نوع گفتگو، پیچیدگی درخواست، نیاز به ابزارها و راهنماییهای صریح کاربر (مثلاً «think step by step» یا «analyze in depth») را در نظر میگیرد. در ChatGPT، حالتهای Auto / Instant / Thinking / Pro در دسترس کاربر هستند؛ نسخههای mini و nano عمدتاً مدلهای API هستند، و mini در محصول کاربری میتواند به عنوان fallback پس از اتمام محدودیت استفاده شود[17].
از طریق رابط برنامهنویسی، چندین اندازه و پیکربندی GPT‑5 ارائه میشود؛ در مستندات OpenAI نسخههای اصلی gpt‑5، gpt‑5‑mini و gpt‑5‑nano (همه آنها متن و دادههای بصری را پشتیبانی میکنند) ذکر شدهاند. حداکثر پنجره زمینه کلی برای خانواده GPT‑5 در API حدود ۴۰۰ ۰۰۰ token است (با تقسیم بودجهها بر ورودی و استدلال/خروجی)، در حالی که محدودیتهای خاص بسته به نسخه مدل و محصول انتخابشده میتوانند متفاوت باشند[18].
بر اساس تعدادی از benchmarkهای جستجوی وب و واقعبینانه، GPT‑5 کاهش قابل توجهی در فراوانی توهمات و خطاها نسبت به مدلهای GPT‑4o و مدلهای «thinking» قدیمیتر OpenAI نشان میدهد. در اعلامیه رسمی OpenAI، برآوردهایی از کاهش خطا حدود ۴۵٪ نسبت به GPT-4o و حدود ۸۰٪ نسبت به o3 در حالت thinking ارائه شد — این نتایج در شرایط خاص به دست آمدند: با جستجوی وب فعال روی promptهای ناشناسسازیشده نماینده ترافیک تولیدی ChatGPT[19].
GPT-5.1
مدل GPT-5.1 در ۱۲ نوامبر ۲۰۲۵ توسط OpenAI به عنوان اولین تکرار قابل توجه پس از GPT-5 پایه معرفی شد، با هدف بهبود تعامل روزانه، مکالمهای بودن و تطبیقپذیری. مدل سیستم یکپارچه را با حالت سریع (GPT-5.1 Instant) و استدلال عمیق (GPT-5.1 Thinking) حفظ میکند، اما تفکر تطبیقی (adaptive reasoning) را معرفی میکند: مدل بهصورت پویا حجم محاسبات را بر اساس پیچیدگی درخواست تعیین میکند، که آن را در وظایف ساده بدون از دست دادن کیفیت در وظایف پیچیده قابل توجهی سریعتر میکند.
آموزش GPT-5.1 بر پایه GPT-5 با یک مرحله پسآموزش اضافی شامل RLHF گستردهتر، تمرکز بر طبیعی بودن لحن و کاهش «سردی» پاسخها بنا شد. پنجره زمینه در API برابر ۴۰۰ ۰۰۰ token، حداکثر خروجی ۱۲۸ ۰۰۰ token است[20]. پشتیبانی از حافظه پنهان گستردهشده prompt تا ۲۴ ساعت اضافه شد که هزینه و تأخیر را در گفتگوهای چندمرحلهای بهطور قابل توجهی کاهش میدهد[21].
ویژگیهای کلیدی:
- GPT-5.1 Instant — حالت اصلی برای وظایف روزانه؛ برای اولین بار از adaptive reasoning استفاده میکند تا تعیین کند چه زمانی باید قبل از پاسخ به درخواست پیچیدهتر «فکر کرد»[21].
- GPT-5.1 Thinking — تخصیص تطبیقی زمان برای استدلال؛ بر اساس دادههای OpenAI، در توزیع نماینده وظایف ChatGPT، مدل تقریباً دو برابر سریعتر در سادهترین وظایف و تقریباً دو برابر کندتر در سختترین وظایف نسبت به GPT-5 Thinking است[21].
- بهبود چندوجهی (متن + vision).
- بهبود سناریوهای coding و agentic، و همچنین کارایی در وظایف ساده از طریق adaptive reasoning و extended prompt caching[22].
GPT-5.2
مدل GPT-5.2 در ۱۱ دسامبر ۲۰۲۵ به عنوان «توانمندترین مدل سری برای کار حرفهای و آموزش» عرضه شد. این تکامل GPT-5.1 است با تأکید بر ارزش اقتصادی: تولید جداول، ارائهها، کدهای پیچیده، وظایف end-to-end. سیستم یکپارچه را با حالتهای Instant، Thinking و حالت جدید Pro (برای وظایف نیازمند حداکثر compute و زمان استدلال) حفظ میکند.
آموزش شامل پیکره بهروزشده با knowledge cutoff اوت ۲۰۲۵، instruction-tuning تقویتشده و RLHF برای کاهش خطاها در سناریوهای چندمرحلهای بود. زمینه — ۴۰۰K token (۱۲۸K حداکثر خروجی). مدل در سناریوهای حرفهای قابل اطمینانتر شد، با دقت واقعی بهتر و استفاده بهتر از ابزارها.
بر اساس GPT-5.2 در ۱۸ دسامبر ۲۰۲۵ مدل تخصصی GPT-5.2-Codex عرضه شد — یک مدل عاملی coding با فشردهسازی بهبودیافته زمینه (context compaction)، پشتیبانی از Windows، امنیت سایبری تقویتشده و long-horizon reasoning (وظایف تا چند ساعت).
بر اساس وضعیت تا ۱۳ فوریه ۲۰۲۶، پس از از رده خارج شدن تعدادی از مدلهای قدیمی، GPT-5.2 بهطور موقت به مدل پیشفرض در ChatGPT تبدیل شد. اما در اوایل مارس ۲۰۲۶ این نقش به GPT‑5.3 Instant و GPT‑5.4 منتقل شد[17].
GPT-5.3-Codex
GPT-5.3-Codex در ۵ فوریه ۲۰۲۶ به عنوان «قدرتمندترین مدل عاملی coding تا به امروز» معرفی شد. این ادغام قابلیتهای frontier-coding مدل GPT-5.2-Codex با استدلال حرفهای GPT-5.2 در یک مدل واحد است که ۲۵٪ سریعتر از نسلهای قبل است.
مدل قادر به انجام تقریباً هر وظیفهای از توسعهدهنده است: جریانهای کاری long-running، تحقیق، استفاده از ابزار، اجرای کد، interactive steering (کاربر میتواند در زمان واقعی بدون از دست دادن زمینه مداخله کند). نسخههای اولیه مدل توسط تیم OpenAI برای اشکالزدایی آموزش، استقرار و ارزیابیهای خود استفاده شد.
نتایج کلیدی در زمان اعلامیه ۵ فوریه ۲۰۲۶: Terminal-Bench حدود ۷۷٫۳٪، OSWorld-Verified حدود ۶۴٫۷٪، SWE-Bench Pro حدود ۵۶٫۸٪. در انتشار بعدی GPT-5.4 در ۵ مارس ۲۰۲۶، OpenAI نتیجه بهروزشده OSWorld-Verified برابر ۷۴٫۰٪ را برای GPT-5.3-Codex با استفاده از پارامتر جدید API که وضوح اصلی تصویر را حفظ میکند ارائه داد[23][7].
در ۱۲ فوریه ۲۰۲۶، OpenAI همچنین GPT-5.3-Codex-Spark را عرضه کرد — نسخه فشرده ultra-fast در مشارکت با Cerebras، بهینهشده برای زمان واقعی: بیش از ۱۰۰۰ token در ثانیه، text-only، زمینه ۱۲۸K. در ابتدا این یک rollout برای کاربران ChatGPT Pro در Codex و تعداد کمی از API design partners بود، نه یک مدل API با دسترسی گسترده[24].
GPT-5.4
۵ مارس ۲۰۲۶ OpenAI مدل GPT‑5.4 را به عنوان مدل frontier جدید برای کار حرفهای معرفی کرد. GPT‑5.4 نقاط قوت آخرین انتشارات OpenAI در reasoning، coding و agentic workflows را ادغام میکند و برای اولین بار در خط اصلی قابلیتهای داخلی computer use دریافت کرد. همزمان OpenAI GPT‑5.4 Pro را عرضه کرد — نسخهای برای سختترین وظایف که از محاسبات بیشتر و استدلال طولانیتر استفاده میکند[7].
در API، مدل gpt-5.4 به عنوان پیشفرض توصیهشده برای طیف گستردهای از وظایف general-purpose و coding توصیف میشود؛ پنجره زمینه ۱ ۰۵۰ ۰۰۰ token، حداکثر خروجی ۱۲۸ ۰۰۰ token است. مدل متن و تصاویر را به عنوان ورودی میپذیرد و متن تولید میکند[8][25].
در ChatGPT، حالت Auto بر اساس وضعیت تا ۷ مارس ۲۰۲۶ بهطور خودکار بین GPT‑5.3 Instant و GPT‑5.4 Thinking جابجا میشود، در حالی که GPT‑5.4 Pro به عنوان حالت جداگانه با قابلیت بالا در دسترس است. برای کاربران وارد شده به ChatGPT، مدل پیشفرض GPT‑5.3 است[17].
توسعه مدلهای GPT
| نسل | سال انتشار | تعداد پارامترها | اندازه پیکره متنی | ویژگیهای کلیدی |
|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 میلیون[26] | ≈5 گیگابایت (BooksCorpus) | پیشآموزش مولد روی پیکرههای بزرگ؛ آموزش دومرحلهای (pre-training + fine-tuning) |
| GPT-2 | 2019 | 1.5 میلیارد | ≈40 گیگابایت (WebText) | تولید متن بهطور قابل توجهی بهبودیافته؛ نمایش رفتار قوی zero-shot؛ انتشار اولیه جزئی مدل |
| GPT-3 | 2020 | 175 میلیارد | ≈570 گیگابایت (Common Crawl, WebText2 و دیگران) | in-context learning در مقیاس بزرگ؛ قابلیتهای برجسته few-shot و zero-shot بدون fine-tuning |
| GPT-3.5 | 2022 | افشا نشده (نسخههای davinci احتمالاً ~175 میلیارد) | >570 گیگابایت + پیکرههای اضافی و instruction tuning | پایداری بهبودیافته و پیروی از دستورالعملها؛ پایه نسخههای اولیه ChatGPT |
| GPT-4 | 2023 | افشا نشده[27] | افشا نشده | چندوجهی (متن + تصویر)؛ دقت بیشتر و مقاومت بهتر در برابر توهمات؛ زمینه 8k/32k token |
| GPT-4 Turbo | 2023 | افشا نشده | مبتنی بر آموزش GPT-4 (جزئیات افشا نشده) | افزایش زمینه تا 128,000 token؛ بهینهسازی سرعت و هزینه تولید |
| GPT-4o | 2024 | افشا نشده | دادههای چندوجهی (متن، تصویر، صدا) | پردازش چندوجهی با معماری یکپارچه شبکه عصبی؛ سرعت پاسخ بالا |
| GPT-4.5 | 2025 | افشا نشده | پیکرههای متنی و چندوجهی گستردهتر | Research preview بر پایه GPT-4o؛ کاهش خطاها؛ deprecated تا سال 2026 |
| GPT-4.1 | 2025 | افشا نشده | پیکرههای بهروزشده | زمینه تا 1,047,576 token؛ متن + تصویر ورودی، متن خروجی |
| GPT-5 | 2025 (اوت) | افشا نشده | پیکرههای چندوجهی در مقیاس بزرگ | سیستم یکپارچه با حالتهای پاسخ سریع و استدلال؛ زمینه ~400K token؛ کاهش توهمات |
| GPT-5.1 | 2025 (نوامبر) | افشا نشده | پیکرههای گستردهشده GPT-5 + RLHF | استدلال تطبیقی؛ prompt caching 24 ساعته؛ بهبودها در coding |
| GPT-5.2 | 2025 (دسامبر) | افشا نشده | Knowledge cutoff اوت 2025 | حالت Pro؛ کار دانشی حرفهای؛ GPT-5.2-Codex (coding عاملی) |
| GPT-5.3-Codex | 2026 (فوریه) | افشا نشده | پیکرههای بهروزشده + داده self-improvement | 25٪ سریعتر؛ agent طیف کامل؛ interactive steering |
| GPT-5.3-Codex-Spark | 2026 (فوریه) | افشا نشده | فشرده | >1000 t/s روی Cerebras؛ coding زمان واقعی؛ زمینه 128K |
| GPT-5.3 Instant | 2026 (مارس) | افشا نشده | افشا نشده | بهروزرسانی پرکاربردترین مدل مکالمهای ChatGPT؛ بهبود factuality، web search و conversational flow |
| GPT-5.4 | 2026 (مارس) | افشا نشده | افشا نشده | مدل frontier جدید برای کار حرفهای؛ computer use بومی؛ مدل پیشفرض در API برای وظایف general-purpose و اکثر coding |
| GPT-5.4 Pro | 2026 (مارس) | افشا نشده | افشا نشده | نسخه GPT-5.4 با compute بیشتر برای سختترین وظایف |
پارامترهای معماری مدلهای GPT
| مدل | سال انتشار | تعداد پارامترها | تعداد لایهها | اندازه حالت پنهان | تعداد headهای توجه | پنجره زمینه | اندازه پیکره آموزشی |
|---|---|---|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 میلیون | 12 | 768 | 12 | 512 token | ≈5 گیگابایت (BooksCorpus) |
| GPT-2 | 2019 | 1.5 میلیارد | 48 | 1,600 | 25 | 1,024 token | ≈40 گیگابایت (WebText) |
| GPT-3 | 2020 | 175 میلیارد | 96 | 12,288 | 96 | 2,048 token | ≈570 گیگابایت (Common Crawl + WebText2 + دیگران) |
| GPT-3.5 | 2022 | افشا نشده (نسخههای davinci احتمالاً ~175 میلیارد) | (تخمیناً نزدیک به GPT-3) | (تخمیناً نزدیک به GPT-3) | (افشا نشده) | تا 4,096 token (اولیه)؛ تا 16,385 token (بعدی) | Common Crawl گستردهشده + datasetهای اضافی و instruction tuning |
| GPT-4 | 2023 | افشا نشده | (افشا نشده) | (افشا نشده) | (افشا نشده) | 8,192 token (پایه)؛ 32,768 (GPT-4-32k) | افشا نشده |
| GPT-4 Turbo | 2023 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | تا 128,000 token | نسخه بهینهشده GPT-4 (جزئیات پیکره افشا نشده) |
| GPT-4o | 2024 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | تا 128,000 token | دادههای چندوجهی: متن، تصویر، صدا |
| GPT-4.5 | 2025 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | تا 128,000 token | پیکرههای متنی و چندوجهی بهروزشده |
| GPT-4.1 | 2025 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | تا 1,047,576 token | چندوجهی؛ آموزش مقیاسشده با تأکید بر زمینههای بلند |
| GPT-5 | 2025 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | تا ≈400,000 token (زمینه کلی) | پیکرههای چندوجهی در مقیاس بزرگ (جزئیات افشا نشده) |
| GPT-5.4 | 2026 | (افشا نشده) | (افشا نشده) | (افشا نشده) | (افشا نشده) | 1,050,000 token؛ 128,000 حداکثر خروجی | افشا نشده |
پیوندها
- «Improving language understanding with unsupervised learning»، OpenAI، ۱۱ ژوئن ۲۰۱۸
- «Better language models and their implications»، OpenAI، ۱۴ فوریه ۲۰۱۹
- «GPT-2: 6-month follow-up»، OpenAI، ۲۰ اوت ۲۰۱۹
- «GPT-2: 1.5B release»، OpenAI، ۵ نوامبر ۲۰۱۹
- «Language models are few-shot learners»، OpenAI، ۲۸ مه ۲۰۲۰
- «OpenAI API»، OpenAI، ۱۱ ژوئن ۲۰۲۰
- «Introducing ChatGPT»، OpenAI، ۳۰ نوامبر ۲۰۲۲
- «Function calling and other API updates»، OpenAI، ۱۳ ژوئن ۲۰۲۳
- «GPT-4»، OpenAI، ۱۴ مارس ۲۰۲۳
- «New models and developer products announced at DevDay»، OpenAI، ۶ نوامبر ۲۰۲۳
- «Hello GPT-4o»، OpenAI، ۱۳ مه ۲۰۲۴
- «Introducing GPT-4.1 in the API»، OpenAI، ۱۴ آوریل ۲۰۲۵
- «Introducing GPT-4.5»، OpenAI، ۲۷ فوریه ۲۰۲۵
- «Introducing GPT-5»، OpenAI، ۷ اوت ۲۰۲۵
- «GPT-5.1: A smarter, more conversational ChatGPT»، OpenAI، ۱۲ نوامبر ۲۰۲۵
- «Introducing GPT-5.2»، OpenAI، ۱۱ دسامبر ۲۰۲۵
- «Introducing GPT-5.2-Codex»، OpenAI، ۱۸ دسامبر ۲۰۲۵
- «Introducing GPT-5.3-Codex»، OpenAI، ۵ فوریه ۲۰۲۶
- «Introducing GPT-5.3-Codex-Spark»، OpenAI، ۱۲ فوریه ۲۰۲۶
- «GPT-5.3 Instant: Smoother, more useful everyday conversations»، OpenAI، ۳ مارس ۲۰۲۶
- «Introducing GPT-5.4»، OpenAI، ۵ مارس ۲۰۲۶
- «Using GPT-5.4»، OpenAI Developers
- «Models»، OpenAI API
- «Deprecations»، OpenAI API
- «GPT-5.3 and GPT-5.4 in ChatGPT»، OpenAI Help Center
- «Retiring GPT-4o and other ChatGPT models»، OpenAI Help Center
منابع
- Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
یادداشتها
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
- ↑ OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
- ↑ 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
- ↑ 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
- ↑ 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
- ↑ 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
- ↑ OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
- ↑ Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
- ↑ Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
- ↑ Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025).
- ↑ 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
- ↑ OpenAI API documentation. Models: GPT-5.
- ↑ OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
- ↑ OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
- ↑ 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
- ↑ OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
- ↑ OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
- ↑ OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
- ↑ OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
- ↑ Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
- ↑ По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.