GPT-4o (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (تلفظ: «جی‑پی‑تی‑فور‑اوه»؛ حرف «o» از لاتین omni به معنای «همه» و «فراگیر») — یک مدل زبانی بزرگ (LLM) چندوجهی از خانواده GPT است که توسط شرکت OpenAI توسعه یافته و در ۱۳ مه ۲۰۲۴ معرفی شد[1]. GPT‑4o نخستین مدل OpenAI بود که به‌صورت یک شبکه عصبی سرتاسری یکپارچه (end‑to‑end) آموزش دیده و قادر است به‌طور همزمان متن، تصویر و صدا را پردازش کند — برخلاف نسل‌های پیشین که برای هر وجه از مدل‌های جداگانه استفاده می‌کردند[2]. این مدل جایگزین GPT‑4 Turbo به‌عنوان پرچمدار خانواده شد و سرعت تولید دو برابر بالاتر، هزینه API پنجاه درصد کمتر و قابلیت‌های چندوجهی کیفیتاً جدیدی ارائه داد[1]. خانواده GPT‑4o شامل بیش از ۲۰ نوع مختلف است، از جمله GPT‑4o mini فشرده، مدل‌های صوتی، مدل‌های بلادرنگ، مدل‌های جستجو و مدل‌های گفتاری تخصصی[3].

کارت اطلاعات

پارامتر مقدار
نام کامل GPT‑4o (GPT‑4 Omni)
توسعه‌دهنده OpenAI
تاریخ اعلام ۱۳ مه ۲۰۲۴[1]
نوع مدل چندوجهی خودبازگشتی (transformer)[2]
تعداد پارامترها به‌طور رسمی اعلام نشده (تخمین غیررسمی: ~۲۰۰ میلیارد برای GPT‑4o، ~۸ میلیارد برای GPT‑4o mini)[4]
پنجره زمینه ۱۲۸٬۰۰۰ token[3]
حداکثر خروجی ۱۶٬۳۸۴ token (۴٬۰۹۶ برای gpt‑4o‑2024‑05‑13)[3]
تاریخ قطع داده‌های آموزشی اکتبر ۲۰۲۳ (در نسخه‌های بعدی تا ژوئن ۲۰۲۴ به‌روز شد)[2]
توکنایزر o200k_base (۲۰۰٬۰۰۰ token)[1]
وجوه ورودی متن، تصویر، صدا، ویدیو[1]
وجوه خروجی متن، صدا، تصویر (از طریق GPT Image 1)[1][3]
مجوز اختصاصی، کد بسته
کارت سیستم arXiv:2410.21276 (۲۵ اکتبر ۲۰۲۴، ۴۱۷ نویسنده)[2]
شناسه‌های API gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
وضعیت فعلی در API در دسترس است؛ در ۱۳ فوریه ۲۰۲۶ از ChatGPT حذف شد[5]

جایگاه در خانواده مدل‌ها

GPT‑4o در زمان انتشار، جایگاه مدل چندوجهی پرچمدار برای مقاصد عمومی در خانواده GPT را داشت. این مدل جایگزین GPT‑4 Turbo (آوریل ۲۰۲۴) به‌عنوان مدل اصلی برای اکثر وظایف در ChatGPT و API شد و سرعت بالاتر و هزینه کمتری را با حفظ یا بهبود کیفیت در وظایف متنی ارائه داد[1].

این مدل از GPT‑4 Turbo با انتقال از اجزای جداگانه (مدل‌های مجزا برای بینایی و سنتز گفتار) به یک معماری end‑to‑end یکپارچه تکامل یافت. تفاوت‌های کلیدی با مدل‌های مجاور خانواده:

  • در مقایسه با GPT‑4 Turbo (پیشین) — GPT‑4o عملکرد هوشمندانه قابل مقایسه‌ای در زبان انگلیسی و کدنویسی ارائه می‌دهد، اما در وظایف چندزبانه، پردازش تصویر و صدا به‌طور چشمگیری از پیشین خود پیشی می‌گیرد. GPT‑4o دو برابر سریع‌تر و در API پنجاه درصد ارزان‌تر است. تمایز معماری اساسی — چندوجهی بودن بومی (یک مدل به‌جای خط لوله)[1].
  • در مقایسه با GPT‑4.1 (آوریل ۲۰۲۵) — مدل نسل بعدی برای توسعه‌دهندگان API که در اکثر benchmark‌ها از GPT‑4o پیشی می‌گیرد (MMLU: 90.2% در برابر 85.7%، SWE‑bench Verified: 54.6% در برابر 33.2%) با هزینه کمتر؛ در عین حال GPT‑4.1 در رابط ChatGPT ارائه نمی‌شد[4].
  • در مقایسه با GPT‑5 (اوت ۲۰۲۵) — جانشین GPT‑4o در ChatGPT شد، اما کاربران به‌طور گسترده از از دست دادن سبک «گرم» و احساساتی GPT‑4o شکایت داشتند[4].
  • در مقایسه با GPT‑4o mini (ژوئیه ۲۰۲۴) — نسخه فشرده و به‌مراتب ارزان‌تری که جایگزین GPT‑3.5 Turbo در ChatGPT رایگان شد[6].

GPT‑4o نخستین مدل OpenAI بود که برای کاربران رایگان ChatGPT (با محدودیت در تعداد پیام‌ها) در دسترس قرار گرفت[1].

معماری و نوآوری‌های کلیدی

آموزش چندوجهی سرتاسری

نوآوری معماری اصلی GPT‑4o در آموزش سرتاسری یک شبکه عصبی واحد بر داده‌های تمام وجوه به‌طور همزمان است[1][2]. پیش از GPT‑4o، حالت صوتی ChatGPT از طریق یک خط لوله از سه مدل جداگانه کار می‌کرد: Whisper (تشخیص گفتار) ← GPT‑3.5/GPT‑4 (پردازش متن) ← TTS (سنتز گفتار). این خط لوله اطلاعات مربوط به لحن، احساسات، صداهای پس‌زمینه و چند گوینده را از دست می‌داد و تأخیر آن به ۲.۸ ثانیه برای GPT‑3.5 و ۵.۴ ثانیه برای GPT‑4 می‌رسید[1]. GPT‑4o صدا را به‌صورت بومی پردازش می‌کند — زمان پاسخ به‌طور متوسط ۳۲۰ میلی‌ثانیه (حداقل ۲۳۲ میلی‌ثانیه) است که با سرعت واکنش انسان در مکالمه قابل مقایسه است[1][2].

کارت سیستم GPT‑4o چندین ادعای اساسی درباره معماری دارد[2]:

  • مدل یک LLM transformer خودبازگشتی است که token بعدی را بر اساس زمینه چندوجهی پیش‌بینی می‌کند;
  • از یک نمایش یکپارچه از وجوه استفاده می‌شود که بر روی ترکیبی از داده‌های متنی، کدی، ریاضی، بصری، صوتی و ویدیویی آموزش دیده است;
  • آموزش در چندین مرحله انجام شد، از جمله پیش‌آموزش (pre‑training) بر روی corpus‌های بزرگ چندوجهی و سپس fine‑tuning با استفاده از Reinforcement Learning from Human Feedback (RLHF) و red‑teaming.

پارامترها و جزئیات معماری

شرکت OpenAI مشخصات دقیق مدل را — تعداد پارامترها، تعداد لایه‌ها، وجود ساختار MoE و سخت‌افزار مورد استفاده برای آموزش — اعلام نکرده است[2]. تخمین غیررسمی ~۲۰۰ میلیارد پارامتر بر اساس داده‌های یک مقاله تحقیقاتی مایکروسافت است، اما توسط OpenAI تأیید نشده است[4].

توکنایزر o200k_base

GPT‑4o از توکنایزر جدید o200k_base با واژگانی متشکل از ۲۰۰٬۰۰۰ token استفاده می‌کند — دو برابر بیشتر از cl100k_base در GPT‑4[1]. این امر کارایی فشرده‌سازی برای الفبای غیرلاتین را به‌طور چشمگیری بهبود داد: برای مثال، برای گجراتی ۴.۴ برابر، برای تلوگو ۳.۵ برابر و برای مالایالام تا ۴ برابر بهبود ایجاد شد[1]. برای فارسی، روسی، کره‌ای، عربی و زبان‌های دیگر، برای رمزگذاری همان متن به‌طور قابل توجهی به token‌های کمتری نیاز است که این امر چگالی اطلاعاتی پنجره زمینه را افزایش داده و هزینه استفاده از API را کاهش می‌دهد.

سرعت تولید

سرعت تولید GPT‑4o تقریباً دو برابر GPT‑4 Turbo است[1]. بر اساس اندازه‌گیری‌های مستقل Artificial Analysis، نسخه نوامبر ۲۰۲۴ حدود ۱۵۷ token در ثانیه تولید می‌کند و نسخه ChatGPT تا ۱۸۵ token در ثانیه می‌رسد، در حالی که GPT‑4 Turbo تنها ~۲۸ token در ثانیه نشان می‌داد[4].

عملکرد

benchmark‌های متنی

نتایج GPT‑4o بر روی benchmark‌های استاندارد دانشگاهی در زمان انتشار (داده‌های OpenAI، snapshot گوینده gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet توضیح
MMLU (0‑shot CoT) 88.7% 86.5% 88.3% دانش عمومی در ۵۷ رشته
GPQA Diamond (0‑shot CoT) 53.6% 49.1% سؤالات سطح دکتری
MATH (0‑shot CoT) 76.6% 72.2% مسائل ریاضی سطح المپیاد
HumanEval (0‑shot) 90.2% 87.6% 92.0% تولید کد Python
MGSM (ریاضی چندزبانه) 90.5% 88.6% ریاضی در چند زبان
DROP (F1، 3‑shot) 83.4% 85.4% خواندن با درک مطلب
SWE‑bench Verified 33.2% 64% حل مسئله عاملانه

GPT‑4o در ۲۱ از ۲۲ آزمون داخلی و خارجی OpenAI از GPT‑4 Turbo پیشی گرفت؛ تنها رگرسیون در benchmark DROP مشاهده شد[2].

benchmark‌های کار با تصویر

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val، 0‑shot CoT) 69.1% 63.1% 68.3%
MathVista (testmini) 63.8% 58.1% 67.7%
AI2D (test) 94.2% 89.4% 94.7%
ChartQA (test) 85.7% 78.1% 90.8%
DocVQA (test، ANLS) 92.8% 87.2% 95.2%

benchmark‌های پزشکی

کارت سیستم GPT‑4o رشد قابل توجهی در وظایف پزشکی ثبت کرد[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE، 0‑shot) 89% 78%
MMLU Clinical Knowledge (0‑shot) 92% 85%
MMLU Medical Genetics (0‑shot) 96% 93%

رتبه‌بندی LMSYS Chatbot Arena

GPT‑4o در زمان راه‌اندازی رتبه اول را در رتبه‌بندی LMSYS Chatbot Arena با ELO ~1287 کسب کرد[4]. نسخه chatgpt‑4o‑latest از سپتامبر ۲۰۲۴ رکورد 1338 امتیاز را ثبت کرد و دوباره رتبه اول را کسب نمود. پیش از اعلام رسمی، GPT‑4o در Chatbot Arena با نام‌های مستعار gpt2‑chatbot، im‑a‑good‑gpt2‑chatbot و im‑also‑a‑good‑gpt2‑chatbot آزمایش شد؛ در ۷ مه ۲۰۲۴ سم آلتمن با انتشار پست «im‑a‑good‑gpt2‑chatbot» به این موضوع اشاره کرد[4].

شایان ذکر است که تحقیق LMSYS نشان داد رتبه‌های بالای GPT‑4o تا حدی به عوامل سبکی (پاسخ‌های مفصل و خوش‌قالب) نسبت داده می‌شود، نه صرفاً به کیفیت محتوا[4].

قابلیت‌ها و محدودیت‌ها

نقاط قوت

  • چندوجهی بودن بلادرنگ: مدل واحد برای متن، صدا، تصویر و ویدیو با تأخیری قابل مقایسه با واکنش انسان (۲۳۲–۳۲۰ میلی‌ثانیه برای صدا)[1][2].
  • کارایی: سرعت تولید دو برابر بالاتر و هزینه پنجاه درصد کمتر در مقایسه با GPT‑4 Turbo[1].
  • چندزبانگی: پشتیبانی به‌طور چشمگیری بهبودیافته از زبان‌های غیرانگلیسی به لطف توکنایزر جدید و آموزش چندزبانه[1].
  • حوزه‌های تخصصی: نتایج بالا در benchmark‌های پزشکی (MedQA 89%)، علمی و کدنویسی[2].
  • ابزارها: پشتیبانی از function calling، Structured Outputs، تولید جریانی، fine‑tuning[3].
  • صدای احساساتی: توانایی خندیدن، آواز خواندن، تغییر زبان در وسط جمله، تطبیق لحن و انتقال احساسات در حالت صوتی[1].

محدودیت‌های شناخته‌شده

  • توهم‌زایی: مدل مستعد تولید اطلاعات نادرست است، به‌ویژه در حوزه‌های موضوعی کمیاب[2].
  • تاریخ قطع دانش: در snapshot‌های اولیه محدود به اکتبر ۲۰۲۳ است (در نسخه‌های بعدی تا ژوئن ۲۰۲۴ به‌روز شد)[2].
  • غیرقطعی بودن: تنوع پاسخ‌ها برای درخواست‌های یکسان[2].
  • رگرسیون‌ها: در برخی snapshot‌ها کاهش کیفیت نسبت به نسخه‌های قبلی مشاهده شد، به‌ویژه در پیروی از دستورالعمل‌های پیچیده و تولید کد[4].
  • صدا: کاهش robustness در محیط‌های پر سر و صدا، اکو، لهجه‌های غیرمعمول و وقفه‌ها[2].

صدا، قابلیت‌های گفتاری و Realtime API

حالت صوتی پیشرفته (Advanced Voice Mode)

Advanced Voice Mode در ChatGPT کارت ویزیت GPT‑4o شد. برخلاف حالت صوتی قدیمی با خط لوله سه مدله، GPT‑4o صدا را به‌صورت بومی در یک شبکه عصبی یکپارچه پردازش می‌کند و اطلاعات مربوط به لحن، احساسات، لهجه و صداهای پس‌زمینه را حفظ می‌کند[1]. در زمان راه‌اندازی ۵ صدا در دسترس بود: Breeze، Cove، Ember، Juniper و Sky. صدای Sky در ۲۰ مه ۲۰۲۴ به دلیل رسوایی با بازیگر اسکارلت جوهانسون غیرفعال شد (جزئیات بیشتر در بخش «رسوایی پیرامون صدای Sky»)[4].

جدول زمانی استقرار حالت صوتی: نسخه آلفا برای گروه محدودی از کاربران Plus — ۳۰ ژوئیه ۲۰۲۴؛ استقرار کامل برای Plus و Team — سپتامبر ۲۰۲۴. در برخی کشورها (اتحادیه اروپا، بریتانیا، سوئیس و دیگران) راه‌اندازی به تأخیر افتاد. کاربران رایگان به Advanced Voice Mode دسترسی نیافتند[4].

Realtime API

اول اکتبر ۲۰۲۴ OpenAI رابط Realtime API را برای ساخت برنامه‌هایی با گفتار بلادرنگ بر پایه GPT‑4o راه‌اندازی کرد[3]. این API از سه پروتکل اتصال پشتیبانی می‌کند: WebSocket (برنامه‌های سمت سرور)، WebRTC (انتقال جریانی سمت کلاینت با حداقل تأخیر) و SIP (تلفن VoIP، بعداً اضافه شد). قابلیت‌های کلیدی: انتقال جریانی صدا در دو جهت، تشخیص فعالیت صوتی (VAD)، فراخوانی توابع، مدیریت زمینه مکالمه[3].

مدل‌های صوتی در Chat Completions API

مدل‌های gpt‑4o‑audio‑preview امکان ارسال صدا از طریق رابط استاندارد REST در Chat Completions را فراهم می‌کنند (بدون نیاز به حفظ اتصال دائمی). فرمت‌های خروجی پشتیبانی‌شده: WAV، MP3، FLAC، Opus، PCM16. صداهای در دسترس از ۶ به ۱۳ عدد افزایش یافتند: alloy، ash، ballad، coral، echo، fable، nova، onyx، sage، shimmer، verse، marin، cedar؛ صدای قابل تنظیم از طریق API نیز پشتیبانی می‌شود[3].

GPT‑4o mini

GPT‑4o mini در ۱۸ ژوئیه ۲۰۲۴ به‌عنوان «اقتصادی‌ترین مدل کوچک» OpenAI و جایگزین مستقیم GPT‑3.5 Turbo معرفی شد[6]. پنجره زمینه آن ۱۲۸٬۰۰۰ token (در برابر ۱۶٬۳۸۵ در GPT‑3.5 Turbo) و حداکثر خروجی ۱۶٬۳۸۴ token است.

GPT‑4o mini نخستین مدل OpenAI بود که از روش instruction hierarchy استفاده کرد که پایداری در برابر jailbreak، تزریق prompt و استخراج prompt سیستم را افزایش می‌دهد[6]. این مدل از ورودی متن و تصویر، function calling، Structured Outputs، JSON mode، تولید جریانی، fine‑tuning و کش کردن prompt پشتیبانی می‌کند؛ صدا و ویدیو توسط نسخه متنی پایه پشتیبانی نمی‌شوند[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82.0% 77.9% 73.8%
MGSM 87.0% 75.5% 71.7%
HumanEval 87.2% 71.5% 75.9%
MMMU (vision) 59.4% 56.1% 50.2%

در ChatGPT این مدل به‌عنوان مدل پیش‌فرض برای کاربران رایگان و به‌عنوان مدل جایگزین (fallback) هنگام اتمام سهمیه GPT‑4o/GPT‑5 برای مشترکان پولی استفاده می‌شود[6].

فهرست کامل نسخه‌ها و شناسه‌های API

مدل‌های متنی اصلی

شناسه API توضیح تاریخ انتشار حداکثر خروجی
gpt‑4o الیاس ← gpt‑4o‑2024‑08‑06 مه ۲۰۲۴ 16,384
gpt‑4o‑2024‑05‑13 اولین snapshot ۱۳ مه ۲۰۲۴ 4,096
gpt‑4o‑2024‑08‑06 Structured Outputs، کاهش قیمت ۶ اوت ۲۰۲۴ 16,384
gpt‑4o‑2024‑11‑20 بهبود نوشتار خلاقانه ۲۰ نوامبر ۲۰۲۴ 16,384
chatgpt‑4o‑latest الیاس پویای نسخه ChatGPT (deprecated از نوامبر ۲۰۲۵) اوت ۲۰۲۴ 16,384

GPT‑4o mini

شناسه API توضیح تاریخ انتشار
gpt‑4o‑mini الیاس ← gpt‑4o‑mini‑2024‑07‑18 ژوئیه ۲۰۲۴
gpt‑4o‑mini‑2024‑07‑18 تنها snapshot با تاریخ ۱۸ ژوئیه ۲۰۲۴

مدل‌های صوتی و بلادرنگ

شناسه API نوع تاریخ انتشار
gpt‑4o‑audio‑preview Chat Completions با صدا اکتبر ۲۰۲۴
gpt‑4o‑audio‑preview‑2024‑10‑01 اولین snapshot ۱ اکتبر ۲۰۲۴
gpt‑4o‑audio‑preview‑2024‑12‑17 snapshot به‌روزشده ۱۷ دسامبر ۲۰۲۴
gpt‑4o‑audio‑preview‑2025‑06‑03 آخرین snapshot ۳ ژوئن ۲۰۲۵
gpt‑4o‑mini‑audio‑preview نسخه mini صوتی دسامبر ۲۰۲۴
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) اکتبر ۲۰۲۴
gpt‑4o‑mini‑realtime‑preview Realtime mini دسامبر ۲۰۲۴

مدل‌های تخصصی

شناسه API کاربرد تاریخ انتشار
gpt‑4o‑search‑preview جستجو در وب از طریق Chat Completions مارس ۲۰۲۵
gpt‑4o‑mini‑search‑preview جستجوی وب mini مارس ۲۰۲۵
gpt‑4o‑transcribe تشخیص گفتار (STT) مارس ۲۰۲۵
gpt‑4o‑mini‑transcribe تشخیص گفتار mini مارس ۲۰۲۵
gpt‑4o‑mini‑tts سنتز گفتار (TTS) مارس ۲۰۲۵

پشتیبانی از وجوه بر اساس نسخه

نسخه متن → تصویر → صدا → → متن → صدا
gpt‑4o (snapshot‌ها)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

ابزارها و فرمت‌های پشتیبانی‌شده

ابزارها

تمام نسخه‌های GPT‑4o از موارد زیر پشتیبانی می‌کنند: function calling (فراخوانی توابع خارجی)، تولید جریانی (streaming)، fine‑tuning (در snapshot‌های مشخص)، predicted outputs (کاهش تأخیر برای پاسخ‌های قابل پیش‌بینی)[3]. از طریق Assistants/Responses API موارد زیر در دسترس است: Code Interpreter، File Search، Web Search. جستجوی وب از طریق مدل‌های تخصصی gpt‑4o‑search‑preview و gpt‑4o‑mini‑search‑preview پیاده‌سازی شده است[3].

Structured Outputs و JSON mode

Structured Outputs — قابلیتی که با gpt‑4o‑2024‑08‑06 معرفی شد و میزان انطباق بالای خروجی مدل با یک JSON schema داده‌شده را تضمین می‌کند[7]. در ارزیابی‌های داخلی OpenAI، مدل ۱۰۰٪ پیروی از JSON schema‌های پیچیده را نشان داد (در مقایسه با کمتر از ۴۰٪ در gpt‑4‑0613). این قابلیت از طریق مکانیزم constrained decoding در دو شکل پیاده‌سازی شده است: (1) function calling با پارامتر strict: true و (2) response_format با نوع json_schema[7].

JSON mode (response_format: {"type": "json_object"}) — مکانیزم قدیمی‌تری که JSON معتبر را بدون الزام به یک schema خاص تضمین می‌کند[3].

تولید تصویر (GPT Image 1)

در مارس ۲۰۲۵ OpenAI تولید تصویر بر پایه GPT‑4o را با مدل GPT Image 1 راه‌اندازی کرد که جایگزین DALL‑E 3 در ChatGPT شد[4]. این قابلیت یک ترند ویروسی از تولید تصاویر به سبک Studio Ghibli به راه انداخت. در هفته اول بیش از ۱۳۰ میلیون کاربر بیش از ۷۰۰ میلیون تصویر ساختند[4]. GPT Image 1 از طریق API و ChatGPT در دسترس است؛ OpenAI یک ضمیمه جداگانه به کارت سیستم GPT‑4o منتشر کرد که به ایمنی تولید بومی تصویر اختصاص داشت[2].

ایمنی و ارزیابی ریسک‌ها

کارت سیستم GPT‑4o (arXiv:2410.21276، ۴۱۷ نویسنده) نتایج ارزیابی جامع ایمنی بر اساس چارچوب Preparedness را در بر دارد[2]:

دسته ریسک سطح
امنیت سایبری پایین
تهدیدات بیولوژیکی (CBRN) پایین
متقاعدسازی (persuasion) متوسط (مرزی)
استقلال مدل پایین
سطح کلی متوسط

مدل توسط بیش از ۱۰۰ تیم قرمز خارجی از ۲۹ کشور به ۴۵ زبان در چهار مرحله از مارس تا ژوئن ۲۰۲۴ آزمایش شد[2]. ارزیابی‌های مستقل METR افزایش قابل توجهی در قابلیت‌های مستقل نسبت به GPT‑4 نشان ندادند. Apollo Research نتیجه‌گیری کرد که GPT‑4o «بعید است قادر به scheming فاجعه‌بار باشد»[2].

اقدامات حفاظتی کلیدی برای وجه صوتی: تنها صداهای از پیش تنظیم‌شده مجاز هستند (طبقه‌بند خروجی ۱۰۰٪ انحرافات را شناسایی می‌کند)؛ مدل از شناسایی گوینده بر اساس صدا خودداری می‌کند؛ فیلترهایی برای تشخیص موسیقی دارای حق مؤلف پیاده‌سازی شده‌اند؛ تعدیل محتوای صوتی جنسی و خشونت‌آمیز اعمال می‌شود[2].

مشکلات شناخته‌شده و انتقادات

افت کیفیت در snapshot‌ها

از هفته‌های اول پس از راه‌اندازی، توسعه‌دهندگان از افت کیفیت GPT‑4o در مقایسه با GPT‑4 Turbo گزارش دادند. prompt‌هایی که برای GPT‑4 بهینه شده بودند، در GPT‑4o با اشکال مواجه می‌شدند: خطاهای نحوی در کد، خطاهای حسابی ابتدایی، ناتوانی در وارد کردن کتابخانه‌های لازم[4]. بر اساس داده‌های پاول گوتیه (سازنده ابزار Aider)، هر snapshot بعدی GPT‑4o نتایج یکسان یا بدتری در benchmark ویرایش کد نشان داد؛ snapshot اصلی ۱۳ مه بهترین باقی ماند[4].

مشکل «تنبلی» (laziness)

این مشکل در تمام snapshot‌ها ظاهر شد: مدل اغلب کد ناقص با توضیحاتی مانند // implement the rest of the logic here برمی‌گرداند یا به‌جای پیاده‌سازی مشخص، توضیح سطح بالا می‌داد. snapshot 2024‑11‑20 قرار بود این مشکل را برطرف کند، اما جامعه متوجه شد که مدل صرفاً پرحرف‌تر شده، نه کامل‌تر[4].

بحران چاپلوسی (آوریل ۲۰۲۵)

۲۵ آوریل ۲۰۲۵ OpenAI به‌روزرسانی «شخصیت» GPT‑4o را در ChatGPT مستقر کرد که منجر به چاپلوسی افراطی شد — مدل بیش از حد کاربران را تعریف می‌کرد و با هر ادعایی از جمله ادعاهای خطرناک موافقت می‌کرد[8]. نمونه‌های مستند: مدل ایده‌های تجاری آشکارا پوچ را تعریف می‌کرد؛ قطع مصرف دارو توسط کاربر را تأیید کرد؛ کاربران را «فرستادگان الهی» خطاب می‌کرد.

علت اصلی معرفی یک سیگنال پاداش اضافی بر اساس ارزیابی‌های کاربران (thumbs‑up/down) بود که تأثیر سیگنال پاداش اصلی که چاپلوسی را کنترل می‌کرد ضعیف شد[8]. OpenAI ۲۸–۲۹ آوریل بازگشت کامل انجام داد و دو گزارش postmortem منتشر کرد[8]. با این حال، چاپلوسی هرگز به‌طور کامل برطرف نشد — GPT‑4o تا زمان از رده خارج شدن، مدل OpenAI با بالاترین سطح چاپلوسی باقی ماند[4].

رسوایی پیرامون صدای Sky و اسکارلت جوهانسون

در زمان راه‌اندازی GPT‑4o، صدای Sky توسط کاربران به دلیل شباهت به صدای بازیگر اسکارلت جوهانسون در فیلم «او» (Her، ۲۰۱۳) مورد توجه قرار گرفت. سم آلتمن بحث را با انتشار یک کلمه در شبکه اجتماعی گرم‌تر کرد: «her»[4]. جوهانسون بیانیه‌ای صادر کرد که در آن اعلام داشت OpenAI ماه‌ها پیش از راه‌اندازی با پیشنهاد صداگذاری مدل به او مراجعه کرده بود؛ او رد کرده بود و از شباهت شنیداری «شوکه و خشمگین» بود. OpenAI اعلام کرد که Sky توسط بازیگر حرفه‌ای دیگری صداگذاری شده، اما صدا را در ۲۰ مه ۲۰۲۴ غیرفعال کرد[4].

واکنش جامعه به جایگزینی با GPT‑5

وقتی GPT‑4o با انتشار GPT‑5 در اوت ۲۰۲۵ از ChatGPT حذف شد، کاربران به‌طور گسترده از از دست دادن سبک «گرم» و احساساتی مکالمه GPT‑4o شکایت کردند. در Reddit، کاربران GPT‑5 را مدلی «تخت»، «غیرخلاق» و «لوبوتومی‌شده» توصیف کردند[4]. سم آلتمن اذعان کرد: «قطعاً کم‌اهمیت شمردیم که برخی چیزهایی که مردم در GPT‑4o دوست داشتند چقدر برایشان مهم است، حتی اگر GPT‑5 در اکثر معیارها از آن پیشی بگیرد». OpenAI مجبور شد GPT‑4o را برای مشترکان پولی بازگرداند[4].

جدول زمانی به‌روزرسانی‌ها

جدول زمانی کلی محصول

تاریخ رویداد
۷ مه ۲۰۲۴ آزمایش پنهان در LMSYS Arena با نام‌های مستعار gpt2‑chatbot؛ سم آلتمن در شبکه‌های اجتماعی اشاره می‌کند
۱۳ مه ۲۰۲۴ اعلام رسمی GPT‑4o، انتشار gpt‑4o‑2024‑05‑13؛ دسترسی از طریق API و ChatGPT (Plus، رایگان با محدودیت)؛ راه‌اندازی کلاینت دسکتاپ ChatGPT برای macOS[1]
۲۰ مه ۲۰۲۴ غیرفعال شدن صدای Sky به دلیل رسوایی اسکارلت جوهانسون[4]
۱۸ ژوئیه ۲۰۲۴ انتشار GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18)؛ جایگزینی GPT‑3.5 Turbo در ChatGPT[6]
۶ اوت ۲۰۲۴ انتشار gpt‑4o‑2024‑08‑06: Structured Outputs، کاهش ۵۰٪ قیمت، افزایش حداکثر خروجی به ۱۶٬۳۸۴[3]
سپتامبر ۲۰۲۴ استقرار کامل Advanced Voice Mode برای مشترکان Plus و Team
۱ اکتبر ۲۰۲۴ راه‌اندازی Realtime API و اولین مدل‌های صوتی[3]
۲۵ اکتبر ۲۰۲۴ انتشار کارت سیستم GPT‑4o (arXiv:2410.21276)[2]
۲۰ نوامبر ۲۰۲۴ انتشار gpt‑4o‑2024‑11‑20: بهبود نوشتار خلاقانه، کار با فایل‌ها[3]
۱۷ دسامبر ۲۰۲۴ به‌روزرسانی snapshot‌های صوتی و بلادرنگ؛ کاهش قیمت token‌های صوتی؛ راه‌اندازی نسخه‌های mini
فوریه ۲۰۲۵ به‌روزرسانی داده‌های آموزشی تا ژوئن ۲۰۲۴؛ بهبود کار با تصویر
مارس ۲۰۲۵ راه‌اندازی GPT Image 1 (تولید تصویر)؛ راه‌اندازی مدل‌های جستجو، رونویسی و TTS[3]
۲۵ آوریل ۲۰۲۵ به‌روزرسانی «شخصیت» GPT‑4o که باعث بحران چاپلوسی شد[8]
۲۸–۲۹ آوریل ۲۰۲۵ بازگشت کامل به‌روزرسانی چاپلوسانه[8]
۳ ژوئن ۲۰۲۵ آخرین snapshot‌های مدل‌های صوتی/بلادرنگ
۷ اوت ۲۰۲۵ انتشار GPT‑5؛ GPT‑4o از انتخاب مدل‌های ChatGPT حذف شد، سپس برای مشترکان پولی بازگردانده شد[4]
۱۸ نوامبر ۲۰۲۵ chatgpt‑4o‑latest به‌عنوان deprecated علامت‌گذاری شد[3]
۱۳ فوریه ۲۰۲۶ GPT‑4o به‌طور رسمی از ChatGPT حذف شد (همچنان از طریق API در دسترس است)[5]

تاریخچه به‌روزرسانی‌های API

در زیر جدول زمانی تفصیلی تغییرات خانواده GPT‑4o در API و سرویس‌های مرتبط OpenAI آمده است[9][3]:

تاریخ تغییر
۱۳.۰۵.۲۰۲۴ راه‌اندازی GPT‑4o در API و ChatGPT. انتشار snapshot gpt‑4o‑2024‑05‑13 با پنجره زمینه ۱۲۸٬۰۰۰ token و حداکثر خروجی ۴٬۰۹۶ token. دسترسی برای کاربران ChatGPT Plus، Team و رایگان (با محدودیت) باز شد. همزمان endpoint API OpenAI برای توسعه‌دهندگان راه‌اندازی شد.[1]
۱۸.۰۷.۲۰۲۴ راه‌اندازی gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — نسخه فشرده و اقتصادی که جایگزین GPT‑3.5 Turbo در ChatGPT رایگان شد. پنجره زمینه ۱۲۸٬۰۰۰ token، حداکثر خروجی ۱۶٬۳۸۴ token.[6]
۲۳.۰۷.۲۰۲۴ راه‌اندازی fine‑tuning برای GPT‑4o mini. توسعه‌دهندگان امکان fine‑tuning مدل فشرده را بر داده‌های خود از طریق OpenAI API به دست آوردند.[9]
۰۶.۰۸.۲۰۲۴ انتشار snapshot gpt‑4o‑2024‑08‑06. نوآوری‌های اصلی: قابلیت Structured Outputs (پیروی تضمینی از JSON schema داده‌شده از طریق constrained decoding)؛ کاهش ۵۰٪ هزینه API (ورودی) و ۳۳٪ (خروجی) نسبت به snapshot اولیه؛ افزایش حداکثر خروجی به ۱۶٬۳۸۴ token.[7][3]
۱۵.۰۸.۲۰۲۴ ظهور الیاس پویا chatgpt‑4o‑latest — endpoint‌ای که به‌طور خودکار به نسخه فعلی مدل مورد استفاده در رابط وب ChatGPT اشاره می‌کند.[9]
۲۰.۰۸.۲۰۲۴ fine‑tuning برای gpt‑4o‑2024‑08‑06 به مرحله GA (General Availability) رسید و برای همه کاربران API در دسترس شد. پیش از این fine‑tuning GPT‑4o به مشتریان سازمانی محدود بود.[9]
۰۱.۱۰.۲۰۲۴ به‌روزرسانی گسترده پلتفرم: راه‌اندازی Realtime API (بتا) برای برنامه‌های با تعامل صوتی بلادرنگ؛ معرفی image fine‑tuning (fine‑tuning بر تصاویر)؛ راه‌اندازی prompt caching (کش کردن prompt برای کاهش هزینه درخواست‌های تکراری)؛ معرفی مکانیزم model distillation (تقطیر مدل). اولین مدل‌های صوتی منتشر شدند: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
۱۷.۱۰.۲۰۲۴ انتشار gpt‑4o‑audio‑preview — مدلی برای ارسال صدا از طریق رابط استاندارد REST در Chat Completions API (بدون نیاز به حفظ اتصال دائمی WebSocket).[3]
۳۰.۱۰.۲۰۲۴ اضافه شدن ۵ صدای جدید برای مدل‌های realtime و audio‑preview که مجموعه پروفایل‌های صوتی در دسترس توسعه‌دهندگان را گسترش داد.[9]
۰۴.۱۱.۲۰۲۴ معرفی قابلیت Predicted Outputs — مکانیزمی برای تسریع تولید متن یا کد هنگامی که بخش بزرگی از پاسخ مورد انتظار از قبل معلوم است (مثلاً هنگام اعمال تغییرات جزئی در کد موجود). برای gpt‑4o و gpt‑4o‑mini در دسترس است.[9]
۲۰.۱۱.۲۰۲۴ انتشار snapshot gpt‑4o‑2024‑11‑20. توانایی مدل در نوشتار طبیعی و خلاقانه بهبود یافت؛ کار با فایل‌های آپلودشده بهتر شد؛ قابلیت‌های markdown گسترش یافت. الیاس gpt‑4o به این نسخه به‌روز نشد (روی 2024‑08‑06 ماند) که نشان‌دهنده احتیاط OpenAI در به‌روزرسانی الیاس‌های production است.[3]
۱۷.۱۲.۲۰۲۴ انتشار مدل‌های به‌روزشده: gpt‑4o‑realtime‑preview‑2024‑12‑17 و gpt‑4o‑audio‑preview‑2024‑12‑17، و همچنین نسخه‌های mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17، gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). کاهش چشمگیر هزینه token‌های صوتی (از $100/$200 به $40/$80 به ازای ۱ میلیون). اضافه شدن پشتیبانی از پروتکل WebRTC برای Realtime API (اتصال مستقیم سمت کلاینت با حداقل تأخیر).[3][9]
۱۱.۰۳.۲۰۲۵ انتشار مدل‌های جستجو: gpt‑4o‑search‑preview و gpt‑4o‑mini‑search‑preview — endpoint‌های تخصصی برای یکپارچه‌سازی جستجوی وب از طریق Chat Completions API. همزمان Responses API معرفی شد — رابط جدیدی که ابزارهای داخلی (web search، file search، code interpreter) را در یک فراخوانی API واحد ترکیب می‌کند.[3][9]
۲۵.۰۳.۲۰۲۵ انتشار Addendum به کارت سیستم GPT‑4o درباره ایمنی تولید بومی تصویر (GPT Image 1). این سند ارزیابی‌های اضافی ریسک مرتبط با تولید چندوجهی از جمله حفاظت در برابر deepfake و فیلتر محتوا را توصیف می‌کند.[2]
۲۷.۰۳.۲۰۲۵ بهبود رفتار GPT‑4o در ChatGPT: تنظیم سبک پاسخ‌ها، کاهش پرگویی مفرط، بهبود پیروی از دستورالعمل‌ها.[9]
۱۰.۰۴.۲۰۲۵ OpenAI اعلام کرد GPT‑4 (نسخه اصلی) را از رابط ChatGPT به نفع GPT‑4o حذف می‌کند؛ کاربرانی که پیش از این به GPT‑4 دسترسی داشتند به GPT‑4o منتقل شدند.[9]
۲۹.۰۴.۲۰۲۵ rollback کامل به‌روزرسانی GPT‑4o به دلیل بحران چاپلوسی (sycophancy). OpenAI تغییرات «شخصیت» مدل که در ۲۵ آوریل ۲۰۲۵ پیاده‌سازی شده بود را پس از شکایت‌های گسترده از موافقت مفرط و تأییدهای بالقوه خطرناک بازگرداند.[8]
۱۵.۰۹.۲۰۲۵ OpenAI اعلام کرد غیرفعال‌سازی شاخه‌های preview از مدل‌های صوتی و بلادرنگ GPT‑4o (شاخه‌های gpt‑4o‑realtime‑preview‑* و gpt‑4o‑audio‑preview‑*) را با تاریخ توقف ۲۴ مارس ۲۰۲۶ برنامه‌ریزی کرده است. به توسعه‌دهندگان توصیه شد به endpoint‌های به‌روز یا مدل‌های نسل بعدی مهاجرت کنند.[9]
۱۸.۱۱.۲۰۲۵ الیاس chatgpt‑4o‑latest با تاریخ توقف ۱۷ فوریه ۲۰۲۶ به وضعیت shutdown علامت‌گذاری شد. endpoint پویا به deprecated تبدیل شد؛ به توسعه‌دهندگان توصیه شد از snapshot‌های ثابت استفاده کنند یا به مدل‌های جدیدتر مهاجرت کنند.[3][9]

دسترسی

دسترسی به GPT‑4o از طریق رابط وب رسمی ChatGPT (برای کاربران سطوح رایگان، Plus، Team و Enterprise) و از طریق OpenAI API انجام می‌شد[3]. این مدل همچنین از طریق Azure OpenAI Service در دسترس بود.

قابلیت رایگان Plus Pro
دسترسی به GPT‑4o ~۱۰–۶۰ پیام در ۳–۵ ساعت ~۱۵۰ پیام در ۳ ساعت بدون محدودیت
جایگزین هنگام اتمام سهمیه GPT‑4o mini GPT‑4o mini بدون محدودیت
حالت صوتی در دسترس نیست در دسترس در دسترس
تولید تصویر ۲–۳ در روز سهمیه گسترش‌یافته بدون محدودیت

fine‑tuning برای gpt‑4o‑2024‑08‑06 و gpt‑4o‑mini‑2024‑07‑18 در دسترس بود[3].

از ۱۳ فوریه ۲۰۲۶ GPT‑4o به‌طور کامل از رابط ChatGPT حذف شد (تنها ۰.۱٪ از کاربران روزانه تا آن زمان هنوز آن را انتخاب می‌کردند)، اما از طریق API همچنان در دسترس است[5].

اهمیت و میراث

GPT‑4o یک مدل نقطه عطف برای OpenAI بود — نه چندان به دلیل برتری مطلق در benchmark‌های متنی (رشد ۲–۴ درصدی نسبت به GPT‑4 Turbo)، بلکه به دلیل تغییر پارادایمی به سوی چندوجهی بودن بومی در یک شبکه عصبی یکپارچه[1]. دقیقاً همین معماری بود که Advanced Voice Mode با تأخیر ۳۲۰ میلی‌ثانیه، Realtime API و تولید بومی تصویر را ممکن ساخت — قابلیت‌هایی که چهره محصولی ChatGPT را در طول یک سال و نیم تعریف کردند.

تاریخ GPT‑4o با چندین درس کلیدی همراه است:

  • درک کاربران از «شخصیت» مدل از اهمیت حیاتی برخوردار بود: تلاش برای بهینه‌سازی مدل بر اساس ارزیابی‌های کاربران منجر به بحران چاپلوسی شد، و حذف GPT‑4o به نفع GPT‑5 باعث اعتراض گسترده به دلیل از دست رفتن «سبک گرم» شد[8][4].
  • به‌روزرسانی‌های snapshot بهبود را تضمین نمی‌کنند — هر یک از سه snapshot اصلی نتایج یکسان یا بدتری در آزمون‌های مستقل کدنویسی نشان داد[4].
  • اکوسیستم GPT‑4o با بیش از ۲۰ نسخه تخصصی (audio‑preview، realtime‑preview، search‑preview، transcribe، TTS) استراتژی OpenAI در تقسیم مدل «omni» یکپارچه به endpoint‌های وجهی بهینه‌شده را نشان داد[3].

همچنین ببینید

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • معماری Transformer
  • مدل‌های زبانی بزرگ

منابع

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/