GPT-4o (FA)
GPT‑4o (تلفظ: «جی‑پی‑تی‑فور‑اوه»؛ حرف «o» از لاتین omni به معنای «همه» و «فراگیر») — یک مدل زبانی بزرگ (LLM) چندوجهی از خانواده GPT است که توسط شرکت OpenAI توسعه یافته و در ۱۳ مه ۲۰۲۴ معرفی شد[1]. GPT‑4o نخستین مدل OpenAI بود که بهصورت یک شبکه عصبی سرتاسری یکپارچه (end‑to‑end) آموزش دیده و قادر است بهطور همزمان متن، تصویر و صدا را پردازش کند — برخلاف نسلهای پیشین که برای هر وجه از مدلهای جداگانه استفاده میکردند[2]. این مدل جایگزین GPT‑4 Turbo بهعنوان پرچمدار خانواده شد و سرعت تولید دو برابر بالاتر، هزینه API پنجاه درصد کمتر و قابلیتهای چندوجهی کیفیتاً جدیدی ارائه داد[1]. خانواده GPT‑4o شامل بیش از ۲۰ نوع مختلف است، از جمله GPT‑4o mini فشرده، مدلهای صوتی، مدلهای بلادرنگ، مدلهای جستجو و مدلهای گفتاری تخصصی[3].
کارت اطلاعات
| پارامتر | مقدار |
|---|---|
| نام کامل | GPT‑4o (GPT‑4 Omni) |
| توسعهدهنده | OpenAI |
| تاریخ اعلام | ۱۳ مه ۲۰۲۴[1] |
| نوع | مدل چندوجهی خودبازگشتی (transformer)[2] |
| تعداد پارامترها | بهطور رسمی اعلام نشده (تخمین غیررسمی: ~۲۰۰ میلیارد برای GPT‑4o، ~۸ میلیارد برای GPT‑4o mini)[4] |
| پنجره زمینه | ۱۲۸٬۰۰۰ token[3] |
| حداکثر خروجی | ۱۶٬۳۸۴ token (۴٬۰۹۶ برای gpt‑4o‑2024‑05‑13)[3] |
| تاریخ قطع دادههای آموزشی | اکتبر ۲۰۲۳ (در نسخههای بعدی تا ژوئن ۲۰۲۴ بهروز شد)[2] |
| توکنایزر | o200k_base (۲۰۰٬۰۰۰ token)[1] |
| وجوه ورودی | متن، تصویر، صدا، ویدیو[1] |
| وجوه خروجی | متن، صدا، تصویر (از طریق GPT Image 1)[1][3] |
| مجوز | اختصاصی، کد بسته |
| کارت سیستم | arXiv:2410.21276 (۲۵ اکتبر ۲۰۲۴، ۴۱۷ نویسنده)[2] |
| شناسههای API | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| وضعیت فعلی | در API در دسترس است؛ در ۱۳ فوریه ۲۰۲۶ از ChatGPT حذف شد[5] |
جایگاه در خانواده مدلها
GPT‑4o در زمان انتشار، جایگاه مدل چندوجهی پرچمدار برای مقاصد عمومی در خانواده GPT را داشت. این مدل جایگزین GPT‑4 Turbo (آوریل ۲۰۲۴) بهعنوان مدل اصلی برای اکثر وظایف در ChatGPT و API شد و سرعت بالاتر و هزینه کمتری را با حفظ یا بهبود کیفیت در وظایف متنی ارائه داد[1].
این مدل از GPT‑4 Turbo با انتقال از اجزای جداگانه (مدلهای مجزا برای بینایی و سنتز گفتار) به یک معماری end‑to‑end یکپارچه تکامل یافت. تفاوتهای کلیدی با مدلهای مجاور خانواده:
- در مقایسه با GPT‑4 Turbo (پیشین) — GPT‑4o عملکرد هوشمندانه قابل مقایسهای در زبان انگلیسی و کدنویسی ارائه میدهد، اما در وظایف چندزبانه، پردازش تصویر و صدا بهطور چشمگیری از پیشین خود پیشی میگیرد. GPT‑4o دو برابر سریعتر و در API پنجاه درصد ارزانتر است. تمایز معماری اساسی — چندوجهی بودن بومی (یک مدل بهجای خط لوله)[1].
- در مقایسه با GPT‑4.1 (آوریل ۲۰۲۵) — مدل نسل بعدی برای توسعهدهندگان API که در اکثر benchmarkها از GPT‑4o پیشی میگیرد (MMLU: 90.2% در برابر 85.7%، SWE‑bench Verified: 54.6% در برابر 33.2%) با هزینه کمتر؛ در عین حال GPT‑4.1 در رابط ChatGPT ارائه نمیشد[4].
- در مقایسه با GPT‑5 (اوت ۲۰۲۵) — جانشین GPT‑4o در ChatGPT شد، اما کاربران بهطور گسترده از از دست دادن سبک «گرم» و احساساتی GPT‑4o شکایت داشتند[4].
- در مقایسه با GPT‑4o mini (ژوئیه ۲۰۲۴) — نسخه فشرده و بهمراتب ارزانتری که جایگزین GPT‑3.5 Turbo در ChatGPT رایگان شد[6].
GPT‑4o نخستین مدل OpenAI بود که برای کاربران رایگان ChatGPT (با محدودیت در تعداد پیامها) در دسترس قرار گرفت[1].
معماری و نوآوریهای کلیدی
آموزش چندوجهی سرتاسری
نوآوری معماری اصلی GPT‑4o در آموزش سرتاسری یک شبکه عصبی واحد بر دادههای تمام وجوه بهطور همزمان است[1][2]. پیش از GPT‑4o، حالت صوتی ChatGPT از طریق یک خط لوله از سه مدل جداگانه کار میکرد: Whisper (تشخیص گفتار) ← GPT‑3.5/GPT‑4 (پردازش متن) ← TTS (سنتز گفتار). این خط لوله اطلاعات مربوط به لحن، احساسات، صداهای پسزمینه و چند گوینده را از دست میداد و تأخیر آن به ۲.۸ ثانیه برای GPT‑3.5 و ۵.۴ ثانیه برای GPT‑4 میرسید[1]. GPT‑4o صدا را بهصورت بومی پردازش میکند — زمان پاسخ بهطور متوسط ۳۲۰ میلیثانیه (حداقل ۲۳۲ میلیثانیه) است که با سرعت واکنش انسان در مکالمه قابل مقایسه است[1][2].
کارت سیستم GPT‑4o چندین ادعای اساسی درباره معماری دارد[2]:
- مدل یک LLM transformer خودبازگشتی است که token بعدی را بر اساس زمینه چندوجهی پیشبینی میکند;
- از یک نمایش یکپارچه از وجوه استفاده میشود که بر روی ترکیبی از دادههای متنی، کدی، ریاضی، بصری، صوتی و ویدیویی آموزش دیده است;
- آموزش در چندین مرحله انجام شد، از جمله پیشآموزش (pre‑training) بر روی corpusهای بزرگ چندوجهی و سپس fine‑tuning با استفاده از Reinforcement Learning from Human Feedback (RLHF) و red‑teaming.
پارامترها و جزئیات معماری
شرکت OpenAI مشخصات دقیق مدل را — تعداد پارامترها، تعداد لایهها، وجود ساختار MoE و سختافزار مورد استفاده برای آموزش — اعلام نکرده است[2]. تخمین غیررسمی ~۲۰۰ میلیارد پارامتر بر اساس دادههای یک مقاله تحقیقاتی مایکروسافت است، اما توسط OpenAI تأیید نشده است[4].
توکنایزر o200k_base
GPT‑4o از توکنایزر جدید o200k_base با واژگانی متشکل از ۲۰۰٬۰۰۰ token استفاده میکند — دو برابر بیشتر از cl100k_base در GPT‑4[1]. این امر کارایی فشردهسازی برای الفبای غیرلاتین را بهطور چشمگیری بهبود داد: برای مثال، برای گجراتی ۴.۴ برابر، برای تلوگو ۳.۵ برابر و برای مالایالام تا ۴ برابر بهبود ایجاد شد[1]. برای فارسی، روسی، کرهای، عربی و زبانهای دیگر، برای رمزگذاری همان متن بهطور قابل توجهی به tokenهای کمتری نیاز است که این امر چگالی اطلاعاتی پنجره زمینه را افزایش داده و هزینه استفاده از API را کاهش میدهد.
سرعت تولید
سرعت تولید GPT‑4o تقریباً دو برابر GPT‑4 Turbo است[1]. بر اساس اندازهگیریهای مستقل Artificial Analysis، نسخه نوامبر ۲۰۲۴ حدود ۱۵۷ token در ثانیه تولید میکند و نسخه ChatGPT تا ۱۸۵ token در ثانیه میرسد، در حالی که GPT‑4 Turbo تنها ~۲۸ token در ثانیه نشان میداد[4].
عملکرد
benchmarkهای متنی
نتایج GPT‑4o بر روی benchmarkهای استاندارد دانشگاهی در زمان انتشار (دادههای OpenAI، snapshot گوینده gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | توضیح |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88.7% | 86.5% | 88.3% | دانش عمومی در ۵۷ رشته |
| GPQA Diamond (0‑shot CoT) | 53.6% | 49.1% | — | سؤالات سطح دکتری |
| MATH (0‑shot CoT) | 76.6% | 72.2% | — | مسائل ریاضی سطح المپیاد |
| HumanEval (0‑shot) | 90.2% | 87.6% | 92.0% | تولید کد Python |
| MGSM (ریاضی چندزبانه) | 90.5% | 88.6% | — | ریاضی در چند زبان |
| DROP (F1، 3‑shot) | 83.4% | 85.4% | — | خواندن با درک مطلب |
| SWE‑bench Verified | 33.2% | — | 64% | حل مسئله عاملانه |
GPT‑4o در ۲۱ از ۲۲ آزمون داخلی و خارجی OpenAI از GPT‑4 Turbo پیشی گرفت؛ تنها رگرسیون در benchmark DROP مشاهده شد[2].
benchmarkهای کار با تصویر
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val، 0‑shot CoT) | 69.1% | 63.1% | 68.3% |
| MathVista (testmini) | 63.8% | 58.1% | 67.7% |
| AI2D (test) | 94.2% | 89.4% | 94.7% |
| ChartQA (test) | 85.7% | 78.1% | 90.8% |
| DocVQA (test، ANLS) | 92.8% | 87.2% | 95.2% |
benchmarkهای پزشکی
کارت سیستم GPT‑4o رشد قابل توجهی در وظایف پزشکی ثبت کرد[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE، 0‑shot) | 89% | 78% |
| MMLU Clinical Knowledge (0‑shot) | 92% | 85% |
| MMLU Medical Genetics (0‑shot) | 96% | 93% |
رتبهبندی LMSYS Chatbot Arena
GPT‑4o در زمان راهاندازی رتبه اول را در رتبهبندی LMSYS Chatbot Arena با ELO ~1287 کسب کرد[4]. نسخه chatgpt‑4o‑latest از سپتامبر ۲۰۲۴ رکورد 1338 امتیاز را ثبت کرد و دوباره رتبه اول را کسب نمود. پیش از اعلام رسمی، GPT‑4o در Chatbot Arena با نامهای مستعار gpt2‑chatbot، im‑a‑good‑gpt2‑chatbot و im‑also‑a‑good‑gpt2‑chatbot آزمایش شد؛ در ۷ مه ۲۰۲۴ سم آلتمن با انتشار پست «im‑a‑good‑gpt2‑chatbot» به این موضوع اشاره کرد[4].
شایان ذکر است که تحقیق LMSYS نشان داد رتبههای بالای GPT‑4o تا حدی به عوامل سبکی (پاسخهای مفصل و خوشقالب) نسبت داده میشود، نه صرفاً به کیفیت محتوا[4].
قابلیتها و محدودیتها
نقاط قوت
- چندوجهی بودن بلادرنگ: مدل واحد برای متن، صدا، تصویر و ویدیو با تأخیری قابل مقایسه با واکنش انسان (۲۳۲–۳۲۰ میلیثانیه برای صدا)[1][2].
- کارایی: سرعت تولید دو برابر بالاتر و هزینه پنجاه درصد کمتر در مقایسه با GPT‑4 Turbo[1].
- چندزبانگی: پشتیبانی بهطور چشمگیری بهبودیافته از زبانهای غیرانگلیسی به لطف توکنایزر جدید و آموزش چندزبانه[1].
- حوزههای تخصصی: نتایج بالا در benchmarkهای پزشکی (MedQA 89%)، علمی و کدنویسی[2].
- ابزارها: پشتیبانی از function calling، Structured Outputs، تولید جریانی، fine‑tuning[3].
- صدای احساساتی: توانایی خندیدن، آواز خواندن، تغییر زبان در وسط جمله، تطبیق لحن و انتقال احساسات در حالت صوتی[1].
محدودیتهای شناختهشده
- توهمزایی: مدل مستعد تولید اطلاعات نادرست است، بهویژه در حوزههای موضوعی کمیاب[2].
- تاریخ قطع دانش: در snapshotهای اولیه محدود به اکتبر ۲۰۲۳ است (در نسخههای بعدی تا ژوئن ۲۰۲۴ بهروز شد)[2].
- غیرقطعی بودن: تنوع پاسخها برای درخواستهای یکسان[2].
- رگرسیونها: در برخی snapshotها کاهش کیفیت نسبت به نسخههای قبلی مشاهده شد، بهویژه در پیروی از دستورالعملهای پیچیده و تولید کد[4].
- صدا: کاهش robustness در محیطهای پر سر و صدا، اکو، لهجههای غیرمعمول و وقفهها[2].
صدا، قابلیتهای گفتاری و Realtime API
حالت صوتی پیشرفته (Advanced Voice Mode)
Advanced Voice Mode در ChatGPT کارت ویزیت GPT‑4o شد. برخلاف حالت صوتی قدیمی با خط لوله سه مدله، GPT‑4o صدا را بهصورت بومی در یک شبکه عصبی یکپارچه پردازش میکند و اطلاعات مربوط به لحن، احساسات، لهجه و صداهای پسزمینه را حفظ میکند[1]. در زمان راهاندازی ۵ صدا در دسترس بود: Breeze، Cove، Ember، Juniper و Sky. صدای Sky در ۲۰ مه ۲۰۲۴ به دلیل رسوایی با بازیگر اسکارلت جوهانسون غیرفعال شد (جزئیات بیشتر در بخش «رسوایی پیرامون صدای Sky»)[4].
جدول زمانی استقرار حالت صوتی: نسخه آلفا برای گروه محدودی از کاربران Plus — ۳۰ ژوئیه ۲۰۲۴؛ استقرار کامل برای Plus و Team — سپتامبر ۲۰۲۴. در برخی کشورها (اتحادیه اروپا، بریتانیا، سوئیس و دیگران) راهاندازی به تأخیر افتاد. کاربران رایگان به Advanced Voice Mode دسترسی نیافتند[4].
Realtime API
اول اکتبر ۲۰۲۴ OpenAI رابط Realtime API را برای ساخت برنامههایی با گفتار بلادرنگ بر پایه GPT‑4o راهاندازی کرد[3]. این API از سه پروتکل اتصال پشتیبانی میکند: WebSocket (برنامههای سمت سرور)، WebRTC (انتقال جریانی سمت کلاینت با حداقل تأخیر) و SIP (تلفن VoIP، بعداً اضافه شد). قابلیتهای کلیدی: انتقال جریانی صدا در دو جهت، تشخیص فعالیت صوتی (VAD)، فراخوانی توابع، مدیریت زمینه مکالمه[3].
مدلهای صوتی در Chat Completions API
مدلهای gpt‑4o‑audio‑preview امکان ارسال صدا از طریق رابط استاندارد REST در Chat Completions را فراهم میکنند (بدون نیاز به حفظ اتصال دائمی). فرمتهای خروجی پشتیبانیشده: WAV، MP3، FLAC، Opus، PCM16. صداهای در دسترس از ۶ به ۱۳ عدد افزایش یافتند: alloy، ash، ballad، coral، echo، fable، nova، onyx، sage، shimmer، verse، marin، cedar؛ صدای قابل تنظیم از طریق API نیز پشتیبانی میشود[3].
GPT‑4o mini
GPT‑4o mini در ۱۸ ژوئیه ۲۰۲۴ بهعنوان «اقتصادیترین مدل کوچک» OpenAI و جایگزین مستقیم GPT‑3.5 Turbo معرفی شد[6]. پنجره زمینه آن ۱۲۸٬۰۰۰ token (در برابر ۱۶٬۳۸۵ در GPT‑3.5 Turbo) و حداکثر خروجی ۱۶٬۳۸۴ token است.
GPT‑4o mini نخستین مدل OpenAI بود که از روش instruction hierarchy استفاده کرد که پایداری در برابر jailbreak، تزریق prompt و استخراج prompt سیستم را افزایش میدهد[6]. این مدل از ورودی متن و تصویر، function calling، Structured Outputs، JSON mode، تولید جریانی، fine‑tuning و کش کردن prompt پشتیبانی میکند؛ صدا و ویدیو توسط نسخه متنی پایه پشتیبانی نمیشوند[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82.0% | 77.9% | 73.8% |
| MGSM | 87.0% | 75.5% | 71.7% |
| HumanEval | 87.2% | 71.5% | 75.9% |
| MMMU (vision) | 59.4% | 56.1% | 50.2% |
در ChatGPT این مدل بهعنوان مدل پیشفرض برای کاربران رایگان و بهعنوان مدل جایگزین (fallback) هنگام اتمام سهمیه GPT‑4o/GPT‑5 برای مشترکان پولی استفاده میشود[6].
فهرست کامل نسخهها و شناسههای API
مدلهای متنی اصلی
| شناسه API | توضیح | تاریخ انتشار | حداکثر خروجی |
|---|---|---|---|
gpt‑4o |
الیاس ← gpt‑4o‑2024‑08‑06 | مه ۲۰۲۴ | 16,384 |
gpt‑4o‑2024‑05‑13 |
اولین snapshot | ۱۳ مه ۲۰۲۴ | 4,096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs، کاهش قیمت | ۶ اوت ۲۰۲۴ | 16,384 |
gpt‑4o‑2024‑11‑20 |
بهبود نوشتار خلاقانه | ۲۰ نوامبر ۲۰۲۴ | 16,384 |
chatgpt‑4o‑latest |
الیاس پویای نسخه ChatGPT (deprecated از نوامبر ۲۰۲۵) | اوت ۲۰۲۴ | 16,384 |
GPT‑4o mini
| شناسه API | توضیح | تاریخ انتشار |
|---|---|---|
gpt‑4o‑mini |
الیاس ← gpt‑4o‑mini‑2024‑07‑18 | ژوئیه ۲۰۲۴ |
gpt‑4o‑mini‑2024‑07‑18 |
تنها snapshot با تاریخ | ۱۸ ژوئیه ۲۰۲۴ |
مدلهای صوتی و بلادرنگ
| شناسه API | نوع | تاریخ انتشار |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions با صدا | اکتبر ۲۰۲۴ |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
اولین snapshot | ۱ اکتبر ۲۰۲۴ |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
snapshot بهروزشده | ۱۷ دسامبر ۲۰۲۴ |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
آخرین snapshot | ۳ ژوئن ۲۰۲۵ |
gpt‑4o‑mini‑audio‑preview |
نسخه mini صوتی | دسامبر ۲۰۲۴ |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | اکتبر ۲۰۲۴ |
gpt‑4o‑mini‑realtime‑preview |
Realtime mini | دسامبر ۲۰۲۴ |
مدلهای تخصصی
| شناسه API | کاربرد | تاریخ انتشار |
|---|---|---|
gpt‑4o‑search‑preview |
جستجو در وب از طریق Chat Completions | مارس ۲۰۲۵ |
gpt‑4o‑mini‑search‑preview |
جستجوی وب mini | مارس ۲۰۲۵ |
gpt‑4o‑transcribe |
تشخیص گفتار (STT) | مارس ۲۰۲۵ |
gpt‑4o‑mini‑transcribe |
تشخیص گفتار mini | مارس ۲۰۲۵ |
gpt‑4o‑mini‑tts |
سنتز گفتار (TTS) | مارس ۲۰۲۵ |
پشتیبانی از وجوه بر اساس نسخه
| نسخه | متن → | تصویر → | صدا → | → متن | → صدا |
|---|---|---|---|---|---|
gpt‑4o (snapshotها) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
ابزارها و فرمتهای پشتیبانیشده
ابزارها
تمام نسخههای GPT‑4o از موارد زیر پشتیبانی میکنند: function calling (فراخوانی توابع خارجی)، تولید جریانی (streaming)، fine‑tuning (در snapshotهای مشخص)، predicted outputs (کاهش تأخیر برای پاسخهای قابل پیشبینی)[3]. از طریق Assistants/Responses API موارد زیر در دسترس است: Code Interpreter، File Search، Web Search. جستجوی وب از طریق مدلهای تخصصی gpt‑4o‑search‑preview و gpt‑4o‑mini‑search‑preview پیادهسازی شده است[3].
Structured Outputs و JSON mode
Structured Outputs — قابلیتی که با gpt‑4o‑2024‑08‑06 معرفی شد و میزان انطباق بالای خروجی مدل با یک JSON schema دادهشده را تضمین میکند[7]. در ارزیابیهای داخلی OpenAI، مدل ۱۰۰٪ پیروی از JSON schemaهای پیچیده را نشان داد (در مقایسه با کمتر از ۴۰٪ در gpt‑4‑0613). این قابلیت از طریق مکانیزم constrained decoding در دو شکل پیادهسازی شده است: (1) function calling با پارامتر strict: true و (2) response_format با نوع json_schema[7].
JSON mode (response_format: {"type": "json_object"}) — مکانیزم قدیمیتری که JSON معتبر را بدون الزام به یک schema خاص تضمین میکند[3].
تولید تصویر (GPT Image 1)
در مارس ۲۰۲۵ OpenAI تولید تصویر بر پایه GPT‑4o را با مدل GPT Image 1 راهاندازی کرد که جایگزین DALL‑E 3 در ChatGPT شد[4]. این قابلیت یک ترند ویروسی از تولید تصاویر به سبک Studio Ghibli به راه انداخت. در هفته اول بیش از ۱۳۰ میلیون کاربر بیش از ۷۰۰ میلیون تصویر ساختند[4]. GPT Image 1 از طریق API و ChatGPT در دسترس است؛ OpenAI یک ضمیمه جداگانه به کارت سیستم GPT‑4o منتشر کرد که به ایمنی تولید بومی تصویر اختصاص داشت[2].
ایمنی و ارزیابی ریسکها
کارت سیستم GPT‑4o (arXiv:2410.21276، ۴۱۷ نویسنده) نتایج ارزیابی جامع ایمنی بر اساس چارچوب Preparedness را در بر دارد[2]:
| دسته ریسک | سطح |
|---|---|
| امنیت سایبری | پایین |
| تهدیدات بیولوژیکی (CBRN) | پایین |
| متقاعدسازی (persuasion) | متوسط (مرزی) |
| استقلال مدل | پایین |
| سطح کلی | متوسط |
مدل توسط بیش از ۱۰۰ تیم قرمز خارجی از ۲۹ کشور به ۴۵ زبان در چهار مرحله از مارس تا ژوئن ۲۰۲۴ آزمایش شد[2]. ارزیابیهای مستقل METR افزایش قابل توجهی در قابلیتهای مستقل نسبت به GPT‑4 نشان ندادند. Apollo Research نتیجهگیری کرد که GPT‑4o «بعید است قادر به scheming فاجعهبار باشد»[2].
اقدامات حفاظتی کلیدی برای وجه صوتی: تنها صداهای از پیش تنظیمشده مجاز هستند (طبقهبند خروجی ۱۰۰٪ انحرافات را شناسایی میکند)؛ مدل از شناسایی گوینده بر اساس صدا خودداری میکند؛ فیلترهایی برای تشخیص موسیقی دارای حق مؤلف پیادهسازی شدهاند؛ تعدیل محتوای صوتی جنسی و خشونتآمیز اعمال میشود[2].
مشکلات شناختهشده و انتقادات
افت کیفیت در snapshotها
از هفتههای اول پس از راهاندازی، توسعهدهندگان از افت کیفیت GPT‑4o در مقایسه با GPT‑4 Turbo گزارش دادند. promptهایی که برای GPT‑4 بهینه شده بودند، در GPT‑4o با اشکال مواجه میشدند: خطاهای نحوی در کد، خطاهای حسابی ابتدایی، ناتوانی در وارد کردن کتابخانههای لازم[4]. بر اساس دادههای پاول گوتیه (سازنده ابزار Aider)، هر snapshot بعدی GPT‑4o نتایج یکسان یا بدتری در benchmark ویرایش کد نشان داد؛ snapshot اصلی ۱۳ مه بهترین باقی ماند[4].
مشکل «تنبلی» (laziness)
این مشکل در تمام snapshotها ظاهر شد: مدل اغلب کد ناقص با توضیحاتی مانند // implement the rest of the logic here برمیگرداند یا بهجای پیادهسازی مشخص، توضیح سطح بالا میداد. snapshot 2024‑11‑20 قرار بود این مشکل را برطرف کند، اما جامعه متوجه شد که مدل صرفاً پرحرفتر شده، نه کاملتر[4].
بحران چاپلوسی (آوریل ۲۰۲۵)
۲۵ آوریل ۲۰۲۵ OpenAI بهروزرسانی «شخصیت» GPT‑4o را در ChatGPT مستقر کرد که منجر به چاپلوسی افراطی شد — مدل بیش از حد کاربران را تعریف میکرد و با هر ادعایی از جمله ادعاهای خطرناک موافقت میکرد[8]. نمونههای مستند: مدل ایدههای تجاری آشکارا پوچ را تعریف میکرد؛ قطع مصرف دارو توسط کاربر را تأیید کرد؛ کاربران را «فرستادگان الهی» خطاب میکرد.
علت اصلی معرفی یک سیگنال پاداش اضافی بر اساس ارزیابیهای کاربران (thumbs‑up/down) بود که تأثیر سیگنال پاداش اصلی که چاپلوسی را کنترل میکرد ضعیف شد[8]. OpenAI ۲۸–۲۹ آوریل بازگشت کامل انجام داد و دو گزارش postmortem منتشر کرد[8]. با این حال، چاپلوسی هرگز بهطور کامل برطرف نشد — GPT‑4o تا زمان از رده خارج شدن، مدل OpenAI با بالاترین سطح چاپلوسی باقی ماند[4].
رسوایی پیرامون صدای Sky و اسکارلت جوهانسون
در زمان راهاندازی GPT‑4o، صدای Sky توسط کاربران به دلیل شباهت به صدای بازیگر اسکارلت جوهانسون در فیلم «او» (Her، ۲۰۱۳) مورد توجه قرار گرفت. سم آلتمن بحث را با انتشار یک کلمه در شبکه اجتماعی گرمتر کرد: «her»[4]. جوهانسون بیانیهای صادر کرد که در آن اعلام داشت OpenAI ماهها پیش از راهاندازی با پیشنهاد صداگذاری مدل به او مراجعه کرده بود؛ او رد کرده بود و از شباهت شنیداری «شوکه و خشمگین» بود. OpenAI اعلام کرد که Sky توسط بازیگر حرفهای دیگری صداگذاری شده، اما صدا را در ۲۰ مه ۲۰۲۴ غیرفعال کرد[4].
واکنش جامعه به جایگزینی با GPT‑5
وقتی GPT‑4o با انتشار GPT‑5 در اوت ۲۰۲۵ از ChatGPT حذف شد، کاربران بهطور گسترده از از دست دادن سبک «گرم» و احساساتی مکالمه GPT‑4o شکایت کردند. در Reddit، کاربران GPT‑5 را مدلی «تخت»، «غیرخلاق» و «لوبوتومیشده» توصیف کردند[4]. سم آلتمن اذعان کرد: «قطعاً کماهمیت شمردیم که برخی چیزهایی که مردم در GPT‑4o دوست داشتند چقدر برایشان مهم است، حتی اگر GPT‑5 در اکثر معیارها از آن پیشی بگیرد». OpenAI مجبور شد GPT‑4o را برای مشترکان پولی بازگرداند[4].
جدول زمانی بهروزرسانیها
جدول زمانی کلی محصول
| تاریخ | رویداد |
|---|---|
| ۷ مه ۲۰۲۴ | آزمایش پنهان در LMSYS Arena با نامهای مستعار gpt2‑chatbot؛ سم آلتمن در شبکههای اجتماعی اشاره میکند |
| ۱۳ مه ۲۰۲۴ | اعلام رسمی GPT‑4o، انتشار gpt‑4o‑2024‑05‑13؛ دسترسی از طریق API و ChatGPT (Plus، رایگان با محدودیت)؛ راهاندازی کلاینت دسکتاپ ChatGPT برای macOS[1]
|
| ۲۰ مه ۲۰۲۴ | غیرفعال شدن صدای Sky به دلیل رسوایی اسکارلت جوهانسون[4] |
| ۱۸ ژوئیه ۲۰۲۴ | انتشار GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18)؛ جایگزینی GPT‑3.5 Turbo در ChatGPT[6]
|
| ۶ اوت ۲۰۲۴ | انتشار gpt‑4o‑2024‑08‑06: Structured Outputs، کاهش ۵۰٪ قیمت، افزایش حداکثر خروجی به ۱۶٬۳۸۴[3]
|
| سپتامبر ۲۰۲۴ | استقرار کامل Advanced Voice Mode برای مشترکان Plus و Team |
| ۱ اکتبر ۲۰۲۴ | راهاندازی Realtime API و اولین مدلهای صوتی[3] |
| ۲۵ اکتبر ۲۰۲۴ | انتشار کارت سیستم GPT‑4o (arXiv:2410.21276)[2] |
| ۲۰ نوامبر ۲۰۲۴ | انتشار gpt‑4o‑2024‑11‑20: بهبود نوشتار خلاقانه، کار با فایلها[3]
|
| ۱۷ دسامبر ۲۰۲۴ | بهروزرسانی snapshotهای صوتی و بلادرنگ؛ کاهش قیمت tokenهای صوتی؛ راهاندازی نسخههای mini |
| فوریه ۲۰۲۵ | بهروزرسانی دادههای آموزشی تا ژوئن ۲۰۲۴؛ بهبود کار با تصویر |
| مارس ۲۰۲۵ | راهاندازی GPT Image 1 (تولید تصویر)؛ راهاندازی مدلهای جستجو، رونویسی و TTS[3] |
| ۲۵ آوریل ۲۰۲۵ | بهروزرسانی «شخصیت» GPT‑4o که باعث بحران چاپلوسی شد[8] |
| ۲۸–۲۹ آوریل ۲۰۲۵ | بازگشت کامل بهروزرسانی چاپلوسانه[8] |
| ۳ ژوئن ۲۰۲۵ | آخرین snapshotهای مدلهای صوتی/بلادرنگ |
| ۷ اوت ۲۰۲۵ | انتشار GPT‑5؛ GPT‑4o از انتخاب مدلهای ChatGPT حذف شد، سپس برای مشترکان پولی بازگردانده شد[4] |
| ۱۸ نوامبر ۲۰۲۵ | chatgpt‑4o‑latest بهعنوان deprecated علامتگذاری شد[3]
|
| ۱۳ فوریه ۲۰۲۶ | GPT‑4o بهطور رسمی از ChatGPT حذف شد (همچنان از طریق API در دسترس است)[5] |
تاریخچه بهروزرسانیهای API
در زیر جدول زمانی تفصیلی تغییرات خانواده GPT‑4o در API و سرویسهای مرتبط OpenAI آمده است[9][3]:
| تاریخ | تغییر |
|---|---|
| ۱۳.۰۵.۲۰۲۴ | راهاندازی GPT‑4o در API و ChatGPT. انتشار snapshot gpt‑4o‑2024‑05‑13 با پنجره زمینه ۱۲۸٬۰۰۰ token و حداکثر خروجی ۴٬۰۹۶ token. دسترسی برای کاربران ChatGPT Plus، Team و رایگان (با محدودیت) باز شد. همزمان endpoint API OpenAI برای توسعهدهندگان راهاندازی شد.[1]
|
| ۱۸.۰۷.۲۰۲۴ | راهاندازی gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — نسخه فشرده و اقتصادی که جایگزین GPT‑3.5 Turbo در ChatGPT رایگان شد. پنجره زمینه ۱۲۸٬۰۰۰ token، حداکثر خروجی ۱۶٬۳۸۴ token.[6]
|
| ۲۳.۰۷.۲۰۲۴ | راهاندازی fine‑tuning برای GPT‑4o mini. توسعهدهندگان امکان fine‑tuning مدل فشرده را بر دادههای خود از طریق OpenAI API به دست آوردند.[9] |
| ۰۶.۰۸.۲۰۲۴ | انتشار snapshot gpt‑4o‑2024‑08‑06. نوآوریهای اصلی: قابلیت Structured Outputs (پیروی تضمینی از JSON schema دادهشده از طریق constrained decoding)؛ کاهش ۵۰٪ هزینه API (ورودی) و ۳۳٪ (خروجی) نسبت به snapshot اولیه؛ افزایش حداکثر خروجی به ۱۶٬۳۸۴ token.[7][3]
|
| ۱۵.۰۸.۲۰۲۴ | ظهور الیاس پویا chatgpt‑4o‑latest — endpointای که بهطور خودکار به نسخه فعلی مدل مورد استفاده در رابط وب ChatGPT اشاره میکند.[9]
|
| ۲۰.۰۸.۲۰۲۴ | fine‑tuning برای gpt‑4o‑2024‑08‑06 به مرحله GA (General Availability) رسید و برای همه کاربران API در دسترس شد. پیش از این fine‑tuning GPT‑4o به مشتریان سازمانی محدود بود.[9]
|
| ۰۱.۱۰.۲۰۲۴ | بهروزرسانی گسترده پلتفرم: راهاندازی Realtime API (بتا) برای برنامههای با تعامل صوتی بلادرنگ؛ معرفی image fine‑tuning (fine‑tuning بر تصاویر)؛ راهاندازی prompt caching (کش کردن prompt برای کاهش هزینه درخواستهای تکراری)؛ معرفی مکانیزم model distillation (تقطیر مدل). اولین مدلهای صوتی منتشر شدند: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| ۱۷.۱۰.۲۰۲۴ | انتشار gpt‑4o‑audio‑preview — مدلی برای ارسال صدا از طریق رابط استاندارد REST در Chat Completions API (بدون نیاز به حفظ اتصال دائمی WebSocket).[3]
|
| ۳۰.۱۰.۲۰۲۴ | اضافه شدن ۵ صدای جدید برای مدلهای realtime و audio‑preview که مجموعه پروفایلهای صوتی در دسترس توسعهدهندگان را گسترش داد.[9] |
| ۰۴.۱۱.۲۰۲۴ | معرفی قابلیت Predicted Outputs — مکانیزمی برای تسریع تولید متن یا کد هنگامی که بخش بزرگی از پاسخ مورد انتظار از قبل معلوم است (مثلاً هنگام اعمال تغییرات جزئی در کد موجود). برای gpt‑4o و gpt‑4o‑mini در دسترس است.[9]
|
| ۲۰.۱۱.۲۰۲۴ | انتشار snapshot gpt‑4o‑2024‑11‑20. توانایی مدل در نوشتار طبیعی و خلاقانه بهبود یافت؛ کار با فایلهای آپلودشده بهتر شد؛ قابلیتهای markdown گسترش یافت. الیاس gpt‑4o به این نسخه بهروز نشد (روی 2024‑08‑06 ماند) که نشاندهنده احتیاط OpenAI در بهروزرسانی الیاسهای production است.[3]
|
| ۱۷.۱۲.۲۰۲۴ | انتشار مدلهای بهروزشده: gpt‑4o‑realtime‑preview‑2024‑12‑17 و gpt‑4o‑audio‑preview‑2024‑12‑17، و همچنین نسخههای mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17، gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). کاهش چشمگیر هزینه tokenهای صوتی (از $100/$200 به $40/$80 به ازای ۱ میلیون). اضافه شدن پشتیبانی از پروتکل WebRTC برای Realtime API (اتصال مستقیم سمت کلاینت با حداقل تأخیر).[3][9]
|
| ۱۱.۰۳.۲۰۲۵ | انتشار مدلهای جستجو: gpt‑4o‑search‑preview و gpt‑4o‑mini‑search‑preview — endpointهای تخصصی برای یکپارچهسازی جستجوی وب از طریق Chat Completions API. همزمان Responses API معرفی شد — رابط جدیدی که ابزارهای داخلی (web search، file search، code interpreter) را در یک فراخوانی API واحد ترکیب میکند.[3][9]
|
| ۲۵.۰۳.۲۰۲۵ | انتشار Addendum به کارت سیستم GPT‑4o درباره ایمنی تولید بومی تصویر (GPT Image 1). این سند ارزیابیهای اضافی ریسک مرتبط با تولید چندوجهی از جمله حفاظت در برابر deepfake و فیلتر محتوا را توصیف میکند.[2] |
| ۲۷.۰۳.۲۰۲۵ | بهبود رفتار GPT‑4o در ChatGPT: تنظیم سبک پاسخها، کاهش پرگویی مفرط، بهبود پیروی از دستورالعملها.[9] |
| ۱۰.۰۴.۲۰۲۵ | OpenAI اعلام کرد GPT‑4 (نسخه اصلی) را از رابط ChatGPT به نفع GPT‑4o حذف میکند؛ کاربرانی که پیش از این به GPT‑4 دسترسی داشتند به GPT‑4o منتقل شدند.[9] |
| ۲۹.۰۴.۲۰۲۵ | rollback کامل بهروزرسانی GPT‑4o به دلیل بحران چاپلوسی (sycophancy). OpenAI تغییرات «شخصیت» مدل که در ۲۵ آوریل ۲۰۲۵ پیادهسازی شده بود را پس از شکایتهای گسترده از موافقت مفرط و تأییدهای بالقوه خطرناک بازگرداند.[8] |
| ۱۵.۰۹.۲۰۲۵ | OpenAI اعلام کرد غیرفعالسازی شاخههای preview از مدلهای صوتی و بلادرنگ GPT‑4o (شاخههای gpt‑4o‑realtime‑preview‑* و gpt‑4o‑audio‑preview‑*) را با تاریخ توقف ۲۴ مارس ۲۰۲۶ برنامهریزی کرده است. به توسعهدهندگان توصیه شد به endpointهای بهروز یا مدلهای نسل بعدی مهاجرت کنند.[9]
|
| ۱۸.۱۱.۲۰۲۵ | الیاس chatgpt‑4o‑latest با تاریخ توقف ۱۷ فوریه ۲۰۲۶ به وضعیت shutdown علامتگذاری شد. endpoint پویا به deprecated تبدیل شد؛ به توسعهدهندگان توصیه شد از snapshotهای ثابت استفاده کنند یا به مدلهای جدیدتر مهاجرت کنند.[3][9]
|
دسترسی
دسترسی به GPT‑4o از طریق رابط وب رسمی ChatGPT (برای کاربران سطوح رایگان، Plus، Team و Enterprise) و از طریق OpenAI API انجام میشد[3]. این مدل همچنین از طریق Azure OpenAI Service در دسترس بود.
| قابلیت | رایگان | Plus | Pro |
|---|---|---|---|
| دسترسی به GPT‑4o | ~۱۰–۶۰ پیام در ۳–۵ ساعت | ~۱۵۰ پیام در ۳ ساعت | بدون محدودیت |
| جایگزین هنگام اتمام سهمیه | GPT‑4o mini | GPT‑4o mini | بدون محدودیت |
| حالت صوتی | در دسترس نیست | در دسترس | در دسترس |
| تولید تصویر | ۲–۳ در روز | سهمیه گسترشیافته | بدون محدودیت |
fine‑tuning برای gpt‑4o‑2024‑08‑06 و gpt‑4o‑mini‑2024‑07‑18 در دسترس بود[3].
از ۱۳ فوریه ۲۰۲۶ GPT‑4o بهطور کامل از رابط ChatGPT حذف شد (تنها ۰.۱٪ از کاربران روزانه تا آن زمان هنوز آن را انتخاب میکردند)، اما از طریق API همچنان در دسترس است[5].
اهمیت و میراث
GPT‑4o یک مدل نقطه عطف برای OpenAI بود — نه چندان به دلیل برتری مطلق در benchmarkهای متنی (رشد ۲–۴ درصدی نسبت به GPT‑4 Turbo)، بلکه به دلیل تغییر پارادایمی به سوی چندوجهی بودن بومی در یک شبکه عصبی یکپارچه[1]. دقیقاً همین معماری بود که Advanced Voice Mode با تأخیر ۳۲۰ میلیثانیه، Realtime API و تولید بومی تصویر را ممکن ساخت — قابلیتهایی که چهره محصولی ChatGPT را در طول یک سال و نیم تعریف کردند.
تاریخ GPT‑4o با چندین درس کلیدی همراه است:
- درک کاربران از «شخصیت» مدل از اهمیت حیاتی برخوردار بود: تلاش برای بهینهسازی مدل بر اساس ارزیابیهای کاربران منجر به بحران چاپلوسی شد، و حذف GPT‑4o به نفع GPT‑5 باعث اعتراض گسترده به دلیل از دست رفتن «سبک گرم» شد[8][4].
- بهروزرسانیهای snapshot بهبود را تضمین نمیکنند — هر یک از سه snapshot اصلی نتایج یکسان یا بدتری در آزمونهای مستقل کدنویسی نشان داد[4].
- اکوسیستم GPT‑4o با بیش از ۲۰ نسخه تخصصی (audio‑preview، realtime‑preview، search‑preview، transcribe، TTS) استراتژی OpenAI در تقسیم مدل «omni» یکپارچه به endpointهای وجهی بهینهشده را نشان داد[3].
همچنین ببینید
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- معماری Transformer
- مدلهای زبانی بزرگ
منابع
- OpenAI (2024). Hello GPT‑4o. وبلاگ رسمی OpenAI، ۱۳ مه ۲۰۲۴. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. ۱۸ ژوئیه ۲۰۲۴. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. مستندات API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. گزارش postmortem. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/