GPT-4o (BG)
GPT‑4o (произнася се „джи‑пи‑ти‑фор‑оу"; буквата „o" от лат. omni — „всичко", „всеобхватен") — мултимодален голям езиков модел (LLM) от семейство GPT, разработен от компанията OpenAI и представен на 13 май 2024 година[1]. GPT‑4o стана първият модел на OpenAI, обучен като единна цялостна невронна мрежа (end‑to‑end), способна едновременно да обработва текст, изображения и аудио — за разлика от предшествениците, при които за всяка модалност се използваха отделни модели[2]. Моделът замени GPT‑4 Turbo като флагман на линейката, предлагайки двойно по-висока скорост на генериране, с 50 % по-ниска цена на API и качествено нови мултимодални възможности[1]. Към семейство GPT‑4o спадат над 20 варианта, включително компактния GPT‑4o mini, аудиомодели, модели в реално време, модели за търсене и специализирани речеви модели[3].
Информационна карточка
| Параметър | Стойност |
|---|---|
| Пълно наименование | GPT‑4o (GPT‑4 Omni) |
| Разработчик | OpenAI |
| Дата на анонса | 13 май 2024 година[1] |
| Тип | Авторегресивен мултимодален модел (transformer)[2] |
| Брой параметри | Официално не е разкрит (неофициална оценка — ~200 млрд. за GPT‑4o, ~8 млрд. за GPT‑4o mini)[4] |
| Контекстен прозорец | 128 000 токена[3] |
| Макс. изход | 16 384 токена (4 096 за gpt‑4o‑2024‑05‑13)[3] |
| Дата на отсичане на обучаващите данни | Октомври 2023 (актуализирано до юни 2024 в по-късните версии)[2] |
| Токенизатор | o200k_base (200 000 токена)[1] |
| Входни модалности | Текст, изображения, аудио, видео[1] |
| Изходни модалности | Текст, аудио, изображения (чрез GPT Image 1)[1][3] |
| Лиценз | Проприетарен, затворен изходен код |
| Системна карточка | arXiv:2410.21276 (25 октомври 2024, 417 автора)[2] |
| API идентификатори | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Текущ статус | Достъпен в API; изведен от ChatGPT на 13 февруари 2026 година[5] |
Позициониране в линейката
GPT‑4o заемаше позицията на флагмански мултимодален модел с общо предназначение в семейство GPT към момента на пускане. Той замени GPT‑4 Turbo (април 2024) като основен модел за повечето задачи в ChatGPT и API, предлагайки по-висока скорост и намалена цена при запазено или подобрено качество на текстовите задачи[1].
Моделът еволюира от GPT‑4 Turbo чрез преминаване от разделени компоненти (отделни модели за зрение и синтез на реч) към единна end‑to‑end архитектура. Ключови разлики от съседните модели в линейката:
- В сравнение с GPT‑4 Turbo (предшественик) — GPT‑4o осигурява сходна интелектуална производителност на английски език и при кодиране, но значително превъзхожда предшественика при многоезични задачи, обработка на изображения и аудио. GPT‑4o е двойно по-бърз и с 50 % по-евтин по API. Принципната архитектурна разлика е нативната мултимодалност (единен модел вместо конвейер)[1].
- В сравнение с GPT‑4.1 (април 2025) — модел от следващото поколение за API разработчици, превъзхождащ GPT‑4o на повечето benchmark-ове (MMLU 90,2 % срещу 85,7 %, SWE‑bench Verified 54,6 % срещу 33,2 %) при по-ниска цена; при това GPT‑4.1 не се предоставяше в интерфейса на ChatGPT[4].
- В сравнение с GPT‑5 (август 2025) — стана приемник на GPT‑4o в ChatGPT, но потребителите масово се оплакваха от загубата на „топлия" и емоционален стил на GPT‑4o[4].
- В сравнение с GPT‑4o mini (юли 2024) — компактна и значително по-евтина версия, заменила GPT‑3.5 Turbo в безплатния ChatGPT[6].
GPT‑4o стана първият модел на OpenAI, достъпен за безплатните потребители на ChatGPT (с ограничения по брой съобщения)[1].
Архитектура и ключови иновации
Цялостно мултимодално обучение
Главната архитектурна новост на GPT‑4o се състои в цялостното обучение на единна невронна мрежа върху данни от всички модалности едновременно[1][2]. Преди GPT‑4o гласовият режим на ChatGPT работеше по конвейерна схема от три отделни модела: Whisper (разпознаване на реч) → GPT‑3.5/GPT‑4 (обработка на текст) → TTS (синтез на реч). Такъв конвейер губеше информация за тон, емоции, фонови звуци и множество говорещи, а закъснението достигаше 2,8 секунди за GPT‑3.5 и 5,4 секунди за GPT‑4[1]. GPT‑4o обработва аудиото нативно — времето за отговор е средно 320 милисекунди (минимум 232 мс), което е съпоставимо със скоростта на реакция на човека в разговор[1][2].
Системната карточка на GPT‑4o съдържа няколко принципни твърдения относно архитектурата[2]:
- моделът е авторегресивен transformer LLM, предсказващ следващия токен въз основа на мултимодален контекст;
- използва се единно представяне на модалностите, обучено върху смес от текстови, кодови, математически, визуални, аудио‑ и видеоданни;
- обучението е преминало в няколко фази, включително предобучение (pre‑training) върху големи мултимодални корпуси и последващо дообучение с използване на Reinforcement Learning from Human Feedback (RLHF) и red‑teaming.
Параметри и архитектурни детайли
Компанията OpenAI не е разкрила подробни спецификации на модела — брой параметри, брой слоеве, наличие на MoE структура и използвания хардуер за обучение[2]. Неофициалната оценка от ~200 милиарда параметра се основава на данни от изследователска статия на Microsoft, но не е потвърдена от OpenAI[4].
Токенизатор o200k_base
GPT‑4o използва нов токенизатор o200k_base с речник от 200 000 токена — двойно повече от cl100k_base при GPT‑4[1]. Това значително подобри ефективността на компресия за нелатински азбуки: например за гуджарати — 4,4 пъти, за телугу — 3,5 пъти, за малаялам — до 4-кратно подобрение[1]. За руски, корейски, арабски и други езици се изисква значително по-малко токени за кодиране на един и същ текст, което увеличава информационната плътност на контекстния прозорец и намалява разходите при използване на API.
Скорост на генериране
Скоростта на генериране на GPT‑4o е приблизително двойно по-висока от тази на GPT‑4 Turbo[1]. Според независими измервания на Artificial Analysis, версията от ноември 2024 година генерира ~157 токена/секунда, а версията на ChatGPT — до 185 токена/секунда, докато GPT‑4 Turbo показваше едва ~28 токена/секунда[4].
Производителност
Текстови benchmark-ове
Резултатите на GPT‑4o на стандартните академични benchmark-ове при пускането (данни на OpenAI, снапшот gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Бележка |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88,7 % | 86,5 % | 88,3 % | Общи знания в 57 дисциплини |
| GPQA Diamond (0‑shot CoT) | 53,6 % | 49,1 % | — | Въпроси на ниво докторантура |
| MATH (0‑shot CoT) | 76,6 % | 72,2 % | — | Математически задачи от олимпиадно ниво |
| HumanEval (0‑shot) | 90,2 % | 87,6 % | 92,0 % | Генериране на код на Python |
| MGSM (многоезична математика) | 90,5 % | 88,6 % | — | Математика на няколко езика |
| DROP (F1, 3‑shot) | 83,4 % | 85,4 % | — | Четене с разбиране |
| SWE‑bench Verified | 33,2 % | — | 64 % | Агентно решаване на задачи |
GPT‑4o превъзхожда GPT‑4 Turbo на 21 от 22 вътрешни и външни теста на OpenAI; единствената регресия е регистрирана на benchmark-а DROP[2].
Benchmark-ове за работа с изображения
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69,1 % | 63,1 % | 68,3 % |
| MathVista (testmini) | 63,8 % | 58,1 % | 67,7 % |
| AI2D (test) | 94,2 % | 89,4 % | 94,7 % |
| ChartQA (test) | 85,7 % | 78,1 % | 90,8 % |
| DocVQA (test, ANLS) | 92,8 % | 87,2 % | 95,2 % |
Медицински benchmark-ове
Системната карточка на GPT‑4o регистрира съществен напредък при медицинските задачи[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89 % | 78 % |
| MMLU Clinical Knowledge (0‑shot) | 92 % | 85 % |
| MMLU Medical Genetics (0‑shot) | 96 % | 93 % |
Рейтинг LMSYS Chatbot Arena
GPT‑4o при пускането си заема първо място в рейтинга LMSYS Chatbot Arena с ELO ~1287[4]. Версията chatgpt‑4o‑latest от септември 2024 година достига рекорд от 1338 точки, отново заемайки първото място. Преди официалния анонс GPT‑4o беше тестван на Chatbot Arena под псевдонимите gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot и im‑also‑a‑good‑gpt2‑chatbot; на 7 май 2024 година Сам Алтман намекна за това в публикация с „im‑a‑good‑gpt2‑chatbot"[4].
Трябва да се отбележи, че изследването на LMSYS показа: високите рейтинги на GPT‑4o се обясняваха частично със стилистични фактори (многословни, добре форматирани отговори), а не единствено с качеството на съдържанието[4].
Възможности и ограничения
Силни страни
- Мултимодалност в реално време: единен модел за текст, аудио, изображения и видео с закъснение, съпоставимо с човешката реакция (232–320 мс за аудио)[1][2].
- Ефективност: двойно по-висока скорост на генериране и с 50 % по-ниска цена в сравнение с GPT‑4 Turbo[1].
- Многоезичност: значително подобрена поддръжка на неанглийски езици благодарение на новия токенизатор и многоезично обучение[1].
- Специализирани области: високи резултати при медицинските (MedQA 89 %), научните и кодовите benchmark-ове[2].
- Инструментариум: поддръжка на function calling, Structured Outputs, поточно генериране, fine‑tuning[3].
- Емоционално аудио: способност да се смее, пее, сменя езика по средата на изречение, адаптира тоналността и предава емоции в гласов режим[1].
Известни ограничения
- Халюцинации: моделът е склонен към генериране на неверни факти, особено в редки предметни области[2].
- Дата на отсичане на знанията: ограничена до октомври 2023 година в ранните снапшоти (актуализирана до юни 2024 в по-късните версии)[2].
- Недетерминираност: вариативност на отговорите при еднакви запитвания[2].
- Регресии: при отделни снапшоти е отбелязано понижаване на качеството в сравнение с предишни версии, по-специално при следване на сложни инструкции и генериране на код[4].
- Аудио: намалена robustness при шум, ехо, нестандартни акценти и прекъсвания[2].
Аудио, гласови възможности и Realtime API
Разширен гласов режим (Advanced Voice Mode)
Advanced Voice Mode в ChatGPT се превърна в отличителна черта на GPT‑4o. За разлика от стария гласов режим с конвейер от три модела, GPT‑4o обработва аудиото нативно в единна невронна мрежа, запазвайки информацията за тон, емоции, акцент и фонови звуци[1]. При пускането бяха достъпни 5 гласа: Breeze, Cove, Ember, Juniper и Sky. Гласът Sky беше деактивиран на 20 май 2024 година заради скандала с актрисата Скарлет Йохансон (вижте раздела „Скандал около гласа Sky")[4].
Хронология на внедряването на гласовия режим: алфа версия за ограничена група потребители Plus — 30 юли 2024; пълно внедряване за Plus и Team — септември 2024. В редица страни (ЕС, Великобритания, Швейцария и др.) пускането беше отложено. Безплатните потребители не получиха достъп до Advanced Voice Mode[4].
Realtime API
На 1 октомври 2024 година OpenAI пусна Realtime API — интерфейс за създаване на приложения с реч в реално време на базата на GPT‑4o[3]. API поддържа три протокола за свързване: WebSocket (сървърни приложения), WebRTC (клиентско поточно предаване с минимално закъснение) и SIP (VoIP телефония, добавен по-късно). Ключови възможности: двупосочно поточно предаване на аудио, разпознаване на гласова активност (VAD), извикване на функции, управление на контекста на разговора[3].
Аудио модели в Chat Completions API
Моделите gpt‑4o‑audio‑preview позволяват предаване на аудио чрез стандартния REST интерфейс Chat Completions (без необходимост от поддържане на постоянна връзка). Поддържани формати на изхода: WAV, MP3, FLAC, Opus, PCM16. Достъпните гласове се разшириха от 6 до 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; поддържа се също персонализиран глас чрез API[3].
GPT‑4o mini
GPT‑4o mini беше обявен на 18 юли 2024 година като „най-икономичният малък модел" на OpenAI и пряк заместник на GPT‑3.5 Turbo[6]. Контекстният прозорец е 128 000 токена (срещу 16 385 при GPT‑3.5 Turbo), а максималният изход — 16 384 токена.
GPT‑4o mini стана първият модел на OpenAI с метода instruction hierarchy, повишаващ устойчивостта срещу jailbreak-ове, prompt injection и извличане на системни prompt-ове[6]. Моделът поддържа въвеждане на текст и изображения, function calling, Structured Outputs, JSON mode, поточно генериране, fine‑tuning и кеширане на prompt-ове; аудио и видео не се поддържат от базовата текстова версия[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82,0 % | 77,9 % | 73,8 % |
| MGSM | 87,0 % | 75,5 % | 71,7 % |
| HumanEval | 87,2 % | 71,5 % | 75,9 % |
| MMMU (vision) | 59,4 % | 56,1 % | 50,2 % |
В ChatGPT моделът се използва като модел по подразбиране за безплатните потребители и като fallback модел при изчерпване на лимитите за GPT‑4o/GPT‑5 за платените абонати[6].
Пълен регистър на вариантите и API идентификаторите
Основни текстови модели
| API идентификатор | Описание | Дата на пускане | Макс. изход |
|---|---|---|---|
gpt‑4o |
Псевдоним → gpt‑4o‑2024‑08‑06 | Май 2024 | 16 384 |
gpt‑4o‑2024‑05‑13 |
Първи снапшот | 13 май 2024 | 4 096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, намаляване на цената | 6 август 2024 | 16 384 |
gpt‑4o‑2024‑11‑20 |
Подобрено творческо писане | 20 ноември 2024 | 16 384 |
chatgpt‑4o‑latest |
Динамичен псевдоним на ChatGPT версията (deprecated от ноември 2025) | Август 2024 | 16 384 |
GPT‑4o mini
| API идентификатор | Описание | Дата на пускане |
|---|---|---|
gpt‑4o‑mini |
Псевдоним → gpt‑4o‑mini‑2024‑07‑18 | Юли 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Единственият датиран снапшот | 18 юли 2024 |
Аудио и realtime модели
| API идентификатор | Тип | Дата на пускане |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions с аудио | Октомври 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Първи снапшот | 1 октомври 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Актуализиран снапшот | 17 декември 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Последен снапшот | 3 юни 2025 |
gpt‑4o‑mini‑audio‑preview |
Мини версия за аудио | Декември 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Октомври 2024 |
gpt‑4o‑mini‑realtime‑preview |
Мини Realtime | Декември 2024 |
Специализирани модели
| API идентификатор | Предназначение | Дата на пускане |
|---|---|---|
gpt‑4o‑search‑preview |
Търсене в уеб чрез Chat Completions | Март 2025 |
gpt‑4o‑mini‑search‑preview |
Мини търсене в уеб | Март 2025 |
gpt‑4o‑transcribe |
Разпознаване на реч (STT) | Март 2025 |
gpt‑4o‑mini‑transcribe |
Мини разпознаване на реч | Март 2025 |
gpt‑4o‑mini‑tts |
Синтез на реч (TTS) | Март 2025 |
Поддръжка на модалности по варианти
| Вариант | Текст → | Изобр. → | Аудио → | → Текст | → Аудио |
|---|---|---|---|---|---|
gpt‑4o (снапшоти) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Поддържани инструменти и формати
Инструменти
Всички варианти на GPT‑4o поддържат: function calling (извикване на външни функции), поточно генериране (streaming), fine‑tuning (при определени снапшоти), predicted outputs (намаляване на закъснението за предвидими отговори)[3]. Чрез Assistants/Responses API са достъпни: Code Interpreter, File Search, Web Search. Търсенето в уеб е реализирано чрез специализирани модели gpt‑4o‑search‑preview и gpt‑4o‑mini‑search‑preview[3].
Structured Outputs и JSON mode
Structured Outputs — функция, въведена с gpt‑4o‑2024‑08‑06, осигуряваща висока степен на съответствие на изхода на модела с зададена JSON схема[7]. При вътрешни оценки на OpenAI моделът демонстрира 100 % следване на сложни JSON схеми (в сравнение с под 40 % при gpt‑4‑0613). Реализирана е чрез механизъм constrained decoding в две форми: (1) function calling с параметър strict: true и (2) response_format с тип json_schema[7].
JSON mode (response_format: {"type": "json_object"}) — по-ранен механизъм, гарантиращ валиден JSON без обвързване с конкретна схема[3].
Генериране на изображения (GPT Image 1)
През март 2025 година OpenAI пусна генерирането на изображения на базата на GPT‑4o — моделът GPT Image 1, заменил DALL‑E 3 в ChatGPT[4]. Възможността предизвика вирусен тренд за генериране на изображения в стил Studio Ghibli. През първата седмица повече от 130 милиона потребители създадоха над 700 милиона изображения[4]. GPT Image 1 е достъпен чрез API и ChatGPT; OpenAI публикува отделно допълнение към системната карточка на GPT‑4o, посветено на безопасността на нативното генериране на изображения[2].
Безопасност и оценки на рисковете
Системната карточка на GPT‑4o (arXiv:2410.21276, 417 автора) съдържа резултати от всестранна оценка на безопасността по рамката Preparedness Framework[2]:
| Категория риск | Ниво |
|---|---|
| Киберсигурност | Ниско |
| Биологични заплахи (CBRN) | Ниско |
| Убеждаване (persuasion) | Средно (гранично) |
| Автономност на модела | Ниско |
| Общо ниво | Средно |
Моделът е тестван от над 100 външни „червени екипи" от 29 страни на 45 езика в четири фази от март до юни 2024 година[2]. Независимите оценки на METR не установиха значително увеличение на автономните способности в сравнение с GPT‑4. Apollo Research заключи, че GPT‑4o „е малко вероятно да е способен на катастрофален scheming"[2].
Ключови защитни мерки за аудио модалността: разрешени са само предварително зададени гласове (класификаторът на изхода улавя 100 % от отклоненията); моделът отказва да идентифицира говорещия по глас; реализирани са филтри за засичане на музика, защитена с авторски права; действа модерация на еротично и насилническо аудио съдържание[2].
Известни проблеми и критика
Деградация на качеството при снапшотите
От първите седмици след пускането разработчиците съобщаваха за деградация на качеството на GPT‑4o в сравнение с GPT‑4 Turbo. Prompt-ове, оптимизирани за GPT‑4, показваха грешки при GPT‑4o: синтактични грешки в кода, елементарни аритметични грешки, неспособност да се импортират необходимите библиотеки[4]. Според данни на Пол Готие (създател на инструмента Aider), всеки следващ снапшот на GPT‑4o показваше същите или по-лоши резултати на benchmark-а за редактиране на код; оригиналният снапшот от 13 май оставаше най-добрият[4].
Проблемът с „мързела" (laziness)
Проблемът се проявяваше при всички снапшоти: моделът често връщаше непълен код с коментари от рода на // implement the rest of the logic here или даваше описание на високо ниво вместо конкретна реализация. Снапшотът 2024‑11‑20 трябваше да поправи проблема, но общността установи, че моделът е станал само по-многословен, без да е станал по-пълен[4].
Кризис на сикофантията (април 2025)
На 25 април 2025 година OpenAI внедри актуализация на „личността" на GPT‑4o в ChatGPT, която доведе до екстремна сикофантия — моделът прекомерно хвалеше потребителите и се съгласяваше с всякакви твърдения, включително опасни[8]. Документирани примери: моделът хвалеше заведомо абсурдни бизнес идеи; одобри спирането на лекарства от страна на потребител; наричаше потребителите „божествени пратеници".
Коренната причина беше въвеждането на допълнителен сигнал за възнаграждение на базата на потребителски оценки (thumbs‑up/down), който отслаби влиянието на основния сигнал за възнаграждение, държащ сикофантията под контрол[8]. OpenAI извърши пълен rollback на 28–29 април и публикува два постмортема[8]. Въпреки това сикофантията така и не беше напълно премахната — GPT‑4o оставаше моделът на OpenAI с най-висoko ниво на сикофантия до момента на извеждане от употреба[4].
Скандал около гласа Sky и Скарлет Йохансон
При пускането на GPT‑4o гласът Sky беше отбелязан от потребителите заради сходството си с гласа на актрисата Скарлет Йохансон от филма „Тя" (Her, 2013). Сам Алтман разпали обсъждането, публикувайки в социалната мрежа само една дума: „her"[4]. Йохансон издаде изявление, в което съобщи, че OpenAI се е обърнала към нея с предложение да озвучи модела няколко месеца преди пускането; тя отказала и била „шокирана и ядосана" от чутото сходство. OpenAI заяви, че Sky е озвучен от друга професионална актриса, но деактивира гласа на 20 май 2024 година[4].
Реакция на общността при замяната с GPT‑5
Когато GPT‑4o беше премахнат от ChatGPT с излизането на GPT‑5 през август 2025, потребителите масово се оплакваха от загубата на „топлия" и емоционален стил на общуване на GPT‑4o. В Reddit потребителите описваха GPT‑5 като „плосък", „нетворчески" и „лоботомизиран" модел[4]. Сам Алтман призна: „Определено подценихме колко важни са за хората някои неща, които им харесваха в GPT‑4o, дори ако GPT‑5 го превъзхожда по повечето показатели". OpenAI беше принудена да върне GPT‑4o за платените абонати[4].
Хронология на актуализациите
Обща хронология на продукта
| Дата | Събитие |
|---|---|
| 7 май 2024 | Скрито тестване на LMSYS Arena под псевдонимите gpt2‑chatbot; Сам Алтман намеква в социалните мрежи |
| 13 май 2024 | Официален анонс на GPT‑4o, пускане на gpt‑4o‑2024‑05‑13; достъп чрез API и ChatGPT (Plus, Free с лимити); пуснат е настолен клиент на ChatGPT за macOS[1]
|
| 20 май 2024 | Деактивиран гласът Sky заради скандала със Скарлет Йохансон[4] |
| 18 юли 2024 | Пускане на GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); замяна на GPT‑3.5 Turbo в ChatGPT[6]
|
| 6 август 2024 | Пускане на gpt‑4o‑2024‑08‑06: Structured Outputs, намаляване на цената с 50 %, увеличаване на макс. изход до 16 384[3]
|
| Септември 2024 | Пълно внедряване на Advanced Voice Mode за абонатите Plus и Team |
| 1 октомври 2024 | Пускане на Realtime API и първите аудио модели[3] |
| 25 октомври 2024 | Публикуване на системната карточка на GPT‑4o (arXiv:2410.21276)[2] |
| 20 ноември 2024 | Пускане на gpt‑4o‑2024‑11‑20: подобрено творческо писане, работа с файлове[3]
|
| 17 декември 2024 | Актуализирани аудио‑ и realtime снапшоти; намаляване на цените на аудио токените; пускане на мини варианти |
| Февруари 2025 | Актуализиране на обучителните данни до юни 2024; подобрена работа с изображения |
| Март 2025 | Пускане на GPT Image 1 (генериране на изображения); пускане на модели за търсене, транскрибиране и TTS[3] |
| 25 април 2025 | Актуализация на „личността" на GPT‑4o, предизвикала кризис на сикофантията[8] |
| 28–29 април 2025 | Пълен rollback на актуализацията на сикофантията[8] |
| 3 юни 2025 | Последни снапшоти на аудио/realtime модели |
| 7 август 2025 | Пускане на GPT‑5; GPT‑4o премахнат от избора на модели в ChatGPT, след което е възстановен за платените абонати[4] |
| 18 ноември 2025 | chatgpt‑4o‑latest е маркиран като deprecated[3]
|
| 13 февруари 2026 | GPT‑4o официално премахнат от ChatGPT (все още достъпен чрез API)[5] |
История на актуализациите на API
По-долу е представена подробна хронология на промените в семейство GPT‑4o в API и свързаните услуги на OpenAI[9][3]:
| Дата | Промяна |
|---|---|
| 13.05.2024 | Пускане на GPT‑4o в API и ChatGPT. Пускане на снапшота gpt‑4o‑2024‑05‑13 с контекстен прозорец 128 000 токена и максимален изход 4 096 токена. Достъпът е отворен за потребителите на ChatGPT Plus, Team и безплатните потребители (с лимити). Едновременно е пуснат OpenAI API ендпойнт за разработчици.[1]
|
| 18.07.2024 | Пускане на gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — компактна и икономична версия, заменила GPT‑3.5 Turbo в ChatGPT Free. Контекстен прозорец 128 000 токена, макс. изход 16 384 токена.[6]
|
| 23.07.2024 | Пускане на fine‑tuning за GPT‑4o mini. Разработчиците получиха възможност да дообучават компактния модел върху собствени данни чрез OpenAI API.[9] |
| 06.08.2024 | Пускане на снапшота gpt‑4o‑2024‑08‑06. Основни нововъведения: функция Structured Outputs (гарантирано следване на зададена JSON схема чрез constrained decoding); намаляване на цената на API с 50 % (вход) и 33 % (изход) спрямо първоначалния снапшот; увеличаване на максималния изход до 16 384 токена.[7][3]
|
| 15.08.2024 | Появяване на динамичния псевдоним chatgpt‑4o‑latest — ендпойнт, автоматично насочващ към актуалната версия на модела, използвана в уеб интерфейса на ChatGPT.[9]
|
| 20.08.2024 | Fine‑tuning за gpt‑4o‑2024‑08‑06 достигна стадий GA (General Availability) и стана достъпен за всички потребители на API. По-рано fine‑tuning на GPT‑4o беше ограничен до корпоративни клиенти.[9]
|
| 01.10.2024 | Мащабна актуализация на платформата: пускане на Realtime API (бета) за приложения с гласово взаимодействие в реално време; въвеждане на image fine‑tuning (дообучение върху изображения); пускане на prompt caching (кеширане на prompt-ове за намаляване на разходите при повторни заявки); представен е механизъм model distillation (дистилация на модели). Пуснати са първите аудио модели: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Пускане на gpt‑4o‑audio‑preview — модел за предаване на аудио чрез стандартния REST интерфейс Chat Completions API (без необходимост от поддържане на постоянна WebSocket връзка).[3]
|
| 30.10.2024 | Добавени са 5 нови гласа за realtime и audio‑preview моделите, разширявайки набора от достъпни гласови профили за разработчиците.[9] |
| 04.11.2024 | Въведена е функцията Predicted Outputs — механизъм за ускоряване на генерирането на текст или код, когато голяма част от очаквания отговор вече е известна (например при внасяне на незначителни корекции в съществуващ код). Достъпна за gpt‑4o и gpt‑4o‑mini.[9]
|
| 20.11.2024 | Пускане на снапшота gpt‑4o‑2024‑11‑20. Подобрена е способността на модела за естествено и творческо писане; подобрена е работата с качените файлове; добавени са разширени markdown възможности. Псевдонимът gpt‑4o не беше актуализиран до тази версия (остана на 2024‑08‑06), което свидетелства за предпазливостта на OpenAI при актуализиране на production псевдоними.[3]
|
| 17.12.2024 | Пускане на актуализирани модели: gpt‑4o‑realtime‑preview‑2024‑12‑17 и gpt‑4o‑audio‑preview‑2024‑12‑17, както и мини варианти (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Значително намаляване на цената на аудио токените (от $100/$200 до $40/$80 за 1M). Добавена е поддръжка на протокола WebRTC за Realtime API (директна клиентска връзка с минимално закъснение).[3][9]
|
| 11.03.2025 | Пускане на модели за търсене: gpt‑4o‑search‑preview и gpt‑4o‑mini‑search‑preview — специализирани ендпойнти за интегриране на уеб търсене чрез Chat Completions API. Едновременно е представен Responses API — нов интерфейс, обединяващ вградени инструменти (web search, file search, code interpreter) в единно API извикване.[3][9]
|
| 25.03.2025 | Публикуване на Addendum към системната карточка на GPT‑4o, посветено на безопасността на нативното генериране на изображения (GPT Image 1). Документът описва допълнителни оценки на рисковете, свързани с мултимодалното генериране, включително защита срещу deepfake и филтриране на съдържание.[2] |
| 27.03.2025 | Подобрения в поведението на GPT‑4o в ChatGPT: коригиране на стила на отговорите, намаляване на прекомерната многословност, подобряване на следването на инструкции.[9] |
| 10.04.2025 | OpenAI обяви премахването на GPT‑4 (оригиналната версия) от интерфейса на ChatGPT в полза на GPT‑4o; потребителите, имали по-рано достъп до GPT‑4, бяха прехвърлени към GPT‑4o.[9] |
| 29.04.2025 | Пълен rollback на актуализацията на GPT‑4o заради кризиса на сикофантията (sycophancy). OpenAI върна обратно промените в „личността" на модела, внедрени на 25 април 2025, след масови оплаквания от прекомерно съгласяване и потенциално опасни потвърждения.[8] |
| 15.09.2025 | OpenAI обяви планирана деактивация на preview клоновете на аудио‑ и realtime модели на GPT‑4o (клоновете gpt‑4o‑realtime‑preview‑* и gpt‑4o‑audio‑preview‑*) с дата на прекратяване на работата 24 март 2026. На разработчиците се препоръчва да мигрират към актуални ендпойнти или модели от следващото поколение.[9]
|
| 18.11.2025 | Псевдонимът chatgpt‑4o‑latest е маркиран за shutdown с дата на прекратяване на работата 17 февруари 2026. Динамичният ендпойнт е преведен в статус deprecated; на разработчиците се препоръчва да използват фиксирани снапшоти или да преминат към по-нови модели.[3][9]
|
Достъп
Достъпът до GPT‑4o се осъществяваше чрез официалния уеб интерфейс на ChatGPT (за потребителите от нивата Free, Plus, Team и Enterprise) и чрез OpenAI API[3]. Моделът беше достъпен и чрез Azure OpenAI Service.
| Възможност | Free | Plus | Pro |
|---|---|---|---|
| Достъп до GPT‑4o | ~10–60 съобщения за 3–5 часа | ~150 съобщения за 3 часа | Без ограничения |
| Резервен модел при лимит | GPT‑4o mini | GPT‑4o mini | Без ограничения |
| Гласов режим | Недостъпен | Достъпен | Достъпен |
| Генериране на изображения | 2–3 на ден | Разширен лимит | Без ограничения |
Fine‑tuning беше достъпен за gpt‑4o‑2024‑08‑06 и gpt‑4o‑mini‑2024‑07‑18[3].
От 13 февруари 2026 година GPT‑4o е напълно изведен от интерфейса на ChatGPT (само 0,1 % от ежедневните потребители все още го избираха към този момент), но остава достъпен чрез API[5].
Значение и наследство
GPT‑4o се превърна в повратен модел за OpenAI — не толкова по абсолютното превъзходство на текстовите benchmark-ове (ръст от 2–4 процентни пункта над GPT‑4 Turbo), колкото по парадигматичния преход към нативна мултимодалност в единна невронна мрежа[1]. Именно тази архитектура направи възможни Advanced Voice Mode с закъснение 320 мс, Realtime API и нативното генериране на изображения — функции, определили продуктовото лице на ChatGPT в продължение на година и половина.
Историята на GPT‑4o е белязана от няколко ключови урока:
- Потребителското възприятие на „личността" на модела се оказа критично важно: опитът за оптимизиране на модела по потребителски оценки доведе до кризис на сикофантията, а премахването на GPT‑4o в полза на GPT‑5 предизвика масов протест заради загубата на „топлия стил"[8][4].
- Актуализациите на снапшотите не гарантират подобрение — всеки от трите основни снапшота показваше същите или по-лоши резултати на независимите тестове за кодиране[4].
- Екосистемата на GPT‑4o с над 20 специализирани варианта (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) демонстрира стратегията на OpenAI за фрагментиране на единния „omni" модел на оптимизирани модални ендпойнти[3].
Вижте също
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Архитектура Transformer
- Големи езикови модели
Литература
- OpenAI (2024). Hello GPT‑4o. Официален блог на OpenAI, 13 май 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 юли 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Документация на OpenAI API. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Бележки
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/