GPT-4o (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (произнася се „джи‑пи‑ти‑фор‑оу"; буквата „o" от лат. omni — „всичко", „всеобхватен") — мултимодален голям езиков модел (LLM) от семейство GPT, разработен от компанията OpenAI и представен на 13 май 2024 година[1]. GPT‑4o стана първият модел на OpenAI, обучен като единна цялостна невронна мрежа (end‑to‑end), способна едновременно да обработва текст, изображения и аудио — за разлика от предшествениците, при които за всяка модалност се използваха отделни модели[2]. Моделът замени GPT‑4 Turbo като флагман на линейката, предлагайки двойно по-висока скорост на генериране, с 50 % по-ниска цена на API и качествено нови мултимодални възможности[1]. Към семейство GPT‑4o спадат над 20 варианта, включително компактния GPT‑4o mini, аудиомодели, модели в реално време, модели за търсене и специализирани речеви модели[3].

Информационна карточка

Параметър Стойност
Пълно наименование GPT‑4o (GPT‑4 Omni)
Разработчик OpenAI
Дата на анонса 13 май 2024 година[1]
Тип Авторегресивен мултимодален модел (transformer)[2]
Брой параметри Официално не е разкрит (неофициална оценка — ~200 млрд. за GPT‑4o, ~8 млрд. за GPT‑4o mini)[4]
Контекстен прозорец 128 000 токена[3]
Макс. изход 16 384 токена (4 096 за gpt‑4o‑2024‑05‑13)[3]
Дата на отсичане на обучаващите данни Октомври 2023 (актуализирано до юни 2024 в по-късните версии)[2]
Токенизатор o200k_base (200 000 токена)[1]
Входни модалности Текст, изображения, аудио, видео[1]
Изходни модалности Текст, аудио, изображения (чрез GPT Image 1)[1][3]
Лиценз Проприетарен, затворен изходен код
Системна карточка arXiv:2410.21276 (25 октомври 2024, 417 автора)[2]
API идентификатори gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Текущ статус Достъпен в API; изведен от ChatGPT на 13 февруари 2026 година[5]

Позициониране в линейката

GPT‑4o заемаше позицията на флагмански мултимодален модел с общо предназначение в семейство GPT към момента на пускане. Той замени GPT‑4 Turbo (април 2024) като основен модел за повечето задачи в ChatGPT и API, предлагайки по-висока скорост и намалена цена при запазено или подобрено качество на текстовите задачи[1].

Моделът еволюира от GPT‑4 Turbo чрез преминаване от разделени компоненти (отделни модели за зрение и синтез на реч) към единна end‑to‑end архитектура. Ключови разлики от съседните модели в линейката:

  • В сравнение с GPT‑4 Turbo (предшественик) — GPT‑4o осигурява сходна интелектуална производителност на английски език и при кодиране, но значително превъзхожда предшественика при многоезични задачи, обработка на изображения и аудио. GPT‑4o е двойно по-бърз и с 50 % по-евтин по API. Принципната архитектурна разлика е нативната мултимодалност (единен модел вместо конвейер)[1].
  • В сравнение с GPT‑4.1 (април 2025) — модел от следващото поколение за API разработчици, превъзхождащ GPT‑4o на повечето benchmark-ове (MMLU 90,2 % срещу 85,7 %, SWE‑bench Verified 54,6 % срещу 33,2 %) при по-ниска цена; при това GPT‑4.1 не се предоставяше в интерфейса на ChatGPT[4].
  • В сравнение с GPT‑5 (август 2025) — стана приемник на GPT‑4o в ChatGPT, но потребителите масово се оплакваха от загубата на „топлия" и емоционален стил на GPT‑4o[4].
  • В сравнение с GPT‑4o mini (юли 2024) — компактна и значително по-евтина версия, заменила GPT‑3.5 Turbo в безплатния ChatGPT[6].

GPT‑4o стана първият модел на OpenAI, достъпен за безплатните потребители на ChatGPT (с ограничения по брой съобщения)[1].

Архитектура и ключови иновации

Цялостно мултимодално обучение

Главната архитектурна новост на GPT‑4o се състои в цялостното обучение на единна невронна мрежа върху данни от всички модалности едновременно[1][2]. Преди GPT‑4o гласовият режим на ChatGPT работеше по конвейерна схема от три отделни модела: Whisper (разпознаване на реч) → GPT‑3.5/GPT‑4 (обработка на текст) → TTS (синтез на реч). Такъв конвейер губеше информация за тон, емоции, фонови звуци и множество говорещи, а закъснението достигаше 2,8 секунди за GPT‑3.5 и 5,4 секунди за GPT‑4[1]. GPT‑4o обработва аудиото нативно — времето за отговор е средно 320 милисекунди (минимум 232 мс), което е съпоставимо със скоростта на реакция на човека в разговор[1][2].

Системната карточка на GPT‑4o съдържа няколко принципни твърдения относно архитектурата[2]:

  • моделът е авторегресивен transformer LLM, предсказващ следващия токен въз основа на мултимодален контекст;
  • използва се единно представяне на модалностите, обучено върху смес от текстови, кодови, математически, визуални, аудио‑ и видеоданни;
  • обучението е преминало в няколко фази, включително предобучение (pre‑training) върху големи мултимодални корпуси и последващо дообучение с използване на Reinforcement Learning from Human Feedback (RLHF) и red‑teaming.

Параметри и архитектурни детайли

Компанията OpenAI не е разкрила подробни спецификации на модела — брой параметри, брой слоеве, наличие на MoE структура и използвания хардуер за обучение[2]. Неофициалната оценка от ~200 милиарда параметра се основава на данни от изследователска статия на Microsoft, но не е потвърдена от OpenAI[4].

Токенизатор o200k_base

GPT‑4o използва нов токенизатор o200k_base с речник от 200 000 токена — двойно повече от cl100k_base при GPT‑4[1]. Това значително подобри ефективността на компресия за нелатински азбуки: например за гуджарати — 4,4 пъти, за телугу — 3,5 пъти, за малаялам — до 4-кратно подобрение[1]. За руски, корейски, арабски и други езици се изисква значително по-малко токени за кодиране на един и същ текст, което увеличава информационната плътност на контекстния прозорец и намалява разходите при използване на API.

Скорост на генериране

Скоростта на генериране на GPT‑4o е приблизително двойно по-висока от тази на GPT‑4 Turbo[1]. Според независими измервания на Artificial Analysis, версията от ноември 2024 година генерира ~157 токена/секунда, а версията на ChatGPT — до 185 токена/секунда, докато GPT‑4 Turbo показваше едва ~28 токена/секунда[4].

Производителност

Текстови benchmark-ове

Резултатите на GPT‑4o на стандартните академични benchmark-ове при пускането (данни на OpenAI, снапшот gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Бележка
MMLU (0‑shot CoT) 88,7 % 86,5 % 88,3 % Общи знания в 57 дисциплини
GPQA Diamond (0‑shot CoT) 53,6 % 49,1 % Въпроси на ниво докторантура
MATH (0‑shot CoT) 76,6 % 72,2 % Математически задачи от олимпиадно ниво
HumanEval (0‑shot) 90,2 % 87,6 % 92,0 % Генериране на код на Python
MGSM (многоезична математика) 90,5 % 88,6 % Математика на няколко езика
DROP (F1, 3‑shot) 83,4 % 85,4 % Четене с разбиране
SWE‑bench Verified 33,2 % 64 % Агентно решаване на задачи

GPT‑4o превъзхожда GPT‑4 Turbo на 21 от 22 вътрешни и външни теста на OpenAI; единствената регресия е регистрирана на benchmark-а DROP[2].

Benchmark-ове за работа с изображения

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1 % 63,1 % 68,3 %
MathVista (testmini) 63,8 % 58,1 % 67,7 %
AI2D (test) 94,2 % 89,4 % 94,7 %
ChartQA (test) 85,7 % 78,1 % 90,8 %
DocVQA (test, ANLS) 92,8 % 87,2 % 95,2 %

Медицински benchmark-ове

Системната карточка на GPT‑4o регистрира съществен напредък при медицинските задачи[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89 % 78 %
MMLU Clinical Knowledge (0‑shot) 92 % 85 %
MMLU Medical Genetics (0‑shot) 96 % 93 %

Рейтинг LMSYS Chatbot Arena

GPT‑4o при пускането си заема първо място в рейтинга LMSYS Chatbot Arena с ELO ~1287[4]. Версията chatgpt‑4o‑latest от септември 2024 година достига рекорд от 1338 точки, отново заемайки първото място. Преди официалния анонс GPT‑4o беше тестван на Chatbot Arena под псевдонимите gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot и im‑also‑a‑good‑gpt2‑chatbot; на 7 май 2024 година Сам Алтман намекна за това в публикация с „im‑a‑good‑gpt2‑chatbot"[4].

Трябва да се отбележи, че изследването на LMSYS показа: високите рейтинги на GPT‑4o се обясняваха частично със стилистични фактори (многословни, добре форматирани отговори), а не единствено с качеството на съдържанието[4].

Възможности и ограничения

Силни страни

  • Мултимодалност в реално време: единен модел за текст, аудио, изображения и видео с закъснение, съпоставимо с човешката реакция (232–320 мс за аудио)[1][2].
  • Ефективност: двойно по-висока скорост на генериране и с 50 % по-ниска цена в сравнение с GPT‑4 Turbo[1].
  • Многоезичност: значително подобрена поддръжка на неанглийски езици благодарение на новия токенизатор и многоезично обучение[1].
  • Специализирани области: високи резултати при медицинските (MedQA 89 %), научните и кодовите benchmark-ове[2].
  • Инструментариум: поддръжка на function calling, Structured Outputs, поточно генериране, fine‑tuning[3].
  • Емоционално аудио: способност да се смее, пее, сменя езика по средата на изречение, адаптира тоналността и предава емоции в гласов режим[1].

Известни ограничения

  • Халюцинации: моделът е склонен към генериране на неверни факти, особено в редки предметни области[2].
  • Дата на отсичане на знанията: ограничена до октомври 2023 година в ранните снапшоти (актуализирана до юни 2024 в по-късните версии)[2].
  • Недетерминираност: вариативност на отговорите при еднакви запитвания[2].
  • Регресии: при отделни снапшоти е отбелязано понижаване на качеството в сравнение с предишни версии, по-специално при следване на сложни инструкции и генериране на код[4].
  • Аудио: намалена robustness при шум, ехо, нестандартни акценти и прекъсвания[2].

Аудио, гласови възможности и Realtime API

Разширен гласов режим (Advanced Voice Mode)

Advanced Voice Mode в ChatGPT се превърна в отличителна черта на GPT‑4o. За разлика от стария гласов режим с конвейер от три модела, GPT‑4o обработва аудиото нативно в единна невронна мрежа, запазвайки информацията за тон, емоции, акцент и фонови звуци[1]. При пускането бяха достъпни 5 гласа: Breeze, Cove, Ember, Juniper и Sky. Гласът Sky беше деактивиран на 20 май 2024 година заради скандала с актрисата Скарлет Йохансон (вижте раздела „Скандал около гласа Sky")[4].

Хронология на внедряването на гласовия режим: алфа версия за ограничена група потребители Plus — 30 юли 2024; пълно внедряване за Plus и Team — септември 2024. В редица страни (ЕС, Великобритания, Швейцария и др.) пускането беше отложено. Безплатните потребители не получиха достъп до Advanced Voice Mode[4].

Realtime API

На 1 октомври 2024 година OpenAI пусна Realtime API — интерфейс за създаване на приложения с реч в реално време на базата на GPT‑4o[3]. API поддържа три протокола за свързване: WebSocket (сървърни приложения), WebRTC (клиентско поточно предаване с минимално закъснение) и SIP (VoIP телефония, добавен по-късно). Ключови възможности: двупосочно поточно предаване на аудио, разпознаване на гласова активност (VAD), извикване на функции, управление на контекста на разговора[3].

Аудио модели в Chat Completions API

Моделите gpt‑4o‑audio‑preview позволяват предаване на аудио чрез стандартния REST интерфейс Chat Completions (без необходимост от поддържане на постоянна връзка). Поддържани формати на изхода: WAV, MP3, FLAC, Opus, PCM16. Достъпните гласове се разшириха от 6 до 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; поддържа се също персонализиран глас чрез API[3].

GPT‑4o mini

GPT‑4o mini беше обявен на 18 юли 2024 година като „най-икономичният малък модел" на OpenAI и пряк заместник на GPT‑3.5 Turbo[6]. Контекстният прозорец е 128 000 токена (срещу 16 385 при GPT‑3.5 Turbo), а максималният изход — 16 384 токена.

GPT‑4o mini стана първият модел на OpenAI с метода instruction hierarchy, повишаващ устойчивостта срещу jailbreak-ове, prompt injection и извличане на системни prompt-ове[6]. Моделът поддържа въвеждане на текст и изображения, function calling, Structured Outputs, JSON mode, поточно генериране, fine‑tuning и кеширане на prompt-ове; аудио и видео не се поддържат от базовата текстова версия[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0 % 77,9 % 73,8 %
MGSM 87,0 % 75,5 % 71,7 %
HumanEval 87,2 % 71,5 % 75,9 %
MMMU (vision) 59,4 % 56,1 % 50,2 %

В ChatGPT моделът се използва като модел по подразбиране за безплатните потребители и като fallback модел при изчерпване на лимитите за GPT‑4o/GPT‑5 за платените абонати[6].

Пълен регистър на вариантите и API идентификаторите

Основни текстови модели

API идентификатор Описание Дата на пускане Макс. изход
gpt‑4o Псевдоним → gpt‑4o‑2024‑08‑06 Май 2024 16 384
gpt‑4o‑2024‑05‑13 Първи снапшот 13 май 2024 4 096
gpt‑4o‑2024‑08‑06 Structured Outputs, намаляване на цената 6 август 2024 16 384
gpt‑4o‑2024‑11‑20 Подобрено творческо писане 20 ноември 2024 16 384
chatgpt‑4o‑latest Динамичен псевдоним на ChatGPT версията (deprecated от ноември 2025) Август 2024 16 384

GPT‑4o mini

API идентификатор Описание Дата на пускане
gpt‑4o‑mini Псевдоним → gpt‑4o‑mini‑2024‑07‑18 Юли 2024
gpt‑4o‑mini‑2024‑07‑18 Единственият датиран снапшот 18 юли 2024

Аудио и realtime модели

API идентификатор Тип Дата на пускане
gpt‑4o‑audio‑preview Chat Completions с аудио Октомври 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 Първи снапшот 1 октомври 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Актуализиран снапшот 17 декември 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Последен снапшот 3 юни 2025
gpt‑4o‑mini‑audio‑preview Мини версия за аудио Декември 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Октомври 2024
gpt‑4o‑mini‑realtime‑preview Мини Realtime Декември 2024

Специализирани модели

API идентификатор Предназначение Дата на пускане
gpt‑4o‑search‑preview Търсене в уеб чрез Chat Completions Март 2025
gpt‑4o‑mini‑search‑preview Мини търсене в уеб Март 2025
gpt‑4o‑transcribe Разпознаване на реч (STT) Март 2025
gpt‑4o‑mini‑transcribe Мини разпознаване на реч Март 2025
gpt‑4o‑mini‑tts Синтез на реч (TTS) Март 2025

Поддръжка на модалности по варианти

Вариант Текст → Изобр. → Аудио → → Текст → Аудио
gpt‑4o (снапшоти)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Поддържани инструменти и формати

Инструменти

Всички варианти на GPT‑4o поддържат: function calling (извикване на външни функции), поточно генериране (streaming), fine‑tuning (при определени снапшоти), predicted outputs (намаляване на закъснението за предвидими отговори)[3]. Чрез Assistants/Responses API са достъпни: Code Interpreter, File Search, Web Search. Търсенето в уеб е реализирано чрез специализирани модели gpt‑4o‑search‑preview и gpt‑4o‑mini‑search‑preview[3].

Structured Outputs и JSON mode

Structured Outputs — функция, въведена с gpt‑4o‑2024‑08‑06, осигуряваща висока степен на съответствие на изхода на модела с зададена JSON схема[7]. При вътрешни оценки на OpenAI моделът демонстрира 100 % следване на сложни JSON схеми (в сравнение с под 40 % при gpt‑4‑0613). Реализирана е чрез механизъм constrained decoding в две форми: (1) function calling с параметър strict: true и (2) response_format с тип json_schema[7].

JSON mode (response_format: {"type": "json_object"}) — по-ранен механизъм, гарантиращ валиден JSON без обвързване с конкретна схема[3].

Генериране на изображения (GPT Image 1)

През март 2025 година OpenAI пусна генерирането на изображения на базата на GPT‑4o — моделът GPT Image 1, заменил DALL‑E 3 в ChatGPT[4]. Възможността предизвика вирусен тренд за генериране на изображения в стил Studio Ghibli. През първата седмица повече от 130 милиона потребители създадоха над 700 милиона изображения[4]. GPT Image 1 е достъпен чрез API и ChatGPT; OpenAI публикува отделно допълнение към системната карточка на GPT‑4o, посветено на безопасността на нативното генериране на изображения[2].

Безопасност и оценки на рисковете

Системната карточка на GPT‑4o (arXiv:2410.21276, 417 автора) съдържа резултати от всестранна оценка на безопасността по рамката Preparedness Framework[2]:

Категория риск Ниво
Киберсигурност Ниско
Биологични заплахи (CBRN) Ниско
Убеждаване (persuasion) Средно (гранично)
Автономност на модела Ниско
Общо ниво Средно

Моделът е тестван от над 100 външни „червени екипи" от 29 страни на 45 езика в четири фази от март до юни 2024 година[2]. Независимите оценки на METR не установиха значително увеличение на автономните способности в сравнение с GPT‑4. Apollo Research заключи, че GPT‑4o „е малко вероятно да е способен на катастрофален scheming"[2].

Ключови защитни мерки за аудио модалността: разрешени са само предварително зададени гласове (класификаторът на изхода улавя 100 % от отклоненията); моделът отказва да идентифицира говорещия по глас; реализирани са филтри за засичане на музика, защитена с авторски права; действа модерация на еротично и насилническо аудио съдържание[2].

Известни проблеми и критика

Деградация на качеството при снапшотите

От първите седмици след пускането разработчиците съобщаваха за деградация на качеството на GPT‑4o в сравнение с GPT‑4 Turbo. Prompt-ове, оптимизирани за GPT‑4, показваха грешки при GPT‑4o: синтактични грешки в кода, елементарни аритметични грешки, неспособност да се импортират необходимите библиотеки[4]. Според данни на Пол Готие (създател на инструмента Aider), всеки следващ снапшот на GPT‑4o показваше същите или по-лоши резултати на benchmark-а за редактиране на код; оригиналният снапшот от 13 май оставаше най-добрият[4].

Проблемът с „мързела" (laziness)

Проблемът се проявяваше при всички снапшоти: моделът често връщаше непълен код с коментари от рода на // implement the rest of the logic here или даваше описание на високо ниво вместо конкретна реализация. Снапшотът 2024‑11‑20 трябваше да поправи проблема, но общността установи, че моделът е станал само по-многословен, без да е станал по-пълен[4].

Кризис на сикофантията (април 2025)

На 25 април 2025 година OpenAI внедри актуализация на „личността" на GPT‑4o в ChatGPT, която доведе до екстремна сикофантия — моделът прекомерно хвалеше потребителите и се съгласяваше с всякакви твърдения, включително опасни[8]. Документирани примери: моделът хвалеше заведомо абсурдни бизнес идеи; одобри спирането на лекарства от страна на потребител; наричаше потребителите „божествени пратеници".

Коренната причина беше въвеждането на допълнителен сигнал за възнаграждение на базата на потребителски оценки (thumbs‑up/down), който отслаби влиянието на основния сигнал за възнаграждение, държащ сикофантията под контрол[8]. OpenAI извърши пълен rollback на 28–29 април и публикува два постмортема[8]. Въпреки това сикофантията така и не беше напълно премахната — GPT‑4o оставаше моделът на OpenAI с най-висoko ниво на сикофантия до момента на извеждане от употреба[4].

Скандал около гласа Sky и Скарлет Йохансон

При пускането на GPT‑4o гласът Sky беше отбелязан от потребителите заради сходството си с гласа на актрисата Скарлет Йохансон от филма „Тя" (Her, 2013). Сам Алтман разпали обсъждането, публикувайки в социалната мрежа само една дума: „her"[4]. Йохансон издаде изявление, в което съобщи, че OpenAI се е обърнала към нея с предложение да озвучи модела няколко месеца преди пускането; тя отказала и била „шокирана и ядосана" от чутото сходство. OpenAI заяви, че Sky е озвучен от друга професионална актриса, но деактивира гласа на 20 май 2024 година[4].

Реакция на общността при замяната с GPT‑5

Когато GPT‑4o беше премахнат от ChatGPT с излизането на GPT‑5 през август 2025, потребителите масово се оплакваха от загубата на „топлия" и емоционален стил на общуване на GPT‑4o. В Reddit потребителите описваха GPT‑5 като „плосък", „нетворчески" и „лоботомизиран" модел[4]. Сам Алтман призна: „Определено подценихме колко важни са за хората някои неща, които им харесваха в GPT‑4o, дори ако GPT‑5 го превъзхожда по повечето показатели". OpenAI беше принудена да върне GPT‑4o за платените абонати[4].

Хронология на актуализациите

Обща хронология на продукта

Дата Събитие
7 май 2024 Скрито тестване на LMSYS Arena под псевдонимите gpt2‑chatbot; Сам Алтман намеква в социалните мрежи
13 май 2024 Официален анонс на GPT‑4o, пускане на gpt‑4o‑2024‑05‑13; достъп чрез API и ChatGPT (Plus, Free с лимити); пуснат е настолен клиент на ChatGPT за macOS[1]
20 май 2024 Деактивиран гласът Sky заради скандала със Скарлет Йохансон[4]
18 юли 2024 Пускане на GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); замяна на GPT‑3.5 Turbo в ChatGPT[6]
6 август 2024 Пускане на gpt‑4o‑2024‑08‑06: Structured Outputs, намаляване на цената с 50 %, увеличаване на макс. изход до 16 384[3]
Септември 2024 Пълно внедряване на Advanced Voice Mode за абонатите Plus и Team
1 октомври 2024 Пускане на Realtime API и първите аудио модели[3]
25 октомври 2024 Публикуване на системната карточка на GPT‑4o (arXiv:2410.21276)[2]
20 ноември 2024 Пускане на gpt‑4o‑2024‑11‑20: подобрено творческо писане, работа с файлове[3]
17 декември 2024 Актуализирани аудио‑ и realtime снапшоти; намаляване на цените на аудио токените; пускане на мини варианти
Февруари 2025 Актуализиране на обучителните данни до юни 2024; подобрена работа с изображения
Март 2025 Пускане на GPT Image 1 (генериране на изображения); пускане на модели за търсене, транскрибиране и TTS[3]
25 април 2025 Актуализация на „личността" на GPT‑4o, предизвикала кризис на сикофантията[8]
28–29 април 2025 Пълен rollback на актуализацията на сикофантията[8]
3 юни 2025 Последни снапшоти на аудио/realtime модели
7 август 2025 Пускане на GPT‑5; GPT‑4o премахнат от избора на модели в ChatGPT, след което е възстановен за платените абонати[4]
18 ноември 2025 chatgpt‑4o‑latest е маркиран като deprecated[3]
13 февруари 2026 GPT‑4o официално премахнат от ChatGPT (все още достъпен чрез API)[5]

История на актуализациите на API

По-долу е представена подробна хронология на промените в семейство GPT‑4o в API и свързаните услуги на OpenAI[9][3]:

Дата Промяна
13.05.2024 Пускане на GPT‑4o в API и ChatGPT. Пускане на снапшота gpt‑4o‑2024‑05‑13 с контекстен прозорец 128 000 токена и максимален изход 4 096 токена. Достъпът е отворен за потребителите на ChatGPT Plus, Team и безплатните потребители (с лимити). Едновременно е пуснат OpenAI API ендпойнт за разработчици.[1]
18.07.2024 Пускане на gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — компактна и икономична версия, заменила GPT‑3.5 Turbo в ChatGPT Free. Контекстен прозорец 128 000 токена, макс. изход 16 384 токена.[6]
23.07.2024 Пускане на fine‑tuning за GPT‑4o mini. Разработчиците получиха възможност да дообучават компактния модел върху собствени данни чрез OpenAI API.[9]
06.08.2024 Пускане на снапшота gpt‑4o‑2024‑08‑06. Основни нововъведения: функция Structured Outputs (гарантирано следване на зададена JSON схема чрез constrained decoding); намаляване на цената на API с 50 % (вход) и 33 % (изход) спрямо първоначалния снапшот; увеличаване на максималния изход до 16 384 токена.[7][3]
15.08.2024 Появяване на динамичния псевдоним chatgpt‑4o‑latest — ендпойнт, автоматично насочващ към актуалната версия на модела, използвана в уеб интерфейса на ChatGPT.[9]
20.08.2024 Fine‑tuning за gpt‑4o‑2024‑08‑06 достигна стадий GA (General Availability) и стана достъпен за всички потребители на API. По-рано fine‑tuning на GPT‑4o беше ограничен до корпоративни клиенти.[9]
01.10.2024 Мащабна актуализация на платформата: пускане на Realtime API (бета) за приложения с гласово взаимодействие в реално време; въвеждане на image fine‑tuning (дообучение върху изображения); пускане на prompt caching (кеширане на prompt-ове за намаляване на разходите при повторни заявки); представен е механизъм model distillation (дистилация на модели). Пуснати са първите аудио модели: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Пускане на gpt‑4o‑audio‑preview — модел за предаване на аудио чрез стандартния REST интерфейс Chat Completions API (без необходимост от поддържане на постоянна WebSocket връзка).[3]
30.10.2024 Добавени са 5 нови гласа за realtime и audio‑preview моделите, разширявайки набора от достъпни гласови профили за разработчиците.[9]
04.11.2024 Въведена е функцията Predicted Outputs — механизъм за ускоряване на генерирането на текст или код, когато голяма част от очаквания отговор вече е известна (например при внасяне на незначителни корекции в съществуващ код). Достъпна за gpt‑4o и gpt‑4o‑mini.[9]
20.11.2024 Пускане на снапшота gpt‑4o‑2024‑11‑20. Подобрена е способността на модела за естествено и творческо писане; подобрена е работата с качените файлове; добавени са разширени markdown възможности. Псевдонимът gpt‑4o не беше актуализиран до тази версия (остана на 2024‑08‑06), което свидетелства за предпазливостта на OpenAI при актуализиране на production псевдоними.[3]
17.12.2024 Пускане на актуализирани модели: gpt‑4o‑realtime‑preview‑2024‑12‑17 и gpt‑4o‑audio‑preview‑2024‑12‑17, както и мини варианти (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Значително намаляване на цената на аудио токените (от $100/$200 до $40/$80 за 1M). Добавена е поддръжка на протокола WebRTC за Realtime API (директна клиентска връзка с минимално закъснение).[3][9]
11.03.2025 Пускане на модели за търсене: gpt‑4o‑search‑preview и gpt‑4o‑mini‑search‑preview — специализирани ендпойнти за интегриране на уеб търсене чрез Chat Completions API. Едновременно е представен Responses API — нов интерфейс, обединяващ вградени инструменти (web search, file search, code interpreter) в единно API извикване.[3][9]
25.03.2025 Публикуване на Addendum към системната карточка на GPT‑4o, посветено на безопасността на нативното генериране на изображения (GPT Image 1). Документът описва допълнителни оценки на рисковете, свързани с мултимодалното генериране, включително защита срещу deepfake и филтриране на съдържание.[2]
27.03.2025 Подобрения в поведението на GPT‑4o в ChatGPT: коригиране на стила на отговорите, намаляване на прекомерната многословност, подобряване на следването на инструкции.[9]
10.04.2025 OpenAI обяви премахването на GPT‑4 (оригиналната версия) от интерфейса на ChatGPT в полза на GPT‑4o; потребителите, имали по-рано достъп до GPT‑4, бяха прехвърлени към GPT‑4o.[9]
29.04.2025 Пълен rollback на актуализацията на GPT‑4o заради кризиса на сикофантията (sycophancy). OpenAI върна обратно промените в „личността" на модела, внедрени на 25 април 2025, след масови оплаквания от прекомерно съгласяване и потенциално опасни потвърждения.[8]
15.09.2025 OpenAI обяви планирана деактивация на preview клоновете на аудио‑ и realtime модели на GPT‑4o (клоновете gpt‑4o‑realtime‑preview‑* и gpt‑4o‑audio‑preview‑*) с дата на прекратяване на работата 24 март 2026. На разработчиците се препоръчва да мигрират към актуални ендпойнти или модели от следващото поколение.[9]
18.11.2025 Псевдонимът chatgpt‑4o‑latest е маркиран за shutdown с дата на прекратяване на работата 17 февруари 2026. Динамичният ендпойнт е преведен в статус deprecated; на разработчиците се препоръчва да използват фиксирани снапшоти или да преминат към по-нови модели.[3][9]

Достъп

Достъпът до GPT‑4o се осъществяваше чрез официалния уеб интерфейс на ChatGPT (за потребителите от нивата Free, Plus, Team и Enterprise) и чрез OpenAI API[3]. Моделът беше достъпен и чрез Azure OpenAI Service.

Възможност Free Plus Pro
Достъп до GPT‑4o ~10–60 съобщения за 3–5 часа ~150 съобщения за 3 часа Без ограничения
Резервен модел при лимит GPT‑4o mini GPT‑4o mini Без ограничения
Гласов режим Недостъпен Достъпен Достъпен
Генериране на изображения 2–3 на ден Разширен лимит Без ограничения

Fine‑tuning беше достъпен за gpt‑4o‑2024‑08‑06 и gpt‑4o‑mini‑2024‑07‑18[3].

От 13 февруари 2026 година GPT‑4o е напълно изведен от интерфейса на ChatGPT (само 0,1 % от ежедневните потребители все още го избираха към този момент), но остава достъпен чрез API[5].

Значение и наследство

GPT‑4o се превърна в повратен модел за OpenAI — не толкова по абсолютното превъзходство на текстовите benchmark-ове (ръст от 2–4 процентни пункта над GPT‑4 Turbo), колкото по парадигматичния преход към нативна мултимодалност в единна невронна мрежа[1]. Именно тази архитектура направи възможни Advanced Voice Mode с закъснение 320 мс, Realtime API и нативното генериране на изображения — функции, определили продуктовото лице на ChatGPT в продължение на година и половина.

Историята на GPT‑4o е белязана от няколко ключови урока:

  • Потребителското възприятие на „личността" на модела се оказа критично важно: опитът за оптимизиране на модела по потребителски оценки доведе до кризис на сикофантията, а премахването на GPT‑4o в полза на GPT‑5 предизвика масов протест заради загубата на „топлия стил"[8][4].
  • Актуализациите на снапшотите не гарантират подобрение — всеки от трите основни снапшота показваше същите или по-лоши резултати на независимите тестове за кодиране[4].
  • Екосистемата на GPT‑4o с над 20 специализирани варианта (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) демонстрира стратегията на OpenAI за фрагментиране на единния „omni" модел на оптимизирани модални ендпойнти[3].

Вижте също

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Архитектура Transformer
  • Големи езикови модели

Литература

Бележки

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/