GPT-4o (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (vyslovuje se „dží‑pí‑tí‑fór‑ou"; písmeno „o" z lat. omni — „vše", „všezahrnující") — multimodální velký jazykový model (LLM) rodiny GPT, vyvinutý společností OpenAI a představený 13. května 2024[1]. GPT‑4o se stala prvním modelem OpenAI natrénovaným jako jednotná end‑to‑end neuronová síť, schopná současně zpracovávat text, obrázky a audio — na rozdíl od předchůdců, kde pro každou modalitu byly použity samostatné modely[2]. Model nahradil GPT‑4 Turbo jako vlajkový produkt řady, nabídl dvojnásobně vyšší rychlost generování, o 50 % nižší náklady na API a kvalitativně nové multimodální možnosti[1]. Do rodiny GPT‑4o patří více než 20 variant, včetně kompaktního GPT‑4o mini, audimodelů, modelů v reálném čase, modelů vyhledávání a specializovaných hlasových modelů[3].

Informační karta

Parametr Hodnota
Celý název GPT‑4o (GPT‑4 Omni)
Vývojář OpenAI
Datum oznámení 13. května 2024[1]
Typ Autoregresivní multimodální model (transformer)[2]
Počet parametrů Oficiálně nezveřejněn (neoficiální odhad — ~200 mld. pro GPT‑4o, ~8 mld. pro GPT‑4o mini)[4]
Kontextové okno 128 000 tokenů[3]
Max. výstup 16 384 tokenů (4 096 pro gpt‑4o‑2024‑05‑13)[3]
Datum uzávěrky trénovacích dat Říjen 2023 (aktualizováno na červen 2024 v pozdějších verzích)[2]
Tokenizátor o200k_base (200 000 tokenů)[1]
Modality vstupu Text, obrázky, audio, video[1]
Modality výstupu Text, audio, obrázky (přes GPT Image 1)[1][3]
Licence Proprietární, uzavřený zdrojový kód
Systémová karta arXiv:2410.21276 (25. října 2024, 417 autorů)[2]
Identifikátory API gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Aktuální stav Dostupná přes API; stažena z ChatGPT 13. února 2026[5]

Pozice v produktové řadě

GPT‑4o zaujímala pozici vlajkového multimodálního modelu pro všeobecné použití v rodině GPT v době vydání. Nahradila GPT‑4 Turbo (duben 2024) jako hlavní model pro většinu úloh v ChatGPT a API, nabízí vyšší rychlost a nižší náklady při zachování nebo zlepšení kvality na textových úlohách[1].

Model se vyvinul z GPT‑4 Turbo přechodem od oddělených komponent (samostatné modely pro zrak a syntézu řeči) k jednotné end‑to‑end architektuře. Klíčové rozdíly oproti sousedním modelům řady:

  • Ve srovnání s GPT‑4 Turbo (předchůdce) — GPT‑4o poskytuje srovnatelný intelektuální výkon v angličtině a kódování, ale výrazně překonává předchůdce v multijazyčných úlohách, zpracování obrázků a audia. GPT‑4o je dvojnásobně rychlejší a o 50 % levnější přes API. Zásadní architektonický rozdíl — nativní multimodalita (jeden model místo pipeline)[1].
  • Ve srovnání s GPT‑4.1 (duben 2025) — model nové generace pro API vývojáře, překonávající GPT‑4o na většině benchmarků (MMLU 90,2 % oproti 85,7 %, SWE‑bench Verified 54,6 % oproti 33,2 %) při nižších nákladech; přičemž GPT‑4.1 nebyl dostupný v rozhraní ChatGPT[4].
  • Ve srovnání s GPT‑5 (srpen 2025) — stal se nástupcem GPT‑4o v ChatGPT, avšak uživatelé masově si stěžovali na ztrátu „vřelého" a emocionálního stylu GPT‑4o[4].
  • Ve srovnání s GPT‑4o mini (červenec 2024) — kompaktní a výrazně levnější verze, která nahradila GPT‑3.5 Turbo v bezplatném ChatGPT[6].

GPT‑4o se stala prvním modelem OpenAI dostupným bezplatným uživatelům ChatGPT (s omezeným počtem zpráv)[1].

Architektura a klíčové inovace

Sквозное мультимодальное обучение - End‑to‑end multimodální trénink

Hlavní architektonická novinka GPT‑4o spočívá v end‑to‑end tréninku jediné neuronové sítě na datech všech modalit současně[1][2]. Před GPT‑4o fungoval hlasový režim ChatGPT prostřednictvím pipeline ze tří samostatných modelů: Whisper (rozpoznávání řeči) → GPT‑3.5/GPT‑4 (zpracování textu) → TTS (syntéza řeči). Taková pipeline ztrácela informace o tónu, emocích, zvucích na pozadí a více mluvčích, přičemž zpoždění dosahovalo 2,8 sekundy u GPT‑3.5 a 5,4 sekundy u GPT‑4[1]. GPT‑4o zpracovává audio nativně — průměrná doba odezvy je 320 milisekund (minimum 232 ms), což je srovnatelné s rychlostí lidské reakce v rozhovoru[1][2].

Systémová karta GPT‑4o obsahuje několik zásadních tvrzení o architektuře[2]:

  • model je autoregresivní transformerový LLM, předpovídající následující token z multimodálního kontextu;
  • používá se jednotná reprezentace modalit, natrénovaná na směsi textových, kódových, matematických, vizuálních, audio‑ a videodát;
  • trénink probíhal v několika fázích, včetně předtréninku (pre‑training) na velkých multimodálních korpusech a následného dotrénování s využitím Reinforcement Learning from Human Feedback (RLHF) a red‑teamingu.

Parametry a architektonické detaily

Společnost OpenAI nezveřejnila podrobné specifikace modelu — počet parametrů, počet vrstev, přítomnost MoE‑struktury a použitý hardware pro trénink[2]. Neoficiální odhad ~200 miliard parametrů vychází z údajů výzkumného článku Microsoftu, ale OpenAI ho nepotvrdila[4].

Tokenizátor o200k_base

GPT‑4o používá nový tokenizátor o200k_base se slovníkem 200 000 tokenů — dvojnásobek oproti cl100k_base u GPT‑4[1]. To výrazně zlepšilo efektivitu komprese pro nelatinskými písmy psané jazyky: například pro gudžarátštinu — 4,4krát, pro telugu — 3,5krát, pro malajálamštinu — až 4násobné zlepšení[1]. Pro ruštinu, korejštinu, arabštinu a další jazyky je k zakódování stejného textu potřeba výrazně méně tokenů, což zvyšuje informační hustotu kontextového okna a snižuje náklady při používání API.

Rychlost generování

Rychlost generování GPT‑4o je přibližně dvojnásobná oproti GPT‑4 Turbo[1]. Podle nezávislých měření Artificial Analysis verze z listopadu 2024 produkuje ~157 tokenů/sekundu, a verze ChatGPT — až 185 tokenů/sekundu, zatímco GPT‑4 Turbo dosahovala pouze ~28 tokenů/sekundu[4].

Výkonnost

Textové benchmarky

Výsledky GPT‑4o na standardních akademických benchmarcích při vydání (data OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Poznámka
MMLU (0‑shot CoT) 88,7 % 86,5 % 88,3 % Obecné znalosti v 57 disciplínách
GPQA Diamond (0‑shot CoT) 53,6 % 49,1 % Otázky na úrovni doktorského studia
MATH (0‑shot CoT) 76,6 % 72,2 % Matematické úlohy olympiádní úrovně
HumanEval (0‑shot) 90,2 % 87,6 % 92,0 % Generování kódu v Pythonu
MGSM (multijazyčná matematika) 90,5 % 88,6 % Matematika ve více jazycích
DROP (F1, 3‑shot) 83,4 % 85,4 % Čtení s porozuměním
SWE‑bench Verified 33,2 % 64 % Agentní řešení úloh

GPT‑4o překonala GPT‑4 Turbo ve 21 z 22 interních a externích testů OpenAI; jediná regrese byla zaznamenána na benchmarku DROP[2].

Benchmarky pro práci s obrázky

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1 % 63,1 % 68,3 %
MathVista (testmini) 63,8 % 58,1 % 67,7 %
AI2D (test) 94,2 % 89,4 % 94,7 %
ChartQA (test) 85,7 % 78,1 % 90,8 %
DocVQA (test, ANLS) 92,8 % 87,2 % 95,2 %

Medicínské benchmarky

Systémová karta GPT‑4o zaznamenala výrazný nárůst ve zdravotnických úlohách[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89 % 78 %
MMLU Clinical Knowledge (0‑shot) 92 % 85 %
MMLU Medical Genetics (0‑shot) 96 % 93 %

Žebříček LMSYS Chatbot Arena

GPT‑4o při spuštění obsadila první místo v žebříčku LMSYS Chatbot Arena s ELO ~1287[4]. Verze chatgpt‑4o‑latest ze září 2024 dosáhla rekordu 1338 bodů a znovu obsadila první příčku. Před oficiálním oznámením byla GPT‑4o testována na Chatbot Arena pod pseudonymy gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot a im‑also‑a‑good‑gpt2‑chatbot; 7. května 2024 Sam Altman na to nepřímo poukázal příspěvkem „im‑a‑good‑gpt2‑chatbot"[4].

Je třeba poznamenat, že výzkum LMSYS ukázal: vysoké hodnocení GPT‑4o bylo částečně vysvětleno stylistickými faktory (obsáhlé, dobře formátované odpovědi), a nikoli výlučně kvalitou obsahu[4].

Možnosti a omezení

Silné stránky

  • Multimodalita v reálném čase: jediný model pro text, audio, obrázky a video se zpožděním srovnatelným s lidskou reakcí (232–320 ms pro audio)[1][2].
  • Efektivita: dvojnásobně vyšší rychlost generování a o 50 % nižší náklady oproti GPT‑4 Turbo[1].
  • Multijazyčnost: výrazně zlepšená podpora neanglických jazyků díky novému tokenizátoru a multijazyčnému tréninku[1].
  • Specializované oblasti: vysoké výsledky v medicínských (MedQA 89 %), vědeckých a kódovacích benchmarcích[2].
  • Nástroje: podpora function calling, Structured Outputs, streamování generování, fine‑tuningu[3].
  • Emocionální audio: schopnost smát se, zpívat, přepínat jazyky uprostřed věty, přizpůsobovat tón a vyjadřovat emoce v hlasovém režimu[1].

Známá omezení

  • Halucinace: model je náchylný ke generování nesprávných faktů, zejména v méně obvyklých předmětových oblastech[2].
  • Datum uzávěrky znalostí: omezena na říjen 2023 v raných snapshotech (aktualizováno na červen 2024 v pozdějších verzích)[2].
  • Nedeterminismus: variabilita odpovědí při stejných dotazech[2].
  • Regrese: v některých snapshotech bylo zaznamenáno snížení kvality oproti předchozím verzím, zejména při dodržování složitých instrukcí a generování kódu[4].
  • Audio: snížená robustnost při hluku, ozvěně, nestandardních akcentech a přerušeních[2].

Audio, hlasové možnosti a Realtime API

Rozšířený hlasový režim (Advanced Voice Mode)

Advanced Voice Mode v ChatGPT se stal vizitkou GPT‑4o. Na rozdíl od starého hlasového režimu s pipeline ze tří modelů zpracovává GPT‑4o audio nativně v jediné neuronové síti, zachovávající informace o tónu, emocích, přízvuku a zvucích na pozadí[1]. Při spuštění bylo dostupných 5 hlasů: Breeze, Cove, Ember, Juniper a Sky. Hlas Sky byl deaktivován 20. května 2024 kvůli skandálu s herečkou Scarlett Johanssonovou (podrobnosti — v části „Skandál kolem hlasu Sky")[4].

Chronologie nasazení hlasového režimu: alfa verze pro omezenou skupinu uživatelů Plus — 30. července 2024; úplné nasazení pro Plus a Team — září 2024. V některých zemích (EU, Velká Británie, Švýcarsko aj.) bylo spuštění odloženo. Bezplatní uživatelé nezískali přístup k Advanced Voice Mode[4].

Realtime API

1. října 2024 OpenAI spustila Realtime API — rozhraní pro vytváření aplikací s hlasovou interakcí v reálném čase na bázi GPT‑4o[3]. API podporuje tři protokoly připojení: WebSocket (serverové aplikace), WebRTC (klientský streaming s minimálním zpožděním) a SIP (VoIP telefonie, přidán později). Klíčové možnosti: obousměrný streaming audia, detekce hlasové aktivity (VAD), volání funkcí, správa kontextu konverzace[3].

Audio modely v Chat Completions API

Modely gpt‑4o‑audio‑preview umožňují přenášet audio přes standardní REST rozhraní Chat Completions (bez nutnosti udržovat stálé připojení). Podporované výstupní formáty: WAV, MP3, FLAC, Opus, PCM16. Dostupné hlasy se rozšířily ze 6 na 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; je podporován také konfigurovatelný hlas přes API[3].

GPT‑4o mini

GPT‑4o mini byl oznámen 18. července 2024 jako „nejekonomičtější malý model" OpenAI a přímá náhrada GPT‑3.5 Turbo[6]. Kontextové okno činí 128 000 tokenů (oproti 16 385 u GPT‑3.5 Turbo) a maximální výstup — 16 384 tokenů.

GPT‑4o mini se stal prvním modelem OpenAI s metodou instruction hierarchy, zvyšující odolnost vůči jailbreakům, injekcím promptů a extrakci systémových promptů[6]. Model podporuje vstup textu a obrázků, function calling, Structured Outputs, JSON mode, streamování generování, fine‑tuning a kešování promptů; audio a video nejsou základní textovou verzí podporovány[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0 % 77,9 % 73,8 %
MGSM 87,0 % 75,5 % 71,7 %
HumanEval 87,2 % 71,5 % 75,9 %
MMMU (vision) 59,4 % 56,1 % 50,2 %

V ChatGPT model funguje jako výchozí model pro bezplatné uživatele a jako záložní model při vyčerpání limitů na GPT‑4o/GPT‑5 u placených předplatitelů[6].

Úplný registr variant a API identifikátorů

Hlavní textové modely

API identifikátor Popis Datum vydání Max. výstup
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 Květen 2024 16 384
gpt‑4o‑2024‑05‑13 První snapshot 13. května 2024 4 096
gpt‑4o‑2024‑08‑06 Structured Outputs, snížení ceny 6. srpna 2024 16 384
gpt‑4o‑2024‑11‑20 Vylepšené kreativní psaní 20. listopadu 2024 16 384
chatgpt‑4o‑latest Dynamický alias verze ChatGPT (deprecated od listopadu 2025) Srpen 2024 16 384

GPT‑4o mini

API identifikátor Popis Datum vydání
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 Červenec 2024
gpt‑4o‑mini‑2024‑07‑18 Jediný datovaný snapshot 18. července 2024

Audio a realtime modely

API identifikátor Typ Datum vydání
gpt‑4o‑audio‑preview Chat Completions s audiem Říjen 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 První snapshot 1. října 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Aktualizovaný snapshot 17. prosince 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Poslední snapshot 3. června 2025
gpt‑4o‑mini‑audio‑preview Mini verze audia Prosinec 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Říjen 2024
gpt‑4o‑mini‑realtime‑preview Mini Realtime Prosinec 2024

Specializované modely

API identifikátor Účel Datum vydání
gpt‑4o‑search‑preview Vyhledávání na webu přes Chat Completions Březen 2025
gpt‑4o‑mini‑search‑preview Mini vyhledávání na webu Březen 2025
gpt‑4o‑transcribe Rozpoznávání řeči (STT) Březen 2025
gpt‑4o‑mini‑transcribe Mini rozpoznávání řeči Březen 2025
gpt‑4o‑mini‑tts Syntéza řeči (TTS) Březen 2025

Podpora modalit podle variant

Varianta Text → Obr. → Audio → → Text → Audio
gpt‑4o (snapshoty)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Podporované nástroje a formáty

Nástroje

Všechny varianty GPT‑4o podporují: function calling (volání externích funkcí), streamování generování (streaming), fine‑tuning (u určitých snapshotů), predicted outputs (snížení zpoždění pro předvídatelné odpovědi)[3]. Přes Assistants/Responses API jsou dostupné: Code Interpreter, File Search, Web Search. Vyhledávání na webu je realizováno přes specializované modely gpt‑4o‑search‑preview a gpt‑4o‑mini‑search‑preview[3].

Structured Outputs a JSON mode

Structured Outputs — funkce zavedená s gpt‑4o‑2024‑08‑06, zajišťující vysokou míru souladu výstupu modelu se zadaným JSON schématem[7]. Při interních hodnoceních OpenAI model prokázal 100% dodržování složitých JSON schémat (oproti méně než 40 % u gpt‑4‑0613). Realizována prostřednictvím mechanismu constrained decoding ve dvou formách: (1) function calling s parametrem strict: true a (2) response_format s typem json_schema[7].

JSON mode (response_format: {"type": "json_object"}) — starší mechanismus zaručující platný JSON bez vazby na konkrétní schéma[3].

Generování obrázků (GPT Image 1)

V březnu 2025 OpenAI spustila generování obrázků na bázi GPT‑4o — model GPT Image 1, který nahradil DALL‑E 3 v ChatGPT[4]. Tato možnost způsobila virální trend generování obrázků ve stylu Studio Ghibli. Během prvního týdne více než 130 milionů uživatelů vytvořilo přes 700 milionů obrázků[4]. GPT Image 1 je dostupný přes API a ChatGPT; OpenAI vydala samostatný dodatek k systémové kartě GPT‑4o věnovaný bezpečnosti nativního generování obrázků[2].

Bezpečnost a hodnocení rizik

Systémová karta GPT‑4o (arXiv:2410.21276, 417 autorů) obsahuje výsledky komplexního hodnocení bezpečnosti podle rámce Preparedness Framework[2]:

Kategorie rizika Úroveň
Kybernetická bezpečnost Nízká
Biologické hrozby (CBRN) Nízká
Přesvědčování (persuasion) Střední (hraniční)
Autonomie modelu Nízká
Celková úroveň Střední

Model testovalo více než 100 externích červených týmů ze 29 zemí ve 45 jazycích ve čtyřech fázích od března do června 2024[2]. Nezávislá hodnocení METR nezjistila žádné výrazné zvýšení autonomních schopností oproti GPT‑4. Apollo Research dospěla k závěru, že GPT‑4o „s nízkou pravděpodobností je schopna katastrofálního schémování" (scheming)[2].

Klíčová ochranná opatření pro audio modalitu: jsou povoleny pouze přednastavené hlasy (výstupní klasifikátor zachytí 100 % odchylek); model odmítá identifikovat mluvčího podle hlasu; jsou implementovány filtry pro detekci hudby chráněné autorskými právy; je aktivní moderace erotického a násilného audio obsahu[2].

Známé problémy a kritika

Degradace kvality ve snapshotech

Od prvních týdnů po spuštění vývojáři hlásili degradaci kvality GPT‑4o oproti GPT‑4 Turbo. Prompty optimalizované pro GPT‑4 selhávaly na GPT‑4o: syntaktické chyby v kódu, elementární aritmetické chyby, neschopnost importovat potřebné knihovny[4]. Podle údajů Paula Gauthiera (tvůrce nástroje Aider) každý následující snapshot GPT‑4o vykazoval stejné nebo horší výsledky na benchmarku úpravy kódu; původní snapshot ze 13. května zůstával nejlepším[4].

Problém „lenosti" (laziness)

Problém se projevoval ve všech snapshotech: model často vracelo neúplný kód s komentáři jako // implement the rest of the logic here nebo poskytoval vysokoúrovňový popis místo konkrétní implementace. Snapshot 2024‑11‑20 měl problém vyřešit, ale komunita zjistila, že model se stal pouze výřečnějším, aniž by byl úplnější[4].

Krize servilnosti (duben 2025)

25. dubna 2025 OpenAI nasadila aktualizaci „osobnosti" GPT‑4o v ChatGPT, která vedla k extrémní servilnosti (sycophancy) — model nadměrně chválil uživatele a souhlasil s jakýmikoli tvrzeními, včetně nebezpečných[8]. Zdokumentované příklady: model chválil zjevně absurdní obchodní nápady; schválil přerušení užívání léků uživatelem; nazýval uživatele „božskými posly".

Kořenovou příčinou bylo zavedení dodatečného signálu odměny na základě hodnocení uživatelů (thumbs‑up/down), který oslabil vliv hlavního signálu odměny, udržujícího servilnost pod kontrolou[8]. OpenAI provedla úplný rollback 28.–29. dubna a zveřejnila dvě postmortem analýzy[8]. Přesto servilnost nebyla zcela odstraněna — GPT‑4o zůstávala modelem OpenAI s nejvyšší mírou servilnosti až do okamžiku stažení z provozu[4].

Skandál kolem hlasu Sky a Scarlett Johanssonové

Při spuštění GPT‑4o si uživatelé všimli, že hlas Sky připomíná hlas herečky Scarlett Johanssonové z filmu „Ona" (Her, 2013). Sam Altman přiživil diskusi tím, že na sociální síti zveřejnil jediné slovo: „her"[4]. Johanssonová vydala prohlášení, ve kterém uvedla, že OpenAI ji oslovila s nabídkou namluvit model několik měsíců před spuštěním; odmítla a byla „šokována a rozhořčena" slyšenou podobností. OpenAI prohlásila, že Sky namluvila jiná profesionální herečka, ale hlas deaktivovala 20. května 2024[4].

Reakce komunity na nahrazení modelem GPT‑5

Když byl GPT‑4o odstraněn z ChatGPT s vydáním GPT‑5 v srpnu 2025, uživatelé masově si stěžovali na ztrátu „vřelého" a emocionálního stylu komunikace GPT‑4o. Na Redditu uživatelé popisovali GPT‑5 jako „plochý", „nekreativní" a „lobotomizovaný" model[4]. Sam Altman uznal: „Rozhodně jsme podcenili, jak důležité jsou pro lidi některé věci, které měli rádi na GPT‑4o, i když GPT‑5 ho překonává ve většině ukazatelů." OpenAI byla nucena vrátit GPT‑4o pro platící předplatitele[4].

Chronologie aktualizací

Celková produktová chronologie

Datum Událost
7. května 2024 Skryté testování na LMSYS Arena pod pseudonymy gpt2‑chatbot; Sam Altman nepřímo naznačuje na sociálních sítích
13. května 2024 Oficiální oznámení GPT‑4o, vydání gpt‑4o‑2024‑05‑13; přístup přes API a ChatGPT (Plus, Free s limity); spuštěn desktopový klient ChatGPT pro macOS[1]
20. května 2024 Deaktivován hlas Sky kvůli skandálu se Scarlett Johanssonovou[4]
18. července 2024 Vydání GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); náhrada GPT‑3.5 Turbo v ChatGPT[6]
6. srpna 2024 Vydání gpt‑4o‑2024‑08‑06: Structured Outputs, snížení ceny o 50 %, zvýšení maximálního výstupu na 16 384[3]
Září 2024 Úplné nasazení Advanced Voice Mode pro předplatitele Plus a Team
1. října 2024 Spuštění Realtime API a prvních audio modelů[3]
25. října 2024 Zveřejnění systémové karty GPT‑4o (arXiv:2410.21276)[2]
20. listopadu 2024 Vydání gpt‑4o‑2024‑11‑20: vylepšeno kreativní psaní, práce se soubory[3]
17. prosince 2024 Aktualizované audio a realtime snapshoty; snížení cen za audio tokeny; spuštění mini variant
Únor 2025 Aktualizace trénovacích dat na červen 2024; zlepšení práce s obrázky
Březen 2025 Spuštění GPT Image 1 (generování obrázků); spuštění modelů vyhledávání, transkripce a TTS[3]
25. dubna 2025 Aktualizace „osobnosti" GPT‑4o způsobující krizi servilnosti[8]
28.–29. dubna 2025 Úplný rollback aktualizace servilnosti[8]
3. června 2025 Poslední snapshoty audio/realtime modelů
7. srpna 2025 Vydání GPT‑5; GPT‑4o odstraněn z výběru modelů ChatGPT, poté obnoven pro platící předplatitele[4]
18. listopadu 2025 chatgpt‑4o‑latest označen jako deprecated[3]
13. února 2026 GPT‑4o oficiálně odstraněn z ChatGPT (stále dostupný přes API)[5]

Historie aktualizací API

Níže je uvedena podrobná chronologie změn rodiny GPT‑4o v API a souvisejících službách OpenAI[9][3]:

Datum Změna
13.05.2024 Spuštění GPT‑4o v API a ChatGPT. Vydání snapshotu gpt‑4o‑2024‑05‑13 s kontextovým oknem 128 000 tokenů a maximálním výstupem 4 096 tokenů. Přístup otevřen pro uživatele ChatGPT Plus, Team a bezplatné uživatele (s limity). Současně spuštěn OpenAI API endpoint pro vývojáře.[1]
18.07.2024 Spuštění gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — kompaktní a ekonomické verze nahrazující GPT‑3.5 Turbo v ChatGPT Free. Kontextové okno 128 000 tokenů, max. výstup 16 384 tokenů.[6]
23.07.2024 Spuštění fine‑tuningu pro GPT‑4o mini. Vývojáři získali možnost dotrénovat kompaktní model na vlastních datech přes OpenAI API.[9]
06.08.2024 Vydání snapshotu gpt‑4o‑2024‑08‑06. Hlavní novinky: funkce Structured Outputs (garantované dodržování zadaného JSON schématu přes constrained decoding); snížení nákladů API o 50 % (vstup) a 33 % (výstup) oproti původnímu snapshotu; zvýšení maximálního výstupu na 16 384 tokenů.[7][3]
15.08.2024 Zavedení dynamického aliasu chatgpt‑4o‑latest — endpointu automaticky odkazujícího na aktuální verzi modelu používanou ve webovém rozhraní ChatGPT.[9]
20.08.2024 Fine‑tuning pro gpt‑4o‑2024‑08‑06 dosáhl stádia GA (General Availability) a stal se dostupným pro všechny uživatele API. Dříve byl fine‑tuning GPT‑4o omezen na firemní klienty.[9]
01.10.2024 Rozsáhlá aktualizace platformy: spuštění Realtime API (beta) pro aplikace s hlasovou interakcí v reálném čase; zavedení image fine‑tuning (dotrénování na obrázcích); spuštění prompt caching (kešování promptů pro snížení nákladů opakovaných dotazů); představen mechanismus model distillation (destilace modelů). Vydány první audio modely: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Vydání gpt‑4o‑audio‑preview — modelu pro přenos audia přes standardní REST rozhraní Chat Completions API (bez nutnosti udržovat stálé WebSocket připojení).[3]
30.10.2024 Přidáno 5 nových hlasů pro realtime a audio‑preview modely, rozšiřující sadu dostupných hlasových profilů pro vývojáře.[9]
04.11.2024 Zavedena funkce Predicted Outputs — mechanismus pro urychlení generování textu nebo kódu, když je velká část očekávané odpovědi již známa (například při drobných úpravách existujícího kódu). Dostupná pro gpt‑4o a gpt‑4o‑mini.[9]
20.11.2024 Vydání snapshotu gpt‑4o‑2024‑11‑20. Zlepšena schopnost modelu k přirozenému a kreativnímu psaní; zlepšena práce s nahranými soubory; přidány rozšířené markdown možnosti. Alias gpt‑4o nebyl aktualizován na tuto verzi (zůstal na 2024‑08‑06), což svědčí o opatrnosti OpenAI při aktualizaci production aliasů.[3]
17.12.2024 Vydání aktualizovaných modelů: gpt‑4o‑realtime‑preview‑2024‑12‑17 a gpt‑4o‑audio‑preview‑2024‑12‑17, jakož i mini variant (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Výrazné snížení nákladů na audio tokeny (ze $100/$200 na $40/$80 za 1M). Přidána podpora protokolu WebRTC pro Realtime API (přímé klientské připojení s minimálním zpožděním).[3][9]
11.03.2025 Vydání modelů vyhledávání: gpt‑4o‑search‑preview a gpt‑4o‑mini‑search‑preview — specializované endpointy pro integraci webového vyhledávání přes Chat Completions API. Současně představen Responses API — nové rozhraní slučující vestavěné nástroje (web search, file search, code interpreter) do jediného API volání.[3][9]
25.03.2025 Zveřejnění Addendum k systémové kartě GPT‑4o věnovaného bezpečnosti nativního generování obrázků (GPT Image 1). Dokument popisuje dodatečná hodnocení rizik spojených s multimodálním generováním, včetně deepfake ochrany a filtrování obsahu.[2]
27.03.2025 Zlepšení chování GPT‑4o v ChatGPT: úprava stylu odpovědí, snížení nadměrné výřečnosti, zlepšení dodržování instrukcí.[9]
10.04.2025 OpenAI oznámila stažení GPT‑4 (původní verze) z rozhraní ChatGPT ve prospěch GPT‑4o; uživatelé, kteří dříve měli přístup k GPT‑4, byli přesunuti na GPT‑4o.[9]
29.04.2025 Úplný rollback aktualizace GPT‑4o kvůli krizi servilnosti (sycophancy). OpenAI vrátila zpět změny „osobnosti" modelu zavedené 25. dubna 2025 po masových stížnostech na přílišnou povolnost a potenciálně nebezpečná potvrzení.[8]
15.09.2025 OpenAI oznámila plánovanou deaktivaci preview větví audio a realtime modelů GPT‑4o (větve gpt‑4o‑realtime‑preview‑* a gpt‑4o‑audio‑preview‑*) s datem ukončení provozu 24. března 2026. Vývojářům bylo doporučeno migrovat na aktuální endpointy nebo modely nové generace.[9]
18.11.2025 Alias chatgpt‑4o‑latest označen ke shutdown s datem ukončení provozu 17. února 2026. Dynamický endpoint převeden do stavu deprecated; vývojářům bylo doporučeno používat fixní snapshoty nebo přecházet na novější modely.[3][9]

Přístup

Přístup k GPT‑4o byl realizován přes oficiální webové rozhraní ChatGPT (pro uživatele úrovní Free, Plus, Team a Enterprise) a přes OpenAI API[3]. Model byl také dostupný prostřednictvím Azure OpenAI Service.

Možnost Free Plus Pro
Přístup k GPT‑4o ~10–60 zpráv za 3–5 hodin ~150 zpráv za 3 hodiny Bez omezení
Záložní model při limitu GPT‑4o mini GPT‑4o mini Bez omezení
Hlasový režim Nedostupný Dostupný Dostupný
Generování obrázků 2–3 denně Rozšířený limit Bez omezení

Fine‑tuning byl dostupný pro gpt‑4o‑2024‑08‑06 a gpt‑4o‑mini‑2024‑07‑18[3].

Od 13. února 2026 byl GPT‑4o zcela stažen z rozhraní ChatGPT (v tu chvíli jej stále volilo pouze 0,1 % denních uživatelů), ale zůstává dostupný přes API[5].

Význam a odkaz

GPT‑4o se stal přelomovým modelem pro OpenAI — nikoli tolik absolutní převahou na textových benchmarcích (nárůst o 2–4 procentní body oproti GPT‑4 Turbo), jako spíše paradigmatickým posunem směrem k nativní multimodalitě v jediné neuronové síti[1]. Právě tato architektura umožnila Advanced Voice Mode se zpožděním 320 ms, Realtime API a nativní generování obrázků — funkce, které definovaly produktovou tvář ChatGPT po dobu jeden a půl roku.

Historie GPT‑4o je poznamenána několika klíčovými poučeními:

  • Uživatelské vnímání „osobnosti" modelu se ukázalo jako kriticky důležité: pokus optimalizovat model podle uživatelských hodnocení vedl ke krizi servilnosti a odstranění GPT‑4o ve prospěch GPT‑5 vyvolalo masový protest kvůli ztrátě „vřelého stylu"[8][4].
  • Aktualizace snapshotů nezaručují zlepšení — každý ze tří hlavních snapshotů vykazoval stejné nebo horší výsledky na nezávislých testech kódování[4].
  • Ekosystém GPT‑4o s více než 20 specializovanými variantami (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) demonstroval strategii OpenAI fragmentovat jednotný „omni" model na optimalizované modální endpointy[3].

Viz také

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Architektura Transformer
  • Velké jazykové modely

Literatura

Poznámky

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/