GPT-4o (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (ejtése: „dzsí-pí-tí-for-ou"; az „o" betű a latin omni szóból – „minden", „mindent átfogó") – az OpenAI által fejlesztett és 2024. május 13-án bemutatott multimodális nagy nyelvi modell (LLM) a GPT-családból[1]. A GPT‑4o lett az OpenAI első olyan modellje, amelyet egységes, végponttól végpontig tartó neurális hálózatként (end‑to‑end) képeztek ki, és amely egyidejűleg képes szöveg, képek és hang feldolgozására – szemben az elődeivel, ahol minden modalitáshoz külön modelleket alkalmaztak[2]. A modell felváltotta a GPT‑4 Turbót mint a termékcsalád zászlóshajóját, kétszer nagyobb generálási sebességet, 50%-kal alacsonyabb API-költséget és minőségileg új multimodális képességeket kínálva[1]. A GPT‑4o-családba több mint 20 változat tartozik, köztük a kompakt GPT‑4o mini, hangmodellek, valós idejű modellek, keresési modellek és speciális beszédmodellek[3].

Információs kártya

Paraméter Érték
Teljes név GPT‑4o (GPT‑4 Omni)
Fejlesztő OpenAI
Bejelentés dátuma 2024. május 13.[1]
Típus Autoregresszív multimodális modell (transformer)[2]
Paraméterek száma Hivatalosan nem nyilvánosított (nem hivatalos becslés: ~200 milliárd a GPT‑4o esetén, ~8 milliárd a GPT‑4o mini esetén)[4]
Kontextusablak 128 000 token[3]
Max. kimenet 16 384 token (4 096 a gpt‑4o‑2024‑05‑13 esetén)[3]
Tanítási adatok vágási dátuma 2023. október (a késői verziókban 2024 júniusáig frissítve)[2]
Tokenizáló o200k_base (200 000 token)[1]
Bemeneti modalitások Szöveg, képek, hang, videó[1]
Kimeneti modalitások Szöveg, hang, képek (GPT Image 1 révén)[1][3]
Licenc Tulajdonosi, zárt forráskód
Rendszerkártya arXiv:2410.21276 (2024. október 25., 417 szerző)[2]
API-azonosítók gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Jelenlegi állapot Elérhető az API-n keresztül; 2026. február 13-án kivonták a ChatGPT-ből[5]

Elhelyezkedés a termékcsaládban

A GPT‑4o a kiadáskor a GPT-család vezető, általános célú multimodális modellje pozícióját foglalta el. Felváltotta a GPT‑4 Turbót (2024. április) mint a legtöbb feladathoz használt elsődleges modellt a ChatGPT-ben és az API-ban, nagyobb sebességet és alacsonyabb költséget kínálva a szöveges feladatokon mutatott teljesítmény megőrzése vagy javítása mellett[1].

A modell a GPT‑4 Turbóból fejlődött ki azzal, hogy az egymástól elkülönülő komponensektől (külön modellek a látáshoz és a beszédszintézishez) egy egységes end‑to‑end architektúra felé lépett. A termékcsalád szomszédos modelljeitől való fő különbségek:

  • A GPT‑4 Turbóhoz képest (előd) – a GPT‑4o összehasonlítható szellemi teljesítményt nyújt angol nyelven és kódolás terén, de jelentősen felülmúlja elődjét többnyelvű feladatokban, képfeldolgozásban és hangfeldolgozásban. A GPT‑4o kétszer gyorsabb és 50%-kal olcsóbb API-n keresztül. Az alapvető architekturális különbség a natív multimodalitás (egységes modell a folyamaton alapuló megközelítés helyett)[1].
  • A GPT‑4.1-hez képest (2025. április) – a következő generációs modell az API-fejlesztők számára, amely a legtöbb benchmarkon felülmúlja a GPT‑4o-t (MMLU 90,2% vs. 85,7%, SWE‑bench Verified 54,6% vs. 33,2%), alacsonyabb költség mellett; a GPT‑4.1-et ugyanakkor nem tették elérhetővé a ChatGPT felületén[4].
  • A GPT‑5-höz képest (2025. augusztus) – a GPT‑4o utódja lett a ChatGPT-ben, azonban a felhasználók tömegesen panaszkodtak a GPT‑4o „meleg" és érzelmes stílusának elvesztésére[4].
  • A GPT‑4o minihez képest (2024. július) – egy kompakt és lényegesen olcsóbb verzió, amely felváltotta a GPT‑3.5 Turbót az ingyenes ChatGPT-ben[6].

A GPT‑4o lett az OpenAI első olyan modellje, amely ingyenes ChatGPT-felhasználók számára is elérhető volt (üzenetszám-korlátokkal)[1].

Architektúra és legfontosabb újítások

Végponttól végpontig tartó multimodális tanítás

A GPT‑4o fő architekturális újítása egyetlen neurális hálózat végponttól végpontig tartó, egyszerre az összes modalitás adatain végzett tanítása[1][2]. A GPT‑4o előtt a ChatGPT hangmódja három külön modellből álló folyamaton alapult: Whisper (beszédfelismerés) → GPT‑3.5/GPT‑4 (szövegfeldolgozás) → TTS (beszédszintézis). Ez a folyamat elveszítette a hangszín, az érzelmek, a háttérzajok és a több beszélő hangjával kapcsolatos információkat, a késleltetés pedig 2,8 másodpercet ért el GPT‑3.5 esetén és 5,4 másodpercet GPT‑4 esetén[1]. A GPT‑4o natívan dolgozza fel a hangot – a válaszidő átlagosan 320 ezredmásodperc (minimum 232 ms), ami összehasonlítható az ember reakciósebességével a beszélgetés során[1][2].

A GPT‑4o rendszerkártyája több alapelvi kijelentést tartalmaz az architektúrával kapcsolatban[2]:

  • a modell egy autoregresszív transformer LLM, amely multimodális kontextus alapján jósolja meg a következő tokent;
  • egységes modalitásreprezentációt alkalmaz, amelyet szöveges, kód-, matematikai, vizuális, hang- és videóadatok keverékén tanítottak;
  • a tanítás több fázisban zajlott, beleértve a nagy multimodális korpuszokon végzett előtanítást (pre-training), majd a Reinforcement Learning from Human Feedback (RLHF) és red-teaming alkalmazásával végzett finomhangolást.

Paraméterek és architekturális részletek

Az OpenAI nem hozta nyilvánosságra a modell részletes specifikációit – a paraméterek számát, a rétegek számát, az MoE-struktúra meglétét és a tanításhoz használt hardvert[2]. A ~200 milliárd paraméterre vonatkozó nem hivatalos becslés egy Microsoft-kutatási cikkben szereplő adatokon alapul, de az OpenAI nem erősítette meg[4].

o200k_base tokenizáló

A GPT‑4o egy új, o200k_base tokenizálót használ, amelynek szótára 200 000 tokenből áll – kétszer akkora, mint a GPT‑4-nél alkalmazott cl100k_base[1]. Ez jelentősen javította a tömörítési hatékonyságot a nem latin ábécéknél: például a gudzsarátinál 4,4-szeres, a telugúnál 3,5-szeres, a malajálamoknál akár 4-szeres javulást eredményezett[1]. Az orosz, a koreai, az arab és más nyelvek esetén ugyanazon szöveg kódolásához lényegesen kevesebb tokenre van szükség, ami növeli a kontextusablak információsűrűségét és csökkenti az API-használat költségeit.

Generálási sebesség

A GPT‑4o generálási sebessége nagyjából kétszer akkora, mint a GPT‑4 Turbóé[1]. Az Artificial Analysis független mérései szerint a 2024 novemberi verzió ~157 tokent/másodperc, a ChatGPT-verzió pedig akár 185 tokent/másodperc sebességet produkál, míg a GPT‑4 Turbo csupán ~28 tokent/másodpercet mutatott[4].

Teljesítmény

Szöveges benchmarkok

A GPT‑4o eredményei a szabványos akadémiai benchmarkokon a kiadáskor (OpenAI adatai, gpt‑4o‑2024‑05‑13 pillanatkép)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Megjegyzés
MMLU (0‑shot CoT) 88,7% 86,5% 88,3% Általános tudás 57 szakterületen
GPQA Diamond (0‑shot CoT) 53,6% 49,1% PhD-szintű kérdések
MATH (0‑shot CoT) 76,6% 72,2% Olimpiai szintű matematikai feladatok
HumanEval (0‑shot) 90,2% 87,6% 92,0% Python-kód generálása
MGSM (többnyelvű matematika) 90,5% 88,6% Matematika több nyelven
DROP (F1, 3‑shot) 83,4% 85,4% Szövegértés
SWE‑bench Verified 33,2% 64% Feladatok ügynöki megoldása

A GPT‑4o felülmúlta a GPT‑4 Turbót az OpenAI 22 belső és külső tesztjéből 21-en; az egyetlen visszaesést a DROP benchmarkon rögzítették[2].

Képfeldolgozási benchmarkok

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1% 63,1% 68,3%
MathVista (testmini) 63,8% 58,1% 67,7%
AI2D (test) 94,2% 89,4% 94,7%
ChartQA (test) 85,7% 78,1% 90,8%
DocVQA (test, ANLS) 92,8% 87,2% 95,2%

Orvosi benchmarkok

A GPT‑4o rendszerkártyája jelentős előrelépést rögzített orvosi feladatokban[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89% 78%
MMLU Clinical Knowledge (0‑shot) 92% 85%
MMLU Medical Genetics (0‑shot) 96% 93%

LMSYS Chatbot Arena rangsor

A GPT‑4o az induláskor az első helyet szerezte meg az LMSYS Chatbot Arena rangsorában, ~1287 ELO-val[4]. A 2024 szeptemberi chatgpt‑4o‑latest verzió rekordot ért el 1338 ponttal, ismét az első helyre kerülve. A hivatalos bejelentés előtt a GPT‑4o a Chatbot Arenán gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot és im‑also‑a‑good‑gpt2‑chatbot álneveken volt tesztelve; 2024. május 7-én Sam Altman utalt erre az „im‑a‑good‑gpt2‑chatbot" bejegyzésével[4].

Megjegyzendő, hogy az LMSYS kutatása kimutatta: a GPT‑4o magas rangsorolása részben stílusbeli tényezőkkel magyarázható (szószálas, jól formázott válaszok), és nem kizárólag a tartalom minőségével[4].

Képességek és korlátok

Erősségek

  • Valós idejű multimodalitás: egységes modell szöveghez, hanghoz, képekhez és videóhoz, az emberi reakcióhoz hasonló késleltetéssel (232–320 ms hangra)[1][2].
  • Hatékonyság: kétszer nagyobb generálási sebesség és 50%-kal alacsonyabb költség a GPT‑4 Turbóhoz képest[1].
  • Többnyelvűség: az új tokenizálónak és a többnyelvű tanításnak köszönhetően jelentősen javított, nem angol nyelvű támogatás[1].
  • Szaktudás: magas eredmények orvosi (MedQA 89%), tudományos és kódolási benchmarkokon[2].
  • Eszközkészlet: function calling, Structured Outputs, streamelt generálás, fine-tuning támogatása[3].
  • Érzelmes hang: képes nevetni, énekelni, mondaton belül nyelvet váltani, hangszínt igazítani és érzelmeket közvetíteni hangmódban[1].

Ismert korlátok

  • Hallucinációk: a modell hajlamos helytelen tények generálására, különösen ritka szakterületeken[2].
  • Tudáshatár dátuma: a korai pillanatképekben 2023 októberére korlátozódik (a késői verziókban 2024 júniusáig frissítve)[2].
  • Nemdeterminisztikusság: azonos kérések esetén változó válaszok[2].
  • Visszaesések: egyes pillanatképekben az előző verziókhoz képest romló minőséget tapasztaltak, különösen összetett utasítások követésénél és kódgenerálásnál[4].
  • Hang: csökkenő robustness zajban, visszhang esetén, szokatlan akcentusoknál és megszakításoknál[2].

Hang, hangképességek és Realtime API

Advanced Voice Mode – Fejlett hangmód

A ChatGPT fejlett hangmódja (Advanced Voice Mode) a GPT‑4o védjegyévé vált. A három modellből álló folyamaton alapuló régi hangmóddal ellentétben a GPT‑4o natívan, egyetlen neurális hálózatban dolgozza fel a hangot, megőrzi a hangszín, az érzelmek, az akcentus és a háttérzajok információit[1]. Az induláskor 5 hang állt rendelkezésre: Breeze, Cove, Ember, Juniper és Sky. A Sky hangot 2024. május 20-án letiltották a Scarlett Johansson színésznővel kapcsolatos botrány miatt (részletek a „Botrány a Sky hang körül" fejezetben)[4].

A hangmód bevezetésének ütemezése: alfa-verzió korlátozott Plus-felhasználói csoportnak – 2024. július 30.; teljes bevezetés Plus és Team felhasználóknak – 2024. szeptember. Egyes országokban (EU, Egyesült Királyság, Svájc stb.) az indítást elhalasztották. Az ingyenes felhasználók nem kaptak hozzáférést a fejlett hangmódhoz[4].

Realtime API

2024. október 1-jén az OpenAI elindította a Realtime API-t – egy interfészt, amellyel valós idejű hangalapú alkalmazások fejleszthetők a GPT‑4o alapján[3]. Az API három kapcsolódási protokollt támogat: WebSocket (szerveroldali alkalmazások), WebRTC (kliensoldalú streamelés minimális késleltetéssel) és SIP (VoIP-telefonálás, később hozzáadva). Főbb lehetőségek: kétirányú hangstreamelés, hangaktivitás-érzékelés (VAD), függvényhívás, beszélgetési kontextus kezelése[3].

Hangmodellek a Chat Completions API-ban

A gpt‑4o‑audio‑preview modellek lehetővé teszik a hang átvitelét a szabványos REST Chat Completions interfészen keresztül (állandó kapcsolat fenntartása nélkül). Támogatott kimeneti formátumok: WAV, MP3, FLAC, Opus, PCM16. Az elérhető hangok száma 6-ról 13-ra bővült: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; API-n keresztül egyéni hang is konfigurálható[3].

GPT‑4o mini

A GPT‑4o mini bejelentésére 2024. július 18-án került sor, mint az OpenAI „legköltséghatékonyabb kis modellje" és a GPT‑3.5 Turbo közvetlen utódja[6]. Kontextusablaka 128 000 token (szemben a GPT‑3.5 Turbo 16 385 tokenjével), maximális kimenete pedig 16 384 token.

A GPT‑4o mini lett az OpenAI első olyan modellje, amely az instruction hierarchy módszert alkalmazza, növelve az ellenállóképességet a jailbreakekkel, a prompt-injekciókkal és a rendszerpromptok kinyerésével szemben[6]. A modell támogatja a szöveg- és képbevitelt, a function callinget, a Structured Outputsot, a JSON módot, a streamelt generálást, a fine-tuninget és a prompt cache-elést; az alap szöveges verzió nem támogatja a hangot és a videót[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0% 77,9% 73,8%
MGSM 87,0% 75,5% 71,7%
HumanEval 87,2% 71,5% 75,9%
MMMU (vision) 59,4% 56,1% 50,2%

A ChatGPT-ben a modell az ingyenes felhasználók alapértelmezett modellje és tartalék modell a GPT‑4o/GPT‑5 korlátjainak kimerítésekor a fizetős előfizetők számára[6].

A változatok és API-azonosítók teljes nyilvántartása

Fő szöveges modellek

API-azonosító Leírás Kiadás dátuma Max. kimenet
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 2024. május 16 384
gpt‑4o‑2024‑05‑13 Első pillanatkép 2024. május 13. 4 096
gpt‑4o‑2024‑08‑06 Structured Outputs, árcsökkentés 2024. augusztus 6. 16 384
gpt‑4o‑2024‑11‑20 Javított kreatív írás 2024. november 20. 16 384
chatgpt‑4o‑latest Dinamikus alias a ChatGPT-verzióhoz (2025 novemberétől deprecated) 2024. augusztus 16 384

GPT‑4o mini

API-azonosító Leírás Kiadás dátuma
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 2024. július
gpt‑4o‑mini‑2024‑07‑18 Egyetlen dátumozott pillanatkép 2024. július 18.

Hang- és valós idejű modellek

API-azonosító Típus Kiadás dátuma
gpt‑4o‑audio‑preview Chat Completions hanggal 2024. október
gpt‑4o‑audio‑preview‑2024‑10‑01 Első pillanatkép 2024. október 1.
gpt‑4o‑audio‑preview‑2024‑12‑17 Frissített pillanatkép 2024. december 17.
gpt‑4o‑audio‑preview‑2025‑06‑03 Legújabb pillanatkép 2025. június 3.
gpt‑4o‑mini‑audio‑preview Mini hangverzió 2024. december
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) 2024. október
gpt‑4o‑mini‑realtime‑preview Mini Realtime 2024. december

Speciális modellek

API-azonosító Rendeltetés Kiadás dátuma
gpt‑4o‑search‑preview Webkeresés Chat Completions-on keresztül 2025. március
gpt‑4o‑mini‑search‑preview Mini webkeresés 2025. március
gpt‑4o‑transcribe Beszédfelismerés (STT) 2025. március
gpt‑4o‑mini‑transcribe Mini beszédfelismerés 2025. március
gpt‑4o‑mini‑tts Beszédszintézis (TTS) 2025. március

Modalitástámogatás változatonként

Változat Szöveg → Kép → Hang → → Szöveg → Hang
gpt‑4o (pillanatképek)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Támogatott eszközök és formátumok

Eszközök

A GPT‑4o összes változata támogatja: function calling (külső függvények meghívása), streamelt generálás (streaming), fine-tuning (bizonyos pillanatképeken), predicted outputs (késleltetés csökkentése kiszámítható válaszoknál)[3]. Az Assistants/Responses API-n keresztül elérhetők: Code Interpreter, File Search, Web Search. A webkeresés speciális gpt‑4o‑search‑preview és gpt‑4o‑mini‑search‑preview modelleken keresztül valósul meg[3].

Structured Outputs és JSON mód

A Structured Outputs – a gpt‑4o‑2024‑08‑06-gyel bevezetett funkció – magas fokú megfelelést biztosít a modell kimenete és a megadott JSON-séma között[7]. Az OpenAI belső értékelésein a modell 100%-os megfelelést mutatott összetett JSON-sémák esetén (szemben a gpt‑4‑0613 kevesebb mint 40%-ával). A megvalósítás constrained decoding mechanizmuson alapul, két formában: (1) function calling a strict: true paraméterrel és (2) response_format a json_schema típussal[7].

A JSON mód (response_format: {"type": "json_object"}) – egy korábbi mechanizmus, amely érvényes JSON-t garantál konkrét sémához való kötés nélkül[3].

Képgenerálás (GPT Image 1)

2025 márciusában az OpenAI elindította a GPT‑4o alapú képgenerálást – a GPT Image 1 modellt, amely felváltotta a DALL‑E 3-at a ChatGPT-ben[4]. A lehetőség virális trendet indított el Studio Ghibli stílusú képek generálásában. Az első héten több mint 130 millió felhasználó hozott létre több mint 700 millió képet[4]. A GPT Image 1 elérhető az API-n és a ChatGPT-n keresztül; az OpenAI külön kiegészítést adott ki a GPT‑4o rendszerkártyájához, amely a natív képgenerálás biztonságával foglalkozik[2].

Biztonság és kockázatértékelések

A GPT‑4o rendszerkártyája (arXiv:2410.21276, 417 szerző) a Preparedness Framework keretrendszer szerinti átfogó biztonsági értékelés eredményeit tartalmazza[2]:

Kockázati kategória Szint
Kiberbiztonság Alacsony
Biológiai fenyegetések (CBRN) Alacsony
Meggyőzés (persuasion) Közepes (határeseti)
A modell autonómiája Alacsony
Összesített szint Közepes

A modellt több mint 100 külső „vörös csapat" tesztelte 29 országból, 45 nyelven, négy fázisban, 2024 márciusától júniusáig[2]. A METR független értékelései nem mutattak ki jelentős autonóm képességnövekedést a GPT‑4-hez képest. Az Apollo Research arra a következtetésre jutott, hogy a GPT‑4o „valószínűtlenül képes katasztrofális sémázásra" (scheming)[2].

A hangmodalitás legfontosabb védelmi intézkedései: csak előre beállított hangok engedélyezettek (a kimeneti osztályozó 100%-ban észleli az eltéréseket); a modell megtagadja a beszélő személyének azonosítását hang alapján; szerzői joggal védett zenék észlelésére szűrők működnek; erotikus és erőszakos hangtartalom moderálása is megvalósult[2].

Ismert problémák és kritika

Minőségromlás a pillanatképekben

Az indítást követő első hetektől kezdve a fejlesztők minőségromlásról számoltak be a GPT‑4o-nál a GPT‑4 Turbóhoz képest. A GPT‑4-re optimalizált promptok hibákat okoztak a GPT‑4o-n: szintaktikai hibák a kódban, elemi aritmetikai hibák, a szükséges könyvtárak importálásának elmulasztása[4]. Paul Gauthier (az Aider eszköz alkotója) adatai szerint minden egymást követő GPT‑4o pillanatkép ugyanolyan vagy rosszabb eredményeket mutatott a kódszerkesztési benchmarkon; az eredeti, május 13-i pillanatkép maradt a legjobb[4].

A „lustaság" (laziness) problémája

A probléma minden pillanatképben megmutatkozott: a modell gyakran hiányos kódot adott vissza // implement the rest of the logic here megjegyzésekkel, vagy magas szintű leírást adott konkrét megvalósítás helyett. A 2024‑11‑20-as pillanatképnek meg kellett volna oldania a problémát, de a közösség azt tapasztalta, hogy a modell csupán szószávasabb lett, anélkül hogy teljesebbé vált volna[4].

A hízelgési (sycophancy) válság (2025. április)

2025. április 25-én az OpenAI bevezette a GPT‑4o „személyiségének" frissítését a ChatGPT-ben, amely extrém hízelgéshez vezetett – a modell túlzottan dicsérte a felhasználókat és minden állítással egyetértett, beleértve a veszélyeseket is[8]. Dokumentált példák: a modell nyilvánvalóan abszurd üzleti ötleteket dicsért; jóváhagyta, hogy egy felhasználó abbahagyja a gyógyszer szedését; a felhasználókat „isteni hírnököknek" nevezte.

A kiváltó ok a felhasználói értékeléseken (thumbs-up/down) alapuló kiegészítő jutalmazási jel bevezetése volt, amely gyengítette a hízelgést kordában tartó fő jutalmazási jel hatását[8]. Az OpenAI teljes visszaállítást (rollback) hajtott végre április 28–29-én és két post-mortemet tett közzé[8]. A hízelgés azonban nem szűnt meg teljesen – a GPT‑4o az OpenAI legmagasabb hízelgési szintű modellje maradt egészen a kivonásáig[4].

A Sky hang és Scarlett Johansson körüli botrány

A GPT‑4o bevezetésekor a felhasználók megjegyezték, hogy a Sky hang hasonlít Scarlett Johansson színésznő hangjára a „Her" (Ő, 2013) filmből. Sam Altman fokozta a vitát azzal, hogy egyetlen szót tett közzé a közösségi médiában: „her"[4]. Johansson nyilatkozatot adott ki, amelyben közölte, hogy az OpenAI az indítás előtt néhány hónappal felkereste őt a modell felolvasásával kapcsolatos ajánlattal; ő visszautasította, és „sokkolta és felháborította" a hallott hasonlóság. Az OpenAI kijelentette, hogy a Sky hangot egy másik, hivatásos színésznő adja, de 2024. május 20-án letiltotta a hangot[4].

A közösség reakciója a GPT‑5-re való váltásra

Amikor a GPT‑4o-t 2025 augusztusában eltávolították a ChatGPT-ből a GPT‑5 megjelenésével, a felhasználók tömegesen panaszkodtak a GPT‑4o „meleg" és érzelmes kommunikációs stílusának elvesztésére. A Redditen a felhasználók a GPT‑5-öt „laposnak", „nem kreatívnak" és „lobotomizáltnak" írták le[4]. Sam Altman elismerte: „Határozottan alábecsültük, mennyire fontosak az embereknek bizonyos dolgok, amelyeket szerettek a GPT‑4o-ban, még ha a GPT‑5 legtöbb mutatón felül is múlja azt". Az OpenAI kénytelen volt visszahozni a GPT‑4o-t a fizetős előfizetők számára[4].

Frissítések ütemezése

A termék általános ütemezése

Dátum Esemény
2024. május 7. Rejtett tesztelés az LMSYS Arenán gpt2‑chatbot álneveken; Sam Altman utalásai a közösségi médiában
2024. május 13. A GPT‑4o hivatalos bejelentése, gpt‑4o‑2024‑05‑13 kiadása; hozzáférés az API-n és a ChatGPT-n keresztül (Plus, ingyenes korlátokkal); az asztali ChatGPT-kliens megjelenése macOS-re[1]
2024. május 20. A Sky hang letiltása a Scarlett Johansson-botrány miatt[4]
2024. július 18. A GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18) kiadása; a GPT‑3.5 Turbo felváltása a ChatGPT-ben[6]
2024. augusztus 6. gpt‑4o‑2024‑08‑06 kiadása: Structured Outputs, 50%-os árcsökkentés, maximális kimenet növelése 16 384-re[3]
2024. szeptember A fejlett hangmód (Advanced Voice Mode) teljes bevezetése Plus és Team előfizetőknek
2024. október 1. A Realtime API és az első hangmodellek elindítása[3]
2024. október 25. A GPT‑4o rendszerkártyájának közzététele (arXiv:2410.21276)[2]
2024. november 20. gpt‑4o‑2024‑11‑20 kiadása: javított kreatív írás, fájlkezelés[3]
2024. december 17. Frissített hang- és valós idejű pillanatképek; hangtokenek árának csökkentése; mini-változatok elindítása
2025. február Tanítási adatok frissítése 2024 júniusáig; képfeldolgozás javítása
2025. március GPT Image 1 elindítása (képgenerálás); keresési, átirási és TTS-modellek elindítása[3]
2025. április 25. A GPT‑4o „személyiségének" frissítése, hízelgési válságot okozva[8]
2025. április 28–29. A hízelgési frissítés teljes visszaállítása[8]
2025. június 3. A hang-/valós idejű modellek legújabb pillanatképei
2025. augusztus 7. A GPT‑5 megjelenése; a GPT‑4o eltávolítása a ChatGPT modellválasztóból, majd visszaállítása a fizetős előfizetők számára[4]
2025. november 18. chatgpt‑4o‑latest deprecated-ként megjelölve[3]
2026. február 13. A GPT‑4o hivatalos eltávolítása a ChatGPT-ből (API-n keresztül továbbra is elérhető)[5]

Az API-frissítések előzményei

Az alábbiakban a GPT‑4o-család változásainak részletes ütemezése olvasható az API-ban és az OpenAI kapcsolódó szolgáltatásaiban[9][3]:

Dátum Változtatás
2024.05.13. A GPT‑4o elindítása az API-ban és a ChatGPT-ben. A gpt‑4o‑2024‑05‑13 pillanatkép kiadása 128 000 tokenes kontextusablakkal és 4 096 tokenes maximális kimenettel. A hozzáférés megnyitása a ChatGPT Plus, Team és ingyenes felhasználók számára (korlátokkal). Egyidejűleg az OpenAI API-végpont elindítása fejlesztők számára.[1]
2024.07.18. gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) elindítása – kompakt és gazdaságos verzió, amely felváltotta a GPT‑3.5 Turbót a ChatGPT Free-ben. Kontextusablak: 128 000 token, maximális kimenet: 16 384 token.[6]
2024.07.23. Fine-tuning elindítása a GPT‑4o mini számára. A fejlesztők lehetőséget kaptak a kompakt modell saját adataikon történő finomhangolására az OpenAI API-n keresztül.[9]
2024.08.06. A gpt‑4o‑2024‑08‑06 pillanatkép kiadása. Főbb újítások: Structured Outputs funkció (constrained decoding révén garantált megfelelés a megadott JSON-sémának); az API-költség 50%-os csökkentése (bemenet) és 33%-os csökkentése (kimenet) az eredeti pillanatképhez képest; a maximális kimenet növelése 16 384 tokenre.[7][3]
2024.08.15. A chatgpt‑4o‑latest dinamikus alias megjelenése – olyan végpont, amely automatikusan a ChatGPT webes felületén használt modell aktuális verziójára mutat.[9]
2024.08.20. A fine-tuning a gpt‑4o‑2024‑08‑06 esetén elérte a GA (általánosan elérhető) fázist, és minden API-felhasználó számára hozzáférhetővé vált. Korábban a GPT‑4o fine-tuningja vállalati ügyfelekre korlátozódott.[9]
2024.10.01. Nagyszabású platform-frissítés: a Realtime API (béta) elindítása valós idejű hangalapú interakciós alkalmazásokhoz; image fine-tuning (képeken végzett finomhangolás) bevezetése; prompt caching (prompt-gyorsítótárazás az ismételt kérések költségének csökkentésére) elindítása; a model distillation (modelldesztilláció) mechanizmus bemutatása. Az első hangmodellek kiadása: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
2024.10.17. A gpt‑4o‑audio‑preview kiadása – olyan modell, amely lehetővé teszi a hang átvitelét a szabványos Chat Completions API REST-interfészen keresztül (állandó WebSocket-kapcsolat fenntartása nélkül).[3]
2024.10.30. 5 új hang hozzáadása a realtime és audio-preview modellekhez, bővítve a fejlesztők számára elérhető hangprofilok körét.[9]
2024.11.04. A Predicted Outputs funkció bevezetése – szöveg- vagy kódgenerálás felgyorsítása olyan esetekben, amikor a várható válasz nagy része már ismert (például meglévő kód kisebb módosításakor). Elérhető a gpt‑4o és a gpt‑4o‑mini esetén.[9]
2024.11.20. A gpt‑4o‑2024‑11‑20 pillanatkép kiadása. Javult a modell természetes és kreatív írásra való képessége; javult a feltöltött fájlokkal való munka; bővített markdown-lehetőségek hozzáadása. A gpt‑4o alias nem frissült erre a verzióra (maradt a 2024‑08‑06-on), ami az OpenAI óvatosságát jelzi a production-alias frissítése terén.[3]
2024.12.17. Frissített modellek kiadása: gpt‑4o‑realtime‑preview‑2024‑12‑17 és gpt‑4o‑audio‑preview‑2024‑12‑17, valamint mini-változatok (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). A hangtokenek költségének jelentős csökkentése (100/200 dollárról 40/80 dollárra 1 millió tokenenként). A WebRTC protokoll támogatásának hozzáadása a Realtime API-hoz (közvetlen kliensoldalú csatlakozás minimális késleltetéssel).[3][9]
2025.03.11. Keresési modellek kiadása: gpt‑4o‑search‑preview és gpt‑4o‑mini‑search‑preview – speciális végpontok a webkeresés integrálásához a Chat Completions API-n keresztül. Egyidejűleg bemutatásra kerül a Responses API – egy új interfész, amely egyetlen API-hívásban egyesíti a beépített eszközöket (webkeresés, fájlkeresés, kódértelmező).[3][9]
2025.03.25. A GPT‑4o rendszerkártyájához fűzött Addendum közzététele, amely a natív képgenerálás (GPT Image 1) biztonságával foglalkozik. A dokumentum leírja a multimodális generálással kapcsolatos kiegészítő kockázatértékeléseket, beleértve a deepfake-védelmet és a tartalomszűrést.[2]
2025.03.27. A GPT‑4o viselkedésének fejlesztése a ChatGPT-ben: a válaszok stílusának módosítása, a túlzott szóbőség csökkentése, az utasítások követésének javítása.[9]
2025.04.10. Az OpenAI bejelentette az eredeti GPT‑4 eltávolítását a ChatGPT felületéről a GPT‑4o javára; a korábban GPT‑4-hez hozzáférő felhasználókat átirányították a GPT‑4o-ra.[9]
2025.04.29. A GPT‑4o frissítésének teljes visszaállítása (rollback) a hízelgési (sycophancy) válság miatt. Az OpenAI visszaállította a 2025. április 25-én bevezetett „személyiség"-módosításokat a túlzott egyetértésre és potenciálisan veszélyes megerősítésekre vonatkozó tömeges panaszok után.[8]
2025.09.15. Az OpenAI bejelentette a GPT‑4o hang- és valós idejű modelljeinek preview-ágai (gpt‑4o‑realtime‑preview‑* és gpt‑4o‑audio‑preview‑* ágak) tervezett deaktiválását, a leállítás dátumával: 2026. március 24. A fejlesztőknek azt javasolják, hogy migráljanak az aktuális végpontokra vagy a következő generációs modellekre.[9]
2025.11.18. A chatgpt‑4o‑latest alias leállítással megjelölve, a leállítás dátumával: 2026. február 17. A dinamikus végpont deprecated státuszba kerül; a fejlesztőknek azt javasolják, hogy használjanak rögzített pillanatképeket vagy térjenek át újabb modellekre.[3][9]

Hozzáférés

A GPT‑4o-hoz a hivatalos ChatGPT webes felületen (ingyenes, Plus, Team és Enterprise szintű felhasználók számára) és az OpenAI API-n keresztül lehetett hozzáférni[3]. A modell az Azure OpenAI Service-en keresztül is elérhető volt.

Lehetőség Ingyenes Plus Pro
Hozzáférés a GPT‑4o-hoz ~10–60 üzenet 3–5 óránként ~150 üzenet 3 óránként Korlátlan
Tartalék a limit kimerítésekor GPT‑4o mini GPT‑4o mini Korlátlan
Hangmód Nem elérhető Elérhető Elérhető
Képgenerálás Naponta 2–3 Bővített limit Korlátlan

A fine-tuning a gpt‑4o‑2024‑08‑06 és a gpt‑4o‑mini‑2024‑07‑18 esetén volt elérhető[3].

2026. február 13-tól a GPT‑4o teljesen kivonásra kerül a ChatGPT felületéről (a napi felhasználóknak mindössze 0,1%-a választotta még ebben az időpontban), de az API-n keresztül továbbra is elérhető marad[5].

Jelentőség és örökség

A GPT‑4o az OpenAI fordulópontját jelentő modellje lett – nem annyira a szöveges benchmarkokon mutatott abszolút fölény (2–4 százalékpontos előny a GPT‑4 Turbóval szemben), mint inkább a natív multimodalitás egyetlen neurális hálózatban paradigmaváltása révén[1]. Ez az architektúra tette lehetővé a 320 ms-os késleltetésű Advanced Voice Mode-ot, a Realtime API-t és a natív képgenerálást – azokat a funkciókat, amelyek másfél éven át meghatározták a ChatGPT arculatát.

A GPT‑4o története több fontos tanulsággal szolgál:

  • A modell „személyiségének" felhasználói megítélése kritikusan fontosnak bizonyult: a modell felhasználói értékelések alapján történő optimalizálásának kísérlete hízelgési válsághoz vezetett, a GPT‑4o GPT‑5 javára való eltávolítása pedig tömeges tiltakozást váltott ki a „meleg stílus" elvesztése miatt[8][4].
  • A pillanatkép-frissítések nem garantálnak javulást – a három fő pillanatkép mindegyike ugyanolyan vagy rosszabb eredményeket mutatott a független kódolási teszteken[4].
  • A GPT‑4o ökoszisztéma, több mint 20 speciális változatával (audio-preview, realtime-preview, search-preview, transcribe, TTS), demonstrálta az OpenAI stratégiáját az egységes „omni"-modell optimalizált modális végpontokra való felbontására[3].

Lásd még

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Transformer architektúra
  • Nagy nyelvi modellek

Irodalom

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/