GPT (OpenAI) (HU)
GPT (Generative Pre-trained Transformer) — a nagy nyelvi modellek (LLM) egy családja, amelyet az OpenAI fejlesztett ki. A GPT-modellek a transformer architektúrára épülnek, és a generatív előtanítás paradigmáját valósítják meg: az első szakaszban a modell explicit jelölés nélküli, kiterjedt szövegkorpuszon tanul, majd konkrét feladatokra finomhangolható. A késői generációkhoz (GPT‑5-től kezdve) az OpenAI az egységes rendszer (unified system) megjelölést is alkalmazza, mivel a termék egy gyors válaszmódot, egy mélyített gondolkodási (reasoning) módot és egy útválasztót egyesít.[1]
Elnevezés
A GPT rövidítés feloldása: Generative Pre-trained Transformer (Generatív Előzetesen Betanított Transformer).
- Generatív (Generative): azt jelenti, hogy a modell képes új tartalmat – például szöveget – létrehozni (generálni).
- Előzetesen betanított (Pre-trained): arra utal, hogy a modell egy kiterjedt kezdeti tanítási szakaszon megy át nagy adatmennyiségen (például internetes szövegeken). Az előzetes tanítás után a modell általában tovább „finomhangolható" (fine-tuned) specifikusabb feladatok elvégzésére.
- Transformer: egy konkrét neurális hálózati architektúra neve, amely a GPT és számos más modern AI-modell alapját képező kulcsinnováció.
A GPT legfőbb sajátossága, hogy a tanítás autoregresszív formában történik – a modell a korábbi kontextus alapján jósolja meg a következő tokent. Vagyis a modell azt tanulja meg, hogy maximalizálja a következő token valószínűségét az előző tokenek sorozatát ismerve. A tanítás során a következő elem előrejelzési hibáját minimalizálják, ami lehetővé teszi nagy koherenciával és összefüggéssel rendelkező szövegek előállítását.
A szöveggenerálás folyamata a GPT-ben
A GPT-modell a szöveget egymás után, token-ről tokenre generálja, az alábbi iteratív séma szerint:
- Fogadja a bemeneti szöveges sorozatot (prompt, seed text).
- Kiszámítja a szótár összes tokenjére vonatkozó valószínűségi eloszlást a szöveg következő eleme számára.
- Kiválasztja a következő tokent:
- vagy a legmagasabb valószínűség alapján (mohó kiválasztás),
- vagy sztochasztikus mintavételezéssel (sampling),
- vagy speciális szűrési stratégiák alkalmazásával (top-k, top-p).
- Hozzáadja a kiválasztott tokent az aktuális sorozathoz.
- A frissített sorozatot ismét a modell bemenetére adja a következő token előrejelzéséhez.
A transformer architektúrája: szövegfeldolgozás
A transformeren belüli adatfeldolgozási folyamat a következő token előrejelzéséhez több fő lépést foglal magában:
- Tokenizálás (Tokenization). A bemeneti szöveg tokenekre – kis szövegegységekre – bomlik, amelyek lehetnek szavak, szórészek vagy írásjelek. A GPT-3 modellben a szótár például körülbelül 50 257 tokent tartalmaz.
- Token embedding (Embeddings). Minden tokent egy rögzített hosszúságú vektorrá alakítanak az embedding-mátrix (W_E) segítségével. A vektorok kódolják a tokenek jelentését: a szemantikailag közeli tokenek közel helyezkednek el a többdimenziós térben. A GPT-3 modellben az embedding dimenziószáma 12 288.
- Feldolgozás a transformer rétegeiben.
- Figyelmi blokkok (Attention Blocks): Minden token kölcsönhat a sorozat többi tokenjével. A figyelmi mechanizmus lehetővé teszi a kontextus figyelembevételét és a szavak jelentésének helyes értelmezését.
- Teljesen összekötött rétegek (Feed-Forward Layers): A figyelmi lépés után minden tokent külön dolgoz fel egy kétrétegű neurális hálózat nemlineáris aktivációval.
- Inverz transzformáció és Softmax. Az összes réteg után a feldolgozott vektort visszaalakítják a tokenek terébe a (W_U) mátrix segítségével, amely gyakran a W_E transzponáltja. Az eredményül kapott logit-vektort Softmax-függvénnyel normalizálják az összes tokenre vonatkozó valószínűségi eloszlás előállításához.
- A következő token kiválasztása (Sampling). A következő tokent a valószínűségi eloszlás alapján választják ki. A hőmérséklet (temperature) paraméter szabályozza a kiválasztás véletlenszerűségét: 0 hőmérsékletnél a legvalószínűbb tokent választják, magasabb hőmérsékleteken nő a kevésbé valószínű változatok kiválasztásának esélye, ami nagyobb szövegváltozatosságot eredményez.
GPT-modellek
- GPT-1 (2018): a család első modellje; 12 rétegű decoder-only transformer; kétlépéses tanítás (előtanítás + finomhangolás NLP-feladatokon).
- GPT-2 (2019): 1,5 milliárd paraméter; WebText korpuszon tanítva; először képes hosszú, összefüggő szövegek generálására; a zero-shot generálás minőségének javulása. 2019. február 14-én jelentették be, a teljes verzió (1,5 milliárd) biztonsági megfontolásokból 2019. november 5-én jelent meg.
- GPT-3 (2020): 175 milliárd paraméter; nagyszabású tanítás Common Crawl, Books, Wikipedia összesítésén; a few-shot és zero-shot képességek erőteljes fejlődése.
- GPT-3.5 (2022): köztes verzió a GPT-3 és a GPT-4 között; javított utasításkövetés emberi visszajelzésen alapuló megerősítéses tanulással (RLHF) a text-davinci-003 és gpt-3.5-turbo verziókban; kontextusablak korai verziókban 4 096 tokenig, későbbiekben 16 385 tokenig (gpt-3.5-turbo-16k és a frissített gpt-3.5-turbo).
- GPT-4 (2023): multimodális modell szöveges és képi bemenettel (a képtámogatás a szöveges indítás után, később került bevezetésre); kontextusablak 8 192 token az alap verzióban és 32 768 token a GPT-4-32k változatban; jelentős pontosság-, stabilitás- és következtetési logika-javulás.
- GPT-4 Turbo (2023): a GPT-4 optimalizált verziója; megnövelt kontextusablak 128 000 tokenig; alacsonyabb késleltetés és üzemeltetési költség.
- GPT-4o (2024): új generációs multimodális modell (szöveg, kép, hang) egységes neurális hálózati architektúrával; nagyon nagy válaszsebesség és pontosság; kontextusablak 128 000 token.
- GPT-4.5 (2025): kutatási előnézet (research preview); az OpenAI system card jelzi, hogy a modell „builds on GPT-4o\"[2][3]; javított felhasználói kérés-értelmezés, csökkentett hibaarány; kontextusablak 128 000 token. Az API-ban a
gpt-4.5-previewmodellt 2025. április 14-én deprecated-ként jelölték meg, és 2025. július 14-én kapcsolták le.[4] - GPT-4.1 (2025): a GPT-4 család fejlesztett verziója, kontextusablakkal 1 millió tokenig; szöveg és kép fogadható bemenetként, szöveg adható ki kimenetként.[5] Egyszerre három változatban jelent meg: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
- GPT-5 (2025): egységes rendszer gyors válasz- és mélyített gondolkodási módokkal; kontextusablak kb. 400 000 token; a hallucináció mértékének jelentős csökkenése tényszerű feladatokon.
- GPT-5.1 (2025): adaptív reasoning, fejlesztések a coding és long-context retention területén.
- GPT-5.2 (2025): a szakmai munkára helyezett hangsúly; Pro-mód a frontier-feladatokhoz; a GPT-5.2 alapján jelent meg az ágens GPT-5.2-Codex.
- GPT-5.3-Codex (2026): ágens coding-modell, amely egyesíti a coding-képességeket és a reasoningot; 25%-kal gyorsabb az elődjeinél.
- GPT-5.3 Instant (2026): a ChatGPT legtöbbet használt társalgási modelljének frissítése; 2026. március 3-án jelent meg. Javult a tényszerű pontosság, a webes keresés minősége, a párbeszéd gördülékenysége, és csökkent a felesleges elutasítások és túlzott fenntartások száma. Az API-ban
gpt-5.3-chat-latestnéven érhető el.[6] - GPT-5.4 (2026): az OpenAI frontier-modellje professzionális munkához, amelyet 2026. március 5-én mutattak be; az OpenAI első általános célú modellje natív computer-use képességekkel. Az API-ban a
gpt-5.4az általános célú és coding-feladatok széles köréhez ajánlott alapértelmezett modellként.[7][8]
GPT-1
Az első modellt, a GPT-1-et az OpenAI 2018-ban mutatta be a \"Improving Language Understanding by Generative Pre-Training\" című tanulmányban. A modell egy 12 rétegű decoder-only transformer volt[9], és a transformer architektúrára épült. A GPT-1 tanítása két szakaszban zajlott: a felügyelet nélküli generatív előtanítás (pre-training) szakasza, amelyet a felügyelt finomhangolás (fine-tuning) szakasza követett.
Az előtanítási szakaszban a modellt a BookCorpus korpuszon tanították, amely több mint 7 000, különböző műfajú, kiadatlan könyvet tartalmaz. E korpusz jellegzetessége a hosszú, összefüggő szövegrészletek jelenléte volt, ami kritikusan fontos volt ahhoz, hogy a modell képes legyen összetett és kiterjedt szövegfüggőségeket kezelni.
A finomhangolási szakaszban a modellt természetes nyelvi feldolgozás speciális feladataira adaptálták, többek közt:
- Kérdés-megválaszolás (Question Answering, QA) – helyes válasz alkotása adott szöveges kontextus alapján;
- Szöveges következtetés felismerése (Natural Language Inference, NLI) – két szöveg logikai összefüggésének meghatározása: következtetés, ellentmondás vagy semlegesség;
- Szemantikai hasonlóság értékelése (Semantic Textual Similarity) – két szöveges sorozat közötti jelentésbeli közelség fokának mérése.
Ennek köszönhetően a GPT-1 több standard szövegértési benchmark-feladaton is lényegesen felülmúlta a korábbi modelleket.
A GPT-1 fejlesztése számos kulcsfontosságú eredményt és felfedezést hozott a természetes nyelvi feldolgozás (NLP) területén:
- A generatív előtanítás hatékonysága. Empirikusan igazolták, hogy a nagy, jelölés nélküli szövegkorpuszon végzett előtanítás lehetővé teszi a modell számára univerzális nyelvi reprezentációk elsajátítását, amelyek különböző alkalmazási feladatokban hasznosíthatók anélkül, hogy alapvető architektúrális változtatásokra lenne szükség.
- A transformer architektúra sokoldalúsága. A többrétegű dekóderes transformer alkalmazása lehetővé tette a modell számára a szöveg hosszú távú függőségeinek sikeres kezelését, ami korábban a rekurrens neurális hálózaton alapuló modelleknek nehézséget okozott.
- Az adatjelölési függőség csökkentése. A munka megerősítette, hogy a jelöletlen adatokon végzett nagyszabású előtanítás jelentősen csökkentheti a célfeladatokon való jó teljesítményhez szükséges jelölt adatok mennyiségét.
- Az ezt követő fejlesztések alapja. A GPT-1 eredményei lefektették a GPT-modellcsalád (GPT-2, GPT-3 és így tovább) következő verzióinak fogalmi és technikai alapjait.
GPT-2
A GPT-2 modellt az OpenAI 2019. február 14-én jelentette be. Méretében jelentősen felülmúlta elődjét: a modell teljes verziója körülbelül 1,5 milliárd paramétert tartalmazott. Biztonsági megfontolásokból az OpenAI kezdetben csak a modell kisebb változatait tette közzé; a teljes verzió (1,5 milliárd paraméter) 2019. november 5-én jelent meg. A GPT-1-gyel ellentétben, amely a BookCorpus (~5 GB) korpuszon tanult, a GPT-2-t egy kifejezetten összeállított, kb. 40 GB méretű WebText korpuszon tanították, amely magas minőségű internetes szövegforrásokból származó adatokat tartalmaz. Mind a modell méretének, mind a tanítóadatok mennyiségének növekedése lehetővé tette a GPT-2 számára a szöveggenerálás minőségének jelentős javítását: képes volt tartalmas cikkek, elbeszélések és akár összefüggő szépirodalmi részletek létrehozására.
A GPT-2 a GPT-1-hez hasonló autoregresszív dekóderes transformer architektúrát alkalmazott, lényeges változtatások nélkül. A modell 48 önfigyelmi rétegből állt, rejtett állapotának mérete 1600 volt, és körülbelül 1,5 milliárd paramétert tartalmazott. A figyelmi fejek száma 25 volt (megtartva a GPT-1-től örökölt, fejenként 64-es méretet: 1600 ÷ 64 = 25). A tanítás a következő token előrejelzésének feladatán zajlott a korábbi kontextus alapján, maszkolt figyelmi mechanizmus alkalmazásával.
A GPT-2 egyik legfontosabb újdonsága az volt, hogy a modell először mutatott nagy hatékonyságot zero-shot learning módban – vagyis abban a képességben, hogy az adott feladatra vonatkozó explicit finomhangolás nélkül képes új feladatokat megoldani. A modell általános szövegek nagy korpuszán tanult, és nem esett át speciális feladatspecifikus tanításon. Az értékelés zero-shot módban zajlott, amelyben a modell kizárólag az előtanítás során szerzett tudásra támaszkodva hajtotta végre a feladatokat. Egyes nyelvi modellezési feladatokon a GPT-2 hasonló vagy jobb minőséget ért el, mint a speciális adathalmazokon (pl. Wikipédia, hírszövegek, könyvek) kifejezetten betanított modellek.
GPT-3
A GPT-3 modellt az OpenAI 2020 júniusában mutatta be (a cikk az arXiv-on 2020. május 28-án jelent meg, az API béta-hozzáférése 2020. június 11-én nyílt meg). A GPT-2 utáni generatív transformerek fejlesztésének következő lépéseként az architektúra 175 milliárd paraméterre való skálázásával tűnt ki, ami az akkori legnagyobb nyelvi modellé tette.
A GPT-3 architektúrája alapvetően változatlan maradt – többrétegű autoregresszív dekóderes transformer, alapvető változtatások nélkül. A teljesítménybeli javulások elsősorban a rétegek számának, a rejtett rétegek szélességének és a tanítási léptékek növeléséből adódtak. A modellt több nagy szövegkorpusz összesítésén tanították, köztük Common Crawl, WebText2, Books1, Books2 és Wikipédia. Az adatok összesített mennyisége kb. 570 GB és több volt (a 570 GB a szűrt Common Crawl-részre vonatkozik, amely a tanítási keverékben domináns).
A GPT-3 egyik legfőbb jellemzője a few-shot learning és a zero-shot learning képessége volt: a modell természetes nyelvi feldolgozási feladatok széles körét tudta elvégezni – köztük fordítást, összefoglalást, kérdés-megválaszolást, esszéírást és akár programozást – csupán néhány, a szöveges kérésben megadott példa alapján, vagy akár példák nélkül is.
GPT-3.5
A GPT-3.5 modellt az OpenAI 2022 végén mutatta be a GPT-modellcsalád evolúciós fejlesztéseként. A GPT-3-ban alkalmazott skálázott autoregresszív dekóderes transformer architektúrára épült, fejlesztésekkel a szöveggenerálás minőségében, a kontextuskezelésben és a komplex utasítások követésének képességében. A GPT-3.5 paramétereinek pontos számát hivatalosan nem hozták nyilvánosságra; feltételezhetően a davinci-verziók mérete összehasonlítható a GPT-3-éval (175 milliárd), azonban a gpt-3.5-turbo verzió pontos paraméterei ismeretlenek.
A GPT-3.5 tanítása kiterjedten alkalmazta az emberi visszajelzésen alapuló megerősítéses tanulás (Reinforcement Learning from Human Feedback, RLHF) módszereit a text-davinci-003 és gpt-3.5-turbo verziókban. A korábbi text-davinci-002 verzió felügyelt finomhangolással (SFT) tanult, nem RLHF-fel. A modellt bővített szövegkorpuszon tanították, amely Common Crawl-t, könyveket, WebText-et és más, magas minőségű forrásokat tartalmaz. A korai népszerű verziók (gpt-3.5-turbo) kontextusablaka 4 096 token volt; ezt követően az OpenAI frissített verziókat adott ki, amelyek kontextusa 16 385 tokenig terjedt.[10]
A gyakorlatban a GPT-3.5 természetes nyelvi feldolgozási feladatok széles körére volt adaptálva, például:
- Összefüggő és logikus szöveg generálása;
- Kérdés-megválaszolás (QA) és kontextusértés;
- Több lépéses utasítások követése;
- A párbeszédek hosszú távú kontextusának javított kezelése.
A GPT-3.5 alapján több kulcsverziót adtak ki különböző célokra:
- text-davinci-002 – a GPT-3.5-ön alapuló első általánosan elérhető modell, generálásra és utasításkövetésre optimalizálva (SFT-vel tanítva).
- text-davinci-003 – fejlesztett verzió, még nagyobb következtetési és összetett szöveggenerálási képességgel (RLHF-fel tanítva).
- gpt-3.5-turbo – a GPT-3.5 legjobb teljesítményű és leggazdaságosabb verziója, amelyet a ChatGPT szolgáltatásban 2022 végétől alkalmaztak.
GPT-4
A GPT-4 modellt az OpenAI 2023. március 14-én mutatta be a "GPT-4 Technical Report\" című tanulmányban. A nyelvi modellek fejlesztésének következő állomásaként jelentős javulásokat kínált a szövegértés, az értelmes és kreatív válaszok generálása, valamint a multimodális adatok feldolgozása terén. A modell paramétereinek pontos száma és az architektúra részletei hivatalosan nem kerültek nyilvánosságra – a GPT-4 technikai jelentése kifejezetten jelzi, hogy az architektúrára, a modell méretére, a hardverre, a tanítási számítási költségekre és az adatkészletek összeállítására vonatkozó információkat nem teszik közzé.[11] Nem hivatalos külső becslések szerint a GPT-4 a Mixture of Experts (MoE) megközelítést alkalmazhatta, és teljes léptéke kb. ~1,8 billió paraméter lehetett, azonban az OpenAI ezeket a számokat sem hivatalosan nem erősítette meg, sem nem cáfolta.[12]
A GPT-4 multimodális modell, amely szöveg és kép fogadására egyaránt képes. Meg kell jegyezni, hogy a 2023 márciusi kezdeti indításkor csak a szöveges modalitás volt elérhető; a képbevitel támogatása később került bevezetésre. A kontextusablak az alap verzióban 8 192 token, a GPT-4-32k változatban 32 768 token volt. A modell RLHF módszereket (emberi visszajelzésen alapuló megerősítéses tanulás) alkalmazott.
A GPT-4 tanítása nagyszabású szöveges és multimodális korpuszok összesítésén zajlott. A tanítóadatok, a hardver és a módszertan konkrét részleteit az OpenAI hivatalos publikációi nem hozzák nyilvánosságra.
A tanítás több szakaszban zajlott:
- nagyszabású felügyelet nélküli előtanítás szövegeken és képeken,
- felügyelt finomhangolás (supervised fine-tuning) speciális feladatokon,
- záró szakasz: emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) a megbízhatóság, a biztonság és az utasítás-értelmezés minőségének javítása érdekében.
A GPT-4 alapján több fő verzió jelent meg:
- GPT-4 (2023. március): alap verzió szöveges bevitel támogatásával (képtámogatás később hozzáadva); kontextusablak 8 192 token; szintén megjelent a GPT-4-32k változat 32 768 tokenes kontextussal.
- GPT-4 Turbo (2023. november): a GPT-4 optimalizált módosítása, megnövelt, 128 000 tokenes kontextusablakkal[13]; csökkentett számítási költség és gyorsított generálás; függvényhívási (function calling) és JSON-kimenet módok támogatása.
- GPT-4o (2024. május): új generációs multimodális verzió; az indulási bejelentésben omni-modellként pozicionálták, amely valós időben képes szöveggel, képekkel és hanggal dolgozni (a GPT-4 Turboval ellentétben, ahol a különböző modalitásokat külön modulok kezelték); az alap API-modell
gpt-4oszöveg+kép bemenetként és szöveg kimenetként írható le; kontextusablak 128 000 token. - GPT-4.5 (2025. február): kutatási előnézet (research preview); az OpenAI system card-ja kifejezetten jelzi, hogy a modell „builds on GPT-4o\"[3]; javított összetett szöveggenerálás, nagyobb pontosságú utasítás-végrehajtás és csökkentett hallucináció-szint; kontextusablak 128 000 token. Úgy írták le, mint „az OpenAI utolsó chain-of-thought nélküli modellje" (kódneve – Orion).[14] Az API-ban a
gpt-4.5-previewmodellt 2025. április 14-én deprecated-ként jelölték meg, és 2025. július 14-én kapcsolták le.[4] - GPT-4.1 (2025. április): stabil verzió a kontextus gyökeres kiterjesztésével 1 047 576 tokenre; szöveg és kép fogadható bemenetként, szöveg adható ki kimenetként[15]; egyszerre három változatban jelent meg (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); kezdetben csak API-n volt elérhető, majd később a ChatGPT-ben is bevezették.
GPT-5
2025. augusztus 7-én az OpenAI bemutatta a GPT‑5-öt mint akkori „legokosabb, leggyorsabb és leghasznosabb" modelljét, beépített mélyített gondolkodási (thinking) móddal és a gyakorlati forgatókönyvekre – írás, programozás, egészségüggyel kapcsolatos munka és multimodális értelmezés – helyezett hangsúllyal. A GPT‑5 fokozatosan vált a ChatGPT legtöbb bejelentkezett felhasználójának alapértelmezett modelljévé, kiszorítva a korábban használt GPT‑4/4o és o‑sorozatú modelleket.[16]
A GPT‑5 egységes rendszerként valósul meg, két fő működési móddal: gyors, gazdaságos válaszok hétköznapi kérésekhez (hozzávetőlegesen gpt‑5 main) és mélyített gondolkodás összetett feladatokhoz (hozzávetőlegesen gpt‑5 thinking). A mód kiválasztása automatikusan, egy útválasztó segítségével történik, amely figyelembe veszi a párbeszéd típusát, a kérés összetettségét, az eszközök szükségességét és a felhasználó explicit jelzéseit (pl. „think step by step" vagy „analyze in depth"). A ChatGPT-ben a felhasználó számára Auto / Instant / Thinking / Pro módok érhetők el; a mini és nano változatok elsősorban API-modellek, a mini a felhasználói termékben tartalékként (fallback) is használható a limit kimerítése után.[17]
A programozói felületen a GPT‑5 több méret és konfiguráció formájában érhető el; az OpenAI dokumentációja fő változatokként a gpt‑5, gpt‑5‑mini és gpt‑5‑nano variánsokat jelöli meg (mindegyik támogatja a szöveges és vizuális adatokat). A GPT‑5 család API-ban elérhető maximális összesített kontextusablaka kb. 400 000 token (a bemenet és a gondolkodás/kimenet keretei között megosztva), az egyes korlátok azonban eltérhetnek a kiválasztott modellvariánstól és a terméktől függően.[18]
Számos webes keresési és tényszerű benchmark alapján a GPT‑5 a GPT‑4o-hoz és az OpenAI korábbi „thinking"-modelljeihez képest észrevehető hallucináció- és hibacsökkenést mutat. Az OpenAI hivatalos bejelentése körülbelül 45%-os hibacsökkentést idézett a GPT-4o-hoz képest, és körülbelül 80%-osat az o3 thinking-módhoz képest – ezek az eredmények specifikus feltételek mellett, bekapcsolt webes kereséssel, a ChatGPT produkciós forgalmára reprezentatív, anonimizált promptokon születtek.[19]
GPT-5.1
A GPT-5.1 modellt az OpenAI 2025. november 12-én mutatta be, mint az alap GPT-5 utáni első jelentős iterációt, amelyet a mindennapi interakció, a társalgási jelleg és az adaptivitás javítására optimalizáltak. A modell megtartja az egységes rendszert gyors móddal (GPT-5.1 Instant) és mélyített gondolkodással (GPT-5.1 Thinking), de bevezeti az adaptív gondolkodást (adaptive reasoning): a modell dinamikusan határozza meg a kérés összetettségétől függő számítási mennyiséget, ami egyszerű feladatokon észrevehetően gyorsabbá teszi anélkül, hogy a komplex feladatokon rontana a minőségen.
A GPT-5.1 tanítása a GPT-5 alapjaira épül, egy kiegészítő utótanítási szakasszal, amely bővített RLHF-et, a hangnem természetességére fókuszálást és a „hidegség" csökkentését foglalja magában a válaszokban. Az API-ban a kontextusablak 400 000 token, a maximális kimenet 128 000 token.[20] Megjelent a kiterjesztett promptgyorsítótárazás (prompt caching) támogatása 24 órás tárolással, ami lényegesen csökkenti a többlépéses párbeszédek költségét és késleltetését.[21]
Főbb jellemzők:
- GPT-5.1 Instant – az elsődleges mód hétköznapi feladatokhoz; először alkalmaz adaptive reasoningot annak meghatározására, hogy érdemes-e „gondolkodni" egy összetettebb kérés megválaszolása előtt.[21]
- GPT-5.1 Thinking – adaptív időkeret a gondolkodáshoz; az OpenAI adatai szerint a ChatGPT reprezentatív feladateloszlásán a modell a legegyszerűbb feladatokon körülbelül kétszer gyorsabb, a legnehezebbeknél pedig körülbelül kétszer lassabb, mint a GPT-5 Thinking.[21]
- Javított multimodalitás (szöveg + vision).
- Fejlesztett coding- és agentic-forgatókönyvek, valamint egyszerű feladatokon javított hatékonyság az adaptive reasoning és a kiterjesztett promptgyorsítótárazás révén.[22]
GPT-5.2
A GPT-5.2 modellt 2025. december 11-én adták ki, mint „a sorozat legképesebb modelljét professzionális munkához és tanuláshoz". Ez a GPT-5.1 evolúciója, a gazdasági értékre helyezett hangsúllyal: táblázatok, prezentációk, összetett kód és end-to-end feladatok generálása. Megtartja az egységes architektúrát az Instant, Thinking és az új Pro módokkal (a maximális számítási kapacitást és gondolkodási időt igénylő feladatokhoz).
A tanítás 2025 augusztusi tudáshatáridővel rendelkező frissített korpuszt tartalmazott, megerősített instruction tuning-gal és RLHF-fel a többlépéses forgatókönyvek hibáinak csökkentésére. Kontextus – 400K token (128K max kimenet). A modell megbízhatóbbá vált professzionális forgatókönyvekben, jobb tényszerű pontossággal és eszközhasználattal.
A GPT-5.2 alapján 2025. december 18-án jelent meg a speciális GPT-5.2-Codex – egy ágens coding-modell, javított kontextustömörítéssel (context compaction), Windows-támogatással, erősített kiberbiztonság-tudatossággal és long-horizon reasoning képességgel (több óráig tartó feladatok).
2026. február 13-tól, miután számos régi modell kivezetésre került, a GPT-5.2 ideiglenesen az alapértelmezett modellé vált a ChatGPT-ben. Azonban már 2026 március elejére ezt a szerepet a GPT‑5.3 Instant és a GPT‑5.4 vette át.[17]
GPT-5.3-Codex
A GPT-5.3-Codex modellt 2026. február 5-én mutatták be, mint „a mindenkori legerősebb ágens coding-modellt". Ez a GPT-5.2-Codex frontier-coding képességeinek és a GPT-5.2 professzionális reasoning-jának egyesítése egyetlen modellben, amely 25%-kal gyorsabb az elődjeinél.
A modell szinte bármilyen fejlesztői feladatot képes elvégezni: long-running workflows, kutatás, eszközhasználat, kódvégrehajtás, interactive steering (a felhasználó valós időben beavatkozhat kontextusveszteség nélkül). A modell korai verzióit az OpenAI csapata saját tanításának hibakeresésére, telepítésre és kiértékelésre használta.
Főbb eredmények a 2026. február 5-i bejelentés időpontjában: Terminal-Bench ~77,3 %, OSWorld-Verified ~64,7 %, SWE-Bench Pro ~56,8 %. A GPT-5.4 2026. március 5-i, későbbi kiadásában az OpenAI frissített eredményként OSWorld-Verified 74,0 %-ot közölt a GPT-5.3-Codexre vonatkozóan, egy új API-paraméter alkalmazásakor, amely megőrzi a kép eredeti felbontását.[23][7]
2026. február 12-én az OpenAI kiadta a GPT-5.3-Codex-Spark modellt is – egy kompakt, ultra-gyors verziót a Cerebras-szal való partnerségben, valós idejű használatra optimalizálva: több mint 1000 token másodpercenként, csak szöveges, 128K kontextus. A bevezetéskor ez a ChatGPT Pro felhasználók számára volt elérhető a Codexben és kevés API design partner számára, nem pedig széles körben elérhető API-modellként.[24]
GPT-5.4
2026. március 5-én az OpenAI bemutatta a GPT‑5.4-et mint új frontier-modellt professzionális munkához. A GPT‑5.4 egyesíti az OpenAI legújabb kiadásainak erősségeit a reasoning, coding és agentic workflows területén, és az alap sorozatban elsőként kapott beépített computer use képességeket. Ezzel egyidejűleg az OpenAI kiadta a GPT‑5.4 Pro változatot – a legösszetettebb feladatokra, nagyobb számítási kapacitással és hosszabb gondolkodási idővel.[7]
Az API-ban a gpt-5.4 modell az általános célú és coding-feladatok széles köréhez ajánlott alapértelmezett modellként van leírva; a kontextusablak 1 050 000 token, a maximális kimenet 128 000 token. A modell szöveg és kép fogadására képes bemenetként, és szöveget ad ki kimenetként.[8][25]
A ChatGPT-ben az Auto mód 2026. március 7-ei állapot szerint automatikusan vált a GPT‑5.3 Instant és a GPT‑5.4 Thinking között, míg a GPT‑5.4 Pro külön high-capability módként érhető el. A bejelentkezett ChatGPT-felhasználók alapértelmezett modellje a GPT‑5.3.[17]
A GPT-modellek fejlődése
| Generáció | Kiadás éve | Paraméterek száma | Szövegkorpusz mérete | Főbb jellemzők |
|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 millió[26] | ≈5 GB (BooksCorpus) | Generatív előtanítás nagy korpuszon; kétlépéses tanítás (pre-training + fine-tuning) |
| GPT-2 | 2019 | 1,5 milliárd | ≈40 GB (WebText) | Lényegesen javított szöveggenerálás; erős zero-shot viselkedés bemutatása; kezdetben részleges modellkiadás |
| GPT-3 | 2020 | 175 milliárd | ≈570 GB (Common Crawl, WebText2 és mások) | Nagyszabású in-context learning; kifejezett few-shot és zero-shot tanulási képességek finomhangolás nélkül |
| GPT-3.5 | 2022 | Nem hozták nyilvánosságra (davinci-verziók feltételezhetően ~175 milliárd) | >570 GB + kiegészítő korpuszok és instruction tuning | Javított stabilitás és utasításkövetés; a ChatGPT korai verzióinak alapja |
| GPT-4 | 2023 | Nem hozták nyilvánosságra[27] | Nem hozták nyilvánosságra | Multimodalitás (szöveg + képek); javított pontosság és hallucinációval szembeni ellenállás; 8k/32k tokenes kontextus |
| GPT-4 Turbo | 2023 | Nem hozták nyilvánosságra | GPT-4 tanításán alapul (részletek nem nyilvánosak) | Kontextus növelése 128 000 tokenre; sebesség és generálási költség optimalizálása |
| GPT-4o | 2024 | Nem hozták nyilvánosságra | Multimodális adatok (szöveg, képek, hang) | Egységes neurális hálózati multimodális feldolgozás; nagy válaszsebesség |
| GPT-4.5 | 2025 | Nem hozták nyilvánosságra | Bővített szöveges és multimodális korpuszok | GPT-4o alapú research preview; hibacsökkentés; 2026-ra deprecated |
| GPT-4.1 | 2025 | Nem hozták nyilvánosságra | Frissített korpuszok | Kontextus 1 047 576 tokenig; szöveg + képek bemenetként, szöveg kimenetként |
| GPT-5 | 2025 (augusztus) | Nem hozták nyilvánosságra | Nagyszabású multimodális korpuszok | Egységes rendszer gyors válasz- és gondolkodási módokkal; ~400K tokenes kontextus; csökkentett hallucinációk |
| GPT-5.1 | 2025 (november) | Nem hozták nyilvánosságra | Bővített GPT-5 korpuszok + RLHF | Adaptív reasoning; 24h prompt caching; fejlesztések a codingban |
| GPT-5.2 | 2025 (december) | Nem hozták nyilvánosságra | Tudáshatáridő: 2025. augusztus | Pro-mód; professzionális szaktudás-munka; GPT-5.2-Codex (ágens coding) |
| GPT-5.3-Codex | 2026 (február) | Nem hozták nyilvánosságra | Frissített + self-improvement adatok | 25%-kal gyorsabb; teljes spektrumú ágens; interactive steering |
| GPT-5.3-Codex-Spark | 2026 (február) | Nem hozták nyilvánosságra | Kompakt | >1000 t/s Cerebras-on; valós idejű coding; 128K kontextus |
| GPT-5.3 Instant | 2026 (március) | Nem hozták nyilvánosságra | Nem hozták nyilvánosságra | A ChatGPT legtöbbet használt társalgási modelljének frissítése; javult a tényszerű pontosság, a webes keresés és a párbeszéd gördülékenysége |
| GPT-5.4 | 2026 (március) | Nem hozták nyilvánosságra | Nem hozták nyilvánosságra | Új frontier-modell professzionális munkához; natív computer use; API alapértelmezett modellje általános célú és legtöbb coding-feladathoz |
| GPT-5.4 Pro | 2026 (március) | Nem hozták nyilvánosságra | Nem hozták nyilvánosságra | GPT-5.4 változat nagyobb számítási kapacitással a legösszetettebb feladatokhoz |
A GPT-modellek architektúrális paraméterei
| Modell | Kiadás éve | Paraméterek száma | Rétegek száma | Rejtett állapot mérete | Figyelmi fejek száma | Kontextusablak | Tanítókorpusz mérete |
|---|---|---|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 millió | 12 | 768 | 12 | 512 token | ≈5 GB (BooksCorpus) |
| GPT-2 | 2019 | 1,5 milliárd | 48 | 1 600 | 25 | 1 024 token | ≈40 GB (WebText) |
| GPT-3 | 2020 | 175 milliárd | 96 | 12 288 | 96 | 2 048 token | ≈570 GB (Common Crawl + WebText2 + egyéb) |
| GPT-3.5 | 2022 | Nem hozták nyilvánosságra (davinci-verziók feltételezhetően ~175 milliárd) | (becsülten közel a GPT-3-hoz) | (becsülten közel a GPT-3-hoz) | (nem hozták nyilvánosságra) | Legfeljebb 4 096 token (korai); legfeljebb 16 385 token (késői) | Bővített Common Crawl + kiegészítő adatkészletek és instruction tuning |
| GPT-4 | 2023 | Nem hozták nyilvánosságra | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | 8 192 token (alap); 32 768 (GPT-4-32k) | Nem hozták nyilvánosságra |
| GPT-4 Turbo | 2023 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | Legfeljebb 128 000 token | A GPT-4 optimalizált verziója (a korpusz részletei nem nyilvánosak) |
| GPT-4o | 2024 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | Legfeljebb 128 000 token | Multimodális adatok: szöveg, képek, hang |
| GPT-4.5 | 2025 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | Legfeljebb 128 000 token | Frissített szöveges és multimodális korpuszok |
| GPT-4.1 | 2025 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | Legfeljebb 1 047 576 token | Multimodalitás; skálázott tanítás hosszú kontextusokra összpontosítva |
| GPT-5 | 2025 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | Legfeljebb ≈400 000 token (összesített kontextus) | Nagyszabású multimodális korpuszok (részletek nem nyilvánosak) |
| GPT-5.4 | 2026 | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | (nem hozták nyilvánosságra) | 1 050 000 token; 128 000 max kimenet | Nem hozták nyilvánosságra |
Hivatkozások
- „Improving language understanding with unsupervised learning", OpenAI, 2018. június 11.
- „Better language models and their implications", OpenAI, 2019. február 14.
- „GPT-2: 6-month follow-up", OpenAI, 2019. augusztus 20.
- „GPT-2: 1.5B release", OpenAI, 2019. november 5.
- „Language models are few-shot learners", OpenAI, 2020. május 28.
- „OpenAI API", OpenAI, 2020. június 11.
- „Introducing ChatGPT", OpenAI, 2022. november 30.
- „Function calling and other API updates", OpenAI, 2023. június 13.
- „GPT-4", OpenAI, 2023. március 14.
- „New models and developer products announced at DevDay", OpenAI, 2023. november 6.
- „Hello GPT-4o", OpenAI, 2024. május 13.
- „Introducing GPT-4.1 in the API", OpenAI, 2025. április 14.
- „Introducing GPT-4.5", OpenAI, 2025. február 27.
- „Introducing GPT-5", OpenAI, 2025. augusztus 7.
- „GPT-5.1: A smarter, more conversational ChatGPT", OpenAI, 2025. november 12.
- „Introducing GPT-5.2", OpenAI, 2025. december 11.
- „Introducing GPT-5.2-Codex", OpenAI, 2025. december 18.
- „Introducing GPT-5.3-Codex", OpenAI, 2026. február 5.
- „Introducing GPT-5.3-Codex-Spark", OpenAI, 2026. február 12.
- „GPT-5.3 Instant: Smoother, more useful everyday conversations", OpenAI, 2026. március 3.
- „Introducing GPT-5.4", OpenAI, 2026. március 5.
- „Using GPT-5.4", OpenAI Developers
- „Models", OpenAI API
- „Deprecations", OpenAI API
- „GPT-5.3 and GPT-5.4 in ChatGPT", OpenAI Help Center
- „Retiring GPT-4o and other ChatGPT models", OpenAI Help Center
Megjegyzések
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
- ↑ OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
- ↑ 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
- ↑ 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
- ↑ 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
- ↑ 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
- ↑ OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
- ↑ Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
- ↑ Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
- ↑ Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025).
- ↑ 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
- ↑ OpenAI API documentation. Models: GPT-5.
- ↑ OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
- ↑ OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
- ↑ 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
- ↑ OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
- ↑ OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
- ↑ OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
- ↑ OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
- ↑ Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
- ↑ По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.
Irodalom
- Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.