GPT (OpenAI) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT (Generative Pre-trained Transformer) — a nagy nyelvi modellek (LLM) egy családja, amelyet az OpenAI fejlesztett ki. A GPT-modellek a transformer architektúrára épülnek, és a generatív előtanítás paradigmáját valósítják meg: az első szakaszban a modell explicit jelölés nélküli, kiterjedt szövegkorpuszon tanul, majd konkrét feladatokra finomhangolható. A késői generációkhoz (GPT‑5-től kezdve) az OpenAI az egységes rendszer (unified system) megjelölést is alkalmazza, mivel a termék egy gyors válaszmódot, egy mélyített gondolkodási (reasoning) módot és egy útválasztót egyesít.[1]

Elnevezés

A GPT rövidítés feloldása: Generative Pre-trained Transformer (Generatív Előzetesen Betanított Transformer).

  • Generatív (Generative): azt jelenti, hogy a modell képes új tartalmat – például szöveget – létrehozni (generálni).
  • Előzetesen betanított (Pre-trained): arra utal, hogy a modell egy kiterjedt kezdeti tanítási szakaszon megy át nagy adatmennyiségen (például internetes szövegeken). Az előzetes tanítás után a modell általában tovább „finomhangolható" (fine-tuned) specifikusabb feladatok elvégzésére.
  • Transformer: egy konkrét neurális hálózati architektúra neve, amely a GPT és számos más modern AI-modell alapját képező kulcsinnováció.

A GPT legfőbb sajátossága, hogy a tanítás autoregresszív formában történik – a modell a korábbi kontextus alapján jósolja meg a következő tokent. Vagyis a modell azt tanulja meg, hogy maximalizálja a következő token valószínűségét az előző tokenek sorozatát ismerve. A tanítás során a következő elem előrejelzési hibáját minimalizálják, ami lehetővé teszi nagy koherenciával és összefüggéssel rendelkező szövegek előállítását.

A szöveggenerálás folyamata a GPT-ben

A GPT-modell a szöveget egymás után, token-ről tokenre generálja, az alábbi iteratív séma szerint:

  • Fogadja a bemeneti szöveges sorozatot (prompt, seed text).
  • Kiszámítja a szótár összes tokenjére vonatkozó valószínűségi eloszlást a szöveg következő eleme számára.
  • Kiválasztja a következő tokent:
    • vagy a legmagasabb valószínűség alapján (mohó kiválasztás),
    • vagy sztochasztikus mintavételezéssel (sampling),
    • vagy speciális szűrési stratégiák alkalmazásával (top-k, top-p).
  • Hozzáadja a kiválasztott tokent az aktuális sorozathoz.
  • A frissített sorozatot ismét a modell bemenetére adja a következő token előrejelzéséhez.

A transformer architektúrája: szövegfeldolgozás

A transformeren belüli adatfeldolgozási folyamat a következő token előrejelzéséhez több fő lépést foglal magában:

  • Tokenizálás (Tokenization). A bemeneti szöveg tokenekre – kis szövegegységekre – bomlik, amelyek lehetnek szavak, szórészek vagy írásjelek. A GPT-3 modellben a szótár például körülbelül 50 257 tokent tartalmaz.
  • Token embedding (Embeddings). Minden tokent egy rögzített hosszúságú vektorrá alakítanak az embedding-mátrix (W_E) segítségével. A vektorok kódolják a tokenek jelentését: a szemantikailag közeli tokenek közel helyezkednek el a többdimenziós térben. A GPT-3 modellben az embedding dimenziószáma 12 288.
  • Feldolgozás a transformer rétegeiben.
    • Figyelmi blokkok (Attention Blocks): Minden token kölcsönhat a sorozat többi tokenjével. A figyelmi mechanizmus lehetővé teszi a kontextus figyelembevételét és a szavak jelentésének helyes értelmezését.
    • Teljesen összekötött rétegek (Feed-Forward Layers): A figyelmi lépés után minden tokent külön dolgoz fel egy kétrétegű neurális hálózat nemlineáris aktivációval.
  • Inverz transzformáció és Softmax. Az összes réteg után a feldolgozott vektort visszaalakítják a tokenek terébe a (W_U) mátrix segítségével, amely gyakran a W_E transzponáltja. Az eredményül kapott logit-vektort Softmax-függvénnyel normalizálják az összes tokenre vonatkozó valószínűségi eloszlás előállításához.
  • A következő token kiválasztása (Sampling). A következő tokent a valószínűségi eloszlás alapján választják ki. A hőmérséklet (temperature) paraméter szabályozza a kiválasztás véletlenszerűségét: 0 hőmérsékletnél a legvalószínűbb tokent választják, magasabb hőmérsékleteken nő a kevésbé valószínű változatok kiválasztásának esélye, ami nagyobb szövegváltozatosságot eredményez.

GPT-modellek

  • GPT-1 (2018): a család első modellje; 12 rétegű decoder-only transformer; kétlépéses tanítás (előtanítás + finomhangolás NLP-feladatokon).
  • GPT-2 (2019): 1,5 milliárd paraméter; WebText korpuszon tanítva; először képes hosszú, összefüggő szövegek generálására; a zero-shot generálás minőségének javulása. 2019. február 14-én jelentették be, a teljes verzió (1,5 milliárd) biztonsági megfontolásokból 2019. november 5-én jelent meg.
  • GPT-3 (2020): 175 milliárd paraméter; nagyszabású tanítás Common Crawl, Books, Wikipedia összesítésén; a few-shot és zero-shot képességek erőteljes fejlődése.
  • GPT-3.5 (2022): köztes verzió a GPT-3 és a GPT-4 között; javított utasításkövetés emberi visszajelzésen alapuló megerősítéses tanulással (RLHF) a text-davinci-003 és gpt-3.5-turbo verziókban; kontextusablak korai verziókban 4 096 tokenig, későbbiekben 16 385 tokenig (gpt-3.5-turbo-16k és a frissített gpt-3.5-turbo).
  • GPT-4 (2023): multimodális modell szöveges és képi bemenettel (a képtámogatás a szöveges indítás után, később került bevezetésre); kontextusablak 8 192 token az alap verzióban és 32 768 token a GPT-4-32k változatban; jelentős pontosság-, stabilitás- és következtetési logika-javulás.
  • GPT-4 Turbo (2023): a GPT-4 optimalizált verziója; megnövelt kontextusablak 128 000 tokenig; alacsonyabb késleltetés és üzemeltetési költség.
  • GPT-4o (2024): új generációs multimodális modell (szöveg, kép, hang) egységes neurális hálózati architektúrával; nagyon nagy válaszsebesség és pontosság; kontextusablak 128 000 token.
  • GPT-4.5 (2025): kutatási előnézet (research preview); az OpenAI system card jelzi, hogy a modell „builds on GPT-4o\"[2][3]; javított felhasználói kérés-értelmezés, csökkentett hibaarány; kontextusablak 128 000 token. Az API-ban a gpt-4.5-preview modellt 2025. április 14-én deprecated-ként jelölték meg, és 2025. július 14-én kapcsolták le.[4]
  • GPT-4.1 (2025): a GPT-4 család fejlesztett verziója, kontextusablakkal 1 millió tokenig; szöveg és kép fogadható bemenetként, szöveg adható ki kimenetként.[5] Egyszerre három változatban jelent meg: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
  • GPT-5 (2025): egységes rendszer gyors válasz- és mélyített gondolkodási módokkal; kontextusablak kb. 400 000 token; a hallucináció mértékének jelentős csökkenése tényszerű feladatokon.
  • GPT-5.1 (2025): adaptív reasoning, fejlesztések a coding és long-context retention területén.
  • GPT-5.2 (2025): a szakmai munkára helyezett hangsúly; Pro-mód a frontier-feladatokhoz; a GPT-5.2 alapján jelent meg az ágens GPT-5.2-Codex.
  • GPT-5.3-Codex (2026): ágens coding-modell, amely egyesíti a coding-képességeket és a reasoningot; 25%-kal gyorsabb az elődjeinél.
  • GPT-5.3 Instant (2026): a ChatGPT legtöbbet használt társalgási modelljének frissítése; 2026. március 3-án jelent meg. Javult a tényszerű pontosság, a webes keresés minősége, a párbeszéd gördülékenysége, és csökkent a felesleges elutasítások és túlzott fenntartások száma. Az API-ban gpt-5.3-chat-latest néven érhető el.[6]
  • GPT-5.4 (2026): az OpenAI frontier-modellje professzionális munkához, amelyet 2026. március 5-én mutattak be; az OpenAI első általános célú modellje natív computer-use képességekkel. Az API-ban a gpt-5.4 az általános célú és coding-feladatok széles köréhez ajánlott alapértelmezett modellként.[7][8]

GPT-1

Az első modellt, a GPT-1-et az OpenAI 2018-ban mutatta be a \"Improving Language Understanding by Generative Pre-Training\" című tanulmányban. A modell egy 12 rétegű decoder-only transformer volt[9], és a transformer architektúrára épült. A GPT-1 tanítása két szakaszban zajlott: a felügyelet nélküli generatív előtanítás (pre-training) szakasza, amelyet a felügyelt finomhangolás (fine-tuning) szakasza követett.

Az előtanítási szakaszban a modellt a BookCorpus korpuszon tanították, amely több mint 7 000, különböző műfajú, kiadatlan könyvet tartalmaz. E korpusz jellegzetessége a hosszú, összefüggő szövegrészletek jelenléte volt, ami kritikusan fontos volt ahhoz, hogy a modell képes legyen összetett és kiterjedt szövegfüggőségeket kezelni.

A finomhangolási szakaszban a modellt természetes nyelvi feldolgozás speciális feladataira adaptálták, többek közt:

  • Kérdés-megválaszolás (Question Answering, QA) – helyes válasz alkotása adott szöveges kontextus alapján;
  • Szöveges következtetés felismerése (Natural Language Inference, NLI) – két szöveg logikai összefüggésének meghatározása: következtetés, ellentmondás vagy semlegesség;
  • Szemantikai hasonlóság értékelése (Semantic Textual Similarity) – két szöveges sorozat közötti jelentésbeli közelség fokának mérése.

Ennek köszönhetően a GPT-1 több standard szövegértési benchmark-feladaton is lényegesen felülmúlta a korábbi modelleket.

A GPT-1 fejlesztése számos kulcsfontosságú eredményt és felfedezést hozott a természetes nyelvi feldolgozás (NLP) területén:

  • A generatív előtanítás hatékonysága. Empirikusan igazolták, hogy a nagy, jelölés nélküli szövegkorpuszon végzett előtanítás lehetővé teszi a modell számára univerzális nyelvi reprezentációk elsajátítását, amelyek különböző alkalmazási feladatokban hasznosíthatók anélkül, hogy alapvető architektúrális változtatásokra lenne szükség.
  • A transformer architektúra sokoldalúsága. A többrétegű dekóderes transformer alkalmazása lehetővé tette a modell számára a szöveg hosszú távú függőségeinek sikeres kezelését, ami korábban a rekurrens neurális hálózaton alapuló modelleknek nehézséget okozott.
  • Az adatjelölési függőség csökkentése. A munka megerősítette, hogy a jelöletlen adatokon végzett nagyszabású előtanítás jelentősen csökkentheti a célfeladatokon való jó teljesítményhez szükséges jelölt adatok mennyiségét.
  • Az ezt követő fejlesztések alapja. A GPT-1 eredményei lefektették a GPT-modellcsalád (GPT-2, GPT-3 és így tovább) következő verzióinak fogalmi és technikai alapjait.

GPT-2

A GPT-2 modellt az OpenAI 2019. február 14-én jelentette be. Méretében jelentősen felülmúlta elődjét: a modell teljes verziója körülbelül 1,5 milliárd paramétert tartalmazott. Biztonsági megfontolásokból az OpenAI kezdetben csak a modell kisebb változatait tette közzé; a teljes verzió (1,5 milliárd paraméter) 2019. november 5-én jelent meg. A GPT-1-gyel ellentétben, amely a BookCorpus (~5 GB) korpuszon tanult, a GPT-2-t egy kifejezetten összeállított, kb. 40 GB méretű WebText korpuszon tanították, amely magas minőségű internetes szövegforrásokból származó adatokat tartalmaz. Mind a modell méretének, mind a tanítóadatok mennyiségének növekedése lehetővé tette a GPT-2 számára a szöveggenerálás minőségének jelentős javítását: képes volt tartalmas cikkek, elbeszélések és akár összefüggő szépirodalmi részletek létrehozására.

A GPT-2 a GPT-1-hez hasonló autoregresszív dekóderes transformer architektúrát alkalmazott, lényeges változtatások nélkül. A modell 48 önfigyelmi rétegből állt, rejtett állapotának mérete 1600 volt, és körülbelül 1,5 milliárd paramétert tartalmazott. A figyelmi fejek száma 25 volt (megtartva a GPT-1-től örökölt, fejenként 64-es méretet: 1600 ÷ 64 = 25). A tanítás a következő token előrejelzésének feladatán zajlott a korábbi kontextus alapján, maszkolt figyelmi mechanizmus alkalmazásával.

A GPT-2 egyik legfontosabb újdonsága az volt, hogy a modell először mutatott nagy hatékonyságot zero-shot learning módban – vagyis abban a képességben, hogy az adott feladatra vonatkozó explicit finomhangolás nélkül képes új feladatokat megoldani. A modell általános szövegek nagy korpuszán tanult, és nem esett át speciális feladatspecifikus tanításon. Az értékelés zero-shot módban zajlott, amelyben a modell kizárólag az előtanítás során szerzett tudásra támaszkodva hajtotta végre a feladatokat. Egyes nyelvi modellezési feladatokon a GPT-2 hasonló vagy jobb minőséget ért el, mint a speciális adathalmazokon (pl. Wikipédia, hírszövegek, könyvek) kifejezetten betanított modellek.

GPT-3

A GPT-3 modellt az OpenAI 2020 júniusában mutatta be (a cikk az arXiv-on 2020. május 28-án jelent meg, az API béta-hozzáférése 2020. június 11-én nyílt meg). A GPT-2 utáni generatív transformerek fejlesztésének következő lépéseként az architektúra 175 milliárd paraméterre való skálázásával tűnt ki, ami az akkori legnagyobb nyelvi modellé tette.

A GPT-3 architektúrája alapvetően változatlan maradt – többrétegű autoregresszív dekóderes transformer, alapvető változtatások nélkül. A teljesítménybeli javulások elsősorban a rétegek számának, a rejtett rétegek szélességének és a tanítási léptékek növeléséből adódtak. A modellt több nagy szövegkorpusz összesítésén tanították, köztük Common Crawl, WebText2, Books1, Books2 és Wikipédia. Az adatok összesített mennyisége kb. 570 GB és több volt (a 570 GB a szűrt Common Crawl-részre vonatkozik, amely a tanítási keverékben domináns).

A GPT-3 egyik legfőbb jellemzője a few-shot learning és a zero-shot learning képessége volt: a modell természetes nyelvi feldolgozási feladatok széles körét tudta elvégezni – köztük fordítást, összefoglalást, kérdés-megválaszolást, esszéírást és akár programozást – csupán néhány, a szöveges kérésben megadott példa alapján, vagy akár példák nélkül is.

GPT-3.5

A GPT-3.5 modellt az OpenAI 2022 végén mutatta be a GPT-modellcsalád evolúciós fejlesztéseként. A GPT-3-ban alkalmazott skálázott autoregresszív dekóderes transformer architektúrára épült, fejlesztésekkel a szöveggenerálás minőségében, a kontextuskezelésben és a komplex utasítások követésének képességében. A GPT-3.5 paramétereinek pontos számát hivatalosan nem hozták nyilvánosságra; feltételezhetően a davinci-verziók mérete összehasonlítható a GPT-3-éval (175 milliárd), azonban a gpt-3.5-turbo verzió pontos paraméterei ismeretlenek.

A GPT-3.5 tanítása kiterjedten alkalmazta az emberi visszajelzésen alapuló megerősítéses tanulás (Reinforcement Learning from Human Feedback, RLHF) módszereit a text-davinci-003 és gpt-3.5-turbo verziókban. A korábbi text-davinci-002 verzió felügyelt finomhangolással (SFT) tanult, nem RLHF-fel. A modellt bővített szövegkorpuszon tanították, amely Common Crawl-t, könyveket, WebText-et és más, magas minőségű forrásokat tartalmaz. A korai népszerű verziók (gpt-3.5-turbo) kontextusablaka 4 096 token volt; ezt követően az OpenAI frissített verziókat adott ki, amelyek kontextusa 16 385 tokenig terjedt.[10]

A gyakorlatban a GPT-3.5 természetes nyelvi feldolgozási feladatok széles körére volt adaptálva, például:

  • Összefüggő és logikus szöveg generálása;
  • Kérdés-megválaszolás (QA) és kontextusértés;
  • Több lépéses utasítások követése;
  • A párbeszédek hosszú távú kontextusának javított kezelése.

A GPT-3.5 alapján több kulcsverziót adtak ki különböző célokra:

  • text-davinci-002 – a GPT-3.5-ön alapuló első általánosan elérhető modell, generálásra és utasításkövetésre optimalizálva (SFT-vel tanítva).
  • text-davinci-003 – fejlesztett verzió, még nagyobb következtetési és összetett szöveggenerálási képességgel (RLHF-fel tanítva).
  • gpt-3.5-turbo – a GPT-3.5 legjobb teljesítményű és leggazdaságosabb verziója, amelyet a ChatGPT szolgáltatásban 2022 végétől alkalmaztak.

GPT-4

A GPT-4 modellt az OpenAI 2023. március 14-én mutatta be a "GPT-4 Technical Report\" című tanulmányban. A nyelvi modellek fejlesztésének következő állomásaként jelentős javulásokat kínált a szövegértés, az értelmes és kreatív válaszok generálása, valamint a multimodális adatok feldolgozása terén. A modell paramétereinek pontos száma és az architektúra részletei hivatalosan nem kerültek nyilvánosságra – a GPT-4 technikai jelentése kifejezetten jelzi, hogy az architektúrára, a modell méretére, a hardverre, a tanítási számítási költségekre és az adatkészletek összeállítására vonatkozó információkat nem teszik közzé.[11] Nem hivatalos külső becslések szerint a GPT-4 a Mixture of Experts (MoE) megközelítést alkalmazhatta, és teljes léptéke kb. ~1,8 billió paraméter lehetett, azonban az OpenAI ezeket a számokat sem hivatalosan nem erősítette meg, sem nem cáfolta.[12]

A GPT-4 multimodális modell, amely szöveg és kép fogadására egyaránt képes. Meg kell jegyezni, hogy a 2023 márciusi kezdeti indításkor csak a szöveges modalitás volt elérhető; a képbevitel támogatása később került bevezetésre. A kontextusablak az alap verzióban 8 192 token, a GPT-4-32k változatban 32 768 token volt. A modell RLHF módszereket (emberi visszajelzésen alapuló megerősítéses tanulás) alkalmazott.

A GPT-4 tanítása nagyszabású szöveges és multimodális korpuszok összesítésén zajlott. A tanítóadatok, a hardver és a módszertan konkrét részleteit az OpenAI hivatalos publikációi nem hozzák nyilvánosságra.

A tanítás több szakaszban zajlott:

  • nagyszabású felügyelet nélküli előtanítás szövegeken és képeken,
  • felügyelt finomhangolás (supervised fine-tuning) speciális feladatokon,
  • záró szakasz: emberi visszajelzésen alapuló megerősítéses tanulás (RLHF) a megbízhatóság, a biztonság és az utasítás-értelmezés minőségének javítása érdekében.

A GPT-4 alapján több fő verzió jelent meg:

  • GPT-4 (2023. március): alap verzió szöveges bevitel támogatásával (képtámogatás később hozzáadva); kontextusablak 8 192 token; szintén megjelent a GPT-4-32k változat 32 768 tokenes kontextussal.
  • GPT-4 Turbo (2023. november): a GPT-4 optimalizált módosítása, megnövelt, 128 000 tokenes kontextusablakkal[13]; csökkentett számítási költség és gyorsított generálás; függvényhívási (function calling) és JSON-kimenet módok támogatása.
  • GPT-4o (2024. május): új generációs multimodális verzió; az indulási bejelentésben omni-modellként pozicionálták, amely valós időben képes szöveggel, képekkel és hanggal dolgozni (a GPT-4 Turboval ellentétben, ahol a különböző modalitásokat külön modulok kezelték); az alap API-modell gpt-4o szöveg+kép bemenetként és szöveg kimenetként írható le; kontextusablak 128 000 token.
  • GPT-4.5 (2025. február): kutatási előnézet (research preview); az OpenAI system card-ja kifejezetten jelzi, hogy a modell „builds on GPT-4o\"[3]; javított összetett szöveggenerálás, nagyobb pontosságú utasítás-végrehajtás és csökkentett hallucináció-szint; kontextusablak 128 000 token. Úgy írták le, mint „az OpenAI utolsó chain-of-thought nélküli modellje" (kódneve – Orion).[14] Az API-ban a gpt-4.5-preview modellt 2025. április 14-én deprecated-ként jelölték meg, és 2025. július 14-én kapcsolták le.[4]
  • GPT-4.1 (2025. április): stabil verzió a kontextus gyökeres kiterjesztésével 1 047 576 tokenre; szöveg és kép fogadható bemenetként, szöveg adható ki kimenetként[15]; egyszerre három változatban jelent meg (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); kezdetben csak API-n volt elérhető, majd később a ChatGPT-ben is bevezették.

GPT-5

2025. augusztus 7-én az OpenAI bemutatta a GPT‑5-öt mint akkori „legokosabb, leggyorsabb és leghasznosabb" modelljét, beépített mélyített gondolkodási (thinking) móddal és a gyakorlati forgatókönyvekre – írás, programozás, egészségüggyel kapcsolatos munka és multimodális értelmezés – helyezett hangsúllyal. A GPT‑5 fokozatosan vált a ChatGPT legtöbb bejelentkezett felhasználójának alapértelmezett modelljévé, kiszorítva a korábban használt GPT‑4/4o és o‑sorozatú modelleket.[16]

A GPT‑5 egységes rendszerként valósul meg, két fő működési móddal: gyors, gazdaságos válaszok hétköznapi kérésekhez (hozzávetőlegesen gpt‑5 main) és mélyített gondolkodás összetett feladatokhoz (hozzávetőlegesen gpt‑5 thinking). A mód kiválasztása automatikusan, egy útválasztó segítségével történik, amely figyelembe veszi a párbeszéd típusát, a kérés összetettségét, az eszközök szükségességét és a felhasználó explicit jelzéseit (pl. „think step by step" vagy „analyze in depth"). A ChatGPT-ben a felhasználó számára Auto / Instant / Thinking / Pro módok érhetők el; a mini és nano változatok elsősorban API-modellek, a mini a felhasználói termékben tartalékként (fallback) is használható a limit kimerítése után.[17]

A programozói felületen a GPT‑5 több méret és konfiguráció formájában érhető el; az OpenAI dokumentációja fő változatokként a gpt‑5, gpt‑5‑mini és gpt‑5‑nano variánsokat jelöli meg (mindegyik támogatja a szöveges és vizuális adatokat). A GPT‑5 család API-ban elérhető maximális összesített kontextusablaka kb. 400 000 token (a bemenet és a gondolkodás/kimenet keretei között megosztva), az egyes korlátok azonban eltérhetnek a kiválasztott modellvariánstól és a terméktől függően.[18]

Számos webes keresési és tényszerű benchmark alapján a GPT‑5 a GPT‑4o-hoz és az OpenAI korábbi „thinking"-modelljeihez képest észrevehető hallucináció- és hibacsökkenést mutat. Az OpenAI hivatalos bejelentése körülbelül 45%-os hibacsökkentést idézett a GPT-4o-hoz képest, és körülbelül 80%-osat az o3 thinking-módhoz képest – ezek az eredmények specifikus feltételek mellett, bekapcsolt webes kereséssel, a ChatGPT produkciós forgalmára reprezentatív, anonimizált promptokon születtek.[19]

GPT-5.1

A GPT-5.1 modellt az OpenAI 2025. november 12-én mutatta be, mint az alap GPT-5 utáni első jelentős iterációt, amelyet a mindennapi interakció, a társalgási jelleg és az adaptivitás javítására optimalizáltak. A modell megtartja az egységes rendszert gyors móddal (GPT-5.1 Instant) és mélyített gondolkodással (GPT-5.1 Thinking), de bevezeti az adaptív gondolkodást (adaptive reasoning): a modell dinamikusan határozza meg a kérés összetettségétől függő számítási mennyiséget, ami egyszerű feladatokon észrevehetően gyorsabbá teszi anélkül, hogy a komplex feladatokon rontana a minőségen.

A GPT-5.1 tanítása a GPT-5 alapjaira épül, egy kiegészítő utótanítási szakasszal, amely bővített RLHF-et, a hangnem természetességére fókuszálást és a „hidegség" csökkentését foglalja magában a válaszokban. Az API-ban a kontextusablak 400 000 token, a maximális kimenet 128 000 token.[20] Megjelent a kiterjesztett promptgyorsítótárazás (prompt caching) támogatása 24 órás tárolással, ami lényegesen csökkenti a többlépéses párbeszédek költségét és késleltetését.[21]

Főbb jellemzők:

  • GPT-5.1 Instant – az elsődleges mód hétköznapi feladatokhoz; először alkalmaz adaptive reasoningot annak meghatározására, hogy érdemes-e „gondolkodni" egy összetettebb kérés megválaszolása előtt.[21]
  • GPT-5.1 Thinking – adaptív időkeret a gondolkodáshoz; az OpenAI adatai szerint a ChatGPT reprezentatív feladateloszlásán a modell a legegyszerűbb feladatokon körülbelül kétszer gyorsabb, a legnehezebbeknél pedig körülbelül kétszer lassabb, mint a GPT-5 Thinking.[21]
  • Javított multimodalitás (szöveg + vision).
  • Fejlesztett coding- és agentic-forgatókönyvek, valamint egyszerű feladatokon javított hatékonyság az adaptive reasoning és a kiterjesztett promptgyorsítótárazás révén.[22]

GPT-5.2

A GPT-5.2 modellt 2025. december 11-én adták ki, mint „a sorozat legképesebb modelljét professzionális munkához és tanuláshoz". Ez a GPT-5.1 evolúciója, a gazdasági értékre helyezett hangsúllyal: táblázatok, prezentációk, összetett kód és end-to-end feladatok generálása. Megtartja az egységes architektúrát az Instant, Thinking és az új Pro módokkal (a maximális számítási kapacitást és gondolkodási időt igénylő feladatokhoz).

A tanítás 2025 augusztusi tudáshatáridővel rendelkező frissített korpuszt tartalmazott, megerősített instruction tuning-gal és RLHF-fel a többlépéses forgatókönyvek hibáinak csökkentésére. Kontextus – 400K token (128K max kimenet). A modell megbízhatóbbá vált professzionális forgatókönyvekben, jobb tényszerű pontossággal és eszközhasználattal.

A GPT-5.2 alapján 2025. december 18-án jelent meg a speciális GPT-5.2-Codex – egy ágens coding-modell, javított kontextustömörítéssel (context compaction), Windows-támogatással, erősített kiberbiztonság-tudatossággal és long-horizon reasoning képességgel (több óráig tartó feladatok).

2026. február 13-tól, miután számos régi modell kivezetésre került, a GPT-5.2 ideiglenesen az alapértelmezett modellé vált a ChatGPT-ben. Azonban már 2026 március elejére ezt a szerepet a GPT‑5.3 Instant és a GPT‑5.4 vette át.[17]

GPT-5.3-Codex

A GPT-5.3-Codex modellt 2026. február 5-én mutatták be, mint „a mindenkori legerősebb ágens coding-modellt". Ez a GPT-5.2-Codex frontier-coding képességeinek és a GPT-5.2 professzionális reasoning-jának egyesítése egyetlen modellben, amely 25%-kal gyorsabb az elődjeinél.

A modell szinte bármilyen fejlesztői feladatot képes elvégezni: long-running workflows, kutatás, eszközhasználat, kódvégrehajtás, interactive steering (a felhasználó valós időben beavatkozhat kontextusveszteség nélkül). A modell korai verzióit az OpenAI csapata saját tanításának hibakeresésére, telepítésre és kiértékelésre használta.

Főbb eredmények a 2026. február 5-i bejelentés időpontjában: Terminal-Bench ~77,3 %, OSWorld-Verified ~64,7 %, SWE-Bench Pro ~56,8 %. A GPT-5.4 2026. március 5-i, későbbi kiadásában az OpenAI frissített eredményként OSWorld-Verified 74,0 %-ot közölt a GPT-5.3-Codexre vonatkozóan, egy új API-paraméter alkalmazásakor, amely megőrzi a kép eredeti felbontását.[23][7]

2026. február 12-én az OpenAI kiadta a GPT-5.3-Codex-Spark modellt is – egy kompakt, ultra-gyors verziót a Cerebras-szal való partnerségben, valós idejű használatra optimalizálva: több mint 1000 token másodpercenként, csak szöveges, 128K kontextus. A bevezetéskor ez a ChatGPT Pro felhasználók számára volt elérhető a Codexben és kevés API design partner számára, nem pedig széles körben elérhető API-modellként.[24]

GPT-5.4

2026. március 5-én az OpenAI bemutatta a GPT‑5.4-et mint új frontier-modellt professzionális munkához. A GPT‑5.4 egyesíti az OpenAI legújabb kiadásainak erősségeit a reasoning, coding és agentic workflows területén, és az alap sorozatban elsőként kapott beépített computer use képességeket. Ezzel egyidejűleg az OpenAI kiadta a GPT‑5.4 Pro változatot – a legösszetettebb feladatokra, nagyobb számítási kapacitással és hosszabb gondolkodási idővel.[7]

Az API-ban a gpt-5.4 modell az általános célú és coding-feladatok széles köréhez ajánlott alapértelmezett modellként van leírva; a kontextusablak 1 050 000 token, a maximális kimenet 128 000 token. A modell szöveg és kép fogadására képes bemenetként, és szöveget ad ki kimenetként.[8][25]

A ChatGPT-ben az Auto mód 2026. március 7-ei állapot szerint automatikusan vált a GPT‑5.3 Instant és a GPT‑5.4 Thinking között, míg a GPT‑5.4 Pro külön high-capability módként érhető el. A bejelentkezett ChatGPT-felhasználók alapértelmezett modellje a GPT‑5.3.[17]

A GPT-modellek fejlődése

A GPT-modellek fejlődése
Generáció Kiadás éve Paraméterek száma Szövegkorpusz mérete Főbb jellemzők
GPT-1 2018 ≈117–124 millió[26] ≈5 GB (BooksCorpus) Generatív előtanítás nagy korpuszon; kétlépéses tanítás (pre-training + fine-tuning)
GPT-2 2019 1,5 milliárd ≈40 GB (WebText) Lényegesen javított szöveggenerálás; erős zero-shot viselkedés bemutatása; kezdetben részleges modellkiadás
GPT-3 2020 175 milliárd ≈570 GB (Common Crawl, WebText2 és mások) Nagyszabású in-context learning; kifejezett few-shot és zero-shot tanulási képességek finomhangolás nélkül
GPT-3.5 2022 Nem hozták nyilvánosságra (davinci-verziók feltételezhetően ~175 milliárd) >570 GB + kiegészítő korpuszok és instruction tuning Javított stabilitás és utasításkövetés; a ChatGPT korai verzióinak alapja
GPT-4 2023 Nem hozták nyilvánosságra[27] Nem hozták nyilvánosságra Multimodalitás (szöveg + képek); javított pontosság és hallucinációval szembeni ellenállás; 8k/32k tokenes kontextus
GPT-4 Turbo 2023 Nem hozták nyilvánosságra GPT-4 tanításán alapul (részletek nem nyilvánosak) Kontextus növelése 128 000 tokenre; sebesség és generálási költség optimalizálása
GPT-4o 2024 Nem hozták nyilvánosságra Multimodális adatok (szöveg, képek, hang) Egységes neurális hálózati multimodális feldolgozás; nagy válaszsebesség
GPT-4.5 2025 Nem hozták nyilvánosságra Bővített szöveges és multimodális korpuszok GPT-4o alapú research preview; hibacsökkentés; 2026-ra deprecated
GPT-4.1 2025 Nem hozták nyilvánosságra Frissített korpuszok Kontextus 1 047 576 tokenig; szöveg + képek bemenetként, szöveg kimenetként
GPT-5 2025 (augusztus) Nem hozták nyilvánosságra Nagyszabású multimodális korpuszok Egységes rendszer gyors válasz- és gondolkodási módokkal; ~400K tokenes kontextus; csökkentett hallucinációk
GPT-5.1 2025 (november) Nem hozták nyilvánosságra Bővített GPT-5 korpuszok + RLHF Adaptív reasoning; 24h prompt caching; fejlesztések a codingban
GPT-5.2 2025 (december) Nem hozták nyilvánosságra Tudáshatáridő: 2025. augusztus Pro-mód; professzionális szaktudás-munka; GPT-5.2-Codex (ágens coding)
GPT-5.3-Codex 2026 (február) Nem hozták nyilvánosságra Frissített + self-improvement adatok 25%-kal gyorsabb; teljes spektrumú ágens; interactive steering
GPT-5.3-Codex-Spark 2026 (február) Nem hozták nyilvánosságra Kompakt >1000 t/s Cerebras-on; valós idejű coding; 128K kontextus
GPT-5.3 Instant 2026 (március) Nem hozták nyilvánosságra Nem hozták nyilvánosságra A ChatGPT legtöbbet használt társalgási modelljének frissítése; javult a tényszerű pontosság, a webes keresés és a párbeszéd gördülékenysége
GPT-5.4 2026 (március) Nem hozták nyilvánosságra Nem hozták nyilvánosságra Új frontier-modell professzionális munkához; natív computer use; API alapértelmezett modellje általános célú és legtöbb coding-feladathoz
GPT-5.4 Pro 2026 (március) Nem hozták nyilvánosságra Nem hozták nyilvánosságra GPT-5.4 változat nagyobb számítási kapacitással a legösszetettebb feladatokhoz

A GPT-modellek architektúrális paraméterei

A GPT-modellek architektúrális paraméterei
Modell Kiadás éve Paraméterek száma Rétegek száma Rejtett állapot mérete Figyelmi fejek száma Kontextusablak Tanítókorpusz mérete
GPT-1 2018 ≈117–124 millió 12 768 12 512 token ≈5 GB (BooksCorpus)
GPT-2 2019 1,5 milliárd 48 1 600 25 1 024 token ≈40 GB (WebText)
GPT-3 2020 175 milliárd 96 12 288 96 2 048 token ≈570 GB (Common Crawl + WebText2 + egyéb)
GPT-3.5 2022 Nem hozták nyilvánosságra (davinci-verziók feltételezhetően ~175 milliárd) (becsülten közel a GPT-3-hoz) (becsülten közel a GPT-3-hoz) (nem hozták nyilvánosságra) Legfeljebb 4 096 token (korai); legfeljebb 16 385 token (késői) Bővített Common Crawl + kiegészítő adatkészletek és instruction tuning
GPT-4 2023 Nem hozták nyilvánosságra (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) 8 192 token (alap); 32 768 (GPT-4-32k) Nem hozták nyilvánosságra
GPT-4 Turbo 2023 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) Legfeljebb 128 000 token A GPT-4 optimalizált verziója (a korpusz részletei nem nyilvánosak)
GPT-4o 2024 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) Legfeljebb 128 000 token Multimodális adatok: szöveg, képek, hang
GPT-4.5 2025 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) Legfeljebb 128 000 token Frissített szöveges és multimodális korpuszok
GPT-4.1 2025 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) Legfeljebb 1 047 576 token Multimodalitás; skálázott tanítás hosszú kontextusokra összpontosítva
GPT-5 2025 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) Legfeljebb ≈400 000 token (összesített kontextus) Nagyszabású multimodális korpuszok (részletek nem nyilvánosak)
GPT-5.4 2026 (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) (nem hozták nyilvánosságra) 1 050 000 token; 128 000 max kimenet Nem hozták nyilvánosságra

Hivatkozások

  • „Improving language understanding with unsupervised learning", OpenAI, 2018. június 11.
  • „Better language models and their implications", OpenAI, 2019. február 14.
  • „GPT-2: 6-month follow-up", OpenAI, 2019. augusztus 20.
  • „GPT-2: 1.5B release", OpenAI, 2019. november 5.
  • „Language models are few-shot learners", OpenAI, 2020. május 28.
  • „OpenAI API", OpenAI, 2020. június 11.
  • „Introducing ChatGPT", OpenAI, 2022. november 30.
  • „Function calling and other API updates", OpenAI, 2023. június 13.
  • „GPT-4", OpenAI, 2023. március 14.
  • „New models and developer products announced at DevDay", OpenAI, 2023. november 6.
  • „Hello GPT-4o", OpenAI, 2024. május 13.
  • „Introducing GPT-4.1 in the API", OpenAI, 2025. április 14.
  • „Introducing GPT-4.5", OpenAI, 2025. február 27.
  • „Introducing GPT-5", OpenAI, 2025. augusztus 7.
  • „GPT-5.1: A smarter, more conversational ChatGPT", OpenAI, 2025. november 12.
  • „Introducing GPT-5.2", OpenAI, 2025. december 11.
  • „Introducing GPT-5.2-Codex", OpenAI, 2025. december 18.
  • „Introducing GPT-5.3-Codex", OpenAI, 2026. február 5.
  • „Introducing GPT-5.3-Codex-Spark", OpenAI, 2026. február 12.
  • „GPT-5.3 Instant: Smoother, more useful everyday conversations", OpenAI, 2026. március 3.
  • „Introducing GPT-5.4", OpenAI, 2026. március 5.
  • „Using GPT-5.4", OpenAI Developers
  • „Models", OpenAI API
  • „Deprecations", OpenAI API
  • „GPT-5.3 and GPT-5.4 in ChatGPT", OpenAI Help Center
  • „Retiring GPT-4o and other ChatGPT models", OpenAI Help Center

Megjegyzések

  1. OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
  2. OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
  3. 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
  4. 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
  5. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  6. OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
  7. 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
  8. 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
  9. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  10. OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
  11. OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
  12. Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
  13. Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
  14. Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
  15. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  16. OpenAI. «Introducing GPT-5» (7 августа 2025).
  17. 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
  18. OpenAI API documentation. Models: GPT-5.
  19. OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
  20. OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
  21. 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
  22. OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
  23. OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
  24. OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
  25. OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
  26. Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
  27. По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.

Irodalom

  • Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.