GPT (OpenAI) (SV)
GPT (Generative Pre-trained Transformer) — är en familj av stora språkmodeller (LLM), utvecklad av företaget OpenAI. GPT-modellerna bygger på transformer-arkitekturen och implementerar paradigmet för generativ förträning: i det första steget tränas modellen på omfattande textkorpusar utan explicit annotering, varefter den kan finjusteras för specifika uppgifter. För senare generationer (från och med GPT‑5) använder OpenAI även begreppet enhetligt system (unified system), eftersom produkten kombinerar ett snabbt svarsläge, ett läge för fördjupat resonerande (reasoning) och en router[1].
Namn
Förkortningen GPT står för Generative Pre-trained Transformer (Generativ Förtränad Transformer).
- Generativ (Generative): innebär att modellen kan skapa (generera) nytt innehåll, till exempel text.
- Förtränad (Pre-trained): anger att modellen genomgår ett omfattande inledande träningssteg på en stor datamängd (till exempel texter från internet). Efter förträningen kan modellen ofta ytterligare finjusteras (fine-tuned) för att utföra mer specifika uppgifter.
- Transformer (Transformer): detta är namnet på en specifik neuralt nätverksarkitektur som utgör den viktigaste innovationen bakom GPT och många andra moderna AI-modeller.
Den grundläggande egenskapen hos GPT är att träningen sker i autoregressiv form — modellen förutsäger nästa token utifrån det föregående sammanhanget. Det vill säga att modellen tränas att maximera sannolikheten för nästa token givet sekvensen av föregående tokens. Under träningen minimeras felet vid förutsägelsen av nästa element, vilket gör det möjligt att generera texter med hög koherens och sammanhang.
Processen för textgenerering i GPT
GPT-modellen genererar text sekventiellt, token för token, enligt följande iterativa schema:
- Tar emot en inledande textsekvens som indata (prompt, seed text).
- Beräknar en sannolikhetsfördelning över alla tokens i ordlistan för nästa textelement.
- Väljer nästa token:
- antingen med högsta sannolikhet (girig sökning),
- eller med stokastisk sampling (sampling),
- eller med hjälp av speciella filtreringsstrategier (top-k, top-p).
- Lägger till den valda token till den aktuella sekvensen.
- Den uppdaterade sekvensen matas återigen in i modellen för förutsägelse av nästa token.
Transformer-arkitektur: textbearbetning
Processen för databearbetning inuti transformern för att förutsäga nästa token innefattar flera huvudsakliga steg:
- Tokenisering (Tokenization). Indatatexten delas upp i tokens — små textenheter som kan vara ord, delar av ord eller skiljetecken. I GPT-3-modellen innehåller exempelvis ordlistan ungefär 50 257 tokens.
- Token-embeddings (Embeddings). Varje token omvandlas till en vektor av fast längd med hjälp av en embedding-matris (W_E). Vektorerna kodar tokens betydelse: semantiskt närstående tokens placeras nära varandra i det flerdimensionella rummet. I GPT-3-modellen är embedding-dimensionen 12 288.
- Bearbetning i transformer-lager.
- Uppmärksamhetsblock (Attention Blocks): Varje token interagerar med övriga tokens i sekvensen. Uppmärksamhetsmekanismen gör det möjligt att ta hänsyn till sammanhanget och korrekt tolka ordens betydelse.
- Fullt förbundna lager (Feed-Forward Layers): Efter uppmärksamheten bearbetas varje token separat genom ett tvålagers neuralt nätverk med icke-linjär aktivering.
- Omvänd transformation och Softmax. Efter alla lager omvandlas den bearbetade vektorn tillbaka till token-utrymmet med hjälp av matrisen (W_U), som ofta är den transponerade versionen av W_E. Den resulterande logit-vektorn normaliseras med hjälp av Softmax-funktionen för att erhålla en sannolikhetsfördelning över alla tokens.
- Val av nästa token (Sampling). Nästa token väljs utifrån sannolikhetsfördelningen. Temperaturparametern (temperature) styr slumpmässigheten i valet: vid temperatur 0 väljs den mest sannolika token, vid högre temperaturer ökar sannolikheten för att välja mindre sannolika alternativ, vilket bidrar till större textvariation.
GPT-modeller
- GPT-1 (2018): den första modellen i familjen; 12-lagers decoder-only transformer; träning i två steg (förträning + finjustering på NLP-uppgifter).
- GPT-2 (2019): 1,5 miljarder parametrar; tränad på WebText-korpusen; förmåga att för första gången generera långa sammanhängande texter; förbättrad kvalitet på zero-shot-generering. Presenterades den 14 februari 2019, den fullständiga versionen (1,5 miljarder) publicerades den 5 november 2019 av säkerhetsskäl.
- GPT-3 (2020): 175 miljarder parametrar; storskalig träning på en kombination av Common Crawl, Books och Wikipedia; stark utveckling av few-shot- och zero-shot-förmågor.
- GPT-3.5 (2022): en mellanversion mellan GPT-3 och GPT-4; förbättrad instruktionsföljning tack vare träning med mänsklig återkoppling (RLHF) i versionerna text-davinci-003 och gpt-3.5-turbo; kontextfönster upp till 4 096 tokens i tidiga versioner och upp till 16 385 tokens i senare versioner (gpt-3.5-turbo-16k och den uppdaterade gpt-3.5-turbo).
- GPT-4 (2023): multimodal modell med text- och bildinmatning (stöd för bilder lanserades senare, efter textlanseringen); kontextfönster på 8 192 tokens i basversionen och 32 768 tokens i varianten GPT-4-32k; avsevärd förbättring av precision, robusthet och logik i resonemang.
- GPT-4 Turbo (2023): optimerad version av GPT-4; utökat kontextfönster till 128 000 tokens; lägre latens och driftskostnad.
- GPT-4o (2024): multimodal modell av ny generation (text, bild, ljud) med en enhetlig neuralt nätverksarkitektur; mycket hög svarshastighet och precision; kontextfönster på 128 000 tokens.
- GPT-4.5 (2025): forskningsförhandsvisning (research preview); i system card anger OpenAI att modellen \"builds on GPT-4o\"[2][3]; förbättrad förståelse av användarförfrågningar, minskat antal fel; kontextfönster på 128 000 tokens. I API:t förklarades modellen
gpt-4.5-previewsom deprecated den 14 april 2025 och stängdes av den 14 juli 2025[4]. - GPT-4.1 (2025): förbättrad version av GPT-4-familjen med ett kontextfönster på upp till 1 miljon tokens; tar emot text och bilder som indata och producerar text som utdata[5]. Lanserades samtidigt i tre varianter: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
- GPT-5 (2025): ett enhetligt system med lägen för snabbt svar och fördjupat resonerande; kontextfönster på ungefär 400 000 tokens; märkbar minskning av hallucinationer på faktabaserade uppgifter.
- GPT-5.1 (2025): adaptivt reasoning, förbättringar inom coding och long-context retention.
- GPT-5.2 (2025): fokus på professionellt arbete; Pro-läge för frontier-uppgifter; på basis av GPT-5.2 lanserades den agentbaserade GPT-5.2-Codex.
- GPT-5.3-Codex (2026): agentbaserad coding-modell som förenar coding-förmågor och reasoning; 25 % snabbare än föregångarna.
- GPT-5.3 Instant (2026): uppdatering av den mest använda konversationsmodellen ChatGPT; lanserades den 3 mars 2026. Förbättrad faktanoggrannhet, sökkvalitet på webben, flöde i dialog samt minskat antal onödiga avslag och överdrivna förbehåll. Tillgänglig i API:t som
gpt-5.3-chat-latest[6]. - GPT-5.4 (2026): OpenAI:s frontier-modell för professionellt arbete, presenterad den 5 mars 2026; den första general-purpose-modellen från OpenAI med native computer-use capabilities. I API:t rekommenderas
gpt-5.4som standardmodell för ett brett spektrum av general-purpose- och coding-uppgifter[7][8].
GPT-1
Den första modellen, GPT-1, presenterades av OpenAI år 2018 i arbetet \"Improving Language Understanding by Generative Pre-Training\". Modellen utgjordes av en 12-lagers decoder-only transformer[9] och byggde på transformer-arkitekturen. Träningen av GPT-1 genomfördes i två steg: ett steg med okontrollerad generativ förträning (pre-training), följt av ett steg med kontrollerad finjustering (fine-tuning).
Under förträningssteget tränade modellen på BookCorpus-korpusen, som innehåller mer än 7 000 opublicerade böcker inom olika genrer. En egenskap hos denna korpus var förekomsten av långa sammanhängande textavsnitt, vilket var av avgörande betydelse för att modellen skulle utveckla förmågan att hantera komplexa och utdragna textberoenden.
Under finjusteringssteget anpassades modellen för att lösa specialiserade uppgifter inom bearbetning av naturligt språk, däribland:
- Frågesvar (Question Answering, QA) — att formulera ett korrekt svar utifrån ett givet textsammanhang;
- Igenkänning av textimplikation (Natural Language Inference, NLI) — att fastställa det logiska sambandet mellan två texter: implikation, motsättning eller neutralitet;
- Bedömning av semantisk likhet (Semantic Textual Similarity) — att mäta graden av meningsnärhet mellan två textsekvenser.
Tack vare detta tillvägagångssätt visade GPT-1 en betydande överlägsenhet gentemot tidigare modeller på ett antal standardbenchmarks för textförståelse.
Utvecklingen av GPT-1 visade på ett antal viktiga framsteg och rön inom bearbetning av naturligt språk (NLP):
- Effektiviteten hos generativ förträning. Det bekräftades empiriskt att förträning på stora korpusar med omärkt text gör det möjligt för modellen att förvärva universella språkrepresentationer, lämpliga för efterföljande tillämpning i olika praktiska uppgifter utan behov av grundläggande arkitekturförändringar.
- Transformer-arkitekturens mångsidighet. Användningen av en flerlagers decoder-transformer gjorde det möjligt för modellen att framgångsrikt hantera långsiktiga beroenden i text, vilket tidigare var svårt för modeller baserade på återkommande neurala nätverk.
- Minskad beroende av annoterade data. Arbetet bekräftade att storskalig förträning på omärkta data avsevärt kan minska mängden annoterade data som krävs för att uppnå hög kvalitet på måluppgifter.
- Grund för fortsatt utveckling. Resultaten från GPT-1 lade de konceptuella och tekniska grunderna för efterföljande versioner av GPT-modellfamiljen (GPT-2, GPT-3 och vidare).
GPT-2
Modellen GPT-2 presenterades av OpenAI den 14 februari 2019. Den överträffade avsevärt sin föregångare i storlek: den fullständiga versionen av modellen innehöll ungefär 1,5 miljarder parametrar. Av säkerhetsskäl publicerade OpenAI inledningsvis bara reducerade varianter av modellen; den fullständiga versionen (1,5 miljarder parametrar) lanserades den 5 november 2019. Till skillnad från GPT-1, som tränades på BookCorpus-korpusen (~5 GB), tränades GPT-2 på den specialinsamlade WebText-korpusen med en volym på ungefär 40 GB, bestående av textdata från internetkällor med hög kvalitetsnivå. Ökningen av både modellstorleken och volymen på träningsdata gjorde det möjligt för GPT-2 att avsevärt förbättra textgenereringskvaliteten: den visade förmågan att skapa innehållsrika artiklar, berättelser och till och med sammanhängande fragment av skönlitterär prosa.
I GPT-2 användes en autoregressiv decoder-transformer-arkitektur liknande GPT-1, utan väsentliga förändringar. Modellen bestod av 48 självuppmärksamhetslager, hade en dold tillståndsbredd på 1 600 och innehöll ungefär 1,5 miljarder parametrar. Antalet uppmärksamhetshuvuden var 25 (med bibehållen storlek på 64 per huvud, ärvd från GPT-1: 1 600 ÷ 64 = 25). Träningen genomfördes på uppgiften att förutsäga nästa token utifrån det föregående sammanhanget med hjälp av en maskerad uppmärksamhetsmekanism.
En av de viktigaste skillnaderna med GPT-2 var att modellen för första gången visade hög effektivitet i zero-shot learning-läge — förmågan att lösa nya uppgifter utan att genomgå explicit finjustering med exempel för dessa uppgifter. Modellen tränades på en stor korpus med allmänna texter och genomgick ingen specialiserad träning på data för specifika uppgifter. Utvärderingen genomfördes i zero-shot-läge, där modellen utförde uppgifter uteslutande utifrån kunskaper som förvärvats under förträningen. I ett antal språkmodelleringsuppgifter uppnådde GPT-2 en kvalitet jämförbar med eller överlägsen resultaten från modeller som specialtränats på specialiserade dataset (till exempel Wikipedia, nyhetstext, böcker).
GPT-3
Modellen GPT-3 presenterades av OpenAI i juni 2020 (artikeln på arXiv publicerades den 28 maj 2020, beta-tillgång till API:t öppnades den 11 juni 2020). Den blev nästa steg i utvecklingen av generativa transformers efter GPT-2 och utmärktes av en skalning av arkitekturen till 175 miljarder parametrar, vilket vid den tidpunkten gjorde den till den största språkmodellen.
GPT-3:s arkitektur förblev i grunden densamma — en flerlagers autoregressiv decoder-transformer utan radikala förändringar. De viktigaste prestandaförbättringarna uppnåddes genom ökning av antalet lager, bredden på de dolda lagren och träningsskalan. Modellen tränades på en kombination av flera stora textkorpusar, inklusive Common Crawl, WebText2, Books1, Books2 och Wikipedia. Den totala datavolymen uppgick till ungefär 570 GB och mer (570 GB avser den filtrerade delen av Common Crawl, som dominerar i träningsblandningen).
En av de viktigaste egenskaperna hos GPT-3 var dess förmåga till few-shot learning och zero-shot learning: modellen kunde utföra ett brett spektrum av uppgifter inom bearbetning av naturligt språk, inklusive översättning, sammanfattning, frågesvar, essäskrivning och till och med programmering, baserat på endast några få exempel i textförfrågan eller helt utan exempel.
GPT-3.5
Modellen GPT-3.5 presenterades av OpenAI i slutet av 2022 som en del av den evolutionära utvecklingen av GPT-familjen. Den byggde på den skalade autoregressiva decoder-transformer-arkitektur som användes i GPT-3, med förbättringar i textgenereringskvalitet, kontextbearbetning och förmåga att följa komplexa instruktioner. Det exakta antalet parametrar i GPT-3.5 har inte offentliggjorts officiellt; davinci-versionerna antas vara jämförbara i storlek med GPT-3 (175 miljarder), men de exakta parametrarna för versionen gpt-3.5-turbo är okända.
Träningen av GPT-3.5 inkluderade utökad användning av metoder för förstärkningsinlärning baserat på mänsklig återkoppling (Reinforcement Learning from Human Feedback, RLHF) i versionerna text-davinci-003 och gpt-3.5-turbo. Den tidigare versionen text-davinci-002 tränades med supervised fine-tuning (SFT), inte RLHF. Modellen tränades på utökade textkorpusar som inkluderar Common Crawl, Books, WebText och andra högkvalitativa källor. Kontextfönstret i tidiga populära versioner (gpt-3.5-turbo) var 4 096 tokens; därefter lanserade OpenAI uppdaterade versioner med ett kontext på upp till 16 385 tokens[10].
I praktiken anpassades GPT-3.5 för att lösa ett brett spektrum av uppgifter inom bearbetning av naturligt språk, såsom:
- Generering av sammanhängande och logisk text;
- Frågesvar (QA) och kontextförståelse;
- Följande av flerstegs-instruktioner;
- Förbättrat upprätthållande av långsiktigt sammanhang i dialoger.
Baserat på GPT-3.5 lanserades flera nyckelversioner avsedda för olika ändamål:
- text-davinci-002 — den första allmänt tillgängliga modellen baserad på GPT-3.5, optimerad för generering och instruktionsföljning (tränad med SFT).
- text-davinci-003 — en förbättrad version med ännu bättre resonemang och generering av komplexa texter (tränad med RLHF).
- gpt-3.5-turbo — den mest presterande och ekonomiska versionen av GPT-3.5, som användes i ChatGPT-tjänsten från slutet av 2022.
GPT-4
Modellen GPT-4 presenterades av OpenAI den 14 mars 2023 i arbetet "GPT-4 Technical Report\". Den blev nästa steg i utvecklingen av familjen av språkmodeller och erbjöd betydande förbättringar inom textförståelse, generering av meningsfulla och kreativa svar samt bearbetning av multimodala data. Det exakta antalet parametrar och arkitekturdetaljerna för modellen har inte offentliggjorts officiellt — den tekniska rapporten för GPT-4 anger uttryckligen att information om arkitektur, modellstorlek, hårdvara, beräkningskostnader för träning och konstruktion av dataset inte publiceras[11]. Enligt inofficiella externa uppskattningar kunde GPT-4 använda ett Mixture of Experts (MoE)-tillvägagångssätt och ha en total skala på ungefär ~1,8 biljoner parametrar, men OpenAI har varken officiellt bekräftat eller dementerat dessa siffror[12].
GPT-4 är en multimodal modell som kan ta emot både text och bilder som indata. Det bör noteras att vid den ursprungliga lanseringen i mars 2023 var endast textmodaliteten tillgänglig; stöd för bildinmatning lanserades senare. Kontextfönstret var 8 192 tokens i basversionen och 32 768 tokens i varianten GPT-4-32k. Modellen använde RLHF-metoder (förstärkningsinlärning baserat på mänsklig återkoppling).
Träningen av GPT-4 genomfördes på en kombination av storskaliga text- och multimodala korpusar. Specifika detaljer om träningsdata, hårdvara och metodik redovisas inte i officiella publikationer från OpenAI.
Träningen skedde i flera steg:
- storskalig okontrollerad förträning på texter och bilder,
- kontrollerad finjustering (supervised fine-tuning) på specialiserade uppgifter,
- det slutliga steget med förstärkningsinlärning baserat på mänsklig återkoppling (RLHF) för att öka tillförlitligheten, säkerheten och kvaliteten på tolkning av instruktioner.
Baserat på GPT-4 lanserades flera huvudversioner:
- GPT-4 (mars 2023): basversion med stöd för textinmatning (bildstöd lades till senare); kontextfönster på 8 192 tokens; varianten GPT-4-32k med ett kontext på 32 768 tokens lanserades också.
- GPT-4 Turbo (november 2023): optimerad modifikation av GPT-4 med utökat kontextfönster till 128 000 tokens[13]; minskade beräkningskostnader och accelererad generering; stöd för function calling-lägen och JSON-utdata.
- GPT-4o (maj 2024): multimodal version av ny generation; i lanseringsannonsen positionerades den som en omni-modell med förmåga att arbeta med text, bilder och ljud i realtid (till skillnad från GPT-4 Turbo, där olika modaliteter hanterades av separata moduler); API-basmodellen
gpt-4obeskrivs som text+bildinmatning, textutdata; kontextfönster på 128 000 tokens. - GPT-4.5 (februari 2025): forskningsförhandsvisning (research preview); i system card anger OpenAI uttryckligen att modellen \"builds on GPT-4o\"[3]; förbättrad generering av komplexa texter, ökad precision i instruktionsutförande och minskad hallucinationsgrad; kontextfönster på 128 000 tokens. Beskrevs som \"den sista OpenAI-modellen utan chain-of-thought\" (kodnamn — Orion)[14]. I API:t förklarades modellen
gpt-4.5-previewsom deprecated den 14 april 2025 och stängdes av den 14 juli 2025[4]. - GPT-4.1 (april 2025): stabil version med en radikal utökning av kontexten till 1 047 576 tokens; tar emot text och bilder som indata och producerar text som utdata[15]; lanserades samtidigt i tre varianter (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); inledningsvis endast tillgänglig via API, senare lanserad i ChatGPT.
GPT-5
Den 7 augusti 2025 presenterade OpenAI GPT‑5 som sin dåvarande \"smartaste, snabbaste och mest användbara\" modell, med ett inbyggt läge för fördjupat resonerande (thinking) och fokus på praktiska scenarier — skrivande, programmering, hälsoarbete och multimodal förståelse. GPT‑5 blev gradvis standardmodellen för de flesta inloggade ChatGPT-användare och ersatte de tidigare använda modellerna från GPT‑4/4o- och o‑seriens familjer.[16]
GPT‑5 är implementerat som ett enhetligt system med två huvudsakliga driftslägen: snabba, ekonomiska svar för vardagliga förfrågningar (konventionellt gpt‑5 main) och fördjupat resonerande för komplexa uppgifter (konventionellt gpt‑5 thinking). Valet av läge sker automatiskt med hjälp av en router som tar hänsyn till dialogtyp, förfrågningskomplexitet, behov av verktyg och explicita ledtrådar från användaren (till exempel \"think step by step\" eller \"analyze in depth\"). I ChatGPT har användaren tillgång till lägena Auto / Instant / Thinking / Pro; varianterna mini och nano är i första hand API-modeller, och mini kan i den användarinriktade produkten användas som fallback efter att gränsen har uppnåtts[17].
Genom programmeringsgränssnittet tillhandahålls flera storlekar och konfigurationer av GPT‑5; i OpenAI:s dokumentation anges gpt‑5, gpt‑5‑mini och gpt‑5‑nano som huvudvarianter (alla stöder text och visuella data). Det maximala totala kontextfönstret för GPT‑5-familjen i API:t uppgår till ungefär 400 000 tokens (med uppdelade budgetar för inmatning och resonemang/utdata), men de specifika gränserna kan variera beroende på vald modellvariant och produkt[18].
I ett antal webb-sökning- och faktabaserade benchmarks uppvisar GPT‑5 en märkbar minskning av hallucinationsfrekvens och fel jämfört med GPT‑4o-modellerna och tidigare \"thinking\"-modeller från OpenAI. I det officiella tillkännagivandet presenterade OpenAI uppskattningar av felminskningar med ungefär 45 % jämfört med GPT-4o och ungefär 80 % jämfört med o3 i thinking-läge — dessa resultat erhölls under specifika förhållanden: med webbsökning aktiverad på anonymiserade prompts representativa för ChatGPT:s produktionstrafik[19].
GPT-5.1
Modellen GPT-5.1 presenterades av OpenAI den 12 november 2025 som den första betydande iterationen efter bas-GPT-5, inriktad på förbättrat vardagligt samspel, konversationsnaturlighet och anpassningsförmåga. Modellen behåller det enhetliga systemet med ett snabbt läge (GPT-5.1 Instant) och fördjupat resonerande (GPT-5.1 Thinking), men introducerar adaptivt tänkande (adaptive reasoning): modellen avgör dynamiskt beräkningsvolymen beroende på förfrågningens komplexitet, vilket gör den märkbart snabbare på enkla uppgifter utan kvalitetsförlust på komplexa.
Träningen av GPT-5.1 byggde på GPT-5 med ett ytterligare post-träningssteg som inkluderar utökad RLHF, fokus på tonens naturlighet och minskning av svarens \"kyliga\" karaktär. Kontextfönstret i API:t är 400 000 tokens, maximalt utdata — 128 000 tokens[20]. Stöd för utökad prompt-cachning upp till 24 timmar tillkom, vilket avsevärt minskar kostnader och fördröjningar vid dialoger med många steg[21].
Viktigaste egenskaper:
- GPT-5.1 Instant — huvudläge för vardagliga uppgifter; använder för första gången adaptive reasoning för att avgöra när det är lämpligt att \"tänka\" innan svar på en mer komplex förfrågan[21].
- GPT-5.1 Thinking — adaptiv fördelning av tid för resonerande; enligt OpenAI:s uppgifter är modellen på en representativ fördelning av ChatGPT-uppgifter ungefär dubbelt så snabb på de enklaste uppgifterna och ungefär dubbelt så långsam på de svåraste jämfört med GPT-5 Thinking[21].
- Förbättrad multimodalitet (text + vision).
- Förbättrade coding- och agentbaserade scenarier, samt effektivitet på enkla uppgifter tack vare adaptive reasoning och extended prompt caching[22].
GPT-5.2
Modellen GPT-5.2 lanserades den 11 december 2025 som \"seriens mest kapabla modell för professionellt arbete och lärande\". Det är en evolution av GPT-5.1 med fokus på ekonomiskt värde: generering av tabeller, presentationer, komplex kod, end-to-end-uppgifter. Behåller den enhetliga arkitekturen med lägena Instant, Thinking och det nya Pro (för uppgifter som kräver maximalt beräkningsresurser och tid för resonerande).
Träningen inkluderade ett uppdaterat korpus med knowledge cutoff i augusti 2025, förstärkt instruction-tuning och RLHF för att minska fel i scenarier med flera steg. Kontext — 400K tokens (128K max utdata). Modellen blev mer tillförlitlig i professionella scenarier, med bättre faktanoggrannhet och verktygsanvändning.
Baserat på GPT-5.2 lanserades den 18 december 2025 den specialiserade GPT-5.2-Codex — en agentbaserad coding-modell med förbättrad context compaction, stöd för Windows, förstärkt cybersäkerhet och long-horizon reasoning (uppgifter upp till flera timmar).
Per den 13 februari 2026, efter att ett antal äldre modeller fasats ut, blev GPT-5.2 tillfälligt standardmodellen i ChatGPT. Men redan i början av mars 2026 övertogs denna roll av GPT‑5.3 Instant och GPT‑5.4[17].
GPT-5.3-Codex
GPT-5.3-Codex presenterades den 5 februari 2026 som \"den kraftfullaste agentbaserade coding-modellen hittills\". Det är en sammanslagning av frontier-coding-förmågorna hos GPT-5.2-Codex med det professionella resonerandet hos GPT-5.2 i en enda modell, som är 25 % snabbare än föregångarna.
Modellen kan utföra i princip alla utvecklaruppgifter: long-running workflows, research, tool use, kodkörning, interactive steering (användaren kan ingripa i realtid utan att förlora sammanhanget). Tidiga versioner av modellen användes av OpenAI:s team för felsökning av sin egen träning, driftsättning och utvärderingar.
Viktigaste resultat vid tillkännagivandet den 5 februari 2026: Terminal-Bench ~77,3 %, OSWorld-Verified ~64,7 %, SWE-Bench Pro ~56,8 %. I den senare lanseringen av GPT-5.4 den 5 mars 2026 presenterade OpenAI ett uppdaterat resultat på OSWorld-Verified 74,0 % för GPT-5.3-Codex vid användning av den nya API-parametern som bevarar bildens ursprungliga upplösning[23][7].
Den 12 februari 2026 lanserade OpenAI även GPT-5.3-Codex-Spark — en kompakt ultra-snabb version i partnerskap med Cerebras, optimerad för realtid: mer än 1000 tokens per sekund, text-only, kontext 128K. Vid starten var detta en lansering för ChatGPT Pro-användare i Codex och ett litet antal API design partners, och inte en brett tillgänglig API-modell[24].
GPT-5.4
Den 5 mars 2026 presenterade OpenAI GPT‑5.4 som en ny frontier-modell för professionellt arbete. GPT‑5.4 förenar styrkorna från OpenAI:s senaste lanseringar inom reasoning, coding och agentic workflows och fick för första gången i huvudlinjen inbyggda computer use-förmågor. Samtidigt lanserade OpenAI GPT‑5.4 Pro — en variant för de mest komplexa uppgifterna, som använder mer beräkningsresurser och längre resonerande[7].
I API:t beskrivs modellen gpt-5.4 som rekommenderad standard för ett brett spektrum av general-purpose- och coding-uppgifter; kontextfönstret uppgår till 1 050 000 tokens, maximalt utdata — 128 000 tokens. Modellen tar emot text och bilder som indata och producerar text som utdata[8][25].
I ChatGPT växlar läget Auto per den 7 mars 2026 automatiskt mellan GPT‑5.3 Instant och GPT‑5.4 Thinking, medan GPT‑5.4 Pro är tillgänglig som ett separat high-capability-läge. För inloggade ChatGPT-användare är GPT‑5.3 standardmodellen[17].
Utveckling av GPT-modeller
| Generation | Lansерingsår | Antal parametrar | Textkorpusens storlek | Viktigaste egenskaper |
|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 milj.[26] | ≈5 GB (BooksCorpus) | Generativ förträning på stora korpusar; tvåstegsträning (pre-training + fine-tuning) |
| GPT-2 | 2019 | 1,5 miljarder | ≈40 GB (WebText) | Väsentligt förbättrad textgenerering; demonstration av starkt zero-shot-beteende; inledningsvis partiell publicering av modellen |
| GPT-3 | 2020 | 175 miljarder | ≈570 GB (Common Crawl, WebText2 m.fl.) | Storskalig in-context learning; uttalade förmågor för few-shot och zero-shot utan finjustering |
| GPT-3.5 | 2022 | Ej offentliggjort (davinci-versioner förmodligen ~175 miljarder) | >570 GB + ytterligare korpusar och instruction tuning | Förbättrad stabilitet och instruktionsföljning; grund för tidiga versioner av ChatGPT |
| GPT-4 | 2023 | Ej offentliggjort[27] | Ej offentliggjort | Multimodalitet (text + bilder); ökad precision och motståndskraft mot hallucinationer; kontext 8k/32k tokens |
| GPT-4 Turbo | 2023 | Ej offentliggjort | Baserar sig på GPT-4-träning (detaljer ej offentliggjorda) | Utökning av kontext till 128 000 tokens; optimering av genereringshastighet och kostnad |
| GPT-4o | 2024 | Ej offentliggjort | Multimodala data (text, bilder, ljud) | Enhetlig neuralt nätverks-multimodal bearbetning; hög svarshastighet |
| GPT-4.5 | 2025 | Ej offentliggjort | Utökade text- och multimodala korpusar | Research preview baserat på GPT-4o; minskning av fel; deprecated till 2026 |
| GPT-4.1 | 2025 | Ej offentliggjort | Uppdaterade korpusar | Kontext upp till 1 047 576 tokens; text + bilder som indata, text som utdata |
| GPT-5 | 2025 (augusti) | Ej offentliggjort | Storskaliga multimodala korpusar | Enhetligt system med lägen för snabbt svar och resonerande; kontext ~400K tokens; minskning av hallucinationer |
| GPT-5.1 | 2025 (november) | Ej offentliggjort | Utökade GPT-5-korpusar + RLHF | Adaptivt reasoning; 24h prompt caching; förbättringar inom coding |
| GPT-5.2 | 2025 (december) | Ej offentliggjort | Knowledge cutoff augusti 2025 | Pro-läge; professionellt kunskapsarbete; GPT-5.2-Codex (agentbaserad coding) |
| GPT-5.3-Codex | 2026 (februari) | Ej offentliggjort | Uppdaterade + self-improvement data | 25 % snabbare; full-spectrum agent; interactive steering |
| GPT-5.3-Codex-Spark | 2026 (februari) | Ej offentliggjort | Kompakt | >1000 t/s på Cerebras; realtids-coding; 128K kontext |
| GPT-5.3 Instant | 2026 (mars) | Ej offentliggjort | Ej offentliggjort | Uppdatering av den mest använda konversationsmodellen ChatGPT; förbättrad faktanoggrannhet, webbsökning och konversationsflöde |
| GPT-5.4 | 2026 (mars) | Ej offentliggjort | Ej offentliggjort | Ny frontier-modell för professionellt arbete; native computer use; standardmodell i API:t för general-purpose och de flesta coding-uppgifter |
| GPT-5.4 Pro | 2026 (mars) | Ej offentliggjort | Ej offentliggjort | Variant av GPT-5.4 med mer beräkningsresurser för de mest komplexa uppgifterna |
Arkitekturparametrar för GPT-modeller
| Modell | Lansерingsår | Antal parametrar | Antal lager | Dold tillståndsbredd | Antal uppmärksamhetshuvuden | Kontextfönster | Träningskorpusens storlek |
|---|---|---|---|---|---|---|---|
| GPT-1 | 2018 | ≈117–124 milj. | 12 | 768 | 12 | 512 tokens | ≈5 GB (BooksCorpus) |
| GPT-2 | 2019 | 1,5 miljarder | 48 | 1 600 | 25 | 1 024 tokens | ≈40 GB (WebText) |
| GPT-3 | 2020 | 175 miljarder | 96 | 12 288 | 96 | 2 048 tokens | ≈570 GB (Common Crawl + WebText2 + övriga) |
| GPT-3.5 | 2022 | Ej offentliggjort (davinci-versioner förmodligen ~175 miljarder) | (uppskattningsvis nära GPT-3) | (uppskattningsvis nära GPT-3) | (ej offentliggjort) | Upp till 4 096 tokens (tidiga); upp till 16 385 tokens (sena) | Utökad Common Crawl + ytterligare dataset och instruction tuning |
| GPT-4 | 2023 | Ej offentliggjort | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | 8 192 tokens (bas); 32 768 (GPT-4-32k) | Ej offentliggjort |
| GPT-4 Turbo | 2023 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | Upp till 128 000 tokens | Optimerad version av GPT-4 (korpusdetaljer ej offentliggjorda) |
| GPT-4o | 2024 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | Upp till 128 000 tokens | Multimodala data: text, bilder, ljud |
| GPT-4.5 | 2025 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | Upp till 128 000 tokens | Uppdaterade text- och multimodala korpusar |
| GPT-4.1 | 2025 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | Upp till 1 047 576 tokens | Multimodalitet; skalad träning med fokus på långa kontexter |
| GPT-5 | 2025 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | Upp till ≈400 000 tokens (totalt kontext) | Storskaliga multimodala korpusar (detaljer ej offentliggjorda) |
| GPT-5.4 | 2026 | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | (ej offentliggjort) | 1 050 000 tokens; 128 000 max utdata | Ej offentliggjort |
Källor
- \"Improving language understanding with unsupervised learning\", OpenAI, 11 juni 2018
- \"Better language models and their implications\", OpenAI, 14 februari 2019
- \"GPT-2: 6-month follow-up\", OpenAI, 20 augusti 2019
- \"GPT-2: 1.5B release\", OpenAI, 5 november 2019
- \"Language models are few-shot learners\", OpenAI, 28 maj 2020
- \"OpenAI API\", OpenAI, 11 juni 2020
- \"Introducing ChatGPT\", OpenAI, 30 november 2022
- \"Function calling and other API updates\", OpenAI, 13 juni 2023
- \"GPT-4\", OpenAI, 14 mars 2023
- \"New models and developer products announced at DevDay\", OpenAI, 6 november 2023
- \"Hello GPT-4o\", OpenAI, 13 maj 2024
- \"Introducing GPT-4.1 in the API\", OpenAI, 14 april 2025
- \"Introducing GPT-4.5\", OpenAI, 27 februari 2025
- \"Introducing GPT-5\", OpenAI, 7 augusti 2025
- \"GPT-5.1: A smarter, more conversational ChatGPT\", OpenAI, 12 november 2025
- \"Introducing GPT-5.2\", OpenAI, 11 december 2025
- \"Introducing GPT-5.2-Codex\", OpenAI, 18 december 2025
- \"Introducing GPT-5.3-Codex\", OpenAI, 5 februari 2026
- \"Introducing GPT-5.3-Codex-Spark\", OpenAI, 12 februari 2026
- \"GPT-5.3 Instant: Smoother, more useful everyday conversations\", OpenAI, 3 mars 2026
- \"Introducing GPT-5.4\", OpenAI, 5 mars 2026
- \"Using GPT-5.4\", OpenAI Developers
- \"Models\", OpenAI API
- \"Deprecations\", OpenAI API
- \"GPT-5.3 and GPT-5.4 in ChatGPT\", OpenAI Help Center
- \"Retiring GPT-4o and other ChatGPT models\", OpenAI Help Center
Fotnoter
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
- ↑ OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
- ↑ 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
- ↑ 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
- ↑ 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
- ↑ 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
- ↑ Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
- ↑ OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
- ↑ OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
- ↑ Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
- ↑ Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
- ↑ Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
- ↑ OpenAI. «Introducing GPT-4.1 in the API» (2025).
- ↑ OpenAI. «Introducing GPT-5» (7 августа 2025).
- ↑ 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
- ↑ OpenAI API documentation. Models: GPT-5.
- ↑ OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
- ↑ OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
- ↑ 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
- ↑ OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
- ↑ OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
- ↑ OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
- ↑ OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
- ↑ Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
- ↑ По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.
Litteratur
- Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.