GPT (OpenAI) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT (Generative Pre-trained Transformer) — to rodzina dużych modeli językowych (LLM), opracowana przez firmę OpenAI. Modele GPT są zbudowane na architekturze transformerów i realizują paradygmat generatywnego wstępnego treningu: w pierwszym etapie model uczy się na rozległych korpusach tekstów bez jawnego etykietowania, a następnie może być dostrajany do konkretnych zadań. Dla późniejszych generacji (począwszy od GPT‑5) OpenAI stosuje również określenie zunifikowany system (unified system), ponieważ produkt łączy szybki tryb odpowiedzi, tryb pogłębionego wnioskowania (reasoning) oraz router[1].

Nazwa

Skrót GPT oznacza Generative Pre-trained Transformer (Generatywny Wstępnie Wytrenowany Transformer).

  • Generatywny (Generative): oznacza, że model jest w stanie tworzyć (generować) nowe treści, na przykład tekst.
  • Wstępnie wytrenowany (Pre-trained): wskazuje, że model przechodzi rozległy etap wstępnego treningu na dużym zbiorze danych (np. tekstach z internetu). Po wstępnym treningu model może być dodatkowo \"dostrojony\" (fine-tuned) do wykonywania bardziej specyficznych zadań.
  • Transformer (Transformer): to nazwa konkretnej architektury sieci neuronowej, będącej kluczową innowacją leżącą u podstaw GPT i wielu innych współczesnych modeli AI.

Główną cechą GPT jest to, że trening odbywa się w formie autoregresyjnej — model przewiduje następny token na podstawie poprzedniego kontekstu. Oznacza to, że model uczy się maksymalizować prawdopodobieństwo następnego tokenu, znając sekwencję poprzednich tokenów. Podczas treningu minimalizowany jest błąd przewidywania następnego elementu, co pozwala tworzyć teksty o wysokiej koherencji i spójności.

Proces generowania tekstu w GPT

Model GPT generuje tekst sekwencyjnie, token po tokenie, według następującego iteracyjnego schematu:

  • Przyjmuje na wejście początkową sekwencję tekstową (prompt, seed text).
  • Oblicza rozkład prawdopodobieństwa po wszystkich tokenach słownika dla następnego elementu tekstu.
  • Wybiera następny token:
    • albo według najwyższego prawdopodobieństwa (wybór zachłanny),
    • albo metodą stochastycznego próbkowania (sampling),
    • albo z zastosowaniem specjalnych strategii filtrujących (top-k, top-p).
  • Dodaje wybrany token do bieżącej sekwencji.
  • Zaktualizowana sekwencja ponownie podawana jest na wejście modelu w celu przewidzenia następnego tokenu.

Architektura transformera: przetwarzanie tekstu

Proces przetwarzania danych wewnątrz transformera w celu przewidzenia następnego tokenu obejmuje kilka głównych etapów:

  • Tokenizacja (Tokenization). Tekst wejściowy dzielony jest na tokeny — małe jednostki tekstu, które mogą być słowami, częściami słów lub znakami interpunkcyjnymi. W modelu GPT-3 słownik obejmuje na przykład około 50 257 tokenów.
  • Embedding tokenów (Embeddings). Każdy token przekształcany jest w wektor o stałej długości za pomocą macierzy embeddingów (W_E). Wektory kodują znaczenie tokenów: tokeny semantycznie bliskie umieszczone są blisko siebie w przestrzeni wielowymiarowej. W modelu GPT-3 wymiarowość embeddingów wynosi 12 288.
  • Przetwarzanie w warstwach transformera.
    • Bloki uwagi (Attention Blocks): Każdy token wchodzi w interakcję z innymi tokenami sekwencji. Mechanizm uwagi pozwala uwzględniać kontekst i poprawnie interpretować znaczenia słów.
    • Warstwy gęsto połączone (Feed-Forward Layers): Po uwadze każdy token przetwarzany jest osobno przez dwuwarstwową sieć neuronową z nieliniową aktywacją.
  • Odwrotne przekształcenie i Softmax. Po wszystkich warstwach przetworzony wektor przekształcany jest z powrotem do przestrzeni tokenów za pomocą macierzy (W_U), która często jest transponowaną wersją W_E. Wynikowy wektor logitów normalizowany jest funkcją Softmax w celu uzyskania rozkładu prawdopodobieństwa po wszystkich tokenach.
  • Wybór następnego tokenu (Sampling). Następny token wybierany jest na podstawie rozkładu prawdopodobieństwa. Parametr temperatury (temperature) steruje losowością wyboru: przy temperaturze 0 wybierany jest najbardziej prawdopodobny token, przy wyższych temperaturach wzrasta prawdopodobieństwo wyboru mniej prawdopodobnych wariantów, co sprzyja większej różnorodności tekstu.

Modele GPT

  • GPT-1 (2018): pierwszy model rodziny; 12-warstwowy transformer decoder-only; trening dwuetapowy (wstępny trening + dostrajanie na zadaniach NLP).
  • GPT-2 (2019): 1,5 mld parametrów; trening na korpusie WebText; po raz pierwszy zdolny do generowania długich spójnych tekstów; poprawa jakości generacji zero-shot. Ogłoszony 14 lutego 2019 roku, pełna wersja (1,5 mld) opublikowana 5 listopada 2019 roku ze względów bezpieczeństwa.
  • GPT-3 (2020): 175 mld parametrów; rozległy trening na zbiorze Common Crawl, Books, Wikipedia; silny rozwój zdolności few-shot i zero-shot.
  • GPT-3.5 (2022): wersja pośrednia między GPT-3 a GPT-4; ulepszone podążanie za instrukcjami dzięki treningowi z informacją zwrotną od człowieka (RLHF) w wersjach text-davinci-003 i gpt-3.5-turbo; okno kontekstowe do 4 096 tokenów we wczesnych wersjach i do 16 385 tokenów w późniejszych (gpt-3.5-turbo-16k i zaktualizowanym gpt-3.5-turbo).
  • GPT-4 (2023): model multimodalny z wejściem tekstowym i graficznym (obsługa obrazów została wdrożona później, po uruchomieniu wersji tekstowej); okno kontekstowe 8 192 tokenów w wersji podstawowej i 32 768 tokenów w wariancie GPT-4-32k; znaczna poprawa dokładności, odporności i logiki wnioskowania.
  • GPT-4 Turbo (2023): zoptymalizowana wersja GPT-4; rozszerzone okno kontekstowe do 128 000 tokenów; niższe opóźnienia i koszt działania.
  • GPT-4o (2024): multimodalny model nowej generacji (tekst, obraz, audio) z jednolitą architekturą sieci neuronowej; bardzo wysoka szybkość i dokładność odpowiedzi; okno kontekstowe 128 000 tokenów.
  • GPT-4.5 (2025): wersja badawcza (research preview); w system card OpenAI wskazuje, że model „builds on GPT-4o\"[2][3]; ulepszone rozumienie zapytań użytkownika, zmniejszenie liczby błędów; okno kontekstowe 128 000 tokenów. W API model gpt-4.5-preview został ogłoszony deprecated 14 kwietnia 2025 roku i wyłączony 14 lipca 2025 roku[4].
  • GPT-4.1 (2025): ulepszona wersja rodziny GPT-4 z oknem kontekstowym do 1 mln tokenów; przyjmuje tekst i obrazy na wejściu, generuje tekst na wyjściu[5]. Wydana jednocześnie w trzech wariantach: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
  • GPT-5 (2025): zunifikowany system z trybami szybkiej odpowiedzi i pogłębionego wnioskowania; okno kontekstowe około 400 000 tokenów; wyraźne zmniejszenie halucynacji na zadaniach faktograficznych.
  • GPT-5.1 (2025): adaptacyjne reasoning, ulepszenia w coding i long-context retention.
  • GPT-5.2 (2025): nacisk na pracę profesjonalną; tryb Pro dla zadań frontier; na bazie GPT-5.2 wydano agentową GPT-5.2-Codex.
  • GPT-5.3-Codex (2026): agentowy model coding łączący zdolności coding i reasoning; o 25 % szybszy od poprzedników.
  • GPT-5.3 Instant (2026): aktualizacja najczęściej używanego modelu konwersacyjnego ChatGPT; wydana 3 marca 2026 roku. Ulepszona dokładność faktograficzna, jakość wyszukiwania w sieci, płynność dialogu oraz zmniejszona liczba zbędnych odmów i nadmiernych zastrzeżeń. W API dostępna jako gpt-5.3-chat-latest[6].
  • GPT-5.4 (2026): model frontier OpenAI do pracy profesjonalnej, przedstawiony 5 marca 2026 roku; pierwszy model ogólnego przeznaczenia OpenAI z natywną obsługą computer use. W API gpt-5.4 rekomendowany jako domyślny model do szerokiego zakresu zadań general-purpose i coding[7][8].

GPT-1

Pierwszy model, GPT-1, został przedstawiony przez OpenAI w 2018 roku w pracy \"Improving Language Understanding by Generative Pre-Training\". Model był 12-warstwowym transformerem decoder-only[9] i zbudowany był na bazie architektury transformerów. Trening GPT-1 przebiegał w dwóch etapach: etap nienadzorowanego generatywnego wstępnego treningu (pre-training), po którym następował etap nadzorowanego dostrajania (fine-tuning).

Na etapie wstępnego treningu model uczył się na korpusie BookCorpus, obejmującym ponad 7 000 nieopublikowanych książek różnych gatunków. Cechą charakterystyczną tego korpusu była obecność długich ciągłych fragmentów tekstu, co miało kluczowe znaczenie dla wykształcenia u modelu zdolności przetwarzania złożonych i rozległych zależności tekstowych.

Na etapie dostrajania model był adaptowany do rozwiązywania specjalistycznych zadań przetwarzania języka naturalnego, w tym:

  • Odpowiedzi na pytania (Question Answering, QA) — formułowanie poprawnej odpowiedzi na podstawie zadanego kontekstu tekstowego;
  • Rozpoznawanie implikacji tekstowej (Natural Language Inference, NLI) — określanie logicznego związku między dwoma tekstami: implikacji, sprzeczności lub neutralności;
  • Ocena podobieństwa semantycznego (Semantic Textual Similarity) — pomiar stopnia bliskości znaczeniowej między dwiema sekwencjami tekstowymi.

Dzięki takiemu podejściu GPT-1 zademonstrował znaczną przewagę nad poprzednimi modelami na szeregu standardowych benchmarków do zadań rozumienia tekstu.

Opracowanie GPT-1 wykazało szereg kluczowych osiągnięć i odkryć w dziedzinie przetwarzania języka naturalnego (NLP):

  • Skuteczność generatywnego wstępnego treningu. Empirycznie potwierdzono, że wstępny trening na dużych korpusach nieoznakowanego tekstu pozwala modelowi nabywać uniwersalne reprezentacje językowe, przydatne do późniejszego zastosowania w różnych zadaniach praktycznych bez konieczności fundamentalnych zmian architektonicznych.
  • Uniwersalność architektury transformerów. Zastosowanie wielowarstwowego transformera dekoderowego umożliwiło modelowi skuteczne przetwarzanie długoterminowych zależności w tekście, co wcześniej było utrudnione dla modeli opartych na rekurencyjnych sieciach neuronowych.
  • Zmniejszenie zależności od oznakowania danych. Praca potwierdziła, że wstępny trening na dużą skalę na danych nieoznakowanych może znacząco zmniejszyć ilość oznakowanych danych potrzebnych do osiągnięcia wysokiej jakości na zadaniach docelowych.
  • Fundament dla dalszego rozwoju. Wyniki GPT-1 położyły konceptualne i techniczne podstawy dla kolejnych wersji modeli z rodziny GPT (GPT-2, GPT-3 i dalej).

GPT-2

Model GPT-2 został ogłoszony przez OpenAI 14 lutego 2019 roku. Znacznie przewyższał swojego poprzednika pod względem rozmiaru: pełna wersja modelu zawierała około 1,5 miliarda parametrów. Ze względów bezpieczeństwa OpenAI początkowo opublikowała jedynie pomniejszone warianty modelu; pełna wersja (1,5 mld parametrów) została wydana 5 listopada 2019 roku. W odróżnieniu od GPT-1, trenowanego na korpusie BookCorpus (~5 GB), GPT-2 był trenowany na specjalnie zebranym korpusie WebText o objętości około 40 GB, zawierającym dane tekstowe ze źródeł internetowych o wysokiej jakości. Zwiększenie zarówno rozmiaru modelu, jak i objętości danych treningowych pozwoliło GPT-2 znacząco poprawić jakość generowania tekstu: model demonstrował zdolność tworzenia treściwych artykułów, opowiadań, a nawet spójnych fragmentów prozy artystycznej.

W GPT-2 zastosowano architekturę autoregresyjnego transformera dekoderowego, analogiczną do GPT-1, bez istotnych zmian. Model składał się z 48 warstw samo-uwagi, miał rozmiar stanu ukrytego 1600 i zawierał około 1,5 miliarda parametrów. Liczba głowic uwagi wynosiła 25 (przy zachowaniu rozmiaru 64 na głowicę, odziedziczonego z GPT-1: 1600 ÷ 64 = 25). Trening odbywał się na zadaniu przewidywania następnego tokenu na podstawie poprzedniego kontekstu z zastosowaniem maskowanego mechanizmu uwagi.

Jedną z głównych cech wyróżniających GPT-2 było to, że model po raz pierwszy zademonstrował wysoką skuteczność w trybie zero-shot learning — zdolności do rozwiązywania nowych zadań bez przechodzenia przez jawne dostrajanie na przykładach dla tych zadań. Model był trenowany na dużym korpusie uogólnionych tekstów i nie przechodził specjalistycznego treningu na danych konkretnych zadań. Ocena przeprowadzana była w trybie zero-shot, w którym model wykonywał zadania wyłącznie na podstawie wiedzy nabytej podczas wstępnego treningu. W szeregu zadań modelowania językowego GPT-2 osiągał jakość porównywalną lub przewyższającą wyniki modeli specjalnie trenowanych na wyspecjalizowanych zbiorach danych (np. Wikipedia, teksty prasowe, książki).

GPT-3

Model GPT-3 został przedstawiony przez OpenAI w czerwcu 2020 roku (artykuł na arXiv ukazał się 28 maja 2020, dostęp beta do API otwarto 11 czerwca 2020). Stanowił kolejny krok w rozwoju generatywnych transformerów po GPT-2 i wyróżniał się skalowaniem architektury do 175 miliardów parametrów, co uczyniło go wówczas największym modelem językowym.

Architektura GPT-3 pozostała w zasadzie niezmieniona — wielowarstwowy autoregresyjny transformer dekoderowy bez zasadniczych zmian. Główne ulepszenia wydajności osiągnięto dzięki zwiększeniu liczby warstw, szerokości warstw ukrytych i skali treningu. Model trenowany był na połączeniu kilku dużych korpusów tekstów, w tym Common Crawl, WebText2, Books1, Books2 i Wikipedii. Łączna objętość danych wynosiła około 570 GB i więcej (570 GB przypada na odfiltrowaną część Common Crawl, dominującą w mieszaninie treningowej).

Jedną z głównych cech GPT-3 była jego zdolność do few-shot learning i zero-shot learning: model potrafił wykonywać szeroki zakres zadań przetwarzania języka naturalnego, w tym tłumaczenie, podsumowywanie, odpowiedzi na pytania, pisanie esejów, a nawet programowanie, opierając się jedynie na kilku przykładach w zapytaniu tekstowym lub w ogóle bez przykładów.

GPT-3.5

Model GPT-3.5 został przedstawiony przez OpenAI pod koniec 2022 roku w ramach ewolucyjnego rozwoju rodziny GPT. Zbudowany był na bazie architektury skalowanego autoregresyjnego transformera dekoderowego użytego w GPT-3, z ulepszeniami w zakresie jakości generowania tekstu, przetwarzania kontekstu i zdolności podążania za złożonymi instrukcjami. Dokładna liczba parametrów GPT-3.5 nie została oficjalnie ujawniona; przypuszcza się, że wersje davinci są porównywalne rozmiarem z GPT-3 (175 mld), jednak dokładne parametry wersji gpt-3.5-turbo nie są znane.

Trening GPT-3.5 obejmował rozszerzone zastosowanie metod uczenia ze wzmocnieniem na podstawie informacji zwrotnej od człowieka (Reinforcement Learning from Human Feedback, RLHF) w wersjach text-davinci-003 i gpt-3.5-turbo. Przy czym wcześniejsza wersja text-davinci-002 trenowana była z użyciem supervised fine-tuning (SFT), a nie RLHF. Model trenowany był na rozszerzonych korpusach tekstów, obejmujących Common Crawl, Books, WebText i inne źródła wysokiej jakości. Okno kontekstowe we wczesnych popularnych wersjach (gpt-3.5-turbo) wynosiło 4 096 tokenów; następnie OpenAI wydała zaktualizowane wersje z kontekstem do 16 385 tokenów[10].

W praktyce GPT-3.5 był adaptowany do rozwiązywania szerokiego zakresu zadań przetwarzania języka naturalnego, takich jak:

  • Generowanie spójnego i logicznego tekstu;
  • Odpowiedzi na pytania (QA) i rozumienie kontekstu;
  • Podążanie za wieloetapowymi instrukcjami;
  • Ulepszone utrzymywanie długoterminowego kontekstu w dialogach.

Na bazie GPT-3.5 wydano kilka kluczowych wersji przeznaczonych do różnych celów:

  • text-davinci-002 — pierwszy ogólnodostępny model oparty na GPT-3.5, zoptymalizowany pod kątem generacji i podążania za instrukcjami (trenowany z pomocą SFT).
  • text-davinci-003 — ulepszona wersja o jeszcze większej zdolności do wnioskowania i generowania złożonych tekstów (trenowana z zastosowaniem RLHF).
  • gpt-3.5-turbo — najbardziej wydajna i ekonomiczna wersja GPT-3.5, używana w serwisie ChatGPT od końca 2022 roku.

GPT-4

Model GPT-4 został przedstawiony przez OpenAI 14 marca 2023 roku w pracy "GPT-4 Technical Report\". Stanowił kolejny etap rozwoju rodziny modeli językowych, oferując znaczące ulepszenia w zakresie rozumienia tekstu, generowania sensownych i kreatywnych odpowiedzi oraz przetwarzania danych multimodalnych. Dokładna liczba parametrów i szczegóły architektoniczne modelu nie zostały oficjalnie ujawnione — raport techniczny GPT-4 wprost wskazuje, że informacje o architekturze, rozmiarze modelu, sprzęcie, kosztach obliczeniowych treningu i budowie zbiorów danych nie są publikowane[11]. Według nieoficjalnych zewnętrznych szacunków GPT-4 mógł stosować podejście Mixture of Experts (MoE) i mieć łączną skalę rzędu ~1,8 biliona parametrów, jednak OpenAI tych liczb oficjalnie nie potwierdzała ani nie dementowała[12].

GPT-4 jest modelem multimodalnym, zdolnym przyjmować na wejściu zarówno tekst, jak i obrazy. Należy zaznaczyć, że w momencie pierwotnego uruchomienia w marcu 2023 roku dostępna była jedynie modalność tekstowa; obsługa wejścia obrazów została wdrożona później. Okno kontekstowe wynosiło 8 192 tokeny w wersji podstawowej i 32 768 tokenów w wariancie GPT-4-32k. Model stosował metody RLHF (uczenie ze wzmocnieniem na podstawie informacji zwrotnej od człowieka).

Trening GPT-4 odbywał się na połączeniu dużych korpusów tekstowych i multimodalnych. Szczegółowe informacje dotyczące danych treningowych, sprzętu i metodologii nie są ujawniane w oficjalnych publikacjach OpenAI.

Trening przebiegał w kilku etapach:

  • rozległy nienadzorowany wstępny trening na tekstach i obrazach,
  • nadzorowane dostrajanie (supervised fine-tuning) na wyspecjalizowanych zadaniach,
  • końcowy etap uczenia ze wzmocnieniem na podstawie informacji zwrotnej od człowieka (RLHF) w celu poprawy niezawodności, bezpieczeństwa i jakości interpretacji instrukcji.

Na bazie GPT-4 wydano kilka głównych wersji:

  • GPT-4 (marzec 2023): wersja podstawowa z obsługą wejścia tekstowego (obsługa obrazów dodana później); okno kontekstowe 8 192 tokeny; wydano również wariant GPT-4-32k z kontekstem 32 768 tokenów.
  • GPT-4 Turbo (listopad 2023): zoptymalizowana modyfikacja GPT-4 z rozszerzonym oknem kontekstowym do 128 000 tokenów[13]; zmniejszone koszty obliczeniowe i przyspieszona generacja; obsługa trybów wywoływania funkcji (function calling) i wyjścia JSON.
  • GPT-4o (maj 2024): multimodalna wersja nowej generacji; w ogłoszeniu premierowym pozycjonowana jako model omni, zdolny pracować z tekstem, obrazami i audio w czasie rzeczywistym (w odróżnieniu od GPT-4 Turbo, gdzie różne modalności obsługiwane były przez oddzielne moduły); przy czym bazowy model API gpt-4o opisywany jest jako wejście tekst+obraz, wyjście tekst; okno kontekstowe 128 000 tokenów.
  • GPT-4.5 (luty 2025): wersja badawcza (research preview); w system card OpenAI wprost wskazuje, że model „builds on GPT-4o\"[3]; ulepszona generacja złożonych tekstów, zwiększona dokładność wykonywania instrukcji i zmniejszony poziom halucynacji; okno kontekstowe 128 000 tokenów. Opisywany jako „ostatni model OpenAI bez chain-of-thought\" (kryptonim — Orion)[14]. W API model gpt-4.5-preview został ogłoszony deprecated 14 kwietnia 2025 roku i wyłączony 14 lipca 2025 roku[4].
  • GPT-4.1 (kwiecień 2025): stabilna wersja z radykalnym rozszerzeniem kontekstu do 1 047 576 tokenów; przyjmuje tekst i obrazy na wejściu, generuje tekst na wyjściu[15]; wydana jednocześnie w trzech wariantach (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); początkowo dostępna wyłącznie przez API, później wdrożona w ChatGPT.

GPT-5

7 sierpnia 2025 roku OpenAI przedstawiła GPT‑5 jako swój ówcześnie „najmądrzejszy, najszybszy i najbardziej użyteczny\" model, z wbudowanym trybem pogłębionego wnioskowania (thinking) i skupieniem na praktycznych scenariuszach — pisaniu, programowaniu, zagadnieniach zdrowotnych i rozumieniu multimodalnym. GPT‑5 stopniowo stał się domyślnym modelem dla większości zalogowanych użytkowników ChatGPT, wypierając wcześniej używane modele z rodziny GPT‑4/4o i serii o‑.[16]

GPT‑5 jest zrealizowany jako zunifikowany system z dwoma głównymi trybami działania: szybkie, ekonomiczne odpowiedzi na codzienne zapytania (umownie gpt‑5 main) oraz pogłębione wnioskowanie dla złożonych zadań (umownie gpt‑5 thinking). Wybór trybu odbywa się automatycznie za pomocą routera, który uwzględnia typ dialogu, złożoność zapytania, konieczność użycia narzędzi oraz jawne wskazówki użytkownika (np. „think step by step\" lub „analyze in depth\"). W ChatGPT użytkownikowi dostępne są tryby Auto / Instant / Thinking / Pro; warianty mini i nano to przede wszystkim modele API, a mini w produkcie użytkownika może być używane jako rozwiązanie awaryjne po wyczerpaniu limitu[17].

Przez interfejs programistyczny udostępniane jest kilka rozmiarów i konfiguracji GPT‑5; w dokumentacji OpenAI jako główne warianty wskazane są gpt‑5, gpt‑5‑mini i gpt‑5‑nano (wszystkie obsługują tekst i dane wizualne). Maksymalne łączne okno kontekstowe dla rodziny GPT‑5 w API wynosi około 400 000 tokenów (z podziałem budżetów na wejście i wnioskowanie/wyjście), przy czym konkretne limity mogą się różnić w zależności od wybranego wariantu modelu i produktu[18].

W szeregu benchmarków wyszukiwania internetowego i faktograficznych GPT‑5 wykazuje wyraźne zmniejszenie częstotliwości halucynacji i błędów w porównaniu z modelami GPT‑4o i wcześniejszymi modelami OpenAI z trybem „thinking\". W oficjalnym ogłoszeniu OpenAI podawała szacunki redukcji błędów o około 45 % w porównaniu z GPT-4o i około 80 % w porównaniu z o3 w trybie thinking — wyniki te uzyskano w specyficznych warunkach: z włączonym wyszukiwaniem internetowym na zanonimizowanych promptach reprezentatywnych dla ruchu produkcyjnego ChatGPT[19].

GPT-5.1

Model GPT-5.1 został przedstawiony przez OpenAI 12 listopada 2025 roku jako pierwsza znacząca iteracja po bazowym GPT-5, ukierunkowana na poprawę codziennych interakcji, konwersacyjności i adaptacyjności. Model zachowuje zunifikowany system z szybkim trybem (GPT-5.1 Instant) i pogłębionym wnioskowaniem (GPT-5.1 Thinking), ale wprowadza adaptacyjne myślenie (adaptive reasoning): model dynamicznie określa ilość obliczeń w zależności od złożoności zapytania, co czyni go wyraźnie szybszym na prostych zadaniach bez utraty jakości na złożonych.

Trening GPT-5.1 oparty był na bazie GPT-5 z dodatkowym etapem post-treningu obejmującym rozszerzony RLHF, skupienie na naturalności tonu i zmniejszenie „chłodności\" odpowiedzi. Okno kontekstowe w API wynosi 400 000 tokenów, maksymalne wyjście — 128 000 tokenów[20]. Pojawiła się obsługa rozszerzonego cache'owania promptów do 24 godzin, co znacząco obniża koszty i opóźnienia przy wieloetapowych dialogach[21].

Kluczowe cechy:

  • GPT-5.1 Instant — główny tryb do codziennych zadań; po raz pierwszy stosuje adaptive reasoning, aby określać, kiedy warto „pomyśleć\" przed odpowiedzią na bardziej złożone zapytanie[21].
  • GPT-5.1 Thinking — adaptacyjne przydzielanie czasu na wnioskowanie; według danych OpenAI, na reprezentatywnym rozkładzie zadań ChatGPT model jest mniej więcej dwukrotnie szybszy na najprostszych zadaniach i mniej więcej dwukrotnie wolniejszy na najtrudniejszych w porównaniu z GPT-5 Thinking[21].
  • Ulepszona multimodalność (tekst + vision).
  • Ulepszone scenariusze coding i agentic, a także efektywność na prostych zadaniach dzięki adaptive reasoning i extended prompt caching[22].

GPT-5.2

Model GPT-5.2 został wydany 11 grudnia 2025 roku jako „najbardziej zaawansowany model serii do pracy profesjonalnej i nauki\". Jest to ewolucja GPT-5.1 z naciskiem na wartość ekonomiczną: generowanie tabel, prezentacji, złożonego kodu, zadań end-to-end. Zachowuje zunifikowaną architekturę z trybami Instant, Thinking i nowym Pro (dla zadań wymagających maksymalnej mocy obliczeniowej i czasu na wnioskowanie).

Trening obejmował zaktualizowany korpus z datą graniczną wiedzy sierpień 2025, wzmocniony instruction-tuning i RLHF w celu zmniejszenia błędów w scenariuszach wieloetapowych. Kontekst — 400K tokenów (128K maksymalne wyjście). Model stał się bardziej niezawodny w scenariuszach profesjonalnych, z lepszą dokładnością faktograficzną i korzystaniem z narzędzi.

Na bazie GPT-5.2 18 grudnia 2025 roku wydano specjalistyczny GPT-5.2-Codex — agentowy model coding z ulepszonym kompresowaniem kontekstu (context compaction), obsługą systemu Windows, wzmocnionym cyberbezpieczeństwem i long-horizon reasoning (zadania trwające do kilku godzin).

Według stanu na 13 lutego 2026 roku, po wycofaniu z eksploatacji szeregu starszych modeli, GPT-5.2 tymczasowo stał się domyślnym modelem w ChatGPT. Jednak już na początku marca 2026 roku tę rolę przejęły GPT‑5.3 Instant i GPT‑5.4[17].

GPT-5.3-Codex

GPT-5.3-Codex został przedstawiony 5 lutego 2026 roku jako „najpotężniejszy agentowy model coding na dziś\". Jest to połączenie frontier-coding zdolności GPT-5.2-Codex z profesjonalnym reasoning GPT-5.2 w jednym modelu, który jest o 25 % szybszy od poprzedników.

Model zdolny jest wykonywać praktycznie dowolne zadania programistyczne: long-running workflows, research, korzystanie z narzędzi, wykonywanie kodu, interactive steering (użytkownik może interweniować w czasie rzeczywistym bez utraty kontekstu). Wczesne wersje modelu były używane przez zespół OpenAI do debugowania własnego treningu, wdrożeń i ewaluacji.

Kluczowe wyniki w momencie ogłoszenia 5 lutego 2026 roku: Terminal-Bench ~77,3 %, OSWorld-Verified ~64,7 %, SWE-Bench Pro ~56,8 %. W późniejszym wydaniu GPT-5.4 z 5 marca 2026 roku OpenAI podała zaktualizowany wynik OSWorld-Verified 74,0 % dla GPT-5.3-Codex przy użyciu nowego parametru API zachowującego oryginalne rozdzielczości obrazu[23][7].

12 lutego 2026 roku OpenAI wydała również GPT-5.3-Codex-Spark — kompaktową ultra-fast wersję we współpracy z Cerebras, zoptymalizowaną pod kątem czasu rzeczywistego: ponad 1000 tokenów na sekundę, text-only, kontekst 128K. Na starcie był to rollout dla użytkowników ChatGPT Pro w Codex i niewielkiej liczby API design partners, a nie szeroko dostępny model API[24].

GPT-5.4

5 marca 2026 roku OpenAI przedstawiła GPT‑5.4 jako nowy model frontier do pracy profesjonalnej. GPT‑5.4 łączy mocne strony ostatnich wydań OpenAI w zakresie reasoning, coding i agentic workflows oraz jako pierwszy w głównej linii otrzymał wbudowane możliwości computer use. Jednocześnie OpenAI wydała GPT‑5.4 Pro — wariant dla najtrudniejszych zadań, wykorzystujący więcej mocy obliczeniowej i dłuższe wnioskowanie[7].

W API model gpt-5.4 opisywany jest jako domyślnie rekomendowany do szerokiego zakresu zadań general-purpose i coding; okno kontekstowe wynosi 1 050 000 tokenów, maksymalne wyjście — 128 000 tokenów. Model przyjmuje tekst i obrazy na wejściu i generuje tekst na wyjściu[8][25].

W ChatGPT tryb Auto według stanu na 7 marca 2026 roku automatycznie przełącza się między GPT‑5.3 Instant a GPT‑5.4 Thinking, natomiast GPT‑5.4 Pro dostępny jest jako oddzielny tryb wysokich możliwości. Dla zalogowanych użytkowników ChatGPT domyślnym modelem jest GPT‑5.3[17].

Rozwój modeli GPT

Rozwój modeli GPT
Generacja Rok wydania Liczba parametrów Rozmiar korpusu tekstów Kluczowe cechy
GPT-1 2018 ≈117–124 mln[26] ≈5 GB (BooksCorpus) Generatywny wstępny trening na dużych korpusach; dwuetapowy trening (pre-training + fine-tuning)
GPT-2 2019 1,5 mld ≈40 GB (WebText) Znacznie ulepszona generacja tekstu; demonstracja silnego zachowania zero-shot; początkowo częściowa publikacja modelu
GPT-3 2020 175 mld ≈570 GB (Common Crawl, WebText2 i inne) Rozległe in-context learning; wyraźne możliwości few-shot i zero-shot bez dostrajania
GPT-3.5 2022 Nie ujawniono (wersje davinci przypuszczalnie ~175 mld) >570 GB + dodatkowe korpusy i instruction tuning Ulepszona stabilność i podążanie za instrukcjami; podstawa wczesnych wersji ChatGPT
GPT-4 2023 Nie ujawniono[27] Nie ujawniono Multimodalność (tekst + obrazy); zwiększona dokładność i odporność na halucynacje; kontekst 8k/32k tokenów
GPT-4 Turbo 2023 Nie ujawniono Bazuje na treningu GPT-4 (szczegóły nie ujawnione) Zwiększenie kontekstu do 128 000 tokenów; optymalizacja szybkości i kosztu generacji
GPT-4o 2024 Nie ujawniono Dane multimodalne (tekst, obrazy, audio) Jednolite multimodalne przetwarzanie w sieci neuronowej; wysoka szybkość odpowiedzi
GPT-4.5 2025 Nie ujawniono Rozszerzone korpusy tekstowe i multimodalne Wersja badawcza na bazie GPT-4o; redukcja błędów; deprecated do 2026 roku
GPT-4.1 2025 Nie ujawniono Zaktualizowane korpusy Kontekst do 1 047 576 tokenów; tekst + obrazy na wejściu, tekst na wyjściu
GPT-5 2025 (sierpień) Nie ujawniono Wielkoskalowe korpusy multimodalne Zunifikowany system z trybami szybkiej odpowiedzi i wnioskowania; kontekst ~400K tokenów; redukcja halucynacji
GPT-5.1 2025 (listopad) Nie ujawniono Rozszerzone korpusy GPT-5 + RLHF Adaptacyjne reasoning; 24h prompt caching; ulepszenia w coding
GPT-5.2 2025 (grudzień) Nie ujawniono Data graniczna wiedzy sierpień 2025 Tryb Pro; professional knowledge work; GPT-5.2-Codex (agentowy coding)
GPT-5.3-Codex 2026 (luty) Nie ujawniono Zaktualizowane + self-improvement data 25 % szybszy; full-spectrum agent; interactive steering
GPT-5.3-Codex-Spark 2026 (luty) Nie ujawniono Kompaktowy >1000 t/s na Cerebras; real-time coding; kontekst 128K
GPT-5.3 Instant 2026 (marzec) Nie ujawniono Nie ujawniono Aktualizacja najczęściej używanego modelu konwersacyjnego ChatGPT; ulepszone factuality, web search i conversational flow
GPT-5.4 2026 (marzec) Nie ujawniono Nie ujawniono Nowy model frontier do pracy profesjonalnej; native computer use; domyślny model w API dla general-purpose i większości zadań coding
GPT-5.4 Pro 2026 (marzec) Nie ujawniono Nie ujawniono Wariant GPT-5.4 z większą mocą obliczeniową dla najtrudniejszych zadań

Parametry architektoniczne modeli GPT

Parametry architektoniczne modeli GPT
Model Rok wydania Liczba parametrów Liczba warstw Rozmiar stanu ukrytego Liczba głowic uwagi Okno kontekstowe Rozmiar korpusu treningowego
GPT-1 2018 ≈117–124 mln 12 768 12 512 tokenów ≈5 GB (BooksCorpus)
GPT-2 2019 1,5 mld 48 1 600 25 1 024 tokeny ≈40 GB (WebText)
GPT-3 2020 175 mld 96 12 288 96 2 048 tokenów ≈570 GB (Common Crawl + WebText2 + inne)
GPT-3.5 2022 Nie ujawniono (wersje davinci przypuszczalnie ~175 mld) (szacunkowo zbliżone do GPT-3) (szacunkowo zbliżone do GPT-3) (nie ujawniono) Do 4 096 tokenów (wczesne); do 16 385 tokenów (późne) Rozszerzony Common Crawl + dodatkowe zbiory danych i instruction tuning
GPT-4 2023 Nie ujawniono (nie ujawniono) (nie ujawniono) (nie ujawniono) 8 192 tokeny (podstawowa); 32 768 (GPT-4-32k) Nie ujawniono
GPT-4 Turbo 2023 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) Do 128 000 tokenów Zoptymalizowana wersja GPT-4 (szczegóły korpusu nie ujawnione)
GPT-4o 2024 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) Do 128 000 tokenów Dane multimodalne: tekst, obrazy, audio
GPT-4.5 2025 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) Do 128 000 tokenów Zaktualizowane korpusy tekstowe i multimodalne
GPT-4.1 2025 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) Do 1 047 576 tokenów Multimodalność; trening na dużą skalę z naciskiem na długie konteksty
GPT-5 2025 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) Do ≈400 000 tokenów (łączny kontekst) Wielkoskalowe korpusy multimodalne (szczegóły nie ujawnione)
GPT-5.4 2026 (nie ujawniono) (nie ujawniono) (nie ujawniono) (nie ujawniono) 1 050 000 tokenów; 128 000 max output Nie ujawniono

Odnośniki

  • „Improving language understanding with unsupervised learning\", OpenAI, 11 czerwca 2018
  • „Better language models and their implications\", OpenAI, 14 lutego 2019
  • „GPT-2: 6-month follow-up\", OpenAI, 20 sierpnia 2019
  • „GPT-2: 1.5B release\", OpenAI, 5 listopada 2019
  • „Language models are few-shot learners\", OpenAI, 28 maja 2020
  • „OpenAI API\", OpenAI, 11 czerwca 2020
  • „Introducing ChatGPT\", OpenAI, 30 listopada 2022
  • „Function calling and other API updates\", OpenAI, 13 czerwca 2023
  • „GPT-4\", OpenAI, 14 marca 2023
  • „New models and developer products announced at DevDay\", OpenAI, 6 listopada 2023
  • „Hello GPT-4o\", OpenAI, 13 maja 2024
  • „Introducing GPT-4.1 in the API\", OpenAI, 14 kwietnia 2025
  • „Introducing GPT-4.5\", OpenAI, 27 lutego 2025
  • „Introducing GPT-5\", OpenAI, 7 sierpnia 2025
  • „GPT-5.1: A smarter, more conversational ChatGPT\", OpenAI, 12 listopada 2025
  • „Introducing GPT-5.2\", OpenAI, 11 grudnia 2025
  • „Introducing GPT-5.2-Codex\", OpenAI, 18 grudnia 2025
  • „Introducing GPT-5.3-Codex\", OpenAI, 5 lutego 2026
  • „Introducing GPT-5.3-Codex-Spark\", OpenAI, 12 lutego 2026
  • „GPT-5.3 Instant: Smoother, more useful everyday conversations\", OpenAI, 3 marca 2026
  • „Introducing GPT-5.4\", OpenAI, 5 marca 2026
  • „Using GPT-5.4\", OpenAI Developers
  • „Models\", OpenAI API
  • „Deprecations\", OpenAI API
  • „GPT-5.3 and GPT-5.4 in ChatGPT\", OpenAI Help Center
  • „Retiring GPT-4o and other ChatGPT models\", OpenAI Help Center

Przypisy

  1. OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
  2. OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
  3. 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
  4. 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
  5. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  6. OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
  7. 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
  8. 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
  9. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  10. OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
  11. OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
  12. Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
  13. Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
  14. Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
  15. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  16. OpenAI. «Introducing GPT-5» (7 августа 2025).
  17. 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
  18. OpenAI API documentation. Models: GPT-5.
  19. OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
  20. OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
  21. 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
  22. OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
  23. OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
  24. OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
  25. OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
  26. Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
  27. По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.

Literatura

  • Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.