GPT (OpenAI) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT (Generative Pre-trained Transformer) — ito ay isang pamilya ng malalaking language model (LLM), na binuo ng kumpanyang OpenAI. Ang mga modelo ng GPT ay itinayo sa arkitektura ng transformer at isinasagawa ang paradigma ng generative pre-training: sa unang yugto, natututo ang modelo sa malalawak na korpus ng mga teksto nang walang malinaw na pagtatatanda, at pagkatapos ay maaaring i-fine-tune para sa mga partikular na gawain. Para sa mga huling henerasyon (simula sa GPT‑5) ginagamit din ng OpenAI ang terminong pinag-isang sistema (unified system), dahil pinagsama ng produkto ang mabilis na mode ng pagsagot, ang mode ng malalim na pangangatwiran (reasoning) at ang router[1].

Pangalan

Ang daglat na GPT ay nangangahulugang Generative Pre-trained Transformer (Generative Pre-trained Transformer).

  • Generative (Generatibo): nangangahulugang ang modelo ay may kakayahang lumikha (mag-generate) ng bagong nilalaman, halimbawa, teksto.
  • Pre-trained (Paunang Sinanay): nagpapahiwatig na ang modelo ay dumadaan sa malawak na unang yugto ng pagsasanay sa malaking hanay ng data (halimbawa, mga teksto mula sa internet). Pagkatapos ng pre-training, ang modelo ay kadalasang maaaring karagdagang i-fine-tune upang matupad ang mas tiyak na mga gawain.
  • Transformer (Transformer): ito ang pangalan ng partikular na arkitektura ng neural network, na siyang pangunahing pagbabago sa pundasyon ng GPT at marami pang iba sa mga modernong AI model.

Ang pangunahing katangian ng GPT ay ang pagsasanay ay nagaganap sa autoregressive na anyo — hinuhulaan ng modelo ang susunod na token batay sa nakaraang konteksto. Ibig sabihin, natututo ang modelo na i-maximize ang posibilidad ng susunod na token, nalalaman ang pagkakasunod-sunod ng mga nakaraang token. Sa panahon ng pagsasanay, ang pagkakamali sa paghula ng susunod na elemento ay pinaliit, na nagpapahintulot sa pagbuo ng mga teksto na may mataas na koherensya at pagkakakonekta.

Proseso ng Pagbuo ng Teksto sa GPT

Binubuo ng modelo ng GPT ang teksto nang sunud-sunod, token sa token, ayon sa sumusunod na paulit-ulit na pamamaraan:

  • Tinatanggap bilang input ang paunang tekstwal na pagkakasunod-sunod (prompt, seed text).
  • Kinakalkula ang distribusyon ng posibilidad sa lahat ng token ng bokabularyo para sa susunod na elemento ng teksto.
  • Pinipili ang susunod na token:
    • alinman sa pamamagitan ng pinakamataas na posibilidad (greedy selection),
    • o sa pamamagitan ng pamamaraan ng stochastic sampling (sampling),
    • o gamit ang mga espesyal na filtering strategy (top-k, top-p).
  • Idinaragdag ang napiling token sa kasalukuyang pagkakasunod-sunod.
  • Ang na-update na pagkakasunod-sunod ay muling ipinasok sa modelo upang mahulaan ang susunod na token.

Arkitektura ng Transformer: Pagproseso ng Teksto

Ang proseso ng pagproseso ng data sa loob ng transformer para sa paghula ng susunod na token ay may kasamang ilang pangunahing yugto:

  • Tokenization (Tokenization). Ang input na teksto ay nahahati sa mga token — maliliit na yunit ng teksto, na maaaring maging mga salita, bahagi ng mga salita, o mga bantas. Sa modelo ng GPT-3, halimbawa, ang bokabularyo ay naglalaman ng humigit-kumulang 50,257 token.
  • Embedding ng Token (Embeddings). Ang bawat token ay binabago sa isang vector ng nakapirming haba gamit ang matrix ng mga embedding (W_E). Ang mga vector ay nag-e-encode ng kahulugan ng mga token: ang mga semantikong malapit na token ay matatagpuan nang magkatabi sa multidimensional na espasyo. Sa modelo ng GPT-3, ang dimensyon ng mga embedding ay 12,288.
  • Pagproseso sa mga layer ng transformer.
    • Attention Blocks (Mga Bloke ng Atensyon): Ang bawat token ay nakikipag-ugnayan sa iba pang mga token ng pagkakasunod-sunod. Ang mekanismo ng atensyon ay nagpapahintulot sa pagsasaalang-alang ng konteksto at wastong interpretasyon ng kahulugan ng mga salita.
    • Feed-Forward Layers (Mga Ganap na Konektadong Layer): Pagkatapos ng atensyon, ang bawat token ay hiwalay na pinoproseso sa pamamagitan ng dalawang layer na neural network na may nonlinear na activation.
  • Kabaligtarang Pagbabago at Softmax. Pagkatapos ng lahat ng layer, ang naprosesong vector ay binabago pabalik sa espasyo ng token gamit ang matrix (W_U), na madalas na transposed na bersyon ng W_E. Ang resultang vector ng logit ay normalized gamit ang Softmax function upang makuha ang distribusyon ng posibilidad sa lahat ng token.
  • Pagpili ng Susunod na Token (Sampling). Ang susunod na token ay pinili batay sa distribusyon ng posibilidad. Ang parameter ng temperatura (temperature) ay namamahala sa randomness ng pagpili: sa temperatura na 0, pinipili ang pinaka-malamang na token, sa mas mataas na temperatura, tumataas ang posibilidad ng pagpili ng mas hindi malamang na mga opsyon, na nagtataguyod ng mas malaking pagkakaiba-iba ng teksto.

Mga Modelo ng GPT

  • GPT-1 (2018): unang modelo ng pamilya; 12-layer decoder-only transformer; pagsasanay sa dalawang yugto (pre-training + fine-tuning sa mga gawain ng NLP).
  • GPT-2 (2019): 1.5 bilyong parameter; pagsasanay sa korpus ng WebText; sa unang pagkakataon ay nagagawang mag-generate ng mahahabang magkakaugnay na teksto; pagpapabuti ng kalidad ng zero-shot na pagbuo. Inihayag noong Pebrero 14, 2019, ang buong bersyon (1.5 bilyon) ay inilathala noong Nobyembre 5, 2019 para sa mga kadahilanang pangkaligtasan.
  • GPT-3 (2020): 175 bilyong parameter; malawakang pagsasanay sa pinagsama-samang Common Crawl, Books, Wikipedia; matibay na pag-unlad ng mga kakayahan ng few-shot at zero-shot.
  • GPT-3.5 (2022): intermediate na bersyon sa pagitan ng GPT-3 at GPT-4; pinahusay na pagsunod sa mga tagubilin sa pamamagitan ng pagsasanay na may feedback ng tao (RLHF) sa mga bersyon ng text-davinci-003 at gpt-3.5-turbo; kontekstwal na window na hanggang 4,096 token sa mga maagang bersyon at hanggang 16,385 token sa mga susunod na bersyon (gpt-3.5-turbo-16k at na-update na gpt-3.5-turbo).
  • GPT-4 (2023): multimodal na modelo na may tekstwal at grapikong input (ang suporta para sa mga imahe ay na-deploy nang mas huli, pagkatapos ng tekstwal na paglulunsad); kontekstwal na window na 8,192 token sa batayang bersyon at 32,768 token sa variant na GPT-4-32k; makabuluhang pagpapataas ng katumpakan, katatagan at lohika ng pangangatwiran.
  • GPT-4 Turbo (2023): na-optimize na bersyon ng GPT-4; pinapalaki ang kontekstwal na window hanggang 128,000 token; mas mababang latency at gastos sa operasyon.
  • GPT-4o (2024): multimodal na modelo ng bagong henerasyon (teksto, imahe, audio) na may nag-iisang arkitektura ng neural network; napakataas na bilis at katumpakan ng mga tugon; kontekstwal na window na 128,000 token.
  • GPT-4.5 (2025): research preview; sa system card ng OpenAI ay tinukoy na ang modelo ay "builds on GPT-4o"[2][3]; pinahusay na pag-unawa sa mga kahilingan ng gumagamit, pagbabawas ng bilang ng mga pagkakamali; kontekstwal na window na 128,000 token. Sa API, ang modelo gpt-4.5-preview ay inihayag na deprecated noong Abril 14, 2025 at pinatigil noong Hulyo 14, 2025[4].
  • GPT-4.1 (2025): pinahusay na bersyon ng pamilya ng GPT-4 na may kontekstwal na window na hanggang 1 milyong token; tumatanggap ng teksto at mga imahe bilang input, naglalabas ng teksto[5]. Inilabas nang sabay-sabay sa tatlong variant: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
  • GPT-5 (2025): pinag-isang sistema na may mga mode ng mabilis na pagsagot at malalim na pangangatwiran; kontekstwal na window na humigit-kumulang 400,000 token; kapansin-pansing pagbabawas ng mga hallucination sa mga gawain na batay sa katotohanan.
  • GPT-5.1 (2025): adaptive reasoning, mga pagpapabuti sa coding at long-context retention.
  • GPT-5.2 (2025): diin sa propesyonal na trabaho; Pro mode para sa mga frontier na gawain; batay sa GPT-5.2 ay inilabas ang agentic na GPT-5.2-Codex.
  • GPT-5.3-Codex (2026): agentic coding model na pinagsama ang mga kakayahan sa coding at reasoning; 25% mas mabilis kaysa sa mga nauna.
  • GPT-5.3 Instant (2026): pag-update ng pinaka-ginagamit na conversational model ng ChatGPT; inilabas noong Marso 3, 2026. Pinahusay ang katumpakang paktwal, kalidad ng web search, kadaloy ng diyalogo at nabawasan ang bilang ng mga labis na pagtanggi at labis na pag-iingat. Sa API ay available bilang gpt-5.3-chat-latest[6].
  • GPT-5.4 (2026): frontier model ng OpenAI para sa propesyonal na trabaho, ipinakita noong Marso 5, 2026; unang general-purpose model ng OpenAI na may native computer-use capabilities. Sa API gpt-5.4 ay inirerekomenda bilang default na modelo para sa malawak na hanay ng mga general-purpose at coding na gawain[7][8].

GPT-1

Ang unang modelo, GPT-1, ay ipinakita ng kumpanyang OpenAI noong 2018 sa pananaliksik na "Improving Language Understanding by Generative Pre-Training". Ang modelo ay kumakatawan sa isang 12-layer na decoder-only transformer[9] at itinayo batay sa arkitektura ng transformer. Ang pagsasanay ng GPT-1 ay nangyari sa dalawang yugto: ang yugto ng hindi kontroladong generative pre-training, na sinundan ng yugto ng kontroladong fine-tuning.

Sa yugto ng pre-training, ang modelo ay sinanay sa korpus ng BookCorpus, na naglalaman ng mahigit 7,000 hindi pa nailalathala na mga aklat ng iba't ibang genre. Ang kaibahan ng korpus na ito ay ang pagkakaroon ng mahahabang tuluy-tuloy na mga sipi ng teksto, na kritikal na mahalaga para sa pagbuo sa modelo ng kakayahang mag-proseso ng kumplikado at mahabang mga tekstwal na dependency.

Sa yugto ng fine-tuning, ang modelo ay ina-adapt sa paglutas ng mga espesyal na gawain sa natural language processing, kabilang ang:

  • Mga sagot sa mga tanong (Question Answering, QA) — pagbuo ng tamang sagot batay sa ibinigay na tekstwal na konteksto;
  • Pagkilala sa tekstwal na implikasyon (Natural Language Inference, NLI) — pagtukoy ng lohikal na relasyon sa pagitan ng dalawang teksto: implikasyon, kontradiksyon o neutralidad;
  • Pagsusuri ng semantikong pagkakatulad (Semantic Textual Similarity) — pagsukat ng antas ng pagkakatulad ng kahulugan sa pagitan ng dalawang tekstwal na pagkakasunod-sunod.

Sa pamamagitan ng ganitong diskarte, ipinakita ng GPT-1 ang makabuluhang kahusayan sa nakaraang mga modelo sa ilang karaniwang benchmark para sa mga gawain ng pag-unawa sa teksto.

Ipinakita ng pagbuo ng GPT-1 ang ilang pangunahing tagumpay at natuklasan sa larangan ng natural language processing (NLP):

  • Bisa ng generative pre-training. Empirikong kinumpirma na ang pre-training sa malalaking korpus ng hindi naka-label na teksto ay nagbibigay-daan sa modelo na makakuha ng mga unibersal na representasyon ng wika, na angkop para sa kasunod na paggamit sa iba't ibang mga praktikal na gawain nang hindi nangangailangan ng mga pundamental na pagbabago sa arkitektura.
  • Unibersalidad ng arkitektura ng transformer. Ang paggamit ng multi-layer na decoder transformer ay nagpahintulot sa modelo na matagumpay na maproseso ang mga pangmatagalang dependency sa teksto, na dati ay mahirap para sa mga modelo batay sa recurrent neural network.
  • Pagbabawas ng pag-asa sa pagtatatanda ng data. Kinumpirma ng pananaliksik na ang malakihang pre-training sa hindi naka-label na data ay maaaring makabuluhang bawasan ang dami ng naka-label na data na kinakailangan upang makamit ang mataas na kalidad sa mga target na gawain.
  • Pundasyon para sa kasunod na pag-unlad. Ang mga resulta ng GPT-1 ay naglatag ng mga konseptwal at teknikal na pundasyon para sa mga susunod na bersyon ng mga modelo ng pamilya ng GPT (GPT-2, GPT-3 at higit pa).

GPT-2

Ang modelo ng GPT-2 ay inihayag ng kumpanyang OpenAI noong Pebrero 14, 2019. Ito ay malaki ang pagtatangi sa nauna nito sa laki: ang buong bersyon ng modelo ay naglalaman ng humigit-kumulang 1.5 bilyong parameter. Para sa mga kadahilanang pangkaligtasan, unang nag-publish ang OpenAI ng mga pinababa na variant ng modelo; ang buong bersyon (1.5 bilyong parameter) ay inilabas noong Nobyembre 5, 2019. Hindi tulad ng GPT-1, na sinanay sa korpus ng BookCorpus (~5 GB), ang GPT-2 ay sinanay sa espesyal na pinagsama-samang korpus ng WebText na may sukat na humigit-kumulang 40 GB, na naglalaman ng mga tekstwal na data mula sa mga mapagkukunan sa internet na may mataas na antas ng kalidad. Ang pagdaragdag ng parehong laki ng modelo at dami ng data ng pagsasanay ay nagpahintulot sa GPT-2 na makabuluhang mapabuti ang kalidad ng pagbuo ng teksto: ipinakita nito ang kakayahang lumikha ng mga makabuluhang artikulo, kwento at maging mga magkakaugnay na sipi ng kathang-isip na prosa.

Ang GPT-2 ay gumagamit ng autoregressive decoder transformer architecture, katulad ng GPT-1, nang walang malalaking pagbabago. Ang modelo ay binubuo ng 48 na layer ng self-attention, mayroon itong laki ng nakatagong estado na 1,600 at naglalaman ng humigit-kumulang 1.5 bilyong parameter. Ang bilang ng mga attention head ay 25 (habang pinapanatili ang laki na 64 bawat head, na minana mula sa GPT-1: 1600 ÷ 64 = 25). Ang pagsasanay ay isinagawa sa gawain ng paghula ng susunod na token batay sa nakaraang konteksto gamit ang masked attention mechanism.

Ang isa sa mga pangunahing pagkakaiba ng GPT-2 ay ang una nitong ipinakita ang mataas na bisa sa mode ng zero-shot learning — ang kakayahang malutas ng mga bagong gawain nang hindi dumadaan sa malinaw na fine-tuning sa mga halimbawa para sa mga gawaing iyon. Ang modelo ay sinanay sa isang malaking korpus ng mga pangkalahatang teksto at hindi dumaan sa espesyal na pagsasanay sa data ng mga partikular na gawain. Ang pagsusuri ay isinagawa sa mode na zero-shot, kung saan ang modelo ay nagtupad ng mga gawain batay lamang sa kaalaman na nakuha sa panahon ng pre-training. Sa ilang mga gawain ng language modeling, ang GPT-2 ay nakamit ang kalidad na maihahambing o higit pa sa mga resulta ng mga modelo na espesyal na sinanay sa mga espesyal na dataset (halimbawa, Wikipedia, mga tekstong balita, mga aklat).

GPT-3

Ang modelo ng GPT-3 ay ipinakita ng kumpanyang OpenAI noong Hunyo 2020 (ang artikulo sa arXiv ay lumabas noong Mayo 28, 2020, ang beta-access sa API ay binuksan noong Hunyo 11, 2020). Ito ang naging susunod na hakbang sa pag-unlad ng mga generative transformer pagkatapos ng GPT-2 at nangibabaw sa pamamagitan ng pagpapalawak ng arkitektura hanggang 175 bilyong parameter, na ginawa itong pinakamalaking language model sa panahong iyon.

Ang arkitektura ng GPT-3 ay nanatiling pangunahing katulad — isang multi-layer na autoregressive decoder transformer nang walang mga kardinal na pagbabago. Ang mga pangunahing pagpapabuti ng pagganap ay nakamit sa pamamagitan ng pagdaragdag ng bilang ng mga layer, lapad ng mga nakatagong layer at sukat ng pagsasanay. Ang modelo ay sinanay sa pinagsamang ilang malalaking korpus ng teksto, kabilang ang Common Crawl, WebText2, Books1, Books2 at Wikipedia. Ang kabuuang dami ng data ay humigit-kumulang 570 GB at higit pa (ang 570 GB ay para sa na-filter na bahagi ng Common Crawl, na nangunguna sa pinaghalong pagsasanay).

Ang isa sa mga pangunahing katangian ng GPT-3 ay ang kakayahan nito sa few-shot learning at zero-shot learning: ang modelo ay makakatupad ng malawak na hanay ng mga gawain sa natural language processing, kabilang ang pagsasalin, summarization, mga sagot sa mga tanong, pagsulat ng sanaysay at maging programming, batay lamang sa ilang mga halimbawa sa tekstwal na kahilingan o nang walang anumang mga halimbawa.

GPT-3.5

Ang modelo ng GPT-3.5 ay ipinakita ng kumpanyang OpenAI sa huling bahagi ng 2022 bilang bahagi ng evolutionary na pag-unlad ng pamilya ng GPT. Ito ay itinayo batay sa arkitektura ng scaled autoregressive decoder transformer na ginamit sa GPT-3, na may mga pagpapabuti sa kalidad ng pagbuo ng teksto, pagproseso ng konteksto at kakayahang sundin ang mga kumplikadong tagubilin. Ang eksaktong bilang ng mga parameter ng GPT-3.5 ay hindi opisyal na inihayag; ang mga bersyon ng davinci ay malamang na katulad ng laki ng GPT-3 (175 bilyon), ngunit ang eksaktong mga parameter ng bersyon na gpt-3.5-turbo ay hindi alam.

Kabilang sa pagsasanay ng GPT-3.5 ang pinalawak na paggamit ng mga pamamaraan ng Reinforcement Learning from Human Feedback (RLHF) sa mga bersyon ng text-davinci-003 at gpt-3.5-turbo. Kasabay nito, ang mas naunang bersyon na text-davinci-002 ay sinanay gamit ang supervised fine-tuning (SFT), hindi RLHF. Ang modelo ay sinanay sa mga pinalawak na korpus ng teksto, kabilang ang Common Crawl, Books, WebText at iba pang mga mapagkukunan ng mataas na kalidad. Ang kontekstwal na window sa mga maagang popular na bersyon (gpt-3.5-turbo) ay 4,096 token; kalaunan ay naglabas ang OpenAI ng mga na-update na bersyon na may konteksto na hanggang 16,385 token[10].

Sa pagsasagawa, ang GPT-3.5 ay ina-adapt sa paglutas ng malawak na hanay ng mga gawain sa natural language processing, tulad ng:

  • Pagbuo ng magkakaugnay at lohikal na teksto;
  • Mga sagot sa mga tanong (QA) at pag-unawa sa konteksto;
  • Pagsunod sa mga multi-step na tagubilin;
  • Pinahusay na pagpapanatili ng pangmatagalang konteksto sa mga diyalogo.

Batay sa GPT-3.5, ilang pangunahing bersyon ang inilabas para sa iba't ibang layunin:

  • text-davinci-002 — unang pangkalahatang available na modelo batay sa GPT-3.5, na-optimize para sa pagbuo at pagsunod sa mga tagubilin (sinanay gamit ang SFT).
  • text-davinci-003 — pinahusay na bersyon na may mas malaking kakayahan sa pangangatwiran at pagbuo ng mga kumplikadong teksto (sinanay gamit ang RLHF).
  • gpt-3.5-turbo — pinaka-makapangyarihan at matipid na bersyon ng GPT-3.5, na ginamit sa serbisyo ng ChatGPT mula sa huling bahagi ng 2022.

GPT-4

Ang modelo ng GPT-4 ay ipinakita ng kumpanyang OpenAI noong Marso 14, 2023 sa pananaliksik na "GPT-4 Technical Report". Ito ang naging susunod na yugto ng pag-unlad ng pamilya ng mga language model, na nag-aalok ng mga makabuluhang pagpapabuti sa larangan ng pag-unawa sa teksto, pagbuo ng mga makabuluhan at malikhain na tugon, pati na rin ang pagproseso ng multimodal na data. Ang eksaktong bilang ng mga parameter at mga detalye ng arkitektura ng modelo ay hindi opisyal na inihayag — ang teknikal na ulat ng GPT-4 ay direktang nagpapahiwatig na ang impormasyon tungkol sa arkitektura, laki ng modelo, hardware, mga gastos sa pagkalkula ng pagsasanay at pagbuo ng mga dataset ay hindi inilalathala[11]. Ayon sa mga hindi opisyal na panlabas na pagtatantya, maaaring gumamit ang GPT-4 ng diskarteng Mixture of Experts (MoE) at magkaroon ng kabuuang sukat na humigit-kumulang ~1.8 trilyong parameter, ngunit hindi opisyal na kinumpirma o itinanggi ng OpenAI ang mga numerong ito[12].

Ang GPT-4 ay isang multimodal na modelo, na may kakayahang tumanggap ng parehong teksto at mga imahe bilang input. Dapat tandaan na sa oras ng unang paglulunsad noong Marso 2023, ang tekstwal na modalidad lamang ang available; ang suporta para sa input ng mga imahe ay na-deploy nang mas huli. Ang kontekstwal na window ay 8,192 token sa batayang bersyon at 32,768 token sa variant na GPT-4-32k. Ang modelo ay gumagamit ng mga pamamaraan ng RLHF (Reinforcement Learning from Human Feedback).

Ang pagsasanay ng GPT-4 ay isinagawa sa pinagsamang malakihang mga tekstwal at multimodal na korpus. Ang mga partikular na detalye ng data ng pagsasanay, hardware at metodolohiya ay hindi inihahayag sa mga opisyal na publikasyon ng OpenAI.

Ang pagsasanay ay nangyari sa ilang yugto:

  • malakihang hindi kontroladong pre-training sa mga teksto at imahe,
  • kontroladong fine-tuning sa mga espesyal na gawain,
  • panghuling yugto ng Reinforcement Learning from Human Feedback (RLHF) upang mapataas ang pagiging maaasahan, kaligtasan at kalidad ng interpretasyon ng mga tagubilin.

Batay sa GPT-4, ilang pangunahing bersyon ang inilabas:

  • GPT-4 (Marso 2023): batayang bersyon na may suporta para sa tekstwal na input (ang suporta para sa mga imahe ay idinagdag nang mas huli); kontekstwal na window na 8,192 token; inilabas din ang variant na GPT-4-32k na may kontekstong 32,768 token.
  • GPT-4 Turbo (Nobyembre 2023): na-optimize na modipikasyon ng GPT-4 na may pinapalaking kontekstwal na window hanggang 128,000 token[13]; nabawasang mga gastos sa pagkalkula at pinabilis na pagbuo; suporta para sa mga mode ng function calling at JSON output.
  • GPT-4o (Mayo 2024): multimodal na bersyon ng bagong henerasyon; sa launch announcement ay itinampok bilang omni model, na may kakayahang magtrabaho sa teksto, mga imahe at audio sa real time (hindi tulad ng GPT-4 Turbo, kung saan ang iba't ibang modalidad ay pinagsilbihan ng mga hiwalay na module); kasabay nito, ang batayang API model gpt-4o ay inilalarawan bilang text+image input, text output; kontekstwal na window na 128,000 token.
  • GPT-4.5 (Pebrero 2025): research preview; sa system card ng OpenAI ay direktang tinukoy na ang modelo ay "builds on GPT-4o"[3]; pinahusay na pagbuo ng mga kumplikadong teksto, nadagdagang katumpakan ng pagsunod sa mga tagubilin at nabawasang antas ng mga hallucination; kontekstwal na window na 128,000 token. Inilalarawan bilang "ang huling modelo ng OpenAI nang walang chain-of-thought" (code name — Orion)[14]. Sa API, ang modelo gpt-4.5-preview ay inihayag na deprecated noong Abril 14, 2025 at pinatigil noong Hulyo 14, 2025[4].
  • GPT-4.1 (Abril 2025): matatag na bersyon na may kardinal na pagpapalawak ng konteksto hanggang 1,047,576 token; tumatanggap ng teksto at mga imahe bilang input, naglalabas ng teksto[15]; inilabas nang sabay-sabay sa tatlong variant (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); sa una ay available lamang sa pamamagitan ng API, kalaunan ay na-deploy sa ChatGPT.

GPT-5

Noong Agosto 7, 2025 ipinakilala ng OpenAI ang GPT‑5 bilang ang sa panahong iyon na "pinaka-matalino, mabilis at kapaki-pakinabang" na modelo, na may built-in na mode ng malalim na pag-iisip (thinking) at pokus sa mga praktikal na sitwasyon — pagsulat, programming, trabaho sa kalusugan at multimodal na pag-unawa. Ang GPT‑5 ay unti-unting naging default na modelo para sa karamihan ng mga naka-authenticate na gumagamit ng ChatGPT, na pinalitaw ang mga dating ginagamit na modelo ng pamilya ng GPT‑4/4o at serye ng o‑.[16]

Ang GPT‑5 ay ipinatupad bilang isang pinag-isang sistema na may dalawang pangunahing mode ng operasyon: mabilis, matipid na mga tugon para sa pang-araw-araw na mga kahilingan (kondisyonal na gpt‑5 main) at malalim na pangangatwiran para sa mga kumplikadong gawain (kondisyonal na gpt‑5 thinking). Ang pagpili ng mode ay awtomatikong nangyayari sa pamamagitan ng router, na isinasaalang-alang ang uri ng diyalogo, pagiging kumplikado ng kahilingan, pangangailangan ng mga kasangkapan at malinaw na mga pahiwatig ng gumagamit (halimbawa, "think step by step" o "analyze in depth"). Sa ChatGPT, ang mga mode na Auto / Instant / Thinking / Pro ay available sa gumagamit; ang mga variant na mini at nano ay pangunahing mga API model, at ang mini sa produkto ng gumagamit ay maaaring gamitin bilang fallback pagkatapos maubos ang limitasyon[17].

Sa pamamagitan ng programming interface, maraming laki at kumpigurasyon ng GPT‑5 ang ibinibigay; sa dokumentasyon ng OpenAI ang mga pangunahing variant ay tinukoy bilang gpt‑5, gpt‑5‑mini at gpt‑5‑nano (lahat sila ay sumusuporta sa teksto at visual na data). Ang maximum na kabuuang kontekstwal na window para sa pamilya ng GPT‑5 sa API ay humigit-kumulang 400,000 token (na may paghahati ng mga badyet sa input at pangangatwiran/output), habang ang mga partikular na limitasyon ay maaaring magkaiba depende sa napiling variant ng modelo at produkto[18].

Ayon sa ilang mga web-search at factual na benchmark, ang GPT‑5 ay nagpapakita ng kapansin-pansing pagbabawas ng dalas ng mga hallucination at pagkakamali kumpara sa mga modelo ng GPT‑4o at mas naunang "thinking" na mga modelo ng OpenAI. Sa opisyal na anunsyo, nagbigay ang OpenAI ng mga pagtatantya ng pagbabawas ng mga pagkakamali ng humigit-kumulang 45% kumpara sa GPT-4o at humigit-kumulang 80% kumpara sa o3 sa thinking mode — ang mga resultang ito ay nakuha sa mga tiyak na kondisyon: na may naka-enable na web search sa anonymized na mga prompt na representatibo para sa production traffic ng ChatGPT[19].

GPT-5.1

Ang modelo ng GPT-5.1 ay ipinakita ng kumpanyang OpenAI noong Nobyembre 12, 2025 bilang unang makabuluhang iterasyon pagkatapos ng base GPT-5, na nakatuon sa pagpapabuti ng pang-araw-araw na pakikipag-ugnayan, conversational quality at adaptability. Pinapanatili ng modelo ang pinag-isang sistema na may mabilis na mode (GPT-5.1 Instant) at malalim na pangangatwiran (GPT-5.1 Thinking), ngunit nagpapakilala ng adaptive reasoning (adaptive na pag-iisip): ang modelo ay dinamikong tinutukoy ang dami ng mga kalkulasyon depende sa pagiging kumplikado ng kahilingan, na ginagawa itong kapansin-pansing mas mabilis sa mga simpleng gawain nang hindi nababawasan ang kalidad sa mga kumplikado.

Ang pagsasanay ng GPT-5.1 ay itinayo batay sa GPT-5 na may karagdagang yugto ng post-training, na kinabibilangan ng pinalawak na RLHF, pokus sa natural na tono at pagbabawas ng "kalamigan" ng mga tugon. Ang kontekstwal na window sa API ay 400,000 token, ang maximum na output ay 128,000 token[20]. Lumabas ang suporta para sa pinalawak na prompt caching ng hanggang 24 na oras, na makabuluhang nagbabawas ng gastos at latency sa mga multi-step na diyalogo[21].

Mga pangunahing katangian:

  • GPT-5.1 Instant — pangunahing mode para sa pang-araw-araw na mga gawain; sa unang pagkakataon ay gumagamit ng adaptive reasoning upang matukoy kung kailan dapat "mag-isip" bago sumagot sa mas kumplikadong kahilingan[21].
  • GPT-5.1 Thinking — adaptive na paglalaan ng oras para sa pangangatwiran; ayon sa datos ng OpenAI, sa representatibong distribusyon ng mga gawain ng ChatGPT, ang modelo ay humigit-kumulang dalawang beses na mas mabilis sa mga pinakasimpleng gawain at humigit-kumulang dalawang beses na mas mabagal sa mga pinakamahirap na gawain kumpara sa GPT-5 Thinking[21].
  • Pinahusay na multimodality (teksto + vision).
  • Pinahusay ang mga sitwasyon ng coding at agentic, pati na rin ang kahusayan sa mga simpleng gawain sa pamamagitan ng adaptive reasoning at extended prompt caching[22].

GPT-5.2

Ang modelo ng GPT-5.2 ay inilabas noong Disyembre 11, 2025 bilang "pinaka-may kakayahang modelo ng serye para sa propesyonal na trabaho at pag-aaral". Ito ay isang ebolusyon ng GPT-5.1 na may diin sa ekonomikong halaga: pagbuo ng mga talahanayan, presentasyon, kumplikadong code, end-to-end na mga gawain. Pinapanatili ang pinag-isang arkitektura na may mga mode na Instant, Thinking at bago pang Pro (para sa mga gawain na nangangailangan ng maximum na compute at oras para sa pangangatwiran).

Kabilang sa pagsasanay ang na-update na korpus na may knowledge cutoff na Agosto 2025, pinaigting na instruction-tuning at RLHF upang mabawasan ang mga pagkakamali sa mga multi-step na sitwasyon. Konteksto — 400K token (128K max output). Naging mas maaasahan ang modelo sa mga propesyonal na sitwasyon, na may mas mahusay na katumpakang paktwal at paggamit ng mga kasangkapan.

Batay sa GPT-5.2 noong Disyembre 18, 2025 ay inilabas ang espesyal na GPT-5.2-Codex — isang agentic coding model na may pinahusay na context compaction, suporta para sa Windows, pinaigting na cybersecurity at long-horizon reasoning (mga gawain na hanggang ilang oras).

Sa katayuan noong Pebrero 13, 2026, pagkatapos ng pag-retire ng ilang lumang modelo, pansamantalang naging default na modelo sa ChatGPT ang GPT-5.2. Ngunit sa simula pa lang ng Marso 2026, ang papel na ito ay napunta na sa GPT‑5.3 Instant at GPT‑5.4[17].

GPT-5.3-Codex

Ang GPT-5.3-Codex ay ipinakita noong Pebrero 5, 2026 bilang "pinaka-makapangyarihang agentic coding model sa kasalukuyan". Ito ay isang pagsasama ng frontier coding capabilities ng GPT-5.2-Codex at propesyonal na reasoning ng GPT-5.2 sa iisang modelo, na 25% mas mabilis kaysa sa mga nauna.

Ang modelo ay may kakayahang matupad ang halos anumang gawain ng developer: long-running workflow, research, tool use, pagpapatakbo ng code, interactive steering (maaaring makialam ang gumagamit sa real time nang hindi nawawala ang konteksto). Ang mga maagang bersyon ng modelo ay ginamit ng koponan ng OpenAI para sa pag-debug ng sariling pagsasanay, deployment at evaluations.

Mga pangunahing resulta sa oras ng anunsyo noong Pebrero 5, 2026: Terminal-Bench ~77.3%, OSWorld-Verified ~64.7%, SWE-Bench Pro ~56.8%. Sa mas huling release ng GPT-5.4 mula noong Marso 5, 2026, nagbigay ang OpenAI ng na-update na resulta na OSWorld-Verified 74.0% para sa GPT-5.3-Codex kapag ginagamit ang bagong API parameter na pinapanatili ang orihinal na resolusyon ng imahe[23][7].

Noong Pebrero 12, 2026, naglabas din ang OpenAI ng GPT-5.3-Codex-Spark — isang compact na ultra-fast na bersyon sa pakikipagtulungan sa Cerebras, na na-optimize para sa real time: mahigit 1000 token bawat segundo, text-only, konteksto na 128K. Sa simula, ito ay isang rollout para sa mga gumagamit ng ChatGPT Pro sa Codex at maliit na bilang ng mga API design partner, at hindi isang malawak na available na API model[24].

GPT-5.4

Noong Marso 5, 2026 ipinakita ng OpenAI ang GPT‑5.4 bilang bagong frontier model para sa propesyonal na trabaho. Pinagsasama ng GPT‑5.4 ang mga lakas ng mga pinakabagong release ng OpenAI sa reasoning, coding at agentic workflow at sa unang pagkakataon para sa pangunahing linya ay nakatanggap ng built-in na kakayahan sa computer use. Sabay-sabay na naglabas ang OpenAI ng GPT‑5.4 Pro — isang variant para sa mga pinakamahirap na gawain, na gumagamit ng mas maraming kalkulasyon at mas mahabang pangangatwiran[7].

Sa API ang modelo gpt-5.4 ay inilalarawan bilang inirekomendang default para sa malawak na hanay ng mga general-purpose at coding na gawain; ang kontekstwal na window ay 1,050,000 token, ang maximum na output ay 128,000 token. Tinatanggap ng modelo ang teksto at mga imahe bilang input at naglalabas ng teksto[8][25].

Sa ChatGPT, ang mode na Auto sa katayuan noong Marso 7, 2026 ay awtomatikong nagpapalit sa pagitan ng GPT‑5.3 Instant at GPT‑5.4 Thinking, habang ang GPT‑5.4 Pro ay available bilang isang hiwalay na high-capability mode. Para sa mga naka-log in na gumagamit ng ChatGPT, ang default na modelo ay GPT‑5.3[17].

Pag-unlad ng mga Modelo ng GPT

Pag-unlad ng mga Modelo ng GPT
Henerasyon Taon ng Paglulunsad Bilang ng mga Parameter Laki ng Korpus ng Teksto Mga Pangunahing Katangian
GPT-1 2018 ≈117–124 milyon[26] ≈5 GB (BooksCorpus) Generative pre-training sa malalaking korpus; dalawang yugto ng pagsasanay (pre-training + fine-tuning)
GPT-2 2019 1.5 bilyon ≈40 GB (WebText) Makabuluhang pinahusay na pagbuo ng teksto; demonstrasyon ng malakas na zero-shot na pag-uugali; bahagyang unang publikasyon ng modelo
GPT-3 2020 175 bilyon ≈570 GB (Common Crawl, WebText2 at iba pa) Malakihang in-context learning; malinaw na mga kakayahan ng few-shot at zero-shot na pagsasanay nang walang fine-tuning
GPT-3.5 2022 Hindi inihayag (ang mga bersyon ng davinci ay malamang na ~175 bilyon) >570 GB + karagdagang korpus at instruction tuning Pinahusay na katatagan at pagsunod sa mga tagubilin; pundasyon ng mga maagang bersyon ng ChatGPT
GPT-4 2023 Hindi inihayag[27] Hindi inihayag Multimodality (teksto + mga imahe); nadagdagang katumpakan at katatagan sa mga hallucination; konteksto na 8k/32k token
GPT-4 Turbo 2023 Hindi inihayag Batay sa pagsasanay ng GPT-4 (ang mga detalye ay hindi inihayag) Pagdaragdag ng konteksto hanggang 128,000 token; pag-optimize ng bilis at gastos ng pagbuo
GPT-4o 2024 Hindi inihayag Multimodal na data (teksto, mga imahe, audio) Pinag-isang neural network na multimodal na pagproseso; mataas na bilis ng pagtugon
GPT-4.5 2025 Hindi inihayag Pinalawak na tekstwal at multimodal na korpus Research preview batay sa GPT-4o; pagbabawas ng mga pagkakamali; deprecated sa taong 2026
GPT-4.1 2025 Hindi inihayag Mga na-update na korpus Konteksto na hanggang 1,047,576 token; teksto + mga imahe bilang input, teksto bilang output
GPT-5 2025 (Agosto) Hindi inihayag Malakihang multimodal na korpus Pinag-isang sistema na may mga mode ng mabilis na pagsagot at pangangatwiran; konteksto na ~400K token; pagbabawas ng mga hallucination
GPT-5.1 2025 (Nobyembre) Hindi inihayag Pinalawak na korpus ng GPT-5 + RLHF Adaptive reasoning; 24h prompt caching; mga pagpapabuti sa coding
GPT-5.2 2025 (Disyembre) Hindi inihayag Knowledge cutoff Agosto 2025 Pro mode; propesyonal na knowledge work; GPT-5.2-Codex (agentic coding)
GPT-5.3-Codex 2026 (Pebrero) Hindi inihayag Mga na-update + self-improvement data 25% mas mabilis; full-spectrum agent; interactive steering
GPT-5.3-Codex-Spark 2026 (Pebrero) Hindi inihayag Compact >1000 t/s sa Cerebras; real-time coding; 128K konteksto
GPT-5.3 Instant 2026 (Marso) Hindi inihayag Hindi inihayag Pag-update ng pinaka-ginagamit na conversational model ng ChatGPT; pinahusay ang factuality, web search at conversational flow
GPT-5.4 2026 (Marso) Hindi inihayag Hindi inihayag Bagong frontier model para sa propesyonal na trabaho; native computer use; default na modelo sa API para sa general-purpose at karamihan ng coding na gawain
GPT-5.4 Pro 2026 (Marso) Hindi inihayag Hindi inihayag Variant ng GPT-5.4 na may mas malaking compute para sa mga pinakamahirap na gawain

Mga Arkitekturang Parameter ng mga Modelo ng GPT

Mga Arkitekturang Parameter ng mga Modelo ng GPT
Modelo Taon ng Paglulunsad Bilang ng mga Parameter Bilang ng mga Layer Laki ng Nakatagong Estado Bilang ng mga Attention Head Kontekstwal na Window Laki ng Korpus ng Pagsasanay
GPT-1 2018 ≈117–124 milyon 12 768 12 512 token ≈5 GB (BooksCorpus)
GPT-2 2019 1.5 bilyon 48 1,600 25 1,024 token ≈40 GB (WebText)
GPT-3 2020 175 bilyon 96 12,288 96 2,048 token ≈570 GB (Common Crawl + WebText2 + iba pa)
GPT-3.5 2022 Hindi inihayag (ang mga bersyon ng davinci ay malamang na ~175 bilyon) (tinantyang malapit sa GPT-3) (tinantyang malapit sa GPT-3) (hindi inihayag) Hanggang 4,096 token (mga maagang bersyon); hanggang 16,385 token (mga huling bersyon) Pinalawak na Common Crawl + karagdagang dataset at instruction tuning
GPT-4 2023 Hindi inihayag (hindi inihayag) (hindi inihayag) (hindi inihayag) 8,192 token (batayang bersyon); 32,768 (GPT-4-32k) Hindi inihayag
GPT-4 Turbo 2023 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) Hanggang 128,000 token Na-optimize na bersyon ng GPT-4 (ang mga detalye ng korpus ay hindi inihayag)
GPT-4o 2024 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) Hanggang 128,000 token Multimodal na data: teksto, mga imahe, audio
GPT-4.5 2025 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) Hanggang 128,000 token Mga na-update na tekstwal at multimodal na korpus
GPT-4.1 2025 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) Hanggang 1,047,576 token Multimodality; nasukat na pagsasanay na may diin sa mahahabang konteksto
GPT-5 2025 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) Hanggang ≈400,000 token (kabuuang konteksto) Malakihang multimodal na korpus (ang mga detalye ay hindi inihayag)
GPT-5.4 2026 (hindi inihayag) (hindi inihayag) (hindi inihayag) (hindi inihayag) 1,050,000 token; 128,000 max output Hindi inihayag

Mga Sanggunian

  • «Improving language understanding with unsupervised learning», OpenAI, Hunyo 11, 2018
  • «Better language models and their implications», OpenAI, Pebrero 14, 2019
  • «GPT-2: 6-month follow-up», OpenAI, Agosto 20, 2019
  • «GPT-2: 1.5B release», OpenAI, Nobyembre 5, 2019
  • «Language models are few-shot learners», OpenAI, Mayo 28, 2020
  • «OpenAI API», OpenAI, Hunyo 11, 2020
  • «Introducing ChatGPT», OpenAI, Nobyembre 30, 2022
  • «Function calling and other API updates», OpenAI, Hunyo 13, 2023
  • «GPT-4», OpenAI, Marso 14, 2023
  • «New models and developer products announced at DevDay», OpenAI, Nobyembre 6, 2023
  • «Hello GPT-4o», OpenAI, Mayo 13, 2024
  • «Introducing GPT-4.1 in the API», OpenAI, Abril 14, 2025
  • «Introducing GPT-4.5», OpenAI, Pebrero 27, 2025
  • «Introducing GPT-5», OpenAI, Agosto 7, 2025
  • «GPT-5.1: A smarter, more conversational ChatGPT», OpenAI, Nobyembre 12, 2025
  • «Introducing GPT-5.2», OpenAI, Disyembre 11, 2025
  • «Introducing GPT-5.2-Codex», OpenAI, Disyembre 18, 2025
  • «Introducing GPT-5.3-Codex», OpenAI, Pebrero 5, 2026
  • «Introducing GPT-5.3-Codex-Spark», OpenAI, Pebrero 12, 2026
  • «GPT-5.3 Instant: Smoother, more useful everyday conversations», OpenAI, Marso 3, 2026
  • «Introducing GPT-5.4», OpenAI, Marso 5, 2026
  • «Using GPT-5.4», OpenAI Developers
  • «Models», OpenAI API
  • «Deprecations», OpenAI API
  • «GPT-5.3 and GPT-5.4 in ChatGPT», OpenAI Help Center
  • «Retiring GPT-4o and other ChatGPT models», OpenAI Help Center

Mga Tala

  1. OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
  2. OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
  3. 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
  4. 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
  5. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  6. OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
  7. 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
  8. 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
  9. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  10. OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
  11. OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
  12. Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
  13. Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
  14. Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
  15. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  16. OpenAI. «Introducing GPT-5» (7 августа 2025).
  17. 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
  18. OpenAI API documentation. Models: GPT-5.
  19. OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
  20. OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
  21. 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
  22. OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
  23. OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
  24. OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
  25. OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
  26. Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
  27. По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.

Panitikan

  • Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.