GPT (OpenAI) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT (Generative Pre-trained Transformer) — това е семейство от големи езикови модели (LLM), разработено от компанията OpenAI. Моделите GPT се изграждат върху архитектурата на трансформери и реализират парадигмата на генеративно предобучение: на първия етап моделът се обучава върху обширни корпуси от текстове без явна анотация, а след това може да бъде дообучаван за конкретни задачи. За по-късните поколения (считано от GPT‑5) OpenAI използва и формулировката единна система (unified system), тъй като продуктът обединява бърз режим на отговор, режим на задълбочено разсъждение (reasoning) и маршрутизатор[1].

Наименование

Акронимът GPT се разшифрова като Generative Pre-trained Transformer (Генеративен Предварително обучен Трансформер).

  • Генеративен (Generative): означава, че моделът е способен да създава (генерира) ново съдържание, например текст.
  • Предварително обучен (Pre-trained): указва, че моделът преминава през обширен начален етап на обучение върху голям масив от данни (например текстове от интернет). След предварителното обучение моделът може да бъде допълнително „дообучен" (fine-tuned) за изпълнение на по-специфични задачи.
  • Трансформер (Transformer): това е наименованието на конкретна архитектура на невронна мрежа, която представлява ключовата иновация, лежаща в основата на GPT и много други съвременни AI модели.

Основната особеност на GPT се състои в това, че обучението протича в авторегресивна форма — моделът предсказва следващия token на базата на предходния контекст. Тоест моделът се обучава да максимизира вероятността за следващия token, знаейки последователността от предходните token-и. По време на обучението се минимизира грешката на предсказване на следващия елемент, което позволява формирането на текстове с висока кохерентност и свързаност.

Процес на генериране на текст в GPT

Моделът GPT генерира текст последователно, token по token, по следната итеративна схема:

  • Приема като вход начална текстова последователност (prompt, seed text).
  • Изчислява вероятностно разпределение по всички token-и от речника за следващия елемент на текста.
  • Избира следващия token:
    • или по най-висока вероятност (алчен избор),
    • или чрез метода на стохастично семплиране (sampling),
    • или с използване на специални филтриращи стратегии (top-k, top-p).
  • Добавя избрания token към текущата последователност.
  • Актуализираната последователност отново се подава на входа на модела за предсказване на следващия token.

Архитектура на трансформера: обработка на текст

Процесът на обработка на данни вътре в трансформера за предсказване на следващия token включва няколко основни етапа:

  • Токенизация (Tokenization). Входният текст се разбива на token-и — малки единици текст, които могат да бъдат думи, части от думи или препинателни знаци. В модела GPT-3, например, речникът включва около 50 257 token-а.
  • Embedding на token-и (Embeddings). Всеки token се преобразува в вектор с фиксирана дължина с помощта на матрица на embedding-и (W_E). Векторите кодират значението на token-ите: семантично близките token-и се намират близо един до друг в многомерното пространство. В модела GPT-3 размерността на embedding-ите е 12 288.
  • Обработка в слоевете на трансформера.
    • Блокове на внимание (Attention Blocks): Всеки token взаимодейства с останалите token-и от последователността. Механизмът на внимание позволява да се отчита контекстът и да се интерпретира правилно значението на думите.
    • Напълно свързани слоеве (Feed-Forward Layers): След вниманието всеки token се обработва отделно чрез двуслойна невронна мрежа с нелинейна активация.
  • Обратно преобразуване и Softmax. След всички слоеве обработеният вектор се преобразува обратно в пространството на token-ите с помощта на матрица (W_U), която често е транспонирана версия на W_E. Полученият вектор от logit-и се нормализира с помощта на функцията Softmax за получаване на вероятностно разпределение по всички token-и.
  • Избор на следващия token (Sampling). Следващият token се избира въз основа на разпределението на вероятностите. Параметърът температура (temperature) управлява случайността на избора: при температура 0 се избира най-вероятният token, при по-високи температури се увеличава вероятността за избор на по-малко вероятни варианти, което допринася за по-голямо разнообразие на текста.

Модели GPT

  • GPT-1 (2018): първият модел от семейството; 12-слоен decoder-only transformer; обучение в два етапа (предобучение + дообучение на NLP задачи).
  • GPT-2 (2019): 1,5 млрд параметъра; обучение върху корпуса WebText; за пръв път способен да генерира дълги свързани текстове; повишаване качеството на zero-shot генерацията. Обявен на 14 февруари 2019 г., пълната версия (1,5 млрд) публикувана на 5 ноември 2019 г. от съображения за сигурност.
  • GPT-3 (2020): 175 млрд параметъра; мащабно обучение върху съвкупност от Common Crawl, Books, Wikipedia; значително развитие на few-shot и zero-shot способностите.
  • GPT-3.5 (2022): междинна версия между GPT-3 и GPT-4; подобрено следване на инструкции благодарение на обучение с обратна връзка от човека (RLHF) във версиите text-davinci-003 и gpt-3.5-turbo; контекстен прозорец до 4 096 token-а в ранните версии и до 16 385 token-а в по-късните (gpt-3.5-turbo-16k и актуализираното gpt-3.5-turbo).
  • GPT-4 (2023): мултимодален модел с текстов и графичен вход (поддръжката на изображения беше внедрена по-късно, след текстовото стартиране); контекстен прозорец 8 192 token-а в базовата версия и 32 768 token-а във варианта GPT-4-32k; значително повишаване на точността, стабилността и логиката на разсъжденията.
  • GPT-4 Turbo (2023): оптимизирана версия на GPT-4; увеличен контекстен прозорец до 128 000 token-а; по-ниски закъснения и разходи за работа.
  • GPT-4o (2024): мултимодален модел отново поколение (текст, изображение, аудио) с единна невронна мрежова архитектура; много висока скорост и точност на отговорите; контекстен прозорец 128 000 token-а.
  • GPT-4.5 (2025): изследователски преглед (research preview); в system card OpenAI посочва, че моделът „builds on GPT-4o\"[2][3]; подобрено разбиране на потребителски заявки, намаляване на броя грешки; контекстен прозорец 128 000 token-а. В API моделът gpt-4.5-preview беше обявен за deprecated на 14 април 2025 г. и изключен на 14 юли 2025 г.[4].
  • GPT-4.1 (2025): подобрена версия на семейството GPT-4 с контекстен прозорец до 1 млн token-а; приема текст и изображения на входа, извежда текст[5]. Пусната едновременно в три варианта: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
  • GPT-5 (2025): единна система с режими на бърз отговор и задълбочено разсъждение; контекстен прозорец около 400 000 token-а; забележимо намаляване на халюцинациите при фактологични задачи.
  • GPT-5.1 (2025): адаптивно reasoning, подобрения в coding и long-context retention.
  • GPT-5.2 (2025): акцент върху професионалната работа; режим Pro за frontier задачи; на базата на GPT-5.2 е пусната агентният GPT-5.2-Codex.
  • GPT-5.3-Codex (2026): агентен coding модел, обединяващ coding способности и reasoning; с 25 % по-бърз от предшествениците.
  • GPT-5.3 Instant (2026): актуализация на най-използвания разговорен модел ChatGPT; пусната на 3 март 2026 г. Подобрени фактическа точност, качество на уеб търсенето, плавност на диалога и намален брой излишни откази и прекомерни уговорки. В API е достъпна като gpt-5.3-chat-latest[6].
  • GPT-5.4 (2026): frontier модел на OpenAI за професионална работа, представен на 5 март 2026 г.; първият general-purpose модел на OpenAI с native computer-use capabilities. В API gpt-5.4 е препоръчан като модел по подразбиране за широк спектър от general-purpose и coding задачи[7][8].

GPT-1

Първият модел, GPT-1, беше представен от компанията OpenAI през 2018 г. в работата \"Improving Language Understanding by Generative Pre-Training\". Моделът представляваше 12-слоен decoder-only transformer[9] и се изграждаше на базата на архитектурата на трансформери. Обучението на GPT-1 протичаше в два етапа: етап на неконтролирано генеративно предварително обучение (pre-training), последван от етап на контролирано финно настройване (fine-tuning).

На стадия на предварителното обучение моделът се обучаваше върху корпуса BookCorpus, включващ над 7 000 непубликувани книги от различни жанрове. Особеността на този корпус беше наличието на дълги непрекъснати откъси от текст, което беше критично важно за формирането у модела на способност да обработва сложни и протяжни текстови зависимости.

На етапа на дообучението моделът се адаптираше към решаването на специализирани задачи по обработка на естествен език, включително:

  • Отговори на въпроси (Question Answering, QA) — формиране на коректен отговор въз основа на зададен текстов контекст;
  • Разпознаване на текстова импликация (Natural Language Inference, NLI) — определяне на логическата взаимовръзка между два текста: импликация, противоречие или неутралност;
  • Оценка на семантичното сходство (Semantic Textual Similarity) — измерване на степента на смисловата близост между две текстови последователности.

Благодарение на този подход GPT-1 демонстрира значително превъзходство над предишните модели при редица стандартни benchmark-и за задачи по разбиране на текст.

Разработването на GPT-1 демонстрира редица ключови постижения и открития в областта на обработката на естествен език (NLP):

  • Ефективност на генеративното предварително обучение. Беше емпирично потвърдено, че предварителното обучение върху големи корпуси от неанотиран текст позволява на модела да придобие универсални езикови представи, приложими за последващо използване в различни приложни задачи без необходимост от фундаментални архитектурни промени.
  • Универсалност на архитектурата на трансформерите. Използването на многослоен декодерен трансформер позволи на модела успешно да обработва дългосрочни зависимости в текста, което преди беше затруднено за моделите, основани на рекурентни невронни мрежи.
  • Намаляване на зависимостта от анотирани данни. Работата потвърди, че мащабното предварително обучение върху неанотирани данни може значително да намали обема от анотирани данни, необходими за постигане на високо качество при целевите задачи.
  • Основа за последващото развитие. Резултатите от GPT-1 положиха концептуалните и техническите основи за следващите версии на моделите от семейството GPT (GPT-2, GPT-3 и по-нататък).

GPT-2

Моделът GPT-2 беше обявен от компанията OpenAI на 14 февруари 2019 г. Той значително превъзхождаше своя предшественик по размер: пълната версия на модела съдържаше около 1,5 милиарда параметъра. От съображения за сигурност OpenAI първоначално публикува само намалени варианти на модела; пълната версия (1,5 млрд параметъра) беше пусната на 5 ноември 2019 г. За разлика от GPT-1, обучен върху корпуса BookCorpus (~5 ГБ), GPT-2 беше обучен върху специално събрания корпус WebText с обем около 40 ГБ, включващ текстови данни от интернет източници с висока степен на качество. Увеличаването както на размера на модела, така и на обема от обучаващи данни позволи на GPT-2 значително да повиши качеството на генерирания текст: той демонстрираше способност да създава съдържателни статии, разкази и дори свързани фрагменти от художествена проза.

В GPT-2 се прилагаше архитектурата на авторегресивен трансформер-декодер, аналогична на GPT-1, без съществени промени. Моделът се състоеше от 48 слоя на самовнимание, имаше размер на скритото състояние 1600 и включваше около 1,5 милиарда параметъра. Броят на главите на вниманието беше 25 (при запазване на размера 64 на глава, наследен от GPT-1: 1600 ÷ 64 = 25). Обучението се осъществяваше върху задачата за предсказване на следващия token въз основа на предходния контекст с прилагане на маскиран механизъм на внимание.

Едно от главните отличия на GPT-2 беше, че моделът за пръв път демонстрира висока ефективност в режим zero-shot learning — способността да решава нови задачи, без да преминава явно дообучение върху примери за тези задачи. Моделът се обучаваше върху голям корпус от обобщени текстове и не преминаваше специализирано обучение върху данни за конкретни задачи. Оценката се провеждаше в режим zero-shot, при който моделът изпълняваше задачите единствено въз основа на знанията, придобити по време на предварителното обучение. При редица задачи по езиково моделиране GPT-2 постигаше качество, съпоставимо или превъзхождащо резултатите на модели, специално обучени върху специализирани набори от данни (например Wikipedia, новинарски текстове, книги).

GPT-3

Моделът GPT-3 беше представен от компанията OpenAI през юни 2020 г. (статията в arXiv се появи на 28 май 2020 г., бета достъпът до API беше открит на 11 юни 2020 г.). Той стана следваща стъпка в развитието на генеративните трансформери след GPT-2 и се отличаваше с мащабиране на архитектурата до 175 милиарда параметъра, което го правеше по онова време най-големия езиков модел.

Архитектурата на GPT-3 остана в основата си предишната — многослоен авторегресивен трансформер-декодер без кардинални промени. Основните подобрения в производителността бяха постигнати чрез увеличаване на броя на слоевете, ширината на скритите слоеве и мащабите на обучението. Моделът се обучаваше върху обединение от няколко големи корпуса от текстове, включително Common Crawl, WebText2, Books1, Books2 и Wikipedia. Общият обем на данните беше от порядъка на 570 ГБ и повече (570 ГБ се пада на филтрираната част на Common Crawl, доминираща в обучаващата смес).

Една от главните особености на GPT-3 беше способността му към few-shot learning и zero-shot learning: моделът можеше да изпълнява широк спектър от задачи по обработка на естествен език, включително превод, обобщаване, отговори на въпроси, писане на есета и дори програмиране, основавайки се само на няколко примера в текстовата заявка или изобщо без примери.

GPT-3.5

Моделът GPT-3.5 беше представен от компанията OpenAI в края на 2022 г. в рамките на еволюционното развитие на семейството GPT. Той се изграждаше на базата на архитектурата на мащабирания авторегресивен трансформер-декодер, използван в GPT-3, с подобрения в качеството на генерирания текст, обработката на контекста и способността да следва сложни инструкции. Точният брой параметри на GPT-3.5 официално не беше разкрит; предположително davinci версиите са съпоставими по размер с GPT-3 (175 млрд), но точните параметри на версията gpt-3.5-turbo не са известни.

Обучението на GPT-3.5 включваше разширено използване на методите на обучение с подкрепление въз основа на обратна връзка от човека (Reinforcement Learning from Human Feedback, RLHF) във версиите text-davinci-003 и gpt-3.5-turbo. При това по-ранната версия text-davinci-002 се обучаваше с използване на supervised fine-tuning (SFT), а не RLHF. Моделът се обучаваше върху разширени корпуси от текстове, включващи Common Crawl, Books, WebText и други висококачествени източници. Контекстният прозорец в ранните популярни версии (gpt-3.5-turbo) беше 4 096 token-а; впоследствие OpenAI пусна актуализирани версии с контекст до 16 385 token-а[10].

На практика GPT-3.5 беше адаптиран за решаването на широк кръг от задачи по обработка на естествен език, като:

  • Генериране на свързан и логичен текст;
  • Отговори на въпроси (QA) и разбиране на контекста;
  • Следване на многостепенни инструкции;
  • Подобрено поддържане на дългосрочен контекст в диалозите.

На базата на GPT-3.5 бяха пуснати няколко ключови версии, предназначени за различни цели:

  • text-davinci-002 — първият общодостъпен модел, основан на GPT-3.5, оптимизиран за генериране и следване на инструкции (обучен с помощта на SFT).
  • text-davinci-003 — подобрена версия с още по-голяма способност за разсъждение и генериране на сложни текстове (обучена с прилагане на RLHF).
  • gpt-3.5-turbo — най-производителната и икономична версия на GPT-3.5, използвана в услугата ChatGPT от края на 2022 г.

GPT-4

Моделът GPT-4 беше представен от компанията OpenAI на 14 март 2023 г. в работата "GPT-4 Technical Report\". Той стана следващ етап в развитието на семейството езикови модели, предлагайки значителни подобрения в областта на разбирането на текст, генерирането на смислени и творчески отговори, както и обработката на мултимодални данни. Точният брой параметри и архитектурните детайли на модела официално не бяха разкрити — техническият доклад на GPT-4 изрично посочва, че информацията за архитектурата, размера на модела, хардуерното осигуряване, изчислителните разходи за обучение и изграждането на dataset-ите не се публикува[11]. Според неофициални външни оценки GPT-4 може да използва подход Mixture of Experts (MoE) и да има общ мащаб от порядъка на ~1,8 трилиона параметъра, но OpenAI официално не е потвърждавала нито отричала тези цифри[12].

GPT-4 е мултимодален модел, способен да приема на вход както текст, така и изображения. Следва да се отбележи, че по времето на първоначалното стартиране през март 2023 г. беше достъпна само текстовата модалност; поддръжката на входни изображения беше внедрена по-късно. Контекстният прозорец беше 8 192 token-а в базовата версия и 32 768 token-а във варианта GPT-4-32k. Моделът използваше методите RLHF (обучение с подкрепление въз основа на обратна връзка от човека).

Обучението на GPT-4 се осъществяваше върху обединение от мащабни текстови и мултимодални корпуси. Конкретните детайли за обучаващите данни, хардуерното осигуряване и методологията не се разкриват в официалните публикации на OpenAI.

Обучението протичаше в няколко етапа:

  • мащабно неконтролирано предварително обучение върху текстове и изображения,
  • контролирано финно настройване (supervised fine-tuning) върху специализирани задачи,
  • финален етап на обучение с подкрепление въз основа на обратна връзка от човека (RLHF) за повишаване на надеждността, сигурността и качеството на интерпретацията на инструкциите.

На базата на GPT-4 бяха пуснати няколко основни версии:

  • GPT-4 (март 2023): базова версия с поддръжка на текстов вход (поддръжката на изображения беше добавена по-късно); контекстен прозорец 8 192 token-а; пуснат е и вариантът GPT-4-32k с контекст 32 768 token-а.
  • GPT-4 Turbo (ноември 2023): оптимизирана модификация на GPT-4 с увеличен контекстен прозорец до 128 000 token-а[13]; намалени изчислителни разходи и ускорена генерация; поддръжка на режими за извикване на функции (function calling) и JSON извод.
  • GPT-4o (май 2024): мултимодална версия от ново поколение; в launch анонса беше позиционирана като omni модел, способен да работи с текст, изображения и аудио в реално време (за разлика от GPT-4 Turbo, където различните модалности се обслужваха от отделни модули); при това базовият API модел gpt-4o е описан като text+image input, text output; контекстен прозорец 128 000 token-а.
  • GPT-4.5 (февруари 2025): изследователски преглед (research preview); в system card OpenAI изрично посочва, че моделът „builds on GPT-4o\"[3]; подобрена генерация на сложни текстове, повишена точност при изпълнение на инструкции и намалено ниво на халюцинации; контекстен прозорец 128 000 token-а. Описваше се като „последният модел на OpenAI без chain-of-thought\" (кодово наименование — Orion)[14]. В API моделът gpt-4.5-preview беше обявен за deprecated на 14 април 2025 г. и изключен на 14 юли 2025 г.[4].
  • GPT-4.1 (април 2025): стабилна версия с кардинално разширяване на контекста до 1 047 576 token-а; приема текст и изображения на вход, извежда текст[15]; пусната едновременно в три варианта (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); първоначално достъпна само чрез API, по-късно внедрена в ChatGPT.

GPT-5

На 7 август 2025 г. OpenAI представи GPT‑5 като своя по онова време „най-умен, бърз и полезен\" модел, с вграден режим на задълбочени разсъждения (thinking) и фокус върху практически сценарии — писане, програмиране, работа в областта на здравеопазването и мултимодално разбиране. GPT‑5 постепенно се превърна в модел по подразбиране за повечето авторизирани потребители на ChatGPT, измествайки по-рано използваните модели от семействата GPT‑4/4o и серията o‑.[16]

GPT‑5 е реализиран като единна система с два основни режима на работа: бързи, икономични отговори за ежедневни заявки (условно gpt‑5 main) и задълбочено разсъждение за сложни задачи (условно gpt‑5 thinking). Изборът на режим се извършва автоматично с помощта на маршрутизатор, който отчита типа диалог, сложността на заявката, необходимостта от инструменти и явни подсказки от потребителя (например „think step by step\" или „analyze in depth\"). В ChatGPT потребителят разполага с режими Auto / Instant / Thinking / Pro; вариантите mini и nano са предимно API модели, а mini в потребителския продукт може да се използва като fallback след изчерпване на лимита[17].

Чрез програмния интерфейс се предоставят няколко размера и конфигурации на GPT‑5; в документацията на OpenAI като основни варианти са посочени gpt‑5, gpt‑5‑mini и gpt‑5‑nano (всички поддържат текст и визуални данни). Максималният общ контекстен прозорец за семейството GPT‑5 в API е от порядъка на 400 000 token-а (с разделяне на бюджетите за вход и разсъждение/извод), като конкретните лимити могат да се различават в зависимост от избрания вариант на модела и продукта[18].

По редица уеб търсещи и фактологични benchmark-и GPT‑5 демонстрира забележимо намаляване на честотата на халюцинациите и грешките в сравнение с моделите GPT‑4o и по-ранните „thinking\" модели на OpenAI. В официалния анонс OpenAI посочваше оценки за намаляване на грешките с приблизително 45 % в сравнение с GPT-4o и с приблизително 80 % в сравнение с o3 в thinking режим — тези резултати бяха получени при специфични условия: с включено уеб търсене върху анонимизирани prompt-и, представителни за производствения трафик на ChatGPT[19].

GPT-5.1

Моделът GPT-5.1 беше представен от компанията OpenAI на 12 ноември 2025 г. като първата значителна итерация след базовия GPT-5, ориентирана към подобряване на ежедневното взаимодействие, разговорността и адаптивността. Моделът запазва единната система с бърз режим (GPT-5.1 Instant) и задълбочено разсъждение (GPT-5.1 Thinking), но въвежда адаптивно мислене (adaptive reasoning): моделът динамично определя обема на изчисленията в зависимост от сложността на заявката, което го прави забележимо по-бърз при прости задачи без загуба на качество при сложни.

Обучението на GPT-5.1 се изграждаше на базата на GPT-5 с допълнителен етап на пост-обучение, включващ разширен RLHF, фокус върху естествеността на тона и намаляване на „студенината\" на отговорите. Контекстният прозорец в API е 400 000 token-а, максималният извод — 128 000 token-а[20]. Появи се поддръжка на разширено кеширане на prompt-и до 24 часа, което съществено намалява разходите и закъсненията при многостепенни диалози[21].

Ключови особености:

  • GPT-5.1 Instant — основен режим за ежедневни задачи; за пръв път използва adaptive reasoning, за да определя кога е уместно да „помисли\" преди отговор на по-сложна заявка[21].
  • GPT-5.1 Thinking — адаптивно отделяне на време за разсъждения; според данните на OpenAI, при представително разпределение на задачите в ChatGPT моделът е приблизително два пъти по-бърз при най-простите задачи и приблизително два пъти по-бавен при най-трудните в сравнение с GPT-5 Thinking[21].
  • Подобрена мултимодалност (текст + vision).
  • Подобрени coding и agentic сценарии, както и ефективност при прости задачи благодарение на adaptive reasoning и extended prompt caching[22].

GPT-5.2

Моделът GPT-5.2 беше пуснат на 11 декември 2025 г. като „най-способният модел от серията за професионална работа и обучение\". Това е еволюция на GPT-5.1 с акцент върху икономическата стойност: генериране на таблици, презентации, сложен код, end-to-end задачи. Запазва единната архитектура с режими Instant, Thinking и новия Pro (за задачи, изискващи максимален compute и време за разсъждения).

Обучението включваше актуализиран корпус с knowledge cutoff август 2025 г., засилен instruction-tuning и RLHF за намаляване на грешките в многостепенни сценарии. Контекстът — 400K token-а (128K max output). Моделът стана по-надежден в професионални сценарии, с по-добра фактологична точност и използване на инструменти.

На базата на GPT-5.2 на 18 декември 2025 г. беше пуснат специализираният GPT-5.2-Codex — агентен coding модел с подобрено компресиране на контекста (context compaction), поддръжка на Windows, засилена киберсигурност и long-horizon reasoning (задачи до няколко часа).

Към 13 февруари 2026 г., след извеждането от експлоатация на редица стари модели, GPT-5.2 временно стана модел по подразбиране в ChatGPT. Но още към началото на март 2026 г. тази роля премина към GPT‑5.3 Instant и GPT‑5.4[17].

GPT-5.3-Codex

GPT-5.3-Codex беше представен на 5 февруари 2026 г. като „най-мощният агентен coding модел към днешна дата\". Това е обединение на frontier coding способностите на GPT-5.2-Codex с професионалното reasoning на GPT-5.2 в един модел, който е с 25 % по-бърз от предшествениците.

Моделът е способен да изпълнява практически всякакви задачи на разработчик: long-running workflows, research, tool use, изпълнение на код, interactive steering (потребителят може да се намесва в реално време без загуба на контекст). Ранните версии на модела бяха използвани от екипа на OpenAI за отстраняване на грешки в собственото обучение, deployment и evaluations.

Ключови резултати към момента на анонса на 5 февруари 2026 г.: Terminal-Bench ~77,3 %, OSWorld-Verified ~64,7 %, SWE-Bench Pro ~56,8 %. В по-късния релийз GPT-5.4 от 5 март 2026 г. OpenAI посочи актуализиран резултат OSWorld-Verified 74,0 % за GPT-5.3-Codex при използване на нов API параметър, запазващ оригиналната разделителна способност на изображението[23][7].

На 12 февруари 2026 г. OpenAI пусна и GPT-5.3-Codex-Spark — компактна ultra-fast версия в партньорство с Cerebras, оптимизирана за реално време: над 1000 token-а в секунда, text-only, контекст 128K. При стартирането това беше rollout за потребителите на ChatGPT Pro в Codex и малък брой API design partners, а не широкодостъпен API модел[24].

GPT-5.4

На 5 март 2026 г. OpenAI представи GPT‑5.4 като новия frontier модел за професионална работа. GPT‑5.4 обединява силните страни на последните релийзи на OpenAI в reasoning, coding и agentic workflows и за пръв път за основната линейка получи вградени възможности за computer use. Едновременно OpenAI пусна GPT‑5.4 Pro — вариант за най-сложните задачи, използващ повече изчислителни ресурси и по-продължително разсъждение[7].

В API моделът gpt-5.4 е описан като препоръчителен по подразбиране за широк спектър от general-purpose и coding задачи; контекстният прозорец е 1 050 000 token-а, максималният извод — 128 000 token-а. Моделът приема текст и изображения на вход и извежда текст на изход[8][25].

В ChatGPT режимът Auto към 7 март 2026 г. автоматично превключва между GPT‑5.3 Instant и GPT‑5.4 Thinking, докато GPT‑5.4 Pro е достъпен като отделен high-capability режим. За влезлите потребители на ChatGPT моделът по подразбиране е GPT‑5.3[17].

Развитие на моделите GPT

Развитие на моделите GPT
Поколение Година на издаване Брой параметри Размер на корпуса от текстове Ключови особености
GPT-1 2018 ≈117–124 млн[26] ≈5 ГБ (BooksCorpus) Генеративно предобучение върху големи корпуси; двуетапно обучение (pre-training + fine-tuning)
GPT-2 2019 1,5 млрд ≈40 ГБ (WebText) Съществено подобрена генерация на текст; демонстрация на силно zero-shot поведение; първоначално частично публикуване на модела
GPT-3 2020 175 млрд ≈570 ГБ (Common Crawl, WebText2 и др.) Мащабно in-context learning; изразени способности за few-shot и zero-shot обучение без дообучване
GPT-3.5 2022 Не е разкрит (davinci версиите предположително ~175 млрд) >570 ГБ + допълнителни корпуси и instruction tuning Подобрена стабилност и следване на инструкции; основа на ранните версии на ChatGPT
GPT-4 2023 Не е разкрит[27] Не е разкрит Мултимодалност (текст + изображения); повишена точност и устойчивост на халюцинации; контекст 8k/32k token-а
GPT-4 Turbo 2023 Не е разкрит Базира се на обучението на GPT-4 (детайлите не са разкрити) Увеличаване на контекста до 128 000 token-а; оптимизация на скоростта и разходите за генерация
GPT-4o 2024 Не е разкрит Мултимодални данни (текст, изображения, аудио) Единна невронна мрежова мултимодална обработка; висока скорост на отклик
GPT-4.5 2025 Не е разкрит Разширени текстови и мултимодални корпуси Research preview на базата на GPT-4o; намаляване на грешките; deprecated към 2026 г.
GPT-4.1 2025 Не е разкрит Актуализирани корпуси Контекст до 1 047 576 token-а; текст + изображения на вход, текст на изход
GPT-5 2025 (август) Не е разкрит Мащабни мултимодални корпуси Единна система с режими на бърз отговор и разсъждение; контекст ~400K token-а; намаляване на халюцинациите
GPT-5.1 2025 (ноември) Не е разкрит Разширени корпуси на GPT-5 + RLHF Адаптивно reasoning; 24h prompt caching; подобрения в coding
GPT-5.2 2025 (декември) Не е разкрит Knowledge cutoff август 2025 г. Pro режим; professional knowledge work; GPT-5.2-Codex (агентен coding)
GPT-5.3-Codex 2026 (февруари) Не е разкрит Актуализирани + self-improvement data 25 % по-бърз; full-spectrum agent; interactive steering
GPT-5.3-Codex-Spark 2026 (февруари) Не е разкрит Компактен >1000 t/s на Cerebras; real-time coding; 128K контекст
GPT-5.3 Instant 2026 (март) Не е разкрит Не е разкрит Актуализация на най-използвания разговорен модел ChatGPT; подобрени factuality, web search и conversational flow
GPT-5.4 2026 (март) Не е разкрит Не е разкрит Нов frontier модел за професионална работа; native computer use; модел по подразбиране в API за general-purpose и повечето coding задачи
GPT-5.4 Pro 2026 (март) Не е разкрит Не е разкрит Вариант на GPT-5.4 с по-голям compute за най-сложните задачи

Архитектурни параметри на моделите GPT

Архитектурни параметри на моделите GPT
Модел Година на издаване Брой параметри Брой слоеве Размер на скритото състояние Брой глави на вниманието Контекстен прозорец Размер на обучаващия корпус
GPT-1 2018 ≈117–124 млн 12 768 12 512 token-а ≈5 ГБ (BooksCorpus)
GPT-2 2019 1,5 млрд 48 1 600 25 1 024 token-а ≈40 ГБ (WebText)
GPT-3 2020 175 млрд 96 12 288 96 2 048 token-а ≈570 ГБ (Common Crawl + WebText2 + други)
GPT-3.5 2022 Не е разкрит (davinci версиите предположително ~175 млрд) (оценъчно близо до GPT-3) (оценъчно близо до GPT-3) (не е разкрит) До 4 096 token-а (ранни); до 16 385 token-а (късни) Разширен Common Crawl + допълнителни dataset-и и instruction tuning
GPT-4 2023 Не е разкрит (не е разкрит) (не е разкрит) (не е разкрит) 8 192 token-а (базова); 32 768 (GPT-4-32k) Не е разкрит
GPT-4 Turbo 2023 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) До 128 000 token-а Оптимизирана версия на GPT-4 (детайлите за корпуса не са разкрити)
GPT-4o 2024 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) До 128 000 token-а Мултимодални данни: текст, изображения, аудио
GPT-4.5 2025 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) До 128 000 token-а Актуализирани текстови и мултимодални корпуси
GPT-4.1 2025 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) До 1 047 576 token-а Мултимодалност; мащабирано обучение с акцент върху дълги контексти
GPT-5 2025 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) До ≈400 000 token-а (общ контекст) Мащабни мултимодални корпуси (детайлите не са разкрити)
GPT-5.4 2026 (не е разкрит) (не е разкрит) (не е разкрит) (не е разкрит) 1 050 000 token-а; 128 000 max output Не е разкрит

Препратки

  • „Improving language understanding with unsupervised learning\", OpenAI, 11 юни 2018 г.
  • „Better language models and their implications\", OpenAI, 14 февруари 2019 г.
  • „GPT-2: 6-month follow-up\", OpenAI, 20 август 2019 г.
  • „GPT-2: 1.5B release\", OpenAI, 5 ноември 2019 г.
  • „Language models are few-shot learners\", OpenAI, 28 май 2020 г.
  • „OpenAI API\", OpenAI, 11 юни 2020 г.
  • „Introducing ChatGPT\", OpenAI, 30 ноември 2022 г.
  • „Function calling and other API updates\", OpenAI, 13 юни 2023 г.
  • „GPT-4\", OpenAI, 14 март 2023 г.
  • „New models and developer products announced at DevDay\", OpenAI, 6 ноември 2023 г.
  • „Hello GPT-4o\", OpenAI, 13 май 2024 г.
  • „Introducing GPT-4.1 in the API\", OpenAI, 14 април 2025 г.
  • „Introducing GPT-4.5\", OpenAI, 27 февруари 2025 г.
  • „Introducing GPT-5\", OpenAI, 7 август 2025 г.
  • „GPT-5.1: A smarter, more conversational ChatGPT\", OpenAI, 12 ноември 2025 г.
  • „Introducing GPT-5.2\", OpenAI, 11 декември 2025 г.
  • „Introducing GPT-5.2-Codex\", OpenAI, 18 декември 2025 г.
  • „Introducing GPT-5.3-Codex\", OpenAI, 5 февруари 2026 г.
  • „Introducing GPT-5.3-Codex-Spark\", OpenAI, 12 февруари 2026 г.
  • „GPT-5.3 Instant: Smoother, more useful everyday conversations\", OpenAI, 3 март 2026 г.
  • „Introducing GPT-5.4\", OpenAI, 5 март 2026 г.
  • „Using GPT-5.4\", OpenAI Developers
  • „Models\", OpenAI API
  • „Deprecations\", OpenAI API
  • „GPT-5.3 and GPT-5.4 in ChatGPT\", OpenAI Help Center
  • „Retiring GPT-4o and other ChatGPT models\", OpenAI Help Center

Бележки

  1. OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
  2. OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
  3. 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
  4. 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
  5. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  6. OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
  7. 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
  8. 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
  9. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  10. OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
  11. OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
  12. Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
  13. Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
  14. Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
  15. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  16. OpenAI. «Introducing GPT-5» (7 августа 2025).
  17. 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
  18. OpenAI API documentation. Models: GPT-5.
  19. OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
  20. OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
  21. 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
  22. OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
  23. OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
  24. OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
  25. OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
  26. Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
  27. По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.

Литература

  • Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.