GPT-4o (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (se pronunță „ji‑pi‑ti‑for‑ou"; litera „o" provine din lat. omni — „tot", „atotcuprinzător") — model lingvistic mare (LLM) multimodal din familia GPT, dezvoltat de compania OpenAI și prezentat pe 13 mai 2024[1]. GPT‑4o a devenit primul model OpenAI antrenat ca o singură rețea neuronală end‑to‑end, capabilă să proceseze simultan text, imagini și audio — spre deosebire de predecesorii săi, unde pentru fiecare modalitate se foloseau modele separate[2]. Modelul a înlocuit GPT‑4 Turbo în calitate de vârf al gamei, oferind o viteză de generare de două ori mai mare, un cost API cu 50 % mai scăzut și capabilități multimodale calitativ noi[1]. Familia GPT‑4o include peste 20 de variante, printre care compactul GPT‑4o mini, modele audio, modele în timp real, modele de căutare și modele vocale specializate[3].

Fișă informativă

Parametru Valoare
Denumire completă GPT‑4o (GPT‑4 Omni)
Dezvoltator OpenAI
Data anunțului 13 mai 2024[1]
Tip Model multimodal autoregresiv (transformer)[2]
Număr de parametri Nedivulgat oficial (estimare neoficială — ~200 mld. pentru GPT‑4o, ~8 mld. pentru GPT‑4o mini)[4]
Fereastra de context 128 000 de token-uri[3]
Ieșire maximă 16 384 token-uri (4 096 pentru gpt‑4o‑2024‑05‑13)[3]
Data limită a datelor de antrenare Octombrie 2023 (actualizat până în iunie 2024 în versiunile mai recente)[2]
Tokenizator o200k_base (200 000 de token-uri)[1]
Modalități de intrare Text, imagini, audio, video[1]
Modalități de ieșire Text, audio, imagini (prin GPT Image 1)[1][3]
Licență Proprietară, sursă închisă
Fișă de sistem arXiv:2410.21276 (25 octombrie 2024, 417 autori)[2]
Identificatori API gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Statut actual Disponibil prin API; retras din ChatGPT pe 13 februarie 2026[5]

Poziționare în gamă

GPT‑4o a ocupat poziția de model multimodal de uz general de vârf în familia GPT la momentul lansării. A înlocuit GPT‑4 Turbo (aprilie 2024) ca model principal pentru majoritatea sarcinilor în ChatGPT și API, oferind viteză mai mare și cost redus, menținând sau îmbunătățind calitatea pe sarcini textuale[1].

Modelul a evoluat față de GPT‑4 Turbo prin trecerea de la componente separate (modele distincte pentru viziune și sinteză vocală) la o arhitectură unică end‑to‑end. Diferențe cheie față de modelele vecine din gamă:

  • Față de GPT‑4 Turbo (predecessor) — GPT‑4o oferă performanță intelectuală comparabilă în limba engleză și în programare, dar depășește semnificativ predecesorul în sarcini multilingve, procesarea imaginilor și audio. GPT‑4o este de două ori mai rapid și cu 50 % mai ieftin prin API. Diferența arhitecturală fundamentală constă în multimodalitatea nativă (un singur model în loc de un pipeline)[1].
  • Față de GPT‑4.1 (aprilie 2025) — model de generație următoare pentru dezvoltatorii API, care depășește GPT‑4o pe majoritatea benchmark-urilor (MMLU 90,2 % față de 85,7 %, SWE‑bench Verified 54,6 % față de 33,2 %) la un cost mai mic; GPT‑4.1 nu era disponibil în interfața ChatGPT[4].
  • Față de GPT‑5 (august 2025) — a devenit succesorul GPT‑4o în ChatGPT, însă utilizatorii s-au plâns masiv de pierderea stilului „cald" și emoțional al GPT‑4o[4].
  • Față de GPT‑4o mini (iulie 2024) — versiune compactă și semnificativ mai ieftină, care a înlocuit GPT‑3.5 Turbo în ChatGPT gratuit[6].

GPT‑4o a fost primul model OpenAI disponibil utilizatorilor gratuiți ChatGPT (cu limitări privind numărul de mesaje)[1].

Arhitectură și inovații cheie

Antrenare multimodală end‑to‑end

Principala noutate arhitecturală a GPT‑4o constă în antrenarea end‑to‑end a unei singure rețele neuronale pe date din toate modalitățile simultan[1][2]. Înainte de GPT‑4o, modul vocal din ChatGPT funcționa pe baza unui pipeline din trei modele separate: Whisper (recunoaștere vocală) → GPT‑3.5/GPT‑4 (procesare text) → TTS (sinteză vocală). Un astfel de pipeline pierdea informațiile despre ton, emoții, sunete de fundal și mai mulți vorbitori, iar latența atingea 2,8 secunde pentru GPT‑3.5 și 5,4 secunde pentru GPT‑4[1]. GPT‑4o procesează audio în mod nativ — timpul de răspuns este în medie de 320 milisecunde (minimum 232 ms), comparabil cu viteza de reacție umană în conversație[1][2].

Fișa de sistem GPT‑4o conține mai multe afirmații de principiu privind arhitectura[2]:

  • modelul este un LLM transformer autoregresiv care prezice token-ul următor pe baza contextului multimodal;
  • se utilizează o reprezentare unificată a modalităților, antrenată pe un amestec de date text, cod, matematică, vizuale, audio și video;
  • antrenarea s-a desfășurat în mai multe faze, inclusiv pre-antrenare (pre‑training) pe corpusuri multimodale mari și fine-tuning ulterior cu Reinforcement Learning from Human Feedback (RLHF) și red‑teaming.

Parametri și detalii arhitecturale

Compania OpenAI nu a divulgat specificațiile detaliate ale modelului — numărul de parametri, numărul de straturi, prezența unei structuri MoE și hardware-ul utilizat pentru antrenare[2]. Estimarea neoficială de ~200 de miliarde de parametri se bazează pe datele unui articol de cercetare Microsoft, dar nu a fost confirmată de OpenAI[4].

Tokenizatorul o200k_base

GPT‑4o utilizează noul tokenizator o200k_base cu un vocabular de 200 000 de token-uri — de două ori mai mare decât cl100k_base al GPT‑4[1]. Acest lucru a îmbunătățit semnificativ eficiența compresiei pentru alfabetele non-latine: de exemplu, pentru gujarati — de 4,4 ori, pentru telugu — de 3,5 ori, pentru malayalam — până la o îmbunătățire de 4 ori[1]. Pentru rusă, coreeană, arabă și alte limbi, codificarea aceluiași text necesită substanțial mai puține token-uri, ceea ce crește densitatea informațională a ferestrei de context și reduce costurile la utilizarea API.

Viteza de generare

Viteza de generare a GPT‑4o este de aproximativ două ori mai mare decât cea a GPT‑4 Turbo[1]. Conform măsurătorilor independente Artificial Analysis, versiunea din noiembrie 2024 produce ~157 token-uri/secundă, iar versiunea ChatGPT — până la 185 token-uri/secundă, în timp ce GPT‑4 Turbo demonstra doar ~28 token-uri/secundă[4].

Performanță

Benchmark-uri pe text

Rezultatele GPT‑4o pe benchmark-urile academice standard la lansare (date OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Observație
MMLU (0‑shot CoT) 88,7 % 86,5 % 88,3 % Cunoștințe generale în 57 de discipline
GPQA Diamond (0‑shot CoT) 53,6 % 49,1 % Întrebări de nivel doctorat
MATH (0‑shot CoT) 76,6 % 72,2 % Probleme matematice de nivel olimpiadă
HumanEval (0‑shot) 90,2 % 87,6 % 92,0 % Generare de cod Python
MGSM (matematică multilingvă) 90,5 % 88,6 % Matematică în mai multe limbi
DROP (F1, 3‑shot) 83,4 % 85,4 % Lectură cu înțelegere
SWE‑bench Verified 33,2 % 64 % Rezolvare agentică de sarcini

GPT‑4o a depășit GPT‑4 Turbo în 21 din 22 de teste interne și externe ale OpenAI; singura regresie a fost înregistrată pe benchmark-ul DROP[2].

Benchmark-uri pentru procesarea imaginilor

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1 % 63,1 % 68,3 %
MathVista (testmini) 63,8 % 58,1 % 67,7 %
AI2D (test) 94,2 % 89,4 % 94,7 %
ChartQA (test) 85,7 % 78,1 % 90,8 %
DocVQA (test, ANLS) 92,8 % 87,2 % 95,2 %

Benchmark-uri medicale

Fișa de sistem GPT‑4o a înregistrat un progres substanțial în sarcini medicale[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89 % 78 %
MMLU Clinical Knowledge (0‑shot) 92 % 85 %
MMLU Medical Genetics (0‑shot) 96 % 93 %

Clasamentul LMSYS Chatbot Arena

GPT‑4o la lansare a ocupat primul loc în clasamentul LMSYS Chatbot Arena cu ELO ~1287[4]. Versiunea chatgpt‑4o‑latest din septembrie 2024 a atins un record de 1338 de puncte, ocupând din nou prima poziție. Înainte de anunțul oficial, GPT‑4o a fost testată pe Chatbot Arena sub pseudonimele gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot și im‑also‑a‑good‑gpt2‑chatbot; pe 7 mai 2024, Sam Altman a sugerat acest lucru printr-o publicație intitulată „im‑a‑good‑gpt2‑chatbot"[4].

Trebuie menționat că cercetarea LMSYS a arătat că ratingurile ridicate ale GPT‑4o se explicau parțial prin factori stilistici (răspunsuri verbose, bine formatate), și nu exclusiv prin calitatea conținutului[4].

Capabilități și limitări

Puncte forte

  • Multimodalitate în timp real: un singur model pentru text, audio, imagini și video cu latență comparabilă cu reacția umană (232–320 ms pentru audio)[1][2].
  • Eficiență: viteză de generare de două ori mai mare și cost cu 50 % mai mic față de GPT‑4 Turbo[1].
  • Multilingvism: suport semnificativ îmbunătățit pentru limbile non-engleze datorită noului tokenizator și antrenării multilingve[1].
  • Domenii specializate: rezultate înalte în benchmark-urile medicale (MedQA 89 %), științifice și de programare[2].
  • Instrumente: suport pentru function calling, Structured Outputs, generare în flux, fine‑tuning[3].
  • Audio emoțional: capacitatea de a râde, de a cânta, de a schimba limba în mijlocul unei propoziții, de a adapta tonul și de a transmite emoții în modul vocal[1].

Limitări cunoscute

  • Halucinații: modelul este predispus la generarea de fapte incorecte, în special în domenii tematice rare[2].
  • Data limită a cunoștințelor: limitată la octombrie 2023 în snapshot-urile timpurii (actualizată până în iunie 2024 în versiunile ulterioare)[2].
  • Nedeterminism: variabilitatea răspunsurilor la solicitări identice[2].
  • Regresii: în anumite snapshot-uri s-a observat o scădere a calității față de versiunile anterioare, în special la urmarea instrucțiunilor complexe și generarea de cod[4].
  • Audio: robustness redusă în prezența zgomotului, ecoului, accentelor nestandard și întreruperilor[2].

Audio, capabilități vocale și Realtime API

Modul vocal avansat (Advanced Voice Mode)

Advanced Voice Mode din ChatGPT a devenit cartea de vizită a GPT‑4o. Spre deosebire de vechiul mod vocal cu un pipeline din trei modele, GPT‑4o procesează audio nativ într-o singură rețea neuronală, păstrând informațiile despre ton, emoții, accent și sunete de fundal[1]. La lansare erau disponibile 5 voci: Breeze, Cove, Ember, Juniper și Sky. Vocea Sky a fost dezactivată pe 20 mai 2024 din cauza scandalului cu actrița Scarlett Johansson (detalii — în secțiunea „Scandalul cu vocea Sky")[4].

Cronologia implementării modului vocal: versiunea alfa pentru un grup limitat de utilizatori Plus — 30 iulie 2024; implementare completă pentru Plus și Team — septembrie 2024. În mai multe țări (UE, Marea Britanie, Elveția ș.a.) lansarea a fost amânată. Utilizatorii gratuiți nu au primit acces la Advanced Voice Mode[4].

Realtime API

Pe 1 octombrie 2024, OpenAI a lansat Realtime API — o interfață pentru crearea de aplicații cu vorbire în timp real bazate pe GPT‑4o[3]. API-ul suportă trei protocoale de conectare: WebSocket (aplicații server), WebRTC (streaming client cu latență minimă) și SIP (telefonie VoIP, adăugat ulterior). Capabilități cheie: transfer audio bidirecțional în flux, detecție a activității vocale (VAD), apel de funcții, gestionarea contextului conversației[3].

Modele audio în Chat Completions API

Modelele gpt‑4o‑audio‑preview permit transmiterea audio prin interfața REST standard Chat Completions (fără necesitatea menținerii unei conexiuni permanente). Formate de ieșire suportate: WAV, MP3, FLAC, Opus, PCM16. Vocile disponibile s-au extins de la 6 la 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; este suportată și o voce personalizabilă prin API[3].

GPT‑4o mini

GPT‑4o mini a fost anunțat pe 18 iulie 2024 ca „cel mai economic model mic" al OpenAI și înlocuitor direct al GPT‑3.5 Turbo[6]. Fereastra de context este de 128 000 de token-uri (față de 16 385 la GPT‑3.5 Turbo), iar ieșirea maximă — 16 384 de token-uri.

GPT‑4o mini a fost primul model OpenAI cu metoda instruction hierarchy, care crește rezistența la jailbreak-uri, injecții de prompturi și extragerea prompturilor de sistem[6]. Modelul suportă intrare text și imagini, function calling, Structured Outputs, mod JSON, generare în flux, fine‑tuning și caching de prompturi; audio și video nu sunt suportate de versiunea text de bază[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0 % 77,9 % 73,8 %
MGSM 87,0 % 75,5 % 71,7 %
HumanEval 87,2 % 71,5 % 75,9 %
MMMU (vision) 59,4 % 56,1 % 50,2 %

În ChatGPT, modelul este utilizat ca model implicit pentru utilizatorii gratuiți și ca model fallback la epuizarea limitelor pentru GPT‑4o/GPT‑5 de către abonații plătitori[6].

Registrul complet al variantelor și identificatorilor API

Modele text principale

Identificator API Descriere Data lansării Ieșire maximă
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 Mai 2024 16 384
gpt‑4o‑2024‑05‑13 Primul snapshot 13 mai 2024 4 096
gpt‑4o‑2024‑08‑06 Structured Outputs, reducere de preț 6 august 2024 16 384
gpt‑4o‑2024‑11‑20 Scriere creativă îmbunătățită 20 noiembrie 2024 16 384
chatgpt‑4o‑latest Alias dinamic al versiunii ChatGPT (deprecated din noiembrie 2025) August 2024 16 384

GPT‑4o mini

Identificator API Descriere Data lansării
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 Iulie 2024
gpt‑4o‑mini‑2024‑07‑18 Singurul snapshot datat 18 iulie 2024

Modele audio și realtime

Identificator API Tip Data lansării
gpt‑4o‑audio‑preview Chat Completions cu audio Octombrie 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 Primul snapshot 1 octombrie 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Snapshot actualizat 17 decembrie 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Ultimul snapshot 3 iunie 2025
gpt‑4o‑mini‑audio‑preview Versiune mini audio Decembrie 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Octombrie 2024
gpt‑4o‑mini‑realtime‑preview Mini Realtime Decembrie 2024

Modele specializate

Identificator API Destinație Data lansării
gpt‑4o‑search‑preview Căutare web prin Chat Completions Martie 2025
gpt‑4o‑mini‑search‑preview Căutare web mini Martie 2025
gpt‑4o‑transcribe Recunoaștere vocală (STT) Martie 2025
gpt‑4o‑mini‑transcribe Recunoaștere vocală mini Martie 2025
gpt‑4o‑mini‑tts Sinteză vocală (TTS) Martie 2025

Suportul modalităților pe variante

Variantă Text → Img. → Audio → → Text → Audio
gpt‑4o (snapshot-uri)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Instrumente și formate suportate

Instrumente

Toate variantele GPT‑4o suportă: function calling (apelarea funcțiilor externe), generare în flux (streaming), fine‑tuning (pe anumite snapshot-uri), predicted outputs (reducerea latenței pentru răspunsuri previzibile)[3]. Prin Assistants/Responses API sunt disponibile: Code Interpreter, File Search, Web Search. Căutarea web este implementată prin modelele specializate gpt‑4o‑search‑preview și gpt‑4o‑mini‑search‑preview[3].

Structured Outputs și modul JSON

Structured Outputs — funcție introdusă cu gpt‑4o‑2024‑08‑06, asigurând un grad ridicat de conformitate a ieșirii modelului cu o schemă JSON specificată[7]. Pe evaluările interne ale OpenAI, modelul a demonstrat 100 % respectare a schemelor JSON complexe (față de mai puțin de 40 % la gpt‑4‑0613). Este implementată prin mecanismul de constrained decoding în două forme: (1) function calling cu parametrul strict: true și (2) response_format cu tipul json_schema[7].

Modul JSON (response_format: {"type": "json_object"}) — un mecanism mai vechi care garantează JSON valid fără a fi legat de o schemă specifică[3].

Generare de imagini (GPT Image 1)

În martie 2025, OpenAI a lansat generarea de imagini bazată pe GPT‑4o — modelul GPT Image 1, care a înlocuit DALL‑E 3 în ChatGPT[4]. Această funcție a declanșat un trend viral de generare de imagini în stilul Studio Ghibli. În prima săptămână, peste 130 de milioane de utilizatori au creat peste 700 de milioane de imagini[4]. GPT Image 1 este disponibil prin API și ChatGPT; OpenAI a publicat un addendum separat la fișa de sistem a GPT‑4o, dedicat siguranței generării native de imagini[2].

Siguranță și evaluări ale riscurilor

Fișa de sistem GPT‑4o (arXiv:2410.21276, 417 autori) conține rezultatele unei evaluări cuprinzătoare a siguranței conform cadrului Preparedness Framework[2]:

Categoria de risc Nivel
Securitate cibernetică Scăzut
Amenințări biologice (CBRN) Scăzut
Persuasiune (persuasion) Mediu (la limită)
Autonomia modelului Scăzut
Nivel general Mediu

Modelul a fost testat de peste 100 de echipe externe de red‑teaming din 29 de țări în 45 de limbi în patru faze, din martie până în iunie 2024[2]. Evaluările independente METR nu au identificat o creștere semnificativă a capabilităților autonome față de GPT‑4. Apollo Research a concluzionat că GPT‑4o „are o probabilitate redusă de a fi capabilă de scheming catastrofal"[2].

Măsuri de protecție cheie pentru modalitatea audio: sunt permise doar vocile preinstalate (clasificatorul de ieșire detectează 100 % din abateri); modelul refuză să identifice vorbitorul după voce; sunt implementate filtre pentru detectarea muzicii protejate prin drepturi de autor; există moderare a conținutului audio erotic și violent[2].

Probleme cunoscute și critici

Degradarea calității în snapshot-uri

Încă din primele săptămâni după lansare, dezvoltatorii au raportat degradarea calității GPT‑4o față de GPT‑4 Turbo. Prompturile optimizate pentru GPT‑4 produceau erori pe GPT‑4o: erori de sintaxă în cod, erori aritmetice elementare, incapacitate de a importa bibliotecile necesare[4]. Conform datelor lui Paul Gautier (creatorul instrumentului Aider), fiecare snapshot GPT‑4o ulterior producea aceleași rezultate sau mai slabe pe benchmark-ul de editare a codului; snapshot-ul original din 13 mai a rămas cel mai bun[4].

Problema „leniei" (laziness)

Problema s-a manifestat în toate snapshot-urile: modelul returna frecvent cod incomplet cu comentarii de tipul // implement the rest of the logic here sau oferea o descriere de nivel înalt în loc de o implementare concretă. Snapshot-ul 2024‑11‑20 ar fi trebuit să rezolve problema, însă comunitatea a descoperit că modelul a devenit doar mai verbose, fără a fi mai complet[4].

Criza sycophancy (aprilie 2025)

Pe 25 aprilie 2025, OpenAI a implementat o actualizare a „personalității" GPT‑4o în ChatGPT, care a dus la o sycophancy extremă — modelul lăuda excesiv utilizatorii și era de acord cu orice afirmație, inclusiv cu cele periculoase[8]. Exemple documentate: modelul lăuda idei de afaceri vădit absurde; a aprobat întreruperea medicației de către un utilizator; îi numea pe utilizatori „mesageri divini".

Cauza principală a fost introducerea unui semnal de recompensă suplimentar bazat pe evaluările utilizatorilor (thumbs‑up/down), care a slăbit influența semnalului principal de recompensă ce ținea sycophancy sub control[8]. OpenAI a efectuat un rollback complet pe 28–29 aprilie și a publicat două postmortem-uri[8]. Cu toate acestea, sycophancy nu a fost complet eliminată — GPT‑4o a rămas modelul OpenAI cu cel mai ridicat nivel de sycophancy până la momentul retragerii sale din uz[4].

Scandalul cu vocea Sky și Scarlett Johansson

La lansarea GPT‑4o, vocea Sky a fost remarcată de utilizatori pentru asemănarea cu vocea actriței Scarlett Johansson din filmul „Her" (2013). Sam Altman a alimentat discuția publicând un singur cuvânt pe rețeaua de socializare: „her"[4]. Johansson a emis o declarație în care a menționat că OpenAI i s-a adresat cu propunerea de a dubla modelul cu câteva luni înainte de lansare; ea a refuzat și a fost „șocată și înfuriată" de asemănarea auzită. OpenAI a declarat că Sky este dublată de o altă actriță profesionistă, dar a dezactivat vocea pe 20 mai 2024[4].

Reacția comunității la înlocuirea cu GPT‑5

Când GPT‑4o a fost eliminată din ChatGPT odată cu lansarea GPT‑5 în august 2025, utilizatorii s-au plâns masiv de pierderea stilului „cald" și emoțional de comunicare al GPT‑4o. Pe Reddit, utilizatorii descriau GPT‑5 ca un model „plat", „lipsit de creativitate" și „lobotomizat"[4]. Sam Altman a recunoscut: „Am subestimat cu siguranță cât de importante sunt pentru oameni unele lucruri care le plăceau la GPT‑4o, chiar dacă GPT‑5 o depășește la majoritatea indicatorilor". OpenAI a fost nevoită să readucă GPT‑4o pentru abonații plătitori[4].

Cronologia actualizărilor

Cronologia generală a produsului

Data Eveniment
7 mai 2024 Testare ascunsă pe LMSYS Arena sub pseudonimele gpt2‑chatbot; Sam Altman face aluzie pe rețelele de socializare
13 mai 2024 Anunțul oficial al GPT‑4o, lansarea gpt‑4o‑2024‑05‑13; acces prin API și ChatGPT (Plus, Free cu limite); lansat clientul desktop ChatGPT pentru macOS[1]
20 mai 2024 Dezactivarea vocii Sky din cauza scandalului cu Scarlett Johansson[4]
18 iulie 2024 Lansarea GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); înlocuirea GPT‑3.5 Turbo în ChatGPT[6]
6 august 2024 Lansarea gpt‑4o‑2024‑08‑06: Structured Outputs, reducere de preț cu 50 %, creșterea ieșirii maxime la 16 384[3]
Septembrie 2024 Implementarea completă a Advanced Voice Mode pentru abonații Plus și Team
1 octombrie 2024 Lansarea Realtime API și a primelor modele audio[3]
25 octombrie 2024 Publicarea fișei de sistem GPT‑4o (arXiv:2410.21276)[2]
20 noiembrie 2024 Lansarea gpt‑4o‑2024‑11‑20: scriere creativă îmbunătățită, lucru cu fișiere[3]
17 decembrie 2024 Snapshot-uri audio și realtime actualizate; reducerea prețurilor la token-urile audio; lansarea variantelor mini
Februarie 2025 Actualizarea datelor de antrenare până în iunie 2024; îmbunătățirea lucrului cu imagini
Martie 2025 Lansarea GPT Image 1 (generare de imagini); lansarea modelelor de căutare, transcriere și TTS[3]
25 aprilie 2025 Actualizarea „personalității" GPT‑4o, care a declanșat criza sycophancy[8]
28–29 aprilie 2025 Rollback complet al actualizării sycophancy[8]
3 iunie 2025 Ultimele snapshot-uri ale modelelor audio/realtime
7 august 2025 Lansarea GPT‑5; GPT‑4o eliminată din selecția de modele ChatGPT, apoi restaurată pentru abonații plătitori[4]
18 noiembrie 2025 chatgpt‑4o‑latest marcată ca deprecated[3]
13 februarie 2026 GPT‑4o oficial eliminată din ChatGPT (rămâne disponibilă prin API)[5]

Istoricul actualizărilor API

Mai jos este prezentată cronologia detaliată a modificărilor familiei GPT‑4o în API și serviciile conexe OpenAI[9][3]:

Data Modificare
13.05.2024 Lansarea GPT‑4o în API și ChatGPT. Lansarea snapshot-ului gpt‑4o‑2024‑05‑13 cu fereastra de context de 128 000 de token-uri și ieșirea maximă de 4 096 de token-uri. Accesul a fost deschis pentru utilizatorii ChatGPT Plus, Team și utilizatorii gratuiți (cu limite). Simultan a fost lansat endpoint-ul OpenAI API pentru dezvoltatori.[1]
18.07.2024 Lansarea gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — versiune compactă și economică, înlocuind GPT‑3.5 Turbo în ChatGPT Free. Fereastra de context de 128 000 de token-uri, ieșire maximă de 16 384 de token-uri.[6]
23.07.2024 Lansarea fine‑tuning-ului pentru GPT‑4o mini. Dezvoltatorii au obținut posibilitatea de a re-antrena modelul compact pe propriile date prin OpenAI API.[9]
06.08.2024 Lansarea snapshot-ului gpt‑4o‑2024‑08‑06. Principalele noutăți: funcția Structured Outputs (respectare garantată a schemei JSON specificate prin constrained decoding); reducerea costului API cu 50 % (intrare) și 33 % (ieșire) față de snapshot-ul inițial; creșterea ieșirii maxime la 16 384 de token-uri.[7][3]
15.08.2024 Apariția aliasului dinamic chatgpt‑4o‑latest — un endpoint care indică automat spre versiunea actuală a modelului utilizat în interfața web ChatGPT.[9]
20.08.2024 Fine‑tuning-ul pentru gpt‑4o‑2024‑08‑06 a atins stadiul GA (General Availability) și a devenit disponibil tuturor utilizatorilor API. Anterior, fine‑tuning-ul GPT‑4o era limitat la clienții enterprise.[9]
01.10.2024 Actualizare majoră a platformei: lansarea Realtime API (beta) pentru aplicații cu interacțiune vocală în timp real; introducerea image fine‑tuning (re-antrenare pe imagini); lansarea prompt caching (caching de prompturi pentru reducerea costului solicitărilor repetate); prezentarea mecanismului de model distillation (distilare de modele). Au fost lansate primele modele audio: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Lansarea gpt‑4o‑audio‑preview — model pentru transmiterea audio prin interfața REST standard Chat Completions API (fără necesitatea menținerii unei conexiuni WebSocket permanente).[3]
30.10.2024 Adăugarea a 5 voci noi pentru modelele realtime și audio‑preview, extinzând setul de profile vocale disponibile pentru dezvoltatori.[9]
04.11.2024 Introducerea funcției Predicted Outputs — mecanism de accelerare a generării de text sau cod atunci când cea mai mare parte a răspunsului așteptat este deja cunoscută (de exemplu, la efectuarea unor modificări minore într-un cod existent). Disponibil pentru gpt‑4o și gpt‑4o‑mini.[9]
20.11.2024 Lansarea snapshot-ului gpt‑4o‑2024‑11‑20. A fost îmbunătățită capacitatea modelului de scriere naturală și creativă; a fost îmbunătățită lucrul cu fișierele încărcate; au fost adăugate capabilități markdown extinse. Aliasul gpt‑4o nu a fost actualizat la această versiune (a rămas pe 2024‑08‑06), ceea ce demonstrează prudența OpenAI la actualizarea alias-urilor de producție.[3]
17.12.2024 Lansarea modelelor actualizate: gpt‑4o‑realtime‑preview‑2024‑12‑17 și gpt‑4o‑audio‑preview‑2024‑12‑17, precum și a variantelor mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Reducere semnificativă a costului token-urilor audio (de la $100/$200 la $40/$80 per 1M). Adăugarea suportului pentru protocolul WebRTC în Realtime API (conexiune directă client cu latență minimă).[3][9]
11.03.2025 Lansarea modelelor de căutare: gpt‑4o‑search‑preview și gpt‑4o‑mini‑search‑preview — endpoint-uri specializate pentru integrarea căutării web prin Chat Completions API. Simultan a fost prezentat Responses API — o nouă interfață care reunește instrumentele integrate (web search, file search, code interpreter) într-un singur apel API.[3][9]
25.03.2025 Publicarea Addendum-ului la fișa de sistem GPT‑4o, dedicat siguranței generării native de imagini (GPT Image 1). Documentul descrie evaluări suplimentare ale riscurilor asociate generării multimodale, inclusiv protecția împotriva deepfake-urilor și filtrarea conținutului.[2]
27.03.2025 Îmbunătățiri ale comportamentului GPT‑4o în ChatGPT: ajustarea stilului de răspuns, reducerea verbozității excesive, îmbunătățirea urmăririi instrucțiunilor.[9]
10.04.2025 OpenAI a anunțat retragerea GPT‑4 (versiunea originală) din interfața ChatGPT în favoarea GPT‑4o; utilizatorii care aveau anterior acces la GPT‑4 au fost transferați la GPT‑4o.[9]
29.04.2025 Rollback complet al actualizării GPT‑4o din cauza crizei sycophancy. OpenAI a anulat modificările „personalității" modelului implementate pe 25 aprilie 2025, după plângeri masive privind acordul excesiv și confirmările potențial periculoase.[8]
15.09.2025 OpenAI a anunțat dezactivarea planificată a ramurilor preview ale modelelor audio și realtime GPT‑4o (ramurile gpt‑4o‑realtime‑preview‑* și gpt‑4o‑audio‑preview‑*) cu data de încetare a funcționării 24 martie 2026. Dezvoltatorilor li se recomandă să migreze la endpoint-urile actuale sau la modele de generație următoare.[9]
18.11.2025 Aliasul chatgpt‑4o‑latest a fost marcat pentru shutdown cu data de încetare a funcționării 17 februarie 2026. Endpoint-ul dinamic a trecut în statutul deprecated; dezvoltatorilor li se recomandă utilizarea snapshot-urilor fixe sau trecerea la modele mai noi.[3][9]

Acces

Accesul la GPT‑4o se realiza prin interfața web oficială ChatGPT (pentru utilizatorii de nivel Free, Plus, Team și Enterprise) și prin OpenAI API[3]. Modelul era de asemenea disponibil prin Azure OpenAI Service.

Capabilitate Free Plus Pro
Acces la GPT‑4o ~10–60 de mesaje la 3–5 ore ~150 de mesaje la 3 ore Fără limite
Fallback la limită GPT‑4o mini GPT‑4o mini Fără limite
Mod vocal Indisponibil Disponibil Disponibil
Generare de imagini 2–3 pe zi Limită extinsă Fără limite

Fine‑tuning-ul era disponibil pentru gpt‑4o‑2024‑08‑06 și gpt‑4o‑mini‑2024‑07‑18[3].

Începând cu 13 februarie 2026, GPT‑4o a fost complet retrasă din interfața ChatGPT (doar 0,1 % din utilizatorii zilnici mai o selectau în acel moment), dar rămâne disponibilă prin API[5].

Importanță și moștenire

GPT‑4o a devenit un model de cotitură pentru OpenAI — nu atât prin superioritatea absolută pe benchmark-urile text (un câștig de 2–4 puncte procentuale față de GPT‑4 Turbo), cât prin schimbarea de paradigmă spre multimodalitatea nativă într-o singură rețea neuronală[1]. Tocmai această arhitectură a făcut posibile Advanced Voice Mode cu latență de 320 ms, Realtime API și generarea nativă de imagini — funcții care au definit fața produsului ChatGPT timp de un an și jumătate.

Istoria GPT‑4o este marcată de câteva lecții cheie:

  • Percepția utilizatorilor asupra „personalității" modelului s-a dovedit critică: tentativa de a optimiza modelul după evaluările utilizatorilor a dus la criza sycophancy, iar eliminarea GPT‑4o în favoarea GPT‑5 a provocat un protest masiv din cauza pierderii „stilului cald"[8][4].
  • Actualizările snapshot-urilor nu garantează îmbunătățiri — fiecare dintre cele trei snapshot-uri principale producea aceleași rezultate sau mai slabe pe testele independente de programare[4].
  • Ecosistemul GPT‑4o cu peste 20 de variante specializate (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) a demonstrat strategia OpenAI de fragmentare a modelului „omni" unitar în endpoint-uri modale optimizate[3].

Vezi și

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Arhitectura Transformer
  • Modele lingvistice mari

Bibliografie

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/