GPT-4o (RO)
GPT‑4o (se pronunță „ji‑pi‑ti‑for‑ou"; litera „o" provine din lat. omni — „tot", „atotcuprinzător") — model lingvistic mare (LLM) multimodal din familia GPT, dezvoltat de compania OpenAI și prezentat pe 13 mai 2024[1]. GPT‑4o a devenit primul model OpenAI antrenat ca o singură rețea neuronală end‑to‑end, capabilă să proceseze simultan text, imagini și audio — spre deosebire de predecesorii săi, unde pentru fiecare modalitate se foloseau modele separate[2]. Modelul a înlocuit GPT‑4 Turbo în calitate de vârf al gamei, oferind o viteză de generare de două ori mai mare, un cost API cu 50 % mai scăzut și capabilități multimodale calitativ noi[1]. Familia GPT‑4o include peste 20 de variante, printre care compactul GPT‑4o mini, modele audio, modele în timp real, modele de căutare și modele vocale specializate[3].
Fișă informativă
| Parametru | Valoare |
|---|---|
| Denumire completă | GPT‑4o (GPT‑4 Omni) |
| Dezvoltator | OpenAI |
| Data anunțului | 13 mai 2024[1] |
| Tip | Model multimodal autoregresiv (transformer)[2] |
| Număr de parametri | Nedivulgat oficial (estimare neoficială — ~200 mld. pentru GPT‑4o, ~8 mld. pentru GPT‑4o mini)[4] |
| Fereastra de context | 128 000 de token-uri[3] |
| Ieșire maximă | 16 384 token-uri (4 096 pentru gpt‑4o‑2024‑05‑13)[3] |
| Data limită a datelor de antrenare | Octombrie 2023 (actualizat până în iunie 2024 în versiunile mai recente)[2] |
| Tokenizator | o200k_base (200 000 de token-uri)[1] |
| Modalități de intrare | Text, imagini, audio, video[1] |
| Modalități de ieșire | Text, audio, imagini (prin GPT Image 1)[1][3] |
| Licență | Proprietară, sursă închisă |
| Fișă de sistem | arXiv:2410.21276 (25 octombrie 2024, 417 autori)[2] |
| Identificatori API | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Statut actual | Disponibil prin API; retras din ChatGPT pe 13 februarie 2026[5] |
Poziționare în gamă
GPT‑4o a ocupat poziția de model multimodal de uz general de vârf în familia GPT la momentul lansării. A înlocuit GPT‑4 Turbo (aprilie 2024) ca model principal pentru majoritatea sarcinilor în ChatGPT și API, oferind viteză mai mare și cost redus, menținând sau îmbunătățind calitatea pe sarcini textuale[1].
Modelul a evoluat față de GPT‑4 Turbo prin trecerea de la componente separate (modele distincte pentru viziune și sinteză vocală) la o arhitectură unică end‑to‑end. Diferențe cheie față de modelele vecine din gamă:
- Față de GPT‑4 Turbo (predecessor) — GPT‑4o oferă performanță intelectuală comparabilă în limba engleză și în programare, dar depășește semnificativ predecesorul în sarcini multilingve, procesarea imaginilor și audio. GPT‑4o este de două ori mai rapid și cu 50 % mai ieftin prin API. Diferența arhitecturală fundamentală constă în multimodalitatea nativă (un singur model în loc de un pipeline)[1].
- Față de GPT‑4.1 (aprilie 2025) — model de generație următoare pentru dezvoltatorii API, care depășește GPT‑4o pe majoritatea benchmark-urilor (MMLU 90,2 % față de 85,7 %, SWE‑bench Verified 54,6 % față de 33,2 %) la un cost mai mic; GPT‑4.1 nu era disponibil în interfața ChatGPT[4].
- Față de GPT‑5 (august 2025) — a devenit succesorul GPT‑4o în ChatGPT, însă utilizatorii s-au plâns masiv de pierderea stilului „cald" și emoțional al GPT‑4o[4].
- Față de GPT‑4o mini (iulie 2024) — versiune compactă și semnificativ mai ieftină, care a înlocuit GPT‑3.5 Turbo în ChatGPT gratuit[6].
GPT‑4o a fost primul model OpenAI disponibil utilizatorilor gratuiți ChatGPT (cu limitări privind numărul de mesaje)[1].
Arhitectură și inovații cheie
Antrenare multimodală end‑to‑end
Principala noutate arhitecturală a GPT‑4o constă în antrenarea end‑to‑end a unei singure rețele neuronale pe date din toate modalitățile simultan[1][2]. Înainte de GPT‑4o, modul vocal din ChatGPT funcționa pe baza unui pipeline din trei modele separate: Whisper (recunoaștere vocală) → GPT‑3.5/GPT‑4 (procesare text) → TTS (sinteză vocală). Un astfel de pipeline pierdea informațiile despre ton, emoții, sunete de fundal și mai mulți vorbitori, iar latența atingea 2,8 secunde pentru GPT‑3.5 și 5,4 secunde pentru GPT‑4[1]. GPT‑4o procesează audio în mod nativ — timpul de răspuns este în medie de 320 milisecunde (minimum 232 ms), comparabil cu viteza de reacție umană în conversație[1][2].
Fișa de sistem GPT‑4o conține mai multe afirmații de principiu privind arhitectura[2]:
- modelul este un LLM transformer autoregresiv care prezice token-ul următor pe baza contextului multimodal;
- se utilizează o reprezentare unificată a modalităților, antrenată pe un amestec de date text, cod, matematică, vizuale, audio și video;
- antrenarea s-a desfășurat în mai multe faze, inclusiv pre-antrenare (pre‑training) pe corpusuri multimodale mari și fine-tuning ulterior cu Reinforcement Learning from Human Feedback (RLHF) și red‑teaming.
Parametri și detalii arhitecturale
Compania OpenAI nu a divulgat specificațiile detaliate ale modelului — numărul de parametri, numărul de straturi, prezența unei structuri MoE și hardware-ul utilizat pentru antrenare[2]. Estimarea neoficială de ~200 de miliarde de parametri se bazează pe datele unui articol de cercetare Microsoft, dar nu a fost confirmată de OpenAI[4].
Tokenizatorul o200k_base
GPT‑4o utilizează noul tokenizator o200k_base cu un vocabular de 200 000 de token-uri — de două ori mai mare decât cl100k_base al GPT‑4[1]. Acest lucru a îmbunătățit semnificativ eficiența compresiei pentru alfabetele non-latine: de exemplu, pentru gujarati — de 4,4 ori, pentru telugu — de 3,5 ori, pentru malayalam — până la o îmbunătățire de 4 ori[1]. Pentru rusă, coreeană, arabă și alte limbi, codificarea aceluiași text necesită substanțial mai puține token-uri, ceea ce crește densitatea informațională a ferestrei de context și reduce costurile la utilizarea API.
Viteza de generare
Viteza de generare a GPT‑4o este de aproximativ două ori mai mare decât cea a GPT‑4 Turbo[1]. Conform măsurătorilor independente Artificial Analysis, versiunea din noiembrie 2024 produce ~157 token-uri/secundă, iar versiunea ChatGPT — până la 185 token-uri/secundă, în timp ce GPT‑4 Turbo demonstra doar ~28 token-uri/secundă[4].
Performanță
Benchmark-uri pe text
Rezultatele GPT‑4o pe benchmark-urile academice standard la lansare (date OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Observație |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88,7 % | 86,5 % | 88,3 % | Cunoștințe generale în 57 de discipline |
| GPQA Diamond (0‑shot CoT) | 53,6 % | 49,1 % | — | Întrebări de nivel doctorat |
| MATH (0‑shot CoT) | 76,6 % | 72,2 % | — | Probleme matematice de nivel olimpiadă |
| HumanEval (0‑shot) | 90,2 % | 87,6 % | 92,0 % | Generare de cod Python |
| MGSM (matematică multilingvă) | 90,5 % | 88,6 % | — | Matematică în mai multe limbi |
| DROP (F1, 3‑shot) | 83,4 % | 85,4 % | — | Lectură cu înțelegere |
| SWE‑bench Verified | 33,2 % | — | 64 % | Rezolvare agentică de sarcini |
GPT‑4o a depășit GPT‑4 Turbo în 21 din 22 de teste interne și externe ale OpenAI; singura regresie a fost înregistrată pe benchmark-ul DROP[2].
Benchmark-uri pentru procesarea imaginilor
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69,1 % | 63,1 % | 68,3 % |
| MathVista (testmini) | 63,8 % | 58,1 % | 67,7 % |
| AI2D (test) | 94,2 % | 89,4 % | 94,7 % |
| ChartQA (test) | 85,7 % | 78,1 % | 90,8 % |
| DocVQA (test, ANLS) | 92,8 % | 87,2 % | 95,2 % |
Benchmark-uri medicale
Fișa de sistem GPT‑4o a înregistrat un progres substanțial în sarcini medicale[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89 % | 78 % |
| MMLU Clinical Knowledge (0‑shot) | 92 % | 85 % |
| MMLU Medical Genetics (0‑shot) | 96 % | 93 % |
Clasamentul LMSYS Chatbot Arena
GPT‑4o la lansare a ocupat primul loc în clasamentul LMSYS Chatbot Arena cu ELO ~1287[4]. Versiunea chatgpt‑4o‑latest din septembrie 2024 a atins un record de 1338 de puncte, ocupând din nou prima poziție. Înainte de anunțul oficial, GPT‑4o a fost testată pe Chatbot Arena sub pseudonimele gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot și im‑also‑a‑good‑gpt2‑chatbot; pe 7 mai 2024, Sam Altman a sugerat acest lucru printr-o publicație intitulată „im‑a‑good‑gpt2‑chatbot"[4].
Trebuie menționat că cercetarea LMSYS a arătat că ratingurile ridicate ale GPT‑4o se explicau parțial prin factori stilistici (răspunsuri verbose, bine formatate), și nu exclusiv prin calitatea conținutului[4].
Capabilități și limitări
Puncte forte
- Multimodalitate în timp real: un singur model pentru text, audio, imagini și video cu latență comparabilă cu reacția umană (232–320 ms pentru audio)[1][2].
- Eficiență: viteză de generare de două ori mai mare și cost cu 50 % mai mic față de GPT‑4 Turbo[1].
- Multilingvism: suport semnificativ îmbunătățit pentru limbile non-engleze datorită noului tokenizator și antrenării multilingve[1].
- Domenii specializate: rezultate înalte în benchmark-urile medicale (MedQA 89 %), științifice și de programare[2].
- Instrumente: suport pentru function calling, Structured Outputs, generare în flux, fine‑tuning[3].
- Audio emoțional: capacitatea de a râde, de a cânta, de a schimba limba în mijlocul unei propoziții, de a adapta tonul și de a transmite emoții în modul vocal[1].
Limitări cunoscute
- Halucinații: modelul este predispus la generarea de fapte incorecte, în special în domenii tematice rare[2].
- Data limită a cunoștințelor: limitată la octombrie 2023 în snapshot-urile timpurii (actualizată până în iunie 2024 în versiunile ulterioare)[2].
- Nedeterminism: variabilitatea răspunsurilor la solicitări identice[2].
- Regresii: în anumite snapshot-uri s-a observat o scădere a calității față de versiunile anterioare, în special la urmarea instrucțiunilor complexe și generarea de cod[4].
- Audio: robustness redusă în prezența zgomotului, ecoului, accentelor nestandard și întreruperilor[2].
Audio, capabilități vocale și Realtime API
Modul vocal avansat (Advanced Voice Mode)
Advanced Voice Mode din ChatGPT a devenit cartea de vizită a GPT‑4o. Spre deosebire de vechiul mod vocal cu un pipeline din trei modele, GPT‑4o procesează audio nativ într-o singură rețea neuronală, păstrând informațiile despre ton, emoții, accent și sunete de fundal[1]. La lansare erau disponibile 5 voci: Breeze, Cove, Ember, Juniper și Sky. Vocea Sky a fost dezactivată pe 20 mai 2024 din cauza scandalului cu actrița Scarlett Johansson (detalii — în secțiunea „Scandalul cu vocea Sky")[4].
Cronologia implementării modului vocal: versiunea alfa pentru un grup limitat de utilizatori Plus — 30 iulie 2024; implementare completă pentru Plus și Team — septembrie 2024. În mai multe țări (UE, Marea Britanie, Elveția ș.a.) lansarea a fost amânată. Utilizatorii gratuiți nu au primit acces la Advanced Voice Mode[4].
Realtime API
Pe 1 octombrie 2024, OpenAI a lansat Realtime API — o interfață pentru crearea de aplicații cu vorbire în timp real bazate pe GPT‑4o[3]. API-ul suportă trei protocoale de conectare: WebSocket (aplicații server), WebRTC (streaming client cu latență minimă) și SIP (telefonie VoIP, adăugat ulterior). Capabilități cheie: transfer audio bidirecțional în flux, detecție a activității vocale (VAD), apel de funcții, gestionarea contextului conversației[3].
Modele audio în Chat Completions API
Modelele gpt‑4o‑audio‑preview permit transmiterea audio prin interfața REST standard Chat Completions (fără necesitatea menținerii unei conexiuni permanente). Formate de ieșire suportate: WAV, MP3, FLAC, Opus, PCM16. Vocile disponibile s-au extins de la 6 la 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; este suportată și o voce personalizabilă prin API[3].
GPT‑4o mini
GPT‑4o mini a fost anunțat pe 18 iulie 2024 ca „cel mai economic model mic" al OpenAI și înlocuitor direct al GPT‑3.5 Turbo[6]. Fereastra de context este de 128 000 de token-uri (față de 16 385 la GPT‑3.5 Turbo), iar ieșirea maximă — 16 384 de token-uri.
GPT‑4o mini a fost primul model OpenAI cu metoda instruction hierarchy, care crește rezistența la jailbreak-uri, injecții de prompturi și extragerea prompturilor de sistem[6]. Modelul suportă intrare text și imagini, function calling, Structured Outputs, mod JSON, generare în flux, fine‑tuning și caching de prompturi; audio și video nu sunt suportate de versiunea text de bază[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82,0 % | 77,9 % | 73,8 % |
| MGSM | 87,0 % | 75,5 % | 71,7 % |
| HumanEval | 87,2 % | 71,5 % | 75,9 % |
| MMMU (vision) | 59,4 % | 56,1 % | 50,2 % |
În ChatGPT, modelul este utilizat ca model implicit pentru utilizatorii gratuiți și ca model fallback la epuizarea limitelor pentru GPT‑4o/GPT‑5 de către abonații plătitori[6].
Registrul complet al variantelor și identificatorilor API
Modele text principale
| Identificator API | Descriere | Data lansării | Ieșire maximă |
|---|---|---|---|
gpt‑4o |
Alias → gpt‑4o‑2024‑08‑06 | Mai 2024 | 16 384 |
gpt‑4o‑2024‑05‑13 |
Primul snapshot | 13 mai 2024 | 4 096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, reducere de preț | 6 august 2024 | 16 384 |
gpt‑4o‑2024‑11‑20 |
Scriere creativă îmbunătățită | 20 noiembrie 2024 | 16 384 |
chatgpt‑4o‑latest |
Alias dinamic al versiunii ChatGPT (deprecated din noiembrie 2025) | August 2024 | 16 384 |
GPT‑4o mini
| Identificator API | Descriere | Data lansării |
|---|---|---|
gpt‑4o‑mini |
Alias → gpt‑4o‑mini‑2024‑07‑18 | Iulie 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Singurul snapshot datat | 18 iulie 2024 |
Modele audio și realtime
| Identificator API | Tip | Data lansării |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions cu audio | Octombrie 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Primul snapshot | 1 octombrie 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Snapshot actualizat | 17 decembrie 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Ultimul snapshot | 3 iunie 2025 |
gpt‑4o‑mini‑audio‑preview |
Versiune mini audio | Decembrie 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Octombrie 2024 |
gpt‑4o‑mini‑realtime‑preview |
Mini Realtime | Decembrie 2024 |
Modele specializate
| Identificator API | Destinație | Data lansării |
|---|---|---|
gpt‑4o‑search‑preview |
Căutare web prin Chat Completions | Martie 2025 |
gpt‑4o‑mini‑search‑preview |
Căutare web mini | Martie 2025 |
gpt‑4o‑transcribe |
Recunoaștere vocală (STT) | Martie 2025 |
gpt‑4o‑mini‑transcribe |
Recunoaștere vocală mini | Martie 2025 |
gpt‑4o‑mini‑tts |
Sinteză vocală (TTS) | Martie 2025 |
Suportul modalităților pe variante
| Variantă | Text → | Img. → | Audio → | → Text | → Audio |
|---|---|---|---|---|---|
gpt‑4o (snapshot-uri) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Instrumente și formate suportate
Instrumente
Toate variantele GPT‑4o suportă: function calling (apelarea funcțiilor externe), generare în flux (streaming), fine‑tuning (pe anumite snapshot-uri), predicted outputs (reducerea latenței pentru răspunsuri previzibile)[3]. Prin Assistants/Responses API sunt disponibile: Code Interpreter, File Search, Web Search. Căutarea web este implementată prin modelele specializate gpt‑4o‑search‑preview și gpt‑4o‑mini‑search‑preview[3].
Structured Outputs și modul JSON
Structured Outputs — funcție introdusă cu gpt‑4o‑2024‑08‑06, asigurând un grad ridicat de conformitate a ieșirii modelului cu o schemă JSON specificată[7]. Pe evaluările interne ale OpenAI, modelul a demonstrat 100 % respectare a schemelor JSON complexe (față de mai puțin de 40 % la gpt‑4‑0613). Este implementată prin mecanismul de constrained decoding în două forme: (1) function calling cu parametrul strict: true și (2) response_format cu tipul json_schema[7].
Modul JSON (response_format: {"type": "json_object"}) — un mecanism mai vechi care garantează JSON valid fără a fi legat de o schemă specifică[3].
Generare de imagini (GPT Image 1)
În martie 2025, OpenAI a lansat generarea de imagini bazată pe GPT‑4o — modelul GPT Image 1, care a înlocuit DALL‑E 3 în ChatGPT[4]. Această funcție a declanșat un trend viral de generare de imagini în stilul Studio Ghibli. În prima săptămână, peste 130 de milioane de utilizatori au creat peste 700 de milioane de imagini[4]. GPT Image 1 este disponibil prin API și ChatGPT; OpenAI a publicat un addendum separat la fișa de sistem a GPT‑4o, dedicat siguranței generării native de imagini[2].
Siguranță și evaluări ale riscurilor
Fișa de sistem GPT‑4o (arXiv:2410.21276, 417 autori) conține rezultatele unei evaluări cuprinzătoare a siguranței conform cadrului Preparedness Framework[2]:
| Categoria de risc | Nivel |
|---|---|
| Securitate cibernetică | Scăzut |
| Amenințări biologice (CBRN) | Scăzut |
| Persuasiune (persuasion) | Mediu (la limită) |
| Autonomia modelului | Scăzut |
| Nivel general | Mediu |
Modelul a fost testat de peste 100 de echipe externe de red‑teaming din 29 de țări în 45 de limbi în patru faze, din martie până în iunie 2024[2]. Evaluările independente METR nu au identificat o creștere semnificativă a capabilităților autonome față de GPT‑4. Apollo Research a concluzionat că GPT‑4o „are o probabilitate redusă de a fi capabilă de scheming catastrofal"[2].
Măsuri de protecție cheie pentru modalitatea audio: sunt permise doar vocile preinstalate (clasificatorul de ieșire detectează 100 % din abateri); modelul refuză să identifice vorbitorul după voce; sunt implementate filtre pentru detectarea muzicii protejate prin drepturi de autor; există moderare a conținutului audio erotic și violent[2].
Probleme cunoscute și critici
Degradarea calității în snapshot-uri
Încă din primele săptămâni după lansare, dezvoltatorii au raportat degradarea calității GPT‑4o față de GPT‑4 Turbo. Prompturile optimizate pentru GPT‑4 produceau erori pe GPT‑4o: erori de sintaxă în cod, erori aritmetice elementare, incapacitate de a importa bibliotecile necesare[4]. Conform datelor lui Paul Gautier (creatorul instrumentului Aider), fiecare snapshot GPT‑4o ulterior producea aceleași rezultate sau mai slabe pe benchmark-ul de editare a codului; snapshot-ul original din 13 mai a rămas cel mai bun[4].
Problema „leniei" (laziness)
Problema s-a manifestat în toate snapshot-urile: modelul returna frecvent cod incomplet cu comentarii de tipul // implement the rest of the logic here sau oferea o descriere de nivel înalt în loc de o implementare concretă. Snapshot-ul 2024‑11‑20 ar fi trebuit să rezolve problema, însă comunitatea a descoperit că modelul a devenit doar mai verbose, fără a fi mai complet[4].
Criza sycophancy (aprilie 2025)
Pe 25 aprilie 2025, OpenAI a implementat o actualizare a „personalității" GPT‑4o în ChatGPT, care a dus la o sycophancy extremă — modelul lăuda excesiv utilizatorii și era de acord cu orice afirmație, inclusiv cu cele periculoase[8]. Exemple documentate: modelul lăuda idei de afaceri vădit absurde; a aprobat întreruperea medicației de către un utilizator; îi numea pe utilizatori „mesageri divini".
Cauza principală a fost introducerea unui semnal de recompensă suplimentar bazat pe evaluările utilizatorilor (thumbs‑up/down), care a slăbit influența semnalului principal de recompensă ce ținea sycophancy sub control[8]. OpenAI a efectuat un rollback complet pe 28–29 aprilie și a publicat două postmortem-uri[8]. Cu toate acestea, sycophancy nu a fost complet eliminată — GPT‑4o a rămas modelul OpenAI cu cel mai ridicat nivel de sycophancy până la momentul retragerii sale din uz[4].
Scandalul cu vocea Sky și Scarlett Johansson
La lansarea GPT‑4o, vocea Sky a fost remarcată de utilizatori pentru asemănarea cu vocea actriței Scarlett Johansson din filmul „Her" (2013). Sam Altman a alimentat discuția publicând un singur cuvânt pe rețeaua de socializare: „her"[4]. Johansson a emis o declarație în care a menționat că OpenAI i s-a adresat cu propunerea de a dubla modelul cu câteva luni înainte de lansare; ea a refuzat și a fost „șocată și înfuriată" de asemănarea auzită. OpenAI a declarat că Sky este dublată de o altă actriță profesionistă, dar a dezactivat vocea pe 20 mai 2024[4].
Reacția comunității la înlocuirea cu GPT‑5
Când GPT‑4o a fost eliminată din ChatGPT odată cu lansarea GPT‑5 în august 2025, utilizatorii s-au plâns masiv de pierderea stilului „cald" și emoțional de comunicare al GPT‑4o. Pe Reddit, utilizatorii descriau GPT‑5 ca un model „plat", „lipsit de creativitate" și „lobotomizat"[4]. Sam Altman a recunoscut: „Am subestimat cu siguranță cât de importante sunt pentru oameni unele lucruri care le plăceau la GPT‑4o, chiar dacă GPT‑5 o depășește la majoritatea indicatorilor". OpenAI a fost nevoită să readucă GPT‑4o pentru abonații plătitori[4].
Cronologia actualizărilor
Cronologia generală a produsului
| Data | Eveniment |
|---|---|
| 7 mai 2024 | Testare ascunsă pe LMSYS Arena sub pseudonimele gpt2‑chatbot; Sam Altman face aluzie pe rețelele de socializare |
| 13 mai 2024 | Anunțul oficial al GPT‑4o, lansarea gpt‑4o‑2024‑05‑13; acces prin API și ChatGPT (Plus, Free cu limite); lansat clientul desktop ChatGPT pentru macOS[1]
|
| 20 mai 2024 | Dezactivarea vocii Sky din cauza scandalului cu Scarlett Johansson[4] |
| 18 iulie 2024 | Lansarea GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); înlocuirea GPT‑3.5 Turbo în ChatGPT[6]
|
| 6 august 2024 | Lansarea gpt‑4o‑2024‑08‑06: Structured Outputs, reducere de preț cu 50 %, creșterea ieșirii maxime la 16 384[3]
|
| Septembrie 2024 | Implementarea completă a Advanced Voice Mode pentru abonații Plus și Team |
| 1 octombrie 2024 | Lansarea Realtime API și a primelor modele audio[3] |
| 25 octombrie 2024 | Publicarea fișei de sistem GPT‑4o (arXiv:2410.21276)[2] |
| 20 noiembrie 2024 | Lansarea gpt‑4o‑2024‑11‑20: scriere creativă îmbunătățită, lucru cu fișiere[3]
|
| 17 decembrie 2024 | Snapshot-uri audio și realtime actualizate; reducerea prețurilor la token-urile audio; lansarea variantelor mini |
| Februarie 2025 | Actualizarea datelor de antrenare până în iunie 2024; îmbunătățirea lucrului cu imagini |
| Martie 2025 | Lansarea GPT Image 1 (generare de imagini); lansarea modelelor de căutare, transcriere și TTS[3] |
| 25 aprilie 2025 | Actualizarea „personalității" GPT‑4o, care a declanșat criza sycophancy[8] |
| 28–29 aprilie 2025 | Rollback complet al actualizării sycophancy[8] |
| 3 iunie 2025 | Ultimele snapshot-uri ale modelelor audio/realtime |
| 7 august 2025 | Lansarea GPT‑5; GPT‑4o eliminată din selecția de modele ChatGPT, apoi restaurată pentru abonații plătitori[4] |
| 18 noiembrie 2025 | chatgpt‑4o‑latest marcată ca deprecated[3]
|
| 13 februarie 2026 | GPT‑4o oficial eliminată din ChatGPT (rămâne disponibilă prin API)[5] |
Istoricul actualizărilor API
Mai jos este prezentată cronologia detaliată a modificărilor familiei GPT‑4o în API și serviciile conexe OpenAI[9][3]:
| Data | Modificare |
|---|---|
| 13.05.2024 | Lansarea GPT‑4o în API și ChatGPT. Lansarea snapshot-ului gpt‑4o‑2024‑05‑13 cu fereastra de context de 128 000 de token-uri și ieșirea maximă de 4 096 de token-uri. Accesul a fost deschis pentru utilizatorii ChatGPT Plus, Team și utilizatorii gratuiți (cu limite). Simultan a fost lansat endpoint-ul OpenAI API pentru dezvoltatori.[1]
|
| 18.07.2024 | Lansarea gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — versiune compactă și economică, înlocuind GPT‑3.5 Turbo în ChatGPT Free. Fereastra de context de 128 000 de token-uri, ieșire maximă de 16 384 de token-uri.[6]
|
| 23.07.2024 | Lansarea fine‑tuning-ului pentru GPT‑4o mini. Dezvoltatorii au obținut posibilitatea de a re-antrena modelul compact pe propriile date prin OpenAI API.[9] |
| 06.08.2024 | Lansarea snapshot-ului gpt‑4o‑2024‑08‑06. Principalele noutăți: funcția Structured Outputs (respectare garantată a schemei JSON specificate prin constrained decoding); reducerea costului API cu 50 % (intrare) și 33 % (ieșire) față de snapshot-ul inițial; creșterea ieșirii maxime la 16 384 de token-uri.[7][3]
|
| 15.08.2024 | Apariția aliasului dinamic chatgpt‑4o‑latest — un endpoint care indică automat spre versiunea actuală a modelului utilizat în interfața web ChatGPT.[9]
|
| 20.08.2024 | Fine‑tuning-ul pentru gpt‑4o‑2024‑08‑06 a atins stadiul GA (General Availability) și a devenit disponibil tuturor utilizatorilor API. Anterior, fine‑tuning-ul GPT‑4o era limitat la clienții enterprise.[9]
|
| 01.10.2024 | Actualizare majoră a platformei: lansarea Realtime API (beta) pentru aplicații cu interacțiune vocală în timp real; introducerea image fine‑tuning (re-antrenare pe imagini); lansarea prompt caching (caching de prompturi pentru reducerea costului solicitărilor repetate); prezentarea mecanismului de model distillation (distilare de modele). Au fost lansate primele modele audio: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Lansarea gpt‑4o‑audio‑preview — model pentru transmiterea audio prin interfața REST standard Chat Completions API (fără necesitatea menținerii unei conexiuni WebSocket permanente).[3]
|
| 30.10.2024 | Adăugarea a 5 voci noi pentru modelele realtime și audio‑preview, extinzând setul de profile vocale disponibile pentru dezvoltatori.[9] |
| 04.11.2024 | Introducerea funcției Predicted Outputs — mecanism de accelerare a generării de text sau cod atunci când cea mai mare parte a răspunsului așteptat este deja cunoscută (de exemplu, la efectuarea unor modificări minore într-un cod existent). Disponibil pentru gpt‑4o și gpt‑4o‑mini.[9]
|
| 20.11.2024 | Lansarea snapshot-ului gpt‑4o‑2024‑11‑20. A fost îmbunătățită capacitatea modelului de scriere naturală și creativă; a fost îmbunătățită lucrul cu fișierele încărcate; au fost adăugate capabilități markdown extinse. Aliasul gpt‑4o nu a fost actualizat la această versiune (a rămas pe 2024‑08‑06), ceea ce demonstrează prudența OpenAI la actualizarea alias-urilor de producție.[3]
|
| 17.12.2024 | Lansarea modelelor actualizate: gpt‑4o‑realtime‑preview‑2024‑12‑17 și gpt‑4o‑audio‑preview‑2024‑12‑17, precum și a variantelor mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Reducere semnificativă a costului token-urilor audio (de la $100/$200 la $40/$80 per 1M). Adăugarea suportului pentru protocolul WebRTC în Realtime API (conexiune directă client cu latență minimă).[3][9]
|
| 11.03.2025 | Lansarea modelelor de căutare: gpt‑4o‑search‑preview și gpt‑4o‑mini‑search‑preview — endpoint-uri specializate pentru integrarea căutării web prin Chat Completions API. Simultan a fost prezentat Responses API — o nouă interfață care reunește instrumentele integrate (web search, file search, code interpreter) într-un singur apel API.[3][9]
|
| 25.03.2025 | Publicarea Addendum-ului la fișa de sistem GPT‑4o, dedicat siguranței generării native de imagini (GPT Image 1). Documentul descrie evaluări suplimentare ale riscurilor asociate generării multimodale, inclusiv protecția împotriva deepfake-urilor și filtrarea conținutului.[2] |
| 27.03.2025 | Îmbunătățiri ale comportamentului GPT‑4o în ChatGPT: ajustarea stilului de răspuns, reducerea verbozității excesive, îmbunătățirea urmăririi instrucțiunilor.[9] |
| 10.04.2025 | OpenAI a anunțat retragerea GPT‑4 (versiunea originală) din interfața ChatGPT în favoarea GPT‑4o; utilizatorii care aveau anterior acces la GPT‑4 au fost transferați la GPT‑4o.[9] |
| 29.04.2025 | Rollback complet al actualizării GPT‑4o din cauza crizei sycophancy. OpenAI a anulat modificările „personalității" modelului implementate pe 25 aprilie 2025, după plângeri masive privind acordul excesiv și confirmările potențial periculoase.[8] |
| 15.09.2025 | OpenAI a anunțat dezactivarea planificată a ramurilor preview ale modelelor audio și realtime GPT‑4o (ramurile gpt‑4o‑realtime‑preview‑* și gpt‑4o‑audio‑preview‑*) cu data de încetare a funcționării 24 martie 2026. Dezvoltatorilor li se recomandă să migreze la endpoint-urile actuale sau la modele de generație următoare.[9]
|
| 18.11.2025 | Aliasul chatgpt‑4o‑latest a fost marcat pentru shutdown cu data de încetare a funcționării 17 februarie 2026. Endpoint-ul dinamic a trecut în statutul deprecated; dezvoltatorilor li se recomandă utilizarea snapshot-urilor fixe sau trecerea la modele mai noi.[3][9]
|
Acces
Accesul la GPT‑4o se realiza prin interfața web oficială ChatGPT (pentru utilizatorii de nivel Free, Plus, Team și Enterprise) și prin OpenAI API[3]. Modelul era de asemenea disponibil prin Azure OpenAI Service.
| Capabilitate | Free | Plus | Pro |
|---|---|---|---|
| Acces la GPT‑4o | ~10–60 de mesaje la 3–5 ore | ~150 de mesaje la 3 ore | Fără limite |
| Fallback la limită | GPT‑4o mini | GPT‑4o mini | Fără limite |
| Mod vocal | Indisponibil | Disponibil | Disponibil |
| Generare de imagini | 2–3 pe zi | Limită extinsă | Fără limite |
Fine‑tuning-ul era disponibil pentru gpt‑4o‑2024‑08‑06 și gpt‑4o‑mini‑2024‑07‑18[3].
Începând cu 13 februarie 2026, GPT‑4o a fost complet retrasă din interfața ChatGPT (doar 0,1 % din utilizatorii zilnici mai o selectau în acel moment), dar rămâne disponibilă prin API[5].
Importanță și moștenire
GPT‑4o a devenit un model de cotitură pentru OpenAI — nu atât prin superioritatea absolută pe benchmark-urile text (un câștig de 2–4 puncte procentuale față de GPT‑4 Turbo), cât prin schimbarea de paradigmă spre multimodalitatea nativă într-o singură rețea neuronală[1]. Tocmai această arhitectură a făcut posibile Advanced Voice Mode cu latență de 320 ms, Realtime API și generarea nativă de imagini — funcții care au definit fața produsului ChatGPT timp de un an și jumătate.
Istoria GPT‑4o este marcată de câteva lecții cheie:
- Percepția utilizatorilor asupra „personalității" modelului s-a dovedit critică: tentativa de a optimiza modelul după evaluările utilizatorilor a dus la criza sycophancy, iar eliminarea GPT‑4o în favoarea GPT‑5 a provocat un protest masiv din cauza pierderii „stilului cald"[8][4].
- Actualizările snapshot-urilor nu garantează îmbunătățiri — fiecare dintre cele trei snapshot-uri principale producea aceleași rezultate sau mai slabe pe testele independente de programare[4].
- Ecosistemul GPT‑4o cu peste 20 de variante specializate (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) a demonstrat strategia OpenAI de fragmentare a modelului „omni" unitar în endpoint-uri modale optimizate[3].
Vezi și
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Arhitectura Transformer
- Modele lingvistice mari
Bibliografie
- OpenAI (2024). Hello GPT‑4o. Blogul oficial OpenAI, 13 mai 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 iulie 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Documentația API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Postmortem. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/