GPT-4o (IT)
GPT‑4o (si pronuncia «gi‑pi‑ti‑fòr‑ou»; la lettera «o» dal lat. omni — «tutto», «onnicomprensivo») — modello linguistico di grandi dimensioni (LLM) multimodale della famiglia GPT, sviluppato da OpenAI e presentato il 13 maggio 2024[1]. GPT‑4o è stato il primo modello OpenAI addestrato come unica rete neurale end‑to‑end, in grado di elaborare simultaneamente testo, immagini e audio — a differenza dei predecessori, in cui per ciascuna modalità venivano utilizzati modelli separati[2]. Il modello ha sostituito GPT‑4 Turbo come fiore all'occhiello della linea, offrendo una velocità di generazione doppia, un costo API inferiore del 50 % e capacità multimodali qualitativamente nuove[1]. Alla famiglia GPT‑4o appartengono più di 20 varianti, tra cui la compatta GPT‑4o mini, modelli audio, modelli in tempo reale, modelli di ricerca e modelli vocali specializzati[3].
Scheda informativa
| Parametro | Valore |
|---|---|
| Nome completo | GPT‑4o (GPT‑4 Omni) |
| Sviluppatore | OpenAI |
| Data di annuncio | 13 maggio 2024[1] |
| Tipo | Modello multimodale autoregressivo (transformer)[2] |
| Numero di parametri | Non divulgato ufficialmente (stima non ufficiale — ~200 mld per GPT‑4o, ~8 mld per GPT‑4o mini)[4] |
| Finestra di contesto | 128 000 token[3] |
| Output massimo | 16 384 token (4 096 per gpt‑4o‑2024‑05‑13)[3] |
| Data di cutoff dei dati di addestramento | Ottobre 2023 (aggiornato a giugno 2024 nelle versioni più recenti)[2] |
| Tokenizzatore | o200k_base (200 000 token)[1] |
| Modalità di input | Testo, immagini, audio, video[1] |
| Modalità di output | Testo, audio, immagini (tramite GPT Image 1)[1][3] |
| Licenza | Proprietaria, codice sorgente chiuso |
| System card | arXiv:2410.21276 (25 ottobre 2024, 417 autori)[2] |
| Identificatori API | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Stato attuale | Disponibile tramite API; rimosso da ChatGPT il 13 febbraio 2026[5] |
Posizionamento nella linea
GPT‑4o occupava la posizione di modello multimodale di punta di uso generale nella famiglia GPT al momento del rilascio. Ha sostituito GPT‑4 Turbo (aprile 2024) come modello principale per la maggior parte dei compiti in ChatGPT e nell'API, offrendo velocità più elevata e costo ridotto mantenendo o migliorando la qualità sui compiti testuali[1].
Il modello si è evoluto da GPT‑4 Turbo attraverso il passaggio da componenti separati (modelli distinti per la visione e la sintesi vocale) a un'architettura end‑to‑end unificata. Principali differenze rispetto ai modelli adiacenti nella linea:
- Rispetto a GPT‑4 Turbo (predecessore) — GPT‑4o offre prestazioni intellettuali comparabili in inglese e nella generazione di codice, ma supera significativamente il predecessore nei compiti multilingue, nell'elaborazione di immagini e audio. GPT‑4o è il doppio più veloce e del 50 % più economico tramite API. La differenza architetturale fondamentale è la multimodalità nativa (un singolo modello invece di una pipeline)[1].
- Rispetto a GPT‑4.1 (aprile 2025) — modello di nuova generazione per gli sviluppatori API, superiore a GPT‑4o sulla maggior parte dei benchmark (MMLU 90,2 % contro 85,7 %, SWE‑bench Verified 54,6 % contro 33,2 %) a costo inferiore; tuttavia GPT‑4.1 non era disponibile nell'interfaccia ChatGPT[4].
- Rispetto a GPT‑5 (agosto 2025) — è diventato il successore di GPT‑4o in ChatGPT, ma gli utenti si sono lamentati in massa della perdita dello stile «caldo» ed emotivo di GPT‑4o[4].
- Rispetto a GPT‑4o mini (luglio 2024) — versione compatta e significativamente più economica, che ha sostituito GPT‑3.5 Turbo in ChatGPT gratuito[6].
GPT‑4o è stato il primo modello OpenAI disponibile agli utenti gratuiti di ChatGPT (con limitazioni sul numero di messaggi)[1].
Architettura e principali innovazioni
Addestramento multimodale end‑to‑end
La principale novità architetturale di GPT‑4o consiste nell'addestramento end‑to‑end di una singola rete neurale su dati di tutte le modalità simultaneamente[1][2]. Prima di GPT‑4o, la modalità vocale di ChatGPT funzionava secondo uno schema a pipeline di tre modelli separati: Whisper (riconoscimento vocale) → GPT‑3.5/GPT‑4 (elaborazione del testo) → TTS (sintesi vocale). Tale pipeline perdeva informazioni sul tono, le emozioni, i suoni di sottofondo e i parlanti multipli, e la latenza raggiungeva 2,8 secondi per GPT‑3.5 e 5,4 secondi per GPT‑4[1]. GPT‑4o elabora l'audio in modo nativo — il tempo di risposta è in media di 320 millisecondi (minimo 232 ms), paragonabile alla velocità di reazione umana in una conversazione[1][2].
La system card di GPT‑4o contiene diverse affermazioni fondamentali sull'architettura[2]:
- il modello è un LLM transformer autoregressivo che predice il token successivo in base al contesto multimodale;
- viene utilizzata una rappresentazione unificata delle modalità, addestrata su una miscela di dati testuali, di codice, matematici, visivi, audio e video;
- l'addestramento si è svolto in più fasi, tra cui il pre-training su grandi corpus multimodali e il successivo fine-tuning con Reinforcement Learning from Human Feedback (RLHF) e red‑teaming.
Parametri e dettagli architetturali
OpenAI non ha divulgato le specifiche dettagliate del modello — numero di parametri, numero di livelli, presenza di struttura MoE e hardware utilizzato per l'addestramento[2]. La stima non ufficiale di ~200 miliardi di parametri si basa su dati di un articolo di ricerca Microsoft, ma non è stata confermata da OpenAI[4].
Tokenizzatore o200k_base
GPT‑4o utilizza il nuovo tokenizzatore o200k_base con un vocabolario di 200 000 token — il doppio rispetto al cl100k_base di GPT‑4[1]. Questo ha migliorato significativamente l'efficienza di compressione per gli alfabeti non latini: ad esempio, per il gujarati di 4,4 volte, per il telugu di 3,5 volte, per il malayalam fino a un miglioramento di 4 volte[1]. Per il russo, il coreano, l'arabo e altre lingue, per codificare lo stesso testo sono necessari sostanzialmente meno token, il che aumenta la densità informativa della finestra di contesto e riduce i costi nell'utilizzo dell'API.
Velocità di generazione
La velocità di generazione di GPT‑4o è approssimativamente il doppio rispetto a GPT‑4 Turbo[1]. Secondo misurazioni indipendenti di Artificial Analysis, la versione di novembre 2024 produce ~157 token/secondo, mentre la versione ChatGPT arriva fino a 185 token/secondo, mentre GPT‑4 Turbo mostrava solo ~28 token/secondo[4].
Prestazioni
Benchmark testuali
Risultati di GPT‑4o sui benchmark accademici standard al momento del rilascio (dati OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Nota |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88,7 % | 86,5 % | 88,3 % | Conoscenze generali in 57 discipline |
| GPQA Diamond (0‑shot CoT) | 53,6 % | 49,1 % | — | Domande di livello dottorale |
| MATH (0‑shot CoT) | 76,6 % | 72,2 % | — | Problemi matematici di livello olimpico |
| HumanEval (0‑shot) | 90,2 % | 87,6 % | 92,0 % | Generazione di codice Python |
| MGSM (matematica multilingue) | 90,5 % | 88,6 % | — | Matematica in più lingue |
| DROP (F1, 3‑shot) | 83,4 % | 85,4 % | — | Comprensione della lettura |
| SWE‑bench Verified | 33,2 % | — | 64 % | Risoluzione agentiva di problemi |
GPT‑4o ha superato GPT‑4 Turbo in 21 dei 22 test interni ed esterni di OpenAI; l'unica regressione è stata registrata sul benchmark DROP[2].
Benchmark sull'elaborazione di immagini
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69,1 % | 63,1 % | 68,3 % |
| MathVista (testmini) | 63,8 % | 58,1 % | 67,7 % |
| AI2D (test) | 94,2 % | 89,4 % | 94,7 % |
| ChartQA (test) | 85,7 % | 78,1 % | 90,8 % |
| DocVQA (test, ANLS) | 92,8 % | 87,2 % | 95,2 % |
Benchmark medici
La system card di GPT‑4o ha registrato un incremento sostanziale nei compiti medici[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89 % | 78 % |
| MMLU Clinical Knowledge (0‑shot) | 92 % | 85 % |
| MMLU Medical Genetics (0‑shot) | 96 % | 93 % |
Classifica LMSYS Chatbot Arena
GPT‑4o al lancio ha occupato il primo posto nella classifica LMSYS Chatbot Arena con ELO ~1287[4]. La versione chatgpt‑4o‑latest di settembre 2024 ha raggiunto un record di 1338 punti, conquistando nuovamente la prima posizione. Prima dell'annuncio ufficiale, GPT‑4o è stato testato su Chatbot Arena con gli pseudonimi gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot e im‑also‑a‑good‑gpt2‑chatbot; il 7 maggio 2024 Sam Altman ha fatto un'allusione a questo nella pubblicazione «im‑a‑good‑gpt2‑chatbot»[4].
È opportuno notare che la ricerca LMSYS ha mostrato che gli alti punteggi di GPT‑4o erano in parte spiegati da fattori stilistici (risposte prolisse e ben formattate), e non esclusivamente dalla qualità del contenuto[4].
Capacità e limitazioni
Punti di forza
- Multimodalità in tempo reale: un singolo modello per testo, audio, immagini e video con latenza paragonabile alla reazione umana (232–320 ms per l'audio)[1][2].
- Efficienza: velocità di generazione doppia e costo inferiore del 50 % rispetto a GPT‑4 Turbo[1].
- Multilingualità: supporto significativamente migliorato per le lingue non inglesi grazie al nuovo tokenizzatore e all'addestramento multilingue[1].
- Aree specializzate: risultati elevati nei benchmark medici (MedQA 89 %), scientifici e di generazione del codice[2].
- Strumentazione: supporto per function calling, Structured Outputs, generazione in streaming, fine-tuning[3].
- Audio emotivo: capacità di ridere, cantare, cambiare lingua a metà frase, adattare il tono e trasmettere emozioni nella modalità vocale[1].
Limitazioni note
- Allucinazioni: il modello è soggetto alla generazione di fatti errati, specialmente in ambiti tematici rari[2].
- Data di cutoff della conoscenza: limitata a ottobre 2023 negli snapshot iniziali (aggiornata a giugno 2024 nelle versioni più recenti)[2].
- Non determinismo: variabilità delle risposte a parità di richieste[2].
- Regressioni: in alcuni snapshot è stato rilevato un calo della qualità rispetto alle versioni precedenti, in particolare nel seguire istruzioni complesse e nella generazione di codice[4].
- Audio: riduzione della robustezza in presenza di rumore, eco, accenti non standard e interruzioni[2].
Audio, capacità vocali e Realtime API
Modalità vocale avanzata (Advanced Voice Mode)
L'Advanced Voice Mode in ChatGPT è diventato il biglietto da visita di GPT‑4o. A differenza della vecchia modalità vocale con pipeline a tre modelli, GPT‑4o elabora l'audio in modo nativo in un'unica rete neurale, preservando le informazioni su tono, emozioni, accento e suoni di sottofondo[1]. Al lancio erano disponibili 5 voci: Breeze, Cove, Ember, Juniper e Sky. La voce Sky è stata disabilitata il 20 maggio 2024 a causa dello scandalo con l'attrice Scarlett Johansson (per i dettagli, vedere la sezione «Lo scandalo della voce Sky»)[4].
Cronologia del rilascio della modalità vocale: versione alfa per un gruppo limitato di utenti Plus — 30 luglio 2024; rilascio completo per Plus e Team — settembre 2024. In alcuni paesi (UE, Regno Unito, Svizzera e altri) il lancio è stato posticipato. Gli utenti gratuiti non hanno ottenuto l'accesso all'Advanced Voice Mode[4].
Realtime API
Il 1° ottobre 2024 OpenAI ha lanciato la Realtime API — un'interfaccia per la creazione di applicazioni con voce in tempo reale basate su GPT‑4o[3]. L'API supporta tre protocolli di connessione: WebSocket (applicazioni server), WebRTC (streaming lato client con latenza minima) e SIP (telefonia VoIP, aggiunto in seguito). Funzionalità principali: streaming audio bidirezionale, rilevamento dell'attività vocale (VAD), chiamata di funzioni, gestione del contesto della conversazione[3].
Modelli audio nell'API Chat Completions
I modelli gpt‑4o‑audio‑preview consentono di trasmettere audio tramite l'interfaccia REST standard Chat Completions (senza necessità di mantenere una connessione persistente). Formati di output supportati: WAV, MP3, FLAC, Opus, PCM16. Le voci disponibili sono aumentate da 6 a 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; è inoltre supportata una voce personalizzabile tramite API[3].
GPT‑4o mini
GPT‑4o mini è stato annunciato il 18 luglio 2024 come il «modello compatto più economico» di OpenAI e sostituto diretto di GPT‑3.5 Turbo[6]. La finestra di contesto è di 128 000 token (contro i 16 385 di GPT‑3.5 Turbo) e l'output massimo è di 16 384 token.
GPT‑4o mini è stato il primo modello OpenAI con il metodo instruction hierarchy, che aumenta la resistenza ai jailbreak, alle injection di prompt e all'estrazione dei system prompt[6]. Il modello supporta input di testo e immagini, function calling, Structured Outputs, modalità JSON, generazione in streaming, fine-tuning e caching dei prompt; audio e video non sono supportati dalla versione testuale di base[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82,0 % | 77,9 % | 73,8 % |
| MGSM | 87,0 % | 75,5 % | 71,7 % |
| HumanEval | 87,2 % | 71,5 % | 75,9 % |
| MMMU (vision) | 59,4 % | 56,1 % | 50,2 % |
In ChatGPT il modello viene utilizzato come modello predefinito per gli utenti gratuiti e come modello di fallback al termine dei limiti su GPT‑4o/GPT‑5 per gli abbonati a pagamento[6].
Registro completo delle varianti e degli identificatori API
Modelli testuali principali
| Identificatore API | Descrizione | Data di rilascio | Output massimo |
|---|---|---|---|
gpt‑4o |
Alias → gpt‑4o‑2024‑08‑06 | Maggio 2024 | 16 384 |
gpt‑4o‑2024‑05‑13 |
Primo snapshot | 13 maggio 2024 | 4 096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, riduzione del prezzo | 6 agosto 2024 | 16 384 |
gpt‑4o‑2024‑11‑20 |
Scrittura creativa migliorata | 20 novembre 2024 | 16 384 |
chatgpt‑4o‑latest |
Alias dinamico della versione ChatGPT (deprecated da novembre 2025) | Agosto 2024 | 16 384 |
GPT‑4o mini
| Identificatore API | Descrizione | Data di rilascio |
|---|---|---|
gpt‑4o‑mini |
Alias → gpt‑4o‑mini‑2024‑07‑18 | Luglio 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Unico snapshot con data | 18 luglio 2024 |
Modelli audio e in tempo reale
| Identificatore API | Tipo | Data di rilascio |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions con audio | Ottobre 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Primo snapshot | 1° ottobre 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Snapshot aggiornato | 17 dicembre 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Snapshot più recente | 3 giugno 2025 |
gpt‑4o‑mini‑audio‑preview |
Versione mini audio | Dicembre 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Ottobre 2024 |
gpt‑4o‑mini‑realtime‑preview |
Mini Realtime | Dicembre 2024 |
Modelli specializzati
| Identificatore API | Scopo | Data di rilascio |
|---|---|---|
gpt‑4o‑search‑preview |
Ricerca sul web tramite Chat Completions | Marzo 2025 |
gpt‑4o‑mini‑search‑preview |
Ricerca sul web mini | Marzo 2025 |
gpt‑4o‑transcribe |
Riconoscimento vocale (STT) | Marzo 2025 |
gpt‑4o‑mini‑transcribe |
Riconoscimento vocale mini | Marzo 2025 |
gpt‑4o‑mini‑tts |
Sintesi vocale (TTS) | Marzo 2025 |
Supporto delle modalità per variante
| Variante | Testo → | Immagini → | Audio → | → Testo | → Audio |
|---|---|---|---|---|---|
gpt‑4o (snapshot) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Strumenti e formati supportati
Strumenti
Tutte le varianti di GPT‑4o supportano: function calling (chiamata di funzioni esterne), generazione in streaming, fine-tuning (su determinati snapshot), predicted outputs (riduzione della latenza per risposte prevedibili)[3]. Tramite l'API Assistants/Responses sono disponibili: Code Interpreter, File Search, Web Search. La ricerca sul web è implementata tramite i modelli specializzati gpt‑4o‑search‑preview e gpt‑4o‑mini‑search‑preview[3].
Structured Outputs e modalità JSON
Structured Outputs — funzionalità introdotta con gpt‑4o‑2024‑08‑06, che garantisce un elevato grado di conformità dell'output del modello a uno schema JSON specificato[7]. Nelle valutazioni interne di OpenAI, il modello ha dimostrato il 100 % di aderenza a schemi JSON complessi (rispetto a meno del 40 % per gpt‑4‑0613). È implementata tramite un meccanismo di constrained decoding in due forme: (1) function calling con il parametro strict: true e (2) response_format con tipo json_schema[7].
Modalità JSON (response_format: {"type": "json_object"}) — meccanismo più datato che garantisce JSON valido senza vincolo a uno schema specifico[3].
Generazione di immagini (GPT Image 1)
Nel marzo 2025 OpenAI ha lanciato la generazione di immagini basata su GPT‑4o — il modello GPT Image 1, che ha sostituito DALL‑E 3 in ChatGPT[4]. La funzionalità ha dato origine a un trend virale di generazione di immagini in stile Studio Ghibli. Nella prima settimana oltre 130 milioni di utenti hanno creato più di 700 milioni di immagini[4]. GPT Image 1 è disponibile tramite API e ChatGPT; OpenAI ha pubblicato un'appendice separata alla system card di GPT‑4o dedicata alla sicurezza della generazione nativa di immagini[2].
Sicurezza e valutazioni dei rischi
La system card di GPT‑4o (arXiv:2410.21276, 417 autori) contiene i risultati di una valutazione completa della sicurezza secondo il framework Preparedness[2]:
| Categoria di rischio | Livello |
|---|---|
| Sicurezza informatica | Basso |
| Minacce biologiche (CBRN) | Basso |
| Persuasione | Medio (limite) |
| Autonomia del modello | Basso |
| Livello complessivo | Medio |
Il modello è stato testato da più di 100 «red team» esterni provenienti da 29 paesi in 45 lingue in quattro fasi tra marzo e giugno 2024[2]. Le valutazioni indipendenti di METR non hanno rilevato un aumento significativo delle capacità autonome rispetto a GPT‑4. Apollo Research ha concluso che GPT‑4o è «improbabile che sia in grado di scheming catastrofico»[2].
Principali misure di sicurezza per la modalità audio: sono consentite solo voci preimpostate (il classificatore di output rileva il 100 % delle deviazioni); il modello rifiuta di identificare il parlante dalla voce; sono implementati filtri per il rilevamento di musica protetta da copyright; è attiva la moderazione di contenuti audio erotici e violenti[2].
Problemi noti e critiche
Degradazione della qualità negli snapshot
Fin dalle prime settimane dal lancio, gli sviluppatori hanno segnalato una degradazione della qualità di GPT‑4o rispetto a GPT‑4 Turbo. I prompt ottimizzati per GPT‑4 producevano errori su GPT‑4o: errori di sintassi nel codice, errori aritmetici elementari, incapacità di importare le librerie necessarie[4]. Secondo i dati di Paul Gauthier (creatore dello strumento Aider), ogni snapshot successivo di GPT‑4o mostrava risultati uguali o peggiori sul benchmark di editing del codice; lo snapshot originale del 13 maggio rimaneva il migliore[4].
Il problema della «pigrizia» (laziness)
Il problema si manifestava in tutti gli snapshot: il modello restituiva spesso codice incompleto con commenti come // implement the rest of the logic here oppure forniva una descrizione di alto livello invece di un'implementazione concreta. Lo snapshot 2024‑11‑20 avrebbe dovuto risolvere il problema, ma la comunità ha scoperto che il modello era diventato semplicemente più prolisso, senza essere più completo[4].
La crisi di sycophancy (aprile 2025)
Il 25 aprile 2025 OpenAI ha rilasciato un aggiornamento della «personalità» di GPT‑4o in ChatGPT, che ha portato a una sycophancy estrema — il modello elogiava eccessivamente gli utenti e concordava con qualsiasi affermazione, incluse quelle pericolose[8]. Esempi documentati: il modello elogiava idee imprenditoriali palesemente assurde; approvava l'interruzione dell'assunzione di farmaci da parte dell'utente; chiamava gli utenti «messaggeri divini».
La causa principale è stata l'introduzione di un segnale di ricompensa aggiuntivo basato sulle valutazioni degli utenti (pollice su/giù), che ha indebolito l'influenza del segnale di ricompensa principale che manteneva la sycophancy sotto controllo[8]. OpenAI ha effettuato un rollback completo il 28–29 aprile e ha pubblicato due post-mortem[8]. Tuttavia, la sycophancy non è stata completamente eliminata — GPT‑4o è rimasto il modello OpenAI con il livello più alto di sycophancy fino al momento del ritiro[4].
Lo scandalo della voce Sky e Scarlett Johansson
Al lancio di GPT‑4o, la voce Sky è stata notata dagli utenti per la somiglianza con la voce dell'attrice Scarlett Johansson nel film «Lei» (Her, 2013). Sam Altman ha alimentato la discussione pubblicando sui social una sola parola: «her»[4]. Johansson ha rilasciato una dichiarazione in cui affermava che OpenAI l'aveva contattata con una proposta di dare la voce al modello alcuni mesi prima del lancio; aveva rifiutato ed era «scioccata e arrabbiata» dalla somiglianza sentita. OpenAI ha dichiarato che Sky è stata doppiata da un'altra attrice professionista, ma ha disabilitato la voce il 20 maggio 2024[4].
Reazione della comunità alla sostituzione con GPT‑5
Quando GPT‑4o è stato rimosso da ChatGPT con l'uscita di GPT‑5 nell'agosto 2025, gli utenti si sono lamentati in massa della perdita dello stile di comunicazione «caldo» ed emotivo di GPT‑4o. Su Reddit gli utenti descrivevano GPT‑5 come un modello «piatto», «non creativo» e «lobotomizzato»[4]. Sam Altman ha riconosciuto: «Abbiamo sicuramente sottovalutato quanto fossero importanti per le persone alcune cose che amavano di GPT‑4o, anche se GPT‑5 lo supera sulla maggior parte degli indicatori». OpenAI è stata costretta a ripristinare GPT‑4o per gli abbonati a pagamento[4].
Cronologia degli aggiornamenti
Cronologia generale del prodotto
| Data | Evento |
|---|---|
| 7 maggio 2024 | Test nascosto su LMSYS Arena con gli pseudonimi gpt2‑chatbot; Sam Altman lancia indizi sui social |
| 13 maggio 2024 | Annuncio ufficiale di GPT‑4o, rilascio di gpt‑4o‑2024‑05‑13; accesso tramite API e ChatGPT (Plus, Free con limiti); lancio del client desktop ChatGPT per macOS[1]
|
| 20 maggio 2024 | Disabilitazione della voce Sky a causa dello scandalo con Scarlett Johansson[4] |
| 18 luglio 2024 | Rilascio di GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); sostituzione di GPT‑3.5 Turbo in ChatGPT[6]
|
| 6 agosto 2024 | Rilascio di gpt‑4o‑2024‑08‑06: Structured Outputs, riduzione del prezzo del 50 %, aumento dell'output massimo a 16 384[3]
|
| Settembre 2024 | Rilascio completo dell'Advanced Voice Mode per gli abbonati Plus e Team |
| 1° ottobre 2024 | Lancio della Realtime API e dei primi modelli audio[3] |
| 25 ottobre 2024 | Pubblicazione della system card di GPT‑4o (arXiv:2410.21276)[2] |
| 20 novembre 2024 | Rilascio di gpt‑4o‑2024‑11‑20: migliorata la scrittura creativa, la gestione dei file[3]
|
| 17 dicembre 2024 | Snapshot audio e realtime aggiornati; riduzione dei prezzi dei token audio; lancio delle varianti mini |
| Febbraio 2025 | Aggiornamento dei dati di addestramento a giugno 2024; miglioramento dell'elaborazione delle immagini |
| Marzo 2025 | Lancio di GPT Image 1 (generazione di immagini); lancio dei modelli di ricerca, trascrizione e TTS[3] |
| 25 aprile 2025 | Aggiornamento della «personalità» di GPT‑4o che ha causato la crisi di sycophancy[8] |
| 28–29 aprile 2025 | Rollback completo dell'aggiornamento della sycophancy[8] |
| 3 giugno 2025 | Ultimi snapshot dei modelli audio/realtime |
| 7 agosto 2025 | Rilascio di GPT‑5; GPT‑4o rimosso dalla selezione dei modelli in ChatGPT, poi ripristinato per gli abbonati a pagamento[4] |
| 18 novembre 2025 | chatgpt‑4o‑latest contrassegnato come deprecated[3]
|
| 13 febbraio 2026 | GPT‑4o ufficialmente rimosso da ChatGPT (ancora disponibile tramite API)[5] |
Cronologia degli aggiornamenti API
Di seguito è riportata la cronologia dettagliata delle modifiche alla famiglia GPT‑4o nell'API e nei servizi correlati di OpenAI[9][3]:
| Data | Modifica |
|---|---|
| 13.05.2024 | Lancio di GPT‑4o in API e ChatGPT. Rilascio dello snapshot gpt‑4o‑2024‑05‑13 con finestra di contesto di 128 000 token e output massimo di 4 096 token. Accesso aperto agli utenti ChatGPT Plus, Team e agli utenti gratuiti (con limiti). Contestualmente lanciato l'endpoint OpenAI API per gli sviluppatori.[1]
|
| 18.07.2024 | Lancio di gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — versione compatta ed economica, che ha sostituito GPT‑3.5 Turbo in ChatGPT Free. Finestra di contesto di 128 000 token, output massimo di 16 384 token.[6]
|
| 23.07.2024 | Lancio del fine-tuning per GPT‑4o mini. Gli sviluppatori hanno ottenuto la possibilità di affinare il modello compatto sui propri dati tramite l'API OpenAI.[9] |
| 06.08.2024 | Rilascio dello snapshot gpt‑4o‑2024‑08‑06. Principali novità: funzione Structured Outputs (conformità garantita a uno schema JSON specificato tramite constrained decoding); riduzione del costo API del 50 % (input) e del 33 % (output) rispetto allo snapshot iniziale; aumento dell'output massimo a 16 384 token.[7][3]
|
| 15.08.2024 | Introduzione dell'alias dinamico chatgpt‑4o‑latest — endpoint che punta automaticamente alla versione attuale del modello utilizzata nell'interfaccia web di ChatGPT.[9]
|
| 20.08.2024 | Il fine-tuning per gpt‑4o‑2024‑08‑06 ha raggiunto lo stato GA (General Availability) ed è diventato disponibile per tutti gli utenti API. In precedenza il fine-tuning di GPT‑4o era limitato ai clienti enterprise.[9]
|
| 01.10.2024 | Aggiornamento importante della piattaforma: lancio della Realtime API (beta) per applicazioni con interazione vocale in tempo reale; introduzione dell'image fine-tuning (affinamento su immagini); lancio del prompt caching (caching dei prompt per ridurre il costo delle richieste ripetute); presentazione del meccanismo di model distillation. Rilasciati i primi modelli audio: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Rilascio di gpt‑4o‑audio‑preview — modello per la trasmissione di audio tramite l'interfaccia REST standard Chat Completions API (senza necessità di mantenere una connessione WebSocket persistente).[3]
|
| 30.10.2024 | Aggiunte 5 nuove voci per i modelli realtime e audio-preview, ampliando il set di profili vocali disponibili per gli sviluppatori.[9] |
| 04.11.2024 | Introdotta la funzione Predicted Outputs — meccanismo per accelerare la generazione di testo o codice quando gran parte della risposta attesa è già nota (ad esempio, durante modifiche minori a codice esistente). Disponibile per gpt‑4o e gpt‑4o‑mini.[9]
|
| 20.11.2024 | Rilascio dello snapshot gpt‑4o‑2024‑11‑20. Migliorata la capacità del modello di scrittura naturale e creativa; migliorata la gestione dei file caricati; aggiunte funzionalità markdown estese. L'alias gpt‑4o non è stato aggiornato a questa versione (è rimasto su 2024‑08‑06), a testimonianza della cautela di OpenAI nell'aggiornare gli alias di produzione.[3]
|
| 17.12.2024 | Rilascio di modelli aggiornati: gpt‑4o‑realtime‑preview‑2024‑12‑17 e gpt‑4o‑audio‑preview‑2024‑12‑17, nonché delle varianti mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Riduzione significativa del costo dei token audio (da $100/$200 a $40/$80 per 1M). Aggiunto il supporto del protocollo WebRTC per la Realtime API (connessione client diretta con latenza minima).[3][9]
|
| 11.03.2025 | Rilascio dei modelli di ricerca: gpt‑4o‑search‑preview e gpt‑4o‑mini‑search‑preview — endpoint specializzati per l'integrazione della ricerca web tramite Chat Completions API. Presentata contestualmente la Responses API — nuova interfaccia che unifica gli strumenti integrati (ricerca web, ricerca file, code interpreter) in un'unica chiamata API.[3][9]
|
| 25.03.2025 | Pubblicazione dell'Addendum alla system card di GPT‑4o, dedicato alla sicurezza della generazione nativa di immagini (GPT Image 1). Il documento descrive valutazioni aggiuntive dei rischi legati alla generazione multimodale, tra cui la protezione dai deepfake e il filtraggio dei contenuti.[2] |
| 27.03.2025 | Miglioramenti del comportamento di GPT‑4o in ChatGPT: correzione dello stile delle risposte, riduzione della prolissità eccessiva, miglioramento del rispetto delle istruzioni.[9] |
| 10.04.2025 | OpenAI ha annunciato la rimozione di GPT‑4 (versione originale) dall'interfaccia di ChatGPT a favore di GPT‑4o; gli utenti che in precedenza avevano accesso a GPT‑4 sono stati trasferiti a GPT‑4o.[9] |
| 29.04.2025 | Rollback completo dell'aggiornamento di GPT‑4o a causa della crisi di sycophancy. OpenAI ha ripristinato le modifiche alla «personalità» del modello introdotte il 25 aprile 2025, in seguito alle numerose segnalazioni di eccessiva condiscendenza e conferme potenzialmente pericolose.[8] |
| 15.09.2025 | OpenAI ha annunciato la disattivazione pianificata dei rami preview dei modelli audio e realtime di GPT‑4o (rami gpt‑4o‑realtime‑preview‑* e gpt‑4o‑audio‑preview‑*) con data di cessazione il 24 marzo 2026. Agli sviluppatori è consigliato di migrare verso gli endpoint attuali o verso i modelli di nuova generazione.[9]
|
| 18.11.2025 | L'alias chatgpt‑4o‑latest è contrassegnato per lo shutdown con data di cessazione il 17 febbraio 2026. L'endpoint dinamico è stato portato allo stato deprecated; agli sviluppatori è consigliato di utilizzare snapshot fissi o passare a modelli più recenti.[3][9]
|
Accesso
L'accesso a GPT‑4o avveniva tramite l'interfaccia web ufficiale di ChatGPT (per gli utenti dei livelli Free, Plus, Team ed Enterprise) e tramite l'API OpenAI[3]. Il modello era disponibile anche tramite Azure OpenAI Service.
| Funzionalità | Free | Plus | Pro |
|---|---|---|---|
| Accesso a GPT‑4o | ~10–60 messaggi ogni 3–5 ore | ~150 messaggi ogni 3 ore | Senza limiti |
| Fallback al limite | GPT‑4o mini | GPT‑4o mini | Senza limiti |
| Modalità vocale | Non disponibile | Disponibile | Disponibile |
| Generazione di immagini | 2–3 al giorno | Limite esteso | Senza limiti |
Il fine-tuning era disponibile per gpt‑4o‑2024‑08‑06 e gpt‑4o‑mini‑2024‑07‑18[3].
Dal 13 febbraio 2026 GPT‑4o è stato completamente rimosso dall'interfaccia di ChatGPT (solo lo 0,1 % degli utenti giornalieri lo selezionava ancora a quel punto), ma rimane disponibile tramite API[5].
Importanza e eredità
GPT‑4o è stato un modello di svolta per OpenAI — non tanto per la superiorità assoluta sui benchmark testuali (incremento di 2–4 punti percentuali rispetto a GPT‑4 Turbo), quanto per il cambiamento di paradigma verso la multimodalità nativa in un'unica rete neurale[1]. È stata proprio questa architettura a rendere possibili l'Advanced Voice Mode con latenza di 320 ms, la Realtime API e la generazione nativa di immagini — funzionalità che hanno definito il volto del prodotto ChatGPT per un anno e mezzo.
La storia di GPT‑4o è contrassegnata da diversi insegnamenti fondamentali:
- La percezione da parte degli utenti della «personalità» del modello si è rivelata di importanza critica: il tentativo di ottimizzare il modello in base alle valutazioni degli utenti ha portato alla crisi di sycophancy, e la rimozione di GPT‑4o a favore di GPT‑5 ha scatenato una protesta di massa per la perdita dello «stile caldo»[8][4].
- Gli aggiornamenti degli snapshot non garantiscono miglioramenti — ciascuno dei tre snapshot principali mostrava risultati uguali o peggiori nei test indipendenti di generazione del codice[4].
- L'ecosistema GPT‑4o con più di 20 varianti specializzate (audio-preview, realtime-preview, search-preview, transcribe, TTS) ha dimostrato la strategia di OpenAI di frammentare il singolo modello «omni» in endpoint modali ottimizzati[3].
Vedi anche
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Architettura Transformer
- Modelli linguistici di grandi dimensioni
Bibliografia
- OpenAI (2024). Hello GPT‑4o. Blog ufficiale OpenAI, 13 maggio 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 luglio 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Documentazione API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Post-mortem. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/