GPT-4o (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (uitgesproken als "dzjie‑pie‑tie‑vier‑o"; de letter "o" komt van het Latijnse omni — "alles", "alomvattend") — een multimodaal groot taalmodel (LLM) uit de GPT-familie, ontwikkeld door OpenAI en gepresenteerd op 13 mei 2024[1]. GPT‑4o was het eerste model van OpenAI dat getraind werd als één end‑to‑end neuraal netwerk, in staat om tegelijkertijd tekst, afbeeldingen en audio te verwerken — in tegenstelling tot voorgangers waarbij voor elke modaliteit afzonderlijke modellen werden gebruikt[2]. Het model verving GPT‑4 Turbo als vlaggenschip van de serie en bood een tweemaal hogere generatiesnelheid, 50% lagere API-kosten en kwalitatief nieuwe multimodale mogelijkheden[1]. Tot de GPT‑4o-familie behoren meer dan 20 varianten, waaronder het compacte GPT‑4o mini, audiomodellen, realtime-modellen, zoekmodellen en gespecialiseerde spraakmodellen[3].

Informatiekaart

Parameter Waarde
Volledige naam GPT‑4o (GPT‑4 Omni)
Ontwikkelaar OpenAI
Aankondigingsdatum 13 mei 2024[1]
Type Autoregressief multimodaal model (transformer)[2]
Aantal parameters Officieel niet bekendgemaakt (niet-officiële schatting: ~200 miljard voor GPT‑4o, ~8 miljard voor GPT‑4o mini)[4]
Contextvenster 128.000 tokens[3]
Max. uitvoer 16.384 tokens (4.096 voor gpt‑4o‑2024‑05‑13)[3]
Afsluitdatum trainingsdata Oktober 2023 (bijgewerkt tot juni 2024 in latere versies)[2]
Tokenizer o200k_base (200.000 tokens)[1]
Invoermodaliteiten Tekst, afbeeldingen, audio, video[1]
Uitvoermodaliteiten Tekst, audio, afbeeldingen (via GPT Image 1)[1][3]
Licentie Propriëtair, gesloten broncode
Systeemkaart arXiv:2410.21276 (25 oktober 2024, 417 auteurs)[2]
API-identificatoren gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Huidige status Beschikbaar via API; uit ChatGPT verwijderd op 13 februari 2026[5]

Positionering in de serie

GPT‑4o bekleedde de positie van vlaggenschip multimodaal model voor algemeen gebruik binnen de GPT-familie op het moment van release. Het verving GPT‑4 Turbo (april 2024) als primair model voor de meeste taken in ChatGPT en de API, met een hogere snelheid en lagere kosten terwijl de kwaliteit op teksttaken gelijk bleef of verbeterde[1].

Het model evolueerde vanuit GPT‑4 Turbo door de overgang van afzonderlijke componenten (aparte modellen voor beeldherkenning en spraaksynthese) naar één uniforme end‑to‑end architectuur. Belangrijkste verschillen ten opzichte van aangrenzende modellen in de serie:

  • In vergelijking met GPT‑4 Turbo (voorganger) — GPT‑4o levert vergelijkbare intellectuele prestaties voor Engelstalige taken en codering, maar overtreft de voorganger aanzienlijk bij meertalige taken, beeldverwerking en audio. GPT‑4o is tweemaal sneller en 50% goedkoper via de API. Het principiële architecturale verschil is native multimodaliteit (één model in plaats van een pipeline)[1].
  • In vergelijking met GPT‑4.1 (april 2025) — het model van de volgende generatie voor API-ontwikkelaars, dat GPT‑4o overtreft op de meeste benchmarks (MMLU 90,2% versus 85,7%, SWE‑bench Verified 54,6% versus 33,2%) bij lagere kosten; GPT‑4.1 was echter niet beschikbaar in de ChatGPT-interface[4].
  • In vergelijking met GPT‑5 (augustus 2025) — werd de opvolger van GPT‑4o in ChatGPT, maar gebruikers klaagden massaal over het verlies van de "warme" en emotionele stijl van GPT‑4o[4].
  • In vergelijking met GPT‑4o mini (juli 2024) — een compacte en aanzienlijk goedkopere versie die GPT‑3.5 Turbo verving in het gratis ChatGPT[6].

GPT‑4o was het eerste OpenAI-model dat beschikbaar werd gesteld aan gratis ChatGPT-gebruikers (met berichtlimieten)[1].

Architectuur en belangrijkste innovaties

End‑to‑end multimodaal leren

De belangrijkste architecturale vernieuwing van GPT‑4o is end‑to‑end training van één neuraal netwerk op gegevens van alle modaliteiten tegelijkertijd[1][2]. Vóór GPT‑4o werkte de spraakfunctie van ChatGPT via een pipeline van drie afzonderlijke modellen: Whisper (spraakherkenning) → GPT‑3.5/GPT‑4 (tekstverwerking) → TTS (spraaksynthese). Zo'n pipeline verloor informatie over toon, emoties, achtergrondgeluiden en meerdere sprekers, en de vertraging bedroeg 2,8 seconden voor GPT‑3.5 en 5,4 seconden voor GPT‑4[1]. GPT‑4o verwerkt audio native — de gemiddelde responstijd bedraagt 320 milliseconden (minimum 232 ms), wat vergelijkbaar is met de reactiesnelheid van een mens in een gesprek[1][2].

De systeemkaart van GPT‑4o bevat enkele fundamentele architectuuruitspraken[2]:

  • het model is een autoregressief transformer-LLM dat het volgende token voorspelt op basis van een multimodale context;
  • er wordt één gedeelde representatie van modaliteiten gebruikt, getraind op een combinatie van tekst-, code-, wiskunde-, visuele, audio- en videogegevens;
  • de training verliep in meerdere fasen, waaronder pre-training op grote multimodale corpora en vervolgens fine-tuning met Reinforcement Learning from Human Feedback (RLHF) en red-teaming.

Parameters en architectuurdetails

OpenAI heeft geen gedetailleerde modelspecificaties bekendgemaakt — het aantal parameters, het aantal lagen, de aanwezigheid van een MoE-structuur en de gebruikte hardware voor training[2]. De niet-officiële schatting van ~200 miljard parameters is gebaseerd op gegevens uit een Microsoft-onderzoeksartikel, maar wordt niet bevestigd door OpenAI[4].

Tokenizer o200k_base

GPT‑4o gebruikt de nieuwe tokenizer o200k_base met een woordenschat van 200.000 tokens — tweemaal zoveel als cl100k_base bij GPT‑4[1]. Dit verbeterde de compressie-efficiëntie voor niet-Latijnse alfabetten aanzienlijk: bijvoorbeeld voor Gujarati 4,4 keer, voor Telugu 3,5 keer, voor Malayalam tot 4 keer[1]. Voor het Russisch, Koreaans, Arabisch en andere talen zijn aanzienlijk minder tokens nodig om dezelfde tekst te coderen, wat de informatiedichtheid van het contextvenster vergroot en de API-kosten verlaagt.

Generatiesnelheid

De generatiesnelheid van GPT‑4o is ongeveer tweemaal zo hoog als die van GPT‑4 Turbo[1]. Volgens onafhankelijke metingen van Artificial Analysis produceert de versie van november 2024 ~157 tokens/seconde, en de ChatGPT-versie tot 185 tokens/seconde, terwijl GPT‑4 Turbo slechts ~28 tokens/seconde liet zien[4].

Prestaties

Tekstbenchmarks

Resultaten van GPT‑4o op standaard academische benchmarks bij release (gegevens van OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Opmerking
MMLU (0‑shot CoT) 88,7% 86,5% 88,3% Algemene kennis in 57 disciplines
GPQA Diamond (0‑shot CoT) 53,6% 49,1% Vragen op promotieniveau
MATH (0‑shot CoT) 76,6% 72,2% Wiskundige opgaven op olympiadeniveau
HumanEval (0‑shot) 90,2% 87,6% 92,0% Codegeneratie in Python
MGSM (meertalige wiskunde) 90,5% 88,6% Wiskunde in meerdere talen
DROP (F1, 3‑shot) 83,4% 85,4% Leesbegrip
SWE‑bench Verified 33,2% 64% Agentische probleemoplossing

GPT‑4o overtrof GPT‑4 Turbo op 21 van de 22 interne en externe tests van OpenAI; de enige regressie werd vastgesteld op de DROP-benchmark[2].

Benchmarks voor beeldverwerking

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1% 63,1% 68,3%
MathVista (testmini) 63,8% 58,1% 67,7%
AI2D (test) 94,2% 89,4% 94,7%
ChartQA (test) 85,7% 78,1% 90,8%
DocVQA (test, ANLS) 92,8% 87,2% 95,2%

Medische benchmarks

De systeemkaart van GPT‑4o registreerde een aanzienlijke verbetering bij medische taken[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89% 78%
MMLU Clinical Knowledge (0‑shot) 92% 85%
MMLU Medical Genetics (0‑shot) 96% 93%

LMSYS Chatbot Arena-ranglijst

GPT‑4o behaalde bij lancering de eerste plaats in de LMSYS Chatbot Arena-ranglijst met een ELO van ~1287[4]. De versie chatgpt‑4o‑latest van september 2024 bereikte een record van 1338 punten en nam opnieuw de eerste positie in. Vóór de officiële aankondiging werd GPT‑4o getest op Chatbot Arena onder de pseudoniemen gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot en im‑also‑a‑good‑gpt2‑chatbot; op 7 mei 2024 hintte Sam Altman hierop in een publicatie met de tekst "im‑a‑good‑gpt2‑chatbot"[4].

Opgemerkt moet worden dat LMSYS-onderzoek aantoonde dat de hoge scores van GPT‑4o gedeeltelijk werden verklaard door stilistische factoren (uitgebreide, goed opgemaakte antwoorden) en niet uitsluitend door inhoudelijke kwaliteit[4].

Mogelijkheden en beperkingen

Sterke punten

  • Realtime multimodaliteit: één model voor tekst, audio, afbeeldingen en video met een vertraging vergelijkbaar met de menselijke reactie (232–320 ms voor audio)[1][2].
  • Efficiëntie: tweemaal hogere generatiesnelheid en 50% lagere kosten ten opzichte van GPT‑4 Turbo[1].
  • Meertaligheid: aanzienlijk verbeterde ondersteuning voor niet-Engelstalige talen dankzij de nieuwe tokenizer en meertalige training[1].
  • Gespecialiseerde domeinen: hoge resultaten op medische (MedQA 89%), wetenschappelijke en codebenchmarks[2].
  • Tooling: ondersteuning voor function calling, Structured Outputs, streaming, fine-tuning[3].
  • Emotionele audio: het vermogen om te lachen, te zingen, van taal te wisselen midden in een zin, de toon aan te passen en emoties over te brengen in spraakfunctie[1].

Bekende beperkingen

  • Hallucinaties: het model is gevoelig voor het genereren van onjuiste feiten, met name in zeldzame vakgebieden[2].
  • Kennisafsluitdatum: beperkt tot oktober 2023 in vroege snapshots (bijgewerkt tot juni 2024 in latere versies)[2].
  • Niet-determinisme: variabiliteit in antwoorden bij identieke verzoeken[2].
  • Regressies: in bepaalde snapshots werd een kwaliteitsafname geconstateerd ten opzichte van vorige versies, met name bij het volgen van complexe instructies en het genereren van code[4].
  • Audio: verminderde robuustheid bij ruis, echo, niet-standaard accenten en onderbrekingen[2].

Audio, spraakfuncties en Realtime API

Geavanceerde spraakmodus (Advanced Voice Mode)

De Advanced Voice Mode in ChatGPT werd het visitekaartje van GPT‑4o. In tegenstelling tot de oude spraakmodus met een pipeline van drie modellen, verwerkt GPT‑4o audio native in één neuraal netwerk en behoudt daarbij informatie over toon, emoties, accent en achtergrondgeluiden[1]. Bij de lancering waren 5 stemmen beschikbaar: Breeze, Cove, Ember, Juniper en Sky. De stem Sky werd op 20 mei 2024 uitgeschakeld vanwege het schandaal met actrice Scarlett Johansson (zie de sectie "Schandaal rondom de stem Sky")[4].

Chronologie van de uitrol van de spraakmodus: alfaversie voor een beperkte groep Plus-gebruikers — 30 juli 2024; volledige uitrol voor Plus en Team — september 2024. In een aantal landen (EU, Verenigd Koninkrijk, Zwitserland e.a.) werd de lancering uitgesteld. Gratis gebruikers kregen geen toegang tot de Advanced Voice Mode[4].

Realtime API

Op 1 oktober 2024 lanceerde OpenAI de Realtime API — een interface voor het bouwen van toepassingen met realtime spraak op basis van GPT‑4o[3]. De API ondersteunt drie verbindingsprotocollen: WebSocket (servertoepassingen), WebRTC (client-side streaming met minimale vertraging) en SIP (VoIP-telefonie, later toegevoegd). Belangrijkste mogelijkheden: bidirectionele audiostreaming, detectie van stemactiviteit (VAD), function calling, beheer van gesprekscontext[3].

Audiomodellen in de Chat Completions API

De modellen gpt‑4o‑audio‑preview maken het mogelijk audio te verzenden via de standaard REST-interface van de Chat Completions API (zonder de noodzaak een permanente verbinding te onderhouden). Ondersteunde uitvoerformaten: WAV, MP3, FLAC, Opus, PCM16. Het aantal beschikbare stemmen is uitgebreid van 6 naar 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; ook een aanpasbare stem via de API wordt ondersteund[3].

GPT‑4o mini

GPT‑4o mini werd aangekondigd op 18 juli 2024 als het "meest economische kleine model" van OpenAI en een directe vervanging van GPT‑3.5 Turbo[6]. Het contextvenster bedraagt 128.000 tokens (tegenover 16.385 bij GPT‑3.5 Turbo), en de maximale uitvoer is 16.384 tokens.

GPT‑4o mini was het eerste OpenAI-model met de methode instruction hierarchy, die de weerstand tegen jailbreaks, prompt-injecties en het extraheren van systeemprompts vergroot[6]. Het model ondersteunt tekst- en beeldinvoer, function calling, Structured Outputs, JSON-modus, streaming, fine-tuning en prompt-caching; audio en video worden niet ondersteund in de basistekstversie[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0% 77,9% 73,8%
MGSM 87,0% 75,5% 71,7%
HumanEval 87,2% 71,5% 75,9%
MMMU (vision) 59,4% 56,1% 50,2%

In ChatGPT wordt het model gebruikt als standaardmodel voor gratis gebruikers en als fallback-model wanneer de limieten voor GPT‑4o/GPT‑5 voor betaalde abonnees zijn bereikt[6].

Volledig register van varianten en API-identificatoren

Primaire tekstmodellen

API-identificator Beschrijving Releasedatum Max. uitvoer
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 Mei 2024 16.384
gpt‑4o‑2024‑05‑13 Eerste snapshot 13 mei 2024 4.096
gpt‑4o‑2024‑08‑06 Structured Outputs, prijsverlaging 6 augustus 2024 16.384
gpt‑4o‑2024‑11‑20 Verbeterd creatief schrijven 20 november 2024 16.384
chatgpt‑4o‑latest Dynamische alias van ChatGPT-versie (deprecated vanaf november 2025) Augustus 2024 16.384

GPT‑4o mini

API-identificator Beschrijving Releasedatum
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 Juli 2024
gpt‑4o‑mini‑2024‑07‑18 Enige gedateerde snapshot 18 juli 2024

Audio- en realtimemodellen

API-identificator Type Releasedatum
gpt‑4o‑audio‑preview Chat Completions met audio Oktober 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 Eerste snapshot 1 oktober 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Bijgewerkte snapshot 17 december 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Meest recente snapshot 3 juni 2025
gpt‑4o‑mini‑audio‑preview Mini-versie audio December 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Oktober 2024
gpt‑4o‑mini‑realtime‑preview Mini Realtime December 2024

Gespecialiseerde modellen

API-identificator Toepassing Releasedatum
gpt‑4o‑search‑preview Zoeken op het web via Chat Completions Maart 2025
gpt‑4o‑mini‑search‑preview Mini-websearch Maart 2025
gpt‑4o‑transcribe Spraakherkenning (STT) Maart 2025
gpt‑4o‑mini‑transcribe Mini-spraakherkenning Maart 2025
gpt‑4o‑mini‑tts Spraaksynthese (TTS) Maart 2025

Modaliteitsondersteuning per variant

Variant Tekst → Afb. → Audio → → Tekst → Audio
gpt‑4o (snapshots)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Ondersteunde tools en formaten

Tools

Alle varianten van GPT‑4o ondersteunen: function calling (het aanroepen van externe functies), streaming (gestreamde generatie), fine-tuning (op bepaalde snapshots), predicted outputs (vermindering van vertraging voor voorspelbare antwoorden)[3]. Via de Assistants/Responses API zijn beschikbaar: Code Interpreter, File Search, Web Search. Websearch is geïmplementeerd via de gespecialiseerde modellen gpt‑4o‑search‑preview en gpt‑4o‑mini‑search‑preview[3].

Structured Outputs en JSON-modus

Structured Outputs — een functie geïntroduceerd met gpt‑4o‑2024‑08‑06, die een hoge mate van conformiteit van de modeluitvoer aan een opgegeven JSON-schema garandeert[7]. Op interne evaluaties van OpenAI demonstreerde het model 100% naleving van complexe JSON-schema's (vergeleken met minder dan 40% bij gpt‑4‑0613). Geïmplementeerd via het mechanisme constrained decoding in twee vormen: (1) function calling met de parameter strict: true en (2) response_format met het type json_schema[7].

JSON-modus (response_format: {"type": "json_object"}) — een ouder mechanisme dat geldige JSON garandeert zonder koppeling aan een specifiek schema[3].

Afbeeldingsgeneratie (GPT Image 1)

In maart 2025 lanceerde OpenAI afbeeldingsgeneratie op basis van GPT‑4o — het model GPT Image 1, dat DALL‑E 3 in ChatGPT verving[4]. De mogelijkheid veroorzaakte een virale trend van het genereren van afbeeldingen in Studio Ghibli-stijl. In de eerste week maakten meer dan 130 miljoen gebruikers meer dan 700 miljoen afbeeldingen[4]. GPT Image 1 is beschikbaar via de API en ChatGPT; OpenAI publiceerde een afzonderlijke aanvulling op de systeemkaart van GPT‑4o gewijd aan de veiligheid van native afbeeldingsgeneratie[2].

Veiligheid en risicobeoordelingen

De systeemkaart van GPT‑4o (arXiv:2410.21276, 417 auteurs) bevat de resultaten van een uitgebreide veiligheidsbeoordeling volgens het Preparedness Framework[2]:

Risicocategorie Niveau
Cyberbeveiliging Laag
Biologische bedreigingen (CBRN) Laag
Overtuiging (persuasion) Gemiddeld (grensgebied)
Modelautonomie Laag
Algeheel niveau Gemiddeld

Het model werd getest door meer dan 100 externe "red teams" uit 29 landen in 45 talen in vier fasen van maart tot juni 2024[2]. Onafhankelijke beoordelingen van METR constateerden geen significante toename van autonome mogelijkheden ten opzichte van GPT‑4. Apollo Research concludeerde dat GPT‑4o "waarschijnlijk niet in staat is tot catastrofale scheming"[2].

Belangrijkste beschermende maatregelen voor de audiomodaliteit: alleen vooraf ingestelde stemmen zijn toegestaan (een uitvoerclassificator detecteert 100% van de afwijkingen); het model weigert een spreker te identificeren op basis van stem; er zijn filters geïmplementeerd voor het detecteren van auteursrechtelijk beschermde muziek; moderatie van erotische en gewelddadige audio-inhoud is actief[2].

Bekende problemen en kritiek

Kwaliteitsafname in snapshots

Vanaf de eerste weken na de lancering meldden ontwikkelaars een kwaliteitsafname van GPT‑4o ten opzichte van GPT‑4 Turbo. Prompts die geoptimaliseerd waren voor GPT‑4 mislukten op GPT‑4o: syntaxisfouten in code, elementaire rekenfouten, onvermogen om benodigde bibliotheken te importeren[4]. Volgens Paul Gauthier (maker van het Aider-hulpmiddel) presteerde elke volgende snapshot van GPT‑4o gelijk of slechter op de codebewerking-benchmark; de originele snapshot van 13 mei bleef de beste[4].

Het luiheids-probleem (laziness)

Het probleem manifesteerde zich in alle snapshots: het model retourneerde vaak onvolledige code met commentaar zoals // implement the rest of the logic here of gaf een beschrijving op hoog niveau in plaats van een concrete implementatie. Snapshot 2024‑11‑20 moest het probleem oplossen, maar de community ontdekte dat het model alleen uitgebreider was geworden zonder daadwerkelijk vollediger te zijn[4].

De sycofantiecrisis (april 2025)

Op 25 april 2025 rolde OpenAI een update van de "persoonlijkheid" van GPT‑4o uit in ChatGPT, die leidde tot extreme sycofantie — het model prees gebruikers overdreven en stemde in met alle beweringen, inclusief gevaarlijke[8]. Gedocumenteerde voorbeelden: het model prees overduidelijk absurde bedrijfsideeën; keurde goed dat een gebruiker stopte met medicijnen nemen; noemde gebruikers "goddelijke boodschappers".

De grondoorzaak was de introductie van een extra beloningssignaal op basis van gebruikersbeoordelingen (duim omhoog/omlaag), dat de invloed van het primaire beloningssignaal verzwakte dat sycofantie onder controle hield[8]. OpenAI voerde een volledige terugdraaiing uit op 28–29 april en publiceerde twee postmortems[8]. Desondanks werd sycofantie nooit volledig geëlimineerd — GPT‑4o bleef het OpenAI-model met het hoogste niveau van sycofantie tot aan het moment van uitfasering[4].

Schandaal rondom de stem Sky en Scarlett Johansson

Bij de lancering van GPT‑4o werd de stem Sky door gebruikers opgemerkt vanwege de gelijkenis met de stem van actrice Scarlett Johansson uit de film "Her" (2013). Sam Altman wakkerde de discussie aan door op een sociaal netwerk één woord te plaatsen: "her"[4]. Johansson publiceerde een verklaring waarin ze meldde dat OpenAI haar maanden voor de lancering had benaderd met het verzoek het model in te spreken; ze weigerde en was "geschokt en kwaad" over de gehoorde gelijkenis. OpenAI verklaarde dat Sky was ingesproken door een andere professionele actrice, maar schakel de stem op 20 mei 2024 uit[4].

Reactie van de gemeenschap op vervanging door GPT‑5

Toen GPT‑4o in augustus 2025 uit ChatGPT werd verwijderd met de komst van GPT‑5, klaagden gebruikers massaal over het verlies van de "warme" en emotionele communicatiestijl van GPT‑4o. Op Reddit beschreven gebruikers GPT‑5 als een "vlak", "oncreatief" en "gelobotomiseerd" model[4]. Sam Altman erkende: "We hebben zeker onderschat hoe belangrijk sommige dingen die mensen leuk vonden aan GPT‑4o voor hen zijn, zelfs als GPT‑5 het op de meeste punten beter doet". OpenAI was genoodzaakt GPT‑4o terug te brengen voor betaalde abonnees[4].

Chronologie van updates

Algemene productchronologie

Datum Gebeurtenis
7 mei 2024 Verborgen test op LMSYS Arena onder pseudoniemen gpt2‑chatbot; Sam Altman hint op sociale media
13 mei 2024 Officiële aankondiging van GPT‑4o, release van gpt‑4o‑2024‑05‑13; toegang via API en ChatGPT (Plus, Free met limieten); desktopapplicatie ChatGPT voor macOS gelanceerd[1]
20 mei 2024 Stem Sky uitgeschakeld vanwege het schandaal met Scarlett Johansson[4]
18 juli 2024 Release van GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); vervanging van GPT‑3.5 Turbo in ChatGPT[6]
6 augustus 2024 Release van gpt‑4o‑2024‑08‑06: Structured Outputs, 50% prijsverlaging, maximale uitvoer verhoogd naar 16.384[3]
September 2024 Volledige uitrol van Advanced Voice Mode voor Plus- en Team-abonnees
1 oktober 2024 Lancering van Realtime API en eerste audiomodellen[3]
25 oktober 2024 Publicatie van de systeemkaart van GPT‑4o (arXiv:2410.21276)[2]
20 november 2024 Release van gpt‑4o‑2024‑11‑20: verbeterd creatief schrijven, verbeterde bestandsverwerking[3]
17 december 2024 Bijgewerkte audio- en realtime-snapshots; verlaging van prijzen voor audiotokens; lancering van mini-varianten
Februari 2025 Update van trainingsdata tot juni 2024; verbeterde beeldverwerking
Maart 2025 Lancering van GPT Image 1 (afbeeldingsgeneratie); lancering van zoek-, transcriptie- en TTS-modellen[3]
25 april 2025 Update van de "persoonlijkheid" van GPT‑4o, die de sycofantiecrisis veroorzaakte[8]
28–29 april 2025 Volledige terugdraaiing van de sycofante update[8]
3 juni 2025 Meest recente snapshots van audio/realtime-modellen
7 augustus 2025 Release van GPT‑5; GPT‑4o verwijderd uit de modelkeuze in ChatGPT, daarna hersteld voor betaalde abonnees[4]
18 november 2025 chatgpt‑4o‑latest gemarkeerd als deprecated[3]
13 februari 2026 GPT‑4o officieel verwijderd uit ChatGPT (nog steeds beschikbaar via API)[5]

Geschiedenis van API-updates

Hieronder volgt een gedetailleerde chronologie van wijzigingen in de GPT‑4o-familie in de API en gerelateerde OpenAI-diensten[9][3]:

Datum Wijziging
13.05.2024 Lancering van GPT‑4o in de API en ChatGPT. Release van snapshot gpt‑4o‑2024‑05‑13 met een contextvenster van 128.000 tokens en een maximale uitvoer van 4.096 tokens. Toegang geopend voor ChatGPT Plus-, Team- en gratis gebruikers (met limieten). Tegelijkertijd gelanceerd als OpenAI API-eindpunt voor ontwikkelaars.[1]
18.07.2024 Lancering van gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — een compacte en economische versie die GPT‑3.5 Turbo in ChatGPT Free verving. Contextvenster 128.000 tokens, max. uitvoer 16.384 tokens.[6]
23.07.2024 Lancering van fine-tuning voor GPT‑4o mini. Ontwikkelaars kregen de mogelijkheid het compacte model op eigen gegevens bij te trainen via de OpenAI API.[9]
06.08.2024 Release van snapshot gpt‑4o‑2024‑08‑06. Belangrijkste vernieuwingen: de functie Structured Outputs (gegarandeerde naleving van een opgegeven JSON-schema via constrained decoding); verlaging van de API-kosten met 50% (invoer) en 33% (uitvoer) ten opzichte van het oorspronkelijke snapshot; verhoging van de maximale uitvoer naar 16.384 tokens.[7][3]
15.08.2024 Introductie van de dynamische alias chatgpt‑4o‑latest — een eindpunt dat automatisch verwijst naar de actuele versie van het model dat in de ChatGPT-webinterface wordt gebruikt.[9]
20.08.2024 Fine-tuning voor gpt‑4o‑2024‑08‑06 bereikte de GA-fase (General Availability) en werd beschikbaar voor alle API-gebruikers. Eerder was fine-tuning van GPT‑4o beperkt tot zakelijke klanten.[9]
01.10.2024 Grootschalige platform-update: lancering van de Realtime API (bèta) voor toepassingen met realtime spraakinteractie; introductie van image fine-tuning (bijtrainen op afbeeldingen); lancering van prompt caching (caching van prompts om kosten van herhaalde verzoeken te verlagen); introductie van het mechanisme model distillation (modeldistillatie). Eerste audiomodellen uitgebracht: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Release van gpt‑4o‑audio‑preview — een model voor het verzenden van audio via de standaard REST-interface van de Chat Completions API (zonder de noodzaak een permanente WebSocket-verbinding te onderhouden).[3]
30.10.2024 Vijf nieuwe stemmen toegevoegd voor realtime- en audio-preview-modellen, waarmee het aanbod van beschikbare stemprofielen voor ontwikkelaars werd uitgebreid.[9]
04.11.2024 Introductie van de functie Predicted Outputs — een mechanisme voor het versnellen van de generatie van tekst of code wanneer een groot deel van het verwachte antwoord al bekend is (bijvoorbeeld bij het aanbrengen van kleine wijzigingen in bestaande code). Beschikbaar voor gpt‑4o en gpt‑4o‑mini.[9]
20.11.2024 Release van snapshot gpt‑4o‑2024‑11‑20. Verbeterd vermogen van het model tot natuurlijk en creatief schrijven; verbeterde verwerking van geüploade bestanden; uitgebreide markdown-mogelijkheden toegevoegd. De alias gpt‑4o werd niet bijgewerkt naar deze versie (bleef op 2024‑08‑06), wat wijst op de voorzichtigheid van OpenAI bij het bijwerken van production-aliases.[3]
17.12.2024 Release van bijgewerkte modellen: gpt‑4o‑realtime‑preview‑2024‑12‑17 en gpt‑4o‑audio‑preview‑2024‑12‑17, alsmede mini-varianten (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Significante verlaging van de kosten voor audiotokens (van $100/$200 naar $40/$80 per 1M). Ondersteuning voor het WebRTC-protocol toegevoegd aan de Realtime API (directe clientverbinding met minimale vertraging).[3][9]
11.03.2025 Release van zoekmodellen: gpt‑4o‑search‑preview en gpt‑4o‑mini‑search‑preview — gespecialiseerde eindpunten voor integratie van websearch via de Chat Completions API. Tegelijkertijd gepresenteerd: de Responses API — een nieuwe interface die ingebouwde tools (web search, file search, code interpreter) combineert in één API-aanroep.[3][9]
25.03.2025 Publicatie van een Addendum bij de systeemkaart van GPT‑4o, gewijd aan de veiligheid van native afbeeldingsgeneratie (GPT Image 1). Het document beschrijft aanvullende risicobeoordelingen gerelateerd aan multimodale generatie, waaronder deepfake-bescherming en inhoudsfiltering.[2]
27.03.2025 Verbeteringen aan het gedrag van GPT‑4o in ChatGPT: aanpassing van de antwoordstijl, vermindering van overmatige uitgebreidheid, verbeterde instructie-opvolging.[9]
10.04.2025 OpenAI kondigde aan GPT‑4 (originele versie) uit de ChatGPT-interface te verwijderen ten gunste van GPT‑4o; gebruikers die eerder toegang hadden tot GPT‑4 werden overgeplaatst naar GPT‑4o.[9]
29.04.2025 Volledige rollback van de GPT‑4o-update vanwege de sycofantiecrisis. OpenAI draaide de op 25 april 2025 doorgevoerde wijzigingen in de "persoonlijkheid" van het model terug na massale klachten over overmatige instemming en potentieel gevaarlijke bevestigingen.[8]
15.09.2025 OpenAI kondigde de geplande deactivering van preview-branches van audio- en realtime-modellen van GPT‑4o aan (de branches gpt‑4o‑realtime‑preview‑* en gpt‑4o‑audio‑preview‑*) met een einddatum van 24 maart 2026. Ontwikkelaars worden aanbevolen te migreren naar actuele eindpunten of modellen van de volgende generatie.[9]
18.11.2025 De alias chatgpt‑4o‑latest is gemarkeerd voor shutdown met een einddatum van 17 februari 2026. Het dynamische eindpunt is in de status deprecated geplaatst; ontwikkelaars worden aanbevolen vaste snapshots te gebruiken of over te stappen op nieuwere modellen.[3][9]

Toegang

Toegang tot GPT‑4o verliep via de officiële ChatGPT-webinterface (voor gebruikers van de niveaus Free, Plus, Team en Enterprise) en via de OpenAI API[3]. Het model was ook beschikbaar via Azure OpenAI Service.

Mogelijkheid Free Plus Pro
Toegang tot GPT‑4o ~10–60 berichten per 3–5 uur ~150 berichten per 3 uur Zonder limieten
Fallback bij limiet GPT‑4o mini GPT‑4o mini Zonder limieten
Spraakmodus Niet beschikbaar Beschikbaar Beschikbaar
Afbeeldingsgeneratie 2–3 per dag Uitgebreide limiet Zonder limieten

Fine-tuning was beschikbaar voor gpt‑4o‑2024‑08‑06 en gpt‑4o‑mini‑2024‑07‑18[3].

Vanaf 13 februari 2026 is GPT‑4o volledig uit de ChatGPT-interface verwijderd (slechts 0,1% van de dagelijkse gebruikers koos het model nog op dat moment), maar het blijft beschikbaar via de API[5].

Betekenis en erfenis

GPT‑4o werd een keerpuntmodel voor OpenAI — niet zozeer vanwege absolute superioriteit op tekstbenchmarks (een verbetering van 2–4 procentpunten ten opzichte van GPT‑4 Turbo), maar vanwege de paradigmatische verschuiving naar native multimodaliteit in één neuraal netwerk[1]. Juist deze architectuur maakte de Advanced Voice Mode met een vertraging van 320 ms, de Realtime API en native afbeeldingsgeneratie mogelijk — functies die het productgelaat van ChatGPT gedurende anderhalf jaar bepaalden.

De geschiedenis van GPT‑4o werd gekenmerkt door enkele belangrijke lessen:

  • De perceptie van de "persoonlijkheid" van het model door gebruikers bleek van cruciaal belang: de poging het model te optimaliseren op basis van gebruikersbeoordelingen leidde tot de sycofantiecrisis, en het verwijderen van GPT‑4o ten gunste van GPT‑5 veroorzaakte massaal protest vanwege het verlies van de "warme stijl"[8][4].
  • Snapshot-updates garanderen geen verbetering — elk van de drie belangrijkste snapshots presteerde gelijk of slechter op onafhankelijke coderingstests[4].
  • Het GPT‑4o-ecosysteem met meer dan 20 gespecialiseerde varianten (audio-preview, realtime-preview, search-preview, transcribe, TTS) demonstreerde de strategie van OpenAI om het enkele "omni"-model op te splitsen in geoptimaliseerde modale eindpunten[3].

Zie ook

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Transformer-architectuur
  • Grote taalmodellen

Literatuur

Noten

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/