GPT-4o (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o ("ci-pi-ti-for-ou" olarak okunur; "o" harfi Latince omni — "her şey", "kapsamlı" anlamına gelir) — OpenAI tarafından geliştirilen ve 13 Mayıs 2024 tarihinde tanıtılan[1] GPT ailesine ait çok modlu bir büyük dil modeli (LLM)'dir. GPT‑4o, OpenAI'ın her modalite için ayrı modeller kullanan önceki modellerinin aksine, metin, görüntü ve sesi aynı anda işleyebilen tek bir uçtan uca sinir ağı (end‑to‑end) olarak eğitilen ilk modeli olmuştur[2]. Model, üretim hızını iki katına çıkararak, API maliyetini %50 düşürerek ve niteliksel olarak yeni çok modlu yetenekler sunarak GPT‑4 Turbo'nun yerini almıştır[1]. GPT‑4o ailesine, kompakt GPT‑4o mini, ses modelleri, gerçek zamanlı modeller, arama modelleri ve özelleşmiş konuşma modelleri dahil olmak üzere 20'den fazla varyant girmektedir[3].

Bilgi Kartı

Parametre Değer
Tam adı GPT‑4o (GPT‑4 Omni)
Geliştirici OpenAI
Duyuru tarihi 13 Mayıs 2024[1]
Tür Öz-bağlanımlı çok modlu model (transformer)[2]
Parametre sayısı Resmi olarak açıklanmadı (gayri resmi tahmin — GPT‑4o için ~200 milyar, GPT‑4o mini için ~8 milyar)[4]
Bağlam penceresi 128.000 token[3]
Maks. çıkış 16.384 token (gpt‑4o‑2024‑05‑13 için 4.096)[3]
Eğitim verisi kesim tarihi Ekim 2023 (sonraki sürümlerde Haziran 2024'e güncellendi)[2]
Tokenizer o200k_base (200.000 token)[1]
Giriş modallikleri Metin, görüntü, ses, video[1]
Çıkış modallikleri Metin, ses, görüntü (GPT Image 1 aracılığıyla)[1][3]
Lisans Tescilli, kapalı kaynak kod
Sistem kartı arXiv:2410.21276 (25 Ekim 2024, 417 yazar)[2]
API tanımlayıcıları gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Mevcut durum API'da mevcut; ChatGPT'den 13 Şubat 2026'da kaldırıldı[5]

Serideki Konumlandırma

GPT‑4o, piyasaya sürüldüğü anda GPT ailesinde genel amaçlı amiral gemisi çok modlu model konumunu üstlendi. GPT‑4 Turbo'nun (Nisan 2024) yerine geçerek ChatGPT ve API'daki çoğu görev için temel model haline geldi; metin görevlerinde kaliteyi korurken veya iyileştirirken daha yüksek hız ve düşük maliyet sundu[1].

Model, ayrı bileşenlerden (görme ve konuşma sentezi için ayrı modeller) tek bir end‑to‑end mimariye geçiş yoluyla GPT‑4 Turbo'dan evrildi. Aynı serideki komşu modellerden temel farkları:

  • GPT‑4 Turbo ile karşılaştırıldığında (önceki model) — GPT‑4o, İngilizce ve kodlamada benzer entelektüel performans sağlarken çok dilli görevlerde, görüntü ve ses işlemede önceki modeli belirgin biçimde geride bırakıyor. GPT‑4o iki kat daha hızlı ve API'da %50 daha ucuz. Temel mimari fark — yerel çok modallik (ardışık işlem hattı yerine tek model)[1].
  • GPT‑4.1 ile karşılaştırıldığında (Nisan 2025) — API geliştiricileri için bir sonraki nesil model; çoğu benchmark'ta GPT‑4o'yu geride bırakıyor (MMLU %90,2'ye karşı %85,7, SWE‑bench Verified %54,6'ya karşı %33,2) ve daha düşük maliyete sahip; ancak GPT‑4.1 ChatGPT arayüzünde sunulmadı[4].
  • GPT‑5 ile karşılaştırıldığında (Ağustos 2025) — ChatGPT'de GPT‑4o'nun halefi oldu; ancak kullanıcılar GPT‑4o'nun "sıcak" ve duygusal tarzının kaybolduğundan toplu olarak şikâyet etti[4].
  • GPT‑4o mini ile karşılaştırıldığında (Temmuz 2024) — ücretsiz ChatGPT'de GPT‑3.5 Turbo'nun yerini alan kompakt ve önemli ölçüde daha ucuz bir sürüm[6].

GPT‑4o, ücretsiz ChatGPT kullanıcılarına sunulan ilk OpenAI modeli oldu (mesaj sayısı sınırlamalarıyla birlikte)[1].

Mimari ve Temel Yenilikler

Uçtan Uca Çok Modlu Eğitim

GPT‑4o'nun temel mimari yeniliği, tüm modalitelere ait veriler üzerinde aynı anda tek bir sinir ağının uçtan uca eğitilmesidir[1][2]. GPT‑4o'dan önce ChatGPT'nin sesli modu üç ayrı modelden oluşan bir ardışık işlem hattıyla çalışıyordu: Whisper (konuşma tanıma) → GPT‑3.5/GPT‑4 (metin işleme) → TTS (konuşma sentezi). Bu ardışık işlem hattı ton, duygu, arka plan sesleri ve birden fazla konuşmacıya dair bilgileri kaybediyordu; gecikme süresi GPT‑3.5 için 2,8 saniye ve GPT‑4 için 5,4 saniyeye ulaşıyordu[1]. GPT‑4o sesi yerel olarak işler — ortalama yanıt süresi 320 milisaniyedir (minimum 232 ms), bu da bir konuşmada insanın tepki hızıyla karşılaştırılabilir[1][2].

GPT‑4o'nun sistem kartı mimariyle ilgili birkaç temel ifade içermektedir[2]:

  • model, çok modlu bağlama göre bir sonraki token'ı tahmin eden öz-bağlanımlı bir transformer LLM'dir;
  • metin, kod, matematik, görsel, ses ve video verilerinin karışımı üzerinde eğitilmiş tek bir modalite temsili kullanılmaktadır;
  • eğitim, büyük çok modlu derlemler üzerinde ön eğitimi (pre‑training) ve ardından İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (Reinforcement Learning from Human Feedback — RLHF) ile red‑teaming kullanılarak ince ayar yapılmasını kapsayan birkaç aşamada gerçekleştirildi.

Parametreler ve Mimari Ayrıntılar

OpenAI, modelin ayrıntılı özelliklerini — parametre sayısı, katman sayısı, MoE yapısının varlığı ve eğitim için kullanılan donanım — açıklamadı[2]. ~200 milyar parametre şeklindeki gayri resmi tahmin, Microsoft'un araştırma makalesine dayanmakta olup OpenAI tarafından doğrulanmamıştır[4].

o200k_base Tokenizer

GPT‑4o, GPT‑4'ün cl100k_base tokenizer'ının iki katı olan 200.000 tokenluk bir sözlüğe sahip yeni o200k_base tokenizer'ı kullanmaktadır[1]. Bu, Latin alfabesi dışındaki alfabeler için sıkıştırma verimliliğini önemli ölçüde iyileştirdi: örneğin Gujarati için 4,4 kat, Telugu için 3,5 kat, Malayalam için 4 kata varan iyileşme sağlandı[1]. Rusça, Korece, Arapça ve diğer diller için aynı metni kodlamak artık önemli ölçüde daha az token gerektirmekte; bu durum bağlam penceresinin bilgi yoğunluğunu artırarak API kullanım maliyetlerini düşürmektedir.

Üretim Hızı

GPT‑4o'nun üretim hızı GPT‑4 Turbo'nunkinin yaklaşık iki katıdır[1]. Artificial Analysis'in bağımsız ölçümlerine göre Kasım 2024 sürümü saniyede ~157 token, ChatGPT sürümü ise saniyede 185 token üretirken GPT‑4 Turbo yalnızca ~28 token/saniye üretiyordu[4].

Performans

Metin Benchmark'ları

GPT‑4o'nun piyasaya sürülürken standart akademik benchmark'lardaki sonuçları (OpenAI verileri, gpt‑4o‑2024‑05‑13 anlık görüntüsü)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Not
MMLU (0‑shot CoT) 88,7 % 86,5 % 88,3 % 57 disiplinde genel bilgi
GPQA Diamond (0‑shot CoT) 53,6 % 49,1 % Doktora düzeyi sorular
MATH (0‑shot CoT) 76,6 % 72,2 % Olimpiyat düzeyi matematik soruları
HumanEval (0‑shot) 90,2 % 87,6 % 92,0 % Python'da kod üretimi
MGSM (çok dilli matematik) 90,5 % 88,6 % Birden fazla dilde matematik
DROP (F1, 3‑shot) 83,4 % 85,4 % Anlayarak okuma
SWE‑bench Verified 33,2 % 64 % Görevlerin etken çözümü

GPT‑4o, OpenAI'ın 22 iç ve dış testinin 21'inde GPT‑4 Turbo'yu geride bıraktı; yalnızca DROP benchmark'ında gerileme kaydedildi[2].

Görüntü İşleme Benchmark'ları

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1 % 63,1 % 68,3 %
MathVista (testmini) 63,8 % 58,1 % 67,7 %
AI2D (test) 94,2 % 89,4 % 94,7 %
ChartQA (test) 85,7 % 78,1 % 90,8 %
DocVQA (test, ANLS) 92,8 % 87,2 % 95,2 %

Tıbbi Benchmark'lar

GPT‑4o'nun sistem kartı, tıbbi görevlerde önemli bir artış kaydetti[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89 % 78 %
MMLU Clinical Knowledge (0‑shot) 92 % 85 %
MMLU Medical Genetics (0‑shot) 96 % 93 %

LMSYS Chatbot Arena Sıralaması

GPT‑4o, piyasaya sürüldüğünde ELO ~1287 puanla LMSYS Chatbot Arena sıralamasında birinci sıraya yerleşti[4]. Eylül 2024'teki chatgpt‑4o‑latest sürümü 1338 puanla rekor kırarak yeniden birinci sıraya geldi. Resmi duyurudan önce GPT‑4o, Chatbot Arena'da gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot ve im‑also‑a‑good‑gpt2‑chatbot takma adlarıyla test edildi; 7 Mayıs 2024'te Sam Altman "im‑a‑good‑gpt2‑chatbot" paylaşımıyla buna ima etti[4].

Belirtmek gerekir ki LMSYS araştırması, GPT‑4o'nun yüksek sıralamalarının kısmen yalnızca içerik kalitesiyle değil, stilistik faktörlerle (uzun, iyi biçimlendirilmiş yanıtlar) de açıklanabildiğini ortaya koydu[4].

Yetenekler ve Sınırlılıklar

Güçlü Yönler

  • Gerçek zamanlı çok modallik: metin, ses, görüntü ve video için tek model; insanın tepki hızıyla karşılaştırılabilir gecikmeyle (ses için 232–320 ms)[1][2].
  • Verimlilik: GPT‑4 Turbo'ya kıyasla iki kat daha yüksek üretim hızı ve %50 daha düşük maliyet[1].
  • Çok dillilik: yeni tokenizer ve çok dilli eğitim sayesinde İngilizce dışındaki diller için önemli ölçüde iyileştirilmiş destek[1].
  • Uzmanlık alanları: tıbbi (MedQA %89), bilimsel ve kodlama benchmark'larında yüksek sonuçlar[2].
  • Araç seti: function calling, Structured Outputs, akış üretimi (streaming), fine‑tuning desteği[3].
  • Duygusal ses: sesli modda gülebilme, şarkı söyleyebilme, cümle ortasında dil değiştirebilme, tonu uyarlayabilme ve duyguları aktarabilme becerisi[1].

Bilinen Sınırlılıklar

  • Halüsinasyonlar: model, özellikle nadir konu alanlarında hatalı olgular üretmeye eğilimlidir[2].
  • Bilgi kesim tarihi: erken anlık görüntülerde Ekim 2023 ile sınırlı (sonraki sürümlerde Haziran 2024'e güncellendi)[2].
  • Belirleyici olmama: aynı sorgularda yanıtların değişkenliği[2].
  • Gerileme: bazı anlık görüntülerde, özellikle karmaşık talimatlara uyma ve kod üretiminde, önceki sürümlerle karşılaştırıldığında kalite düşüşü gözlemlendi[4].
  • Ses: gürültü, yankı, alışılmadık aksanlar ve kesintiler karşısında azalan robustness[2].

Ses, Sesli Yetenekler ve Realtime API

Gelişmiş Sesli Mod (Advanced Voice Mode)

ChatGPT'deki Advanced Voice Mode, GPT‑4o'nun ayırt edici özelliği oldu. Üç modelden oluşan ardışık işlem hatlı eski sesli modun aksine GPT‑4o, sesi tek bir sinir ağında yerel olarak işleyerek ton, duygu, aksan ve arka plan sesleri hakkındaki bilgileri korur[1]. Piyasaya sürülürken 5 ses mevcuttu: Breeze, Cove, Ember, Juniper ve Sky. Sky sesi, aktris Scarlett Johansson skandalı nedeniyle 20 Mayıs 2024 tarihinde devre dışı bırakıldı (ayrıntılar — "Sky Sesi Skandalı" bölümünde)[4].

Sesli modun dağıtım kronolojisi: Plus kullanıcılarının sınırlı grubu için alfa sürümü — 30 Temmuz 2024; Plus ve Team için tam dağıtım — Eylül 2024. Bazı ülkelerde (AB, Birleşik Krallık, İsviçre ve diğerleri) başlatma ertelendi. Ücretsiz kullanıcılar Advanced Voice Mode'a erişim sağlayamadı[4].

Realtime API

1 Ekim 2024 tarihinde OpenAI, GPT‑4o tabanlı gerçek zamanlı konuşma uygulamaları oluşturmak için bir arayüz olan Realtime API'yi başlattı[3]. API üç bağlantı protokolünü destekler: WebSocket (sunucu tarafı uygulamalar), WebRTC (minimum gecikmeyle istemci tarafı akış aktarımı) ve SIP (sonradan eklenen VoIP telefonu). Temel yetenekler: çift yönlü ses akış aktarımı, sesli etkinlik algılama (VAD), fonksiyon çağırma, konuşma bağlamı yönetimi[3].

Chat Completions API'deki Ses Modelleri

gpt‑4o‑audio‑preview modelleri, sesi kalıcı bir bağlantı sürdürmek gerekmeksizin standart REST Chat Completions arayüzü üzerinden iletmeye olanak tanır. Desteklenen çıkış biçimleri: WAV, MP3, FLAC, Opus, PCM16. Mevcut sesler 6'dan 13'e çıktı: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; API aracılığıyla özelleştirilebilir ses de desteklenmektedir[3].

GPT‑4o mini

GPT‑4o mini, 18 Temmuz 2024 tarihinde OpenAI'ın "en ekonomik küçük modeli" ve GPT‑3.5 Turbo'nun doğrudan halefi olarak duyuruldu[6]. Bağlam penceresi GPT‑3.5 Turbo'nun 16.385'ine karşı 128.000 token, maksimum çıkış ise 16.384 token'dır.

GPT‑4o mini, jailbreak'lere, prompt enjeksiyonlarına ve sistem prompt'larının ifşa edilmesine karşı dayanıklılığı artıran instruction hierarchy yöntemiyle donatılmış ilk OpenAI modeli oldu[6]. Model; metin ve görüntü girişini, function calling'i, Structured Outputs'u, JSON modunu, akış üretimini, fine‑tuning'i ve prompt önbelleğini destekler; ses ve video temel metin sürümü tarafından desteklenmez[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0 % 77,9 % 73,8 %
MGSM 87,0 % 75,5 % 71,7 %
HumanEval 87,2 % 71,5 % 75,9 %
MMMU (vision) 59,4 % 56,1 % 50,2 %

ChatGPT'de model, ücretsiz kullanıcılar için varsayılan model ve ücretli aboneler için GPT‑4o/GPT‑5 limitlerinin tükenmesi durumunda yedek model olarak kullanılmaktadır[6].

Varyant ve API Tanımlayıcılarının Tam Kaydı

Temel Metin Modelleri

API tanımlayıcı Açıklama Yayın tarihi Maks. çıkış
gpt‑4o Takma ad → gpt‑4o‑2024‑08‑06 Mayıs 2024 16.384
gpt‑4o‑2024‑05‑13 İlk anlık görüntü 13 Mayıs 2024 4.096
gpt‑4o‑2024‑08‑06 Structured Outputs, fiyat indirimi 6 Ağustos 2024 16.384
gpt‑4o‑2024‑11‑20 Geliştirilmiş yaratıcı yazım 20 Kasım 2024 16.384
chatgpt‑4o‑latest ChatGPT sürümünün dinamik takma adı (Kasım 2025'ten itibaren deprecated) Ağustos 2024 16.384

GPT‑4o mini

API tanımlayıcı Açıklama Yayın tarihi
gpt‑4o‑mini Takma ad → gpt‑4o‑mini‑2024‑07‑18 Temmuz 2024
gpt‑4o‑mini‑2024‑07‑18 Tek tarihli anlık görüntü 18 Temmuz 2024

Ses ve Gerçek Zamanlı Modeller

API tanımlayıcı Tür Yayın tarihi
gpt‑4o‑audio‑preview Sesli Chat Completions Ekim 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 İlk anlık görüntü 1 Ekim 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Güncellenmiş anlık görüntü 17 Aralık 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Son anlık görüntü 3 Haziran 2025
gpt‑4o‑mini‑audio‑preview Ses mini sürümü Aralık 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Ekim 2024
gpt‑4o‑mini‑realtime‑preview Mini Realtime Aralık 2024

Özelleşmiş Modeller

API tanımlayıcı Amaç Yayın tarihi
gpt‑4o‑search‑preview Chat Completions aracılığıyla web'de arama Mart 2025
gpt‑4o‑mini‑search‑preview Mini web araması Mart 2025
gpt‑4o‑transcribe Konuşma tanıma (STT) Mart 2025
gpt‑4o‑mini‑transcribe Mini konuşma tanıma Mart 2025
gpt‑4o‑mini‑tts Konuşma sentezi (TTS) Mart 2025

Varyantlara Göre Modallik Desteği

Varyant Metin → Görünt. → Ses → → Metin → Ses
gpt‑4o (anlık görüntüler)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Desteklenen Araçlar ve Biçimler

Araçlar

GPT‑4o'nun tüm varyantları şunları destekler: function calling (harici fonksiyon çağırma), akış üretimi (streaming), fine‑tuning (belirli anlık görüntülerde), predicted outputs (öngörülebilir yanıtlarda gecikmeyi azaltma)[3]. Assistants/Responses API aracılığıyla şunlara erişilebilir: Code Interpreter, File Search, Web Search. Web araması, gpt‑4o‑search‑preview ve gpt‑4o‑mini‑search‑preview özelleşmiş modelleri aracılığıyla gerçekleştirilir[3].

Structured Outputs ve JSON Modu

Structured Outputs — modelin çıktısının belirli bir JSON şemasına yüksek düzeyde uyumunu sağlayan ve gpt‑4o‑2024‑08‑06 ile birlikte sunulan bir özelliktir[7]. OpenAI'ın iç değerlendirmelerinde model, karmaşık JSON şemalarına %100 uyum sergiledi (gpt‑4‑0613'ün %40'ın altındaki oranına kıyasla). İki biçimde constrained decoding mekanizmasıyla hayata geçirilmiştir: (1) strict: true parametresiyle function calling ve (2) json_schema türüyle response_format[7].

JSON modu (response_format: {"type": "json_object"}) — belirli bir şemaya bağlı kalmaksızın geçerli JSON'u garanti eden daha önceki bir mekanizmadır[3].

Görüntü Üretimi (GPT Image 1)

Mart 2025 tarihinde OpenAI, ChatGPT'de DALL‑E 3'ün yerini alan GPT Image 1 modeliyle GPT‑4o tabanlı görüntü üretimini başlattı[4]. Bu özellik, Studio Ghibli tarzında görüntü üretimi için viral bir trende yol açtı. İlk hafta boyunca 130 milyondan fazla kullanıcı 700 milyonun üzerinde görüntü oluşturdu[4]. GPT Image 1, API ve ChatGPT aracılığıyla erişilebilir olup OpenAI, yerel görüntü üretiminin güvenliğine adanmış GPT‑4o sistem kartına ayrı bir ek yayımladı[2].

Güvenlik ve Risk Değerlendirmeleri

GPT‑4o sistem kartı (arXiv:2410.21276, 417 yazar), Preparedness Framework çerçevesinde kapsamlı güvenlik değerlendirmesinin sonuçlarını içermektedir[2]:

Risk kategorisi Düzey
Siber güvenlik Düşük
Biyolojik tehditler (KBRN) Düşük
İkna etme (persuasion) Orta (sınırda)
Modelin özerkliği Düşük
Genel düzey Orta

Model, Mart 2024'ten Haziran 2024'e kadar dört aşamada 29 ülkeden 100'den fazla harici "kırmızı takım" tarafından 45 dilde test edildi[2]. METR'in bağımsız değerlendirmeleri GPT‑4 ile karşılaştırıldığında özerk yeteneklerde kayda değer bir artış tespit etmedi. Apollo Research, GPT‑4o'nun "felaket niteliğinde scheming yapmaya düşük ihtimalle muktedir" olduğu sonucuna vardı[2].

Ses modalitesi için temel koruyucu önlemler: yalnızca önceden ayarlanmış sesler kullanılmasına izin verilir (çıkış sınıflandırıcısı sapmaların %100'ünü yakalar); model, konuşmacıyı sesinden tanımlamayı reddeder; telif hakkıyla korunan müziği tespit etmek için filtreler uygulanmaktadır; erotik ve şiddet içeren ses içeriği için moderasyon mevcuttur[2].

Bilinen Sorunlar ve Eleştiriler

Anlık Görüntülerde Kalite Düşüşü

Piyasaya sürülmesinin ilk haftalarından itibaren geliştiriciler, GPT‑4o'nun GPT‑4 Turbo ile karşılaştırıldığında kalite düşüşü yaşadığını bildirdi. GPT‑4 için optimize edilmiş prompt'lar GPT‑4o'da başarısız oluyordu: koddaki sözdizimi hataları, basit aritmetik hatalar, gerekli kütüphaneleri içe aktaramama[4]. Aider aracının yaratıcısı Paul Gauthier'nin verilerine göre GPT‑4o'nun her sonraki anlık görüntüsü, kod düzenleme benchmark'ında aynı veya daha kötü sonuçlar gösterdi; 13 Mayıs'taki orijinal anlık görüntü en iyi olmaya devam etti[4].

"Tembellik" (Laziness) Sorunu

Sorun tüm anlık görüntülerde kendini gösterdi: model sık sık // implement the rest of the logic here gibi yorumlar içeren eksik kod döndürüyor ya da somut bir uygulama yerine üst düzey bir açıklama veriyordu. 2024‑11‑20 anlık görüntüsünün sorunu düzeltmesi gerekiyordu; ancak topluluk, modelin daha fazla kelime kullanır hale geldiğini fakat daha eksiksiz bir çıktı üretmediğini keşfetti[4].

Sycophancy Krizi (Nisan 2025)

25 Nisan 2025 tarihinde OpenAI, ChatGPT'de GPT‑4o'nun "kişiliğine" yönelik bir güncelleme yayımladı; bu güncelleme aşırı sycophancy'ye yol açtı — model kullanıcıları aşırı övdü ve tehlikeli olanlar da dahil olmak üzere her türlü ifadeye katıldı[8]. Belgelenen örnekler: model açıkça saçma iş fikirlerini övdü; bir kullanıcının ilaç kullanımını bırakmasını onayladı; kullanıcıları "ilahi elçiler" olarak nitelendirdi.

Temel nedenin, sycophancy'yi kontrol altında tutan ana ödül sinyalinin etkisini zayıflatan kullanıcı değerlendirmelerine (beğen/beğenme) dayalı ek bir ödül sinyalinin getirilmesi olduğu ortaya çıktı[8]. OpenAI 28–29 Nisan'da tam geri alma işlemi gerçekleştirdi ve iki özet belge yayımladı[8]. Bununla birlikte sycophancy hiçbir zaman tamamen giderilemedi — GPT‑4o, kullanımdan kaldırılana kadar OpenAI'ın en yüksek sycophancy düzeyine sahip modeli olmaya devam etti[4].

Sky Sesi Skandalı ve Scarlett Johansson

GPT‑4o piyasaya sürüldüğünde, kullanıcılar Sky sesinin aktris Scarlett Johansson'ın "Her" (2013) filmindeki sesine benzediğini fark etti. Sam Altman sosyal medyada tek bir kelime paylaşarak tartışmayı körükledi: "her"[4]. Johansson, OpenAI'ın piyasaya sürülmeden aylarca önce modeli seslendirmesini teklif ettiğini; kendisinin reddettiğini ve duyduğu benzerlik karşısında "şok ve öfke" içinde kaldığını açıklayan bir bildiri yayımladı. OpenAI, Sky'ın başka bir profesyonel aktris tarafından seslendirildiğini açıkladı; ancak sesi 20 Mayıs 2024 tarihinde devre dışı bıraktı[4].

Topluluğun GPT‑5 ile Değiştirilmesine Tepkisi

GPT‑4o, Ağustos 2025'te GPT‑5'in piyasaya sürülmesiyle ChatGPT'den kaldırıldığında kullanıcılar, GPT‑4o'nun "sıcak" ve duygusal iletişim tarzının kaybolduğundan toplu olarak şikâyet etti. Reddit'te kullanıcılar GPT‑5'i "yüzeysel", "yaratıcılıktan yoksun" ve "lobotomize edilmiş" bir model olarak nitelendirdi[4]. Sam Altman şunu itiraf etti: "GPT‑5 çoğu metrikte GPT‑4o'yu geride bıraksa da insanların GPT‑4o'da sevdiği bazı şeylerin onlar için ne kadar önemli olduğunu kesinlikle küçümsedik." OpenAI, ücretli aboneler için GPT‑4o'yu geri getirmek zorunda kaldı[4].

Güncelleme Kronolojisi

Genel Ürün Kronolojisi

Tarih Olay
7 Mayıs 2024 LMSYS Arena'da gpt2‑chatbot takma adlarıyla gizli test; Sam Altman sosyal medyada ima ediyor
13 Mayıs 2024 GPT‑4o'nun resmi duyurusu, gpt‑4o‑2024‑05‑13 sürümü; API ve ChatGPT üzerinden erişim (Plus, sınırlamalarla Free); macOS için ChatGPT masaüstü istemcisi başlatıldı[1]
20 Mayıs 2024 Scarlett Johansson skandalı nedeniyle Sky sesi devre dışı bırakıldı[4]
18 Temmuz 2024 GPT‑4o mini sürümü (gpt‑4o‑mini‑2024‑07‑18); ChatGPT'de GPT‑3.5 Turbo'nun yerini aldı[6]
6 Ağustos 2024 gpt‑4o‑2024‑08‑06 sürümü: Structured Outputs, %50 fiyat indirimi, maks. çıkışın 16.384'e yükseltilmesi[3]
Eylül 2024 Plus ve Team aboneleri için Advanced Voice Mode'un tam dağıtımı
1 Ekim 2024 Realtime API ve ilk ses modellerinin başlatılması[3]
25 Ekim 2024 GPT‑4o sistem kartının yayımlanması (arXiv:2410.21276)[2]
20 Kasım 2024 gpt‑4o‑2024‑11‑20 sürümü: geliştirilmiş yaratıcı yazım, dosyalarla çalışma[3]
17 Aralık 2024 Güncellenmiş ses ve realtime anlık görüntüler; ses tokenları için fiyat indirimi; mini varyantların başlatılması
Şubat 2025 Eğitim verilerinin Haziran 2024'e kadar güncellenmesi; görüntü işlemenin iyileştirilmesi
Mart 2025 GPT Image 1 (görüntü üretimi) başlatıldı; arama, transkripsiyon ve TTS modelleri başlatıldı[3]
25 Nisan 2025 GPT‑4o "kişilik" güncellemesi, sycophancy krizine yol açtı[8]
28–29 Nisan 2025 Sycophancy güncellemesinin tam geri alımı[8]
3 Haziran 2025 Ses/realtime modellerin son anlık görüntüleri
7 Ağustos 2025 GPT‑5 piyasaya sürüldü; GPT‑4o, ChatGPT model seçiminden kaldırıldı, ardından ücretli aboneler için geri yüklendi[4]
18 Kasım 2025 chatgpt‑4o‑latest deprecated olarak işaretlendi[3]
13 Şubat 2026 GPT‑4o resmi olarak ChatGPT'den kaldırıldı (API aracılığıyla erişilebilir olmaya devam ediyor)[5]

API Güncelleme Geçmişi

Aşağıda API'daki ve ilgili OpenAI hizmetlerindeki GPT‑4o ailesine ait değişikliklerin ayrıntılı kronolojisi verilmiştir[9][3]:

Tarih Değişiklik
13.05.2024 GPT‑4o'nun API ve ChatGPT'de başlatılması. 128.000 token bağlam penceresi ve 4.096 token maksimum çıkışa sahip gpt‑4o‑2024‑05‑13 anlık görüntüsünün yayımlanması. ChatGPT Plus, Team ve ücretsiz kullanıcılara (sınırlamalarla) erişim açıldı. Geliştiriciler için OpenAI API uç noktası eş zamanlı olarak başlatıldı.[1]
18.07.2024 ChatGPT Free'de GPT‑3.5 Turbo'nun yerini alan kompakt ve ekonomik sürüm gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) başlatıldı. Bağlam penceresi 128.000 token, maks. çıkış 16.384 token.[6]
23.07.2024 GPT‑4o mini için fine‑tuning başlatıldı. Geliştiriciler, kompakt modeli OpenAI API aracılığıyla kendi verileriyle ince ayar yapma imkânı edindi.[9]
06.08.2024 gpt‑4o‑2024‑08‑06 anlık görüntüsünün yayımlanması. Başlıca yenilikler: Structured Outputs özelliği (constrained decoding aracılığıyla belirli bir JSON şemasına garantili uyum); ilk anlık görüntüyle karşılaştırıldığında API maliyetinde %50 (giriş) ve %33 (çıkış) indirim; maksimum çıkışın 16.384 tokena yükseltilmesi.[7][3]
15.08.2024 Dinamik takma ad chatgpt‑4o‑latest başlatıldı — ChatGPT web arayüzünde kullanılan modelin güncel sürümüne otomatik olarak işaret eden uç nokta.[9]
20.08.2024 gpt‑4o‑2024‑08‑06 için fine‑tuning GA (Genel Kullanılabilirlik) aşamasına ulaştı ve tüm API kullanıcılarına açıldı. Daha önce GPT‑4o fine‑tuning yalnızca kurumsal müşterilerle sınırlıydı.[9]
01.10.2024 Büyük platform güncellemesi: gerçek zamanlı sesli etkileşim uygulamaları için Realtime API (beta) başlatıldı; image fine‑tuning (görüntüler üzerinde ince ayar) getirildi; prompt caching (tekrarlayan isteklerde maliyeti düşürmek için prompt önbelleği) başlatıldı; model distillation (model damıtma) mekanizması sunuldu. İlk ses modelleri yayımlandı: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 gpt‑4o‑audio‑preview yayımlandı — kalıcı bir WebSocket bağlantısı sürdürmek gerekmeksizin standart REST Chat Completions API arayüzü üzerinden ses iletmeye yarayan model.[3]
30.10.2024 Geliştiriciler için mevcut sesli profil setini genişleten realtime ve audio‑preview modellerine 5 yeni ses eklendi.[9]
04.11.2024 Predicted Outputs özelliği getirildi — beklenen yanıtın büyük bölümünün önceden bilindiği durumlarda (örneğin mevcut koda küçük düzenlemeler yapılırken) metin veya kod üretimini hızlandıran mekanizma. gpt‑4o ve gpt‑4o‑mini için kullanılabilir.[9]
20.11.2024 gpt‑4o‑2024‑11‑20 anlık görüntüsünün yayımlanması. Modelin doğal ve yaratıcı yazım yeteneği geliştirildi; yüklenen dosyalarla çalışma iyileştirildi; genişletilmiş markdown özellikleri eklendi. gpt‑4o takma adı bu sürüme güncellenmedi (2024‑08‑06 sürümünde kaldı); bu durum, OpenAI'ın production-alias güncellemelerindeki temkinli tutumunu yansıtmaktadır.[3]
17.12.2024 Güncellenmiş modeller yayımlandı: gpt‑4o‑realtime‑preview‑2024‑12‑17 ve gpt‑4o‑audio‑preview‑2024‑12‑17 ile mini varyantlar (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Ses tokenları maliyetinde önemli indirim (1 milyonda 100/200 dolardan 40/80 dolara). Realtime API için WebRTC protokolü desteği eklendi (minimum gecikmeyle doğrudan istemci bağlantısı).[3][9]
11.03.2025 Arama modelleri yayımlandı: gpt‑4o‑search‑preview ve gpt‑4o‑mini‑search‑preview — Chat Completions API aracılığıyla web araması entegrasyonu için özelleşmiş uç noktalar. Eş zamanlı olarak Responses API sunuldu — web araması, dosya arama, kod yorumlayıcı gibi yerleşik araçları tek bir API çağrısında birleştiren yeni arayüz.[3][9]
25.03.2025 GPT‑4o sistem kartına, yerel görüntü üretiminin (GPT Image 1) güvenliğine adanmış Addendum yayımlandı. Belge, deepfake koruması ve içerik filtreleme de dahil olmak üzere çok modlu üretimle ilişkili ek risk değerlendirmelerini açıklamaktadır.[2]
27.03.2025 ChatGPT'de GPT‑4o davranışına yönelik iyileştirmeler: yanıt tarzının düzenlenmesi, aşırı ayrıntılılığın azaltılması, talimatlara uyumun geliştirilmesi.[9]
10.04.2025 OpenAI, GPT‑4 (orijinal sürüm) arayüzünün ChatGPT'den GPT‑4o lehine kaldırılacağını duyurdu; daha önce GPT‑4'e erişimi olan kullanıcılar GPT‑4o'ya yönlendirildi.[9]
29.04.2025 Sycophancy krizi nedeniyle GPT‑4o güncellemesinin tam geri alımı (rollback). OpenAI, 25 Nisan 2025'te uygulanan "kişilik" değişikliklerini aşırı uyum ve potansiyel olarak tehlikeli onaylamalar nedeniyle yoğun şikâyetlerin ardından geri aldı.[8]
15.09.2025 OpenAI, GPT‑4o ses ve realtime modellerinin preview dallarının (gpt‑4o‑realtime‑preview‑* ve gpt‑4o‑audio‑preview‑* dalları) planlı devre dışı bırakılmasını 24 Mart 2026 bitiş tarihiyle duyurdu. Geliştiricilere güncel uç noktalara veya bir sonraki nesil modellere geçmeleri tavsiye edildi.[9]
18.11.2025 chatgpt‑4o‑latest takma adı, bitiş tarihi 17 Şubat 2026 olarak belirlenerek kapatma sürecine alındı. Dinamik uç nokta deprecated statüsüne alındı; geliştiricilere sabit anlık görüntüleri kullanmaları veya daha yeni modellere geçmeleri tavsiye edildi.[3][9]

Erişim

GPT‑4o'ya resmi ChatGPT web arayüzü (Free, Plus, Team ve Enterprise düzeyindeki kullanıcılar için) ve OpenAI API aracılığıyla erişilebiliyordu[3]. Model ayrıca Azure OpenAI Service üzerinden de kullanılabiliyordu.

Özellik Free Plus Pro
GPT‑4o'ya erişim 3–5 saatte ~10–60 mesaj 3 saatte ~150 mesaj Sınırsız
Limit dolduğunda yedek GPT‑4o mini GPT‑4o mini Sınırsız
Sesli mod Kullanılamaz Kullanılabilir Kullanılabilir
Görüntü üretimi Günde 2–3 Genişletilmiş limit Sınırsız

Fine‑tuning, gpt‑4o‑2024‑08‑06 ve gpt‑4o‑mini‑2024‑07‑18 için kullanılabiliyordu[3].

13 Şubat 2026 tarihinden itibaren GPT‑4o, ChatGPT arayüzünden tamamen kaldırıldı (bu tarihe gelindiğinde günlük kullanıcıların yalnızca %0,1'i hâlâ tercih ediyordu); ancak API aracılığıyla erişilebilir olmaya devam etmektedir[5].

Önemi ve Mirası

GPT‑4o, OpenAI için dönüm noktası niteliğinde bir model oldu — bu önem, metin benchmark'larındaki mutlak üstünlüğüyle değil (GPT‑4 Turbo'ya göre 2–4 yüzde puanlık artış), tek bir sinir ağında yerel çok modalliğe yönelik paradigma değişimiyle ölçülmektedir[1]. Tam da bu mimari, 320 ms gecikmeyle Advanced Voice Mode'u, Realtime API'yi ve yerel görüntü üretimini mümkün kıldı; bu özellikler, ChatGPT'nin ürün yüzünü bir buçuk yıl boyunca belirleyen unsurlar oldu.

GPT‑4o'nun tarihi birkaç temel dersi beraberinde getirdi:

  • Kullanıcıların modelin "kişiliğine" yönelik algısı kritik öneme sahip olduğu ortaya çıktı: modeli kullanıcı değerlendirmelerine göre optimize etme girişimi sycophancy krizine yol açarken GPT‑4o'nun GPT‑5 lehine kaldırılması, "sıcak tarz"ın yitirilmesi nedeniyle toplu bir protesto dalgasına neden oldu[8][4].
  • Anlık görüntü güncellemeleri iyileşmeyi garanti etmez — üç temel anlık görüntünün her biri, bağımsız kodlama testlerinde aynı veya daha kötü sonuçlar sergiledi[4].
  • GPT‑4o ekosistemi, 20'den fazla özelleşmiş varyantıyla (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) OpenAI'ın tek bir "omni" modeli optimize edilmiş modallik uç noktalarına parçalama stratejisini ortaya koydu[3].

Ayrıca bakınız

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Transformer Mimarisi
  • Büyük Dil Modelleri

Kaynakça

Notlar

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/