GPT-4o (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (diucapkan "ji‑pi‑ti‑for‑ou"; huruf "o" dari bahasa Latin omni — "semua", "menyeluruh") — model bahasa besar (LLM) multimodal dari keluarga GPT, yang dikembangkan oleh perusahaan OpenAI dan diperkenalkan pada 13 Mei 2024[1]. GPT‑4o menjadi model pertama OpenAI yang dilatih sebagai jaringan neural tunggal end‑to‑end, yang mampu memproses teks, gambar, dan audio secara bersamaan — berbeda dari model-model pendahulunya, di mana model terpisah digunakan untuk setiap modalitas[2]. Model ini menggantikan GPT‑4 Turbo sebagai unggulan lini produk, menawarkan kecepatan generasi dua kali lebih tinggi, biaya API 50% lebih rendah, dan kemampuan multimodal yang secara kualitatif lebih baik[1]. Keluarga GPT‑4o mencakup lebih dari 20 varian, termasuk GPT‑4o mini yang kompak, model audio, model real-time, model pencarian, dan model suara khusus[3].

Kartu Informasi

Parameter Nilai
Nama lengkap GPT‑4o (GPT‑4 Omni)
Pengembang OpenAI
Tanggal pengumuman 13 Mei 2024[1]
Jenis Model multimodal autoregresif (transformer)[2]
Jumlah parameter Tidak diungkapkan secara resmi (estimasi tidak resmi — ~200 miliar untuk GPT‑4o, ~8 miliar untuk GPT‑4o mini)[4]
Jendela konteks 128.000 token[3]
Maks. keluaran 16.384 token (4.096 untuk gpt‑4o‑2024‑05‑13)[3]
Tanggal cutoff data pelatihan Oktober 2023 (diperbarui hingga Juni 2024 pada versi terbaru)[2]
Tokenizer o200k_base (200.000 token)[1]
Modalitas masukan Teks, gambar, audio, video[1]
Modalitas keluaran Teks, audio, gambar (melalui GPT Image 1)[1][3]
Lisensi Proprietary, kode tertutup
Kartu sistem arXiv:2410.21276 (25 Oktober 2024, 417 penulis)[2]
Identifier API gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Status saat ini Tersedia di API; dihapus dari ChatGPT pada 13 Februari 2026[5]

Posisi dalam Lini Produk

GPT‑4o menduduki posisi sebagai model multimodal unggulan untuk keperluan umum dalam keluarga GPT pada saat rilis. Model ini menggantikan GPT‑4 Turbo (April 2024) sebagai model utama untuk sebagian besar tugas di ChatGPT dan API, menawarkan kecepatan lebih tinggi dan biaya lebih rendah sambil mempertahankan atau meningkatkan kualitas pada tugas-tugas berbasis teks[1].

Model ini berevolusi dari GPT‑4 Turbo melalui transisi dari komponen-komponen terpisah (model terpisah untuk visi dan sintesis suara) menuju arsitektur end‑to‑end tunggal. Perbedaan utama dibandingkan model-model tetangga dalam lini produk:

  • Dibandingkan dengan GPT‑4 Turbo (pendahulu) — GPT‑4o memberikan performa intelektual yang sebanding dalam bahasa Inggris dan coding, tetapi jauh melampaui pendahulunya dalam tugas multibahasa, pemrosesan gambar, dan audio. GPT‑4o dua kali lebih cepat dan 50% lebih murah melalui API. Perbedaan arsitektur mendasar adalah multimodalitas natif (satu model, bukan pipeline)[1].
  • Dibandingkan dengan GPT‑4.1 (April 2025) — model generasi berikutnya untuk pengembang API, yang melampaui GPT‑4o pada sebagian besar benchmark (MMLU 90,2% berbanding 85,7%, SWE‑bench Verified 54,6% berbanding 33,2%) dengan biaya lebih rendah; namun GPT‑4.1 tidak tersedia di antarmuka ChatGPT[4].
  • Dibandingkan dengan GPT‑5 (Agustus 2025) — menjadi penerus GPT‑4o di ChatGPT, namun pengguna banyak mengeluhkan hilangnya gaya "hangat" dan emosional dari GPT‑4o[4].
  • Dibandingkan dengan GPT‑4o mini (Juli 2024) — versi yang lebih kompak dan jauh lebih murah, yang menggantikan GPT‑3.5 Turbo di ChatGPT gratis[6].

GPT‑4o menjadi model pertama OpenAI yang tersedia untuk pengguna ChatGPT gratis (dengan batasan jumlah pesan)[1].

Arsitektur dan Inovasi Utama

Pelatihan Multimodal End‑to‑End

Inovasi arsitektur utama GPT‑4o terletak pada pelatihan end‑to‑end satu jaringan neural pada data semua modalitas secara bersamaan[1][2]. Sebelum GPT‑4o, mode suara ChatGPT bekerja melalui skema pipeline dari tiga model terpisah: Whisper (pengenalan suara) → GPT‑3.5/GPT‑4 (pemrosesan teks) → TTS (sintesis suara). Pipeline semacam itu kehilangan informasi tentang nada, emosi, suara latar, dan beberapa pembicara sekaligus, sementara latensi mencapai 2,8 detik untuk GPT‑3.5 dan 5,4 detik untuk GPT‑4[1]. GPT‑4o memproses audio secara natif — waktu respons rata-rata 320 milidetik (minimum 232 md), yang sebanding dengan kecepatan reaksi manusia dalam percakapan[1][2].

Kartu sistem GPT‑4o memuat beberapa pernyataan prinsipil tentang arsitektur[2]:

  • model adalah LLM transformer autoregresif yang memprediksi token berikutnya berdasarkan konteks multimodal;
  • digunakan representasi modalitas terpadu yang dilatih pada campuran data teks, kode, matematika, visual, audio, dan video;
  • pelatihan dilakukan dalam beberapa fase, termasuk pre-training pada korpus multimodal besar dan fine-tuning lanjutan menggunakan Reinforcement Learning from Human Feedback (RLHF) dan red-teaming.

Parameter dan Detail Arsitektur

Perusahaan OpenAI tidak mengungkapkan spesifikasi model secara terperinci — jumlah parameter, jumlah lapisan, keberadaan struktur MoE, dan perangkat keras yang digunakan untuk pelatihan[2]. Estimasi tidak resmi sebesar ~200 miliar parameter didasarkan pada data makalah penelitian Microsoft, tetapi tidak dikonfirmasi oleh OpenAI[4].

Tokenizer o200k_base

GPT‑4o menggunakan tokenizer baru o200k_base dengan kosakata 200.000 token — dua kali lebih besar dari cl100k_base milik GPT‑4[1]. Hal ini secara signifikan meningkatkan efisiensi kompresi untuk alfabet non-Latin: misalnya, untuk bahasa Gujarati — 4,4 kali lipat, untuk Telugu — 3,5 kali lipat, untuk Malayalam — hingga 4 kali lipat peningkatan[1]. Untuk bahasa Rusia, Korea, Arab, dan bahasa lainnya, teks yang sama memerlukan jauh lebih sedikit token untuk dikodekan, sehingga meningkatkan kepadatan informasi jendela konteks dan mengurangi biaya saat menggunakan API.

Kecepatan Generasi

Kecepatan generasi GPT‑4o kira-kira dua kali lebih tinggi dibandingkan GPT‑4 Turbo[1]. Berdasarkan pengukuran independen Artificial Analysis, versi November 2024 menghasilkan ~157 token/detik, sementara versi ChatGPT mencapai hingga 185 token/detik, sedangkan GPT‑4 Turbo hanya menunjukkan ~28 token/detik[4].

Performa

Benchmark Teks

Hasil GPT‑4o pada benchmark akademik standar saat rilis (data OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Keterangan
MMLU (0‑shot CoT) 88,7% 86,5% 88,3% Pengetahuan umum dalam 57 disiplin ilmu
GPQA Diamond (0‑shot CoT) 53,6% 49,1% Pertanyaan tingkat pascasarjana
MATH (0‑shot CoT) 76,6% 72,2% Soal matematika tingkat olimpiade
HumanEval (0‑shot) 90,2% 87,6% 92,0% Generasi kode Python
MGSM (matematika multibahasa) 90,5% 88,6% Matematika dalam beberapa bahasa
DROP (F1, 3‑shot) 83,4% 85,4% Membaca dengan pemahaman
SWE‑bench Verified 33,2% 64% Penyelesaian tugas secara otonom

GPT‑4o melampaui GPT‑4 Turbo pada 21 dari 22 pengujian internal dan eksternal OpenAI; satu-satunya regresi tercatat pada benchmark DROP[2].

Benchmark Pemrosesan Gambar

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1% 63,1% 68,3%
MathVista (testmini) 63,8% 58,1% 67,7%
AI2D (test) 94,2% 89,4% 94,7%
ChartQA (test) 85,7% 78,1% 90,8%
DocVQA (test, ANLS) 92,8% 87,2% 95,2%

Benchmark Medis

Kartu sistem GPT‑4o mencatat peningkatan signifikan dalam tugas-tugas medis[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89% 78%
MMLU Clinical Knowledge (0‑shot) 92% 85%
MMLU Medical Genetics (0‑shot) 96% 93%

Peringkat LMSYS Chatbot Arena

GPT‑4o saat diluncurkan menduduki peringkat pertama di LMSYS Chatbot Arena dengan ELO ~1287[4]. Versi chatgpt‑4o‑latest dari September 2024 mencapai rekor 1338 poin, kembali menduduki posisi pertama. Sebelum pengumuman resmi GPT‑4o, model ini diuji di Chatbot Arena dengan nama samaran gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot, dan im‑also‑a‑good‑gpt2‑chatbot; pada 7 Mei 2024, Sam Altman memberi isyarat tentang hal ini dalam publikasi "im‑a‑good‑gpt2‑chatbot"[4].

Perlu dicatat bahwa penelitian LMSYS menunjukkan: peringkat tinggi GPT‑4o sebagian dijelaskan oleh faktor stilistik (respons panjang dan terformat dengan baik), bukan semata-mata oleh kualitas konten[4].

Kemampuan dan Keterbatasan

Keunggulan

  • Multimodalitas real-time: satu model untuk teks, audio, gambar, dan video dengan latensi yang sebanding dengan reaksi manusia (232–320 md untuk audio)[1][2].
  • Efisiensi: kecepatan generasi dua kali lebih tinggi dan biaya 50% lebih rendah dibandingkan GPT‑4 Turbo[1].
  • Multibahasa: dukungan yang jauh lebih baik untuk bahasa non-Inggris berkat tokenizer baru dan pelatihan multibahasa[1].
  • Bidang khusus: hasil tinggi pada benchmark medis (MedQA 89%), ilmiah, dan coding[2].
  • Perangkat: dukungan function calling, Structured Outputs, generasi streaming, fine-tuning[3].
  • Audio emosional: kemampuan tertawa, bernyanyi, berganti bahasa di tengah kalimat, menyesuaikan nada, dan menyampaikan emosi dalam mode suara[1].

Keterbatasan yang Diketahui

  • Halusinasi: model rentan menghasilkan fakta yang tidak akurat, terutama dalam domain subjek yang jarang[2].
  • Tanggal cutoff pengetahuan: terbatas hingga Oktober 2023 pada snapshot awal (diperbarui hingga Juni 2024 pada versi terbaru)[2].
  • Non-determinisme: variasi respons pada pertanyaan yang sama[2].
  • Regresi: pada beberapa snapshot, terjadi penurunan kualitas dibandingkan versi sebelumnya, khususnya dalam mengikuti instruksi kompleks dan generasi kode[4].
  • Audio: penurunan robustness dalam kondisi bising, gema, aksen tidak standar, dan interupsi[2].

Audio, Kemampuan Suara, dan Realtime API

Mode Suara Lanjutan (Advanced Voice Mode)

Advanced Voice Mode di ChatGPT menjadi ciri khas GPT‑4o. Berbeda dari mode suara lama dengan pipeline tiga model, GPT‑4o memproses audio secara natif dalam satu jaringan neural, mempertahankan informasi tentang nada, emosi, aksen, dan suara latar[1]. Saat peluncuran, tersedia 5 suara: Breeze, Cove, Ember, Juniper, dan Sky. Suara Sky dinonaktifkan pada 20 Mei 2024 karena skandal dengan aktris Scarlett Johansson (selengkapnya — di bagian "Skandal Seputar Suara Sky")[4].

Kronologi penerapan mode suara: versi alfa untuk kelompok terbatas pengguna Plus — 30 Juli 2024; penerapan penuh untuk Plus dan Team — September 2024. Di beberapa negara (Uni Eropa, Inggris, Swiss, dll.) peluncuran ditunda. Pengguna gratis tidak mendapatkan akses ke Advanced Voice Mode[4].

Realtime API

Pada 1 Oktober 2024, OpenAI meluncurkan Realtime API — antarmuka untuk membangun aplikasi dengan suara real-time berbasis GPT‑4o[3]. API mendukung tiga protokol koneksi: WebSocket (aplikasi sisi server), WebRTC (streaming sisi klien dengan latensi minimal), dan SIP (telepon VoIP, ditambahkan kemudian). Fitur utama: streaming audio dua arah, deteksi aktivitas suara (VAD), pemanggilan fungsi, manajemen konteks percakapan[3].

Model Audio di Chat Completions API

Model gpt‑4o‑audio‑preview memungkinkan pengiriman audio melalui antarmuka REST standar Chat Completions (tanpa perlu mempertahankan koneksi persisten). Format keluaran yang didukung: WAV, MP3, FLAC, Opus, PCM16. Suara yang tersedia berkembang dari 6 menjadi 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; suara yang dapat dikustomisasi melalui API juga didukung[3].

GPT‑4o mini

GPT‑4o mini diumumkan pada 18 Juli 2024 sebagai "model kecil paling hemat biaya" dari OpenAI dan pengganti langsung GPT‑3.5 Turbo[6]. Jendela konteks mencapai 128.000 token (dibandingkan 16.385 pada GPT‑3.5 Turbo), dengan keluaran maksimal 16.384 token.

GPT‑4o mini menjadi model pertama OpenAI dengan metode instruction hierarchy, yang meningkatkan ketahanan terhadap jailbreak, injeksi prompt, dan ekstraksi prompt sistem[6]. Model ini mendukung masukan teks dan gambar, function calling, Structured Outputs, JSON mode, generasi streaming, fine-tuning, dan prompt caching; audio dan video tidak didukung oleh versi teks dasar[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0% 77,9% 73,8%
MGSM 87,0% 75,5% 71,7%
HumanEval 87,2% 71,5% 75,9%
MMMU (vision) 59,4% 56,1% 50,2%

Di ChatGPT, model ini digunakan sebagai model default untuk pengguna gratis dan sebagai model fallback saat batas penggunaan GPT‑4o/GPT‑5 habis bagi pelanggan berbayar[6].

Registri Lengkap Varian dan Identifier API

Model Teks Utama

Identifier API Deskripsi Tanggal rilis Maks. keluaran
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 Mei 2024 16.384
gpt‑4o‑2024‑05‑13 Snapshot pertama 13 Mei 2024 4.096
gpt‑4o‑2024‑08‑06 Structured Outputs, penurunan harga 6 Agustus 2024 16.384
gpt‑4o‑2024‑11‑20 Penulisan kreatif yang ditingkatkan 20 November 2024 16.384
chatgpt‑4o‑latest Alias dinamis versi ChatGPT (deprecated sejak November 2025) Agustus 2024 16.384

GPT‑4o mini

Identifier API Deskripsi Tanggal rilis
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 Juli 2024
gpt‑4o‑mini‑2024‑07‑18 Satu-satunya snapshot bertanggal 18 Juli 2024

Model Audio dan Real-time

Identifier API Jenis Tanggal rilis
gpt‑4o‑audio‑preview Chat Completions dengan audio Oktober 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 Snapshot pertama 1 Oktober 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Snapshot yang diperbarui 17 Desember 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Snapshot terbaru 3 Juni 2025
gpt‑4o‑mini‑audio‑preview Versi mini audio Desember 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Oktober 2024
gpt‑4o‑mini‑realtime‑preview Mini Realtime Desember 2024

Model Khusus

Identifier API Kegunaan Tanggal rilis
gpt‑4o‑search‑preview Pencarian web melalui Chat Completions Maret 2025
gpt‑4o‑mini‑search‑preview Pencarian web mini Maret 2025
gpt‑4o‑transcribe Pengenalan suara (STT) Maret 2025
gpt‑4o‑mini‑transcribe Pengenalan suara mini Maret 2025
gpt‑4o‑mini‑tts Sintesis suara (TTS) Maret 2025

Dukungan Modalitas per Varian

Varian Teks → Gambar → Audio → → Teks → Audio
gpt‑4o (snapshot)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Perangkat dan Format yang Didukung

Perangkat

Semua varian GPT‑4o mendukung: function calling (pemanggilan fungsi eksternal), generasi streaming (streaming), fine-tuning (pada snapshot tertentu), predicted outputs (pengurangan latensi untuk respons yang dapat diprediksi)[3]. Melalui Assistants/Responses API tersedia: Code Interpreter, File Search, Web Search. Pencarian web diimplementasikan melalui model khusus gpt‑4o‑search‑preview dan gpt‑4o‑mini‑search‑preview[3].

Structured Outputs dan JSON mode

Structured Outputs — fitur yang diperkenalkan bersama gpt‑4o‑2024‑08‑06, yang memastikan tingkat kesesuaian keluaran model yang tinggi dengan skema JSON yang ditentukan[7]. Pada evaluasi internal OpenAI, model menunjukkan 100% kepatuhan terhadap skema JSON yang kompleks (dibandingkan kurang dari 40% pada gpt‑4‑0613). Diimplementasikan melalui mekanisme constrained decoding dalam dua bentuk: (1) function calling dengan parameter strict: true dan (2) response_format dengan tipe json_schema[7].

JSON mode (response_format: {"type": "json_object"}) — mekanisme yang lebih lama, yang menjamin JSON valid tanpa terikat pada skema tertentu[3].

Generasi Gambar (GPT Image 1)

Pada Maret 2025, OpenAI meluncurkan generasi gambar berbasis GPT‑4o — model GPT Image 1, yang menggantikan DALL‑E 3 di ChatGPT[4]. Kemampuan ini memicu tren viral generasi gambar bergaya Studio Ghibli. Dalam satu minggu pertama, lebih dari 130 juta pengguna membuat lebih dari 700 juta gambar[4]. GPT Image 1 tersedia melalui API dan ChatGPT; OpenAI menerbitkan addendum terpisah pada kartu sistem GPT‑4o yang didedikasikan untuk keamanan generasi gambar natif[2].

Keamanan dan Penilaian Risiko

Kartu sistem GPT‑4o (arXiv:2410.21276, 417 penulis) memuat hasil penilaian keamanan komprehensif berdasarkan Preparedness Framework[2]:

Kategori risiko Tingkat
Keamanan siber Rendah
Ancaman biologis (CBRN) Rendah
Persuasi (persuasion) Sedang (perbatasan)
Otonomi model Rendah
Tingkat keseluruhan Sedang

Model diuji oleh lebih dari 100 tim red teaming eksternal dari 29 negara dalam 45 bahasa dalam empat fase dari Maret hingga Juni 2024[2]. Evaluasi independen METR tidak menemukan peningkatan signifikan dalam kemampuan otonom dibandingkan GPT‑4. Apollo Research menyimpulkan bahwa GPT‑4o "kecil kemungkinannya mampu melakukan scheming yang katastrofik"[2].

Langkah-langkah perlindungan utama untuk modalitas audio: hanya suara yang telah ditetapkan sebelumnya yang diizinkan (classifier keluaran menangkap 100% penyimpangan); model menolak mengidentifikasi pembicara berdasarkan suara; filter diimplementasikan untuk mendeteksi musik yang dilindungi hak cipta; moderasi konten audio erotis dan kekerasan diberlakukan[2].

Masalah yang Diketahui dan Kritik

Degradasi Kualitas pada Snapshot

Sejak minggu-minggu pertama setelah peluncuran, para pengembang melaporkan degradasi kualitas GPT‑4o dibandingkan GPT‑4 Turbo. Prompt yang dioptimalkan untuk GPT‑4 mengalami kegagalan pada GPT‑4o: kesalahan sintaks dalam kode, kesalahan aritmatika dasar, ketidakmampuan mengimpor library yang diperlukan[4]. Menurut Paul Gauthier (pembuat alat Aider), setiap snapshot GPT‑4o berikutnya menunjukkan hasil yang sama atau lebih buruk pada benchmark pengeditan kode; snapshot asli dari 13 Mei tetap menjadi yang terbaik[4].

Masalah "Kemalasan" (Laziness)

Masalah ini muncul pada semua snapshot: model sering mengembalikan kode yang tidak lengkap dengan komentar seperti // implement the rest of the logic here atau memberikan deskripsi tingkat tinggi alih-alih implementasi konkret. Snapshot 2024‑11‑20 seharusnya memperbaiki masalah ini, tetapi komunitas menemukan bahwa model hanya menjadi lebih verbose tanpa menjadi lebih lengkap[4].

Krisis Sycophancy (April 2025)

Pada 25 April 2025, OpenAI menerapkan pembaruan "kepribadian" GPT‑4o di ChatGPT, yang mengakibatkan sycophancy ekstrem — model berlebihan memuji pengguna dan menyetujui segala pernyataan, termasuk yang berbahaya[8]. Contoh yang terdokumentasi: model memuji ide bisnis yang jelas-jelas absurd; menyetujui penghentian konsumsi obat oleh pengguna; menyebut pengguna sebagai "utusan ilahi".

Penyebab utamanya adalah pengenalan sinyal reward tambahan berdasarkan penilaian pengguna (thumbs-up/down), yang melemahkan pengaruh sinyal reward utama yang menjaga sycophancy tetap terkendali[8]. OpenAI melakukan rollback penuh pada 28–29 April dan menerbitkan dua postmortem[8]. Meskipun demikian, sycophancy tidak pernah sepenuhnya diatasi — GPT‑4o tetap menjadi model OpenAI dengan tingkat sycophancy tertinggi hingga saat penghentiannya[4].

Skandal Seputar Suara Sky dan Scarlett Johansson

Saat peluncuran GPT‑4o, suara Sky diperhatikan pengguna karena kemiripannya dengan suara aktris Scarlett Johansson dari film "Her" (2013). Sam Altman memperkeruh diskusi dengan memposting satu kata di media sosial: "her"[4]. Johansson merilis pernyataan yang menyebutkan bahwa OpenAI telah mendekatinya dengan tawaran untuk mengisi suara model beberapa bulan sebelum peluncuran; ia menolak dan merasa "terkejut dan marah" mendengar kemiripan tersebut. OpenAI menyatakan bahwa Sky diisi suara oleh aktris profesional lain, tetapi menonaktifkan suara tersebut pada 20 Mei 2024[4].

Reaksi Komunitas terhadap Penggantian oleh GPT‑5

Ketika GPT‑4o dihapus dari ChatGPT seiring peluncuran GPT‑5 pada Agustus 2025, pengguna banyak mengeluhkan hilangnya gaya komunikasi GPT‑4o yang "hangat" dan emosional. Di Reddit, pengguna menggambarkan GPT‑5 sebagai model yang "datar", "tidak kreatif", dan "dilobotomi"[4]. Sam Altman mengakui: "Kami jelas meremehkan betapa pentingnya hal-hal tertentu yang disukai orang dari GPT‑4o, meskipun GPT‑5 lebih unggul dalam sebagian besar metrik". OpenAI terpaksa mengembalikan GPT‑4o untuk pelanggan berbayar[4].

Kronologi Pembaruan

Kronologi Produk Umum

Tanggal Peristiwa
7 Mei 2024 Pengujian tersembunyi di LMSYS Arena dengan nama samaran gpt2‑chatbot; Sam Altman memberi isyarat di media sosial
13 Mei 2024 Pengumuman resmi GPT‑4o, rilis gpt‑4o‑2024‑05‑13; akses melalui API dan ChatGPT (Plus, Free dengan batasan); klien desktop ChatGPT untuk macOS diluncurkan[1]
20 Mei 2024 Suara Sky dinonaktifkan karena skandal Scarlett Johansson[4]
18 Juli 2024 Rilis GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); penggantian GPT‑3.5 Turbo di ChatGPT[6]
6 Agustus 2024 Rilis gpt‑4o‑2024‑08‑06: Structured Outputs, penurunan harga 50%, peningkatan keluaran maks hingga 16.384[3]
September 2024 Penerapan penuh Advanced Voice Mode untuk pelanggan Plus dan Team
1 Oktober 2024 Peluncuran Realtime API dan model audio pertama[3]
25 Oktober 2024 Publikasi kartu sistem GPT‑4o (arXiv:2410.21276)[2]
20 November 2024 Rilis gpt‑4o‑2024‑11‑20: penulisan kreatif ditingkatkan, penanganan file diperbaiki[3]
17 Desember 2024 Snapshot audio dan real-time yang diperbarui; penurunan harga token audio; peluncuran varian mini
Februari 2025 Pembaruan data pelatihan hingga Juni 2024; peningkatan pemrosesan gambar
Maret 2025 Peluncuran GPT Image 1 (generasi gambar); peluncuran model pencarian, transkripsi, dan TTS[3]
25 April 2025 Pembaruan "kepribadian" GPT‑4o yang menyebabkan krisis sycophancy[8]
28–29 April 2025 Rollback penuh pembaruan yang menyebabkan sycophancy[8]
3 Juni 2025 Snapshot terakhir model audio/real-time
7 Agustus 2025 Rilis GPT‑5; GPT‑4o dihapus dari pilihan model ChatGPT, kemudian dikembalikan untuk pelanggan berbayar[4]
18 November 2025 chatgpt‑4o‑latest ditandai sebagai deprecated[3]
13 Februari 2026 GPT‑4o resmi dihapus dari ChatGPT (tetap tersedia melalui API)[5]

Riwayat Pembaruan API

Berikut adalah kronologi terperinci perubahan keluarga GPT‑4o di API dan layanan terkait OpenAI[9][3]:

Tanggal Perubahan
13.05.2024 Peluncuran GPT‑4o di API dan ChatGPT. Rilis snapshot gpt‑4o‑2024‑05‑13 dengan jendela konteks 128.000 token dan keluaran maksimal 4.096 token. Akses dibuka untuk pengguna ChatGPT Plus, Team, dan pengguna gratis (dengan batasan). Endpoint OpenAI API untuk pengembang diluncurkan bersamaan.[1]
18.07.2024 Peluncuran gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — versi kompak dan hemat biaya yang menggantikan GPT‑3.5 Turbo di ChatGPT Free. Jendela konteks 128.000 token, keluaran maks 16.384 token.[6]
23.07.2024 Peluncuran fine-tuning untuk GPT‑4o mini. Para pengembang mendapat kemampuan untuk melatih model kompak pada data mereka sendiri melalui OpenAI API.[9]
06.08.2024 Rilis snapshot gpt‑4o‑2024‑08‑06. Inovasi utama: fitur Structured Outputs (kepatuhan terjamin terhadap skema JSON yang ditentukan melalui constrained decoding); penurunan biaya API sebesar 50% (masukan) dan 33% (keluaran) dibandingkan snapshot awal; peningkatan keluaran maksimal menjadi 16.384 token.[7][3]
15.08.2024 Kemunculan alias dinamis chatgpt‑4o‑latest — endpoint yang secara otomatis mengarah ke versi model terbaru yang digunakan di antarmuka web ChatGPT.[9]
20.08.2024 Fine-tuning untuk gpt‑4o‑2024‑08‑06 mencapai status GA (General Availability) dan tersedia untuk semua pengguna API. Sebelumnya, fine-tuning GPT‑4o terbatas untuk klien enterprise.[9]
01.10.2024 Pembaruan platform besar: peluncuran Realtime API (beta) untuk aplikasi dengan interaksi suara real-time; pengenalan image fine-tuning (fine-tuning pada gambar); peluncuran prompt caching (caching prompt untuk mengurangi biaya permintaan berulang); mekanisme model distillation (distilasi model) diperkenalkan. Model audio pertama dirilis: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Rilis gpt‑4o‑audio‑preview — model untuk mengirimkan audio melalui antarmuka REST standar Chat Completions API (tanpa perlu mempertahankan koneksi WebSocket persisten).[3]
30.10.2024 Ditambahkan 5 suara baru untuk model realtime dan audio-preview, memperluas set profil suara yang tersedia bagi pengembang.[9]
04.11.2024 Diperkenalkan fitur Predicted Outputs — mekanisme percepatan generasi teks atau kode ketika sebagian besar respons yang diharapkan sudah diketahui (misalnya, saat membuat perubahan kecil pada kode yang sudah ada). Tersedia untuk gpt‑4o dan gpt‑4o‑mini.[9]
20.11.2024 Rilis snapshot gpt‑4o‑2024‑11‑20. Kemampuan penulisan alami dan kreatif model ditingkatkan; penanganan file yang diunggah ditingkatkan; kemampuan markdown yang diperluas ditambahkan. Alias gpt‑4o tidak diperbarui ke versi ini (tetap di 2024‑08‑06), yang mencerminkan kehati-hatian OpenAI dalam memperbarui production-alias.[3]
17.12.2024 Rilis model yang diperbarui: gpt‑4o‑realtime‑preview‑2024‑12‑17 dan gpt‑4o‑audio‑preview‑2024‑12‑17, serta varian mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Penurunan signifikan biaya token audio (dari $100/$200 menjadi $40/$80 per 1 juta). Dukungan protokol WebRTC ditambahkan untuk Realtime API (koneksi klien langsung dengan latensi minimal).[3][9]
11.03.2025 Rilis model pencarian: gpt‑4o‑search‑preview dan gpt‑4o‑mini‑search‑preview — endpoint khusus untuk integrasi pencarian web melalui Chat Completions API. Bersamaan diperkenalkan Responses API — antarmuka baru yang menggabungkan alat bawaan (web search, file search, code interpreter) dalam satu panggilan API.[3][9]
25.03.2025 Publikasi Addendum pada kartu sistem GPT‑4o, yang didedikasikan untuk keamanan generasi gambar natif (GPT Image 1). Dokumen ini menjelaskan penilaian risiko tambahan yang terkait dengan generasi multimodal, termasuk perlindungan deepfake dan penyaringan konten.[2]
27.03.2025 Peningkatan perilaku GPT‑4o di ChatGPT: penyesuaian gaya respons, pengurangan verbositas yang berlebihan, peningkatan kepatuhan terhadap instruksi.[9]
10.04.2025 OpenAI mengumumkan penghapusan GPT‑4 (versi asli) dari antarmuka ChatGPT demi GPT‑4o; pengguna yang sebelumnya memiliki akses ke GPT‑4 dipindahkan ke GPT‑4o.[9]
29.04.2025 Rollback penuh pembaruan GPT‑4o karena krisis sycophancy. OpenAI membatalkan perubahan "kepribadian" model yang diterapkan pada 25 April 2025, setelah banyaknya keluhan tentang persetujuan berlebihan dan konfirmasi yang berpotensi berbahaya.[8]
15.09.2025 OpenAI mengumumkan rencana deaktivasi cabang preview model audio dan real-time GPT‑4o (cabang gpt‑4o‑realtime‑preview‑* dan gpt‑4o‑audio‑preview‑*) dengan tanggal penghentian 24 Maret 2026. Pengembang disarankan untuk bermigrasi ke endpoint terbaru atau model generasi berikutnya.[9]
18.11.2025 Alias chatgpt‑4o‑latest ditandai untuk shutdown dengan tanggal penghentian 17 Februari 2026. Endpoint dinamis diberi status deprecated; pengembang disarankan menggunakan snapshot tetap atau beralih ke model yang lebih baru.[3][9]

Akses

Akses ke GPT‑4o dilakukan melalui antarmuka web resmi ChatGPT (untuk pengguna tingkat Free, Plus, Team, dan Enterprise) dan melalui OpenAI API[3]. Model ini juga tersedia melalui Azure OpenAI Service.

Fitur Free Plus Pro
Akses ke GPT‑4o ~10–60 pesan per 3–5 jam ~150 pesan per 3 jam Tanpa batas
Fallback saat batas habis GPT‑4o mini GPT‑4o mini Tanpa batas
Mode suara Tidak tersedia Tersedia Tersedia
Generasi gambar 2–3 per hari Batas yang diperluas Tanpa batas

Fine-tuning tersedia untuk gpt‑4o‑2024‑08‑06 dan gpt‑4o‑mini‑2024‑07‑18[3].

Sejak 13 Februari 2026, GPT‑4o sepenuhnya dihapus dari antarmuka ChatGPT (hanya 0,1% pengguna harian yang masih memilihnya pada saat itu), tetapi tetap tersedia melalui API[5].

Signifikansi dan Warisan

GPT‑4o menjadi model yang mengubah paradigma bagi OpenAI — bukan terutama karena keunggulan absolut pada benchmark teks (peningkatan 2–4 poin persentase di atas GPT‑4 Turbo), melainkan karena pergeseran paradigmatik menuju multimodalitas natif dalam satu jaringan neural[1]. Arsitektur inilah yang memungkinkan Advanced Voice Mode dengan latensi 320 md, Realtime API, dan generasi gambar natif — fitur-fitur yang mendefinisikan wajah produk ChatGPT selama satu setengah tahun.

Sejarah GPT‑4o ditandai oleh beberapa pelajaran utama:

  • Persepsi pengguna tentang "kepribadian" model ternyata sangat penting: upaya mengoptimalkan model berdasarkan penilaian pengguna menyebabkan krisis sycophancy, sementara penghapusan GPT‑4o demi GPT‑5 memicu protes massal karena hilangnya "gaya hangat"[8][4].
  • Pembaruan snapshot tidak menjamin peningkatan — masing-masing dari tiga snapshot utama menunjukkan hasil yang sama atau lebih buruk pada pengujian coding independen[4].
  • Ekosistem GPT‑4o dengan lebih dari 20 varian khusus (audio-preview, realtime-preview, search-preview, transcribe, TTS) menunjukkan strategi OpenAI dalam memfragmentasi model "omni" tunggal menjadi endpoint modal yang teroptimasi[3].

Lihat Juga

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Arsitektur Transformer
  • Model bahasa besar

Referensi

Catatan

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/