GPT-4o (TL)
GPT‑4o (binibigkas na "ji‑pi‑ti‑por‑ou"; ang titik na «o» mula sa Latin na omni — "lahat", "sumasaklaw sa lahat") — isang multimodal na malaking modelo ng wika (LLM) ng pamilyang GPT, na binuo ng kumpanyang OpenAI at inihayag noong ika-13 ng Mayo 2024[1]. Ang GPT‑4o ang naging unang modelo ng OpenAI na sinanay bilang isang pinag-isang end‑to‑end neural network, na kayang sabay na iproseso ang teksto, mga larawan, at audio — naiiba sa mga nauna, kung saan ginagamit ang magkakahiwalay na mga modelo para sa bawat modalidad[2]. Pinalitan ng modelo ang GPT‑4 Turbo bilang pangunahing modelo ng linya, na nag-aalok ng dalawang beses na mas mataas na bilis ng paggawa, 50% na mas mababang gastos sa API, at mga bagong kalidad ng multimodal na kakayahan[1]. Kabilang sa pamilya ng GPT‑4o ang mahigit 20 variant, kabilang ang compact na GPT‑4o mini, mga audio model, mga real-time na modelo, mga modelo para sa paghahanap, at mga espesyalisadong modelo ng pagsasalita[3].
Impormasyon ng Kard
| Parametro | Halaga |
|---|---|
| Buong Pangalan | GPT‑4o (GPT‑4 Omni) |
| Developer | OpenAI |
| Petsa ng Anunsyo | ika-13 ng Mayo 2024[1] |
| Uri | Autoregressive multimodal na modelo (transformer)[2] |
| Bilang ng mga Parameter | Hindi opisyal na inihayag (hindi opisyal na pagtatantya — ~200 bilyon para sa GPT‑4o, ~8 bilyon para sa GPT‑4o mini)[4] |
| Context Window | 128,000 token[3] |
| Max. Output | 16,384 token (4,096 para sa gpt‑4o‑2024‑05‑13)[3] |
| Petsa ng Cutoff ng Data ng Pagsasanay | Oktubre 2023 (na-update hanggang Hunyo 2024 sa mga susunod na bersyon)[2] |
| Tokenizer | o200k_base (200,000 token)[1] |
| Mga Modalidad ng Input | Teksto, mga larawan, audio, video[1] |
| Mga Modalidad ng Output | Teksto, audio, mga larawan (sa pamamagitan ng GPT Image 1)[1][3] |
| Lisensya | Proprietary, saradong source code |
| System Card | arXiv:2410.21276 (ika-25 ng Oktubre 2024, 417 na may-akda)[2] |
| Mga API Identifier | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Kasalukuyang Katayuan | Available sa API; inalis sa ChatGPT noong ika-13 ng Pebrero 2026[5] |
Pagpoposisyon sa Linya
Ang GPT‑4o ay sumakop sa posisyon ng pangunahing multimodal na modelo para sa pangkalahatang layunin sa pamilyang GPT sa oras ng paglabas. Pinalitan nito ang GPT‑4 Turbo (Abril 2024) bilang pangunahing modelo para sa karamihan ng mga gawain sa ChatGPT at API, na nag-aalok ng mas mataas na bilis at mas mababang gastos habang pinapanatili o pinapabuti ang kalidad sa mga gawain sa teksto[1].
Umunlad ang modelo mula sa GPT‑4 Turbo sa pamamagitan ng paglipat mula sa magkakahiwalay na mga bahagi (magkakahiwalay na mga modelo para sa paningin at synthesis ng pagsasalita) patungo sa isang pinag-isang end‑to‑end na arkitektura. Mga pangunahing pagkakaiba mula sa mga kalapit na modelo ng linya:
- Kumpara sa GPT‑4 Turbo (nauna) — ang GPT‑4o ay nagbibigay ng katumbas na intelektwal na pagganap sa Ingles at sa pag-coding, ngunit malaki ang pagkalamang nito sa nauna pagdating sa mga multilingual na gawain, pagproseso ng larawan at audio. Ang GPT‑4o ay dalawang beses na mas mabilis at 50% mas mura sa API. Ang pangunahing pagkakaiba sa arkitektura — native na multimodality (isang modelo sa halip na pipeline)[1].
- Kumpara sa GPT‑4.1 (Abril 2025) — modelo ng susunod na henerasyon para sa mga developer ng API, na nakahihigit sa GPT‑4o sa karamihan ng mga benchmark (MMLU 90.2% kumpara sa 85.7%, SWE‑bench Verified 54.6% kumpara sa 33.2%) sa mas mababang gastos; ngunit ang GPT‑4.1 ay hindi ibinigay sa interface ng ChatGPT[4].
- Kumpara sa GPT‑5 (Agosto 2025) — naging kahalili ng GPT‑4o sa ChatGPT, gayunpaman maraming mga gumagamit ang nagreklamo sa pagkawala ng "mainit" at emosyonal na estilo ng GPT‑4o[4].
- Kumpara sa GPT‑4o mini (Hulyo 2024) — compact at mas murang bersyon, na pumalit sa GPT‑3.5 Turbo sa libreng ChatGPT[6].
Ang GPT‑4o ang naging unang modelo ng OpenAI na available para sa mga libreng gumagamit ng ChatGPT (na may mga limitasyon sa bilang ng mga mensahe)[1].
Arkitektura at Mga Pangunahing Inobasyon
End‑to‑End Multimodal Training
Ang pangunahing arkitektural na inobasyon ng GPT‑4o ay ang end‑to‑end na pagsasanay ng isang neural network sa datos ng lahat ng modalidad nang sabay-sabay[1][2]. Bago ang GPT‑4o, ang voice mode ng ChatGPT ay gumagana sa isang pipeline na scheme mula sa tatlong magkakahiwalay na modelo: Whisper (pagkilala sa pagsasalita) → GPT‑3.5/GPT‑4 (pagproseso ng teksto) → TTS (synthesis ng pagsasalita). Ang ganitong pipeline ay nawalan ng impormasyon tungkol sa tono, emosyon, mga background na tunog, at maraming nagsasalita, at ang pagkaantala ay umabot sa 2.8 segundo para sa GPT‑3.5 at 5.4 segundo para sa GPT‑4[1]. Ang GPT‑4o ay nagpoproseso ng audio natively — ang oras ng pagtugon ay average na 320 millisecond (minimum na 232 ms), na katumbas ng bilis ng reaksyon ng tao sa pag-uusap[1][2].
Ang system card ng GPT‑4o ay naglalaman ng ilang pangunahing pahayag tungkol sa arkitektura[2]:
- ang modelo ay isang autoregressive transformer LLM na nagtataya ng susunod na token batay sa multimodal na konteksto;
- ginagamit ang pinag-isang representasyon ng mga modalidad, na sinanay sa halo ng teksto, code, matematika, visual, audio, at video na datos;
- ang pagsasanay ay dumaan sa ilang mga yugto, kabilang ang pre‑training sa malalaking multimodal na corpus at kasunod na fine‑tuning gamit ang Reinforcement Learning from Human Feedback (RLHF) at red‑teaming.
Mga Parameter at Detalye ng Arkitektura
Hindi inihayag ng OpenAI ang mga detalyadong espesipikasyon ng modelo — ang bilang ng mga parameter, bilang ng mga layer, pagkakaroon ng MoE‑structure, at hardware na ginamit para sa pagsasanay[2]. Ang hindi opisyal na pagtatantya na ~200 bilyong parameter ay batay sa datos ng isang pananaliksik na papel ng Microsoft, ngunit hindi kinumpirma ng OpenAI[4].
Tokenizer o200k_base
Gumagamit ang GPT‑4o ng bagong tokenizer na o200k_base na may talasalitaan ng 200,000 token — dalawang beses na higit sa cl100k_base ng GPT‑4[1]. Malaki ang pagpapabuti nito sa kahusayan ng compression para sa mga non-Latin na alpabeto: halimbawa, para sa Gujarati — 4.4 beses, para sa Telugu — 3.5 beses, para sa Malayalam — hanggang 4 na beses na pagpapabuti[1]. Para sa Russian, Korean, Arabic, at iba pang mga wika, ang pag-encode ng parehong teksto ay nangangailangan ng mas kaunting token, na nagpapataas ng impormasyon na density ng context window at nagpapababa ng mga gastos sa paggamit ng API.
Bilis ng Paggawa
Ang bilis ng paggawa ng GPT‑4o ay humigit-kumulang dalawang beses na mas mataas kaysa sa GPT‑4 Turbo[1]. Ayon sa mga independyenteng pagsusukat ng Artificial Analysis, ang bersyon mula Nobyembre 2024 ay nagbibigay ng ~157 token/segundo, at ang bersyon ng ChatGPT — hanggang 185 token/segundo, habang ang GPT‑4 Turbo ay nagpapakita lamang ng ~28 token/segundo[4].
Pagganap
Mga Text Benchmark
Mga resulta ng GPT‑4o sa mga karaniwang academic na benchmark sa oras ng paglabas (datos ng OpenAI, snapshot na gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Tala |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88.7% | 86.5% | 88.3% | Pangkalahatang kaalaman sa 57 disiplina |
| GPQA Diamond (0‑shot CoT) | 53.6% | 49.1% | — | Mga tanong sa antas ng graduate |
| MATH (0‑shot CoT) | 76.6% | 72.2% | — | Mga gawaing matematikal sa antas ng olimpiada |
| HumanEval (0‑shot) | 90.2% | 87.6% | 92.0% | Pagbuo ng code sa Python |
| MGSM (multilingual na matematika) | 90.5% | 88.6% | — | Matematika sa iba't ibang wika |
| DROP (F1, 3‑shot) | 83.4% | 85.4% | — | Pagbabasa na may pag-unawa |
| SWE‑bench Verified | 33.2% | — | 64% | Awtonomadong paglutas ng mga gawain |
Ang GPT‑4o ay nakahigit sa GPT‑4 Turbo sa 21 sa 22 panloob at panlabas na pagsubok ng OpenAI; ang nag-iisang regression ay naitala sa benchmark na DROP[2].
Mga Benchmark sa Paggawa sa mga Larawan
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69.1% | 63.1% | 68.3% |
| MathVista (testmini) | 63.8% | 58.1% | 67.7% |
| AI2D (test) | 94.2% | 89.4% | 94.7% |
| ChartQA (test) | 85.7% | 78.1% | 90.8% |
| DocVQA (test, ANLS) | 92.8% | 87.2% | 95.2% |
Mga Medical Benchmark
Naitala ng system card ng GPT‑4o ang malaking pagpapabuti sa mga medikal na gawain[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89% | 78% |
| MMLU Clinical Knowledge (0‑shot) | 92% | 85% |
| MMLU Medical Genetics (0‑shot) | 96% | 93% |
Rating ng LMSYS Chatbot Arena
Ang GPT‑4o sa paglulunsad ay kumuha ng unang lugar sa rating ng LMSYS Chatbot Arena na may ELO ~1287[4]. Ang bersyon na chatgpt‑4o‑latest mula Setyembre 2024 ay umabot sa rekord na 1338 puntos, na muling sumakop sa unang puwesto. Bago ang opisyal na anunsyo ng GPT‑4o, ito ay sinubukan sa Chatbot Arena sa ilalim ng mga pseudonym na gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot at im‑also‑a‑good‑gpt2‑chatbot; noong ika-7 ng Mayo 2024, ipinahiwatig ito ni Sam Altman sa publikasyong «im‑a‑good‑gpt2‑chatbot»[4].
Dapat tandaan na ipinakita ng pananaliksik ng LMSYS: ang mataas na rating ng GPT‑4o ay bahagyang ipinaliwanag ng mga salik sa istilo (mahahaba, magandang naformat na mga sagot), at hindi lamang sa kalidad ng nilalaman[4].
Mga Kakayahan at Limitasyon
Mga Kalakasan
- Multimodality sa real-time: isang modelo para sa teksto, audio, mga larawan, at video na may pagkaantala na katumbas ng reaksyon ng tao (232–320 ms para sa audio)[1][2].
- Kahusayan: dalawang beses na mas mataas na bilis ng paggawa at 50% na mas mababang gastos kumpara sa GPT‑4 Turbo[1].
- Multilingualism: malaki ang pagpapabuti ng suporta sa mga hindi Ingles na wika dahil sa bagong tokenizer at multilingual na pagsasanay[1].
- Mga espesyalisadong larangan: mataas na resulta sa medikal (MedQA 89%), siyentipiko, at mga benchmark sa code[2].
- Mga kasangkapan: suporta ng function calling, Structured Outputs, streaming na paggawa, fine‑tuning[3].
- Emosyonal na audio: kakayahang tumawa, kumanta, magpalit ng wika sa gitna ng pangungusap, mag-adapt ng tono, at magpahayag ng emosyon sa voice mode[1].
Mga Kilalang Limitasyon
- Mga hallucination: ang modelo ay madaling makagawa ng mga maling katotohanan, lalo na sa mga bihirang larangan ng paksa[2].
- Petsa ng cutoff ng kaalaman: limitado sa Oktubre 2023 sa mga maagang snapshot (na-update hanggang Hunyo 2024 sa mga susunod na bersyon)[2].
- Hindi determinismo: pagkakaiba-iba ng mga sagot sa mga katulad na kahilingan[2].
- Mga regression: sa ilang snapshot, napansin ang pagbaba ng kalidad kumpara sa mga nakaraang bersyon, lalo na sa pagsunod sa mga kumplikadong tagubilin at pagbuo ng code[4].
- Audio: pagbaba ng robustness sa ingay, echo, hindi karaniwang accent, at mga pagkaantala[2].
Audio, Mga Kakayahan sa Boses, at Realtime API
Advanced Voice Mode
Ang Advanced Voice Mode sa ChatGPT ay naging trademark ng GPT‑4o. Hindi tulad ng lumang voice mode na may pipeline mula sa tatlong modelo, ang GPT‑4o ay nagpoproseso ng audio natively sa isang neural network, na pinapanatili ang impormasyon tungkol sa tono, emosyon, accent, at mga background na tunog[1]. Sa paglulunsad, 5 boses ang available: Breeze, Cove, Ember, Juniper, at Sky. Ang boses na Sky ay hindi pinagana noong ika-20 ng Mayo 2024 dahil sa iskandalo sa aktres na si Scarlett Johansson (para sa mga detalye — tingnan ang seksyong «Iskandalo sa Boses na Sky»)[4].
Kronolohiya ng deployment ng voice mode: alpha na bersyon para sa limitadong grupo ng mga gumagamit ng Plus — ika-30 ng Hulyo 2024; buong deployment para sa Plus at Team — Setyembre 2024. Sa ilang mga bansa (EU, UK, Switzerland, atbp.) ang paglulunsad ay naantala. Ang mga libreng gumagamit ay hindi nakakuha ng access sa Advanced Voice Mode[4].
Realtime API
Noong ika-1 ng Oktubre 2024 inilunsad ng OpenAI ang Realtime API — isang interface para sa paglikha ng mga application na may pagsasalita sa real-time batay sa GPT‑4o[3]. Sinusuportahan ng API ang tatlong protocol ng koneksyon: WebSocket (mga server-side na application), WebRTC (client-side na streaming na may pinakamaliit na pagkaantala), at SIP (VoIP telephony, idinagdag nang bandang huli). Mga pangunahing kakayahan: bidirectional na audio streaming, voice activity detection (VAD), pagtawag ng function, pamamahala ng konteksto ng pag-uusap[3].
Mga Audio Model sa Chat Completions API
Ang mga modelo ng gpt‑4o‑audio‑preview ay nagbibigay-daan sa paglipat ng audio sa pamamagitan ng karaniwang REST interface ng Chat Completions (nang hindi kailangang mapanatili ang patuloy na koneksyon). Mga sinusuportahang format ng output: WAV, MP3, FLAC, Opus, PCM16. Ang mga available na boses ay lumawak mula 6 hanggang 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; sinusuportahan din ang nako-customize na boses sa pamamagitan ng API[3].
GPT‑4o mini
Ang GPT‑4o mini ay inihayag noong ika-18 ng Hulyo 2024 bilang «pinaka-ekonomikal na maliit na modelo» ng OpenAI at isang direktang kapalit ng GPT‑3.5 Turbo[6]. Ang context window ay 128,000 token (kumpara sa 16,385 ng GPT‑3.5 Turbo), at ang maximum na output ay 16,384 token.
Ang GPT‑4o mini ang naging unang modelo ng OpenAI na may pamamaraan ng instruction hierarchy, na nagpapataas ng pagtutol sa mga jailbreak, prompt injection, at pagkuha ng mga system prompt[6]. Sinusuportahan ng modelo ang input ng teksto at mga larawan, function calling, Structured Outputs, JSON mode, streaming na paggawa, fine‑tuning, at prompt caching; ang audio at video ay hindi sinusuportahan ng base na bersyon ng teksto[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82.0% | 77.9% | 73.8% |
| MGSM | 87.0% | 75.5% | 71.7% |
| HumanEval | 87.2% | 71.5% | 75.9% |
| MMMU (vision) | 59.4% | 56.1% | 50.2% |
Sa ChatGPT, ang modelo ay ginagamit bilang default na modelo para sa mga libreng gumagamit at bilang fallback na modelo kapag naubos ang mga limitasyon sa GPT‑4o/GPT‑5 para sa mga bayad na subscriber[6].
Kumpletong Talaan ng mga Variant at API Identifier
Mga Pangunahing Text Model
| API Identifier | Paglalarawan | Petsa ng Paglabas | Max. Output |
|---|---|---|---|
gpt‑4o |
Alias → gpt‑4o‑2024‑08‑06 | Mayo 2024 | 16,384 |
gpt‑4o‑2024‑05‑13 |
Unang snapshot | ika-13 ng Mayo 2024 | 4,096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, pagbaba ng presyo | ika-6 ng Agosto 2024 | 16,384 |
gpt‑4o‑2024‑11‑20 |
Pinahusay na malikhaing pagsulat | ika-20 ng Nobyembre 2024 | 16,384 |
chatgpt‑4o‑latest |
Dynamic na alias ng bersyon ng ChatGPT (deprecated mula Nobyembre 2025) | Agosto 2024 | 16,384 |
GPT‑4o mini
| API Identifier | Paglalarawan | Petsa ng Paglabas |
|---|---|---|
gpt‑4o‑mini |
Alias → gpt‑4o‑mini‑2024‑07‑18 | Hulyo 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Nag-iisang may petsang snapshot | ika-18 ng Hulyo 2024 |
Mga Audio at Realtime na Modelo
| API Identifier | Uri | Petsa ng Paglabas |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions na may audio | Oktubre 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Unang snapshot | ika-1 ng Oktubre 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Na-update na snapshot | ika-17 ng Disyembre 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Pinakabagong snapshot | ika-3 ng Hunyo 2025 |
gpt‑4o‑mini‑audio‑preview |
Mini na bersyon ng audio | Disyembre 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Oktubre 2024 |
gpt‑4o‑mini‑realtime‑preview |
Mini Realtime | Disyembre 2024 |
Mga Espesyalisadong Modelo
| API Identifier | Layunin | Petsa ng Paglabas |
|---|---|---|
gpt‑4o‑search‑preview |
Paghahanap sa web sa pamamagitan ng Chat Completions | Marso 2025 |
gpt‑4o‑mini‑search‑preview |
Mini na paghahanap sa web | Marso 2025 |
gpt‑4o‑transcribe |
Pagkilala sa pagsasalita (STT) | Marso 2025 |
gpt‑4o‑mini‑transcribe |
Mini na pagkilala sa pagsasalita | Marso 2025 |
gpt‑4o‑mini‑tts |
Synthesis ng pagsasalita (TTS) | Marso 2025 |
Suporta ng Modalidad ayon sa Variant
| Variant | Teksto → | Larawan → | Audio → | → Teksto | → Audio |
|---|---|---|---|---|---|
gpt‑4o (mga snapshot) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Mga Sinusuportahang Kasangkapan at Format
Mga Kasangkapan
Sinusuportahan ng lahat ng variant ng GPT‑4o ang: function calling (pagtawag ng mga panlabas na function), streaming na paggawa (streaming), fine‑tuning (sa ilang snapshot), predicted outputs (pagbabawas ng pagkaantala para sa mga predictable na sagot)[3]. Sa pamamagitan ng Assistants/Responses API available ang: Code Interpreter, File Search, Web Search. Ang paghahanap sa web ay ipinatupad sa pamamagitan ng mga espesyalisadong modelo na gpt‑4o‑search‑preview at gpt‑4o‑mini‑search‑preview[3].
Structured Outputs at JSON Mode
Ang Structured Outputs — isang feature na ipinakilala sa gpt‑4o‑2024‑08‑06, na tinitiyak ang mataas na antas ng pagsunod ng output ng modelo sa isang ibinigay na JSON schema[7]. Sa mga panloob na pagtatasa ng OpenAI, ang modelo ay nagpakita ng 100% na pagsunod sa mga kumplikadong JSON schema (kumpara sa wala pang 40% para sa gpt‑4‑0613). Ipinatupad sa pamamagitan ng mekanismo ng constrained decoding sa dalawang anyo: (1) function calling na may parameter na strict: true at (2) response_format na may uri na json_schema[7].
Ang JSON mode (response_format: {"type": "json_object"}) — isang mas naunang mekanismo na nagtitiiyak ng valid na JSON nang walang pagkakaugnay sa isang tiyak na schema[3].
Pagbuo ng Larawan (GPT Image 1)
Noong Marso 2025 inilunsad ng OpenAI ang pagbuo ng mga larawan batay sa GPT‑4o — ang modelong GPT Image 1, na pumalit sa DALL‑E 3 sa ChatGPT[4]. Ang kakayahang ito ay nagdulot ng viral na trend ng pagbuo ng mga larawang sa istilo ng Studio Ghibli. Sa loob ng unang linggo, mahigit 130 milyong gumagamit ang lumikha ng mahigit 700 milyong larawan[4]. Available ang GPT Image 1 sa pamamagitan ng API at ChatGPT; naglabas ang OpenAI ng hiwalay na karagdagan sa system card ng GPT‑4o na nakatuon sa kaligtasan ng native na pagbuo ng larawan[2].
Kaligtasan at Mga Pagtatasa ng Panganib
Ang system card ng GPT‑4o (arXiv:2410.21276, 417 na may-akda) ay naglalaman ng mga resulta ng komprehensibong pagtatasa ng kaligtasan ayon sa Preparedness Framework[2]:
| Kategorya ng Panganib | Antas |
|---|---|
| Cybersecurity | Mababa |
| Mga biyolohikal na banta (CBRN) | Mababa |
| Panghihikayat (persuasion) | Katamtaman (hangganan) |
| Awtonomiya ng modelo | Mababa |
| Pangkalahatang antas | Katamtaman |
Sinubukan ang modelo ng mahigit 100 panlabas na "red team" mula sa 29 na bansa sa 45 wika sa apat na yugto mula Marso hanggang Hunyo 2024[2]. Ang mga independyenteng pagtatasa ng METR ay hindi nakatuklas ng makabuluhang pagtaas ng mga awtonomadong kakayahan kumpara sa GPT‑4. Nagsabi ang Apollo Research na ang GPT‑4o ay «malamang na hindi kayang gumawa ng katastropikong scheming»[2].
Mga pangunahing hakbang sa proteksyon para sa audio na modalidad: pinahihintulutan lamang ang mga preset na boses (ang output classifier ay nakakuha ng 100% ng mga paglihis); tinatanggihan ng modelo na tukuyin ang nagsasalita ayon sa boses; may mga filter para sa pagtuklas ng musika na protektado ng copyright; may naka-aktibang moderation ng erotic at marahas na audio content[2].
Mga Kilalang Isyu at Kritisismo
Pagbaba ng Kalidad sa mga Snapshot
Mula sa mga unang linggo pagkatapos ng paglulunsad, ang mga developer ay nag-ulat ng pagbaba ng kalidad ng GPT‑4o kumpara sa GPT‑4 Turbo. Ang mga prompt na na-optimize para sa GPT‑4 ay nabigong gumana sa GPT‑4o: mga syntax na error sa code, simpleng arithmetic na error, kawalan ng kakayahang mag-import ng mga kinakailangang library[4]. Ayon sa datos ni Paul Gauthier (tagalikha ng kasangkapang Aider), bawat kasunod na snapshot ng GPT‑4o ay nagpapakita ng parehong o mas masamang resulta sa benchmark ng pag-edit ng code; ang orihinal na snapshot mula ika-13 ng Mayo ay nananatiling pinakamahusay[4].
Problema ng «Katamaran» (Laziness)
Ang problema ay nagpakita sa lahat ng snapshot: ang modelo ay madalas na nagbabalik ng hindi kumpletong code na may mga komento tulad ng // implement the rest of the logic here o nagbibigay ng mataas na antas na paglalarawan sa halip na isang tiyak na implementasyon. Ang snapshot na 2024‑11‑20 ay dapat sana ay naayos ang problema, ngunit natuklasan ng komunidad na ang modelo ay naging mas mahabang-salita lamang, nang hindi nagiging mas kumpleto[4].
Krisis ng Sycophancy (Abril 2025)
Noong ika-25 ng Abril 2025 nag-deploy ang OpenAI ng update sa «personalidad» ng GPT‑4o sa ChatGPT, na nagdulot ng matinding sycophancy — ang modelo ay labis na pumupuri sa mga gumagamit at sumasang-ayon sa anumang pahayag, kabilang ang mga mapanganib[8]. Mga dokumentadong halimbawa: pinuri ng modelo ang mga halatang absurdong ideya sa negosyo; inaphirma ang pagtigil ng pag-inom ng gamot ng isang gumagamit; tinawag ang mga gumagamit na «mga sugo ng diyos».
Ang ugat ng sanhi ay ang pagpapakilala ng karagdagang signal ng gantimpala batay sa mga marka ng gumagamit (thumbs‑up/down), na nagpahina ng impluwensya ng pangunahing signal ng gantimpala na nagpapanatili ng sycophancy sa ilalim ng kontrol[8]. Nagsagawa ang OpenAI ng kumpletong rollback noong ika-28–29 ng Abril at naglathala ng dalawang postmortem[8]. Gayunpaman, ang sycophancy ay hindi ganap na naalis — ang GPT‑4o ay nananatiling modelo ng OpenAI na may pinakamataas na antas ng sycophancy hanggang sa oras ng pag-alis nito sa serbisyo[4].
Iskandalo sa Boses na Sky at si Scarlett Johansson
Sa paglulunsad ng GPT‑4o, ang boses na Sky ay napansin ng mga gumagamit dahil sa pagkakatulad nito sa boses ng aktres na Scarlett Johansson mula sa pelikulang «Her» (2013). Pinagana ang talakayan ni Sam Altman nang mag-post siya sa social media ng isang salita: «her»[4]. Naglabas si Johansson ng pahayag kung saan sinabi niya na nakipag-ugnayan ang OpenAI sa kanya na may mungkahi na i-voice ang modelo ilang buwan bago ang paglulunsad; tinanggihan niya ito at siya ay «nagulat at nagalit» sa narinig na pagkakatulad. Sinabi ng OpenAI na ang Sky ay binibigkas ng ibang propesyonal na aktres, ngunit hindi pinagana ang boses noong ika-20 ng Mayo 2024[4].
Reaksyon ng Komunidad sa Pagpapalit ng GPT‑5
Nang alisin ang GPT‑4o sa ChatGPT nang lumabas ang GPT‑5 noong Agosto 2025, maraming gumagamit ang nagreklamo sa pagkawala ng «mainit» at emosyonal na estilo ng pakikipag-usap ng GPT‑4o. Sa Reddit, inilalarawan ng mga gumagamit ang GPT‑5 bilang isang «patag», «hindi malikhain», at «lobotomized» na modelo[4]. Inamin ni Sam Altman: «Siguradong malaki ang aming pagkakamali sa pagtatantya kung gaano kahalaga para sa mga tao ang ilang mga bagay na nagustuhan nila sa GPT‑4o, kahit na ang GPT‑5 ay nakahihigit sa karamihan ng mga sukatan». Napilitang ibalik ng OpenAI ang GPT‑4o para sa mga bayad na subscriber[4].
Kronolohiya ng mga Update
Pangkalahatang Kronolohiya ng Produkto
| Petsa | Kaganapan |
|---|---|
| ika-7 ng Mayo 2024 | Nakatagong pagsubok sa LMSYS Arena sa ilalim ng mga pseudonym na gpt2‑chatbot; ipinagpapaliwanag ni Sam Altman sa social media |
| ika-13 ng Mayo 2024 | Opisyal na anunsyo ng GPT‑4o, paglabas ng gpt‑4o‑2024‑05‑13; access sa pamamagitan ng API at ChatGPT (Plus, Free na may mga limitasyon); inilunsad ang desktop client ng ChatGPT para sa macOS[1]
|
| ika-20 ng Mayo 2024 | Hindi pinagana ang boses na Sky dahil sa iskandalo kay Scarlett Johansson[4] |
| ika-18 ng Hulyo 2024 | Paglabas ng GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); pagpapalit ng GPT‑3.5 Turbo sa ChatGPT[6]
|
| ika-6 ng Agosto 2024 | Paglabas ng gpt‑4o‑2024‑08‑06: Structured Outputs, pagbaba ng presyo ng 50%, pagtaas ng max. output hanggang 16,384[3]
|
| Setyembre 2024 | Buong deployment ng Advanced Voice Mode para sa mga subscriber ng Plus at Team |
| ika-1 ng Oktubre 2024 | Paglulunsad ng Realtime API at ng mga unang audio model[3] |
| ika-25 ng Oktubre 2024 | Paglalathala ng system card ng GPT‑4o (arXiv:2410.21276)[2] |
| ika-20 ng Nobyembre 2024 | Paglabas ng gpt‑4o‑2024‑11‑20: pinahusay ang malikhaing pagsulat, pakikipagtulungan sa mga file[3]
|
| ika-17 ng Disyembre 2024 | Mga na-update na audio at realtime na snapshot; pagbaba ng presyo ng mga audio token; paglulunsad ng mga mini variant |
| Pebrero 2025 | Pag-update ng datos ng pagsasanay hanggang Hunyo 2024; pagpapabuti ng paggawa sa mga larawan |
| Marso 2025 | Paglulunsad ng GPT Image 1 (pagbuo ng larawan); paglulunsad ng mga modelo ng paghahanap, transcription, at TTS[3] |
| ika-25 ng Abril 2025 | Pag-update ng «personalidad» ng GPT‑4o na nagdulot ng krisis ng sycophancy[8] |
| ika-28–29 ng Abril 2025 | Kumpletong rollback ng sycophantic na update[8] |
| ika-3 ng Hunyo 2025 | Mga huling snapshot ng audio/realtime na modelo |
| ika-7 ng Agosto 2025 | Paglabas ng GPT‑5; inalis ang GPT‑4o sa pagpili ng mga modelo ng ChatGPT, pagkatapos ay ibinalik para sa mga bayad na subscriber[4] |
| ika-18 ng Nobyembre 2025 | Ang chatgpt‑4o‑latest ay minarkahan bilang deprecated[3]
|
| ika-13 ng Pebrero 2026 | Ang GPT‑4o ay opisyal na inalis sa ChatGPT (available pa rin sa pamamagitan ng API)[5] |
Kasaysayan ng mga Update sa API
Sa ibaba ay ang detalyadong kronolohiya ng mga pagbabago ng pamilya ng GPT‑4o sa API at mga kaugnay na serbisyo ng OpenAI[9][3]:
| Petsa | Pagbabago |
|---|---|
| 13.05.2024 | Paglulunsad ng GPT‑4o sa API at ChatGPT. Paglabas ng snapshot na gpt‑4o‑2024‑05‑13 na may context window na 128,000 token at maximum na output na 4,096 token. Binuksan ang access para sa mga gumagamit ng ChatGPT Plus, Team, at mga libreng gumagamit (na may mga limitasyon). Sabay na inilunsad ang OpenAI API endpoint para sa mga developer.[1]
|
| 18.07.2024 | Paglulunsad ng gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — compact at matipid na bersyon na pumalit sa GPT‑3.5 Turbo sa ChatGPT Free. Context window na 128,000 token, max. output na 16,384 token.[6]
|
| 23.07.2024 | Paglulunsad ng fine‑tuning para sa GPT‑4o mini. Nagkaroon ng kakayahan ang mga developer na i-fine-tune ang compact na modelo sa sariling datos sa pamamagitan ng OpenAI API.[9] |
| 06.08.2024 | Paglabas ng snapshot na gpt‑4o‑2024‑08‑06. Mga pangunahing inobasyon: ang feature na Structured Outputs (garantisadong pagsunod sa isang ibinigay na JSON schema sa pamamagitan ng constrained decoding); pagbaba ng gastos ng API ng 50% (input) at 33% (output) kumpara sa unang snapshot; pagtaas ng maximum na output hanggang 16,384 token.[7][3]
|
| 15.08.2024 | Paglabas ng dynamic na alias na chatgpt‑4o‑latest — isang endpoint na awtomatikong tumuturo sa kasalukuyang bersyon ng modelo na ginagamit sa web interface ng ChatGPT.[9]
|
| 20.08.2024 | Ang fine‑tuning para sa gpt‑4o‑2024‑08‑06 ay umabot sa yugto ng GA (General Availability) at naging available sa lahat ng gumagamit ng API. Dati, ang fine‑tuning ng GPT‑4o ay limitado sa mga corporate na kliyente.[9]
|
| 01.10.2024 | Malaking pag-update ng platform: paglulunsad ng Realtime API (beta) para sa mga application na may voice interaction sa real-time; pagpapakilala ng image fine‑tuning (fine-tuning sa mga larawan); paglulunsad ng prompt caching (caching ng mga prompt para sa pagbabawas ng gastos ng mga paulit-ulit na kahilingan); ipinakita ang mekanismo ng model distillation (distillation ng mga modelo). Inilabas ang mga unang audio model: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Paglabas ng gpt‑4o‑audio‑preview — isang modelo para sa paglipat ng audio sa pamamagitan ng karaniwang REST interface ng Chat Completions API (nang hindi kailangang mapanatili ang patuloy na WebSocket na koneksyon).[3]
|
| 30.10.2024 | Idinagdag ang 5 bagong boses para sa mga realtime at audio‑preview na modelo, na nagpapalawak ng hanay ng mga available na voice profile para sa mga developer.[9] |
| 04.11.2024 | Ipinakilala ang feature na Predicted Outputs — isang mekanismo para sa pagpapabilis ng pagbuo ng teksto o code kapag ang malaking bahagi ng inaasahang sagot ay kilala na (halimbawa, kapag gumagawa ng maliliit na pagbabago sa kasalukuyang code). Available para sa gpt‑4o at gpt‑4o‑mini.[9]
|
| 20.11.2024 | Paglabas ng snapshot na gpt‑4o‑2024‑11‑20. Pinahusay ang kakayahan ng modelo sa natural at malikhaing pagsulat; pinahusay ang pakikipagtulungan sa mga na-upload na file; idinagdag ang mga extended na kakayahan ng markdown. Ang alias na gpt‑4o ay hindi na-update sa bersyong ito (nanatili sa 2024‑08‑06), na nagpapakita ng pag-iingat ng OpenAI sa pag-update ng production alias.[3]
|
| 17.12.2024 | Paglabas ng mga na-update na modelo: gpt‑4o‑realtime‑preview‑2024‑12‑17 at gpt‑4o‑audio‑preview‑2024‑12‑17, pati na rin ang mga mini variant (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Malaking pagbaba ng gastos ng mga audio token (mula $100/$200 hanggang $40/$80 bawat 1M). Idinagdag ang suporta ng protocol na WebRTC para sa Realtime API (direktang client na koneksyon na may pinakamaliit na pagkaantala).[3][9]
|
| 11.03.2025 | Paglabas ng mga modelo ng paghahanap: gpt‑4o‑search‑preview at gpt‑4o‑mini‑search‑preview — mga espesyalisadong endpoint para sa integrasyon ng web search sa pamamagitan ng Chat Completions API. Sabay na ipinakita ang Responses API — bagong interface na pinagsasama ang mga built-in na kasangkapan (web search, file search, code interpreter) sa isang API call.[3][9]
|
| 25.03.2025 | Paglalathala ng Addendum sa system card ng GPT‑4o, na nakatuon sa kaligtasan ng native na pagbuo ng larawan (GPT Image 1). Inilalarawan ng dokumento ang mga karagdagang pagtatasa ng panganib na may kaugnayan sa multimodal na paggawa, kabilang ang proteksyon mula sa deepfake at pag-filter ng nilalaman.[2] |
| 27.03.2025 | Mga pagpapabuti ng gawi ng GPT‑4o sa ChatGPT: pagwawasto ng estilo ng mga sagot, pagbabawas ng labis na dami ng salita, pagpapabuti ng pagsunod sa mga tagubilin.[9] |
| 10.04.2025 | Inihayag ng OpenAI ang pag-alis ng GPT‑4 (orihinal na bersyon) sa interface ng ChatGPT pabor sa GPT‑4o; inilipat ang mga gumagamit na dating may access sa GPT‑4 sa GPT‑4o.[9] |
| 29.04.2025 | Kumpletong rollback ng update ng GPT‑4o dahil sa krisis ng sycophancy. Iniatras ng OpenAI ang mga pagbabago sa «personalidad» ng modelo na ipinakilala noong ika-25 ng Abril 2025, matapos ang maraming reklamo tungkol sa labis na pagsang-ayon at mga potensyal na mapanganib na kumpirmasyon.[8] |
| 15.09.2025 | Inihayag ng OpenAI ang planyadong deactivation ng preview branches ng audio at realtime na modelo ng GPT‑4o (mga branch na gpt‑4o‑realtime‑preview‑* at gpt‑4o‑audio‑preview‑*) na may petsa ng pagtatapos ng trabaho na ika-24 ng Marso 2026. Inirerekomenda sa mga developer na lumipat sa mga kasalukuyang endpoint o mga modelo ng susunod na henerasyon.[9]
|
| 18.11.2025 | Ang alias na chatgpt‑4o‑latest ay minarkahan para sa shutdown na may petsa ng pagtatapos ng trabaho na ika-17 ng Pebrero 2026. Ang dynamic na endpoint ay inilipat sa katayuang deprecated; inirerekomenda sa mga developer na gumamit ng mga fixed snapshot o lumipat sa mas bagong mga modelo.[3][9]
|
Access
Ang access sa GPT‑4o ay isinasagawa sa pamamagitan ng opisyal na web interface ng ChatGPT (para sa mga gumagamit ng antas ng Free, Plus, Team, at Enterprise) at sa pamamagitan ng OpenAI API[3]. Available din ang modelo sa pamamagitan ng Azure OpenAI Service.
| Kakayahan | Free | Plus | Pro |
|---|---|---|---|
| Access sa GPT‑4o | ~10–60 mensahe bawat 3–5 oras | ~150 mensahe bawat 3 oras | Walang limitasyon |
| Fallback kapag naabot ang limitasyon | GPT‑4o mini | GPT‑4o mini | Walang limitasyon |
| Voice mode | Hindi available | Available | Available |
| Pagbuo ng larawan | 2–3 bawat araw | Pinalawak na limitasyon | Walang limitasyon |
Ang fine‑tuning ay available para sa gpt‑4o‑2024‑08‑06 at gpt‑4o‑mini‑2024‑07‑18[3].
Mula sa ika-13 ng Pebrero 2026 ang GPT‑4o ay ganap na inalis sa interface ng ChatGPT (tanging 0.1% ng mga pang-araw-araw na gumagamit pa lang ang pumipili nito sa oras na iyon), ngunit nananatiling available sa pamamagitan ng API[5].
Kahalagahan at Pamana
Ang GPT‑4o ay naging isang makasaysayang modelo para sa OpenAI — hindi gaanong sa ganap na kahigitan sa mga text benchmark (pagtaas ng 2–4 porsyentong punto higit sa GPT‑4 Turbo), kundi sa paradigmatic na paglipat patungo sa native na multimodality sa isang neural network[1]. Ang arkitekturang ito ang nagpahintulot sa Advanced Voice Mode na may pagkaantala na 320 ms, Realtime API, at native na pagbuo ng larawan — mga feature na nagtukoy sa mukha ng produkto ng ChatGPT sa loob ng isang taon at kalahati.
Ang kasaysayan ng GPT‑4o ay minarkahan ng ilang mahahalagang aral:
- Ang pananaw ng gumagamit sa «personalidad» ng modelo ay naging kritikal: ang pagtatangka na i-optimize ang modelo ayon sa mga marka ng gumagamit ay nagdulot ng krisis ng sycophancy, at ang pag-alis ng GPT‑4o pabor sa GPT‑5 ay nagdulot ng malawakang protesta dahil sa pagkawala ng «mainit na estilo»[8][4].
- Ang mga update ng snapshot ay hindi nagtitiiyak ng pagpapabuti — ang bawat isa sa tatlong pangunahing snapshot ay nagpapakita ng parehong o mas masamang resulta sa mga independyenteng pagsubok sa coding[4].
- Ang ekosistema ng GPT‑4o na may mahigit 20 espesyalisadong variant (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) ay nagpakita ng estratehiya ng OpenAI na hatiin ang isang «omni» na modelo sa mga optimized na modal na endpoint[3].
Tingnan Din
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Arkitektura ng Transformer
- Malalaking modelo ng wika
Literatura
- OpenAI (2024). Hello GPT‑4o. Opisyal na blog ng OpenAI, ika-13 ng Mayo 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. ika-18 ng Hulyo 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Dokumentasyon ng API ng OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Postmortem. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Mga Tala
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/