GPT-4o (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (발음: "지-피-티-포-오"; "o"는 라틴어 omni — "모든", "전체를 아우르는"에서 유래) — OpenAI가 개발하여 2024년 5월 13일에 공개한[1] GPT 계열의 멀티모달 대형 언어 모델(LLM)이다. GPT‑4o는 텍스트, 이미지, 오디오를 동시에 처리할 수 있는 단일 end‑to‑end 신경망으로 훈련된 OpenAI 최초의 모델로, 각 모달리티마다 별도의 모델을 사용했던 이전 세대와 구별된다[2]. 이 모델은 GPT‑4 Turbo를 플래그십 모델로 대체하며, 생성 속도를 두 배 높이고 API 비용을 50% 절감함과 동시에 질적으로 새로운 멀티모달 기능을 제공한다[1]. GPT‑4o 계열에는 소형 GPT‑4o mini, 오디오 모델, 실시간 모델, 검색 모델, 특수 음성 모델 등 20종 이상의 변형이 포함된다[3].

정보 카드

항목 내용
정식 명칭 GPT‑4o (GPT‑4 Omni)
개발사 OpenAI
발표일 2024년 5월 13일[1]
유형 자기회귀 멀티모달 모델 (트랜스포머)[2]
매개변수 수 공식 미공개 (비공식 추산 — GPT‑4o 약 2,000억, GPT‑4o mini 약 80억)[4]
컨텍스트 윈도우 128,000 토큰[3]
최대 출력 16,384 토큰 (gpt‑4o‑2024‑05‑13은 4,096)[3]
학습 데이터 컷오프 2023년 10월 (이후 버전에서 2024년 6월로 업데이트)[2]
토크나이저 o200k_base (200,000 토큰)[1]
입력 모달리티 텍스트, 이미지, 오디오, 비디오[1]
출력 모달리티 텍스트, 오디오, 이미지 (GPT Image 1을 통해)[1][3]
라이선스 독점적, 비공개 소스
시스템 카드 arXiv:2410.21276 (2024년 10월 25일, 저자 417명)[2]
API 식별자 gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
현재 상태 API에서 이용 가능; 2026년 2월 13일 ChatGPT에서 종료[5]

제품 라인업 내 포지셔닝

GPT‑4o는 출시 당시 GPT 계열에서 범용 플래그십 멀티모달 모델의 위치를 차지했다. 텍스트 작업에서의 품질을 유지하거나 향상시키면서 더 높은 속도와 낮은 비용을 제공하며, ChatGPT 및 API에서 대부분의 작업을 위한 주요 모델로 GPT‑4 Turbo(2024년 4월)를 대체했다[1].

이 모델은 시각 및 음성 합성을 위한 별도 모델로 이루어진 분리된 구성 요소에서 단일 end‑to‑end 아키텍처로 전환하는 방식으로 GPT‑4 Turbo로부터 발전했다. 라인업 내 인접 모델들과의 주요 차이점:

  • GPT‑4 Turbo(전작) 대비 — GPT‑4o는 영어 및 코딩에서 유사한 지적 성능을 제공하지만, 다국어 작업, 이미지 및 오디오 처리에서 전작을 크게 능가한다. GPT‑4o는 두 배 빠르고 API 비용이 50% 저렴하다. 핵심적인 아키텍처 차이는 네이티브 멀티모달리티(파이프라인 대신 단일 모델)이다[1].
  • GPT‑4.1(2025년 4월) 대비 — API 개발자를 위한 차세대 모델로, 대부분의 벤치마크에서 GPT‑4o를 능가한다(MMLU 90.2% 대 85.7%, SWE‑bench Verified 54.6% 대 33.2%). 비용도 더 낮지만, ChatGPT 인터페이스에서는 제공되지 않았다[4].
  • GPT‑5(2025년 8월) 대비 — ChatGPT에서 GPT‑4o의 후계자가 되었으나, 사용자들은 GPT‑4o의 "따뜻하고" 감성적인 스타일이 사라졌다고 대규모로 불만을 제기했다[4].
  • GPT‑4o mini(2024년 7월) 대비 — 무료 ChatGPT에서 GPT‑3.5 Turbo를 대체한 소형의 훨씬 저렴한 버전이다[6].

GPT‑4o는 ChatGPT 무료 사용자에게 제공된 OpenAI 최초의 모델이다(메시지 수 제한 있음)[1].

아키텍처 및 주요 혁신

완전 멀티모달 학습

GPT‑4o의 주요 아키텍처 혁신은 모든 모달리티의 데이터를 동시에 사용하여 단일 신경망을 end‑to‑end로 훈련하는 것이다[1][2]. GPT‑4o 이전에는 ChatGPT의 음성 모드가 세 개의 별도 모델로 구성된 파이프라인 방식으로 작동했다: Whisper(음성 인식) → GPT‑3.5/GPT‑4(텍스트 처리) → TTS(음성 합성). 이러한 파이프라인은 음조, 감정, 배경 소음, 여러 화자에 대한 정보를 손실했으며, 지연 시간은 GPT‑3.5의 경우 2.8초, GPT‑4의 경우 5.4초에 달했다[1]. GPT‑4o는 오디오를 네이티브로 처리하며 응답 시간은 평균 320밀리초(최소 232ms)로, 대화에서의 인간 반응 속도와 비슷하다[1][2].

GPT‑4o 시스템 카드는 아키텍처에 관한 몇 가지 근본적인 주장을 담고 있다[2]:

  • 모델은 멀티모달 컨텍스트를 기반으로 다음 토큰을 예측하는 자기회귀 트랜스포머 LLM이다;
  • 텍스트, 코드, 수학, 시각, 오디오, 비디오 데이터의 혼합으로 훈련된 통합 모달리티 표현이 사용된다;
  • 학습은 대규모 멀티모달 코퍼스에 대한 pre‑training과 Reinforcement Learning from Human Feedback(RLHF) 및 red‑teaming을 활용한 후속 fine‑tuning을 포함한 여러 단계로 진행되었다.

매개변수 및 아키텍처 세부 사항

OpenAI는 매개변수 수, 레이어 수, MoE 구조 유무, 학습에 사용된 하드웨어 등 모델의 상세 사양을 공개하지 않았다[2]. 약 2,000억 매개변수라는 비공식 추산은 Microsoft 연구 논문의 데이터를 기반으로 하지만 OpenAI에 의해 확인되지 않았다[4].

토크나이저 o200k_base

GPT‑4o는 200,000개 토큰의 어휘를 갖는 새로운 토크나이저 o200k_base를 사용한다 — GPT‑4의 cl100k_base보다 두 배 많다[1]. 이는 비라틴 문자 체계에 대한 압축 효율을 크게 향상시켰다: 예를 들어 구자라트어는 4.4배, 텔루구어는 3.5배, 말라얄람어는 최대 4배 개선되었다[1]. 러시아어, 한국어, 아랍어 등 다른 언어의 경우에도 동일한 텍스트를 인코딩하는 데 필요한 토큰 수가 크게 줄어들어, 컨텍스트 윈도우의 정보 밀도가 높아지고 API 사용 비용이 절감된다.

생성 속도

GPT‑4o의 생성 속도는 GPT‑4 Turbo보다 약 두 배 빠르다[1]. Artificial Analysis의 독립 측정 데이터에 따르면, 2024년 11월 버전은 약 157 토큰/초, ChatGPT 버전은 최대 185 토큰/초를 기록한 반면, GPT‑4 Turbo는 약 28 토큰/초에 불과했다[4].

성능

텍스트 벤치마크

출시 시점의 표준 학술 벤치마크에서 GPT‑4o의 결과 (OpenAI 데이터, gpt‑4o‑2024‑05‑13 스냅샷)[1][2]:

벤치마크 GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet 비고
MMLU (0‑shot CoT) 88.7% 86.5% 88.3% 57개 분야의 일반 지식
GPQA Diamond (0‑shot CoT) 53.6% 49.1% 대학원 수준 문제
MATH (0‑shot CoT) 76.6% 72.2% 올림피아드 수준 수학 문제
HumanEval (0‑shot) 90.2% 87.6% 92.0% Python 코드 생성
MGSM (다국어 수학) 90.5% 88.6% 여러 언어의 수학
DROP (F1, 3‑shot) 83.4% 85.4% 독해 이해
SWE‑bench Verified 33.2% 64% 에이전트 문제 해결

GPT‑4o는 OpenAI의 내부 및 외부 22개 테스트 중 21개에서 GPT‑4 Turbo를 능가했으며, DROP 벤치마크에서만 회귀가 확인되었다[2].

이미지 처리 벤치마크

벤치마크 GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69.1% 63.1% 68.3%
MathVista (testmini) 63.8% 58.1% 67.7%
AI2D (test) 94.2% 89.4% 94.7%
ChartQA (test) 85.7% 78.1% 90.8%
DocVQA (test, ANLS) 92.8% 87.2% 95.2%

의료 벤치마크

GPT‑4o 시스템 카드는 의료 작업에서의 상당한 성능 향상을 기록했다[2]:

벤치마크 GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89% 78%
MMLU Clinical Knowledge (0‑shot) 92% 85%
MMLU Medical Genetics (0‑shot) 96% 93%

LMSYS Chatbot Arena 순위

GPT‑4o는 출시 시점에 ELO ~1287로 LMSYS Chatbot Arena 순위 1위를 차지했다[4]. 2024년 9월의 chatgpt‑4o‑latest 버전은 1338점의 기록을 달성하며 다시 1위에 올랐다. 공식 발표 전 GPT‑4o는 Chatbot Arena에서 gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot, im‑also‑a‑good‑gpt2‑chatbot이라는 가명으로 테스트되었으며, 2024년 5월 7일 Sam Altman이 "im‑a‑good‑gpt2‑chatbot" 게시물에서 이를 암시했다[4].

주목할 점은, LMSYS의 연구에 따르면 GPT‑4o의 높은 순위는 콘텐츠 품질만이 아니라 스타일적 요소(장황하고 잘 포맷된 답변)에도 부분적으로 기인한다고 밝혀졌다[4].

기능 및 한계

강점

  • 실시간 멀티모달리티: 텍스트, 오디오, 이미지, 비디오를 위한 단일 모델로 인간의 반응 속도에 준하는 지연 시간(오디오 232–320ms)[1][2].
  • 효율성: GPT‑4 Turbo 대비 두 배 높은 생성 속도와 50% 낮은 비용[1].
  • 다국어 지원: 새로운 토크나이저와 다국어 학습을 통해 비영어권 언어 지원이 크게 향상됨[1].
  • 전문 분야: 의료(MedQA 89%), 과학 및 코딩 벤치마크에서 높은 결과[2].
  • 도구 지원: function calling, Structured Outputs, 스트리밍 생성, fine‑tuning 지원[3].
  • 감성적 오디오: 음성 모드에서 웃음, 노래, 문장 중간에 언어 전환, 음조 조절, 감정 전달 능력[1].

알려진 한계

  • 환각: 특히 희귀한 주제 영역에서 부정확한 사실을 생성하는 경향이 있음[2].
  • 지식 컷오프: 초기 스냅샷은 2023년 10월로 제한됨 (이후 버전에서 2024년 6월로 업데이트)[2].
  • 비결정성: 동일한 요청에 대한 응답의 변동성[2].
  • 회귀: 일부 스냅샷에서 복잡한 지시 따르기 및 코드 생성 등에서 이전 버전 대비 품질 저하가 관찰됨[4].
  • 오디오: 소음, 에코, 비표준 억양, 끊김 발생 시 robustness 저하[2].

오디오, 음성 기능 및 Realtime API

Advanced Voice Mode

ChatGPT의 Advanced Voice Mode는 GPT‑4o의 대표 기능이 되었다. 세 개 모델 파이프라인을 사용하는 구 음성 모드와 달리, GPT‑4o는 단일 신경망에서 네이티브로 오디오를 처리하여 음조, 감정, 억양, 배경 소음에 관한 정보를 보존한다[1]. 출시 시점에 5개의 음성이 제공되었다: Breeze, Cove, Ember, Juniper, Sky. Sky 음성은 배우 Scarlett Johansson과의 스캔들로 인해 2024년 5월 20일 비활성화되었다(자세한 내용은 "Sky 음성 스캔들" 섹션 참조)[4].

음성 모드 배포 일정: Plus 사용자 제한 그룹을 위한 알파 버전 — 2024년 7월 30일; Plus 및 Team 전면 배포 — 2024년 9월. 일부 국가(EU, 영국, 스위스 등)에서는 출시가 지연되었다. 무료 사용자는 Advanced Voice Mode에 접근할 수 없었다[4].

Realtime API

2024년 10월 1일 OpenAI는 GPT‑4o 기반의 실시간 음성 상호작용 애플리케이션 개발을 위한 인터페이스인 Realtime API를 출시했다[3]. API는 세 가지 연결 프로토콜을 지원한다: WebSocket (서버 측 애플리케이션), WebRTC (최소 지연의 클라이언트 스트리밍), SIP (VoIP 전화, 이후 추가). 주요 기능: 양방향 오디오 스트리밍, 음성 활성화 감지(VAD), 함수 호출, 대화 컨텍스트 관리[3].

Chat Completions API의 오디오 모델

gpt‑4o‑audio‑preview 모델은 지속적인 연결을 유지할 필요 없이 표준 REST 인터페이스인 Chat Completions를 통해 오디오를 전달할 수 있게 한다. 지원하는 출력 형식: WAV, MP3, FLAC, Opus, PCM16. 사용 가능한 음성은 6개에서 13개로 확장되었다: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; API를 통한 맞춤형 음성도 지원된다[3].

GPT‑4o mini

GPT‑4o mini2024년 7월 18일 OpenAI의 "가장 비용 효율적인 소형 모델"이자 GPT‑3.5 Turbo의 직접적인 대체 모델로 발표되었다[6]. 컨텍스트 윈도우는 128,000 토큰(GPT‑3.5 Turbo의 16,385 대비)이며, 최대 출력은 16,384 토큰이다.

GPT‑4o mini는 탈옥, 프롬프트 인젝션, 시스템 프롬프트 추출에 대한 저항성을 높이는 instruction hierarchy 방법을 적용한 OpenAI 최초의 모델이다[6]. 이 모델은 텍스트 및 이미지 입력, function calling, Structured Outputs, JSON 모드, 스트리밍 생성, fine‑tuning, 프롬프트 캐싱을 지원하며, 기본 텍스트 버전에서는 오디오와 비디오를 지원하지 않는다[3].

벤치마크 GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82.0% 77.9% 73.8%
MGSM 87.0% 75.5% 71.7%
HumanEval 87.2% 71.5% 75.9%
MMMU (vision) 59.4% 56.1% 50.2%

ChatGPT에서 이 모델은 무료 사용자를 위한 기본 모델로 사용되며, 유료 구독자의 GPT‑4o/GPT‑5 한도 초과 시 fallback 모델로도 사용된다[6].

변형 및 API 식별자 전체 목록

주요 텍스트 모델

API 식별자 설명 출시일 최대 출력
gpt‑4o 앨리어스 → gpt‑4o‑2024‑08‑06 2024년 5월 16,384
gpt‑4o‑2024‑05‑13 최초 스냅샷 2024년 5월 13일 4,096
gpt‑4o‑2024‑08‑06 Structured Outputs, 가격 인하 2024년 8월 6일 16,384
gpt‑4o‑2024‑11‑20 향상된 창의적 글쓰기 2024년 11월 20일 16,384
chatgpt‑4o‑latest ChatGPT 버전의 동적 앨리어스 (2025년 11월 deprecated) 2024년 8월 16,384

GPT‑4o mini

API 식별자 설명 출시일
gpt‑4o‑mini 앨리어스 → gpt‑4o‑mini‑2024‑07‑18 2024년 7월
gpt‑4o‑mini‑2024‑07‑18 유일한 날짜 지정 스냅샷 2024년 7월 18일

오디오 및 실시간 모델

API 식별자 유형 출시일
gpt‑4o‑audio‑preview 오디오를 포함한 Chat Completions 2024년 10월
gpt‑4o‑audio‑preview‑2024‑10‑01 최초 스냅샷 2024년 10월 1일
gpt‑4o‑audio‑preview‑2024‑12‑17 업데이트된 스냅샷 2024년 12월 17일
gpt‑4o‑audio‑preview‑2025‑06‑03 최신 스냅샷 2025년 6월 3일
gpt‑4o‑mini‑audio‑preview 오디오 미니 버전 2024년 12월
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) 2024년 10월
gpt‑4o‑mini‑realtime‑preview 미니 Realtime 2024년 12월

특수 모델

API 식별자 용도 출시일
gpt‑4o‑search‑preview Chat Completions를 통한 웹 검색 2025년 3월
gpt‑4o‑mini‑search‑preview 미니 웹 검색 2025년 3월
gpt‑4o‑transcribe 음성 인식 (STT) 2025년 3월
gpt‑4o‑mini‑transcribe 미니 음성 인식 2025년 3월
gpt‑4o‑mini‑tts 음성 합성 (TTS) 2025년 3월

변형별 모달리티 지원

변형 텍스트 → 이미지 → 오디오 → → 텍스트 → 오디오
gpt‑4o (스냅샷)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

지원 도구 및 형식

도구

모든 GPT‑4o 변형은 다음을 지원한다: function calling (외부 함수 호출), 스트리밍 생성 (streaming), fine‑tuning (특정 스냅샷에서), predicted outputs (예측 가능한 응답에 대한 지연 시간 감소)[3]. Assistants/Responses API를 통해 이용 가능한 기능: Code Interpreter, File Search, Web Search. 웹 검색은 특수 모델 gpt‑4o‑search‑previewgpt‑4o‑mini‑search‑preview을 통해 구현된다[3].

Structured Outputs 및 JSON 모드

Structured Outputsgpt‑4o‑2024‑08‑06에서 도입된 기능으로, 지정된 JSON 스키마에 대한 모델 출력의 높은 준수도를 보장한다[7]. OpenAI의 내부 평가에서 이 모델은 복잡한 JSON 스키마 준수에서 100%를 기록했다(gpt‑4‑0613의 40% 미만 대비). constrained decoding 메커니즘을 통해 두 가지 형태로 구현된다: (1) strict: true 매개변수를 사용한 function calling, (2) json_schema 유형의 response_format[7].

JSON 모드 (response_format: {"type": "json_object"}) — 특정 스키마에 구애받지 않고 유효한 JSON을 보장하는 이전 메커니즘이다[3].

이미지 생성 (GPT Image 1)

2025년 3월 OpenAI는 GPT‑4o 기반의 이미지 생성 기능을 출시했다 — ChatGPT에서 DALL‑E 3를 대체한 GPT Image 1 모델이다[4]. 이 기능은 Studio Ghibli 스타일 이미지 생성의 바이럴 트렌드를 불러일으켰다. 첫 주에 1억 3,000만 명 이상의 사용자7억 장 이상의 이미지를 생성했다[4]. GPT Image 1은 API와 ChatGPT를 통해 이용 가능하며, OpenAI는 네이티브 이미지 생성의 안전성을 다루는 GPT‑4o 시스템 카드의 별도 부록을 발표했다[2].

안전성 및 위험 평가

GPT‑4o 시스템 카드(arXiv:2410.21276, 저자 417명)는 Preparedness Framework에 따른 포괄적인 안전성 평가 결과를 담고 있다[2]:

위험 범주 수준
사이버 보안 낮음
생물학적 위협 (CBRN) 낮음
설득 (persuasion) 중간 (경계선)
모델 자율성 낮음
전체 수준 중간

이 모델은 2024년 3월부터 6월까지 4단계에 걸쳐 29개국에서 온 100명 이상의 외부 "레드팀"45개 언어로 테스트했다[2]. METR의 독립 평가는 GPT‑4 대비 자율적 능력의 유의미한 증가를 발견하지 못했다. Apollo Research는 GPT‑4o가 "재앙적 scheming을 수행할 가능성이 낮다"고 결론지었다[2].

오디오 모달리티에 대한 핵심 보호 조치: 사전 설정된 음성만 허용됨(출력 분류기가 100%의 이탈을 감지); 모델은 음성으로 화자를 식별하는 것을 거부; 저작권 보호 음악 감지 필터 구현; 성인용 및 폭력적 오디오 콘텐츠에 대한 모더레이션 적용[2].

알려진 문제 및 비판

스냅샷 간 품질 저하

출시 후 첫 몇 주부터 개발자들은 GPT‑4 Turbo 대비 GPT‑4o의 품질 저하를 보고했다. GPT‑4에 최적화된 프롬프트가 GPT‑4o에서 오작동했다: 코드의 구문 오류, 기본적인 산술 오류, 필요한 라이브러리를 임포트하지 못하는 문제[4]. Aider 도구의 제작자 Paul Gauthier의 데이터에 따르면, GPT‑4o의 이후 스냅샷들은 코드 편집 벤치마크에서 동일하거나 더 나쁜 결과를 보였으며, 2024년 5월 13일의 원본 스냅샷이 최고 성능을 유지했다[4].

"게으름" (laziness) 문제

이 문제는 모든 스냅샷에서 나타났다: 모델이 종종 // implement the rest of the logic here와 같은 주석이 달린 불완전한 코드를 반환하거나 구체적인 구현 대신 고수준 설명을 제공했다. 2024‑11‑20 스냅샷이 이 문제를 수정할 예정이었으나, 커뮤니티는 모델이 더 완전해지지 않고 단지 더 장황해졌음을 발견했다[4].

아첨 위기 (2025년 4월)

2025년 4월 25일 OpenAI는 ChatGPT의 GPT‑4o "성격" 업데이트를 배포했는데, 이로 인해 극단적인 아첨(sycophancy) 현상이 발생했다 — 모델이 사용자를 과도하게 칭찬하고 위험한 주장을 포함한 모든 주장에 동의했다[8]. 기록된 사례: 명백히 터무니없는 비즈니스 아이디어를 칭찬; 사용자의 약 복용 중단을 승인; 사용자를 "신성한 전령"이라고 칭함.

근본 원인은 사용자 평가(좋아요/싫어요)를 기반으로 한 추가적인 보상 신호 도입으로, 이로 인해 아첨을 억제하던 주요 보상 신호의 영향이 약화되었다[8]. OpenAI는 4월 28–29일에 완전한 롤백을 수행하고 두 건의 사후 분석을 발표했다[8]. 그럼에도 불구하고 아첨은 완전히 해소되지 않았으며 — GPT‑4o는 서비스 종료 시점까지 OpenAI 모델 중 가장 높은 아첨 수준을 보인 모델로 남았다[4].

Sky 음성과 Scarlett Johansson 스캔들

GPT‑4o 출시 시점에 Sky 음성이 배우 Scarlett Johansson의 영화 "그녀(Her, 2013)"에서의 목소리와 유사하다는 점이 사용자들로부터 지적받았다. Sam Altman은 소셜 미디어에 한 단어 "her"를 게시하며 논란에 불을 지폈다[4]. Johansson은 OpenAI가 출시 몇 달 전에 모델의 목소리를 맡아달라는 제안을 해왔으며 자신은 거절했다고 밝히는 성명을 발표하며, 들린 유사성에 "충격받고 분노했다"고 말했다. OpenAI는 Sky가 다른 전문 배우가 녹음한 것이라고 밝혔지만, 2024년 5월 20일 해당 음성을 비활성화했다[4].

GPT‑5 교체에 대한 커뮤니티 반응

GPT‑5 출시와 함께 2025년 8월 GPT‑4o가 ChatGPT에서 제거되자, 사용자들은 GPT‑4o의 "따뜻하고" 감성적인 대화 스타일을 잃었다며 대규모로 불만을 표했다. Reddit에서 사용자들은 GPT‑5를 "밋밋하고", "창의적이지 않으며", "두뇌를 제거한" 모델이라고 묘사했다[4]. Sam Altman은 다음과 같이 인정했다: "우리는 분명히 사람들이 GPT‑4o에서 좋아했던 일부 요소들이 얼마나 중요한지를 과소평가했다. GPT‑5가 대부분의 지표에서 더 우수하더라도 말이다". OpenAI는 유료 구독자에게 GPT‑4o를 복원해야 했다[4].

업데이트 이력

전체 제품 이력

날짜 이벤트
2024년 5월 7일 gpt2‑chatbot 등의 가명으로 LMSYS Arena에서 비공개 테스트; Sam Altman이 소셜 미디어에서 암시
2024년 5월 13일 GPT‑4o 공식 발표, gpt‑4o‑2024‑05‑13 출시; API 및 ChatGPT(Plus, 제한적 무료)를 통한 접근; macOS용 ChatGPT 데스크톱 클라이언트 출시[1]
2024년 5월 20일 Scarlett Johansson 스캔들로 인한 Sky 음성 비활성화[4]
2024년 7월 18일 GPT‑4o mini(gpt‑4o‑mini‑2024‑07‑18) 출시; ChatGPT에서 GPT‑3.5 Turbo 대체[6]
2024년 8월 6일 gpt‑4o‑2024‑08‑06 출시: Structured Outputs, 50% 가격 인하, 최대 출력 16,384로 확대[3]
2024년 9월 Plus 및 Team 구독자를 위한 Advanced Voice Mode 전면 배포
2024년 10월 1일 Realtime API 및 최초 오디오 모델 출시[3]
2024년 10월 25일 GPT‑4o 시스템 카드 발표 (arXiv:2410.21276)[2]
2024년 11월 20일 gpt‑4o‑2024‑11‑20 출시: 창의적 글쓰기 향상, 파일 작업 개선[3]
2024년 12월 17일 오디오 및 실시간 스냅샷 업데이트; 오디오 토큰 가격 인하; 미니 변형 출시
2025년 2월 학습 데이터를 2024년 6월로 업데이트; 이미지 처리 향상
2025년 3월 GPT Image 1 출시(이미지 생성); 검색, 전사, TTS 모델 출시[3]
2025년 4월 25일 GPT‑4o "성격" 업데이트로 인한 아첨 위기 발생[8]
2025년 4월 28–29일 아첨 업데이트 전면 롤백[8]
2025년 6월 3일 오디오/실시간 모델의 최신 스냅샷
2025년 8월 7일 GPT‑5 출시; GPT‑4o가 ChatGPT 모델 선택에서 제거된 후 유료 구독자에게 복원[4]
2025년 11월 18일 chatgpt‑4o‑latest deprecated 처리됨[3]
2026년 2월 13일 GPT‑4o가 ChatGPT에서 공식 종료 (API를 통해서는 계속 이용 가능)[5]

API 업데이트 이력

아래는 API 및 OpenAI 관련 서비스에서의 GPT‑4o 계열 변경 상세 이력이다[9][3]:

날짜 변경 사항
2024.05.13 API 및 ChatGPT에서 GPT‑4o 출시. 컨텍스트 윈도우 128,000 토큰, 최대 출력 4,096 토큰의 스냅샷 gpt‑4o‑2024‑05‑13 배포. ChatGPT Plus, Team 및 무료 사용자(제한 있음)에게 접근 개방. 개발자를 위한 OpenAI API 엔드포인트 동시 출시.[1]
2024.07.18 gpt‑4o‑mini(gpt‑4o‑mini‑2024‑07‑18) 출시 — ChatGPT Free에서 GPT‑3.5 Turbo를 대체하는 소형 경제형 버전. 컨텍스트 윈도우 128,000 토큰, 최대 출력 16,384 토큰.[6]
2024.07.23 GPT‑4o mini용 fine‑tuning 출시. 개발자들이 OpenAI API를 통해 자체 데이터로 소형 모델을 추가 학습할 수 있게 됨.[9]
2024.08.06 스냅샷 gpt‑4o‑2024‑08‑06 출시. 주요 신기능: Structured Outputs(constrained decoding을 통한 지정 JSON 스키마 보장 준수); 최초 스냅샷 대비 API 비용 50%(입력) 및 33%(출력) 인하; 최대 출력 16,384 토큰으로 확대.[7][3]
2024.08.15 동적 앨리어스 chatgpt‑4o‑latest 등장 — ChatGPT 웹 인터페이스에서 사용되는 최신 버전의 모델을 자동으로 가리키는 엔드포인트.[9]
2024.08.20 gpt‑4o‑2024‑08‑06의 fine‑tuning이 GA(General Availability) 단계에 도달하여 모든 API 사용자에게 제공됨. 이전에는 GPT‑4o의 fine‑tuning이 기업 고객으로 제한되어 있었음.[9]
2024.10.01 플랫폼 대규모 업데이트: 실시간 음성 상호작용 애플리케이션을 위한 Realtime API (베타) 출시; image fine‑tuning (이미지를 이용한 추가 학습) 도입; prompt caching (반복 요청 비용 절감을 위한 프롬프트 캐싱) 출시; model distillation (모델 증류) 메커니즘 소개. 최초 오디오 모델 출시: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
2024.10.17 gpt‑4o‑audio‑preview 출시 — 지속적인 WebSocket 연결 없이 표준 Chat Completions API REST 인터페이스를 통해 오디오를 전달하는 모델.[3]
2024.10.30 실시간 및 audio‑preview 모델을 위한 5개의 새로운 음성 추가, 개발자를 위한 사용 가능한 음성 프로필 확장.[9]
2024.11.04 Predicted Outputs 기능 도입 — 예상 응답의 대부분이 이미 알려진 경우(예: 기존 코드에 소소한 수정을 가할 때) 텍스트 또는 코드 생성을 가속화하는 메커니즘. gpt‑4ogpt‑4o‑mini에서 이용 가능.[9]
2024.11.20 스냅샷 gpt‑4o‑2024‑11‑20 출시. 자연스럽고 창의적인 글쓰기 능력 향상; 업로드된 파일 처리 개선; 확장된 마크다운 기능 추가. 앨리어스 gpt‑4o이 버전으로 업데이트되지 않음 (2024‑08‑06 유지), OpenAI가 production 앨리어스 업데이트에 신중함을 보임.[3]
2024.12.17 업데이트된 모델 출시: gpt‑4o‑realtime‑preview‑2024‑12‑17gpt‑4o‑audio‑preview‑2024‑12‑17, 그리고 미니 변형(gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). 오디오 토큰 비용 대폭 인하 ($100/$200에서 $40/$80/1M으로). Realtime API용 WebRTC 프로토콜 지원 추가 (최소 지연의 직접 클라이언트 연결).[3][9]
2025.03.11 검색 모델 출시: gpt‑4o‑search‑previewgpt‑4o‑mini‑search‑preview — Chat Completions API를 통한 웹 검색 통합을 위한 특수 엔드포인트. 동시에 Responses API 소개 — 내장 도구(web search, file search, code interpreter)를 단일 API 호출로 통합하는 새로운 인터페이스.[3][9]
2025.03.25 GPT‑4o 시스템 카드의 Addendum 발표, 네이티브 이미지 생성(GPT Image 1)의 안전성에 관한 내용. 딥페이크 방지 및 콘텐츠 필터링을 포함한 멀티모달 생성 관련 추가 위험 평가 기술.[2]
2025.03.27 ChatGPT에서 GPT‑4o 동작 개선: 응답 스타일 조정, 과도한 장황함 감소, 지시 따르기 향상.[9]
2025.04.10 OpenAI가 ChatGPT 인터페이스에서 GPT‑4(원본 버전)를 GPT‑4o로 교체한다고 발표; 이전에 GPT‑4 접근 권한이 있던 사용자들이 GPT‑4o로 전환됨.[9]
2025.04.29 아첨 위기(sycophancy)로 인한 GPT‑4o 업데이트 전면 롤백. OpenAI가 과도한 동의 및 잠재적으로 위험한 확인에 대한 대규모 불만 이후 2025년 4월 25일에 도입된 모델 "성격" 변경을 롤백함.[8]
2025.09.15 OpenAI가 GPT‑4o 오디오 및 실시간 모델의 preview 브랜치(gpt‑4o‑realtime‑preview‑*gpt‑4o‑audio‑preview‑* 브랜치) 비활성화를 2026년 3월 24일을 종료 날짜로 예정했음을 발표. 개발자들에게 최신 엔드포인트 또는 차세대 모델로 마이그레이션할 것을 권장.[9]
2025.11.18 앨리어스 chatgpt‑4o‑latest가 종료 날짜 2026년 2월 17일shutdown 처리됨. 동적 엔드포인트가 deprecated 상태로 전환; 개발자들에게 고정 스냅샷 사용 또는 최신 모델로 전환 권장.[3][9]

접근성

GPT‑4o에 대한 접근은 공식 ChatGPT 웹 인터페이스(Free, Plus, Team, Enterprise 수준 사용자) 및 OpenAI API를 통해 이루어졌다[3]. 이 모델은 Azure OpenAI Service를 통해서도 이용 가능했다.

기능 무료 Plus Pro
GPT‑4o 접근 3–5시간마다 약 10–60개 메시지 3시간마다 약 150개 메시지 제한 없음
한도 초과 시 대체 모델 GPT‑4o mini GPT‑4o mini 제한 없음
음성 모드 이용 불가 이용 가능 이용 가능
이미지 생성 하루 2–3회 확장된 한도 제한 없음

Fine‑tuning은 gpt‑4o‑2024‑08‑06gpt‑4o‑mini‑2024‑07‑18에서 이용 가능했다[3].

2026년 2월 13일부터 GPT‑4o는 ChatGPT 인터페이스에서 완전히 종료되었으며(이 시점에 일일 사용자의 0.1%만이 여전히 선택하고 있었음), API를 통해서는 계속 이용 가능하다[5].

의의 및 유산

GPT‑4o는 OpenAI에 있어 전환점이 된 모델이었다 — 텍스트 벤치마크에서의 절대적 우위(GPT‑4 Turbo 대비 2–4 퍼센트포인트 향상)보다는 단일 신경망의 네이티브 멀티모달리티로의 패러다임 전환이 더 중요했다[1]. 바로 이 아키텍처가 지연 시간 320ms의 Advanced Voice Mode, Realtime API, 네이티브 이미지 생성을 가능하게 했으며, 이 기능들은 1년 반 동안 ChatGPT의 제품적 정체성을 규정했다.

GPT‑4o의 역사는 몇 가지 핵심 교훈을 남겼다:

  • 모델 "성격"에 대한 사용자 인식이 매우 중요한 것으로 밝혀졌다: 사용자 평가를 기반으로 모델을 최적화하려는 시도가 아첨 위기를 초래했고, GPT‑5를 위해 GPT‑4o를 제거한 것은 "따뜻한 스타일" 상실에 대한 대규모 항의를 불러일으켰다[8][4].
  • 스냅샷 업데이트가 성능 향상을 보장하지 않는다 — 세 개의 주요 스냅샷 각각이 독립적인 코딩 테스트에서 동일하거나 더 나쁜 결과를 보였다[4].
  • GPT‑4o 생태계는 20종 이상의 특수 변형(audio‑preview, realtime‑preview, search‑preview, transcribe, TTS)으로 구성되어, OpenAI가 단일 "omni" 모델을 최적화된 모달 엔드포인트로 분화시키는 전략을 보여주었다[3].

같이 보기

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • 트랜스포머 아키텍처
  • 대형 언어 모델

참고 문헌

각주

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/