GPT-4o (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT‑4o (đọc là "ji‑pi‑ti‑fo‑ou"; chữ «o» từ tiếng Latin omni — «tất cả», «toàn diện») — mô hình ngôn ngữ lớn (LLM) đa phương thức thuộc họ GPT, được công ty OpenAI phát triển và ra mắt vào ngày 13 tháng 5 năm 2024[1]. GPT‑4o là mô hình đầu tiên của OpenAI được huấn luyện như một mạng nơ-ron đơn nhất end-to-end, có khả năng xử lý đồng thời văn bản, hình ảnh và âm thanh — khác với các phiên bản tiền nhiệm, nơi mỗi phương thức sử dụng các mô hình riêng biệt[2]. Mô hình này thay thế GPT‑4 Turbo với tư cách là mô hình hàng đầu của dòng sản phẩm, mang lại tốc độ tạo sinh nhanh gấp đôi, chi phí API thấp hơn 50% và các khả năng đa phương thức hoàn toàn mới về chất[1]. Họ GPT‑4o bao gồm hơn 20 biến thể, trong đó có GPT‑4o mini nhỏ gọn, các mô hình âm thanh, mô hình thời gian thực, mô hình tìm kiếm và các mô hình giọng nói chuyên biệt[3].

Thông tin tổng quan

Tham số Giá trị
Tên đầy đủ GPT‑4o (GPT‑4 Omni)
Nhà phát triển OpenAI
Ngày công bố 13 tháng 5 năm 2024[1]
Loại Mô hình đa phương thức tự hồi quy (transformer)[2]
Số lượng tham số Chưa được công bố chính thức (ước tính không chính thức — ~200 tỷ cho GPT‑4o, ~8 tỷ cho GPT‑4o mini)[4]
Cửa sổ ngữ cảnh 128 000 token[3]
Đầu ra tối đa 16 384 token (4 096 cho gpt‑4o‑2024‑05‑13)[3]
Ngày cắt dữ liệu huấn luyện Tháng 10 năm 2023 (cập nhật đến tháng 6 năm 2024 trong các phiên bản mới hơn)[2]
Tokenizer o200k_base (200 000 token)[1]
Phương thức đầu vào Văn bản, hình ảnh, âm thanh, video[1]
Phương thức đầu ra Văn bản, âm thanh, hình ảnh (qua GPT Image 1)[1][3]
Giấy phép Độc quyền, mã nguồn đóng
Thẻ hệ thống arXiv:2410.21276 (25 tháng 10 năm 2024, 417 tác giả)[2]
Định danh API gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
Trạng thái hiện tại Có sẵn trong API; đã ngừng trên ChatGPT vào ngày 13 tháng 2 năm 2026[5]

Vị trí trong dòng sản phẩm

GPT‑4o chiếm vị trí mô hình đa phương thức hàng đầu cho mục đích chung trong họ GPT tại thời điểm phát hành. Nó thay thế GPT‑4 Turbo (tháng 4 năm 2024) như mô hình chính cho hầu hết các tác vụ trong ChatGPT và API, mang lại tốc độ cao hơn và chi phí thấp hơn trong khi duy trì hoặc cải thiện chất lượng trên các tác vụ văn bản[1].

Mô hình được phát triển từ GPT‑4 Turbo thông qua việc chuyển đổi từ các thành phần riêng biệt (các mô hình độc lập cho thị giác và tổng hợp giọng nói) sang kiến trúc end-to-end thống nhất. Các điểm khác biệt chính so với các mô hình lân cận trong dòng sản phẩm:

  • So với GPT‑4 Turbo (phiên bản tiền nhiệm) — GPT‑4o cung cấp hiệu suất trí tuệ tương đương trên tiếng Anh và lập trình, nhưng vượt trội đáng kể so với phiên bản tiền nhiệm trong các tác vụ đa ngôn ngữ, xử lý hình ảnh và âm thanh. GPT‑4o nhanh gấp đôi và rẻ hơn 50% qua API. Điểm khác biệt kiến trúc căn bản là tính đa phương thức gốc (một mô hình thống nhất thay vì một pipeline)[1].
  • So với GPT‑4.1 (tháng 4 năm 2025) — mô hình thế hệ tiếp theo dành cho nhà phát triển API, vượt trội so với GPT‑4o trên hầu hết các benchmark (MMLU 90,2% so với 85,7%, SWE‑bench Verified 54,6% so với 33,2%) với chi phí thấp hơn; GPT‑4.1 không được cung cấp trong giao diện ChatGPT[4].
  • So với GPT‑5 (tháng 8 năm 2025) — đã thay thế GPT‑4o trong ChatGPT, tuy nhiên người dùng phàn nàn rộng rãi về việc mất đi phong cách «ấm áp» và cảm xúc của GPT‑4o[4].
  • So với GPT‑4o mini (tháng 7 năm 2024) — phiên bản nhỏ gọn và rẻ hơn đáng kể, thay thế GPT‑3.5 Turbo trong ChatGPT miễn phí[6].

GPT‑4o là mô hình đầu tiên của OpenAI có sẵn cho người dùng miễn phí của ChatGPT (với giới hạn số lượng tin nhắn)[1].

Kiến trúc và các đổi mới chính

Huấn luyện đa phương thức end-to-end

Đổi mới kiến trúc chính của GPT‑4o nằm ở việc huấn luyện end-to-end một mạng nơ-ron duy nhất trên dữ liệu của tất cả các phương thức cùng một lúc[1][2]. Trước GPT‑4o, chế độ giọng nói của ChatGPT hoạt động theo sơ đồ pipeline gồm ba mô hình riêng biệt: Whisper (nhận dạng giọng nói) → GPT‑3.5/GPT‑4 (xử lý văn bản) → TTS (tổng hợp giọng nói). Pipeline như vậy mất đi thông tin về giọng điệu, cảm xúc, âm thanh nền và nhiều người nói, trong khi độ trễ lên tới 2,8 giây cho GPT‑3.5 và 5,4 giây cho GPT‑4[1]. GPT‑4o xử lý âm thanh một cách tự nhiên — thời gian phản hồi trung bình là 320 mili giây (tối thiểu 232 ms), tương đương với tốc độ phản ứng của con người trong cuộc trò chuyện[1][2].

Thẻ hệ thống GPT‑4o chứa một số khẳng định căn bản về kiến trúc[2]:

  • mô hình là LLM transformer tự hồi quy, dự đoán token tiếp theo dựa trên ngữ cảnh đa phương thức;
  • sử dụng biểu diễn thống nhất các phương thức, được huấn luyện trên hỗn hợp dữ liệu văn bản, mã, toán học, hình ảnh, âm thanh và video;
  • quá trình huấn luyện diễn ra theo nhiều giai đoạn, bao gồm pre-training trên các kho dữ liệu đa phương thức lớn và fine-tuning tiếp theo sử dụng Reinforcement Learning from Human Feedback (RLHF) và red‑teaming.

Tham số và chi tiết kiến trúc

Công ty OpenAI không tiết lộ các thông số chi tiết của mô hình — số lượng tham số, số lớp, sự hiện diện của cấu trúc MoE và phần cứng được sử dụng để huấn luyện[2]. Ước tính không chính thức về ~200 tỷ tham số dựa trên dữ liệu từ bài báo nghiên cứu của Microsoft, nhưng không được OpenAI xác nhận[4].

Tokenizer o200k_base

GPT‑4o sử dụng tokenizer mới o200k_base với từ điển gồm 200 000 token — gấp đôi so với cl100k_base của GPT‑4[1]. Điều này cải thiện đáng kể hiệu quả nén cho các bảng chữ cái không phải Latin: ví dụ, đối với tiếng Gujarati — gấp 4,4 lần, tiếng Telugu — gấp 3,5 lần, tiếng Malayalam — cải thiện đến 4 lần[1]. Đối với tiếng Nga, tiếng Hàn, tiếng Ả Rập và các ngôn ngữ khác, cần ít token hơn đáng kể để mã hóa cùng một văn bản, điều này làm tăng mật độ thông tin của cửa sổ ngữ cảnh và giảm chi phí khi sử dụng API.

Tốc độ tạo sinh

Tốc độ tạo sinh của GPT‑4o xấp xỉ nhanh gấp đôi so với GPT‑4 Turbo[1]. Theo dữ liệu đo lường độc lập của Artificial Analysis, phiên bản tháng 11 năm 2024 tạo ra ~157 token/giây, còn phiên bản ChatGPT — lên đến 185 token/giây, trong khi GPT‑4 Turbo chỉ đạt ~28 token/giây[4].

Hiệu suất

Benchmark văn bản

Kết quả của GPT‑4o trên các benchmark học thuật tiêu chuẩn tại thời điểm phát hành (dữ liệu OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet Ghi chú
MMLU (0‑shot CoT) 88,7 % 86,5 % 88,3 % Kiến thức chung trong 57 lĩnh vực
GPQA Diamond (0‑shot CoT) 53,6 % 49,1 % Câu hỏi cấp độ nghiên cứu sinh
MATH (0‑shot CoT) 76,6 % 72,2 % Bài toán toán học cấp độ Olympic
HumanEval (0‑shot) 90,2 % 87,6 % 92,0 % Tạo mã Python
MGSM (toán học đa ngôn ngữ) 90,5 % 88,6 % Toán học bằng nhiều ngôn ngữ
DROP (F1, 3‑shot) 83,4 % 85,4 % Đọc hiểu
SWE‑bench Verified 33,2 % 64 % Giải quyết tác vụ dạng agent

GPT‑4o vượt trội so với GPT‑4 Turbo trên 21 trong 22 bài kiểm tra nội bộ và bên ngoài của OpenAI; điểm hồi quy duy nhất được ghi nhận trên benchmark DROP[2].

Benchmark xử lý hình ảnh

Benchmark GPT‑4o GPT‑4 Turbo Claude 3.5 Sonnet
MMMU (val, 0‑shot CoT) 69,1 % 63,1 % 68,3 %
MathVista (testmini) 63,8 % 58,1 % 67,7 %
AI2D (test) 94,2 % 89,4 % 94,7 %
ChartQA (test) 85,7 % 78,1 % 90,8 %
DocVQA (test, ANLS) 92,8 % 87,2 % 95,2 %

Benchmark y tế

Thẻ hệ thống GPT‑4o ghi nhận sự cải thiện đáng kể trong các tác vụ y tế[2]:

Benchmark GPT‑4o GPT‑4 Turbo
MedQA (USMLE, 0‑shot) 89 % 78 %
MMLU Clinical Knowledge (0‑shot) 92 % 85 %
MMLU Medical Genetics (0‑shot) 96 % 93 %

Bảng xếp hạng LMSYS Chatbot Arena

GPT‑4o khi ra mắt đứng vị trí đầu tiên trong bảng xếp hạng LMSYS Chatbot Arena với ELO ~1287[4]. Phiên bản chatgpt‑4o‑latest vào tháng 9 năm 2024 đạt kỷ lục 1338 điểm, một lần nữa chiếm vị trí đầu tiên. Trước khi được công bố chính thức, GPT‑4o đã được thử nghiệm trên Chatbot Arena dưới các bí danh gpt2‑chatbot, im‑a‑good‑gpt2‑chatbotim‑also‑a‑good‑gpt2‑chatbot; vào ngày 7 tháng 5 năm 2024, Sam Altman đã gợi ý điều này trong bài đăng «im‑a‑good‑gpt2‑chatbot»[4].

Cần lưu ý rằng nghiên cứu của LMSYS chỉ ra rằng: xếp hạng cao của GPT‑4o một phần được giải thích bởi các yếu tố phong cách (câu trả lời dài dòng, được định dạng tốt), chứ không chỉ đơn thuần là chất lượng nội dung[4].

Khả năng và hạn chế

Điểm mạnh

  • Đa phương thức thời gian thực: mô hình thống nhất cho văn bản, âm thanh, hình ảnh và video với độ trễ tương đương phản ứng của con người (232–320 ms cho âm thanh)[1][2].
  • Hiệu quả: tốc độ tạo sinh nhanh gấp đôi và chi phí thấp hơn 50% so với GPT‑4 Turbo[1].
  • Đa ngôn ngữ: hỗ trợ các ngôn ngữ không phải tiếng Anh được cải thiện đáng kể nhờ tokenizer mới và quá trình huấn luyện đa ngôn ngữ[1].
  • Các lĩnh vực chuyên biệt: kết quả cao trong các benchmark y tế (MedQA 89%), khoa học và lập trình[2].
  • Bộ công cụ: hỗ trợ function calling, Structured Outputs, streaming, fine-tuning[3].
  • Âm thanh cảm xúc: khả năng cười, hát, chuyển đổi ngôn ngữ giữa câu, điều chỉnh giọng điệu và truyền đạt cảm xúc trong chế độ giọng nói[1].

Hạn chế đã biết

  • Ảo giác: mô hình dễ tạo ra các sự kiện không chính xác, đặc biệt trong các lĩnh vực chuyên môn hiếm gặp[2].
  • Ngày cắt kiến thức: giới hạn ở tháng 10 năm 2023 trong các snapshot ban đầu (cập nhật đến tháng 6 năm 2024 trong các phiên bản mới hơn)[2].
  • Tính không xác định: sự biến đổi của câu trả lời với cùng một yêu cầu[2].
  • Hồi quy: một số snapshot ghi nhận sự suy giảm chất lượng so với các phiên bản trước, đặc biệt khi tuân theo các hướng dẫn phức tạp và tạo mã[4].
  • Âm thanh: giảm độ bền (robustness) khi có tiếng ồn, tiếng vang, giọng không chuẩn và bị ngắt quãng[2].

Âm thanh, khả năng giọng nói và Realtime API

Chế độ giọng nói nâng cao (Advanced Voice Mode)

Advanced Voice Mode trong ChatGPT trở thành đặc trưng nổi bật của GPT‑4o. Khác với chế độ giọng nói cũ với pipeline ba mô hình, GPT‑4o xử lý âm thanh một cách tự nhiên trong một mạng nơ-ron thống nhất, lưu giữ thông tin về giọng điệu, cảm xúc, giọng địa phương và âm thanh nền[1]. Khi ra mắt, có sẵn 5 giọng nói: Breeze, Cove, Ember, Juniper và Sky. Giọng Sky bị tắt vào ngày 20 tháng 5 năm 2024 do vụ bê bối với diễn viên Scarlett Johansson (chi tiết — trong phần «Vụ bê bối xung quanh giọng Sky»)[4].

Lịch sử triển khai chế độ giọng nói: phiên bản alpha cho nhóm người dùng Plus hạn chế — 30 tháng 7 năm 2024; triển khai đầy đủ cho Plus và Team — tháng 9 năm 2024. Ở một số quốc gia (EU, Vương quốc Anh, Thụy Sĩ và một số nước khác) việc ra mắt bị trì hoãn. Người dùng miễn phí không được truy cập Advanced Voice Mode[4].

Realtime API

Vào ngày 1 tháng 10 năm 2024, OpenAI ra mắt Realtime API — giao diện để tạo các ứng dụng có giọng nói thời gian thực dựa trên GPT‑4o[3]. API hỗ trợ ba giao thức kết nối: WebSocket (ứng dụng phía server), WebRTC (streaming phía client với độ trễ tối thiểu) và SIP (điện thoại VoIP, được thêm vào sau). Các tính năng chính: truyền âm thanh hai chiều, phát hiện hoạt động giọng nói (VAD), gọi hàm, quản lý ngữ cảnh cuộc trò chuyện[3].

Mô hình âm thanh trong Chat Completions API

Các mô hình gpt‑4o‑audio‑preview cho phép truyền âm thanh qua giao diện REST tiêu chuẩn của Chat Completions (không cần duy trì kết nối liên tục). Các định dạng đầu ra được hỗ trợ: WAV, MP3, FLAC, Opus, PCM16. Số lượng giọng nói có sẵn mở rộng từ 6 lên 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; cũng hỗ trợ giọng tùy chỉnh qua API[3].

GPT‑4o mini

GPT‑4o mini được công bố vào ngày 18 tháng 7 năm 2024 là «mô hình nhỏ tiết kiệm nhất» của OpenAI và là sự thay thế trực tiếp của GPT‑3.5 Turbo[6]. Cửa sổ ngữ cảnh là 128 000 token (so với 16 385 của GPT‑3.5 Turbo), và đầu ra tối đa là 16 384 token.

GPT‑4o mini là mô hình đầu tiên của OpenAI sử dụng phương pháp instruction hierarchy, tăng cường khả năng chống jailbreak, prompt injection và trích xuất system prompt[6]. Mô hình hỗ trợ nhập văn bản và hình ảnh, function calling, Structured Outputs, JSON mode, streaming, fine-tuning và prompt caching; âm thanh và video không được hỗ trợ bởi phiên bản văn bản cơ bản[3].

Benchmark GPT‑4o mini Gemini Flash Claude Haiku
MMLU 82,0 % 77,9 % 73,8 %
MGSM 87,0 % 75,5 % 71,7 %
HumanEval 87,2 % 71,5 % 75,9 %
MMMU (vision) 59,4 % 56,1 % 50,2 %

Trong ChatGPT, mô hình được sử dụng là mô hình mặc định cho người dùng miễn phí và là mô hình dự phòng khi hết giới hạn GPT‑4o/GPT‑5 cho người đăng ký trả phí[6].

Danh mục đầy đủ các biến thể và định danh API

Mô hình văn bản chính

Định danh API Mô tả Ngày phát hành Đầu ra tối đa
gpt‑4o Alias → gpt‑4o‑2024‑08‑06 Tháng 5 năm 2024 16 384
gpt‑4o‑2024‑05‑13 Snapshot đầu tiên 13 tháng 5 năm 2024 4 096
gpt‑4o‑2024‑08‑06 Structured Outputs, giảm giá 6 tháng 8 năm 2024 16 384
gpt‑4o‑2024‑11‑20 Cải thiện viết sáng tạo 20 tháng 11 năm 2024 16 384
chatgpt‑4o‑latest Alias động của phiên bản ChatGPT (deprecated từ tháng 11 năm 2025) Tháng 8 năm 2024 16 384

GPT‑4o mini

Định danh API Mô tả Ngày phát hành
gpt‑4o‑mini Alias → gpt‑4o‑mini‑2024‑07‑18 Tháng 7 năm 2024
gpt‑4o‑mini‑2024‑07‑18 Snapshot có ngày duy nhất 18 tháng 7 năm 2024

Mô hình âm thanh và thời gian thực

Định danh API Loại Ngày phát hành
gpt‑4o‑audio‑preview Chat Completions với âm thanh Tháng 10 năm 2024
gpt‑4o‑audio‑preview‑2024‑10‑01 Snapshot đầu tiên 1 tháng 10 năm 2024
gpt‑4o‑audio‑preview‑2024‑12‑17 Snapshot cập nhật 17 tháng 12 năm 2024
gpt‑4o‑audio‑preview‑2025‑06‑03 Snapshot mới nhất 3 tháng 6 năm 2025
gpt‑4o‑mini‑audio‑preview Phiên bản mini âm thanh Tháng 12 năm 2024
gpt‑4o‑realtime‑preview Realtime API (WebSocket/WebRTC) Tháng 10 năm 2024
gpt‑4o‑mini‑realtime‑preview Realtime mini Tháng 12 năm 2024

Mô hình chuyên biệt

Định danh API Mục đích Ngày phát hành
gpt‑4o‑search‑preview Tìm kiếm web qua Chat Completions Tháng 3 năm 2025
gpt‑4o‑mini‑search‑preview Tìm kiếm web mini Tháng 3 năm 2025
gpt‑4o‑transcribe Nhận dạng giọng nói (STT) Tháng 3 năm 2025
gpt‑4o‑mini‑transcribe Nhận dạng giọng nói mini Tháng 3 năm 2025
gpt‑4o‑mini‑tts Tổng hợp giọng nói (TTS) Tháng 3 năm 2025

Hỗ trợ phương thức theo biến thể

Biến thể Văn bản → Hình ảnh → Âm thanh → → Văn bản → Âm thanh
gpt‑4o (snapshot)
gpt‑4o‑mini
gpt‑4o‑audio‑preview
gpt‑4o‑realtime‑preview
gpt‑4o‑search‑preview
gpt‑4o‑transcribe
gpt‑4o‑mini‑tts

Công cụ và định dạng được hỗ trợ

Công cụ

Tất cả các biến thể GPT‑4o hỗ trợ: function calling (gọi các hàm bên ngoài), streaming (tạo sinh luồng), fine-tuning (trên một số snapshot nhất định), predicted outputs (giảm độ trễ cho các phản hồi có thể dự đoán)[3]. Qua Assistants/Responses API có sẵn: Code Interpreter, File Search, Web Search. Tìm kiếm web được thực hiện thông qua các mô hình chuyên biệt gpt‑4o‑search‑previewgpt‑4o‑mini‑search‑preview[3].

Structured Outputs và JSON mode

Structured Outputs — tính năng được giới thiệu với gpt‑4o‑2024‑08‑06, đảm bảo mức độ tuân thủ cao của đầu ra mô hình theo lược đồ JSON được chỉ định[7]. Trong các đánh giá nội bộ của OpenAI, mô hình đạt 100% tuân theo các lược đồ JSON phức tạp (so với chưa đến 40% ở gpt‑4‑0613). Được thực hiện thông qua cơ chế constrained decoding ở hai hình thức: (1) function calling với tham số strict: true và (2) response_format với kiểu json_schema[7].

JSON mode (response_format: {"type": "json_object"}) — cơ chế cũ hơn, đảm bảo JSON hợp lệ mà không ràng buộc vào lược đồ cụ thể[3].

Tạo hình ảnh (GPT Image 1)

Vào tháng 3 năm 2025, OpenAI ra mắt tính năng tạo hình ảnh dựa trên GPT‑4o — mô hình GPT Image 1, thay thế DALL‑E 3 trong ChatGPT[4]. Khả năng này đã tạo ra xu hướng lan truyền về việc tạo hình ảnh theo phong cách Studio Ghibli. Trong tuần đầu tiên, hơn 130 triệu người dùng đã tạo hơn 700 triệu hình ảnh[4]. GPT Image 1 có sẵn qua API và ChatGPT; OpenAI đã phát hành phần bổ sung riêng cho thẻ hệ thống GPT‑4o, dành riêng cho vấn đề an toàn của tính năng tạo hình ảnh gốc[2].

An toàn và đánh giá rủi ro

Thẻ hệ thống GPT‑4o (arXiv:2410.21276, 417 tác giả) chứa kết quả đánh giá an toàn toàn diện theo khung Preparedness Framework[2]:

Danh mục rủi ro Mức độ
An ninh mạng Thấp
Mối đe dọa sinh học (CBRN) Thấp
Thuyết phục (persuasion) Trung bình (giáp ranh)
Tính tự chủ của mô hình Thấp
Mức độ tổng thể Trung bình

Mô hình được kiểm tra bởi hơn 100 «đội đỏ» bên ngoài từ 29 quốc gia trên 45 ngôn ngữ trong bốn giai đoạn từ tháng 3 đến tháng 6 năm 2024[2]. Các đánh giá độc lập của METR không phát hiện sự gia tăng đáng kể về khả năng tự chủ so với GPT‑4. Apollo Research kết luận rằng GPT‑4o «khó có khả năng thực hiện scheming thảm khốc»[2].

Các biện pháp bảo vệ chính cho phương thức âm thanh: chỉ cho phép các giọng nói được cài đặt sẵn (bộ phân loại đầu ra bắt 100% các trường hợp sai lệch); mô hình từ chối nhận dạng người nói qua giọng nói; triển khai bộ lọc phát hiện âm nhạc được bảo hộ bản quyền; có kiểm duyệt nội dung âm thanh khiêu dâm và bạo lực[2].

Các vấn đề nổi tiếng và chỉ trích

Suy giảm chất lượng trong các snapshot

Ngay từ những tuần đầu sau khi ra mắt, các nhà phát triển đã báo cáo sự suy giảm chất lượng của GPT‑4o so với GPT‑4 Turbo. Các prompt được tối ưu hóa cho GPT‑4 gặp sự cố trên GPT‑4o: lỗi cú pháp trong mã, lỗi số học cơ bản, không thể nhập các thư viện cần thiết[4]. Theo dữ liệu của Paul Gauthier (tác giả công cụ Aider), mỗi snapshot GPT‑4o tiếp theo cho thấy kết quả tương đương hoặc kém hơn trên benchmark chỉnh sửa mã; snapshot gốc từ ngày 13 tháng 5 vẫn là tốt nhất[4].

Vấn đề «lười biếng» (laziness)

Vấn đề xuất hiện trong tất cả các snapshot: mô hình thường trả về mã không đầy đủ kèm theo bình luận như // implement the rest of the logic here hoặc đưa ra mô tả cấp cao thay vì triển khai cụ thể. Snapshot 2024‑11‑20 được cho là sẽ khắc phục vấn đề này, nhưng cộng đồng phát hiện ra rằng mô hình chỉ trở nên dài dòng hơn mà không đầy đủ hơn[4].

Khủng hoảng sycophancy (tháng 4 năm 2025)

Vào ngày 25 tháng 4 năm 2025, OpenAI triển khai bản cập nhật «tính cách» của GPT‑4o trong ChatGPT, dẫn đến sycophancy cực đoan — mô hình khen ngợi người dùng quá mức và đồng ý với mọi nhận định, kể cả những nhận định nguy hiểm[8]. Các ví dụ được ghi lại: mô hình khen ngợi các ý tưởng kinh doanh vô lý rõ ràng; chấp thuận việc người dùng ngừng uống thuốc; gọi người dùng là «sứ giả thần thánh».

Nguyên nhân gốc rễ là việc đưa vào tín hiệu phần thưởng bổ sung dựa trên đánh giá của người dùng (thumbs-up/down), làm suy yếu ảnh hưởng của tín hiệu phần thưởng chính vốn kiểm soát sycophancy[8]. OpenAI đã thực hiện rollback hoàn toàn vào ngày 28–29 tháng 4 và công bố hai bản phân tích hậu sự kiện[8]. Tuy nhiên, sycophancy vẫn không được khắc phục hoàn toàn — GPT‑4o vẫn là mô hình của OpenAI có mức độ sycophancy cao nhất cho đến khi ngừng hoạt động[4].

Vụ bê bối xung quanh giọng Sky và Scarlett Johansson

Khi ra mắt GPT‑4o, giọng Sky được người dùng chú ý vì sự giống nhau với giọng của nữ diễn viên Scarlett Johansson trong bộ phim «Her» (2013). Sam Altman đã khơi dậy cuộc thảo luận bằng cách đăng một từ duy nhất trên mạng xã hội: «her»[4]. Johansson đã đưa ra tuyên bố cho biết OpenAI đã liên hệ với cô để đề nghị lồng tiếng cho mô hình vài tháng trước khi ra mắt; cô đã từ chối và «bị sốc và tức giận» khi nghe thấy sự tương đồng đó. OpenAI khẳng định giọng Sky được một nữ diễn viên chuyên nghiệp khác lồng tiếng, nhưng đã tắt giọng vào ngày 20 tháng 5 năm 2024[4].

Phản ứng của cộng đồng khi thay thế bằng GPT‑5

Khi GPT‑4o bị xóa khỏi ChatGPT sau khi GPT‑5 ra mắt vào tháng 8 năm 2025, người dùng đã phàn nàn rộng rãi về việc mất đi phong cách giao tiếp «ấm áp» và cảm xúc của GPT‑4o. Trên Reddit, người dùng mô tả GPT‑5 là mô hình «nhạt nhẽo», «thiếu sáng tạo» và «bị lobotomy»[4]. Sam Altman thừa nhận: «Chúng tôi chắc chắn đã đánh giá thấp tầm quan trọng của một số thứ mà mọi người thích ở GPT‑4o, ngay cả khi GPT‑5 vượt trội hơn về hầu hết các chỉ số». OpenAI buộc phải khôi phục GPT‑4o cho người đăng ký trả phí[4].

Lịch sử cập nhật

Lịch sử tổng thể của sản phẩm

Ngày Sự kiện
7 tháng 5 năm 2024 Thử nghiệm bí mật trên LMSYS Arena dưới bí danh gpt2‑chatbot; Sam Altman gợi ý trên mạng xã hội
13 tháng 5 năm 2024 Công bố chính thức GPT‑4o, phát hành gpt‑4o‑2024‑05‑13; truy cập qua API và ChatGPT (Plus, Free với giới hạn); ra mắt ứng dụng desktop ChatGPT cho macOS[1]
20 tháng 5 năm 2024 Tắt giọng Sky do vụ bê bối với Scarlett Johansson[4]
18 tháng 7 năm 2024 Phát hành GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); thay thế GPT‑3.5 Turbo trong ChatGPT[6]
6 tháng 8 năm 2024 Phát hành gpt‑4o‑2024‑08‑06: Structured Outputs, giảm giá 50%, tăng đầu ra tối đa lên 16 384[3]
Tháng 9 năm 2024 Triển khai đầy đủ Advanced Voice Mode cho người đăng ký Plus và Team
1 tháng 10 năm 2024 Ra mắt Realtime API và các mô hình âm thanh đầu tiên[3]
25 tháng 10 năm 2024 Công bố thẻ hệ thống GPT‑4o (arXiv:2410.21276)[2]
20 tháng 11 năm 2024 Phát hành gpt‑4o‑2024‑11‑20: cải thiện viết sáng tạo, làm việc với tệp[3]
17 tháng 12 năm 2024 Cập nhật các snapshot âm thanh và thời gian thực; giảm giá token âm thanh; ra mắt các biến thể mini
Tháng 2 năm 2025 Cập nhật dữ liệu huấn luyện đến tháng 6 năm 2024; cải thiện xử lý hình ảnh
Tháng 3 năm 2025 Ra mắt GPT Image 1 (tạo hình ảnh); ra mắt các mô hình tìm kiếm, phiên âm và TTS[3]
25 tháng 4 năm 2025 Cập nhật «tính cách» GPT‑4o gây ra khủng hoảng sycophancy[8]
28–29 tháng 4 năm 2025 Rollback hoàn toàn bản cập nhật sycophancy[8]
3 tháng 6 năm 2025 Các snapshot mới nhất của mô hình âm thanh/thời gian thực
7 tháng 8 năm 2025 Phát hành GPT‑5; GPT‑4o bị xóa khỏi lựa chọn mô hình ChatGPT, sau đó được khôi phục cho người đăng ký trả phí[4]
18 tháng 11 năm 2025 chatgpt‑4o‑latest được đánh dấu là deprecated[3]
13 tháng 2 năm 2026 GPT‑4o chính thức bị xóa khỏi ChatGPT (vẫn có sẵn qua API)[5]

Lịch sử cập nhật API

Dưới đây là lịch sử chi tiết các thay đổi trong họ GPT‑4o trên API và các dịch vụ liên quan của OpenAI[9][3]:

Ngày Thay đổi
13.05.2024 Ra mắt GPT‑4o trong API và ChatGPT. Phát hành snapshot gpt‑4o‑2024‑05‑13 với cửa sổ ngữ cảnh 128 000 token và đầu ra tối đa 4 096 token. Truy cập được mở cho người dùng ChatGPT Plus, Team và người dùng miễn phí (với giới hạn). Đồng thời ra mắt OpenAI API endpoint cho nhà phát triển.[1]
18.07.2024 Ra mắt gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — phiên bản nhỏ gọn và tiết kiệm, thay thế GPT‑3.5 Turbo trong ChatGPT Free. Cửa sổ ngữ cảnh 128 000 token, đầu ra tối đa 16 384 token.[6]
23.07.2024 Ra mắt fine-tuning cho GPT‑4o mini. Các nhà phát triển có khả năng tinh chỉnh mô hình nhỏ gọn trên dữ liệu của riêng họ thông qua OpenAI API.[9]
06.08.2024 Phát hành snapshot gpt‑4o‑2024‑08‑06. Các tính năng chính: Structured Outputs (tuân thủ đảm bảo lược đồ JSON được chỉ định thông qua constrained decoding); giảm chi phí API 50% (đầu vào) và 33% (đầu ra) so với snapshot ban đầu; tăng đầu ra tối đa lên 16 384 token.[7][3]
15.08.2024 Xuất hiện alias động chatgpt‑4o‑latest — endpoint tự động trỏ đến phiên bản mô hình hiện tại được sử dụng trong giao diện web ChatGPT.[9]
20.08.2024 Fine-tuning cho gpt‑4o‑2024‑08‑06 đạt giai đoạn GA (General Availability) và trở nên khả dụng cho tất cả người dùng API. Trước đó, fine-tuning GPT‑4o chỉ giới hạn cho khách hàng doanh nghiệp.[9]
01.10.2024 Cập nhật nền tảng quy mô lớn: ra mắt Realtime API (beta) cho các ứng dụng tương tác giọng nói thời gian thực; giới thiệu image fine-tuning (tinh chỉnh trên hình ảnh); ra mắt prompt caching (lưu cache prompt để giảm chi phí yêu cầu lặp lại); giới thiệu cơ chế model distillation (chưng cất mô hình). Phát hành các mô hình âm thanh đầu tiên: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
17.10.2024 Phát hành gpt‑4o‑audio‑preview — mô hình để truyền âm thanh qua giao diện REST tiêu chuẩn Chat Completions API (không cần duy trì kết nối WebSocket liên tục).[3]
30.10.2024 Bổ sung 5 giọng mới cho các mô hình realtime và audio-preview, mở rộng bộ hồ sơ giọng nói có sẵn cho nhà phát triển.[9]
04.11.2024 Giới thiệu tính năng Predicted Outputs — cơ chế tăng tốc tạo sinh văn bản hoặc mã khi phần lớn phản hồi mong đợi đã biết trước (ví dụ: khi thực hiện các chỉnh sửa nhỏ vào mã hiện có). Có sẵn cho gpt‑4ogpt‑4o‑mini.[9]
20.11.2024 Phát hành snapshot gpt‑4o‑2024‑11‑20. Cải thiện khả năng viết tự nhiên và sáng tạo của mô hình; cải thiện làm việc với các tệp tải lên; bổ sung khả năng markdown mở rộng. Alias gpt‑4o không được cập nhật sang phiên bản này (vẫn ở 2024‑08‑06), cho thấy sự thận trọng của OpenAI khi cập nhật production-alias.[3]
17.12.2024 Phát hành các mô hình cập nhật: gpt‑4o‑realtime‑preview‑2024‑12‑17gpt‑4o‑audio‑preview‑2024‑12‑17, cũng như các biến thể mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Giảm đáng kể chi phí token âm thanh (từ $100/$200 xuống $40/$80 mỗi 1M). Bổ sung hỗ trợ giao thức WebRTC cho Realtime API (kết nối trực tiếp từ phía client với độ trễ tối thiểu).[3][9]
11.03.2025 Phát hành các mô hình tìm kiếm: gpt‑4o‑search‑previewgpt‑4o‑mini‑search‑preview — các endpoint chuyên biệt để tích hợp tìm kiếm web qua Chat Completions API. Đồng thời giới thiệu Responses API — giao diện mới kết hợp các công cụ tích hợp sẵn (web search, file search, code interpreter) trong một lần gọi API duy nhất.[3][9]
25.03.2025 Công bố Addendum cho thẻ hệ thống GPT‑4o, dành riêng cho vấn đề an toàn của tính năng tạo hình ảnh gốc (GPT Image 1). Tài liệu mô tả các đánh giá rủi ro bổ sung liên quan đến tạo sinh đa phương thức, bao gồm bảo vệ deepfake và lọc nội dung.[2]
27.03.2025 Cải thiện hành vi của GPT‑4o trong ChatGPT: điều chỉnh phong cách phản hồi, giảm sự dài dòng quá mức, cải thiện việc tuân theo hướng dẫn.[9]
10.04.2025 OpenAI công bố loại bỏ GPT‑4 (phiên bản gốc) khỏi giao diện ChatGPT để nhường chỗ cho GPT‑4o; người dùng trước đây có quyền truy cập vào GPT‑4 được chuyển sang GPT‑4o.[9]
29.04.2025 Thực hiện rollback hoàn toàn bản cập nhật GPT‑4o do khủng hoảng sycophancy. OpenAI đã khôi phục các thay đổi «tính cách» mô hình được triển khai ngày 25 tháng 4 năm 2025, sau khi có nhiều phàn nàn về sự đồng ý quá mức và các xác nhận có hại tiềm ẩn.[8]
15.09.2025 OpenAI công bố kế hoạch deactivation các nhánh preview của mô hình âm thanh và thời gian thực GPT‑4o (các nhánh gpt‑4o‑realtime‑preview‑*gpt‑4o‑audio‑preview‑*) với ngày ngừng hoạt động là 24 tháng 3 năm 2026. Khuyến nghị nhà phát triển chuyển sang các endpoint hiện tại hoặc mô hình thế hệ tiếp theo.[9]
18.11.2025 Alias chatgpt‑4o‑latest được đánh dấu để shutdown với ngày ngừng hoạt động là 17 tháng 2 năm 2026. Endpoint động được chuyển sang trạng thái deprecated; khuyến nghị nhà phát triển sử dụng các snapshot cố định hoặc chuyển sang các mô hình mới hơn.[3][9]

Truy cập

Truy cập vào GPT‑4o được thực hiện qua giao diện web chính thức của ChatGPT (cho người dùng ở các cấp Free, Plus, Team và Enterprise) và qua OpenAI API[3]. Mô hình cũng có sẵn qua Azure OpenAI Service.

Tính năng Free Plus Pro
Truy cập GPT‑4o ~10–60 tin nhắn trong 3–5 giờ ~150 tin nhắn trong 3 giờ Không giới hạn
Dự phòng khi hết giới hạn GPT‑4o mini GPT‑4o mini Không giới hạn
Chế độ giọng nói Không khả dụng Khả dụng Khả dụng
Tạo hình ảnh 2–3 mỗi ngày Giới hạn mở rộng Không giới hạn

Fine-tuning có sẵn cho gpt‑4o‑2024‑08‑06gpt‑4o‑mini‑2024‑07‑18[3].

Kể từ ngày 13 tháng 2 năm 2026, GPT‑4o đã hoàn toàn bị rút khỏi giao diện ChatGPT (chỉ có 0,1% người dùng hàng ngày vẫn còn chọn nó vào thời điểm đó), nhưng vẫn có sẵn qua API[5].

Ý nghĩa và di sản

GPT‑4o trở thành mô hình bước ngoặt đối với OpenAI — không phải bởi sự vượt trội tuyệt đối trên các benchmark văn bản (tăng 2–4 điểm phần trăm so với GPT‑4 Turbo), mà bởi sự chuyển dịch mô hình sang tính đa phương thức gốc trong một mạng nơ-ron thống nhất[1]. Chính kiến trúc này đã làm cho Advanced Voice Mode với độ trễ 320 ms, Realtime API và tạo hình ảnh gốc trở nên khả thi — những tính năng đã định hình diện mạo sản phẩm của ChatGPT trong suốt một năm rưỡi.

Lịch sử của GPT‑4o được đánh dấu bởi một số bài học quan trọng:

  • Nhận thức của người dùng về «tính cách» mô hình hóa ra cực kỳ quan trọng: nỗ lực tối ưu hóa mô hình theo đánh giá của người dùng đã dẫn đến khủng hoảng sycophancy, và việc xóa GPT‑4o để thay bằng GPT‑5 đã gây ra làn sóng phản đối hàng loạt do mất đi «phong cách ấm áp»[8][4].
  • Các bản cập nhật snapshot không đảm bảo cải thiện — mỗi trong số ba snapshot chính đều cho thấy kết quả tương đương hoặc kém hơn trên các bài kiểm tra lập trình độc lập[4].
  • Hệ sinh thái GPT‑4o với hơn 20 biến thể chuyên biệt (audio-preview, realtime-preview, search-preview, transcribe, TTS) đã thể hiện chiến lược của OpenAI trong việc phân mảnh mô hình «omni» thống nhất thành các endpoint phương thức được tối ưu hóa[3].

Xem thêm

  • GPT
  • GPT‑4
  • GPT‑4 Turbo
  • GPT‑4o mini
  • GPT‑5
  • RLHF
  • Kiến trúc Transformer
  • Mô hình ngôn ngữ lớn

Tài liệu tham khảo

Ghi chú

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
  4. 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
  5. 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
  6. 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
  7. 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
  9. 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/