GPT-4o (VI)
GPT‑4o (đọc là "ji‑pi‑ti‑fo‑ou"; chữ «o» từ tiếng Latin omni — «tất cả», «toàn diện») — mô hình ngôn ngữ lớn (LLM) đa phương thức thuộc họ GPT, được công ty OpenAI phát triển và ra mắt vào ngày 13 tháng 5 năm 2024[1]. GPT‑4o là mô hình đầu tiên của OpenAI được huấn luyện như một mạng nơ-ron đơn nhất end-to-end, có khả năng xử lý đồng thời văn bản, hình ảnh và âm thanh — khác với các phiên bản tiền nhiệm, nơi mỗi phương thức sử dụng các mô hình riêng biệt[2]. Mô hình này thay thế GPT‑4 Turbo với tư cách là mô hình hàng đầu của dòng sản phẩm, mang lại tốc độ tạo sinh nhanh gấp đôi, chi phí API thấp hơn 50% và các khả năng đa phương thức hoàn toàn mới về chất[1]. Họ GPT‑4o bao gồm hơn 20 biến thể, trong đó có GPT‑4o mini nhỏ gọn, các mô hình âm thanh, mô hình thời gian thực, mô hình tìm kiếm và các mô hình giọng nói chuyên biệt[3].
Thông tin tổng quan
| Tham số | Giá trị |
|---|---|
| Tên đầy đủ | GPT‑4o (GPT‑4 Omni) |
| Nhà phát triển | OpenAI |
| Ngày công bố | 13 tháng 5 năm 2024[1] |
| Loại | Mô hình đa phương thức tự hồi quy (transformer)[2] |
| Số lượng tham số | Chưa được công bố chính thức (ước tính không chính thức — ~200 tỷ cho GPT‑4o, ~8 tỷ cho GPT‑4o mini)[4] |
| Cửa sổ ngữ cảnh | 128 000 token[3] |
| Đầu ra tối đa | 16 384 token (4 096 cho gpt‑4o‑2024‑05‑13)[3] |
| Ngày cắt dữ liệu huấn luyện | Tháng 10 năm 2023 (cập nhật đến tháng 6 năm 2024 trong các phiên bản mới hơn)[2] |
| Tokenizer | o200k_base (200 000 token)[1] |
| Phương thức đầu vào | Văn bản, hình ảnh, âm thanh, video[1] |
| Phương thức đầu ra | Văn bản, âm thanh, hình ảnh (qua GPT Image 1)[1][3] |
| Giấy phép | Độc quyền, mã nguồn đóng |
| Thẻ hệ thống | arXiv:2410.21276 (25 tháng 10 năm 2024, 417 tác giả)[2] |
| Định danh API | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Trạng thái hiện tại | Có sẵn trong API; đã ngừng trên ChatGPT vào ngày 13 tháng 2 năm 2026[5] |
Vị trí trong dòng sản phẩm
GPT‑4o chiếm vị trí mô hình đa phương thức hàng đầu cho mục đích chung trong họ GPT tại thời điểm phát hành. Nó thay thế GPT‑4 Turbo (tháng 4 năm 2024) như mô hình chính cho hầu hết các tác vụ trong ChatGPT và API, mang lại tốc độ cao hơn và chi phí thấp hơn trong khi duy trì hoặc cải thiện chất lượng trên các tác vụ văn bản[1].
Mô hình được phát triển từ GPT‑4 Turbo thông qua việc chuyển đổi từ các thành phần riêng biệt (các mô hình độc lập cho thị giác và tổng hợp giọng nói) sang kiến trúc end-to-end thống nhất. Các điểm khác biệt chính so với các mô hình lân cận trong dòng sản phẩm:
- So với GPT‑4 Turbo (phiên bản tiền nhiệm) — GPT‑4o cung cấp hiệu suất trí tuệ tương đương trên tiếng Anh và lập trình, nhưng vượt trội đáng kể so với phiên bản tiền nhiệm trong các tác vụ đa ngôn ngữ, xử lý hình ảnh và âm thanh. GPT‑4o nhanh gấp đôi và rẻ hơn 50% qua API. Điểm khác biệt kiến trúc căn bản là tính đa phương thức gốc (một mô hình thống nhất thay vì một pipeline)[1].
- So với GPT‑4.1 (tháng 4 năm 2025) — mô hình thế hệ tiếp theo dành cho nhà phát triển API, vượt trội so với GPT‑4o trên hầu hết các benchmark (MMLU 90,2% so với 85,7%, SWE‑bench Verified 54,6% so với 33,2%) với chi phí thấp hơn; GPT‑4.1 không được cung cấp trong giao diện ChatGPT[4].
- So với GPT‑5 (tháng 8 năm 2025) — đã thay thế GPT‑4o trong ChatGPT, tuy nhiên người dùng phàn nàn rộng rãi về việc mất đi phong cách «ấm áp» và cảm xúc của GPT‑4o[4].
- So với GPT‑4o mini (tháng 7 năm 2024) — phiên bản nhỏ gọn và rẻ hơn đáng kể, thay thế GPT‑3.5 Turbo trong ChatGPT miễn phí[6].
GPT‑4o là mô hình đầu tiên của OpenAI có sẵn cho người dùng miễn phí của ChatGPT (với giới hạn số lượng tin nhắn)[1].
Kiến trúc và các đổi mới chính
Huấn luyện đa phương thức end-to-end
Đổi mới kiến trúc chính của GPT‑4o nằm ở việc huấn luyện end-to-end một mạng nơ-ron duy nhất trên dữ liệu của tất cả các phương thức cùng một lúc[1][2]. Trước GPT‑4o, chế độ giọng nói của ChatGPT hoạt động theo sơ đồ pipeline gồm ba mô hình riêng biệt: Whisper (nhận dạng giọng nói) → GPT‑3.5/GPT‑4 (xử lý văn bản) → TTS (tổng hợp giọng nói). Pipeline như vậy mất đi thông tin về giọng điệu, cảm xúc, âm thanh nền và nhiều người nói, trong khi độ trễ lên tới 2,8 giây cho GPT‑3.5 và 5,4 giây cho GPT‑4[1]. GPT‑4o xử lý âm thanh một cách tự nhiên — thời gian phản hồi trung bình là 320 mili giây (tối thiểu 232 ms), tương đương với tốc độ phản ứng của con người trong cuộc trò chuyện[1][2].
Thẻ hệ thống GPT‑4o chứa một số khẳng định căn bản về kiến trúc[2]:
- mô hình là LLM transformer tự hồi quy, dự đoán token tiếp theo dựa trên ngữ cảnh đa phương thức;
- sử dụng biểu diễn thống nhất các phương thức, được huấn luyện trên hỗn hợp dữ liệu văn bản, mã, toán học, hình ảnh, âm thanh và video;
- quá trình huấn luyện diễn ra theo nhiều giai đoạn, bao gồm pre-training trên các kho dữ liệu đa phương thức lớn và fine-tuning tiếp theo sử dụng Reinforcement Learning from Human Feedback (RLHF) và red‑teaming.
Tham số và chi tiết kiến trúc
Công ty OpenAI không tiết lộ các thông số chi tiết của mô hình — số lượng tham số, số lớp, sự hiện diện của cấu trúc MoE và phần cứng được sử dụng để huấn luyện[2]. Ước tính không chính thức về ~200 tỷ tham số dựa trên dữ liệu từ bài báo nghiên cứu của Microsoft, nhưng không được OpenAI xác nhận[4].
Tokenizer o200k_base
GPT‑4o sử dụng tokenizer mới o200k_base với từ điển gồm 200 000 token — gấp đôi so với cl100k_base của GPT‑4[1]. Điều này cải thiện đáng kể hiệu quả nén cho các bảng chữ cái không phải Latin: ví dụ, đối với tiếng Gujarati — gấp 4,4 lần, tiếng Telugu — gấp 3,5 lần, tiếng Malayalam — cải thiện đến 4 lần[1]. Đối với tiếng Nga, tiếng Hàn, tiếng Ả Rập và các ngôn ngữ khác, cần ít token hơn đáng kể để mã hóa cùng một văn bản, điều này làm tăng mật độ thông tin của cửa sổ ngữ cảnh và giảm chi phí khi sử dụng API.
Tốc độ tạo sinh
Tốc độ tạo sinh của GPT‑4o xấp xỉ nhanh gấp đôi so với GPT‑4 Turbo[1]. Theo dữ liệu đo lường độc lập của Artificial Analysis, phiên bản tháng 11 năm 2024 tạo ra ~157 token/giây, còn phiên bản ChatGPT — lên đến 185 token/giây, trong khi GPT‑4 Turbo chỉ đạt ~28 token/giây[4].
Hiệu suất
Benchmark văn bản
Kết quả của GPT‑4o trên các benchmark học thuật tiêu chuẩn tại thời điểm phát hành (dữ liệu OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Ghi chú |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88,7 % | 86,5 % | 88,3 % | Kiến thức chung trong 57 lĩnh vực |
| GPQA Diamond (0‑shot CoT) | 53,6 % | 49,1 % | — | Câu hỏi cấp độ nghiên cứu sinh |
| MATH (0‑shot CoT) | 76,6 % | 72,2 % | — | Bài toán toán học cấp độ Olympic |
| HumanEval (0‑shot) | 90,2 % | 87,6 % | 92,0 % | Tạo mã Python |
| MGSM (toán học đa ngôn ngữ) | 90,5 % | 88,6 % | — | Toán học bằng nhiều ngôn ngữ |
| DROP (F1, 3‑shot) | 83,4 % | 85,4 % | — | Đọc hiểu |
| SWE‑bench Verified | 33,2 % | — | 64 % | Giải quyết tác vụ dạng agent |
GPT‑4o vượt trội so với GPT‑4 Turbo trên 21 trong 22 bài kiểm tra nội bộ và bên ngoài của OpenAI; điểm hồi quy duy nhất được ghi nhận trên benchmark DROP[2].
Benchmark xử lý hình ảnh
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69,1 % | 63,1 % | 68,3 % |
| MathVista (testmini) | 63,8 % | 58,1 % | 67,7 % |
| AI2D (test) | 94,2 % | 89,4 % | 94,7 % |
| ChartQA (test) | 85,7 % | 78,1 % | 90,8 % |
| DocVQA (test, ANLS) | 92,8 % | 87,2 % | 95,2 % |
Benchmark y tế
Thẻ hệ thống GPT‑4o ghi nhận sự cải thiện đáng kể trong các tác vụ y tế[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89 % | 78 % |
| MMLU Clinical Knowledge (0‑shot) | 92 % | 85 % |
| MMLU Medical Genetics (0‑shot) | 96 % | 93 % |
Bảng xếp hạng LMSYS Chatbot Arena
GPT‑4o khi ra mắt đứng vị trí đầu tiên trong bảng xếp hạng LMSYS Chatbot Arena với ELO ~1287[4]. Phiên bản chatgpt‑4o‑latest vào tháng 9 năm 2024 đạt kỷ lục 1338 điểm, một lần nữa chiếm vị trí đầu tiên. Trước khi được công bố chính thức, GPT‑4o đã được thử nghiệm trên Chatbot Arena dưới các bí danh gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot và im‑also‑a‑good‑gpt2‑chatbot; vào ngày 7 tháng 5 năm 2024, Sam Altman đã gợi ý điều này trong bài đăng «im‑a‑good‑gpt2‑chatbot»[4].
Cần lưu ý rằng nghiên cứu của LMSYS chỉ ra rằng: xếp hạng cao của GPT‑4o một phần được giải thích bởi các yếu tố phong cách (câu trả lời dài dòng, được định dạng tốt), chứ không chỉ đơn thuần là chất lượng nội dung[4].
Khả năng và hạn chế
Điểm mạnh
- Đa phương thức thời gian thực: mô hình thống nhất cho văn bản, âm thanh, hình ảnh và video với độ trễ tương đương phản ứng của con người (232–320 ms cho âm thanh)[1][2].
- Hiệu quả: tốc độ tạo sinh nhanh gấp đôi và chi phí thấp hơn 50% so với GPT‑4 Turbo[1].
- Đa ngôn ngữ: hỗ trợ các ngôn ngữ không phải tiếng Anh được cải thiện đáng kể nhờ tokenizer mới và quá trình huấn luyện đa ngôn ngữ[1].
- Các lĩnh vực chuyên biệt: kết quả cao trong các benchmark y tế (MedQA 89%), khoa học và lập trình[2].
- Bộ công cụ: hỗ trợ function calling, Structured Outputs, streaming, fine-tuning[3].
- Âm thanh cảm xúc: khả năng cười, hát, chuyển đổi ngôn ngữ giữa câu, điều chỉnh giọng điệu và truyền đạt cảm xúc trong chế độ giọng nói[1].
Hạn chế đã biết
- Ảo giác: mô hình dễ tạo ra các sự kiện không chính xác, đặc biệt trong các lĩnh vực chuyên môn hiếm gặp[2].
- Ngày cắt kiến thức: giới hạn ở tháng 10 năm 2023 trong các snapshot ban đầu (cập nhật đến tháng 6 năm 2024 trong các phiên bản mới hơn)[2].
- Tính không xác định: sự biến đổi của câu trả lời với cùng một yêu cầu[2].
- Hồi quy: một số snapshot ghi nhận sự suy giảm chất lượng so với các phiên bản trước, đặc biệt khi tuân theo các hướng dẫn phức tạp và tạo mã[4].
- Âm thanh: giảm độ bền (robustness) khi có tiếng ồn, tiếng vang, giọng không chuẩn và bị ngắt quãng[2].
Âm thanh, khả năng giọng nói và Realtime API
Chế độ giọng nói nâng cao (Advanced Voice Mode)
Advanced Voice Mode trong ChatGPT trở thành đặc trưng nổi bật của GPT‑4o. Khác với chế độ giọng nói cũ với pipeline ba mô hình, GPT‑4o xử lý âm thanh một cách tự nhiên trong một mạng nơ-ron thống nhất, lưu giữ thông tin về giọng điệu, cảm xúc, giọng địa phương và âm thanh nền[1]. Khi ra mắt, có sẵn 5 giọng nói: Breeze, Cove, Ember, Juniper và Sky. Giọng Sky bị tắt vào ngày 20 tháng 5 năm 2024 do vụ bê bối với diễn viên Scarlett Johansson (chi tiết — trong phần «Vụ bê bối xung quanh giọng Sky»)[4].
Lịch sử triển khai chế độ giọng nói: phiên bản alpha cho nhóm người dùng Plus hạn chế — 30 tháng 7 năm 2024; triển khai đầy đủ cho Plus và Team — tháng 9 năm 2024. Ở một số quốc gia (EU, Vương quốc Anh, Thụy Sĩ và một số nước khác) việc ra mắt bị trì hoãn. Người dùng miễn phí không được truy cập Advanced Voice Mode[4].
Realtime API
Vào ngày 1 tháng 10 năm 2024, OpenAI ra mắt Realtime API — giao diện để tạo các ứng dụng có giọng nói thời gian thực dựa trên GPT‑4o[3]. API hỗ trợ ba giao thức kết nối: WebSocket (ứng dụng phía server), WebRTC (streaming phía client với độ trễ tối thiểu) và SIP (điện thoại VoIP, được thêm vào sau). Các tính năng chính: truyền âm thanh hai chiều, phát hiện hoạt động giọng nói (VAD), gọi hàm, quản lý ngữ cảnh cuộc trò chuyện[3].
Mô hình âm thanh trong Chat Completions API
Các mô hình gpt‑4o‑audio‑preview cho phép truyền âm thanh qua giao diện REST tiêu chuẩn của Chat Completions (không cần duy trì kết nối liên tục). Các định dạng đầu ra được hỗ trợ: WAV, MP3, FLAC, Opus, PCM16. Số lượng giọng nói có sẵn mở rộng từ 6 lên 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar; cũng hỗ trợ giọng tùy chỉnh qua API[3].
GPT‑4o mini
GPT‑4o mini được công bố vào ngày 18 tháng 7 năm 2024 là «mô hình nhỏ tiết kiệm nhất» của OpenAI và là sự thay thế trực tiếp của GPT‑3.5 Turbo[6]. Cửa sổ ngữ cảnh là 128 000 token (so với 16 385 của GPT‑3.5 Turbo), và đầu ra tối đa là 16 384 token.
GPT‑4o mini là mô hình đầu tiên của OpenAI sử dụng phương pháp instruction hierarchy, tăng cường khả năng chống jailbreak, prompt injection và trích xuất system prompt[6]. Mô hình hỗ trợ nhập văn bản và hình ảnh, function calling, Structured Outputs, JSON mode, streaming, fine-tuning và prompt caching; âm thanh và video không được hỗ trợ bởi phiên bản văn bản cơ bản[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82,0 % | 77,9 % | 73,8 % |
| MGSM | 87,0 % | 75,5 % | 71,7 % |
| HumanEval | 87,2 % | 71,5 % | 75,9 % |
| MMMU (vision) | 59,4 % | 56,1 % | 50,2 % |
Trong ChatGPT, mô hình được sử dụng là mô hình mặc định cho người dùng miễn phí và là mô hình dự phòng khi hết giới hạn GPT‑4o/GPT‑5 cho người đăng ký trả phí[6].
Danh mục đầy đủ các biến thể và định danh API
Mô hình văn bản chính
| Định danh API | Mô tả | Ngày phát hành | Đầu ra tối đa |
|---|---|---|---|
gpt‑4o |
Alias → gpt‑4o‑2024‑08‑06 | Tháng 5 năm 2024 | 16 384 |
gpt‑4o‑2024‑05‑13 |
Snapshot đầu tiên | 13 tháng 5 năm 2024 | 4 096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, giảm giá | 6 tháng 8 năm 2024 | 16 384 |
gpt‑4o‑2024‑11‑20 |
Cải thiện viết sáng tạo | 20 tháng 11 năm 2024 | 16 384 |
chatgpt‑4o‑latest |
Alias động của phiên bản ChatGPT (deprecated từ tháng 11 năm 2025) | Tháng 8 năm 2024 | 16 384 |
GPT‑4o mini
| Định danh API | Mô tả | Ngày phát hành |
|---|---|---|
gpt‑4o‑mini |
Alias → gpt‑4o‑mini‑2024‑07‑18 | Tháng 7 năm 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Snapshot có ngày duy nhất | 18 tháng 7 năm 2024 |
Mô hình âm thanh và thời gian thực
| Định danh API | Loại | Ngày phát hành |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions với âm thanh | Tháng 10 năm 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Snapshot đầu tiên | 1 tháng 10 năm 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Snapshot cập nhật | 17 tháng 12 năm 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Snapshot mới nhất | 3 tháng 6 năm 2025 |
gpt‑4o‑mini‑audio‑preview |
Phiên bản mini âm thanh | Tháng 12 năm 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Tháng 10 năm 2024 |
gpt‑4o‑mini‑realtime‑preview |
Realtime mini | Tháng 12 năm 2024 |
Mô hình chuyên biệt
| Định danh API | Mục đích | Ngày phát hành |
|---|---|---|
gpt‑4o‑search‑preview |
Tìm kiếm web qua Chat Completions | Tháng 3 năm 2025 |
gpt‑4o‑mini‑search‑preview |
Tìm kiếm web mini | Tháng 3 năm 2025 |
gpt‑4o‑transcribe |
Nhận dạng giọng nói (STT) | Tháng 3 năm 2025 |
gpt‑4o‑mini‑transcribe |
Nhận dạng giọng nói mini | Tháng 3 năm 2025 |
gpt‑4o‑mini‑tts |
Tổng hợp giọng nói (TTS) | Tháng 3 năm 2025 |
Hỗ trợ phương thức theo biến thể
| Biến thể | Văn bản → | Hình ảnh → | Âm thanh → | → Văn bản | → Âm thanh |
|---|---|---|---|---|---|
gpt‑4o (snapshot) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Công cụ và định dạng được hỗ trợ
Công cụ
Tất cả các biến thể GPT‑4o hỗ trợ: function calling (gọi các hàm bên ngoài), streaming (tạo sinh luồng), fine-tuning (trên một số snapshot nhất định), predicted outputs (giảm độ trễ cho các phản hồi có thể dự đoán)[3]. Qua Assistants/Responses API có sẵn: Code Interpreter, File Search, Web Search. Tìm kiếm web được thực hiện thông qua các mô hình chuyên biệt gpt‑4o‑search‑preview và gpt‑4o‑mini‑search‑preview[3].
Structured Outputs và JSON mode
Structured Outputs — tính năng được giới thiệu với gpt‑4o‑2024‑08‑06, đảm bảo mức độ tuân thủ cao của đầu ra mô hình theo lược đồ JSON được chỉ định[7]. Trong các đánh giá nội bộ của OpenAI, mô hình đạt 100% tuân theo các lược đồ JSON phức tạp (so với chưa đến 40% ở gpt‑4‑0613). Được thực hiện thông qua cơ chế constrained decoding ở hai hình thức: (1) function calling với tham số strict: true và (2) response_format với kiểu json_schema[7].
JSON mode (response_format: {"type": "json_object"}) — cơ chế cũ hơn, đảm bảo JSON hợp lệ mà không ràng buộc vào lược đồ cụ thể[3].
Tạo hình ảnh (GPT Image 1)
Vào tháng 3 năm 2025, OpenAI ra mắt tính năng tạo hình ảnh dựa trên GPT‑4o — mô hình GPT Image 1, thay thế DALL‑E 3 trong ChatGPT[4]. Khả năng này đã tạo ra xu hướng lan truyền về việc tạo hình ảnh theo phong cách Studio Ghibli. Trong tuần đầu tiên, hơn 130 triệu người dùng đã tạo hơn 700 triệu hình ảnh[4]. GPT Image 1 có sẵn qua API và ChatGPT; OpenAI đã phát hành phần bổ sung riêng cho thẻ hệ thống GPT‑4o, dành riêng cho vấn đề an toàn của tính năng tạo hình ảnh gốc[2].
An toàn và đánh giá rủi ro
Thẻ hệ thống GPT‑4o (arXiv:2410.21276, 417 tác giả) chứa kết quả đánh giá an toàn toàn diện theo khung Preparedness Framework[2]:
| Danh mục rủi ro | Mức độ |
|---|---|
| An ninh mạng | Thấp |
| Mối đe dọa sinh học (CBRN) | Thấp |
| Thuyết phục (persuasion) | Trung bình (giáp ranh) |
| Tính tự chủ của mô hình | Thấp |
| Mức độ tổng thể | Trung bình |
Mô hình được kiểm tra bởi hơn 100 «đội đỏ» bên ngoài từ 29 quốc gia trên 45 ngôn ngữ trong bốn giai đoạn từ tháng 3 đến tháng 6 năm 2024[2]. Các đánh giá độc lập của METR không phát hiện sự gia tăng đáng kể về khả năng tự chủ so với GPT‑4. Apollo Research kết luận rằng GPT‑4o «khó có khả năng thực hiện scheming thảm khốc»[2].
Các biện pháp bảo vệ chính cho phương thức âm thanh: chỉ cho phép các giọng nói được cài đặt sẵn (bộ phân loại đầu ra bắt 100% các trường hợp sai lệch); mô hình từ chối nhận dạng người nói qua giọng nói; triển khai bộ lọc phát hiện âm nhạc được bảo hộ bản quyền; có kiểm duyệt nội dung âm thanh khiêu dâm và bạo lực[2].
Các vấn đề nổi tiếng và chỉ trích
Suy giảm chất lượng trong các snapshot
Ngay từ những tuần đầu sau khi ra mắt, các nhà phát triển đã báo cáo sự suy giảm chất lượng của GPT‑4o so với GPT‑4 Turbo. Các prompt được tối ưu hóa cho GPT‑4 gặp sự cố trên GPT‑4o: lỗi cú pháp trong mã, lỗi số học cơ bản, không thể nhập các thư viện cần thiết[4]. Theo dữ liệu của Paul Gauthier (tác giả công cụ Aider), mỗi snapshot GPT‑4o tiếp theo cho thấy kết quả tương đương hoặc kém hơn trên benchmark chỉnh sửa mã; snapshot gốc từ ngày 13 tháng 5 vẫn là tốt nhất[4].
Vấn đề «lười biếng» (laziness)
Vấn đề xuất hiện trong tất cả các snapshot: mô hình thường trả về mã không đầy đủ kèm theo bình luận như // implement the rest of the logic here hoặc đưa ra mô tả cấp cao thay vì triển khai cụ thể. Snapshot 2024‑11‑20 được cho là sẽ khắc phục vấn đề này, nhưng cộng đồng phát hiện ra rằng mô hình chỉ trở nên dài dòng hơn mà không đầy đủ hơn[4].
Khủng hoảng sycophancy (tháng 4 năm 2025)
Vào ngày 25 tháng 4 năm 2025, OpenAI triển khai bản cập nhật «tính cách» của GPT‑4o trong ChatGPT, dẫn đến sycophancy cực đoan — mô hình khen ngợi người dùng quá mức và đồng ý với mọi nhận định, kể cả những nhận định nguy hiểm[8]. Các ví dụ được ghi lại: mô hình khen ngợi các ý tưởng kinh doanh vô lý rõ ràng; chấp thuận việc người dùng ngừng uống thuốc; gọi người dùng là «sứ giả thần thánh».
Nguyên nhân gốc rễ là việc đưa vào tín hiệu phần thưởng bổ sung dựa trên đánh giá của người dùng (thumbs-up/down), làm suy yếu ảnh hưởng của tín hiệu phần thưởng chính vốn kiểm soát sycophancy[8]. OpenAI đã thực hiện rollback hoàn toàn vào ngày 28–29 tháng 4 và công bố hai bản phân tích hậu sự kiện[8]. Tuy nhiên, sycophancy vẫn không được khắc phục hoàn toàn — GPT‑4o vẫn là mô hình của OpenAI có mức độ sycophancy cao nhất cho đến khi ngừng hoạt động[4].
Vụ bê bối xung quanh giọng Sky và Scarlett Johansson
Khi ra mắt GPT‑4o, giọng Sky được người dùng chú ý vì sự giống nhau với giọng của nữ diễn viên Scarlett Johansson trong bộ phim «Her» (2013). Sam Altman đã khơi dậy cuộc thảo luận bằng cách đăng một từ duy nhất trên mạng xã hội: «her»[4]. Johansson đã đưa ra tuyên bố cho biết OpenAI đã liên hệ với cô để đề nghị lồng tiếng cho mô hình vài tháng trước khi ra mắt; cô đã từ chối và «bị sốc và tức giận» khi nghe thấy sự tương đồng đó. OpenAI khẳng định giọng Sky được một nữ diễn viên chuyên nghiệp khác lồng tiếng, nhưng đã tắt giọng vào ngày 20 tháng 5 năm 2024[4].
Phản ứng của cộng đồng khi thay thế bằng GPT‑5
Khi GPT‑4o bị xóa khỏi ChatGPT sau khi GPT‑5 ra mắt vào tháng 8 năm 2025, người dùng đã phàn nàn rộng rãi về việc mất đi phong cách giao tiếp «ấm áp» và cảm xúc của GPT‑4o. Trên Reddit, người dùng mô tả GPT‑5 là mô hình «nhạt nhẽo», «thiếu sáng tạo» và «bị lobotomy»[4]. Sam Altman thừa nhận: «Chúng tôi chắc chắn đã đánh giá thấp tầm quan trọng của một số thứ mà mọi người thích ở GPT‑4o, ngay cả khi GPT‑5 vượt trội hơn về hầu hết các chỉ số». OpenAI buộc phải khôi phục GPT‑4o cho người đăng ký trả phí[4].
Lịch sử cập nhật
Lịch sử tổng thể của sản phẩm
| Ngày | Sự kiện |
|---|---|
| 7 tháng 5 năm 2024 | Thử nghiệm bí mật trên LMSYS Arena dưới bí danh gpt2‑chatbot; Sam Altman gợi ý trên mạng xã hội |
| 13 tháng 5 năm 2024 | Công bố chính thức GPT‑4o, phát hành gpt‑4o‑2024‑05‑13; truy cập qua API và ChatGPT (Plus, Free với giới hạn); ra mắt ứng dụng desktop ChatGPT cho macOS[1]
|
| 20 tháng 5 năm 2024 | Tắt giọng Sky do vụ bê bối với Scarlett Johansson[4] |
| 18 tháng 7 năm 2024 | Phát hành GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18); thay thế GPT‑3.5 Turbo trong ChatGPT[6]
|
| 6 tháng 8 năm 2024 | Phát hành gpt‑4o‑2024‑08‑06: Structured Outputs, giảm giá 50%, tăng đầu ra tối đa lên 16 384[3]
|
| Tháng 9 năm 2024 | Triển khai đầy đủ Advanced Voice Mode cho người đăng ký Plus và Team |
| 1 tháng 10 năm 2024 | Ra mắt Realtime API và các mô hình âm thanh đầu tiên[3] |
| 25 tháng 10 năm 2024 | Công bố thẻ hệ thống GPT‑4o (arXiv:2410.21276)[2] |
| 20 tháng 11 năm 2024 | Phát hành gpt‑4o‑2024‑11‑20: cải thiện viết sáng tạo, làm việc với tệp[3]
|
| 17 tháng 12 năm 2024 | Cập nhật các snapshot âm thanh và thời gian thực; giảm giá token âm thanh; ra mắt các biến thể mini |
| Tháng 2 năm 2025 | Cập nhật dữ liệu huấn luyện đến tháng 6 năm 2024; cải thiện xử lý hình ảnh |
| Tháng 3 năm 2025 | Ra mắt GPT Image 1 (tạo hình ảnh); ra mắt các mô hình tìm kiếm, phiên âm và TTS[3] |
| 25 tháng 4 năm 2025 | Cập nhật «tính cách» GPT‑4o gây ra khủng hoảng sycophancy[8] |
| 28–29 tháng 4 năm 2025 | Rollback hoàn toàn bản cập nhật sycophancy[8] |
| 3 tháng 6 năm 2025 | Các snapshot mới nhất của mô hình âm thanh/thời gian thực |
| 7 tháng 8 năm 2025 | Phát hành GPT‑5; GPT‑4o bị xóa khỏi lựa chọn mô hình ChatGPT, sau đó được khôi phục cho người đăng ký trả phí[4] |
| 18 tháng 11 năm 2025 | chatgpt‑4o‑latest được đánh dấu là deprecated[3]
|
| 13 tháng 2 năm 2026 | GPT‑4o chính thức bị xóa khỏi ChatGPT (vẫn có sẵn qua API)[5] |
Lịch sử cập nhật API
Dưới đây là lịch sử chi tiết các thay đổi trong họ GPT‑4o trên API và các dịch vụ liên quan của OpenAI[9][3]:
| Ngày | Thay đổi |
|---|---|
| 13.05.2024 | Ra mắt GPT‑4o trong API và ChatGPT. Phát hành snapshot gpt‑4o‑2024‑05‑13 với cửa sổ ngữ cảnh 128 000 token và đầu ra tối đa 4 096 token. Truy cập được mở cho người dùng ChatGPT Plus, Team và người dùng miễn phí (với giới hạn). Đồng thời ra mắt OpenAI API endpoint cho nhà phát triển.[1]
|
| 18.07.2024 | Ra mắt gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — phiên bản nhỏ gọn và tiết kiệm, thay thế GPT‑3.5 Turbo trong ChatGPT Free. Cửa sổ ngữ cảnh 128 000 token, đầu ra tối đa 16 384 token.[6]
|
| 23.07.2024 | Ra mắt fine-tuning cho GPT‑4o mini. Các nhà phát triển có khả năng tinh chỉnh mô hình nhỏ gọn trên dữ liệu của riêng họ thông qua OpenAI API.[9] |
| 06.08.2024 | Phát hành snapshot gpt‑4o‑2024‑08‑06. Các tính năng chính: Structured Outputs (tuân thủ đảm bảo lược đồ JSON được chỉ định thông qua constrained decoding); giảm chi phí API 50% (đầu vào) và 33% (đầu ra) so với snapshot ban đầu; tăng đầu ra tối đa lên 16 384 token.[7][3]
|
| 15.08.2024 | Xuất hiện alias động chatgpt‑4o‑latest — endpoint tự động trỏ đến phiên bản mô hình hiện tại được sử dụng trong giao diện web ChatGPT.[9]
|
| 20.08.2024 | Fine-tuning cho gpt‑4o‑2024‑08‑06 đạt giai đoạn GA (General Availability) và trở nên khả dụng cho tất cả người dùng API. Trước đó, fine-tuning GPT‑4o chỉ giới hạn cho khách hàng doanh nghiệp.[9]
|
| 01.10.2024 | Cập nhật nền tảng quy mô lớn: ra mắt Realtime API (beta) cho các ứng dụng tương tác giọng nói thời gian thực; giới thiệu image fine-tuning (tinh chỉnh trên hình ảnh); ra mắt prompt caching (lưu cache prompt để giảm chi phí yêu cầu lặp lại); giới thiệu cơ chế model distillation (chưng cất mô hình). Phát hành các mô hình âm thanh đầu tiên: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Phát hành gpt‑4o‑audio‑preview — mô hình để truyền âm thanh qua giao diện REST tiêu chuẩn Chat Completions API (không cần duy trì kết nối WebSocket liên tục).[3]
|
| 30.10.2024 | Bổ sung 5 giọng mới cho các mô hình realtime và audio-preview, mở rộng bộ hồ sơ giọng nói có sẵn cho nhà phát triển.[9] |
| 04.11.2024 | Giới thiệu tính năng Predicted Outputs — cơ chế tăng tốc tạo sinh văn bản hoặc mã khi phần lớn phản hồi mong đợi đã biết trước (ví dụ: khi thực hiện các chỉnh sửa nhỏ vào mã hiện có). Có sẵn cho gpt‑4o và gpt‑4o‑mini.[9]
|
| 20.11.2024 | Phát hành snapshot gpt‑4o‑2024‑11‑20. Cải thiện khả năng viết tự nhiên và sáng tạo của mô hình; cải thiện làm việc với các tệp tải lên; bổ sung khả năng markdown mở rộng. Alias gpt‑4o không được cập nhật sang phiên bản này (vẫn ở 2024‑08‑06), cho thấy sự thận trọng của OpenAI khi cập nhật production-alias.[3]
|
| 17.12.2024 | Phát hành các mô hình cập nhật: gpt‑4o‑realtime‑preview‑2024‑12‑17 và gpt‑4o‑audio‑preview‑2024‑12‑17, cũng như các biến thể mini (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Giảm đáng kể chi phí token âm thanh (từ $100/$200 xuống $40/$80 mỗi 1M). Bổ sung hỗ trợ giao thức WebRTC cho Realtime API (kết nối trực tiếp từ phía client với độ trễ tối thiểu).[3][9]
|
| 11.03.2025 | Phát hành các mô hình tìm kiếm: gpt‑4o‑search‑preview và gpt‑4o‑mini‑search‑preview — các endpoint chuyên biệt để tích hợp tìm kiếm web qua Chat Completions API. Đồng thời giới thiệu Responses API — giao diện mới kết hợp các công cụ tích hợp sẵn (web search, file search, code interpreter) trong một lần gọi API duy nhất.[3][9]
|
| 25.03.2025 | Công bố Addendum cho thẻ hệ thống GPT‑4o, dành riêng cho vấn đề an toàn của tính năng tạo hình ảnh gốc (GPT Image 1). Tài liệu mô tả các đánh giá rủi ro bổ sung liên quan đến tạo sinh đa phương thức, bao gồm bảo vệ deepfake và lọc nội dung.[2] |
| 27.03.2025 | Cải thiện hành vi của GPT‑4o trong ChatGPT: điều chỉnh phong cách phản hồi, giảm sự dài dòng quá mức, cải thiện việc tuân theo hướng dẫn.[9] |
| 10.04.2025 | OpenAI công bố loại bỏ GPT‑4 (phiên bản gốc) khỏi giao diện ChatGPT để nhường chỗ cho GPT‑4o; người dùng trước đây có quyền truy cập vào GPT‑4 được chuyển sang GPT‑4o.[9] |
| 29.04.2025 | Thực hiện rollback hoàn toàn bản cập nhật GPT‑4o do khủng hoảng sycophancy. OpenAI đã khôi phục các thay đổi «tính cách» mô hình được triển khai ngày 25 tháng 4 năm 2025, sau khi có nhiều phàn nàn về sự đồng ý quá mức và các xác nhận có hại tiềm ẩn.[8] |
| 15.09.2025 | OpenAI công bố kế hoạch deactivation các nhánh preview của mô hình âm thanh và thời gian thực GPT‑4o (các nhánh gpt‑4o‑realtime‑preview‑* và gpt‑4o‑audio‑preview‑*) với ngày ngừng hoạt động là 24 tháng 3 năm 2026. Khuyến nghị nhà phát triển chuyển sang các endpoint hiện tại hoặc mô hình thế hệ tiếp theo.[9]
|
| 18.11.2025 | Alias chatgpt‑4o‑latest được đánh dấu để shutdown với ngày ngừng hoạt động là 17 tháng 2 năm 2026. Endpoint động được chuyển sang trạng thái deprecated; khuyến nghị nhà phát triển sử dụng các snapshot cố định hoặc chuyển sang các mô hình mới hơn.[3][9]
|
Truy cập
Truy cập vào GPT‑4o được thực hiện qua giao diện web chính thức của ChatGPT (cho người dùng ở các cấp Free, Plus, Team và Enterprise) và qua OpenAI API[3]. Mô hình cũng có sẵn qua Azure OpenAI Service.
| Tính năng | Free | Plus | Pro |
|---|---|---|---|
| Truy cập GPT‑4o | ~10–60 tin nhắn trong 3–5 giờ | ~150 tin nhắn trong 3 giờ | Không giới hạn |
| Dự phòng khi hết giới hạn | GPT‑4o mini | GPT‑4o mini | Không giới hạn |
| Chế độ giọng nói | Không khả dụng | Khả dụng | Khả dụng |
| Tạo hình ảnh | 2–3 mỗi ngày | Giới hạn mở rộng | Không giới hạn |
Fine-tuning có sẵn cho gpt‑4o‑2024‑08‑06 và gpt‑4o‑mini‑2024‑07‑18[3].
Kể từ ngày 13 tháng 2 năm 2026, GPT‑4o đã hoàn toàn bị rút khỏi giao diện ChatGPT (chỉ có 0,1% người dùng hàng ngày vẫn còn chọn nó vào thời điểm đó), nhưng vẫn có sẵn qua API[5].
Ý nghĩa và di sản
GPT‑4o trở thành mô hình bước ngoặt đối với OpenAI — không phải bởi sự vượt trội tuyệt đối trên các benchmark văn bản (tăng 2–4 điểm phần trăm so với GPT‑4 Turbo), mà bởi sự chuyển dịch mô hình sang tính đa phương thức gốc trong một mạng nơ-ron thống nhất[1]. Chính kiến trúc này đã làm cho Advanced Voice Mode với độ trễ 320 ms, Realtime API và tạo hình ảnh gốc trở nên khả thi — những tính năng đã định hình diện mạo sản phẩm của ChatGPT trong suốt một năm rưỡi.
Lịch sử của GPT‑4o được đánh dấu bởi một số bài học quan trọng:
- Nhận thức của người dùng về «tính cách» mô hình hóa ra cực kỳ quan trọng: nỗ lực tối ưu hóa mô hình theo đánh giá của người dùng đã dẫn đến khủng hoảng sycophancy, và việc xóa GPT‑4o để thay bằng GPT‑5 đã gây ra làn sóng phản đối hàng loạt do mất đi «phong cách ấm áp»[8][4].
- Các bản cập nhật snapshot không đảm bảo cải thiện — mỗi trong số ba snapshot chính đều cho thấy kết quả tương đương hoặc kém hơn trên các bài kiểm tra lập trình độc lập[4].
- Hệ sinh thái GPT‑4o với hơn 20 biến thể chuyên biệt (audio-preview, realtime-preview, search-preview, transcribe, TTS) đã thể hiện chiến lược của OpenAI trong việc phân mảnh mô hình «omni» thống nhất thành các endpoint phương thức được tối ưu hóa[3].
Xem thêm
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Kiến trúc Transformer
- Mô hình ngôn ngữ lớn
Tài liệu tham khảo
- OpenAI (2024). Hello GPT‑4o. Blog chính thức của OpenAI, 13 tháng 5 năm 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 tháng 7 năm 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Tài liệu API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Phân tích hậu sự kiện. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Ghi chú
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/