GPT (OpenAI) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

GPT (Generative Pre-trained Transformer) — là một họ các mô hình ngôn ngữ lớn (LLM) được phát triển bởi công ty OpenAI. Các mô hình GPT được xây dựng trên kiến trúc transformer và thực hiện mô hình sinh học tiền huấn luyện: ở giai đoạn đầu, mô hình được huấn luyện trên các kho ngữ liệu văn bản rộng lớn mà không có nhãn rõ ràng, sau đó có thể được tinh chỉnh (fine-tuning) cho các tác vụ cụ thể. Đối với các thế hệ muộn hơn (bắt đầu từ GPT‑5), OpenAI cũng sử dụng thuật ngữ hệ thống thống nhất (unified system), vì sản phẩm kết hợp chế độ phản hồi nhanh, chế độ suy luận chuyên sâu (reasoning) và bộ định tuyến[1].

Tên gọi

Viết tắt GPT được giải mã là Generative Pre-trained Transformer (Transformer Sinh học Tiền huấn luyện).

  • Sinh học (Generative): có nghĩa là mô hình có khả năng tạo ra (sinh ra) nội dung mới, ví dụ như văn bản.
  • Tiền huấn luyện (Pre-trained): chỉ ra rằng mô hình trải qua một giai đoạn huấn luyện ban đầu mở rộng trên một tập dữ liệu lớn (ví dụ: các văn bản từ internet). Sau khi tiền huấn luyện, mô hình thường có thể được tiếp tục \"tinh chỉnh\" (fine-tuned) để thực hiện các tác vụ chuyên biệt hơn.
  • Transformer (Transformer): đây là tên của một kiến trúc mạng nơ-ron cụ thể, vốn là đổi mới chủ chốt làm nền tảng cho GPT và nhiều mô hình AI hiện đại khác.

Đặc điểm chính của GPT là quá trình huấn luyện diễn ra theo hình thức tự hồi quy (autoregressive) — mô hình dự đoán token tiếp theo dựa trên ngữ cảnh trước đó. Tức là mô hình được huấn luyện để tối đa hóa xác suất của token tiếp theo, dựa vào chuỗi các token trước đó. Trong quá trình huấn luyện, sai số dự đoán phần tử tiếp theo được tối thiểu hóa, cho phép tạo ra các văn bản có tính mạch lạc và liên kết cao.

Quá trình sinh văn bản trong GPT

Mô hình GPT sinh văn bản tuần tự, từng token một, theo sơ đồ lặp đi lặp lại như sau:

  • Nhận vào chuỗi văn bản khởi đầu (prompt, seed text).
  • Tính toán phân phối xác suất trên tất cả các token trong từ điển cho phần tử tiếp theo của văn bản.
  • Chọn token tiếp theo:
    • hoặc theo xác suất cao nhất (chọn tham lam),
    • hoặc bằng phương pháp lấy mẫu ngẫu nhiên (sampling),
    • hoặc sử dụng các chiến lược lọc đặc biệt (top-k, top-p).
  • Thêm token đã chọn vào chuỗi hiện tại.
  • Chuỗi đã được cập nhật lại được đưa vào mô hình để dự đoán token tiếp theo.

Kiến trúc transformer: xử lý văn bản

Quá trình xử lý dữ liệu bên trong transformer để dự đoán token tiếp theo bao gồm một số giai đoạn chính:

  • Phân tách token (Tokenization). Văn bản đầu vào được tách thành các token — các đơn vị văn bản nhỏ, có thể là các từ, phần của từ hoặc dấu câu. Trong mô hình GPT-3, ví dụ, từ điển bao gồm khoảng 50 257 token.
  • Nhúng token (Embeddings). Mỗi token được chuyển đổi thành một vector có độ dài cố định bằng ma trận nhúng (W_E). Các vector mã hóa ý nghĩa của token: các token gần nghĩa nhau về mặt ngữ nghĩa được đặt gần nhau trong không gian đa chiều. Trong mô hình GPT-3, số chiều của embedding là 12 288.
  • Xử lý trong các lớp transformer.
    • Khối chú ý (Attention Blocks): Mỗi token tương tác với các token khác trong chuỗi. Cơ chế attention cho phép tính đến ngữ cảnh và diễn giải đúng ý nghĩa của các từ.
    • Lớp kết nối đầy đủ (Feed-Forward Layers): Sau attention, mỗi token được xử lý riêng lẻ qua mạng nơ-ron hai lớp với hàm kích hoạt phi tuyến.
  • Biến đổi ngược và Softmax. Sau tất cả các lớp, vector đã xử lý được biến đổi ngược lại sang không gian token bằng ma trận (W_U), thường là phiên bản chuyển vị của W_E. Vector logit kết quả được chuẩn hóa bằng hàm Softmax để thu được phân phối xác suất trên tất cả các token.
  • Chọn token tiếp theo (Sampling). Token tiếp theo được chọn dựa trên phân phối xác suất. Tham số nhiệt độ (temperature) kiểm soát tính ngẫu nhiên của lựa chọn: ở nhiệt độ 0, token có xác suất cao nhất được chọn; ở nhiệt độ cao hơn, xác suất chọn các phương án ít xác suất hơn tăng lên, điều này thúc đẩy sự đa dạng hơn của văn bản.

Các mô hình GPT

  • GPT-1 (2018): mô hình đầu tiên của dòng; transformer chỉ-decoder 12 lớp; huấn luyện theo hai giai đoạn (tiền huấn luyện + tinh chỉnh trên các tác vụ NLP).
  • GPT-2 (2019): 1,5 tỷ tham số; huấn luyện trên kho ngữ liệu WebText; lần đầu tiên có khả năng tạo ra các văn bản dài mạch lạc; nâng cao chất lượng sinh zero-shot. Được công bố ngày 14 tháng 2 năm 2019, phiên bản đầy đủ (1,5 tỷ) được phát hành ngày 5 tháng 11 năm 2019 vì lý do an toàn.
  • GPT-3 (2020): 175 tỷ tham số; huấn luyện quy mô lớn trên tập hợp Common Crawl, Books, Wikipedia; phát triển mạnh mẽ khả năng few-shot và zero-shot.
  • GPT-3.5 (2022): phiên bản trung gian giữa GPT-3 và GPT-4; cải thiện khả năng tuân thủ hướng dẫn nhờ huấn luyện với phản hồi của con người (RLHF) trong các phiên bản text-davinci-003 và gpt-3.5-turbo; cửa sổ ngữ cảnh lên đến 4 096 token trong các phiên bản đầu và lên đến 16 385 token trong các phiên bản sau (gpt-3.5-turbo-16k và gpt-3.5-turbo được cập nhật).
  • GPT-4 (2023): mô hình đa phương thức với đầu vào văn bản và hình ảnh (hỗ trợ hình ảnh được triển khai sau, sau khi ra mắt văn bản); cửa sổ ngữ cảnh 8 192 token trong phiên bản cơ sở và 32 768 token trong biến thể GPT-4-32k; cải thiện đáng kể về độ chính xác, tính ổn định và logic suy luận.
  • GPT-4 Turbo (2023): phiên bản tối ưu hóa của GPT-4; tăng cửa sổ ngữ cảnh lên đến 128 000 token; độ trễ và chi phí hoạt động thấp hơn.
  • GPT-4o (2024): mô hình đa phương thức thế hệ mới (văn bản, hình ảnh, âm thanh) với kiến trúc mạng nơ-ron thống nhất; tốc độ và độ chính xác phản hồi rất cao; cửa sổ ngữ cảnh 128 000 token.
  • GPT-4.5 (2025): bản xem trước nghiên cứu (research preview); trong system card, OpenAI chỉ ra rằng mô hình «builds on GPT-4o»[2][3]; cải thiện khả năng hiểu yêu cầu của người dùng, giảm số lỗi; cửa sổ ngữ cảnh 128 000 token. Trong API, mô hình gpt-4.5-preview được thông báo deprecated vào ngày 14 tháng 4 năm 2025 và ngừng hoạt động vào ngày 14 tháng 7 năm 2025[4].
  • GPT-4.1 (2025): phiên bản cải tiến của dòng GPT-4 với cửa sổ ngữ cảnh lên đến 1 triệu token; nhận văn bản và hình ảnh làm đầu vào, xuất văn bản[5]. Được phát hành đồng thời trong ba biến thể: GPT-4.1, GPT-4.1 mini, GPT-4.1 nano.
  • GPT-5 (2025): hệ thống thống nhất với các chế độ phản hồi nhanh và suy luận chuyên sâu; cửa sổ ngữ cảnh khoảng 400 000 token; giảm đáng kể ảo giác (hallucination) trên các tác vụ thực tế.
  • GPT-5.1 (2025): adaptive reasoning, cải tiến trong coding và long-context retention.
  • GPT-5.2 (2025): tập trung vào công việc chuyên nghiệp; chế độ Pro cho các tác vụ frontier; dựa trên GPT-5.2 đã phát hành GPT-5.2-Codex dạng tác nhân (agentic).
  • GPT-5.3-Codex (2026): mô hình coding dạng tác nhân, kết hợp khả năng coding và reasoning; nhanh hơn 25% so với các phiên bản tiền nhiệm.
  • GPT-5.3 Instant (2026): cập nhật mô hình hội thoại được sử dụng nhiều nhất của ChatGPT; phát hành ngày 3 tháng 3 năm 2026. Cải thiện độ chính xác thực tế, chất lượng tìm kiếm web, tính mượt mà của hội thoại và giảm số lần từ chối thừa và các lưu ý quá mức. Trong API có sẵn dưới dạng gpt-5.3-chat-latest[6].
  • GPT-5.4 (2026): mô hình frontier của OpenAI cho công việc chuyên nghiệp, được giới thiệu ngày 5 tháng 3 năm 2026; mô hình general-purpose đầu tiên của OpenAI với khả năng sử dụng máy tính (computer use) tích hợp sẵn. Trong API, gpt-5.4 được khuyến nghị là mô hình mặc định cho nhiều tác vụ general-purpose và coding[7][8].

GPT-1

Mô hình đầu tiên, GPT-1, được OpenAI giới thiệu vào năm 2018 trong bài báo \"Improving Language Understanding by Generative Pre-Training\". Mô hình là một transformer chỉ-decoder 12 lớp[9] và được xây dựng trên nền tảng kiến trúc transformer. Huấn luyện GPT-1 diễn ra theo hai giai đoạn: giai đoạn tiền huấn luyện sinh học không giám sát (pre-training), tiếp theo là giai đoạn tinh chỉnh có giám sát (fine-tuning).

Ở giai đoạn tiền huấn luyện, mô hình được huấn luyện trên kho ngữ liệu BookCorpus, bao gồm hơn 7 000 cuốn sách chưa xuất bản thuộc nhiều thể loại khác nhau. Đặc điểm của kho ngữ liệu này là sự có mặt của các đoạn văn bản dài liên tục, điều này đặc biệt quan trọng để hình thành khả năng xử lý các phụ thuộc văn bản phức tạp và kéo dài của mô hình.

Ở giai đoạn tinh chỉnh, mô hình được điều chỉnh để giải quyết các tác vụ xử lý ngôn ngữ tự nhiên chuyên biệt, bao gồm:

  • Trả lời câu hỏi (Question Answering, QA) — tạo ra câu trả lời đúng dựa trên ngữ cảnh văn bản cho sẵn;
  • Nhận dạng hàm ý văn bản (Natural Language Inference, NLI) — xác định mối quan hệ logic giữa hai văn bản: hàm ý, mâu thuẫn hoặc trung lập;
  • Đánh giá mức độ tương đồng ngữ nghĩa (Semantic Textual Similarity) — đo lường mức độ gần nghĩa giữa hai chuỗi văn bản.

Nhờ cách tiếp cận này, GPT-1 đã thể hiện sự vượt trội đáng kể so với các mô hình trước đó trên một số benchmark tiêu chuẩn cho các tác vụ hiểu văn bản.

Việc phát triển GPT-1 đã chứng minh một số thành tựu và khám phá chính trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP):

  • Hiệu quả của tiền huấn luyện sinh học. Đã được xác nhận thực nghiệm rằng việc tiền huấn luyện trên các kho ngữ liệu văn bản chưa có nhãn lớn cho phép mô hình thu nhận các biểu diễn ngôn ngữ phổ quát, phù hợp để ứng dụng trong nhiều tác vụ thực tiễn khác nhau mà không cần thay đổi kiến trúc cơ bản.
  • Tính đa năng của kiến trúc transformer. Việc sử dụng transformer decoder đa lớp đã cho phép mô hình xử lý thành công các phụ thuộc dài hạn trong văn bản, điều trước đây gặp nhiều khó khăn đối với các mô hình dựa trên mạng nơ-ron hồi quy.
  • Giảm sự phụ thuộc vào dữ liệu có nhãn. Nghiên cứu xác nhận rằng việc tiền huấn luyện quy mô lớn trên dữ liệu chưa có nhãn có thể giảm đáng kể lượng dữ liệu có nhãn cần thiết để đạt chất lượng cao trên các tác vụ mục tiêu.
  • Nền tảng cho sự phát triển tiếp theo. Kết quả của GPT-1 đã đặt nền tảng khái niệm và kỹ thuật cho các phiên bản mô hình tiếp theo trong dòng GPT (GPT-2, GPT-3 và xa hơn).

GPT-2

Mô hình GPT-2 được OpenAI công bố vào ngày 14 tháng 2 năm 2019. Nó vượt trội đáng kể so với người tiền nhiệm về kích thước: phiên bản đầy đủ của mô hình chứa khoảng 1,5 tỷ tham số. Vì lý do an toàn, OpenAI ban đầu chỉ công bố các phiên bản thu nhỏ của mô hình; phiên bản đầy đủ (1,5 tỷ tham số) được phát hành vào ngày 5 tháng 11 năm 2019. Không giống như GPT-1 được huấn luyện trên kho ngữ liệu BookCorpus (~5 GB), GPT-2 được huấn luyện trên kho ngữ liệu WebText được thu thập đặc biệt với dung lượng khoảng 40 GB, bao gồm dữ liệu văn bản từ các nguồn internet có chất lượng cao. Việc tăng cả kích thước mô hình lẫn lượng dữ liệu huấn luyện đã cho phép GPT-2 cải thiện đáng kể chất lượng sinh văn bản: nó thể hiện khả năng tạo ra các bài báo, câu chuyện có nội dung phong phú và thậm chí các đoạn văn xuô nghệ thuật mạch lạc.

GPT-2 sử dụng kiến trúc transformer-decoder tự hồi quy tương tự như GPT-1, không có thay đổi đáng kể. Mô hình bao gồm 48 lớp tự chú ý, có kích thước trạng thái ẩn là 1600 và chứa khoảng 1,5 tỷ tham số. Số đầu attention là 25 (với kích thước 64 mỗi đầu, kế thừa từ GPT-1: 1600 ÷ 64 = 25). Huấn luyện được thực hiện trên tác vụ dự đoán token tiếp theo dựa trên ngữ cảnh trước đó với cơ chế attention có mặt nạ.

Một trong những điểm khác biệt chính của GPT-2 là mô hình lần đầu tiên thể hiện hiệu quả cao trong chế độ zero-shot learning — khả năng giải quyết các tác vụ mới mà không cần phải trải qua tinh chỉnh rõ ràng trên các ví dụ cho các tác vụ đó. Mô hình được huấn luyện trên một kho ngữ liệu văn bản tổng quát lớn và không trải qua huấn luyện chuyên biệt trên dữ liệu của các tác vụ cụ thể. Đánh giá được thực hiện ở chế độ zero-shot, trong đó mô hình thực hiện các tác vụ hoàn toàn dựa trên kiến thức thu được trong quá trình tiền huấn luyện. Trong một số tác vụ mô hình hóa ngôn ngữ, GPT-2 đạt được chất lượng tương đương hoặc vượt qua kết quả của các mô hình được huấn luyện chuyên biệt trên các tập dữ liệu chuyên biệt (ví dụ: Wikipedia, văn bản tin tức, sách).

GPT-3

Mô hình GPT-3 được OpenAI giới thiệu vào tháng 6 năm 2020 (bài báo trên arXiv xuất hiện ngày 28 tháng 5 năm 2020, quyền truy cập beta vào API được mở vào ngày 11 tháng 6 năm 2020). Nó là bước tiếp theo trong quá trình phát triển của các transformer sinh học sau GPT-2 và nổi bật bởi việc mở rộng kiến trúc lên 175 tỷ tham số, khiến nó trở thành mô hình ngôn ngữ lớn nhất vào thời điểm đó.

Kiến trúc của GPT-3 về cơ bản vẫn giữ nguyên — transformer-decoder tự hồi quy đa lớp, không có thay đổi căn bản. Các cải tiến hiệu suất chính đạt được nhờ tăng số lượng lớp, độ rộng của các lớp ẩn và quy mô huấn luyện. Mô hình được huấn luyện trên sự kết hợp của nhiều kho ngữ liệu văn bản lớn, bao gồm Common Crawl, WebText2, Books1, Books2 và Wikipedia. Tổng khối lượng dữ liệu vào khoảng 570 GB và hơn thế nữa (570 GB thuộc về phần đã lọc của Common Crawl, chiếm ưu thế trong hỗn hợp huấn luyện).

Một trong những đặc điểm chính của GPT-3 là khả năng few-shot learningzero-shot learning: mô hình có thể thực hiện một loạt các tác vụ xử lý ngôn ngữ tự nhiên, bao gồm dịch thuật, tóm tắt, trả lời câu hỏi, viết luận và thậm chí lập trình, chỉ dựa trên một vài ví dụ trong câu truy vấn văn bản hoặc hoàn toàn không có ví dụ nào.

GPT-3.5

Mô hình GPT-3.5 được OpenAI giới thiệu vào cuối năm 2022 như một bước phát triển tiến hóa của dòng GPT. Nó được xây dựng trên nền tảng kiến trúc transformer-decoder tự hồi quy mở rộng được sử dụng trong GPT-3, với các cải tiến về chất lượng sinh văn bản, xử lý ngữ cảnh và khả năng tuân thủ các hướng dẫn phức tạp. Số lượng tham số chính xác của GPT-3.5 không được tiết lộ chính thức; theo ước tính, các phiên bản davinci có quy mô tương đương GPT-3 (175 tỷ), tuy nhiên các tham số chính xác của phiên bản gpt-3.5-turbo vẫn chưa được biết.

Việc huấn luyện GPT-3.5 bao gồm việc sử dụng mở rộng các phương pháp học tăng cường từ phản hồi của con người (Reinforcement Learning from Human Feedback, RLHF) trong các phiên bản text-davinci-003 và gpt-3.5-turbo. Trong đó, phiên bản text-davinci-002 trước đó được huấn luyện bằng supervised fine-tuning (SFT), không phải RLHF. Mô hình được huấn luyện trên các kho ngữ liệu văn bản mở rộng bao gồm Common Crawl, Books, WebText và các nguồn chất lượng cao khác. Cửa sổ ngữ cảnh trong các phiên bản phổ biến đầu (gpt-3.5-turbo) là 4 096 token; sau đó OpenAI đã phát hành các phiên bản cập nhật với ngữ cảnh lên đến 16 385 token[10].

Trên thực tế, GPT-3.5 được điều chỉnh để giải quyết nhiều tác vụ xử lý ngôn ngữ tự nhiên như:

  • Sinh văn bản mạch lạc và logic;
  • Trả lời câu hỏi (QA) và hiểu ngữ cảnh;
  • Tuân thủ các hướng dẫn nhiều bước;
  • Duy trì ngữ cảnh dài hạn trong hội thoại được cải thiện.

Dựa trên GPT-3.5, một số phiên bản chính đã được phát hành, phục vụ cho các mục đích khác nhau:

  • text-davinci-002 — mô hình công khai đầu tiên dựa trên GPT-3.5, được tối ưu hóa cho việc sinh và tuân thủ hướng dẫn (được huấn luyện bằng SFT).
  • text-davinci-003 — phiên bản cải tiến với khả năng suy luận và sinh văn bản phức tạp tốt hơn (được huấn luyện bằng RLHF).
  • gpt-3.5-turbo — phiên bản hiệu suất cao và tiết kiệm nhất của GPT-3.5, được sử dụng trong dịch vụ ChatGPT từ cuối năm 2022.

GPT-4

Mô hình GPT-4 được OpenAI giới thiệu vào ngày 14 tháng 3 năm 2023 trong bài báo "GPT-4 Technical Report". Nó trở thành giai đoạn tiếp theo trong quá trình phát triển của dòng mô hình ngôn ngữ, mang lại những cải tiến đáng kể trong việc hiểu văn bản, sinh ra các câu trả lời có ý nghĩa và sáng tạo, cũng như xử lý dữ liệu đa phương thức. Số lượng tham số chính xác và các chi tiết kiến trúc của mô hình không được tiết lộ chính thức — báo cáo kỹ thuật GPT-4 nêu rõ rằng thông tin về kiến trúc, kích thước mô hình, phần cứng, chi phí tính toán để huấn luyện và xây dựng tập dữ liệu không được công bố[11]. Theo các ước tính bên ngoài không chính thức, GPT-4 có thể sử dụng phương pháp Mixture of Experts (MoE) và có tổng quy mô khoảng ~1,8 nghìn tỷ tham số, tuy nhiên OpenAI chưa chính thức xác nhận hay phủ nhận các con số này[12].

GPT-4 là một mô hình đa phương thức, có khả năng nhận cả văn bản lẫn hình ảnh làm đầu vào. Cần lưu ý rằng tại thời điểm ra mắt ban đầu vào tháng 3 năm 2023, chỉ có phương thức văn bản được cung cấp; hỗ trợ nhập hình ảnh được triển khai sau đó. Cửa sổ ngữ cảnh là 8 192 token trong phiên bản cơ sở và 32 768 token trong biến thể GPT-4-32k. Mô hình sử dụng các phương pháp RLHF (học tăng cường từ phản hồi của con người).

Việc huấn luyện GPT-4 được thực hiện trên sự kết hợp của các kho ngữ liệu văn bản và đa phương thức quy mô lớn. Các chi tiết cụ thể về dữ liệu huấn luyện, phần cứng và phương pháp luận không được tiết lộ trong các ấn phẩm chính thức của OpenAI.

Việc huấn luyện diễn ra theo nhiều giai đoạn:

  • tiền huấn luyện không giám sát quy mô lớn trên văn bản và hình ảnh,
  • tinh chỉnh có giám sát (supervised fine-tuning) trên các tác vụ chuyên biệt,
  • giai đoạn cuối là học tăng cường từ phản hồi của con người (RLHF) để nâng cao độ tin cậy, an toàn và chất lượng diễn giải hướng dẫn.

Dựa trên GPT-4, một số phiên bản chính đã được phát hành:

  • GPT-4 (tháng 3 năm 2023): phiên bản cơ sở hỗ trợ đầu vào văn bản (hỗ trợ hình ảnh được thêm vào sau); cửa sổ ngữ cảnh 8 192 token; cũng phát hành biến thể GPT-4-32k với ngữ cảnh 32 768 token.
  • GPT-4 Turbo (tháng 11 năm 2023): biến thể tối ưu hóa của GPT-4 với cửa sổ ngữ cảnh tăng lên đến 128 000 token[13]; giảm chi phí tính toán và tăng tốc sinh; hỗ trợ chế độ gọi hàm (function calling) và xuất JSON.
  • GPT-4o (tháng 5 năm 2024): phiên bản đa phương thức thế hệ mới; trong thông báo ra mắt được định vị là mô hình omni, có khả năng làm việc với văn bản, hình ảnh và âm thanh theo thời gian thực (không giống như GPT-4 Turbo, nơi các phương thức khác nhau được phục vụ bởi các mô-đun riêng biệt); trong khi đó mô hình API cơ sở gpt-4o được mô tả là text+image input, text output; cửa sổ ngữ cảnh 128 000 token.
  • GPT-4.5 (tháng 2 năm 2025): bản xem trước nghiên cứu (research preview); trong system card, OpenAI nêu rõ rằng mô hình «builds on GPT-4o»[3]; cải thiện sinh văn bản phức tạp, tăng độ chính xác khi thực hiện hướng dẫn và giảm mức độ ảo giác (hallucination); cửa sổ ngữ cảnh 128 000 token. Được mô tả là «mô hình OpenAI mới nhất không có chain-of-thought» (tên mã — Orion)[14]. Trong API, mô hình gpt-4.5-preview được thông báo deprecated vào ngày 14 tháng 4 năm 2025 và ngừng hoạt động vào ngày 14 tháng 7 năm 2025[4].
  • GPT-4.1 (tháng 4 năm 2025): phiên bản ổn định với mở rộng căn bản ngữ cảnh lên đến 1 047 576 token; nhận văn bản và hình ảnh làm đầu vào, xuất văn bản[15]; được phát hành đồng thời trong ba biến thể (GPT-4.1, GPT-4.1 mini, GPT-4.1 nano); ban đầu chỉ có sẵn qua API, sau đó được triển khai trong ChatGPT.

GPT-5

Ngày 7 tháng 8 năm 2025, OpenAI giới thiệu GPT‑5 là mô hình «thông minh nhất, nhanh nhất và hữu ích nhất» của họ vào thời điểm đó, với chế độ suy luận chuyên sâu tích hợp (thinking) và tập trung vào các tình huống thực tế — viết lách, lập trình, chăm sóc sức khỏe và hiểu đa phương thức. GPT‑5 dần trở thành mô hình mặc định cho phần lớn người dùng ChatGPT đã xác thực, thay thế các mô hình dòng GPT‑4/4o và o‑series trước đây.[16]

GPT‑5 được triển khai như một hệ thống thống nhất với hai chế độ hoạt động chính: phản hồi nhanh, tiết kiệm cho các truy vấn hàng ngày (tạm gọi là gpt‑5 main) và suy luận chuyên sâu cho các tác vụ phức tạp (tạm gọi là gpt‑5 thinking). Việc chọn chế độ diễn ra tự động nhờ bộ định tuyến, có tính đến loại hội thoại, mức độ phức tạp của truy vấn, sự cần thiết của công cụ và các gợi ý rõ ràng từ người dùng (ví dụ: «think step by step» hoặc «analyze in depth»). Trong ChatGPT, người dùng có thể sử dụng các chế độ Auto / Instant / Thinking / Pro; các biến thể mininano chủ yếu là các mô hình API, còn mini trong sản phẩm người dùng có thể được sử dụng như fallback sau khi hết giới hạn[17].

Qua giao diện lập trình, có sẵn nhiều kích thước và cấu hình của GPT‑5; trong tài liệu OpenAI, các biến thể chính được liệt kê là gpt‑5, gpt‑5‑minigpt‑5‑nano (tất cả đều hỗ trợ văn bản và dữ liệu hình ảnh). Tổng cửa sổ ngữ cảnh tối đa cho dòng GPT‑5 trong API vào khoảng 400 000 token (với phân chia ngân sách cho đầu vào và suy luận/đầu ra), trong khi các giới hạn cụ thể có thể khác nhau tùy thuộc vào biến thể mô hình và sản phẩm được chọn[18].

Theo một số benchmark tìm kiếm web và thực tế, GPT‑5 thể hiện sự giảm đáng kể tần suất ảo giác (hallucination) và lỗi so với các mô hình GPT‑4o và các mô hình «thinking» trước đó của OpenAI. Trong thông báo chính thức, OpenAI đưa ra ước tính giảm lỗi khoảng 45% so với GPT-4o và khoảng 80% so với o3 ở chế độ thinking — các kết quả này được thu thập trong các điều kiện cụ thể: với tìm kiếm web được bật trên các prompt ẩn danh, đại diện cho lưu lượng sản xuất của ChatGPT[19].

GPT-5.1

Mô hình GPT-5.1 được OpenAI giới thiệu vào ngày 12 tháng 11 năm 2025 như là lần lặp đầu tiên đáng kể sau GPT-5 cơ sở, hướng đến cải thiện tương tác hàng ngày, tính hội thoại và khả năng thích ứng. Mô hình duy trì hệ thống thống nhất với chế độ nhanh (GPT-5.1 Instant) và suy luận chuyên sâu (GPT-5.1 Thinking), nhưng giới thiệu suy luận thích ứng (adaptive reasoning): mô hình tự động xác định khối lượng tính toán dựa trên mức độ phức tạp của truy vấn, khiến nó nhanh hơn đáng kể trên các tác vụ đơn giản mà không mất chất lượng trên các tác vụ phức tạp.

Việc huấn luyện GPT-5.1 được xây dựng trên nền tảng GPT-5 với giai đoạn hậu huấn luyện bổ sung, bao gồm RLHF mở rộng, tập trung vào tính tự nhiên của ngữ điệu và giảm sự «lạnh lùng» của câu trả lời. Cửa sổ ngữ cảnh trong API là 400 000 token, đầu ra tối đa — 128 000 token[20]. Đã xuất hiện hỗ trợ bộ nhớ đệm prompt mở rộng lên đến 24 giờ, điều này giảm đáng kể chi phí và độ trễ trong các hội thoại nhiều bước[21].

Các đặc điểm chính:

  • GPT-5.1 Instant — chế độ chính cho các tác vụ hàng ngày; lần đầu tiên sử dụng adaptive reasoning để xác định khi nào nên «suy nghĩ» trước khi trả lời truy vấn phức tạp hơn[21].
  • GPT-5.1 Thinking — phân bổ thời gian thích ứng cho suy luận; theo dữ liệu của OpenAI, trên phân phối tác vụ đại diện của ChatGPT, mô hình nhanh hơn khoảng hai lần trên các tác vụ đơn giản nhất và chậm hơn khoảng hai lần trên các tác vụ khó nhất so với GPT-5 Thinking[21].
  • Cải thiện đa phương thức (văn bản + vision).
  • Cải thiện các tình huống coding và agentic, cũng như hiệu quả trên các tác vụ đơn giản nhờ adaptive reasoning và bộ nhớ đệm prompt mở rộng[22].

GPT-5.2

Mô hình GPT-5.2 được phát hành vào ngày 11 tháng 12 năm 2025 như là «mô hình có khả năng nhất của dòng cho công việc chuyên nghiệp và học tập». Đây là sự tiến hóa của GPT-5.1 với trọng tâm vào giá trị kinh tế: tạo bảng biểu, bản trình bày, mã phức tạp, các tác vụ end-to-end. Duy trì kiến trúc thống nhất với các chế độ Instant, Thinking và chế độ Pro mới (cho các tác vụ yêu cầu compute tối đa và thời gian suy luận).

Việc huấn luyện bao gồm kho ngữ liệu cập nhật với knowledge cutoff tháng 8 năm 2025, tăng cường instruction-tuning và RLHF để giảm lỗi trong các tình huống nhiều bước. Ngữ cảnh — 400K token (128K max output). Mô hình đã trở nên đáng tin cậy hơn trong các tình huống chuyên nghiệp, với độ chính xác thực tế tốt hơn và sử dụng công cụ hiệu quả hơn.

Dựa trên GPT-5.2, vào ngày 18 tháng 12 năm 2025, GPT-5.2-Codex chuyên biệt đã được phát hành — một mô hình coding dạng tác nhân với nén ngữ cảnh được cải tiến (context compaction), hỗ trợ Windows, tăng cường an ninh mạng và long-horizon reasoning (các tác vụ kéo dài đến vài giờ).

Tính đến ngày 13 tháng 2 năm 2026, sau khi ngừng sử dụng một số mô hình cũ, GPT-5.2 tạm thời trở thành mô hình mặc định trong ChatGPT. Tuy nhiên, đến đầu tháng 3 năm 2026, vai trò này đã chuyển sang GPT‑5.3 Instant và GPT‑5.4[17].

GPT-5.3-Codex

GPT-5.3-Codex được giới thiệu vào ngày 5 tháng 2 năm 2026 như là «mô hình coding dạng tác nhân mạnh mẽ nhất cho đến nay». Đây là sự kết hợp giữa khả năng coding frontier của GPT-5.2-Codex với suy luận chuyên nghiệp của GPT-5.2 trong một mô hình duy nhất, nhanh hơn 25% so với các phiên bản tiền nhiệm.

Mô hình có khả năng thực hiện hầu hết mọi tác vụ của nhà phát triển: long-running workflows, nghiên cứu, sử dụng công cụ, thực thi mã, điều hướng tương tác (người dùng có thể can thiệp theo thời gian thực mà không mất ngữ cảnh). Các phiên bản đầu của mô hình được nhóm OpenAI sử dụng để gỡ lỗi trong quá trình huấn luyện, triển khai và đánh giá của chính họ.

Các kết quả chính tại thời điểm công bố ngày 5 tháng 2 năm 2026: Terminal-Bench ~77,3%, OSWorld-Verified ~64,7%, SWE-Bench Pro ~56,8%. Trong bản phát hành GPT-5.4 sau đó vào ngày 5 tháng 3 năm 2026, OpenAI đưa ra kết quả cập nhật OSWorld-Verified 74,0% cho GPT-5.3-Codex khi sử dụng tham số API mới giữ nguyên độ phân giải ban đầu của hình ảnh[23][7].

Vào ngày 12 tháng 2 năm 2026, OpenAI cũng phát hành GPT-5.3-Codex-Spark — phiên bản nhỏ gọn, ultra-fast trong quan hệ đối tác với Cerebras, được tối ưu hóa cho thời gian thực: hơn 1000 token mỗi giây, chỉ văn bản (text-only), ngữ cảnh 128K. Khi ra mắt, đây là rollout cho người dùng ChatGPT Pro trong Codex và một số lượng nhỏ đối tác thiết kế API, không phải mô hình API rộng rãi[24].

GPT-5.4

Ngày 5 tháng 3 năm 2026, OpenAI giới thiệu GPT‑5.4 là mô hình frontier mới cho công việc chuyên nghiệp. GPT‑5.4 kết hợp những điểm mạnh của các bản phát hành gần đây của OpenAI về reasoning, coding và agentic workflows và lần đầu tiên trong dòng chính thống nhận được khả năng computer use tích hợp. Đồng thời, OpenAI đã phát hành GPT‑5.4 Pro — biến thể cho các tác vụ phức tạp nhất, sử dụng nhiều tính toán hơn và thời gian suy luận dài hơn[7].

Trong API, mô hình gpt-5.4 được mô tả là được khuyến nghị mặc định cho nhiều tác vụ general-purpose và coding; cửa sổ ngữ cảnh là 1 050 000 token, đầu ra tối đa — 128 000 token. Mô hình nhận văn bản và hình ảnh làm đầu vào và xuất văn bản[8][25].

Trong ChatGPT, chế độ Auto tính đến ngày 7 tháng 3 năm 2026 tự động chuyển đổi giữa GPT‑5.3 InstantGPT‑5.4 Thinking, trong khi GPT‑5.4 Pro có sẵn như một chế độ high-capability riêng biệt. Đối với người dùng ChatGPT đã đăng nhập, mô hình mặc định là GPT‑5.3[17].

Sự phát triển của các mô hình GPT

Sự phát triển của các mô hình GPT
Thế hệ Năm phát hành Số lượng tham số Kích thước kho ngữ liệu Đặc điểm chính
GPT-1 2018 ≈117–124 triệu[26] ≈5 GB (BooksCorpus) Tiền huấn luyện sinh học trên các kho ngữ liệu lớn; huấn luyện hai giai đoạn (pre-training + fine-tuning)
GPT-2 2019 1,5 tỷ ≈40 GB (WebText) Cải thiện đáng kể chất lượng sinh văn bản; thể hiện hành vi zero-shot mạnh mẽ; ban đầu công bố mô hình một phần
GPT-3 2020 175 tỷ ≈570 GB (Common Crawl, WebText2 và các nguồn khác) In-context learning quy mô lớn; khả năng học few-shot và zero-shot rõ rệt mà không cần tinh chỉnh
GPT-3.5 2022 Không được tiết lộ (các phiên bản davinci ước tính ~175 tỷ) >570 GB + các kho ngữ liệu bổ sung và instruction tuning Cải thiện tính ổn định và tuân thủ hướng dẫn; nền tảng của các phiên bản ChatGPT đầu tiên
GPT-4 2023 Không được tiết lộ[27] Không được tiết lộ Đa phương thức (văn bản + hình ảnh); tăng độ chính xác và khả năng chống ảo giác; ngữ cảnh 8k/32k token
GPT-4 Turbo 2023 Không được tiết lộ Dựa trên việc huấn luyện GPT-4 (chi tiết không được tiết lộ) Tăng ngữ cảnh lên 128 000 token; tối ưu hóa tốc độ và chi phí sinh
GPT-4o 2024 Không được tiết lộ Dữ liệu đa phương thức (văn bản, hình ảnh, âm thanh) Xử lý đa phương thức bằng mạng nơ-ron thống nhất; tốc độ phản hồi cao
GPT-4.5 2025 Không được tiết lộ Kho ngữ liệu văn bản và đa phương thức mở rộng Bản xem trước nghiên cứu dựa trên GPT-4o; giảm lỗi; deprecated vào năm 2026
GPT-4.1 2025 Không được tiết lộ Kho ngữ liệu cập nhật Ngữ cảnh lên đến 1 047 576 token; văn bản + hình ảnh làm đầu vào, văn bản làm đầu ra
GPT-5 2025 (tháng 8) Không được tiết lộ Kho ngữ liệu đa phương thức quy mô lớn Hệ thống thống nhất với chế độ phản hồi nhanh và suy luận; ngữ cảnh ~400K token; giảm ảo giác
GPT-5.1 2025 (tháng 11) Không được tiết lộ Kho ngữ liệu GPT-5 mở rộng + RLHF Adaptive reasoning; bộ nhớ đệm prompt 24h; cải tiến trong coding
GPT-5.2 2025 (tháng 12) Không được tiết lộ Knowledge cutoff tháng 8 năm 2025 Chế độ Pro; công việc chuyên nghiệp; GPT-5.2-Codex (coding dạng tác nhân)
GPT-5.3-Codex 2026 (tháng 2) Không được tiết lộ Dữ liệu cập nhật + self-improvement Nhanh hơn 25%; tác nhân toàn diện; điều hướng tương tác
GPT-5.3-Codex-Spark 2026 (tháng 2) Không được tiết lộ Nhỏ gọn >1000 t/s trên Cerebras; coding thời gian thực; ngữ cảnh 128K
GPT-5.3 Instant 2026 (tháng 3) Không được tiết lộ Không được tiết lộ Cập nhật mô hình hội thoại được sử dụng nhiều nhất của ChatGPT; cải thiện factuality, web search và conversational flow
GPT-5.4 2026 (tháng 3) Không được tiết lộ Không được tiết lộ Mô hình frontier mới cho công việc chuyên nghiệp; native computer use; mô hình mặc định trong API cho general-purpose và hầu hết các tác vụ coding
GPT-5.4 Pro 2026 (tháng 3) Không được tiết lộ Không được tiết lộ Biến thể GPT-5.4 với compute lớn hơn cho các tác vụ phức tạp nhất

Các tham số kiến trúc của mô hình GPT

Các tham số kiến trúc của mô hình GPT
Mô hình Năm phát hành Số lượng tham số Số lớp Kích thước trạng thái ẩn Số lượng đầu attention Cửa sổ ngữ cảnh Kích thước kho ngữ liệu huấn luyện
GPT-1 2018 ≈117–124 triệu 12 768 12 512 token ≈5 GB (BooksCorpus)
GPT-2 2019 1,5 tỷ 48 1 600 25 1 024 token ≈40 GB (WebText)
GPT-3 2020 175 tỷ 96 12 288 96 2 048 token ≈570 GB (Common Crawl + WebText2 + các nguồn khác)
GPT-3.5 2022 Không được tiết lộ (các phiên bản davinci ước tính ~175 tỷ) (ước tính gần với GPT-3) (ước tính gần với GPT-3) (không được tiết lộ) Đến 4 096 token (phiên bản đầu); đến 16 385 token (phiên bản sau) Common Crawl mở rộng + các tập dữ liệu bổ sung và instruction tuning
GPT-4 2023 Không được tiết lộ (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) 8 192 token (cơ sở); 32 768 (GPT-4-32k) Không được tiết lộ
GPT-4 Turbo 2023 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) Đến 128 000 token Phiên bản tối ưu hóa của GPT-4 (chi tiết kho ngữ liệu không được tiết lộ)
GPT-4o 2024 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) Đến 128 000 token Dữ liệu đa phương thức: văn bản, hình ảnh, âm thanh
GPT-4.5 2025 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) Đến 128 000 token Kho ngữ liệu văn bản và đa phương thức cập nhật
GPT-4.1 2025 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) Đến 1 047 576 token Đa phương thức; huấn luyện mở rộng với trọng tâm vào ngữ cảnh dài
GPT-5 2025 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) Đến ≈400 000 token (tổng ngữ cảnh) Kho ngữ liệu đa phương thức quy mô lớn (chi tiết không được tiết lộ)
GPT-5.4 2026 (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) (không được tiết lộ) 1 050 000 token; 128 000 max output Không được tiết lộ

Liên kết

  • «Improving language understanding with unsupervised learning», OpenAI, 11 tháng 6 năm 2018
  • «Better language models and their implications», OpenAI, 14 tháng 2 năm 2019
  • «GPT-2: 6-month follow-up», OpenAI, 20 tháng 8 năm 2019
  • «GPT-2: 1.5B release», OpenAI, 5 tháng 11 năm 2019
  • «Language models are few-shot learners», OpenAI, 28 tháng 5 năm 2020
  • «OpenAI API», OpenAI, 11 tháng 6 năm 2020
  • «Introducing ChatGPT», OpenAI, 30 tháng 11 năm 2022
  • «Function calling and other API updates», OpenAI, 13 tháng 6 năm 2023
  • «GPT-4», OpenAI, 14 tháng 3 năm 2023
  • «New models and developer products announced at DevDay», OpenAI, 6 tháng 11 năm 2023
  • «Hello GPT-4o», OpenAI, 13 tháng 5 năm 2024
  • «Introducing GPT-4.1 in the API», OpenAI, 14 tháng 4 năm 2025
  • «Introducing GPT-4.5», OpenAI, 27 tháng 2 năm 2025
  • «Introducing GPT-5», OpenAI, 7 tháng 8 năm 2025
  • «GPT-5.1: A smarter, more conversational ChatGPT», OpenAI, 12 tháng 11 năm 2025
  • «Introducing GPT-5.2», OpenAI, 11 tháng 12 năm 2025
  • «Introducing GPT-5.2-Codex», OpenAI, 18 tháng 12 năm 2025
  • «Introducing GPT-5.3-Codex», OpenAI, 5 tháng 2 năm 2026
  • «Introducing GPT-5.3-Codex-Spark», OpenAI, 12 tháng 2 năm 2026
  • «GPT-5.3 Instant: Smoother, more useful everyday conversations», OpenAI, 3 tháng 3 năm 2026
  • «Introducing GPT-5.4», OpenAI, 5 tháng 3 năm 2026
  • «Using GPT-5.4», OpenAI Developers
  • «Models», OpenAI API
  • «Deprecations», OpenAI API
  • «GPT-5.3 and GPT-5.4 in ChatGPT», OpenAI Help Center
  • «Retiring GPT-4o and other ChatGPT models», OpenAI Help Center

Chú thích

  1. OpenAI. «Introducing GPT-5» (7 августа 2025). https://openai.com/index/introducing-gpt-5/
  2. OpenAI. «Introducing GPT-4.5» (2025). https://openai.com/index/introducing-gpt-4-5/
  3. 3.0 3.1 OpenAI. GPT-4.5 System Card (27 февраля 2025). https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf
  4. 4.0 4.1 OpenAI Developers. Deprecations. https://developers.openai.com/api/docs/deprecations/
  5. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  6. OpenAI. «GPT-5.3 Instant: Smoother, more useful everyday conversations» (3 марта 2026). https://openai.com/index/gpt-5-3-instant/
  7. 7.0 7.1 7.2 OpenAI. «Introducing GPT-5.4» (5 марта 2026). https://openai.com/index/introducing-gpt-5-4/
  8. 8.0 8.1 OpenAI Developers. «Using GPT-5.4». https://developers.openai.com/api/docs/guides/latest-model/
  9. Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
  10. OpenAI отмечала, что обновлённый GPT-3.5 Turbo «now comes by default with 16k context».
  11. OpenAI. «GPT-4 Technical Report» (2023). arXiv:2303.08774.
  12. Эти оценки основаны на данных, опубликованных SemiAnalysis и подтверждённых рядом независимых источников.
  13. Анонсирована на DevDay OpenAI 6 ноября 2023 года; общая доступность — с 9 апреля 2024 года.
  14. Кодовое имя Orion и характеристика «последняя модель без chain-of-thought» фигурировали в roadmap-коммуникации Сэма Альтмана и ряде медиа-публикаций (Reuters, The Verge), но не в самом launch post GPT-4.5.
  15. OpenAI. «Introducing GPT-4.1 in the API» (2025).
  16. OpenAI. «Introducing GPT-5» (7 августа 2025).
  17. 17.0 17.1 17.2 OpenAI Help Center. «GPT-5.3 and GPT-5.4 in ChatGPT». https://help.openai.com/en/articles/11909943-gpt-53-and-54-in-chatgpt
  18. OpenAI API documentation. Models: GPT-5.
  19. OpenAI. «Introducing GPT-5» (2025). Условия тестирования: «with web search enabled on anonymized prompts representative of ChatGPT production traffic».
  20. OpenAI Developers. Models: GPT-5.1. https://developers.openai.com/api/docs/models/gpt-5.1
  21. 21.0 21.1 21.2 OpenAI. «GPT-5.1: A smarter, more conversational ChatGPT» (12 ноября 2025). https://openai.com/index/gpt-5-1/
  22. OpenAI. «GPT-5.1 for developers» (2025). https://openai.com/index/gpt-5-1-for-developers/
  23. OpenAI. «Introducing GPT-5.3-Codex» (5 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex/
  24. OpenAI. «Introducing GPT-5.3-Codex-Spark» (12 февраля 2026). https://openai.com/index/introducing-gpt-5-3-codex-spark/
  25. OpenAI Developers. Models: GPT-5.4. https://developers.openai.com/api/docs/models/gpt-5.4
  26. Точное число параметров GPT-1 в разных источниках варьируется; исходная публикация не указывает число явно. Цифра ≈117 млн широко цитируется, а ≈124 млн фигурирует в ряде поздних материалов.
  27. По неофициальным внешним оценкам (SemiAnalysis и др.), возможно MoE-архитектура с суммарным масштабом ~1,8 трлн параметров; OpenAI эти данные не подтверждала.

Tài liệu tham khảo

  • Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
  • OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.