Decoder-only models (architecture) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Mô hình chỉ dùng bộ giải mã (tiếng Anh: Decoder-Only Models) — là lớp kiến trúc thống trị của các mô hình ngôn ngữ lớn (LLM), được xây dựng hoàn toàn dựa trên phần giải mã (decoder) của kiến trúc Transformer. Các mô hình này chuyên về các tác vụ sinh văn bản và là nền tảng cho hầu hết các chatbot và trợ lý AI hiện đại.

Dòng mô hình tiên phong đã phổ biến hóa cách tiếp cận này là dòng GPT của OpenAI.

Khái niệm và kiến trúc

Ý tưởng cốt lõi của các mô hình chỉ dùng bộ giải mã là sinh chuỗi tự hồi quy (autoregressive generation). Điều này có nghĩa là mô hình dự đoán token tiếp theo dựa trên tất cả các token trước đó đã được sinh ra. Prompt đầu vào (câu hỏi của người dùng) và văn bản đã được sinh ra được coi là một chuỗi thống nhất mà mô hình tiếp tục.

Về mặt kiến trúc, mô hình là một ngăn xếp gồm N lớp giải mã giống hệt nhau. Mỗi lớp, khác với bộ mã hóa hoặc bộ giải mã đầy đủ, chỉ chứa hai lớp con chính:

  1. Cơ chế tự chú ý đa đầu có mặt nạ (Masked Multi-Head Self-Attention): Đây là cơ chế then chốt đảm bảo tính chất tự hồi quy. Trong quá trình xử lý chuỗi, một mặt nạ nhân quả (causal mask) đặc biệt ngăn không cho mỗi token "nhìn" vào các token phía sau. Như vậy, dự đoán cho vị trí i chỉ phụ thuộc vào các token ở các vị trí <i.
  2. Mạng nơ-ron kết nối đầy đủ (Feed-Forward Network): Áp dụng phép biến đổi phi tuyến tính lên biểu diễn của mỗi token.

Các mô hình chỉ dùng bộ giải mã không có cơ chế chú ý chéo (cross-attention), vì không có bộ mã hóa nào để "chú ý" vào.

Nhiệm vụ tiền huấn luyện

Các mô hình chỉ dùng bộ giải mã được huấn luyện trên một nhiệm vụ tự giám sát duy nhất nhưng rất mạnh mẽ:

Mô hình hóa ngôn ngữ nhân quả (Causal Language Modeling, CLM)

  • Nguyên lý hoạt động: Mô hình được huấn luyện để dự đoán token tiếp theo trong chuỗi. Ở mỗi bước huấn luyện, nó nhận một đoạn văn bản làm đầu vào và phải sinh ra phân phối xác suất cho token tiếp theo.
  • Mục tiêu: Tối đa hóa xác suất của token tiếp theo đúng trên khối lượng dữ liệu văn bản khổng lồ. Nhiệm vụ thoạt nhìn có vẻ đơn giản này buộc mô hình phải học ngữ pháp, cú pháp, các sự kiện về thế giới và các quy luật phức tạp của ngôn ngữ.

Ứng dụng

Nhờ bản chất tự hồi quy, các mô hình chỉ dùng bộ giải mã phù hợp lý tưởng với mọi tác vụ yêu cầu sinh văn bản:

  • Sinh văn bản tự do: Viết bài báo, thơ, kịch bản, v.v.
  • Hệ thống hội thoại và chatbot: Trả lời câu hỏi của người dùng theo phong cách hội thoại.
  • Tóm tắt văn bản: Tạo nội dung tóm lược của các văn bản dài.
  • Dịch máy: Mặc dù các mô hình encoder-decoder thường được dùng cho tác vụ này, các mô hình chỉ dùng bộ giải mã cũng có thể xử lý dịch thuật nếu tác vụ được diễn đạt trong prompt (ví dụ: «Dịch từ tiếng Anh sang tiếng Việt: ...»).
  • Viết mã: Sinh mã lập trình từ mô tả bằng văn bản.
  • Học trong ngữ cảnh (In-context learning): Nhờ quy mô lớn, các mô hình giải mã lớn thể hiện khả năng giải quyết các tác vụ mới chỉ với vài ví dụ (few-shot) hoặc thậm chí không cần ví dụ nào (zero-shot) ngay trong prompt, mà không cần fine-tuning.

Các mô hình tiêu biểu và sự phát triển của chúng

  • Dòng GPT (2018 - nay): Những người tiên phong và phổ biến hóa cách tiếp cận này. GPT-1 chứng minh hiệu quả của tiền huấn luyện, GPT-2 thể hiện sức mạnh của việc mở rộng quy mô, còn GPT-3 — sự xuất hiện của khả năng few-shot. ChatGPT và GPT-4 đã biến kiến trúc này thành tiêu chuẩn cho các trợ lý AI.
  • LLaMA (2023 - nay): Dòng mô hình mã nguồn mở từ Meta, đã dân chủ hóa khả năng tiếp cận với các LLM mạnh mẽ và thúc đẩy làn sóng đổi mới trong cộng đồng.
  • Claude (2023 - nay): Dòng mô hình từ Anthropic, tập trung vào sự an toàn và khả năng kiểm soát thông qua Constitutional AI.
  • PaLMGemini (2022 - nay): Các mô hình hàng đầu của Google. Gemini cũng là mô hình chỉ dùng bộ giải mã đa phương thức nguyên bản.

So sánh với các kiến trúc khác

So sánh các kiến trúc chính dựa trên Transformer
Kiến trúc Nhiệm vụ chính Hướng ngữ cảnh Các mô hình tiêu biểu
Chỉ dùng bộ giải mã Sinh văn bản Một chiều (từ trái sang phải) GPT, LLaMA, Claude, Gemini
Chỉ dùng bộ mã hóa Hiểu văn bản Hai chiều BERT, RoBERTa
Bộ mã hóa - bộ giải mã Chuyển đổi chuỗi sang chuỗi Hai chiều (bộ mã hóa) + Một chiều (bộ giải mã) T5, BART, Transformer gốc

Xem thêm

  • GPT