Fine-tuning (deep learning) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Tinh chỉnh mô hình (tiếng Anh: Fine-tuning), còn được gọi là điều chỉnh tinh, — là một phương pháp học chuyển giao (transfer learning) trong Machine Learning, trong đó các tham số của mô hình đã được huấn luyện trước (pre-trained model) được điều chỉnh để giải quyết một nhiệm vụ mới và cụ thể. Thay vì huấn luyện mô hình từ đầu — điều đòi hỏi khối lượng dữ liệu và tài nguyên tính toán khổng lồ — fine-tuning cho phép tận dụng các kiến thức đã được mã hóa trong các trọng số của mô hình và «tinh chỉnh» chúng theo nhu cầu cụ thể.

Phương pháp này đã trở thành tiêu chuẩn thực tế trong lĩnh vực học sâu (deep learning), đặc biệt khi làm việc với các mô hình ngôn ngữ lớn (LLM) và các mô hình thị giác máy tính.

Khái niệm

Quá trình fine-tuning có thể được chia thành hai giai đoạn chính:

1. Huấn luyện trước (Pre-training): Mô hình (ví dụ: BERT hoặc GPT) được huấn luyện trên tập dữ liệu rất lớn và tổng quát (ví dụ: toàn bộ Internet) bằng cách sử dụng nhiệm vụ tự giám sát (ví dụ: dự đoán từ tiếp theo). Ở giai đoạn này, mô hình học các quy luật chung, cú pháp, ngữ nghĩa và kiến thức về thế giới.

2. Tinh chỉnh (Fine-tuning): Mô hình đã được huấn luyện trước được lấy làm nền tảng, và các trọng số của nó được điều chỉnh thêm trên một tập dữ liệu có nhãn nhỏ hơn nhưng đặc thù cho nhiệm vụ mục tiêu.

Ý tưởng cốt lõi là các kiến thức thu được trong giai đoạn huấn luyện trước mang tính phổ quát và có thể được chuyển giao thành công để giải quyết nhiều nhiệm vụ khác, hẹp hơn.

Quy trình fine-tuning

Quy trình fine-tuning điển hình bao gồm các bước sau:

1. Lựa chọn mô hình đã huấn luyện trước: Chọn một mô hình có khả năng nền tảng phù hợp với nhiệm vụ mục tiêu (ví dụ: BERT cho các nhiệm vụ hiểu văn bản, GPT cho các nhiệm vụ sinh văn bản).

2. Điều chỉnh kiến trúc: Một lớp «đầu ra» (head) mới, đặc thù cho nhiệm vụ mục tiêu, được thêm vào mô hình đã huấn luyện trước. Ví dụ:

  • Đối với phân loại văn bản, một lớp kết nối đầy đủ đơn giản với hàm softmax được thêm vào.
  • Đối với nhận dạng thực thể có tên (NER), bộ phân loại được thêm vào đầu ra của mỗi token.

3. Huấn luyện trên tập dữ liệu mục tiêu: Toàn bộ mô hình (hoặc một phần của nó) được huấn luyện trên tập dữ liệu có nhãn mới. Ở giai đoạn này, các trọng số của mô hình, bao gồm cả trọng số của các lớp đã được huấn luyện trước, được cập nhật bằng phương pháp gradient descent để tối thiểu hóa hàm mất mát trên nhiệm vụ mới. 4. Sử dụng tốc độ học thấp hơn: Trong quá trình fine-tuning, thường sử dụng tốc độ học thấp hơn đáng kể so với giai đoạn huấn luyện trước. Điều này cần thiết để tránh «phá hủy» các kiến thức hữu ích đã được mã hóa trong các trọng số của mô hình, mà chỉ điều chỉnh chúng một cách cẩn thận.

Các loại fine-tuning

Tinh chỉnh toàn bộ (Full Fine-tuning)

  • Nguyên tắc: Tất cả các tham số của mô hình đã huấn luyện trước cùng với lớp «đầu ra» mới đều được cập nhật.
  • Ưu điểm: Tiềm năng mang lại hiệu suất tốt nhất, vì toàn bộ mô hình được thích nghi với nhiệm vụ mới.
  • Nhược điểm: Đòi hỏi tài nguyên tính toán và bộ nhớ đáng kể, vì cần lưu trữ và cập nhật gradient cho tất cả các tham số. Có nguy cơ xảy ra quên thảm khốc (catastrophic forgetting), khi mô hình «quên» các kiến thức chung thu được trong giai đoạn huấn luyện trước.

Tinh chỉnh hiệu quả tham số (Parameter-Efficient Fine-Tuning, PEFT)

Đây là một nhóm các phương pháp nhằm giảm chi phí tính toán trong quá trình fine-tuning. Ý tưởng chính là đóng băng phần lớn các tham số của mô hình đã huấn luyện trước và chỉ huấn luyện một số lượng nhỏ các tham số mới hoặc các tham số hiện có được chọn lọc.

  • Ví dụ về các phương pháp PEFT:
    • Bộ điều hợp (Adapters): Các lớp điều hợp nhỏ, bổ sung được chèn vào kiến trúc Transformer, và chỉ chúng được huấn luyện.
    • LoRA (Low-Rank Adaptation): Thay vì cập nhật toàn bộ ma trận trọng số, LoRA huấn luyện các cập nhật hạng thấp (low-rank) của chúng. Điều này cho phép giảm số lượng tham số được huấn luyện hàng nghìn lần.
    • Prompt Tuning: Các vector «prompt» có thể huấn luyện được thêm vào dữ liệu đầu vào, chúng được tinh chỉnh để giải quyết nhiệm vụ, trong khi bản thân mô hình vẫn bị đóng băng.
  • Ưu điểm của PEFT:
    • Hiệu quả: Giảm đáng kể yêu cầu về bộ nhớ và tính toán.
    • Tính mô-đun: Cho phép dễ dàng thích nghi một mô hình đã huấn luyện trước cho nhiều nhiệm vụ khác nhau, chỉ cần lưu trữ các bộ trọng số đã thích nghi nhỏ cho mỗi nhiệm vụ.

Tinh chỉnh theo hướng dẫn (Instruction Tuning)

Đây là một loại fine-tuning đặc thù, nhằm nâng cao khả năng của LLM trong việc tuân theo các hướng dẫn bằng ngôn ngữ tự nhiên.

  • Nguyên tắc hoạt động: Mô hình được fine-tune trên tập dữ liệu bao gồm các cặp «hướng dẫn — kết quả mong muốn».
  • Mục tiêu: Cải thiện khả năng tổng quát hóa của mô hình trên các nhiệm vụ mới, chưa từng thấy trước đây, có thể được mô tả dưới dạng hướng dẫn. Các mô hình như InstructGPT và FLAN-T5 là những ví dụ tiêu biểu của phương pháp này.

Tài liệu tham khảo

  • Howard, J.; Ruder, S. (2018). Universal Language Model Fine-tuning for Text Classification. arXiv:1801.06146.
  • Houlsby, N. et al. (2019). Parameter-Efficient Transfer Learning for NLP. arXiv:1902.00751.
  • Pfeiffer, J. et al. (2020). AdapterFusion: Non-Destructive Task Composition for Transfer Learning. arXiv:2005.00247.
  • Hu, E. J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Lester, B.; Al-Rfou, R.; Constant, N. (2021). The Power of Scale for Parameter-Efficient Prompt Tuning. arXiv:2104.08691.
  • Ben Zaken, A.; Goldberg, Y.; Ravfogel, S. (2022). BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-based Masked Language-Models. ACL 2022.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Han, Z. et al. (2024). Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey. arXiv:2403.14608.
  • Bian, J. et al. (2025). A Survey on Parameter-Efficient Fine-Tuning for Foundation Models in Federated Learning. arXiv:2504.21099.
  • Li, X. et al. (2025). Revisiting Fine-Tuning: A Survey of Parameter-Efficient Techniques and Future Directions. Preprints.org.

Xem thêm

  • Mô hình ngôn ngữ lớn
  • BERT
  • GPT