Reinforcement learning from human feedback (RLHF) (VI)
Học tăng cường từ phản hồi của con người (Reinforcement Learning from Human Feedback, RLHF) — là một phương pháp Machine Learning, trong đó trước tiên một "mô hình phần thưởng" (reward model) đặc biệt được huấn luyện dựa trên phản hồi từ con người, sau đó mô hình này được sử dụng trong quá trình Reinforcement Learning (RL) để tối ưu hóa hành vi của tác nhân thông minh[1].
RLHF cho phép hình thức hóa các mục tiêu phức tạp hoặc khó xác định (ví dụ: câu trả lời "hữu ích", "an toàn" hay "hài hước") thông qua đánh giá của con người. Thay vì xác định thủ công một hàm phần thưởng phức tạp, RLHF cho phép huấn luyện reward model trực tiếp dựa trên sở thích của con người. Phương pháp này đã trở thành chìa khóa cho việc "alignment" (căn chỉnh) các mô hình ngôn ngữ lớn (LLM), tức là điều chỉnh hành vi của chúng phù hợp với các giá trị và ý định của con người[2].
Sự phát triển của phương pháp và những thành tựu đầu tiên
Ý tưởng huấn luyện các tác nhân sử dụng phản hồi từ con người bắt đầu xuất hiện vào những năm 2010. Một trong những kết quả đáng kể đầu tiên là công trình của Paul Christiano và các đồng nghiệp từ OpenAI và DeepMind vào năm 2017. Họ đã chứng minh rằng sở thích của con người có thể thay thế hàm phần thưởng được xác định thủ công trong các bài toán RL phức tạp. Trong thí nghiệm của họ, con người xem các đoạn hành vi của tác nhân (ví dụ trong trò chơi Atari) và chọn phương án được ưa thích hơn. Dựa trên các so sánh theo cặp này, một reward model đã được huấn luyện, cho phép giải quyết thành công một số bài toán phức tạp với phản hồi thu thập từ chưa đến 1% hành động của tác nhân[3].
Trong những năm tiếp theo, phương pháp này bắt đầu được áp dụng để huấn luyện các mô hình ngôn ngữ. Năm 2020, các nhà nghiên cứu tại OpenAI lần đầu tiên áp dụng RLHF cho bài toán tóm tắt văn bản. Họ đã huấn luyện một reward model dự đoán bản tóm tắt nào được con người ưa thích hơn, và sử dụng RL để fine-tuning mô hình nhằm tối ưu hóa điểm đánh giá này. Kết quả cho thấy chất lượng tóm tắt cao hơn đáng kể, vượt qua cả các mô hình được huấn luyện trên các ví dụ tham chiếu do con người tạo ra[4].
RLHF trong các mô hình ngôn ngữ lớn
Các mô hình ngôn ngữ lớn đã thu được lợi ích đáng kể từ việc áp dụng RLHF để cải thiện câu trả lời của chúng về mặt tính hữu ích, độ chính xác và khả năng tuân theo hướng dẫn.
InstructGPT và ChatGPT
Một trong những bước tiến quan trọng là nghiên cứu của OpenAI, giới thiệu mô hình InstructGPT (2022) — các phiên bản GPT-3 được fine-tuning với sự tham gia của con người[5]. Phương pháp luận bao gồm ba giai đoạn:
- Supervised Fine-Tuning (SFT): Mô hình được fine-tuning trên một tập nhỏ các ví dụ minh họa chất lượng cao, trong đó những người đánh giá viết tay các ví dụ về câu trả lời mong muốn cho các yêu cầu khác nhau.
- Huấn luyện Reward Model: Với nhiều yêu cầu khác nhau, mô hình tạo ra nhiều câu trả lời. Những người đánh giá xếp hạng các câu trả lời này từ tốt nhất đến tệ nhất. Dựa trên dữ liệu sở thích này, một reward model được huấn luyện để học cách gán điểm cao hơn cho những câu trả lời mà con người ưa thích.
- Tối ưu hóa bằng RL: Mô hình ngôn ngữ gốc được fine-tuning bằng thuật toán tối ưu hóa chính sách gần đúng (PPO) để tối đa hóa điểm do reward model đưa ra. Trong quá trình tối ưu hóa, một hình phạt cũng được áp dụng cho sự sai lệch lớn so với mô hình SFT gốc nhằm ngăn chặn sự suy giảm khả năng ngôn ngữ.
Các thử nghiệm cho thấy ngay cả mô hình InstructGPT tương đối nhỏ (1,3 tỷ tham số) cũng vượt trội hơn mô hình GPT-3 khổng lồ (175 tỷ tham số) về tính hữu ích. Các mô hình InstructGPT cũng ít tạo ra nội dung độc hại, thiên vị hoặc không đáng tin cậy hơn đáng kể[5].
Sự phát triển của dòng này dẫn đến việc tạo ra các mô hình hội thoại, trong đó nổi tiếng nhất là ChatGPT (OpenAI, cuối năm 2022). ChatGPT là mô hình thuộc dòng GPT-3.5, được fine-tuning đặc biệt cho việc thực hiện hội thoại sử dụng RLHF theo phương pháp luận tương tự[6].
Áp dụng trong ngành công nghiệp
Phương pháp RLHF cũng được các tổ chức hàng đầu khác áp dụng. DeepMind đã phát triển tác nhân hội thoại Sparrow (2022), được huấn luyện bằng RLHF kết hợp với một bộ quy tắc bằng ngôn ngữ tự nhiên (ví dụ: "không đưa ra lời khuyên nguy hiểm")[7]. Anthropic cũng sử dụng các nguyên tắc tương tự để huấn luyện các mô hình của mình. Đến năm 2023, RLHF đã trở thành một thành phần gần như tiêu chuẩn trong việc tạo ra các mô hình ngôn ngữ tiên tiến nhất[1].
Ưu điểm của việc áp dụng RLHF
- Phù hợp với ý định của người dùng: Các mô hình đã qua RLHF fine-tuning tuân theo hướng dẫn tốt hơn đáng kể và đưa ra các câu trả lời phù hợp và hữu ích hơn[5].
- Giảm độc tính và nội dung có hại: Việc đưa con người vào vòng lặp huấn luyện cho phép trừng phạt rõ ràng các hình thức phản hồi không mong muốn. Kết quả là các mô hình RLHF tạo ra nội dung độc hại và thiên vị ít hơn nhiều[5].
- Cải thiện tính trung thực và giảm "ảo giác": Những người đánh giá có thể hạ thấp xếp hạng các câu trả lời có sự kiện bịa đặt, khuyến khích mô hình chính xác hơn. Các mô hình InstructGPT và ChatGPT ít "bịa đặt" sự kiện hơn so với các tiền thân của chúng[5].
- Hiệu quả huấn luyện: RLHF cho phép cải thiện mô hình mà không cần tăng tỷ lệ thuận dữ liệu huấn luyện. Thay vì khối lượng dữ liệu khổng lồ, điều cần thiết là các đánh giá sở thích chất lượng cao.
Hạn chế và vấn đề
Mặc dù có những thành công, phương pháp RLHF vẫn có một số hạn chế và vấn đề chưa được giải quyết.
- Chất lượng và chi phí thu thập dữ liệu từ con người: Hiệu quả của RLHF phụ thuộc trực tiếp vào chất lượng phản hồi. Việc thu thập dataset như vậy là một quá trình tốn công sức và chi phí cao. Ngoài ra, nếu mẫu người đánh giá hoặc tiêu chí của họ thiếu khách quan, mô hình có thể kế thừa sự thiên lệch của họ[2].
- Nguy cơ "Reward Hacking": Mô hình được tối ưu hóa cho một hàm phần thưởng cụ thể có thể bắt đầu thích nghi với chính hàm đó thay vì mục tiêu thực sự. Ví dụ, nó có thể học cách đưa ra các câu trả lời dài nhất có thể nếu người đánh giá đánh giá cao độ dài, hoặc tránh đưa ra khẳng định nếu bị phạt vì không chính xác.
- Thiếu đảm bảo về tính trung thực: RLHF không đưa kiến thức thực tế mới vào mô hình, mà chỉ dạy nó hình thức câu trả lời mà con người ưa thích. Vì vậy, vấn đề ảo giác chưa được giải quyết hoàn toàn. Mô hình có thể học cách che giấu sự không chắc chắn tốt hơn, nhưng không phải lúc nào cũng có thể kiểm tra các sự kiện[6].
- Mở rộng quy mô sở thích: Việc chuyển giao reward model sang các bài toán khác cũng đặt ra câu hỏi. Một mô hình được huấn luyện trên sở thích cho một tập hợp yêu cầu nhất định có thể hoạt động không thể đoán trước khi gặp các bài toán mới về phong cách hoặc chủ đề.
Kết luận
RLHF đã được khẳng định là một phương pháp quan trọng để "alignment" các mô hình ngôn ngữ lớn với quan niệm của con người về các câu trả lời tốt. Nó đã cho phép cải thiện đáng kể chất lượng tương tác với các trợ lý AI, làm cho câu trả lời của chúng hữu ích hơn và an toàn hơn. RLHF được xem là công cụ then chốt trên con đường tạo ra các mô hình không chỉ tạo ra văn bản có vẻ hợp lý, mà còn tính đến các giá trị, sở thích và ý định của con người trong quá trình giao tiếp[8].
Liên kết
- Bài viết của OpenAI về fine-tuning các mô hình để tuân theo hướng dẫn
- Tổng quan về RLHF từ IBM
Tài liệu tham khảo
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Chú thích
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]