Reinforcement learning from human feedback (RLHF) (PL)
Uczenie ze wzmocnieniem z informacją zwrotną od człowieka (Reinforcement Learning from Human Feedback, RLHF) — to metoda machine learning, w której najpierw na podstawie informacji zwrotnej od ludzi trenowany jest specjalny „model nagrody" (reward model), po czym jest on wykorzystywany w procesie uczenia ze wzmocnieniem (RL) do optymalizacji zachowania inteligentnego agenta[1].
RLHF pozwala sformalizować złożone lub trudne do zdefiniowania cele (na przykład „użyteczna", „bezpieczna" lub „zabawna" odpowiedź) poprzez oceny ludzi. Zamiast ręcznie definiować skomplikowaną funkcję nagrody, RLHF umożliwia trenowanie modelu nagrody bezpośrednio na podstawie ludzkich preferencji. Podejście to stało się kluczowe dla „wyrównania" (alignment) dużych modeli językowych (LLM), czyli dostosowania ich zachowania do ludzkich wartości i intencji[2].
Rozwój metody i pierwsze osiągnięcia
Pomysł trenowania agentów z wykorzystaniem informacji zwrotnej od człowieka narodził się w latach 2010-tych. Jednym z pierwszych znaczących wyników była praca Paula Christiano i współpracowników z OpenAI i DeepMind w 2017 roku. Wykazali oni, że ludzkie preferencje mogą zastąpić ręcznie zdefiniowaną funkcję nagrody w złożonych zadaniach RL. W ich eksperymencie człowiek oglądał fragmenty zachowania agenta (na przykład w grze Atari) i wybierał bardziej preferowany wariant. Na podstawie tych porównań parowych wytrenowano model nagrody, co pozwoliło skutecznie rozwiązać szereg trudnych zadań, otrzymując informację zwrotną dla mniej niż 1% działań agenta[3].
W kolejnych latach metoda zaczęła być stosowana do trenowania modeli językowych. W 2020 roku badacze z OpenAI po raz pierwszy zastosowali RLHF do zadania streszczania tekstu. Wytrenowali model nagrody przewidujący, które streszczenie preferuje człowiek, i za pomocą RL douczyli model w celu optymalizacji tej oceny. Wyniki pokazały znacznie wyższą jakość streszczowania, przewyższając nawet modele trenowane na ludzkich przykładach referencyjnych[4].
RLHF w dużych modelach językowych
Duże modele językowe odniosły istotne korzyści z wdrożenia RLHF w celu poprawy swoich odpowiedzi pod względem użyteczności, dokładności i zgodności z instrukcjami.
InstructGPT i ChatGPT
Jednym z kluczowych kroków było badanie OpenAI, które przedstawiło modele InstructGPT (2022) — wersje GPT-3 douczane z udziałem człowieka[5]. Metodologia składała się z trzech etapów:
- Supervised Fine-Tuning (SFT): Model jest douczany na małym zbiorze wysokiej jakości demonstracji, gdzie ludzcy oceniający ręcznie piszą przykłady pożądanych odpowiedzi na różne zapytania.
- Trenowanie modelu nagrody (Reward Model): Dla wielu zapytań generowanych jest kilka odpowiedzi modelu. Ludzcy oceniający rankingują te odpowiedzi od najlepszej do najgorszej. Na podstawie tych danych o preferencjach trenowany jest model nagrody, który uczy się przypisywać wyższe oceny odpowiedziom preferowanym przez ludzi.
- Optymalizacja za pomocą RL: Wyjściowy model językowy jest douczany za pomocą algorytmu proksymalnej optymalizacji polityki (PPO) w celu maksymalizacji oceny wystawianej przez model nagrody. W procesie optymalizacji wprowadzana jest również kara za znaczne odchylenie od wyjściowego modelu SFT, aby zapobiec degradacji zdolności językowych.
Testy wykazały, że nawet stosunkowo mały model InstructGPT (1,3 mld parametrów) przewyższył pod względem użyteczności gigantyczny model GPT-3 (175 mld parametrów). Modele InstructGPT znacznie rzadziej generowały również treści toksyczne, stronnicze lub nieprawdziwe[5].
Rozwój tej linii doprowadził do powstania modeli dialogowych, z których najbardziej znany stał się ChatGPT (OpenAI, koniec 2022). ChatGPT to model z serii GPT-3.5, specjalnie douczony do prowadzenia dialogu z wykorzystaniem RLHF według podobnej metodologii[6].
Przyjęcie w branży
Metoda RLHF została przyjęta również przez inne czołowe organizacje. DeepMind opracował agenta dialogowego Sparrow (2022), który był trenowany za pomocą RLHF z dodaniem zestawu reguł w języku naturalnym (na przykład „nie udzielaj niebezpiecznych porad")[7]. Firma Anthropic również wykorzystała podobne zasady do trenowania swoich modeli. Do 2023 roku RLHF stał się niemal standardowym komponentem przy tworzeniu najbardziej zaawansowanych modeli językowych[1].
Zalety stosowania RLHF
- Zgodność z intencjami użytkownika: Modele poddane fine-tuningowi za pomocą RLHF znacznie lepiej przestrzegają instrukcji i udzielają bardziej trafnych i użytecznych odpowiedzi[5].
- Redukcja toksyczności i szkodliwych treści: Włączenie człowieka do pętli treningowej pozwala jawnie karać niepożądane formy odpowiedzi. W rezultacie modele RLHF generują znacznie mniej toksycznych i stronniczych treści[5].
- Poprawa prawdziwości i redukcja „halucynacji": Oceniający mogą obniżać ranking odpowiedzi zawierających zmyślone fakty, skłaniając model do większej precyzji. Modele InstructGPT i ChatGPT rzadziej „wymyślają" fakty w porównaniu ze swoimi poprzednikami[5].
- Efektywność trenowania: RLHF pozwala ulepszyć model bez proporcjonalnego zwiększania zbioru treningowego. Nie są potrzebne ogromne ilości danych, lecz wysokiej jakości oceny preferencji.
Ograniczenia i problemy
Pomimo sukcesów metoda RLHF ma szereg ograniczeń i nierozwiązanych problemów.
- Jakość i koszt zbierania danych od ludzi: Skuteczność RLHF zależy bezpośrednio od jakości informacji zwrotnej. Zebranie takiego datasetu to pracochłonny i kosztowny proces. Ponadto jeśli próba oceniających lub ich kryteria są stronnicze, model może odziedziczyć ich tendencyjność[2].
- Ryzyko „wyuczonego dopasowania" (Reward Hacking): Model optymalizowany pod określoną funkcję nagrody może zacząć dostosowywać się właśnie do tej funkcji, a nie do prawdziwego celu. Na przykład może nauczyć się udzielać jak najdłuższych odpowiedzi, jeśli oceniający cenią długość, lub unikać stwierdzeń, jeśli są karani za nieścisłości.
- Brak gwarancji prawdziwości: RLHF nie wprowadza do modelu nowej wiedzy faktycznej, a jedynie uczy go formy odpowiedzi, która podoba się ludziom. Dlatego problem halucynacji nie jest w pełni rozwiązany. Model może nauczyć się lepiej ukrywać niepewność, ale nie zawsze będzie w stanie weryfikować fakty[6].
- Skalowalność preferencji: Wątpliwości budzi również przenoszalność modelu nagrody na inne zadania. Model wytrenowany na preferencjach dla jednego zestawu zapytań może zachowywać się nieprzewidywalnie, gdy zetknie się z nowymi zadaniami pod względem stylu lub tematyki.
Podsumowanie
RLHF ugruntował się jako ważna metoda „wyrównania" dużych modeli językowych z ludzkimi wyobrażeniami o dobrych odpowiedziach. Pozwolił znacząco poprawić jakość interakcji z asystentami AI, czyniąc ich odpowiedzi bardziej użytecznymi i bezpiecznymi. RLHF jest postrzegany jako kluczowe narzędzie na drodze do tworzenia modeli zdolnych nie tylko do generowania wiarygodnego tekstu, ale także do uwzględniania ludzkich wartości, preferencji i intencji w procesie komunikacji[8].
Odnośniki
- Artykuł OpenAI o douczaniu modeli do przestrzegania instrukcji
- Przegląd RLHF od IBM
Literatura
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Przypisy
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]