Reinforcement learning from human feedback (RLHF) (CS)
Učení s posilováním se zpětnou vazbou od člověka (Reinforcement Learning from Human Feedback, RLHF) — je metoda strojového učení, při níž je nejprve na základě zpětné vazby od lidí natrénován speciální „model odměny" (reward model), který je poté využíván v procesu učení s posilováním (RL) k optimalizaci chování inteligentního agenta[1].
RLHF umožňuje formalizovat složité nebo obtížně definovatelné cíle (například „užitečná", „bezpečná" nebo „vtipná" odpověď) prostřednictvím hodnocení lidí. Namísto ručního definování složité funkce odměny umožňuje RLHF trénovat model odměny přímo na lidských preferencích. Tento přístup se stal klíčovým pro „vyrovnávání" (alignment) velkých jazykových modelů (LLM), tedy přizpůsobení jejich chování lidským hodnotám a záměrům[2].
Vývoj metody a první úspěchy
Myšlenka trénování agentů s využitím zpětné vazby od člověka vznikla v roce 2010. Jedním z prvních významných výsledků byla práce Paula Christiana a kolegů z OpenAI a DeepMind v roce 2017. Ukázali, že lidské preference mohou nahradit ručně zadanou funkci odměny ve složitých úlohách RL. V jejich experimentu člověk sledoval úseky chování agenta (například ve hře Atari) a vybíral preferovanou variantu. Na základě těchto párových srovnání byl natrénován model odměny, což umožnilo úspěšně řešit řadu složitých úloh při získávání zpětné vazby pro méně než 1 % akcí agenta[3].
V následujících letech se metoda začala uplatňovat při trénování jazykových modelů. V roce 2020 výzkumníci z OpenAI poprvé použili RLHF pro úlohu sumarizace textu. Natrénovali model odměny, který předpovídal, které shrnutí člověk upřednostní, a pomocí RL doladili model pro optimalizaci tohoto hodnocení. Výsledek ukázal výrazně vyšší kvalitu sumarizace, překonávající dokonce modely trénované na lidských referenčních příkladech[4].
RLHF ve velkých jazykových modelech
Velké jazykové modely výrazně profitovaly ze zavedení RLHF pro zlepšení svých odpovědí z hlediska užitečnosti, přesnosti a plnění pokynů.
InstructGPT a ChatGPT
Jedním z klíčových kroků byl výzkum OpenAI, který představil modely InstructGPT (2022) — verze GPT-3 doladěné za účasti člověka[5]. Metodologie se skládala ze tří fází:
- Supervised Fine-Tuning (SFT): Model je doladěn na malé sadě vysoce kvalitních ukázek, kde lidé-hodnotitelé ručně píší příklady požadovaných odpovědí na různé dotazy.
- Trénování modelu odměny (Reward Model): Pro sadu dotazů je vygenerováno několik odpovědí modelu. Lidé-hodnotitelé seřadí tyto odpovědi od nejlepší k nejhorší. Na základě těchto dat o preferencích je natrénován model odměny, který se učí přiřazovat vyšší skóre těm odpovědím, které lidé preferují.
- Optimalizace pomocí RL: Původní jazykový model je doladěn pomocí algoritmu proximální optimalizace politiky (PPO) tak, aby maximalizoval skóre udělované modelem odměny. V průběhu optimalizace je také zavedena penalizace za výrazné odchýlení od původního SFT modelu, aby se zabránilo degradaci jazykových schopností.
Testování ukázalo, že i relativně malý model InstructGPT (1,3 miliard parametrů) překonal co do užitečnosti obří model GPT-3 (175 miliard parametrů). Modely InstructGPT také začaly výrazně méně generovat toxický, zaujatý nebo nedůvěryhodný obsah[5].
Rozvoj této linie vedl k vytvoření dialogových modelů, z nichž nejznámější se stala ChatGPT (OpenAI, konec roku 2022). ChatGPT je model řady GPT-3.5, speciálně doladěný pro vedení dialogu s využitím RLHF podle podobné metodologie[6].
Přijetí v průmyslu
Metodu RLHF přijaly i jiné přední organizace. DeepMind vyvinul dialogového agenta Sparrow (2022), který byl natrénován pomocí RLHF s přidáním sady pravidel v přirozeném jazyce (například „neposkytovat nebezpečné rady")[7]. Společnost Anthropic také využila podobné principy pro trénování svých modelů. V roce 2023 se RLHF stal prakticky standardní součástí při vytváření nejpokročilejších jazykových modelů[1].
Výhody použití RLHF
- Soulad se záměry uživatele: Modely, které prošly RLHF fine-tuningem, výrazně lépe dodržují pokyny a poskytují relevantnější a užitečnější odpovědi[5].
- Snížení toxicity a škodlivého obsahu: Zapojení člověka do cyklu trénování umožňuje explicitně penalizovat nežádoucí formy odpovědí. V důsledku toho modely RLHF generují mnohem méně toxický a zaujatý obsah[5].
- Zlepšení pravdivosti a snížení „halucinací": Hodnotitelé mohou snižovat hodnocení odpovědí s vymyšlenými fakty, čímž motivují model k větší přesnosti. Modely InstructGPT a ChatGPT méně „vymýšlejí" fakta ve srovnání se svými předchůdci[5].
- Efektivita trénování: RLHF umožňuje zlepšit model bez proporcionálního zvýšení tréninkové sady. Nejsou potřeba obrovské objemy dat, ale kvalitní hodnocení preferencí.
Omezení a problémy
Navzdory úspěchům má metoda RLHF řadu omezení a otevřených problémů.
- Kvalita a náklady na sběr lidských dat: Účinnost RLHF přímo závisí na kvalitě zpětné vazby. Sběr takového datasetu je pracně náročný a nákladný proces. Navíc pokud je výběr hodnotitelů nebo jejich kritéria neobjektivní, může model zdědit jejich zaujatost[2].
- Riziko „naučené shody" (Reward Hacking): Model optimalizovaný pro určitou funkci odměny může začít přizpůsobovat se právě této funkci, nikoli skutečnému cíli. Může se například naučit dávat co nejdelší odpovědi, pokud hodnotitelé oceňují délku, nebo se vyhýbat tvrzením, pokud jsou penalizovány za nepřesnosti.
- Absence záruk pravdivosti: RLHF nepřináší do modelu nové faktické znalosti, ale pouze učí formu odpovědi, která se lidem líbí. Proto není problém halucinací zcela vyřešen. Model se může naučit lépe skrývat nejistotu, ale ne vždy bude schopen ověřovat fakta[6].
- Škálování preferencí: Otázky vyvolává také přenos modelu odměny na jiné úlohy. Model natrénovaný na preferencích pro jednu sadu dotazů může jednat nepředvídatelně, když se setkává s úlohami novými co do stylu nebo tematiky.
Závěr
RLHF se etabloval jako důležitá metoda „vyrovnávání" velkých jazykových modelů s lidskými představami o kvalitních odpovědích. Umožnil výrazně zlepšit kvalitu interakce s AI asistenty, čímž se jejich odpovědi staly užitečnějšími a bezpečnějšími. RLHF je považován za klíčový nástroj na cestě k vytvoření modelů schopných nejen generovat věrohodný text, ale také zohledňovat lidské hodnoty, preference a záměry v průběhu komunikace[8].
Odkazy
- Článek OpenAI o dolaďování modelů pro plnění pokynů
- Přehled RLHF od IBM
Literatura
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Poznámky
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]