Reinforcement learning from human feedback (RLHF) (HU)
Megerősítéses tanulás emberi visszajelzéssel (Reinforcement Learning from Human Feedback, RLHF) — olyan gépi tanulási módszer, amelyben először az emberektől származó visszajelzések alapján tanítanak egy speciális „jutalom-modellt" (reward model), amelyet ezután a megerősítéses tanulás (RL) folyamatában alkalmaznak egy intelligens ágens viselkedésének optimalizálására[1].
Az RLHF lehetővé teszi összetett vagy nehezen meghatározható célok formalizálását (például „hasznos", „biztonságos" vagy „szórakoztató" válasz) az emberek értékelésein keresztül. Ahelyett, hogy kézzel kellene meghatározni egy bonyolult jutalom-függvényt, az RLHF lehetővé teszi a jutalom-modell közvetlen tanítását az emberi preferenciák alapján. Ez a megközelítés kulcsfontosságúvá vált a nagy nyelvi modellek (LLM) „összehangolásában" (alignment), vagyis viselkedésük emberi értékekkel és szándékokkal való összhangba hozásában[2].
Fejlesztés és első eredmények
Az ágensek emberi visszajelzéssel történő tanításának ötlete a 2010-es években született. Az egyik első jelentős eredmény Paul Christiano és kollégái munkája volt az OpenAI-tól és a DeepMind-tól 2017-ben. Megmutatták, hogy az emberi preferenciák helyettesíthetik a kézzel megadott jutalom-függvényt összetett RL-feladatokban. Kísérletükben egy ember megtekintette az ágens viselkedésének részleteit (például Atari-játékban), és kiválasztotta az előnyösebbnek ítélt változatot. E páros összehasonlítások alapján tanítottak egy jutalom-modellt, amely lehetővé tette számos összetett feladat sikeres megoldását, miközben az ágens cselekedeteinek kevesebb mint 1%-ára vonatkozott visszajelzés[3].
A következő években a módszert elkezdték alkalmazni nyelvi modellek tanítására is. 2020-ban az OpenAI kutatói először alkalmazták az RLHF-et szövegösszefoglalási feladatra. Tanítottak egy jutalom-modellt, amely előrejelezte, hogy az emberek melyik összefoglalót részesítenék előnyben, majd RL segítségével finomhangolták a modellt ennek az értékelésnek az optimalizálására. Az eredmény lényegesen magasabb összefoglalási minőséget mutatott, felülmúlva még az emberi referenciapéldákon tanított modelleket is[4].
RLHF a nagy nyelvi modellekben
A nagy nyelvi modellek jelentős előnyöket nyertek az RLHF bevezetéséből, amely javítja válaszaikat a hasznosság, a pontosság és az utasításkövetés szempontjából.
InstructGPT és ChatGPT
Az egyik kulcslépés az OpenAI kutatása volt, amely bemutatta az InstructGPT modelleket (2022) — emberi részvétellel finomhangolt GPT-3-verziókat[5]. A módszertan három lépésből állt:
- Supervised Fine-Tuning (SFT): A modellt egy kis méretű, kiváló minőségű bemutatókból álló készleten finomhangolják, ahol emberi értékelők kézzel írják meg a kívánatos válaszok példáit különböző kérésekre.
- Jutalom-modell (Reward Model) tanítása: Számos kérésre több modellválaszt generálnak. Az emberi értékelők a válaszokat a legjobbtól a legrosszabbig rangsorolják. E preferencia-adatok alapján tanítják a jutalom-modellt, amely megtanulja magasabb pontszámot adni azoknak a válaszoknak, amelyeket az emberek előnyben részesítenek.
- Optimalizálás RL segítségével: Az eredeti nyelvi modellt a proximális politikaoptimalizálás (PPO) algoritmusával finomhangolják, hogy maximalizálja a jutalom-modell által adott pontszámot. Az optimalizálás során büntetést is alkalmaznak az eredeti SFT-modelltől való nagy eltérés esetén, hogy megakadályozzák a nyelvi képességek romlását.
A tesztek kimutatták, hogy még a viszonylag kis InstructGPT-modell (1,3 milliárd paraméter) is felülmúlta hasznosság tekintetében a hatalmas GPT-3 modellt (175 milliárd paraméter). Az InstructGPT-modellek emellett lényegesen ritkábban generáltak toxikus, elfogult vagy hamis tartalmat[5].
Ennek a fejlesztési vonalnak a folytatása párbeszédes modellek létrehozásához vezetett, amelyek közül a legismertebb a ChatGPT (OpenAI, 2022 vége) lett. A ChatGPT a GPT-3.5 sorozat egy modellje, amelyet kifejezetten párbeszédre hangoltak finomhangolással az RLHF hasonló módszertana szerint[6].
Az iparban való elterjedés
Az RLHF módszert más vezető szervezetek is átvették. A DeepMind kifejlesztette a Sparrow nevű párbeszédes ágenst (2022), amelyet RLHF segítségével tanítottak, természetes nyelvű szabályok (például „ne adjon veszélyes tanácsokat") hozzáadásával[7]. Az Anthropic vállalat is hasonló elveket alkalmazott modelljei tanításában. 2023-ra az RLHF gyakorlatilag szabványos alkotóelemmé vált a legfejlettebb nyelvi modellek létrehozásában[1].
Az RLHF alkalmazásának előnyei
- Felhasználói szándéknak való megfelelés: Az RLHF-hangolásán átesett modellek lényegesen jobban követik az utasításokat, és relevánsabb, hasznosabb válaszokat adnak[5].
- A toxicitás és a káros tartalom csökkentése: Az ember bevonása a tanítási folyamatba lehetővé teszi a nemkívánatos válaszformák explicit büntetését. Ennek eredményeként az RLHF-modellek sokkal kevésbé toxikus és elfogult tartalmat generálnak[5].
- Az igazságtartalom javítása és a „hallucinációk" csökkentése: Az értékelők lejjebb sorolhatják a kitalált tényeket tartalmazó válaszokat, ösztönözve a modellt a pontosságra. Az InstructGPT- és a ChatGPT-modellek ritkábban „találnak ki" tényeket elődjeikhez képest[5].
- Tanítási hatékonyság: Az RLHF lehetővé teszi a modell javítását a tanítókészlet arányos növelése nélkül. Nem hatalmas adatmennyiségre van szükség, hanem minőségi preferencia-értékelésekre.
Korlátok és problémák
A sikerek ellenére az RLHF módszernek számos korlátja és nyitott problémája van.
- Az emberi adatgyűjtés minősége és költsége: Az RLHF hatékonysága közvetlenül függ a visszajelzések minőségétől. Egy ilyen dataset összeállítása munkaigényes és költséges folyamat. Emellett, ha az értékelők köre vagy szempontjai elfogultak, a modell örökölheti ezt az elfogultságot[2].
- A „tanult megfelelés" kockázata (Reward Hacking): Egy adott jutalom-függvényre optimalizált modell elkezdheti éppen ezt a függvényt kijátszani, nem pedig a tényleges célt követni. Például megtanulhat maximálisan hosszú válaszokat adni, ha az értékelők értékelik a hosszt, vagy kerülheti az állítások megtételét, ha büntetik a pontatlanságért.
- Az igazság garanciájának hiánya: Az RLHF nem visz be új ténybeli ismereteket a modellbe, csupán arra tanítja, hogy milyen válaszformát kedvelnek az emberek. Ezért a hallucinációk problémája nem oldódik meg teljesen. A modell megtanulhat jobban leplezni a bizonytalanságát, de nem mindig képes ellenőrizni a tényeket[6].
- A preferenciák általánosítása: Kérdéseket vet fel a jutalom-modell más feladatokra való átvihetősége is. Egy adott kéréskészlet preferenciáira tanított modell kiszámíthatatlanul viselkedhet, amikor stílusban vagy témában új feladatokkal találkozik.
Összefoglalás
Az RLHF megszilárdult mint fontos módszer a nagy nyelvi modellek emberi elképzelésekkel való „összehangolásában" a jó válaszokról. Lehetővé tette az AI-asszisztensekkel való interakció minőségének érezhető javítását, hasznossabbá és biztonságosabbá téve válaszaikat. Az RLHF kulcseszközként tekinthető azon az úton, amely olyan modellek létrehozásához vezet, amelyek nemcsak hihető szöveget generálnak, hanem figyelembe veszik az emberi értékeket, preferenciákat és szándékokat a kommunikáció során[8].
Hivatkozások
- Az OpenAI tanulmánya az utasításkövetésre finomhangolt modellekről
- Az IBM RLHF-áttekintése
Irodalom
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Megjegyzések
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]