Reinforcement learning from human feedback (RLHF) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Reinforcement Learning from Human Feedback (RLHF) is een methode voor machine learning waarbij eerst op basis van menselijke feedback een speciaal "beloningsmodel" (reward model) wordt getraind, waarna dit model wordt ingezet tijdens het proces van Reinforcement Learning (RL) om het gedrag van een intelligente agent te optimaliseren[1].

RLHF maakt het mogelijk om complexe of moeilijk te definiëren doelen (zoals een "nuttig", "veilig" of "grappig" antwoord) te formaliseren via beoordelingen van mensen. In plaats van handmatig een complexe beloningsfunctie te definiëren, maakt RLHF het mogelijk om een beloningsmodel rechtstreeks te trainen op menselijke voorkeuren. Deze aanpak is cruciaal geworden voor het "uitlijnen" (alignment) van grote taalmodellen (LLM), dat wil zeggen het afstemmen van hun gedrag op menselijke waarden en intenties[2].

Ontwikkeling van de methode en eerste resultaten

Het idee om agenten te trainen met behulp van menselijke feedback ontstond in de jaren 2010. Een van de eerste belangrijke resultaten was het werk van Paul Christiano en collega's van OpenAI en DeepMind in 2017. Zij toonden aan dat menselijke voorkeuren de handmatig gedefinieerde beloningsfunctie kunnen vervangen bij complexe RL-taken. In hun experiment bekeek een mens fragmenten van het gedrag van een agent (bijvoorbeeld in een Atari-spel) en koos de meest gewenste variant. Op basis van deze paarsgewijze vergelijkingen werd een beloningsmodel getraind, waarmee een reeks complexe taken succesvol werd opgelost, met feedback op minder dan 1% van de acties van de agent[3].

In de daaropvolgende jaren werd de methode toegepast voor het trainen van taalmodellen. In 2020 pasten onderzoekers van OpenAI RLHF voor het eerst toe op de taak van tekstsamenvatting. Ze trainden een beloningsmodel dat voorspelt welke samenvatting een mens zou verkiezen, en verfijnden het model met behulp van RL om deze score te optimaliseren. Het resultaat toonde een aanzienlijk hogere kwaliteit van de samenvattingen, waarbij zelfs modellen die getraind waren op menselijke referentievoorbeelden werden overtroffen[4].

RLHF in grote taalmodellen

Grote taalmodellen hebben aanzienlijk geprofiteerd van de invoering van RLHF om hun antwoorden te verbeteren op het gebied van bruikbaarheid, nauwkeurigheid en opvolging van instructies.

InstructGPT en ChatGPT

Een van de belangrijkste stappen was het onderzoek van OpenAI, dat de modellen InstructGPT (2022) introduceerde — versies van GPT-3 die met menselijke betrokkenheid zijn verfijnd[5]. De methodologie bestond uit drie fasen:

  1. Supervised Fine-Tuning (SFT): Het model wordt verfijnd op een kleine set hoogwaardige demonstraties, waarbij menselijke beoordelaars handmatig voorbeelden schrijven van gewenste antwoorden op diverse verzoeken.
  2. Training van het beloningsmodel (Reward Model): Voor een reeks verzoeken worden meerdere modelantwoorden gegenereerd. Menselijke beoordelaars rangschikken deze antwoorden van best naar slechtst. Op basis van deze voorkeursgegevens wordt een beloningsmodel getraind dat leert hogere scores toe te kennen aan antwoorden die mensen verkiezen.
  3. Optimalisatie met behulp van RL: Het oorspronkelijke taalmodel wordt verfijnd met behulp van het algoritme voor proximale beleidsoptimalisatie (PPO) om de score van het beloningsmodel te maximaliseren. Tijdens het optimalisatieproces wordt ook een straf ingevoerd voor een sterke afwijking van het oorspronkelijke SFT-model, om achteruitgang van taalvaardigheden te voorkomen.

Tests toonden aan dat zelfs het relatief kleine InstructGPT-model (1,3 miljard parameters) het gigantische GPT-3-model (175 miljard parameters) overtrof in bruikbaarheid. InstructGPT-modellen genereerden ook aanzienlijk minder toxische, bevooroordeelde of onbetrouwbare inhoud[5].

De verdere ontwikkeling van deze lijn leidde tot de creatie van conversatiemodellen, waarvan ChatGPT (OpenAI, eind 2022) de bekendste werd. ChatGPT is een model uit de GPT-3.5-serie, speciaal verfijnd voor het voeren van een dialoog met behulp van RLHF volgens een vergelijkbare methodologie[6].

Adoptie in de industrie

De RLHF-methode werd ook overgenomen door andere toonaangevende organisaties. DeepMind ontwikkelde de conversatieagent Sparrow (2022), die werd getraind met RLHF aangevuld met een set regels in natuurlijke taal (zoals "geef geen gevaarlijk advies")[7]. Anthropic maakte ook gebruik van vergelijkbare principes voor het trainen van zijn modellen. Tegen 2023 was RLHF vrijwel een standaardcomponent geworden bij de ontwikkeling van de meest geavanceerde taalmodellen[1].

Voordelen van het gebruik van RLHF

  • Afstemming op de intentie van de gebruiker: Modellen die zijn verfijnd met RLHF volgen instructies aanzienlijk beter en geven relevantere en nuttigere antwoorden[5].
  • Vermindering van toxiciteit en schadelijke inhoud: Het betrekken van mensen in de trainingscyclus maakt het mogelijk om ongewenste antwoordvormen expliciet te bestraffen. Als gevolg hiervan genereren RLHF-modellen veel minder toxische en bevooroordeelde inhoud[5].
  • Verbetering van eerlijkheid en vermindering van "hallucinaties": Beoordelaars kunnen antwoorden met verzonnen feiten lager beoordelen, waardoor het model gestimuleerd wordt nauwkeuriger te zijn. InstructGPT- en ChatGPT-modellen "verzinnen" minder feiten in vergelijking met hun voorgangers[5].
  • Trainingsefficiëntie: RLHF maakt het mogelijk om een model te verbeteren zonder een evenredige toename van de trainingsdata. Er zijn geen enorme hoeveelheden gegevens nodig, maar kwalitatieve voorkeursbeoordelingen.

Beperkingen en uitdagingen

Ondanks de successen kent de RLHF-methode een aantal beperkingen en openstaande problemen.

  • Kwaliteit en kosten van het verzamelen van menselijke gegevens: De effectiviteit van RLHF hangt rechtstreeks af van de kwaliteit van de feedback. Het verzamelen van zo'n dataset is een arbeidsintensief en kostbaar proces. Bovendien kan het model, als de selectie van beoordelaars of hun criteria bevooroordeeld zijn, hun vooringenomenheid overnemen[2].
  • Risico op "aangeleerde conformiteit" (Reward Hacking): Een model dat wordt geoptimaliseerd voor een bepaalde beloningsfunctie, kan zich gaan aanpassen aan juist die functie in plaats van aan het werkelijke doel. Het kan bijvoorbeeld leren zo lang mogelijke antwoorden te geven als beoordelaars lengte waarderen, of beweringen te vermijden als ze worden gestraft voor onnauwkeurigheden.
  • Geen garanties voor waarheid: RLHF introduceert geen nieuwe feitelijke kennis in het model, maar leert het slechts de antwoordvorm die mensen aanspreken. Daardoor wordt het probleem van hallucinaties niet volledig opgelost. Het model kan leren onzekerheid beter te verbergen, maar zal niet altijd in staat zijn feiten te verifiëren[6].
  • Schaling van voorkeuren: Vragen rijzen ook over de overdracht van het beloningsmodel naar andere taken. Een model dat is getraind op voorkeuren voor één set verzoeken, kan onvoorspelbaar gedrag vertonen wanneer het wordt geconfronteerd met taken die qua stijl of thematiek nieuw zijn.

Conclusie

RLHF heeft zich gevestigd als een belangrijke methode voor het "uitlijnen" van grote taalmodellen met menselijke opvattingen over goede antwoorden. Het heeft de kwaliteit van de interactie met AI-assistenten merkbaar verbeterd, waardoor hun antwoorden nuttiger en veiliger zijn geworden. RLHF wordt beschouwd als een sleutelinstrument op weg naar de creatie van modellen die niet alleen plausibele tekst kunnen genereren, maar ook menselijke waarden, voorkeuren en intenties kunnen meewegen tijdens de communicatie[8].

Verwijzingen

  • Artikel van OpenAI over het verfijnen van modellen voor het opvolgen van instructies
  • Overzicht van RLHF door IBM

Literatuur

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

Noten

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
  8. «Aligning language models to follow instructions». OpenAI. [8]