Reinforcement learning from human feedback (RLHF) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Förstärkningsinlärning med återkoppling från människor (Reinforcement Learning from Human Feedback, RLHF) — är en metod inom Machine Learning där man först, baserat på återkoppling från människor, tränar en speciell "belöningsmodell" (reward model), varefter den används i processen för Reinforcement Learning (RL) för att optimera en intelligent agents beteende[1].

RLHF gör det möjligt att formalisera komplexa eller svårdefinierade mål (till exempel ett "användbart", "säkert" eller "roligt" svar) genom mänskliga bedömningar. Istället för att manuellt definiera en komplex belösningsfunktion låter RLHF modellen tränas direkt på mänskliga preferenser. Detta tillvägagångssätt har blivit centralt för "alignment" av stora språkmodeller (LLM), det vill säga att anpassa deras beteende till mänskliga värderingar och avsikter[2].

Metodens utveckling och tidiga framsteg

Idén att träna agenter med hjälp av mänsklig återkoppling uppstod på 2010-talet. Ett av de första betydelsefulla resultaten var arbetet av Paul Christiano och kollegor från OpenAI och DeepMind år 2017. De visade att mänskliga preferenser kan ersätta en manuellt definierad belösningsfunktion i komplexa RL-uppgifter. I deras experiment tittade en människa på fragment av en agents beteende (till exempel i spelet Atari) och valde det mer önskvärda alternativet. Baserat på dessa parjämförelser tränades en belöningsmodell, vilket möjliggjorde en framgångsrik lösning av ett antal komplexa uppgifter med återkoppling från mindre än 1 % av agentens handlingar[3].

Under de följande åren började metoden tillämpas för träning av språkmodeller. År 2020 tillämpade forskare vid OpenAI RLHF för första gången på uppgiften att sammanfatta text. De tränade en belöningsmodell som förutspår vilken sammanfattning en människa föredrar, och fine-tunade sedan modellen med hjälp av RL för att optimera detta betyg. Resultatet visade en avsevärt högre kvalitet på sammanfattningarna och överträffade till och med modeller som tränats på mänskliga referensexempel[4].

RLHF i stora språkmodeller

Stora språkmodeller har haft stor nytta av införandet av RLHF för att förbättra sina svar avseende användbarhet, noggrannhet och förmåga att följa instruktioner.

InstructGPT och ChatGPT

Ett av de viktigaste stegen var OpenAI:s forskning som presenterade modellerna InstructGPT (2022) — versioner av GPT-3 fine-tunade med mänskligt deltagande[5]. Metodiken bestod av tre steg:

  1. Supervised Fine-Tuning (SFT): Modellen fine-tunas på en liten uppsättning högkvalitativa demonstrationer, där mänskliga bedömare manuellt skriver exempel på önskade svar på olika förfrågningar.
  2. Träning av belöningsmodellen (Reward Model): För ett antal förfrågningar genereras flera modellsvar. Mänskliga bedömare rangordnar dessa svar från bäst till sämst. Baserat på dessa preferensdata tränas en belöningsmodell som lär sig att tilldela högre poäng till de svar som människor föredrar.
  3. Optimering med hjälp av RL: Den ursprungliga språkmodellen fine-tunas med hjälp av algoritmen Proximal Policy Optimization (PPO) för att maximera det betyg som belöningsmodellen ger. Under optimeringsprocessen införs också ett straff för alltför stor avvikelse från den ursprungliga SFT-modellen, för att förhindra försämring av de språkliga förmågorna.

Tester visade att till och med den relativt lilla modellen InstructGPT (1,3 miljarder parametrar) överträffade den gigantiska modellen GPT-3 (175 miljarder parametrar) i fråga om användbarhet. InstructGPT-modellerna började också generera toxiskt, partiskt eller otillförlitligt innehåll betydligt mer sällan[5].

Utvecklingen av denna linje ledde till skapandet av dialogmodeller, varav den mest kända blev ChatGPT (OpenAI, slutet av 2022). ChatGPT är en modell ur GPT-3.5-serien som är speciellt fine-tunad för dialog med hjälp av RLHF enligt en liknande metodik[6].

Branschens adoption

Metoden RLHF antogs även av andra ledande organisationer. DeepMind utvecklade dialogagenten Sparrow (2022), som tränades med hjälp av RLHF med tillägg av en uppsättning regler på naturligt språk (till exempel "ge inga farliga råd")[7]. Företaget Anthropic använde också liknande principer för träning av sina modeller. År 2023 hade RLHF blivit en närmast standardkomponent vid skapandet av de mest avancerade språkmodellerna[1].

Fördelar med RLHF

  • Anpassning till användarens avsikter: Modeller som genomgått RLHF-tuning följer instruktioner avsevärt bättre och ger mer relevanta och användbara svar[5].
  • Minskning av toxicitet och skadligt innehåll: Att inkludera människan i träningscykeln gör det möjligt att explicit bestraffa oönskade svarsformer. Som ett resultat genererar RLHF-modeller betydligt mindre toxiskt och partiskt innehåll[5].
  • Förbättrad sanningsenlighet och minskade "hallucinationer": Bedömare kan sänka betyget för svar med påhittade fakta, vilket uppmuntrar modellen att vara mer noggrann. Modellerna InstructGPT och ChatGPT "hittar på" fakta mer sällan jämfört med sina föregångare[5].
  • Träningseffektivitet: RLHF gör det möjligt att förbättra modellen utan att proportionerligt öka träningsdatan. Vad som krävs är inte enorma datamängder, utan kvalitativa preferensbedömningar.

Begränsningar och utmaningar

Trots framgångarna har metoden RLHF ett antal begränsningar och olösta problem.

  • Kvalitet och kostnad för insamling av mänskliga data: RLHF:s effektivitet beror direkt på kvaliteten på återkopplingen. Insamlingen av ett sådant dataset är en arbets- och kostnadskrävande process. Dessutom kan modellen ärva bedömarnas partiskhet om urvalet av bedömare eller deras kriterier är snedvridna[2].
  • Risken för "inlärd anpassning" (Reward Hacking): En modell som optimeras mot en viss belösningsfunktion kan börja anpassa sig till just den funktionen snarare än till det verkliga målet. Till exempel kan den lära sig att ge maximalt långa svar om bedömarna värdesätter längd, eller undvika påståenden om de straffas för inexaktheter.
  • Avsaknad av sanningsgarantier: RLHF tillför inte modellen ny faktakunskap, utan lär den bara en svarsform som människor gillar. Därför löses inte problemet med hallucinationer fullständigt. Modellen kan lära sig att bättre dölja osäkerhet, men kan inte alltid verifiera fakta[6].
  • Skalning av preferenser: Frågor väcks också kring överföringen av belöningsmodellen till andra uppgifter. En modell som tränats på preferenser för en uppsättning förfrågningar kan bete sig oförutsägbart när den möter uppgifter med ny stil eller nytt ämne.

Slutsats

RLHF har etablerat sig som en viktig metod för "alignment" av stora språkmodeller med mänskliga föreställningar om bra svar. Det har möjliggjort en märkbar förbättring av interaktionskvaliteten med AI-assistenter, vilket gjort deras svar mer användbara och säkra. RLHF betraktas som ett nyckelverktyg på vägen mot att skapa modeller som inte bara kan generera trovärdig text, utan också ta hänsyn till mänskliga värderingar, preferenser och avsikter i kommunikationsprocessen[8].

Länkar

  • OpenAI:s artikel om fine-tuning av modeller för att följa instruktioner
  • Översikt av RLHF från IBM

Litteratur

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

Noter

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
  8. «Aligning language models to follow instructions». OpenAI. [8]