Reinforcement learning from human feedback (RLHF) (RO)
Învățare prin consolidare cu feedback uman (Reinforcement Learning from Human Feedback, RLHF) — este o metodă de Machine Learning în care, mai întâi, pe baza feedback-ului uman, se antrenează un „model de recompensă" special (reward model), după care acesta este utilizat în procesul de Reinforcement Learning (RL) pentru optimizarea comportamentului unui agent inteligent[1].
RLHF permite formalizarea unor obiective complexe sau greu de definit (de exemplu, un răspuns „util", „sigur" sau „amuzant\") prin intermediul evaluărilor umane. În loc să definești manual o funcție de recompensă complexă, RLHF permite antrenarea modelului de recompensă direct pe preferințele umane. Această abordare a devenit esențială pentru „alinierea\" (alignment) modelelor lingvistice de mari dimensiuni (LLM), adică pentru aducerea comportamentului acestora în concordanță cu valorile și intențiile umane[2].
Dezvoltarea metodei și primele realizări
Ideea antrenării agenților cu ajutorul feedback-ului uman a apărut în anii 2010. Unul dintre primele rezultate semnificative a fost lucrarea lui Paul Christiano și a colegilor săi de la OpenAI și DeepMind în 2017. Ei au demonstrat că preferințele umane pot înlocui o funcție de recompensă definită manual în sarcini complexe de RL. În experimentul lor, un om vizualiza fragmente din comportamentul agentului (de exemplu, în jocul Atari) și alegea varianta mai preferată. Pe baza acestor comparații pereche a fost antrenat un model de recompensă, ceea ce a permis rezolvarea cu succes a unor sarcini complexe, obținând feedback pentru mai puțin de 1% dintre acțiunile agentului[3].
În anii următori, metoda a început să fie aplicată pentru antrenarea modelelor lingvistice. În 2020, cercetătorii de la OpenAI au aplicat pentru prima dată RLHF la sarcina de sumarizare a textului. Ei au antrenat un model de recompensă care prezice ce rezumat va prefera un om și, cu ajutorul RL, au rafinat modelul pentru a optimiza această evaluare. Rezultatul a arătat o calitate semnificativ mai ridicată a sumarizării, depășind chiar și modelele antrenate pe exemple de referință umane[4].
RLHF în modelele lingvistice de mari dimensiuni
Modelele lingvistice de mari dimensiuni au beneficiat substanțial de implementarea RLHF pentru îmbunătățirea răspunsurilor din perspectiva utilității, preciziei și respectării instrucțiunilor.
InstructGPT și ChatGPT
Un pas-cheie l-a reprezentat cercetarea OpenAI care a prezentat modelele InstructGPT (2022) — versiuni ale GPT-3 rafinate cu participare umană[5]. Metodologia cuprindea trei etape:
- Supervised Fine-Tuning (SFT): Modelul este rafinat pe un set mic de demonstrații de înaltă calitate, în care evaluatorii umani scriu manual exemple de răspunsuri dorite la diverse solicitări.
- Antrenarea modelului de recompensă (Reward Model): Pentru un set de solicitări sunt generate mai multe răspunsuri ale modelului. Evaluatorii umani clasifică aceste răspunsuri de la cel mai bun la cel mai slab. Pe baza acestor date privind preferințele, este antrenat un model de recompensă care învață să atribuie scoruri mai mari răspunsurilor preferate de oameni.
- Optimizarea cu ajutorul RL: Modelul lingvistic de bază este rafinat cu ajutorul algoritmului de optimizare proximală a politicii (PPO), pentru a maximiza scorul furnizat de modelul de recompensă. În procesul de optimizare se introduce, de asemenea, o penalizare pentru abaterea prea mare față de modelul SFT inițial, pentru a preveni degradarea capacităților lingvistice.
Testele au arătat că un model InstructGPT relativ mic (1,3 miliarde de parametri) a depășit ca utilitate uriașul model GPT-3 (175 de miliarde de parametri). Modelele InstructGPT au generat, de asemenea, mult mai rar conținut toxic, părtinitor sau neautentic[5].
Dezvoltarea acestei linii a condus la crearea modelelor de dialog, cel mai cunoscut dintre acestea devenind ChatGPT (OpenAI, sfârșitul anului 2022). ChatGPT este un model din seria GPT-3.5, special rafinat pentru conversație folosind RLHF după o metodologie similară[6].
Adoptarea în industrie
Metoda RLHF a fost adoptată și de alte organizații de frunte. DeepMind a dezvoltat agentul de dialog Sparrow (2022), care a fost antrenat cu ajutorul RLHF, cu adăugarea unui set de reguli în limbaj natural (de exemplu, „să nu ofere sfaturi periculoase\")[7]. Compania Anthropic a utilizat, de asemenea, principii similare pentru antrenarea modelelor sale. Până în 2023, RLHF a devenit practic o componentă standard în crearea celor mai avansate modele lingvistice[1].
Avantajele aplicării RLHF
- Concordanța cu intențiile utilizatorului: Modelele care au trecut prin fine-tuning cu RLHF urmează semnificativ mai bine instrucțiunile și oferă răspunsuri mai relevante și mai utile[5].
- Reducerea toxicității și a conținutului nociv: Includerea omului în ciclul de antrenare permite sancționarea explicită a formelor nedorite de răspuns. Ca urmare, modelele RLHF generează conținut mult mai puțin toxic și părtinitor[5].
- Îmbunătățirea veridicității și reducerea „halucinațiilor\": Evaluatorii pot reduce ratingul răspunsurilor cu fapte inventate, determinând modelul să fie mai precis. Modelele InstructGPT și ChatGPT „inventează\" mai rar fapte în comparație cu predecesorii lor[5].
- Eficiența antrenării: RLHF permite îmbunătățirea modelului fără a crește proporțional setul de antrenare. Nu sunt necesare volume uriașe de date, ci evaluări calitative ale preferințelor.
Limitări și probleme
În ciuda succeselor, metoda RLHF prezintă o serie de limitări și probleme deschise.
- Calitatea și costul colectării datelor umane: Eficacitatea RLHF depinde direct de calitatea feedback-ului. Colectarea unui astfel de dataset este un proces laborios și costisitor. În plus, dacă eșantionul de evaluatori sau criteriile acestora sunt părtinătoare, modelul poate moșteni acea părtinire[2].
- Riscul „conformității învățate\" (Reward Hacking): Modelul optimizat pentru o anumită funcție de recompensă poate începe să se adapteze tocmai la acea funcție, și nu la obiectivul real. De exemplu, poate învăța să dea răspunsuri cât mai lungi dacă evaluatorii apreciază lungimea, sau să evite afirmațiile dacă sunt penalizate pentru inexactități.
- Absența garanțiilor de adevăr: RLHF nu introduce în model cunoștințe factuale noi, ci îl învață doar forma de răspuns care place oamenilor. De aceea, problema halucinațiilor nu este rezolvată complet. Modelul poate învăța să își ascundă mai bine nesiguranța, dar nu va putea întotdeauna verifica faptele[6].
- Scalarea preferințelor: Transferul modelului de recompensă la alte sarcini ridică semne de întrebare. Un model antrenat pe preferințe pentru un set de solicitări poate acționa imprevizibil atunci când se confruntă cu sarcini noi ca stil sau tematică.
Concluzie
RLHF s-a consacrat ca o metodă importantă de „aliniere\" a modelelor lingvistice de mari dimensiuni cu reprezentările umane despre răspunsuri bune. A permis îmbunătățirea vizibilă a calității interacțiunii cu asistenții AI, făcând răspunsurile acestora mai utile și mai sigure. RLHF este considerat un instrument-cheie pe drumul spre crearea unor modele capabile nu doar să genereze text plauzibil, ci și să țină seama de valorile, preferințele și intențiile umane în procesul de comunicare[8].
Referințe
- Articolul OpenAI despre rafinarea modelelor pentru urmarea instrucțiunilor
- Prezentare generală RLHF de la IBM
Bibliografie
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Note
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]