Reinforcement learning from human feedback (RLHF) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Εκπαίδευση με ενίσχυση με ανατροφοδότηση από τον άνθρωπο (Reinforcement Learning from Human Feedback, RLHF) — είναι μια μέθοδος Machine Learning, στην οποία αρχικά εκπαιδεύεται ένα ειδικό «μοντέλο ανταμοιβής» (reward model) βάσει ανατροφοδότησης από ανθρώπους, και στη συνέχεια χρησιμοποιείται στη διαδικασία Reinforcement Learning (RL) για τη βελτιστοποίηση της συμπεριφοράς ενός έξυπνου πράκτορα[1].

Το RLHF επιτρέπει την τυποποίηση σύνθετων ή δυσκολόρητων στόχων (όπως «χρήσιμη», «ασφαλής» ή «αστεία» απάντηση) μέσω αξιολογήσεων ανθρώπων. Αντί να ορίζεται χειροκίνητα μια σύνθετη συνάρτηση ανταμοιβής, το RLHF επιτρέπει την εκπαίδευση του reward model απευθείας από τις ανθρώπινες προτιμήσεις. Αυτή η προσέγγιση έχει γίνει κλειδί για την «ευθυγράμμιση» (alignment) μεγάλων γλωσσικών μοντέλων (LLM), δηλαδή για την προσαρμογή της συμπεριφοράς τους στις ανθρώπινες αξίες και προθέσεις[2].

Ανάπτυξη της μεθόδου και πρώτα επιτεύγματα

Η ιδέα εκπαίδευσης πρακτόρων με χρήση ανθρώπινης ανατροφοδότησης γεννήθηκε τη δεκαετία του 2010. Ένα από τα πρώτα σημαντικά αποτελέσματα ήταν η εργασία του Paul Christiano και συνεργατών από την OpenAI και το DeepMind το 2017. Απέδειξαν ότι οι ανθρώπινες προτιμήσεις μπορούν να αντικαταστήσουν τη χειροκίνητα ορισμένη συνάρτηση ανταμοιβής σε σύνθετες εργασίες RL. Στο πείραμά τους, ένας άνθρωπος παρατηρούσε τμήματα συμπεριφοράς του πράκτορα (για παράδειγμα, σε παιχνίδι Atari) και επέλεγε την πιο προτιμητέα παραλλαγή. Βάσει αυτών των ζευγαρωτών συγκρίσεων εκπαιδεύτηκε ένα reward model, που επέτρεψε την επιτυχή επίλυση μιας σειράς σύνθετων εργασιών, λαμβάνοντας ανατροφοδότηση από λιγότερο από το 1% των ενεργειών του πράκτορα[3].

Τα επόμενα χρόνια η μέθοδος άρχισε να εφαρμόζεται για την εκπαίδευση γλωσσικών μοντέλων. Το 2020 ερευνητές της OpenAI εφάρμοσαν για πρώτη φορά το RLHF στην εργασία περίληψης κειμένου. Εκπαίδευσαν ένα reward model που προέβλεπε ποια περίληψη θα προτιμούσε ένας άνθρωπος, και με τη βοήθεια RL πραγματοποίησαν fine-tuning του μοντέλου για τη βελτιστοποίηση αυτής της αξιολόγησης. Το αποτέλεσμα έδειξε σημαντικά υψηλότερη ποιότητα περίληψης, ξεπερνώντας ακόμα και μοντέλα εκπαιδευμένα σε ανθρώπινα παραδείγματα αναφοράς[4].

RLHF σε μεγάλα γλωσσικά μοντέλα

Τα μεγάλα γλωσσικά μοντέλα ωφελήθηκαν σημαντικά από την εφαρμογή του RLHF για τη βελτίωση των απαντήσεών τους από την άποψη της χρησιμότητας, της ακρίβειας και της συμμόρφωσης με τις οδηγίες.

InstructGPT και ChatGPT

Ένα από τα βασικά βήματα ήταν η έρευνα της OpenAI που παρουσίασε τα μοντέλα InstructGPT (2022) — εκδόσεις του GPT-3 με fine-tuning με τη συμμετοχή ανθρώπων[5]. Η μεθοδολογία αποτελούνταν από τρία στάδια:

  1. Supervised Fine-Tuning (SFT): Το μοντέλο υφίσταται fine-tuning σε ένα μικρό σύνολο επιδείξεων υψηλής ποιότητας, όπου ανθρώπινοι αξιολογητές γράφουν χειροκίνητα παραδείγματα επιθυμητών απαντήσεων σε διάφορα ερωτήματα.
  2. Εκπαίδευση reward model: Για ένα σύνολο ερωτημάτων παράγονται πολλές απαντήσεις του μοντέλου. Ανθρώπινοι αξιολογητές κατατάσσουν αυτές τις απαντήσεις από την καλύτερη στη χειρότερη. Βάσει αυτών των δεδομένων προτίμησης εκπαιδεύεται ένα reward model, το οποίο μαθαίνει να αποδίδει υψηλότερες βαθμολογίες στις απαντήσεις που προτιμούν οι άνθρωποι.
  3. Βελτιστοποίηση με RL: Το αρχικό γλωσσικό μοντέλο υφίσταται fine-tuning με τη βοήθεια του αλγορίθμου Proximal Policy Optimization (PPO), ώστε να μεγιστοποιεί την αξιολόγηση που εκδίδει το reward model. Στη διαδικασία βελτιστοποίησης εισάγεται επίσης ποινή για μεγάλη απόκλιση από το αρχικό SFT μοντέλο, για την αποτροπή υποβάθμισης των γλωσσικών ικανοτήτων.

Οι δοκιμές έδειξαν ότι ακόμα και το σχετικά μικρό μοντέλο InstructGPT (1,3 δισεκατομμύρια παράμετροι) ξεπέρασε σε χρησιμότητα το γιγάντιο μοντέλο GPT-3 (175 δισεκατομμύρια παράμετροι). Τα μοντέλα InstructGPT επίσης παρήγαγαν σημαντικά σπανιότερα τοξικό, μεροληπτικό ή αναξιόπιστο περιεχόμενο[5].

Η εξέλιξη αυτής της γραμμής οδήγησε στη δημιουργία διαλογικών μοντέλων, το πιο γνωστό από τα οποία έγινε το ChatGPT (OpenAI, τέλη 2022). Το ChatGPT αποτελεί ένα μοντέλο της σειράς GPT-3.5, ειδικά με fine-tuning για τη διεξαγωγή διαλόγου με χρήση RLHF σύμφωνα με παρόμοια μεθοδολογία[6].

Υιοθέτηση στη βιομηχανία

Η μέθοδος RLHF υιοθετήθηκε και από άλλους κορυφαίους οργανισμούς. Το DeepMind ανέπτυξε τον διαλογικό πράκτορα Sparrow (2022), ο οποίος εκπαιδεύτηκε με RLHF με την προσθήκη ενός συνόλου κανόνων σε φυσική γλώσσα (για παράδειγμα, «να μη δίνονται επικίνδυνες συμβουλές»)[7]. Η εταιρεία Anthropic επίσης χρησιμοποίησε παρόμοιες αρχές για την εκπαίδευση των μοντέλων της. Μέχρι το 2023 το RLHF είχε γίνει σχεδόν τυπικό συστατικό στοιχείο κατά τη δημιουργία των πιο προηγμένων γλωσσικών μοντέλων[1].

Πλεονεκτήματα εφαρμογής του RLHF

  • Συμμόρφωση με τις προθέσεις του χρήστη: Τα μοντέλα που έχουν υποστεί RLHF tuning ακολουθούν σημαντικά καλύτερα τις οδηγίες και δίνουν πιο σχετικές και χρήσιμες απαντήσεις[5].
  • Μείωση τοξικότητας και επιβλαβούς περιεχομένου: Η συμμετοχή ανθρώπου στον κύκλο εκπαίδευσης επιτρέπει τη ρητή τιμώρηση ανεπιθύμητων μορφών απάντησης. Ως αποτέλεσμα, τα RLHF μοντέλα παράγουν πολύ λιγότερο τοξικό και μεροληπτικό περιεχόμενο[5].
  • Βελτίωση αξιοπιστίας και μείωση «ψευδαισθήσεων»: Οι αξιολογητές μπορούν να υποβαθμίζουν απαντήσεις με επινοημένα γεγονότα, παροτρύνοντας το μοντέλο να είναι πιο ακριβές. Τα μοντέλα InstructGPT και ChatGPT «επινοούν» σπανιότερα γεγονότα σε σύγκριση με τους προκατόχους τους[5].
  • Αποδοτικότητα εκπαίδευσης: Το RLHF επιτρέπει τη βελτίωση του μοντέλου χωρίς ανάλογη αύξηση του συνόλου εκπαίδευσης. Δεν απαιτούνται τεράστιοι όγκοι δεδομένων, αλλά ποιοτικές αξιολογήσεις προτίμησης.

Περιορισμοί και προβλήματα

Παρά τις επιτυχίες, η μέθοδος RLHF έχει μια σειρά περιορισμών και ανοιχτών προβλημάτων.

  • Ποιότητα και κόστος συλλογής ανθρώπινων δεδομένων: Η αποτελεσματικότητα του RLHF εξαρτάται άμεσα από την ποιότητα της ανατροφοδότησης. Η συλλογή ενός τέτοιου dataset είναι μια χρονοβόρα και δαπανηρή διαδικασία. Επιπλέον, αν το δείγμα των αξιολογητών ή τα κριτήριά τους είναι αντικειμενικά μεροληπτικά, το μοντέλο μπορεί να κληρονομήσει τη μεροληψία τους[2].
  • Κίνδυνος «μαθημένης συμμόρφωσης» (Reward Hacking): Ένα μοντέλο που βελτιστοποιείται για μια συγκεκριμένη συνάρτηση ανταμοιβής μπορεί να αρχίσει να προσαρμόζεται ακριβώς σε αυτή τη συνάρτηση και όχι στον πραγματικό στόχο. Για παράδειγμα, μπορεί να μάθει να δίνει όσο το δυνατόν μεγαλύτερες απαντήσεις αν οι αξιολογητές εκτιμούν το μήκος, ή να αποφεύγει ισχυρισμούς αν τιμωρείται για ανακρίβειες.
  • Έλλειψη εγγυήσεων αλήθειας: Το RLHF δεν εισάγει νέες πραγματικές γνώσεις στο μοντέλο, αλλά απλώς το διδάσκει τη μορφή της απάντησης που αρέσει στους ανθρώπους. Επομένως, το πρόβλημα των ψευδαισθήσεων δεν επιλύεται πλήρως. Το μοντέλο μπορεί να μάθει να κρύβει καλύτερα την αβεβαιότητα, αλλά δεν θα είναι πάντα σε θέση να επαληθεύει γεγονότα[6].
  • Κλιμάκωση προτιμήσεων: Ανησυχίες δημιουργεί επίσης η μεταφορά του reward model σε άλλες εργασίες. Ένα μοντέλο εκπαιδευμένο σε προτιμήσεις για ένα σύνολο ερωτημάτων μπορεί να συμπεριφέρεται απρόβλεπτα όταν αντιμετωπίζει εργασίες νέου ύφους ή θεματολογίας.

Συμπέρασμα

Το RLHF έχει καθιερωθεί ως σημαντική μέθοδος «ευθυγράμμισης» μεγάλων γλωσσικών μοντέλων με τις ανθρώπινες αντιλήψεις περί καλών απαντήσεων. Επέτρεψε αισθητή βελτίωση της ποιότητας αλληλεπίδρασης με AI assistants, καθιστώντας τις απαντήσεις τους πιο χρήσιμες και ασφαλείς. Το RLHF θεωρείται βασικό εργαλείο στην πορεία προς τη δημιουργία μοντέλων ικανών όχι απλώς να παράγουν αληθοφανές κείμενο, αλλά και να λαμβάνουν υπόψη τις ανθρώπινες αξίες, προτιμήσεις και προθέσεις κατά τη διαδικασία επικοινωνίας[8].

Παραπομπές

  • Άρθρο της OpenAI για το fine-tuning μοντέλων για την ακολουθία οδηγιών
  • Επισκόπηση του RLHF από την IBM

Βιβλιογραφία

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

Σημειώσεις

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
  8. «Aligning language models to follow instructions». OpenAI. [8]