Direct Preference Optimization (DPO) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Direct Preference Optimization (DPO) — είναι μια μέθοδος ευθυγράμμισης μεγάλων γλωσσικών μοντέλων (LLM) με τις ανθρώπινες προτιμήσεις, που προτάθηκε ως μια απλούστερη και πιο σταθερή εναλλακτική του Reinforcement Learning from Human Feedback (RLHF). Η μέθοδος παρουσιάστηκε το 2023 από ομάδα ερευνητών του Πανεπιστημίου Stanford υπό την ηγεσία του Rafailov[1].

Το βασικό χαρακτηριστικό του DPO είναι ότι βελτιστοποιεί άμεσα το γλωσσικό μοντέλο ώστε να ανταποκρίνεται στις ανθρώπινες προτιμήσεις, χωρίς την ανάγκη εκπαίδευσης ξεχωριστού μοντέλου ανταμοιβής (reward model) και χωρίς το πολύπλοκο στάδιο εκπαίδευσης με ενισχυτική μάθηση (RL), καθιστώντας τη διαδικασία ρύθμισης LLM σημαντικά απλούστερη, ταχύτερη και πιο σταθερή[2].

Ιστορικό Πλαίσιο: Περιορισμοί του RLHF

Η τυπική μέθοδος Reinforcement Learning from Human Feedback (RLHF) αποτελείται από τρία βασικά στάδια:

  1. Supervised Fine-Tuning (SFT): Βασική εκπαίδευση του μοντέλου σε ποιοτικά παραδείγματα.
  2. Εκπαίδευση μοντέλου ανταμοιβής: Δημιουργία ξεχωριστού μοντέλου που μαθαίνει να αποδίδει «βαθμολογία» στις απαντήσεις βάσει ζευγαρωτών συγκρίσεων που παρέχονται από ανθρώπους (π.χ. η απάντηση Α είναι καλύτερη από την απάντηση Β).
  3. Βελτιστοποίηση πολιτικής μέσω RL: Περαιτέρω εκπαίδευση του κύριου μοντέλου με χρήση αλγορίθμων RL (π.χ. PPO), ώστε να παράγει απαντήσεις που μεγιστοποιούν τη βαθμολογία του μοντέλου ανταμοιβής.

Παρά την αποτελεσματικότητά του, το RLHF είναι μια πολύπλοκη, δαπανηρή και ασταθής διαδικασία. Είναι επιρρεπές σε προβλήματα όπως το reward hacking (όταν το μοντέλο «εξαπατά» το μοντέλο ανταμοιβής) και απαιτεί προσεκτική ρύθμιση πολλών υπερπαραμέτρων[1]. Το DPO αναπτύχθηκε για να ξεπεράσει αυτούς τους περιορισμούς.

Αρχή Λειτουργίας του DPO

Η μέθοδος DPO αντικαθιστά το πολυσταδιακό pipeline του RLHF με ένα μόνο στάδιο εκπαίδευσης, το οποίο μπορεί να θεωρηθεί ως επιβλεπόμενο fine-tuning.

  1. Συλλογή δεδομένων προτιμήσεων. Όπως και στο RLHF, συλλέγεται ένα dataset όπου για κάθε ερώτημα `x` υπάρχουν δύο απαντήσεις: η προτιμώμενη (`y_w`, winning) και η απορριπτόμενη (`y_l`, losing).
  2. Άμεση βελτιστοποίηση. Αντί για εκπαίδευση μοντέλου ανταμοιβής, το DPO χρησιμοποιεί άμεσα αυτά τα δεδομένα για να ενημερώσει το ίδιο το γλωσσικό μοντέλο. Ο στόχος βελτιστοποίησης είναι να αυξηθεί η πιθανότητα παραγωγής της προτιμώμενης απάντησης `y_w` και ταυτόχρονα να μειωθεί η πιθανότητα παραγωγής της απορριπτόμενης απάντησης `y_l`.

Μαθηματικά, αυτό ανάγεται στην ελαχιστοποίηση μιας συνάρτησης απώλειας που βασίζεται σε λογιστική παλινδρόμηση εφαρμοζόμενη στη διαφορά των λογαριθμικών πιθανοτήτων των απαντήσεων. Για να αποτραπεί η «λήθη» των αρχικών γνώσεων του μοντέλου, το DPO, όπως και το RLHF, χρησιμοποιεί ένα μοντέλο αναφοράς (reference model, συνήθως την SFT έκδοση) για κανονικοποίηση, αποτρέποντας υπερβολική απόκλιση από την αρχική κατανομή απαντήσεων[2].

Πλεονεκτήματα σε Σχέση με το RLHF

  • Απλότητα και σταθερότητα: Το DPO εξαλείφει την ανάγκη εκπαίδευσης ξεχωριστού μοντέλου ανταμοιβής και πολύπλοκης ρύθμισης RL. Η διαδικασία γίνεται απλούστερη, πιο προβλέψιμη και λιγότερο επιρρεπής σε σφάλματα[3].
  • Αποδοτικότητα και ταχύτητα: Η απαλοιφή δύο σταδίων μειώνει σημαντικά το υπολογιστικό κόστος (GPU-ώρες) και τον χρόνο που απαιτείται για τη ρύθμιση του μοντέλου. Σύμφωνα με ορισμένες εκτιμήσεις, το DPO είναι 50–60% πιο οικονομικό από το RLHF[4].
  • Ποιότητα αποτελεσμάτων: Πειράματα έδειξαν ότι το DPO δεν υστερεί έναντι του RLHF ως προς την ποιότητα, ενώ σε ορισμένες εργασίες, όπως ο έλεγχος του τόνου των απαντήσεων, το υπερβαίνει. Τα μοντέλα που εκπαιδεύτηκαν με DPO επιδεικνύουν καλύτερη ευθυγράμμιση με τις ανθρώπινες προτιμήσεις[1].
  • Απουσία υποβάθμισης βασικών δεξιοτήτων: Η ρύθμιση με DPO επηρεάζει ελάχιστα τις γενικές ικανότητες του μοντέλου (π.χ. πραγματικές γνώσεις ή λογική), σε αντίθεση με το RLHF, το οποίο μπορεί μερικές φορές να υποβαθμίζει βασικές μετρικές[5].

Εφαρμογή και Διάδοση

Χάρη στην αποδοτικότητα και την απλότητά του, το DPO διαδόθηκε γρήγορα σε ευρεία κλίμακα. Υλοποιήθηκε σε κορυφαίες open-source βιβλιοθήκες, όπως η Hugging Face TRL και το OpenRLHF.

Πολλά επιτυχημένα ανοικτά μοντέλα έχουν υποστεί fine-tuning με DPO, συμπεριλαμβανομένων των Zephyr-7B και TÜLU 2. Τα μοντέλα αυτά επέδειξαν υψηλή απόδοση σε benchmark αξιολόγησης ποιότητας απαντήσεων, επιβεβαιώνοντας την αποτελεσματικότητα του DPO για μοντέλα μεγάλης κλίμακας[5].

Ηγέτες της βιομηχανίας ενσωμάτωσαν επίσης το DPO στις πλατφόρμες τους. Για παράδειγμα, η Microsoft πρόσθεσε υποστήριξη για fine-tuning με DPO στην υπηρεσία Azure OpenAI, επιτρέποντας στους χρήστες να ρυθμίζουν μοντέλα, συμπεριλαμβανομένου του GPT-4, με βάση τα δικά τους δεδομένα προτιμήσεων[6].

Περιορισμοί

Παρά τα πλεονεκτήματά του, το DPO κληρονομεί ορισμένους περιορισμούς από την ίδια την προσέγγιση εκπαίδευσης βάσει προτιμήσεων:

  • Ευαισθησία στα δεδομένα: Η ποιότητα και η ποικιλομορφία των συλλεχθέντων δεδομένων προτιμήσεων είναι κρίσιμης σημασίας. Εάν τα δεδομένα είναι μονόπλευρα (π.χ. περιέχουν μόνο μία γλώσσα ή στυλ), το μοντέλο ενδέχεται να υπερεκπαιδευτεί και να υποβαθμίσει την απόδοσή του σε άλλους τομείς[7].
  • Στατικότητα εκπαίδευσης: Όπως και το RLHF, το DPO εκπαιδεύεται σε ένα στατικό dataset και δεν προβλέπει δυναμική αλληλεπίδραση με το περιβάλλον. Αυτή η μέθοδος ενδείκνυται για μονοβηματική ευθυγράμμιση, αλλά όχι για εργασίες που απαιτούν εκπαίδευση μέσω διαδοχικών ενεργειών.

Σύνδεσμοι

  • Τεκμηρίωση DPO στη βιβλιοθήκη Hugging Face TRL
  • Αναλυτική επισκόπηση RLHF και DPO στο ICLR 2024 Blogposts

Βιβλιογραφία

  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
  • Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
  • Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
  • Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
  • Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
  • Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
  • Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.

Παραπομπές

  1. 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [1]
  2. 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [2]
  3. «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [3]
  4. «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [4]
  5. 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [5]
  6. «Direct preference optimization». Azure OpenAI | Microsoft Learn. [6]
  7. «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [7]