Direct Preference Optimization (DPO) (NL)
Direct Preference Optimization (DPO) — dit is een methode voor het afstemmen van grote taalmodellen (LLM) op menselijke voorkeuren, voorgesteld als een eenvoudiger en stabieler alternatief voor Reinforcement Learning from Human Feedback (RLHF). De methode werd in 2023 gepresenteerd door een groep onderzoekers van de Stanford Universiteit onder leiding van Rafael Rafailov[1].
Het belangrijkste onderscheid van DPO is dat het de taalmodellen rechtstreeks optimaliseert voor overeenstemming met menselijke voorkeuren, zonder dat een apart beloningsmodel (reward model) hoeft te worden getraind en zonder de complexe fase van reinforcement learning (RL), waardoor het afstemmen van LLM aanzienlijk eenvoudiger, sneller en stabieler wordt[2].
Voorgeschiedenis: Beperkingen van RLHF
De standaardmethode Reinforcement Learning from Human Feedback (RLHF) bestaat uit drie hoofdfasen:
- Supervised Fine-Tuning (SFT): Basistraining van het model op kwalitatieve voorbeelden.
- Training van het beloningsmodel: Het aanmaken van een apart model dat leert om antwoorden een "beoordeling" toe te kennen op basis van paarsgewijze vergelijkingen die door mensen zijn aangeleverd (bijvoorbeeld: antwoord A is beter dan antwoord B).
- Beleidsoptimalisatie met behulp van RL: Verdere training van het hoofdmodel met behulp van RL-algoritmen (zoals PPO), zodat het antwoorden genereert die de beoordeling van het beloningsmodel maximaliseren.
Ondanks zijn effectiviteit is RLHF een complex, kostbaar en onstabiel proces. Het is gevoelig voor problemen zoals reward hacking (waarbij het model het beloningsmodel "bedriegt") en vereist een zorgvuldige instelling van talrijke hyperparameters[1]. DPO is ontwikkeld om deze beperkingen te overwinnen.
Werkingsprincipe van DPO
De DPO-methode vervangt de meerfasige RLHF-pijplijn door één trainingsfase, die kan worden beschouwd als supervised fine-tuning.
- Verzamelen van voorkeursgegevens. Net als bij RLHF wordt een dataset samengesteld waarbij voor elke prompt `x` twee antwoorden beschikbaar zijn: het geprefereerde antwoord (`y_w`, winning) en het afgewezen antwoord (`y_l`, losing).
- Directe optimalisatie. In plaats van een beloningsmodel te trainen, gebruikt DPO deze gegevens direct om het taalmodel zelf bij te werken. Het optimalisatiedoel is het vergroten van de kans op het genereren van het geprefereerde antwoord `y_w` en tegelijkertijd het verkleinen van de kans op het genereren van het afgewezen antwoord `y_l`.
Wiskundig gezien komt dit neer op het minimaliseren van een verliesfunctie die is gebaseerd op logistische regressie, toegepast op het verschil in logaritmische kansen van de antwoorden. Om te voorkomen dat het model zijn oorspronkelijke kennis "vergeet", gebruikt DPO, net als RLHF, een referentiemodel (reference model, doorgaans de SFT-versie) voor regularisatie, waardoor te grote afwijking van de oorspronkelijke antwoorddistributie wordt voorkomen[2].
Voordelen ten opzichte van RLHF
- Eenvoud en stabiliteit: DPO elimineert de noodzaak voor het trainen van een apart beloningsmodel en de complexe RL-instellingen. Het proces wordt eenvoudiger, voorspelbaarder en minder foutgevoelig[3].
- Efficiëntie en snelheid: Het wegvallen van twee fasen vermindert de rekentijd (GPU-uren) en de benodigde tijd voor het afstemmen van het model aanzienlijk. Volgens sommige schattingen is DPO 50–60% zuiniger dan RLHF[4].
- Kwaliteit van de resultaten: Experimenten hebben aangetoond dat DPO niet onderdoet voor RLHF in termen van kwaliteit, en bij sommige taken, zoals het sturen van de toon van antwoorden, zelfs beter presteert. Modellen getraind met DPO tonen een betere afstemming op menselijke voorkeuren[1].
- Geen degradatie van basisvaardigheden: DPO-afstemming heeft minimale invloed op de algemene capaciteiten van het model (zoals feitenkennis of redeneren), in tegenstelling tot RLHF, dat soms basismetrieken kan verslechteren[5].
Toepassing en verspreiding
Dankzij zijn efficiëntie en eenvoud heeft DPO snel een brede verspreiding gekregen. Het is geïmplementeerd in toonaangevende open-source bibliotheken zoals Hugging Face TRL en OpenRLHF.
Veel succesvolle open modellen zijn met behulp van DPO gefinetuned, waaronder Zephyr-7B en TÜLU 2. Deze modellen hebben hoge prestaties behaald op benchmarks voor de beoordeling van antwoordkwaliteit, waarmee de effectiviteit van DPO voor grootschalige modellen is bevestigd[5].
Industriële marktleiders hebben DPO ook in hun platformen geïntegreerd. Zo heeft Microsoft ondersteuning voor DPO-fine-tuning toegevoegd aan zijn Azure OpenAI-dienst, waarmee gebruikers modellen, waaronder GPT-4, kunnen afstemmen op hun eigen voorkeursgegevens[6].
Beperkingen
Ondanks de voordelen erft DPO enkele beperkingen van de voorkeursgebaseerde trainingsaanpak:
- Gevoeligheid voor gegevens: De kwaliteit en diversiteit van de verzamelde voorkeursgegevens zijn van cruciaal belang. Als de gegevens eenzijdig zijn (bijvoorbeeld alleen één taal of stijl bevatten), kan het model overfitten en slechter presteren in andere domeinen[7].
- Statische training: Net als RLHF wordt DPO getraind op een statische dataset en voorziet het niet in dynamische interactie met de omgeving. Deze methode is goed geschikt voor eenstapsafstemming, maar niet voor taken die leren via opeenvolgende acties vereisen.
Verwijzingen
- Documentatie van DPO in de Hugging Face TRL-bibliotheek
- Analytisch overzicht van RLHF en DPO op ICLR 2024 Blogposts
Literatuur
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
- Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
- Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
- Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
- Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
- Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
- Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
- Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.
Noten
- ↑ 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [1]
- ↑ 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [2]
- ↑ «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [3]
- ↑ «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [4]
- ↑ 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [5]
- ↑ «Direct preference optimization». Azure OpenAI | Microsoft Learn. [6]
- ↑ «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [7]