Direct Preference Optimization (DPO) (TL)
Direct Preference Optimization (DPO) — ito ay isang paraan ng paglalagay ng malalaking language model (LLM) sa pagkakatugma sa mga kagustuhan ng tao, na iminungkahi bilang isang mas simple at mas matatag na alternatibo sa Reinforcement Learning from Human Feedback (RLHF). Ang pamamaraan ay ipinakilala noong 2023 ng isang grupo ng mga mananaliksik mula sa Stanford University sa ilalim ng pamumuno ni Rafael Rafailov[1].
Ang pangunahing pagkakaiba ng DPO ay direkta nitong ino-optimize ang language model upang tumugma sa mga kagustuhan ng tao, nang hindi na kailangang hiwalay na sanayin ang reward model at nang hindi na dumadaan sa kumplikadong yugto ng Reinforcement Learning (RL), na ginagawang mas simple, mas mabilis, at mas matatag ang proseso ng fine-tuning ng LLM[2].
Kasaysayan: Mga Limitasyon ng RLHF
Ang karaniwang pamamaraan ng Reinforcement Learning from Human Feedback (RLHF) ay binubuo ng tatlong pangunahing yugto:
- Supervised Fine-Tuning (SFT): Pangunahing fine-tuning ng modelo gamit ang mga de-kalidad na halimbawa.
- Pagsasanay ng reward model: Paglikha ng isang hiwalay na modelo na natututo kung paano magbigay ng "ranggo" sa mga sagot batay sa mga pares ng paghahambing na ibinibigay ng mga tao (halimbawa, ang sagot A ay mas mabuti kaysa sagot B).
- Pag-optimize ng patakaran gamit ang RL: Karagdagang pagsasanay ng pangunahing modelo gamit ang mga algorithm ng RL (halimbawa, PPO), upang ito ay makabuo ng mga sagot na nagpapalaki ng ranggo mula sa reward model.
Kahit epektibo, ang RLHF ay isang kumplikado, mahal, at hindi matatag na proseso. Ito ay madaling maapektuhan ng mga problemang tulad ng reward hacking (kapag "niloloko" ng modelo ang reward model), at nangangailangan ng maingat na pagsasaayos ng maraming hyperparameter[1]. Ang DPO ay binuo upang malampasan ang mga limitasyong ito.
Prinsipyo ng Paggana ng DPO
Pinapalitan ng DPO ang multi-stage na pipeline ng RLHF ng isang yugto ng pagsasanay, na maaaring ituring na supervised fine-tuning.
- Pangongolekta ng datos ng kagustuhan. Tulad ng sa RLHF, nangongolekta ng dataset kung saan para sa bawat tanong `x` ay may dalawang sagot: ang mas gusto (`y_w`, winning) at ang tinanggihan (`y_l`, losing).
- Direktang pag-optimize. Sa halip na sanayin ang isang reward model, direktang ginagamit ng DPO ang mga datos na ito upang i-update ang language model mismo. Ang layunin ng pag-optimize ay palakihin ang posibilidad ng pagbuo ng mas gustong sagot `y_w` at sabay na bawasan ang posibilidad ng pagbuo ng tinanggihang sagot `y_l`.
Mathematically, ito ay nagreresulta sa pagliit ng loss function na batay sa logistic regression, na inilapat sa pagkakaiba ng mga logarithmic na posibilidad ng mga sagot. Upang hindi "makalimutan" ng modelo ang orihinal na kaalaman nito, ginagamit ng DPO, tulad ng RLHF, ang reference model (reference model, karaniwang ang SFT na bersyon) para sa regularization, na pumipigil sa labis na paglihis mula sa orihinal na distribusyon ng mga sagot[2].
Mga Kalamangan Kumpara sa RLHF
- Pagiging simple at katatagan: Inaalis ng DPO ang pangangailangan sa pagsasanay ng hiwalay na reward model at kumplikadong pag-aayos ng RL. Ang proseso ay nagiging mas simple, mas mahulaan, at hindi gaanong madaling magkamali[3].
- Kahusayan at bilis: Ang pag-aalis ng dalawang yugto ay malaki ang naiaambag sa pagbabawas ng mga gastos sa pagkukumpute (mga oras ng GPU) at oras na kailangan para sa fine-tuning ng modelo. Ayon sa ilang pagtatantya, ang DPO ay 50–60% na mas matipid kaysa sa RLHF[4].
- Kalidad ng mga resulta: Ipinakita ng mga eksperimento na hindi naman mas mababa ang DPO kaysa sa RLHF pagdating sa kalidad, at sa ilang mga gawain, halimbawa sa pamamahala ng tono ng sagot, kahit pa nalampasan ito. Ang mga modelong sinanay gamit ang DPO ay nagpapakita ng mas mataas na pagkakatugma sa mga kagustuhan ng tao[1].
- Kawalan ng pagkasira ng mga pangunahing kasanayan: Ang DPO fine-tuning ay minimal ang epekto sa pangkalahatang kakayahan ng modelo (halimbawa, katotohanan o lohika), hindi tulad ng RLHF, na kung minsan ay maaaring magpababa ng mga pangunahing sukatan[5].
Paggamit at Paglaganap
Dahil sa kahusayan at pagiging simple nito, ang DPO ay mabilis na kumalat. Ito ay naipatupad sa mga nangungunang open-source na library, tulad ng Hugging Face TRL at OpenRLHF.
Maraming matagumpay na bukas na modelo ang na-fine-tune gamit ang DPO, kabilang ang Zephyr-7B at TÜLU 2. Ang mga modelong ito ay nagpakita ng mataas na pagganap sa mga benchmark ng pagtatasa ng kalidad ng sagot, na nagpapatunay ng bisa ng DPO para sa malalaking modelo[5].
Ang mga lider ng industriya ay nagsimula ring ipatupad ang DPO sa kanilang mga platform. Halimbawa, nagdagdag ang Microsoft ng suporta para sa DPO fine-tuning sa kanilang serbisyong Azure OpenAI, na nagpapahintulot sa mga gumagamit na i-fine-tune ang mga modelo, kabilang ang GPT-4, gamit ang kanilang sariling datos ng kagustuhan[6].
Mga Limitasyon
Kahit may mga kalamangan, ang DPO ay nagmamana ng ilang limitasyon mula sa mismong pamamaraan ng pagsasanay batay sa kagustuhan:
- Pagiging sensitibo sa datos: Ang kalidad at pagkakaiba-iba ng nakolektang datos ng kagustuhan ay kritikal na mahalaga. Kung ang datos ay naka-bias (halimbawa, naglalaman lamang ng isang wika o istilo), maaaring mag-overfit ang modelo at mabawasan ang pagganap nito sa ibang mga larangan[7].
- Pagiging static ng pagsasanay: Tulad ng RLHF, ang DPO ay sinasamahan ng static na dataset at hindi nagmumungkahi ng dinamikong pakikipag-ugnayan sa kapaligiran. Ang pamamaraang ito ay angkop para sa isang-hakbang na paglalagay sa pagkakaayon, ngunit hindi para sa mga gawaing nangangailangan ng pagsasanay sa pamamagitan ng sunud-sunod na mga aksyon.
Mga Sanggunian
- Dokumentasyon ng DPO sa library na Hugging Face TRL
- Analytical na pagsusuri ng RLHF at DPO sa ICLR 2024 Blogposts
Talasanggunian
- Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
- Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
- Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
- Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
- Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
- Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
- Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
- Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.
Mga Tala
- ↑ 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [1]
- ↑ 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [2]
- ↑ «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [3]
- ↑ «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [4]
- ↑ 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [5]
- ↑ «Direct preference optimization». Azure OpenAI | Microsoft Learn. [6]
- ↑ «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [7]