Direct Preference Optimization (DPO) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Direct Preference Optimization (DPO) — यह बड़े भाषा मॉडलों (LLM) को मानवीय प्राथमिकताओं के साथ संरेखित करने की एक विधि है, जिसे Reinforcement Learning from Human Feedback (RLHF) के एक सरल और अधिक स्थिर विकल्प के रूप में प्रस्तावित किया गया था। यह विधि 2023 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं के एक समूह द्वारा राफाएल राफाइलोव के नेतृत्व में प्रस्तुत की गई थी[1]

DPO की मुख्य विशेषता यह है कि यह भाषा मॉडल को मानवीय प्राथमिकताओं के अनुरूप बनाने के लिए सीधे अनुकूलित करता है — बिना किसी अलग reward model (पुरस्कार मॉडल) के प्रशिक्षण और Reinforcement Learning (RL) के जटिल चरण के, जिससे LLM को ठीक करने की प्रक्रिया काफी सरल, तेज़ और अधिक स्थिर हो जाती है[2]

पूर्व पृष्ठभूमि: RLHF की सीमाएँ

मानक Reinforcement Learning from Human Feedback (RLHF) विधि में तीन मुख्य चरण होते हैं:

  1. Supervised Fine-Tuning (SFT): उच्च-गुणवत्ता वाले उदाहरणों पर मॉडल का बुनियादी fine-tuning।
  2. Reward Model का प्रशिक्षण: एक अलग मॉडल का निर्माण, जो मनुष्यों द्वारा प्रदान की गई युग्मित तुलनाओं (जैसे, उत्तर A, उत्तर B से बेहतर है) के आधार पर उत्तरों को "रेटिंग" देना सीखता है।
  3. RL की सहायता से नीति अनुकूलन: RL एल्गोरिदम (जैसे, PPO) का उपयोग करके मुख्य मॉडल का fine-tuning, ताकि वह reward model से अधिकतम रेटिंग प्राप्त करने वाले उत्तर उत्पन्न करे।

अपनी प्रभावशीलता के बावजूद, RLHF एक जटिल, महंगी और अस्थिर प्रक्रिया है। यह reward hacking (जब मॉडल reward model को "धोखा" देता है) जैसी समस्याओं से ग्रस्त है, और इसके लिए अनेक hyperparameter की सावधानीपूर्वक सेटिंग की आवश्यकता होती है[1]। DPO को इन्हीं सीमाओं पर काबू पाने के लिए विकसित किया गया था।

DPO की कार्यप्रणाली

DPO विधि RLHF की बहु-चरणीय प्रक्रिया को एक ही प्रशिक्षण चरण से प्रतिस्थापित करती है, जिसे supervised fine-tuning के रूप में देखा जा सकता है।

  1. प्राथमिकता डेटा का संग्रह। RLHF की तरह ही, एक dataset तैयार किया जाता है जहाँ प्रत्येक अनुरोध `x` के लिए दो उत्तर होते हैं: पसंदीदा (`y_w`, winning) और अस्वीकृत (`y_l`, losing)।
  2. प्रत्यक्ष अनुकूलन। reward model को प्रशिक्षित करने के बजाय, DPO इन डेटा का उपयोग सीधे भाषा मॉडल को अद्यतन करने के लिए करता है। अनुकूलन का लक्ष्य — पसंदीदा उत्तर `y_w` उत्पन्न करने की संभावना बढ़ाना और साथ ही अस्वीकृत उत्तर `y_l` उत्पन्न करने की संभावना घटाना।

गणितीय दृष्टि से यह एक loss function के न्यूनीकरण तक सीमित हो जाता है, जो उत्तरों की लघुगणकीय संभावनाओं के अंतर पर लागू logistic regression पर आधारित है। यह सुनिश्चित करने के लिए कि मॉडल अपना मूल ज्ञान न भूले, DPO भी RLHF की तरह नियमितीकरण के लिए एक reference model (reference model, आमतौर पर SFT-संस्करण) का उपयोग करता है, जो उत्तरों के मूल वितरण से अत्यधिक विचलन को रोकता है[2]

RLHF की तुलना में लाभ

  • सरलता और स्थिरता: DPO एक अलग reward model के प्रशिक्षण और RL की जटिल सेटिंग की आवश्यकता को समाप्त करता है। प्रक्रिया अधिक सरल, पूर्वानुमानित और त्रुटि-प्रवण कम होती है[3]
  • दक्षता और गति: दो चरणों को हटाने से कम्प्यूटेशनल लागत (GPU-घंटे) और मॉडल सेटिंग में लगने वाला समय काफी कम हो जाता है। कुछ अनुमानों के अनुसार, DPO RLHF की तुलना में 50–60% अधिक किफायती है[4]
  • परिणामों की गुणवत्ता: प्रयोगों से पता चला है कि DPO गुणवत्ता में RLHF से कमतर नहीं है, और कुछ कार्यों में, जैसे उत्तर के स्वर के नियंत्रण में, यह उससे बेहतर भी है। DPO से प्रशिक्षित मॉडल मानवीय प्राथमिकताओं के साथ बेहतर संरेखण प्रदर्शित करते हैं[1]
  • बुनियादी कौशल में गिरावट नहीं: DPO fine-tuning मॉडल की सामान्य क्षमताओं (जैसे, तथ्यात्मक ज्ञान या तर्क) को न्यूनतम रूप से प्रभावित करती है, जबकि RLHF कभी-कभी बुनियादी metrics को खराब कर सकता है[5]

अनुप्रयोग और प्रसार

अपनी दक्षता और सरलता के कारण, DPO ने शीघ्र ही व्यापक प्रसार प्राप्त किया। इसे प्रमुख open-source लाइब्रेरी, जैसे Hugging Face TRL और OpenRLHF, में लागू किया गया।

कई सफल खुले मॉडलों को DPO की सहायता से fine-tune किया गया, जिनमें Zephyr-7B और TÜLU 2 शामिल हैं। इन मॉडलों ने उत्तर गुणवत्ता मूल्यांकन benchmark पर उच्च प्रदर्शन दिखाया, जिससे बड़े पैमाने के मॉडलों के लिए DPO की प्रभावशीलता की पुष्टि हुई[5]

उद्योग जगत के अग्रणी संगठनों ने भी DPO को अपने platform में शामिल किया है। उदाहरण के लिए, Microsoft ने अपनी Azure OpenAI सेवा में DPO fine-tuning के समर्थन को जोड़ा, जिससे उपयोगकर्ता GPT-4 सहित मॉडलों को अपने प्राथमिकता डेटा पर fine-tune कर सकते हैं[6]

सीमाएँ

लाभों के बावजूद, DPO प्राथमिकता-आधारित प्रशिक्षण के दृष्टिकोण से कुछ सीमाएँ विरासत में लेता है:

  • डेटा के प्रति संवेदनशीलता: एकत्रित प्राथमिकता डेटा की गुणवत्ता और विविधता अत्यंत महत्वपूर्ण है। यदि डेटा एकपक्षीय है (उदाहरण के लिए, केवल एक भाषा या शैली शामिल है), तो मॉडल overfit हो सकता है और अन्य क्षेत्रों में उसका प्रदर्शन खराब हो सकता है[7]
  • प्रशिक्षण की स्थिरता: RLHF की तरह, DPO एक स्थिर dataset पर प्रशिक्षित होता है और परिवेश के साथ गतिशील संपर्क की कल्पना नहीं करता। यह विधि एकल-चरण संरेखण के लिए उपयुक्त है, लेकिन अनुक्रमिक क्रियाओं के माध्यम से सीखने की आवश्यकता वाले कार्यों के लिए नहीं।

संदर्भ

  • Hugging Face TRL लाइब्रेरी में DPO का प्रलेखन
  • ICLR 2024 Blogposts पर RLHF और DPO का विश्लेषणात्मक सर्वेक्षण

साहित्य

  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
  • Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
  • Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
  • Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
  • Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
  • Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
  • Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.

टिप्पणियाँ

  1. 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [१]
  2. 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [२]
  3. «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [३]
  4. «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [४]
  5. 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [५]
  6. «Direct preference optimization». Azure OpenAI | Microsoft Learn. [६]
  7. «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [७]