---
title: "Direct Preference Optimization (DPO) (HI)"
source: "https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)"
wiki: "systems-analysis.info/int"
article: "Direct_Preference_Optimization_(DPO)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1704
wiki_created_at: 2026-09-06T22:52:45Z
wiki_modified_at: 2026-09-06T22:52:45Z
downloaded_at: 2026-09-07T22:47:20Z
---

# Direct Preference Optimization (DPO) (HI)

**Direct Preference Optimization** (**DPO**) — यह बड़े भाषा मॉडलों (LLM) को मानवीय प्राथमिकताओं के साथ संरेखित करने की एक विधि है, जिसे Reinforcement Learning from Human Feedback (RLHF) के एक सरल और अधिक स्थिर विकल्प के रूप में प्रस्तावित किया गया था। यह विधि 2023 में स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं के एक समूह द्वारा राफाएल राफाइलोव के नेतृत्व में प्रस्तुत की गई थी<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-dpo_paper_2023-1)</sup>।

DPO की मुख्य विशेषता यह है कि यह भाषा मॉडल को मानवीय प्राथमिकताओं के अनुरूप बनाने के लिए सीधे अनुकूलित करता है — बिना किसी अलग **reward model** (पुरस्कार मॉडल) के प्रशिक्षण और Reinforcement Learning (RL) के जटिल चरण के, जिससे LLM को ठीक करने की प्रक्रिया काफी सरल, तेज़ और अधिक स्थिर हो जाती है<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-huggingface_dpo-2)</sup>।

## पूर्व पृष्ठभूमि: RLHF की सीमाएँ

मानक **Reinforcement Learning from Human Feedback** (**RLHF**) विधि में तीन मुख्य चरण होते हैं:

1.  **Supervised Fine-Tuning (SFT)**: उच्च-गुणवत्ता वाले उदाहरणों पर मॉडल का बुनियादी fine-tuning।
2.  **Reward Model का प्रशिक्षण**: एक अलग मॉडल का निर्माण, जो मनुष्यों द्वारा प्रदान की गई युग्मित तुलनाओं (जैसे, उत्तर A, उत्तर B से बेहतर है) के आधार पर उत्तरों को "रेटिंग" देना सीखता है।
3.  **RL की सहायता से नीति अनुकूलन**: RL एल्गोरिदम (जैसे, PPO) का उपयोग करके मुख्य मॉडल का fine-tuning, ताकि वह reward model से अधिकतम रेटिंग प्राप्त करने वाले उत्तर उत्पन्न करे।

अपनी प्रभावशीलता के बावजूद, RLHF एक जटिल, महंगी और अस्थिर प्रक्रिया है। यह **reward hacking** (जब मॉडल reward model को "धोखा" देता है) जैसी समस्याओं से ग्रस्त है, और इसके लिए अनेक hyperparameter की सावधानीपूर्वक सेटिंग की आवश्यकता होती है<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-dpo_paper_2023-1)</sup>। DPO को इन्हीं सीमाओं पर काबू पाने के लिए विकसित किया गया था।

## DPO की कार्यप्रणाली

DPO विधि RLHF की बहु-चरणीय प्रक्रिया को एक ही प्रशिक्षण चरण से प्रतिस्थापित करती है, जिसे supervised fine-tuning के रूप में देखा जा सकता है।

1.  **प्राथमिकता डेटा का संग्रह**। RLHF की तरह ही, एक dataset तैयार किया जाता है जहाँ प्रत्येक अनुरोध \`x\` के लिए दो उत्तर होते हैं: पसंदीदा (\`y_w\`, winning) और अस्वीकृत (\`y_l\`, losing)।
2.  **प्रत्यक्ष अनुकूलन**। reward model को प्रशिक्षित करने के बजाय, DPO इन डेटा का उपयोग सीधे भाषा मॉडल को अद्यतन करने के लिए करता है। अनुकूलन का लक्ष्य — पसंदीदा उत्तर \`y_w\` उत्पन्न करने की संभावना बढ़ाना और साथ ही अस्वीकृत उत्तर \`y_l\` उत्पन्न करने की संभावना घटाना।

गणितीय दृष्टि से यह एक loss function के न्यूनीकरण तक सीमित हो जाता है, जो उत्तरों की लघुगणकीय संभावनाओं के अंतर पर लागू logistic regression पर आधारित है। यह सुनिश्चित करने के लिए कि मॉडल अपना मूल ज्ञान न भूले, DPO भी RLHF की तरह नियमितीकरण के लिए एक **reference model** (*reference model*, आमतौर पर SFT-संस्करण) का उपयोग करता है, जो उत्तरों के मूल वितरण से अत्यधिक विचलन को रोकता है<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-huggingface_dpo-2)</sup>।

## RLHF की तुलना में लाभ

- **सरलता और स्थिरता**: DPO एक अलग reward model के प्रशिक्षण और RL की जटिल सेटिंग की आवश्यकता को समाप्त करता है। प्रक्रिया अधिक सरल, पूर्वानुमानित और त्रुटि-प्रवण कम होती है<sup>[\[3\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-superannotate_dpo-3)</sup>।
- **दक्षता और गति**: दो चरणों को हटाने से कम्प्यूटेशनल लागत (GPU-घंटे) और मॉडल सेटिंग में लगने वाला समय काफी कम हो जाता है। कुछ अनुमानों के अनुसार, DPO RLHF की तुलना में 50–60% अधिक किफायती है<sup>[\[4\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-arbisoft_dpo-4)</sup>।
- **परिणामों की गुणवत्ता**: प्रयोगों से पता चला है कि DPO गुणवत्ता में RLHF से कमतर नहीं है, और कुछ कार्यों में, जैसे उत्तर के स्वर के नियंत्रण में, यह उससे बेहतर भी है। DPO से प्रशिक्षित मॉडल मानवीय प्राथमिकताओं के साथ बेहतर संरेखण प्रदर्शित करते हैं<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-dpo_paper_2023-1)</sup>।
- **बुनियादी कौशल में गिरावट नहीं**: DPO fine-tuning मॉडल की सामान्य क्षमताओं (जैसे, तथ्यात्मक ज्ञान या तर्क) को न्यूनतम रूप से प्रभावित करती है, जबकि RLHF कभी-कभी बुनियादी metrics को खराब कर सकता है<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-iclr_blog-5)</sup>।

## अनुप्रयोग और प्रसार

अपनी दक्षता और सरलता के कारण, DPO ने शीघ्र ही व्यापक प्रसार प्राप्त किया। इसे प्रमुख open-source लाइब्रेरी, जैसे **Hugging Face TRL** और **OpenRLHF**, में लागू किया गया।

कई सफल खुले मॉडलों को DPO की सहायता से fine-tune किया गया, जिनमें **Zephyr-7B** और **TÜLU 2** शामिल हैं। इन मॉडलों ने उत्तर गुणवत्ता मूल्यांकन benchmark पर उच्च प्रदर्शन दिखाया, जिससे बड़े पैमाने के मॉडलों के लिए DPO की प्रभावशीलता की पुष्टि हुई<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-iclr_blog-5)</sup>।

उद्योग जगत के अग्रणी संगठनों ने भी DPO को अपने platform में शामिल किया है। उदाहरण के लिए, Microsoft ने अपनी Azure OpenAI सेवा में DPO fine-tuning के समर्थन को जोड़ा, जिससे उपयोगकर्ता GPT-4 सहित मॉडलों को अपने प्राथमिकता डेटा पर fine-tune कर सकते हैं<sup>[\[6\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-azure_dpo-6)</sup>।

## सीमाएँ

लाभों के बावजूद, DPO प्राथमिकता-आधारित प्रशिक्षण के दृष्टिकोण से कुछ सीमाएँ विरासत में लेता है:

- **डेटा के प्रति संवेदनशीलता**: एकत्रित प्राथमिकता डेटा की गुणवत्ता और विविधता अत्यंत महत्वपूर्ण है। यदि डेटा एकपक्षीय है (उदाहरण के लिए, केवल एक भाषा या शैली शामिल है), तो मॉडल overfit हो सकता है और अन्य क्षेत्रों में उसका प्रदर्शन खराब हो सकता है<sup>[\[7\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_note-toloka_dpo-7)</sup>।
- **प्रशिक्षण की स्थिरता**: RLHF की तरह, DPO एक स्थिर dataset पर प्रशिक्षित होता है और परिवेश के साथ गतिशील संपर्क की कल्पना नहीं करता। यह विधि एकल-चरण संरेखण के लिए उपयुक्त है, लेकिन अनुक्रमिक क्रियाओं के माध्यम से सीखने की आवश्यकता वाले कार्यों के लिए नहीं।

## संदर्भ

- Hugging Face TRL लाइब्रेरी में DPO का प्रलेखन
- ICLR 2024 Blogposts पर RLHF और DPO का विश्लेषणात्मक सर्वेक्षण

## साहित्य

- Rafailov, R. et al. (2023). *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. arXiv:2305.18290.
- Hong, J.; Lee, N.; Thorne, J. (2024). *ORPO: Monolithic Preference Optimization without Reference Model*. arXiv:2403.07691.
- Sun, L. et al. (2025). *BPO: Revisiting Preference Modeling in Direct Preference Optimization*. arXiv:2506.03557.
- Yin, Y. et al. (2024). *Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment*. arXiv:2405.20830.
- Wu, Y. et al. (2024). *Self-Play Preference Optimization for Language Model Alignment*. arXiv:2405.00675.
- Li, P. et al. (2024). *ROPO: Robust Preference Optimization for Large Language Models*. arXiv:2404.04102.
- Tunstall, L. et al. (2023). *Zephyr: Direct Distillation of LM Alignment*. arXiv:2310.16944.
- Wu, F. et al. (2023). *Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization*. arXiv:2311.12908.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. arXiv:2309.00267.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). *Direct Preference Optimization (v3): Enhanced Experiments and Analysis*. arXiv:2305.18290v3.

## टिप्पणियाँ

1.  <span id="cite_note-dpo_paper_2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-dpo_paper_2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-dpo_paper_2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-dpo_paper_2023_1-2)</sup> Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». *arXiv:2305.18290*. <a href="https://arxiv.org/abs/2305.18290" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-huggingface_dpo-2">↑ <sup>[2.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-huggingface_dpo_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-huggingface_dpo_2-1)</sup> «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». *Hugging Face Blog*. <a href="https://huggingface.co/blog/ariG23498/rlhf-to-dpo" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-superannotate_dpo-3">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-superannotate_dpo_3-0) «What is direct preference optimization (DPO)?». *SuperAnnotate Blog*. <a href="https://www.superannotate.com/blog/direct-preference-optimization-dpo" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-arbisoft_dpo-4">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-arbisoft_dpo_4-0) «RLHF vs DPO: A Closer Look into the Process and Methodology». *Arbisoft Blog*. <a href="https://arbisoft.com/blogs/rlhf-vs-dpo-a-closer-look-into-the-process-and-methodology" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-iclr_blog-5">↑ <sup>[5.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-iclr_blog_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-iclr_blog_5-1)</sup> «RLHF without RL - Direct Preference Optimization». *ICLR Blogposts 2024*. <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-azure_dpo-6">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-azure_dpo_6-0) «Direct preference optimization». *Azure OpenAI \| Microsoft Learn*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-direct-preference-optimization" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-toloka_dpo-7">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HI)#cite_ref-toloka_dpo_7-0) «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». *Toloka AI Blog*. <a href="https://toloka.ai/blog/direct-preference-optimization/" class="external autonumber" rel="nofollow">[७]</a></span>
