---
title: "Direct Preference Optimization (DPO) (BN)"
source: "https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)"
wiki: "systems-analysis.info/int"
article: "Direct_Preference_Optimization_(DPO)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1696
wiki_created_at: 2026-09-06T22:52:37Z
wiki_modified_at: 2026-09-06T22:52:37Z
downloaded_at: 2026-09-07T22:47:17Z
---

# Direct Preference Optimization (DPO) (BN)

**Direct Preference Optimization** (**DPO**) — এটি বৃহৎ ভাষা মডেলগুলিকে (LLM) মানুষের পছন্দের সাথে সামঞ্জস্য করার একটি পদ্ধতি, যা Reinforcement Learning from Human Feedback (RLHF)-এর তুলনায় আরও সহজ ও স্থিতিশীল বিকল্প হিসেবে প্রস্তাবিত হয়েছিল। পদ্ধতিটি ২০২৩ সালে স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের রাফায়েল রাফাইলভের নেতৃত্বে একদল গবেষক উপস্থাপন করেছিলেন<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-dpo_paper_2023-1)</sup>।

DPO-এর মূল পার্থক্য হলো এটি সরাসরি ভাষা মডেলকে মানুষের পছন্দ অনুযায়ী অপটিমাইজ করে — আলাদা **reward model** প্রশিক্ষণ এবং জটিল Reinforcement Learning (RL) পর্যায় ছাড়াই — যা LLM fine-tuning প্রক্রিয়াটিকে উল্লেখযোগ্যভাবে সহজতর, দ্রুততর ও স্থিতিশীলতর করে তোলে<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-huggingface_dpo-2)</sup>।

## Reinforcement Learning from Human Feedback - RLHF-এর সীমাবদ্ধতা: পটভূমি

প্রমাণিত **Reinforcement Learning from Human Feedback** (**RLHF**) পদ্ধতিটি তিনটি মূল পর্যায় নিয়ে গঠিত:

1.  **Supervised Fine-Tuning (SFT)**: উচ্চমানের উদাহরণের উপর ভিত্তি করে মডেলের মৌলিক fine-tuning।
2.  **Reward model প্রশিক্ষণ**: একটি পৃথক মডেল তৈরি করা, যা মানুষের দেওয়া জোড়া তুলনার ভিত্তিতে উত্তরগুলিকে "রেটিং" দিতে শেখে (যেমন, উত্তর A উত্তর B-এর চেয়ে ভালো)।
3.  **RL-এর মাধ্যমে নীতি অপটিমাইজেশন**: RL অ্যালগরিদম (যেমন PPO) ব্যবহার করে মূল মডেলের fine-tuning, যাতে এটি reward model থেকে সর্বোচ্চ রেটিং পাওয়া উত্তর তৈরি করে।

কার্যকারিতা সত্ত্বেও, RLHF একটি জটিল, ব্যয়বহুল এবং অস্থিতিশীল প্রক্রিয়া। এটি **reward hacking**-এর মতো সমস্যার (যখন মডেল reward model-কে "ফাঁকি দেয়") শিকার হয় এবং বহু হাইপারপ্যারামিটারের সূক্ষ্ম সমন্বয় প্রয়োজন করে<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-dpo_paper_2023-1)</sup>। এই সীমাবদ্ধতাগুলি কাটিয়ে উঠতেই DPO তৈরি করা হয়েছিল।

## DPO-এর কার্যপদ্ধতি

DPO পদ্ধতিটি RLHF-এর বহু-পর্যায়ের পাইপলাইনকে একটি একক প্রশিক্ষণ পর্যায় দিয়ে প্রতিস্থাপন করে, যাকে supervised fine-tuning হিসেবে বিবেচনা করা যায়।

1.  **পছন্দের ডেটা সংগ্রহ**। RLHF-এর মতো, একটি dataset সংগ্রহ করা হয় যেখানে প্রতিটি অনুরোধ \`x\`-এর জন্য দুটি উত্তর থাকে: পছন্দের (\`y_w\`, winning) এবং প্রত্যাখ্যাত (\`y_l\`, losing)।
2.  **সরাসরি অপটিমাইজেশন**। reward model প্রশিক্ষণের পরিবর্তে, DPO সরাসরি এই ডেটা ব্যবহার করে ভাষা মডেলটিকে আপডেট করে। অপটিমাইজেশনের লক্ষ্য হলো পছন্দের উত্তর \`y_w\` তৈরির সম্ভাবনা বাড়ানো এবং একইসাথে প্রত্যাখ্যাত উত্তর \`y_l\` তৈরির সম্ভাবনা কমানো।

গাণিতিকভাবে এটি একটি loss function ন্যূনতম করার মধ্যে সীমাবদ্ধ, যা উত্তরগুলির লগ-সম্ভাবনার পার্থক্যে প্রয়োগ করা logistic regression-এর উপর ভিত্তি করে। মডেলটি যাতে তার প্রাথমিক জ্ঞান "ভুলে না যায়", তার জন্য DPO, RLHF-এর মতোই, নিয়মিতকরণের জন্য একটি **reference model** (সাধারণত SFT সংস্করণ) ব্যবহার করে, যা মূল উত্তর বিতরণ থেকে অতিরিক্ত বিচ্যুতি রোধ করে<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-huggingface_dpo-2)</sup>।

## RLHF-এর তুলনায় সুবিধাসমূহ

- **সরলতা ও স্থিতিশীলতা**: DPO আলাদা reward model প্রশিক্ষণ এবং জটিল RL সমন্বয়ের প্রয়োজনীয়তা দূর করে। প্রক্রিয়াটি আরও সহজ, পূর্বানুমানযোগ্য এবং কম ত্রুটিপ্রবণ হয়<sup>[\[3\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-superannotate_dpo-3)</sup>।
- **দক্ষতা ও গতি**: দুটি পর্যায় বাদ দেওয়ায় মডেল fine-tuning-এ প্রয়োজনীয় গণনামূলক খরচ (GPU-ঘণ্টা) এবং সময় উল্লেখযোগ্যভাবে হ্রাস পায়। কিছু অনুমান অনুযায়ী, DPO RLHF-এর চেয়ে ৫০–৬০% বেশি সাশ্রয়ী<sup>[\[4\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-arbisoft_dpo-4)</sup>।
- **ফলাফলের মান**: পরীক্ষা-নিরীক্ষায় দেখা গেছে যে DPO গুণমানে RLHF-এর সমকক্ষ এবং কিছু ক্ষেত্রে, যেমন উত্তরের সুর নিয়ন্ত্রণে, এমনকি এটিকে ছাড়িয়ে যায়। DPO দিয়ে প্রশিক্ষিত মডেলগুলি মানুষের পছন্দের সাথে আরও ভালো সামঞ্জস্য প্রদর্শন করে<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-dpo_paper_2023-1)</sup>।
- **মৌলিক দক্ষতার অবক্ষয় নেই**: DPO fine-tuning মডেলের সাধারণ সক্ষমতার (যেমন বাস্তব জ্ঞান বা যুক্তি) উপর ন্যূনতম প্রভাব ফেলে, যেখানে RLHF কখনো কখনো মৌলিক মেট্রিক্স খারাপ করতে পারে<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-iclr_blog-5)</sup>।

## প্রয়োগ ও বিস্তার

দক্ষতা ও সরলতার কারণে DPO দ্রুত ব্যাপক জনপ্রিয়তা পেয়েছে। এটি **Hugging Face TRL** এবং **OpenRLHF**-এর মতো শীর্ষস্থানীয় open-source লাইব্রেরিতে প্রয়োগ করা হয়েছে।

অনেক সফল উন্মুক্ত মডেল DPO ব্যবহার করে fine-tuning করা হয়েছে, যার মধ্যে **Zephyr-7B** এবং **TÜLU 2** অন্তর্ভুক্ত। এই মডেলগুলি উত্তরের মান মূল্যায়নের benchmark-এ উচ্চ কার্যক্ষমতা দেখিয়েছে, বৃহৎ মাপের মডেলের জন্য DPO-এর কার্যকারিতা নিশ্চিত করেছে<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-iclr_blog-5)</sup>।

শিল্পের শীর্ষ প্রতিষ্ঠানগুলিও তাদের প্ল্যাটফর্মে DPO সংযুক্ত করেছে। উদাহরণস্বরূপ, Microsoft তাদের Azure OpenAI সেবায় DPO fine-tuning-এর সমর্থন যুক্ত করেছে, যা ব্যবহারকারীদের নিজেদের পছন্দের ডেটায় GPT-4 সহ বিভিন্ন মডেল কাস্টমাইজ করতে দেয়<sup>[\[6\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-azure_dpo-6)</sup>।

## সীমাবদ্ধতা

সুবিধা সত্ত্বেও, DPO পছন্দ-ভিত্তিক প্রশিক্ষণ পদ্ধতির কিছু সীমাবদ্ধতা উত্তরাধিকারসূত্রে বহন করে:

- **ডেটার প্রতি সংবেদনশীলতা**: সংগৃহীত পছন্দের ডেটার মান ও বৈচিত্র্য অত্যন্ত গুরুত্বপূর্ণ। যদি ডেটা একমুখী হয় (যেমন কেবল একটি ভাষা বা শৈলী থাকে), তাহলে মডেল অতিরিক্ত প্রশিক্ষিত হয়ে অন্যান্য ক্ষেত্রে কার্যক্ষমতা হ্রাস পেতে পারে<sup>[\[7\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_note-toloka_dpo-7)</sup>।
- **প্রশিক্ষণের স্থিরতা**: RLHF-এর মতো, DPO একটি স্থির dataset-এ প্রশিক্ষিত হয় এবং পরিবেশের সাথে গতিশীল মিথস্ক্রিয়া অনুমান করে না। এই পদ্ধতি একক-পর্যায়ের সামঞ্জস্যের জন্য উপযুক্ত, কিন্তু ক্রমানুগত কার্যক্রমের মাধ্যমে প্রশিক্ষণের প্রয়োজন এমন কাজের জন্য নয়।

## তথ্যসূত্র

- Hugging Face TRL লাইব্রেরিতে DPO ডকুমেন্টেশন
- ICLR 2024 Blogposts-এ RLHF ও DPO-এর বিশ্লেষণমূলক পর্যালোচনা

## সাহিত্য

- Rafailov, R. et al. (2023). *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. arXiv:2305.18290.
- Hong, J.; Lee, N.; Thorne, J. (2024). *ORPO: Monolithic Preference Optimization without Reference Model*. arXiv:2403.07691.
- Sun, L. et al. (2025). *BPO: Revisiting Preference Modeling in Direct Preference Optimization*. arXiv:2506.03557.
- Yin, Y. et al. (2024). *Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment*. arXiv:2405.20830.
- Wu, Y. et al. (2024). *Self-Play Preference Optimization for Language Model Alignment*. arXiv:2405.00675.
- Li, P. et al. (2024). *ROPO: Robust Preference Optimization for Large Language Models*. arXiv:2404.04102.
- Tunstall, L. et al. (2023). *Zephyr: Direct Distillation of LM Alignment*. arXiv:2310.16944.
- Wu, F. et al. (2023). *Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization*. arXiv:2311.12908.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. arXiv:2309.00267.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). *Direct Preference Optimization (v3): Enhanced Experiments and Analysis*. arXiv:2305.18290v3.

## টীকা

1.  <span id="cite_note-dpo_paper_2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-dpo_paper_2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-dpo_paper_2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-dpo_paper_2023_1-2)</sup> Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». *arXiv:2305.18290*. <a href="https://arxiv.org/abs/2305.18290" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-huggingface_dpo-2">↑ <sup>[2.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-huggingface_dpo_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-huggingface_dpo_2-1)</sup> «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». *Hugging Face Blog*. <a href="https://huggingface.co/blog/ariG23498/rlhf-to-dpo" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-superannotate_dpo-3">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-superannotate_dpo_3-0) «What is direct preference optimization (DPO)?». *SuperAnnotate Blog*. <a href="https://www.superannotate.com/blog/direct-preference-optimization-dpo" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-arbisoft_dpo-4">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-arbisoft_dpo_4-0) «RLHF vs DPO: A Closer Look into the Process and Methodology». *Arbisoft Blog*. <a href="https://arbisoft.com/blogs/rlhf-vs-dpo-a-closer-look-into-the-process-and-methodology" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-iclr_blog-5">↑ <sup>[5.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-iclr_blog_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-iclr_blog_5-1)</sup> «RLHF without RL - Direct Preference Optimization». *ICLR Blogposts 2024*. <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-azure_dpo-6">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-azure_dpo_6-0) «Direct preference optimization». *Azure OpenAI \| Microsoft Learn*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-direct-preference-optimization" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-toloka_dpo-7">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(BN)#cite_ref-toloka_dpo_7-0) «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». *Toloka AI Blog*. <a href="https://toloka.ai/blog/direct-preference-optimization/" class="external autonumber" rel="nofollow">[৭]</a></span>
