Direct Preference Optimization (DPO) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Direct Preference Optimization (DPO) — এটি বৃহৎ ভাষা মডেলগুলিকে (LLM) মানুষের পছন্দের সাথে সামঞ্জস্য করার একটি পদ্ধতি, যা Reinforcement Learning from Human Feedback (RLHF)-এর তুলনায় আরও সহজ ও স্থিতিশীল বিকল্প হিসেবে প্রস্তাবিত হয়েছিল। পদ্ধতিটি ২০২৩ সালে স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের রাফায়েল রাফাইলভের নেতৃত্বে একদল গবেষক উপস্থাপন করেছিলেন[1]

DPO-এর মূল পার্থক্য হলো এটি সরাসরি ভাষা মডেলকে মানুষের পছন্দ অনুযায়ী অপটিমাইজ করে — আলাদা reward model প্রশিক্ষণ এবং জটিল Reinforcement Learning (RL) পর্যায় ছাড়াই — যা LLM fine-tuning প্রক্রিয়াটিকে উল্লেখযোগ্যভাবে সহজতর, দ্রুততর ও স্থিতিশীলতর করে তোলে[2]

Reinforcement Learning from Human Feedback - RLHF-এর সীমাবদ্ধতা: পটভূমি

প্রমাণিত Reinforcement Learning from Human Feedback (RLHF) পদ্ধতিটি তিনটি মূল পর্যায় নিয়ে গঠিত:

  1. Supervised Fine-Tuning (SFT): উচ্চমানের উদাহরণের উপর ভিত্তি করে মডেলের মৌলিক fine-tuning।
  2. Reward model প্রশিক্ষণ: একটি পৃথক মডেল তৈরি করা, যা মানুষের দেওয়া জোড়া তুলনার ভিত্তিতে উত্তরগুলিকে "রেটিং" দিতে শেখে (যেমন, উত্তর A উত্তর B-এর চেয়ে ভালো)।
  3. RL-এর মাধ্যমে নীতি অপটিমাইজেশন: RL অ্যালগরিদম (যেমন PPO) ব্যবহার করে মূল মডেলের fine-tuning, যাতে এটি reward model থেকে সর্বোচ্চ রেটিং পাওয়া উত্তর তৈরি করে।

কার্যকারিতা সত্ত্বেও, RLHF একটি জটিল, ব্যয়বহুল এবং অস্থিতিশীল প্রক্রিয়া। এটি reward hacking-এর মতো সমস্যার (যখন মডেল reward model-কে "ফাঁকি দেয়") শিকার হয় এবং বহু হাইপারপ্যারামিটারের সূক্ষ্ম সমন্বয় প্রয়োজন করে[1]। এই সীমাবদ্ধতাগুলি কাটিয়ে উঠতেই DPO তৈরি করা হয়েছিল।

DPO-এর কার্যপদ্ধতি

DPO পদ্ধতিটি RLHF-এর বহু-পর্যায়ের পাইপলাইনকে একটি একক প্রশিক্ষণ পর্যায় দিয়ে প্রতিস্থাপন করে, যাকে supervised fine-tuning হিসেবে বিবেচনা করা যায়।

  1. পছন্দের ডেটা সংগ্রহ। RLHF-এর মতো, একটি dataset সংগ্রহ করা হয় যেখানে প্রতিটি অনুরোধ `x`-এর জন্য দুটি উত্তর থাকে: পছন্দের (`y_w`, winning) এবং প্রত্যাখ্যাত (`y_l`, losing)।
  2. সরাসরি অপটিমাইজেশন। reward model প্রশিক্ষণের পরিবর্তে, DPO সরাসরি এই ডেটা ব্যবহার করে ভাষা মডেলটিকে আপডেট করে। অপটিমাইজেশনের লক্ষ্য হলো পছন্দের উত্তর `y_w` তৈরির সম্ভাবনা বাড়ানো এবং একইসাথে প্রত্যাখ্যাত উত্তর `y_l` তৈরির সম্ভাবনা কমানো।

গাণিতিকভাবে এটি একটি loss function ন্যূনতম করার মধ্যে সীমাবদ্ধ, যা উত্তরগুলির লগ-সম্ভাবনার পার্থক্যে প্রয়োগ করা logistic regression-এর উপর ভিত্তি করে। মডেলটি যাতে তার প্রাথমিক জ্ঞান "ভুলে না যায়", তার জন্য DPO, RLHF-এর মতোই, নিয়মিতকরণের জন্য একটি reference model (সাধারণত SFT সংস্করণ) ব্যবহার করে, যা মূল উত্তর বিতরণ থেকে অতিরিক্ত বিচ্যুতি রোধ করে[2]

RLHF-এর তুলনায় সুবিধাসমূহ

  • সরলতা ও স্থিতিশীলতা: DPO আলাদা reward model প্রশিক্ষণ এবং জটিল RL সমন্বয়ের প্রয়োজনীয়তা দূর করে। প্রক্রিয়াটি আরও সহজ, পূর্বানুমানযোগ্য এবং কম ত্রুটিপ্রবণ হয়[3]
  • দক্ষতা ও গতি: দুটি পর্যায় বাদ দেওয়ায় মডেল fine-tuning-এ প্রয়োজনীয় গণনামূলক খরচ (GPU-ঘণ্টা) এবং সময় উল্লেখযোগ্যভাবে হ্রাস পায়। কিছু অনুমান অনুযায়ী, DPO RLHF-এর চেয়ে ৫০–৬০% বেশি সাশ্রয়ী[4]
  • ফলাফলের মান: পরীক্ষা-নিরীক্ষায় দেখা গেছে যে DPO গুণমানে RLHF-এর সমকক্ষ এবং কিছু ক্ষেত্রে, যেমন উত্তরের সুর নিয়ন্ত্রণে, এমনকি এটিকে ছাড়িয়ে যায়। DPO দিয়ে প্রশিক্ষিত মডেলগুলি মানুষের পছন্দের সাথে আরও ভালো সামঞ্জস্য প্রদর্শন করে[1]
  • মৌলিক দক্ষতার অবক্ষয় নেই: DPO fine-tuning মডেলের সাধারণ সক্ষমতার (যেমন বাস্তব জ্ঞান বা যুক্তি) উপর ন্যূনতম প্রভাব ফেলে, যেখানে RLHF কখনো কখনো মৌলিক মেট্রিক্স খারাপ করতে পারে[5]

প্রয়োগ ও বিস্তার

দক্ষতা ও সরলতার কারণে DPO দ্রুত ব্যাপক জনপ্রিয়তা পেয়েছে। এটি Hugging Face TRL এবং OpenRLHF-এর মতো শীর্ষস্থানীয় open-source লাইব্রেরিতে প্রয়োগ করা হয়েছে।

অনেক সফল উন্মুক্ত মডেল DPO ব্যবহার করে fine-tuning করা হয়েছে, যার মধ্যে Zephyr-7B এবং TÜLU 2 অন্তর্ভুক্ত। এই মডেলগুলি উত্তরের মান মূল্যায়নের benchmark-এ উচ্চ কার্যক্ষমতা দেখিয়েছে, বৃহৎ মাপের মডেলের জন্য DPO-এর কার্যকারিতা নিশ্চিত করেছে[5]

শিল্পের শীর্ষ প্রতিষ্ঠানগুলিও তাদের প্ল্যাটফর্মে DPO সংযুক্ত করেছে। উদাহরণস্বরূপ, Microsoft তাদের Azure OpenAI সেবায় DPO fine-tuning-এর সমর্থন যুক্ত করেছে, যা ব্যবহারকারীদের নিজেদের পছন্দের ডেটায় GPT-4 সহ বিভিন্ন মডেল কাস্টমাইজ করতে দেয়[6]

সীমাবদ্ধতা

সুবিধা সত্ত্বেও, DPO পছন্দ-ভিত্তিক প্রশিক্ষণ পদ্ধতির কিছু সীমাবদ্ধতা উত্তরাধিকারসূত্রে বহন করে:

  • ডেটার প্রতি সংবেদনশীলতা: সংগৃহীত পছন্দের ডেটার মান ও বৈচিত্র্য অত্যন্ত গুরুত্বপূর্ণ। যদি ডেটা একমুখী হয় (যেমন কেবল একটি ভাষা বা শৈলী থাকে), তাহলে মডেল অতিরিক্ত প্রশিক্ষিত হয়ে অন্যান্য ক্ষেত্রে কার্যক্ষমতা হ্রাস পেতে পারে[7]
  • প্রশিক্ষণের স্থিরতা: RLHF-এর মতো, DPO একটি স্থির dataset-এ প্রশিক্ষিত হয় এবং পরিবেশের সাথে গতিশীল মিথস্ক্রিয়া অনুমান করে না। এই পদ্ধতি একক-পর্যায়ের সামঞ্জস্যের জন্য উপযুক্ত, কিন্তু ক্রমানুগত কার্যক্রমের মাধ্যমে প্রশিক্ষণের প্রয়োজন এমন কাজের জন্য নয়।

তথ্যসূত্র

  • Hugging Face TRL লাইব্রেরিতে DPO ডকুমেন্টেশন
  • ICLR 2024 Blogposts-এ RLHF ও DPO-এর বিশ্লেষণমূলক পর্যালোচনা

সাহিত্য

  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
  • Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
  • Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
  • Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
  • Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
  • Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
  • Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.

টীকা

  1. 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [১]
  2. 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [২]
  3. «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [৩]
  4. «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [৪]
  5. 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [৫]
  6. «Direct preference optimization». Azure OpenAI | Microsoft Learn. [৬]
  7. «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [৭]