Direct Preference Optimization (DPO) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Direct Preference Optimization (DPO) — büyük dil modellerini (LLM) insan tercihleriyle hizalamak için önerilen, İnsan Geri Bildiriminden Pekiştirmeli Öğrenme'ye (RLHF) kıyasla daha basit ve kararlı bir alternatif yöntemdir. Yöntem, 2023 yılında Stanford Üniversitesi'nden Rafael Rafailov liderliğindeki bir araştırmacı grubu tarafından tanıtılmıştır[1].

DPO'nun temel farkı, ayrı bir ödül modeli (reward model) eğitme ve karmaşık pekiştirmeli öğrenme (RL) aşaması gerektirmeksizin dil modelini doğrudan insan tercihlerine uyacak şekilde optimize etmesidir; bu da LLM ayarlama sürecini önemli ölçüde daha basit, hızlı ve kararlı hale getirir[2].

Arka Plan: RLHF'nin Sınırlılıkları

Standart Reinforcement Learning from Human Feedback (RLHF) yöntemi üç temel aşamadan oluşur:

  1. Supervised Fine-Tuning (SFT): Modelin yüksek kaliteli örnekler üzerinde temel düzeyinde ince ayar yapılması.
  2. Ödül modeli eğitimi: İnsanlar tarafından sağlanan ikili karşılaştırmalara (örneğin, A yanıtı B yanıtından daha iyidir) dayanarak yanıtlara "puan" atamayı öğrenen ayrı bir modelin oluşturulması.
  3. RL ile politika optimizasyonu: Ana modelin, ödül modelinden alınan puanı maksimize eden yanıtlar üretmesi için RL algoritmaları (örneğin PPO) kullanılarak ince ayar yapılması.

Etkinliğine karşın RLHF, karmaşık, maliyetli ve kararsız bir süreçtir. Reward hacking (modelin ödül modelini "kandırması") gibi sorunlara açıktır ve çok sayıda hiperparametrenin dikkatli biçimde ayarlanmasını gerektirir[1]. DPO bu sınırlılıkların üstesinden gelmek amacıyla geliştirilmiştir.

DPO'nun Çalışma Prensibi

DPO yöntemi, RLHF'nin çok aşamalı hattını, gözetimli ince ayar olarak değerlendirilebilecek tek bir eğitim aşamasıyla değiştirir.

  1. Tercih verisi toplama. RLHF'de olduğu gibi, her `x` sorgusu için tercih edilen (`y_w`, winning) ve reddedilen (`y_l`, losing) olmak üzere iki yanıtın bulunduğu bir veri kümesi oluşturulur.
  2. Doğrudan optimizasyon. Bir ödül modeli eğitmek yerine DPO, bu verileri doğrudan dil modelinin güncellenmesinde kullanır. Optimizasyon hedefi, tercih edilen `y_w` yanıtının üretilme olasılığını artırırken aynı anda reddedilen `y_l` yanıtının üretilme olasılığını azaltmaktır.

Matematiksel olarak bu, yanıtların logaritmik olasılıkları arasındaki farka uygulanan lojistik regresyona dayalı bir kayıp fonksiyonunun minimize edilmesine indirgenir. Modelin başlangıçtaki bilgilerini "unutmaması" için DPO, tıpkı RLHF gibi, yanıt dağılımından çok fazla sapmasını önlemek amacıyla bir referans model (reference model, genellikle SFT sürümü) kullanarak düzenlileştirme uygular[2].

RLHF ile Karşılaştırıldığında Avantajları

  • Basitlik ve kararlılık: DPO, ayrı bir ödül modeli eğitme ve RL'nin karmaşık ayar sürecini ortadan kaldırır. Süreç daha basit, öngörülebilir ve hataya daha az açık hale gelir[3].
  • Verimlilik ve hız: İki aşamanın çıkarılması, hesaplama maliyetlerini (GPU saati) ve model ayarlama için gereken süreyi önemli ölçüde azaltır. Bazı tahminlere göre DPO, RLHF'den %50–60 daha ekonomiktir[4].
  • Sonuç kalitesi: Deneyler, DPO'nun kalite açısından RLHF'den geri kalmadığını, hatta yanıt tonu yönetimi gibi bazı görevlerde onu geride bıraktığını göstermiştir. DPO ile eğitilen modeller, insan tercihleriyle daha iyi bir uyum sergilemektedir[1].
  • Temel becerilerin bozulmaması: DPO ayarı, modelin genel yeteneklerini (örneğin olgusal bilgi ya da mantık yürütme) en az düzeyde etkiler; bu özelliğiyle, zaman zaman temel metrikleri olumsuz etkileyebilen RLHF'den ayrışır[5].

Uygulama ve Yaygınlaşma

Verimliliği ve basitliği sayesinde DPO, hızla geniş çaplı bir kullanım alanı bulmuştur. Hugging Face TRL ve OpenRLHF gibi önde gelen açık kaynak kütüphanelerde hayata geçirilmiştir.

Zephyr-7B ve TÜLU 2 dahil olmak üzere pek çok başarılı açık model DPO ile ince ayardan geçirilmiştir. Bu modeller, yanıt kalitesini değerlendiren benchmark'larda yüksek performans sergileyerek DPO'nun büyük ölçekli modeller için etkinliğini kanıtlamıştır[5].

Sektör liderleri de DPO'yu kendi platformlarına entegre etmiştir. Örneğin Microsoft, Azure OpenAI hizmetine DPO ince ayar desteği ekleyerek kullanıcıların GPT-4 dahil modelleri kendi tercih verileriyle özelleştirmesine olanak tanımaktadır[6].

Sınırlılıklar

Avantajlarına karşın DPO, tercih temelli öğrenme yaklaşımının bazı sınırlılıklarını devralmaktadır:

  • Veriye duyarlılık: Toplanan tercih verilerinin kalitesi ve çeşitliliği kritik önem taşır. Veriler tek yönlüyse (örneğin yalnızca tek bir dil veya üslup içeriyorsa) model aşırı uyum sağlayabilir ve diğer alanlardaki performansı düşebilir[7].
  • Statik eğitim: RLHF gibi DPO da statik bir veri kümesi üzerinde eğitim yapar ve ortamla dinamik bir etkileşim öngörmez. Bu yöntem tek adımlı hizalama için iyi uyum sağlarken, ardışık eylemler aracılığıyla öğrenme gerektiren görevler için uygun değildir.

Dış bağlantılar

  • Hugging Face TRL kütüphanesinde DPO belgeleri
  • ICLR 2024 Blogposts'ta RLHF ve DPO analitik incelemesi

Literatür

  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Hong, J.; Lee, N.; Thorne, J. (2024). ORPO: Monolithic Preference Optimization without Reference Model. arXiv:2403.07691.
  • Sun, L. et al. (2025). BPO: Revisiting Preference Modeling in Direct Preference Optimization. arXiv:2506.03557.
  • Yin, Y. et al. (2024). Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment. arXiv:2405.20830.
  • Wu, Y. et al. (2024). Self-Play Preference Optimization for Language Model Alignment. arXiv:2405.00675.
  • Li, P. et al. (2024). ROPO: Robust Preference Optimization for Large Language Models. arXiv:2404.04102.
  • Tunstall, L. et al. (2023). Zephyr: Direct Distillation of LM Alignment. arXiv:2310.16944.
  • Wu, F. et al. (2023). Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization. arXiv:2311.12908.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). Direct Preference Optimization (v3): Enhanced Experiments and Analysis. arXiv:2305.18290v3.

Notlar

  1. 1.0 1.1 1.2 Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». arXiv:2305.18290. [1]
  2. 2.0 2.1 «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». Hugging Face Blog. [2]
  3. «What is direct preference optimization (DPO)?». SuperAnnotate Blog. [3]
  4. «RLHF vs DPO: A Closer Look into the Process and Methodology». Arbisoft Blog. [4]
  5. 5.0 5.1 «RLHF without RL - Direct Preference Optimization». ICLR Blogposts 2024. [5]
  6. «Direct preference optimization». Azure OpenAI | Microsoft Learn. [6]
  7. «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». Toloka AI Blog. [7]