---
title: "Direct Preference Optimization (DPO) (HE)"
source: "https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)"
wiki: "systems-analysis.info/int"
article: "Direct_Preference_Optimization_(DPO)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1703
wiki_created_at: 2026-09-06T22:52:44Z
wiki_modified_at: 2026-09-06T22:52:44Z
downloaded_at: 2026-09-07T22:47:20Z
---

# Direct Preference Optimization (DPO) (HE)

**Direct Preference Optimization** (**DPO**) — היא שיטה ליישור מודלי שפה גדולים (LLM) עם העדפות אנושיות, שהוצגה כאלטרנטיבה פשוטה ויציבה יותר ל-Reinforcement Learning from Human Feedback (RLHF). השיטה הוצגה בשנת 2023 על ידי קבוצת חוקרים מאוניברסיטת סטנפורד בהנהגת רפאל רפאילוב<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-dpo_paper_2023-1)</sup>.

ההבדל המרכזי של DPO הוא שהוא מבצע אופטימיזציה ישירה של מודל השפה כך שיתאים להעדפות אנושיות, תוך דילוג על אימון מפורש של **מודל תגמול** נפרד (reward model) ועל שלב ה-Reinforcement Learning (RL) המורכב, מה שהופך את תהליך כוונון ה-LLM לפשוט, מהיר ויציב יותר באופן משמעותי<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-huggingface_dpo-2)</sup>.

## מקדימות: מגבלות RLHF

שיטת **Reinforcement Learning from Human Feedback** (**RLHF**) הסטנדרטית מורכבת משלושה שלבים עיקריים:

1.  **Supervised Fine-Tuning (SFT)**: כוונון בסיסי של המודל על דוגמאות איכותיות.
2.  **אימון מודל התגמול**: יצירת מודל נפרד הלומד להקצות "דירוג" לתשובות על בסיס השוואות זוגיות שסיפקו בני אדם (למשל, תשובה א' טובה יותר מתשובה ב').
3.  **אופטימיזציה של המדיניות באמצעות RL**: כוונון המודל הראשי תוך שימוש באלגוריתמי RL (למשל, PPO), כדי שיניב תשובות המקסימות את הדירוג ממודל התגמול.

למרות יעילותה, RLHF הינה תהליך מורכב, יקר ולא יציב. היא חשופה לבעיות כגון **reward hacking** (כאשר המודל "מרמה" את מודל התגמול), ומצריכה כוונון זהיר של היפרפרמטרים רבים<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-dpo_paper_2023-1)</sup>. DPO פותחה כדי להתגבר על מגבלות אלו.

## עיקרון פעולת DPO

שיטת DPO מחליפה את צינור RLHF הרב-שלבי בשלב אימון יחיד, שניתן לראות בו כ-fine-tuning מונחה.

1.  **איסוף נתוני העדפות**. כמו ב-RLHF, נאסף dataset שבו לכל שאילתה \`x\` יש שתי תשובות: המועדפת (\`y_w\`, winning) והנדחית (\`y_l\`, losing).
2.  **אופטימיזציה ישירה**. במקום לאמן מודל תגמול, DPO משתמש ישירות בנתונים אלו לעדכון מודל השפה עצמו. מטרת האופטימיזציה היא להגדיל את ההסתברות ליצירת התשובה המועדפת \`y_w\` ובמקביל להקטין את ההסתברות ליצירת התשובה הנדחית \`y_l\`.

מבחינה מתמטית, הדבר מתמצה במינימיזציה של פונקציית הפסד המבוססת על רגרסיה לוגיסטית המיושמת על ההפרש בין לוגריתמי ההסתברויות של התשובות. כדי שהמודל לא "ישכח" את ידיעותיו המקוריות, DPO, כמו RLHF, משתמש ב**מודל ייחוס** (*reference model*, בדרך כלל גרסת ה-SFT) לצורך רגולריזציה, כדי למנוע סטייה חזקה מדי מהתפלגות התשובות המקורית<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-huggingface_dpo-2)</sup>.

## יתרונות לעומת RLHF

- **פשטות ויציבות**: DPO מסיר את הצורך באימון מודל תגמול נפרד ובכוונון RL מורכב. התהליך הופך פשוט יותר, צפוי יותר ופחות נוטה לשגיאות<sup>[\[3\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-superannotate_dpo-3)</sup>.
- **יעילות ומהירות**: השמטת שני שלבים מקצרת באופן משמעותי את עלויות החישוב (שעות GPU) ואת הזמן הנדרש לכוונון המודל. לפי הערכות מסוימות, DPO חסכוני ב-50–60% לעומת RLHF<sup>[\[4\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-arbisoft_dpo-4)</sup>.
- **איכות תוצאות**: ניסויים הראו ש-DPO אינו נופל מ-RLHF מבחינת איכות, ובחלק מהמשימות, כגון שליטה בטון התשובה, אף עולה עליו. מודלים שאומנו באמצעות DPO מפגינים התאמה טובה יותר להעדפות אנושיות<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-dpo_paper_2023-1)</sup>.
- **היעדר ניוון מיומנויות בסיס**: כוונון DPO משפיע במינימום על היכולות הכלליות של המודל (למשל, ידע עובדתי או הגיון), בניגוד ל-RLHF, שלעיתים עלול לפגוע במדדי הבסיס<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-iclr_blog-5)</sup>.

## יישום והפצה

בזכות יעילותו ופשטותו, DPO זכה במהירות להתפשטות רחבה. הוא מומש בספריות open-source מובילות כגון **Hugging Face TRL** ו-**OpenRLHF**.

מודלים פתוחים מצליחים רבים עברו fine-tuning באמצעות DPO, כולל **Zephyr-7B** ו-**TÜLU 2**. מודלים אלו הציגו ביצועים גבוהים על benchmarks להערכת איכות תשובות, ואישרו את יעילות DPO עבור מודלים בקנה מידה גדול<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-iclr_blog-5)</sup>.

מובילי התעשייה גם שילבו את DPO בפלטפורמות שלהם. לדוגמה, Microsoft הוסיפה תמיכה ב-fine-tuning מסוג DPO לשירות Azure OpenAI שלה, המאפשרת למשתמשים לכוונן מודלים, כולל GPT-4, על נתוני העדפות משלהם<sup>[\[6\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-azure_dpo-6)</sup>.

## מגבלות

למרות יתרונותיו, DPO יורש מגבלות מסוימות מגישת האימון על העדפות עצמה:

- **רגישות לנתונים**: איכות המגוון של נתוני ההעדפות שנאספו הם קריטיים. אם הנתונים חד-צדדיים (למשל, מכילים שפה או סגנון אחד בלבד), המודל עלול להתאמן יתר על המידה ולפגוע בביצועיו בתחומים אחרים<sup>[\[7\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_note-toloka_dpo-7)</sup>.
- **סטטיות האימון**: כמו RLHF, DPO מאומן על dataset סטטי ואינו מניח אינטראקציה דינמית עם הסביבה. שיטה זו מתאימה היטב ליישור חד-שלבי, אך לא למשימות הדורשות למידה דרך פעולות רצופות.

## קישורים

- תיעוד DPO בספריית Hugging Face TRL
- סקירה אנליטית של RLHF ו-DPO ב-ICLR 2024 Blogposts

## ספרות

- Rafailov, R. et al. (2023). *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. arXiv:2305.18290.
- Hong, J.; Lee, N.; Thorne, J. (2024). *ORPO: Monolithic Preference Optimization without Reference Model*. arXiv:2403.07691.
- Sun, L. et al. (2025). *BPO: Revisiting Preference Modeling in Direct Preference Optimization*. arXiv:2506.03557.
- Yin, Y. et al. (2024). *Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment*. arXiv:2405.20830.
- Wu, Y. et al. (2024). *Self-Play Preference Optimization for Language Model Alignment*. arXiv:2405.00675.
- Li, P. et al. (2024). *ROPO: Robust Preference Optimization for Large Language Models*. arXiv:2404.04102.
- Tunstall, L. et al. (2023). *Zephyr: Direct Distillation of LM Alignment*. arXiv:2310.16944.
- Wu, F. et al. (2023). *Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization*. arXiv:2311.12908.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. arXiv:2309.00267.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). *Direct Preference Optimization (v3): Enhanced Experiments and Analysis*. arXiv:2305.18290v3.

## הערות

1.  <span id="cite_note-dpo_paper_2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-dpo_paper_2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-dpo_paper_2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-dpo_paper_2023_1-2)</sup> Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». *arXiv:2305.18290*. <a href="https://arxiv.org/abs/2305.18290" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_dpo-2">↑ <sup>[2.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-huggingface_dpo_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-huggingface_dpo_2-1)</sup> «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». *Hugging Face Blog*. <a href="https://huggingface.co/blog/ariG23498/rlhf-to-dpo" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-superannotate_dpo-3">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-superannotate_dpo_3-0) «What is direct preference optimization (DPO)?». *SuperAnnotate Blog*. <a href="https://www.superannotate.com/blog/direct-preference-optimization-dpo" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-arbisoft_dpo-4">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-arbisoft_dpo_4-0) «RLHF vs DPO: A Closer Look into the Process and Methodology». *Arbisoft Blog*. <a href="https://arbisoft.com/blogs/rlhf-vs-dpo-a-closer-look-into-the-process-and-methodology" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-iclr_blog-5">↑ <sup>[5.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-iclr_blog_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-iclr_blog_5-1)</sup> «RLHF without RL - Direct Preference Optimization». *ICLR Blogposts 2024*. <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-azure_dpo-6">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-azure_dpo_6-0) «Direct preference optimization». *Azure OpenAI \| Microsoft Learn*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-direct-preference-optimization" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-toloka_dpo-7">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(HE)#cite_ref-toloka_dpo_7-0) «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». *Toloka AI Blog*. <a href="https://toloka.ai/blog/direct-preference-optimization/" class="external autonumber" rel="nofollow">[7]</a></span>
