---
title: "Direct Preference Optimization"
source: "https://systems-analysis.info/wiki/Direct_Preference_Optimization"
wiki: "systems-analysis.info/wiki"
article: "Direct_Preference_Optimization"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 87
wiki_created_at: 2026-09-06T21:54:48Z
wiki_modified_at: 2026-09-06T21:54:48Z
downloaded_at: 2026-09-07T22:17:19Z
---

# Direct Preference Optimization

**Direct Preference Optimization** (**DPO**) — это метод выравнивания [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) с человеческими предпочтениями, предложенный как более простая и стабильная альтернатива Обучению с подкреплением на основе отзывов людей ([RLHF](https://systems-analysis.info/wiki/RLHF "RLHF")). Метод был представлен в 2023 году группой исследователей из Стэнфордского университета под руководством Рафаэля Рафаилова<sup>[\[1\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-dpo_paper_2023-1)</sup>.

Ключевое отличие DPO заключается в том, что он напрямую оптимизирует языковую модель для соответствия человеческим предпочтениям, обходясь без явного обучения отдельной **модели вознаграждения** (reward model) и сложного этапа обучения с подкреплением (RL), что делает процесс настройки LLM значительно проще, быстрее и стабильнее<sup>[\[2\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-huggingface_dpo-2)</sup>.

## Предыстория: Ограничения RLHF

Стандартный метод **Reinforcement Learning from Human Feedback** (**RLHF**) состоит из трёх основных этапов:

1.  **Supervised [Fine-Tuning](https://systems-analysis.info/wiki/Fine-tuning "Fine-tuning") (SFT)**: Базовое дообучение модели на качественных примерах.
2.  **Обучение модели вознаграждения**: Создание отдельной модели, которая учится присваивать "рейтинг" ответам на основе парных сравнений, предоставленных людьми (например, ответ А лучше ответа Б).
3.  **Оптимизация политики с помощью RL**: Дообучение основной модели с использованием алгоритмов RL (например, PPO), чтобы она генерировала ответы, максимизирующие рейтинг от модели вознаграждения.

Несмотря на свою эффективность, RLHF является сложным, дорогим и нестабильным процессом. Он подвержен таким проблемам, как **reward hacking** (когда модель "обманывает" модель вознаграждения), и требует аккуратной настройки множества гиперпараметров<sup>[\[1\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-dpo_paper_2023-1)</sup>. DPO был разработан для преодоления этих ограничений.

## Принцип работы DPO

Метод DPO заменяет многоэтапный конвейер RLHF на один этап обучения, который можно рассматривать как дообучение с учителем.

1.  **Сбор данных предпочтений**. Как и в RLHF, собирается набор данных, где для каждого запроса \`x\` есть два ответа: предпочитаемый (\`y_w\`, winning) и отвергнутый (\`y_l\`, losing).
2.  **Прямая оптимизация**. Вместо обучения модели вознаграждения, DPO напрямую использует эти данные для обновления самой языковой модели. Цель оптимизации — увеличить вероятность генерации предпочитаемого ответа \`y_w\` и одновременно уменьшить вероятность генерации отвергнутого ответа \`y_l\`.

Математически это сводится к минимизации функции потерь, которая основана на логистической регрессии, применяемой к разнице логарифмических вероятностей ответов. Чтобы модель не «забывала» свои изначальные знания, DPO, как и RLHF, использует **эталонную модель** (*reference model*, обычно SFT-версию) для регуляризации, предотвращая слишком сильное отклонение от исходного распределения ответов<sup>[\[2\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-huggingface_dpo-2)</sup>.

## Преимущества по сравнению с RLHF

- **Простота и стабильность**: DPO устраняет необходимость в обучении отдельной модели вознаграждения и сложной настройке RL. Процесс становится более простым, предсказуемым и менее подверженным ошибкам<sup>[\[3\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-superannotate_dpo-3)</sup>.
- **Эффективность и скорость**: Исключение двух этапов значительно сокращает вычислительные затраты (GPU-часы) и время, необходимое для настройки модели. По некоторым оценкам, DPO на 50–60% экономичнее RLHF<sup>[\[4\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-arbisoft_dpo-4)</sup>.
- **Качество результатов**: Эксперименты показали, что DPO не уступает RLHF по качеству, а в некоторых задачах, например, в управлении тоном ответа, даже превосходит его. Модели, обученные с помощью DPO, демонстрируют лучшее соответствие человеческим предпочтениям<sup>[\[1\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-dpo_paper_2023-1)</sup>.
- **Отсутствие деградации базовых навыков**: DPO-настройка минимально влияет на общие способности модели (например, фактические знания или логику), в отличие от RLHF, который иногда может ухудшать базовые метрики<sup>[\[5\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-iclr_blog-5)</sup>.

## Применение и распространение

Благодаря своей эффективности и простоте, DPO быстро получил широкое распространение. Он был реализован в ведущих open-source библиотеках, таких как **Hugging Face TRL** и **OpenRLHF**.

Многие успешные открытые модели были дообучены с помощью DPO, включая **Zephyr-7B** и **TÜLU 2**. Эти модели показали высокую производительность на бенчмарках оценки качества ответов, подтвердив эффективность DPO для моделей большого масштаба<sup>[\[5\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-iclr_blog-5)</sup>.

Индустриальные лидеры также внедрили DPO в свои платформы. Например, Microsoft добавила поддержку DPO-дообучения в свой сервис Azure OpenAI, позволяя пользователям настраивать модели, включая GPT-4, на собственных данных предпочтений<sup>[\[6\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-azure_dpo-6)</sup>.

## Ограничения

Несмотря на преимущества, DPO наследует некоторые ограничения от самого подхода обучения на предпочтениях:

- **Чувствительность к данным**: Качество и разнообразие собранных данных предпочтений критически важны. Если данные однобоки (например, содержат только один язык или стиль), модель может переобучиться и ухудшить свою производительность в других областях<sup>[\[7\]](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_note-toloka_dpo-7)</sup>.
- **Статичность обучения**: Как и RLHF, DPO обучается на статичном наборе данных и не предполагает динамического взаимодействия с окружением. Этот метод хорошо подходит для одношагового согласования, но не для задач, требующих обучения через последовательные действия.

## См. также

- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [Agentic workflows](https://systems-analysis.info/wiki/Agentic_workflows "Agentic workflows")
- [AutoGPT](https://systems-analysis.info/wiki/AutoGPT "AutoGPT")
- [Automatic Prompt Engineer (APE)](https://systems-analysis.info/wiki/Automatic_Prompt_Engineer_(APE) "Automatic Prompt Engineer (APE)")

## Ссылки

- <a href="https://huggingface.co/docs/trl/main/en/dpo_trainer" class="external text" rel="nofollow">Документация DPO в библиотеке Hugging Face TRL</a>
- <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external text" rel="nofollow">Аналитический обзор RLHF и DPO на ICLR 2024 Blogposts</a>

## Литература

- Rafailov, R. et al. (2023). *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. <a href="https://arxiv.org/abs/2305.18290" class="external text" rel="nofollow">arXiv:2305.18290</a>.
- Hong, J.; Lee, N.; Thorne, J. (2024). *ORPO: Monolithic Preference Optimization without Reference Model*. <a href="https://arxiv.org/abs/2403.07691" class="external text" rel="nofollow">arXiv:2403.07691</a>.
- Sun, L. et al. (2025). *BPO: Revisiting Preference Modeling in Direct Preference Optimization*. <a href="https://arxiv.org/abs/2506.03557" class="external text" rel="nofollow">arXiv:2506.03557</a>.
- Yin, Y. et al. (2024). *Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment*. <a href="https://arxiv.org/abs/2405.20830" class="external text" rel="nofollow">arXiv:2405.20830</a>.
- Wu, Y. et al. (2024). *Self-Play Preference Optimization for Language Model Alignment*. <a href="https://arxiv.org/abs/2405.00675" class="external text" rel="nofollow">arXiv:2405.00675</a>.
- Li, P. et al. (2024). *ROPO: Robust Preference Optimization for Large Language Models*. <a href="https://arxiv.org/abs/2404.04102" class="external text" rel="nofollow">arXiv:2404.04102</a>.
- Tunstall, L. et al. (2023). *Zephyr: Direct Distillation of LM Alignment*. <a href="https://arxiv.org/abs/2310.16944" class="external text" rel="nofollow">arXiv:2310.16944</a>.
- Wu, F. et al. (2023). *Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization*. <a href="https://arxiv.org/abs/2311.12908" class="external text" rel="nofollow">arXiv:2311.12908</a>.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. <a href="https://arxiv.org/abs/2309.00267" class="external text" rel="nofollow">arXiv:2309.00267</a>.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). *Direct Preference Optimization (v3): Enhanced Experiments and Analysis*. <a href="https://arxiv.org/pdf/2305.18290v3" class="external text" rel="nofollow">arXiv:2305.18290v3</a>.

## Примечания

1.  <span id="cite_note-dpo_paper_2023-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-dpo_paper_2023_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-dpo_paper_2023_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-dpo_paper_2023_1-2)</sup> Rafailov, R., et al. «Direct Preference Optimization: Your Language Model is Secretly a Reward Model». *arXiv:2305.18290*. <a href="https://arxiv.org/abs/2305.18290" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_dpo-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-huggingface_dpo_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-huggingface_dpo_2-1)</sup> «Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)». *Hugging Face Blog*. <a href="https://huggingface.co/blog/ariG23498/rlhf-to-dpo" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-superannotate_dpo-3">[↑](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-superannotate_dpo_3-0) «What is direct preference optimization (DPO)?». *SuperAnnotate Blog*. <a href="https://www.superannotate.com/blog/direct-preference-optimization-dpo" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-arbisoft_dpo-4">[↑](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-arbisoft_dpo_4-0) «RLHF vs DPO: A Closer Look into the Process and Methodology». *Arbisoft Blog*. <a href="https://arbisoft.com/blogs/rlhf-vs-dpo-a-closer-look-into-the-process-and-methodology" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-iclr_blog-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-iclr_blog_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-iclr_blog_5-1)</sup> «RLHF without RL - Direct Preference Optimization». *ICLR Blogposts 2024*. <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-azure_dpo-6">[↑](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-azure_dpo_6-0) «Direct preference optimization». *Azure OpenAI \| Microsoft Learn*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-direct-preference-optimization" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-toloka_dpo-7">[↑](https://systems-analysis.info/wiki/Direct_Preference_Optimization#cite_ref-toloka_dpo_7-0) «Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF». *Toloka AI Blog*. <a href="https://toloka.ai/blog/direct-preference-optimization/" class="external autonumber" rel="nofollow">[7]</a></span>
