---
title: "Direct Preference Optimization (DPO) (DE)"
source: "https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)"
wiki: "systems-analysis.info/int"
article: "Direct_Preference_Optimization_(DPO)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1698
wiki_created_at: 2026-09-06T22:52:39Z
wiki_modified_at: 2026-09-06T22:52:39Z
downloaded_at: 2026-09-07T22:47:18Z
---

# Direct Preference Optimization (DPO) (DE)

**Direct Preference Optimization** (**DPO**) ist eine Methode zur Ausrichtung [großer Sprachmodelle](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLMs) an menschlichen Präferenzen, die als einfachere und stabilere Alternative zum bestärkenden Lernen aus menschlichem Feedback (RLHF) vorgeschlagen wurde. Die Methode wurde 2023 von einer Gruppe von Forschern der Stanford University unter der Leitung von Rafael Rafailov vorgestellt<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-dpo_paper_2023-1)</sup>.

Der Hauptunterschied von DPO besteht darin, dass es das Sprachmodell direkt optimiert, um menschlichen Präferenzen zu entsprechen. Dabei wird auf das explizite Training eines separaten **Belohnungsmodells** (Reward Model) und die komplexe Phase des bestärkenden Lernens (RL) verzichtet, was den Feinabstimmungsprozess von LLMs erheblich einfacher, schneller und stabiler macht<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-huggingface_dpo-2)</sup>.

## Hintergrund: Einschränkungen von RLHF

Die Standardmethode des **Reinforcement Learning from Human Feedback** (**RLHF**) besteht aus drei Hauptphasen:

1.  **Supervised Fine-Tuning (SFT)**: Grundlegende Feinabstimmung des Modells anhand hochwertiger Beispiele.
2.  **Training des Belohnungsmodells**: Erstellung eines separaten Modells, das lernt, Antworten auf der Grundlage von paarweisen Vergleichen durch Menschen eine „Bewertung“ zuzuweisen (z. B. ist Antwort A besser als Antwort B).
3.  **Optimierung der Policy mittels RL**: Feinabstimmung des Hauptmodells unter Verwendung von RL-Algorithmen (z. B. PPO), um Antworten zu generieren, die die Bewertung des Belohnungsmodells maximieren.

Trotz seiner Effektivität ist RLHF ein komplexer, kostspieliger und instabiler Prozess. Er ist anfällig für Probleme wie **Reward Hacking** (wenn das Modell das Belohnungsmodell „austrickst“) und erfordert eine sorgfältige Abstimmung zahlreicher Hyperparameter<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-dpo_paper_2023-1)</sup>. DPO wurde entwickelt, um diese Einschränkungen zu überwinden.

## Funktionsweise von DPO

Die DPO-Methode ersetzt die mehrstufige RLHF-Pipeline durch eine einzige Trainingsphase, die als überwachtes Feinabstimmung betrachtet werden kann.

1.  **Sammlung von Präferenzdaten**. Wie bei RLHF wird ein Datensatz gesammelt, in dem für jede Anfrage \`x\` zwei Antworten vorliegen: eine bevorzugte (\`y_w\`, winning) und eine abgelehnte (\`y_l\`, losing).
2.  **Direkte Optimierung**. Anstatt ein Belohnungsmodell zu trainieren, verwendet DPO diese Daten direkt, um das Sprachmodell selbst zu aktualisieren. Das Ziel der Optimierung besteht darin, die Wahrscheinlichkeit der Generierung der bevorzugten Antwort \`y_w\` zu erhöhen und gleichzeitig die Wahrscheinlichkeit der Generierung der abgelehnten Antwort \`y_l\` zu verringern.

Mathematisch läuft dies auf die Minimierung einer Verlustfunktion hinaus, die auf einer logistischen Regression basiert, die auf die Differenz der logarithmischen Wahrscheinlichkeiten der Antworten angewendet wird. Damit das Modell sein ursprüngliches Wissen nicht „vergisst“, verwendet DPO, genau wie RLHF, ein **Referenzmodell** (*reference model*, üblicherweise die SFT-Version) zur Regularisierung, um eine zu starke Abweichung von der ursprünglichen Antwortverteilung zu verhindern<sup>[\[2\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-huggingface_dpo-2)</sup>.

## Vorteile im Vergleich zu RLHF

- **Einfachheit und Stabilität**: DPO eliminiert die Notwendigkeit, ein separates Belohnungsmodell zu trainieren und eine komplexe RL-Konfiguration vorzunehmen. Der Prozess wird einfacher, vorhersehbarer und weniger fehleranfällig<sup>[\[3\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-superannotate_dpo-3)</sup>.
- **Effizienz und Geschwindigkeit**: Der Wegfall von zwei Phasen reduziert den Rechenaufwand (GPU-Stunden) und die für die Modellabstimmung erforderliche Zeit erheblich. Nach einigen Schätzungen ist DPO 50–60 % kostengünstiger als RLHF<sup>[\[4\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-arbisoft_dpo-4)</sup>.
- **Qualität der Ergebnisse**: Experimente haben gezeigt, dass DPO qualitativ nicht hinter RLHF zurückbleibt und es in einigen Aufgaben, wie der Steuerung des Antworttons, sogar übertrifft. Mit DPO trainierte Modelle zeigen eine bessere Übereinstimmung mit menschlichen Präferenzen<sup>[\[1\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-dpo_paper_2023-1)</sup>.
- **Keine Verschlechterung der Grundfähigkeiten**: Die DPO-Abstimmung beeinflusst die allgemeinen Fähigkeiten des Modells (z. B. Faktenwissen oder logisches Denken) nur minimal, im Gegensatz zu RLHF, das manchmal grundlegende Metriken verschlechtern kann<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-iclr_blog-5)</sup>.

## Anwendung und Verbreitung

Dank seiner Effizienz und Einfachheit hat sich DPO schnell verbreitet. Es wurde in führenden Open-Source-Bibliotheken wie **Hugging Face TRL** und **OpenRLHF** implementiert.

Viele erfolgreiche Open-Source-Modelle wurden mit DPO feingetunt, darunter **Zephyr-7B** und **TÜLU 2**. Diese Modelle zeigten eine hohe Leistung in Benchmarks zur Bewertung der Antwortqualität und bestätigten die Wirksamkeit von DPO für große Modelle<sup>[\[5\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-iclr_blog-5)</sup>.

Auch Branchenführer haben DPO in ihre Plattformen integriert. Microsoft hat beispielsweise die Unterstützung für das DPO-Fine-Tuning in seinen Azure OpenAI Service aufgenommen, sodass Benutzer Modelle, einschließlich GPT-4, mit ihren eigenen Präferenzdaten anpassen können<sup>[\[6\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-azure_dpo-6)</sup>.

## Einschränkungen

Trotz seiner Vorteile erbt DPO einige Einschränkungen vom Ansatz des Lernens aus Präferenzen selbst:

- **Datenabhängigkeit**: Die Qualität und Vielfalt der gesammelten Präferenzdaten sind von entscheidender Bedeutung. Wenn die Daten einseitig sind (z. B. nur eine Sprache oder einen Stil enthalten), kann das Modell überanpassen und seine Leistung in anderen Bereichen verschlechtern<sup>[\[7\]](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_note-toloka_dpo-7)</sup>.
- **Statisches Training**: Wie RLHF wird DPO auf einem statischen Datensatz trainiert und beinhaltet keine dynamische Interaktion mit einer Umgebung. Diese Methode eignet sich gut für eine einmalige Ausrichtung, jedoch nicht für Aufgaben, die ein Lernen durch sequentielle Aktionen erfordern.

## Weblinks

- <a href="https://huggingface.co/docs/trl/main/en/dpo_trainer" class="external text" rel="nofollow">Dokumentation zum DPO-Trainer in der Hugging Face TRL-Bibliothek</a>
- <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external text" rel="nofollow">Analytischer Überblick über RLHF und DPO bei ICLR 2024 Blogposts</a>

## Literatur

- Rafailov, R. et al. (2023). *Direct Preference Optimization: Your Language Model is Secretly a Reward Model*. <a href="https://arxiv.org/abs/2305.18290" class="external text" rel="nofollow">arXiv:2305.18290</a>.
- Hong, J.; Lee, N.; Thorne, J. (2024). *ORPO: Monolithic Preference Optimization without Reference Model*. <a href="https://arxiv.org/abs/2403.07691" class="external text" rel="nofollow">arXiv:2403.07691</a>.
- Sun, L. et al. (2025). *BPO: Revisiting Preference Modeling in Direct Preference Optimization*. <a href="https://arxiv.org/abs/2506.03557" class="external text" rel="nofollow">arXiv:2506.03557</a>.
- Yin, Y. et al. (2024). *Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment*. <a href="https://arxiv.org/abs/2405.20830" class="external text" rel="nofollow">arXiv:2405.20830</a>.
- Wu, Y. et al. (2024). *Self-Play Preference Optimization for Language Model Alignment*. <a href="https://arxiv.org/abs/2405.00675" class="external text" rel="nofollow">arXiv:2405.00675</a>.
- Li, P. et al. (2024). *ROPO: Robust Preference Optimization for Large Language Models*. <a href="https://arxiv.org/abs/2404.04102" class="external text" rel="nofollow">arXiv:2404.04102</a>.
- Tunstall, L. et al. (2023). *Zephyr: Direct Distillation of LM Alignment*. <a href="https://arxiv.org/abs/2310.16944" class="external text" rel="nofollow">arXiv:2310.16944</a>.
- Wu, F. et al. (2023). *Diffusion-DPO: Diffusion Model Alignment Using Direct Preference Optimization*. <a href="https://arxiv.org/abs/2311.12908" class="external text" rel="nofollow">arXiv:2311.12908</a>.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. <a href="https://arxiv.org/abs/2309.00267" class="external text" rel="nofollow">arXiv:2309.00267</a>.
- Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C. D.; Finn, C. (2024). *Direct Preference Optimization (v3): Enhanced Experiments and Analysis*. <a href="https://arxiv.org/pdf/2305.18290v3" class="external text" rel="nofollow">arXiv:2305.18290v3</a>.

## Einzelnachweise

1.  <span id="cite_note-dpo_paper_2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-dpo_paper_2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-dpo_paper_2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-dpo_paper_2023_1-2)</sup> Rafailov, R., et al. „Direct Preference Optimization: Your Language Model is Secretly a Reward Model“. *arXiv:2305.18290*. <a href="https://arxiv.org/abs/2305.18290" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface_dpo-2">↑ <sup>[2.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-huggingface_dpo_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-huggingface_dpo_2-1)</sup> „Simplifying Alignment: From RLHF to Direct Preference Optimization (DPO)“. *Hugging Face Blog*. <a href="https://huggingface.co/blog/ariG23498/rlhf-to-dpo" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-superannotate_dpo-3">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-superannotate_dpo_3-0) „What is direct preference optimization (DPO)?“. *SuperAnnotate Blog*. <a href="https://www.superannotate.com/blog/direct-preference-optimization-dpo" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-arbisoft_dpo-4">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-arbisoft_dpo_4-0) „RLHF vs DPO: A Closer Look into the Process and Methodology“. *Arbisoft Blog*. <a href="https://arbisoft.com/blogs/rlhf-vs-dpo-a-closer-look-into-the-process-and-methodology" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-iclr_blog-5">↑ <sup>[5.0](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-iclr_blog_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-iclr_blog_5-1)</sup> „RLHF without RL - Direct Preference Optimization“. *ICLR Blogposts 2024*. <a href="https://iclr-blogposts.github.io/2024/blog/rlhf-without-rl/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-azure_dpo-6">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-azure_dpo_6-0) „Direct preference optimization“. *Azure OpenAI \| Microsoft Learn*. <a href="https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-direct-preference-optimization" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-toloka_dpo-7">[↑](https://systems-analysis.info/int/Direct_Preference_Optimization_(DPO)_(DE)#cite_ref-toloka_dpo_7-0) „Direct Preference Optimization (DPO): A Lightweight Counterpart to RLHF“. *Toloka AI Blog*. <a href="https://toloka.ai/blog/direct-preference-optimization/" class="external autonumber" rel="nofollow">[7]</a></span>
