---
title: "Encoder-only models (Encoder-Only-Modelle)"
source: "https://systems-analysis.info/int/Encoder-only_models_(Encoder-Only-Modelle)"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_(Encoder-Only-Modelle)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1912
wiki_created_at: 2026-09-06T22:55:56Z
wiki_modified_at: 2026-09-06T22:55:56Z
downloaded_at: 2026-09-07T22:48:28Z
---

# Encoder-only models (Encoder-Only-Modelle)

**Encoder-Only-Modelle** (engl. *Encoder-Only Models*) sind eine Klasse von Architekturen großer Sprachmodelle (LLM), die ausschließlich auf dem **Encoder**-Teil der **Transformer**-Architektur basieren. Im Gegensatz zu Modellen, die einen Decoder oder eine vollständige Encoder-Decoder-Architektur verwenden, sind diese Modelle auf Aufgaben des **Verstehens natürlicher Sprache (Natural Language Understanding, NLU)** spezialisiert.

Das Flaggschiff-Modell und der Pionier dieses Ansatzes ist **BERT** (Bidirectional Encoder Representations from Transformers), das 2018 von Google entwickelt wurde.

## Konzept und Architektur

Die Grundidee von Encoder-Only-Modellen besteht darin, tiefe, **kontextualisierte Repräsentationen** (Embeddings) für jedes Token in der Eingabesequenz zu erstellen. Dank des **Self-Attention**-Mechanismus im Transformer kann jedes Token alle anderen Tokens in der Sequenz „sehen“ und mit ihnen interagieren, wodurch das Modell einen reichen Kontext erfassen kann.

Ein Schlüsselmerkmal ist die **Bidirektionalität**: Die Repräsentation jedes Tokens wird gleichzeitig auf der Grundlage des linken und des rechten Kontexts gebildet. Dies unterscheidet sie grundlegend von autoregressiven Decoder-Only-Modellen (wie GPT), die von Natur aus unidirektional sind.

Architektonisch besteht das Modell aus einem Stapel von $N$ identischen Encoder-Schichten. Jede Schicht besteht aus zwei Haupt-Subschichten:

1.  **Multi-Head Self-Attention:** Berechnet eine kontextualisierte Repräsentation für jedes Token.
2.  **Feed-Forward-Netzwerk:** Wendet eine nichtlineare Transformation auf jede Token-Repräsentation an.

Am Ausgang erzeugt das Modell eine Sequenz von Vektoren, die dieselbe Länge wie die Eingabesequenz hat, wobei jeder Vektor eine reichhaltige Repräsentation des entsprechenden Eingabe-Tokens darstellt.

## Pre-Training-Aufgaben

Um das Modell zu trainieren, Sprache in einem bidirektionalen Kontext zu verstehen, werden spezielle selbstüberwachte Pre-Training-Aufgaben verwendet:

### Masked Language Modeling (MLM)

Dies ist die zentrale und wichtigste Aufgabe für Encoder-Only-Modelle, die erstmals in BERT vorgestellt wurde.

- **Funktionsprinzip:** Ein kleiner Prozentsatz der Tokens in der Eingabesequenz (typischerweise 15 %) wird zufällig ausgeblendet (maskiert). Die Aufgabe des Modells besteht darin, die ursprünglichen Werte dieser maskierten Tokens unter Verwendung des sie umgebenden bidirektionalen Kontexts vorherzusagen.
- **Ziel:** Diese Aufgabe zwingt das Modell, tiefe semantische und syntaktische Beziehungen zwischen Wörtern zu lernen.

### Next Sentence Prediction (NSP)

Diese Aufgabe (ebenfalls aus dem ursprünglichen BERT) wurde entwickelt, um dem Modell beizubringen, die Beziehungen zwischen Sätzen zu verstehen.

- **Funktionsprinzip:** Dem Modell wird ein Satzpaar vorgelegt, und es muss bestimmen, ob der zweite Satz eine logische Fortsetzung des ersten im Originaltext ist.
- **Status:** Spätere Forschungen (z. B. im RoBERTa-Modell) zeigten, dass NSP weniger effektiv ist als MLM und oft durch andere Aufgaben ersetzt oder ganz weggelassen wird.

## Anwendung

Encoder-Only-Modelle sind nicht für die freie Textgenerierung konzipiert, da ihnen ein autoregressiver Decoder fehlt. Ihre Stärke liegt in der Analyse und dem Verständnis von Text. Die Ausgabe-Vektorrepräsentationen des Modells werden zur Lösung eines breiten Spektrums von NLU-Aufgaben verwendet:

- **Textklassifikation:** Für Aufgaben wie die Sentimentanalyse oder die Themenbestimmung wird die Repräsentation eines speziellen `[CLS]`-Tokens verwendet, das an den Anfang jeder Sequenz gestellt wird. Sein finaler Vektor aggregiert Informationen über die gesamte Sequenz.
- **Token-Klassifikation:** Für Aufgaben wie die Erkennung benannter Entitäten (Named Entity Recognition, NER) oder das Part-of-Speech-Tagging (POS-Tagging) werden die Vektorrepräsentationen jedes einzelnen Tokens verwendet.
- **Question Answering:** Bei Aufgaben, bei denen die Antwort ein Auszug aus einem gegebenen Text ist (extractive QA), wird das Modell darauf trainiert, die Start- und End-Tokens der Antwort vorherzusagen.
- **Embedding-Extraktion:** Encoder-Modelle werden oft als universelle Text-Encoder verwendet, um hochwertige Embeddings für Sätze oder Dokumente zu erhalten, die dann in Suchmaschinen oder für Aufgaben der semantischen Ähnlichkeit eingesetzt werden können.

## Wichtige Modelle und ihre Entwicklung

- **BERT** (2018): Der Pionier dieser Architektur, der auf zahlreichen NLP-Benchmarks neue Rekorde aufstellte.
- **RoBERTa** (2019): „Ein robust optimiertes BERT“. Zeigte, dass die Leistung von BERT durch längeres Training auf mehr Daten und den Verzicht auf die NSP-Aufgabe erheblich verbessert werden kann.
- **ALBERT** (2019): „A Lite BERT“. Ein Modell mit einer deutlich geringeren Anzahl von Parametern dank Techniken wie der Faktorisierung von Embeddings und der Parameter-Freigabe zwischen den Schichten.
- **DistilBERT** (2019): Eine kleinere Version von BERT, die durch Wissensdestillation erstellt wurde. Sie ist schneller und leichter, behält aber den größten Teil der Leistung des Originals bei.
- **ELECTRA** (2020): Führte eine effizientere Pre-Training-Aufgabe ein – die **Replaced Token Detection**, bei der das Modell lernt, zwischen originalen Tokens und „gefälschten“ Tokens zu unterscheiden, die von einem kleinen Generator-Modell erzeugt werden.
- **DeBERTa** (2020): Führte einen „disentangled attention“-Mechanismus ein, der Inhalt und relative Positionen der Tokens getrennt voneinander kodiert.

## Siehe auch

- BERT
