---
title: "Encoder-only models (HU)"
source: "https://systems-analysis.info/int/Encoder-only_models_(HU)"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1913
wiki_created_at: 2026-09-06T22:55:56Z
wiki_modified_at: 2026-09-06T22:55:56Z
downloaded_at: 2026-09-07T22:48:28Z
---

# Encoder-only models (HU)

**Csak enkóderes modellek** (angol. Encoder-Only Models) — a nagy nyelvi modellek (LLM) architektúráinak egy osztálya, amely kizárólag a **Transformer** architektúra **kódoló** részére (enkóderre) épül. A dekódert vagy a teljes enkóder-dekóder architektúrát alkalmazó modellekkel ellentétben ezek a modellek a **természetes nyelv megértésének (Natural Language Understanding, NLU)** feladataira specializálódnak.

Ennek a megközelítésnek a zászlóshajója és úttörője a **BERT** (Bidirectional Encoder Representations from Transformers), amelyet a Google fejlesztett ki 2018-ban.

## Koncepció és architektúra

A csak enkóderes modellek alapgondolata az, hogy mély, **kontextualizált reprezentációkat** (embedding-eket) hozzanak létre a bemeneti szekvencia minden egyes token-jéhez. A Transformer **önfigyelem (self-attention)** mechanizmusának köszönhetően minden token „láthatja" és kölcsönhatásba léphet a szekvencia összes többi token-jével, ami lehetővé teszi a modell számára, hogy gazdag kontextust ragadjon meg.

A kulcsfontosságú jellemző a **kétirányúság**: minden token reprezentációja egyszerre a bal és a jobb oldali kontextus alapján alakul ki. Ez alapvetően megkülönbözteti őket az autoregresszív csak-dekóderes modellektől (mint a GPT), amelyek természetüknél fogva egyirányúak.

Architekturálisan a modell $N$ azonos enkóderrétegből álló veremként képzelhető el. Minden réteg két fő alrétegből áll:

1.  **Többfejű önfigyelem (Multi-Head Self-Attention):** Kontextualizált reprezentációt számít minden token számára.
2.  **Teljesen kapcsolt neurális hálózat (Feed-Forward Network):** Nemlineáris transzformációt alkalmaz minden token reprezentációjára.

Kimenetként a modell egy vektorsorozatot állít elő, amelynek hossza megegyezik a bemeneti szekvencia hosszával, ahol minden vektor a megfelelő bemeneti token gazdag reprezentációja.

## Az előtanítás feladatai

Annak érdekében, hogy a modell megtanulja kétirányú kontextusban megérteni a nyelvet, speciális, önfelügyelt előtanítási feladatokat alkalmaznak:

### Masked Language Modeling - Maszkolt nyelvi modellezés (Masked Language Modeling, MLM)

Ez a csak enkóderes modellek legfőbb és legfontosabb feladata, amelyet először a BERT mutatott be.

- **Működési elv:** A bemeneti szekvenciából véletlenszerűen elrejtenek (maszkolnak) egy kis százaléknyi token-t (általában 15%-ot). A modell feladata, hogy megjósolja ezeknek a maszkolt token-eknek az eredeti értékeit, felhasználva a körülöttük lévő kétirányú kontextust.
- **Cél:** Ez a feladat arra kényszeríti a modellt, hogy mély szemantikai és szintaktikai kapcsolatokat tanuljon meg a szavak között.

### Next Sentence Prediction - A következő mondat előrejelzése (Next Sentence Prediction, NSP)

Ezt a feladatot (szintén az eredeti BERT-ből) azért fejlesztették ki, hogy megtanítsák a modellt a mondatok közötti összefüggések megértésére.

- **Működési elv:** A modell kap egy mondatpárt, és meg kell határoznia, hogy a második mondat logikusan következik-e az elsőből az eredeti szövegben.
- **Státusz:** Későbbi kutatások (például a RoBERTa modellben) kimutatták, hogy az NSP kevésbé hatékony, mint az MLM, ezért gyakran más feladatokkal helyettesítik, vagy teljesen elhagyják.

## Alkalmazás

A csak enkóderes modellek nem alkalmasak szabad formájú szöveggenerálásra, mivel nem rendelkeznek autoregresszív dekóderrel. Erejük a szöveg elemzésében és megértésében rejlik. A modell kimeneti vektorreprezentációit az NLU-feladatok széles körének megoldására használják:

- **Szövegosztályozás:** Az olyan feladatoknál, mint a hangulatelemzés vagy a témameghatározás, a \`\[CLS\]\` speciális token reprezentációját használják, amelyet minden szekvencia elejéhez adnak hozzá. Végső vektora összesíti a teljes szekvencia információját.
- **Token-szintű osztályozás:** Az olyan feladatoknál, mint a névfelismerés (NER) vagy a szófaji jelölés (POS-tagging), az egyes token-ek vektorreprezentációit használják.
- **Kérdés-megválaszolás (Question Answering):** Azoknál a feladatoknál, ahol a válasz az adott szöveg egy töredéke (extractive QA), a modell megtanulja megjósolni a válasz kezdő és záró token-jét.
- **Embedding-ek előállítása:** Az enkóderes modellek gyakran univerzális szövegkódolóként szolgálnak, hogy kiváló minőségű mondatvektoros vagy dokumentumvektoros embedding-eket állítsanak elő, amelyek aztán keresőmotorokban vagy szemantikai hasonlósági feladatokban használhatók fel.

## Főbb modellek és fejlődésük

- **BERT** (2018): Az architektúra úttörője, amely új rekordokat állított fel számos NLP-benchmark területén.
- **RoBERTa** (2019): „Robustly Optimized BERT". Kimutatta, hogy a BERT teljesítménye jelentősen javítható hosszabb ideig tartó, nagyobb adatmennyiségen végzett tanítással és az NSP-feladat elhagyásával.
- **ALBERT** (2019): „A Lite BERT". Jóval kevesebb paraméterrel rendelkező modell, amely az embedding-faktorizáció és a rétegek közötti paraméterosztás technikáit alkalmazza.
- **DistilBERT** (2019): A BERT tudásdesztillációval létrehozott kisebb változata, amely gyorsabb és könnyebb, de megőrzi az eredeti teljesítményének nagy részét.
- **ELECTRA** (2020): Hatékonyabb előtanítási feladatot vezetett be — a **replaced token detection**-t, amelynek során a modell megtanulja megkülönböztetni az eredeti token-eket a kis generátormodell által előállított „hamis" token-ektől.
- **DeBERTa** (2020): Bevezette a „szétválasztott figyelem" (disentangled attention) mechanizmusát, amely a token-ek tartalmát és relatív pozícióit külön kódolja.

## Lásd még

- BERT
