Encoder-only models (HU)
Csak enkóderes modellek (angol. Encoder-Only Models) — a nagy nyelvi modellek (LLM) architektúráinak egy osztálya, amely kizárólag a Transformer architektúra kódoló részére (enkóderre) épül. A dekódert vagy a teljes enkóder-dekóder architektúrát alkalmazó modellekkel ellentétben ezek a modellek a természetes nyelv megértésének (Natural Language Understanding, NLU) feladataira specializálódnak.
Ennek a megközelítésnek a zászlóshajója és úttörője a BERT (Bidirectional Encoder Representations from Transformers), amelyet a Google fejlesztett ki 2018-ban.
Koncepció és architektúra
A csak enkóderes modellek alapgondolata az, hogy mély, kontextualizált reprezentációkat (embedding-eket) hozzanak létre a bemeneti szekvencia minden egyes token-jéhez. A Transformer önfigyelem (self-attention) mechanizmusának köszönhetően minden token „láthatja" és kölcsönhatásba léphet a szekvencia összes többi token-jével, ami lehetővé teszi a modell számára, hogy gazdag kontextust ragadjon meg.
A kulcsfontosságú jellemző a kétirányúság: minden token reprezentációja egyszerre a bal és a jobb oldali kontextus alapján alakul ki. Ez alapvetően megkülönbözteti őket az autoregresszív csak-dekóderes modellektől (mint a GPT), amelyek természetüknél fogva egyirányúak.
Architekturálisan a modell azonos enkóderrétegből álló veremként képzelhető el. Minden réteg két fő alrétegből áll:
- Többfejű önfigyelem (Multi-Head Self-Attention): Kontextualizált reprezentációt számít minden token számára.
- Teljesen kapcsolt neurális hálózat (Feed-Forward Network): Nemlineáris transzformációt alkalmaz minden token reprezentációjára.
Kimenetként a modell egy vektorsorozatot állít elő, amelynek hossza megegyezik a bemeneti szekvencia hosszával, ahol minden vektor a megfelelő bemeneti token gazdag reprezentációja.
Az előtanítás feladatai
Annak érdekében, hogy a modell megtanulja kétirányú kontextusban megérteni a nyelvet, speciális, önfelügyelt előtanítási feladatokat alkalmaznak:
Masked Language Modeling - Maszkolt nyelvi modellezés (Masked Language Modeling, MLM)
Ez a csak enkóderes modellek legfőbb és legfontosabb feladata, amelyet először a BERT mutatott be.
- Működési elv: A bemeneti szekvenciából véletlenszerűen elrejtenek (maszkolnak) egy kis százaléknyi token-t (általában 15%-ot). A modell feladata, hogy megjósolja ezeknek a maszkolt token-eknek az eredeti értékeit, felhasználva a körülöttük lévő kétirányú kontextust.
- Cél: Ez a feladat arra kényszeríti a modellt, hogy mély szemantikai és szintaktikai kapcsolatokat tanuljon meg a szavak között.
Next Sentence Prediction - A következő mondat előrejelzése (Next Sentence Prediction, NSP)
Ezt a feladatot (szintén az eredeti BERT-ből) azért fejlesztették ki, hogy megtanítsák a modellt a mondatok közötti összefüggések megértésére.
- Működési elv: A modell kap egy mondatpárt, és meg kell határoznia, hogy a második mondat logikusan következik-e az elsőből az eredeti szövegben.
- Státusz: Későbbi kutatások (például a RoBERTa modellben) kimutatták, hogy az NSP kevésbé hatékony, mint az MLM, ezért gyakran más feladatokkal helyettesítik, vagy teljesen elhagyják.
Alkalmazás
A csak enkóderes modellek nem alkalmasak szabad formájú szöveggenerálásra, mivel nem rendelkeznek autoregresszív dekóderrel. Erejük a szöveg elemzésében és megértésében rejlik. A modell kimeneti vektorreprezentációit az NLU-feladatok széles körének megoldására használják:
- Szövegosztályozás: Az olyan feladatoknál, mint a hangulatelemzés vagy a témameghatározás, a `[CLS]` speciális token reprezentációját használják, amelyet minden szekvencia elejéhez adnak hozzá. Végső vektora összesíti a teljes szekvencia információját.
- Token-szintű osztályozás: Az olyan feladatoknál, mint a névfelismerés (NER) vagy a szófaji jelölés (POS-tagging), az egyes token-ek vektorreprezentációit használják.
- Kérdés-megválaszolás (Question Answering): Azoknál a feladatoknál, ahol a válasz az adott szöveg egy töredéke (extractive QA), a modell megtanulja megjósolni a válasz kezdő és záró token-jét.
- Embedding-ek előállítása: Az enkóderes modellek gyakran univerzális szövegkódolóként szolgálnak, hogy kiváló minőségű mondatvektoros vagy dokumentumvektoros embedding-eket állítsanak elő, amelyek aztán keresőmotorokban vagy szemantikai hasonlósági feladatokban használhatók fel.
Főbb modellek és fejlődésük
- BERT (2018): Az architektúra úttörője, amely új rekordokat állított fel számos NLP-benchmark területén.
- RoBERTa (2019): „Robustly Optimized BERT". Kimutatta, hogy a BERT teljesítménye jelentősen javítható hosszabb ideig tartó, nagyobb adatmennyiségen végzett tanítással és az NSP-feladat elhagyásával.
- ALBERT (2019): „A Lite BERT". Jóval kevesebb paraméterrel rendelkező modell, amely az embedding-faktorizáció és a rétegek közötti paraméterosztás technikáit alkalmazza.
- DistilBERT (2019): A BERT tudásdesztillációval létrehozott kisebb változata, amely gyorsabb és könnyebb, de megőrzi az eredeti teljesítményének nagy részét.
- ELECTRA (2020): Hatékonyabb előtanítási feladatot vezetett be — a replaced token detection-t, amelynek során a modell megtanulja megkülönböztetni az eredeti token-eket a kis generátormodell által előállított „hamis" token-ektől.
- DeBERTa (2020): Bevezette a „szétválasztott figyelem" (disentangled attention) mechanizmusát, amely a token-ek tartalmát és relatív pozícióit külön kódolja.
Lásd még
- BERT