Encoder-only models (NL)
Alleen-encoder modellen (Engels: Encoder-Only Models) — dit is een klasse van architecturen voor grote taalmodellen (LLM), uitsluitend gebaseerd op het coderende gedeelte (de encoder) van de Transformer-architectuur. In tegenstelling tot modellen die gebruikmaken van een decoder of de volledige encoder-decoder-architectuur, zijn deze modellen gespecialiseerd in taken op het gebied van Natural Language Understanding (NLU).
Het vlaggenschipmodel en de pionier van deze aanpak is BERT (Bidirectional Encoder Representations from Transformers), ontwikkeld door Google in 2018.
Concept en architectuur
Het centrale idee achter alleen-encoder modellen is het creëren van diepe, gecontextualiseerde representaties (embeddings) voor elk token in de invoersequentie. Dankzij het self-attention-mechanisme in de Transformer kan elk token alle andere tokens in de sequentie "zien" en ermee interageren, waardoor het model rijke contextuele verbanden kan vastleggen.
Een sleuteleigenschap is bidirectionaliteit: de representatie van elk token wordt tegelijkertijd gevormd op basis van zowel de linker- als de rechtercontext. Dit onderscheidt deze modellen fundamenteel van autoregressive alleen-decoder modellen (zoals GPT), die van nature unidirectioneel zijn.
Architectureel bestaat het model uit een stapel van identieke encoderlagen. Elke laag bestaat uit twee belangrijke sublagen:
- Multi-Head Self-Attention: Berekent een gecontextualiseerde representatie voor elk token.
- Feed-Forward Network: Past een niet-lineaire transformatie toe op de representatie van elk token.
Aan de uitvoer genereert het model een reeks vectoren met dezelfde lengte als de invoersequentie, waarbij elke vector een rijke representatie vormt van het overeenkomstige invoertoken.
Taken bij voorafgaande training
Om het model taal te leren begrijpen in een bidirectionele context, worden speciale zelfgesuperviseerde taken voor voorafgaande training gebruikt:
Masked Language Modeling (MLM) - Gemaskeerde taalmodi
Dit is de belangrijkste taak voor alleen-encoder modellen, voor het eerst geïntroduceerd in BERT.
- Werkingsprincipe: Een klein percentage van de tokens in de invoersequentie (gewoonlijk 15%) wordt willekeurig verborgen (gemaskeerd). De taak van het model is om de oorspronkelijke waarden van deze gemaskeerde tokens te voorspellen aan de hand van de bidirectionele context eromheen.
- Doel: Deze taak dwingt het model diepgaande semantische en syntactische verbanden tussen woorden te leren.
Next Sentence Prediction (NSP) - Voorspelling van de volgende zin
Deze taak (ook afkomstig uit het originele BERT) werd ontwikkeld om het model relaties tussen zinnen te leren begrijpen.
- Werkingsprincipe: Het model krijgt een zinspaar aangeboden en moet bepalen of de tweede zin een logisch vervolg is op de eerste in de originele tekst.
- Status: Later onderzoek (bijvoorbeeld bij het RoBERTa-model) toonde aan dat NSP minder effectief is dan MLM, en de taak wordt vaak vervangen door andere taken of volledig weggelaten.
Toepassingen
Alleen-encoder modellen zijn niet bedoeld voor het vrij genereren van tekst, omdat zij geen autoregressive decoder bevatten. Hun kracht ligt in het analyseren en begrijpen van tekst. De uitvoervectorrepresentaties van het model worden gebruikt voor een breed spectrum aan NLU-taken:
- Tekstclassificatie: Voor taken zoals sentimentanalyse of onderwerpdetectie wordt de representatie van het speciale token `[CLS]` gebruikt, dat aan het begin van elke sequentie wordt toegevoegd. De uiteindelijke vector ervan aggregeert informatie over de gehele sequentie.
- Tokenclassificatie: Voor taken zoals Named Entity Recognition (NER) of Part-of-Speech-tagging (POS-tagging) worden de vectorrepresentaties van elk afzonderlijk token gebruikt.
- Question Answering: Bij taken waarbij het antwoord een fragment uit een gegeven tekst is (extractive QA), wordt het model getraind om het begin- en eindtoken van het antwoord te voorspellen.
- Embeddings verkrijgen: Encoder-modellen worden vaak gebruikt als universele tekstcoders voor het verkrijgen van hoogwaardige embeddings van zinnen of documenten, die vervolgens kunnen worden ingezet in zoekmachines of voor taken op het gebied van semantische gelijkenis.
Belangrijkste modellen en hun evolutie
- BERT (2018): Pionier van de architectuur, die nieuwe records vestigde op talloze NLP-benchmarks.
- RoBERTa (2019): "Robuust geoptimaliseerde BERT". Toonde aan dat de prestaties van BERT aanzienlijk verbeterd kunnen worden door langer te trainen op meer data en de NSP-taak weg te laten.
- ALBERT (2019): "A Lite BERT". Een model met aanzienlijk minder parameters dankzij technieken voor embedding-factorisatie en het delen van parameters tussen lagen.
- DistilBERT (2019): Een verkleinde versie van BERT, gecreëerd met behulp van knowledge distillation, die sneller en lichter is maar het grootste deel van de prestaties van het origineel behoudt.
- ELECTRA (2020): Introduceerde een efficiëntere voorafgaande trainingstask — replaced token detection, waarbij het model leert originele tokens te onderscheiden van "neppe" tokens die door een klein generatormodel zijn gegenereerd.
- DeBERTa (2020): Introduceerde het mechanisme van "disentangled attention", dat de inhoud en de relatieve posities van tokens afzonderlijk codeert.
Zie ook
- BERT