Encoder-only models (RO)
Modele exclusiv-encoder (engl. Encoder-Only Models) — reprezintă o clasă de arhitecturi ale modelelor lingvistice mari (LLM), bazate exclusiv pe partea de codificare (encoder) a arhitecturii Transformer. Spre deosebire de modelele care utilizează un decoder sau arhitectura completă encoder-decoder, aceste modele sunt specializate în sarcini de înțelegere a limbajului natural (Natural Language Understanding, NLU).
Modelul emblematic și pionier al acestei abordări este BERT (Bidirectional Encoder Representations from Transformers), dezvoltat de Google în 2018.
Concept și arhitectură
Ideea de bază a modelelor exclusiv-encoder constă în crearea unor reprezentări contextualizate profunde (embedding-uri) pentru fiecare token din secvența de intrare. Datorită mecanismului de auto-atenție (self-attention) din Transformer, fiecare token poate „vedea" și interacționa cu toți ceilalți tokeni din secvență, ceea ce permite modelului să capteze un context bogat.
Caracteristica esențială este bidirecționalitatea: reprezentarea fiecărui token se formează pe baza atât a contextului stâng, cât și a celui drept, simultan. Aceasta îi diferențiază fundamental de modelele autoregresive exclusiv-decoder (precum GPT), care prin natura lor sunt unidirecționale.
Din punct de vedere arhitectural, modelul reprezintă un stac de straturi identice de encoder. Fiecare strat este compus din două sub-straturi principale:
- Auto-atenție cu mai multe capete (Multi-Head Self-Attention): Calculează reprezentarea contextualizată pentru fiecare token.
- Rețea neuronală complet conectată (Feed-Forward Network): Aplică o transformare neliniară fiecărei reprezentări de token.
La ieșire, modelul generează o secvență de vectori de aceeași lungime cu secvența de intrare, unde fiecare vector reprezintă o reprezentare bogată a tokenului de intrare corespunzător.
Sarcini de pre-antrenare
Pentru a învăța modelul să înțeleagă limbajul în context bidirecțional, se utilizează sarcini speciale de pre-antrenare auto-supervizat:
Modelarea lingvistică mascată (Masked Language Modeling, MLM)
Aceasta este sarcina principală și cea mai importantă pentru modelele exclusiv-encoder, prezentată pentru prima dată în BERT.
- Principiu de funcționare: Din secvența de intrare, un mic procent de tokeni (de obicei 15%) este ascuns (mascat) în mod aleatoriu. Sarcina modelului este să prezică valorile originale ale acestor tokeni mascați, folosind contextul bidirecțional din jurul lor.
- Scop: Această sarcină determină modelul să învețe relații semantice și sintactice profunde între cuvinte.
Predicția propoziției următoare (Next Sentence Prediction, NSP)
Această sarcină (tot din BERT original) a fost concepută pentru a învăța modelul să înțeleagă relațiile dintre propoziții.
- Principiu de funcționare: Modelului i se furnizează o pereche de propoziții și trebuie să determine dacă a doua propoziție reprezintă o continuare logică a primei în textul original.
- Statut: Ulterior, cercetările (de exemplu, în modelul RoBERTa) au arătat că NSP este mai puțin eficientă decât MLM și este adesea înlocuită cu alte sarcini sau eliminată cu totul.
Aplicații
Modelele exclusiv-encoder nu sunt destinate generării de text în formă liberă, deoarece nu dispun de un decoder autoregresiv. Puterea lor constă în analiza și înțelegerea textului. Reprezentările vectoriale de ieșire ale modelului sunt utilizate pentru rezolvarea unui spectru larg de sarcini NLU:
- Clasificarea textului: Pentru sarcini precum analiza sentimentelor sau determinarea temei, se utilizează reprezentarea tokenului special `[CLS]`, care este adăugat la începutul fiecărei secvențe. Vectorul său final agregă informații despre întreaga secvență.
- Clasificarea la nivel de token: Pentru sarcini precum recunoașterea entităților denumite (NER) sau etichetarea părților de vorbire (POS-tagging), se utilizează reprezentările vectoriale ale fiecărui token individual.
- Răspuns la întrebări (Question Answering): În sarcinile în care răspunsul este un fragment din textul dat (extractive QA), modelul este antrenat să prezică tokenul de început și de sfârșit al răspunsului.
- Obținerea de embedding-uri: Modelele de tip encoder sunt adesea utilizate ca encodere universale de text pentru obținerea unor embedding-uri de înaltă calitate pentru propoziții sau documente, care pot fi ulterior folosite în motoare de căutare sau pentru sarcini de similaritate semantică.
Modele principale și evoluția lor
- BERT (2018): Pionierul arhitecturii, care a stabilit noi recorduri pe numeroase benchmark-uri NLP.
- RoBERTa (2019): „BERT optimizat robust". A demonstrat că performanța BERT poate fi îmbunătățită semnificativ prin antrenare mai îndelungată pe mai multe date și renunțarea la sarcina NSP.
- ALBERT (2019): „A Lite BERT". Model cu un număr semnificativ mai mic de parametri datorită tehnicilor de factorizare a embedding-urilor și partajării parametrilor între straturi.
- DistilBERT (2019): Versiune redusă a BERT, creată prin distilarea cunoștințelor, care este mai rapidă și mai ușoară, dar păstrează o mare parte din performanța originalului.
- ELECTRA (2020): A introdus o sarcină de pre-antrenare mai eficientă — replaced token detection, în care modelul învață să distingă tokenii originali de cei „falși", generați de un mic model-generator.
- DeBERTa (2020): A introdus mecanismul „atenției dezentrelacsate" (disentangled attention), care codifică separat conținutul și pozițiile relative ale tokenilor.
Vezi și
- BERT