Encoder-only models (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Enbart-encoder-modeller (eng. Encoder-Only Models) — är en klass av arkitekturer för stora språkmodeller (LLM), som uteslutande baseras på den kodande delen (encodern) i Transformer-arkitekturen. Till skillnad från modeller som använder en decoder eller en fullständig encoder-decoder-arkitektur, är dessa modeller specialiserade på uppgifter inom förståelse av naturligt språk (Natural Language Understanding, NLU).

Flaggskeppsmodellen och pionjären för detta tillvägagångssätt är BERT (Bidirectional Encoder Representations from Transformers), utvecklad av Google år 2018.

Koncept och arkitektur

Grundidén med enbart-encoder-modeller är att skapa djupa, kontextualiserade representationer (embeddings) för varje token i indatasekvensen. Tack vare mekanismen för självuppmärksamhet (self-attention) i Transformer kan varje token "se" och interagera med alla övriga tokens i sekvensen, vilket gör att modellen kan fånga upp ett rikt sammanhang.

En nyckelegenskap är bidirektionaliteten: representationen av varje token formas utifrån både vänster och höger kontext samtidigt. Detta skiljer dem markant från autoregressiva enbart-decoder-modeller (som GPT), vilka till sin natur är enkelriktade.

Arkitekturmässigt består modellen av ett stack med N identiska encoderlager. Varje lager består av två huvudsakliga underlaager:

  1. Flerhuvudat självuppmärksamhet (Multi-Head Self-Attention): Beräknar en kontextualiserad representation för varje token.
  2. Fullt anslutet neuralt nätverk (Feed-Forward Network): Tillämpar en icke-linjär transformation på varje tokenrepresentation.

Vid utmatningen genererar modellen en sekvens av vektorer med samma längd som indatasekvensen, där varje vektor utgör en rik representation av motsvarande indatatoken.

Uppgifter för förträning

För att lära modellen att förstå språk i ett bidirektionellt sammanhang används särskilda självövervakade förträningsuppgifter:

Maskerad språkmodellering (Masked Language Modeling, MLM)

Detta är den grundläggande och viktigaste uppgiften för enbart-encoder-modeller, som för första gången introducerades i BERT.

  • Arbetsprincip: En liten andel av tokens (vanligtvis 15 %) i indatasekvensen döljs (maskeras) slumpmässigt. Modellens uppgift är att förutsäga de ursprungliga värdena för dessa maskerade tokens med hjälp av det omgivande bidirektionella sammanhanget.
  • Syfte: Denna uppgift tvingar modellen att lära sig djupa semantiska och syntaktiska samband mellan ord.

Förutsägelse av nästa mening (Next Sentence Prediction, NSP)

Denna uppgift (också från den ursprungliga BERT) utvecklades för att lära modellen att förstå relationer mellan meningar.

  • Arbetsprincip: Modellen matas med ett par meningar och ska avgöra om den andra meningen är en logisk fortsättning på den första i originaltexten.
  • Status: Senare forskning (till exempel i modellen RoBERTa) visade att NSP är mindre effektiv än MLM, och den ersätts ofta av andra uppgifter eller tas bort helt.

Tillämpningar

Enbart-encoder-modeller är inte avsedda för fri textgenerering, eftersom de saknar en autoregressiv decoder. Deras styrka ligger i analys och förståelse av text. Modellens utmatningsvektorrepresentationer används för att lösa ett brett spektrum av NLU-uppgifter:

  • Textklassificering: För uppgifter som sentimentanalys eller ämnesidentifiering används representationen av den speciella token `[CLS]`, som läggs till i början av varje sekvens. Dess slutliga vektor aggregerar information om hela sekvensen.
  • Tokenklassificering: För uppgifter som igenkänning av namngivna entiteter (NER) eller ordklasstaggning (POS-tagging) används vektorrepresentationerna för varje enskild token.
  • Frågesvar (Question Answering): I uppgifter där svaret utgör ett fragment ur en given text (extractive QA) tränas modellen att förutsäga start- och sluttokens för svaret.
  • Erhållande av embeddings: Encoder-modeller används ofta som universella textkodare för att erhålla högkvalitativa embeddings av meningar eller dokument, vilka sedan kan användas i sökmotorer eller för uppgifter om semantisk likhet.

Huvudmodeller och deras utveckling

  • BERT (2018): Pionjär för arkitekturen, som satte nya rekord på en mängd NLP-benchmark.
  • RoBERTa (2019): "Robust optimerad BERT". Visade att BERTs prestanda kan förbättras avsevärt genom längre träning på större mängder data och genom att ta bort NSP-uppgiften.
  • ALBERT (2019): "A Lite BERT". En modell med betydligt färre parametrar tack vare tekniker för embedding-faktorisering och delning av parametrar mellan lager.
  • DistilBERT (2019): En nedskalad version av BERT, skapad med hjälp av kunskapsdestillering, som är snabbare och lättare men behåller större delen av originalets prestanda.
  • ELECTRA (2020): Introducerade en mer effektiv förträningsuppgift — replaced token detection, där modellen lär sig att skilja originaltokens från "falska" tokens genererade av en liten generatormodell.
  • DeBERTa (2020): Introducerade mekanismen "disentangled attention", som kodar innehåll och relativa positioner för tokens separat.

Se även

  • BERT