Decoder-only models (architecture) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Modeller med enbart dekoder (eng. Decoder-Only Models) — detta är den dominerande klassen av arkitekturer för stora språkmodeller (LLM), baserade uteslutande på den avkodande delen (dekoderns) av Transformer-arkitekturen. Dessa modeller specialiserar sig på uppgifter inom textgenerering och utgör grunden för de flesta moderna chattbotar och AI-assistenter.

Den flaggskeppsserie som populariserade detta tillvägagångssätt är modellserien GPT från OpenAI.

Koncept och arkitektur

Grundidén med modeller med enbart dekoder är autoregressiv generering av sekvenser. Det innebär att modellen förutsäger nästa token baserat på alla tidigare tokens som genererats dessförinnan. Ingångsprompten (användarens förfrågan) och den redan genererade texten betraktas som en enda sekvens som modellen fortsätter.

Arkitekturmässigt består modellen av en stapel med N identiska dekoderslager. Varje lager innehåller, till skillnad från en enkoder eller en fullständig dekoder, endast två huvudsakliga delskikt:

  1. Maskerad multi-head self-attention (Masked Multi-Head Self-Attention): Detta är den nyckelmodul som säkerställer den autoregressiva egenskapen. Under bearbetning av sekvensen förhindrar en speciell kausal mask (causal mask) varje token från att "se" på efterföljande tokens. På så sätt beror förutsägelsen för position i enbart på tokens vid positionerna <i.
  2. Fullständigt kopplat neuralt nätverk (Feed-Forward Network): Tillämpar en icke-linjär transformation på representationen av varje token.

I modeller med enbart dekoder saknas mekanismen för korsad uppmärksamhet (cross-attention), eftersom det inte finns någon enkoder att "rikta uppmärksamheten mot".

Uppgifter vid förträning

Modeller med enbart dekoder tränas på en enda men mycket kraftfull självövervakad uppgift:

Kausal språkmodellering (Causal Language Modeling, CLM)

  • Arbetsprincip: Modellen tränas att förutsäga nästa token i en sekvens. Vid varje träningssteg får den som indata ett textstycke och ska generera en sannolikhetsfördelning för nästa token.
  • Mål: Att maximera sannolikheten för korrekt nästa token på enorma mängder textdata. Denna till synes enkla uppgift tvingar modellen att lära sig grammatik, syntax, fakta om världen och komplexa språkmönster.

Tillämpning

Tack vare sin autoregressiva natur lämpar sig modeller med enbart dekoder utmärkt för alla uppgifter som kräver textgenerering:

  • Fri textgenerering: Skrivande av artiklar, dikter, manus o.s.v.
  • Dialogsystem och chattbotar: Svar på användarfrågor i konversationsstil.
  • Sammanfattning: Skapande av kortfattat innehåll ur långa texter.
  • Maskinöversättning: Även om enkoder-dekoder-modeller ofta används för detta, kan modeller med enbart dekoder också hantera översättning om uppgiften formuleras i prompten (t.ex. "Översätt från engelska till svenska: ...").
  • Kodskrivning: Generering av kod utifrån textbeskrivning.
  • Inlärning i kontext (In-context learning): Tack vare sin skala uppvisar stora dekodermodeller förmågan att lösa nya uppgifter med bara några få exempel (few-shot) eller till och med utan exempel (zero-shot) direkt i prompten, utan behov av finjustering (fine-tuning).

Huvudsakliga modeller och deras utveckling

  • GPT-serien (2018–nu): Pionjärer och popularisatorer av tillvägagångssättet. GPT-1 visade effektiviteten av förträning, GPT-2 demonstrerade kraften i skalning, och GPT-3 — uppkomsten av few-shot-förmågor. ChatGPT och GPT-4 gjorde denna arkitektur till standard för AI-assistenter.
  • LLaMA (2023–nu): En serie öppna modeller från Meta som demokratiserade tillgången till kraftfulla LLM och stimulerade en våg av innovationer i gemenskapen.
  • Claude (2023–nu): En modellfamilj från Anthropic med fokus på säkerhet och styrbarhet med hjälp av Constitutional AI.
  • PaLM och Gemini (2022–nu): Googles flaggskeppsmodeller. Gemini är också en nativt multimodal modell med enbart dekoder.

Jämförelse med andra arkitekturer

Jämförelse av nyckelarkitekturer baserade på Transformer
Arkitektur Primär uppgift Kontextriktning Typiska modeller
Enbart dekoder Textgenerering Enkelriktad (vänster till höger) GPT, LLaMA, Claude, Gemini
Enbart enkoder Textförståelse Dubbelriktad BERT, RoBERTa
Enkoder-dekoder Sekvens-till-sekvens-omvandling Dubbelriktad (enkoder) + Enkelriktad (dekoder) T5, BART, original Transformer

Se även

  • GPT