Decoder-only models (architecture) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Alleen-decoder-modellen (Engels: Decoder-Only Models) — dit is de dominante klasse van architecturen voor grote taalmodellen (LLM), die uitsluitend gebaseerd zijn op het decoderende deel (de decoder) van de Transformer-architectuur. Deze modellen zijn gespecialiseerd in taken op het gebied van tekstgeneratie en vormen de basis voor de meeste moderne chatbots en AI-assistenten.

De vlaggenschiplijn die deze aanpak populair heeft gemaakt, is de serie GPT-modellen van OpenAI.

Concept en architectuur

Het centrale idee van alleen-decoder-modellen is de autoregressieve generatie van reeksen. Dit betekent dat het model het volgende token voorspelt op basis van alle eerder gegenereerde tokens. De invoer-prompt (het verzoek van de gebruiker) en de al gegenereerde tekst worden beschouwd als één doorlopende reeks die het model voortzet.

Architectureel bestaat het model uit een stapel van N identieke decoderlagen. Elke laag bevat, in tegenstelling tot een encoder of volledige decoder, slechts twee hoofdonderdelen:

  1. Gemaskeerde multi-head self-attention (Masked Multi-Head Self-Attention): Dit is het sleutelmechanisme dat de autoregressieve eigenschap waarborgt. Tijdens de verwerking van de reeks zorgt een speciaal causaal masker (causal mask) ervoor dat elk token niet kan "kijken" naar de daaropvolgende tokens. Hierdoor is de voorspelling voor positie i uitsluitend afhankelijk van tokens op posities <i.
  2. Volledig verbonden neuraal netwerk (Feed-Forward Network): Past een niet-lineaire transformatie toe op de representatie van elk token.

In alleen-decoder-modellen ontbreekt het mechanisme van cross-attention, omdat er geen encoder aanwezig is waarop aandacht gericht kan worden.

Taken bij voortrainen

Alleen-decoder-modellen worden getraind op één, maar zeer krachtige zelfgesuperviseerde taak:

Causaal taalmodellering (Causal Language Modeling, CLM)

  • Werkingsprincipe: Het model wordt getraind om het volgende token in een reeks te voorspellen. Bij elke trainingsstap krijgt het een tekstfragment als invoer en moet het een kansenverdeling genereren voor het volgende token.
  • Doel: Het maximaliseren van de kans op het juiste volgende token over enorme hoeveelheden tekstdata. Deze op het eerste gezicht eenvoudige taak dwingt het model grammatica, syntaxis, feitenkennis over de wereld en complexe taalpatronen aan te leren.

Toepassingen

Dankzij hun autoregressieve aard zijn alleen-decoder-modellen bij uitstek geschikt voor alle taken waarbij tekstgeneratie vereist is:

  • Vrije tekstgeneratie: Het schrijven van artikelen, gedichten, scripts enzovoort.
  • Dialoogsystemen en chatbots: Het beantwoorden van gebruikersvragen in conversatiestijl.
  • Samenvatting: Het maken van een beknopte weergave van lange teksten.
  • Machinale vertaling: Hoewel hiervoor vaak encoder-decoder-modellen worden gebruikt, kunnen alleen-decoder-modellen ook vertalen als de taak in de prompt is geformuleerd (bijvoorbeeld: "Vertaal van het Engels naar het Nederlands: ...").
  • Coderen: Het genereren van code op basis van een tekstbeschrijving.
  • In-context leren (In-context learning): Dankzij hun schaal tonen grote decoder-modellen het vermogen om nieuwe taken op te lossen met slechts enkele voorbeelden (few-shot) of zelfs zonder voorbeelden (zero-shot) rechtstreeks in de prompt, zonder dat fine-tuning noodzakelijk is.

Belangrijkste modellen en hun evolutie

  • GPT-serie (2018–heden): De pioniers en popularisatoren van deze aanpak. GPT-1 toonde de effectiviteit van voortrainen aan, GPT-2 demonstreerde de kracht van opschaling, en GPT-3 het ontstaan van few-shot-vermogens. ChatGPT en GPT-4 maakten deze architectuur tot de standaard voor AI-assistenten.
  • LLaMA (2023–heden): Een serie open modellen van Meta die de toegang tot krachtige LLM democratiseerde en een golf van innovaties in de gemeenschap stimuleerde.
  • Claude (2023–heden): Een modelfamilie van Anthropic, gericht op veiligheid en beheersbaarheid via Constitutional AI.
  • PaLM en Gemini (2022–heden): De vlaggenschipmodellen van Google. Gemini is tevens een native multimodaal alleen-decoder-model.

Vergelijking met andere architecturen

Vergelijking van belangrijkste Transformer-gebaseerde architecturen
Architectuur Hoofdtaak Contextrichting Typische modellen
Alleen-decoder Tekstgeneratie Eenrichtingsverkeer (van links naar rechts) GPT, LLaMA, Claude, Gemini
Alleen-encoder Tekstbegrip Tweerichtingsverkeer BERT, RoBERTa
Encoder-decoder Reeks-naar-reeks-transformatie Tweerichtingsverkeer (encoder) + Eenrichtingsverkeer (decoder) T5, BART, originele Transformer

Zie ook

  • GPT