Decoder-only models (architecture) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

I modelli solo-decoder (ingl. Decoder-Only Models) sono la classe dominante di architetture per i grandi modelli linguistici (LLM), basata esclusivamente sulla parte decodificante (decoder) dell'architettura Transformer. Questi modelli sono specializzati nei compiti di generazione del testo e costituiscono la base della maggior parte dei chatbot e degli assistenti AI moderni.

La serie di modelli GPT di OpenAI è la linea di punta che ha reso popolare questo approccio.

Concetto e architettura

L'idea fondamentale dei modelli solo-decoder risiede nella generazione autoregressiva di sequenze. Ciò significa che il modello predice il token successivo basandosi su tutti i token precedenti che sono stati generati fino a quel momento. Il prompt in ingresso (la richiesta dell'utente) e il testo già generato vengono trattati come un'unica sequenza che il modello continua.

Architetturalmente, il modello è composto da uno stack di N strati decoder identici. Ogni strato, a differenza di un encoder o di un decoder completo, contiene solo due sottostrati principali:

  1. Masked Multi-Head Self-Attention (Attenzione multipla mascherata): È il meccanismo chiave che garantisce la proprietà autoregressiva. Durante l'elaborazione della sequenza, una speciale maschera causale (causal mask) impedisce a ciascun token di «guardare» i token successivi. In questo modo, la predizione per la posizione i dipende solo dai token nelle posizioni <i.
  2. Feed-Forward Network (Rete neurale completamente connessa): Applica una trasformazione non lineare alla rappresentazione di ciascun token.

Nei modelli solo-decoder è assente il meccanismo di cross-attention (attenzione incrociata), poiché non vi è alcun encoder su cui «porre l'attenzione».

Compiti di pre-addestramento

I modelli solo-decoder vengono addestrati su un unico compito, ma estremamente potente, di auto-supervisione:

Causal Language Modeling (Modellazione del linguaggio causale, CLM)

  • Principio di funzionamento: Il modello viene addestrato a predire il token successivo nella sequenza. Ad ogni passo di addestramento riceve in ingresso un frammento di testo e deve generare una distribuzione di probabilità per il token successivo.
  • Obiettivo: Massimizzare la probabilità del token successivo corretto su enormi volumi di dati testuali. Questo compito, semplice in apparenza, costringe il modello ad apprendere grammatica, sintassi, fatti sul mondo e complessi pattern del linguaggio.

Applicazioni

Grazie alla loro natura autoregressiva, i modelli solo-decoder si prestano perfettamente a qualsiasi compito che richieda la generazione di testo:

  • Generazione libera di testo: Scrittura di articoli, poesie, sceneggiature, ecc.
  • Sistemi dialogici e chatbot: Risposte alle domande degli utenti in stile conversazionale.
  • Riassunto automatico: Creazione di sintesi di testi lunghi.
  • Traduzione automatica: Sebbene per questo scopo vengano spesso utilizzati modelli encoder-decoder, i modelli solo-decoder sono anch'essi in grado di svolgere traduzioni se il compito è formulato nel prompt (ad esempio, «Traduci dall'inglese all'italiano: ...»).
  • Scrittura di codice: Generazione di codice a partire da una descrizione testuale.
  • In-context learning (Apprendimento nel contesto): Grazie alla loro scala, i grandi modelli decoder dimostrano la capacità di affrontare nuovi compiti ricevendo solo pochi esempi (few-shot) o addirittura nessuno (zero-shot) direttamente nel prompt, senza necessità di fine-tuning.

Modelli principali e loro evoluzione

  • Serie GPT (2018-oggi): Pionieri e divulgatori dell'approccio. GPT-1 ha dimostrato l'efficacia del pre-addestramento, GPT-2 ha mostrato la potenza della scalabilità, mentre GPT-3 ha rivelato l'emergere delle capacità few-shot. ChatGPT e GPT-4 hanno reso questa architettura lo standard per gli assistenti AI.
  • LLaMA (2023-oggi): Serie di modelli aperti di Meta, che ha democratizzato l'accesso a potenti LLM e stimolato un'ondata di innovazioni nella comunità.
  • Claude (2023-oggi): Famiglia di modelli di Anthropic, focalizzata sulla sicurezza e la controllabilità tramite Constitutional AI.
  • PaLM e Gemini (2022-oggi): Modelli di punta di Google. Gemini è anche un modello solo-decoder nativamente multimodale.

Confronto con altre architetture

Confronto tra le principali architetture basate sul Transformer
Architettura Compito principale Direzione del contesto Modelli tipici
Solo-decoder Generazione del testo Unidirezionale (da sinistra a destra) GPT, LLaMA, Claude, Gemini
Solo-encoder Comprensione del testo Bidirezionale BERT, RoBERTa
Encoder-decoder Trasformazione da sequenza a sequenza Bidirezionale (encoder) + Unidirezionale (decoder) T5, BART, Transformer originale

Vedi anche

  • GPT