Decoder-only models (architecture) (IT)
I modelli solo-decoder (ingl. Decoder-Only Models) sono la classe dominante di architetture per i grandi modelli linguistici (LLM), basata esclusivamente sulla parte decodificante (decoder) dell'architettura Transformer. Questi modelli sono specializzati nei compiti di generazione del testo e costituiscono la base della maggior parte dei chatbot e degli assistenti AI moderni.
La serie di modelli GPT di OpenAI è la linea di punta che ha reso popolare questo approccio.
Concetto e architettura
L'idea fondamentale dei modelli solo-decoder risiede nella generazione autoregressiva di sequenze. Ciò significa che il modello predice il token successivo basandosi su tutti i token precedenti che sono stati generati fino a quel momento. Il prompt in ingresso (la richiesta dell'utente) e il testo già generato vengono trattati come un'unica sequenza che il modello continua.
Architetturalmente, il modello è composto da uno stack di strati decoder identici. Ogni strato, a differenza di un encoder o di un decoder completo, contiene solo due sottostrati principali:
- Masked Multi-Head Self-Attention (Attenzione multipla mascherata): È il meccanismo chiave che garantisce la proprietà autoregressiva. Durante l'elaborazione della sequenza, una speciale maschera causale (causal mask) impedisce a ciascun token di «guardare» i token successivi. In questo modo, la predizione per la posizione dipende solo dai token nelle posizioni .
- Feed-Forward Network (Rete neurale completamente connessa): Applica una trasformazione non lineare alla rappresentazione di ciascun token.
Nei modelli solo-decoder è assente il meccanismo di cross-attention (attenzione incrociata), poiché non vi è alcun encoder su cui «porre l'attenzione».
Compiti di pre-addestramento
I modelli solo-decoder vengono addestrati su un unico compito, ma estremamente potente, di auto-supervisione:
Causal Language Modeling (Modellazione del linguaggio causale, CLM)
- Principio di funzionamento: Il modello viene addestrato a predire il token successivo nella sequenza. Ad ogni passo di addestramento riceve in ingresso un frammento di testo e deve generare una distribuzione di probabilità per il token successivo.
- Obiettivo: Massimizzare la probabilità del token successivo corretto su enormi volumi di dati testuali. Questo compito, semplice in apparenza, costringe il modello ad apprendere grammatica, sintassi, fatti sul mondo e complessi pattern del linguaggio.
Applicazioni
Grazie alla loro natura autoregressiva, i modelli solo-decoder si prestano perfettamente a qualsiasi compito che richieda la generazione di testo:
- Generazione libera di testo: Scrittura di articoli, poesie, sceneggiature, ecc.
- Sistemi dialogici e chatbot: Risposte alle domande degli utenti in stile conversazionale.
- Riassunto automatico: Creazione di sintesi di testi lunghi.
- Traduzione automatica: Sebbene per questo scopo vengano spesso utilizzati modelli encoder-decoder, i modelli solo-decoder sono anch'essi in grado di svolgere traduzioni se il compito è formulato nel prompt (ad esempio, «Traduci dall'inglese all'italiano: ...»).
- Scrittura di codice: Generazione di codice a partire da una descrizione testuale.
- In-context learning (Apprendimento nel contesto): Grazie alla loro scala, i grandi modelli decoder dimostrano la capacità di affrontare nuovi compiti ricevendo solo pochi esempi (few-shot) o addirittura nessuno (zero-shot) direttamente nel prompt, senza necessità di fine-tuning.
Modelli principali e loro evoluzione
- Serie GPT (2018-oggi): Pionieri e divulgatori dell'approccio. GPT-1 ha dimostrato l'efficacia del pre-addestramento, GPT-2 ha mostrato la potenza della scalabilità, mentre GPT-3 ha rivelato l'emergere delle capacità few-shot. ChatGPT e GPT-4 hanno reso questa architettura lo standard per gli assistenti AI.
- LLaMA (2023-oggi): Serie di modelli aperti di Meta, che ha democratizzato l'accesso a potenti LLM e stimolato un'ondata di innovazioni nella comunità.
- Claude (2023-oggi): Famiglia di modelli di Anthropic, focalizzata sulla sicurezza e la controllabilità tramite Constitutional AI.
- PaLM e Gemini (2022-oggi): Modelli di punta di Google. Gemini è anche un modello solo-decoder nativamente multimodale.
Confronto con altre architetture
| Architettura | Compito principale | Direzione del contesto | Modelli tipici |
|---|---|---|---|
| Solo-decoder | Generazione del testo | Unidirezionale (da sinistra a destra) | GPT, LLaMA, Claude, Gemini |
| Solo-encoder | Comprensione del testo | Bidirezionale | BERT, RoBERTa |
| Encoder-decoder | Trasformazione da sequenza a sequenza | Bidirezionale (encoder) + Unidirezionale (decoder) | T5, BART, Transformer originale |
Vedi anche
- GPT