Decoder-only models (architecture) (CS)
Modely pouze s dekodérem (angl. Decoder-Only Models) — to je dominantní třída architektur velkých jazykových modelů (LLM), založených výhradně na dekódovací části (dekodéru) architektury Transformer. Tyto modely jsou specializovány na úlohy generování textu a tvoří základ většiny moderních chatbotů a AI asistentů.
Vlajkovou řadou, která tento přístup zpopularizovala, je série modelů GPT od OpenAI.
Koncepce a architektura
Základní myšlenka modelů pouze s dekodérem spočívá v autoregresivním generování sekvencí. To znamená, že model předpovídá následující token na základě všech předchozích tokenů, které byly do té doby vygenerovány. Vstupní prompt (požadavek uživatele) a již vygenerovaný text jsou považovány za jedinou sekvenci, kterou model dále rozvíjí.
Architektonicky model představuje zásobník identických vrstev dekodéru. Každá vrstva, na rozdíl od enkodéru nebo úplného dekodéru, obsahuje pouze dva hlavní podvrstvy:
- Maskovaná vícehlasá vlastní pozornost (Masked Multi-Head Self-Attention): Jedná se o klíčový mechanismus zajišťující autoregresivní vlastnost. Při zpracování sekvence speciální kauzální maska (causal mask) neumožňuje každému tokenu „dívat se" na následující tokeny. Předpověď pro pozici tedy závisí pouze na tokenech na pozicích .
- Plně propojená neuronová síť (Feed-Forward Network): Aplikuje nelineární transformaci na reprezentaci každého tokenu.
V modelech pouze s dekodérem chybí mechanismus křížové pozornosti (cross-attention), protože neexistuje enkodér, na který by bylo možné „zaměřit pozornost".
Úlohy předtrénování
Modely pouze s dekodérem jsou trénovány na jediné, avšak velmi mocné samořízeně dozorované úloze:
Kauzální jazykové modelování (Causal Language Modeling, CLM)
- Princip fungování: Model je trénován na předpovídání následujícího tokenu v sekvenci. V každém trénovacím kroku dostane na vstup fragment textu a musí vygenerovat rozdělení pravděpodobností pro následující token.
- Cíl: Maximalizovat pravděpodobnost správného následujícího tokenu na obrovských objemech textových dat. Tato na první pohled jednoduchá úloha nutí model učit se gramatiku, syntax, fakta o světě a složité zákonitosti jazyka.
Použití
Díky své autoregresivní povaze jsou modely pouze s dekodérem ideálně vhodné pro jakékoli úlohy vyžadující generování textu:
- Volné generování textu: Psaní článků, básní, scénářů atd.
- Dialogové systémy a chatboty: Odpovídání na dotazy uživatelů v konverzačním stylu.
- Sumarizace: Vytváření stručného obsahu dlouhých textů.
- Strojový překlad: Ačkoli se pro tento účel často používají modely enkodér-dekodér, modely pouze s dekodérem si také dokáží poradit s překladem, pokud je úloha formulována v promptu (například „Přelož z angličtiny do češtiny: …").
- Generování kódu: Generování kódu na základě textového popisu.
- Učení v kontextu (In-context learning): Díky svému rozsahu vykazují velké modely-dekodéry schopnost řešit nové úlohy poté, co dostanou jen několik příkladů (few-shot), nebo dokonce bez nich (zero-shot) přímo v promptu, bez nutnosti dotrénování (fine-tuning).
Hlavní modely a jejich evoluce
- Série GPT (2018–současnost): Průkopníci a popularizátoři tohoto přístupu. GPT-1 ukázal účinnost předtrénování, GPT-2 demonstroval sílu škálování a GPT-3 — vznik few-shot schopností. ChatGPT a GPT-4 udělaly z této architektury standard pro AI asistenty.
- LLaMA (2023–současnost): Série otevřených modelů od Meta, která demokratizovala přístup k výkonným LLM a podnítila vlnu inovací v komunitě.
- Claude (2023–současnost): Rodina modelů od Anthropic, zaměřená na bezpečnost a řiditelnost pomocí Constitutional AI.
- PaLM a Gemini (2022–současnost): Vlajkové modely Google. Gemini je také nativně multimodálním modelem pouze s dekodérem.
Srovnání s ostatními architekturami
| Architektura | Hlavní úloha | Směr kontextu | Typické modely |
|---|---|---|---|
| Pouze s dekodérem | Generování textu | Jednosměrné (zleva doprava) | GPT, LLaMA, Claude, Gemini |
| Pouze s enkodérem | Porozumění textu | Obousměrné | BERT, RoBERTa |
| Enkodér-dekodér | Převod sekvence na sekvenci | Obousměrné (enkodér) + Jednosměrné (dekodér) | T5, BART, původní Transformer |
Viz také
- GPT