Decoder-only models (architecture) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Modely pouze s dekodérem (angl. Decoder-Only Models) — to je dominantní třída architektur velkých jazykových modelů (LLM), založených výhradně na dekódovací části (dekodéru) architektury Transformer. Tyto modely jsou specializovány na úlohy generování textu a tvoří základ většiny moderních chatbotů a AI asistentů.

Vlajkovou řadou, která tento přístup zpopularizovala, je série modelů GPT od OpenAI.

Koncepce a architektura

Základní myšlenka modelů pouze s dekodérem spočívá v autoregresivním generování sekvencí. To znamená, že model předpovídá následující token na základě všech předchozích tokenů, které byly do té doby vygenerovány. Vstupní prompt (požadavek uživatele) a již vygenerovaný text jsou považovány za jedinou sekvenci, kterou model dále rozvíjí.

Architektonicky model představuje zásobník N identických vrstev dekodéru. Každá vrstva, na rozdíl od enkodéru nebo úplného dekodéru, obsahuje pouze dva hlavní podvrstvy:

  1. Maskovaná vícehlasá vlastní pozornost (Masked Multi-Head Self-Attention): Jedná se o klíčový mechanismus zajišťující autoregresivní vlastnost. Při zpracování sekvence speciální kauzální maska (causal mask) neumožňuje každému tokenu „dívat se" na následující tokeny. Předpověď pro pozici i tedy závisí pouze na tokenech na pozicích <i.
  2. Plně propojená neuronová síť (Feed-Forward Network): Aplikuje nelineární transformaci na reprezentaci každého tokenu.

V modelech pouze s dekodérem chybí mechanismus křížové pozornosti (cross-attention), protože neexistuje enkodér, na který by bylo možné „zaměřit pozornost".

Úlohy předtrénování

Modely pouze s dekodérem jsou trénovány na jediné, avšak velmi mocné samořízeně dozorované úloze:

Kauzální jazykové modelování (Causal Language Modeling, CLM)

  • Princip fungování: Model je trénován na předpovídání následujícího tokenu v sekvenci. V každém trénovacím kroku dostane na vstup fragment textu a musí vygenerovat rozdělení pravděpodobností pro následující token.
  • Cíl: Maximalizovat pravděpodobnost správného následujícího tokenu na obrovských objemech textových dat. Tato na první pohled jednoduchá úloha nutí model učit se gramatiku, syntax, fakta o světě a složité zákonitosti jazyka.

Použití

Díky své autoregresivní povaze jsou modely pouze s dekodérem ideálně vhodné pro jakékoli úlohy vyžadující generování textu:

  • Volné generování textu: Psaní článků, básní, scénářů atd.
  • Dialogové systémy a chatboty: Odpovídání na dotazy uživatelů v konverzačním stylu.
  • Sumarizace: Vytváření stručného obsahu dlouhých textů.
  • Strojový překlad: Ačkoli se pro tento účel často používají modely enkodér-dekodér, modely pouze s dekodérem si také dokáží poradit s překladem, pokud je úloha formulována v promptu (například „Přelož z angličtiny do češtiny: …").
  • Generování kódu: Generování kódu na základě textového popisu.
  • Učení v kontextu (In-context learning): Díky svému rozsahu vykazují velké modely-dekodéry schopnost řešit nové úlohy poté, co dostanou jen několik příkladů (few-shot), nebo dokonce bez nich (zero-shot) přímo v promptu, bez nutnosti dotrénování (fine-tuning).

Hlavní modely a jejich evoluce

  • Série GPT (2018–současnost): Průkopníci a popularizátoři tohoto přístupu. GPT-1 ukázal účinnost předtrénování, GPT-2 demonstroval sílu škálování a GPT-3 — vznik few-shot schopností. ChatGPT a GPT-4 udělaly z této architektury standard pro AI asistenty.
  • LLaMA (2023–současnost): Série otevřených modelů od Meta, která demokratizovala přístup k výkonným LLM a podnítila vlnu inovací v komunitě.
  • Claude (2023–současnost): Rodina modelů od Anthropic, zaměřená na bezpečnost a řiditelnost pomocí Constitutional AI.
  • PaLM a Gemini (2022–současnost): Vlajkové modely Google. Gemini je také nativně multimodálním modelem pouze s dekodérem.

Srovnání s ostatními architekturami

Srovnání klíčových architektur na bázi Transformeru
Architektura Hlavní úloha Směr kontextu Typické modely
Pouze s dekodérem Generování textu Jednosměrné (zleva doprava) GPT, LLaMA, Claude, Gemini
Pouze s enkodérem Porozumění textu Obousměrné BERT, RoBERTa
Enkodér-dekodér Převod sekvence na sekvenci Obousměrné (enkodér) + Jednosměrné (dekodér) T5, BART, původní Transformer

Viz také

  • GPT