Decoder-only models (architecture) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Csak-dekóderes modellek (angol: Decoder-Only Models) — a nagy nyelvi modellek (LLM) domináns architektúraosztálya, amely kizárólag a Transformer architektúra dekódoló részére (dekóderre) épül. Ezek a modellek szöveggenerálási feladatokra specializálódtak, és a legtöbb modern chatbot és AI-asszisztens alapját képezik.

Azt a megközelítést népszerűsítő vezető modellsorozat az OpenAI GPT-modellcsaládja.

Koncepció és architektúra

A csak-dekóderes modellek alapötlete az autoregresszív sorozatgenerálás. Ez azt jelenti, hogy a modell a következő tokent az összes korábban generált token alapján jósolja meg. A bemeneti prompt (a felhasználói kérés) és a már generált szöveg egyetlen sorozatként kezelendő, amelyet a modell folytat.

Architekturálisan a modell N azonos dekóderréteg egymásra épített sorozatából áll. Az enkóderrel vagy a teljes dekóderrel ellentétben minden réteg csupán két fő alréteget tartalmaz:

  1. Maszkolt többfejű önfigyelem (Masked Multi-Head Self-Attention): Ez a kulcsmechanizmus, amely biztosítja az autoregresszív tulajdonságot. A sorozat feldolgozása során egy speciális kauzális maszk (causal mask) megakadályozza, hogy az egyes tokenek „rátekintsenek" a rákövetkező tokenekre. Így a i pozícióra vonatkozó előrejelzés kizárólag a <i pozíciókon lévő tokenektől függ.
  2. Teljesen összefüggő neurális hálózat (Feed-Forward Network): Nemlineáris transzformációt alkalmaz az egyes tokenek reprezentációjára.

A csak-dekóderes modellekből hiányzik a keresztfigyelem (cross-attention) mechanizmusa, mivel nincs enkóder, amelyre „figyelni" lehetne.

Előtanítási feladatok

A csak-dekóderes modellek egyetlen, ám rendkívül hatékony önfelügyelt feladaton tanulnak:

Kauzális nyelvi modellezés (Causal Language Modeling, CLM)

  • Működési elv: A modell megtanulja megjósolni a sorozat következő tokenjét. A tanítás minden lépésénél szövegtöredéket kap bemenetként, és valószínűségi eloszlást kell generálnia a következő tokenre.
  • Cél: A helyes következő token valószínűségének maximalizálása hatalmas mennyiségű szöveges adaton. Ez az első pillantásra egyszerűnek tűnő feladat arra kényszeríti a modellt, hogy elsajátítsa a nyelvtant, a szintaxist, a világgal kapcsolatos tényeket és az összetett nyelvi mintázatokat.

Alkalmazások

Autoregresszív természetükből adódóan a csak-dekóderes modellek ideálisan alkalmazhatók minden szöveggenerálást igénylő feladathoz:

  • Szabad formátumú szöveggenerálás: Cikkek, versek, forgatókönyvek írása stb.
  • Párbeszédes rendszerek és chatbotok: Felhasználói kérdések megválaszolása társalgási stílusban.
  • Összefoglalás: Hosszú szövegek tömör kivonatának elkészítése.
  • Gépi fordítás: Bár erre a célra gyakran enkóder-dekóderes modelleket alkalmaznak, a csak-dekóderes modellek szintén képesek fordításra, ha a feladatot a promptban fogalmazzák meg (pl. „Fordítsd le angolról magyarra: …").
  • Kódírás: Kód generálása szöveges leírás alapján.
  • Kontextuson belüli tanulás (In-context learning): Méretüknek köszönhetően a nagy dekóderes modellek képesek új feladatok megoldására, ha csupán néhány példát kapnak (few-shot), vagy akár példák nélkül is (zero-shot), közvetlenül a promptban, anélkül hogy fine-tuningra lenne szükség.

Főbb modellek és fejlődésük

  • GPT-sorozat (2018–napjainkig): A megközelítés úttörői és népszerűsítői. A GPT-1 az előtanítás hatékonyságát mutatta meg, a GPT-2 a skálázás erejét demonstrálta, a GPT-3 pedig a few-shot képességek megjelenését hozta el. A ChatGPT és a GPT-4 ezt az architektúrát tette az AI-asszisztensek standardjává.
  • LLaMA (2023–napjainkig): A Meta nyílt modellsorozata, amely demokratizálta a hozzáférést a hatékony LLM-ekhez, és innovációs hullámot indított el a közösségben.
  • Claude (2023–napjainkig): Az Anthropic modellcsaládja, amely a biztonságra és az irányíthatóságra összpontosít a Constitutional AI segítségével.
  • PaLM és Gemini (2022–napjainkig): A Google vezető modelljei. A Gemini emellett natívan multimodális csak-dekóderes modell.

Összehasonlítás más architektúrákkal

Transformer-alapú főbb architektúrák összehasonlítása
Architektúra Fő feladat Kontextus iránya Tipikus modellek
Csak-dekóderes Szöveggenerálás Egyirányú (balról jobbra) GPT, LLaMA, Claude, Gemini
Csak-enkóderes Szövegértés Kétirányú BERT, RoBERTa
Enkóder-dekóderes Sorozatból sorozatba transzformálás Kétirányú (enkóder) + Egyirányú (dekóder) T5, BART, eredeti Transformer

Lásd még

  • GPT