Decoder-only models (architecture) (HU)
Csak-dekóderes modellek (angol: Decoder-Only Models) — a nagy nyelvi modellek (LLM) domináns architektúraosztálya, amely kizárólag a Transformer architektúra dekódoló részére (dekóderre) épül. Ezek a modellek szöveggenerálási feladatokra specializálódtak, és a legtöbb modern chatbot és AI-asszisztens alapját képezik.
Azt a megközelítést népszerűsítő vezető modellsorozat az OpenAI GPT-modellcsaládja.
Koncepció és architektúra
A csak-dekóderes modellek alapötlete az autoregresszív sorozatgenerálás. Ez azt jelenti, hogy a modell a következő tokent az összes korábban generált token alapján jósolja meg. A bemeneti prompt (a felhasználói kérés) és a már generált szöveg egyetlen sorozatként kezelendő, amelyet a modell folytat.
Architekturálisan a modell azonos dekóderréteg egymásra épített sorozatából áll. Az enkóderrel vagy a teljes dekóderrel ellentétben minden réteg csupán két fő alréteget tartalmaz:
- Maszkolt többfejű önfigyelem (Masked Multi-Head Self-Attention): Ez a kulcsmechanizmus, amely biztosítja az autoregresszív tulajdonságot. A sorozat feldolgozása során egy speciális kauzális maszk (causal mask) megakadályozza, hogy az egyes tokenek „rátekintsenek" a rákövetkező tokenekre. Így a pozícióra vonatkozó előrejelzés kizárólag a pozíciókon lévő tokenektől függ.
- Teljesen összefüggő neurális hálózat (Feed-Forward Network): Nemlineáris transzformációt alkalmaz az egyes tokenek reprezentációjára.
A csak-dekóderes modellekből hiányzik a keresztfigyelem (cross-attention) mechanizmusa, mivel nincs enkóder, amelyre „figyelni" lehetne.
Előtanítási feladatok
A csak-dekóderes modellek egyetlen, ám rendkívül hatékony önfelügyelt feladaton tanulnak:
Kauzális nyelvi modellezés (Causal Language Modeling, CLM)
- Működési elv: A modell megtanulja megjósolni a sorozat következő tokenjét. A tanítás minden lépésénél szövegtöredéket kap bemenetként, és valószínűségi eloszlást kell generálnia a következő tokenre.
- Cél: A helyes következő token valószínűségének maximalizálása hatalmas mennyiségű szöveges adaton. Ez az első pillantásra egyszerűnek tűnő feladat arra kényszeríti a modellt, hogy elsajátítsa a nyelvtant, a szintaxist, a világgal kapcsolatos tényeket és az összetett nyelvi mintázatokat.
Alkalmazások
Autoregresszív természetükből adódóan a csak-dekóderes modellek ideálisan alkalmazhatók minden szöveggenerálást igénylő feladathoz:
- Szabad formátumú szöveggenerálás: Cikkek, versek, forgatókönyvek írása stb.
- Párbeszédes rendszerek és chatbotok: Felhasználói kérdések megválaszolása társalgási stílusban.
- Összefoglalás: Hosszú szövegek tömör kivonatának elkészítése.
- Gépi fordítás: Bár erre a célra gyakran enkóder-dekóderes modelleket alkalmaznak, a csak-dekóderes modellek szintén képesek fordításra, ha a feladatot a promptban fogalmazzák meg (pl. „Fordítsd le angolról magyarra: …").
- Kódírás: Kód generálása szöveges leírás alapján.
- Kontextuson belüli tanulás (In-context learning): Méretüknek köszönhetően a nagy dekóderes modellek képesek új feladatok megoldására, ha csupán néhány példát kapnak (few-shot), vagy akár példák nélkül is (zero-shot), közvetlenül a promptban, anélkül hogy fine-tuningra lenne szükség.
Főbb modellek és fejlődésük
- GPT-sorozat (2018–napjainkig): A megközelítés úttörői és népszerűsítői. A GPT-1 az előtanítás hatékonyságát mutatta meg, a GPT-2 a skálázás erejét demonstrálta, a GPT-3 pedig a few-shot képességek megjelenését hozta el. A ChatGPT és a GPT-4 ezt az architektúrát tette az AI-asszisztensek standardjává.
- LLaMA (2023–napjainkig): A Meta nyílt modellsorozata, amely demokratizálta a hozzáférést a hatékony LLM-ekhez, és innovációs hullámot indított el a közösségben.
- Claude (2023–napjainkig): Az Anthropic modellcsaládja, amely a biztonságra és az irányíthatóságra összpontosít a Constitutional AI segítségével.
- PaLM és Gemini (2022–napjainkig): A Google vezető modelljei. A Gemini emellett natívan multimodális csak-dekóderes modell.
Összehasonlítás más architektúrákkal
| Architektúra | Fő feladat | Kontextus iránya | Tipikus modellek |
|---|---|---|---|
| Csak-dekóderes | Szöveggenerálás | Egyirányú (balról jobbra) | GPT, LLaMA, Claude, Gemini |
| Csak-enkóderes | Szövegértés | Kétirányú | BERT, RoBERTa |
| Enkóder-dekóderes | Sorozatból sorozatba transzformálás | Kétirányú (enkóder) + Egyirányú (dekóder) | T5, BART, eredeti Transformer |
Lásd még
- GPT