---
title: "Decoder-only models (architecture) (HU)"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_(HU)"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1537
wiki_created_at: 2026-09-06T22:50:10Z
wiki_modified_at: 2026-09-06T22:50:10Z
downloaded_at: 2026-09-07T22:46:30Z
---

# Decoder-only models (architecture) (HU)

**Csak-dekóderes modellek** (angol: Decoder-Only Models) — a nagy nyelvi modellek (LLM) domináns architektúraosztálya, amely kizárólag a **Transformer** architektúra **dekódoló** részére (dekóderre) épül. Ezek a modellek **szöveggenerálási** feladatokra specializálódtak, és a legtöbb modern chatbot és AI-asszisztens alapját képezik.

Azt a megközelítést népszerűsítő vezető modellsorozat az OpenAI **GPT**-modellcsaládja.

## Koncepció és architektúra

A csak-dekóderes modellek alapötlete az **autoregresszív sorozatgenerálás**. Ez azt jelenti, hogy a modell a következő tokent az összes korábban generált token alapján jósolja meg. A bemeneti prompt (a felhasználói kérés) és a már generált szöveg egyetlen sorozatként kezelendő, amelyet a modell folytat.

Architekturálisan a modell $N$ azonos dekóderréteg egymásra épített sorozatából áll. Az enkóderrel vagy a teljes dekóderrel ellentétben minden réteg csupán két fő alréteget tartalmaz:

1.  **Maszkolt többfejű önfigyelem (Masked Multi-Head Self-Attention):** Ez a kulcsmechanizmus, amely biztosítja az autoregresszív tulajdonságot. A sorozat feldolgozása során egy speciális **kauzális maszk** (causal mask) megakadályozza, hogy az egyes tokenek „rátekintsenek" a rákövetkező tokenekre. Így a $i$ pozícióra vonatkozó előrejelzés kizárólag a $< i$ pozíciókon lévő tokenektől függ.
2.  **Teljesen összefüggő neurális hálózat (Feed-Forward Network):** Nemlineáris transzformációt alkalmaz az egyes tokenek reprezentációjára.

A csak-dekóderes modellekből hiányzik a **keresztfigyelem (cross-attention)** mechanizmusa, mivel nincs enkóder, amelyre „figyelni" lehetne.

## Előtanítási feladatok

A csak-dekóderes modellek egyetlen, ám rendkívül hatékony önfelügyelt feladaton tanulnak:

### Kauzális nyelvi modellezés (Causal Language Modeling, CLM)

- **Működési elv:** A modell megtanulja megjósolni a sorozat következő tokenjét. A tanítás minden lépésénél szövegtöredéket kap bemenetként, és valószínűségi eloszlást kell generálnia a következő tokenre.
- **Cél:** A helyes következő token valószínűségének maximalizálása hatalmas mennyiségű szöveges adaton. Ez az első pillantásra egyszerűnek tűnő feladat arra kényszeríti a modellt, hogy elsajátítsa a nyelvtant, a szintaxist, a világgal kapcsolatos tényeket és az összetett nyelvi mintázatokat.

## Alkalmazások

Autoregresszív természetükből adódóan a csak-dekóderes modellek ideálisan alkalmazhatók minden szöveggenerálást igénylő feladathoz:

- **Szabad formátumú szöveggenerálás:** Cikkek, versek, forgatókönyvek írása stb.
- **Párbeszédes rendszerek és chatbotok:** Felhasználói kérdések megválaszolása társalgási stílusban.
- **Összefoglalás:** Hosszú szövegek tömör kivonatának elkészítése.
- **Gépi fordítás:** Bár erre a célra gyakran enkóder-dekóderes modelleket alkalmaznak, a csak-dekóderes modellek szintén képesek fordításra, ha a feladatot a promptban fogalmazzák meg (pl. „Fordítsd le angolról magyarra: …").
- **Kódírás:** Kód generálása szöveges leírás alapján.
- **Kontextuson belüli tanulás (In-context learning):** Méretüknek köszönhetően a nagy dekóderes modellek képesek új feladatok megoldására, ha csupán néhány példát kapnak (*few-shot*), vagy akár példák nélkül is (*zero-shot*), közvetlenül a promptban, anélkül hogy fine-tuningra lenne szükség.

## Főbb modellek és fejlődésük

- **GPT-sorozat** (2018–napjainkig): A megközelítés úttörői és népszerűsítői. A GPT-1 az előtanítás hatékonyságát mutatta meg, a GPT-2 a skálázás erejét demonstrálta, a GPT-3 pedig a *few-shot* képességek megjelenését hozta el. A ChatGPT és a GPT-4 ezt az architektúrát tette az AI-asszisztensek standardjává.
- **LLaMA** (2023–napjainkig): A Meta nyílt modellsorozata, amely demokratizálta a hozzáférést a hatékony LLM-ekhez, és innovációs hullámot indított el a közösségben.
- **Claude** (2023–napjainkig): Az Anthropic modellcsaládja, amely a biztonságra és az irányíthatóságra összpontosít a **Constitutional AI** segítségével.
- **PaLM** és **Gemini** (2022–napjainkig): A Google vezető modelljei. A Gemini emellett natívan multimodális csak-dekóderes modell.

## Összehasonlítás más architektúrákkal

| Architektúra          | Fő feladat                          | Kontextus iránya                          | Tipikus modellek              |
|-----------------------|-------------------------------------|-------------------------------------------|-------------------------------|
| **Csak-dekóderes**    | Szöveggenerálás                     | Egyirányú (balról jobbra)                 | GPT, LLaMA, Claude, Gemini    |
| **Csak-enkóderes**    | Szövegértés                         | Kétirányú                                 | BERT, RoBERTa                 |
| **Enkóder-dekóderes** | Sorozatból sorozatba transzformálás | Kétirányú (enkóder) + Egyirányú (dekóder) | T5, BART, eredeti Transformer |

Transformer-alapú főbb architektúrák összehasonlítása

## Lásd még

- GPT
