---
title: "Decoder-only models (architecture) (BG)"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_(BG)"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1529
wiki_created_at: 2026-09-06T22:50:01Z
wiki_modified_at: 2026-09-06T22:50:01Z
downloaded_at: 2026-09-07T22:46:27Z
---

# Decoder-only models (architecture) (BG)

**Модели само-декодер** (англ. Decoder-Only Models) — това е доминиращият клас архитектури на големи езикови модели (LLM), базирани изключително на **декодиращата** част (декодера) на архитектурата **Transformer**. Тези модели са специализирани в задачи за **генериране на текст** и са в основата на повечето съвременни чат-ботове и AI-асистенти.

Флагманската серия, популяризирала този подход, е серията модели **GPT** на OpenAI.

## Концепция и архитектура

Основната идея на моделите само-декодер се състои в **авторегресивното генериране** на последователности. Това означава, че моделът предсказва следващия token, въз основа на всички предишни token-и, генерирани до момента. Входният prompt (заявката на потребителя) и вече генерираният текст се разглеждат като единна последователност, която моделът продължава.

Архитектурно моделът представлява стек от $N$ идентични слоя на декодера. Всеки слой, за разлика от енкодера или пълния декодер, съдържа само два основни подслоя:

1.  **Маскирано многоглаво самовнимание (Masked Multi-Head Self-Attention):** Това е ключовият механизъм, осигуряващ авторегресивното свойство. По време на обработката на последователността специална **каузална маска** (causal mask) не позволява на всеки token да „гледа" към следващите token-и. По този начин предсказването за позиция $i$ зависи единствено от token-ите на позиции $< i$.
2.  **Напълно свързана невронна мрежа (Feed-Forward Network):** Прилага нелинейна трансформация към представянето на всеки token.

В моделите само-декодер липсва механизъм за **кръстосано внимание (cross-attention)**, тъй като няма енкодер, към който да се „насочва внимание".

## Задачи за предварително обучение

Моделите само-декодер се обучават върху една, но изключително мощна самоконтролирана задача:

### Каузално езиково моделиране (Causal Language Modeling, CLM)

- **Принцип на работа:** Моделът се обучава да предсказва следващия token в последователността. На всяка стъпка от обучението той получава на вход фрагмент от текст и трябва да генерира разпределение на вероятностите за следващия token.
- **Цел:** Максимизиране на вероятността за правилния следващ token върху огромни обеми текстови данни. Тази, на пръв поглед проста, задача принуждава модела да изучава граматика, синтаксис, факти за света и сложни закономерности на езика.

## Приложение

Благодарение на своята авторегресивна природа, моделите само-декодер са идеално подходящи за всякакви задачи, изискващи генериране на текст:

- **Свободно генериране на текст:** Писане на статии, стихове, сценарии и т.н.
- **Диалогови системи и чат-ботове:** Отговори на въпроси на потребителите в разговорен стил.
- **Обобщаване:** Създаване на резюме на дълги текстове.
- **Машинен превод:** Въпреки че за тази цел често се използват модели енкодер-декодер, моделите само-декодер също могат да се справят с превода, ако задачата е формулирана в prompt-а (например „Преведи от английски на български: …").
- **Писане на код:** Генериране на код по текстово описание.
- **Обучение в контекст (In-context learning):** Благодарение на мащаба си, големите модели-декодери демонстрират способността да решават нови задачи, след като са получили само няколко примера (*few-shot*) или дори без такива (*zero-shot*) директно в prompt-а, без необходимост от допълнително обучение (fine-tuning).

## Основни модели и тяхната еволюция

- **Серия GPT** (2018 — до днес): Пионери и популяризатори на подхода. GPT-1 показа ефективността на предобучението, GPT-2 демонстрира мощта на мащабирането, а GPT-3 — появата на *few-shot* способности. ChatGPT и GPT-4 превърнаха тази архитектура в стандарт за AI-асистенти.
- **LLaMA** (2023 — до днес): Серия отворени модели от Meta, която демократизира достъпа до мощни LLM и стимулира вълна от иновации в общността.
- **Claude** (2023 — до днес): Семейство модели от Anthropic, фокусирано върху безопасността и управляемостта чрез **Constitutional AI**.
- **PaLM** и **Gemini** (2022 — до днес): Флагманските модели на Google. Gemini е също така нативно мултимодален модел само-декодер.

## Сравнение с други архитектури

| Архитектура         | Основна задача                                        | Посока на контекста                          | Типични модели                   |
|---------------------|-------------------------------------------------------|----------------------------------------------|----------------------------------|
| **Само-декодер**    | Генериране на текст                                   | Еднопосочно (отляво надясно)                 | GPT, LLaMA, Claude, Gemini       |
| **Само-енкодер**    | Разбиране на текст                                    | Двупосочно                                   | BERT, RoBERTa                    |
| **Енкодер-декодер** | Трансформиране на последователност в последователност | Двупосочно (енкодер) + Еднопосочно (декодер) | T5, BART, оригинален Transformer |

Сравнение на ключови архитектури на базата на Transformer

## Вижте също

- GPT
