---
title: "Decoder-only"
source: "https://systems-analysis.info/wiki/Decoder-only"
wiki: "systems-analysis.info/wiki"
article: "Decoder-only"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 85
wiki_created_at: 2026-09-06T21:54:46Z
wiki_modified_at: 2026-09-06T21:54:46Z
downloaded_at: 2026-09-07T22:17:18Z
---

# Decoder-only

**Модели только-декодер** (англ. Decoder-Only Models) — это доминирующий класс архитектур [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM), основанных исключительно на **декодирующей** части (декодере) архитектуры **[Трансформер](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")**. Эти модели специализируются на задачах **генерации текста** и являются основой для большинства современных чат-ботов и AI-ассистентов.

Флагманской линейкой, популяризовавшей этот подход, является серия моделей **[GPT](https://systems-analysis.info/wiki/GPT "GPT")** от OpenAI.

## Концепция и архитектура

Основная идея моделей только-декодер заключается в **авторегрессионной генерации** последовательностей. Это означает, что модель предсказывает следующий токен, основываясь на всех предыдущих токенах, которые были сгенерированы до этого. Входной промпт (запрос пользователя) и уже сгенерированный текст рассматриваются как единая последовательность, которую модель продолжает.

Архитектурно, модель представляет собой стек из $N$ идентичных слоёв декодера. Каждый слой, в отличие от энкодера или полного декодера, содержит только два основных подслоя:

1.  **Маскированное многоголовое самовнимание (Masked Multi-Head Self-Attention):** Это ключевой механизм, обеспечивающий авторегрессионное свойство. Во время обработки последовательности специальная **каузальная маска** (causal mask) не позволяет каждому токену «смотреть» на последующие токены. Таким образом, предсказание для позиции $i$ зависит только от токенов на позициях $< i$.
2.  **Полносвязная нейронная сеть (Feed-Forward Network):** Применяет нелинейное преобразование к представлению каждого токена.

В моделях только-декодер отсутствует механизм **перекрёстного внимания (cross-attention)**, так как нет энкодера, на который можно было бы «обращать внимание».

## Задачи предварительного обучения

Модели только-декодер обучаются на одной, но очень мощной самоконтролируемой задаче:

### Каузальное языковое моделирование (Causal Language Modeling, CLM)

- **Принцип работы:** Модель обучается предсказывать следующий токен в последовательности. На каждом шаге обучения она получает на вход фрагмент текста и должна сгенерировать распределение вероятностей для следующего токена.
- **Цель:** Максимизировать вероятность правильного следующего токена на огромных объёмах текстовых данных. Эта простая, на первый взгляд, задача заставляет модель изучать грамматику, синтаксис, факты о мире и сложные закономерности языка.

## Применение

Благодаря своей авторегрессионной природе, модели только-декодер идеально подходят для любых задач, требующих генерации текста:

- **Генерация текста в свободном виде:** Написание статей, стихов, сценариев и т.д.
- **Диалоговые системы и чат-боты:** Ответы на вопросы пользователей в разговорном стиле.
- **Суммаризация:** Создание краткого содержания длинных текстов.
- **Машинный перевод:** Хотя для этого часто используются модели энкодер-декодер, модели только-декодер также могут справляться с переводом, если задача сформулирована в промпте (например, «Переведи с английского на русский: ...»).
- **Написание кода:** Генерация кода по текстовому описанию.
- **Обучение в контексте (In-context learning):** Благодаря масштабу, большие модели-декодеры демонстрируют способность решать новые задачи, получив всего несколько примеров (*few-shot*) или даже без них (*zero-shot*) прямо в промпте, без необходимости дообучения (fine-tuning).

## Основные модели и их эволюция

- **Серия [GPT](https://systems-analysis.info/wiki/GPT "GPT")** (2018-н.в.): Пионеры и популяризаторы подхода. GPT-1 показал эффективность предобучения, GPT-2 продемонстрировал мощь масштабирования, а GPT-3 — появление *few-shot* способностей. ChatGPT и GPT-4 сделали эту архитектуру стандартом для AI-ассистентов.
- **[LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA")** (2023-н.в.): Серия открытых моделей от Meta, которая демократизировала доступ к мощным LLM и стимулировала волну инноваций в сообществе.
- **[Claude](https://systems-analysis.info/wiki/Claude "Claude")** (2023-н.в.): Семейство моделей от Anthropic, сфокусированное на безопасности и управляемости с помощью **Constitutional AI**.
- **[PaLM](https://systems-analysis.info/wiki/PaLM "PaLM")** и **[Gemini](https://systems-analysis.info/wiki/Gemini "Gemini")** (2022-н.в.): Флагманские модели Google. Gemini также является нативно мультимодальной моделью только-декодер.

## Сравнение с другими архитектурами

| Архитектура         | Основная задача                                        | Направление контекста                                  | Типичные модели                                                                                                                                                                                                                            |
|---------------------|--------------------------------------------------------|--------------------------------------------------------|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| **Только-декодер**  | Генерация текста                                       | Однонаправленное (слева направо)                       | [GPT](https://systems-analysis.info/wiki/GPT "GPT"), [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA"), [Claude](https://systems-analysis.info/wiki/Claude "Claude"), [Gemini](https://systems-analysis.info/wiki/Gemini "Gemini") |
| **Только-энкодер**  | Понимание текста                                       | Двунаправленное                                        | BERT, RoBERTa                                                                                                                                                                                                                              |
| **Энкодер-декодер** | Преобразование последовательности в последовательность | Двунаправленное (энкодер) + Однонаправленное (декодер) | [T5](https://systems-analysis.info/wiki/T5 "T5"), BART, оригинальный Transformer                                                                                                                                                           |

Сравнение ключевых архитектур на основе Трансформера

## См. также

- [GPT](https://systems-analysis.info/wiki/GPT "GPT")
