---
title: "Decoder-only models (architecture) — 仅解码器"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_%E2%80%94_%E4%BB%85%E8%A7%A3%E7%A0%81%E5%99%A8"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_—_仅解码器"
language: "zh"
categories:
  - "Category:Chinese"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1555
wiki_created_at: 2026-09-06T22:50:28Z
wiki_modified_at: 2026-09-06T22:50:28Z
downloaded_at: 2026-09-07T22:46:35Z
---

# Decoder-only models (architecture) — 仅解码器

**仅解码器模型**（Decoder-Only Models）是大语言模型（LLM）的一种主流架构，它完全基于**Transformer**架构的**解码器**（decoder）部分。这些模型专攻**文本生成**任务，是当今大多数聊天机器人和 AI 助手的技术基础。

推广并普及了这种方法的旗舰模型系列是 OpenAI 的 **GPT** 系列。

## 概念与架构

仅解码器模型的核心思想是序列的**自回归生成**（autoregressive generation）。这意味着模型基于所有先前已生成的词元（token）来预测下一个词元。用户的输入提示（prompt）和已生成的文本被视为一个单一序列，模型在此基础上进行续写。

从架构上看，模型由 $N$ 个相同的解码器层堆叠而成。与编码器或完整的解码器不同，每个解码器层仅包含两个主要子层：

1.  **掩码多头自注意力 (Masked Multi-Head Self-Attention):** 这是确保模型具有自回归特性的关键机制。在处理序列时，一个特殊的**因果掩码** (causal mask) 会阻止每个词元“看到”其后的词元。因此，对位置 $i$ 的预测仅依赖于位置 $< i$ 的词元。
2.  **前馈神经网络 (Feed-Forward Network):** 对每个词元的表示应用非线性变换。

在仅解码器模型中，没有**交叉注意力 (cross-attention)**机制，因为不存在可供“关注”的编码器。

## 预训练任务

仅解码器模型通过一项强大而单一的自监督任务进行训练：

### 因果语言建模 (Causal Language Modeling, CLM)

- **工作原理：** 模型学习预测序列中的下一个词元。在每个训练步骤中，它接收一段文本作为输入，并需要为下一个词元生成概率分布。
- **目标：** 在海量文本数据上，最大化预测出正确下一个词元的概率。这个看似简单的任务迫使模型学习语法、句法、世界知识以及复杂的语言规律。

## 应用

由于其自回归的特性，仅解码器模型非常适合任何需要生成文本的任务：

- **自由形式的文本生成：** 撰写文章、诗歌、剧本等。
- **对话系统和聊天机器人：** 以对话方式回答用户问题。
- **文本摘要：** 为长篇文章生成简明摘要。
- **机器翻译：** 尽管编码器-解码器模型更常用于此任务，但仅解码器模型也能处理翻译，只要在提示中明确说明任务即可（例如，“将以下英文翻译成中文：...”）。
- **代码编写：** 根据文本描述生成代码。
- **上下文学习 (In-context learning):** 凭借其庞大的规模，大型解码器模型展现出解决新任务的能力，只需在提示中提供少量示例（*few-shot*）甚至无需示例（*zero-shot*），而无需进行微调（fine-tuning）。

## 主要模型及其演进

- **GPT** 系列 (2018-至今): 该方法的先驱和推广者。GPT-1 验证了预训练的有效性，GPT-2 展示了规模化的力量，而 GPT-3 则催生了 *few-shot* 能力。ChatGPT 和 GPT-4 使该架构成为 AI 助手的行业标准。
- **LLaMA** (2023-至今): Meta推出的一系列开源模型，使强大的 LLM 更加普及，并激励了社区的创新浪潮。
- **Claude** (2023-至今): Anthropic 开发的模型系列，通过 **Constitutional AI** （宪法 AI）技术专注于安全性和可控性。
- **PaLM** 与 **Gemini** (2022-至今): Google 的旗舰模型。Gemini 也是一个原生的多模态仅解码器模型。

## 与其他架构的比较

| 架构              | 主要任务       | 上下文方向                     | 典型模型                   |
|-------------------|----------------|--------------------------------|----------------------------|
| **仅解码器**      | 文本生成       | 单向（从左到右）               | GPT, LLaMA, Claude, Gemini |
| **仅编码器**      | 文本理解       | 双向                           | BERT, RoBERTa              |
| **编码器-解码器** | 序列到序列转换 | 双向（编码器）+ 单向（解码器） | T5, BART, 原始 Transformer |

基于 Transformer 的关键架构比较

## 参见

- GPT
