---
title: "Chinchilla (language model) — 龙猫"
source: "https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB"
wiki: "systems-analysis.info/int"
article: "Chinchilla_(language_model)_—_龙猫"
language: "zh"
categories:
  - "Category:Chinese"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 918
wiki_created_at: 2026-09-06T22:40:43Z
wiki_modified_at: 2026-09-06T22:40:43Z
downloaded_at: 2026-09-07T22:43:05Z
---

# Chinchilla (language model) — 龙猫

**Chinchilla**（龙猫）是由研究团队 DeepMind 开发的一款大型语言模型（LLM），于2022年3月发布<sup>[\[1\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-hoffmann2022-1)</sup>。该模型包含约**700亿**个参数，并在一个包含**1.4万亿**词元（token）的文本语料库上进行了训练。

Chinchilla 的一个关键特点是其计算最优的训练方法。与以往主要关注增加参数数量的模型不同，Chinchilla 的创建基于一个假设，即模型大小和训练数据量需要按比例扩展。得益于这种方法，Chinchilla 在广泛的语言任务上表现优于参数量远大于自身的模型，例如 **Gopher**（2800亿参数）和 **GPT-3**（1750亿参数）<sup>[\[2\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-wali2022-2)</sup>。

## 背景与创建历史

Chinchilla 的开发是 DeepMind 基于 **Gopher** 模型家族进行 LLM 扩展研究的成果<sup>[\[3\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-gopher2022-3)</sup>。于2021年发布的 Gopher 模型拥有2800亿参数，但其训练语料库相对较小，仅有3000亿词元。当时，行业内的主流观点认为，模型的性能主要通过增加其规模（参数数量）来提升，而数据量则保持相对稳定。

### 计算最优训练假说

DeepMind 的研究人员提出一个假说，认为许多大型模型（包括 Gopher）相对于其规模而言**训练不足**（*undertrained*）。由于缺乏足够的训练数据，这些模型在给定的计算预算下未能达到其可能实现的最高性能<sup>[\[2\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-wali2022-2)</sup>。

该假说的核心在于，为了最优化地利用计算资源，模型大小和训练数据量应**按比例**增加。换言之，当模型参数数量翻倍时，训练词元的数量也应大致翻倍<sup>[\[1\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-hoffmann2022-1)</sup>。这一结论与先前的研究相悖，因为那些研究是在数据量固定的情况下进行的，从而高估了增加模型大小的价值。

为了验证这一假说，DeepMind 团队进行了广泛的实验，在50亿到5000亿词元的数据集上训练了超过400个不同规模的模型。结果证实，并行扩展是最佳策略。基于这些发现，Chinchilla 模型被开发出来，作为对新范式的实践检验<sup>[\[4\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-neurips_proc-4)</sup>。

## 架构与训练

### 架构特点

Chinchilla 属于自回归 Transformer 家族，其架构与 GPT-2/GPT-3 模型相似<sup>[\[3\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-gopher2022-3)</sup>。它继承了 Gopher 的许多设计，但在关键方面有所不同，旨在减小模型规模的同时保持网络深度：

- **参数**：约700亿参数，分布在80个层中。
- **模型宽度**：自注意力头的数量减少到64个（Gopher为128个），层的内部维度减少到8192（Gopher约为16384）。
- **优化器**：使用 **AdamW** 代替 Adam，这改善了在大型数据集上的收敛性<sup>[\[3\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-gopher2022-3)</sup>。

这种架构使得 Chinchilla 能够在参数数量显著减少的情况下，保持与 Gopher 相同的网络深度，从而降低了对内存和计算资源的需求。

### 扩展与训练数据

为了验证假说，Chinchilla 的训练使用了与 Gopher 相同的计算预算，但将资源重新分配，更侧重于数据。这个拥有700亿参数的模型在一个包含**1.4万亿词元**的语料库上进行训练，数据量约是 Gopher 的4倍<sup>[\[1\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-hoffmann2022-1)</sup>。

这个比例，即**每个参数约20个词元**，被称为**“Chinchilla点”**（*Chinchilla Point*），并成为现代 LLM 计算最优训练的一个参考基准<sup>[\[5\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-legalgenie-5)</sup>。实验证实，由于 Chinchilla 的训练更接近这一最优极限，它比那些虽然更大但训练不足的模型更能充分发挥其潜力。

## 结果与性能

在一系列广泛的标准测试中，Chinchilla 表现出比以往模型显著的优势。它不仅轻松超越了 Gopher，还超过了当时其他先进的 LLM，包括 OpenAI GPT-3（1750亿参数）和 Megatron-Turing NLG（5300亿参数）<sup>[\[1\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-hoffmann2022-1)</sup>。

最具代表性的成果是在综合基准测试**MMLU**（*Measuring Massive Multitask Language Understanding*）上的表现，该测试评估模型在数百个不同任务中的知识和推理能力。Chinchilla 取得了**67.5%**的平均准确率，创下了同类模型的新纪录，比 Gopher 的结果高出7个百分点<sup>[\[4\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-neurips_proc-4)</sup>。

除了高效性，Chinchilla 还展现了其**经济性**。较小的模型规模（700亿参数，而同类模型为1750亿以上）意味着其逻辑推理（*inference*）和微调（*fine-tuning*）所需的计算资源要少得多，这简化了其在实际应用中的部署。

## 意义与影响

关于 Chinchilla 的研究对大型语言模型的训练方法产生了深远影响。

- **Chinchilla缩放定律**（*Chinchilla scaling laws*）：研究所揭示的模型大小与数据量之间的最优比例，已成为行业后续开发的准标准和指南。
- **焦点从模型大小转向数据**：这项工作促使业界更加关注训练语料库的创建、清洗和扩展，而不仅仅是盲目增加参数数量。
- **在多模态系统中的应用**：Chinchilla 被用作 DeepMind 多模态模型**Flamingo**的核心语言组件，该模型能够理解图像和文本<sup>[\[6\]](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_note-wiki_eng-6)</sup>。

尽管 Chinchilla 模型本身未公开发布，但其在科学论文中发表的概念和成果改变了整个 LLM 领域的发展轨迹，为实现人工智能能力更高效、更均衡的增长指明了方向。

## 参考文献

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. <a href="https://arxiv.org/abs/1606.08415" class="external text" rel="nofollow">arXiv:1606.08415</a>.
- Loshchilov, I.; Hutter, F. (2017). *Decoupled Weight Decay Regularization*. <a href="https://arxiv.org/abs/1711.05101" class="external text" rel="nofollow">arXiv:1711.05101</a>.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external text" rel="nofollow">arXiv:1909.08053</a>.
- Kaplan, J.; et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Brown, T. B.; et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. <a href="https://arxiv.org/abs/1910.02054" class="external text" rel="nofollow">arXiv:1910.02054</a>.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Rae, J.; et al. (2021). *Scaling Language Models: Methods, Analysis & Insights from Training Gopher*. <a href="https://arxiv.org/abs/2112.11446" class="external text" rel="nofollow">arXiv:2112.11446</a>.
- Hoffmann, J.; et al. (2022). *Training Compute‑Optimal Large Language Models*. <a href="https://arxiv.org/abs/2203.15556" class="external text" rel="nofollow">arXiv:2203.15556</a>.
- Alayrac, J.‑B.; et al. (2022). *Flamingo: A Visual Language Model for Few‑Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Hendrycks, D.; et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.

## 注释

1.  <span id="cite_note-hoffmann2022-1">↑ <sup>[1.0](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-hoffmann2022_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-hoffmann2022_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-hoffmann2022_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-hoffmann2022_1-3)</sup> Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». *NeurIPS 2022*. <a href="https://proceedings.neurips.cc/paper_files/paper/2022/file/c1e2faff6f588870935f114ebe04a3e5-Paper-Conference.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wali2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-wali2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-wali2022_2-1)</sup> Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». *Analytics India Magazine*. <a href="https://analyticsindiamag.com/ai-news-updates/deepmind-launches-gpt-3-rival-chinchilla/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gopher2022-3">↑ <sup>[3.0](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-gopher2022_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-gopher2022_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-gopher2022_3-2)</sup> Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». *arXiv:2112.11446*.</span>
4.  <span id="cite_note-neurips_proc-4">↑ <sup>[4.0](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-neurips_proc_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-neurips_proc_4-1)</sup> «Training Compute-Optimal Large Language Models». *proceedings.neurips.cc*.</span>
5.  <span id="cite_note-legalgenie-5">[↑](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-legalgenie_5-0) «What is the Chinchilla Point ("Chinchilla Optimal")?». *Legal Genie*.</span>
6.  <span id="cite_note-wiki_eng-6">[↑](https://systems-analysis.info/int/Chinchilla_(language_model)_%E2%80%94_%E9%BE%99%E7%8C%AB#cite_ref-wiki_eng_6-0) «Chinchilla (language model)». *Wikipedia*.</span>
