---
title: "Chinchilla"
source: "https://systems-analysis.info/wiki/Chinchilla"
wiki: "systems-analysis.info/wiki"
article: "Chinchilla"
language: "ru"
categories:
  - "Категория:Google"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 79
wiki_created_at: 2026-09-06T21:54:42Z
wiki_modified_at: 2026-09-06T21:54:42Z
downloaded_at: 2026-09-07T22:17:16Z
---

# Chinchilla

**Chinchilla** — это [большая языковая модель](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM), разработанная исследовательской группой DeepMind и представленная в марте 2022 года<sup>[\[1\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-hoffmann2022-1)</sup>. Модель содержит около **70 миллиардов** параметров и была обучена на корпусе текста объемом **1,4 триллиона** [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен").

Ключевой особенностью Chinchilla является её вычислительно-оптимальный подход к обучению. В отличие от предыдущих моделей, где основной упор делался на увеличение числа параметров, Chinchilla была создана на основе гипотезы о необходимости пропорционального масштабирования как размера модели, так и объема обучающих данных. Благодаря этому подходу Chinchilla продемонстрировала превосходство над значительно более крупными моделями, такими как **Gopher** (280 млрд параметров) и **GPT-3** (175 млрд), на широком спектре языковых задач<sup>[\[2\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-wali2022-2)</sup>.

## Предпосылки и история создания

Разработка Chinchilla стала результатом исследования масштабирования LLM, проводимого в DeepMind на основе семейства моделей **Gopher**<sup>[\[3\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-gopher2022-3)</sup>. Модель Gopher, представленная в 2021 году, имела 280 млрд параметров, но была обучена на сравнительно небольшом корпусе в 300 млрд токенов. В то время в отрасли доминировал подход, согласно которому производительность моделей росла в основном за счет увеличения их размера (числа параметров), в то время как объем данных оставался относительно постоянным.

### Гипотеза о вычислительно-оптимальном обучении

Исследователи DeepMind выдвинули гипотезу, что многие крупные модели, включая Gopher, были **недообучены** (*undertrained*) относительно своего размера. Они не достигали максимально возможного качества при заданном вычислительном бюджете, поскольку им не хватало данных для обучения<sup>[\[2\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-wali2022-2)</sup>.

Суть гипотезы заключалась в том, что для оптимального использования вычислительных ресурсов размер модели и объем обучающих данных следует увеличивать **пропорционально** друг другу. Иными словами, при удвоении числа параметров модели необходимо примерно вдвое увеличивать и число обучающих токенов<sup>[\[1\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-hoffmann2022-1)</sup>. Этот вывод расходился с предыдущими исследованиями, которые переоценивали ценность увеличения размера модели, так как проводились при фиксированном объеме данных.

Для проверки этой гипотезы команда DeepMind провела обширные эксперименты, обучив свыше 400 моделей разного размера на наборах данных от 5 до 500 млрд токенов. Результаты подтвердили, что параллельное масштабирование является оптимальной стратегией. На основе этих выводов была разработана модель Chinchilla как практический тест новой парадигмы<sup>[\[4\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-neurips_proc-4)</sup>.

## Архитектура и обучение

### Архитектурные особенности

Chinchilla относится к семейству авторегрессионных трансформеров и по архитектуре близка к моделям GPT-2/GPT-3<sup>[\[3\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-gopher2022-3)</sup>. Она унаследовала многие решения от Gopher, но с ключевыми отличиями, направленными на уменьшение размера при сохранении глубины сети:

- **Параметры**: ~70 млрд параметров, распределенных по 80 слоям.
- **Ширина модели**: Число голов самовнимания было уменьшено до 64 (против 128 у Gopher), а внутренняя размерность слоев — до 8192 (против ~16384 у Gopher).
- **Оптимизатор**: Используется **AdamW** вместо Adam, что улучшает сходимость на больших наборах данных<sup>[\[3\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-gopher2022-3)</sup>.

Такая архитектура позволила Chinchilla сохранить ту же глубину сети, что и Gopher, но при значительно меньшем числе параметров, что снизило требования к памяти и вычислительным ресурсам.

### Масштабирование и данные для обучения

Для проверки гипотезы Chinchilla была обучена с тем же вычислительным бюджетом, что и Gopher, но с перераспределением ресурсов в пользу данных. Модель с 70 млрд параметров была обучена на корпусе в **1,4 триллиона токенов**, что примерно в 4 раза превышает объем данных, использованных для Gopher<sup>[\[1\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-hoffmann2022-1)</sup>.

Это соотношение, примерно **20 токенов на каждый параметр**, стало известно как **точка Chinchilla** (*Chinchilla Point*) и является ориентиром для вычислительно-оптимального обучения современных LLM<sup>[\[5\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-legalgenie-5)</sup>. Эксперимент подтвердил, что Chinchilla, будучи обученной ближе к этому оптимальному пределу, смогла реализовать свой потенциал более полно, чем недообученные, хотя и более крупные, модели.

## Результаты и производительность

На широком наборе стандартных тестов Chinchilla продемонстрировала значительное превосходство над предыдущими моделями. Она уверенно обошла не только Gopher, но и другие современные на тот момент LLM, включая OpenAI GPT-3 (175 млрд параметров) и Megatron-Turing NLG (530 млрд параметров)<sup>[\[1\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-hoffmann2022-1)</sup>.

Наиболее показательным стал результат на комплексном бенчмарке **MMLU** (*Measuring Massive Multitask Language Understanding*), который оценивает знания и рассуждения в сотнях разнородных задач. Chinchilla достигла средней точности **67,5%**, что стало новым рекордом для моделей такого класса и на 7 процентных пунктов превысило результат Gopher<sup>[\[4\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-neurips_proc-4)</sup>.

Помимо высокой эффективности, Chinchilla показала и **экономичность** в использовании. Меньший размер модели (70 млрд против 175+ млрд у аналогов) означает, что для логического вывода (*inference*) и дообучения (*fine-tuning*) требуется значительно меньше вычислительных ресурсов, что упрощает её практическое применение.

## Значение и влияние

Исследование Chinchilla оказало фундаментальное влияние на подходы к обучению больших языковых моделей.

- **Законы масштабирования Chinchilla** (*Chinchilla scaling laws*): Выявленное оптимальное соотношение между размером модели и объемом данных стало де-факто стандартом и ориентиром для последующих разработок в отрасли.
- **Смещение фокуса с размера на данные**: Работа стимулировала индустрию уделять больше внимания созданию, очистке и расширению обучающих корпусов, а не только неизбирательному наращиванию числа параметров.
- **Применение в мультимодальных системах**: Chinchilla была использована в качестве основного языкового компонента в мультимодальной модели DeepMind **Flamingo**, которая способна понимать изображения и текст<sup>[\[6\]](https://systems-analysis.info/wiki/Chinchilla#cite_note-wiki_eng-6)</sup>.

Хотя сама модель Chinchilla не была выпущена в публичный доступ, её концепции и результаты, опубликованные в научной работе, изменили траекторию развития всей области LLM, обозначив путь к более эффективному и сбалансированному росту возможностей искусственного интеллекта.

## См. также

- [Большие языковые модели Google](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8_Google "Большие языковые модели Google")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [Gemini](https://systems-analysis.info/wiki/Gemini "Gemini")
- [Gemma](https://systems-analysis.info/wiki/Gemma "Gemma")
- [LaMDA](https://systems-analysis.info/wiki/LaMDA "LaMDA")

## Литература

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. <a href="https://arxiv.org/abs/1606.08415" class="external text" rel="nofollow">arXiv:1606.08415</a>.
- Loshchilov, I.; Hutter, F. (2017). *Decoupled Weight Decay Regularization*. <a href="https://arxiv.org/abs/1711.05101" class="external text" rel="nofollow">arXiv:1711.05101</a>.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external text" rel="nofollow">arXiv:1909.08053</a>.
- Kaplan, J.; et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Brown, T. B.; et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. <a href="https://arxiv.org/abs/1910.02054" class="external text" rel="nofollow">arXiv:1910.02054</a>.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Rae, J.; et al. (2021). *Scaling Language Models: Methods, Analysis & Insights from Training Gopher*. <a href="https://arxiv.org/abs/2112.11446" class="external text" rel="nofollow">arXiv:2112.11446</a>.
- Hoffmann, J.; et al. (2022). *Training Compute‑Optimal Large Language Models*. <a href="https://arxiv.org/abs/2203.15556" class="external text" rel="nofollow">arXiv:2203.15556</a>.
- Alayrac, J.‑B.; et al. (2022). *Flamingo: A Visual Language Model for Few‑Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Hendrycks, D.; et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.

## Примечания

1.  <span id="cite_note-hoffmann2022-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Chinchilla#cite_ref-hoffmann2022_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Chinchilla#cite_ref-hoffmann2022_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Chinchilla#cite_ref-hoffmann2022_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/Chinchilla#cite_ref-hoffmann2022_1-3)</sup> Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». *NeurIPS 2022*. <a href="https://proceedings.neurips.cc/paper_files/paper/2022/file/c1e2faff6f588870935f114ebe04a3e5-Paper-Conference.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wali2022-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Chinchilla#cite_ref-wali2022_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Chinchilla#cite_ref-wali2022_2-1)</sup> Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». *Analytics India Magazine*. <a href="https://analyticsindiamag.com/ai-news-updates/deepmind-launches-gpt-3-rival-chinchilla/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gopher2022-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/Chinchilla#cite_ref-gopher2022_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/Chinchilla#cite_ref-gopher2022_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/Chinchilla#cite_ref-gopher2022_3-2)</sup> Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». *arXiv:2112.11446*.</span>
4.  <span id="cite_note-neurips_proc-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/Chinchilla#cite_ref-neurips_proc_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/Chinchilla#cite_ref-neurips_proc_4-1)</sup> «Training Compute-Optimal Large Language Models». *proceedings.neurips.cc*.</span>
5.  <span id="cite_note-legalgenie-5">[↑](https://systems-analysis.info/wiki/Chinchilla#cite_ref-legalgenie_5-0) «What is the Chinchilla Point ("Chinchilla Optimal")?». *Legal Genie*.</span>
6.  <span id="cite_note-wiki_eng-6">[↑](https://systems-analysis.info/wiki/Chinchilla#cite_ref-wiki_eng_6-0) «Chinchilla (language model)». *Wikipedia*.</span>
