---
title: "T5"
source: "https://systems-analysis.info/wiki/T5"
wiki: "systems-analysis.info/wiki"
article: "T5"
language: "ru"
categories:
  - "Категория:Google"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 187
wiki_created_at: 2026-09-06T22:05:01Z
wiki_modified_at: 2026-09-06T22:05:01Z
downloaded_at: 2026-09-07T22:18:09Z
---

# T5

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — это семейство [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), разработанное исследователями Google AI и представленное в 2019 году<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>. Ключевая инновация T5 — это унифицированный фреймворк **«text-to-text»**, который рассматривает любую задачу обработки естественного языка (NLP) как проблему преобразования одной текстовой последовательности в другую. Это позволило использовать единую модель, функцию потерь и процедуру обучения для широкого спектра задач, таких как перевод, суммаризация, ответы на вопросы и классификация<sup>[\[2\]](https://systems-analysis.info/wiki/T5#cite_note-google-blog-t5-2)</sup>.

Модель основана на стандартной архитектуре трансформера «энкодер-декодер», что отличает её от моделей типа [BERT](https://systems-analysis.info/wiki/BERT "BERT") (только энкодер) и [GPT](https://systems-analysis.info/wiki/GPT "GPT") (только декодер). Работа над T5 была задумана как масштабное эмпирическое исследование для систематического изучения и сравнения различных методик трансферного обучения в NLP, а не как создание принципиально нового метода<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>.

## Парадигма «Text-to-Text»

Центральная идея T5 заключается в том, что все задачи формулируются в едином формате. Модель получает на вход текст и генерирует на выходе также текст. Для того чтобы модель могла различать поставленные перед ней задачи, к входной последовательности добавляется специальный текстовый **префикс-инструкция**<sup>[\[2\]](https://systems-analysis.info/wiki/T5#cite_note-google-blog-t5-2)</sup>.

- **Перевод**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Классификация тональности**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Суммаризация**: \`summarize: \[длинный текст статьи\]\` → \`\[краткое изложение\]\`

Этот подход радикально упрощает процесс применения модели, устраняя необходимость в разработке специфических «голов» (*task-specific heads*) для каждой отдельной задачи, что было характерно для архитектур вроде BERT<sup>[\[3\]](https://systems-analysis.info/wiki/T5#cite_note-dhiwise-t5-3)</sup>.

## Архитектура и масштабирование

### Архитектура энкодер-декодер

T5 использует стандартную архитектуру трансформера, состоящую из двух частей<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>:

- **Энкодер**: Обрабатывает всю входную последовательность одновременно, создавая богатое контекстуализированное представление. Как и в BERT, энкодер T5 является **двунаправленным**.
- **Декодер**: Генерирует выходной текст токен за токеном (авторегрессионно), используя представление, полученное от энкодера.

Эта гибридная структура позволяет T5 эффективно решать как задачи на понимание языка, так и задачи на генерацию текста<sup>[\[4\]](https://systems-analysis.info/wiki/T5#cite_note-gfg-t5-4)</sup>.

### Ключевые усовершенствования

Архитектура T5 включает несколько изменений по сравнению с оригинальной моделью трансформера:

- **Относительные позиционные эмбеддинги**: Вместо абсолютных синусоидальных эмбеддингов T5 использует упрощенную, но эффективную форму относительного кодирования позиции, где к логитам внимания добавляется обучаемое скалярное смещение (bias), зависящее только от относительного расстояния между [токенами](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>.
- **Модифицированная нормализация слоев (Layer Norm)**: Нормализация вынесена за пределы остаточного соединения (*residual connection*), и из неё убран аддитивный сдвиг (bias) для повышения стабильности обучения.

### Масштабы модели

В оригинальной работе модель была представлена в нескольких конфигурациях, различающихся количеством параметров, что позволило систематически изучить влияние масштаба<sup>[\[5\]](https://systems-analysis.info/wiki/T5#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 миллионов параметров
- **T5-Base**: ~220 миллионов параметров
- **T5-Large**: ~770 миллионов параметров
- **T5-3B**: ~3 миллиарда параметров
- **T5-11B**: ~11 миллиардов параметров

Исследование показало, что увеличение масштаба модели является одним из самых надежных способов повышения её производительности<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>.

## Предобучение: датасет C4 и задача Span Corruption

### Задача Span Corruption

Для предварительного обучения T5 была выбрана задача шумоподавления (*denoising*), а именно её специфический вариант под названием **повреждение фрагментов (span corruption)**<sup>[\[6\]](https://systems-analysis.info/wiki/T5#cite_note-t5-wikipedia-6)</sup>. Метод работает следующим образом:

1.  Во входном тексте случайным образом маскируется 15% токенов.
2.  В отличие от [метода MLM в BERT](https://systems-analysis.info/wiki/BERT "BERT"), где маскируются отдельные токены, в T5 маскируются целые непрерывные фрагменты (*spans*).
3.  Каждый поврежденный фрагмент заменяется одним уникальным токеном-маской (например, \`\<X\>\`, \`\<Y\>\`).
4.  Модель обучается генерировать на выходе последовательность из удаленных фрагментов, разделенных соответствующими масками.

Этот подход заставляет модель предсказывать целые последовательности текста, что оказалось более эффективной задачей для [предобучения](https://systems-analysis.info/wiki/%D0%9F%D1%80%D0%B5%D0%B4%D0%BE%D0%B1%D1%83%D1%87%D0%B5%D0%BD%D0%B8%D0%B5 "Предобучение"), чем простое языковое моделирование<sup>[\[1\]](https://systems-analysis.info/wiki/T5#cite_note-raffel2020-1)</sup>.

### Датасет C4 (Colossal Clean Crawled Corpus)

Для реализации потенциала трансферного обучения исследователи создали огромный и качественно очищенный набор текстовых данных **C4**, объемом около 750 ГБ<sup>[\[2\]](https://systems-analysis.info/wiki/T5#cite_note-google-blog-t5-2)</sup>. Он был получен путем масштабной очистки и фильтрации общедоступного веб-корпуса **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/wiki/T5#cite_note-c4-dataset-pwc-7)</sup>. Процесс очистки включал удаление дубликатов, шаблонного текста ("Lorem ipsum"), неполных предложений, а также фильтрацию нецензурной лексики<sup>[\[8\]](https://systems-analysis.info/wiki/T5#cite_note-dodge2021-doc-c4-8)</sup>.

### Критика датасета C4

Несмотря на заявленную цель создания «чистого» корпуса, процесс фильтрации C4 подвергся критике за системные смещения. Исследования показали, что фильтр нецензурной лексики непропорционально удалял тексты, связанные с ЛГБТК+ сообществами, а также тексты на афроамериканском английском (AAE)<sup>[\[8\]](https://systems-analysis.info/wiki/T5#cite_note-dodge2021-doc-c4-8)</sup>. Кроме того, в датасете было обнаружено значительное количество оскорбительного и защищенного авторским правом контента. Эти проблемы иллюстрируют сложность создания объективно «качественных» наборов данных и то, как технические решения по фильтрации могут приводить к непреднамеренным социальным смещениям.

## Результаты и производительность

На момент публикации T5 установила новые рекорды производительности (*state-of-the-art*) на множестве бенчмарков, включая **GLUE**, **SuperGLUE**, **SQuAD** и задачи суммиризации<sup>[\[2\]](https://systems-analysis.info/wiki/T5#cite_note-google-blog-t5-2)</sup>. В частности, модель **T5-11B** достигла на **SuperGLUE** результата, близкого к человеческому уровню, продемонстрировав способность справляться с задачами, требующими сложного логического вывода<sup>[\[9\]](https://systems-analysis.info/wiki/T5#cite_note-reddit-superglue-t5-9)</sup>. Эти результаты подтвердили центральную гипотезу исследования: комбинация унифицированного фреймворка, большого масштаба и качественного набора данных является чрезвычайно мощной стратегией для достижения передовых результатов в NLP.

## Эволюция и варианты T5

Подход T5 послужил основой для множества последующих моделей:

- **mT5**: Многоязычная версия T5, обученная на корпусе **mC4**, охватывающем **101 язык**<sup>[\[10\]](https://systems-analysis.info/wiki/T5#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Экспериментальная версия, которая полностью отказывается от токенизации и работает напрямую с **сырыми байтами UTF-8**. Это делает её устойчивой к опечаткам и позволяет обрабатывать любой язык «из коробки»<sup>[\[11\]](https://systems-analysis.info/wiki/T5#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Масштабируемая версия T5, внедрившая архитектуру **Mixture-of-Experts (MoE)**, что позволило увеличить число параметров до триллионов при сохранении разумных вычислительных затрат<sup>[\[12\]](https://systems-analysis.info/wiki/T5#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Это не новая архитектура, а стандартная T5, которая прошла дополнительный этап дообучения на сотнях задач, сформулированных в виде инструкций (*instruction tuning*). Это значительно повысило её способность к обобщению на новые, невиданные задачи в режиме **zero-shot** (без примеров)<sup>[\[13\]](https://systems-analysis.info/wiki/T5#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Модель, развивающая идеи T5, которая использует новый предобучающий объектив под названием **Mixture of Denoisers**, комбинируя различные схемы маскировки текста для улучшения универсальности<sup>[\[14\]](https://systems-analysis.info/wiki/T5#cite_note-tay2022-ul2-14)</sup>.

## См. также

- [Большие языковые модели Google](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8_Google "Большие языковые модели Google")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [GPT](https://systems-analysis.info/wiki/GPT "GPT")
- [Gemma](https://systems-analysis.info/wiki/Gemma "Gemma")
- [LaMDA](https://systems-analysis.info/wiki/LaMDA "LaMDA")

## Ссылки

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">Официальный репозиторий T5 на GitHub</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">Статья в блоге Google Research об исследовании T5</a>

## Литература

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## Примечания

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-3)</sup> <sup>[1,4](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-4)</sup> <sup>[1,5](https://systems-analysis.info/wiki/T5#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/T5#cite_ref-google-blog-t5_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/T5#cite_ref-google-blog-t5_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/T5#cite_ref-google-blog-t5_2-2)</sup> <sup>[2,3](https://systems-analysis.info/wiki/T5#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/wiki/T5#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/wiki/T5#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/wiki/T5#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/wiki/T5#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/wiki/T5#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/T5#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/T5#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/wiki/T5#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/wiki/T5#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/wiki/T5#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/wiki/T5#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/wiki/T5#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/wiki/T5#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
