---
title: "T5 (Text-to-Text Transfer Transformer) — T5（文本到文本转换模型）"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_—_T5（文本到文本转换模型）"
language: "zh"
categories:
  - "Category:Chinese"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7832
wiki_created_at: 2026-09-07T01:07:39Z
wiki_modified_at: 2026-09-07T01:07:39Z
downloaded_at: 2026-09-07T23:21:03Z
---

# T5 (Text-to-Text Transfer Transformer) — T5（文本到文本转换模型）

**T5**（**T**ext-to-**T**ext **T**ransfer **T**ransformer）是 Google AI 研究人员开发的一个大型语言模型家族，于 2019 年发布<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>。T5 的关键创新是一个统一的**“文本到文本”（text-to-text）**框架，它将任何自然语言处理（NLP）任务都视为将一个文本序列转换为另一个文本序列的问题。这使得可以用单一模型、损失函数和训练流程来处理翻译、摘要、问答和分类等各种任务<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-google-blog-t5-2)</sup>。

该模型基于标准的“编码器-解码器” Transformer 架构，这使其区别于 BERT（仅编码器）和 GPT（仅解码器）等模型。T5 的工作旨在进行一项大规模的实证研究，以系统地探索和比较 NLP 中不同的迁移学习技术，而不是创造一种全新的方法<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>。

## “文本到文本”范式

T5 的核心思想是将所有任务统一表述为相同的格式。模型接收文本输入，并生成文本输出。为了让模型能够区分不同的任务，输入序列前会添加一个特定的文本**任务前缀**<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-google-blog-t5-2)</sup>。

- **翻译**：\`translate English to German: That is good.\` → \`Das ist gut.\`
- **情感分类**：\`sst2 sentence: a very exciting film.\` → \`positive\`
- **摘要**：\`summarize: \[一篇长文章的文本\]\` → \`\[简短的摘要\]\`

这种方法极大地简化了模型的应用过程，无需为每个特定任务开发专用的“头”（*task-specific heads*），而这正是像 BERT 这样的架构的特点<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-dhiwise-t5-3)</sup>。

## 架构与规模

### 编码器-解码器架构

T5 采用标准的 Transformer 架构，由两部分组成<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>：

- **编码器**：同时处理整个输入序列，生成丰富的上下文表示。与 BERT 类似，T5 的编码器是**双向的**。
- **解码器**：利用编码器提供的表示，逐个 token（自回归地）生成输出文本。

这种混合结构使 T5 能够有效解决语言理解和文本生成两类任务<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-gfg-t5-4)</sup>。

### 关键改进

与原始 Transformer 模型相比，T5 的架构包含几项改动：

- **相对位置嵌入**：T5 不使用绝对的正弦位置嵌入，而是采用一种简化但高效的相对位置编码形式，其中注意力 logits 会加上一个可学习的标量偏移（bias），该偏移仅取决于 token 之间的相对距离<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>。
- **改进的层归一化（Layer Norm）**：为了提高训练稳定性，层归一化被移到了残差连接（*residual connection*）之外，并且移除了其中的加性偏移（bias）。

### 模型规模

在最初的论文中，该模型被分为几种不同参数数量的配置，以便系统地研究模型规模的影响<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-huggingface-t5-doc-5)</sup>：

- **T5-Small**：约 6000 万参数
- **T5-Base**：约 2.2 亿参数
- **T5-Large**：约 7.7 亿参数
- **T5-3B**：约 30 亿参数
- **T5-11B**：约 110 亿参数

研究表明，扩大模型规模是提升其性能最可靠的方法之一<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>。

## 预训练：C4 数据集与 Span Corruption 任务

### Span Corruption 任务

T5 的预训练选择了一种去噪（*denoising*）任务，具体来说是一种名为**片段损坏（span corruption）**的变体<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-t5-wikipedia-6)</sup>。该方法的工作流程如下：

1.  在输入文本中，随机屏蔽 15% 的 token。
2.  与 BERT 的 MLM 方法不同（该方法屏蔽单个 token），T5 屏蔽的是连续的文本片段（*spans*）。
3.  每个损坏的片段被替换为一个唯一的掩码 token（例如 \`\<X\>\`、\`\<Y\>\`）。
4.  模型被训练来生成由相应掩码分隔的、被移除的文本片段序列。

这种方法迫使模型预测整个文本序列，事实证明，这比简单的语言建模是一种更有效的预训练任务<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-raffel2020-1)</sup>。

### C4 数据集 (Colossal Clean Crawled Corpus)

为了发挥迁移学习的潜力，研究人员创建了一个巨大且经过高质量清洗的文本数据集 **C4**，其大小约为 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-google-blog-t5-2)</sup>。它通过对公开的网络语料库 **Common Crawl**进行大规模清洗和过滤而获得<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-c4-dataset-pwc-7)</sup>。清洗过程包括删除重复内容、样板文字（“Lorem ipsum”）、不完整的句子，以及过滤不雅词汇<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-dodge2021-doc-c4-8)</sup>。

### 对 C4 数据集的批评

尽管 C4 的目标是创建一个“干净”的语料库，但其过滤过程因存在系统性偏见而受到批评。研究表明，其不雅词汇过滤器不成比例地移除了与 LGBTQ+ 社群相关的文本，以及非裔美国人英语（AAE）的文本<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-dodge2021-doc-c4-8)</sup>。此外，数据集中还发现了大量冒犯性和受版权保护的内容。这些问题说明了创建客观“高质量”数据集的复杂性，以及技术性的过滤决策如何可能导致意想不到的社会偏见。

## 结果与性能

在发布时，T5 在众多基准测试中创造了新的最高水平（*state-of-the-art*）记录，包括 **GLUE**、**SuperGLUE**、**SQuAD** 和摘要任务<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-google-blog-t5-2)</sup>。特别是，**T5-11B** 模型在 **SuperGLUE** 上取得了接近人类水平的成绩，展示了其处理需要复杂逻辑推理任务的能力<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-reddit-superglue-t5-9)</sup>。这些结果证实了该研究的核心假设：统一框架、大规模模型和高质量数据集的结合，是实现 NLP 领域顶尖成果的极其强大的策略。

## T5 的演进与变体

T5 的方法为后续众多模型奠定了基础：

- **mT5**：T5 的多语言版本，在覆盖 **101 种语言**的 **mC4** 语料库上训练<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-xue2020-mt5-10)</sup>。
- **ByT5**：一个实验性版本，完全放弃了 tokenization，直接处理**原始 UTF-8 字节**。这使其能够抵抗拼写错误，并能“开箱即用”地处理任何语言<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-xue2022-byt5-11)</sup>。
- **Switch Transformer**：T5 的一个可扩展版本，引入了**专家混合（Mixture-of-Experts, MoE）**架构，从而在保持合理计算成本的同时，将参数数量扩展至万亿级别<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-fedus2021-switch-12)</sup>。
- **FLAN-T5**：这不是一种新架构，而是标准的 T5 模型经过了额外的微调阶段，使用了数百个以指令形式（*instruction tuning*）表述的任务进行训练。这显著提升了其在**零样本（zero-shot）**（无示例）模式下对未见过的新任务的泛化能力<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-chung2022-flan-13)</sup>。
- **UL2**：该模型发展了 T5 的思想，采用了一种名为**去噪器混合（Mixture of Denoisers）**的新预训练目标，通过组合不同的文本掩码方案来提高通用性<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_note-tay2022-ul2-14)</sup>。

## 外部链接

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">T5 在 GitHub 上的官方代码库</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">Google Research 博客上关于 T5 研究的文章</a>

## 参考文献

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## 注释

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5%EF%BC%88%E6%96%87%E6%9C%AC%E5%88%B0%E6%96%87%E6%9C%AC%E8%BD%AC%E6%8D%A2%E6%A8%A1%E5%9E%8B%EF%BC%89#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
