---
title: "T5 (Text-to-Text Transfer Transformer) — T5"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_—_T5"
language: "ja"
categories:
  - "Category:Google"
  - "Category:Japanese"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7831
wiki_created_at: 2026-09-07T01:07:39Z
wiki_modified_at: 2026-09-07T01:07:39Z
downloaded_at: 2026-09-07T23:21:02Z
---

# T5 (Text-to-Text Transfer Transformer) — T5

**T5**（**T**ext-to-**T**ext **T**ransfer **T**ransformer）は、Google AIの研究者によって開発され、2019年に発表された大規模言語モデルのファミリーです<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>。T5の主要な革新は、統一された**「text-to-text」**フレームワークであり、あらゆる自然言語処理（NLP）タスクを、あるテキストシーケンスを別のテキストシーケンスに変換する問題として扱います。これにより、翻訳、要約、質疑応答、分類といった幅広いタスクに対して、単一のモデル、損失関数、学習手順を使用することが可能になりました<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-google-blog-t5-2)</sup>。

モデルは標準的な「エンコーダー・デコーダー」トランスフォーマーアーキテクチャに基づいており、この点がBERT（エンコーダーのみ）やGPT（デコーダーのみ）のようなモデルとは異なります。T5に関する研究は、根本的に新しい手法を創造するというよりは、NLPにおける様々な転移学習の手法を体系的に調査・比較するための大規模な実証研究として考案されました<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>。

## Text-to-Text Paradigm - Text-to-Textパラダイム

T5の中心的なアイデアは、すべてのタスクが統一された形式で定式化されることです。モデルは入力としてテキストを受け取り、出力としてもテキストを生成します。モデルが与えられたタスクを区別できるように、入力シーケンスには特別なテキストの**プレフィックス（指示）**が追加されます<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-google-blog-t5-2)</sup>。

- **翻訳**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **感情分類**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **要約**: \`summarize: \[記事の長いテキスト\]\` → \`\[短い要約\]\`

このアプローチは、BERTのようなアーキテクチャで特徴的だった、個々のタスクごとに特有の「ヘッド」（*task-specific heads*）を開発する必要性をなくし、モデルの適用プロセスを根本的に簡素化します<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-dhiwise-t5-3)</sup>。

## アーキテクチャとスケーリング

### エンコーダー・デコーダーアーキテクチャ

T5は、2つの部分から構成される標準的なトランスフォーマーアーキテクチャを使用します<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>：

- **エンコーダー**: 入力シーケンス全体を一度に処理し、文脈に応じた豊富な表現を生成します。BERTと同様に、T5のエンコーダーは**双方向**です。
- **デコーダー**: エンコーダーから受け取った表現を使用して、出力テキストをトークンごとに（自己回帰的に）生成します。

このハイブリッド構造により、T5は言語理解タスクとテキスト生成タスクの両方を効率的に解決できます<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-gfg-t5-4)</sup>。

### 主な改良点

T5のアーキテクチャには、オリジナルのトランスフォーマーモデルと比較していくつかの変更点が含まれています：

- **相対位置エンベディング**: 絶対的な正弦波エンベディングの代わりに、T5は単純でありながら効果的な形式の相対位置エンコーディングを使用します。この方法では、アテンションのロジットに、トークン間の相対的な距離のみに依存する学習可能なスカラーバイアスが追加されます<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>。
- **修正されたレイヤー正規化（Layer Norm）**: 正規化は残差接続（*residual connection*）の外側に移動され、学習の安定性を向上させるために加算的なバイアスが削除されています。

### モデルのスケール

オリジナルの論文では、モデルはパラメータ数が異なるいくつかの構成で提示され、これによりスケールの影響を体系的に調査することが可能になりました<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-huggingface-t5-doc-5)</sup>：

- **T5-Small**: 約6000万パラメータ
- **T5-Base**: 約2億2000万パラメータ
- **T5-Large**: 約7億7000万パラメータ
- **T5-3B**: 約30億パラメータ
- **T5-11B**: 約110億パラメータ

この研究は、モデルのスケールを拡大することが、その性能を向上させる最も確実な方法の一つであることを示しました<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>。

## Pre-training: C4 Dataset and Span Corruption Task - 事前学習：C4データセットとSpan Corruptionタスク

### Span Corruption Task - Span Corruptionタスク

T5の事前学習には、ノイズ除去（*denoising*）タスク、具体的には**スパン破壊（span corruption）**と呼ばれる特定のバリアントが選ばれました<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-t5-wikipedia-6)</sup>。この手法は次のように機能します：

1.  入力テキスト内のトークンの15%がランダムにマスクされます。
2.  個々のトークンがマスクされるBERTにおけるMLM手法とは異なり、T5では連続したフラグメント（*spans*）全体がマスクされます。
3.  破壊された各スパンは、単一のユニークなマスク・トークン（例：\`\<X\>\`, \`\<Y\>\`）に置き換えられます。
4.  モデルは、対応するマスクで区切られた、削除されたフラグメントのシーケンスを出力するように学習します。

このアプローチにより、モデルはテキストのシーケンス全体を予測する必要があり、これは単純な言語モデリングよりも効果的な事前学習タスクであることが示されました<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-raffel2020-1)</sup>。

### C4 Dataset (Colossal Clean Crawled Corpus) - C4データセット（Colossal Clean Crawled Corpus）

転移学習の可能性を実現するため、研究者たちは約750GBの容量を持つ、巨大で高品質にクリーンアップされたテキストデータセット**C4**を作成しました<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-google-blog-t5-2)</sup>。これは、一般公開されているウェブコーパス**Common Crawl**を大規模にクリーンアップおよびフィルタリングすることによって得られました<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-c4-dataset-pwc-7)</sup>。クリーンアッププロセスには、重複の削除、定型文（「Lorem ipsum」）、不完全な文の除去、および不適切な語彙のフィルタリングが含まれていました<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-dodge2021-doc-c4-8)</sup>。

### C4データセットへの批判

「クリーンな」コーパスを作成するという公言された目標にもかかわらず、C4のフィルタリングプロセスは体系的なバイアスについて批判を受けています。研究により、不適切な語彙フィルターがLGBTQ+コミュニティに関連するテキストやアフリカ系アメリカ人英語（AAE）のテキストを不均衡に削除していることが示されました<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-dodge2021-doc-c4-8)</sup>。さらに、データセット内には相当量の攻撃的なコンテンツや著作権で保護されたコンテンツが発見されました。これらの問題は、客観的に「質の高い」データセットを作成することの難しさと、フィルタリングに関する技術的な決定が意図しない社会的バイアスをどのように引き起こすかを例証しています。

## 結果とパフォーマンス

発表当時、T5は**GLUE**、**SuperGLUE**、**SQuAD**、要約タスクなど、多くのベンチマークで新たな最高性能（*state-of-the-art*）を記録しました<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-google-blog-t5-2)</sup>。特に、**T5-11B**モデルは**SuperGLUE**で人間レベルに近い結果を達成し、複雑な論理的推論を必要とするタスクに対応できる能力を示しました<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-reddit-superglue-t5-9)</sup>。これらの結果は、研究の中心的な仮説を裏付けました。すなわち、統一されたフレームワーク、大規模なスケール、そして質の高いデータセットの組み合わせが、NLPで最先端の結果を達成するための極めて強力な戦略であるということです。

## T5の進化とバリエーション

T5のアプローチは、その後の多くのモデルの基礎となりました：

- **mT5**: **101言語**をカバーする**mC4**コーパスで学習されたT5の多言語版<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-xue2020-mt5-10)</sup>。
- **ByT5**: トークン化を完全に排除し、**生のUTF-8バイト**で直接動作する実験的なバージョン。これにより、タイプミスに強く、あらゆる言語を「そのまま」処理できます<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-xue2022-byt5-11)</sup>。
- **Switch Transformer**: **Mixture-of-Experts（MoE）**アーキテクチャを導入したT5のスケーラブルなバージョン。これにより、妥当な計算コストを維持しながら、パラメータ数を数兆にまで増加させることが可能になりました<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-fedus2021-switch-12)</sup>。
- **FLAN-T5**: これは新しいアーキテクチャではなく、標準のT5に、指示（*instruction tuning*）として定式化された数百のタスクで追加のファインチューニングを施したものです。これにより、未知の新しいタスクに対する**ゼロショット**（例なし）での汎化能力が大幅に向上しました<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-chung2022-flan-13)</sup>。
- **UL2**: T5のアイデアを発展させたモデルで、**Mixture of Denoisers**という新しい事前学習目的を使用します。これは、汎用性を向上させるために様々なテキストマスキング手法を組み合わせたものです<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_note-tay2022-ul2-14)</sup>。

## 外部リンク

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">GitHub上のT5公式リポジトリ</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">T5研究に関するGoogle Researchのブログ記事</a>

## 参考文献

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## 脚注

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_%E2%80%94_T5#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
