---
title: "T5 (Text-to-Text Transfer Transformer) (VI)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(VI)"
language: "vi"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Vietnamese"
revision_id: 7830
wiki_created_at: 2026-09-07T01:07:38Z
wiki_modified_at: 2026-09-07T01:07:38Z
downloaded_at: 2026-09-07T23:21:02Z
---

# T5 (Text-to-Text Transfer Transformer) (VI)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — là một họ các mô hình ngôn ngữ lớn được các nhà nghiên cứu của Google AI phát triển và giới thiệu vào năm 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>. Đổi mới cốt lõi của T5 là framework thống nhất **«text-to-text»**, xem xét mọi bài toán xử lý ngôn ngữ tự nhiên (NLP) như một vấn đề chuyển đổi chuỗi văn bản này thành chuỗi văn bản khác. Điều này cho phép sử dụng một mô hình duy nhất, một hàm mất mát và một quy trình huấn luyện duy nhất cho một loạt các bài toán đa dạng như dịch thuật, tóm tắt, trả lời câu hỏi và phân loại<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-google-blog-t5-2)</sup>.

Mô hình dựa trên kiến trúc transformer chuẩn «encoder-decoder», điều này phân biệt nó với các mô hình kiểu BERT (chỉ encoder) và GPT (chỉ decoder). Công trình về T5 được hình thành như một nghiên cứu thực nghiệm quy mô lớn nhằm nghiên cứu và so sánh có hệ thống các phương pháp transfer learning khác nhau trong NLP, chứ không phải nhằm tạo ra một phương pháp hoàn toàn mới<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>.

## Paradigma «Text-to-Text» - Mô hình «Văn bản sang Văn bản»

Ý tưởng trung tâm của T5 là tất cả các bài toán đều được định dạng theo một khuôn mẫu thống nhất. Mô hình nhận văn bản đầu vào và tạo ra văn bản đầu ra. Để mô hình có thể phân biệt các nhiệm vụ được giao, một **tiền tố lệnh** dạng văn bản đặc biệt được thêm vào chuỗi đầu vào<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-google-blog-t5-2)</sup>.

- **Dịch thuật**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Phân tích cảm xúc**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Tóm tắt**: \`summarize: \[văn bản bài viết dài\]\` → \`\[tóm tắt ngắn gọn\]\`

Cách tiếp cận này đơn giản hóa triệt để quá trình áp dụng mô hình, loại bỏ sự cần thiết phải phát triển các «đầu ra đặc thù» (*task-specific heads*) riêng cho từng bài toán cụ thể, vốn là đặc trưng của các kiến trúc như BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-dhiwise-t5-3)</sup>.

## Kiến trúc và Quy mô

### Kiến trúc Encoder-Decoder

T5 sử dụng kiến trúc transformer chuẩn gồm hai phần<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>:

- **Encoder**: Xử lý toàn bộ chuỗi đầu vào đồng thời, tạo ra một biểu diễn ngữ cảnh phong phú. Giống như trong BERT, encoder của T5 là **hai chiều**.
- **Decoder**: Tạo ra văn bản đầu ra từng token một (theo kiểu tự hồi quy), sử dụng biểu diễn nhận được từ encoder.

Cấu trúc lai này cho phép T5 giải quyết hiệu quả cả các bài toán hiểu ngôn ngữ lẫn các bài toán sinh văn bản<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-gfg-t5-4)</sup>.

### Các Cải tiến Chính

Kiến trúc T5 bao gồm một số thay đổi so với mô hình transformer gốc:

- **Relative positional embedding**: Thay vì các embedding vị trí tuyệt đối kiểu sinusoidal, T5 sử dụng một dạng mã hóa vị trí tương đối được đơn giản hóa nhưng hiệu quả, trong đó một độ lệch vô hướng (scalar bias) có thể học được, chỉ phụ thuộc vào khoảng cách tương đối giữa các token, được cộng vào các logit attention<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>.
- **Layer Norm được sửa đổi**: Chuẩn hóa được đặt ra ngoài kết nối dư (*residual connection*), và độ lệch cộng (bias) bị loại bỏ để tăng độ ổn định trong quá trình huấn luyện.

### Các Kích thước Mô hình

Trong công trình gốc, mô hình được trình bày ở nhiều cấu hình khác nhau, phân biệt theo số lượng tham số, cho phép nghiên cứu có hệ thống về ảnh hưởng của quy mô<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 triệu tham số
- **T5-Base**: ~220 triệu tham số
- **T5-Large**: ~770 triệu tham số
- **T5-3B**: ~3 tỷ tham số
- **T5-11B**: ~11 tỷ tham số

Nghiên cứu cho thấy việc tăng quy mô mô hình là một trong những cách đáng tin cậy nhất để nâng cao hiệu suất của nó<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>.

## Tiền huấn luyện: Dataset C4 và Bài toán Span Corruption

### Bài toán Span Corruption

Để tiền huấn luyện T5, bài toán khử nhiễu (*denoising*) đã được chọn, cụ thể là biến thể đặc thù của nó mang tên **làm hỏng đoạn văn (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-t5-wikipedia-6)</sup>. Phương pháp hoạt động như sau:

1.  Ngẫu nhiên che 15% token trong văn bản đầu vào.
2.  Khác với phương pháp MLM trong BERT, nơi các token riêng lẻ bị che, T5 che toàn bộ các đoạn liên tục (*spans*).
3.  Mỗi đoạn bị làm hỏng được thay thế bằng một token mặt nạ duy nhất (ví dụ: \`\<X\>\`, \`\<Y\>\`).
4.  Mô hình được huấn luyện để tạo ra ở đầu ra một chuỗi gồm các đoạn đã bị xóa, được phân tách bởi các mặt nạ tương ứng.

Cách tiếp cận này buộc mô hình phải dự đoán toàn bộ chuỗi văn bản, điều này được chứng minh là bài toán tiền huấn luyện hiệu quả hơn so với mô hình ngôn ngữ đơn giản<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

Để hiện thực hóa tiềm năng của transfer learning, các nhà nghiên cứu đã tạo ra một tập dữ liệu văn bản khổng lồ và được làm sạch chất lượng cao là **C4**, với dung lượng khoảng 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-google-blog-t5-2)</sup>. Nó được tạo ra thông qua quá trình làm sạch và lọc quy mô lớn từ kho ngữ liệu web công cộng **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-c4-dataset-pwc-7)</sup>. Quá trình làm sạch bao gồm loại bỏ các bản sao, văn bản mẫu ("Lorem ipsum"), các câu không hoàn chỉnh, cũng như lọc từ ngữ thô tục<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-dodge2021-doc-c4-8)</sup>.

### Chỉ trích về Dataset C4

Mặc dù có mục tiêu được tuyên bố là tạo ra một kho ngữ liệu «sạch», quá trình lọc C4 đã bị chỉ trích vì những thiên lệch có hệ thống. Các nghiên cứu cho thấy bộ lọc từ ngữ thô tục đã loại bỏ không tương xứng các văn bản liên quan đến cộng đồng LGBTQ+, cũng như các văn bản bằng tiếng Anh của người Mỹ gốc Phi (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-dodge2021-doc-c4-8)</sup>. Ngoài ra, trong dataset đã phát hiện ra một lượng đáng kể nội dung xúc phạm và có bản quyền. Những vấn đề này minh họa sự phức tạp của việc tạo ra các tập dữ liệu «chất lượng» một cách khách quan và cách các quyết định kỹ thuật về lọc có thể dẫn đến các thiên lệch xã hội không mong muốn.

## Kết quả và Hiệu suất

Tại thời điểm công bố, T5 đã thiết lập các kỷ lục hiệu suất mới (*state-of-the-art*) trên nhiều benchmark, bao gồm **GLUE**, **SuperGLUE**, **SQuAD** và các bài toán tóm tắt<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-google-blog-t5-2)</sup>. Đặc biệt, mô hình **T5-11B** đạt được kết quả trên **SuperGLUE** gần với mức độ của con người, chứng minh khả năng xử lý các bài toán đòi hỏi suy luận logic phức tạp<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-reddit-superglue-t5-9)</sup>. Những kết quả này đã xác nhận giả thuyết trung tâm của nghiên cứu: sự kết hợp của framework thống nhất, quy mô lớn và tập dữ liệu chất lượng cao là một chiến lược vô cùng mạnh mẽ để đạt được các kết quả tiên tiến trong NLP.

## Sự Tiến hóa và Các Biến thể của T5

Cách tiếp cận T5 đã là nền tảng cho nhiều mô hình tiếp theo:

- **mT5**: Phiên bản đa ngôn ngữ của T5, được huấn luyện trên kho ngữ liệu **mC4**, bao gồm **101 ngôn ngữ**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Phiên bản thử nghiệm hoàn toàn từ bỏ việc tokenization và làm việc trực tiếp với **các byte UTF-8 thô**. Điều này làm cho nó có khả năng chống lỗi chính tả và cho phép xử lý bất kỳ ngôn ngữ nào «ngay lập tức»<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Phiên bản có khả năng mở rộng của T5, giới thiệu kiến trúc **Mixture-of-Experts (MoE)**, cho phép tăng số lượng tham số lên hàng nghìn tỷ trong khi vẫn duy trì chi phí tính toán hợp lý<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Đây không phải là một kiến trúc mới, mà là T5 tiêu chuẩn đã trải qua giai đoạn fine-tuning bổ sung trên hàng trăm bài toán được định dạng dưới dạng các lệnh (*instruction tuning*). Điều này cải thiện đáng kể khả năng tổng quát hóa sang các bài toán mới, chưa từng gặp ở chế độ **zero-shot** (không có ví dụ)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Mô hình phát triển các ý tưởng của T5, sử dụng một mục tiêu tiền huấn luyện mới có tên **Mixture of Denoisers**, kết hợp các sơ đồ che văn bản khác nhau để cải thiện tính đa năng<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_note-tay2022-ul2-14)</sup>.

## Liên kết

- Kho lưu trữ chính thức T5 trên GitHub
- Bài đăng trên blog Google Research về nghiên cứu T5

## Tài liệu tham khảo

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Ghi chú

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(VI)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
