---
title: "T5 (Text-to-Text Transfer Transformer) (TH)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(TH)"
language: "th"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 7826
wiki_created_at: 2026-09-07T01:07:34Z
wiki_modified_at: 2026-09-07T01:07:34Z
downloaded_at: 2026-09-07T23:21:00Z
---

# T5 (Text-to-Text Transfer Transformer) (TH)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — คือกลุ่มโมเดลภาษาขนาดใหญ่ที่พัฒนาโดยนักวิจัยจาก Google AI และเปิดตัวในปี 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup> นวัตกรรมสำคัญของ T5 คือกรอบการทำงานแบบรวมศูนย์ **«text-to-text»** ซึ่งมองงานประมวลผลภาษาธรรมชาติ (NLP) ทุกประเภทว่าเป็นปัญหาของการแปลงลำดับข้อความหนึ่งไปเป็นอีกลำดับข้อความหนึ่ง แนวทางนี้ทำให้สามารถใช้โมเดลเดียว ฟังก์ชันการสูญเสียเดียว และขั้นตอนการเรียนรู้เดียวสำหรับงานที่หลากหลาย เช่น การแปลภาษา การสรุปความ การตอบคำถาม และการจำแนกประเภท<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-google-blog-t5-2)</sup>

โมเดลนี้อิงตามสถาปัตยกรรม transformer แบบ «encoder-decoder» มาตรฐาน ซึ่งแตกต่างจากโมเดลประเภท BERT (encoder เท่านั้น) และ GPT (decoder เท่านั้น) งานวิจัย T5 ถูกออกแบบมาเป็นการศึกษาเชิงประจักษ์ขนาดใหญ่เพื่อตรวจสอบและเปรียบเทียบวิธีการ transfer learning ต่างๆ ใน NLP อย่างเป็นระบบ มากกว่าจะเป็นการสร้างวิธีการใหม่โดยพื้นฐาน<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup>

## แนวคิด «Text-to-Text»

แนวคิดหลักของ T5 คือการกำหนดสูตรงานทุกประเภทในรูปแบบเดียวกัน โมเดลรับข้อความเป็น input และสร้างข้อความเป็น output เพื่อให้โมเดลสามารถแยกแยะงานที่ได้รับมอบหมายได้ จึงมีการเพิ่ม **คำนำหน้าเป็นคำสั่ง (prefix)** พิเศษที่เป็นข้อความลงในลำดับ input<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-google-blog-t5-2)</sup>

- **การแปลภาษา**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **การจำแนกอารมณ์ความรู้สึก**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **การสรุปความ**: \`summarize: \[ข้อความบทความยาว\]\` → \`\[บทสรุป\]\`

แนวทางนี้ช่วยลดความซับซ้อนของการนำโมเดลไปใช้งานได้อย่างมาก โดยขจัดความจำเป็นในการพัฒนา «หัว» เฉพาะงาน (*task-specific heads*) สำหรับแต่ละงาน ซึ่งเป็นลักษณะที่พบในสถาปัตยกรรมอย่าง BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-dhiwise-t5-3)</sup>

## สถาปัตยกรรมและการปรับขนาด

### สถาปัตยกรรม Encoder-Decoder

T5 ใช้สถาปัตยกรรม transformer มาตรฐานที่ประกอบด้วยสองส่วน<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup>:

- **Encoder**: ประมวลผลลำดับ input ทั้งหมดพร้อมกัน สร้างการแสดงแทนแบบมีบริบทที่สมบูรณ์ เช่นเดียวกับ BERT encoder ของ T5 เป็นแบบ **สองทิศทาง (bidirectional)**
- **Decoder**: สร้างข้อความ output ทีละ token (แบบ autoregressive) โดยใช้การแสดงแทนที่ได้รับจาก encoder

โครงสร้างแบบผสมผสานนี้ทำให้ T5 สามารถแก้ปัญหาทั้งด้านการทำความเข้าใจภาษาและการสร้างข้อความได้อย่างมีประสิทธิภาพ<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-gfg-t5-4)</sup>

### การปรับปรุงที่สำคัญ

สถาปัตยกรรม T5 มีการเปลี่ยนแปลงหลายประการเมื่อเทียบกับโมเดล transformer ดั้งเดิม:

- **Relative Positional Embeddings**: แทนที่จะใช้ absolute sinusoidal embeddings T5 ใช้รูปแบบการเข้ารหัสตำแหน่งสัมพัทธ์ที่เรียบง่ายแต่มีประสิทธิภาพ โดยเพิ่ม bias แบบ scalar ที่เรียนรู้ได้ซึ่งขึ้นอยู่กับระยะห่างสัมพัทธ์ระหว่าง token เท่านั้นลงใน attention logits<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup>
- **Layer Norm ที่ปรับแต่งแล้ว**: การ normalize ถูกย้ายออกไปนอก residual connection และกำจัด additive bias ออกเพื่อเพิ่มความเสถียรในการเรียนรู้

### ขนาดของโมเดล

ในงานวิจัยต้นฉบับ โมเดลถูกนำเสนอในหลายการกำหนดค่าที่มีจำนวนพารามิเตอร์แตกต่างกัน ซึ่งช่วยให้ศึกษาผลกระทบของการปรับขนาดได้อย่างเป็นระบบ<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ประมาณ 60 ล้านพารามิเตอร์
- **T5-Base**: ประมาณ 220 ล้านพารามิเตอร์
- **T5-Large**: ประมาณ 770 ล้านพารามิเตอร์
- **T5-3B**: ประมาณ 3 พันล้านพารามิเตอร์
- **T5-11B**: ประมาณ 11 พันล้านพารามิเตอร์

การวิจัยแสดงให้เห็นว่าการเพิ่มขนาดโมเดลเป็นหนึ่งในวิธีที่เชื่อถือได้มากที่สุดในการพัฒนาประสิทธิภาพของโมเดล<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup>

## การเรียนรู้ล่วงหน้า: dataset C4 และงาน Span Corruption

### งาน Span Corruption

สำหรับการเรียนรู้ล่วงหน้า T5 ได้เลือกงานลดสัญญาณรบกวน (*denoising*) โดยเฉพาะตัวแปรที่เรียกว่า **การทำลายส่วน (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-t5-wikipedia-6)</sup> วิธีการทำงานมีดังนี้:

1.  ปิดบัง token แบบสุ่ม 15% ในข้อความ input
2.  แตกต่างจากวิธี MLM ใน BERT ที่ปิดบัง token แต่ละตัว T5 จะปิดบังส่วนต่อเนื่องทั้งหมด (*spans*)
3.  แต่ละส่วนที่ถูกทำลายจะถูกแทนที่ด้วย token mask เฉพาะตัวเดียว (เช่น \`\<X\>\`, \`\<Y\>\`)
4.  โมเดลจะถูกฝึกให้สร้างลำดับของส่วนที่ถูกลบออกคั่นด้วย mask ที่สอดคล้องกันเป็น output

แนวทางนี้บังคับให้โมเดลทำนายลำดับข้อความทั้งหมด ซึ่งพิสูจน์แล้วว่าเป็นงานสำหรับการเรียนรู้ล่วงหน้าที่มีประสิทธิภาพมากกว่าการสร้างแบบจำลองภาษาแบบเรียบง่าย<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-raffel2020-1)</sup>

### Dataset C4 (Colossal Clean Crawled Corpus)

เพื่อใช้ประโยชน์จากศักยภาพของ transfer learning นักวิจัยได้สร้างชุดข้อมูลข้อความขนาดใหญ่และมีคุณภาพที่ผ่านการทำความสะอาดอย่างดีชื่อว่า **C4** ที่มีขนาดประมาณ 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-google-blog-t5-2)</sup> ได้มาจากการทำความสะอาดและกรองคลังข้อมูลเว็บสาธารณะ **Common Crawl** ในระดับขนาดใหญ่<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-c4-dataset-pwc-7)</sup> กระบวนการทำความสะอาดรวมถึงการลบข้อมูลซ้ำซ้อน ข้อความต้นแบบ ("Lorem ipsum") ประโยคที่ไม่สมบูรณ์ รวมถึงการกรองคำหยาบคาย<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-dodge2021-doc-c4-8)</sup>

### การวิจารณ์ Dataset C4

แม้จะมีเป้าหมายในการสร้างคลังข้อมูล «สะอาด» แต่กระบวนการกรอง C4 ก็ถูกวิจารณ์ว่ามีความลำเอียงเชิงระบบ การวิจัยแสดงให้เห็นว่าตัวกรองคำหยาบคายลบข้อความที่เกี่ยวข้องกับชุมชน LGBTQ+ และข้อความในภาษาอังกฤษแบบแอฟริกัน-อเมริกัน (AAE) อย่างไม่สมส่วน<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-dodge2021-doc-c4-8)</sup> นอกจากนี้ยังพบเนื้อหาที่ดูหมิ่นและเนื้อหาที่ได้รับการคุ้มครองลิขสิทธิ์จำนวนมากใน dataset ปัญหาเหล่านี้แสดงให้เห็นถึงความซับซ้อนในการสร้างชุดข้อมูลที่ «มีคุณภาพ» อย่างเป็นกลาง และวิธีที่การตัดสินใจทางเทคนิคในการกรองอาจนำไปสู่ความลำเอียงทางสังคมที่ไม่ได้ตั้งใจ

## ผลลัพธ์และประสิทธิภาพ

ในช่วงเวลาที่เผยแพร่ T5 สร้างสถิติประสิทธิภาพใหม่ (*state-of-the-art*) บน benchmark หลายรายการ รวมถึง **GLUE**, **SuperGLUE**, **SQuAD** และงานสรุปความ<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-google-blog-t5-2)</sup> โดยเฉพาะอย่างยิ่ง โมเดล **T5-11B** บรรลุผลลัพธ์บน **SuperGLUE** ใกล้เคียงกับระดับมนุษย์ แสดงให้เห็นความสามารถในการรับมือกับงานที่ต้องการการอนุมานเชิงตรรกะที่ซับซ้อน<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-reddit-superglue-t5-9)</sup> ผลลัพธ์เหล่านี้ยืนยันสมมติฐานหลักของการวิจัย: การผสมผสานระหว่างกรอบการทำงานแบบรวมศูนย์ ขนาดที่ใหญ่ และชุดข้อมูลที่มีคุณภาพเป็นกลยุทธ์ที่ทรงพลังอย่างยิ่งในการบรรลุผลลัพธ์ระดับแนวหน้าใน NLP

## วิวัฒนาการและตัวแปรของ T5

แนวทาง T5 เป็นพื้นฐานสำหรับโมเดลต่อๆ มาอีกมากมาย:

- **mT5**: T5 เวอร์ชันหลายภาษา ฝึกบนคลังข้อมูล **mC4** ที่ครอบคลุม **101 ภาษา**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-xue2020-mt5-10)</sup>
- **ByT5**: เวอร์ชันทดลองที่ละทิ้งการ tokenization โดยสิ้นเชิงและทำงานโดยตรงกับ **raw bytes UTF-8** ซึ่งทำให้มีความทนทานต่อการพิมพ์ผิดและสามารถประมวลผลภาษาใดก็ได้ทันที<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-xue2022-byt5-11)</sup>
- **Switch Transformer**: T5 เวอร์ชันที่ปรับขนาดได้ซึ่งนำสถาปัตยกรรม **Mixture-of-Experts (MoE)** มาใช้ ทำให้สามารถเพิ่มจำนวนพารามิเตอร์ได้ถึงหลักล้านล้านในขณะที่ยังคงต้นทุนการคำนวณที่สมเหตุสมผล<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-fedus2021-switch-12)</sup>
- **FLAN-T5**: ไม่ใช่สถาปัตยกรรมใหม่ แต่เป็น T5 มาตรฐานที่ผ่านขั้นตอน fine-tuning เพิ่มเติมบนงานหลายร้อยงานที่กำหนดเป็นคำสั่ง (*instruction tuning*) ซึ่งช่วยเพิ่มความสามารถในการทำงานทั่วไปกับงานใหม่ที่ไม่เคยเห็นมาก่อนในโหมด **zero-shot** (โดยไม่มีตัวอย่าง)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-chung2022-flan-13)</sup>
- **UL2**: โมเดลที่พัฒนาต่อจากแนวคิดของ T5 โดยใช้ objective การเรียนรู้ล่วงหน้าใหม่ที่เรียกว่า **Mixture of Denoisers** ซึ่งผสมผสานรูปแบบการ mask ข้อความที่แตกต่างกันเพื่อพัฒนาความสามารถในการทำงานทั่วไป<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_note-tay2022-ul2-14)</sup>

## ลิงก์

- ที่เก็บโค้ดอย่างเป็นทางการของ T5 บน GitHub
- บทความในบล็อก Google Research เกี่ยวกับการวิจัย T5

## เอกสารอ้างอิง

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## หมายเหตุ

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(TH)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
