T5 (Text-to-Text Transfer Transformer) (TH)
T5 (Text-to-Text Transfer Transformer) — คือกลุ่มโมเดลภาษาขนาดใหญ่ที่พัฒนาโดยนักวิจัยจาก Google AI และเปิดตัวในปี 2019[1] นวัตกรรมสำคัญของ T5 คือกรอบการทำงานแบบรวมศูนย์ «text-to-text» ซึ่งมองงานประมวลผลภาษาธรรมชาติ (NLP) ทุกประเภทว่าเป็นปัญหาของการแปลงลำดับข้อความหนึ่งไปเป็นอีกลำดับข้อความหนึ่ง แนวทางนี้ทำให้สามารถใช้โมเดลเดียว ฟังก์ชันการสูญเสียเดียว และขั้นตอนการเรียนรู้เดียวสำหรับงานที่หลากหลาย เช่น การแปลภาษา การสรุปความ การตอบคำถาม และการจำแนกประเภท[2]
โมเดลนี้อิงตามสถาปัตยกรรม transformer แบบ «encoder-decoder» มาตรฐาน ซึ่งแตกต่างจากโมเดลประเภท BERT (encoder เท่านั้น) และ GPT (decoder เท่านั้น) งานวิจัย T5 ถูกออกแบบมาเป็นการศึกษาเชิงประจักษ์ขนาดใหญ่เพื่อตรวจสอบและเปรียบเทียบวิธีการ transfer learning ต่างๆ ใน NLP อย่างเป็นระบบ มากกว่าจะเป็นการสร้างวิธีการใหม่โดยพื้นฐาน[1]
แนวคิด «Text-to-Text»
แนวคิดหลักของ T5 คือการกำหนดสูตรงานทุกประเภทในรูปแบบเดียวกัน โมเดลรับข้อความเป็น input และสร้างข้อความเป็น output เพื่อให้โมเดลสามารถแยกแยะงานที่ได้รับมอบหมายได้ จึงมีการเพิ่ม คำนำหน้าเป็นคำสั่ง (prefix) พิเศษที่เป็นข้อความลงในลำดับ input[2]
- การแปลภาษา: `translate English to German: That is good.` → `Das ist gut.`
- การจำแนกอารมณ์ความรู้สึก: `sst2 sentence: a very exciting film.` → `positive`
- การสรุปความ: `summarize: [ข้อความบทความยาว]` → `[บทสรุป]`
แนวทางนี้ช่วยลดความซับซ้อนของการนำโมเดลไปใช้งานได้อย่างมาก โดยขจัดความจำเป็นในการพัฒนา «หัว» เฉพาะงาน (task-specific heads) สำหรับแต่ละงาน ซึ่งเป็นลักษณะที่พบในสถาปัตยกรรมอย่าง BERT[3]
สถาปัตยกรรมและการปรับขนาด
สถาปัตยกรรม Encoder-Decoder
T5 ใช้สถาปัตยกรรม transformer มาตรฐานที่ประกอบด้วยสองส่วน[1]:
- Encoder: ประมวลผลลำดับ input ทั้งหมดพร้อมกัน สร้างการแสดงแทนแบบมีบริบทที่สมบูรณ์ เช่นเดียวกับ BERT encoder ของ T5 เป็นแบบ สองทิศทาง (bidirectional)
- Decoder: สร้างข้อความ output ทีละ token (แบบ autoregressive) โดยใช้การแสดงแทนที่ได้รับจาก encoder
โครงสร้างแบบผสมผสานนี้ทำให้ T5 สามารถแก้ปัญหาทั้งด้านการทำความเข้าใจภาษาและการสร้างข้อความได้อย่างมีประสิทธิภาพ[4]
การปรับปรุงที่สำคัญ
สถาปัตยกรรม T5 มีการเปลี่ยนแปลงหลายประการเมื่อเทียบกับโมเดล transformer ดั้งเดิม:
- Relative Positional Embeddings: แทนที่จะใช้ absolute sinusoidal embeddings T5 ใช้รูปแบบการเข้ารหัสตำแหน่งสัมพัทธ์ที่เรียบง่ายแต่มีประสิทธิภาพ โดยเพิ่ม bias แบบ scalar ที่เรียนรู้ได้ซึ่งขึ้นอยู่กับระยะห่างสัมพัทธ์ระหว่าง token เท่านั้นลงใน attention logits[1]
- Layer Norm ที่ปรับแต่งแล้ว: การ normalize ถูกย้ายออกไปนอก residual connection และกำจัด additive bias ออกเพื่อเพิ่มความเสถียรในการเรียนรู้
ขนาดของโมเดล
ในงานวิจัยต้นฉบับ โมเดลถูกนำเสนอในหลายการกำหนดค่าที่มีจำนวนพารามิเตอร์แตกต่างกัน ซึ่งช่วยให้ศึกษาผลกระทบของการปรับขนาดได้อย่างเป็นระบบ[5]:
- T5-Small: ประมาณ 60 ล้านพารามิเตอร์
- T5-Base: ประมาณ 220 ล้านพารามิเตอร์
- T5-Large: ประมาณ 770 ล้านพารามิเตอร์
- T5-3B: ประมาณ 3 พันล้านพารามิเตอร์
- T5-11B: ประมาณ 11 พันล้านพารามิเตอร์
การวิจัยแสดงให้เห็นว่าการเพิ่มขนาดโมเดลเป็นหนึ่งในวิธีที่เชื่อถือได้มากที่สุดในการพัฒนาประสิทธิภาพของโมเดล[1]
การเรียนรู้ล่วงหน้า: dataset C4 และงาน Span Corruption
งาน Span Corruption
สำหรับการเรียนรู้ล่วงหน้า T5 ได้เลือกงานลดสัญญาณรบกวน (denoising) โดยเฉพาะตัวแปรที่เรียกว่า การทำลายส่วน (span corruption)[6] วิธีการทำงานมีดังนี้:
- ปิดบัง token แบบสุ่ม 15% ในข้อความ input
- แตกต่างจากวิธี MLM ใน BERT ที่ปิดบัง token แต่ละตัว T5 จะปิดบังส่วนต่อเนื่องทั้งหมด (spans)
- แต่ละส่วนที่ถูกทำลายจะถูกแทนที่ด้วย token mask เฉพาะตัวเดียว (เช่น `<X>`, `<Y>`)
- โมเดลจะถูกฝึกให้สร้างลำดับของส่วนที่ถูกลบออกคั่นด้วย mask ที่สอดคล้องกันเป็น output
แนวทางนี้บังคับให้โมเดลทำนายลำดับข้อความทั้งหมด ซึ่งพิสูจน์แล้วว่าเป็นงานสำหรับการเรียนรู้ล่วงหน้าที่มีประสิทธิภาพมากกว่าการสร้างแบบจำลองภาษาแบบเรียบง่าย[1]
Dataset C4 (Colossal Clean Crawled Corpus)
เพื่อใช้ประโยชน์จากศักยภาพของ transfer learning นักวิจัยได้สร้างชุดข้อมูลข้อความขนาดใหญ่และมีคุณภาพที่ผ่านการทำความสะอาดอย่างดีชื่อว่า C4 ที่มีขนาดประมาณ 750 GB[2] ได้มาจากการทำความสะอาดและกรองคลังข้อมูลเว็บสาธารณะ Common Crawl ในระดับขนาดใหญ่[7] กระบวนการทำความสะอาดรวมถึงการลบข้อมูลซ้ำซ้อน ข้อความต้นแบบ ("Lorem ipsum") ประโยคที่ไม่สมบูรณ์ รวมถึงการกรองคำหยาบคาย[8]
การวิจารณ์ Dataset C4
แม้จะมีเป้าหมายในการสร้างคลังข้อมูล «สะอาด» แต่กระบวนการกรอง C4 ก็ถูกวิจารณ์ว่ามีความลำเอียงเชิงระบบ การวิจัยแสดงให้เห็นว่าตัวกรองคำหยาบคายลบข้อความที่เกี่ยวข้องกับชุมชน LGBTQ+ และข้อความในภาษาอังกฤษแบบแอฟริกัน-อเมริกัน (AAE) อย่างไม่สมส่วน[8] นอกจากนี้ยังพบเนื้อหาที่ดูหมิ่นและเนื้อหาที่ได้รับการคุ้มครองลิขสิทธิ์จำนวนมากใน dataset ปัญหาเหล่านี้แสดงให้เห็นถึงความซับซ้อนในการสร้างชุดข้อมูลที่ «มีคุณภาพ» อย่างเป็นกลาง และวิธีที่การตัดสินใจทางเทคนิคในการกรองอาจนำไปสู่ความลำเอียงทางสังคมที่ไม่ได้ตั้งใจ
ผลลัพธ์และประสิทธิภาพ
ในช่วงเวลาที่เผยแพร่ T5 สร้างสถิติประสิทธิภาพใหม่ (state-of-the-art) บน benchmark หลายรายการ รวมถึง GLUE, SuperGLUE, SQuAD และงานสรุปความ[2] โดยเฉพาะอย่างยิ่ง โมเดล T5-11B บรรลุผลลัพธ์บน SuperGLUE ใกล้เคียงกับระดับมนุษย์ แสดงให้เห็นความสามารถในการรับมือกับงานที่ต้องการการอนุมานเชิงตรรกะที่ซับซ้อน[9] ผลลัพธ์เหล่านี้ยืนยันสมมติฐานหลักของการวิจัย: การผสมผสานระหว่างกรอบการทำงานแบบรวมศูนย์ ขนาดที่ใหญ่ และชุดข้อมูลที่มีคุณภาพเป็นกลยุทธ์ที่ทรงพลังอย่างยิ่งในการบรรลุผลลัพธ์ระดับแนวหน้าใน NLP
วิวัฒนาการและตัวแปรของ T5
แนวทาง T5 เป็นพื้นฐานสำหรับโมเดลต่อๆ มาอีกมากมาย:
- mT5: T5 เวอร์ชันหลายภาษา ฝึกบนคลังข้อมูล mC4 ที่ครอบคลุม 101 ภาษา[10]
- ByT5: เวอร์ชันทดลองที่ละทิ้งการ tokenization โดยสิ้นเชิงและทำงานโดยตรงกับ raw bytes UTF-8 ซึ่งทำให้มีความทนทานต่อการพิมพ์ผิดและสามารถประมวลผลภาษาใดก็ได้ทันที[11]
- Switch Transformer: T5 เวอร์ชันที่ปรับขนาดได้ซึ่งนำสถาปัตยกรรม Mixture-of-Experts (MoE) มาใช้ ทำให้สามารถเพิ่มจำนวนพารามิเตอร์ได้ถึงหลักล้านล้านในขณะที่ยังคงต้นทุนการคำนวณที่สมเหตุสมผล[12]
- FLAN-T5: ไม่ใช่สถาปัตยกรรมใหม่ แต่เป็น T5 มาตรฐานที่ผ่านขั้นตอน fine-tuning เพิ่มเติมบนงานหลายร้อยงานที่กำหนดเป็นคำสั่ง (instruction tuning) ซึ่งช่วยเพิ่มความสามารถในการทำงานทั่วไปกับงานใหม่ที่ไม่เคยเห็นมาก่อนในโหมด zero-shot (โดยไม่มีตัวอย่าง)[13]
- UL2: โมเดลที่พัฒนาต่อจากแนวคิดของ T5 โดยใช้ objective การเรียนรู้ล่วงหน้าใหม่ที่เรียกว่า Mixture of Denoisers ซึ่งผสมผสานรูปแบบการ mask ข้อความที่แตกต่างกันเพื่อพัฒนาความสามารถในการทำงานทั่วไป[14]
ลิงก์
- ที่เก็บโค้ดอย่างเป็นทางการของ T5 บน GitHub
- บทความในบล็อก Google Research เกี่ยวกับการวิจัย T5
เอกสารอ้างอิง
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
- Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
- Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
- Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
- Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
- Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
- Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
- ↑ 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
- ↑ «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
- ↑ «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
- ↑ «T5». Hugging Face Transformers Documentation. [5]
- ↑ «T5 (language model)». In Wikipedia. [6]
- ↑ «C4 Dataset». Papers With Code. [7]
- ↑ 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
- ↑ «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
- ↑ Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
- ↑ Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
- ↑ Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
- ↑ Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]